Model: fpadovani/rus-cyrl-10mb-after-ppt-Dp-10mb-ckpt500_seed10 Source: Original Platform
22797 lines
624 KiB
JSON
22797 lines
624 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 9.99156679982246,
|
|
"eval_steps": 500,
|
|
"global_step": 11260,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 7.78931941986084,
|
|
"epoch": 0.004438526409232135,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 2e-06,
|
|
"loss": 7.4769,
|
|
"mean_token_accuracy": 0.08522442281246186,
|
|
"num_tokens": 10699.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 7.787262725830078,
|
|
"epoch": 0.00887705281846427,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 7.4824,
|
|
"mean_token_accuracy": 0.08313449285924435,
|
|
"num_tokens": 20868.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 7.764151668548584,
|
|
"epoch": 0.013315579227696404,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 7e-06,
|
|
"loss": 7.4352,
|
|
"mean_token_accuracy": 0.08592776954174042,
|
|
"num_tokens": 31565.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 7.8020752429962155,
|
|
"epoch": 0.01775410563692854,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 7.5052,
|
|
"mean_token_accuracy": 0.08421143889427185,
|
|
"num_tokens": 42396.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 7.809156513214111,
|
|
"epoch": 0.022192632046160676,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 7.5029,
|
|
"mean_token_accuracy": 0.08358340412378311,
|
|
"num_tokens": 52422.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 7.804666757583618,
|
|
"epoch": 0.02663115845539281,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 7.4415,
|
|
"mean_token_accuracy": 0.0846289798617363,
|
|
"num_tokens": 63167.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 7.820871639251709,
|
|
"epoch": 0.031069684864624945,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 7.4654,
|
|
"mean_token_accuracy": 0.08765448182821274,
|
|
"num_tokens": 73620.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 7.827526521682739,
|
|
"epoch": 0.03550821127385708,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 7.3795,
|
|
"mean_token_accuracy": 0.08707336336374283,
|
|
"num_tokens": 83176.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 7.789561748504639,
|
|
"epoch": 0.03994673768308921,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 7.435,
|
|
"mean_token_accuracy": 0.0886497862637043,
|
|
"num_tokens": 94238.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 7.7829310417175295,
|
|
"epoch": 0.04438526409232135,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 7.4332,
|
|
"mean_token_accuracy": 0.08750618845224381,
|
|
"num_tokens": 104855.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 7.799046611785888,
|
|
"epoch": 0.048823790501553485,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 7.4366,
|
|
"mean_token_accuracy": 0.09203671216964722,
|
|
"num_tokens": 113812.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 7.795975160598755,
|
|
"epoch": 0.05326231691078562,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 7.4903,
|
|
"mean_token_accuracy": 0.08637641668319702,
|
|
"num_tokens": 123392.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 7.796218681335449,
|
|
"epoch": 0.05770084332001776,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 7.4831,
|
|
"mean_token_accuracy": 0.08530961498618125,
|
|
"num_tokens": 132764.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 7.810373401641845,
|
|
"epoch": 0.06213936972924989,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 7.434,
|
|
"mean_token_accuracy": 0.08844730108976365,
|
|
"num_tokens": 142965.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 7.803947973251343,
|
|
"epoch": 0.06657789613848203,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 7.4512,
|
|
"mean_token_accuracy": 0.08455823883414268,
|
|
"num_tokens": 152939.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 7.8467789649963375,
|
|
"epoch": 0.07101642254771416,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 7.5052,
|
|
"mean_token_accuracy": 0.08405138589441777,
|
|
"num_tokens": 164455.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 7.778741502761841,
|
|
"epoch": 0.0754549489569463,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 7.4599,
|
|
"mean_token_accuracy": 0.08571180626749993,
|
|
"num_tokens": 174110.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 7.789217472076416,
|
|
"epoch": 0.07989347536617843,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 7.4293,
|
|
"mean_token_accuracy": 0.0909264013171196,
|
|
"num_tokens": 184160.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 7.8063740730285645,
|
|
"epoch": 0.08433200177541056,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 7.4067,
|
|
"mean_token_accuracy": 0.08633613213896751,
|
|
"num_tokens": 194797.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 7.8098077297210695,
|
|
"epoch": 0.0887705281846427,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 7.4494,
|
|
"mean_token_accuracy": 0.08306959643959999,
|
|
"num_tokens": 204108.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 7.793222093582154,
|
|
"epoch": 0.09320905459387484,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 7.4157,
|
|
"mean_token_accuracy": 0.08446534052491188,
|
|
"num_tokens": 214945.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 7.810083961486816,
|
|
"epoch": 0.09764758100310697,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 7.5058,
|
|
"mean_token_accuracy": 0.08473781980574131,
|
|
"num_tokens": 226787.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 7.764282941818237,
|
|
"epoch": 0.1020861074123391,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 7.3897,
|
|
"mean_token_accuracy": 0.08418168947100639,
|
|
"num_tokens": 237273.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 7.864174175262451,
|
|
"epoch": 0.10652463382157124,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 7.4156,
|
|
"mean_token_accuracy": 0.09291890189051628,
|
|
"num_tokens": 246793.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 7.779165315628052,
|
|
"epoch": 0.11096316023080337,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.4275,
|
|
"mean_token_accuracy": 0.0859360195696354,
|
|
"num_tokens": 258022.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 7.7436638355255125,
|
|
"epoch": 0.11540168664003551,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.4169,
|
|
"mean_token_accuracy": 0.08928811252117157,
|
|
"num_tokens": 267670.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 7.7615663528442385,
|
|
"epoch": 0.11984021304926765,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.4734,
|
|
"mean_token_accuracy": 0.08662445694208146,
|
|
"num_tokens": 278441.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 7.868949317932129,
|
|
"epoch": 0.12427873945849978,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.44,
|
|
"mean_token_accuracy": 0.0834168739616871,
|
|
"num_tokens": 288501.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 7.918918085098267,
|
|
"epoch": 0.1287172658677319,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.5111,
|
|
"mean_token_accuracy": 0.08065465465188026,
|
|
"num_tokens": 299557.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 7.7995758056640625,
|
|
"epoch": 0.13315579227696406,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.4013,
|
|
"mean_token_accuracy": 0.09215340986847878,
|
|
"num_tokens": 309221.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 7.789921569824219,
|
|
"epoch": 0.13759431868619618,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.3926,
|
|
"mean_token_accuracy": 0.0882001981139183,
|
|
"num_tokens": 318890.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 7.7831714153289795,
|
|
"epoch": 0.14203284509542832,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.3731,
|
|
"mean_token_accuracy": 0.08587820529937744,
|
|
"num_tokens": 329547.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 7.732769966125488,
|
|
"epoch": 0.14647137150466044,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.4036,
|
|
"mean_token_accuracy": 0.09170155450701714,
|
|
"num_tokens": 339819.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 7.838970375061035,
|
|
"epoch": 0.1509098979138926,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.4284,
|
|
"mean_token_accuracy": 0.09364147260785102,
|
|
"num_tokens": 349132.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 7.720353078842163,
|
|
"epoch": 0.15534842432312473,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.4269,
|
|
"mean_token_accuracy": 0.08701886683702469,
|
|
"num_tokens": 358950.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.802455282211303,
|
|
"epoch": 0.15978695073235685,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.3911,
|
|
"mean_token_accuracy": 0.08798973783850669,
|
|
"num_tokens": 368710.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.7396303653717045,
|
|
"epoch": 0.164225477141589,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.4086,
|
|
"mean_token_accuracy": 0.09115821123123169,
|
|
"num_tokens": 377388.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.784192132949829,
|
|
"epoch": 0.16866400355082112,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.368,
|
|
"mean_token_accuracy": 0.08906726986169815,
|
|
"num_tokens": 387860.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.78899359703064,
|
|
"epoch": 0.17310252996005326,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.3988,
|
|
"mean_token_accuracy": 0.09347473680973054,
|
|
"num_tokens": 397737.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.7772763729095455,
|
|
"epoch": 0.1775410563692854,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.4405,
|
|
"mean_token_accuracy": 0.08559705466032028,
|
|
"num_tokens": 408016.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.831363105773926,
|
|
"epoch": 0.18197958277851753,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.4124,
|
|
"mean_token_accuracy": 0.08368377536535263,
|
|
"num_tokens": 417578.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.737787818908691,
|
|
"epoch": 0.18641810918774968,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.3308,
|
|
"mean_token_accuracy": 0.08822357207536698,
|
|
"num_tokens": 428746.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.837935161590576,
|
|
"epoch": 0.1908566355969818,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.39,
|
|
"mean_token_accuracy": 0.08428716734051704,
|
|
"num_tokens": 439500.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.771363592147827,
|
|
"epoch": 0.19529516200621394,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.4119,
|
|
"mean_token_accuracy": 0.08383373767137528,
|
|
"num_tokens": 450105.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.8077551364898685,
|
|
"epoch": 0.19973368841544606,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.3646,
|
|
"mean_token_accuracy": 0.09255110621452331,
|
|
"num_tokens": 459800.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.745184326171875,
|
|
"epoch": 0.2041722148246782,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.2759,
|
|
"mean_token_accuracy": 0.09842955991625786,
|
|
"num_tokens": 470371.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.753671360015869,
|
|
"epoch": 0.20861074123391035,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.3007,
|
|
"mean_token_accuracy": 0.09646429568529129,
|
|
"num_tokens": 480347.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.81769061088562,
|
|
"epoch": 0.21304926764314247,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.3843,
|
|
"mean_token_accuracy": 0.08836668208241463,
|
|
"num_tokens": 491058.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.67605414390564,
|
|
"epoch": 0.21748779405237462,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.3048,
|
|
"mean_token_accuracy": 0.08849572688341141,
|
|
"num_tokens": 500826.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.790542507171631,
|
|
"epoch": 0.22192632046160674,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.284,
|
|
"mean_token_accuracy": 0.08906695693731308,
|
|
"num_tokens": 510952.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.7136742115020756,
|
|
"epoch": 0.22636484687083888,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.2967,
|
|
"mean_token_accuracy": 0.09439613595604897,
|
|
"num_tokens": 520680.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.686872863769532,
|
|
"epoch": 0.23080337328007103,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.378,
|
|
"mean_token_accuracy": 0.0834910437464714,
|
|
"num_tokens": 531400.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.752029180526733,
|
|
"epoch": 0.23524189968930315,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.4008,
|
|
"mean_token_accuracy": 0.08466090187430382,
|
|
"num_tokens": 541657.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.805071783065796,
|
|
"epoch": 0.2396804260985353,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.3264,
|
|
"mean_token_accuracy": 0.09501602202653885,
|
|
"num_tokens": 550609.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.560798215866089,
|
|
"epoch": 0.2441189525077674,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.292,
|
|
"mean_token_accuracy": 0.09585189595818519,
|
|
"num_tokens": 561482.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.8325278759002686,
|
|
"epoch": 0.24855747891699956,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.2829,
|
|
"mean_token_accuracy": 0.09389769136905671,
|
|
"num_tokens": 570582.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.7413294315338135,
|
|
"epoch": 0.2529960053262317,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.392,
|
|
"mean_token_accuracy": 0.0857204593718052,
|
|
"num_tokens": 581206.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.825753402709961,
|
|
"epoch": 0.2574345317354638,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.193,
|
|
"mean_token_accuracy": 0.09314141124486923,
|
|
"num_tokens": 592122.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.66306438446045,
|
|
"epoch": 0.26187305814469597,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.3151,
|
|
"mean_token_accuracy": 0.08986739963293075,
|
|
"num_tokens": 602919.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.771809720993042,
|
|
"epoch": 0.2663115845539281,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 7.2954,
|
|
"mean_token_accuracy": 0.09381957724690437,
|
|
"num_tokens": 612864.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.627486038208008,
|
|
"epoch": 0.2707501109631602,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000152,
|
|
"loss": 7.2278,
|
|
"mean_token_accuracy": 0.09549270346760749,
|
|
"num_tokens": 622682.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.6965526103973385,
|
|
"epoch": 0.27518863737239235,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.3782,
|
|
"mean_token_accuracy": 0.09121644049882889,
|
|
"num_tokens": 634017.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.837769556045532,
|
|
"epoch": 0.2796271637816245,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 7.4513,
|
|
"mean_token_accuracy": 0.08749650418758392,
|
|
"num_tokens": 644132.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.789153337478638,
|
|
"epoch": 0.28406569019085665,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.3349,
|
|
"mean_token_accuracy": 0.09567861631512642,
|
|
"num_tokens": 655246.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.75645751953125,
|
|
"epoch": 0.2885042166000888,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000162,
|
|
"loss": 7.3554,
|
|
"mean_token_accuracy": 0.08929399326443672,
|
|
"num_tokens": 664899.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.748797941207886,
|
|
"epoch": 0.2929427430093209,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 7.375,
|
|
"mean_token_accuracy": 0.09080832377076149,
|
|
"num_tokens": 675989.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.664048528671264,
|
|
"epoch": 0.29738126941855303,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 7.3221,
|
|
"mean_token_accuracy": 0.09584744423627853,
|
|
"num_tokens": 687759.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.7706445217132565,
|
|
"epoch": 0.3018197958277852,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 7.2649,
|
|
"mean_token_accuracy": 0.09178439974784851,
|
|
"num_tokens": 696943.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.699291706085205,
|
|
"epoch": 0.3062583222370173,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 7.2908,
|
|
"mean_token_accuracy": 0.0902982622385025,
|
|
"num_tokens": 708139.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.69988489151001,
|
|
"epoch": 0.31069684864624947,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 7.2561,
|
|
"mean_token_accuracy": 0.09475043341517449,
|
|
"num_tokens": 718000.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.659535074234009,
|
|
"epoch": 0.31513537505548156,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000177,
|
|
"loss": 7.2602,
|
|
"mean_token_accuracy": 0.09070580154657364,
|
|
"num_tokens": 728188.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.705199956893921,
|
|
"epoch": 0.3195739014647137,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 7.291,
|
|
"mean_token_accuracy": 0.09317795038223267,
|
|
"num_tokens": 738590.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.739383554458618,
|
|
"epoch": 0.32401242787394585,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 7.3736,
|
|
"mean_token_accuracy": 0.09111551642417907,
|
|
"num_tokens": 748628.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.654271173477173,
|
|
"epoch": 0.328450954283178,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.2501,
|
|
"mean_token_accuracy": 0.09355314895510673,
|
|
"num_tokens": 760126.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.799070549011231,
|
|
"epoch": 0.33288948069241014,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.3846,
|
|
"mean_token_accuracy": 0.08661651834845543,
|
|
"num_tokens": 770255.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.63041615486145,
|
|
"epoch": 0.33732800710164224,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 7.3517,
|
|
"mean_token_accuracy": 0.08633785173296929,
|
|
"num_tokens": 780744.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.73739104270935,
|
|
"epoch": 0.3417665335108744,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 7.2372,
|
|
"mean_token_accuracy": 0.09704277291893959,
|
|
"num_tokens": 790617.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.6727227687835695,
|
|
"epoch": 0.34620505992010653,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 7.2751,
|
|
"mean_token_accuracy": 0.09424345120787621,
|
|
"num_tokens": 800751.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.7567243576049805,
|
|
"epoch": 0.3506435863293387,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 7.3627,
|
|
"mean_token_accuracy": 0.09301683828234672,
|
|
"num_tokens": 810596.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.74293794631958,
|
|
"epoch": 0.3550821127385708,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.3311,
|
|
"mean_token_accuracy": 0.08610923066735268,
|
|
"num_tokens": 821001.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.658763313293457,
|
|
"epoch": 0.3595206391478029,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 7.2313,
|
|
"mean_token_accuracy": 0.09779016748070717,
|
|
"num_tokens": 831653.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.616789484024048,
|
|
"epoch": 0.36395916555703506,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 7.1687,
|
|
"mean_token_accuracy": 0.10131467953324318,
|
|
"num_tokens": 842953.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.563587284088134,
|
|
"epoch": 0.3683976919662672,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000207,
|
|
"loss": 7.2395,
|
|
"mean_token_accuracy": 0.0917266458272934,
|
|
"num_tokens": 853521.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.62612771987915,
|
|
"epoch": 0.37283621837549935,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 7.1909,
|
|
"mean_token_accuracy": 0.09840409010648728,
|
|
"num_tokens": 863525.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.7186483383178714,
|
|
"epoch": 0.37727474478473144,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000212,
|
|
"loss": 7.2794,
|
|
"mean_token_accuracy": 0.09545301347970962,
|
|
"num_tokens": 874101.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.579249715805053,
|
|
"epoch": 0.3817132711939636,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.1828,
|
|
"mean_token_accuracy": 0.1006378948688507,
|
|
"num_tokens": 884422.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.561653470993042,
|
|
"epoch": 0.38615179760319573,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 7.1764,
|
|
"mean_token_accuracy": 0.09805170893669128,
|
|
"num_tokens": 894787.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.73306303024292,
|
|
"epoch": 0.3905903240124279,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.2928,
|
|
"mean_token_accuracy": 0.08978268429636956,
|
|
"num_tokens": 906295.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.6030584335327145,
|
|
"epoch": 0.39502885042166,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 7.2112,
|
|
"mean_token_accuracy": 0.09668504521250725,
|
|
"num_tokens": 916791.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.55758113861084,
|
|
"epoch": 0.3994673768308921,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 7.1147,
|
|
"mean_token_accuracy": 0.09961161985993386,
|
|
"num_tokens": 926383.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.644591426849365,
|
|
"epoch": 0.40390590324012426,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 7.1943,
|
|
"mean_token_accuracy": 0.10151847004890442,
|
|
"num_tokens": 937319.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.615101528167725,
|
|
"epoch": 0.4083444296493564,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 7.2615,
|
|
"mean_token_accuracy": 0.09779548048973083,
|
|
"num_tokens": 947641.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.583732938766479,
|
|
"epoch": 0.41278295605858856,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 7.1568,
|
|
"mean_token_accuracy": 0.09658500477671624,
|
|
"num_tokens": 957778.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.627662897109985,
|
|
"epoch": 0.4172214824678207,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 7.1428,
|
|
"mean_token_accuracy": 0.09743335545063019,
|
|
"num_tokens": 967619.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.599508905410767,
|
|
"epoch": 0.4216600088770528,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 7.2186,
|
|
"mean_token_accuracy": 0.09613262861967087,
|
|
"num_tokens": 978301.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.5192223072052,
|
|
"epoch": 0.42609853528628494,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 7.2032,
|
|
"mean_token_accuracy": 0.09714524820446968,
|
|
"num_tokens": 989783.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.552160596847534,
|
|
"epoch": 0.4305370616955171,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000242,
|
|
"loss": 7.0988,
|
|
"mean_token_accuracy": 0.10628278627991676,
|
|
"num_tokens": 999827.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.5833902835845945,
|
|
"epoch": 0.43497558810474923,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 7.2168,
|
|
"mean_token_accuracy": 0.09577535167336464,
|
|
"num_tokens": 1011294.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.581695985794068,
|
|
"epoch": 0.4394141145139814,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000247,
|
|
"loss": 7.1425,
|
|
"mean_token_accuracy": 0.09786203876137733,
|
|
"num_tokens": 1021672.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.592150259017944,
|
|
"epoch": 0.44385264092321347,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 7.1239,
|
|
"mean_token_accuracy": 0.10068506821990013,
|
|
"num_tokens": 1031281.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.44385264092321347,
|
|
"eval_entropy": 7.398865165166787,
|
|
"eval_loss": 7.180932521820068,
|
|
"eval_mean_token_accuracy": 0.09428256430669806,
|
|
"eval_num_tokens": 1031281.0,
|
|
"eval_runtime": 2.1123,
|
|
"eval_samples_per_second": 1593.963,
|
|
"eval_steps_per_second": 199.305,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.5125542163848875,
|
|
"epoch": 0.4482911673324456,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000252,
|
|
"loss": 7.1865,
|
|
"mean_token_accuracy": 0.09644722416996956,
|
|
"num_tokens": 1042458.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.581930828094483,
|
|
"epoch": 0.45272969374167776,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 7.1654,
|
|
"mean_token_accuracy": 0.10110429748892784,
|
|
"num_tokens": 1051645.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 7.556396198272705,
|
|
"epoch": 0.4571682201509099,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000257,
|
|
"loss": 7.1574,
|
|
"mean_token_accuracy": 0.10311417281627655,
|
|
"num_tokens": 1061634.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 7.615333938598633,
|
|
"epoch": 0.46160674656014206,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 7.1778,
|
|
"mean_token_accuracy": 0.10142057165503501,
|
|
"num_tokens": 1071666.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.468676328659058,
|
|
"epoch": 0.46604527296937415,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000262,
|
|
"loss": 7.1345,
|
|
"mean_token_accuracy": 0.09515785649418831,
|
|
"num_tokens": 1082652.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 7.533456087112427,
|
|
"epoch": 0.4704837993786063,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 7.0998,
|
|
"mean_token_accuracy": 0.0970863476395607,
|
|
"num_tokens": 1092396.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 7.495568656921387,
|
|
"epoch": 0.47492232578783844,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 7.0605,
|
|
"mean_token_accuracy": 0.10546803250908851,
|
|
"num_tokens": 1102504.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 7.440021228790283,
|
|
"epoch": 0.4793608521970706,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 7.112,
|
|
"mean_token_accuracy": 0.09773821383714676,
|
|
"num_tokens": 1112505.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 7.558693218231201,
|
|
"epoch": 0.48379937860630273,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 7.1158,
|
|
"mean_token_accuracy": 0.0986550621688366,
|
|
"num_tokens": 1122603.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.461544179916382,
|
|
"epoch": 0.4882379050155348,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 7.1284,
|
|
"mean_token_accuracy": 0.09657116010785102,
|
|
"num_tokens": 1132178.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 7.562966060638428,
|
|
"epoch": 0.49267643142476697,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 7.0946,
|
|
"mean_token_accuracy": 0.09613885954022408,
|
|
"num_tokens": 1141712.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 7.508441638946533,
|
|
"epoch": 0.4971149578339991,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.1157,
|
|
"mean_token_accuracy": 0.0992264598608017,
|
|
"num_tokens": 1151748.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.558133125305176,
|
|
"epoch": 0.5015534842432312,
|
|
"grad_norm": 2.265625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 7.0116,
|
|
"mean_token_accuracy": 0.10735590234398842,
|
|
"num_tokens": 1161234.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.4882372379302975,
|
|
"epoch": 0.5059920106524634,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 7.0915,
|
|
"mean_token_accuracy": 0.10239496752619744,
|
|
"num_tokens": 1171656.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 7.4804298877716064,
|
|
"epoch": 0.5104305370616955,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000287,
|
|
"loss": 7.1359,
|
|
"mean_token_accuracy": 0.09924655333161354,
|
|
"num_tokens": 1182983.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 7.447319459915161,
|
|
"epoch": 0.5148690634709276,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 7.1005,
|
|
"mean_token_accuracy": 0.09991766214370727,
|
|
"num_tokens": 1193720.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.4760712623596195,
|
|
"epoch": 0.5193075898801598,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 7.0304,
|
|
"mean_token_accuracy": 0.10363117456436158,
|
|
"num_tokens": 1203286.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.436632061004639,
|
|
"epoch": 0.5237461162893919,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 7.0193,
|
|
"mean_token_accuracy": 0.10448477938771247,
|
|
"num_tokens": 1212875.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 7.479945039749145,
|
|
"epoch": 0.5281846426986241,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000297,
|
|
"loss": 7.0455,
|
|
"mean_token_accuracy": 0.09875646382570266,
|
|
"num_tokens": 1223629.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.455782127380371,
|
|
"epoch": 0.5326231691078562,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 7.1663,
|
|
"mean_token_accuracy": 0.10330844521522523,
|
|
"num_tokens": 1233670.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 7.540210819244384,
|
|
"epoch": 0.5370616955170884,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.000302,
|
|
"loss": 7.0882,
|
|
"mean_token_accuracy": 0.10033463165163994,
|
|
"num_tokens": 1244140.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.42637152671814,
|
|
"epoch": 0.5415002219263204,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 7.0617,
|
|
"mean_token_accuracy": 0.10370045378804207,
|
|
"num_tokens": 1254496.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 7.397940731048584,
|
|
"epoch": 0.5459387483355526,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 7.0262,
|
|
"mean_token_accuracy": 0.10960142239928246,
|
|
"num_tokens": 1265391.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 7.426065683364868,
|
|
"epoch": 0.5503772747447847,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.9633,
|
|
"mean_token_accuracy": 0.10688221156597137,
|
|
"num_tokens": 1275857.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.255760049819946,
|
|
"epoch": 0.5548158011540169,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.9785,
|
|
"mean_token_accuracy": 0.10750289410352706,
|
|
"num_tokens": 1285122.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 7.525947952270508,
|
|
"epoch": 0.559254327563249,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 7.0365,
|
|
"mean_token_accuracy": 0.10156842395663261,
|
|
"num_tokens": 1294476.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 7.383149433135986,
|
|
"epoch": 0.5636928539724811,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000317,
|
|
"loss": 7.0386,
|
|
"mean_token_accuracy": 0.10288441628217697,
|
|
"num_tokens": 1304959.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 7.389831638336181,
|
|
"epoch": 0.5681313803817133,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.9818,
|
|
"mean_token_accuracy": 0.10231715813279152,
|
|
"num_tokens": 1316121.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.392814636230469,
|
|
"epoch": 0.5725699067909454,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000322,
|
|
"loss": 7.0793,
|
|
"mean_token_accuracy": 0.10169301480054856,
|
|
"num_tokens": 1326750.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 7.383424234390259,
|
|
"epoch": 0.5770084332001776,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.9712,
|
|
"mean_token_accuracy": 0.10646747648715973,
|
|
"num_tokens": 1337044.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 7.4170256614685055,
|
|
"epoch": 0.5814469596094097,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 7.0334,
|
|
"mean_token_accuracy": 0.09991655647754669,
|
|
"num_tokens": 1347610.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 7.2603747844696045,
|
|
"epoch": 0.5858854860186418,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.9609,
|
|
"mean_token_accuracy": 0.10539844930171967,
|
|
"num_tokens": 1356521.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 7.422995662689209,
|
|
"epoch": 0.5903240124278739,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.9662,
|
|
"mean_token_accuracy": 0.10543927997350692,
|
|
"num_tokens": 1366741.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 7.369775009155274,
|
|
"epoch": 0.5947625388371061,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 7.0411,
|
|
"mean_token_accuracy": 0.10072910860180855,
|
|
"num_tokens": 1377018.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 7.43230504989624,
|
|
"epoch": 0.5992010652463382,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.959,
|
|
"mean_token_accuracy": 0.10484865829348564,
|
|
"num_tokens": 1386387.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 7.3505573749542235,
|
|
"epoch": 0.6036395916555704,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.961,
|
|
"mean_token_accuracy": 0.10673004984855652,
|
|
"num_tokens": 1396049.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 7.355041980743408,
|
|
"epoch": 0.6080781180648025,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 7.0803,
|
|
"mean_token_accuracy": 0.0983244001865387,
|
|
"num_tokens": 1406952.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 7.410180234909058,
|
|
"epoch": 0.6125166444740346,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.9874,
|
|
"mean_token_accuracy": 0.10184509009122848,
|
|
"num_tokens": 1417146.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 7.331110858917237,
|
|
"epoch": 0.6169551708832668,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.9654,
|
|
"mean_token_accuracy": 0.11014403700828553,
|
|
"num_tokens": 1426146.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 7.430603981018066,
|
|
"epoch": 0.6213936972924989,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 7.0644,
|
|
"mean_token_accuracy": 0.10093853399157524,
|
|
"num_tokens": 1437913.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 7.3031325340271,
|
|
"epoch": 0.625832223701731,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.9308,
|
|
"mean_token_accuracy": 0.11181655824184418,
|
|
"num_tokens": 1448329.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 7.382747077941895,
|
|
"epoch": 0.6302707501109631,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.9559,
|
|
"mean_token_accuracy": 0.10284734219312668,
|
|
"num_tokens": 1457896.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 7.310059356689453,
|
|
"epoch": 0.6347092765201953,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.9601,
|
|
"mean_token_accuracy": 0.1071910947561264,
|
|
"num_tokens": 1467705.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 7.25341272354126,
|
|
"epoch": 0.6391478029294274,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.9512,
|
|
"mean_token_accuracy": 0.10645409822463989,
|
|
"num_tokens": 1478132.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 7.391849327087402,
|
|
"epoch": 0.6435863293386596,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000362,
|
|
"loss": 7.019,
|
|
"mean_token_accuracy": 0.10602135583758354,
|
|
"num_tokens": 1488424.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 7.310156202316284,
|
|
"epoch": 0.6480248557478917,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.8812,
|
|
"mean_token_accuracy": 0.11527719348669052,
|
|
"num_tokens": 1498197.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 7.234117460250855,
|
|
"epoch": 0.6524633821571239,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.9052,
|
|
"mean_token_accuracy": 0.10894913673400879,
|
|
"num_tokens": 1508242.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 7.232631635665894,
|
|
"epoch": 0.656901908566356,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.8983,
|
|
"mean_token_accuracy": 0.11159973964095116,
|
|
"num_tokens": 1517652.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 7.2952375411987305,
|
|
"epoch": 0.6613404349755881,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.9347,
|
|
"mean_token_accuracy": 0.10787282809615135,
|
|
"num_tokens": 1527501.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 7.291040468215942,
|
|
"epoch": 0.6657789613848203,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.9339,
|
|
"mean_token_accuracy": 0.11132785305380821,
|
|
"num_tokens": 1537640.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 7.20764536857605,
|
|
"epoch": 0.6702174877940523,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.8701,
|
|
"mean_token_accuracy": 0.11440131813287735,
|
|
"num_tokens": 1548049.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 7.340287876129151,
|
|
"epoch": 0.6746560142032845,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 7.0474,
|
|
"mean_token_accuracy": 0.10261607840657234,
|
|
"num_tokens": 1558389.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 7.222410678863525,
|
|
"epoch": 0.6790945406125166,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.8176,
|
|
"mean_token_accuracy": 0.11613213866949082,
|
|
"num_tokens": 1568489.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 7.2836723804473875,
|
|
"epoch": 0.6835330670217488,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.9313,
|
|
"mean_token_accuracy": 0.10658463388681412,
|
|
"num_tokens": 1578430.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 7.352204275131226,
|
|
"epoch": 0.6879715934309809,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 7.001,
|
|
"mean_token_accuracy": 0.10380481109023094,
|
|
"num_tokens": 1590307.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 7.313673448562622,
|
|
"epoch": 0.6924101198402131,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.8585,
|
|
"mean_token_accuracy": 0.11356580927968025,
|
|
"num_tokens": 1601719.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 7.149180507659912,
|
|
"epoch": 0.6968486462494452,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.8735,
|
|
"mean_token_accuracy": 0.11371317654848098,
|
|
"num_tokens": 1612047.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 7.195708179473877,
|
|
"epoch": 0.7012871726586773,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.8651,
|
|
"mean_token_accuracy": 0.11098539307713509,
|
|
"num_tokens": 1623141.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 7.241322708129883,
|
|
"epoch": 0.7057256990679095,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.8738,
|
|
"mean_token_accuracy": 0.1125923864543438,
|
|
"num_tokens": 1633249.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 7.270007610321045,
|
|
"epoch": 0.7101642254771416,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.9612,
|
|
"mean_token_accuracy": 0.10728915557265281,
|
|
"num_tokens": 1644451.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 7.245293235778808,
|
|
"epoch": 0.7146027518863737,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.8967,
|
|
"mean_token_accuracy": 0.11031619012355805,
|
|
"num_tokens": 1655196.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 7.137471008300781,
|
|
"epoch": 0.7190412782956058,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.8781,
|
|
"mean_token_accuracy": 0.11013623625040055,
|
|
"num_tokens": 1665613.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 7.282591247558594,
|
|
"epoch": 0.723479804704838,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.8188,
|
|
"mean_token_accuracy": 0.11500794291496277,
|
|
"num_tokens": 1675116.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 7.219833612442017,
|
|
"epoch": 0.7279183311140701,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.9236,
|
|
"mean_token_accuracy": 0.10631008669734002,
|
|
"num_tokens": 1684055.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 7.231753492355347,
|
|
"epoch": 0.7323568575233023,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.7797,
|
|
"mean_token_accuracy": 0.12125139310956001,
|
|
"num_tokens": 1694046.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 7.143084859848022,
|
|
"epoch": 0.7367953839325344,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.8325,
|
|
"mean_token_accuracy": 0.1153494082391262,
|
|
"num_tokens": 1704133.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 7.14149580001831,
|
|
"epoch": 0.7412339103417666,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.9275,
|
|
"mean_token_accuracy": 0.11007370427250862,
|
|
"num_tokens": 1714678.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 7.204297304153442,
|
|
"epoch": 0.7456724367509987,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.7453,
|
|
"mean_token_accuracy": 0.12288743630051613,
|
|
"num_tokens": 1725145.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 7.071165657043457,
|
|
"epoch": 0.7501109631602308,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.8729,
|
|
"mean_token_accuracy": 0.11628773137927055,
|
|
"num_tokens": 1735530.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 7.21942458152771,
|
|
"epoch": 0.7545494895694629,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.8964,
|
|
"mean_token_accuracy": 0.11181129217147827,
|
|
"num_tokens": 1746520.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 7.154268980026245,
|
|
"epoch": 0.758988015978695,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.8532,
|
|
"mean_token_accuracy": 0.1179992400109768,
|
|
"num_tokens": 1756091.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 7.089676809310913,
|
|
"epoch": 0.7634265423879272,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.8561,
|
|
"mean_token_accuracy": 0.10415932089090348,
|
|
"num_tokens": 1765968.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 7.192745923995972,
|
|
"epoch": 0.7678650687971593,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.8773,
|
|
"mean_token_accuracy": 0.11299539059400558,
|
|
"num_tokens": 1777409.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 7.130894994735717,
|
|
"epoch": 0.7723035952063915,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.8824,
|
|
"mean_token_accuracy": 0.10640934631228446,
|
|
"num_tokens": 1788440.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 7.20861964225769,
|
|
"epoch": 0.7767421216156236,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.8417,
|
|
"mean_token_accuracy": 0.11558186262845993,
|
|
"num_tokens": 1799145.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 7.05075421333313,
|
|
"epoch": 0.7811806480248558,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.808,
|
|
"mean_token_accuracy": 0.116386828571558,
|
|
"num_tokens": 1809366.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 7.129081392288208,
|
|
"epoch": 0.7856191744340879,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.8875,
|
|
"mean_token_accuracy": 0.10899080038070678,
|
|
"num_tokens": 1820878.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 7.155272579193115,
|
|
"epoch": 0.79005770084332,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.8349,
|
|
"mean_token_accuracy": 0.11343251317739486,
|
|
"num_tokens": 1831870.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 7.249894714355468,
|
|
"epoch": 0.7944962272525522,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.801,
|
|
"mean_token_accuracy": 0.11338023543357849,
|
|
"num_tokens": 1841482.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.969785833358765,
|
|
"epoch": 0.7989347536617842,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.8102,
|
|
"mean_token_accuracy": 0.11380291059613228,
|
|
"num_tokens": 1851748.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 7.100828695297241,
|
|
"epoch": 0.8033732800710164,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.7389,
|
|
"mean_token_accuracy": 0.1162735216319561,
|
|
"num_tokens": 1862292.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 7.249449729919434,
|
|
"epoch": 0.8078118064802485,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.959,
|
|
"mean_token_accuracy": 0.10582878962159156,
|
|
"num_tokens": 1873825.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 7.126041460037231,
|
|
"epoch": 0.8122503328894807,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.7795,
|
|
"mean_token_accuracy": 0.11718677878379821,
|
|
"num_tokens": 1883824.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 7.029882144927979,
|
|
"epoch": 0.8166888592987128,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.7984,
|
|
"mean_token_accuracy": 0.10695101991295815,
|
|
"num_tokens": 1894236.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 7.212645196914673,
|
|
"epoch": 0.821127385707945,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.779,
|
|
"mean_token_accuracy": 0.11693326756358147,
|
|
"num_tokens": 1904083.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 7.023255491256714,
|
|
"epoch": 0.8255659121171771,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.7907,
|
|
"mean_token_accuracy": 0.11693133264780045,
|
|
"num_tokens": 1914845.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 7.073426914215088,
|
|
"epoch": 0.8300044385264093,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.7945,
|
|
"mean_token_accuracy": 0.11135339140892028,
|
|
"num_tokens": 1925999.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 7.0789491653442385,
|
|
"epoch": 0.8344429649356414,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.694,
|
|
"mean_token_accuracy": 0.1280534103512764,
|
|
"num_tokens": 1935401.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.9891969680786135,
|
|
"epoch": 0.8388814913448736,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.7607,
|
|
"mean_token_accuracy": 0.12046314924955367,
|
|
"num_tokens": 1945510.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 7.16357650756836,
|
|
"epoch": 0.8433200177541056,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.7473,
|
|
"mean_token_accuracy": 0.11847912147641182,
|
|
"num_tokens": 1956934.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 7.054219198226929,
|
|
"epoch": 0.8477585441633377,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.7688,
|
|
"mean_token_accuracy": 0.11719952076673508,
|
|
"num_tokens": 1967032.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 7.080799579620361,
|
|
"epoch": 0.8521970705725699,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.8584,
|
|
"mean_token_accuracy": 0.11015522852540016,
|
|
"num_tokens": 1978895.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 7.09550929069519,
|
|
"epoch": 0.856635596981802,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.816,
|
|
"mean_token_accuracy": 0.11443090364336968,
|
|
"num_tokens": 1990156.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 7.139660930633545,
|
|
"epoch": 0.8610741233910342,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.7035,
|
|
"mean_token_accuracy": 0.11342604532837867,
|
|
"num_tokens": 1999643.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.957034969329834,
|
|
"epoch": 0.8655126498002663,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.7472,
|
|
"mean_token_accuracy": 0.11747978329658508,
|
|
"num_tokens": 2010328.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 7.062716341018676,
|
|
"epoch": 0.8699511762094985,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.8272,
|
|
"mean_token_accuracy": 0.11245640963315964,
|
|
"num_tokens": 2021353.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 7.081027889251709,
|
|
"epoch": 0.8743897026187306,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.7701,
|
|
"mean_token_accuracy": 0.11547347530722618,
|
|
"num_tokens": 2032331.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 7.023243951797485,
|
|
"epoch": 0.8788282290279628,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.7011,
|
|
"mean_token_accuracy": 0.1206856571137905,
|
|
"num_tokens": 2041786.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.975612211227417,
|
|
"epoch": 0.8832667554371949,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.6885,
|
|
"mean_token_accuracy": 0.11817316859960555,
|
|
"num_tokens": 2052512.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 7.02327561378479,
|
|
"epoch": 0.8877052818464269,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.6295,
|
|
"mean_token_accuracy": 0.12657489329576493,
|
|
"num_tokens": 2062785.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 0.8877052818464269,
|
|
"eval_entropy": 6.811686369698857,
|
|
"eval_loss": 6.767911434173584,
|
|
"eval_mean_token_accuracy": 0.11571601520772501,
|
|
"eval_num_tokens": 2062785.0,
|
|
"eval_runtime": 2.1114,
|
|
"eval_samples_per_second": 1594.66,
|
|
"eval_steps_per_second": 199.392,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 7.073720645904541,
|
|
"epoch": 0.8921438082556591,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999998312369076,
|
|
"loss": 6.7709,
|
|
"mean_token_accuracy": 0.11314490139484405,
|
|
"num_tokens": 2072621.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 7.060971355438232,
|
|
"epoch": 0.8965823346648912,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999991456372788,
|
|
"loss": 6.8178,
|
|
"mean_token_accuracy": 0.10872112512588501,
|
|
"num_tokens": 2083356.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 7.0227889060974125,
|
|
"epoch": 0.9010208610741234,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000499997932655026,
|
|
"loss": 6.7777,
|
|
"mean_token_accuracy": 0.11077685430645942,
|
|
"num_tokens": 2092787.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.9889302253723145,
|
|
"epoch": 0.9054593874833555,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004999961922929925,
|
|
"loss": 6.6739,
|
|
"mean_token_accuracy": 0.11871889233589172,
|
|
"num_tokens": 2103721.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.950629568099975,
|
|
"epoch": 0.9098979138925877,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999939245552573,
|
|
"loss": 6.6956,
|
|
"mean_token_accuracy": 0.12753814980387687,
|
|
"num_tokens": 2115016.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.951031637191773,
|
|
"epoch": 0.9143364403018198,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000499991129447136,
|
|
"loss": 6.6594,
|
|
"mean_token_accuracy": 0.1263865128159523,
|
|
"num_tokens": 2126183.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.928300905227661,
|
|
"epoch": 0.918774966711052,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999878069751803,
|
|
"loss": 6.7069,
|
|
"mean_token_accuracy": 0.11957084909081458,
|
|
"num_tokens": 2135955.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.915622138977051,
|
|
"epoch": 0.9232134931202841,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004999839571471776,
|
|
"loss": 6.6919,
|
|
"mean_token_accuracy": 0.11919597014784813,
|
|
"num_tokens": 2146064.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.9707104682922365,
|
|
"epoch": 0.9276520195295161,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004999795799721517,
|
|
"loss": 6.6444,
|
|
"mean_token_accuracy": 0.1262632966041565,
|
|
"num_tokens": 2155707.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.99800386428833,
|
|
"epoch": 0.9320905459387483,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999746754603624,
|
|
"loss": 6.6928,
|
|
"mean_token_accuracy": 0.11961428299546242,
|
|
"num_tokens": 2166037.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.904142761230469,
|
|
"epoch": 0.9365290723479804,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999692436233055,
|
|
"loss": 6.7519,
|
|
"mean_token_accuracy": 0.11929019168019295,
|
|
"num_tokens": 2175993.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 7.008247995376587,
|
|
"epoch": 0.9409675987572126,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000499963284473713,
|
|
"loss": 6.7099,
|
|
"mean_token_accuracy": 0.12117866948246955,
|
|
"num_tokens": 2186829.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.9378032207489015,
|
|
"epoch": 0.9454061251664447,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999567980255526,
|
|
"loss": 6.665,
|
|
"mean_token_accuracy": 0.12237748578190803,
|
|
"num_tokens": 2195845.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 7.0276360511779785,
|
|
"epoch": 0.9498446515756769,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999497842940282,
|
|
"loss": 6.6921,
|
|
"mean_token_accuracy": 0.12066913396120071,
|
|
"num_tokens": 2204937.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.900293159484863,
|
|
"epoch": 0.954283177984909,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999422432955794,
|
|
"loss": 6.6703,
|
|
"mean_token_accuracy": 0.12011573910713196,
|
|
"num_tokens": 2214582.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.922044038772583,
|
|
"epoch": 0.9587217043941412,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999341750478818,
|
|
"loss": 6.6229,
|
|
"mean_token_accuracy": 0.1269613318145275,
|
|
"num_tokens": 2225157.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.99785623550415,
|
|
"epoch": 0.9631602308033733,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000499925579569847,
|
|
"loss": 6.6932,
|
|
"mean_token_accuracy": 0.12152787148952485,
|
|
"num_tokens": 2234823.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.851722621917725,
|
|
"epoch": 0.9675987572126055,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999164568816219,
|
|
"loss": 6.6802,
|
|
"mean_token_accuracy": 0.119229806214571,
|
|
"num_tokens": 2244666.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 7.007480764389038,
|
|
"epoch": 0.9720372836218375,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999068070045897,
|
|
"loss": 6.6412,
|
|
"mean_token_accuracy": 0.117543176561594,
|
|
"num_tokens": 2254586.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.836320638656616,
|
|
"epoch": 0.9764758100310696,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000499896629961369,
|
|
"loss": 6.6026,
|
|
"mean_token_accuracy": 0.12370306029915809,
|
|
"num_tokens": 2264453.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.999147844314575,
|
|
"epoch": 0.9809143364403018,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000499885925775814,
|
|
"loss": 6.6656,
|
|
"mean_token_accuracy": 0.11901217773556709,
|
|
"num_tokens": 2275170.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.810418939590454,
|
|
"epoch": 0.9853528628495339,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004998746944730148,
|
|
"loss": 6.6517,
|
|
"mean_token_accuracy": 0.12251685783267022,
|
|
"num_tokens": 2285448.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.978043413162231,
|
|
"epoch": 0.9897913892587661,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004998629360792965,
|
|
"loss": 6.6361,
|
|
"mean_token_accuracy": 0.1255613885819912,
|
|
"num_tokens": 2295673.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.860985517501831,
|
|
"epoch": 0.9942299156679982,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004998506506222202,
|
|
"loss": 6.644,
|
|
"mean_token_accuracy": 0.12026142254471779,
|
|
"num_tokens": 2306115.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.872910737991333,
|
|
"epoch": 0.9986684420772304,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004998378381305821,
|
|
"loss": 6.637,
|
|
"mean_token_accuracy": 0.12394563928246498,
|
|
"num_tokens": 2316495.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.93203698264228,
|
|
"epoch": 1.0026631158455392,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004998244986344138,
|
|
"loss": 6.5838,
|
|
"mean_token_accuracy": 0.1257213337553872,
|
|
"num_tokens": 2326409.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.777434873580932,
|
|
"epoch": 1.0071016422547714,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998106321649822,
|
|
"loss": 6.439,
|
|
"mean_token_accuracy": 0.1350421704351902,
|
|
"num_tokens": 2337394.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.8583564281463625,
|
|
"epoch": 1.0115401686640035,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004997962387547893,
|
|
"loss": 6.5089,
|
|
"mean_token_accuracy": 0.12366606816649436,
|
|
"num_tokens": 2347768.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.965995025634766,
|
|
"epoch": 1.0159786950732357,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004997813184375723,
|
|
"loss": 6.5134,
|
|
"mean_token_accuracy": 0.12577569335699082,
|
|
"num_tokens": 2357969.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.872522068023682,
|
|
"epoch": 1.0204172214824678,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004997658712483034,
|
|
"loss": 6.4866,
|
|
"mean_token_accuracy": 0.1270396701991558,
|
|
"num_tokens": 2367878.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.814556646347046,
|
|
"epoch": 1.0248557478917,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004997498972231898,
|
|
"loss": 6.4781,
|
|
"mean_token_accuracy": 0.12578893974423408,
|
|
"num_tokens": 2377072.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.867713165283203,
|
|
"epoch": 1.0292942743009321,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997333963996734,
|
|
"loss": 6.503,
|
|
"mean_token_accuracy": 0.13253186494112015,
|
|
"num_tokens": 2387348.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.912645387649536,
|
|
"epoch": 1.0337328007101643,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004997163688164313,
|
|
"loss": 6.4919,
|
|
"mean_token_accuracy": 0.12540172412991524,
|
|
"num_tokens": 2398113.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.738404178619385,
|
|
"epoch": 1.0381713271193964,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004996988145133745,
|
|
"loss": 6.3882,
|
|
"mean_token_accuracy": 0.13407822996377944,
|
|
"num_tokens": 2408074.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.699475193023682,
|
|
"epoch": 1.0426098535286286,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004996807335316496,
|
|
"loss": 6.3874,
|
|
"mean_token_accuracy": 0.1336548797786236,
|
|
"num_tokens": 2419752.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.843112182617188,
|
|
"epoch": 1.0470483799378607,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004996621259136368,
|
|
"loss": 6.4743,
|
|
"mean_token_accuracy": 0.1282840073108673,
|
|
"num_tokens": 2430853.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.741962194442749,
|
|
"epoch": 1.0514869063470929,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996429917029513,
|
|
"loss": 6.4597,
|
|
"mean_token_accuracy": 0.1284678265452385,
|
|
"num_tokens": 2440686.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.87503981590271,
|
|
"epoch": 1.055925432756325,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004996233309444424,
|
|
"loss": 6.4862,
|
|
"mean_token_accuracy": 0.1273033231496811,
|
|
"num_tokens": 2450849.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.7747828483581545,
|
|
"epoch": 1.060363959165557,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004996031436841934,
|
|
"loss": 6.3842,
|
|
"mean_token_accuracy": 0.13247138634324074,
|
|
"num_tokens": 2460827.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.7094989776611325,
|
|
"epoch": 1.064802485574789,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004995824299695219,
|
|
"loss": 6.4723,
|
|
"mean_token_accuracy": 0.1337954096496105,
|
|
"num_tokens": 2471265.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.8431929588317875,
|
|
"epoch": 1.0692410119840212,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004995611898489796,
|
|
"loss": 6.3655,
|
|
"mean_token_accuracy": 0.13849280402064323,
|
|
"num_tokens": 2481346.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.77330379486084,
|
|
"epoch": 1.0736795383932534,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004995394233723516,
|
|
"loss": 6.4696,
|
|
"mean_token_accuracy": 0.13246190845966338,
|
|
"num_tokens": 2492281.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.771844577789307,
|
|
"epoch": 1.0781180648024855,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004995171305906574,
|
|
"loss": 6.397,
|
|
"mean_token_accuracy": 0.1389589823782444,
|
|
"num_tokens": 2502094.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.706840229034424,
|
|
"epoch": 1.0825565912117177,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004994943115561495,
|
|
"loss": 6.3975,
|
|
"mean_token_accuracy": 0.13392824158072472,
|
|
"num_tokens": 2512553.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.795430517196655,
|
|
"epoch": 1.0869951176209498,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004994709663223143,
|
|
"loss": 6.3947,
|
|
"mean_token_accuracy": 0.13575630336999894,
|
|
"num_tokens": 2522350.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.717914056777954,
|
|
"epoch": 1.091433644030182,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004994470949438712,
|
|
"loss": 6.4571,
|
|
"mean_token_accuracy": 0.12943646237254142,
|
|
"num_tokens": 2532884.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.821149110794067,
|
|
"epoch": 1.095872170439414,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004994226974767734,
|
|
"loss": 6.4947,
|
|
"mean_token_accuracy": 0.12449371442198753,
|
|
"num_tokens": 2543364.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.7451752662658695,
|
|
"epoch": 1.1003106968486462,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004993977739782066,
|
|
"loss": 6.3817,
|
|
"mean_token_accuracy": 0.13001500964164733,
|
|
"num_tokens": 2552281.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.721602582931519,
|
|
"epoch": 1.1047492232578784,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00049937232450659,
|
|
"loss": 6.446,
|
|
"mean_token_accuracy": 0.12717969268560408,
|
|
"num_tokens": 2561963.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.7753888130187985,
|
|
"epoch": 1.1091877496671105,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004993463491215753,
|
|
"loss": 6.4337,
|
|
"mean_token_accuracy": 0.13999854624271393,
|
|
"num_tokens": 2572951.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.816381406784058,
|
|
"epoch": 1.1136262760763427,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499319847884047,
|
|
"loss": 6.4535,
|
|
"mean_token_accuracy": 0.1278873711824417,
|
|
"num_tokens": 2583019.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.7529043674469,
|
|
"epoch": 1.1180648024855748,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004992928208561224,
|
|
"loss": 6.3902,
|
|
"mean_token_accuracy": 0.13753967881202697,
|
|
"num_tokens": 2593385.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.774140882492065,
|
|
"epoch": 1.122503328894807,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004992652681011508,
|
|
"loss": 6.3959,
|
|
"mean_token_accuracy": 0.13451069965958595,
|
|
"num_tokens": 2603679.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.745535135269165,
|
|
"epoch": 1.1269418553040391,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000499237189683714,
|
|
"loss": 6.458,
|
|
"mean_token_accuracy": 0.1327129691839218,
|
|
"num_tokens": 2614029.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.658591461181641,
|
|
"epoch": 1.1313803817132713,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004992085856696259,
|
|
"loss": 6.4209,
|
|
"mean_token_accuracy": 0.1382272757589817,
|
|
"num_tokens": 2624063.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.722748279571533,
|
|
"epoch": 1.1358189081225034,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004991794561259325,
|
|
"loss": 6.3691,
|
|
"mean_token_accuracy": 0.14201630800962448,
|
|
"num_tokens": 2633792.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.6542223453521725,
|
|
"epoch": 1.1402574345317356,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004991498011209112,
|
|
"loss": 6.3232,
|
|
"mean_token_accuracy": 0.13645180314779282,
|
|
"num_tokens": 2643401.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.773741817474365,
|
|
"epoch": 1.1446959609409677,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004991196207240714,
|
|
"loss": 6.4539,
|
|
"mean_token_accuracy": 0.1282748505473137,
|
|
"num_tokens": 2653909.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.693137884140015,
|
|
"epoch": 1.1491344873501999,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004990889150061541,
|
|
"loss": 6.4317,
|
|
"mean_token_accuracy": 0.1349467732012272,
|
|
"num_tokens": 2664386.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.766120195388794,
|
|
"epoch": 1.1535730137594318,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004990576840391312,
|
|
"loss": 6.4865,
|
|
"mean_token_accuracy": 0.12709747180342673,
|
|
"num_tokens": 2675398.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.749423599243164,
|
|
"epoch": 1.158011540168664,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000499025927896206,
|
|
"loss": 6.389,
|
|
"mean_token_accuracy": 0.1319727636873722,
|
|
"num_tokens": 2684895.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.622655010223388,
|
|
"epoch": 1.162450066577896,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004989936466518127,
|
|
"loss": 6.367,
|
|
"mean_token_accuracy": 0.1397032156586647,
|
|
"num_tokens": 2694706.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.733213758468628,
|
|
"epoch": 1.1668885929871282,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004989608403816164,
|
|
"loss": 6.3576,
|
|
"mean_token_accuracy": 0.13502043187618257,
|
|
"num_tokens": 2706486.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.691570997238159,
|
|
"epoch": 1.1713271193963604,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004989275091625126,
|
|
"loss": 6.4414,
|
|
"mean_token_accuracy": 0.14210355877876282,
|
|
"num_tokens": 2716613.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.886738586425781,
|
|
"epoch": 1.1757656458055925,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004988936530726276,
|
|
"loss": 6.5302,
|
|
"mean_token_accuracy": 0.1268772892653942,
|
|
"num_tokens": 2727313.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.723033380508423,
|
|
"epoch": 1.1802041722148247,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004988592721913176,
|
|
"loss": 6.3995,
|
|
"mean_token_accuracy": 0.1361616112291813,
|
|
"num_tokens": 2737826.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.63746075630188,
|
|
"epoch": 1.1846426986240568,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004988243665991692,
|
|
"loss": 6.3232,
|
|
"mean_token_accuracy": 0.13523943722248077,
|
|
"num_tokens": 2748962.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.7660548210144045,
|
|
"epoch": 1.189081225033289,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004987889363779985,
|
|
"loss": 6.3726,
|
|
"mean_token_accuracy": 0.13909099400043487,
|
|
"num_tokens": 2760116.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.642192268371582,
|
|
"epoch": 1.193519751442521,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004987529816108517,
|
|
"loss": 6.3868,
|
|
"mean_token_accuracy": 0.13063296377658845,
|
|
"num_tokens": 2771664.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.735338401794434,
|
|
"epoch": 1.1979582778517532,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004987165023820043,
|
|
"loss": 6.3339,
|
|
"mean_token_accuracy": 0.13763192743062974,
|
|
"num_tokens": 2781792.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.5532543659210205,
|
|
"epoch": 1.2023968042609854,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004986794987769611,
|
|
"loss": 6.3272,
|
|
"mean_token_accuracy": 0.1380511462688446,
|
|
"num_tokens": 2792203.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.720197010040283,
|
|
"epoch": 1.2068353306702175,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000498641970882456,
|
|
"loss": 6.4867,
|
|
"mean_token_accuracy": 0.13111176937818528,
|
|
"num_tokens": 2802077.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.638952589035034,
|
|
"epoch": 1.2112738570794497,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004986039187864518,
|
|
"loss": 6.3655,
|
|
"mean_token_accuracy": 0.14026057049632074,
|
|
"num_tokens": 2811993.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 6.676184177398682,
|
|
"epoch": 1.2157123834886818,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004985653425781401,
|
|
"loss": 6.402,
|
|
"mean_token_accuracy": 0.13089463859796524,
|
|
"num_tokens": 2821924.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.675514078140258,
|
|
"epoch": 1.220150909897914,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004985262423479408,
|
|
"loss": 6.3627,
|
|
"mean_token_accuracy": 0.1411583587527275,
|
|
"num_tokens": 2831521.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.686585426330566,
|
|
"epoch": 1.2245894363071461,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004984866181875021,
|
|
"loss": 6.3526,
|
|
"mean_token_accuracy": 0.13705047890543937,
|
|
"num_tokens": 2841864.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.604874324798584,
|
|
"epoch": 1.229027962716378,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004984464701897005,
|
|
"loss": 6.3588,
|
|
"mean_token_accuracy": 0.13925145491957663,
|
|
"num_tokens": 2852199.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.6554466724395756,
|
|
"epoch": 1.2334664891256102,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004984057984486402,
|
|
"loss": 6.3641,
|
|
"mean_token_accuracy": 0.1341533102095127,
|
|
"num_tokens": 2862167.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.686126089096069,
|
|
"epoch": 1.2379050155348423,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004983646030596527,
|
|
"loss": 6.4079,
|
|
"mean_token_accuracy": 0.13984917402267455,
|
|
"num_tokens": 2872604.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.672490835189819,
|
|
"epoch": 1.2423435419440745,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004983228841192975,
|
|
"loss": 6.3752,
|
|
"mean_token_accuracy": 0.13595345988869667,
|
|
"num_tokens": 2882401.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.631757831573486,
|
|
"epoch": 1.2467820683533066,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004982806417253607,
|
|
"loss": 6.3511,
|
|
"mean_token_accuracy": 0.13876891285181045,
|
|
"num_tokens": 2892004.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.63784236907959,
|
|
"epoch": 1.2512205947625388,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004982378759768557,
|
|
"loss": 6.3538,
|
|
"mean_token_accuracy": 0.13770614489912986,
|
|
"num_tokens": 2902369.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.656727027893067,
|
|
"epoch": 1.255659121171771,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004981945869740225,
|
|
"loss": 6.3934,
|
|
"mean_token_accuracy": 0.13234489262104035,
|
|
"num_tokens": 2912532.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.692376708984375,
|
|
"epoch": 1.260097647581003,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004981507748183276,
|
|
"loss": 6.3853,
|
|
"mean_token_accuracy": 0.1314159318804741,
|
|
"num_tokens": 2922621.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.710336446762085,
|
|
"epoch": 1.2645361739902352,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004981064396124635,
|
|
"loss": 6.3583,
|
|
"mean_token_accuracy": 0.13584646657109262,
|
|
"num_tokens": 2932510.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 6.6139873504638675,
|
|
"epoch": 1.2689747003994674,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004980615814603492,
|
|
"loss": 6.3846,
|
|
"mean_token_accuracy": 0.12972714975476266,
|
|
"num_tokens": 2942982.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.653766632080078,
|
|
"epoch": 1.2734132268086995,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004980162004671288,
|
|
"loss": 6.2817,
|
|
"mean_token_accuracy": 0.1397496670484543,
|
|
"num_tokens": 2953417.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.590647983551025,
|
|
"epoch": 1.2778517532179317,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004979702967391725,
|
|
"loss": 6.287,
|
|
"mean_token_accuracy": 0.14722541570663453,
|
|
"num_tokens": 2961771.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.587854480743408,
|
|
"epoch": 1.2822902796271638,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004979238703840755,
|
|
"loss": 6.3671,
|
|
"mean_token_accuracy": 0.13086313456296922,
|
|
"num_tokens": 2971980.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.69378170967102,
|
|
"epoch": 1.286728806036396,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004978769215106579,
|
|
"loss": 6.3792,
|
|
"mean_token_accuracy": 0.13028891906142234,
|
|
"num_tokens": 2982087.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.681559753417969,
|
|
"epoch": 1.291167332445628,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004978294502289646,
|
|
"loss": 6.4874,
|
|
"mean_token_accuracy": 0.12749797403812407,
|
|
"num_tokens": 2993424.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.710448789596557,
|
|
"epoch": 1.2956058588548602,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004977814566502651,
|
|
"loss": 6.3213,
|
|
"mean_token_accuracy": 0.1379827730357647,
|
|
"num_tokens": 3003081.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.677050495147705,
|
|
"epoch": 1.3000443852640924,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004977329408870532,
|
|
"loss": 6.4048,
|
|
"mean_token_accuracy": 0.1378847599029541,
|
|
"num_tokens": 3013829.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 6.576231288909912,
|
|
"epoch": 1.3044829116733245,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004976839030530464,
|
|
"loss": 6.3102,
|
|
"mean_token_accuracy": 0.1419086903333664,
|
|
"num_tokens": 3024511.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.593928623199463,
|
|
"epoch": 1.3089214380825567,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000497634343263186,
|
|
"loss": 6.4043,
|
|
"mean_token_accuracy": 0.12826052978634833,
|
|
"num_tokens": 3034503.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.648963260650635,
|
|
"epoch": 1.3133599644917888,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004975842616336369,
|
|
"loss": 6.3201,
|
|
"mean_token_accuracy": 0.141230496019125,
|
|
"num_tokens": 3044823.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.510059928894043,
|
|
"epoch": 1.317798490901021,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004975336582817869,
|
|
"loss": 6.33,
|
|
"mean_token_accuracy": 0.1362045116722584,
|
|
"num_tokens": 3056412.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.728832674026489,
|
|
"epoch": 1.3222370173102531,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004974825333262469,
|
|
"loss": 6.3945,
|
|
"mean_token_accuracy": 0.12927686050534248,
|
|
"num_tokens": 3067101.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 6.7084520816802975,
|
|
"epoch": 1.3266755437194853,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004974308868868501,
|
|
"loss": 6.3995,
|
|
"mean_token_accuracy": 0.12630158364772798,
|
|
"num_tokens": 3077638.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.551306915283203,
|
|
"epoch": 1.3311140701287172,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004973787190846524,
|
|
"loss": 6.3218,
|
|
"mean_token_accuracy": 0.14200132787227632,
|
|
"num_tokens": 3087970.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 1.3311140701287172,
|
|
"eval_entropy": 6.368161134651891,
|
|
"eval_loss": 6.45974588394165,
|
|
"eval_mean_token_accuracy": 0.13263512823969623,
|
|
"eval_num_tokens": 3087970.0,
|
|
"eval_runtime": 2.0891,
|
|
"eval_samples_per_second": 1611.728,
|
|
"eval_steps_per_second": 201.526,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.630201387405395,
|
|
"epoch": 1.3355525965379493,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004973260300419316,
|
|
"loss": 6.3578,
|
|
"mean_token_accuracy": 0.13766367435455323,
|
|
"num_tokens": 3097895.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.590450048446655,
|
|
"epoch": 1.3399911229471815,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004972728198821871,
|
|
"loss": 6.3072,
|
|
"mean_token_accuracy": 0.1387806810438633,
|
|
"num_tokens": 3107042.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 6.625532007217407,
|
|
"epoch": 1.3444296493564136,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00049721908873014,
|
|
"loss": 6.315,
|
|
"mean_token_accuracy": 0.14337668791413308,
|
|
"num_tokens": 3117959.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.558200359344482,
|
|
"epoch": 1.3488681757656458,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004971648367117323,
|
|
"loss": 6.3543,
|
|
"mean_token_accuracy": 0.13464199230074883,
|
|
"num_tokens": 3128407.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.676009941101074,
|
|
"epoch": 1.353306702174878,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004971100639541271,
|
|
"loss": 6.3267,
|
|
"mean_token_accuracy": 0.14146978706121444,
|
|
"num_tokens": 3138265.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.57694182395935,
|
|
"epoch": 1.35774522858411,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000497054770585708,
|
|
"loss": 6.3353,
|
|
"mean_token_accuracy": 0.13715606033802033,
|
|
"num_tokens": 3148677.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 6.556269979476928,
|
|
"epoch": 1.3621837549933422,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004969989567360788,
|
|
"loss": 6.3503,
|
|
"mean_token_accuracy": 0.13542981594800949,
|
|
"num_tokens": 3158684.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.643629789352417,
|
|
"epoch": 1.3666222814025744,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004969426225360635,
|
|
"loss": 6.3543,
|
|
"mean_token_accuracy": 0.1378885067999363,
|
|
"num_tokens": 3169124.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.596967315673828,
|
|
"epoch": 1.3710608078118065,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004968857681177056,
|
|
"loss": 6.2667,
|
|
"mean_token_accuracy": 0.1364466980099678,
|
|
"num_tokens": 3179282.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.605694532394409,
|
|
"epoch": 1.3754993342210386,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004968283936142679,
|
|
"loss": 6.301,
|
|
"mean_token_accuracy": 0.13783995881676675,
|
|
"num_tokens": 3190144.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 6.484689426422119,
|
|
"epoch": 1.3799378606302708,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004967704991602322,
|
|
"loss": 6.3025,
|
|
"mean_token_accuracy": 0.14239512234926224,
|
|
"num_tokens": 3201277.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.584119367599487,
|
|
"epoch": 1.384376387039503,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004967120848912995,
|
|
"loss": 6.318,
|
|
"mean_token_accuracy": 0.13924861773848535,
|
|
"num_tokens": 3211691.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.51182188987732,
|
|
"epoch": 1.388814913448735,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004966531509443884,
|
|
"loss": 6.2972,
|
|
"mean_token_accuracy": 0.1423930622637272,
|
|
"num_tokens": 3220452.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.665063858032227,
|
|
"epoch": 1.3932534398579672,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004965936974576363,
|
|
"loss": 6.2572,
|
|
"mean_token_accuracy": 0.1434251219034195,
|
|
"num_tokens": 3230821.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.569358205795288,
|
|
"epoch": 1.3976919662671992,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004965337245703981,
|
|
"loss": 6.333,
|
|
"mean_token_accuracy": 0.13867368102073668,
|
|
"num_tokens": 3240621.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.564372253417969,
|
|
"epoch": 1.4021304926764313,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004964732324232462,
|
|
"loss": 6.302,
|
|
"mean_token_accuracy": 0.13816518783569337,
|
|
"num_tokens": 3251442.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 6.6255796432495115,
|
|
"epoch": 1.4065690190856635,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00049641222115797,
|
|
"loss": 6.3077,
|
|
"mean_token_accuracy": 0.13412498235702514,
|
|
"num_tokens": 3261164.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 6.539021825790405,
|
|
"epoch": 1.4110075454948956,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004963506909175758,
|
|
"loss": 6.3365,
|
|
"mean_token_accuracy": 0.13258393555879594,
|
|
"num_tokens": 3271442.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.633949136734008,
|
|
"epoch": 1.4154460719041277,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000496288641846286,
|
|
"loss": 6.3385,
|
|
"mean_token_accuracy": 0.13758450075984002,
|
|
"num_tokens": 3282159.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.485613584518433,
|
|
"epoch": 1.41988459831336,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004962260740895398,
|
|
"loss": 6.2791,
|
|
"mean_token_accuracy": 0.14571996703743934,
|
|
"num_tokens": 3291424.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.557862329483032,
|
|
"epoch": 1.424323124722592,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004961629877939913,
|
|
"loss": 6.3422,
|
|
"mean_token_accuracy": 0.1376090705394745,
|
|
"num_tokens": 3302098.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.554436111450196,
|
|
"epoch": 1.4287616511318242,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000496099383107511,
|
|
"loss": 6.3472,
|
|
"mean_token_accuracy": 0.13372454419732094,
|
|
"num_tokens": 3313292.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.600845575332642,
|
|
"epoch": 1.4332001775410563,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004960352601791835,
|
|
"loss": 6.2123,
|
|
"mean_token_accuracy": 0.14182500839233397,
|
|
"num_tokens": 3324272.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.54074878692627,
|
|
"epoch": 1.4376387039502885,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004959706191593087,
|
|
"loss": 6.3102,
|
|
"mean_token_accuracy": 0.1401732988655567,
|
|
"num_tokens": 3335299.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 6.616578388214111,
|
|
"epoch": 1.4420772303595206,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004959054601994007,
|
|
"loss": 6.2826,
|
|
"mean_token_accuracy": 0.1450162336230278,
|
|
"num_tokens": 3344652.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 6.52901258468628,
|
|
"epoch": 1.4465157567687528,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004958397834521878,
|
|
"loss": 6.3048,
|
|
"mean_token_accuracy": 0.139273801445961,
|
|
"num_tokens": 3355166.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 6.562482261657715,
|
|
"epoch": 1.450954283177985,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004957735890716115,
|
|
"loss": 6.2622,
|
|
"mean_token_accuracy": 0.1440594784915447,
|
|
"num_tokens": 3366330.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.549576234817505,
|
|
"epoch": 1.455392809587217,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004957068772128273,
|
|
"loss": 6.3315,
|
|
"mean_token_accuracy": 0.14034282714128493,
|
|
"num_tokens": 3375930.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.5108832836151125,
|
|
"epoch": 1.4598313359964492,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000495639648032203,
|
|
"loss": 6.1684,
|
|
"mean_token_accuracy": 0.16133927404880524,
|
|
"num_tokens": 3387310.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 6.47861647605896,
|
|
"epoch": 1.4642698624056814,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004955719016873192,
|
|
"loss": 6.2004,
|
|
"mean_token_accuracy": 0.1491427481174469,
|
|
"num_tokens": 3398022.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.540802431106568,
|
|
"epoch": 1.4687083888149135,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004955036383369688,
|
|
"loss": 6.216,
|
|
"mean_token_accuracy": 0.14632173478603364,
|
|
"num_tokens": 3407315.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 6.459036493301392,
|
|
"epoch": 1.4731469152241456,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004954348581411564,
|
|
"loss": 6.3148,
|
|
"mean_token_accuracy": 0.14125865548849106,
|
|
"num_tokens": 3418009.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.666120433807373,
|
|
"epoch": 1.4775854416333778,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000495365561261098,
|
|
"loss": 6.3262,
|
|
"mean_token_accuracy": 0.13915122225880622,
|
|
"num_tokens": 3428659.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 6.513209629058838,
|
|
"epoch": 1.48202396804261,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004952957478592209,
|
|
"loss": 6.2605,
|
|
"mean_token_accuracy": 0.14562821611762047,
|
|
"num_tokens": 3439102.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 6.495951080322266,
|
|
"epoch": 1.486462494451842,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004952254180991628,
|
|
"loss": 6.3143,
|
|
"mean_token_accuracy": 0.14086345955729485,
|
|
"num_tokens": 3450269.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.550183248519898,
|
|
"epoch": 1.4909010208610742,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004951545721457719,
|
|
"loss": 6.2323,
|
|
"mean_token_accuracy": 0.15024334490299224,
|
|
"num_tokens": 3459876.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 6.439149618148804,
|
|
"epoch": 1.4953395472703064,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004950832101651062,
|
|
"loss": 6.2879,
|
|
"mean_token_accuracy": 0.1395568035542965,
|
|
"num_tokens": 3469276.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 6.540930128097534,
|
|
"epoch": 1.4997780736795385,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004950113323244336,
|
|
"loss": 6.1873,
|
|
"mean_token_accuracy": 0.14649046510457991,
|
|
"num_tokens": 3479835.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.476472091674805,
|
|
"epoch": 1.5042166000887707,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004949389387922305,
|
|
"loss": 6.2472,
|
|
"mean_token_accuracy": 0.14312107488512993,
|
|
"num_tokens": 3491176.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 6.531066989898681,
|
|
"epoch": 1.5086551264980028,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004948660297381826,
|
|
"loss": 6.2262,
|
|
"mean_token_accuracy": 0.14610032215714455,
|
|
"num_tokens": 3501122.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 6.392983913421631,
|
|
"epoch": 1.5130936529072347,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004947926053331836,
|
|
"loss": 6.1558,
|
|
"mean_token_accuracy": 0.1542304791510105,
|
|
"num_tokens": 3510875.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.541310834884643,
|
|
"epoch": 1.517532179316467,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004947186657493354,
|
|
"loss": 6.2377,
|
|
"mean_token_accuracy": 0.1494641751050949,
|
|
"num_tokens": 3521798.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 6.438729286193848,
|
|
"epoch": 1.521970705725699,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004946442111599473,
|
|
"loss": 6.2043,
|
|
"mean_token_accuracy": 0.1451006591320038,
|
|
"num_tokens": 3531456.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.580926847457886,
|
|
"epoch": 1.5264092321349312,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004945692417395358,
|
|
"loss": 6.251,
|
|
"mean_token_accuracy": 0.14176156222820283,
|
|
"num_tokens": 3541315.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.448061084747314,
|
|
"epoch": 1.5308477585441633,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.000494493757663824,
|
|
"loss": 6.2238,
|
|
"mean_token_accuracy": 0.14351213127374648,
|
|
"num_tokens": 3552876.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.4509584426879885,
|
|
"epoch": 1.5352862849533955,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004944177591097415,
|
|
"loss": 6.2331,
|
|
"mean_token_accuracy": 0.14354335144162178,
|
|
"num_tokens": 3563967.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 6.457042932510376,
|
|
"epoch": 1.5397248113626276,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004943412462554236,
|
|
"loss": 6.2159,
|
|
"mean_token_accuracy": 0.1507117457687855,
|
|
"num_tokens": 3573510.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.546308755874634,
|
|
"epoch": 1.5441633377718598,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004942642192802114,
|
|
"loss": 6.3099,
|
|
"mean_token_accuracy": 0.13970684260129929,
|
|
"num_tokens": 3584863.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 6.455177211761475,
|
|
"epoch": 1.548601864181092,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004941866783646508,
|
|
"loss": 6.2268,
|
|
"mean_token_accuracy": 0.14618334472179412,
|
|
"num_tokens": 3594489.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.556396770477295,
|
|
"epoch": 1.553040390590324,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004941086236904923,
|
|
"loss": 6.2043,
|
|
"mean_token_accuracy": 0.14727460145950316,
|
|
"num_tokens": 3605159.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.481395721435547,
|
|
"epoch": 1.557478916999556,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004940300554406909,
|
|
"loss": 6.3012,
|
|
"mean_token_accuracy": 0.14313508197665215,
|
|
"num_tokens": 3615254.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 6.445766162872315,
|
|
"epoch": 1.5619174434087881,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000493950973799405,
|
|
"loss": 6.1703,
|
|
"mean_token_accuracy": 0.15018191039562226,
|
|
"num_tokens": 3625015.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.42508454322815,
|
|
"epoch": 1.5663559698180203,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004938713789519967,
|
|
"loss": 6.2497,
|
|
"mean_token_accuracy": 0.1505135826766491,
|
|
"num_tokens": 3636083.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.512313747406006,
|
|
"epoch": 1.5707944962272524,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004937912710850309,
|
|
"loss": 6.166,
|
|
"mean_token_accuracy": 0.1465531922876835,
|
|
"num_tokens": 3646363.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 6.370706844329834,
|
|
"epoch": 1.5752330226364846,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004937106503862749,
|
|
"loss": 6.1685,
|
|
"mean_token_accuracy": 0.1537150263786316,
|
|
"num_tokens": 3656868.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.539106035232544,
|
|
"epoch": 1.5796715490457167,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004936295170446981,
|
|
"loss": 6.3492,
|
|
"mean_token_accuracy": 0.1347063384950161,
|
|
"num_tokens": 3668105.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 6.607371664047241,
|
|
"epoch": 1.5841100754549489,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004935478712504715,
|
|
"loss": 6.2487,
|
|
"mean_token_accuracy": 0.1385604441165924,
|
|
"num_tokens": 3678841.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.4086525440216064,
|
|
"epoch": 1.588548601864181,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004934657131949674,
|
|
"loss": 6.2415,
|
|
"mean_token_accuracy": 0.14987936168909072,
|
|
"num_tokens": 3688603.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 6.529016494750977,
|
|
"epoch": 1.5929871282734132,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004933830430707585,
|
|
"loss": 6.2542,
|
|
"mean_token_accuracy": 0.13600879460573195,
|
|
"num_tokens": 3698312.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.4327093124389645,
|
|
"epoch": 1.5974256546826453,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000493299861071618,
|
|
"loss": 6.1204,
|
|
"mean_token_accuracy": 0.15229299366474153,
|
|
"num_tokens": 3708252.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.483391284942627,
|
|
"epoch": 1.6018641810918774,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004932161673925189,
|
|
"loss": 6.1691,
|
|
"mean_token_accuracy": 0.1462477594614029,
|
|
"num_tokens": 3718431.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 6.433411121368408,
|
|
"epoch": 1.6063027075011096,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004931319622296333,
|
|
"loss": 6.0884,
|
|
"mean_token_accuracy": 0.15784337967634202,
|
|
"num_tokens": 3729170.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.474455261230469,
|
|
"epoch": 1.6107412339103417,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004930472457803324,
|
|
"loss": 6.1861,
|
|
"mean_token_accuracy": 0.1482206791639328,
|
|
"num_tokens": 3738885.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.340183973312378,
|
|
"epoch": 1.6151797603195739,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004929620182431858,
|
|
"loss": 6.1744,
|
|
"mean_token_accuracy": 0.15203531160950662,
|
|
"num_tokens": 3748535.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.444498491287232,
|
|
"epoch": 1.619618286728806,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004928762798179612,
|
|
"loss": 6.237,
|
|
"mean_token_accuracy": 0.14974780827760698,
|
|
"num_tokens": 3758827.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 6.455253171920776,
|
|
"epoch": 1.6240568131380382,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004927900307056233,
|
|
"loss": 6.1615,
|
|
"mean_token_accuracy": 0.1510964810848236,
|
|
"num_tokens": 3768632.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.441723012924195,
|
|
"epoch": 1.6284953395472703,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004927032711083342,
|
|
"loss": 6.214,
|
|
"mean_token_accuracy": 0.14101684093475342,
|
|
"num_tokens": 3779324.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.381724882125854,
|
|
"epoch": 1.6329338659565025,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004926160012294526,
|
|
"loss": 6.1586,
|
|
"mean_token_accuracy": 0.15024627447128297,
|
|
"num_tokens": 3789744.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.370701789855957,
|
|
"epoch": 1.6373723923657346,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000492528221273533,
|
|
"loss": 6.1104,
|
|
"mean_token_accuracy": 0.1493580684065819,
|
|
"num_tokens": 3799831.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 6.542438220977783,
|
|
"epoch": 1.6418109187749668,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004924399314463258,
|
|
"loss": 6.2365,
|
|
"mean_token_accuracy": 0.14592818170785904,
|
|
"num_tokens": 3812102.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.4679584980010985,
|
|
"epoch": 1.646249445184199,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004923511319547761,
|
|
"loss": 6.2914,
|
|
"mean_token_accuracy": 0.13645976781845093,
|
|
"num_tokens": 3822750.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 6.439510631561279,
|
|
"epoch": 1.650687971593431,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000492261823007024,
|
|
"loss": 6.2064,
|
|
"mean_token_accuracy": 0.1489210918545723,
|
|
"num_tokens": 3832354.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.458003902435303,
|
|
"epoch": 1.6551264980026632,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004921720048124034,
|
|
"loss": 6.2224,
|
|
"mean_token_accuracy": 0.1468009516596794,
|
|
"num_tokens": 3842930.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.5039207458496096,
|
|
"epoch": 1.6595650244118954,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004920816775814422,
|
|
"loss": 6.2599,
|
|
"mean_token_accuracy": 0.14020814523100852,
|
|
"num_tokens": 3852952.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.454715347290039,
|
|
"epoch": 1.6640035508211275,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004919908415258612,
|
|
"loss": 6.2067,
|
|
"mean_token_accuracy": 0.14455220550298692,
|
|
"num_tokens": 3863070.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.4132616996765135,
|
|
"epoch": 1.6684420772303596,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000491899496858574,
|
|
"loss": 6.1501,
|
|
"mean_token_accuracy": 0.15156037211418152,
|
|
"num_tokens": 3872767.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 6.3353992938995365,
|
|
"epoch": 1.6728806036395918,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004918076437936859,
|
|
"loss": 6.1056,
|
|
"mean_token_accuracy": 0.15438561514019966,
|
|
"num_tokens": 3883183.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.433599185943604,
|
|
"epoch": 1.677319130048824,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004917152825464947,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.1471118450164795,
|
|
"num_tokens": 3893304.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 6.44781608581543,
|
|
"epoch": 1.681757656458056,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004916224133334885,
|
|
"loss": 6.135,
|
|
"mean_token_accuracy": 0.1504994697868824,
|
|
"num_tokens": 3903786.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.413273906707763,
|
|
"epoch": 1.686196182867288,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004915290363723465,
|
|
"loss": 6.1426,
|
|
"mean_token_accuracy": 0.14888948425650597,
|
|
"num_tokens": 3913703.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.3861230373382565,
|
|
"epoch": 1.6906347092765202,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004914351518819379,
|
|
"loss": 6.197,
|
|
"mean_token_accuracy": 0.14716671407222748,
|
|
"num_tokens": 3923653.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.3618451118469235,
|
|
"epoch": 1.6950732356857523,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004913407600823216,
|
|
"loss": 6.0837,
|
|
"mean_token_accuracy": 0.15539871603250505,
|
|
"num_tokens": 3933915.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.429026556015015,
|
|
"epoch": 1.6995117620949844,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004912458611947454,
|
|
"loss": 6.1613,
|
|
"mean_token_accuracy": 0.14607803374528885,
|
|
"num_tokens": 3943334.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.512318658828735,
|
|
"epoch": 1.7039502885042166,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000491150455441646,
|
|
"loss": 6.2164,
|
|
"mean_token_accuracy": 0.13555126562714576,
|
|
"num_tokens": 3952608.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 6.345305156707764,
|
|
"epoch": 1.7083888149134487,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004910545430466478,
|
|
"loss": 6.123,
|
|
"mean_token_accuracy": 0.1472136050462723,
|
|
"num_tokens": 3963398.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.38430609703064,
|
|
"epoch": 1.7128273413226809,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004909581242345628,
|
|
"loss": 6.1552,
|
|
"mean_token_accuracy": 0.14694450199604034,
|
|
"num_tokens": 3973878.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 6.430195760726929,
|
|
"epoch": 1.717265867731913,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004908611992313905,
|
|
"loss": 6.1648,
|
|
"mean_token_accuracy": 0.13664614632725716,
|
|
"num_tokens": 3983681.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.39329776763916,
|
|
"epoch": 1.7217043941411452,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004907637682643162,
|
|
"loss": 6.201,
|
|
"mean_token_accuracy": 0.14567800536751746,
|
|
"num_tokens": 3995026.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 6.430534839630127,
|
|
"epoch": 1.7261429205503773,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004906658315617112,
|
|
"loss": 6.2022,
|
|
"mean_token_accuracy": 0.14595392793416978,
|
|
"num_tokens": 4005089.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.359121513366699,
|
|
"epoch": 1.7305814469596092,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004905673893531331,
|
|
"loss": 6.1076,
|
|
"mean_token_accuracy": 0.15097568482160567,
|
|
"num_tokens": 4014795.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 6.326131105422974,
|
|
"epoch": 1.7350199733688414,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004904684418693231,
|
|
"loss": 6.1828,
|
|
"mean_token_accuracy": 0.14517654925584794,
|
|
"num_tokens": 4025563.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.499860239028931,
|
|
"epoch": 1.7394584997780735,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004903689893422077,
|
|
"loss": 6.116,
|
|
"mean_token_accuracy": 0.1486818477511406,
|
|
"num_tokens": 4035050.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 6.305110931396484,
|
|
"epoch": 1.7438970261873057,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004902690320048966,
|
|
"loss": 6.1345,
|
|
"mean_token_accuracy": 0.14928318560123444,
|
|
"num_tokens": 4046109.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.449776601791382,
|
|
"epoch": 1.7483355525965378,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000490168570091683,
|
|
"loss": 6.1848,
|
|
"mean_token_accuracy": 0.1390085846185684,
|
|
"num_tokens": 4056776.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.319344854354858,
|
|
"epoch": 1.75277407900577,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004900676038380429,
|
|
"loss": 6.0406,
|
|
"mean_token_accuracy": 0.16621824055910112,
|
|
"num_tokens": 4066326.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.454939699172973,
|
|
"epoch": 1.7572126054150021,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004899661334806342,
|
|
"loss": 6.1759,
|
|
"mean_token_accuracy": 0.15071096420288085,
|
|
"num_tokens": 4077478.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.262599611282349,
|
|
"epoch": 1.7616511318242343,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004898641592572965,
|
|
"loss": 6.1057,
|
|
"mean_token_accuracy": 0.15066718459129333,
|
|
"num_tokens": 4087661.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.442129898071289,
|
|
"epoch": 1.7660896582334664,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004897616814070505,
|
|
"loss": 6.1694,
|
|
"mean_token_accuracy": 0.15258410200476646,
|
|
"num_tokens": 4097450.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.382274055480957,
|
|
"epoch": 1.7705281846426986,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004896587001700972,
|
|
"loss": 6.2003,
|
|
"mean_token_accuracy": 0.14331723377108574,
|
|
"num_tokens": 4106850.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.4386186599731445,
|
|
"epoch": 1.7749667110519307,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004895552157878174,
|
|
"loss": 6.2273,
|
|
"mean_token_accuracy": 0.1446727268397808,
|
|
"num_tokens": 4117561.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 1.7749667110519307,
|
|
"eval_entropy": 6.304367476574315,
|
|
"eval_loss": 6.241267681121826,
|
|
"eval_mean_token_accuracy": 0.14483241421876214,
|
|
"eval_num_tokens": 4117561.0,
|
|
"eval_runtime": 2.0862,
|
|
"eval_samples_per_second": 1613.972,
|
|
"eval_steps_per_second": 201.806,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.513484525680542,
|
|
"epoch": 1.7794052374611629,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004894512285027717,
|
|
"loss": 6.1375,
|
|
"mean_token_accuracy": 0.15294163376092912,
|
|
"num_tokens": 4126913.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.32349796295166,
|
|
"epoch": 1.783843763870395,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004893467385586991,
|
|
"loss": 6.1763,
|
|
"mean_token_accuracy": 0.14652613997459413,
|
|
"num_tokens": 4136501.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.455650901794433,
|
|
"epoch": 1.7882822902796272,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000489241746200517,
|
|
"loss": 6.1304,
|
|
"mean_token_accuracy": 0.14899376183748245,
|
|
"num_tokens": 4147263.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.39251856803894,
|
|
"epoch": 1.7927208166888593,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004891362516743201,
|
|
"loss": 6.1805,
|
|
"mean_token_accuracy": 0.1439195953309536,
|
|
"num_tokens": 4159251.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.375892972946167,
|
|
"epoch": 1.7971593430980914,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004890302552273805,
|
|
"loss": 6.1605,
|
|
"mean_token_accuracy": 0.14276045113801955,
|
|
"num_tokens": 4170601.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.455142402648926,
|
|
"epoch": 1.8015978695073236,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004889237571081465,
|
|
"loss": 6.1291,
|
|
"mean_token_accuracy": 0.1502329871058464,
|
|
"num_tokens": 4181650.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.3142640590667725,
|
|
"epoch": 1.8060363959165557,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004888167575662425,
|
|
"loss": 6.0242,
|
|
"mean_token_accuracy": 0.1540951281785965,
|
|
"num_tokens": 4191514.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.364542388916016,
|
|
"epoch": 1.8104749223257879,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004887092568524682,
|
|
"loss": 6.1543,
|
|
"mean_token_accuracy": 0.1545771673321724,
|
|
"num_tokens": 4200909.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.418929243087769,
|
|
"epoch": 1.81491344873502,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004886012552187979,
|
|
"loss": 6.0958,
|
|
"mean_token_accuracy": 0.1500440776348114,
|
|
"num_tokens": 4211139.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.353375577926636,
|
|
"epoch": 1.8193519751442522,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.0004884927529183799,
|
|
"loss": 6.1404,
|
|
"mean_token_accuracy": 0.1507970094680786,
|
|
"num_tokens": 4221754.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.401797246932984,
|
|
"epoch": 1.8237905015534843,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004883837502055363,
|
|
"loss": 6.0354,
|
|
"mean_token_accuracy": 0.15554228723049163,
|
|
"num_tokens": 4232771.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.274783992767334,
|
|
"epoch": 1.8282290279627165,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004882742473357619,
|
|
"loss": 6.047,
|
|
"mean_token_accuracy": 0.162461756169796,
|
|
"num_tokens": 4242860.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.384546136856079,
|
|
"epoch": 1.8326675543719486,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00048816424456572403,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.1450534589588642,
|
|
"num_tokens": 4253442.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.373266220092773,
|
|
"epoch": 1.8371060807811808,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004880537421532618,
|
|
"loss": 6.1037,
|
|
"mean_token_accuracy": 0.14555230140686035,
|
|
"num_tokens": 4263856.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.2938440322875975,
|
|
"epoch": 1.841544607190413,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00048794274035738515,
|
|
"loss": 6.0456,
|
|
"mean_token_accuracy": 0.158289635181427,
|
|
"num_tokens": 4274251.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 6.333366107940674,
|
|
"epoch": 1.845983133599645,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004878312394382747,
|
|
"loss": 6.0724,
|
|
"mean_token_accuracy": 0.15534539371728898,
|
|
"num_tokens": 4283486.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.355884695053101,
|
|
"epoch": 1.8504216600088772,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000487719239657281,
|
|
"loss": 6.168,
|
|
"mean_token_accuracy": 0.14514408335089685,
|
|
"num_tokens": 4293908.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 6.315519952774048,
|
|
"epoch": 1.8548601864181093,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000487606741276924,
|
|
"loss": 6.0074,
|
|
"mean_token_accuracy": 0.15041493326425553,
|
|
"num_tokens": 4303255.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.367549180984497,
|
|
"epoch": 1.8592987128273413,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004874937445608921,
|
|
"loss": 6.222,
|
|
"mean_token_accuracy": 0.14236995279788972,
|
|
"num_tokens": 4313981.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 6.414429569244385,
|
|
"epoch": 1.8637372392365734,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004873802497740418,
|
|
"loss": 6.1659,
|
|
"mean_token_accuracy": 0.1489059269428253,
|
|
"num_tokens": 4325010.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.336979866027832,
|
|
"epoch": 1.8681757656458056,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004872662571823973,
|
|
"loss": 6.142,
|
|
"mean_token_accuracy": 0.15032578706741334,
|
|
"num_tokens": 4336279.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.276753234863281,
|
|
"epoch": 1.8726142920550377,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00048715176705314936,
|
|
"loss": 6.0886,
|
|
"mean_token_accuracy": 0.15055317282676697,
|
|
"num_tokens": 4345816.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.390111589431763,
|
|
"epoch": 1.8770528184642699,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00048703677965465506,
|
|
"loss": 6.1546,
|
|
"mean_token_accuracy": 0.14694484174251557,
|
|
"num_tokens": 4356520.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.38926854133606,
|
|
"epoch": 1.881491344873502,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048692129525643694,
|
|
"loss": 6.0455,
|
|
"mean_token_accuracy": 0.15440051704645158,
|
|
"num_tokens": 4367517.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 6.319567394256592,
|
|
"epoch": 1.8859298712827341,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00048680531412918267,
|
|
"loss": 6.1221,
|
|
"mean_token_accuracy": 0.14795979335904122,
|
|
"num_tokens": 4378043.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.339055061340332,
|
|
"epoch": 1.8903683976919663,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004866888365447439,
|
|
"loss": 6.1116,
|
|
"mean_token_accuracy": 0.15579188615083694,
|
|
"num_tokens": 4388098.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.342102432250977,
|
|
"epoch": 1.8948069241011984,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004865718627761363,
|
|
"loss": 6.0351,
|
|
"mean_token_accuracy": 0.16426317244768143,
|
|
"num_tokens": 4397745.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.255016899108886,
|
|
"epoch": 1.8992454505104306,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004864543930975383,
|
|
"loss": 6.1125,
|
|
"mean_token_accuracy": 0.1508719764649868,
|
|
"num_tokens": 4407995.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.372575426101685,
|
|
"epoch": 1.9036839769196625,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004863364277842908,
|
|
"loss": 6.0864,
|
|
"mean_token_accuracy": 0.1544354021549225,
|
|
"num_tokens": 4417574.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 6.287673425674439,
|
|
"epoch": 1.9081225033288947,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004862179671128965,
|
|
"loss": 6.0029,
|
|
"mean_token_accuracy": 0.1653035208582878,
|
|
"num_tokens": 4428772.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.284837818145752,
|
|
"epoch": 1.9125610297381268,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000486099011361019,
|
|
"loss": 6.0921,
|
|
"mean_token_accuracy": 0.156430184841156,
|
|
"num_tokens": 4438971.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.439360094070435,
|
|
"epoch": 1.916999556147359,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00048597956080748264,
|
|
"loss": 6.2184,
|
|
"mean_token_accuracy": 0.147563187032938,
|
|
"num_tokens": 4449685.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.310244178771972,
|
|
"epoch": 1.921438082556591,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048585961573227116,
|
|
"loss": 6.1103,
|
|
"mean_token_accuracy": 0.15256588608026506,
|
|
"num_tokens": 4460260.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.324094629287719,
|
|
"epoch": 1.9258766089658232,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004857391764165277,
|
|
"loss": 6.0654,
|
|
"mean_token_accuracy": 0.15756789296865464,
|
|
"num_tokens": 4471149.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.27415452003479,
|
|
"epoch": 1.9303151353750554,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048561824314255383,
|
|
"loss": 6.0969,
|
|
"mean_token_accuracy": 0.15434358417987823,
|
|
"num_tokens": 4481506.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.373397016525269,
|
|
"epoch": 1.9347536617842875,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048549681619380886,
|
|
"loss": 6.1389,
|
|
"mean_token_accuracy": 0.14398213624954223,
|
|
"num_tokens": 4492541.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 6.348176717758179,
|
|
"epoch": 1.9391921881935197,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004853748958549092,
|
|
"loss": 6.0879,
|
|
"mean_token_accuracy": 0.15113953053951262,
|
|
"num_tokens": 4502727.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.243179750442505,
|
|
"epoch": 1.9436307146027518,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004852524824116278,
|
|
"loss": 6.1136,
|
|
"mean_token_accuracy": 0.14689265042543412,
|
|
"num_tokens": 4512657.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.332787084579468,
|
|
"epoch": 1.948069241011984,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00048512957615089354,
|
|
"loss": 5.9777,
|
|
"mean_token_accuracy": 0.15856263190507888,
|
|
"num_tokens": 4522083.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 6.226612901687622,
|
|
"epoch": 1.9525077674212161,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004850061773607902,
|
|
"loss": 6.0255,
|
|
"mean_token_accuracy": 0.1586281806230545,
|
|
"num_tokens": 4531882.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.2661069393157955,
|
|
"epoch": 1.9569462938304483,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000484882286330556,
|
|
"loss": 6.0668,
|
|
"mean_token_accuracy": 0.15751879066228866,
|
|
"num_tokens": 4541724.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.290356159210205,
|
|
"epoch": 1.9613848202396804,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004847579033505833,
|
|
"loss": 6.0823,
|
|
"mean_token_accuracy": 0.1551389679312706,
|
|
"num_tokens": 4551889.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.299551630020142,
|
|
"epoch": 1.9658233466489126,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004846330287124171,
|
|
"loss": 6.1149,
|
|
"mean_token_accuracy": 0.1571243390440941,
|
|
"num_tokens": 4561792.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.349295568466187,
|
|
"epoch": 1.9702618730581447,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048450766270875513,
|
|
"loss": 6.0104,
|
|
"mean_token_accuracy": 0.1578826203942299,
|
|
"num_tokens": 4572021.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.304033708572388,
|
|
"epoch": 1.9747003994673769,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048438180563344666,
|
|
"loss": 6.0659,
|
|
"mean_token_accuracy": 0.15220063626766206,
|
|
"num_tokens": 4582800.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.356626272201538,
|
|
"epoch": 1.979138925876609,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00048425545778149213,
|
|
"loss": 6.1376,
|
|
"mean_token_accuracy": 0.1478087991476059,
|
|
"num_tokens": 4593035.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.293792295455932,
|
|
"epoch": 1.9835774522858411,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004841286194490423,
|
|
"loss": 6.0004,
|
|
"mean_token_accuracy": 0.1586893692612648,
|
|
"num_tokens": 4602625.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 6.298813009262085,
|
|
"epoch": 1.9880159786950733,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00048400129093339745,
|
|
"loss": 6.0939,
|
|
"mean_token_accuracy": 0.15187210515141486,
|
|
"num_tokens": 4613419.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.2934352397918705,
|
|
"epoch": 1.9924545051043054,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00048387347253300703,
|
|
"loss": 6.0592,
|
|
"mean_token_accuracy": 0.15442992970347405,
|
|
"num_tokens": 4622575.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.2924830436706545,
|
|
"epoch": 1.9968930315135376,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004837451645474685,
|
|
"loss": 6.0589,
|
|
"mean_token_accuracy": 0.15284667909145355,
|
|
"num_tokens": 4632497.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 6.336415661705865,
|
|
"epoch": 2.0008877052818463,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048361636727752716,
|
|
"loss": 6.0301,
|
|
"mean_token_accuracy": 0.15711821946832868,
|
|
"num_tokens": 4641305.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.320528984069824,
|
|
"epoch": 2.0053262316910785,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000483487081025075,
|
|
"loss": 5.826,
|
|
"mean_token_accuracy": 0.16330702155828475,
|
|
"num_tokens": 4650986.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.267225694656372,
|
|
"epoch": 2.0097647581003106,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048335730609315,
|
|
"loss": 5.7919,
|
|
"mean_token_accuracy": 0.165120992064476,
|
|
"num_tokens": 4661836.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.285591506958008,
|
|
"epoch": 2.014203284509543,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048322704278593595,
|
|
"loss": 5.7822,
|
|
"mean_token_accuracy": 0.1718212589621544,
|
|
"num_tokens": 4671325.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.2631378173828125,
|
|
"epoch": 2.018641810918775,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048309629140876097,
|
|
"loss": 5.7983,
|
|
"mean_token_accuracy": 0.16487672328948974,
|
|
"num_tokens": 4682334.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.278176546096802,
|
|
"epoch": 2.023080337328007,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004829650522680974,
|
|
"loss": 5.8037,
|
|
"mean_token_accuracy": 0.16945539861917497,
|
|
"num_tokens": 4691486.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 6.2450908660888675,
|
|
"epoch": 2.027518863737239,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004828333256715609,
|
|
"loss": 5.7808,
|
|
"mean_token_accuracy": 0.1654707446694374,
|
|
"num_tokens": 4700841.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.16944465637207,
|
|
"epoch": 2.0319573901464714,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004827011119279096,
|
|
"loss": 5.7364,
|
|
"mean_token_accuracy": 0.17380234599113464,
|
|
"num_tokens": 4709842.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.2213818550109865,
|
|
"epoch": 2.0363959165557035,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048256841134704335,
|
|
"loss": 5.7495,
|
|
"mean_token_accuracy": 0.1679978162050247,
|
|
"num_tokens": 4720193.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.182414245605469,
|
|
"epoch": 2.0408344429649357,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048243522424000333,
|
|
"loss": 5.8063,
|
|
"mean_token_accuracy": 0.1693178117275238,
|
|
"num_tokens": 4729503.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 6.248026180267334,
|
|
"epoch": 2.045272969374168,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000482301550918971,
|
|
"loss": 5.7874,
|
|
"mean_token_accuracy": 0.17118435055017472,
|
|
"num_tokens": 4740241.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.120760440826416,
|
|
"epoch": 2.0497114957834,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004821673916972676,
|
|
"loss": 5.676,
|
|
"mean_token_accuracy": 0.18444487154483796,
|
|
"num_tokens": 4749616.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 6.1944496631622314,
|
|
"epoch": 2.054150022192632,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000482032746889353,
|
|
"loss": 5.7767,
|
|
"mean_token_accuracy": 0.16697147488594055,
|
|
"num_tokens": 4759846.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 6.24187216758728,
|
|
"epoch": 2.0585885486018642,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048189761681082557,
|
|
"loss": 5.8296,
|
|
"mean_token_accuracy": 0.16175905466079712,
|
|
"num_tokens": 4769441.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.2141406536102295,
|
|
"epoch": 2.0630270750110964,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004817620017784209,
|
|
"loss": 5.7617,
|
|
"mean_token_accuracy": 0.16938935965299606,
|
|
"num_tokens": 4779962.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.242314195632934,
|
|
"epoch": 2.0674656014203285,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048162590211001143,
|
|
"loss": 5.8326,
|
|
"mean_token_accuracy": 0.16407378911972045,
|
|
"num_tokens": 4790275.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.061077022552491,
|
|
"epoch": 2.0719041278295607,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00048148931812460536,
|
|
"loss": 5.7234,
|
|
"mean_token_accuracy": 0.17769070863723754,
|
|
"num_tokens": 4800799.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 6.300735187530518,
|
|
"epoch": 2.076342654238793,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004813522501423464,
|
|
"loss": 5.8311,
|
|
"mean_token_accuracy": 0.16275566965341567,
|
|
"num_tokens": 4811786.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.152251577377319,
|
|
"epoch": 2.080781180648025,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004812146984845124,
|
|
"loss": 5.7383,
|
|
"mean_token_accuracy": 0.17451401948928832,
|
|
"num_tokens": 4821321.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.21392674446106,
|
|
"epoch": 2.085219707057257,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048107666347351505,
|
|
"loss": 5.7691,
|
|
"mean_token_accuracy": 0.17131485641002656,
|
|
"num_tokens": 4831418.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 6.152781057357788,
|
|
"epoch": 2.0896582334664893,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00048093814543289894,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.1736764594912529,
|
|
"num_tokens": 4843326.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.162942695617676,
|
|
"epoch": 2.0940967598757214,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00048079914468734117,
|
|
"loss": 5.7209,
|
|
"mean_token_accuracy": 0.17366211116313934,
|
|
"num_tokens": 4853946.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 6.194116878509521,
|
|
"epoch": 2.0985352862849536,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048065966156264964,
|
|
"loss": 5.761,
|
|
"mean_token_accuracy": 0.1711730867624283,
|
|
"num_tokens": 4863494.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 6.145648765563965,
|
|
"epoch": 2.1029738126941857,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00048051969638576345,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.16969802528619765,
|
|
"num_tokens": 4872583.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 6.198772192001343,
|
|
"epoch": 2.107412339103418,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00048037924948475134,
|
|
"loss": 5.6999,
|
|
"mean_token_accuracy": 0.18126114159822465,
|
|
"num_tokens": 4882333.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.133423471450806,
|
|
"epoch": 2.11185086551265,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004802383211888114,
|
|
"loss": 5.8388,
|
|
"mean_token_accuracy": 0.16247562766075135,
|
|
"num_tokens": 4892874.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.190569829940796,
|
|
"epoch": 2.116289391921882,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004800969118282697,
|
|
"loss": 5.7077,
|
|
"mean_token_accuracy": 0.17178617119789125,
|
|
"num_tokens": 4903666.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.148941993713379,
|
|
"epoch": 2.120727918331114,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004799550217345803,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.16479915231466294,
|
|
"num_tokens": 4913565.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 6.25219759941101,
|
|
"epoch": 2.125166444740346,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047981265124032375,
|
|
"loss": 5.8806,
|
|
"mean_token_accuracy": 0.16119145303964616,
|
|
"num_tokens": 4924664.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.1365477561950685,
|
|
"epoch": 2.129604971149578,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047966980067920686,
|
|
"loss": 5.787,
|
|
"mean_token_accuracy": 0.16446771174669267,
|
|
"num_tokens": 4935361.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 6.212709236145019,
|
|
"epoch": 2.1340434975588103,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00047952647038606157,
|
|
"loss": 5.7139,
|
|
"mean_token_accuracy": 0.1764111801981926,
|
|
"num_tokens": 4946954.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 6.166495609283447,
|
|
"epoch": 2.1384820239680424,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004793826606968443,
|
|
"loss": 5.8285,
|
|
"mean_token_accuracy": 0.1607503190636635,
|
|
"num_tokens": 4957497.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.101367950439453,
|
|
"epoch": 2.1429205503772746,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000479238371948635,
|
|
"loss": 5.7757,
|
|
"mean_token_accuracy": 0.16357363164424896,
|
|
"num_tokens": 4968069.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 6.219218921661377,
|
|
"epoch": 2.1473590767865067,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004790936044796369,
|
|
"loss": 5.7844,
|
|
"mean_token_accuracy": 0.17338328510522844,
|
|
"num_tokens": 4978417.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.17771635055542,
|
|
"epoch": 2.151797603195739,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047894835862917473,
|
|
"loss": 5.7621,
|
|
"mean_token_accuracy": 0.16970881968736648,
|
|
"num_tokens": 4989670.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.143991899490357,
|
|
"epoch": 2.156236129604971,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00047880263473769514,
|
|
"loss": 5.8096,
|
|
"mean_token_accuracy": 0.16401513367891313,
|
|
"num_tokens": 5000346.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 6.209756994247437,
|
|
"epoch": 2.160674656014203,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004786564331467648,
|
|
"loss": 5.7988,
|
|
"mean_token_accuracy": 0.16377755850553513,
|
|
"num_tokens": 5011878.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.224458789825439,
|
|
"epoch": 2.1651131824234353,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047850975419907034,
|
|
"loss": 5.8718,
|
|
"mean_token_accuracy": 0.162304849922657,
|
|
"num_tokens": 5022939.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 6.232002401351929,
|
|
"epoch": 2.1695517088326675,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00047836259823841716,
|
|
"loss": 5.7963,
|
|
"mean_token_accuracy": 0.1669462203979492,
|
|
"num_tokens": 5033613.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.125792789459228,
|
|
"epoch": 2.1739902352418996,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004782149656097287,
|
|
"loss": 5.7654,
|
|
"mean_token_accuracy": 0.1679580643773079,
|
|
"num_tokens": 5043926.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.151848697662354,
|
|
"epoch": 2.1784287616511318,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047806685665904586,
|
|
"loss": 5.8006,
|
|
"mean_token_accuracy": 0.17178182303905487,
|
|
"num_tokens": 5054179.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 6.080358839035034,
|
|
"epoch": 2.182867288060364,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004779182717335258,
|
|
"loss": 5.7625,
|
|
"mean_token_accuracy": 0.16996095776557923,
|
|
"num_tokens": 5063654.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 6.169263648986816,
|
|
"epoch": 2.187305814469596,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047776921118144154,
|
|
"loss": 5.8695,
|
|
"mean_token_accuracy": 0.1624024137854576,
|
|
"num_tokens": 5073558.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 6.250872087478638,
|
|
"epoch": 2.191744340878828,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00047761967535218084,
|
|
"loss": 5.8175,
|
|
"mean_token_accuracy": 0.16334515810012817,
|
|
"num_tokens": 5083218.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 6.116773986816407,
|
|
"epoch": 2.1961828672880603,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004774696645962453,
|
|
"loss": 5.7848,
|
|
"mean_token_accuracy": 0.17051488161087036,
|
|
"num_tokens": 5093037.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 6.085236072540283,
|
|
"epoch": 2.2006213936972925,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004773191792652501,
|
|
"loss": 5.7379,
|
|
"mean_token_accuracy": 0.17253995835781097,
|
|
"num_tokens": 5103434.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.203386831283569,
|
|
"epoch": 2.2050599201065246,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004771682197119224,
|
|
"loss": 5.8513,
|
|
"mean_token_accuracy": 0.16081491261720657,
|
|
"num_tokens": 5113325.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 6.135442781448364,
|
|
"epoch": 2.2094984465157568,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00047701678629010115,
|
|
"loss": 5.812,
|
|
"mean_token_accuracy": 0.16577334851026534,
|
|
"num_tokens": 5124957.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 6.2259856224060055,
|
|
"epoch": 2.213936972924989,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004768648793547359,
|
|
"loss": 5.7559,
|
|
"mean_token_accuracy": 0.17162533700466157,
|
|
"num_tokens": 5134491.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.040803050994873,
|
|
"epoch": 2.218375499334221,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004767124992618863,
|
|
"loss": 5.7236,
|
|
"mean_token_accuracy": 0.17656566202640533,
|
|
"num_tokens": 5145063.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"epoch": 2.218375499334221,
|
|
"eval_entropy": 5.758825140157958,
|
|
"eval_loss": 6.117055416107178,
|
|
"eval_mean_token_accuracy": 0.15501565050838112,
|
|
"eval_num_tokens": 5145063.0,
|
|
"eval_runtime": 2.0862,
|
|
"eval_samples_per_second": 1613.95,
|
|
"eval_steps_per_second": 201.804,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 6.138974285125732,
|
|
"epoch": 2.222814025743453,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004765596463687207,
|
|
"loss": 5.839,
|
|
"mean_token_accuracy": 0.16339409202337266,
|
|
"num_tokens": 5155396.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 6.151093578338623,
|
|
"epoch": 2.2272525521526854,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00047640632103351576,
|
|
"loss": 5.7831,
|
|
"mean_token_accuracy": 0.16532318145036698,
|
|
"num_tokens": 5166499.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 6.171177387237549,
|
|
"epoch": 2.2316910785619175,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00047625252361565586,
|
|
"loss": 5.8143,
|
|
"mean_token_accuracy": 0.1652636408805847,
|
|
"num_tokens": 5177530.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 6.115115642547607,
|
|
"epoch": 2.2361296049711497,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047609825447563137,
|
|
"loss": 5.6925,
|
|
"mean_token_accuracy": 0.1710483983159065,
|
|
"num_tokens": 5187427.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 6.033501386642456,
|
|
"epoch": 2.240568131380382,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004759435139750388,
|
|
"loss": 5.6936,
|
|
"mean_token_accuracy": 0.17407233715057374,
|
|
"num_tokens": 5198888.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 6.088896322250366,
|
|
"epoch": 2.245006657789614,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00047578830247657915,
|
|
"loss": 5.6968,
|
|
"mean_token_accuracy": 0.17464374303817748,
|
|
"num_tokens": 5208463.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 6.135959005355835,
|
|
"epoch": 2.249445184198846,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00047563262034405773,
|
|
"loss": 5.8129,
|
|
"mean_token_accuracy": 0.16065521836280822,
|
|
"num_tokens": 5219989.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 6.196387863159179,
|
|
"epoch": 2.2538837106080782,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00047547646794238277,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.16879613399505616,
|
|
"num_tokens": 5231443.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 6.069067049026489,
|
|
"epoch": 2.2583222370173104,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004753198456375647,
|
|
"loss": 5.7687,
|
|
"mean_token_accuracy": 0.17048330157995223,
|
|
"num_tokens": 5241633.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 6.197365951538086,
|
|
"epoch": 2.2627607634265425,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004751627537967158,
|
|
"loss": 5.7616,
|
|
"mean_token_accuracy": 0.17182915061712264,
|
|
"num_tokens": 5252486.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 6.106606483459473,
|
|
"epoch": 2.2671992898357747,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047500519278804835,
|
|
"loss": 5.7842,
|
|
"mean_token_accuracy": 0.16441592425107956,
|
|
"num_tokens": 5262672.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 6.161299324035644,
|
|
"epoch": 2.271637816245007,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004748471629808746,
|
|
"loss": 5.7257,
|
|
"mean_token_accuracy": 0.1692223384976387,
|
|
"num_tokens": 5273547.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 6.044488430023193,
|
|
"epoch": 2.276076342654239,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047468866474560575,
|
|
"loss": 5.7477,
|
|
"mean_token_accuracy": 0.1677919000387192,
|
|
"num_tokens": 5284935.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 6.1366087913513185,
|
|
"epoch": 2.280514869063471,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047452969845375074,
|
|
"loss": 5.7731,
|
|
"mean_token_accuracy": 0.17664981484413148,
|
|
"num_tokens": 5295237.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 6.143746471405029,
|
|
"epoch": 2.2849533954727033,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004743702644779157,
|
|
"loss": 5.8109,
|
|
"mean_token_accuracy": 0.16415809839963913,
|
|
"num_tokens": 5305288.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 6.148390245437622,
|
|
"epoch": 2.2893919218819354,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000474210363191803,
|
|
"loss": 5.7359,
|
|
"mean_token_accuracy": 0.1691213622689247,
|
|
"num_tokens": 5316031.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 6.067453241348266,
|
|
"epoch": 2.2938304482911676,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004740499949702103,
|
|
"loss": 5.7778,
|
|
"mean_token_accuracy": 0.16342108249664306,
|
|
"num_tokens": 5327544.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 6.038386487960816,
|
|
"epoch": 2.2982689747003997,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004738891601890298,
|
|
"loss": 5.718,
|
|
"mean_token_accuracy": 0.17032305002212525,
|
|
"num_tokens": 5338282.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 6.144178962707519,
|
|
"epoch": 2.302707501109632,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004737278592252473,
|
|
"loss": 5.7589,
|
|
"mean_token_accuracy": 0.17450494766235353,
|
|
"num_tokens": 5348300.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 6.15695972442627,
|
|
"epoch": 2.3071460275188636,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004735660924569411,
|
|
"loss": 5.8636,
|
|
"mean_token_accuracy": 0.16162828356027603,
|
|
"num_tokens": 5360193.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 6.121260452270508,
|
|
"epoch": 2.3115845539280957,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004734038602632815,
|
|
"loss": 5.7297,
|
|
"mean_token_accuracy": 0.1731833279132843,
|
|
"num_tokens": 5369655.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.111371564865112,
|
|
"epoch": 2.316023080337328,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047324116302452975,
|
|
"loss": 5.792,
|
|
"mean_token_accuracy": 0.16499196141958236,
|
|
"num_tokens": 5379654.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 6.121448135375976,
|
|
"epoch": 2.32046160674656,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004730780011220369,
|
|
"loss": 5.7201,
|
|
"mean_token_accuracy": 0.17435721009969712,
|
|
"num_tokens": 5389527.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.137268733978272,
|
|
"epoch": 2.324900133155792,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004729143749382435,
|
|
"loss": 5.8075,
|
|
"mean_token_accuracy": 0.1641774520277977,
|
|
"num_tokens": 5399480.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 6.093860912322998,
|
|
"epoch": 2.3293386595650243,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047275028485667793,
|
|
"loss": 5.6667,
|
|
"mean_token_accuracy": 0.17897211164236068,
|
|
"num_tokens": 5410065.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 6.025512218475342,
|
|
"epoch": 2.3337771859742564,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004725857312619563,
|
|
"loss": 5.7156,
|
|
"mean_token_accuracy": 0.17173065543174743,
|
|
"num_tokens": 5419519.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 6.155104923248291,
|
|
"epoch": 2.3382157123834886,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004724207145397809,
|
|
"loss": 5.7943,
|
|
"mean_token_accuracy": 0.1667987123131752,
|
|
"num_tokens": 5429907.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 6.147578144073487,
|
|
"epoch": 2.3426542387927207,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004722552350769397,
|
|
"loss": 5.7846,
|
|
"mean_token_accuracy": 0.1689673498272896,
|
|
"num_tokens": 5440051.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 6.044529819488526,
|
|
"epoch": 2.347092765201953,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047208929326130535,
|
|
"loss": 5.7874,
|
|
"mean_token_accuracy": 0.16316695511341095,
|
|
"num_tokens": 5452596.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 6.1003374576568605,
|
|
"epoch": 2.351531291611185,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00047192288948183394,
|
|
"loss": 5.8084,
|
|
"mean_token_accuracy": 0.15916725099086762,
|
|
"num_tokens": 5463133.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 6.074586248397827,
|
|
"epoch": 2.355969818020417,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00047175602412856453,
|
|
"loss": 5.7162,
|
|
"mean_token_accuracy": 0.17868943214416505,
|
|
"num_tokens": 5473934.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 6.048851585388183,
|
|
"epoch": 2.3604083444296493,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047158869759261843,
|
|
"loss": 5.7626,
|
|
"mean_token_accuracy": 0.1687912866473198,
|
|
"num_tokens": 5483921.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 6.145990705490112,
|
|
"epoch": 2.3648468708388815,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004714209102661973,
|
|
"loss": 5.7686,
|
|
"mean_token_accuracy": 0.16941458731889725,
|
|
"num_tokens": 5494218.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 6.121583032608032,
|
|
"epoch": 2.3692853972481136,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004712526625425832,
|
|
"loss": 5.811,
|
|
"mean_token_accuracy": 0.1643875315785408,
|
|
"num_tokens": 5504942.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 6.102924728393555,
|
|
"epoch": 2.3737239236573457,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047108395481613736,
|
|
"loss": 5.8558,
|
|
"mean_token_accuracy": 0.15613222420215606,
|
|
"num_tokens": 5514624.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 6.14481372833252,
|
|
"epoch": 2.378162450066578,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047091478748229927,
|
|
"loss": 5.6984,
|
|
"mean_token_accuracy": 0.17392003685235977,
|
|
"num_tokens": 5524098.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 6.04828372001648,
|
|
"epoch": 2.38260097647581,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004707451609375854,
|
|
"loss": 5.7557,
|
|
"mean_token_accuracy": 0.1692517578601837,
|
|
"num_tokens": 5534585.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 6.10555362701416,
|
|
"epoch": 2.387039502885042,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004705750755795889,
|
|
"loss": 5.7966,
|
|
"mean_token_accuracy": 0.168571537733078,
|
|
"num_tokens": 5544136.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 6.117819595336914,
|
|
"epoch": 2.3914780292942743,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00047040453180697823,
|
|
"loss": 5.691,
|
|
"mean_token_accuracy": 0.1738590866327286,
|
|
"num_tokens": 5554939.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 6.123975086212158,
|
|
"epoch": 2.3959165557035065,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004702335300194963,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.16760747879743576,
|
|
"num_tokens": 5564533.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 6.117423820495605,
|
|
"epoch": 2.4003550821127386,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004700620706179596,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.16853979229927063,
|
|
"num_tokens": 5575140.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 6.141474914550781,
|
|
"epoch": 2.4047936085219708,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004698901540042573,
|
|
"loss": 5.7775,
|
|
"mean_token_accuracy": 0.16901845932006837,
|
|
"num_tokens": 5585399.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 6.079065132141113,
|
|
"epoch": 2.409232134931203,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046971778058135024,
|
|
"loss": 5.6638,
|
|
"mean_token_accuracy": 0.18335538804531099,
|
|
"num_tokens": 5596194.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 6.042174386978149,
|
|
"epoch": 2.413670661340435,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046954495075326986,
|
|
"loss": 5.8439,
|
|
"mean_token_accuracy": 0.16659024804830552,
|
|
"num_tokens": 5608317.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 6.13245415687561,
|
|
"epoch": 2.418109187749667,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046937166492511746,
|
|
"loss": 5.725,
|
|
"mean_token_accuracy": 0.1753625452518463,
|
|
"num_tokens": 5617777.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 6.06634931564331,
|
|
"epoch": 2.4225477141588994,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046919792350306317,
|
|
"loss": 5.7311,
|
|
"mean_token_accuracy": 0.1771342933177948,
|
|
"num_tokens": 5628056.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 5.94120683670044,
|
|
"epoch": 2.4269862405681315,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004690237268943451,
|
|
"loss": 5.7222,
|
|
"mean_token_accuracy": 0.17666102647781373,
|
|
"num_tokens": 5638073.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 6.103239822387695,
|
|
"epoch": 2.4314247669773636,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046884907550726816,
|
|
"loss": 5.6812,
|
|
"mean_token_accuracy": 0.1819820836186409,
|
|
"num_tokens": 5647290.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 6.077079916000367,
|
|
"epoch": 2.435863293386596,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00046867396975120324,
|
|
"loss": 5.7744,
|
|
"mean_token_accuracy": 0.16964205503463745,
|
|
"num_tokens": 5656882.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 6.1173424243927,
|
|
"epoch": 2.440301819795828,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004684984100365863,
|
|
"loss": 5.8316,
|
|
"mean_token_accuracy": 0.16495220363140106,
|
|
"num_tokens": 5667803.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 6.142762899398804,
|
|
"epoch": 2.44474034620506,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00046832239677491736,
|
|
"loss": 5.7461,
|
|
"mean_token_accuracy": 0.1722828820347786,
|
|
"num_tokens": 5678319.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 6.022468090057373,
|
|
"epoch": 2.4491788726142922,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004681459303787594,
|
|
"loss": 5.7948,
|
|
"mean_token_accuracy": 0.16484333127737044,
|
|
"num_tokens": 5688677.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 6.150290822982788,
|
|
"epoch": 2.4536173990235244,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004679690112617376,
|
|
"loss": 5.8075,
|
|
"mean_token_accuracy": 0.16610533744096756,
|
|
"num_tokens": 5699538.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 6.095004320144653,
|
|
"epoch": 2.458055925432756,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004677916398385383,
|
|
"loss": 5.6928,
|
|
"mean_token_accuracy": 0.18449453860521317,
|
|
"num_tokens": 5709461.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 6.063209056854248,
|
|
"epoch": 2.4624944518419882,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000467613816524908,
|
|
"loss": 5.7058,
|
|
"mean_token_accuracy": 0.17079256027936934,
|
|
"num_tokens": 5718220.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 6.105566453933716,
|
|
"epoch": 2.4669329782512204,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004674355417376524,
|
|
"loss": 5.7678,
|
|
"mean_token_accuracy": 0.16715284287929535,
|
|
"num_tokens": 5728638.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 6.0401427268981935,
|
|
"epoch": 2.4713715046604525,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00046725681589463537,
|
|
"loss": 5.7113,
|
|
"mean_token_accuracy": 0.17297857254743576,
|
|
"num_tokens": 5738854.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 6.040780830383301,
|
|
"epoch": 2.4758100310696847,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046707763941477817,
|
|
"loss": 5.6819,
|
|
"mean_token_accuracy": 0.1767168715596199,
|
|
"num_tokens": 5748624.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 6.007115411758423,
|
|
"epoch": 2.480248557478917,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004668980127180582,
|
|
"loss": 5.7215,
|
|
"mean_token_accuracy": 0.17497175931930542,
|
|
"num_tokens": 5759846.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 6.1033079624176025,
|
|
"epoch": 2.484687083888149,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004667179362255081,
|
|
"loss": 5.7512,
|
|
"mean_token_accuracy": 0.17809866815805436,
|
|
"num_tokens": 5769983.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 6.070840358734131,
|
|
"epoch": 2.489125610297381,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004665374103592149,
|
|
"loss": 5.7566,
|
|
"mean_token_accuracy": 0.1682102620601654,
|
|
"num_tokens": 5780691.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 6.047124242782592,
|
|
"epoch": 2.4935641367066133,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004663564355423189,
|
|
"loss": 5.6824,
|
|
"mean_token_accuracy": 0.17610101848840715,
|
|
"num_tokens": 5790690.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 6.104051399230957,
|
|
"epoch": 2.4980026631158454,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004661750121990128,
|
|
"loss": 5.7507,
|
|
"mean_token_accuracy": 0.17295027673244476,
|
|
"num_tokens": 5801088.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.899098825454712,
|
|
"epoch": 2.5024411895250775,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00046599314075454034,
|
|
"loss": 5.6632,
|
|
"mean_token_accuracy": 0.17894352227449417,
|
|
"num_tokens": 5811451.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 6.042473268508911,
|
|
"epoch": 2.5068797159343097,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00046581082163519585,
|
|
"loss": 5.6985,
|
|
"mean_token_accuracy": 0.1734083727002144,
|
|
"num_tokens": 5822024.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 5.998702621459961,
|
|
"epoch": 2.511318242343542,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046562805526832284,
|
|
"loss": 5.7612,
|
|
"mean_token_accuracy": 0.1688615247607231,
|
|
"num_tokens": 5831634.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 6.080638408660889,
|
|
"epoch": 2.515756768752774,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004654448420823133,
|
|
"loss": 5.7544,
|
|
"mean_token_accuracy": 0.17119256556034088,
|
|
"num_tokens": 5842422.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 6.030310201644897,
|
|
"epoch": 2.520195295162006,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046526118250660636,
|
|
"loss": 5.7404,
|
|
"mean_token_accuracy": 0.17302993685007095,
|
|
"num_tokens": 5851658.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 6.0097393035888675,
|
|
"epoch": 2.5246338215712383,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004650770769716875,
|
|
"loss": 5.7635,
|
|
"mean_token_accuracy": 0.16970502585172653,
|
|
"num_tokens": 5861900.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 6.13044376373291,
|
|
"epoch": 2.5290723479804704,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004648925259090875,
|
|
"loss": 5.8304,
|
|
"mean_token_accuracy": 0.16660041362047195,
|
|
"num_tokens": 5872675.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 6.098389196395874,
|
|
"epoch": 2.5335108743897026,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046470752975138146,
|
|
"loss": 5.7127,
|
|
"mean_token_accuracy": 0.17505834698677064,
|
|
"num_tokens": 5882768.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.994097661972046,
|
|
"epoch": 2.5379494007989347,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046452208893218777,
|
|
"loss": 5.7086,
|
|
"mean_token_accuracy": 0.17897956669330597,
|
|
"num_tokens": 5892970.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 6.031912326812744,
|
|
"epoch": 2.542387927208167,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000464336203886167,
|
|
"loss": 5.6679,
|
|
"mean_token_accuracy": 0.17664587646722793,
|
|
"num_tokens": 5903597.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 6.076654577255249,
|
|
"epoch": 2.546826453617399,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000464149875049021,
|
|
"loss": 5.7082,
|
|
"mean_token_accuracy": 0.17591760605573653,
|
|
"num_tokens": 5913908.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 6.035532999038696,
|
|
"epoch": 2.551264980026631,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046396310285749175,
|
|
"loss": 5.7447,
|
|
"mean_token_accuracy": 0.17051061540842055,
|
|
"num_tokens": 5923022.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 6.030104494094848,
|
|
"epoch": 2.5557035064358633,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00046377588774936077,
|
|
"loss": 5.7383,
|
|
"mean_token_accuracy": 0.17380277961492538,
|
|
"num_tokens": 5933005.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 6.0437328815460205,
|
|
"epoch": 2.5601420328450954,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00046358823016344713,
|
|
"loss": 5.7029,
|
|
"mean_token_accuracy": 0.17715244591236115,
|
|
"num_tokens": 5943197.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 6.017801523208618,
|
|
"epoch": 2.5645805592543276,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004634001305396076,
|
|
"loss": 5.7701,
|
|
"mean_token_accuracy": 0.17026674896478652,
|
|
"num_tokens": 5954788.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 6.168081951141358,
|
|
"epoch": 2.5690190856635597,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00046321158931873486,
|
|
"loss": 5.7751,
|
|
"mean_token_accuracy": 0.16409984081983567,
|
|
"num_tokens": 5965896.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.9579003810882565,
|
|
"epoch": 2.573457612072792,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004630226069427566,
|
|
"loss": 5.616,
|
|
"mean_token_accuracy": 0.18554621189832687,
|
|
"num_tokens": 5975492.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 6.020355606079102,
|
|
"epoch": 2.577896138482024,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00046283318385463454,
|
|
"loss": 5.6971,
|
|
"mean_token_accuracy": 0.1745652511715889,
|
|
"num_tokens": 5985489.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 5.985205554962159,
|
|
"epoch": 2.582334664891256,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004626433204983636,
|
|
"loss": 5.647,
|
|
"mean_token_accuracy": 0.174534772336483,
|
|
"num_tokens": 5995031.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 6.006907415390015,
|
|
"epoch": 2.5867731913004883,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00046245301731897024,
|
|
"loss": 5.7595,
|
|
"mean_token_accuracy": 0.16590401232242585,
|
|
"num_tokens": 6005010.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 6.114031076431274,
|
|
"epoch": 2.5912117177097205,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00046226227476251256,
|
|
"loss": 5.6742,
|
|
"mean_token_accuracy": 0.1767223834991455,
|
|
"num_tokens": 6016403.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.938989210128784,
|
|
"epoch": 2.5956502441189526,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004620710932760776,
|
|
"loss": 5.6682,
|
|
"mean_token_accuracy": 0.18038018196821212,
|
|
"num_tokens": 6026312.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 6.016516923904419,
|
|
"epoch": 2.6000887705281848,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000461879473307782,
|
|
"loss": 5.867,
|
|
"mean_token_accuracy": 0.16858119815587996,
|
|
"num_tokens": 6036857.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 6.142938184738159,
|
|
"epoch": 2.604527296937417,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004616874153067698,
|
|
"loss": 5.7728,
|
|
"mean_token_accuracy": 0.16579627990722656,
|
|
"num_tokens": 6048270.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 6.05487551689148,
|
|
"epoch": 2.608965823346649,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004614949197232118,
|
|
"loss": 5.696,
|
|
"mean_token_accuracy": 0.17658320367336272,
|
|
"num_tokens": 6059351.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 5.983553838729859,
|
|
"epoch": 2.613404349755881,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004613019870083045,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.1750687301158905,
|
|
"num_tokens": 6069639.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 6.009236431121826,
|
|
"epoch": 2.6178428761651134,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00046110861761426903,
|
|
"loss": 5.7475,
|
|
"mean_token_accuracy": 0.16875652074813843,
|
|
"num_tokens": 6081393.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 6.063278436660767,
|
|
"epoch": 2.6222814025743455,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00046091481199435005,
|
|
"loss": 5.7469,
|
|
"mean_token_accuracy": 0.1720976859331131,
|
|
"num_tokens": 6091043.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 6.051684427261352,
|
|
"epoch": 2.6267199289835776,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004607205706028147,
|
|
"loss": 5.733,
|
|
"mean_token_accuracy": 0.1665470317006111,
|
|
"num_tokens": 6101502.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.959883069992065,
|
|
"epoch": 2.63115845539281,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004605258938949514,
|
|
"loss": 5.6537,
|
|
"mean_token_accuracy": 0.1800918236374855,
|
|
"num_tokens": 6110908.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 6.070306491851807,
|
|
"epoch": 2.635596981802042,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00046033078232706923,
|
|
"loss": 5.7551,
|
|
"mean_token_accuracy": 0.17454806268215178,
|
|
"num_tokens": 6120189.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 6.073927783966065,
|
|
"epoch": 2.640035508211274,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046013523635649625,
|
|
"loss": 5.7497,
|
|
"mean_token_accuracy": 0.16859546005725862,
|
|
"num_tokens": 6129095.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 6.0158473491668705,
|
|
"epoch": 2.6444740346205062,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00045993925644157883,
|
|
"loss": 5.7132,
|
|
"mean_token_accuracy": 0.1755117155611515,
|
|
"num_tokens": 6139129.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.979988050460816,
|
|
"epoch": 2.6489125610297384,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004597428430416807,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.17120434045791627,
|
|
"num_tokens": 6148966.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 6.136995887756347,
|
|
"epoch": 2.6533510874389705,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045954599661718126,
|
|
"loss": 5.8193,
|
|
"mean_token_accuracy": 0.1676889553666115,
|
|
"num_tokens": 6158254.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 6.045438051223755,
|
|
"epoch": 2.6577896138482027,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00045934871762947504,
|
|
"loss": 5.6964,
|
|
"mean_token_accuracy": 0.17370334416627883,
|
|
"num_tokens": 6167922.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.940775346755982,
|
|
"epoch": 2.6622281402574344,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00045915100654097076,
|
|
"loss": 5.7092,
|
|
"mean_token_accuracy": 0.17816627770662308,
|
|
"num_tokens": 6179494.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 2.6622281402574344,
|
|
"eval_entropy": 5.789337054001181,
|
|
"eval_loss": 6.018830299377441,
|
|
"eval_mean_token_accuracy": 0.16076800524480553,
|
|
"eval_num_tokens": 6179494.0,
|
|
"eval_runtime": 2.0923,
|
|
"eval_samples_per_second": 1609.206,
|
|
"eval_steps_per_second": 201.211,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 6.011846494674683,
|
|
"epoch": 2.6666666666666665,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045895286381508944,
|
|
"loss": 5.7312,
|
|
"mean_token_accuracy": 0.1753581464290619,
|
|
"num_tokens": 6189732.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 6.029772520065308,
|
|
"epoch": 2.6711051930758987,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004587542899162642,
|
|
"loss": 5.7683,
|
|
"mean_token_accuracy": 0.16387217342853547,
|
|
"num_tokens": 6200582.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 6.066657304763794,
|
|
"epoch": 2.675543719485131,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045855528530993874,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.17216766774654388,
|
|
"num_tokens": 6210009.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 6.039933919906616,
|
|
"epoch": 2.679982245894363,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004583558504625661,
|
|
"loss": 5.7558,
|
|
"mean_token_accuracy": 0.1696187898516655,
|
|
"num_tokens": 6220178.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.955683088302612,
|
|
"epoch": 2.684420772303595,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045815598584160824,
|
|
"loss": 5.6471,
|
|
"mean_token_accuracy": 0.1844172552227974,
|
|
"num_tokens": 6230147.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 6.097689056396485,
|
|
"epoch": 2.6888592987128273,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045795569191553384,
|
|
"loss": 5.7985,
|
|
"mean_token_accuracy": 0.16727579087018968,
|
|
"num_tokens": 6241561.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 5.979752445220948,
|
|
"epoch": 2.6932978251220594,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004577549691538183,
|
|
"loss": 5.7252,
|
|
"mean_token_accuracy": 0.18227578103542327,
|
|
"num_tokens": 6251360.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 6.113001489639283,
|
|
"epoch": 2.6977363515312915,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045755381802694206,
|
|
"loss": 5.7266,
|
|
"mean_token_accuracy": 0.1760123386979103,
|
|
"num_tokens": 6261947.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 6.00572943687439,
|
|
"epoch": 2.7021748779405237,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045735223900638967,
|
|
"loss": 5.7118,
|
|
"mean_token_accuracy": 0.16842464506626129,
|
|
"num_tokens": 6272247.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 6.02584981918335,
|
|
"epoch": 2.706613404349756,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045715023256464855,
|
|
"loss": 5.7608,
|
|
"mean_token_accuracy": 0.1715293511748314,
|
|
"num_tokens": 6282171.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 6.107793283462525,
|
|
"epoch": 2.711051930758988,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045694779917520797,
|
|
"loss": 5.7451,
|
|
"mean_token_accuracy": 0.17290424555540085,
|
|
"num_tokens": 6290993.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.978008699417114,
|
|
"epoch": 2.71549045716822,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000456744939312558,
|
|
"loss": 5.6471,
|
|
"mean_token_accuracy": 0.18025294095277786,
|
|
"num_tokens": 6301039.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.9843508243560795,
|
|
"epoch": 2.7199289835774523,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004565416534521883,
|
|
"loss": 5.7301,
|
|
"mean_token_accuracy": 0.16947097778320314,
|
|
"num_tokens": 6312095.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.932244157791137,
|
|
"epoch": 2.7243675099866844,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000456337942070587,
|
|
"loss": 5.6472,
|
|
"mean_token_accuracy": 0.18285827040672303,
|
|
"num_tokens": 6322621.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 6.0621102809906,
|
|
"epoch": 2.7288060363959166,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004561338056452396,
|
|
"loss": 5.7749,
|
|
"mean_token_accuracy": 0.17220864966511726,
|
|
"num_tokens": 6332733.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.973612880706787,
|
|
"epoch": 2.7332445628051487,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004559292446546281,
|
|
"loss": 5.7143,
|
|
"mean_token_accuracy": 0.17332967817783357,
|
|
"num_tokens": 6343162.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 6.0895998001098635,
|
|
"epoch": 2.737683089214381,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004557242595782293,
|
|
"loss": 5.742,
|
|
"mean_token_accuracy": 0.17037878483533858,
|
|
"num_tokens": 6354283.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 6.039672994613648,
|
|
"epoch": 2.742121615623613,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004555188508965144,
|
|
"loss": 5.6795,
|
|
"mean_token_accuracy": 0.17761039584875107,
|
|
"num_tokens": 6364645.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.966477537155152,
|
|
"epoch": 2.746560142032845,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045531301909094724,
|
|
"loss": 5.6686,
|
|
"mean_token_accuracy": 0.17619081139564513,
|
|
"num_tokens": 6375156.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 6.012517929077148,
|
|
"epoch": 2.7509986684420773,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004551067646439834,
|
|
"loss": 5.6824,
|
|
"mean_token_accuracy": 0.17580184042453767,
|
|
"num_tokens": 6385105.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 6.031947231292724,
|
|
"epoch": 2.7554371948513094,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045490008803906936,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.1666751965880394,
|
|
"num_tokens": 6396122.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 6.084775066375732,
|
|
"epoch": 2.7598757212605416,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004546929897606409,
|
|
"loss": 5.6284,
|
|
"mean_token_accuracy": 0.18060048222541808,
|
|
"num_tokens": 6405668.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.962884092330933,
|
|
"epoch": 2.7643142476697737,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00045448547029412225,
|
|
"loss": 5.7133,
|
|
"mean_token_accuracy": 0.17631541192531586,
|
|
"num_tokens": 6415845.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.991909742355347,
|
|
"epoch": 2.768752774079006,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045427753012592477,
|
|
"loss": 5.6724,
|
|
"mean_token_accuracy": 0.1697130471467972,
|
|
"num_tokens": 6424945.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 6.0469557762146,
|
|
"epoch": 2.773191300488238,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045406916974344617,
|
|
"loss": 5.7563,
|
|
"mean_token_accuracy": 0.17011816203594207,
|
|
"num_tokens": 6435224.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 6.046081399917602,
|
|
"epoch": 2.77762982689747,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045386038963506883,
|
|
"loss": 5.7334,
|
|
"mean_token_accuracy": 0.1699560046195984,
|
|
"num_tokens": 6444519.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.950239896774292,
|
|
"epoch": 2.7820683533067023,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004536511902901591,
|
|
"loss": 5.7693,
|
|
"mean_token_accuracy": 0.17263632714748384,
|
|
"num_tokens": 6454377.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.952496862411499,
|
|
"epoch": 2.7865068797159345,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004534415721990659,
|
|
"loss": 5.5402,
|
|
"mean_token_accuracy": 0.1998279348015785,
|
|
"num_tokens": 6464073.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 6.071445178985596,
|
|
"epoch": 2.790945406125166,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045323153585311975,
|
|
"loss": 5.7179,
|
|
"mean_token_accuracy": 0.1706698343157768,
|
|
"num_tokens": 6473517.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 6.029016780853271,
|
|
"epoch": 2.7953839325343983,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004530210817446316,
|
|
"loss": 5.6796,
|
|
"mean_token_accuracy": 0.17350984811782838,
|
|
"num_tokens": 6482465.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 6.018514966964721,
|
|
"epoch": 2.7998224589436305,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004528102103668913,
|
|
"loss": 5.7618,
|
|
"mean_token_accuracy": 0.17125869393348694,
|
|
"num_tokens": 6493420.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 6.028185033798218,
|
|
"epoch": 2.8042609853528626,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004525989222141671,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.1788898825645447,
|
|
"num_tokens": 6503395.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 6.030786037445068,
|
|
"epoch": 2.8086995117620948,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045238721778170386,
|
|
"loss": 5.7436,
|
|
"mean_token_accuracy": 0.17074056565761567,
|
|
"num_tokens": 6514353.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 6.061694574356079,
|
|
"epoch": 2.813138038171327,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045217509756572256,
|
|
"loss": 5.6871,
|
|
"mean_token_accuracy": 0.17090310156345367,
|
|
"num_tokens": 6523501.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.97159743309021,
|
|
"epoch": 2.817576564580559,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004519625620634182,
|
|
"loss": 5.7318,
|
|
"mean_token_accuracy": 0.16962333917617797,
|
|
"num_tokens": 6535135.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 6.10450177192688,
|
|
"epoch": 2.822015090989791,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045174961177295964,
|
|
"loss": 5.7209,
|
|
"mean_token_accuracy": 0.17412717789411544,
|
|
"num_tokens": 6546100.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.934656810760498,
|
|
"epoch": 2.8264536173990233,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045153624719348773,
|
|
"loss": 5.6484,
|
|
"mean_token_accuracy": 0.17352755069732667,
|
|
"num_tokens": 6557091.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.935671329498291,
|
|
"epoch": 2.8308921438082555,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045132246882511457,
|
|
"loss": 5.6754,
|
|
"mean_token_accuracy": 0.17148020267486572,
|
|
"num_tokens": 6567469.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 6.015770435333252,
|
|
"epoch": 2.8353306702174876,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004511082771689219,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.17414820641279222,
|
|
"num_tokens": 6577442.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 6.07279109954834,
|
|
"epoch": 2.83976919662672,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045089367272696046,
|
|
"loss": 5.6299,
|
|
"mean_token_accuracy": 0.1816476598381996,
|
|
"num_tokens": 6587321.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 6.001161098480225,
|
|
"epoch": 2.844207723035952,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00045067865600224833,
|
|
"loss": 5.7098,
|
|
"mean_token_accuracy": 0.17837129086256026,
|
|
"num_tokens": 6597971.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.96258053779602,
|
|
"epoch": 2.848646249445184,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00045046322749877005,
|
|
"loss": 5.6859,
|
|
"mean_token_accuracy": 0.1785979002714157,
|
|
"num_tokens": 6608251.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 6.015719032287597,
|
|
"epoch": 2.853084775854416,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00045024738772147534,
|
|
"loss": 5.6568,
|
|
"mean_token_accuracy": 0.1777540847659111,
|
|
"num_tokens": 6618045.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 6.079815149307251,
|
|
"epoch": 2.8575233022636484,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004500311371762778,
|
|
"loss": 5.723,
|
|
"mean_token_accuracy": 0.1762673020362854,
|
|
"num_tokens": 6628162.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 6.04972767829895,
|
|
"epoch": 2.8619618286728805,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044981447637005396,
|
|
"loss": 5.7761,
|
|
"mean_token_accuracy": 0.16095962822437287,
|
|
"num_tokens": 6639225.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.983947801589966,
|
|
"epoch": 2.8664003550821127,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000449597405810642,
|
|
"loss": 5.6133,
|
|
"mean_token_accuracy": 0.17978738248348236,
|
|
"num_tokens": 6649248.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.941468191146851,
|
|
"epoch": 2.870838881491345,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004493799260068405,
|
|
"loss": 5.7351,
|
|
"mean_token_accuracy": 0.17311612367630005,
|
|
"num_tokens": 6660458.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 6.038877630233765,
|
|
"epoch": 2.875277407900577,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004491620374684072,
|
|
"loss": 5.6762,
|
|
"mean_token_accuracy": 0.17014368772506713,
|
|
"num_tokens": 6669951.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 6.017770910263062,
|
|
"epoch": 2.879715934309809,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044894374070605795,
|
|
"loss": 5.743,
|
|
"mean_token_accuracy": 0.17674416303634644,
|
|
"num_tokens": 6680472.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 6.084974384307861,
|
|
"epoch": 2.8841544607190412,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044872503623146544,
|
|
"loss": 5.7117,
|
|
"mean_token_accuracy": 0.16619863510131835,
|
|
"num_tokens": 6690939.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.94278769493103,
|
|
"epoch": 2.8885929871282734,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044850592455725804,
|
|
"loss": 5.7764,
|
|
"mean_token_accuracy": 0.17108806669712068,
|
|
"num_tokens": 6701087.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 6.017983531951904,
|
|
"epoch": 2.8930315135375055,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004482864061970185,
|
|
"loss": 5.6862,
|
|
"mean_token_accuracy": 0.18754952698945998,
|
|
"num_tokens": 6712292.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 6.036191987991333,
|
|
"epoch": 2.8974700399467377,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044806648166528286,
|
|
"loss": 5.659,
|
|
"mean_token_accuracy": 0.17132395058870314,
|
|
"num_tokens": 6722818.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.893555545806885,
|
|
"epoch": 2.90190856635597,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00044784615147753934,
|
|
"loss": 5.6816,
|
|
"mean_token_accuracy": 0.1757792666554451,
|
|
"num_tokens": 6733303.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 5.996296119689942,
|
|
"epoch": 2.906347092765202,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044762541615022664,
|
|
"loss": 5.7015,
|
|
"mean_token_accuracy": 0.17875064462423323,
|
|
"num_tokens": 6742483.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 5.979998683929443,
|
|
"epoch": 2.910785619174434,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00044740427620073344,
|
|
"loss": 5.6603,
|
|
"mean_token_accuracy": 0.17813819795846939,
|
|
"num_tokens": 6752836.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.954287004470825,
|
|
"epoch": 2.9152241455836663,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00044718273214739654,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.17084962874650955,
|
|
"num_tokens": 6764321.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 6.067618417739868,
|
|
"epoch": 2.9196626719928984,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004469607845095002,
|
|
"loss": 5.6775,
|
|
"mean_token_accuracy": 0.1735297128558159,
|
|
"num_tokens": 6774034.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.988525152206421,
|
|
"epoch": 2.9241011984021306,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004467384338072744,
|
|
"loss": 5.7772,
|
|
"mean_token_accuracy": 0.1673002153635025,
|
|
"num_tokens": 6786182.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 6.02162880897522,
|
|
"epoch": 2.9285397248113627,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004465156805618941,
|
|
"loss": 5.6475,
|
|
"mean_token_accuracy": 0.17642576694488527,
|
|
"num_tokens": 6795631.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.964630270004273,
|
|
"epoch": 2.932978251220595,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004462925252954775,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.16975196450948715,
|
|
"num_tokens": 6805212.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 6.031642150878906,
|
|
"epoch": 2.937416777629827,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004460689685310855,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.1703239858150482,
|
|
"num_tokens": 6815680.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 6.008225917816162,
|
|
"epoch": 2.941855304039059,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004458450107927199,
|
|
"loss": 5.6538,
|
|
"mean_token_accuracy": 0.180711767077446,
|
|
"num_tokens": 6824694.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.845587253570557,
|
|
"epoch": 2.9462938304482913,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044562065260532214,
|
|
"loss": 5.621,
|
|
"mean_token_accuracy": 0.17849345952272416,
|
|
"num_tokens": 6835219.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 6.04475736618042,
|
|
"epoch": 2.9507323568575234,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00044539589449477265,
|
|
"loss": 5.7213,
|
|
"mean_token_accuracy": 0.1738622322678566,
|
|
"num_tokens": 6845992.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 6.052994966506958,
|
|
"epoch": 2.9551708832667556,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000445170736987889,
|
|
"loss": 5.6658,
|
|
"mean_token_accuracy": 0.18287943601608275,
|
|
"num_tokens": 6855287.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 6.029227447509766,
|
|
"epoch": 2.9596094096759877,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000444945180612425,
|
|
"loss": 5.775,
|
|
"mean_token_accuracy": 0.17114163041114808,
|
|
"num_tokens": 6865841.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 6.034116411209107,
|
|
"epoch": 2.96404793608522,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044471922589706944,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.16967750638723372,
|
|
"num_tokens": 6875931.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 6.023122358322143,
|
|
"epoch": 2.968486462494452,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004444928733714446,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.17056947499513625,
|
|
"num_tokens": 6886092.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 6.0595800399780275,
|
|
"epoch": 2.972924988903684,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044426612356610555,
|
|
"loss": 5.7344,
|
|
"mean_token_accuracy": 0.16704397201538085,
|
|
"num_tokens": 6897312.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.955773544311524,
|
|
"epoch": 2.9773635153129163,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004440389770125382,
|
|
"loss": 5.6457,
|
|
"mean_token_accuracy": 0.18342512249946594,
|
|
"num_tokens": 6907838.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.930391263961792,
|
|
"epoch": 2.9818020417221485,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004438114342431586,
|
|
"loss": 5.6485,
|
|
"mean_token_accuracy": 0.17502613514661788,
|
|
"num_tokens": 6916729.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.983162069320679,
|
|
"epoch": 2.9862405681313806,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00044358349579131143,
|
|
"loss": 5.5849,
|
|
"mean_token_accuracy": 0.1869617834687233,
|
|
"num_tokens": 6927074.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.962836027145386,
|
|
"epoch": 2.9906790945406128,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044335516219126876,
|
|
"loss": 5.6287,
|
|
"mean_token_accuracy": 0.17767293900251388,
|
|
"num_tokens": 6938437.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.964249944686889,
|
|
"epoch": 2.995117620949845,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044312643397822907,
|
|
"loss": 5.6745,
|
|
"mean_token_accuracy": 0.18153784573078155,
|
|
"num_tokens": 6949036.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 6.030031394958496,
|
|
"epoch": 2.999556147359077,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00044289731168831566,
|
|
"loss": 5.5911,
|
|
"mean_token_accuracy": 0.18498829305171965,
|
|
"num_tokens": 6958459.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.8808572557237415,
|
|
"epoch": 3.003550821127386,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004426677958585755,
|
|
"loss": 5.4157,
|
|
"mean_token_accuracy": 0.19034291472699907,
|
|
"num_tokens": 6967264.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.903432178497314,
|
|
"epoch": 3.007989347536618,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00044243788702697797,
|
|
"loss": 5.3709,
|
|
"mean_token_accuracy": 0.19530602395534516,
|
|
"num_tokens": 6977465.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.998833322525025,
|
|
"epoch": 3.01242787394585,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004422075857324137,
|
|
"loss": 5.3929,
|
|
"mean_token_accuracy": 0.19290464073419572,
|
|
"num_tokens": 6987583.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.954317235946656,
|
|
"epoch": 3.0168664003550822,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044197689251469324,
|
|
"loss": 5.38,
|
|
"mean_token_accuracy": 0.1891101285815239,
|
|
"num_tokens": 6997894.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.9602972030639645,
|
|
"epoch": 3.0213049267643144,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00044174580791454555,
|
|
"loss": 5.3515,
|
|
"mean_token_accuracy": 0.19597329050302506,
|
|
"num_tokens": 7008019.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.9017480373382565,
|
|
"epoch": 3.0257434531735465,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004415143324736174,
|
|
"loss": 5.3916,
|
|
"mean_token_accuracy": 0.19494948536157608,
|
|
"num_tokens": 7018272.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.968024396896363,
|
|
"epoch": 3.0301819795827787,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004412824667344712,
|
|
"loss": 5.439,
|
|
"mean_token_accuracy": 0.1884671375155449,
|
|
"num_tokens": 7028185.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 6.047925806045532,
|
|
"epoch": 3.034620505992011,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044105021124058455,
|
|
"loss": 5.4481,
|
|
"mean_token_accuracy": 0.18440557271242142,
|
|
"num_tokens": 7038123.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.86896710395813,
|
|
"epoch": 3.039059032401243,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00044081756653634825,
|
|
"loss": 5.342,
|
|
"mean_token_accuracy": 0.1948542922735214,
|
|
"num_tokens": 7048379.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.908081436157227,
|
|
"epoch": 3.043497558810475,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004405845331670659,
|
|
"loss": 5.323,
|
|
"mean_token_accuracy": 0.20013415217399597,
|
|
"num_tokens": 7057878.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.90395884513855,
|
|
"epoch": 3.0479360852197073,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004403511116789514,
|
|
"loss": 5.4602,
|
|
"mean_token_accuracy": 0.18673462122678758,
|
|
"num_tokens": 7067998.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.890441370010376,
|
|
"epoch": 3.052374611628939,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044011730261912915,
|
|
"loss": 5.3764,
|
|
"mean_token_accuracy": 0.19622484892606734,
|
|
"num_tokens": 7079236.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.89832239151001,
|
|
"epoch": 3.056813138038171,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004398831065356314,
|
|
"loss": 5.3428,
|
|
"mean_token_accuracy": 0.19831295162439347,
|
|
"num_tokens": 7088947.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.946053075790405,
|
|
"epoch": 3.0612516644474033,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043964852397739793,
|
|
"loss": 5.4557,
|
|
"mean_token_accuracy": 0.18364953398704528,
|
|
"num_tokens": 7099480.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.869796800613403,
|
|
"epoch": 3.0656901908566354,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000439413555494274,
|
|
"loss": 5.3686,
|
|
"mean_token_accuracy": 0.1966594323515892,
|
|
"num_tokens": 7109471.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.870002937316895,
|
|
"epoch": 3.0701287172658676,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004391782016370098,
|
|
"loss": 5.4148,
|
|
"mean_token_accuracy": 0.1896324947476387,
|
|
"num_tokens": 7119790.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.988854026794433,
|
|
"epoch": 3.0745672436750997,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004389424629572586,
|
|
"loss": 5.3878,
|
|
"mean_token_accuracy": 0.19112442284822465,
|
|
"num_tokens": 7129736.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.899620294570923,
|
|
"epoch": 3.079005770084332,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043870634000757605,
|
|
"loss": 5.3816,
|
|
"mean_token_accuracy": 0.18703049421310425,
|
|
"num_tokens": 7139786.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.943547010421753,
|
|
"epoch": 3.083444296493564,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004384698333414179,
|
|
"loss": 5.387,
|
|
"mean_token_accuracy": 0.1897724226117134,
|
|
"num_tokens": 7150742.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.958523893356324,
|
|
"epoch": 3.087882822902796,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004382329435131396,
|
|
"loss": 5.4457,
|
|
"mean_token_accuracy": 0.18277957141399384,
|
|
"num_tokens": 7161740.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.954104804992676,
|
|
"epoch": 3.0923213493120283,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00043799567107799504,
|
|
"loss": 5.423,
|
|
"mean_token_accuracy": 0.18841141164302827,
|
|
"num_tokens": 7172615.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.788148641586304,
|
|
"epoch": 3.0967598757212604,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043775801659213425,
|
|
"loss": 5.3323,
|
|
"mean_token_accuracy": 0.20167517215013503,
|
|
"num_tokens": 7183037.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.911949014663696,
|
|
"epoch": 3.1011984021304926,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004375199806126034,
|
|
"loss": 5.4289,
|
|
"mean_token_accuracy": 0.19386280030012132,
|
|
"num_tokens": 7193621.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.8650144100189205,
|
|
"epoch": 3.1056369285397247,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043728156369734236,
|
|
"loss": 5.313,
|
|
"mean_token_accuracy": 0.20414462238550185,
|
|
"num_tokens": 7204419.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"epoch": 3.1056369285397247,
|
|
"eval_entropy": 5.6460988130818635,
|
|
"eval_loss": 5.959334373474121,
|
|
"eval_mean_token_accuracy": 0.16493839260872073,
|
|
"eval_num_tokens": 7204419.0,
|
|
"eval_runtime": 2.0846,
|
|
"eval_samples_per_second": 1615.155,
|
|
"eval_steps_per_second": 201.954,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 5.834872102737426,
|
|
"epoch": 3.110075454948957,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004370427664051841,
|
|
"loss": 5.3529,
|
|
"mean_token_accuracy": 0.19269932806491852,
|
|
"num_tokens": 7214372.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.863707590103149,
|
|
"epoch": 3.114513981358189,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004368035892958533,
|
|
"loss": 5.3994,
|
|
"mean_token_accuracy": 0.19355032294988633,
|
|
"num_tokens": 7224990.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 5.937055206298828,
|
|
"epoch": 3.118952507767421,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043656403292996454,
|
|
"loss": 5.4193,
|
|
"mean_token_accuracy": 0.1840432032942772,
|
|
"num_tokens": 7235487.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 5.885832786560059,
|
|
"epoch": 3.1233910341766533,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004363240978690218,
|
|
"loss": 5.4026,
|
|
"mean_token_accuracy": 0.19053976088762284,
|
|
"num_tokens": 7245942.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 5.951666831970215,
|
|
"epoch": 3.1278295605858855,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00043608378467541626,
|
|
"loss": 5.4028,
|
|
"mean_token_accuracy": 0.18414484113454818,
|
|
"num_tokens": 7255323.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 5.941895866394043,
|
|
"epoch": 3.1322680869951176,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043584309391242584,
|
|
"loss": 5.4639,
|
|
"mean_token_accuracy": 0.1837260752916336,
|
|
"num_tokens": 7266339.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 5.955119895935058,
|
|
"epoch": 3.1367066134043498,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004356020261442131,
|
|
"loss": 5.4029,
|
|
"mean_token_accuracy": 0.1911745175719261,
|
|
"num_tokens": 7277501.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.9398706436157225,
|
|
"epoch": 3.141145139813582,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043536058193582443,
|
|
"loss": 5.455,
|
|
"mean_token_accuracy": 0.1892775923013687,
|
|
"num_tokens": 7287639.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.849388504028321,
|
|
"epoch": 3.145583666222814,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004351187618531886,
|
|
"loss": 5.3415,
|
|
"mean_token_accuracy": 0.19347691684961318,
|
|
"num_tokens": 7297333.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 5.835960865020752,
|
|
"epoch": 3.150022192632046,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043487656646311535,
|
|
"loss": 5.4584,
|
|
"mean_token_accuracy": 0.18551218509674072,
|
|
"num_tokens": 7307750.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 5.860294580459595,
|
|
"epoch": 3.1544607190412783,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004346339963332941,
|
|
"loss": 5.3436,
|
|
"mean_token_accuracy": 0.20199633687734603,
|
|
"num_tokens": 7317128.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.871670961380005,
|
|
"epoch": 3.1588992454505105,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004343910520322927,
|
|
"loss": 5.4169,
|
|
"mean_token_accuracy": 0.1937512531876564,
|
|
"num_tokens": 7327574.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 5.894437789916992,
|
|
"epoch": 3.1633377718597426,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000434147734129556,
|
|
"loss": 5.4207,
|
|
"mean_token_accuracy": 0.192408949136734,
|
|
"num_tokens": 7337776.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.906270456314087,
|
|
"epoch": 3.1677762982689748,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043390404319540443,
|
|
"loss": 5.4257,
|
|
"mean_token_accuracy": 0.19216728061437607,
|
|
"num_tokens": 7347691.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.894905376434326,
|
|
"epoch": 3.172214824678207,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043365997980103304,
|
|
"loss": 5.4454,
|
|
"mean_token_accuracy": 0.18370102643966674,
|
|
"num_tokens": 7358152.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 5.903047180175781,
|
|
"epoch": 3.176653351087439,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00043341554451850964,
|
|
"loss": 5.3993,
|
|
"mean_token_accuracy": 0.19171175360679626,
|
|
"num_tokens": 7369017.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 5.9143860816955565,
|
|
"epoch": 3.181091877496671,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00043317073792077394,
|
|
"loss": 5.4409,
|
|
"mean_token_accuracy": 0.19202805012464524,
|
|
"num_tokens": 7378589.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 5.907209157943726,
|
|
"epoch": 3.1855304039059034,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004329255605816357,
|
|
"loss": 5.3684,
|
|
"mean_token_accuracy": 0.19171188175678253,
|
|
"num_tokens": 7388053.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 5.889437580108643,
|
|
"epoch": 3.1899689303151355,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000432680013075774,
|
|
"loss": 5.4492,
|
|
"mean_token_accuracy": 0.18419877737760543,
|
|
"num_tokens": 7398200.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 5.893877220153809,
|
|
"epoch": 3.1944074567243677,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004324340959787354,
|
|
"loss": 5.3605,
|
|
"mean_token_accuracy": 0.20110263228416442,
|
|
"num_tokens": 7408378.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 5.872954082489014,
|
|
"epoch": 3.1988459831336,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043218780986693274,
|
|
"loss": 5.4328,
|
|
"mean_token_accuracy": 0.1992975264787674,
|
|
"num_tokens": 7418961.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 5.846698236465454,
|
|
"epoch": 3.203284509542832,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004319411553176438,
|
|
"loss": 5.5195,
|
|
"mean_token_accuracy": 0.18346895426511764,
|
|
"num_tokens": 7429844.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.879422616958618,
|
|
"epoch": 3.207723035952064,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004316941329090101,
|
|
"loss": 5.3498,
|
|
"mean_token_accuracy": 0.20174553096294404,
|
|
"num_tokens": 7440824.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.9176287174224855,
|
|
"epoch": 3.2121615623612962,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043144674322003525,
|
|
"loss": 5.4666,
|
|
"mean_token_accuracy": 0.1915660098195076,
|
|
"num_tokens": 7451666.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.904341077804565,
|
|
"epoch": 3.2166000887705284,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004311989868305837,
|
|
"loss": 5.4375,
|
|
"mean_token_accuracy": 0.1913430780172348,
|
|
"num_tokens": 7462476.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.900774383544922,
|
|
"epoch": 3.2210386151797605,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043095086432137954,
|
|
"loss": 5.4534,
|
|
"mean_token_accuracy": 0.18185227811336518,
|
|
"num_tokens": 7472388.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 5.887851858139038,
|
|
"epoch": 3.2254771415889927,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000430702376274005,
|
|
"loss": 5.401,
|
|
"mean_token_accuracy": 0.19130902141332626,
|
|
"num_tokens": 7482770.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.906753969192505,
|
|
"epoch": 3.2299156679982244,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043045352327089907,
|
|
"loss": 5.468,
|
|
"mean_token_accuracy": 0.1859576016664505,
|
|
"num_tokens": 7492107.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.898250150680542,
|
|
"epoch": 3.2343541944074565,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043020430589535625,
|
|
"loss": 5.3594,
|
|
"mean_token_accuracy": 0.19287962913513185,
|
|
"num_tokens": 7501597.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.905869817733764,
|
|
"epoch": 3.2387927208166887,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000429954724731525,
|
|
"loss": 5.4058,
|
|
"mean_token_accuracy": 0.19971251338720322,
|
|
"num_tokens": 7513200.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 5.91200532913208,
|
|
"epoch": 3.243231247225921,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004297047803644063,
|
|
"loss": 5.3459,
|
|
"mean_token_accuracy": 0.19347363710403442,
|
|
"num_tokens": 7522807.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 5.8334047317504885,
|
|
"epoch": 3.247669773635153,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000429454473379853,
|
|
"loss": 5.3477,
|
|
"mean_token_accuracy": 0.1945561319589615,
|
|
"num_tokens": 7533577.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 5.883318090438843,
|
|
"epoch": 3.252108300044385,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004292038043645675,
|
|
"loss": 5.4106,
|
|
"mean_token_accuracy": 0.18551634699106218,
|
|
"num_tokens": 7543640.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.794455099105835,
|
|
"epoch": 3.2565468264536173,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00042895277390610074,
|
|
"loss": 5.4428,
|
|
"mean_token_accuracy": 0.19491562098264695,
|
|
"num_tokens": 7554692.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.990721559524536,
|
|
"epoch": 3.2609853528628494,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004287013825928509,
|
|
"loss": 5.385,
|
|
"mean_token_accuracy": 0.18947930932044982,
|
|
"num_tokens": 7563925.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 5.733651828765869,
|
|
"epoch": 3.2654238792720816,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004284496310140622,
|
|
"loss": 5.2984,
|
|
"mean_token_accuracy": 0.20197273343801497,
|
|
"num_tokens": 7573484.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 5.799650478363037,
|
|
"epoch": 3.2698624056813137,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004281975197598231,
|
|
"loss": 5.3955,
|
|
"mean_token_accuracy": 0.19549006968736649,
|
|
"num_tokens": 7582808.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.88456883430481,
|
|
"epoch": 3.274300932090546,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004279450494210651,
|
|
"loss": 5.4827,
|
|
"mean_token_accuracy": 0.18646293729543686,
|
|
"num_tokens": 7593790.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.911808729171753,
|
|
"epoch": 3.278739458499778,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004276922205895614,
|
|
"loss": 5.48,
|
|
"mean_token_accuracy": 0.1881803423166275,
|
|
"num_tokens": 7603756.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 5.939221954345703,
|
|
"epoch": 3.28317798490901,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004274390338579257,
|
|
"loss": 5.4207,
|
|
"mean_token_accuracy": 0.19052503407001495,
|
|
"num_tokens": 7614126.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.749071359634399,
|
|
"epoch": 3.2876165113182423,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004271854898196102,
|
|
"loss": 5.3746,
|
|
"mean_token_accuracy": 0.19580249339342118,
|
|
"num_tokens": 7624573.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 5.878935194015503,
|
|
"epoch": 3.2920550377274744,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004269315890689049,
|
|
"loss": 5.4431,
|
|
"mean_token_accuracy": 0.1863309696316719,
|
|
"num_tokens": 7634715.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 5.853589487075806,
|
|
"epoch": 3.2964935641367066,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042667733220093574,
|
|
"loss": 5.3239,
|
|
"mean_token_accuracy": 0.20386914610862733,
|
|
"num_tokens": 7644241.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 5.874784135818482,
|
|
"epoch": 3.3009320905459387,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004264227198116635,
|
|
"loss": 5.4795,
|
|
"mean_token_accuracy": 0.18705491870641708,
|
|
"num_tokens": 7655655.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 5.848001718521118,
|
|
"epoch": 3.305370616955171,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042616775249788223,
|
|
"loss": 5.4973,
|
|
"mean_token_accuracy": 0.18835359066724777,
|
|
"num_tokens": 7665232.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 5.913939046859741,
|
|
"epoch": 3.309809143364403,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004259124308572178,
|
|
"loss": 5.4316,
|
|
"mean_token_accuracy": 0.1916329488158226,
|
|
"num_tokens": 7675178.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 5.899500942230224,
|
|
"epoch": 3.314247669773635,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004256567554881268,
|
|
"loss": 5.3627,
|
|
"mean_token_accuracy": 0.1938821107149124,
|
|
"num_tokens": 7685835.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 5.912274503707886,
|
|
"epoch": 3.3186861961828673,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004254007269898948,
|
|
"loss": 5.3577,
|
|
"mean_token_accuracy": 0.1939299672842026,
|
|
"num_tokens": 7694828.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.82884202003479,
|
|
"epoch": 3.3231247225920995,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00042514434596263513,
|
|
"loss": 5.4271,
|
|
"mean_token_accuracy": 0.1924677923321724,
|
|
"num_tokens": 7706055.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 5.830545425415039,
|
|
"epoch": 3.3275632490013316,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004248876130072873,
|
|
"loss": 5.4581,
|
|
"mean_token_accuracy": 0.1842326655983925,
|
|
"num_tokens": 7716220.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.860052013397217,
|
|
"epoch": 3.3320017754105637,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00042463052872561587,
|
|
"loss": 5.4372,
|
|
"mean_token_accuracy": 0.19057605415582657,
|
|
"num_tokens": 7726709.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 5.963085699081421,
|
|
"epoch": 3.336440301819796,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00042437309372020886,
|
|
"loss": 5.4012,
|
|
"mean_token_accuracy": 0.1977565497159958,
|
|
"num_tokens": 7736507.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 5.872720527648926,
|
|
"epoch": 3.340878828229028,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042411530859447634,
|
|
"loss": 5.4912,
|
|
"mean_token_accuracy": 0.1859763205051422,
|
|
"num_tokens": 7747031.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 5.914382410049439,
|
|
"epoch": 3.34531735463826,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004238571739526489,
|
|
"loss": 5.5078,
|
|
"mean_token_accuracy": 0.18674080073833466,
|
|
"num_tokens": 7756896.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 5.829860639572144,
|
|
"epoch": 3.3497558810474923,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004235986903997767,
|
|
"loss": 5.3098,
|
|
"mean_token_accuracy": 0.1985625222325325,
|
|
"num_tokens": 7768243.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 5.909512329101562,
|
|
"epoch": 3.3541944074567245,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004233398585417275,
|
|
"loss": 5.3886,
|
|
"mean_token_accuracy": 0.1947034165263176,
|
|
"num_tokens": 7778017.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 5.905759811401367,
|
|
"epoch": 3.3586329338659566,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004230806789851854,
|
|
"loss": 5.4766,
|
|
"mean_token_accuracy": 0.18501238375902176,
|
|
"num_tokens": 7788648.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.870203638076783,
|
|
"epoch": 3.3630714602751888,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042282115233764953,
|
|
"loss": 5.4228,
|
|
"mean_token_accuracy": 0.1922216847538948,
|
|
"num_tokens": 7799444.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 5.915548610687256,
|
|
"epoch": 3.367509986684421,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004225612792074326,
|
|
"loss": 5.4095,
|
|
"mean_token_accuracy": 0.18869893848896027,
|
|
"num_tokens": 7809324.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 5.847271156311035,
|
|
"epoch": 3.371948513093653,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042230106020365964,
|
|
"loss": 5.4219,
|
|
"mean_token_accuracy": 0.18740808665752412,
|
|
"num_tokens": 7819835.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 5.823662281036377,
|
|
"epoch": 3.376387039502885,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042204049593626617,
|
|
"loss": 5.3148,
|
|
"mean_token_accuracy": 0.19989162534475327,
|
|
"num_tokens": 7829978.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 5.8751567840576175,
|
|
"epoch": 3.3808255659121174,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042177958701599696,
|
|
"loss": 5.466,
|
|
"mean_token_accuracy": 0.1890934631228447,
|
|
"num_tokens": 7840638.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 5.777163314819336,
|
|
"epoch": 3.3852640923213495,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004215183340544047,
|
|
"loss": 5.2881,
|
|
"mean_token_accuracy": 0.20688982158899308,
|
|
"num_tokens": 7852025.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.833953237533569,
|
|
"epoch": 3.389702618730581,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004212567376638485,
|
|
"loss": 5.3775,
|
|
"mean_token_accuracy": 0.19608416706323623,
|
|
"num_tokens": 7861446.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.823704862594605,
|
|
"epoch": 3.3941411451398134,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00042099479845749256,
|
|
"loss": 5.4895,
|
|
"mean_token_accuracy": 0.18594682961702347,
|
|
"num_tokens": 7871521.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.859103012084961,
|
|
"epoch": 3.3985796715490455,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042073251704930414,
|
|
"loss": 5.4215,
|
|
"mean_token_accuracy": 0.19555966407060624,
|
|
"num_tokens": 7882352.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.895108985900879,
|
|
"epoch": 3.4030181979582776,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042046989405405326,
|
|
"loss": 5.3998,
|
|
"mean_token_accuracy": 0.19245795011520386,
|
|
"num_tokens": 7892487.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 5.786870241165161,
|
|
"epoch": 3.40745672436751,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004202069300873102,
|
|
"loss": 5.3629,
|
|
"mean_token_accuracy": 0.19259919673204423,
|
|
"num_tokens": 7902262.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 5.887244415283203,
|
|
"epoch": 3.411895250776742,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004199436257654445,
|
|
"loss": 5.3403,
|
|
"mean_token_accuracy": 0.19992637187242507,
|
|
"num_tokens": 7913415.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 5.800942850112915,
|
|
"epoch": 3.416333777185974,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004196799817056234,
|
|
"loss": 5.3702,
|
|
"mean_token_accuracy": 0.1944957345724106,
|
|
"num_tokens": 7923378.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 5.833743000030518,
|
|
"epoch": 3.4207723035952062,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00041941599852581067,
|
|
"loss": 5.4005,
|
|
"mean_token_accuracy": 0.192107592523098,
|
|
"num_tokens": 7932155.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 5.866676568984985,
|
|
"epoch": 3.4252108300044384,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041915167684476495,
|
|
"loss": 5.4391,
|
|
"mean_token_accuracy": 0.1913757935166359,
|
|
"num_tokens": 7942236.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 5.916124677658081,
|
|
"epoch": 3.4296493564136705,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000418887017282038,
|
|
"loss": 5.4685,
|
|
"mean_token_accuracy": 0.19052421748638154,
|
|
"num_tokens": 7952067.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 5.809151649475098,
|
|
"epoch": 3.4340878828229027,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041862202045797386,
|
|
"loss": 5.3092,
|
|
"mean_token_accuracy": 0.19900714755058288,
|
|
"num_tokens": 7961456.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 5.823811960220337,
|
|
"epoch": 3.438526409232135,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004183566869937069,
|
|
"loss": 5.3782,
|
|
"mean_token_accuracy": 0.20037556439638138,
|
|
"num_tokens": 7971601.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 5.87151517868042,
|
|
"epoch": 3.442964935641367,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004180910175111608,
|
|
"loss": 5.4483,
|
|
"mean_token_accuracy": 0.18243330270051955,
|
|
"num_tokens": 7982732.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 5.812599134445191,
|
|
"epoch": 3.447403462050599,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00041782501263304655,
|
|
"loss": 5.4182,
|
|
"mean_token_accuracy": 0.18896383941173553,
|
|
"num_tokens": 7993550.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 5.85041913986206,
|
|
"epoch": 3.4518419884598313,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004175586729828614,
|
|
"loss": 5.3866,
|
|
"mean_token_accuracy": 0.1983974426984787,
|
|
"num_tokens": 8003753.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 5.848913478851318,
|
|
"epoch": 3.4562805148690634,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041729199918488725,
|
|
"loss": 5.367,
|
|
"mean_token_accuracy": 0.1954442948102951,
|
|
"num_tokens": 8014516.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.776366281509399,
|
|
"epoch": 3.4607190412782955,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041702499186418936,
|
|
"loss": 5.4013,
|
|
"mean_token_accuracy": 0.191869093477726,
|
|
"num_tokens": 8024734.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 5.825012636184693,
|
|
"epoch": 3.4651575676875277,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041675765164661473,
|
|
"loss": 5.2844,
|
|
"mean_token_accuracy": 0.20244546234607697,
|
|
"num_tokens": 8033681.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.812342643737793,
|
|
"epoch": 3.46959609409676,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004164899791587903,
|
|
"loss": 5.4335,
|
|
"mean_token_accuracy": 0.18668857365846633,
|
|
"num_tokens": 8043202.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.874458456039429,
|
|
"epoch": 3.474034620505992,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00041622197502812224,
|
|
"loss": 5.4737,
|
|
"mean_token_accuracy": 0.18350510895252228,
|
|
"num_tokens": 8052964.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 5.868040704727173,
|
|
"epoch": 3.478473146915224,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000415953639882794,
|
|
"loss": 5.4358,
|
|
"mean_token_accuracy": 0.191118323802948,
|
|
"num_tokens": 8063964.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 5.817435216903687,
|
|
"epoch": 3.4829116733244563,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041568497435176473,
|
|
"loss": 5.3394,
|
|
"mean_token_accuracy": 0.1965772658586502,
|
|
"num_tokens": 8073659.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 5.775618934631348,
|
|
"epoch": 3.4873501997336884,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004154159790647681,
|
|
"loss": 5.4096,
|
|
"mean_token_accuracy": 0.1935155361890793,
|
|
"num_tokens": 8083850.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 5.857674884796142,
|
|
"epoch": 3.4917887261429206,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041514665465231063,
|
|
"loss": 5.3836,
|
|
"mean_token_accuracy": 0.19599000364542007,
|
|
"num_tokens": 8094308.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 5.884661388397217,
|
|
"epoch": 3.4962272525521527,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00041487700174567036,
|
|
"loss": 5.4342,
|
|
"mean_token_accuracy": 0.1878661945462227,
|
|
"num_tokens": 8105383.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 5.894474458694458,
|
|
"epoch": 3.500665778961385,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00041460702097689535,
|
|
"loss": 5.4853,
|
|
"mean_token_accuracy": 0.1829699918627739,
|
|
"num_tokens": 8116888.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 5.815571308135986,
|
|
"epoch": 3.505104305370617,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041433671297880204,
|
|
"loss": 5.3644,
|
|
"mean_token_accuracy": 0.2002154141664505,
|
|
"num_tokens": 8126419.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 5.856853008270264,
|
|
"epoch": 3.509542831779849,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004140660783849739,
|
|
"loss": 5.4585,
|
|
"mean_token_accuracy": 0.18545352667570114,
|
|
"num_tokens": 8136734.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 5.7611549377441404,
|
|
"epoch": 3.5139813581890813,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041379511782975995,
|
|
"loss": 5.4275,
|
|
"mean_token_accuracy": 0.18803369849920273,
|
|
"num_tokens": 8146362.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 5.867103481292725,
|
|
"epoch": 3.5184198845983135,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004135238319482731,
|
|
"loss": 5.3396,
|
|
"mean_token_accuracy": 0.19985446333885193,
|
|
"num_tokens": 8156493.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 5.827406597137451,
|
|
"epoch": 3.5228584110075456,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041325222137638914,
|
|
"loss": 5.3822,
|
|
"mean_token_accuracy": 0.198279732465744,
|
|
"num_tokens": 8166693.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 5.8414324760437015,
|
|
"epoch": 3.5272969374167777,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004129802867507444,
|
|
"loss": 5.5056,
|
|
"mean_token_accuracy": 0.18893716484308243,
|
|
"num_tokens": 8177819.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 5.8395007133483885,
|
|
"epoch": 3.53173546382601,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004127080287087354,
|
|
"loss": 5.4563,
|
|
"mean_token_accuracy": 0.19080454111099243,
|
|
"num_tokens": 8187559.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.878630113601685,
|
|
"epoch": 3.536173990235242,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041243544788851616,
|
|
"loss": 5.4661,
|
|
"mean_token_accuracy": 0.18955991715192794,
|
|
"num_tokens": 8198051.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 5.788226985931397,
|
|
"epoch": 3.540612516644474,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041216254492899753,
|
|
"loss": 5.2939,
|
|
"mean_token_accuracy": 0.20163479596376419,
|
|
"num_tokens": 8207969.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 5.814974308013916,
|
|
"epoch": 3.5450510430537063,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004118893204698454,
|
|
"loss": 5.3902,
|
|
"mean_token_accuracy": 0.18923236578702926,
|
|
"num_tokens": 8219057.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.7541250705719,
|
|
"epoch": 3.5494895694629385,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004116157751514793,
|
|
"loss": 5.3578,
|
|
"mean_token_accuracy": 0.19907362014055252,
|
|
"num_tokens": 8228156.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"epoch": 3.5494895694629385,
|
|
"eval_entropy": 5.581153839047901,
|
|
"eval_loss": 5.913293838500977,
|
|
"eval_mean_token_accuracy": 0.16851918041847663,
|
|
"eval_num_tokens": 8228156.0,
|
|
"eval_runtime": 2.0884,
|
|
"eval_samples_per_second": 1612.224,
|
|
"eval_steps_per_second": 201.588,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 5.824972915649414,
|
|
"epoch": 3.5539280958721706,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041134190961507073,
|
|
"loss": 5.4659,
|
|
"mean_token_accuracy": 0.19036727249622346,
|
|
"num_tokens": 8238707.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 5.870899343490601,
|
|
"epoch": 3.5583666222814028,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041106772450254177,
|
|
"loss": 5.4352,
|
|
"mean_token_accuracy": 0.19054232090711593,
|
|
"num_tokens": 8248026.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 5.803697156906128,
|
|
"epoch": 3.562805148690635,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041079322045656366,
|
|
"loss": 5.3887,
|
|
"mean_token_accuracy": 0.2025946080684662,
|
|
"num_tokens": 8258615.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 5.885553455352783,
|
|
"epoch": 3.567243675099867,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000410518398120555,
|
|
"loss": 5.4536,
|
|
"mean_token_accuracy": 0.1920897349715233,
|
|
"num_tokens": 8268912.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 5.87697319984436,
|
|
"epoch": 3.571682201509099,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041024325813868065,
|
|
"loss": 5.4202,
|
|
"mean_token_accuracy": 0.19221669733524321,
|
|
"num_tokens": 8278503.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 5.786037254333496,
|
|
"epoch": 3.5761207279183314,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040996780115584995,
|
|
"loss": 5.4195,
|
|
"mean_token_accuracy": 0.1956888884305954,
|
|
"num_tokens": 8289725.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 5.849604320526123,
|
|
"epoch": 3.5805592543275635,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004096920278177153,
|
|
"loss": 5.4054,
|
|
"mean_token_accuracy": 0.19833215177059174,
|
|
"num_tokens": 8300391.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 5.870030736923217,
|
|
"epoch": 3.5849977807367956,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004094159387706703,
|
|
"loss": 5.4031,
|
|
"mean_token_accuracy": 0.19163014888763427,
|
|
"num_tokens": 8310656.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 5.793809986114502,
|
|
"epoch": 3.589436307146028,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004091395346618491,
|
|
"loss": 5.3533,
|
|
"mean_token_accuracy": 0.2000315383076668,
|
|
"num_tokens": 8320605.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 5.88753571510315,
|
|
"epoch": 3.5938748335552595,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040886281613912396,
|
|
"loss": 5.4909,
|
|
"mean_token_accuracy": 0.18160921484231948,
|
|
"num_tokens": 8331683.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 5.859517431259155,
|
|
"epoch": 3.5983133599644916,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004085857838511042,
|
|
"loss": 5.494,
|
|
"mean_token_accuracy": 0.18673501014709473,
|
|
"num_tokens": 8342132.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 5.813091182708741,
|
|
"epoch": 3.602751886373724,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040830843844713447,
|
|
"loss": 5.4091,
|
|
"mean_token_accuracy": 0.1943575844168663,
|
|
"num_tokens": 8352202.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 5.824704217910766,
|
|
"epoch": 3.607190412782956,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040803078057729354,
|
|
"loss": 5.4583,
|
|
"mean_token_accuracy": 0.18807061463594438,
|
|
"num_tokens": 8362204.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 5.858654499053955,
|
|
"epoch": 3.611628939192188,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004077528108923924,
|
|
"loss": 5.4523,
|
|
"mean_token_accuracy": 0.19497880935668946,
|
|
"num_tokens": 8372525.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 5.830624771118164,
|
|
"epoch": 3.6160674656014202,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004074745300439732,
|
|
"loss": 5.4152,
|
|
"mean_token_accuracy": 0.1913478270173073,
|
|
"num_tokens": 8383007.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 5.777306318283081,
|
|
"epoch": 3.6205059920106524,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000407195938684307,
|
|
"loss": 5.3941,
|
|
"mean_token_accuracy": 0.19022576361894608,
|
|
"num_tokens": 8392928.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 5.886033535003662,
|
|
"epoch": 3.6249445184198845,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000406917037466393,
|
|
"loss": 5.4263,
|
|
"mean_token_accuracy": 0.19012691229581832,
|
|
"num_tokens": 8403008.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 5.789344787597656,
|
|
"epoch": 3.6293830448291167,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004066378270439567,
|
|
"loss": 5.4782,
|
|
"mean_token_accuracy": 0.17886057496070862,
|
|
"num_tokens": 8413513.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 5.841081666946411,
|
|
"epoch": 3.633821571238349,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004063583080714481,
|
|
"loss": 5.3738,
|
|
"mean_token_accuracy": 0.1967576861381531,
|
|
"num_tokens": 8423894.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 5.8004848003387455,
|
|
"epoch": 3.638260097647581,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040607848120404063,
|
|
"loss": 5.413,
|
|
"mean_token_accuracy": 0.19520466923713684,
|
|
"num_tokens": 8434467.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 5.803511476516723,
|
|
"epoch": 3.642698624056813,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004057983470976293,
|
|
"loss": 5.357,
|
|
"mean_token_accuracy": 0.2016320988535881,
|
|
"num_tokens": 8446037.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 5.77181224822998,
|
|
"epoch": 3.6471371504660453,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040551790640882954,
|
|
"loss": 5.4094,
|
|
"mean_token_accuracy": 0.20021369606256484,
|
|
"num_tokens": 8457032.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 5.854924535751342,
|
|
"epoch": 3.6515756768752774,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00040523715979497486,
|
|
"loss": 5.4118,
|
|
"mean_token_accuracy": 0.19359598606824874,
|
|
"num_tokens": 8466088.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 5.865506505966186,
|
|
"epoch": 3.6560142032845095,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004049561079141163,
|
|
"loss": 5.4117,
|
|
"mean_token_accuracy": 0.19178108721971512,
|
|
"num_tokens": 8477214.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 5.798425579071045,
|
|
"epoch": 3.6604527296937417,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004046747514250202,
|
|
"loss": 5.4725,
|
|
"mean_token_accuracy": 0.19099220335483552,
|
|
"num_tokens": 8488031.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 5.95139889717102,
|
|
"epoch": 3.664891256102974,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004043930909871671,
|
|
"loss": 5.5991,
|
|
"mean_token_accuracy": 0.18338969349861145,
|
|
"num_tokens": 8500214.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 5.890401697158813,
|
|
"epoch": 3.669329782512206,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040411112726074954,
|
|
"loss": 5.439,
|
|
"mean_token_accuracy": 0.19255967885255815,
|
|
"num_tokens": 8509768.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 5.854125690460205,
|
|
"epoch": 3.673768308921438,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040382886090667154,
|
|
"loss": 5.4488,
|
|
"mean_token_accuracy": 0.19439015686511993,
|
|
"num_tokens": 8519967.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 5.899671220779419,
|
|
"epoch": 3.6782068353306703,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004035462925865459,
|
|
"loss": 5.4697,
|
|
"mean_token_accuracy": 0.18602120280265808,
|
|
"num_tokens": 8531624.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 5.917951536178589,
|
|
"epoch": 3.6826453617399024,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00040326342296269363,
|
|
"loss": 5.4044,
|
|
"mean_token_accuracy": 0.19721968472003937,
|
|
"num_tokens": 8542130.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 5.776456356048584,
|
|
"epoch": 3.6870838881491346,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00040298025269814165,
|
|
"loss": 5.4315,
|
|
"mean_token_accuracy": 0.19611175805330278,
|
|
"num_tokens": 8552155.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 5.807200622558594,
|
|
"epoch": 3.6915224145583667,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004026967824566218,
|
|
"loss": 5.3751,
|
|
"mean_token_accuracy": 0.19862941205501555,
|
|
"num_tokens": 8561602.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 5.829988574981689,
|
|
"epoch": 3.695960940967599,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000402413012902569,
|
|
"loss": 5.3549,
|
|
"mean_token_accuracy": 0.1946346491575241,
|
|
"num_tokens": 8571957.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 5.757293558120727,
|
|
"epoch": 3.700399467376831,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040212894470111966,
|
|
"loss": 5.3879,
|
|
"mean_token_accuracy": 0.19661612063646317,
|
|
"num_tokens": 8582550.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 5.827823162078857,
|
|
"epoch": 3.704837993786063,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004018445785181102,
|
|
"loss": 5.422,
|
|
"mean_token_accuracy": 0.19695309102535247,
|
|
"num_tokens": 8592353.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 5.832696485519409,
|
|
"epoch": 3.7092765201952953,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004015599150200755,
|
|
"loss": 5.4116,
|
|
"mean_token_accuracy": 0.1886480987071991,
|
|
"num_tokens": 8602629.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 5.811392307281494,
|
|
"epoch": 3.7137150466045274,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00040127495487424735,
|
|
"loss": 5.4699,
|
|
"mean_token_accuracy": 0.19141082167625428,
|
|
"num_tokens": 8612308.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 5.834705829620361,
|
|
"epoch": 3.7181535730137596,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004009896987485531,
|
|
"loss": 5.366,
|
|
"mean_token_accuracy": 0.20177424997091292,
|
|
"num_tokens": 8622177.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 5.809908723831176,
|
|
"epoch": 3.7225920994229913,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00040070414731161326,
|
|
"loss": 5.443,
|
|
"mean_token_accuracy": 0.19458999037742614,
|
|
"num_tokens": 8632435.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 5.747843647003174,
|
|
"epoch": 3.7270306258322234,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040041830123274105,
|
|
"loss": 5.2288,
|
|
"mean_token_accuracy": 0.20880044400691986,
|
|
"num_tokens": 8642331.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 5.903952407836914,
|
|
"epoch": 3.7314691522414556,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004001321611819401,
|
|
"loss": 5.3903,
|
|
"mean_token_accuracy": 0.18388656824827193,
|
|
"num_tokens": 8652838.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 5.80471625328064,
|
|
"epoch": 3.7359076786506877,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003998457278299033,
|
|
"loss": 5.4137,
|
|
"mean_token_accuracy": 0.19091238379478453,
|
|
"num_tokens": 8662908.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 5.801855611801147,
|
|
"epoch": 3.74034620505992,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003995590018480107,
|
|
"loss": 5.4813,
|
|
"mean_token_accuracy": 0.18728871196508406,
|
|
"num_tokens": 8673015.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 5.828760576248169,
|
|
"epoch": 3.744784731469152,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00039927198390832843,
|
|
"loss": 5.3716,
|
|
"mean_token_accuracy": 0.20105525702238083,
|
|
"num_tokens": 8682149.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 5.803042364120484,
|
|
"epoch": 3.749223257878384,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000398984674683607,
|
|
"loss": 5.3658,
|
|
"mean_token_accuracy": 0.19573144614696503,
|
|
"num_tokens": 8692715.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 5.784009027481079,
|
|
"epoch": 3.7536617842876163,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003986970748472795,
|
|
"loss": 5.4067,
|
|
"mean_token_accuracy": 0.20018333494663237,
|
|
"num_tokens": 8702379.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 5.8258195400238035,
|
|
"epoch": 3.7581003106968485,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003984091850734604,
|
|
"loss": 5.3853,
|
|
"mean_token_accuracy": 0.19552432000637054,
|
|
"num_tokens": 8712653.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 5.8420146942138675,
|
|
"epoch": 3.7625388371060806,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0003981210060369435,
|
|
"loss": 5.4715,
|
|
"mean_token_accuracy": 0.18399242907762528,
|
|
"num_tokens": 8724054.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 5.857115030288696,
|
|
"epoch": 3.7669773635153128,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000397832538413201,
|
|
"loss": 5.5001,
|
|
"mean_token_accuracy": 0.18325462341308593,
|
|
"num_tokens": 8734629.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 5.845765590667725,
|
|
"epoch": 3.771415889924545,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003975437828783811,
|
|
"loss": 5.4329,
|
|
"mean_token_accuracy": 0.1934712439775467,
|
|
"num_tokens": 8746198.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 5.730560302734375,
|
|
"epoch": 3.775854416333777,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039725474010930716,
|
|
"loss": 5.3907,
|
|
"mean_token_accuracy": 0.20444272756576537,
|
|
"num_tokens": 8756604.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 5.827708339691162,
|
|
"epoch": 3.780292942743009,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003969654107834756,
|
|
"loss": 5.4509,
|
|
"mean_token_accuracy": 0.1945435181260109,
|
|
"num_tokens": 8768088.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 5.82703127861023,
|
|
"epoch": 3.7847314691522413,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0003966757955790547,
|
|
"loss": 5.3874,
|
|
"mean_token_accuracy": 0.19351006299257278,
|
|
"num_tokens": 8778318.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 5.848085165023804,
|
|
"epoch": 3.7891699955614735,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003963858951748826,
|
|
"loss": 5.4017,
|
|
"mean_token_accuracy": 0.1907930001616478,
|
|
"num_tokens": 8788659.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 5.796998500823975,
|
|
"epoch": 3.7936085219707056,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003960957102504661,
|
|
"loss": 5.4293,
|
|
"mean_token_accuracy": 0.18963894993066788,
|
|
"num_tokens": 8799052.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 5.907032918930054,
|
|
"epoch": 3.798047048379938,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003958052414859788,
|
|
"loss": 5.4359,
|
|
"mean_token_accuracy": 0.1835399091243744,
|
|
"num_tokens": 8808534.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 5.759076499938965,
|
|
"epoch": 3.80248557478917,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003955144895622597,
|
|
"loss": 5.3888,
|
|
"mean_token_accuracy": 0.1968761757016182,
|
|
"num_tokens": 8818802.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 5.813445806503296,
|
|
"epoch": 3.806924101198402,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003952234551608114,
|
|
"loss": 5.3661,
|
|
"mean_token_accuracy": 0.18817414045333863,
|
|
"num_tokens": 8829123.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 5.800790023803711,
|
|
"epoch": 3.8113626276076342,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003949321389637986,
|
|
"loss": 5.4292,
|
|
"mean_token_accuracy": 0.19044290333986283,
|
|
"num_tokens": 8839771.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 5.825014877319336,
|
|
"epoch": 3.8158011540168664,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003946405416540466,
|
|
"loss": 5.4491,
|
|
"mean_token_accuracy": 0.18945735543966294,
|
|
"num_tokens": 8849621.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 5.940211343765259,
|
|
"epoch": 3.8202396804260985,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039434866391503963,
|
|
"loss": 5.4527,
|
|
"mean_token_accuracy": 0.1803130567073822,
|
|
"num_tokens": 8860672.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 5.789125680923462,
|
|
"epoch": 3.8246782068353307,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039405650643091917,
|
|
"loss": 5.3998,
|
|
"mean_token_accuracy": 0.19494441598653794,
|
|
"num_tokens": 8870721.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 5.757489824295044,
|
|
"epoch": 3.829116733244563,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003937640698864823,
|
|
"loss": 5.4515,
|
|
"mean_token_accuracy": 0.19027765691280366,
|
|
"num_tokens": 8882142.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 5.861147117614746,
|
|
"epoch": 3.833555259653795,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039347135496718027,
|
|
"loss": 5.4136,
|
|
"mean_token_accuracy": 0.1945791110396385,
|
|
"num_tokens": 8892573.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 5.772451877593994,
|
|
"epoch": 3.837993786063027,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00039317836235911705,
|
|
"loss": 5.4017,
|
|
"mean_token_accuracy": 0.195092111825943,
|
|
"num_tokens": 8902942.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 5.806214046478272,
|
|
"epoch": 3.8424323124722592,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003928850927490472,
|
|
"loss": 5.4216,
|
|
"mean_token_accuracy": 0.18946156948804854,
|
|
"num_tokens": 8913208.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 5.805463075637817,
|
|
"epoch": 3.8468708388814914,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003925915468243746,
|
|
"loss": 5.4276,
|
|
"mean_token_accuracy": 0.1883111536502838,
|
|
"num_tokens": 8923080.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 5.89415135383606,
|
|
"epoch": 3.8513093652907235,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00039229772527315073,
|
|
"loss": 5.4224,
|
|
"mean_token_accuracy": 0.18533381819725037,
|
|
"num_tokens": 8933823.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 5.795059251785278,
|
|
"epoch": 3.8557478916999557,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003920036287840734,
|
|
"loss": 5.3395,
|
|
"mean_token_accuracy": 0.19785182178020477,
|
|
"num_tokens": 8943412.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 5.793986701965332,
|
|
"epoch": 3.860186418109188,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039170925804648486,
|
|
"loss": 5.4513,
|
|
"mean_token_accuracy": 0.19680401533842087,
|
|
"num_tokens": 8953616.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 5.841963052749634,
|
|
"epoch": 3.86462494451842,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00039141461375036957,
|
|
"loss": 5.4467,
|
|
"mean_token_accuracy": 0.18167138546705247,
|
|
"num_tokens": 8964790.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 5.803447532653808,
|
|
"epoch": 3.869063470927652,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003911196965863539,
|
|
"loss": 5.3662,
|
|
"mean_token_accuracy": 0.1910330817103386,
|
|
"num_tokens": 8975476.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 5.852850914001465,
|
|
"epoch": 3.8735019973368843,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039082450724570357,
|
|
"loss": 5.4888,
|
|
"mean_token_accuracy": 0.18827887177467345,
|
|
"num_tokens": 8986132.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 5.80005111694336,
|
|
"epoch": 3.8779405237461164,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003905290464203221,
|
|
"loss": 5.4303,
|
|
"mean_token_accuracy": 0.19234416782855987,
|
|
"num_tokens": 8996384.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 5.816908454895019,
|
|
"epoch": 3.8823790501553486,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003902333148027495,
|
|
"loss": 5.391,
|
|
"mean_token_accuracy": 0.20051574110984802,
|
|
"num_tokens": 9006288.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 5.857726764678955,
|
|
"epoch": 3.8868175765645807,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003899373130861605,
|
|
"loss": 5.4102,
|
|
"mean_token_accuracy": 0.19304264485836028,
|
|
"num_tokens": 9016713.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 5.917016649246216,
|
|
"epoch": 3.891256102973813,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038964104196436284,
|
|
"loss": 5.3835,
|
|
"mean_token_accuracy": 0.19150962233543395,
|
|
"num_tokens": 9026524.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 5.777474451065063,
|
|
"epoch": 3.895694629383045,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038934450213179596,
|
|
"loss": 5.4493,
|
|
"mean_token_accuracy": 0.1875316545367241,
|
|
"num_tokens": 9037063.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 5.824544095993042,
|
|
"epoch": 3.900133155792277,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038904769428352873,
|
|
"loss": 5.4017,
|
|
"mean_token_accuracy": 0.1963329166173935,
|
|
"num_tokens": 9047685.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 5.849619722366333,
|
|
"epoch": 3.9045716822015093,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00038875061911525856,
|
|
"loss": 5.3666,
|
|
"mean_token_accuracy": 0.1921242356300354,
|
|
"num_tokens": 9058084.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 5.744299793243409,
|
|
"epoch": 3.9090102086107414,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003884532773233094,
|
|
"loss": 5.3635,
|
|
"mean_token_accuracy": 0.20264142900705337,
|
|
"num_tokens": 9068384.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 5.833960247039795,
|
|
"epoch": 3.9134487350199736,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00038815566960463015,
|
|
"loss": 5.4482,
|
|
"mean_token_accuracy": 0.18840712010860444,
|
|
"num_tokens": 9079222.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 5.850077724456787,
|
|
"epoch": 3.9178872614292057,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00038785779665679275,
|
|
"loss": 5.4202,
|
|
"mean_token_accuracy": 0.18839995115995406,
|
|
"num_tokens": 9089526.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 5.751740980148315,
|
|
"epoch": 3.922325787838438,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003875596591779913,
|
|
"loss": 5.3186,
|
|
"mean_token_accuracy": 0.2056492105126381,
|
|
"num_tokens": 9099054.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 5.793323278427124,
|
|
"epoch": 3.92676431424767,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003872612578670395,
|
|
"loss": 5.4754,
|
|
"mean_token_accuracy": 0.18841795325279237,
|
|
"num_tokens": 9109290.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 5.885016775131225,
|
|
"epoch": 3.931202840656902,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00038696259342336966,
|
|
"loss": 5.499,
|
|
"mean_token_accuracy": 0.18841444998979567,
|
|
"num_tokens": 9120796.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 5.861675357818603,
|
|
"epoch": 3.935641367066134,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00038666366654703077,
|
|
"loss": 5.4846,
|
|
"mean_token_accuracy": 0.1862151712179184,
|
|
"num_tokens": 9131306.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 5.840978145599365,
|
|
"epoch": 3.940079893475366,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00038636447793868715,
|
|
"loss": 5.4734,
|
|
"mean_token_accuracy": 0.18990519195795058,
|
|
"num_tokens": 9140278.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 5.851602220535279,
|
|
"epoch": 3.944518419884598,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00038606502829961645,
|
|
"loss": 5.4267,
|
|
"mean_token_accuracy": 0.19005220383405685,
|
|
"num_tokens": 9150742.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 5.7608050346374515,
|
|
"epoch": 3.9489569462938303,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003857653183317081,
|
|
"loss": 5.3303,
|
|
"mean_token_accuracy": 0.19899591207504272,
|
|
"num_tokens": 9160227.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 5.791858434677124,
|
|
"epoch": 3.9533954727030625,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003854653487374617,
|
|
"loss": 5.4306,
|
|
"mean_token_accuracy": 0.19147539585828782,
|
|
"num_tokens": 9170733.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 5.8443633079528805,
|
|
"epoch": 3.9578339991122946,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003851651202199856,
|
|
"loss": 5.413,
|
|
"mean_token_accuracy": 0.19143973886966706,
|
|
"num_tokens": 9180582.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 5.821952390670776,
|
|
"epoch": 3.9622725255215268,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003848646334829949,
|
|
"loss": 5.4525,
|
|
"mean_token_accuracy": 0.1855350062251091,
|
|
"num_tokens": 9191245.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 5.840106630325318,
|
|
"epoch": 3.966711051930759,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038456388923081006,
|
|
"loss": 5.4459,
|
|
"mean_token_accuracy": 0.18592941164970397,
|
|
"num_tokens": 9201657.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 5.830752325057984,
|
|
"epoch": 3.971149578339991,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038426288816835485,
|
|
"loss": 5.4103,
|
|
"mean_token_accuracy": 0.18891609460115433,
|
|
"num_tokens": 9212102.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 5.847698926925659,
|
|
"epoch": 3.975588104749223,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003839616310011554,
|
|
"loss": 5.3934,
|
|
"mean_token_accuracy": 0.18960051685571672,
|
|
"num_tokens": 9221022.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 5.806353616714477,
|
|
"epoch": 3.9800266311584553,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003836601184353379,
|
|
"loss": 5.4564,
|
|
"mean_token_accuracy": 0.18732759356498718,
|
|
"num_tokens": 9232105.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 5.804685926437378,
|
|
"epoch": 3.9844651575676875,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00038335835117762706,
|
|
"loss": 5.3984,
|
|
"mean_token_accuracy": 0.1938449651002884,
|
|
"num_tokens": 9242338.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 5.864504861831665,
|
|
"epoch": 3.9889036839769196,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00038305632993534483,
|
|
"loss": 5.4276,
|
|
"mean_token_accuracy": 0.1886606141924858,
|
|
"num_tokens": 9252551.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 5.843533515930176,
|
|
"epoch": 3.993342210386152,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00038275405541640835,
|
|
"loss": 5.403,
|
|
"mean_token_accuracy": 0.19167436361312867,
|
|
"num_tokens": 9263424.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"epoch": 3.993342210386152,
|
|
"eval_entropy": 5.580333083372501,
|
|
"eval_loss": 5.84522008895874,
|
|
"eval_mean_token_accuracy": 0.17348938688388063,
|
|
"eval_num_tokens": 9263424.0,
|
|
"eval_runtime": 2.2779,
|
|
"eval_samples_per_second": 1478.121,
|
|
"eval_steps_per_second": 184.82,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 5.849137592315674,
|
|
"epoch": 3.997780736795384,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00038245152832932843,
|
|
"loss": 5.4953,
|
|
"mean_token_accuracy": 0.1837543785572052,
|
|
"num_tokens": 9274355.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 5.780615064832899,
|
|
"epoch": 4.001775410563693,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00038214874938320795,
|
|
"loss": 5.2503,
|
|
"mean_token_accuracy": 0.205965217616823,
|
|
"num_tokens": 9283179.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 5.817928743362427,
|
|
"epoch": 4.006213936972925,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003818457192877399,
|
|
"loss": 5.1978,
|
|
"mean_token_accuracy": 0.208414126932621,
|
|
"num_tokens": 9293709.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 5.824892950057984,
|
|
"epoch": 4.010652463382157,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003815424387532063,
|
|
"loss": 5.2238,
|
|
"mean_token_accuracy": 0.21198973655700684,
|
|
"num_tokens": 9303971.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 5.810022640228271,
|
|
"epoch": 4.015090989791389,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000381238908490476,
|
|
"loss": 5.1717,
|
|
"mean_token_accuracy": 0.208732508122921,
|
|
"num_tokens": 9313578.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 5.752050828933716,
|
|
"epoch": 4.019529516200621,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038093512921100306,
|
|
"loss": 5.1907,
|
|
"mean_token_accuracy": 0.2054088294506073,
|
|
"num_tokens": 9323538.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 5.838475942611694,
|
|
"epoch": 4.023968042609853,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003806311016268254,
|
|
"loss": 5.1886,
|
|
"mean_token_accuracy": 0.20790643393993377,
|
|
"num_tokens": 9335266.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 5.79393162727356,
|
|
"epoch": 4.028406569019086,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000380326826450563,
|
|
"loss": 5.1481,
|
|
"mean_token_accuracy": 0.20686888098716735,
|
|
"num_tokens": 9345247.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 5.778472805023194,
|
|
"epoch": 4.032845095428318,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00038002230439541603,
|
|
"loss": 5.1838,
|
|
"mean_token_accuracy": 0.20136410593986512,
|
|
"num_tokens": 9355435.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 5.719447374343872,
|
|
"epoch": 4.03728362183755,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00037971753617516336,
|
|
"loss": 5.109,
|
|
"mean_token_accuracy": 0.2196057543158531,
|
|
"num_tokens": 9365503.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 5.798331022262573,
|
|
"epoch": 4.041722148246782,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00037941252250416074,
|
|
"loss": 5.0692,
|
|
"mean_token_accuracy": 0.21513248682022096,
|
|
"num_tokens": 9374361.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 5.722120237350464,
|
|
"epoch": 4.046160674656014,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00037910726409733965,
|
|
"loss": 5.0786,
|
|
"mean_token_accuracy": 0.22050419300794602,
|
|
"num_tokens": 9383992.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 5.756671810150147,
|
|
"epoch": 4.050599201065246,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003788017616702048,
|
|
"loss": 5.2069,
|
|
"mean_token_accuracy": 0.20192554146051406,
|
|
"num_tokens": 9394270.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 5.837602424621582,
|
|
"epoch": 4.055037727474478,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00037849601593883297,
|
|
"loss": 5.1378,
|
|
"mean_token_accuracy": 0.20951651483774186,
|
|
"num_tokens": 9404913.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 5.830431222915649,
|
|
"epoch": 4.059476253883711,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00037819002761987127,
|
|
"loss": 5.2469,
|
|
"mean_token_accuracy": 0.20075388699769975,
|
|
"num_tokens": 9415718.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 5.777271699905396,
|
|
"epoch": 4.063914780292943,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003778837974305355,
|
|
"loss": 5.1694,
|
|
"mean_token_accuracy": 0.20675463527441024,
|
|
"num_tokens": 9425761.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 5.696642255783081,
|
|
"epoch": 4.068353306702175,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00037757732608860824,
|
|
"loss": 5.1757,
|
|
"mean_token_accuracy": 0.2074501171708107,
|
|
"num_tokens": 9437519.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 5.773201513290405,
|
|
"epoch": 4.072791833111407,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00037727061431243737,
|
|
"loss": 5.0117,
|
|
"mean_token_accuracy": 0.22399133294820786,
|
|
"num_tokens": 9447452.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 5.802689504623413,
|
|
"epoch": 4.077230359520639,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00037696366282093433,
|
|
"loss": 5.2194,
|
|
"mean_token_accuracy": 0.20754450112581252,
|
|
"num_tokens": 9458155.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 5.665275192260742,
|
|
"epoch": 4.081668885929871,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00037665647233357243,
|
|
"loss": 5.035,
|
|
"mean_token_accuracy": 0.22337092012166976,
|
|
"num_tokens": 9467478.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 5.747597599029541,
|
|
"epoch": 4.0861074123391035,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003763490435703853,
|
|
"loss": 5.1954,
|
|
"mean_token_accuracy": 0.2060795918107033,
|
|
"num_tokens": 9478636.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 5.818109655380249,
|
|
"epoch": 4.090545938748336,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003760413772519648,
|
|
"loss": 5.1343,
|
|
"mean_token_accuracy": 0.21224167048931122,
|
|
"num_tokens": 9488626.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 5.805790519714355,
|
|
"epoch": 4.094984465157568,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00037573347409945983,
|
|
"loss": 5.2094,
|
|
"mean_token_accuracy": 0.20401569008827208,
|
|
"num_tokens": 9501119.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 5.736809253692627,
|
|
"epoch": 4.0994229915668,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003754253348345743,
|
|
"loss": 5.0526,
|
|
"mean_token_accuracy": 0.21723955422639846,
|
|
"num_tokens": 9511075.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 5.720714664459228,
|
|
"epoch": 4.103861517976032,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003751169601795657,
|
|
"loss": 5.1149,
|
|
"mean_token_accuracy": 0.2152253657579422,
|
|
"num_tokens": 9520956.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 5.765715742111206,
|
|
"epoch": 4.108300044385264,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00037480835085724313,
|
|
"loss": 5.1922,
|
|
"mean_token_accuracy": 0.20740145891904832,
|
|
"num_tokens": 9531020.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 5.826910781860351,
|
|
"epoch": 4.112738570794496,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003744995075909656,
|
|
"loss": 5.1995,
|
|
"mean_token_accuracy": 0.20915032178163528,
|
|
"num_tokens": 9541230.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 5.742929315567016,
|
|
"epoch": 4.1171770972037285,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003741904311046408,
|
|
"loss": 5.1937,
|
|
"mean_token_accuracy": 0.20653378814458848,
|
|
"num_tokens": 9551055.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 5.820126247406006,
|
|
"epoch": 4.121615623612961,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003738811221227228,
|
|
"loss": 5.2131,
|
|
"mean_token_accuracy": 0.2067299783229828,
|
|
"num_tokens": 9560982.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 5.5898134231567385,
|
|
"epoch": 4.126054150022193,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00037357158137021077,
|
|
"loss": 5.0703,
|
|
"mean_token_accuracy": 0.21925579160451888,
|
|
"num_tokens": 9571950.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 5.7765885353088375,
|
|
"epoch": 4.130492676431425,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000373261809572647,
|
|
"loss": 5.192,
|
|
"mean_token_accuracy": 0.2030755400657654,
|
|
"num_tokens": 9581670.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 5.8400060653686525,
|
|
"epoch": 4.134931202840657,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00037295180745611553,
|
|
"loss": 5.2075,
|
|
"mean_token_accuracy": 0.2056944653391838,
|
|
"num_tokens": 9592282.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 5.656895732879638,
|
|
"epoch": 4.139369729249889,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003726415757472401,
|
|
"loss": 5.1455,
|
|
"mean_token_accuracy": 0.21399735808372497,
|
|
"num_tokens": 9602530.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 5.784669542312622,
|
|
"epoch": 4.143808255659121,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00037233111517318257,
|
|
"loss": 5.2154,
|
|
"mean_token_accuracy": 0.20880706161260604,
|
|
"num_tokens": 9612454.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 5.761039924621582,
|
|
"epoch": 4.1482467820683535,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003720204264616414,
|
|
"loss": 5.1301,
|
|
"mean_token_accuracy": 0.21270381510257722,
|
|
"num_tokens": 9623461.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 5.727607536315918,
|
|
"epoch": 4.152685308477586,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003717095103408497,
|
|
"loss": 5.1241,
|
|
"mean_token_accuracy": 0.21046421229839324,
|
|
"num_tokens": 9632502.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 5.74509973526001,
|
|
"epoch": 4.157123834886818,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00037139836753957353,
|
|
"loss": 5.1327,
|
|
"mean_token_accuracy": 0.2110206052660942,
|
|
"num_tokens": 9642801.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 5.717509031295776,
|
|
"epoch": 4.16156236129605,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00037108699878711044,
|
|
"loss": 5.1467,
|
|
"mean_token_accuracy": 0.22023138552904128,
|
|
"num_tokens": 9652638.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 5.7005359649658205,
|
|
"epoch": 4.166000887705282,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00037077540481328744,
|
|
"loss": 5.1091,
|
|
"mean_token_accuracy": 0.21125866025686263,
|
|
"num_tokens": 9662480.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 5.737263202667236,
|
|
"epoch": 4.170439414114514,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003704635863484596,
|
|
"loss": 5.2501,
|
|
"mean_token_accuracy": 0.20748572200536727,
|
|
"num_tokens": 9673269.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 5.7536533832550045,
|
|
"epoch": 4.174877940523746,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00037015154412350806,
|
|
"loss": 5.0887,
|
|
"mean_token_accuracy": 0.20911131352186202,
|
|
"num_tokens": 9682905.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 5.684925746917725,
|
|
"epoch": 4.1793164669329785,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00036983927886983847,
|
|
"loss": 5.1556,
|
|
"mean_token_accuracy": 0.212339323759079,
|
|
"num_tokens": 9693609.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 5.720796203613281,
|
|
"epoch": 4.183754993342211,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00036952679131937923,
|
|
"loss": 5.1308,
|
|
"mean_token_accuracy": 0.21655481159687043,
|
|
"num_tokens": 9703927.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 5.760318803787231,
|
|
"epoch": 4.188193519751443,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003692140822045798,
|
|
"loss": 5.1275,
|
|
"mean_token_accuracy": 0.21760178804397584,
|
|
"num_tokens": 9714440.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 5.6793900489807125,
|
|
"epoch": 4.192632046160675,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00036890115225840904,
|
|
"loss": 5.1579,
|
|
"mean_token_accuracy": 0.21766061335802078,
|
|
"num_tokens": 9724586.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 5.717368078231812,
|
|
"epoch": 4.197070572569907,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003685880022143533,
|
|
"loss": 5.1252,
|
|
"mean_token_accuracy": 0.2100989669561386,
|
|
"num_tokens": 9734602.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 5.812760972976685,
|
|
"epoch": 4.201509098979139,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00036827463280641494,
|
|
"loss": 5.2243,
|
|
"mean_token_accuracy": 0.19821423143148423,
|
|
"num_tokens": 9744970.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 5.766703367233276,
|
|
"epoch": 4.205947625388371,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00036796104476911033,
|
|
"loss": 5.1653,
|
|
"mean_token_accuracy": 0.2106243133544922,
|
|
"num_tokens": 9754529.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 5.708454179763794,
|
|
"epoch": 4.210386151797604,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00036764723883746865,
|
|
"loss": 5.1962,
|
|
"mean_token_accuracy": 0.20117447674274444,
|
|
"num_tokens": 9765742.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 5.742970275878906,
|
|
"epoch": 4.214824678206836,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003673332157470293,
|
|
"loss": 5.1156,
|
|
"mean_token_accuracy": 0.2144193544983864,
|
|
"num_tokens": 9776563.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 5.772315835952758,
|
|
"epoch": 4.219263204616068,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000367018976233841,
|
|
"loss": 5.137,
|
|
"mean_token_accuracy": 0.2113969936966896,
|
|
"num_tokens": 9786663.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 5.725389003753662,
|
|
"epoch": 4.2237017310253,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003667045210344598,
|
|
"loss": 5.1432,
|
|
"mean_token_accuracy": 0.2056875169277191,
|
|
"num_tokens": 9796499.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 5.7241839408874515,
|
|
"epoch": 4.228140257434532,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003663898508859471,
|
|
"loss": 5.1622,
|
|
"mean_token_accuracy": 0.21654269099235535,
|
|
"num_tokens": 9807305.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 5.753515100479126,
|
|
"epoch": 4.232578783843764,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003660749665258684,
|
|
"loss": 5.1908,
|
|
"mean_token_accuracy": 0.20672854781150818,
|
|
"num_tokens": 9818259.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 5.696164798736572,
|
|
"epoch": 4.237017310252996,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003657598686922909,
|
|
"loss": 5.1094,
|
|
"mean_token_accuracy": 0.21507840007543563,
|
|
"num_tokens": 9830146.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 5.7545092582702635,
|
|
"epoch": 4.241455836662228,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003654445581237824,
|
|
"loss": 5.1845,
|
|
"mean_token_accuracy": 0.20769521594047546,
|
|
"num_tokens": 9840847.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 5.662838459014893,
|
|
"epoch": 4.245894363071461,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003651290355594096,
|
|
"loss": 5.1024,
|
|
"mean_token_accuracy": 0.2179262727499008,
|
|
"num_tokens": 9850948.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 5.748239183425904,
|
|
"epoch": 4.250332889480692,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003648133017387356,
|
|
"loss": 5.1987,
|
|
"mean_token_accuracy": 0.20759087502956391,
|
|
"num_tokens": 9861205.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 5.666525506973267,
|
|
"epoch": 4.254771415889924,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00036449735740181884,
|
|
"loss": 5.1803,
|
|
"mean_token_accuracy": 0.205241397023201,
|
|
"num_tokens": 9871660.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 5.73541841506958,
|
|
"epoch": 4.259209942299156,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00036418120328921146,
|
|
"loss": 5.0938,
|
|
"mean_token_accuracy": 0.22027103304862977,
|
|
"num_tokens": 9881533.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 5.766236066818237,
|
|
"epoch": 4.263648468708388,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00036386484014195696,
|
|
"loss": 5.2506,
|
|
"mean_token_accuracy": 0.20312998443841934,
|
|
"num_tokens": 9892707.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 5.696821928024292,
|
|
"epoch": 4.268086995117621,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003635482687015891,
|
|
"loss": 5.0745,
|
|
"mean_token_accuracy": 0.21657687425613403,
|
|
"num_tokens": 9901562.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 5.70862922668457,
|
|
"epoch": 4.272525521526853,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00036323148971012954,
|
|
"loss": 5.1427,
|
|
"mean_token_accuracy": 0.2149751827120781,
|
|
"num_tokens": 9910742.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 5.784573650360107,
|
|
"epoch": 4.276964047936085,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00036291450391008655,
|
|
"loss": 5.2066,
|
|
"mean_token_accuracy": 0.20904852747917174,
|
|
"num_tokens": 9922322.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 5.728090095520019,
|
|
"epoch": 4.281402574345317,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00036259731204445347,
|
|
"loss": 5.117,
|
|
"mean_token_accuracy": 0.20740775316953658,
|
|
"num_tokens": 9931868.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 5.731380271911621,
|
|
"epoch": 4.285841100754549,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003622799148567061,
|
|
"loss": 5.179,
|
|
"mean_token_accuracy": 0.21309688240289687,
|
|
"num_tokens": 9942198.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 5.804520463943481,
|
|
"epoch": 4.290279627163781,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003619623130908017,
|
|
"loss": 5.209,
|
|
"mean_token_accuracy": 0.2023901730775833,
|
|
"num_tokens": 9953094.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 5.745091295242309,
|
|
"epoch": 4.2947181535730135,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003616445074911774,
|
|
"loss": 5.1656,
|
|
"mean_token_accuracy": 0.2081662744283676,
|
|
"num_tokens": 9964759.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 5.738615322113037,
|
|
"epoch": 4.299156679982246,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003613264988027477,
|
|
"loss": 5.1629,
|
|
"mean_token_accuracy": 0.2116822764277458,
|
|
"num_tokens": 9973916.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 5.72474102973938,
|
|
"epoch": 4.303595206391478,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003610082877709031,
|
|
"loss": 5.2008,
|
|
"mean_token_accuracy": 0.20751210302114487,
|
|
"num_tokens": 9985388.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 5.754292154312134,
|
|
"epoch": 4.30803373280071,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00036068987514150866,
|
|
"loss": 5.1662,
|
|
"mean_token_accuracy": 0.21000789403915404,
|
|
"num_tokens": 9996143.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 5.7305224418640135,
|
|
"epoch": 4.312472259209942,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00036037126166090167,
|
|
"loss": 5.2454,
|
|
"mean_token_accuracy": 0.1990845561027527,
|
|
"num_tokens": 10007376.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 5.722129201889038,
|
|
"epoch": 4.316910785619174,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003600524480758906,
|
|
"loss": 5.1317,
|
|
"mean_token_accuracy": 0.2125830441713333,
|
|
"num_tokens": 10016435.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 5.771578645706176,
|
|
"epoch": 4.321349312028406,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00035973343513375254,
|
|
"loss": 5.2502,
|
|
"mean_token_accuracy": 0.20185581594705582,
|
|
"num_tokens": 10027577.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 5.819239234924316,
|
|
"epoch": 4.3257878384376385,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000359414223582232,
|
|
"loss": 5.1953,
|
|
"mean_token_accuracy": 0.1998763546347618,
|
|
"num_tokens": 10037099.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 5.746256351470947,
|
|
"epoch": 4.330226364846871,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003590948141695392,
|
|
"loss": 5.1537,
|
|
"mean_token_accuracy": 0.20699663162231446,
|
|
"num_tokens": 10047718.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 5.696747159957885,
|
|
"epoch": 4.334664891256103,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003587752076443479,
|
|
"loss": 5.1114,
|
|
"mean_token_accuracy": 0.2158285990357399,
|
|
"num_tokens": 10057507.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 5.7871781349182125,
|
|
"epoch": 4.339103417665335,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003584554047557939,
|
|
"loss": 5.2184,
|
|
"mean_token_accuracy": 0.20748222768306732,
|
|
"num_tokens": 10067643.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 5.658500385284424,
|
|
"epoch": 4.343541944074567,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00035813540625347334,
|
|
"loss": 5.0818,
|
|
"mean_token_accuracy": 0.21400361955165864,
|
|
"num_tokens": 10077296.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 5.799658584594726,
|
|
"epoch": 4.347980470483799,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0003578152128874409,
|
|
"loss": 5.2096,
|
|
"mean_token_accuracy": 0.20976602435112,
|
|
"num_tokens": 10087218.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 5.7649839401245115,
|
|
"epoch": 4.352418996893031,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00035749482540820796,
|
|
"loss": 5.2046,
|
|
"mean_token_accuracy": 0.2050032064318657,
|
|
"num_tokens": 10096915.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 5.669079971313477,
|
|
"epoch": 4.3568575233022635,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00035717424456674086,
|
|
"loss": 5.1605,
|
|
"mean_token_accuracy": 0.20748622417449952,
|
|
"num_tokens": 10108096.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 5.729409265518188,
|
|
"epoch": 4.361296049711496,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003568534711144591,
|
|
"loss": 5.1616,
|
|
"mean_token_accuracy": 0.20923524498939514,
|
|
"num_tokens": 10119131.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 5.727017021179199,
|
|
"epoch": 4.365734576120728,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00035653250580323383,
|
|
"loss": 5.2125,
|
|
"mean_token_accuracy": 0.2000671833753586,
|
|
"num_tokens": 10129490.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 5.716195392608642,
|
|
"epoch": 4.37017310252996,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00035621134938538585,
|
|
"loss": 5.0923,
|
|
"mean_token_accuracy": 0.2212134048342705,
|
|
"num_tokens": 10140282.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 5.7920060634613035,
|
|
"epoch": 4.374611628939192,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003558900026136838,
|
|
"loss": 5.2556,
|
|
"mean_token_accuracy": 0.20267445594072342,
|
|
"num_tokens": 10150256.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 5.661780214309692,
|
|
"epoch": 4.379050155348424,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003555684662413424,
|
|
"loss": 5.1197,
|
|
"mean_token_accuracy": 0.21318988204002381,
|
|
"num_tokens": 10160993.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 5.699134492874146,
|
|
"epoch": 4.383488681757656,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003552467410220212,
|
|
"loss": 5.1816,
|
|
"mean_token_accuracy": 0.20566583573818206,
|
|
"num_tokens": 10171585.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 5.622805070877075,
|
|
"epoch": 4.3879272081668885,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0003549248277098221,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.21171367913484573,
|
|
"num_tokens": 10180923.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 5.71085786819458,
|
|
"epoch": 4.392365734576121,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003546027270592878,
|
|
"loss": 5.1071,
|
|
"mean_token_accuracy": 0.21543533205986024,
|
|
"num_tokens": 10190365.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 5.789462852478027,
|
|
"epoch": 4.396804260985353,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00035428043982540017,
|
|
"loss": 5.2529,
|
|
"mean_token_accuracy": 0.2044300004839897,
|
|
"num_tokens": 10200400.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 5.729992198944092,
|
|
"epoch": 4.401242787394585,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00035395796676357855,
|
|
"loss": 5.174,
|
|
"mean_token_accuracy": 0.21109428107738495,
|
|
"num_tokens": 10210489.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 5.7173525333404545,
|
|
"epoch": 4.405681313803817,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003536353086296778,
|
|
"loss": 5.1718,
|
|
"mean_token_accuracy": 0.20589128136634827,
|
|
"num_tokens": 10221141.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 5.723089933395386,
|
|
"epoch": 4.410119840213049,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00035331246617998654,
|
|
"loss": 5.1542,
|
|
"mean_token_accuracy": 0.2141341060400009,
|
|
"num_tokens": 10230776.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 5.744500684738159,
|
|
"epoch": 4.414558366622281,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003529894401712253,
|
|
"loss": 5.1449,
|
|
"mean_token_accuracy": 0.21146791875362397,
|
|
"num_tokens": 10240366.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 5.6858978271484375,
|
|
"epoch": 4.4189968930315136,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00035266623136054505,
|
|
"loss": 5.1778,
|
|
"mean_token_accuracy": 0.20696759223937988,
|
|
"num_tokens": 10250833.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 5.750640869140625,
|
|
"epoch": 4.423435419440746,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00035234284050552516,
|
|
"loss": 5.2571,
|
|
"mean_token_accuracy": 0.2038218379020691,
|
|
"num_tokens": 10260242.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 5.765140056610107,
|
|
"epoch": 4.427873945849978,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003520192683641718,
|
|
"loss": 5.2297,
|
|
"mean_token_accuracy": 0.2027687519788742,
|
|
"num_tokens": 10272362.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 5.744220781326294,
|
|
"epoch": 4.43231247225921,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003516955156949157,
|
|
"loss": 5.1941,
|
|
"mean_token_accuracy": 0.20152689814567565,
|
|
"num_tokens": 10283176.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 5.7464361667633055,
|
|
"epoch": 4.436750998668442,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00035137158325661115,
|
|
"loss": 5.2608,
|
|
"mean_token_accuracy": 0.20259124040603638,
|
|
"num_tokens": 10293630.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"epoch": 4.436750998668442,
|
|
"eval_entropy": 5.5769944247610495,
|
|
"eval_loss": 5.8343658447265625,
|
|
"eval_mean_token_accuracy": 0.17468414655632192,
|
|
"eval_num_tokens": 10293630.0,
|
|
"eval_runtime": 2.0854,
|
|
"eval_samples_per_second": 1614.524,
|
|
"eval_steps_per_second": 201.875,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 5.790251922607422,
|
|
"epoch": 4.441189525077674,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00035104747180853376,
|
|
"loss": 5.1822,
|
|
"mean_token_accuracy": 0.20639875233173371,
|
|
"num_tokens": 10303775.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 5.715227222442627,
|
|
"epoch": 4.445628051486906,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003507231821103785,
|
|
"loss": 5.1551,
|
|
"mean_token_accuracy": 0.21106622070074083,
|
|
"num_tokens": 10314142.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 5.747024440765381,
|
|
"epoch": 4.450066577896139,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00035039871492225814,
|
|
"loss": 5.1535,
|
|
"mean_token_accuracy": 0.2024983510375023,
|
|
"num_tokens": 10324401.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 5.675720167160034,
|
|
"epoch": 4.454505104305371,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00035007407100470187,
|
|
"loss": 5.1739,
|
|
"mean_token_accuracy": 0.21270538568496705,
|
|
"num_tokens": 10334872.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 5.7632105350494385,
|
|
"epoch": 4.458943630714603,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003497492511186527,
|
|
"loss": 5.253,
|
|
"mean_token_accuracy": 0.1968903511762619,
|
|
"num_tokens": 10345504.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 5.672514867782593,
|
|
"epoch": 4.463382157123835,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00034942425602546616,
|
|
"loss": 5.1775,
|
|
"mean_token_accuracy": 0.2216365560889244,
|
|
"num_tokens": 10355191.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 5.778588008880615,
|
|
"epoch": 4.467820683533067,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00034909908648690874,
|
|
"loss": 5.2407,
|
|
"mean_token_accuracy": 0.20244300067424775,
|
|
"num_tokens": 10365185.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 5.789299154281617,
|
|
"epoch": 4.472259209942299,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00034877374326515556,
|
|
"loss": 5.1825,
|
|
"mean_token_accuracy": 0.207652448117733,
|
|
"num_tokens": 10374977.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 5.714522647857666,
|
|
"epoch": 4.4766977363515315,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00034844822712278874,
|
|
"loss": 5.2086,
|
|
"mean_token_accuracy": 0.21069382429122924,
|
|
"num_tokens": 10385182.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 5.704091644287109,
|
|
"epoch": 4.481136262760764,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003481225388227961,
|
|
"loss": 5.1767,
|
|
"mean_token_accuracy": 0.21677854061126708,
|
|
"num_tokens": 10395685.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 5.69912896156311,
|
|
"epoch": 4.485574789169996,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00034779667912856864,
|
|
"loss": 5.1712,
|
|
"mean_token_accuracy": 0.2076883152127266,
|
|
"num_tokens": 10405920.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 5.758427858352661,
|
|
"epoch": 4.490013315579228,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003474706488038993,
|
|
"loss": 5.2679,
|
|
"mean_token_accuracy": 0.19982607960700988,
|
|
"num_tokens": 10417815.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 5.775757932662964,
|
|
"epoch": 4.49445184198846,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00034714444861298077,
|
|
"loss": 5.2791,
|
|
"mean_token_accuracy": 0.20297911316156386,
|
|
"num_tokens": 10428603.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 5.725766277313232,
|
|
"epoch": 4.498890368397692,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00034681807932040407,
|
|
"loss": 5.1524,
|
|
"mean_token_accuracy": 0.2125113993883133,
|
|
"num_tokens": 10438053.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 5.751907110214233,
|
|
"epoch": 4.503328894806924,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003464915416911565,
|
|
"loss": 5.2354,
|
|
"mean_token_accuracy": 0.2079993560910225,
|
|
"num_tokens": 10447750.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 5.751536750793457,
|
|
"epoch": 4.5077674212161565,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00034616483649062003,
|
|
"loss": 5.2334,
|
|
"mean_token_accuracy": 0.19996216744184495,
|
|
"num_tokens": 10458168.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 5.77265772819519,
|
|
"epoch": 4.512205947625389,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003458379644845693,
|
|
"loss": 5.2019,
|
|
"mean_token_accuracy": 0.20402003526687623,
|
|
"num_tokens": 10468537.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 5.749958181381226,
|
|
"epoch": 4.516644474034621,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003455109264391699,
|
|
"loss": 5.2142,
|
|
"mean_token_accuracy": 0.20577894747257233,
|
|
"num_tokens": 10478549.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 5.679034996032715,
|
|
"epoch": 4.521083000443853,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003451837231209766,
|
|
"loss": 5.1651,
|
|
"mean_token_accuracy": 0.22028762549161912,
|
|
"num_tokens": 10488579.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 5.727813005447388,
|
|
"epoch": 4.525521526853085,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00034485635529693173,
|
|
"loss": 5.2168,
|
|
"mean_token_accuracy": 0.21334245204925537,
|
|
"num_tokens": 10498869.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 5.774104833602905,
|
|
"epoch": 4.529960053262317,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003445288237343632,
|
|
"loss": 5.1222,
|
|
"mean_token_accuracy": 0.21038362979888917,
|
|
"num_tokens": 10509994.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 5.692390060424804,
|
|
"epoch": 4.534398579671549,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00034420112920098247,
|
|
"loss": 5.1689,
|
|
"mean_token_accuracy": 0.20680999457836152,
|
|
"num_tokens": 10520386.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 5.761635255813599,
|
|
"epoch": 4.5388371060807815,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003438732724648831,
|
|
"loss": 5.3269,
|
|
"mean_token_accuracy": 0.19650017619132995,
|
|
"num_tokens": 10530802.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 5.7955528736114506,
|
|
"epoch": 4.543275632490014,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00034354525429453894,
|
|
"loss": 5.1972,
|
|
"mean_token_accuracy": 0.2062854290008545,
|
|
"num_tokens": 10540581.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 5.708793306350708,
|
|
"epoch": 4.547714158899246,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00034321707545880223,
|
|
"loss": 5.1542,
|
|
"mean_token_accuracy": 0.21162179708480836,
|
|
"num_tokens": 10550908.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 5.64053750038147,
|
|
"epoch": 4.552152685308478,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00034288873672690167,
|
|
"loss": 5.1124,
|
|
"mean_token_accuracy": 0.21572550535202026,
|
|
"num_tokens": 10561710.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 5.748101234436035,
|
|
"epoch": 4.55659121171771,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00034256023886844076,
|
|
"loss": 5.1799,
|
|
"mean_token_accuracy": 0.20977407246828078,
|
|
"num_tokens": 10571469.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 5.795603084564209,
|
|
"epoch": 4.561029738126942,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00034223158265339615,
|
|
"loss": 5.1568,
|
|
"mean_token_accuracy": 0.2124243423342705,
|
|
"num_tokens": 10580968.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 5.732140684127808,
|
|
"epoch": 4.5654682645361735,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00034190276885211554,
|
|
"loss": 5.1957,
|
|
"mean_token_accuracy": 0.20838963836431504,
|
|
"num_tokens": 10590848.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 5.73495044708252,
|
|
"epoch": 4.5699067909454065,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003415737982353159,
|
|
"loss": 5.1829,
|
|
"mean_token_accuracy": 0.202427276968956,
|
|
"num_tokens": 10600341.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 5.7257547855377195,
|
|
"epoch": 4.574345317354638,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000341244671574082,
|
|
"loss": 5.1245,
|
|
"mean_token_accuracy": 0.21159932017326355,
|
|
"num_tokens": 10611733.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 5.703883457183838,
|
|
"epoch": 4.578783843763871,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003409153896398641,
|
|
"loss": 5.1376,
|
|
"mean_token_accuracy": 0.20912213623523712,
|
|
"num_tokens": 10621570.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 5.7086564064025875,
|
|
"epoch": 4.583222370173102,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00034058595320447685,
|
|
"loss": 5.1727,
|
|
"mean_token_accuracy": 0.20659724175930022,
|
|
"num_tokens": 10632438.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 5.724616813659668,
|
|
"epoch": 4.587660896582335,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00034025636304009646,
|
|
"loss": 5.0619,
|
|
"mean_token_accuracy": 0.21662326902151108,
|
|
"num_tokens": 10641738.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 5.72975525856018,
|
|
"epoch": 4.592099422991566,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003399266199192597,
|
|
"loss": 5.2308,
|
|
"mean_token_accuracy": 0.20958700329065322,
|
|
"num_tokens": 10652854.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 5.65272216796875,
|
|
"epoch": 4.596537949400799,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003395967246148622,
|
|
"loss": 5.1518,
|
|
"mean_token_accuracy": 0.2112141489982605,
|
|
"num_tokens": 10663401.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 5.7544811248779295,
|
|
"epoch": 4.600976475810031,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00033926667790015584,
|
|
"loss": 5.2547,
|
|
"mean_token_accuracy": 0.20084319710731507,
|
|
"num_tokens": 10675126.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 5.77255654335022,
|
|
"epoch": 4.605415002219264,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003389364805487476,
|
|
"loss": 5.2229,
|
|
"mean_token_accuracy": 0.20229778736829757,
|
|
"num_tokens": 10685212.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 5.691144752502441,
|
|
"epoch": 4.609853528628495,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00033860613333459757,
|
|
"loss": 5.1348,
|
|
"mean_token_accuracy": 0.2177197515964508,
|
|
"num_tokens": 10695467.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 5.67885947227478,
|
|
"epoch": 4.614292055037727,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003382756370320169,
|
|
"loss": 5.1713,
|
|
"mean_token_accuracy": 0.20744576752185823,
|
|
"num_tokens": 10706089.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 5.803925657272339,
|
|
"epoch": 4.618730581446959,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003379449924156664,
|
|
"loss": 5.1694,
|
|
"mean_token_accuracy": 0.20873753428459169,
|
|
"num_tokens": 10716593.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 5.753027248382568,
|
|
"epoch": 4.623169107856191,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003376142002605547,
|
|
"loss": 5.1973,
|
|
"mean_token_accuracy": 0.20896549969911576,
|
|
"num_tokens": 10727642.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 5.683163452148437,
|
|
"epoch": 4.6276076342654235,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003372832613420356,
|
|
"loss": 5.0631,
|
|
"mean_token_accuracy": 0.21866176128387452,
|
|
"num_tokens": 10737135.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 5.693540334701538,
|
|
"epoch": 4.632046160674656,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003369521764358075,
|
|
"loss": 5.2051,
|
|
"mean_token_accuracy": 0.20459542274475098,
|
|
"num_tokens": 10747527.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 5.647522068023681,
|
|
"epoch": 4.636484687083888,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003366209463179109,
|
|
"loss": 5.072,
|
|
"mean_token_accuracy": 0.21823544502258302,
|
|
"num_tokens": 10757082.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 5.7527947425842285,
|
|
"epoch": 4.64092321349312,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003362895717647265,
|
|
"loss": 5.2071,
|
|
"mean_token_accuracy": 0.20612578988075256,
|
|
"num_tokens": 10768280.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 5.79077115058899,
|
|
"epoch": 4.645361739902352,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003359580535529735,
|
|
"loss": 5.1666,
|
|
"mean_token_accuracy": 0.20676536858081818,
|
|
"num_tokens": 10778276.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 5.723053407669068,
|
|
"epoch": 4.649800266311584,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00033562639245970807,
|
|
"loss": 5.1456,
|
|
"mean_token_accuracy": 0.206996351480484,
|
|
"num_tokens": 10788004.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 5.712559366226197,
|
|
"epoch": 4.654238792720816,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033529458926232105,
|
|
"loss": 5.2224,
|
|
"mean_token_accuracy": 0.2089390218257904,
|
|
"num_tokens": 10797918.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 5.691585636138916,
|
|
"epoch": 4.658677319130049,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003349626447385366,
|
|
"loss": 5.157,
|
|
"mean_token_accuracy": 0.2116892606019974,
|
|
"num_tokens": 10808545.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 5.678885221481323,
|
|
"epoch": 4.663115845539281,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003346305596664099,
|
|
"loss": 5.2123,
|
|
"mean_token_accuracy": 0.20954641252756118,
|
|
"num_tokens": 10818941.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 5.76534628868103,
|
|
"epoch": 4.667554371948513,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00033429833482432567,
|
|
"loss": 5.2666,
|
|
"mean_token_accuracy": 0.2046421304345131,
|
|
"num_tokens": 10829980.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 5.735799407958984,
|
|
"epoch": 4.671992898357745,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00033396597099099624,
|
|
"loss": 5.1517,
|
|
"mean_token_accuracy": 0.212375408411026,
|
|
"num_tokens": 10840512.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 5.748387145996094,
|
|
"epoch": 4.676431424766977,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00033363346894545984,
|
|
"loss": 5.1999,
|
|
"mean_token_accuracy": 0.2036992847919464,
|
|
"num_tokens": 10850837.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 5.699161005020142,
|
|
"epoch": 4.680869951176209,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00033330082946707827,
|
|
"loss": 5.1828,
|
|
"mean_token_accuracy": 0.21137236356735228,
|
|
"num_tokens": 10862036.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 5.781758213043213,
|
|
"epoch": 4.6853084775854414,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000332968053335536,
|
|
"loss": 5.1708,
|
|
"mean_token_accuracy": 0.211983323097229,
|
|
"num_tokens": 10870900.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 5.730520582199096,
|
|
"epoch": 4.689747003994674,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00033263514133083757,
|
|
"loss": 5.2581,
|
|
"mean_token_accuracy": 0.20092154294252396,
|
|
"num_tokens": 10880989.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 5.704589605331421,
|
|
"epoch": 4.694185530403906,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00033230209423330587,
|
|
"loss": 5.178,
|
|
"mean_token_accuracy": 0.2079184263944626,
|
|
"num_tokens": 10890759.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 5.781274271011353,
|
|
"epoch": 4.698624056813138,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003319689128235804,
|
|
"loss": 5.1725,
|
|
"mean_token_accuracy": 0.20617727935314178,
|
|
"num_tokens": 10900700.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 5.6957298755645756,
|
|
"epoch": 4.70306258322237,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00033163559788261575,
|
|
"loss": 5.1661,
|
|
"mean_token_accuracy": 0.20840034782886505,
|
|
"num_tokens": 10910378.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 5.7365562915802,
|
|
"epoch": 4.707501109631602,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0003313021501916795,
|
|
"loss": 5.1849,
|
|
"mean_token_accuracy": 0.20706552118062974,
|
|
"num_tokens": 10920605.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 5.672279596328735,
|
|
"epoch": 4.711939636040834,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00033096857053235016,
|
|
"loss": 5.14,
|
|
"mean_token_accuracy": 0.21455953121185303,
|
|
"num_tokens": 10931063.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 5.710047006607056,
|
|
"epoch": 4.7163781624500665,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00033063485968651545,
|
|
"loss": 5.1996,
|
|
"mean_token_accuracy": 0.21062558740377427,
|
|
"num_tokens": 10941418.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 5.646402835845947,
|
|
"epoch": 4.720816688859299,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003303010184363711,
|
|
"loss": 5.1237,
|
|
"mean_token_accuracy": 0.21142874658107758,
|
|
"num_tokens": 10951664.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 5.749710512161255,
|
|
"epoch": 4.725255215268531,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00032996704756441803,
|
|
"loss": 5.2223,
|
|
"mean_token_accuracy": 0.20792291164398194,
|
|
"num_tokens": 10962060.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 5.758749008178711,
|
|
"epoch": 4.729693741677763,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003296329478534612,
|
|
"loss": 5.2622,
|
|
"mean_token_accuracy": 0.20276703983545302,
|
|
"num_tokens": 10973630.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 5.694210529327393,
|
|
"epoch": 4.734132268086995,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003292987200866075,
|
|
"loss": 5.2161,
|
|
"mean_token_accuracy": 0.2052842602133751,
|
|
"num_tokens": 10984016.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 5.766045379638672,
|
|
"epoch": 4.738570794496227,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003289643650472639,
|
|
"loss": 5.1933,
|
|
"mean_token_accuracy": 0.217355939745903,
|
|
"num_tokens": 10994531.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 5.7393327236175535,
|
|
"epoch": 4.743009320905459,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003286298835191358,
|
|
"loss": 5.1673,
|
|
"mean_token_accuracy": 0.2125002473592758,
|
|
"num_tokens": 11004498.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 5.7455676078796385,
|
|
"epoch": 4.7474478473146915,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00032829527628622517,
|
|
"loss": 5.1947,
|
|
"mean_token_accuracy": 0.20545327067375183,
|
|
"num_tokens": 11014460.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 5.711310625076294,
|
|
"epoch": 4.751886373723924,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00032796054413282834,
|
|
"loss": 5.1853,
|
|
"mean_token_accuracy": 0.2101360887289047,
|
|
"num_tokens": 11024488.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 5.7556007385253904,
|
|
"epoch": 4.756324900133156,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003276256878435347,
|
|
"loss": 5.2054,
|
|
"mean_token_accuracy": 0.21297023296356202,
|
|
"num_tokens": 11033652.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 5.807051658630371,
|
|
"epoch": 4.760763426542388,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003272907082032244,
|
|
"loss": 5.2588,
|
|
"mean_token_accuracy": 0.20238023847341538,
|
|
"num_tokens": 11044587.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 5.66930661201477,
|
|
"epoch": 4.76520195295162,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00032695560599706706,
|
|
"loss": 5.1097,
|
|
"mean_token_accuracy": 0.21576271057128907,
|
|
"num_tokens": 11053836.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 5.657267951965332,
|
|
"epoch": 4.769640479360852,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00032662038201051915,
|
|
"loss": 5.1985,
|
|
"mean_token_accuracy": 0.2085062623023987,
|
|
"num_tokens": 11064250.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 5.730874490737915,
|
|
"epoch": 4.774079005770084,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00032628503702932275,
|
|
"loss": 5.2485,
|
|
"mean_token_accuracy": 0.2009250283241272,
|
|
"num_tokens": 11074516.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 5.77521390914917,
|
|
"epoch": 4.7785175321793165,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003259495718395038,
|
|
"loss": 5.1925,
|
|
"mean_token_accuracy": 0.21358498334884643,
|
|
"num_tokens": 11084519.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 5.704379510879517,
|
|
"epoch": 4.782956058588549,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003256139872273696,
|
|
"loss": 5.2315,
|
|
"mean_token_accuracy": 0.20225883275270462,
|
|
"num_tokens": 11094492.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 5.678598880767822,
|
|
"epoch": 4.787394584997781,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00032527828397950763,
|
|
"loss": 5.1649,
|
|
"mean_token_accuracy": 0.2148972600698471,
|
|
"num_tokens": 11104196.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 5.673313236236572,
|
|
"epoch": 4.791833111407013,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003249424628827834,
|
|
"loss": 5.071,
|
|
"mean_token_accuracy": 0.2209952265024185,
|
|
"num_tokens": 11114436.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 5.779289436340332,
|
|
"epoch": 4.796271637816245,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00032460652472433854,
|
|
"loss": 5.2209,
|
|
"mean_token_accuracy": 0.20202610343694688,
|
|
"num_tokens": 11123866.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 5.7611284255981445,
|
|
"epoch": 4.800710164225477,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00032427047029158924,
|
|
"loss": 5.2148,
|
|
"mean_token_accuracy": 0.21345822662115096,
|
|
"num_tokens": 11134817.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 5.715837097167968,
|
|
"epoch": 4.805148690634709,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003239343003722239,
|
|
"loss": 5.1417,
|
|
"mean_token_accuracy": 0.2122260719537735,
|
|
"num_tokens": 11145252.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 5.738485956192017,
|
|
"epoch": 4.8095872170439415,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000323598015754202,
|
|
"loss": 5.2536,
|
|
"mean_token_accuracy": 0.20232891887426377,
|
|
"num_tokens": 11154957.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 5.721615982055664,
|
|
"epoch": 4.814025743453174,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003232616172257518,
|
|
"loss": 5.1721,
|
|
"mean_token_accuracy": 0.21200567334890366,
|
|
"num_tokens": 11166565.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 5.751074361801147,
|
|
"epoch": 4.818464269862406,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00032292510557536844,
|
|
"loss": 5.2772,
|
|
"mean_token_accuracy": 0.20485566854476928,
|
|
"num_tokens": 11176922.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 5.765995121002197,
|
|
"epoch": 4.822902796271638,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000322588481591812,
|
|
"loss": 5.1212,
|
|
"mean_token_accuracy": 0.21359312385320664,
|
|
"num_tokens": 11187526.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 5.726685285568237,
|
|
"epoch": 4.82734132268087,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00032225174606410634,
|
|
"loss": 5.1969,
|
|
"mean_token_accuracy": 0.20894990414381026,
|
|
"num_tokens": 11199138.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 5.756986904144287,
|
|
"epoch": 4.831779849090102,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00032191489978153646,
|
|
"loss": 5.2013,
|
|
"mean_token_accuracy": 0.20594589412212372,
|
|
"num_tokens": 11209158.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 5.692794561386108,
|
|
"epoch": 4.836218375499334,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003215779435336471,
|
|
"loss": 5.11,
|
|
"mean_token_accuracy": 0.22132737040519715,
|
|
"num_tokens": 11218202.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 5.732383728027344,
|
|
"epoch": 4.840656901908567,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003212408781102404,
|
|
"loss": 5.1896,
|
|
"mean_token_accuracy": 0.20523899495601655,
|
|
"num_tokens": 11227885.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 5.655904531478882,
|
|
"epoch": 4.845095428317799,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003209037043013751,
|
|
"loss": 5.2079,
|
|
"mean_token_accuracy": 0.20618089586496352,
|
|
"num_tokens": 11237686.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 5.712638187408447,
|
|
"epoch": 4.849533954727031,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003205664228973632,
|
|
"loss": 5.1826,
|
|
"mean_token_accuracy": 0.20865253657102584,
|
|
"num_tokens": 11248287.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 5.777940988540649,
|
|
"epoch": 4.853972481136263,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003202290346887696,
|
|
"loss": 5.1814,
|
|
"mean_token_accuracy": 0.20437095165252686,
|
|
"num_tokens": 11258376.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 5.766065216064453,
|
|
"epoch": 4.858411007545495,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003198915404664088,
|
|
"loss": 5.2219,
|
|
"mean_token_accuracy": 0.19672314822673798,
|
|
"num_tokens": 11268966.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 5.700806474685669,
|
|
"epoch": 4.862849533954727,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00031955394102134454,
|
|
"loss": 5.2355,
|
|
"mean_token_accuracy": 0.2040538489818573,
|
|
"num_tokens": 11279836.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 5.7688816547393795,
|
|
"epoch": 4.8672880603639594,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003192162371448868,
|
|
"loss": 5.2809,
|
|
"mean_token_accuracy": 0.20273662358522415,
|
|
"num_tokens": 11290009.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 5.706856298446655,
|
|
"epoch": 4.871726586773192,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00031887842962859033,
|
|
"loss": 5.1465,
|
|
"mean_token_accuracy": 0.2068696990609169,
|
|
"num_tokens": 11300460.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 5.7477126121521,
|
|
"epoch": 4.876165113182424,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00031854051926425277,
|
|
"loss": 5.2111,
|
|
"mean_token_accuracy": 0.20210069715976714,
|
|
"num_tokens": 11309995.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 5.722295808792114,
|
|
"epoch": 4.880603639591656,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00031820250684391304,
|
|
"loss": 5.1839,
|
|
"mean_token_accuracy": 0.21283525675535203,
|
|
"num_tokens": 11319682.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"epoch": 4.880603639591656,
|
|
"eval_entropy": 5.523329989643957,
|
|
"eval_loss": 5.800832271575928,
|
|
"eval_mean_token_accuracy": 0.17711487331044928,
|
|
"eval_num_tokens": 11319682.0,
|
|
"eval_runtime": 2.2641,
|
|
"eval_samples_per_second": 1487.117,
|
|
"eval_steps_per_second": 185.945,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 5.73695330619812,
|
|
"epoch": 4.885042166000888,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00031786439315984925,
|
|
"loss": 5.2303,
|
|
"mean_token_accuracy": 0.20797490924596787,
|
|
"num_tokens": 11330186.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 5.770789432525635,
|
|
"epoch": 4.88948069241012,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00031752617900457656,
|
|
"loss": 5.2255,
|
|
"mean_token_accuracy": 0.21493835896253585,
|
|
"num_tokens": 11340284.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 5.741439962387085,
|
|
"epoch": 4.893919218819352,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000317187865170846,
|
|
"loss": 5.2033,
|
|
"mean_token_accuracy": 0.2078318029642105,
|
|
"num_tokens": 11351098.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 5.707396221160889,
|
|
"epoch": 4.8983577452285845,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000316849452451642,
|
|
"loss": 5.2368,
|
|
"mean_token_accuracy": 0.20806288421154023,
|
|
"num_tokens": 11361783.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 5.690252161026001,
|
|
"epoch": 4.902796271637817,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00031651094164018097,
|
|
"loss": 5.1346,
|
|
"mean_token_accuracy": 0.21844119280576707,
|
|
"num_tokens": 11372840.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 5.7909657001495365,
|
|
"epoch": 4.907234798047049,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003161723335299089,
|
|
"loss": 5.1128,
|
|
"mean_token_accuracy": 0.2176864340901375,
|
|
"num_tokens": 11382785.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 5.6382709503173825,
|
|
"epoch": 4.911673324456281,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003158336289145003,
|
|
"loss": 5.1838,
|
|
"mean_token_accuracy": 0.21205998063087464,
|
|
"num_tokens": 11392714.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 5.741606950759888,
|
|
"epoch": 4.916111850865512,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00031549482858785554,
|
|
"loss": 5.2685,
|
|
"mean_token_accuracy": 0.19965731650590895,
|
|
"num_tokens": 11404755.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 5.803937005996704,
|
|
"epoch": 4.920550377274745,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00031515593334409934,
|
|
"loss": 5.2045,
|
|
"mean_token_accuracy": 0.20873982608318328,
|
|
"num_tokens": 11414938.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 5.686682176589966,
|
|
"epoch": 4.9249889036839765,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003148169439775792,
|
|
"loss": 5.1479,
|
|
"mean_token_accuracy": 0.21138025522232057,
|
|
"num_tokens": 11424962.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 5.696095275878906,
|
|
"epoch": 4.9294274300932095,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00031447786128286286,
|
|
"loss": 5.1778,
|
|
"mean_token_accuracy": 0.21060777753591536,
|
|
"num_tokens": 11436416.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 5.765445613861084,
|
|
"epoch": 4.933865956502441,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003141386860547371,
|
|
"loss": 5.2256,
|
|
"mean_token_accuracy": 0.20483573526144028,
|
|
"num_tokens": 11446820.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 5.775624513626099,
|
|
"epoch": 4.938304482911674,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003137994190882054,
|
|
"loss": 5.1784,
|
|
"mean_token_accuracy": 0.2152741551399231,
|
|
"num_tokens": 11456880.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 5.679759883880616,
|
|
"epoch": 4.942743009320905,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003134600611784865,
|
|
"loss": 5.1812,
|
|
"mean_token_accuracy": 0.20349172353744507,
|
|
"num_tokens": 11465758.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 5.664295959472656,
|
|
"epoch": 4.947181535730138,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003131206131210119,
|
|
"loss": 5.0953,
|
|
"mean_token_accuracy": 0.21441334635019302,
|
|
"num_tokens": 11476209.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 5.703896141052246,
|
|
"epoch": 4.951620062139369,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003127810757114249,
|
|
"loss": 5.1239,
|
|
"mean_token_accuracy": 0.21405192017555236,
|
|
"num_tokens": 11486510.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 5.755063581466675,
|
|
"epoch": 4.9560585885486015,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00031244144974557775,
|
|
"loss": 5.1462,
|
|
"mean_token_accuracy": 0.2157666265964508,
|
|
"num_tokens": 11496910.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 5.703655195236206,
|
|
"epoch": 4.960497114957834,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003121017360195308,
|
|
"loss": 5.1891,
|
|
"mean_token_accuracy": 0.20666308254003524,
|
|
"num_tokens": 11507488.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 5.749307441711426,
|
|
"epoch": 4.964935641367066,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00031176193532954957,
|
|
"loss": 5.2232,
|
|
"mean_token_accuracy": 0.20651409029960632,
|
|
"num_tokens": 11518398.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 5.7297381401062015,
|
|
"epoch": 4.969374167776298,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003114220484721038,
|
|
"loss": 5.1564,
|
|
"mean_token_accuracy": 0.20705897808074952,
|
|
"num_tokens": 11528470.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 5.670311784744262,
|
|
"epoch": 4.97381269418553,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00031108207624386486,
|
|
"loss": 5.1299,
|
|
"mean_token_accuracy": 0.2155166521668434,
|
|
"num_tokens": 11537765.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 5.7339622497558596,
|
|
"epoch": 4.978251220594762,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003107420194417047,
|
|
"loss": 5.249,
|
|
"mean_token_accuracy": 0.2012795925140381,
|
|
"num_tokens": 11549065.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 5.769830179214478,
|
|
"epoch": 4.982689747003994,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000310401878862693,
|
|
"loss": 5.2641,
|
|
"mean_token_accuracy": 0.20485369861125946,
|
|
"num_tokens": 11559010.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 5.698846435546875,
|
|
"epoch": 4.9871282734132265,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003100616553040962,
|
|
"loss": 5.1158,
|
|
"mean_token_accuracy": 0.21705816090106964,
|
|
"num_tokens": 11567978.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 5.703730916976928,
|
|
"epoch": 4.991566799822459,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00030972134956337493,
|
|
"loss": 5.1565,
|
|
"mean_token_accuracy": 0.20373631715774537,
|
|
"num_tokens": 11579433.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 5.69541335105896,
|
|
"epoch": 4.996005326231691,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00030938096243818275,
|
|
"loss": 5.1387,
|
|
"mean_token_accuracy": 0.21119639426469802,
|
|
"num_tokens": 11589882.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 5.7001016404893665,
|
|
"epoch": 5.0,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 0.00030904049472636367,
|
|
"loss": 5.1901,
|
|
"mean_token_accuracy": 0.21247350341743892,
|
|
"num_tokens": 11598630.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 5.739415073394776,
|
|
"epoch": 5.004438526409232,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00030869994722595095,
|
|
"loss": 5.008,
|
|
"mean_token_accuracy": 0.22126824110746385,
|
|
"num_tokens": 11608797.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 5.663621139526367,
|
|
"epoch": 5.008877052818464,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003083593207351644,
|
|
"loss": 5.0175,
|
|
"mean_token_accuracy": 0.22501287162303923,
|
|
"num_tokens": 11619095.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 5.700268888473511,
|
|
"epoch": 5.013315579227696,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003080186160524095,
|
|
"loss": 5.0311,
|
|
"mean_token_accuracy": 0.22601672559976577,
|
|
"num_tokens": 11629770.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 5.718568563461304,
|
|
"epoch": 5.017754105636929,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003076778339762745,
|
|
"loss": 4.948,
|
|
"mean_token_accuracy": 0.23284862637519838,
|
|
"num_tokens": 11640785.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 5.695920658111572,
|
|
"epoch": 5.022192632046161,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00030733697530552955,
|
|
"loss": 4.9336,
|
|
"mean_token_accuracy": 0.22667457312345504,
|
|
"num_tokens": 11651995.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 5.738033103942871,
|
|
"epoch": 5.026631158455393,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003069960408391239,
|
|
"loss": 5.0168,
|
|
"mean_token_accuracy": 0.21783950328826904,
|
|
"num_tokens": 11662821.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 5.666689348220825,
|
|
"epoch": 5.031069684864625,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00030665503137618466,
|
|
"loss": 4.8584,
|
|
"mean_token_accuracy": 0.2404223471879959,
|
|
"num_tokens": 11672423.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 5.6299999237060545,
|
|
"epoch": 5.035508211273857,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003063139477160147,
|
|
"loss": 4.918,
|
|
"mean_token_accuracy": 0.23635224550962447,
|
|
"num_tokens": 11683010.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 5.682493114471436,
|
|
"epoch": 5.039946737683089,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00030597279065809103,
|
|
"loss": 4.9942,
|
|
"mean_token_accuracy": 0.22202890664339064,
|
|
"num_tokens": 11693887.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 5.711723518371582,
|
|
"epoch": 5.0443852640923215,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003056315610020622,
|
|
"loss": 5.0131,
|
|
"mean_token_accuracy": 0.22168050855398178,
|
|
"num_tokens": 11705152.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 5.658341979980468,
|
|
"epoch": 5.048823790501554,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003052902595477474,
|
|
"loss": 4.9349,
|
|
"mean_token_accuracy": 0.22618422508239747,
|
|
"num_tokens": 11714953.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 5.796881008148193,
|
|
"epoch": 5.053262316910786,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00030494888709513377,
|
|
"loss": 5.048,
|
|
"mean_token_accuracy": 0.2163314253091812,
|
|
"num_tokens": 11725273.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 5.722124481201172,
|
|
"epoch": 5.057700843320018,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003046074444443751,
|
|
"loss": 5.0219,
|
|
"mean_token_accuracy": 0.21710677593946456,
|
|
"num_tokens": 11735757.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 5.642864036560058,
|
|
"epoch": 5.06213936972925,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00030426593239578966,
|
|
"loss": 5.0246,
|
|
"mean_token_accuracy": 0.22806545048952104,
|
|
"num_tokens": 11746190.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 5.654903078079224,
|
|
"epoch": 5.066577896138482,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003039243517498583,
|
|
"loss": 4.9854,
|
|
"mean_token_accuracy": 0.2298506259918213,
|
|
"num_tokens": 11756692.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 5.702650833129883,
|
|
"epoch": 5.071016422547714,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003035827033072228,
|
|
"loss": 4.9319,
|
|
"mean_token_accuracy": 0.22459085732698442,
|
|
"num_tokens": 11768071.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 5.720613718032837,
|
|
"epoch": 5.0754549489569465,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00030324098786868364,
|
|
"loss": 5.0182,
|
|
"mean_token_accuracy": 0.22162954807281493,
|
|
"num_tokens": 11778685.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 5.6652062892913815,
|
|
"epoch": 5.079893475366179,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00030289920623519854,
|
|
"loss": 4.9676,
|
|
"mean_token_accuracy": 0.2229399025440216,
|
|
"num_tokens": 11788078.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 5.676460599899292,
|
|
"epoch": 5.084332001775411,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003025573592078803,
|
|
"loss": 4.9833,
|
|
"mean_token_accuracy": 0.22160238772630692,
|
|
"num_tokens": 11796440.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 5.745248508453369,
|
|
"epoch": 5.088770528184643,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000302215447587995,
|
|
"loss": 5.0358,
|
|
"mean_token_accuracy": 0.21714013665914536,
|
|
"num_tokens": 11806263.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 5.646965360641479,
|
|
"epoch": 5.093209054593875,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00030187347217696005,
|
|
"loss": 4.9496,
|
|
"mean_token_accuracy": 0.22523796260356904,
|
|
"num_tokens": 11816368.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 5.5966925621032715,
|
|
"epoch": 5.097647581003107,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00030153143377634244,
|
|
"loss": 4.9276,
|
|
"mean_token_accuracy": 0.22945380359888076,
|
|
"num_tokens": 11826319.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 5.676280736923218,
|
|
"epoch": 5.102086107412339,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003011893331878569,
|
|
"loss": 4.9664,
|
|
"mean_token_accuracy": 0.23140579015016555,
|
|
"num_tokens": 11835971.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 5.701886701583862,
|
|
"epoch": 5.1065246338215715,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00030084717121336383,
|
|
"loss": 4.9618,
|
|
"mean_token_accuracy": 0.22556509524583818,
|
|
"num_tokens": 11845506.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 5.715242481231689,
|
|
"epoch": 5.110963160230804,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00030050494865486744,
|
|
"loss": 5.0605,
|
|
"mean_token_accuracy": 0.2205240473151207,
|
|
"num_tokens": 11856083.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 5.595279550552368,
|
|
"epoch": 5.115401686640036,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003001626663145141,
|
|
"loss": 4.9238,
|
|
"mean_token_accuracy": 0.23146225064992904,
|
|
"num_tokens": 11867061.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 5.720956182479858,
|
|
"epoch": 5.119840213049268,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00029982032499459017,
|
|
"loss": 5.0122,
|
|
"mean_token_accuracy": 0.22077643722295762,
|
|
"num_tokens": 11877751.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 5.651248216629028,
|
|
"epoch": 5.1242787394585,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00029947792549752034,
|
|
"loss": 4.9893,
|
|
"mean_token_accuracy": 0.22719825357198714,
|
|
"num_tokens": 11887649.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 5.659734487533569,
|
|
"epoch": 5.128717265867732,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00029913546862586567,
|
|
"loss": 5.0319,
|
|
"mean_token_accuracy": 0.223132161796093,
|
|
"num_tokens": 11898833.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 5.735756158828735,
|
|
"epoch": 5.133155792276964,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002987929551823215,
|
|
"loss": 5.0595,
|
|
"mean_token_accuracy": 0.22174521237611772,
|
|
"num_tokens": 11910341.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 5.6615043640136715,
|
|
"epoch": 5.1375943186861965,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002984503859697162,
|
|
"loss": 4.9508,
|
|
"mean_token_accuracy": 0.23014761209487916,
|
|
"num_tokens": 11919393.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 5.6714434146881105,
|
|
"epoch": 5.142032845095429,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002981077617910085,
|
|
"loss": 4.9194,
|
|
"mean_token_accuracy": 0.23738617449998856,
|
|
"num_tokens": 11930765.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 5.629246377944947,
|
|
"epoch": 5.146471371504661,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00029776508344928597,
|
|
"loss": 4.9687,
|
|
"mean_token_accuracy": 0.22703385949134827,
|
|
"num_tokens": 11940054.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 5.650801801681519,
|
|
"epoch": 5.150909897913893,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002974223517477633,
|
|
"loss": 4.9464,
|
|
"mean_token_accuracy": 0.23225471675395964,
|
|
"num_tokens": 11950756.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 5.657662773132325,
|
|
"epoch": 5.155348424323125,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002970795674897802,
|
|
"loss": 4.9582,
|
|
"mean_token_accuracy": 0.22137288451194764,
|
|
"num_tokens": 11961062.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 5.690600299835205,
|
|
"epoch": 5.159786950732357,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002967367314787995,
|
|
"loss": 4.9235,
|
|
"mean_token_accuracy": 0.22654454112052919,
|
|
"num_tokens": 11970557.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 5.638317346572876,
|
|
"epoch": 5.164225477141589,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00029639384451840545,
|
|
"loss": 4.9384,
|
|
"mean_token_accuracy": 0.22700047940015794,
|
|
"num_tokens": 11981331.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 5.6244978427886965,
|
|
"epoch": 5.168664003550822,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002960509074123015,
|
|
"loss": 4.9891,
|
|
"mean_token_accuracy": 0.21644605994224547,
|
|
"num_tokens": 11992159.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 5.716595268249511,
|
|
"epoch": 5.173102529960053,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000295707920964309,
|
|
"loss": 4.9931,
|
|
"mean_token_accuracy": 0.22334617823362352,
|
|
"num_tokens": 12002603.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 5.7139030456542965,
|
|
"epoch": 5.177541056369286,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002953648859783646,
|
|
"loss": 5.1011,
|
|
"mean_token_accuracy": 0.21508881002664565,
|
|
"num_tokens": 12012623.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 5.665186405181885,
|
|
"epoch": 5.181979582778517,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002950218032585191,
|
|
"loss": 4.9749,
|
|
"mean_token_accuracy": 0.22413384765386582,
|
|
"num_tokens": 12023017.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 5.671549224853516,
|
|
"epoch": 5.186418109187749,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002946786736089346,
|
|
"loss": 4.9773,
|
|
"mean_token_accuracy": 0.2214719161391258,
|
|
"num_tokens": 12033032.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 5.677174139022827,
|
|
"epoch": 5.190856635596981,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002943354978338838,
|
|
"loss": 5.0024,
|
|
"mean_token_accuracy": 0.2283272624015808,
|
|
"num_tokens": 12043609.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 5.730323934555054,
|
|
"epoch": 5.1952951620062136,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002939922767377472,
|
|
"loss": 5.0104,
|
|
"mean_token_accuracy": 0.22389555275440215,
|
|
"num_tokens": 12053282.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 5.7337881565094,
|
|
"epoch": 5.199733688415446,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002936490111250116,
|
|
"loss": 5.0561,
|
|
"mean_token_accuracy": 0.217279052734375,
|
|
"num_tokens": 12063672.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 5.663741397857666,
|
|
"epoch": 5.204172214824678,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002933057018002681,
|
|
"loss": 4.9316,
|
|
"mean_token_accuracy": 0.22680189162492753,
|
|
"num_tokens": 12073921.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 5.718992376327515,
|
|
"epoch": 5.20861074123391,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00029296234956821044,
|
|
"loss": 4.9402,
|
|
"mean_token_accuracy": 0.22692192792892457,
|
|
"num_tokens": 12085149.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 5.621643352508545,
|
|
"epoch": 5.213049267643142,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002926189552336326,
|
|
"loss": 4.9647,
|
|
"mean_token_accuracy": 0.2331915631890297,
|
|
"num_tokens": 12096515.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 5.674287557601929,
|
|
"epoch": 5.217487794052374,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002922755196014277,
|
|
"loss": 4.9135,
|
|
"mean_token_accuracy": 0.22644905298948287,
|
|
"num_tokens": 12106352.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 5.652184581756591,
|
|
"epoch": 5.221926320461606,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000291932043476585,
|
|
"loss": 4.9627,
|
|
"mean_token_accuracy": 0.2293543979525566,
|
|
"num_tokens": 12116344.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 5.67815523147583,
|
|
"epoch": 5.226364846870839,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002915885276641895,
|
|
"loss": 5.1006,
|
|
"mean_token_accuracy": 0.21285598427057267,
|
|
"num_tokens": 12127402.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 5.687961149215698,
|
|
"epoch": 5.230803373280071,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00029124497296941843,
|
|
"loss": 4.9267,
|
|
"mean_token_accuracy": 0.22959166169166564,
|
|
"num_tokens": 12138065.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 5.636407089233399,
|
|
"epoch": 5.235241899689303,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00029090138019754075,
|
|
"loss": 4.9783,
|
|
"mean_token_accuracy": 0.22571838796138763,
|
|
"num_tokens": 12148450.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 5.608906221389771,
|
|
"epoch": 5.239680426098535,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002905577501539144,
|
|
"loss": 4.9822,
|
|
"mean_token_accuracy": 0.21735644042491914,
|
|
"num_tokens": 12158587.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 5.650953483581543,
|
|
"epoch": 5.244118952507767,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002902140836439847,
|
|
"loss": 4.9359,
|
|
"mean_token_accuracy": 0.22076532393693923,
|
|
"num_tokens": 12169139.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 5.664229774475098,
|
|
"epoch": 5.248557478916999,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002898703814732824,
|
|
"loss": 4.9963,
|
|
"mean_token_accuracy": 0.22586210668087006,
|
|
"num_tokens": 12179178.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 5.747469329833985,
|
|
"epoch": 5.2529960053262315,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00028952664444742204,
|
|
"loss": 5.0667,
|
|
"mean_token_accuracy": 0.21449797302484513,
|
|
"num_tokens": 12189018.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 5.725044107437133,
|
|
"epoch": 5.257434531735464,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002891828733720996,
|
|
"loss": 5.0464,
|
|
"mean_token_accuracy": 0.22428497821092605,
|
|
"num_tokens": 12199250.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 5.674435091018677,
|
|
"epoch": 5.261873058144696,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00028883906905309103,
|
|
"loss": 5.0602,
|
|
"mean_token_accuracy": 0.21731068789958954,
|
|
"num_tokens": 12209572.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 5.678584957122803,
|
|
"epoch": 5.266311584553928,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002884952322962502,
|
|
"loss": 5.0185,
|
|
"mean_token_accuracy": 0.22419251948595048,
|
|
"num_tokens": 12220168.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 5.725101184844971,
|
|
"epoch": 5.27075011096316,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00028815136390750694,
|
|
"loss": 4.967,
|
|
"mean_token_accuracy": 0.2251395106315613,
|
|
"num_tokens": 12229765.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 5.604526662826538,
|
|
"epoch": 5.275188637372392,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002878074646928653,
|
|
"loss": 4.9616,
|
|
"mean_token_accuracy": 0.22482145875692366,
|
|
"num_tokens": 12240087.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 5.676482009887695,
|
|
"epoch": 5.279627163781624,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002874635354584015,
|
|
"loss": 4.9899,
|
|
"mean_token_accuracy": 0.22442464679479598,
|
|
"num_tokens": 12251489.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 5.718767786026001,
|
|
"epoch": 5.2840656901908565,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002871195770102621,
|
|
"loss": 5.0116,
|
|
"mean_token_accuracy": 0.22521375119686127,
|
|
"num_tokens": 12261114.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 5.649609994888306,
|
|
"epoch": 5.288504216600089,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002867755901546624,
|
|
"loss": 4.9961,
|
|
"mean_token_accuracy": 0.21924589872360228,
|
|
"num_tokens": 12271840.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 5.661839437484741,
|
|
"epoch": 5.292942743009321,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00028643157569788386,
|
|
"loss": 4.9661,
|
|
"mean_token_accuracy": 0.22587821185588836,
|
|
"num_tokens": 12281407.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 5.667834806442261,
|
|
"epoch": 5.297381269418553,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00028608753444627307,
|
|
"loss": 4.9471,
|
|
"mean_token_accuracy": 0.23786964565515517,
|
|
"num_tokens": 12293087.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 5.657839250564575,
|
|
"epoch": 5.301819795827785,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000285743467206239,
|
|
"loss": 4.9241,
|
|
"mean_token_accuracy": 0.23313162177801133,
|
|
"num_tokens": 12303638.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 5.723939514160156,
|
|
"epoch": 5.306258322237017,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00028539937478425196,
|
|
"loss": 5.004,
|
|
"mean_token_accuracy": 0.22194170355796813,
|
|
"num_tokens": 12314059.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 5.626681756973267,
|
|
"epoch": 5.310696848646249,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002850552579868409,
|
|
"loss": 4.9439,
|
|
"mean_token_accuracy": 0.23021697402000427,
|
|
"num_tokens": 12323447.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 5.587870359420776,
|
|
"epoch": 5.3151353750554815,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002847111176205922,
|
|
"loss": 4.9479,
|
|
"mean_token_accuracy": 0.23014504015445708,
|
|
"num_tokens": 12333676.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 5.688661241531372,
|
|
"epoch": 5.319573901464714,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002843669544921473,
|
|
"loss": 5.0272,
|
|
"mean_token_accuracy": 0.22250010669231415,
|
|
"num_tokens": 12344188.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 5.607497310638427,
|
|
"epoch": 5.324012427873946,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002840227694082011,
|
|
"loss": 4.8953,
|
|
"mean_token_accuracy": 0.2363758459687233,
|
|
"num_tokens": 12353898.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 5.324012427873946,
|
|
"eval_entropy": 5.461305147112124,
|
|
"eval_loss": 5.801708221435547,
|
|
"eval_mean_token_accuracy": 0.1778349627579193,
|
|
"eval_num_tokens": 12353898.0,
|
|
"eval_runtime": 2.0862,
|
|
"eval_samples_per_second": 1613.94,
|
|
"eval_steps_per_second": 201.802,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 5.694605779647827,
|
|
"epoch": 5.328450954283178,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002836785631754998,
|
|
"loss": 5.0717,
|
|
"mean_token_accuracy": 0.21206305921077728,
|
|
"num_tokens": 12364775.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 5.655154228210449,
|
|
"epoch": 5.33288948069241,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002833343366008396,
|
|
"loss": 5.0325,
|
|
"mean_token_accuracy": 0.2215897798538208,
|
|
"num_tokens": 12376072.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 5.734228801727295,
|
|
"epoch": 5.337328007101642,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00028299009049106364,
|
|
"loss": 4.9952,
|
|
"mean_token_accuracy": 0.2188931554555893,
|
|
"num_tokens": 12385616.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 5.680519723892212,
|
|
"epoch": 5.341766533510874,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002826458256530617,
|
|
"loss": 5.0288,
|
|
"mean_token_accuracy": 0.2136446177959442,
|
|
"num_tokens": 12395860.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 5.6432453155517575,
|
|
"epoch": 5.3462050599201065,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00028230154289376677,
|
|
"loss": 5.0099,
|
|
"mean_token_accuracy": 0.22122237384319304,
|
|
"num_tokens": 12405827.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 5.597190999984742,
|
|
"epoch": 5.350643586329339,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002819572430201542,
|
|
"loss": 4.8931,
|
|
"mean_token_accuracy": 0.23657583594322204,
|
|
"num_tokens": 12415957.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 5.564443159103393,
|
|
"epoch": 5.355082112738571,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002816129268392393,
|
|
"loss": 4.9235,
|
|
"mean_token_accuracy": 0.2252490147948265,
|
|
"num_tokens": 12426120.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 5.659930801391601,
|
|
"epoch": 5.359520639147803,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00028126859515807575,
|
|
"loss": 5.0185,
|
|
"mean_token_accuracy": 0.22204705625772475,
|
|
"num_tokens": 12436771.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 5.64413104057312,
|
|
"epoch": 5.363959165557035,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00028092424878375347,
|
|
"loss": 4.9902,
|
|
"mean_token_accuracy": 0.22899802029132843,
|
|
"num_tokens": 12448171.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 5.6428248405456545,
|
|
"epoch": 5.368397691966267,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00028057988852339677,
|
|
"loss": 4.9936,
|
|
"mean_token_accuracy": 0.2263574168086052,
|
|
"num_tokens": 12457646.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 5.736252880096435,
|
|
"epoch": 5.372836218375499,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002802355151841627,
|
|
"loss": 5.0063,
|
|
"mean_token_accuracy": 0.21641401946544647,
|
|
"num_tokens": 12467141.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 5.617092132568359,
|
|
"epoch": 5.3772747447847316,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00027989112957323874,
|
|
"loss": 5.024,
|
|
"mean_token_accuracy": 0.2205627903342247,
|
|
"num_tokens": 12477263.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 5.65948166847229,
|
|
"epoch": 5.381713271193964,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00027954673249784123,
|
|
"loss": 5.0292,
|
|
"mean_token_accuracy": 0.21856732070446014,
|
|
"num_tokens": 12487686.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 5.6798900127410885,
|
|
"epoch": 5.386151797603196,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002792023247652135,
|
|
"loss": 4.9648,
|
|
"mean_token_accuracy": 0.23209285140037536,
|
|
"num_tokens": 12498661.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 5.649793338775635,
|
|
"epoch": 5.390590324012428,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00027885790718262354,
|
|
"loss": 5.0383,
|
|
"mean_token_accuracy": 0.22359896451234818,
|
|
"num_tokens": 12509618.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 5.650465726852417,
|
|
"epoch": 5.39502885042166,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002785134805573628,
|
|
"loss": 4.9869,
|
|
"mean_token_accuracy": 0.2266141027212143,
|
|
"num_tokens": 12519005.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 5.665211725234985,
|
|
"epoch": 5.399467376830892,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00027816904569674363,
|
|
"loss": 4.965,
|
|
"mean_token_accuracy": 0.22762566953897476,
|
|
"num_tokens": 12528217.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 5.599503660202027,
|
|
"epoch": 5.403905903240124,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00027782460340809793,
|
|
"loss": 4.9359,
|
|
"mean_token_accuracy": 0.2310307577252388,
|
|
"num_tokens": 12537721.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 5.658894205093384,
|
|
"epoch": 5.408344429649357,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00027748015449877486,
|
|
"loss": 5.0124,
|
|
"mean_token_accuracy": 0.21849820911884307,
|
|
"num_tokens": 12548140.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 5.683730030059815,
|
|
"epoch": 5.412782956058589,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00027713569977613913,
|
|
"loss": 5.0007,
|
|
"mean_token_accuracy": 0.22294105142354964,
|
|
"num_tokens": 12558488.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 5.671377372741699,
|
|
"epoch": 5.417221482467821,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002767912400475689,
|
|
"loss": 4.9683,
|
|
"mean_token_accuracy": 0.22906655818223953,
|
|
"num_tokens": 12568175.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 5.677095890045166,
|
|
"epoch": 5.421660008877053,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00027644677612045454,
|
|
"loss": 5.0371,
|
|
"mean_token_accuracy": 0.21587695181369781,
|
|
"num_tokens": 12579019.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 5.705719900131226,
|
|
"epoch": 5.426098535286285,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00027610230880219575,
|
|
"loss": 4.9961,
|
|
"mean_token_accuracy": 0.22534764558076859,
|
|
"num_tokens": 12589693.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 5.676087188720703,
|
|
"epoch": 5.430537061695517,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00027575783890020045,
|
|
"loss": 5.0388,
|
|
"mean_token_accuracy": 0.21792452335357665,
|
|
"num_tokens": 12599149.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 5.611163806915283,
|
|
"epoch": 5.4349755881047495,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00027541336722188253,
|
|
"loss": 4.9999,
|
|
"mean_token_accuracy": 0.22886097729206084,
|
|
"num_tokens": 12608389.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 5.721693277359009,
|
|
"epoch": 5.439414114513982,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002750688945746601,
|
|
"loss": 5.0188,
|
|
"mean_token_accuracy": 0.2188421055674553,
|
|
"num_tokens": 12618664.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 5.714936113357544,
|
|
"epoch": 5.443852640923214,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002747244217659535,
|
|
"loss": 5.0174,
|
|
"mean_token_accuracy": 0.2265838772058487,
|
|
"num_tokens": 12629044.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 5.736785793304444,
|
|
"epoch": 5.448291167332446,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002743799496031834,
|
|
"loss": 5.0571,
|
|
"mean_token_accuracy": 0.22291236519813537,
|
|
"num_tokens": 12639354.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 5.632248735427856,
|
|
"epoch": 5.452729693741678,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002740354788937691,
|
|
"loss": 4.9996,
|
|
"mean_token_accuracy": 0.21985315829515456,
|
|
"num_tokens": 12648845.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 5.619083642959595,
|
|
"epoch": 5.45716822015091,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002736910104451263,
|
|
"loss": 5.0694,
|
|
"mean_token_accuracy": 0.21995143890380858,
|
|
"num_tokens": 12659245.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 5.719312000274658,
|
|
"epoch": 5.461606746560142,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00027334654506466576,
|
|
"loss": 5.0977,
|
|
"mean_token_accuracy": 0.21217371821403502,
|
|
"num_tokens": 12670436.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 5.736315631866455,
|
|
"epoch": 5.4660452729693745,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00027300208355979054,
|
|
"loss": 5.0745,
|
|
"mean_token_accuracy": 0.21208183467388153,
|
|
"num_tokens": 12680735.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 5.63333215713501,
|
|
"epoch": 5.470483799378607,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00027265762673789497,
|
|
"loss": 4.9634,
|
|
"mean_token_accuracy": 0.2283572718501091,
|
|
"num_tokens": 12691125.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 5.688968515396118,
|
|
"epoch": 5.474922325787839,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00027231317540636217,
|
|
"loss": 4.9945,
|
|
"mean_token_accuracy": 0.21915152668952942,
|
|
"num_tokens": 12700838.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 5.692178964614868,
|
|
"epoch": 5.479360852197071,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00027196873037256265,
|
|
"loss": 5.0622,
|
|
"mean_token_accuracy": 0.21220242083072663,
|
|
"num_tokens": 12710960.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 5.7159651756286625,
|
|
"epoch": 5.483799378606303,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002716242924438521,
|
|
"loss": 5.0347,
|
|
"mean_token_accuracy": 0.21605148762464524,
|
|
"num_tokens": 12721958.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 5.668157291412354,
|
|
"epoch": 5.488237905015535,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00027127986242756933,
|
|
"loss": 5.0048,
|
|
"mean_token_accuracy": 0.22361987084150314,
|
|
"num_tokens": 12731104.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 5.601274681091309,
|
|
"epoch": 5.492676431424767,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002709354411310349,
|
|
"loss": 4.9887,
|
|
"mean_token_accuracy": 0.2279864251613617,
|
|
"num_tokens": 12740759.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 5.652634859085083,
|
|
"epoch": 5.4971149578339995,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002705910293615487,
|
|
"loss": 4.9924,
|
|
"mean_token_accuracy": 0.22392220199108123,
|
|
"num_tokens": 12750109.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 5.653663682937622,
|
|
"epoch": 5.501553484243232,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00027024662792638854,
|
|
"loss": 4.9645,
|
|
"mean_token_accuracy": 0.2316619038581848,
|
|
"num_tokens": 12760629.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 5.623260498046875,
|
|
"epoch": 5.505992010652463,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00026990223763280767,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.21955691128969193,
|
|
"num_tokens": 12770282.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 5.649196434020996,
|
|
"epoch": 5.510430537061696,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00026955785928803344,
|
|
"loss": 5.0416,
|
|
"mean_token_accuracy": 0.22228744626045227,
|
|
"num_tokens": 12781417.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 5.641202163696289,
|
|
"epoch": 5.514869063470927,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00026921349369926525,
|
|
"loss": 4.936,
|
|
"mean_token_accuracy": 0.22368472665548325,
|
|
"num_tokens": 12792052.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 5.703455018997192,
|
|
"epoch": 5.51930758988016,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00026886914167367244,
|
|
"loss": 5.0203,
|
|
"mean_token_accuracy": 0.22575272768735885,
|
|
"num_tokens": 12802748.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 5.765030145645142,
|
|
"epoch": 5.5237461162893915,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002685248040183926,
|
|
"loss": 4.9543,
|
|
"mean_token_accuracy": 0.2244446337223053,
|
|
"num_tokens": 12812036.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 5.613691759109497,
|
|
"epoch": 5.5281846426986245,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0002681804815405297,
|
|
"loss": 5.0105,
|
|
"mean_token_accuracy": 0.2189746007323265,
|
|
"num_tokens": 12821555.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 5.620352506637573,
|
|
"epoch": 5.532623169107856,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002678361750471522,
|
|
"loss": 4.9934,
|
|
"mean_token_accuracy": 0.22740308046340943,
|
|
"num_tokens": 12831802.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 5.764811611175537,
|
|
"epoch": 5.537061695517089,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002674918853452909,
|
|
"loss": 5.1639,
|
|
"mean_token_accuracy": 0.209571872651577,
|
|
"num_tokens": 12843051.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 5.740146160125732,
|
|
"epoch": 5.54150022192632,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002671476132419374,
|
|
"loss": 5.097,
|
|
"mean_token_accuracy": 0.21217051148414612,
|
|
"num_tokens": 12853595.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 5.7057901382446286,
|
|
"epoch": 5.545938748335552,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00026680335954404176,
|
|
"loss": 5.0752,
|
|
"mean_token_accuracy": 0.2123361885547638,
|
|
"num_tokens": 12864217.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 5.699584007263184,
|
|
"epoch": 5.550377274744784,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002664591250585114,
|
|
"loss": 5.0434,
|
|
"mean_token_accuracy": 0.22167427241802215,
|
|
"num_tokens": 12874707.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 5.711703157424926,
|
|
"epoch": 5.5548158011540165,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002661149105922083,
|
|
"loss": 5.0713,
|
|
"mean_token_accuracy": 0.21682032346725463,
|
|
"num_tokens": 12885434.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 5.633283376693726,
|
|
"epoch": 5.559254327563249,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002657707169519477,
|
|
"loss": 5.0226,
|
|
"mean_token_accuracy": 0.2257848098874092,
|
|
"num_tokens": 12896104.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 5.749885225296021,
|
|
"epoch": 5.563692853972481,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00026542654494449597,
|
|
"loss": 5.0371,
|
|
"mean_token_accuracy": 0.2217355713248253,
|
|
"num_tokens": 12906885.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 5.638136959075927,
|
|
"epoch": 5.568131380381713,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0002650823953765688,
|
|
"loss": 5.0413,
|
|
"mean_token_accuracy": 0.2228425621986389,
|
|
"num_tokens": 12918075.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 5.705075645446778,
|
|
"epoch": 5.572569906790945,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00026473826905482924,
|
|
"loss": 5.0307,
|
|
"mean_token_accuracy": 0.22413425594568254,
|
|
"num_tokens": 12929147.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 5.732161951065064,
|
|
"epoch": 5.577008433200177,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00026439416678588593,
|
|
"loss": 5.0882,
|
|
"mean_token_accuracy": 0.22053047120571137,
|
|
"num_tokens": 12940123.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 5.709658288955689,
|
|
"epoch": 5.581446959609409,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002640500893762908,
|
|
"loss": 4.959,
|
|
"mean_token_accuracy": 0.22130573987960817,
|
|
"num_tokens": 12950587.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 5.643577623367309,
|
|
"epoch": 5.5858854860186415,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00026370603763253814,
|
|
"loss": 4.9522,
|
|
"mean_token_accuracy": 0.22671314030885698,
|
|
"num_tokens": 12961034.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 5.694207715988159,
|
|
"epoch": 5.590324012427874,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002633620123610616,
|
|
"loss": 4.9965,
|
|
"mean_token_accuracy": 0.22679226994514465,
|
|
"num_tokens": 12971385.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 5.7326904296875,
|
|
"epoch": 5.594762538837106,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00026301801436823285,
|
|
"loss": 5.1144,
|
|
"mean_token_accuracy": 0.21260396838188172,
|
|
"num_tokens": 12982263.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 5.6141676902771,
|
|
"epoch": 5.599201065246338,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002626740444603598,
|
|
"loss": 4.9541,
|
|
"mean_token_accuracy": 0.22624145448207855,
|
|
"num_tokens": 12992246.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 5.60584135055542,
|
|
"epoch": 5.60363959165557,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00026233010344368425,
|
|
"loss": 4.9833,
|
|
"mean_token_accuracy": 0.22964728623628616,
|
|
"num_tokens": 13002696.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 5.671609258651733,
|
|
"epoch": 5.608078118064802,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002619861921243806,
|
|
"loss": 5.0442,
|
|
"mean_token_accuracy": 0.21581459939479827,
|
|
"num_tokens": 13013156.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 5.672356510162354,
|
|
"epoch": 5.612516644474034,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002616423113085535,
|
|
"loss": 4.9933,
|
|
"mean_token_accuracy": 0.22206830531358718,
|
|
"num_tokens": 13024357.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 5.690655517578125,
|
|
"epoch": 5.616955170883267,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00026129846180223586,
|
|
"loss": 5.0451,
|
|
"mean_token_accuracy": 0.22947421222925185,
|
|
"num_tokens": 13035214.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 5.641977167129516,
|
|
"epoch": 5.621393697292499,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002609546444113876,
|
|
"loss": 4.9429,
|
|
"mean_token_accuracy": 0.23031658828258514,
|
|
"num_tokens": 13044978.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 5.707359695434571,
|
|
"epoch": 5.625832223701731,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002606108599418933,
|
|
"loss": 5.0968,
|
|
"mean_token_accuracy": 0.22304710894823074,
|
|
"num_tokens": 13055023.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 5.682846355438232,
|
|
"epoch": 5.630270750110963,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00026026710919956,
|
|
"loss": 5.0717,
|
|
"mean_token_accuracy": 0.21679206639528276,
|
|
"num_tokens": 13065992.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 5.62232928276062,
|
|
"epoch": 5.634709276520195,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00025992339299011616,
|
|
"loss": 4.9318,
|
|
"mean_token_accuracy": 0.236390919983387,
|
|
"num_tokens": 13076550.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 5.664689016342163,
|
|
"epoch": 5.639147802929427,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00025957971211920894,
|
|
"loss": 5.0736,
|
|
"mean_token_accuracy": 0.22434719055891036,
|
|
"num_tokens": 13085785.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 5.683269357681274,
|
|
"epoch": 5.6435863293386594,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00025923606739240306,
|
|
"loss": 4.9591,
|
|
"mean_token_accuracy": 0.22180295884609222,
|
|
"num_tokens": 13096411.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 5.74550051689148,
|
|
"epoch": 5.648024855747892,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000258892459615178,
|
|
"loss": 5.0569,
|
|
"mean_token_accuracy": 0.21744260042905808,
|
|
"num_tokens": 13106624.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 5.6472186088562015,
|
|
"epoch": 5.652463382157124,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000258548889592927,
|
|
"loss": 4.9247,
|
|
"mean_token_accuracy": 0.23228488862514496,
|
|
"num_tokens": 13116487.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 5.677945470809936,
|
|
"epoch": 5.656901908566356,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00025820535813095475,
|
|
"loss": 5.024,
|
|
"mean_token_accuracy": 0.2238454282283783,
|
|
"num_tokens": 13126210.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 5.658624219894409,
|
|
"epoch": 5.661340434975588,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002578618660344756,
|
|
"loss": 5.0801,
|
|
"mean_token_accuracy": 0.21515882164239883,
|
|
"num_tokens": 13136964.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 5.690809345245361,
|
|
"epoch": 5.66577896138482,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002575184141086114,
|
|
"loss": 4.9476,
|
|
"mean_token_accuracy": 0.23027436584234237,
|
|
"num_tokens": 13147332.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 5.693671369552613,
|
|
"epoch": 5.670217487794052,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002571750031583901,
|
|
"loss": 5.0634,
|
|
"mean_token_accuracy": 0.21712343990802765,
|
|
"num_tokens": 13157021.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 5.610699081420899,
|
|
"epoch": 5.6746560142032845,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00025683163398874356,
|
|
"loss": 4.9216,
|
|
"mean_token_accuracy": 0.23084259927272796,
|
|
"num_tokens": 13166802.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 5.657120323181152,
|
|
"epoch": 5.679094540612517,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002564883074045055,
|
|
"loss": 4.976,
|
|
"mean_token_accuracy": 0.22509267032146454,
|
|
"num_tokens": 13176032.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 5.660452222824096,
|
|
"epoch": 5.683533067021749,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00025614502421041004,
|
|
"loss": 5.0065,
|
|
"mean_token_accuracy": 0.22530782520771026,
|
|
"num_tokens": 13186941.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 5.66192135810852,
|
|
"epoch": 5.687971593430981,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002558017852110895,
|
|
"loss": 5.0014,
|
|
"mean_token_accuracy": 0.2287282794713974,
|
|
"num_tokens": 13196641.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 5.625327491760254,
|
|
"epoch": 5.692410119840213,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00025545859121107274,
|
|
"loss": 4.9805,
|
|
"mean_token_accuracy": 0.2243235483765602,
|
|
"num_tokens": 13207610.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 5.660505294799805,
|
|
"epoch": 5.696848646249445,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00025511544301478294,
|
|
"loss": 5.026,
|
|
"mean_token_accuracy": 0.2201002851128578,
|
|
"num_tokens": 13217436.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 5.70370454788208,
|
|
"epoch": 5.701287172658677,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002547723414265361,
|
|
"loss": 5.1099,
|
|
"mean_token_accuracy": 0.21733487248420716,
|
|
"num_tokens": 13228309.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 5.684768295288086,
|
|
"epoch": 5.7057256990679095,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002544292872505388,
|
|
"loss": 4.9975,
|
|
"mean_token_accuracy": 0.21937978714704515,
|
|
"num_tokens": 13239109.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 5.662685775756836,
|
|
"epoch": 5.710164225477142,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002540862812908868,
|
|
"loss": 5.0534,
|
|
"mean_token_accuracy": 0.22029348760843276,
|
|
"num_tokens": 13250000.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 5.609535360336304,
|
|
"epoch": 5.714602751886374,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00025374332435156244,
|
|
"loss": 4.9416,
|
|
"mean_token_accuracy": 0.2313062146306038,
|
|
"num_tokens": 13259866.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 5.75750241279602,
|
|
"epoch": 5.719041278295606,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00025340041723643337,
|
|
"loss": 5.1141,
|
|
"mean_token_accuracy": 0.21256275922060014,
|
|
"num_tokens": 13271362.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 5.719785213470459,
|
|
"epoch": 5.723479804704838,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00025305756074925047,
|
|
"loss": 4.9946,
|
|
"mean_token_accuracy": 0.2274504005908966,
|
|
"num_tokens": 13281301.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 5.620000314712525,
|
|
"epoch": 5.72791833111407,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00025271475569364586,
|
|
"loss": 5.0276,
|
|
"mean_token_accuracy": 0.22291718572378158,
|
|
"num_tokens": 13291027.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 5.663481092453003,
|
|
"epoch": 5.732356857523302,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00025237200287313137,
|
|
"loss": 5.0262,
|
|
"mean_token_accuracy": 0.22112659811973573,
|
|
"num_tokens": 13302115.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 5.692264604568481,
|
|
"epoch": 5.7367953839325345,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00025202930309109597,
|
|
"loss": 4.9641,
|
|
"mean_token_accuracy": 0.21913922280073167,
|
|
"num_tokens": 13310881.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 5.692331790924072,
|
|
"epoch": 5.741233910341767,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00025168665715080463,
|
|
"loss": 5.023,
|
|
"mean_token_accuracy": 0.22164955586194993,
|
|
"num_tokens": 13321205.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 5.639096593856811,
|
|
"epoch": 5.745672436750999,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00025134406585539603,
|
|
"loss": 4.9374,
|
|
"mean_token_accuracy": 0.22749236226081848,
|
|
"num_tokens": 13330719.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 5.630515432357788,
|
|
"epoch": 5.750110963160231,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002510015300078808,
|
|
"loss": 4.9898,
|
|
"mean_token_accuracy": 0.22950752973556518,
|
|
"num_tokens": 13340637.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 5.60786190032959,
|
|
"epoch": 5.754549489569463,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002506590504111394,
|
|
"loss": 4.9795,
|
|
"mean_token_accuracy": 0.23011483550071715,
|
|
"num_tokens": 13351614.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 5.668804073333741,
|
|
"epoch": 5.758988015978695,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002503166278679207,
|
|
"loss": 4.9276,
|
|
"mean_token_accuracy": 0.2333003029227257,
|
|
"num_tokens": 13360674.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 5.683562183380127,
|
|
"epoch": 5.763426542387927,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002499742631808398,
|
|
"loss": 4.9955,
|
|
"mean_token_accuracy": 0.22023021876811982,
|
|
"num_tokens": 13369766.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 5.62109260559082,
|
|
"epoch": 5.7678650687971595,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000249631957152376,
|
|
"loss": 5.0218,
|
|
"mean_token_accuracy": 0.21475125700235367,
|
|
"num_tokens": 13380343.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"epoch": 5.7678650687971595,
|
|
"eval_entropy": 5.407964576168468,
|
|
"eval_loss": 5.782175064086914,
|
|
"eval_mean_token_accuracy": 0.1802773434412168,
|
|
"eval_num_tokens": 13380343.0,
|
|
"eval_runtime": 2.0862,
|
|
"eval_samples_per_second": 1613.953,
|
|
"eval_steps_per_second": 201.804,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 5.584969186782837,
|
|
"epoch": 5.772303595206392,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002492897105848714,
|
|
"loss": 4.98,
|
|
"mean_token_accuracy": 0.22692383378744124,
|
|
"num_tokens": 13389321.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 5.726426792144776,
|
|
"epoch": 5.776742121615624,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00024894752428052846,
|
|
"loss": 5.0393,
|
|
"mean_token_accuracy": 0.21606299877166749,
|
|
"num_tokens": 13399962.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 5.56514983177185,
|
|
"epoch": 5.781180648024856,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00024860539904140853,
|
|
"loss": 4.8783,
|
|
"mean_token_accuracy": 0.24556800127029418,
|
|
"num_tokens": 13411272.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 5.647047424316407,
|
|
"epoch": 5.785619174434088,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00024826333566942995,
|
|
"loss": 4.9628,
|
|
"mean_token_accuracy": 0.2233626127243042,
|
|
"num_tokens": 13421332.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 5.62768177986145,
|
|
"epoch": 5.79005770084332,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00024792133496636553,
|
|
"loss": 5.0542,
|
|
"mean_token_accuracy": 0.2192031517624855,
|
|
"num_tokens": 13431984.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 5.647650861740113,
|
|
"epoch": 5.794496227252552,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00024757939773384184,
|
|
"loss": 4.9519,
|
|
"mean_token_accuracy": 0.23061719238758088,
|
|
"num_tokens": 13441565.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 5.641554975509644,
|
|
"epoch": 5.798934753661785,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00024723752477333625,
|
|
"loss": 4.9632,
|
|
"mean_token_accuracy": 0.2289481893181801,
|
|
"num_tokens": 13451950.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 5.621675825119018,
|
|
"epoch": 5.803373280071017,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002468957168861758,
|
|
"loss": 5.0089,
|
|
"mean_token_accuracy": 0.22343629747629165,
|
|
"num_tokens": 13461382.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 5.665220546722412,
|
|
"epoch": 5.807811806480249,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002465539748735346,
|
|
"loss": 5.006,
|
|
"mean_token_accuracy": 0.22176862955093385,
|
|
"num_tokens": 13470402.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 5.71075325012207,
|
|
"epoch": 5.812250332889481,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002462122995364327,
|
|
"loss": 4.9876,
|
|
"mean_token_accuracy": 0.22950772643089296,
|
|
"num_tokens": 13480272.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 5.701600456237793,
|
|
"epoch": 5.816688859298713,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002458706916757338,
|
|
"loss": 5.059,
|
|
"mean_token_accuracy": 0.2181694835424423,
|
|
"num_tokens": 13491366.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 5.66182165145874,
|
|
"epoch": 5.821127385707945,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00024552915209214327,
|
|
"loss": 5.1043,
|
|
"mean_token_accuracy": 0.21448306888341903,
|
|
"num_tokens": 13501887.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 5.631567716598511,
|
|
"epoch": 5.8255659121171774,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00024518768158620654,
|
|
"loss": 5.0124,
|
|
"mean_token_accuracy": 0.22701208740472795,
|
|
"num_tokens": 13512254.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 5.75889220237732,
|
|
"epoch": 5.83000443852641,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002448462809583072,
|
|
"loss": 5.0506,
|
|
"mean_token_accuracy": 0.2189397171139717,
|
|
"num_tokens": 13522082.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 5.705504655838013,
|
|
"epoch": 5.834442964935642,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000244504951008665,
|
|
"loss": 5.0196,
|
|
"mean_token_accuracy": 0.22250390648841858,
|
|
"num_tokens": 13531879.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 5.679951810836792,
|
|
"epoch": 5.838881491344874,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00024416369253733405,
|
|
"loss": 5.1403,
|
|
"mean_token_accuracy": 0.21508430540561677,
|
|
"num_tokens": 13543089.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 5.677362966537475,
|
|
"epoch": 5.843320017754106,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00024382250634420085,
|
|
"loss": 4.9994,
|
|
"mean_token_accuracy": 0.22156949639320372,
|
|
"num_tokens": 13553677.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 5.660028409957886,
|
|
"epoch": 5.847758544163337,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002434813932289825,
|
|
"loss": 5.0117,
|
|
"mean_token_accuracy": 0.22413584291934968,
|
|
"num_tokens": 13564787.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 5.7271475315094,
|
|
"epoch": 5.85219707057257,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00024314035399122485,
|
|
"loss": 5.0934,
|
|
"mean_token_accuracy": 0.21186063587665557,
|
|
"num_tokens": 13575382.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 5.598541164398194,
|
|
"epoch": 5.856635596981802,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00024279938943030073,
|
|
"loss": 4.9572,
|
|
"mean_token_accuracy": 0.22869121432304382,
|
|
"num_tokens": 13585213.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 5.6470095157623295,
|
|
"epoch": 5.861074123391035,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002424585003454075,
|
|
"loss": 5.0741,
|
|
"mean_token_accuracy": 0.21848224103450775,
|
|
"num_tokens": 13595305.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 5.72409954071045,
|
|
"epoch": 5.865512649800266,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00024211768753556602,
|
|
"loss": 5.1366,
|
|
"mean_token_accuracy": 0.21125885993242263,
|
|
"num_tokens": 13605988.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 5.680611324310303,
|
|
"epoch": 5.869951176209499,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00024177695179961823,
|
|
"loss": 4.9716,
|
|
"mean_token_accuracy": 0.23375285118818284,
|
|
"num_tokens": 13615279.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 5.692046737670898,
|
|
"epoch": 5.87438970261873,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00024143629393622541,
|
|
"loss": 5.0182,
|
|
"mean_token_accuracy": 0.2263980969786644,
|
|
"num_tokens": 13624837.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 5.699664449691772,
|
|
"epoch": 5.878828229027963,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00024109571474386631,
|
|
"loss": 5.164,
|
|
"mean_token_accuracy": 0.20575061440467834,
|
|
"num_tokens": 13635695.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 5.673453092575073,
|
|
"epoch": 5.8832667554371945,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00024075521502083525,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.22787272781133652,
|
|
"num_tokens": 13645631.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 5.693185091018677,
|
|
"epoch": 5.887705281846427,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00024041479556524044,
|
|
"loss": 5.0198,
|
|
"mean_token_accuracy": 0.22435105293989183,
|
|
"num_tokens": 13657008.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 5.682106876373291,
|
|
"epoch": 5.892143808255659,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00024007445717500175,
|
|
"loss": 4.9906,
|
|
"mean_token_accuracy": 0.22617370635271072,
|
|
"num_tokens": 13666436.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 5.6378443241119385,
|
|
"epoch": 5.896582334664891,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00023973420064784908,
|
|
"loss": 4.9667,
|
|
"mean_token_accuracy": 0.2313501387834549,
|
|
"num_tokens": 13677533.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 5.637309503555298,
|
|
"epoch": 5.901020861074123,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00023939402678132044,
|
|
"loss": 5.0153,
|
|
"mean_token_accuracy": 0.22506245523691176,
|
|
"num_tokens": 13688965.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 5.590819215774536,
|
|
"epoch": 5.905459387483355,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00023905393637276018,
|
|
"loss": 4.8899,
|
|
"mean_token_accuracy": 0.23322740644216539,
|
|
"num_tokens": 13699025.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 5.649019622802735,
|
|
"epoch": 5.909897913892587,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002387139302193171,
|
|
"loss": 5.0254,
|
|
"mean_token_accuracy": 0.2191639542579651,
|
|
"num_tokens": 13708922.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 5.6550849914550785,
|
|
"epoch": 5.9143364403018195,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00023837400911794215,
|
|
"loss": 4.9824,
|
|
"mean_token_accuracy": 0.22595618963241576,
|
|
"num_tokens": 13718921.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 5.743515682220459,
|
|
"epoch": 5.918774966711052,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002380341738653874,
|
|
"loss": 5.1055,
|
|
"mean_token_accuracy": 0.2134455546736717,
|
|
"num_tokens": 13729921.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 5.599254369735718,
|
|
"epoch": 5.923213493120284,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00023769442525820334,
|
|
"loss": 4.9852,
|
|
"mean_token_accuracy": 0.22476375699043274,
|
|
"num_tokens": 13739620.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 5.607891178131103,
|
|
"epoch": 5.927652019529516,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0002373547640927375,
|
|
"loss": 5.0571,
|
|
"mean_token_accuracy": 0.22019446194171904,
|
|
"num_tokens": 13749229.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 5.659670448303222,
|
|
"epoch": 5.932090545938748,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00023701519116513253,
|
|
"loss": 4.9967,
|
|
"mean_token_accuracy": 0.22971152812242507,
|
|
"num_tokens": 13759610.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 5.695259475708008,
|
|
"epoch": 5.93652907234798,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00023667570727132405,
|
|
"loss": 4.9922,
|
|
"mean_token_accuracy": 0.22517374008893967,
|
|
"num_tokens": 13769907.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 5.684794235229492,
|
|
"epoch": 5.940967598757212,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00023633631320703918,
|
|
"loss": 5.0675,
|
|
"mean_token_accuracy": 0.2160962328314781,
|
|
"num_tokens": 13779982.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 5.639357566833496,
|
|
"epoch": 5.9454061251664445,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00023599700976779432,
|
|
"loss": 5.043,
|
|
"mean_token_accuracy": 0.21850094348192214,
|
|
"num_tokens": 13789771.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 5.628429841995239,
|
|
"epoch": 5.949844651575677,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00023565779774889367,
|
|
"loss": 4.9659,
|
|
"mean_token_accuracy": 0.2278966560959816,
|
|
"num_tokens": 13800205.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 5.6213545322418215,
|
|
"epoch": 5.954283177984909,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00023531867794542694,
|
|
"loss": 4.9304,
|
|
"mean_token_accuracy": 0.22960940152406692,
|
|
"num_tokens": 13810745.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 5.568739891052246,
|
|
"epoch": 5.958721704394141,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00023497965115226794,
|
|
"loss": 4.9683,
|
|
"mean_token_accuracy": 0.2309238538146019,
|
|
"num_tokens": 13820775.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 5.683120155334473,
|
|
"epoch": 5.963160230803373,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00023464071816407206,
|
|
"loss": 5.0246,
|
|
"mean_token_accuracy": 0.22314121723175048,
|
|
"num_tokens": 13831654.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 5.650092029571534,
|
|
"epoch": 5.967598757212605,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00023430187977527533,
|
|
"loss": 5.0141,
|
|
"mean_token_accuracy": 0.22444996535778045,
|
|
"num_tokens": 13841596.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 5.697477531433106,
|
|
"epoch": 5.972037283621837,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00023396313678009158,
|
|
"loss": 5.0705,
|
|
"mean_token_accuracy": 0.2211512729525566,
|
|
"num_tokens": 13852000.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 5.647402238845825,
|
|
"epoch": 5.9764758100310695,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00023362448997251128,
|
|
"loss": 4.9566,
|
|
"mean_token_accuracy": 0.2314678579568863,
|
|
"num_tokens": 13861778.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 5.721929597854614,
|
|
"epoch": 5.980914336440302,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00023328594014629945,
|
|
"loss": 5.117,
|
|
"mean_token_accuracy": 0.2070889353752136,
|
|
"num_tokens": 13873480.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 5.716448974609375,
|
|
"epoch": 5.985352862849534,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002329474880949937,
|
|
"loss": 5.0325,
|
|
"mean_token_accuracy": 0.22087830156087876,
|
|
"num_tokens": 13884072.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 5.689628601074219,
|
|
"epoch": 5.989791389258766,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002326091346119026,
|
|
"loss": 4.9494,
|
|
"mean_token_accuracy": 0.23061742037534713,
|
|
"num_tokens": 13893968.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 5.630706739425659,
|
|
"epoch": 5.994229915667998,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002322708804901036,
|
|
"loss": 4.994,
|
|
"mean_token_accuracy": 0.22329082787036897,
|
|
"num_tokens": 13904929.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 5.6796722412109375,
|
|
"epoch": 5.99866844207723,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00023193272652244113,
|
|
"loss": 5.1024,
|
|
"mean_token_accuracy": 0.21085811257362366,
|
|
"num_tokens": 13915694.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 5.692179414961073,
|
|
"epoch": 6.0026631158455395,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00023159467350152515,
|
|
"loss": 4.8489,
|
|
"mean_token_accuracy": 0.23016820516851214,
|
|
"num_tokens": 13924820.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 5.666901588439941,
|
|
"epoch": 6.007101642254772,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00023125672221972865,
|
|
"loss": 4.9123,
|
|
"mean_token_accuracy": 0.2299010157585144,
|
|
"num_tokens": 13934479.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 5.616270542144775,
|
|
"epoch": 6.011540168664004,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002309188734691865,
|
|
"loss": 4.8134,
|
|
"mean_token_accuracy": 0.2453361839056015,
|
|
"num_tokens": 13943992.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 5.675692939758301,
|
|
"epoch": 6.015978695073236,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00023058112804179298,
|
|
"loss": 4.8678,
|
|
"mean_token_accuracy": 0.23117896914482117,
|
|
"num_tokens": 13953227.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 5.601825332641601,
|
|
"epoch": 6.020417221482468,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002302434867292003,
|
|
"loss": 4.7923,
|
|
"mean_token_accuracy": 0.2510546937584877,
|
|
"num_tokens": 13962801.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 5.6510995388031,
|
|
"epoch": 6.0248557478917,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00022990595032281675,
|
|
"loss": 4.8471,
|
|
"mean_token_accuracy": 0.2332788363099098,
|
|
"num_tokens": 13972875.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 5.633752536773682,
|
|
"epoch": 6.029294274300932,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002295685196138045,
|
|
"loss": 4.8729,
|
|
"mean_token_accuracy": 0.23518357425928116,
|
|
"num_tokens": 13983064.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 5.6549684524536135,
|
|
"epoch": 6.0337328007101645,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00022923119539307806,
|
|
"loss": 4.8019,
|
|
"mean_token_accuracy": 0.24193447679281235,
|
|
"num_tokens": 13993912.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 5.6357931137084964,
|
|
"epoch": 6.038171327119397,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00022889397845130254,
|
|
"loss": 4.8466,
|
|
"mean_token_accuracy": 0.24493976086378097,
|
|
"num_tokens": 14004731.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 5.654474878311158,
|
|
"epoch": 6.042609853528629,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00022855686957889116,
|
|
"loss": 4.9095,
|
|
"mean_token_accuracy": 0.23571256697177886,
|
|
"num_tokens": 14015260.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 5.693507862091065,
|
|
"epoch": 6.047048379937861,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002282198695660042,
|
|
"loss": 4.835,
|
|
"mean_token_accuracy": 0.23543342649936677,
|
|
"num_tokens": 14025598.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 5.665556144714356,
|
|
"epoch": 6.051486906347093,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00022788297920254663,
|
|
"loss": 4.8342,
|
|
"mean_token_accuracy": 0.2411949336528778,
|
|
"num_tokens": 14036058.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 5.634428071975708,
|
|
"epoch": 6.055925432756325,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002275461992781665,
|
|
"loss": 4.8578,
|
|
"mean_token_accuracy": 0.2349405601620674,
|
|
"num_tokens": 14046181.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 5.765952777862549,
|
|
"epoch": 6.060363959165557,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00022720953058225286,
|
|
"loss": 4.916,
|
|
"mean_token_accuracy": 0.22795970290899276,
|
|
"num_tokens": 14056891.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 5.662580060958862,
|
|
"epoch": 6.0648024855747895,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00022687297390393426,
|
|
"loss": 4.8952,
|
|
"mean_token_accuracy": 0.23405720591545104,
|
|
"num_tokens": 14065753.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 5.625827646255493,
|
|
"epoch": 6.069241011984022,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00022653653003207642,
|
|
"loss": 4.8419,
|
|
"mean_token_accuracy": 0.23657547682523727,
|
|
"num_tokens": 14075923.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 5.643268251419068,
|
|
"epoch": 6.073679538393254,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002262001997552809,
|
|
"loss": 4.8538,
|
|
"mean_token_accuracy": 0.2408415660262108,
|
|
"num_tokens": 14085359.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 5.700117111206055,
|
|
"epoch": 6.078118064802486,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00022586398386188278,
|
|
"loss": 4.961,
|
|
"mean_token_accuracy": 0.2297465369105339,
|
|
"num_tokens": 14096061.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 5.676120615005493,
|
|
"epoch": 6.082556591211718,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00022552788313994922,
|
|
"loss": 4.9442,
|
|
"mean_token_accuracy": 0.23140277862548828,
|
|
"num_tokens": 14107077.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 5.717546367645264,
|
|
"epoch": 6.08699511762095,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00022519189837727727,
|
|
"loss": 4.8767,
|
|
"mean_token_accuracy": 0.24003577083349228,
|
|
"num_tokens": 14117493.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 5.621216297149658,
|
|
"epoch": 6.091433644030182,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00022485603036139236,
|
|
"loss": 4.8463,
|
|
"mean_token_accuracy": 0.24116085171699525,
|
|
"num_tokens": 14128048.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 5.609436750411987,
|
|
"epoch": 6.0958721704394145,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002245202798795461,
|
|
"loss": 4.918,
|
|
"mean_token_accuracy": 0.23105758875608445,
|
|
"num_tokens": 14137743.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 5.683057594299316,
|
|
"epoch": 6.100310696848647,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00022418464771871473,
|
|
"loss": 4.9015,
|
|
"mean_token_accuracy": 0.23463036864995956,
|
|
"num_tokens": 14148607.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 5.664183139801025,
|
|
"epoch": 6.104749223257878,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00022384913466559704,
|
|
"loss": 4.8985,
|
|
"mean_token_accuracy": 0.23701905459165573,
|
|
"num_tokens": 14159000.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 5.639634990692139,
|
|
"epoch": 6.10918774966711,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002235137415066128,
|
|
"loss": 4.82,
|
|
"mean_token_accuracy": 0.24064428955316544,
|
|
"num_tokens": 14169358.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 5.665800952911377,
|
|
"epoch": 6.113626276076342,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002231784690279005,
|
|
"loss": 4.8579,
|
|
"mean_token_accuracy": 0.23416383415460587,
|
|
"num_tokens": 14179183.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 5.708160400390625,
|
|
"epoch": 6.118064802485574,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002228433180153161,
|
|
"loss": 4.948,
|
|
"mean_token_accuracy": 0.23335806876420975,
|
|
"num_tokens": 14189984.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 5.732094764709473,
|
|
"epoch": 6.1225033288948065,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002225082892544305,
|
|
"loss": 4.9469,
|
|
"mean_token_accuracy": 0.23224007040262223,
|
|
"num_tokens": 14200926.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 5.557865715026855,
|
|
"epoch": 6.126941855304039,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0002221733835305283,
|
|
"loss": 4.8578,
|
|
"mean_token_accuracy": 0.23204921036958695,
|
|
"num_tokens": 14210234.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 5.569741487503052,
|
|
"epoch": 6.131380381713271,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00022183860162860568,
|
|
"loss": 4.8321,
|
|
"mean_token_accuracy": 0.23886339515447616,
|
|
"num_tokens": 14219657.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 5.658196544647216,
|
|
"epoch": 6.135818908122503,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00022150394433336857,
|
|
"loss": 4.8518,
|
|
"mean_token_accuracy": 0.24155458062887192,
|
|
"num_tokens": 14229670.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 5.683429384231568,
|
|
"epoch": 6.140257434531735,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00022116941242923067,
|
|
"loss": 4.8616,
|
|
"mean_token_accuracy": 0.23926016241312026,
|
|
"num_tokens": 14240647.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 5.687435626983643,
|
|
"epoch": 6.144695960940967,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00022083500670031208,
|
|
"loss": 4.9326,
|
|
"mean_token_accuracy": 0.22271257191896437,
|
|
"num_tokens": 14250780.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 5.650713872909546,
|
|
"epoch": 6.149134487350199,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002205007279304368,
|
|
"loss": 4.8902,
|
|
"mean_token_accuracy": 0.23237428516149522,
|
|
"num_tokens": 14260103.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 5.616778898239136,
|
|
"epoch": 6.1535730137594316,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00022016657690313151,
|
|
"loss": 4.8788,
|
|
"mean_token_accuracy": 0.23531609922647476,
|
|
"num_tokens": 14271279.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 5.657024240493774,
|
|
"epoch": 6.158011540168664,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00021983255440162337,
|
|
"loss": 4.8206,
|
|
"mean_token_accuracy": 0.23231412321329117,
|
|
"num_tokens": 14283616.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 5.593470096588135,
|
|
"epoch": 6.162450066577896,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00021949866120883832,
|
|
"loss": 4.8775,
|
|
"mean_token_accuracy": 0.23365422189235688,
|
|
"num_tokens": 14294364.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 5.707459211349487,
|
|
"epoch": 6.166888592987128,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0002191648981073992,
|
|
"loss": 4.9597,
|
|
"mean_token_accuracy": 0.2304862216114998,
|
|
"num_tokens": 14304719.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 5.694037342071534,
|
|
"epoch": 6.17132711939636,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00021883126587962393,
|
|
"loss": 4.9022,
|
|
"mean_token_accuracy": 0.2382871016860008,
|
|
"num_tokens": 14315802.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 5.64510407447815,
|
|
"epoch": 6.175765645805592,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00021849776530752352,
|
|
"loss": 4.8146,
|
|
"mean_token_accuracy": 0.24049257338047028,
|
|
"num_tokens": 14325612.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 5.609499311447143,
|
|
"epoch": 6.180204172214824,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002181643971728008,
|
|
"loss": 4.8274,
|
|
"mean_token_accuracy": 0.24286553859710694,
|
|
"num_tokens": 14336104.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 5.629146242141724,
|
|
"epoch": 6.184642698624057,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00021783116225684756,
|
|
"loss": 4.9035,
|
|
"mean_token_accuracy": 0.23919736891984938,
|
|
"num_tokens": 14346339.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 5.579304122924805,
|
|
"epoch": 6.189081225033289,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00021749806134074395,
|
|
"loss": 4.8422,
|
|
"mean_token_accuracy": 0.24013746976852418,
|
|
"num_tokens": 14357101.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 5.669518184661865,
|
|
"epoch": 6.193519751442521,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00021716509520525564,
|
|
"loss": 4.9278,
|
|
"mean_token_accuracy": 0.22939721792936324,
|
|
"num_tokens": 14366712.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 5.678557634353638,
|
|
"epoch": 6.197958277851753,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00021683226463083238,
|
|
"loss": 4.974,
|
|
"mean_token_accuracy": 0.2297002613544464,
|
|
"num_tokens": 14377920.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 5.657860898971558,
|
|
"epoch": 6.202396804260985,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0002164995703976066,
|
|
"loss": 4.8676,
|
|
"mean_token_accuracy": 0.2351352483034134,
|
|
"num_tokens": 14387005.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 5.639587545394898,
|
|
"epoch": 6.206835330670217,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00021616701328539057,
|
|
"loss": 4.8971,
|
|
"mean_token_accuracy": 0.23374675512313842,
|
|
"num_tokens": 14396201.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 5.607171297073364,
|
|
"epoch": 6.2112738570794495,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00021583459407367557,
|
|
"loss": 4.8544,
|
|
"mean_token_accuracy": 0.23507434725761414,
|
|
"num_tokens": 14406481.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"epoch": 6.2112738570794495,
|
|
"eval_entropy": 5.412511341928586,
|
|
"eval_loss": 5.790064334869385,
|
|
"eval_mean_token_accuracy": 0.18045707795583155,
|
|
"eval_num_tokens": 14406481.0,
|
|
"eval_runtime": 2.0827,
|
|
"eval_samples_per_second": 1616.643,
|
|
"eval_steps_per_second": 202.14,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 5.615001440048218,
|
|
"epoch": 6.215712383488682,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00021550231354162957,
|
|
"loss": 4.9424,
|
|
"mean_token_accuracy": 0.22658960223197938,
|
|
"num_tokens": 14416624.0,
|
|
"step": 7005
|
|
},
|
|
{
|
|
"entropy": 5.713114929199219,
|
|
"epoch": 6.220150909897914,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002151701724680952,
|
|
"loss": 4.9738,
|
|
"mean_token_accuracy": 0.22456389367580415,
|
|
"num_tokens": 14427962.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 5.660664367675781,
|
|
"epoch": 6.224589436307146,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00021483817163158876,
|
|
"loss": 4.8579,
|
|
"mean_token_accuracy": 0.23523758053779603,
|
|
"num_tokens": 14437472.0,
|
|
"step": 7015
|
|
},
|
|
{
|
|
"entropy": 5.642330932617187,
|
|
"epoch": 6.229027962716378,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00021450631181029733,
|
|
"loss": 4.8862,
|
|
"mean_token_accuracy": 0.2419634908437729,
|
|
"num_tokens": 14447642.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 5.627429723739624,
|
|
"epoch": 6.23346648912561,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002141745937820776,
|
|
"loss": 4.8557,
|
|
"mean_token_accuracy": 0.23747613430023193,
|
|
"num_tokens": 14457877.0,
|
|
"step": 7025
|
|
},
|
|
{
|
|
"entropy": 5.695980024337769,
|
|
"epoch": 6.237905015534842,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002138430183244542,
|
|
"loss": 4.9587,
|
|
"mean_token_accuracy": 0.218131722509861,
|
|
"num_tokens": 14467954.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 5.681252717971802,
|
|
"epoch": 6.2423435419440745,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00021351158621461707,
|
|
"loss": 4.8773,
|
|
"mean_token_accuracy": 0.23452190905809403,
|
|
"num_tokens": 14478430.0,
|
|
"step": 7035
|
|
},
|
|
{
|
|
"entropy": 5.727174472808838,
|
|
"epoch": 6.246782068353307,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00021318029822942059,
|
|
"loss": 4.9696,
|
|
"mean_token_accuracy": 0.22943937182426452,
|
|
"num_tokens": 14488961.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 5.676918077468872,
|
|
"epoch": 6.251220594762539,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00021284915514538128,
|
|
"loss": 4.9253,
|
|
"mean_token_accuracy": 0.23082171231508256,
|
|
"num_tokens": 14499311.0,
|
|
"step": 7045
|
|
},
|
|
{
|
|
"entropy": 5.664526510238647,
|
|
"epoch": 6.255659121171771,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002125181577386756,
|
|
"loss": 4.8889,
|
|
"mean_token_accuracy": 0.2293272003531456,
|
|
"num_tokens": 14509823.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 5.624607181549072,
|
|
"epoch": 6.260097647581003,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002121873067851391,
|
|
"loss": 4.8879,
|
|
"mean_token_accuracy": 0.23438603281974793,
|
|
"num_tokens": 14520591.0,
|
|
"step": 7055
|
|
},
|
|
{
|
|
"entropy": 5.639122581481933,
|
|
"epoch": 6.264536173990235,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00021185660306026366,
|
|
"loss": 4.8637,
|
|
"mean_token_accuracy": 0.23611437976360322,
|
|
"num_tokens": 14529921.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 5.630729007720947,
|
|
"epoch": 6.268974700399467,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00021152604733919628,
|
|
"loss": 4.8801,
|
|
"mean_token_accuracy": 0.23746803402900696,
|
|
"num_tokens": 14540809.0,
|
|
"step": 7065
|
|
},
|
|
{
|
|
"entropy": 5.625325870513916,
|
|
"epoch": 6.2734132268086995,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000211195640396737,
|
|
"loss": 4.8364,
|
|
"mean_token_accuracy": 0.23659609109163285,
|
|
"num_tokens": 14552302.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 5.71686315536499,
|
|
"epoch": 6.277851753217932,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002108653830073371,
|
|
"loss": 4.914,
|
|
"mean_token_accuracy": 0.223981074988842,
|
|
"num_tokens": 14562520.0,
|
|
"step": 7075
|
|
},
|
|
{
|
|
"entropy": 5.585401248931885,
|
|
"epoch": 6.282290279627164,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00021053527594509731,
|
|
"loss": 4.8052,
|
|
"mean_token_accuracy": 0.2348144382238388,
|
|
"num_tokens": 14572356.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 5.654277801513672,
|
|
"epoch": 6.286728806036396,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002102053199837662,
|
|
"loss": 4.8697,
|
|
"mean_token_accuracy": 0.23135853707790374,
|
|
"num_tokens": 14582315.0,
|
|
"step": 7085
|
|
},
|
|
{
|
|
"entropy": 5.6194806575775145,
|
|
"epoch": 6.291167332445628,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002098755158967377,
|
|
"loss": 4.906,
|
|
"mean_token_accuracy": 0.23014334738254547,
|
|
"num_tokens": 14593053.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 5.674391412734986,
|
|
"epoch": 6.29560585885486,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00020954586445705027,
|
|
"loss": 4.92,
|
|
"mean_token_accuracy": 0.23151278197765351,
|
|
"num_tokens": 14604325.0,
|
|
"step": 7095
|
|
},
|
|
{
|
|
"entropy": 5.639675903320312,
|
|
"epoch": 6.300044385264092,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00020921636643738429,
|
|
"loss": 4.8611,
|
|
"mean_token_accuracy": 0.2337682381272316,
|
|
"num_tokens": 14613827.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 5.595416641235351,
|
|
"epoch": 6.3044829116733245,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002088870226100606,
|
|
"loss": 4.8384,
|
|
"mean_token_accuracy": 0.242666994035244,
|
|
"num_tokens": 14623778.0,
|
|
"step": 7105
|
|
},
|
|
{
|
|
"entropy": 5.6498009204864506,
|
|
"epoch": 6.308921438082557,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00020855783374703861,
|
|
"loss": 4.9455,
|
|
"mean_token_accuracy": 0.23030229955911635,
|
|
"num_tokens": 14635388.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 5.607757091522217,
|
|
"epoch": 6.313359964491789,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002082288006199146,
|
|
"loss": 4.8515,
|
|
"mean_token_accuracy": 0.24223090708255768,
|
|
"num_tokens": 14646004.0,
|
|
"step": 7115
|
|
},
|
|
{
|
|
"entropy": 5.606477165222168,
|
|
"epoch": 6.317798490901021,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00020789992399991965,
|
|
"loss": 4.7971,
|
|
"mean_token_accuracy": 0.24364340603351592,
|
|
"num_tokens": 14655192.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 5.700380420684814,
|
|
"epoch": 6.322237017310253,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00020757120465791823,
|
|
"loss": 4.9447,
|
|
"mean_token_accuracy": 0.23280777037143707,
|
|
"num_tokens": 14665275.0,
|
|
"step": 7125
|
|
},
|
|
{
|
|
"entropy": 5.644902658462525,
|
|
"epoch": 6.326675543719485,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00020724264336440584,
|
|
"loss": 4.8422,
|
|
"mean_token_accuracy": 0.2432616949081421,
|
|
"num_tokens": 14675021.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 5.627721071243286,
|
|
"epoch": 6.331114070128717,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00020691424088950782,
|
|
"loss": 4.8976,
|
|
"mean_token_accuracy": 0.23562218099832535,
|
|
"num_tokens": 14684685.0,
|
|
"step": 7135
|
|
},
|
|
{
|
|
"entropy": 5.6213939666748045,
|
|
"epoch": 6.3355525965379496,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00020658599800297707,
|
|
"loss": 4.8603,
|
|
"mean_token_accuracy": 0.23688842058181764,
|
|
"num_tokens": 14695224.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 5.573054313659668,
|
|
"epoch": 6.339991122947182,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002062579154741925,
|
|
"loss": 4.8881,
|
|
"mean_token_accuracy": 0.2448859840631485,
|
|
"num_tokens": 14706466.0,
|
|
"step": 7145
|
|
},
|
|
{
|
|
"entropy": 5.583721399307251,
|
|
"epoch": 6.344429649356414,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00020592999407215718,
|
|
"loss": 4.832,
|
|
"mean_token_accuracy": 0.23735189139842988,
|
|
"num_tokens": 14716054.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 5.69507098197937,
|
|
"epoch": 6.348868175765646,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00020560223456549638,
|
|
"loss": 4.9087,
|
|
"mean_token_accuracy": 0.23078093826770782,
|
|
"num_tokens": 14727039.0,
|
|
"step": 7155
|
|
},
|
|
{
|
|
"entropy": 5.630094718933106,
|
|
"epoch": 6.353306702174878,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002052746377224561,
|
|
"loss": 4.8636,
|
|
"mean_token_accuracy": 0.23590660691261292,
|
|
"num_tokens": 14737713.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 5.601201391220092,
|
|
"epoch": 6.35774522858411,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00020494720431090096,
|
|
"loss": 4.8156,
|
|
"mean_token_accuracy": 0.23504213839769364,
|
|
"num_tokens": 14748361.0,
|
|
"step": 7165
|
|
},
|
|
{
|
|
"entropy": 5.600072193145752,
|
|
"epoch": 6.362183754993342,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00020461993509831238,
|
|
"loss": 4.858,
|
|
"mean_token_accuracy": 0.2413262441754341,
|
|
"num_tokens": 14759074.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 5.715661287307739,
|
|
"epoch": 6.366622281402575,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00020429283085178713,
|
|
"loss": 4.972,
|
|
"mean_token_accuracy": 0.2220981925725937,
|
|
"num_tokens": 14769546.0,
|
|
"step": 7175
|
|
},
|
|
{
|
|
"entropy": 5.646831226348877,
|
|
"epoch": 6.371060807811807,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00020396589233803513,
|
|
"loss": 4.9025,
|
|
"mean_token_accuracy": 0.23244934827089309,
|
|
"num_tokens": 14779150.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 5.639772558212281,
|
|
"epoch": 6.375499334221039,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000203639120323378,
|
|
"loss": 4.9233,
|
|
"mean_token_accuracy": 0.23125887513160706,
|
|
"num_tokens": 14791400.0,
|
|
"step": 7185
|
|
},
|
|
{
|
|
"entropy": 5.572238826751709,
|
|
"epoch": 6.379937860630271,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002033125155737471,
|
|
"loss": 4.7976,
|
|
"mean_token_accuracy": 0.2403891295194626,
|
|
"num_tokens": 14801386.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 5.6020301342010494,
|
|
"epoch": 6.384376387039503,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0002029860788546814,
|
|
"loss": 4.8491,
|
|
"mean_token_accuracy": 0.23611615598201752,
|
|
"num_tokens": 14810998.0,
|
|
"step": 7195
|
|
},
|
|
{
|
|
"entropy": 5.675145769119263,
|
|
"epoch": 6.388814913448735,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00020265981093132646,
|
|
"loss": 4.8518,
|
|
"mean_token_accuracy": 0.23608860820531846,
|
|
"num_tokens": 14820792.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 5.657589626312256,
|
|
"epoch": 6.3932534398579675,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00020233371256843198,
|
|
"loss": 4.9124,
|
|
"mean_token_accuracy": 0.24230266064405442,
|
|
"num_tokens": 14830399.0,
|
|
"step": 7205
|
|
},
|
|
{
|
|
"entropy": 5.629939174652099,
|
|
"epoch": 6.3976919662672,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00020200778453035017,
|
|
"loss": 4.9127,
|
|
"mean_token_accuracy": 0.23107272684574126,
|
|
"num_tokens": 14840425.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 5.71688027381897,
|
|
"epoch": 6.402130492676432,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00020168202758103415,
|
|
"loss": 4.8756,
|
|
"mean_token_accuracy": 0.23498946130275727,
|
|
"num_tokens": 14851241.0,
|
|
"step": 7215
|
|
},
|
|
{
|
|
"entropy": 5.658588933944702,
|
|
"epoch": 6.406569019085664,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00020135644248403585,
|
|
"loss": 4.8872,
|
|
"mean_token_accuracy": 0.23236081898212432,
|
|
"num_tokens": 14862432.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 5.57954888343811,
|
|
"epoch": 6.411007545494896,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00020103103000250456,
|
|
"loss": 4.8924,
|
|
"mean_token_accuracy": 0.24108029156923294,
|
|
"num_tokens": 14872967.0,
|
|
"step": 7225
|
|
},
|
|
{
|
|
"entropy": 5.661067914962769,
|
|
"epoch": 6.415446071904128,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000200705790899185,
|
|
"loss": 4.958,
|
|
"mean_token_accuracy": 0.22953315675258637,
|
|
"num_tokens": 14883761.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 5.631343793869019,
|
|
"epoch": 6.41988459831336,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002003807259364152,
|
|
"loss": 4.8924,
|
|
"mean_token_accuracy": 0.2356957033276558,
|
|
"num_tokens": 14893769.0,
|
|
"step": 7235
|
|
},
|
|
{
|
|
"entropy": 5.690106344223023,
|
|
"epoch": 6.4243231247225925,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00020005583587612535,
|
|
"loss": 4.8853,
|
|
"mean_token_accuracy": 0.2385820046067238,
|
|
"num_tokens": 14903984.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 5.613562297821045,
|
|
"epoch": 6.428761651131825,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00019973112147983563,
|
|
"loss": 4.8509,
|
|
"mean_token_accuracy": 0.23809456080198288,
|
|
"num_tokens": 14914710.0,
|
|
"step": 7245
|
|
},
|
|
{
|
|
"entropy": 5.653356075286865,
|
|
"epoch": 6.433200177541057,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00019940658350865422,
|
|
"loss": 4.9327,
|
|
"mean_token_accuracy": 0.22687021642923355,
|
|
"num_tokens": 14924806.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 5.616370105743409,
|
|
"epoch": 6.437638703950288,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00019908222272327608,
|
|
"loss": 4.8763,
|
|
"mean_token_accuracy": 0.23514180332422258,
|
|
"num_tokens": 14934301.0,
|
|
"step": 7255
|
|
},
|
|
{
|
|
"entropy": 5.636706256866455,
|
|
"epoch": 6.442077230359521,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001987580398839806,
|
|
"loss": 4.9406,
|
|
"mean_token_accuracy": 0.22921711951494217,
|
|
"num_tokens": 14946660.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 5.691154718399048,
|
|
"epoch": 6.446515756768752,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00019843403575063028,
|
|
"loss": 4.9662,
|
|
"mean_token_accuracy": 0.2253483772277832,
|
|
"num_tokens": 14957383.0,
|
|
"step": 7265
|
|
},
|
|
{
|
|
"entropy": 5.678403759002686,
|
|
"epoch": 6.450954283177985,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001981102110826688,
|
|
"loss": 4.8742,
|
|
"mean_token_accuracy": 0.23139094114303588,
|
|
"num_tokens": 14967784.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 5.641230297088623,
|
|
"epoch": 6.455392809587217,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00019778656663911883,
|
|
"loss": 4.8382,
|
|
"mean_token_accuracy": 0.23628487586975097,
|
|
"num_tokens": 14977374.0,
|
|
"step": 7275
|
|
},
|
|
{
|
|
"entropy": 5.61148362159729,
|
|
"epoch": 6.459831335996449,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001974631031785809,
|
|
"loss": 4.8508,
|
|
"mean_token_accuracy": 0.23570340275764465,
|
|
"num_tokens": 14987529.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 5.626633501052856,
|
|
"epoch": 6.464269862405681,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00019713982145923149,
|
|
"loss": 4.8438,
|
|
"mean_token_accuracy": 0.24089188277721404,
|
|
"num_tokens": 14996878.0,
|
|
"step": 7285
|
|
},
|
|
{
|
|
"entropy": 5.57475848197937,
|
|
"epoch": 6.468708388814913,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00019681672223882047,
|
|
"loss": 4.8538,
|
|
"mean_token_accuracy": 0.24125839471817018,
|
|
"num_tokens": 15008560.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 5.644071102142334,
|
|
"epoch": 6.473146915224145,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019649380627467062,
|
|
"loss": 4.8226,
|
|
"mean_token_accuracy": 0.2429828017950058,
|
|
"num_tokens": 15018837.0,
|
|
"step": 7295
|
|
},
|
|
{
|
|
"entropy": 5.601809978485107,
|
|
"epoch": 6.477585441633377,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00019617107432367477,
|
|
"loss": 4.8497,
|
|
"mean_token_accuracy": 0.23642477840185167,
|
|
"num_tokens": 15028844.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 5.60591402053833,
|
|
"epoch": 6.4820239680426095,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00019584852714229456,
|
|
"loss": 4.9256,
|
|
"mean_token_accuracy": 0.22939349859952926,
|
|
"num_tokens": 15038318.0,
|
|
"step": 7305
|
|
},
|
|
{
|
|
"entropy": 5.648140001296997,
|
|
"epoch": 6.486462494451842,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00019552616548655866,
|
|
"loss": 4.8503,
|
|
"mean_token_accuracy": 0.2392851486802101,
|
|
"num_tokens": 15048744.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 5.623563575744629,
|
|
"epoch": 6.490901020861074,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00019520399011206064,
|
|
"loss": 4.9062,
|
|
"mean_token_accuracy": 0.23606253117322923,
|
|
"num_tokens": 15058458.0,
|
|
"step": 7315
|
|
},
|
|
{
|
|
"entropy": 5.642405605316162,
|
|
"epoch": 6.495339547270306,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001948820017739576,
|
|
"loss": 4.9307,
|
|
"mean_token_accuracy": 0.22659213989973068,
|
|
"num_tokens": 15068520.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 5.69501142501831,
|
|
"epoch": 6.499778073679538,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00019456020122696834,
|
|
"loss": 4.9282,
|
|
"mean_token_accuracy": 0.23074082285165787,
|
|
"num_tokens": 15078405.0,
|
|
"step": 7325
|
|
},
|
|
{
|
|
"entropy": 5.689974164962768,
|
|
"epoch": 6.50421660008877,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00019423858922537108,
|
|
"loss": 4.8855,
|
|
"mean_token_accuracy": 0.23277142345905305,
|
|
"num_tokens": 15088777.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 5.656842422485352,
|
|
"epoch": 6.508655126498002,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00019391716652300263,
|
|
"loss": 4.861,
|
|
"mean_token_accuracy": 0.23903997093439103,
|
|
"num_tokens": 15098240.0,
|
|
"step": 7335
|
|
},
|
|
{
|
|
"entropy": 5.604224157333374,
|
|
"epoch": 6.5130936529072345,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00019359593387325568,
|
|
"loss": 4.8821,
|
|
"mean_token_accuracy": 0.23923973590135575,
|
|
"num_tokens": 15108537.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 5.630281448364258,
|
|
"epoch": 6.517532179316467,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019327489202907773,
|
|
"loss": 4.9323,
|
|
"mean_token_accuracy": 0.22366443127393723,
|
|
"num_tokens": 15119207.0,
|
|
"step": 7345
|
|
},
|
|
{
|
|
"entropy": 5.660913276672363,
|
|
"epoch": 6.521970705725699,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.00019295404174296887,
|
|
"loss": 4.9099,
|
|
"mean_token_accuracy": 0.23395536541938783,
|
|
"num_tokens": 15128679.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 5.6129961013793945,
|
|
"epoch": 6.526409232134931,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0001926333837669802,
|
|
"loss": 4.8457,
|
|
"mean_token_accuracy": 0.23017606437206267,
|
|
"num_tokens": 15139104.0,
|
|
"step": 7355
|
|
},
|
|
{
|
|
"entropy": 5.668904113769531,
|
|
"epoch": 6.530847758544163,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00019231291885271214,
|
|
"loss": 4.9458,
|
|
"mean_token_accuracy": 0.22286424338817595,
|
|
"num_tokens": 15150810.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 5.683821392059326,
|
|
"epoch": 6.535286284953395,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001919926477513127,
|
|
"loss": 4.911,
|
|
"mean_token_accuracy": 0.23413541167974472,
|
|
"num_tokens": 15160809.0,
|
|
"step": 7365
|
|
},
|
|
{
|
|
"entropy": 5.6379194259643555,
|
|
"epoch": 6.539724811362627,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001916725712134752,
|
|
"loss": 4.9,
|
|
"mean_token_accuracy": 0.2355610266327858,
|
|
"num_tokens": 15171987.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 5.534349250793457,
|
|
"epoch": 6.5441633377718595,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00019135268998943738,
|
|
"loss": 4.8263,
|
|
"mean_token_accuracy": 0.25055228769779203,
|
|
"num_tokens": 15181947.0,
|
|
"step": 7375
|
|
},
|
|
{
|
|
"entropy": 5.670077896118164,
|
|
"epoch": 6.548601864181092,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00019103300482897884,
|
|
"loss": 4.9093,
|
|
"mean_token_accuracy": 0.2327532261610031,
|
|
"num_tokens": 15193321.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 5.677333498001099,
|
|
"epoch": 6.553040390590324,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00019071351648141977,
|
|
"loss": 4.9312,
|
|
"mean_token_accuracy": 0.2269109845161438,
|
|
"num_tokens": 15203519.0,
|
|
"step": 7385
|
|
},
|
|
{
|
|
"entropy": 5.63700590133667,
|
|
"epoch": 6.557478916999556,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001903942256956192,
|
|
"loss": 4.8802,
|
|
"mean_token_accuracy": 0.24052705764770507,
|
|
"num_tokens": 15213109.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 5.619002008438111,
|
|
"epoch": 6.561917443408788,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00019007513321997265,
|
|
"loss": 4.8994,
|
|
"mean_token_accuracy": 0.23233902901411058,
|
|
"num_tokens": 15222797.0,
|
|
"step": 7395
|
|
},
|
|
{
|
|
"entropy": 5.651479578018188,
|
|
"epoch": 6.56635596981802,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00018975623980241124,
|
|
"loss": 4.8911,
|
|
"mean_token_accuracy": 0.23779234439134597,
|
|
"num_tokens": 15232416.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 5.662068700790405,
|
|
"epoch": 6.570794496227252,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00018943754619039942,
|
|
"loss": 4.9369,
|
|
"mean_token_accuracy": 0.23430106937885284,
|
|
"num_tokens": 15243020.0,
|
|
"step": 7405
|
|
},
|
|
{
|
|
"entropy": 5.5887304782867435,
|
|
"epoch": 6.575233022636485,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00018911905313093307,
|
|
"loss": 4.8263,
|
|
"mean_token_accuracy": 0.23923749029636382,
|
|
"num_tokens": 15252733.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 5.563994359970093,
|
|
"epoch": 6.579671549045717,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00018880076137053827,
|
|
"loss": 4.7685,
|
|
"mean_token_accuracy": 0.24913979470729827,
|
|
"num_tokens": 15261913.0,
|
|
"step": 7415
|
|
},
|
|
{
|
|
"entropy": 5.651371669769287,
|
|
"epoch": 6.584110075454949,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00018848267165526912,
|
|
"loss": 4.8773,
|
|
"mean_token_accuracy": 0.2341095745563507,
|
|
"num_tokens": 15272871.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 5.638633298873901,
|
|
"epoch": 6.588548601864181,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00018816478473070608,
|
|
"loss": 4.8492,
|
|
"mean_token_accuracy": 0.2379048854112625,
|
|
"num_tokens": 15283218.0,
|
|
"step": 7425
|
|
},
|
|
{
|
|
"entropy": 5.639962291717529,
|
|
"epoch": 6.592987128273413,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00018784710134195465,
|
|
"loss": 4.8734,
|
|
"mean_token_accuracy": 0.2387226015329361,
|
|
"num_tokens": 15293040.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 5.615225982666016,
|
|
"epoch": 6.597425654682645,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00018752962223364268,
|
|
"loss": 4.8725,
|
|
"mean_token_accuracy": 0.23257046937942505,
|
|
"num_tokens": 15303422.0,
|
|
"step": 7435
|
|
},
|
|
{
|
|
"entropy": 5.655850124359131,
|
|
"epoch": 6.6018641810918774,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00018721234814991967,
|
|
"loss": 4.8898,
|
|
"mean_token_accuracy": 0.22835646271705629,
|
|
"num_tokens": 15313589.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 5.572815036773681,
|
|
"epoch": 6.60630270750111,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00018689527983445448,
|
|
"loss": 4.8663,
|
|
"mean_token_accuracy": 0.2393585979938507,
|
|
"num_tokens": 15324007.0,
|
|
"step": 7445
|
|
},
|
|
{
|
|
"entropy": 5.6924981594085695,
|
|
"epoch": 6.610741233910342,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00018657841803043342,
|
|
"loss": 4.9154,
|
|
"mean_token_accuracy": 0.22886577993631363,
|
|
"num_tokens": 15334601.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 5.688579797744751,
|
|
"epoch": 6.615179760319574,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001862617634805589,
|
|
"loss": 4.9144,
|
|
"mean_token_accuracy": 0.2311697095632553,
|
|
"num_tokens": 15345459.0,
|
|
"step": 7455
|
|
},
|
|
{
|
|
"entropy": 5.623719263076782,
|
|
"epoch": 6.619618286728806,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00018594531692704764,
|
|
"loss": 4.8966,
|
|
"mean_token_accuracy": 0.2258065462112427,
|
|
"num_tokens": 15356031.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 5.651442193984986,
|
|
"epoch": 6.624056813138038,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0001856290791116287,
|
|
"loss": 4.8827,
|
|
"mean_token_accuracy": 0.2345448449254036,
|
|
"num_tokens": 15366023.0,
|
|
"step": 7465
|
|
},
|
|
{
|
|
"entropy": 5.650465106964111,
|
|
"epoch": 6.62849533954727,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00018531305077554194,
|
|
"loss": 4.8677,
|
|
"mean_token_accuracy": 0.2378988280892372,
|
|
"num_tokens": 15376626.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 5.65687928199768,
|
|
"epoch": 6.6329338659565025,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00018499723265953617,
|
|
"loss": 4.8474,
|
|
"mean_token_accuracy": 0.23806278705596923,
|
|
"num_tokens": 15387704.0,
|
|
"step": 7475
|
|
},
|
|
{
|
|
"entropy": 5.639648532867431,
|
|
"epoch": 6.637372392365735,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00018468162550386741,
|
|
"loss": 4.8351,
|
|
"mean_token_accuracy": 0.23378264605998994,
|
|
"num_tokens": 15397700.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 5.63367862701416,
|
|
"epoch": 6.641810918774967,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00018436623004829746,
|
|
"loss": 4.9241,
|
|
"mean_token_accuracy": 0.23234807848930358,
|
|
"num_tokens": 15408311.0,
|
|
"step": 7485
|
|
},
|
|
{
|
|
"entropy": 5.655848789215088,
|
|
"epoch": 6.646249445184199,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00018405104703209145,
|
|
"loss": 5.0114,
|
|
"mean_token_accuracy": 0.21867426186800004,
|
|
"num_tokens": 15418351.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 5.564092350006104,
|
|
"epoch": 6.650687971593431,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0001837360771940171,
|
|
"loss": 4.7873,
|
|
"mean_token_accuracy": 0.24043413549661635,
|
|
"num_tokens": 15428833.0,
|
|
"step": 7495
|
|
},
|
|
{
|
|
"entropy": 5.609026527404785,
|
|
"epoch": 6.655126498002663,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001834213212723419,
|
|
"loss": 4.8847,
|
|
"mean_token_accuracy": 0.23354386985301973,
|
|
"num_tokens": 15439460.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"epoch": 6.655126498002663,
|
|
"eval_entropy": 5.492083697874019,
|
|
"eval_loss": 5.773307800292969,
|
|
"eval_mean_token_accuracy": 0.18101677521532336,
|
|
"eval_num_tokens": 15439460.0,
|
|
"eval_runtime": 2.0854,
|
|
"eval_samples_per_second": 1614.527,
|
|
"eval_steps_per_second": 201.876,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 5.6930934429168705,
|
|
"epoch": 6.659565024411895,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0001831067800048325,
|
|
"loss": 4.7959,
|
|
"mean_token_accuracy": 0.2436303585767746,
|
|
"num_tokens": 15449294.0,
|
|
"step": 7505
|
|
},
|
|
{
|
|
"entropy": 5.623752403259277,
|
|
"epoch": 6.6640035508211275,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000182792454128752,
|
|
"loss": 4.8692,
|
|
"mean_token_accuracy": 0.24148676544427872,
|
|
"num_tokens": 15458983.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 5.598190116882324,
|
|
"epoch": 6.66844207723036,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00018247834438085876,
|
|
"loss": 4.9012,
|
|
"mean_token_accuracy": 0.23211518079042434,
|
|
"num_tokens": 15469613.0,
|
|
"step": 7515
|
|
},
|
|
{
|
|
"entropy": 5.550053262710572,
|
|
"epoch": 6.672880603639592,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00018216445149740463,
|
|
"loss": 4.8374,
|
|
"mean_token_accuracy": 0.2409072920680046,
|
|
"num_tokens": 15479877.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 5.582193613052368,
|
|
"epoch": 6.677319130048824,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00018185077621413315,
|
|
"loss": 4.8801,
|
|
"mean_token_accuracy": 0.2388046383857727,
|
|
"num_tokens": 15491102.0,
|
|
"step": 7525
|
|
},
|
|
{
|
|
"entropy": 5.659359884262085,
|
|
"epoch": 6.681757656458056,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001815373192662776,
|
|
"loss": 4.8708,
|
|
"mean_token_accuracy": 0.2363179937005043,
|
|
"num_tokens": 15501835.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 5.627538728713989,
|
|
"epoch": 6.686196182867288,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00018122408138855972,
|
|
"loss": 4.9023,
|
|
"mean_token_accuracy": 0.23346997648477555,
|
|
"num_tokens": 15512174.0,
|
|
"step": 7535
|
|
},
|
|
{
|
|
"entropy": 5.6381974697113035,
|
|
"epoch": 6.69063470927652,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00018091106331518764,
|
|
"loss": 4.9496,
|
|
"mean_token_accuracy": 0.23031805604696273,
|
|
"num_tokens": 15522031.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 5.57114987373352,
|
|
"epoch": 6.6950732356857525,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001805982657798544,
|
|
"loss": 4.8015,
|
|
"mean_token_accuracy": 0.24753360450267792,
|
|
"num_tokens": 15532624.0,
|
|
"step": 7545
|
|
},
|
|
{
|
|
"entropy": 5.66475100517273,
|
|
"epoch": 6.699511762094985,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00018028568951573604,
|
|
"loss": 4.9144,
|
|
"mean_token_accuracy": 0.2324439212679863,
|
|
"num_tokens": 15542818.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 5.661481332778931,
|
|
"epoch": 6.703950288504217,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00017997333525548987,
|
|
"loss": 4.8521,
|
|
"mean_token_accuracy": 0.23437338471412658,
|
|
"num_tokens": 15552163.0,
|
|
"step": 7555
|
|
},
|
|
{
|
|
"entropy": 5.7011888980865475,
|
|
"epoch": 6.708388814913449,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00017966120373125315,
|
|
"loss": 4.9343,
|
|
"mean_token_accuracy": 0.23252523839473724,
|
|
"num_tokens": 15563418.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 5.552364444732666,
|
|
"epoch": 6.712827341322681,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001793492956746408,
|
|
"loss": 4.7384,
|
|
"mean_token_accuracy": 0.2564175441861153,
|
|
"num_tokens": 15573452.0,
|
|
"step": 7565
|
|
},
|
|
{
|
|
"entropy": 5.636792707443237,
|
|
"epoch": 6.717265867731913,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00017903761181674373,
|
|
"loss": 4.879,
|
|
"mean_token_accuracy": 0.23047803938388825,
|
|
"num_tokens": 15583997.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 5.623147821426391,
|
|
"epoch": 6.721704394141145,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00017872615288812787,
|
|
"loss": 4.9214,
|
|
"mean_token_accuracy": 0.22931641340255737,
|
|
"num_tokens": 15594792.0,
|
|
"step": 7575
|
|
},
|
|
{
|
|
"entropy": 5.623021602630615,
|
|
"epoch": 6.7261429205503775,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00017841491961883155,
|
|
"loss": 4.8535,
|
|
"mean_token_accuracy": 0.23732224553823472,
|
|
"num_tokens": 15606035.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 5.536058235168457,
|
|
"epoch": 6.73058144695961,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00017810391273836423,
|
|
"loss": 4.8117,
|
|
"mean_token_accuracy": 0.2492598831653595,
|
|
"num_tokens": 15616304.0,
|
|
"step": 7585
|
|
},
|
|
{
|
|
"entropy": 5.65251612663269,
|
|
"epoch": 6.735019973368842,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00017779313297570503,
|
|
"loss": 4.9448,
|
|
"mean_token_accuracy": 0.22746442407369613,
|
|
"num_tokens": 15626764.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 5.597546100616455,
|
|
"epoch": 6.739458499778074,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001774825810593002,
|
|
"loss": 4.8324,
|
|
"mean_token_accuracy": 0.23837329149246217,
|
|
"num_tokens": 15637480.0,
|
|
"step": 7595
|
|
},
|
|
{
|
|
"entropy": 5.557524871826172,
|
|
"epoch": 6.743897026187306,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00017717225771706247,
|
|
"loss": 4.8944,
|
|
"mean_token_accuracy": 0.23627863973379135,
|
|
"num_tokens": 15649260.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 5.658842754364014,
|
|
"epoch": 6.748335552596538,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00017686216367636843,
|
|
"loss": 4.9467,
|
|
"mean_token_accuracy": 0.22584837228059768,
|
|
"num_tokens": 15659871.0,
|
|
"step": 7605
|
|
},
|
|
{
|
|
"entropy": 5.605499505996704,
|
|
"epoch": 6.75277407900577,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00017655229966405723,
|
|
"loss": 4.9341,
|
|
"mean_token_accuracy": 0.23004010021686555,
|
|
"num_tokens": 15670823.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 5.611935806274414,
|
|
"epoch": 6.757212605415003,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00017624266640642905,
|
|
"loss": 4.8835,
|
|
"mean_token_accuracy": 0.24057673364877702,
|
|
"num_tokens": 15682096.0,
|
|
"step": 7615
|
|
},
|
|
{
|
|
"entropy": 5.623531627655029,
|
|
"epoch": 6.761651131824235,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00017593326462924308,
|
|
"loss": 4.9277,
|
|
"mean_token_accuracy": 0.228327676653862,
|
|
"num_tokens": 15694035.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 5.6253424167633055,
|
|
"epoch": 6.766089658233467,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00017562409505771586,
|
|
"loss": 4.9519,
|
|
"mean_token_accuracy": 0.22875481098890305,
|
|
"num_tokens": 15703704.0,
|
|
"step": 7625
|
|
},
|
|
{
|
|
"entropy": 5.620166778564453,
|
|
"epoch": 6.770528184642699,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00017531515841651997,
|
|
"loss": 4.8281,
|
|
"mean_token_accuracy": 0.23683270514011384,
|
|
"num_tokens": 15714082.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 5.598400545120239,
|
|
"epoch": 6.774966711051931,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00017500645542978144,
|
|
"loss": 4.8359,
|
|
"mean_token_accuracy": 0.2366919055581093,
|
|
"num_tokens": 15723698.0,
|
|
"step": 7635
|
|
},
|
|
{
|
|
"entropy": 5.5909511089324955,
|
|
"epoch": 6.779405237461162,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001746979868210793,
|
|
"loss": 4.8543,
|
|
"mean_token_accuracy": 0.23210738301277162,
|
|
"num_tokens": 15734031.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 5.579500579833985,
|
|
"epoch": 6.7838437638703954,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00017438975331344285,
|
|
"loss": 4.9171,
|
|
"mean_token_accuracy": 0.23237429410219193,
|
|
"num_tokens": 15743970.0,
|
|
"step": 7645
|
|
},
|
|
{
|
|
"entropy": 5.608100414276123,
|
|
"epoch": 6.788282290279627,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001740817556293501,
|
|
"loss": 4.8341,
|
|
"mean_token_accuracy": 0.2382849484682083,
|
|
"num_tokens": 15754037.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 5.606877136230469,
|
|
"epoch": 6.79272081668886,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0001737739944907269,
|
|
"loss": 4.8736,
|
|
"mean_token_accuracy": 0.239120714366436,
|
|
"num_tokens": 15763709.0,
|
|
"step": 7655
|
|
},
|
|
{
|
|
"entropy": 5.696621513366699,
|
|
"epoch": 6.797159343098091,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0001734664706189441,
|
|
"loss": 4.9923,
|
|
"mean_token_accuracy": 0.21968121081590652,
|
|
"num_tokens": 15775153.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 5.618563842773438,
|
|
"epoch": 6.801597869507324,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00017315918473481673,
|
|
"loss": 4.8721,
|
|
"mean_token_accuracy": 0.2420559421181679,
|
|
"num_tokens": 15785221.0,
|
|
"step": 7665
|
|
},
|
|
{
|
|
"entropy": 5.641010332107544,
|
|
"epoch": 6.806036395916555,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000172852137558602,
|
|
"loss": 4.9103,
|
|
"mean_token_accuracy": 0.2399204134941101,
|
|
"num_tokens": 15795971.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 5.672269058227539,
|
|
"epoch": 6.810474922325788,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00017254532980999731,
|
|
"loss": 4.8691,
|
|
"mean_token_accuracy": 0.23459128886461258,
|
|
"num_tokens": 15806397.0,
|
|
"step": 7675
|
|
},
|
|
{
|
|
"entropy": 5.6173951625823975,
|
|
"epoch": 6.81491344873502,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00017223876220813928,
|
|
"loss": 4.8804,
|
|
"mean_token_accuracy": 0.23836596608161925,
|
|
"num_tokens": 15816321.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 5.586831521987915,
|
|
"epoch": 6.819351975144252,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00017193243547160137,
|
|
"loss": 4.8242,
|
|
"mean_token_accuracy": 0.24257457554340361,
|
|
"num_tokens": 15827589.0,
|
|
"step": 7685
|
|
},
|
|
{
|
|
"entropy": 5.634782886505127,
|
|
"epoch": 6.823790501553484,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00017162635031839235,
|
|
"loss": 4.9055,
|
|
"mean_token_accuracy": 0.23421668708324433,
|
|
"num_tokens": 15837946.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 5.573149108886719,
|
|
"epoch": 6.828229027962716,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00017132050746595506,
|
|
"loss": 4.8026,
|
|
"mean_token_accuracy": 0.24179507941007614,
|
|
"num_tokens": 15847654.0,
|
|
"step": 7695
|
|
},
|
|
{
|
|
"entropy": 5.647809982299805,
|
|
"epoch": 6.832667554371948,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00017101490763116425,
|
|
"loss": 4.9371,
|
|
"mean_token_accuracy": 0.22609542757272721,
|
|
"num_tokens": 15857984.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 5.635323572158813,
|
|
"epoch": 6.83710608078118,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0001707095515303249,
|
|
"loss": 4.8504,
|
|
"mean_token_accuracy": 0.23756092488765718,
|
|
"num_tokens": 15869471.0,
|
|
"step": 7705
|
|
},
|
|
{
|
|
"entropy": 5.684949541091919,
|
|
"epoch": 6.8415446071904125,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00017040443987917107,
|
|
"loss": 4.8949,
|
|
"mean_token_accuracy": 0.2333218827843666,
|
|
"num_tokens": 15881198.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 5.671195602416992,
|
|
"epoch": 6.845983133599645,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00017009957339286346,
|
|
"loss": 4.9099,
|
|
"mean_token_accuracy": 0.2356297641992569,
|
|
"num_tokens": 15891509.0,
|
|
"step": 7715
|
|
},
|
|
{
|
|
"entropy": 5.602191638946533,
|
|
"epoch": 6.850421660008877,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00016979495278598834,
|
|
"loss": 4.871,
|
|
"mean_token_accuracy": 0.24206794053316116,
|
|
"num_tokens": 15900121.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 5.614440202713013,
|
|
"epoch": 6.854860186418109,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00016949057877255568,
|
|
"loss": 4.8368,
|
|
"mean_token_accuracy": 0.23573466688394545,
|
|
"num_tokens": 15908775.0,
|
|
"step": 7725
|
|
},
|
|
{
|
|
"entropy": 5.610541772842407,
|
|
"epoch": 6.859298712827341,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00016918645206599715,
|
|
"loss": 4.8102,
|
|
"mean_token_accuracy": 0.24010200649499894,
|
|
"num_tokens": 15917829.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 5.631719636917114,
|
|
"epoch": 6.863737239236573,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0001688825733791652,
|
|
"loss": 4.9277,
|
|
"mean_token_accuracy": 0.23344822525978087,
|
|
"num_tokens": 15927670.0,
|
|
"step": 7735
|
|
},
|
|
{
|
|
"entropy": 5.6192333698272705,
|
|
"epoch": 6.868175765645805,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0001685789434243306,
|
|
"loss": 4.922,
|
|
"mean_token_accuracy": 0.22423568069934846,
|
|
"num_tokens": 15937185.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 5.648077774047851,
|
|
"epoch": 6.8726142920550375,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00016827556291318117,
|
|
"loss": 4.9116,
|
|
"mean_token_accuracy": 0.23681291341781616,
|
|
"num_tokens": 15948776.0,
|
|
"step": 7745
|
|
},
|
|
{
|
|
"entropy": 5.6142254829406735,
|
|
"epoch": 6.87705281846427,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00016797243255682026,
|
|
"loss": 4.8721,
|
|
"mean_token_accuracy": 0.24417632073163986,
|
|
"num_tokens": 15958741.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 5.580417346954346,
|
|
"epoch": 6.881491344873502,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00016766955306576458,
|
|
"loss": 4.8672,
|
|
"mean_token_accuracy": 0.23564981371164323,
|
|
"num_tokens": 15968575.0,
|
|
"step": 7755
|
|
},
|
|
{
|
|
"entropy": 5.58715934753418,
|
|
"epoch": 6.885929871282734,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001673669251499429,
|
|
"loss": 4.8962,
|
|
"mean_token_accuracy": 0.24195304811000823,
|
|
"num_tokens": 15978289.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 5.612484931945801,
|
|
"epoch": 6.890368397691966,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00016706454951869468,
|
|
"loss": 4.8167,
|
|
"mean_token_accuracy": 0.24455712735652924,
|
|
"num_tokens": 15988087.0,
|
|
"step": 7765
|
|
},
|
|
{
|
|
"entropy": 5.672069263458252,
|
|
"epoch": 6.894806924101198,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00016676242688076737,
|
|
"loss": 4.9011,
|
|
"mean_token_accuracy": 0.23040000945329667,
|
|
"num_tokens": 15999263.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 5.626254987716675,
|
|
"epoch": 6.89924545051043,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00016646055794431602,
|
|
"loss": 4.8864,
|
|
"mean_token_accuracy": 0.23542827218770981,
|
|
"num_tokens": 16010039.0,
|
|
"step": 7775
|
|
},
|
|
{
|
|
"entropy": 5.612948799133301,
|
|
"epoch": 6.9036839769196625,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00016615894341690074,
|
|
"loss": 4.8774,
|
|
"mean_token_accuracy": 0.23686619699001313,
|
|
"num_tokens": 16018979.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 5.56874713897705,
|
|
"epoch": 6.908122503328895,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001658575840054853,
|
|
"loss": 4.8396,
|
|
"mean_token_accuracy": 0.23484621644020082,
|
|
"num_tokens": 16028075.0,
|
|
"step": 7785
|
|
},
|
|
{
|
|
"entropy": 5.623555040359497,
|
|
"epoch": 6.912561029738127,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00016555648041643566,
|
|
"loss": 4.9398,
|
|
"mean_token_accuracy": 0.2301971957087517,
|
|
"num_tokens": 16038532.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 5.58894534111023,
|
|
"epoch": 6.916999556147359,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00016525563335551804,
|
|
"loss": 4.8413,
|
|
"mean_token_accuracy": 0.23962522596120833,
|
|
"num_tokens": 16049499.0,
|
|
"step": 7795
|
|
},
|
|
{
|
|
"entropy": 5.654615020751953,
|
|
"epoch": 6.921438082556591,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00016495504352789735,
|
|
"loss": 4.8943,
|
|
"mean_token_accuracy": 0.2340008422732353,
|
|
"num_tokens": 16059020.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 5.549252653121949,
|
|
"epoch": 6.925876608965823,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00016465471163813576,
|
|
"loss": 4.8341,
|
|
"mean_token_accuracy": 0.23921622186899186,
|
|
"num_tokens": 16069271.0,
|
|
"step": 7805
|
|
},
|
|
{
|
|
"entropy": 5.637233638763428,
|
|
"epoch": 6.930315135375055,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00016435463839019045,
|
|
"loss": 4.9143,
|
|
"mean_token_accuracy": 0.23102892190217972,
|
|
"num_tokens": 16079660.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 5.671835803985596,
|
|
"epoch": 6.9347536617842875,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001640548244874128,
|
|
"loss": 4.8808,
|
|
"mean_token_accuracy": 0.23606295734643937,
|
|
"num_tokens": 16089634.0,
|
|
"step": 7815
|
|
},
|
|
{
|
|
"entropy": 5.636116361618042,
|
|
"epoch": 6.93919218819352,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00016375527063254604,
|
|
"loss": 4.8349,
|
|
"mean_token_accuracy": 0.23580583930015564,
|
|
"num_tokens": 16100013.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 5.611877584457398,
|
|
"epoch": 6.943630714602752,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0001634559775277239,
|
|
"loss": 4.8247,
|
|
"mean_token_accuracy": 0.23430021107196808,
|
|
"num_tokens": 16109348.0,
|
|
"step": 7825
|
|
},
|
|
{
|
|
"entropy": 5.6350829124450685,
|
|
"epoch": 6.948069241011984,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001631569458744691,
|
|
"loss": 4.9357,
|
|
"mean_token_accuracy": 0.2324354037642479,
|
|
"num_tokens": 16120660.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 5.551068735122681,
|
|
"epoch": 6.952507767421216,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00016285817637369133,
|
|
"loss": 4.8583,
|
|
"mean_token_accuracy": 0.24234248846769332,
|
|
"num_tokens": 16130641.0,
|
|
"step": 7835
|
|
},
|
|
{
|
|
"entropy": 5.60447063446045,
|
|
"epoch": 6.956946293830448,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00016255966972568574,
|
|
"loss": 4.8934,
|
|
"mean_token_accuracy": 0.23625647723674775,
|
|
"num_tokens": 16141064.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 5.656469106674194,
|
|
"epoch": 6.96138482023968,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0001622614266301319,
|
|
"loss": 4.8802,
|
|
"mean_token_accuracy": 0.2349098026752472,
|
|
"num_tokens": 16152028.0,
|
|
"step": 7845
|
|
},
|
|
{
|
|
"entropy": 5.541554498672485,
|
|
"epoch": 6.965823346648913,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001619634477860908,
|
|
"loss": 4.7703,
|
|
"mean_token_accuracy": 0.25239986926317215,
|
|
"num_tokens": 16161791.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 5.6629115581512455,
|
|
"epoch": 6.970261873058145,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00016166573389200478,
|
|
"loss": 4.8822,
|
|
"mean_token_accuracy": 0.2337420627474785,
|
|
"num_tokens": 16171400.0,
|
|
"step": 7855
|
|
},
|
|
{
|
|
"entropy": 5.680152702331543,
|
|
"epoch": 6.974700399467377,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00016136828564569482,
|
|
"loss": 4.9182,
|
|
"mean_token_accuracy": 0.23141363710165025,
|
|
"num_tokens": 16181021.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 5.649973583221436,
|
|
"epoch": 6.979138925876609,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00016107110374435912,
|
|
"loss": 4.9242,
|
|
"mean_token_accuracy": 0.22770167738199235,
|
|
"num_tokens": 16191776.0,
|
|
"step": 7865
|
|
},
|
|
{
|
|
"entropy": 5.62092866897583,
|
|
"epoch": 6.983577452285841,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00016077418888457197,
|
|
"loss": 4.824,
|
|
"mean_token_accuracy": 0.2396681249141693,
|
|
"num_tokens": 16201794.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 5.5582726955413815,
|
|
"epoch": 6.988015978695073,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00016047754176228145,
|
|
"loss": 4.7942,
|
|
"mean_token_accuracy": 0.24241213947534562,
|
|
"num_tokens": 16212336.0,
|
|
"step": 7875
|
|
},
|
|
{
|
|
"entropy": 5.62031569480896,
|
|
"epoch": 6.992454505104305,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00016018116307280801,
|
|
"loss": 4.8205,
|
|
"mean_token_accuracy": 0.23726749718189238,
|
|
"num_tokens": 16221807.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 5.605819463729858,
|
|
"epoch": 6.996893031513538,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00015988505351084334,
|
|
"loss": 4.8163,
|
|
"mean_token_accuracy": 0.24274969846010208,
|
|
"num_tokens": 16231396.0,
|
|
"step": 7885
|
|
},
|
|
{
|
|
"entropy": 5.611403094397651,
|
|
"epoch": 7.000887705281847,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00015958921377044765,
|
|
"loss": 4.8752,
|
|
"mean_token_accuracy": 0.23783743215931785,
|
|
"num_tokens": 16240104.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 5.617601537704468,
|
|
"epoch": 7.005326231691079,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00015929364454504935,
|
|
"loss": 4.7332,
|
|
"mean_token_accuracy": 0.24038610905408858,
|
|
"num_tokens": 16250248.0,
|
|
"step": 7895
|
|
},
|
|
{
|
|
"entropy": 5.608922958374023,
|
|
"epoch": 7.009764758100311,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00015899834652744247,
|
|
"loss": 4.733,
|
|
"mean_token_accuracy": 0.2499992936849594,
|
|
"num_tokens": 16260247.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 5.593012189865112,
|
|
"epoch": 7.014203284509543,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0001587033204097852,
|
|
"loss": 4.7298,
|
|
"mean_token_accuracy": 0.2503066956996918,
|
|
"num_tokens": 16269958.0,
|
|
"step": 7905
|
|
},
|
|
{
|
|
"entropy": 5.577810621261596,
|
|
"epoch": 7.018641810918775,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00015840856688359887,
|
|
"loss": 4.7438,
|
|
"mean_token_accuracy": 0.2486233279109001,
|
|
"num_tokens": 16280207.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 5.584585094451905,
|
|
"epoch": 7.0230803373280075,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00015811408663976546,
|
|
"loss": 4.7719,
|
|
"mean_token_accuracy": 0.2526538476347923,
|
|
"num_tokens": 16290643.0,
|
|
"step": 7915
|
|
},
|
|
{
|
|
"entropy": 5.6261121273040775,
|
|
"epoch": 7.02751886373724,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00015781988036852647,
|
|
"loss": 4.8066,
|
|
"mean_token_accuracy": 0.24251403659582138,
|
|
"num_tokens": 16300275.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 5.6150976657867435,
|
|
"epoch": 7.031957390146472,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00015752594875948156,
|
|
"loss": 4.7842,
|
|
"mean_token_accuracy": 0.25247207581996917,
|
|
"num_tokens": 16310325.0,
|
|
"step": 7925
|
|
},
|
|
{
|
|
"entropy": 5.57365460395813,
|
|
"epoch": 7.036395916555703,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00015723229250158598,
|
|
"loss": 4.7528,
|
|
"mean_token_accuracy": 0.2452716886997223,
|
|
"num_tokens": 16321162.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 5.581171464920044,
|
|
"epoch": 7.040834442964935,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00015693891228315025,
|
|
"loss": 4.8408,
|
|
"mean_token_accuracy": 0.23999989181756973,
|
|
"num_tokens": 16331547.0,
|
|
"step": 7935
|
|
},
|
|
{
|
|
"entropy": 5.694797801971435,
|
|
"epoch": 7.045272969374167,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00015664580879183737,
|
|
"loss": 4.8351,
|
|
"mean_token_accuracy": 0.23663006126880645,
|
|
"num_tokens": 16342123.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 5.667220640182495,
|
|
"epoch": 7.0497114957833995,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00015635298271466188,
|
|
"loss": 4.8549,
|
|
"mean_token_accuracy": 0.24184161573648452,
|
|
"num_tokens": 16351556.0,
|
|
"step": 7945
|
|
},
|
|
{
|
|
"entropy": 5.655506229400634,
|
|
"epoch": 7.054150022192632,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001560604347379883,
|
|
"loss": 4.7944,
|
|
"mean_token_accuracy": 0.24469185769557952,
|
|
"num_tokens": 16362218.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 5.643814659118652,
|
|
"epoch": 7.058588548601864,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00015576816554752892,
|
|
"loss": 4.8398,
|
|
"mean_token_accuracy": 0.2360506162047386,
|
|
"num_tokens": 16371950.0,
|
|
"step": 7955
|
|
},
|
|
{
|
|
"entropy": 5.625913333892822,
|
|
"epoch": 7.063027075011096,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00015547617582834273,
|
|
"loss": 4.7247,
|
|
"mean_token_accuracy": 0.2517290264368057,
|
|
"num_tokens": 16382809.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 5.650652074813843,
|
|
"epoch": 7.067465601420328,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00015518446626483392,
|
|
"loss": 4.8532,
|
|
"mean_token_accuracy": 0.24074320048093795,
|
|
"num_tokens": 16394067.0,
|
|
"step": 7965
|
|
},
|
|
{
|
|
"entropy": 5.593384456634522,
|
|
"epoch": 7.07190412782956,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00015489303754074945,
|
|
"loss": 4.7416,
|
|
"mean_token_accuracy": 0.2478596895933151,
|
|
"num_tokens": 16404440.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 5.613967704772949,
|
|
"epoch": 7.076342654238792,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0001546018903391786,
|
|
"loss": 4.8099,
|
|
"mean_token_accuracy": 0.24362023770809174,
|
|
"num_tokens": 16416590.0,
|
|
"step": 7975
|
|
},
|
|
{
|
|
"entropy": 5.635798025131225,
|
|
"epoch": 7.0807811806480245,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00015431102534255037,
|
|
"loss": 4.7756,
|
|
"mean_token_accuracy": 0.24231118112802505,
|
|
"num_tokens": 16427693.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 5.642639303207398,
|
|
"epoch": 7.085219707057257,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00015402044323263242,
|
|
"loss": 4.831,
|
|
"mean_token_accuracy": 0.23662135750055313,
|
|
"num_tokens": 16437620.0,
|
|
"step": 7985
|
|
},
|
|
{
|
|
"entropy": 5.609428071975708,
|
|
"epoch": 7.089658233466489,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00015373014469052948,
|
|
"loss": 4.8572,
|
|
"mean_token_accuracy": 0.238211490213871,
|
|
"num_tokens": 16448687.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 5.6499780178070065,
|
|
"epoch": 7.094096759875721,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00015344013039668148,
|
|
"loss": 4.7807,
|
|
"mean_token_accuracy": 0.24328325241804122,
|
|
"num_tokens": 16459468.0,
|
|
"step": 7995
|
|
},
|
|
{
|
|
"entropy": 5.5954752445220945,
|
|
"epoch": 7.098535286284953,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00015315040103086196,
|
|
"loss": 4.6931,
|
|
"mean_token_accuracy": 0.2483156830072403,
|
|
"num_tokens": 16469724.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"epoch": 7.098535286284953,
|
|
"eval_entropy": 5.416269718043312,
|
|
"eval_loss": 5.778171062469482,
|
|
"eval_mean_token_accuracy": 0.18130150968275274,
|
|
"eval_num_tokens": 16469724.0,
|
|
"eval_runtime": 2.0808,
|
|
"eval_samples_per_second": 1618.107,
|
|
"eval_steps_per_second": 202.323,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 5.651164579391479,
|
|
"epoch": 7.102973812694185,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00015286095727217702,
|
|
"loss": 4.788,
|
|
"mean_token_accuracy": 0.24188789278268813,
|
|
"num_tokens": 16480223.0,
|
|
"step": 8005
|
|
},
|
|
{
|
|
"entropy": 5.616126251220703,
|
|
"epoch": 7.107412339103417,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00015257179979906278,
|
|
"loss": 4.8052,
|
|
"mean_token_accuracy": 0.2415272295475006,
|
|
"num_tokens": 16490135.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 5.582115650177002,
|
|
"epoch": 7.1118508655126496,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00015228292928928471,
|
|
"loss": 4.8165,
|
|
"mean_token_accuracy": 0.2410730466246605,
|
|
"num_tokens": 16500319.0,
|
|
"step": 8015
|
|
},
|
|
{
|
|
"entropy": 5.669525909423828,
|
|
"epoch": 7.116289391921882,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00015199434641993565,
|
|
"loss": 4.8401,
|
|
"mean_token_accuracy": 0.23958230316638945,
|
|
"num_tokens": 16511567.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 5.6151392459869385,
|
|
"epoch": 7.120727918331114,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00015170605186743392,
|
|
"loss": 4.7799,
|
|
"mean_token_accuracy": 0.24504974186420442,
|
|
"num_tokens": 16522257.0,
|
|
"step": 8025
|
|
},
|
|
{
|
|
"entropy": 5.647300052642822,
|
|
"epoch": 7.125166444740346,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00015141804630752244,
|
|
"loss": 4.7894,
|
|
"mean_token_accuracy": 0.24213282614946366,
|
|
"num_tokens": 16532265.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 5.626792287826538,
|
|
"epoch": 7.129604971149578,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00015113033041526652,
|
|
"loss": 4.8792,
|
|
"mean_token_accuracy": 0.2439812406897545,
|
|
"num_tokens": 16542011.0,
|
|
"step": 8035
|
|
},
|
|
{
|
|
"entropy": 5.654769802093506,
|
|
"epoch": 7.13404349755881,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00015084290486505242,
|
|
"loss": 4.865,
|
|
"mean_token_accuracy": 0.24027765691280364,
|
|
"num_tokens": 16553061.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 5.595619964599609,
|
|
"epoch": 7.138482023968042,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00015055577033058626,
|
|
"loss": 4.7966,
|
|
"mean_token_accuracy": 0.24340930283069612,
|
|
"num_tokens": 16562284.0,
|
|
"step": 8045
|
|
},
|
|
{
|
|
"entropy": 5.592163181304931,
|
|
"epoch": 7.142920550377275,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001502689274848914,
|
|
"loss": 4.7704,
|
|
"mean_token_accuracy": 0.24650910049676894,
|
|
"num_tokens": 16572492.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 5.594275903701782,
|
|
"epoch": 7.147359076786507,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00014998237700030822,
|
|
"loss": 4.7289,
|
|
"mean_token_accuracy": 0.2570605859160423,
|
|
"num_tokens": 16582753.0,
|
|
"step": 8055
|
|
},
|
|
{
|
|
"entropy": 5.582263565063476,
|
|
"epoch": 7.151797603195739,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00014969611954849133,
|
|
"loss": 4.7189,
|
|
"mean_token_accuracy": 0.24957410544157027,
|
|
"num_tokens": 16593046.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 5.651943874359131,
|
|
"epoch": 7.156236129604971,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00014941015580040854,
|
|
"loss": 4.8262,
|
|
"mean_token_accuracy": 0.24293568581342698,
|
|
"num_tokens": 16603400.0,
|
|
"step": 8065
|
|
},
|
|
{
|
|
"entropy": 5.586185884475708,
|
|
"epoch": 7.160674656014203,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00014912448642633952,
|
|
"loss": 4.7195,
|
|
"mean_token_accuracy": 0.24556244909763336,
|
|
"num_tokens": 16613889.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 5.669100713729859,
|
|
"epoch": 7.165113182423435,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00014883911209587366,
|
|
"loss": 4.8462,
|
|
"mean_token_accuracy": 0.23542421609163283,
|
|
"num_tokens": 16624608.0,
|
|
"step": 8075
|
|
},
|
|
{
|
|
"entropy": 5.593939876556396,
|
|
"epoch": 7.1695517088326675,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00014855403347790885,
|
|
"loss": 4.7833,
|
|
"mean_token_accuracy": 0.2390362352132797,
|
|
"num_tokens": 16634799.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 5.643000841140747,
|
|
"epoch": 7.1739902352419,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00014826925124065014,
|
|
"loss": 4.8217,
|
|
"mean_token_accuracy": 0.2355726256966591,
|
|
"num_tokens": 16644582.0,
|
|
"step": 8085
|
|
},
|
|
{
|
|
"entropy": 5.65504035949707,
|
|
"epoch": 7.178428761651132,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00014798476605160728,
|
|
"loss": 4.8574,
|
|
"mean_token_accuracy": 0.2403621941804886,
|
|
"num_tokens": 16654796.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 5.659970712661743,
|
|
"epoch": 7.182867288060364,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014770057857759438,
|
|
"loss": 4.8621,
|
|
"mean_token_accuracy": 0.23705325424671173,
|
|
"num_tokens": 16665793.0,
|
|
"step": 8095
|
|
},
|
|
{
|
|
"entropy": 5.625168418884277,
|
|
"epoch": 7.187305814469596,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00014741668948472735,
|
|
"loss": 4.7672,
|
|
"mean_token_accuracy": 0.24221248626708985,
|
|
"num_tokens": 16674958.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 5.568954133987427,
|
|
"epoch": 7.191744340878828,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00014713309943842272,
|
|
"loss": 4.7851,
|
|
"mean_token_accuracy": 0.24504324346780776,
|
|
"num_tokens": 16685320.0,
|
|
"step": 8105
|
|
},
|
|
{
|
|
"entropy": 5.607044839859009,
|
|
"epoch": 7.19618286728806,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00014684980910339645,
|
|
"loss": 4.7711,
|
|
"mean_token_accuracy": 0.24917140752077102,
|
|
"num_tokens": 16695279.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 5.614578485488892,
|
|
"epoch": 7.2006213936972925,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0001465668191436616,
|
|
"loss": 4.7459,
|
|
"mean_token_accuracy": 0.25655201226472857,
|
|
"num_tokens": 16705034.0,
|
|
"step": 8115
|
|
},
|
|
{
|
|
"entropy": 5.586905288696289,
|
|
"epoch": 7.205059920106525,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00014628413022252715,
|
|
"loss": 4.7428,
|
|
"mean_token_accuracy": 0.25043479800224305,
|
|
"num_tokens": 16715572.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 5.572377347946167,
|
|
"epoch": 7.209498446515757,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00014600174300259693,
|
|
"loss": 4.7813,
|
|
"mean_token_accuracy": 0.2421206369996071,
|
|
"num_tokens": 16725414.0,
|
|
"step": 8125
|
|
},
|
|
{
|
|
"entropy": 5.618861246109009,
|
|
"epoch": 7.213936972924989,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000145719658145767,
|
|
"loss": 4.7864,
|
|
"mean_token_accuracy": 0.2453219085931778,
|
|
"num_tokens": 16736485.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 5.598287868499756,
|
|
"epoch": 7.218375499334221,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00014543787631322513,
|
|
"loss": 4.7182,
|
|
"mean_token_accuracy": 0.249337999522686,
|
|
"num_tokens": 16746552.0,
|
|
"step": 8135
|
|
},
|
|
{
|
|
"entropy": 5.60232572555542,
|
|
"epoch": 7.222814025743453,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00014515639816544865,
|
|
"loss": 4.8132,
|
|
"mean_token_accuracy": 0.24463479816913605,
|
|
"num_tokens": 16756982.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 5.613389492034912,
|
|
"epoch": 7.227252552152685,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00014487522436220304,
|
|
"loss": 4.8303,
|
|
"mean_token_accuracy": 0.24313561469316483,
|
|
"num_tokens": 16766563.0,
|
|
"step": 8145
|
|
},
|
|
{
|
|
"entropy": 5.582632398605346,
|
|
"epoch": 7.2316910785619175,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00014459435556254062,
|
|
"loss": 4.6934,
|
|
"mean_token_accuracy": 0.25378575921058655,
|
|
"num_tokens": 16777232.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 5.6129851818084715,
|
|
"epoch": 7.23612960497115,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014431379242479863,
|
|
"loss": 4.7535,
|
|
"mean_token_accuracy": 0.25162407010793686,
|
|
"num_tokens": 16786792.0,
|
|
"step": 8155
|
|
},
|
|
{
|
|
"entropy": 5.604517221450806,
|
|
"epoch": 7.240568131380382,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00014403353560659776,
|
|
"loss": 4.7447,
|
|
"mean_token_accuracy": 0.24262727200984954,
|
|
"num_tokens": 16796834.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 5.579232788085937,
|
|
"epoch": 7.245006657789614,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00014375358576484114,
|
|
"loss": 4.7236,
|
|
"mean_token_accuracy": 0.2525438666343689,
|
|
"num_tokens": 16806097.0,
|
|
"step": 8165
|
|
},
|
|
{
|
|
"entropy": 5.604126691818237,
|
|
"epoch": 7.249445184198846,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00014347394355571167,
|
|
"loss": 4.8413,
|
|
"mean_token_accuracy": 0.24283919632434844,
|
|
"num_tokens": 16816811.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 5.674602937698364,
|
|
"epoch": 7.253883710608078,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001431946096346719,
|
|
"loss": 4.8962,
|
|
"mean_token_accuracy": 0.23681159764528276,
|
|
"num_tokens": 16828927.0,
|
|
"step": 8175
|
|
},
|
|
{
|
|
"entropy": 5.653934621810913,
|
|
"epoch": 7.25832223701731,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00014291558465646132,
|
|
"loss": 4.8392,
|
|
"mean_token_accuracy": 0.23177510201931,
|
|
"num_tokens": 16839250.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 5.555654811859131,
|
|
"epoch": 7.2627607634265425,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0001426368692750954,
|
|
"loss": 4.7814,
|
|
"mean_token_accuracy": 0.24895949065685272,
|
|
"num_tokens": 16849457.0,
|
|
"step": 8185
|
|
},
|
|
{
|
|
"entropy": 5.590941286087036,
|
|
"epoch": 7.267199289835775,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000142358464143864,
|
|
"loss": 4.7414,
|
|
"mean_token_accuracy": 0.24497014433145523,
|
|
"num_tokens": 16858862.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 5.648228549957276,
|
|
"epoch": 7.271637816245007,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00014208036991532978,
|
|
"loss": 4.8389,
|
|
"mean_token_accuracy": 0.24611674398183822,
|
|
"num_tokens": 16869066.0,
|
|
"step": 8195
|
|
},
|
|
{
|
|
"entropy": 5.58711838722229,
|
|
"epoch": 7.276076342654239,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0001418025872413264,
|
|
"loss": 4.7427,
|
|
"mean_token_accuracy": 0.24696867167949677,
|
|
"num_tokens": 16879246.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 5.584018802642822,
|
|
"epoch": 7.280514869063471,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00014152511677295785,
|
|
"loss": 4.7609,
|
|
"mean_token_accuracy": 0.24561516046524048,
|
|
"num_tokens": 16888806.0,
|
|
"step": 8205
|
|
},
|
|
{
|
|
"entropy": 5.621240139007568,
|
|
"epoch": 7.284953395472703,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00014124795916059548,
|
|
"loss": 4.9081,
|
|
"mean_token_accuracy": 0.22466619163751603,
|
|
"num_tokens": 16900026.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 5.57724928855896,
|
|
"epoch": 7.289391921881935,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00014097111505387817,
|
|
"loss": 4.7535,
|
|
"mean_token_accuracy": 0.25008971244096756,
|
|
"num_tokens": 16909663.0,
|
|
"step": 8215
|
|
},
|
|
{
|
|
"entropy": 5.5794919490814205,
|
|
"epoch": 7.293830448291168,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001406945851017094,
|
|
"loss": 4.7522,
|
|
"mean_token_accuracy": 0.24882604479789733,
|
|
"num_tokens": 16919436.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 5.577401781082154,
|
|
"epoch": 7.2982689747004,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00014041836995225645,
|
|
"loss": 4.7693,
|
|
"mean_token_accuracy": 0.24174992591142655,
|
|
"num_tokens": 16929163.0,
|
|
"step": 8225
|
|
},
|
|
{
|
|
"entropy": 5.630890655517578,
|
|
"epoch": 7.302707501109632,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00014014247025294897,
|
|
"loss": 4.809,
|
|
"mean_token_accuracy": 0.2426743283867836,
|
|
"num_tokens": 16939311.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 5.585244750976562,
|
|
"epoch": 7.307146027518864,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001398668866504768,
|
|
"loss": 4.7743,
|
|
"mean_token_accuracy": 0.2385195553302765,
|
|
"num_tokens": 16950136.0,
|
|
"step": 8235
|
|
},
|
|
{
|
|
"entropy": 5.620087766647339,
|
|
"epoch": 7.311584553928096,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0001395916197907891,
|
|
"loss": 4.7774,
|
|
"mean_token_accuracy": 0.24441735893487931,
|
|
"num_tokens": 16959466.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 5.5653503894805905,
|
|
"epoch": 7.316023080337328,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00013931667031909283,
|
|
"loss": 4.7811,
|
|
"mean_token_accuracy": 0.24182346761226653,
|
|
"num_tokens": 16969215.0,
|
|
"step": 8245
|
|
},
|
|
{
|
|
"entropy": 5.589449644088745,
|
|
"epoch": 7.32046160674656,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00013904203887985035,
|
|
"loss": 4.7746,
|
|
"mean_token_accuracy": 0.25069549679756165,
|
|
"num_tokens": 16979461.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 5.623612976074218,
|
|
"epoch": 7.324900133155793,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001387677261167793,
|
|
"loss": 4.8033,
|
|
"mean_token_accuracy": 0.23954901844263077,
|
|
"num_tokens": 16989869.0,
|
|
"step": 8255
|
|
},
|
|
{
|
|
"entropy": 5.55921311378479,
|
|
"epoch": 7.329338659565025,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00013849373267284997,
|
|
"loss": 4.7743,
|
|
"mean_token_accuracy": 0.24666431099176406,
|
|
"num_tokens": 17000056.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 5.6654010772705075,
|
|
"epoch": 7.333777185974257,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00013822005919028412,
|
|
"loss": 4.9138,
|
|
"mean_token_accuracy": 0.2361399546265602,
|
|
"num_tokens": 17009954.0,
|
|
"step": 8265
|
|
},
|
|
{
|
|
"entropy": 5.561171245574951,
|
|
"epoch": 7.338215712383489,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00013794670631055395,
|
|
"loss": 4.785,
|
|
"mean_token_accuracy": 0.25198626667261126,
|
|
"num_tokens": 17020515.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 5.614985752105713,
|
|
"epoch": 7.342654238792721,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00013767367467437986,
|
|
"loss": 4.816,
|
|
"mean_token_accuracy": 0.2471354067325592,
|
|
"num_tokens": 17031197.0,
|
|
"step": 8275
|
|
},
|
|
{
|
|
"entropy": 5.621808576583862,
|
|
"epoch": 7.347092765201953,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00013740096492172917,
|
|
"loss": 4.8355,
|
|
"mean_token_accuracy": 0.23394697159528732,
|
|
"num_tokens": 17042475.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 5.651164102554321,
|
|
"epoch": 7.3515312916111855,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00013712857769181518,
|
|
"loss": 4.8466,
|
|
"mean_token_accuracy": 0.24291353672742844,
|
|
"num_tokens": 17052168.0,
|
|
"step": 8285
|
|
},
|
|
{
|
|
"entropy": 5.595386266708374,
|
|
"epoch": 7.355969818020418,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0001368565136230947,
|
|
"loss": 4.765,
|
|
"mean_token_accuracy": 0.2448628842830658,
|
|
"num_tokens": 17061860.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 5.576072359085083,
|
|
"epoch": 7.36040834442965,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001365847733532675,
|
|
"loss": 4.764,
|
|
"mean_token_accuracy": 0.24507157057523726,
|
|
"num_tokens": 17071231.0,
|
|
"step": 8295
|
|
},
|
|
{
|
|
"entropy": 5.6070592403411865,
|
|
"epoch": 7.364846870838882,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001363133575192741,
|
|
"loss": 4.7643,
|
|
"mean_token_accuracy": 0.24564572423696518,
|
|
"num_tokens": 17080847.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 5.653164005279541,
|
|
"epoch": 7.369285397248113,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00013604226675729465,
|
|
"loss": 4.8657,
|
|
"mean_token_accuracy": 0.24031397998332976,
|
|
"num_tokens": 17091449.0,
|
|
"step": 8305
|
|
},
|
|
{
|
|
"entropy": 5.611967277526856,
|
|
"epoch": 7.373723923657346,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001357715017027475,
|
|
"loss": 4.7416,
|
|
"mean_token_accuracy": 0.25372110307216644,
|
|
"num_tokens": 17100493.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 5.636879110336304,
|
|
"epoch": 7.3781624500665774,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00013550106299028733,
|
|
"loss": 4.8178,
|
|
"mean_token_accuracy": 0.24200106412172318,
|
|
"num_tokens": 17111940.0,
|
|
"step": 8315
|
|
},
|
|
{
|
|
"entropy": 5.599853277206421,
|
|
"epoch": 7.3826009764758105,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00013523095125380396,
|
|
"loss": 4.7741,
|
|
"mean_token_accuracy": 0.24679408073425294,
|
|
"num_tokens": 17121665.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 5.647273397445678,
|
|
"epoch": 7.387039502885042,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00013496116712642108,
|
|
"loss": 4.7879,
|
|
"mean_token_accuracy": 0.24034995436668397,
|
|
"num_tokens": 17131302.0,
|
|
"step": 8325
|
|
},
|
|
{
|
|
"entropy": 5.708431959152222,
|
|
"epoch": 7.391478029294274,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00013469171124049398,
|
|
"loss": 4.9057,
|
|
"mean_token_accuracy": 0.23542815893888475,
|
|
"num_tokens": 17141835.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 5.582692098617554,
|
|
"epoch": 7.395916555703506,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000134422584227609,
|
|
"loss": 4.8169,
|
|
"mean_token_accuracy": 0.24481576979160308,
|
|
"num_tokens": 17152606.0,
|
|
"step": 8335
|
|
},
|
|
{
|
|
"entropy": 5.668390130996704,
|
|
"epoch": 7.400355082112738,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00013415378671858142,
|
|
"loss": 4.749,
|
|
"mean_token_accuracy": 0.2478741630911827,
|
|
"num_tokens": 17162408.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 5.545242071151733,
|
|
"epoch": 7.40479360852197,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00013388531934345417,
|
|
"loss": 4.6783,
|
|
"mean_token_accuracy": 0.2598895564675331,
|
|
"num_tokens": 17173401.0,
|
|
"step": 8345
|
|
},
|
|
{
|
|
"entropy": 5.587543106079101,
|
|
"epoch": 7.4092321349312025,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0001336171827314966,
|
|
"loss": 4.7818,
|
|
"mean_token_accuracy": 0.24679094702005386,
|
|
"num_tokens": 17182496.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 5.61757607460022,
|
|
"epoch": 7.413670661340435,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00013334937751120247,
|
|
"loss": 4.7839,
|
|
"mean_token_accuracy": 0.2415824443101883,
|
|
"num_tokens": 17192356.0,
|
|
"step": 8355
|
|
},
|
|
{
|
|
"entropy": 5.605987405776977,
|
|
"epoch": 7.418109187749667,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00013308190431028893,
|
|
"loss": 4.773,
|
|
"mean_token_accuracy": 0.24593424350023269,
|
|
"num_tokens": 17201334.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 5.643883562088012,
|
|
"epoch": 7.422547714158899,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00013281476375569503,
|
|
"loss": 4.8575,
|
|
"mean_token_accuracy": 0.24084860384464263,
|
|
"num_tokens": 17212918.0,
|
|
"step": 8365
|
|
},
|
|
{
|
|
"entropy": 5.697737503051758,
|
|
"epoch": 7.426986240568131,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00013254795647357976,
|
|
"loss": 4.8512,
|
|
"mean_token_accuracy": 0.23984091579914094,
|
|
"num_tokens": 17222897.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 5.613522052764893,
|
|
"epoch": 7.431424766977363,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0001322814830893213,
|
|
"loss": 4.8029,
|
|
"mean_token_accuracy": 0.23903808891773223,
|
|
"num_tokens": 17233338.0,
|
|
"step": 8375
|
|
},
|
|
{
|
|
"entropy": 5.616470766067505,
|
|
"epoch": 7.435863293386595,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00013201534422751504,
|
|
"loss": 4.8359,
|
|
"mean_token_accuracy": 0.24246901124715806,
|
|
"num_tokens": 17244439.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 5.59759554862976,
|
|
"epoch": 7.4403018197958275,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0001317495405119722,
|
|
"loss": 4.7734,
|
|
"mean_token_accuracy": 0.24684369266033174,
|
|
"num_tokens": 17254550.0,
|
|
"step": 8385
|
|
},
|
|
{
|
|
"entropy": 5.620569324493408,
|
|
"epoch": 7.44474034620506,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00013148407256571864,
|
|
"loss": 4.7594,
|
|
"mean_token_accuracy": 0.24132882952690124,
|
|
"num_tokens": 17265261.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 5.621211385726928,
|
|
"epoch": 7.449178872614292,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001312189410109931,
|
|
"loss": 4.8165,
|
|
"mean_token_accuracy": 0.24573127329349517,
|
|
"num_tokens": 17275462.0,
|
|
"step": 8395
|
|
},
|
|
{
|
|
"entropy": 5.622348737716675,
|
|
"epoch": 7.453617399023524,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00013095414646924563,
|
|
"loss": 4.832,
|
|
"mean_token_accuracy": 0.23855035305023192,
|
|
"num_tokens": 17285418.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 5.603376388549805,
|
|
"epoch": 7.458055925432756,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00013068968956113686,
|
|
"loss": 4.7917,
|
|
"mean_token_accuracy": 0.24725850373506547,
|
|
"num_tokens": 17295611.0,
|
|
"step": 8405
|
|
},
|
|
{
|
|
"entropy": 5.593970584869385,
|
|
"epoch": 7.462494451841988,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00013042557090653538,
|
|
"loss": 4.8082,
|
|
"mean_token_accuracy": 0.24336805194616318,
|
|
"num_tokens": 17305926.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 5.599623537063598,
|
|
"epoch": 7.46693297825122,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00013016179112451754,
|
|
"loss": 4.8885,
|
|
"mean_token_accuracy": 0.2276719629764557,
|
|
"num_tokens": 17316835.0,
|
|
"step": 8415
|
|
},
|
|
{
|
|
"entropy": 5.628227233886719,
|
|
"epoch": 7.4713715046604525,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000129898350833365,
|
|
"loss": 4.8313,
|
|
"mean_token_accuracy": 0.2366963267326355,
|
|
"num_tokens": 17327368.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 5.5453413963317875,
|
|
"epoch": 7.475810031069685,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0001296352506505637,
|
|
"loss": 4.7561,
|
|
"mean_token_accuracy": 0.24766674339771272,
|
|
"num_tokens": 17338973.0,
|
|
"step": 8425
|
|
},
|
|
{
|
|
"entropy": 5.627303409576416,
|
|
"epoch": 7.480248557478917,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00012937249119280276,
|
|
"loss": 4.786,
|
|
"mean_token_accuracy": 0.24259506314992904,
|
|
"num_tokens": 17349120.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 5.637816619873047,
|
|
"epoch": 7.484687083888149,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00012911007307597216,
|
|
"loss": 4.7804,
|
|
"mean_token_accuracy": 0.24444835633039474,
|
|
"num_tokens": 17358366.0,
|
|
"step": 8435
|
|
},
|
|
{
|
|
"entropy": 5.634320783615112,
|
|
"epoch": 7.489125610297381,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00012884799691516207,
|
|
"loss": 4.8173,
|
|
"mean_token_accuracy": 0.24340624660253524,
|
|
"num_tokens": 17369251.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 5.561995983123779,
|
|
"epoch": 7.493564136706613,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00012858626332466134,
|
|
"loss": 4.7528,
|
|
"mean_token_accuracy": 0.2505992516875267,
|
|
"num_tokens": 17379592.0,
|
|
"step": 8445
|
|
},
|
|
{
|
|
"entropy": 5.634268283843994,
|
|
"epoch": 7.498002663115845,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00012832487291795529,
|
|
"loss": 4.934,
|
|
"mean_token_accuracy": 0.2370862290263176,
|
|
"num_tokens": 17392503.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 5.646816635131836,
|
|
"epoch": 7.5024411895250775,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00012806382630772538,
|
|
"loss": 4.8353,
|
|
"mean_token_accuracy": 0.239703668653965,
|
|
"num_tokens": 17402567.0,
|
|
"step": 8455
|
|
},
|
|
{
|
|
"entropy": 5.626044750213623,
|
|
"epoch": 7.50687971593431,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00012780312410584695,
|
|
"loss": 4.7913,
|
|
"mean_token_accuracy": 0.2436431348323822,
|
|
"num_tokens": 17412268.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 5.687927007675171,
|
|
"epoch": 7.511318242343542,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00012754276692338807,
|
|
"loss": 4.8221,
|
|
"mean_token_accuracy": 0.23432755172252656,
|
|
"num_tokens": 17422589.0,
|
|
"step": 8465
|
|
},
|
|
{
|
|
"entropy": 5.640648460388183,
|
|
"epoch": 7.515756768752774,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0001272827553706084,
|
|
"loss": 4.7236,
|
|
"mean_token_accuracy": 0.24965725988149642,
|
|
"num_tokens": 17432595.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 5.645471239089966,
|
|
"epoch": 7.520195295162006,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00012702309005695715,
|
|
"loss": 4.9422,
|
|
"mean_token_accuracy": 0.23136825263500213,
|
|
"num_tokens": 17443330.0,
|
|
"step": 8475
|
|
},
|
|
{
|
|
"entropy": 5.628073978424072,
|
|
"epoch": 7.524633821571238,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00012676377159107194,
|
|
"loss": 4.7252,
|
|
"mean_token_accuracy": 0.24868777692317962,
|
|
"num_tokens": 17453572.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 5.592718410491943,
|
|
"epoch": 7.52907234798047,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00012650480058077785,
|
|
"loss": 4.7902,
|
|
"mean_token_accuracy": 0.24778269678354264,
|
|
"num_tokens": 17464652.0,
|
|
"step": 8485
|
|
},
|
|
{
|
|
"entropy": 5.616911792755127,
|
|
"epoch": 7.533510874389703,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00012624617763308486,
|
|
"loss": 4.7939,
|
|
"mean_token_accuracy": 0.2487393707036972,
|
|
"num_tokens": 17474860.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 5.615617179870606,
|
|
"epoch": 7.537949400798935,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00012598790335418774,
|
|
"loss": 4.9042,
|
|
"mean_token_accuracy": 0.24065403640270233,
|
|
"num_tokens": 17485637.0,
|
|
"step": 8495
|
|
},
|
|
{
|
|
"entropy": 5.6045591831207275,
|
|
"epoch": 7.542387927208167,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00012572997834946371,
|
|
"loss": 4.8278,
|
|
"mean_token_accuracy": 0.2347078174352646,
|
|
"num_tokens": 17496413.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"epoch": 7.542387927208167,
|
|
"eval_entropy": 5.4126535277468575,
|
|
"eval_loss": 5.772815704345703,
|
|
"eval_mean_token_accuracy": 0.1815227924574016,
|
|
"eval_num_tokens": 17496413.0,
|
|
"eval_runtime": 2.084,
|
|
"eval_samples_per_second": 1615.661,
|
|
"eval_steps_per_second": 202.018,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 5.577853345870972,
|
|
"epoch": 7.546826453617399,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00012547240322347122,
|
|
"loss": 4.763,
|
|
"mean_token_accuracy": 0.242463056743145,
|
|
"num_tokens": 17506409.0,
|
|
"step": 8505
|
|
},
|
|
{
|
|
"entropy": 5.529885625839233,
|
|
"epoch": 7.551264980026631,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00012521517857994895,
|
|
"loss": 4.7195,
|
|
"mean_token_accuracy": 0.25806231051683426,
|
|
"num_tokens": 17515892.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 5.6272207736969,
|
|
"epoch": 7.555703506435863,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00012495830502181387,
|
|
"loss": 4.7613,
|
|
"mean_token_accuracy": 0.24957229048013688,
|
|
"num_tokens": 17526098.0,
|
|
"step": 8515
|
|
},
|
|
{
|
|
"entropy": 5.578021717071533,
|
|
"epoch": 7.5601420328450954,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00012470178315115987,
|
|
"loss": 4.8031,
|
|
"mean_token_accuracy": 0.2425813138484955,
|
|
"num_tokens": 17535981.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 5.602420663833618,
|
|
"epoch": 7.564580559254328,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00012444561356925697,
|
|
"loss": 4.8167,
|
|
"mean_token_accuracy": 0.23723478466272355,
|
|
"num_tokens": 17547276.0,
|
|
"step": 8525
|
|
},
|
|
{
|
|
"entropy": 5.563844203948975,
|
|
"epoch": 7.56901908566356,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00012418979687654888,
|
|
"loss": 4.7687,
|
|
"mean_token_accuracy": 0.24734698086977006,
|
|
"num_tokens": 17557405.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 5.644276285171509,
|
|
"epoch": 7.573457612072792,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001239343336726526,
|
|
"loss": 4.8234,
|
|
"mean_token_accuracy": 0.23931223452091216,
|
|
"num_tokens": 17567378.0,
|
|
"step": 8535
|
|
},
|
|
{
|
|
"entropy": 5.594404697418213,
|
|
"epoch": 7.577896138482024,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00012367922455635644,
|
|
"loss": 4.741,
|
|
"mean_token_accuracy": 0.25200376808643343,
|
|
"num_tokens": 17577329.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 5.627266597747803,
|
|
"epoch": 7.582334664891256,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00012342447012561863,
|
|
"loss": 4.8227,
|
|
"mean_token_accuracy": 0.24737372398376464,
|
|
"num_tokens": 17586906.0,
|
|
"step": 8545
|
|
},
|
|
{
|
|
"entropy": 5.614478683471679,
|
|
"epoch": 7.586773191300488,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00012317007097756627,
|
|
"loss": 4.8267,
|
|
"mean_token_accuracy": 0.2495371177792549,
|
|
"num_tokens": 17596480.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 5.626444149017334,
|
|
"epoch": 7.5912117177097205,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00012291602770849353,
|
|
"loss": 4.8314,
|
|
"mean_token_accuracy": 0.24053182005882262,
|
|
"num_tokens": 17606762.0,
|
|
"step": 8555
|
|
},
|
|
{
|
|
"entropy": 5.629002285003662,
|
|
"epoch": 7.595650244118953,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001226623409138604,
|
|
"loss": 4.8273,
|
|
"mean_token_accuracy": 0.24170896410942078,
|
|
"num_tokens": 17617484.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 5.575932550430298,
|
|
"epoch": 7.600088770528185,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001224090111882916,
|
|
"loss": 4.725,
|
|
"mean_token_accuracy": 0.24653060138225555,
|
|
"num_tokens": 17628287.0,
|
|
"step": 8565
|
|
},
|
|
{
|
|
"entropy": 5.46213436126709,
|
|
"epoch": 7.604527296937417,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00012215603912557447,
|
|
"loss": 4.6773,
|
|
"mean_token_accuracy": 0.260981060564518,
|
|
"num_tokens": 17638897.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 5.562841749191284,
|
|
"epoch": 7.608965823346649,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00012190342531865837,
|
|
"loss": 4.8051,
|
|
"mean_token_accuracy": 0.24890348315238953,
|
|
"num_tokens": 17648741.0,
|
|
"step": 8575
|
|
},
|
|
{
|
|
"entropy": 5.604767894744873,
|
|
"epoch": 7.613404349755881,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001216511703596528,
|
|
"loss": 4.7483,
|
|
"mean_token_accuracy": 0.24546580612659455,
|
|
"num_tokens": 17659167.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 5.6343518733978275,
|
|
"epoch": 7.617842876165113,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00012139927483982601,
|
|
"loss": 4.8199,
|
|
"mean_token_accuracy": 0.2468451276421547,
|
|
"num_tokens": 17669807.0,
|
|
"step": 8585
|
|
},
|
|
{
|
|
"entropy": 5.594668579101563,
|
|
"epoch": 7.6222814025743455,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00012114773934960408,
|
|
"loss": 4.7476,
|
|
"mean_token_accuracy": 0.24479157030582427,
|
|
"num_tokens": 17679855.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 5.581899356842041,
|
|
"epoch": 7.626719928983578,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00012089656447856892,
|
|
"loss": 4.7355,
|
|
"mean_token_accuracy": 0.24908360838890076,
|
|
"num_tokens": 17690515.0,
|
|
"step": 8595
|
|
},
|
|
{
|
|
"entropy": 5.653876638412475,
|
|
"epoch": 7.63115845539281,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0001206457508154572,
|
|
"loss": 4.8948,
|
|
"mean_token_accuracy": 0.23261968791484833,
|
|
"num_tokens": 17701706.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 5.61975736618042,
|
|
"epoch": 7.635596981802042,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00012039529894815924,
|
|
"loss": 4.8769,
|
|
"mean_token_accuracy": 0.2317401275038719,
|
|
"num_tokens": 17712406.0,
|
|
"step": 8605
|
|
},
|
|
{
|
|
"entropy": 5.574303007125854,
|
|
"epoch": 7.640035508211274,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00012014520946371675,
|
|
"loss": 4.8018,
|
|
"mean_token_accuracy": 0.23979134112596512,
|
|
"num_tokens": 17723058.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 5.663169908523559,
|
|
"epoch": 7.644474034620506,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001198954829483227,
|
|
"loss": 4.8344,
|
|
"mean_token_accuracy": 0.24350956827402115,
|
|
"num_tokens": 17734622.0,
|
|
"step": 8615
|
|
},
|
|
{
|
|
"entropy": 5.660298252105713,
|
|
"epoch": 7.648912561029738,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001196461199873189,
|
|
"loss": 4.8388,
|
|
"mean_token_accuracy": 0.23559698164463044,
|
|
"num_tokens": 17744837.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 5.671527290344239,
|
|
"epoch": 7.6533510874389705,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00011939712116519494,
|
|
"loss": 4.8672,
|
|
"mean_token_accuracy": 0.22930359244346618,
|
|
"num_tokens": 17754947.0,
|
|
"step": 8625
|
|
},
|
|
{
|
|
"entropy": 5.570849800109864,
|
|
"epoch": 7.657789613848203,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00011914848706558726,
|
|
"loss": 4.7473,
|
|
"mean_token_accuracy": 0.2497904732823372,
|
|
"num_tokens": 17764975.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 5.675461196899414,
|
|
"epoch": 7.662228140257435,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001189002182712771,
|
|
"loss": 4.9107,
|
|
"mean_token_accuracy": 0.22764871269464493,
|
|
"num_tokens": 17776059.0,
|
|
"step": 8635
|
|
},
|
|
{
|
|
"entropy": 5.567536163330078,
|
|
"epoch": 7.666666666666667,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00011865231536418948,
|
|
"loss": 4.8643,
|
|
"mean_token_accuracy": 0.24078970700502395,
|
|
"num_tokens": 17786497.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 5.613209342956543,
|
|
"epoch": 7.671105193075899,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001184047789253921,
|
|
"loss": 4.8192,
|
|
"mean_token_accuracy": 0.24157051891088485,
|
|
"num_tokens": 17797011.0,
|
|
"step": 8645
|
|
},
|
|
{
|
|
"entropy": 5.614933252334595,
|
|
"epoch": 7.675543719485131,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001181576095350932,
|
|
"loss": 4.731,
|
|
"mean_token_accuracy": 0.25015268474817276,
|
|
"num_tokens": 17808013.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 5.573355388641358,
|
|
"epoch": 7.679982245894363,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00011791080777264111,
|
|
"loss": 4.7924,
|
|
"mean_token_accuracy": 0.2484039694070816,
|
|
"num_tokens": 17819960.0,
|
|
"step": 8655
|
|
},
|
|
{
|
|
"entropy": 5.547659778594971,
|
|
"epoch": 7.6844207723035955,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00011766437421652223,
|
|
"loss": 4.8069,
|
|
"mean_token_accuracy": 0.24256494492292405,
|
|
"num_tokens": 17830607.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 5.5974204540252686,
|
|
"epoch": 7.688859298712828,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00011741830944435994,
|
|
"loss": 4.7668,
|
|
"mean_token_accuracy": 0.24646107852458954,
|
|
"num_tokens": 17839966.0,
|
|
"step": 8665
|
|
},
|
|
{
|
|
"entropy": 5.665827989578247,
|
|
"epoch": 7.69329782512206,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00011717261403291336,
|
|
"loss": 4.8638,
|
|
"mean_token_accuracy": 0.23469094038009644,
|
|
"num_tokens": 17851005.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 5.6627805709838865,
|
|
"epoch": 7.697736351531292,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001169272885580757,
|
|
"loss": 4.8591,
|
|
"mean_token_accuracy": 0.2355073317885399,
|
|
"num_tokens": 17861291.0,
|
|
"step": 8675
|
|
},
|
|
{
|
|
"entropy": 5.659609937667847,
|
|
"epoch": 7.702174877940524,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00011668233359487303,
|
|
"loss": 4.846,
|
|
"mean_token_accuracy": 0.24660485684871675,
|
|
"num_tokens": 17870973.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 5.570666170120239,
|
|
"epoch": 7.706613404349756,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00011643774971746326,
|
|
"loss": 4.7285,
|
|
"mean_token_accuracy": 0.247702693939209,
|
|
"num_tokens": 17880519.0,
|
|
"step": 8685
|
|
},
|
|
{
|
|
"entropy": 5.6231241703033445,
|
|
"epoch": 7.7110519307589875,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00011619353749913403,
|
|
"loss": 4.7906,
|
|
"mean_token_accuracy": 0.24416962265968323,
|
|
"num_tokens": 17891305.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 5.651121377944946,
|
|
"epoch": 7.715490457168221,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00011594969751230224,
|
|
"loss": 4.7934,
|
|
"mean_token_accuracy": 0.24780775159597396,
|
|
"num_tokens": 17902270.0,
|
|
"step": 8695
|
|
},
|
|
{
|
|
"entropy": 5.577750492095947,
|
|
"epoch": 7.719928983577452,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00011570623032851214,
|
|
"loss": 4.8305,
|
|
"mean_token_accuracy": 0.23696945756673812,
|
|
"num_tokens": 17913198.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 5.64020619392395,
|
|
"epoch": 7.724367509986685,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00011546313651843412,
|
|
"loss": 4.8798,
|
|
"mean_token_accuracy": 0.23703725188970565,
|
|
"num_tokens": 17923141.0,
|
|
"step": 8705
|
|
},
|
|
{
|
|
"entropy": 5.590990924835205,
|
|
"epoch": 7.728806036395916,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00011522041665186356,
|
|
"loss": 4.7527,
|
|
"mean_token_accuracy": 0.24965473115444184,
|
|
"num_tokens": 17932864.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 5.638533115386963,
|
|
"epoch": 7.733244562805149,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00011497807129771916,
|
|
"loss": 4.7716,
|
|
"mean_token_accuracy": 0.2449493318796158,
|
|
"num_tokens": 17943197.0,
|
|
"step": 8715
|
|
},
|
|
{
|
|
"entropy": 5.645896577835083,
|
|
"epoch": 7.73768308921438,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00011473610102404184,
|
|
"loss": 4.8396,
|
|
"mean_token_accuracy": 0.23490110486745835,
|
|
"num_tokens": 17952948.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 5.600251197814941,
|
|
"epoch": 7.7421216156236135,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001144945063979936,
|
|
"loss": 4.7914,
|
|
"mean_token_accuracy": 0.24723510891199113,
|
|
"num_tokens": 17963060.0,
|
|
"step": 8725
|
|
},
|
|
{
|
|
"entropy": 5.621655035018921,
|
|
"epoch": 7.746560142032845,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00011425328798585544,
|
|
"loss": 4.8242,
|
|
"mean_token_accuracy": 0.24024057984352112,
|
|
"num_tokens": 17972561.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 5.543101501464844,
|
|
"epoch": 7.750998668442077,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00011401244635302704,
|
|
"loss": 4.7972,
|
|
"mean_token_accuracy": 0.24505361765623093,
|
|
"num_tokens": 17984170.0,
|
|
"step": 8735
|
|
},
|
|
{
|
|
"entropy": 5.674505519866943,
|
|
"epoch": 7.755437194851309,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0001137719820640247,
|
|
"loss": 4.8222,
|
|
"mean_token_accuracy": 0.24060646295547486,
|
|
"num_tokens": 17994885.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 5.605698204040527,
|
|
"epoch": 7.759875721260541,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00011353189568248015,
|
|
"loss": 4.7587,
|
|
"mean_token_accuracy": 0.24596629291772842,
|
|
"num_tokens": 18005243.0,
|
|
"step": 8745
|
|
},
|
|
{
|
|
"entropy": 5.61593713760376,
|
|
"epoch": 7.764314247669773,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00011329218777113965,
|
|
"loss": 4.8469,
|
|
"mean_token_accuracy": 0.2370738297700882,
|
|
"num_tokens": 18015389.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 5.644484138488769,
|
|
"epoch": 7.768752774079005,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00011305285889186207,
|
|
"loss": 4.8185,
|
|
"mean_token_accuracy": 0.23563065230846406,
|
|
"num_tokens": 18025337.0,
|
|
"step": 8755
|
|
},
|
|
{
|
|
"entropy": 5.5437792301177975,
|
|
"epoch": 7.773191300488238,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00011281390960561791,
|
|
"loss": 4.7155,
|
|
"mean_token_accuracy": 0.25206502676010134,
|
|
"num_tokens": 18036000.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 5.576042795181275,
|
|
"epoch": 7.77762982689747,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00011257534047248816,
|
|
"loss": 4.7944,
|
|
"mean_token_accuracy": 0.24529619067907332,
|
|
"num_tokens": 18046288.0,
|
|
"step": 8765
|
|
},
|
|
{
|
|
"entropy": 5.600074195861817,
|
|
"epoch": 7.782068353306702,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00011233715205166231,
|
|
"loss": 4.8049,
|
|
"mean_token_accuracy": 0.2477586969733238,
|
|
"num_tokens": 18057451.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 5.602705430984497,
|
|
"epoch": 7.786506879715934,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001120993449014379,
|
|
"loss": 4.7589,
|
|
"mean_token_accuracy": 0.25330079942941663,
|
|
"num_tokens": 18068285.0,
|
|
"step": 8775
|
|
},
|
|
{
|
|
"entropy": 5.617920589447022,
|
|
"epoch": 7.790945406125166,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00011186191957921862,
|
|
"loss": 4.8042,
|
|
"mean_token_accuracy": 0.23800883889198304,
|
|
"num_tokens": 18078727.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 5.57922043800354,
|
|
"epoch": 7.795383932534398,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00011162487664151313,
|
|
"loss": 4.8212,
|
|
"mean_token_accuracy": 0.24299152344465255,
|
|
"num_tokens": 18089479.0,
|
|
"step": 8785
|
|
},
|
|
{
|
|
"entropy": 5.637958812713623,
|
|
"epoch": 7.7998224589436305,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000111388216643934,
|
|
"loss": 4.8403,
|
|
"mean_token_accuracy": 0.23720509111881255,
|
|
"num_tokens": 18099955.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 5.608727216720581,
|
|
"epoch": 7.804260985352863,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00011115194014119606,
|
|
"loss": 4.8157,
|
|
"mean_token_accuracy": 0.23696075528860092,
|
|
"num_tokens": 18110346.0,
|
|
"step": 8795
|
|
},
|
|
{
|
|
"entropy": 5.595779228210449,
|
|
"epoch": 7.808699511762095,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00011091604768711517,
|
|
"loss": 4.8345,
|
|
"mean_token_accuracy": 0.2373129606246948,
|
|
"num_tokens": 18120387.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 5.563124704360962,
|
|
"epoch": 7.813138038171327,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00011068053983460736,
|
|
"loss": 4.748,
|
|
"mean_token_accuracy": 0.24808206111192704,
|
|
"num_tokens": 18129816.0,
|
|
"step": 8805
|
|
},
|
|
{
|
|
"entropy": 5.603744649887085,
|
|
"epoch": 7.817576564580559,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00011044541713568665,
|
|
"loss": 4.7968,
|
|
"mean_token_accuracy": 0.24560564309358596,
|
|
"num_tokens": 18140462.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 5.642629909515381,
|
|
"epoch": 7.822015090989791,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00011021068014146483,
|
|
"loss": 4.8259,
|
|
"mean_token_accuracy": 0.2352639377117157,
|
|
"num_tokens": 18149775.0,
|
|
"step": 8815
|
|
},
|
|
{
|
|
"entropy": 5.621963882446289,
|
|
"epoch": 7.826453617399023,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00010997632940214924,
|
|
"loss": 4.847,
|
|
"mean_token_accuracy": 0.23910239189863206,
|
|
"num_tokens": 18159758.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 5.611216735839844,
|
|
"epoch": 7.8308921438082555,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000109742365467042,
|
|
"loss": 4.8549,
|
|
"mean_token_accuracy": 0.23773933947086334,
|
|
"num_tokens": 18169660.0,
|
|
"step": 8825
|
|
},
|
|
{
|
|
"entropy": 5.5926886081695555,
|
|
"epoch": 7.835330670217488,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00010950878888453872,
|
|
"loss": 4.7992,
|
|
"mean_token_accuracy": 0.24671298861503602,
|
|
"num_tokens": 18179858.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 5.631653070449829,
|
|
"epoch": 7.83976919662672,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00010927560020212682,
|
|
"loss": 4.7828,
|
|
"mean_token_accuracy": 0.23893103152513503,
|
|
"num_tokens": 18190030.0,
|
|
"step": 8835
|
|
},
|
|
{
|
|
"entropy": 5.592760419845581,
|
|
"epoch": 7.844207723035952,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0001090427999663846,
|
|
"loss": 4.8697,
|
|
"mean_token_accuracy": 0.23913137167692183,
|
|
"num_tokens": 18201468.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 5.612957429885864,
|
|
"epoch": 7.848646249445184,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00010881038872298014,
|
|
"loss": 4.7181,
|
|
"mean_token_accuracy": 0.25081874430179596,
|
|
"num_tokens": 18211584.0,
|
|
"step": 8845
|
|
},
|
|
{
|
|
"entropy": 5.610744476318359,
|
|
"epoch": 7.853084775854416,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00010857836701666923,
|
|
"loss": 4.8197,
|
|
"mean_token_accuracy": 0.24464940577745437,
|
|
"num_tokens": 18222097.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 5.590881824493408,
|
|
"epoch": 7.857523302263648,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00010834673539129506,
|
|
"loss": 4.7819,
|
|
"mean_token_accuracy": 0.24441686570644378,
|
|
"num_tokens": 18232621.0,
|
|
"step": 8855
|
|
},
|
|
{
|
|
"entropy": 5.6175110816955565,
|
|
"epoch": 7.8619618286728805,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00010811549438978633,
|
|
"loss": 4.7609,
|
|
"mean_token_accuracy": 0.24669099152088164,
|
|
"num_tokens": 18242175.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 5.611443328857422,
|
|
"epoch": 7.866400355082113,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00010788464455415602,
|
|
"loss": 4.803,
|
|
"mean_token_accuracy": 0.24646749645471572,
|
|
"num_tokens": 18253411.0,
|
|
"step": 8865
|
|
},
|
|
{
|
|
"entropy": 5.619358348846435,
|
|
"epoch": 7.870838881491345,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00010765418642550053,
|
|
"loss": 4.7991,
|
|
"mean_token_accuracy": 0.24373794794082643,
|
|
"num_tokens": 18263490.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 5.61102066040039,
|
|
"epoch": 7.875277407900577,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010742412054399791,
|
|
"loss": 4.8023,
|
|
"mean_token_accuracy": 0.24309327751398085,
|
|
"num_tokens": 18274137.0,
|
|
"step": 8875
|
|
},
|
|
{
|
|
"entropy": 5.563189077377319,
|
|
"epoch": 7.879715934309809,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00010719444744890683,
|
|
"loss": 4.7857,
|
|
"mean_token_accuracy": 0.2447147473692894,
|
|
"num_tokens": 18284819.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 5.63184552192688,
|
|
"epoch": 7.884154460719041,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00010696516767856545,
|
|
"loss": 4.7935,
|
|
"mean_token_accuracy": 0.24254106134176254,
|
|
"num_tokens": 18294478.0,
|
|
"step": 8885
|
|
},
|
|
{
|
|
"entropy": 5.563577461242676,
|
|
"epoch": 7.888592987128273,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00010673628177038966,
|
|
"loss": 4.7236,
|
|
"mean_token_accuracy": 0.2522422730922699,
|
|
"num_tokens": 18304105.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 5.583220434188843,
|
|
"epoch": 7.8930315135375055,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00010650779026087263,
|
|
"loss": 4.8534,
|
|
"mean_token_accuracy": 0.2386540099978447,
|
|
"num_tokens": 18315257.0,
|
|
"step": 8895
|
|
},
|
|
{
|
|
"entropy": 5.63894829750061,
|
|
"epoch": 7.897470039946738,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0001062796936855827,
|
|
"loss": 4.8064,
|
|
"mean_token_accuracy": 0.23517239540815355,
|
|
"num_tokens": 18325071.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 5.697704172134399,
|
|
"epoch": 7.90190856635597,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00010605199257916269,
|
|
"loss": 4.8656,
|
|
"mean_token_accuracy": 0.23249168694019318,
|
|
"num_tokens": 18335494.0,
|
|
"step": 8905
|
|
},
|
|
{
|
|
"entropy": 5.602939462661743,
|
|
"epoch": 7.906347092765202,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00010582468747532848,
|
|
"loss": 4.824,
|
|
"mean_token_accuracy": 0.23976868093013765,
|
|
"num_tokens": 18345444.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 5.617969083786011,
|
|
"epoch": 7.910785619174434,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00010559777890686766,
|
|
"loss": 4.7988,
|
|
"mean_token_accuracy": 0.24544016569852828,
|
|
"num_tokens": 18355718.0,
|
|
"step": 8915
|
|
},
|
|
{
|
|
"entropy": 5.606509733200073,
|
|
"epoch": 7.915224145583666,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00010537126740563838,
|
|
"loss": 4.8278,
|
|
"mean_token_accuracy": 0.24126604944467545,
|
|
"num_tokens": 18365715.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 5.584646940231323,
|
|
"epoch": 7.919662671992898,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00010514515350256825,
|
|
"loss": 4.7304,
|
|
"mean_token_accuracy": 0.24988619983196259,
|
|
"num_tokens": 18377132.0,
|
|
"step": 8925
|
|
},
|
|
{
|
|
"entropy": 5.586235666275025,
|
|
"epoch": 7.924101198402131,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00010491943772765264,
|
|
"loss": 4.7714,
|
|
"mean_token_accuracy": 0.24127329885959625,
|
|
"num_tokens": 18387052.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 5.610493421554565,
|
|
"epoch": 7.928539724811363,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00010469412060995404,
|
|
"loss": 4.7541,
|
|
"mean_token_accuracy": 0.24917635172605515,
|
|
"num_tokens": 18395902.0,
|
|
"step": 8935
|
|
},
|
|
{
|
|
"entropy": 5.624601125717163,
|
|
"epoch": 7.932978251220595,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00010446920267760028,
|
|
"loss": 4.809,
|
|
"mean_token_accuracy": 0.2380239710211754,
|
|
"num_tokens": 18405594.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 5.561234474182129,
|
|
"epoch": 7.937416777629827,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00010424468445778365,
|
|
"loss": 4.6987,
|
|
"mean_token_accuracy": 0.2525144338607788,
|
|
"num_tokens": 18414498.0,
|
|
"step": 8945
|
|
},
|
|
{
|
|
"entropy": 5.628938293457031,
|
|
"epoch": 7.941855304039059,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00010402056647675958,
|
|
"loss": 4.8449,
|
|
"mean_token_accuracy": 0.23591086268424988,
|
|
"num_tokens": 18424584.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 5.570144128799439,
|
|
"epoch": 7.946293830448291,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00010379684925984525,
|
|
"loss": 4.7792,
|
|
"mean_token_accuracy": 0.24480725079774857,
|
|
"num_tokens": 18434000.0,
|
|
"step": 8955
|
|
},
|
|
{
|
|
"entropy": 5.638365364074707,
|
|
"epoch": 7.950732356857523,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001035735333314185,
|
|
"loss": 4.8293,
|
|
"mean_token_accuracy": 0.23598061949014665,
|
|
"num_tokens": 18444672.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 5.598419904708862,
|
|
"epoch": 7.955170883266756,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00010335061921491679,
|
|
"loss": 4.7728,
|
|
"mean_token_accuracy": 0.24881643652915955,
|
|
"num_tokens": 18454658.0,
|
|
"step": 8965
|
|
},
|
|
{
|
|
"entropy": 5.570593070983887,
|
|
"epoch": 7.959609409675988,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001031281074328353,
|
|
"loss": 4.7455,
|
|
"mean_token_accuracy": 0.25492839217185975,
|
|
"num_tokens": 18464243.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 5.568582344055176,
|
|
"epoch": 7.96404793608522,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001029059985067266,
|
|
"loss": 4.7995,
|
|
"mean_token_accuracy": 0.24403091967105867,
|
|
"num_tokens": 18475114.0,
|
|
"step": 8975
|
|
},
|
|
{
|
|
"entropy": 5.660172033309936,
|
|
"epoch": 7.968486462494452,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00010268429295719886,
|
|
"loss": 4.8763,
|
|
"mean_token_accuracy": 0.23354254961013793,
|
|
"num_tokens": 18485651.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 5.549182367324829,
|
|
"epoch": 7.972924988903684,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00010246299130391462,
|
|
"loss": 4.7234,
|
|
"mean_token_accuracy": 0.24379675835371017,
|
|
"num_tokens": 18496686.0,
|
|
"step": 8985
|
|
},
|
|
{
|
|
"entropy": 5.604406118392944,
|
|
"epoch": 7.977363515312916,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00010224209406558997,
|
|
"loss": 4.7892,
|
|
"mean_token_accuracy": 0.25044484734535216,
|
|
"num_tokens": 18507239.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 5.5869965076446535,
|
|
"epoch": 7.9818020417221485,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00010202160175999293,
|
|
"loss": 4.7259,
|
|
"mean_token_accuracy": 0.25664988309144976,
|
|
"num_tokens": 18517362.0,
|
|
"step": 8995
|
|
},
|
|
{
|
|
"entropy": 5.549998044967651,
|
|
"epoch": 7.986240568131381,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00010180151490394221,
|
|
"loss": 4.704,
|
|
"mean_token_accuracy": 0.25883693248033524,
|
|
"num_tokens": 18527296.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 7.986240568131381,
|
|
"eval_entropy": 5.415405883924978,
|
|
"eval_loss": 5.768394470214844,
|
|
"eval_mean_token_accuracy": 0.1820103095539109,
|
|
"eval_num_tokens": 18527296.0,
|
|
"eval_runtime": 2.0798,
|
|
"eval_samples_per_second": 1618.939,
|
|
"eval_steps_per_second": 202.427,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 5.556950283050537,
|
|
"epoch": 7.990679094540613,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00010158183401330669,
|
|
"loss": 4.7733,
|
|
"mean_token_accuracy": 0.24481090605258943,
|
|
"num_tokens": 18537806.0,
|
|
"step": 9005
|
|
},
|
|
{
|
|
"entropy": 5.561641073226928,
|
|
"epoch": 7.995117620949845,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00010136255960300304,
|
|
"loss": 4.7773,
|
|
"mean_token_accuracy": 0.24679241478443145,
|
|
"num_tokens": 18547886.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 5.5817492485046385,
|
|
"epoch": 7.999556147359077,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00010114369218699571,
|
|
"loss": 4.7882,
|
|
"mean_token_accuracy": 0.24391598701477052,
|
|
"num_tokens": 18557187.0,
|
|
"step": 9015
|
|
},
|
|
{
|
|
"entropy": 5.600562148623997,
|
|
"epoch": 8.003550821127385,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00010092523227829492,
|
|
"loss": 4.7597,
|
|
"mean_token_accuracy": 0.24998611211776733,
|
|
"num_tokens": 18565267.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 5.584753227233887,
|
|
"epoch": 8.007989347536618,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00010070718038895565,
|
|
"loss": 4.6895,
|
|
"mean_token_accuracy": 0.25067931562662127,
|
|
"num_tokens": 18574882.0,
|
|
"step": 9025
|
|
},
|
|
{
|
|
"entropy": 5.594324350357056,
|
|
"epoch": 8.01242787394585,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0001004895370300768,
|
|
"loss": 4.8041,
|
|
"mean_token_accuracy": 0.23570327162742616,
|
|
"num_tokens": 18586037.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 5.622472143173217,
|
|
"epoch": 8.016866400355083,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00010027230271179947,
|
|
"loss": 4.6508,
|
|
"mean_token_accuracy": 0.2616667628288269,
|
|
"num_tokens": 18596499.0,
|
|
"step": 9035
|
|
},
|
|
{
|
|
"entropy": 5.601358461380005,
|
|
"epoch": 8.021304926764314,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00010005547794330596,
|
|
"loss": 4.7357,
|
|
"mean_token_accuracy": 0.24696330428123475,
|
|
"num_tokens": 18605956.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 5.6297825336456295,
|
|
"epoch": 8.025743453173547,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 9.983906323281896e-05,
|
|
"loss": 4.7418,
|
|
"mean_token_accuracy": 0.2501678392291069,
|
|
"num_tokens": 18616823.0,
|
|
"step": 9045
|
|
},
|
|
{
|
|
"entropy": 5.63553466796875,
|
|
"epoch": 8.030181979582778,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 9.962305908759947e-05,
|
|
"loss": 4.7675,
|
|
"mean_token_accuracy": 0.24254207462072372,
|
|
"num_tokens": 18627002.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 5.585255861282349,
|
|
"epoch": 8.034620505992011,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 9.940746601394665e-05,
|
|
"loss": 4.7828,
|
|
"mean_token_accuracy": 0.24124627709388732,
|
|
"num_tokens": 18636889.0,
|
|
"step": 9055
|
|
},
|
|
{
|
|
"entropy": 5.6164830207824705,
|
|
"epoch": 8.039059032401243,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 9.919228451719586e-05,
|
|
"loss": 4.7782,
|
|
"mean_token_accuracy": 0.24562991559505462,
|
|
"num_tokens": 18646283.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 5.524437093734742,
|
|
"epoch": 8.043497558810476,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 9.897751510171777e-05,
|
|
"loss": 4.6816,
|
|
"mean_token_accuracy": 0.2574348658323288,
|
|
"num_tokens": 18655789.0,
|
|
"step": 9065
|
|
},
|
|
{
|
|
"entropy": 5.648582792282104,
|
|
"epoch": 8.047936085219707,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 9.876315827091733e-05,
|
|
"loss": 4.8007,
|
|
"mean_token_accuracy": 0.24285533875226975,
|
|
"num_tokens": 18666319.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 5.614380025863648,
|
|
"epoch": 8.05237461162894,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 9.854921452723229e-05,
|
|
"loss": 4.7687,
|
|
"mean_token_accuracy": 0.2453346148133278,
|
|
"num_tokens": 18676441.0,
|
|
"step": 9075
|
|
},
|
|
{
|
|
"entropy": 5.560852098464966,
|
|
"epoch": 8.056813138038171,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 9.833568437213206e-05,
|
|
"loss": 4.748,
|
|
"mean_token_accuracy": 0.24729786962270736,
|
|
"num_tokens": 18687991.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 5.602876281738281,
|
|
"epoch": 8.061251664447404,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 9.812256830611691e-05,
|
|
"loss": 4.7243,
|
|
"mean_token_accuracy": 0.24441397935152054,
|
|
"num_tokens": 18697398.0,
|
|
"step": 9085
|
|
},
|
|
{
|
|
"entropy": 5.6233558177948,
|
|
"epoch": 8.065690190856635,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 9.790986682871612e-05,
|
|
"loss": 4.8034,
|
|
"mean_token_accuracy": 0.24360340237617492,
|
|
"num_tokens": 18708118.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 5.569839763641357,
|
|
"epoch": 8.070128717265868,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 9.76975804384876e-05,
|
|
"loss": 4.6816,
|
|
"mean_token_accuracy": 0.2597063645720482,
|
|
"num_tokens": 18717538.0,
|
|
"step": 9095
|
|
},
|
|
{
|
|
"entropy": 5.578516626358033,
|
|
"epoch": 8.0745672436751,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 9.748570963301607e-05,
|
|
"loss": 4.6976,
|
|
"mean_token_accuracy": 0.25198488831520083,
|
|
"num_tokens": 18727893.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 5.593212604522705,
|
|
"epoch": 8.079005770084333,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 9.727425490891217e-05,
|
|
"loss": 4.7394,
|
|
"mean_token_accuracy": 0.24295031130313874,
|
|
"num_tokens": 18737986.0,
|
|
"step": 9105
|
|
},
|
|
{
|
|
"entropy": 5.580005216598511,
|
|
"epoch": 8.083444296493564,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.706321676181142e-05,
|
|
"loss": 4.749,
|
|
"mean_token_accuracy": 0.24532703757286073,
|
|
"num_tokens": 18748485.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 5.543484544754028,
|
|
"epoch": 8.087882822902797,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 9.685259568637279e-05,
|
|
"loss": 4.6729,
|
|
"mean_token_accuracy": 0.25581154972314835,
|
|
"num_tokens": 18758529.0,
|
|
"step": 9115
|
|
},
|
|
{
|
|
"entropy": 5.5874107837677,
|
|
"epoch": 8.092321349312028,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 9.664239217627765e-05,
|
|
"loss": 4.7735,
|
|
"mean_token_accuracy": 0.24382049441337586,
|
|
"num_tokens": 18768461.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 5.59615421295166,
|
|
"epoch": 8.096759875721261,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.643260672422879e-05,
|
|
"loss": 4.7068,
|
|
"mean_token_accuracy": 0.2559760048985481,
|
|
"num_tokens": 18779596.0,
|
|
"step": 9125
|
|
},
|
|
{
|
|
"entropy": 5.600860214233398,
|
|
"epoch": 8.101198402130493,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 9.622323982194876e-05,
|
|
"loss": 4.7708,
|
|
"mean_token_accuracy": 0.2454341694712639,
|
|
"num_tokens": 18789286.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 5.6215215682983395,
|
|
"epoch": 8.105636928539726,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 9.601429196017945e-05,
|
|
"loss": 4.7375,
|
|
"mean_token_accuracy": 0.24460976719856262,
|
|
"num_tokens": 18800223.0,
|
|
"step": 9135
|
|
},
|
|
{
|
|
"entropy": 5.579845952987671,
|
|
"epoch": 8.110075454948957,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 9.580576362868034e-05,
|
|
"loss": 4.7271,
|
|
"mean_token_accuracy": 0.247392874956131,
|
|
"num_tokens": 18810543.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 5.657810926437378,
|
|
"epoch": 8.11451398135819,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 9.55976553162275e-05,
|
|
"loss": 4.8694,
|
|
"mean_token_accuracy": 0.23422227054834366,
|
|
"num_tokens": 18821509.0,
|
|
"step": 9145
|
|
},
|
|
{
|
|
"entropy": 5.654885578155517,
|
|
"epoch": 8.118952507767421,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 9.53899675106127e-05,
|
|
"loss": 4.7515,
|
|
"mean_token_accuracy": 0.24759697467088698,
|
|
"num_tokens": 18831347.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 5.58132905960083,
|
|
"epoch": 8.123391034176654,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 9.518270069864194e-05,
|
|
"loss": 4.6944,
|
|
"mean_token_accuracy": 0.2579855680465698,
|
|
"num_tokens": 18841863.0,
|
|
"step": 9155
|
|
},
|
|
{
|
|
"entropy": 5.56219253540039,
|
|
"epoch": 8.127829560585885,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 9.49758553661344e-05,
|
|
"loss": 4.7146,
|
|
"mean_token_accuracy": 0.2549776121973991,
|
|
"num_tokens": 18850644.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 5.566682624816894,
|
|
"epoch": 8.132268086995118,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 9.476943199792159e-05,
|
|
"loss": 4.6978,
|
|
"mean_token_accuracy": 0.2559429556131363,
|
|
"num_tokens": 18861007.0,
|
|
"step": 9165
|
|
},
|
|
{
|
|
"entropy": 5.54859766960144,
|
|
"epoch": 8.13670661340435,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 9.456343107784552e-05,
|
|
"loss": 4.6926,
|
|
"mean_token_accuracy": 0.2567680761218071,
|
|
"num_tokens": 18871120.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 5.549384021759034,
|
|
"epoch": 8.141145139813581,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 9.435785308875847e-05,
|
|
"loss": 4.6801,
|
|
"mean_token_accuracy": 0.25949779748916624,
|
|
"num_tokens": 18880350.0,
|
|
"step": 9175
|
|
},
|
|
{
|
|
"entropy": 5.65172700881958,
|
|
"epoch": 8.145583666222814,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 9.415269851252112e-05,
|
|
"loss": 4.8564,
|
|
"mean_token_accuracy": 0.24883945733308793,
|
|
"num_tokens": 18890533.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 5.603241682052612,
|
|
"epoch": 8.150022192632045,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 9.394796783000173e-05,
|
|
"loss": 4.6974,
|
|
"mean_token_accuracy": 0.25252249240875246,
|
|
"num_tokens": 18900894.0,
|
|
"step": 9185
|
|
},
|
|
{
|
|
"entropy": 5.6615437984466555,
|
|
"epoch": 8.154460719041278,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 9.374366152107516e-05,
|
|
"loss": 4.8143,
|
|
"mean_token_accuracy": 0.2441593036055565,
|
|
"num_tokens": 18911579.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 5.591167163848877,
|
|
"epoch": 8.15889924545051,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 9.353978006462135e-05,
|
|
"loss": 4.7301,
|
|
"mean_token_accuracy": 0.25238525718450544,
|
|
"num_tokens": 18921692.0,
|
|
"step": 9195
|
|
},
|
|
{
|
|
"entropy": 5.639298629760742,
|
|
"epoch": 8.163337771859743,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 9.333632393852449e-05,
|
|
"loss": 4.7691,
|
|
"mean_token_accuracy": 0.24444992393255233,
|
|
"num_tokens": 18931463.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 5.67277979850769,
|
|
"epoch": 8.167776298268974,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 9.313329361967198e-05,
|
|
"loss": 4.8595,
|
|
"mean_token_accuracy": 0.2395936891436577,
|
|
"num_tokens": 18941286.0,
|
|
"step": 9205
|
|
},
|
|
{
|
|
"entropy": 5.60672345161438,
|
|
"epoch": 8.172214824678207,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.293068958395281e-05,
|
|
"loss": 4.7449,
|
|
"mean_token_accuracy": 0.2505317091941833,
|
|
"num_tokens": 18952009.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 5.611156272888183,
|
|
"epoch": 8.176653351087438,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 9.272851230625715e-05,
|
|
"loss": 4.7034,
|
|
"mean_token_accuracy": 0.25811170786619186,
|
|
"num_tokens": 18961567.0,
|
|
"step": 9215
|
|
},
|
|
{
|
|
"entropy": 5.5414012432098385,
|
|
"epoch": 8.181091877496671,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.252676226047464e-05,
|
|
"loss": 4.7485,
|
|
"mean_token_accuracy": 0.25348705649375913,
|
|
"num_tokens": 18971949.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 5.575426483154297,
|
|
"epoch": 8.185530403905902,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 9.23254399194936e-05,
|
|
"loss": 4.7197,
|
|
"mean_token_accuracy": 0.2536012798547745,
|
|
"num_tokens": 18982589.0,
|
|
"step": 9225
|
|
},
|
|
{
|
|
"entropy": 5.575132942199707,
|
|
"epoch": 8.189968930315136,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.212454575519992e-05,
|
|
"loss": 4.7907,
|
|
"mean_token_accuracy": 0.2509087845683098,
|
|
"num_tokens": 18992569.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 5.576204919815064,
|
|
"epoch": 8.194407456724367,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 9.192408023847573e-05,
|
|
"loss": 4.7505,
|
|
"mean_token_accuracy": 0.24879114031791688,
|
|
"num_tokens": 19002875.0,
|
|
"step": 9235
|
|
},
|
|
{
|
|
"entropy": 5.596258020401001,
|
|
"epoch": 8.1988459831336,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 9.17240438391985e-05,
|
|
"loss": 4.7328,
|
|
"mean_token_accuracy": 0.24858084321022034,
|
|
"num_tokens": 19013014.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 5.620888042449951,
|
|
"epoch": 8.203284509542831,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 9.152443702623993e-05,
|
|
"loss": 4.784,
|
|
"mean_token_accuracy": 0.25361003279685973,
|
|
"num_tokens": 19023628.0,
|
|
"step": 9245
|
|
},
|
|
{
|
|
"entropy": 5.6154765605926515,
|
|
"epoch": 8.207723035952064,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.132526026746476e-05,
|
|
"loss": 4.766,
|
|
"mean_token_accuracy": 0.23748403936624526,
|
|
"num_tokens": 19034442.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 5.607378625869751,
|
|
"epoch": 8.212161562361295,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 9.112651402972962e-05,
|
|
"loss": 4.7817,
|
|
"mean_token_accuracy": 0.24408718198537827,
|
|
"num_tokens": 19045376.0,
|
|
"step": 9255
|
|
},
|
|
{
|
|
"entropy": 5.596570730209351,
|
|
"epoch": 8.216600088770528,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.09281987788822e-05,
|
|
"loss": 4.6789,
|
|
"mean_token_accuracy": 0.25938530564308165,
|
|
"num_tokens": 19054748.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 5.596550941467285,
|
|
"epoch": 8.22103861517976,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 9.073031497975981e-05,
|
|
"loss": 4.744,
|
|
"mean_token_accuracy": 0.24752996861934662,
|
|
"num_tokens": 19064650.0,
|
|
"step": 9265
|
|
},
|
|
{
|
|
"entropy": 5.622500419616699,
|
|
"epoch": 8.225477141588993,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 9.053286309618861e-05,
|
|
"loss": 4.7859,
|
|
"mean_token_accuracy": 0.24634932577610016,
|
|
"num_tokens": 19074644.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 5.653139543533325,
|
|
"epoch": 8.229915667998224,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 9.033584359098234e-05,
|
|
"loss": 4.7325,
|
|
"mean_token_accuracy": 0.2504239797592163,
|
|
"num_tokens": 19083827.0,
|
|
"step": 9275
|
|
},
|
|
{
|
|
"entropy": 5.597638130187988,
|
|
"epoch": 8.234354194407457,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 9.013925692594121e-05,
|
|
"loss": 4.7969,
|
|
"mean_token_accuracy": 0.2470914050936699,
|
|
"num_tokens": 19094159.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 5.512376308441162,
|
|
"epoch": 8.238792720816688,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 8.994310356185098e-05,
|
|
"loss": 4.6769,
|
|
"mean_token_accuracy": 0.25950956493616106,
|
|
"num_tokens": 19103435.0,
|
|
"step": 9285
|
|
},
|
|
{
|
|
"entropy": 5.571479272842407,
|
|
"epoch": 8.243231247225921,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 8.974738395848171e-05,
|
|
"loss": 4.7376,
|
|
"mean_token_accuracy": 0.2513103991746902,
|
|
"num_tokens": 19114029.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 5.54641637802124,
|
|
"epoch": 8.247669773635153,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 8.955209857458679e-05,
|
|
"loss": 4.7609,
|
|
"mean_token_accuracy": 0.24761680364608765,
|
|
"num_tokens": 19124290.0,
|
|
"step": 9295
|
|
},
|
|
{
|
|
"entropy": 5.582125806808472,
|
|
"epoch": 8.252108300044386,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 8.935724786790181e-05,
|
|
"loss": 4.704,
|
|
"mean_token_accuracy": 0.2555938556790352,
|
|
"num_tokens": 19135214.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 5.557685613632202,
|
|
"epoch": 8.256546826453617,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 8.916283229514342e-05,
|
|
"loss": 4.6554,
|
|
"mean_token_accuracy": 0.2581814661622047,
|
|
"num_tokens": 19145799.0,
|
|
"step": 9305
|
|
},
|
|
{
|
|
"entropy": 5.608782577514648,
|
|
"epoch": 8.26098535286285,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 8.89688523120086e-05,
|
|
"loss": 4.7948,
|
|
"mean_token_accuracy": 0.24048526138067244,
|
|
"num_tokens": 19156580.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 5.58035101890564,
|
|
"epoch": 8.265423879272081,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 8.87753083731731e-05,
|
|
"loss": 4.7427,
|
|
"mean_token_accuracy": 0.2501308485865593,
|
|
"num_tokens": 19167041.0,
|
|
"step": 9315
|
|
},
|
|
{
|
|
"entropy": 5.576243591308594,
|
|
"epoch": 8.269862405681314,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 8.858220093229062e-05,
|
|
"loss": 4.667,
|
|
"mean_token_accuracy": 0.25742698162794114,
|
|
"num_tokens": 19176971.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 5.569400978088379,
|
|
"epoch": 8.274300932090545,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.838953044199196e-05,
|
|
"loss": 4.7622,
|
|
"mean_token_accuracy": 0.24014434665441514,
|
|
"num_tokens": 19187854.0,
|
|
"step": 9325
|
|
},
|
|
{
|
|
"entropy": 5.573638105392456,
|
|
"epoch": 8.278739458499778,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 8.819729735388348e-05,
|
|
"loss": 4.7176,
|
|
"mean_token_accuracy": 0.25572559237480164,
|
|
"num_tokens": 19198087.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 5.610104417800903,
|
|
"epoch": 8.28317798490901,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 8.800550211854643e-05,
|
|
"loss": 4.8015,
|
|
"mean_token_accuracy": 0.2500563129782677,
|
|
"num_tokens": 19207904.0,
|
|
"step": 9335
|
|
},
|
|
{
|
|
"entropy": 5.615197563171387,
|
|
"epoch": 8.287616511318243,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 8.781414518553572e-05,
|
|
"loss": 4.757,
|
|
"mean_token_accuracy": 0.25031324177980424,
|
|
"num_tokens": 19217786.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 5.5897355556488035,
|
|
"epoch": 8.292055037727474,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 8.762322700337891e-05,
|
|
"loss": 4.7602,
|
|
"mean_token_accuracy": 0.2527596965432167,
|
|
"num_tokens": 19226840.0,
|
|
"step": 9345
|
|
},
|
|
{
|
|
"entropy": 5.600899124145508,
|
|
"epoch": 8.296493564136707,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.743274801957523e-05,
|
|
"loss": 4.8207,
|
|
"mean_token_accuracy": 0.24670181721448897,
|
|
"num_tokens": 19237921.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 5.564527606964111,
|
|
"epoch": 8.300932090545938,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 8.724270868059442e-05,
|
|
"loss": 4.7436,
|
|
"mean_token_accuracy": 0.2478237494826317,
|
|
"num_tokens": 19247843.0,
|
|
"step": 9355
|
|
},
|
|
{
|
|
"entropy": 5.576130390167236,
|
|
"epoch": 8.305370616955171,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 8.705310943187556e-05,
|
|
"loss": 4.7259,
|
|
"mean_token_accuracy": 0.24943871200084686,
|
|
"num_tokens": 19258128.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 5.58797607421875,
|
|
"epoch": 8.309809143364403,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 8.686395071782651e-05,
|
|
"loss": 4.7595,
|
|
"mean_token_accuracy": 0.249937903881073,
|
|
"num_tokens": 19268040.0,
|
|
"step": 9365
|
|
},
|
|
{
|
|
"entropy": 5.619840526580811,
|
|
"epoch": 8.314247669773636,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 8.667523298182229e-05,
|
|
"loss": 4.7941,
|
|
"mean_token_accuracy": 0.24233166873455048,
|
|
"num_tokens": 19278710.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 5.634401941299439,
|
|
"epoch": 8.318686196182867,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.64869566662044e-05,
|
|
"loss": 4.7151,
|
|
"mean_token_accuracy": 0.2577543377876282,
|
|
"num_tokens": 19289247.0,
|
|
"step": 9375
|
|
},
|
|
{
|
|
"entropy": 5.607892322540283,
|
|
"epoch": 8.3231247225921,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 8.629912221227962e-05,
|
|
"loss": 4.7813,
|
|
"mean_token_accuracy": 0.24694018214941024,
|
|
"num_tokens": 19299939.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 5.602738380432129,
|
|
"epoch": 8.327563249001331,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.611173006031906e-05,
|
|
"loss": 4.7491,
|
|
"mean_token_accuracy": 0.24435822665691376,
|
|
"num_tokens": 19311199.0,
|
|
"step": 9385
|
|
},
|
|
{
|
|
"entropy": 5.5667643547058105,
|
|
"epoch": 8.332001775410564,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.592478064955723e-05,
|
|
"loss": 4.7593,
|
|
"mean_token_accuracy": 0.25332185477018354,
|
|
"num_tokens": 19321553.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 5.587645959854126,
|
|
"epoch": 8.336440301819795,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 8.573827441819068e-05,
|
|
"loss": 4.6876,
|
|
"mean_token_accuracy": 0.2526177316904068,
|
|
"num_tokens": 19331594.0,
|
|
"step": 9395
|
|
},
|
|
{
|
|
"entropy": 5.610805797576904,
|
|
"epoch": 8.340878828229028,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 8.555221180337728e-05,
|
|
"loss": 4.7803,
|
|
"mean_token_accuracy": 0.24626043438911438,
|
|
"num_tokens": 19341948.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 5.581516456604004,
|
|
"epoch": 8.34531735463826,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 8.536659324123513e-05,
|
|
"loss": 4.7327,
|
|
"mean_token_accuracy": 0.24894094914197923,
|
|
"num_tokens": 19351839.0,
|
|
"step": 9405
|
|
},
|
|
{
|
|
"entropy": 5.557519626617432,
|
|
"epoch": 8.349755881047493,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 8.518141916684145e-05,
|
|
"loss": 4.6994,
|
|
"mean_token_accuracy": 0.2583307921886444,
|
|
"num_tokens": 19361977.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 5.5718913078308105,
|
|
"epoch": 8.354194407456724,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 8.499669001423161e-05,
|
|
"loss": 4.727,
|
|
"mean_token_accuracy": 0.24450808614492417,
|
|
"num_tokens": 19372086.0,
|
|
"step": 9415
|
|
},
|
|
{
|
|
"entropy": 5.561998796463013,
|
|
"epoch": 8.358632933865957,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 8.481240621639811e-05,
|
|
"loss": 4.7161,
|
|
"mean_token_accuracy": 0.25400485992431643,
|
|
"num_tokens": 19381444.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 5.583795976638794,
|
|
"epoch": 8.363071460275188,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 8.46285682052895e-05,
|
|
"loss": 4.7227,
|
|
"mean_token_accuracy": 0.25941183269023893,
|
|
"num_tokens": 19391495.0,
|
|
"step": 9425
|
|
},
|
|
{
|
|
"entropy": 5.575471210479736,
|
|
"epoch": 8.367509986684421,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 8.444517641180972e-05,
|
|
"loss": 4.7968,
|
|
"mean_token_accuracy": 0.24449914693832397,
|
|
"num_tokens": 19402542.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 5.564076519012451,
|
|
"epoch": 8.371948513093653,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 8.426223126581642e-05,
|
|
"loss": 4.7771,
|
|
"mean_token_accuracy": 0.2448112592101097,
|
|
"num_tokens": 19412848.0,
|
|
"step": 9435
|
|
},
|
|
{
|
|
"entropy": 5.619865036010742,
|
|
"epoch": 8.376387039502886,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 8.407973319612055e-05,
|
|
"loss": 4.7706,
|
|
"mean_token_accuracy": 0.2449239730834961,
|
|
"num_tokens": 19423195.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 5.581668949127197,
|
|
"epoch": 8.380825565912117,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 8.389768263048522e-05,
|
|
"loss": 4.6803,
|
|
"mean_token_accuracy": 0.26081545650959015,
|
|
"num_tokens": 19432448.0,
|
|
"step": 9445
|
|
},
|
|
{
|
|
"entropy": 5.566140031814575,
|
|
"epoch": 8.38526409232135,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 8.371607999562445e-05,
|
|
"loss": 4.6987,
|
|
"mean_token_accuracy": 0.250637549161911,
|
|
"num_tokens": 19442546.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 5.620829105377197,
|
|
"epoch": 8.389702618730581,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 8.353492571720239e-05,
|
|
"loss": 4.8435,
|
|
"mean_token_accuracy": 0.2411188617348671,
|
|
"num_tokens": 19453777.0,
|
|
"step": 9455
|
|
},
|
|
{
|
|
"entropy": 5.589980840682983,
|
|
"epoch": 8.394141145139814,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.33542202198323e-05,
|
|
"loss": 4.7599,
|
|
"mean_token_accuracy": 0.24477939009666444,
|
|
"num_tokens": 19464864.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 5.610381460189819,
|
|
"epoch": 8.398579671549046,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 8.317396392707549e-05,
|
|
"loss": 4.8076,
|
|
"mean_token_accuracy": 0.2450042486190796,
|
|
"num_tokens": 19475201.0,
|
|
"step": 9465
|
|
},
|
|
{
|
|
"entropy": 5.643883943557739,
|
|
"epoch": 8.403018197958279,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 8.299415726144047e-05,
|
|
"loss": 4.7075,
|
|
"mean_token_accuracy": 0.2506277024745941,
|
|
"num_tokens": 19485245.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 5.629512786865234,
|
|
"epoch": 8.40745672436751,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 8.281480064438176e-05,
|
|
"loss": 4.7434,
|
|
"mean_token_accuracy": 0.24580850601196289,
|
|
"num_tokens": 19495452.0,
|
|
"step": 9475
|
|
},
|
|
{
|
|
"entropy": 5.590829801559448,
|
|
"epoch": 8.411895250776743,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.263589449629894e-05,
|
|
"loss": 4.719,
|
|
"mean_token_accuracy": 0.25590338706970217,
|
|
"num_tokens": 19506503.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 5.5709387302398685,
|
|
"epoch": 8.416333777185974,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 8.24574392365359e-05,
|
|
"loss": 4.7388,
|
|
"mean_token_accuracy": 0.25319988578557967,
|
|
"num_tokens": 19517303.0,
|
|
"step": 9485
|
|
},
|
|
{
|
|
"entropy": 5.544078826904297,
|
|
"epoch": 8.420772303595207,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.227943528337953e-05,
|
|
"loss": 4.6431,
|
|
"mean_token_accuracy": 0.26116381734609606,
|
|
"num_tokens": 19526937.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 5.563114881515503,
|
|
"epoch": 8.425210830004438,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 8.210188305405893e-05,
|
|
"loss": 4.7096,
|
|
"mean_token_accuracy": 0.255737429857254,
|
|
"num_tokens": 19537389.0,
|
|
"step": 9495
|
|
},
|
|
{
|
|
"entropy": 5.611912488937378,
|
|
"epoch": 8.429649356413671,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 8.192478296474437e-05,
|
|
"loss": 4.7781,
|
|
"mean_token_accuracy": 0.2487079009413719,
|
|
"num_tokens": 19547581.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"epoch": 8.429649356413671,
|
|
"eval_entropy": 5.424791200143991,
|
|
"eval_loss": 5.771859645843506,
|
|
"eval_mean_token_accuracy": 0.18201584144187935,
|
|
"eval_num_tokens": 19547581.0,
|
|
"eval_runtime": 2.0852,
|
|
"eval_samples_per_second": 1614.678,
|
|
"eval_steps_per_second": 201.895,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 5.6505804538726805,
|
|
"epoch": 8.434087882822903,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 8.174813543054638e-05,
|
|
"loss": 4.7086,
|
|
"mean_token_accuracy": 0.25109957754611967,
|
|
"num_tokens": 19557124.0,
|
|
"step": 9505
|
|
},
|
|
{
|
|
"entropy": 5.585074186325073,
|
|
"epoch": 8.438526409232136,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 8.157194086551475e-05,
|
|
"loss": 4.8165,
|
|
"mean_token_accuracy": 0.23596446663141252,
|
|
"num_tokens": 19567297.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 5.607591676712036,
|
|
"epoch": 8.442964935641367,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 8.139619968263745e-05,
|
|
"loss": 4.7855,
|
|
"mean_token_accuracy": 0.24840192645788192,
|
|
"num_tokens": 19578450.0,
|
|
"step": 9515
|
|
},
|
|
{
|
|
"entropy": 5.616419315338135,
|
|
"epoch": 8.4474034620506,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 8.12209122938398e-05,
|
|
"loss": 4.7457,
|
|
"mean_token_accuracy": 0.24583709090948105,
|
|
"num_tokens": 19588912.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 5.634144687652588,
|
|
"epoch": 8.451841988459831,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 8.10460791099835e-05,
|
|
"loss": 4.8006,
|
|
"mean_token_accuracy": 0.23721618354320526,
|
|
"num_tokens": 19598659.0,
|
|
"step": 9525
|
|
},
|
|
{
|
|
"entropy": 5.6569397926330565,
|
|
"epoch": 8.456280514869064,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 8.087170054086558e-05,
|
|
"loss": 4.8159,
|
|
"mean_token_accuracy": 0.23924409598112106,
|
|
"num_tokens": 19609403.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 5.630198955535889,
|
|
"epoch": 8.460719041278296,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 8.069777699521749e-05,
|
|
"loss": 4.8136,
|
|
"mean_token_accuracy": 0.23563257604837418,
|
|
"num_tokens": 19620223.0,
|
|
"step": 9535
|
|
},
|
|
{
|
|
"entropy": 5.5739891052246096,
|
|
"epoch": 8.465157567687529,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.052430888070415e-05,
|
|
"loss": 4.7077,
|
|
"mean_token_accuracy": 0.25690231323242185,
|
|
"num_tokens": 19630030.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 5.655608654022217,
|
|
"epoch": 8.46959609409676,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 8.035129660392288e-05,
|
|
"loss": 4.7921,
|
|
"mean_token_accuracy": 0.24214512407779692,
|
|
"num_tokens": 19641112.0,
|
|
"step": 9545
|
|
},
|
|
{
|
|
"entropy": 5.593982744216919,
|
|
"epoch": 8.474034620505993,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 8.017874057040274e-05,
|
|
"loss": 4.7123,
|
|
"mean_token_accuracy": 0.25090999603271485,
|
|
"num_tokens": 19650975.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 5.543642139434814,
|
|
"epoch": 8.478473146915224,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.000664118460325e-05,
|
|
"loss": 4.7463,
|
|
"mean_token_accuracy": 0.24988037794828416,
|
|
"num_tokens": 19662148.0,
|
|
"step": 9555
|
|
},
|
|
{
|
|
"entropy": 5.608541822433471,
|
|
"epoch": 8.482911673324455,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 7.983499884991356e-05,
|
|
"loss": 4.7303,
|
|
"mean_token_accuracy": 0.24890135377645492,
|
|
"num_tokens": 19672201.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 5.633218908309937,
|
|
"epoch": 8.487350199733688,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 7.966381396865169e-05,
|
|
"loss": 4.777,
|
|
"mean_token_accuracy": 0.2396102175116539,
|
|
"num_tokens": 19681986.0,
|
|
"step": 9565
|
|
},
|
|
{
|
|
"entropy": 5.625114631652832,
|
|
"epoch": 8.491788726142921,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 7.949308694206323e-05,
|
|
"loss": 4.7739,
|
|
"mean_token_accuracy": 0.250192628800869,
|
|
"num_tokens": 19692789.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 5.558058977127075,
|
|
"epoch": 8.496227252552153,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 7.932281817032065e-05,
|
|
"loss": 4.7512,
|
|
"mean_token_accuracy": 0.24510611742734909,
|
|
"num_tokens": 19703401.0,
|
|
"step": 9575
|
|
},
|
|
{
|
|
"entropy": 5.57720251083374,
|
|
"epoch": 8.500665778961384,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 7.915300805252237e-05,
|
|
"loss": 4.7606,
|
|
"mean_token_accuracy": 0.24950093030929565,
|
|
"num_tokens": 19714005.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 5.659220123291016,
|
|
"epoch": 8.505104305370617,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 7.89836569866916e-05,
|
|
"loss": 4.797,
|
|
"mean_token_accuracy": 0.24425686597824098,
|
|
"num_tokens": 19723819.0,
|
|
"step": 9585
|
|
},
|
|
{
|
|
"entropy": 5.643762302398682,
|
|
"epoch": 8.509542831779848,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 7.88147653697758e-05,
|
|
"loss": 4.8099,
|
|
"mean_token_accuracy": 0.2332814946770668,
|
|
"num_tokens": 19734883.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 5.584053611755371,
|
|
"epoch": 8.513981358189081,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 7.864633359764534e-05,
|
|
"loss": 4.7135,
|
|
"mean_token_accuracy": 0.25549362748861315,
|
|
"num_tokens": 19746455.0,
|
|
"step": 9595
|
|
},
|
|
{
|
|
"entropy": 5.617925357818604,
|
|
"epoch": 8.518419884598313,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 7.847836206509267e-05,
|
|
"loss": 4.7778,
|
|
"mean_token_accuracy": 0.24892029613256456,
|
|
"num_tokens": 19755954.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 5.581628847122192,
|
|
"epoch": 8.522858411007546,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.831085116583176e-05,
|
|
"loss": 4.8209,
|
|
"mean_token_accuracy": 0.24132636785507203,
|
|
"num_tokens": 19766312.0,
|
|
"step": 9605
|
|
},
|
|
{
|
|
"entropy": 5.574694728851318,
|
|
"epoch": 8.527296937416777,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 7.814380129249663e-05,
|
|
"loss": 4.7403,
|
|
"mean_token_accuracy": 0.2525677874684334,
|
|
"num_tokens": 19777169.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 5.5812132358551025,
|
|
"epoch": 8.53173546382601,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 7.797721283664077e-05,
|
|
"loss": 4.7611,
|
|
"mean_token_accuracy": 0.24748248010873794,
|
|
"num_tokens": 19788444.0,
|
|
"step": 9615
|
|
},
|
|
{
|
|
"entropy": 5.628298807144165,
|
|
"epoch": 8.536173990235241,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 7.781108618873614e-05,
|
|
"loss": 4.7513,
|
|
"mean_token_accuracy": 0.25065765231847764,
|
|
"num_tokens": 19799422.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 5.615176630020142,
|
|
"epoch": 8.540612516644474,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.764542173817221e-05,
|
|
"loss": 4.771,
|
|
"mean_token_accuracy": 0.25225749164819716,
|
|
"num_tokens": 19809820.0,
|
|
"step": 9625
|
|
},
|
|
{
|
|
"entropy": 5.65957989692688,
|
|
"epoch": 8.545051043053705,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.748021987325523e-05,
|
|
"loss": 4.825,
|
|
"mean_token_accuracy": 0.24210838675498964,
|
|
"num_tokens": 19820398.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 5.646222829818726,
|
|
"epoch": 8.549489569462938,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 7.731548098120701e-05,
|
|
"loss": 4.7981,
|
|
"mean_token_accuracy": 0.24547132402658461,
|
|
"num_tokens": 19831423.0,
|
|
"step": 9635
|
|
},
|
|
{
|
|
"entropy": 5.601474189758301,
|
|
"epoch": 8.55392809587217,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 7.715120544816425e-05,
|
|
"loss": 4.6992,
|
|
"mean_token_accuracy": 0.2534711495041847,
|
|
"num_tokens": 19841721.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 5.612629699707031,
|
|
"epoch": 8.558366622281403,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 7.698739365917764e-05,
|
|
"loss": 4.8228,
|
|
"mean_token_accuracy": 0.24151419699192048,
|
|
"num_tokens": 19851988.0,
|
|
"step": 9645
|
|
},
|
|
{
|
|
"entropy": 5.564256763458252,
|
|
"epoch": 8.562805148690634,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.682404599821084e-05,
|
|
"loss": 4.7423,
|
|
"mean_token_accuracy": 0.25280972123146056,
|
|
"num_tokens": 19862388.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 5.603235673904419,
|
|
"epoch": 8.567243675099867,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.666116284813942e-05,
|
|
"loss": 4.7386,
|
|
"mean_token_accuracy": 0.2536649614572525,
|
|
"num_tokens": 19872599.0,
|
|
"step": 9655
|
|
},
|
|
{
|
|
"entropy": 5.573291683197022,
|
|
"epoch": 8.571682201509098,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 7.649874459075057e-05,
|
|
"loss": 4.7408,
|
|
"mean_token_accuracy": 0.25134706050157546,
|
|
"num_tokens": 19882718.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 5.5813507556915285,
|
|
"epoch": 8.576120727918331,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 7.633679160674144e-05,
|
|
"loss": 4.7452,
|
|
"mean_token_accuracy": 0.2480468288064003,
|
|
"num_tokens": 19893163.0,
|
|
"step": 9665
|
|
},
|
|
{
|
|
"entropy": 5.571159744262696,
|
|
"epoch": 8.580559254327563,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 7.617530427571886e-05,
|
|
"loss": 4.7042,
|
|
"mean_token_accuracy": 0.251173834502697,
|
|
"num_tokens": 19903606.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 5.564378309249878,
|
|
"epoch": 8.584997780736796,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 7.601428297619805e-05,
|
|
"loss": 4.7107,
|
|
"mean_token_accuracy": 0.2537266120314598,
|
|
"num_tokens": 19913344.0,
|
|
"step": 9675
|
|
},
|
|
{
|
|
"entropy": 5.615421962738037,
|
|
"epoch": 8.589436307146027,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 7.585372808560192e-05,
|
|
"loss": 4.7925,
|
|
"mean_token_accuracy": 0.24262114316225053,
|
|
"num_tokens": 19922925.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 5.554098129272461,
|
|
"epoch": 8.59387483355526,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 7.569363998026021e-05,
|
|
"loss": 4.7001,
|
|
"mean_token_accuracy": 0.25055798441171645,
|
|
"num_tokens": 19933030.0,
|
|
"step": 9685
|
|
},
|
|
{
|
|
"entropy": 5.5686399936676025,
|
|
"epoch": 8.598313359964491,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.553401903540857e-05,
|
|
"loss": 4.7596,
|
|
"mean_token_accuracy": 0.24786879867315292,
|
|
"num_tokens": 19943168.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 5.6089434146881105,
|
|
"epoch": 8.602751886373724,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.537486562518735e-05,
|
|
"loss": 4.8182,
|
|
"mean_token_accuracy": 0.24910855889320374,
|
|
"num_tokens": 19953813.0,
|
|
"step": 9695
|
|
},
|
|
{
|
|
"entropy": 5.598349714279175,
|
|
"epoch": 8.607190412782955,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 7.521618012264149e-05,
|
|
"loss": 4.7667,
|
|
"mean_token_accuracy": 0.24518538862466813,
|
|
"num_tokens": 19964023.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 5.623208904266358,
|
|
"epoch": 8.611628939192189,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 7.505796289971885e-05,
|
|
"loss": 4.7705,
|
|
"mean_token_accuracy": 0.24491222351789474,
|
|
"num_tokens": 19973863.0,
|
|
"step": 9705
|
|
},
|
|
{
|
|
"entropy": 5.602122640609741,
|
|
"epoch": 8.61606746560142,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 7.490021432726987e-05,
|
|
"loss": 4.787,
|
|
"mean_token_accuracy": 0.23845486342906952,
|
|
"num_tokens": 19984061.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 5.620031118392944,
|
|
"epoch": 8.620505992010653,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 7.474293477504637e-05,
|
|
"loss": 4.8126,
|
|
"mean_token_accuracy": 0.23817750215530395,
|
|
"num_tokens": 19993687.0,
|
|
"step": 9715
|
|
},
|
|
{
|
|
"entropy": 5.566807079315185,
|
|
"epoch": 8.624944518419884,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.458612461170086e-05,
|
|
"loss": 4.6846,
|
|
"mean_token_accuracy": 0.2531875312328339,
|
|
"num_tokens": 20003981.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 5.594224452972412,
|
|
"epoch": 8.629383044829117,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 7.44297842047857e-05,
|
|
"loss": 4.7066,
|
|
"mean_token_accuracy": 0.24917846024036408,
|
|
"num_tokens": 20014780.0,
|
|
"step": 9725
|
|
},
|
|
{
|
|
"entropy": 5.592606163024902,
|
|
"epoch": 8.633821571238348,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 7.427391392075219e-05,
|
|
"loss": 4.8253,
|
|
"mean_token_accuracy": 0.23553045094013214,
|
|
"num_tokens": 20024820.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 5.597631549835205,
|
|
"epoch": 8.638260097647581,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 7.411851412494943e-05,
|
|
"loss": 4.7303,
|
|
"mean_token_accuracy": 0.25188649594783785,
|
|
"num_tokens": 20034879.0,
|
|
"step": 9735
|
|
},
|
|
{
|
|
"entropy": 5.612718629837036,
|
|
"epoch": 8.642698624056813,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.396358518162405e-05,
|
|
"loss": 4.8078,
|
|
"mean_token_accuracy": 0.24746455252170563,
|
|
"num_tokens": 20044591.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 5.549119901657105,
|
|
"epoch": 8.647137150466046,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 7.380912745391888e-05,
|
|
"loss": 4.6773,
|
|
"mean_token_accuracy": 0.25358337014913557,
|
|
"num_tokens": 20054693.0,
|
|
"step": 9745
|
|
},
|
|
{
|
|
"entropy": 5.630761909484863,
|
|
"epoch": 8.651575676875277,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 7.36551413038723e-05,
|
|
"loss": 4.7938,
|
|
"mean_token_accuracy": 0.23408515602350236,
|
|
"num_tokens": 20065521.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 5.579347705841064,
|
|
"epoch": 8.65601420328451,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 7.350162709241734e-05,
|
|
"loss": 4.7786,
|
|
"mean_token_accuracy": 0.2491224378347397,
|
|
"num_tokens": 20074505.0,
|
|
"step": 9755
|
|
},
|
|
{
|
|
"entropy": 5.604472208023071,
|
|
"epoch": 8.660452729693741,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.334858517938074e-05,
|
|
"loss": 4.7106,
|
|
"mean_token_accuracy": 0.2578990548849106,
|
|
"num_tokens": 20084517.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 5.572125720977783,
|
|
"epoch": 8.664891256102974,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 7.319601592348238e-05,
|
|
"loss": 4.7459,
|
|
"mean_token_accuracy": 0.25304116010665895,
|
|
"num_tokens": 20095286.0,
|
|
"step": 9765
|
|
},
|
|
{
|
|
"entropy": 5.601616048812867,
|
|
"epoch": 8.669329782512206,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 7.304391968233418e-05,
|
|
"loss": 4.7582,
|
|
"mean_token_accuracy": 0.24886737167835235,
|
|
"num_tokens": 20106012.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 5.622958993911743,
|
|
"epoch": 8.673768308921439,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.28922968124392e-05,
|
|
"loss": 4.7215,
|
|
"mean_token_accuracy": 0.2536028206348419,
|
|
"num_tokens": 20116258.0,
|
|
"step": 9775
|
|
},
|
|
{
|
|
"entropy": 5.585145807266235,
|
|
"epoch": 8.67820683533067,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 7.27411476691912e-05,
|
|
"loss": 4.6919,
|
|
"mean_token_accuracy": 0.261311873793602,
|
|
"num_tokens": 20126414.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 5.609970903396606,
|
|
"epoch": 8.682645361739903,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 7.25904726068734e-05,
|
|
"loss": 4.7665,
|
|
"mean_token_accuracy": 0.24972303062677384,
|
|
"num_tokens": 20136225.0,
|
|
"step": 9785
|
|
},
|
|
{
|
|
"entropy": 5.64526047706604,
|
|
"epoch": 8.687083888149134,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 7.244027197865793e-05,
|
|
"loss": 4.8015,
|
|
"mean_token_accuracy": 0.240475632250309,
|
|
"num_tokens": 20145244.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 5.5723278522491455,
|
|
"epoch": 8.691522414558367,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 7.229054613660472e-05,
|
|
"loss": 4.7199,
|
|
"mean_token_accuracy": 0.25074487924575806,
|
|
"num_tokens": 20156242.0,
|
|
"step": 9795
|
|
},
|
|
{
|
|
"entropy": 5.557277727127075,
|
|
"epoch": 8.695960940967598,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 7.21412954316609e-05,
|
|
"loss": 4.7729,
|
|
"mean_token_accuracy": 0.24823535978794098,
|
|
"num_tokens": 20166527.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 5.578718852996826,
|
|
"epoch": 8.700399467376831,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 7.199252021366e-05,
|
|
"loss": 4.7769,
|
|
"mean_token_accuracy": 0.2547251760959625,
|
|
"num_tokens": 20177374.0,
|
|
"step": 9805
|
|
},
|
|
{
|
|
"entropy": 5.575873231887817,
|
|
"epoch": 8.704837993786063,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 7.184422083132097e-05,
|
|
"loss": 4.7466,
|
|
"mean_token_accuracy": 0.2457982838153839,
|
|
"num_tokens": 20187635.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 5.618230485916138,
|
|
"epoch": 8.709276520195296,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 7.16963976322473e-05,
|
|
"loss": 4.7838,
|
|
"mean_token_accuracy": 0.24515322893857955,
|
|
"num_tokens": 20198231.0,
|
|
"step": 9815
|
|
},
|
|
{
|
|
"entropy": 5.60819993019104,
|
|
"epoch": 8.713715046604527,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 7.154905096292662e-05,
|
|
"loss": 4.7923,
|
|
"mean_token_accuracy": 0.24355104863643645,
|
|
"num_tokens": 20210163.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 5.610666799545288,
|
|
"epoch": 8.71815357301376,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 7.140218116872932e-05,
|
|
"loss": 4.7552,
|
|
"mean_token_accuracy": 0.24881061911582947,
|
|
"num_tokens": 20220379.0,
|
|
"step": 9825
|
|
},
|
|
{
|
|
"entropy": 5.588549995422364,
|
|
"epoch": 8.722592099422991,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 7.125578859390828e-05,
|
|
"loss": 4.8184,
|
|
"mean_token_accuracy": 0.24166147261857987,
|
|
"num_tokens": 20231171.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 5.6291186809539795,
|
|
"epoch": 8.727030625832224,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 7.110987358159763e-05,
|
|
"loss": 4.7684,
|
|
"mean_token_accuracy": 0.24281597435474395,
|
|
"num_tokens": 20241274.0,
|
|
"step": 9835
|
|
},
|
|
{
|
|
"entropy": 5.681340742111206,
|
|
"epoch": 8.731469152241456,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 7.09644364738122e-05,
|
|
"loss": 4.8518,
|
|
"mean_token_accuracy": 0.24292930364608764,
|
|
"num_tokens": 20252242.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 5.5738099098205565,
|
|
"epoch": 8.735907678650689,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 7.081947761144665e-05,
|
|
"loss": 4.7314,
|
|
"mean_token_accuracy": 0.25171978324651717,
|
|
"num_tokens": 20261885.0,
|
|
"step": 9845
|
|
},
|
|
{
|
|
"entropy": 5.625948715209961,
|
|
"epoch": 8.74034620505992,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 7.067499733427466e-05,
|
|
"loss": 4.7634,
|
|
"mean_token_accuracy": 0.24471362829208373,
|
|
"num_tokens": 20272732.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 5.5375231266021725,
|
|
"epoch": 8.744784731469153,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.053099598094804e-05,
|
|
"loss": 4.6779,
|
|
"mean_token_accuracy": 0.26139019429683685,
|
|
"num_tokens": 20283526.0,
|
|
"step": 9855
|
|
},
|
|
{
|
|
"entropy": 5.659989356994629,
|
|
"epoch": 8.749223257878384,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 7.038747388899624e-05,
|
|
"loss": 4.7924,
|
|
"mean_token_accuracy": 0.24179302304983138,
|
|
"num_tokens": 20294212.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 5.61225848197937,
|
|
"epoch": 8.753661784287617,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 7.024443139482514e-05,
|
|
"loss": 4.745,
|
|
"mean_token_accuracy": 0.2544255778193474,
|
|
"num_tokens": 20303366.0,
|
|
"step": 9865
|
|
},
|
|
{
|
|
"entropy": 5.57560510635376,
|
|
"epoch": 8.758100310696848,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 7.010186883371667e-05,
|
|
"loss": 4.7615,
|
|
"mean_token_accuracy": 0.2517819806933403,
|
|
"num_tokens": 20314309.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 5.590107154846192,
|
|
"epoch": 8.762538837106082,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 6.995978653982765e-05,
|
|
"loss": 4.7814,
|
|
"mean_token_accuracy": 0.2455209344625473,
|
|
"num_tokens": 20325368.0,
|
|
"step": 9875
|
|
},
|
|
{
|
|
"entropy": 5.643364524841308,
|
|
"epoch": 8.766977363515313,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 6.981818484618926e-05,
|
|
"loss": 4.7682,
|
|
"mean_token_accuracy": 0.24380398243665696,
|
|
"num_tokens": 20336379.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 5.559052991867065,
|
|
"epoch": 8.771415889924546,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 6.967706408470628e-05,
|
|
"loss": 4.7703,
|
|
"mean_token_accuracy": 0.2454047232866287,
|
|
"num_tokens": 20348171.0,
|
|
"step": 9885
|
|
},
|
|
{
|
|
"entropy": 5.60030722618103,
|
|
"epoch": 8.775854416333777,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.953642458615616e-05,
|
|
"loss": 4.8141,
|
|
"mean_token_accuracy": 0.23767014890909194,
|
|
"num_tokens": 20358802.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 5.603857088088989,
|
|
"epoch": 8.78029294274301,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 6.939626668018806e-05,
|
|
"loss": 4.8151,
|
|
"mean_token_accuracy": 0.24443256705999375,
|
|
"num_tokens": 20369105.0,
|
|
"step": 9895
|
|
},
|
|
{
|
|
"entropy": 5.66502685546875,
|
|
"epoch": 8.784731469152241,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 6.925659069532276e-05,
|
|
"loss": 4.776,
|
|
"mean_token_accuracy": 0.248145167529583,
|
|
"num_tokens": 20379169.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 5.61020565032959,
|
|
"epoch": 8.789169995561474,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 6.911739695895108e-05,
|
|
"loss": 4.7493,
|
|
"mean_token_accuracy": 0.2572967499494553,
|
|
"num_tokens": 20389664.0,
|
|
"step": 9905
|
|
},
|
|
{
|
|
"entropy": 5.568779706954956,
|
|
"epoch": 8.793608521970706,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 6.897868579733373e-05,
|
|
"loss": 4.7438,
|
|
"mean_token_accuracy": 0.253316530585289,
|
|
"num_tokens": 20399821.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 5.574910879135132,
|
|
"epoch": 8.798047048379939,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 6.884045753560016e-05,
|
|
"loss": 4.6918,
|
|
"mean_token_accuracy": 0.26183532923460007,
|
|
"num_tokens": 20410270.0,
|
|
"step": 9915
|
|
},
|
|
{
|
|
"entropy": 5.630820083618164,
|
|
"epoch": 8.80248557478917,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 6.870271249774793e-05,
|
|
"loss": 4.7437,
|
|
"mean_token_accuracy": 0.2513258084654808,
|
|
"num_tokens": 20419892.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 5.616603899002075,
|
|
"epoch": 8.806924101198401,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 6.856545100664203e-05,
|
|
"loss": 4.8576,
|
|
"mean_token_accuracy": 0.24017766416072844,
|
|
"num_tokens": 20432811.0,
|
|
"step": 9925
|
|
},
|
|
{
|
|
"entropy": 5.606483221054077,
|
|
"epoch": 8.811362627607634,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 6.842867338401409e-05,
|
|
"loss": 4.7382,
|
|
"mean_token_accuracy": 0.2526328548789024,
|
|
"num_tokens": 20441249.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 5.602121353149414,
|
|
"epoch": 8.815801154016867,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 6.829237995046138e-05,
|
|
"loss": 4.7022,
|
|
"mean_token_accuracy": 0.24912111908197404,
|
|
"num_tokens": 20450274.0,
|
|
"step": 9935
|
|
},
|
|
{
|
|
"entropy": 5.562580156326294,
|
|
"epoch": 8.820239680426099,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 6.815657102544648e-05,
|
|
"loss": 4.7129,
|
|
"mean_token_accuracy": 0.2592930346727371,
|
|
"num_tokens": 20460588.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 5.566735124588012,
|
|
"epoch": 8.82467820683533,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.802124692729613e-05,
|
|
"loss": 4.7813,
|
|
"mean_token_accuracy": 0.24866351187229158,
|
|
"num_tokens": 20471577.0,
|
|
"step": 9945
|
|
},
|
|
{
|
|
"entropy": 5.579263973236084,
|
|
"epoch": 8.829116733244563,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 6.788640797320092e-05,
|
|
"loss": 4.7157,
|
|
"mean_token_accuracy": 0.2595663443207741,
|
|
"num_tokens": 20481366.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 5.652793979644775,
|
|
"epoch": 8.833555259653796,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 6.775205447921409e-05,
|
|
"loss": 4.8475,
|
|
"mean_token_accuracy": 0.2453085944056511,
|
|
"num_tokens": 20491263.0,
|
|
"step": 9955
|
|
},
|
|
{
|
|
"entropy": 5.6102378368377686,
|
|
"epoch": 8.837993786063027,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 6.761818676025096e-05,
|
|
"loss": 4.7238,
|
|
"mean_token_accuracy": 0.24480469673871993,
|
|
"num_tokens": 20501733.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 5.592812776565552,
|
|
"epoch": 8.842432312472258,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 6.748480513008843e-05,
|
|
"loss": 4.7668,
|
|
"mean_token_accuracy": 0.2423416182398796,
|
|
"num_tokens": 20511349.0,
|
|
"step": 9965
|
|
},
|
|
{
|
|
"entropy": 5.592259693145752,
|
|
"epoch": 8.846870838881491,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 6.735190990136394e-05,
|
|
"loss": 4.7608,
|
|
"mean_token_accuracy": 0.2457003191113472,
|
|
"num_tokens": 20520861.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 5.61671462059021,
|
|
"epoch": 8.851309365290723,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 6.721950138557468e-05,
|
|
"loss": 4.7153,
|
|
"mean_token_accuracy": 0.25770729780197144,
|
|
"num_tokens": 20531104.0,
|
|
"step": 9975
|
|
},
|
|
{
|
|
"entropy": 5.596091794967651,
|
|
"epoch": 8.855747891699956,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.708757989307729e-05,
|
|
"loss": 4.7882,
|
|
"mean_token_accuracy": 0.24048157334327697,
|
|
"num_tokens": 20541106.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 5.586101293563843,
|
|
"epoch": 8.860186418109187,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 6.695614573308673e-05,
|
|
"loss": 4.8171,
|
|
"mean_token_accuracy": 0.24570093303918839,
|
|
"num_tokens": 20551081.0,
|
|
"step": 9985
|
|
},
|
|
{
|
|
"entropy": 5.565116357803345,
|
|
"epoch": 8.86462494451842,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.68251992136756e-05,
|
|
"loss": 4.715,
|
|
"mean_token_accuracy": 0.25080256462097167,
|
|
"num_tokens": 20560810.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 5.5944661617279055,
|
|
"epoch": 8.869063470927651,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 6.66947406417737e-05,
|
|
"loss": 4.7674,
|
|
"mean_token_accuracy": 0.25089229494333265,
|
|
"num_tokens": 20570712.0,
|
|
"step": 9995
|
|
},
|
|
{
|
|
"entropy": 5.541274976730347,
|
|
"epoch": 8.873501997336884,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 6.65647703231669e-05,
|
|
"loss": 4.7197,
|
|
"mean_token_accuracy": 0.24946106374263763,
|
|
"num_tokens": 20581006.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"epoch": 8.873501997336884,
|
|
"eval_entropy": 5.4241680634559755,
|
|
"eval_loss": 5.7706379890441895,
|
|
"eval_mean_token_accuracy": 0.1819902893129267,
|
|
"eval_num_tokens": 20581006.0,
|
|
"eval_runtime": 2.0723,
|
|
"eval_samples_per_second": 1624.726,
|
|
"eval_steps_per_second": 203.151,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 5.551128482818603,
|
|
"epoch": 8.877940523746116,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 6.643528856249688e-05,
|
|
"loss": 4.7111,
|
|
"mean_token_accuracy": 0.257743664085865,
|
|
"num_tokens": 20590970.0,
|
|
"step": 10005
|
|
},
|
|
{
|
|
"entropy": 5.583196210861206,
|
|
"epoch": 8.882379050155349,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 6.630629566325999e-05,
|
|
"loss": 4.7645,
|
|
"mean_token_accuracy": 0.2506068110466003,
|
|
"num_tokens": 20601261.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 5.540107727050781,
|
|
"epoch": 8.88681757656458,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 6.617779192780671e-05,
|
|
"loss": 4.6476,
|
|
"mean_token_accuracy": 0.25502060204744337,
|
|
"num_tokens": 20610575.0,
|
|
"step": 10015
|
|
},
|
|
{
|
|
"entropy": 5.578070640563965,
|
|
"epoch": 8.891256102973813,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.604977765734105e-05,
|
|
"loss": 4.6872,
|
|
"mean_token_accuracy": 0.2577795058488846,
|
|
"num_tokens": 20620803.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 5.626595592498779,
|
|
"epoch": 8.895694629383044,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 6.592225315191974e-05,
|
|
"loss": 4.7855,
|
|
"mean_token_accuracy": 0.24570256173610688,
|
|
"num_tokens": 20630516.0,
|
|
"step": 10025
|
|
},
|
|
{
|
|
"entropy": 5.577913379669189,
|
|
"epoch": 8.900133155792277,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 6.579521871045147e-05,
|
|
"loss": 4.7581,
|
|
"mean_token_accuracy": 0.2485368862748146,
|
|
"num_tokens": 20640354.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 5.601108455657959,
|
|
"epoch": 8.904571682201508,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 6.566867463069631e-05,
|
|
"loss": 4.7663,
|
|
"mean_token_accuracy": 0.24701670408248902,
|
|
"num_tokens": 20650610.0,
|
|
"step": 10035
|
|
},
|
|
{
|
|
"entropy": 5.521933555603027,
|
|
"epoch": 8.909010208610741,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 6.554262120926494e-05,
|
|
"loss": 4.6525,
|
|
"mean_token_accuracy": 0.2568608194589615,
|
|
"num_tokens": 20661911.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 5.572207880020142,
|
|
"epoch": 8.913448735019973,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 6.541705874161795e-05,
|
|
"loss": 4.7479,
|
|
"mean_token_accuracy": 0.25041707456111906,
|
|
"num_tokens": 20672558.0,
|
|
"step": 10045
|
|
},
|
|
{
|
|
"entropy": 5.617059850692749,
|
|
"epoch": 8.917887261429206,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 6.529198752206528e-05,
|
|
"loss": 4.7985,
|
|
"mean_token_accuracy": 0.23992843329906463,
|
|
"num_tokens": 20682913.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 5.612056255340576,
|
|
"epoch": 8.922325787838437,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 6.516740784376516e-05,
|
|
"loss": 4.7679,
|
|
"mean_token_accuracy": 0.24587691873311995,
|
|
"num_tokens": 20693108.0,
|
|
"step": 10055
|
|
},
|
|
{
|
|
"entropy": 5.639013195037842,
|
|
"epoch": 8.92676431424767,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 6.504331999872395e-05,
|
|
"loss": 4.832,
|
|
"mean_token_accuracy": 0.2372266560792923,
|
|
"num_tokens": 20702846.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 5.607140302658081,
|
|
"epoch": 8.931202840656901,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 6.491972427779507e-05,
|
|
"loss": 4.7682,
|
|
"mean_token_accuracy": 0.25341561138629914,
|
|
"num_tokens": 20713343.0,
|
|
"step": 10065
|
|
},
|
|
{
|
|
"entropy": 5.664197635650635,
|
|
"epoch": 8.935641367066134,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 6.479662097067837e-05,
|
|
"loss": 4.8807,
|
|
"mean_token_accuracy": 0.24217969924211502,
|
|
"num_tokens": 20724324.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 5.56042628288269,
|
|
"epoch": 8.940079893475366,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 6.467401036591972e-05,
|
|
"loss": 4.7044,
|
|
"mean_token_accuracy": 0.2556281819939613,
|
|
"num_tokens": 20734018.0,
|
|
"step": 10075
|
|
},
|
|
{
|
|
"entropy": 5.6037050724029545,
|
|
"epoch": 8.944518419884599,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 6.455189275090985e-05,
|
|
"loss": 4.7307,
|
|
"mean_token_accuracy": 0.25062364935874937,
|
|
"num_tokens": 20743806.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 5.579561948776245,
|
|
"epoch": 8.94895694629383,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 6.443026841188426e-05,
|
|
"loss": 4.7175,
|
|
"mean_token_accuracy": 0.2559228092432022,
|
|
"num_tokens": 20753747.0,
|
|
"step": 10085
|
|
},
|
|
{
|
|
"entropy": 5.573804664611816,
|
|
"epoch": 8.953395472703063,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 6.430913763392202e-05,
|
|
"loss": 4.6947,
|
|
"mean_token_accuracy": 0.25658926367759705,
|
|
"num_tokens": 20764235.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 5.613000679016113,
|
|
"epoch": 8.957833999112294,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.418850070094535e-05,
|
|
"loss": 4.7834,
|
|
"mean_token_accuracy": 0.2439221367239952,
|
|
"num_tokens": 20775170.0,
|
|
"step": 10095
|
|
},
|
|
{
|
|
"entropy": 5.6074809551239015,
|
|
"epoch": 8.962272525521527,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 6.406835789571905e-05,
|
|
"loss": 4.7976,
|
|
"mean_token_accuracy": 0.23421283811330795,
|
|
"num_tokens": 20786111.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 5.589686870574951,
|
|
"epoch": 8.966711051930758,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.394870949984962e-05,
|
|
"loss": 4.7813,
|
|
"mean_token_accuracy": 0.2536864697933197,
|
|
"num_tokens": 20796594.0,
|
|
"step": 10105
|
|
},
|
|
{
|
|
"entropy": 5.574846172332764,
|
|
"epoch": 8.971149578339991,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 6.382955579378468e-05,
|
|
"loss": 4.716,
|
|
"mean_token_accuracy": 0.25237261652946474,
|
|
"num_tokens": 20807711.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 5.5636969089508055,
|
|
"epoch": 8.975588104749223,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 6.37108970568125e-05,
|
|
"loss": 4.7253,
|
|
"mean_token_accuracy": 0.2592225655913353,
|
|
"num_tokens": 20818467.0,
|
|
"step": 10115
|
|
},
|
|
{
|
|
"entropy": 5.633021306991577,
|
|
"epoch": 8.980026631158456,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 6.359273356706088e-05,
|
|
"loss": 4.7535,
|
|
"mean_token_accuracy": 0.23862671852111816,
|
|
"num_tokens": 20829777.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 5.592502117156982,
|
|
"epoch": 8.984465157567687,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 6.347506560149712e-05,
|
|
"loss": 4.778,
|
|
"mean_token_accuracy": 0.2456789031624794,
|
|
"num_tokens": 20841011.0,
|
|
"step": 10125
|
|
},
|
|
{
|
|
"entropy": 5.6184286117553714,
|
|
"epoch": 8.98890368397692,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 6.335789343592687e-05,
|
|
"loss": 4.7724,
|
|
"mean_token_accuracy": 0.24752812683582306,
|
|
"num_tokens": 20851779.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 5.603323364257813,
|
|
"epoch": 8.993342210386151,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.324121734499355e-05,
|
|
"loss": 4.7046,
|
|
"mean_token_accuracy": 0.2546207711100578,
|
|
"num_tokens": 20862457.0,
|
|
"step": 10135
|
|
},
|
|
{
|
|
"entropy": 5.589032793045044,
|
|
"epoch": 8.997780736795384,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 6.312503760217809e-05,
|
|
"loss": 4.7463,
|
|
"mean_token_accuracy": 0.24548126459121705,
|
|
"num_tokens": 20872526.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 5.595643361409505,
|
|
"epoch": 9.001775410563694,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 6.300935447979779e-05,
|
|
"loss": 4.7594,
|
|
"mean_token_accuracy": 0.24710878398683336,
|
|
"num_tokens": 20881490.0,
|
|
"step": 10145
|
|
},
|
|
{
|
|
"entropy": 5.624365758895874,
|
|
"epoch": 9.006213936972925,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 6.289416824900597e-05,
|
|
"loss": 4.791,
|
|
"mean_token_accuracy": 0.24580082893371583,
|
|
"num_tokens": 20891419.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 5.620862913131714,
|
|
"epoch": 9.010652463382158,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 6.277947917979139e-05,
|
|
"loss": 4.8342,
|
|
"mean_token_accuracy": 0.24350712895393373,
|
|
"num_tokens": 20902121.0,
|
|
"step": 10155
|
|
},
|
|
{
|
|
"entropy": 5.575443077087402,
|
|
"epoch": 9.01509098979139,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 6.266528754097726e-05,
|
|
"loss": 4.7547,
|
|
"mean_token_accuracy": 0.25189488530159,
|
|
"num_tokens": 20912387.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 5.6060854434967045,
|
|
"epoch": 9.019529516200622,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 6.255159360022109e-05,
|
|
"loss": 4.7684,
|
|
"mean_token_accuracy": 0.2428876981139183,
|
|
"num_tokens": 20923119.0,
|
|
"step": 10165
|
|
},
|
|
{
|
|
"entropy": 5.629054212570191,
|
|
"epoch": 9.023968042609853,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 6.24383976240137e-05,
|
|
"loss": 4.7845,
|
|
"mean_token_accuracy": 0.2439975693821907,
|
|
"num_tokens": 20933744.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 5.573568201065063,
|
|
"epoch": 9.028406569019086,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 6.23256998776786e-05,
|
|
"loss": 4.7197,
|
|
"mean_token_accuracy": 0.25985676497220994,
|
|
"num_tokens": 20943897.0,
|
|
"step": 10175
|
|
},
|
|
{
|
|
"entropy": 5.607037115097046,
|
|
"epoch": 9.032845095428318,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.221350062537173e-05,
|
|
"loss": 4.7038,
|
|
"mean_token_accuracy": 0.25252425819635393,
|
|
"num_tokens": 20954603.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 5.579010152816773,
|
|
"epoch": 9.03728362183755,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 6.210180013008046e-05,
|
|
"loss": 4.778,
|
|
"mean_token_accuracy": 0.24778902977705003,
|
|
"num_tokens": 20965426.0,
|
|
"step": 10185
|
|
},
|
|
{
|
|
"entropy": 5.602505350112915,
|
|
"epoch": 9.041722148246782,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 6.199059865362303e-05,
|
|
"loss": 4.7299,
|
|
"mean_token_accuracy": 0.24813518524169922,
|
|
"num_tokens": 20974755.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 5.606250905990601,
|
|
"epoch": 9.046160674656015,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 6.187989645664822e-05,
|
|
"loss": 4.7653,
|
|
"mean_token_accuracy": 0.2501200094819069,
|
|
"num_tokens": 20984898.0,
|
|
"step": 10195
|
|
},
|
|
{
|
|
"entropy": 5.639361763000489,
|
|
"epoch": 9.050599201065246,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 6.176969379863433e-05,
|
|
"loss": 4.7416,
|
|
"mean_token_accuracy": 0.25200111269950864,
|
|
"num_tokens": 20995173.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 5.6628247737884525,
|
|
"epoch": 9.05503772747448,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.165999093788894e-05,
|
|
"loss": 4.8082,
|
|
"mean_token_accuracy": 0.23594252169132232,
|
|
"num_tokens": 21005010.0,
|
|
"step": 10205
|
|
},
|
|
{
|
|
"entropy": 5.6216919898986815,
|
|
"epoch": 9.05947625388371,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 6.1550788131548e-05,
|
|
"loss": 4.7103,
|
|
"mean_token_accuracy": 0.25395443141460416,
|
|
"num_tokens": 21014807.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 5.592295742034912,
|
|
"epoch": 9.063914780292944,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 6.144208563557543e-05,
|
|
"loss": 4.6797,
|
|
"mean_token_accuracy": 0.2545186519622803,
|
|
"num_tokens": 21024463.0,
|
|
"step": 10215
|
|
},
|
|
{
|
|
"entropy": 5.605840635299683,
|
|
"epoch": 9.068353306702175,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 6.133388370476245e-05,
|
|
"loss": 4.7968,
|
|
"mean_token_accuracy": 0.2417024180293083,
|
|
"num_tokens": 21035180.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 5.597324228286743,
|
|
"epoch": 9.072791833111406,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 6.122618259272702e-05,
|
|
"loss": 4.7644,
|
|
"mean_token_accuracy": 0.24844435453414918,
|
|
"num_tokens": 21046544.0,
|
|
"step": 10225
|
|
},
|
|
{
|
|
"entropy": 5.582694816589355,
|
|
"epoch": 9.07723035952064,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 6.111898255191316e-05,
|
|
"loss": 4.7634,
|
|
"mean_token_accuracy": 0.24949227124452591,
|
|
"num_tokens": 21057741.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 5.626307773590088,
|
|
"epoch": 9.08166888592987,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 6.1012283833590465e-05,
|
|
"loss": 4.7392,
|
|
"mean_token_accuracy": 0.2562169447541237,
|
|
"num_tokens": 21068480.0,
|
|
"step": 10235
|
|
},
|
|
{
|
|
"entropy": 5.574475955963135,
|
|
"epoch": 9.086107412339103,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 6.0906086687853404e-05,
|
|
"loss": 4.6708,
|
|
"mean_token_accuracy": 0.2607402577996254,
|
|
"num_tokens": 21079086.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 5.590927696228027,
|
|
"epoch": 9.090545938748335,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 6.0800391363620873e-05,
|
|
"loss": 4.7346,
|
|
"mean_token_accuracy": 0.2527214378118515,
|
|
"num_tokens": 21090672.0,
|
|
"step": 10245
|
|
},
|
|
{
|
|
"entropy": 5.586051082611084,
|
|
"epoch": 9.094984465157568,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 6.069519810863552e-05,
|
|
"loss": 4.8094,
|
|
"mean_token_accuracy": 0.24355319440364837,
|
|
"num_tokens": 21103512.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 5.52944016456604,
|
|
"epoch": 9.099422991566799,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 6.059050716946304e-05,
|
|
"loss": 4.6547,
|
|
"mean_token_accuracy": 0.26089911013841627,
|
|
"num_tokens": 21113949.0,
|
|
"step": 10255
|
|
},
|
|
{
|
|
"entropy": 5.5463494777679445,
|
|
"epoch": 9.103861517976032,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 6.048631879149193e-05,
|
|
"loss": 4.7576,
|
|
"mean_token_accuracy": 0.2511456862092018,
|
|
"num_tokens": 21124950.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 5.603103590011597,
|
|
"epoch": 9.108300044385263,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 6.038263321893259e-05,
|
|
"loss": 4.7417,
|
|
"mean_token_accuracy": 0.24978003054857253,
|
|
"num_tokens": 21135784.0,
|
|
"step": 10265
|
|
},
|
|
{
|
|
"entropy": 5.617848348617554,
|
|
"epoch": 9.112738570794496,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 6.027945069481691e-05,
|
|
"loss": 4.7622,
|
|
"mean_token_accuracy": 0.24598357379436492,
|
|
"num_tokens": 21145960.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 5.6492307662963865,
|
|
"epoch": 9.117177097203728,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 6.017677146099773e-05,
|
|
"loss": 4.7699,
|
|
"mean_token_accuracy": 0.2480050414800644,
|
|
"num_tokens": 21155692.0,
|
|
"step": 10275
|
|
},
|
|
{
|
|
"entropy": 5.651911354064941,
|
|
"epoch": 9.12161562361296,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.007459575814812e-05,
|
|
"loss": 4.7459,
|
|
"mean_token_accuracy": 0.25501337051391604,
|
|
"num_tokens": 21165476.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 5.633753824234009,
|
|
"epoch": 9.126054150022192,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 5.997292382576092e-05,
|
|
"loss": 4.7632,
|
|
"mean_token_accuracy": 0.2472266897559166,
|
|
"num_tokens": 21175696.0,
|
|
"step": 10285
|
|
},
|
|
{
|
|
"entropy": 5.450502634048462,
|
|
"epoch": 9.130492676431425,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 5.987175590214827e-05,
|
|
"loss": 4.587,
|
|
"mean_token_accuracy": 0.27226661890745163,
|
|
"num_tokens": 21186274.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 5.605899238586426,
|
|
"epoch": 9.134931202840656,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 5.977109222444078e-05,
|
|
"loss": 4.7526,
|
|
"mean_token_accuracy": 0.24441428035497664,
|
|
"num_tokens": 21195526.0,
|
|
"step": 10295
|
|
},
|
|
{
|
|
"entropy": 5.580242013931274,
|
|
"epoch": 9.13936972924989,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.9670933028587296e-05,
|
|
"loss": 4.7372,
|
|
"mean_token_accuracy": 0.24998867362737656,
|
|
"num_tokens": 21206002.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 5.620478916168213,
|
|
"epoch": 9.14380825565912,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.957127854935411e-05,
|
|
"loss": 4.6796,
|
|
"mean_token_accuracy": 0.2508429452776909,
|
|
"num_tokens": 21215388.0,
|
|
"step": 10305
|
|
},
|
|
{
|
|
"entropy": 5.624001121520996,
|
|
"epoch": 9.148246782068354,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 5.9472129020324476e-05,
|
|
"loss": 4.7462,
|
|
"mean_token_accuracy": 0.2474284663796425,
|
|
"num_tokens": 21225948.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 5.6259502410888675,
|
|
"epoch": 9.152685308477585,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 5.93734846738982e-05,
|
|
"loss": 4.8,
|
|
"mean_token_accuracy": 0.24020758122205735,
|
|
"num_tokens": 21236969.0,
|
|
"step": 10315
|
|
},
|
|
{
|
|
"entropy": 5.643144321441651,
|
|
"epoch": 9.157123834886818,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 5.927534574129081e-05,
|
|
"loss": 4.7771,
|
|
"mean_token_accuracy": 0.24813067317008972,
|
|
"num_tokens": 21248708.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 5.601741552352905,
|
|
"epoch": 9.161562361296049,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 5.917771245253329e-05,
|
|
"loss": 4.7729,
|
|
"mean_token_accuracy": 0.25012415200471877,
|
|
"num_tokens": 21260224.0,
|
|
"step": 10325
|
|
},
|
|
{
|
|
"entropy": 5.584124898910522,
|
|
"epoch": 9.166000887705282,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 5.908058503647146e-05,
|
|
"loss": 4.751,
|
|
"mean_token_accuracy": 0.2500235453248024,
|
|
"num_tokens": 21270308.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 5.616476154327392,
|
|
"epoch": 9.170439414114513,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 5.898396372076519e-05,
|
|
"loss": 4.7654,
|
|
"mean_token_accuracy": 0.24522326588630677,
|
|
"num_tokens": 21280221.0,
|
|
"step": 10335
|
|
},
|
|
{
|
|
"entropy": 5.555826425552368,
|
|
"epoch": 9.174877940523746,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 5.888784873188839e-05,
|
|
"loss": 4.7079,
|
|
"mean_token_accuracy": 0.25730653405189513,
|
|
"num_tokens": 21290881.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 5.533019971847534,
|
|
"epoch": 9.179316466932978,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 5.879224029512797e-05,
|
|
"loss": 4.6931,
|
|
"mean_token_accuracy": 0.2536853849887848,
|
|
"num_tokens": 21301471.0,
|
|
"step": 10345
|
|
},
|
|
{
|
|
"entropy": 5.559663009643555,
|
|
"epoch": 9.18375499334221,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 5.869713863458353e-05,
|
|
"loss": 4.6974,
|
|
"mean_token_accuracy": 0.2554829180240631,
|
|
"num_tokens": 21310894.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 5.571140193939209,
|
|
"epoch": 9.188193519751442,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 5.8602543973166966e-05,
|
|
"loss": 4.7589,
|
|
"mean_token_accuracy": 0.24656118154525758,
|
|
"num_tokens": 21321804.0,
|
|
"step": 10355
|
|
},
|
|
{
|
|
"entropy": 5.5888091087341305,
|
|
"epoch": 9.192632046160675,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 5.850845653260163e-05,
|
|
"loss": 4.7206,
|
|
"mean_token_accuracy": 0.2527917593717575,
|
|
"num_tokens": 21332359.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 5.574620342254638,
|
|
"epoch": 9.197070572569906,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 5.8414876533422044e-05,
|
|
"loss": 4.7404,
|
|
"mean_token_accuracy": 0.25233368426561353,
|
|
"num_tokens": 21342082.0,
|
|
"step": 10365
|
|
},
|
|
{
|
|
"entropy": 5.593585443496704,
|
|
"epoch": 9.20150909897914,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.83218041949734e-05,
|
|
"loss": 4.761,
|
|
"mean_token_accuracy": 0.2487403556704521,
|
|
"num_tokens": 21352805.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 5.591269683837891,
|
|
"epoch": 9.20594762538837,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 5.822923973541083e-05,
|
|
"loss": 4.7495,
|
|
"mean_token_accuracy": 0.2503411635756493,
|
|
"num_tokens": 21365021.0,
|
|
"step": 10375
|
|
},
|
|
{
|
|
"entropy": 5.61783618927002,
|
|
"epoch": 9.210386151797604,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.813718337169913e-05,
|
|
"loss": 4.768,
|
|
"mean_token_accuracy": 0.24710558950901032,
|
|
"num_tokens": 21374179.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 5.5946392059326175,
|
|
"epoch": 9.214824678206835,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 5.804563531961214e-05,
|
|
"loss": 4.8104,
|
|
"mean_token_accuracy": 0.24308468997478486,
|
|
"num_tokens": 21384956.0,
|
|
"step": 10385
|
|
},
|
|
{
|
|
"entropy": 5.547881984710694,
|
|
"epoch": 9.219263204616068,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 5.79545957937322e-05,
|
|
"loss": 4.6997,
|
|
"mean_token_accuracy": 0.2534201368689537,
|
|
"num_tokens": 21395073.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 5.624308109283447,
|
|
"epoch": 9.223701731025299,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 5.786406500744978e-05,
|
|
"loss": 4.7098,
|
|
"mean_token_accuracy": 0.249492609500885,
|
|
"num_tokens": 21405779.0,
|
|
"step": 10395
|
|
},
|
|
{
|
|
"entropy": 5.673814153671264,
|
|
"epoch": 9.228140257434532,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.777404317296288e-05,
|
|
"loss": 4.7773,
|
|
"mean_token_accuracy": 0.24015034437179567,
|
|
"num_tokens": 21414876.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 5.57143268585205,
|
|
"epoch": 9.232578783843763,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.768453050127642e-05,
|
|
"loss": 4.739,
|
|
"mean_token_accuracy": 0.2537206903100014,
|
|
"num_tokens": 21425057.0,
|
|
"step": 10405
|
|
},
|
|
{
|
|
"entropy": 5.567228889465332,
|
|
"epoch": 9.237017310252996,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 5.759552720220212e-05,
|
|
"loss": 4.7282,
|
|
"mean_token_accuracy": 0.24745972454547882,
|
|
"num_tokens": 21435246.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 5.585815715789795,
|
|
"epoch": 9.241455836662228,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 5.7507033484357536e-05,
|
|
"loss": 4.6992,
|
|
"mean_token_accuracy": 0.25898619592189787,
|
|
"num_tokens": 21444386.0,
|
|
"step": 10415
|
|
},
|
|
{
|
|
"entropy": 5.612739610671997,
|
|
"epoch": 9.24589436307146,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 5.741904955516594e-05,
|
|
"loss": 4.7434,
|
|
"mean_token_accuracy": 0.2484385147690773,
|
|
"num_tokens": 21455254.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 5.554107189178467,
|
|
"epoch": 9.250332889480692,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.733157562085565e-05,
|
|
"loss": 4.6299,
|
|
"mean_token_accuracy": 0.2578326538205147,
|
|
"num_tokens": 21464897.0,
|
|
"step": 10425
|
|
},
|
|
{
|
|
"entropy": 5.6073863983154295,
|
|
"epoch": 9.254771415889925,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 5.7244611886459526e-05,
|
|
"loss": 4.7317,
|
|
"mean_token_accuracy": 0.24835094511508943,
|
|
"num_tokens": 21475390.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 5.629126358032226,
|
|
"epoch": 9.259209942299156,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 5.7158158555814715e-05,
|
|
"loss": 4.7009,
|
|
"mean_token_accuracy": 0.2558847337961197,
|
|
"num_tokens": 21486690.0,
|
|
"step": 10435
|
|
},
|
|
{
|
|
"entropy": 5.594157600402832,
|
|
"epoch": 9.26364846870839,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 5.707221583156189e-05,
|
|
"loss": 4.7163,
|
|
"mean_token_accuracy": 0.2533439129590988,
|
|
"num_tokens": 21496728.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 5.618081998825073,
|
|
"epoch": 9.26808699511762,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.6986783915144874e-05,
|
|
"loss": 4.7508,
|
|
"mean_token_accuracy": 0.24690095335245132,
|
|
"num_tokens": 21507019.0,
|
|
"step": 10445
|
|
},
|
|
{
|
|
"entropy": 5.602433156967163,
|
|
"epoch": 9.272525521526854,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.6901863006810345e-05,
|
|
"loss": 4.7306,
|
|
"mean_token_accuracy": 0.25141475945711134,
|
|
"num_tokens": 21517730.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 5.6470507144927975,
|
|
"epoch": 9.276964047936085,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.681745330560695e-05,
|
|
"loss": 4.8216,
|
|
"mean_token_accuracy": 0.23808371722698213,
|
|
"num_tokens": 21528419.0,
|
|
"step": 10455
|
|
},
|
|
{
|
|
"entropy": 5.628362798690796,
|
|
"epoch": 9.281402574345318,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.673355500938542e-05,
|
|
"loss": 4.776,
|
|
"mean_token_accuracy": 0.24959989935159682,
|
|
"num_tokens": 21539247.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 5.607505941390992,
|
|
"epoch": 9.28584110075455,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 5.665016831479755e-05,
|
|
"loss": 4.7596,
|
|
"mean_token_accuracy": 0.24818158596754075,
|
|
"num_tokens": 21549063.0,
|
|
"step": 10465
|
|
},
|
|
{
|
|
"entropy": 5.603528261184692,
|
|
"epoch": 9.290279627163782,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.6567293417296044e-05,
|
|
"loss": 4.7361,
|
|
"mean_token_accuracy": 0.2488905072212219,
|
|
"num_tokens": 21559137.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 5.596030282974243,
|
|
"epoch": 9.294718153573013,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.648493051113404e-05,
|
|
"loss": 4.7356,
|
|
"mean_token_accuracy": 0.25256200432777404,
|
|
"num_tokens": 21569403.0,
|
|
"step": 10475
|
|
},
|
|
{
|
|
"entropy": 5.583005905151367,
|
|
"epoch": 9.299156679982246,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.640307978936455e-05,
|
|
"loss": 4.7006,
|
|
"mean_token_accuracy": 0.2529683455824852,
|
|
"num_tokens": 21579657.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 5.627980709075928,
|
|
"epoch": 9.303595206391478,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 5.6321741443840045e-05,
|
|
"loss": 4.7914,
|
|
"mean_token_accuracy": 0.24177914410829543,
|
|
"num_tokens": 21589673.0,
|
|
"step": 10485
|
|
},
|
|
{
|
|
"entropy": 5.622909259796143,
|
|
"epoch": 9.30803373280071,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 5.624091566521212e-05,
|
|
"loss": 4.7854,
|
|
"mean_token_accuracy": 0.24686320275068283,
|
|
"num_tokens": 21600174.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 5.553754615783691,
|
|
"epoch": 9.312472259209942,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 5.6160602642930795e-05,
|
|
"loss": 4.6771,
|
|
"mean_token_accuracy": 0.24957920908927916,
|
|
"num_tokens": 21610019.0,
|
|
"step": 10495
|
|
},
|
|
{
|
|
"entropy": 5.57537431716919,
|
|
"epoch": 9.316910785619175,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.608080256524435e-05,
|
|
"loss": 4.787,
|
|
"mean_token_accuracy": 0.25396704375743867,
|
|
"num_tokens": 21619801.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"epoch": 9.316910785619175,
|
|
"eval_entropy": 5.420958371740055,
|
|
"eval_loss": 5.771925926208496,
|
|
"eval_mean_token_accuracy": 0.1817705282087564,
|
|
"eval_num_tokens": 21619801.0,
|
|
"eval_runtime": 2.0795,
|
|
"eval_samples_per_second": 1619.108,
|
|
"eval_steps_per_second": 202.449,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 5.612295389175415,
|
|
"epoch": 9.321349312028406,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 5.6001515619198706e-05,
|
|
"loss": 4.7115,
|
|
"mean_token_accuracy": 0.25523230880498887,
|
|
"num_tokens": 21629181.0,
|
|
"step": 10505
|
|
},
|
|
{
|
|
"entropy": 5.606086778640747,
|
|
"epoch": 9.32578783843764,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 5.5922741990637034e-05,
|
|
"loss": 4.7603,
|
|
"mean_token_accuracy": 0.2468782424926758,
|
|
"num_tokens": 21638886.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 5.5680992603302,
|
|
"epoch": 9.33022636484687,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 5.584448186419936e-05,
|
|
"loss": 4.6864,
|
|
"mean_token_accuracy": 0.2610390529036522,
|
|
"num_tokens": 21649144.0,
|
|
"step": 10515
|
|
},
|
|
{
|
|
"entropy": 5.514496755599976,
|
|
"epoch": 9.334664891256104,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 5.57667354233221e-05,
|
|
"loss": 4.6743,
|
|
"mean_token_accuracy": 0.26080861389636995,
|
|
"num_tokens": 21658963.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 5.5711860179901125,
|
|
"epoch": 9.339103417665335,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.5689502850237505e-05,
|
|
"loss": 4.6843,
|
|
"mean_token_accuracy": 0.25015687197446823,
|
|
"num_tokens": 21668993.0,
|
|
"step": 10525
|
|
},
|
|
{
|
|
"entropy": 5.620013904571533,
|
|
"epoch": 9.343541944074568,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.561278432597357e-05,
|
|
"loss": 4.7476,
|
|
"mean_token_accuracy": 0.24753319174051286,
|
|
"num_tokens": 21679529.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 5.598373746871948,
|
|
"epoch": 9.3479804704838,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 5.5536580030353146e-05,
|
|
"loss": 4.7168,
|
|
"mean_token_accuracy": 0.2492371380329132,
|
|
"num_tokens": 21689303.0,
|
|
"step": 10535
|
|
},
|
|
{
|
|
"entropy": 5.578448867797851,
|
|
"epoch": 9.352418996893032,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.546089014199402e-05,
|
|
"loss": 4.6515,
|
|
"mean_token_accuracy": 0.25948324501514436,
|
|
"num_tokens": 21699529.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 5.575736236572266,
|
|
"epoch": 9.356857523302264,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.538571483830803e-05,
|
|
"loss": 4.6937,
|
|
"mean_token_accuracy": 0.25351267009973527,
|
|
"num_tokens": 21710548.0,
|
|
"step": 10545
|
|
},
|
|
{
|
|
"entropy": 5.587365198135376,
|
|
"epoch": 9.361296049711497,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 5.531105429550097e-05,
|
|
"loss": 4.7413,
|
|
"mean_token_accuracy": 0.24867594987154007,
|
|
"num_tokens": 21721149.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 5.54455943107605,
|
|
"epoch": 9.365734576120728,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.523690868857207e-05,
|
|
"loss": 4.6429,
|
|
"mean_token_accuracy": 0.25795337557792664,
|
|
"num_tokens": 21731321.0,
|
|
"step": 10555
|
|
},
|
|
{
|
|
"entropy": 5.619054508209229,
|
|
"epoch": 9.37017310252996,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.5163278191313566e-05,
|
|
"loss": 4.7264,
|
|
"mean_token_accuracy": 0.25097277760505676,
|
|
"num_tokens": 21741351.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 5.568988609313965,
|
|
"epoch": 9.374611628939192,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 5.509016297631029e-05,
|
|
"loss": 4.7468,
|
|
"mean_token_accuracy": 0.24569898396730422,
|
|
"num_tokens": 21752393.0,
|
|
"step": 10565
|
|
},
|
|
{
|
|
"entropy": 5.5395482063293455,
|
|
"epoch": 9.379050155348425,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 5.501756321493936e-05,
|
|
"loss": 4.7351,
|
|
"mean_token_accuracy": 0.24928926676511765,
|
|
"num_tokens": 21762366.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 5.649628829956055,
|
|
"epoch": 9.383488681757656,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 5.4945479077369575e-05,
|
|
"loss": 4.8206,
|
|
"mean_token_accuracy": 0.24700121134519576,
|
|
"num_tokens": 21773382.0,
|
|
"step": 10575
|
|
},
|
|
{
|
|
"entropy": 5.5670863628387455,
|
|
"epoch": 9.38792720816689,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.4873910732561314e-05,
|
|
"loss": 4.7203,
|
|
"mean_token_accuracy": 0.2545818164944649,
|
|
"num_tokens": 21784441.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 5.545032358169555,
|
|
"epoch": 9.39236573457612,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 5.480285834826585e-05,
|
|
"loss": 4.6587,
|
|
"mean_token_accuracy": 0.25672469586133956,
|
|
"num_tokens": 21793480.0,
|
|
"step": 10585
|
|
},
|
|
{
|
|
"entropy": 5.623483180999756,
|
|
"epoch": 9.396804260985354,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 5.473232209102508e-05,
|
|
"loss": 4.7293,
|
|
"mean_token_accuracy": 0.2471278727054596,
|
|
"num_tokens": 21803266.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 5.601286602020264,
|
|
"epoch": 9.401242787394585,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.466230212617122e-05,
|
|
"loss": 4.6865,
|
|
"mean_token_accuracy": 0.2611603170633316,
|
|
"num_tokens": 21812874.0,
|
|
"step": 10595
|
|
},
|
|
{
|
|
"entropy": 5.595543050765992,
|
|
"epoch": 9.405681313803818,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 5.4592798617826284e-05,
|
|
"loss": 4.781,
|
|
"mean_token_accuracy": 0.24761614203453064,
|
|
"num_tokens": 21823285.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 5.5608320236206055,
|
|
"epoch": 9.41011984021305,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 5.4523811728901705e-05,
|
|
"loss": 4.6773,
|
|
"mean_token_accuracy": 0.2523235365748405,
|
|
"num_tokens": 21832869.0,
|
|
"step": 10605
|
|
},
|
|
{
|
|
"entropy": 5.601332330703736,
|
|
"epoch": 9.41455836662228,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 5.4455341621098095e-05,
|
|
"loss": 4.8148,
|
|
"mean_token_accuracy": 0.24220670014619827,
|
|
"num_tokens": 21843891.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 5.561312818527222,
|
|
"epoch": 9.418996893031514,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 5.4387388454904656e-05,
|
|
"loss": 4.6662,
|
|
"mean_token_accuracy": 0.26319111585617067,
|
|
"num_tokens": 21853567.0,
|
|
"step": 10615
|
|
},
|
|
{
|
|
"entropy": 5.629105520248413,
|
|
"epoch": 9.423435419440747,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 5.4319952389599e-05,
|
|
"loss": 4.7319,
|
|
"mean_token_accuracy": 0.24853490591049193,
|
|
"num_tokens": 21864111.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 5.58112359046936,
|
|
"epoch": 9.427873945849978,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 5.4253033583246675e-05,
|
|
"loss": 4.7193,
|
|
"mean_token_accuracy": 0.25248041898012163,
|
|
"num_tokens": 21873187.0,
|
|
"step": 10625
|
|
},
|
|
{
|
|
"entropy": 5.54155330657959,
|
|
"epoch": 9.432312472259209,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.418663219270069e-05,
|
|
"loss": 4.6904,
|
|
"mean_token_accuracy": 0.262599316239357,
|
|
"num_tokens": 21883156.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 5.595254278182983,
|
|
"epoch": 9.436750998668442,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 5.412074837360148e-05,
|
|
"loss": 4.7854,
|
|
"mean_token_accuracy": 0.24465038031339645,
|
|
"num_tokens": 21895381.0,
|
|
"step": 10635
|
|
},
|
|
{
|
|
"entropy": 5.626121950149536,
|
|
"epoch": 9.441189525077673,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 5.4055382280376195e-05,
|
|
"loss": 4.7876,
|
|
"mean_token_accuracy": 0.24533421248197557,
|
|
"num_tokens": 21906482.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 5.6155046939849855,
|
|
"epoch": 9.445628051486906,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 5.399053406623843e-05,
|
|
"loss": 4.7546,
|
|
"mean_token_accuracy": 0.2444614812731743,
|
|
"num_tokens": 21916964.0,
|
|
"step": 10645
|
|
},
|
|
{
|
|
"entropy": 5.638181972503662,
|
|
"epoch": 9.450066577896138,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 5.392620388318803e-05,
|
|
"loss": 4.6817,
|
|
"mean_token_accuracy": 0.26017231196165086,
|
|
"num_tokens": 21927131.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 5.564279460906983,
|
|
"epoch": 9.45450510430537,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 5.386239188201052e-05,
|
|
"loss": 4.6575,
|
|
"mean_token_accuracy": 0.26284138560295106,
|
|
"num_tokens": 21937480.0,
|
|
"step": 10655
|
|
},
|
|
{
|
|
"entropy": 5.613448905944824,
|
|
"epoch": 9.458943630714602,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 5.379909821227688e-05,
|
|
"loss": 4.7726,
|
|
"mean_token_accuracy": 0.24933940172195435,
|
|
"num_tokens": 21947713.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 5.6507172107696535,
|
|
"epoch": 9.463382157123835,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 5.373632302234314e-05,
|
|
"loss": 4.7654,
|
|
"mean_token_accuracy": 0.24434418827295304,
|
|
"num_tokens": 21957374.0,
|
|
"step": 10665
|
|
},
|
|
{
|
|
"entropy": 5.608902454376221,
|
|
"epoch": 9.467820683533066,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 5.3674066459350035e-05,
|
|
"loss": 4.806,
|
|
"mean_token_accuracy": 0.24420345723628997,
|
|
"num_tokens": 21968442.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 5.606340169906616,
|
|
"epoch": 9.4722592099423,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.3612328669222746e-05,
|
|
"loss": 4.7668,
|
|
"mean_token_accuracy": 0.24997528791427612,
|
|
"num_tokens": 21979115.0,
|
|
"step": 10675
|
|
},
|
|
{
|
|
"entropy": 5.5612959384918215,
|
|
"epoch": 9.47669773635153,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 5.3551109796670416e-05,
|
|
"loss": 4.7038,
|
|
"mean_token_accuracy": 0.25177205055952073,
|
|
"num_tokens": 21988876.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 5.537668085098266,
|
|
"epoch": 9.481136262760764,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 5.349040998518589e-05,
|
|
"loss": 4.6908,
|
|
"mean_token_accuracy": 0.2579268977046013,
|
|
"num_tokens": 21998582.0,
|
|
"step": 10685
|
|
},
|
|
{
|
|
"entropy": 5.518413257598877,
|
|
"epoch": 9.485574789169995,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.34302293770454e-05,
|
|
"loss": 4.6711,
|
|
"mean_token_accuracy": 0.2571806490421295,
|
|
"num_tokens": 22008569.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 5.555644464492798,
|
|
"epoch": 9.490013315579228,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.337056811330812e-05,
|
|
"loss": 4.7228,
|
|
"mean_token_accuracy": 0.25779859274625777,
|
|
"num_tokens": 22018823.0,
|
|
"step": 10695
|
|
},
|
|
{
|
|
"entropy": 5.619304037094116,
|
|
"epoch": 9.49445184198846,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 5.331142633381604e-05,
|
|
"loss": 4.7794,
|
|
"mean_token_accuracy": 0.24225648492574692,
|
|
"num_tokens": 22029910.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 5.605983066558838,
|
|
"epoch": 9.498890368397692,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.3252804177193415e-05,
|
|
"loss": 4.7467,
|
|
"mean_token_accuracy": 0.2460011884570122,
|
|
"num_tokens": 22040121.0,
|
|
"step": 10705
|
|
},
|
|
{
|
|
"entropy": 5.597764539718628,
|
|
"epoch": 9.503328894806923,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.319470178084658e-05,
|
|
"loss": 4.7491,
|
|
"mean_token_accuracy": 0.24634174704551698,
|
|
"num_tokens": 22051135.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 5.566795492172242,
|
|
"epoch": 9.507767421216156,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 5.31371192809636e-05,
|
|
"loss": 4.7511,
|
|
"mean_token_accuracy": 0.2501747578382492,
|
|
"num_tokens": 22061310.0,
|
|
"step": 10715
|
|
},
|
|
{
|
|
"entropy": 5.545968008041382,
|
|
"epoch": 9.512205947625388,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 5.308005681251392e-05,
|
|
"loss": 4.7361,
|
|
"mean_token_accuracy": 0.2475030854344368,
|
|
"num_tokens": 22071551.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 5.546762466430664,
|
|
"epoch": 9.51664447403462,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 5.302351450924803e-05,
|
|
"loss": 4.65,
|
|
"mean_token_accuracy": 0.2569732666015625,
|
|
"num_tokens": 22082915.0,
|
|
"step": 10725
|
|
},
|
|
{
|
|
"entropy": 5.583299064636231,
|
|
"epoch": 9.521083000443852,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.2967492503697285e-05,
|
|
"loss": 4.7091,
|
|
"mean_token_accuracy": 0.24854396730661393,
|
|
"num_tokens": 22092209.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 5.614784669876099,
|
|
"epoch": 9.525521526853085,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 5.291199092717338e-05,
|
|
"loss": 4.727,
|
|
"mean_token_accuracy": 0.25229128897190095,
|
|
"num_tokens": 22101998.0,
|
|
"step": 10735
|
|
},
|
|
{
|
|
"entropy": 5.6048524379730225,
|
|
"epoch": 9.529960053262316,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 5.285700990976824e-05,
|
|
"loss": 4.8115,
|
|
"mean_token_accuracy": 0.23919014483690262,
|
|
"num_tokens": 22112382.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 5.589371395111084,
|
|
"epoch": 9.53439857967155,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 5.2802549580353625e-05,
|
|
"loss": 4.7339,
|
|
"mean_token_accuracy": 0.25364048033952713,
|
|
"num_tokens": 22122378.0,
|
|
"step": 10745
|
|
},
|
|
{
|
|
"entropy": 5.591985464096069,
|
|
"epoch": 9.53883710608078,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.27486100665808e-05,
|
|
"loss": 4.6951,
|
|
"mean_token_accuracy": 0.2594953551888466,
|
|
"num_tokens": 22131995.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 5.6061185836792,
|
|
"epoch": 9.543275632490014,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 5.2695191494880347e-05,
|
|
"loss": 4.6837,
|
|
"mean_token_accuracy": 0.2558481156826019,
|
|
"num_tokens": 22141638.0,
|
|
"step": 10755
|
|
},
|
|
{
|
|
"entropy": 5.553796434402466,
|
|
"epoch": 9.547714158899245,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 5.26422939904617e-05,
|
|
"loss": 4.6676,
|
|
"mean_token_accuracy": 0.2564620032906532,
|
|
"num_tokens": 22150888.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 5.568976497650146,
|
|
"epoch": 9.552152685308478,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 5.258991767731302e-05,
|
|
"loss": 4.6959,
|
|
"mean_token_accuracy": 0.2527426972985268,
|
|
"num_tokens": 22161645.0,
|
|
"step": 10765
|
|
},
|
|
{
|
|
"entropy": 5.581752157211303,
|
|
"epoch": 9.55659121171771,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 5.2538062678200796e-05,
|
|
"loss": 4.7335,
|
|
"mean_token_accuracy": 0.24978428930044175,
|
|
"num_tokens": 22172287.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 5.530632734298706,
|
|
"epoch": 9.561029738126942,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.248672911466959e-05,
|
|
"loss": 4.6622,
|
|
"mean_token_accuracy": 0.25910936295986176,
|
|
"num_tokens": 22182298.0,
|
|
"step": 10775
|
|
},
|
|
{
|
|
"entropy": 5.620260095596313,
|
|
"epoch": 9.565468264536173,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.243591710704181e-05,
|
|
"loss": 4.7555,
|
|
"mean_token_accuracy": 0.24761541336774825,
|
|
"num_tokens": 22191703.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 5.6352344989776615,
|
|
"epoch": 9.569906790945407,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 5.238562677441731e-05,
|
|
"loss": 4.7341,
|
|
"mean_token_accuracy": 0.2561090365052223,
|
|
"num_tokens": 22202143.0,
|
|
"step": 10785
|
|
},
|
|
{
|
|
"entropy": 5.6108777046203615,
|
|
"epoch": 9.574345317354638,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.233585823467314e-05,
|
|
"loss": 4.7384,
|
|
"mean_token_accuracy": 0.24401030093431472,
|
|
"num_tokens": 22212234.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 5.621181631088257,
|
|
"epoch": 9.57878384376387,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 5.2286611604463445e-05,
|
|
"loss": 4.7712,
|
|
"mean_token_accuracy": 0.24685394316911696,
|
|
"num_tokens": 22224207.0,
|
|
"step": 10795
|
|
},
|
|
{
|
|
"entropy": 5.551716470718384,
|
|
"epoch": 9.583222370173102,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.223788699921892e-05,
|
|
"loss": 4.6655,
|
|
"mean_token_accuracy": 0.2581934481859207,
|
|
"num_tokens": 22234999.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 5.569052219390869,
|
|
"epoch": 9.587660896582335,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 5.2189684533146676e-05,
|
|
"loss": 4.671,
|
|
"mean_token_accuracy": 0.2569624289870262,
|
|
"num_tokens": 22245503.0,
|
|
"step": 10805
|
|
},
|
|
{
|
|
"entropy": 5.629954671859741,
|
|
"epoch": 9.592099422991566,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.2142004319230076e-05,
|
|
"loss": 4.8221,
|
|
"mean_token_accuracy": 0.23989968448877336,
|
|
"num_tokens": 22255580.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 5.559308433532715,
|
|
"epoch": 9.5965379494008,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 5.209484646922822e-05,
|
|
"loss": 4.7055,
|
|
"mean_token_accuracy": 0.24906722009181975,
|
|
"num_tokens": 22265896.0,
|
|
"step": 10815
|
|
},
|
|
{
|
|
"entropy": 5.573928308486939,
|
|
"epoch": 9.60097647581003,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 5.204821109367592e-05,
|
|
"loss": 4.7579,
|
|
"mean_token_accuracy": 0.25319531559944153,
|
|
"num_tokens": 22276014.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 5.59938645362854,
|
|
"epoch": 9.605415002219264,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.2002098301883284e-05,
|
|
"loss": 4.7444,
|
|
"mean_token_accuracy": 0.24580765664577484,
|
|
"num_tokens": 22286619.0,
|
|
"step": 10825
|
|
},
|
|
{
|
|
"entropy": 5.53187575340271,
|
|
"epoch": 9.609853528628495,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 5.195650820193557e-05,
|
|
"loss": 4.7439,
|
|
"mean_token_accuracy": 0.2511479392647743,
|
|
"num_tokens": 22296942.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 5.5759459972381595,
|
|
"epoch": 9.614292055037728,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 5.191144090069284e-05,
|
|
"loss": 4.7436,
|
|
"mean_token_accuracy": 0.2565228849649429,
|
|
"num_tokens": 22307611.0,
|
|
"step": 10835
|
|
},
|
|
{
|
|
"entropy": 5.628077411651612,
|
|
"epoch": 9.61873058144696,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 5.186689650378977e-05,
|
|
"loss": 4.8117,
|
|
"mean_token_accuracy": 0.24138310551643372,
|
|
"num_tokens": 22318114.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 5.6219971656799315,
|
|
"epoch": 9.623169107856192,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 5.182287511563538e-05,
|
|
"loss": 4.7871,
|
|
"mean_token_accuracy": 0.24422207623720169,
|
|
"num_tokens": 22328232.0,
|
|
"step": 10845
|
|
},
|
|
{
|
|
"entropy": 5.5955873966217045,
|
|
"epoch": 9.627607634265424,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 5.177937683941284e-05,
|
|
"loss": 4.6813,
|
|
"mean_token_accuracy": 0.2631091594696045,
|
|
"num_tokens": 22337546.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 5.619602012634277,
|
|
"epoch": 9.632046160674657,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 5.173640177707909e-05,
|
|
"loss": 4.8234,
|
|
"mean_token_accuracy": 0.2461318016052246,
|
|
"num_tokens": 22349007.0,
|
|
"step": 10855
|
|
},
|
|
{
|
|
"entropy": 5.623139572143555,
|
|
"epoch": 9.636484687083888,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 5.169395002936473e-05,
|
|
"loss": 4.7582,
|
|
"mean_token_accuracy": 0.25169286131858826,
|
|
"num_tokens": 22359361.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 5.595722818374634,
|
|
"epoch": 9.64092321349312,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.165202169577381e-05,
|
|
"loss": 4.7376,
|
|
"mean_token_accuracy": 0.2519330456852913,
|
|
"num_tokens": 22369302.0,
|
|
"step": 10865
|
|
},
|
|
{
|
|
"entropy": 5.588696432113648,
|
|
"epoch": 9.645361739902352,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 5.1610616874583426e-05,
|
|
"loss": 4.7431,
|
|
"mean_token_accuracy": 0.25177302658557893,
|
|
"num_tokens": 22379544.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 5.700624275207519,
|
|
"epoch": 9.649800266311585,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 5.156973566284366e-05,
|
|
"loss": 4.8225,
|
|
"mean_token_accuracy": 0.2428364038467407,
|
|
"num_tokens": 22390523.0,
|
|
"step": 10875
|
|
},
|
|
{
|
|
"entropy": 5.629448080062867,
|
|
"epoch": 9.654238792720816,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 5.152937815637731e-05,
|
|
"loss": 4.7757,
|
|
"mean_token_accuracy": 0.2473833978176117,
|
|
"num_tokens": 22399815.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 5.629021406173706,
|
|
"epoch": 9.65867731913005,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 5.148954444977957e-05,
|
|
"loss": 4.7668,
|
|
"mean_token_accuracy": 0.24442552030086517,
|
|
"num_tokens": 22410578.0,
|
|
"step": 10885
|
|
},
|
|
{
|
|
"entropy": 5.568861865997315,
|
|
"epoch": 9.66311584553928,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 5.145023463641798e-05,
|
|
"loss": 4.7059,
|
|
"mean_token_accuracy": 0.24693001061677933,
|
|
"num_tokens": 22420523.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 5.596695804595948,
|
|
"epoch": 9.667554371948514,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 5.141144880843202e-05,
|
|
"loss": 4.7373,
|
|
"mean_token_accuracy": 0.2500020623207092,
|
|
"num_tokens": 22430578.0,
|
|
"step": 10895
|
|
},
|
|
{
|
|
"entropy": 5.505984449386597,
|
|
"epoch": 9.671992898357745,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 5.137318705673301e-05,
|
|
"loss": 4.6315,
|
|
"mean_token_accuracy": 0.2600592151284218,
|
|
"num_tokens": 22440190.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 5.608639907836914,
|
|
"epoch": 9.676431424766978,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.133544947100392e-05,
|
|
"loss": 4.7072,
|
|
"mean_token_accuracy": 0.258477059006691,
|
|
"num_tokens": 22450701.0,
|
|
"step": 10905
|
|
},
|
|
{
|
|
"entropy": 5.579621982574463,
|
|
"epoch": 9.68086995117621,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 5.129823613969904e-05,
|
|
"loss": 4.6887,
|
|
"mean_token_accuracy": 0.25758892148733137,
|
|
"num_tokens": 22461132.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 5.628561878204346,
|
|
"epoch": 9.685308477585442,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.126154715004389e-05,
|
|
"loss": 4.761,
|
|
"mean_token_accuracy": 0.248402239382267,
|
|
"num_tokens": 22472667.0,
|
|
"step": 10915
|
|
},
|
|
{
|
|
"entropy": 5.598708009719848,
|
|
"epoch": 9.689747003994674,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.122538258803494e-05,
|
|
"loss": 4.7774,
|
|
"mean_token_accuracy": 0.24931755661964417,
|
|
"num_tokens": 22483099.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 5.589997577667236,
|
|
"epoch": 9.694185530403907,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 5.118974253843948e-05,
|
|
"loss": 4.6876,
|
|
"mean_token_accuracy": 0.2570286825299263,
|
|
"num_tokens": 22493485.0,
|
|
"step": 10925
|
|
},
|
|
{
|
|
"entropy": 5.639008855819702,
|
|
"epoch": 9.698624056813138,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 5.115462708479533e-05,
|
|
"loss": 4.785,
|
|
"mean_token_accuracy": 0.23565338999032975,
|
|
"num_tokens": 22503119.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 5.57471079826355,
|
|
"epoch": 9.703062583222371,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 5.112003630941073e-05,
|
|
"loss": 4.6963,
|
|
"mean_token_accuracy": 0.2526188686490059,
|
|
"num_tokens": 22513041.0,
|
|
"step": 10935
|
|
},
|
|
{
|
|
"entropy": 5.575444746017456,
|
|
"epoch": 9.707501109631602,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.108597029336407e-05,
|
|
"loss": 4.696,
|
|
"mean_token_accuracy": 0.25091323107481,
|
|
"num_tokens": 22524786.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 5.584777450561523,
|
|
"epoch": 9.711939636040835,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 5.105242911650378e-05,
|
|
"loss": 4.6808,
|
|
"mean_token_accuracy": 0.2551630511879921,
|
|
"num_tokens": 22535369.0,
|
|
"step": 10945
|
|
},
|
|
{
|
|
"entropy": 5.573048639297485,
|
|
"epoch": 9.716378162450066,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 5.1019412857448086e-05,
|
|
"loss": 4.7046,
|
|
"mean_token_accuracy": 0.25896392911672594,
|
|
"num_tokens": 22545841.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 5.5534779071807865,
|
|
"epoch": 9.7208166888593,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.098692159358484e-05,
|
|
"loss": 4.7499,
|
|
"mean_token_accuracy": 0.24127935320138932,
|
|
"num_tokens": 22555673.0,
|
|
"step": 10955
|
|
},
|
|
{
|
|
"entropy": 5.596746301651001,
|
|
"epoch": 9.72525521526853,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.095495540107134e-05,
|
|
"loss": 4.7187,
|
|
"mean_token_accuracy": 0.24160663187503814,
|
|
"num_tokens": 22565422.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 5.6120342254638675,
|
|
"epoch": 9.729693741677764,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 5.092351435483418e-05,
|
|
"loss": 4.8337,
|
|
"mean_token_accuracy": 0.23918654769659042,
|
|
"num_tokens": 22576005.0,
|
|
"step": 10965
|
|
},
|
|
{
|
|
"entropy": 5.619411325454712,
|
|
"epoch": 9.734132268086995,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 5.0892598528569006e-05,
|
|
"loss": 4.7993,
|
|
"mean_token_accuracy": 0.24092330932617187,
|
|
"num_tokens": 22587047.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 5.526518630981445,
|
|
"epoch": 9.738570794496226,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.086220799474039e-05,
|
|
"loss": 4.6441,
|
|
"mean_token_accuracy": 0.2667004883289337,
|
|
"num_tokens": 22597080.0,
|
|
"step": 10975
|
|
},
|
|
{
|
|
"entropy": 5.547692060470581,
|
|
"epoch": 9.74300932090546,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 5.083234282458168e-05,
|
|
"loss": 4.7622,
|
|
"mean_token_accuracy": 0.25101588666439056,
|
|
"num_tokens": 22607338.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 5.637822580337525,
|
|
"epoch": 9.747447847314692,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.0803003088094824e-05,
|
|
"loss": 4.7437,
|
|
"mean_token_accuracy": 0.24827832579612732,
|
|
"num_tokens": 22617628.0,
|
|
"step": 10985
|
|
},
|
|
{
|
|
"entropy": 5.620887804031372,
|
|
"epoch": 9.751886373723924,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 5.07741888540501e-05,
|
|
"loss": 4.7857,
|
|
"mean_token_accuracy": 0.2416316509246826,
|
|
"num_tokens": 22627599.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 5.613753366470337,
|
|
"epoch": 9.756324900133155,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 5.074590018998614e-05,
|
|
"loss": 4.7747,
|
|
"mean_token_accuracy": 0.24558381885290145,
|
|
"num_tokens": 22637685.0,
|
|
"step": 10995
|
|
},
|
|
{
|
|
"entropy": 5.634680557250976,
|
|
"epoch": 9.760763426542388,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 5.0718137162209655e-05,
|
|
"loss": 4.7323,
|
|
"mean_token_accuracy": 0.245318903028965,
|
|
"num_tokens": 22646658.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"epoch": 9.760763426542388,
|
|
"eval_entropy": 5.424538399431315,
|
|
"eval_loss": 5.772741317749023,
|
|
"eval_mean_token_accuracy": 0.18170263766888484,
|
|
"eval_num_tokens": 22646658.0,
|
|
"eval_runtime": 2.2798,
|
|
"eval_samples_per_second": 1476.867,
|
|
"eval_steps_per_second": 184.663,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 5.593730354309082,
|
|
"epoch": 9.765201952951621,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 5.069089983579523e-05,
|
|
"loss": 4.7158,
|
|
"mean_token_accuracy": 0.25342212319374086,
|
|
"num_tokens": 22657488.0,
|
|
"step": 11005
|
|
},
|
|
{
|
|
"entropy": 5.625090551376343,
|
|
"epoch": 9.769640479360852,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 5.0664188274585356e-05,
|
|
"loss": 4.775,
|
|
"mean_token_accuracy": 0.24792626351118088,
|
|
"num_tokens": 22666377.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 5.634574890136719,
|
|
"epoch": 9.774079005770083,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 5.063800254119007e-05,
|
|
"loss": 4.7661,
|
|
"mean_token_accuracy": 0.24515058994293212,
|
|
"num_tokens": 22676370.0,
|
|
"step": 11015
|
|
},
|
|
{
|
|
"entropy": 5.551168394088745,
|
|
"epoch": 9.778517532179317,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 5.0612342696986954e-05,
|
|
"loss": 4.692,
|
|
"mean_token_accuracy": 0.25683009177446364,
|
|
"num_tokens": 22686353.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 5.573161220550537,
|
|
"epoch": 9.782956058588548,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 5.058720880212095e-05,
|
|
"loss": 4.7274,
|
|
"mean_token_accuracy": 0.24562746584415435,
|
|
"num_tokens": 22697444.0,
|
|
"step": 11025
|
|
},
|
|
{
|
|
"entropy": 5.638763523101806,
|
|
"epoch": 9.78739458499778,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 5.0562600915504146e-05,
|
|
"loss": 4.7872,
|
|
"mean_token_accuracy": 0.24680910855531693,
|
|
"num_tokens": 22708522.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 5.619208431243896,
|
|
"epoch": 9.791833111407012,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.053851909481579e-05,
|
|
"loss": 4.7888,
|
|
"mean_token_accuracy": 0.2448167771100998,
|
|
"num_tokens": 22718214.0,
|
|
"step": 11035
|
|
},
|
|
{
|
|
"entropy": 5.568363094329834,
|
|
"epoch": 9.796271637816245,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 5.0514963396501996e-05,
|
|
"loss": 4.7059,
|
|
"mean_token_accuracy": 0.2517767667770386,
|
|
"num_tokens": 22727961.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 5.594292068481446,
|
|
"epoch": 9.800710164225476,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 5.049193387577574e-05,
|
|
"loss": 4.7693,
|
|
"mean_token_accuracy": 0.25163354575634,
|
|
"num_tokens": 22738328.0,
|
|
"step": 11045
|
|
},
|
|
{
|
|
"entropy": 5.606991100311279,
|
|
"epoch": 9.80514869063471,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 5.0469430586616595e-05,
|
|
"loss": 4.7338,
|
|
"mean_token_accuracy": 0.24495653957128524,
|
|
"num_tokens": 22748787.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 5.618829345703125,
|
|
"epoch": 9.80958721704394,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 5.0447453581770776e-05,
|
|
"loss": 4.724,
|
|
"mean_token_accuracy": 0.24702285826206208,
|
|
"num_tokens": 22759747.0,
|
|
"step": 11055
|
|
},
|
|
{
|
|
"entropy": 5.596460390090942,
|
|
"epoch": 9.814025743453174,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 5.0426002912750886e-05,
|
|
"loss": 4.6391,
|
|
"mean_token_accuracy": 0.2560017928481102,
|
|
"num_tokens": 22769634.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 5.604701852798462,
|
|
"epoch": 9.818464269862405,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.04050786298358e-05,
|
|
"loss": 4.7575,
|
|
"mean_token_accuracy": 0.2550246357917786,
|
|
"num_tokens": 22779181.0,
|
|
"step": 11065
|
|
},
|
|
{
|
|
"entropy": 5.602218723297119,
|
|
"epoch": 9.822902796271638,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.0384680782070613e-05,
|
|
"loss": 4.7241,
|
|
"mean_token_accuracy": 0.24959044605493547,
|
|
"num_tokens": 22789957.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 5.607069253921509,
|
|
"epoch": 9.82734132268087,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 5.0364809417266476e-05,
|
|
"loss": 4.6642,
|
|
"mean_token_accuracy": 0.2538582026958466,
|
|
"num_tokens": 22799183.0,
|
|
"step": 11075
|
|
},
|
|
{
|
|
"entropy": 5.604412031173706,
|
|
"epoch": 9.831779849090102,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 5.034546458200056e-05,
|
|
"loss": 4.7508,
|
|
"mean_token_accuracy": 0.24396117627620698,
|
|
"num_tokens": 22809712.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 5.600497627258301,
|
|
"epoch": 9.836218375499334,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.032664632161577e-05,
|
|
"loss": 4.7672,
|
|
"mean_token_accuracy": 0.24642891585826873,
|
|
"num_tokens": 22821253.0,
|
|
"step": 11085
|
|
},
|
|
{
|
|
"entropy": 5.538465976715088,
|
|
"epoch": 9.840656901908567,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 5.0308354680220896e-05,
|
|
"loss": 4.6057,
|
|
"mean_token_accuracy": 0.25864298492670057,
|
|
"num_tokens": 22831862.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 5.596806526184082,
|
|
"epoch": 9.845095428317798,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 5.029058970069021e-05,
|
|
"loss": 4.8317,
|
|
"mean_token_accuracy": 0.23708509653806686,
|
|
"num_tokens": 22841618.0,
|
|
"step": 11095
|
|
},
|
|
{
|
|
"entropy": 5.599494075775146,
|
|
"epoch": 9.84953395472703,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 5.0273351424663686e-05,
|
|
"loss": 4.8031,
|
|
"mean_token_accuracy": 0.24399064779281615,
|
|
"num_tokens": 22851390.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 5.61898398399353,
|
|
"epoch": 9.853972481136262,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 5.025663989254663e-05,
|
|
"loss": 4.7286,
|
|
"mean_token_accuracy": 0.2509080842137337,
|
|
"num_tokens": 22861351.0,
|
|
"step": 11105
|
|
},
|
|
{
|
|
"entropy": 5.5476585865020756,
|
|
"epoch": 9.858411007545495,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.0240455143509734e-05,
|
|
"loss": 4.6599,
|
|
"mean_token_accuracy": 0.2564140856266022,
|
|
"num_tokens": 22870714.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 5.601348161697388,
|
|
"epoch": 9.862849533954726,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 5.022479721548895e-05,
|
|
"loss": 4.7485,
|
|
"mean_token_accuracy": 0.24796415418386458,
|
|
"num_tokens": 22880896.0,
|
|
"step": 11115
|
|
},
|
|
{
|
|
"entropy": 5.603586196899414,
|
|
"epoch": 9.86728806036396,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 5.0209666145185366e-05,
|
|
"loss": 4.7807,
|
|
"mean_token_accuracy": 0.24908716678619386,
|
|
"num_tokens": 22892149.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 5.596175670623779,
|
|
"epoch": 9.87172658677319,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 5.019506196806521e-05,
|
|
"loss": 4.7024,
|
|
"mean_token_accuracy": 0.25063668489456176,
|
|
"num_tokens": 22903558.0,
|
|
"step": 11125
|
|
},
|
|
{
|
|
"entropy": 5.544181489944458,
|
|
"epoch": 9.876165113182424,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.018098471835966e-05,
|
|
"loss": 4.7287,
|
|
"mean_token_accuracy": 0.2562645718455315,
|
|
"num_tokens": 22914004.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 5.544908237457276,
|
|
"epoch": 9.880603639591655,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 5.016743442906484e-05,
|
|
"loss": 4.6243,
|
|
"mean_token_accuracy": 0.26578269004821775,
|
|
"num_tokens": 22923185.0,
|
|
"step": 11135
|
|
},
|
|
{
|
|
"entropy": 5.601456165313721,
|
|
"epoch": 9.885042166000888,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 5.0154411131941704e-05,
|
|
"loss": 4.7764,
|
|
"mean_token_accuracy": 0.24665402472019196,
|
|
"num_tokens": 22933132.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 5.583887243270874,
|
|
"epoch": 9.88948069241012,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 5.014191485751594e-05,
|
|
"loss": 4.7076,
|
|
"mean_token_accuracy": 0.24674847722053528,
|
|
"num_tokens": 22942819.0,
|
|
"step": 11145
|
|
},
|
|
{
|
|
"entropy": 5.612498092651367,
|
|
"epoch": 9.893919218819352,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 5.0129945635077995e-05,
|
|
"loss": 4.7882,
|
|
"mean_token_accuracy": 0.24903185218572615,
|
|
"num_tokens": 22954323.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 5.5512079238891605,
|
|
"epoch": 9.898357745228584,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.011850349268288e-05,
|
|
"loss": 4.6844,
|
|
"mean_token_accuracy": 0.2590100601315498,
|
|
"num_tokens": 22964415.0,
|
|
"step": 11155
|
|
},
|
|
{
|
|
"entropy": 5.543228340148926,
|
|
"epoch": 9.902796271637817,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 5.0107588457150216e-05,
|
|
"loss": 4.7145,
|
|
"mean_token_accuracy": 0.25771168023347857,
|
|
"num_tokens": 22974050.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 5.613619470596314,
|
|
"epoch": 9.907234798047048,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 5.00972005540641e-05,
|
|
"loss": 4.7615,
|
|
"mean_token_accuracy": 0.24506556689739228,
|
|
"num_tokens": 22984609.0,
|
|
"step": 11165
|
|
},
|
|
{
|
|
"entropy": 5.554394054412842,
|
|
"epoch": 9.911673324456281,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 5.008733980777305e-05,
|
|
"loss": 4.6956,
|
|
"mean_token_accuracy": 0.25476562082767484,
|
|
"num_tokens": 22994485.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 5.635476541519165,
|
|
"epoch": 9.916111850865512,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 5.007800624138999e-05,
|
|
"loss": 4.82,
|
|
"mean_token_accuracy": 0.24267265498638152,
|
|
"num_tokens": 23006457.0,
|
|
"step": 11175
|
|
},
|
|
{
|
|
"entropy": 5.604471874237061,
|
|
"epoch": 9.920550377274745,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 5.00691998767922e-05,
|
|
"loss": 4.7666,
|
|
"mean_token_accuracy": 0.24232983589172363,
|
|
"num_tokens": 23016414.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 5.579199981689453,
|
|
"epoch": 9.924988903683976,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 5.006092073462112e-05,
|
|
"loss": 4.7471,
|
|
"mean_token_accuracy": 0.25086646229028703,
|
|
"num_tokens": 23026744.0,
|
|
"step": 11185
|
|
},
|
|
{
|
|
"entropy": 5.488195085525513,
|
|
"epoch": 9.92942743009321,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 5.0053168834282556e-05,
|
|
"loss": 4.6239,
|
|
"mean_token_accuracy": 0.2690026223659515,
|
|
"num_tokens": 23036344.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 5.633797693252563,
|
|
"epoch": 9.93386595650244,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 5.00459441939464e-05,
|
|
"loss": 4.8254,
|
|
"mean_token_accuracy": 0.24292940497398377,
|
|
"num_tokens": 23047241.0,
|
|
"step": 11195
|
|
},
|
|
{
|
|
"entropy": 5.593798017501831,
|
|
"epoch": 9.938304482911674,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 5.003924683054674e-05,
|
|
"loss": 4.7408,
|
|
"mean_token_accuracy": 0.25180465579032896,
|
|
"num_tokens": 23057532.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 5.57158055305481,
|
|
"epoch": 9.942743009320905,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.0033076759781725e-05,
|
|
"loss": 4.6931,
|
|
"mean_token_accuracy": 0.2530891001224518,
|
|
"num_tokens": 23067799.0,
|
|
"step": 11205
|
|
},
|
|
{
|
|
"entropy": 5.631787586212158,
|
|
"epoch": 9.947181535730138,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 5.002743399611358e-05,
|
|
"loss": 4.7735,
|
|
"mean_token_accuracy": 0.24685444086790084,
|
|
"num_tokens": 23077910.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 5.572078132629395,
|
|
"epoch": 9.95162006213937,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 5.0022318552768565e-05,
|
|
"loss": 4.6716,
|
|
"mean_token_accuracy": 0.2553743064403534,
|
|
"num_tokens": 23086967.0,
|
|
"step": 11215
|
|
},
|
|
{
|
|
"entropy": 5.560754108428955,
|
|
"epoch": 9.956058588548602,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 5.001773044173691e-05,
|
|
"loss": 4.6996,
|
|
"mean_token_accuracy": 0.2497991919517517,
|
|
"num_tokens": 23096097.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 5.597431230545044,
|
|
"epoch": 9.960497114957834,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 5.0013669673772826e-05,
|
|
"loss": 4.685,
|
|
"mean_token_accuracy": 0.2584192931652069,
|
|
"num_tokens": 23105852.0,
|
|
"step": 11225
|
|
},
|
|
{
|
|
"entropy": 5.5533127784729,
|
|
"epoch": 9.964935641367067,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.001013625839454e-05,
|
|
"loss": 4.6843,
|
|
"mean_token_accuracy": 0.2577719181776047,
|
|
"num_tokens": 23116690.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 5.548858976364135,
|
|
"epoch": 9.969374167776298,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 5.000713020388405e-05,
|
|
"loss": 4.6925,
|
|
"mean_token_accuracy": 0.2506492272019386,
|
|
"num_tokens": 23127160.0,
|
|
"step": 11235
|
|
},
|
|
{
|
|
"entropy": 5.559906053543091,
|
|
"epoch": 9.973812694185531,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.00046515172874e-05,
|
|
"loss": 4.7243,
|
|
"mean_token_accuracy": 0.2504351645708084,
|
|
"num_tokens": 23137600.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 5.626404905319214,
|
|
"epoch": 9.978251220594762,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 5.000270020441444e-05,
|
|
"loss": 4.7744,
|
|
"mean_token_accuracy": 0.24536895751953125,
|
|
"num_tokens": 23147053.0,
|
|
"step": 11245
|
|
},
|
|
{
|
|
"entropy": 5.556606578826904,
|
|
"epoch": 9.982689747003995,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 5.000127626983894e-05,
|
|
"loss": 4.6658,
|
|
"mean_token_accuracy": 0.26524037718772886,
|
|
"num_tokens": 23157445.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 5.574942636489868,
|
|
"epoch": 9.987128273413227,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 5.000037971689848e-05,
|
|
"loss": 4.7572,
|
|
"mean_token_accuracy": 0.248799467086792,
|
|
"num_tokens": 23168108.0,
|
|
"step": 11255
|
|
},
|
|
{
|
|
"entropy": 5.645563745498658,
|
|
"epoch": 9.99156679982246,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 5.000001054769452e-05,
|
|
"loss": 4.8283,
|
|
"mean_token_accuracy": 0.24510107338428497,
|
|
"num_tokens": 23178134.0,
|
|
"step": 11260
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 11260,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 5212775660451840.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|