20255 lines
554 KiB
JSON
20255 lines
554 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 8.873501997336884,
|
|
"eval_steps": 500,
|
|
"global_step": 10000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.692031192779542,
|
|
"epoch": 0.004438526409232135,
|
|
"grad_norm": 14.75,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8207,
|
|
"mean_token_accuracy": 0.000128369708545506,
|
|
"num_tokens": 9810.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691952133178711,
|
|
"epoch": 0.00887705281846427,
|
|
"grad_norm": 12.9375,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7613,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 20538.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.690592384338379,
|
|
"epoch": 0.013315579227696404,
|
|
"grad_norm": 9.9375,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.5054,
|
|
"mean_token_accuracy": 0.03474730136804283,
|
|
"num_tokens": 30258.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.66368646621704,
|
|
"epoch": 0.01775410563692854,
|
|
"grad_norm": 5.875,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1947,
|
|
"mean_token_accuracy": 0.04976645708084106,
|
|
"num_tokens": 41249.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.518089294433594,
|
|
"epoch": 0.022192632046160676,
|
|
"grad_norm": 3.609375,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.9,
|
|
"mean_token_accuracy": 0.053335465490818024,
|
|
"num_tokens": 51738.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.489847755432129,
|
|
"epoch": 0.02663115845539281,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.8161,
|
|
"mean_token_accuracy": 0.05364362597465515,
|
|
"num_tokens": 62920.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.506165885925293,
|
|
"epoch": 0.031069684864624945,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.7103,
|
|
"mean_token_accuracy": 0.05455525256693363,
|
|
"num_tokens": 73163.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.478147506713867,
|
|
"epoch": 0.03550821127385708,
|
|
"grad_norm": 2.40625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.682,
|
|
"mean_token_accuracy": 0.05231944099068642,
|
|
"num_tokens": 84180.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.461441326141358,
|
|
"epoch": 0.03994673768308921,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.6388,
|
|
"mean_token_accuracy": 0.05221981666982174,
|
|
"num_tokens": 94108.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.476018333435059,
|
|
"epoch": 0.04438526409232135,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.6253,
|
|
"mean_token_accuracy": 0.05243444815278053,
|
|
"num_tokens": 104696.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.478155612945557,
|
|
"epoch": 0.048823790501553485,
|
|
"grad_norm": 2.375,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.5235,
|
|
"mean_token_accuracy": 0.0584161002188921,
|
|
"num_tokens": 114568.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.39725103378296,
|
|
"epoch": 0.05326231691078562,
|
|
"grad_norm": 2.125,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.4713,
|
|
"mean_token_accuracy": 0.064088149741292,
|
|
"num_tokens": 126251.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.248920154571532,
|
|
"epoch": 0.05770084332001776,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.3504,
|
|
"mean_token_accuracy": 0.06839247606694698,
|
|
"num_tokens": 135612.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.320736598968505,
|
|
"epoch": 0.06213936972924989,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.4004,
|
|
"mean_token_accuracy": 0.0615400142967701,
|
|
"num_tokens": 145962.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.323652744293213,
|
|
"epoch": 0.06657789613848203,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.1911,
|
|
"mean_token_accuracy": 0.07103513963520527,
|
|
"num_tokens": 155587.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.258409976959229,
|
|
"epoch": 0.07101642254771416,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.1343,
|
|
"mean_token_accuracy": 0.06803948283195496,
|
|
"num_tokens": 165657.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.24950189590454,
|
|
"epoch": 0.0754549489569463,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.1277,
|
|
"mean_token_accuracy": 0.06729609742760659,
|
|
"num_tokens": 175844.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.224775981903075,
|
|
"epoch": 0.07989347536617843,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.9736,
|
|
"mean_token_accuracy": 0.06970795653760434,
|
|
"num_tokens": 185453.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.128818893432618,
|
|
"epoch": 0.08433200177541056,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.9469,
|
|
"mean_token_accuracy": 0.07015660107135772,
|
|
"num_tokens": 195296.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.158192539215088,
|
|
"epoch": 0.0887705281846427,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.8594,
|
|
"mean_token_accuracy": 0.0717735793441534,
|
|
"num_tokens": 204491.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.063592338562012,
|
|
"epoch": 0.09320905459387484,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.8275,
|
|
"mean_token_accuracy": 0.06594390086829663,
|
|
"num_tokens": 214916.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.0551118850708,
|
|
"epoch": 0.09764758100310697,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.6661,
|
|
"mean_token_accuracy": 0.07398808561265469,
|
|
"num_tokens": 226660.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.929056739807129,
|
|
"epoch": 0.1020861074123391,
|
|
"grad_norm": 2.203125,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.6191,
|
|
"mean_token_accuracy": 0.06771207004785537,
|
|
"num_tokens": 236554.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.87773323059082,
|
|
"epoch": 0.10652463382157124,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.5466,
|
|
"mean_token_accuracy": 0.07039828561246395,
|
|
"num_tokens": 247388.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.78554401397705,
|
|
"epoch": 0.11096316023080337,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.3693,
|
|
"mean_token_accuracy": 0.07505594864487648,
|
|
"num_tokens": 257404.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.569751739501953,
|
|
"epoch": 0.11540168664003551,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 8.366,
|
|
"mean_token_accuracy": 0.0721758782863617,
|
|
"num_tokens": 268024.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.49385757446289,
|
|
"epoch": 0.11984021304926765,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 8.3116,
|
|
"mean_token_accuracy": 0.07231119871139527,
|
|
"num_tokens": 278477.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.405902671813966,
|
|
"epoch": 0.12427873945849978,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.2427,
|
|
"mean_token_accuracy": 0.06903640553355217,
|
|
"num_tokens": 289974.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 9.16763277053833,
|
|
"epoch": 0.1287172658677319,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.1839,
|
|
"mean_token_accuracy": 0.06725569888949394,
|
|
"num_tokens": 300150.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 9.045907497406006,
|
|
"epoch": 0.13315579227696406,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.0648,
|
|
"mean_token_accuracy": 0.07113164104521275,
|
|
"num_tokens": 310482.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.951902961730957,
|
|
"epoch": 0.13759431868619618,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 8.1043,
|
|
"mean_token_accuracy": 0.07190654650330544,
|
|
"num_tokens": 321350.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.734932899475098,
|
|
"epoch": 0.14203284509542832,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.9902,
|
|
"mean_token_accuracy": 0.07260116301476956,
|
|
"num_tokens": 332009.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.618322277069092,
|
|
"epoch": 0.14647137150466044,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 8.0046,
|
|
"mean_token_accuracy": 0.07010005228221416,
|
|
"num_tokens": 341980.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.576034545898438,
|
|
"epoch": 0.1509098979138926,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.9965,
|
|
"mean_token_accuracy": 0.06660077758133412,
|
|
"num_tokens": 354249.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.524139022827148,
|
|
"epoch": 0.15534842432312473,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.9076,
|
|
"mean_token_accuracy": 0.07078476324677467,
|
|
"num_tokens": 364295.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.328704929351806,
|
|
"epoch": 0.15978695073235685,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.8464,
|
|
"mean_token_accuracy": 0.0794072538614273,
|
|
"num_tokens": 373601.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.382467269897461,
|
|
"epoch": 0.164225477141589,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.8583,
|
|
"mean_token_accuracy": 0.07436131834983825,
|
|
"num_tokens": 384260.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 8.316840362548827,
|
|
"epoch": 0.16866400355082112,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.9058,
|
|
"mean_token_accuracy": 0.06711366176605224,
|
|
"num_tokens": 394964.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.204895782470704,
|
|
"epoch": 0.17310252996005326,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.8384,
|
|
"mean_token_accuracy": 0.07343141734600067,
|
|
"num_tokens": 404470.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.270458793640136,
|
|
"epoch": 0.1775410563692854,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.9041,
|
|
"mean_token_accuracy": 0.07145134881138801,
|
|
"num_tokens": 414822.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.344293403625489,
|
|
"epoch": 0.18197958277851753,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.8228,
|
|
"mean_token_accuracy": 0.07206394150853157,
|
|
"num_tokens": 424367.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.169469261169434,
|
|
"epoch": 0.18641810918774968,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.8063,
|
|
"mean_token_accuracy": 0.06796807795763016,
|
|
"num_tokens": 434911.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 8.127049207687378,
|
|
"epoch": 0.1908566355969818,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.7417,
|
|
"mean_token_accuracy": 0.08103418126702308,
|
|
"num_tokens": 445215.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 8.216034698486329,
|
|
"epoch": 0.19529516200621394,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.7919,
|
|
"mean_token_accuracy": 0.07842708677053452,
|
|
"num_tokens": 454786.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 8.140088844299317,
|
|
"epoch": 0.19973368841544606,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.8219,
|
|
"mean_token_accuracy": 0.07302889823913575,
|
|
"num_tokens": 465185.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 8.021256399154662,
|
|
"epoch": 0.2041722148246782,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.7156,
|
|
"mean_token_accuracy": 0.08027704544365406,
|
|
"num_tokens": 475235.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 8.17042875289917,
|
|
"epoch": 0.20861074123391035,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.7317,
|
|
"mean_token_accuracy": 0.07805200070142745,
|
|
"num_tokens": 485408.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 8.040202140808105,
|
|
"epoch": 0.21304926764314247,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.7331,
|
|
"mean_token_accuracy": 0.0744746584445238,
|
|
"num_tokens": 495570.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 8.125858116149903,
|
|
"epoch": 0.21748779405237462,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.7248,
|
|
"mean_token_accuracy": 0.07628845125436783,
|
|
"num_tokens": 506103.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 8.083836793899536,
|
|
"epoch": 0.22192632046160674,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.6989,
|
|
"mean_token_accuracy": 0.07588708400726318,
|
|
"num_tokens": 516416.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 8.041877603530883,
|
|
"epoch": 0.22636484687083888,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.7498,
|
|
"mean_token_accuracy": 0.0751910775899887,
|
|
"num_tokens": 525841.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 8.231132793426514,
|
|
"epoch": 0.23080337328007103,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.7681,
|
|
"mean_token_accuracy": 0.07214248739182949,
|
|
"num_tokens": 536426.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 8.028632116317748,
|
|
"epoch": 0.23524189968930315,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.7229,
|
|
"mean_token_accuracy": 0.07526009976863861,
|
|
"num_tokens": 545852.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.998026943206787,
|
|
"epoch": 0.2396804260985353,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.6466,
|
|
"mean_token_accuracy": 0.07897478640079499,
|
|
"num_tokens": 555222.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.9018083095550535,
|
|
"epoch": 0.2441189525077674,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.6683,
|
|
"mean_token_accuracy": 0.0769478440284729,
|
|
"num_tokens": 566311.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 8.067350673675538,
|
|
"epoch": 0.24855747891699956,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.6718,
|
|
"mean_token_accuracy": 0.07673554085195064,
|
|
"num_tokens": 576883.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 8.010624122619628,
|
|
"epoch": 0.2529960053262317,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.8136,
|
|
"mean_token_accuracy": 0.07454071268439293,
|
|
"num_tokens": 587387.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 8.04631519317627,
|
|
"epoch": 0.2574345317354638,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.6914,
|
|
"mean_token_accuracy": 0.07921014353632927,
|
|
"num_tokens": 597229.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 8.029859972000121,
|
|
"epoch": 0.26187305814469597,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.6793,
|
|
"mean_token_accuracy": 0.0733891949057579,
|
|
"num_tokens": 606997.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.9327795028686525,
|
|
"epoch": 0.2663115845539281,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 7.6346,
|
|
"mean_token_accuracy": 0.07976229339838029,
|
|
"num_tokens": 617316.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.945201730728149,
|
|
"epoch": 0.2707501109631602,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 7.6262,
|
|
"mean_token_accuracy": 0.07671116665005684,
|
|
"num_tokens": 626494.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.911632776260376,
|
|
"epoch": 0.27518863737239235,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.6211,
|
|
"mean_token_accuracy": 0.07656443342566491,
|
|
"num_tokens": 636816.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.9385381698608395,
|
|
"epoch": 0.2796271637816245,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000157,
|
|
"loss": 7.5921,
|
|
"mean_token_accuracy": 0.07875077873468399,
|
|
"num_tokens": 647520.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.8889247417449955,
|
|
"epoch": 0.28406569019085665,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.5615,
|
|
"mean_token_accuracy": 0.0802665926516056,
|
|
"num_tokens": 656772.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.87529935836792,
|
|
"epoch": 0.2885042166000888,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000162,
|
|
"loss": 7.6269,
|
|
"mean_token_accuracy": 0.07935804799199105,
|
|
"num_tokens": 666570.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.889472913742066,
|
|
"epoch": 0.2929427430093209,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 7.6449,
|
|
"mean_token_accuracy": 0.07449713721871376,
|
|
"num_tokens": 676873.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.901484632492066,
|
|
"epoch": 0.29738126941855303,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 7.556,
|
|
"mean_token_accuracy": 0.0819828025996685,
|
|
"num_tokens": 687322.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.938011121749878,
|
|
"epoch": 0.3018197958277852,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 7.6304,
|
|
"mean_token_accuracy": 0.07710144743323326,
|
|
"num_tokens": 697657.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.953681612014771,
|
|
"epoch": 0.3062583222370173,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 7.5355,
|
|
"mean_token_accuracy": 0.07943713515996934,
|
|
"num_tokens": 707713.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.818657636642456,
|
|
"epoch": 0.31069684864624947,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 7.5792,
|
|
"mean_token_accuracy": 0.08700495660305023,
|
|
"num_tokens": 719438.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.922421979904175,
|
|
"epoch": 0.31513537505548156,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 7.5211,
|
|
"mean_token_accuracy": 0.0777974933385849,
|
|
"num_tokens": 728991.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.7726140975952145,
|
|
"epoch": 0.3195739014647137,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 7.4375,
|
|
"mean_token_accuracy": 0.09254143610596657,
|
|
"num_tokens": 738276.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.8144529342651365,
|
|
"epoch": 0.32401242787394585,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 7.537,
|
|
"mean_token_accuracy": 0.07724328823387623,
|
|
"num_tokens": 748405.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.8304845809936525,
|
|
"epoch": 0.328450954283178,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.5365,
|
|
"mean_token_accuracy": 0.08004771247506141,
|
|
"num_tokens": 759111.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.755885601043701,
|
|
"epoch": 0.33288948069241014,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.4431,
|
|
"mean_token_accuracy": 0.08885042890906333,
|
|
"num_tokens": 770315.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.815682411193848,
|
|
"epoch": 0.33732800710164224,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 7.5761,
|
|
"mean_token_accuracy": 0.07824730798602104,
|
|
"num_tokens": 781390.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.868446302413941,
|
|
"epoch": 0.3417665335108744,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 7.4659,
|
|
"mean_token_accuracy": 0.08218091987073421,
|
|
"num_tokens": 790710.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.664791536331177,
|
|
"epoch": 0.34620505992010653,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 7.4344,
|
|
"mean_token_accuracy": 0.08516876846551895,
|
|
"num_tokens": 800475.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.776907110214234,
|
|
"epoch": 0.3506435863293387,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 7.5457,
|
|
"mean_token_accuracy": 0.07697484940290451,
|
|
"num_tokens": 810394.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.851606655120849,
|
|
"epoch": 0.3550821127385708,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.5259,
|
|
"mean_token_accuracy": 0.07952482551336289,
|
|
"num_tokens": 820493.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.881973552703857,
|
|
"epoch": 0.3595206391478029,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 7.5896,
|
|
"mean_token_accuracy": 0.07090779766440392,
|
|
"num_tokens": 831570.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.75118236541748,
|
|
"epoch": 0.36395916555703506,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 7.5822,
|
|
"mean_token_accuracy": 0.07436199747025966,
|
|
"num_tokens": 841851.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.8130326747894285,
|
|
"epoch": 0.3683976919662672,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000207,
|
|
"loss": 7.4771,
|
|
"mean_token_accuracy": 0.08917279317975044,
|
|
"num_tokens": 851221.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.784592771530152,
|
|
"epoch": 0.37283621837549935,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 7.5136,
|
|
"mean_token_accuracy": 0.08482674360275269,
|
|
"num_tokens": 861876.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.806199550628662,
|
|
"epoch": 0.37727474478473144,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000212,
|
|
"loss": 7.5012,
|
|
"mean_token_accuracy": 0.08520847856998444,
|
|
"num_tokens": 871742.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.63223876953125,
|
|
"epoch": 0.3817132711939636,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.4356,
|
|
"mean_token_accuracy": 0.08614917695522309,
|
|
"num_tokens": 881968.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.708009338378906,
|
|
"epoch": 0.38615179760319573,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 7.3441,
|
|
"mean_token_accuracy": 0.0903160773217678,
|
|
"num_tokens": 892142.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.681766939163208,
|
|
"epoch": 0.3905903240124279,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.408,
|
|
"mean_token_accuracy": 0.09188471287488938,
|
|
"num_tokens": 901992.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.797896862030029,
|
|
"epoch": 0.39502885042166,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000222,
|
|
"loss": 7.5382,
|
|
"mean_token_accuracy": 0.07850045077502728,
|
|
"num_tokens": 913438.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.55986213684082,
|
|
"epoch": 0.3994673768308921,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 7.273,
|
|
"mean_token_accuracy": 0.10574427619576454,
|
|
"num_tokens": 923879.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.674528026580811,
|
|
"epoch": 0.40390590324012426,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 7.4341,
|
|
"mean_token_accuracy": 0.08904042169451713,
|
|
"num_tokens": 933954.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.707700920104981,
|
|
"epoch": 0.4083444296493564,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 7.4156,
|
|
"mean_token_accuracy": 0.0867860458791256,
|
|
"num_tokens": 942992.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.656433868408203,
|
|
"epoch": 0.41278295605858856,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 7.4528,
|
|
"mean_token_accuracy": 0.08972205594182014,
|
|
"num_tokens": 953822.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.627706384658813,
|
|
"epoch": 0.4172214824678207,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 7.3472,
|
|
"mean_token_accuracy": 0.08931803703308105,
|
|
"num_tokens": 964475.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.642127990722656,
|
|
"epoch": 0.4216600088770528,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 7.434,
|
|
"mean_token_accuracy": 0.0859565369784832,
|
|
"num_tokens": 974535.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.666657447814941,
|
|
"epoch": 0.42609853528628494,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 7.3944,
|
|
"mean_token_accuracy": 0.08582191392779351,
|
|
"num_tokens": 984674.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.544086360931397,
|
|
"epoch": 0.4305370616955171,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000242,
|
|
"loss": 7.37,
|
|
"mean_token_accuracy": 0.09044271633028984,
|
|
"num_tokens": 995248.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.742295646667481,
|
|
"epoch": 0.43497558810474923,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 7.3632,
|
|
"mean_token_accuracy": 0.0895160473883152,
|
|
"num_tokens": 1005547.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.550811624526977,
|
|
"epoch": 0.4394141145139814,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 7.3413,
|
|
"mean_token_accuracy": 0.08750802129507065,
|
|
"num_tokens": 1015498.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.609345579147339,
|
|
"epoch": 0.44385264092321347,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 7.4055,
|
|
"mean_token_accuracy": 0.08584300205111503,
|
|
"num_tokens": 1025420.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.44385264092321347,
|
|
"eval_entropy": 7.669124412989673,
|
|
"eval_loss": 7.446435451507568,
|
|
"eval_mean_token_accuracy": 0.08312557260738132,
|
|
"eval_num_tokens": 1025420.0,
|
|
"eval_runtime": 2.7854,
|
|
"eval_samples_per_second": 1208.804,
|
|
"eval_steps_per_second": 151.145,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.6334656238555905,
|
|
"epoch": 0.4482911673324456,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 7.3295,
|
|
"mean_token_accuracy": 0.09022360593080521,
|
|
"num_tokens": 1036556.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.584210634231567,
|
|
"epoch": 0.45272969374167776,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 7.3593,
|
|
"mean_token_accuracy": 0.08703627660870553,
|
|
"num_tokens": 1046676.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 7.6705080509185795,
|
|
"epoch": 0.4571682201509099,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 7.4042,
|
|
"mean_token_accuracy": 0.08590352982282638,
|
|
"num_tokens": 1057088.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 7.5486232280731205,
|
|
"epoch": 0.46160674656014206,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 7.2982,
|
|
"mean_token_accuracy": 0.09567688480019569,
|
|
"num_tokens": 1067814.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.543769884109497,
|
|
"epoch": 0.46604527296937415,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000262,
|
|
"loss": 7.3327,
|
|
"mean_token_accuracy": 0.0892727330327034,
|
|
"num_tokens": 1078600.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 7.641923093795777,
|
|
"epoch": 0.4704837993786063,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 7.3363,
|
|
"mean_token_accuracy": 0.08722671940922737,
|
|
"num_tokens": 1089158.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 7.568871212005615,
|
|
"epoch": 0.47492232578783844,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 7.3497,
|
|
"mean_token_accuracy": 0.08428739383816719,
|
|
"num_tokens": 1100365.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 7.500961780548096,
|
|
"epoch": 0.4793608521970706,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 7.305,
|
|
"mean_token_accuracy": 0.09392210468649864,
|
|
"num_tokens": 1111168.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 7.573345041275024,
|
|
"epoch": 0.48379937860630273,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 7.3194,
|
|
"mean_token_accuracy": 0.09149189814925193,
|
|
"num_tokens": 1121520.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.536744737625122,
|
|
"epoch": 0.4882379050155348,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 7.2073,
|
|
"mean_token_accuracy": 0.09879742562770844,
|
|
"num_tokens": 1131300.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 7.364904880523682,
|
|
"epoch": 0.49267643142476697,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 7.2532,
|
|
"mean_token_accuracy": 0.0986358568072319,
|
|
"num_tokens": 1141897.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 7.541038084030151,
|
|
"epoch": 0.4971149578339991,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.2956,
|
|
"mean_token_accuracy": 0.08940311297774314,
|
|
"num_tokens": 1152510.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.552376794815063,
|
|
"epoch": 0.5015534842432312,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 7.3001,
|
|
"mean_token_accuracy": 0.09093584269285201,
|
|
"num_tokens": 1161762.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.479511404037476,
|
|
"epoch": 0.5059920106524634,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 7.2394,
|
|
"mean_token_accuracy": 0.09156333580613137,
|
|
"num_tokens": 1172836.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 7.480563068389893,
|
|
"epoch": 0.5104305370616955,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 7.2935,
|
|
"mean_token_accuracy": 0.09051846116781234,
|
|
"num_tokens": 1182101.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 7.511827182769776,
|
|
"epoch": 0.5148690634709276,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 7.2868,
|
|
"mean_token_accuracy": 0.08703599572181701,
|
|
"num_tokens": 1191925.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.430129528045654,
|
|
"epoch": 0.5193075898801598,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000292,
|
|
"loss": 7.1629,
|
|
"mean_token_accuracy": 0.09691138043999672,
|
|
"num_tokens": 1202030.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.408132934570313,
|
|
"epoch": 0.5237461162893919,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 7.253,
|
|
"mean_token_accuracy": 0.09141650795936584,
|
|
"num_tokens": 1212178.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 7.515611791610718,
|
|
"epoch": 0.5281846426986241,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000297,
|
|
"loss": 7.1971,
|
|
"mean_token_accuracy": 0.0950719341635704,
|
|
"num_tokens": 1221685.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.383773374557495,
|
|
"epoch": 0.5326231691078562,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 7.197,
|
|
"mean_token_accuracy": 0.08822897970676422,
|
|
"num_tokens": 1233178.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 7.4588648796081545,
|
|
"epoch": 0.5370616955170884,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 7.1611,
|
|
"mean_token_accuracy": 0.09191120117902755,
|
|
"num_tokens": 1243687.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.358021211624146,
|
|
"epoch": 0.5415002219263204,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 7.2349,
|
|
"mean_token_accuracy": 0.08815527036786079,
|
|
"num_tokens": 1255124.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 7.400767421722412,
|
|
"epoch": 0.5459387483355526,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000307,
|
|
"loss": 7.2452,
|
|
"mean_token_accuracy": 0.09174467995762825,
|
|
"num_tokens": 1265517.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 7.310306978225708,
|
|
"epoch": 0.5503772747447847,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 7.1176,
|
|
"mean_token_accuracy": 0.09506009593605995,
|
|
"num_tokens": 1275877.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.400981378555298,
|
|
"epoch": 0.5548158011540169,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000312,
|
|
"loss": 7.2286,
|
|
"mean_token_accuracy": 0.09438399225473404,
|
|
"num_tokens": 1285951.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 7.509041738510132,
|
|
"epoch": 0.559254327563249,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 7.1567,
|
|
"mean_token_accuracy": 0.09806277230381966,
|
|
"num_tokens": 1295209.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 7.316894149780273,
|
|
"epoch": 0.5636928539724811,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000317,
|
|
"loss": 7.2208,
|
|
"mean_token_accuracy": 0.09708264470100403,
|
|
"num_tokens": 1304733.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 7.342378044128418,
|
|
"epoch": 0.5681313803817133,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 7.1539,
|
|
"mean_token_accuracy": 0.08910495042800903,
|
|
"num_tokens": 1314981.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.538545989990235,
|
|
"epoch": 0.5725699067909454,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 7.198,
|
|
"mean_token_accuracy": 0.0895936667919159,
|
|
"num_tokens": 1325211.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 7.2863500118255615,
|
|
"epoch": 0.5770084332001776,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 7.1309,
|
|
"mean_token_accuracy": 0.09338074773550034,
|
|
"num_tokens": 1335625.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 7.436445474624634,
|
|
"epoch": 0.5814469596094097,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 7.2488,
|
|
"mean_token_accuracy": 0.0991661287844181,
|
|
"num_tokens": 1345158.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 7.262508535385132,
|
|
"epoch": 0.5858854860186418,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 7.081,
|
|
"mean_token_accuracy": 0.10250589922070504,
|
|
"num_tokens": 1355092.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 7.307907056808472,
|
|
"epoch": 0.5903240124278739,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 7.1329,
|
|
"mean_token_accuracy": 0.09874422326683999,
|
|
"num_tokens": 1364919.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 7.2338110446929935,
|
|
"epoch": 0.5947625388371061,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 7.1726,
|
|
"mean_token_accuracy": 0.09538876637816429,
|
|
"num_tokens": 1375200.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 7.331265687942505,
|
|
"epoch": 0.5992010652463382,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000337,
|
|
"loss": 7.1466,
|
|
"mean_token_accuracy": 0.09369650185108185,
|
|
"num_tokens": 1385728.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 7.4757524013519285,
|
|
"epoch": 0.6036395916555704,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 7.196,
|
|
"mean_token_accuracy": 0.08721103966236114,
|
|
"num_tokens": 1395542.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 7.264866781234741,
|
|
"epoch": 0.6080781180648025,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000342,
|
|
"loss": 7.1667,
|
|
"mean_token_accuracy": 0.09908052235841751,
|
|
"num_tokens": 1406350.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 7.250851583480835,
|
|
"epoch": 0.6125166444740346,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 7.0933,
|
|
"mean_token_accuracy": 0.09707043692469597,
|
|
"num_tokens": 1418229.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 7.257457447052002,
|
|
"epoch": 0.6169551708832668,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000347,
|
|
"loss": 7.101,
|
|
"mean_token_accuracy": 0.10156845226883889,
|
|
"num_tokens": 1428290.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 7.389108514785766,
|
|
"epoch": 0.6213936972924989,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 7.1644,
|
|
"mean_token_accuracy": 0.08962787240743637,
|
|
"num_tokens": 1439837.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 7.230832195281982,
|
|
"epoch": 0.625832223701731,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000352,
|
|
"loss": 7.1004,
|
|
"mean_token_accuracy": 0.09468400254845619,
|
|
"num_tokens": 1450831.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 7.241072797775269,
|
|
"epoch": 0.6302707501109631,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 7.0787,
|
|
"mean_token_accuracy": 0.0992747537791729,
|
|
"num_tokens": 1461772.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 7.251083326339722,
|
|
"epoch": 0.6347092765201953,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000357,
|
|
"loss": 7.0678,
|
|
"mean_token_accuracy": 0.10479466319084167,
|
|
"num_tokens": 1471669.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 7.284691286087036,
|
|
"epoch": 0.6391478029294274,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 7.0922,
|
|
"mean_token_accuracy": 0.0977623738348484,
|
|
"num_tokens": 1482319.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 7.207487869262695,
|
|
"epoch": 0.6435863293386596,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000362,
|
|
"loss": 7.0654,
|
|
"mean_token_accuracy": 0.09616786390542983,
|
|
"num_tokens": 1492393.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 7.214288234710693,
|
|
"epoch": 0.6480248557478917,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 7.1377,
|
|
"mean_token_accuracy": 0.10020551234483718,
|
|
"num_tokens": 1502986.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 7.309820938110351,
|
|
"epoch": 0.6524633821571239,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000367,
|
|
"loss": 7.1195,
|
|
"mean_token_accuracy": 0.09985571056604385,
|
|
"num_tokens": 1514046.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 7.249904489517212,
|
|
"epoch": 0.656901908566356,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 7.133,
|
|
"mean_token_accuracy": 0.0978231132030487,
|
|
"num_tokens": 1523789.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 7.303426790237427,
|
|
"epoch": 0.6613404349755881,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000372,
|
|
"loss": 7.0636,
|
|
"mean_token_accuracy": 0.0984602726995945,
|
|
"num_tokens": 1533449.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 7.157350540161133,
|
|
"epoch": 0.6657789613848203,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 7.1052,
|
|
"mean_token_accuracy": 0.0913457877933979,
|
|
"num_tokens": 1543449.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 7.232370662689209,
|
|
"epoch": 0.6702174877940523,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.957,
|
|
"mean_token_accuracy": 0.10332913659512996,
|
|
"num_tokens": 1553529.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 7.166843461990356,
|
|
"epoch": 0.6746560142032845,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 7.0559,
|
|
"mean_token_accuracy": 0.1009259507060051,
|
|
"num_tokens": 1564245.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 7.135752153396607,
|
|
"epoch": 0.6790945406125166,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.9787,
|
|
"mean_token_accuracy": 0.0997254841029644,
|
|
"num_tokens": 1573834.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 7.034980821609497,
|
|
"epoch": 0.6835330670217488,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.9407,
|
|
"mean_token_accuracy": 0.10062595605850219,
|
|
"num_tokens": 1583782.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 7.211769485473633,
|
|
"epoch": 0.6879715934309809,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 7.0625,
|
|
"mean_token_accuracy": 0.10229107290506363,
|
|
"num_tokens": 1594056.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 7.17944564819336,
|
|
"epoch": 0.6924101198402131,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 7.0671,
|
|
"mean_token_accuracy": 0.09898089095950127,
|
|
"num_tokens": 1604177.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 7.1694622993469235,
|
|
"epoch": 0.6968486462494452,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.9696,
|
|
"mean_token_accuracy": 0.10202183946967125,
|
|
"num_tokens": 1614439.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 7.079647397994995,
|
|
"epoch": 0.7012871726586773,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.99,
|
|
"mean_token_accuracy": 0.09851381108164788,
|
|
"num_tokens": 1625004.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 7.182702732086182,
|
|
"epoch": 0.7057256990679095,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 7.0091,
|
|
"mean_token_accuracy": 0.09595384523272514,
|
|
"num_tokens": 1634188.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 7.0714222431182865,
|
|
"epoch": 0.7101642254771416,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.9157,
|
|
"mean_token_accuracy": 0.1082749105989933,
|
|
"num_tokens": 1642633.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 7.0621692657470705,
|
|
"epoch": 0.7146027518863737,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.9424,
|
|
"mean_token_accuracy": 0.10712620615959167,
|
|
"num_tokens": 1654536.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 7.148227691650391,
|
|
"epoch": 0.7190412782956058,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 7.0822,
|
|
"mean_token_accuracy": 0.09017667174339294,
|
|
"num_tokens": 1665083.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 7.069796466827393,
|
|
"epoch": 0.723479804704838,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 7.033,
|
|
"mean_token_accuracy": 0.09541632980108261,
|
|
"num_tokens": 1675826.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 7.110815143585205,
|
|
"epoch": 0.7279183311140701,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.9946,
|
|
"mean_token_accuracy": 0.10398527979850769,
|
|
"num_tokens": 1685806.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 7.097141170501709,
|
|
"epoch": 0.7323568575233023,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000412,
|
|
"loss": 7.0632,
|
|
"mean_token_accuracy": 0.10135304108262062,
|
|
"num_tokens": 1695984.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 7.124357271194458,
|
|
"epoch": 0.7367953839325344,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 7.0575,
|
|
"mean_token_accuracy": 0.09942566752433776,
|
|
"num_tokens": 1706086.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 7.091458511352539,
|
|
"epoch": 0.7412339103417666,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 7.0284,
|
|
"mean_token_accuracy": 0.10059899911284446,
|
|
"num_tokens": 1718040.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 7.131758165359497,
|
|
"epoch": 0.7456724367509987,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 7.0191,
|
|
"mean_token_accuracy": 0.09906580075621604,
|
|
"num_tokens": 1729009.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 7.087246465682983,
|
|
"epoch": 0.7501109631602308,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.9929,
|
|
"mean_token_accuracy": 0.10902519077062607,
|
|
"num_tokens": 1738895.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 7.113551664352417,
|
|
"epoch": 0.7545494895694629,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 7.0261,
|
|
"mean_token_accuracy": 0.10415812507271767,
|
|
"num_tokens": 1750225.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 7.0047619342803955,
|
|
"epoch": 0.758988015978695,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.9292,
|
|
"mean_token_accuracy": 0.105811557918787,
|
|
"num_tokens": 1761224.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 7.085004186630249,
|
|
"epoch": 0.7634265423879272,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 7.0169,
|
|
"mean_token_accuracy": 0.09775067865848541,
|
|
"num_tokens": 1771853.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 7.146742153167724,
|
|
"epoch": 0.7678650687971593,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.9895,
|
|
"mean_token_accuracy": 0.10439399853348733,
|
|
"num_tokens": 1781186.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 7.151022291183471,
|
|
"epoch": 0.7723035952063915,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.9711,
|
|
"mean_token_accuracy": 0.09423294179141521,
|
|
"num_tokens": 1792887.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.941896152496338,
|
|
"epoch": 0.7767421216156236,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.8708,
|
|
"mean_token_accuracy": 0.10734946057200431,
|
|
"num_tokens": 1803050.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.811341190338135,
|
|
"epoch": 0.7811806480248558,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.9879,
|
|
"mean_token_accuracy": 0.10939516723155976,
|
|
"num_tokens": 1813287.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 7.056670713424682,
|
|
"epoch": 0.7856191744340879,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.9735,
|
|
"mean_token_accuracy": 0.1008478730916977,
|
|
"num_tokens": 1824425.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.97848916053772,
|
|
"epoch": 0.79005770084332,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.8898,
|
|
"mean_token_accuracy": 0.11324303895235062,
|
|
"num_tokens": 1833968.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.980572080612182,
|
|
"epoch": 0.7944962272525522,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000447,
|
|
"loss": 7.0128,
|
|
"mean_token_accuracy": 0.10274540036916732,
|
|
"num_tokens": 1844097.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 7.055815601348877,
|
|
"epoch": 0.7989347536617842,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.934,
|
|
"mean_token_accuracy": 0.10776300206780434,
|
|
"num_tokens": 1854395.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.931429195404053,
|
|
"epoch": 0.8033732800710164,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.949,
|
|
"mean_token_accuracy": 0.10048572197556496,
|
|
"num_tokens": 1864531.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.998499774932862,
|
|
"epoch": 0.8078118064802485,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.8224,
|
|
"mean_token_accuracy": 0.11029603257775307,
|
|
"num_tokens": 1875071.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.971027994155884,
|
|
"epoch": 0.8122503328894807,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.947,
|
|
"mean_token_accuracy": 0.10487593412399292,
|
|
"num_tokens": 1884633.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.975761222839355,
|
|
"epoch": 0.8166888592987128,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.9402,
|
|
"mean_token_accuracy": 0.10628680288791656,
|
|
"num_tokens": 1895204.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 7.054645633697509,
|
|
"epoch": 0.821127385707945,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.9658,
|
|
"mean_token_accuracy": 0.10290167108178139,
|
|
"num_tokens": 1906187.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 7.008241748809814,
|
|
"epoch": 0.8255659121171771,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.9215,
|
|
"mean_token_accuracy": 0.09948821216821671,
|
|
"num_tokens": 1915585.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.954188346862793,
|
|
"epoch": 0.8300044385264093,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.9624,
|
|
"mean_token_accuracy": 0.1034872155636549,
|
|
"num_tokens": 1926912.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.975879383087158,
|
|
"epoch": 0.8344429649356414,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.8828,
|
|
"mean_token_accuracy": 0.1049314372241497,
|
|
"num_tokens": 1936542.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 7.032291650772095,
|
|
"epoch": 0.8388814913448736,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.8869,
|
|
"mean_token_accuracy": 0.1079288512468338,
|
|
"num_tokens": 1946052.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.855350923538208,
|
|
"epoch": 0.8433200177541056,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.9479,
|
|
"mean_token_accuracy": 0.10810579061508178,
|
|
"num_tokens": 1957352.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 7.012834692001343,
|
|
"epoch": 0.8477585441633377,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.9165,
|
|
"mean_token_accuracy": 0.10588640198111535,
|
|
"num_tokens": 1967538.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.953670644760132,
|
|
"epoch": 0.8521970705725699,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.9437,
|
|
"mean_token_accuracy": 0.10475035384297371,
|
|
"num_tokens": 1977620.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 7.001286792755127,
|
|
"epoch": 0.856635596981802,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.8474,
|
|
"mean_token_accuracy": 0.10972543135285377,
|
|
"num_tokens": 1987534.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.883567142486572,
|
|
"epoch": 0.8610741233910342,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.8677,
|
|
"mean_token_accuracy": 0.11282802000641823,
|
|
"num_tokens": 1997817.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.960841703414917,
|
|
"epoch": 0.8655126498002663,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.8693,
|
|
"mean_token_accuracy": 0.10804260671138763,
|
|
"num_tokens": 2007529.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.893871688842774,
|
|
"epoch": 0.8699511762094985,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.8747,
|
|
"mean_token_accuracy": 0.1100342482328415,
|
|
"num_tokens": 2017317.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.920565032958985,
|
|
"epoch": 0.8743897026187306,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.8925,
|
|
"mean_token_accuracy": 0.10560473203659057,
|
|
"num_tokens": 2028427.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.928885173797608,
|
|
"epoch": 0.8788282290279628,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.8469,
|
|
"mean_token_accuracy": 0.111257666349411,
|
|
"num_tokens": 2038464.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.895605516433716,
|
|
"epoch": 0.8832667554371949,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.9248,
|
|
"mean_token_accuracy": 0.10252941846847534,
|
|
"num_tokens": 2049006.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.840125465393067,
|
|
"epoch": 0.8877052818464269,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.8673,
|
|
"mean_token_accuracy": 0.10938069224357605,
|
|
"num_tokens": 2060436.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 0.8877052818464269,
|
|
"eval_entropy": 6.823905027394057,
|
|
"eval_loss": 6.903217315673828,
|
|
"eval_mean_token_accuracy": 0.10246794701790583,
|
|
"eval_num_tokens": 2060436.0,
|
|
"eval_runtime": 2.7045,
|
|
"eval_samples_per_second": 1244.948,
|
|
"eval_steps_per_second": 155.665,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.8510839462280275,
|
|
"epoch": 0.8921438082556591,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004999998312369076,
|
|
"loss": 6.7705,
|
|
"mean_token_accuracy": 0.1085792139172554,
|
|
"num_tokens": 2070906.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.848130416870117,
|
|
"epoch": 0.8965823346648912,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004999991456372788,
|
|
"loss": 6.8232,
|
|
"mean_token_accuracy": 0.10221576392650604,
|
|
"num_tokens": 2080563.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.826877164840698,
|
|
"epoch": 0.9010208610741234,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000499997932655026,
|
|
"loss": 6.7509,
|
|
"mean_token_accuracy": 0.11835153996944428,
|
|
"num_tokens": 2089785.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.89136643409729,
|
|
"epoch": 0.9054593874833555,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999961922929925,
|
|
"loss": 6.798,
|
|
"mean_token_accuracy": 0.11268565952777862,
|
|
"num_tokens": 2099609.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.894064235687256,
|
|
"epoch": 0.9098979138925877,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999939245552573,
|
|
"loss": 6.8422,
|
|
"mean_token_accuracy": 0.11023318842053413,
|
|
"num_tokens": 2110043.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.8520002365112305,
|
|
"epoch": 0.9143364403018198,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000499991129447136,
|
|
"loss": 6.8665,
|
|
"mean_token_accuracy": 0.1076730340719223,
|
|
"num_tokens": 2119748.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.8474874019622805,
|
|
"epoch": 0.918774966711052,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999878069751803,
|
|
"loss": 6.8907,
|
|
"mean_token_accuracy": 0.10536454170942307,
|
|
"num_tokens": 2130347.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.900251626968384,
|
|
"epoch": 0.9232134931202841,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004999839571471776,
|
|
"loss": 6.7778,
|
|
"mean_token_accuracy": 0.1090541049838066,
|
|
"num_tokens": 2140499.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.788918542861938,
|
|
"epoch": 0.9276520195295161,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999795799721517,
|
|
"loss": 6.7795,
|
|
"mean_token_accuracy": 0.10508258789777755,
|
|
"num_tokens": 2151143.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.702548313140869,
|
|
"epoch": 0.9320905459387483,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999746754603624,
|
|
"loss": 6.8099,
|
|
"mean_token_accuracy": 0.1090174950659275,
|
|
"num_tokens": 2161651.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.934295988082885,
|
|
"epoch": 0.9365290723479804,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999692436233055,
|
|
"loss": 6.8146,
|
|
"mean_token_accuracy": 0.1094007097184658,
|
|
"num_tokens": 2172152.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.8816564083099365,
|
|
"epoch": 0.9409675987572126,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499963284473713,
|
|
"loss": 6.8335,
|
|
"mean_token_accuracy": 0.1026708424091339,
|
|
"num_tokens": 2182912.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.725460863113403,
|
|
"epoch": 0.9454061251664447,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004999567980255526,
|
|
"loss": 6.8253,
|
|
"mean_token_accuracy": 0.10950745418667793,
|
|
"num_tokens": 2193573.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.998191976547242,
|
|
"epoch": 0.9498446515756769,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004999497842940282,
|
|
"loss": 6.8627,
|
|
"mean_token_accuracy": 0.1091019332408905,
|
|
"num_tokens": 2204157.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.804390239715576,
|
|
"epoch": 0.954283177984909,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999422432955794,
|
|
"loss": 6.8426,
|
|
"mean_token_accuracy": 0.11238477602601052,
|
|
"num_tokens": 2214433.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.7941382884979244,
|
|
"epoch": 0.9587217043941412,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999341750478818,
|
|
"loss": 6.7722,
|
|
"mean_token_accuracy": 0.1097018837928772,
|
|
"num_tokens": 2224913.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.810701084136963,
|
|
"epoch": 0.9631602308033733,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000499925579569847,
|
|
"loss": 6.7335,
|
|
"mean_token_accuracy": 0.12259945124387742,
|
|
"num_tokens": 2234871.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.818542575836181,
|
|
"epoch": 0.9675987572126055,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004999164568816219,
|
|
"loss": 6.7889,
|
|
"mean_token_accuracy": 0.10602138787508011,
|
|
"num_tokens": 2244462.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.706165170669555,
|
|
"epoch": 0.9720372836218375,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999068070045897,
|
|
"loss": 6.7827,
|
|
"mean_token_accuracy": 0.10748272910714149,
|
|
"num_tokens": 2256145.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.83993878364563,
|
|
"epoch": 0.9764758100310696,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499896629961369,
|
|
"loss": 6.7837,
|
|
"mean_token_accuracy": 0.11425440460443496,
|
|
"num_tokens": 2265913.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.725751304626465,
|
|
"epoch": 0.9809143364403018,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000499885925775814,
|
|
"loss": 6.7316,
|
|
"mean_token_accuracy": 0.11490511074662209,
|
|
"num_tokens": 2274874.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.830372858047485,
|
|
"epoch": 0.9853528628495339,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004998746944730148,
|
|
"loss": 6.7131,
|
|
"mean_token_accuracy": 0.11283201426267624,
|
|
"num_tokens": 2284767.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.874453449249268,
|
|
"epoch": 0.9897913892587661,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004998629360792965,
|
|
"loss": 6.8831,
|
|
"mean_token_accuracy": 0.10844636484980583,
|
|
"num_tokens": 2295196.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.715284633636474,
|
|
"epoch": 0.9942299156679982,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004998506506222202,
|
|
"loss": 6.7286,
|
|
"mean_token_accuracy": 0.11680992171168328,
|
|
"num_tokens": 2306078.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.814456415176392,
|
|
"epoch": 0.9986684420772304,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004998378381305821,
|
|
"loss": 6.8094,
|
|
"mean_token_accuracy": 0.10992804765701295,
|
|
"num_tokens": 2317229.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.859947204589844,
|
|
"epoch": 1.0026631158455392,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004998244986344138,
|
|
"loss": 6.688,
|
|
"mean_token_accuracy": 0.11234754075606664,
|
|
"num_tokens": 2326312.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.762184476852417,
|
|
"epoch": 1.0071016422547714,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998106321649822,
|
|
"loss": 6.5436,
|
|
"mean_token_accuracy": 0.12012127339839936,
|
|
"num_tokens": 2335548.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.783463954925537,
|
|
"epoch": 1.0115401686640035,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004997962387547893,
|
|
"loss": 6.5731,
|
|
"mean_token_accuracy": 0.11604165062308311,
|
|
"num_tokens": 2346180.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.728586292266845,
|
|
"epoch": 1.0159786950732357,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004997813184375723,
|
|
"loss": 6.5403,
|
|
"mean_token_accuracy": 0.11700786501169205,
|
|
"num_tokens": 2355682.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.737982702255249,
|
|
"epoch": 1.0204172214824678,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004997658712483034,
|
|
"loss": 6.5789,
|
|
"mean_token_accuracy": 0.11569899022579193,
|
|
"num_tokens": 2365529.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.645860004425049,
|
|
"epoch": 1.0248557478917,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997498972231898,
|
|
"loss": 6.4906,
|
|
"mean_token_accuracy": 0.12428833544254303,
|
|
"num_tokens": 2375527.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.723867797851563,
|
|
"epoch": 1.0292942743009321,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004997333963996734,
|
|
"loss": 6.6103,
|
|
"mean_token_accuracy": 0.11796300113201141,
|
|
"num_tokens": 2386425.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.686568021774292,
|
|
"epoch": 1.0337328007101643,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004997163688164313,
|
|
"loss": 6.6209,
|
|
"mean_token_accuracy": 0.11397269815206527,
|
|
"num_tokens": 2396897.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.736155891418457,
|
|
"epoch": 1.0381713271193964,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004996988145133745,
|
|
"loss": 6.6215,
|
|
"mean_token_accuracy": 0.11120860427618026,
|
|
"num_tokens": 2408671.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.68158974647522,
|
|
"epoch": 1.0426098535286286,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004996807335316496,
|
|
"loss": 6.5968,
|
|
"mean_token_accuracy": 0.11955826655030251,
|
|
"num_tokens": 2418373.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.73370852470398,
|
|
"epoch": 1.0470483799378607,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004996621259136368,
|
|
"loss": 6.5516,
|
|
"mean_token_accuracy": 0.12124700546264648,
|
|
"num_tokens": 2429094.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.58090991973877,
|
|
"epoch": 1.0514869063470929,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996429917029513,
|
|
"loss": 6.5521,
|
|
"mean_token_accuracy": 0.11974199712276459,
|
|
"num_tokens": 2439522.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.689072942733764,
|
|
"epoch": 1.055925432756325,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996233309444424,
|
|
"loss": 6.5334,
|
|
"mean_token_accuracy": 0.12693726643919945,
|
|
"num_tokens": 2449900.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.648254156112671,
|
|
"epoch": 1.060363959165557,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004996031436841934,
|
|
"loss": 6.528,
|
|
"mean_token_accuracy": 0.11835195198655128,
|
|
"num_tokens": 2461187.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.613636541366577,
|
|
"epoch": 1.064802485574789,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004995824299695219,
|
|
"loss": 6.5522,
|
|
"mean_token_accuracy": 0.12386145591735839,
|
|
"num_tokens": 2471897.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.695000886917114,
|
|
"epoch": 1.0692410119840212,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004995611898489796,
|
|
"loss": 6.4835,
|
|
"mean_token_accuracy": 0.13428002893924712,
|
|
"num_tokens": 2482668.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.542116737365722,
|
|
"epoch": 1.0736795383932534,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004995394233723516,
|
|
"loss": 6.5273,
|
|
"mean_token_accuracy": 0.12380995452404023,
|
|
"num_tokens": 2492375.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.612301158905029,
|
|
"epoch": 1.0781180648024855,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004995171305906574,
|
|
"loss": 6.5553,
|
|
"mean_token_accuracy": 0.12436272650957107,
|
|
"num_tokens": 2504176.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.712629508972168,
|
|
"epoch": 1.0825565912117177,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004994943115561495,
|
|
"loss": 6.5802,
|
|
"mean_token_accuracy": 0.12135286405682563,
|
|
"num_tokens": 2513437.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.71323561668396,
|
|
"epoch": 1.0869951176209498,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004994709663223143,
|
|
"loss": 6.5305,
|
|
"mean_token_accuracy": 0.12117772102355957,
|
|
"num_tokens": 2524907.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.586472082138061,
|
|
"epoch": 1.091433644030182,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004994470949438712,
|
|
"loss": 6.4818,
|
|
"mean_token_accuracy": 0.1203920915722847,
|
|
"num_tokens": 2535288.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.5804437637329105,
|
|
"epoch": 1.095872170439414,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004994226974767734,
|
|
"loss": 6.5353,
|
|
"mean_token_accuracy": 0.11931732892990113,
|
|
"num_tokens": 2545896.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.543254709243774,
|
|
"epoch": 1.1003106968486462,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004993977739782066,
|
|
"loss": 6.4584,
|
|
"mean_token_accuracy": 0.13561398088932036,
|
|
"num_tokens": 2555440.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.59882869720459,
|
|
"epoch": 1.1047492232578784,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00049937232450659,
|
|
"loss": 6.4693,
|
|
"mean_token_accuracy": 0.12519273459911345,
|
|
"num_tokens": 2565474.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.621742391586304,
|
|
"epoch": 1.1091877496671105,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004993463491215753,
|
|
"loss": 6.5707,
|
|
"mean_token_accuracy": 0.11752136424183846,
|
|
"num_tokens": 2576090.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.66785740852356,
|
|
"epoch": 1.1136262760763427,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000499319847884047,
|
|
"loss": 6.48,
|
|
"mean_token_accuracy": 0.12498680129647255,
|
|
"num_tokens": 2585719.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.547177171707153,
|
|
"epoch": 1.1180648024855748,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004992928208561224,
|
|
"loss": 6.4818,
|
|
"mean_token_accuracy": 0.12778932899236678,
|
|
"num_tokens": 2594797.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.544874048233032,
|
|
"epoch": 1.122503328894807,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004992652681011508,
|
|
"loss": 6.5028,
|
|
"mean_token_accuracy": 0.12365371584892274,
|
|
"num_tokens": 2605525.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.667212867736817,
|
|
"epoch": 1.1269418553040391,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000499237189683714,
|
|
"loss": 6.543,
|
|
"mean_token_accuracy": 0.12363962829113007,
|
|
"num_tokens": 2616478.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.585494756698608,
|
|
"epoch": 1.1313803817132713,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004992085856696259,
|
|
"loss": 6.5255,
|
|
"mean_token_accuracy": 0.12803056016564368,
|
|
"num_tokens": 2626290.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.660335063934326,
|
|
"epoch": 1.1358189081225034,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004991794561259325,
|
|
"loss": 6.5861,
|
|
"mean_token_accuracy": 0.11459894254803657,
|
|
"num_tokens": 2637319.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.654719829559326,
|
|
"epoch": 1.1402574345317356,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004991498011209112,
|
|
"loss": 6.5036,
|
|
"mean_token_accuracy": 0.1196965254843235,
|
|
"num_tokens": 2648140.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.520665168762207,
|
|
"epoch": 1.1446959609409677,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004991196207240714,
|
|
"loss": 6.5534,
|
|
"mean_token_accuracy": 0.12024708986282348,
|
|
"num_tokens": 2658561.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.740872001647949,
|
|
"epoch": 1.1491344873501999,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004990889150061541,
|
|
"loss": 6.421,
|
|
"mean_token_accuracy": 0.13026004359126092,
|
|
"num_tokens": 2670233.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.636859560012818,
|
|
"epoch": 1.1535730137594318,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004990576840391312,
|
|
"loss": 6.4896,
|
|
"mean_token_accuracy": 0.12343377694487571,
|
|
"num_tokens": 2681047.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.514160776138306,
|
|
"epoch": 1.158011540168664,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000499025927896206,
|
|
"loss": 6.4793,
|
|
"mean_token_accuracy": 0.12569797188043594,
|
|
"num_tokens": 2691284.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.50507082939148,
|
|
"epoch": 1.162450066577896,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004989936466518127,
|
|
"loss": 6.4791,
|
|
"mean_token_accuracy": 0.12733488231897355,
|
|
"num_tokens": 2702105.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.660071849822998,
|
|
"epoch": 1.1668885929871282,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004989608403816164,
|
|
"loss": 6.4392,
|
|
"mean_token_accuracy": 0.1262727789580822,
|
|
"num_tokens": 2712003.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.480842781066895,
|
|
"epoch": 1.1713271193963604,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004989275091625126,
|
|
"loss": 6.4644,
|
|
"mean_token_accuracy": 0.12619971707463265,
|
|
"num_tokens": 2721609.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.514829921722412,
|
|
"epoch": 1.1757656458055925,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004988936530726276,
|
|
"loss": 6.3574,
|
|
"mean_token_accuracy": 0.1336055465042591,
|
|
"num_tokens": 2731036.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.577421188354492,
|
|
"epoch": 1.1802041722148247,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004988592721913176,
|
|
"loss": 6.4856,
|
|
"mean_token_accuracy": 0.12642226815223695,
|
|
"num_tokens": 2741860.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.4255718231201175,
|
|
"epoch": 1.1846426986240568,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004988243665991692,
|
|
"loss": 6.4757,
|
|
"mean_token_accuracy": 0.12892607748508453,
|
|
"num_tokens": 2751898.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.610957288742066,
|
|
"epoch": 1.189081225033289,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004987889363779985,
|
|
"loss": 6.4425,
|
|
"mean_token_accuracy": 0.13178927153348924,
|
|
"num_tokens": 2761193.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.46262493133545,
|
|
"epoch": 1.193519751442521,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004987529816108517,
|
|
"loss": 6.4799,
|
|
"mean_token_accuracy": 0.1273398607969284,
|
|
"num_tokens": 2771693.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.6233940601348875,
|
|
"epoch": 1.1979582778517532,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004987165023820043,
|
|
"loss": 6.4757,
|
|
"mean_token_accuracy": 0.12488154098391532,
|
|
"num_tokens": 2780680.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.422232627868652,
|
|
"epoch": 1.2023968042609854,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004986794987769611,
|
|
"loss": 6.4691,
|
|
"mean_token_accuracy": 0.13016403540968896,
|
|
"num_tokens": 2792049.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.61912989616394,
|
|
"epoch": 1.2068353306702175,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000498641970882456,
|
|
"loss": 6.5094,
|
|
"mean_token_accuracy": 0.11824153885245323,
|
|
"num_tokens": 2802284.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.5044067859649655,
|
|
"epoch": 1.2112738570794497,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004986039187864518,
|
|
"loss": 6.4687,
|
|
"mean_token_accuracy": 0.1283252492547035,
|
|
"num_tokens": 2812791.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 6.563082885742188,
|
|
"epoch": 1.2157123834886818,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004985653425781401,
|
|
"loss": 6.5185,
|
|
"mean_token_accuracy": 0.12203285768628121,
|
|
"num_tokens": 2823216.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.505474853515625,
|
|
"epoch": 1.220150909897914,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004985262423479408,
|
|
"loss": 6.4274,
|
|
"mean_token_accuracy": 0.13895628824830056,
|
|
"num_tokens": 2832582.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.52580771446228,
|
|
"epoch": 1.2245894363071461,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004984866181875021,
|
|
"loss": 6.4579,
|
|
"mean_token_accuracy": 0.12877390310168266,
|
|
"num_tokens": 2843576.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.516999197006226,
|
|
"epoch": 1.229027962716378,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004984464701897005,
|
|
"loss": 6.456,
|
|
"mean_token_accuracy": 0.12886594235897064,
|
|
"num_tokens": 2854028.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.550729846954345,
|
|
"epoch": 1.2334664891256102,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004984057984486402,
|
|
"loss": 6.4491,
|
|
"mean_token_accuracy": 0.1290650874376297,
|
|
"num_tokens": 2863695.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.497787046432495,
|
|
"epoch": 1.2379050155348423,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004983646030596527,
|
|
"loss": 6.4078,
|
|
"mean_token_accuracy": 0.12960500344634057,
|
|
"num_tokens": 2873134.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.530357122421265,
|
|
"epoch": 1.2423435419440745,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004983228841192975,
|
|
"loss": 6.4504,
|
|
"mean_token_accuracy": 0.12851642668247223,
|
|
"num_tokens": 2883559.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.488299894332886,
|
|
"epoch": 1.2467820683533066,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004982806417253607,
|
|
"loss": 6.422,
|
|
"mean_token_accuracy": 0.12727490290999413,
|
|
"num_tokens": 2893541.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.5642862796783445,
|
|
"epoch": 1.2512205947625388,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004982378759768557,
|
|
"loss": 6.459,
|
|
"mean_token_accuracy": 0.12929099127650262,
|
|
"num_tokens": 2903390.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.462419414520264,
|
|
"epoch": 1.255659121171771,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004981945869740225,
|
|
"loss": 6.3934,
|
|
"mean_token_accuracy": 0.13202970251441,
|
|
"num_tokens": 2913071.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.547803783416748,
|
|
"epoch": 1.260097647581003,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004981507748183276,
|
|
"loss": 6.5538,
|
|
"mean_token_accuracy": 0.12963883131742476,
|
|
"num_tokens": 2925266.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.489030170440674,
|
|
"epoch": 1.2645361739902352,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004981064396124635,
|
|
"loss": 6.4396,
|
|
"mean_token_accuracy": 0.12705525755882263,
|
|
"num_tokens": 2935347.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 6.553302574157715,
|
|
"epoch": 1.2689747003994674,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004980615814603492,
|
|
"loss": 6.5228,
|
|
"mean_token_accuracy": 0.12255004495382309,
|
|
"num_tokens": 2945381.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.548076343536377,
|
|
"epoch": 1.2734132268086995,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004980162004671288,
|
|
"loss": 6.4853,
|
|
"mean_token_accuracy": 0.12323620095849037,
|
|
"num_tokens": 2956332.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.490498161315918,
|
|
"epoch": 1.2778517532179317,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004979702967391725,
|
|
"loss": 6.4637,
|
|
"mean_token_accuracy": 0.1297840654850006,
|
|
"num_tokens": 2966563.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.459001588821411,
|
|
"epoch": 1.2822902796271638,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004979238703840755,
|
|
"loss": 6.4291,
|
|
"mean_token_accuracy": 0.13188086450099945,
|
|
"num_tokens": 2976078.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.535675382614135,
|
|
"epoch": 1.286728806036396,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004978769215106579,
|
|
"loss": 6.51,
|
|
"mean_token_accuracy": 0.11516684889793397,
|
|
"num_tokens": 2985889.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.561489534378052,
|
|
"epoch": 1.291167332445628,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004978294502289646,
|
|
"loss": 6.4789,
|
|
"mean_token_accuracy": 0.12259078919887542,
|
|
"num_tokens": 2996244.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.490956830978393,
|
|
"epoch": 1.2956058588548602,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004977814566502651,
|
|
"loss": 6.4193,
|
|
"mean_token_accuracy": 0.12861331328749656,
|
|
"num_tokens": 3006212.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.499041128158569,
|
|
"epoch": 1.3000443852640924,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004977329408870532,
|
|
"loss": 6.409,
|
|
"mean_token_accuracy": 0.12722128033638,
|
|
"num_tokens": 3016763.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 6.4857086658477785,
|
|
"epoch": 1.3044829116733245,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004976839030530464,
|
|
"loss": 6.3783,
|
|
"mean_token_accuracy": 0.13740343004465103,
|
|
"num_tokens": 3027111.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.542345571517944,
|
|
"epoch": 1.3089214380825567,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000497634343263186,
|
|
"loss": 6.4623,
|
|
"mean_token_accuracy": 0.12753049805760383,
|
|
"num_tokens": 3037549.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.353925800323486,
|
|
"epoch": 1.3133599644917888,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004975842616336369,
|
|
"loss": 6.386,
|
|
"mean_token_accuracy": 0.13300835117697715,
|
|
"num_tokens": 3048033.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.501514005661011,
|
|
"epoch": 1.317798490901021,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004975336582817869,
|
|
"loss": 6.3997,
|
|
"mean_token_accuracy": 0.13204055801033973,
|
|
"num_tokens": 3057503.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.487248039245605,
|
|
"epoch": 1.3222370173102531,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004974825333262469,
|
|
"loss": 6.4642,
|
|
"mean_token_accuracy": 0.12323634922504426,
|
|
"num_tokens": 3068216.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 6.558629322052002,
|
|
"epoch": 1.3266755437194853,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004974308868868501,
|
|
"loss": 6.4271,
|
|
"mean_token_accuracy": 0.13236989378929137,
|
|
"num_tokens": 3079471.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.5367296695709225,
|
|
"epoch": 1.3311140701287172,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004973787190846524,
|
|
"loss": 6.518,
|
|
"mean_token_accuracy": 0.12429615929722786,
|
|
"num_tokens": 3090996.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 1.3311140701287172,
|
|
"eval_entropy": 6.421620451639497,
|
|
"eval_loss": 6.5496826171875,
|
|
"eval_mean_token_accuracy": 0.12521972324955774,
|
|
"eval_num_tokens": 3090996.0,
|
|
"eval_runtime": 2.6959,
|
|
"eval_samples_per_second": 1248.929,
|
|
"eval_steps_per_second": 156.163,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.472316646575928,
|
|
"epoch": 1.3355525965379493,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004973260300419316,
|
|
"loss": 6.466,
|
|
"mean_token_accuracy": 0.1273823134601116,
|
|
"num_tokens": 3100445.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.405650186538696,
|
|
"epoch": 1.3399911229471815,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004972728198821871,
|
|
"loss": 6.3772,
|
|
"mean_token_accuracy": 0.13720163628458976,
|
|
"num_tokens": 3110065.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 6.48620924949646,
|
|
"epoch": 1.3444296493564136,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00049721908873014,
|
|
"loss": 6.4228,
|
|
"mean_token_accuracy": 0.12824928835034372,
|
|
"num_tokens": 3120323.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.523930549621582,
|
|
"epoch": 1.3488681757656458,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004971648367117323,
|
|
"loss": 6.464,
|
|
"mean_token_accuracy": 0.12202735692262649,
|
|
"num_tokens": 3131268.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.500436449050904,
|
|
"epoch": 1.353306702174878,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004971100639541271,
|
|
"loss": 6.3697,
|
|
"mean_token_accuracy": 0.13300676867365838,
|
|
"num_tokens": 3141529.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.385044431686401,
|
|
"epoch": 1.35774522858411,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000497054770585708,
|
|
"loss": 6.3884,
|
|
"mean_token_accuracy": 0.13427990674972534,
|
|
"num_tokens": 3151096.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 6.540951824188232,
|
|
"epoch": 1.3621837549933422,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004969989567360788,
|
|
"loss": 6.3651,
|
|
"mean_token_accuracy": 0.126102414727211,
|
|
"num_tokens": 3160900.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.315720701217652,
|
|
"epoch": 1.3666222814025744,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004969426225360635,
|
|
"loss": 6.3444,
|
|
"mean_token_accuracy": 0.1334808275103569,
|
|
"num_tokens": 3171303.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.431712341308594,
|
|
"epoch": 1.3710608078118065,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004968857681177056,
|
|
"loss": 6.4942,
|
|
"mean_token_accuracy": 0.12975035086274148,
|
|
"num_tokens": 3181924.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.435882043838501,
|
|
"epoch": 1.3754993342210386,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004968283936142679,
|
|
"loss": 6.359,
|
|
"mean_token_accuracy": 0.13290246427059174,
|
|
"num_tokens": 3192018.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 6.475548458099365,
|
|
"epoch": 1.3799378606302708,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004967704991602322,
|
|
"loss": 6.3652,
|
|
"mean_token_accuracy": 0.1294732205569744,
|
|
"num_tokens": 3203064.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.439318323135376,
|
|
"epoch": 1.384376387039503,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004967120848912995,
|
|
"loss": 6.3961,
|
|
"mean_token_accuracy": 0.12799521535634995,
|
|
"num_tokens": 3213651.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.372346305847168,
|
|
"epoch": 1.388814913448735,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004966531509443884,
|
|
"loss": 6.3479,
|
|
"mean_token_accuracy": 0.13649084344506263,
|
|
"num_tokens": 3224152.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.471084785461426,
|
|
"epoch": 1.3932534398579672,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004965936974576363,
|
|
"loss": 6.3545,
|
|
"mean_token_accuracy": 0.13298841714859008,
|
|
"num_tokens": 3234185.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.455093669891357,
|
|
"epoch": 1.3976919662671992,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004965337245703981,
|
|
"loss": 6.3767,
|
|
"mean_token_accuracy": 0.12946312502026558,
|
|
"num_tokens": 3244509.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.458269500732422,
|
|
"epoch": 1.4021304926764313,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004964732324232462,
|
|
"loss": 6.4008,
|
|
"mean_token_accuracy": 0.12682827115058898,
|
|
"num_tokens": 3255157.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 6.34567403793335,
|
|
"epoch": 1.4065690190856635,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00049641222115797,
|
|
"loss": 6.2956,
|
|
"mean_token_accuracy": 0.13407586440443992,
|
|
"num_tokens": 3264367.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 6.4444191455841064,
|
|
"epoch": 1.4110075454948956,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004963506909175758,
|
|
"loss": 6.3853,
|
|
"mean_token_accuracy": 0.12875387147068978,
|
|
"num_tokens": 3274678.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.426648998260498,
|
|
"epoch": 1.4154460719041277,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000496288641846286,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.1277147874236107,
|
|
"num_tokens": 3285817.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.372090244293213,
|
|
"epoch": 1.41988459831336,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004962260740895398,
|
|
"loss": 6.2855,
|
|
"mean_token_accuracy": 0.13827268779277802,
|
|
"num_tokens": 3296303.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.379140472412109,
|
|
"epoch": 1.424323124722592,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004961629877939913,
|
|
"loss": 6.3871,
|
|
"mean_token_accuracy": 0.1381452649831772,
|
|
"num_tokens": 3305686.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.410601949691772,
|
|
"epoch": 1.4287616511318242,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000496099383107511,
|
|
"loss": 6.3337,
|
|
"mean_token_accuracy": 0.13385034054517747,
|
|
"num_tokens": 3316243.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.363243675231933,
|
|
"epoch": 1.4332001775410563,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004960352601791835,
|
|
"loss": 6.3509,
|
|
"mean_token_accuracy": 0.1326597101986408,
|
|
"num_tokens": 3326118.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.420337390899658,
|
|
"epoch": 1.4376387039502885,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004959706191593087,
|
|
"loss": 6.2826,
|
|
"mean_token_accuracy": 0.139851226657629,
|
|
"num_tokens": 3336597.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 6.367270183563233,
|
|
"epoch": 1.4420772303595206,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004959054601994007,
|
|
"loss": 6.3475,
|
|
"mean_token_accuracy": 0.13378802165389062,
|
|
"num_tokens": 3346958.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 6.393503141403198,
|
|
"epoch": 1.4465157567687528,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004958397834521878,
|
|
"loss": 6.3568,
|
|
"mean_token_accuracy": 0.1363594651222229,
|
|
"num_tokens": 3357068.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 6.357707118988037,
|
|
"epoch": 1.450954283177985,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004957735890716115,
|
|
"loss": 6.3272,
|
|
"mean_token_accuracy": 0.1293055720627308,
|
|
"num_tokens": 3367710.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.438919878005981,
|
|
"epoch": 1.455392809587217,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004957068772128273,
|
|
"loss": 6.3926,
|
|
"mean_token_accuracy": 0.12550436183810235,
|
|
"num_tokens": 3377146.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.4241721630096436,
|
|
"epoch": 1.4598313359964492,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000495639648032203,
|
|
"loss": 6.2687,
|
|
"mean_token_accuracy": 0.13697705715894698,
|
|
"num_tokens": 3387494.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 6.404942893981934,
|
|
"epoch": 1.4642698624056814,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004955719016873192,
|
|
"loss": 6.271,
|
|
"mean_token_accuracy": 0.1324605606496334,
|
|
"num_tokens": 3397667.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.341697072982788,
|
|
"epoch": 1.4687083888149135,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004955036383369688,
|
|
"loss": 6.2882,
|
|
"mean_token_accuracy": 0.13828188329935073,
|
|
"num_tokens": 3407245.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 6.33912615776062,
|
|
"epoch": 1.4731469152241456,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004954348581411564,
|
|
"loss": 6.3502,
|
|
"mean_token_accuracy": 0.13207383826375008,
|
|
"num_tokens": 3417796.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.365179395675659,
|
|
"epoch": 1.4775854416333778,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000495365561261098,
|
|
"loss": 6.3521,
|
|
"mean_token_accuracy": 0.13066228553652764,
|
|
"num_tokens": 3427665.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 6.460514163970947,
|
|
"epoch": 1.48202396804261,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004952957478592209,
|
|
"loss": 6.4161,
|
|
"mean_token_accuracy": 0.13068753182888032,
|
|
"num_tokens": 3438279.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 6.346782398223877,
|
|
"epoch": 1.486462494451842,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004952254180991628,
|
|
"loss": 6.3924,
|
|
"mean_token_accuracy": 0.1330470062792301,
|
|
"num_tokens": 3448722.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.355397272109985,
|
|
"epoch": 1.4909010208610742,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004951545721457719,
|
|
"loss": 6.3045,
|
|
"mean_token_accuracy": 0.14068271815776826,
|
|
"num_tokens": 3459050.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 6.3841273307800295,
|
|
"epoch": 1.4953395472703064,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004950832101651062,
|
|
"loss": 6.2644,
|
|
"mean_token_accuracy": 0.13605008125305176,
|
|
"num_tokens": 3468833.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 6.393172645568848,
|
|
"epoch": 1.4997780736795385,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004950113323244336,
|
|
"loss": 6.3353,
|
|
"mean_token_accuracy": 0.13272473365068435,
|
|
"num_tokens": 3479119.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.422500705718994,
|
|
"epoch": 1.5042166000887707,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004949389387922305,
|
|
"loss": 6.3001,
|
|
"mean_token_accuracy": 0.13518199026584626,
|
|
"num_tokens": 3490339.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 6.375849771499634,
|
|
"epoch": 1.5086551264980028,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004948660297381826,
|
|
"loss": 6.2959,
|
|
"mean_token_accuracy": 0.13820037841796876,
|
|
"num_tokens": 3500645.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 6.326462697982788,
|
|
"epoch": 1.5130936529072347,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004947926053331836,
|
|
"loss": 6.273,
|
|
"mean_token_accuracy": 0.139491256326437,
|
|
"num_tokens": 3510393.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.408394193649292,
|
|
"epoch": 1.517532179316467,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004947186657493354,
|
|
"loss": 6.2666,
|
|
"mean_token_accuracy": 0.14247287064790726,
|
|
"num_tokens": 3520707.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 6.333920478820801,
|
|
"epoch": 1.521970705725699,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004946442111599473,
|
|
"loss": 6.4165,
|
|
"mean_token_accuracy": 0.13150266110897063,
|
|
"num_tokens": 3532101.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.405943059921265,
|
|
"epoch": 1.5264092321349312,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004945692417395358,
|
|
"loss": 6.2607,
|
|
"mean_token_accuracy": 0.13934548795223237,
|
|
"num_tokens": 3541270.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.301887083053589,
|
|
"epoch": 1.5308477585441633,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000494493757663824,
|
|
"loss": 6.3411,
|
|
"mean_token_accuracy": 0.13587306886911393,
|
|
"num_tokens": 3550959.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.384119939804077,
|
|
"epoch": 1.5352862849533955,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004944177591097415,
|
|
"loss": 6.3751,
|
|
"mean_token_accuracy": 0.13755866140127182,
|
|
"num_tokens": 3561853.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 6.344173955917358,
|
|
"epoch": 1.5397248113626276,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004943412462554236,
|
|
"loss": 6.3123,
|
|
"mean_token_accuracy": 0.13452489599585532,
|
|
"num_tokens": 3573060.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.308044004440307,
|
|
"epoch": 1.5441633377718598,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004942642192802114,
|
|
"loss": 6.328,
|
|
"mean_token_accuracy": 0.1374310664832592,
|
|
"num_tokens": 3582777.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 6.439042711257935,
|
|
"epoch": 1.548601864181092,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004941866783646508,
|
|
"loss": 6.3345,
|
|
"mean_token_accuracy": 0.13529076278209687,
|
|
"num_tokens": 3592978.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.348781871795654,
|
|
"epoch": 1.553040390590324,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004941086236904923,
|
|
"loss": 6.3061,
|
|
"mean_token_accuracy": 0.13936796635389329,
|
|
"num_tokens": 3603355.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.436870050430298,
|
|
"epoch": 1.557478916999556,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004940300554406909,
|
|
"loss": 6.3498,
|
|
"mean_token_accuracy": 0.1272510677576065,
|
|
"num_tokens": 3614843.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 6.3685750484466555,
|
|
"epoch": 1.5619174434087881,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000493950973799405,
|
|
"loss": 6.2738,
|
|
"mean_token_accuracy": 0.14151667505502702,
|
|
"num_tokens": 3623953.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.366236734390259,
|
|
"epoch": 1.5663559698180203,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004938713789519967,
|
|
"loss": 6.3528,
|
|
"mean_token_accuracy": 0.13301268741488456,
|
|
"num_tokens": 3634762.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.44322018623352,
|
|
"epoch": 1.5707944962272524,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004937912710850309,
|
|
"loss": 6.3909,
|
|
"mean_token_accuracy": 0.12702670469880104,
|
|
"num_tokens": 3645597.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 6.3498796939849855,
|
|
"epoch": 1.5752330226364846,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004937106503862749,
|
|
"loss": 6.2962,
|
|
"mean_token_accuracy": 0.1402463473379612,
|
|
"num_tokens": 3655895.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.3070460796356205,
|
|
"epoch": 1.5796715490457167,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004936295170446981,
|
|
"loss": 6.2705,
|
|
"mean_token_accuracy": 0.13688953965902328,
|
|
"num_tokens": 3667181.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 6.274955320358276,
|
|
"epoch": 1.5841100754549489,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004935478712504715,
|
|
"loss": 6.2313,
|
|
"mean_token_accuracy": 0.14355697929859162,
|
|
"num_tokens": 3676675.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.3787109375,
|
|
"epoch": 1.588548601864181,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004934657131949674,
|
|
"loss": 6.293,
|
|
"mean_token_accuracy": 0.13846610561013223,
|
|
"num_tokens": 3687354.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 6.278066110610962,
|
|
"epoch": 1.5929871282734132,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004933830430707585,
|
|
"loss": 6.3331,
|
|
"mean_token_accuracy": 0.1389099143445492,
|
|
"num_tokens": 3696762.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.403505325317383,
|
|
"epoch": 1.5974256546826453,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000493299861071618,
|
|
"loss": 6.3193,
|
|
"mean_token_accuracy": 0.13765995875000953,
|
|
"num_tokens": 3706671.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.346765232086182,
|
|
"epoch": 1.6018641810918774,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004932161673925189,
|
|
"loss": 6.3211,
|
|
"mean_token_accuracy": 0.14222623705863952,
|
|
"num_tokens": 3716047.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 6.480462837219238,
|
|
"epoch": 1.6063027075011096,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004931319622296333,
|
|
"loss": 6.3733,
|
|
"mean_token_accuracy": 0.12890343070030214,
|
|
"num_tokens": 3728249.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.327421188354492,
|
|
"epoch": 1.6107412339103417,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004930472457803324,
|
|
"loss": 6.2919,
|
|
"mean_token_accuracy": 0.14020831808447837,
|
|
"num_tokens": 3739164.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.408966207504273,
|
|
"epoch": 1.6151797603195739,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004929620182431858,
|
|
"loss": 6.303,
|
|
"mean_token_accuracy": 0.142412880808115,
|
|
"num_tokens": 3749190.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.261825037002564,
|
|
"epoch": 1.619618286728806,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004928762798179612,
|
|
"loss": 6.2169,
|
|
"mean_token_accuracy": 0.1475951187312603,
|
|
"num_tokens": 3760265.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 6.274430656433106,
|
|
"epoch": 1.6240568131380382,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004927900307056233,
|
|
"loss": 6.2945,
|
|
"mean_token_accuracy": 0.13552614152431489,
|
|
"num_tokens": 3771068.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.3409483432769775,
|
|
"epoch": 1.6284953395472703,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004927032711083342,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.13993098884820937,
|
|
"num_tokens": 3781230.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.295605039596557,
|
|
"epoch": 1.6329338659565025,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004926160012294526,
|
|
"loss": 6.2502,
|
|
"mean_token_accuracy": 0.14423105642199516,
|
|
"num_tokens": 3791435.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.265171527862549,
|
|
"epoch": 1.6373723923657346,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000492528221273533,
|
|
"loss": 6.2049,
|
|
"mean_token_accuracy": 0.14195780605077743,
|
|
"num_tokens": 3801680.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 6.373475074768066,
|
|
"epoch": 1.6418109187749668,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004924399314463258,
|
|
"loss": 6.3058,
|
|
"mean_token_accuracy": 0.13744521513581276,
|
|
"num_tokens": 3812005.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.294007301330566,
|
|
"epoch": 1.646249445184199,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004923511319547761,
|
|
"loss": 6.2355,
|
|
"mean_token_accuracy": 0.1440819539129734,
|
|
"num_tokens": 3821682.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 6.319647216796875,
|
|
"epoch": 1.650687971593431,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000492261823007024,
|
|
"loss": 6.2157,
|
|
"mean_token_accuracy": 0.14868459478020668,
|
|
"num_tokens": 3831725.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.311188554763794,
|
|
"epoch": 1.6551264980026632,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004921720048124034,
|
|
"loss": 6.2569,
|
|
"mean_token_accuracy": 0.13653967306017875,
|
|
"num_tokens": 3840647.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.402250814437866,
|
|
"epoch": 1.6595650244118954,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004920816775814422,
|
|
"loss": 6.3124,
|
|
"mean_token_accuracy": 0.1325970098376274,
|
|
"num_tokens": 3852869.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.3165970802307125,
|
|
"epoch": 1.6640035508211275,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004919908415258612,
|
|
"loss": 6.2912,
|
|
"mean_token_accuracy": 0.14089620634913444,
|
|
"num_tokens": 3863484.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.288156318664551,
|
|
"epoch": 1.6684420772303596,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000491899496858574,
|
|
"loss": 6.2841,
|
|
"mean_token_accuracy": 0.13467081785202026,
|
|
"num_tokens": 3874564.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 6.395035028457642,
|
|
"epoch": 1.6728806036395918,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004918076437936859,
|
|
"loss": 6.3119,
|
|
"mean_token_accuracy": 0.1333139009773731,
|
|
"num_tokens": 3884315.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.327268505096436,
|
|
"epoch": 1.677319130048824,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004917152825464947,
|
|
"loss": 6.2965,
|
|
"mean_token_accuracy": 0.13294868022203446,
|
|
"num_tokens": 3893948.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 6.396142435073853,
|
|
"epoch": 1.681757656458056,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004916224133334885,
|
|
"loss": 6.311,
|
|
"mean_token_accuracy": 0.13014644309878348,
|
|
"num_tokens": 3905099.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.286337661743164,
|
|
"epoch": 1.686196182867288,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004915290363723465,
|
|
"loss": 6.2342,
|
|
"mean_token_accuracy": 0.14227957800030708,
|
|
"num_tokens": 3914674.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.324175691604614,
|
|
"epoch": 1.6906347092765202,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004914351518819379,
|
|
"loss": 6.2272,
|
|
"mean_token_accuracy": 0.14022424072027206,
|
|
"num_tokens": 3925096.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.305720806121826,
|
|
"epoch": 1.6950732356857523,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004913407600823216,
|
|
"loss": 6.2887,
|
|
"mean_token_accuracy": 0.1422324001789093,
|
|
"num_tokens": 3935048.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.279489135742187,
|
|
"epoch": 1.6995117620949844,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004912458611947454,
|
|
"loss": 6.2333,
|
|
"mean_token_accuracy": 0.14147737249732018,
|
|
"num_tokens": 3944021.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.27567949295044,
|
|
"epoch": 1.7039502885042166,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000491150455441646,
|
|
"loss": 6.166,
|
|
"mean_token_accuracy": 0.14739958047866822,
|
|
"num_tokens": 3953587.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 6.247754430770874,
|
|
"epoch": 1.7083888149134487,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004910545430466478,
|
|
"loss": 6.2706,
|
|
"mean_token_accuracy": 0.13362218514084817,
|
|
"num_tokens": 3963981.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.270370864868164,
|
|
"epoch": 1.7128273413226809,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004909581242345628,
|
|
"loss": 6.2833,
|
|
"mean_token_accuracy": 0.14019264951348304,
|
|
"num_tokens": 3973720.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 6.295551729202271,
|
|
"epoch": 1.717265867731913,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004908611992313905,
|
|
"loss": 6.222,
|
|
"mean_token_accuracy": 0.14261915981769563,
|
|
"num_tokens": 3984579.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.264960384368896,
|
|
"epoch": 1.7217043941411452,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004907637682643162,
|
|
"loss": 6.245,
|
|
"mean_token_accuracy": 0.1404101848602295,
|
|
"num_tokens": 3994609.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 6.302646636962891,
|
|
"epoch": 1.7261429205503773,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004906658315617112,
|
|
"loss": 6.2902,
|
|
"mean_token_accuracy": 0.13819315508008004,
|
|
"num_tokens": 4004969.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.248818016052246,
|
|
"epoch": 1.7305814469596092,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004905673893531331,
|
|
"loss": 6.3268,
|
|
"mean_token_accuracy": 0.1326567329466343,
|
|
"num_tokens": 4016098.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 6.397868633270264,
|
|
"epoch": 1.7350199733688414,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004904684418693231,
|
|
"loss": 6.233,
|
|
"mean_token_accuracy": 0.14564677476882934,
|
|
"num_tokens": 4025744.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.238390398025513,
|
|
"epoch": 1.7394584997780735,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004903689893422077,
|
|
"loss": 6.2537,
|
|
"mean_token_accuracy": 0.13860218822956086,
|
|
"num_tokens": 4036532.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 6.4320872783660885,
|
|
"epoch": 1.7438970261873057,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004902690320048966,
|
|
"loss": 6.3386,
|
|
"mean_token_accuracy": 0.13317947015166282,
|
|
"num_tokens": 4047350.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.341959428787232,
|
|
"epoch": 1.7483355525965378,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000490168570091683,
|
|
"loss": 6.3134,
|
|
"mean_token_accuracy": 0.14479754120111465,
|
|
"num_tokens": 4058223.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.26735486984253,
|
|
"epoch": 1.75277407900577,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004900676038380429,
|
|
"loss": 6.2377,
|
|
"mean_token_accuracy": 0.1400671385228634,
|
|
"num_tokens": 4067741.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.2349577903747555,
|
|
"epoch": 1.7572126054150021,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004899661334806342,
|
|
"loss": 6.2507,
|
|
"mean_token_accuracy": 0.1395649529993534,
|
|
"num_tokens": 4078598.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.328679370880127,
|
|
"epoch": 1.7616511318242343,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004898641592572965,
|
|
"loss": 6.2545,
|
|
"mean_token_accuracy": 0.1380497135221958,
|
|
"num_tokens": 4089230.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.289399909973144,
|
|
"epoch": 1.7660896582334664,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004897616814070505,
|
|
"loss": 6.1316,
|
|
"mean_token_accuracy": 0.14506224393844605,
|
|
"num_tokens": 4099104.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.196705055236817,
|
|
"epoch": 1.7705281846426986,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004896587001700972,
|
|
"loss": 6.2359,
|
|
"mean_token_accuracy": 0.13811009451746942,
|
|
"num_tokens": 4109008.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.3165913105010985,
|
|
"epoch": 1.7749667110519307,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004895552157878174,
|
|
"loss": 6.1727,
|
|
"mean_token_accuracy": 0.14556334167718887,
|
|
"num_tokens": 4118219.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 1.7749667110519307,
|
|
"eval_entropy": 6.189312974517533,
|
|
"eval_loss": 6.335569858551025,
|
|
"eval_mean_token_accuracy": 0.136928480658282,
|
|
"eval_num_tokens": 4118219.0,
|
|
"eval_runtime": 2.7093,
|
|
"eval_samples_per_second": 1242.755,
|
|
"eval_steps_per_second": 155.39,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.294293546676636,
|
|
"epoch": 1.7794052374611629,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004894512285027717,
|
|
"loss": 6.1793,
|
|
"mean_token_accuracy": 0.14657135903835297,
|
|
"num_tokens": 4127255.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.239873313903809,
|
|
"epoch": 1.783843763870395,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004893467385586991,
|
|
"loss": 6.1614,
|
|
"mean_token_accuracy": 0.14499758780002595,
|
|
"num_tokens": 4137222.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.136928653717041,
|
|
"epoch": 1.7882822902796272,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000489241746200517,
|
|
"loss": 6.1773,
|
|
"mean_token_accuracy": 0.14779955595731736,
|
|
"num_tokens": 4147746.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.287437057495117,
|
|
"epoch": 1.7927208166888593,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004891362516743201,
|
|
"loss": 6.2624,
|
|
"mean_token_accuracy": 0.13894592374563217,
|
|
"num_tokens": 4157270.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.25756139755249,
|
|
"epoch": 1.7971593430980914,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004890302552273805,
|
|
"loss": 6.1967,
|
|
"mean_token_accuracy": 0.14151124581694602,
|
|
"num_tokens": 4167239.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.1199119091033936,
|
|
"epoch": 1.8015978695073236,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004889237571081465,
|
|
"loss": 6.1876,
|
|
"mean_token_accuracy": 0.14599697291851044,
|
|
"num_tokens": 4177829.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.389132165908814,
|
|
"epoch": 1.8060363959165557,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004888167575662425,
|
|
"loss": 6.2991,
|
|
"mean_token_accuracy": 0.13579059466719628,
|
|
"num_tokens": 4189015.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.2341320514678955,
|
|
"epoch": 1.8104749223257879,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004887092568524682,
|
|
"loss": 6.252,
|
|
"mean_token_accuracy": 0.13997769802808763,
|
|
"num_tokens": 4198895.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.282239961624145,
|
|
"epoch": 1.81491344873502,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004886012552187979,
|
|
"loss": 6.2221,
|
|
"mean_token_accuracy": 0.14225052297115326,
|
|
"num_tokens": 4209845.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.251390075683593,
|
|
"epoch": 1.8193519751442522,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004884927529183799,
|
|
"loss": 6.1844,
|
|
"mean_token_accuracy": 0.14328595399856567,
|
|
"num_tokens": 4220065.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.233511972427368,
|
|
"epoch": 1.8237905015534843,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004883837502055363,
|
|
"loss": 6.2135,
|
|
"mean_token_accuracy": 0.14167198091745375,
|
|
"num_tokens": 4229720.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.30111985206604,
|
|
"epoch": 1.8282290279627165,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004882742473357619,
|
|
"loss": 6.22,
|
|
"mean_token_accuracy": 0.13643964901566505,
|
|
"num_tokens": 4239585.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.267259979248047,
|
|
"epoch": 1.8326675543719486,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048816424456572403,
|
|
"loss": 6.2476,
|
|
"mean_token_accuracy": 0.14258809238672257,
|
|
"num_tokens": 4250294.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.305874967575074,
|
|
"epoch": 1.8371060807811808,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004880537421532618,
|
|
"loss": 6.1402,
|
|
"mean_token_accuracy": 0.14959779605269433,
|
|
"num_tokens": 4260089.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.234825468063354,
|
|
"epoch": 1.841544607190413,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00048794274035738515,
|
|
"loss": 6.1932,
|
|
"mean_token_accuracy": 0.1468948632478714,
|
|
"num_tokens": 4270282.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 6.299134731292725,
|
|
"epoch": 1.845983133599645,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004878312394382747,
|
|
"loss": 6.2185,
|
|
"mean_token_accuracy": 0.13943059742450714,
|
|
"num_tokens": 4279308.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.163238048553467,
|
|
"epoch": 1.8504216600088772,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000487719239657281,
|
|
"loss": 6.1957,
|
|
"mean_token_accuracy": 0.14037612825632095,
|
|
"num_tokens": 4291101.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 6.286023044586182,
|
|
"epoch": 1.8548601864181093,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000487606741276924,
|
|
"loss": 6.1967,
|
|
"mean_token_accuracy": 0.143647962808609,
|
|
"num_tokens": 4301479.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.24072036743164,
|
|
"epoch": 1.8592987128273413,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004874937445608921,
|
|
"loss": 6.1618,
|
|
"mean_token_accuracy": 0.14226512238383293,
|
|
"num_tokens": 4310876.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 6.294512367248535,
|
|
"epoch": 1.8637372392365734,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004873802497740418,
|
|
"loss": 6.1967,
|
|
"mean_token_accuracy": 0.14145390689373016,
|
|
"num_tokens": 4320788.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.25504732131958,
|
|
"epoch": 1.8681757656458056,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004872662571823973,
|
|
"loss": 6.1915,
|
|
"mean_token_accuracy": 0.14332777559757232,
|
|
"num_tokens": 4331609.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.1963708877563475,
|
|
"epoch": 1.8726142920550377,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048715176705314936,
|
|
"loss": 6.1427,
|
|
"mean_token_accuracy": 0.14273860454559326,
|
|
"num_tokens": 4341495.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.178388929367065,
|
|
"epoch": 1.8770528184642699,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00048703677965465506,
|
|
"loss": 6.1335,
|
|
"mean_token_accuracy": 0.15152502655982972,
|
|
"num_tokens": 4351827.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.253129768371582,
|
|
"epoch": 1.881491344873502,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00048692129525643694,
|
|
"loss": 6.2925,
|
|
"mean_token_accuracy": 0.13464196175336837,
|
|
"num_tokens": 4363291.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 6.251963663101196,
|
|
"epoch": 1.8859298712827341,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00048680531412918267,
|
|
"loss": 6.1861,
|
|
"mean_token_accuracy": 0.14269427880644797,
|
|
"num_tokens": 4373458.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.263167381286621,
|
|
"epoch": 1.8903683976919663,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004866888365447439,
|
|
"loss": 6.1529,
|
|
"mean_token_accuracy": 0.1422121912240982,
|
|
"num_tokens": 4383562.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.234077024459839,
|
|
"epoch": 1.8948069241011984,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004865718627761363,
|
|
"loss": 6.2679,
|
|
"mean_token_accuracy": 0.13356237038969992,
|
|
"num_tokens": 4394970.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.317501831054687,
|
|
"epoch": 1.8992454505104306,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004864543930975383,
|
|
"loss": 6.2377,
|
|
"mean_token_accuracy": 0.13947510719299316,
|
|
"num_tokens": 4405117.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.127161931991577,
|
|
"epoch": 1.9036839769196625,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004863364277842908,
|
|
"loss": 6.1427,
|
|
"mean_token_accuracy": 0.14334554746747016,
|
|
"num_tokens": 4416392.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 6.275495529174805,
|
|
"epoch": 1.9081225033288947,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004862179671128965,
|
|
"loss": 6.1993,
|
|
"mean_token_accuracy": 0.13783841133117675,
|
|
"num_tokens": 4426309.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.237747573852539,
|
|
"epoch": 1.9125610297381268,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000486099011361019,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.1414594329893589,
|
|
"num_tokens": 4437044.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.329879093170166,
|
|
"epoch": 1.916999556147359,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048597956080748264,
|
|
"loss": 6.2209,
|
|
"mean_token_accuracy": 0.14464983716607094,
|
|
"num_tokens": 4447391.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.203670978546143,
|
|
"epoch": 1.921438082556591,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00048585961573227116,
|
|
"loss": 6.1001,
|
|
"mean_token_accuracy": 0.145625601708889,
|
|
"num_tokens": 4457465.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.1996794700622555,
|
|
"epoch": 1.9258766089658232,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004857391764165277,
|
|
"loss": 6.1805,
|
|
"mean_token_accuracy": 0.14704733341932297,
|
|
"num_tokens": 4467798.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.195384168624878,
|
|
"epoch": 1.9303151353750554,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048561824314255383,
|
|
"loss": 6.1378,
|
|
"mean_token_accuracy": 0.15038661435246467,
|
|
"num_tokens": 4478789.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.092350435256958,
|
|
"epoch": 1.9347536617842875,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 0.00048549681619380886,
|
|
"loss": 6.1211,
|
|
"mean_token_accuracy": 0.14591658264398574,
|
|
"num_tokens": 4490521.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 6.228357648849487,
|
|
"epoch": 1.9391921881935197,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004853748958549092,
|
|
"loss": 6.1215,
|
|
"mean_token_accuracy": 0.14524291455745697,
|
|
"num_tokens": 4499484.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.248248529434204,
|
|
"epoch": 1.9436307146027518,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004852524824116278,
|
|
"loss": 6.1538,
|
|
"mean_token_accuracy": 0.14293037131428718,
|
|
"num_tokens": 4509329.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.160349798202515,
|
|
"epoch": 1.948069241011984,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048512957615089354,
|
|
"loss": 6.2247,
|
|
"mean_token_accuracy": 0.14221593588590623,
|
|
"num_tokens": 4518806.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 6.36239857673645,
|
|
"epoch": 1.9525077674212161,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004850061773607902,
|
|
"loss": 6.3015,
|
|
"mean_token_accuracy": 0.13219987377524375,
|
|
"num_tokens": 4530760.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.284463357925415,
|
|
"epoch": 1.9569462938304483,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000484882286330556,
|
|
"loss": 6.2875,
|
|
"mean_token_accuracy": 0.1374896213412285,
|
|
"num_tokens": 4541754.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.271965026855469,
|
|
"epoch": 1.9613848202396804,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004847579033505833,
|
|
"loss": 6.1348,
|
|
"mean_token_accuracy": 0.1421991430222988,
|
|
"num_tokens": 4553124.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.1756409168243405,
|
|
"epoch": 1.9658233466489126,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004846330287124171,
|
|
"loss": 6.0553,
|
|
"mean_token_accuracy": 0.14253825396299363,
|
|
"num_tokens": 4563558.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.236325645446778,
|
|
"epoch": 1.9702618730581447,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00048450766270875513,
|
|
"loss": 6.2018,
|
|
"mean_token_accuracy": 0.13894723802804948,
|
|
"num_tokens": 4572584.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.235476398468018,
|
|
"epoch": 1.9747003994673769,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00048438180563344666,
|
|
"loss": 6.166,
|
|
"mean_token_accuracy": 0.14769693315029145,
|
|
"num_tokens": 4583009.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.15409779548645,
|
|
"epoch": 1.979138925876609,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00048425545778149213,
|
|
"loss": 6.0949,
|
|
"mean_token_accuracy": 0.14991173148155212,
|
|
"num_tokens": 4593073.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.135072088241577,
|
|
"epoch": 1.9835774522858411,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004841286194490423,
|
|
"loss": 6.0433,
|
|
"mean_token_accuracy": 0.14960258230566978,
|
|
"num_tokens": 4602419.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 6.148426246643067,
|
|
"epoch": 1.9880159786950733,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00048400129093339745,
|
|
"loss": 6.0559,
|
|
"mean_token_accuracy": 0.147773315012455,
|
|
"num_tokens": 4613023.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.228465175628662,
|
|
"epoch": 1.9924545051043054,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00048387347253300703,
|
|
"loss": 6.1037,
|
|
"mean_token_accuracy": 0.14951256513595582,
|
|
"num_tokens": 4622202.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.119011068344117,
|
|
"epoch": 1.9968930315135376,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004837451645474685,
|
|
"loss": 6.1319,
|
|
"mean_token_accuracy": 0.1470404915511608,
|
|
"num_tokens": 4632223.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 6.2560236189100475,
|
|
"epoch": 2.0008877052818463,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048361636727752716,
|
|
"loss": 6.0661,
|
|
"mean_token_accuracy": 0.14733944171004826,
|
|
"num_tokens": 4641379.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.137987041473389,
|
|
"epoch": 2.0053262316910785,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000483487081025075,
|
|
"loss": 5.756,
|
|
"mean_token_accuracy": 0.1647419661283493,
|
|
"num_tokens": 4650474.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.123887157440185,
|
|
"epoch": 2.0097647581003106,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048335730609315,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.16743734031915664,
|
|
"num_tokens": 4660151.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.119118976593017,
|
|
"epoch": 2.014203284509543,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00048322704278593595,
|
|
"loss": 5.8702,
|
|
"mean_token_accuracy": 0.14718232825398445,
|
|
"num_tokens": 4669852.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.116711235046386,
|
|
"epoch": 2.018641810918775,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048309629140876097,
|
|
"loss": 5.8726,
|
|
"mean_token_accuracy": 0.15764627158641814,
|
|
"num_tokens": 4679867.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.149226093292237,
|
|
"epoch": 2.023080337328007,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004829650522680974,
|
|
"loss": 5.7536,
|
|
"mean_token_accuracy": 0.1666225776076317,
|
|
"num_tokens": 4690866.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 6.088321590423584,
|
|
"epoch": 2.027518863737239,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004828333256715609,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.15734207332134248,
|
|
"num_tokens": 4701081.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.169612789154053,
|
|
"epoch": 2.0319573901464714,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004827011119279096,
|
|
"loss": 5.9393,
|
|
"mean_token_accuracy": 0.1523371458053589,
|
|
"num_tokens": 4712468.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.127353048324585,
|
|
"epoch": 2.0363959165557035,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048256841134704335,
|
|
"loss": 5.8486,
|
|
"mean_token_accuracy": 0.15824615359306335,
|
|
"num_tokens": 4722887.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.078661012649536,
|
|
"epoch": 2.0408344429649357,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048243522424000333,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.14893866032361985,
|
|
"num_tokens": 4733806.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 6.1255724906921385,
|
|
"epoch": 2.045272969374168,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000482301550918971,
|
|
"loss": 5.8143,
|
|
"mean_token_accuracy": 0.16233171075582503,
|
|
"num_tokens": 4744172.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.110927534103394,
|
|
"epoch": 2.0497114957834,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004821673916972676,
|
|
"loss": 5.8643,
|
|
"mean_token_accuracy": 0.15222925841808319,
|
|
"num_tokens": 4754543.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 6.109183931350708,
|
|
"epoch": 2.054150022192632,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000482032746889353,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.16298202574253082,
|
|
"num_tokens": 4765617.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.983950281143189,
|
|
"epoch": 2.0585885486018642,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048189761681082557,
|
|
"loss": 5.796,
|
|
"mean_token_accuracy": 0.158494932949543,
|
|
"num_tokens": 4775718.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.1368935108184814,
|
|
"epoch": 2.0630270750110964,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004817620017784209,
|
|
"loss": 5.8967,
|
|
"mean_token_accuracy": 0.14975014999508857,
|
|
"num_tokens": 4785651.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.024167013168335,
|
|
"epoch": 2.0674656014203285,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00048162590211001143,
|
|
"loss": 5.7429,
|
|
"mean_token_accuracy": 0.16594669073820115,
|
|
"num_tokens": 4795541.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.079076719284058,
|
|
"epoch": 2.0719041278295607,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00048148931812460536,
|
|
"loss": 5.8856,
|
|
"mean_token_accuracy": 0.15231603533029556,
|
|
"num_tokens": 4804863.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 6.1893517017364506,
|
|
"epoch": 2.076342654238793,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004813522501423464,
|
|
"loss": 5.8937,
|
|
"mean_token_accuracy": 0.1559199094772339,
|
|
"num_tokens": 4814782.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.05956449508667,
|
|
"epoch": 2.080781180648025,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004812146984845124,
|
|
"loss": 5.8515,
|
|
"mean_token_accuracy": 0.15324196219444275,
|
|
"num_tokens": 4825847.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.04329924583435,
|
|
"epoch": 2.085219707057257,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00048107666347351505,
|
|
"loss": 5.8137,
|
|
"mean_token_accuracy": 0.1576656773686409,
|
|
"num_tokens": 4836537.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 6.060811710357666,
|
|
"epoch": 2.0896582334664893,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048093814543289894,
|
|
"loss": 5.7875,
|
|
"mean_token_accuracy": 0.16412230134010314,
|
|
"num_tokens": 4847031.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.0803258419036865,
|
|
"epoch": 2.0940967598757214,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00048079914468734117,
|
|
"loss": 5.7767,
|
|
"mean_token_accuracy": 0.15763533413410186,
|
|
"num_tokens": 4857031.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.995853662490845,
|
|
"epoch": 2.0985352862849536,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048065966156264964,
|
|
"loss": 5.761,
|
|
"mean_token_accuracy": 0.16315652430057526,
|
|
"num_tokens": 4866413.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 5.984428453445434,
|
|
"epoch": 2.1029738126941857,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048051969638576345,
|
|
"loss": 5.8756,
|
|
"mean_token_accuracy": 0.15949649065732957,
|
|
"num_tokens": 4878840.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 6.032569789886475,
|
|
"epoch": 2.107412339103418,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048037924948475134,
|
|
"loss": 5.8749,
|
|
"mean_token_accuracy": 0.15843928158283233,
|
|
"num_tokens": 4889182.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.064680576324463,
|
|
"epoch": 2.11185086551265,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004802383211888114,
|
|
"loss": 5.8504,
|
|
"mean_token_accuracy": 0.15740898102521897,
|
|
"num_tokens": 4899497.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.0131433486938475,
|
|
"epoch": 2.116289391921882,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004800969118282697,
|
|
"loss": 5.8147,
|
|
"mean_token_accuracy": 0.15467424541711808,
|
|
"num_tokens": 4910232.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.156729316711425,
|
|
"epoch": 2.120727918331114,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004799550217345803,
|
|
"loss": 5.8762,
|
|
"mean_token_accuracy": 0.15463934987783431,
|
|
"num_tokens": 4920986.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.9624425888061525,
|
|
"epoch": 2.125166444740346,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047981265124032375,
|
|
"loss": 5.8132,
|
|
"mean_token_accuracy": 0.16584520637989045,
|
|
"num_tokens": 4930630.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.077665233612061,
|
|
"epoch": 2.129604971149578,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047966980067920686,
|
|
"loss": 5.8461,
|
|
"mean_token_accuracy": 0.1554732069373131,
|
|
"num_tokens": 4941414.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 6.0890580177307125,
|
|
"epoch": 2.1340434975588103,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00047952647038606157,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.15972182601690293,
|
|
"num_tokens": 4952087.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.965068292617798,
|
|
"epoch": 2.1384820239680424,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004793826606968443,
|
|
"loss": 5.7824,
|
|
"mean_token_accuracy": 0.16058602333068847,
|
|
"num_tokens": 4962340.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.062709331512451,
|
|
"epoch": 2.1429205503772746,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000479238371948635,
|
|
"loss": 5.8172,
|
|
"mean_token_accuracy": 0.15823266208171843,
|
|
"num_tokens": 4972793.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 6.068630790710449,
|
|
"epoch": 2.1473590767865067,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004790936044796369,
|
|
"loss": 5.7894,
|
|
"mean_token_accuracy": 0.15582628548145294,
|
|
"num_tokens": 4982851.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.043807077407837,
|
|
"epoch": 2.151797603195739,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047894835862917473,
|
|
"loss": 5.8587,
|
|
"mean_token_accuracy": 0.15432205498218537,
|
|
"num_tokens": 4993367.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.0602922439575195,
|
|
"epoch": 2.156236129604971,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047880263473769514,
|
|
"loss": 5.8847,
|
|
"mean_token_accuracy": 0.15590363442897798,
|
|
"num_tokens": 5004678.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 6.016771364212036,
|
|
"epoch": 2.160674656014203,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004786564331467648,
|
|
"loss": 5.9167,
|
|
"mean_token_accuracy": 0.15726353973150253,
|
|
"num_tokens": 5015707.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.097188186645508,
|
|
"epoch": 2.1651131824234353,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00047850975419907034,
|
|
"loss": 5.8521,
|
|
"mean_token_accuracy": 0.16086476445198059,
|
|
"num_tokens": 5025627.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 6.054884433746338,
|
|
"epoch": 2.1695517088326675,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047836259823841716,
|
|
"loss": 5.901,
|
|
"mean_token_accuracy": 0.15026813372969627,
|
|
"num_tokens": 5037109.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.021889686584473,
|
|
"epoch": 2.1739902352418996,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004782149656097287,
|
|
"loss": 5.8724,
|
|
"mean_token_accuracy": 0.1604078121483326,
|
|
"num_tokens": 5047547.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.027349185943604,
|
|
"epoch": 2.1784287616511318,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047806685665904586,
|
|
"loss": 5.6991,
|
|
"mean_token_accuracy": 0.17207456529140472,
|
|
"num_tokens": 5057491.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 6.059153509140015,
|
|
"epoch": 2.182867288060364,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004779182717335258,
|
|
"loss": 5.88,
|
|
"mean_token_accuracy": 0.15979125201702118,
|
|
"num_tokens": 5067779.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 5.914556980133057,
|
|
"epoch": 2.187305814469596,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047776921118144154,
|
|
"loss": 5.7787,
|
|
"mean_token_accuracy": 0.16236073076725005,
|
|
"num_tokens": 5079933.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 6.0363281726837155,
|
|
"epoch": 2.191744340878828,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047761967535218084,
|
|
"loss": 5.7699,
|
|
"mean_token_accuracy": 0.1603487879037857,
|
|
"num_tokens": 5090511.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 5.9814863204956055,
|
|
"epoch": 2.1961828672880603,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004774696645962453,
|
|
"loss": 5.8209,
|
|
"mean_token_accuracy": 0.155949005484581,
|
|
"num_tokens": 5100374.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 6.025760889053345,
|
|
"epoch": 2.2006213936972925,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004773191792652501,
|
|
"loss": 5.8747,
|
|
"mean_token_accuracy": 0.15608740150928496,
|
|
"num_tokens": 5110729.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.043809127807617,
|
|
"epoch": 2.2050599201065246,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004771682197119224,
|
|
"loss": 5.9689,
|
|
"mean_token_accuracy": 0.1561452865600586,
|
|
"num_tokens": 5121512.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 6.116773700714111,
|
|
"epoch": 2.2094984465157568,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00047701678629010115,
|
|
"loss": 5.7927,
|
|
"mean_token_accuracy": 0.16145216375589372,
|
|
"num_tokens": 5132244.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.996910858154297,
|
|
"epoch": 2.213936972924989,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004768648793547359,
|
|
"loss": 5.8645,
|
|
"mean_token_accuracy": 0.15332240164279937,
|
|
"num_tokens": 5142499.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.124018716812134,
|
|
"epoch": 2.218375499334221,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004767124992618863,
|
|
"loss": 5.9254,
|
|
"mean_token_accuracy": 0.14778615534305573,
|
|
"num_tokens": 5154082.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"epoch": 2.218375499334221,
|
|
"eval_entropy": 5.912582218505425,
|
|
"eval_loss": 6.2384443283081055,
|
|
"eval_mean_token_accuracy": 0.14352747247578695,
|
|
"eval_num_tokens": 5154082.0,
|
|
"eval_runtime": 2.7018,
|
|
"eval_samples_per_second": 1246.209,
|
|
"eval_steps_per_second": 155.822,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 5.979514408111572,
|
|
"epoch": 2.222814025743453,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004765596463687207,
|
|
"loss": 5.8599,
|
|
"mean_token_accuracy": 0.16360579580068588,
|
|
"num_tokens": 5164473.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 6.0302653312683105,
|
|
"epoch": 2.2272525521526854,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00047640632103351576,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.1529782608151436,
|
|
"num_tokens": 5174505.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 5.984198331832886,
|
|
"epoch": 2.2316910785619175,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047625252361565586,
|
|
"loss": 5.86,
|
|
"mean_token_accuracy": 0.16072332859039307,
|
|
"num_tokens": 5183730.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 6.080876970291138,
|
|
"epoch": 2.2361296049711497,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047609825447563137,
|
|
"loss": 5.8875,
|
|
"mean_token_accuracy": 0.15377844423055648,
|
|
"num_tokens": 5194589.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 6.031586074829102,
|
|
"epoch": 2.240568131380382,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004759435139750388,
|
|
"loss": 5.8224,
|
|
"mean_token_accuracy": 0.1603144511580467,
|
|
"num_tokens": 5204865.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 5.950521659851074,
|
|
"epoch": 2.245006657789614,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047578830247657915,
|
|
"loss": 5.7883,
|
|
"mean_token_accuracy": 0.15542953312397004,
|
|
"num_tokens": 5214174.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 6.086405277252197,
|
|
"epoch": 2.249445184198846,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047563262034405773,
|
|
"loss": 5.8553,
|
|
"mean_token_accuracy": 0.15860657542943954,
|
|
"num_tokens": 5224776.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 5.879979848861694,
|
|
"epoch": 2.2538837106080782,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047547646794238277,
|
|
"loss": 5.774,
|
|
"mean_token_accuracy": 0.16944229304790498,
|
|
"num_tokens": 5235808.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 6.069366598129273,
|
|
"epoch": 2.2583222370173104,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004753198456375647,
|
|
"loss": 5.8768,
|
|
"mean_token_accuracy": 0.15542600452899932,
|
|
"num_tokens": 5246870.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 5.9477842330932615,
|
|
"epoch": 2.2627607634265425,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004751627537967158,
|
|
"loss": 5.814,
|
|
"mean_token_accuracy": 0.15728210359811784,
|
|
"num_tokens": 5256713.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 6.079386186599732,
|
|
"epoch": 2.2671992898357747,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00047500519278804835,
|
|
"loss": 5.8594,
|
|
"mean_token_accuracy": 0.15244215726852417,
|
|
"num_tokens": 5266205.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 5.994957637786865,
|
|
"epoch": 2.271637816245007,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004748471629808746,
|
|
"loss": 5.8492,
|
|
"mean_token_accuracy": 0.16054973602294922,
|
|
"num_tokens": 5275790.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.990897369384766,
|
|
"epoch": 2.276076342654239,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047468866474560575,
|
|
"loss": 5.8324,
|
|
"mean_token_accuracy": 0.16462789922952653,
|
|
"num_tokens": 5286644.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 6.060874319076538,
|
|
"epoch": 2.280514869063471,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047452969845375074,
|
|
"loss": 5.8517,
|
|
"mean_token_accuracy": 0.15758478343486787,
|
|
"num_tokens": 5297218.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 5.967515182495117,
|
|
"epoch": 2.2849533954727033,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004743702644779157,
|
|
"loss": 5.8643,
|
|
"mean_token_accuracy": 0.16127976924180984,
|
|
"num_tokens": 5306963.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 6.041119766235352,
|
|
"epoch": 2.2893919218819354,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000474210363191803,
|
|
"loss": 5.8436,
|
|
"mean_token_accuracy": 0.15753196477890014,
|
|
"num_tokens": 5317831.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 6.07420163154602,
|
|
"epoch": 2.2938304482911676,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004740499949702103,
|
|
"loss": 5.9116,
|
|
"mean_token_accuracy": 0.1521080181002617,
|
|
"num_tokens": 5328441.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 6.023616170883178,
|
|
"epoch": 2.2982689747003997,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004738891601890298,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.15639281421899795,
|
|
"num_tokens": 5339196.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 6.031891489028931,
|
|
"epoch": 2.302707501109632,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004737278592252473,
|
|
"loss": 5.8922,
|
|
"mean_token_accuracy": 0.15469010919332504,
|
|
"num_tokens": 5350607.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 6.049084806442261,
|
|
"epoch": 2.3071460275188636,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004735660924569411,
|
|
"loss": 5.8015,
|
|
"mean_token_accuracy": 0.16298002377152443,
|
|
"num_tokens": 5359882.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 5.998689460754394,
|
|
"epoch": 2.3115845539280957,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004734038602632815,
|
|
"loss": 5.901,
|
|
"mean_token_accuracy": 0.1472710005939007,
|
|
"num_tokens": 5369895.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.047903060913086,
|
|
"epoch": 2.316023080337328,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047324116302452975,
|
|
"loss": 5.8089,
|
|
"mean_token_accuracy": 0.1612442836165428,
|
|
"num_tokens": 5380603.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 5.948516035079956,
|
|
"epoch": 2.32046160674656,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004730780011220369,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.1603932797908783,
|
|
"num_tokens": 5390638.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.000922441482544,
|
|
"epoch": 2.324900133155792,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004729143749382435,
|
|
"loss": 5.8306,
|
|
"mean_token_accuracy": 0.15756168812513352,
|
|
"num_tokens": 5401420.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 5.9953662872314455,
|
|
"epoch": 2.3293386595650243,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047275028485667793,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.16370837688446044,
|
|
"num_tokens": 5410609.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 6.01699743270874,
|
|
"epoch": 2.3337771859742564,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004725857312619563,
|
|
"loss": 5.8682,
|
|
"mean_token_accuracy": 0.15251740217208862,
|
|
"num_tokens": 5420443.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 6.033771324157715,
|
|
"epoch": 2.3382157123834886,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004724207145397809,
|
|
"loss": 5.8648,
|
|
"mean_token_accuracy": 0.15294097363948822,
|
|
"num_tokens": 5431385.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 5.970233392715454,
|
|
"epoch": 2.3426542387927207,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004722552350769397,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.1535698138177395,
|
|
"num_tokens": 5443030.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 6.052612066268921,
|
|
"epoch": 2.347092765201953,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047208929326130535,
|
|
"loss": 5.9079,
|
|
"mean_token_accuracy": 0.15419892519712447,
|
|
"num_tokens": 5454165.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 5.993892097473145,
|
|
"epoch": 2.351531291611185,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00047192288948183394,
|
|
"loss": 5.8514,
|
|
"mean_token_accuracy": 0.1610301211476326,
|
|
"num_tokens": 5464677.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 6.002200412750244,
|
|
"epoch": 2.355969818020417,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047175602412856453,
|
|
"loss": 5.8932,
|
|
"mean_token_accuracy": 0.15303485542535783,
|
|
"num_tokens": 5474800.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 5.996066761016846,
|
|
"epoch": 2.3604083444296493,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047158869759261843,
|
|
"loss": 5.8812,
|
|
"mean_token_accuracy": 0.15533178001642228,
|
|
"num_tokens": 5484560.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 6.029137420654297,
|
|
"epoch": 2.3648468708388815,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004714209102661973,
|
|
"loss": 5.7492,
|
|
"mean_token_accuracy": 0.16394296288490295,
|
|
"num_tokens": 5494044.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 5.91089277267456,
|
|
"epoch": 2.3692853972481136,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004712526625425832,
|
|
"loss": 5.7802,
|
|
"mean_token_accuracy": 0.16682939529418944,
|
|
"num_tokens": 5504699.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 5.978672981262207,
|
|
"epoch": 2.3737239236573457,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047108395481613736,
|
|
"loss": 5.8211,
|
|
"mean_token_accuracy": 0.15940958112478257,
|
|
"num_tokens": 5515653.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 5.973521709442139,
|
|
"epoch": 2.378162450066578,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047091478748229927,
|
|
"loss": 5.8413,
|
|
"mean_token_accuracy": 0.1611622080206871,
|
|
"num_tokens": 5525598.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 5.935227870941162,
|
|
"epoch": 2.38260097647581,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004707451609375854,
|
|
"loss": 5.7347,
|
|
"mean_token_accuracy": 0.16550450325012206,
|
|
"num_tokens": 5535022.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 5.960200691223145,
|
|
"epoch": 2.387039502885042,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004705750755795889,
|
|
"loss": 5.8633,
|
|
"mean_token_accuracy": 0.15553324073553085,
|
|
"num_tokens": 5544766.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 6.048462724685669,
|
|
"epoch": 2.3914780292942743,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00047040453180697823,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.15715541690587997,
|
|
"num_tokens": 5556475.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 5.987107372283935,
|
|
"epoch": 2.3959165557035065,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004702335300194963,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.1529506891965866,
|
|
"num_tokens": 5567679.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 5.9911316394805905,
|
|
"epoch": 2.4003550821127386,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004700620706179596,
|
|
"loss": 5.8734,
|
|
"mean_token_accuracy": 0.15287387520074844,
|
|
"num_tokens": 5579154.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 6.002614164352417,
|
|
"epoch": 2.4047936085219708,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004698901540042573,
|
|
"loss": 5.8182,
|
|
"mean_token_accuracy": 0.15594158917665482,
|
|
"num_tokens": 5588597.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 5.956090831756592,
|
|
"epoch": 2.409232134931203,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046971778058135024,
|
|
"loss": 5.8452,
|
|
"mean_token_accuracy": 0.16208919137716293,
|
|
"num_tokens": 5598744.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 6.036012983322143,
|
|
"epoch": 2.413670661340435,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046954495075326986,
|
|
"loss": 5.8405,
|
|
"mean_token_accuracy": 0.1533527597784996,
|
|
"num_tokens": 5608684.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 6.065688228607177,
|
|
"epoch": 2.418109187749667,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046937166492511746,
|
|
"loss": 5.869,
|
|
"mean_token_accuracy": 0.1580584764480591,
|
|
"num_tokens": 5619073.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 5.885785341262817,
|
|
"epoch": 2.4225477141588994,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046919792350306317,
|
|
"loss": 5.8433,
|
|
"mean_token_accuracy": 0.1607219859957695,
|
|
"num_tokens": 5628764.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 5.997347974777222,
|
|
"epoch": 2.4269862405681315,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004690237268943451,
|
|
"loss": 5.8939,
|
|
"mean_token_accuracy": 0.1569211430847645,
|
|
"num_tokens": 5640132.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 6.014172315597534,
|
|
"epoch": 2.4314247669773636,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046884907550726816,
|
|
"loss": 5.832,
|
|
"mean_token_accuracy": 0.16245327293872833,
|
|
"num_tokens": 5650104.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 6.030955839157104,
|
|
"epoch": 2.435863293386596,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046867396975120324,
|
|
"loss": 5.8838,
|
|
"mean_token_accuracy": 0.1566794067621231,
|
|
"num_tokens": 5660570.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 5.935262775421142,
|
|
"epoch": 2.440301819795828,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004684984100365863,
|
|
"loss": 5.8102,
|
|
"mean_token_accuracy": 0.16272856444120407,
|
|
"num_tokens": 5670416.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 5.952510738372803,
|
|
"epoch": 2.44474034620506,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00046832239677491736,
|
|
"loss": 5.8026,
|
|
"mean_token_accuracy": 0.159297114610672,
|
|
"num_tokens": 5680103.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 5.9763203144073485,
|
|
"epoch": 2.4491788726142922,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004681459303787594,
|
|
"loss": 5.7618,
|
|
"mean_token_accuracy": 0.1663880541920662,
|
|
"num_tokens": 5690177.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 5.848566389083862,
|
|
"epoch": 2.4536173990235244,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004679690112617376,
|
|
"loss": 5.7924,
|
|
"mean_token_accuracy": 0.1640610784292221,
|
|
"num_tokens": 5700618.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 6.005400848388672,
|
|
"epoch": 2.458055925432756,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004677916398385383,
|
|
"loss": 5.6976,
|
|
"mean_token_accuracy": 0.16924956142902375,
|
|
"num_tokens": 5709363.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.92542405128479,
|
|
"epoch": 2.4624944518419882,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000467613816524908,
|
|
"loss": 5.7632,
|
|
"mean_token_accuracy": 0.16014119535684584,
|
|
"num_tokens": 5718337.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 5.98035454750061,
|
|
"epoch": 2.4669329782512204,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004674355417376524,
|
|
"loss": 5.8899,
|
|
"mean_token_accuracy": 0.15295967012643813,
|
|
"num_tokens": 5729728.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 6.071887493133545,
|
|
"epoch": 2.4713715046604525,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00046725681589463537,
|
|
"loss": 5.8657,
|
|
"mean_token_accuracy": 0.156499744951725,
|
|
"num_tokens": 5739417.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 5.863467073440551,
|
|
"epoch": 2.4758100310696847,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046707763941477817,
|
|
"loss": 5.752,
|
|
"mean_token_accuracy": 0.16586533784866334,
|
|
"num_tokens": 5749262.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 5.958102178573609,
|
|
"epoch": 2.480248557478917,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004668980127180582,
|
|
"loss": 5.7598,
|
|
"mean_token_accuracy": 0.16487552374601364,
|
|
"num_tokens": 5758631.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 6.010591220855713,
|
|
"epoch": 2.484687083888149,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004667179362255081,
|
|
"loss": 5.8768,
|
|
"mean_token_accuracy": 0.15696858763694763,
|
|
"num_tokens": 5768216.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 5.944836568832398,
|
|
"epoch": 2.489125610297381,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004665374103592149,
|
|
"loss": 5.8615,
|
|
"mean_token_accuracy": 0.15959977358579636,
|
|
"num_tokens": 5779497.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.9987327575683596,
|
|
"epoch": 2.4935641367066133,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004663564355423189,
|
|
"loss": 5.8722,
|
|
"mean_token_accuracy": 0.1550326645374298,
|
|
"num_tokens": 5790354.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 5.994489002227783,
|
|
"epoch": 2.4980026631158454,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004661750121990128,
|
|
"loss": 5.8588,
|
|
"mean_token_accuracy": 0.15960408747196198,
|
|
"num_tokens": 5801444.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.916463232040405,
|
|
"epoch": 2.5024411895250775,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00046599314075454034,
|
|
"loss": 5.7893,
|
|
"mean_token_accuracy": 0.16704044193029405,
|
|
"num_tokens": 5811444.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 5.954709720611572,
|
|
"epoch": 2.5068797159343097,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046581082163519585,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.16441214680671692,
|
|
"num_tokens": 5821470.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 6.026654958724976,
|
|
"epoch": 2.511318242343542,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00046562805526832284,
|
|
"loss": 5.9117,
|
|
"mean_token_accuracy": 0.1474317044019699,
|
|
"num_tokens": 5831946.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.968541955947876,
|
|
"epoch": 2.515756768752774,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004654448420823133,
|
|
"loss": 5.7507,
|
|
"mean_token_accuracy": 0.16840852946043014,
|
|
"num_tokens": 5841871.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.894213438034058,
|
|
"epoch": 2.520195295162006,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046526118250660636,
|
|
"loss": 5.7572,
|
|
"mean_token_accuracy": 0.1637505128979683,
|
|
"num_tokens": 5852177.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 5.925645160675049,
|
|
"epoch": 2.5246338215712383,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004650770769716875,
|
|
"loss": 5.8017,
|
|
"mean_token_accuracy": 0.16091584861278535,
|
|
"num_tokens": 5861833.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 6.0279539108276365,
|
|
"epoch": 2.5290723479804704,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004648925259090875,
|
|
"loss": 5.8965,
|
|
"mean_token_accuracy": 0.15736780315637589,
|
|
"num_tokens": 5872356.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.906160831451416,
|
|
"epoch": 2.5335108743897026,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046470752975138146,
|
|
"loss": 5.766,
|
|
"mean_token_accuracy": 0.1651814177632332,
|
|
"num_tokens": 5882191.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.877144622802734,
|
|
"epoch": 2.5379494007989347,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046452208893218777,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.15751032680273055,
|
|
"num_tokens": 5892166.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 6.012645864486695,
|
|
"epoch": 2.542387927208167,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000464336203886167,
|
|
"loss": 5.8779,
|
|
"mean_token_accuracy": 0.15454574823379516,
|
|
"num_tokens": 5902736.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 6.037869215011597,
|
|
"epoch": 2.546826453617399,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000464149875049021,
|
|
"loss": 5.8828,
|
|
"mean_token_accuracy": 0.1547730416059494,
|
|
"num_tokens": 5913118.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 5.903016805648804,
|
|
"epoch": 2.551264980026631,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046396310285749175,
|
|
"loss": 5.7814,
|
|
"mean_token_accuracy": 0.16758745312690734,
|
|
"num_tokens": 5922748.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 5.863944339752197,
|
|
"epoch": 2.5557035064358633,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00046377588774936077,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.16544996947050095,
|
|
"num_tokens": 5932107.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 6.011892890930175,
|
|
"epoch": 2.5601420328450954,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046358823016344713,
|
|
"loss": 5.9142,
|
|
"mean_token_accuracy": 0.15287835970520974,
|
|
"num_tokens": 5942231.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.860071897506714,
|
|
"epoch": 2.5645805592543276,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004634001305396076,
|
|
"loss": 5.7025,
|
|
"mean_token_accuracy": 0.17802257537841798,
|
|
"num_tokens": 5952768.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 5.9685780048370365,
|
|
"epoch": 2.5690190856635597,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046321158931873486,
|
|
"loss": 5.8106,
|
|
"mean_token_accuracy": 0.16438037455081939,
|
|
"num_tokens": 5963588.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.918586349487304,
|
|
"epoch": 2.573457612072792,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004630226069427566,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.15472524762153625,
|
|
"num_tokens": 5974010.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 5.987170839309693,
|
|
"epoch": 2.577896138482024,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046283318385463454,
|
|
"loss": 5.8025,
|
|
"mean_token_accuracy": 0.15875670611858367,
|
|
"num_tokens": 5983788.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 6.004740524291992,
|
|
"epoch": 2.582334664891256,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004626433204983636,
|
|
"loss": 5.8272,
|
|
"mean_token_accuracy": 0.15208624452352523,
|
|
"num_tokens": 5993757.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 5.989063167572022,
|
|
"epoch": 2.5867731913004883,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046245301731897024,
|
|
"loss": 5.8965,
|
|
"mean_token_accuracy": 0.15564585849642754,
|
|
"num_tokens": 6004298.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 5.924497413635254,
|
|
"epoch": 2.5912117177097205,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046226227476251256,
|
|
"loss": 5.7492,
|
|
"mean_token_accuracy": 0.1677611857652664,
|
|
"num_tokens": 6014338.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.932976245880127,
|
|
"epoch": 2.5956502441189526,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004620710932760776,
|
|
"loss": 5.7697,
|
|
"mean_token_accuracy": 0.16785314530134202,
|
|
"num_tokens": 6024162.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 5.958101367950439,
|
|
"epoch": 2.6000887705281848,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000461879473307782,
|
|
"loss": 5.9011,
|
|
"mean_token_accuracy": 0.15391672402620316,
|
|
"num_tokens": 6035618.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 6.020662879943847,
|
|
"epoch": 2.604527296937417,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004616874153067698,
|
|
"loss": 5.8625,
|
|
"mean_token_accuracy": 0.15793592631816863,
|
|
"num_tokens": 6046958.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.986457204818725,
|
|
"epoch": 2.608965823346649,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004614949197232118,
|
|
"loss": 5.7603,
|
|
"mean_token_accuracy": 0.15999703258275985,
|
|
"num_tokens": 6056605.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 6.014141416549682,
|
|
"epoch": 2.613404349755881,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004613019870083045,
|
|
"loss": 5.8777,
|
|
"mean_token_accuracy": 0.15496069490909575,
|
|
"num_tokens": 6066820.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 5.97690601348877,
|
|
"epoch": 2.6178428761651134,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046110861761426903,
|
|
"loss": 5.8899,
|
|
"mean_token_accuracy": 0.15131543576717377,
|
|
"num_tokens": 6076894.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 5.9907660484313965,
|
|
"epoch": 2.6222814025743455,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046091481199435005,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.16070771217346191,
|
|
"num_tokens": 6087603.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 5.969569063186645,
|
|
"epoch": 2.6267199289835776,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004607205706028147,
|
|
"loss": 5.8553,
|
|
"mean_token_accuracy": 0.1571110799908638,
|
|
"num_tokens": 6097742.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.947077798843384,
|
|
"epoch": 2.63115845539281,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004605258938949514,
|
|
"loss": 5.7632,
|
|
"mean_token_accuracy": 0.16355187743902205,
|
|
"num_tokens": 6107589.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 5.910353899002075,
|
|
"epoch": 2.635596981802042,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046033078232706923,
|
|
"loss": 5.8305,
|
|
"mean_token_accuracy": 0.16115528345108032,
|
|
"num_tokens": 6117487.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 5.9662243843078615,
|
|
"epoch": 2.640035508211274,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046013523635649625,
|
|
"loss": 5.7886,
|
|
"mean_token_accuracy": 0.1626285195350647,
|
|
"num_tokens": 6127326.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 5.9658843040466305,
|
|
"epoch": 2.6444740346205062,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045993925644157883,
|
|
"loss": 5.8586,
|
|
"mean_token_accuracy": 0.15528757721185685,
|
|
"num_tokens": 6137314.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.949848461151123,
|
|
"epoch": 2.6489125610297384,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004597428430416807,
|
|
"loss": 5.7777,
|
|
"mean_token_accuracy": 0.15900478214025499,
|
|
"num_tokens": 6147307.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 5.903331708908081,
|
|
"epoch": 2.6533510874389705,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045954599661718126,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.15989653617143632,
|
|
"num_tokens": 6157251.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 5.940880393981933,
|
|
"epoch": 2.6577896138482027,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045934871762947504,
|
|
"loss": 5.8187,
|
|
"mean_token_accuracy": 0.1611912429332733,
|
|
"num_tokens": 6167190.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.969712638854981,
|
|
"epoch": 2.6622281402574344,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045915100654097076,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.14869051277637482,
|
|
"num_tokens": 6177276.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 2.6622281402574344,
|
|
"eval_entropy": 5.890340174178896,
|
|
"eval_loss": 6.156768798828125,
|
|
"eval_mean_token_accuracy": 0.1474443507201598,
|
|
"eval_num_tokens": 6177276.0,
|
|
"eval_runtime": 2.8874,
|
|
"eval_samples_per_second": 1166.085,
|
|
"eval_steps_per_second": 145.804,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 5.963724184036255,
|
|
"epoch": 2.6666666666666665,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045895286381508944,
|
|
"loss": 5.7761,
|
|
"mean_token_accuracy": 0.16845725029706954,
|
|
"num_tokens": 6187477.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.930504608154297,
|
|
"epoch": 2.6711051930758987,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004587542899162642,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.16042507588863372,
|
|
"num_tokens": 6196961.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 5.972206020355225,
|
|
"epoch": 2.675543719485131,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045855528530993874,
|
|
"loss": 5.8621,
|
|
"mean_token_accuracy": 0.15465489625930787,
|
|
"num_tokens": 6206267.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 5.989437532424927,
|
|
"epoch": 2.679982245894363,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004583558504625661,
|
|
"loss": 5.8806,
|
|
"mean_token_accuracy": 0.1598665952682495,
|
|
"num_tokens": 6216960.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.972441625595093,
|
|
"epoch": 2.684420772303595,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045815598584160824,
|
|
"loss": 5.8508,
|
|
"mean_token_accuracy": 0.15688182711601256,
|
|
"num_tokens": 6227843.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.931846618652344,
|
|
"epoch": 2.6888592987128273,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045795569191553384,
|
|
"loss": 5.7869,
|
|
"mean_token_accuracy": 0.1634823426604271,
|
|
"num_tokens": 6236712.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 6.0422979354858395,
|
|
"epoch": 2.6932978251220594,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004577549691538183,
|
|
"loss": 5.867,
|
|
"mean_token_accuracy": 0.15649005323648452,
|
|
"num_tokens": 6248021.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 6.038855028152466,
|
|
"epoch": 2.6977363515312915,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045755381802694206,
|
|
"loss": 5.9027,
|
|
"mean_token_accuracy": 0.15194420740008355,
|
|
"num_tokens": 6259582.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 5.9294596195220945,
|
|
"epoch": 2.7021748779405237,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045735223900638967,
|
|
"loss": 5.8207,
|
|
"mean_token_accuracy": 0.15803860276937484,
|
|
"num_tokens": 6269835.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.9558673858642575,
|
|
"epoch": 2.706613404349756,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045715023256464855,
|
|
"loss": 5.746,
|
|
"mean_token_accuracy": 0.16712094992399215,
|
|
"num_tokens": 6279486.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.922696256637574,
|
|
"epoch": 2.711051930758988,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045694779917520797,
|
|
"loss": 5.817,
|
|
"mean_token_accuracy": 0.16085006594657897,
|
|
"num_tokens": 6290273.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.900194597244263,
|
|
"epoch": 2.71549045716822,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000456744939312558,
|
|
"loss": 5.6937,
|
|
"mean_token_accuracy": 0.17415937334299086,
|
|
"num_tokens": 6299543.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.909957361221314,
|
|
"epoch": 2.7199289835774523,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004565416534521883,
|
|
"loss": 5.7641,
|
|
"mean_token_accuracy": 0.1630728706717491,
|
|
"num_tokens": 6309813.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.874665069580078,
|
|
"epoch": 2.7243675099866844,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000456337942070587,
|
|
"loss": 5.7821,
|
|
"mean_token_accuracy": 0.1703098714351654,
|
|
"num_tokens": 6319961.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 5.964541339874268,
|
|
"epoch": 2.7288060363959166,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004561338056452396,
|
|
"loss": 5.737,
|
|
"mean_token_accuracy": 0.16806395202875138,
|
|
"num_tokens": 6329585.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.92868595123291,
|
|
"epoch": 2.7332445628051487,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004559292446546281,
|
|
"loss": 5.7987,
|
|
"mean_token_accuracy": 0.16131089478731156,
|
|
"num_tokens": 6339527.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 5.970851278305053,
|
|
"epoch": 2.737683089214381,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004557242595782293,
|
|
"loss": 5.7985,
|
|
"mean_token_accuracy": 0.15973087251186371,
|
|
"num_tokens": 6350079.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 5.91132082939148,
|
|
"epoch": 2.742121615623613,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004555188508965144,
|
|
"loss": 5.7925,
|
|
"mean_token_accuracy": 0.16054237484931946,
|
|
"num_tokens": 6359999.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.912930011749268,
|
|
"epoch": 2.746560142032845,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045531301909094724,
|
|
"loss": 5.7963,
|
|
"mean_token_accuracy": 0.1637853652238846,
|
|
"num_tokens": 6370643.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.9343184471130375,
|
|
"epoch": 2.7509986684420773,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004551067646439834,
|
|
"loss": 5.8199,
|
|
"mean_token_accuracy": 0.15766822546720505,
|
|
"num_tokens": 6381132.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 5.960313940048218,
|
|
"epoch": 2.7554371948513094,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045490008803906936,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.16581773906946182,
|
|
"num_tokens": 6391143.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 5.841590690612793,
|
|
"epoch": 2.7598757212605416,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004546929897606409,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.16631501466035842,
|
|
"num_tokens": 6401079.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.993973875045777,
|
|
"epoch": 2.7643142476697737,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045448547029412225,
|
|
"loss": 5.8225,
|
|
"mean_token_accuracy": 0.16507848501205444,
|
|
"num_tokens": 6412380.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.91737003326416,
|
|
"epoch": 2.768752774079006,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045427753012592477,
|
|
"loss": 5.7552,
|
|
"mean_token_accuracy": 0.1646926447749138,
|
|
"num_tokens": 6423198.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 5.957061624526977,
|
|
"epoch": 2.773191300488238,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045406916974344617,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.15380569249391557,
|
|
"num_tokens": 6433850.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 5.903844690322876,
|
|
"epoch": 2.77762982689747,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045386038963506883,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.16169303506612778,
|
|
"num_tokens": 6443296.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.890790748596191,
|
|
"epoch": 2.7820683533067023,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004536511902901591,
|
|
"loss": 5.7452,
|
|
"mean_token_accuracy": 0.17047004401683807,
|
|
"num_tokens": 6452857.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.9857110500335695,
|
|
"epoch": 2.7865068797159345,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004534415721990659,
|
|
"loss": 5.8426,
|
|
"mean_token_accuracy": 0.15422120094299316,
|
|
"num_tokens": 6463027.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 5.9161601066589355,
|
|
"epoch": 2.790945406125166,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045323153585311975,
|
|
"loss": 5.7903,
|
|
"mean_token_accuracy": 0.16016594916582108,
|
|
"num_tokens": 6473667.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 5.91183705329895,
|
|
"epoch": 2.7953839325343983,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004530210817446316,
|
|
"loss": 5.7923,
|
|
"mean_token_accuracy": 0.1590562269091606,
|
|
"num_tokens": 6484935.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 5.96208758354187,
|
|
"epoch": 2.7998224589436305,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004528102103668913,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.1598386511206627,
|
|
"num_tokens": 6496436.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.941922044754028,
|
|
"epoch": 2.8042609853528626,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004525989222141671,
|
|
"loss": 5.8385,
|
|
"mean_token_accuracy": 0.16108565628528596,
|
|
"num_tokens": 6506426.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 5.909464502334595,
|
|
"epoch": 2.8086995117620948,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00045238721778170386,
|
|
"loss": 5.7245,
|
|
"mean_token_accuracy": 0.17027909755706788,
|
|
"num_tokens": 6516208.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.904296827316284,
|
|
"epoch": 2.813138038171327,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045217509756572256,
|
|
"loss": 5.8064,
|
|
"mean_token_accuracy": 0.16750676929950714,
|
|
"num_tokens": 6526989.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.950080680847168,
|
|
"epoch": 2.817576564580559,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004519625620634182,
|
|
"loss": 5.779,
|
|
"mean_token_accuracy": 0.16853131651878356,
|
|
"num_tokens": 6536623.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 5.996464633941651,
|
|
"epoch": 2.822015090989791,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045174961177295964,
|
|
"loss": 5.8603,
|
|
"mean_token_accuracy": 0.15565441995859147,
|
|
"num_tokens": 6546362.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.882690143585205,
|
|
"epoch": 2.8264536173990233,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045153624719348773,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.16545474231243135,
|
|
"num_tokens": 6556018.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.9369165897369385,
|
|
"epoch": 2.8308921438082555,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045132246882511457,
|
|
"loss": 5.8711,
|
|
"mean_token_accuracy": 0.15271297544240953,
|
|
"num_tokens": 6566633.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 5.928608226776123,
|
|
"epoch": 2.8353306702174876,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004511082771689219,
|
|
"loss": 5.7848,
|
|
"mean_token_accuracy": 0.162632454931736,
|
|
"num_tokens": 6577078.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 5.87532901763916,
|
|
"epoch": 2.83976919662672,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045089367272696046,
|
|
"loss": 5.7296,
|
|
"mean_token_accuracy": 0.16761246025562287,
|
|
"num_tokens": 6587012.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 5.853836631774902,
|
|
"epoch": 2.844207723035952,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045067865600224833,
|
|
"loss": 5.7389,
|
|
"mean_token_accuracy": 0.16479332596063614,
|
|
"num_tokens": 6597487.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.851861524581909,
|
|
"epoch": 2.848646249445184,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045046322749877005,
|
|
"loss": 5.8008,
|
|
"mean_token_accuracy": 0.16307896375656128,
|
|
"num_tokens": 6607959.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 5.999709367752075,
|
|
"epoch": 2.853084775854416,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045024738772147534,
|
|
"loss": 5.8787,
|
|
"mean_token_accuracy": 0.15614837110042573,
|
|
"num_tokens": 6618790.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.923825883865357,
|
|
"epoch": 2.8575233022636484,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004500311371762778,
|
|
"loss": 5.8501,
|
|
"mean_token_accuracy": 0.15941908359527587,
|
|
"num_tokens": 6628472.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 5.905185556411743,
|
|
"epoch": 2.8619618286728805,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044981447637005396,
|
|
"loss": 5.8651,
|
|
"mean_token_accuracy": 0.16131409406661987,
|
|
"num_tokens": 6638912.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.949870872497558,
|
|
"epoch": 2.8664003550821127,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000449597405810642,
|
|
"loss": 5.8519,
|
|
"mean_token_accuracy": 0.1583707645535469,
|
|
"num_tokens": 6649533.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.891813468933106,
|
|
"epoch": 2.870838881491345,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004493799260068405,
|
|
"loss": 5.7662,
|
|
"mean_token_accuracy": 0.1668047934770584,
|
|
"num_tokens": 6658936.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 5.957934093475342,
|
|
"epoch": 2.875277407900577,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004491620374684072,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.16199405193328859,
|
|
"num_tokens": 6669555.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 5.974352836608887,
|
|
"epoch": 2.879715934309809,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044894374070605795,
|
|
"loss": 5.7669,
|
|
"mean_token_accuracy": 0.15872932597994804,
|
|
"num_tokens": 6680298.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 5.8650794506073,
|
|
"epoch": 2.8841544607190412,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044872503623146544,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.1566520646214485,
|
|
"num_tokens": 6690852.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.917939901351929,
|
|
"epoch": 2.8885929871282734,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044850592455725804,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.16597653180360794,
|
|
"num_tokens": 6701442.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.969485950469971,
|
|
"epoch": 2.8930315135375055,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004482864061970185,
|
|
"loss": 5.812,
|
|
"mean_token_accuracy": 0.15813857614994048,
|
|
"num_tokens": 6711176.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 5.85574049949646,
|
|
"epoch": 2.8974700399467377,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044806648166528286,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.16221853271126746,
|
|
"num_tokens": 6721869.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.909014701843262,
|
|
"epoch": 2.90190856635597,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00044784615147753934,
|
|
"loss": 5.7292,
|
|
"mean_token_accuracy": 0.1643129900097847,
|
|
"num_tokens": 6731004.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 6.034462118148804,
|
|
"epoch": 2.906347092765202,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00044762541615022664,
|
|
"loss": 5.8652,
|
|
"mean_token_accuracy": 0.15844893604516982,
|
|
"num_tokens": 6741793.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 6.018981266021728,
|
|
"epoch": 2.910785619174434,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044740427620073344,
|
|
"loss": 5.8222,
|
|
"mean_token_accuracy": 0.1608099490404129,
|
|
"num_tokens": 6753177.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.9532171249389645,
|
|
"epoch": 2.9152241455836663,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044718273214739654,
|
|
"loss": 5.8773,
|
|
"mean_token_accuracy": 0.15125300288200377,
|
|
"num_tokens": 6763104.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 5.929151487350464,
|
|
"epoch": 2.9196626719928984,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004469607845095002,
|
|
"loss": 5.8162,
|
|
"mean_token_accuracy": 0.16089233607053757,
|
|
"num_tokens": 6773823.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.9447283267974855,
|
|
"epoch": 2.9241011984021306,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004467384338072744,
|
|
"loss": 5.7967,
|
|
"mean_token_accuracy": 0.16282767355442046,
|
|
"num_tokens": 6783445.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.851709604263306,
|
|
"epoch": 2.9285397248113627,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004465156805618941,
|
|
"loss": 5.681,
|
|
"mean_token_accuracy": 0.1752907082438469,
|
|
"num_tokens": 6794199.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.876345252990722,
|
|
"epoch": 2.932978251220595,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004462925252954775,
|
|
"loss": 5.8756,
|
|
"mean_token_accuracy": 0.15152985453605652,
|
|
"num_tokens": 6804817.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.9312444686889645,
|
|
"epoch": 2.937416777629827,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004460689685310855,
|
|
"loss": 5.8161,
|
|
"mean_token_accuracy": 0.16338575184345244,
|
|
"num_tokens": 6815592.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 5.860175895690918,
|
|
"epoch": 2.941855304039059,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004458450107927199,
|
|
"loss": 5.759,
|
|
"mean_token_accuracy": 0.17119106501340867,
|
|
"num_tokens": 6825653.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.963648462295533,
|
|
"epoch": 2.9462938304482913,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044562065260532214,
|
|
"loss": 5.9028,
|
|
"mean_token_accuracy": 0.15333495438098907,
|
|
"num_tokens": 6836610.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 5.885528802871704,
|
|
"epoch": 2.9507323568575234,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044539589449477265,
|
|
"loss": 5.6927,
|
|
"mean_token_accuracy": 0.16941193193197251,
|
|
"num_tokens": 6846700.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 5.940938091278076,
|
|
"epoch": 2.9551708832667556,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000445170736987889,
|
|
"loss": 5.8498,
|
|
"mean_token_accuracy": 0.15794429033994675,
|
|
"num_tokens": 6857796.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 5.989238452911377,
|
|
"epoch": 2.9596094096759877,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000444945180612425,
|
|
"loss": 5.8447,
|
|
"mean_token_accuracy": 0.15649579018354415,
|
|
"num_tokens": 6868038.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 5.952742576599121,
|
|
"epoch": 2.96404793608522,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044471922589706944,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.1704735830426216,
|
|
"num_tokens": 6878356.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 5.956376743316651,
|
|
"epoch": 2.968486462494452,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004444928733714446,
|
|
"loss": 5.801,
|
|
"mean_token_accuracy": 0.1637368842959404,
|
|
"num_tokens": 6889087.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 5.929503870010376,
|
|
"epoch": 2.972924988903684,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00044426612356610555,
|
|
"loss": 5.8323,
|
|
"mean_token_accuracy": 0.15772309452295302,
|
|
"num_tokens": 6898357.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.9494575500488285,
|
|
"epoch": 2.9773635153129163,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004440389770125382,
|
|
"loss": 5.9006,
|
|
"mean_token_accuracy": 0.1598823130130768,
|
|
"num_tokens": 6908363.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.953467893600464,
|
|
"epoch": 2.9818020417221485,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004438114342431586,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.16902253776788712,
|
|
"num_tokens": 6918680.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.909799098968506,
|
|
"epoch": 2.9862405681313806,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044358349579131143,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.16135867238044738,
|
|
"num_tokens": 6929063.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.941587018966675,
|
|
"epoch": 2.9906790945406128,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044335516219126876,
|
|
"loss": 5.805,
|
|
"mean_token_accuracy": 0.15798759311437607,
|
|
"num_tokens": 6937862.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.936902904510498,
|
|
"epoch": 2.995117620949845,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00044312643397822907,
|
|
"loss": 5.8394,
|
|
"mean_token_accuracy": 0.16224613785743713,
|
|
"num_tokens": 6948838.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 5.955539321899414,
|
|
"epoch": 2.999556147359077,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044289731168831566,
|
|
"loss": 5.8572,
|
|
"mean_token_accuracy": 0.15817692875862122,
|
|
"num_tokens": 6958496.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.930147065056695,
|
|
"epoch": 3.003550821127386,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004426677958585755,
|
|
"loss": 5.5163,
|
|
"mean_token_accuracy": 0.17406127519077724,
|
|
"num_tokens": 6967392.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.90186071395874,
|
|
"epoch": 3.007989347536618,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00044243788702697797,
|
|
"loss": 5.4168,
|
|
"mean_token_accuracy": 0.18226586729288102,
|
|
"num_tokens": 6976740.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.921399211883545,
|
|
"epoch": 3.01242787394585,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004422075857324137,
|
|
"loss": 5.461,
|
|
"mean_token_accuracy": 0.17682978212833406,
|
|
"num_tokens": 6986058.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.805210304260254,
|
|
"epoch": 3.0168664003550822,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044197689251469324,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.17929895371198654,
|
|
"num_tokens": 6997796.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.819172430038452,
|
|
"epoch": 3.0213049267643144,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044174580791454555,
|
|
"loss": 5.4213,
|
|
"mean_token_accuracy": 0.18021279126405715,
|
|
"num_tokens": 7008367.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.90168023109436,
|
|
"epoch": 3.0257434531735465,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004415143324736174,
|
|
"loss": 5.5685,
|
|
"mean_token_accuracy": 0.1715884819626808,
|
|
"num_tokens": 7019134.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.9204421043396,
|
|
"epoch": 3.0301819795827787,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004412824667344712,
|
|
"loss": 5.4352,
|
|
"mean_token_accuracy": 0.17551446259021758,
|
|
"num_tokens": 7030078.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.873832845687867,
|
|
"epoch": 3.034620505992011,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00044105021124058455,
|
|
"loss": 5.4334,
|
|
"mean_token_accuracy": 0.17652692794799804,
|
|
"num_tokens": 7039828.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.702576208114624,
|
|
"epoch": 3.039059032401243,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044081756653634825,
|
|
"loss": 5.4346,
|
|
"mean_token_accuracy": 0.19161795526742936,
|
|
"num_tokens": 7050842.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.811843490600586,
|
|
"epoch": 3.043497558810475,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004405845331670659,
|
|
"loss": 5.4042,
|
|
"mean_token_accuracy": 0.1850294515490532,
|
|
"num_tokens": 7059872.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.8140980243682865,
|
|
"epoch": 3.0479360852197073,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004403511116789514,
|
|
"loss": 5.4583,
|
|
"mean_token_accuracy": 0.17900667041540147,
|
|
"num_tokens": 7069625.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.849609327316284,
|
|
"epoch": 3.052374611628939,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044011730261912915,
|
|
"loss": 5.4784,
|
|
"mean_token_accuracy": 0.1747259259223938,
|
|
"num_tokens": 7078890.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.818154144287109,
|
|
"epoch": 3.056813138038171,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004398831065356314,
|
|
"loss": 5.4591,
|
|
"mean_token_accuracy": 0.18030397742986679,
|
|
"num_tokens": 7089123.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.864135217666626,
|
|
"epoch": 3.0612516644474033,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043964852397739793,
|
|
"loss": 5.4633,
|
|
"mean_token_accuracy": 0.1758294314146042,
|
|
"num_tokens": 7100053.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.854467535018921,
|
|
"epoch": 3.0656901908566354,
|
|
"grad_norm": 3.125,
|
|
"learning_rate": 0.000439413555494274,
|
|
"loss": 5.5035,
|
|
"mean_token_accuracy": 0.17171409279108046,
|
|
"num_tokens": 7110528.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.797104597091675,
|
|
"epoch": 3.0701287172658676,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004391782016370098,
|
|
"loss": 5.552,
|
|
"mean_token_accuracy": 0.17069081217050552,
|
|
"num_tokens": 7121691.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.799645948410034,
|
|
"epoch": 3.0745672436750997,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004389424629572586,
|
|
"loss": 5.4676,
|
|
"mean_token_accuracy": 0.17778647989034652,
|
|
"num_tokens": 7131689.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.832806205749511,
|
|
"epoch": 3.079005770084332,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043870634000757605,
|
|
"loss": 5.5696,
|
|
"mean_token_accuracy": 0.1696484714746475,
|
|
"num_tokens": 7142595.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.8818260669708256,
|
|
"epoch": 3.083444296493564,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004384698333414179,
|
|
"loss": 5.4671,
|
|
"mean_token_accuracy": 0.17925113886594773,
|
|
"num_tokens": 7152092.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.796309995651245,
|
|
"epoch": 3.087882822902796,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004382329435131396,
|
|
"loss": 5.4868,
|
|
"mean_token_accuracy": 0.17726072669029236,
|
|
"num_tokens": 7163053.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.830512142181396,
|
|
"epoch": 3.0923213493120283,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00043799567107799504,
|
|
"loss": 5.435,
|
|
"mean_token_accuracy": 0.18380391746759414,
|
|
"num_tokens": 7172812.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.815919589996338,
|
|
"epoch": 3.0967598757212604,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00043775801659213425,
|
|
"loss": 5.4432,
|
|
"mean_token_accuracy": 0.18219853341579437,
|
|
"num_tokens": 7183234.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.867840814590454,
|
|
"epoch": 3.1011984021304926,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004375199806126034,
|
|
"loss": 5.5505,
|
|
"mean_token_accuracy": 0.17434204816818238,
|
|
"num_tokens": 7193614.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.865722894668579,
|
|
"epoch": 3.1056369285397247,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043728156369734236,
|
|
"loss": 5.5435,
|
|
"mean_token_accuracy": 0.17825270295143128,
|
|
"num_tokens": 7204836.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"epoch": 3.1056369285397247,
|
|
"eval_entropy": 5.67943718654243,
|
|
"eval_loss": 6.10019063949585,
|
|
"eval_mean_token_accuracy": 0.15331950948314826,
|
|
"eval_num_tokens": 7204836.0,
|
|
"eval_runtime": 2.6975,
|
|
"eval_samples_per_second": 1248.216,
|
|
"eval_steps_per_second": 156.073,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 5.769807004928589,
|
|
"epoch": 3.110075454948957,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004370427664051841,
|
|
"loss": 5.4519,
|
|
"mean_token_accuracy": 0.17842291593551635,
|
|
"num_tokens": 7215138.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.7893476486206055,
|
|
"epoch": 3.114513981358189,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004368035892958533,
|
|
"loss": 5.5557,
|
|
"mean_token_accuracy": 0.17136096805334092,
|
|
"num_tokens": 7226468.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 5.889794778823853,
|
|
"epoch": 3.118952507767421,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043656403292996454,
|
|
"loss": 5.5482,
|
|
"mean_token_accuracy": 0.17302740216255189,
|
|
"num_tokens": 7235904.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 5.793400382995605,
|
|
"epoch": 3.1233910341766533,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004363240978690218,
|
|
"loss": 5.5274,
|
|
"mean_token_accuracy": 0.17253278195858002,
|
|
"num_tokens": 7245933.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 5.846996784210205,
|
|
"epoch": 3.1278295605858855,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00043608378467541626,
|
|
"loss": 5.5482,
|
|
"mean_token_accuracy": 0.17442068457603455,
|
|
"num_tokens": 7255626.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 5.793939161300659,
|
|
"epoch": 3.1322680869951176,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043584309391242584,
|
|
"loss": 5.471,
|
|
"mean_token_accuracy": 0.17612817138433456,
|
|
"num_tokens": 7264579.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 5.80440616607666,
|
|
"epoch": 3.1367066134043498,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004356020261442131,
|
|
"loss": 5.4877,
|
|
"mean_token_accuracy": 0.17804499417543412,
|
|
"num_tokens": 7274860.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.832252120971679,
|
|
"epoch": 3.141145139813582,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00043536058193582443,
|
|
"loss": 5.4445,
|
|
"mean_token_accuracy": 0.17826966494321822,
|
|
"num_tokens": 7285236.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.774497222900391,
|
|
"epoch": 3.145583666222814,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004351187618531886,
|
|
"loss": 5.4918,
|
|
"mean_token_accuracy": 0.17440381795167922,
|
|
"num_tokens": 7295291.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 5.885190725326538,
|
|
"epoch": 3.150022192632046,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043487656646311535,
|
|
"loss": 5.5069,
|
|
"mean_token_accuracy": 0.17112795114517212,
|
|
"num_tokens": 7306237.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 5.744331693649292,
|
|
"epoch": 3.1544607190412783,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004346339963332941,
|
|
"loss": 5.4601,
|
|
"mean_token_accuracy": 0.18217105120420457,
|
|
"num_tokens": 7316695.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.734088611602783,
|
|
"epoch": 3.1588992454505105,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004343910520322927,
|
|
"loss": 5.4478,
|
|
"mean_token_accuracy": 0.18409417420625687,
|
|
"num_tokens": 7325942.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 5.781349754333496,
|
|
"epoch": 3.1633377718597426,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000434147734129556,
|
|
"loss": 5.557,
|
|
"mean_token_accuracy": 0.17307535111904143,
|
|
"num_tokens": 7336817.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.821921443939209,
|
|
"epoch": 3.1677762982689748,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043390404319540443,
|
|
"loss": 5.5423,
|
|
"mean_token_accuracy": 0.17289045602083206,
|
|
"num_tokens": 7347072.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.850234889984131,
|
|
"epoch": 3.172214824678207,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043365997980103304,
|
|
"loss": 5.4943,
|
|
"mean_token_accuracy": 0.1778233155608177,
|
|
"num_tokens": 7357125.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 5.763746833801269,
|
|
"epoch": 3.176653351087439,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043341554451850964,
|
|
"loss": 5.4796,
|
|
"mean_token_accuracy": 0.1793802037835121,
|
|
"num_tokens": 7367290.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 5.780725145339966,
|
|
"epoch": 3.181091877496671,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043317073792077394,
|
|
"loss": 5.4474,
|
|
"mean_token_accuracy": 0.18791042119264603,
|
|
"num_tokens": 7377126.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 5.8030867099761965,
|
|
"epoch": 3.1855304039059034,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004329255605816357,
|
|
"loss": 5.4992,
|
|
"mean_token_accuracy": 0.17195357382297516,
|
|
"num_tokens": 7388136.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 5.821031093597412,
|
|
"epoch": 3.1899689303151355,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000432680013075774,
|
|
"loss": 5.436,
|
|
"mean_token_accuracy": 0.17939778566360473,
|
|
"num_tokens": 7397781.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 5.805264902114868,
|
|
"epoch": 3.1944074567243677,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004324340959787354,
|
|
"loss": 5.4492,
|
|
"mean_token_accuracy": 0.17887378931045533,
|
|
"num_tokens": 7407135.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 5.814063787460327,
|
|
"epoch": 3.1988459831336,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043218780986693274,
|
|
"loss": 5.5155,
|
|
"mean_token_accuracy": 0.1740931436419487,
|
|
"num_tokens": 7417614.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 5.742436218261719,
|
|
"epoch": 3.203284509542832,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004319411553176438,
|
|
"loss": 5.5237,
|
|
"mean_token_accuracy": 0.17489579766988755,
|
|
"num_tokens": 7427792.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.751005458831787,
|
|
"epoch": 3.207723035952064,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004316941329090101,
|
|
"loss": 5.4246,
|
|
"mean_token_accuracy": 0.1843129500746727,
|
|
"num_tokens": 7437310.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.804794406890869,
|
|
"epoch": 3.2121615623612962,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043144674322003525,
|
|
"loss": 5.5249,
|
|
"mean_token_accuracy": 0.1753912925720215,
|
|
"num_tokens": 7447451.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.8752443313598635,
|
|
"epoch": 3.2166000887705284,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004311989868305837,
|
|
"loss": 5.536,
|
|
"mean_token_accuracy": 0.1762519434094429,
|
|
"num_tokens": 7456837.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.7469000816345215,
|
|
"epoch": 3.2210386151797605,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00043095086432137954,
|
|
"loss": 5.5601,
|
|
"mean_token_accuracy": 0.17813700139522554,
|
|
"num_tokens": 7466832.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 5.867207765579224,
|
|
"epoch": 3.2254771415889927,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000430702376274005,
|
|
"loss": 5.5123,
|
|
"mean_token_accuracy": 0.181433866918087,
|
|
"num_tokens": 7476833.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.72882194519043,
|
|
"epoch": 3.2299156679982244,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043045352327089907,
|
|
"loss": 5.4978,
|
|
"mean_token_accuracy": 0.17953841239213944,
|
|
"num_tokens": 7486980.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.76573543548584,
|
|
"epoch": 3.2343541944074565,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00043020430589535625,
|
|
"loss": 5.511,
|
|
"mean_token_accuracy": 0.1714419886469841,
|
|
"num_tokens": 7496612.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.787287712097168,
|
|
"epoch": 3.2387927208166887,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000429954724731525,
|
|
"loss": 5.5044,
|
|
"mean_token_accuracy": 0.17498656511306762,
|
|
"num_tokens": 7506704.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 5.848012685775757,
|
|
"epoch": 3.243231247225921,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004297047803644063,
|
|
"loss": 5.5579,
|
|
"mean_token_accuracy": 0.16941310465335846,
|
|
"num_tokens": 7517914.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 5.829830932617187,
|
|
"epoch": 3.247669773635153,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000429454473379853,
|
|
"loss": 5.5851,
|
|
"mean_token_accuracy": 0.16952553391456604,
|
|
"num_tokens": 7527610.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 5.78036208152771,
|
|
"epoch": 3.252108300044385,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004292038043645675,
|
|
"loss": 5.579,
|
|
"mean_token_accuracy": 0.17085347920656205,
|
|
"num_tokens": 7536721.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.835186433792114,
|
|
"epoch": 3.2565468264536173,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042895277390610074,
|
|
"loss": 5.5393,
|
|
"mean_token_accuracy": 0.16900095343589783,
|
|
"num_tokens": 7546508.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.8003698825836185,
|
|
"epoch": 3.2609853528628494,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004287013825928509,
|
|
"loss": 5.4926,
|
|
"mean_token_accuracy": 0.1826077312231064,
|
|
"num_tokens": 7556024.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 5.807423114776611,
|
|
"epoch": 3.2654238792720816,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004284496310140622,
|
|
"loss": 5.6074,
|
|
"mean_token_accuracy": 0.16542265564203262,
|
|
"num_tokens": 7566033.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 5.8312273025512695,
|
|
"epoch": 3.2698624056813137,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004281975197598231,
|
|
"loss": 5.6146,
|
|
"mean_token_accuracy": 0.17007148563861846,
|
|
"num_tokens": 7576956.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.792421102523804,
|
|
"epoch": 3.274300932090546,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004279450494210651,
|
|
"loss": 5.5571,
|
|
"mean_token_accuracy": 0.17620914578437805,
|
|
"num_tokens": 7588185.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.833206367492676,
|
|
"epoch": 3.278739458499778,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004276922205895614,
|
|
"loss": 5.4967,
|
|
"mean_token_accuracy": 0.17706188112497329,
|
|
"num_tokens": 7598886.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 5.774030017852783,
|
|
"epoch": 3.28317798490901,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004274390338579257,
|
|
"loss": 5.4094,
|
|
"mean_token_accuracy": 0.18668818473815918,
|
|
"num_tokens": 7609238.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.7815450668334964,
|
|
"epoch": 3.2876165113182423,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004271854898196102,
|
|
"loss": 5.4946,
|
|
"mean_token_accuracy": 0.1777348294854164,
|
|
"num_tokens": 7619873.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 5.715425872802735,
|
|
"epoch": 3.2920550377274744,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004269315890689049,
|
|
"loss": 5.4391,
|
|
"mean_token_accuracy": 0.18781703263521193,
|
|
"num_tokens": 7628903.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 5.795434141159058,
|
|
"epoch": 3.2964935641367066,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00042667733220093574,
|
|
"loss": 5.6098,
|
|
"mean_token_accuracy": 0.16501247882843018,
|
|
"num_tokens": 7639774.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 5.788212394714355,
|
|
"epoch": 3.3009320905459387,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004264227198116635,
|
|
"loss": 5.5198,
|
|
"mean_token_accuracy": 0.17427263855934144,
|
|
"num_tokens": 7649739.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 5.754326581954956,
|
|
"epoch": 3.305370616955171,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042616775249788223,
|
|
"loss": 5.4986,
|
|
"mean_token_accuracy": 0.17347201257944106,
|
|
"num_tokens": 7659329.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 5.818285989761352,
|
|
"epoch": 3.309809143364403,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004259124308572178,
|
|
"loss": 5.5031,
|
|
"mean_token_accuracy": 0.17783356904983522,
|
|
"num_tokens": 7669754.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 5.849746561050415,
|
|
"epoch": 3.314247669773635,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004256567554881268,
|
|
"loss": 5.5744,
|
|
"mean_token_accuracy": 0.16835701167583467,
|
|
"num_tokens": 7679139.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 5.756852912902832,
|
|
"epoch": 3.3186861961828673,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004254007269898948,
|
|
"loss": 5.4857,
|
|
"mean_token_accuracy": 0.17899881154298783,
|
|
"num_tokens": 7689210.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.784307432174683,
|
|
"epoch": 3.3231247225920995,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00042514434596263513,
|
|
"loss": 5.5316,
|
|
"mean_token_accuracy": 0.17348483949899673,
|
|
"num_tokens": 7698741.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 5.769883012771606,
|
|
"epoch": 3.3275632490013316,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.0004248876130072873,
|
|
"loss": 5.5304,
|
|
"mean_token_accuracy": 0.1791750445961952,
|
|
"num_tokens": 7708398.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.805131721496582,
|
|
"epoch": 3.3320017754105637,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00042463052872561587,
|
|
"loss": 5.4996,
|
|
"mean_token_accuracy": 0.17841846048831939,
|
|
"num_tokens": 7718574.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 5.776119947433472,
|
|
"epoch": 3.336440301819796,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00042437309372020886,
|
|
"loss": 5.491,
|
|
"mean_token_accuracy": 0.18578603267669677,
|
|
"num_tokens": 7728453.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 5.758517026901245,
|
|
"epoch": 3.340878828229028,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00042411530859447634,
|
|
"loss": 5.4694,
|
|
"mean_token_accuracy": 0.17349309474229813,
|
|
"num_tokens": 7738928.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 5.788589143753052,
|
|
"epoch": 3.34531735463826,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004238571739526489,
|
|
"loss": 5.5044,
|
|
"mean_token_accuracy": 0.18183342814445497,
|
|
"num_tokens": 7748828.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 5.8095966339111325,
|
|
"epoch": 3.3497558810474923,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004235986903997767,
|
|
"loss": 5.5192,
|
|
"mean_token_accuracy": 0.17913017868995668,
|
|
"num_tokens": 7759533.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 5.770309352874756,
|
|
"epoch": 3.3541944074567245,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004233398585417275,
|
|
"loss": 5.4932,
|
|
"mean_token_accuracy": 0.17637839764356614,
|
|
"num_tokens": 7769511.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 5.806517553329468,
|
|
"epoch": 3.3586329338659566,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004230806789851854,
|
|
"loss": 5.5236,
|
|
"mean_token_accuracy": 0.1788152739405632,
|
|
"num_tokens": 7779579.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.761344146728516,
|
|
"epoch": 3.3630714602751888,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00042282115233764953,
|
|
"loss": 5.5373,
|
|
"mean_token_accuracy": 0.18033097833395004,
|
|
"num_tokens": 7789739.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 5.832413530349731,
|
|
"epoch": 3.367509986684421,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004225612792074326,
|
|
"loss": 5.5743,
|
|
"mean_token_accuracy": 0.17297957986593246,
|
|
"num_tokens": 7798744.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 5.769485569000244,
|
|
"epoch": 3.371948513093653,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00042230106020365964,
|
|
"loss": 5.4193,
|
|
"mean_token_accuracy": 0.1825847089290619,
|
|
"num_tokens": 7808111.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 5.798009586334229,
|
|
"epoch": 3.376387039502885,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042204049593626617,
|
|
"loss": 5.4902,
|
|
"mean_token_accuracy": 0.17742030769586564,
|
|
"num_tokens": 7818673.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 5.741698551177978,
|
|
"epoch": 3.3808255659121174,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00042177958701599696,
|
|
"loss": 5.508,
|
|
"mean_token_accuracy": 0.17802224904298783,
|
|
"num_tokens": 7829165.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 5.735812187194824,
|
|
"epoch": 3.3852640923213495,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004215183340544047,
|
|
"loss": 5.4262,
|
|
"mean_token_accuracy": 0.1855878248810768,
|
|
"num_tokens": 7839345.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.765830135345459,
|
|
"epoch": 3.389702618730581,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004212567376638485,
|
|
"loss": 5.5266,
|
|
"mean_token_accuracy": 0.18168332129716874,
|
|
"num_tokens": 7850232.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.817579126358032,
|
|
"epoch": 3.3941411451398134,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00042099479845749256,
|
|
"loss": 5.5961,
|
|
"mean_token_accuracy": 0.16893403679132463,
|
|
"num_tokens": 7860109.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.775877475738525,
|
|
"epoch": 3.3985796715490455,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042073251704930414,
|
|
"loss": 5.5559,
|
|
"mean_token_accuracy": 0.17739353477954864,
|
|
"num_tokens": 7870466.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.847122144699097,
|
|
"epoch": 3.4030181979582776,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042046989405405326,
|
|
"loss": 5.5934,
|
|
"mean_token_accuracy": 0.17239516228437424,
|
|
"num_tokens": 7880460.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 5.73626298904419,
|
|
"epoch": 3.40745672436751,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004202069300873102,
|
|
"loss": 5.444,
|
|
"mean_token_accuracy": 0.17805344611406326,
|
|
"num_tokens": 7890099.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 5.804626178741455,
|
|
"epoch": 3.411895250776742,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004199436257654445,
|
|
"loss": 5.5374,
|
|
"mean_token_accuracy": 0.17474997490644456,
|
|
"num_tokens": 7900484.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 5.791158151626587,
|
|
"epoch": 3.416333777185974,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004196799817056234,
|
|
"loss": 5.5676,
|
|
"mean_token_accuracy": 0.1661073759198189,
|
|
"num_tokens": 7911408.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 5.822518634796142,
|
|
"epoch": 3.4207723035952062,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041941599852581067,
|
|
"loss": 5.5941,
|
|
"mean_token_accuracy": 0.16456971168518067,
|
|
"num_tokens": 7922317.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 5.850543022155762,
|
|
"epoch": 3.4252108300044384,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041915167684476495,
|
|
"loss": 5.5218,
|
|
"mean_token_accuracy": 0.18075551390647887,
|
|
"num_tokens": 7932713.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 5.771756839752197,
|
|
"epoch": 3.4296493564136705,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000418887017282038,
|
|
"loss": 5.4753,
|
|
"mean_token_accuracy": 0.1776781052350998,
|
|
"num_tokens": 7942639.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 5.707421112060547,
|
|
"epoch": 3.4340878828229027,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041862202045797386,
|
|
"loss": 5.5052,
|
|
"mean_token_accuracy": 0.18350479304790496,
|
|
"num_tokens": 7953094.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 5.789714384078979,
|
|
"epoch": 3.438526409232135,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004183566869937069,
|
|
"loss": 5.5103,
|
|
"mean_token_accuracy": 0.17723090648651124,
|
|
"num_tokens": 7963070.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 5.729114675521851,
|
|
"epoch": 3.442964935641367,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004180910175111608,
|
|
"loss": 5.4825,
|
|
"mean_token_accuracy": 0.18474385887384415,
|
|
"num_tokens": 7972957.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 5.81961579322815,
|
|
"epoch": 3.447403462050599,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041782501263304655,
|
|
"loss": 5.5174,
|
|
"mean_token_accuracy": 0.17037456184625627,
|
|
"num_tokens": 7982759.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 5.793990993499756,
|
|
"epoch": 3.4518419884598313,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004175586729828614,
|
|
"loss": 5.6276,
|
|
"mean_token_accuracy": 0.1665704995393753,
|
|
"num_tokens": 7993300.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 5.737445640563965,
|
|
"epoch": 3.4562805148690634,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041729199918488725,
|
|
"loss": 5.4466,
|
|
"mean_token_accuracy": 0.1841512829065323,
|
|
"num_tokens": 8003175.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.7286967754364015,
|
|
"epoch": 3.4607190412782955,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041702499186418936,
|
|
"loss": 5.4967,
|
|
"mean_token_accuracy": 0.18316451460123062,
|
|
"num_tokens": 8013399.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 5.761036109924317,
|
|
"epoch": 3.4651575676875277,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041675765164661473,
|
|
"loss": 5.5364,
|
|
"mean_token_accuracy": 0.1704569160938263,
|
|
"num_tokens": 8022939.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.758256196975708,
|
|
"epoch": 3.46959609409676,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004164899791587903,
|
|
"loss": 5.5904,
|
|
"mean_token_accuracy": 0.17271675616502763,
|
|
"num_tokens": 8034267.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.749184274673462,
|
|
"epoch": 3.474034620505992,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00041622197502812224,
|
|
"loss": 5.4549,
|
|
"mean_token_accuracy": 0.17980799823999405,
|
|
"num_tokens": 8044270.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 5.827999448776245,
|
|
"epoch": 3.478473146915224,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000415953639882794,
|
|
"loss": 5.5304,
|
|
"mean_token_accuracy": 0.1710374191403389,
|
|
"num_tokens": 8055775.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 5.766659116744995,
|
|
"epoch": 3.4829116733244563,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00041568497435176473,
|
|
"loss": 5.5221,
|
|
"mean_token_accuracy": 0.17611446529626845,
|
|
"num_tokens": 8065768.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 5.748378419876099,
|
|
"epoch": 3.4873501997336884,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004154159790647681,
|
|
"loss": 5.4649,
|
|
"mean_token_accuracy": 0.18407126516103745,
|
|
"num_tokens": 8075759.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 5.7725756645202635,
|
|
"epoch": 3.4917887261429206,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041514665465231063,
|
|
"loss": 5.4982,
|
|
"mean_token_accuracy": 0.18658517599105834,
|
|
"num_tokens": 8085658.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 5.741648721694946,
|
|
"epoch": 3.4962272525521527,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041487700174567036,
|
|
"loss": 5.5052,
|
|
"mean_token_accuracy": 0.17059303522109986,
|
|
"num_tokens": 8096094.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 5.767246150970459,
|
|
"epoch": 3.500665778961385,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041460702097689535,
|
|
"loss": 5.5218,
|
|
"mean_token_accuracy": 0.1741237834095955,
|
|
"num_tokens": 8106617.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 5.773199129104614,
|
|
"epoch": 3.505104305370617,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041433671297880204,
|
|
"loss": 5.5496,
|
|
"mean_token_accuracy": 0.16931709200143813,
|
|
"num_tokens": 8116621.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 5.806981468200684,
|
|
"epoch": 3.509542831779849,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004140660783849739,
|
|
"loss": 5.5137,
|
|
"mean_token_accuracy": 0.17311855256557465,
|
|
"num_tokens": 8127433.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 5.786522340774536,
|
|
"epoch": 3.5139813581890813,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041379511782975995,
|
|
"loss": 5.5991,
|
|
"mean_token_accuracy": 0.17303308695554734,
|
|
"num_tokens": 8138568.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 5.76244478225708,
|
|
"epoch": 3.5184198845983135,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004135238319482731,
|
|
"loss": 5.5114,
|
|
"mean_token_accuracy": 0.18091665506362914,
|
|
"num_tokens": 8148358.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 5.7167627811431885,
|
|
"epoch": 3.5228584110075456,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041325222137638914,
|
|
"loss": 5.3969,
|
|
"mean_token_accuracy": 0.18320150971412658,
|
|
"num_tokens": 8157817.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 5.775286912918091,
|
|
"epoch": 3.5272969374167777,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004129802867507444,
|
|
"loss": 5.5544,
|
|
"mean_token_accuracy": 0.17027477473020552,
|
|
"num_tokens": 8167599.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 5.696363019943237,
|
|
"epoch": 3.53173546382601,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004127080287087354,
|
|
"loss": 5.5232,
|
|
"mean_token_accuracy": 0.17984641939401627,
|
|
"num_tokens": 8179004.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.784954500198364,
|
|
"epoch": 3.536173990235242,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041243544788851616,
|
|
"loss": 5.4638,
|
|
"mean_token_accuracy": 0.18233600854873658,
|
|
"num_tokens": 8189410.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 5.829836797714234,
|
|
"epoch": 3.540612516644474,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041216254492899753,
|
|
"loss": 5.6603,
|
|
"mean_token_accuracy": 0.1625197023153305,
|
|
"num_tokens": 8200712.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 5.799665212631226,
|
|
"epoch": 3.5450510430537063,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004118893204698454,
|
|
"loss": 5.5192,
|
|
"mean_token_accuracy": 0.17453998774290086,
|
|
"num_tokens": 8209907.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.747171545028687,
|
|
"epoch": 3.5494895694629385,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004116157751514793,
|
|
"loss": 5.5106,
|
|
"mean_token_accuracy": 0.18200805485248567,
|
|
"num_tokens": 8220216.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"epoch": 3.5494895694629385,
|
|
"eval_entropy": 5.639556728462709,
|
|
"eval_loss": 6.055363178253174,
|
|
"eval_mean_token_accuracy": 0.1559798157377934,
|
|
"eval_num_tokens": 8220216.0,
|
|
"eval_runtime": 2.6999,
|
|
"eval_samples_per_second": 1247.088,
|
|
"eval_steps_per_second": 155.932,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 5.758590269088745,
|
|
"epoch": 3.5539280958721706,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00041134190961507073,
|
|
"loss": 5.5321,
|
|
"mean_token_accuracy": 0.17542774826288224,
|
|
"num_tokens": 8230336.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 5.784881734848023,
|
|
"epoch": 3.5583666222814028,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041106772450254177,
|
|
"loss": 5.4653,
|
|
"mean_token_accuracy": 0.17452345192432403,
|
|
"num_tokens": 8240874.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 5.783570194244385,
|
|
"epoch": 3.562805148690635,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041079322045656366,
|
|
"loss": 5.5892,
|
|
"mean_token_accuracy": 0.17384659200906755,
|
|
"num_tokens": 8252841.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 5.830329322814942,
|
|
"epoch": 3.567243675099867,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000410518398120555,
|
|
"loss": 5.5175,
|
|
"mean_token_accuracy": 0.17372012734413148,
|
|
"num_tokens": 8263302.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 5.751014280319214,
|
|
"epoch": 3.571682201509099,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00041024325813868065,
|
|
"loss": 5.5459,
|
|
"mean_token_accuracy": 0.17314320653676987,
|
|
"num_tokens": 8274057.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 5.72536072731018,
|
|
"epoch": 3.5761207279183314,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00040996780115584995,
|
|
"loss": 5.5958,
|
|
"mean_token_accuracy": 0.1759219765663147,
|
|
"num_tokens": 8286464.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 5.826333808898926,
|
|
"epoch": 3.5805592543275635,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004096920278177153,
|
|
"loss": 5.5092,
|
|
"mean_token_accuracy": 0.18037501573562623,
|
|
"num_tokens": 8296892.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 5.790096998214722,
|
|
"epoch": 3.5849977807367956,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004094159387706703,
|
|
"loss": 5.5125,
|
|
"mean_token_accuracy": 0.18033478856086732,
|
|
"num_tokens": 8306657.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 5.824331569671631,
|
|
"epoch": 3.589436307146028,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004091395346618491,
|
|
"loss": 5.6575,
|
|
"mean_token_accuracy": 0.16630110293626785,
|
|
"num_tokens": 8316827.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 5.805656099319458,
|
|
"epoch": 3.5938748335552595,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00040886281613912396,
|
|
"loss": 5.4919,
|
|
"mean_token_accuracy": 0.17849037796258926,
|
|
"num_tokens": 8328373.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 5.827359437942505,
|
|
"epoch": 3.5983133599644916,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004085857838511042,
|
|
"loss": 5.5818,
|
|
"mean_token_accuracy": 0.17678980827331542,
|
|
"num_tokens": 8341237.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 5.710772895812989,
|
|
"epoch": 3.602751886373724,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040830843844713447,
|
|
"loss": 5.5011,
|
|
"mean_token_accuracy": 0.1750195726752281,
|
|
"num_tokens": 8352017.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 5.81193175315857,
|
|
"epoch": 3.607190412782956,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040803078057729354,
|
|
"loss": 5.5159,
|
|
"mean_token_accuracy": 0.17865791022777558,
|
|
"num_tokens": 8362928.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 5.748114824295044,
|
|
"epoch": 3.611628939192188,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004077528108923924,
|
|
"loss": 5.5559,
|
|
"mean_token_accuracy": 0.17659952044486998,
|
|
"num_tokens": 8373381.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 5.803421354293823,
|
|
"epoch": 3.6160674656014202,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004074745300439732,
|
|
"loss": 5.6322,
|
|
"mean_token_accuracy": 0.1618813991546631,
|
|
"num_tokens": 8384582.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 5.8019660949707035,
|
|
"epoch": 3.6205059920106524,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000407195938684307,
|
|
"loss": 5.4872,
|
|
"mean_token_accuracy": 0.17608115077018738,
|
|
"num_tokens": 8394519.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 5.7562150955200195,
|
|
"epoch": 3.6249445184198845,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000406917037466393,
|
|
"loss": 5.5079,
|
|
"mean_token_accuracy": 0.18082676380872725,
|
|
"num_tokens": 8405010.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 5.736172008514404,
|
|
"epoch": 3.6293830448291167,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004066378270439567,
|
|
"loss": 5.4797,
|
|
"mean_token_accuracy": 0.18313054293394088,
|
|
"num_tokens": 8414933.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 5.825035905838012,
|
|
"epoch": 3.633821571238349,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004063583080714481,
|
|
"loss": 5.4873,
|
|
"mean_token_accuracy": 0.17869255542755128,
|
|
"num_tokens": 8426086.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 5.788977384567261,
|
|
"epoch": 3.638260097647581,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040607848120404063,
|
|
"loss": 5.587,
|
|
"mean_token_accuracy": 0.16598645299673082,
|
|
"num_tokens": 8436157.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 5.757912921905517,
|
|
"epoch": 3.642698624056813,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004057983470976293,
|
|
"loss": 5.5187,
|
|
"mean_token_accuracy": 0.17786410450935364,
|
|
"num_tokens": 8446602.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 5.770361804962159,
|
|
"epoch": 3.6471371504660453,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00040551790640882954,
|
|
"loss": 5.5779,
|
|
"mean_token_accuracy": 0.17473774552345275,
|
|
"num_tokens": 8457029.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 5.7793317317962645,
|
|
"epoch": 3.6515756768752774,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040523715979497486,
|
|
"loss": 5.5423,
|
|
"mean_token_accuracy": 0.1721513971686363,
|
|
"num_tokens": 8466965.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 5.807348728179932,
|
|
"epoch": 3.6560142032845095,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004049561079141163,
|
|
"loss": 5.5432,
|
|
"mean_token_accuracy": 0.1787703663110733,
|
|
"num_tokens": 8477009.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 5.7499840259552,
|
|
"epoch": 3.6604527296937417,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004046747514250202,
|
|
"loss": 5.5504,
|
|
"mean_token_accuracy": 0.17546208202838898,
|
|
"num_tokens": 8487931.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 5.652848815917968,
|
|
"epoch": 3.664891256102974,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004043930909871671,
|
|
"loss": 5.4463,
|
|
"mean_token_accuracy": 0.1887633755803108,
|
|
"num_tokens": 8498347.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 5.742549324035645,
|
|
"epoch": 3.669329782512206,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00040411112726074954,
|
|
"loss": 5.4154,
|
|
"mean_token_accuracy": 0.18402329832315445,
|
|
"num_tokens": 8508032.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 5.75079312324524,
|
|
"epoch": 3.673768308921438,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00040382886090667154,
|
|
"loss": 5.4874,
|
|
"mean_token_accuracy": 0.1806105464696884,
|
|
"num_tokens": 8517279.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 5.771097898483276,
|
|
"epoch": 3.6782068353306703,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004035462925865459,
|
|
"loss": 5.5024,
|
|
"mean_token_accuracy": 0.17528152018785476,
|
|
"num_tokens": 8526978.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 5.67859206199646,
|
|
"epoch": 3.6826453617399024,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00040326342296269363,
|
|
"loss": 5.4488,
|
|
"mean_token_accuracy": 0.18660874664783478,
|
|
"num_tokens": 8537203.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 5.743128395080566,
|
|
"epoch": 3.6870838881491346,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00040298025269814165,
|
|
"loss": 5.4749,
|
|
"mean_token_accuracy": 0.17928291708230973,
|
|
"num_tokens": 8548761.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 5.839509391784668,
|
|
"epoch": 3.6915224145583667,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004026967824566218,
|
|
"loss": 5.5589,
|
|
"mean_token_accuracy": 0.16653368175029754,
|
|
"num_tokens": 8559428.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 5.729336977005005,
|
|
"epoch": 3.695960940967599,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000402413012902569,
|
|
"loss": 5.4503,
|
|
"mean_token_accuracy": 0.17860912382602692,
|
|
"num_tokens": 8570173.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 5.747783279418945,
|
|
"epoch": 3.700399467376831,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040212894470111966,
|
|
"loss": 5.5785,
|
|
"mean_token_accuracy": 0.17391075789928437,
|
|
"num_tokens": 8581673.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 5.77725305557251,
|
|
"epoch": 3.704837993786063,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004018445785181102,
|
|
"loss": 5.4539,
|
|
"mean_token_accuracy": 0.18218168914318084,
|
|
"num_tokens": 8591375.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 5.710399770736695,
|
|
"epoch": 3.7092765201952953,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004015599150200755,
|
|
"loss": 5.5329,
|
|
"mean_token_accuracy": 0.1777075231075287,
|
|
"num_tokens": 8601940.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 5.707136774063111,
|
|
"epoch": 3.7137150466045274,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00040127495487424735,
|
|
"loss": 5.4598,
|
|
"mean_token_accuracy": 0.18140023648738862,
|
|
"num_tokens": 8612346.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 5.744045686721802,
|
|
"epoch": 3.7181535730137596,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004009896987485531,
|
|
"loss": 5.5638,
|
|
"mean_token_accuracy": 0.17714692652225494,
|
|
"num_tokens": 8622994.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 5.775576734542847,
|
|
"epoch": 3.7225920994229913,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00040070414731161326,
|
|
"loss": 5.5267,
|
|
"mean_token_accuracy": 0.1812612682580948,
|
|
"num_tokens": 8633684.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 5.662596607208252,
|
|
"epoch": 3.7270306258322234,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00040041830123274105,
|
|
"loss": 5.4511,
|
|
"mean_token_accuracy": 0.18718448132276536,
|
|
"num_tokens": 8642799.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 5.827040672302246,
|
|
"epoch": 3.7314691522414556,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004001321611819401,
|
|
"loss": 5.5311,
|
|
"mean_token_accuracy": 0.18084388226270676,
|
|
"num_tokens": 8652611.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 5.714217329025269,
|
|
"epoch": 3.7359076786506877,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003998457278299033,
|
|
"loss": 5.5617,
|
|
"mean_token_accuracy": 0.17636579573154448,
|
|
"num_tokens": 8662819.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 5.70295467376709,
|
|
"epoch": 3.74034620505992,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003995590018480107,
|
|
"loss": 5.4903,
|
|
"mean_token_accuracy": 0.18014921694993974,
|
|
"num_tokens": 8673276.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 5.848191595077514,
|
|
"epoch": 3.744784731469152,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00039927198390832843,
|
|
"loss": 5.6112,
|
|
"mean_token_accuracy": 0.1720762312412262,
|
|
"num_tokens": 8684106.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 5.776020240783692,
|
|
"epoch": 3.749223257878384,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000398984674683607,
|
|
"loss": 5.4998,
|
|
"mean_token_accuracy": 0.1755255162715912,
|
|
"num_tokens": 8694533.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 5.738758993148804,
|
|
"epoch": 3.7536617842876163,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003986970748472795,
|
|
"loss": 5.5222,
|
|
"mean_token_accuracy": 0.17897798866033554,
|
|
"num_tokens": 8704241.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 5.78121862411499,
|
|
"epoch": 3.7581003106968485,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003984091850734604,
|
|
"loss": 5.5512,
|
|
"mean_token_accuracy": 0.16789624243974685,
|
|
"num_tokens": 8714364.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 5.697751045227051,
|
|
"epoch": 3.7625388371060806,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003981210060369435,
|
|
"loss": 5.5404,
|
|
"mean_token_accuracy": 0.1779459834098816,
|
|
"num_tokens": 8724443.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 5.702847146987915,
|
|
"epoch": 3.7669773635153128,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000397832538413201,
|
|
"loss": 5.4592,
|
|
"mean_token_accuracy": 0.1797871246933937,
|
|
"num_tokens": 8733880.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 5.8351147174835205,
|
|
"epoch": 3.771415889924545,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003975437828783811,
|
|
"loss": 5.524,
|
|
"mean_token_accuracy": 0.1804560035467148,
|
|
"num_tokens": 8744437.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 5.753838205337525,
|
|
"epoch": 3.775854416333777,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00039725474010930716,
|
|
"loss": 5.5152,
|
|
"mean_token_accuracy": 0.1822276994585991,
|
|
"num_tokens": 8756107.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 5.7022788524627686,
|
|
"epoch": 3.780292942743009,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003969654107834756,
|
|
"loss": 5.5006,
|
|
"mean_token_accuracy": 0.17494045644998552,
|
|
"num_tokens": 8766490.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 5.785413694381714,
|
|
"epoch": 3.7847314691522413,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003966757955790547,
|
|
"loss": 5.4772,
|
|
"mean_token_accuracy": 0.18133565336465834,
|
|
"num_tokens": 8776401.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 5.750336790084839,
|
|
"epoch": 3.7891699955614735,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0003963858951748826,
|
|
"loss": 5.5201,
|
|
"mean_token_accuracy": 0.1766982913017273,
|
|
"num_tokens": 8786816.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 5.6869926929473875,
|
|
"epoch": 3.7936085219707056,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003960957102504661,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.18434616476297377,
|
|
"num_tokens": 8796692.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 5.746105194091797,
|
|
"epoch": 3.798047048379938,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003958052414859788,
|
|
"loss": 5.5203,
|
|
"mean_token_accuracy": 0.17907101064920425,
|
|
"num_tokens": 8807118.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 5.681885862350464,
|
|
"epoch": 3.80248557478917,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003955144895622597,
|
|
"loss": 5.4925,
|
|
"mean_token_accuracy": 0.1807284712791443,
|
|
"num_tokens": 8817914.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 5.751665019989014,
|
|
"epoch": 3.806924101198402,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003952234551608114,
|
|
"loss": 5.5089,
|
|
"mean_token_accuracy": 0.17762693464756013,
|
|
"num_tokens": 8828236.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 5.7408606052398685,
|
|
"epoch": 3.8113626276076342,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003949321389637986,
|
|
"loss": 5.4302,
|
|
"mean_token_accuracy": 0.18315188437700272,
|
|
"num_tokens": 8838911.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 5.7521624088287355,
|
|
"epoch": 3.8158011540168664,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003946405416540466,
|
|
"loss": 5.4319,
|
|
"mean_token_accuracy": 0.1811888560652733,
|
|
"num_tokens": 8849116.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 5.720421886444091,
|
|
"epoch": 3.8202396804260985,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039434866391503963,
|
|
"loss": 5.4994,
|
|
"mean_token_accuracy": 0.17618632167577744,
|
|
"num_tokens": 8860279.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 5.7000336170196535,
|
|
"epoch": 3.8246782068353307,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00039405650643091917,
|
|
"loss": 5.5333,
|
|
"mean_token_accuracy": 0.18363996148109435,
|
|
"num_tokens": 8869910.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 5.730699825286865,
|
|
"epoch": 3.829116733244563,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003937640698864823,
|
|
"loss": 5.5585,
|
|
"mean_token_accuracy": 0.1803690657019615,
|
|
"num_tokens": 8880781.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 5.7924156665802,
|
|
"epoch": 3.833555259653795,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00039347135496718027,
|
|
"loss": 5.5631,
|
|
"mean_token_accuracy": 0.16978129595518113,
|
|
"num_tokens": 8891812.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 5.719081401824951,
|
|
"epoch": 3.837993786063027,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00039317836235911705,
|
|
"loss": 5.4632,
|
|
"mean_token_accuracy": 0.17845752388238906,
|
|
"num_tokens": 8902112.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 5.681349039077759,
|
|
"epoch": 3.8424323124722592,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003928850927490472,
|
|
"loss": 5.4173,
|
|
"mean_token_accuracy": 0.18779767602682113,
|
|
"num_tokens": 8912009.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 5.729856777191162,
|
|
"epoch": 3.8468708388814914,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003925915468243746,
|
|
"loss": 5.4864,
|
|
"mean_token_accuracy": 0.18054269552230834,
|
|
"num_tokens": 8921986.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 5.698644685745239,
|
|
"epoch": 3.8513093652907235,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00039229772527315073,
|
|
"loss": 5.5588,
|
|
"mean_token_accuracy": 0.1698625460267067,
|
|
"num_tokens": 8932103.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 5.785820150375367,
|
|
"epoch": 3.8557478916999557,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003920036287840734,
|
|
"loss": 5.5093,
|
|
"mean_token_accuracy": 0.18339616656303406,
|
|
"num_tokens": 8942587.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 5.716684341430664,
|
|
"epoch": 3.860186418109188,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039170925804648486,
|
|
"loss": 5.4901,
|
|
"mean_token_accuracy": 0.18353802263736724,
|
|
"num_tokens": 8954882.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 5.640814590454101,
|
|
"epoch": 3.86462494451842,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039141461375036957,
|
|
"loss": 5.4216,
|
|
"mean_token_accuracy": 0.1882522866129875,
|
|
"num_tokens": 8965400.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 5.732454633712768,
|
|
"epoch": 3.869063470927652,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003911196965863539,
|
|
"loss": 5.4433,
|
|
"mean_token_accuracy": 0.17967188507318496,
|
|
"num_tokens": 8975425.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 5.708558893203735,
|
|
"epoch": 3.8735019973368843,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00039082450724570357,
|
|
"loss": 5.5334,
|
|
"mean_token_accuracy": 0.17930300831794738,
|
|
"num_tokens": 8986111.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 5.737200307846069,
|
|
"epoch": 3.8779405237461164,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003905290464203221,
|
|
"loss": 5.5118,
|
|
"mean_token_accuracy": 0.17625806480646133,
|
|
"num_tokens": 8996503.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 5.806273937225342,
|
|
"epoch": 3.8823790501553486,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003902333148027495,
|
|
"loss": 5.5558,
|
|
"mean_token_accuracy": 0.17663292586803436,
|
|
"num_tokens": 9008370.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 5.737713384628296,
|
|
"epoch": 3.8868175765645807,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003899373130861605,
|
|
"loss": 5.5651,
|
|
"mean_token_accuracy": 0.17326079905033112,
|
|
"num_tokens": 9020077.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 5.8152988910675045,
|
|
"epoch": 3.891256102973813,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00038964104196436284,
|
|
"loss": 5.5894,
|
|
"mean_token_accuracy": 0.17162887006998062,
|
|
"num_tokens": 9030627.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 5.762547349929809,
|
|
"epoch": 3.895694629383045,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00038934450213179596,
|
|
"loss": 5.4845,
|
|
"mean_token_accuracy": 0.18070337772369385,
|
|
"num_tokens": 9041138.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 5.631207036972046,
|
|
"epoch": 3.900133155792277,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038904769428352873,
|
|
"loss": 5.4612,
|
|
"mean_token_accuracy": 0.18537994474172592,
|
|
"num_tokens": 9050830.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 5.788889026641845,
|
|
"epoch": 3.9045716822015093,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00038875061911525856,
|
|
"loss": 5.5402,
|
|
"mean_token_accuracy": 0.17427804619073867,
|
|
"num_tokens": 9061113.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 5.746660757064819,
|
|
"epoch": 3.9090102086107414,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003884532773233094,
|
|
"loss": 5.5819,
|
|
"mean_token_accuracy": 0.17695318460464476,
|
|
"num_tokens": 9070655.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 5.663952970504761,
|
|
"epoch": 3.9134487350199736,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00038815566960463015,
|
|
"loss": 5.3662,
|
|
"mean_token_accuracy": 0.18698422610759735,
|
|
"num_tokens": 9079019.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 5.727706336975098,
|
|
"epoch": 3.9178872614292057,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038785779665679275,
|
|
"loss": 5.5219,
|
|
"mean_token_accuracy": 0.17985262721776962,
|
|
"num_tokens": 9089545.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 5.709404706954956,
|
|
"epoch": 3.922325787838438,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003875596591779913,
|
|
"loss": 5.4711,
|
|
"mean_token_accuracy": 0.17852504402399064,
|
|
"num_tokens": 9099539.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 5.659719467163086,
|
|
"epoch": 3.92676431424767,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0003872612578670395,
|
|
"loss": 5.432,
|
|
"mean_token_accuracy": 0.18161263316869736,
|
|
"num_tokens": 9110721.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 5.731282758712768,
|
|
"epoch": 3.931202840656902,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00038696259342336966,
|
|
"loss": 5.4644,
|
|
"mean_token_accuracy": 0.17836183905601502,
|
|
"num_tokens": 9121014.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 5.750094223022461,
|
|
"epoch": 3.935641367066134,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038666366654703077,
|
|
"loss": 5.5449,
|
|
"mean_token_accuracy": 0.17551416903734207,
|
|
"num_tokens": 9131085.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 5.752908182144165,
|
|
"epoch": 3.940079893475366,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00038636447793868715,
|
|
"loss": 5.4715,
|
|
"mean_token_accuracy": 0.18193041980266572,
|
|
"num_tokens": 9140844.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 5.7174254894256595,
|
|
"epoch": 3.944518419884598,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00038606502829961645,
|
|
"loss": 5.5679,
|
|
"mean_token_accuracy": 0.17696069329977035,
|
|
"num_tokens": 9151185.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 5.754332447052002,
|
|
"epoch": 3.9489569462938303,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003857653183317081,
|
|
"loss": 5.4548,
|
|
"mean_token_accuracy": 0.1789930745959282,
|
|
"num_tokens": 9162031.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 5.769329786300659,
|
|
"epoch": 3.9533954727030625,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003854653487374617,
|
|
"loss": 5.5161,
|
|
"mean_token_accuracy": 0.17834289520978927,
|
|
"num_tokens": 9172896.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 5.715093040466309,
|
|
"epoch": 3.9578339991122946,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003851651202199856,
|
|
"loss": 5.4465,
|
|
"mean_token_accuracy": 0.1802556499838829,
|
|
"num_tokens": 9182364.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 5.703181409835816,
|
|
"epoch": 3.9622725255215268,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003848646334829949,
|
|
"loss": 5.4415,
|
|
"mean_token_accuracy": 0.1801273450255394,
|
|
"num_tokens": 9192740.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 5.674679946899414,
|
|
"epoch": 3.966711051930759,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038456388923081006,
|
|
"loss": 5.5164,
|
|
"mean_token_accuracy": 0.18230873495340347,
|
|
"num_tokens": 9202638.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 5.741348552703857,
|
|
"epoch": 3.971149578339991,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00038426288816835485,
|
|
"loss": 5.4495,
|
|
"mean_token_accuracy": 0.17755311280488967,
|
|
"num_tokens": 9212282.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 5.726871204376221,
|
|
"epoch": 3.975588104749223,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003839616310011554,
|
|
"loss": 5.5127,
|
|
"mean_token_accuracy": 0.17680146396160126,
|
|
"num_tokens": 9222352.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 5.784638833999634,
|
|
"epoch": 3.9800266311584553,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0003836601184353379,
|
|
"loss": 5.5881,
|
|
"mean_token_accuracy": 0.17251629903912544,
|
|
"num_tokens": 9233801.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 5.749805593490601,
|
|
"epoch": 3.9844651575676875,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00038335835117762706,
|
|
"loss": 5.5791,
|
|
"mean_token_accuracy": 0.17449699193239213,
|
|
"num_tokens": 9244265.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 5.760185623168946,
|
|
"epoch": 3.9889036839769196,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00038305632993534483,
|
|
"loss": 5.4196,
|
|
"mean_token_accuracy": 0.18088131695985793,
|
|
"num_tokens": 9254071.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 5.707600259780884,
|
|
"epoch": 3.993342210386152,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00038275405541640835,
|
|
"loss": 5.4296,
|
|
"mean_token_accuracy": 0.19716665893793106,
|
|
"num_tokens": 9264144.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"epoch": 3.993342210386152,
|
|
"eval_entropy": 5.5763132815689485,
|
|
"eval_loss": 5.997529983520508,
|
|
"eval_mean_token_accuracy": 0.16018386616984343,
|
|
"eval_num_tokens": 9264144.0,
|
|
"eval_runtime": 2.7056,
|
|
"eval_samples_per_second": 1244.433,
|
|
"eval_steps_per_second": 155.6,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 5.701356315612793,
|
|
"epoch": 3.997780736795384,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00038245152832932843,
|
|
"loss": 5.5425,
|
|
"mean_token_accuracy": 0.1744165375828743,
|
|
"num_tokens": 9274514.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 5.850748009151882,
|
|
"epoch": 4.001775410563693,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00038214874938320795,
|
|
"loss": 5.5387,
|
|
"mean_token_accuracy": 0.17106109195285374,
|
|
"num_tokens": 9283806.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 5.729006147384643,
|
|
"epoch": 4.006213936972925,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003818457192877399,
|
|
"loss": 5.2642,
|
|
"mean_token_accuracy": 0.18925500512123108,
|
|
"num_tokens": 9293878.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 5.720128965377808,
|
|
"epoch": 4.010652463382157,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003815424387532063,
|
|
"loss": 5.3185,
|
|
"mean_token_accuracy": 0.18909395337104798,
|
|
"num_tokens": 9304527.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 5.720921659469605,
|
|
"epoch": 4.015090989791389,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000381238908490476,
|
|
"loss": 5.237,
|
|
"mean_token_accuracy": 0.18835289925336837,
|
|
"num_tokens": 9314726.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 5.692098760604859,
|
|
"epoch": 4.019529516200621,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00038093512921100306,
|
|
"loss": 5.1707,
|
|
"mean_token_accuracy": 0.19642118662595748,
|
|
"num_tokens": 9324715.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 5.629355716705322,
|
|
"epoch": 4.023968042609853,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003806311016268254,
|
|
"loss": 5.1799,
|
|
"mean_token_accuracy": 0.19247162342071533,
|
|
"num_tokens": 9335237.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 5.7696263790130615,
|
|
"epoch": 4.028406569019086,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000380326826450563,
|
|
"loss": 5.1995,
|
|
"mean_token_accuracy": 0.1953647792339325,
|
|
"num_tokens": 9346380.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 5.63343915939331,
|
|
"epoch": 4.032845095428318,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00038002230439541603,
|
|
"loss": 5.2162,
|
|
"mean_token_accuracy": 0.19140224754810334,
|
|
"num_tokens": 9357002.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 5.699198818206787,
|
|
"epoch": 4.03728362183755,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00037971753617516336,
|
|
"loss": 5.2713,
|
|
"mean_token_accuracy": 0.1927043616771698,
|
|
"num_tokens": 9367095.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 5.744393634796142,
|
|
"epoch": 4.041722148246782,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00037941252250416074,
|
|
"loss": 5.2923,
|
|
"mean_token_accuracy": 0.19106441736221313,
|
|
"num_tokens": 9376557.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 5.664052677154541,
|
|
"epoch": 4.046160674656014,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00037910726409733965,
|
|
"loss": 5.297,
|
|
"mean_token_accuracy": 0.18930719494819642,
|
|
"num_tokens": 9387355.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 5.69176549911499,
|
|
"epoch": 4.050599201065246,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003788017616702048,
|
|
"loss": 5.31,
|
|
"mean_token_accuracy": 0.1926235094666481,
|
|
"num_tokens": 9398472.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 5.7388163089752195,
|
|
"epoch": 4.055037727474478,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00037849601593883297,
|
|
"loss": 5.2272,
|
|
"mean_token_accuracy": 0.19727225750684738,
|
|
"num_tokens": 9408229.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 5.5694373607635494,
|
|
"epoch": 4.059476253883711,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00037819002761987127,
|
|
"loss": 5.237,
|
|
"mean_token_accuracy": 0.19977665394544603,
|
|
"num_tokens": 9418732.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 5.78159465789795,
|
|
"epoch": 4.063914780292943,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003778837974305355,
|
|
"loss": 5.3161,
|
|
"mean_token_accuracy": 0.17896658927202225,
|
|
"num_tokens": 9429390.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 5.748556661605835,
|
|
"epoch": 4.068353306702175,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00037757732608860824,
|
|
"loss": 5.2833,
|
|
"mean_token_accuracy": 0.18809683322906495,
|
|
"num_tokens": 9440634.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 5.628183794021607,
|
|
"epoch": 4.072791833111407,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00037727061431243737,
|
|
"loss": 5.3021,
|
|
"mean_token_accuracy": 0.18863182365894318,
|
|
"num_tokens": 9451523.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 5.795997381210327,
|
|
"epoch": 4.077230359520639,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00037696366282093433,
|
|
"loss": 5.2465,
|
|
"mean_token_accuracy": 0.18781881034374237,
|
|
"num_tokens": 9460637.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 5.725009632110596,
|
|
"epoch": 4.081668885929871,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00037665647233357243,
|
|
"loss": 5.2701,
|
|
"mean_token_accuracy": 0.18813904821872712,
|
|
"num_tokens": 9472274.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 5.649727058410645,
|
|
"epoch": 4.0861074123391035,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0003763490435703853,
|
|
"loss": 5.286,
|
|
"mean_token_accuracy": 0.1922745645046234,
|
|
"num_tokens": 9481508.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 5.73937463760376,
|
|
"epoch": 4.090545938748336,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003760413772519648,
|
|
"loss": 5.2717,
|
|
"mean_token_accuracy": 0.18653745353221893,
|
|
"num_tokens": 9491111.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 5.665762710571289,
|
|
"epoch": 4.094984465157568,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00037573347409945983,
|
|
"loss": 5.2281,
|
|
"mean_token_accuracy": 0.19926678538322448,
|
|
"num_tokens": 9501499.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 5.729472923278808,
|
|
"epoch": 4.0994229915668,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003754253348345743,
|
|
"loss": 5.3109,
|
|
"mean_token_accuracy": 0.18431389182806016,
|
|
"num_tokens": 9512770.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 5.63422040939331,
|
|
"epoch": 4.103861517976032,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003751169601795657,
|
|
"loss": 5.2295,
|
|
"mean_token_accuracy": 0.19330070316791534,
|
|
"num_tokens": 9522663.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 5.720160961151123,
|
|
"epoch": 4.108300044385264,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00037480835085724313,
|
|
"loss": 5.2717,
|
|
"mean_token_accuracy": 0.1893833637237549,
|
|
"num_tokens": 9532652.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 5.611191701889038,
|
|
"epoch": 4.112738570794496,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003744995075909656,
|
|
"loss": 5.2573,
|
|
"mean_token_accuracy": 0.19513216018676757,
|
|
"num_tokens": 9542632.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 5.735529994964599,
|
|
"epoch": 4.1171770972037285,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003741904311046408,
|
|
"loss": 5.2186,
|
|
"mean_token_accuracy": 0.19701965749263764,
|
|
"num_tokens": 9552182.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 5.659197998046875,
|
|
"epoch": 4.121615623612961,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003738811221227228,
|
|
"loss": 5.2847,
|
|
"mean_token_accuracy": 0.19813647866249084,
|
|
"num_tokens": 9562570.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 5.602932691574097,
|
|
"epoch": 4.126054150022193,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00037357158137021077,
|
|
"loss": 5.2181,
|
|
"mean_token_accuracy": 0.1899891808629036,
|
|
"num_tokens": 9572928.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 5.699469041824341,
|
|
"epoch": 4.130492676431425,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000373261809572647,
|
|
"loss": 5.1659,
|
|
"mean_token_accuracy": 0.20609040707349777,
|
|
"num_tokens": 9583387.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 5.673456764221191,
|
|
"epoch": 4.134931202840657,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00037295180745611553,
|
|
"loss": 5.2844,
|
|
"mean_token_accuracy": 0.18709968775510788,
|
|
"num_tokens": 9592876.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 5.634208106994629,
|
|
"epoch": 4.139369729249889,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003726415757472401,
|
|
"loss": 5.2281,
|
|
"mean_token_accuracy": 0.1973868727684021,
|
|
"num_tokens": 9603818.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 5.697757434844971,
|
|
"epoch": 4.143808255659121,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00037233111517318257,
|
|
"loss": 5.2405,
|
|
"mean_token_accuracy": 0.19370168149471284,
|
|
"num_tokens": 9613726.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 5.638398885726929,
|
|
"epoch": 4.1482467820683535,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003720204264616414,
|
|
"loss": 5.2381,
|
|
"mean_token_accuracy": 0.19537219703197478,
|
|
"num_tokens": 9624566.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 5.605507707595825,
|
|
"epoch": 4.152685308477586,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003717095103408497,
|
|
"loss": 5.2355,
|
|
"mean_token_accuracy": 0.19357358068227767,
|
|
"num_tokens": 9634558.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 5.650458574295044,
|
|
"epoch": 4.157123834886818,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00037139836753957353,
|
|
"loss": 5.315,
|
|
"mean_token_accuracy": 0.18568638265132903,
|
|
"num_tokens": 9644937.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 5.73355770111084,
|
|
"epoch": 4.16156236129605,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00037108699878711044,
|
|
"loss": 5.3145,
|
|
"mean_token_accuracy": 0.18074976205825805,
|
|
"num_tokens": 9654407.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 5.638219738006592,
|
|
"epoch": 4.166000887705282,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00037077540481328744,
|
|
"loss": 5.1966,
|
|
"mean_token_accuracy": 0.19675681591033936,
|
|
"num_tokens": 9664116.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 5.643871116638183,
|
|
"epoch": 4.170439414114514,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003704635863484596,
|
|
"loss": 5.1979,
|
|
"mean_token_accuracy": 0.19657710641622544,
|
|
"num_tokens": 9674710.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 5.739799880981446,
|
|
"epoch": 4.174877940523746,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00037015154412350806,
|
|
"loss": 5.3521,
|
|
"mean_token_accuracy": 0.1823303997516632,
|
|
"num_tokens": 9685321.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 5.62279691696167,
|
|
"epoch": 4.1793164669329785,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00036983927886983847,
|
|
"loss": 5.2145,
|
|
"mean_token_accuracy": 0.19245072156190873,
|
|
"num_tokens": 9694390.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 5.585807514190674,
|
|
"epoch": 4.183754993342211,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00036952679131937923,
|
|
"loss": 5.1868,
|
|
"mean_token_accuracy": 0.19732326567173003,
|
|
"num_tokens": 9703999.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 5.686507225036621,
|
|
"epoch": 4.188193519751443,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003692140822045798,
|
|
"loss": 5.257,
|
|
"mean_token_accuracy": 0.19399092495441436,
|
|
"num_tokens": 9714853.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 5.697870445251465,
|
|
"epoch": 4.192632046160675,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00036890115225840904,
|
|
"loss": 5.3467,
|
|
"mean_token_accuracy": 0.1930564671754837,
|
|
"num_tokens": 9726006.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 5.677460718154907,
|
|
"epoch": 4.197070572569907,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003685880022143533,
|
|
"loss": 5.2474,
|
|
"mean_token_accuracy": 0.19850908517837523,
|
|
"num_tokens": 9735918.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 5.694363260269165,
|
|
"epoch": 4.201509098979139,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00036827463280641494,
|
|
"loss": 5.2696,
|
|
"mean_token_accuracy": 0.19284430593252183,
|
|
"num_tokens": 9746207.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 5.636784505844116,
|
|
"epoch": 4.205947625388371,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00036796104476911033,
|
|
"loss": 5.2579,
|
|
"mean_token_accuracy": 0.19579048752784728,
|
|
"num_tokens": 9757076.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 5.693604230880737,
|
|
"epoch": 4.210386151797604,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00036764723883746865,
|
|
"loss": 5.2048,
|
|
"mean_token_accuracy": 0.20219410210847855,
|
|
"num_tokens": 9767776.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 5.739891386032104,
|
|
"epoch": 4.214824678206836,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0003673332157470293,
|
|
"loss": 5.2705,
|
|
"mean_token_accuracy": 0.1894511416554451,
|
|
"num_tokens": 9778316.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 5.589966917037964,
|
|
"epoch": 4.219263204616068,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000367018976233841,
|
|
"loss": 5.154,
|
|
"mean_token_accuracy": 0.20144910216331482,
|
|
"num_tokens": 9788735.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 5.646427965164184,
|
|
"epoch": 4.2237017310253,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0003667045210344598,
|
|
"loss": 5.2837,
|
|
"mean_token_accuracy": 0.1887564703822136,
|
|
"num_tokens": 9799020.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 5.6686927318573,
|
|
"epoch": 4.228140257434532,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003663898508859471,
|
|
"loss": 5.2098,
|
|
"mean_token_accuracy": 0.1981448546051979,
|
|
"num_tokens": 9810421.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 5.637562465667725,
|
|
"epoch": 4.232578783843764,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003660749665258684,
|
|
"loss": 5.2807,
|
|
"mean_token_accuracy": 0.18643705397844315,
|
|
"num_tokens": 9820816.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 5.656064462661743,
|
|
"epoch": 4.237017310252996,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003657598686922909,
|
|
"loss": 5.1875,
|
|
"mean_token_accuracy": 0.20534438788890838,
|
|
"num_tokens": 9830827.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 5.667426013946534,
|
|
"epoch": 4.241455836662228,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003654445581237824,
|
|
"loss": 5.242,
|
|
"mean_token_accuracy": 0.18796127587556838,
|
|
"num_tokens": 9840928.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 5.566523122787475,
|
|
"epoch": 4.245894363071461,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003651290355594096,
|
|
"loss": 5.1411,
|
|
"mean_token_accuracy": 0.20217157006263733,
|
|
"num_tokens": 9851042.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 5.705053472518921,
|
|
"epoch": 4.250332889480692,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003648133017387356,
|
|
"loss": 5.3601,
|
|
"mean_token_accuracy": 0.18476287126541138,
|
|
"num_tokens": 9862598.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 5.754878854751587,
|
|
"epoch": 4.254771415889924,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00036449735740181884,
|
|
"loss": 5.2864,
|
|
"mean_token_accuracy": 0.18946309983730317,
|
|
"num_tokens": 9872537.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 5.604499864578247,
|
|
"epoch": 4.259209942299156,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00036418120328921146,
|
|
"loss": 5.2632,
|
|
"mean_token_accuracy": 0.190321084856987,
|
|
"num_tokens": 9883091.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 5.649293565750122,
|
|
"epoch": 4.263648468708388,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00036386484014195696,
|
|
"loss": 5.2218,
|
|
"mean_token_accuracy": 0.19319310337305068,
|
|
"num_tokens": 9892580.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 5.754296684265137,
|
|
"epoch": 4.268086995117621,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003635482687015891,
|
|
"loss": 5.3169,
|
|
"mean_token_accuracy": 0.18868042081594466,
|
|
"num_tokens": 9902618.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 5.6679424285888675,
|
|
"epoch": 4.272525521526853,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00036323148971012954,
|
|
"loss": 5.2416,
|
|
"mean_token_accuracy": 0.1906725734472275,
|
|
"num_tokens": 9912148.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 5.6508142948150635,
|
|
"epoch": 4.276964047936085,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00036291450391008655,
|
|
"loss": 5.3068,
|
|
"mean_token_accuracy": 0.18597807735204697,
|
|
"num_tokens": 9922843.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 5.685378742218018,
|
|
"epoch": 4.281402574345317,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00036259731204445347,
|
|
"loss": 5.2813,
|
|
"mean_token_accuracy": 0.1838116839528084,
|
|
"num_tokens": 9933503.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 5.6864439964294435,
|
|
"epoch": 4.285841100754549,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0003622799148567061,
|
|
"loss": 5.2686,
|
|
"mean_token_accuracy": 0.1897219806909561,
|
|
"num_tokens": 9943991.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 5.695897388458252,
|
|
"epoch": 4.290279627163781,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0003619623130908017,
|
|
"loss": 5.244,
|
|
"mean_token_accuracy": 0.19663725346326827,
|
|
"num_tokens": 9954498.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 5.625618648529053,
|
|
"epoch": 4.2947181535730135,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003616445074911774,
|
|
"loss": 5.3275,
|
|
"mean_token_accuracy": 0.18534286618232726,
|
|
"num_tokens": 9965206.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 5.635822486877442,
|
|
"epoch": 4.299156679982246,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003613264988027477,
|
|
"loss": 5.2884,
|
|
"mean_token_accuracy": 0.19060297310352325,
|
|
"num_tokens": 9975214.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 5.659406042098999,
|
|
"epoch": 4.303595206391478,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003610082877709031,
|
|
"loss": 5.286,
|
|
"mean_token_accuracy": 0.18736871629953383,
|
|
"num_tokens": 9986225.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 5.660641241073608,
|
|
"epoch": 4.30803373280071,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00036068987514150866,
|
|
"loss": 5.2555,
|
|
"mean_token_accuracy": 0.19821808636188507,
|
|
"num_tokens": 9995779.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 5.64681830406189,
|
|
"epoch": 4.312472259209942,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00036037126166090167,
|
|
"loss": 5.3489,
|
|
"mean_token_accuracy": 0.18932785391807555,
|
|
"num_tokens": 10007252.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 5.637697410583496,
|
|
"epoch": 4.316910785619174,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003600524480758906,
|
|
"loss": 5.2318,
|
|
"mean_token_accuracy": 0.19486922770738602,
|
|
"num_tokens": 10017578.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 5.6532087326049805,
|
|
"epoch": 4.321349312028406,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00035973343513375254,
|
|
"loss": 5.3188,
|
|
"mean_token_accuracy": 0.19158722460269928,
|
|
"num_tokens": 10027666.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 5.680660104751587,
|
|
"epoch": 4.3257878384376385,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000359414223582232,
|
|
"loss": 5.3116,
|
|
"mean_token_accuracy": 0.19016897827386856,
|
|
"num_tokens": 10037663.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 5.622398471832275,
|
|
"epoch": 4.330226364846871,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003590948141695392,
|
|
"loss": 5.2118,
|
|
"mean_token_accuracy": 0.20080626308917998,
|
|
"num_tokens": 10046807.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 5.632709121704101,
|
|
"epoch": 4.334664891256103,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0003587752076443479,
|
|
"loss": 5.2463,
|
|
"mean_token_accuracy": 0.1918161079287529,
|
|
"num_tokens": 10056838.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 5.664422035217285,
|
|
"epoch": 4.339103417665335,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0003584554047557939,
|
|
"loss": 5.2491,
|
|
"mean_token_accuracy": 0.18712048828601838,
|
|
"num_tokens": 10067789.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 5.653136253356934,
|
|
"epoch": 4.343541944074567,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00035813540625347334,
|
|
"loss": 5.2398,
|
|
"mean_token_accuracy": 0.19476775527000428,
|
|
"num_tokens": 10077492.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 5.632155656814575,
|
|
"epoch": 4.347980470483799,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003578152128874409,
|
|
"loss": 5.2462,
|
|
"mean_token_accuracy": 0.19236094504594803,
|
|
"num_tokens": 10087609.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 5.652819108963013,
|
|
"epoch": 4.352418996893031,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00035749482540820796,
|
|
"loss": 5.3211,
|
|
"mean_token_accuracy": 0.1850426435470581,
|
|
"num_tokens": 10097566.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 5.714115858078003,
|
|
"epoch": 4.3568575233022635,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00035717424456674086,
|
|
"loss": 5.3343,
|
|
"mean_token_accuracy": 0.18456389158964157,
|
|
"num_tokens": 10108928.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 5.649772787094117,
|
|
"epoch": 4.361296049711496,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003568534711144591,
|
|
"loss": 5.2653,
|
|
"mean_token_accuracy": 0.1963585063815117,
|
|
"num_tokens": 10119017.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 5.679361629486084,
|
|
"epoch": 4.365734576120728,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00035653250580323383,
|
|
"loss": 5.2774,
|
|
"mean_token_accuracy": 0.19579027891159057,
|
|
"num_tokens": 10129162.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 5.689876365661621,
|
|
"epoch": 4.37017310252996,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00035621134938538585,
|
|
"loss": 5.2676,
|
|
"mean_token_accuracy": 0.18924943059682847,
|
|
"num_tokens": 10139477.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 5.679563999176025,
|
|
"epoch": 4.374611628939192,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003558900026136838,
|
|
"loss": 5.3398,
|
|
"mean_token_accuracy": 0.18372707217931747,
|
|
"num_tokens": 10149787.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 5.606500291824341,
|
|
"epoch": 4.379050155348424,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003555684662413424,
|
|
"loss": 5.2255,
|
|
"mean_token_accuracy": 0.20049355775117875,
|
|
"num_tokens": 10159073.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 5.642777729034424,
|
|
"epoch": 4.383488681757656,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0003552467410220212,
|
|
"loss": 5.3377,
|
|
"mean_token_accuracy": 0.18747732937335967,
|
|
"num_tokens": 10169649.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 5.662962293624878,
|
|
"epoch": 4.3879272081668885,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003549248277098221,
|
|
"loss": 5.2077,
|
|
"mean_token_accuracy": 0.20882650166749955,
|
|
"num_tokens": 10179207.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 5.672674179077148,
|
|
"epoch": 4.392365734576121,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003546027270592878,
|
|
"loss": 5.3379,
|
|
"mean_token_accuracy": 0.18902564346790313,
|
|
"num_tokens": 10190784.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 5.629483890533447,
|
|
"epoch": 4.396804260985353,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00035428043982540017,
|
|
"loss": 5.1926,
|
|
"mean_token_accuracy": 0.19381997883319854,
|
|
"num_tokens": 10200708.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 5.693956756591797,
|
|
"epoch": 4.401242787394585,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.00035395796676357855,
|
|
"loss": 5.3106,
|
|
"mean_token_accuracy": 0.18499992042779922,
|
|
"num_tokens": 10212137.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 5.628724479675293,
|
|
"epoch": 4.405681313803817,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003536353086296778,
|
|
"loss": 5.2644,
|
|
"mean_token_accuracy": 0.1989094153046608,
|
|
"num_tokens": 10223298.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 5.661438131332398,
|
|
"epoch": 4.410119840213049,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00035331246617998654,
|
|
"loss": 5.3061,
|
|
"mean_token_accuracy": 0.1842536136507988,
|
|
"num_tokens": 10233086.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 5.674805450439453,
|
|
"epoch": 4.414558366622281,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003529894401712253,
|
|
"loss": 5.3157,
|
|
"mean_token_accuracy": 0.19099296629428864,
|
|
"num_tokens": 10243579.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 5.70593490600586,
|
|
"epoch": 4.4189968930315136,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00035266623136054505,
|
|
"loss": 5.351,
|
|
"mean_token_accuracy": 0.18827414959669114,
|
|
"num_tokens": 10254027.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 5.577308177947998,
|
|
"epoch": 4.423435419440746,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00035234284050552516,
|
|
"loss": 5.2328,
|
|
"mean_token_accuracy": 0.19931498169898987,
|
|
"num_tokens": 10263640.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 5.624858951568603,
|
|
"epoch": 4.427873945849978,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003520192683641718,
|
|
"loss": 5.3176,
|
|
"mean_token_accuracy": 0.1865358293056488,
|
|
"num_tokens": 10273782.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 5.662206935882568,
|
|
"epoch": 4.43231247225921,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0003516955156949157,
|
|
"loss": 5.283,
|
|
"mean_token_accuracy": 0.19057476669549941,
|
|
"num_tokens": 10283183.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 5.674851894378662,
|
|
"epoch": 4.436750998668442,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00035137158325661115,
|
|
"loss": 5.226,
|
|
"mean_token_accuracy": 0.19591174125671387,
|
|
"num_tokens": 10293423.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"epoch": 4.436750998668442,
|
|
"eval_entropy": 5.567853355634241,
|
|
"eval_loss": 5.981941223144531,
|
|
"eval_mean_token_accuracy": 0.16250542425627945,
|
|
"eval_num_tokens": 10293423.0,
|
|
"eval_runtime": 2.7031,
|
|
"eval_samples_per_second": 1245.604,
|
|
"eval_steps_per_second": 155.747,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 5.654122638702392,
|
|
"epoch": 4.441189525077674,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00035104747180853376,
|
|
"loss": 5.2947,
|
|
"mean_token_accuracy": 0.18767934292554855,
|
|
"num_tokens": 10303271.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 5.6119753360748295,
|
|
"epoch": 4.445628051486906,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003507231821103785,
|
|
"loss": 5.2817,
|
|
"mean_token_accuracy": 0.19101752191781998,
|
|
"num_tokens": 10313178.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 5.629220962524414,
|
|
"epoch": 4.450066577896139,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00035039871492225814,
|
|
"loss": 5.2726,
|
|
"mean_token_accuracy": 0.19079317450523375,
|
|
"num_tokens": 10322545.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 5.609466409683227,
|
|
"epoch": 4.454505104305371,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00035007407100470187,
|
|
"loss": 5.287,
|
|
"mean_token_accuracy": 0.19432370364665985,
|
|
"num_tokens": 10332409.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 5.683311319351196,
|
|
"epoch": 4.458943630714603,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0003497492511186527,
|
|
"loss": 5.2575,
|
|
"mean_token_accuracy": 0.1963579922914505,
|
|
"num_tokens": 10342386.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 5.622466516494751,
|
|
"epoch": 4.463382157123835,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00034942425602546616,
|
|
"loss": 5.2756,
|
|
"mean_token_accuracy": 0.19172120541334153,
|
|
"num_tokens": 10352708.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 5.6206597805023195,
|
|
"epoch": 4.467820683533067,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00034909908648690874,
|
|
"loss": 5.2499,
|
|
"mean_token_accuracy": 0.1950252041220665,
|
|
"num_tokens": 10363012.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 5.630757093429565,
|
|
"epoch": 4.472259209942299,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00034877374326515556,
|
|
"loss": 5.3145,
|
|
"mean_token_accuracy": 0.18441115617752074,
|
|
"num_tokens": 10374013.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 5.672241115570069,
|
|
"epoch": 4.4766977363515315,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00034844822712278874,
|
|
"loss": 5.2635,
|
|
"mean_token_accuracy": 0.19501564651727676,
|
|
"num_tokens": 10385113.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 5.62173228263855,
|
|
"epoch": 4.481136262760764,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003481225388227961,
|
|
"loss": 5.2596,
|
|
"mean_token_accuracy": 0.19639810621738435,
|
|
"num_tokens": 10394870.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 5.61270432472229,
|
|
"epoch": 4.485574789169996,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00034779667912856864,
|
|
"loss": 5.2597,
|
|
"mean_token_accuracy": 0.19666437953710555,
|
|
"num_tokens": 10405366.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 5.635061597824096,
|
|
"epoch": 4.490013315579228,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003474706488038993,
|
|
"loss": 5.3051,
|
|
"mean_token_accuracy": 0.19377691447734832,
|
|
"num_tokens": 10416167.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 5.649030971527099,
|
|
"epoch": 4.49445184198846,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00034714444861298077,
|
|
"loss": 5.2935,
|
|
"mean_token_accuracy": 0.19156765341758727,
|
|
"num_tokens": 10426462.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 5.678150844573975,
|
|
"epoch": 4.498890368397692,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00034681807932040407,
|
|
"loss": 5.2768,
|
|
"mean_token_accuracy": 0.19505888521671294,
|
|
"num_tokens": 10436877.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 5.646652936935425,
|
|
"epoch": 4.503328894806924,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003464915416911565,
|
|
"loss": 5.211,
|
|
"mean_token_accuracy": 0.1991257518529892,
|
|
"num_tokens": 10446825.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 5.607460594177246,
|
|
"epoch": 4.5077674212161565,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00034616483649062003,
|
|
"loss": 5.3141,
|
|
"mean_token_accuracy": 0.18773615658283233,
|
|
"num_tokens": 10457461.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 5.660916757583618,
|
|
"epoch": 4.512205947625389,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003458379644845693,
|
|
"loss": 5.2876,
|
|
"mean_token_accuracy": 0.19307054132223128,
|
|
"num_tokens": 10468536.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 5.569738674163818,
|
|
"epoch": 4.516644474034621,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003455109264391699,
|
|
"loss": 5.2311,
|
|
"mean_token_accuracy": 0.2075985327363014,
|
|
"num_tokens": 10477975.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 5.672913312911987,
|
|
"epoch": 4.521083000443853,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003451837231209766,
|
|
"loss": 5.3438,
|
|
"mean_token_accuracy": 0.1885087013244629,
|
|
"num_tokens": 10488778.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 5.656591367721558,
|
|
"epoch": 4.525521526853085,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00034485635529693173,
|
|
"loss": 5.3156,
|
|
"mean_token_accuracy": 0.19488475471735,
|
|
"num_tokens": 10499048.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 5.605901145935059,
|
|
"epoch": 4.529960053262317,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003445288237343632,
|
|
"loss": 5.2402,
|
|
"mean_token_accuracy": 0.194477578997612,
|
|
"num_tokens": 10510069.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 5.632487487792969,
|
|
"epoch": 4.534398579671549,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00034420112920098247,
|
|
"loss": 5.2078,
|
|
"mean_token_accuracy": 0.19704542309045792,
|
|
"num_tokens": 10519982.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 5.610809469223023,
|
|
"epoch": 4.5388371060807815,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003438732724648831,
|
|
"loss": 5.2617,
|
|
"mean_token_accuracy": 0.19183198362588882,
|
|
"num_tokens": 10530557.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 5.6930591583251955,
|
|
"epoch": 4.543275632490014,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00034354525429453894,
|
|
"loss": 5.3641,
|
|
"mean_token_accuracy": 0.19053901880979537,
|
|
"num_tokens": 10541868.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 5.725565814971924,
|
|
"epoch": 4.547714158899246,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00034321707545880223,
|
|
"loss": 5.3051,
|
|
"mean_token_accuracy": 0.18928719758987428,
|
|
"num_tokens": 10552697.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 5.6639995098114015,
|
|
"epoch": 4.552152685308478,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00034288873672690167,
|
|
"loss": 5.3462,
|
|
"mean_token_accuracy": 0.18529921025037766,
|
|
"num_tokens": 10563589.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 5.6188617706298825,
|
|
"epoch": 4.55659121171771,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00034256023886844076,
|
|
"loss": 5.2437,
|
|
"mean_token_accuracy": 0.19360621720552446,
|
|
"num_tokens": 10573463.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 5.6811785221099855,
|
|
"epoch": 4.561029738126942,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00034223158265339615,
|
|
"loss": 5.2545,
|
|
"mean_token_accuracy": 0.19319794178009034,
|
|
"num_tokens": 10583101.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 5.556000089645385,
|
|
"epoch": 4.5654682645361735,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00034190276885211554,
|
|
"loss": 5.2716,
|
|
"mean_token_accuracy": 0.18423331677913665,
|
|
"num_tokens": 10593690.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 5.635164499282837,
|
|
"epoch": 4.5699067909454065,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003415737982353159,
|
|
"loss": 5.2941,
|
|
"mean_token_accuracy": 0.1903964877128601,
|
|
"num_tokens": 10603191.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 5.681883096694946,
|
|
"epoch": 4.574345317354638,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000341244671574082,
|
|
"loss": 5.3017,
|
|
"mean_token_accuracy": 0.18837089836597443,
|
|
"num_tokens": 10613659.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 5.564352560043335,
|
|
"epoch": 4.578783843763871,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003409153896398641,
|
|
"loss": 5.1305,
|
|
"mean_token_accuracy": 0.20727834850549698,
|
|
"num_tokens": 10624045.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 5.673906660079956,
|
|
"epoch": 4.583222370173102,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00034058595320447685,
|
|
"loss": 5.3353,
|
|
"mean_token_accuracy": 0.17562085539102554,
|
|
"num_tokens": 10634158.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 5.61040620803833,
|
|
"epoch": 4.587660896582335,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00034025636304009646,
|
|
"loss": 5.3226,
|
|
"mean_token_accuracy": 0.19618920981884003,
|
|
"num_tokens": 10645080.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 5.631897068023681,
|
|
"epoch": 4.592099422991566,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0003399266199192597,
|
|
"loss": 5.2425,
|
|
"mean_token_accuracy": 0.19404248893260956,
|
|
"num_tokens": 10655623.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 5.641080236434936,
|
|
"epoch": 4.596537949400799,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003395967246148622,
|
|
"loss": 5.2854,
|
|
"mean_token_accuracy": 0.18656337410211563,
|
|
"num_tokens": 10666685.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 5.587111949920654,
|
|
"epoch": 4.600976475810031,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00033926667790015584,
|
|
"loss": 5.2656,
|
|
"mean_token_accuracy": 0.19923681169748306,
|
|
"num_tokens": 10675809.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 5.662479639053345,
|
|
"epoch": 4.605415002219264,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0003389364805487476,
|
|
"loss": 5.3413,
|
|
"mean_token_accuracy": 0.18461865037679673,
|
|
"num_tokens": 10685260.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 5.611877202987671,
|
|
"epoch": 4.609853528628495,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00033860613333459757,
|
|
"loss": 5.2462,
|
|
"mean_token_accuracy": 0.19999865740537642,
|
|
"num_tokens": 10696091.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 5.605573225021362,
|
|
"epoch": 4.614292055037727,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003382756370320169,
|
|
"loss": 5.2886,
|
|
"mean_token_accuracy": 0.19352062195539474,
|
|
"num_tokens": 10706583.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 5.739141893386841,
|
|
"epoch": 4.618730581446959,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003379449924156664,
|
|
"loss": 5.2623,
|
|
"mean_token_accuracy": 0.1936701849102974,
|
|
"num_tokens": 10716065.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 5.683768081665039,
|
|
"epoch": 4.623169107856191,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003376142002605547,
|
|
"loss": 5.2843,
|
|
"mean_token_accuracy": 0.19705345034599303,
|
|
"num_tokens": 10726230.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 5.640566396713257,
|
|
"epoch": 4.6276076342654235,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003372832613420356,
|
|
"loss": 5.2944,
|
|
"mean_token_accuracy": 0.19027775526046753,
|
|
"num_tokens": 10737465.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 5.639433574676514,
|
|
"epoch": 4.632046160674656,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003369521764358075,
|
|
"loss": 5.2702,
|
|
"mean_token_accuracy": 0.19792116135358812,
|
|
"num_tokens": 10747528.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 5.6411927223205565,
|
|
"epoch": 4.636484687083888,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003366209463179109,
|
|
"loss": 5.3429,
|
|
"mean_token_accuracy": 0.1818401500582695,
|
|
"num_tokens": 10758029.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 5.640262508392334,
|
|
"epoch": 4.64092321349312,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003362895717647265,
|
|
"loss": 5.2086,
|
|
"mean_token_accuracy": 0.19509417563676834,
|
|
"num_tokens": 10767966.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 5.618955183029175,
|
|
"epoch": 4.645361739902352,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003359580535529735,
|
|
"loss": 5.3655,
|
|
"mean_token_accuracy": 0.19132119715213775,
|
|
"num_tokens": 10778109.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 5.642926549911499,
|
|
"epoch": 4.649800266311584,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00033562639245970807,
|
|
"loss": 5.1965,
|
|
"mean_token_accuracy": 0.20074644684791565,
|
|
"num_tokens": 10788208.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 5.67922830581665,
|
|
"epoch": 4.654238792720816,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00033529458926232105,
|
|
"loss": 5.3116,
|
|
"mean_token_accuracy": 0.18762012124061583,
|
|
"num_tokens": 10798708.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 5.60074291229248,
|
|
"epoch": 4.658677319130049,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003349626447385366,
|
|
"loss": 5.2437,
|
|
"mean_token_accuracy": 0.19076474905014038,
|
|
"num_tokens": 10809605.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 5.638704633712768,
|
|
"epoch": 4.663115845539281,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003346305596664099,
|
|
"loss": 5.2174,
|
|
"mean_token_accuracy": 0.19353772103786468,
|
|
"num_tokens": 10818983.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 5.607289361953735,
|
|
"epoch": 4.667554371948513,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00033429833482432567,
|
|
"loss": 5.2177,
|
|
"mean_token_accuracy": 0.20427365750074386,
|
|
"num_tokens": 10827765.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 5.592062091827392,
|
|
"epoch": 4.671992898357745,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00033396597099099624,
|
|
"loss": 5.2666,
|
|
"mean_token_accuracy": 0.1946563631296158,
|
|
"num_tokens": 10837505.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 5.60541524887085,
|
|
"epoch": 4.676431424766977,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00033363346894545984,
|
|
"loss": 5.2645,
|
|
"mean_token_accuracy": 0.19506226778030394,
|
|
"num_tokens": 10847882.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 5.595429611206055,
|
|
"epoch": 4.680869951176209,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00033330082946707827,
|
|
"loss": 5.2496,
|
|
"mean_token_accuracy": 0.19965140521526337,
|
|
"num_tokens": 10857798.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 5.6422858238220215,
|
|
"epoch": 4.6853084775854414,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000332968053335536,
|
|
"loss": 5.3098,
|
|
"mean_token_accuracy": 0.18733831942081453,
|
|
"num_tokens": 10868709.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 5.637231636047363,
|
|
"epoch": 4.689747003994674,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00033263514133083757,
|
|
"loss": 5.2483,
|
|
"mean_token_accuracy": 0.19040373861789703,
|
|
"num_tokens": 10879745.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 5.613223361968994,
|
|
"epoch": 4.694185530403906,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00033230209423330587,
|
|
"loss": 5.2751,
|
|
"mean_token_accuracy": 0.19259334802627565,
|
|
"num_tokens": 10890562.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 5.669538974761963,
|
|
"epoch": 4.698624056813138,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0003319689128235804,
|
|
"loss": 5.274,
|
|
"mean_token_accuracy": 0.18844619989395142,
|
|
"num_tokens": 10900576.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 5.690864086151123,
|
|
"epoch": 4.70306258322237,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00033163559788261575,
|
|
"loss": 5.3173,
|
|
"mean_token_accuracy": 0.18966183066368103,
|
|
"num_tokens": 10912183.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 5.565565013885498,
|
|
"epoch": 4.707501109631602,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0003313021501916795,
|
|
"loss": 5.1953,
|
|
"mean_token_accuracy": 0.2010662868618965,
|
|
"num_tokens": 10921856.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 5.677471017837524,
|
|
"epoch": 4.711939636040834,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00033096857053235016,
|
|
"loss": 5.3378,
|
|
"mean_token_accuracy": 0.18726189136505128,
|
|
"num_tokens": 10932534.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 5.641095590591431,
|
|
"epoch": 4.7163781624500665,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00033063485968651545,
|
|
"loss": 5.249,
|
|
"mean_token_accuracy": 0.1999572589993477,
|
|
"num_tokens": 10943188.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 5.6503016471862795,
|
|
"epoch": 4.720816688859299,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003303010184363711,
|
|
"loss": 5.3246,
|
|
"mean_token_accuracy": 0.18445967882871628,
|
|
"num_tokens": 10953602.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 5.6475958824157715,
|
|
"epoch": 4.725255215268531,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00032996704756441803,
|
|
"loss": 5.2699,
|
|
"mean_token_accuracy": 0.19611910581588746,
|
|
"num_tokens": 10963397.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 5.53646068572998,
|
|
"epoch": 4.729693741677763,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003296329478534612,
|
|
"loss": 5.2109,
|
|
"mean_token_accuracy": 0.20465768426656722,
|
|
"num_tokens": 10973643.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 5.630436706542969,
|
|
"epoch": 4.734132268086995,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003292987200866075,
|
|
"loss": 5.2402,
|
|
"mean_token_accuracy": 0.19249440282583236,
|
|
"num_tokens": 10983667.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 5.588424873352051,
|
|
"epoch": 4.738570794496227,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0003289643650472639,
|
|
"loss": 5.2597,
|
|
"mean_token_accuracy": 0.19734693318605423,
|
|
"num_tokens": 10993373.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 5.59550290107727,
|
|
"epoch": 4.743009320905459,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003286298835191358,
|
|
"loss": 5.3057,
|
|
"mean_token_accuracy": 0.1939626529812813,
|
|
"num_tokens": 11003388.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 5.582844638824463,
|
|
"epoch": 4.7474478473146915,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00032829527628622517,
|
|
"loss": 5.179,
|
|
"mean_token_accuracy": 0.20016789436340332,
|
|
"num_tokens": 11014436.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 5.695787811279297,
|
|
"epoch": 4.751886373723924,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00032796054413282834,
|
|
"loss": 5.3532,
|
|
"mean_token_accuracy": 0.1878980353474617,
|
|
"num_tokens": 11025065.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 5.6283598899841305,
|
|
"epoch": 4.756324900133156,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003276256878435347,
|
|
"loss": 5.1878,
|
|
"mean_token_accuracy": 0.19970009326934815,
|
|
"num_tokens": 11033959.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 5.6868609428405765,
|
|
"epoch": 4.760763426542388,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003272907082032244,
|
|
"loss": 5.2691,
|
|
"mean_token_accuracy": 0.1895872637629509,
|
|
"num_tokens": 11043662.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 5.6718062400817875,
|
|
"epoch": 4.76520195295162,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00032695560599706706,
|
|
"loss": 5.4886,
|
|
"mean_token_accuracy": 0.1745270237326622,
|
|
"num_tokens": 11055351.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 5.6680046081542965,
|
|
"epoch": 4.769640479360852,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00032662038201051915,
|
|
"loss": 5.2491,
|
|
"mean_token_accuracy": 0.19356611073017121,
|
|
"num_tokens": 11065937.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 5.6382208347320555,
|
|
"epoch": 4.774079005770084,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00032628503702932275,
|
|
"loss": 5.2965,
|
|
"mean_token_accuracy": 0.19127077460289002,
|
|
"num_tokens": 11075983.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 5.617775297164917,
|
|
"epoch": 4.7785175321793165,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003259495718395038,
|
|
"loss": 5.3317,
|
|
"mean_token_accuracy": 0.19082656055688857,
|
|
"num_tokens": 11086818.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 5.631493854522705,
|
|
"epoch": 4.782956058588549,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003256139872273696,
|
|
"loss": 5.2669,
|
|
"mean_token_accuracy": 0.19227593392133713,
|
|
"num_tokens": 11097941.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 5.673382186889649,
|
|
"epoch": 4.787394584997781,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00032527828397950763,
|
|
"loss": 5.2502,
|
|
"mean_token_accuracy": 0.1887993887066841,
|
|
"num_tokens": 11108155.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 5.588239288330078,
|
|
"epoch": 4.791833111407013,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003249424628827834,
|
|
"loss": 5.3165,
|
|
"mean_token_accuracy": 0.1904405176639557,
|
|
"num_tokens": 11117822.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 5.672802591323853,
|
|
"epoch": 4.796271637816245,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00032460652472433854,
|
|
"loss": 5.2608,
|
|
"mean_token_accuracy": 0.19372894912958144,
|
|
"num_tokens": 11128322.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 5.715357065200806,
|
|
"epoch": 4.800710164225477,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00032427047029158924,
|
|
"loss": 5.3032,
|
|
"mean_token_accuracy": 0.19178959727287292,
|
|
"num_tokens": 11138528.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 5.588251304626465,
|
|
"epoch": 4.805148690634709,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003239343003722239,
|
|
"loss": 5.3395,
|
|
"mean_token_accuracy": 0.19131782352924348,
|
|
"num_tokens": 11150124.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 5.695693492889404,
|
|
"epoch": 4.8095872170439415,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000323598015754202,
|
|
"loss": 5.2757,
|
|
"mean_token_accuracy": 0.19160598665475845,
|
|
"num_tokens": 11160864.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 5.612943649291992,
|
|
"epoch": 4.814025743453174,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003232616172257518,
|
|
"loss": 5.291,
|
|
"mean_token_accuracy": 0.19477419108152388,
|
|
"num_tokens": 11172273.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 5.536879062652588,
|
|
"epoch": 4.818464269862406,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00032292510557536844,
|
|
"loss": 5.2375,
|
|
"mean_token_accuracy": 0.18924187272787094,
|
|
"num_tokens": 11182367.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 5.6457702159881595,
|
|
"epoch": 4.822902796271638,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000322588481591812,
|
|
"loss": 5.2336,
|
|
"mean_token_accuracy": 0.19279612451791764,
|
|
"num_tokens": 11193196.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 5.646676540374756,
|
|
"epoch": 4.82734132268087,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00032225174606410634,
|
|
"loss": 5.2909,
|
|
"mean_token_accuracy": 0.19228778928518295,
|
|
"num_tokens": 11202926.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 5.68856406211853,
|
|
"epoch": 4.831779849090102,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00032191489978153646,
|
|
"loss": 5.3878,
|
|
"mean_token_accuracy": 0.18282851576805115,
|
|
"num_tokens": 11213548.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 5.6710638999938965,
|
|
"epoch": 4.836218375499334,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003215779435336471,
|
|
"loss": 5.23,
|
|
"mean_token_accuracy": 0.19917183816432954,
|
|
"num_tokens": 11223404.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 5.577983474731445,
|
|
"epoch": 4.840656901908567,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003212408781102404,
|
|
"loss": 5.2642,
|
|
"mean_token_accuracy": 0.19608746469020844,
|
|
"num_tokens": 11233586.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 5.603341770172119,
|
|
"epoch": 4.845095428317799,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003209037043013751,
|
|
"loss": 5.1927,
|
|
"mean_token_accuracy": 0.197077240049839,
|
|
"num_tokens": 11243816.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 5.606571054458618,
|
|
"epoch": 4.849533954727031,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003205664228973632,
|
|
"loss": 5.2969,
|
|
"mean_token_accuracy": 0.18979629129171371,
|
|
"num_tokens": 11253451.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 5.66569504737854,
|
|
"epoch": 4.853972481136263,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003202290346887696,
|
|
"loss": 5.304,
|
|
"mean_token_accuracy": 0.18910456597805023,
|
|
"num_tokens": 11263985.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 5.622323417663575,
|
|
"epoch": 4.858411007545495,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003198915404664088,
|
|
"loss": 5.2887,
|
|
"mean_token_accuracy": 0.18854654878377913,
|
|
"num_tokens": 11274557.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 5.629386043548584,
|
|
"epoch": 4.862849533954727,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00031955394102134454,
|
|
"loss": 5.227,
|
|
"mean_token_accuracy": 0.19979529976844787,
|
|
"num_tokens": 11284220.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 5.553300237655639,
|
|
"epoch": 4.8672880603639594,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0003192162371448868,
|
|
"loss": 5.2902,
|
|
"mean_token_accuracy": 0.18757660388946534,
|
|
"num_tokens": 11295281.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 5.592968368530274,
|
|
"epoch": 4.871726586773192,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00031887842962859033,
|
|
"loss": 5.2361,
|
|
"mean_token_accuracy": 0.19308489561080933,
|
|
"num_tokens": 11305483.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 5.710874938964844,
|
|
"epoch": 4.876165113182424,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00031854051926425277,
|
|
"loss": 5.2688,
|
|
"mean_token_accuracy": 0.19588978737592697,
|
|
"num_tokens": 11315236.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 5.636416244506836,
|
|
"epoch": 4.880603639591656,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00031820250684391304,
|
|
"loss": 5.3134,
|
|
"mean_token_accuracy": 0.1919151797890663,
|
|
"num_tokens": 11325729.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"epoch": 4.880603639591656,
|
|
"eval_entropy": 5.471726274830146,
|
|
"eval_loss": 5.943048000335693,
|
|
"eval_mean_token_accuracy": 0.16503392612990744,
|
|
"eval_num_tokens": 11325729.0,
|
|
"eval_runtime": 2.6952,
|
|
"eval_samples_per_second": 1249.263,
|
|
"eval_steps_per_second": 156.204,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 5.542026567459106,
|
|
"epoch": 4.885042166000888,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00031786439315984925,
|
|
"loss": 5.2973,
|
|
"mean_token_accuracy": 0.19267825186252593,
|
|
"num_tokens": 11335368.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 5.6588369846344,
|
|
"epoch": 4.88948069241012,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00031752617900457656,
|
|
"loss": 5.2859,
|
|
"mean_token_accuracy": 0.18471840023994446,
|
|
"num_tokens": 11344696.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 5.695864963531494,
|
|
"epoch": 4.893919218819352,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000317187865170846,
|
|
"loss": 5.3761,
|
|
"mean_token_accuracy": 0.17981996685266494,
|
|
"num_tokens": 11355391.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 5.603839492797851,
|
|
"epoch": 4.8983577452285845,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000316849452451642,
|
|
"loss": 5.2798,
|
|
"mean_token_accuracy": 0.19502321481704712,
|
|
"num_tokens": 11365493.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 5.586929035186768,
|
|
"epoch": 4.902796271637817,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00031651094164018097,
|
|
"loss": 5.2471,
|
|
"mean_token_accuracy": 0.1947021484375,
|
|
"num_tokens": 11376192.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 5.642178583145141,
|
|
"epoch": 4.907234798047049,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003161723335299089,
|
|
"loss": 5.3408,
|
|
"mean_token_accuracy": 0.19162992835044862,
|
|
"num_tokens": 11386920.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 5.631239175796509,
|
|
"epoch": 4.911673324456281,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003158336289145003,
|
|
"loss": 5.2499,
|
|
"mean_token_accuracy": 0.19778143465518952,
|
|
"num_tokens": 11396668.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 5.675585317611694,
|
|
"epoch": 4.916111850865512,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00031549482858785554,
|
|
"loss": 5.3227,
|
|
"mean_token_accuracy": 0.184337118268013,
|
|
"num_tokens": 11407479.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 5.624910354614258,
|
|
"epoch": 4.920550377274745,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00031515593334409934,
|
|
"loss": 5.2995,
|
|
"mean_token_accuracy": 0.19436507821083068,
|
|
"num_tokens": 11417431.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 5.6332221031188965,
|
|
"epoch": 4.9249889036839765,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003148169439775792,
|
|
"loss": 5.2554,
|
|
"mean_token_accuracy": 0.19847005605697632,
|
|
"num_tokens": 11427262.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 5.664980173110962,
|
|
"epoch": 4.9294274300932095,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00031447786128286286,
|
|
"loss": 5.2158,
|
|
"mean_token_accuracy": 0.19394159615039824,
|
|
"num_tokens": 11437958.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 5.560730075836181,
|
|
"epoch": 4.933865956502441,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003141386860547371,
|
|
"loss": 5.2121,
|
|
"mean_token_accuracy": 0.2035077393054962,
|
|
"num_tokens": 11447233.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 5.6375902652740475,
|
|
"epoch": 4.938304482911674,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0003137994190882054,
|
|
"loss": 5.3308,
|
|
"mean_token_accuracy": 0.18119245618581772,
|
|
"num_tokens": 11458458.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 5.6583921909332275,
|
|
"epoch": 4.942743009320905,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003134600611784865,
|
|
"loss": 5.3601,
|
|
"mean_token_accuracy": 0.19218487590551375,
|
|
"num_tokens": 11469197.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 5.685963153839111,
|
|
"epoch": 4.947181535730138,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003131206131210119,
|
|
"loss": 5.3439,
|
|
"mean_token_accuracy": 0.18568494468927382,
|
|
"num_tokens": 11479103.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 5.6125835418701175,
|
|
"epoch": 4.951620062139369,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0003127810757114249,
|
|
"loss": 5.26,
|
|
"mean_token_accuracy": 0.19918753504753112,
|
|
"num_tokens": 11489205.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 5.633475351333618,
|
|
"epoch": 4.9560585885486015,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00031244144974557775,
|
|
"loss": 5.2449,
|
|
"mean_token_accuracy": 0.2015002354979515,
|
|
"num_tokens": 11498441.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 5.5904388427734375,
|
|
"epoch": 4.960497114957834,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003121017360195308,
|
|
"loss": 5.2319,
|
|
"mean_token_accuracy": 0.20153346359729768,
|
|
"num_tokens": 11509109.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 5.630889749526977,
|
|
"epoch": 4.964935641367066,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00031176193532954957,
|
|
"loss": 5.2786,
|
|
"mean_token_accuracy": 0.19114782959222792,
|
|
"num_tokens": 11518979.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 5.634117698669433,
|
|
"epoch": 4.969374167776298,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003114220484721038,
|
|
"loss": 5.3592,
|
|
"mean_token_accuracy": 0.18462447971105575,
|
|
"num_tokens": 11529236.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 5.653819942474366,
|
|
"epoch": 4.97381269418553,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00031108207624386486,
|
|
"loss": 5.2658,
|
|
"mean_token_accuracy": 0.1887330949306488,
|
|
"num_tokens": 11538992.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 5.611984825134277,
|
|
"epoch": 4.978251220594762,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003107420194417047,
|
|
"loss": 5.2459,
|
|
"mean_token_accuracy": 0.19865258336067199,
|
|
"num_tokens": 11549033.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 5.648901462554932,
|
|
"epoch": 4.982689747003994,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000310401878862693,
|
|
"loss": 5.3271,
|
|
"mean_token_accuracy": 0.19301538914442062,
|
|
"num_tokens": 11559386.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 5.537397050857544,
|
|
"epoch": 4.9871282734132265,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003100616553040962,
|
|
"loss": 5.1865,
|
|
"mean_token_accuracy": 0.1997347354888916,
|
|
"num_tokens": 11570101.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 5.666191101074219,
|
|
"epoch": 4.991566799822459,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00030972134956337493,
|
|
"loss": 5.2824,
|
|
"mean_token_accuracy": 0.19162117540836335,
|
|
"num_tokens": 11580081.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 5.675402212142944,
|
|
"epoch": 4.996005326231691,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00030938096243818275,
|
|
"loss": 5.2921,
|
|
"mean_token_accuracy": 0.1961108550429344,
|
|
"num_tokens": 11590285.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 5.6483564376831055,
|
|
"epoch": 5.0,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 0.00030904049472636367,
|
|
"loss": 5.3088,
|
|
"mean_token_accuracy": 0.18876984549893272,
|
|
"num_tokens": 11598630.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 5.578065586090088,
|
|
"epoch": 5.004438526409232,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00030869994722595095,
|
|
"loss": 5.133,
|
|
"mean_token_accuracy": 0.20324181020259857,
|
|
"num_tokens": 11608750.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 5.601625633239746,
|
|
"epoch": 5.008877052818464,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003083593207351644,
|
|
"loss": 5.0247,
|
|
"mean_token_accuracy": 0.2162548914551735,
|
|
"num_tokens": 11619429.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 5.6836292266845705,
|
|
"epoch": 5.013315579227696,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003080186160524095,
|
|
"loss": 5.0634,
|
|
"mean_token_accuracy": 0.2087712988257408,
|
|
"num_tokens": 11628940.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 5.647754287719726,
|
|
"epoch": 5.017754105636929,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003076778339762745,
|
|
"loss": 5.1085,
|
|
"mean_token_accuracy": 0.19888755679130554,
|
|
"num_tokens": 11639635.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 5.679539012908935,
|
|
"epoch": 5.022192632046161,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00030733697530552955,
|
|
"loss": 5.1282,
|
|
"mean_token_accuracy": 0.20206331312656403,
|
|
"num_tokens": 11649565.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 5.57519793510437,
|
|
"epoch": 5.026631158455393,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003069960408391239,
|
|
"loss": 4.9929,
|
|
"mean_token_accuracy": 0.21066118031740189,
|
|
"num_tokens": 11658805.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 5.607788848876953,
|
|
"epoch": 5.031069684864625,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00030665503137618466,
|
|
"loss": 5.0327,
|
|
"mean_token_accuracy": 0.20983841568231582,
|
|
"num_tokens": 11667875.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 5.608612155914306,
|
|
"epoch": 5.035508211273857,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0003063139477160147,
|
|
"loss": 5.0269,
|
|
"mean_token_accuracy": 0.20639787912368773,
|
|
"num_tokens": 11678397.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 5.621532392501831,
|
|
"epoch": 5.039946737683089,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00030597279065809103,
|
|
"loss": 5.0719,
|
|
"mean_token_accuracy": 0.19961849600076675,
|
|
"num_tokens": 11688672.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 5.607308101654053,
|
|
"epoch": 5.0443852640923215,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003056315610020622,
|
|
"loss": 5.0717,
|
|
"mean_token_accuracy": 0.20271217823028564,
|
|
"num_tokens": 11698807.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 5.604615497589111,
|
|
"epoch": 5.048823790501554,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003052902595477474,
|
|
"loss": 4.9989,
|
|
"mean_token_accuracy": 0.2087470233440399,
|
|
"num_tokens": 11708332.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 5.51806411743164,
|
|
"epoch": 5.053262316910786,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00030494888709513377,
|
|
"loss": 4.9813,
|
|
"mean_token_accuracy": 0.2174397587776184,
|
|
"num_tokens": 11717509.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 5.486528110504151,
|
|
"epoch": 5.057700843320018,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003046074444443751,
|
|
"loss": 4.9325,
|
|
"mean_token_accuracy": 0.22246583700180053,
|
|
"num_tokens": 11727447.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 5.590923547744751,
|
|
"epoch": 5.06213936972925,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00030426593239578966,
|
|
"loss": 5.0835,
|
|
"mean_token_accuracy": 0.2037480965256691,
|
|
"num_tokens": 11738068.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 5.598885774612427,
|
|
"epoch": 5.066577896138482,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0003039243517498583,
|
|
"loss": 4.9602,
|
|
"mean_token_accuracy": 0.21319418251514435,
|
|
"num_tokens": 11748867.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 5.641113233566284,
|
|
"epoch": 5.071016422547714,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0003035827033072228,
|
|
"loss": 5.089,
|
|
"mean_token_accuracy": 0.2028583437204361,
|
|
"num_tokens": 11758217.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 5.616635942459107,
|
|
"epoch": 5.0754549489569465,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00030324098786868364,
|
|
"loss": 5.1001,
|
|
"mean_token_accuracy": 0.20311024636030198,
|
|
"num_tokens": 11768656.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 5.558078241348267,
|
|
"epoch": 5.079893475366179,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00030289920623519854,
|
|
"loss": 5.02,
|
|
"mean_token_accuracy": 0.2149716630578041,
|
|
"num_tokens": 11779222.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 5.502596426010132,
|
|
"epoch": 5.084332001775411,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003025573592078803,
|
|
"loss": 4.9762,
|
|
"mean_token_accuracy": 0.21715585589408876,
|
|
"num_tokens": 11789489.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 5.6058704376220705,
|
|
"epoch": 5.088770528184643,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000302215447587995,
|
|
"loss": 5.0407,
|
|
"mean_token_accuracy": 0.205974081158638,
|
|
"num_tokens": 11799365.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 5.550213241577149,
|
|
"epoch": 5.093209054593875,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00030187347217696005,
|
|
"loss": 5.0634,
|
|
"mean_token_accuracy": 0.21454951018095017,
|
|
"num_tokens": 11810871.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 5.64659538269043,
|
|
"epoch": 5.097647581003107,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00030153143377634244,
|
|
"loss": 5.1786,
|
|
"mean_token_accuracy": 0.19919128865003585,
|
|
"num_tokens": 11822320.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 5.516408824920655,
|
|
"epoch": 5.102086107412339,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003011893331878569,
|
|
"loss": 4.9717,
|
|
"mean_token_accuracy": 0.21831310093402861,
|
|
"num_tokens": 11832823.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 5.581918239593506,
|
|
"epoch": 5.1065246338215715,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00030084717121336383,
|
|
"loss": 5.0316,
|
|
"mean_token_accuracy": 0.2116502895951271,
|
|
"num_tokens": 11842963.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 5.584142208099365,
|
|
"epoch": 5.110963160230804,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00030050494865486744,
|
|
"loss": 5.0307,
|
|
"mean_token_accuracy": 0.2093645766377449,
|
|
"num_tokens": 11853795.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 5.592232656478882,
|
|
"epoch": 5.115401686640036,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0003001626663145141,
|
|
"loss": 5.0086,
|
|
"mean_token_accuracy": 0.20560475587844848,
|
|
"num_tokens": 11863392.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 5.547612714767456,
|
|
"epoch": 5.119840213049268,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00029982032499459017,
|
|
"loss": 5.008,
|
|
"mean_token_accuracy": 0.21953772604465485,
|
|
"num_tokens": 11873182.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 5.585672092437744,
|
|
"epoch": 5.1242787394585,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00029947792549752034,
|
|
"loss": 5.0224,
|
|
"mean_token_accuracy": 0.20585456043481826,
|
|
"num_tokens": 11883611.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 5.526079797744751,
|
|
"epoch": 5.128717265867732,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00029913546862586567,
|
|
"loss": 5.0221,
|
|
"mean_token_accuracy": 0.20663823187351227,
|
|
"num_tokens": 11893378.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 5.615198993682862,
|
|
"epoch": 5.133155792276964,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002987929551823215,
|
|
"loss": 5.1043,
|
|
"mean_token_accuracy": 0.19898212403059007,
|
|
"num_tokens": 11904167.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 5.590409278869629,
|
|
"epoch": 5.1375943186861965,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002984503859697162,
|
|
"loss": 5.0604,
|
|
"mean_token_accuracy": 0.19891392439603806,
|
|
"num_tokens": 11914414.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 5.534732341766357,
|
|
"epoch": 5.142032845095429,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002981077617910085,
|
|
"loss": 5.0314,
|
|
"mean_token_accuracy": 0.2104380398988724,
|
|
"num_tokens": 11925065.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 5.566891670227051,
|
|
"epoch": 5.146471371504661,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00029776508344928597,
|
|
"loss": 5.0835,
|
|
"mean_token_accuracy": 0.2008894294500351,
|
|
"num_tokens": 11934452.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 5.629260444641114,
|
|
"epoch": 5.150909897913893,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002974223517477633,
|
|
"loss": 5.1517,
|
|
"mean_token_accuracy": 0.19960906356573105,
|
|
"num_tokens": 11945233.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 5.649737453460693,
|
|
"epoch": 5.155348424323125,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0002970795674897802,
|
|
"loss": 5.0896,
|
|
"mean_token_accuracy": 0.19956457167863845,
|
|
"num_tokens": 11955846.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 5.536502981185913,
|
|
"epoch": 5.159786950732357,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0002967367314787995,
|
|
"loss": 5.0534,
|
|
"mean_token_accuracy": 0.2123357966542244,
|
|
"num_tokens": 11965617.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 5.543145799636841,
|
|
"epoch": 5.164225477141589,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00029639384451840545,
|
|
"loss": 5.0238,
|
|
"mean_token_accuracy": 0.2106179490685463,
|
|
"num_tokens": 11975720.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 5.607858180999756,
|
|
"epoch": 5.168664003550822,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002960509074123015,
|
|
"loss": 5.0567,
|
|
"mean_token_accuracy": 0.20483888536691666,
|
|
"num_tokens": 11985240.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 5.573398208618164,
|
|
"epoch": 5.173102529960053,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000295707920964309,
|
|
"loss": 5.03,
|
|
"mean_token_accuracy": 0.21344470232725143,
|
|
"num_tokens": 11995723.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 5.524889850616455,
|
|
"epoch": 5.177541056369286,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002953648859783646,
|
|
"loss": 5.0129,
|
|
"mean_token_accuracy": 0.2085215851664543,
|
|
"num_tokens": 12004369.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 5.590805339813232,
|
|
"epoch": 5.181979582778517,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0002950218032585191,
|
|
"loss": 5.1073,
|
|
"mean_token_accuracy": 0.20238737761974335,
|
|
"num_tokens": 12015179.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 5.597344923019409,
|
|
"epoch": 5.186418109187749,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002946786736089346,
|
|
"loss": 5.058,
|
|
"mean_token_accuracy": 0.20639242827892304,
|
|
"num_tokens": 12025871.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 5.620744848251343,
|
|
"epoch": 5.190856635596981,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002943354978338838,
|
|
"loss": 5.139,
|
|
"mean_token_accuracy": 0.20422376394271852,
|
|
"num_tokens": 12036467.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 5.626263284683228,
|
|
"epoch": 5.1952951620062136,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002939922767377472,
|
|
"loss": 5.0605,
|
|
"mean_token_accuracy": 0.20900676995515824,
|
|
"num_tokens": 12047048.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 5.614035606384277,
|
|
"epoch": 5.199733688415446,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002936490111250116,
|
|
"loss": 5.0232,
|
|
"mean_token_accuracy": 0.21099703162908554,
|
|
"num_tokens": 12055958.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 5.497699499130249,
|
|
"epoch": 5.204172214824678,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002933057018002681,
|
|
"loss": 5.0886,
|
|
"mean_token_accuracy": 0.20526396930217744,
|
|
"num_tokens": 12067045.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 5.527740383148194,
|
|
"epoch": 5.20861074123391,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00029296234956821044,
|
|
"loss": 5.0447,
|
|
"mean_token_accuracy": 0.2035256266593933,
|
|
"num_tokens": 12077615.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 5.631336879730225,
|
|
"epoch": 5.213049267643142,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002926189552336326,
|
|
"loss": 5.1111,
|
|
"mean_token_accuracy": 0.20148058980703354,
|
|
"num_tokens": 12087704.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 5.588882112503052,
|
|
"epoch": 5.217487794052374,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002922755196014277,
|
|
"loss": 5.0818,
|
|
"mean_token_accuracy": 0.20626674145460128,
|
|
"num_tokens": 12098006.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 5.643190526962281,
|
|
"epoch": 5.221926320461606,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000291932043476585,
|
|
"loss": 5.096,
|
|
"mean_token_accuracy": 0.2011096343398094,
|
|
"num_tokens": 12108289.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 5.525919628143311,
|
|
"epoch": 5.226364846870839,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002915885276641895,
|
|
"loss": 5.0037,
|
|
"mean_token_accuracy": 0.21124742925167084,
|
|
"num_tokens": 12118389.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 5.558362579345703,
|
|
"epoch": 5.230803373280071,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00029124497296941843,
|
|
"loss": 5.0267,
|
|
"mean_token_accuracy": 0.209383824467659,
|
|
"num_tokens": 12129551.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 5.573451709747315,
|
|
"epoch": 5.235241899689303,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00029090138019754075,
|
|
"loss": 5.0837,
|
|
"mean_token_accuracy": 0.20430581122636796,
|
|
"num_tokens": 12141097.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 5.607167053222656,
|
|
"epoch": 5.239680426098535,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002905577501539144,
|
|
"loss": 5.0633,
|
|
"mean_token_accuracy": 0.2045643150806427,
|
|
"num_tokens": 12150664.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 5.617243003845215,
|
|
"epoch": 5.244118952507767,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0002902140836439847,
|
|
"loss": 5.1259,
|
|
"mean_token_accuracy": 0.20352842658758163,
|
|
"num_tokens": 12161483.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 5.538080930709839,
|
|
"epoch": 5.248557478916999,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002898703814732824,
|
|
"loss": 4.9657,
|
|
"mean_token_accuracy": 0.2118803322315216,
|
|
"num_tokens": 12171364.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 5.553083276748657,
|
|
"epoch": 5.2529960053262315,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00028952664444742204,
|
|
"loss": 5.0186,
|
|
"mean_token_accuracy": 0.21196339577436446,
|
|
"num_tokens": 12181375.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 5.6105516910552975,
|
|
"epoch": 5.257434531735464,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002891828733720996,
|
|
"loss": 5.1144,
|
|
"mean_token_accuracy": 0.20475836247205734,
|
|
"num_tokens": 12192225.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 5.535951709747314,
|
|
"epoch": 5.261873058144696,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00028883906905309103,
|
|
"loss": 5.0363,
|
|
"mean_token_accuracy": 0.2053716629743576,
|
|
"num_tokens": 12202386.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 5.593074989318848,
|
|
"epoch": 5.266311584553928,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002884952322962502,
|
|
"loss": 5.1044,
|
|
"mean_token_accuracy": 0.200898414850235,
|
|
"num_tokens": 12213358.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 5.485325574874878,
|
|
"epoch": 5.27075011096316,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00028815136390750694,
|
|
"loss": 5.0031,
|
|
"mean_token_accuracy": 0.21439032703638078,
|
|
"num_tokens": 12223819.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 5.638899469375611,
|
|
"epoch": 5.275188637372392,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002878074646928653,
|
|
"loss": 5.1032,
|
|
"mean_token_accuracy": 0.2074124902486801,
|
|
"num_tokens": 12234973.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 5.598820209503174,
|
|
"epoch": 5.279627163781624,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0002874635354584015,
|
|
"loss": 5.101,
|
|
"mean_token_accuracy": 0.20702701508998872,
|
|
"num_tokens": 12246819.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 5.623632478713989,
|
|
"epoch": 5.2840656901908565,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002871195770102621,
|
|
"loss": 5.1166,
|
|
"mean_token_accuracy": 0.20531850755214692,
|
|
"num_tokens": 12256195.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 5.573619079589844,
|
|
"epoch": 5.288504216600089,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002867755901546624,
|
|
"loss": 5.1343,
|
|
"mean_token_accuracy": 0.19836855828762054,
|
|
"num_tokens": 12267105.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 5.5811749458312985,
|
|
"epoch": 5.292942743009321,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00028643157569788386,
|
|
"loss": 5.1259,
|
|
"mean_token_accuracy": 0.20249876379966736,
|
|
"num_tokens": 12277534.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 5.604808521270752,
|
|
"epoch": 5.297381269418553,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00028608753444627307,
|
|
"loss": 5.0402,
|
|
"mean_token_accuracy": 0.2057702973484993,
|
|
"num_tokens": 12287342.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 5.6337807178497314,
|
|
"epoch": 5.301819795827785,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000285743467206239,
|
|
"loss": 5.1331,
|
|
"mean_token_accuracy": 0.19976214617490767,
|
|
"num_tokens": 12299127.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 5.579834604263306,
|
|
"epoch": 5.306258322237017,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00028539937478425196,
|
|
"loss": 5.096,
|
|
"mean_token_accuracy": 0.2002892404794693,
|
|
"num_tokens": 12309186.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 5.6033408641815186,
|
|
"epoch": 5.310696848646249,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0002850552579868409,
|
|
"loss": 5.0645,
|
|
"mean_token_accuracy": 0.20565202087163925,
|
|
"num_tokens": 12319246.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 5.6327873229980465,
|
|
"epoch": 5.3151353750554815,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0002847111176205922,
|
|
"loss": 5.1272,
|
|
"mean_token_accuracy": 0.20285700708627702,
|
|
"num_tokens": 12330328.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 5.524570274353027,
|
|
"epoch": 5.319573901464714,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0002843669544921473,
|
|
"loss": 5.0906,
|
|
"mean_token_accuracy": 0.2001372069120407,
|
|
"num_tokens": 12339554.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 5.553857755661011,
|
|
"epoch": 5.324012427873946,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002840227694082011,
|
|
"loss": 5.1673,
|
|
"mean_token_accuracy": 0.19471082091331482,
|
|
"num_tokens": 12350925.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 5.324012427873946,
|
|
"eval_entropy": 5.546145657745506,
|
|
"eval_loss": 5.925079822540283,
|
|
"eval_mean_token_accuracy": 0.16672020655063438,
|
|
"eval_num_tokens": 12350925.0,
|
|
"eval_runtime": 2.6935,
|
|
"eval_samples_per_second": 1250.037,
|
|
"eval_steps_per_second": 156.301,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 5.662134456634521,
|
|
"epoch": 5.328450954283178,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002836785631754998,
|
|
"loss": 5.0496,
|
|
"mean_token_accuracy": 0.20719179511070251,
|
|
"num_tokens": 12361140.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 5.548701333999634,
|
|
"epoch": 5.33288948069241,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0002833343366008396,
|
|
"loss": 5.084,
|
|
"mean_token_accuracy": 0.2034963384270668,
|
|
"num_tokens": 12370794.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 5.6618561267852785,
|
|
"epoch": 5.337328007101642,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00028299009049106364,
|
|
"loss": 5.1648,
|
|
"mean_token_accuracy": 0.1947068303823471,
|
|
"num_tokens": 12382211.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 5.5460282325744625,
|
|
"epoch": 5.341766533510874,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002826458256530617,
|
|
"loss": 5.0251,
|
|
"mean_token_accuracy": 0.213189934194088,
|
|
"num_tokens": 12391749.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 5.591916704177857,
|
|
"epoch": 5.3462050599201065,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00028230154289376677,
|
|
"loss": 5.1025,
|
|
"mean_token_accuracy": 0.1996217891573906,
|
|
"num_tokens": 12401607.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 5.566343593597412,
|
|
"epoch": 5.350643586329339,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002819572430201542,
|
|
"loss": 5.1012,
|
|
"mean_token_accuracy": 0.20017844587564468,
|
|
"num_tokens": 12412025.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 5.591163396835327,
|
|
"epoch": 5.355082112738571,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002816129268392393,
|
|
"loss": 5.119,
|
|
"mean_token_accuracy": 0.20444039404392242,
|
|
"num_tokens": 12421674.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 5.638062381744385,
|
|
"epoch": 5.359520639147803,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00028126859515807575,
|
|
"loss": 5.1834,
|
|
"mean_token_accuracy": 0.19409443587064742,
|
|
"num_tokens": 12431439.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 5.653153753280639,
|
|
"epoch": 5.363959165557035,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00028092424878375347,
|
|
"loss": 5.0666,
|
|
"mean_token_accuracy": 0.2100761964917183,
|
|
"num_tokens": 12440914.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 5.571391248703003,
|
|
"epoch": 5.368397691966267,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00028057988852339677,
|
|
"loss": 5.0766,
|
|
"mean_token_accuracy": 0.20178451091051103,
|
|
"num_tokens": 12451397.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 5.618826103210449,
|
|
"epoch": 5.372836218375499,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002802355151841627,
|
|
"loss": 5.0942,
|
|
"mean_token_accuracy": 0.1956700414419174,
|
|
"num_tokens": 12461609.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 5.555040407180786,
|
|
"epoch": 5.3772747447847316,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00027989112957323874,
|
|
"loss": 5.114,
|
|
"mean_token_accuracy": 0.2043379083275795,
|
|
"num_tokens": 12471388.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 5.5462562084198,
|
|
"epoch": 5.381713271193964,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00027954673249784123,
|
|
"loss": 5.0682,
|
|
"mean_token_accuracy": 0.20022315084934234,
|
|
"num_tokens": 12480955.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 5.499785852432251,
|
|
"epoch": 5.386151797603196,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002792023247652135,
|
|
"loss": 5.0221,
|
|
"mean_token_accuracy": 0.20753575265407562,
|
|
"num_tokens": 12491056.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 5.607504510879517,
|
|
"epoch": 5.390590324012428,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00027885790718262354,
|
|
"loss": 5.0996,
|
|
"mean_token_accuracy": 0.19739820659160615,
|
|
"num_tokens": 12501634.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 5.575655174255371,
|
|
"epoch": 5.39502885042166,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002785134805573628,
|
|
"loss": 5.1236,
|
|
"mean_token_accuracy": 0.20160026252269744,
|
|
"num_tokens": 12512496.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 5.587437438964844,
|
|
"epoch": 5.399467376830892,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00027816904569674363,
|
|
"loss": 5.0713,
|
|
"mean_token_accuracy": 0.20747292339801787,
|
|
"num_tokens": 12522494.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 5.7026749610900875,
|
|
"epoch": 5.403905903240124,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00027782460340809793,
|
|
"loss": 5.1806,
|
|
"mean_token_accuracy": 0.19498033374547957,
|
|
"num_tokens": 12533969.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 5.569170951843262,
|
|
"epoch": 5.408344429649357,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00027748015449877486,
|
|
"loss": 5.0142,
|
|
"mean_token_accuracy": 0.2154815077781677,
|
|
"num_tokens": 12543484.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 5.5392396450042725,
|
|
"epoch": 5.412782956058589,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00027713569977613913,
|
|
"loss": 5.0738,
|
|
"mean_token_accuracy": 0.20868272483348846,
|
|
"num_tokens": 12552954.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 5.641184234619141,
|
|
"epoch": 5.417221482467821,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002767912400475689,
|
|
"loss": 5.1017,
|
|
"mean_token_accuracy": 0.19845348000526428,
|
|
"num_tokens": 12563269.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 5.584108161926269,
|
|
"epoch": 5.421660008877053,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00027644677612045454,
|
|
"loss": 5.0805,
|
|
"mean_token_accuracy": 0.208245387673378,
|
|
"num_tokens": 12573327.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 5.581417274475098,
|
|
"epoch": 5.426098535286285,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00027610230880219575,
|
|
"loss": 5.0816,
|
|
"mean_token_accuracy": 0.20271376818418502,
|
|
"num_tokens": 12583297.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 5.552739763259888,
|
|
"epoch": 5.430537061695517,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00027575783890020045,
|
|
"loss": 5.0949,
|
|
"mean_token_accuracy": 0.20238072723150252,
|
|
"num_tokens": 12593656.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 5.523594236373901,
|
|
"epoch": 5.4349755881047495,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00027541336722188253,
|
|
"loss": 5.0287,
|
|
"mean_token_accuracy": 0.20966356843709946,
|
|
"num_tokens": 12603242.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 5.580938482284546,
|
|
"epoch": 5.439414114513982,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002750688945746601,
|
|
"loss": 5.1222,
|
|
"mean_token_accuracy": 0.19789490401744841,
|
|
"num_tokens": 12614510.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 5.644650602340699,
|
|
"epoch": 5.443852640923214,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002747244217659535,
|
|
"loss": 5.0496,
|
|
"mean_token_accuracy": 0.20694887787103652,
|
|
"num_tokens": 12624525.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 5.51423282623291,
|
|
"epoch": 5.448291167332446,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002743799496031834,
|
|
"loss": 4.9961,
|
|
"mean_token_accuracy": 0.21388078331947327,
|
|
"num_tokens": 12634856.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 5.532556390762329,
|
|
"epoch": 5.452729693741678,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002740354788937691,
|
|
"loss": 5.0825,
|
|
"mean_token_accuracy": 0.20512001365423202,
|
|
"num_tokens": 12644595.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 5.605690145492554,
|
|
"epoch": 5.45716822015091,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002736910104451263,
|
|
"loss": 5.1696,
|
|
"mean_token_accuracy": 0.1970501348376274,
|
|
"num_tokens": 12656588.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 5.585254907608032,
|
|
"epoch": 5.461606746560142,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00027334654506466576,
|
|
"loss": 5.0683,
|
|
"mean_token_accuracy": 0.21022608876228333,
|
|
"num_tokens": 12667540.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 5.5905224800109865,
|
|
"epoch": 5.4660452729693745,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00027300208355979054,
|
|
"loss": 5.081,
|
|
"mean_token_accuracy": 0.21323304921388625,
|
|
"num_tokens": 12678252.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 5.567399549484253,
|
|
"epoch": 5.470483799378607,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00027265762673789497,
|
|
"loss": 5.0328,
|
|
"mean_token_accuracy": 0.21125102043151855,
|
|
"num_tokens": 12688455.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 5.544572591781616,
|
|
"epoch": 5.474922325787839,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00027231317540636217,
|
|
"loss": 5.0715,
|
|
"mean_token_accuracy": 0.20413849055767058,
|
|
"num_tokens": 12699261.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 5.557119560241699,
|
|
"epoch": 5.479360852197071,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00027196873037256265,
|
|
"loss": 5.1211,
|
|
"mean_token_accuracy": 0.20442508459091185,
|
|
"num_tokens": 12709209.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 5.618570470809937,
|
|
"epoch": 5.483799378606303,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002716242924438521,
|
|
"loss": 5.0871,
|
|
"mean_token_accuracy": 0.2136775240302086,
|
|
"num_tokens": 12720196.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 5.6269590854644775,
|
|
"epoch": 5.488237905015535,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00027127986242756933,
|
|
"loss": 5.1723,
|
|
"mean_token_accuracy": 0.19949438720941542,
|
|
"num_tokens": 12729664.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 5.561153841018677,
|
|
"epoch": 5.492676431424767,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002709354411310349,
|
|
"loss": 5.094,
|
|
"mean_token_accuracy": 0.20299144238233566,
|
|
"num_tokens": 12739223.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 5.599923086166382,
|
|
"epoch": 5.4971149578339995,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002705910293615487,
|
|
"loss": 5.1144,
|
|
"mean_token_accuracy": 0.1993901625275612,
|
|
"num_tokens": 12748344.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 5.61824893951416,
|
|
"epoch": 5.501553484243232,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00027024662792638854,
|
|
"loss": 5.1287,
|
|
"mean_token_accuracy": 0.20007070302963256,
|
|
"num_tokens": 12758725.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 5.514189720153809,
|
|
"epoch": 5.505992010652463,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00026990223763280767,
|
|
"loss": 5.0171,
|
|
"mean_token_accuracy": 0.21372074633836746,
|
|
"num_tokens": 12768183.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 5.611531543731689,
|
|
"epoch": 5.510430537061696,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00026955785928803344,
|
|
"loss": 5.1551,
|
|
"mean_token_accuracy": 0.19791555404663086,
|
|
"num_tokens": 12778947.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 5.564114761352539,
|
|
"epoch": 5.514869063470927,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00026921349369926525,
|
|
"loss": 5.0888,
|
|
"mean_token_accuracy": 0.20085929930210114,
|
|
"num_tokens": 12789580.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 5.659040212631226,
|
|
"epoch": 5.51930758988016,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00026886914167367244,
|
|
"loss": 5.1212,
|
|
"mean_token_accuracy": 0.20163543224334718,
|
|
"num_tokens": 12800926.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 5.529235315322876,
|
|
"epoch": 5.5237461162893915,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002685248040183926,
|
|
"loss": 5.0214,
|
|
"mean_token_accuracy": 0.21549215763807297,
|
|
"num_tokens": 12811017.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 5.546945571899414,
|
|
"epoch": 5.5281846426986245,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0002681804815405297,
|
|
"loss": 5.0504,
|
|
"mean_token_accuracy": 0.21143288910388947,
|
|
"num_tokens": 12821028.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 5.560630178451538,
|
|
"epoch": 5.532623169107856,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002678361750471522,
|
|
"loss": 5.0529,
|
|
"mean_token_accuracy": 0.2028401628136635,
|
|
"num_tokens": 12830176.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 5.55534029006958,
|
|
"epoch": 5.537061695517089,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002674918853452909,
|
|
"loss": 5.0722,
|
|
"mean_token_accuracy": 0.20871641933918,
|
|
"num_tokens": 12840525.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 5.626813220977783,
|
|
"epoch": 5.54150022192632,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0002671476132419374,
|
|
"loss": 5.1409,
|
|
"mean_token_accuracy": 0.20306331068277358,
|
|
"num_tokens": 12850698.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 5.599089765548706,
|
|
"epoch": 5.545938748335552,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00026680335954404176,
|
|
"loss": 5.144,
|
|
"mean_token_accuracy": 0.20015592277050018,
|
|
"num_tokens": 12860613.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 5.536163234710694,
|
|
"epoch": 5.550377274744784,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0002664591250585114,
|
|
"loss": 5.0393,
|
|
"mean_token_accuracy": 0.20839242786169052,
|
|
"num_tokens": 12871651.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 5.610751438140869,
|
|
"epoch": 5.5548158011540165,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002661149105922083,
|
|
"loss": 5.1218,
|
|
"mean_token_accuracy": 0.20223393440246581,
|
|
"num_tokens": 12881477.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 5.633294534683228,
|
|
"epoch": 5.559254327563249,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002657707169519477,
|
|
"loss": 5.0636,
|
|
"mean_token_accuracy": 0.20507729798555374,
|
|
"num_tokens": 12891217.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 5.536508226394654,
|
|
"epoch": 5.563692853972481,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00026542654494449597,
|
|
"loss": 5.1129,
|
|
"mean_token_accuracy": 0.2077334776520729,
|
|
"num_tokens": 12901940.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 5.574195098876953,
|
|
"epoch": 5.568131380381713,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002650823953765688,
|
|
"loss": 5.0735,
|
|
"mean_token_accuracy": 0.20476429611444474,
|
|
"num_tokens": 12911974.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 5.641457462310791,
|
|
"epoch": 5.572569906790945,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00026473826905482924,
|
|
"loss": 5.1327,
|
|
"mean_token_accuracy": 0.19755058288574218,
|
|
"num_tokens": 12921865.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 5.598918676376343,
|
|
"epoch": 5.577008433200177,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00026439416678588593,
|
|
"loss": 5.0806,
|
|
"mean_token_accuracy": 0.20567530542612075,
|
|
"num_tokens": 12932370.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 5.597425556182861,
|
|
"epoch": 5.581446959609409,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002640500893762908,
|
|
"loss": 5.0451,
|
|
"mean_token_accuracy": 0.209423665702343,
|
|
"num_tokens": 12943101.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 5.568455410003662,
|
|
"epoch": 5.5858854860186415,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00026370603763253814,
|
|
"loss": 5.0633,
|
|
"mean_token_accuracy": 0.21115909665822982,
|
|
"num_tokens": 12952419.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 5.523344945907593,
|
|
"epoch": 5.590324012427874,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002633620123610616,
|
|
"loss": 5.0175,
|
|
"mean_token_accuracy": 0.21355213671922685,
|
|
"num_tokens": 12962797.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 5.500270414352417,
|
|
"epoch": 5.594762538837106,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00026301801436823285,
|
|
"loss": 5.1217,
|
|
"mean_token_accuracy": 0.20372316390275955,
|
|
"num_tokens": 12973266.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 5.609734296798706,
|
|
"epoch": 5.599201065246338,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0002626740444603598,
|
|
"loss": 5.158,
|
|
"mean_token_accuracy": 0.19786878526210785,
|
|
"num_tokens": 12983155.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 5.702747917175293,
|
|
"epoch": 5.60363959165557,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00026233010344368425,
|
|
"loss": 5.1969,
|
|
"mean_token_accuracy": 0.19020256400108337,
|
|
"num_tokens": 12994159.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 5.651484584808349,
|
|
"epoch": 5.608078118064802,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0002619861921243806,
|
|
"loss": 5.1413,
|
|
"mean_token_accuracy": 0.20623185336589814,
|
|
"num_tokens": 13005322.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 5.5671463966369625,
|
|
"epoch": 5.612516644474034,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002616423113085535,
|
|
"loss": 5.0896,
|
|
"mean_token_accuracy": 0.2094891607761383,
|
|
"num_tokens": 13016193.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 5.557018184661866,
|
|
"epoch": 5.616955170883267,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00026129846180223586,
|
|
"loss": 5.0625,
|
|
"mean_token_accuracy": 0.20653146803379058,
|
|
"num_tokens": 13026270.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 5.559992170333862,
|
|
"epoch": 5.621393697292499,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002609546444113876,
|
|
"loss": 5.0531,
|
|
"mean_token_accuracy": 0.20299082100391388,
|
|
"num_tokens": 13035958.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 5.570192480087281,
|
|
"epoch": 5.625832223701731,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002606108599418933,
|
|
"loss": 5.0952,
|
|
"mean_token_accuracy": 0.2037765219807625,
|
|
"num_tokens": 13045938.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 5.589366436004639,
|
|
"epoch": 5.630270750110963,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00026026710919956,
|
|
"loss": 5.1079,
|
|
"mean_token_accuracy": 0.20677500218153,
|
|
"num_tokens": 13055876.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 5.620864963531494,
|
|
"epoch": 5.634709276520195,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00025992339299011616,
|
|
"loss": 5.1793,
|
|
"mean_token_accuracy": 0.19748032689094544,
|
|
"num_tokens": 13066121.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 5.576847934722901,
|
|
"epoch": 5.639147802929427,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00025957971211920894,
|
|
"loss": 5.1185,
|
|
"mean_token_accuracy": 0.20461114048957824,
|
|
"num_tokens": 13075927.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 5.608967685699463,
|
|
"epoch": 5.6435863293386594,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00025923606739240306,
|
|
"loss": 5.1309,
|
|
"mean_token_accuracy": 0.2012041077017784,
|
|
"num_tokens": 13086469.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 5.554079198837281,
|
|
"epoch": 5.648024855747892,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000258892459615178,
|
|
"loss": 5.0471,
|
|
"mean_token_accuracy": 0.21921688169240952,
|
|
"num_tokens": 13096781.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 5.593461990356445,
|
|
"epoch": 5.652463382157124,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000258548889592927,
|
|
"loss": 5.0659,
|
|
"mean_token_accuracy": 0.20000619143247605,
|
|
"num_tokens": 13107279.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 5.510042524337768,
|
|
"epoch": 5.656901908566356,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00025820535813095475,
|
|
"loss": 5.0243,
|
|
"mean_token_accuracy": 0.21235457807779312,
|
|
"num_tokens": 13116154.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 5.541016626358032,
|
|
"epoch": 5.661340434975588,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002578618660344756,
|
|
"loss": 5.0481,
|
|
"mean_token_accuracy": 0.2115420863032341,
|
|
"num_tokens": 13125720.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 5.670938491821289,
|
|
"epoch": 5.66577896138482,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002575184141086114,
|
|
"loss": 5.1537,
|
|
"mean_token_accuracy": 0.20022787749767304,
|
|
"num_tokens": 13135313.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 5.561427640914917,
|
|
"epoch": 5.670217487794052,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0002571750031583901,
|
|
"loss": 5.1389,
|
|
"mean_token_accuracy": 0.19568807631731033,
|
|
"num_tokens": 13145852.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 5.55481276512146,
|
|
"epoch": 5.6746560142032845,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00025683163398874356,
|
|
"loss": 5.0508,
|
|
"mean_token_accuracy": 0.21583274602890015,
|
|
"num_tokens": 13155957.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 5.567706632614136,
|
|
"epoch": 5.679094540612517,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002564883074045055,
|
|
"loss": 5.0444,
|
|
"mean_token_accuracy": 0.20912159830331803,
|
|
"num_tokens": 13166914.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 5.576488924026489,
|
|
"epoch": 5.683533067021749,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00025614502421041004,
|
|
"loss": 5.0466,
|
|
"mean_token_accuracy": 0.20984987318515777,
|
|
"num_tokens": 13177071.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 5.568351316452026,
|
|
"epoch": 5.687971593430981,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002558017852110895,
|
|
"loss": 5.1336,
|
|
"mean_token_accuracy": 0.20015836358070374,
|
|
"num_tokens": 13187574.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 5.570750045776367,
|
|
"epoch": 5.692410119840213,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00025545859121107274,
|
|
"loss": 5.0511,
|
|
"mean_token_accuracy": 0.21021770387887956,
|
|
"num_tokens": 13197029.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 5.662575674057007,
|
|
"epoch": 5.696848646249445,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00025511544301478294,
|
|
"loss": 5.1974,
|
|
"mean_token_accuracy": 0.19245787411928178,
|
|
"num_tokens": 13208146.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 5.5649487495422365,
|
|
"epoch": 5.701287172658677,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002547723414265361,
|
|
"loss": 5.0931,
|
|
"mean_token_accuracy": 0.21084344387054443,
|
|
"num_tokens": 13217557.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 5.587751960754394,
|
|
"epoch": 5.7057256990679095,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002544292872505388,
|
|
"loss": 5.1087,
|
|
"mean_token_accuracy": 0.2058153361082077,
|
|
"num_tokens": 13226916.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 5.495823097229004,
|
|
"epoch": 5.710164225477142,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002540862812908868,
|
|
"loss": 5.0381,
|
|
"mean_token_accuracy": 0.2152624875307083,
|
|
"num_tokens": 13237639.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 5.599671411514282,
|
|
"epoch": 5.714602751886374,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00025374332435156244,
|
|
"loss": 5.1204,
|
|
"mean_token_accuracy": 0.20174115151166916,
|
|
"num_tokens": 13247697.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 5.543997573852539,
|
|
"epoch": 5.719041278295606,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00025340041723643337,
|
|
"loss": 5.0251,
|
|
"mean_token_accuracy": 0.21282418072223663,
|
|
"num_tokens": 13257622.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 5.582433128356934,
|
|
"epoch": 5.723479804704838,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00025305756074925047,
|
|
"loss": 5.0738,
|
|
"mean_token_accuracy": 0.20590440481901168,
|
|
"num_tokens": 13268272.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 5.590435028076172,
|
|
"epoch": 5.72791833111407,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00025271475569364586,
|
|
"loss": 5.149,
|
|
"mean_token_accuracy": 0.19441523253917695,
|
|
"num_tokens": 13279395.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 5.604456090927124,
|
|
"epoch": 5.732356857523302,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00025237200287313137,
|
|
"loss": 5.1081,
|
|
"mean_token_accuracy": 0.19952116459608077,
|
|
"num_tokens": 13289171.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 5.6032037258148195,
|
|
"epoch": 5.7367953839325345,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00025202930309109597,
|
|
"loss": 5.0955,
|
|
"mean_token_accuracy": 0.20548186749219893,
|
|
"num_tokens": 13299339.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 5.548041152954101,
|
|
"epoch": 5.741233910341767,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00025168665715080463,
|
|
"loss": 5.0836,
|
|
"mean_token_accuracy": 0.20553600937128066,
|
|
"num_tokens": 13309363.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 5.532993221282959,
|
|
"epoch": 5.745672436750999,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00025134406585539603,
|
|
"loss": 5.0704,
|
|
"mean_token_accuracy": 0.21398436576128005,
|
|
"num_tokens": 13319722.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 5.574262571334839,
|
|
"epoch": 5.750110963160231,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002510015300078808,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.20138103514909744,
|
|
"num_tokens": 13330034.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 5.561505126953125,
|
|
"epoch": 5.754549489569463,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002506590504111394,
|
|
"loss": 5.0781,
|
|
"mean_token_accuracy": 0.21250172853469848,
|
|
"num_tokens": 13340846.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 5.610709095001221,
|
|
"epoch": 5.758988015978695,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002503166278679207,
|
|
"loss": 5.0885,
|
|
"mean_token_accuracy": 0.20365740358829498,
|
|
"num_tokens": 13351785.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 5.575344657897949,
|
|
"epoch": 5.763426542387927,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002499742631808398,
|
|
"loss": 5.027,
|
|
"mean_token_accuracy": 0.20383460223674774,
|
|
"num_tokens": 13362322.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 5.505190086364746,
|
|
"epoch": 5.7678650687971595,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000249631957152376,
|
|
"loss": 5.0279,
|
|
"mean_token_accuracy": 0.2089679092168808,
|
|
"num_tokens": 13372355.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"epoch": 5.7678650687971595,
|
|
"eval_entropy": 5.395023606452126,
|
|
"eval_loss": 5.90569543838501,
|
|
"eval_mean_token_accuracy": 0.16883616795378456,
|
|
"eval_num_tokens": 13372355.0,
|
|
"eval_runtime": 2.7028,
|
|
"eval_samples_per_second": 1245.735,
|
|
"eval_steps_per_second": 155.763,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 5.486952066421509,
|
|
"epoch": 5.772303595206392,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002492897105848714,
|
|
"loss": 5.0374,
|
|
"mean_token_accuracy": 0.20795274674892425,
|
|
"num_tokens": 13381759.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 5.581659507751465,
|
|
"epoch": 5.776742121615624,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00024894752428052846,
|
|
"loss": 5.1711,
|
|
"mean_token_accuracy": 0.1940222665667534,
|
|
"num_tokens": 13393491.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 5.588375282287598,
|
|
"epoch": 5.781180648024856,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00024860539904140853,
|
|
"loss": 5.1193,
|
|
"mean_token_accuracy": 0.2004074990749359,
|
|
"num_tokens": 13403603.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 5.607946729660034,
|
|
"epoch": 5.785619174434088,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00024826333566942995,
|
|
"loss": 5.0644,
|
|
"mean_token_accuracy": 0.21309028416872025,
|
|
"num_tokens": 13413784.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 5.547456836700439,
|
|
"epoch": 5.79005770084332,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00024792133496636553,
|
|
"loss": 5.0718,
|
|
"mean_token_accuracy": 0.20509508550167083,
|
|
"num_tokens": 13422953.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 5.510232162475586,
|
|
"epoch": 5.794496227252552,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00024757939773384184,
|
|
"loss": 5.0742,
|
|
"mean_token_accuracy": 0.20572683364152908,
|
|
"num_tokens": 13433188.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 5.565609693527222,
|
|
"epoch": 5.798934753661785,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00024723752477333625,
|
|
"loss": 5.0235,
|
|
"mean_token_accuracy": 0.21056320518255234,
|
|
"num_tokens": 13443815.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 5.670208215713501,
|
|
"epoch": 5.803373280071017,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002468957168861758,
|
|
"loss": 5.1307,
|
|
"mean_token_accuracy": 0.19810602217912673,
|
|
"num_tokens": 13453927.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 5.585939931869507,
|
|
"epoch": 5.807811806480249,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002465539748735346,
|
|
"loss": 5.0682,
|
|
"mean_token_accuracy": 0.21096296310424806,
|
|
"num_tokens": 13465431.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 5.624184417724609,
|
|
"epoch": 5.812250332889481,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002462122995364327,
|
|
"loss": 5.1785,
|
|
"mean_token_accuracy": 0.18811278641223908,
|
|
"num_tokens": 13476323.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 5.624741268157959,
|
|
"epoch": 5.816688859298713,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002458706916757338,
|
|
"loss": 5.1479,
|
|
"mean_token_accuracy": 0.20121028870344163,
|
|
"num_tokens": 13486741.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 5.503808879852295,
|
|
"epoch": 5.821127385707945,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00024552915209214327,
|
|
"loss": 5.0612,
|
|
"mean_token_accuracy": 0.20564158856868744,
|
|
"num_tokens": 13497151.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 5.586016988754272,
|
|
"epoch": 5.8255659121171774,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00024518768158620654,
|
|
"loss": 5.0161,
|
|
"mean_token_accuracy": 0.2136678770184517,
|
|
"num_tokens": 13508072.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 5.60361967086792,
|
|
"epoch": 5.83000443852641,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002448462809583072,
|
|
"loss": 5.1092,
|
|
"mean_token_accuracy": 0.20014549046754837,
|
|
"num_tokens": 13518421.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 5.560875797271729,
|
|
"epoch": 5.834442964935642,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000244504951008665,
|
|
"loss": 5.1264,
|
|
"mean_token_accuracy": 0.21313424408435822,
|
|
"num_tokens": 13527920.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 5.528744125366211,
|
|
"epoch": 5.838881491344874,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00024416369253733405,
|
|
"loss": 5.0393,
|
|
"mean_token_accuracy": 0.20386240929365157,
|
|
"num_tokens": 13539288.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 5.554074335098266,
|
|
"epoch": 5.843320017754106,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00024382250634420085,
|
|
"loss": 5.0883,
|
|
"mean_token_accuracy": 0.20932643860578537,
|
|
"num_tokens": 13549178.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 5.62343053817749,
|
|
"epoch": 5.847758544163337,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0002434813932289825,
|
|
"loss": 5.0808,
|
|
"mean_token_accuracy": 0.20308277904987335,
|
|
"num_tokens": 13560442.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 5.586601591110229,
|
|
"epoch": 5.85219707057257,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00024314035399122485,
|
|
"loss": 5.065,
|
|
"mean_token_accuracy": 0.21043608486652374,
|
|
"num_tokens": 13571007.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 5.522235107421875,
|
|
"epoch": 5.856635596981802,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00024279938943030073,
|
|
"loss": 5.0848,
|
|
"mean_token_accuracy": 0.208780737221241,
|
|
"num_tokens": 13581774.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 5.59641809463501,
|
|
"epoch": 5.861074123391035,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0002424585003454075,
|
|
"loss": 5.1463,
|
|
"mean_token_accuracy": 0.19471298903226852,
|
|
"num_tokens": 13591820.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 5.576270675659179,
|
|
"epoch": 5.865512649800266,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00024211768753556602,
|
|
"loss": 5.0553,
|
|
"mean_token_accuracy": 0.20980488508939743,
|
|
"num_tokens": 13601631.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 5.616266059875488,
|
|
"epoch": 5.869951176209499,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00024177695179961823,
|
|
"loss": 5.1118,
|
|
"mean_token_accuracy": 0.20324235409498215,
|
|
"num_tokens": 13611010.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 5.523974752426147,
|
|
"epoch": 5.87438970261873,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00024143629393622541,
|
|
"loss": 5.0795,
|
|
"mean_token_accuracy": 0.2068472161889076,
|
|
"num_tokens": 13621480.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 5.592173433303833,
|
|
"epoch": 5.878828229027963,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00024109571474386631,
|
|
"loss": 5.18,
|
|
"mean_token_accuracy": 0.19840116798877716,
|
|
"num_tokens": 13631868.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 5.63975977897644,
|
|
"epoch": 5.8832667554371945,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00024075521502083525,
|
|
"loss": 5.1471,
|
|
"mean_token_accuracy": 0.20076769590377808,
|
|
"num_tokens": 13642444.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 5.602757835388184,
|
|
"epoch": 5.887705281846427,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00024041479556524044,
|
|
"loss": 5.0928,
|
|
"mean_token_accuracy": 0.20409242957830429,
|
|
"num_tokens": 13652675.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 5.561541318893433,
|
|
"epoch": 5.892143808255659,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00024007445717500175,
|
|
"loss": 5.1267,
|
|
"mean_token_accuracy": 0.2063656270503998,
|
|
"num_tokens": 13664209.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 5.529283952713013,
|
|
"epoch": 5.896582334664891,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00023973420064784908,
|
|
"loss": 5.081,
|
|
"mean_token_accuracy": 0.2037829801440239,
|
|
"num_tokens": 13675249.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 5.597996425628662,
|
|
"epoch": 5.901020861074123,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00023939402678132044,
|
|
"loss": 5.035,
|
|
"mean_token_accuracy": 0.2080688178539276,
|
|
"num_tokens": 13685827.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 5.614791297912598,
|
|
"epoch": 5.905459387483355,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00023905393637276018,
|
|
"loss": 5.1164,
|
|
"mean_token_accuracy": 0.19920257925987245,
|
|
"num_tokens": 13696391.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 5.586729669570923,
|
|
"epoch": 5.909897913892587,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002387139302193171,
|
|
"loss": 5.0999,
|
|
"mean_token_accuracy": 0.20862944722175597,
|
|
"num_tokens": 13705917.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 5.584148120880127,
|
|
"epoch": 5.9143364403018195,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00023837400911794215,
|
|
"loss": 5.0723,
|
|
"mean_token_accuracy": 0.2055222660303116,
|
|
"num_tokens": 13716499.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 5.520716762542724,
|
|
"epoch": 5.918774966711052,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002380341738653874,
|
|
"loss": 5.0979,
|
|
"mean_token_accuracy": 0.20228934586048125,
|
|
"num_tokens": 13726292.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 5.539011859893799,
|
|
"epoch": 5.923213493120284,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00023769442525820334,
|
|
"loss": 5.0227,
|
|
"mean_token_accuracy": 0.20357633084058763,
|
|
"num_tokens": 13737368.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 5.584113931655883,
|
|
"epoch": 5.927652019529516,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002373547640927375,
|
|
"loss": 5.1391,
|
|
"mean_token_accuracy": 0.1995089456439018,
|
|
"num_tokens": 13747193.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 5.5580991268157955,
|
|
"epoch": 5.932090545938748,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00023701519116513253,
|
|
"loss": 5.0749,
|
|
"mean_token_accuracy": 0.20574639588594437,
|
|
"num_tokens": 13758467.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 5.5872362613677975,
|
|
"epoch": 5.93652907234798,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00023667570727132405,
|
|
"loss": 5.1663,
|
|
"mean_token_accuracy": 0.2031402051448822,
|
|
"num_tokens": 13768122.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 5.527556371688843,
|
|
"epoch": 5.940967598757212,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00023633631320703918,
|
|
"loss": 5.0464,
|
|
"mean_token_accuracy": 0.21761444509029387,
|
|
"num_tokens": 13778010.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 5.55449366569519,
|
|
"epoch": 5.9454061251664445,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00023599700976779432,
|
|
"loss": 5.091,
|
|
"mean_token_accuracy": 0.20930832773447036,
|
|
"num_tokens": 13788564.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 5.629205846786499,
|
|
"epoch": 5.949844651575677,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00023565779774889367,
|
|
"loss": 5.1206,
|
|
"mean_token_accuracy": 0.20180112570524217,
|
|
"num_tokens": 13799111.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 5.640710783004761,
|
|
"epoch": 5.954283177984909,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00023531867794542694,
|
|
"loss": 5.1349,
|
|
"mean_token_accuracy": 0.20038243979215623,
|
|
"num_tokens": 13809609.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 5.550815439224243,
|
|
"epoch": 5.958721704394141,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00023497965115226794,
|
|
"loss": 5.1328,
|
|
"mean_token_accuracy": 0.20198143422603607,
|
|
"num_tokens": 13820497.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 5.5442609786987305,
|
|
"epoch": 5.963160230803373,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00023464071816407206,
|
|
"loss": 5.0974,
|
|
"mean_token_accuracy": 0.2144639238715172,
|
|
"num_tokens": 13830807.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 5.58894190788269,
|
|
"epoch": 5.967598757212605,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00023430187977527533,
|
|
"loss": 5.0969,
|
|
"mean_token_accuracy": 0.20274531692266465,
|
|
"num_tokens": 13839967.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 5.563863468170166,
|
|
"epoch": 5.972037283621837,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00023396313678009158,
|
|
"loss": 5.1262,
|
|
"mean_token_accuracy": 0.20454970449209214,
|
|
"num_tokens": 13850741.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 5.540625286102295,
|
|
"epoch": 5.9764758100310695,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00023362448997251128,
|
|
"loss": 5.1619,
|
|
"mean_token_accuracy": 0.1981108382344246,
|
|
"num_tokens": 13861309.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 5.643215322494507,
|
|
"epoch": 5.980914336440302,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00023328594014629945,
|
|
"loss": 5.0826,
|
|
"mean_token_accuracy": 0.20924076735973357,
|
|
"num_tokens": 13872190.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 5.52737946510315,
|
|
"epoch": 5.985352862849534,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002329474880949937,
|
|
"loss": 5.0304,
|
|
"mean_token_accuracy": 0.21228506416082382,
|
|
"num_tokens": 13882973.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 5.522306108474732,
|
|
"epoch": 5.989791389258766,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0002326091346119026,
|
|
"loss": 5.0696,
|
|
"mean_token_accuracy": 0.20860151052474976,
|
|
"num_tokens": 13894254.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 5.575989580154419,
|
|
"epoch": 5.994229915667998,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002322708804901036,
|
|
"loss": 5.1609,
|
|
"mean_token_accuracy": 0.2007613718509674,
|
|
"num_tokens": 13905553.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 5.623301839828491,
|
|
"epoch": 5.99866844207723,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00023193272652244113,
|
|
"loss": 5.0959,
|
|
"mean_token_accuracy": 0.20574696362018585,
|
|
"num_tokens": 13915488.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 5.574898348914252,
|
|
"epoch": 6.0026631158455395,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00023159467350152515,
|
|
"loss": 5.0308,
|
|
"mean_token_accuracy": 0.21161833736631605,
|
|
"num_tokens": 13924671.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 5.570318222045898,
|
|
"epoch": 6.007101642254772,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00023125672221972865,
|
|
"loss": 4.9148,
|
|
"mean_token_accuracy": 0.22097623944282532,
|
|
"num_tokens": 13934299.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 5.573090076446533,
|
|
"epoch": 6.011540168664004,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002309188734691865,
|
|
"loss": 4.9069,
|
|
"mean_token_accuracy": 0.21901576817035676,
|
|
"num_tokens": 13945614.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 5.577006053924561,
|
|
"epoch": 6.015978695073236,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00023058112804179298,
|
|
"loss": 5.0099,
|
|
"mean_token_accuracy": 0.2100958600640297,
|
|
"num_tokens": 13956859.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 5.595920896530151,
|
|
"epoch": 6.020417221482468,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002302434867292003,
|
|
"loss": 4.9683,
|
|
"mean_token_accuracy": 0.21894738227128982,
|
|
"num_tokens": 13967572.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 5.558254957199097,
|
|
"epoch": 6.0248557478917,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00022990595032281675,
|
|
"loss": 4.9206,
|
|
"mean_token_accuracy": 0.2240821823477745,
|
|
"num_tokens": 13977669.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 5.605133867263794,
|
|
"epoch": 6.029294274300932,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002295685196138045,
|
|
"loss": 4.917,
|
|
"mean_token_accuracy": 0.21340941190719603,
|
|
"num_tokens": 13987452.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 5.606102848052979,
|
|
"epoch": 6.0337328007101645,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00022923119539307806,
|
|
"loss": 4.9886,
|
|
"mean_token_accuracy": 0.20658108741044998,
|
|
"num_tokens": 13997433.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 5.59543399810791,
|
|
"epoch": 6.038171327119397,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00022889397845130254,
|
|
"loss": 5.0201,
|
|
"mean_token_accuracy": 0.21266337633132934,
|
|
"num_tokens": 14008129.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 5.562005090713501,
|
|
"epoch": 6.042609853528629,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00022855686957889116,
|
|
"loss": 4.9403,
|
|
"mean_token_accuracy": 0.22045661211013795,
|
|
"num_tokens": 14018690.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 5.547663164138794,
|
|
"epoch": 6.047048379937861,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002282198695660042,
|
|
"loss": 4.8688,
|
|
"mean_token_accuracy": 0.22229637205600739,
|
|
"num_tokens": 14029021.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 5.62746229171753,
|
|
"epoch": 6.051486906347093,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00022788297920254663,
|
|
"loss": 4.9808,
|
|
"mean_token_accuracy": 0.21179607808589934,
|
|
"num_tokens": 14038856.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 5.560137414932251,
|
|
"epoch": 6.055925432756325,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002275461992781665,
|
|
"loss": 4.8557,
|
|
"mean_token_accuracy": 0.2237355023622513,
|
|
"num_tokens": 14049781.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 5.595793104171753,
|
|
"epoch": 6.060363959165557,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00022720953058225286,
|
|
"loss": 4.953,
|
|
"mean_token_accuracy": 0.21852329671382903,
|
|
"num_tokens": 14060248.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 5.526202297210693,
|
|
"epoch": 6.0648024855747895,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00022687297390393426,
|
|
"loss": 4.8112,
|
|
"mean_token_accuracy": 0.22845348417758943,
|
|
"num_tokens": 14069461.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 5.5649689674377445,
|
|
"epoch": 6.069241011984022,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00022653653003207642,
|
|
"loss": 4.922,
|
|
"mean_token_accuracy": 0.2146340489387512,
|
|
"num_tokens": 14080019.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 5.5446208953857425,
|
|
"epoch": 6.073679538393254,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002262001997552809,
|
|
"loss": 4.9114,
|
|
"mean_token_accuracy": 0.2177823379635811,
|
|
"num_tokens": 14090453.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 5.499939012527466,
|
|
"epoch": 6.078118064802486,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00022586398386188278,
|
|
"loss": 4.9356,
|
|
"mean_token_accuracy": 0.2196785107254982,
|
|
"num_tokens": 14101865.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 5.565708923339844,
|
|
"epoch": 6.082556591211718,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00022552788313994922,
|
|
"loss": 4.8761,
|
|
"mean_token_accuracy": 0.22282514572143555,
|
|
"num_tokens": 14111649.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 5.636212491989136,
|
|
"epoch": 6.08699511762095,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00022519189837727727,
|
|
"loss": 4.9518,
|
|
"mean_token_accuracy": 0.21787493526935578,
|
|
"num_tokens": 14122203.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 5.565778303146362,
|
|
"epoch": 6.091433644030182,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00022485603036139236,
|
|
"loss": 4.97,
|
|
"mean_token_accuracy": 0.21275963336229325,
|
|
"num_tokens": 14132120.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 5.528501749038696,
|
|
"epoch": 6.0958721704394145,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002245202798795461,
|
|
"loss": 4.8767,
|
|
"mean_token_accuracy": 0.22740499526262284,
|
|
"num_tokens": 14142626.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 5.590403699874878,
|
|
"epoch": 6.100310696848647,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00022418464771871473,
|
|
"loss": 5.0033,
|
|
"mean_token_accuracy": 0.21154555380344392,
|
|
"num_tokens": 14153707.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 5.521816730499268,
|
|
"epoch": 6.104749223257878,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00022384913466559704,
|
|
"loss": 4.9088,
|
|
"mean_token_accuracy": 0.22512754797935486,
|
|
"num_tokens": 14163194.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 5.512416982650757,
|
|
"epoch": 6.10918774966711,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002235137415066128,
|
|
"loss": 4.8982,
|
|
"mean_token_accuracy": 0.22106172293424606,
|
|
"num_tokens": 14174376.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 5.576170587539673,
|
|
"epoch": 6.113626276076342,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002231784690279005,
|
|
"loss": 4.9781,
|
|
"mean_token_accuracy": 0.21190883219242096,
|
|
"num_tokens": 14186251.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 5.586230754852295,
|
|
"epoch": 6.118064802485574,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002228433180153161,
|
|
"loss": 4.9858,
|
|
"mean_token_accuracy": 0.2136741042137146,
|
|
"num_tokens": 14196816.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 5.567343139648438,
|
|
"epoch": 6.1225033288948065,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002225082892544305,
|
|
"loss": 4.9328,
|
|
"mean_token_accuracy": 0.2175935685634613,
|
|
"num_tokens": 14207942.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 5.587808227539062,
|
|
"epoch": 6.126941855304039,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002221733835305283,
|
|
"loss": 4.9094,
|
|
"mean_token_accuracy": 0.21719594895839692,
|
|
"num_tokens": 14218686.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 5.631440019607544,
|
|
"epoch": 6.131380381713271,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00022183860162860568,
|
|
"loss": 4.9468,
|
|
"mean_token_accuracy": 0.2097667023539543,
|
|
"num_tokens": 14228611.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 5.543772602081299,
|
|
"epoch": 6.135818908122503,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00022150394433336857,
|
|
"loss": 4.8756,
|
|
"mean_token_accuracy": 0.22756686359643935,
|
|
"num_tokens": 14238630.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 5.518515300750733,
|
|
"epoch": 6.140257434531735,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00022116941242923067,
|
|
"loss": 4.9336,
|
|
"mean_token_accuracy": 0.21143654733896255,
|
|
"num_tokens": 14248388.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 5.620897626876831,
|
|
"epoch": 6.144695960940967,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00022083500670031208,
|
|
"loss": 4.9677,
|
|
"mean_token_accuracy": 0.21778711080551147,
|
|
"num_tokens": 14258898.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 5.585202980041504,
|
|
"epoch": 6.149134487350199,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002205007279304368,
|
|
"loss": 4.8468,
|
|
"mean_token_accuracy": 0.2330240786075592,
|
|
"num_tokens": 14269316.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 5.560101747512817,
|
|
"epoch": 6.1535730137594316,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00022016657690313151,
|
|
"loss": 4.9169,
|
|
"mean_token_accuracy": 0.22099239081144334,
|
|
"num_tokens": 14279843.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 5.5503302097320555,
|
|
"epoch": 6.158011540168664,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00021983255440162337,
|
|
"loss": 4.8757,
|
|
"mean_token_accuracy": 0.22673001140356064,
|
|
"num_tokens": 14288827.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 5.56884241104126,
|
|
"epoch": 6.162450066577896,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00021949866120883832,
|
|
"loss": 4.9644,
|
|
"mean_token_accuracy": 0.21202533394098283,
|
|
"num_tokens": 14299273.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 5.59989857673645,
|
|
"epoch": 6.166888592987128,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002191648981073992,
|
|
"loss": 4.9163,
|
|
"mean_token_accuracy": 0.21220019161701204,
|
|
"num_tokens": 14309416.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 5.5525611400604244,
|
|
"epoch": 6.17132711939636,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00021883126587962393,
|
|
"loss": 4.968,
|
|
"mean_token_accuracy": 0.21182450652122498,
|
|
"num_tokens": 14319077.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 5.559889698028565,
|
|
"epoch": 6.175765645805592,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00021849776530752352,
|
|
"loss": 4.9841,
|
|
"mean_token_accuracy": 0.21414981186389923,
|
|
"num_tokens": 14329995.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 5.61794958114624,
|
|
"epoch": 6.180204172214824,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002181643971728008,
|
|
"loss": 4.9596,
|
|
"mean_token_accuracy": 0.20955124795436858,
|
|
"num_tokens": 14340455.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 5.584700012207032,
|
|
"epoch": 6.184642698624057,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00021783116225684756,
|
|
"loss": 4.9347,
|
|
"mean_token_accuracy": 0.2132657915353775,
|
|
"num_tokens": 14351491.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 5.578726291656494,
|
|
"epoch": 6.189081225033289,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00021749806134074395,
|
|
"loss": 5.0009,
|
|
"mean_token_accuracy": 0.2053453207015991,
|
|
"num_tokens": 14362655.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 5.541824436187744,
|
|
"epoch": 6.193519751442521,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00021716509520525564,
|
|
"loss": 4.9268,
|
|
"mean_token_accuracy": 0.21462586224079133,
|
|
"num_tokens": 14372391.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 5.5617835521698,
|
|
"epoch": 6.197958277851753,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00021683226463083238,
|
|
"loss": 4.8949,
|
|
"mean_token_accuracy": 0.2212710663676262,
|
|
"num_tokens": 14383404.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 5.507156562805176,
|
|
"epoch": 6.202396804260985,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002164995703976066,
|
|
"loss": 4.9054,
|
|
"mean_token_accuracy": 0.21920328438282013,
|
|
"num_tokens": 14393603.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 5.47821159362793,
|
|
"epoch": 6.206835330670217,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00021616701328539057,
|
|
"loss": 4.9131,
|
|
"mean_token_accuracy": 0.22882269322872162,
|
|
"num_tokens": 14403249.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 5.472233676910401,
|
|
"epoch": 6.2112738570794495,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00021583459407367557,
|
|
"loss": 4.8924,
|
|
"mean_token_accuracy": 0.22245227992534639,
|
|
"num_tokens": 14413359.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"epoch": 6.2112738570794495,
|
|
"eval_entropy": 5.415627414993322,
|
|
"eval_loss": 5.894550323486328,
|
|
"eval_mean_token_accuracy": 0.17017376936104972,
|
|
"eval_num_tokens": 14413359.0,
|
|
"eval_runtime": 2.697,
|
|
"eval_samples_per_second": 1248.442,
|
|
"eval_steps_per_second": 156.102,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 5.5439781665802,
|
|
"epoch": 6.215712383488682,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00021550231354162957,
|
|
"loss": 4.9004,
|
|
"mean_token_accuracy": 0.22160688787698746,
|
|
"num_tokens": 14423198.0,
|
|
"step": 7005
|
|
},
|
|
{
|
|
"entropy": 5.598263692855835,
|
|
"epoch": 6.220150909897914,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0002151701724680952,
|
|
"loss": 4.9546,
|
|
"mean_token_accuracy": 0.21566907912492753,
|
|
"num_tokens": 14432994.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 5.534407472610473,
|
|
"epoch": 6.224589436307146,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00021483817163158876,
|
|
"loss": 4.9085,
|
|
"mean_token_accuracy": 0.21766563951969148,
|
|
"num_tokens": 14443192.0,
|
|
"step": 7015
|
|
},
|
|
{
|
|
"entropy": 5.574075365066529,
|
|
"epoch": 6.229027962716378,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00021450631181029733,
|
|
"loss": 4.9435,
|
|
"mean_token_accuracy": 0.21509276032447816,
|
|
"num_tokens": 14454059.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 5.5993444442749025,
|
|
"epoch": 6.23346648912561,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002141745937820776,
|
|
"loss": 4.9748,
|
|
"mean_token_accuracy": 0.2133477210998535,
|
|
"num_tokens": 14463759.0,
|
|
"step": 7025
|
|
},
|
|
{
|
|
"entropy": 5.590779209136963,
|
|
"epoch": 6.237905015534842,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002138430183244542,
|
|
"loss": 4.9243,
|
|
"mean_token_accuracy": 0.21228954643011094,
|
|
"num_tokens": 14474181.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 5.515654850006103,
|
|
"epoch": 6.2423435419440745,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00021351158621461707,
|
|
"loss": 4.8771,
|
|
"mean_token_accuracy": 0.21910371780395507,
|
|
"num_tokens": 14483982.0,
|
|
"step": 7035
|
|
},
|
|
{
|
|
"entropy": 5.480132055282593,
|
|
"epoch": 6.246782068353307,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00021318029822942059,
|
|
"loss": 4.8526,
|
|
"mean_token_accuracy": 0.22817063182592393,
|
|
"num_tokens": 14494972.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 5.552070379257202,
|
|
"epoch": 6.251220594762539,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00021284915514538128,
|
|
"loss": 4.8857,
|
|
"mean_token_accuracy": 0.21987539827823638,
|
|
"num_tokens": 14505749.0,
|
|
"step": 7045
|
|
},
|
|
{
|
|
"entropy": 5.521484851837158,
|
|
"epoch": 6.255659121171771,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0002125181577386756,
|
|
"loss": 4.8593,
|
|
"mean_token_accuracy": 0.23223900347948073,
|
|
"num_tokens": 14515078.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 5.539416217803955,
|
|
"epoch": 6.260097647581003,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002121873067851391,
|
|
"loss": 4.9507,
|
|
"mean_token_accuracy": 0.21154749095439912,
|
|
"num_tokens": 14525421.0,
|
|
"step": 7055
|
|
},
|
|
{
|
|
"entropy": 5.55464448928833,
|
|
"epoch": 6.264536173990235,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00021185660306026366,
|
|
"loss": 4.9274,
|
|
"mean_token_accuracy": 0.22232799082994462,
|
|
"num_tokens": 14535352.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 5.51084532737732,
|
|
"epoch": 6.268974700399467,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00021152604733919628,
|
|
"loss": 4.9556,
|
|
"mean_token_accuracy": 0.21935131400823593,
|
|
"num_tokens": 14545196.0,
|
|
"step": 7065
|
|
},
|
|
{
|
|
"entropy": 5.59230260848999,
|
|
"epoch": 6.2734132268086995,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000211195640396737,
|
|
"loss": 4.9719,
|
|
"mean_token_accuracy": 0.21324086636304856,
|
|
"num_tokens": 14555060.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 5.556578731536865,
|
|
"epoch": 6.277851753217932,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0002108653830073371,
|
|
"loss": 4.8782,
|
|
"mean_token_accuracy": 0.22991495430469513,
|
|
"num_tokens": 14564580.0,
|
|
"step": 7075
|
|
},
|
|
{
|
|
"entropy": 5.5330891609191895,
|
|
"epoch": 6.282290279627164,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00021053527594509731,
|
|
"loss": 4.9589,
|
|
"mean_token_accuracy": 0.21836420595645906,
|
|
"num_tokens": 14575872.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 5.539455604553223,
|
|
"epoch": 6.286728806036396,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002102053199837662,
|
|
"loss": 5.022,
|
|
"mean_token_accuracy": 0.20693743228912354,
|
|
"num_tokens": 14586787.0,
|
|
"step": 7085
|
|
},
|
|
{
|
|
"entropy": 5.494345235824585,
|
|
"epoch": 6.291167332445628,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0002098755158967377,
|
|
"loss": 4.8962,
|
|
"mean_token_accuracy": 0.22479941844940185,
|
|
"num_tokens": 14597215.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 5.572389602661133,
|
|
"epoch": 6.29560585885486,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00020954586445705027,
|
|
"loss": 4.9326,
|
|
"mean_token_accuracy": 0.2146194890141487,
|
|
"num_tokens": 14608081.0,
|
|
"step": 7095
|
|
},
|
|
{
|
|
"entropy": 5.5912513256073,
|
|
"epoch": 6.300044385264092,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00020921636643738429,
|
|
"loss": 5.0152,
|
|
"mean_token_accuracy": 0.20137862265110015,
|
|
"num_tokens": 14618027.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 5.4752177715301515,
|
|
"epoch": 6.3044829116733245,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002088870226100606,
|
|
"loss": 4.8619,
|
|
"mean_token_accuracy": 0.22098766416311263,
|
|
"num_tokens": 14628828.0,
|
|
"step": 7105
|
|
},
|
|
{
|
|
"entropy": 5.553564214706421,
|
|
"epoch": 6.308921438082557,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00020855783374703861,
|
|
"loss": 4.9717,
|
|
"mean_token_accuracy": 0.20831257104873657,
|
|
"num_tokens": 14638913.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 5.497220373153686,
|
|
"epoch": 6.313359964491789,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002082288006199146,
|
|
"loss": 4.7927,
|
|
"mean_token_accuracy": 0.2333698570728302,
|
|
"num_tokens": 14648392.0,
|
|
"step": 7115
|
|
},
|
|
{
|
|
"entropy": 5.51929202079773,
|
|
"epoch": 6.317798490901021,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00020789992399991965,
|
|
"loss": 4.9533,
|
|
"mean_token_accuracy": 0.21903302073478698,
|
|
"num_tokens": 14659422.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 5.508348655700684,
|
|
"epoch": 6.322237017310253,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00020757120465791823,
|
|
"loss": 4.8942,
|
|
"mean_token_accuracy": 0.21924525648355483,
|
|
"num_tokens": 14669419.0,
|
|
"step": 7125
|
|
},
|
|
{
|
|
"entropy": 5.628988456726074,
|
|
"epoch": 6.326675543719485,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00020724264336440584,
|
|
"loss": 4.9656,
|
|
"mean_token_accuracy": 0.20997923612594604,
|
|
"num_tokens": 14678843.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 5.566967105865478,
|
|
"epoch": 6.331114070128717,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00020691424088950782,
|
|
"loss": 4.9551,
|
|
"mean_token_accuracy": 0.2179657518863678,
|
|
"num_tokens": 14688636.0,
|
|
"step": 7135
|
|
},
|
|
{
|
|
"entropy": 5.525785160064697,
|
|
"epoch": 6.3355525965379496,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00020658599800297707,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.21035348623991013,
|
|
"num_tokens": 14699781.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 5.540164136886597,
|
|
"epoch": 6.339991122947182,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002062579154741925,
|
|
"loss": 4.9754,
|
|
"mean_token_accuracy": 0.21742237359285355,
|
|
"num_tokens": 14709657.0,
|
|
"step": 7145
|
|
},
|
|
{
|
|
"entropy": 5.602196598052979,
|
|
"epoch": 6.344429649356414,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00020592999407215718,
|
|
"loss": 4.9722,
|
|
"mean_token_accuracy": 0.21528039425611495,
|
|
"num_tokens": 14719999.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 5.5818932056427,
|
|
"epoch": 6.348868175765646,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00020560223456549638,
|
|
"loss": 5.0083,
|
|
"mean_token_accuracy": 0.21144500225782395,
|
|
"num_tokens": 14730014.0,
|
|
"step": 7155
|
|
},
|
|
{
|
|
"entropy": 5.510139751434326,
|
|
"epoch": 6.353306702174878,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0002052746377224561,
|
|
"loss": 4.8984,
|
|
"mean_token_accuracy": 0.22431433349847793,
|
|
"num_tokens": 14740251.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 5.539159488677979,
|
|
"epoch": 6.35774522858411,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00020494720431090096,
|
|
"loss": 4.9593,
|
|
"mean_token_accuracy": 0.2163797825574875,
|
|
"num_tokens": 14749658.0,
|
|
"step": 7165
|
|
},
|
|
{
|
|
"entropy": 5.553530168533325,
|
|
"epoch": 6.362183754993342,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00020461993509831238,
|
|
"loss": 4.9113,
|
|
"mean_token_accuracy": 0.22412171810865403,
|
|
"num_tokens": 14759561.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 5.5949631690979,
|
|
"epoch": 6.366622281402575,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00020429283085178713,
|
|
"loss": 4.997,
|
|
"mean_token_accuracy": 0.21032286137342454,
|
|
"num_tokens": 14770313.0,
|
|
"step": 7175
|
|
},
|
|
{
|
|
"entropy": 5.512533473968506,
|
|
"epoch": 6.371060807811807,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00020396589233803513,
|
|
"loss": 4.8402,
|
|
"mean_token_accuracy": 0.22684555351734162,
|
|
"num_tokens": 14780502.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 5.566857242584229,
|
|
"epoch": 6.375499334221039,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000203639120323378,
|
|
"loss": 4.9538,
|
|
"mean_token_accuracy": 0.2116124227643013,
|
|
"num_tokens": 14790904.0,
|
|
"step": 7185
|
|
},
|
|
{
|
|
"entropy": 5.52278208732605,
|
|
"epoch": 6.379937860630271,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0002033125155737471,
|
|
"loss": 4.88,
|
|
"mean_token_accuracy": 0.23080461025238036,
|
|
"num_tokens": 14800834.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 5.570139455795288,
|
|
"epoch": 6.384376387039503,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002029860788546814,
|
|
"loss": 4.9122,
|
|
"mean_token_accuracy": 0.21681701242923737,
|
|
"num_tokens": 14810748.0,
|
|
"step": 7195
|
|
},
|
|
{
|
|
"entropy": 5.552179908752441,
|
|
"epoch": 6.388814913448735,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00020265981093132646,
|
|
"loss": 4.9086,
|
|
"mean_token_accuracy": 0.2180839627981186,
|
|
"num_tokens": 14821453.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 5.571068620681762,
|
|
"epoch": 6.3932534398579675,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00020233371256843198,
|
|
"loss": 4.9906,
|
|
"mean_token_accuracy": 0.21032893061637878,
|
|
"num_tokens": 14831651.0,
|
|
"step": 7205
|
|
},
|
|
{
|
|
"entropy": 5.582639169692993,
|
|
"epoch": 6.3976919662672,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00020200778453035017,
|
|
"loss": 4.9279,
|
|
"mean_token_accuracy": 0.2177841067314148,
|
|
"num_tokens": 14841856.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 5.6155554294586185,
|
|
"epoch": 6.402130492676432,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00020168202758103415,
|
|
"loss": 4.9881,
|
|
"mean_token_accuracy": 0.20622386634349824,
|
|
"num_tokens": 14851981.0,
|
|
"step": 7215
|
|
},
|
|
{
|
|
"entropy": 5.620007038116455,
|
|
"epoch": 6.406569019085664,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00020135644248403585,
|
|
"loss": 4.9927,
|
|
"mean_token_accuracy": 0.2059517666697502,
|
|
"num_tokens": 14862928.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 5.565825510025024,
|
|
"epoch": 6.411007545494896,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00020103103000250456,
|
|
"loss": 4.9571,
|
|
"mean_token_accuracy": 0.2124220073223114,
|
|
"num_tokens": 14873704.0,
|
|
"step": 7225
|
|
},
|
|
{
|
|
"entropy": 5.5490161895751955,
|
|
"epoch": 6.415446071904128,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000200705790899185,
|
|
"loss": 4.9306,
|
|
"mean_token_accuracy": 0.21215646117925643,
|
|
"num_tokens": 14883483.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 5.51604208946228,
|
|
"epoch": 6.41988459831336,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0002003807259364152,
|
|
"loss": 4.8848,
|
|
"mean_token_accuracy": 0.21850584596395492,
|
|
"num_tokens": 14893469.0,
|
|
"step": 7235
|
|
},
|
|
{
|
|
"entropy": 5.570466136932373,
|
|
"epoch": 6.4243231247225925,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00020005583587612535,
|
|
"loss": 4.9813,
|
|
"mean_token_accuracy": 0.22117258757352828,
|
|
"num_tokens": 14903323.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 5.58856954574585,
|
|
"epoch": 6.428761651131825,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00019973112147983563,
|
|
"loss": 4.944,
|
|
"mean_token_accuracy": 0.21649894416332244,
|
|
"num_tokens": 14914516.0,
|
|
"step": 7245
|
|
},
|
|
{
|
|
"entropy": 5.554163026809692,
|
|
"epoch": 6.433200177541057,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00019940658350865422,
|
|
"loss": 4.9261,
|
|
"mean_token_accuracy": 0.22312809228897096,
|
|
"num_tokens": 14924799.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 5.5466584205627445,
|
|
"epoch": 6.437638703950288,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00019908222272327608,
|
|
"loss": 4.934,
|
|
"mean_token_accuracy": 0.21238065659999847,
|
|
"num_tokens": 14934725.0,
|
|
"step": 7255
|
|
},
|
|
{
|
|
"entropy": 5.519527578353882,
|
|
"epoch": 6.442077230359521,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001987580398839806,
|
|
"loss": 4.9117,
|
|
"mean_token_accuracy": 0.21712051331996918,
|
|
"num_tokens": 14944954.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 5.606967544555664,
|
|
"epoch": 6.446515756768752,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00019843403575063028,
|
|
"loss": 4.989,
|
|
"mean_token_accuracy": 0.20784797966480256,
|
|
"num_tokens": 14956614.0,
|
|
"step": 7265
|
|
},
|
|
{
|
|
"entropy": 5.537259244918824,
|
|
"epoch": 6.450954283177985,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001981102110826688,
|
|
"loss": 4.9348,
|
|
"mean_token_accuracy": 0.21783325970172882,
|
|
"num_tokens": 14967766.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 5.502602243423462,
|
|
"epoch": 6.455392809587217,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00019778656663911883,
|
|
"loss": 4.873,
|
|
"mean_token_accuracy": 0.2198093429207802,
|
|
"num_tokens": 14977754.0,
|
|
"step": 7275
|
|
},
|
|
{
|
|
"entropy": 5.539269208908081,
|
|
"epoch": 6.459831335996449,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0001974631031785809,
|
|
"loss": 5.018,
|
|
"mean_token_accuracy": 0.20795969516038895,
|
|
"num_tokens": 14988239.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 5.540018606185913,
|
|
"epoch": 6.464269862405681,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00019713982145923149,
|
|
"loss": 4.965,
|
|
"mean_token_accuracy": 0.22250630259513854,
|
|
"num_tokens": 14998037.0,
|
|
"step": 7285
|
|
},
|
|
{
|
|
"entropy": 5.575396919250489,
|
|
"epoch": 6.468708388814913,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00019681672223882047,
|
|
"loss": 4.8789,
|
|
"mean_token_accuracy": 0.21838145703077316,
|
|
"num_tokens": 15008076.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 5.575087308883667,
|
|
"epoch": 6.473146915224145,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00019649380627467062,
|
|
"loss": 4.9572,
|
|
"mean_token_accuracy": 0.21463317126035691,
|
|
"num_tokens": 15018484.0,
|
|
"step": 7295
|
|
},
|
|
{
|
|
"entropy": 5.5347404956817625,
|
|
"epoch": 6.477585441633377,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00019617107432367477,
|
|
"loss": 5.0057,
|
|
"mean_token_accuracy": 0.2054355576634407,
|
|
"num_tokens": 15028377.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 5.521458387374878,
|
|
"epoch": 6.4820239680426095,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019584852714229456,
|
|
"loss": 4.9849,
|
|
"mean_token_accuracy": 0.21593954861164094,
|
|
"num_tokens": 15039739.0,
|
|
"step": 7305
|
|
},
|
|
{
|
|
"entropy": 5.577728700637818,
|
|
"epoch": 6.486462494451842,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00019552616548655866,
|
|
"loss": 4.9734,
|
|
"mean_token_accuracy": 0.21477217227220535,
|
|
"num_tokens": 15051008.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 5.590926170349121,
|
|
"epoch": 6.490901020861074,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00019520399011206064,
|
|
"loss": 4.9301,
|
|
"mean_token_accuracy": 0.21706142723560334,
|
|
"num_tokens": 15062389.0,
|
|
"step": 7315
|
|
},
|
|
{
|
|
"entropy": 5.5129210472106935,
|
|
"epoch": 6.495339547270306,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001948820017739576,
|
|
"loss": 4.937,
|
|
"mean_token_accuracy": 0.21531863063573836,
|
|
"num_tokens": 15072152.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 5.569131374359131,
|
|
"epoch": 6.499778073679538,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00019456020122696834,
|
|
"loss": 4.9409,
|
|
"mean_token_accuracy": 0.21280237287282944,
|
|
"num_tokens": 15082441.0,
|
|
"step": 7325
|
|
},
|
|
{
|
|
"entropy": 5.606104135513306,
|
|
"epoch": 6.50421660008877,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00019423858922537108,
|
|
"loss": 4.9619,
|
|
"mean_token_accuracy": 0.2136653557419777,
|
|
"num_tokens": 15093815.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 5.489365291595459,
|
|
"epoch": 6.508655126498002,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00019391716652300263,
|
|
"loss": 4.8621,
|
|
"mean_token_accuracy": 0.22243182808160783,
|
|
"num_tokens": 15103852.0,
|
|
"step": 7335
|
|
},
|
|
{
|
|
"entropy": 5.494791889190674,
|
|
"epoch": 6.5130936529072345,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00019359593387325568,
|
|
"loss": 4.8751,
|
|
"mean_token_accuracy": 0.22394601702690126,
|
|
"num_tokens": 15113240.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 5.440359354019165,
|
|
"epoch": 6.517532179316467,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00019327489202907773,
|
|
"loss": 4.8125,
|
|
"mean_token_accuracy": 0.23842044323682784,
|
|
"num_tokens": 15122670.0,
|
|
"step": 7345
|
|
},
|
|
{
|
|
"entropy": 5.555277252197266,
|
|
"epoch": 6.521970705725699,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00019295404174296887,
|
|
"loss": 4.9713,
|
|
"mean_token_accuracy": 0.2124989315867424,
|
|
"num_tokens": 15133656.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 5.547752857208252,
|
|
"epoch": 6.526409232134931,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0001926333837669802,
|
|
"loss": 4.9106,
|
|
"mean_token_accuracy": 0.2165180802345276,
|
|
"num_tokens": 15144197.0,
|
|
"step": 7355
|
|
},
|
|
{
|
|
"entropy": 5.521604919433594,
|
|
"epoch": 6.530847758544163,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00019231291885271214,
|
|
"loss": 4.9025,
|
|
"mean_token_accuracy": 0.21249637752771378,
|
|
"num_tokens": 15154186.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 5.512654066085815,
|
|
"epoch": 6.535286284953395,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001919926477513127,
|
|
"loss": 4.9267,
|
|
"mean_token_accuracy": 0.21667930781841277,
|
|
"num_tokens": 15165000.0,
|
|
"step": 7365
|
|
},
|
|
{
|
|
"entropy": 5.571691656112671,
|
|
"epoch": 6.539724811362627,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001916725712134752,
|
|
"loss": 4.8703,
|
|
"mean_token_accuracy": 0.22219718098640442,
|
|
"num_tokens": 15173717.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 5.530984878540039,
|
|
"epoch": 6.5441633377718595,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00019135268998943738,
|
|
"loss": 4.9476,
|
|
"mean_token_accuracy": 0.21453277319669722,
|
|
"num_tokens": 15184347.0,
|
|
"step": 7375
|
|
},
|
|
{
|
|
"entropy": 5.583292293548584,
|
|
"epoch": 6.548601864181092,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00019103300482897884,
|
|
"loss": 5.0056,
|
|
"mean_token_accuracy": 0.20867671221494674,
|
|
"num_tokens": 15194211.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 5.5603893280029295,
|
|
"epoch": 6.553040390590324,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00019071351648141977,
|
|
"loss": 4.9244,
|
|
"mean_token_accuracy": 0.215047487616539,
|
|
"num_tokens": 15204205.0,
|
|
"step": 7385
|
|
},
|
|
{
|
|
"entropy": 5.543908643722534,
|
|
"epoch": 6.557478916999556,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001903942256956192,
|
|
"loss": 4.9546,
|
|
"mean_token_accuracy": 0.21952016949653624,
|
|
"num_tokens": 15213639.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 5.443136262893677,
|
|
"epoch": 6.561917443408788,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019007513321997265,
|
|
"loss": 4.8108,
|
|
"mean_token_accuracy": 0.22921429425477982,
|
|
"num_tokens": 15224116.0,
|
|
"step": 7395
|
|
},
|
|
{
|
|
"entropy": 5.5761871337890625,
|
|
"epoch": 6.56635596981802,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00018975623980241124,
|
|
"loss": 5.0467,
|
|
"mean_token_accuracy": 0.19705019742250443,
|
|
"num_tokens": 15234698.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 5.528809499740601,
|
|
"epoch": 6.570794496227252,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00018943754619039942,
|
|
"loss": 4.9477,
|
|
"mean_token_accuracy": 0.22121944576501845,
|
|
"num_tokens": 15246712.0,
|
|
"step": 7405
|
|
},
|
|
{
|
|
"entropy": 5.552549219131469,
|
|
"epoch": 6.575233022636485,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00018911905313093307,
|
|
"loss": 4.9194,
|
|
"mean_token_accuracy": 0.22004495412111283,
|
|
"num_tokens": 15256212.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 5.474944829940796,
|
|
"epoch": 6.579671549045717,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00018880076137053827,
|
|
"loss": 4.9697,
|
|
"mean_token_accuracy": 0.21426863223314285,
|
|
"num_tokens": 15266387.0,
|
|
"step": 7415
|
|
},
|
|
{
|
|
"entropy": 5.512602376937866,
|
|
"epoch": 6.584110075454949,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00018848267165526912,
|
|
"loss": 4.9557,
|
|
"mean_token_accuracy": 0.2115221843123436,
|
|
"num_tokens": 15276758.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 5.584454536437988,
|
|
"epoch": 6.588548601864181,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00018816478473070608,
|
|
"loss": 5.0191,
|
|
"mean_token_accuracy": 0.20571426451206207,
|
|
"num_tokens": 15287761.0,
|
|
"step": 7425
|
|
},
|
|
{
|
|
"entropy": 5.523955917358398,
|
|
"epoch": 6.592987128273413,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00018784710134195465,
|
|
"loss": 4.8963,
|
|
"mean_token_accuracy": 0.21990615129470825,
|
|
"num_tokens": 15297977.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 5.6014564037323,
|
|
"epoch": 6.597425654682645,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00018752962223364268,
|
|
"loss": 5.0225,
|
|
"mean_token_accuracy": 0.2103557303547859,
|
|
"num_tokens": 15307775.0,
|
|
"step": 7435
|
|
},
|
|
{
|
|
"entropy": 5.567426967620849,
|
|
"epoch": 6.6018641810918774,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00018721234814991967,
|
|
"loss": 4.9965,
|
|
"mean_token_accuracy": 0.20939726531505584,
|
|
"num_tokens": 15318207.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 5.518761920928955,
|
|
"epoch": 6.60630270750111,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00018689527983445448,
|
|
"loss": 4.8966,
|
|
"mean_token_accuracy": 0.2349304050207138,
|
|
"num_tokens": 15327679.0,
|
|
"step": 7445
|
|
},
|
|
{
|
|
"entropy": 5.533396291732788,
|
|
"epoch": 6.610741233910342,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00018657841803043342,
|
|
"loss": 4.8862,
|
|
"mean_token_accuracy": 0.21814586371183395,
|
|
"num_tokens": 15338116.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 5.5464195728302,
|
|
"epoch": 6.615179760319574,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0001862617634805589,
|
|
"loss": 4.9738,
|
|
"mean_token_accuracy": 0.20787449330091476,
|
|
"num_tokens": 15348616.0,
|
|
"step": 7455
|
|
},
|
|
{
|
|
"entropy": 5.451552391052246,
|
|
"epoch": 6.619618286728806,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00018594531692704764,
|
|
"loss": 4.7663,
|
|
"mean_token_accuracy": 0.2325999692082405,
|
|
"num_tokens": 15358756.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 5.480347204208374,
|
|
"epoch": 6.624056813138038,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0001856290791116287,
|
|
"loss": 4.8428,
|
|
"mean_token_accuracy": 0.23378848433494567,
|
|
"num_tokens": 15368613.0,
|
|
"step": 7465
|
|
},
|
|
{
|
|
"entropy": 5.572533750534058,
|
|
"epoch": 6.62849533954727,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00018531305077554194,
|
|
"loss": 4.9706,
|
|
"mean_token_accuracy": 0.21170900613069535,
|
|
"num_tokens": 15379404.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 5.5782238960266115,
|
|
"epoch": 6.6329338659565025,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00018499723265953617,
|
|
"loss": 4.916,
|
|
"mean_token_accuracy": 0.21391223669052123,
|
|
"num_tokens": 15389834.0,
|
|
"step": 7475
|
|
},
|
|
{
|
|
"entropy": 5.539776039123535,
|
|
"epoch": 6.637372392365735,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00018468162550386741,
|
|
"loss": 4.9276,
|
|
"mean_token_accuracy": 0.21960266083478927,
|
|
"num_tokens": 15399638.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 5.537761163711548,
|
|
"epoch": 6.641810918774967,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00018436623004829746,
|
|
"loss": 4.967,
|
|
"mean_token_accuracy": 0.2131970763206482,
|
|
"num_tokens": 15410332.0,
|
|
"step": 7485
|
|
},
|
|
{
|
|
"entropy": 5.54385027885437,
|
|
"epoch": 6.646249445184199,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00018405104703209145,
|
|
"loss": 4.9299,
|
|
"mean_token_accuracy": 0.21461192518472672,
|
|
"num_tokens": 15420786.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 5.583719491958618,
|
|
"epoch": 6.650687971593431,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001837360771940171,
|
|
"loss": 5.0111,
|
|
"mean_token_accuracy": 0.21125808209180832,
|
|
"num_tokens": 15431117.0,
|
|
"step": 7495
|
|
},
|
|
{
|
|
"entropy": 5.562678384780884,
|
|
"epoch": 6.655126498002663,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001834213212723419,
|
|
"loss": 4.9551,
|
|
"mean_token_accuracy": 0.21025206744670868,
|
|
"num_tokens": 15441011.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"epoch": 6.655126498002663,
|
|
"eval_entropy": 5.433451703495198,
|
|
"eval_loss": 5.872466087341309,
|
|
"eval_mean_token_accuracy": 0.17129931521033448,
|
|
"eval_num_tokens": 15441011.0,
|
|
"eval_runtime": 2.6906,
|
|
"eval_samples_per_second": 1251.379,
|
|
"eval_steps_per_second": 156.469,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 5.565105867385864,
|
|
"epoch": 6.659565024411895,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001831067800048325,
|
|
"loss": 4.9893,
|
|
"mean_token_accuracy": 0.21508434265851975,
|
|
"num_tokens": 15452241.0,
|
|
"step": 7505
|
|
},
|
|
{
|
|
"entropy": 5.5772076606750485,
|
|
"epoch": 6.6640035508211275,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000182792454128752,
|
|
"loss": 4.9832,
|
|
"mean_token_accuracy": 0.20836001187562941,
|
|
"num_tokens": 15462245.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 5.453781414031982,
|
|
"epoch": 6.66844207723036,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00018247834438085876,
|
|
"loss": 4.8834,
|
|
"mean_token_accuracy": 0.2298267349600792,
|
|
"num_tokens": 15473154.0,
|
|
"step": 7515
|
|
},
|
|
{
|
|
"entropy": 5.564900684356689,
|
|
"epoch": 6.672880603639592,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00018216445149740463,
|
|
"loss": 4.9673,
|
|
"mean_token_accuracy": 0.2112121433019638,
|
|
"num_tokens": 15484348.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 5.496655035018921,
|
|
"epoch": 6.677319130048824,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00018185077621413315,
|
|
"loss": 4.8569,
|
|
"mean_token_accuracy": 0.2250566825270653,
|
|
"num_tokens": 15494242.0,
|
|
"step": 7525
|
|
},
|
|
{
|
|
"entropy": 5.597740602493286,
|
|
"epoch": 6.681757656458056,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001815373192662776,
|
|
"loss": 5.0132,
|
|
"mean_token_accuracy": 0.2117848128080368,
|
|
"num_tokens": 15505054.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 5.629758358001709,
|
|
"epoch": 6.686196182867288,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00018122408138855972,
|
|
"loss": 5.094,
|
|
"mean_token_accuracy": 0.20787640511989594,
|
|
"num_tokens": 15517053.0,
|
|
"step": 7535
|
|
},
|
|
{
|
|
"entropy": 5.578078699111939,
|
|
"epoch": 6.69063470927652,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00018091106331518764,
|
|
"loss": 4.9678,
|
|
"mean_token_accuracy": 0.2137841433286667,
|
|
"num_tokens": 15526698.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 5.5597199440002445,
|
|
"epoch": 6.6950732356857525,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0001805982657798544,
|
|
"loss": 4.9396,
|
|
"mean_token_accuracy": 0.22155947983264923,
|
|
"num_tokens": 15537550.0,
|
|
"step": 7545
|
|
},
|
|
{
|
|
"entropy": 5.5322150707244875,
|
|
"epoch": 6.699511762094985,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00018028568951573604,
|
|
"loss": 4.9237,
|
|
"mean_token_accuracy": 0.22312415093183519,
|
|
"num_tokens": 15548059.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 5.531038808822632,
|
|
"epoch": 6.703950288504217,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00017997333525548987,
|
|
"loss": 4.8844,
|
|
"mean_token_accuracy": 0.22331589609384536,
|
|
"num_tokens": 15557643.0,
|
|
"step": 7555
|
|
},
|
|
{
|
|
"entropy": 5.5061217784881595,
|
|
"epoch": 6.708388814913449,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00017966120373125315,
|
|
"loss": 4.9971,
|
|
"mean_token_accuracy": 0.21540144979953765,
|
|
"num_tokens": 15567311.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 5.577610778808594,
|
|
"epoch": 6.712827341322681,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001793492956746408,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.21024437844753266,
|
|
"num_tokens": 15578568.0,
|
|
"step": 7565
|
|
},
|
|
{
|
|
"entropy": 5.58430027961731,
|
|
"epoch": 6.717265867731913,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00017903761181674373,
|
|
"loss": 5.0033,
|
|
"mean_token_accuracy": 0.2131154552102089,
|
|
"num_tokens": 15588261.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 5.5942832946777346,
|
|
"epoch": 6.721704394141145,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00017872615288812787,
|
|
"loss": 4.972,
|
|
"mean_token_accuracy": 0.21587662845849992,
|
|
"num_tokens": 15598277.0,
|
|
"step": 7575
|
|
},
|
|
{
|
|
"entropy": 5.576036357879639,
|
|
"epoch": 6.7261429205503775,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00017841491961883155,
|
|
"loss": 5.0137,
|
|
"mean_token_accuracy": 0.21150822788476945,
|
|
"num_tokens": 15608378.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 5.440856790542602,
|
|
"epoch": 6.73058144695961,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00017810391273836423,
|
|
"loss": 4.8656,
|
|
"mean_token_accuracy": 0.22235908806324006,
|
|
"num_tokens": 15618718.0,
|
|
"step": 7585
|
|
},
|
|
{
|
|
"entropy": 5.538923454284668,
|
|
"epoch": 6.735019973368842,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00017779313297570503,
|
|
"loss": 4.9984,
|
|
"mean_token_accuracy": 0.21473804116249084,
|
|
"num_tokens": 15628814.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 5.546994590759278,
|
|
"epoch": 6.739458499778074,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001774825810593002,
|
|
"loss": 4.9366,
|
|
"mean_token_accuracy": 0.22057251185178756,
|
|
"num_tokens": 15638845.0,
|
|
"step": 7595
|
|
},
|
|
{
|
|
"entropy": 5.51106276512146,
|
|
"epoch": 6.743897026187306,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00017717225771706247,
|
|
"loss": 4.8866,
|
|
"mean_token_accuracy": 0.22599420696496964,
|
|
"num_tokens": 15649869.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 5.567038726806641,
|
|
"epoch": 6.748335552596538,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00017686216367636843,
|
|
"loss": 4.9987,
|
|
"mean_token_accuracy": 0.21562597751617432,
|
|
"num_tokens": 15661114.0,
|
|
"step": 7605
|
|
},
|
|
{
|
|
"entropy": 5.534251260757446,
|
|
"epoch": 6.75277407900577,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00017655229966405723,
|
|
"loss": 4.9744,
|
|
"mean_token_accuracy": 0.21633935421705247,
|
|
"num_tokens": 15671753.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 5.568616580963135,
|
|
"epoch": 6.757212605415003,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00017624266640642905,
|
|
"loss": 4.9541,
|
|
"mean_token_accuracy": 0.21877749264240265,
|
|
"num_tokens": 15681275.0,
|
|
"step": 7615
|
|
},
|
|
{
|
|
"entropy": 5.569207382202149,
|
|
"epoch": 6.761651131824235,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00017593326462924308,
|
|
"loss": 5.0089,
|
|
"mean_token_accuracy": 0.2117543026804924,
|
|
"num_tokens": 15691818.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 5.54941840171814,
|
|
"epoch": 6.766089658233467,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00017562409505771586,
|
|
"loss": 4.9161,
|
|
"mean_token_accuracy": 0.22721419632434844,
|
|
"num_tokens": 15701621.0,
|
|
"step": 7625
|
|
},
|
|
{
|
|
"entropy": 5.545981407165527,
|
|
"epoch": 6.770528184642699,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00017531515841651997,
|
|
"loss": 4.9604,
|
|
"mean_token_accuracy": 0.2164713516831398,
|
|
"num_tokens": 15712246.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 5.555404710769653,
|
|
"epoch": 6.774966711051931,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00017500645542978144,
|
|
"loss": 4.9692,
|
|
"mean_token_accuracy": 0.22068429589271546,
|
|
"num_tokens": 15722295.0,
|
|
"step": 7635
|
|
},
|
|
{
|
|
"entropy": 5.52449369430542,
|
|
"epoch": 6.779405237461162,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0001746979868210793,
|
|
"loss": 4.8808,
|
|
"mean_token_accuracy": 0.22128682136535643,
|
|
"num_tokens": 15731898.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 5.538254261016846,
|
|
"epoch": 6.7838437638703954,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00017438975331344285,
|
|
"loss": 4.9089,
|
|
"mean_token_accuracy": 0.2163728505373001,
|
|
"num_tokens": 15742338.0,
|
|
"step": 7645
|
|
},
|
|
{
|
|
"entropy": 5.503296041488648,
|
|
"epoch": 6.788282290279627,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001740817556293501,
|
|
"loss": 4.8689,
|
|
"mean_token_accuracy": 0.22529321312904357,
|
|
"num_tokens": 15751642.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 5.543597173690796,
|
|
"epoch": 6.79272081668886,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0001737739944907269,
|
|
"loss": 4.9519,
|
|
"mean_token_accuracy": 0.21429035067558289,
|
|
"num_tokens": 15762223.0,
|
|
"step": 7655
|
|
},
|
|
{
|
|
"entropy": 5.527972936630249,
|
|
"epoch": 6.797159343098091,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0001734664706189441,
|
|
"loss": 4.8971,
|
|
"mean_token_accuracy": 0.21979204416275025,
|
|
"num_tokens": 15772324.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 5.5575508117675785,
|
|
"epoch": 6.801597869507324,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00017315918473481673,
|
|
"loss": 4.9669,
|
|
"mean_token_accuracy": 0.21212748885154725,
|
|
"num_tokens": 15782361.0,
|
|
"step": 7665
|
|
},
|
|
{
|
|
"entropy": 5.518660640716552,
|
|
"epoch": 6.806036395916555,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000172852137558602,
|
|
"loss": 4.8935,
|
|
"mean_token_accuracy": 0.2195412129163742,
|
|
"num_tokens": 15791882.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 5.5690549373626705,
|
|
"epoch": 6.810474922325788,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00017254532980999731,
|
|
"loss": 4.8992,
|
|
"mean_token_accuracy": 0.2253511518239975,
|
|
"num_tokens": 15801385.0,
|
|
"step": 7675
|
|
},
|
|
{
|
|
"entropy": 5.518895864486694,
|
|
"epoch": 6.81491344873502,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00017223876220813928,
|
|
"loss": 4.9283,
|
|
"mean_token_accuracy": 0.21845995038747787,
|
|
"num_tokens": 15811729.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 5.490466022491455,
|
|
"epoch": 6.819351975144252,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00017193243547160137,
|
|
"loss": 4.936,
|
|
"mean_token_accuracy": 0.22149820178747176,
|
|
"num_tokens": 15821669.0,
|
|
"step": 7685
|
|
},
|
|
{
|
|
"entropy": 5.613123369216919,
|
|
"epoch": 6.823790501553484,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00017162635031839235,
|
|
"loss": 5.059,
|
|
"mean_token_accuracy": 0.21032467633485794,
|
|
"num_tokens": 15832555.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 5.607917594909668,
|
|
"epoch": 6.828229027962716,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00017132050746595506,
|
|
"loss": 4.944,
|
|
"mean_token_accuracy": 0.21487554609775544,
|
|
"num_tokens": 15841866.0,
|
|
"step": 7695
|
|
},
|
|
{
|
|
"entropy": 5.5373986721038815,
|
|
"epoch": 6.832667554371948,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00017101490763116425,
|
|
"loss": 4.8652,
|
|
"mean_token_accuracy": 0.22313926219940186,
|
|
"num_tokens": 15851403.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 5.403235673904419,
|
|
"epoch": 6.83710608078118,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001707095515303249,
|
|
"loss": 4.819,
|
|
"mean_token_accuracy": 0.23036244362592698,
|
|
"num_tokens": 15861136.0,
|
|
"step": 7705
|
|
},
|
|
{
|
|
"entropy": 5.508434629440307,
|
|
"epoch": 6.8415446071904125,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00017040443987917107,
|
|
"loss": 4.9685,
|
|
"mean_token_accuracy": 0.21057210862636566,
|
|
"num_tokens": 15872000.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 5.562422561645508,
|
|
"epoch": 6.845983133599645,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00017009957339286346,
|
|
"loss": 4.9852,
|
|
"mean_token_accuracy": 0.21071284711360933,
|
|
"num_tokens": 15881721.0,
|
|
"step": 7715
|
|
},
|
|
{
|
|
"entropy": 5.5122603416442875,
|
|
"epoch": 6.850421660008877,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00016979495278598834,
|
|
"loss": 4.8697,
|
|
"mean_token_accuracy": 0.22172239869832994,
|
|
"num_tokens": 15891939.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 5.534740734100342,
|
|
"epoch": 6.854860186418109,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00016949057877255568,
|
|
"loss": 4.8869,
|
|
"mean_token_accuracy": 0.22549089938402175,
|
|
"num_tokens": 15901955.0,
|
|
"step": 7725
|
|
},
|
|
{
|
|
"entropy": 5.527624988555909,
|
|
"epoch": 6.859298712827341,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00016918645206599715,
|
|
"loss": 4.8805,
|
|
"mean_token_accuracy": 0.21357282400131225,
|
|
"num_tokens": 15911906.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 5.537739896774292,
|
|
"epoch": 6.863737239236573,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001688825733791652,
|
|
"loss": 4.8817,
|
|
"mean_token_accuracy": 0.215438637137413,
|
|
"num_tokens": 15921389.0,
|
|
"step": 7735
|
|
},
|
|
{
|
|
"entropy": 5.6014237880706785,
|
|
"epoch": 6.868175765645805,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001685789434243306,
|
|
"loss": 5.0405,
|
|
"mean_token_accuracy": 0.21656180918216705,
|
|
"num_tokens": 15932419.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 5.588205718994141,
|
|
"epoch": 6.8726142920550375,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00016827556291318117,
|
|
"loss": 5.0265,
|
|
"mean_token_accuracy": 0.20712802112102507,
|
|
"num_tokens": 15942861.0,
|
|
"step": 7745
|
|
},
|
|
{
|
|
"entropy": 5.5192646980285645,
|
|
"epoch": 6.87705281846427,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00016797243255682026,
|
|
"loss": 4.8868,
|
|
"mean_token_accuracy": 0.22516984045505523,
|
|
"num_tokens": 15952205.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 5.543596839904785,
|
|
"epoch": 6.881491344873502,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00016766955306576458,
|
|
"loss": 4.9872,
|
|
"mean_token_accuracy": 0.21560545414686202,
|
|
"num_tokens": 15963222.0,
|
|
"step": 7755
|
|
},
|
|
{
|
|
"entropy": 5.540840721130371,
|
|
"epoch": 6.885929871282734,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001673669251499429,
|
|
"loss": 4.8694,
|
|
"mean_token_accuracy": 0.2329263225197792,
|
|
"num_tokens": 15973309.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 5.603669309616089,
|
|
"epoch": 6.890368397691966,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00016706454951869468,
|
|
"loss": 4.9901,
|
|
"mean_token_accuracy": 0.21477916091680527,
|
|
"num_tokens": 15983434.0,
|
|
"step": 7765
|
|
},
|
|
{
|
|
"entropy": 5.5009620666503904,
|
|
"epoch": 6.894806924101198,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00016676242688076737,
|
|
"loss": 4.8267,
|
|
"mean_token_accuracy": 0.22609834522008895,
|
|
"num_tokens": 15994229.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 5.514490699768066,
|
|
"epoch": 6.89924545051043,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00016646055794431602,
|
|
"loss": 4.998,
|
|
"mean_token_accuracy": 0.2085113435983658,
|
|
"num_tokens": 16004322.0,
|
|
"step": 7775
|
|
},
|
|
{
|
|
"entropy": 5.5758161544799805,
|
|
"epoch": 6.9036839769196625,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00016615894341690074,
|
|
"loss": 4.9419,
|
|
"mean_token_accuracy": 0.22001910358667373,
|
|
"num_tokens": 16013846.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 5.631315755844116,
|
|
"epoch": 6.908122503328895,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001658575840054853,
|
|
"loss": 5.0109,
|
|
"mean_token_accuracy": 0.2098667725920677,
|
|
"num_tokens": 16024230.0,
|
|
"step": 7785
|
|
},
|
|
{
|
|
"entropy": 5.560648584365845,
|
|
"epoch": 6.912561029738127,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00016555648041643566,
|
|
"loss": 4.9415,
|
|
"mean_token_accuracy": 0.21280067563056945,
|
|
"num_tokens": 16034299.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 5.5424243927001955,
|
|
"epoch": 6.916999556147359,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00016525563335551804,
|
|
"loss": 4.9421,
|
|
"mean_token_accuracy": 0.22658007144927977,
|
|
"num_tokens": 16044180.0,
|
|
"step": 7795
|
|
},
|
|
{
|
|
"entropy": 5.534834194183349,
|
|
"epoch": 6.921438082556591,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00016495504352789735,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.21532035619020462,
|
|
"num_tokens": 16054461.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 5.510569429397583,
|
|
"epoch": 6.925876608965823,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00016465471163813576,
|
|
"loss": 4.9646,
|
|
"mean_token_accuracy": 0.21625108569860457,
|
|
"num_tokens": 16065962.0,
|
|
"step": 7805
|
|
},
|
|
{
|
|
"entropy": 5.518696546554565,
|
|
"epoch": 6.930315135375055,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00016435463839019045,
|
|
"loss": 4.8412,
|
|
"mean_token_accuracy": 0.2187938243150711,
|
|
"num_tokens": 16076125.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 5.530542373657227,
|
|
"epoch": 6.9347536617842875,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0001640548244874128,
|
|
"loss": 4.9254,
|
|
"mean_token_accuracy": 0.2178049236536026,
|
|
"num_tokens": 16086582.0,
|
|
"step": 7815
|
|
},
|
|
{
|
|
"entropy": 5.510978507995605,
|
|
"epoch": 6.93919218819352,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00016375527063254604,
|
|
"loss": 4.9403,
|
|
"mean_token_accuracy": 0.2125280275940895,
|
|
"num_tokens": 16097072.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 5.543430233001709,
|
|
"epoch": 6.943630714602752,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001634559775277239,
|
|
"loss": 4.8512,
|
|
"mean_token_accuracy": 0.2229102522134781,
|
|
"num_tokens": 16107155.0,
|
|
"step": 7825
|
|
},
|
|
{
|
|
"entropy": 5.465942001342773,
|
|
"epoch": 6.948069241011984,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001631569458744691,
|
|
"loss": 4.788,
|
|
"mean_token_accuracy": 0.2326107367873192,
|
|
"num_tokens": 16116320.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 5.527227830886841,
|
|
"epoch": 6.952507767421216,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00016285817637369133,
|
|
"loss": 4.9287,
|
|
"mean_token_accuracy": 0.21412108689546586,
|
|
"num_tokens": 16127160.0,
|
|
"step": 7835
|
|
},
|
|
{
|
|
"entropy": 5.474220418930054,
|
|
"epoch": 6.956946293830448,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00016255966972568574,
|
|
"loss": 4.9013,
|
|
"mean_token_accuracy": 0.22032673358917237,
|
|
"num_tokens": 16137512.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 5.539914226531982,
|
|
"epoch": 6.96138482023968,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001622614266301319,
|
|
"loss": 4.942,
|
|
"mean_token_accuracy": 0.22001080960035324,
|
|
"num_tokens": 16147360.0,
|
|
"step": 7845
|
|
},
|
|
{
|
|
"entropy": 5.562770509719849,
|
|
"epoch": 6.965823346648913,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001619634477860908,
|
|
"loss": 4.9612,
|
|
"mean_token_accuracy": 0.21766769737005234,
|
|
"num_tokens": 16156831.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 5.514585828781128,
|
|
"epoch": 6.970261873058145,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00016166573389200478,
|
|
"loss": 4.9254,
|
|
"mean_token_accuracy": 0.21982194483280182,
|
|
"num_tokens": 16167435.0,
|
|
"step": 7855
|
|
},
|
|
{
|
|
"entropy": 5.539769268035888,
|
|
"epoch": 6.974700399467377,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00016136828564569482,
|
|
"loss": 5.0289,
|
|
"mean_token_accuracy": 0.21073384582996368,
|
|
"num_tokens": 16177400.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 5.435232019424438,
|
|
"epoch": 6.979138925876609,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00016107110374435912,
|
|
"loss": 4.8471,
|
|
"mean_token_accuracy": 0.23319431096315385,
|
|
"num_tokens": 16187529.0,
|
|
"step": 7865
|
|
},
|
|
{
|
|
"entropy": 5.45747447013855,
|
|
"epoch": 6.983577452285841,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00016077418888457197,
|
|
"loss": 4.8004,
|
|
"mean_token_accuracy": 0.2349813848733902,
|
|
"num_tokens": 16197515.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 5.580996084213257,
|
|
"epoch": 6.988015978695073,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00016047754176228145,
|
|
"loss": 5.0835,
|
|
"mean_token_accuracy": 0.206863734126091,
|
|
"num_tokens": 16208407.0,
|
|
"step": 7875
|
|
},
|
|
{
|
|
"entropy": 5.5298388481140135,
|
|
"epoch": 6.992454505104305,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00016018116307280801,
|
|
"loss": 4.8976,
|
|
"mean_token_accuracy": 0.21983272433280945,
|
|
"num_tokens": 16220079.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 5.535926485061646,
|
|
"epoch": 6.996893031513538,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00015988505351084334,
|
|
"loss": 4.8715,
|
|
"mean_token_accuracy": 0.22571598887443542,
|
|
"num_tokens": 16230652.0,
|
|
"step": 7885
|
|
},
|
|
{
|
|
"entropy": 5.5292445288764105,
|
|
"epoch": 7.000887705281847,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00015958921377044765,
|
|
"loss": 4.932,
|
|
"mean_token_accuracy": 0.22119410004880694,
|
|
"num_tokens": 16240468.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 5.565903282165527,
|
|
"epoch": 7.005326231691079,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00015929364454504935,
|
|
"loss": 4.8382,
|
|
"mean_token_accuracy": 0.21748816668987275,
|
|
"num_tokens": 16249703.0,
|
|
"step": 7895
|
|
},
|
|
{
|
|
"entropy": 5.5517669200897215,
|
|
"epoch": 7.009764758100311,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00015899834652744247,
|
|
"loss": 4.8414,
|
|
"mean_token_accuracy": 0.21986480355262755,
|
|
"num_tokens": 16260998.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 5.534623432159424,
|
|
"epoch": 7.014203284509543,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0001587033204097852,
|
|
"loss": 4.8262,
|
|
"mean_token_accuracy": 0.2315726563334465,
|
|
"num_tokens": 16270718.0,
|
|
"step": 7905
|
|
},
|
|
{
|
|
"entropy": 5.499970531463623,
|
|
"epoch": 7.018641810918775,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00015840856688359887,
|
|
"loss": 4.8604,
|
|
"mean_token_accuracy": 0.2276461660861969,
|
|
"num_tokens": 16281573.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 5.489800643920899,
|
|
"epoch": 7.0230803373280075,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00015811408663976546,
|
|
"loss": 4.7549,
|
|
"mean_token_accuracy": 0.23386742174625397,
|
|
"num_tokens": 16293543.0,
|
|
"step": 7915
|
|
},
|
|
{
|
|
"entropy": 5.481780529022217,
|
|
"epoch": 7.02751886373724,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00015781988036852647,
|
|
"loss": 4.7375,
|
|
"mean_token_accuracy": 0.23514950424432754,
|
|
"num_tokens": 16303030.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 5.551403141021728,
|
|
"epoch": 7.031957390146472,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00015752594875948156,
|
|
"loss": 4.8416,
|
|
"mean_token_accuracy": 0.22496299147605897,
|
|
"num_tokens": 16312923.0,
|
|
"step": 7925
|
|
},
|
|
{
|
|
"entropy": 5.554946804046631,
|
|
"epoch": 7.036395916555703,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00015723229250158598,
|
|
"loss": 4.8175,
|
|
"mean_token_accuracy": 0.22460051774978637,
|
|
"num_tokens": 16324347.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 5.537577056884766,
|
|
"epoch": 7.040834442964935,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00015693891228315025,
|
|
"loss": 4.6995,
|
|
"mean_token_accuracy": 0.2363031968474388,
|
|
"num_tokens": 16334160.0,
|
|
"step": 7935
|
|
},
|
|
{
|
|
"entropy": 5.566307640075683,
|
|
"epoch": 7.045272969374167,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00015664580879183737,
|
|
"loss": 4.842,
|
|
"mean_token_accuracy": 0.22375402152538298,
|
|
"num_tokens": 16343381.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 5.593927335739136,
|
|
"epoch": 7.0497114957833995,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00015635298271466188,
|
|
"loss": 4.9271,
|
|
"mean_token_accuracy": 0.21231627017259597,
|
|
"num_tokens": 16354539.0,
|
|
"step": 7945
|
|
},
|
|
{
|
|
"entropy": 5.536477994918823,
|
|
"epoch": 7.054150022192632,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001560604347379883,
|
|
"loss": 4.8844,
|
|
"mean_token_accuracy": 0.2209285467863083,
|
|
"num_tokens": 16364886.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 5.545589971542358,
|
|
"epoch": 7.058588548601864,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00015576816554752892,
|
|
"loss": 4.8537,
|
|
"mean_token_accuracy": 0.22095734924077987,
|
|
"num_tokens": 16374341.0,
|
|
"step": 7955
|
|
},
|
|
{
|
|
"entropy": 5.582144355773925,
|
|
"epoch": 7.063027075011096,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00015547617582834273,
|
|
"loss": 4.8919,
|
|
"mean_token_accuracy": 0.21359026581048965,
|
|
"num_tokens": 16385619.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 5.563768529891968,
|
|
"epoch": 7.067465601420328,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00015518446626483392,
|
|
"loss": 4.8257,
|
|
"mean_token_accuracy": 0.22679323256015776,
|
|
"num_tokens": 16395807.0,
|
|
"step": 7965
|
|
},
|
|
{
|
|
"entropy": 5.580456829071045,
|
|
"epoch": 7.07190412782956,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00015489303754074945,
|
|
"loss": 4.8699,
|
|
"mean_token_accuracy": 0.2149389088153839,
|
|
"num_tokens": 16405647.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 5.500267887115479,
|
|
"epoch": 7.076342654238792,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001546018903391786,
|
|
"loss": 4.8523,
|
|
"mean_token_accuracy": 0.22563212364912033,
|
|
"num_tokens": 16415194.0,
|
|
"step": 7975
|
|
},
|
|
{
|
|
"entropy": 5.568335008621216,
|
|
"epoch": 7.0807811806480245,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00015431102534255037,
|
|
"loss": 4.8703,
|
|
"mean_token_accuracy": 0.21965404599905014,
|
|
"num_tokens": 16425195.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 5.51585373878479,
|
|
"epoch": 7.085219707057257,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00015402044323263242,
|
|
"loss": 4.7516,
|
|
"mean_token_accuracy": 0.2385525271296501,
|
|
"num_tokens": 16435643.0,
|
|
"step": 7985
|
|
},
|
|
{
|
|
"entropy": 5.551548194885254,
|
|
"epoch": 7.089658233466489,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00015373014469052948,
|
|
"loss": 4.7653,
|
|
"mean_token_accuracy": 0.23402368575334548,
|
|
"num_tokens": 16445925.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 5.484806203842163,
|
|
"epoch": 7.094096759875721,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00015344013039668148,
|
|
"loss": 4.7979,
|
|
"mean_token_accuracy": 0.22974969297647477,
|
|
"num_tokens": 16456433.0,
|
|
"step": 7995
|
|
},
|
|
{
|
|
"entropy": 5.5673164367675785,
|
|
"epoch": 7.098535286284953,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00015315040103086196,
|
|
"loss": 4.8894,
|
|
"mean_token_accuracy": 0.21772680729627608,
|
|
"num_tokens": 16468007.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"epoch": 7.098535286284953,
|
|
"eval_entropy": 5.417081438730562,
|
|
"eval_loss": 5.868298530578613,
|
|
"eval_mean_token_accuracy": 0.17251386265148744,
|
|
"eval_num_tokens": 16468007.0,
|
|
"eval_runtime": 2.7016,
|
|
"eval_samples_per_second": 1246.311,
|
|
"eval_steps_per_second": 155.835,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 5.547671842575073,
|
|
"epoch": 7.102973812694185,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00015286095727217702,
|
|
"loss": 4.8401,
|
|
"mean_token_accuracy": 0.2188134655356407,
|
|
"num_tokens": 16477025.0,
|
|
"step": 8005
|
|
},
|
|
{
|
|
"entropy": 5.5542027950286865,
|
|
"epoch": 7.107412339103417,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00015257179979906278,
|
|
"loss": 4.804,
|
|
"mean_token_accuracy": 0.23099099695682526,
|
|
"num_tokens": 16486515.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 5.475750875473023,
|
|
"epoch": 7.1118508655126496,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00015228292928928471,
|
|
"loss": 4.7812,
|
|
"mean_token_accuracy": 0.22622407525777816,
|
|
"num_tokens": 16495978.0,
|
|
"step": 8015
|
|
},
|
|
{
|
|
"entropy": 5.578029155731201,
|
|
"epoch": 7.116289391921882,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00015199434641993565,
|
|
"loss": 4.9103,
|
|
"mean_token_accuracy": 0.21572188585996627,
|
|
"num_tokens": 16506911.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 5.57917013168335,
|
|
"epoch": 7.120727918331114,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00015170605186743392,
|
|
"loss": 4.8321,
|
|
"mean_token_accuracy": 0.23019132614135743,
|
|
"num_tokens": 16516311.0,
|
|
"step": 8025
|
|
},
|
|
{
|
|
"entropy": 5.542527723312378,
|
|
"epoch": 7.125166444740346,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00015141804630752244,
|
|
"loss": 4.7415,
|
|
"mean_token_accuracy": 0.23034332692623138,
|
|
"num_tokens": 16526681.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 5.588299083709717,
|
|
"epoch": 7.129604971149578,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00015113033041526652,
|
|
"loss": 4.7978,
|
|
"mean_token_accuracy": 0.2255474552512169,
|
|
"num_tokens": 16537423.0,
|
|
"step": 8035
|
|
},
|
|
{
|
|
"entropy": 5.505769491195679,
|
|
"epoch": 7.13404349755881,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00015084290486505242,
|
|
"loss": 4.8383,
|
|
"mean_token_accuracy": 0.2282260313630104,
|
|
"num_tokens": 16547597.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 5.483242607116699,
|
|
"epoch": 7.138482023968042,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00015055577033058626,
|
|
"loss": 4.7709,
|
|
"mean_token_accuracy": 0.2337564632296562,
|
|
"num_tokens": 16558041.0,
|
|
"step": 8045
|
|
},
|
|
{
|
|
"entropy": 5.515174627304077,
|
|
"epoch": 7.142920550377275,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001502689274848914,
|
|
"loss": 4.8708,
|
|
"mean_token_accuracy": 0.23410458117723465,
|
|
"num_tokens": 16568852.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 5.489902353286743,
|
|
"epoch": 7.147359076786507,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014998237700030822,
|
|
"loss": 4.7999,
|
|
"mean_token_accuracy": 0.22890048772096633,
|
|
"num_tokens": 16578621.0,
|
|
"step": 8055
|
|
},
|
|
{
|
|
"entropy": 5.549872493743896,
|
|
"epoch": 7.151797603195739,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00014969611954849133,
|
|
"loss": 4.8904,
|
|
"mean_token_accuracy": 0.22757930755615235,
|
|
"num_tokens": 16589276.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 5.578784704208374,
|
|
"epoch": 7.156236129604971,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00014941015580040854,
|
|
"loss": 4.8428,
|
|
"mean_token_accuracy": 0.2250010758638382,
|
|
"num_tokens": 16598684.0,
|
|
"step": 8065
|
|
},
|
|
{
|
|
"entropy": 5.54313645362854,
|
|
"epoch": 7.160674656014203,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00014912448642633952,
|
|
"loss": 4.8411,
|
|
"mean_token_accuracy": 0.2198699176311493,
|
|
"num_tokens": 16609809.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 5.484795713424683,
|
|
"epoch": 7.165113182423435,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00014883911209587366,
|
|
"loss": 4.8334,
|
|
"mean_token_accuracy": 0.22378929555416108,
|
|
"num_tokens": 16620542.0,
|
|
"step": 8075
|
|
},
|
|
{
|
|
"entropy": 5.572915744781494,
|
|
"epoch": 7.1695517088326675,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00014855403347790885,
|
|
"loss": 4.8565,
|
|
"mean_token_accuracy": 0.22495311200618745,
|
|
"num_tokens": 16632469.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 5.508671426773072,
|
|
"epoch": 7.1739902352419,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00014826925124065014,
|
|
"loss": 4.8023,
|
|
"mean_token_accuracy": 0.23364190608263016,
|
|
"num_tokens": 16643392.0,
|
|
"step": 8085
|
|
},
|
|
{
|
|
"entropy": 5.549451017379761,
|
|
"epoch": 7.178428761651132,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00014798476605160728,
|
|
"loss": 4.8544,
|
|
"mean_token_accuracy": 0.2243693932890892,
|
|
"num_tokens": 16654342.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 5.52611813545227,
|
|
"epoch": 7.182867288060364,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00014770057857759438,
|
|
"loss": 4.8278,
|
|
"mean_token_accuracy": 0.22625938057899475,
|
|
"num_tokens": 16663987.0,
|
|
"step": 8095
|
|
},
|
|
{
|
|
"entropy": 5.502599811553955,
|
|
"epoch": 7.187305814469596,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00014741668948472735,
|
|
"loss": 4.7703,
|
|
"mean_token_accuracy": 0.23049034625291825,
|
|
"num_tokens": 16674039.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 5.54769082069397,
|
|
"epoch": 7.191744340878828,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00014713309943842272,
|
|
"loss": 4.8235,
|
|
"mean_token_accuracy": 0.22678229212760925,
|
|
"num_tokens": 16684956.0,
|
|
"step": 8105
|
|
},
|
|
{
|
|
"entropy": 5.542664337158203,
|
|
"epoch": 7.19618286728806,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00014684980910339645,
|
|
"loss": 4.811,
|
|
"mean_token_accuracy": 0.22825126200914383,
|
|
"num_tokens": 16694386.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 5.567810678482056,
|
|
"epoch": 7.2006213936972925,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001465668191436616,
|
|
"loss": 4.8191,
|
|
"mean_token_accuracy": 0.22737596780061722,
|
|
"num_tokens": 16704102.0,
|
|
"step": 8115
|
|
},
|
|
{
|
|
"entropy": 5.525670337677002,
|
|
"epoch": 7.205059920106525,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00014628413022252715,
|
|
"loss": 4.8254,
|
|
"mean_token_accuracy": 0.22843316495418547,
|
|
"num_tokens": 16714091.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 5.462945365905762,
|
|
"epoch": 7.209498446515757,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014600174300259693,
|
|
"loss": 4.7493,
|
|
"mean_token_accuracy": 0.23545086532831191,
|
|
"num_tokens": 16725368.0,
|
|
"step": 8125
|
|
},
|
|
{
|
|
"entropy": 5.504182481765747,
|
|
"epoch": 7.213936972924989,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000145719658145767,
|
|
"loss": 4.7538,
|
|
"mean_token_accuracy": 0.22991939634084702,
|
|
"num_tokens": 16735174.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 5.522628545761108,
|
|
"epoch": 7.218375499334221,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00014543787631322513,
|
|
"loss": 4.8879,
|
|
"mean_token_accuracy": 0.22089564055204391,
|
|
"num_tokens": 16745772.0,
|
|
"step": 8135
|
|
},
|
|
{
|
|
"entropy": 5.550188446044922,
|
|
"epoch": 7.222814025743453,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00014515639816544865,
|
|
"loss": 4.8424,
|
|
"mean_token_accuracy": 0.21901417672634124,
|
|
"num_tokens": 16756771.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 5.508692789077759,
|
|
"epoch": 7.227252552152685,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00014487522436220304,
|
|
"loss": 4.8438,
|
|
"mean_token_accuracy": 0.22418237179517747,
|
|
"num_tokens": 16767199.0,
|
|
"step": 8145
|
|
},
|
|
{
|
|
"entropy": 5.579889440536499,
|
|
"epoch": 7.2316910785619175,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00014459435556254062,
|
|
"loss": 4.9329,
|
|
"mean_token_accuracy": 0.21205476969480513,
|
|
"num_tokens": 16778303.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 5.5756187915802,
|
|
"epoch": 7.23612960497115,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00014431379242479863,
|
|
"loss": 4.8782,
|
|
"mean_token_accuracy": 0.22583089917898178,
|
|
"num_tokens": 16789043.0,
|
|
"step": 8155
|
|
},
|
|
{
|
|
"entropy": 5.502965259552002,
|
|
"epoch": 7.240568131380382,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014403353560659776,
|
|
"loss": 4.8176,
|
|
"mean_token_accuracy": 0.22689286917448043,
|
|
"num_tokens": 16799261.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 5.4611681461334225,
|
|
"epoch": 7.245006657789614,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00014375358576484114,
|
|
"loss": 4.797,
|
|
"mean_token_accuracy": 0.23626856207847596,
|
|
"num_tokens": 16809392.0,
|
|
"step": 8165
|
|
},
|
|
{
|
|
"entropy": 5.527022075653076,
|
|
"epoch": 7.249445184198846,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00014347394355571167,
|
|
"loss": 4.8138,
|
|
"mean_token_accuracy": 0.22673380970954896,
|
|
"num_tokens": 16818645.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 5.52257285118103,
|
|
"epoch": 7.253883710608078,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001431946096346719,
|
|
"loss": 4.8578,
|
|
"mean_token_accuracy": 0.2238910511136055,
|
|
"num_tokens": 16827998.0,
|
|
"step": 8175
|
|
},
|
|
{
|
|
"entropy": 5.553846597671509,
|
|
"epoch": 7.25832223701731,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00014291558465646132,
|
|
"loss": 4.8377,
|
|
"mean_token_accuracy": 0.22434737384319306,
|
|
"num_tokens": 16838314.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 5.5643891334533695,
|
|
"epoch": 7.2627607634265425,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0001426368692750954,
|
|
"loss": 4.8456,
|
|
"mean_token_accuracy": 0.22257078886032106,
|
|
"num_tokens": 16847978.0,
|
|
"step": 8185
|
|
},
|
|
{
|
|
"entropy": 5.473025560379028,
|
|
"epoch": 7.267199289835775,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000142358464143864,
|
|
"loss": 4.8104,
|
|
"mean_token_accuracy": 0.23016615509986876,
|
|
"num_tokens": 16858105.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 5.457581567764282,
|
|
"epoch": 7.271637816245007,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00014208036991532978,
|
|
"loss": 4.7493,
|
|
"mean_token_accuracy": 0.23675765246152877,
|
|
"num_tokens": 16868574.0,
|
|
"step": 8195
|
|
},
|
|
{
|
|
"entropy": 5.500149965286255,
|
|
"epoch": 7.276076342654239,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0001418025872413264,
|
|
"loss": 4.7875,
|
|
"mean_token_accuracy": 0.2306971177458763,
|
|
"num_tokens": 16878456.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 5.54533200263977,
|
|
"epoch": 7.280514869063471,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00014152511677295785,
|
|
"loss": 4.856,
|
|
"mean_token_accuracy": 0.22881562411785125,
|
|
"num_tokens": 16887687.0,
|
|
"step": 8205
|
|
},
|
|
{
|
|
"entropy": 5.532986259460449,
|
|
"epoch": 7.284953395472703,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00014124795916059548,
|
|
"loss": 4.8357,
|
|
"mean_token_accuracy": 0.22583044022321702,
|
|
"num_tokens": 16898846.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 5.574441719055176,
|
|
"epoch": 7.289391921881935,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00014097111505387817,
|
|
"loss": 4.8899,
|
|
"mean_token_accuracy": 0.21410389095544816,
|
|
"num_tokens": 16908820.0,
|
|
"step": 8215
|
|
},
|
|
{
|
|
"entropy": 5.524200057983398,
|
|
"epoch": 7.293830448291168,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001406945851017094,
|
|
"loss": 4.912,
|
|
"mean_token_accuracy": 0.2211119070649147,
|
|
"num_tokens": 16920229.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 5.500553894042969,
|
|
"epoch": 7.2982689747004,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00014041836995225645,
|
|
"loss": 4.7488,
|
|
"mean_token_accuracy": 0.23597707003355026,
|
|
"num_tokens": 16929534.0,
|
|
"step": 8225
|
|
},
|
|
{
|
|
"entropy": 5.5176365852355955,
|
|
"epoch": 7.302707501109632,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00014014247025294897,
|
|
"loss": 4.761,
|
|
"mean_token_accuracy": 0.22832667082548141,
|
|
"num_tokens": 16939405.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 5.515739059448242,
|
|
"epoch": 7.307146027518864,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0001398668866504768,
|
|
"loss": 4.8566,
|
|
"mean_token_accuracy": 0.22204002141952514,
|
|
"num_tokens": 16950653.0,
|
|
"step": 8235
|
|
},
|
|
{
|
|
"entropy": 5.539560985565186,
|
|
"epoch": 7.311584553928096,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001395916197907891,
|
|
"loss": 4.8745,
|
|
"mean_token_accuracy": 0.2229080006480217,
|
|
"num_tokens": 16961061.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 5.506972122192383,
|
|
"epoch": 7.316023080337328,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00013931667031909283,
|
|
"loss": 4.8393,
|
|
"mean_token_accuracy": 0.22425775676965715,
|
|
"num_tokens": 16971005.0,
|
|
"step": 8245
|
|
},
|
|
{
|
|
"entropy": 5.5056829929351805,
|
|
"epoch": 7.32046160674656,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00013904203887985035,
|
|
"loss": 4.7999,
|
|
"mean_token_accuracy": 0.23558456301689149,
|
|
"num_tokens": 16981818.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 5.5343590259552,
|
|
"epoch": 7.324900133155793,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001387677261167793,
|
|
"loss": 4.8117,
|
|
"mean_token_accuracy": 0.2205576404929161,
|
|
"num_tokens": 16991476.0,
|
|
"step": 8255
|
|
},
|
|
{
|
|
"entropy": 5.526212167739868,
|
|
"epoch": 7.329338659565025,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00013849373267284997,
|
|
"loss": 4.7656,
|
|
"mean_token_accuracy": 0.23142243772745133,
|
|
"num_tokens": 17001590.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 5.568186807632446,
|
|
"epoch": 7.333777185974257,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00013822005919028412,
|
|
"loss": 4.8976,
|
|
"mean_token_accuracy": 0.22561565041542053,
|
|
"num_tokens": 17010866.0,
|
|
"step": 8265
|
|
},
|
|
{
|
|
"entropy": 5.6258691310882565,
|
|
"epoch": 7.338215712383489,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00013794670631055395,
|
|
"loss": 4.8762,
|
|
"mean_token_accuracy": 0.21288719922304153,
|
|
"num_tokens": 17020594.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 5.5284508228302,
|
|
"epoch": 7.342654238792721,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00013767367467437986,
|
|
"loss": 4.8882,
|
|
"mean_token_accuracy": 0.21825562417507172,
|
|
"num_tokens": 17031553.0,
|
|
"step": 8275
|
|
},
|
|
{
|
|
"entropy": 5.521149492263794,
|
|
"epoch": 7.347092765201953,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00013740096492172917,
|
|
"loss": 4.8175,
|
|
"mean_token_accuracy": 0.21843705028295518,
|
|
"num_tokens": 17041926.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 5.628622388839721,
|
|
"epoch": 7.3515312916111855,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00013712857769181518,
|
|
"loss": 4.9479,
|
|
"mean_token_accuracy": 0.21376848667860032,
|
|
"num_tokens": 17053085.0,
|
|
"step": 8285
|
|
},
|
|
{
|
|
"entropy": 5.513779497146606,
|
|
"epoch": 7.355969818020418,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001368565136230947,
|
|
"loss": 4.8289,
|
|
"mean_token_accuracy": 0.22480135411024094,
|
|
"num_tokens": 17063045.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 5.518791627883911,
|
|
"epoch": 7.36040834442965,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001365847733532675,
|
|
"loss": 4.7868,
|
|
"mean_token_accuracy": 0.22614157497882842,
|
|
"num_tokens": 17073923.0,
|
|
"step": 8295
|
|
},
|
|
{
|
|
"entropy": 5.526434278488159,
|
|
"epoch": 7.364846870838882,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 0.0001363133575192741,
|
|
"loss": 4.8127,
|
|
"mean_token_accuracy": 0.22693072259426117,
|
|
"num_tokens": 17083659.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 5.511857891082764,
|
|
"epoch": 7.369285397248113,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00013604226675729465,
|
|
"loss": 4.7973,
|
|
"mean_token_accuracy": 0.23052221089601516,
|
|
"num_tokens": 17094258.0,
|
|
"step": 8305
|
|
},
|
|
{
|
|
"entropy": 5.531572914123535,
|
|
"epoch": 7.373723923657346,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0001357715017027475,
|
|
"loss": 4.8425,
|
|
"mean_token_accuracy": 0.22183124274015426,
|
|
"num_tokens": 17102983.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 5.5259300708770756,
|
|
"epoch": 7.3781624500665774,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00013550106299028733,
|
|
"loss": 4.8894,
|
|
"mean_token_accuracy": 0.22089309394359588,
|
|
"num_tokens": 17112940.0,
|
|
"step": 8315
|
|
},
|
|
{
|
|
"entropy": 5.527954483032227,
|
|
"epoch": 7.3826009764758105,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00013523095125380396,
|
|
"loss": 4.8544,
|
|
"mean_token_accuracy": 0.224172443151474,
|
|
"num_tokens": 17123574.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 5.551538753509521,
|
|
"epoch": 7.387039502885042,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00013496116712642108,
|
|
"loss": 4.8772,
|
|
"mean_token_accuracy": 0.22175752520561218,
|
|
"num_tokens": 17134914.0,
|
|
"step": 8325
|
|
},
|
|
{
|
|
"entropy": 5.480142831802368,
|
|
"epoch": 7.391478029294274,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00013469171124049398,
|
|
"loss": 4.8045,
|
|
"mean_token_accuracy": 0.23609121292829513,
|
|
"num_tokens": 17144670.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 5.481876802444458,
|
|
"epoch": 7.395916555703506,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000134422584227609,
|
|
"loss": 4.7476,
|
|
"mean_token_accuracy": 0.2342465564608574,
|
|
"num_tokens": 17154276.0,
|
|
"step": 8335
|
|
},
|
|
{
|
|
"entropy": 5.487003374099731,
|
|
"epoch": 7.400355082112738,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00013415378671858142,
|
|
"loss": 4.7674,
|
|
"mean_token_accuracy": 0.23292025923728943,
|
|
"num_tokens": 17165139.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 5.5097075462341305,
|
|
"epoch": 7.40479360852197,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00013388531934345417,
|
|
"loss": 4.8342,
|
|
"mean_token_accuracy": 0.22711736261844634,
|
|
"num_tokens": 17175604.0,
|
|
"step": 8345
|
|
},
|
|
{
|
|
"entropy": 5.5641197681427,
|
|
"epoch": 7.4092321349312025,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001336171827314966,
|
|
"loss": 4.8327,
|
|
"mean_token_accuracy": 0.22450610399246215,
|
|
"num_tokens": 17185976.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 5.50412769317627,
|
|
"epoch": 7.413670661340435,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00013334937751120247,
|
|
"loss": 4.8453,
|
|
"mean_token_accuracy": 0.2299114391207695,
|
|
"num_tokens": 17196836.0,
|
|
"step": 8355
|
|
},
|
|
{
|
|
"entropy": 5.5768190860748295,
|
|
"epoch": 7.418109187749667,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.00013308190431028893,
|
|
"loss": 4.9488,
|
|
"mean_token_accuracy": 0.21491037160158158,
|
|
"num_tokens": 17207511.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 5.553695201873779,
|
|
"epoch": 7.422547714158899,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00013281476375569503,
|
|
"loss": 4.7938,
|
|
"mean_token_accuracy": 0.2326598882675171,
|
|
"num_tokens": 17217611.0,
|
|
"step": 8365
|
|
},
|
|
{
|
|
"entropy": 5.528583288192749,
|
|
"epoch": 7.426986240568131,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00013254795647357976,
|
|
"loss": 4.8362,
|
|
"mean_token_accuracy": 0.22520908415317537,
|
|
"num_tokens": 17227721.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 5.476093578338623,
|
|
"epoch": 7.431424766977363,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001322814830893213,
|
|
"loss": 4.7469,
|
|
"mean_token_accuracy": 0.23049061745405197,
|
|
"num_tokens": 17237611.0,
|
|
"step": 8375
|
|
},
|
|
{
|
|
"entropy": 5.523039531707764,
|
|
"epoch": 7.435863293386595,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00013201534422751504,
|
|
"loss": 4.8555,
|
|
"mean_token_accuracy": 0.2302015706896782,
|
|
"num_tokens": 17249165.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 5.51413049697876,
|
|
"epoch": 7.4403018197958275,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001317495405119722,
|
|
"loss": 4.8349,
|
|
"mean_token_accuracy": 0.230510413646698,
|
|
"num_tokens": 17259970.0,
|
|
"step": 8385
|
|
},
|
|
{
|
|
"entropy": 5.528391933441162,
|
|
"epoch": 7.44474034620506,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00013148407256571864,
|
|
"loss": 4.8569,
|
|
"mean_token_accuracy": 0.2208354115486145,
|
|
"num_tokens": 17270583.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 5.4800660610198975,
|
|
"epoch": 7.449178872614292,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0001312189410109931,
|
|
"loss": 4.7726,
|
|
"mean_token_accuracy": 0.23840725123882295,
|
|
"num_tokens": 17280523.0,
|
|
"step": 8395
|
|
},
|
|
{
|
|
"entropy": 5.52663025856018,
|
|
"epoch": 7.453617399023524,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00013095414646924563,
|
|
"loss": 4.8237,
|
|
"mean_token_accuracy": 0.22444128692150117,
|
|
"num_tokens": 17290334.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 5.537862110137939,
|
|
"epoch": 7.458055925432756,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00013068968956113686,
|
|
"loss": 4.825,
|
|
"mean_token_accuracy": 0.22732312083244324,
|
|
"num_tokens": 17300573.0,
|
|
"step": 8405
|
|
},
|
|
{
|
|
"entropy": 5.494001770019532,
|
|
"epoch": 7.462494451841988,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00013042557090653538,
|
|
"loss": 4.7484,
|
|
"mean_token_accuracy": 0.23765261173248292,
|
|
"num_tokens": 17310081.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 5.491052436828613,
|
|
"epoch": 7.46693297825122,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00013016179112451754,
|
|
"loss": 4.7297,
|
|
"mean_token_accuracy": 0.2428295537829399,
|
|
"num_tokens": 17320941.0,
|
|
"step": 8415
|
|
},
|
|
{
|
|
"entropy": 5.518697881698609,
|
|
"epoch": 7.4713715046604525,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000129898350833365,
|
|
"loss": 4.8659,
|
|
"mean_token_accuracy": 0.22780809849500655,
|
|
"num_tokens": 17332574.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 5.417581176757812,
|
|
"epoch": 7.475810031069685,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001296352506505637,
|
|
"loss": 4.6881,
|
|
"mean_token_accuracy": 0.24527059644460678,
|
|
"num_tokens": 17342567.0,
|
|
"step": 8425
|
|
},
|
|
{
|
|
"entropy": 5.505463790893555,
|
|
"epoch": 7.480248557478917,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00012937249119280276,
|
|
"loss": 4.8062,
|
|
"mean_token_accuracy": 0.22198499292135238,
|
|
"num_tokens": 17352599.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 5.50503830909729,
|
|
"epoch": 7.484687083888149,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00012911007307597216,
|
|
"loss": 4.826,
|
|
"mean_token_accuracy": 0.2316443592309952,
|
|
"num_tokens": 17362457.0,
|
|
"step": 8435
|
|
},
|
|
{
|
|
"entropy": 5.558705615997314,
|
|
"epoch": 7.489125610297381,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00012884799691516207,
|
|
"loss": 4.866,
|
|
"mean_token_accuracy": 0.2235052093863487,
|
|
"num_tokens": 17371939.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 5.576251029968262,
|
|
"epoch": 7.493564136706613,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00012858626332466134,
|
|
"loss": 4.874,
|
|
"mean_token_accuracy": 0.22011675238609313,
|
|
"num_tokens": 17381727.0,
|
|
"step": 8445
|
|
},
|
|
{
|
|
"entropy": 5.487157583236694,
|
|
"epoch": 7.498002663115845,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00012832487291795529,
|
|
"loss": 4.7783,
|
|
"mean_token_accuracy": 0.23089126646518707,
|
|
"num_tokens": 17392035.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 5.507126045227051,
|
|
"epoch": 7.5024411895250775,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00012806382630772538,
|
|
"loss": 4.7595,
|
|
"mean_token_accuracy": 0.2336970940232277,
|
|
"num_tokens": 17402021.0,
|
|
"step": 8455
|
|
},
|
|
{
|
|
"entropy": 5.542128849029541,
|
|
"epoch": 7.50687971593431,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00012780312410584695,
|
|
"loss": 4.8438,
|
|
"mean_token_accuracy": 0.22735902518033982,
|
|
"num_tokens": 17412091.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 5.5118200302124025,
|
|
"epoch": 7.511318242343542,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00012754276692338807,
|
|
"loss": 4.8416,
|
|
"mean_token_accuracy": 0.22556969821453093,
|
|
"num_tokens": 17422486.0,
|
|
"step": 8465
|
|
},
|
|
{
|
|
"entropy": 5.515256452560425,
|
|
"epoch": 7.515756768752774,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001272827553706084,
|
|
"loss": 4.8273,
|
|
"mean_token_accuracy": 0.22171308547258378,
|
|
"num_tokens": 17432853.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 5.541082525253296,
|
|
"epoch": 7.520195295162006,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00012702309005695715,
|
|
"loss": 4.8205,
|
|
"mean_token_accuracy": 0.23031286746263505,
|
|
"num_tokens": 17442921.0,
|
|
"step": 8475
|
|
},
|
|
{
|
|
"entropy": 5.472198009490967,
|
|
"epoch": 7.524633821571238,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00012676377159107194,
|
|
"loss": 4.7382,
|
|
"mean_token_accuracy": 0.23142171204090117,
|
|
"num_tokens": 17453728.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 5.553830671310425,
|
|
"epoch": 7.52907234798047,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00012650480058077785,
|
|
"loss": 4.8315,
|
|
"mean_token_accuracy": 0.2260192424058914,
|
|
"num_tokens": 17464263.0,
|
|
"step": 8485
|
|
},
|
|
{
|
|
"entropy": 5.491733026504517,
|
|
"epoch": 7.533510874389703,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00012624617763308486,
|
|
"loss": 4.7833,
|
|
"mean_token_accuracy": 0.2294919490814209,
|
|
"num_tokens": 17474529.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 5.554998779296875,
|
|
"epoch": 7.537949400798935,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00012598790335418774,
|
|
"loss": 4.8687,
|
|
"mean_token_accuracy": 0.2203487917780876,
|
|
"num_tokens": 17484955.0,
|
|
"step": 8495
|
|
},
|
|
{
|
|
"entropy": 5.521708965301514,
|
|
"epoch": 7.542387927208167,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00012572997834946371,
|
|
"loss": 4.7601,
|
|
"mean_token_accuracy": 0.23390865623950957,
|
|
"num_tokens": 17494511.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"epoch": 7.542387927208167,
|
|
"eval_entropy": 5.417753244522348,
|
|
"eval_loss": 5.858129978179932,
|
|
"eval_mean_token_accuracy": 0.1735702339657129,
|
|
"eval_num_tokens": 17494511.0,
|
|
"eval_runtime": 2.6847,
|
|
"eval_samples_per_second": 1254.157,
|
|
"eval_steps_per_second": 156.816,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 5.5250678062438965,
|
|
"epoch": 7.546826453617399,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00012547240322347122,
|
|
"loss": 4.7879,
|
|
"mean_token_accuracy": 0.2308879241347313,
|
|
"num_tokens": 17503873.0,
|
|
"step": 8505
|
|
},
|
|
{
|
|
"entropy": 5.5558990955352785,
|
|
"epoch": 7.551264980026631,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00012521517857994895,
|
|
"loss": 4.8245,
|
|
"mean_token_accuracy": 0.22850705236196517,
|
|
"num_tokens": 17515681.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 5.499555873870849,
|
|
"epoch": 7.555703506435863,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00012495830502181387,
|
|
"loss": 4.7977,
|
|
"mean_token_accuracy": 0.2280339777469635,
|
|
"num_tokens": 17525300.0,
|
|
"step": 8515
|
|
},
|
|
{
|
|
"entropy": 5.521435499191284,
|
|
"epoch": 7.5601420328450954,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00012470178315115987,
|
|
"loss": 4.9059,
|
|
"mean_token_accuracy": 0.2221609577536583,
|
|
"num_tokens": 17536049.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 5.556616735458374,
|
|
"epoch": 7.564580559254328,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00012444561356925697,
|
|
"loss": 4.8785,
|
|
"mean_token_accuracy": 0.2231447160243988,
|
|
"num_tokens": 17546294.0,
|
|
"step": 8525
|
|
},
|
|
{
|
|
"entropy": 5.526573038101196,
|
|
"epoch": 7.56901908566356,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00012418979687654888,
|
|
"loss": 4.8849,
|
|
"mean_token_accuracy": 0.22129187732934952,
|
|
"num_tokens": 17557202.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 5.397485160827637,
|
|
"epoch": 7.573457612072792,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001239343336726526,
|
|
"loss": 4.7635,
|
|
"mean_token_accuracy": 0.24531075209379197,
|
|
"num_tokens": 17567982.0,
|
|
"step": 8535
|
|
},
|
|
{
|
|
"entropy": 5.574466753005981,
|
|
"epoch": 7.577896138482024,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00012367922455635644,
|
|
"loss": 4.8606,
|
|
"mean_token_accuracy": 0.22121091634035112,
|
|
"num_tokens": 17577911.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 5.516995859146118,
|
|
"epoch": 7.582334664891256,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00012342447012561863,
|
|
"loss": 4.8121,
|
|
"mean_token_accuracy": 0.2234480172395706,
|
|
"num_tokens": 17587867.0,
|
|
"step": 8545
|
|
},
|
|
{
|
|
"entropy": 5.499090909957886,
|
|
"epoch": 7.586773191300488,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00012317007097756627,
|
|
"loss": 4.8215,
|
|
"mean_token_accuracy": 0.22983253747224808,
|
|
"num_tokens": 17597665.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 5.423785448074341,
|
|
"epoch": 7.5912117177097205,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00012291602770849353,
|
|
"loss": 4.7192,
|
|
"mean_token_accuracy": 0.24927148073911667,
|
|
"num_tokens": 17608081.0,
|
|
"step": 8555
|
|
},
|
|
{
|
|
"entropy": 5.571401596069336,
|
|
"epoch": 7.595650244118953,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001226623409138604,
|
|
"loss": 4.8507,
|
|
"mean_token_accuracy": 0.2312807634472847,
|
|
"num_tokens": 17620146.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 5.6068775177001955,
|
|
"epoch": 7.600088770528185,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001224090111882916,
|
|
"loss": 4.8674,
|
|
"mean_token_accuracy": 0.22157650142908097,
|
|
"num_tokens": 17630535.0,
|
|
"step": 8565
|
|
},
|
|
{
|
|
"entropy": 5.593964052200318,
|
|
"epoch": 7.604527296937417,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00012215603912557447,
|
|
"loss": 4.9289,
|
|
"mean_token_accuracy": 0.2195365846157074,
|
|
"num_tokens": 17641278.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 5.480939292907715,
|
|
"epoch": 7.608965823346649,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00012190342531865837,
|
|
"loss": 4.7968,
|
|
"mean_token_accuracy": 0.22860725224018097,
|
|
"num_tokens": 17652730.0,
|
|
"step": 8575
|
|
},
|
|
{
|
|
"entropy": 5.52091498374939,
|
|
"epoch": 7.613404349755881,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001216511703596528,
|
|
"loss": 4.7502,
|
|
"mean_token_accuracy": 0.23379470109939576,
|
|
"num_tokens": 17661978.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 5.529548311233521,
|
|
"epoch": 7.617842876165113,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00012139927483982601,
|
|
"loss": 4.8188,
|
|
"mean_token_accuracy": 0.22166130244731902,
|
|
"num_tokens": 17672394.0,
|
|
"step": 8585
|
|
},
|
|
{
|
|
"entropy": 5.4765965938568115,
|
|
"epoch": 7.6222814025743455,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00012114773934960408,
|
|
"loss": 4.8486,
|
|
"mean_token_accuracy": 0.22920041382312775,
|
|
"num_tokens": 17682828.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 5.516771125793457,
|
|
"epoch": 7.626719928983578,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00012089656447856892,
|
|
"loss": 4.8548,
|
|
"mean_token_accuracy": 0.22131503969430924,
|
|
"num_tokens": 17692547.0,
|
|
"step": 8595
|
|
},
|
|
{
|
|
"entropy": 5.559178876876831,
|
|
"epoch": 7.63115845539281,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0001206457508154572,
|
|
"loss": 4.8654,
|
|
"mean_token_accuracy": 0.21908055394887924,
|
|
"num_tokens": 17702179.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 5.521388721466065,
|
|
"epoch": 7.635596981802042,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00012039529894815924,
|
|
"loss": 4.8163,
|
|
"mean_token_accuracy": 0.2325139284133911,
|
|
"num_tokens": 17711674.0,
|
|
"step": 8605
|
|
},
|
|
{
|
|
"entropy": 5.52794189453125,
|
|
"epoch": 7.640035508211274,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00012014520946371675,
|
|
"loss": 4.7865,
|
|
"mean_token_accuracy": 0.23072536289691925,
|
|
"num_tokens": 17721954.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 5.57104344367981,
|
|
"epoch": 7.644474034620506,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001198954829483227,
|
|
"loss": 4.917,
|
|
"mean_token_accuracy": 0.2173857718706131,
|
|
"num_tokens": 17733187.0,
|
|
"step": 8615
|
|
},
|
|
{
|
|
"entropy": 5.538820886611939,
|
|
"epoch": 7.648912561029738,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0001196461199873189,
|
|
"loss": 4.8293,
|
|
"mean_token_accuracy": 0.2199716806411743,
|
|
"num_tokens": 17743167.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 5.543489694595337,
|
|
"epoch": 7.6533510874389705,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00011939712116519494,
|
|
"loss": 4.7988,
|
|
"mean_token_accuracy": 0.22360094785690307,
|
|
"num_tokens": 17754232.0,
|
|
"step": 8625
|
|
},
|
|
{
|
|
"entropy": 5.5572075843811035,
|
|
"epoch": 7.657789613848203,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00011914848706558726,
|
|
"loss": 4.9074,
|
|
"mean_token_accuracy": 0.21729654520750047,
|
|
"num_tokens": 17764223.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 5.486240816116333,
|
|
"epoch": 7.662228140257435,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0001189002182712771,
|
|
"loss": 4.7927,
|
|
"mean_token_accuracy": 0.23020248115062714,
|
|
"num_tokens": 17773957.0,
|
|
"step": 8635
|
|
},
|
|
{
|
|
"entropy": 5.541817760467529,
|
|
"epoch": 7.666666666666667,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00011865231536418948,
|
|
"loss": 4.8065,
|
|
"mean_token_accuracy": 0.2260996639728546,
|
|
"num_tokens": 17783016.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 5.51589412689209,
|
|
"epoch": 7.671105193075899,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0001184047789253921,
|
|
"loss": 4.8263,
|
|
"mean_token_accuracy": 0.23161399960517884,
|
|
"num_tokens": 17794189.0,
|
|
"step": 8645
|
|
},
|
|
{
|
|
"entropy": 5.577518892288208,
|
|
"epoch": 7.675543719485131,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001181576095350932,
|
|
"loss": 4.9603,
|
|
"mean_token_accuracy": 0.21940330564975738,
|
|
"num_tokens": 17804915.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 5.523958826065064,
|
|
"epoch": 7.679982245894363,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00011791080777264111,
|
|
"loss": 4.885,
|
|
"mean_token_accuracy": 0.22324447333812714,
|
|
"num_tokens": 17815324.0,
|
|
"step": 8655
|
|
},
|
|
{
|
|
"entropy": 5.4906425952911375,
|
|
"epoch": 7.6844207723035955,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00011766437421652223,
|
|
"loss": 4.8136,
|
|
"mean_token_accuracy": 0.22610076516866684,
|
|
"num_tokens": 17826276.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 5.53193850517273,
|
|
"epoch": 7.688859298712828,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00011741830944435994,
|
|
"loss": 4.8479,
|
|
"mean_token_accuracy": 0.22147312611341477,
|
|
"num_tokens": 17836162.0,
|
|
"step": 8665
|
|
},
|
|
{
|
|
"entropy": 5.574075746536255,
|
|
"epoch": 7.69329782512206,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00011717261403291336,
|
|
"loss": 4.8155,
|
|
"mean_token_accuracy": 0.2189062386751175,
|
|
"num_tokens": 17846380.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 5.546022748947143,
|
|
"epoch": 7.697736351531292,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001169272885580757,
|
|
"loss": 4.8734,
|
|
"mean_token_accuracy": 0.219287970662117,
|
|
"num_tokens": 17857073.0,
|
|
"step": 8675
|
|
},
|
|
{
|
|
"entropy": 5.472138261795044,
|
|
"epoch": 7.702174877940524,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00011668233359487303,
|
|
"loss": 4.7321,
|
|
"mean_token_accuracy": 0.23839522898197174,
|
|
"num_tokens": 17867576.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 5.519084024429321,
|
|
"epoch": 7.706613404349756,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00011643774971746326,
|
|
"loss": 4.8842,
|
|
"mean_token_accuracy": 0.22231787592172622,
|
|
"num_tokens": 17878319.0,
|
|
"step": 8685
|
|
},
|
|
{
|
|
"entropy": 5.493455314636231,
|
|
"epoch": 7.7110519307589875,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00011619353749913403,
|
|
"loss": 4.8044,
|
|
"mean_token_accuracy": 0.23032058477401735,
|
|
"num_tokens": 17889786.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 5.509057235717774,
|
|
"epoch": 7.715490457168221,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00011594969751230224,
|
|
"loss": 4.7935,
|
|
"mean_token_accuracy": 0.22978353202342988,
|
|
"num_tokens": 17900932.0,
|
|
"step": 8695
|
|
},
|
|
{
|
|
"entropy": 5.508798217773437,
|
|
"epoch": 7.719928983577452,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00011570623032851214,
|
|
"loss": 4.823,
|
|
"mean_token_accuracy": 0.2255034938454628,
|
|
"num_tokens": 17910985.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 5.569445276260376,
|
|
"epoch": 7.724367509986685,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00011546313651843412,
|
|
"loss": 4.9551,
|
|
"mean_token_accuracy": 0.210782253742218,
|
|
"num_tokens": 17922923.0,
|
|
"step": 8705
|
|
},
|
|
{
|
|
"entropy": 5.508803415298462,
|
|
"epoch": 7.728806036395916,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00011522041665186356,
|
|
"loss": 4.8163,
|
|
"mean_token_accuracy": 0.22762422859668732,
|
|
"num_tokens": 17933619.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 5.536534404754638,
|
|
"epoch": 7.733244562805149,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00011497807129771916,
|
|
"loss": 4.8449,
|
|
"mean_token_accuracy": 0.23125416934490203,
|
|
"num_tokens": 17944584.0,
|
|
"step": 8715
|
|
},
|
|
{
|
|
"entropy": 5.4448188781738285,
|
|
"epoch": 7.73768308921438,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00011473610102404184,
|
|
"loss": 4.7655,
|
|
"mean_token_accuracy": 0.23355314880609512,
|
|
"num_tokens": 17955076.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 5.4814516544342045,
|
|
"epoch": 7.7421216156236135,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001144945063979936,
|
|
"loss": 4.8358,
|
|
"mean_token_accuracy": 0.22968773245811464,
|
|
"num_tokens": 17964527.0,
|
|
"step": 8725
|
|
},
|
|
{
|
|
"entropy": 5.515767621994018,
|
|
"epoch": 7.746560142032845,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00011425328798585544,
|
|
"loss": 4.861,
|
|
"mean_token_accuracy": 0.2284746989607811,
|
|
"num_tokens": 17974279.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 5.566736650466919,
|
|
"epoch": 7.750998668442077,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00011401244635302704,
|
|
"loss": 4.7477,
|
|
"mean_token_accuracy": 0.22742162942886351,
|
|
"num_tokens": 17985039.0,
|
|
"step": 8735
|
|
},
|
|
{
|
|
"entropy": 5.478198289871216,
|
|
"epoch": 7.755437194851309,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001137719820640247,
|
|
"loss": 4.8392,
|
|
"mean_token_accuracy": 0.22531141787767411,
|
|
"num_tokens": 17995554.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 5.438498878479004,
|
|
"epoch": 7.759875721260541,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00011353189568248015,
|
|
"loss": 4.7265,
|
|
"mean_token_accuracy": 0.2402109295129776,
|
|
"num_tokens": 18005321.0,
|
|
"step": 8745
|
|
},
|
|
{
|
|
"entropy": 5.51060266494751,
|
|
"epoch": 7.764314247669773,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00011329218777113965,
|
|
"loss": 4.7904,
|
|
"mean_token_accuracy": 0.2305187091231346,
|
|
"num_tokens": 18016008.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 5.573731374740601,
|
|
"epoch": 7.768752774079005,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00011305285889186207,
|
|
"loss": 4.8491,
|
|
"mean_token_accuracy": 0.23133554607629775,
|
|
"num_tokens": 18026433.0,
|
|
"step": 8755
|
|
},
|
|
{
|
|
"entropy": 5.557860231399536,
|
|
"epoch": 7.773191300488238,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00011281390960561791,
|
|
"loss": 4.8496,
|
|
"mean_token_accuracy": 0.21802178770303726,
|
|
"num_tokens": 18037533.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 5.518392133712768,
|
|
"epoch": 7.77762982689747,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00011257534047248816,
|
|
"loss": 4.7693,
|
|
"mean_token_accuracy": 0.23333774507045746,
|
|
"num_tokens": 18046564.0,
|
|
"step": 8765
|
|
},
|
|
{
|
|
"entropy": 5.5076854705810545,
|
|
"epoch": 7.782068353306702,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00011233715205166231,
|
|
"loss": 4.8813,
|
|
"mean_token_accuracy": 0.2230132520198822,
|
|
"num_tokens": 18057515.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 5.508595275878906,
|
|
"epoch": 7.786506879715934,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001120993449014379,
|
|
"loss": 4.7852,
|
|
"mean_token_accuracy": 0.23008816242218016,
|
|
"num_tokens": 18065990.0,
|
|
"step": 8775
|
|
},
|
|
{
|
|
"entropy": 5.53666615486145,
|
|
"epoch": 7.790945406125166,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00011186191957921862,
|
|
"loss": 4.8407,
|
|
"mean_token_accuracy": 0.22502628117799758,
|
|
"num_tokens": 18076594.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 5.4848020553588865,
|
|
"epoch": 7.795383932534398,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00011162487664151313,
|
|
"loss": 4.7834,
|
|
"mean_token_accuracy": 0.23348850309848784,
|
|
"num_tokens": 18086456.0,
|
|
"step": 8785
|
|
},
|
|
{
|
|
"entropy": 5.550656795501709,
|
|
"epoch": 7.7998224589436305,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000111388216643934,
|
|
"loss": 4.8798,
|
|
"mean_token_accuracy": 0.21799631267786027,
|
|
"num_tokens": 18096189.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 5.548898601531983,
|
|
"epoch": 7.804260985352863,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00011115194014119606,
|
|
"loss": 4.8994,
|
|
"mean_token_accuracy": 0.22215149700641632,
|
|
"num_tokens": 18107146.0,
|
|
"step": 8795
|
|
},
|
|
{
|
|
"entropy": 5.539883613586426,
|
|
"epoch": 7.808699511762095,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00011091604768711517,
|
|
"loss": 4.7639,
|
|
"mean_token_accuracy": 0.2320783630013466,
|
|
"num_tokens": 18116380.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 5.547922658920288,
|
|
"epoch": 7.813138038171327,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00011068053983460736,
|
|
"loss": 4.8312,
|
|
"mean_token_accuracy": 0.22256851494312285,
|
|
"num_tokens": 18126218.0,
|
|
"step": 8805
|
|
},
|
|
{
|
|
"entropy": 5.560447788238525,
|
|
"epoch": 7.817576564580559,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00011044541713568665,
|
|
"loss": 4.853,
|
|
"mean_token_accuracy": 0.22795532047748565,
|
|
"num_tokens": 18136315.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 5.522366237640381,
|
|
"epoch": 7.822015090989791,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00011021068014146483,
|
|
"loss": 4.8595,
|
|
"mean_token_accuracy": 0.22368412613868713,
|
|
"num_tokens": 18145921.0,
|
|
"step": 8815
|
|
},
|
|
{
|
|
"entropy": 5.51537561416626,
|
|
"epoch": 7.826453617399023,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00010997632940214924,
|
|
"loss": 4.8527,
|
|
"mean_token_accuracy": 0.22324531078338622,
|
|
"num_tokens": 18156781.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 5.508488368988037,
|
|
"epoch": 7.8308921438082555,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000109742365467042,
|
|
"loss": 4.8381,
|
|
"mean_token_accuracy": 0.2276904597878456,
|
|
"num_tokens": 18167053.0,
|
|
"step": 8825
|
|
},
|
|
{
|
|
"entropy": 5.529995727539062,
|
|
"epoch": 7.835330670217488,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010950878888453872,
|
|
"loss": 4.8813,
|
|
"mean_token_accuracy": 0.2198058247566223,
|
|
"num_tokens": 18177289.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 5.535861492156982,
|
|
"epoch": 7.83976919662672,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00010927560020212682,
|
|
"loss": 4.7965,
|
|
"mean_token_accuracy": 0.2283168613910675,
|
|
"num_tokens": 18186698.0,
|
|
"step": 8835
|
|
},
|
|
{
|
|
"entropy": 5.514022874832153,
|
|
"epoch": 7.844207723035952,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001090427999663846,
|
|
"loss": 4.8243,
|
|
"mean_token_accuracy": 0.22577032595872878,
|
|
"num_tokens": 18197158.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 5.557280969619751,
|
|
"epoch": 7.848646249445184,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00010881038872298014,
|
|
"loss": 4.8997,
|
|
"mean_token_accuracy": 0.21947368532419204,
|
|
"num_tokens": 18206429.0,
|
|
"step": 8845
|
|
},
|
|
{
|
|
"entropy": 5.518510532379151,
|
|
"epoch": 7.853084775854416,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00010857836701666923,
|
|
"loss": 4.818,
|
|
"mean_token_accuracy": 0.22450481504201888,
|
|
"num_tokens": 18216526.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 5.541376113891602,
|
|
"epoch": 7.857523302263648,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00010834673539129506,
|
|
"loss": 4.873,
|
|
"mean_token_accuracy": 0.22380498498678209,
|
|
"num_tokens": 18227340.0,
|
|
"step": 8855
|
|
},
|
|
{
|
|
"entropy": 5.477765798568726,
|
|
"epoch": 7.8619618286728805,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00010811549438978633,
|
|
"loss": 4.7912,
|
|
"mean_token_accuracy": 0.22984451651573182,
|
|
"num_tokens": 18238425.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 5.534372854232788,
|
|
"epoch": 7.866400355082113,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00010788464455415602,
|
|
"loss": 4.7665,
|
|
"mean_token_accuracy": 0.2335157424211502,
|
|
"num_tokens": 18249050.0,
|
|
"step": 8865
|
|
},
|
|
{
|
|
"entropy": 5.523896837234497,
|
|
"epoch": 7.870838881491345,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00010765418642550053,
|
|
"loss": 4.8546,
|
|
"mean_token_accuracy": 0.22614182233810426,
|
|
"num_tokens": 18259952.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 5.529813385009765,
|
|
"epoch": 7.875277407900577,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00010742412054399791,
|
|
"loss": 4.8082,
|
|
"mean_token_accuracy": 0.22530926913022994,
|
|
"num_tokens": 18270256.0,
|
|
"step": 8875
|
|
},
|
|
{
|
|
"entropy": 5.476798486709595,
|
|
"epoch": 7.879715934309809,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010719444744890683,
|
|
"loss": 4.7686,
|
|
"mean_token_accuracy": 0.2383452147245407,
|
|
"num_tokens": 18280755.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 5.552324438095093,
|
|
"epoch": 7.884154460719041,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00010696516767856545,
|
|
"loss": 4.8974,
|
|
"mean_token_accuracy": 0.22011606991291047,
|
|
"num_tokens": 18292206.0,
|
|
"step": 8885
|
|
},
|
|
{
|
|
"entropy": 5.551198244094849,
|
|
"epoch": 7.888592987128273,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00010673628177038966,
|
|
"loss": 4.9158,
|
|
"mean_token_accuracy": 0.2141529440879822,
|
|
"num_tokens": 18302808.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 5.518300342559814,
|
|
"epoch": 7.8930315135375055,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00010650779026087263,
|
|
"loss": 4.8937,
|
|
"mean_token_accuracy": 0.2223954975605011,
|
|
"num_tokens": 18313469.0,
|
|
"step": 8895
|
|
},
|
|
{
|
|
"entropy": 5.60967698097229,
|
|
"epoch": 7.897470039946738,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001062796936855827,
|
|
"loss": 4.8828,
|
|
"mean_token_accuracy": 0.22586873024702073,
|
|
"num_tokens": 18324204.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 5.561729812622071,
|
|
"epoch": 7.90190856635597,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00010605199257916269,
|
|
"loss": 4.9032,
|
|
"mean_token_accuracy": 0.21938958913087844,
|
|
"num_tokens": 18334968.0,
|
|
"step": 8905
|
|
},
|
|
{
|
|
"entropy": 5.5323351383209225,
|
|
"epoch": 7.906347092765202,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00010582468747532848,
|
|
"loss": 4.8645,
|
|
"mean_token_accuracy": 0.22808050960302353,
|
|
"num_tokens": 18345983.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 5.492877388000489,
|
|
"epoch": 7.910785619174434,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00010559777890686766,
|
|
"loss": 4.8252,
|
|
"mean_token_accuracy": 0.23101968914270402,
|
|
"num_tokens": 18357001.0,
|
|
"step": 8915
|
|
},
|
|
{
|
|
"entropy": 5.565626430511474,
|
|
"epoch": 7.915224145583666,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00010537126740563838,
|
|
"loss": 4.8906,
|
|
"mean_token_accuracy": 0.21490684449672698,
|
|
"num_tokens": 18367033.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 5.526720380783081,
|
|
"epoch": 7.919662671992898,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00010514515350256825,
|
|
"loss": 4.8748,
|
|
"mean_token_accuracy": 0.22452143728733062,
|
|
"num_tokens": 18376060.0,
|
|
"step": 8925
|
|
},
|
|
{
|
|
"entropy": 5.5491547107696535,
|
|
"epoch": 7.924101198402131,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00010491943772765264,
|
|
"loss": 4.905,
|
|
"mean_token_accuracy": 0.21478988975286484,
|
|
"num_tokens": 18385937.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 5.57955412864685,
|
|
"epoch": 7.928539724811363,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010469412060995404,
|
|
"loss": 4.8638,
|
|
"mean_token_accuracy": 0.22902661859989165,
|
|
"num_tokens": 18396180.0,
|
|
"step": 8935
|
|
},
|
|
{
|
|
"entropy": 5.606887865066528,
|
|
"epoch": 7.932978251220595,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00010446920267760028,
|
|
"loss": 4.8425,
|
|
"mean_token_accuracy": 0.22685208171606064,
|
|
"num_tokens": 18405430.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 5.463298749923706,
|
|
"epoch": 7.937416777629827,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00010424468445778365,
|
|
"loss": 4.7842,
|
|
"mean_token_accuracy": 0.22720548659563064,
|
|
"num_tokens": 18415755.0,
|
|
"step": 8945
|
|
},
|
|
{
|
|
"entropy": 5.5281373977661135,
|
|
"epoch": 7.941855304039059,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010402056647675958,
|
|
"loss": 4.8737,
|
|
"mean_token_accuracy": 0.21984899044036865,
|
|
"num_tokens": 18426825.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 5.554888391494751,
|
|
"epoch": 7.946293830448291,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00010379684925984525,
|
|
"loss": 4.8583,
|
|
"mean_token_accuracy": 0.21590252667665483,
|
|
"num_tokens": 18436772.0,
|
|
"step": 8955
|
|
},
|
|
{
|
|
"entropy": 5.5233241558074955,
|
|
"epoch": 7.950732356857523,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0001035735333314185,
|
|
"loss": 4.7888,
|
|
"mean_token_accuracy": 0.22861692309379578,
|
|
"num_tokens": 18446777.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 5.577347278594971,
|
|
"epoch": 7.955170883266756,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00010335061921491679,
|
|
"loss": 4.8494,
|
|
"mean_token_accuracy": 0.2308831110596657,
|
|
"num_tokens": 18457054.0,
|
|
"step": 8965
|
|
},
|
|
{
|
|
"entropy": 5.606191968917846,
|
|
"epoch": 7.959609409675988,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0001031281074328353,
|
|
"loss": 4.9527,
|
|
"mean_token_accuracy": 0.20974261313676834,
|
|
"num_tokens": 18467639.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 5.545734691619873,
|
|
"epoch": 7.96404793608522,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0001029059985067266,
|
|
"loss": 4.8322,
|
|
"mean_token_accuracy": 0.22921389043331147,
|
|
"num_tokens": 18477395.0,
|
|
"step": 8975
|
|
},
|
|
{
|
|
"entropy": 5.516326284408569,
|
|
"epoch": 7.968486462494452,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00010268429295719886,
|
|
"loss": 4.7758,
|
|
"mean_token_accuracy": 0.22973539680242538,
|
|
"num_tokens": 18487533.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 5.535935544967652,
|
|
"epoch": 7.972924988903684,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00010246299130391462,
|
|
"loss": 4.8485,
|
|
"mean_token_accuracy": 0.22032086104154586,
|
|
"num_tokens": 18498167.0,
|
|
"step": 8985
|
|
},
|
|
{
|
|
"entropy": 5.557373666763306,
|
|
"epoch": 7.977363515312916,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010224209406558997,
|
|
"loss": 4.8657,
|
|
"mean_token_accuracy": 0.22085580825805665,
|
|
"num_tokens": 18508695.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 5.482311677932739,
|
|
"epoch": 7.9818020417221485,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00010202160175999293,
|
|
"loss": 4.7819,
|
|
"mean_token_accuracy": 0.2350700467824936,
|
|
"num_tokens": 18518130.0,
|
|
"step": 8995
|
|
},
|
|
{
|
|
"entropy": 5.541825962066651,
|
|
"epoch": 7.986240568131381,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00010180151490394221,
|
|
"loss": 4.8632,
|
|
"mean_token_accuracy": 0.21929781436920165,
|
|
"num_tokens": 18528551.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 7.986240568131381,
|
|
"eval_entropy": 5.428067480300214,
|
|
"eval_loss": 5.8507981300354,
|
|
"eval_mean_token_accuracy": 0.17412096424793688,
|
|
"eval_num_tokens": 18528551.0,
|
|
"eval_runtime": 2.6827,
|
|
"eval_samples_per_second": 1255.072,
|
|
"eval_steps_per_second": 156.931,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 5.5274420261383055,
|
|
"epoch": 7.990679094540613,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00010158183401330669,
|
|
"loss": 4.8132,
|
|
"mean_token_accuracy": 0.22902776151895524,
|
|
"num_tokens": 18538058.0,
|
|
"step": 9005
|
|
},
|
|
{
|
|
"entropy": 5.540129089355469,
|
|
"epoch": 7.995117620949845,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00010136255960300304,
|
|
"loss": 4.835,
|
|
"mean_token_accuracy": 0.23212106823921203,
|
|
"num_tokens": 18548361.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 5.576272487640381,
|
|
"epoch": 7.999556147359077,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00010114369218699571,
|
|
"loss": 4.8688,
|
|
"mean_token_accuracy": 0.23091581612825393,
|
|
"num_tokens": 18557201.0,
|
|
"step": 9015
|
|
},
|
|
{
|
|
"entropy": 5.564248720804851,
|
|
"epoch": 8.003550821127385,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00010092523227829492,
|
|
"loss": 4.7607,
|
|
"mean_token_accuracy": 0.231922490729226,
|
|
"num_tokens": 18565334.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 5.524493646621704,
|
|
"epoch": 8.007989347536618,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00010070718038895565,
|
|
"loss": 4.7093,
|
|
"mean_token_accuracy": 0.23903445154428482,
|
|
"num_tokens": 18575053.0,
|
|
"step": 9025
|
|
},
|
|
{
|
|
"entropy": 5.536652374267578,
|
|
"epoch": 8.01242787394585,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001004895370300768,
|
|
"loss": 4.7929,
|
|
"mean_token_accuracy": 0.22713127732276917,
|
|
"num_tokens": 18585712.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 5.528022623062133,
|
|
"epoch": 8.016866400355083,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00010027230271179947,
|
|
"loss": 4.7239,
|
|
"mean_token_accuracy": 0.23597533106803895,
|
|
"num_tokens": 18595891.0,
|
|
"step": 9035
|
|
},
|
|
{
|
|
"entropy": 5.550457382202149,
|
|
"epoch": 8.021304926764314,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00010005547794330596,
|
|
"loss": 4.8266,
|
|
"mean_token_accuracy": 0.23265185505151748,
|
|
"num_tokens": 18606840.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 5.53079514503479,
|
|
"epoch": 8.025743453173547,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 9.983906323281896e-05,
|
|
"loss": 4.6892,
|
|
"mean_token_accuracy": 0.23528325855731963,
|
|
"num_tokens": 18616471.0,
|
|
"step": 9045
|
|
},
|
|
{
|
|
"entropy": 5.461957025527954,
|
|
"epoch": 8.030181979582778,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 9.962305908759947e-05,
|
|
"loss": 4.6661,
|
|
"mean_token_accuracy": 0.2398424983024597,
|
|
"num_tokens": 18627043.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 5.605092000961304,
|
|
"epoch": 8.034620505992011,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 9.940746601394665e-05,
|
|
"loss": 4.9146,
|
|
"mean_token_accuracy": 0.2153011977672577,
|
|
"num_tokens": 18637513.0,
|
|
"step": 9055
|
|
},
|
|
{
|
|
"entropy": 5.540894269943237,
|
|
"epoch": 8.039059032401243,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 9.919228451719586e-05,
|
|
"loss": 4.7133,
|
|
"mean_token_accuracy": 0.24061339199543,
|
|
"num_tokens": 18648212.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 5.555710220336914,
|
|
"epoch": 8.043497558810476,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 9.897751510171777e-05,
|
|
"loss": 4.8077,
|
|
"mean_token_accuracy": 0.23113755881786346,
|
|
"num_tokens": 18658671.0,
|
|
"step": 9065
|
|
},
|
|
{
|
|
"entropy": 5.537944650650024,
|
|
"epoch": 8.047936085219707,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 9.876315827091733e-05,
|
|
"loss": 4.7569,
|
|
"mean_token_accuracy": 0.22958007603883743,
|
|
"num_tokens": 18668049.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 5.512982559204102,
|
|
"epoch": 8.05237461162894,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 9.854921452723229e-05,
|
|
"loss": 4.7163,
|
|
"mean_token_accuracy": 0.2393386796116829,
|
|
"num_tokens": 18678396.0,
|
|
"step": 9075
|
|
},
|
|
{
|
|
"entropy": 5.541017627716064,
|
|
"epoch": 8.056813138038171,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 9.833568437213206e-05,
|
|
"loss": 4.7883,
|
|
"mean_token_accuracy": 0.23481515645980836,
|
|
"num_tokens": 18687959.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 5.5000848293304445,
|
|
"epoch": 8.061251664447404,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 9.812256830611691e-05,
|
|
"loss": 4.766,
|
|
"mean_token_accuracy": 0.23509853035211564,
|
|
"num_tokens": 18697741.0,
|
|
"step": 9085
|
|
},
|
|
{
|
|
"entropy": 5.513149356842041,
|
|
"epoch": 8.065690190856635,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.790986682871612e-05,
|
|
"loss": 4.7547,
|
|
"mean_token_accuracy": 0.23307934552431106,
|
|
"num_tokens": 18708758.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 5.486678743362427,
|
|
"epoch": 8.070128717265868,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 9.76975804384876e-05,
|
|
"loss": 4.6917,
|
|
"mean_token_accuracy": 0.238458089530468,
|
|
"num_tokens": 18719236.0,
|
|
"step": 9095
|
|
},
|
|
{
|
|
"entropy": 5.547485828399658,
|
|
"epoch": 8.0745672436751,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 9.748570963301607e-05,
|
|
"loss": 4.7913,
|
|
"mean_token_accuracy": 0.22847978621721268,
|
|
"num_tokens": 18729467.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 5.493706703186035,
|
|
"epoch": 8.079005770084333,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 9.727425490891217e-05,
|
|
"loss": 4.7527,
|
|
"mean_token_accuracy": 0.232248055934906,
|
|
"num_tokens": 18741053.0,
|
|
"step": 9105
|
|
},
|
|
{
|
|
"entropy": 5.553925800323486,
|
|
"epoch": 8.083444296493564,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 9.706321676181142e-05,
|
|
"loss": 4.7869,
|
|
"mean_token_accuracy": 0.23709060847759247,
|
|
"num_tokens": 18750376.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 5.5531352996826175,
|
|
"epoch": 8.087882822902797,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 9.685259568637279e-05,
|
|
"loss": 4.8179,
|
|
"mean_token_accuracy": 0.2207489252090454,
|
|
"num_tokens": 18761050.0,
|
|
"step": 9115
|
|
},
|
|
{
|
|
"entropy": 5.4737001895904545,
|
|
"epoch": 8.092321349312028,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 9.664239217627765e-05,
|
|
"loss": 4.7197,
|
|
"mean_token_accuracy": 0.24053823798894883,
|
|
"num_tokens": 18772178.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 5.501503610610962,
|
|
"epoch": 8.096759875721261,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 9.643260672422879e-05,
|
|
"loss": 4.7313,
|
|
"mean_token_accuracy": 0.23011073470115662,
|
|
"num_tokens": 18782398.0,
|
|
"step": 9125
|
|
},
|
|
{
|
|
"entropy": 5.522367906570435,
|
|
"epoch": 8.101198402130493,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 9.622323982194876e-05,
|
|
"loss": 4.7502,
|
|
"mean_token_accuracy": 0.23586821258068086,
|
|
"num_tokens": 18792045.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 5.502495861053466,
|
|
"epoch": 8.105636928539726,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 9.601429196017945e-05,
|
|
"loss": 4.7392,
|
|
"mean_token_accuracy": 0.23209448754787446,
|
|
"num_tokens": 18802760.0,
|
|
"step": 9135
|
|
},
|
|
{
|
|
"entropy": 5.515348339080811,
|
|
"epoch": 8.110075454948957,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 9.580576362868034e-05,
|
|
"loss": 4.7889,
|
|
"mean_token_accuracy": 0.22821114808321,
|
|
"num_tokens": 18812564.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 5.471339702606201,
|
|
"epoch": 8.11451398135819,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 9.55976553162275e-05,
|
|
"loss": 4.7278,
|
|
"mean_token_accuracy": 0.2415887787938118,
|
|
"num_tokens": 18822940.0,
|
|
"step": 9145
|
|
},
|
|
{
|
|
"entropy": 5.469609165191651,
|
|
"epoch": 8.118952507767421,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 9.53899675106127e-05,
|
|
"loss": 4.7134,
|
|
"mean_token_accuracy": 0.23635677099227906,
|
|
"num_tokens": 18832439.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 5.536976718902588,
|
|
"epoch": 8.123391034176654,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 9.518270069864194e-05,
|
|
"loss": 4.7472,
|
|
"mean_token_accuracy": 0.2314641371369362,
|
|
"num_tokens": 18842314.0,
|
|
"step": 9155
|
|
},
|
|
{
|
|
"entropy": 5.567486381530761,
|
|
"epoch": 8.127829560585885,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 9.49758553661344e-05,
|
|
"loss": 4.8109,
|
|
"mean_token_accuracy": 0.22504182010889054,
|
|
"num_tokens": 18853143.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 5.530188417434692,
|
|
"epoch": 8.132268086995118,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 9.476943199792159e-05,
|
|
"loss": 4.7625,
|
|
"mean_token_accuracy": 0.22873036563396454,
|
|
"num_tokens": 18864236.0,
|
|
"step": 9165
|
|
},
|
|
{
|
|
"entropy": 5.502843189239502,
|
|
"epoch": 8.13670661340435,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 9.456343107784552e-05,
|
|
"loss": 4.8246,
|
|
"mean_token_accuracy": 0.2276325687766075,
|
|
"num_tokens": 18875011.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 5.536035537719727,
|
|
"epoch": 8.141145139813581,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 9.435785308875847e-05,
|
|
"loss": 4.7437,
|
|
"mean_token_accuracy": 0.23043781220912934,
|
|
"num_tokens": 18885038.0,
|
|
"step": 9175
|
|
},
|
|
{
|
|
"entropy": 5.567473936080932,
|
|
"epoch": 8.145583666222814,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 9.415269851252112e-05,
|
|
"loss": 4.8357,
|
|
"mean_token_accuracy": 0.2290906250476837,
|
|
"num_tokens": 18896009.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 5.5274864673614506,
|
|
"epoch": 8.150022192632045,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 9.394796783000173e-05,
|
|
"loss": 4.7463,
|
|
"mean_token_accuracy": 0.24023734480142594,
|
|
"num_tokens": 18904690.0,
|
|
"step": 9185
|
|
},
|
|
{
|
|
"entropy": 5.574559354782105,
|
|
"epoch": 8.154460719041278,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 9.374366152107516e-05,
|
|
"loss": 4.8825,
|
|
"mean_token_accuracy": 0.22338451892137529,
|
|
"num_tokens": 18916647.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 5.544428396224975,
|
|
"epoch": 8.15889924545051,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 9.353978006462135e-05,
|
|
"loss": 4.7523,
|
|
"mean_token_accuracy": 0.2375463977456093,
|
|
"num_tokens": 18926387.0,
|
|
"step": 9195
|
|
},
|
|
{
|
|
"entropy": 5.496169567108154,
|
|
"epoch": 8.163337771859743,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 9.333632393852449e-05,
|
|
"loss": 4.7432,
|
|
"mean_token_accuracy": 0.2356122463941574,
|
|
"num_tokens": 18935929.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 5.521384048461914,
|
|
"epoch": 8.167776298268974,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 9.313329361967198e-05,
|
|
"loss": 4.8205,
|
|
"mean_token_accuracy": 0.22696655988693237,
|
|
"num_tokens": 18945875.0,
|
|
"step": 9205
|
|
},
|
|
{
|
|
"entropy": 5.544740152359009,
|
|
"epoch": 8.172214824678207,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 9.293068958395281e-05,
|
|
"loss": 4.7976,
|
|
"mean_token_accuracy": 0.22982836663722991,
|
|
"num_tokens": 18955915.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 5.493546676635742,
|
|
"epoch": 8.176653351087438,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 9.272851230625715e-05,
|
|
"loss": 4.7093,
|
|
"mean_token_accuracy": 0.23800816535949706,
|
|
"num_tokens": 18966396.0,
|
|
"step": 9215
|
|
},
|
|
{
|
|
"entropy": 5.513923835754395,
|
|
"epoch": 8.181091877496671,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 9.252676226047464e-05,
|
|
"loss": 4.7453,
|
|
"mean_token_accuracy": 0.2464535042643547,
|
|
"num_tokens": 18976144.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 5.5350417137146,
|
|
"epoch": 8.185530403905902,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 9.23254399194936e-05,
|
|
"loss": 4.7013,
|
|
"mean_token_accuracy": 0.2389968141913414,
|
|
"num_tokens": 18986626.0,
|
|
"step": 9225
|
|
},
|
|
{
|
|
"entropy": 5.4924163818359375,
|
|
"epoch": 8.189968930315136,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 9.212454575519992e-05,
|
|
"loss": 4.7527,
|
|
"mean_token_accuracy": 0.23163316994905472,
|
|
"num_tokens": 18996712.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 5.585897636413574,
|
|
"epoch": 8.194407456724367,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 9.192408023847573e-05,
|
|
"loss": 4.8572,
|
|
"mean_token_accuracy": 0.22339283376932145,
|
|
"num_tokens": 19007434.0,
|
|
"step": 9235
|
|
},
|
|
{
|
|
"entropy": 5.486374855041504,
|
|
"epoch": 8.1988459831336,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 9.17240438391985e-05,
|
|
"loss": 4.752,
|
|
"mean_token_accuracy": 0.23487935215234756,
|
|
"num_tokens": 19016963.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 5.516498470306397,
|
|
"epoch": 8.203284509542831,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 9.152443702623993e-05,
|
|
"loss": 4.7158,
|
|
"mean_token_accuracy": 0.24053029268980025,
|
|
"num_tokens": 19026881.0,
|
|
"step": 9245
|
|
},
|
|
{
|
|
"entropy": 5.505452632904053,
|
|
"epoch": 8.207723035952064,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 9.132526026746476e-05,
|
|
"loss": 4.7113,
|
|
"mean_token_accuracy": 0.23878167420625687,
|
|
"num_tokens": 19037185.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 5.5648938655853275,
|
|
"epoch": 8.212161562361295,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 9.112651402972962e-05,
|
|
"loss": 4.8562,
|
|
"mean_token_accuracy": 0.2236933633685112,
|
|
"num_tokens": 19049020.0,
|
|
"step": 9255
|
|
},
|
|
{
|
|
"entropy": 5.4700299263000485,
|
|
"epoch": 8.216600088770528,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 9.09281987788822e-05,
|
|
"loss": 4.7421,
|
|
"mean_token_accuracy": 0.23488860726356506,
|
|
"num_tokens": 19059776.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 5.5285501956939695,
|
|
"epoch": 8.22103861517976,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 9.073031497975981e-05,
|
|
"loss": 4.8095,
|
|
"mean_token_accuracy": 0.24489085674285888,
|
|
"num_tokens": 19069899.0,
|
|
"step": 9265
|
|
},
|
|
{
|
|
"entropy": 5.552821636199951,
|
|
"epoch": 8.225477141588993,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 9.053286309618861e-05,
|
|
"loss": 4.8003,
|
|
"mean_token_accuracy": 0.22677543014287949,
|
|
"num_tokens": 19080522.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 5.494792556762695,
|
|
"epoch": 8.229915667998224,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 9.033584359098234e-05,
|
|
"loss": 4.7388,
|
|
"mean_token_accuracy": 0.23966412246227264,
|
|
"num_tokens": 19089528.0,
|
|
"step": 9275
|
|
},
|
|
{
|
|
"entropy": 5.564038515090942,
|
|
"epoch": 8.234354194407457,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 9.013925692594121e-05,
|
|
"loss": 4.817,
|
|
"mean_token_accuracy": 0.22776744067668914,
|
|
"num_tokens": 19098949.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 5.5699258804321286,
|
|
"epoch": 8.238792720816688,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 8.994310356185098e-05,
|
|
"loss": 4.8391,
|
|
"mean_token_accuracy": 0.22998194694519042,
|
|
"num_tokens": 19109196.0,
|
|
"step": 9285
|
|
},
|
|
{
|
|
"entropy": 5.503975582122803,
|
|
"epoch": 8.243231247225921,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 8.974738395848171e-05,
|
|
"loss": 4.6596,
|
|
"mean_token_accuracy": 0.24253153353929519,
|
|
"num_tokens": 19119455.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 5.533790969848633,
|
|
"epoch": 8.247669773635153,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 8.955209857458679e-05,
|
|
"loss": 4.7831,
|
|
"mean_token_accuracy": 0.2344629153609276,
|
|
"num_tokens": 19129623.0,
|
|
"step": 9295
|
|
},
|
|
{
|
|
"entropy": 5.521896076202393,
|
|
"epoch": 8.252108300044386,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.935724786790181e-05,
|
|
"loss": 4.7681,
|
|
"mean_token_accuracy": 0.22446090430021287,
|
|
"num_tokens": 19140021.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 5.497184371948242,
|
|
"epoch": 8.256546826453617,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 8.916283229514342e-05,
|
|
"loss": 4.7647,
|
|
"mean_token_accuracy": 0.2294624149799347,
|
|
"num_tokens": 19150669.0,
|
|
"step": 9305
|
|
},
|
|
{
|
|
"entropy": 5.522274541854858,
|
|
"epoch": 8.26098535286285,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 8.89688523120086e-05,
|
|
"loss": 4.7993,
|
|
"mean_token_accuracy": 0.2291727066040039,
|
|
"num_tokens": 19162334.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 5.51942548751831,
|
|
"epoch": 8.265423879272081,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 8.87753083731731e-05,
|
|
"loss": 4.7681,
|
|
"mean_token_accuracy": 0.23500664681196212,
|
|
"num_tokens": 19171753.0,
|
|
"step": 9315
|
|
},
|
|
{
|
|
"entropy": 5.538489532470703,
|
|
"epoch": 8.269862405681314,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 8.858220093229062e-05,
|
|
"loss": 4.7856,
|
|
"mean_token_accuracy": 0.23224723488092422,
|
|
"num_tokens": 19181693.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 5.49764494895935,
|
|
"epoch": 8.274300932090545,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 8.838953044199196e-05,
|
|
"loss": 4.7371,
|
|
"mean_token_accuracy": 0.24010088741779329,
|
|
"num_tokens": 19192172.0,
|
|
"step": 9325
|
|
},
|
|
{
|
|
"entropy": 5.544925785064697,
|
|
"epoch": 8.278739458499778,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 8.819729735388348e-05,
|
|
"loss": 4.7859,
|
|
"mean_token_accuracy": 0.22752300649881363,
|
|
"num_tokens": 19202253.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 5.479160165786743,
|
|
"epoch": 8.28317798490901,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 8.800550211854643e-05,
|
|
"loss": 4.7005,
|
|
"mean_token_accuracy": 0.241083824634552,
|
|
"num_tokens": 19213043.0,
|
|
"step": 9335
|
|
},
|
|
{
|
|
"entropy": 5.504450702667237,
|
|
"epoch": 8.287616511318243,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 8.781414518553572e-05,
|
|
"loss": 4.7942,
|
|
"mean_token_accuracy": 0.23475057482719422,
|
|
"num_tokens": 19223220.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 5.501762104034424,
|
|
"epoch": 8.292055037727474,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 8.762322700337891e-05,
|
|
"loss": 4.7607,
|
|
"mean_token_accuracy": 0.23693139106035233,
|
|
"num_tokens": 19233881.0,
|
|
"step": 9345
|
|
},
|
|
{
|
|
"entropy": 5.559514665603638,
|
|
"epoch": 8.296493564136707,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 8.743274801957523e-05,
|
|
"loss": 4.8784,
|
|
"mean_token_accuracy": 0.21944281011819838,
|
|
"num_tokens": 19244407.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 5.4935173988342285,
|
|
"epoch": 8.300932090545938,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 8.724270868059442e-05,
|
|
"loss": 4.7489,
|
|
"mean_token_accuracy": 0.24032629430294036,
|
|
"num_tokens": 19254892.0,
|
|
"step": 9355
|
|
},
|
|
{
|
|
"entropy": 5.506518411636352,
|
|
"epoch": 8.305370616955171,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 8.705310943187556e-05,
|
|
"loss": 4.7619,
|
|
"mean_token_accuracy": 0.2328503906726837,
|
|
"num_tokens": 19265347.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 5.574012756347656,
|
|
"epoch": 8.309809143364403,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 8.686395071782651e-05,
|
|
"loss": 4.8766,
|
|
"mean_token_accuracy": 0.21546884179115294,
|
|
"num_tokens": 19276155.0,
|
|
"step": 9365
|
|
},
|
|
{
|
|
"entropy": 5.539609336853028,
|
|
"epoch": 8.314247669773636,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 8.667523298182229e-05,
|
|
"loss": 4.7871,
|
|
"mean_token_accuracy": 0.22656074166297913,
|
|
"num_tokens": 19286305.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 5.5059668064117435,
|
|
"epoch": 8.318686196182867,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 8.64869566662044e-05,
|
|
"loss": 4.7996,
|
|
"mean_token_accuracy": 0.23410040587186814,
|
|
"num_tokens": 19296950.0,
|
|
"step": 9375
|
|
},
|
|
{
|
|
"entropy": 5.547997999191284,
|
|
"epoch": 8.3231247225921,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 8.629912221227962e-05,
|
|
"loss": 4.7638,
|
|
"mean_token_accuracy": 0.2401889055967331,
|
|
"num_tokens": 19307184.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 5.577024459838867,
|
|
"epoch": 8.327563249001331,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 8.611173006031906e-05,
|
|
"loss": 4.8041,
|
|
"mean_token_accuracy": 0.22814675122499467,
|
|
"num_tokens": 19316769.0,
|
|
"step": 9385
|
|
},
|
|
{
|
|
"entropy": 5.594141149520874,
|
|
"epoch": 8.332001775410564,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 8.592478064955723e-05,
|
|
"loss": 4.8423,
|
|
"mean_token_accuracy": 0.2243447408080101,
|
|
"num_tokens": 19326639.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 5.525498151779175,
|
|
"epoch": 8.336440301819795,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 8.573827441819068e-05,
|
|
"loss": 4.709,
|
|
"mean_token_accuracy": 0.24149055778980255,
|
|
"num_tokens": 19337580.0,
|
|
"step": 9395
|
|
},
|
|
{
|
|
"entropy": 5.491425657272339,
|
|
"epoch": 8.340878828229028,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.555221180337728e-05,
|
|
"loss": 4.7758,
|
|
"mean_token_accuracy": 0.22916120886802674,
|
|
"num_tokens": 19348407.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 5.485869026184082,
|
|
"epoch": 8.34531735463826,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 8.536659324123513e-05,
|
|
"loss": 4.7418,
|
|
"mean_token_accuracy": 0.24086770564317703,
|
|
"num_tokens": 19358762.0,
|
|
"step": 9405
|
|
},
|
|
{
|
|
"entropy": 5.506166648864746,
|
|
"epoch": 8.349755881047493,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.518141916684145e-05,
|
|
"loss": 4.7051,
|
|
"mean_token_accuracy": 0.24545371532440186,
|
|
"num_tokens": 19368803.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 5.504174470901489,
|
|
"epoch": 8.354194407456724,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.499669001423161e-05,
|
|
"loss": 4.7075,
|
|
"mean_token_accuracy": 0.23998791426420213,
|
|
"num_tokens": 19379021.0,
|
|
"step": 9415
|
|
},
|
|
{
|
|
"entropy": 5.489093208312989,
|
|
"epoch": 8.358632933865957,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 8.481240621639811e-05,
|
|
"loss": 4.7341,
|
|
"mean_token_accuracy": 0.24076532572507858,
|
|
"num_tokens": 19388395.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 5.548724746704101,
|
|
"epoch": 8.363071460275188,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 8.46285682052895e-05,
|
|
"loss": 4.8932,
|
|
"mean_token_accuracy": 0.21990901827812195,
|
|
"num_tokens": 19398345.0,
|
|
"step": 9425
|
|
},
|
|
{
|
|
"entropy": 5.543989753723144,
|
|
"epoch": 8.367509986684421,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 8.444517641180972e-05,
|
|
"loss": 4.8093,
|
|
"mean_token_accuracy": 0.22736156582832337,
|
|
"num_tokens": 19409016.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 5.513630962371826,
|
|
"epoch": 8.371948513093653,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 8.426223126581642e-05,
|
|
"loss": 4.7599,
|
|
"mean_token_accuracy": 0.23516931235790253,
|
|
"num_tokens": 19419276.0,
|
|
"step": 9435
|
|
},
|
|
{
|
|
"entropy": 5.499025011062622,
|
|
"epoch": 8.376387039502886,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 8.407973319612055e-05,
|
|
"loss": 4.7128,
|
|
"mean_token_accuracy": 0.2366909921169281,
|
|
"num_tokens": 19429576.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 5.5045167922973635,
|
|
"epoch": 8.380825565912117,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 8.389768263048522e-05,
|
|
"loss": 4.7469,
|
|
"mean_token_accuracy": 0.23800566792488098,
|
|
"num_tokens": 19438904.0,
|
|
"step": 9445
|
|
},
|
|
{
|
|
"entropy": 5.521352481842041,
|
|
"epoch": 8.38526409232135,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 8.371607999562445e-05,
|
|
"loss": 4.7592,
|
|
"mean_token_accuracy": 0.2305511102080345,
|
|
"num_tokens": 19448496.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 5.5736151218414305,
|
|
"epoch": 8.389702618730581,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 8.353492571720239e-05,
|
|
"loss": 4.8159,
|
|
"mean_token_accuracy": 0.22852290272712708,
|
|
"num_tokens": 19458650.0,
|
|
"step": 9455
|
|
},
|
|
{
|
|
"entropy": 5.5026754379272464,
|
|
"epoch": 8.394141145139814,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 8.33542202198323e-05,
|
|
"loss": 4.7227,
|
|
"mean_token_accuracy": 0.23163039982318878,
|
|
"num_tokens": 19468073.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 5.527408838272095,
|
|
"epoch": 8.398579671549046,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 8.317396392707549e-05,
|
|
"loss": 4.7896,
|
|
"mean_token_accuracy": 0.2322364330291748,
|
|
"num_tokens": 19480377.0,
|
|
"step": 9465
|
|
},
|
|
{
|
|
"entropy": 5.501632452011108,
|
|
"epoch": 8.403018197958279,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.299415726144047e-05,
|
|
"loss": 4.8061,
|
|
"mean_token_accuracy": 0.23190983533859252,
|
|
"num_tokens": 19489959.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 5.56592493057251,
|
|
"epoch": 8.40745672436751,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 8.281480064438176e-05,
|
|
"loss": 4.7955,
|
|
"mean_token_accuracy": 0.22627756595611573,
|
|
"num_tokens": 19499786.0,
|
|
"step": 9475
|
|
},
|
|
{
|
|
"entropy": 5.54936990737915,
|
|
"epoch": 8.411895250776743,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.263589449629894e-05,
|
|
"loss": 4.8062,
|
|
"mean_token_accuracy": 0.22562486976385115,
|
|
"num_tokens": 19509964.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 5.48337025642395,
|
|
"epoch": 8.416333777185974,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 8.24574392365359e-05,
|
|
"loss": 4.7578,
|
|
"mean_token_accuracy": 0.24041553288698198,
|
|
"num_tokens": 19520266.0,
|
|
"step": 9485
|
|
},
|
|
{
|
|
"entropy": 5.485185956954956,
|
|
"epoch": 8.420772303595207,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 8.227943528337953e-05,
|
|
"loss": 4.7604,
|
|
"mean_token_accuracy": 0.22689348608255386,
|
|
"num_tokens": 19530087.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 5.517862796783447,
|
|
"epoch": 8.425210830004438,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 8.210188305405893e-05,
|
|
"loss": 4.7331,
|
|
"mean_token_accuracy": 0.2316621109843254,
|
|
"num_tokens": 19539968.0,
|
|
"step": 9495
|
|
},
|
|
{
|
|
"entropy": 5.554932928085327,
|
|
"epoch": 8.429649356413671,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.192478296474437e-05,
|
|
"loss": 4.7857,
|
|
"mean_token_accuracy": 0.22947621941566468,
|
|
"num_tokens": 19549593.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"epoch": 8.429649356413671,
|
|
"eval_entropy": 5.416213118265474,
|
|
"eval_loss": 5.850149631500244,
|
|
"eval_mean_token_accuracy": 0.17406961249271652,
|
|
"eval_num_tokens": 19549593.0,
|
|
"eval_runtime": 2.8579,
|
|
"eval_samples_per_second": 1178.126,
|
|
"eval_steps_per_second": 147.309,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 5.5417482376098635,
|
|
"epoch": 8.434087882822903,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 8.174813543054638e-05,
|
|
"loss": 4.7522,
|
|
"mean_token_accuracy": 0.2329458624124527,
|
|
"num_tokens": 19560055.0,
|
|
"step": 9505
|
|
},
|
|
{
|
|
"entropy": 5.499113655090332,
|
|
"epoch": 8.438526409232136,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 8.157194086551475e-05,
|
|
"loss": 4.7433,
|
|
"mean_token_accuracy": 0.23357740938663482,
|
|
"num_tokens": 19571238.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 5.4521290302276615,
|
|
"epoch": 8.442964935641367,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 8.139619968263745e-05,
|
|
"loss": 4.7415,
|
|
"mean_token_accuracy": 0.2420793890953064,
|
|
"num_tokens": 19582089.0,
|
|
"step": 9515
|
|
},
|
|
{
|
|
"entropy": 5.546719408035278,
|
|
"epoch": 8.4474034620506,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 8.12209122938398e-05,
|
|
"loss": 4.844,
|
|
"mean_token_accuracy": 0.22013940811157226,
|
|
"num_tokens": 19592901.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 5.501932144165039,
|
|
"epoch": 8.451841988459831,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.10460791099835e-05,
|
|
"loss": 4.7586,
|
|
"mean_token_accuracy": 0.23002112209796904,
|
|
"num_tokens": 19602675.0,
|
|
"step": 9525
|
|
},
|
|
{
|
|
"entropy": 5.493412208557129,
|
|
"epoch": 8.456280514869064,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 8.087170054086558e-05,
|
|
"loss": 4.711,
|
|
"mean_token_accuracy": 0.24073880165815353,
|
|
"num_tokens": 19612295.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 5.50322847366333,
|
|
"epoch": 8.460719041278296,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 8.069777699521749e-05,
|
|
"loss": 4.7309,
|
|
"mean_token_accuracy": 0.22775111049413682,
|
|
"num_tokens": 19622753.0,
|
|
"step": 9535
|
|
},
|
|
{
|
|
"entropy": 5.5291783809661865,
|
|
"epoch": 8.465157567687529,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 8.052430888070415e-05,
|
|
"loss": 4.7808,
|
|
"mean_token_accuracy": 0.22778575122356415,
|
|
"num_tokens": 19632087.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 5.5328240394592285,
|
|
"epoch": 8.46959609409676,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 8.035129660392288e-05,
|
|
"loss": 4.7764,
|
|
"mean_token_accuracy": 0.23297585546970367,
|
|
"num_tokens": 19642096.0,
|
|
"step": 9545
|
|
},
|
|
{
|
|
"entropy": 5.562929344177246,
|
|
"epoch": 8.474034620505993,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 8.017874057040274e-05,
|
|
"loss": 4.782,
|
|
"mean_token_accuracy": 0.22624499201774598,
|
|
"num_tokens": 19652278.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 5.527111959457398,
|
|
"epoch": 8.478473146915224,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 8.000664118460325e-05,
|
|
"loss": 4.8497,
|
|
"mean_token_accuracy": 0.22667205929756165,
|
|
"num_tokens": 19664257.0,
|
|
"step": 9555
|
|
},
|
|
{
|
|
"entropy": 5.4916459083557125,
|
|
"epoch": 8.482911673324455,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 7.983499884991356e-05,
|
|
"loss": 4.6948,
|
|
"mean_token_accuracy": 0.24415883272886277,
|
|
"num_tokens": 19675093.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 5.536289930343628,
|
|
"epoch": 8.487350199733688,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.966381396865169e-05,
|
|
"loss": 4.8378,
|
|
"mean_token_accuracy": 0.22096568048000337,
|
|
"num_tokens": 19684672.0,
|
|
"step": 9565
|
|
},
|
|
{
|
|
"entropy": 5.52120623588562,
|
|
"epoch": 8.491788726142921,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 7.949308694206323e-05,
|
|
"loss": 4.8214,
|
|
"mean_token_accuracy": 0.23016716092824935,
|
|
"num_tokens": 19695085.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 5.537389945983887,
|
|
"epoch": 8.496227252552153,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 7.932281817032065e-05,
|
|
"loss": 4.7553,
|
|
"mean_token_accuracy": 0.23001490533351898,
|
|
"num_tokens": 19705042.0,
|
|
"step": 9575
|
|
},
|
|
{
|
|
"entropy": 5.494133234024048,
|
|
"epoch": 8.500665778961384,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 7.915300805252237e-05,
|
|
"loss": 4.7346,
|
|
"mean_token_accuracy": 0.2346693217754364,
|
|
"num_tokens": 19715317.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 5.510550212860108,
|
|
"epoch": 8.505104305370617,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 7.89836569866916e-05,
|
|
"loss": 4.7681,
|
|
"mean_token_accuracy": 0.23248301595449447,
|
|
"num_tokens": 19725286.0,
|
|
"step": 9585
|
|
},
|
|
{
|
|
"entropy": 5.532899999618531,
|
|
"epoch": 8.509542831779848,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 7.88147653697758e-05,
|
|
"loss": 4.8103,
|
|
"mean_token_accuracy": 0.22701820284128188,
|
|
"num_tokens": 19734484.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 5.602574682235717,
|
|
"epoch": 8.513981358189081,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 7.864633359764534e-05,
|
|
"loss": 4.8297,
|
|
"mean_token_accuracy": 0.22263017892837525,
|
|
"num_tokens": 19745834.0,
|
|
"step": 9595
|
|
},
|
|
{
|
|
"entropy": 5.493256235122681,
|
|
"epoch": 8.518419884598313,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.847836206509267e-05,
|
|
"loss": 4.6396,
|
|
"mean_token_accuracy": 0.24397653788328172,
|
|
"num_tokens": 19754834.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 5.449935722351074,
|
|
"epoch": 8.522858411007546,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 7.831085116583176e-05,
|
|
"loss": 4.7791,
|
|
"mean_token_accuracy": 0.23400386571884155,
|
|
"num_tokens": 19764777.0,
|
|
"step": 9605
|
|
},
|
|
{
|
|
"entropy": 5.493365526199341,
|
|
"epoch": 8.527296937416777,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 7.814380129249663e-05,
|
|
"loss": 4.7492,
|
|
"mean_token_accuracy": 0.23068651258945466,
|
|
"num_tokens": 19775554.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 5.535855674743653,
|
|
"epoch": 8.53173546382601,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.797721283664077e-05,
|
|
"loss": 4.7602,
|
|
"mean_token_accuracy": 0.23622832596302032,
|
|
"num_tokens": 19785512.0,
|
|
"step": 9615
|
|
},
|
|
{
|
|
"entropy": 5.498302602767945,
|
|
"epoch": 8.536173990235241,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 7.781108618873614e-05,
|
|
"loss": 4.7397,
|
|
"mean_token_accuracy": 0.23634256720542907,
|
|
"num_tokens": 19795689.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 5.488301944732666,
|
|
"epoch": 8.540612516644474,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 7.764542173817221e-05,
|
|
"loss": 4.7557,
|
|
"mean_token_accuracy": 0.23292654305696486,
|
|
"num_tokens": 19806024.0,
|
|
"step": 9625
|
|
},
|
|
{
|
|
"entropy": 5.456901264190674,
|
|
"epoch": 8.545051043053705,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.748021987325523e-05,
|
|
"loss": 4.7132,
|
|
"mean_token_accuracy": 0.23660846352577208,
|
|
"num_tokens": 19816320.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 5.549684715270996,
|
|
"epoch": 8.549489569462938,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 7.731548098120701e-05,
|
|
"loss": 4.771,
|
|
"mean_token_accuracy": 0.23219175040721893,
|
|
"num_tokens": 19826593.0,
|
|
"step": 9635
|
|
},
|
|
{
|
|
"entropy": 5.507291841506958,
|
|
"epoch": 8.55392809587217,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 7.715120544816425e-05,
|
|
"loss": 4.7758,
|
|
"mean_token_accuracy": 0.22952704280614852,
|
|
"num_tokens": 19837182.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 5.478663444519043,
|
|
"epoch": 8.558366622281403,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.698739365917764e-05,
|
|
"loss": 4.7637,
|
|
"mean_token_accuracy": 0.2380097433924675,
|
|
"num_tokens": 19847855.0,
|
|
"step": 9645
|
|
},
|
|
{
|
|
"entropy": 5.54415225982666,
|
|
"epoch": 8.562805148690634,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 7.682404599821084e-05,
|
|
"loss": 4.7991,
|
|
"mean_token_accuracy": 0.230449877679348,
|
|
"num_tokens": 19858739.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 5.468395376205445,
|
|
"epoch": 8.567243675099867,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 7.666116284813942e-05,
|
|
"loss": 4.7988,
|
|
"mean_token_accuracy": 0.23000284731388093,
|
|
"num_tokens": 19868789.0,
|
|
"step": 9655
|
|
},
|
|
{
|
|
"entropy": 5.521364641189575,
|
|
"epoch": 8.571682201509098,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 7.649874459075057e-05,
|
|
"loss": 4.7447,
|
|
"mean_token_accuracy": 0.23275650292634964,
|
|
"num_tokens": 19879093.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 5.469178104400635,
|
|
"epoch": 8.576120727918331,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 7.633679160674144e-05,
|
|
"loss": 4.6962,
|
|
"mean_token_accuracy": 0.2438605934381485,
|
|
"num_tokens": 19889253.0,
|
|
"step": 9665
|
|
},
|
|
{
|
|
"entropy": 5.540501880645752,
|
|
"epoch": 8.580559254327563,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 7.617530427571886e-05,
|
|
"loss": 4.8336,
|
|
"mean_token_accuracy": 0.22254648357629775,
|
|
"num_tokens": 19900104.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 5.518979263305664,
|
|
"epoch": 8.584997780736796,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.601428297619805e-05,
|
|
"loss": 4.7773,
|
|
"mean_token_accuracy": 0.23023637235164643,
|
|
"num_tokens": 19910863.0,
|
|
"step": 9675
|
|
},
|
|
{
|
|
"entropy": 5.528198289871216,
|
|
"epoch": 8.589436307146027,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 7.585372808560192e-05,
|
|
"loss": 4.742,
|
|
"mean_token_accuracy": 0.2323218196630478,
|
|
"num_tokens": 19921214.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 5.559651660919189,
|
|
"epoch": 8.59387483355526,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 7.569363998026021e-05,
|
|
"loss": 4.8121,
|
|
"mean_token_accuracy": 0.23514225482940673,
|
|
"num_tokens": 19930337.0,
|
|
"step": 9685
|
|
},
|
|
{
|
|
"entropy": 5.505900716781616,
|
|
"epoch": 8.598313359964491,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 7.553401903540857e-05,
|
|
"loss": 4.7702,
|
|
"mean_token_accuracy": 0.23090167343616486,
|
|
"num_tokens": 19941329.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 5.46249623298645,
|
|
"epoch": 8.602751886373724,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.537486562518735e-05,
|
|
"loss": 4.7274,
|
|
"mean_token_accuracy": 0.23341498225927354,
|
|
"num_tokens": 19952710.0,
|
|
"step": 9695
|
|
},
|
|
{
|
|
"entropy": 5.537999868392944,
|
|
"epoch": 8.607190412782955,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 7.521618012264149e-05,
|
|
"loss": 4.7155,
|
|
"mean_token_accuracy": 0.2305786982178688,
|
|
"num_tokens": 19964718.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 5.499637603759766,
|
|
"epoch": 8.611628939192189,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 7.505796289971885e-05,
|
|
"loss": 4.6858,
|
|
"mean_token_accuracy": 0.23282495141029358,
|
|
"num_tokens": 19973896.0,
|
|
"step": 9705
|
|
},
|
|
{
|
|
"entropy": 5.57208890914917,
|
|
"epoch": 8.61606746560142,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 7.490021432726987e-05,
|
|
"loss": 4.8398,
|
|
"mean_token_accuracy": 0.2273474544286728,
|
|
"num_tokens": 19984255.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 5.563538980484009,
|
|
"epoch": 8.620505992010653,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 7.474293477504637e-05,
|
|
"loss": 4.821,
|
|
"mean_token_accuracy": 0.22293324917554855,
|
|
"num_tokens": 19995139.0,
|
|
"step": 9715
|
|
},
|
|
{
|
|
"entropy": 5.5361793518066404,
|
|
"epoch": 8.624944518419884,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 7.458612461170086e-05,
|
|
"loss": 4.7594,
|
|
"mean_token_accuracy": 0.2299353763461113,
|
|
"num_tokens": 20005002.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 5.496047401428223,
|
|
"epoch": 8.629383044829117,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 7.44297842047857e-05,
|
|
"loss": 4.7454,
|
|
"mean_token_accuracy": 0.234815414249897,
|
|
"num_tokens": 20016144.0,
|
|
"step": 9725
|
|
},
|
|
{
|
|
"entropy": 5.575048351287842,
|
|
"epoch": 8.633821571238348,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 7.427391392075219e-05,
|
|
"loss": 4.8403,
|
|
"mean_token_accuracy": 0.22622893303632735,
|
|
"num_tokens": 20027667.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 5.492922687530518,
|
|
"epoch": 8.638260097647581,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 7.411851412494943e-05,
|
|
"loss": 4.7804,
|
|
"mean_token_accuracy": 0.2270881474018097,
|
|
"num_tokens": 20037778.0,
|
|
"step": 9735
|
|
},
|
|
{
|
|
"entropy": 5.5301882266998295,
|
|
"epoch": 8.642698624056813,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 7.396358518162405e-05,
|
|
"loss": 4.7654,
|
|
"mean_token_accuracy": 0.23267012983560562,
|
|
"num_tokens": 20047679.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 5.548095989227295,
|
|
"epoch": 8.647137150466046,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 7.380912745391888e-05,
|
|
"loss": 4.8269,
|
|
"mean_token_accuracy": 0.2271960750222206,
|
|
"num_tokens": 20058765.0,
|
|
"step": 9745
|
|
},
|
|
{
|
|
"entropy": 5.518854236602783,
|
|
"epoch": 8.651575676875277,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 7.36551413038723e-05,
|
|
"loss": 4.7733,
|
|
"mean_token_accuracy": 0.23128276616334914,
|
|
"num_tokens": 20069036.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 5.535914897918701,
|
|
"epoch": 8.65601420328451,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 7.350162709241734e-05,
|
|
"loss": 4.8468,
|
|
"mean_token_accuracy": 0.21787732988595962,
|
|
"num_tokens": 20079062.0,
|
|
"step": 9755
|
|
},
|
|
{
|
|
"entropy": 5.559089183807373,
|
|
"epoch": 8.660452729693741,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 7.334858517938074e-05,
|
|
"loss": 4.8022,
|
|
"mean_token_accuracy": 0.22950206995010375,
|
|
"num_tokens": 20089752.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 5.535069322586059,
|
|
"epoch": 8.664891256102974,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 7.319601592348238e-05,
|
|
"loss": 4.7458,
|
|
"mean_token_accuracy": 0.23865058422088622,
|
|
"num_tokens": 20099094.0,
|
|
"step": 9765
|
|
},
|
|
{
|
|
"entropy": 5.519786596298218,
|
|
"epoch": 8.669329782512206,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 7.304391968233418e-05,
|
|
"loss": 4.7941,
|
|
"mean_token_accuracy": 0.23107607215642928,
|
|
"num_tokens": 20109145.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 5.566598987579345,
|
|
"epoch": 8.673768308921439,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 7.28922968124392e-05,
|
|
"loss": 4.8097,
|
|
"mean_token_accuracy": 0.21964459717273713,
|
|
"num_tokens": 20119953.0,
|
|
"step": 9775
|
|
},
|
|
{
|
|
"entropy": 5.474442672729492,
|
|
"epoch": 8.67820683533067,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 7.27411476691912e-05,
|
|
"loss": 4.7226,
|
|
"mean_token_accuracy": 0.23574139475822448,
|
|
"num_tokens": 20130362.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 5.481369972229004,
|
|
"epoch": 8.682645361739903,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 7.25904726068734e-05,
|
|
"loss": 4.6851,
|
|
"mean_token_accuracy": 0.2324271470308304,
|
|
"num_tokens": 20140149.0,
|
|
"step": 9785
|
|
},
|
|
{
|
|
"entropy": 5.4753632068634035,
|
|
"epoch": 8.687083888149134,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 7.244027197865793e-05,
|
|
"loss": 4.6966,
|
|
"mean_token_accuracy": 0.2406598746776581,
|
|
"num_tokens": 20150452.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 5.453383922576904,
|
|
"epoch": 8.691522414558367,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 7.229054613660472e-05,
|
|
"loss": 4.6125,
|
|
"mean_token_accuracy": 0.23984317630529403,
|
|
"num_tokens": 20160763.0,
|
|
"step": 9795
|
|
},
|
|
{
|
|
"entropy": 5.498008728027344,
|
|
"epoch": 8.695960940967598,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 7.21412954316609e-05,
|
|
"loss": 4.7423,
|
|
"mean_token_accuracy": 0.23824133723974228,
|
|
"num_tokens": 20171217.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 5.54000506401062,
|
|
"epoch": 8.700399467376831,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 7.199252021366e-05,
|
|
"loss": 4.9028,
|
|
"mean_token_accuracy": 0.21947446018457412,
|
|
"num_tokens": 20182688.0,
|
|
"step": 9805
|
|
},
|
|
{
|
|
"entropy": 5.486901426315308,
|
|
"epoch": 8.704837993786063,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 7.184422083132097e-05,
|
|
"loss": 4.8131,
|
|
"mean_token_accuracy": 0.2298983633518219,
|
|
"num_tokens": 20194095.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 5.532335233688355,
|
|
"epoch": 8.709276520195296,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.16963976322473e-05,
|
|
"loss": 4.7962,
|
|
"mean_token_accuracy": 0.2296323984861374,
|
|
"num_tokens": 20204575.0,
|
|
"step": 9815
|
|
},
|
|
{
|
|
"entropy": 5.526471138000488,
|
|
"epoch": 8.713715046604527,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 7.154905096292662e-05,
|
|
"loss": 4.826,
|
|
"mean_token_accuracy": 0.2282497078180313,
|
|
"num_tokens": 20215069.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 5.516374921798706,
|
|
"epoch": 8.71815357301376,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 7.140218116872932e-05,
|
|
"loss": 4.7375,
|
|
"mean_token_accuracy": 0.23372119516134263,
|
|
"num_tokens": 20225132.0,
|
|
"step": 9825
|
|
},
|
|
{
|
|
"entropy": 5.503606796264648,
|
|
"epoch": 8.722592099422991,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 7.125578859390828e-05,
|
|
"loss": 4.7837,
|
|
"mean_token_accuracy": 0.23138995766639708,
|
|
"num_tokens": 20234797.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 5.492996597290039,
|
|
"epoch": 8.727030625832224,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 7.110987358159763e-05,
|
|
"loss": 4.7634,
|
|
"mean_token_accuracy": 0.23167468905448912,
|
|
"num_tokens": 20245075.0,
|
|
"step": 9835
|
|
},
|
|
{
|
|
"entropy": 5.516223382949829,
|
|
"epoch": 8.731469152241456,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 7.09644364738122e-05,
|
|
"loss": 4.814,
|
|
"mean_token_accuracy": 0.22969421446323396,
|
|
"num_tokens": 20255729.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 5.522350454330445,
|
|
"epoch": 8.735907678650689,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 7.081947761144665e-05,
|
|
"loss": 4.7605,
|
|
"mean_token_accuracy": 0.23422917276620864,
|
|
"num_tokens": 20266638.0,
|
|
"step": 9845
|
|
},
|
|
{
|
|
"entropy": 5.51732873916626,
|
|
"epoch": 8.74034620505992,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 7.067499733427466e-05,
|
|
"loss": 4.6929,
|
|
"mean_token_accuracy": 0.24654830247163773,
|
|
"num_tokens": 20276927.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 5.556275033950806,
|
|
"epoch": 8.744784731469153,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 7.053099598094804e-05,
|
|
"loss": 4.7794,
|
|
"mean_token_accuracy": 0.23401879370212555,
|
|
"num_tokens": 20286960.0,
|
|
"step": 9855
|
|
},
|
|
{
|
|
"entropy": 5.5193338871002195,
|
|
"epoch": 8.749223257878384,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.038747388899624e-05,
|
|
"loss": 4.7324,
|
|
"mean_token_accuracy": 0.23848005384206772,
|
|
"num_tokens": 20297623.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 5.485701656341552,
|
|
"epoch": 8.753661784287617,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 7.024443139482514e-05,
|
|
"loss": 4.8011,
|
|
"mean_token_accuracy": 0.22937335968017578,
|
|
"num_tokens": 20308089.0,
|
|
"step": 9865
|
|
},
|
|
{
|
|
"entropy": 5.490072250366211,
|
|
"epoch": 8.758100310696848,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.010186883371667e-05,
|
|
"loss": 4.7441,
|
|
"mean_token_accuracy": 0.2342752531170845,
|
|
"num_tokens": 20317314.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 5.4882453918457035,
|
|
"epoch": 8.762538837106082,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 6.995978653982765e-05,
|
|
"loss": 4.7986,
|
|
"mean_token_accuracy": 0.2269292578101158,
|
|
"num_tokens": 20327888.0,
|
|
"step": 9875
|
|
},
|
|
{
|
|
"entropy": 5.554427289962769,
|
|
"epoch": 8.766977363515313,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 6.981818484618926e-05,
|
|
"loss": 4.7827,
|
|
"mean_token_accuracy": 0.2302411451935768,
|
|
"num_tokens": 20337636.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 5.508083295822144,
|
|
"epoch": 8.771415889924546,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 6.967706408470628e-05,
|
|
"loss": 4.783,
|
|
"mean_token_accuracy": 0.23305133432149888,
|
|
"num_tokens": 20348370.0,
|
|
"step": 9885
|
|
},
|
|
{
|
|
"entropy": 5.525426626205444,
|
|
"epoch": 8.775854416333777,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 6.953642458615616e-05,
|
|
"loss": 4.7939,
|
|
"mean_token_accuracy": 0.23202591091394426,
|
|
"num_tokens": 20359656.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 5.544418430328369,
|
|
"epoch": 8.78029294274301,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 6.939626668018806e-05,
|
|
"loss": 4.8007,
|
|
"mean_token_accuracy": 0.22351673245429993,
|
|
"num_tokens": 20370526.0,
|
|
"step": 9895
|
|
},
|
|
{
|
|
"entropy": 5.555383729934692,
|
|
"epoch": 8.784731469152241,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 6.925659069532276e-05,
|
|
"loss": 4.745,
|
|
"mean_token_accuracy": 0.2246900260448456,
|
|
"num_tokens": 20379716.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 5.535406541824341,
|
|
"epoch": 8.789169995561474,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 6.911739695895108e-05,
|
|
"loss": 4.7626,
|
|
"mean_token_accuracy": 0.2337111711502075,
|
|
"num_tokens": 20390369.0,
|
|
"step": 9905
|
|
},
|
|
{
|
|
"entropy": 5.5400303363800045,
|
|
"epoch": 8.793608521970706,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 6.897868579733373e-05,
|
|
"loss": 4.7497,
|
|
"mean_token_accuracy": 0.23331557512283324,
|
|
"num_tokens": 20400188.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 5.498782587051392,
|
|
"epoch": 8.798047048379939,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 6.884045753560016e-05,
|
|
"loss": 4.7731,
|
|
"mean_token_accuracy": 0.2317243054509163,
|
|
"num_tokens": 20410008.0,
|
|
"step": 9915
|
|
},
|
|
{
|
|
"entropy": 5.475151014328003,
|
|
"epoch": 8.80248557478917,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 6.870271249774793e-05,
|
|
"loss": 4.7667,
|
|
"mean_token_accuracy": 0.2383279338479042,
|
|
"num_tokens": 20421205.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 5.507953834533692,
|
|
"epoch": 8.806924101198401,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 6.856545100664203e-05,
|
|
"loss": 4.7779,
|
|
"mean_token_accuracy": 0.23082384318113328,
|
|
"num_tokens": 20432478.0,
|
|
"step": 9925
|
|
},
|
|
{
|
|
"entropy": 5.533805179595947,
|
|
"epoch": 8.811362627607634,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 6.842867338401409e-05,
|
|
"loss": 4.7783,
|
|
"mean_token_accuracy": 0.23170479834079744,
|
|
"num_tokens": 20443546.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 5.547921276092529,
|
|
"epoch": 8.815801154016867,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 6.829237995046138e-05,
|
|
"loss": 4.8601,
|
|
"mean_token_accuracy": 0.2271231785416603,
|
|
"num_tokens": 20455069.0,
|
|
"step": 9935
|
|
},
|
|
{
|
|
"entropy": 5.61183352470398,
|
|
"epoch": 8.820239680426099,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 6.815657102544648e-05,
|
|
"loss": 4.8508,
|
|
"mean_token_accuracy": 0.22385960519313813,
|
|
"num_tokens": 20466592.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 5.5380267143249515,
|
|
"epoch": 8.82467820683533,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 6.802124692729613e-05,
|
|
"loss": 4.7659,
|
|
"mean_token_accuracy": 0.22524937242269516,
|
|
"num_tokens": 20477817.0,
|
|
"step": 9945
|
|
},
|
|
{
|
|
"entropy": 5.4453453540802,
|
|
"epoch": 8.829116733244563,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.788640797320092e-05,
|
|
"loss": 4.7418,
|
|
"mean_token_accuracy": 0.24071793556213378,
|
|
"num_tokens": 20488320.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 5.493866682052612,
|
|
"epoch": 8.833555259653796,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 6.775205447921409e-05,
|
|
"loss": 4.8012,
|
|
"mean_token_accuracy": 0.23522679805755614,
|
|
"num_tokens": 20498834.0,
|
|
"step": 9955
|
|
},
|
|
{
|
|
"entropy": 5.464108943939209,
|
|
"epoch": 8.837993786063027,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 6.761818676025096e-05,
|
|
"loss": 4.7344,
|
|
"mean_token_accuracy": 0.2362118035554886,
|
|
"num_tokens": 20509077.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 5.547714328765869,
|
|
"epoch": 8.842432312472258,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 6.748480513008843e-05,
|
|
"loss": 4.8241,
|
|
"mean_token_accuracy": 0.2292942076921463,
|
|
"num_tokens": 20519263.0,
|
|
"step": 9965
|
|
},
|
|
{
|
|
"entropy": 5.524181985855103,
|
|
"epoch": 8.846870838881491,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 6.735190990136394e-05,
|
|
"loss": 4.7649,
|
|
"mean_token_accuracy": 0.23648161292076111,
|
|
"num_tokens": 20529164.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 5.493105363845825,
|
|
"epoch": 8.851309365290723,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 6.721950138557468e-05,
|
|
"loss": 4.7854,
|
|
"mean_token_accuracy": 0.23499795496463777,
|
|
"num_tokens": 20540442.0,
|
|
"step": 9975
|
|
},
|
|
{
|
|
"entropy": 5.538046169281006,
|
|
"epoch": 8.855747891699956,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.708757989307729e-05,
|
|
"loss": 4.8203,
|
|
"mean_token_accuracy": 0.2239013820886612,
|
|
"num_tokens": 20550535.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 5.553622436523438,
|
|
"epoch": 8.860186418109187,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 6.695614573308673e-05,
|
|
"loss": 4.7881,
|
|
"mean_token_accuracy": 0.23241582959890367,
|
|
"num_tokens": 20559750.0,
|
|
"step": 9985
|
|
},
|
|
{
|
|
"entropy": 5.558172369003296,
|
|
"epoch": 8.86462494451842,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 6.68251992136756e-05,
|
|
"loss": 4.8046,
|
|
"mean_token_accuracy": 0.22624700665473937,
|
|
"num_tokens": 20570007.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 5.556117105484009,
|
|
"epoch": 8.869063470927651,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 6.66947406417737e-05,
|
|
"loss": 4.8638,
|
|
"mean_token_accuracy": 0.22003440111875533,
|
|
"num_tokens": 20580440.0,
|
|
"step": 9995
|
|
},
|
|
{
|
|
"entropy": 5.512663888931274,
|
|
"epoch": 8.873501997336884,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 6.65647703231669e-05,
|
|
"loss": 4.7895,
|
|
"mean_token_accuracy": 0.23371849358081817,
|
|
"num_tokens": 20590441.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"epoch": 8.873501997336884,
|
|
"eval_entropy": 5.401691513786407,
|
|
"eval_loss": 5.8470540046691895,
|
|
"eval_mean_token_accuracy": 0.1741063350063888,
|
|
"eval_num_tokens": 20590441.0,
|
|
"eval_runtime": 2.6927,
|
|
"eval_samples_per_second": 1250.42,
|
|
"eval_steps_per_second": 156.349,
|
|
"step": 10000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 11260,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3.1254197874048e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|