9134 lines
248 KiB
JSON
9134 lines
248 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.993342210386152,
|
|
"eval_steps": 500,
|
|
"global_step": 4500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.692031192779542,
|
|
"epoch": 0.004438526409232135,
|
|
"grad_norm": 14.75,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8207,
|
|
"mean_token_accuracy": 0.000128369708545506,
|
|
"num_tokens": 9810.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691952133178711,
|
|
"epoch": 0.00887705281846427,
|
|
"grad_norm": 12.9375,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7613,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 20538.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.690592384338379,
|
|
"epoch": 0.013315579227696404,
|
|
"grad_norm": 9.9375,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.5054,
|
|
"mean_token_accuracy": 0.03474730136804283,
|
|
"num_tokens": 30258.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.66368646621704,
|
|
"epoch": 0.01775410563692854,
|
|
"grad_norm": 5.875,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1947,
|
|
"mean_token_accuracy": 0.04976645708084106,
|
|
"num_tokens": 41249.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.518089294433594,
|
|
"epoch": 0.022192632046160676,
|
|
"grad_norm": 3.609375,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.9,
|
|
"mean_token_accuracy": 0.053335465490818024,
|
|
"num_tokens": 51738.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.489847755432129,
|
|
"epoch": 0.02663115845539281,
|
|
"grad_norm": 3.0625,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.8161,
|
|
"mean_token_accuracy": 0.05364362597465515,
|
|
"num_tokens": 62920.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.506165885925293,
|
|
"epoch": 0.031069684864624945,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.7103,
|
|
"mean_token_accuracy": 0.05455525256693363,
|
|
"num_tokens": 73163.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.478147506713867,
|
|
"epoch": 0.03550821127385708,
|
|
"grad_norm": 2.40625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.682,
|
|
"mean_token_accuracy": 0.05231944099068642,
|
|
"num_tokens": 84180.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.461441326141358,
|
|
"epoch": 0.03994673768308921,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.6388,
|
|
"mean_token_accuracy": 0.05221981666982174,
|
|
"num_tokens": 94108.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.476018333435059,
|
|
"epoch": 0.04438526409232135,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.6253,
|
|
"mean_token_accuracy": 0.05243444815278053,
|
|
"num_tokens": 104696.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.478155612945557,
|
|
"epoch": 0.048823790501553485,
|
|
"grad_norm": 2.375,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.5235,
|
|
"mean_token_accuracy": 0.0584161002188921,
|
|
"num_tokens": 114568.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.39725103378296,
|
|
"epoch": 0.05326231691078562,
|
|
"grad_norm": 2.125,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.4713,
|
|
"mean_token_accuracy": 0.064088149741292,
|
|
"num_tokens": 126251.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.248920154571532,
|
|
"epoch": 0.05770084332001776,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.3504,
|
|
"mean_token_accuracy": 0.06839247606694698,
|
|
"num_tokens": 135612.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.320736598968505,
|
|
"epoch": 0.06213936972924989,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.4004,
|
|
"mean_token_accuracy": 0.0615400142967701,
|
|
"num_tokens": 145962.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.323652744293213,
|
|
"epoch": 0.06657789613848203,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.1911,
|
|
"mean_token_accuracy": 0.07103513963520527,
|
|
"num_tokens": 155587.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.258409976959229,
|
|
"epoch": 0.07101642254771416,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.1343,
|
|
"mean_token_accuracy": 0.06803948283195496,
|
|
"num_tokens": 165657.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.24950189590454,
|
|
"epoch": 0.0754549489569463,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.1277,
|
|
"mean_token_accuracy": 0.06729609742760659,
|
|
"num_tokens": 175844.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.224775981903075,
|
|
"epoch": 0.07989347536617843,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.9736,
|
|
"mean_token_accuracy": 0.06970795653760434,
|
|
"num_tokens": 185453.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.128818893432618,
|
|
"epoch": 0.08433200177541056,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.9469,
|
|
"mean_token_accuracy": 0.07015660107135772,
|
|
"num_tokens": 195296.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.158192539215088,
|
|
"epoch": 0.0887705281846427,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.8594,
|
|
"mean_token_accuracy": 0.0717735793441534,
|
|
"num_tokens": 204491.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.063592338562012,
|
|
"epoch": 0.09320905459387484,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.8275,
|
|
"mean_token_accuracy": 0.06594390086829663,
|
|
"num_tokens": 214916.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.0551118850708,
|
|
"epoch": 0.09764758100310697,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.6661,
|
|
"mean_token_accuracy": 0.07398808561265469,
|
|
"num_tokens": 226660.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.929056739807129,
|
|
"epoch": 0.1020861074123391,
|
|
"grad_norm": 2.203125,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.6191,
|
|
"mean_token_accuracy": 0.06771207004785537,
|
|
"num_tokens": 236554.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.87773323059082,
|
|
"epoch": 0.10652463382157124,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.5466,
|
|
"mean_token_accuracy": 0.07039828561246395,
|
|
"num_tokens": 247388.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.78554401397705,
|
|
"epoch": 0.11096316023080337,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.3693,
|
|
"mean_token_accuracy": 0.07505594864487648,
|
|
"num_tokens": 257404.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.569751739501953,
|
|
"epoch": 0.11540168664003551,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 8.366,
|
|
"mean_token_accuracy": 0.0721758782863617,
|
|
"num_tokens": 268024.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.49385757446289,
|
|
"epoch": 0.11984021304926765,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 8.3116,
|
|
"mean_token_accuracy": 0.07231119871139527,
|
|
"num_tokens": 278477.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.405902671813966,
|
|
"epoch": 0.12427873945849978,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.2427,
|
|
"mean_token_accuracy": 0.06903640553355217,
|
|
"num_tokens": 289974.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 9.16763277053833,
|
|
"epoch": 0.1287172658677319,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.1839,
|
|
"mean_token_accuracy": 0.06725569888949394,
|
|
"num_tokens": 300150.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 9.045907497406006,
|
|
"epoch": 0.13315579227696406,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.0648,
|
|
"mean_token_accuracy": 0.07113164104521275,
|
|
"num_tokens": 310482.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.951902961730957,
|
|
"epoch": 0.13759431868619618,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 8.1043,
|
|
"mean_token_accuracy": 0.07190654650330544,
|
|
"num_tokens": 321350.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.734932899475098,
|
|
"epoch": 0.14203284509542832,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.9902,
|
|
"mean_token_accuracy": 0.07260116301476956,
|
|
"num_tokens": 332009.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.618322277069092,
|
|
"epoch": 0.14647137150466044,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 8.0046,
|
|
"mean_token_accuracy": 0.07010005228221416,
|
|
"num_tokens": 341980.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.576034545898438,
|
|
"epoch": 0.1509098979138926,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.9965,
|
|
"mean_token_accuracy": 0.06660077758133412,
|
|
"num_tokens": 354249.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.524139022827148,
|
|
"epoch": 0.15534842432312473,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.9076,
|
|
"mean_token_accuracy": 0.07078476324677467,
|
|
"num_tokens": 364295.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.328704929351806,
|
|
"epoch": 0.15978695073235685,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.8464,
|
|
"mean_token_accuracy": 0.0794072538614273,
|
|
"num_tokens": 373601.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.382467269897461,
|
|
"epoch": 0.164225477141589,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.8583,
|
|
"mean_token_accuracy": 0.07436131834983825,
|
|
"num_tokens": 384260.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 8.316840362548827,
|
|
"epoch": 0.16866400355082112,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.9058,
|
|
"mean_token_accuracy": 0.06711366176605224,
|
|
"num_tokens": 394964.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.204895782470704,
|
|
"epoch": 0.17310252996005326,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.8384,
|
|
"mean_token_accuracy": 0.07343141734600067,
|
|
"num_tokens": 404470.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.270458793640136,
|
|
"epoch": 0.1775410563692854,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.9041,
|
|
"mean_token_accuracy": 0.07145134881138801,
|
|
"num_tokens": 414822.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.344293403625489,
|
|
"epoch": 0.18197958277851753,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.8228,
|
|
"mean_token_accuracy": 0.07206394150853157,
|
|
"num_tokens": 424367.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.169469261169434,
|
|
"epoch": 0.18641810918774968,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.8063,
|
|
"mean_token_accuracy": 0.06796807795763016,
|
|
"num_tokens": 434911.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 8.127049207687378,
|
|
"epoch": 0.1908566355969818,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.7417,
|
|
"mean_token_accuracy": 0.08103418126702308,
|
|
"num_tokens": 445215.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 8.216034698486329,
|
|
"epoch": 0.19529516200621394,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.7919,
|
|
"mean_token_accuracy": 0.07842708677053452,
|
|
"num_tokens": 454786.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 8.140088844299317,
|
|
"epoch": 0.19973368841544606,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.8219,
|
|
"mean_token_accuracy": 0.07302889823913575,
|
|
"num_tokens": 465185.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 8.021256399154662,
|
|
"epoch": 0.2041722148246782,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.7156,
|
|
"mean_token_accuracy": 0.08027704544365406,
|
|
"num_tokens": 475235.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 8.17042875289917,
|
|
"epoch": 0.20861074123391035,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.7317,
|
|
"mean_token_accuracy": 0.07805200070142745,
|
|
"num_tokens": 485408.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 8.040202140808105,
|
|
"epoch": 0.21304926764314247,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.7331,
|
|
"mean_token_accuracy": 0.0744746584445238,
|
|
"num_tokens": 495570.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 8.125858116149903,
|
|
"epoch": 0.21748779405237462,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.7248,
|
|
"mean_token_accuracy": 0.07628845125436783,
|
|
"num_tokens": 506103.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 8.083836793899536,
|
|
"epoch": 0.22192632046160674,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.6989,
|
|
"mean_token_accuracy": 0.07588708400726318,
|
|
"num_tokens": 516416.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 8.041877603530883,
|
|
"epoch": 0.22636484687083888,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.7498,
|
|
"mean_token_accuracy": 0.0751910775899887,
|
|
"num_tokens": 525841.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 8.231132793426514,
|
|
"epoch": 0.23080337328007103,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.7681,
|
|
"mean_token_accuracy": 0.07214248739182949,
|
|
"num_tokens": 536426.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 8.028632116317748,
|
|
"epoch": 0.23524189968930315,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.7229,
|
|
"mean_token_accuracy": 0.07526009976863861,
|
|
"num_tokens": 545852.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.998026943206787,
|
|
"epoch": 0.2396804260985353,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.6466,
|
|
"mean_token_accuracy": 0.07897478640079499,
|
|
"num_tokens": 555222.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.9018083095550535,
|
|
"epoch": 0.2441189525077674,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.6683,
|
|
"mean_token_accuracy": 0.0769478440284729,
|
|
"num_tokens": 566311.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 8.067350673675538,
|
|
"epoch": 0.24855747891699956,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.6718,
|
|
"mean_token_accuracy": 0.07673554085195064,
|
|
"num_tokens": 576883.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 8.010624122619628,
|
|
"epoch": 0.2529960053262317,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.8136,
|
|
"mean_token_accuracy": 0.07454071268439293,
|
|
"num_tokens": 587387.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 8.04631519317627,
|
|
"epoch": 0.2574345317354638,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.6914,
|
|
"mean_token_accuracy": 0.07921014353632927,
|
|
"num_tokens": 597229.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 8.029859972000121,
|
|
"epoch": 0.26187305814469597,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.6793,
|
|
"mean_token_accuracy": 0.0733891949057579,
|
|
"num_tokens": 606997.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.9327795028686525,
|
|
"epoch": 0.2663115845539281,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 7.6346,
|
|
"mean_token_accuracy": 0.07976229339838029,
|
|
"num_tokens": 617316.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.945201730728149,
|
|
"epoch": 0.2707501109631602,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 7.6262,
|
|
"mean_token_accuracy": 0.07671116665005684,
|
|
"num_tokens": 626494.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.911632776260376,
|
|
"epoch": 0.27518863737239235,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.6211,
|
|
"mean_token_accuracy": 0.07656443342566491,
|
|
"num_tokens": 636816.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.9385381698608395,
|
|
"epoch": 0.2796271637816245,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000157,
|
|
"loss": 7.5921,
|
|
"mean_token_accuracy": 0.07875077873468399,
|
|
"num_tokens": 647520.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.8889247417449955,
|
|
"epoch": 0.28406569019085665,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.5615,
|
|
"mean_token_accuracy": 0.0802665926516056,
|
|
"num_tokens": 656772.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.87529935836792,
|
|
"epoch": 0.2885042166000888,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000162,
|
|
"loss": 7.6269,
|
|
"mean_token_accuracy": 0.07935804799199105,
|
|
"num_tokens": 666570.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.889472913742066,
|
|
"epoch": 0.2929427430093209,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 7.6449,
|
|
"mean_token_accuracy": 0.07449713721871376,
|
|
"num_tokens": 676873.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.901484632492066,
|
|
"epoch": 0.29738126941855303,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 7.556,
|
|
"mean_token_accuracy": 0.0819828025996685,
|
|
"num_tokens": 687322.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.938011121749878,
|
|
"epoch": 0.3018197958277852,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 7.6304,
|
|
"mean_token_accuracy": 0.07710144743323326,
|
|
"num_tokens": 697657.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.953681612014771,
|
|
"epoch": 0.3062583222370173,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 7.5355,
|
|
"mean_token_accuracy": 0.07943713515996934,
|
|
"num_tokens": 707713.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.818657636642456,
|
|
"epoch": 0.31069684864624947,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 7.5792,
|
|
"mean_token_accuracy": 0.08700495660305023,
|
|
"num_tokens": 719438.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.922421979904175,
|
|
"epoch": 0.31513537505548156,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 7.5211,
|
|
"mean_token_accuracy": 0.0777974933385849,
|
|
"num_tokens": 728991.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.7726140975952145,
|
|
"epoch": 0.3195739014647137,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 7.4375,
|
|
"mean_token_accuracy": 0.09254143610596657,
|
|
"num_tokens": 738276.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.8144529342651365,
|
|
"epoch": 0.32401242787394585,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 7.537,
|
|
"mean_token_accuracy": 0.07724328823387623,
|
|
"num_tokens": 748405.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.8304845809936525,
|
|
"epoch": 0.328450954283178,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.5365,
|
|
"mean_token_accuracy": 0.08004771247506141,
|
|
"num_tokens": 759111.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.755885601043701,
|
|
"epoch": 0.33288948069241014,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.4431,
|
|
"mean_token_accuracy": 0.08885042890906333,
|
|
"num_tokens": 770315.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.815682411193848,
|
|
"epoch": 0.33732800710164224,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 7.5761,
|
|
"mean_token_accuracy": 0.07824730798602104,
|
|
"num_tokens": 781390.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.868446302413941,
|
|
"epoch": 0.3417665335108744,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 7.4659,
|
|
"mean_token_accuracy": 0.08218091987073421,
|
|
"num_tokens": 790710.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.664791536331177,
|
|
"epoch": 0.34620505992010653,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 7.4344,
|
|
"mean_token_accuracy": 0.08516876846551895,
|
|
"num_tokens": 800475.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.776907110214234,
|
|
"epoch": 0.3506435863293387,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 7.5457,
|
|
"mean_token_accuracy": 0.07697484940290451,
|
|
"num_tokens": 810394.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.851606655120849,
|
|
"epoch": 0.3550821127385708,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.5259,
|
|
"mean_token_accuracy": 0.07952482551336289,
|
|
"num_tokens": 820493.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.881973552703857,
|
|
"epoch": 0.3595206391478029,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 7.5896,
|
|
"mean_token_accuracy": 0.07090779766440392,
|
|
"num_tokens": 831570.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.75118236541748,
|
|
"epoch": 0.36395916555703506,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 7.5822,
|
|
"mean_token_accuracy": 0.07436199747025966,
|
|
"num_tokens": 841851.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.8130326747894285,
|
|
"epoch": 0.3683976919662672,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000207,
|
|
"loss": 7.4771,
|
|
"mean_token_accuracy": 0.08917279317975044,
|
|
"num_tokens": 851221.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.784592771530152,
|
|
"epoch": 0.37283621837549935,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 7.5136,
|
|
"mean_token_accuracy": 0.08482674360275269,
|
|
"num_tokens": 861876.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.806199550628662,
|
|
"epoch": 0.37727474478473144,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000212,
|
|
"loss": 7.5012,
|
|
"mean_token_accuracy": 0.08520847856998444,
|
|
"num_tokens": 871742.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.63223876953125,
|
|
"epoch": 0.3817132711939636,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.4356,
|
|
"mean_token_accuracy": 0.08614917695522309,
|
|
"num_tokens": 881968.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.708009338378906,
|
|
"epoch": 0.38615179760319573,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 7.3441,
|
|
"mean_token_accuracy": 0.0903160773217678,
|
|
"num_tokens": 892142.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.681766939163208,
|
|
"epoch": 0.3905903240124279,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.408,
|
|
"mean_token_accuracy": 0.09188471287488938,
|
|
"num_tokens": 901992.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.797896862030029,
|
|
"epoch": 0.39502885042166,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000222,
|
|
"loss": 7.5382,
|
|
"mean_token_accuracy": 0.07850045077502728,
|
|
"num_tokens": 913438.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.55986213684082,
|
|
"epoch": 0.3994673768308921,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 7.273,
|
|
"mean_token_accuracy": 0.10574427619576454,
|
|
"num_tokens": 923879.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.674528026580811,
|
|
"epoch": 0.40390590324012426,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 7.4341,
|
|
"mean_token_accuracy": 0.08904042169451713,
|
|
"num_tokens": 933954.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.707700920104981,
|
|
"epoch": 0.4083444296493564,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 7.4156,
|
|
"mean_token_accuracy": 0.0867860458791256,
|
|
"num_tokens": 942992.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.656433868408203,
|
|
"epoch": 0.41278295605858856,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 7.4528,
|
|
"mean_token_accuracy": 0.08972205594182014,
|
|
"num_tokens": 953822.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.627706384658813,
|
|
"epoch": 0.4172214824678207,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 7.3472,
|
|
"mean_token_accuracy": 0.08931803703308105,
|
|
"num_tokens": 964475.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.642127990722656,
|
|
"epoch": 0.4216600088770528,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 7.434,
|
|
"mean_token_accuracy": 0.0859565369784832,
|
|
"num_tokens": 974535.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.666657447814941,
|
|
"epoch": 0.42609853528628494,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 7.3944,
|
|
"mean_token_accuracy": 0.08582191392779351,
|
|
"num_tokens": 984674.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.544086360931397,
|
|
"epoch": 0.4305370616955171,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000242,
|
|
"loss": 7.37,
|
|
"mean_token_accuracy": 0.09044271633028984,
|
|
"num_tokens": 995248.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.742295646667481,
|
|
"epoch": 0.43497558810474923,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 7.3632,
|
|
"mean_token_accuracy": 0.0895160473883152,
|
|
"num_tokens": 1005547.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.550811624526977,
|
|
"epoch": 0.4394141145139814,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 7.3413,
|
|
"mean_token_accuracy": 0.08750802129507065,
|
|
"num_tokens": 1015498.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.609345579147339,
|
|
"epoch": 0.44385264092321347,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 7.4055,
|
|
"mean_token_accuracy": 0.08584300205111503,
|
|
"num_tokens": 1025420.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.44385264092321347,
|
|
"eval_entropy": 7.669124412989673,
|
|
"eval_loss": 7.446435451507568,
|
|
"eval_mean_token_accuracy": 0.08312557260738132,
|
|
"eval_num_tokens": 1025420.0,
|
|
"eval_runtime": 2.7854,
|
|
"eval_samples_per_second": 1208.804,
|
|
"eval_steps_per_second": 151.145,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.6334656238555905,
|
|
"epoch": 0.4482911673324456,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 7.3295,
|
|
"mean_token_accuracy": 0.09022360593080521,
|
|
"num_tokens": 1036556.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.584210634231567,
|
|
"epoch": 0.45272969374167776,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 7.3593,
|
|
"mean_token_accuracy": 0.08703627660870553,
|
|
"num_tokens": 1046676.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 7.6705080509185795,
|
|
"epoch": 0.4571682201509099,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 7.4042,
|
|
"mean_token_accuracy": 0.08590352982282638,
|
|
"num_tokens": 1057088.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 7.5486232280731205,
|
|
"epoch": 0.46160674656014206,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 7.2982,
|
|
"mean_token_accuracy": 0.09567688480019569,
|
|
"num_tokens": 1067814.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.543769884109497,
|
|
"epoch": 0.46604527296937415,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000262,
|
|
"loss": 7.3327,
|
|
"mean_token_accuracy": 0.0892727330327034,
|
|
"num_tokens": 1078600.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 7.641923093795777,
|
|
"epoch": 0.4704837993786063,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 7.3363,
|
|
"mean_token_accuracy": 0.08722671940922737,
|
|
"num_tokens": 1089158.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 7.568871212005615,
|
|
"epoch": 0.47492232578783844,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 7.3497,
|
|
"mean_token_accuracy": 0.08428739383816719,
|
|
"num_tokens": 1100365.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 7.500961780548096,
|
|
"epoch": 0.4793608521970706,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 7.305,
|
|
"mean_token_accuracy": 0.09392210468649864,
|
|
"num_tokens": 1111168.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 7.573345041275024,
|
|
"epoch": 0.48379937860630273,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 7.3194,
|
|
"mean_token_accuracy": 0.09149189814925193,
|
|
"num_tokens": 1121520.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.536744737625122,
|
|
"epoch": 0.4882379050155348,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 7.2073,
|
|
"mean_token_accuracy": 0.09879742562770844,
|
|
"num_tokens": 1131300.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 7.364904880523682,
|
|
"epoch": 0.49267643142476697,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 7.2532,
|
|
"mean_token_accuracy": 0.0986358568072319,
|
|
"num_tokens": 1141897.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 7.541038084030151,
|
|
"epoch": 0.4971149578339991,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.2956,
|
|
"mean_token_accuracy": 0.08940311297774314,
|
|
"num_tokens": 1152510.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.552376794815063,
|
|
"epoch": 0.5015534842432312,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 7.3001,
|
|
"mean_token_accuracy": 0.09093584269285201,
|
|
"num_tokens": 1161762.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.479511404037476,
|
|
"epoch": 0.5059920106524634,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 7.2394,
|
|
"mean_token_accuracy": 0.09156333580613137,
|
|
"num_tokens": 1172836.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 7.480563068389893,
|
|
"epoch": 0.5104305370616955,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000287,
|
|
"loss": 7.2935,
|
|
"mean_token_accuracy": 0.09051846116781234,
|
|
"num_tokens": 1182101.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 7.511827182769776,
|
|
"epoch": 0.5148690634709276,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 7.2868,
|
|
"mean_token_accuracy": 0.08703599572181701,
|
|
"num_tokens": 1191925.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.430129528045654,
|
|
"epoch": 0.5193075898801598,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000292,
|
|
"loss": 7.1629,
|
|
"mean_token_accuracy": 0.09691138043999672,
|
|
"num_tokens": 1202030.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.408132934570313,
|
|
"epoch": 0.5237461162893919,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 7.253,
|
|
"mean_token_accuracy": 0.09141650795936584,
|
|
"num_tokens": 1212178.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 7.515611791610718,
|
|
"epoch": 0.5281846426986241,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000297,
|
|
"loss": 7.1971,
|
|
"mean_token_accuracy": 0.0950719341635704,
|
|
"num_tokens": 1221685.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.383773374557495,
|
|
"epoch": 0.5326231691078562,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 7.197,
|
|
"mean_token_accuracy": 0.08822897970676422,
|
|
"num_tokens": 1233178.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 7.4588648796081545,
|
|
"epoch": 0.5370616955170884,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 7.1611,
|
|
"mean_token_accuracy": 0.09191120117902755,
|
|
"num_tokens": 1243687.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.358021211624146,
|
|
"epoch": 0.5415002219263204,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 7.2349,
|
|
"mean_token_accuracy": 0.08815527036786079,
|
|
"num_tokens": 1255124.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 7.400767421722412,
|
|
"epoch": 0.5459387483355526,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000307,
|
|
"loss": 7.2452,
|
|
"mean_token_accuracy": 0.09174467995762825,
|
|
"num_tokens": 1265517.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 7.310306978225708,
|
|
"epoch": 0.5503772747447847,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 7.1176,
|
|
"mean_token_accuracy": 0.09506009593605995,
|
|
"num_tokens": 1275877.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.400981378555298,
|
|
"epoch": 0.5548158011540169,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000312,
|
|
"loss": 7.2286,
|
|
"mean_token_accuracy": 0.09438399225473404,
|
|
"num_tokens": 1285951.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 7.509041738510132,
|
|
"epoch": 0.559254327563249,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 7.1567,
|
|
"mean_token_accuracy": 0.09806277230381966,
|
|
"num_tokens": 1295209.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 7.316894149780273,
|
|
"epoch": 0.5636928539724811,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000317,
|
|
"loss": 7.2208,
|
|
"mean_token_accuracy": 0.09708264470100403,
|
|
"num_tokens": 1304733.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 7.342378044128418,
|
|
"epoch": 0.5681313803817133,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 7.1539,
|
|
"mean_token_accuracy": 0.08910495042800903,
|
|
"num_tokens": 1314981.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.538545989990235,
|
|
"epoch": 0.5725699067909454,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 7.198,
|
|
"mean_token_accuracy": 0.0895936667919159,
|
|
"num_tokens": 1325211.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 7.2863500118255615,
|
|
"epoch": 0.5770084332001776,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 7.1309,
|
|
"mean_token_accuracy": 0.09338074773550034,
|
|
"num_tokens": 1335625.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 7.436445474624634,
|
|
"epoch": 0.5814469596094097,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 7.2488,
|
|
"mean_token_accuracy": 0.0991661287844181,
|
|
"num_tokens": 1345158.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 7.262508535385132,
|
|
"epoch": 0.5858854860186418,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 7.081,
|
|
"mean_token_accuracy": 0.10250589922070504,
|
|
"num_tokens": 1355092.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 7.307907056808472,
|
|
"epoch": 0.5903240124278739,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 7.1329,
|
|
"mean_token_accuracy": 0.09874422326683999,
|
|
"num_tokens": 1364919.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 7.2338110446929935,
|
|
"epoch": 0.5947625388371061,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 7.1726,
|
|
"mean_token_accuracy": 0.09538876637816429,
|
|
"num_tokens": 1375200.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 7.331265687942505,
|
|
"epoch": 0.5992010652463382,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000337,
|
|
"loss": 7.1466,
|
|
"mean_token_accuracy": 0.09369650185108185,
|
|
"num_tokens": 1385728.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 7.4757524013519285,
|
|
"epoch": 0.6036395916555704,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 7.196,
|
|
"mean_token_accuracy": 0.08721103966236114,
|
|
"num_tokens": 1395542.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 7.264866781234741,
|
|
"epoch": 0.6080781180648025,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000342,
|
|
"loss": 7.1667,
|
|
"mean_token_accuracy": 0.09908052235841751,
|
|
"num_tokens": 1406350.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 7.250851583480835,
|
|
"epoch": 0.6125166444740346,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 7.0933,
|
|
"mean_token_accuracy": 0.09707043692469597,
|
|
"num_tokens": 1418229.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 7.257457447052002,
|
|
"epoch": 0.6169551708832668,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000347,
|
|
"loss": 7.101,
|
|
"mean_token_accuracy": 0.10156845226883889,
|
|
"num_tokens": 1428290.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 7.389108514785766,
|
|
"epoch": 0.6213936972924989,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 7.1644,
|
|
"mean_token_accuracy": 0.08962787240743637,
|
|
"num_tokens": 1439837.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 7.230832195281982,
|
|
"epoch": 0.625832223701731,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000352,
|
|
"loss": 7.1004,
|
|
"mean_token_accuracy": 0.09468400254845619,
|
|
"num_tokens": 1450831.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 7.241072797775269,
|
|
"epoch": 0.6302707501109631,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 7.0787,
|
|
"mean_token_accuracy": 0.0992747537791729,
|
|
"num_tokens": 1461772.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 7.251083326339722,
|
|
"epoch": 0.6347092765201953,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000357,
|
|
"loss": 7.0678,
|
|
"mean_token_accuracy": 0.10479466319084167,
|
|
"num_tokens": 1471669.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 7.284691286087036,
|
|
"epoch": 0.6391478029294274,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 7.0922,
|
|
"mean_token_accuracy": 0.0977623738348484,
|
|
"num_tokens": 1482319.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 7.207487869262695,
|
|
"epoch": 0.6435863293386596,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000362,
|
|
"loss": 7.0654,
|
|
"mean_token_accuracy": 0.09616786390542983,
|
|
"num_tokens": 1492393.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 7.214288234710693,
|
|
"epoch": 0.6480248557478917,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 7.1377,
|
|
"mean_token_accuracy": 0.10020551234483718,
|
|
"num_tokens": 1502986.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 7.309820938110351,
|
|
"epoch": 0.6524633821571239,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000367,
|
|
"loss": 7.1195,
|
|
"mean_token_accuracy": 0.09985571056604385,
|
|
"num_tokens": 1514046.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 7.249904489517212,
|
|
"epoch": 0.656901908566356,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 7.133,
|
|
"mean_token_accuracy": 0.0978231132030487,
|
|
"num_tokens": 1523789.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 7.303426790237427,
|
|
"epoch": 0.6613404349755881,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000372,
|
|
"loss": 7.0636,
|
|
"mean_token_accuracy": 0.0984602726995945,
|
|
"num_tokens": 1533449.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 7.157350540161133,
|
|
"epoch": 0.6657789613848203,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 7.1052,
|
|
"mean_token_accuracy": 0.0913457877933979,
|
|
"num_tokens": 1543449.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 7.232370662689209,
|
|
"epoch": 0.6702174877940523,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.957,
|
|
"mean_token_accuracy": 0.10332913659512996,
|
|
"num_tokens": 1553529.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 7.166843461990356,
|
|
"epoch": 0.6746560142032845,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 7.0559,
|
|
"mean_token_accuracy": 0.1009259507060051,
|
|
"num_tokens": 1564245.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 7.135752153396607,
|
|
"epoch": 0.6790945406125166,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.9787,
|
|
"mean_token_accuracy": 0.0997254841029644,
|
|
"num_tokens": 1573834.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 7.034980821609497,
|
|
"epoch": 0.6835330670217488,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.9407,
|
|
"mean_token_accuracy": 0.10062595605850219,
|
|
"num_tokens": 1583782.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 7.211769485473633,
|
|
"epoch": 0.6879715934309809,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 7.0625,
|
|
"mean_token_accuracy": 0.10229107290506363,
|
|
"num_tokens": 1594056.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 7.17944564819336,
|
|
"epoch": 0.6924101198402131,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 7.0671,
|
|
"mean_token_accuracy": 0.09898089095950127,
|
|
"num_tokens": 1604177.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 7.1694622993469235,
|
|
"epoch": 0.6968486462494452,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.9696,
|
|
"mean_token_accuracy": 0.10202183946967125,
|
|
"num_tokens": 1614439.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 7.079647397994995,
|
|
"epoch": 0.7012871726586773,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.99,
|
|
"mean_token_accuracy": 0.09851381108164788,
|
|
"num_tokens": 1625004.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 7.182702732086182,
|
|
"epoch": 0.7057256990679095,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 7.0091,
|
|
"mean_token_accuracy": 0.09595384523272514,
|
|
"num_tokens": 1634188.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 7.0714222431182865,
|
|
"epoch": 0.7101642254771416,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.9157,
|
|
"mean_token_accuracy": 0.1082749105989933,
|
|
"num_tokens": 1642633.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 7.0621692657470705,
|
|
"epoch": 0.7146027518863737,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.9424,
|
|
"mean_token_accuracy": 0.10712620615959167,
|
|
"num_tokens": 1654536.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 7.148227691650391,
|
|
"epoch": 0.7190412782956058,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 7.0822,
|
|
"mean_token_accuracy": 0.09017667174339294,
|
|
"num_tokens": 1665083.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 7.069796466827393,
|
|
"epoch": 0.723479804704838,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 7.033,
|
|
"mean_token_accuracy": 0.09541632980108261,
|
|
"num_tokens": 1675826.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 7.110815143585205,
|
|
"epoch": 0.7279183311140701,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.9946,
|
|
"mean_token_accuracy": 0.10398527979850769,
|
|
"num_tokens": 1685806.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 7.097141170501709,
|
|
"epoch": 0.7323568575233023,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000412,
|
|
"loss": 7.0632,
|
|
"mean_token_accuracy": 0.10135304108262062,
|
|
"num_tokens": 1695984.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 7.124357271194458,
|
|
"epoch": 0.7367953839325344,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 7.0575,
|
|
"mean_token_accuracy": 0.09942566752433776,
|
|
"num_tokens": 1706086.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 7.091458511352539,
|
|
"epoch": 0.7412339103417666,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 7.0284,
|
|
"mean_token_accuracy": 0.10059899911284446,
|
|
"num_tokens": 1718040.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 7.131758165359497,
|
|
"epoch": 0.7456724367509987,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 7.0191,
|
|
"mean_token_accuracy": 0.09906580075621604,
|
|
"num_tokens": 1729009.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 7.087246465682983,
|
|
"epoch": 0.7501109631602308,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.9929,
|
|
"mean_token_accuracy": 0.10902519077062607,
|
|
"num_tokens": 1738895.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 7.113551664352417,
|
|
"epoch": 0.7545494895694629,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 7.0261,
|
|
"mean_token_accuracy": 0.10415812507271767,
|
|
"num_tokens": 1750225.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 7.0047619342803955,
|
|
"epoch": 0.758988015978695,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.9292,
|
|
"mean_token_accuracy": 0.105811557918787,
|
|
"num_tokens": 1761224.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 7.085004186630249,
|
|
"epoch": 0.7634265423879272,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 7.0169,
|
|
"mean_token_accuracy": 0.09775067865848541,
|
|
"num_tokens": 1771853.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 7.146742153167724,
|
|
"epoch": 0.7678650687971593,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.9895,
|
|
"mean_token_accuracy": 0.10439399853348733,
|
|
"num_tokens": 1781186.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 7.151022291183471,
|
|
"epoch": 0.7723035952063915,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.9711,
|
|
"mean_token_accuracy": 0.09423294179141521,
|
|
"num_tokens": 1792887.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.941896152496338,
|
|
"epoch": 0.7767421216156236,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.8708,
|
|
"mean_token_accuracy": 0.10734946057200431,
|
|
"num_tokens": 1803050.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.811341190338135,
|
|
"epoch": 0.7811806480248558,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.9879,
|
|
"mean_token_accuracy": 0.10939516723155976,
|
|
"num_tokens": 1813287.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 7.056670713424682,
|
|
"epoch": 0.7856191744340879,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.9735,
|
|
"mean_token_accuracy": 0.1008478730916977,
|
|
"num_tokens": 1824425.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.97848916053772,
|
|
"epoch": 0.79005770084332,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.8898,
|
|
"mean_token_accuracy": 0.11324303895235062,
|
|
"num_tokens": 1833968.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.980572080612182,
|
|
"epoch": 0.7944962272525522,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000447,
|
|
"loss": 7.0128,
|
|
"mean_token_accuracy": 0.10274540036916732,
|
|
"num_tokens": 1844097.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 7.055815601348877,
|
|
"epoch": 0.7989347536617842,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.934,
|
|
"mean_token_accuracy": 0.10776300206780434,
|
|
"num_tokens": 1854395.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.931429195404053,
|
|
"epoch": 0.8033732800710164,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.949,
|
|
"mean_token_accuracy": 0.10048572197556496,
|
|
"num_tokens": 1864531.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.998499774932862,
|
|
"epoch": 0.8078118064802485,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.8224,
|
|
"mean_token_accuracy": 0.11029603257775307,
|
|
"num_tokens": 1875071.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.971027994155884,
|
|
"epoch": 0.8122503328894807,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.947,
|
|
"mean_token_accuracy": 0.10487593412399292,
|
|
"num_tokens": 1884633.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.975761222839355,
|
|
"epoch": 0.8166888592987128,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.9402,
|
|
"mean_token_accuracy": 0.10628680288791656,
|
|
"num_tokens": 1895204.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 7.054645633697509,
|
|
"epoch": 0.821127385707945,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.9658,
|
|
"mean_token_accuracy": 0.10290167108178139,
|
|
"num_tokens": 1906187.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 7.008241748809814,
|
|
"epoch": 0.8255659121171771,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.9215,
|
|
"mean_token_accuracy": 0.09948821216821671,
|
|
"num_tokens": 1915585.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.954188346862793,
|
|
"epoch": 0.8300044385264093,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.9624,
|
|
"mean_token_accuracy": 0.1034872155636549,
|
|
"num_tokens": 1926912.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.975879383087158,
|
|
"epoch": 0.8344429649356414,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.8828,
|
|
"mean_token_accuracy": 0.1049314372241497,
|
|
"num_tokens": 1936542.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 7.032291650772095,
|
|
"epoch": 0.8388814913448736,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.8869,
|
|
"mean_token_accuracy": 0.1079288512468338,
|
|
"num_tokens": 1946052.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.855350923538208,
|
|
"epoch": 0.8433200177541056,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.9479,
|
|
"mean_token_accuracy": 0.10810579061508178,
|
|
"num_tokens": 1957352.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 7.012834692001343,
|
|
"epoch": 0.8477585441633377,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.9165,
|
|
"mean_token_accuracy": 0.10588640198111535,
|
|
"num_tokens": 1967538.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.953670644760132,
|
|
"epoch": 0.8521970705725699,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.9437,
|
|
"mean_token_accuracy": 0.10475035384297371,
|
|
"num_tokens": 1977620.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 7.001286792755127,
|
|
"epoch": 0.856635596981802,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.8474,
|
|
"mean_token_accuracy": 0.10972543135285377,
|
|
"num_tokens": 1987534.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.883567142486572,
|
|
"epoch": 0.8610741233910342,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.8677,
|
|
"mean_token_accuracy": 0.11282802000641823,
|
|
"num_tokens": 1997817.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.960841703414917,
|
|
"epoch": 0.8655126498002663,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.8693,
|
|
"mean_token_accuracy": 0.10804260671138763,
|
|
"num_tokens": 2007529.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.893871688842774,
|
|
"epoch": 0.8699511762094985,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.8747,
|
|
"mean_token_accuracy": 0.1100342482328415,
|
|
"num_tokens": 2017317.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.920565032958985,
|
|
"epoch": 0.8743897026187306,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.8925,
|
|
"mean_token_accuracy": 0.10560473203659057,
|
|
"num_tokens": 2028427.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.928885173797608,
|
|
"epoch": 0.8788282290279628,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.8469,
|
|
"mean_token_accuracy": 0.111257666349411,
|
|
"num_tokens": 2038464.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.895605516433716,
|
|
"epoch": 0.8832667554371949,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.9248,
|
|
"mean_token_accuracy": 0.10252941846847534,
|
|
"num_tokens": 2049006.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.840125465393067,
|
|
"epoch": 0.8877052818464269,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.8673,
|
|
"mean_token_accuracy": 0.10938069224357605,
|
|
"num_tokens": 2060436.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 0.8877052818464269,
|
|
"eval_entropy": 6.823905027394057,
|
|
"eval_loss": 6.903217315673828,
|
|
"eval_mean_token_accuracy": 0.10246794701790583,
|
|
"eval_num_tokens": 2060436.0,
|
|
"eval_runtime": 2.7045,
|
|
"eval_samples_per_second": 1244.948,
|
|
"eval_steps_per_second": 155.665,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.8510839462280275,
|
|
"epoch": 0.8921438082556591,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004999998312369076,
|
|
"loss": 6.7705,
|
|
"mean_token_accuracy": 0.1085792139172554,
|
|
"num_tokens": 2070906.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.848130416870117,
|
|
"epoch": 0.8965823346648912,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004999991456372788,
|
|
"loss": 6.8232,
|
|
"mean_token_accuracy": 0.10221576392650604,
|
|
"num_tokens": 2080563.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.826877164840698,
|
|
"epoch": 0.9010208610741234,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000499997932655026,
|
|
"loss": 6.7509,
|
|
"mean_token_accuracy": 0.11835153996944428,
|
|
"num_tokens": 2089785.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.89136643409729,
|
|
"epoch": 0.9054593874833555,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999961922929925,
|
|
"loss": 6.798,
|
|
"mean_token_accuracy": 0.11268565952777862,
|
|
"num_tokens": 2099609.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.894064235687256,
|
|
"epoch": 0.9098979138925877,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999939245552573,
|
|
"loss": 6.8422,
|
|
"mean_token_accuracy": 0.11023318842053413,
|
|
"num_tokens": 2110043.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.8520002365112305,
|
|
"epoch": 0.9143364403018198,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000499991129447136,
|
|
"loss": 6.8665,
|
|
"mean_token_accuracy": 0.1076730340719223,
|
|
"num_tokens": 2119748.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.8474874019622805,
|
|
"epoch": 0.918774966711052,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999878069751803,
|
|
"loss": 6.8907,
|
|
"mean_token_accuracy": 0.10536454170942307,
|
|
"num_tokens": 2130347.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.900251626968384,
|
|
"epoch": 0.9232134931202841,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004999839571471776,
|
|
"loss": 6.7778,
|
|
"mean_token_accuracy": 0.1090541049838066,
|
|
"num_tokens": 2140499.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.788918542861938,
|
|
"epoch": 0.9276520195295161,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999795799721517,
|
|
"loss": 6.7795,
|
|
"mean_token_accuracy": 0.10508258789777755,
|
|
"num_tokens": 2151143.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.702548313140869,
|
|
"epoch": 0.9320905459387483,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004999746754603624,
|
|
"loss": 6.8099,
|
|
"mean_token_accuracy": 0.1090174950659275,
|
|
"num_tokens": 2161651.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.934295988082885,
|
|
"epoch": 0.9365290723479804,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999692436233055,
|
|
"loss": 6.8146,
|
|
"mean_token_accuracy": 0.1094007097184658,
|
|
"num_tokens": 2172152.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.8816564083099365,
|
|
"epoch": 0.9409675987572126,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499963284473713,
|
|
"loss": 6.8335,
|
|
"mean_token_accuracy": 0.1026708424091339,
|
|
"num_tokens": 2182912.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.725460863113403,
|
|
"epoch": 0.9454061251664447,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004999567980255526,
|
|
"loss": 6.8253,
|
|
"mean_token_accuracy": 0.10950745418667793,
|
|
"num_tokens": 2193573.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.998191976547242,
|
|
"epoch": 0.9498446515756769,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004999497842940282,
|
|
"loss": 6.8627,
|
|
"mean_token_accuracy": 0.1091019332408905,
|
|
"num_tokens": 2204157.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.804390239715576,
|
|
"epoch": 0.954283177984909,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004999422432955794,
|
|
"loss": 6.8426,
|
|
"mean_token_accuracy": 0.11238477602601052,
|
|
"num_tokens": 2214433.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.7941382884979244,
|
|
"epoch": 0.9587217043941412,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004999341750478818,
|
|
"loss": 6.7722,
|
|
"mean_token_accuracy": 0.1097018837928772,
|
|
"num_tokens": 2224913.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.810701084136963,
|
|
"epoch": 0.9631602308033733,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000499925579569847,
|
|
"loss": 6.7335,
|
|
"mean_token_accuracy": 0.12259945124387742,
|
|
"num_tokens": 2234871.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.818542575836181,
|
|
"epoch": 0.9675987572126055,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004999164568816219,
|
|
"loss": 6.7889,
|
|
"mean_token_accuracy": 0.10602138787508011,
|
|
"num_tokens": 2244462.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.706165170669555,
|
|
"epoch": 0.9720372836218375,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999068070045897,
|
|
"loss": 6.7827,
|
|
"mean_token_accuracy": 0.10748272910714149,
|
|
"num_tokens": 2256145.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.83993878364563,
|
|
"epoch": 0.9764758100310696,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499896629961369,
|
|
"loss": 6.7837,
|
|
"mean_token_accuracy": 0.11425440460443496,
|
|
"num_tokens": 2265913.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.725751304626465,
|
|
"epoch": 0.9809143364403018,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000499885925775814,
|
|
"loss": 6.7316,
|
|
"mean_token_accuracy": 0.11490511074662209,
|
|
"num_tokens": 2274874.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.830372858047485,
|
|
"epoch": 0.9853528628495339,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004998746944730148,
|
|
"loss": 6.7131,
|
|
"mean_token_accuracy": 0.11283201426267624,
|
|
"num_tokens": 2284767.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.874453449249268,
|
|
"epoch": 0.9897913892587661,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004998629360792965,
|
|
"loss": 6.8831,
|
|
"mean_token_accuracy": 0.10844636484980583,
|
|
"num_tokens": 2295196.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.715284633636474,
|
|
"epoch": 0.9942299156679982,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004998506506222202,
|
|
"loss": 6.7286,
|
|
"mean_token_accuracy": 0.11680992171168328,
|
|
"num_tokens": 2306078.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.814456415176392,
|
|
"epoch": 0.9986684420772304,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004998378381305821,
|
|
"loss": 6.8094,
|
|
"mean_token_accuracy": 0.10992804765701295,
|
|
"num_tokens": 2317229.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.859947204589844,
|
|
"epoch": 1.0026631158455392,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004998244986344138,
|
|
"loss": 6.688,
|
|
"mean_token_accuracy": 0.11234754075606664,
|
|
"num_tokens": 2326312.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.762184476852417,
|
|
"epoch": 1.0071016422547714,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998106321649822,
|
|
"loss": 6.5436,
|
|
"mean_token_accuracy": 0.12012127339839936,
|
|
"num_tokens": 2335548.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.783463954925537,
|
|
"epoch": 1.0115401686640035,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004997962387547893,
|
|
"loss": 6.5731,
|
|
"mean_token_accuracy": 0.11604165062308311,
|
|
"num_tokens": 2346180.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.728586292266845,
|
|
"epoch": 1.0159786950732357,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004997813184375723,
|
|
"loss": 6.5403,
|
|
"mean_token_accuracy": 0.11700786501169205,
|
|
"num_tokens": 2355682.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.737982702255249,
|
|
"epoch": 1.0204172214824678,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004997658712483034,
|
|
"loss": 6.5789,
|
|
"mean_token_accuracy": 0.11569899022579193,
|
|
"num_tokens": 2365529.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.645860004425049,
|
|
"epoch": 1.0248557478917,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997498972231898,
|
|
"loss": 6.4906,
|
|
"mean_token_accuracy": 0.12428833544254303,
|
|
"num_tokens": 2375527.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.723867797851563,
|
|
"epoch": 1.0292942743009321,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004997333963996734,
|
|
"loss": 6.6103,
|
|
"mean_token_accuracy": 0.11796300113201141,
|
|
"num_tokens": 2386425.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.686568021774292,
|
|
"epoch": 1.0337328007101643,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004997163688164313,
|
|
"loss": 6.6209,
|
|
"mean_token_accuracy": 0.11397269815206527,
|
|
"num_tokens": 2396897.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.736155891418457,
|
|
"epoch": 1.0381713271193964,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004996988145133745,
|
|
"loss": 6.6215,
|
|
"mean_token_accuracy": 0.11120860427618026,
|
|
"num_tokens": 2408671.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.68158974647522,
|
|
"epoch": 1.0426098535286286,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004996807335316496,
|
|
"loss": 6.5968,
|
|
"mean_token_accuracy": 0.11955826655030251,
|
|
"num_tokens": 2418373.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.73370852470398,
|
|
"epoch": 1.0470483799378607,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004996621259136368,
|
|
"loss": 6.5516,
|
|
"mean_token_accuracy": 0.12124700546264648,
|
|
"num_tokens": 2429094.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.58090991973877,
|
|
"epoch": 1.0514869063470929,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996429917029513,
|
|
"loss": 6.5521,
|
|
"mean_token_accuracy": 0.11974199712276459,
|
|
"num_tokens": 2439522.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.689072942733764,
|
|
"epoch": 1.055925432756325,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996233309444424,
|
|
"loss": 6.5334,
|
|
"mean_token_accuracy": 0.12693726643919945,
|
|
"num_tokens": 2449900.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.648254156112671,
|
|
"epoch": 1.060363959165557,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004996031436841934,
|
|
"loss": 6.528,
|
|
"mean_token_accuracy": 0.11835195198655128,
|
|
"num_tokens": 2461187.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.613636541366577,
|
|
"epoch": 1.064802485574789,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004995824299695219,
|
|
"loss": 6.5522,
|
|
"mean_token_accuracy": 0.12386145591735839,
|
|
"num_tokens": 2471897.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.695000886917114,
|
|
"epoch": 1.0692410119840212,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004995611898489796,
|
|
"loss": 6.4835,
|
|
"mean_token_accuracy": 0.13428002893924712,
|
|
"num_tokens": 2482668.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.542116737365722,
|
|
"epoch": 1.0736795383932534,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004995394233723516,
|
|
"loss": 6.5273,
|
|
"mean_token_accuracy": 0.12380995452404023,
|
|
"num_tokens": 2492375.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.612301158905029,
|
|
"epoch": 1.0781180648024855,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004995171305906574,
|
|
"loss": 6.5553,
|
|
"mean_token_accuracy": 0.12436272650957107,
|
|
"num_tokens": 2504176.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.712629508972168,
|
|
"epoch": 1.0825565912117177,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004994943115561495,
|
|
"loss": 6.5802,
|
|
"mean_token_accuracy": 0.12135286405682563,
|
|
"num_tokens": 2513437.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.71323561668396,
|
|
"epoch": 1.0869951176209498,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004994709663223143,
|
|
"loss": 6.5305,
|
|
"mean_token_accuracy": 0.12117772102355957,
|
|
"num_tokens": 2524907.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.586472082138061,
|
|
"epoch": 1.091433644030182,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004994470949438712,
|
|
"loss": 6.4818,
|
|
"mean_token_accuracy": 0.1203920915722847,
|
|
"num_tokens": 2535288.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.5804437637329105,
|
|
"epoch": 1.095872170439414,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004994226974767734,
|
|
"loss": 6.5353,
|
|
"mean_token_accuracy": 0.11931732892990113,
|
|
"num_tokens": 2545896.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.543254709243774,
|
|
"epoch": 1.1003106968486462,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004993977739782066,
|
|
"loss": 6.4584,
|
|
"mean_token_accuracy": 0.13561398088932036,
|
|
"num_tokens": 2555440.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.59882869720459,
|
|
"epoch": 1.1047492232578784,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00049937232450659,
|
|
"loss": 6.4693,
|
|
"mean_token_accuracy": 0.12519273459911345,
|
|
"num_tokens": 2565474.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.621742391586304,
|
|
"epoch": 1.1091877496671105,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004993463491215753,
|
|
"loss": 6.5707,
|
|
"mean_token_accuracy": 0.11752136424183846,
|
|
"num_tokens": 2576090.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.66785740852356,
|
|
"epoch": 1.1136262760763427,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000499319847884047,
|
|
"loss": 6.48,
|
|
"mean_token_accuracy": 0.12498680129647255,
|
|
"num_tokens": 2585719.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.547177171707153,
|
|
"epoch": 1.1180648024855748,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004992928208561224,
|
|
"loss": 6.4818,
|
|
"mean_token_accuracy": 0.12778932899236678,
|
|
"num_tokens": 2594797.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.544874048233032,
|
|
"epoch": 1.122503328894807,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004992652681011508,
|
|
"loss": 6.5028,
|
|
"mean_token_accuracy": 0.12365371584892274,
|
|
"num_tokens": 2605525.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.667212867736817,
|
|
"epoch": 1.1269418553040391,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000499237189683714,
|
|
"loss": 6.543,
|
|
"mean_token_accuracy": 0.12363962829113007,
|
|
"num_tokens": 2616478.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.585494756698608,
|
|
"epoch": 1.1313803817132713,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004992085856696259,
|
|
"loss": 6.5255,
|
|
"mean_token_accuracy": 0.12803056016564368,
|
|
"num_tokens": 2626290.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.660335063934326,
|
|
"epoch": 1.1358189081225034,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004991794561259325,
|
|
"loss": 6.5861,
|
|
"mean_token_accuracy": 0.11459894254803657,
|
|
"num_tokens": 2637319.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.654719829559326,
|
|
"epoch": 1.1402574345317356,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004991498011209112,
|
|
"loss": 6.5036,
|
|
"mean_token_accuracy": 0.1196965254843235,
|
|
"num_tokens": 2648140.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.520665168762207,
|
|
"epoch": 1.1446959609409677,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004991196207240714,
|
|
"loss": 6.5534,
|
|
"mean_token_accuracy": 0.12024708986282348,
|
|
"num_tokens": 2658561.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.740872001647949,
|
|
"epoch": 1.1491344873501999,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004990889150061541,
|
|
"loss": 6.421,
|
|
"mean_token_accuracy": 0.13026004359126092,
|
|
"num_tokens": 2670233.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.636859560012818,
|
|
"epoch": 1.1535730137594318,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004990576840391312,
|
|
"loss": 6.4896,
|
|
"mean_token_accuracy": 0.12343377694487571,
|
|
"num_tokens": 2681047.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.514160776138306,
|
|
"epoch": 1.158011540168664,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000499025927896206,
|
|
"loss": 6.4793,
|
|
"mean_token_accuracy": 0.12569797188043594,
|
|
"num_tokens": 2691284.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.50507082939148,
|
|
"epoch": 1.162450066577896,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004989936466518127,
|
|
"loss": 6.4791,
|
|
"mean_token_accuracy": 0.12733488231897355,
|
|
"num_tokens": 2702105.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.660071849822998,
|
|
"epoch": 1.1668885929871282,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004989608403816164,
|
|
"loss": 6.4392,
|
|
"mean_token_accuracy": 0.1262727789580822,
|
|
"num_tokens": 2712003.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.480842781066895,
|
|
"epoch": 1.1713271193963604,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004989275091625126,
|
|
"loss": 6.4644,
|
|
"mean_token_accuracy": 0.12619971707463265,
|
|
"num_tokens": 2721609.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.514829921722412,
|
|
"epoch": 1.1757656458055925,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004988936530726276,
|
|
"loss": 6.3574,
|
|
"mean_token_accuracy": 0.1336055465042591,
|
|
"num_tokens": 2731036.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.577421188354492,
|
|
"epoch": 1.1802041722148247,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004988592721913176,
|
|
"loss": 6.4856,
|
|
"mean_token_accuracy": 0.12642226815223695,
|
|
"num_tokens": 2741860.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.4255718231201175,
|
|
"epoch": 1.1846426986240568,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004988243665991692,
|
|
"loss": 6.4757,
|
|
"mean_token_accuracy": 0.12892607748508453,
|
|
"num_tokens": 2751898.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.610957288742066,
|
|
"epoch": 1.189081225033289,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004987889363779985,
|
|
"loss": 6.4425,
|
|
"mean_token_accuracy": 0.13178927153348924,
|
|
"num_tokens": 2761193.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.46262493133545,
|
|
"epoch": 1.193519751442521,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004987529816108517,
|
|
"loss": 6.4799,
|
|
"mean_token_accuracy": 0.1273398607969284,
|
|
"num_tokens": 2771693.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.6233940601348875,
|
|
"epoch": 1.1979582778517532,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004987165023820043,
|
|
"loss": 6.4757,
|
|
"mean_token_accuracy": 0.12488154098391532,
|
|
"num_tokens": 2780680.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.422232627868652,
|
|
"epoch": 1.2023968042609854,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004986794987769611,
|
|
"loss": 6.4691,
|
|
"mean_token_accuracy": 0.13016403540968896,
|
|
"num_tokens": 2792049.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.61912989616394,
|
|
"epoch": 1.2068353306702175,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000498641970882456,
|
|
"loss": 6.5094,
|
|
"mean_token_accuracy": 0.11824153885245323,
|
|
"num_tokens": 2802284.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.5044067859649655,
|
|
"epoch": 1.2112738570794497,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004986039187864518,
|
|
"loss": 6.4687,
|
|
"mean_token_accuracy": 0.1283252492547035,
|
|
"num_tokens": 2812791.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 6.563082885742188,
|
|
"epoch": 1.2157123834886818,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004985653425781401,
|
|
"loss": 6.5185,
|
|
"mean_token_accuracy": 0.12203285768628121,
|
|
"num_tokens": 2823216.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.505474853515625,
|
|
"epoch": 1.220150909897914,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004985262423479408,
|
|
"loss": 6.4274,
|
|
"mean_token_accuracy": 0.13895628824830056,
|
|
"num_tokens": 2832582.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.52580771446228,
|
|
"epoch": 1.2245894363071461,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004984866181875021,
|
|
"loss": 6.4579,
|
|
"mean_token_accuracy": 0.12877390310168266,
|
|
"num_tokens": 2843576.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.516999197006226,
|
|
"epoch": 1.229027962716378,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004984464701897005,
|
|
"loss": 6.456,
|
|
"mean_token_accuracy": 0.12886594235897064,
|
|
"num_tokens": 2854028.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.550729846954345,
|
|
"epoch": 1.2334664891256102,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004984057984486402,
|
|
"loss": 6.4491,
|
|
"mean_token_accuracy": 0.1290650874376297,
|
|
"num_tokens": 2863695.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.497787046432495,
|
|
"epoch": 1.2379050155348423,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004983646030596527,
|
|
"loss": 6.4078,
|
|
"mean_token_accuracy": 0.12960500344634057,
|
|
"num_tokens": 2873134.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.530357122421265,
|
|
"epoch": 1.2423435419440745,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004983228841192975,
|
|
"loss": 6.4504,
|
|
"mean_token_accuracy": 0.12851642668247223,
|
|
"num_tokens": 2883559.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.488299894332886,
|
|
"epoch": 1.2467820683533066,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004982806417253607,
|
|
"loss": 6.422,
|
|
"mean_token_accuracy": 0.12727490290999413,
|
|
"num_tokens": 2893541.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.5642862796783445,
|
|
"epoch": 1.2512205947625388,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004982378759768557,
|
|
"loss": 6.459,
|
|
"mean_token_accuracy": 0.12929099127650262,
|
|
"num_tokens": 2903390.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.462419414520264,
|
|
"epoch": 1.255659121171771,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004981945869740225,
|
|
"loss": 6.3934,
|
|
"mean_token_accuracy": 0.13202970251441,
|
|
"num_tokens": 2913071.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.547803783416748,
|
|
"epoch": 1.260097647581003,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004981507748183276,
|
|
"loss": 6.5538,
|
|
"mean_token_accuracy": 0.12963883131742476,
|
|
"num_tokens": 2925266.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.489030170440674,
|
|
"epoch": 1.2645361739902352,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004981064396124635,
|
|
"loss": 6.4396,
|
|
"mean_token_accuracy": 0.12705525755882263,
|
|
"num_tokens": 2935347.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 6.553302574157715,
|
|
"epoch": 1.2689747003994674,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004980615814603492,
|
|
"loss": 6.5228,
|
|
"mean_token_accuracy": 0.12255004495382309,
|
|
"num_tokens": 2945381.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.548076343536377,
|
|
"epoch": 1.2734132268086995,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004980162004671288,
|
|
"loss": 6.4853,
|
|
"mean_token_accuracy": 0.12323620095849037,
|
|
"num_tokens": 2956332.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.490498161315918,
|
|
"epoch": 1.2778517532179317,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004979702967391725,
|
|
"loss": 6.4637,
|
|
"mean_token_accuracy": 0.1297840654850006,
|
|
"num_tokens": 2966563.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.459001588821411,
|
|
"epoch": 1.2822902796271638,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004979238703840755,
|
|
"loss": 6.4291,
|
|
"mean_token_accuracy": 0.13188086450099945,
|
|
"num_tokens": 2976078.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.535675382614135,
|
|
"epoch": 1.286728806036396,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004978769215106579,
|
|
"loss": 6.51,
|
|
"mean_token_accuracy": 0.11516684889793397,
|
|
"num_tokens": 2985889.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.561489534378052,
|
|
"epoch": 1.291167332445628,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004978294502289646,
|
|
"loss": 6.4789,
|
|
"mean_token_accuracy": 0.12259078919887542,
|
|
"num_tokens": 2996244.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.490956830978393,
|
|
"epoch": 1.2956058588548602,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004977814566502651,
|
|
"loss": 6.4193,
|
|
"mean_token_accuracy": 0.12861331328749656,
|
|
"num_tokens": 3006212.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.499041128158569,
|
|
"epoch": 1.3000443852640924,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004977329408870532,
|
|
"loss": 6.409,
|
|
"mean_token_accuracy": 0.12722128033638,
|
|
"num_tokens": 3016763.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 6.4857086658477785,
|
|
"epoch": 1.3044829116733245,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004976839030530464,
|
|
"loss": 6.3783,
|
|
"mean_token_accuracy": 0.13740343004465103,
|
|
"num_tokens": 3027111.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.542345571517944,
|
|
"epoch": 1.3089214380825567,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000497634343263186,
|
|
"loss": 6.4623,
|
|
"mean_token_accuracy": 0.12753049805760383,
|
|
"num_tokens": 3037549.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.353925800323486,
|
|
"epoch": 1.3133599644917888,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004975842616336369,
|
|
"loss": 6.386,
|
|
"mean_token_accuracy": 0.13300835117697715,
|
|
"num_tokens": 3048033.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.501514005661011,
|
|
"epoch": 1.317798490901021,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004975336582817869,
|
|
"loss": 6.3997,
|
|
"mean_token_accuracy": 0.13204055801033973,
|
|
"num_tokens": 3057503.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.487248039245605,
|
|
"epoch": 1.3222370173102531,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004974825333262469,
|
|
"loss": 6.4642,
|
|
"mean_token_accuracy": 0.12323634922504426,
|
|
"num_tokens": 3068216.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 6.558629322052002,
|
|
"epoch": 1.3266755437194853,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004974308868868501,
|
|
"loss": 6.4271,
|
|
"mean_token_accuracy": 0.13236989378929137,
|
|
"num_tokens": 3079471.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.5367296695709225,
|
|
"epoch": 1.3311140701287172,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0004973787190846524,
|
|
"loss": 6.518,
|
|
"mean_token_accuracy": 0.12429615929722786,
|
|
"num_tokens": 3090996.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 1.3311140701287172,
|
|
"eval_entropy": 6.421620451639497,
|
|
"eval_loss": 6.5496826171875,
|
|
"eval_mean_token_accuracy": 0.12521972324955774,
|
|
"eval_num_tokens": 3090996.0,
|
|
"eval_runtime": 2.6959,
|
|
"eval_samples_per_second": 1248.929,
|
|
"eval_steps_per_second": 156.163,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.472316646575928,
|
|
"epoch": 1.3355525965379493,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004973260300419316,
|
|
"loss": 6.466,
|
|
"mean_token_accuracy": 0.1273823134601116,
|
|
"num_tokens": 3100445.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.405650186538696,
|
|
"epoch": 1.3399911229471815,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004972728198821871,
|
|
"loss": 6.3772,
|
|
"mean_token_accuracy": 0.13720163628458976,
|
|
"num_tokens": 3110065.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 6.48620924949646,
|
|
"epoch": 1.3444296493564136,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00049721908873014,
|
|
"loss": 6.4228,
|
|
"mean_token_accuracy": 0.12824928835034372,
|
|
"num_tokens": 3120323.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.523930549621582,
|
|
"epoch": 1.3488681757656458,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004971648367117323,
|
|
"loss": 6.464,
|
|
"mean_token_accuracy": 0.12202735692262649,
|
|
"num_tokens": 3131268.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.500436449050904,
|
|
"epoch": 1.353306702174878,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004971100639541271,
|
|
"loss": 6.3697,
|
|
"mean_token_accuracy": 0.13300676867365838,
|
|
"num_tokens": 3141529.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.385044431686401,
|
|
"epoch": 1.35774522858411,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000497054770585708,
|
|
"loss": 6.3884,
|
|
"mean_token_accuracy": 0.13427990674972534,
|
|
"num_tokens": 3151096.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 6.540951824188232,
|
|
"epoch": 1.3621837549933422,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004969989567360788,
|
|
"loss": 6.3651,
|
|
"mean_token_accuracy": 0.126102414727211,
|
|
"num_tokens": 3160900.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.315720701217652,
|
|
"epoch": 1.3666222814025744,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004969426225360635,
|
|
"loss": 6.3444,
|
|
"mean_token_accuracy": 0.1334808275103569,
|
|
"num_tokens": 3171303.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.431712341308594,
|
|
"epoch": 1.3710608078118065,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004968857681177056,
|
|
"loss": 6.4942,
|
|
"mean_token_accuracy": 0.12975035086274148,
|
|
"num_tokens": 3181924.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.435882043838501,
|
|
"epoch": 1.3754993342210386,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004968283936142679,
|
|
"loss": 6.359,
|
|
"mean_token_accuracy": 0.13290246427059174,
|
|
"num_tokens": 3192018.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 6.475548458099365,
|
|
"epoch": 1.3799378606302708,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004967704991602322,
|
|
"loss": 6.3652,
|
|
"mean_token_accuracy": 0.1294732205569744,
|
|
"num_tokens": 3203064.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.439318323135376,
|
|
"epoch": 1.384376387039503,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004967120848912995,
|
|
"loss": 6.3961,
|
|
"mean_token_accuracy": 0.12799521535634995,
|
|
"num_tokens": 3213651.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.372346305847168,
|
|
"epoch": 1.388814913448735,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004966531509443884,
|
|
"loss": 6.3479,
|
|
"mean_token_accuracy": 0.13649084344506263,
|
|
"num_tokens": 3224152.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.471084785461426,
|
|
"epoch": 1.3932534398579672,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0004965936974576363,
|
|
"loss": 6.3545,
|
|
"mean_token_accuracy": 0.13298841714859008,
|
|
"num_tokens": 3234185.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.455093669891357,
|
|
"epoch": 1.3976919662671992,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004965337245703981,
|
|
"loss": 6.3767,
|
|
"mean_token_accuracy": 0.12946312502026558,
|
|
"num_tokens": 3244509.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.458269500732422,
|
|
"epoch": 1.4021304926764313,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004964732324232462,
|
|
"loss": 6.4008,
|
|
"mean_token_accuracy": 0.12682827115058898,
|
|
"num_tokens": 3255157.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 6.34567403793335,
|
|
"epoch": 1.4065690190856635,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00049641222115797,
|
|
"loss": 6.2956,
|
|
"mean_token_accuracy": 0.13407586440443992,
|
|
"num_tokens": 3264367.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 6.4444191455841064,
|
|
"epoch": 1.4110075454948956,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004963506909175758,
|
|
"loss": 6.3853,
|
|
"mean_token_accuracy": 0.12875387147068978,
|
|
"num_tokens": 3274678.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.426648998260498,
|
|
"epoch": 1.4154460719041277,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000496288641846286,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.1277147874236107,
|
|
"num_tokens": 3285817.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.372090244293213,
|
|
"epoch": 1.41988459831336,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004962260740895398,
|
|
"loss": 6.2855,
|
|
"mean_token_accuracy": 0.13827268779277802,
|
|
"num_tokens": 3296303.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.379140472412109,
|
|
"epoch": 1.424323124722592,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004961629877939913,
|
|
"loss": 6.3871,
|
|
"mean_token_accuracy": 0.1381452649831772,
|
|
"num_tokens": 3305686.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.410601949691772,
|
|
"epoch": 1.4287616511318242,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000496099383107511,
|
|
"loss": 6.3337,
|
|
"mean_token_accuracy": 0.13385034054517747,
|
|
"num_tokens": 3316243.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.363243675231933,
|
|
"epoch": 1.4332001775410563,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004960352601791835,
|
|
"loss": 6.3509,
|
|
"mean_token_accuracy": 0.1326597101986408,
|
|
"num_tokens": 3326118.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.420337390899658,
|
|
"epoch": 1.4376387039502885,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004959706191593087,
|
|
"loss": 6.2826,
|
|
"mean_token_accuracy": 0.139851226657629,
|
|
"num_tokens": 3336597.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 6.367270183563233,
|
|
"epoch": 1.4420772303595206,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004959054601994007,
|
|
"loss": 6.3475,
|
|
"mean_token_accuracy": 0.13378802165389062,
|
|
"num_tokens": 3346958.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 6.393503141403198,
|
|
"epoch": 1.4465157567687528,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004958397834521878,
|
|
"loss": 6.3568,
|
|
"mean_token_accuracy": 0.1363594651222229,
|
|
"num_tokens": 3357068.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 6.357707118988037,
|
|
"epoch": 1.450954283177985,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004957735890716115,
|
|
"loss": 6.3272,
|
|
"mean_token_accuracy": 0.1293055720627308,
|
|
"num_tokens": 3367710.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.438919878005981,
|
|
"epoch": 1.455392809587217,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004957068772128273,
|
|
"loss": 6.3926,
|
|
"mean_token_accuracy": 0.12550436183810235,
|
|
"num_tokens": 3377146.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.4241721630096436,
|
|
"epoch": 1.4598313359964492,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000495639648032203,
|
|
"loss": 6.2687,
|
|
"mean_token_accuracy": 0.13697705715894698,
|
|
"num_tokens": 3387494.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 6.404942893981934,
|
|
"epoch": 1.4642698624056814,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004955719016873192,
|
|
"loss": 6.271,
|
|
"mean_token_accuracy": 0.1324605606496334,
|
|
"num_tokens": 3397667.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.341697072982788,
|
|
"epoch": 1.4687083888149135,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004955036383369688,
|
|
"loss": 6.2882,
|
|
"mean_token_accuracy": 0.13828188329935073,
|
|
"num_tokens": 3407245.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 6.33912615776062,
|
|
"epoch": 1.4731469152241456,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004954348581411564,
|
|
"loss": 6.3502,
|
|
"mean_token_accuracy": 0.13207383826375008,
|
|
"num_tokens": 3417796.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.365179395675659,
|
|
"epoch": 1.4775854416333778,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000495365561261098,
|
|
"loss": 6.3521,
|
|
"mean_token_accuracy": 0.13066228553652764,
|
|
"num_tokens": 3427665.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 6.460514163970947,
|
|
"epoch": 1.48202396804261,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004952957478592209,
|
|
"loss": 6.4161,
|
|
"mean_token_accuracy": 0.13068753182888032,
|
|
"num_tokens": 3438279.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 6.346782398223877,
|
|
"epoch": 1.486462494451842,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004952254180991628,
|
|
"loss": 6.3924,
|
|
"mean_token_accuracy": 0.1330470062792301,
|
|
"num_tokens": 3448722.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.355397272109985,
|
|
"epoch": 1.4909010208610742,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004951545721457719,
|
|
"loss": 6.3045,
|
|
"mean_token_accuracy": 0.14068271815776826,
|
|
"num_tokens": 3459050.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 6.3841273307800295,
|
|
"epoch": 1.4953395472703064,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004950832101651062,
|
|
"loss": 6.2644,
|
|
"mean_token_accuracy": 0.13605008125305176,
|
|
"num_tokens": 3468833.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 6.393172645568848,
|
|
"epoch": 1.4997780736795385,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004950113323244336,
|
|
"loss": 6.3353,
|
|
"mean_token_accuracy": 0.13272473365068435,
|
|
"num_tokens": 3479119.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.422500705718994,
|
|
"epoch": 1.5042166000887707,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004949389387922305,
|
|
"loss": 6.3001,
|
|
"mean_token_accuracy": 0.13518199026584626,
|
|
"num_tokens": 3490339.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 6.375849771499634,
|
|
"epoch": 1.5086551264980028,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004948660297381826,
|
|
"loss": 6.2959,
|
|
"mean_token_accuracy": 0.13820037841796876,
|
|
"num_tokens": 3500645.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 6.326462697982788,
|
|
"epoch": 1.5130936529072347,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004947926053331836,
|
|
"loss": 6.273,
|
|
"mean_token_accuracy": 0.139491256326437,
|
|
"num_tokens": 3510393.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.408394193649292,
|
|
"epoch": 1.517532179316467,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004947186657493354,
|
|
"loss": 6.2666,
|
|
"mean_token_accuracy": 0.14247287064790726,
|
|
"num_tokens": 3520707.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 6.333920478820801,
|
|
"epoch": 1.521970705725699,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004946442111599473,
|
|
"loss": 6.4165,
|
|
"mean_token_accuracy": 0.13150266110897063,
|
|
"num_tokens": 3532101.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.405943059921265,
|
|
"epoch": 1.5264092321349312,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004945692417395358,
|
|
"loss": 6.2607,
|
|
"mean_token_accuracy": 0.13934548795223237,
|
|
"num_tokens": 3541270.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.301887083053589,
|
|
"epoch": 1.5308477585441633,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000494493757663824,
|
|
"loss": 6.3411,
|
|
"mean_token_accuracy": 0.13587306886911393,
|
|
"num_tokens": 3550959.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.384119939804077,
|
|
"epoch": 1.5352862849533955,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004944177591097415,
|
|
"loss": 6.3751,
|
|
"mean_token_accuracy": 0.13755866140127182,
|
|
"num_tokens": 3561853.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 6.344173955917358,
|
|
"epoch": 1.5397248113626276,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004943412462554236,
|
|
"loss": 6.3123,
|
|
"mean_token_accuracy": 0.13452489599585532,
|
|
"num_tokens": 3573060.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.308044004440307,
|
|
"epoch": 1.5441633377718598,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004942642192802114,
|
|
"loss": 6.328,
|
|
"mean_token_accuracy": 0.1374310664832592,
|
|
"num_tokens": 3582777.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 6.439042711257935,
|
|
"epoch": 1.548601864181092,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004941866783646508,
|
|
"loss": 6.3345,
|
|
"mean_token_accuracy": 0.13529076278209687,
|
|
"num_tokens": 3592978.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.348781871795654,
|
|
"epoch": 1.553040390590324,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004941086236904923,
|
|
"loss": 6.3061,
|
|
"mean_token_accuracy": 0.13936796635389329,
|
|
"num_tokens": 3603355.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.436870050430298,
|
|
"epoch": 1.557478916999556,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004940300554406909,
|
|
"loss": 6.3498,
|
|
"mean_token_accuracy": 0.1272510677576065,
|
|
"num_tokens": 3614843.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 6.3685750484466555,
|
|
"epoch": 1.5619174434087881,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000493950973799405,
|
|
"loss": 6.2738,
|
|
"mean_token_accuracy": 0.14151667505502702,
|
|
"num_tokens": 3623953.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.366236734390259,
|
|
"epoch": 1.5663559698180203,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004938713789519967,
|
|
"loss": 6.3528,
|
|
"mean_token_accuracy": 0.13301268741488456,
|
|
"num_tokens": 3634762.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.44322018623352,
|
|
"epoch": 1.5707944962272524,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004937912710850309,
|
|
"loss": 6.3909,
|
|
"mean_token_accuracy": 0.12702670469880104,
|
|
"num_tokens": 3645597.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 6.3498796939849855,
|
|
"epoch": 1.5752330226364846,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004937106503862749,
|
|
"loss": 6.2962,
|
|
"mean_token_accuracy": 0.1402463473379612,
|
|
"num_tokens": 3655895.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.3070460796356205,
|
|
"epoch": 1.5796715490457167,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004936295170446981,
|
|
"loss": 6.2705,
|
|
"mean_token_accuracy": 0.13688953965902328,
|
|
"num_tokens": 3667181.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 6.274955320358276,
|
|
"epoch": 1.5841100754549489,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004935478712504715,
|
|
"loss": 6.2313,
|
|
"mean_token_accuracy": 0.14355697929859162,
|
|
"num_tokens": 3676675.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.3787109375,
|
|
"epoch": 1.588548601864181,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004934657131949674,
|
|
"loss": 6.293,
|
|
"mean_token_accuracy": 0.13846610561013223,
|
|
"num_tokens": 3687354.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 6.278066110610962,
|
|
"epoch": 1.5929871282734132,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004933830430707585,
|
|
"loss": 6.3331,
|
|
"mean_token_accuracy": 0.1389099143445492,
|
|
"num_tokens": 3696762.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.403505325317383,
|
|
"epoch": 1.5974256546826453,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000493299861071618,
|
|
"loss": 6.3193,
|
|
"mean_token_accuracy": 0.13765995875000953,
|
|
"num_tokens": 3706671.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.346765232086182,
|
|
"epoch": 1.6018641810918774,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004932161673925189,
|
|
"loss": 6.3211,
|
|
"mean_token_accuracy": 0.14222623705863952,
|
|
"num_tokens": 3716047.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 6.480462837219238,
|
|
"epoch": 1.6063027075011096,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004931319622296333,
|
|
"loss": 6.3733,
|
|
"mean_token_accuracy": 0.12890343070030214,
|
|
"num_tokens": 3728249.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.327421188354492,
|
|
"epoch": 1.6107412339103417,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004930472457803324,
|
|
"loss": 6.2919,
|
|
"mean_token_accuracy": 0.14020831808447837,
|
|
"num_tokens": 3739164.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.408966207504273,
|
|
"epoch": 1.6151797603195739,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004929620182431858,
|
|
"loss": 6.303,
|
|
"mean_token_accuracy": 0.142412880808115,
|
|
"num_tokens": 3749190.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.261825037002564,
|
|
"epoch": 1.619618286728806,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004928762798179612,
|
|
"loss": 6.2169,
|
|
"mean_token_accuracy": 0.1475951187312603,
|
|
"num_tokens": 3760265.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 6.274430656433106,
|
|
"epoch": 1.6240568131380382,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004927900307056233,
|
|
"loss": 6.2945,
|
|
"mean_token_accuracy": 0.13552614152431489,
|
|
"num_tokens": 3771068.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.3409483432769775,
|
|
"epoch": 1.6284953395472703,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004927032711083342,
|
|
"loss": 6.297,
|
|
"mean_token_accuracy": 0.13993098884820937,
|
|
"num_tokens": 3781230.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.295605039596557,
|
|
"epoch": 1.6329338659565025,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004926160012294526,
|
|
"loss": 6.2502,
|
|
"mean_token_accuracy": 0.14423105642199516,
|
|
"num_tokens": 3791435.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.265171527862549,
|
|
"epoch": 1.6373723923657346,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000492528221273533,
|
|
"loss": 6.2049,
|
|
"mean_token_accuracy": 0.14195780605077743,
|
|
"num_tokens": 3801680.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 6.373475074768066,
|
|
"epoch": 1.6418109187749668,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004924399314463258,
|
|
"loss": 6.3058,
|
|
"mean_token_accuracy": 0.13744521513581276,
|
|
"num_tokens": 3812005.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.294007301330566,
|
|
"epoch": 1.646249445184199,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004923511319547761,
|
|
"loss": 6.2355,
|
|
"mean_token_accuracy": 0.1440819539129734,
|
|
"num_tokens": 3821682.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 6.319647216796875,
|
|
"epoch": 1.650687971593431,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000492261823007024,
|
|
"loss": 6.2157,
|
|
"mean_token_accuracy": 0.14868459478020668,
|
|
"num_tokens": 3831725.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.311188554763794,
|
|
"epoch": 1.6551264980026632,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004921720048124034,
|
|
"loss": 6.2569,
|
|
"mean_token_accuracy": 0.13653967306017875,
|
|
"num_tokens": 3840647.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.402250814437866,
|
|
"epoch": 1.6595650244118954,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004920816775814422,
|
|
"loss": 6.3124,
|
|
"mean_token_accuracy": 0.1325970098376274,
|
|
"num_tokens": 3852869.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.3165970802307125,
|
|
"epoch": 1.6640035508211275,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004919908415258612,
|
|
"loss": 6.2912,
|
|
"mean_token_accuracy": 0.14089620634913444,
|
|
"num_tokens": 3863484.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.288156318664551,
|
|
"epoch": 1.6684420772303596,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000491899496858574,
|
|
"loss": 6.2841,
|
|
"mean_token_accuracy": 0.13467081785202026,
|
|
"num_tokens": 3874564.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 6.395035028457642,
|
|
"epoch": 1.6728806036395918,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004918076437936859,
|
|
"loss": 6.3119,
|
|
"mean_token_accuracy": 0.1333139009773731,
|
|
"num_tokens": 3884315.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.327268505096436,
|
|
"epoch": 1.677319130048824,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004917152825464947,
|
|
"loss": 6.2965,
|
|
"mean_token_accuracy": 0.13294868022203446,
|
|
"num_tokens": 3893948.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 6.396142435073853,
|
|
"epoch": 1.681757656458056,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004916224133334885,
|
|
"loss": 6.311,
|
|
"mean_token_accuracy": 0.13014644309878348,
|
|
"num_tokens": 3905099.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.286337661743164,
|
|
"epoch": 1.686196182867288,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004915290363723465,
|
|
"loss": 6.2342,
|
|
"mean_token_accuracy": 0.14227957800030708,
|
|
"num_tokens": 3914674.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.324175691604614,
|
|
"epoch": 1.6906347092765202,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004914351518819379,
|
|
"loss": 6.2272,
|
|
"mean_token_accuracy": 0.14022424072027206,
|
|
"num_tokens": 3925096.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.305720806121826,
|
|
"epoch": 1.6950732356857523,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004913407600823216,
|
|
"loss": 6.2887,
|
|
"mean_token_accuracy": 0.1422324001789093,
|
|
"num_tokens": 3935048.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.279489135742187,
|
|
"epoch": 1.6995117620949844,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004912458611947454,
|
|
"loss": 6.2333,
|
|
"mean_token_accuracy": 0.14147737249732018,
|
|
"num_tokens": 3944021.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.27567949295044,
|
|
"epoch": 1.7039502885042166,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000491150455441646,
|
|
"loss": 6.166,
|
|
"mean_token_accuracy": 0.14739958047866822,
|
|
"num_tokens": 3953587.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 6.247754430770874,
|
|
"epoch": 1.7083888149134487,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004910545430466478,
|
|
"loss": 6.2706,
|
|
"mean_token_accuracy": 0.13362218514084817,
|
|
"num_tokens": 3963981.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.270370864868164,
|
|
"epoch": 1.7128273413226809,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004909581242345628,
|
|
"loss": 6.2833,
|
|
"mean_token_accuracy": 0.14019264951348304,
|
|
"num_tokens": 3973720.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 6.295551729202271,
|
|
"epoch": 1.717265867731913,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004908611992313905,
|
|
"loss": 6.222,
|
|
"mean_token_accuracy": 0.14261915981769563,
|
|
"num_tokens": 3984579.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.264960384368896,
|
|
"epoch": 1.7217043941411452,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004907637682643162,
|
|
"loss": 6.245,
|
|
"mean_token_accuracy": 0.1404101848602295,
|
|
"num_tokens": 3994609.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 6.302646636962891,
|
|
"epoch": 1.7261429205503773,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004906658315617112,
|
|
"loss": 6.2902,
|
|
"mean_token_accuracy": 0.13819315508008004,
|
|
"num_tokens": 4004969.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.248818016052246,
|
|
"epoch": 1.7305814469596092,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004905673893531331,
|
|
"loss": 6.3268,
|
|
"mean_token_accuracy": 0.1326567329466343,
|
|
"num_tokens": 4016098.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 6.397868633270264,
|
|
"epoch": 1.7350199733688414,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004904684418693231,
|
|
"loss": 6.233,
|
|
"mean_token_accuracy": 0.14564677476882934,
|
|
"num_tokens": 4025744.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.238390398025513,
|
|
"epoch": 1.7394584997780735,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004903689893422077,
|
|
"loss": 6.2537,
|
|
"mean_token_accuracy": 0.13860218822956086,
|
|
"num_tokens": 4036532.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 6.4320872783660885,
|
|
"epoch": 1.7438970261873057,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004902690320048966,
|
|
"loss": 6.3386,
|
|
"mean_token_accuracy": 0.13317947015166282,
|
|
"num_tokens": 4047350.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.341959428787232,
|
|
"epoch": 1.7483355525965378,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000490168570091683,
|
|
"loss": 6.3134,
|
|
"mean_token_accuracy": 0.14479754120111465,
|
|
"num_tokens": 4058223.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.26735486984253,
|
|
"epoch": 1.75277407900577,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004900676038380429,
|
|
"loss": 6.2377,
|
|
"mean_token_accuracy": 0.1400671385228634,
|
|
"num_tokens": 4067741.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.2349577903747555,
|
|
"epoch": 1.7572126054150021,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004899661334806342,
|
|
"loss": 6.2507,
|
|
"mean_token_accuracy": 0.1395649529993534,
|
|
"num_tokens": 4078598.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.328679370880127,
|
|
"epoch": 1.7616511318242343,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004898641592572965,
|
|
"loss": 6.2545,
|
|
"mean_token_accuracy": 0.1380497135221958,
|
|
"num_tokens": 4089230.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.289399909973144,
|
|
"epoch": 1.7660896582334664,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004897616814070505,
|
|
"loss": 6.1316,
|
|
"mean_token_accuracy": 0.14506224393844605,
|
|
"num_tokens": 4099104.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.196705055236817,
|
|
"epoch": 1.7705281846426986,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004896587001700972,
|
|
"loss": 6.2359,
|
|
"mean_token_accuracy": 0.13811009451746942,
|
|
"num_tokens": 4109008.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.3165913105010985,
|
|
"epoch": 1.7749667110519307,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004895552157878174,
|
|
"loss": 6.1727,
|
|
"mean_token_accuracy": 0.14556334167718887,
|
|
"num_tokens": 4118219.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 1.7749667110519307,
|
|
"eval_entropy": 6.189312974517533,
|
|
"eval_loss": 6.335569858551025,
|
|
"eval_mean_token_accuracy": 0.136928480658282,
|
|
"eval_num_tokens": 4118219.0,
|
|
"eval_runtime": 2.7093,
|
|
"eval_samples_per_second": 1242.755,
|
|
"eval_steps_per_second": 155.39,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.294293546676636,
|
|
"epoch": 1.7794052374611629,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004894512285027717,
|
|
"loss": 6.1793,
|
|
"mean_token_accuracy": 0.14657135903835297,
|
|
"num_tokens": 4127255.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.239873313903809,
|
|
"epoch": 1.783843763870395,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004893467385586991,
|
|
"loss": 6.1614,
|
|
"mean_token_accuracy": 0.14499758780002595,
|
|
"num_tokens": 4137222.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.136928653717041,
|
|
"epoch": 1.7882822902796272,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000489241746200517,
|
|
"loss": 6.1773,
|
|
"mean_token_accuracy": 0.14779955595731736,
|
|
"num_tokens": 4147746.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.287437057495117,
|
|
"epoch": 1.7927208166888593,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004891362516743201,
|
|
"loss": 6.2624,
|
|
"mean_token_accuracy": 0.13894592374563217,
|
|
"num_tokens": 4157270.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.25756139755249,
|
|
"epoch": 1.7971593430980914,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004890302552273805,
|
|
"loss": 6.1967,
|
|
"mean_token_accuracy": 0.14151124581694602,
|
|
"num_tokens": 4167239.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.1199119091033936,
|
|
"epoch": 1.8015978695073236,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004889237571081465,
|
|
"loss": 6.1876,
|
|
"mean_token_accuracy": 0.14599697291851044,
|
|
"num_tokens": 4177829.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.389132165908814,
|
|
"epoch": 1.8060363959165557,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004888167575662425,
|
|
"loss": 6.2991,
|
|
"mean_token_accuracy": 0.13579059466719628,
|
|
"num_tokens": 4189015.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.2341320514678955,
|
|
"epoch": 1.8104749223257879,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004887092568524682,
|
|
"loss": 6.252,
|
|
"mean_token_accuracy": 0.13997769802808763,
|
|
"num_tokens": 4198895.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.282239961624145,
|
|
"epoch": 1.81491344873502,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004886012552187979,
|
|
"loss": 6.2221,
|
|
"mean_token_accuracy": 0.14225052297115326,
|
|
"num_tokens": 4209845.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.251390075683593,
|
|
"epoch": 1.8193519751442522,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004884927529183799,
|
|
"loss": 6.1844,
|
|
"mean_token_accuracy": 0.14328595399856567,
|
|
"num_tokens": 4220065.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.233511972427368,
|
|
"epoch": 1.8237905015534843,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004883837502055363,
|
|
"loss": 6.2135,
|
|
"mean_token_accuracy": 0.14167198091745375,
|
|
"num_tokens": 4229720.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.30111985206604,
|
|
"epoch": 1.8282290279627165,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004882742473357619,
|
|
"loss": 6.22,
|
|
"mean_token_accuracy": 0.13643964901566505,
|
|
"num_tokens": 4239585.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.267259979248047,
|
|
"epoch": 1.8326675543719486,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048816424456572403,
|
|
"loss": 6.2476,
|
|
"mean_token_accuracy": 0.14258809238672257,
|
|
"num_tokens": 4250294.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.305874967575074,
|
|
"epoch": 1.8371060807811808,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004880537421532618,
|
|
"loss": 6.1402,
|
|
"mean_token_accuracy": 0.14959779605269433,
|
|
"num_tokens": 4260089.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.234825468063354,
|
|
"epoch": 1.841544607190413,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00048794274035738515,
|
|
"loss": 6.1932,
|
|
"mean_token_accuracy": 0.1468948632478714,
|
|
"num_tokens": 4270282.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 6.299134731292725,
|
|
"epoch": 1.845983133599645,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004878312394382747,
|
|
"loss": 6.2185,
|
|
"mean_token_accuracy": 0.13943059742450714,
|
|
"num_tokens": 4279308.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.163238048553467,
|
|
"epoch": 1.8504216600088772,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000487719239657281,
|
|
"loss": 6.1957,
|
|
"mean_token_accuracy": 0.14037612825632095,
|
|
"num_tokens": 4291101.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 6.286023044586182,
|
|
"epoch": 1.8548601864181093,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000487606741276924,
|
|
"loss": 6.1967,
|
|
"mean_token_accuracy": 0.143647962808609,
|
|
"num_tokens": 4301479.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.24072036743164,
|
|
"epoch": 1.8592987128273413,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004874937445608921,
|
|
"loss": 6.1618,
|
|
"mean_token_accuracy": 0.14226512238383293,
|
|
"num_tokens": 4310876.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 6.294512367248535,
|
|
"epoch": 1.8637372392365734,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004873802497740418,
|
|
"loss": 6.1967,
|
|
"mean_token_accuracy": 0.14145390689373016,
|
|
"num_tokens": 4320788.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.25504732131958,
|
|
"epoch": 1.8681757656458056,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004872662571823973,
|
|
"loss": 6.1915,
|
|
"mean_token_accuracy": 0.14332777559757232,
|
|
"num_tokens": 4331609.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.1963708877563475,
|
|
"epoch": 1.8726142920550377,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048715176705314936,
|
|
"loss": 6.1427,
|
|
"mean_token_accuracy": 0.14273860454559326,
|
|
"num_tokens": 4341495.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.178388929367065,
|
|
"epoch": 1.8770528184642699,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00048703677965465506,
|
|
"loss": 6.1335,
|
|
"mean_token_accuracy": 0.15152502655982972,
|
|
"num_tokens": 4351827.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.253129768371582,
|
|
"epoch": 1.881491344873502,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00048692129525643694,
|
|
"loss": 6.2925,
|
|
"mean_token_accuracy": 0.13464196175336837,
|
|
"num_tokens": 4363291.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 6.251963663101196,
|
|
"epoch": 1.8859298712827341,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00048680531412918267,
|
|
"loss": 6.1861,
|
|
"mean_token_accuracy": 0.14269427880644797,
|
|
"num_tokens": 4373458.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.263167381286621,
|
|
"epoch": 1.8903683976919663,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004866888365447439,
|
|
"loss": 6.1529,
|
|
"mean_token_accuracy": 0.1422121912240982,
|
|
"num_tokens": 4383562.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.234077024459839,
|
|
"epoch": 1.8948069241011984,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004865718627761363,
|
|
"loss": 6.2679,
|
|
"mean_token_accuracy": 0.13356237038969992,
|
|
"num_tokens": 4394970.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.317501831054687,
|
|
"epoch": 1.8992454505104306,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004864543930975383,
|
|
"loss": 6.2377,
|
|
"mean_token_accuracy": 0.13947510719299316,
|
|
"num_tokens": 4405117.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.127161931991577,
|
|
"epoch": 1.9036839769196625,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004863364277842908,
|
|
"loss": 6.1427,
|
|
"mean_token_accuracy": 0.14334554746747016,
|
|
"num_tokens": 4416392.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 6.275495529174805,
|
|
"epoch": 1.9081225033288947,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004862179671128965,
|
|
"loss": 6.1993,
|
|
"mean_token_accuracy": 0.13783841133117675,
|
|
"num_tokens": 4426309.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.237747573852539,
|
|
"epoch": 1.9125610297381268,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000486099011361019,
|
|
"loss": 6.1996,
|
|
"mean_token_accuracy": 0.1414594329893589,
|
|
"num_tokens": 4437044.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.329879093170166,
|
|
"epoch": 1.916999556147359,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00048597956080748264,
|
|
"loss": 6.2209,
|
|
"mean_token_accuracy": 0.14464983716607094,
|
|
"num_tokens": 4447391.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.203670978546143,
|
|
"epoch": 1.921438082556591,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00048585961573227116,
|
|
"loss": 6.1001,
|
|
"mean_token_accuracy": 0.145625601708889,
|
|
"num_tokens": 4457465.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.1996794700622555,
|
|
"epoch": 1.9258766089658232,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004857391764165277,
|
|
"loss": 6.1805,
|
|
"mean_token_accuracy": 0.14704733341932297,
|
|
"num_tokens": 4467798.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.195384168624878,
|
|
"epoch": 1.9303151353750554,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048561824314255383,
|
|
"loss": 6.1378,
|
|
"mean_token_accuracy": 0.15038661435246467,
|
|
"num_tokens": 4478789.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.092350435256958,
|
|
"epoch": 1.9347536617842875,
|
|
"grad_norm": 2.09375,
|
|
"learning_rate": 0.00048549681619380886,
|
|
"loss": 6.1211,
|
|
"mean_token_accuracy": 0.14591658264398574,
|
|
"num_tokens": 4490521.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 6.228357648849487,
|
|
"epoch": 1.9391921881935197,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004853748958549092,
|
|
"loss": 6.1215,
|
|
"mean_token_accuracy": 0.14524291455745697,
|
|
"num_tokens": 4499484.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.248248529434204,
|
|
"epoch": 1.9436307146027518,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004852524824116278,
|
|
"loss": 6.1538,
|
|
"mean_token_accuracy": 0.14293037131428718,
|
|
"num_tokens": 4509329.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.160349798202515,
|
|
"epoch": 1.948069241011984,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048512957615089354,
|
|
"loss": 6.2247,
|
|
"mean_token_accuracy": 0.14221593588590623,
|
|
"num_tokens": 4518806.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 6.36239857673645,
|
|
"epoch": 1.9525077674212161,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004850061773607902,
|
|
"loss": 6.3015,
|
|
"mean_token_accuracy": 0.13219987377524375,
|
|
"num_tokens": 4530760.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.284463357925415,
|
|
"epoch": 1.9569462938304483,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000484882286330556,
|
|
"loss": 6.2875,
|
|
"mean_token_accuracy": 0.1374896213412285,
|
|
"num_tokens": 4541754.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.271965026855469,
|
|
"epoch": 1.9613848202396804,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004847579033505833,
|
|
"loss": 6.1348,
|
|
"mean_token_accuracy": 0.1421991430222988,
|
|
"num_tokens": 4553124.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.1756409168243405,
|
|
"epoch": 1.9658233466489126,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004846330287124171,
|
|
"loss": 6.0553,
|
|
"mean_token_accuracy": 0.14253825396299363,
|
|
"num_tokens": 4563558.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.236325645446778,
|
|
"epoch": 1.9702618730581447,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00048450766270875513,
|
|
"loss": 6.2018,
|
|
"mean_token_accuracy": 0.13894723802804948,
|
|
"num_tokens": 4572584.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.235476398468018,
|
|
"epoch": 1.9747003994673769,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00048438180563344666,
|
|
"loss": 6.166,
|
|
"mean_token_accuracy": 0.14769693315029145,
|
|
"num_tokens": 4583009.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.15409779548645,
|
|
"epoch": 1.979138925876609,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00048425545778149213,
|
|
"loss": 6.0949,
|
|
"mean_token_accuracy": 0.14991173148155212,
|
|
"num_tokens": 4593073.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.135072088241577,
|
|
"epoch": 1.9835774522858411,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004841286194490423,
|
|
"loss": 6.0433,
|
|
"mean_token_accuracy": 0.14960258230566978,
|
|
"num_tokens": 4602419.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 6.148426246643067,
|
|
"epoch": 1.9880159786950733,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00048400129093339745,
|
|
"loss": 6.0559,
|
|
"mean_token_accuracy": 0.147773315012455,
|
|
"num_tokens": 4613023.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.228465175628662,
|
|
"epoch": 1.9924545051043054,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00048387347253300703,
|
|
"loss": 6.1037,
|
|
"mean_token_accuracy": 0.14951256513595582,
|
|
"num_tokens": 4622202.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.119011068344117,
|
|
"epoch": 1.9968930315135376,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004837451645474685,
|
|
"loss": 6.1319,
|
|
"mean_token_accuracy": 0.1470404915511608,
|
|
"num_tokens": 4632223.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 6.2560236189100475,
|
|
"epoch": 2.0008877052818463,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048361636727752716,
|
|
"loss": 6.0661,
|
|
"mean_token_accuracy": 0.14733944171004826,
|
|
"num_tokens": 4641379.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.137987041473389,
|
|
"epoch": 2.0053262316910785,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000483487081025075,
|
|
"loss": 5.756,
|
|
"mean_token_accuracy": 0.1647419661283493,
|
|
"num_tokens": 4650474.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.123887157440185,
|
|
"epoch": 2.0097647581003106,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048335730609315,
|
|
"loss": 5.7524,
|
|
"mean_token_accuracy": 0.16743734031915664,
|
|
"num_tokens": 4660151.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.119118976593017,
|
|
"epoch": 2.014203284509543,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00048322704278593595,
|
|
"loss": 5.8702,
|
|
"mean_token_accuracy": 0.14718232825398445,
|
|
"num_tokens": 4669852.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.116711235046386,
|
|
"epoch": 2.018641810918775,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048309629140876097,
|
|
"loss": 5.8726,
|
|
"mean_token_accuracy": 0.15764627158641814,
|
|
"num_tokens": 4679867.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.149226093292237,
|
|
"epoch": 2.023080337328007,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004829650522680974,
|
|
"loss": 5.7536,
|
|
"mean_token_accuracy": 0.1666225776076317,
|
|
"num_tokens": 4690866.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 6.088321590423584,
|
|
"epoch": 2.027518863737239,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004828333256715609,
|
|
"loss": 5.8065,
|
|
"mean_token_accuracy": 0.15734207332134248,
|
|
"num_tokens": 4701081.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.169612789154053,
|
|
"epoch": 2.0319573901464714,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004827011119279096,
|
|
"loss": 5.9393,
|
|
"mean_token_accuracy": 0.1523371458053589,
|
|
"num_tokens": 4712468.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.127353048324585,
|
|
"epoch": 2.0363959165557035,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048256841134704335,
|
|
"loss": 5.8486,
|
|
"mean_token_accuracy": 0.15824615359306335,
|
|
"num_tokens": 4722887.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.078661012649536,
|
|
"epoch": 2.0408344429649357,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048243522424000333,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.14893866032361985,
|
|
"num_tokens": 4733806.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 6.1255724906921385,
|
|
"epoch": 2.045272969374168,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000482301550918971,
|
|
"loss": 5.8143,
|
|
"mean_token_accuracy": 0.16233171075582503,
|
|
"num_tokens": 4744172.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.110927534103394,
|
|
"epoch": 2.0497114957834,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004821673916972676,
|
|
"loss": 5.8643,
|
|
"mean_token_accuracy": 0.15222925841808319,
|
|
"num_tokens": 4754543.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 6.109183931350708,
|
|
"epoch": 2.054150022192632,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000482032746889353,
|
|
"loss": 5.7969,
|
|
"mean_token_accuracy": 0.16298202574253082,
|
|
"num_tokens": 4765617.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.983950281143189,
|
|
"epoch": 2.0585885486018642,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048189761681082557,
|
|
"loss": 5.796,
|
|
"mean_token_accuracy": 0.158494932949543,
|
|
"num_tokens": 4775718.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.1368935108184814,
|
|
"epoch": 2.0630270750110964,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004817620017784209,
|
|
"loss": 5.8967,
|
|
"mean_token_accuracy": 0.14975014999508857,
|
|
"num_tokens": 4785651.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.024167013168335,
|
|
"epoch": 2.0674656014203285,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00048162590211001143,
|
|
"loss": 5.7429,
|
|
"mean_token_accuracy": 0.16594669073820115,
|
|
"num_tokens": 4795541.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.079076719284058,
|
|
"epoch": 2.0719041278295607,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00048148931812460536,
|
|
"loss": 5.8856,
|
|
"mean_token_accuracy": 0.15231603533029556,
|
|
"num_tokens": 4804863.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 6.1893517017364506,
|
|
"epoch": 2.076342654238793,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004813522501423464,
|
|
"loss": 5.8937,
|
|
"mean_token_accuracy": 0.1559199094772339,
|
|
"num_tokens": 4814782.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.05956449508667,
|
|
"epoch": 2.080781180648025,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004812146984845124,
|
|
"loss": 5.8515,
|
|
"mean_token_accuracy": 0.15324196219444275,
|
|
"num_tokens": 4825847.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.04329924583435,
|
|
"epoch": 2.085219707057257,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00048107666347351505,
|
|
"loss": 5.8137,
|
|
"mean_token_accuracy": 0.1576656773686409,
|
|
"num_tokens": 4836537.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 6.060811710357666,
|
|
"epoch": 2.0896582334664893,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048093814543289894,
|
|
"loss": 5.7875,
|
|
"mean_token_accuracy": 0.16412230134010314,
|
|
"num_tokens": 4847031.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.0803258419036865,
|
|
"epoch": 2.0940967598757214,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00048079914468734117,
|
|
"loss": 5.7767,
|
|
"mean_token_accuracy": 0.15763533413410186,
|
|
"num_tokens": 4857031.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.995853662490845,
|
|
"epoch": 2.0985352862849536,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048065966156264964,
|
|
"loss": 5.761,
|
|
"mean_token_accuracy": 0.16315652430057526,
|
|
"num_tokens": 4866413.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 5.984428453445434,
|
|
"epoch": 2.1029738126941857,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048051969638576345,
|
|
"loss": 5.8756,
|
|
"mean_token_accuracy": 0.15949649065732957,
|
|
"num_tokens": 4878840.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 6.032569789886475,
|
|
"epoch": 2.107412339103418,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00048037924948475134,
|
|
"loss": 5.8749,
|
|
"mean_token_accuracy": 0.15843928158283233,
|
|
"num_tokens": 4889182.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.064680576324463,
|
|
"epoch": 2.11185086551265,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004802383211888114,
|
|
"loss": 5.8504,
|
|
"mean_token_accuracy": 0.15740898102521897,
|
|
"num_tokens": 4899497.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.0131433486938475,
|
|
"epoch": 2.116289391921882,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004800969118282697,
|
|
"loss": 5.8147,
|
|
"mean_token_accuracy": 0.15467424541711808,
|
|
"num_tokens": 4910232.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.156729316711425,
|
|
"epoch": 2.120727918331114,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004799550217345803,
|
|
"loss": 5.8762,
|
|
"mean_token_accuracy": 0.15463934987783431,
|
|
"num_tokens": 4920986.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.9624425888061525,
|
|
"epoch": 2.125166444740346,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047981265124032375,
|
|
"loss": 5.8132,
|
|
"mean_token_accuracy": 0.16584520637989045,
|
|
"num_tokens": 4930630.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.077665233612061,
|
|
"epoch": 2.129604971149578,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047966980067920686,
|
|
"loss": 5.8461,
|
|
"mean_token_accuracy": 0.1554732069373131,
|
|
"num_tokens": 4941414.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 6.0890580177307125,
|
|
"epoch": 2.1340434975588103,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00047952647038606157,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.15972182601690293,
|
|
"num_tokens": 4952087.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.965068292617798,
|
|
"epoch": 2.1384820239680424,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004793826606968443,
|
|
"loss": 5.7824,
|
|
"mean_token_accuracy": 0.16058602333068847,
|
|
"num_tokens": 4962340.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.062709331512451,
|
|
"epoch": 2.1429205503772746,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000479238371948635,
|
|
"loss": 5.8172,
|
|
"mean_token_accuracy": 0.15823266208171843,
|
|
"num_tokens": 4972793.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 6.068630790710449,
|
|
"epoch": 2.1473590767865067,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004790936044796369,
|
|
"loss": 5.7894,
|
|
"mean_token_accuracy": 0.15582628548145294,
|
|
"num_tokens": 4982851.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.043807077407837,
|
|
"epoch": 2.151797603195739,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047894835862917473,
|
|
"loss": 5.8587,
|
|
"mean_token_accuracy": 0.15432205498218537,
|
|
"num_tokens": 4993367.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.0602922439575195,
|
|
"epoch": 2.156236129604971,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047880263473769514,
|
|
"loss": 5.8847,
|
|
"mean_token_accuracy": 0.15590363442897798,
|
|
"num_tokens": 5004678.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 6.016771364212036,
|
|
"epoch": 2.160674656014203,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004786564331467648,
|
|
"loss": 5.9167,
|
|
"mean_token_accuracy": 0.15726353973150253,
|
|
"num_tokens": 5015707.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.097188186645508,
|
|
"epoch": 2.1651131824234353,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00047850975419907034,
|
|
"loss": 5.8521,
|
|
"mean_token_accuracy": 0.16086476445198059,
|
|
"num_tokens": 5025627.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 6.054884433746338,
|
|
"epoch": 2.1695517088326675,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047836259823841716,
|
|
"loss": 5.901,
|
|
"mean_token_accuracy": 0.15026813372969627,
|
|
"num_tokens": 5037109.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.021889686584473,
|
|
"epoch": 2.1739902352418996,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004782149656097287,
|
|
"loss": 5.8724,
|
|
"mean_token_accuracy": 0.1604078121483326,
|
|
"num_tokens": 5047547.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.027349185943604,
|
|
"epoch": 2.1784287616511318,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047806685665904586,
|
|
"loss": 5.6991,
|
|
"mean_token_accuracy": 0.17207456529140472,
|
|
"num_tokens": 5057491.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 6.059153509140015,
|
|
"epoch": 2.182867288060364,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004779182717335258,
|
|
"loss": 5.88,
|
|
"mean_token_accuracy": 0.15979125201702118,
|
|
"num_tokens": 5067779.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 5.914556980133057,
|
|
"epoch": 2.187305814469596,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047776921118144154,
|
|
"loss": 5.7787,
|
|
"mean_token_accuracy": 0.16236073076725005,
|
|
"num_tokens": 5079933.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 6.0363281726837155,
|
|
"epoch": 2.191744340878828,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047761967535218084,
|
|
"loss": 5.7699,
|
|
"mean_token_accuracy": 0.1603487879037857,
|
|
"num_tokens": 5090511.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 5.9814863204956055,
|
|
"epoch": 2.1961828672880603,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004774696645962453,
|
|
"loss": 5.8209,
|
|
"mean_token_accuracy": 0.155949005484581,
|
|
"num_tokens": 5100374.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 6.025760889053345,
|
|
"epoch": 2.2006213936972925,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004773191792652501,
|
|
"loss": 5.8747,
|
|
"mean_token_accuracy": 0.15608740150928496,
|
|
"num_tokens": 5110729.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.043809127807617,
|
|
"epoch": 2.2050599201065246,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004771682197119224,
|
|
"loss": 5.9689,
|
|
"mean_token_accuracy": 0.1561452865600586,
|
|
"num_tokens": 5121512.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 6.116773700714111,
|
|
"epoch": 2.2094984465157568,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00047701678629010115,
|
|
"loss": 5.7927,
|
|
"mean_token_accuracy": 0.16145216375589372,
|
|
"num_tokens": 5132244.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.996910858154297,
|
|
"epoch": 2.213936972924989,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004768648793547359,
|
|
"loss": 5.8645,
|
|
"mean_token_accuracy": 0.15332240164279937,
|
|
"num_tokens": 5142499.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.124018716812134,
|
|
"epoch": 2.218375499334221,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004767124992618863,
|
|
"loss": 5.9254,
|
|
"mean_token_accuracy": 0.14778615534305573,
|
|
"num_tokens": 5154082.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"epoch": 2.218375499334221,
|
|
"eval_entropy": 5.912582218505425,
|
|
"eval_loss": 6.2384443283081055,
|
|
"eval_mean_token_accuracy": 0.14352747247578695,
|
|
"eval_num_tokens": 5154082.0,
|
|
"eval_runtime": 2.7018,
|
|
"eval_samples_per_second": 1246.209,
|
|
"eval_steps_per_second": 155.822,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 5.979514408111572,
|
|
"epoch": 2.222814025743453,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004765596463687207,
|
|
"loss": 5.8599,
|
|
"mean_token_accuracy": 0.16360579580068588,
|
|
"num_tokens": 5164473.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 6.0302653312683105,
|
|
"epoch": 2.2272525521526854,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00047640632103351576,
|
|
"loss": 5.823,
|
|
"mean_token_accuracy": 0.1529782608151436,
|
|
"num_tokens": 5174505.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 5.984198331832886,
|
|
"epoch": 2.2316910785619175,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047625252361565586,
|
|
"loss": 5.86,
|
|
"mean_token_accuracy": 0.16072332859039307,
|
|
"num_tokens": 5183730.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 6.080876970291138,
|
|
"epoch": 2.2361296049711497,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047609825447563137,
|
|
"loss": 5.8875,
|
|
"mean_token_accuracy": 0.15377844423055648,
|
|
"num_tokens": 5194589.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 6.031586074829102,
|
|
"epoch": 2.240568131380382,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004759435139750388,
|
|
"loss": 5.8224,
|
|
"mean_token_accuracy": 0.1603144511580467,
|
|
"num_tokens": 5204865.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 5.950521659851074,
|
|
"epoch": 2.245006657789614,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047578830247657915,
|
|
"loss": 5.7883,
|
|
"mean_token_accuracy": 0.15542953312397004,
|
|
"num_tokens": 5214174.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 6.086405277252197,
|
|
"epoch": 2.249445184198846,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047563262034405773,
|
|
"loss": 5.8553,
|
|
"mean_token_accuracy": 0.15860657542943954,
|
|
"num_tokens": 5224776.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 5.879979848861694,
|
|
"epoch": 2.2538837106080782,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047547646794238277,
|
|
"loss": 5.774,
|
|
"mean_token_accuracy": 0.16944229304790498,
|
|
"num_tokens": 5235808.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 6.069366598129273,
|
|
"epoch": 2.2583222370173104,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004753198456375647,
|
|
"loss": 5.8768,
|
|
"mean_token_accuracy": 0.15542600452899932,
|
|
"num_tokens": 5246870.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 5.9477842330932615,
|
|
"epoch": 2.2627607634265425,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004751627537967158,
|
|
"loss": 5.814,
|
|
"mean_token_accuracy": 0.15728210359811784,
|
|
"num_tokens": 5256713.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 6.079386186599732,
|
|
"epoch": 2.2671992898357747,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00047500519278804835,
|
|
"loss": 5.8594,
|
|
"mean_token_accuracy": 0.15244215726852417,
|
|
"num_tokens": 5266205.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 5.994957637786865,
|
|
"epoch": 2.271637816245007,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004748471629808746,
|
|
"loss": 5.8492,
|
|
"mean_token_accuracy": 0.16054973602294922,
|
|
"num_tokens": 5275790.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.990897369384766,
|
|
"epoch": 2.276076342654239,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047468866474560575,
|
|
"loss": 5.8324,
|
|
"mean_token_accuracy": 0.16462789922952653,
|
|
"num_tokens": 5286644.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 6.060874319076538,
|
|
"epoch": 2.280514869063471,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047452969845375074,
|
|
"loss": 5.8517,
|
|
"mean_token_accuracy": 0.15758478343486787,
|
|
"num_tokens": 5297218.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 5.967515182495117,
|
|
"epoch": 2.2849533954727033,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004743702644779157,
|
|
"loss": 5.8643,
|
|
"mean_token_accuracy": 0.16127976924180984,
|
|
"num_tokens": 5306963.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 6.041119766235352,
|
|
"epoch": 2.2893919218819354,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000474210363191803,
|
|
"loss": 5.8436,
|
|
"mean_token_accuracy": 0.15753196477890014,
|
|
"num_tokens": 5317831.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 6.07420163154602,
|
|
"epoch": 2.2938304482911676,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004740499949702103,
|
|
"loss": 5.9116,
|
|
"mean_token_accuracy": 0.1521080181002617,
|
|
"num_tokens": 5328441.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 6.023616170883178,
|
|
"epoch": 2.2982689747003997,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004738891601890298,
|
|
"loss": 5.8882,
|
|
"mean_token_accuracy": 0.15639281421899795,
|
|
"num_tokens": 5339196.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 6.031891489028931,
|
|
"epoch": 2.302707501109632,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004737278592252473,
|
|
"loss": 5.8922,
|
|
"mean_token_accuracy": 0.15469010919332504,
|
|
"num_tokens": 5350607.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 6.049084806442261,
|
|
"epoch": 2.3071460275188636,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004735660924569411,
|
|
"loss": 5.8015,
|
|
"mean_token_accuracy": 0.16298002377152443,
|
|
"num_tokens": 5359882.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 5.998689460754394,
|
|
"epoch": 2.3115845539280957,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004734038602632815,
|
|
"loss": 5.901,
|
|
"mean_token_accuracy": 0.1472710005939007,
|
|
"num_tokens": 5369895.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.047903060913086,
|
|
"epoch": 2.316023080337328,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047324116302452975,
|
|
"loss": 5.8089,
|
|
"mean_token_accuracy": 0.1612442836165428,
|
|
"num_tokens": 5380603.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 5.948516035079956,
|
|
"epoch": 2.32046160674656,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004730780011220369,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.1603932797908783,
|
|
"num_tokens": 5390638.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.000922441482544,
|
|
"epoch": 2.324900133155792,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004729143749382435,
|
|
"loss": 5.8306,
|
|
"mean_token_accuracy": 0.15756168812513352,
|
|
"num_tokens": 5401420.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 5.9953662872314455,
|
|
"epoch": 2.3293386595650243,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047275028485667793,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.16370837688446044,
|
|
"num_tokens": 5410609.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 6.01699743270874,
|
|
"epoch": 2.3337771859742564,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004725857312619563,
|
|
"loss": 5.8682,
|
|
"mean_token_accuracy": 0.15251740217208862,
|
|
"num_tokens": 5420443.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 6.033771324157715,
|
|
"epoch": 2.3382157123834886,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004724207145397809,
|
|
"loss": 5.8648,
|
|
"mean_token_accuracy": 0.15294097363948822,
|
|
"num_tokens": 5431385.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 5.970233392715454,
|
|
"epoch": 2.3426542387927207,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004722552350769397,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.1535698138177395,
|
|
"num_tokens": 5443030.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 6.052612066268921,
|
|
"epoch": 2.347092765201953,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047208929326130535,
|
|
"loss": 5.9079,
|
|
"mean_token_accuracy": 0.15419892519712447,
|
|
"num_tokens": 5454165.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 5.993892097473145,
|
|
"epoch": 2.351531291611185,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00047192288948183394,
|
|
"loss": 5.8514,
|
|
"mean_token_accuracy": 0.1610301211476326,
|
|
"num_tokens": 5464677.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 6.002200412750244,
|
|
"epoch": 2.355969818020417,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047175602412856453,
|
|
"loss": 5.8932,
|
|
"mean_token_accuracy": 0.15303485542535783,
|
|
"num_tokens": 5474800.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 5.996066761016846,
|
|
"epoch": 2.3604083444296493,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047158869759261843,
|
|
"loss": 5.8812,
|
|
"mean_token_accuracy": 0.15533178001642228,
|
|
"num_tokens": 5484560.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 6.029137420654297,
|
|
"epoch": 2.3648468708388815,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004714209102661973,
|
|
"loss": 5.7492,
|
|
"mean_token_accuracy": 0.16394296288490295,
|
|
"num_tokens": 5494044.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 5.91089277267456,
|
|
"epoch": 2.3692853972481136,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004712526625425832,
|
|
"loss": 5.7802,
|
|
"mean_token_accuracy": 0.16682939529418944,
|
|
"num_tokens": 5504699.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 5.978672981262207,
|
|
"epoch": 2.3737239236573457,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047108395481613736,
|
|
"loss": 5.8211,
|
|
"mean_token_accuracy": 0.15940958112478257,
|
|
"num_tokens": 5515653.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 5.973521709442139,
|
|
"epoch": 2.378162450066578,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047091478748229927,
|
|
"loss": 5.8413,
|
|
"mean_token_accuracy": 0.1611622080206871,
|
|
"num_tokens": 5525598.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 5.935227870941162,
|
|
"epoch": 2.38260097647581,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004707451609375854,
|
|
"loss": 5.7347,
|
|
"mean_token_accuracy": 0.16550450325012206,
|
|
"num_tokens": 5535022.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 5.960200691223145,
|
|
"epoch": 2.387039502885042,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004705750755795889,
|
|
"loss": 5.8633,
|
|
"mean_token_accuracy": 0.15553324073553085,
|
|
"num_tokens": 5544766.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 6.048462724685669,
|
|
"epoch": 2.3914780292942743,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00047040453180697823,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.15715541690587997,
|
|
"num_tokens": 5556475.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 5.987107372283935,
|
|
"epoch": 2.3959165557035065,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004702335300194963,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.1529506891965866,
|
|
"num_tokens": 5567679.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 5.9911316394805905,
|
|
"epoch": 2.4003550821127386,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004700620706179596,
|
|
"loss": 5.8734,
|
|
"mean_token_accuracy": 0.15287387520074844,
|
|
"num_tokens": 5579154.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 6.002614164352417,
|
|
"epoch": 2.4047936085219708,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004698901540042573,
|
|
"loss": 5.8182,
|
|
"mean_token_accuracy": 0.15594158917665482,
|
|
"num_tokens": 5588597.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 5.956090831756592,
|
|
"epoch": 2.409232134931203,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046971778058135024,
|
|
"loss": 5.8452,
|
|
"mean_token_accuracy": 0.16208919137716293,
|
|
"num_tokens": 5598744.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 6.036012983322143,
|
|
"epoch": 2.413670661340435,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046954495075326986,
|
|
"loss": 5.8405,
|
|
"mean_token_accuracy": 0.1533527597784996,
|
|
"num_tokens": 5608684.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 6.065688228607177,
|
|
"epoch": 2.418109187749667,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046937166492511746,
|
|
"loss": 5.869,
|
|
"mean_token_accuracy": 0.1580584764480591,
|
|
"num_tokens": 5619073.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 5.885785341262817,
|
|
"epoch": 2.4225477141588994,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046919792350306317,
|
|
"loss": 5.8433,
|
|
"mean_token_accuracy": 0.1607219859957695,
|
|
"num_tokens": 5628764.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 5.997347974777222,
|
|
"epoch": 2.4269862405681315,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004690237268943451,
|
|
"loss": 5.8939,
|
|
"mean_token_accuracy": 0.1569211430847645,
|
|
"num_tokens": 5640132.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 6.014172315597534,
|
|
"epoch": 2.4314247669773636,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046884907550726816,
|
|
"loss": 5.832,
|
|
"mean_token_accuracy": 0.16245327293872833,
|
|
"num_tokens": 5650104.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 6.030955839157104,
|
|
"epoch": 2.435863293386596,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046867396975120324,
|
|
"loss": 5.8838,
|
|
"mean_token_accuracy": 0.1566794067621231,
|
|
"num_tokens": 5660570.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 5.935262775421142,
|
|
"epoch": 2.440301819795828,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004684984100365863,
|
|
"loss": 5.8102,
|
|
"mean_token_accuracy": 0.16272856444120407,
|
|
"num_tokens": 5670416.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 5.952510738372803,
|
|
"epoch": 2.44474034620506,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00046832239677491736,
|
|
"loss": 5.8026,
|
|
"mean_token_accuracy": 0.159297114610672,
|
|
"num_tokens": 5680103.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 5.9763203144073485,
|
|
"epoch": 2.4491788726142922,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004681459303787594,
|
|
"loss": 5.7618,
|
|
"mean_token_accuracy": 0.1663880541920662,
|
|
"num_tokens": 5690177.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 5.848566389083862,
|
|
"epoch": 2.4536173990235244,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004679690112617376,
|
|
"loss": 5.7924,
|
|
"mean_token_accuracy": 0.1640610784292221,
|
|
"num_tokens": 5700618.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 6.005400848388672,
|
|
"epoch": 2.458055925432756,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004677916398385383,
|
|
"loss": 5.6976,
|
|
"mean_token_accuracy": 0.16924956142902375,
|
|
"num_tokens": 5709363.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.92542405128479,
|
|
"epoch": 2.4624944518419882,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000467613816524908,
|
|
"loss": 5.7632,
|
|
"mean_token_accuracy": 0.16014119535684584,
|
|
"num_tokens": 5718337.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 5.98035454750061,
|
|
"epoch": 2.4669329782512204,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004674355417376524,
|
|
"loss": 5.8899,
|
|
"mean_token_accuracy": 0.15295967012643813,
|
|
"num_tokens": 5729728.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 6.071887493133545,
|
|
"epoch": 2.4713715046604525,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00046725681589463537,
|
|
"loss": 5.8657,
|
|
"mean_token_accuracy": 0.156499744951725,
|
|
"num_tokens": 5739417.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 5.863467073440551,
|
|
"epoch": 2.4758100310696847,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046707763941477817,
|
|
"loss": 5.752,
|
|
"mean_token_accuracy": 0.16586533784866334,
|
|
"num_tokens": 5749262.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 5.958102178573609,
|
|
"epoch": 2.480248557478917,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004668980127180582,
|
|
"loss": 5.7598,
|
|
"mean_token_accuracy": 0.16487552374601364,
|
|
"num_tokens": 5758631.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 6.010591220855713,
|
|
"epoch": 2.484687083888149,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004667179362255081,
|
|
"loss": 5.8768,
|
|
"mean_token_accuracy": 0.15696858763694763,
|
|
"num_tokens": 5768216.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 5.944836568832398,
|
|
"epoch": 2.489125610297381,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004665374103592149,
|
|
"loss": 5.8615,
|
|
"mean_token_accuracy": 0.15959977358579636,
|
|
"num_tokens": 5779497.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.9987327575683596,
|
|
"epoch": 2.4935641367066133,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004663564355423189,
|
|
"loss": 5.8722,
|
|
"mean_token_accuracy": 0.1550326645374298,
|
|
"num_tokens": 5790354.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 5.994489002227783,
|
|
"epoch": 2.4980026631158454,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004661750121990128,
|
|
"loss": 5.8588,
|
|
"mean_token_accuracy": 0.15960408747196198,
|
|
"num_tokens": 5801444.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.916463232040405,
|
|
"epoch": 2.5024411895250775,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00046599314075454034,
|
|
"loss": 5.7893,
|
|
"mean_token_accuracy": 0.16704044193029405,
|
|
"num_tokens": 5811444.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 5.954709720611572,
|
|
"epoch": 2.5068797159343097,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046581082163519585,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.16441214680671692,
|
|
"num_tokens": 5821470.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 6.026654958724976,
|
|
"epoch": 2.511318242343542,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00046562805526832284,
|
|
"loss": 5.9117,
|
|
"mean_token_accuracy": 0.1474317044019699,
|
|
"num_tokens": 5831946.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.968541955947876,
|
|
"epoch": 2.515756768752774,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004654448420823133,
|
|
"loss": 5.7507,
|
|
"mean_token_accuracy": 0.16840852946043014,
|
|
"num_tokens": 5841871.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.894213438034058,
|
|
"epoch": 2.520195295162006,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046526118250660636,
|
|
"loss": 5.7572,
|
|
"mean_token_accuracy": 0.1637505128979683,
|
|
"num_tokens": 5852177.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 5.925645160675049,
|
|
"epoch": 2.5246338215712383,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004650770769716875,
|
|
"loss": 5.8017,
|
|
"mean_token_accuracy": 0.16091584861278535,
|
|
"num_tokens": 5861833.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 6.0279539108276365,
|
|
"epoch": 2.5290723479804704,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004648925259090875,
|
|
"loss": 5.8965,
|
|
"mean_token_accuracy": 0.15736780315637589,
|
|
"num_tokens": 5872356.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.906160831451416,
|
|
"epoch": 2.5335108743897026,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046470752975138146,
|
|
"loss": 5.766,
|
|
"mean_token_accuracy": 0.1651814177632332,
|
|
"num_tokens": 5882191.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.877144622802734,
|
|
"epoch": 2.5379494007989347,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046452208893218777,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.15751032680273055,
|
|
"num_tokens": 5892166.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 6.012645864486695,
|
|
"epoch": 2.542387927208167,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000464336203886167,
|
|
"loss": 5.8779,
|
|
"mean_token_accuracy": 0.15454574823379516,
|
|
"num_tokens": 5902736.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 6.037869215011597,
|
|
"epoch": 2.546826453617399,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000464149875049021,
|
|
"loss": 5.8828,
|
|
"mean_token_accuracy": 0.1547730416059494,
|
|
"num_tokens": 5913118.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 5.903016805648804,
|
|
"epoch": 2.551264980026631,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046396310285749175,
|
|
"loss": 5.7814,
|
|
"mean_token_accuracy": 0.16758745312690734,
|
|
"num_tokens": 5922748.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 5.863944339752197,
|
|
"epoch": 2.5557035064358633,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00046377588774936077,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.16544996947050095,
|
|
"num_tokens": 5932107.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 6.011892890930175,
|
|
"epoch": 2.5601420328450954,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046358823016344713,
|
|
"loss": 5.9142,
|
|
"mean_token_accuracy": 0.15287835970520974,
|
|
"num_tokens": 5942231.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.860071897506714,
|
|
"epoch": 2.5645805592543276,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004634001305396076,
|
|
"loss": 5.7025,
|
|
"mean_token_accuracy": 0.17802257537841798,
|
|
"num_tokens": 5952768.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 5.9685780048370365,
|
|
"epoch": 2.5690190856635597,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046321158931873486,
|
|
"loss": 5.8106,
|
|
"mean_token_accuracy": 0.16438037455081939,
|
|
"num_tokens": 5963588.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.918586349487304,
|
|
"epoch": 2.573457612072792,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004630226069427566,
|
|
"loss": 5.8375,
|
|
"mean_token_accuracy": 0.15472524762153625,
|
|
"num_tokens": 5974010.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 5.987170839309693,
|
|
"epoch": 2.577896138482024,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046283318385463454,
|
|
"loss": 5.8025,
|
|
"mean_token_accuracy": 0.15875670611858367,
|
|
"num_tokens": 5983788.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 6.004740524291992,
|
|
"epoch": 2.582334664891256,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004626433204983636,
|
|
"loss": 5.8272,
|
|
"mean_token_accuracy": 0.15208624452352523,
|
|
"num_tokens": 5993757.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 5.989063167572022,
|
|
"epoch": 2.5867731913004883,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046245301731897024,
|
|
"loss": 5.8965,
|
|
"mean_token_accuracy": 0.15564585849642754,
|
|
"num_tokens": 6004298.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 5.924497413635254,
|
|
"epoch": 2.5912117177097205,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046226227476251256,
|
|
"loss": 5.7492,
|
|
"mean_token_accuracy": 0.1677611857652664,
|
|
"num_tokens": 6014338.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.932976245880127,
|
|
"epoch": 2.5956502441189526,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004620710932760776,
|
|
"loss": 5.7697,
|
|
"mean_token_accuracy": 0.16785314530134202,
|
|
"num_tokens": 6024162.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 5.958101367950439,
|
|
"epoch": 2.6000887705281848,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000461879473307782,
|
|
"loss": 5.9011,
|
|
"mean_token_accuracy": 0.15391672402620316,
|
|
"num_tokens": 6035618.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 6.020662879943847,
|
|
"epoch": 2.604527296937417,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004616874153067698,
|
|
"loss": 5.8625,
|
|
"mean_token_accuracy": 0.15793592631816863,
|
|
"num_tokens": 6046958.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.986457204818725,
|
|
"epoch": 2.608965823346649,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004614949197232118,
|
|
"loss": 5.7603,
|
|
"mean_token_accuracy": 0.15999703258275985,
|
|
"num_tokens": 6056605.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 6.014141416549682,
|
|
"epoch": 2.613404349755881,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004613019870083045,
|
|
"loss": 5.8777,
|
|
"mean_token_accuracy": 0.15496069490909575,
|
|
"num_tokens": 6066820.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 5.97690601348877,
|
|
"epoch": 2.6178428761651134,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046110861761426903,
|
|
"loss": 5.8899,
|
|
"mean_token_accuracy": 0.15131543576717377,
|
|
"num_tokens": 6076894.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 5.9907660484313965,
|
|
"epoch": 2.6222814025743455,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046091481199435005,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.16070771217346191,
|
|
"num_tokens": 6087603.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 5.969569063186645,
|
|
"epoch": 2.6267199289835776,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004607205706028147,
|
|
"loss": 5.8553,
|
|
"mean_token_accuracy": 0.1571110799908638,
|
|
"num_tokens": 6097742.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.947077798843384,
|
|
"epoch": 2.63115845539281,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004605258938949514,
|
|
"loss": 5.7632,
|
|
"mean_token_accuracy": 0.16355187743902205,
|
|
"num_tokens": 6107589.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 5.910353899002075,
|
|
"epoch": 2.635596981802042,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046033078232706923,
|
|
"loss": 5.8305,
|
|
"mean_token_accuracy": 0.16115528345108032,
|
|
"num_tokens": 6117487.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 5.9662243843078615,
|
|
"epoch": 2.640035508211274,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046013523635649625,
|
|
"loss": 5.7886,
|
|
"mean_token_accuracy": 0.1626285195350647,
|
|
"num_tokens": 6127326.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 5.9658843040466305,
|
|
"epoch": 2.6444740346205062,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045993925644157883,
|
|
"loss": 5.8586,
|
|
"mean_token_accuracy": 0.15528757721185685,
|
|
"num_tokens": 6137314.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.949848461151123,
|
|
"epoch": 2.6489125610297384,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004597428430416807,
|
|
"loss": 5.7777,
|
|
"mean_token_accuracy": 0.15900478214025499,
|
|
"num_tokens": 6147307.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 5.903331708908081,
|
|
"epoch": 2.6533510874389705,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045954599661718126,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.15989653617143632,
|
|
"num_tokens": 6157251.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 5.940880393981933,
|
|
"epoch": 2.6577896138482027,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045934871762947504,
|
|
"loss": 5.8187,
|
|
"mean_token_accuracy": 0.1611912429332733,
|
|
"num_tokens": 6167190.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.969712638854981,
|
|
"epoch": 2.6622281402574344,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045915100654097076,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.14869051277637482,
|
|
"num_tokens": 6177276.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 2.6622281402574344,
|
|
"eval_entropy": 5.890340174178896,
|
|
"eval_loss": 6.156768798828125,
|
|
"eval_mean_token_accuracy": 0.1474443507201598,
|
|
"eval_num_tokens": 6177276.0,
|
|
"eval_runtime": 2.8874,
|
|
"eval_samples_per_second": 1166.085,
|
|
"eval_steps_per_second": 145.804,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 5.963724184036255,
|
|
"epoch": 2.6666666666666665,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045895286381508944,
|
|
"loss": 5.7761,
|
|
"mean_token_accuracy": 0.16845725029706954,
|
|
"num_tokens": 6187477.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.930504608154297,
|
|
"epoch": 2.6711051930758987,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004587542899162642,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.16042507588863372,
|
|
"num_tokens": 6196961.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 5.972206020355225,
|
|
"epoch": 2.675543719485131,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045855528530993874,
|
|
"loss": 5.8621,
|
|
"mean_token_accuracy": 0.15465489625930787,
|
|
"num_tokens": 6206267.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 5.989437532424927,
|
|
"epoch": 2.679982245894363,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004583558504625661,
|
|
"loss": 5.8806,
|
|
"mean_token_accuracy": 0.1598665952682495,
|
|
"num_tokens": 6216960.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.972441625595093,
|
|
"epoch": 2.684420772303595,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045815598584160824,
|
|
"loss": 5.8508,
|
|
"mean_token_accuracy": 0.15688182711601256,
|
|
"num_tokens": 6227843.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.931846618652344,
|
|
"epoch": 2.6888592987128273,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045795569191553384,
|
|
"loss": 5.7869,
|
|
"mean_token_accuracy": 0.1634823426604271,
|
|
"num_tokens": 6236712.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 6.0422979354858395,
|
|
"epoch": 2.6932978251220594,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004577549691538183,
|
|
"loss": 5.867,
|
|
"mean_token_accuracy": 0.15649005323648452,
|
|
"num_tokens": 6248021.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 6.038855028152466,
|
|
"epoch": 2.6977363515312915,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045755381802694206,
|
|
"loss": 5.9027,
|
|
"mean_token_accuracy": 0.15194420740008355,
|
|
"num_tokens": 6259582.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 5.9294596195220945,
|
|
"epoch": 2.7021748779405237,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045735223900638967,
|
|
"loss": 5.8207,
|
|
"mean_token_accuracy": 0.15803860276937484,
|
|
"num_tokens": 6269835.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.9558673858642575,
|
|
"epoch": 2.706613404349756,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045715023256464855,
|
|
"loss": 5.746,
|
|
"mean_token_accuracy": 0.16712094992399215,
|
|
"num_tokens": 6279486.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.922696256637574,
|
|
"epoch": 2.711051930758988,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045694779917520797,
|
|
"loss": 5.817,
|
|
"mean_token_accuracy": 0.16085006594657897,
|
|
"num_tokens": 6290273.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.900194597244263,
|
|
"epoch": 2.71549045716822,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000456744939312558,
|
|
"loss": 5.6937,
|
|
"mean_token_accuracy": 0.17415937334299086,
|
|
"num_tokens": 6299543.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.909957361221314,
|
|
"epoch": 2.7199289835774523,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004565416534521883,
|
|
"loss": 5.7641,
|
|
"mean_token_accuracy": 0.1630728706717491,
|
|
"num_tokens": 6309813.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.874665069580078,
|
|
"epoch": 2.7243675099866844,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000456337942070587,
|
|
"loss": 5.7821,
|
|
"mean_token_accuracy": 0.1703098714351654,
|
|
"num_tokens": 6319961.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 5.964541339874268,
|
|
"epoch": 2.7288060363959166,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004561338056452396,
|
|
"loss": 5.737,
|
|
"mean_token_accuracy": 0.16806395202875138,
|
|
"num_tokens": 6329585.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.92868595123291,
|
|
"epoch": 2.7332445628051487,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004559292446546281,
|
|
"loss": 5.7987,
|
|
"mean_token_accuracy": 0.16131089478731156,
|
|
"num_tokens": 6339527.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 5.970851278305053,
|
|
"epoch": 2.737683089214381,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004557242595782293,
|
|
"loss": 5.7985,
|
|
"mean_token_accuracy": 0.15973087251186371,
|
|
"num_tokens": 6350079.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 5.91132082939148,
|
|
"epoch": 2.742121615623613,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004555188508965144,
|
|
"loss": 5.7925,
|
|
"mean_token_accuracy": 0.16054237484931946,
|
|
"num_tokens": 6359999.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.912930011749268,
|
|
"epoch": 2.746560142032845,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045531301909094724,
|
|
"loss": 5.7963,
|
|
"mean_token_accuracy": 0.1637853652238846,
|
|
"num_tokens": 6370643.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.9343184471130375,
|
|
"epoch": 2.7509986684420773,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004551067646439834,
|
|
"loss": 5.8199,
|
|
"mean_token_accuracy": 0.15766822546720505,
|
|
"num_tokens": 6381132.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 5.960313940048218,
|
|
"epoch": 2.7554371948513094,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045490008803906936,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.16581773906946182,
|
|
"num_tokens": 6391143.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 5.841590690612793,
|
|
"epoch": 2.7598757212605416,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004546929897606409,
|
|
"loss": 5.7849,
|
|
"mean_token_accuracy": 0.16631501466035842,
|
|
"num_tokens": 6401079.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.993973875045777,
|
|
"epoch": 2.7643142476697737,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045448547029412225,
|
|
"loss": 5.8225,
|
|
"mean_token_accuracy": 0.16507848501205444,
|
|
"num_tokens": 6412380.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.91737003326416,
|
|
"epoch": 2.768752774079006,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045427753012592477,
|
|
"loss": 5.7552,
|
|
"mean_token_accuracy": 0.1646926447749138,
|
|
"num_tokens": 6423198.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 5.957061624526977,
|
|
"epoch": 2.773191300488238,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045406916974344617,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.15380569249391557,
|
|
"num_tokens": 6433850.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 5.903844690322876,
|
|
"epoch": 2.77762982689747,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045386038963506883,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.16169303506612778,
|
|
"num_tokens": 6443296.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.890790748596191,
|
|
"epoch": 2.7820683533067023,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004536511902901591,
|
|
"loss": 5.7452,
|
|
"mean_token_accuracy": 0.17047004401683807,
|
|
"num_tokens": 6452857.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.9857110500335695,
|
|
"epoch": 2.7865068797159345,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004534415721990659,
|
|
"loss": 5.8426,
|
|
"mean_token_accuracy": 0.15422120094299316,
|
|
"num_tokens": 6463027.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 5.9161601066589355,
|
|
"epoch": 2.790945406125166,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045323153585311975,
|
|
"loss": 5.7903,
|
|
"mean_token_accuracy": 0.16016594916582108,
|
|
"num_tokens": 6473667.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 5.91183705329895,
|
|
"epoch": 2.7953839325343983,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004530210817446316,
|
|
"loss": 5.7923,
|
|
"mean_token_accuracy": 0.1590562269091606,
|
|
"num_tokens": 6484935.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 5.96208758354187,
|
|
"epoch": 2.7998224589436305,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004528102103668913,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.1598386511206627,
|
|
"num_tokens": 6496436.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.941922044754028,
|
|
"epoch": 2.8042609853528626,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004525989222141671,
|
|
"loss": 5.8385,
|
|
"mean_token_accuracy": 0.16108565628528596,
|
|
"num_tokens": 6506426.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 5.909464502334595,
|
|
"epoch": 2.8086995117620948,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00045238721778170386,
|
|
"loss": 5.7245,
|
|
"mean_token_accuracy": 0.17027909755706788,
|
|
"num_tokens": 6516208.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.904296827316284,
|
|
"epoch": 2.813138038171327,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045217509756572256,
|
|
"loss": 5.8064,
|
|
"mean_token_accuracy": 0.16750676929950714,
|
|
"num_tokens": 6526989.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.950080680847168,
|
|
"epoch": 2.817576564580559,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004519625620634182,
|
|
"loss": 5.779,
|
|
"mean_token_accuracy": 0.16853131651878356,
|
|
"num_tokens": 6536623.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 5.996464633941651,
|
|
"epoch": 2.822015090989791,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045174961177295964,
|
|
"loss": 5.8603,
|
|
"mean_token_accuracy": 0.15565441995859147,
|
|
"num_tokens": 6546362.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.882690143585205,
|
|
"epoch": 2.8264536173990233,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045153624719348773,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.16545474231243135,
|
|
"num_tokens": 6556018.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.9369165897369385,
|
|
"epoch": 2.8308921438082555,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045132246882511457,
|
|
"loss": 5.8711,
|
|
"mean_token_accuracy": 0.15271297544240953,
|
|
"num_tokens": 6566633.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 5.928608226776123,
|
|
"epoch": 2.8353306702174876,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004511082771689219,
|
|
"loss": 5.7848,
|
|
"mean_token_accuracy": 0.162632454931736,
|
|
"num_tokens": 6577078.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 5.87532901763916,
|
|
"epoch": 2.83976919662672,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045089367272696046,
|
|
"loss": 5.7296,
|
|
"mean_token_accuracy": 0.16761246025562287,
|
|
"num_tokens": 6587012.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 5.853836631774902,
|
|
"epoch": 2.844207723035952,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045067865600224833,
|
|
"loss": 5.7389,
|
|
"mean_token_accuracy": 0.16479332596063614,
|
|
"num_tokens": 6597487.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.851861524581909,
|
|
"epoch": 2.848646249445184,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045046322749877005,
|
|
"loss": 5.8008,
|
|
"mean_token_accuracy": 0.16307896375656128,
|
|
"num_tokens": 6607959.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 5.999709367752075,
|
|
"epoch": 2.853084775854416,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045024738772147534,
|
|
"loss": 5.8787,
|
|
"mean_token_accuracy": 0.15614837110042573,
|
|
"num_tokens": 6618790.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.923825883865357,
|
|
"epoch": 2.8575233022636484,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004500311371762778,
|
|
"loss": 5.8501,
|
|
"mean_token_accuracy": 0.15941908359527587,
|
|
"num_tokens": 6628472.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 5.905185556411743,
|
|
"epoch": 2.8619618286728805,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044981447637005396,
|
|
"loss": 5.8651,
|
|
"mean_token_accuracy": 0.16131409406661987,
|
|
"num_tokens": 6638912.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.949870872497558,
|
|
"epoch": 2.8664003550821127,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000449597405810642,
|
|
"loss": 5.8519,
|
|
"mean_token_accuracy": 0.1583707645535469,
|
|
"num_tokens": 6649533.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.891813468933106,
|
|
"epoch": 2.870838881491345,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004493799260068405,
|
|
"loss": 5.7662,
|
|
"mean_token_accuracy": 0.1668047934770584,
|
|
"num_tokens": 6658936.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 5.957934093475342,
|
|
"epoch": 2.875277407900577,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004491620374684072,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.16199405193328859,
|
|
"num_tokens": 6669555.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 5.974352836608887,
|
|
"epoch": 2.879715934309809,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044894374070605795,
|
|
"loss": 5.7669,
|
|
"mean_token_accuracy": 0.15872932597994804,
|
|
"num_tokens": 6680298.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 5.8650794506073,
|
|
"epoch": 2.8841544607190412,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044872503623146544,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.1566520646214485,
|
|
"num_tokens": 6690852.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.917939901351929,
|
|
"epoch": 2.8885929871282734,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044850592455725804,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.16597653180360794,
|
|
"num_tokens": 6701442.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.969485950469971,
|
|
"epoch": 2.8930315135375055,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004482864061970185,
|
|
"loss": 5.812,
|
|
"mean_token_accuracy": 0.15813857614994048,
|
|
"num_tokens": 6711176.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 5.85574049949646,
|
|
"epoch": 2.8974700399467377,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044806648166528286,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.16221853271126746,
|
|
"num_tokens": 6721869.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.909014701843262,
|
|
"epoch": 2.90190856635597,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00044784615147753934,
|
|
"loss": 5.7292,
|
|
"mean_token_accuracy": 0.1643129900097847,
|
|
"num_tokens": 6731004.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 6.034462118148804,
|
|
"epoch": 2.906347092765202,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00044762541615022664,
|
|
"loss": 5.8652,
|
|
"mean_token_accuracy": 0.15844893604516982,
|
|
"num_tokens": 6741793.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 6.018981266021728,
|
|
"epoch": 2.910785619174434,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044740427620073344,
|
|
"loss": 5.8222,
|
|
"mean_token_accuracy": 0.1608099490404129,
|
|
"num_tokens": 6753177.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.9532171249389645,
|
|
"epoch": 2.9152241455836663,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044718273214739654,
|
|
"loss": 5.8773,
|
|
"mean_token_accuracy": 0.15125300288200377,
|
|
"num_tokens": 6763104.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 5.929151487350464,
|
|
"epoch": 2.9196626719928984,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004469607845095002,
|
|
"loss": 5.8162,
|
|
"mean_token_accuracy": 0.16089233607053757,
|
|
"num_tokens": 6773823.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.9447283267974855,
|
|
"epoch": 2.9241011984021306,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004467384338072744,
|
|
"loss": 5.7967,
|
|
"mean_token_accuracy": 0.16282767355442046,
|
|
"num_tokens": 6783445.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.851709604263306,
|
|
"epoch": 2.9285397248113627,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004465156805618941,
|
|
"loss": 5.681,
|
|
"mean_token_accuracy": 0.1752907082438469,
|
|
"num_tokens": 6794199.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.876345252990722,
|
|
"epoch": 2.932978251220595,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004462925252954775,
|
|
"loss": 5.8756,
|
|
"mean_token_accuracy": 0.15152985453605652,
|
|
"num_tokens": 6804817.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.9312444686889645,
|
|
"epoch": 2.937416777629827,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004460689685310855,
|
|
"loss": 5.8161,
|
|
"mean_token_accuracy": 0.16338575184345244,
|
|
"num_tokens": 6815592.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 5.860175895690918,
|
|
"epoch": 2.941855304039059,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004458450107927199,
|
|
"loss": 5.759,
|
|
"mean_token_accuracy": 0.17119106501340867,
|
|
"num_tokens": 6825653.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.963648462295533,
|
|
"epoch": 2.9462938304482913,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044562065260532214,
|
|
"loss": 5.9028,
|
|
"mean_token_accuracy": 0.15333495438098907,
|
|
"num_tokens": 6836610.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 5.885528802871704,
|
|
"epoch": 2.9507323568575234,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044539589449477265,
|
|
"loss": 5.6927,
|
|
"mean_token_accuracy": 0.16941193193197251,
|
|
"num_tokens": 6846700.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 5.940938091278076,
|
|
"epoch": 2.9551708832667556,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000445170736987889,
|
|
"loss": 5.8498,
|
|
"mean_token_accuracy": 0.15794429033994675,
|
|
"num_tokens": 6857796.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 5.989238452911377,
|
|
"epoch": 2.9596094096759877,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000444945180612425,
|
|
"loss": 5.8447,
|
|
"mean_token_accuracy": 0.15649579018354415,
|
|
"num_tokens": 6868038.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 5.952742576599121,
|
|
"epoch": 2.96404793608522,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044471922589706944,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.1704735830426216,
|
|
"num_tokens": 6878356.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 5.956376743316651,
|
|
"epoch": 2.968486462494452,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004444928733714446,
|
|
"loss": 5.801,
|
|
"mean_token_accuracy": 0.1637368842959404,
|
|
"num_tokens": 6889087.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 5.929503870010376,
|
|
"epoch": 2.972924988903684,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00044426612356610555,
|
|
"loss": 5.8323,
|
|
"mean_token_accuracy": 0.15772309452295302,
|
|
"num_tokens": 6898357.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.9494575500488285,
|
|
"epoch": 2.9773635153129163,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004440389770125382,
|
|
"loss": 5.9006,
|
|
"mean_token_accuracy": 0.1598823130130768,
|
|
"num_tokens": 6908363.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.953467893600464,
|
|
"epoch": 2.9818020417221485,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004438114342431586,
|
|
"loss": 5.7412,
|
|
"mean_token_accuracy": 0.16902253776788712,
|
|
"num_tokens": 6918680.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.909799098968506,
|
|
"epoch": 2.9862405681313806,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044358349579131143,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.16135867238044738,
|
|
"num_tokens": 6929063.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.941587018966675,
|
|
"epoch": 2.9906790945406128,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044335516219126876,
|
|
"loss": 5.805,
|
|
"mean_token_accuracy": 0.15798759311437607,
|
|
"num_tokens": 6937862.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.936902904510498,
|
|
"epoch": 2.995117620949845,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00044312643397822907,
|
|
"loss": 5.8394,
|
|
"mean_token_accuracy": 0.16224613785743713,
|
|
"num_tokens": 6948838.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 5.955539321899414,
|
|
"epoch": 2.999556147359077,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044289731168831566,
|
|
"loss": 5.8572,
|
|
"mean_token_accuracy": 0.15817692875862122,
|
|
"num_tokens": 6958496.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.930147065056695,
|
|
"epoch": 3.003550821127386,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004426677958585755,
|
|
"loss": 5.5163,
|
|
"mean_token_accuracy": 0.17406127519077724,
|
|
"num_tokens": 6967392.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.90186071395874,
|
|
"epoch": 3.007989347536618,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00044243788702697797,
|
|
"loss": 5.4168,
|
|
"mean_token_accuracy": 0.18226586729288102,
|
|
"num_tokens": 6976740.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.921399211883545,
|
|
"epoch": 3.01242787394585,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004422075857324137,
|
|
"loss": 5.461,
|
|
"mean_token_accuracy": 0.17682978212833406,
|
|
"num_tokens": 6986058.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.805210304260254,
|
|
"epoch": 3.0168664003550822,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044197689251469324,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.17929895371198654,
|
|
"num_tokens": 6997796.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.819172430038452,
|
|
"epoch": 3.0213049267643144,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044174580791454555,
|
|
"loss": 5.4213,
|
|
"mean_token_accuracy": 0.18021279126405715,
|
|
"num_tokens": 7008367.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.90168023109436,
|
|
"epoch": 3.0257434531735465,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004415143324736174,
|
|
"loss": 5.5685,
|
|
"mean_token_accuracy": 0.1715884819626808,
|
|
"num_tokens": 7019134.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.9204421043396,
|
|
"epoch": 3.0301819795827787,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004412824667344712,
|
|
"loss": 5.4352,
|
|
"mean_token_accuracy": 0.17551446259021758,
|
|
"num_tokens": 7030078.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.873832845687867,
|
|
"epoch": 3.034620505992011,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00044105021124058455,
|
|
"loss": 5.4334,
|
|
"mean_token_accuracy": 0.17652692794799804,
|
|
"num_tokens": 7039828.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.702576208114624,
|
|
"epoch": 3.039059032401243,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044081756653634825,
|
|
"loss": 5.4346,
|
|
"mean_token_accuracy": 0.19161795526742936,
|
|
"num_tokens": 7050842.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.811843490600586,
|
|
"epoch": 3.043497558810475,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004405845331670659,
|
|
"loss": 5.4042,
|
|
"mean_token_accuracy": 0.1850294515490532,
|
|
"num_tokens": 7059872.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.8140980243682865,
|
|
"epoch": 3.0479360852197073,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004403511116789514,
|
|
"loss": 5.4583,
|
|
"mean_token_accuracy": 0.17900667041540147,
|
|
"num_tokens": 7069625.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.849609327316284,
|
|
"epoch": 3.052374611628939,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044011730261912915,
|
|
"loss": 5.4784,
|
|
"mean_token_accuracy": 0.1747259259223938,
|
|
"num_tokens": 7078890.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.818154144287109,
|
|
"epoch": 3.056813138038171,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004398831065356314,
|
|
"loss": 5.4591,
|
|
"mean_token_accuracy": 0.18030397742986679,
|
|
"num_tokens": 7089123.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.864135217666626,
|
|
"epoch": 3.0612516644474033,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043964852397739793,
|
|
"loss": 5.4633,
|
|
"mean_token_accuracy": 0.1758294314146042,
|
|
"num_tokens": 7100053.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.854467535018921,
|
|
"epoch": 3.0656901908566354,
|
|
"grad_norm": 3.125,
|
|
"learning_rate": 0.000439413555494274,
|
|
"loss": 5.5035,
|
|
"mean_token_accuracy": 0.17171409279108046,
|
|
"num_tokens": 7110528.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.797104597091675,
|
|
"epoch": 3.0701287172658676,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004391782016370098,
|
|
"loss": 5.552,
|
|
"mean_token_accuracy": 0.17069081217050552,
|
|
"num_tokens": 7121691.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.799645948410034,
|
|
"epoch": 3.0745672436750997,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004389424629572586,
|
|
"loss": 5.4676,
|
|
"mean_token_accuracy": 0.17778647989034652,
|
|
"num_tokens": 7131689.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.832806205749511,
|
|
"epoch": 3.079005770084332,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043870634000757605,
|
|
"loss": 5.5696,
|
|
"mean_token_accuracy": 0.1696484714746475,
|
|
"num_tokens": 7142595.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.8818260669708256,
|
|
"epoch": 3.083444296493564,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004384698333414179,
|
|
"loss": 5.4671,
|
|
"mean_token_accuracy": 0.17925113886594773,
|
|
"num_tokens": 7152092.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.796309995651245,
|
|
"epoch": 3.087882822902796,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004382329435131396,
|
|
"loss": 5.4868,
|
|
"mean_token_accuracy": 0.17726072669029236,
|
|
"num_tokens": 7163053.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.830512142181396,
|
|
"epoch": 3.0923213493120283,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00043799567107799504,
|
|
"loss": 5.435,
|
|
"mean_token_accuracy": 0.18380391746759414,
|
|
"num_tokens": 7172812.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.815919589996338,
|
|
"epoch": 3.0967598757212604,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00043775801659213425,
|
|
"loss": 5.4432,
|
|
"mean_token_accuracy": 0.18219853341579437,
|
|
"num_tokens": 7183234.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.867840814590454,
|
|
"epoch": 3.1011984021304926,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004375199806126034,
|
|
"loss": 5.5505,
|
|
"mean_token_accuracy": 0.17434204816818238,
|
|
"num_tokens": 7193614.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.865722894668579,
|
|
"epoch": 3.1056369285397247,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043728156369734236,
|
|
"loss": 5.5435,
|
|
"mean_token_accuracy": 0.17825270295143128,
|
|
"num_tokens": 7204836.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"epoch": 3.1056369285397247,
|
|
"eval_entropy": 5.67943718654243,
|
|
"eval_loss": 6.10019063949585,
|
|
"eval_mean_token_accuracy": 0.15331950948314826,
|
|
"eval_num_tokens": 7204836.0,
|
|
"eval_runtime": 2.6975,
|
|
"eval_samples_per_second": 1248.216,
|
|
"eval_steps_per_second": 156.073,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 5.769807004928589,
|
|
"epoch": 3.110075454948957,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004370427664051841,
|
|
"loss": 5.4519,
|
|
"mean_token_accuracy": 0.17842291593551635,
|
|
"num_tokens": 7215138.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.7893476486206055,
|
|
"epoch": 3.114513981358189,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004368035892958533,
|
|
"loss": 5.5557,
|
|
"mean_token_accuracy": 0.17136096805334092,
|
|
"num_tokens": 7226468.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 5.889794778823853,
|
|
"epoch": 3.118952507767421,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043656403292996454,
|
|
"loss": 5.5482,
|
|
"mean_token_accuracy": 0.17302740216255189,
|
|
"num_tokens": 7235904.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 5.793400382995605,
|
|
"epoch": 3.1233910341766533,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004363240978690218,
|
|
"loss": 5.5274,
|
|
"mean_token_accuracy": 0.17253278195858002,
|
|
"num_tokens": 7245933.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 5.846996784210205,
|
|
"epoch": 3.1278295605858855,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00043608378467541626,
|
|
"loss": 5.5482,
|
|
"mean_token_accuracy": 0.17442068457603455,
|
|
"num_tokens": 7255626.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 5.793939161300659,
|
|
"epoch": 3.1322680869951176,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043584309391242584,
|
|
"loss": 5.471,
|
|
"mean_token_accuracy": 0.17612817138433456,
|
|
"num_tokens": 7264579.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 5.80440616607666,
|
|
"epoch": 3.1367066134043498,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004356020261442131,
|
|
"loss": 5.4877,
|
|
"mean_token_accuracy": 0.17804499417543412,
|
|
"num_tokens": 7274860.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.832252120971679,
|
|
"epoch": 3.141145139813582,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00043536058193582443,
|
|
"loss": 5.4445,
|
|
"mean_token_accuracy": 0.17826966494321822,
|
|
"num_tokens": 7285236.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.774497222900391,
|
|
"epoch": 3.145583666222814,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004351187618531886,
|
|
"loss": 5.4918,
|
|
"mean_token_accuracy": 0.17440381795167922,
|
|
"num_tokens": 7295291.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 5.885190725326538,
|
|
"epoch": 3.150022192632046,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043487656646311535,
|
|
"loss": 5.5069,
|
|
"mean_token_accuracy": 0.17112795114517212,
|
|
"num_tokens": 7306237.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 5.744331693649292,
|
|
"epoch": 3.1544607190412783,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004346339963332941,
|
|
"loss": 5.4601,
|
|
"mean_token_accuracy": 0.18217105120420457,
|
|
"num_tokens": 7316695.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.734088611602783,
|
|
"epoch": 3.1588992454505105,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004343910520322927,
|
|
"loss": 5.4478,
|
|
"mean_token_accuracy": 0.18409417420625687,
|
|
"num_tokens": 7325942.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 5.781349754333496,
|
|
"epoch": 3.1633377718597426,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000434147734129556,
|
|
"loss": 5.557,
|
|
"mean_token_accuracy": 0.17307535111904143,
|
|
"num_tokens": 7336817.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.821921443939209,
|
|
"epoch": 3.1677762982689748,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043390404319540443,
|
|
"loss": 5.5423,
|
|
"mean_token_accuracy": 0.17289045602083206,
|
|
"num_tokens": 7347072.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.850234889984131,
|
|
"epoch": 3.172214824678207,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043365997980103304,
|
|
"loss": 5.4943,
|
|
"mean_token_accuracy": 0.1778233155608177,
|
|
"num_tokens": 7357125.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 5.763746833801269,
|
|
"epoch": 3.176653351087439,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043341554451850964,
|
|
"loss": 5.4796,
|
|
"mean_token_accuracy": 0.1793802037835121,
|
|
"num_tokens": 7367290.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 5.780725145339966,
|
|
"epoch": 3.181091877496671,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043317073792077394,
|
|
"loss": 5.4474,
|
|
"mean_token_accuracy": 0.18791042119264603,
|
|
"num_tokens": 7377126.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 5.8030867099761965,
|
|
"epoch": 3.1855304039059034,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004329255605816357,
|
|
"loss": 5.4992,
|
|
"mean_token_accuracy": 0.17195357382297516,
|
|
"num_tokens": 7388136.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 5.821031093597412,
|
|
"epoch": 3.1899689303151355,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000432680013075774,
|
|
"loss": 5.436,
|
|
"mean_token_accuracy": 0.17939778566360473,
|
|
"num_tokens": 7397781.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 5.805264902114868,
|
|
"epoch": 3.1944074567243677,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004324340959787354,
|
|
"loss": 5.4492,
|
|
"mean_token_accuracy": 0.17887378931045533,
|
|
"num_tokens": 7407135.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 5.814063787460327,
|
|
"epoch": 3.1988459831336,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043218780986693274,
|
|
"loss": 5.5155,
|
|
"mean_token_accuracy": 0.1740931436419487,
|
|
"num_tokens": 7417614.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 5.742436218261719,
|
|
"epoch": 3.203284509542832,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004319411553176438,
|
|
"loss": 5.5237,
|
|
"mean_token_accuracy": 0.17489579766988755,
|
|
"num_tokens": 7427792.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.751005458831787,
|
|
"epoch": 3.207723035952064,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004316941329090101,
|
|
"loss": 5.4246,
|
|
"mean_token_accuracy": 0.1843129500746727,
|
|
"num_tokens": 7437310.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.804794406890869,
|
|
"epoch": 3.2121615623612962,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043144674322003525,
|
|
"loss": 5.5249,
|
|
"mean_token_accuracy": 0.1753912925720215,
|
|
"num_tokens": 7447451.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.8752443313598635,
|
|
"epoch": 3.2166000887705284,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004311989868305837,
|
|
"loss": 5.536,
|
|
"mean_token_accuracy": 0.1762519434094429,
|
|
"num_tokens": 7456837.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.7469000816345215,
|
|
"epoch": 3.2210386151797605,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00043095086432137954,
|
|
"loss": 5.5601,
|
|
"mean_token_accuracy": 0.17813700139522554,
|
|
"num_tokens": 7466832.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 5.867207765579224,
|
|
"epoch": 3.2254771415889927,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000430702376274005,
|
|
"loss": 5.5123,
|
|
"mean_token_accuracy": 0.181433866918087,
|
|
"num_tokens": 7476833.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.72882194519043,
|
|
"epoch": 3.2299156679982244,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043045352327089907,
|
|
"loss": 5.4978,
|
|
"mean_token_accuracy": 0.17953841239213944,
|
|
"num_tokens": 7486980.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.76573543548584,
|
|
"epoch": 3.2343541944074565,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00043020430589535625,
|
|
"loss": 5.511,
|
|
"mean_token_accuracy": 0.1714419886469841,
|
|
"num_tokens": 7496612.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.787287712097168,
|
|
"epoch": 3.2387927208166887,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000429954724731525,
|
|
"loss": 5.5044,
|
|
"mean_token_accuracy": 0.17498656511306762,
|
|
"num_tokens": 7506704.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 5.848012685775757,
|
|
"epoch": 3.243231247225921,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004297047803644063,
|
|
"loss": 5.5579,
|
|
"mean_token_accuracy": 0.16941310465335846,
|
|
"num_tokens": 7517914.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 5.829830932617187,
|
|
"epoch": 3.247669773635153,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000429454473379853,
|
|
"loss": 5.5851,
|
|
"mean_token_accuracy": 0.16952553391456604,
|
|
"num_tokens": 7527610.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 5.78036208152771,
|
|
"epoch": 3.252108300044385,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004292038043645675,
|
|
"loss": 5.579,
|
|
"mean_token_accuracy": 0.17085347920656205,
|
|
"num_tokens": 7536721.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.835186433792114,
|
|
"epoch": 3.2565468264536173,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042895277390610074,
|
|
"loss": 5.5393,
|
|
"mean_token_accuracy": 0.16900095343589783,
|
|
"num_tokens": 7546508.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.8003698825836185,
|
|
"epoch": 3.2609853528628494,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004287013825928509,
|
|
"loss": 5.4926,
|
|
"mean_token_accuracy": 0.1826077312231064,
|
|
"num_tokens": 7556024.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 5.807423114776611,
|
|
"epoch": 3.2654238792720816,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004284496310140622,
|
|
"loss": 5.6074,
|
|
"mean_token_accuracy": 0.16542265564203262,
|
|
"num_tokens": 7566033.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 5.8312273025512695,
|
|
"epoch": 3.2698624056813137,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004281975197598231,
|
|
"loss": 5.6146,
|
|
"mean_token_accuracy": 0.17007148563861846,
|
|
"num_tokens": 7576956.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.792421102523804,
|
|
"epoch": 3.274300932090546,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004279450494210651,
|
|
"loss": 5.5571,
|
|
"mean_token_accuracy": 0.17620914578437805,
|
|
"num_tokens": 7588185.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.833206367492676,
|
|
"epoch": 3.278739458499778,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004276922205895614,
|
|
"loss": 5.4967,
|
|
"mean_token_accuracy": 0.17706188112497329,
|
|
"num_tokens": 7598886.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 5.774030017852783,
|
|
"epoch": 3.28317798490901,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004274390338579257,
|
|
"loss": 5.4094,
|
|
"mean_token_accuracy": 0.18668818473815918,
|
|
"num_tokens": 7609238.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.7815450668334964,
|
|
"epoch": 3.2876165113182423,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004271854898196102,
|
|
"loss": 5.4946,
|
|
"mean_token_accuracy": 0.1777348294854164,
|
|
"num_tokens": 7619873.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 5.715425872802735,
|
|
"epoch": 3.2920550377274744,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004269315890689049,
|
|
"loss": 5.4391,
|
|
"mean_token_accuracy": 0.18781703263521193,
|
|
"num_tokens": 7628903.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 5.795434141159058,
|
|
"epoch": 3.2964935641367066,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00042667733220093574,
|
|
"loss": 5.6098,
|
|
"mean_token_accuracy": 0.16501247882843018,
|
|
"num_tokens": 7639774.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 5.788212394714355,
|
|
"epoch": 3.3009320905459387,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004264227198116635,
|
|
"loss": 5.5198,
|
|
"mean_token_accuracy": 0.17427263855934144,
|
|
"num_tokens": 7649739.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 5.754326581954956,
|
|
"epoch": 3.305370616955171,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042616775249788223,
|
|
"loss": 5.4986,
|
|
"mean_token_accuracy": 0.17347201257944106,
|
|
"num_tokens": 7659329.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 5.818285989761352,
|
|
"epoch": 3.309809143364403,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004259124308572178,
|
|
"loss": 5.5031,
|
|
"mean_token_accuracy": 0.17783356904983522,
|
|
"num_tokens": 7669754.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 5.849746561050415,
|
|
"epoch": 3.314247669773635,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004256567554881268,
|
|
"loss": 5.5744,
|
|
"mean_token_accuracy": 0.16835701167583467,
|
|
"num_tokens": 7679139.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 5.756852912902832,
|
|
"epoch": 3.3186861961828673,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004254007269898948,
|
|
"loss": 5.4857,
|
|
"mean_token_accuracy": 0.17899881154298783,
|
|
"num_tokens": 7689210.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.784307432174683,
|
|
"epoch": 3.3231247225920995,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00042514434596263513,
|
|
"loss": 5.5316,
|
|
"mean_token_accuracy": 0.17348483949899673,
|
|
"num_tokens": 7698741.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 5.769883012771606,
|
|
"epoch": 3.3275632490013316,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.0004248876130072873,
|
|
"loss": 5.5304,
|
|
"mean_token_accuracy": 0.1791750445961952,
|
|
"num_tokens": 7708398.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.805131721496582,
|
|
"epoch": 3.3320017754105637,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00042463052872561587,
|
|
"loss": 5.4996,
|
|
"mean_token_accuracy": 0.17841846048831939,
|
|
"num_tokens": 7718574.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 5.776119947433472,
|
|
"epoch": 3.336440301819796,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00042437309372020886,
|
|
"loss": 5.491,
|
|
"mean_token_accuracy": 0.18578603267669677,
|
|
"num_tokens": 7728453.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 5.758517026901245,
|
|
"epoch": 3.340878828229028,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00042411530859447634,
|
|
"loss": 5.4694,
|
|
"mean_token_accuracy": 0.17349309474229813,
|
|
"num_tokens": 7738928.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 5.788589143753052,
|
|
"epoch": 3.34531735463826,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004238571739526489,
|
|
"loss": 5.5044,
|
|
"mean_token_accuracy": 0.18183342814445497,
|
|
"num_tokens": 7748828.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 5.8095966339111325,
|
|
"epoch": 3.3497558810474923,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004235986903997767,
|
|
"loss": 5.5192,
|
|
"mean_token_accuracy": 0.17913017868995668,
|
|
"num_tokens": 7759533.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 5.770309352874756,
|
|
"epoch": 3.3541944074567245,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004233398585417275,
|
|
"loss": 5.4932,
|
|
"mean_token_accuracy": 0.17637839764356614,
|
|
"num_tokens": 7769511.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 5.806517553329468,
|
|
"epoch": 3.3586329338659566,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004230806789851854,
|
|
"loss": 5.5236,
|
|
"mean_token_accuracy": 0.1788152739405632,
|
|
"num_tokens": 7779579.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.761344146728516,
|
|
"epoch": 3.3630714602751888,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00042282115233764953,
|
|
"loss": 5.5373,
|
|
"mean_token_accuracy": 0.18033097833395004,
|
|
"num_tokens": 7789739.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 5.832413530349731,
|
|
"epoch": 3.367509986684421,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004225612792074326,
|
|
"loss": 5.5743,
|
|
"mean_token_accuracy": 0.17297957986593246,
|
|
"num_tokens": 7798744.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 5.769485569000244,
|
|
"epoch": 3.371948513093653,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00042230106020365964,
|
|
"loss": 5.4193,
|
|
"mean_token_accuracy": 0.1825847089290619,
|
|
"num_tokens": 7808111.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 5.798009586334229,
|
|
"epoch": 3.376387039502885,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042204049593626617,
|
|
"loss": 5.4902,
|
|
"mean_token_accuracy": 0.17742030769586564,
|
|
"num_tokens": 7818673.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 5.741698551177978,
|
|
"epoch": 3.3808255659121174,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00042177958701599696,
|
|
"loss": 5.508,
|
|
"mean_token_accuracy": 0.17802224904298783,
|
|
"num_tokens": 7829165.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 5.735812187194824,
|
|
"epoch": 3.3852640923213495,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004215183340544047,
|
|
"loss": 5.4262,
|
|
"mean_token_accuracy": 0.1855878248810768,
|
|
"num_tokens": 7839345.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.765830135345459,
|
|
"epoch": 3.389702618730581,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004212567376638485,
|
|
"loss": 5.5266,
|
|
"mean_token_accuracy": 0.18168332129716874,
|
|
"num_tokens": 7850232.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.817579126358032,
|
|
"epoch": 3.3941411451398134,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00042099479845749256,
|
|
"loss": 5.5961,
|
|
"mean_token_accuracy": 0.16893403679132463,
|
|
"num_tokens": 7860109.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.775877475738525,
|
|
"epoch": 3.3985796715490455,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042073251704930414,
|
|
"loss": 5.5559,
|
|
"mean_token_accuracy": 0.17739353477954864,
|
|
"num_tokens": 7870466.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.847122144699097,
|
|
"epoch": 3.4030181979582776,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042046989405405326,
|
|
"loss": 5.5934,
|
|
"mean_token_accuracy": 0.17239516228437424,
|
|
"num_tokens": 7880460.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 5.73626298904419,
|
|
"epoch": 3.40745672436751,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004202069300873102,
|
|
"loss": 5.444,
|
|
"mean_token_accuracy": 0.17805344611406326,
|
|
"num_tokens": 7890099.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 5.804626178741455,
|
|
"epoch": 3.411895250776742,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004199436257654445,
|
|
"loss": 5.5374,
|
|
"mean_token_accuracy": 0.17474997490644456,
|
|
"num_tokens": 7900484.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 5.791158151626587,
|
|
"epoch": 3.416333777185974,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004196799817056234,
|
|
"loss": 5.5676,
|
|
"mean_token_accuracy": 0.1661073759198189,
|
|
"num_tokens": 7911408.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 5.822518634796142,
|
|
"epoch": 3.4207723035952062,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041941599852581067,
|
|
"loss": 5.5941,
|
|
"mean_token_accuracy": 0.16456971168518067,
|
|
"num_tokens": 7922317.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 5.850543022155762,
|
|
"epoch": 3.4252108300044384,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041915167684476495,
|
|
"loss": 5.5218,
|
|
"mean_token_accuracy": 0.18075551390647887,
|
|
"num_tokens": 7932713.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 5.771756839752197,
|
|
"epoch": 3.4296493564136705,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000418887017282038,
|
|
"loss": 5.4753,
|
|
"mean_token_accuracy": 0.1776781052350998,
|
|
"num_tokens": 7942639.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 5.707421112060547,
|
|
"epoch": 3.4340878828229027,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041862202045797386,
|
|
"loss": 5.5052,
|
|
"mean_token_accuracy": 0.18350479304790496,
|
|
"num_tokens": 7953094.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 5.789714384078979,
|
|
"epoch": 3.438526409232135,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004183566869937069,
|
|
"loss": 5.5103,
|
|
"mean_token_accuracy": 0.17723090648651124,
|
|
"num_tokens": 7963070.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 5.729114675521851,
|
|
"epoch": 3.442964935641367,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004180910175111608,
|
|
"loss": 5.4825,
|
|
"mean_token_accuracy": 0.18474385887384415,
|
|
"num_tokens": 7972957.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 5.81961579322815,
|
|
"epoch": 3.447403462050599,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041782501263304655,
|
|
"loss": 5.5174,
|
|
"mean_token_accuracy": 0.17037456184625627,
|
|
"num_tokens": 7982759.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 5.793990993499756,
|
|
"epoch": 3.4518419884598313,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004175586729828614,
|
|
"loss": 5.6276,
|
|
"mean_token_accuracy": 0.1665704995393753,
|
|
"num_tokens": 7993300.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 5.737445640563965,
|
|
"epoch": 3.4562805148690634,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041729199918488725,
|
|
"loss": 5.4466,
|
|
"mean_token_accuracy": 0.1841512829065323,
|
|
"num_tokens": 8003175.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.7286967754364015,
|
|
"epoch": 3.4607190412782955,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041702499186418936,
|
|
"loss": 5.4967,
|
|
"mean_token_accuracy": 0.18316451460123062,
|
|
"num_tokens": 8013399.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 5.761036109924317,
|
|
"epoch": 3.4651575676875277,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041675765164661473,
|
|
"loss": 5.5364,
|
|
"mean_token_accuracy": 0.1704569160938263,
|
|
"num_tokens": 8022939.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.758256196975708,
|
|
"epoch": 3.46959609409676,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004164899791587903,
|
|
"loss": 5.5904,
|
|
"mean_token_accuracy": 0.17271675616502763,
|
|
"num_tokens": 8034267.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.749184274673462,
|
|
"epoch": 3.474034620505992,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00041622197502812224,
|
|
"loss": 5.4549,
|
|
"mean_token_accuracy": 0.17980799823999405,
|
|
"num_tokens": 8044270.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 5.827999448776245,
|
|
"epoch": 3.478473146915224,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000415953639882794,
|
|
"loss": 5.5304,
|
|
"mean_token_accuracy": 0.1710374191403389,
|
|
"num_tokens": 8055775.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 5.766659116744995,
|
|
"epoch": 3.4829116733244563,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00041568497435176473,
|
|
"loss": 5.5221,
|
|
"mean_token_accuracy": 0.17611446529626845,
|
|
"num_tokens": 8065768.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 5.748378419876099,
|
|
"epoch": 3.4873501997336884,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004154159790647681,
|
|
"loss": 5.4649,
|
|
"mean_token_accuracy": 0.18407126516103745,
|
|
"num_tokens": 8075759.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 5.7725756645202635,
|
|
"epoch": 3.4917887261429206,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041514665465231063,
|
|
"loss": 5.4982,
|
|
"mean_token_accuracy": 0.18658517599105834,
|
|
"num_tokens": 8085658.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 5.741648721694946,
|
|
"epoch": 3.4962272525521527,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041487700174567036,
|
|
"loss": 5.5052,
|
|
"mean_token_accuracy": 0.17059303522109986,
|
|
"num_tokens": 8096094.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 5.767246150970459,
|
|
"epoch": 3.500665778961385,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041460702097689535,
|
|
"loss": 5.5218,
|
|
"mean_token_accuracy": 0.1741237834095955,
|
|
"num_tokens": 8106617.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 5.773199129104614,
|
|
"epoch": 3.505104305370617,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041433671297880204,
|
|
"loss": 5.5496,
|
|
"mean_token_accuracy": 0.16931709200143813,
|
|
"num_tokens": 8116621.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 5.806981468200684,
|
|
"epoch": 3.509542831779849,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004140660783849739,
|
|
"loss": 5.5137,
|
|
"mean_token_accuracy": 0.17311855256557465,
|
|
"num_tokens": 8127433.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 5.786522340774536,
|
|
"epoch": 3.5139813581890813,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041379511782975995,
|
|
"loss": 5.5991,
|
|
"mean_token_accuracy": 0.17303308695554734,
|
|
"num_tokens": 8138568.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 5.76244478225708,
|
|
"epoch": 3.5184198845983135,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004135238319482731,
|
|
"loss": 5.5114,
|
|
"mean_token_accuracy": 0.18091665506362914,
|
|
"num_tokens": 8148358.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 5.7167627811431885,
|
|
"epoch": 3.5228584110075456,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041325222137638914,
|
|
"loss": 5.3969,
|
|
"mean_token_accuracy": 0.18320150971412658,
|
|
"num_tokens": 8157817.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 5.775286912918091,
|
|
"epoch": 3.5272969374167777,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004129802867507444,
|
|
"loss": 5.5544,
|
|
"mean_token_accuracy": 0.17027477473020552,
|
|
"num_tokens": 8167599.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 5.696363019943237,
|
|
"epoch": 3.53173546382601,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004127080287087354,
|
|
"loss": 5.5232,
|
|
"mean_token_accuracy": 0.17984641939401627,
|
|
"num_tokens": 8179004.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.784954500198364,
|
|
"epoch": 3.536173990235242,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041243544788851616,
|
|
"loss": 5.4638,
|
|
"mean_token_accuracy": 0.18233600854873658,
|
|
"num_tokens": 8189410.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 5.829836797714234,
|
|
"epoch": 3.540612516644474,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041216254492899753,
|
|
"loss": 5.6603,
|
|
"mean_token_accuracy": 0.1625197023153305,
|
|
"num_tokens": 8200712.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 5.799665212631226,
|
|
"epoch": 3.5450510430537063,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004118893204698454,
|
|
"loss": 5.5192,
|
|
"mean_token_accuracy": 0.17453998774290086,
|
|
"num_tokens": 8209907.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.747171545028687,
|
|
"epoch": 3.5494895694629385,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004116157751514793,
|
|
"loss": 5.5106,
|
|
"mean_token_accuracy": 0.18200805485248567,
|
|
"num_tokens": 8220216.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"epoch": 3.5494895694629385,
|
|
"eval_entropy": 5.639556728462709,
|
|
"eval_loss": 6.055363178253174,
|
|
"eval_mean_token_accuracy": 0.1559798157377934,
|
|
"eval_num_tokens": 8220216.0,
|
|
"eval_runtime": 2.6999,
|
|
"eval_samples_per_second": 1247.088,
|
|
"eval_steps_per_second": 155.932,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 5.758590269088745,
|
|
"epoch": 3.5539280958721706,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00041134190961507073,
|
|
"loss": 5.5321,
|
|
"mean_token_accuracy": 0.17542774826288224,
|
|
"num_tokens": 8230336.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 5.784881734848023,
|
|
"epoch": 3.5583666222814028,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041106772450254177,
|
|
"loss": 5.4653,
|
|
"mean_token_accuracy": 0.17452345192432403,
|
|
"num_tokens": 8240874.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 5.783570194244385,
|
|
"epoch": 3.562805148690635,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041079322045656366,
|
|
"loss": 5.5892,
|
|
"mean_token_accuracy": 0.17384659200906755,
|
|
"num_tokens": 8252841.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 5.830329322814942,
|
|
"epoch": 3.567243675099867,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000410518398120555,
|
|
"loss": 5.5175,
|
|
"mean_token_accuracy": 0.17372012734413148,
|
|
"num_tokens": 8263302.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 5.751014280319214,
|
|
"epoch": 3.571682201509099,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00041024325813868065,
|
|
"loss": 5.5459,
|
|
"mean_token_accuracy": 0.17314320653676987,
|
|
"num_tokens": 8274057.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 5.72536072731018,
|
|
"epoch": 3.5761207279183314,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00040996780115584995,
|
|
"loss": 5.5958,
|
|
"mean_token_accuracy": 0.1759219765663147,
|
|
"num_tokens": 8286464.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 5.826333808898926,
|
|
"epoch": 3.5805592543275635,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004096920278177153,
|
|
"loss": 5.5092,
|
|
"mean_token_accuracy": 0.18037501573562623,
|
|
"num_tokens": 8296892.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 5.790096998214722,
|
|
"epoch": 3.5849977807367956,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004094159387706703,
|
|
"loss": 5.5125,
|
|
"mean_token_accuracy": 0.18033478856086732,
|
|
"num_tokens": 8306657.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 5.824331569671631,
|
|
"epoch": 3.589436307146028,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004091395346618491,
|
|
"loss": 5.6575,
|
|
"mean_token_accuracy": 0.16630110293626785,
|
|
"num_tokens": 8316827.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 5.805656099319458,
|
|
"epoch": 3.5938748335552595,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00040886281613912396,
|
|
"loss": 5.4919,
|
|
"mean_token_accuracy": 0.17849037796258926,
|
|
"num_tokens": 8328373.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 5.827359437942505,
|
|
"epoch": 3.5983133599644916,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004085857838511042,
|
|
"loss": 5.5818,
|
|
"mean_token_accuracy": 0.17678980827331542,
|
|
"num_tokens": 8341237.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 5.710772895812989,
|
|
"epoch": 3.602751886373724,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040830843844713447,
|
|
"loss": 5.5011,
|
|
"mean_token_accuracy": 0.1750195726752281,
|
|
"num_tokens": 8352017.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 5.81193175315857,
|
|
"epoch": 3.607190412782956,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040803078057729354,
|
|
"loss": 5.5159,
|
|
"mean_token_accuracy": 0.17865791022777558,
|
|
"num_tokens": 8362928.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 5.748114824295044,
|
|
"epoch": 3.611628939192188,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004077528108923924,
|
|
"loss": 5.5559,
|
|
"mean_token_accuracy": 0.17659952044486998,
|
|
"num_tokens": 8373381.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 5.803421354293823,
|
|
"epoch": 3.6160674656014202,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004074745300439732,
|
|
"loss": 5.6322,
|
|
"mean_token_accuracy": 0.1618813991546631,
|
|
"num_tokens": 8384582.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 5.8019660949707035,
|
|
"epoch": 3.6205059920106524,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000407195938684307,
|
|
"loss": 5.4872,
|
|
"mean_token_accuracy": 0.17608115077018738,
|
|
"num_tokens": 8394519.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 5.7562150955200195,
|
|
"epoch": 3.6249445184198845,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000406917037466393,
|
|
"loss": 5.5079,
|
|
"mean_token_accuracy": 0.18082676380872725,
|
|
"num_tokens": 8405010.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 5.736172008514404,
|
|
"epoch": 3.6293830448291167,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004066378270439567,
|
|
"loss": 5.4797,
|
|
"mean_token_accuracy": 0.18313054293394088,
|
|
"num_tokens": 8414933.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 5.825035905838012,
|
|
"epoch": 3.633821571238349,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004063583080714481,
|
|
"loss": 5.4873,
|
|
"mean_token_accuracy": 0.17869255542755128,
|
|
"num_tokens": 8426086.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 5.788977384567261,
|
|
"epoch": 3.638260097647581,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040607848120404063,
|
|
"loss": 5.587,
|
|
"mean_token_accuracy": 0.16598645299673082,
|
|
"num_tokens": 8436157.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 5.757912921905517,
|
|
"epoch": 3.642698624056813,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004057983470976293,
|
|
"loss": 5.5187,
|
|
"mean_token_accuracy": 0.17786410450935364,
|
|
"num_tokens": 8446602.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 5.770361804962159,
|
|
"epoch": 3.6471371504660453,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00040551790640882954,
|
|
"loss": 5.5779,
|
|
"mean_token_accuracy": 0.17473774552345275,
|
|
"num_tokens": 8457029.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 5.7793317317962645,
|
|
"epoch": 3.6515756768752774,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040523715979497486,
|
|
"loss": 5.5423,
|
|
"mean_token_accuracy": 0.1721513971686363,
|
|
"num_tokens": 8466965.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 5.807348728179932,
|
|
"epoch": 3.6560142032845095,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004049561079141163,
|
|
"loss": 5.5432,
|
|
"mean_token_accuracy": 0.1787703663110733,
|
|
"num_tokens": 8477009.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 5.7499840259552,
|
|
"epoch": 3.6604527296937417,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004046747514250202,
|
|
"loss": 5.5504,
|
|
"mean_token_accuracy": 0.17546208202838898,
|
|
"num_tokens": 8487931.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 5.652848815917968,
|
|
"epoch": 3.664891256102974,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004043930909871671,
|
|
"loss": 5.4463,
|
|
"mean_token_accuracy": 0.1887633755803108,
|
|
"num_tokens": 8498347.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 5.742549324035645,
|
|
"epoch": 3.669329782512206,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00040411112726074954,
|
|
"loss": 5.4154,
|
|
"mean_token_accuracy": 0.18402329832315445,
|
|
"num_tokens": 8508032.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 5.75079312324524,
|
|
"epoch": 3.673768308921438,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00040382886090667154,
|
|
"loss": 5.4874,
|
|
"mean_token_accuracy": 0.1806105464696884,
|
|
"num_tokens": 8517279.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 5.771097898483276,
|
|
"epoch": 3.6782068353306703,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004035462925865459,
|
|
"loss": 5.5024,
|
|
"mean_token_accuracy": 0.17528152018785476,
|
|
"num_tokens": 8526978.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 5.67859206199646,
|
|
"epoch": 3.6826453617399024,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00040326342296269363,
|
|
"loss": 5.4488,
|
|
"mean_token_accuracy": 0.18660874664783478,
|
|
"num_tokens": 8537203.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 5.743128395080566,
|
|
"epoch": 3.6870838881491346,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00040298025269814165,
|
|
"loss": 5.4749,
|
|
"mean_token_accuracy": 0.17928291708230973,
|
|
"num_tokens": 8548761.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 5.839509391784668,
|
|
"epoch": 3.6915224145583667,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004026967824566218,
|
|
"loss": 5.5589,
|
|
"mean_token_accuracy": 0.16653368175029754,
|
|
"num_tokens": 8559428.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 5.729336977005005,
|
|
"epoch": 3.695960940967599,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000402413012902569,
|
|
"loss": 5.4503,
|
|
"mean_token_accuracy": 0.17860912382602692,
|
|
"num_tokens": 8570173.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 5.747783279418945,
|
|
"epoch": 3.700399467376831,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00040212894470111966,
|
|
"loss": 5.5785,
|
|
"mean_token_accuracy": 0.17391075789928437,
|
|
"num_tokens": 8581673.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 5.77725305557251,
|
|
"epoch": 3.704837993786063,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004018445785181102,
|
|
"loss": 5.4539,
|
|
"mean_token_accuracy": 0.18218168914318084,
|
|
"num_tokens": 8591375.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 5.710399770736695,
|
|
"epoch": 3.7092765201952953,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004015599150200755,
|
|
"loss": 5.5329,
|
|
"mean_token_accuracy": 0.1777075231075287,
|
|
"num_tokens": 8601940.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 5.707136774063111,
|
|
"epoch": 3.7137150466045274,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00040127495487424735,
|
|
"loss": 5.4598,
|
|
"mean_token_accuracy": 0.18140023648738862,
|
|
"num_tokens": 8612346.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 5.744045686721802,
|
|
"epoch": 3.7181535730137596,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004009896987485531,
|
|
"loss": 5.5638,
|
|
"mean_token_accuracy": 0.17714692652225494,
|
|
"num_tokens": 8622994.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 5.775576734542847,
|
|
"epoch": 3.7225920994229913,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00040070414731161326,
|
|
"loss": 5.5267,
|
|
"mean_token_accuracy": 0.1812612682580948,
|
|
"num_tokens": 8633684.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 5.662596607208252,
|
|
"epoch": 3.7270306258322234,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00040041830123274105,
|
|
"loss": 5.4511,
|
|
"mean_token_accuracy": 0.18718448132276536,
|
|
"num_tokens": 8642799.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 5.827040672302246,
|
|
"epoch": 3.7314691522414556,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004001321611819401,
|
|
"loss": 5.5311,
|
|
"mean_token_accuracy": 0.18084388226270676,
|
|
"num_tokens": 8652611.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 5.714217329025269,
|
|
"epoch": 3.7359076786506877,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003998457278299033,
|
|
"loss": 5.5617,
|
|
"mean_token_accuracy": 0.17636579573154448,
|
|
"num_tokens": 8662819.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 5.70295467376709,
|
|
"epoch": 3.74034620505992,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003995590018480107,
|
|
"loss": 5.4903,
|
|
"mean_token_accuracy": 0.18014921694993974,
|
|
"num_tokens": 8673276.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 5.848191595077514,
|
|
"epoch": 3.744784731469152,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00039927198390832843,
|
|
"loss": 5.6112,
|
|
"mean_token_accuracy": 0.1720762312412262,
|
|
"num_tokens": 8684106.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 5.776020240783692,
|
|
"epoch": 3.749223257878384,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000398984674683607,
|
|
"loss": 5.4998,
|
|
"mean_token_accuracy": 0.1755255162715912,
|
|
"num_tokens": 8694533.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 5.738758993148804,
|
|
"epoch": 3.7536617842876163,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003986970748472795,
|
|
"loss": 5.5222,
|
|
"mean_token_accuracy": 0.17897798866033554,
|
|
"num_tokens": 8704241.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 5.78121862411499,
|
|
"epoch": 3.7581003106968485,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003984091850734604,
|
|
"loss": 5.5512,
|
|
"mean_token_accuracy": 0.16789624243974685,
|
|
"num_tokens": 8714364.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 5.697751045227051,
|
|
"epoch": 3.7625388371060806,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003981210060369435,
|
|
"loss": 5.5404,
|
|
"mean_token_accuracy": 0.1779459834098816,
|
|
"num_tokens": 8724443.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 5.702847146987915,
|
|
"epoch": 3.7669773635153128,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000397832538413201,
|
|
"loss": 5.4592,
|
|
"mean_token_accuracy": 0.1797871246933937,
|
|
"num_tokens": 8733880.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 5.8351147174835205,
|
|
"epoch": 3.771415889924545,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0003975437828783811,
|
|
"loss": 5.524,
|
|
"mean_token_accuracy": 0.1804560035467148,
|
|
"num_tokens": 8744437.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 5.753838205337525,
|
|
"epoch": 3.775854416333777,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00039725474010930716,
|
|
"loss": 5.5152,
|
|
"mean_token_accuracy": 0.1822276994585991,
|
|
"num_tokens": 8756107.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 5.7022788524627686,
|
|
"epoch": 3.780292942743009,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0003969654107834756,
|
|
"loss": 5.5006,
|
|
"mean_token_accuracy": 0.17494045644998552,
|
|
"num_tokens": 8766490.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 5.785413694381714,
|
|
"epoch": 3.7847314691522413,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003966757955790547,
|
|
"loss": 5.4772,
|
|
"mean_token_accuracy": 0.18133565336465834,
|
|
"num_tokens": 8776401.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 5.750336790084839,
|
|
"epoch": 3.7891699955614735,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0003963858951748826,
|
|
"loss": 5.5201,
|
|
"mean_token_accuracy": 0.1766982913017273,
|
|
"num_tokens": 8786816.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 5.6869926929473875,
|
|
"epoch": 3.7936085219707056,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003960957102504661,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.18434616476297377,
|
|
"num_tokens": 8796692.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 5.746105194091797,
|
|
"epoch": 3.798047048379938,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003958052414859788,
|
|
"loss": 5.5203,
|
|
"mean_token_accuracy": 0.17907101064920425,
|
|
"num_tokens": 8807118.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 5.681885862350464,
|
|
"epoch": 3.80248557478917,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003955144895622597,
|
|
"loss": 5.4925,
|
|
"mean_token_accuracy": 0.1807284712791443,
|
|
"num_tokens": 8817914.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 5.751665019989014,
|
|
"epoch": 3.806924101198402,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003952234551608114,
|
|
"loss": 5.5089,
|
|
"mean_token_accuracy": 0.17762693464756013,
|
|
"num_tokens": 8828236.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 5.7408606052398685,
|
|
"epoch": 3.8113626276076342,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003949321389637986,
|
|
"loss": 5.4302,
|
|
"mean_token_accuracy": 0.18315188437700272,
|
|
"num_tokens": 8838911.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 5.7521624088287355,
|
|
"epoch": 3.8158011540168664,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003946405416540466,
|
|
"loss": 5.4319,
|
|
"mean_token_accuracy": 0.1811888560652733,
|
|
"num_tokens": 8849116.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 5.720421886444091,
|
|
"epoch": 3.8202396804260985,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039434866391503963,
|
|
"loss": 5.4994,
|
|
"mean_token_accuracy": 0.17618632167577744,
|
|
"num_tokens": 8860279.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 5.7000336170196535,
|
|
"epoch": 3.8246782068353307,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00039405650643091917,
|
|
"loss": 5.5333,
|
|
"mean_token_accuracy": 0.18363996148109435,
|
|
"num_tokens": 8869910.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 5.730699825286865,
|
|
"epoch": 3.829116733244563,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003937640698864823,
|
|
"loss": 5.5585,
|
|
"mean_token_accuracy": 0.1803690657019615,
|
|
"num_tokens": 8880781.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 5.7924156665802,
|
|
"epoch": 3.833555259653795,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00039347135496718027,
|
|
"loss": 5.5631,
|
|
"mean_token_accuracy": 0.16978129595518113,
|
|
"num_tokens": 8891812.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 5.719081401824951,
|
|
"epoch": 3.837993786063027,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00039317836235911705,
|
|
"loss": 5.4632,
|
|
"mean_token_accuracy": 0.17845752388238906,
|
|
"num_tokens": 8902112.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 5.681349039077759,
|
|
"epoch": 3.8424323124722592,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003928850927490472,
|
|
"loss": 5.4173,
|
|
"mean_token_accuracy": 0.18779767602682113,
|
|
"num_tokens": 8912009.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 5.729856777191162,
|
|
"epoch": 3.8468708388814914,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0003925915468243746,
|
|
"loss": 5.4864,
|
|
"mean_token_accuracy": 0.18054269552230834,
|
|
"num_tokens": 8921986.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 5.698644685745239,
|
|
"epoch": 3.8513093652907235,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00039229772527315073,
|
|
"loss": 5.5588,
|
|
"mean_token_accuracy": 0.1698625460267067,
|
|
"num_tokens": 8932103.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 5.785820150375367,
|
|
"epoch": 3.8557478916999557,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003920036287840734,
|
|
"loss": 5.5093,
|
|
"mean_token_accuracy": 0.18339616656303406,
|
|
"num_tokens": 8942587.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 5.716684341430664,
|
|
"epoch": 3.860186418109188,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039170925804648486,
|
|
"loss": 5.4901,
|
|
"mean_token_accuracy": 0.18353802263736724,
|
|
"num_tokens": 8954882.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 5.640814590454101,
|
|
"epoch": 3.86462494451842,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00039141461375036957,
|
|
"loss": 5.4216,
|
|
"mean_token_accuracy": 0.1882522866129875,
|
|
"num_tokens": 8965400.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 5.732454633712768,
|
|
"epoch": 3.869063470927652,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003911196965863539,
|
|
"loss": 5.4433,
|
|
"mean_token_accuracy": 0.17967188507318496,
|
|
"num_tokens": 8975425.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 5.708558893203735,
|
|
"epoch": 3.8735019973368843,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00039082450724570357,
|
|
"loss": 5.5334,
|
|
"mean_token_accuracy": 0.17930300831794738,
|
|
"num_tokens": 8986111.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 5.737200307846069,
|
|
"epoch": 3.8779405237461164,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003905290464203221,
|
|
"loss": 5.5118,
|
|
"mean_token_accuracy": 0.17625806480646133,
|
|
"num_tokens": 8996503.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 5.806273937225342,
|
|
"epoch": 3.8823790501553486,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003902333148027495,
|
|
"loss": 5.5558,
|
|
"mean_token_accuracy": 0.17663292586803436,
|
|
"num_tokens": 9008370.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 5.737713384628296,
|
|
"epoch": 3.8868175765645807,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003899373130861605,
|
|
"loss": 5.5651,
|
|
"mean_token_accuracy": 0.17326079905033112,
|
|
"num_tokens": 9020077.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 5.8152988910675045,
|
|
"epoch": 3.891256102973813,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00038964104196436284,
|
|
"loss": 5.5894,
|
|
"mean_token_accuracy": 0.17162887006998062,
|
|
"num_tokens": 9030627.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 5.762547349929809,
|
|
"epoch": 3.895694629383045,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00038934450213179596,
|
|
"loss": 5.4845,
|
|
"mean_token_accuracy": 0.18070337772369385,
|
|
"num_tokens": 9041138.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 5.631207036972046,
|
|
"epoch": 3.900133155792277,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038904769428352873,
|
|
"loss": 5.4612,
|
|
"mean_token_accuracy": 0.18537994474172592,
|
|
"num_tokens": 9050830.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 5.788889026641845,
|
|
"epoch": 3.9045716822015093,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00038875061911525856,
|
|
"loss": 5.5402,
|
|
"mean_token_accuracy": 0.17427804619073867,
|
|
"num_tokens": 9061113.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 5.746660757064819,
|
|
"epoch": 3.9090102086107414,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003884532773233094,
|
|
"loss": 5.5819,
|
|
"mean_token_accuracy": 0.17695318460464476,
|
|
"num_tokens": 9070655.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 5.663952970504761,
|
|
"epoch": 3.9134487350199736,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00038815566960463015,
|
|
"loss": 5.3662,
|
|
"mean_token_accuracy": 0.18698422610759735,
|
|
"num_tokens": 9079019.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 5.727706336975098,
|
|
"epoch": 3.9178872614292057,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038785779665679275,
|
|
"loss": 5.5219,
|
|
"mean_token_accuracy": 0.17985262721776962,
|
|
"num_tokens": 9089545.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 5.709404706954956,
|
|
"epoch": 3.922325787838438,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003875596591779913,
|
|
"loss": 5.4711,
|
|
"mean_token_accuracy": 0.17852504402399064,
|
|
"num_tokens": 9099539.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 5.659719467163086,
|
|
"epoch": 3.92676431424767,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0003872612578670395,
|
|
"loss": 5.432,
|
|
"mean_token_accuracy": 0.18161263316869736,
|
|
"num_tokens": 9110721.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 5.731282758712768,
|
|
"epoch": 3.931202840656902,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00038696259342336966,
|
|
"loss": 5.4644,
|
|
"mean_token_accuracy": 0.17836183905601502,
|
|
"num_tokens": 9121014.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 5.750094223022461,
|
|
"epoch": 3.935641367066134,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038666366654703077,
|
|
"loss": 5.5449,
|
|
"mean_token_accuracy": 0.17551416903734207,
|
|
"num_tokens": 9131085.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 5.752908182144165,
|
|
"epoch": 3.940079893475366,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00038636447793868715,
|
|
"loss": 5.4715,
|
|
"mean_token_accuracy": 0.18193041980266572,
|
|
"num_tokens": 9140844.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 5.7174254894256595,
|
|
"epoch": 3.944518419884598,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00038606502829961645,
|
|
"loss": 5.5679,
|
|
"mean_token_accuracy": 0.17696069329977035,
|
|
"num_tokens": 9151185.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 5.754332447052002,
|
|
"epoch": 3.9489569462938303,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003857653183317081,
|
|
"loss": 5.4548,
|
|
"mean_token_accuracy": 0.1789930745959282,
|
|
"num_tokens": 9162031.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 5.769329786300659,
|
|
"epoch": 3.9533954727030625,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0003854653487374617,
|
|
"loss": 5.5161,
|
|
"mean_token_accuracy": 0.17834289520978927,
|
|
"num_tokens": 9172896.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 5.715093040466309,
|
|
"epoch": 3.9578339991122946,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003851651202199856,
|
|
"loss": 5.4465,
|
|
"mean_token_accuracy": 0.1802556499838829,
|
|
"num_tokens": 9182364.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 5.703181409835816,
|
|
"epoch": 3.9622725255215268,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003848646334829949,
|
|
"loss": 5.4415,
|
|
"mean_token_accuracy": 0.1801273450255394,
|
|
"num_tokens": 9192740.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 5.674679946899414,
|
|
"epoch": 3.966711051930759,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038456388923081006,
|
|
"loss": 5.5164,
|
|
"mean_token_accuracy": 0.18230873495340347,
|
|
"num_tokens": 9202638.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 5.741348552703857,
|
|
"epoch": 3.971149578339991,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00038426288816835485,
|
|
"loss": 5.4495,
|
|
"mean_token_accuracy": 0.17755311280488967,
|
|
"num_tokens": 9212282.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 5.726871204376221,
|
|
"epoch": 3.975588104749223,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003839616310011554,
|
|
"loss": 5.5127,
|
|
"mean_token_accuracy": 0.17680146396160126,
|
|
"num_tokens": 9222352.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 5.784638833999634,
|
|
"epoch": 3.9800266311584553,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0003836601184353379,
|
|
"loss": 5.5881,
|
|
"mean_token_accuracy": 0.17251629903912544,
|
|
"num_tokens": 9233801.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 5.749805593490601,
|
|
"epoch": 3.9844651575676875,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00038335835117762706,
|
|
"loss": 5.5791,
|
|
"mean_token_accuracy": 0.17449699193239213,
|
|
"num_tokens": 9244265.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 5.760185623168946,
|
|
"epoch": 3.9889036839769196,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00038305632993534483,
|
|
"loss": 5.4196,
|
|
"mean_token_accuracy": 0.18088131695985793,
|
|
"num_tokens": 9254071.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 5.707600259780884,
|
|
"epoch": 3.993342210386152,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00038275405541640835,
|
|
"loss": 5.4296,
|
|
"mean_token_accuracy": 0.19716665893793106,
|
|
"num_tokens": 9264144.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"epoch": 3.993342210386152,
|
|
"eval_entropy": 5.5763132815689485,
|
|
"eval_loss": 5.997529983520508,
|
|
"eval_mean_token_accuracy": 0.16018386616984343,
|
|
"eval_num_tokens": 9264144.0,
|
|
"eval_runtime": 2.7056,
|
|
"eval_samples_per_second": 1244.433,
|
|
"eval_steps_per_second": 155.6,
|
|
"step": 4500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 11260,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.4050163503872e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|