2035 lines
54 KiB
JSON
2035 lines
54 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.010746563786229353,
|
|
"eval_steps": 500,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.691944599151611,
|
|
"epoch": 5.3732818931146765e-05,
|
|
"grad_norm": 15.4375,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.867,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 12868.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691931915283202,
|
|
"epoch": 0.00010746563786229353,
|
|
"grad_norm": 13.1875,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7713,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 23808.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.69122085571289,
|
|
"epoch": 0.0001611984567934403,
|
|
"grad_norm": 10.5625,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.4885,
|
|
"mean_token_accuracy": 0.017395494051743298,
|
|
"num_tokens": 34239.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.684881401062011,
|
|
"epoch": 0.00021493127572458706,
|
|
"grad_norm": 6.15625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1795,
|
|
"mean_token_accuracy": 0.03431609831750393,
|
|
"num_tokens": 45311.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.651975917816163,
|
|
"epoch": 0.00026866409465573383,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.8328,
|
|
"mean_token_accuracy": 0.039574161358177665,
|
|
"num_tokens": 56105.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.609530162811279,
|
|
"epoch": 0.0003223969135868806,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.7804,
|
|
"mean_token_accuracy": 0.03973569292575121,
|
|
"num_tokens": 68382.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.593698596954345,
|
|
"epoch": 0.00037612973251802736,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.619,
|
|
"mean_token_accuracy": 0.04424203187227249,
|
|
"num_tokens": 81209.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.5916898727417,
|
|
"epoch": 0.0004298625514491741,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.5786,
|
|
"mean_token_accuracy": 0.03825619481503963,
|
|
"num_tokens": 94148.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.594180679321289,
|
|
"epoch": 0.0004835953703803209,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.526,
|
|
"mean_token_accuracy": 0.048027387261390685,
|
|
"num_tokens": 106398.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.578767490386962,
|
|
"epoch": 0.0005373281893114677,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5403,
|
|
"mean_token_accuracy": 0.04592233560979366,
|
|
"num_tokens": 118963.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.581397247314452,
|
|
"epoch": 0.0005910610082426144,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.4431,
|
|
"mean_token_accuracy": 0.045610013604164126,
|
|
"num_tokens": 129302.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.57803840637207,
|
|
"epoch": 0.0006447938271737612,
|
|
"grad_norm": 2.515625,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.3236,
|
|
"mean_token_accuracy": 0.05025259889662266,
|
|
"num_tokens": 139595.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.486345100402833,
|
|
"epoch": 0.000698526646104908,
|
|
"grad_norm": 2.5,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.2169,
|
|
"mean_token_accuracy": 0.060793956741690636,
|
|
"num_tokens": 150436.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.35349416732788,
|
|
"epoch": 0.0007522594650360547,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.1404,
|
|
"mean_token_accuracy": 0.06265294775366784,
|
|
"num_tokens": 161692.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.434385204315186,
|
|
"epoch": 0.0008059922839672015,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.0866,
|
|
"mean_token_accuracy": 0.06112063825130463,
|
|
"num_tokens": 173914.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.437462615966798,
|
|
"epoch": 0.0008597251028983482,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 8.9348,
|
|
"mean_token_accuracy": 0.06636513993144036,
|
|
"num_tokens": 185793.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.385666561126708,
|
|
"epoch": 0.000913457921829495,
|
|
"grad_norm": 2.484375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.9272,
|
|
"mean_token_accuracy": 0.06668606549501419,
|
|
"num_tokens": 199762.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.262327003479005,
|
|
"epoch": 0.0009671907407606418,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.7491,
|
|
"mean_token_accuracy": 0.06684565916657448,
|
|
"num_tokens": 211760.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.279810237884522,
|
|
"epoch": 0.0010209235596917885,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.6214,
|
|
"mean_token_accuracy": 0.07119264826178551,
|
|
"num_tokens": 222654.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.154211807250977,
|
|
"epoch": 0.0010746563786229353,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.605,
|
|
"mean_token_accuracy": 0.07087584175169467,
|
|
"num_tokens": 234906.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.154182243347169,
|
|
"epoch": 0.001128389197554082,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.4204,
|
|
"mean_token_accuracy": 0.08174400329589844,
|
|
"num_tokens": 246419.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 9.984860038757324,
|
|
"epoch": 0.0011821220164852288,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.2827,
|
|
"mean_token_accuracy": 0.08357185944914818,
|
|
"num_tokens": 257878.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.92540111541748,
|
|
"epoch": 0.0012358548354163756,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.1352,
|
|
"mean_token_accuracy": 0.08523289784789086,
|
|
"num_tokens": 269180.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.790580940246581,
|
|
"epoch": 0.0012895876543475224,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.1268,
|
|
"mean_token_accuracy": 0.0837685689330101,
|
|
"num_tokens": 281482.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.689721870422364,
|
|
"epoch": 0.0013433204732786691,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.9125,
|
|
"mean_token_accuracy": 0.08588041439652443,
|
|
"num_tokens": 292289.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.55999813079834,
|
|
"epoch": 0.001397053292209816,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.8259,
|
|
"mean_token_accuracy": 0.08231885209679604,
|
|
"num_tokens": 303274.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.327935886383056,
|
|
"epoch": 0.0014507861111409627,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.6719,
|
|
"mean_token_accuracy": 0.0838103786110878,
|
|
"num_tokens": 314933.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.111929130554199,
|
|
"epoch": 0.0015045189300721094,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.5777,
|
|
"mean_token_accuracy": 0.08480807095766067,
|
|
"num_tokens": 327450.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 8.934065532684325,
|
|
"epoch": 0.0015582517490032562,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.4816,
|
|
"mean_token_accuracy": 0.08673194646835328,
|
|
"num_tokens": 339409.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.693235874176025,
|
|
"epoch": 0.001611984567934403,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.4587,
|
|
"mean_token_accuracy": 0.08729644715785981,
|
|
"num_tokens": 352374.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.44670124053955,
|
|
"epoch": 0.0016657173868655497,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.3175,
|
|
"mean_token_accuracy": 0.09196643233299255,
|
|
"num_tokens": 363653.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.291356182098388,
|
|
"epoch": 0.0017194502057966965,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.3101,
|
|
"mean_token_accuracy": 0.08862848281860351,
|
|
"num_tokens": 374982.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.183576679229736,
|
|
"epoch": 0.0017731830247278433,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.2019,
|
|
"mean_token_accuracy": 0.08939464986324311,
|
|
"num_tokens": 387794.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.042083930969238,
|
|
"epoch": 0.00182691584365899,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.2703,
|
|
"mean_token_accuracy": 0.08938254192471504,
|
|
"num_tokens": 399993.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 7.948488187789917,
|
|
"epoch": 0.0018806486625901368,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.1802,
|
|
"mean_token_accuracy": 0.10024765953421592,
|
|
"num_tokens": 410864.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.877219009399414,
|
|
"epoch": 0.0019343814815212836,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.2057,
|
|
"mean_token_accuracy": 0.09488844051957131,
|
|
"num_tokens": 422376.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.852542734146118,
|
|
"epoch": 0.0019881143004524303,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.1815,
|
|
"mean_token_accuracy": 0.10110960602760315,
|
|
"num_tokens": 434301.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.8157186031341555,
|
|
"epoch": 0.002041847119383577,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.1695,
|
|
"mean_token_accuracy": 0.09449249878525734,
|
|
"num_tokens": 446159.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.741145420074463,
|
|
"epoch": 0.002095579938314724,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.1823,
|
|
"mean_token_accuracy": 0.0965780720114708,
|
|
"num_tokens": 458376.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.750446844100952,
|
|
"epoch": 0.0021493127572458706,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.1192,
|
|
"mean_token_accuracy": 0.10175004899501801,
|
|
"num_tokens": 469082.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.683127355575562,
|
|
"epoch": 0.0022030455761770174,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.0011,
|
|
"mean_token_accuracy": 0.10132882818579673,
|
|
"num_tokens": 480149.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.6684812068939205,
|
|
"epoch": 0.002256778395108164,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.1455,
|
|
"mean_token_accuracy": 0.0962664932012558,
|
|
"num_tokens": 493074.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.615740251541138,
|
|
"epoch": 0.002310511214039311,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.0009,
|
|
"mean_token_accuracy": 0.10513110086321831,
|
|
"num_tokens": 504647.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.548989009857178,
|
|
"epoch": 0.0023642440329704577,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.0833,
|
|
"mean_token_accuracy": 0.09757705479860306,
|
|
"num_tokens": 516304.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.63504056930542,
|
|
"epoch": 0.0024179768519016044,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.0133,
|
|
"mean_token_accuracy": 0.1059924952685833,
|
|
"num_tokens": 526467.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.553870820999146,
|
|
"epoch": 0.002471709670832751,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.059,
|
|
"mean_token_accuracy": 0.10098145231604576,
|
|
"num_tokens": 539109.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.517747688293457,
|
|
"epoch": 0.002525442489763898,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 6.9522,
|
|
"mean_token_accuracy": 0.09978492632508278,
|
|
"num_tokens": 550142.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.522121000289917,
|
|
"epoch": 0.0025791753086950447,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.0176,
|
|
"mean_token_accuracy": 0.10614465549588203,
|
|
"num_tokens": 561639.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.508337593078613,
|
|
"epoch": 0.0026329081276261915,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000122,
|
|
"loss": 6.9533,
|
|
"mean_token_accuracy": 0.10177289620041848,
|
|
"num_tokens": 573849.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.48092360496521,
|
|
"epoch": 0.0026866409465573383,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 6.9289,
|
|
"mean_token_accuracy": 0.10615592449903488,
|
|
"num_tokens": 584572.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.391205263137818,
|
|
"epoch": 0.002740373765488485,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000127,
|
|
"loss": 6.9508,
|
|
"mean_token_accuracy": 0.11110179796814919,
|
|
"num_tokens": 595314.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.482128667831421,
|
|
"epoch": 0.002794106584419632,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.0476,
|
|
"mean_token_accuracy": 0.10385493785142899,
|
|
"num_tokens": 605689.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.351570653915405,
|
|
"epoch": 0.0028478394033507786,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.8358,
|
|
"mean_token_accuracy": 0.11294776201248169,
|
|
"num_tokens": 617057.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.4075196266174315,
|
|
"epoch": 0.0029015722222819253,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.9324,
|
|
"mean_token_accuracy": 0.10447231009602546,
|
|
"num_tokens": 628111.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.342596530914307,
|
|
"epoch": 0.002955305041213072,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 6.8379,
|
|
"mean_token_accuracy": 0.1141952745616436,
|
|
"num_tokens": 639254.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.35143084526062,
|
|
"epoch": 0.003009037860144219,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.9304,
|
|
"mean_token_accuracy": 0.1006052739918232,
|
|
"num_tokens": 651096.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.301223182678223,
|
|
"epoch": 0.0030627706790753656,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9238,
|
|
"mean_token_accuracy": 0.10944507122039795,
|
|
"num_tokens": 663132.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.29386534690857,
|
|
"epoch": 0.0031165034980065124,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.7711,
|
|
"mean_token_accuracy": 0.11792795732617378,
|
|
"num_tokens": 674160.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.214638614654541,
|
|
"epoch": 0.003170236316937659,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.8337,
|
|
"mean_token_accuracy": 0.10255614519119263,
|
|
"num_tokens": 685284.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.2078382015228275,
|
|
"epoch": 0.003223969135868806,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.7865,
|
|
"mean_token_accuracy": 0.10231738537549973,
|
|
"num_tokens": 696789.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.242858171463013,
|
|
"epoch": 0.0032777019547999527,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.8906,
|
|
"mean_token_accuracy": 0.1063354529440403,
|
|
"num_tokens": 708083.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.285495710372925,
|
|
"epoch": 0.0033314347737310995,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.8254,
|
|
"mean_token_accuracy": 0.11012862473726273,
|
|
"num_tokens": 720232.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.072454166412354,
|
|
"epoch": 0.0033851675926622462,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.7098,
|
|
"mean_token_accuracy": 0.11381540670990944,
|
|
"num_tokens": 731264.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.268528461456299,
|
|
"epoch": 0.003438900411593393,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.6929,
|
|
"mean_token_accuracy": 0.11482961028814316,
|
|
"num_tokens": 742158.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.142989206314087,
|
|
"epoch": 0.0034926332305245398,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.776,
|
|
"mean_token_accuracy": 0.11389129087328911,
|
|
"num_tokens": 753330.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.2236439228057865,
|
|
"epoch": 0.0035463660494556865,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.7643,
|
|
"mean_token_accuracy": 0.11012546345591545,
|
|
"num_tokens": 765052.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.140369892120361,
|
|
"epoch": 0.0036000988683868333,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.7135,
|
|
"mean_token_accuracy": 0.11338407099246979,
|
|
"num_tokens": 775120.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.167498207092285,
|
|
"epoch": 0.00365383168731798,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.8179,
|
|
"mean_token_accuracy": 0.10822930335998535,
|
|
"num_tokens": 786442.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.1545287609100345,
|
|
"epoch": 0.003707564506249127,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.7217,
|
|
"mean_token_accuracy": 0.11315969750285149,
|
|
"num_tokens": 796526.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.073437261581421,
|
|
"epoch": 0.0037612973251802736,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.7366,
|
|
"mean_token_accuracy": 0.11096625924110412,
|
|
"num_tokens": 808296.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.14297833442688,
|
|
"epoch": 0.0038150301441114204,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.8753,
|
|
"mean_token_accuracy": 0.10760819539427757,
|
|
"num_tokens": 820142.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.075785732269287,
|
|
"epoch": 0.003868762963042567,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.6351,
|
|
"mean_token_accuracy": 0.1149467647075653,
|
|
"num_tokens": 830656.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.124733304977417,
|
|
"epoch": 0.003922495781973714,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.8206,
|
|
"mean_token_accuracy": 0.11161701381206512,
|
|
"num_tokens": 841948.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.07345609664917,
|
|
"epoch": 0.003976228600904861,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.7821,
|
|
"mean_token_accuracy": 0.11786900460720062,
|
|
"num_tokens": 854207.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.170615530014038,
|
|
"epoch": 0.004029961419836007,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.8525,
|
|
"mean_token_accuracy": 0.12062755227088928,
|
|
"num_tokens": 866747.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.042162704467773,
|
|
"epoch": 0.004083694238767154,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.7051,
|
|
"mean_token_accuracy": 0.11747116073966027,
|
|
"num_tokens": 877961.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.085628366470337,
|
|
"epoch": 0.004137427057698301,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.7507,
|
|
"mean_token_accuracy": 0.10921004936099052,
|
|
"num_tokens": 888869.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.034130811691284,
|
|
"epoch": 0.004191159876629448,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.7366,
|
|
"mean_token_accuracy": 0.11664599329233169,
|
|
"num_tokens": 899408.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.982698535919189,
|
|
"epoch": 0.0042448926955605945,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.6711,
|
|
"mean_token_accuracy": 0.1158648207783699,
|
|
"num_tokens": 910457.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.062652063369751,
|
|
"epoch": 0.004298625514491741,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.7841,
|
|
"mean_token_accuracy": 0.11403620392084121,
|
|
"num_tokens": 922772.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.986512184143066,
|
|
"epoch": 0.004352358333422888,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.6783,
|
|
"mean_token_accuracy": 0.11563151925802231,
|
|
"num_tokens": 933820.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.02769365310669,
|
|
"epoch": 0.004406091152354035,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.6902,
|
|
"mean_token_accuracy": 0.12013663202524186,
|
|
"num_tokens": 945044.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.937658596038818,
|
|
"epoch": 0.0044598239712851815,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.6422,
|
|
"mean_token_accuracy": 0.11966706290841103,
|
|
"num_tokens": 956140.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.904023456573486,
|
|
"epoch": 0.004513556790216328,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.5249,
|
|
"mean_token_accuracy": 0.11787364035844802,
|
|
"num_tokens": 967386.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.979593801498413,
|
|
"epoch": 0.004567289609147475,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.7215,
|
|
"mean_token_accuracy": 0.11483194008469581,
|
|
"num_tokens": 980381.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.9800636768341064,
|
|
"epoch": 0.004621022428078622,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.6044,
|
|
"mean_token_accuracy": 0.11717872545123101,
|
|
"num_tokens": 992279.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.966359424591064,
|
|
"epoch": 0.004674755247009769,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.755,
|
|
"mean_token_accuracy": 0.11651304587721825,
|
|
"num_tokens": 1005046.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.898645305633545,
|
|
"epoch": 0.004728488065940915,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.7279,
|
|
"mean_token_accuracy": 0.11459456831216812,
|
|
"num_tokens": 1018636.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.968531131744385,
|
|
"epoch": 0.004782220884872062,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.6579,
|
|
"mean_token_accuracy": 0.11964940950274468,
|
|
"num_tokens": 1030293.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.921095752716065,
|
|
"epoch": 0.004835953703803209,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.6835,
|
|
"mean_token_accuracy": 0.11620648130774498,
|
|
"num_tokens": 1041853.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.953577375411987,
|
|
"epoch": 0.004889686522734356,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.7021,
|
|
"mean_token_accuracy": 0.12079041078686714,
|
|
"num_tokens": 1052959.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.906730604171753,
|
|
"epoch": 0.004943419341665502,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.5797,
|
|
"mean_token_accuracy": 0.1155982829630375,
|
|
"num_tokens": 1064200.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.912591934204102,
|
|
"epoch": 0.004997152160596649,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.7112,
|
|
"mean_token_accuracy": 0.11692484319210053,
|
|
"num_tokens": 1075643.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.884953784942627,
|
|
"epoch": 0.005050884979527796,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.6495,
|
|
"mean_token_accuracy": 0.11548735648393631,
|
|
"num_tokens": 1086641.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.768892002105713,
|
|
"epoch": 0.005104617798458943,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6014,
|
|
"mean_token_accuracy": 0.12133783251047134,
|
|
"num_tokens": 1098862.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.882342195510864,
|
|
"epoch": 0.0051583506173900895,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.5766,
|
|
"mean_token_accuracy": 0.12126556858420372,
|
|
"num_tokens": 1110243.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.835430574417114,
|
|
"epoch": 0.005212083436321236,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.5728,
|
|
"mean_token_accuracy": 0.11558629795908928,
|
|
"num_tokens": 1122573.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.88542947769165,
|
|
"epoch": 0.005265816255252383,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.6432,
|
|
"mean_token_accuracy": 0.12129139229655266,
|
|
"num_tokens": 1133979.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.83654465675354,
|
|
"epoch": 0.00531954907418353,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.646,
|
|
"mean_token_accuracy": 0.11814743131399155,
|
|
"num_tokens": 1145732.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.817767333984375,
|
|
"epoch": 0.0053732818931146765,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.5869,
|
|
"mean_token_accuracy": 0.12479080557823181,
|
|
"num_tokens": 1156209.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.783105134963989,
|
|
"epoch": 0.005427014712045823,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.6071,
|
|
"mean_token_accuracy": 0.1158917598426342,
|
|
"num_tokens": 1168746.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.877445030212402,
|
|
"epoch": 0.00548074753097697,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.5415,
|
|
"mean_token_accuracy": 0.11388759389519691,
|
|
"num_tokens": 1179953.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.709407901763916,
|
|
"epoch": 0.005534480349908117,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.617,
|
|
"mean_token_accuracy": 0.12177695706486702,
|
|
"num_tokens": 1190376.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.774854850769043,
|
|
"epoch": 0.005588213168839264,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.5396,
|
|
"mean_token_accuracy": 0.11766837164759636,
|
|
"num_tokens": 1203342.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.747042798995972,
|
|
"epoch": 0.00564194598777041,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.4918,
|
|
"mean_token_accuracy": 0.12500829100608826,
|
|
"num_tokens": 1214788.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.805994987487793,
|
|
"epoch": 0.005695678806701557,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.5081,
|
|
"mean_token_accuracy": 0.1282237909734249,
|
|
"num_tokens": 1225573.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.804644536972046,
|
|
"epoch": 0.005749411625632704,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.5936,
|
|
"mean_token_accuracy": 0.11719024851918221,
|
|
"num_tokens": 1236657.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.639275121688843,
|
|
"epoch": 0.005803144444563851,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.4455,
|
|
"mean_token_accuracy": 0.11846009120345116,
|
|
"num_tokens": 1248011.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.6572366714477536,
|
|
"epoch": 0.0058568772634949974,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.3932,
|
|
"mean_token_accuracy": 0.13050461709499359,
|
|
"num_tokens": 1258617.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.6567902088165285,
|
|
"epoch": 0.005910610082426144,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.4417,
|
|
"mean_token_accuracy": 0.12405583187937737,
|
|
"num_tokens": 1269719.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.666623926162719,
|
|
"epoch": 0.005964342901357291,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.4288,
|
|
"mean_token_accuracy": 0.13184549435973167,
|
|
"num_tokens": 1282345.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.707080411911011,
|
|
"epoch": 0.006018075720288438,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.5392,
|
|
"mean_token_accuracy": 0.12187965363264083,
|
|
"num_tokens": 1294488.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.804266262054443,
|
|
"epoch": 0.0060718085392195845,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.5314,
|
|
"mean_token_accuracy": 0.1263057641685009,
|
|
"num_tokens": 1305263.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.658360242843628,
|
|
"epoch": 0.006125541358150731,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.6029,
|
|
"mean_token_accuracy": 0.1247408226132393,
|
|
"num_tokens": 1316859.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.709363222122192,
|
|
"epoch": 0.006179274177081878,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.5673,
|
|
"mean_token_accuracy": 0.12827861905097962,
|
|
"num_tokens": 1327435.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.7831621170043945,
|
|
"epoch": 0.006233006996013025,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.5586,
|
|
"mean_token_accuracy": 0.12109960541129113,
|
|
"num_tokens": 1338911.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.719960689544678,
|
|
"epoch": 0.0062867398149441716,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.5855,
|
|
"mean_token_accuracy": 0.11691064387559891,
|
|
"num_tokens": 1350469.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.635077476501465,
|
|
"epoch": 0.006340472633875318,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.4145,
|
|
"mean_token_accuracy": 0.1246449775993824,
|
|
"num_tokens": 1361563.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.695048713684082,
|
|
"epoch": 0.006394205452806465,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.4567,
|
|
"mean_token_accuracy": 0.13043742775917053,
|
|
"num_tokens": 1371164.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.710860776901245,
|
|
"epoch": 0.006447938271737612,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.6258,
|
|
"mean_token_accuracy": 0.12364646792411804,
|
|
"num_tokens": 1383812.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.557053899765014,
|
|
"epoch": 0.006501671090668759,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.4506,
|
|
"mean_token_accuracy": 0.1240703359246254,
|
|
"num_tokens": 1395949.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.697274923324585,
|
|
"epoch": 0.006555403909599905,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.5407,
|
|
"mean_token_accuracy": 0.12706615030765533,
|
|
"num_tokens": 1407555.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.680358648300171,
|
|
"epoch": 0.006609136728531052,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.479,
|
|
"mean_token_accuracy": 0.12326432690024376,
|
|
"num_tokens": 1419366.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.542993068695068,
|
|
"epoch": 0.006662869547462199,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.4081,
|
|
"mean_token_accuracy": 0.1296963684260845,
|
|
"num_tokens": 1431029.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.630553913116455,
|
|
"epoch": 0.006716602366393346,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.4554,
|
|
"mean_token_accuracy": 0.12751922383904457,
|
|
"num_tokens": 1443373.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.652616214752197,
|
|
"epoch": 0.0067703351853244925,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.4876,
|
|
"mean_token_accuracy": 0.11779244169592858,
|
|
"num_tokens": 1455825.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.5543968200683596,
|
|
"epoch": 0.006824068004255639,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.4883,
|
|
"mean_token_accuracy": 0.12101165652275085,
|
|
"num_tokens": 1468565.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.7368861675262455,
|
|
"epoch": 0.006877800823186786,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.532,
|
|
"mean_token_accuracy": 0.11934061422944069,
|
|
"num_tokens": 1480349.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.685069799423218,
|
|
"epoch": 0.006931533642117933,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.5136,
|
|
"mean_token_accuracy": 0.12378246709704399,
|
|
"num_tokens": 1492546.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.648138904571534,
|
|
"epoch": 0.0069852664610490795,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.4985,
|
|
"mean_token_accuracy": 0.12411848902702331,
|
|
"num_tokens": 1505470.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.578639078140259,
|
|
"epoch": 0.007038999279980226,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.4716,
|
|
"mean_token_accuracy": 0.1275963857769966,
|
|
"num_tokens": 1517651.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.597443866729736,
|
|
"epoch": 0.007092732098911373,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.4648,
|
|
"mean_token_accuracy": 0.1221590779721737,
|
|
"num_tokens": 1528344.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.656521511077881,
|
|
"epoch": 0.00714646491784252,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.5515,
|
|
"mean_token_accuracy": 0.12132448479533195,
|
|
"num_tokens": 1540901.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.798276329040528,
|
|
"epoch": 0.007200197736773667,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.7276,
|
|
"mean_token_accuracy": 0.11917936131358146,
|
|
"num_tokens": 1553948.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.652810382843017,
|
|
"epoch": 0.007253930555704813,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.4356,
|
|
"mean_token_accuracy": 0.1323891557753086,
|
|
"num_tokens": 1564939.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.4081744194030765,
|
|
"epoch": 0.00730766337463596,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.2896,
|
|
"mean_token_accuracy": 0.13150809779763223,
|
|
"num_tokens": 1575701.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.666033411026001,
|
|
"epoch": 0.007361396193567107,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.505,
|
|
"mean_token_accuracy": 0.12376334965229034,
|
|
"num_tokens": 1588302.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.663384532928466,
|
|
"epoch": 0.007415129012498254,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.5337,
|
|
"mean_token_accuracy": 0.12307745441794396,
|
|
"num_tokens": 1600687.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.546121740341187,
|
|
"epoch": 0.0074688618314294,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.3835,
|
|
"mean_token_accuracy": 0.12949468046426774,
|
|
"num_tokens": 1612911.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.483590793609619,
|
|
"epoch": 0.007522594650360547,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.3987,
|
|
"mean_token_accuracy": 0.1250015176832676,
|
|
"num_tokens": 1625407.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.515925741195678,
|
|
"epoch": 0.007576327469291694,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.4381,
|
|
"mean_token_accuracy": 0.1255468212068081,
|
|
"num_tokens": 1636438.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.521837043762207,
|
|
"epoch": 0.007630060288222841,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.3278,
|
|
"mean_token_accuracy": 0.13161946684122086,
|
|
"num_tokens": 1646852.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.5727705478668215,
|
|
"epoch": 0.0076837931071539875,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.4295,
|
|
"mean_token_accuracy": 0.122813381254673,
|
|
"num_tokens": 1657497.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.496736717224121,
|
|
"epoch": 0.007737525926085134,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.3579,
|
|
"mean_token_accuracy": 0.133344866335392,
|
|
"num_tokens": 1668576.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.37104172706604,
|
|
"epoch": 0.007791258745016281,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.2756,
|
|
"mean_token_accuracy": 0.13716673478484154,
|
|
"num_tokens": 1678897.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.4941541194915775,
|
|
"epoch": 0.007844991563947428,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.4019,
|
|
"mean_token_accuracy": 0.12680666893720627,
|
|
"num_tokens": 1690334.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.580505418777466,
|
|
"epoch": 0.007898724382878575,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.3362,
|
|
"mean_token_accuracy": 0.13649081885814668,
|
|
"num_tokens": 1701173.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.443411922454834,
|
|
"epoch": 0.007952457201809721,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.378,
|
|
"mean_token_accuracy": 0.13125211074948312,
|
|
"num_tokens": 1713081.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.535996913909912,
|
|
"epoch": 0.008006190020740869,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.4182,
|
|
"mean_token_accuracy": 0.12619447186589242,
|
|
"num_tokens": 1725061.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.4850883960723875,
|
|
"epoch": 0.008059922839672015,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.396,
|
|
"mean_token_accuracy": 0.12616196647286415,
|
|
"num_tokens": 1735374.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.572152376174927,
|
|
"epoch": 0.008113655658603162,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.4018,
|
|
"mean_token_accuracy": 0.13052576184272766,
|
|
"num_tokens": 1747100.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.337621402740479,
|
|
"epoch": 0.008167388477534308,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.2472,
|
|
"mean_token_accuracy": 0.13288816586136817,
|
|
"num_tokens": 1758577.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.557423830032349,
|
|
"epoch": 0.008221121296465456,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.5367,
|
|
"mean_token_accuracy": 0.12673259526491165,
|
|
"num_tokens": 1771127.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.495845079421997,
|
|
"epoch": 0.008274854115396602,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.3796,
|
|
"mean_token_accuracy": 0.1309738650918007,
|
|
"num_tokens": 1782061.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.395338773727417,
|
|
"epoch": 0.00832858693432775,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.3638,
|
|
"mean_token_accuracy": 0.13038457557559013,
|
|
"num_tokens": 1794632.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.519541597366333,
|
|
"epoch": 0.008382319753258895,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.13315627053380014,
|
|
"num_tokens": 1805414.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.398904037475586,
|
|
"epoch": 0.008436052572190043,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.2914,
|
|
"mean_token_accuracy": 0.13453604951500892,
|
|
"num_tokens": 1816781.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.494039821624756,
|
|
"epoch": 0.008489785391121189,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.4496,
|
|
"mean_token_accuracy": 0.12688224837183953,
|
|
"num_tokens": 1828791.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.386651563644409,
|
|
"epoch": 0.008543518210052337,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.3269,
|
|
"mean_token_accuracy": 0.13748010098934174,
|
|
"num_tokens": 1840092.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.476310205459595,
|
|
"epoch": 0.008597251028983482,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.334,
|
|
"mean_token_accuracy": 0.13396526053547858,
|
|
"num_tokens": 1851569.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.375878381729126,
|
|
"epoch": 0.00865098384791463,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.2508,
|
|
"mean_token_accuracy": 0.13404305949807166,
|
|
"num_tokens": 1861939.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.49393253326416,
|
|
"epoch": 0.008704716666845776,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.4467,
|
|
"mean_token_accuracy": 0.12742400392889977,
|
|
"num_tokens": 1873545.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.360756969451904,
|
|
"epoch": 0.008758449485776924,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.4065,
|
|
"mean_token_accuracy": 0.12780992686748505,
|
|
"num_tokens": 1885870.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.523135995864868,
|
|
"epoch": 0.00881218230470807,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.472,
|
|
"mean_token_accuracy": 0.12656911313533784,
|
|
"num_tokens": 1898118.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.408415365219116,
|
|
"epoch": 0.008865915123639217,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.2098,
|
|
"mean_token_accuracy": 0.13449918180704118,
|
|
"num_tokens": 1907638.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.37138261795044,
|
|
"epoch": 0.008919647942570363,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.12769241705536843,
|
|
"num_tokens": 1919814.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.42969536781311,
|
|
"epoch": 0.00897338076150151,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.305,
|
|
"mean_token_accuracy": 0.12873108088970184,
|
|
"num_tokens": 1930090.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.503070831298828,
|
|
"epoch": 0.009027113580432657,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.4575,
|
|
"mean_token_accuracy": 0.12877310812473297,
|
|
"num_tokens": 1941916.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.373751020431518,
|
|
"epoch": 0.009080846399363804,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.3835,
|
|
"mean_token_accuracy": 0.13241996690630914,
|
|
"num_tokens": 1953356.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.532479238510132,
|
|
"epoch": 0.00913457921829495,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.4746,
|
|
"mean_token_accuracy": 0.1252823568880558,
|
|
"num_tokens": 1964043.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.503678846359253,
|
|
"epoch": 0.009188312037226098,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.4102,
|
|
"mean_token_accuracy": 0.13039419800043106,
|
|
"num_tokens": 1975971.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.328308725357056,
|
|
"epoch": 0.009242044856157244,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.4012,
|
|
"mean_token_accuracy": 0.13699360191822052,
|
|
"num_tokens": 1987882.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.5440106868743895,
|
|
"epoch": 0.009295777675088391,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.4144,
|
|
"mean_token_accuracy": 0.13187188804149627,
|
|
"num_tokens": 1999586.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.467750215530396,
|
|
"epoch": 0.009349510494019537,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.4583,
|
|
"mean_token_accuracy": 0.13001283928751944,
|
|
"num_tokens": 2011867.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.408541107177735,
|
|
"epoch": 0.009403243312950685,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.3552,
|
|
"mean_token_accuracy": 0.13619493544101716,
|
|
"num_tokens": 2023372.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.344149351119995,
|
|
"epoch": 0.00945697613188183,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.3217,
|
|
"mean_token_accuracy": 0.1275565542280674,
|
|
"num_tokens": 2035896.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.362127685546875,
|
|
"epoch": 0.009510708950812978,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.2448,
|
|
"mean_token_accuracy": 0.13719155937433242,
|
|
"num_tokens": 2046912.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.278013896942139,
|
|
"epoch": 0.009564441769744124,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.2975,
|
|
"mean_token_accuracy": 0.13730109632015228,
|
|
"num_tokens": 2058322.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.478695487976074,
|
|
"epoch": 0.009618174588675272,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.3322,
|
|
"mean_token_accuracy": 0.13603856638073922,
|
|
"num_tokens": 2069755.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.3329634189605715,
|
|
"epoch": 0.009671907407606418,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.347,
|
|
"mean_token_accuracy": 0.131291563808918,
|
|
"num_tokens": 2080453.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.4724616527557375,
|
|
"epoch": 0.009725640226537565,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.4294,
|
|
"mean_token_accuracy": 0.13204899728298186,
|
|
"num_tokens": 2090847.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.4222029685974125,
|
|
"epoch": 0.009779373045468711,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.4368,
|
|
"mean_token_accuracy": 0.137455066293478,
|
|
"num_tokens": 2104254.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.344487428665161,
|
|
"epoch": 0.009833105864399859,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.3289,
|
|
"mean_token_accuracy": 0.1320524349808693,
|
|
"num_tokens": 2115392.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.50238618850708,
|
|
"epoch": 0.009886838683331005,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.5063,
|
|
"mean_token_accuracy": 0.12493504136800766,
|
|
"num_tokens": 2128388.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.358483028411865,
|
|
"epoch": 0.009940571502262152,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.2882,
|
|
"mean_token_accuracy": 0.13589850142598153,
|
|
"num_tokens": 2139023.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.373326253890991,
|
|
"epoch": 0.009994304321193298,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.2663,
|
|
"mean_token_accuracy": 0.13531995043158532,
|
|
"num_tokens": 2150693.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.279564762115479,
|
|
"epoch": 0.010048037140124446,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.2776,
|
|
"mean_token_accuracy": 0.13068829327821732,
|
|
"num_tokens": 2163192.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.234259986877442,
|
|
"epoch": 0.010101769959055592,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.1662,
|
|
"mean_token_accuracy": 0.14027160853147508,
|
|
"num_tokens": 2173700.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.339089107513428,
|
|
"epoch": 0.01015550277798674,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.3379,
|
|
"mean_token_accuracy": 0.1347230739891529,
|
|
"num_tokens": 2185500.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.227807855606079,
|
|
"epoch": 0.010209235596917885,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.2689,
|
|
"mean_token_accuracy": 0.1386742152273655,
|
|
"num_tokens": 2197363.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.333368492126465,
|
|
"epoch": 0.010262968415849033,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.3467,
|
|
"mean_token_accuracy": 0.13571017980575562,
|
|
"num_tokens": 2209173.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.408475399017334,
|
|
"epoch": 0.010316701234780179,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.3941,
|
|
"mean_token_accuracy": 0.1270724914968014,
|
|
"num_tokens": 2220469.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.429714393615723,
|
|
"epoch": 0.010370434053711327,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.389,
|
|
"mean_token_accuracy": 0.13281712904572487,
|
|
"num_tokens": 2232426.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.21214656829834,
|
|
"epoch": 0.010424166872642473,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.3173,
|
|
"mean_token_accuracy": 0.13897231221199036,
|
|
"num_tokens": 2243763.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.33380913734436,
|
|
"epoch": 0.01047789969157362,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.2468,
|
|
"mean_token_accuracy": 0.1297723114490509,
|
|
"num_tokens": 2255987.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.272552013397217,
|
|
"epoch": 0.010531632510504766,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.1886,
|
|
"mean_token_accuracy": 0.13993587493896484,
|
|
"num_tokens": 2266701.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.254857301712036,
|
|
"epoch": 0.010585365329435914,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.2448,
|
|
"mean_token_accuracy": 0.13452961146831513,
|
|
"num_tokens": 2278162.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.207320690155029,
|
|
"epoch": 0.01063909814836706,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.2815,
|
|
"mean_token_accuracy": 0.13594236746430396,
|
|
"num_tokens": 2289478.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.288606119155884,
|
|
"epoch": 0.010692830967298207,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.3368,
|
|
"mean_token_accuracy": 0.13813528120517732,
|
|
"num_tokens": 2301283.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.375607204437256,
|
|
"epoch": 0.010746563786229353,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.2796,
|
|
"mean_token_accuracy": 0.13963441848754882,
|
|
"num_tokens": 2312620.0,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3673145401344000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|