1035 lines
27 KiB
JSON
1035 lines
27 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.0053732818931146765,
|
|
"eval_steps": 500,
|
|
"global_step": 500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.691944599151611,
|
|
"epoch": 5.3732818931146765e-05,
|
|
"grad_norm": 15.4375,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.867,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 12868.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691931915283202,
|
|
"epoch": 0.00010746563786229353,
|
|
"grad_norm": 13.1875,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7713,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 23808.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.69122085571289,
|
|
"epoch": 0.0001611984567934403,
|
|
"grad_norm": 10.5625,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.4885,
|
|
"mean_token_accuracy": 0.017395494051743298,
|
|
"num_tokens": 34239.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.684881401062011,
|
|
"epoch": 0.00021493127572458706,
|
|
"grad_norm": 6.15625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1795,
|
|
"mean_token_accuracy": 0.03431609831750393,
|
|
"num_tokens": 45311.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.651975917816163,
|
|
"epoch": 0.00026866409465573383,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.8328,
|
|
"mean_token_accuracy": 0.039574161358177665,
|
|
"num_tokens": 56105.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.609530162811279,
|
|
"epoch": 0.0003223969135868806,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.7804,
|
|
"mean_token_accuracy": 0.03973569292575121,
|
|
"num_tokens": 68382.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.593698596954345,
|
|
"epoch": 0.00037612973251802736,
|
|
"grad_norm": 2.921875,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.619,
|
|
"mean_token_accuracy": 0.04424203187227249,
|
|
"num_tokens": 81209.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.5916898727417,
|
|
"epoch": 0.0004298625514491741,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.5786,
|
|
"mean_token_accuracy": 0.03825619481503963,
|
|
"num_tokens": 94148.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.594180679321289,
|
|
"epoch": 0.0004835953703803209,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.526,
|
|
"mean_token_accuracy": 0.048027387261390685,
|
|
"num_tokens": 106398.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.578767490386962,
|
|
"epoch": 0.0005373281893114677,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5403,
|
|
"mean_token_accuracy": 0.04592233560979366,
|
|
"num_tokens": 118963.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.581397247314452,
|
|
"epoch": 0.0005910610082426144,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.4431,
|
|
"mean_token_accuracy": 0.045610013604164126,
|
|
"num_tokens": 129302.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.57803840637207,
|
|
"epoch": 0.0006447938271737612,
|
|
"grad_norm": 2.515625,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.3236,
|
|
"mean_token_accuracy": 0.05025259889662266,
|
|
"num_tokens": 139595.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.486345100402833,
|
|
"epoch": 0.000698526646104908,
|
|
"grad_norm": 2.5,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.2169,
|
|
"mean_token_accuracy": 0.060793956741690636,
|
|
"num_tokens": 150436.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.35349416732788,
|
|
"epoch": 0.0007522594650360547,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.1404,
|
|
"mean_token_accuracy": 0.06265294775366784,
|
|
"num_tokens": 161692.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.434385204315186,
|
|
"epoch": 0.0008059922839672015,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.0866,
|
|
"mean_token_accuracy": 0.06112063825130463,
|
|
"num_tokens": 173914.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.437462615966798,
|
|
"epoch": 0.0008597251028983482,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 8.9348,
|
|
"mean_token_accuracy": 0.06636513993144036,
|
|
"num_tokens": 185793.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.385666561126708,
|
|
"epoch": 0.000913457921829495,
|
|
"grad_norm": 2.484375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.9272,
|
|
"mean_token_accuracy": 0.06668606549501419,
|
|
"num_tokens": 199762.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.262327003479005,
|
|
"epoch": 0.0009671907407606418,
|
|
"grad_norm": 2.734375,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.7491,
|
|
"mean_token_accuracy": 0.06684565916657448,
|
|
"num_tokens": 211760.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.279810237884522,
|
|
"epoch": 0.0010209235596917885,
|
|
"grad_norm": 3.0,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.6214,
|
|
"mean_token_accuracy": 0.07119264826178551,
|
|
"num_tokens": 222654.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.154211807250977,
|
|
"epoch": 0.0010746563786229353,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.605,
|
|
"mean_token_accuracy": 0.07087584175169467,
|
|
"num_tokens": 234906.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.154182243347169,
|
|
"epoch": 0.001128389197554082,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.4204,
|
|
"mean_token_accuracy": 0.08174400329589844,
|
|
"num_tokens": 246419.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 9.984860038757324,
|
|
"epoch": 0.0011821220164852288,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.2827,
|
|
"mean_token_accuracy": 0.08357185944914818,
|
|
"num_tokens": 257878.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.92540111541748,
|
|
"epoch": 0.0012358548354163756,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.1352,
|
|
"mean_token_accuracy": 0.08523289784789086,
|
|
"num_tokens": 269180.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.790580940246581,
|
|
"epoch": 0.0012895876543475224,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.1268,
|
|
"mean_token_accuracy": 0.0837685689330101,
|
|
"num_tokens": 281482.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.689721870422364,
|
|
"epoch": 0.0013433204732786691,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.9125,
|
|
"mean_token_accuracy": 0.08588041439652443,
|
|
"num_tokens": 292289.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.55999813079834,
|
|
"epoch": 0.001397053292209816,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.8259,
|
|
"mean_token_accuracy": 0.08231885209679604,
|
|
"num_tokens": 303274.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.327935886383056,
|
|
"epoch": 0.0014507861111409627,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.6719,
|
|
"mean_token_accuracy": 0.0838103786110878,
|
|
"num_tokens": 314933.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.111929130554199,
|
|
"epoch": 0.0015045189300721094,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.5777,
|
|
"mean_token_accuracy": 0.08480807095766067,
|
|
"num_tokens": 327450.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 8.934065532684325,
|
|
"epoch": 0.0015582517490032562,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.4816,
|
|
"mean_token_accuracy": 0.08673194646835328,
|
|
"num_tokens": 339409.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.693235874176025,
|
|
"epoch": 0.001611984567934403,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.4587,
|
|
"mean_token_accuracy": 0.08729644715785981,
|
|
"num_tokens": 352374.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.44670124053955,
|
|
"epoch": 0.0016657173868655497,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.3175,
|
|
"mean_token_accuracy": 0.09196643233299255,
|
|
"num_tokens": 363653.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.291356182098388,
|
|
"epoch": 0.0017194502057966965,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.3101,
|
|
"mean_token_accuracy": 0.08862848281860351,
|
|
"num_tokens": 374982.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.183576679229736,
|
|
"epoch": 0.0017731830247278433,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.2019,
|
|
"mean_token_accuracy": 0.08939464986324311,
|
|
"num_tokens": 387794.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.042083930969238,
|
|
"epoch": 0.00182691584365899,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.2703,
|
|
"mean_token_accuracy": 0.08938254192471504,
|
|
"num_tokens": 399993.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 7.948488187789917,
|
|
"epoch": 0.0018806486625901368,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.1802,
|
|
"mean_token_accuracy": 0.10024765953421592,
|
|
"num_tokens": 410864.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.877219009399414,
|
|
"epoch": 0.0019343814815212836,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.2057,
|
|
"mean_token_accuracy": 0.09488844051957131,
|
|
"num_tokens": 422376.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.852542734146118,
|
|
"epoch": 0.0019881143004524303,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.1815,
|
|
"mean_token_accuracy": 0.10110960602760315,
|
|
"num_tokens": 434301.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.8157186031341555,
|
|
"epoch": 0.002041847119383577,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.1695,
|
|
"mean_token_accuracy": 0.09449249878525734,
|
|
"num_tokens": 446159.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.741145420074463,
|
|
"epoch": 0.002095579938314724,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.1823,
|
|
"mean_token_accuracy": 0.0965780720114708,
|
|
"num_tokens": 458376.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.750446844100952,
|
|
"epoch": 0.0021493127572458706,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.1192,
|
|
"mean_token_accuracy": 0.10175004899501801,
|
|
"num_tokens": 469082.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.683127355575562,
|
|
"epoch": 0.0022030455761770174,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.0011,
|
|
"mean_token_accuracy": 0.10132882818579673,
|
|
"num_tokens": 480149.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.6684812068939205,
|
|
"epoch": 0.002256778395108164,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.1455,
|
|
"mean_token_accuracy": 0.0962664932012558,
|
|
"num_tokens": 493074.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.615740251541138,
|
|
"epoch": 0.002310511214039311,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.0009,
|
|
"mean_token_accuracy": 0.10513110086321831,
|
|
"num_tokens": 504647.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.548989009857178,
|
|
"epoch": 0.0023642440329704577,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.0833,
|
|
"mean_token_accuracy": 0.09757705479860306,
|
|
"num_tokens": 516304.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.63504056930542,
|
|
"epoch": 0.0024179768519016044,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.0133,
|
|
"mean_token_accuracy": 0.1059924952685833,
|
|
"num_tokens": 526467.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.553870820999146,
|
|
"epoch": 0.002471709670832751,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.059,
|
|
"mean_token_accuracy": 0.10098145231604576,
|
|
"num_tokens": 539109.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.517747688293457,
|
|
"epoch": 0.002525442489763898,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 6.9522,
|
|
"mean_token_accuracy": 0.09978492632508278,
|
|
"num_tokens": 550142.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.522121000289917,
|
|
"epoch": 0.0025791753086950447,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.0176,
|
|
"mean_token_accuracy": 0.10614465549588203,
|
|
"num_tokens": 561639.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.508337593078613,
|
|
"epoch": 0.0026329081276261915,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000122,
|
|
"loss": 6.9533,
|
|
"mean_token_accuracy": 0.10177289620041848,
|
|
"num_tokens": 573849.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.48092360496521,
|
|
"epoch": 0.0026866409465573383,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 6.9289,
|
|
"mean_token_accuracy": 0.10615592449903488,
|
|
"num_tokens": 584572.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.391205263137818,
|
|
"epoch": 0.002740373765488485,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000127,
|
|
"loss": 6.9508,
|
|
"mean_token_accuracy": 0.11110179796814919,
|
|
"num_tokens": 595314.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.482128667831421,
|
|
"epoch": 0.002794106584419632,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.0476,
|
|
"mean_token_accuracy": 0.10385493785142899,
|
|
"num_tokens": 605689.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.351570653915405,
|
|
"epoch": 0.0028478394033507786,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.8358,
|
|
"mean_token_accuracy": 0.11294776201248169,
|
|
"num_tokens": 617057.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.4075196266174315,
|
|
"epoch": 0.0029015722222819253,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.9324,
|
|
"mean_token_accuracy": 0.10447231009602546,
|
|
"num_tokens": 628111.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.342596530914307,
|
|
"epoch": 0.002955305041213072,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 6.8379,
|
|
"mean_token_accuracy": 0.1141952745616436,
|
|
"num_tokens": 639254.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.35143084526062,
|
|
"epoch": 0.003009037860144219,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.9304,
|
|
"mean_token_accuracy": 0.1006052739918232,
|
|
"num_tokens": 651096.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.301223182678223,
|
|
"epoch": 0.0030627706790753656,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9238,
|
|
"mean_token_accuracy": 0.10944507122039795,
|
|
"num_tokens": 663132.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.29386534690857,
|
|
"epoch": 0.0031165034980065124,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.7711,
|
|
"mean_token_accuracy": 0.11792795732617378,
|
|
"num_tokens": 674160.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.214638614654541,
|
|
"epoch": 0.003170236316937659,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.8337,
|
|
"mean_token_accuracy": 0.10255614519119263,
|
|
"num_tokens": 685284.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.2078382015228275,
|
|
"epoch": 0.003223969135868806,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.7865,
|
|
"mean_token_accuracy": 0.10231738537549973,
|
|
"num_tokens": 696789.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.242858171463013,
|
|
"epoch": 0.0032777019547999527,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.8906,
|
|
"mean_token_accuracy": 0.1063354529440403,
|
|
"num_tokens": 708083.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.285495710372925,
|
|
"epoch": 0.0033314347737310995,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.8254,
|
|
"mean_token_accuracy": 0.11012862473726273,
|
|
"num_tokens": 720232.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.072454166412354,
|
|
"epoch": 0.0033851675926622462,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.7098,
|
|
"mean_token_accuracy": 0.11381540670990944,
|
|
"num_tokens": 731264.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.268528461456299,
|
|
"epoch": 0.003438900411593393,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.6929,
|
|
"mean_token_accuracy": 0.11482961028814316,
|
|
"num_tokens": 742158.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.142989206314087,
|
|
"epoch": 0.0034926332305245398,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.776,
|
|
"mean_token_accuracy": 0.11389129087328911,
|
|
"num_tokens": 753330.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.2236439228057865,
|
|
"epoch": 0.0035463660494556865,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.7643,
|
|
"mean_token_accuracy": 0.11012546345591545,
|
|
"num_tokens": 765052.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.140369892120361,
|
|
"epoch": 0.0036000988683868333,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.7135,
|
|
"mean_token_accuracy": 0.11338407099246979,
|
|
"num_tokens": 775120.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.167498207092285,
|
|
"epoch": 0.00365383168731798,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.8179,
|
|
"mean_token_accuracy": 0.10822930335998535,
|
|
"num_tokens": 786442.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.1545287609100345,
|
|
"epoch": 0.003707564506249127,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.7217,
|
|
"mean_token_accuracy": 0.11315969750285149,
|
|
"num_tokens": 796526.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.073437261581421,
|
|
"epoch": 0.0037612973251802736,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.7366,
|
|
"mean_token_accuracy": 0.11096625924110412,
|
|
"num_tokens": 808296.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.14297833442688,
|
|
"epoch": 0.0038150301441114204,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.8753,
|
|
"mean_token_accuracy": 0.10760819539427757,
|
|
"num_tokens": 820142.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.075785732269287,
|
|
"epoch": 0.003868762963042567,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.6351,
|
|
"mean_token_accuracy": 0.1149467647075653,
|
|
"num_tokens": 830656.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.124733304977417,
|
|
"epoch": 0.003922495781973714,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.8206,
|
|
"mean_token_accuracy": 0.11161701381206512,
|
|
"num_tokens": 841948.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.07345609664917,
|
|
"epoch": 0.003976228600904861,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.7821,
|
|
"mean_token_accuracy": 0.11786900460720062,
|
|
"num_tokens": 854207.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.170615530014038,
|
|
"epoch": 0.004029961419836007,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.8525,
|
|
"mean_token_accuracy": 0.12062755227088928,
|
|
"num_tokens": 866747.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.042162704467773,
|
|
"epoch": 0.004083694238767154,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.7051,
|
|
"mean_token_accuracy": 0.11747116073966027,
|
|
"num_tokens": 877961.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.085628366470337,
|
|
"epoch": 0.004137427057698301,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.7507,
|
|
"mean_token_accuracy": 0.10921004936099052,
|
|
"num_tokens": 888869.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.034130811691284,
|
|
"epoch": 0.004191159876629448,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.7366,
|
|
"mean_token_accuracy": 0.11664599329233169,
|
|
"num_tokens": 899408.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.982698535919189,
|
|
"epoch": 0.0042448926955605945,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.6711,
|
|
"mean_token_accuracy": 0.1158648207783699,
|
|
"num_tokens": 910457.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.062652063369751,
|
|
"epoch": 0.004298625514491741,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.7841,
|
|
"mean_token_accuracy": 0.11403620392084121,
|
|
"num_tokens": 922772.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.986512184143066,
|
|
"epoch": 0.004352358333422888,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.6783,
|
|
"mean_token_accuracy": 0.11563151925802231,
|
|
"num_tokens": 933820.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.02769365310669,
|
|
"epoch": 0.004406091152354035,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.6902,
|
|
"mean_token_accuracy": 0.12013663202524186,
|
|
"num_tokens": 945044.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.937658596038818,
|
|
"epoch": 0.0044598239712851815,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.6422,
|
|
"mean_token_accuracy": 0.11966706290841103,
|
|
"num_tokens": 956140.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.904023456573486,
|
|
"epoch": 0.004513556790216328,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.5249,
|
|
"mean_token_accuracy": 0.11787364035844802,
|
|
"num_tokens": 967386.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.979593801498413,
|
|
"epoch": 0.004567289609147475,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.7215,
|
|
"mean_token_accuracy": 0.11483194008469581,
|
|
"num_tokens": 980381.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.9800636768341064,
|
|
"epoch": 0.004621022428078622,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.6044,
|
|
"mean_token_accuracy": 0.11717872545123101,
|
|
"num_tokens": 992279.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.966359424591064,
|
|
"epoch": 0.004674755247009769,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.755,
|
|
"mean_token_accuracy": 0.11651304587721825,
|
|
"num_tokens": 1005046.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.898645305633545,
|
|
"epoch": 0.004728488065940915,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.7279,
|
|
"mean_token_accuracy": 0.11459456831216812,
|
|
"num_tokens": 1018636.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.968531131744385,
|
|
"epoch": 0.004782220884872062,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.6579,
|
|
"mean_token_accuracy": 0.11964940950274468,
|
|
"num_tokens": 1030293.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.921095752716065,
|
|
"epoch": 0.004835953703803209,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.6835,
|
|
"mean_token_accuracy": 0.11620648130774498,
|
|
"num_tokens": 1041853.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.953577375411987,
|
|
"epoch": 0.004889686522734356,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.7021,
|
|
"mean_token_accuracy": 0.12079041078686714,
|
|
"num_tokens": 1052959.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.906730604171753,
|
|
"epoch": 0.004943419341665502,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.5797,
|
|
"mean_token_accuracy": 0.1155982829630375,
|
|
"num_tokens": 1064200.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.912591934204102,
|
|
"epoch": 0.004997152160596649,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.7112,
|
|
"mean_token_accuracy": 0.11692484319210053,
|
|
"num_tokens": 1075643.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.884953784942627,
|
|
"epoch": 0.005050884979527796,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.6495,
|
|
"mean_token_accuracy": 0.11548735648393631,
|
|
"num_tokens": 1086641.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.768892002105713,
|
|
"epoch": 0.005104617798458943,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6014,
|
|
"mean_token_accuracy": 0.12133783251047134,
|
|
"num_tokens": 1098862.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.882342195510864,
|
|
"epoch": 0.0051583506173900895,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.5766,
|
|
"mean_token_accuracy": 0.12126556858420372,
|
|
"num_tokens": 1110243.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.835430574417114,
|
|
"epoch": 0.005212083436321236,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.5728,
|
|
"mean_token_accuracy": 0.11558629795908928,
|
|
"num_tokens": 1122573.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.88542947769165,
|
|
"epoch": 0.005265816255252383,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.6432,
|
|
"mean_token_accuracy": 0.12129139229655266,
|
|
"num_tokens": 1133979.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.83654465675354,
|
|
"epoch": 0.00531954907418353,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.646,
|
|
"mean_token_accuracy": 0.11814743131399155,
|
|
"num_tokens": 1145732.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.817767333984375,
|
|
"epoch": 0.0053732818931146765,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.5869,
|
|
"mean_token_accuracy": 0.12479080557823181,
|
|
"num_tokens": 1156209.0,
|
|
"step": 500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1826806910976000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|