2035 lines
54 KiB
JSON
2035 lines
54 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 0.058349865795308674,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 1000,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 10.69196834564209,
|
||
|
|
"epoch": 0.00029174932897654333,
|
||
|
|
"grad_norm": 13.0625,
|
||
|
|
"learning_rate": 2e-06,
|
||
|
|
"loss": 10.8036,
|
||
|
|
"mean_token_accuracy": 0.0,
|
||
|
|
"num_tokens": 9376.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.691983699798584,
|
||
|
|
"epoch": 0.0005834986579530867,
|
||
|
|
"grad_norm": 13.0625,
|
||
|
|
"learning_rate": 4.5e-06,
|
||
|
|
"loss": 10.7354,
|
||
|
|
"mean_token_accuracy": 0.00011641443707048893,
|
||
|
|
"num_tokens": 18416.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.690966510772705,
|
||
|
|
"epoch": 0.00087524798692963,
|
||
|
|
"grad_norm": 10.0625,
|
||
|
|
"learning_rate": 7e-06,
|
||
|
|
"loss": 10.5172,
|
||
|
|
"mean_token_accuracy": 0.029424548242241146,
|
||
|
|
"num_tokens": 27778.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.678794956207275,
|
||
|
|
"epoch": 0.0011669973159061733,
|
||
|
|
"grad_norm": 5.90625,
|
||
|
|
"learning_rate": 9.5e-06,
|
||
|
|
"loss": 10.2454,
|
||
|
|
"mean_token_accuracy": 0.04061399847269058,
|
||
|
|
"num_tokens": 37698.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.63073034286499,
|
||
|
|
"epoch": 0.0014587466448827168,
|
||
|
|
"grad_norm": 4.1875,
|
||
|
|
"learning_rate": 1.2e-05,
|
||
|
|
"loss": 9.9716,
|
||
|
|
"mean_token_accuracy": 0.04182791076600552,
|
||
|
|
"num_tokens": 47412.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.602538585662842,
|
||
|
|
"epoch": 0.00175049597385926,
|
||
|
|
"grad_norm": 3.21875,
|
||
|
|
"learning_rate": 1.4500000000000002e-05,
|
||
|
|
"loss": 9.7862,
|
||
|
|
"mean_token_accuracy": 0.04080851711332798,
|
||
|
|
"num_tokens": 56226.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.595691585540772,
|
||
|
|
"epoch": 0.0020422453028358036,
|
||
|
|
"grad_norm": 2.859375,
|
||
|
|
"learning_rate": 1.7000000000000003e-05,
|
||
|
|
"loss": 9.6992,
|
||
|
|
"mean_token_accuracy": 0.04258432537317276,
|
||
|
|
"num_tokens": 65953.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.587265396118164,
|
||
|
|
"epoch": 0.0023339946318123466,
|
||
|
|
"grad_norm": 2.703125,
|
||
|
|
"learning_rate": 1.95e-05,
|
||
|
|
"loss": 9.6666,
|
||
|
|
"mean_token_accuracy": 0.040068139880895616,
|
||
|
|
"num_tokens": 74939.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.5896146774292,
|
||
|
|
"epoch": 0.00262574396078889,
|
||
|
|
"grad_norm": 2.5625,
|
||
|
|
"learning_rate": 2.2e-05,
|
||
|
|
"loss": 9.6425,
|
||
|
|
"mean_token_accuracy": 0.04199751690030098,
|
||
|
|
"num_tokens": 83855.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.573621463775634,
|
||
|
|
"epoch": 0.0029174932897654336,
|
||
|
|
"grad_norm": 2.359375,
|
||
|
|
"learning_rate": 2.4500000000000003e-05,
|
||
|
|
"loss": 9.5754,
|
||
|
|
"mean_token_accuracy": 0.045654605329036715,
|
||
|
|
"num_tokens": 93561.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.557998752593994,
|
||
|
|
"epoch": 0.003209242618741977,
|
||
|
|
"grad_norm": 2.1875,
|
||
|
|
"learning_rate": 2.7e-05,
|
||
|
|
"loss": 9.479,
|
||
|
|
"mean_token_accuracy": 0.05661129578948021,
|
||
|
|
"num_tokens": 103395.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.49096736907959,
|
||
|
|
"epoch": 0.00350099194771852,
|
||
|
|
"grad_norm": 2.40625,
|
||
|
|
"learning_rate": 2.95e-05,
|
||
|
|
"loss": 9.4209,
|
||
|
|
"mean_token_accuracy": 0.05532712675631046,
|
||
|
|
"num_tokens": 112462.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.353149223327637,
|
||
|
|
"epoch": 0.0037927412766950636,
|
||
|
|
"grad_norm": 2.34375,
|
||
|
|
"learning_rate": 3.2e-05,
|
||
|
|
"loss": 9.3195,
|
||
|
|
"mean_token_accuracy": 0.05394121035933495,
|
||
|
|
"num_tokens": 121553.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.451189041137695,
|
||
|
|
"epoch": 0.004084490605671607,
|
||
|
|
"grad_norm": 2.234375,
|
||
|
|
"learning_rate": 3.4500000000000005e-05,
|
||
|
|
"loss": 9.2945,
|
||
|
|
"mean_token_accuracy": 0.05459350645542145,
|
||
|
|
"num_tokens": 131138.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.415141296386718,
|
||
|
|
"epoch": 0.00437623993464815,
|
||
|
|
"grad_norm": 2.140625,
|
||
|
|
"learning_rate": 3.7e-05,
|
||
|
|
"loss": 9.2235,
|
||
|
|
"mean_token_accuracy": 0.05688905864953995,
|
||
|
|
"num_tokens": 140171.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.439569473266602,
|
||
|
|
"epoch": 0.004667989263624693,
|
||
|
|
"grad_norm": 2.046875,
|
||
|
|
"learning_rate": 3.95e-05,
|
||
|
|
"loss": 9.0989,
|
||
|
|
"mean_token_accuracy": 0.055916853994131085,
|
||
|
|
"num_tokens": 149483.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.392880725860596,
|
||
|
|
"epoch": 0.004959738592601237,
|
||
|
|
"grad_norm": 1.8984375,
|
||
|
|
"learning_rate": 4.2000000000000004e-05,
|
||
|
|
"loss": 9.0805,
|
||
|
|
"mean_token_accuracy": 0.05239327773451805,
|
||
|
|
"num_tokens": 159190.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.381812000274659,
|
||
|
|
"epoch": 0.00525148792157778,
|
||
|
|
"grad_norm": 1.84375,
|
||
|
|
"learning_rate": 4.45e-05,
|
||
|
|
"loss": 8.9431,
|
||
|
|
"mean_token_accuracy": 0.05531255267560482,
|
||
|
|
"num_tokens": 169601.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.296150207519531,
|
||
|
|
"epoch": 0.005543237250554324,
|
||
|
|
"grad_norm": 1.9765625,
|
||
|
|
"learning_rate": 4.7000000000000004e-05,
|
||
|
|
"loss": 8.8622,
|
||
|
|
"mean_token_accuracy": 0.057431581988930704,
|
||
|
|
"num_tokens": 179268.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.249444198608398,
|
||
|
|
"epoch": 0.005834986579530867,
|
||
|
|
"grad_norm": 2.875,
|
||
|
|
"learning_rate": 4.9500000000000004e-05,
|
||
|
|
"loss": 8.7591,
|
||
|
|
"mean_token_accuracy": 0.05835646912455559,
|
||
|
|
"num_tokens": 188699.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.191282558441163,
|
||
|
|
"epoch": 0.00612673590850741,
|
||
|
|
"grad_norm": 1.8359375,
|
||
|
|
"learning_rate": 5.2e-05,
|
||
|
|
"loss": 8.6842,
|
||
|
|
"mean_token_accuracy": 0.05705415904521942,
|
||
|
|
"num_tokens": 199939.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.147027969360352,
|
||
|
|
"epoch": 0.006418485237483954,
|
||
|
|
"grad_norm": 2.0,
|
||
|
|
"learning_rate": 5.45e-05,
|
||
|
|
"loss": 8.5501,
|
||
|
|
"mean_token_accuracy": 0.06250228881835937,
|
||
|
|
"num_tokens": 209419.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.024614429473877,
|
||
|
|
"epoch": 0.006710234566460497,
|
||
|
|
"grad_norm": 1.9375,
|
||
|
|
"learning_rate": 5.7e-05,
|
||
|
|
"loss": 8.4704,
|
||
|
|
"mean_token_accuracy": 0.06286126635968685,
|
||
|
|
"num_tokens": 218642.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.988630104064942,
|
||
|
|
"epoch": 0.00700198389543704,
|
||
|
|
"grad_norm": 1.640625,
|
||
|
|
"learning_rate": 5.9499999999999996e-05,
|
||
|
|
"loss": 8.3393,
|
||
|
|
"mean_token_accuracy": 0.061313451081514356,
|
||
|
|
"num_tokens": 228358.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.84273166656494,
|
||
|
|
"epoch": 0.007293733224413584,
|
||
|
|
"grad_norm": 1.875,
|
||
|
|
"learning_rate": 6.2e-05,
|
||
|
|
"loss": 8.1163,
|
||
|
|
"mean_token_accuracy": 0.0694800227880478,
|
||
|
|
"num_tokens": 237860.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.692254257202148,
|
||
|
|
"epoch": 0.007585482553390127,
|
||
|
|
"grad_norm": 1.5625,
|
||
|
|
"learning_rate": 6.450000000000001e-05,
|
||
|
|
"loss": 8.1599,
|
||
|
|
"mean_token_accuracy": 0.06262776851654053,
|
||
|
|
"num_tokens": 247547.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.467087554931641,
|
||
|
|
"epoch": 0.007877231882366671,
|
||
|
|
"grad_norm": 1.6015625,
|
||
|
|
"learning_rate": 6.7e-05,
|
||
|
|
"loss": 8.0195,
|
||
|
|
"mean_token_accuracy": 0.07063104063272477,
|
||
|
|
"num_tokens": 256405.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.383435821533203,
|
||
|
|
"epoch": 0.008168981211343214,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 6.950000000000001e-05,
|
||
|
|
"loss": 7.9616,
|
||
|
|
"mean_token_accuracy": 0.06774205490946769,
|
||
|
|
"num_tokens": 265249.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.17911729812622,
|
||
|
|
"epoch": 0.008460730540319757,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 7.2e-05,
|
||
|
|
"loss": 7.8784,
|
||
|
|
"mean_token_accuracy": 0.0681417278945446,
|
||
|
|
"num_tokens": 275681.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.988021278381348,
|
||
|
|
"epoch": 0.0087524798692963,
|
||
|
|
"grad_norm": 1.4453125,
|
||
|
|
"learning_rate": 7.45e-05,
|
||
|
|
"loss": 7.7636,
|
||
|
|
"mean_token_accuracy": 0.07039406709372997,
|
||
|
|
"num_tokens": 284957.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.73282070159912,
|
||
|
|
"epoch": 0.009044229198272843,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 7.7e-05,
|
||
|
|
"loss": 7.6563,
|
||
|
|
"mean_token_accuracy": 0.07246890291571617,
|
||
|
|
"num_tokens": 294010.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.682876682281494,
|
||
|
|
"epoch": 0.009335978527249386,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 7.950000000000001e-05,
|
||
|
|
"loss": 7.7148,
|
||
|
|
"mean_token_accuracy": 0.07290182597935199,
|
||
|
|
"num_tokens": 303264.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.486510944366454,
|
||
|
|
"epoch": 0.009627727856225931,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 8.2e-05,
|
||
|
|
"loss": 7.5966,
|
||
|
|
"mean_token_accuracy": 0.07415391989052296,
|
||
|
|
"num_tokens": 313450.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.362883186340332,
|
||
|
|
"epoch": 0.009919477185202474,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 8.450000000000001e-05,
|
||
|
|
"loss": 7.5375,
|
||
|
|
"mean_token_accuracy": 0.07450749576091767,
|
||
|
|
"num_tokens": 322764.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.276646995544434,
|
||
|
|
"epoch": 0.010211226514179017,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 8.7e-05,
|
||
|
|
"loss": 7.5492,
|
||
|
|
"mean_token_accuracy": 0.07559143453836441,
|
||
|
|
"num_tokens": 332228.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.189496421813965,
|
||
|
|
"epoch": 0.01050297584315556,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 8.95e-05,
|
||
|
|
"loss": 7.4578,
|
||
|
|
"mean_token_accuracy": 0.07792975381016731,
|
||
|
|
"num_tokens": 341589.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.08325457572937,
|
||
|
|
"epoch": 0.010794725172132104,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 9.2e-05,
|
||
|
|
"loss": 7.3998,
|
||
|
|
"mean_token_accuracy": 0.07972711473703384,
|
||
|
|
"num_tokens": 351166.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.023299407958984,
|
||
|
|
"epoch": 0.011086474501108648,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 9.45e-05,
|
||
|
|
"loss": 7.4712,
|
||
|
|
"mean_token_accuracy": 0.07630453184247017,
|
||
|
|
"num_tokens": 360962.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.986406993865967,
|
||
|
|
"epoch": 0.011378223830085191,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 9.7e-05,
|
||
|
|
"loss": 7.4208,
|
||
|
|
"mean_token_accuracy": 0.07656608372926713,
|
||
|
|
"num_tokens": 370859.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.958215236663818,
|
||
|
|
"epoch": 0.011669973159061734,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 9.95e-05,
|
||
|
|
"loss": 7.4388,
|
||
|
|
"mean_token_accuracy": 0.07721348851919174,
|
||
|
|
"num_tokens": 381017.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.953992605209351,
|
||
|
|
"epoch": 0.011961722488038277,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000102,
|
||
|
|
"loss": 7.4808,
|
||
|
|
"mean_token_accuracy": 0.07665727399289608,
|
||
|
|
"num_tokens": 390849.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.941216659545899,
|
||
|
|
"epoch": 0.01225347181701482,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00010449999999999999,
|
||
|
|
"loss": 7.4537,
|
||
|
|
"mean_token_accuracy": 0.07717064693570137,
|
||
|
|
"num_tokens": 401131.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.940151929855347,
|
||
|
|
"epoch": 0.012545221145991364,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000107,
|
||
|
|
"loss": 7.3567,
|
||
|
|
"mean_token_accuracy": 0.07789909988641738,
|
||
|
|
"num_tokens": 410171.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.845122528076172,
|
||
|
|
"epoch": 0.012836970474967908,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.0001095,
|
||
|
|
"loss": 7.4298,
|
||
|
|
"mean_token_accuracy": 0.07820538356900215,
|
||
|
|
"num_tokens": 419352.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.826071691513062,
|
||
|
|
"epoch": 0.013128719803944451,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.000112,
|
||
|
|
"loss": 7.2948,
|
||
|
|
"mean_token_accuracy": 0.08607594929635524,
|
||
|
|
"num_tokens": 428862.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.802604389190674,
|
||
|
|
"epoch": 0.013420469132920994,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0001145,
|
||
|
|
"loss": 7.2856,
|
||
|
|
"mean_token_accuracy": 0.07789736986160278,
|
||
|
|
"num_tokens": 438900.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.759540748596192,
|
||
|
|
"epoch": 0.013712218461897538,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00011700000000000001,
|
||
|
|
"loss": 7.2419,
|
||
|
|
"mean_token_accuracy": 0.08156893700361252,
|
||
|
|
"num_tokens": 447867.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.753300333023072,
|
||
|
|
"epoch": 0.01400396779087408,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.00011949999999999999,
|
||
|
|
"loss": 7.3329,
|
||
|
|
"mean_token_accuracy": 0.074883484095335,
|
||
|
|
"num_tokens": 457978.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.775896072387695,
|
||
|
|
"epoch": 0.014295717119850624,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000122,
|
||
|
|
"loss": 7.2889,
|
||
|
|
"mean_token_accuracy": 0.08151891827583313,
|
||
|
|
"num_tokens": 466846.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.732866048812866,
|
||
|
|
"epoch": 0.014587466448827168,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.0001245,
|
||
|
|
"loss": 7.2876,
|
||
|
|
"mean_token_accuracy": 0.07967406883835793,
|
||
|
|
"num_tokens": 475862.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.682526159286499,
|
||
|
|
"epoch": 0.014879215777803712,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.000127,
|
||
|
|
"loss": 7.3177,
|
||
|
|
"mean_token_accuracy": 0.0773643635213375,
|
||
|
|
"num_tokens": 486088.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.789633178710938,
|
||
|
|
"epoch": 0.015170965106780255,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0001295,
|
||
|
|
"loss": 7.19,
|
||
|
|
"mean_token_accuracy": 0.0791048213839531,
|
||
|
|
"num_tokens": 495515.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.739433479309082,
|
||
|
|
"epoch": 0.015462714435756798,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.000132,
|
||
|
|
"loss": 7.314,
|
||
|
|
"mean_token_accuracy": 0.07758257985115051,
|
||
|
|
"num_tokens": 505617.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.701812362670898,
|
||
|
|
"epoch": 0.015754463764733342,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00013450000000000002,
|
||
|
|
"loss": 7.2826,
|
||
|
|
"mean_token_accuracy": 0.07801382765173911,
|
||
|
|
"num_tokens": 515977.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.724566078186035,
|
||
|
|
"epoch": 0.016046213093709884,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00013700000000000002,
|
||
|
|
"loss": 7.3384,
|
||
|
|
"mean_token_accuracy": 0.08092856109142303,
|
||
|
|
"num_tokens": 526525.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.645784378051758,
|
||
|
|
"epoch": 0.01633796242268643,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0001395,
|
||
|
|
"loss": 7.2771,
|
||
|
|
"mean_token_accuracy": 0.08373014777898788,
|
||
|
|
"num_tokens": 536494.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.622757911682129,
|
||
|
|
"epoch": 0.01662971175166297,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.00014199999999999998,
|
||
|
|
"loss": 7.3146,
|
||
|
|
"mean_token_accuracy": 0.08114334717392921,
|
||
|
|
"num_tokens": 545326.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.662983512878418,
|
||
|
|
"epoch": 0.016921461080639515,
|
||
|
|
"grad_norm": 1.484375,
|
||
|
|
"learning_rate": 0.0001445,
|
||
|
|
"loss": 7.1416,
|
||
|
|
"mean_token_accuracy": 0.08460377976298332,
|
||
|
|
"num_tokens": 553678.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.63046498298645,
|
||
|
|
"epoch": 0.01721321040961606,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.000147,
|
||
|
|
"loss": 7.2891,
|
||
|
|
"mean_token_accuracy": 0.08224759995937347,
|
||
|
|
"num_tokens": 563860.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.621852588653565,
|
||
|
|
"epoch": 0.0175049597385926,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0001495,
|
||
|
|
"loss": 7.238,
|
||
|
|
"mean_token_accuracy": 0.08669779226183891,
|
||
|
|
"num_tokens": 572492.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.564120435714722,
|
||
|
|
"epoch": 0.017796709067569146,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000152,
|
||
|
|
"loss": 7.1166,
|
||
|
|
"mean_token_accuracy": 0.08243767246603965,
|
||
|
|
"num_tokens": 581840.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.6293127059936525,
|
||
|
|
"epoch": 0.018088458396545687,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00015450000000000001,
|
||
|
|
"loss": 7.2465,
|
||
|
|
"mean_token_accuracy": 0.0864152580499649,
|
||
|
|
"num_tokens": 591697.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.534941625595093,
|
||
|
|
"epoch": 0.01838020772552223,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000157,
|
||
|
|
"loss": 7.1059,
|
||
|
|
"mean_token_accuracy": 0.0846880093216896,
|
||
|
|
"num_tokens": 601153.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.607311391830445,
|
||
|
|
"epoch": 0.018671957054498773,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0001595,
|
||
|
|
"loss": 7.1949,
|
||
|
|
"mean_token_accuracy": 0.08106868788599968,
|
||
|
|
"num_tokens": 609516.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.579704999923706,
|
||
|
|
"epoch": 0.018963706383475318,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000162,
|
||
|
|
"loss": 7.2078,
|
||
|
|
"mean_token_accuracy": 0.07954892218112945,
|
||
|
|
"num_tokens": 618836.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.576669311523437,
|
||
|
|
"epoch": 0.019255455712451863,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00016450000000000001,
|
||
|
|
"loss": 7.2136,
|
||
|
|
"mean_token_accuracy": 0.08916370049118996,
|
||
|
|
"num_tokens": 628223.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.503057956695557,
|
||
|
|
"epoch": 0.019547205041428404,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00016700000000000002,
|
||
|
|
"loss": 7.1113,
|
||
|
|
"mean_token_accuracy": 0.08817728385329246,
|
||
|
|
"num_tokens": 637609.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.545721530914307,
|
||
|
|
"epoch": 0.01983895437040495,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00016950000000000003,
|
||
|
|
"loss": 7.1296,
|
||
|
|
"mean_token_accuracy": 0.08344640359282493,
|
||
|
|
"num_tokens": 646652.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.413992404937744,
|
||
|
|
"epoch": 0.02013070369938149,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.00017199999999999998,
|
||
|
|
"loss": 7.137,
|
||
|
|
"mean_token_accuracy": 0.08315069451928139,
|
||
|
|
"num_tokens": 656238.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.479533767700195,
|
||
|
|
"epoch": 0.020422453028358035,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.00017449999999999999,
|
||
|
|
"loss": 7.1428,
|
||
|
|
"mean_token_accuracy": 0.08378953337669373,
|
||
|
|
"num_tokens": 665148.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.503499221801758,
|
||
|
|
"epoch": 0.02071420235733458,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000177,
|
||
|
|
"loss": 7.049,
|
||
|
|
"mean_token_accuracy": 0.08563587218523025,
|
||
|
|
"num_tokens": 675192.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.388577222824097,
|
||
|
|
"epoch": 0.02100595168631112,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0001795,
|
||
|
|
"loss": 7.0679,
|
||
|
|
"mean_token_accuracy": 0.08425286635756493,
|
||
|
|
"num_tokens": 684813.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.496100616455078,
|
||
|
|
"epoch": 0.021297701015287666,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.000182,
|
||
|
|
"loss": 7.0952,
|
||
|
|
"mean_token_accuracy": 0.08246167674660683,
|
||
|
|
"num_tokens": 694545.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.4700541496276855,
|
||
|
|
"epoch": 0.021589450344264207,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.0001845,
|
||
|
|
"loss": 7.0857,
|
||
|
|
"mean_token_accuracy": 0.08829364702105522,
|
||
|
|
"num_tokens": 704312.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.475095510482788,
|
||
|
|
"epoch": 0.021881199673240752,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000187,
|
||
|
|
"loss": 7.1189,
|
||
|
|
"mean_token_accuracy": 0.08108639344573021,
|
||
|
|
"num_tokens": 713743.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.403366279602051,
|
||
|
|
"epoch": 0.022172949002217297,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0001895,
|
||
|
|
"loss": 7.0088,
|
||
|
|
"mean_token_accuracy": 0.08252720050513744,
|
||
|
|
"num_tokens": 722497.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3469452381134035,
|
||
|
|
"epoch": 0.022464698331193838,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.000192,
|
||
|
|
"loss": 6.9952,
|
||
|
|
"mean_token_accuracy": 0.08496845439076424,
|
||
|
|
"num_tokens": 731849.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.4720964431762695,
|
||
|
|
"epoch": 0.022756447660170383,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0001945,
|
||
|
|
"loss": 7.1709,
|
||
|
|
"mean_token_accuracy": 0.08666181415319443,
|
||
|
|
"num_tokens": 741345.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3531989574432375,
|
||
|
|
"epoch": 0.023048196989146924,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00019700000000000002,
|
||
|
|
"loss": 7.1245,
|
||
|
|
"mean_token_accuracy": 0.08187859356403351,
|
||
|
|
"num_tokens": 751363.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.323095083236694,
|
||
|
|
"epoch": 0.02333994631812347,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.00019950000000000002,
|
||
|
|
"loss": 6.9475,
|
||
|
|
"mean_token_accuracy": 0.08857285082340241,
|
||
|
|
"num_tokens": 761174.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.323359584808349,
|
||
|
|
"epoch": 0.02363169564710001,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000202,
|
||
|
|
"loss": 6.9364,
|
||
|
|
"mean_token_accuracy": 0.0823954962193966,
|
||
|
|
"num_tokens": 770773.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.241050577163696,
|
||
|
|
"epoch": 0.023923444976076555,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.00020449999999999998,
|
||
|
|
"loss": 6.964,
|
||
|
|
"mean_token_accuracy": 0.08706902638077736,
|
||
|
|
"num_tokens": 780462.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.354639291763306,
|
||
|
|
"epoch": 0.0242151943050531,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000207,
|
||
|
|
"loss": 6.9719,
|
||
|
|
"mean_token_accuracy": 0.08648092672228813,
|
||
|
|
"num_tokens": 789822.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.251240015029907,
|
||
|
|
"epoch": 0.02450694363402964,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0002095,
|
||
|
|
"loss": 6.9392,
|
||
|
|
"mean_token_accuracy": 0.08409521207213402,
|
||
|
|
"num_tokens": 799724.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.2920667171478275,
|
||
|
|
"epoch": 0.024798692963006186,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000212,
|
||
|
|
"loss": 7.0463,
|
||
|
|
"mean_token_accuracy": 0.08510638326406479,
|
||
|
|
"num_tokens": 809331.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.488130569458008,
|
||
|
|
"epoch": 0.025090442291982727,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0002145,
|
||
|
|
"loss": 7.057,
|
||
|
|
"mean_token_accuracy": 0.08337506577372551,
|
||
|
|
"num_tokens": 818665.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.296667957305909,
|
||
|
|
"epoch": 0.025382191620959272,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00021700000000000002,
|
||
|
|
"loss": 6.9754,
|
||
|
|
"mean_token_accuracy": 0.08416144661605358,
|
||
|
|
"num_tokens": 828580.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.240721750259399,
|
||
|
|
"epoch": 0.025673940949935817,
|
||
|
|
"grad_norm": 1.609375,
|
||
|
|
"learning_rate": 0.0002195,
|
||
|
|
"loss": 7.0171,
|
||
|
|
"mean_token_accuracy": 0.08526882231235504,
|
||
|
|
"num_tokens": 837661.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.22621784210205,
|
||
|
|
"epoch": 0.025965690278912358,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.000222,
|
||
|
|
"loss": 6.9839,
|
||
|
|
"mean_token_accuracy": 0.08228468671441078,
|
||
|
|
"num_tokens": 847069.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.250874137878418,
|
||
|
|
"epoch": 0.026257439607888903,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0002245,
|
||
|
|
"loss": 6.9794,
|
||
|
|
"mean_token_accuracy": 0.08245958164334297,
|
||
|
|
"num_tokens": 856743.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.338770008087158,
|
||
|
|
"epoch": 0.026549188936865444,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00022700000000000002,
|
||
|
|
"loss": 7.0198,
|
||
|
|
"mean_token_accuracy": 0.08468568697571754,
|
||
|
|
"num_tokens": 865502.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.33205771446228,
|
||
|
|
"epoch": 0.02684093826584199,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00022950000000000002,
|
||
|
|
"loss": 6.9651,
|
||
|
|
"mean_token_accuracy": 0.0839608520269394,
|
||
|
|
"num_tokens": 874178.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.088795518875122,
|
||
|
|
"epoch": 0.02713268759481853,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00023200000000000003,
|
||
|
|
"loss": 6.8514,
|
||
|
|
"mean_token_accuracy": 0.08765117079019547,
|
||
|
|
"num_tokens": 883182.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3482073783874515,
|
||
|
|
"epoch": 0.027424436923795075,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00023449999999999998,
|
||
|
|
"loss": 6.9282,
|
||
|
|
"mean_token_accuracy": 0.08807430192828178,
|
||
|
|
"num_tokens": 891879.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.25138897895813,
|
||
|
|
"epoch": 0.02771618625277162,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000237,
|
||
|
|
"loss": 6.9982,
|
||
|
|
"mean_token_accuracy": 0.08774204924702644,
|
||
|
|
"num_tokens": 901925.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.124047946929932,
|
||
|
|
"epoch": 0.02800793558174816,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0002395,
|
||
|
|
"loss": 6.9424,
|
||
|
|
"mean_token_accuracy": 0.08976237252354621,
|
||
|
|
"num_tokens": 910609.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.321299314498901,
|
||
|
|
"epoch": 0.028299684910724706,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000242,
|
||
|
|
"loss": 7.0122,
|
||
|
|
"mean_token_accuracy": 0.08504581227898597,
|
||
|
|
"num_tokens": 919643.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.123654794692993,
|
||
|
|
"epoch": 0.028591434239701247,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0002445,
|
||
|
|
"loss": 6.8913,
|
||
|
|
"mean_token_accuracy": 0.0893466129899025,
|
||
|
|
"num_tokens": 929160.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.151027345657349,
|
||
|
|
"epoch": 0.028883183568677792,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000247,
|
||
|
|
"loss": 6.8194,
|
||
|
|
"mean_token_accuracy": 0.09795917496085167,
|
||
|
|
"num_tokens": 938329.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3193886280059814,
|
||
|
|
"epoch": 0.029174932897654337,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0002495,
|
||
|
|
"loss": 7.1734,
|
||
|
|
"mean_token_accuracy": 0.0849479891359806,
|
||
|
|
"num_tokens": 947919.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.266849994659424,
|
||
|
|
"epoch": 0.029466682226630878,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.000252,
|
||
|
|
"loss": 6.9606,
|
||
|
|
"mean_token_accuracy": 0.08843713030219078,
|
||
|
|
"num_tokens": 957647.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.076206827163697,
|
||
|
|
"epoch": 0.029758431555607423,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0002545,
|
||
|
|
"loss": 6.8029,
|
||
|
|
"mean_token_accuracy": 0.08850999772548676,
|
||
|
|
"num_tokens": 966569.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.057240724563599,
|
||
|
|
"epoch": 0.030050180884583964,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000257,
|
||
|
|
"loss": 6.8111,
|
||
|
|
"mean_token_accuracy": 0.09094983339309692,
|
||
|
|
"num_tokens": 976051.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.113047027587891,
|
||
|
|
"epoch": 0.03034193021356051,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0002595,
|
||
|
|
"loss": 6.8614,
|
||
|
|
"mean_token_accuracy": 0.0857666164636612,
|
||
|
|
"num_tokens": 985445.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.186595869064331,
|
||
|
|
"epoch": 0.03063367954253705,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.000262,
|
||
|
|
"loss": 6.9374,
|
||
|
|
"mean_token_accuracy": 0.09131588712334633,
|
||
|
|
"num_tokens": 995633.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.1607764720916744,
|
||
|
|
"epoch": 0.030925428871513595,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00026450000000000003,
|
||
|
|
"loss": 6.9758,
|
||
|
|
"mean_token_accuracy": 0.08313630521297455,
|
||
|
|
"num_tokens": 1005518.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.11238431930542,
|
||
|
|
"epoch": 0.03121717820049014,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00026700000000000004,
|
||
|
|
"loss": 6.9041,
|
||
|
|
"mean_token_accuracy": 0.08468850925564766,
|
||
|
|
"num_tokens": 1014791.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.10997519493103,
|
||
|
|
"epoch": 0.031508927529466685,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00026950000000000005,
|
||
|
|
"loss": 6.8947,
|
||
|
|
"mean_token_accuracy": 0.09137562066316604,
|
||
|
|
"num_tokens": 1024607.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.005407094955444,
|
||
|
|
"epoch": 0.031800676858443226,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00027200000000000005,
|
||
|
|
"loss": 6.7183,
|
||
|
|
"mean_token_accuracy": 0.09899639561772347,
|
||
|
|
"num_tokens": 1034939.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.011656808853149,
|
||
|
|
"epoch": 0.03209242618741977,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0002745,
|
||
|
|
"loss": 6.7633,
|
||
|
|
"mean_token_accuracy": 0.0912862703204155,
|
||
|
|
"num_tokens": 1043982.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.030924987792969,
|
||
|
|
"epoch": 0.032384175516396316,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.000277,
|
||
|
|
"loss": 6.792,
|
||
|
|
"mean_token_accuracy": 0.08782375603914261,
|
||
|
|
"num_tokens": 1053519.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.136856937408448,
|
||
|
|
"epoch": 0.03267592484537286,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0002795,
|
||
|
|
"loss": 7.0022,
|
||
|
|
"mean_token_accuracy": 0.08456368148326873,
|
||
|
|
"num_tokens": 1064293.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.047938442230224,
|
||
|
|
"epoch": 0.0329676741743494,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.00028199999999999997,
|
||
|
|
"loss": 6.9196,
|
||
|
|
"mean_token_accuracy": 0.08983817920088769,
|
||
|
|
"num_tokens": 1074013.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.060609769821167,
|
||
|
|
"epoch": 0.03325942350332594,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0002845,
|
||
|
|
"loss": 6.7375,
|
||
|
|
"mean_token_accuracy": 0.09103487208485603,
|
||
|
|
"num_tokens": 1084246.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.055113077163696,
|
||
|
|
"epoch": 0.03355117283230249,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.000287,
|
||
|
|
"loss": 6.9214,
|
||
|
|
"mean_token_accuracy": 0.08176419213414192,
|
||
|
|
"num_tokens": 1093301.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.076783752441406,
|
||
|
|
"epoch": 0.03384292216127903,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0002895,
|
||
|
|
"loss": 6.9173,
|
||
|
|
"mean_token_accuracy": 0.0938428908586502,
|
||
|
|
"num_tokens": 1103001.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.104855298995972,
|
||
|
|
"epoch": 0.03413467149025557,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000292,
|
||
|
|
"loss": 6.8065,
|
||
|
|
"mean_token_accuracy": 0.0953914389014244,
|
||
|
|
"num_tokens": 1111233.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.02773814201355,
|
||
|
|
"epoch": 0.03442642081923212,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0002945,
|
||
|
|
"loss": 6.8948,
|
||
|
|
"mean_token_accuracy": 0.085613664239645,
|
||
|
|
"num_tokens": 1121254.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.111239337921143,
|
||
|
|
"epoch": 0.03471817014820866,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000297,
|
||
|
|
"loss": 6.9226,
|
||
|
|
"mean_token_accuracy": 0.08546795472502708,
|
||
|
|
"num_tokens": 1132420.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.03243350982666,
|
||
|
|
"epoch": 0.0350099194771852,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0002995,
|
||
|
|
"loss": 6.8178,
|
||
|
|
"mean_token_accuracy": 0.09553094804286957,
|
||
|
|
"num_tokens": 1141582.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.081856727600098,
|
||
|
|
"epoch": 0.03530166880616174,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.000302,
|
||
|
|
"loss": 6.9839,
|
||
|
|
"mean_token_accuracy": 0.08826950266957283,
|
||
|
|
"num_tokens": 1151756.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.009781455993652,
|
||
|
|
"epoch": 0.03559341813513829,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0003045,
|
||
|
|
"loss": 6.7564,
|
||
|
|
"mean_token_accuracy": 0.09513645693659782,
|
||
|
|
"num_tokens": 1160624.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.095517921447754,
|
||
|
|
"epoch": 0.03588516746411483,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000307,
|
||
|
|
"loss": 6.8711,
|
||
|
|
"mean_token_accuracy": 0.0887086771428585,
|
||
|
|
"num_tokens": 1169713.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.925157833099365,
|
||
|
|
"epoch": 0.036176916793091374,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0003095,
|
||
|
|
"loss": 6.7838,
|
||
|
|
"mean_token_accuracy": 0.09514963701367378,
|
||
|
|
"num_tokens": 1178983.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0570183277130125,
|
||
|
|
"epoch": 0.03646866612206792,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000312,
|
||
|
|
"loss": 6.8797,
|
||
|
|
"mean_token_accuracy": 0.08803052604198455,
|
||
|
|
"num_tokens": 1189103.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9957983016967775,
|
||
|
|
"epoch": 0.03676041545104446,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0003145,
|
||
|
|
"loss": 6.8739,
|
||
|
|
"mean_token_accuracy": 0.08884734362363815,
|
||
|
|
"num_tokens": 1198249.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.861308431625366,
|
||
|
|
"epoch": 0.037052164780021005,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.000317,
|
||
|
|
"loss": 6.7178,
|
||
|
|
"mean_token_accuracy": 0.09863906130194663,
|
||
|
|
"num_tokens": 1207946.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.984153413772583,
|
||
|
|
"epoch": 0.037343914108997546,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003195,
|
||
|
|
"loss": 6.8166,
|
||
|
|
"mean_token_accuracy": 0.0928347222507,
|
||
|
|
"num_tokens": 1218298.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.125207710266113,
|
||
|
|
"epoch": 0.037635663437974094,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000322,
|
||
|
|
"loss": 6.8759,
|
||
|
|
"mean_token_accuracy": 0.08900825083255767,
|
||
|
|
"num_tokens": 1228291.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.95434799194336,
|
||
|
|
"epoch": 0.037927412766950636,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.00032450000000000003,
|
||
|
|
"loss": 6.7389,
|
||
|
|
"mean_token_accuracy": 0.08987870886921882,
|
||
|
|
"num_tokens": 1237106.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.88364200592041,
|
||
|
|
"epoch": 0.03821916209592718,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00032700000000000003,
|
||
|
|
"loss": 6.7234,
|
||
|
|
"mean_token_accuracy": 0.0889329269528389,
|
||
|
|
"num_tokens": 1246191.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.868375635147094,
|
||
|
|
"epoch": 0.038510911424903725,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00032950000000000004,
|
||
|
|
"loss": 6.6889,
|
||
|
|
"mean_token_accuracy": 0.098920189589262,
|
||
|
|
"num_tokens": 1256071.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.872937250137329,
|
||
|
|
"epoch": 0.038802660753880266,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.00033200000000000005,
|
||
|
|
"loss": 6.7492,
|
||
|
|
"mean_token_accuracy": 0.08766399398446083,
|
||
|
|
"num_tokens": 1266495.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.899469661712646,
|
||
|
|
"epoch": 0.03909441008285681,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00033450000000000005,
|
||
|
|
"loss": 6.7863,
|
||
|
|
"mean_token_accuracy": 0.09696677550673485,
|
||
|
|
"num_tokens": 1275054.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.993720483779907,
|
||
|
|
"epoch": 0.039386159411833356,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.000337,
|
||
|
|
"loss": 6.8245,
|
||
|
|
"mean_token_accuracy": 0.09204187542200089,
|
||
|
|
"num_tokens": 1284654.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.815813589096069,
|
||
|
|
"epoch": 0.0396779087408099,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0003395,
|
||
|
|
"loss": 6.7124,
|
||
|
|
"mean_token_accuracy": 0.09631834179162979,
|
||
|
|
"num_tokens": 1294080.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.981986474990845,
|
||
|
|
"epoch": 0.03996965806978644,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000342,
|
||
|
|
"loss": 6.7317,
|
||
|
|
"mean_token_accuracy": 0.0942990817129612,
|
||
|
|
"num_tokens": 1303578.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.933795309066772,
|
||
|
|
"epoch": 0.04026140739876298,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00034449999999999997,
|
||
|
|
"loss": 6.8006,
|
||
|
|
"mean_token_accuracy": 0.09185948371887206,
|
||
|
|
"num_tokens": 1312690.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.84517650604248,
|
||
|
|
"epoch": 0.04055315672773953,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000347,
|
||
|
|
"loss": 6.7076,
|
||
|
|
"mean_token_accuracy": 0.09742054864764213,
|
||
|
|
"num_tokens": 1322356.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9569329738616945,
|
||
|
|
"epoch": 0.04084490605671607,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0003495,
|
||
|
|
"loss": 6.7981,
|
||
|
|
"mean_token_accuracy": 0.09365248009562492,
|
||
|
|
"num_tokens": 1331343.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.990424251556396,
|
||
|
|
"epoch": 0.04113665538569261,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000352,
|
||
|
|
"loss": 6.8491,
|
||
|
|
"mean_token_accuracy": 0.0921269752085209,
|
||
|
|
"num_tokens": 1341145.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.963319873809814,
|
||
|
|
"epoch": 0.04142840471466916,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0003545,
|
||
|
|
"loss": 6.8309,
|
||
|
|
"mean_token_accuracy": 0.09416978061199188,
|
||
|
|
"num_tokens": 1350510.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.865133380889892,
|
||
|
|
"epoch": 0.0417201540436457,
|
||
|
|
"grad_norm": 1.3359375,
|
||
|
|
"learning_rate": 0.000357,
|
||
|
|
"loss": 6.7864,
|
||
|
|
"mean_token_accuracy": 0.09067512676119804,
|
||
|
|
"num_tokens": 1359799.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.878024053573609,
|
||
|
|
"epoch": 0.04201190337262224,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0003595,
|
||
|
|
"loss": 6.8363,
|
||
|
|
"mean_token_accuracy": 0.09358146041631699,
|
||
|
|
"num_tokens": 1369443.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.90676736831665,
|
||
|
|
"epoch": 0.04230365270159878,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.000362,
|
||
|
|
"loss": 6.685,
|
||
|
|
"mean_token_accuracy": 0.09888828694820403,
|
||
|
|
"num_tokens": 1379261.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.881983280181885,
|
||
|
|
"epoch": 0.04259540203057533,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0003645,
|
||
|
|
"loss": 6.7664,
|
||
|
|
"mean_token_accuracy": 0.10230381861329078,
|
||
|
|
"num_tokens": 1388451.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.774169158935547,
|
||
|
|
"epoch": 0.04288715135955187,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.000367,
|
||
|
|
"loss": 6.7704,
|
||
|
|
"mean_token_accuracy": 0.09487680047750473,
|
||
|
|
"num_tokens": 1398191.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9481110095977785,
|
||
|
|
"epoch": 0.043178900688528414,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0003695,
|
||
|
|
"loss": 6.7186,
|
||
|
|
"mean_token_accuracy": 0.09421756863594055,
|
||
|
|
"num_tokens": 1408276.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.931284427642822,
|
||
|
|
"epoch": 0.04347065001750496,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000372,
|
||
|
|
"loss": 6.7896,
|
||
|
|
"mean_token_accuracy": 0.09712609723210335,
|
||
|
|
"num_tokens": 1417329.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8381664752960205,
|
||
|
|
"epoch": 0.043762399346481504,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0003745,
|
||
|
|
"loss": 6.8117,
|
||
|
|
"mean_token_accuracy": 0.09550364837050437,
|
||
|
|
"num_tokens": 1426361.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8008181095123295,
|
||
|
|
"epoch": 0.044054148675458045,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.000377,
|
||
|
|
"loss": 6.6971,
|
||
|
|
"mean_token_accuracy": 0.0986745998263359,
|
||
|
|
"num_tokens": 1436292.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.845808029174805,
|
||
|
|
"epoch": 0.04434589800443459,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0003795,
|
||
|
|
"loss": 6.5971,
|
||
|
|
"mean_token_accuracy": 0.09895778745412827,
|
||
|
|
"num_tokens": 1445518.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.755419540405273,
|
||
|
|
"epoch": 0.044637647333411135,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.000382,
|
||
|
|
"loss": 6.6102,
|
||
|
|
"mean_token_accuracy": 0.1003187820315361,
|
||
|
|
"num_tokens": 1456140.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.721004772186279,
|
||
|
|
"epoch": 0.044929396662387676,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0003845,
|
||
|
|
"loss": 6.7213,
|
||
|
|
"mean_token_accuracy": 0.0939919888973236,
|
||
|
|
"num_tokens": 1464997.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.738425827026367,
|
||
|
|
"epoch": 0.04522114599136422,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00038700000000000003,
|
||
|
|
"loss": 6.652,
|
||
|
|
"mean_token_accuracy": 0.10241445153951645,
|
||
|
|
"num_tokens": 1474687.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.810252714157104,
|
||
|
|
"epoch": 0.045512895320340765,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00038950000000000003,
|
||
|
|
"loss": 6.7066,
|
||
|
|
"mean_token_accuracy": 0.09432699158787727,
|
||
|
|
"num_tokens": 1484826.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8092962265014645,
|
||
|
|
"epoch": 0.04580464464931731,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00039200000000000004,
|
||
|
|
"loss": 6.7216,
|
||
|
|
"mean_token_accuracy": 0.09401827231049538,
|
||
|
|
"num_tokens": 1494200.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.736168766021729,
|
||
|
|
"epoch": 0.04609639397829385,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00039450000000000005,
|
||
|
|
"loss": 6.6461,
|
||
|
|
"mean_token_accuracy": 0.10280982181429862,
|
||
|
|
"num_tokens": 1503343.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.672789764404297,
|
||
|
|
"epoch": 0.046388143307270396,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00039700000000000005,
|
||
|
|
"loss": 6.6333,
|
||
|
|
"mean_token_accuracy": 0.10122447237372398,
|
||
|
|
"num_tokens": 1511936.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.843571376800537,
|
||
|
|
"epoch": 0.04667989263624694,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0003995,
|
||
|
|
"loss": 6.6928,
|
||
|
|
"mean_token_accuracy": 0.09420284777879714,
|
||
|
|
"num_tokens": 1521692.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.806577157974243,
|
||
|
|
"epoch": 0.04697164196522348,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000402,
|
||
|
|
"loss": 6.6285,
|
||
|
|
"mean_token_accuracy": 0.09857678040862083,
|
||
|
|
"num_tokens": 1530517.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.741385078430175,
|
||
|
|
"epoch": 0.04726339129420002,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0004045,
|
||
|
|
"loss": 6.658,
|
||
|
|
"mean_token_accuracy": 0.1008826494216919,
|
||
|
|
"num_tokens": 1540037.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.744747114181519,
|
||
|
|
"epoch": 0.04755514062317657,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00040699999999999997,
|
||
|
|
"loss": 6.673,
|
||
|
|
"mean_token_accuracy": 0.1030520461499691,
|
||
|
|
"num_tokens": 1549099.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.728698205947876,
|
||
|
|
"epoch": 0.04784688995215311,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004095,
|
||
|
|
"loss": 6.5874,
|
||
|
|
"mean_token_accuracy": 0.10317010059952736,
|
||
|
|
"num_tokens": 1559150.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.691241073608398,
|
||
|
|
"epoch": 0.04813863928112965,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.000412,
|
||
|
|
"loss": 6.6829,
|
||
|
|
"mean_token_accuracy": 0.09901780784130096,
|
||
|
|
"num_tokens": 1567999.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.715443181991577,
|
||
|
|
"epoch": 0.0484303886101062,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004145,
|
||
|
|
"loss": 6.7417,
|
||
|
|
"mean_token_accuracy": 0.10948037281632424,
|
||
|
|
"num_tokens": 1576600.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6703986644744875,
|
||
|
|
"epoch": 0.04872213793908274,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000417,
|
||
|
|
"loss": 6.5241,
|
||
|
|
"mean_token_accuracy": 0.1046327918767929,
|
||
|
|
"num_tokens": 1586462.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.64805235862732,
|
||
|
|
"epoch": 0.04901388726805928,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004195,
|
||
|
|
"loss": 6.6576,
|
||
|
|
"mean_token_accuracy": 0.09610966295003891,
|
||
|
|
"num_tokens": 1596159.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.804348373413086,
|
||
|
|
"epoch": 0.04930563659703582,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.000422,
|
||
|
|
"loss": 6.6896,
|
||
|
|
"mean_token_accuracy": 0.10318435579538346,
|
||
|
|
"num_tokens": 1606010.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.724388599395752,
|
||
|
|
"epoch": 0.04959738592601237,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004245,
|
||
|
|
"loss": 6.714,
|
||
|
|
"mean_token_accuracy": 0.10009755790233613,
|
||
|
|
"num_tokens": 1614968.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.730385255813599,
|
||
|
|
"epoch": 0.04988913525498891,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.000427,
|
||
|
|
"loss": 6.5681,
|
||
|
|
"mean_token_accuracy": 0.10025268271565438,
|
||
|
|
"num_tokens": 1623895.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.804841709136963,
|
||
|
|
"epoch": 0.050180884583965454,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004295,
|
||
|
|
"loss": 6.6844,
|
||
|
|
"mean_token_accuracy": 0.09485859274864197,
|
||
|
|
"num_tokens": 1633732.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.677802991867066,
|
||
|
|
"epoch": 0.050472633912942,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.000432,
|
||
|
|
"loss": 6.65,
|
||
|
|
"mean_token_accuracy": 0.10071519836783409,
|
||
|
|
"num_tokens": 1643176.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.67259259223938,
|
||
|
|
"epoch": 0.050764383241918544,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004345,
|
||
|
|
"loss": 6.7125,
|
||
|
|
"mean_token_accuracy": 0.09944225549697876,
|
||
|
|
"num_tokens": 1652652.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.769341325759887,
|
||
|
|
"epoch": 0.051056132570895085,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000437,
|
||
|
|
"loss": 6.7087,
|
||
|
|
"mean_token_accuracy": 0.09546388238668442,
|
||
|
|
"num_tokens": 1661279.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.785306167602539,
|
||
|
|
"epoch": 0.051347881899871634,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004395,
|
||
|
|
"loss": 6.7172,
|
||
|
|
"mean_token_accuracy": 0.09483732208609581,
|
||
|
|
"num_tokens": 1671254.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.627253103256225,
|
||
|
|
"epoch": 0.051639631228848175,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.000442,
|
||
|
|
"loss": 6.4968,
|
||
|
|
"mean_token_accuracy": 0.10113293752074241,
|
||
|
|
"num_tokens": 1679921.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.703667211532593,
|
||
|
|
"epoch": 0.051931380557824716,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004445,
|
||
|
|
"loss": 6.6159,
|
||
|
|
"mean_token_accuracy": 0.10109170824289322,
|
||
|
|
"num_tokens": 1689706.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.751815223693848,
|
||
|
|
"epoch": 0.05222312988680126,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.000447,
|
||
|
|
"loss": 6.696,
|
||
|
|
"mean_token_accuracy": 0.09690436124801635,
|
||
|
|
"num_tokens": 1700322.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.633773994445801,
|
||
|
|
"epoch": 0.052514879215777806,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00044950000000000003,
|
||
|
|
"loss": 6.574,
|
||
|
|
"mean_token_accuracy": 0.10566928014159202,
|
||
|
|
"num_tokens": 1709179.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.579496812820435,
|
||
|
|
"epoch": 0.05280662854475435,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00045200000000000004,
|
||
|
|
"loss": 6.528,
|
||
|
|
"mean_token_accuracy": 0.10681467652320861,
|
||
|
|
"num_tokens": 1718427.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.682822132110596,
|
||
|
|
"epoch": 0.05309837787373089,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00045450000000000004,
|
||
|
|
"loss": 6.5837,
|
||
|
|
"mean_token_accuracy": 0.09797712191939353,
|
||
|
|
"num_tokens": 1727930.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.625987529754639,
|
||
|
|
"epoch": 0.05339012720270744,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00045700000000000005,
|
||
|
|
"loss": 6.6188,
|
||
|
|
"mean_token_accuracy": 0.10405138954520225,
|
||
|
|
"num_tokens": 1737264.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.602404928207397,
|
||
|
|
"epoch": 0.05368187653168398,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.00045950000000000006,
|
||
|
|
"loss": 6.5705,
|
||
|
|
"mean_token_accuracy": 0.10319243893027305,
|
||
|
|
"num_tokens": 1746388.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.655055236816406,
|
||
|
|
"epoch": 0.05397362586066052,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000462,
|
||
|
|
"loss": 6.588,
|
||
|
|
"mean_token_accuracy": 0.09976595863699914,
|
||
|
|
"num_tokens": 1755992.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.557945108413696,
|
||
|
|
"epoch": 0.05426537518963706,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0004645,
|
||
|
|
"loss": 6.5948,
|
||
|
|
"mean_token_accuracy": 0.1043360821902752,
|
||
|
|
"num_tokens": 1765101.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.608616828918457,
|
||
|
|
"epoch": 0.05455712451861361,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000467,
|
||
|
|
"loss": 6.518,
|
||
|
|
"mean_token_accuracy": 0.10695041045546531,
|
||
|
|
"num_tokens": 1773377.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.7846527099609375,
|
||
|
|
"epoch": 0.05484887384759015,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004695,
|
||
|
|
"loss": 6.685,
|
||
|
|
"mean_token_accuracy": 0.09719114303588867,
|
||
|
|
"num_tokens": 1782691.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.581558084487915,
|
||
|
|
"epoch": 0.05514062317656669,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000472,
|
||
|
|
"loss": 6.6633,
|
||
|
|
"mean_token_accuracy": 0.09527761414647103,
|
||
|
|
"num_tokens": 1792327.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.649594068527222,
|
||
|
|
"epoch": 0.05543237250554324,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004745,
|
||
|
|
"loss": 6.6353,
|
||
|
|
"mean_token_accuracy": 0.10013408064842225,
|
||
|
|
"num_tokens": 1802419.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.586823034286499,
|
||
|
|
"epoch": 0.05572412183451978,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000477,
|
||
|
|
"loss": 6.5391,
|
||
|
|
"mean_token_accuracy": 0.10384995490312576,
|
||
|
|
"num_tokens": 1811809.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.593689727783203,
|
||
|
|
"epoch": 0.05601587116349632,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004795,
|
||
|
|
"loss": 6.6023,
|
||
|
|
"mean_token_accuracy": 0.1025864191353321,
|
||
|
|
"num_tokens": 1820811.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.703953552246094,
|
||
|
|
"epoch": 0.05630762049247287,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000482,
|
||
|
|
"loss": 6.662,
|
||
|
|
"mean_token_accuracy": 0.09310555234551429,
|
||
|
|
"num_tokens": 1830646.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.43831353187561,
|
||
|
|
"epoch": 0.05659936982144941,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004845,
|
||
|
|
"loss": 6.5116,
|
||
|
|
"mean_token_accuracy": 0.10798174142837524,
|
||
|
|
"num_tokens": 1839729.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.744899940490723,
|
||
|
|
"epoch": 0.05689111915042595,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.000487,
|
||
|
|
"loss": 6.6372,
|
||
|
|
"mean_token_accuracy": 0.09991811662912368,
|
||
|
|
"num_tokens": 1848997.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.513811635971069,
|
||
|
|
"epoch": 0.057182868479402495,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0004895,
|
||
|
|
"loss": 6.5616,
|
||
|
|
"mean_token_accuracy": 0.10880497097969055,
|
||
|
|
"num_tokens": 1859123.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.667817068099976,
|
||
|
|
"epoch": 0.05747461780837904,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000492,
|
||
|
|
"loss": 6.6949,
|
||
|
|
"mean_token_accuracy": 0.11167361810803414,
|
||
|
|
"num_tokens": 1868327.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.558897924423218,
|
||
|
|
"epoch": 0.057766367137355584,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004945,
|
||
|
|
"loss": 6.5809,
|
||
|
|
"mean_token_accuracy": 0.1034304141998291,
|
||
|
|
"num_tokens": 1877880.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.661033344268799,
|
||
|
|
"epoch": 0.058058116466332126,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000497,
|
||
|
|
"loss": 6.5736,
|
||
|
|
"mean_token_accuracy": 0.10090498700737953,
|
||
|
|
"num_tokens": 1887331.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.638740062713623,
|
||
|
|
"epoch": 0.058349865795308674,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004995,
|
||
|
|
"loss": 6.6316,
|
||
|
|
"mean_token_accuracy": 0.09878421947360039,
|
||
|
|
"num_tokens": 1897343.0,
|
||
|
|
"step": 1000
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 4000,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 1,
|
||
|
|
"save_steps": 500,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 2755161169920000.0,
|
||
|
|
"train_batch_size": 16,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|