8035 lines
219 KiB
JSON
8035 lines
219 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.2333994631812347,
|
|
"eval_steps": 500,
|
|
"global_step": 4000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.69196834564209,
|
|
"epoch": 0.00029174932897654333,
|
|
"grad_norm": 13.0625,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8036,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 9376.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691983699798584,
|
|
"epoch": 0.0005834986579530867,
|
|
"grad_norm": 13.0625,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7354,
|
|
"mean_token_accuracy": 0.00011641443707048893,
|
|
"num_tokens": 18416.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.690966510772705,
|
|
"epoch": 0.00087524798692963,
|
|
"grad_norm": 10.0625,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.5172,
|
|
"mean_token_accuracy": 0.029424548242241146,
|
|
"num_tokens": 27778.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.678794956207275,
|
|
"epoch": 0.0011669973159061733,
|
|
"grad_norm": 5.90625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.2454,
|
|
"mean_token_accuracy": 0.04061399847269058,
|
|
"num_tokens": 37698.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.63073034286499,
|
|
"epoch": 0.0014587466448827168,
|
|
"grad_norm": 4.1875,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.9716,
|
|
"mean_token_accuracy": 0.04182791076600552,
|
|
"num_tokens": 47412.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.602538585662842,
|
|
"epoch": 0.00175049597385926,
|
|
"grad_norm": 3.21875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.7862,
|
|
"mean_token_accuracy": 0.04080851711332798,
|
|
"num_tokens": 56226.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.595691585540772,
|
|
"epoch": 0.0020422453028358036,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.6992,
|
|
"mean_token_accuracy": 0.04258432537317276,
|
|
"num_tokens": 65953.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.587265396118164,
|
|
"epoch": 0.0023339946318123466,
|
|
"grad_norm": 2.703125,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.6666,
|
|
"mean_token_accuracy": 0.040068139880895616,
|
|
"num_tokens": 74939.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.5896146774292,
|
|
"epoch": 0.00262574396078889,
|
|
"grad_norm": 2.5625,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.6425,
|
|
"mean_token_accuracy": 0.04199751690030098,
|
|
"num_tokens": 83855.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.573621463775634,
|
|
"epoch": 0.0029174932897654336,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5754,
|
|
"mean_token_accuracy": 0.045654605329036715,
|
|
"num_tokens": 93561.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.557998752593994,
|
|
"epoch": 0.003209242618741977,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.479,
|
|
"mean_token_accuracy": 0.05661129578948021,
|
|
"num_tokens": 103395.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.49096736907959,
|
|
"epoch": 0.00350099194771852,
|
|
"grad_norm": 2.40625,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.4209,
|
|
"mean_token_accuracy": 0.05532712675631046,
|
|
"num_tokens": 112462.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.353149223327637,
|
|
"epoch": 0.0037927412766950636,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.3195,
|
|
"mean_token_accuracy": 0.05394121035933495,
|
|
"num_tokens": 121553.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.451189041137695,
|
|
"epoch": 0.004084490605671607,
|
|
"grad_norm": 2.234375,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.2945,
|
|
"mean_token_accuracy": 0.05459350645542145,
|
|
"num_tokens": 131138.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.415141296386718,
|
|
"epoch": 0.00437623993464815,
|
|
"grad_norm": 2.140625,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.2235,
|
|
"mean_token_accuracy": 0.05688905864953995,
|
|
"num_tokens": 140171.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.439569473266602,
|
|
"epoch": 0.004667989263624693,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.0989,
|
|
"mean_token_accuracy": 0.055916853994131085,
|
|
"num_tokens": 149483.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.392880725860596,
|
|
"epoch": 0.004959738592601237,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.0805,
|
|
"mean_token_accuracy": 0.05239327773451805,
|
|
"num_tokens": 159190.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.381812000274659,
|
|
"epoch": 0.00525148792157778,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.9431,
|
|
"mean_token_accuracy": 0.05531255267560482,
|
|
"num_tokens": 169601.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.296150207519531,
|
|
"epoch": 0.005543237250554324,
|
|
"grad_norm": 1.9765625,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.8622,
|
|
"mean_token_accuracy": 0.057431581988930704,
|
|
"num_tokens": 179268.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.249444198608398,
|
|
"epoch": 0.005834986579530867,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.7591,
|
|
"mean_token_accuracy": 0.05835646912455559,
|
|
"num_tokens": 188699.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.191282558441163,
|
|
"epoch": 0.00612673590850741,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.6842,
|
|
"mean_token_accuracy": 0.05705415904521942,
|
|
"num_tokens": 199939.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.147027969360352,
|
|
"epoch": 0.006418485237483954,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.5501,
|
|
"mean_token_accuracy": 0.06250228881835937,
|
|
"num_tokens": 209419.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.024614429473877,
|
|
"epoch": 0.006710234566460497,
|
|
"grad_norm": 1.9375,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.4704,
|
|
"mean_token_accuracy": 0.06286126635968685,
|
|
"num_tokens": 218642.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.988630104064942,
|
|
"epoch": 0.00700198389543704,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.3393,
|
|
"mean_token_accuracy": 0.061313451081514356,
|
|
"num_tokens": 228358.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.84273166656494,
|
|
"epoch": 0.007293733224413584,
|
|
"grad_norm": 1.875,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.1163,
|
|
"mean_token_accuracy": 0.0694800227880478,
|
|
"num_tokens": 237860.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.692254257202148,
|
|
"epoch": 0.007585482553390127,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 8.1599,
|
|
"mean_token_accuracy": 0.06262776851654053,
|
|
"num_tokens": 247547.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.467087554931641,
|
|
"epoch": 0.007877231882366671,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 8.0195,
|
|
"mean_token_accuracy": 0.07063104063272477,
|
|
"num_tokens": 256405.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.383435821533203,
|
|
"epoch": 0.008168981211343214,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.9616,
|
|
"mean_token_accuracy": 0.06774205490946769,
|
|
"num_tokens": 265249.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 9.17911729812622,
|
|
"epoch": 0.008460730540319757,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.8784,
|
|
"mean_token_accuracy": 0.0681417278945446,
|
|
"num_tokens": 275681.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.988021278381348,
|
|
"epoch": 0.0087524798692963,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.7636,
|
|
"mean_token_accuracy": 0.07039406709372997,
|
|
"num_tokens": 284957.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.73282070159912,
|
|
"epoch": 0.009044229198272843,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.6563,
|
|
"mean_token_accuracy": 0.07246890291571617,
|
|
"num_tokens": 294010.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.682876682281494,
|
|
"epoch": 0.009335978527249386,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.7148,
|
|
"mean_token_accuracy": 0.07290182597935199,
|
|
"num_tokens": 303264.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.486510944366454,
|
|
"epoch": 0.009627727856225931,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.5966,
|
|
"mean_token_accuracy": 0.07415391989052296,
|
|
"num_tokens": 313450.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.362883186340332,
|
|
"epoch": 0.009919477185202474,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.5375,
|
|
"mean_token_accuracy": 0.07450749576091767,
|
|
"num_tokens": 322764.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.276646995544434,
|
|
"epoch": 0.010211226514179017,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.5492,
|
|
"mean_token_accuracy": 0.07559143453836441,
|
|
"num_tokens": 332228.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.189496421813965,
|
|
"epoch": 0.01050297584315556,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.4578,
|
|
"mean_token_accuracy": 0.07792975381016731,
|
|
"num_tokens": 341589.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.08325457572937,
|
|
"epoch": 0.010794725172132104,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.3998,
|
|
"mean_token_accuracy": 0.07972711473703384,
|
|
"num_tokens": 351166.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 8.023299407958984,
|
|
"epoch": 0.011086474501108648,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.4712,
|
|
"mean_token_accuracy": 0.07630453184247017,
|
|
"num_tokens": 360962.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.986406993865967,
|
|
"epoch": 0.011378223830085191,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.4208,
|
|
"mean_token_accuracy": 0.07656608372926713,
|
|
"num_tokens": 370859.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.958215236663818,
|
|
"epoch": 0.011669973159061734,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.4388,
|
|
"mean_token_accuracy": 0.07721348851919174,
|
|
"num_tokens": 381017.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.953992605209351,
|
|
"epoch": 0.011961722488038277,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.4808,
|
|
"mean_token_accuracy": 0.07665727399289608,
|
|
"num_tokens": 390849.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.941216659545899,
|
|
"epoch": 0.01225347181701482,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.4537,
|
|
"mean_token_accuracy": 0.07717064693570137,
|
|
"num_tokens": 401131.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.940151929855347,
|
|
"epoch": 0.012545221145991364,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.3567,
|
|
"mean_token_accuracy": 0.07789909988641738,
|
|
"num_tokens": 410171.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.845122528076172,
|
|
"epoch": 0.012836970474967908,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.4298,
|
|
"mean_token_accuracy": 0.07820538356900215,
|
|
"num_tokens": 419352.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.826071691513062,
|
|
"epoch": 0.013128719803944451,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.2948,
|
|
"mean_token_accuracy": 0.08607594929635524,
|
|
"num_tokens": 428862.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.802604389190674,
|
|
"epoch": 0.013420469132920994,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.2856,
|
|
"mean_token_accuracy": 0.07789736986160278,
|
|
"num_tokens": 438900.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.759540748596192,
|
|
"epoch": 0.013712218461897538,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.2419,
|
|
"mean_token_accuracy": 0.08156893700361252,
|
|
"num_tokens": 447867.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.753300333023072,
|
|
"epoch": 0.01400396779087408,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.3329,
|
|
"mean_token_accuracy": 0.074883484095335,
|
|
"num_tokens": 457978.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.775896072387695,
|
|
"epoch": 0.014295717119850624,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.2889,
|
|
"mean_token_accuracy": 0.08151891827583313,
|
|
"num_tokens": 466846.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.732866048812866,
|
|
"epoch": 0.014587466448827168,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.2876,
|
|
"mean_token_accuracy": 0.07967406883835793,
|
|
"num_tokens": 475862.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.682526159286499,
|
|
"epoch": 0.014879215777803712,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.3177,
|
|
"mean_token_accuracy": 0.0773643635213375,
|
|
"num_tokens": 486088.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.789633178710938,
|
|
"epoch": 0.015170965106780255,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.19,
|
|
"mean_token_accuracy": 0.0791048213839531,
|
|
"num_tokens": 495515.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.739433479309082,
|
|
"epoch": 0.015462714435756798,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.314,
|
|
"mean_token_accuracy": 0.07758257985115051,
|
|
"num_tokens": 505617.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.701812362670898,
|
|
"epoch": 0.015754463764733342,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.2826,
|
|
"mean_token_accuracy": 0.07801382765173911,
|
|
"num_tokens": 515977.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.724566078186035,
|
|
"epoch": 0.016046213093709884,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.3384,
|
|
"mean_token_accuracy": 0.08092856109142303,
|
|
"num_tokens": 526525.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.645784378051758,
|
|
"epoch": 0.01633796242268643,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.2771,
|
|
"mean_token_accuracy": 0.08373014777898788,
|
|
"num_tokens": 536494.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.622757911682129,
|
|
"epoch": 0.01662971175166297,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.3146,
|
|
"mean_token_accuracy": 0.08114334717392921,
|
|
"num_tokens": 545326.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.662983512878418,
|
|
"epoch": 0.016921461080639515,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.1416,
|
|
"mean_token_accuracy": 0.08460377976298332,
|
|
"num_tokens": 553678.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.63046498298645,
|
|
"epoch": 0.01721321040961606,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.2891,
|
|
"mean_token_accuracy": 0.08224759995937347,
|
|
"num_tokens": 563860.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.621852588653565,
|
|
"epoch": 0.0175049597385926,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 7.238,
|
|
"mean_token_accuracy": 0.08669779226183891,
|
|
"num_tokens": 572492.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.564120435714722,
|
|
"epoch": 0.017796709067569146,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 7.1166,
|
|
"mean_token_accuracy": 0.08243767246603965,
|
|
"num_tokens": 581840.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.6293127059936525,
|
|
"epoch": 0.018088458396545687,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.2465,
|
|
"mean_token_accuracy": 0.0864152580499649,
|
|
"num_tokens": 591697.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.534941625595093,
|
|
"epoch": 0.01838020772552223,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 7.1059,
|
|
"mean_token_accuracy": 0.0846880093216896,
|
|
"num_tokens": 601153.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.607311391830445,
|
|
"epoch": 0.018671957054498773,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.1949,
|
|
"mean_token_accuracy": 0.08106868788599968,
|
|
"num_tokens": 609516.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.579704999923706,
|
|
"epoch": 0.018963706383475318,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000162,
|
|
"loss": 7.2078,
|
|
"mean_token_accuracy": 0.07954892218112945,
|
|
"num_tokens": 618836.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.576669311523437,
|
|
"epoch": 0.019255455712451863,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 7.2136,
|
|
"mean_token_accuracy": 0.08916370049118996,
|
|
"num_tokens": 628223.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.503057956695557,
|
|
"epoch": 0.019547205041428404,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 7.1113,
|
|
"mean_token_accuracy": 0.08817728385329246,
|
|
"num_tokens": 637609.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.545721530914307,
|
|
"epoch": 0.01983895437040495,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 7.1296,
|
|
"mean_token_accuracy": 0.08344640359282493,
|
|
"num_tokens": 646652.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.413992404937744,
|
|
"epoch": 0.02013070369938149,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 7.137,
|
|
"mean_token_accuracy": 0.08315069451928139,
|
|
"num_tokens": 656238.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.479533767700195,
|
|
"epoch": 0.020422453028358035,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 7.1428,
|
|
"mean_token_accuracy": 0.08378953337669373,
|
|
"num_tokens": 665148.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.503499221801758,
|
|
"epoch": 0.02071420235733458,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 7.049,
|
|
"mean_token_accuracy": 0.08563587218523025,
|
|
"num_tokens": 675192.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.388577222824097,
|
|
"epoch": 0.02100595168631112,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 7.0679,
|
|
"mean_token_accuracy": 0.08425286635756493,
|
|
"num_tokens": 684813.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.496100616455078,
|
|
"epoch": 0.021297701015287666,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 7.0952,
|
|
"mean_token_accuracy": 0.08246167674660683,
|
|
"num_tokens": 694545.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.4700541496276855,
|
|
"epoch": 0.021589450344264207,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.0857,
|
|
"mean_token_accuracy": 0.08829364702105522,
|
|
"num_tokens": 704312.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.475095510482788,
|
|
"epoch": 0.021881199673240752,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.1189,
|
|
"mean_token_accuracy": 0.08108639344573021,
|
|
"num_tokens": 713743.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.403366279602051,
|
|
"epoch": 0.022172949002217297,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 7.0088,
|
|
"mean_token_accuracy": 0.08252720050513744,
|
|
"num_tokens": 722497.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.3469452381134035,
|
|
"epoch": 0.022464698331193838,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.9952,
|
|
"mean_token_accuracy": 0.08496845439076424,
|
|
"num_tokens": 731849.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.4720964431762695,
|
|
"epoch": 0.022756447660170383,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 7.1709,
|
|
"mean_token_accuracy": 0.08666181415319443,
|
|
"num_tokens": 741345.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.3531989574432375,
|
|
"epoch": 0.023048196989146924,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 7.1245,
|
|
"mean_token_accuracy": 0.08187859356403351,
|
|
"num_tokens": 751363.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.323095083236694,
|
|
"epoch": 0.02333994631812347,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.9475,
|
|
"mean_token_accuracy": 0.08857285082340241,
|
|
"num_tokens": 761174.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.323359584808349,
|
|
"epoch": 0.02363169564710001,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.9364,
|
|
"mean_token_accuracy": 0.0823954962193966,
|
|
"num_tokens": 770773.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.241050577163696,
|
|
"epoch": 0.023923444976076555,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.964,
|
|
"mean_token_accuracy": 0.08706902638077736,
|
|
"num_tokens": 780462.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.354639291763306,
|
|
"epoch": 0.0242151943050531,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.9719,
|
|
"mean_token_accuracy": 0.08648092672228813,
|
|
"num_tokens": 789822.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.251240015029907,
|
|
"epoch": 0.02450694363402964,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.9392,
|
|
"mean_token_accuracy": 0.08409521207213402,
|
|
"num_tokens": 799724.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.2920667171478275,
|
|
"epoch": 0.024798692963006186,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000212,
|
|
"loss": 7.0463,
|
|
"mean_token_accuracy": 0.08510638326406479,
|
|
"num_tokens": 809331.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.488130569458008,
|
|
"epoch": 0.025090442291982727,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.057,
|
|
"mean_token_accuracy": 0.08337506577372551,
|
|
"num_tokens": 818665.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.296667957305909,
|
|
"epoch": 0.025382191620959272,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.9754,
|
|
"mean_token_accuracy": 0.08416144661605358,
|
|
"num_tokens": 828580.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.240721750259399,
|
|
"epoch": 0.025673940949935817,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.0171,
|
|
"mean_token_accuracy": 0.08526882231235504,
|
|
"num_tokens": 837661.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.22621784210205,
|
|
"epoch": 0.025965690278912358,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.9839,
|
|
"mean_token_accuracy": 0.08228468671441078,
|
|
"num_tokens": 847069.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.250874137878418,
|
|
"epoch": 0.026257439607888903,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.9794,
|
|
"mean_token_accuracy": 0.08245958164334297,
|
|
"num_tokens": 856743.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.338770008087158,
|
|
"epoch": 0.026549188936865444,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 7.0198,
|
|
"mean_token_accuracy": 0.08468568697571754,
|
|
"num_tokens": 865502.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.33205771446228,
|
|
"epoch": 0.02684093826584199,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.9651,
|
|
"mean_token_accuracy": 0.0839608520269394,
|
|
"num_tokens": 874178.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.088795518875122,
|
|
"epoch": 0.02713268759481853,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.8514,
|
|
"mean_token_accuracy": 0.08765117079019547,
|
|
"num_tokens": 883182.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.3482073783874515,
|
|
"epoch": 0.027424436923795075,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.9282,
|
|
"mean_token_accuracy": 0.08807430192828178,
|
|
"num_tokens": 891879.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.25138897895813,
|
|
"epoch": 0.02771618625277162,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.9982,
|
|
"mean_token_accuracy": 0.08774204924702644,
|
|
"num_tokens": 901925.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.124047946929932,
|
|
"epoch": 0.02800793558174816,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.9424,
|
|
"mean_token_accuracy": 0.08976237252354621,
|
|
"num_tokens": 910609.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.321299314498901,
|
|
"epoch": 0.028299684910724706,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000242,
|
|
"loss": 7.0122,
|
|
"mean_token_accuracy": 0.08504581227898597,
|
|
"num_tokens": 919643.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.123654794692993,
|
|
"epoch": 0.028591434239701247,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.8913,
|
|
"mean_token_accuracy": 0.0893466129899025,
|
|
"num_tokens": 929160.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.151027345657349,
|
|
"epoch": 0.028883183568677792,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.8194,
|
|
"mean_token_accuracy": 0.09795917496085167,
|
|
"num_tokens": 938329.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.3193886280059814,
|
|
"epoch": 0.029174932897654337,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 7.1734,
|
|
"mean_token_accuracy": 0.0849479891359806,
|
|
"num_tokens": 947919.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.266849994659424,
|
|
"epoch": 0.029466682226630878,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.9606,
|
|
"mean_token_accuracy": 0.08843713030219078,
|
|
"num_tokens": 957647.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.076206827163697,
|
|
"epoch": 0.029758431555607423,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.8029,
|
|
"mean_token_accuracy": 0.08850999772548676,
|
|
"num_tokens": 966569.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 7.057240724563599,
|
|
"epoch": 0.030050180884583964,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.8111,
|
|
"mean_token_accuracy": 0.09094983339309692,
|
|
"num_tokens": 976051.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 7.113047027587891,
|
|
"epoch": 0.03034193021356051,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.8614,
|
|
"mean_token_accuracy": 0.0857666164636612,
|
|
"num_tokens": 985445.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.186595869064331,
|
|
"epoch": 0.03063367954253705,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.9374,
|
|
"mean_token_accuracy": 0.09131588712334633,
|
|
"num_tokens": 995633.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 7.1607764720916744,
|
|
"epoch": 0.030925428871513595,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.9758,
|
|
"mean_token_accuracy": 0.08313630521297455,
|
|
"num_tokens": 1005518.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 7.11238431930542,
|
|
"epoch": 0.03121717820049014,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.9041,
|
|
"mean_token_accuracy": 0.08468850925564766,
|
|
"num_tokens": 1014791.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 7.10997519493103,
|
|
"epoch": 0.031508927529466685,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.8947,
|
|
"mean_token_accuracy": 0.09137562066316604,
|
|
"num_tokens": 1024607.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 7.005407094955444,
|
|
"epoch": 0.031800676858443226,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.7183,
|
|
"mean_token_accuracy": 0.09899639561772347,
|
|
"num_tokens": 1034939.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.011656808853149,
|
|
"epoch": 0.03209242618741977,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.7633,
|
|
"mean_token_accuracy": 0.0912862703204155,
|
|
"num_tokens": 1043982.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 7.030924987792969,
|
|
"epoch": 0.032384175516396316,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.792,
|
|
"mean_token_accuracy": 0.08782375603914261,
|
|
"num_tokens": 1053519.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 7.136856937408448,
|
|
"epoch": 0.03267592484537286,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.0022,
|
|
"mean_token_accuracy": 0.08456368148326873,
|
|
"num_tokens": 1064293.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.047938442230224,
|
|
"epoch": 0.0329676741743494,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.9196,
|
|
"mean_token_accuracy": 0.08983817920088769,
|
|
"num_tokens": 1074013.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.060609769821167,
|
|
"epoch": 0.03325942350332594,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.7375,
|
|
"mean_token_accuracy": 0.09103487208485603,
|
|
"num_tokens": 1084246.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 7.055113077163696,
|
|
"epoch": 0.03355117283230249,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.9214,
|
|
"mean_token_accuracy": 0.08176419213414192,
|
|
"num_tokens": 1093301.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 7.076783752441406,
|
|
"epoch": 0.03384292216127903,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.9173,
|
|
"mean_token_accuracy": 0.0938428908586502,
|
|
"num_tokens": 1103001.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.104855298995972,
|
|
"epoch": 0.03413467149025557,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.8065,
|
|
"mean_token_accuracy": 0.0953914389014244,
|
|
"num_tokens": 1111233.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.02773814201355,
|
|
"epoch": 0.03442642081923212,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.8948,
|
|
"mean_token_accuracy": 0.085613664239645,
|
|
"num_tokens": 1121254.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 7.111239337921143,
|
|
"epoch": 0.03471817014820866,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.9226,
|
|
"mean_token_accuracy": 0.08546795472502708,
|
|
"num_tokens": 1132420.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.03243350982666,
|
|
"epoch": 0.0350099194771852,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.8178,
|
|
"mean_token_accuracy": 0.09553094804286957,
|
|
"num_tokens": 1141582.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 7.081856727600098,
|
|
"epoch": 0.03530166880616174,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.9839,
|
|
"mean_token_accuracy": 0.08826950266957283,
|
|
"num_tokens": 1151756.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.009781455993652,
|
|
"epoch": 0.03559341813513829,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.7564,
|
|
"mean_token_accuracy": 0.09513645693659782,
|
|
"num_tokens": 1160624.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 7.095517921447754,
|
|
"epoch": 0.03588516746411483,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.8711,
|
|
"mean_token_accuracy": 0.0887086771428585,
|
|
"num_tokens": 1169713.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.925157833099365,
|
|
"epoch": 0.036176916793091374,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.7838,
|
|
"mean_token_accuracy": 0.09514963701367378,
|
|
"num_tokens": 1178983.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.0570183277130125,
|
|
"epoch": 0.03646866612206792,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.8797,
|
|
"mean_token_accuracy": 0.08803052604198455,
|
|
"num_tokens": 1189103.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.9957983016967775,
|
|
"epoch": 0.03676041545104446,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.8739,
|
|
"mean_token_accuracy": 0.08884734362363815,
|
|
"num_tokens": 1198249.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.861308431625366,
|
|
"epoch": 0.037052164780021005,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.7178,
|
|
"mean_token_accuracy": 0.09863906130194663,
|
|
"num_tokens": 1207946.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.984153413772583,
|
|
"epoch": 0.037343914108997546,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.8166,
|
|
"mean_token_accuracy": 0.0928347222507,
|
|
"num_tokens": 1218298.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.125207710266113,
|
|
"epoch": 0.037635663437974094,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.8759,
|
|
"mean_token_accuracy": 0.08900825083255767,
|
|
"num_tokens": 1228291.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.95434799194336,
|
|
"epoch": 0.037927412766950636,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.7389,
|
|
"mean_token_accuracy": 0.08987870886921882,
|
|
"num_tokens": 1237106.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.88364200592041,
|
|
"epoch": 0.03821916209592718,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.7234,
|
|
"mean_token_accuracy": 0.0889329269528389,
|
|
"num_tokens": 1246191.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.868375635147094,
|
|
"epoch": 0.038510911424903725,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.6889,
|
|
"mean_token_accuracy": 0.098920189589262,
|
|
"num_tokens": 1256071.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.872937250137329,
|
|
"epoch": 0.038802660753880266,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.7492,
|
|
"mean_token_accuracy": 0.08766399398446083,
|
|
"num_tokens": 1266495.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.899469661712646,
|
|
"epoch": 0.03909441008285681,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.7863,
|
|
"mean_token_accuracy": 0.09696677550673485,
|
|
"num_tokens": 1275054.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.993720483779907,
|
|
"epoch": 0.039386159411833356,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.8245,
|
|
"mean_token_accuracy": 0.09204187542200089,
|
|
"num_tokens": 1284654.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.815813589096069,
|
|
"epoch": 0.0396779087408099,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.7124,
|
|
"mean_token_accuracy": 0.09631834179162979,
|
|
"num_tokens": 1294080.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.981986474990845,
|
|
"epoch": 0.03996965806978644,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.7317,
|
|
"mean_token_accuracy": 0.0942990817129612,
|
|
"num_tokens": 1303578.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.933795309066772,
|
|
"epoch": 0.04026140739876298,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.8006,
|
|
"mean_token_accuracy": 0.09185948371887206,
|
|
"num_tokens": 1312690.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.84517650604248,
|
|
"epoch": 0.04055315672773953,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.7076,
|
|
"mean_token_accuracy": 0.09742054864764213,
|
|
"num_tokens": 1322356.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.9569329738616945,
|
|
"epoch": 0.04084490605671607,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.7981,
|
|
"mean_token_accuracy": 0.09365248009562492,
|
|
"num_tokens": 1331343.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.990424251556396,
|
|
"epoch": 0.04113665538569261,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.8491,
|
|
"mean_token_accuracy": 0.0921269752085209,
|
|
"num_tokens": 1341145.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.963319873809814,
|
|
"epoch": 0.04142840471466916,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.8309,
|
|
"mean_token_accuracy": 0.09416978061199188,
|
|
"num_tokens": 1350510.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.865133380889892,
|
|
"epoch": 0.0417201540436457,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.7864,
|
|
"mean_token_accuracy": 0.09067512676119804,
|
|
"num_tokens": 1359799.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.878024053573609,
|
|
"epoch": 0.04201190337262224,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.8363,
|
|
"mean_token_accuracy": 0.09358146041631699,
|
|
"num_tokens": 1369443.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.90676736831665,
|
|
"epoch": 0.04230365270159878,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.685,
|
|
"mean_token_accuracy": 0.09888828694820403,
|
|
"num_tokens": 1379261.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.881983280181885,
|
|
"epoch": 0.04259540203057533,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.7664,
|
|
"mean_token_accuracy": 0.10230381861329078,
|
|
"num_tokens": 1388451.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.774169158935547,
|
|
"epoch": 0.04288715135955187,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.7704,
|
|
"mean_token_accuracy": 0.09487680047750473,
|
|
"num_tokens": 1398191.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.9481110095977785,
|
|
"epoch": 0.043178900688528414,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.7186,
|
|
"mean_token_accuracy": 0.09421756863594055,
|
|
"num_tokens": 1408276.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.931284427642822,
|
|
"epoch": 0.04347065001750496,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.7896,
|
|
"mean_token_accuracy": 0.09712609723210335,
|
|
"num_tokens": 1417329.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.8381664752960205,
|
|
"epoch": 0.043762399346481504,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.8117,
|
|
"mean_token_accuracy": 0.09550364837050437,
|
|
"num_tokens": 1426361.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.8008181095123295,
|
|
"epoch": 0.044054148675458045,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.6971,
|
|
"mean_token_accuracy": 0.0986745998263359,
|
|
"num_tokens": 1436292.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.845808029174805,
|
|
"epoch": 0.04434589800443459,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.5971,
|
|
"mean_token_accuracy": 0.09895778745412827,
|
|
"num_tokens": 1445518.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.755419540405273,
|
|
"epoch": 0.044637647333411135,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.6102,
|
|
"mean_token_accuracy": 0.1003187820315361,
|
|
"num_tokens": 1456140.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.721004772186279,
|
|
"epoch": 0.044929396662387676,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.7213,
|
|
"mean_token_accuracy": 0.0939919888973236,
|
|
"num_tokens": 1464997.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.738425827026367,
|
|
"epoch": 0.04522114599136422,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.652,
|
|
"mean_token_accuracy": 0.10241445153951645,
|
|
"num_tokens": 1474687.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.810252714157104,
|
|
"epoch": 0.045512895320340765,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.7066,
|
|
"mean_token_accuracy": 0.09432699158787727,
|
|
"num_tokens": 1484826.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.8092962265014645,
|
|
"epoch": 0.04580464464931731,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.7216,
|
|
"mean_token_accuracy": 0.09401827231049538,
|
|
"num_tokens": 1494200.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.736168766021729,
|
|
"epoch": 0.04609639397829385,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.6461,
|
|
"mean_token_accuracy": 0.10280982181429862,
|
|
"num_tokens": 1503343.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.672789764404297,
|
|
"epoch": 0.046388143307270396,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.6333,
|
|
"mean_token_accuracy": 0.10122447237372398,
|
|
"num_tokens": 1511936.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.843571376800537,
|
|
"epoch": 0.04667989263624694,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.6928,
|
|
"mean_token_accuracy": 0.09420284777879714,
|
|
"num_tokens": 1521692.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.806577157974243,
|
|
"epoch": 0.04697164196522348,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.6285,
|
|
"mean_token_accuracy": 0.09857678040862083,
|
|
"num_tokens": 1530517.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.741385078430175,
|
|
"epoch": 0.04726339129420002,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.658,
|
|
"mean_token_accuracy": 0.1008826494216919,
|
|
"num_tokens": 1540037.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.744747114181519,
|
|
"epoch": 0.04755514062317657,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.673,
|
|
"mean_token_accuracy": 0.1030520461499691,
|
|
"num_tokens": 1549099.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.728698205947876,
|
|
"epoch": 0.04784688995215311,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.5874,
|
|
"mean_token_accuracy": 0.10317010059952736,
|
|
"num_tokens": 1559150.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.691241073608398,
|
|
"epoch": 0.04813863928112965,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.6829,
|
|
"mean_token_accuracy": 0.09901780784130096,
|
|
"num_tokens": 1567999.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.715443181991577,
|
|
"epoch": 0.0484303886101062,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.7417,
|
|
"mean_token_accuracy": 0.10948037281632424,
|
|
"num_tokens": 1576600.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.6703986644744875,
|
|
"epoch": 0.04872213793908274,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.5241,
|
|
"mean_token_accuracy": 0.1046327918767929,
|
|
"num_tokens": 1586462.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.64805235862732,
|
|
"epoch": 0.04901388726805928,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.6576,
|
|
"mean_token_accuracy": 0.09610966295003891,
|
|
"num_tokens": 1596159.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.804348373413086,
|
|
"epoch": 0.04930563659703582,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.6896,
|
|
"mean_token_accuracy": 0.10318435579538346,
|
|
"num_tokens": 1606010.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.724388599395752,
|
|
"epoch": 0.04959738592601237,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.714,
|
|
"mean_token_accuracy": 0.10009755790233613,
|
|
"num_tokens": 1614968.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.730385255813599,
|
|
"epoch": 0.04988913525498891,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.5681,
|
|
"mean_token_accuracy": 0.10025268271565438,
|
|
"num_tokens": 1623895.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.804841709136963,
|
|
"epoch": 0.050180884583965454,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.6844,
|
|
"mean_token_accuracy": 0.09485859274864197,
|
|
"num_tokens": 1633732.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.677802991867066,
|
|
"epoch": 0.050472633912942,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.65,
|
|
"mean_token_accuracy": 0.10071519836783409,
|
|
"num_tokens": 1643176.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.67259259223938,
|
|
"epoch": 0.050764383241918544,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.7125,
|
|
"mean_token_accuracy": 0.09944225549697876,
|
|
"num_tokens": 1652652.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.769341325759887,
|
|
"epoch": 0.051056132570895085,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.7087,
|
|
"mean_token_accuracy": 0.09546388238668442,
|
|
"num_tokens": 1661279.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.785306167602539,
|
|
"epoch": 0.051347881899871634,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.7172,
|
|
"mean_token_accuracy": 0.09483732208609581,
|
|
"num_tokens": 1671254.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.627253103256225,
|
|
"epoch": 0.051639631228848175,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.4968,
|
|
"mean_token_accuracy": 0.10113293752074241,
|
|
"num_tokens": 1679921.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.703667211532593,
|
|
"epoch": 0.051931380557824716,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.6159,
|
|
"mean_token_accuracy": 0.10109170824289322,
|
|
"num_tokens": 1689706.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.751815223693848,
|
|
"epoch": 0.05222312988680126,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.696,
|
|
"mean_token_accuracy": 0.09690436124801635,
|
|
"num_tokens": 1700322.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.633773994445801,
|
|
"epoch": 0.052514879215777806,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.574,
|
|
"mean_token_accuracy": 0.10566928014159202,
|
|
"num_tokens": 1709179.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.579496812820435,
|
|
"epoch": 0.05280662854475435,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.528,
|
|
"mean_token_accuracy": 0.10681467652320861,
|
|
"num_tokens": 1718427.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.682822132110596,
|
|
"epoch": 0.05309837787373089,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.5837,
|
|
"mean_token_accuracy": 0.09797712191939353,
|
|
"num_tokens": 1727930.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.625987529754639,
|
|
"epoch": 0.05339012720270744,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.6188,
|
|
"mean_token_accuracy": 0.10405138954520225,
|
|
"num_tokens": 1737264.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.602404928207397,
|
|
"epoch": 0.05368187653168398,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.5705,
|
|
"mean_token_accuracy": 0.10319243893027305,
|
|
"num_tokens": 1746388.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.655055236816406,
|
|
"epoch": 0.05397362586066052,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.588,
|
|
"mean_token_accuracy": 0.09976595863699914,
|
|
"num_tokens": 1755992.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.557945108413696,
|
|
"epoch": 0.05426537518963706,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.5948,
|
|
"mean_token_accuracy": 0.1043360821902752,
|
|
"num_tokens": 1765101.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.608616828918457,
|
|
"epoch": 0.05455712451861361,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.518,
|
|
"mean_token_accuracy": 0.10695041045546531,
|
|
"num_tokens": 1773377.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.7846527099609375,
|
|
"epoch": 0.05484887384759015,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.685,
|
|
"mean_token_accuracy": 0.09719114303588867,
|
|
"num_tokens": 1782691.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.581558084487915,
|
|
"epoch": 0.05514062317656669,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.6633,
|
|
"mean_token_accuracy": 0.09527761414647103,
|
|
"num_tokens": 1792327.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.649594068527222,
|
|
"epoch": 0.05543237250554324,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.6353,
|
|
"mean_token_accuracy": 0.10013408064842225,
|
|
"num_tokens": 1802419.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.586823034286499,
|
|
"epoch": 0.05572412183451978,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.5391,
|
|
"mean_token_accuracy": 0.10384995490312576,
|
|
"num_tokens": 1811809.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.593689727783203,
|
|
"epoch": 0.05601587116349632,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.6023,
|
|
"mean_token_accuracy": 0.1025864191353321,
|
|
"num_tokens": 1820811.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.703953552246094,
|
|
"epoch": 0.05630762049247287,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.662,
|
|
"mean_token_accuracy": 0.09310555234551429,
|
|
"num_tokens": 1830646.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.43831353187561,
|
|
"epoch": 0.05659936982144941,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.5116,
|
|
"mean_token_accuracy": 0.10798174142837524,
|
|
"num_tokens": 1839729.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.744899940490723,
|
|
"epoch": 0.05689111915042595,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.6372,
|
|
"mean_token_accuracy": 0.09991811662912368,
|
|
"num_tokens": 1848997.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.513811635971069,
|
|
"epoch": 0.057182868479402495,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.5616,
|
|
"mean_token_accuracy": 0.10880497097969055,
|
|
"num_tokens": 1859123.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.667817068099976,
|
|
"epoch": 0.05747461780837904,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.6949,
|
|
"mean_token_accuracy": 0.11167361810803414,
|
|
"num_tokens": 1868327.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.558897924423218,
|
|
"epoch": 0.057766367137355584,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.5809,
|
|
"mean_token_accuracy": 0.1034304141998291,
|
|
"num_tokens": 1877880.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.661033344268799,
|
|
"epoch": 0.058058116466332126,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.5736,
|
|
"mean_token_accuracy": 0.10090498700737953,
|
|
"num_tokens": 1887331.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.638740062713623,
|
|
"epoch": 0.058349865795308674,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.6316,
|
|
"mean_token_accuracy": 0.09878421947360039,
|
|
"num_tokens": 1897343.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.650649118423462,
|
|
"epoch": 0.058641615124285215,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000499998026082006,
|
|
"loss": 6.6473,
|
|
"mean_token_accuracy": 0.10691011771559715,
|
|
"num_tokens": 1906422.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.63336181640625,
|
|
"epoch": 0.058933364453261756,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999900070995136,
|
|
"loss": 6.671,
|
|
"mean_token_accuracy": 0.1082217514514923,
|
|
"num_tokens": 1916122.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.511569929122925,
|
|
"epoch": 0.0592251137822383,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999758199023239,
|
|
"loss": 6.4567,
|
|
"mean_token_accuracy": 0.10471461117267608,
|
|
"num_tokens": 1924822.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.540279054641724,
|
|
"epoch": 0.059516863111214846,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004999554648793858,
|
|
"loss": 6.6222,
|
|
"mean_token_accuracy": 0.10849541574716567,
|
|
"num_tokens": 1934629.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.493051528930664,
|
|
"epoch": 0.05980861244019139,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999289425887425,
|
|
"loss": 6.4939,
|
|
"mean_token_accuracy": 0.10078425854444503,
|
|
"num_tokens": 1943171.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.736955261230468,
|
|
"epoch": 0.06010036176916793,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004998962537575161,
|
|
"loss": 6.648,
|
|
"mean_token_accuracy": 0.10098663121461868,
|
|
"num_tokens": 1953716.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.582661819458008,
|
|
"epoch": 0.06039211109814448,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998573992818874,
|
|
"loss": 6.6512,
|
|
"mean_token_accuracy": 0.10541167482733727,
|
|
"num_tokens": 1962852.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.67156400680542,
|
|
"epoch": 0.06068386042712102,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998123802270715,
|
|
"loss": 6.6404,
|
|
"mean_token_accuracy": 0.10719699263572693,
|
|
"num_tokens": 1971762.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.535550498962403,
|
|
"epoch": 0.06097560975609756,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004997611978272886,
|
|
"loss": 6.5646,
|
|
"mean_token_accuracy": 0.10268182530999184,
|
|
"num_tokens": 1981798.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.513294410705567,
|
|
"epoch": 0.0612673590850741,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004997038534857298,
|
|
"loss": 6.4932,
|
|
"mean_token_accuracy": 0.1034928672015667,
|
|
"num_tokens": 1990479.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.672393798828125,
|
|
"epoch": 0.06155910841405065,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004996403487745194,
|
|
"loss": 6.5911,
|
|
"mean_token_accuracy": 0.10503169894218445,
|
|
"num_tokens": 2000194.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.536614418029785,
|
|
"epoch": 0.06185085774302719,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499570685434671,
|
|
"loss": 6.6125,
|
|
"mean_token_accuracy": 0.10448794513940811,
|
|
"num_tokens": 2010806.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.543749761581421,
|
|
"epoch": 0.06214260707200373,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004994948653760405,
|
|
"loss": 6.5712,
|
|
"mean_token_accuracy": 0.10555129945278167,
|
|
"num_tokens": 2019811.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.564803409576416,
|
|
"epoch": 0.06243435640098028,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004994128906772729,
|
|
"loss": 6.5333,
|
|
"mean_token_accuracy": 0.10878547504544259,
|
|
"num_tokens": 2028581.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.543899917602539,
|
|
"epoch": 0.06272610572995682,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000499324763585746,
|
|
"loss": 6.555,
|
|
"mean_token_accuracy": 0.10785453170537948,
|
|
"num_tokens": 2037496.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.552090215682983,
|
|
"epoch": 0.06301785505893337,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004992304865175085,
|
|
"loss": 6.4859,
|
|
"mean_token_accuracy": 0.1107458420097828,
|
|
"num_tokens": 2046183.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.6219559669494625,
|
|
"epoch": 0.0633096043879099,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004991300620572138,
|
|
"loss": 6.6477,
|
|
"mean_token_accuracy": 0.10132529735565185,
|
|
"num_tokens": 2056360.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.406348085403442,
|
|
"epoch": 0.06360135371688645,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004990234929580494,
|
|
"loss": 6.4436,
|
|
"mean_token_accuracy": 0.11206084564328193,
|
|
"num_tokens": 2066139.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.533041286468506,
|
|
"epoch": 0.063893103045863,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004989107821416609,
|
|
"loss": 6.5685,
|
|
"mean_token_accuracy": 0.10588387921452522,
|
|
"num_tokens": 2075284.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.4999213218688965,
|
|
"epoch": 0.06418485237483953,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004987919326980723,
|
|
"loss": 6.4587,
|
|
"mean_token_accuracy": 0.10920145735144615,
|
|
"num_tokens": 2084896.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.566693067550659,
|
|
"epoch": 0.06447660170381608,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004986669478856011,
|
|
"loss": 6.5482,
|
|
"mean_token_accuracy": 0.11378610283136367,
|
|
"num_tokens": 2094149.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.5364597797393795,
|
|
"epoch": 0.06476835103279263,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004985358311307688,
|
|
"loss": 6.6266,
|
|
"mean_token_accuracy": 0.10551877319812775,
|
|
"num_tokens": 2104527.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.542181444168091,
|
|
"epoch": 0.06506010036176917,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004983985860282081,
|
|
"loss": 6.4897,
|
|
"mean_token_accuracy": 0.10867034271359444,
|
|
"num_tokens": 2113737.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.457909774780274,
|
|
"epoch": 0.06535184969074571,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004982552163405623,
|
|
"loss": 6.5155,
|
|
"mean_token_accuracy": 0.11161521077156067,
|
|
"num_tokens": 2123517.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.464603519439697,
|
|
"epoch": 0.06564359901972225,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004981057259983839,
|
|
"loss": 6.43,
|
|
"mean_token_accuracy": 0.10833626836538315,
|
|
"num_tokens": 2133389.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.695741128921509,
|
|
"epoch": 0.0659353483486988,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004979501191000262,
|
|
"loss": 6.6258,
|
|
"mean_token_accuracy": 0.1069041796028614,
|
|
"num_tokens": 2142569.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.528357124328613,
|
|
"epoch": 0.06622709767767535,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004977883999115311,
|
|
"loss": 6.4632,
|
|
"mean_token_accuracy": 0.10537031814455985,
|
|
"num_tokens": 2151422.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.430627536773682,
|
|
"epoch": 0.06651884700665188,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004976205728665113,
|
|
"loss": 6.4825,
|
|
"mean_token_accuracy": 0.10998515039682388,
|
|
"num_tokens": 2160696.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.443187093734741,
|
|
"epoch": 0.06681059633562843,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004974466425660307,
|
|
"loss": 6.473,
|
|
"mean_token_accuracy": 0.11025330871343612,
|
|
"num_tokens": 2171333.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.476709651947021,
|
|
"epoch": 0.06710234566460498,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004972666137784759,
|
|
"loss": 6.4448,
|
|
"mean_token_accuracy": 0.11565838381648064,
|
|
"num_tokens": 2180755.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.591566276550293,
|
|
"epoch": 0.06739409499358151,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004970804914394271,
|
|
"loss": 6.5623,
|
|
"mean_token_accuracy": 0.10833770707249642,
|
|
"num_tokens": 2189805.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.487264585494995,
|
|
"epoch": 0.06768584432255806,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004968882806515225,
|
|
"loss": 6.4206,
|
|
"mean_token_accuracy": 0.10597622171044349,
|
|
"num_tokens": 2199696.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.503916501998901,
|
|
"epoch": 0.0679775936515346,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004966899866843177,
|
|
"loss": 6.5065,
|
|
"mean_token_accuracy": 0.11296691745519638,
|
|
"num_tokens": 2210667.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.4775800704956055,
|
|
"epoch": 0.06826934298051114,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000496485614974142,
|
|
"loss": 6.4924,
|
|
"mean_token_accuracy": 0.11328694522380829,
|
|
"num_tokens": 2219517.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.4405846118927,
|
|
"epoch": 0.06856109230948769,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004962751711239492,
|
|
"loss": 6.4377,
|
|
"mean_token_accuracy": 0.10667010024189949,
|
|
"num_tokens": 2228418.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.424973726272583,
|
|
"epoch": 0.06885284163846424,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004960586609031636,
|
|
"loss": 6.4672,
|
|
"mean_token_accuracy": 0.10987688899040222,
|
|
"num_tokens": 2238787.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.491880607604981,
|
|
"epoch": 0.06914459096744077,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004958360902475224,
|
|
"loss": 6.4953,
|
|
"mean_token_accuracy": 0.11162107959389686,
|
|
"num_tokens": 2248750.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.446459341049194,
|
|
"epoch": 0.06943634029641732,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004956074652589125,
|
|
"loss": 6.4687,
|
|
"mean_token_accuracy": 0.11494983360171318,
|
|
"num_tokens": 2258250.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.443336868286133,
|
|
"epoch": 0.06972808962539385,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004953727922052035,
|
|
"loss": 6.4389,
|
|
"mean_token_accuracy": 0.10993985310196877,
|
|
"num_tokens": 2268149.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.5478602886199955,
|
|
"epoch": 0.0700198389543704,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004951320775200756,
|
|
"loss": 6.4572,
|
|
"mean_token_accuracy": 0.11372324377298355,
|
|
"num_tokens": 2276746.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.315929794311524,
|
|
"epoch": 0.07031158828334695,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004948853278028436,
|
|
"loss": 6.3928,
|
|
"mean_token_accuracy": 0.10992860049009323,
|
|
"num_tokens": 2286192.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.42680606842041,
|
|
"epoch": 0.07060333761232349,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004946325498182755,
|
|
"loss": 6.3928,
|
|
"mean_token_accuracy": 0.11117786765098572,
|
|
"num_tokens": 2296087.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.398185729980469,
|
|
"epoch": 0.07089508694130003,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004943737504964076,
|
|
"loss": 6.4682,
|
|
"mean_token_accuracy": 0.10990155264735221,
|
|
"num_tokens": 2306219.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.4592015743255615,
|
|
"epoch": 0.07118683627027658,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000494108936932354,
|
|
"loss": 6.4012,
|
|
"mean_token_accuracy": 0.11408278942108155,
|
|
"num_tokens": 2315171.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.316812133789062,
|
|
"epoch": 0.07147858559925312,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004938381163861124,
|
|
"loss": 6.267,
|
|
"mean_token_accuracy": 0.1170704185962677,
|
|
"num_tokens": 2323791.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.456182384490967,
|
|
"epoch": 0.07177033492822966,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004935612962823645,
|
|
"loss": 6.3477,
|
|
"mean_token_accuracy": 0.11591391935944557,
|
|
"num_tokens": 2333242.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.497243118286133,
|
|
"epoch": 0.07206208425720621,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004932784842102739,
|
|
"loss": 6.4143,
|
|
"mean_token_accuracy": 0.1154218778014183,
|
|
"num_tokens": 2343685.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.377239084243774,
|
|
"epoch": 0.07235383358618275,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004929896879232758,
|
|
"loss": 6.397,
|
|
"mean_token_accuracy": 0.11717568039894104,
|
|
"num_tokens": 2352899.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.3864076137542725,
|
|
"epoch": 0.0726455829151593,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004926949153388668,
|
|
"loss": 6.5139,
|
|
"mean_token_accuracy": 0.11911385580897331,
|
|
"num_tokens": 2362381.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.464845848083496,
|
|
"epoch": 0.07293733224413584,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004923941745383859,
|
|
"loss": 6.3956,
|
|
"mean_token_accuracy": 0.11288046464323997,
|
|
"num_tokens": 2372309.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.503108024597168,
|
|
"epoch": 0.07322908157311238,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000492087473766794,
|
|
"loss": 6.5013,
|
|
"mean_token_accuracy": 0.11466107293963432,
|
|
"num_tokens": 2381236.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.4154833316802975,
|
|
"epoch": 0.07352083090208893,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000491774821432448,
|
|
"loss": 6.4491,
|
|
"mean_token_accuracy": 0.11527864336967468,
|
|
"num_tokens": 2390793.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.414394474029541,
|
|
"epoch": 0.07381258023106547,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.0004914562261068693,
|
|
"loss": 6.3753,
|
|
"mean_token_accuracy": 0.11422505304217338,
|
|
"num_tokens": 2400007.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.423696422576905,
|
|
"epoch": 0.07410432956004201,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004911316965245098,
|
|
"loss": 6.428,
|
|
"mean_token_accuracy": 0.11575796380639077,
|
|
"num_tokens": 2409606.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.41414155960083,
|
|
"epoch": 0.07439607888901856,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000490801241582512,
|
|
"loss": 6.3543,
|
|
"mean_token_accuracy": 0.11173621639609337,
|
|
"num_tokens": 2419074.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.403918361663818,
|
|
"epoch": 0.07468782821799509,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000490464870340465,
|
|
"loss": 6.3939,
|
|
"mean_token_accuracy": 0.11463204845786094,
|
|
"num_tokens": 2428772.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.533142328262329,
|
|
"epoch": 0.07497957754697164,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004901225920201563,
|
|
"loss": 6.5168,
|
|
"mean_token_accuracy": 0.11531570181250572,
|
|
"num_tokens": 2438931.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.282506227493286,
|
|
"epoch": 0.07527132687594819,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000489774416005319,
|
|
"loss": 6.2793,
|
|
"mean_token_accuracy": 0.11793802455067634,
|
|
"num_tokens": 2448339.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.3312074661254885,
|
|
"epoch": 0.07556307620492472,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004894203518413742,
|
|
"loss": 6.3356,
|
|
"mean_token_accuracy": 0.11392701491713524,
|
|
"num_tokens": 2458432.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.3252379417419435,
|
|
"epoch": 0.07585482553390127,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004890604092351701,
|
|
"loss": 6.3885,
|
|
"mean_token_accuracy": 0.11167708337306977,
|
|
"num_tokens": 2468257.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.410771226882934,
|
|
"epoch": 0.07614657486287782,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000488694598054715,
|
|
"loss": 6.3856,
|
|
"mean_token_accuracy": 0.11263055056333542,
|
|
"num_tokens": 2477267.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.425689220428467,
|
|
"epoch": 0.07643832419185435,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004883229283289071,
|
|
"loss": 6.3308,
|
|
"mean_token_accuracy": 0.10780216380953789,
|
|
"num_tokens": 2485952.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.379551649093628,
|
|
"epoch": 0.0767300735208309,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00048794541024725993,
|
|
"loss": 6.4322,
|
|
"mean_token_accuracy": 0.1152675449848175,
|
|
"num_tokens": 2495289.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.50159215927124,
|
|
"epoch": 0.07702182284980745,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004875620541596221,
|
|
"loss": 6.3428,
|
|
"mean_token_accuracy": 0.11285355165600777,
|
|
"num_tokens": 2505304.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.3611382961273195,
|
|
"epoch": 0.07731357217878398,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048717287057589454,
|
|
"loss": 6.3711,
|
|
"mean_token_accuracy": 0.11867863908410073,
|
|
"num_tokens": 2515436.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.414155960083008,
|
|
"epoch": 0.07760532150776053,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004867778701657417,
|
|
"loss": 6.4959,
|
|
"mean_token_accuracy": 0.10673807635903358,
|
|
"num_tokens": 2525195.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.472268724441529,
|
|
"epoch": 0.07789707083673708,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048637706375829955,
|
|
"loss": 6.329,
|
|
"mean_token_accuracy": 0.12044179886579513,
|
|
"num_tokens": 2533900.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.299315404891968,
|
|
"epoch": 0.07818882016571362,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000485970462341878,
|
|
"loss": 6.3818,
|
|
"mean_token_accuracy": 0.11268014311790467,
|
|
"num_tokens": 2543506.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.4526282787323,
|
|
"epoch": 0.07848056949469016,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00048555807706366044,
|
|
"loss": 6.4108,
|
|
"mean_token_accuracy": 0.11387890353798866,
|
|
"num_tokens": 2552899.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.348006105422973,
|
|
"epoch": 0.07877231882366671,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048513991922939756,
|
|
"loss": 6.3313,
|
|
"mean_token_accuracy": 0.11401514112949371,
|
|
"num_tokens": 2563020.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.369770574569702,
|
|
"epoch": 0.07906406815264325,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00048471600030309744,
|
|
"loss": 6.3511,
|
|
"mean_token_accuracy": 0.11567247584462166,
|
|
"num_tokens": 2571784.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.307307720184326,
|
|
"epoch": 0.0793558174816198,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00048428633190671186,
|
|
"loss": 6.3938,
|
|
"mean_token_accuracy": 0.11736602932214737,
|
|
"num_tokens": 2580879.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.45410795211792,
|
|
"epoch": 0.07964756681059633,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004838509258198167,
|
|
"loss": 6.3383,
|
|
"mean_token_accuracy": 0.11524840667843819,
|
|
"num_tokens": 2589398.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 6.316630792617798,
|
|
"epoch": 0.07993931613957288,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00048340979397929,
|
|
"loss": 6.3257,
|
|
"mean_token_accuracy": 0.1217143066227436,
|
|
"num_tokens": 2598446.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.411429595947266,
|
|
"epoch": 0.08023106546854943,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00048296294847898386,
|
|
"loss": 6.4564,
|
|
"mean_token_accuracy": 0.11443509832024575,
|
|
"num_tokens": 2608646.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.5289661407470705,
|
|
"epoch": 0.08052281479752596,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004825104015693934,
|
|
"loss": 6.5233,
|
|
"mean_token_accuracy": 0.10254140794277192,
|
|
"num_tokens": 2619588.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.416348648071289,
|
|
"epoch": 0.08081456412650251,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004820521656573208,
|
|
"loss": 6.3574,
|
|
"mean_token_accuracy": 0.11526949927210808,
|
|
"num_tokens": 2628585.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.382719421386719,
|
|
"epoch": 0.08110631345547906,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00048158825330553505,
|
|
"loss": 6.2697,
|
|
"mean_token_accuracy": 0.12054040431976318,
|
|
"num_tokens": 2636965.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.318143606185913,
|
|
"epoch": 0.08139806278445559,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00048111867723242763,
|
|
"loss": 6.2257,
|
|
"mean_token_accuracy": 0.12370629087090493,
|
|
"num_tokens": 2645926.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.3341890335083,
|
|
"epoch": 0.08168981211343214,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004806434503116637,
|
|
"loss": 6.326,
|
|
"mean_token_accuracy": 0.11409061923623084,
|
|
"num_tokens": 2654566.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.446702146530152,
|
|
"epoch": 0.08198156144240869,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004801625855718296,
|
|
"loss": 6.4087,
|
|
"mean_token_accuracy": 0.11707663610577583,
|
|
"num_tokens": 2663383.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.315024089813233,
|
|
"epoch": 0.08227331077138522,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047967609619607477,
|
|
"loss": 6.2755,
|
|
"mean_token_accuracy": 0.1180037334561348,
|
|
"num_tokens": 2672567.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.357727575302124,
|
|
"epoch": 0.08256506010036177,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004791839955217513,
|
|
"loss": 6.4337,
|
|
"mean_token_accuracy": 0.11114252284169197,
|
|
"num_tokens": 2681966.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.441995429992676,
|
|
"epoch": 0.08285680942933832,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047868629704004786,
|
|
"loss": 6.3481,
|
|
"mean_token_accuracy": 0.11805550679564476,
|
|
"num_tokens": 2690215.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.332686853408814,
|
|
"epoch": 0.08314855875831485,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047818301439561965,
|
|
"loss": 6.393,
|
|
"mean_token_accuracy": 0.11177687272429467,
|
|
"num_tokens": 2700766.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 6.261061716079712,
|
|
"epoch": 0.0834403080872914,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00047767416138621454,
|
|
"loss": 6.2868,
|
|
"mean_token_accuracy": 0.11431297659873962,
|
|
"num_tokens": 2710028.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.5042167663574215,
|
|
"epoch": 0.08373205741626795,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000477159751962295,
|
|
"loss": 6.4711,
|
|
"mean_token_accuracy": 0.11762162894010544,
|
|
"num_tokens": 2720628.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.23676061630249,
|
|
"epoch": 0.08402380674524448,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00047663980022665507,
|
|
"loss": 6.2522,
|
|
"mean_token_accuracy": 0.11971108093857766,
|
|
"num_tokens": 2729826.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.443781185150146,
|
|
"epoch": 0.08431555607422103,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00047611432043403437,
|
|
"loss": 6.4593,
|
|
"mean_token_accuracy": 0.11329575181007386,
|
|
"num_tokens": 2739937.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.39516134262085,
|
|
"epoch": 0.08460730540319757,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004755833269907267,
|
|
"loss": 6.4063,
|
|
"mean_token_accuracy": 0.11360016688704491,
|
|
"num_tokens": 2749542.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.336669158935547,
|
|
"epoch": 0.08489905473217411,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004750468344541857,
|
|
"loss": 6.3085,
|
|
"mean_token_accuracy": 0.12215447798371315,
|
|
"num_tokens": 2759545.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.356807231903076,
|
|
"epoch": 0.08519080406115066,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047450485753262525,
|
|
"loss": 6.3257,
|
|
"mean_token_accuracy": 0.12252013981342316,
|
|
"num_tokens": 2769065.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.375159883499146,
|
|
"epoch": 0.0854825533901272,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047395741108461633,
|
|
"loss": 6.2551,
|
|
"mean_token_accuracy": 0.11856821104884148,
|
|
"num_tokens": 2778608.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 6.184617376327514,
|
|
"epoch": 0.08577430271910375,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00047340451011867985,
|
|
"loss": 6.2887,
|
|
"mean_token_accuracy": 0.12425651028752327,
|
|
"num_tokens": 2787723.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.407329750061035,
|
|
"epoch": 0.0860660520480803,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047284616979287515,
|
|
"loss": 6.2254,
|
|
"mean_token_accuracy": 0.1285393789410591,
|
|
"num_tokens": 2796385.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.187299633026123,
|
|
"epoch": 0.08635780137705683,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047228240541438433,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.12240941449999809,
|
|
"num_tokens": 2805425.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.419047546386719,
|
|
"epoch": 0.08664955070603338,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047171323243909257,
|
|
"loss": 6.4074,
|
|
"mean_token_accuracy": 0.11365959122776985,
|
|
"num_tokens": 2816947.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.266291618347168,
|
|
"epoch": 0.08694130003500992,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00047113866647116457,
|
|
"loss": 6.3063,
|
|
"mean_token_accuracy": 0.12005587667226791,
|
|
"num_tokens": 2826701.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 6.427331399917603,
|
|
"epoch": 0.08723304936398646,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004705587232626164,
|
|
"loss": 6.3071,
|
|
"mean_token_accuracy": 0.1235899992287159,
|
|
"num_tokens": 2836591.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.238853168487549,
|
|
"epoch": 0.08752479869296301,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00046997341871288424,
|
|
"loss": 6.2287,
|
|
"mean_token_accuracy": 0.12085602730512619,
|
|
"num_tokens": 2844624.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.5039948463439945,
|
|
"epoch": 0.08781654802193956,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004693827688683879,
|
|
"loss": 6.3706,
|
|
"mean_token_accuracy": 0.11352829337120056,
|
|
"num_tokens": 2853736.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.2476152896881105,
|
|
"epoch": 0.08810829735091609,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004687867899220914,
|
|
"loss": 6.2534,
|
|
"mean_token_accuracy": 0.11727567315101624,
|
|
"num_tokens": 2863176.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 6.279230070114136,
|
|
"epoch": 0.08840004667989264,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00046818549821305846,
|
|
"loss": 6.2798,
|
|
"mean_token_accuracy": 0.11535517126321793,
|
|
"num_tokens": 2872087.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.298987531661988,
|
|
"epoch": 0.08869179600886919,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00046757891022600494,
|
|
"loss": 6.355,
|
|
"mean_token_accuracy": 0.11613577753305435,
|
|
"num_tokens": 2882916.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.26947922706604,
|
|
"epoch": 0.08898354533784572,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004669670425908471,
|
|
"loss": 6.2438,
|
|
"mean_token_accuracy": 0.12345949336886405,
|
|
"num_tokens": 2893116.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.363525342941284,
|
|
"epoch": 0.08927529466682227,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004663499120822451,
|
|
"loss": 6.3962,
|
|
"mean_token_accuracy": 0.10942287668585778,
|
|
"num_tokens": 2902419.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 6.405201196670532,
|
|
"epoch": 0.0895670439957988,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004657275356191437,
|
|
"loss": 6.2938,
|
|
"mean_token_accuracy": 0.1213503472507,
|
|
"num_tokens": 2911300.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.345795631408691,
|
|
"epoch": 0.08985879332477535,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00046509993026430804,
|
|
"loss": 6.3545,
|
|
"mean_token_accuracy": 0.1187653012573719,
|
|
"num_tokens": 2921190.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.468287611007691,
|
|
"epoch": 0.0901505426537519,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004644671132238558,
|
|
"loss": 6.4109,
|
|
"mean_token_accuracy": 0.11848839297890663,
|
|
"num_tokens": 2931964.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.317207956314087,
|
|
"epoch": 0.09044229198272843,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00046382910184678585,
|
|
"loss": 6.2755,
|
|
"mean_token_accuracy": 0.11598291173577309,
|
|
"num_tokens": 2940780.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 6.33673996925354,
|
|
"epoch": 0.09073404131170498,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004631859136245025,
|
|
"loss": 6.3085,
|
|
"mean_token_accuracy": 0.11326714009046554,
|
|
"num_tokens": 2949537.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.271080875396729,
|
|
"epoch": 0.09102579064068153,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004625375661903357,
|
|
"loss": 6.3005,
|
|
"mean_token_accuracy": 0.12357675582170487,
|
|
"num_tokens": 2959034.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.347681617736816,
|
|
"epoch": 0.09131753996965807,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00046188407731905787,
|
|
"loss": 6.2425,
|
|
"mean_token_accuracy": 0.11625017821788788,
|
|
"num_tokens": 2968480.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.238370418548584,
|
|
"epoch": 0.09160928929863461,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00046122546492639643,
|
|
"loss": 6.2272,
|
|
"mean_token_accuracy": 0.12265427559614181,
|
|
"num_tokens": 2977911.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.211631393432617,
|
|
"epoch": 0.09190103862761116,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000460561747068543,
|
|
"loss": 6.3499,
|
|
"mean_token_accuracy": 0.1291658066213131,
|
|
"num_tokens": 2987139.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.402784824371338,
|
|
"epoch": 0.0921927879565877,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004598929419416578,
|
|
"loss": 6.2812,
|
|
"mean_token_accuracy": 0.12039563283324242,
|
|
"num_tokens": 2996496.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 6.420582628250122,
|
|
"epoch": 0.09248453728556424,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045921906788137123,
|
|
"loss": 6.3001,
|
|
"mean_token_accuracy": 0.11506841331720352,
|
|
"num_tokens": 3005691.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 6.272823667526245,
|
|
"epoch": 0.09277628661454079,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00045854014336228115,
|
|
"loss": 6.3014,
|
|
"mean_token_accuracy": 0.12312400192022324,
|
|
"num_tokens": 3015044.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.450143337249756,
|
|
"epoch": 0.09306803594351733,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045785618699744615,
|
|
"loss": 6.4255,
|
|
"mean_token_accuracy": 0.11360339000821114,
|
|
"num_tokens": 3024195.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.354039144515991,
|
|
"epoch": 0.09335978527249388,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045716721753787543,
|
|
"loss": 6.2459,
|
|
"mean_token_accuracy": 0.11926767155528069,
|
|
"num_tokens": 3033701.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.228268671035766,
|
|
"epoch": 0.09365153460147041,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004564732538720148,
|
|
"loss": 6.2753,
|
|
"mean_token_accuracy": 0.12374345734715461,
|
|
"num_tokens": 3043541.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.303274917602539,
|
|
"epoch": 0.09394328393044696,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045577431502522877,
|
|
"loss": 6.2592,
|
|
"mean_token_accuracy": 0.1281718336045742,
|
|
"num_tokens": 3053489.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.252635860443116,
|
|
"epoch": 0.0942350332594235,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004550704201592787,
|
|
"loss": 6.2725,
|
|
"mean_token_accuracy": 0.12302799075841904,
|
|
"num_tokens": 3062904.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.202295446395874,
|
|
"epoch": 0.09452678258840004,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004543615885717981,
|
|
"loss": 6.0565,
|
|
"mean_token_accuracy": 0.1329715795814991,
|
|
"num_tokens": 3072021.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 6.1748401641845705,
|
|
"epoch": 0.09481853191737659,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00045364783969576296,
|
|
"loss": 6.2428,
|
|
"mean_token_accuracy": 0.11738629788160324,
|
|
"num_tokens": 3082016.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 6.369678926467896,
|
|
"epoch": 0.09511028124635314,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004529291930989592,
|
|
"loss": 6.2417,
|
|
"mean_token_accuracy": 0.12121309861540794,
|
|
"num_tokens": 3091996.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 6.229206562042236,
|
|
"epoch": 0.09540203057532967,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004522056684834464,
|
|
"loss": 6.1711,
|
|
"mean_token_accuracy": 0.12580040022730826,
|
|
"num_tokens": 3101944.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.121789741516113,
|
|
"epoch": 0.09569377990430622,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004514772856850173,
|
|
"loss": 6.1806,
|
|
"mean_token_accuracy": 0.12133874893188476,
|
|
"num_tokens": 3110666.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.4672160148620605,
|
|
"epoch": 0.09598552923328277,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004507440646726542,
|
|
"loss": 6.3902,
|
|
"mean_token_accuracy": 0.11804559379816056,
|
|
"num_tokens": 3120370.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 6.264255619049072,
|
|
"epoch": 0.0962772785622593,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004500060255479818,
|
|
"loss": 6.1807,
|
|
"mean_token_accuracy": 0.12386891469359398,
|
|
"num_tokens": 3130025.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.22208800315857,
|
|
"epoch": 0.09656902789123585,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004492631885447151,
|
|
"loss": 6.2496,
|
|
"mean_token_accuracy": 0.11741102412343025,
|
|
"num_tokens": 3140065.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 6.287959051132202,
|
|
"epoch": 0.0968607772202124,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044851557402810616,
|
|
"loss": 6.3009,
|
|
"mean_token_accuracy": 0.124704909324646,
|
|
"num_tokens": 3148891.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.357010126113892,
|
|
"epoch": 0.09715252654918893,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044776320249438444,
|
|
"loss": 6.2193,
|
|
"mean_token_accuracy": 0.12245449349284172,
|
|
"num_tokens": 3158349.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 6.240838527679443,
|
|
"epoch": 0.09744427587816548,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00044700609457019565,
|
|
"loss": 6.3556,
|
|
"mean_token_accuracy": 0.11844354793429375,
|
|
"num_tokens": 3168214.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 6.300184059143066,
|
|
"epoch": 0.09773602520714203,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004462442710120359,
|
|
"loss": 6.1448,
|
|
"mean_token_accuracy": 0.12163960486650467,
|
|
"num_tokens": 3178119.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.314942026138306,
|
|
"epoch": 0.09802777453611856,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000445477752705683,
|
|
"loss": 6.2403,
|
|
"mean_token_accuracy": 0.12064114734530448,
|
|
"num_tokens": 3187060.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 6.250327491760254,
|
|
"epoch": 0.09831952386509511,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00044470656066562336,
|
|
"loss": 6.3025,
|
|
"mean_token_accuracy": 0.12025051936507225,
|
|
"num_tokens": 3196468.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 6.3662707805633545,
|
|
"epoch": 0.09861127319407165,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004439307160344765,
|
|
"loss": 6.2003,
|
|
"mean_token_accuracy": 0.1232446551322937,
|
|
"num_tokens": 3205009.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.1288464069366455,
|
|
"epoch": 0.0989030225230482,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044315024008241473,
|
|
"loss": 6.1478,
|
|
"mean_token_accuracy": 0.12729258313775063,
|
|
"num_tokens": 3213666.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 6.288136625289917,
|
|
"epoch": 0.09919477185202474,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004423651542065806,
|
|
"loss": 6.1941,
|
|
"mean_token_accuracy": 0.13063909932971002,
|
|
"num_tokens": 3223124.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 6.193147420883179,
|
|
"epoch": 0.09948652118100128,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044157547993050006,
|
|
"loss": 6.2283,
|
|
"mean_token_accuracy": 0.12324749156832696,
|
|
"num_tokens": 3232784.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.303015089035034,
|
|
"epoch": 0.09977827050997783,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044078123890349227,
|
|
"loss": 6.2131,
|
|
"mean_token_accuracy": 0.12409283444285393,
|
|
"num_tokens": 3242296.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 6.229840278625488,
|
|
"epoch": 0.10007001983895437,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00043998245290007606,
|
|
"loss": 6.2414,
|
|
"mean_token_accuracy": 0.12382307648658752,
|
|
"num_tokens": 3251954.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.19064416885376,
|
|
"epoch": 0.10036176916793091,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00043917914381937323,
|
|
"loss": 6.1897,
|
|
"mean_token_accuracy": 0.11765580922365189,
|
|
"num_tokens": 3261115.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.189918899536133,
|
|
"epoch": 0.10065351849690746,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043837133368450815,
|
|
"loss": 6.1931,
|
|
"mean_token_accuracy": 0.12054690048098564,
|
|
"num_tokens": 3269896.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.284554767608642,
|
|
"epoch": 0.100945267825884,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004375590446420037,
|
|
"loss": 6.16,
|
|
"mean_token_accuracy": 0.12517104819417,
|
|
"num_tokens": 3280066.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 6.189452266693115,
|
|
"epoch": 0.10123701715486054,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004367422989611743,
|
|
"loss": 6.1386,
|
|
"mean_token_accuracy": 0.12676257863640786,
|
|
"num_tokens": 3289378.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.276723575592041,
|
|
"epoch": 0.10152876648383709,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004359211190335153,
|
|
"loss": 6.3124,
|
|
"mean_token_accuracy": 0.12249552607536315,
|
|
"num_tokens": 3299529.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 6.3476848125457765,
|
|
"epoch": 0.10182051581281364,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043509552737208923,
|
|
"loss": 6.2807,
|
|
"mean_token_accuracy": 0.1219617947936058,
|
|
"num_tokens": 3308265.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.2723053932189945,
|
|
"epoch": 0.10211226514179017,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00043426554661090853,
|
|
"loss": 6.2029,
|
|
"mean_token_accuracy": 0.12301502600312234,
|
|
"num_tokens": 3318062.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.362277698516846,
|
|
"epoch": 0.10240401447076672,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00043343119950431516,
|
|
"loss": 6.3285,
|
|
"mean_token_accuracy": 0.1206172190606594,
|
|
"num_tokens": 3328561.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 6.213156986236572,
|
|
"epoch": 0.10269576379974327,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00043259250892635644,
|
|
"loss": 6.2485,
|
|
"mean_token_accuracy": 0.12045412585139274,
|
|
"num_tokens": 3338052.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.214480304718018,
|
|
"epoch": 0.1029875131287198,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004317494978701582,
|
|
"loss": 6.1606,
|
|
"mean_token_accuracy": 0.1277881905436516,
|
|
"num_tokens": 3349357.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.226798820495605,
|
|
"epoch": 0.10327926245769635,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004309021894472943,
|
|
"loss": 6.1348,
|
|
"mean_token_accuracy": 0.12920267134904861,
|
|
"num_tokens": 3359030.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 6.139141702651978,
|
|
"epoch": 0.10357101178667288,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004300506068871534,
|
|
"loss": 6.1265,
|
|
"mean_token_accuracy": 0.13153293505311012,
|
|
"num_tokens": 3367702.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.308718204498291,
|
|
"epoch": 0.10386276111564943,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042919477353630135,
|
|
"loss": 6.146,
|
|
"mean_token_accuracy": 0.1294103018939495,
|
|
"num_tokens": 3376626.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 6.128504610061645,
|
|
"epoch": 0.10415451044462598,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000428334712857842,
|
|
"loss": 6.1039,
|
|
"mean_token_accuracy": 0.12742208167910576,
|
|
"num_tokens": 3386301.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.205838346481324,
|
|
"epoch": 0.10444625977360252,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042747044843077304,
|
|
"loss": 6.1932,
|
|
"mean_token_accuracy": 0.12324661612510682,
|
|
"num_tokens": 3396104.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 6.306753921508789,
|
|
"epoch": 0.10473800910257906,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042660200394934047,
|
|
"loss": 6.2169,
|
|
"mean_token_accuracy": 0.12297144085168839,
|
|
"num_tokens": 3405123.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.220966863632202,
|
|
"epoch": 0.10502975843155561,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00042572940322238844,
|
|
"loss": 6.1626,
|
|
"mean_token_accuracy": 0.12484495714306831,
|
|
"num_tokens": 3414967.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.274843978881836,
|
|
"epoch": 0.10532150776053215,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00042485267017270664,
|
|
"loss": 6.3424,
|
|
"mean_token_accuracy": 0.11909266263246536,
|
|
"num_tokens": 3425947.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 6.383258819580078,
|
|
"epoch": 0.1056132570895087,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004239718288363745,
|
|
"loss": 6.2704,
|
|
"mean_token_accuracy": 0.12300543934106827,
|
|
"num_tokens": 3436012.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.266382646560669,
|
|
"epoch": 0.10590500641848524,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004230869033621023,
|
|
"loss": 6.1846,
|
|
"mean_token_accuracy": 0.11848850473761559,
|
|
"num_tokens": 3446474.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.16329665184021,
|
|
"epoch": 0.10619675574746178,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004221979180105688,
|
|
"loss": 6.0963,
|
|
"mean_token_accuracy": 0.13093286454677583,
|
|
"num_tokens": 3455491.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.145866918563843,
|
|
"epoch": 0.10648850507643833,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00042130489715375645,
|
|
"loss": 6.0143,
|
|
"mean_token_accuracy": 0.13937579542398454,
|
|
"num_tokens": 3464418.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 6.21917028427124,
|
|
"epoch": 0.10678025440541487,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042040786527428335,
|
|
"loss": 6.1965,
|
|
"mean_token_accuracy": 0.12161976620554923,
|
|
"num_tokens": 3472877.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.186547470092774,
|
|
"epoch": 0.10707200373439141,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004195068469647315,
|
|
"loss": 6.1542,
|
|
"mean_token_accuracy": 0.12836315035820006,
|
|
"num_tokens": 3483037.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.19683837890625,
|
|
"epoch": 0.10736375306336796,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.00041860186692697297,
|
|
"loss": 6.083,
|
|
"mean_token_accuracy": 0.1275312103331089,
|
|
"num_tokens": 3492873.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.1625336647033695,
|
|
"epoch": 0.1076555023923445,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041769294997149264,
|
|
"loss": 6.2381,
|
|
"mean_token_accuracy": 0.12316666096448899,
|
|
"num_tokens": 3501842.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 6.2700042724609375,
|
|
"epoch": 0.10794725172132104,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004167801210167081,
|
|
"loss": 6.1544,
|
|
"mean_token_accuracy": 0.12415701374411584,
|
|
"num_tokens": 3510415.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.35073299407959,
|
|
"epoch": 0.10823900105029759,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004158634050882861,
|
|
"loss": 6.3202,
|
|
"mean_token_accuracy": 0.11843622103333473,
|
|
"num_tokens": 3521437.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 6.284471845626831,
|
|
"epoch": 0.10853075037927412,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004149428273184569,
|
|
"loss": 6.2712,
|
|
"mean_token_accuracy": 0.12350925728678704,
|
|
"num_tokens": 3531733.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.20415997505188,
|
|
"epoch": 0.10882249970825067,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004140184129453253,
|
|
"loss": 6.0453,
|
|
"mean_token_accuracy": 0.13318468108773232,
|
|
"num_tokens": 3540724.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.169241571426392,
|
|
"epoch": 0.10911424903722722,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000413090187312178,
|
|
"loss": 6.1824,
|
|
"mean_token_accuracy": 0.1301153838634491,
|
|
"num_tokens": 3551015.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.233869838714599,
|
|
"epoch": 0.10940599836620375,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004121581758667898,
|
|
"loss": 6.2521,
|
|
"mean_token_accuracy": 0.1265456885099411,
|
|
"num_tokens": 3560526.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.1837160110473635,
|
|
"epoch": 0.1096977476951803,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00041122240416072533,
|
|
"loss": 6.1241,
|
|
"mean_token_accuracy": 0.12862038388848304,
|
|
"num_tokens": 3569966.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 6.278997421264648,
|
|
"epoch": 0.10998949702415685,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004102828978486385,
|
|
"loss": 6.111,
|
|
"mean_token_accuracy": 0.12866452112793922,
|
|
"num_tokens": 3579061.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.257272148132325,
|
|
"epoch": 0.11028124635313338,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004093396826875695,
|
|
"loss": 6.1377,
|
|
"mean_token_accuracy": 0.12756876572966575,
|
|
"num_tokens": 3587633.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 6.2344451427459715,
|
|
"epoch": 0.11057299568210993,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00040839278453623837,
|
|
"loss": 6.0465,
|
|
"mean_token_accuracy": 0.13229672834277154,
|
|
"num_tokens": 3597136.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.11575870513916,
|
|
"epoch": 0.11086474501108648,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004074422293543363,
|
|
"loss": 6.0951,
|
|
"mean_token_accuracy": 0.12402657866477966,
|
|
"num_tokens": 3605948.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.241190814971924,
|
|
"epoch": 0.11115649434006301,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004064880432018137,
|
|
"loss": 6.2258,
|
|
"mean_token_accuracy": 0.12266718074679375,
|
|
"num_tokens": 3615620.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.2283697605133055,
|
|
"epoch": 0.11144824366903956,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040553025223816615,
|
|
"loss": 6.1949,
|
|
"mean_token_accuracy": 0.1251465432345867,
|
|
"num_tokens": 3624624.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.229434013366699,
|
|
"epoch": 0.11173999299801611,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00040456888272171653,
|
|
"loss": 6.2181,
|
|
"mean_token_accuracy": 0.12829322069883348,
|
|
"num_tokens": 3634574.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.126652479171753,
|
|
"epoch": 0.11203174232699264,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00040360396100889577,
|
|
"loss": 6.0134,
|
|
"mean_token_accuracy": 0.1284105472266674,
|
|
"num_tokens": 3643991.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 6.069678211212159,
|
|
"epoch": 0.1123234916559692,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004026355135535202,
|
|
"loss": 6.0424,
|
|
"mean_token_accuracy": 0.134358549118042,
|
|
"num_tokens": 3652069.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.215138530731201,
|
|
"epoch": 0.11261524098494574,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000401663566906066,
|
|
"loss": 6.2137,
|
|
"mean_token_accuracy": 0.12257095649838448,
|
|
"num_tokens": 3662227.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 6.292611455917358,
|
|
"epoch": 0.11290699031392228,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00040068814771294134,
|
|
"loss": 6.1373,
|
|
"mean_token_accuracy": 0.13084000647068023,
|
|
"num_tokens": 3671511.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.098296356201172,
|
|
"epoch": 0.11319873964289882,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003997092827157562,
|
|
"loss": 6.1175,
|
|
"mean_token_accuracy": 0.13061317726969718,
|
|
"num_tokens": 3680063.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 6.218745851516724,
|
|
"epoch": 0.11349048897187536,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000398726998750589,
|
|
"loss": 6.1272,
|
|
"mean_token_accuracy": 0.12958021759986876,
|
|
"num_tokens": 3689299.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.187112522125244,
|
|
"epoch": 0.1137822383008519,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00039774132274725076,
|
|
"loss": 6.1287,
|
|
"mean_token_accuracy": 0.1283968210220337,
|
|
"num_tokens": 3698071.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 6.100534152984619,
|
|
"epoch": 0.11407398762982845,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00039675228172854707,
|
|
"loss": 6.0399,
|
|
"mean_token_accuracy": 0.12726911306381225,
|
|
"num_tokens": 3706773.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.179676485061646,
|
|
"epoch": 0.11436573695880499,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003957599028095371,
|
|
"loss": 6.0878,
|
|
"mean_token_accuracy": 0.12605519965291023,
|
|
"num_tokens": 3716814.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 6.254482316970825,
|
|
"epoch": 0.11465748628778154,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039476421319679017,
|
|
"loss": 6.1327,
|
|
"mean_token_accuracy": 0.12759872823953627,
|
|
"num_tokens": 3725596.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.121477890014648,
|
|
"epoch": 0.11494923561675809,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039376524018764,
|
|
"loss": 6.0897,
|
|
"mean_token_accuracy": 0.13351815789937974,
|
|
"num_tokens": 3734996.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.22856559753418,
|
|
"epoch": 0.11524098494573462,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039276301116943616,
|
|
"loss": 6.1254,
|
|
"mean_token_accuracy": 0.12725835070014,
|
|
"num_tokens": 3744109.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.288533735275268,
|
|
"epoch": 0.11553273427471117,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003917575536187936,
|
|
"loss": 6.1903,
|
|
"mean_token_accuracy": 0.11792054921388626,
|
|
"num_tokens": 3754416.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.226859855651855,
|
|
"epoch": 0.11582448360368772,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00039074889510083894,
|
|
"loss": 6.2235,
|
|
"mean_token_accuracy": 0.11969063058495522,
|
|
"num_tokens": 3764401.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.328698396682739,
|
|
"epoch": 0.11611623293266425,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038973706326845495,
|
|
"loss": 6.2422,
|
|
"mean_token_accuracy": 0.12645296901464462,
|
|
"num_tokens": 3774098.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.225485849380493,
|
|
"epoch": 0.1164079822616408,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003887220858615225,
|
|
"loss": 6.2042,
|
|
"mean_token_accuracy": 0.1278956189751625,
|
|
"num_tokens": 3783569.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 6.185959148406982,
|
|
"epoch": 0.11669973159061735,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0003877039907061597,
|
|
"loss": 6.051,
|
|
"mean_token_accuracy": 0.11998816132545471,
|
|
"num_tokens": 3793898.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.1757483959198,
|
|
"epoch": 0.11699148091959388,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.0003866828057139598,
|
|
"loss": 6.184,
|
|
"mean_token_accuracy": 0.12747337818145751,
|
|
"num_tokens": 3803847.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.097095108032226,
|
|
"epoch": 0.11728323024857043,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00038565855888122503,
|
|
"loss": 5.9902,
|
|
"mean_token_accuracy": 0.14047103226184846,
|
|
"num_tokens": 3812421.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.1024925231933596,
|
|
"epoch": 0.11757497957754696,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00038463127828819975,
|
|
"loss": 6.1063,
|
|
"mean_token_accuracy": 0.1260400377213955,
|
|
"num_tokens": 3821897.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.344009780883789,
|
|
"epoch": 0.11786672890652351,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00038360099209830043,
|
|
"loss": 6.2277,
|
|
"mean_token_accuracy": 0.1214868538081646,
|
|
"num_tokens": 3831207.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.1543212890625,
|
|
"epoch": 0.11815847823550006,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003825677285573433,
|
|
"loss": 5.9863,
|
|
"mean_token_accuracy": 0.14326240345835686,
|
|
"num_tokens": 3840590.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.025796031951904,
|
|
"epoch": 0.1184502275644766,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038153151599277027,
|
|
"loss": 6.0514,
|
|
"mean_token_accuracy": 0.13036804422736167,
|
|
"num_tokens": 3850600.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.169336032867432,
|
|
"epoch": 0.11874197689345314,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003804923828128723,
|
|
"loss": 6.092,
|
|
"mean_token_accuracy": 0.1290174663066864,
|
|
"num_tokens": 3860191.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.159327983856201,
|
|
"epoch": 0.11903372622242969,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003794503575060104,
|
|
"loss": 6.0568,
|
|
"mean_token_accuracy": 0.13136546462774276,
|
|
"num_tokens": 3869471.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.1873383045196535,
|
|
"epoch": 0.11932547555140623,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00037840546863983484,
|
|
"loss": 6.2054,
|
|
"mean_token_accuracy": 0.1257386215031147,
|
|
"num_tokens": 3878813.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 6.143853998184204,
|
|
"epoch": 0.11961722488038277,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003773577448605015,
|
|
"loss": 6.0548,
|
|
"mean_token_accuracy": 0.1329750269651413,
|
|
"num_tokens": 3887857.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.135542106628418,
|
|
"epoch": 0.11990897420935932,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003763072148918872,
|
|
"loss": 6.0346,
|
|
"mean_token_accuracy": 0.12965454980731012,
|
|
"num_tokens": 3896674.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.12315263748169,
|
|
"epoch": 0.12020072353833586,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003752539075348017,
|
|
"loss": 6.0583,
|
|
"mean_token_accuracy": 0.13050565123558044,
|
|
"num_tokens": 3907043.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.1918113231658936,
|
|
"epoch": 0.1204924728673124,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00037419785166619817,
|
|
"loss": 6.0715,
|
|
"mean_token_accuracy": 0.13669336065649987,
|
|
"num_tokens": 3916464.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 6.082077074050903,
|
|
"epoch": 0.12078422219628895,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003731390762383818,
|
|
"loss": 5.9847,
|
|
"mean_token_accuracy": 0.1324693463742733,
|
|
"num_tokens": 3925314.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 6.234340381622315,
|
|
"epoch": 0.12107597152526549,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003720776102782158,
|
|
"loss": 6.1491,
|
|
"mean_token_accuracy": 0.13121804893016814,
|
|
"num_tokens": 3935483.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 6.205264520645142,
|
|
"epoch": 0.12136772085424204,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00037101348288632555,
|
|
"loss": 6.0325,
|
|
"mean_token_accuracy": 0.12864793166518212,
|
|
"num_tokens": 3945680.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.145557498931884,
|
|
"epoch": 0.12165947018321858,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003699467232363012,
|
|
"loss": 6.1068,
|
|
"mean_token_accuracy": 0.13312529623508454,
|
|
"num_tokens": 3955050.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 6.220155525207519,
|
|
"epoch": 0.12195121951219512,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0003688773605738973,
|
|
"loss": 6.1739,
|
|
"mean_token_accuracy": 0.12807397097349166,
|
|
"num_tokens": 3965137.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 6.205538082122803,
|
|
"epoch": 0.12224296884117167,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00036780542421623134,
|
|
"loss": 6.0811,
|
|
"mean_token_accuracy": 0.1324646107852459,
|
|
"num_tokens": 3974321.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 6.14320821762085,
|
|
"epoch": 0.1225347181701482,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0003667309435509802,
|
|
"loss": 5.9899,
|
|
"mean_token_accuracy": 0.13220726251602172,
|
|
"num_tokens": 3983585.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.185551595687866,
|
|
"epoch": 0.12282646749912475,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0003656539480355741,
|
|
"loss": 6.0992,
|
|
"mean_token_accuracy": 0.13207164481282235,
|
|
"num_tokens": 3993244.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.090251731872558,
|
|
"epoch": 0.1231182168281013,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003645744671963891,
|
|
"loss": 5.9719,
|
|
"mean_token_accuracy": 0.13249791339039801,
|
|
"num_tokens": 4001809.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 5.980392408370972,
|
|
"epoch": 0.12340996615707783,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003634925306279376,
|
|
"loss": 6.0348,
|
|
"mean_token_accuracy": 0.1358187809586525,
|
|
"num_tokens": 4010544.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.2454461574554445,
|
|
"epoch": 0.12370171548605438,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0003624081679920574,
|
|
"loss": 6.1575,
|
|
"mean_token_accuracy": 0.12497098445892334,
|
|
"num_tokens": 4020652.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 6.19257550239563,
|
|
"epoch": 0.12399346481503093,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003613214090170977,
|
|
"loss": 6.1815,
|
|
"mean_token_accuracy": 0.1306192584335804,
|
|
"num_tokens": 4029292.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.063637828826904,
|
|
"epoch": 0.12428521414400746,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003602322834971048,
|
|
"loss": 6.0053,
|
|
"mean_token_accuracy": 0.13113986626267432,
|
|
"num_tokens": 4038962.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.1634547233581545,
|
|
"epoch": 0.12457696347298401,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003591408212910051,
|
|
"loss": 6.0119,
|
|
"mean_token_accuracy": 0.1333060897886753,
|
|
"num_tokens": 4048099.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.054674100875855,
|
|
"epoch": 0.12486871280196056,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003580470523217863,
|
|
"loss": 6.0573,
|
|
"mean_token_accuracy": 0.13094019517302513,
|
|
"num_tokens": 4057178.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 6.151257133483886,
|
|
"epoch": 0.1251604621309371,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003569510065756771,
|
|
"loss": 6.1344,
|
|
"mean_token_accuracy": 0.13510328382253647,
|
|
"num_tokens": 4066942.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 6.162200164794922,
|
|
"epoch": 0.12545221145991364,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0003558527141013254,
|
|
"loss": 6.0538,
|
|
"mean_token_accuracy": 0.13089121207594873,
|
|
"num_tokens": 4076996.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.204866743087768,
|
|
"epoch": 0.1257439607888902,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003547522050089742,
|
|
"loss": 6.1049,
|
|
"mean_token_accuracy": 0.1330699637532234,
|
|
"num_tokens": 4085914.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.158906650543213,
|
|
"epoch": 0.12603571011786674,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00035364950946963606,
|
|
"loss": 5.9965,
|
|
"mean_token_accuracy": 0.13708881437778472,
|
|
"num_tokens": 4095338.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.146380472183227,
|
|
"epoch": 0.12632745944684326,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003525446577142663,
|
|
"loss": 6.0579,
|
|
"mean_token_accuracy": 0.12941342294216157,
|
|
"num_tokens": 4103479.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.203834438323975,
|
|
"epoch": 0.1266192087758198,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00035143768003293395,
|
|
"loss": 6.1182,
|
|
"mean_token_accuracy": 0.1333833985030651,
|
|
"num_tokens": 4112916.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.124022054672241,
|
|
"epoch": 0.12691095810479636,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003503286067739913,
|
|
"loss": 5.9385,
|
|
"mean_token_accuracy": 0.13590933308005332,
|
|
"num_tokens": 4121888.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.10663537979126,
|
|
"epoch": 0.1272027074337729,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00034921746834324193,
|
|
"loss": 6.0631,
|
|
"mean_token_accuracy": 0.1324682280421257,
|
|
"num_tokens": 4130890.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 6.162923336029053,
|
|
"epoch": 0.12749445676274945,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003481042952031072,
|
|
"loss": 6.0507,
|
|
"mean_token_accuracy": 0.1312302142381668,
|
|
"num_tokens": 4140444.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 6.046947240829468,
|
|
"epoch": 0.127786206091726,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003469891178717911,
|
|
"loss": 5.9898,
|
|
"mean_token_accuracy": 0.12995862513780593,
|
|
"num_tokens": 4150167.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.1181951522827145,
|
|
"epoch": 0.12807795542070252,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003458719669224436,
|
|
"loss": 5.998,
|
|
"mean_token_accuracy": 0.1331616722047329,
|
|
"num_tokens": 4159057.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 6.236394929885864,
|
|
"epoch": 0.12836970474967907,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0003447528729823221,
|
|
"loss": 6.1961,
|
|
"mean_token_accuracy": 0.12343473508954048,
|
|
"num_tokens": 4170300.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.111977624893188,
|
|
"epoch": 0.12866145407865562,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003436318667319525,
|
|
"loss": 6.0592,
|
|
"mean_token_accuracy": 0.13006481528282166,
|
|
"num_tokens": 4179023.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.138869905471802,
|
|
"epoch": 0.12895320340763217,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00034250897890428716,
|
|
"loss": 6.0127,
|
|
"mean_token_accuracy": 0.13645198419690133,
|
|
"num_tokens": 4187930.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.11465425491333,
|
|
"epoch": 0.12924495273660871,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003413842402838633,
|
|
"loss": 5.9816,
|
|
"mean_token_accuracy": 0.13514165207743645,
|
|
"num_tokens": 4196863.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.159387445449829,
|
|
"epoch": 0.12953670206558526,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00034025768170595834,
|
|
"loss": 6.0554,
|
|
"mean_token_accuracy": 0.133841223269701,
|
|
"num_tokens": 4206446.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.110213375091552,
|
|
"epoch": 0.12982845139456178,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003391293340557446,
|
|
"loss": 6.0419,
|
|
"mean_token_accuracy": 0.13170824572443962,
|
|
"num_tokens": 4215390.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.143122148513794,
|
|
"epoch": 0.13012020072353833,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0003379992282674431,
|
|
"loss": 5.9628,
|
|
"mean_token_accuracy": 0.1296013280749321,
|
|
"num_tokens": 4224549.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.032369470596313,
|
|
"epoch": 0.13041195005251488,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0003368673953234749,
|
|
"loss": 6.0248,
|
|
"mean_token_accuracy": 0.13395655602216722,
|
|
"num_tokens": 4234911.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 6.108939552307129,
|
|
"epoch": 0.13070369938149143,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00033573386625361176,
|
|
"loss": 5.9833,
|
|
"mean_token_accuracy": 0.1381675697863102,
|
|
"num_tokens": 4244084.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.152256298065185,
|
|
"epoch": 0.13099544871046798,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00033459867213412567,
|
|
"loss": 6.0867,
|
|
"mean_token_accuracy": 0.1329598158597946,
|
|
"num_tokens": 4253102.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 6.228173685073853,
|
|
"epoch": 0.1312871980394445,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000333461844086937,
|
|
"loss": 6.1341,
|
|
"mean_token_accuracy": 0.12330343350768089,
|
|
"num_tokens": 4263220.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 6.15165696144104,
|
|
"epoch": 0.13157894736842105,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00033232341327876097,
|
|
"loss": 6.0217,
|
|
"mean_token_accuracy": 0.13015433102846147,
|
|
"num_tokens": 4272951.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.0193620204925535,
|
|
"epoch": 0.1318706966973976,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003311834109202531,
|
|
"loss": 5.9992,
|
|
"mean_token_accuracy": 0.12776204496622084,
|
|
"num_tokens": 4282920.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.203376007080078,
|
|
"epoch": 0.13216244602637414,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00033004186826515416,
|
|
"loss": 6.144,
|
|
"mean_token_accuracy": 0.13627443239092826,
|
|
"num_tokens": 4293307.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.149167823791504,
|
|
"epoch": 0.1324541953553507,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003288988166094324,
|
|
"loss": 6.0379,
|
|
"mean_token_accuracy": 0.13878687396645545,
|
|
"num_tokens": 4303345.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.014406394958496,
|
|
"epoch": 0.13274594468432724,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00032775428729042656,
|
|
"loss": 5.9448,
|
|
"mean_token_accuracy": 0.13974148780107498,
|
|
"num_tokens": 4312466.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.043557357788086,
|
|
"epoch": 0.13303769401330376,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000326608311685986,
|
|
"loss": 5.918,
|
|
"mean_token_accuracy": 0.13819573670625687,
|
|
"num_tokens": 4321922.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 6.043844318389892,
|
|
"epoch": 0.1333294433422803,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003254609212136108,
|
|
"loss": 6.0421,
|
|
"mean_token_accuracy": 0.13316982761025428,
|
|
"num_tokens": 4332861.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 6.0816281795501705,
|
|
"epoch": 0.13362119267125686,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00032431214732959036,
|
|
"loss": 5.941,
|
|
"mean_token_accuracy": 0.13233345076441766,
|
|
"num_tokens": 4342538.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.050484228134155,
|
|
"epoch": 0.1339129420002334,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000323162021528141,
|
|
"loss": 5.9245,
|
|
"mean_token_accuracy": 0.1377279981970787,
|
|
"num_tokens": 4351725.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.128743600845337,
|
|
"epoch": 0.13420469132920995,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00032201057534054264,
|
|
"loss": 5.9753,
|
|
"mean_token_accuracy": 0.1378311976790428,
|
|
"num_tokens": 4360279.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 6.107240343093872,
|
|
"epoch": 0.13449644065818647,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00032085784033427414,
|
|
"loss": 6.0398,
|
|
"mean_token_accuracy": 0.13199200704693795,
|
|
"num_tokens": 4370121.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.114462852478027,
|
|
"epoch": 0.13478818998716302,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003197038481121478,
|
|
"loss": 6.052,
|
|
"mean_token_accuracy": 0.12872423157095908,
|
|
"num_tokens": 4379801.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 6.113399362564087,
|
|
"epoch": 0.13507993931613957,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0003185486303114436,
|
|
"loss": 6.0406,
|
|
"mean_token_accuracy": 0.12906918823719024,
|
|
"num_tokens": 4389542.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 6.191231679916382,
|
|
"epoch": 0.13537168864511612,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003173922186030409,
|
|
"loss": 6.2285,
|
|
"mean_token_accuracy": 0.12242957651615143,
|
|
"num_tokens": 4399704.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.161467218399048,
|
|
"epoch": 0.13566343797409267,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000316234644690551,
|
|
"loss": 5.9699,
|
|
"mean_token_accuracy": 0.13790022283792497,
|
|
"num_tokens": 4408884.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.051607608795166,
|
|
"epoch": 0.1359551873030692,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003150759403094473,
|
|
"loss": 5.9478,
|
|
"mean_token_accuracy": 0.1472274973988533,
|
|
"num_tokens": 4418539.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.120077419281006,
|
|
"epoch": 0.13624693663204573,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00031391613722619587,
|
|
"loss": 5.8789,
|
|
"mean_token_accuracy": 0.13548571541905402,
|
|
"num_tokens": 4428364.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 5.988148164749146,
|
|
"epoch": 0.13653868596102228,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.000312755267237384,
|
|
"loss": 6.0086,
|
|
"mean_token_accuracy": 0.13620148003101348,
|
|
"num_tokens": 4437597.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.115688276290894,
|
|
"epoch": 0.13683043528999883,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0003115933621688488,
|
|
"loss": 6.1011,
|
|
"mean_token_accuracy": 0.1336211532354355,
|
|
"num_tokens": 4448633.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.210470676422119,
|
|
"epoch": 0.13712218461897538,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00031043045387480487,
|
|
"loss": 5.9385,
|
|
"mean_token_accuracy": 0.13692572787404061,
|
|
"num_tokens": 4458200.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 6.055985021591186,
|
|
"epoch": 0.13741393394795193,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003092665742369703,
|
|
"loss": 5.9568,
|
|
"mean_token_accuracy": 0.13043170794844627,
|
|
"num_tokens": 4467758.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.099366617202759,
|
|
"epoch": 0.13770568327692848,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00030810175516369343,
|
|
"loss": 5.962,
|
|
"mean_token_accuracy": 0.1362786166369915,
|
|
"num_tokens": 4477446.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 6.1166033267974855,
|
|
"epoch": 0.137997432605905,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003069360285890775,
|
|
"loss": 6.0527,
|
|
"mean_token_accuracy": 0.12857796847820283,
|
|
"num_tokens": 4486754.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 6.072907209396362,
|
|
"epoch": 0.13828918193488154,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00030576942647210547,
|
|
"loss": 6.0746,
|
|
"mean_token_accuracy": 0.13448990508913994,
|
|
"num_tokens": 4495841.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 6.1608072280883786,
|
|
"epoch": 0.1385809312638581,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00030460198079576355,
|
|
"loss": 6.0425,
|
|
"mean_token_accuracy": 0.1289051041007042,
|
|
"num_tokens": 4506373.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.127575874328613,
|
|
"epoch": 0.13887268059283464,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003034337235661648,
|
|
"loss": 6.0468,
|
|
"mean_token_accuracy": 0.13214912116527558,
|
|
"num_tokens": 4515843.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 6.090031909942627,
|
|
"epoch": 0.1391644299218112,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003022646868116714,
|
|
"loss": 5.9924,
|
|
"mean_token_accuracy": 0.13868472278118132,
|
|
"num_tokens": 4525216.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.175815439224243,
|
|
"epoch": 0.1394561792507877,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003010949025820163,
|
|
"loss": 6.0182,
|
|
"mean_token_accuracy": 0.13675328269600867,
|
|
"num_tokens": 4534691.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 6.1263453483581545,
|
|
"epoch": 0.13974792857976426,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0002999244029474252,
|
|
"loss": 6.0589,
|
|
"mean_token_accuracy": 0.12986232116818427,
|
|
"num_tokens": 4545428.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 6.090114164352417,
|
|
"epoch": 0.1400396779087408,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00029875321999773684,
|
|
"loss": 5.9025,
|
|
"mean_token_accuracy": 0.1333586908876896,
|
|
"num_tokens": 4554173.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 6.063518381118774,
|
|
"epoch": 0.14033142723771735,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00029758138584152333,
|
|
"loss": 6.0331,
|
|
"mean_token_accuracy": 0.12861537262797357,
|
|
"num_tokens": 4564085.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 6.133324050903321,
|
|
"epoch": 0.1406231765666939,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002964089326052102,
|
|
"loss": 6.0132,
|
|
"mean_token_accuracy": 0.1282704494893551,
|
|
"num_tokens": 4573763.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.088792705535889,
|
|
"epoch": 0.14091492589567045,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002952358924321949,
|
|
"loss": 6.0044,
|
|
"mean_token_accuracy": 0.13971484899520875,
|
|
"num_tokens": 4583062.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 6.160576200485229,
|
|
"epoch": 0.14120667522464697,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00029406229748196657,
|
|
"loss": 6.0049,
|
|
"mean_token_accuracy": 0.1300945073366165,
|
|
"num_tokens": 4592247.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 6.049785470962524,
|
|
"epoch": 0.14149842455362352,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0002928881799292235,
|
|
"loss": 5.9297,
|
|
"mean_token_accuracy": 0.13601833581924438,
|
|
"num_tokens": 4601862.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 6.123089218139649,
|
|
"epoch": 0.14179017388260007,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00029171357196299154,
|
|
"loss": 5.9442,
|
|
"mean_token_accuracy": 0.14178707599639892,
|
|
"num_tokens": 4610613.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 6.128375244140625,
|
|
"epoch": 0.14208192321157662,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0002905385057857414,
|
|
"loss": 6.0802,
|
|
"mean_token_accuracy": 0.1361641526222229,
|
|
"num_tokens": 4621557.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.056922101974488,
|
|
"epoch": 0.14237367254055316,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002893630136125058,
|
|
"loss": 6.0376,
|
|
"mean_token_accuracy": 0.12935881689190865,
|
|
"num_tokens": 4631111.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 6.109204339981079,
|
|
"epoch": 0.1426654218695297,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0002881871276699967,
|
|
"loss": 6.0496,
|
|
"mean_token_accuracy": 0.13275820761919022,
|
|
"num_tokens": 4640753.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 6.178110218048095,
|
|
"epoch": 0.14295717119850623,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00028701088019572114,
|
|
"loss": 6.0044,
|
|
"mean_token_accuracy": 0.1331684447824955,
|
|
"num_tokens": 4651226.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 6.040668582916259,
|
|
"epoch": 0.14324892052748278,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0002858343034370977,
|
|
"loss": 5.9114,
|
|
"mean_token_accuracy": 0.13811235800385474,
|
|
"num_tokens": 4661303.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 6.034663486480713,
|
|
"epoch": 0.14354066985645933,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00028465742965057267,
|
|
"loss": 6.0288,
|
|
"mean_token_accuracy": 0.13574993163347243,
|
|
"num_tokens": 4670380.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 6.162771701812744,
|
|
"epoch": 0.14383241918543588,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00028348029110073533,
|
|
"loss": 6.0914,
|
|
"mean_token_accuracy": 0.13298429995775224,
|
|
"num_tokens": 4680219.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 6.1167665958404545,
|
|
"epoch": 0.14412416851441243,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00028230292005943365,
|
|
"loss": 5.9838,
|
|
"mean_token_accuracy": 0.13663672134280205,
|
|
"num_tokens": 4689667.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 6.099624300003052,
|
|
"epoch": 0.14441591784338895,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00028112534880488945,
|
|
"loss": 5.9561,
|
|
"mean_token_accuracy": 0.1408042088150978,
|
|
"num_tokens": 4698801.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 6.209147024154663,
|
|
"epoch": 0.1447076671723655,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0002799476096208137,
|
|
"loss": 6.1095,
|
|
"mean_token_accuracy": 0.12842155173420905,
|
|
"num_tokens": 4709398.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 6.107708263397217,
|
|
"epoch": 0.14499941650134204,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00027876973479552087,
|
|
"loss": 5.9758,
|
|
"mean_token_accuracy": 0.1377686306834221,
|
|
"num_tokens": 4718082.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 6.053830575942993,
|
|
"epoch": 0.1452911658303186,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00027759175662104424,
|
|
"loss": 5.973,
|
|
"mean_token_accuracy": 0.13549438789486884,
|
|
"num_tokens": 4728122.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 6.171555519104004,
|
|
"epoch": 0.14558291515929514,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002764137073922508,
|
|
"loss": 6.0576,
|
|
"mean_token_accuracy": 0.13965055495500564,
|
|
"num_tokens": 4738078.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.111799240112305,
|
|
"epoch": 0.1458746644882717,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00027523561940595505,
|
|
"loss": 5.9423,
|
|
"mean_token_accuracy": 0.13925925344228746,
|
|
"num_tokens": 4747132.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 6.114526176452637,
|
|
"epoch": 0.1461664138172482,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0002740575249600342,
|
|
"loss": 5.9618,
|
|
"mean_token_accuracy": 0.14162555187940598,
|
|
"num_tokens": 4756392.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 5.990750360488891,
|
|
"epoch": 0.14645816314622476,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00027287945635254263,
|
|
"loss": 5.9853,
|
|
"mean_token_accuracy": 0.13961677849292756,
|
|
"num_tokens": 4765492.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 6.10812292098999,
|
|
"epoch": 0.1467499124752013,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00027170144588082635,
|
|
"loss": 6.0067,
|
|
"mean_token_accuracy": 0.13272907435894013,
|
|
"num_tokens": 4774635.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 6.110986614227295,
|
|
"epoch": 0.14704166180417785,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00027052352584063763,
|
|
"loss": 5.9091,
|
|
"mean_token_accuracy": 0.14452143907546997,
|
|
"num_tokens": 4784542.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 6.097382688522339,
|
|
"epoch": 0.1473334111331544,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00026934572852524907,
|
|
"loss": 5.9974,
|
|
"mean_token_accuracy": 0.13697264865040779,
|
|
"num_tokens": 4793245.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 6.0698380947113035,
|
|
"epoch": 0.14762516046213095,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00026816808622456937,
|
|
"loss": 5.8884,
|
|
"mean_token_accuracy": 0.14629276543855668,
|
|
"num_tokens": 4801576.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 6.065158843994141,
|
|
"epoch": 0.14791690979110747,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002669906312242569,
|
|
"loss": 5.9188,
|
|
"mean_token_accuracy": 0.14538922160863876,
|
|
"num_tokens": 4809742.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 6.059357643127441,
|
|
"epoch": 0.14820865912008402,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00026581339580483525,
|
|
"loss": 5.9825,
|
|
"mean_token_accuracy": 0.14246814250946044,
|
|
"num_tokens": 4820110.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 6.152837419509888,
|
|
"epoch": 0.14850040844906057,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002646364122408082,
|
|
"loss": 5.9469,
|
|
"mean_token_accuracy": 0.14219153597950934,
|
|
"num_tokens": 4828843.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 6.047616100311279,
|
|
"epoch": 0.14879215777803712,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0002634597127997749,
|
|
"loss": 5.9368,
|
|
"mean_token_accuracy": 0.14226388707756996,
|
|
"num_tokens": 4838835.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 6.015814018249512,
|
|
"epoch": 0.14908390710701366,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0002622833297415445,
|
|
"loss": 5.8561,
|
|
"mean_token_accuracy": 0.13575126305222512,
|
|
"num_tokens": 4848055.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 6.080614185333252,
|
|
"epoch": 0.14937565643599018,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002611072953172531,
|
|
"loss": 5.931,
|
|
"mean_token_accuracy": 0.13824644461274146,
|
|
"num_tokens": 4857564.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.9679922580719,
|
|
"epoch": 0.14966740576496673,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00025993164176847845,
|
|
"loss": 5.8316,
|
|
"mean_token_accuracy": 0.14536818563938142,
|
|
"num_tokens": 4865841.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 5.9873395442962645,
|
|
"epoch": 0.14995915509394328,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002587564013263564,
|
|
"loss": 5.9094,
|
|
"mean_token_accuracy": 0.1428757280111313,
|
|
"num_tokens": 4874967.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 6.153641319274902,
|
|
"epoch": 0.15025090442291983,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002575816062106974,
|
|
"loss": 5.9139,
|
|
"mean_token_accuracy": 0.1396403469145298,
|
|
"num_tokens": 4883439.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 6.063961839675903,
|
|
"epoch": 0.15054265375189638,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00025640728862910293,
|
|
"loss": 5.9448,
|
|
"mean_token_accuracy": 0.13880855590105057,
|
|
"num_tokens": 4892694.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 6.055100393295288,
|
|
"epoch": 0.15083440308087293,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00025523348077608285,
|
|
"loss": 5.897,
|
|
"mean_token_accuracy": 0.1369130827486515,
|
|
"num_tokens": 4901388.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 6.080492448806763,
|
|
"epoch": 0.15112615240984945,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00025406021483217225,
|
|
"loss": 5.9181,
|
|
"mean_token_accuracy": 0.14280352666974067,
|
|
"num_tokens": 4911348.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 6.0501851558685305,
|
|
"epoch": 0.151417901738826,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00025288752296304963,
|
|
"loss": 5.8717,
|
|
"mean_token_accuracy": 0.13778910115361215,
|
|
"num_tokens": 4920844.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 5.984165191650391,
|
|
"epoch": 0.15170965106780254,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000251715437318655,
|
|
"loss": 5.8849,
|
|
"mean_token_accuracy": 0.1374461717903614,
|
|
"num_tokens": 4930052.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 6.111906480789185,
|
|
"epoch": 0.1520014003967791,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002505439900323084,
|
|
"loss": 5.9468,
|
|
"mean_token_accuracy": 0.14332334846258163,
|
|
"num_tokens": 4939166.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.058598613739013,
|
|
"epoch": 0.15229314972575564,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00024937321321982894,
|
|
"loss": 5.9688,
|
|
"mean_token_accuracy": 0.13846543580293655,
|
|
"num_tokens": 4948334.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 6.12415075302124,
|
|
"epoch": 0.1525848990547322,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00024820313897865433,
|
|
"loss": 6.0144,
|
|
"mean_token_accuracy": 0.1384118027985096,
|
|
"num_tokens": 4958245.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.115054178237915,
|
|
"epoch": 0.1528766483837087,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00024703379938696105,
|
|
"loss": 5.9209,
|
|
"mean_token_accuracy": 0.13665172830224037,
|
|
"num_tokens": 4967708.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 6.010182428359985,
|
|
"epoch": 0.15316839771268526,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00024586522650278447,
|
|
"loss": 5.98,
|
|
"mean_token_accuracy": 0.13535310477018356,
|
|
"num_tokens": 4976727.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 5.934082746505737,
|
|
"epoch": 0.1534601470416618,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00024469745236314064,
|
|
"loss": 5.8608,
|
|
"mean_token_accuracy": 0.14374621510505675,
|
|
"num_tokens": 4985599.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 6.145913887023926,
|
|
"epoch": 0.15375189637063835,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00024353050898314767,
|
|
"loss": 5.9841,
|
|
"mean_token_accuracy": 0.138478884100914,
|
|
"num_tokens": 4995934.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 6.10263876914978,
|
|
"epoch": 0.1540436456996149,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00024236442835514743,
|
|
"loss": 5.9324,
|
|
"mean_token_accuracy": 0.1366652801632881,
|
|
"num_tokens": 5005590.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 5.94466609954834,
|
|
"epoch": 0.15433539502859142,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00024119924244782965,
|
|
"loss": 5.8964,
|
|
"mean_token_accuracy": 0.13653595745563507,
|
|
"num_tokens": 5015453.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 6.07912244796753,
|
|
"epoch": 0.15462714435756797,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00024003498320535462,
|
|
"loss": 5.9804,
|
|
"mean_token_accuracy": 0.14280492663383484,
|
|
"num_tokens": 5025136.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 6.05559515953064,
|
|
"epoch": 0.15491889368654452,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00023887168254647727,
|
|
"loss": 5.8736,
|
|
"mean_token_accuracy": 0.13317790552973746,
|
|
"num_tokens": 5034838.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 6.057173538208008,
|
|
"epoch": 0.15521064301552107,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00023770937236367308,
|
|
"loss": 5.8705,
|
|
"mean_token_accuracy": 0.1401037745177746,
|
|
"num_tokens": 5044970.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 6.178555107116699,
|
|
"epoch": 0.15550239234449761,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00023654808452226278,
|
|
"loss": 6.0939,
|
|
"mean_token_accuracy": 0.13883488550782203,
|
|
"num_tokens": 5054945.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 6.067953443527221,
|
|
"epoch": 0.15579414167347416,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00023538785085953912,
|
|
"loss": 5.8947,
|
|
"mean_token_accuracy": 0.13750653117895126,
|
|
"num_tokens": 5064588.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 6.067738580703735,
|
|
"epoch": 0.15608589100245068,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00023422870318389404,
|
|
"loss": 5.941,
|
|
"mean_token_accuracy": 0.13957893401384353,
|
|
"num_tokens": 5074924.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 6.013417530059814,
|
|
"epoch": 0.15637764033142723,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0002330706732739468,
|
|
"loss": 5.8744,
|
|
"mean_token_accuracy": 0.14573107957839965,
|
|
"num_tokens": 5083601.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 6.001936149597168,
|
|
"epoch": 0.15666938966040378,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00023191379287767211,
|
|
"loss": 5.8342,
|
|
"mean_token_accuracy": 0.1469048775732517,
|
|
"num_tokens": 5093500.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 6.06051721572876,
|
|
"epoch": 0.15696113898938033,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0002307580937115305,
|
|
"loss": 5.7508,
|
|
"mean_token_accuracy": 0.1494755744934082,
|
|
"num_tokens": 5102178.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 5.993919372558594,
|
|
"epoch": 0.15725288831835688,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00022960360745959846,
|
|
"loss": 5.8858,
|
|
"mean_token_accuracy": 0.14383454471826554,
|
|
"num_tokens": 5110999.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 6.09775972366333,
|
|
"epoch": 0.15754463764733342,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00022845036577269972,
|
|
"loss": 6.0099,
|
|
"mean_token_accuracy": 0.1328982025384903,
|
|
"num_tokens": 5120623.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 6.1089558601379395,
|
|
"epoch": 0.15783638697630994,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00022729840026753777,
|
|
"loss": 5.9253,
|
|
"mean_token_accuracy": 0.1386694572865963,
|
|
"num_tokens": 5129671.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 6.073097181320191,
|
|
"epoch": 0.1581281363052865,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0002261477425258287,
|
|
"loss": 5.8923,
|
|
"mean_token_accuracy": 0.14483443424105644,
|
|
"num_tokens": 5138614.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 6.124736642837524,
|
|
"epoch": 0.15841988563426304,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0002249984240934358,
|
|
"loss": 5.9174,
|
|
"mean_token_accuracy": 0.14498594552278518,
|
|
"num_tokens": 5148351.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 6.035539150238037,
|
|
"epoch": 0.1587116349632396,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00022385047647950464,
|
|
"loss": 5.8949,
|
|
"mean_token_accuracy": 0.13273870199918747,
|
|
"num_tokens": 5158592.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 6.073336935043335,
|
|
"epoch": 0.15900338429221614,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002227039311555986,
|
|
"loss": 5.8747,
|
|
"mean_token_accuracy": 0.14133515432476998,
|
|
"num_tokens": 5167383.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 6.112156391143799,
|
|
"epoch": 0.15929513362119266,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0002215588195548372,
|
|
"loss": 6.0548,
|
|
"mean_token_accuracy": 0.1266437642276287,
|
|
"num_tokens": 5177192.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 6.092114686965942,
|
|
"epoch": 0.1595868829501692,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00022041517307103337,
|
|
"loss": 5.9684,
|
|
"mean_token_accuracy": 0.13050038665533065,
|
|
"num_tokens": 5187890.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 6.140649461746216,
|
|
"epoch": 0.15987863227914575,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0002192730230578331,
|
|
"loss": 6.0046,
|
|
"mean_token_accuracy": 0.13416488394141196,
|
|
"num_tokens": 5197571.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 6.050485706329345,
|
|
"epoch": 0.1601703816081223,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002181324008278559,
|
|
"loss": 5.9753,
|
|
"mean_token_accuracy": 0.13092653825879097,
|
|
"num_tokens": 5206923.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 6.1053454875946045,
|
|
"epoch": 0.16046213093709885,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00021699333765183655,
|
|
"loss": 5.9261,
|
|
"mean_token_accuracy": 0.14082997888326645,
|
|
"num_tokens": 5216567.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 6.00426607131958,
|
|
"epoch": 0.1607538802660754,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0002158558647577673,
|
|
"loss": 5.8069,
|
|
"mean_token_accuracy": 0.14154668897390366,
|
|
"num_tokens": 5225862.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 6.000382614135742,
|
|
"epoch": 0.16104562959505192,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00021472001333004215,
|
|
"loss": 5.9596,
|
|
"mean_token_accuracy": 0.13876780420541762,
|
|
"num_tokens": 5235919.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 6.104824113845825,
|
|
"epoch": 0.16133737892402847,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00021358581450860186,
|
|
"loss": 5.8815,
|
|
"mean_token_accuracy": 0.1419053629040718,
|
|
"num_tokens": 5245125.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 5.9989981174469,
|
|
"epoch": 0.16162912825300502,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0002124532993880799,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.15449366718530655,
|
|
"num_tokens": 5254341.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.942910671234131,
|
|
"epoch": 0.16192087758198156,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00021132249901695044,
|
|
"loss": 5.8397,
|
|
"mean_token_accuracy": 0.14861955791711806,
|
|
"num_tokens": 5263470.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 6.055013132095337,
|
|
"epoch": 0.1622126269109581,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00021019344439667705,
|
|
"loss": 5.9507,
|
|
"mean_token_accuracy": 0.1320488780736923,
|
|
"num_tokens": 5273425.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 6.076160669326782,
|
|
"epoch": 0.16250437623993466,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00020906616648086213,
|
|
"loss": 6.0262,
|
|
"mean_token_accuracy": 0.14037303403019905,
|
|
"num_tokens": 5282530.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 6.019495344161987,
|
|
"epoch": 0.16279612556891118,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00020794069617439942,
|
|
"loss": 5.8767,
|
|
"mean_token_accuracy": 0.14658062309026718,
|
|
"num_tokens": 5290997.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 6.0506243228912355,
|
|
"epoch": 0.16308787489788773,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00020681706433262593,
|
|
"loss": 5.9504,
|
|
"mean_token_accuracy": 0.13620981499552726,
|
|
"num_tokens": 5301781.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 6.093423652648926,
|
|
"epoch": 0.16337962422686428,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00020569530176047602,
|
|
"loss": 5.8574,
|
|
"mean_token_accuracy": 0.14253985211253167,
|
|
"num_tokens": 5311256.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 6.068989706039429,
|
|
"epoch": 0.16367137355584083,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002045754392116374,
|
|
"loss": 5.9108,
|
|
"mean_token_accuracy": 0.13667885661125184,
|
|
"num_tokens": 5320458.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.997001647949219,
|
|
"epoch": 0.16396312288481737,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00020345750738770757,
|
|
"loss": 5.8018,
|
|
"mean_token_accuracy": 0.1458800107240677,
|
|
"num_tokens": 5330411.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 6.098129320144653,
|
|
"epoch": 0.1642548722137939,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00020234153693735214,
|
|
"loss": 5.9696,
|
|
"mean_token_accuracy": 0.12953805774450303,
|
|
"num_tokens": 5340911.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 6.080776023864746,
|
|
"epoch": 0.16454662154277044,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002012275584554647,
|
|
"loss": 5.8799,
|
|
"mean_token_accuracy": 0.14661106169223787,
|
|
"num_tokens": 5350608.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 6.045346450805664,
|
|
"epoch": 0.164838370871747,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00020011560248232803,
|
|
"loss": 5.9228,
|
|
"mean_token_accuracy": 0.13775852844119071,
|
|
"num_tokens": 5359929.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 6.088241815567017,
|
|
"epoch": 0.16513012020072354,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00019900569950277692,
|
|
"loss": 5.8719,
|
|
"mean_token_accuracy": 0.14300134778022766,
|
|
"num_tokens": 5369025.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.926961278915405,
|
|
"epoch": 0.1654218695297001,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00019789787994536228,
|
|
"loss": 5.7771,
|
|
"mean_token_accuracy": 0.1498278111219406,
|
|
"num_tokens": 5378260.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.974400472640991,
|
|
"epoch": 0.16571361885867664,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00019679217418151667,
|
|
"loss": 5.8522,
|
|
"mean_token_accuracy": 0.143273513764143,
|
|
"num_tokens": 5387524.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 6.0697774410247805,
|
|
"epoch": 0.16600536818765316,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00019568861252472236,
|
|
"loss": 5.8223,
|
|
"mean_token_accuracy": 0.15310993790626526,
|
|
"num_tokens": 5396495.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 6.030423736572265,
|
|
"epoch": 0.1662971175166297,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00019458722522967952,
|
|
"loss": 5.9322,
|
|
"mean_token_accuracy": 0.1452712744474411,
|
|
"num_tokens": 5406624.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.970934820175171,
|
|
"epoch": 0.16658886684560625,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00019348804249147723,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.13966285288333893,
|
|
"num_tokens": 5415738.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 6.051425218582153,
|
|
"epoch": 0.1668806161745828,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0001923910944447655,
|
|
"loss": 5.8702,
|
|
"mean_token_accuracy": 0.1442988932132721,
|
|
"num_tokens": 5424469.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 6.093666505813599,
|
|
"epoch": 0.16717236550355935,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00019129641116292928,
|
|
"loss": 5.8642,
|
|
"mean_token_accuracy": 0.14960020035505295,
|
|
"num_tokens": 5433989.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 5.988446140289307,
|
|
"epoch": 0.1674641148325359,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00019020402265726343,
|
|
"loss": 5.8997,
|
|
"mean_token_accuracy": 0.13471955358982085,
|
|
"num_tokens": 5444470.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 6.030282115936279,
|
|
"epoch": 0.16775586416151242,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001891139588761509,
|
|
"loss": 5.8569,
|
|
"mean_token_accuracy": 0.15230374932289123,
|
|
"num_tokens": 5452888.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 6.032169675827026,
|
|
"epoch": 0.16804761349048897,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00018802624970424076,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.15015550553798676,
|
|
"num_tokens": 5462238.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 5.957490491867065,
|
|
"epoch": 0.16833936281946552,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00018694092496162945,
|
|
"loss": 5.8234,
|
|
"mean_token_accuracy": 0.14722683280706406,
|
|
"num_tokens": 5471677.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.960818767547607,
|
|
"epoch": 0.16863111214844206,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00018585801440304306,
|
|
"loss": 5.7365,
|
|
"mean_token_accuracy": 0.14228329360485076,
|
|
"num_tokens": 5480410.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 6.09484372138977,
|
|
"epoch": 0.1689228614774186,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00018477754771702165,
|
|
"loss": 6.0165,
|
|
"mean_token_accuracy": 0.13433389142155647,
|
|
"num_tokens": 5489073.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 6.085838413238525,
|
|
"epoch": 0.16921461080639513,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00018369955452510506,
|
|
"loss": 5.9362,
|
|
"mean_token_accuracy": 0.1429956153035164,
|
|
"num_tokens": 5499075.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 6.072705221176148,
|
|
"epoch": 0.16950636013537168,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001826240643810212,
|
|
"loss": 5.9514,
|
|
"mean_token_accuracy": 0.14289605990052223,
|
|
"num_tokens": 5509280.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 6.048653411865234,
|
|
"epoch": 0.16979810946434823,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0001815511067698758,
|
|
"loss": 5.8695,
|
|
"mean_token_accuracy": 0.13732953518629074,
|
|
"num_tokens": 5518750.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 6.091159248352051,
|
|
"epoch": 0.17008985879332478,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001804807111073436,
|
|
"loss": 5.8803,
|
|
"mean_token_accuracy": 0.14374977126717567,
|
|
"num_tokens": 5528443.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 6.060678482055664,
|
|
"epoch": 0.17038160812230133,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001794129067388625,
|
|
"loss": 5.8407,
|
|
"mean_token_accuracy": 0.1465306468307972,
|
|
"num_tokens": 5537646.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 6.0398924350738525,
|
|
"epoch": 0.17067335745127787,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00017834772293882868,
|
|
"loss": 5.8269,
|
|
"mean_token_accuracy": 0.1500069558620453,
|
|
"num_tokens": 5547027.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 6.058400297164917,
|
|
"epoch": 0.1709651067802544,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000177285188909794,
|
|
"loss": 5.911,
|
|
"mean_token_accuracy": 0.14219145476818085,
|
|
"num_tokens": 5556645.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 5.983715200424195,
|
|
"epoch": 0.17125685610923094,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0001762253337816656,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.14482296258211136,
|
|
"num_tokens": 5566266.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.9874872207641605,
|
|
"epoch": 0.1715486054382075,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00017516818661090738,
|
|
"loss": 5.7831,
|
|
"mean_token_accuracy": 0.15274099111557007,
|
|
"num_tokens": 5575715.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 6.064141082763672,
|
|
"epoch": 0.17184035476718404,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0001741137763797428,
|
|
"loss": 5.9109,
|
|
"mean_token_accuracy": 0.14370758086442947,
|
|
"num_tokens": 5584311.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 6.031230497360229,
|
|
"epoch": 0.1721321040961606,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00017306213199536115,
|
|
"loss": 5.8661,
|
|
"mean_token_accuracy": 0.1443212330341339,
|
|
"num_tokens": 5594110.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 6.044523668289185,
|
|
"epoch": 0.17242385342513714,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0001720132822891243,
|
|
"loss": 5.8734,
|
|
"mean_token_accuracy": 0.14023427292704582,
|
|
"num_tokens": 5603266.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 6.053596162796021,
|
|
"epoch": 0.17271560275411366,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0001709672560157769,
|
|
"loss": 5.8288,
|
|
"mean_token_accuracy": 0.14189991652965545,
|
|
"num_tokens": 5613105.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 6.043732070922852,
|
|
"epoch": 0.1730073520830902,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00016992408185265758,
|
|
"loss": 5.8523,
|
|
"mean_token_accuracy": 0.13648542538285255,
|
|
"num_tokens": 5621862.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 6.057532119750976,
|
|
"epoch": 0.17329910141206675,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00016888378839891298,
|
|
"loss": 5.8793,
|
|
"mean_token_accuracy": 0.14230196923017502,
|
|
"num_tokens": 5630564.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 6.163407611846924,
|
|
"epoch": 0.1735908507410433,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001678464041747137,
|
|
"loss": 6.0071,
|
|
"mean_token_accuracy": 0.1394879087805748,
|
|
"num_tokens": 5641429.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 6.146255159378052,
|
|
"epoch": 0.17388260007001985,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00016681195762047223,
|
|
"loss": 6.1251,
|
|
"mean_token_accuracy": 0.1400466650724411,
|
|
"num_tokens": 5651239.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 6.05663537979126,
|
|
"epoch": 0.17417434939899637,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00016578047709606337,
|
|
"loss": 5.7851,
|
|
"mean_token_accuracy": 0.14893259853124619,
|
|
"num_tokens": 5659848.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 6.0152841091156,
|
|
"epoch": 0.17446609872797292,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00016475199088004678,
|
|
"loss": 5.824,
|
|
"mean_token_accuracy": 0.14212177693843842,
|
|
"num_tokens": 5668767.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 6.074228811264038,
|
|
"epoch": 0.17475784805694947,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00016372652716889163,
|
|
"loss": 5.9407,
|
|
"mean_token_accuracy": 0.14109326303005218,
|
|
"num_tokens": 5679053.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 6.091854429244995,
|
|
"epoch": 0.17504959738592601,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0001627041140762035,
|
|
"loss": 5.9487,
|
|
"mean_token_accuracy": 0.14340727925300598,
|
|
"num_tokens": 5689187.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 6.02516450881958,
|
|
"epoch": 0.17534134671490256,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00016168477963195382,
|
|
"loss": 5.8758,
|
|
"mean_token_accuracy": 0.14070967882871627,
|
|
"num_tokens": 5698734.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.9925124168396,
|
|
"epoch": 0.1756330960438791,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001606685517817114,
|
|
"loss": 5.7817,
|
|
"mean_token_accuracy": 0.1497592642903328,
|
|
"num_tokens": 5707973.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 6.099816417694091,
|
|
"epoch": 0.17592484537285563,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00015965545838587592,
|
|
"loss": 5.9015,
|
|
"mean_token_accuracy": 0.14399924650788307,
|
|
"num_tokens": 5717249.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 6.099091672897339,
|
|
"epoch": 0.17621659470183218,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00015864552721891467,
|
|
"loss": 5.9035,
|
|
"mean_token_accuracy": 0.14050639271736146,
|
|
"num_tokens": 5726805.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.99184627532959,
|
|
"epoch": 0.17650834403080873,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00015763878596860076,
|
|
"loss": 5.7529,
|
|
"mean_token_accuracy": 0.1491460382938385,
|
|
"num_tokens": 5736630.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.975418043136597,
|
|
"epoch": 0.17680009335978528,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00015663526223525412,
|
|
"loss": 5.7542,
|
|
"mean_token_accuracy": 0.15545722842216492,
|
|
"num_tokens": 5745242.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 5.954189682006836,
|
|
"epoch": 0.17709184268876182,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0001556349835309848,
|
|
"loss": 5.8014,
|
|
"mean_token_accuracy": 0.1462449960410595,
|
|
"num_tokens": 5753922.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 5.968493795394897,
|
|
"epoch": 0.17738359201773837,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001546379772789389,
|
|
"loss": 5.7891,
|
|
"mean_token_accuracy": 0.15272758081555365,
|
|
"num_tokens": 5762707.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 6.023804187774658,
|
|
"epoch": 0.1776753413467149,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00015364427081254622,
|
|
"loss": 5.7894,
|
|
"mean_token_accuracy": 0.14391943216323852,
|
|
"num_tokens": 5771097.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.978334379196167,
|
|
"epoch": 0.17796709067569144,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00015265389137477165,
|
|
"loss": 5.7455,
|
|
"mean_token_accuracy": 0.14973681718111037,
|
|
"num_tokens": 5780174.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.9704385757446286,
|
|
"epoch": 0.178258840004668,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00015166686611736786,
|
|
"loss": 5.7537,
|
|
"mean_token_accuracy": 0.15162822529673575,
|
|
"num_tokens": 5789892.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.96152925491333,
|
|
"epoch": 0.17855058933364454,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00015068322210013064,
|
|
"loss": 5.8333,
|
|
"mean_token_accuracy": 0.1415206417441368,
|
|
"num_tokens": 5799455.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 6.005349397659302,
|
|
"epoch": 0.1788423386626211,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0001497029862901578,
|
|
"loss": 5.8161,
|
|
"mean_token_accuracy": 0.14739941880106927,
|
|
"num_tokens": 5809463.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 6.042494630813598,
|
|
"epoch": 0.1791340879915976,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00014872618556110905,
|
|
"loss": 5.8541,
|
|
"mean_token_accuracy": 0.14737959057092667,
|
|
"num_tokens": 5818748.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 6.0722551345825195,
|
|
"epoch": 0.17942583732057416,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00014775284669246992,
|
|
"loss": 5.9485,
|
|
"mean_token_accuracy": 0.13710509315133096,
|
|
"num_tokens": 5829372.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 6.006622838973999,
|
|
"epoch": 0.1797175866495507,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00014678299636881716,
|
|
"loss": 5.8821,
|
|
"mean_token_accuracy": 0.14796946346759796,
|
|
"num_tokens": 5838378.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 6.108114290237427,
|
|
"epoch": 0.18000933597852725,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001458166611790873,
|
|
"loss": 5.8244,
|
|
"mean_token_accuracy": 0.144808778911829,
|
|
"num_tokens": 5847906.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 6.038421726226806,
|
|
"epoch": 0.1803010853075038,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00014485386761584773,
|
|
"loss": 5.8383,
|
|
"mean_token_accuracy": 0.15223936140537261,
|
|
"num_tokens": 5857376.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.983425664901733,
|
|
"epoch": 0.18059283463648035,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00014389464207457042,
|
|
"loss": 5.7844,
|
|
"mean_token_accuracy": 0.14692209884524346,
|
|
"num_tokens": 5866023.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.9774548530578615,
|
|
"epoch": 0.18088458396545687,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00014293901085290795,
|
|
"loss": 5.7973,
|
|
"mean_token_accuracy": 0.15078192874789237,
|
|
"num_tokens": 5874760.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 6.052274465560913,
|
|
"epoch": 0.18117633329443342,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00014198700014997307,
|
|
"loss": 5.8402,
|
|
"mean_token_accuracy": 0.1384495586156845,
|
|
"num_tokens": 5884447.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 6.070935583114624,
|
|
"epoch": 0.18146808262340997,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00014103863606562016,
|
|
"loss": 5.8932,
|
|
"mean_token_accuracy": 0.14012136086821556,
|
|
"num_tokens": 5893946.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 6.109254503250122,
|
|
"epoch": 0.1817598319523865,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00014009394459972964,
|
|
"loss": 5.8622,
|
|
"mean_token_accuracy": 0.1455635294318199,
|
|
"num_tokens": 5904156.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 6.0265435695648195,
|
|
"epoch": 0.18205158128136306,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00013915295165149513,
|
|
"loss": 5.8428,
|
|
"mean_token_accuracy": 0.14050188437104225,
|
|
"num_tokens": 5914448.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 6.048342943191528,
|
|
"epoch": 0.18234333061033958,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00013821568301871384,
|
|
"loss": 5.8582,
|
|
"mean_token_accuracy": 0.1453532099723816,
|
|
"num_tokens": 5923253.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 6.107166433334351,
|
|
"epoch": 0.18263507993931613,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00013728216439707862,
|
|
"loss": 5.969,
|
|
"mean_token_accuracy": 0.13862533569335939,
|
|
"num_tokens": 5934203.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 6.0502711772918705,
|
|
"epoch": 0.18292682926829268,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00013635242137947419,
|
|
"loss": 5.7832,
|
|
"mean_token_accuracy": 0.14052993506193162,
|
|
"num_tokens": 5943563.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 6.046486949920654,
|
|
"epoch": 0.18321857859726923,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00013542647945527498,
|
|
"loss": 5.7763,
|
|
"mean_token_accuracy": 0.14566850811243057,
|
|
"num_tokens": 5952326.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 6.027577304840088,
|
|
"epoch": 0.18351032792624578,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001345043640096465,
|
|
"loss": 5.8018,
|
|
"mean_token_accuracy": 0.1487163707613945,
|
|
"num_tokens": 5960685.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 6.027203559875488,
|
|
"epoch": 0.18380207725522232,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00013358610032284957,
|
|
"loss": 5.8645,
|
|
"mean_token_accuracy": 0.14441141933202745,
|
|
"num_tokens": 5969578.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 6.0214639663696286,
|
|
"epoch": 0.18409382658419884,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000132671713569547,
|
|
"loss": 5.8087,
|
|
"mean_token_accuracy": 0.14720762223005296,
|
|
"num_tokens": 5979078.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.99518461227417,
|
|
"epoch": 0.1843855759131754,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0001317612288181136,
|
|
"loss": 5.7306,
|
|
"mean_token_accuracy": 0.14671053886413574,
|
|
"num_tokens": 5987339.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 6.054168748855591,
|
|
"epoch": 0.18467732524215194,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00013085467102994864,
|
|
"loss": 5.9245,
|
|
"mean_token_accuracy": 0.13285436555743219,
|
|
"num_tokens": 5996644.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.983382701873779,
|
|
"epoch": 0.1849690745711285,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00012995206505879198,
|
|
"loss": 5.7638,
|
|
"mean_token_accuracy": 0.14887403547763825,
|
|
"num_tokens": 6006589.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 6.073369979858398,
|
|
"epoch": 0.18526082390010504,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0001290534356500421,
|
|
"loss": 5.9001,
|
|
"mean_token_accuracy": 0.14178058207035066,
|
|
"num_tokens": 6017686.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 6.034123802185059,
|
|
"epoch": 0.18555257322908159,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00012815880744007827,
|
|
"loss": 5.8147,
|
|
"mean_token_accuracy": 0.1489768370985985,
|
|
"num_tokens": 6026926.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 6.0084474086761475,
|
|
"epoch": 0.1858443225580581,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00012726820495558483,
|
|
"loss": 5.8351,
|
|
"mean_token_accuracy": 0.14621465504169465,
|
|
"num_tokens": 6036215.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 6.043627595901489,
|
|
"epoch": 0.18613607188703465,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00012638165261287868,
|
|
"loss": 5.895,
|
|
"mean_token_accuracy": 0.13720616325736046,
|
|
"num_tokens": 6046646.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 6.0334556102752686,
|
|
"epoch": 0.1864278212160112,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0001254991747172402,
|
|
"loss": 5.859,
|
|
"mean_token_accuracy": 0.1422436058521271,
|
|
"num_tokens": 6056356.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 6.0882158279418945,
|
|
"epoch": 0.18671957054498775,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00012462079546224662,
|
|
"loss": 5.9605,
|
|
"mean_token_accuracy": 0.13735582083463668,
|
|
"num_tokens": 6066171.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 6.127131700515747,
|
|
"epoch": 0.1870113198739643,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00012374653892910896,
|
|
"loss": 5.9618,
|
|
"mean_token_accuracy": 0.13869085684418678,
|
|
"num_tokens": 6076134.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 6.066506671905517,
|
|
"epoch": 0.18730306920294082,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00012287642908601166,
|
|
"loss": 5.8695,
|
|
"mean_token_accuracy": 0.14080614671111108,
|
|
"num_tokens": 6085655.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 6.004119443893432,
|
|
"epoch": 0.18759481853191737,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00012201048978745569,
|
|
"loss": 5.7836,
|
|
"mean_token_accuracy": 0.15067180544137954,
|
|
"num_tokens": 6095534.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.975229740142822,
|
|
"epoch": 0.18788656786089392,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00012114874477360427,
|
|
"loss": 5.6741,
|
|
"mean_token_accuracy": 0.15083765164017676,
|
|
"num_tokens": 6105446.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 6.024548292160034,
|
|
"epoch": 0.18817831718987046,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00012029121766963236,
|
|
"loss": 5.852,
|
|
"mean_token_accuracy": 0.14232656136155128,
|
|
"num_tokens": 6114329.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 6.063687324523926,
|
|
"epoch": 0.188470066518847,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00011943793198507858,
|
|
"loss": 5.9867,
|
|
"mean_token_accuracy": 0.14078133851289748,
|
|
"num_tokens": 6124499.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 6.112341117858887,
|
|
"epoch": 0.18876181584782356,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00011858891111320104,
|
|
"loss": 5.9022,
|
|
"mean_token_accuracy": 0.14912804067134858,
|
|
"num_tokens": 6134244.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 6.057030248641968,
|
|
"epoch": 0.18905356517680008,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0001177441783303359,
|
|
"loss": 5.8263,
|
|
"mean_token_accuracy": 0.14374455586075782,
|
|
"num_tokens": 6143986.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 6.063595247268677,
|
|
"epoch": 0.18934531450577663,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00011690375679525896,
|
|
"loss": 5.8653,
|
|
"mean_token_accuracy": 0.14139487594366074,
|
|
"num_tokens": 6154000.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 6.10469913482666,
|
|
"epoch": 0.18963706383475318,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00011606766954855124,
|
|
"loss": 5.9498,
|
|
"mean_token_accuracy": 0.14461109340190886,
|
|
"num_tokens": 6164124.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 6.0605292320251465,
|
|
"epoch": 0.18992881316372973,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00011523593951196702,
|
|
"loss": 5.9517,
|
|
"mean_token_accuracy": 0.13643277883529664,
|
|
"num_tokens": 6174544.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.970968961715698,
|
|
"epoch": 0.19022056249270627,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00011440858948780523,
|
|
"loss": 5.8331,
|
|
"mean_token_accuracy": 0.1437767818570137,
|
|
"num_tokens": 6183565.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 6.050106859207153,
|
|
"epoch": 0.19051231182168282,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00011358564215828484,
|
|
"loss": 5.8628,
|
|
"mean_token_accuracy": 0.14146824181079865,
|
|
"num_tokens": 6192760.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 6.030937051773071,
|
|
"epoch": 0.19080406115065934,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00011276712008492254,
|
|
"loss": 5.7681,
|
|
"mean_token_accuracy": 0.15233838111162185,
|
|
"num_tokens": 6202028.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 6.030918979644776,
|
|
"epoch": 0.1910958104796359,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00011195304570791451,
|
|
"loss": 5.9659,
|
|
"mean_token_accuracy": 0.13026049807667733,
|
|
"num_tokens": 6212352.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 6.053281974792481,
|
|
"epoch": 0.19138755980861244,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00011114344134552094,
|
|
"loss": 5.9872,
|
|
"mean_token_accuracy": 0.1329122707247734,
|
|
"num_tokens": 6222957.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 6.07804765701294,
|
|
"epoch": 0.191679309137589,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001103383291934545,
|
|
"loss": 5.8702,
|
|
"mean_token_accuracy": 0.1487218275666237,
|
|
"num_tokens": 6232536.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 6.007486772537232,
|
|
"epoch": 0.19197105846656554,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00010953773132427141,
|
|
"loss": 5.6614,
|
|
"mean_token_accuracy": 0.1479742519557476,
|
|
"num_tokens": 6241219.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 6.003913068771363,
|
|
"epoch": 0.19226280779554206,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00010874166968676677,
|
|
"loss": 5.8031,
|
|
"mean_token_accuracy": 0.15177005529403687,
|
|
"num_tokens": 6250918.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.995495986938477,
|
|
"epoch": 0.1925545571245186,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00010795016610537251,
|
|
"loss": 5.8024,
|
|
"mean_token_accuracy": 0.14557328820228577,
|
|
"num_tokens": 6259687.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 6.014154577255249,
|
|
"epoch": 0.19284630645349515,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00010716324227955904,
|
|
"loss": 5.7672,
|
|
"mean_token_accuracy": 0.14368901997804642,
|
|
"num_tokens": 6269836.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.981515645980835,
|
|
"epoch": 0.1931380557824717,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0001063809197832406,
|
|
"loss": 5.7582,
|
|
"mean_token_accuracy": 0.15180876702070237,
|
|
"num_tokens": 6279325.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 6.00025053024292,
|
|
"epoch": 0.19342980511144825,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00010560322006418368,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.143459203094244,
|
|
"num_tokens": 6288637.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 6.07623872756958,
|
|
"epoch": 0.1937215544404248,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00010483016444341887,
|
|
"loss": 5.9301,
|
|
"mean_token_accuracy": 0.14147601649165154,
|
|
"num_tokens": 6297667.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 6.006142234802246,
|
|
"epoch": 0.19401330376940132,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00010406177411465654,
|
|
"loss": 5.8264,
|
|
"mean_token_accuracy": 0.14072705432772636,
|
|
"num_tokens": 6307155.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 6.0206427574157715,
|
|
"epoch": 0.19430505309837787,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00010329807014370562,
|
|
"loss": 5.7762,
|
|
"mean_token_accuracy": 0.14314814656972885,
|
|
"num_tokens": 6317234.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 6.0226826667785645,
|
|
"epoch": 0.19459680242735442,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00010253907346789632,
|
|
"loss": 5.7534,
|
|
"mean_token_accuracy": 0.14850166887044908,
|
|
"num_tokens": 6326627.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 6.109065246582031,
|
|
"epoch": 0.19488855175633096,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00010178480489550596,
|
|
"loss": 5.9731,
|
|
"mean_token_accuracy": 0.13906636089086533,
|
|
"num_tokens": 6335536.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 6.030552816390991,
|
|
"epoch": 0.1951803010853075,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00010103528510518836,
|
|
"loss": 5.8197,
|
|
"mean_token_accuracy": 0.14538429901003838,
|
|
"num_tokens": 6344172.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 6.054323005676269,
|
|
"epoch": 0.19547205041428406,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0001002905346454073,
|
|
"loss": 5.8418,
|
|
"mean_token_accuracy": 0.1415375880897045,
|
|
"num_tokens": 6353085.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 6.024710750579834,
|
|
"epoch": 0.19576379974326058,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 9.955057393387285e-05,
|
|
"loss": 5.8744,
|
|
"mean_token_accuracy": 0.14706755355000495,
|
|
"num_tokens": 6362514.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 6.058240365982056,
|
|
"epoch": 0.19605554907223713,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 9.88154232569816e-05,
|
|
"loss": 5.8653,
|
|
"mean_token_accuracy": 0.14398326873779296,
|
|
"num_tokens": 6372390.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.99666428565979,
|
|
"epoch": 0.19634729840121368,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 9.808510276926075e-05,
|
|
"loss": 5.6641,
|
|
"mean_token_accuracy": 0.15983247011899948,
|
|
"num_tokens": 6380824.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 6.056270790100098,
|
|
"epoch": 0.19663904773019023,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 9.735963249281549e-05,
|
|
"loss": 5.8701,
|
|
"mean_token_accuracy": 0.148010016977787,
|
|
"num_tokens": 6390771.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 6.005418109893799,
|
|
"epoch": 0.19693079705916677,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 9.663903231677974e-05,
|
|
"loss": 5.7508,
|
|
"mean_token_accuracy": 0.15127446353435517,
|
|
"num_tokens": 6399491.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 6.044877672195435,
|
|
"epoch": 0.1972225463881433,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 9.592332199677145e-05,
|
|
"loss": 5.9049,
|
|
"mean_token_accuracy": 0.13796042054891586,
|
|
"num_tokens": 6409420.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 6.070604991912842,
|
|
"epoch": 0.19751429571711984,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 9.521252115435061e-05,
|
|
"loss": 5.8344,
|
|
"mean_token_accuracy": 0.14514295086264611,
|
|
"num_tokens": 6418094.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 6.04467396736145,
|
|
"epoch": 0.1978060450460964,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 9.450664927648126e-05,
|
|
"loss": 5.9103,
|
|
"mean_token_accuracy": 0.14379659593105315,
|
|
"num_tokens": 6428414.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 6.048767518997193,
|
|
"epoch": 0.19809779437507294,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 9.380572571499758e-05,
|
|
"loss": 5.8849,
|
|
"mean_token_accuracy": 0.14546579271554946,
|
|
"num_tokens": 6437808.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 6.048607397079468,
|
|
"epoch": 0.1983895437040495,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 9.310976968607307e-05,
|
|
"loss": 5.7925,
|
|
"mean_token_accuracy": 0.14096582904458047,
|
|
"num_tokens": 6446638.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 6.007585716247559,
|
|
"epoch": 0.19868129303302604,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 9.241880026969381e-05,
|
|
"loss": 5.7017,
|
|
"mean_token_accuracy": 0.1533973976969719,
|
|
"num_tokens": 6455203.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 6.055602025985718,
|
|
"epoch": 0.19897304236200256,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 9.173283640913537e-05,
|
|
"loss": 5.8238,
|
|
"mean_token_accuracy": 0.14979562610387803,
|
|
"num_tokens": 6464962.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 6.026296854019165,
|
|
"epoch": 0.1992647916909791,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 9.10518969104436e-05,
|
|
"loss": 5.8383,
|
|
"mean_token_accuracy": 0.14471356198191643,
|
|
"num_tokens": 6473932.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.978135061264038,
|
|
"epoch": 0.19955654101995565,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 9.037600044191868e-05,
|
|
"loss": 5.7156,
|
|
"mean_token_accuracy": 0.15221462845802308,
|
|
"num_tokens": 6482960.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 6.03188910484314,
|
|
"epoch": 0.1998482903489322,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 8.970516553360383e-05,
|
|
"loss": 5.846,
|
|
"mean_token_accuracy": 0.14298703148961067,
|
|
"num_tokens": 6492689.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 6.005457019805908,
|
|
"epoch": 0.20014003967790875,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 8.903941057677692e-05,
|
|
"loss": 5.7312,
|
|
"mean_token_accuracy": 0.1522333636879921,
|
|
"num_tokens": 6501396.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 6.02034182548523,
|
|
"epoch": 0.2004317890068853,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 8.837875382344635e-05,
|
|
"loss": 5.8165,
|
|
"mean_token_accuracy": 0.1457226373255253,
|
|
"num_tokens": 6509756.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 6.047391128540039,
|
|
"epoch": 0.20072353833586182,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 8.772321338585076e-05,
|
|
"loss": 5.8607,
|
|
"mean_token_accuracy": 0.14221017584204673,
|
|
"num_tokens": 6519685.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 6.019774723052978,
|
|
"epoch": 0.20101528766483837,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 8.707280723596242e-05,
|
|
"loss": 5.7062,
|
|
"mean_token_accuracy": 0.148711633682251,
|
|
"num_tokens": 6528225.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 6.044072866439819,
|
|
"epoch": 0.20130703699381491,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 8.64275532049944e-05,
|
|
"loss": 5.8157,
|
|
"mean_token_accuracy": 0.15155513286590577,
|
|
"num_tokens": 6538010.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 6.049239635467529,
|
|
"epoch": 0.20159878632279146,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 8.578746898291198e-05,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.1427399069070816,
|
|
"num_tokens": 6548059.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 6.086612796783447,
|
|
"epoch": 0.201890535651768,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 8.515257211794742e-05,
|
|
"loss": 5.98,
|
|
"mean_token_accuracy": 0.1377789445221424,
|
|
"num_tokens": 6558397.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 6.045960187911987,
|
|
"epoch": 0.20218228498074453,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 8.452288001611896e-05,
|
|
"loss": 5.8908,
|
|
"mean_token_accuracy": 0.14169946834445,
|
|
"num_tokens": 6567787.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 6.040283679962158,
|
|
"epoch": 0.20247403430972108,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 8.389840994075379e-05,
|
|
"loss": 5.7963,
|
|
"mean_token_accuracy": 0.14816453009843827,
|
|
"num_tokens": 6577962.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 6.012786054611206,
|
|
"epoch": 0.20276578363869763,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 8.327917901201435e-05,
|
|
"loss": 5.797,
|
|
"mean_token_accuracy": 0.14781742691993713,
|
|
"num_tokens": 6587554.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.97820143699646,
|
|
"epoch": 0.20305753296767418,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 8.266520420642931e-05,
|
|
"loss": 5.668,
|
|
"mean_token_accuracy": 0.16253260225057603,
|
|
"num_tokens": 6596019.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 6.046507930755615,
|
|
"epoch": 0.20334928229665072,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 8.205650235642828e-05,
|
|
"loss": 5.9021,
|
|
"mean_token_accuracy": 0.14222710877656936,
|
|
"num_tokens": 6605651.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 6.0546752452850345,
|
|
"epoch": 0.20364103162562727,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 8.145309014987978e-05,
|
|
"loss": 5.7768,
|
|
"mean_token_accuracy": 0.14762477129697799,
|
|
"num_tokens": 6614825.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 6.066930723190308,
|
|
"epoch": 0.2039327809546038,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 8.085498412963437e-05,
|
|
"loss": 5.7661,
|
|
"mean_token_accuracy": 0.15576222389936448,
|
|
"num_tokens": 6623897.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 6.000637578964233,
|
|
"epoch": 0.20422453028358034,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 8.026220069307078e-05,
|
|
"loss": 5.8687,
|
|
"mean_token_accuracy": 0.144045539945364,
|
|
"num_tokens": 6633370.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 6.038487148284912,
|
|
"epoch": 0.2045162796125569,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 7.967475609164621e-05,
|
|
"loss": 5.8469,
|
|
"mean_token_accuracy": 0.13841103613376618,
|
|
"num_tokens": 6642708.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.993542098999024,
|
|
"epoch": 0.20480802894153344,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 7.909266643045124e-05,
|
|
"loss": 5.8255,
|
|
"mean_token_accuracy": 0.14836678206920623,
|
|
"num_tokens": 6652668.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 6.031250762939453,
|
|
"epoch": 0.20509977827050999,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 7.851594766776802e-05,
|
|
"loss": 5.8055,
|
|
"mean_token_accuracy": 0.14238882586359977,
|
|
"num_tokens": 6661913.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 6.047349166870117,
|
|
"epoch": 0.20539152759948653,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 7.794461561463265e-05,
|
|
"loss": 5.8019,
|
|
"mean_token_accuracy": 0.14975719526410103,
|
|
"num_tokens": 6670494.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 6.00344033241272,
|
|
"epoch": 0.20568327692846305,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 7.7378685934402e-05,
|
|
"loss": 5.735,
|
|
"mean_token_accuracy": 0.15057794749736786,
|
|
"num_tokens": 6680030.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 6.005091953277588,
|
|
"epoch": 0.2059750262574396,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 7.68181741423242e-05,
|
|
"loss": 5.7567,
|
|
"mean_token_accuracy": 0.15088203698396682,
|
|
"num_tokens": 6689227.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 6.016825819015503,
|
|
"epoch": 0.20626677558641615,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 7.626309560511313e-05,
|
|
"loss": 5.7283,
|
|
"mean_token_accuracy": 0.14671216905117035,
|
|
"num_tokens": 6698450.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.980291795730591,
|
|
"epoch": 0.2065585249153927,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 7.571346554052724e-05,
|
|
"loss": 5.7237,
|
|
"mean_token_accuracy": 0.15045439451932907,
|
|
"num_tokens": 6707135.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.996686601638794,
|
|
"epoch": 0.20685027424436925,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 7.516929901695249e-05,
|
|
"loss": 5.7658,
|
|
"mean_token_accuracy": 0.1457556039094925,
|
|
"num_tokens": 6716341.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 6.050505208969116,
|
|
"epoch": 0.20714202357334577,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 7.463061095298893e-05,
|
|
"loss": 5.8333,
|
|
"mean_token_accuracy": 0.1497940793633461,
|
|
"num_tokens": 6725685.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 6.075965166091919,
|
|
"epoch": 0.20743377290232232,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 7.409741611704198e-05,
|
|
"loss": 5.8148,
|
|
"mean_token_accuracy": 0.1490970715880394,
|
|
"num_tokens": 6733787.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.9521900653839115,
|
|
"epoch": 0.20772552223129886,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 7.35697291269174e-05,
|
|
"loss": 5.6707,
|
|
"mean_token_accuracy": 0.14835588186979293,
|
|
"num_tokens": 6741872.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 6.003388690948486,
|
|
"epoch": 0.2080172715602754,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 7.304756444942056e-05,
|
|
"loss": 5.752,
|
|
"mean_token_accuracy": 0.14814013689756395,
|
|
"num_tokens": 6750947.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.9675041198730465,
|
|
"epoch": 0.20830902088925196,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 7.253093639995994e-05,
|
|
"loss": 5.7258,
|
|
"mean_token_accuracy": 0.15027416199445726,
|
|
"num_tokens": 6759792.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.970719718933106,
|
|
"epoch": 0.2086007702182285,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 7.20198591421544e-05,
|
|
"loss": 5.7629,
|
|
"mean_token_accuracy": 0.1502393364906311,
|
|
"num_tokens": 6768808.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 6.021814203262329,
|
|
"epoch": 0.20889251954720503,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 7.151434668744517e-05,
|
|
"loss": 5.8571,
|
|
"mean_token_accuracy": 0.13989363610744476,
|
|
"num_tokens": 6778503.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 6.026699018478394,
|
|
"epoch": 0.20918426887618158,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 7.101441289471153e-05,
|
|
"loss": 5.8064,
|
|
"mean_token_accuracy": 0.14698012992739679,
|
|
"num_tokens": 6787670.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 6.076008081436157,
|
|
"epoch": 0.20947601820515813,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 7.052007146989098e-05,
|
|
"loss": 5.8081,
|
|
"mean_token_accuracy": 0.15157271847128867,
|
|
"num_tokens": 6796815.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 6.047684574127198,
|
|
"epoch": 0.20976776753413467,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 7.003133596560341e-05,
|
|
"loss": 5.757,
|
|
"mean_token_accuracy": 0.15668850094079972,
|
|
"num_tokens": 6806811.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 6.040313816070556,
|
|
"epoch": 0.21005951686311122,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 6.954821978077952e-05,
|
|
"loss": 5.7366,
|
|
"mean_token_accuracy": 0.15044392496347428,
|
|
"num_tokens": 6816213.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 6.024389123916626,
|
|
"epoch": 0.21035126619208777,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 6.907073616029356e-05,
|
|
"loss": 5.7313,
|
|
"mean_token_accuracy": 0.15046274587512015,
|
|
"num_tokens": 6826089.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 6.048286008834839,
|
|
"epoch": 0.2106430155210643,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 6.85988981946002e-05,
|
|
"loss": 5.8567,
|
|
"mean_token_accuracy": 0.14526818469166755,
|
|
"num_tokens": 6835976.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.984748792648316,
|
|
"epoch": 0.21093476485004084,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 6.813271881937564e-05,
|
|
"loss": 5.7364,
|
|
"mean_token_accuracy": 0.15024088695645332,
|
|
"num_tokens": 6845530.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.987440776824951,
|
|
"epoch": 0.2112265141790174,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.767221081516286e-05,
|
|
"loss": 5.8078,
|
|
"mean_token_accuracy": 0.14914939254522325,
|
|
"num_tokens": 6855011.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.981237983703613,
|
|
"epoch": 0.21151826350799394,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 6.72173868070215e-05,
|
|
"loss": 5.7454,
|
|
"mean_token_accuracy": 0.14750315994024277,
|
|
"num_tokens": 6865030.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.956703329086304,
|
|
"epoch": 0.21181001283697048,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 6.676825926418149e-05,
|
|
"loss": 5.7577,
|
|
"mean_token_accuracy": 0.14565062820911406,
|
|
"num_tokens": 6874728.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 6.142899370193481,
|
|
"epoch": 0.212101762165947,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 6.632484049970122e-05,
|
|
"loss": 5.8668,
|
|
"mean_token_accuracy": 0.15339091271162034,
|
|
"num_tokens": 6884078.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.988513517379761,
|
|
"epoch": 0.21239351149492355,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 6.588714267013019e-05,
|
|
"loss": 5.6844,
|
|
"mean_token_accuracy": 0.15463413894176484,
|
|
"num_tokens": 6893113.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.954804706573486,
|
|
"epoch": 0.2126852608239001,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 6.545517777517544e-05,
|
|
"loss": 5.6768,
|
|
"mean_token_accuracy": 0.15618959665298462,
|
|
"num_tokens": 6902814.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.95705280303955,
|
|
"epoch": 0.21297701015287665,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 6.502895765737281e-05,
|
|
"loss": 5.8043,
|
|
"mean_token_accuracy": 0.146367709338665,
|
|
"num_tokens": 6912191.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 6.014355278015136,
|
|
"epoch": 0.2132687594818532,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 6.460849400176212e-05,
|
|
"loss": 5.7576,
|
|
"mean_token_accuracy": 0.1523086965084076,
|
|
"num_tokens": 6920871.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 6.008024406433106,
|
|
"epoch": 0.21356050881082975,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 6.419379833556694e-05,
|
|
"loss": 5.798,
|
|
"mean_token_accuracy": 0.14175558984279632,
|
|
"num_tokens": 6930431.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 6.001631402969361,
|
|
"epoch": 0.21385225813980627,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 6.378488202787835e-05,
|
|
"loss": 5.7317,
|
|
"mean_token_accuracy": 0.1507140204310417,
|
|
"num_tokens": 6939756.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.930145883560181,
|
|
"epoch": 0.21414400746878282,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 6.33817562893435e-05,
|
|
"loss": 5.7332,
|
|
"mean_token_accuracy": 0.1568318486213684,
|
|
"num_tokens": 6948657.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.973858404159546,
|
|
"epoch": 0.21443575679775936,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 6.29844321718582e-05,
|
|
"loss": 5.7147,
|
|
"mean_token_accuracy": 0.14987047463655473,
|
|
"num_tokens": 6957639.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 6.054459142684936,
|
|
"epoch": 0.2147275061267359,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 6.259292056826383e-05,
|
|
"loss": 5.8377,
|
|
"mean_token_accuracy": 0.15306739658117294,
|
|
"num_tokens": 6967072.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 6.015826940536499,
|
|
"epoch": 0.21501925545571246,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 6.220723221204873e-05,
|
|
"loss": 5.7007,
|
|
"mean_token_accuracy": 0.15051648318767546,
|
|
"num_tokens": 6975443.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.993532514572143,
|
|
"epoch": 0.215311004784689,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 6.182737767705406e-05,
|
|
"loss": 5.7339,
|
|
"mean_token_accuracy": 0.15275581404566765,
|
|
"num_tokens": 6984196.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.998617887496948,
|
|
"epoch": 0.21560275411366553,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.145336737718375e-05,
|
|
"loss": 5.9231,
|
|
"mean_token_accuracy": 0.13731410577893258,
|
|
"num_tokens": 6994865.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 6.010461664199829,
|
|
"epoch": 0.21589450344264208,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.10852115661191e-05,
|
|
"loss": 5.8737,
|
|
"mean_token_accuracy": 0.14191449359059333,
|
|
"num_tokens": 7004806.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.936453247070313,
|
|
"epoch": 0.21618625277161863,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 6.072292033703766e-05,
|
|
"loss": 5.6948,
|
|
"mean_token_accuracy": 0.1619744524359703,
|
|
"num_tokens": 7013474.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 6.046163082122803,
|
|
"epoch": 0.21647800210059517,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 6.036650362233648e-05,
|
|
"loss": 5.7858,
|
|
"mean_token_accuracy": 0.15016700625419616,
|
|
"num_tokens": 7022448.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 6.095674753189087,
|
|
"epoch": 0.21676975142957172,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 6.0015971193359824e-05,
|
|
"loss": 5.9853,
|
|
"mean_token_accuracy": 0.13983868584036827,
|
|
"num_tokens": 7032418.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 6.088170337677002,
|
|
"epoch": 0.21706150075854824,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 5.9671332660131306e-05,
|
|
"loss": 5.8741,
|
|
"mean_token_accuracy": 0.14399353563785552,
|
|
"num_tokens": 7041734.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 6.128236436843872,
|
|
"epoch": 0.2173532500875248,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 5.933259747109042e-05,
|
|
"loss": 5.8327,
|
|
"mean_token_accuracy": 0.15064259842038155,
|
|
"num_tokens": 7050973.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 6.066099691390991,
|
|
"epoch": 0.21764499941650134,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 5.899977491283351e-05,
|
|
"loss": 5.8833,
|
|
"mean_token_accuracy": 0.14673025161027908,
|
|
"num_tokens": 7060288.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 6.036101198196411,
|
|
"epoch": 0.2179367487454779,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 5.867287410985908e-05,
|
|
"loss": 5.7814,
|
|
"mean_token_accuracy": 0.14783452972769737,
|
|
"num_tokens": 7070133.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 6.083155012130737,
|
|
"epoch": 0.21822849807445444,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 5.835190402431779e-05,
|
|
"loss": 5.9071,
|
|
"mean_token_accuracy": 0.1404767319560051,
|
|
"num_tokens": 7079110.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.98348708152771,
|
|
"epoch": 0.21852024740343098,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.803687345576673e-05,
|
|
"loss": 5.8045,
|
|
"mean_token_accuracy": 0.14875467047095298,
|
|
"num_tokens": 7088725.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 6.032840394973755,
|
|
"epoch": 0.2188119967324075,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.7727791040927977e-05,
|
|
"loss": 5.834,
|
|
"mean_token_accuracy": 0.14755599647760392,
|
|
"num_tokens": 7098454.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.96490249633789,
|
|
"epoch": 0.21910374606138405,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 5.742466525345213e-05,
|
|
"loss": 5.8298,
|
|
"mean_token_accuracy": 0.14867031574249268,
|
|
"num_tokens": 7107867.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 6.097217559814453,
|
|
"epoch": 0.2193954953903606,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 5.7127504403685775e-05,
|
|
"loss": 5.8834,
|
|
"mean_token_accuracy": 0.14168518409132957,
|
|
"num_tokens": 7118592.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 6.076203775405884,
|
|
"epoch": 0.21968724471933715,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 5.6836316638443664e-05,
|
|
"loss": 5.7697,
|
|
"mean_token_accuracy": 0.15422853976488113,
|
|
"num_tokens": 7128002.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 6.1055652618408205,
|
|
"epoch": 0.2199789940483137,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.655110994078553e-05,
|
|
"loss": 5.85,
|
|
"mean_token_accuracy": 0.14584701880812645,
|
|
"num_tokens": 7137276.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 6.078866672515869,
|
|
"epoch": 0.22027074337729025,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 5.6271892129797056e-05,
|
|
"loss": 5.8636,
|
|
"mean_token_accuracy": 0.14398446455597877,
|
|
"num_tokens": 7147286.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 6.018182563781738,
|
|
"epoch": 0.22056249270626677,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 5.599867086037556e-05,
|
|
"loss": 5.7946,
|
|
"mean_token_accuracy": 0.1449967935681343,
|
|
"num_tokens": 7156547.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 6.055611705780029,
|
|
"epoch": 0.22085424203524331,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 5.573145362302012e-05,
|
|
"loss": 5.7902,
|
|
"mean_token_accuracy": 0.15413568541407585,
|
|
"num_tokens": 7166036.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.989874982833863,
|
|
"epoch": 0.22114599136421986,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 5.5470247743626404e-05,
|
|
"loss": 5.6154,
|
|
"mean_token_accuracy": 0.16087048947811128,
|
|
"num_tokens": 7174946.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 6.0004563331604,
|
|
"epoch": 0.2214377406931964,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 5.5215060383285414e-05,
|
|
"loss": 5.761,
|
|
"mean_token_accuracy": 0.14910911470651628,
|
|
"num_tokens": 7183357.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 6.008195495605468,
|
|
"epoch": 0.22172949002217296,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 5.496589853808759e-05,
|
|
"loss": 5.7724,
|
|
"mean_token_accuracy": 0.14813983514904977,
|
|
"num_tokens": 7192708.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 6.085361576080322,
|
|
"epoch": 0.22202123935114948,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 5.47227690389308e-05,
|
|
"loss": 5.9237,
|
|
"mean_token_accuracy": 0.1430981583893299,
|
|
"num_tokens": 7203523.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 6.051559782028198,
|
|
"epoch": 0.22231298868012603,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.448567855133306e-05,
|
|
"loss": 5.7682,
|
|
"mean_token_accuracy": 0.15290465205907822,
|
|
"num_tokens": 7212465.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 6.0105517387390135,
|
|
"epoch": 0.22260473800910258,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 5.425463357524986e-05,
|
|
"loss": 5.7596,
|
|
"mean_token_accuracy": 0.15080212354660033,
|
|
"num_tokens": 7221376.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.99233832359314,
|
|
"epoch": 0.22289648733807912,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 5.402964044489591e-05,
|
|
"loss": 5.7296,
|
|
"mean_token_accuracy": 0.14855361133813857,
|
|
"num_tokens": 7230010.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.968830823898315,
|
|
"epoch": 0.22318823666705567,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 5.381070532857153e-05,
|
|
"loss": 5.7469,
|
|
"mean_token_accuracy": 0.14889991730451585,
|
|
"num_tokens": 7239210.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.982148933410644,
|
|
"epoch": 0.22347998599603222,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.359783422849357e-05,
|
|
"loss": 5.6632,
|
|
"mean_token_accuracy": 0.15458617657423018,
|
|
"num_tokens": 7248587.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.973176622390747,
|
|
"epoch": 0.22377173532500874,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.3391032980630736e-05,
|
|
"loss": 5.72,
|
|
"mean_token_accuracy": 0.15596213340759277,
|
|
"num_tokens": 7257357.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 6.016075563430786,
|
|
"epoch": 0.2240634846539853,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.31903072545437e-05,
|
|
"loss": 5.7746,
|
|
"mean_token_accuracy": 0.15291666537523269,
|
|
"num_tokens": 7266180.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 6.104243659973145,
|
|
"epoch": 0.22435523398296184,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 5.29956625532297e-05,
|
|
"loss": 5.9204,
|
|
"mean_token_accuracy": 0.1450295105576515,
|
|
"num_tokens": 7275818.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 6.127275133132935,
|
|
"epoch": 0.2246469833119384,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 5.280710421297146e-05,
|
|
"loss": 5.9551,
|
|
"mean_token_accuracy": 0.1438662216067314,
|
|
"num_tokens": 7286239.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 6.025333642959595,
|
|
"epoch": 0.22493873264091493,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 5.2624637403191165e-05,
|
|
"loss": 5.7936,
|
|
"mean_token_accuracy": 0.1523332864046097,
|
|
"num_tokens": 7296036.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 6.080296993255615,
|
|
"epoch": 0.22523048196989148,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 5.2448267126308605e-05,
|
|
"loss": 5.8566,
|
|
"mean_token_accuracy": 0.14620201587677,
|
|
"num_tokens": 7304817.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 6.025426387786865,
|
|
"epoch": 0.225522231298868,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 5.2277998217603954e-05,
|
|
"loss": 5.7282,
|
|
"mean_token_accuracy": 0.15442665815353393,
|
|
"num_tokens": 7314519.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 6.028146362304687,
|
|
"epoch": 0.22581398062784455,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 5.211383534508541e-05,
|
|
"loss": 5.8025,
|
|
"mean_token_accuracy": 0.13819092363119126,
|
|
"num_tokens": 7324336.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 6.078394079208374,
|
|
"epoch": 0.2261057299568211,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 5.1955783009361044e-05,
|
|
"loss": 5.9035,
|
|
"mean_token_accuracy": 0.14222924038767815,
|
|
"num_tokens": 7333918.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 6.066049814224243,
|
|
"epoch": 0.22639747928579765,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 5.180384554351543e-05,
|
|
"loss": 5.8381,
|
|
"mean_token_accuracy": 0.1479823723435402,
|
|
"num_tokens": 7343436.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 6.066848993301392,
|
|
"epoch": 0.2266892286147742,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 5.1658027112990976e-05,
|
|
"loss": 5.8354,
|
|
"mean_token_accuracy": 0.15279782116413115,
|
|
"num_tokens": 7352835.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 6.020099735260009,
|
|
"epoch": 0.22698097794375072,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.151833171547365e-05,
|
|
"loss": 5.7064,
|
|
"mean_token_accuracy": 0.1516013413667679,
|
|
"num_tokens": 7362038.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 6.0997809886932375,
|
|
"epoch": 0.22727272727272727,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 5.1384763180783274e-05,
|
|
"loss": 5.8814,
|
|
"mean_token_accuracy": 0.14688156098127364,
|
|
"num_tokens": 7372096.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.988667345046997,
|
|
"epoch": 0.2275644766017038,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.125732517076876e-05,
|
|
"loss": 5.7358,
|
|
"mean_token_accuracy": 0.1515419989824295,
|
|
"num_tokens": 7381632.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 6.0542315483093265,
|
|
"epoch": 0.22785622593068036,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.113602117920747e-05,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.14830198585987092,
|
|
"num_tokens": 7391281.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.971793937683105,
|
|
"epoch": 0.2281479752596569,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 5.102085453170966e-05,
|
|
"loss": 5.6683,
|
|
"mean_token_accuracy": 0.15553800836205484,
|
|
"num_tokens": 7400149.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.98009238243103,
|
|
"epoch": 0.22843972458863346,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 5.091182838562709e-05,
|
|
"loss": 5.8119,
|
|
"mean_token_accuracy": 0.1464971125125885,
|
|
"num_tokens": 7410242.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 6.050911712646484,
|
|
"epoch": 0.22873147391760998,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 5.0808945729966716e-05,
|
|
"loss": 5.7918,
|
|
"mean_token_accuracy": 0.14972439259290696,
|
|
"num_tokens": 7419217.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 6.061527967453003,
|
|
"epoch": 0.22902322324658653,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 5.071220938530844e-05,
|
|
"loss": 5.8862,
|
|
"mean_token_accuracy": 0.14202010184526442,
|
|
"num_tokens": 7429114.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 6.097602462768554,
|
|
"epoch": 0.22931497257556308,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 5.0621622003728026e-05,
|
|
"loss": 5.9313,
|
|
"mean_token_accuracy": 0.14570255130529403,
|
|
"num_tokens": 7438745.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 6.021521806716919,
|
|
"epoch": 0.22960672190453962,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 5.053718606872433e-05,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.1521857351064682,
|
|
"num_tokens": 7447459.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 6.001620197296143,
|
|
"epoch": 0.22989847123351617,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.0458903895151134e-05,
|
|
"loss": 5.7053,
|
|
"mean_token_accuracy": 0.1521988809108734,
|
|
"num_tokens": 7456236.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 6.05599012374878,
|
|
"epoch": 0.23019022056249272,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 5.038677762915381e-05,
|
|
"loss": 5.8028,
|
|
"mean_token_accuracy": 0.15088649466633797,
|
|
"num_tokens": 7466816.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 6.00891146659851,
|
|
"epoch": 0.23048196989146924,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 5.032080924811033e-05,
|
|
"loss": 5.7698,
|
|
"mean_token_accuracy": 0.1575674407184124,
|
|
"num_tokens": 7475321.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 6.0573772430419925,
|
|
"epoch": 0.2307737192204458,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 5.026100056057718e-05,
|
|
"loss": 5.8293,
|
|
"mean_token_accuracy": 0.1521507166326046,
|
|
"num_tokens": 7484852.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 6.0817633152008055,
|
|
"epoch": 0.23106546854942234,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 5.0207353206239764e-05,
|
|
"loss": 5.8218,
|
|
"mean_token_accuracy": 0.14865020662546158,
|
|
"num_tokens": 7494388.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 6.000133943557739,
|
|
"epoch": 0.23135721787839889,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 5.0159868655867436e-05,
|
|
"loss": 5.7617,
|
|
"mean_token_accuracy": 0.14920481890439988,
|
|
"num_tokens": 7502912.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 6.0419029712677,
|
|
"epoch": 0.23164896720737543,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 5.011854821127305e-05,
|
|
"loss": 5.8421,
|
|
"mean_token_accuracy": 0.14159029275178908,
|
|
"num_tokens": 7512611.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 6.083916664123535,
|
|
"epoch": 0.23194071653635195,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 5.008339300527755e-05,
|
|
"loss": 5.8886,
|
|
"mean_token_accuracy": 0.14834078252315522,
|
|
"num_tokens": 7523162.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 6.065530252456665,
|
|
"epoch": 0.2322324658653285,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 5.005440400167859e-05,
|
|
"loss": 5.8122,
|
|
"mean_token_accuracy": 0.15221781879663468,
|
|
"num_tokens": 7531914.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.963392066955566,
|
|
"epoch": 0.23252421519430505,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 5.003158199522442e-05,
|
|
"loss": 5.7085,
|
|
"mean_token_accuracy": 0.14495298117399216,
|
|
"num_tokens": 7541394.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 6.038634395599365,
|
|
"epoch": 0.2328159645232816,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 5.0014927611591806e-05,
|
|
"loss": 5.8087,
|
|
"mean_token_accuracy": 0.1519346982240677,
|
|
"num_tokens": 7550979.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 6.105132150650024,
|
|
"epoch": 0.23310771385225815,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 5.000444130736916e-05,
|
|
"loss": 5.9449,
|
|
"mean_token_accuracy": 0.13759556859731675,
|
|
"num_tokens": 7559977.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.9761114597320555,
|
|
"epoch": 0.2333994631812347,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 5.0000123370043736e-05,
|
|
"loss": 5.6411,
|
|
"mean_token_accuracy": 0.15501480549573898,
|
|
"num_tokens": 7569816.0,
|
|
"step": 4000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.1051689439232e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|