Files
swe-latn-100mb-ppt-Dp-100mb…/checkpoint-2000/trainer_state.json
ModelHub XC 87660c825f 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/swe-latn-100mb-ppt-Dp-100mb_seed10
Source: Original Platform
2026-08-06 01:01:17 +08:00

4035 lines
109 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.11669973159061735,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.69196834564209,
"epoch": 0.00029174932897654333,
"grad_norm": 13.0625,
"learning_rate": 2e-06,
"loss": 10.8036,
"mean_token_accuracy": 0.0,
"num_tokens": 9376.0,
"step": 5
},
{
"entropy": 10.691983699798584,
"epoch": 0.0005834986579530867,
"grad_norm": 13.0625,
"learning_rate": 4.5e-06,
"loss": 10.7354,
"mean_token_accuracy": 0.00011641443707048893,
"num_tokens": 18416.0,
"step": 10
},
{
"entropy": 10.690966510772705,
"epoch": 0.00087524798692963,
"grad_norm": 10.0625,
"learning_rate": 7e-06,
"loss": 10.5172,
"mean_token_accuracy": 0.029424548242241146,
"num_tokens": 27778.0,
"step": 15
},
{
"entropy": 10.678794956207275,
"epoch": 0.0011669973159061733,
"grad_norm": 5.90625,
"learning_rate": 9.5e-06,
"loss": 10.2454,
"mean_token_accuracy": 0.04061399847269058,
"num_tokens": 37698.0,
"step": 20
},
{
"entropy": 10.63073034286499,
"epoch": 0.0014587466448827168,
"grad_norm": 4.1875,
"learning_rate": 1.2e-05,
"loss": 9.9716,
"mean_token_accuracy": 0.04182791076600552,
"num_tokens": 47412.0,
"step": 25
},
{
"entropy": 10.602538585662842,
"epoch": 0.00175049597385926,
"grad_norm": 3.21875,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.7862,
"mean_token_accuracy": 0.04080851711332798,
"num_tokens": 56226.0,
"step": 30
},
{
"entropy": 10.595691585540772,
"epoch": 0.0020422453028358036,
"grad_norm": 2.859375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.6992,
"mean_token_accuracy": 0.04258432537317276,
"num_tokens": 65953.0,
"step": 35
},
{
"entropy": 10.587265396118164,
"epoch": 0.0023339946318123466,
"grad_norm": 2.703125,
"learning_rate": 1.95e-05,
"loss": 9.6666,
"mean_token_accuracy": 0.040068139880895616,
"num_tokens": 74939.0,
"step": 40
},
{
"entropy": 10.5896146774292,
"epoch": 0.00262574396078889,
"grad_norm": 2.5625,
"learning_rate": 2.2e-05,
"loss": 9.6425,
"mean_token_accuracy": 0.04199751690030098,
"num_tokens": 83855.0,
"step": 45
},
{
"entropy": 10.573621463775634,
"epoch": 0.0029174932897654336,
"grad_norm": 2.359375,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5754,
"mean_token_accuracy": 0.045654605329036715,
"num_tokens": 93561.0,
"step": 50
},
{
"entropy": 10.557998752593994,
"epoch": 0.003209242618741977,
"grad_norm": 2.1875,
"learning_rate": 2.7e-05,
"loss": 9.479,
"mean_token_accuracy": 0.05661129578948021,
"num_tokens": 103395.0,
"step": 55
},
{
"entropy": 10.49096736907959,
"epoch": 0.00350099194771852,
"grad_norm": 2.40625,
"learning_rate": 2.95e-05,
"loss": 9.4209,
"mean_token_accuracy": 0.05532712675631046,
"num_tokens": 112462.0,
"step": 60
},
{
"entropy": 10.353149223327637,
"epoch": 0.0037927412766950636,
"grad_norm": 2.34375,
"learning_rate": 3.2e-05,
"loss": 9.3195,
"mean_token_accuracy": 0.05394121035933495,
"num_tokens": 121553.0,
"step": 65
},
{
"entropy": 10.451189041137695,
"epoch": 0.004084490605671607,
"grad_norm": 2.234375,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.2945,
"mean_token_accuracy": 0.05459350645542145,
"num_tokens": 131138.0,
"step": 70
},
{
"entropy": 10.415141296386718,
"epoch": 0.00437623993464815,
"grad_norm": 2.140625,
"learning_rate": 3.7e-05,
"loss": 9.2235,
"mean_token_accuracy": 0.05688905864953995,
"num_tokens": 140171.0,
"step": 75
},
{
"entropy": 10.439569473266602,
"epoch": 0.004667989263624693,
"grad_norm": 2.046875,
"learning_rate": 3.95e-05,
"loss": 9.0989,
"mean_token_accuracy": 0.055916853994131085,
"num_tokens": 149483.0,
"step": 80
},
{
"entropy": 10.392880725860596,
"epoch": 0.004959738592601237,
"grad_norm": 1.8984375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.0805,
"mean_token_accuracy": 0.05239327773451805,
"num_tokens": 159190.0,
"step": 85
},
{
"entropy": 10.381812000274659,
"epoch": 0.00525148792157778,
"grad_norm": 1.84375,
"learning_rate": 4.45e-05,
"loss": 8.9431,
"mean_token_accuracy": 0.05531255267560482,
"num_tokens": 169601.0,
"step": 90
},
{
"entropy": 10.296150207519531,
"epoch": 0.005543237250554324,
"grad_norm": 1.9765625,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.8622,
"mean_token_accuracy": 0.057431581988930704,
"num_tokens": 179268.0,
"step": 95
},
{
"entropy": 10.249444198608398,
"epoch": 0.005834986579530867,
"grad_norm": 2.875,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.7591,
"mean_token_accuracy": 0.05835646912455559,
"num_tokens": 188699.0,
"step": 100
},
{
"entropy": 10.191282558441163,
"epoch": 0.00612673590850741,
"grad_norm": 1.8359375,
"learning_rate": 5.2e-05,
"loss": 8.6842,
"mean_token_accuracy": 0.05705415904521942,
"num_tokens": 199939.0,
"step": 105
},
{
"entropy": 10.147027969360352,
"epoch": 0.006418485237483954,
"grad_norm": 2.0,
"learning_rate": 5.45e-05,
"loss": 8.5501,
"mean_token_accuracy": 0.06250228881835937,
"num_tokens": 209419.0,
"step": 110
},
{
"entropy": 10.024614429473877,
"epoch": 0.006710234566460497,
"grad_norm": 1.9375,
"learning_rate": 5.7e-05,
"loss": 8.4704,
"mean_token_accuracy": 0.06286126635968685,
"num_tokens": 218642.0,
"step": 115
},
{
"entropy": 9.988630104064942,
"epoch": 0.00700198389543704,
"grad_norm": 1.640625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.3393,
"mean_token_accuracy": 0.061313451081514356,
"num_tokens": 228358.0,
"step": 120
},
{
"entropy": 9.84273166656494,
"epoch": 0.007293733224413584,
"grad_norm": 1.875,
"learning_rate": 6.2e-05,
"loss": 8.1163,
"mean_token_accuracy": 0.0694800227880478,
"num_tokens": 237860.0,
"step": 125
},
{
"entropy": 9.692254257202148,
"epoch": 0.007585482553390127,
"grad_norm": 1.5625,
"learning_rate": 6.450000000000001e-05,
"loss": 8.1599,
"mean_token_accuracy": 0.06262776851654053,
"num_tokens": 247547.0,
"step": 130
},
{
"entropy": 9.467087554931641,
"epoch": 0.007877231882366671,
"grad_norm": 1.6015625,
"learning_rate": 6.7e-05,
"loss": 8.0195,
"mean_token_accuracy": 0.07063104063272477,
"num_tokens": 256405.0,
"step": 135
},
{
"entropy": 9.383435821533203,
"epoch": 0.008168981211343214,
"grad_norm": 1.421875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.9616,
"mean_token_accuracy": 0.06774205490946769,
"num_tokens": 265249.0,
"step": 140
},
{
"entropy": 9.17911729812622,
"epoch": 0.008460730540319757,
"grad_norm": 1.2265625,
"learning_rate": 7.2e-05,
"loss": 7.8784,
"mean_token_accuracy": 0.0681417278945446,
"num_tokens": 275681.0,
"step": 145
},
{
"entropy": 8.988021278381348,
"epoch": 0.0087524798692963,
"grad_norm": 1.4453125,
"learning_rate": 7.45e-05,
"loss": 7.7636,
"mean_token_accuracy": 0.07039406709372997,
"num_tokens": 284957.0,
"step": 150
},
{
"entropy": 8.73282070159912,
"epoch": 0.009044229198272843,
"grad_norm": 1.390625,
"learning_rate": 7.7e-05,
"loss": 7.6563,
"mean_token_accuracy": 0.07246890291571617,
"num_tokens": 294010.0,
"step": 155
},
{
"entropy": 8.682876682281494,
"epoch": 0.009335978527249386,
"grad_norm": 1.125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.7148,
"mean_token_accuracy": 0.07290182597935199,
"num_tokens": 303264.0,
"step": 160
},
{
"entropy": 8.486510944366454,
"epoch": 0.009627727856225931,
"grad_norm": 1.203125,
"learning_rate": 8.2e-05,
"loss": 7.5966,
"mean_token_accuracy": 0.07415391989052296,
"num_tokens": 313450.0,
"step": 165
},
{
"entropy": 8.362883186340332,
"epoch": 0.009919477185202474,
"grad_norm": 1.2265625,
"learning_rate": 8.450000000000001e-05,
"loss": 7.5375,
"mean_token_accuracy": 0.07450749576091767,
"num_tokens": 322764.0,
"step": 170
},
{
"entropy": 8.276646995544434,
"epoch": 0.010211226514179017,
"grad_norm": 1.296875,
"learning_rate": 8.7e-05,
"loss": 7.5492,
"mean_token_accuracy": 0.07559143453836441,
"num_tokens": 332228.0,
"step": 175
},
{
"entropy": 8.189496421813965,
"epoch": 0.01050297584315556,
"grad_norm": 1.296875,
"learning_rate": 8.95e-05,
"loss": 7.4578,
"mean_token_accuracy": 0.07792975381016731,
"num_tokens": 341589.0,
"step": 180
},
{
"entropy": 8.08325457572937,
"epoch": 0.010794725172132104,
"grad_norm": 1.09375,
"learning_rate": 9.2e-05,
"loss": 7.3998,
"mean_token_accuracy": 0.07972711473703384,
"num_tokens": 351166.0,
"step": 185
},
{
"entropy": 8.023299407958984,
"epoch": 0.011086474501108648,
"grad_norm": 1.25,
"learning_rate": 9.45e-05,
"loss": 7.4712,
"mean_token_accuracy": 0.07630453184247017,
"num_tokens": 360962.0,
"step": 190
},
{
"entropy": 7.986406993865967,
"epoch": 0.011378223830085191,
"grad_norm": 1.28125,
"learning_rate": 9.7e-05,
"loss": 7.4208,
"mean_token_accuracy": 0.07656608372926713,
"num_tokens": 370859.0,
"step": 195
},
{
"entropy": 7.958215236663818,
"epoch": 0.011669973159061734,
"grad_norm": 1.390625,
"learning_rate": 9.95e-05,
"loss": 7.4388,
"mean_token_accuracy": 0.07721348851919174,
"num_tokens": 381017.0,
"step": 200
},
{
"entropy": 7.953992605209351,
"epoch": 0.011961722488038277,
"grad_norm": 1.234375,
"learning_rate": 0.000102,
"loss": 7.4808,
"mean_token_accuracy": 0.07665727399289608,
"num_tokens": 390849.0,
"step": 205
},
{
"entropy": 7.941216659545899,
"epoch": 0.01225347181701482,
"grad_norm": 1.1171875,
"learning_rate": 0.00010449999999999999,
"loss": 7.4537,
"mean_token_accuracy": 0.07717064693570137,
"num_tokens": 401131.0,
"step": 210
},
{
"entropy": 7.940151929855347,
"epoch": 0.012545221145991364,
"grad_norm": 1.2109375,
"learning_rate": 0.000107,
"loss": 7.3567,
"mean_token_accuracy": 0.07789909988641738,
"num_tokens": 410171.0,
"step": 215
},
{
"entropy": 7.845122528076172,
"epoch": 0.012836970474967908,
"grad_norm": 1.3984375,
"learning_rate": 0.0001095,
"loss": 7.4298,
"mean_token_accuracy": 0.07820538356900215,
"num_tokens": 419352.0,
"step": 220
},
{
"entropy": 7.826071691513062,
"epoch": 0.013128719803944451,
"grad_norm": 1.0625,
"learning_rate": 0.000112,
"loss": 7.2948,
"mean_token_accuracy": 0.08607594929635524,
"num_tokens": 428862.0,
"step": 225
},
{
"entropy": 7.802604389190674,
"epoch": 0.013420469132920994,
"grad_norm": 1.140625,
"learning_rate": 0.0001145,
"loss": 7.2856,
"mean_token_accuracy": 0.07789736986160278,
"num_tokens": 438900.0,
"step": 230
},
{
"entropy": 7.759540748596192,
"epoch": 0.013712218461897538,
"grad_norm": 1.25,
"learning_rate": 0.00011700000000000001,
"loss": 7.2419,
"mean_token_accuracy": 0.08156893700361252,
"num_tokens": 447867.0,
"step": 235
},
{
"entropy": 7.753300333023072,
"epoch": 0.01400396779087408,
"grad_norm": 1.21875,
"learning_rate": 0.00011949999999999999,
"loss": 7.3329,
"mean_token_accuracy": 0.074883484095335,
"num_tokens": 457978.0,
"step": 240
},
{
"entropy": 7.775896072387695,
"epoch": 0.014295717119850624,
"grad_norm": 1.203125,
"learning_rate": 0.000122,
"loss": 7.2889,
"mean_token_accuracy": 0.08151891827583313,
"num_tokens": 466846.0,
"step": 245
},
{
"entropy": 7.732866048812866,
"epoch": 0.014587466448827168,
"grad_norm": 1.3515625,
"learning_rate": 0.0001245,
"loss": 7.2876,
"mean_token_accuracy": 0.07967406883835793,
"num_tokens": 475862.0,
"step": 250
},
{
"entropy": 7.682526159286499,
"epoch": 0.014879215777803712,
"grad_norm": 1.21875,
"learning_rate": 0.000127,
"loss": 7.3177,
"mean_token_accuracy": 0.0773643635213375,
"num_tokens": 486088.0,
"step": 255
},
{
"entropy": 7.789633178710938,
"epoch": 0.015170965106780255,
"grad_norm": 1.140625,
"learning_rate": 0.0001295,
"loss": 7.19,
"mean_token_accuracy": 0.0791048213839531,
"num_tokens": 495515.0,
"step": 260
},
{
"entropy": 7.739433479309082,
"epoch": 0.015462714435756798,
"grad_norm": 1.3125,
"learning_rate": 0.000132,
"loss": 7.314,
"mean_token_accuracy": 0.07758257985115051,
"num_tokens": 505617.0,
"step": 265
},
{
"entropy": 7.701812362670898,
"epoch": 0.015754463764733342,
"grad_norm": 1.078125,
"learning_rate": 0.00013450000000000002,
"loss": 7.2826,
"mean_token_accuracy": 0.07801382765173911,
"num_tokens": 515977.0,
"step": 270
},
{
"entropy": 7.724566078186035,
"epoch": 0.016046213093709884,
"grad_norm": 1.1171875,
"learning_rate": 0.00013700000000000002,
"loss": 7.3384,
"mean_token_accuracy": 0.08092856109142303,
"num_tokens": 526525.0,
"step": 275
},
{
"entropy": 7.645784378051758,
"epoch": 0.01633796242268643,
"grad_norm": 1.1484375,
"learning_rate": 0.0001395,
"loss": 7.2771,
"mean_token_accuracy": 0.08373014777898788,
"num_tokens": 536494.0,
"step": 280
},
{
"entropy": 7.622757911682129,
"epoch": 0.01662971175166297,
"grad_norm": 1.3203125,
"learning_rate": 0.00014199999999999998,
"loss": 7.3146,
"mean_token_accuracy": 0.08114334717392921,
"num_tokens": 545326.0,
"step": 285
},
{
"entropy": 7.662983512878418,
"epoch": 0.016921461080639515,
"grad_norm": 1.484375,
"learning_rate": 0.0001445,
"loss": 7.1416,
"mean_token_accuracy": 0.08460377976298332,
"num_tokens": 553678.0,
"step": 290
},
{
"entropy": 7.63046498298645,
"epoch": 0.01721321040961606,
"grad_norm": 1.46875,
"learning_rate": 0.000147,
"loss": 7.2891,
"mean_token_accuracy": 0.08224759995937347,
"num_tokens": 563860.0,
"step": 295
},
{
"entropy": 7.621852588653565,
"epoch": 0.0175049597385926,
"grad_norm": 1.234375,
"learning_rate": 0.0001495,
"loss": 7.238,
"mean_token_accuracy": 0.08669779226183891,
"num_tokens": 572492.0,
"step": 300
},
{
"entropy": 7.564120435714722,
"epoch": 0.017796709067569146,
"grad_norm": 1.28125,
"learning_rate": 0.000152,
"loss": 7.1166,
"mean_token_accuracy": 0.08243767246603965,
"num_tokens": 581840.0,
"step": 305
},
{
"entropy": 7.6293127059936525,
"epoch": 0.018088458396545687,
"grad_norm": 1.09375,
"learning_rate": 0.00015450000000000001,
"loss": 7.2465,
"mean_token_accuracy": 0.0864152580499649,
"num_tokens": 591697.0,
"step": 310
},
{
"entropy": 7.534941625595093,
"epoch": 0.01838020772552223,
"grad_norm": 1.375,
"learning_rate": 0.000157,
"loss": 7.1059,
"mean_token_accuracy": 0.0846880093216896,
"num_tokens": 601153.0,
"step": 315
},
{
"entropy": 7.607311391830445,
"epoch": 0.018671957054498773,
"grad_norm": 1.1796875,
"learning_rate": 0.0001595,
"loss": 7.1949,
"mean_token_accuracy": 0.08106868788599968,
"num_tokens": 609516.0,
"step": 320
},
{
"entropy": 7.579704999923706,
"epoch": 0.018963706383475318,
"grad_norm": 1.109375,
"learning_rate": 0.000162,
"loss": 7.2078,
"mean_token_accuracy": 0.07954892218112945,
"num_tokens": 618836.0,
"step": 325
},
{
"entropy": 7.576669311523437,
"epoch": 0.019255455712451863,
"grad_norm": 1.25,
"learning_rate": 0.00016450000000000001,
"loss": 7.2136,
"mean_token_accuracy": 0.08916370049118996,
"num_tokens": 628223.0,
"step": 330
},
{
"entropy": 7.503057956695557,
"epoch": 0.019547205041428404,
"grad_norm": 1.171875,
"learning_rate": 0.00016700000000000002,
"loss": 7.1113,
"mean_token_accuracy": 0.08817728385329246,
"num_tokens": 637609.0,
"step": 335
},
{
"entropy": 7.545721530914307,
"epoch": 0.01983895437040495,
"grad_norm": 1.1171875,
"learning_rate": 0.00016950000000000003,
"loss": 7.1296,
"mean_token_accuracy": 0.08344640359282493,
"num_tokens": 646652.0,
"step": 340
},
{
"entropy": 7.413992404937744,
"epoch": 0.02013070369938149,
"grad_norm": 1.328125,
"learning_rate": 0.00017199999999999998,
"loss": 7.137,
"mean_token_accuracy": 0.08315069451928139,
"num_tokens": 656238.0,
"step": 345
},
{
"entropy": 7.479533767700195,
"epoch": 0.020422453028358035,
"grad_norm": 1.3515625,
"learning_rate": 0.00017449999999999999,
"loss": 7.1428,
"mean_token_accuracy": 0.08378953337669373,
"num_tokens": 665148.0,
"step": 350
},
{
"entropy": 7.503499221801758,
"epoch": 0.02071420235733458,
"grad_norm": 1.3671875,
"learning_rate": 0.000177,
"loss": 7.049,
"mean_token_accuracy": 0.08563587218523025,
"num_tokens": 675192.0,
"step": 355
},
{
"entropy": 7.388577222824097,
"epoch": 0.02100595168631112,
"grad_norm": 1.265625,
"learning_rate": 0.0001795,
"loss": 7.0679,
"mean_token_accuracy": 0.08425286635756493,
"num_tokens": 684813.0,
"step": 360
},
{
"entropy": 7.496100616455078,
"epoch": 0.021297701015287666,
"grad_norm": 1.1484375,
"learning_rate": 0.000182,
"loss": 7.0952,
"mean_token_accuracy": 0.08246167674660683,
"num_tokens": 694545.0,
"step": 365
},
{
"entropy": 7.4700541496276855,
"epoch": 0.021589450344264207,
"grad_norm": 1.28125,
"learning_rate": 0.0001845,
"loss": 7.0857,
"mean_token_accuracy": 0.08829364702105522,
"num_tokens": 704312.0,
"step": 370
},
{
"entropy": 7.475095510482788,
"epoch": 0.021881199673240752,
"grad_norm": 1.265625,
"learning_rate": 0.000187,
"loss": 7.1189,
"mean_token_accuracy": 0.08108639344573021,
"num_tokens": 713743.0,
"step": 375
},
{
"entropy": 7.403366279602051,
"epoch": 0.022172949002217297,
"grad_norm": 1.2421875,
"learning_rate": 0.0001895,
"loss": 7.0088,
"mean_token_accuracy": 0.08252720050513744,
"num_tokens": 722497.0,
"step": 380
},
{
"entropy": 7.3469452381134035,
"epoch": 0.022464698331193838,
"grad_norm": 1.421875,
"learning_rate": 0.000192,
"loss": 6.9952,
"mean_token_accuracy": 0.08496845439076424,
"num_tokens": 731849.0,
"step": 385
},
{
"entropy": 7.4720964431762695,
"epoch": 0.022756447660170383,
"grad_norm": 1.1953125,
"learning_rate": 0.0001945,
"loss": 7.1709,
"mean_token_accuracy": 0.08666181415319443,
"num_tokens": 741345.0,
"step": 390
},
{
"entropy": 7.3531989574432375,
"epoch": 0.023048196989146924,
"grad_norm": 1.1953125,
"learning_rate": 0.00019700000000000002,
"loss": 7.1245,
"mean_token_accuracy": 0.08187859356403351,
"num_tokens": 751363.0,
"step": 395
},
{
"entropy": 7.323095083236694,
"epoch": 0.02333994631812347,
"grad_norm": 1.265625,
"learning_rate": 0.00019950000000000002,
"loss": 6.9475,
"mean_token_accuracy": 0.08857285082340241,
"num_tokens": 761174.0,
"step": 400
},
{
"entropy": 7.323359584808349,
"epoch": 0.02363169564710001,
"grad_norm": 1.2109375,
"learning_rate": 0.000202,
"loss": 6.9364,
"mean_token_accuracy": 0.0823954962193966,
"num_tokens": 770773.0,
"step": 405
},
{
"entropy": 7.241050577163696,
"epoch": 0.023923444976076555,
"grad_norm": 1.265625,
"learning_rate": 0.00020449999999999998,
"loss": 6.964,
"mean_token_accuracy": 0.08706902638077736,
"num_tokens": 780462.0,
"step": 410
},
{
"entropy": 7.354639291763306,
"epoch": 0.0242151943050531,
"grad_norm": 1.171875,
"learning_rate": 0.000207,
"loss": 6.9719,
"mean_token_accuracy": 0.08648092672228813,
"num_tokens": 789822.0,
"step": 415
},
{
"entropy": 7.251240015029907,
"epoch": 0.02450694363402964,
"grad_norm": 1.1640625,
"learning_rate": 0.0002095,
"loss": 6.9392,
"mean_token_accuracy": 0.08409521207213402,
"num_tokens": 799724.0,
"step": 420
},
{
"entropy": 7.2920667171478275,
"epoch": 0.024798692963006186,
"grad_norm": 1.140625,
"learning_rate": 0.000212,
"loss": 7.0463,
"mean_token_accuracy": 0.08510638326406479,
"num_tokens": 809331.0,
"step": 425
},
{
"entropy": 7.488130569458008,
"epoch": 0.025090442291982727,
"grad_norm": 1.1015625,
"learning_rate": 0.0002145,
"loss": 7.057,
"mean_token_accuracy": 0.08337506577372551,
"num_tokens": 818665.0,
"step": 430
},
{
"entropy": 7.296667957305909,
"epoch": 0.025382191620959272,
"grad_norm": 1.234375,
"learning_rate": 0.00021700000000000002,
"loss": 6.9754,
"mean_token_accuracy": 0.08416144661605358,
"num_tokens": 828580.0,
"step": 435
},
{
"entropy": 7.240721750259399,
"epoch": 0.025673940949935817,
"grad_norm": 1.609375,
"learning_rate": 0.0002195,
"loss": 7.0171,
"mean_token_accuracy": 0.08526882231235504,
"num_tokens": 837661.0,
"step": 440
},
{
"entropy": 7.22621784210205,
"epoch": 0.025965690278912358,
"grad_norm": 1.21875,
"learning_rate": 0.000222,
"loss": 6.9839,
"mean_token_accuracy": 0.08228468671441078,
"num_tokens": 847069.0,
"step": 445
},
{
"entropy": 7.250874137878418,
"epoch": 0.026257439607888903,
"grad_norm": 1.1796875,
"learning_rate": 0.0002245,
"loss": 6.9794,
"mean_token_accuracy": 0.08245958164334297,
"num_tokens": 856743.0,
"step": 450
},
{
"entropy": 7.338770008087158,
"epoch": 0.026549188936865444,
"grad_norm": 1.2734375,
"learning_rate": 0.00022700000000000002,
"loss": 7.0198,
"mean_token_accuracy": 0.08468568697571754,
"num_tokens": 865502.0,
"step": 455
},
{
"entropy": 7.33205771446228,
"epoch": 0.02684093826584199,
"grad_norm": 1.1484375,
"learning_rate": 0.00022950000000000002,
"loss": 6.9651,
"mean_token_accuracy": 0.0839608520269394,
"num_tokens": 874178.0,
"step": 460
},
{
"entropy": 7.088795518875122,
"epoch": 0.02713268759481853,
"grad_norm": 1.234375,
"learning_rate": 0.00023200000000000003,
"loss": 6.8514,
"mean_token_accuracy": 0.08765117079019547,
"num_tokens": 883182.0,
"step": 465
},
{
"entropy": 7.3482073783874515,
"epoch": 0.027424436923795075,
"grad_norm": 1.234375,
"learning_rate": 0.00023449999999999998,
"loss": 6.9282,
"mean_token_accuracy": 0.08807430192828178,
"num_tokens": 891879.0,
"step": 470
},
{
"entropy": 7.25138897895813,
"epoch": 0.02771618625277162,
"grad_norm": 1.28125,
"learning_rate": 0.000237,
"loss": 6.9982,
"mean_token_accuracy": 0.08774204924702644,
"num_tokens": 901925.0,
"step": 475
},
{
"entropy": 7.124047946929932,
"epoch": 0.02800793558174816,
"grad_norm": 1.21875,
"learning_rate": 0.0002395,
"loss": 6.9424,
"mean_token_accuracy": 0.08976237252354621,
"num_tokens": 910609.0,
"step": 480
},
{
"entropy": 7.321299314498901,
"epoch": 0.028299684910724706,
"grad_norm": 1.2109375,
"learning_rate": 0.000242,
"loss": 7.0122,
"mean_token_accuracy": 0.08504581227898597,
"num_tokens": 919643.0,
"step": 485
},
{
"entropy": 7.123654794692993,
"epoch": 0.028591434239701247,
"grad_norm": 1.09375,
"learning_rate": 0.0002445,
"loss": 6.8913,
"mean_token_accuracy": 0.0893466129899025,
"num_tokens": 929160.0,
"step": 490
},
{
"entropy": 7.151027345657349,
"epoch": 0.028883183568677792,
"grad_norm": 1.1875,
"learning_rate": 0.000247,
"loss": 6.8194,
"mean_token_accuracy": 0.09795917496085167,
"num_tokens": 938329.0,
"step": 495
},
{
"entropy": 7.3193886280059814,
"epoch": 0.029174932897654337,
"grad_norm": 1.2265625,
"learning_rate": 0.0002495,
"loss": 7.1734,
"mean_token_accuracy": 0.0849479891359806,
"num_tokens": 947919.0,
"step": 500
},
{
"entropy": 7.266849994659424,
"epoch": 0.029466682226630878,
"grad_norm": 1.21875,
"learning_rate": 0.000252,
"loss": 6.9606,
"mean_token_accuracy": 0.08843713030219078,
"num_tokens": 957647.0,
"step": 505
},
{
"entropy": 7.076206827163697,
"epoch": 0.029758431555607423,
"grad_norm": 1.1640625,
"learning_rate": 0.0002545,
"loss": 6.8029,
"mean_token_accuracy": 0.08850999772548676,
"num_tokens": 966569.0,
"step": 510
},
{
"entropy": 7.057240724563599,
"epoch": 0.030050180884583964,
"grad_norm": 1.1875,
"learning_rate": 0.000257,
"loss": 6.8111,
"mean_token_accuracy": 0.09094983339309692,
"num_tokens": 976051.0,
"step": 515
},
{
"entropy": 7.113047027587891,
"epoch": 0.03034193021356051,
"grad_norm": 1.1015625,
"learning_rate": 0.0002595,
"loss": 6.8614,
"mean_token_accuracy": 0.0857666164636612,
"num_tokens": 985445.0,
"step": 520
},
{
"entropy": 7.186595869064331,
"epoch": 0.03063367954253705,
"grad_norm": 0.96875,
"learning_rate": 0.000262,
"loss": 6.9374,
"mean_token_accuracy": 0.09131588712334633,
"num_tokens": 995633.0,
"step": 525
},
{
"entropy": 7.1607764720916744,
"epoch": 0.030925428871513595,
"grad_norm": 1.1875,
"learning_rate": 0.00026450000000000003,
"loss": 6.9758,
"mean_token_accuracy": 0.08313630521297455,
"num_tokens": 1005518.0,
"step": 530
},
{
"entropy": 7.11238431930542,
"epoch": 0.03121717820049014,
"grad_norm": 1.1953125,
"learning_rate": 0.00026700000000000004,
"loss": 6.9041,
"mean_token_accuracy": 0.08468850925564766,
"num_tokens": 1014791.0,
"step": 535
},
{
"entropy": 7.10997519493103,
"epoch": 0.031508927529466685,
"grad_norm": 1.046875,
"learning_rate": 0.00026950000000000005,
"loss": 6.8947,
"mean_token_accuracy": 0.09137562066316604,
"num_tokens": 1024607.0,
"step": 540
},
{
"entropy": 7.005407094955444,
"epoch": 0.031800676858443226,
"grad_norm": 1.0625,
"learning_rate": 0.00027200000000000005,
"loss": 6.7183,
"mean_token_accuracy": 0.09899639561772347,
"num_tokens": 1034939.0,
"step": 545
},
{
"entropy": 7.011656808853149,
"epoch": 0.03209242618741977,
"grad_norm": 1.125,
"learning_rate": 0.0002745,
"loss": 6.7633,
"mean_token_accuracy": 0.0912862703204155,
"num_tokens": 1043982.0,
"step": 550
},
{
"entropy": 7.030924987792969,
"epoch": 0.032384175516396316,
"grad_norm": 1.015625,
"learning_rate": 0.000277,
"loss": 6.792,
"mean_token_accuracy": 0.08782375603914261,
"num_tokens": 1053519.0,
"step": 555
},
{
"entropy": 7.136856937408448,
"epoch": 0.03267592484537286,
"grad_norm": 1.1015625,
"learning_rate": 0.0002795,
"loss": 7.0022,
"mean_token_accuracy": 0.08456368148326873,
"num_tokens": 1064293.0,
"step": 560
},
{
"entropy": 7.047938442230224,
"epoch": 0.0329676741743494,
"grad_norm": 1.15625,
"learning_rate": 0.00028199999999999997,
"loss": 6.9196,
"mean_token_accuracy": 0.08983817920088769,
"num_tokens": 1074013.0,
"step": 565
},
{
"entropy": 7.060609769821167,
"epoch": 0.03325942350332594,
"grad_norm": 1.09375,
"learning_rate": 0.0002845,
"loss": 6.7375,
"mean_token_accuracy": 0.09103487208485603,
"num_tokens": 1084246.0,
"step": 570
},
{
"entropy": 7.055113077163696,
"epoch": 0.03355117283230249,
"grad_norm": 1.25,
"learning_rate": 0.000287,
"loss": 6.9214,
"mean_token_accuracy": 0.08176419213414192,
"num_tokens": 1093301.0,
"step": 575
},
{
"entropy": 7.076783752441406,
"epoch": 0.03384292216127903,
"grad_norm": 1.2265625,
"learning_rate": 0.0002895,
"loss": 6.9173,
"mean_token_accuracy": 0.0938428908586502,
"num_tokens": 1103001.0,
"step": 580
},
{
"entropy": 7.104855298995972,
"epoch": 0.03413467149025557,
"grad_norm": 1.1796875,
"learning_rate": 0.000292,
"loss": 6.8065,
"mean_token_accuracy": 0.0953914389014244,
"num_tokens": 1111233.0,
"step": 585
},
{
"entropy": 7.02773814201355,
"epoch": 0.03442642081923212,
"grad_norm": 1.0703125,
"learning_rate": 0.0002945,
"loss": 6.8948,
"mean_token_accuracy": 0.085613664239645,
"num_tokens": 1121254.0,
"step": 590
},
{
"entropy": 7.111239337921143,
"epoch": 0.03471817014820866,
"grad_norm": 1.2109375,
"learning_rate": 0.000297,
"loss": 6.9226,
"mean_token_accuracy": 0.08546795472502708,
"num_tokens": 1132420.0,
"step": 595
},
{
"entropy": 7.03243350982666,
"epoch": 0.0350099194771852,
"grad_norm": 1.265625,
"learning_rate": 0.0002995,
"loss": 6.8178,
"mean_token_accuracy": 0.09553094804286957,
"num_tokens": 1141582.0,
"step": 600
},
{
"entropy": 7.081856727600098,
"epoch": 0.03530166880616174,
"grad_norm": 1.0390625,
"learning_rate": 0.000302,
"loss": 6.9839,
"mean_token_accuracy": 0.08826950266957283,
"num_tokens": 1151756.0,
"step": 605
},
{
"entropy": 7.009781455993652,
"epoch": 0.03559341813513829,
"grad_norm": 1.1875,
"learning_rate": 0.0003045,
"loss": 6.7564,
"mean_token_accuracy": 0.09513645693659782,
"num_tokens": 1160624.0,
"step": 610
},
{
"entropy": 7.095517921447754,
"epoch": 0.03588516746411483,
"grad_norm": 1.2109375,
"learning_rate": 0.000307,
"loss": 6.8711,
"mean_token_accuracy": 0.0887086771428585,
"num_tokens": 1169713.0,
"step": 615
},
{
"entropy": 6.925157833099365,
"epoch": 0.036176916793091374,
"grad_norm": 1.265625,
"learning_rate": 0.0003095,
"loss": 6.7838,
"mean_token_accuracy": 0.09514963701367378,
"num_tokens": 1178983.0,
"step": 620
},
{
"entropy": 7.0570183277130125,
"epoch": 0.03646866612206792,
"grad_norm": 1.078125,
"learning_rate": 0.000312,
"loss": 6.8797,
"mean_token_accuracy": 0.08803052604198455,
"num_tokens": 1189103.0,
"step": 625
},
{
"entropy": 6.9957983016967775,
"epoch": 0.03676041545104446,
"grad_norm": 1.1640625,
"learning_rate": 0.0003145,
"loss": 6.8739,
"mean_token_accuracy": 0.08884734362363815,
"num_tokens": 1198249.0,
"step": 630
},
{
"entropy": 6.861308431625366,
"epoch": 0.037052164780021005,
"grad_norm": 0.94140625,
"learning_rate": 0.000317,
"loss": 6.7178,
"mean_token_accuracy": 0.09863906130194663,
"num_tokens": 1207946.0,
"step": 635
},
{
"entropy": 6.984153413772583,
"epoch": 0.037343914108997546,
"grad_norm": 1.171875,
"learning_rate": 0.0003195,
"loss": 6.8166,
"mean_token_accuracy": 0.0928347222507,
"num_tokens": 1218298.0,
"step": 640
},
{
"entropy": 7.125207710266113,
"epoch": 0.037635663437974094,
"grad_norm": 1.1015625,
"learning_rate": 0.000322,
"loss": 6.8759,
"mean_token_accuracy": 0.08900825083255767,
"num_tokens": 1228291.0,
"step": 645
},
{
"entropy": 6.95434799194336,
"epoch": 0.037927412766950636,
"grad_norm": 1.3046875,
"learning_rate": 0.00032450000000000003,
"loss": 6.7389,
"mean_token_accuracy": 0.08987870886921882,
"num_tokens": 1237106.0,
"step": 650
},
{
"entropy": 6.88364200592041,
"epoch": 0.03821916209592718,
"grad_norm": 1.1171875,
"learning_rate": 0.00032700000000000003,
"loss": 6.7234,
"mean_token_accuracy": 0.0889329269528389,
"num_tokens": 1246191.0,
"step": 655
},
{
"entropy": 6.868375635147094,
"epoch": 0.038510911424903725,
"grad_norm": 1.1015625,
"learning_rate": 0.00032950000000000004,
"loss": 6.6889,
"mean_token_accuracy": 0.098920189589262,
"num_tokens": 1256071.0,
"step": 660
},
{
"entropy": 6.872937250137329,
"epoch": 0.038802660753880266,
"grad_norm": 1.1796875,
"learning_rate": 0.00033200000000000005,
"loss": 6.7492,
"mean_token_accuracy": 0.08766399398446083,
"num_tokens": 1266495.0,
"step": 665
},
{
"entropy": 6.899469661712646,
"epoch": 0.03909441008285681,
"grad_norm": 1.25,
"learning_rate": 0.00033450000000000005,
"loss": 6.7863,
"mean_token_accuracy": 0.09696677550673485,
"num_tokens": 1275054.0,
"step": 670
},
{
"entropy": 6.993720483779907,
"epoch": 0.039386159411833356,
"grad_norm": 1.3046875,
"learning_rate": 0.000337,
"loss": 6.8245,
"mean_token_accuracy": 0.09204187542200089,
"num_tokens": 1284654.0,
"step": 675
},
{
"entropy": 6.815813589096069,
"epoch": 0.0396779087408099,
"grad_norm": 1.1796875,
"learning_rate": 0.0003395,
"loss": 6.7124,
"mean_token_accuracy": 0.09631834179162979,
"num_tokens": 1294080.0,
"step": 680
},
{
"entropy": 6.981986474990845,
"epoch": 0.03996965806978644,
"grad_norm": 1.2109375,
"learning_rate": 0.000342,
"loss": 6.7317,
"mean_token_accuracy": 0.0942990817129612,
"num_tokens": 1303578.0,
"step": 685
},
{
"entropy": 6.933795309066772,
"epoch": 0.04026140739876298,
"grad_norm": 1.171875,
"learning_rate": 0.00034449999999999997,
"loss": 6.8006,
"mean_token_accuracy": 0.09185948371887206,
"num_tokens": 1312690.0,
"step": 690
},
{
"entropy": 6.84517650604248,
"epoch": 0.04055315672773953,
"grad_norm": 1.125,
"learning_rate": 0.000347,
"loss": 6.7076,
"mean_token_accuracy": 0.09742054864764213,
"num_tokens": 1322356.0,
"step": 695
},
{
"entropy": 6.9569329738616945,
"epoch": 0.04084490605671607,
"grad_norm": 1.1640625,
"learning_rate": 0.0003495,
"loss": 6.7981,
"mean_token_accuracy": 0.09365248009562492,
"num_tokens": 1331343.0,
"step": 700
},
{
"entropy": 6.990424251556396,
"epoch": 0.04113665538569261,
"grad_norm": 1.03125,
"learning_rate": 0.000352,
"loss": 6.8491,
"mean_token_accuracy": 0.0921269752085209,
"num_tokens": 1341145.0,
"step": 705
},
{
"entropy": 6.963319873809814,
"epoch": 0.04142840471466916,
"grad_norm": 1.234375,
"learning_rate": 0.0003545,
"loss": 6.8309,
"mean_token_accuracy": 0.09416978061199188,
"num_tokens": 1350510.0,
"step": 710
},
{
"entropy": 6.865133380889892,
"epoch": 0.0417201540436457,
"grad_norm": 1.3359375,
"learning_rate": 0.000357,
"loss": 6.7864,
"mean_token_accuracy": 0.09067512676119804,
"num_tokens": 1359799.0,
"step": 715
},
{
"entropy": 6.878024053573609,
"epoch": 0.04201190337262224,
"grad_norm": 1.2109375,
"learning_rate": 0.0003595,
"loss": 6.8363,
"mean_token_accuracy": 0.09358146041631699,
"num_tokens": 1369443.0,
"step": 720
},
{
"entropy": 6.90676736831665,
"epoch": 0.04230365270159878,
"grad_norm": 1.1484375,
"learning_rate": 0.000362,
"loss": 6.685,
"mean_token_accuracy": 0.09888828694820403,
"num_tokens": 1379261.0,
"step": 725
},
{
"entropy": 6.881983280181885,
"epoch": 0.04259540203057533,
"grad_norm": 1.2421875,
"learning_rate": 0.0003645,
"loss": 6.7664,
"mean_token_accuracy": 0.10230381861329078,
"num_tokens": 1388451.0,
"step": 730
},
{
"entropy": 6.774169158935547,
"epoch": 0.04288715135955187,
"grad_norm": 0.96484375,
"learning_rate": 0.000367,
"loss": 6.7704,
"mean_token_accuracy": 0.09487680047750473,
"num_tokens": 1398191.0,
"step": 735
},
{
"entropy": 6.9481110095977785,
"epoch": 0.043178900688528414,
"grad_norm": 1.2265625,
"learning_rate": 0.0003695,
"loss": 6.7186,
"mean_token_accuracy": 0.09421756863594055,
"num_tokens": 1408276.0,
"step": 740
},
{
"entropy": 6.931284427642822,
"epoch": 0.04347065001750496,
"grad_norm": 1.03125,
"learning_rate": 0.000372,
"loss": 6.7896,
"mean_token_accuracy": 0.09712609723210335,
"num_tokens": 1417329.0,
"step": 745
},
{
"entropy": 6.8381664752960205,
"epoch": 0.043762399346481504,
"grad_norm": 1.1640625,
"learning_rate": 0.0003745,
"loss": 6.8117,
"mean_token_accuracy": 0.09550364837050437,
"num_tokens": 1426361.0,
"step": 750
},
{
"entropy": 6.8008181095123295,
"epoch": 0.044054148675458045,
"grad_norm": 1.2265625,
"learning_rate": 0.000377,
"loss": 6.6971,
"mean_token_accuracy": 0.0986745998263359,
"num_tokens": 1436292.0,
"step": 755
},
{
"entropy": 6.845808029174805,
"epoch": 0.04434589800443459,
"grad_norm": 1.09375,
"learning_rate": 0.0003795,
"loss": 6.5971,
"mean_token_accuracy": 0.09895778745412827,
"num_tokens": 1445518.0,
"step": 760
},
{
"entropy": 6.755419540405273,
"epoch": 0.044637647333411135,
"grad_norm": 1.046875,
"learning_rate": 0.000382,
"loss": 6.6102,
"mean_token_accuracy": 0.1003187820315361,
"num_tokens": 1456140.0,
"step": 765
},
{
"entropy": 6.721004772186279,
"epoch": 0.044929396662387676,
"grad_norm": 1.1171875,
"learning_rate": 0.0003845,
"loss": 6.7213,
"mean_token_accuracy": 0.0939919888973236,
"num_tokens": 1464997.0,
"step": 770
},
{
"entropy": 6.738425827026367,
"epoch": 0.04522114599136422,
"grad_norm": 1.0234375,
"learning_rate": 0.00038700000000000003,
"loss": 6.652,
"mean_token_accuracy": 0.10241445153951645,
"num_tokens": 1474687.0,
"step": 775
},
{
"entropy": 6.810252714157104,
"epoch": 0.045512895320340765,
"grad_norm": 1.03125,
"learning_rate": 0.00038950000000000003,
"loss": 6.7066,
"mean_token_accuracy": 0.09432699158787727,
"num_tokens": 1484826.0,
"step": 780
},
{
"entropy": 6.8092962265014645,
"epoch": 0.04580464464931731,
"grad_norm": 1.1640625,
"learning_rate": 0.00039200000000000004,
"loss": 6.7216,
"mean_token_accuracy": 0.09401827231049538,
"num_tokens": 1494200.0,
"step": 785
},
{
"entropy": 6.736168766021729,
"epoch": 0.04609639397829385,
"grad_norm": 1.1953125,
"learning_rate": 0.00039450000000000005,
"loss": 6.6461,
"mean_token_accuracy": 0.10280982181429862,
"num_tokens": 1503343.0,
"step": 790
},
{
"entropy": 6.672789764404297,
"epoch": 0.046388143307270396,
"grad_norm": 1.109375,
"learning_rate": 0.00039700000000000005,
"loss": 6.6333,
"mean_token_accuracy": 0.10122447237372398,
"num_tokens": 1511936.0,
"step": 795
},
{
"entropy": 6.843571376800537,
"epoch": 0.04667989263624694,
"grad_norm": 1.1015625,
"learning_rate": 0.0003995,
"loss": 6.6928,
"mean_token_accuracy": 0.09420284777879714,
"num_tokens": 1521692.0,
"step": 800
},
{
"entropy": 6.806577157974243,
"epoch": 0.04697164196522348,
"grad_norm": 1.265625,
"learning_rate": 0.000402,
"loss": 6.6285,
"mean_token_accuracy": 0.09857678040862083,
"num_tokens": 1530517.0,
"step": 805
},
{
"entropy": 6.741385078430175,
"epoch": 0.04726339129420002,
"grad_norm": 1.140625,
"learning_rate": 0.0004045,
"loss": 6.658,
"mean_token_accuracy": 0.1008826494216919,
"num_tokens": 1540037.0,
"step": 810
},
{
"entropy": 6.744747114181519,
"epoch": 0.04755514062317657,
"grad_norm": 1.09375,
"learning_rate": 0.00040699999999999997,
"loss": 6.673,
"mean_token_accuracy": 0.1030520461499691,
"num_tokens": 1549099.0,
"step": 815
},
{
"entropy": 6.728698205947876,
"epoch": 0.04784688995215311,
"grad_norm": 1.03125,
"learning_rate": 0.0004095,
"loss": 6.5874,
"mean_token_accuracy": 0.10317010059952736,
"num_tokens": 1559150.0,
"step": 820
},
{
"entropy": 6.691241073608398,
"epoch": 0.04813863928112965,
"grad_norm": 1.2265625,
"learning_rate": 0.000412,
"loss": 6.6829,
"mean_token_accuracy": 0.09901780784130096,
"num_tokens": 1567999.0,
"step": 825
},
{
"entropy": 6.715443181991577,
"epoch": 0.0484303886101062,
"grad_norm": 1.1796875,
"learning_rate": 0.0004145,
"loss": 6.7417,
"mean_token_accuracy": 0.10948037281632424,
"num_tokens": 1576600.0,
"step": 830
},
{
"entropy": 6.6703986644744875,
"epoch": 0.04872213793908274,
"grad_norm": 1.2109375,
"learning_rate": 0.000417,
"loss": 6.5241,
"mean_token_accuracy": 0.1046327918767929,
"num_tokens": 1586462.0,
"step": 835
},
{
"entropy": 6.64805235862732,
"epoch": 0.04901388726805928,
"grad_norm": 1.1171875,
"learning_rate": 0.0004195,
"loss": 6.6576,
"mean_token_accuracy": 0.09610966295003891,
"num_tokens": 1596159.0,
"step": 840
},
{
"entropy": 6.804348373413086,
"epoch": 0.04930563659703582,
"grad_norm": 1.1171875,
"learning_rate": 0.000422,
"loss": 6.6896,
"mean_token_accuracy": 0.10318435579538346,
"num_tokens": 1606010.0,
"step": 845
},
{
"entropy": 6.724388599395752,
"epoch": 0.04959738592601237,
"grad_norm": 1.1484375,
"learning_rate": 0.0004245,
"loss": 6.714,
"mean_token_accuracy": 0.10009755790233613,
"num_tokens": 1614968.0,
"step": 850
},
{
"entropy": 6.730385255813599,
"epoch": 0.04988913525498891,
"grad_norm": 1.1171875,
"learning_rate": 0.000427,
"loss": 6.5681,
"mean_token_accuracy": 0.10025268271565438,
"num_tokens": 1623895.0,
"step": 855
},
{
"entropy": 6.804841709136963,
"epoch": 0.050180884583965454,
"grad_norm": 1.1171875,
"learning_rate": 0.0004295,
"loss": 6.6844,
"mean_token_accuracy": 0.09485859274864197,
"num_tokens": 1633732.0,
"step": 860
},
{
"entropy": 6.677802991867066,
"epoch": 0.050472633912942,
"grad_norm": 0.98828125,
"learning_rate": 0.000432,
"loss": 6.65,
"mean_token_accuracy": 0.10071519836783409,
"num_tokens": 1643176.0,
"step": 865
},
{
"entropy": 6.67259259223938,
"epoch": 0.050764383241918544,
"grad_norm": 1.0859375,
"learning_rate": 0.0004345,
"loss": 6.7125,
"mean_token_accuracy": 0.09944225549697876,
"num_tokens": 1652652.0,
"step": 870
},
{
"entropy": 6.769341325759887,
"epoch": 0.051056132570895085,
"grad_norm": 1.09375,
"learning_rate": 0.000437,
"loss": 6.7087,
"mean_token_accuracy": 0.09546388238668442,
"num_tokens": 1661279.0,
"step": 875
},
{
"entropy": 6.785306167602539,
"epoch": 0.051347881899871634,
"grad_norm": 1.0234375,
"learning_rate": 0.0004395,
"loss": 6.7172,
"mean_token_accuracy": 0.09483732208609581,
"num_tokens": 1671254.0,
"step": 880
},
{
"entropy": 6.627253103256225,
"epoch": 0.051639631228848175,
"grad_norm": 1.1953125,
"learning_rate": 0.000442,
"loss": 6.4968,
"mean_token_accuracy": 0.10113293752074241,
"num_tokens": 1679921.0,
"step": 885
},
{
"entropy": 6.703667211532593,
"epoch": 0.051931380557824716,
"grad_norm": 1.0859375,
"learning_rate": 0.0004445,
"loss": 6.6159,
"mean_token_accuracy": 0.10109170824289322,
"num_tokens": 1689706.0,
"step": 890
},
{
"entropy": 6.751815223693848,
"epoch": 0.05222312988680126,
"grad_norm": 0.99609375,
"learning_rate": 0.000447,
"loss": 6.696,
"mean_token_accuracy": 0.09690436124801635,
"num_tokens": 1700322.0,
"step": 895
},
{
"entropy": 6.633773994445801,
"epoch": 0.052514879215777806,
"grad_norm": 1.171875,
"learning_rate": 0.00044950000000000003,
"loss": 6.574,
"mean_token_accuracy": 0.10566928014159202,
"num_tokens": 1709179.0,
"step": 900
},
{
"entropy": 6.579496812820435,
"epoch": 0.05280662854475435,
"grad_norm": 1.0859375,
"learning_rate": 0.00045200000000000004,
"loss": 6.528,
"mean_token_accuracy": 0.10681467652320861,
"num_tokens": 1718427.0,
"step": 905
},
{
"entropy": 6.682822132110596,
"epoch": 0.05309837787373089,
"grad_norm": 0.9609375,
"learning_rate": 0.00045450000000000004,
"loss": 6.5837,
"mean_token_accuracy": 0.09797712191939353,
"num_tokens": 1727930.0,
"step": 910
},
{
"entropy": 6.625987529754639,
"epoch": 0.05339012720270744,
"grad_norm": 1.1171875,
"learning_rate": 0.00045700000000000005,
"loss": 6.6188,
"mean_token_accuracy": 0.10405138954520225,
"num_tokens": 1737264.0,
"step": 915
},
{
"entropy": 6.602404928207397,
"epoch": 0.05368187653168398,
"grad_norm": 1.2265625,
"learning_rate": 0.00045950000000000006,
"loss": 6.5705,
"mean_token_accuracy": 0.10319243893027305,
"num_tokens": 1746388.0,
"step": 920
},
{
"entropy": 6.655055236816406,
"epoch": 0.05397362586066052,
"grad_norm": 1.03125,
"learning_rate": 0.000462,
"loss": 6.588,
"mean_token_accuracy": 0.09976595863699914,
"num_tokens": 1755992.0,
"step": 925
},
{
"entropy": 6.557945108413696,
"epoch": 0.05426537518963706,
"grad_norm": 1.2265625,
"learning_rate": 0.0004645,
"loss": 6.5948,
"mean_token_accuracy": 0.1043360821902752,
"num_tokens": 1765101.0,
"step": 930
},
{
"entropy": 6.608616828918457,
"epoch": 0.05455712451861361,
"grad_norm": 1.09375,
"learning_rate": 0.000467,
"loss": 6.518,
"mean_token_accuracy": 0.10695041045546531,
"num_tokens": 1773377.0,
"step": 935
},
{
"entropy": 6.7846527099609375,
"epoch": 0.05484887384759015,
"grad_norm": 1.0625,
"learning_rate": 0.0004695,
"loss": 6.685,
"mean_token_accuracy": 0.09719114303588867,
"num_tokens": 1782691.0,
"step": 940
},
{
"entropy": 6.581558084487915,
"epoch": 0.05514062317656669,
"grad_norm": 1.234375,
"learning_rate": 0.000472,
"loss": 6.6633,
"mean_token_accuracy": 0.09527761414647103,
"num_tokens": 1792327.0,
"step": 945
},
{
"entropy": 6.649594068527222,
"epoch": 0.05543237250554324,
"grad_norm": 1.0625,
"learning_rate": 0.0004745,
"loss": 6.6353,
"mean_token_accuracy": 0.10013408064842225,
"num_tokens": 1802419.0,
"step": 950
},
{
"entropy": 6.586823034286499,
"epoch": 0.05572412183451978,
"grad_norm": 1.09375,
"learning_rate": 0.000477,
"loss": 6.5391,
"mean_token_accuracy": 0.10384995490312576,
"num_tokens": 1811809.0,
"step": 955
},
{
"entropy": 6.593689727783203,
"epoch": 0.05601587116349632,
"grad_norm": 1.03125,
"learning_rate": 0.0004795,
"loss": 6.6023,
"mean_token_accuracy": 0.1025864191353321,
"num_tokens": 1820811.0,
"step": 960
},
{
"entropy": 6.703953552246094,
"epoch": 0.05630762049247287,
"grad_norm": 1.125,
"learning_rate": 0.000482,
"loss": 6.662,
"mean_token_accuracy": 0.09310555234551429,
"num_tokens": 1830646.0,
"step": 965
},
{
"entropy": 6.43831353187561,
"epoch": 0.05659936982144941,
"grad_norm": 1.1796875,
"learning_rate": 0.0004845,
"loss": 6.5116,
"mean_token_accuracy": 0.10798174142837524,
"num_tokens": 1839729.0,
"step": 970
},
{
"entropy": 6.744899940490723,
"epoch": 0.05689111915042595,
"grad_norm": 1.1484375,
"learning_rate": 0.000487,
"loss": 6.6372,
"mean_token_accuracy": 0.09991811662912368,
"num_tokens": 1848997.0,
"step": 975
},
{
"entropy": 6.513811635971069,
"epoch": 0.057182868479402495,
"grad_norm": 1.203125,
"learning_rate": 0.0004895,
"loss": 6.5616,
"mean_token_accuracy": 0.10880497097969055,
"num_tokens": 1859123.0,
"step": 980
},
{
"entropy": 6.667817068099976,
"epoch": 0.05747461780837904,
"grad_norm": 1.1015625,
"learning_rate": 0.000492,
"loss": 6.6949,
"mean_token_accuracy": 0.11167361810803414,
"num_tokens": 1868327.0,
"step": 985
},
{
"entropy": 6.558897924423218,
"epoch": 0.057766367137355584,
"grad_norm": 1.21875,
"learning_rate": 0.0004945,
"loss": 6.5809,
"mean_token_accuracy": 0.1034304141998291,
"num_tokens": 1877880.0,
"step": 990
},
{
"entropy": 6.661033344268799,
"epoch": 0.058058116466332126,
"grad_norm": 1.03125,
"learning_rate": 0.000497,
"loss": 6.5736,
"mean_token_accuracy": 0.10090498700737953,
"num_tokens": 1887331.0,
"step": 995
},
{
"entropy": 6.638740062713623,
"epoch": 0.058349865795308674,
"grad_norm": 1.0625,
"learning_rate": 0.0004995,
"loss": 6.6316,
"mean_token_accuracy": 0.09878421947360039,
"num_tokens": 1897343.0,
"step": 1000
},
{
"entropy": 6.650649118423462,
"epoch": 0.058641615124285215,
"grad_norm": 1.0390625,
"learning_rate": 0.000499998026082006,
"loss": 6.6473,
"mean_token_accuracy": 0.10691011771559715,
"num_tokens": 1906422.0,
"step": 1005
},
{
"entropy": 6.63336181640625,
"epoch": 0.058933364453261756,
"grad_norm": 1.0625,
"learning_rate": 0.0004999900070995136,
"loss": 6.671,
"mean_token_accuracy": 0.1082217514514923,
"num_tokens": 1916122.0,
"step": 1010
},
{
"entropy": 6.511569929122925,
"epoch": 0.0592251137822383,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999758199023239,
"loss": 6.4567,
"mean_token_accuracy": 0.10471461117267608,
"num_tokens": 1924822.0,
"step": 1015
},
{
"entropy": 6.540279054641724,
"epoch": 0.059516863111214846,
"grad_norm": 1.2578125,
"learning_rate": 0.0004999554648793858,
"loss": 6.6222,
"mean_token_accuracy": 0.10849541574716567,
"num_tokens": 1934629.0,
"step": 1020
},
{
"entropy": 6.493051528930664,
"epoch": 0.05980861244019139,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999289425887425,
"loss": 6.4939,
"mean_token_accuracy": 0.10078425854444503,
"num_tokens": 1943171.0,
"step": 1025
},
{
"entropy": 6.736955261230468,
"epoch": 0.06010036176916793,
"grad_norm": 1.03125,
"learning_rate": 0.0004998962537575161,
"loss": 6.648,
"mean_token_accuracy": 0.10098663121461868,
"num_tokens": 1953716.0,
"step": 1030
},
{
"entropy": 6.582661819458008,
"epoch": 0.06039211109814448,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998573992818874,
"loss": 6.6512,
"mean_token_accuracy": 0.10541167482733727,
"num_tokens": 1962852.0,
"step": 1035
},
{
"entropy": 6.67156400680542,
"epoch": 0.06068386042712102,
"grad_norm": 1.125,
"learning_rate": 0.0004998123802270715,
"loss": 6.6404,
"mean_token_accuracy": 0.10719699263572693,
"num_tokens": 1971762.0,
"step": 1040
},
{
"entropy": 6.535550498962403,
"epoch": 0.06097560975609756,
"grad_norm": 1.125,
"learning_rate": 0.0004997611978272886,
"loss": 6.5646,
"mean_token_accuracy": 0.10268182530999184,
"num_tokens": 1981798.0,
"step": 1045
},
{
"entropy": 6.513294410705567,
"epoch": 0.0612673590850741,
"grad_norm": 1.046875,
"learning_rate": 0.0004997038534857298,
"loss": 6.4932,
"mean_token_accuracy": 0.1034928672015667,
"num_tokens": 1990479.0,
"step": 1050
},
{
"entropy": 6.672393798828125,
"epoch": 0.06155910841405065,
"grad_norm": 1.4375,
"learning_rate": 0.0004996403487745194,
"loss": 6.5911,
"mean_token_accuracy": 0.10503169894218445,
"num_tokens": 2000194.0,
"step": 1055
},
{
"entropy": 6.536614418029785,
"epoch": 0.06185085774302719,
"grad_norm": 1.0859375,
"learning_rate": 0.000499570685434671,
"loss": 6.6125,
"mean_token_accuracy": 0.10448794513940811,
"num_tokens": 2010806.0,
"step": 1060
},
{
"entropy": 6.543749761581421,
"epoch": 0.06214260707200373,
"grad_norm": 1.1484375,
"learning_rate": 0.0004994948653760405,
"loss": 6.5712,
"mean_token_accuracy": 0.10555129945278167,
"num_tokens": 2019811.0,
"step": 1065
},
{
"entropy": 6.564803409576416,
"epoch": 0.06243435640098028,
"grad_norm": 1.09375,
"learning_rate": 0.0004994128906772729,
"loss": 6.5333,
"mean_token_accuracy": 0.10878547504544259,
"num_tokens": 2028581.0,
"step": 1070
},
{
"entropy": 6.543899917602539,
"epoch": 0.06272610572995682,
"grad_norm": 1.2421875,
"learning_rate": 0.000499324763585746,
"loss": 6.555,
"mean_token_accuracy": 0.10785453170537948,
"num_tokens": 2037496.0,
"step": 1075
},
{
"entropy": 6.552090215682983,
"epoch": 0.06301785505893337,
"grad_norm": 1.1015625,
"learning_rate": 0.0004992304865175085,
"loss": 6.4859,
"mean_token_accuracy": 0.1107458420097828,
"num_tokens": 2046183.0,
"step": 1080
},
{
"entropy": 6.6219559669494625,
"epoch": 0.0633096043879099,
"grad_norm": 0.94921875,
"learning_rate": 0.0004991300620572138,
"loss": 6.6477,
"mean_token_accuracy": 0.10132529735565185,
"num_tokens": 2056360.0,
"step": 1085
},
{
"entropy": 6.406348085403442,
"epoch": 0.06360135371688645,
"grad_norm": 1.0234375,
"learning_rate": 0.0004990234929580494,
"loss": 6.4436,
"mean_token_accuracy": 0.11206084564328193,
"num_tokens": 2066139.0,
"step": 1090
},
{
"entropy": 6.533041286468506,
"epoch": 0.063893103045863,
"grad_norm": 1.09375,
"learning_rate": 0.0004989107821416609,
"loss": 6.5685,
"mean_token_accuracy": 0.10588387921452522,
"num_tokens": 2075284.0,
"step": 1095
},
{
"entropy": 6.4999213218688965,
"epoch": 0.06418485237483953,
"grad_norm": 1.1015625,
"learning_rate": 0.0004987919326980723,
"loss": 6.4587,
"mean_token_accuracy": 0.10920145735144615,
"num_tokens": 2084896.0,
"step": 1100
},
{
"entropy": 6.566693067550659,
"epoch": 0.06447660170381608,
"grad_norm": 1.15625,
"learning_rate": 0.0004986669478856011,
"loss": 6.5482,
"mean_token_accuracy": 0.11378610283136367,
"num_tokens": 2094149.0,
"step": 1105
},
{
"entropy": 6.5364597797393795,
"epoch": 0.06476835103279263,
"grad_norm": 0.96875,
"learning_rate": 0.0004985358311307688,
"loss": 6.6266,
"mean_token_accuracy": 0.10551877319812775,
"num_tokens": 2104527.0,
"step": 1110
},
{
"entropy": 6.542181444168091,
"epoch": 0.06506010036176917,
"grad_norm": 1.15625,
"learning_rate": 0.0004983985860282081,
"loss": 6.4897,
"mean_token_accuracy": 0.10867034271359444,
"num_tokens": 2113737.0,
"step": 1115
},
{
"entropy": 6.457909774780274,
"epoch": 0.06535184969074571,
"grad_norm": 1.0234375,
"learning_rate": 0.0004982552163405623,
"loss": 6.5155,
"mean_token_accuracy": 0.11161521077156067,
"num_tokens": 2123517.0,
"step": 1120
},
{
"entropy": 6.464603519439697,
"epoch": 0.06564359901972225,
"grad_norm": 0.99609375,
"learning_rate": 0.0004981057259983839,
"loss": 6.43,
"mean_token_accuracy": 0.10833626836538315,
"num_tokens": 2133389.0,
"step": 1125
},
{
"entropy": 6.695741128921509,
"epoch": 0.0659353483486988,
"grad_norm": 1.0703125,
"learning_rate": 0.0004979501191000262,
"loss": 6.6258,
"mean_token_accuracy": 0.1069041796028614,
"num_tokens": 2142569.0,
"step": 1130
},
{
"entropy": 6.528357124328613,
"epoch": 0.06622709767767535,
"grad_norm": 1.1875,
"learning_rate": 0.0004977883999115311,
"loss": 6.4632,
"mean_token_accuracy": 0.10537031814455985,
"num_tokens": 2151422.0,
"step": 1135
},
{
"entropy": 6.430627536773682,
"epoch": 0.06651884700665188,
"grad_norm": 1.0546875,
"learning_rate": 0.0004976205728665113,
"loss": 6.4825,
"mean_token_accuracy": 0.10998515039682388,
"num_tokens": 2160696.0,
"step": 1140
},
{
"entropy": 6.443187093734741,
"epoch": 0.06681059633562843,
"grad_norm": 0.93359375,
"learning_rate": 0.0004974466425660307,
"loss": 6.473,
"mean_token_accuracy": 0.11025330871343612,
"num_tokens": 2171333.0,
"step": 1145
},
{
"entropy": 6.476709651947021,
"epoch": 0.06710234566460498,
"grad_norm": 0.94921875,
"learning_rate": 0.0004972666137784759,
"loss": 6.4448,
"mean_token_accuracy": 0.11565838381648064,
"num_tokens": 2180755.0,
"step": 1150
},
{
"entropy": 6.591566276550293,
"epoch": 0.06739409499358151,
"grad_norm": 1.0390625,
"learning_rate": 0.0004970804914394271,
"loss": 6.5623,
"mean_token_accuracy": 0.10833770707249642,
"num_tokens": 2189805.0,
"step": 1155
},
{
"entropy": 6.487264585494995,
"epoch": 0.06768584432255806,
"grad_norm": 1.0546875,
"learning_rate": 0.0004968882806515225,
"loss": 6.4206,
"mean_token_accuracy": 0.10597622171044349,
"num_tokens": 2199696.0,
"step": 1160
},
{
"entropy": 6.503916501998901,
"epoch": 0.0679775936515346,
"grad_norm": 1.0078125,
"learning_rate": 0.0004966899866843177,
"loss": 6.5065,
"mean_token_accuracy": 0.11296691745519638,
"num_tokens": 2210667.0,
"step": 1165
},
{
"entropy": 6.4775800704956055,
"epoch": 0.06826934298051114,
"grad_norm": 1.015625,
"learning_rate": 0.000496485614974142,
"loss": 6.4924,
"mean_token_accuracy": 0.11328694522380829,
"num_tokens": 2219517.0,
"step": 1170
},
{
"entropy": 6.4405846118927,
"epoch": 0.06856109230948769,
"grad_norm": 0.9453125,
"learning_rate": 0.0004962751711239492,
"loss": 6.4377,
"mean_token_accuracy": 0.10667010024189949,
"num_tokens": 2228418.0,
"step": 1175
},
{
"entropy": 6.424973726272583,
"epoch": 0.06885284163846424,
"grad_norm": 1.046875,
"learning_rate": 0.0004960586609031636,
"loss": 6.4672,
"mean_token_accuracy": 0.10987688899040222,
"num_tokens": 2238787.0,
"step": 1180
},
{
"entropy": 6.491880607604981,
"epoch": 0.06914459096744077,
"grad_norm": 0.99609375,
"learning_rate": 0.0004958360902475224,
"loss": 6.4953,
"mean_token_accuracy": 0.11162107959389686,
"num_tokens": 2248750.0,
"step": 1185
},
{
"entropy": 6.446459341049194,
"epoch": 0.06943634029641732,
"grad_norm": 1.0234375,
"learning_rate": 0.0004956074652589125,
"loss": 6.4687,
"mean_token_accuracy": 0.11494983360171318,
"num_tokens": 2258250.0,
"step": 1190
},
{
"entropy": 6.443336868286133,
"epoch": 0.06972808962539385,
"grad_norm": 0.96484375,
"learning_rate": 0.0004953727922052035,
"loss": 6.4389,
"mean_token_accuracy": 0.10993985310196877,
"num_tokens": 2268149.0,
"step": 1195
},
{
"entropy": 6.5478602886199955,
"epoch": 0.0700198389543704,
"grad_norm": 1.21875,
"learning_rate": 0.0004951320775200756,
"loss": 6.4572,
"mean_token_accuracy": 0.11372324377298355,
"num_tokens": 2276746.0,
"step": 1200
},
{
"entropy": 6.315929794311524,
"epoch": 0.07031158828334695,
"grad_norm": 1.0234375,
"learning_rate": 0.0004948853278028436,
"loss": 6.3928,
"mean_token_accuracy": 0.10992860049009323,
"num_tokens": 2286192.0,
"step": 1205
},
{
"entropy": 6.42680606842041,
"epoch": 0.07060333761232349,
"grad_norm": 1.0,
"learning_rate": 0.0004946325498182755,
"loss": 6.3928,
"mean_token_accuracy": 0.11117786765098572,
"num_tokens": 2296087.0,
"step": 1210
},
{
"entropy": 6.398185729980469,
"epoch": 0.07089508694130003,
"grad_norm": 0.90234375,
"learning_rate": 0.0004943737504964076,
"loss": 6.4682,
"mean_token_accuracy": 0.10990155264735221,
"num_tokens": 2306219.0,
"step": 1215
},
{
"entropy": 6.4592015743255615,
"epoch": 0.07118683627027658,
"grad_norm": 1.0234375,
"learning_rate": 0.000494108936932354,
"loss": 6.4012,
"mean_token_accuracy": 0.11408278942108155,
"num_tokens": 2315171.0,
"step": 1220
},
{
"entropy": 6.316812133789062,
"epoch": 0.07147858559925312,
"grad_norm": 1.0,
"learning_rate": 0.0004938381163861124,
"loss": 6.267,
"mean_token_accuracy": 0.1170704185962677,
"num_tokens": 2323791.0,
"step": 1225
},
{
"entropy": 6.456182384490967,
"epoch": 0.07177033492822966,
"grad_norm": 1.03125,
"learning_rate": 0.0004935612962823645,
"loss": 6.3477,
"mean_token_accuracy": 0.11591391935944557,
"num_tokens": 2333242.0,
"step": 1230
},
{
"entropy": 6.497243118286133,
"epoch": 0.07206208425720621,
"grad_norm": 0.96484375,
"learning_rate": 0.0004932784842102739,
"loss": 6.4143,
"mean_token_accuracy": 0.1154218778014183,
"num_tokens": 2343685.0,
"step": 1235
},
{
"entropy": 6.377239084243774,
"epoch": 0.07235383358618275,
"grad_norm": 1.0859375,
"learning_rate": 0.0004929896879232758,
"loss": 6.397,
"mean_token_accuracy": 0.11717568039894104,
"num_tokens": 2352899.0,
"step": 1240
},
{
"entropy": 6.3864076137542725,
"epoch": 0.0726455829151593,
"grad_norm": 1.46875,
"learning_rate": 0.0004926949153388668,
"loss": 6.5139,
"mean_token_accuracy": 0.11911385580897331,
"num_tokens": 2362381.0,
"step": 1245
},
{
"entropy": 6.464845848083496,
"epoch": 0.07293733224413584,
"grad_norm": 1.0078125,
"learning_rate": 0.0004923941745383859,
"loss": 6.3956,
"mean_token_accuracy": 0.11288046464323997,
"num_tokens": 2372309.0,
"step": 1250
},
{
"entropy": 6.503108024597168,
"epoch": 0.07322908157311238,
"grad_norm": 1.046875,
"learning_rate": 0.000492087473766794,
"loss": 6.5013,
"mean_token_accuracy": 0.11466107293963432,
"num_tokens": 2381236.0,
"step": 1255
},
{
"entropy": 6.4154833316802975,
"epoch": 0.07352083090208893,
"grad_norm": 0.94140625,
"learning_rate": 0.000491774821432448,
"loss": 6.4491,
"mean_token_accuracy": 0.11527864336967468,
"num_tokens": 2390793.0,
"step": 1260
},
{
"entropy": 6.414394474029541,
"epoch": 0.07381258023106547,
"grad_norm": 0.94140625,
"learning_rate": 0.0004914562261068693,
"loss": 6.3753,
"mean_token_accuracy": 0.11422505304217338,
"num_tokens": 2400007.0,
"step": 1265
},
{
"entropy": 6.423696422576905,
"epoch": 0.07410432956004201,
"grad_norm": 1.0078125,
"learning_rate": 0.0004911316965245098,
"loss": 6.428,
"mean_token_accuracy": 0.11575796380639077,
"num_tokens": 2409606.0,
"step": 1270
},
{
"entropy": 6.41414155960083,
"epoch": 0.07439607888901856,
"grad_norm": 1.078125,
"learning_rate": 0.000490801241582512,
"loss": 6.3543,
"mean_token_accuracy": 0.11173621639609337,
"num_tokens": 2419074.0,
"step": 1275
},
{
"entropy": 6.403918361663818,
"epoch": 0.07468782821799509,
"grad_norm": 1.0703125,
"learning_rate": 0.000490464870340465,
"loss": 6.3939,
"mean_token_accuracy": 0.11463204845786094,
"num_tokens": 2428772.0,
"step": 1280
},
{
"entropy": 6.533142328262329,
"epoch": 0.07497957754697164,
"grad_norm": 0.99609375,
"learning_rate": 0.0004901225920201563,
"loss": 6.5168,
"mean_token_accuracy": 0.11531570181250572,
"num_tokens": 2438931.0,
"step": 1285
},
{
"entropy": 6.282506227493286,
"epoch": 0.07527132687594819,
"grad_norm": 1.09375,
"learning_rate": 0.000489774416005319,
"loss": 6.2793,
"mean_token_accuracy": 0.11793802455067634,
"num_tokens": 2448339.0,
"step": 1290
},
{
"entropy": 6.3312074661254885,
"epoch": 0.07556307620492472,
"grad_norm": 1.03125,
"learning_rate": 0.0004894203518413742,
"loss": 6.3356,
"mean_token_accuracy": 0.11392701491713524,
"num_tokens": 2458432.0,
"step": 1295
},
{
"entropy": 6.3252379417419435,
"epoch": 0.07585482553390127,
"grad_norm": 0.96875,
"learning_rate": 0.0004890604092351701,
"loss": 6.3885,
"mean_token_accuracy": 0.11167708337306977,
"num_tokens": 2468257.0,
"step": 1300
},
{
"entropy": 6.410771226882934,
"epoch": 0.07614657486287782,
"grad_norm": 1.0234375,
"learning_rate": 0.000488694598054715,
"loss": 6.3856,
"mean_token_accuracy": 0.11263055056333542,
"num_tokens": 2477267.0,
"step": 1305
},
{
"entropy": 6.425689220428467,
"epoch": 0.07643832419185435,
"grad_norm": 0.97265625,
"learning_rate": 0.0004883229283289071,
"loss": 6.3308,
"mean_token_accuracy": 0.10780216380953789,
"num_tokens": 2485952.0,
"step": 1310
},
{
"entropy": 6.379551649093628,
"epoch": 0.0767300735208309,
"grad_norm": 1.125,
"learning_rate": 0.00048794541024725993,
"loss": 6.4322,
"mean_token_accuracy": 0.1152675449848175,
"num_tokens": 2495289.0,
"step": 1315
},
{
"entropy": 6.50159215927124,
"epoch": 0.07702182284980745,
"grad_norm": 1.0390625,
"learning_rate": 0.0004875620541596221,
"loss": 6.3428,
"mean_token_accuracy": 0.11285355165600777,
"num_tokens": 2505304.0,
"step": 1320
},
{
"entropy": 6.3611382961273195,
"epoch": 0.07731357217878398,
"grad_norm": 1.0390625,
"learning_rate": 0.00048717287057589454,
"loss": 6.3711,
"mean_token_accuracy": 0.11867863908410073,
"num_tokens": 2515436.0,
"step": 1325
},
{
"entropy": 6.414155960083008,
"epoch": 0.07760532150776053,
"grad_norm": 0.94921875,
"learning_rate": 0.0004867778701657417,
"loss": 6.4959,
"mean_token_accuracy": 0.10673807635903358,
"num_tokens": 2525195.0,
"step": 1330
},
{
"entropy": 6.472268724441529,
"epoch": 0.07789707083673708,
"grad_norm": 1.078125,
"learning_rate": 0.00048637706375829955,
"loss": 6.329,
"mean_token_accuracy": 0.12044179886579513,
"num_tokens": 2533900.0,
"step": 1335
},
{
"entropy": 6.299315404891968,
"epoch": 0.07818882016571362,
"grad_norm": 1.0234375,
"learning_rate": 0.000485970462341878,
"loss": 6.3818,
"mean_token_accuracy": 0.11268014311790467,
"num_tokens": 2543506.0,
"step": 1340
},
{
"entropy": 6.4526282787323,
"epoch": 0.07848056949469016,
"grad_norm": 0.98046875,
"learning_rate": 0.00048555807706366044,
"loss": 6.4108,
"mean_token_accuracy": 0.11387890353798866,
"num_tokens": 2552899.0,
"step": 1345
},
{
"entropy": 6.348006105422973,
"epoch": 0.07877231882366671,
"grad_norm": 0.9375,
"learning_rate": 0.00048513991922939756,
"loss": 6.3313,
"mean_token_accuracy": 0.11401514112949371,
"num_tokens": 2563020.0,
"step": 1350
},
{
"entropy": 6.369770574569702,
"epoch": 0.07906406815264325,
"grad_norm": 1.09375,
"learning_rate": 0.00048471600030309744,
"loss": 6.3511,
"mean_token_accuracy": 0.11567247584462166,
"num_tokens": 2571784.0,
"step": 1355
},
{
"entropy": 6.307307720184326,
"epoch": 0.0793558174816198,
"grad_norm": 1.15625,
"learning_rate": 0.00048428633190671186,
"loss": 6.3938,
"mean_token_accuracy": 0.11736602932214737,
"num_tokens": 2580879.0,
"step": 1360
},
{
"entropy": 6.45410795211792,
"epoch": 0.07964756681059633,
"grad_norm": 1.046875,
"learning_rate": 0.0004838509258198167,
"loss": 6.3383,
"mean_token_accuracy": 0.11524840667843819,
"num_tokens": 2589398.0,
"step": 1365
},
{
"entropy": 6.316630792617798,
"epoch": 0.07993931613957288,
"grad_norm": 1.0859375,
"learning_rate": 0.00048340979397929,
"loss": 6.3257,
"mean_token_accuracy": 0.1217143066227436,
"num_tokens": 2598446.0,
"step": 1370
},
{
"entropy": 6.411429595947266,
"epoch": 0.08023106546854943,
"grad_norm": 1.1640625,
"learning_rate": 0.00048296294847898386,
"loss": 6.4564,
"mean_token_accuracy": 0.11443509832024575,
"num_tokens": 2608646.0,
"step": 1375
},
{
"entropy": 6.5289661407470705,
"epoch": 0.08052281479752596,
"grad_norm": 0.9921875,
"learning_rate": 0.0004825104015693934,
"loss": 6.5233,
"mean_token_accuracy": 0.10254140794277192,
"num_tokens": 2619588.0,
"step": 1380
},
{
"entropy": 6.416348648071289,
"epoch": 0.08081456412650251,
"grad_norm": 1.0234375,
"learning_rate": 0.0004820521656573208,
"loss": 6.3574,
"mean_token_accuracy": 0.11526949927210808,
"num_tokens": 2628585.0,
"step": 1385
},
{
"entropy": 6.382719421386719,
"epoch": 0.08110631345547906,
"grad_norm": 1.15625,
"learning_rate": 0.00048158825330553505,
"loss": 6.2697,
"mean_token_accuracy": 0.12054040431976318,
"num_tokens": 2636965.0,
"step": 1390
},
{
"entropy": 6.318143606185913,
"epoch": 0.08139806278445559,
"grad_norm": 1.09375,
"learning_rate": 0.00048111867723242763,
"loss": 6.2257,
"mean_token_accuracy": 0.12370629087090493,
"num_tokens": 2645926.0,
"step": 1395
},
{
"entropy": 6.3341890335083,
"epoch": 0.08168981211343214,
"grad_norm": 1.09375,
"learning_rate": 0.0004806434503116637,
"loss": 6.326,
"mean_token_accuracy": 0.11409061923623084,
"num_tokens": 2654566.0,
"step": 1400
},
{
"entropy": 6.446702146530152,
"epoch": 0.08198156144240869,
"grad_norm": 1.0859375,
"learning_rate": 0.0004801625855718296,
"loss": 6.4087,
"mean_token_accuracy": 0.11707663610577583,
"num_tokens": 2663383.0,
"step": 1405
},
{
"entropy": 6.315024089813233,
"epoch": 0.08227331077138522,
"grad_norm": 1.015625,
"learning_rate": 0.00047967609619607477,
"loss": 6.2755,
"mean_token_accuracy": 0.1180037334561348,
"num_tokens": 2672567.0,
"step": 1410
},
{
"entropy": 6.357727575302124,
"epoch": 0.08256506010036177,
"grad_norm": 1.0546875,
"learning_rate": 0.0004791839955217513,
"loss": 6.4337,
"mean_token_accuracy": 0.11114252284169197,
"num_tokens": 2681966.0,
"step": 1415
},
{
"entropy": 6.441995429992676,
"epoch": 0.08285680942933832,
"grad_norm": 1.0546875,
"learning_rate": 0.00047868629704004786,
"loss": 6.3481,
"mean_token_accuracy": 0.11805550679564476,
"num_tokens": 2690215.0,
"step": 1420
},
{
"entropy": 6.332686853408814,
"epoch": 0.08314855875831485,
"grad_norm": 1.140625,
"learning_rate": 0.00047818301439561965,
"loss": 6.393,
"mean_token_accuracy": 0.11177687272429467,
"num_tokens": 2700766.0,
"step": 1425
},
{
"entropy": 6.261061716079712,
"epoch": 0.0834403080872914,
"grad_norm": 1.1640625,
"learning_rate": 0.00047767416138621454,
"loss": 6.2868,
"mean_token_accuracy": 0.11431297659873962,
"num_tokens": 2710028.0,
"step": 1430
},
{
"entropy": 6.5042167663574215,
"epoch": 0.08373205741626795,
"grad_norm": 1.0546875,
"learning_rate": 0.000477159751962295,
"loss": 6.4711,
"mean_token_accuracy": 0.11762162894010544,
"num_tokens": 2720628.0,
"step": 1435
},
{
"entropy": 6.23676061630249,
"epoch": 0.08402380674524448,
"grad_norm": 1.09375,
"learning_rate": 0.00047663980022665507,
"loss": 6.2522,
"mean_token_accuracy": 0.11971108093857766,
"num_tokens": 2729826.0,
"step": 1440
},
{
"entropy": 6.443781185150146,
"epoch": 0.08431555607422103,
"grad_norm": 1.03125,
"learning_rate": 0.00047611432043403437,
"loss": 6.4593,
"mean_token_accuracy": 0.11329575181007386,
"num_tokens": 2739937.0,
"step": 1445
},
{
"entropy": 6.39516134262085,
"epoch": 0.08460730540319757,
"grad_norm": 1.0234375,
"learning_rate": 0.0004755833269907267,
"loss": 6.4063,
"mean_token_accuracy": 0.11360016688704491,
"num_tokens": 2749542.0,
"step": 1450
},
{
"entropy": 6.336669158935547,
"epoch": 0.08489905473217411,
"grad_norm": 1.015625,
"learning_rate": 0.0004750468344541857,
"loss": 6.3085,
"mean_token_accuracy": 0.12215447798371315,
"num_tokens": 2759545.0,
"step": 1455
},
{
"entropy": 6.356807231903076,
"epoch": 0.08519080406115066,
"grad_norm": 1.0234375,
"learning_rate": 0.00047450485753262525,
"loss": 6.3257,
"mean_token_accuracy": 0.12252013981342316,
"num_tokens": 2769065.0,
"step": 1460
},
{
"entropy": 6.375159883499146,
"epoch": 0.0854825533901272,
"grad_norm": 1.078125,
"learning_rate": 0.00047395741108461633,
"loss": 6.2551,
"mean_token_accuracy": 0.11856821104884148,
"num_tokens": 2778608.0,
"step": 1465
},
{
"entropy": 6.184617376327514,
"epoch": 0.08577430271910375,
"grad_norm": 1.15625,
"learning_rate": 0.00047340451011867985,
"loss": 6.2887,
"mean_token_accuracy": 0.12425651028752327,
"num_tokens": 2787723.0,
"step": 1470
},
{
"entropy": 6.407329750061035,
"epoch": 0.0860660520480803,
"grad_norm": 1.0,
"learning_rate": 0.00047284616979287515,
"loss": 6.2254,
"mean_token_accuracy": 0.1285393789410591,
"num_tokens": 2796385.0,
"step": 1475
},
{
"entropy": 6.187299633026123,
"epoch": 0.08635780137705683,
"grad_norm": 1.1171875,
"learning_rate": 0.00047228240541438433,
"loss": 6.2521,
"mean_token_accuracy": 0.12240941449999809,
"num_tokens": 2805425.0,
"step": 1480
},
{
"entropy": 6.419047546386719,
"epoch": 0.08664955070603338,
"grad_norm": 1.015625,
"learning_rate": 0.00047171323243909257,
"loss": 6.4074,
"mean_token_accuracy": 0.11365959122776985,
"num_tokens": 2816947.0,
"step": 1485
},
{
"entropy": 6.266291618347168,
"epoch": 0.08694130003500992,
"grad_norm": 1.140625,
"learning_rate": 0.00047113866647116457,
"loss": 6.3063,
"mean_token_accuracy": 0.12005587667226791,
"num_tokens": 2826701.0,
"step": 1490
},
{
"entropy": 6.427331399917603,
"epoch": 0.08723304936398646,
"grad_norm": 1.109375,
"learning_rate": 0.0004705587232626164,
"loss": 6.3071,
"mean_token_accuracy": 0.1235899992287159,
"num_tokens": 2836591.0,
"step": 1495
},
{
"entropy": 6.238853168487549,
"epoch": 0.08752479869296301,
"grad_norm": 1.0546875,
"learning_rate": 0.00046997341871288424,
"loss": 6.2287,
"mean_token_accuracy": 0.12085602730512619,
"num_tokens": 2844624.0,
"step": 1500
},
{
"entropy": 6.5039948463439945,
"epoch": 0.08781654802193956,
"grad_norm": 1.03125,
"learning_rate": 0.0004693827688683879,
"loss": 6.3706,
"mean_token_accuracy": 0.11352829337120056,
"num_tokens": 2853736.0,
"step": 1505
},
{
"entropy": 6.2476152896881105,
"epoch": 0.08810829735091609,
"grad_norm": 1.2109375,
"learning_rate": 0.0004687867899220914,
"loss": 6.2534,
"mean_token_accuracy": 0.11727567315101624,
"num_tokens": 2863176.0,
"step": 1510
},
{
"entropy": 6.279230070114136,
"epoch": 0.08840004667989264,
"grad_norm": 0.953125,
"learning_rate": 0.00046818549821305846,
"loss": 6.2798,
"mean_token_accuracy": 0.11535517126321793,
"num_tokens": 2872087.0,
"step": 1515
},
{
"entropy": 6.298987531661988,
"epoch": 0.08869179600886919,
"grad_norm": 1.0,
"learning_rate": 0.00046757891022600494,
"loss": 6.355,
"mean_token_accuracy": 0.11613577753305435,
"num_tokens": 2882916.0,
"step": 1520
},
{
"entropy": 6.26947922706604,
"epoch": 0.08898354533784572,
"grad_norm": 0.92578125,
"learning_rate": 0.0004669670425908471,
"loss": 6.2438,
"mean_token_accuracy": 0.12345949336886405,
"num_tokens": 2893116.0,
"step": 1525
},
{
"entropy": 6.363525342941284,
"epoch": 0.08927529466682227,
"grad_norm": 1.0234375,
"learning_rate": 0.0004663499120822451,
"loss": 6.3962,
"mean_token_accuracy": 0.10942287668585778,
"num_tokens": 2902419.0,
"step": 1530
},
{
"entropy": 6.405201196670532,
"epoch": 0.0895670439957988,
"grad_norm": 1.09375,
"learning_rate": 0.0004657275356191437,
"loss": 6.2938,
"mean_token_accuracy": 0.1213503472507,
"num_tokens": 2911300.0,
"step": 1535
},
{
"entropy": 6.345795631408691,
"epoch": 0.08985879332477535,
"grad_norm": 0.9921875,
"learning_rate": 0.00046509993026430804,
"loss": 6.3545,
"mean_token_accuracy": 0.1187653012573719,
"num_tokens": 2921190.0,
"step": 1540
},
{
"entropy": 6.468287611007691,
"epoch": 0.0901505426537519,
"grad_norm": 0.9765625,
"learning_rate": 0.0004644671132238558,
"loss": 6.4109,
"mean_token_accuracy": 0.11848839297890663,
"num_tokens": 2931964.0,
"step": 1545
},
{
"entropy": 6.317207956314087,
"epoch": 0.09044229198272843,
"grad_norm": 1.109375,
"learning_rate": 0.00046382910184678585,
"loss": 6.2755,
"mean_token_accuracy": 0.11598291173577309,
"num_tokens": 2940780.0,
"step": 1550
},
{
"entropy": 6.33673996925354,
"epoch": 0.09073404131170498,
"grad_norm": 1.109375,
"learning_rate": 0.0004631859136245025,
"loss": 6.3085,
"mean_token_accuracy": 0.11326714009046554,
"num_tokens": 2949537.0,
"step": 1555
},
{
"entropy": 6.271080875396729,
"epoch": 0.09102579064068153,
"grad_norm": 1.0546875,
"learning_rate": 0.0004625375661903357,
"loss": 6.3005,
"mean_token_accuracy": 0.12357675582170487,
"num_tokens": 2959034.0,
"step": 1560
},
{
"entropy": 6.347681617736816,
"epoch": 0.09131753996965807,
"grad_norm": 0.86328125,
"learning_rate": 0.00046188407731905787,
"loss": 6.2425,
"mean_token_accuracy": 0.11625017821788788,
"num_tokens": 2968480.0,
"step": 1565
},
{
"entropy": 6.238370418548584,
"epoch": 0.09160928929863461,
"grad_norm": 0.9609375,
"learning_rate": 0.00046122546492639643,
"loss": 6.2272,
"mean_token_accuracy": 0.12265427559614181,
"num_tokens": 2977911.0,
"step": 1570
},
{
"entropy": 6.211631393432617,
"epoch": 0.09190103862761116,
"grad_norm": 1.0546875,
"learning_rate": 0.000460561747068543,
"loss": 6.3499,
"mean_token_accuracy": 0.1291658066213131,
"num_tokens": 2987139.0,
"step": 1575
},
{
"entropy": 6.402784824371338,
"epoch": 0.0921927879565877,
"grad_norm": 0.9921875,
"learning_rate": 0.0004598929419416578,
"loss": 6.2812,
"mean_token_accuracy": 0.12039563283324242,
"num_tokens": 2996496.0,
"step": 1580
},
{
"entropy": 6.420582628250122,
"epoch": 0.09248453728556424,
"grad_norm": 1.125,
"learning_rate": 0.00045921906788137123,
"loss": 6.3001,
"mean_token_accuracy": 0.11506841331720352,
"num_tokens": 3005691.0,
"step": 1585
},
{
"entropy": 6.272823667526245,
"epoch": 0.09277628661454079,
"grad_norm": 0.97265625,
"learning_rate": 0.00045854014336228115,
"loss": 6.3014,
"mean_token_accuracy": 0.12312400192022324,
"num_tokens": 3015044.0,
"step": 1590
},
{
"entropy": 6.450143337249756,
"epoch": 0.09306803594351733,
"grad_norm": 1.09375,
"learning_rate": 0.00045785618699744615,
"loss": 6.4255,
"mean_token_accuracy": 0.11360339000821114,
"num_tokens": 3024195.0,
"step": 1595
},
{
"entropy": 6.354039144515991,
"epoch": 0.09335978527249388,
"grad_norm": 1.0546875,
"learning_rate": 0.00045716721753787543,
"loss": 6.2459,
"mean_token_accuracy": 0.11926767155528069,
"num_tokens": 3033701.0,
"step": 1600
},
{
"entropy": 6.228268671035766,
"epoch": 0.09365153460147041,
"grad_norm": 0.984375,
"learning_rate": 0.0004564732538720148,
"loss": 6.2753,
"mean_token_accuracy": 0.12374345734715461,
"num_tokens": 3043541.0,
"step": 1605
},
{
"entropy": 6.303274917602539,
"epoch": 0.09394328393044696,
"grad_norm": 1.0,
"learning_rate": 0.00045577431502522877,
"loss": 6.2592,
"mean_token_accuracy": 0.1281718336045742,
"num_tokens": 3053489.0,
"step": 1610
},
{
"entropy": 6.252635860443116,
"epoch": 0.0942350332594235,
"grad_norm": 1.0,
"learning_rate": 0.0004550704201592787,
"loss": 6.2725,
"mean_token_accuracy": 0.12302799075841904,
"num_tokens": 3062904.0,
"step": 1615
},
{
"entropy": 6.202295446395874,
"epoch": 0.09452678258840004,
"grad_norm": 1.1484375,
"learning_rate": 0.0004543615885717981,
"loss": 6.0565,
"mean_token_accuracy": 0.1329715795814991,
"num_tokens": 3072021.0,
"step": 1620
},
{
"entropy": 6.1748401641845705,
"epoch": 0.09481853191737659,
"grad_norm": 1.0234375,
"learning_rate": 0.00045364783969576296,
"loss": 6.2428,
"mean_token_accuracy": 0.11738629788160324,
"num_tokens": 3082016.0,
"step": 1625
},
{
"entropy": 6.369678926467896,
"epoch": 0.09511028124635314,
"grad_norm": 1.0234375,
"learning_rate": 0.0004529291930989592,
"loss": 6.2417,
"mean_token_accuracy": 0.12121309861540794,
"num_tokens": 3091996.0,
"step": 1630
},
{
"entropy": 6.229206562042236,
"epoch": 0.09540203057532967,
"grad_norm": 1.0078125,
"learning_rate": 0.0004522056684834464,
"loss": 6.1711,
"mean_token_accuracy": 0.12580040022730826,
"num_tokens": 3101944.0,
"step": 1635
},
{
"entropy": 6.121789741516113,
"epoch": 0.09569377990430622,
"grad_norm": 1.109375,
"learning_rate": 0.0004514772856850173,
"loss": 6.1806,
"mean_token_accuracy": 0.12133874893188476,
"num_tokens": 3110666.0,
"step": 1640
},
{
"entropy": 6.4672160148620605,
"epoch": 0.09598552923328277,
"grad_norm": 1.015625,
"learning_rate": 0.0004507440646726542,
"loss": 6.3902,
"mean_token_accuracy": 0.11804559379816056,
"num_tokens": 3120370.0,
"step": 1645
},
{
"entropy": 6.264255619049072,
"epoch": 0.0962772785622593,
"grad_norm": 0.97265625,
"learning_rate": 0.0004500060255479818,
"loss": 6.1807,
"mean_token_accuracy": 0.12386891469359398,
"num_tokens": 3130025.0,
"step": 1650
},
{
"entropy": 6.22208800315857,
"epoch": 0.09656902789123585,
"grad_norm": 1.0,
"learning_rate": 0.0004492631885447151,
"loss": 6.2496,
"mean_token_accuracy": 0.11741102412343025,
"num_tokens": 3140065.0,
"step": 1655
},
{
"entropy": 6.287959051132202,
"epoch": 0.0968607772202124,
"grad_norm": 1.1171875,
"learning_rate": 0.00044851557402810616,
"loss": 6.3009,
"mean_token_accuracy": 0.124704909324646,
"num_tokens": 3148891.0,
"step": 1660
},
{
"entropy": 6.357010126113892,
"epoch": 0.09715252654918893,
"grad_norm": 1.0625,
"learning_rate": 0.00044776320249438444,
"loss": 6.2193,
"mean_token_accuracy": 0.12245449349284172,
"num_tokens": 3158349.0,
"step": 1665
},
{
"entropy": 6.240838527679443,
"epoch": 0.09744427587816548,
"grad_norm": 1.0390625,
"learning_rate": 0.00044700609457019565,
"loss": 6.3556,
"mean_token_accuracy": 0.11844354793429375,
"num_tokens": 3168214.0,
"step": 1670
},
{
"entropy": 6.300184059143066,
"epoch": 0.09773602520714203,
"grad_norm": 0.921875,
"learning_rate": 0.0004462442710120359,
"loss": 6.1448,
"mean_token_accuracy": 0.12163960486650467,
"num_tokens": 3178119.0,
"step": 1675
},
{
"entropy": 6.314942026138306,
"epoch": 0.09802777453611856,
"grad_norm": 1.0234375,
"learning_rate": 0.000445477752705683,
"loss": 6.2403,
"mean_token_accuracy": 0.12064114734530448,
"num_tokens": 3187060.0,
"step": 1680
},
{
"entropy": 6.250327491760254,
"epoch": 0.09831952386509511,
"grad_norm": 0.97265625,
"learning_rate": 0.00044470656066562336,
"loss": 6.3025,
"mean_token_accuracy": 0.12025051936507225,
"num_tokens": 3196468.0,
"step": 1685
},
{
"entropy": 6.3662707805633545,
"epoch": 0.09861127319407165,
"grad_norm": 1.0078125,
"learning_rate": 0.0004439307160344765,
"loss": 6.2003,
"mean_token_accuracy": 0.1232446551322937,
"num_tokens": 3205009.0,
"step": 1690
},
{
"entropy": 6.1288464069366455,
"epoch": 0.0989030225230482,
"grad_norm": 1.0546875,
"learning_rate": 0.00044315024008241473,
"loss": 6.1478,
"mean_token_accuracy": 0.12729258313775063,
"num_tokens": 3213666.0,
"step": 1695
},
{
"entropy": 6.288136625289917,
"epoch": 0.09919477185202474,
"grad_norm": 1.0546875,
"learning_rate": 0.0004423651542065806,
"loss": 6.1941,
"mean_token_accuracy": 0.13063909932971002,
"num_tokens": 3223124.0,
"step": 1700
},
{
"entropy": 6.193147420883179,
"epoch": 0.09948652118100128,
"grad_norm": 1.0546875,
"learning_rate": 0.00044157547993050006,
"loss": 6.2283,
"mean_token_accuracy": 0.12324749156832696,
"num_tokens": 3232784.0,
"step": 1705
},
{
"entropy": 6.303015089035034,
"epoch": 0.09977827050997783,
"grad_norm": 1.0234375,
"learning_rate": 0.00044078123890349227,
"loss": 6.2131,
"mean_token_accuracy": 0.12409283444285393,
"num_tokens": 3242296.0,
"step": 1710
},
{
"entropy": 6.229840278625488,
"epoch": 0.10007001983895437,
"grad_norm": 1.53125,
"learning_rate": 0.00043998245290007606,
"loss": 6.2414,
"mean_token_accuracy": 0.12382307648658752,
"num_tokens": 3251954.0,
"step": 1715
},
{
"entropy": 6.19064416885376,
"epoch": 0.10036176916793091,
"grad_norm": 1.0078125,
"learning_rate": 0.00043917914381937323,
"loss": 6.1897,
"mean_token_accuracy": 0.11765580922365189,
"num_tokens": 3261115.0,
"step": 1720
},
{
"entropy": 6.189918899536133,
"epoch": 0.10065351849690746,
"grad_norm": 1.1171875,
"learning_rate": 0.00043837133368450815,
"loss": 6.1931,
"mean_token_accuracy": 0.12054690048098564,
"num_tokens": 3269896.0,
"step": 1725
},
{
"entropy": 6.284554767608642,
"epoch": 0.100945267825884,
"grad_norm": 0.9921875,
"learning_rate": 0.0004375590446420037,
"loss": 6.16,
"mean_token_accuracy": 0.12517104819417,
"num_tokens": 3280066.0,
"step": 1730
},
{
"entropy": 6.189452266693115,
"epoch": 0.10123701715486054,
"grad_norm": 1.0859375,
"learning_rate": 0.0004367422989611743,
"loss": 6.1386,
"mean_token_accuracy": 0.12676257863640786,
"num_tokens": 3289378.0,
"step": 1735
},
{
"entropy": 6.276723575592041,
"epoch": 0.10152876648383709,
"grad_norm": 0.984375,
"learning_rate": 0.0004359211190335153,
"loss": 6.3124,
"mean_token_accuracy": 0.12249552607536315,
"num_tokens": 3299529.0,
"step": 1740
},
{
"entropy": 6.3476848125457765,
"epoch": 0.10182051581281364,
"grad_norm": 1.0703125,
"learning_rate": 0.00043509552737208923,
"loss": 6.2807,
"mean_token_accuracy": 0.1219617947936058,
"num_tokens": 3308265.0,
"step": 1745
},
{
"entropy": 6.2723053932189945,
"epoch": 0.10211226514179017,
"grad_norm": 1.03125,
"learning_rate": 0.00043426554661090853,
"loss": 6.2029,
"mean_token_accuracy": 0.12301502600312234,
"num_tokens": 3318062.0,
"step": 1750
},
{
"entropy": 6.362277698516846,
"epoch": 0.10240401447076672,
"grad_norm": 0.98828125,
"learning_rate": 0.00043343119950431516,
"loss": 6.3285,
"mean_token_accuracy": 0.1206172190606594,
"num_tokens": 3328561.0,
"step": 1755
},
{
"entropy": 6.213156986236572,
"epoch": 0.10269576379974327,
"grad_norm": 0.99609375,
"learning_rate": 0.00043259250892635644,
"loss": 6.2485,
"mean_token_accuracy": 0.12045412585139274,
"num_tokens": 3338052.0,
"step": 1760
},
{
"entropy": 6.214480304718018,
"epoch": 0.1029875131287198,
"grad_norm": 1.0,
"learning_rate": 0.0004317494978701582,
"loss": 6.1606,
"mean_token_accuracy": 0.1277881905436516,
"num_tokens": 3349357.0,
"step": 1765
},
{
"entropy": 6.226798820495605,
"epoch": 0.10327926245769635,
"grad_norm": 1.015625,
"learning_rate": 0.0004309021894472943,
"loss": 6.1348,
"mean_token_accuracy": 0.12920267134904861,
"num_tokens": 3359030.0,
"step": 1770
},
{
"entropy": 6.139141702651978,
"epoch": 0.10357101178667288,
"grad_norm": 1.1953125,
"learning_rate": 0.0004300506068871534,
"loss": 6.1265,
"mean_token_accuracy": 0.13153293505311012,
"num_tokens": 3367702.0,
"step": 1775
},
{
"entropy": 6.308718204498291,
"epoch": 0.10386276111564943,
"grad_norm": 1.109375,
"learning_rate": 0.00042919477353630135,
"loss": 6.146,
"mean_token_accuracy": 0.1294103018939495,
"num_tokens": 3376626.0,
"step": 1780
},
{
"entropy": 6.128504610061645,
"epoch": 0.10415451044462598,
"grad_norm": 1.0390625,
"learning_rate": 0.000428334712857842,
"loss": 6.1039,
"mean_token_accuracy": 0.12742208167910576,
"num_tokens": 3386301.0,
"step": 1785
},
{
"entropy": 6.205838346481324,
"epoch": 0.10444625977360252,
"grad_norm": 1.0390625,
"learning_rate": 0.00042747044843077304,
"loss": 6.1932,
"mean_token_accuracy": 0.12324661612510682,
"num_tokens": 3396104.0,
"step": 1790
},
{
"entropy": 6.306753921508789,
"epoch": 0.10473800910257906,
"grad_norm": 1.0234375,
"learning_rate": 0.00042660200394934047,
"loss": 6.2169,
"mean_token_accuracy": 0.12297144085168839,
"num_tokens": 3405123.0,
"step": 1795
},
{
"entropy": 6.220966863632202,
"epoch": 0.10502975843155561,
"grad_norm": 0.97265625,
"learning_rate": 0.00042572940322238844,
"loss": 6.1626,
"mean_token_accuracy": 0.12484495714306831,
"num_tokens": 3414967.0,
"step": 1800
},
{
"entropy": 6.274843978881836,
"epoch": 0.10532150776053215,
"grad_norm": 0.90234375,
"learning_rate": 0.00042485267017270664,
"loss": 6.3424,
"mean_token_accuracy": 0.11909266263246536,
"num_tokens": 3425947.0,
"step": 1805
},
{
"entropy": 6.383258819580078,
"epoch": 0.1056132570895087,
"grad_norm": 0.953125,
"learning_rate": 0.0004239718288363745,
"loss": 6.2704,
"mean_token_accuracy": 0.12300543934106827,
"num_tokens": 3436012.0,
"step": 1810
},
{
"entropy": 6.266382646560669,
"epoch": 0.10590500641848524,
"grad_norm": 1.0,
"learning_rate": 0.0004230869033621023,
"loss": 6.1846,
"mean_token_accuracy": 0.11848850473761559,
"num_tokens": 3446474.0,
"step": 1815
},
{
"entropy": 6.16329665184021,
"epoch": 0.10619675574746178,
"grad_norm": 1.0078125,
"learning_rate": 0.0004221979180105688,
"loss": 6.0963,
"mean_token_accuracy": 0.13093286454677583,
"num_tokens": 3455491.0,
"step": 1820
},
{
"entropy": 6.145866918563843,
"epoch": 0.10648850507643833,
"grad_norm": 0.98828125,
"learning_rate": 0.00042130489715375645,
"loss": 6.0143,
"mean_token_accuracy": 0.13937579542398454,
"num_tokens": 3464418.0,
"step": 1825
},
{
"entropy": 6.21917028427124,
"epoch": 0.10678025440541487,
"grad_norm": 1.1328125,
"learning_rate": 0.00042040786527428335,
"loss": 6.1965,
"mean_token_accuracy": 0.12161976620554923,
"num_tokens": 3472877.0,
"step": 1830
},
{
"entropy": 6.186547470092774,
"epoch": 0.10707200373439141,
"grad_norm": 1.03125,
"learning_rate": 0.0004195068469647315,
"loss": 6.1542,
"mean_token_accuracy": 0.12836315035820006,
"num_tokens": 3483037.0,
"step": 1835
},
{
"entropy": 6.19683837890625,
"epoch": 0.10736375306336796,
"grad_norm": 0.9453125,
"learning_rate": 0.00041860186692697297,
"loss": 6.083,
"mean_token_accuracy": 0.1275312103331089,
"num_tokens": 3492873.0,
"step": 1840
},
{
"entropy": 6.1625336647033695,
"epoch": 0.1076555023923445,
"grad_norm": 1.1171875,
"learning_rate": 0.00041769294997149264,
"loss": 6.2381,
"mean_token_accuracy": 0.12316666096448899,
"num_tokens": 3501842.0,
"step": 1845
},
{
"entropy": 6.2700042724609375,
"epoch": 0.10794725172132104,
"grad_norm": 1.0625,
"learning_rate": 0.0004167801210167081,
"loss": 6.1544,
"mean_token_accuracy": 0.12415701374411584,
"num_tokens": 3510415.0,
"step": 1850
},
{
"entropy": 6.35073299407959,
"epoch": 0.10823900105029759,
"grad_norm": 1.0234375,
"learning_rate": 0.0004158634050882861,
"loss": 6.3202,
"mean_token_accuracy": 0.11843622103333473,
"num_tokens": 3521437.0,
"step": 1855
},
{
"entropy": 6.284471845626831,
"epoch": 0.10853075037927412,
"grad_norm": 1.0234375,
"learning_rate": 0.0004149428273184569,
"loss": 6.2712,
"mean_token_accuracy": 0.12350925728678704,
"num_tokens": 3531733.0,
"step": 1860
},
{
"entropy": 6.20415997505188,
"epoch": 0.10882249970825067,
"grad_norm": 1.046875,
"learning_rate": 0.0004140184129453253,
"loss": 6.0453,
"mean_token_accuracy": 0.13318468108773232,
"num_tokens": 3540724.0,
"step": 1865
},
{
"entropy": 6.169241571426392,
"epoch": 0.10911424903722722,
"grad_norm": 1.078125,
"learning_rate": 0.000413090187312178,
"loss": 6.1824,
"mean_token_accuracy": 0.1301153838634491,
"num_tokens": 3551015.0,
"step": 1870
},
{
"entropy": 6.233869838714599,
"epoch": 0.10940599836620375,
"grad_norm": 1.0859375,
"learning_rate": 0.0004121581758667898,
"loss": 6.2521,
"mean_token_accuracy": 0.1265456885099411,
"num_tokens": 3560526.0,
"step": 1875
},
{
"entropy": 6.1837160110473635,
"epoch": 0.1096977476951803,
"grad_norm": 1.0078125,
"learning_rate": 0.00041122240416072533,
"loss": 6.1241,
"mean_token_accuracy": 0.12862038388848304,
"num_tokens": 3569966.0,
"step": 1880
},
{
"entropy": 6.278997421264648,
"epoch": 0.10998949702415685,
"grad_norm": 0.96484375,
"learning_rate": 0.0004102828978486385,
"loss": 6.111,
"mean_token_accuracy": 0.12866452112793922,
"num_tokens": 3579061.0,
"step": 1885
},
{
"entropy": 6.257272148132325,
"epoch": 0.11028124635313338,
"grad_norm": 1.109375,
"learning_rate": 0.0004093396826875695,
"loss": 6.1377,
"mean_token_accuracy": 0.12756876572966575,
"num_tokens": 3587633.0,
"step": 1890
},
{
"entropy": 6.2344451427459715,
"epoch": 0.11057299568210993,
"grad_norm": 1.0078125,
"learning_rate": 0.00040839278453623837,
"loss": 6.0465,
"mean_token_accuracy": 0.13229672834277154,
"num_tokens": 3597136.0,
"step": 1895
},
{
"entropy": 6.11575870513916,
"epoch": 0.11086474501108648,
"grad_norm": 1.15625,
"learning_rate": 0.0004074422293543363,
"loss": 6.0951,
"mean_token_accuracy": 0.12402657866477966,
"num_tokens": 3605948.0,
"step": 1900
},
{
"entropy": 6.241190814971924,
"epoch": 0.11115649434006301,
"grad_norm": 1.0859375,
"learning_rate": 0.0004064880432018137,
"loss": 6.2258,
"mean_token_accuracy": 0.12266718074679375,
"num_tokens": 3615620.0,
"step": 1905
},
{
"entropy": 6.2283697605133055,
"epoch": 0.11144824366903956,
"grad_norm": 1.0625,
"learning_rate": 0.00040553025223816615,
"loss": 6.1949,
"mean_token_accuracy": 0.1251465432345867,
"num_tokens": 3624624.0,
"step": 1910
},
{
"entropy": 6.229434013366699,
"epoch": 0.11173999299801611,
"grad_norm": 0.9921875,
"learning_rate": 0.00040456888272171653,
"loss": 6.2181,
"mean_token_accuracy": 0.12829322069883348,
"num_tokens": 3634574.0,
"step": 1915
},
{
"entropy": 6.126652479171753,
"epoch": 0.11203174232699264,
"grad_norm": 1.015625,
"learning_rate": 0.00040360396100889577,
"loss": 6.0134,
"mean_token_accuracy": 0.1284105472266674,
"num_tokens": 3643991.0,
"step": 1920
},
{
"entropy": 6.069678211212159,
"epoch": 0.1123234916559692,
"grad_norm": 1.1328125,
"learning_rate": 0.0004026355135535202,
"loss": 6.0424,
"mean_token_accuracy": 0.134358549118042,
"num_tokens": 3652069.0,
"step": 1925
},
{
"entropy": 6.215138530731201,
"epoch": 0.11261524098494574,
"grad_norm": 0.98828125,
"learning_rate": 0.000401663566906066,
"loss": 6.2137,
"mean_token_accuracy": 0.12257095649838448,
"num_tokens": 3662227.0,
"step": 1930
},
{
"entropy": 6.292611455917358,
"epoch": 0.11290699031392228,
"grad_norm": 0.94921875,
"learning_rate": 0.00040068814771294134,
"loss": 6.1373,
"mean_token_accuracy": 0.13084000647068023,
"num_tokens": 3671511.0,
"step": 1935
},
{
"entropy": 6.098296356201172,
"epoch": 0.11319873964289882,
"grad_norm": 1.046875,
"learning_rate": 0.0003997092827157562,
"loss": 6.1175,
"mean_token_accuracy": 0.13061317726969718,
"num_tokens": 3680063.0,
"step": 1940
},
{
"entropy": 6.218745851516724,
"epoch": 0.11349048897187536,
"grad_norm": 1.0390625,
"learning_rate": 0.000398726998750589,
"loss": 6.1272,
"mean_token_accuracy": 0.12958021759986876,
"num_tokens": 3689299.0,
"step": 1945
},
{
"entropy": 6.187112522125244,
"epoch": 0.1137822383008519,
"grad_norm": 1.0078125,
"learning_rate": 0.00039774132274725076,
"loss": 6.1287,
"mean_token_accuracy": 0.1283968210220337,
"num_tokens": 3698071.0,
"step": 1950
},
{
"entropy": 6.100534152984619,
"epoch": 0.11407398762982845,
"grad_norm": 1.1328125,
"learning_rate": 0.00039675228172854707,
"loss": 6.0399,
"mean_token_accuracy": 0.12726911306381225,
"num_tokens": 3706773.0,
"step": 1955
},
{
"entropy": 6.179676485061646,
"epoch": 0.11436573695880499,
"grad_norm": 1.0546875,
"learning_rate": 0.0003957599028095371,
"loss": 6.0878,
"mean_token_accuracy": 0.12605519965291023,
"num_tokens": 3716814.0,
"step": 1960
},
{
"entropy": 6.254482316970825,
"epoch": 0.11465748628778154,
"grad_norm": 1.1015625,
"learning_rate": 0.00039476421319679017,
"loss": 6.1327,
"mean_token_accuracy": 0.12759872823953627,
"num_tokens": 3725596.0,
"step": 1965
},
{
"entropy": 6.121477890014648,
"epoch": 0.11494923561675809,
"grad_norm": 1.0859375,
"learning_rate": 0.00039376524018764,
"loss": 6.0897,
"mean_token_accuracy": 0.13351815789937974,
"num_tokens": 3734996.0,
"step": 1970
},
{
"entropy": 6.22856559753418,
"epoch": 0.11524098494573462,
"grad_norm": 1.0234375,
"learning_rate": 0.00039276301116943616,
"loss": 6.1254,
"mean_token_accuracy": 0.12725835070014,
"num_tokens": 3744109.0,
"step": 1975
},
{
"entropy": 6.288533735275268,
"epoch": 0.11553273427471117,
"grad_norm": 1.0546875,
"learning_rate": 0.0003917575536187936,
"loss": 6.1903,
"mean_token_accuracy": 0.11792054921388626,
"num_tokens": 3754416.0,
"step": 1980
},
{
"entropy": 6.226859855651855,
"epoch": 0.11582448360368772,
"grad_norm": 0.94140625,
"learning_rate": 0.00039074889510083894,
"loss": 6.2235,
"mean_token_accuracy": 0.11969063058495522,
"num_tokens": 3764401.0,
"step": 1985
},
{
"entropy": 6.328698396682739,
"epoch": 0.11611623293266425,
"grad_norm": 1.0390625,
"learning_rate": 0.00038973706326845495,
"loss": 6.2422,
"mean_token_accuracy": 0.12645296901464462,
"num_tokens": 3774098.0,
"step": 1990
},
{
"entropy": 6.225485849380493,
"epoch": 0.1164079822616408,
"grad_norm": 1.015625,
"learning_rate": 0.0003887220858615225,
"loss": 6.2042,
"mean_token_accuracy": 0.1278956189751625,
"num_tokens": 3783569.0,
"step": 1995
},
{
"entropy": 6.185959148406982,
"epoch": 0.11669973159061735,
"grad_norm": 0.9921875,
"learning_rate": 0.0003877039907061597,
"loss": 6.051,
"mean_token_accuracy": 0.11998816132545471,
"num_tokens": 3793898.0,
"step": 2000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5547433973760000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}