Files
ModelHub XC 87660c825f 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/swe-latn-100mb-ppt-Dp-100mb_seed10
Source: Original Platform
2026-08-06 01:01:17 +08:00

1035 lines
27 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.029174932897654337,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.69196834564209,
"epoch": 0.00029174932897654333,
"grad_norm": 13.0625,
"learning_rate": 2e-06,
"loss": 10.8036,
"mean_token_accuracy": 0.0,
"num_tokens": 9376.0,
"step": 5
},
{
"entropy": 10.691983699798584,
"epoch": 0.0005834986579530867,
"grad_norm": 13.0625,
"learning_rate": 4.5e-06,
"loss": 10.7354,
"mean_token_accuracy": 0.00011641443707048893,
"num_tokens": 18416.0,
"step": 10
},
{
"entropy": 10.690966510772705,
"epoch": 0.00087524798692963,
"grad_norm": 10.0625,
"learning_rate": 7e-06,
"loss": 10.5172,
"mean_token_accuracy": 0.029424548242241146,
"num_tokens": 27778.0,
"step": 15
},
{
"entropy": 10.678794956207275,
"epoch": 0.0011669973159061733,
"grad_norm": 5.90625,
"learning_rate": 9.5e-06,
"loss": 10.2454,
"mean_token_accuracy": 0.04061399847269058,
"num_tokens": 37698.0,
"step": 20
},
{
"entropy": 10.63073034286499,
"epoch": 0.0014587466448827168,
"grad_norm": 4.1875,
"learning_rate": 1.2e-05,
"loss": 9.9716,
"mean_token_accuracy": 0.04182791076600552,
"num_tokens": 47412.0,
"step": 25
},
{
"entropy": 10.602538585662842,
"epoch": 0.00175049597385926,
"grad_norm": 3.21875,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.7862,
"mean_token_accuracy": 0.04080851711332798,
"num_tokens": 56226.0,
"step": 30
},
{
"entropy": 10.595691585540772,
"epoch": 0.0020422453028358036,
"grad_norm": 2.859375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.6992,
"mean_token_accuracy": 0.04258432537317276,
"num_tokens": 65953.0,
"step": 35
},
{
"entropy": 10.587265396118164,
"epoch": 0.0023339946318123466,
"grad_norm": 2.703125,
"learning_rate": 1.95e-05,
"loss": 9.6666,
"mean_token_accuracy": 0.040068139880895616,
"num_tokens": 74939.0,
"step": 40
},
{
"entropy": 10.5896146774292,
"epoch": 0.00262574396078889,
"grad_norm": 2.5625,
"learning_rate": 2.2e-05,
"loss": 9.6425,
"mean_token_accuracy": 0.04199751690030098,
"num_tokens": 83855.0,
"step": 45
},
{
"entropy": 10.573621463775634,
"epoch": 0.0029174932897654336,
"grad_norm": 2.359375,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5754,
"mean_token_accuracy": 0.045654605329036715,
"num_tokens": 93561.0,
"step": 50
},
{
"entropy": 10.557998752593994,
"epoch": 0.003209242618741977,
"grad_norm": 2.1875,
"learning_rate": 2.7e-05,
"loss": 9.479,
"mean_token_accuracy": 0.05661129578948021,
"num_tokens": 103395.0,
"step": 55
},
{
"entropy": 10.49096736907959,
"epoch": 0.00350099194771852,
"grad_norm": 2.40625,
"learning_rate": 2.95e-05,
"loss": 9.4209,
"mean_token_accuracy": 0.05532712675631046,
"num_tokens": 112462.0,
"step": 60
},
{
"entropy": 10.353149223327637,
"epoch": 0.0037927412766950636,
"grad_norm": 2.34375,
"learning_rate": 3.2e-05,
"loss": 9.3195,
"mean_token_accuracy": 0.05394121035933495,
"num_tokens": 121553.0,
"step": 65
},
{
"entropy": 10.451189041137695,
"epoch": 0.004084490605671607,
"grad_norm": 2.234375,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.2945,
"mean_token_accuracy": 0.05459350645542145,
"num_tokens": 131138.0,
"step": 70
},
{
"entropy": 10.415141296386718,
"epoch": 0.00437623993464815,
"grad_norm": 2.140625,
"learning_rate": 3.7e-05,
"loss": 9.2235,
"mean_token_accuracy": 0.05688905864953995,
"num_tokens": 140171.0,
"step": 75
},
{
"entropy": 10.439569473266602,
"epoch": 0.004667989263624693,
"grad_norm": 2.046875,
"learning_rate": 3.95e-05,
"loss": 9.0989,
"mean_token_accuracy": 0.055916853994131085,
"num_tokens": 149483.0,
"step": 80
},
{
"entropy": 10.392880725860596,
"epoch": 0.004959738592601237,
"grad_norm": 1.8984375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.0805,
"mean_token_accuracy": 0.05239327773451805,
"num_tokens": 159190.0,
"step": 85
},
{
"entropy": 10.381812000274659,
"epoch": 0.00525148792157778,
"grad_norm": 1.84375,
"learning_rate": 4.45e-05,
"loss": 8.9431,
"mean_token_accuracy": 0.05531255267560482,
"num_tokens": 169601.0,
"step": 90
},
{
"entropy": 10.296150207519531,
"epoch": 0.005543237250554324,
"grad_norm": 1.9765625,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.8622,
"mean_token_accuracy": 0.057431581988930704,
"num_tokens": 179268.0,
"step": 95
},
{
"entropy": 10.249444198608398,
"epoch": 0.005834986579530867,
"grad_norm": 2.875,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.7591,
"mean_token_accuracy": 0.05835646912455559,
"num_tokens": 188699.0,
"step": 100
},
{
"entropy": 10.191282558441163,
"epoch": 0.00612673590850741,
"grad_norm": 1.8359375,
"learning_rate": 5.2e-05,
"loss": 8.6842,
"mean_token_accuracy": 0.05705415904521942,
"num_tokens": 199939.0,
"step": 105
},
{
"entropy": 10.147027969360352,
"epoch": 0.006418485237483954,
"grad_norm": 2.0,
"learning_rate": 5.45e-05,
"loss": 8.5501,
"mean_token_accuracy": 0.06250228881835937,
"num_tokens": 209419.0,
"step": 110
},
{
"entropy": 10.024614429473877,
"epoch": 0.006710234566460497,
"grad_norm": 1.9375,
"learning_rate": 5.7e-05,
"loss": 8.4704,
"mean_token_accuracy": 0.06286126635968685,
"num_tokens": 218642.0,
"step": 115
},
{
"entropy": 9.988630104064942,
"epoch": 0.00700198389543704,
"grad_norm": 1.640625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.3393,
"mean_token_accuracy": 0.061313451081514356,
"num_tokens": 228358.0,
"step": 120
},
{
"entropy": 9.84273166656494,
"epoch": 0.007293733224413584,
"grad_norm": 1.875,
"learning_rate": 6.2e-05,
"loss": 8.1163,
"mean_token_accuracy": 0.0694800227880478,
"num_tokens": 237860.0,
"step": 125
},
{
"entropy": 9.692254257202148,
"epoch": 0.007585482553390127,
"grad_norm": 1.5625,
"learning_rate": 6.450000000000001e-05,
"loss": 8.1599,
"mean_token_accuracy": 0.06262776851654053,
"num_tokens": 247547.0,
"step": 130
},
{
"entropy": 9.467087554931641,
"epoch": 0.007877231882366671,
"grad_norm": 1.6015625,
"learning_rate": 6.7e-05,
"loss": 8.0195,
"mean_token_accuracy": 0.07063104063272477,
"num_tokens": 256405.0,
"step": 135
},
{
"entropy": 9.383435821533203,
"epoch": 0.008168981211343214,
"grad_norm": 1.421875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.9616,
"mean_token_accuracy": 0.06774205490946769,
"num_tokens": 265249.0,
"step": 140
},
{
"entropy": 9.17911729812622,
"epoch": 0.008460730540319757,
"grad_norm": 1.2265625,
"learning_rate": 7.2e-05,
"loss": 7.8784,
"mean_token_accuracy": 0.0681417278945446,
"num_tokens": 275681.0,
"step": 145
},
{
"entropy": 8.988021278381348,
"epoch": 0.0087524798692963,
"grad_norm": 1.4453125,
"learning_rate": 7.45e-05,
"loss": 7.7636,
"mean_token_accuracy": 0.07039406709372997,
"num_tokens": 284957.0,
"step": 150
},
{
"entropy": 8.73282070159912,
"epoch": 0.009044229198272843,
"grad_norm": 1.390625,
"learning_rate": 7.7e-05,
"loss": 7.6563,
"mean_token_accuracy": 0.07246890291571617,
"num_tokens": 294010.0,
"step": 155
},
{
"entropy": 8.682876682281494,
"epoch": 0.009335978527249386,
"grad_norm": 1.125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.7148,
"mean_token_accuracy": 0.07290182597935199,
"num_tokens": 303264.0,
"step": 160
},
{
"entropy": 8.486510944366454,
"epoch": 0.009627727856225931,
"grad_norm": 1.203125,
"learning_rate": 8.2e-05,
"loss": 7.5966,
"mean_token_accuracy": 0.07415391989052296,
"num_tokens": 313450.0,
"step": 165
},
{
"entropy": 8.362883186340332,
"epoch": 0.009919477185202474,
"grad_norm": 1.2265625,
"learning_rate": 8.450000000000001e-05,
"loss": 7.5375,
"mean_token_accuracy": 0.07450749576091767,
"num_tokens": 322764.0,
"step": 170
},
{
"entropy": 8.276646995544434,
"epoch": 0.010211226514179017,
"grad_norm": 1.296875,
"learning_rate": 8.7e-05,
"loss": 7.5492,
"mean_token_accuracy": 0.07559143453836441,
"num_tokens": 332228.0,
"step": 175
},
{
"entropy": 8.189496421813965,
"epoch": 0.01050297584315556,
"grad_norm": 1.296875,
"learning_rate": 8.95e-05,
"loss": 7.4578,
"mean_token_accuracy": 0.07792975381016731,
"num_tokens": 341589.0,
"step": 180
},
{
"entropy": 8.08325457572937,
"epoch": 0.010794725172132104,
"grad_norm": 1.09375,
"learning_rate": 9.2e-05,
"loss": 7.3998,
"mean_token_accuracy": 0.07972711473703384,
"num_tokens": 351166.0,
"step": 185
},
{
"entropy": 8.023299407958984,
"epoch": 0.011086474501108648,
"grad_norm": 1.25,
"learning_rate": 9.45e-05,
"loss": 7.4712,
"mean_token_accuracy": 0.07630453184247017,
"num_tokens": 360962.0,
"step": 190
},
{
"entropy": 7.986406993865967,
"epoch": 0.011378223830085191,
"grad_norm": 1.28125,
"learning_rate": 9.7e-05,
"loss": 7.4208,
"mean_token_accuracy": 0.07656608372926713,
"num_tokens": 370859.0,
"step": 195
},
{
"entropy": 7.958215236663818,
"epoch": 0.011669973159061734,
"grad_norm": 1.390625,
"learning_rate": 9.95e-05,
"loss": 7.4388,
"mean_token_accuracy": 0.07721348851919174,
"num_tokens": 381017.0,
"step": 200
},
{
"entropy": 7.953992605209351,
"epoch": 0.011961722488038277,
"grad_norm": 1.234375,
"learning_rate": 0.000102,
"loss": 7.4808,
"mean_token_accuracy": 0.07665727399289608,
"num_tokens": 390849.0,
"step": 205
},
{
"entropy": 7.941216659545899,
"epoch": 0.01225347181701482,
"grad_norm": 1.1171875,
"learning_rate": 0.00010449999999999999,
"loss": 7.4537,
"mean_token_accuracy": 0.07717064693570137,
"num_tokens": 401131.0,
"step": 210
},
{
"entropy": 7.940151929855347,
"epoch": 0.012545221145991364,
"grad_norm": 1.2109375,
"learning_rate": 0.000107,
"loss": 7.3567,
"mean_token_accuracy": 0.07789909988641738,
"num_tokens": 410171.0,
"step": 215
},
{
"entropy": 7.845122528076172,
"epoch": 0.012836970474967908,
"grad_norm": 1.3984375,
"learning_rate": 0.0001095,
"loss": 7.4298,
"mean_token_accuracy": 0.07820538356900215,
"num_tokens": 419352.0,
"step": 220
},
{
"entropy": 7.826071691513062,
"epoch": 0.013128719803944451,
"grad_norm": 1.0625,
"learning_rate": 0.000112,
"loss": 7.2948,
"mean_token_accuracy": 0.08607594929635524,
"num_tokens": 428862.0,
"step": 225
},
{
"entropy": 7.802604389190674,
"epoch": 0.013420469132920994,
"grad_norm": 1.140625,
"learning_rate": 0.0001145,
"loss": 7.2856,
"mean_token_accuracy": 0.07789736986160278,
"num_tokens": 438900.0,
"step": 230
},
{
"entropy": 7.759540748596192,
"epoch": 0.013712218461897538,
"grad_norm": 1.25,
"learning_rate": 0.00011700000000000001,
"loss": 7.2419,
"mean_token_accuracy": 0.08156893700361252,
"num_tokens": 447867.0,
"step": 235
},
{
"entropy": 7.753300333023072,
"epoch": 0.01400396779087408,
"grad_norm": 1.21875,
"learning_rate": 0.00011949999999999999,
"loss": 7.3329,
"mean_token_accuracy": 0.074883484095335,
"num_tokens": 457978.0,
"step": 240
},
{
"entropy": 7.775896072387695,
"epoch": 0.014295717119850624,
"grad_norm": 1.203125,
"learning_rate": 0.000122,
"loss": 7.2889,
"mean_token_accuracy": 0.08151891827583313,
"num_tokens": 466846.0,
"step": 245
},
{
"entropy": 7.732866048812866,
"epoch": 0.014587466448827168,
"grad_norm": 1.3515625,
"learning_rate": 0.0001245,
"loss": 7.2876,
"mean_token_accuracy": 0.07967406883835793,
"num_tokens": 475862.0,
"step": 250
},
{
"entropy": 7.682526159286499,
"epoch": 0.014879215777803712,
"grad_norm": 1.21875,
"learning_rate": 0.000127,
"loss": 7.3177,
"mean_token_accuracy": 0.0773643635213375,
"num_tokens": 486088.0,
"step": 255
},
{
"entropy": 7.789633178710938,
"epoch": 0.015170965106780255,
"grad_norm": 1.140625,
"learning_rate": 0.0001295,
"loss": 7.19,
"mean_token_accuracy": 0.0791048213839531,
"num_tokens": 495515.0,
"step": 260
},
{
"entropy": 7.739433479309082,
"epoch": 0.015462714435756798,
"grad_norm": 1.3125,
"learning_rate": 0.000132,
"loss": 7.314,
"mean_token_accuracy": 0.07758257985115051,
"num_tokens": 505617.0,
"step": 265
},
{
"entropy": 7.701812362670898,
"epoch": 0.015754463764733342,
"grad_norm": 1.078125,
"learning_rate": 0.00013450000000000002,
"loss": 7.2826,
"mean_token_accuracy": 0.07801382765173911,
"num_tokens": 515977.0,
"step": 270
},
{
"entropy": 7.724566078186035,
"epoch": 0.016046213093709884,
"grad_norm": 1.1171875,
"learning_rate": 0.00013700000000000002,
"loss": 7.3384,
"mean_token_accuracy": 0.08092856109142303,
"num_tokens": 526525.0,
"step": 275
},
{
"entropy": 7.645784378051758,
"epoch": 0.01633796242268643,
"grad_norm": 1.1484375,
"learning_rate": 0.0001395,
"loss": 7.2771,
"mean_token_accuracy": 0.08373014777898788,
"num_tokens": 536494.0,
"step": 280
},
{
"entropy": 7.622757911682129,
"epoch": 0.01662971175166297,
"grad_norm": 1.3203125,
"learning_rate": 0.00014199999999999998,
"loss": 7.3146,
"mean_token_accuracy": 0.08114334717392921,
"num_tokens": 545326.0,
"step": 285
},
{
"entropy": 7.662983512878418,
"epoch": 0.016921461080639515,
"grad_norm": 1.484375,
"learning_rate": 0.0001445,
"loss": 7.1416,
"mean_token_accuracy": 0.08460377976298332,
"num_tokens": 553678.0,
"step": 290
},
{
"entropy": 7.63046498298645,
"epoch": 0.01721321040961606,
"grad_norm": 1.46875,
"learning_rate": 0.000147,
"loss": 7.2891,
"mean_token_accuracy": 0.08224759995937347,
"num_tokens": 563860.0,
"step": 295
},
{
"entropy": 7.621852588653565,
"epoch": 0.0175049597385926,
"grad_norm": 1.234375,
"learning_rate": 0.0001495,
"loss": 7.238,
"mean_token_accuracy": 0.08669779226183891,
"num_tokens": 572492.0,
"step": 300
},
{
"entropy": 7.564120435714722,
"epoch": 0.017796709067569146,
"grad_norm": 1.28125,
"learning_rate": 0.000152,
"loss": 7.1166,
"mean_token_accuracy": 0.08243767246603965,
"num_tokens": 581840.0,
"step": 305
},
{
"entropy": 7.6293127059936525,
"epoch": 0.018088458396545687,
"grad_norm": 1.09375,
"learning_rate": 0.00015450000000000001,
"loss": 7.2465,
"mean_token_accuracy": 0.0864152580499649,
"num_tokens": 591697.0,
"step": 310
},
{
"entropy": 7.534941625595093,
"epoch": 0.01838020772552223,
"grad_norm": 1.375,
"learning_rate": 0.000157,
"loss": 7.1059,
"mean_token_accuracy": 0.0846880093216896,
"num_tokens": 601153.0,
"step": 315
},
{
"entropy": 7.607311391830445,
"epoch": 0.018671957054498773,
"grad_norm": 1.1796875,
"learning_rate": 0.0001595,
"loss": 7.1949,
"mean_token_accuracy": 0.08106868788599968,
"num_tokens": 609516.0,
"step": 320
},
{
"entropy": 7.579704999923706,
"epoch": 0.018963706383475318,
"grad_norm": 1.109375,
"learning_rate": 0.000162,
"loss": 7.2078,
"mean_token_accuracy": 0.07954892218112945,
"num_tokens": 618836.0,
"step": 325
},
{
"entropy": 7.576669311523437,
"epoch": 0.019255455712451863,
"grad_norm": 1.25,
"learning_rate": 0.00016450000000000001,
"loss": 7.2136,
"mean_token_accuracy": 0.08916370049118996,
"num_tokens": 628223.0,
"step": 330
},
{
"entropy": 7.503057956695557,
"epoch": 0.019547205041428404,
"grad_norm": 1.171875,
"learning_rate": 0.00016700000000000002,
"loss": 7.1113,
"mean_token_accuracy": 0.08817728385329246,
"num_tokens": 637609.0,
"step": 335
},
{
"entropy": 7.545721530914307,
"epoch": 0.01983895437040495,
"grad_norm": 1.1171875,
"learning_rate": 0.00016950000000000003,
"loss": 7.1296,
"mean_token_accuracy": 0.08344640359282493,
"num_tokens": 646652.0,
"step": 340
},
{
"entropy": 7.413992404937744,
"epoch": 0.02013070369938149,
"grad_norm": 1.328125,
"learning_rate": 0.00017199999999999998,
"loss": 7.137,
"mean_token_accuracy": 0.08315069451928139,
"num_tokens": 656238.0,
"step": 345
},
{
"entropy": 7.479533767700195,
"epoch": 0.020422453028358035,
"grad_norm": 1.3515625,
"learning_rate": 0.00017449999999999999,
"loss": 7.1428,
"mean_token_accuracy": 0.08378953337669373,
"num_tokens": 665148.0,
"step": 350
},
{
"entropy": 7.503499221801758,
"epoch": 0.02071420235733458,
"grad_norm": 1.3671875,
"learning_rate": 0.000177,
"loss": 7.049,
"mean_token_accuracy": 0.08563587218523025,
"num_tokens": 675192.0,
"step": 355
},
{
"entropy": 7.388577222824097,
"epoch": 0.02100595168631112,
"grad_norm": 1.265625,
"learning_rate": 0.0001795,
"loss": 7.0679,
"mean_token_accuracy": 0.08425286635756493,
"num_tokens": 684813.0,
"step": 360
},
{
"entropy": 7.496100616455078,
"epoch": 0.021297701015287666,
"grad_norm": 1.1484375,
"learning_rate": 0.000182,
"loss": 7.0952,
"mean_token_accuracy": 0.08246167674660683,
"num_tokens": 694545.0,
"step": 365
},
{
"entropy": 7.4700541496276855,
"epoch": 0.021589450344264207,
"grad_norm": 1.28125,
"learning_rate": 0.0001845,
"loss": 7.0857,
"mean_token_accuracy": 0.08829364702105522,
"num_tokens": 704312.0,
"step": 370
},
{
"entropy": 7.475095510482788,
"epoch": 0.021881199673240752,
"grad_norm": 1.265625,
"learning_rate": 0.000187,
"loss": 7.1189,
"mean_token_accuracy": 0.08108639344573021,
"num_tokens": 713743.0,
"step": 375
},
{
"entropy": 7.403366279602051,
"epoch": 0.022172949002217297,
"grad_norm": 1.2421875,
"learning_rate": 0.0001895,
"loss": 7.0088,
"mean_token_accuracy": 0.08252720050513744,
"num_tokens": 722497.0,
"step": 380
},
{
"entropy": 7.3469452381134035,
"epoch": 0.022464698331193838,
"grad_norm": 1.421875,
"learning_rate": 0.000192,
"loss": 6.9952,
"mean_token_accuracy": 0.08496845439076424,
"num_tokens": 731849.0,
"step": 385
},
{
"entropy": 7.4720964431762695,
"epoch": 0.022756447660170383,
"grad_norm": 1.1953125,
"learning_rate": 0.0001945,
"loss": 7.1709,
"mean_token_accuracy": 0.08666181415319443,
"num_tokens": 741345.0,
"step": 390
},
{
"entropy": 7.3531989574432375,
"epoch": 0.023048196989146924,
"grad_norm": 1.1953125,
"learning_rate": 0.00019700000000000002,
"loss": 7.1245,
"mean_token_accuracy": 0.08187859356403351,
"num_tokens": 751363.0,
"step": 395
},
{
"entropy": 7.323095083236694,
"epoch": 0.02333994631812347,
"grad_norm": 1.265625,
"learning_rate": 0.00019950000000000002,
"loss": 6.9475,
"mean_token_accuracy": 0.08857285082340241,
"num_tokens": 761174.0,
"step": 400
},
{
"entropy": 7.323359584808349,
"epoch": 0.02363169564710001,
"grad_norm": 1.2109375,
"learning_rate": 0.000202,
"loss": 6.9364,
"mean_token_accuracy": 0.0823954962193966,
"num_tokens": 770773.0,
"step": 405
},
{
"entropy": 7.241050577163696,
"epoch": 0.023923444976076555,
"grad_norm": 1.265625,
"learning_rate": 0.00020449999999999998,
"loss": 6.964,
"mean_token_accuracy": 0.08706902638077736,
"num_tokens": 780462.0,
"step": 410
},
{
"entropy": 7.354639291763306,
"epoch": 0.0242151943050531,
"grad_norm": 1.171875,
"learning_rate": 0.000207,
"loss": 6.9719,
"mean_token_accuracy": 0.08648092672228813,
"num_tokens": 789822.0,
"step": 415
},
{
"entropy": 7.251240015029907,
"epoch": 0.02450694363402964,
"grad_norm": 1.1640625,
"learning_rate": 0.0002095,
"loss": 6.9392,
"mean_token_accuracy": 0.08409521207213402,
"num_tokens": 799724.0,
"step": 420
},
{
"entropy": 7.2920667171478275,
"epoch": 0.024798692963006186,
"grad_norm": 1.140625,
"learning_rate": 0.000212,
"loss": 7.0463,
"mean_token_accuracy": 0.08510638326406479,
"num_tokens": 809331.0,
"step": 425
},
{
"entropy": 7.488130569458008,
"epoch": 0.025090442291982727,
"grad_norm": 1.1015625,
"learning_rate": 0.0002145,
"loss": 7.057,
"mean_token_accuracy": 0.08337506577372551,
"num_tokens": 818665.0,
"step": 430
},
{
"entropy": 7.296667957305909,
"epoch": 0.025382191620959272,
"grad_norm": 1.234375,
"learning_rate": 0.00021700000000000002,
"loss": 6.9754,
"mean_token_accuracy": 0.08416144661605358,
"num_tokens": 828580.0,
"step": 435
},
{
"entropy": 7.240721750259399,
"epoch": 0.025673940949935817,
"grad_norm": 1.609375,
"learning_rate": 0.0002195,
"loss": 7.0171,
"mean_token_accuracy": 0.08526882231235504,
"num_tokens": 837661.0,
"step": 440
},
{
"entropy": 7.22621784210205,
"epoch": 0.025965690278912358,
"grad_norm": 1.21875,
"learning_rate": 0.000222,
"loss": 6.9839,
"mean_token_accuracy": 0.08228468671441078,
"num_tokens": 847069.0,
"step": 445
},
{
"entropy": 7.250874137878418,
"epoch": 0.026257439607888903,
"grad_norm": 1.1796875,
"learning_rate": 0.0002245,
"loss": 6.9794,
"mean_token_accuracy": 0.08245958164334297,
"num_tokens": 856743.0,
"step": 450
},
{
"entropy": 7.338770008087158,
"epoch": 0.026549188936865444,
"grad_norm": 1.2734375,
"learning_rate": 0.00022700000000000002,
"loss": 7.0198,
"mean_token_accuracy": 0.08468568697571754,
"num_tokens": 865502.0,
"step": 455
},
{
"entropy": 7.33205771446228,
"epoch": 0.02684093826584199,
"grad_norm": 1.1484375,
"learning_rate": 0.00022950000000000002,
"loss": 6.9651,
"mean_token_accuracy": 0.0839608520269394,
"num_tokens": 874178.0,
"step": 460
},
{
"entropy": 7.088795518875122,
"epoch": 0.02713268759481853,
"grad_norm": 1.234375,
"learning_rate": 0.00023200000000000003,
"loss": 6.8514,
"mean_token_accuracy": 0.08765117079019547,
"num_tokens": 883182.0,
"step": 465
},
{
"entropy": 7.3482073783874515,
"epoch": 0.027424436923795075,
"grad_norm": 1.234375,
"learning_rate": 0.00023449999999999998,
"loss": 6.9282,
"mean_token_accuracy": 0.08807430192828178,
"num_tokens": 891879.0,
"step": 470
},
{
"entropy": 7.25138897895813,
"epoch": 0.02771618625277162,
"grad_norm": 1.28125,
"learning_rate": 0.000237,
"loss": 6.9982,
"mean_token_accuracy": 0.08774204924702644,
"num_tokens": 901925.0,
"step": 475
},
{
"entropy": 7.124047946929932,
"epoch": 0.02800793558174816,
"grad_norm": 1.21875,
"learning_rate": 0.0002395,
"loss": 6.9424,
"mean_token_accuracy": 0.08976237252354621,
"num_tokens": 910609.0,
"step": 480
},
{
"entropy": 7.321299314498901,
"epoch": 0.028299684910724706,
"grad_norm": 1.2109375,
"learning_rate": 0.000242,
"loss": 7.0122,
"mean_token_accuracy": 0.08504581227898597,
"num_tokens": 919643.0,
"step": 485
},
{
"entropy": 7.123654794692993,
"epoch": 0.028591434239701247,
"grad_norm": 1.09375,
"learning_rate": 0.0002445,
"loss": 6.8913,
"mean_token_accuracy": 0.0893466129899025,
"num_tokens": 929160.0,
"step": 490
},
{
"entropy": 7.151027345657349,
"epoch": 0.028883183568677792,
"grad_norm": 1.1875,
"learning_rate": 0.000247,
"loss": 6.8194,
"mean_token_accuracy": 0.09795917496085167,
"num_tokens": 938329.0,
"step": 495
},
{
"entropy": 7.3193886280059814,
"epoch": 0.029174932897654337,
"grad_norm": 1.2265625,
"learning_rate": 0.0002495,
"loss": 7.1734,
"mean_token_accuracy": 0.0849479891359806,
"num_tokens": 947919.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1361486628864000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}