Files
ind-latn-100mb-ppt-Dp-10mb_…/checkpoint-500/trainer_state.json
ModelHub XC da4ae7676e 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/ind-latn-100mb-ppt-Dp-10mb_seed455
Source: Original Platform
2026-08-13 10:57:17 +08:00

1035 lines
27 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.025718180181570353,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.691593360900878,
"epoch": 0.0002571818018157035,
"grad_norm": 13.5625,
"learning_rate": 2e-06,
"loss": 10.761,
"mean_token_accuracy": 0.00011363636003807187,
"num_tokens": 8373.0,
"step": 5
},
{
"entropy": 10.691572093963623,
"epoch": 0.000514363603631407,
"grad_norm": 12.375,
"learning_rate": 4.5e-06,
"loss": 10.7039,
"mean_token_accuracy": 0.0,
"num_tokens": 17090.0,
"step": 10
},
{
"entropy": 10.691090297698974,
"epoch": 0.0007715454054471106,
"grad_norm": 9.875,
"learning_rate": 7e-06,
"loss": 10.5011,
"mean_token_accuracy": 0.018853903049603105,
"num_tokens": 26219.0,
"step": 15
},
{
"entropy": 10.680709075927734,
"epoch": 0.001028727207262814,
"grad_norm": 6.03125,
"learning_rate": 9.5e-06,
"loss": 10.2462,
"mean_token_accuracy": 0.04484990499913692,
"num_tokens": 36191.0,
"step": 20
},
{
"entropy": 10.582563495635986,
"epoch": 0.0012859090090785177,
"grad_norm": 3.9375,
"learning_rate": 1.2e-05,
"loss": 9.9749,
"mean_token_accuracy": 0.040961484611034396,
"num_tokens": 45318.0,
"step": 25
},
{
"entropy": 10.534116744995117,
"epoch": 0.0015430908108942211,
"grad_norm": 3.703125,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.8021,
"mean_token_accuracy": 0.04536043591797352,
"num_tokens": 53102.0,
"step": 30
},
{
"entropy": 10.562399864196777,
"epoch": 0.0018002726127099246,
"grad_norm": 2.984375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.7539,
"mean_token_accuracy": 0.042898242548108104,
"num_tokens": 61808.0,
"step": 35
},
{
"entropy": 10.547216129302978,
"epoch": 0.002057454414525628,
"grad_norm": 2.8125,
"learning_rate": 1.95e-05,
"loss": 9.7136,
"mean_token_accuracy": 0.044699297100305554,
"num_tokens": 70708.0,
"step": 40
},
{
"entropy": 10.517444515228272,
"epoch": 0.0023146362163413317,
"grad_norm": 2.5,
"learning_rate": 2.2e-05,
"loss": 9.632,
"mean_token_accuracy": 0.04661537855863571,
"num_tokens": 79541.0,
"step": 45
},
{
"entropy": 10.505586051940918,
"epoch": 0.0025718180181570354,
"grad_norm": 2.40625,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5459,
"mean_token_accuracy": 0.05164888352155685,
"num_tokens": 87073.0,
"step": 50
},
{
"entropy": 10.474337196350097,
"epoch": 0.0028289998199727386,
"grad_norm": 2.25,
"learning_rate": 2.7e-05,
"loss": 9.5486,
"mean_token_accuracy": 0.059509020671248435,
"num_tokens": 96581.0,
"step": 55
},
{
"entropy": 10.405019569396973,
"epoch": 0.0030861816217884423,
"grad_norm": 2.359375,
"learning_rate": 2.95e-05,
"loss": 9.4782,
"mean_token_accuracy": 0.060714465007185935,
"num_tokens": 105741.0,
"step": 60
},
{
"entropy": 10.288742446899414,
"epoch": 0.003343363423604146,
"grad_norm": 2.125,
"learning_rate": 3.2e-05,
"loss": 9.385,
"mean_token_accuracy": 0.061338124051690104,
"num_tokens": 114609.0,
"step": 65
},
{
"entropy": 10.352596855163574,
"epoch": 0.003600545225419849,
"grad_norm": 2.125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.35,
"mean_token_accuracy": 0.05903933756053448,
"num_tokens": 123922.0,
"step": 70
},
{
"entropy": 10.332678699493409,
"epoch": 0.003857727027235553,
"grad_norm": 2.125,
"learning_rate": 3.7e-05,
"loss": 9.2218,
"mean_token_accuracy": 0.06484894305467606,
"num_tokens": 133213.0,
"step": 75
},
{
"entropy": 10.27952938079834,
"epoch": 0.004114908829051256,
"grad_norm": 1.96875,
"learning_rate": 3.95e-05,
"loss": 9.1737,
"mean_token_accuracy": 0.06273005269467831,
"num_tokens": 141582.0,
"step": 80
},
{
"entropy": 10.254050540924073,
"epoch": 0.00437209063086696,
"grad_norm": 2.0625,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.9925,
"mean_token_accuracy": 0.06865651868283748,
"num_tokens": 149709.0,
"step": 85
},
{
"entropy": 10.210903453826905,
"epoch": 0.004629272432682663,
"grad_norm": 1.8203125,
"learning_rate": 4.45e-05,
"loss": 8.856,
"mean_token_accuracy": 0.07082752697169781,
"num_tokens": 158239.0,
"step": 90
},
{
"entropy": 10.24482765197754,
"epoch": 0.004886454234498367,
"grad_norm": 1.7578125,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.9023,
"mean_token_accuracy": 0.0604440800845623,
"num_tokens": 168046.0,
"step": 95
},
{
"entropy": 10.135429000854492,
"epoch": 0.005143636036314071,
"grad_norm": 1.53125,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.8077,
"mean_token_accuracy": 0.06280115209519863,
"num_tokens": 177797.0,
"step": 100
},
{
"entropy": 10.110702419281006,
"epoch": 0.0054008178381297735,
"grad_norm": 1.796875,
"learning_rate": 5.2e-05,
"loss": 8.6609,
"mean_token_accuracy": 0.06286422722041607,
"num_tokens": 186664.0,
"step": 105
},
{
"entropy": 10.024668121337891,
"epoch": 0.005657999639945477,
"grad_norm": 1.5546875,
"learning_rate": 5.45e-05,
"loss": 8.5449,
"mean_token_accuracy": 0.06326077207922935,
"num_tokens": 195404.0,
"step": 110
},
{
"entropy": 9.922544002532959,
"epoch": 0.005915181441761181,
"grad_norm": 1.5546875,
"learning_rate": 5.7e-05,
"loss": 8.4327,
"mean_token_accuracy": 0.06552885584533215,
"num_tokens": 204248.0,
"step": 115
},
{
"entropy": 9.780591869354248,
"epoch": 0.0061723632435768845,
"grad_norm": 1.515625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.2869,
"mean_token_accuracy": 0.060110585764050484,
"num_tokens": 214042.0,
"step": 120
},
{
"entropy": 9.649379444122314,
"epoch": 0.006429545045392588,
"grad_norm": 1.390625,
"learning_rate": 6.2e-05,
"loss": 8.189,
"mean_token_accuracy": 0.06577248759567737,
"num_tokens": 223194.0,
"step": 125
},
{
"entropy": 9.431284046173095,
"epoch": 0.006686726847208292,
"grad_norm": 1.484375,
"learning_rate": 6.450000000000001e-05,
"loss": 7.9307,
"mean_token_accuracy": 0.07218964248895646,
"num_tokens": 230929.0,
"step": 130
},
{
"entropy": 9.260346984863281,
"epoch": 0.006943908649023995,
"grad_norm": 1.734375,
"learning_rate": 6.7e-05,
"loss": 7.9081,
"mean_token_accuracy": 0.07038265988230705,
"num_tokens": 238687.0,
"step": 135
},
{
"entropy": 9.035238265991211,
"epoch": 0.007201090450839698,
"grad_norm": 1.4921875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.8152,
"mean_token_accuracy": 0.07054561264812946,
"num_tokens": 247397.0,
"step": 140
},
{
"entropy": 8.894649696350097,
"epoch": 0.007458272252655402,
"grad_norm": 1.4453125,
"learning_rate": 7.2e-05,
"loss": 7.7444,
"mean_token_accuracy": 0.07246604040265084,
"num_tokens": 255924.0,
"step": 145
},
{
"entropy": 8.742353820800782,
"epoch": 0.007715454054471106,
"grad_norm": 1.2890625,
"learning_rate": 7.45e-05,
"loss": 7.6781,
"mean_token_accuracy": 0.06747029088437557,
"num_tokens": 264767.0,
"step": 150
},
{
"entropy": 8.636024761199952,
"epoch": 0.00797263585628681,
"grad_norm": 1.1640625,
"learning_rate": 7.7e-05,
"loss": 7.6787,
"mean_token_accuracy": 0.07033539973199368,
"num_tokens": 274250.0,
"step": 155
},
{
"entropy": 8.433564472198487,
"epoch": 0.008229817658102512,
"grad_norm": 1.3828125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.5648,
"mean_token_accuracy": 0.07707317210733891,
"num_tokens": 282568.0,
"step": 160
},
{
"entropy": 8.366222667694093,
"epoch": 0.008486999459918217,
"grad_norm": 1.3671875,
"learning_rate": 8.2e-05,
"loss": 7.5969,
"mean_token_accuracy": 0.06956044659018516,
"num_tokens": 291126.0,
"step": 165
},
{
"entropy": 8.285852527618408,
"epoch": 0.00874418126173392,
"grad_norm": 1.1953125,
"learning_rate": 8.450000000000001e-05,
"loss": 7.5209,
"mean_token_accuracy": 0.07576571702957154,
"num_tokens": 299751.0,
"step": 170
},
{
"entropy": 8.235202884674072,
"epoch": 0.009001363063549624,
"grad_norm": 1.2734375,
"learning_rate": 8.7e-05,
"loss": 7.5119,
"mean_token_accuracy": 0.07470664568245411,
"num_tokens": 309560.0,
"step": 175
},
{
"entropy": 8.157529830932617,
"epoch": 0.009258544865365327,
"grad_norm": 1.296875,
"learning_rate": 8.95e-05,
"loss": 7.4928,
"mean_token_accuracy": 0.06981925927102565,
"num_tokens": 318613.0,
"step": 180
},
{
"entropy": 8.12168264389038,
"epoch": 0.00951572666718103,
"grad_norm": 1.328125,
"learning_rate": 9.2e-05,
"loss": 7.551,
"mean_token_accuracy": 0.07186717689037322,
"num_tokens": 327650.0,
"step": 185
},
{
"entropy": 8.121650791168213,
"epoch": 0.009772908468996734,
"grad_norm": 1.125,
"learning_rate": 9.45e-05,
"loss": 7.4394,
"mean_token_accuracy": 0.07240154445171357,
"num_tokens": 337198.0,
"step": 190
},
{
"entropy": 8.03664698600769,
"epoch": 0.010030090270812437,
"grad_norm": 1.34375,
"learning_rate": 9.7e-05,
"loss": 7.5301,
"mean_token_accuracy": 0.07011710181832313,
"num_tokens": 346179.0,
"step": 195
},
{
"entropy": 8.069316053390503,
"epoch": 0.010287272072628141,
"grad_norm": 1.6875,
"learning_rate": 9.95e-05,
"loss": 7.4276,
"mean_token_accuracy": 0.07499495595693588,
"num_tokens": 355972.0,
"step": 200
},
{
"entropy": 7.968952226638794,
"epoch": 0.010544453874443844,
"grad_norm": 1.4375,
"learning_rate": 0.000102,
"loss": 7.3626,
"mean_token_accuracy": 0.077250687032938,
"num_tokens": 364635.0,
"step": 205
},
{
"entropy": 7.948678016662598,
"epoch": 0.010801635676259547,
"grad_norm": 1.328125,
"learning_rate": 0.00010449999999999999,
"loss": 7.5125,
"mean_token_accuracy": 0.07722728103399276,
"num_tokens": 374161.0,
"step": 210
},
{
"entropy": 7.955185747146606,
"epoch": 0.011058817478075252,
"grad_norm": 1.1875,
"learning_rate": 0.000107,
"loss": 7.3673,
"mean_token_accuracy": 0.0733168862760067,
"num_tokens": 383641.0,
"step": 215
},
{
"entropy": 7.921580362319946,
"epoch": 0.011315999279890954,
"grad_norm": 1.3515625,
"learning_rate": 0.0001095,
"loss": 7.3171,
"mean_token_accuracy": 0.0784445971250534,
"num_tokens": 392300.0,
"step": 220
},
{
"entropy": 7.939724063873291,
"epoch": 0.011573181081706659,
"grad_norm": 1.3125,
"learning_rate": 0.000112,
"loss": 7.3486,
"mean_token_accuracy": 0.07721329033374787,
"num_tokens": 400721.0,
"step": 225
},
{
"entropy": 7.914973640441895,
"epoch": 0.011830362883522362,
"grad_norm": 1.265625,
"learning_rate": 0.0001145,
"loss": 7.3563,
"mean_token_accuracy": 0.08054085932672024,
"num_tokens": 410261.0,
"step": 230
},
{
"entropy": 7.840137624740601,
"epoch": 0.012087544685338066,
"grad_norm": 1.296875,
"learning_rate": 0.00011700000000000001,
"loss": 7.2993,
"mean_token_accuracy": 0.08381507098674774,
"num_tokens": 419006.0,
"step": 235
},
{
"entropy": 7.865709638595581,
"epoch": 0.012344726487153769,
"grad_norm": 1.1953125,
"learning_rate": 0.00011949999999999999,
"loss": 7.3679,
"mean_token_accuracy": 0.07533743120729923,
"num_tokens": 428773.0,
"step": 240
},
{
"entropy": 7.8893204689025875,
"epoch": 0.012601908288969472,
"grad_norm": 1.5390625,
"learning_rate": 0.000122,
"loss": 7.2843,
"mean_token_accuracy": 0.08408410698175431,
"num_tokens": 438111.0,
"step": 245
},
{
"entropy": 7.718148136138916,
"epoch": 0.012859090090785176,
"grad_norm": 1.3046875,
"learning_rate": 0.0001245,
"loss": 7.2826,
"mean_token_accuracy": 0.07801055312156677,
"num_tokens": 447352.0,
"step": 250
},
{
"entropy": 7.834936952590942,
"epoch": 0.01311627189260088,
"grad_norm": 1.2421875,
"learning_rate": 0.000127,
"loss": 7.2718,
"mean_token_accuracy": 0.08380828946828842,
"num_tokens": 456118.0,
"step": 255
},
{
"entropy": 7.78115496635437,
"epoch": 0.013373453694416584,
"grad_norm": 1.3359375,
"learning_rate": 0.0001295,
"loss": 7.3091,
"mean_token_accuracy": 0.0782765805721283,
"num_tokens": 465016.0,
"step": 260
},
{
"entropy": 7.746971464157104,
"epoch": 0.013630635496232286,
"grad_norm": 1.234375,
"learning_rate": 0.000132,
"loss": 7.2129,
"mean_token_accuracy": 0.0813664972782135,
"num_tokens": 473828.0,
"step": 265
},
{
"entropy": 7.73144416809082,
"epoch": 0.01388781729804799,
"grad_norm": 1.125,
"learning_rate": 0.00013450000000000002,
"loss": 7.1867,
"mean_token_accuracy": 0.08951399773359299,
"num_tokens": 482481.0,
"step": 270
},
{
"entropy": 7.821958923339844,
"epoch": 0.014144999099863694,
"grad_norm": 1.34375,
"learning_rate": 0.00013700000000000002,
"loss": 7.2565,
"mean_token_accuracy": 0.08631709441542626,
"num_tokens": 491784.0,
"step": 275
},
{
"entropy": 7.713495445251465,
"epoch": 0.014402180901679397,
"grad_norm": 1.421875,
"learning_rate": 0.0001395,
"loss": 7.3491,
"mean_token_accuracy": 0.0803300604224205,
"num_tokens": 501227.0,
"step": 280
},
{
"entropy": 7.609055280685425,
"epoch": 0.014659362703495101,
"grad_norm": 1.6640625,
"learning_rate": 0.00014199999999999998,
"loss": 7.1247,
"mean_token_accuracy": 0.0826262541115284,
"num_tokens": 509566.0,
"step": 285
},
{
"entropy": 7.692761611938477,
"epoch": 0.014916544505310804,
"grad_norm": 1.3984375,
"learning_rate": 0.0001445,
"loss": 7.1787,
"mean_token_accuracy": 0.09211432188749313,
"num_tokens": 517517.0,
"step": 290
},
{
"entropy": 7.6960266590118405,
"epoch": 0.015173726307126508,
"grad_norm": 1.21875,
"learning_rate": 0.000147,
"loss": 7.2176,
"mean_token_accuracy": 0.0820289522409439,
"num_tokens": 526279.0,
"step": 295
},
{
"entropy": 7.665759134292602,
"epoch": 0.015430908108942211,
"grad_norm": 1.171875,
"learning_rate": 0.0001495,
"loss": 7.1406,
"mean_token_accuracy": 0.0928925946354866,
"num_tokens": 534516.0,
"step": 300
},
{
"entropy": 7.661193418502807,
"epoch": 0.015688089910757916,
"grad_norm": 1.3671875,
"learning_rate": 0.000152,
"loss": 7.2216,
"mean_token_accuracy": 0.08248281478881836,
"num_tokens": 543828.0,
"step": 305
},
{
"entropy": 7.662406015396118,
"epoch": 0.01594527171257362,
"grad_norm": 1.2734375,
"learning_rate": 0.00015450000000000001,
"loss": 7.1559,
"mean_token_accuracy": 0.08263281881809234,
"num_tokens": 552530.0,
"step": 310
},
{
"entropy": 7.536833572387695,
"epoch": 0.01620245351438932,
"grad_norm": 1.359375,
"learning_rate": 0.000157,
"loss": 7.1062,
"mean_token_accuracy": 0.08527780249714852,
"num_tokens": 561475.0,
"step": 315
},
{
"entropy": 7.684497308731079,
"epoch": 0.016459635316205024,
"grad_norm": 1.4609375,
"learning_rate": 0.0001595,
"loss": 7.1742,
"mean_token_accuracy": 0.08275718316435814,
"num_tokens": 569852.0,
"step": 320
},
{
"entropy": 7.586278247833252,
"epoch": 0.01671681711802073,
"grad_norm": 1.203125,
"learning_rate": 0.000162,
"loss": 7.2073,
"mean_token_accuracy": 0.08587946742773056,
"num_tokens": 578326.0,
"step": 325
},
{
"entropy": 7.664967060089111,
"epoch": 0.016973998919836433,
"grad_norm": 1.1484375,
"learning_rate": 0.00016450000000000001,
"loss": 7.238,
"mean_token_accuracy": 0.08378956839442253,
"num_tokens": 587606.0,
"step": 330
},
{
"entropy": 7.510732364654541,
"epoch": 0.017231180721652136,
"grad_norm": 1.3828125,
"learning_rate": 0.00016700000000000002,
"loss": 6.9636,
"mean_token_accuracy": 0.09541863054037095,
"num_tokens": 595321.0,
"step": 335
},
{
"entropy": 7.525554895401001,
"epoch": 0.01748836252346784,
"grad_norm": 1.1875,
"learning_rate": 0.00016950000000000003,
"loss": 7.0757,
"mean_token_accuracy": 0.08646541684865952,
"num_tokens": 603836.0,
"step": 340
},
{
"entropy": 7.485527229309082,
"epoch": 0.01774554432528354,
"grad_norm": 1.359375,
"learning_rate": 0.00017199999999999998,
"loss": 7.0746,
"mean_token_accuracy": 0.08882175087928772,
"num_tokens": 612847.0,
"step": 345
},
{
"entropy": 7.5213652610778805,
"epoch": 0.018002726127099248,
"grad_norm": 1.2734375,
"learning_rate": 0.00017449999999999999,
"loss": 7.1177,
"mean_token_accuracy": 0.08585901409387589,
"num_tokens": 620840.0,
"step": 350
},
{
"entropy": 7.538561153411865,
"epoch": 0.01825990792891495,
"grad_norm": 1.4140625,
"learning_rate": 0.000177,
"loss": 7.0237,
"mean_token_accuracy": 0.09108547568321228,
"num_tokens": 629495.0,
"step": 355
},
{
"entropy": 7.50935378074646,
"epoch": 0.018517089730730654,
"grad_norm": 1.203125,
"learning_rate": 0.0001795,
"loss": 7.1784,
"mean_token_accuracy": 0.08739718049764633,
"num_tokens": 638589.0,
"step": 360
},
{
"entropy": 7.4144041538238525,
"epoch": 0.018774271532546356,
"grad_norm": 1.2890625,
"learning_rate": 0.000182,
"loss": 7.05,
"mean_token_accuracy": 0.08531938642263412,
"num_tokens": 647713.0,
"step": 365
},
{
"entropy": 7.665746688842773,
"epoch": 0.01903145333436206,
"grad_norm": 1.40625,
"learning_rate": 0.0001845,
"loss": 7.1511,
"mean_token_accuracy": 0.08770897537469864,
"num_tokens": 656472.0,
"step": 370
},
{
"entropy": 7.371031093597412,
"epoch": 0.019288635136177765,
"grad_norm": 1.5625,
"learning_rate": 0.000187,
"loss": 7.0004,
"mean_token_accuracy": 0.09101735278964043,
"num_tokens": 664858.0,
"step": 375
},
{
"entropy": 7.439912271499634,
"epoch": 0.019545816937993468,
"grad_norm": 1.1796875,
"learning_rate": 0.0001895,
"loss": 7.0322,
"mean_token_accuracy": 0.09086323380470276,
"num_tokens": 673675.0,
"step": 380
},
{
"entropy": 7.4977442741394045,
"epoch": 0.01980299873980917,
"grad_norm": 1.3046875,
"learning_rate": 0.000192,
"loss": 7.1526,
"mean_token_accuracy": 0.0906866118311882,
"num_tokens": 681968.0,
"step": 385
},
{
"entropy": 7.431271123886108,
"epoch": 0.020060180541624874,
"grad_norm": 1.1640625,
"learning_rate": 0.0001945,
"loss": 7.0089,
"mean_token_accuracy": 0.09397086799144745,
"num_tokens": 690447.0,
"step": 390
},
{
"entropy": 7.5096940994262695,
"epoch": 0.020317362343440577,
"grad_norm": 1.1953125,
"learning_rate": 0.00019700000000000002,
"loss": 7.0298,
"mean_token_accuracy": 0.09151682630181313,
"num_tokens": 699659.0,
"step": 395
},
{
"entropy": 7.40989465713501,
"epoch": 0.020574544145256283,
"grad_norm": 1.4921875,
"learning_rate": 0.00019950000000000002,
"loss": 7.0506,
"mean_token_accuracy": 0.09182499945163727,
"num_tokens": 708342.0,
"step": 400
},
{
"entropy": 7.437063407897949,
"epoch": 0.020831725947071986,
"grad_norm": 1.2421875,
"learning_rate": 0.000202,
"loss": 7.0589,
"mean_token_accuracy": 0.08685924187302589,
"num_tokens": 717986.0,
"step": 405
},
{
"entropy": 7.506326389312744,
"epoch": 0.02108890774888769,
"grad_norm": 1.1875,
"learning_rate": 0.00020449999999999998,
"loss": 7.0868,
"mean_token_accuracy": 0.08464771658182144,
"num_tokens": 727397.0,
"step": 410
},
{
"entropy": 7.389501142501831,
"epoch": 0.02134608955070339,
"grad_norm": 1.109375,
"learning_rate": 0.000207,
"loss": 7.0421,
"mean_token_accuracy": 0.09134713932871819,
"num_tokens": 736291.0,
"step": 415
},
{
"entropy": 7.398612976074219,
"epoch": 0.021603271352519094,
"grad_norm": 1.3046875,
"learning_rate": 0.0002095,
"loss": 7.0983,
"mean_token_accuracy": 0.08749841973185539,
"num_tokens": 745132.0,
"step": 420
},
{
"entropy": 7.387109804153442,
"epoch": 0.0218604531543348,
"grad_norm": 1.359375,
"learning_rate": 0.000212,
"loss": 6.9801,
"mean_token_accuracy": 0.09526508301496506,
"num_tokens": 753535.0,
"step": 425
},
{
"entropy": 7.287825727462769,
"epoch": 0.022117634956150503,
"grad_norm": 1.34375,
"learning_rate": 0.0002145,
"loss": 6.8881,
"mean_token_accuracy": 0.09665613695979118,
"num_tokens": 762626.0,
"step": 430
},
{
"entropy": 7.425317716598511,
"epoch": 0.022374816757966206,
"grad_norm": 1.265625,
"learning_rate": 0.00021700000000000002,
"loss": 7.0183,
"mean_token_accuracy": 0.08952494263648987,
"num_tokens": 771802.0,
"step": 435
},
{
"entropy": 7.3904194831848145,
"epoch": 0.02263199855978191,
"grad_norm": 1.109375,
"learning_rate": 0.0002195,
"loss": 7.055,
"mean_token_accuracy": 0.09687120616436004,
"num_tokens": 780444.0,
"step": 440
},
{
"entropy": 7.46030330657959,
"epoch": 0.022889180361597615,
"grad_norm": 1.28125,
"learning_rate": 0.000222,
"loss": 7.0891,
"mean_token_accuracy": 0.08583850935101509,
"num_tokens": 789335.0,
"step": 445
},
{
"entropy": 7.254354047775268,
"epoch": 0.023146362163413318,
"grad_norm": 1.3828125,
"learning_rate": 0.0002245,
"loss": 6.9291,
"mean_token_accuracy": 0.09709356278181076,
"num_tokens": 797891.0,
"step": 450
},
{
"entropy": 7.221427774429321,
"epoch": 0.02340354396522902,
"grad_norm": 1.328125,
"learning_rate": 0.00022700000000000002,
"loss": 6.9026,
"mean_token_accuracy": 0.09430735632777214,
"num_tokens": 806238.0,
"step": 455
},
{
"entropy": 7.3990577220916744,
"epoch": 0.023660725767044723,
"grad_norm": 1.4765625,
"learning_rate": 0.00022950000000000002,
"loss": 6.9081,
"mean_token_accuracy": 0.09148178026080131,
"num_tokens": 814430.0,
"step": 460
},
{
"entropy": 7.347194242477417,
"epoch": 0.023917907568860426,
"grad_norm": 1.140625,
"learning_rate": 0.00023200000000000003,
"loss": 7.0802,
"mean_token_accuracy": 0.08918680474162102,
"num_tokens": 823546.0,
"step": 465
},
{
"entropy": 7.322706604003907,
"epoch": 0.024175089370676132,
"grad_norm": 1.3203125,
"learning_rate": 0.00023449999999999998,
"loss": 6.8709,
"mean_token_accuracy": 0.0952567420899868,
"num_tokens": 832885.0,
"step": 470
},
{
"entropy": 7.260769939422607,
"epoch": 0.024432271172491835,
"grad_norm": 1.171875,
"learning_rate": 0.000237,
"loss": 6.8382,
"mean_token_accuracy": 0.09813853800296783,
"num_tokens": 841140.0,
"step": 475
},
{
"entropy": 7.244242477416992,
"epoch": 0.024689452974307538,
"grad_norm": 1.5703125,
"learning_rate": 0.0002395,
"loss": 6.9147,
"mean_token_accuracy": 0.09300818815827369,
"num_tokens": 849768.0,
"step": 480
},
{
"entropy": 7.25398006439209,
"epoch": 0.02494663477612324,
"grad_norm": 1.09375,
"learning_rate": 0.000242,
"loss": 6.8165,
"mean_token_accuracy": 0.09476587101817131,
"num_tokens": 859080.0,
"step": 485
},
{
"entropy": 7.220676612854004,
"epoch": 0.025203816577938944,
"grad_norm": 1.1328125,
"learning_rate": 0.0002445,
"loss": 6.9026,
"mean_token_accuracy": 0.0947590596973896,
"num_tokens": 868624.0,
"step": 490
},
{
"entropy": 7.27272310256958,
"epoch": 0.02546099837975465,
"grad_norm": 1.15625,
"learning_rate": 0.000247,
"loss": 6.893,
"mean_token_accuracy": 0.09338614419102668,
"num_tokens": 877592.0,
"step": 495
},
{
"entropy": 7.275995779037475,
"epoch": 0.025718180181570353,
"grad_norm": 1.2578125,
"learning_rate": 0.0002495,
"loss": 6.8668,
"mean_token_accuracy": 0.09461153075098991,
"num_tokens": 886470.0,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1206164846592000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}