Files
zho-hans-10mb-10mb_seed3407/checkpoint-500/trainer_state.json
ModelHub XC 299f5479e7 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/zho-hans-10mb-10mb_seed3407
Source: Original Platform
2026-09-28 06:53:17 +08:00

1046 lines
28 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.999000999000999,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.74254903793335,
"epoch": 0.00999000999000999,
"grad_norm": 4.6875,
"learning_rate": 2e-06,
"loss": 10.8409,
"mean_token_accuracy": 0.00010789126390591264,
"num_tokens": 17348.0,
"step": 5
},
{
"entropy": 10.742575931549073,
"epoch": 0.01998001998001998,
"grad_norm": 5.28125,
"learning_rate": 4.5e-06,
"loss": 10.8325,
"mean_token_accuracy": 6.410256610251963e-05,
"num_tokens": 33613.0,
"step": 10
},
{
"entropy": 10.742553329467773,
"epoch": 0.029970029970029972,
"grad_norm": 5.0625,
"learning_rate": 7e-06,
"loss": 10.8012,
"mean_token_accuracy": 0.00016108142444863914,
"num_tokens": 49416.0,
"step": 15
},
{
"entropy": 10.742562675476075,
"epoch": 0.03996003996003996,
"grad_norm": 5.0625,
"learning_rate": 9.5e-06,
"loss": 10.7438,
"mean_token_accuracy": 0.0010525182529818266,
"num_tokens": 64663.0,
"step": 20
},
{
"entropy": 10.742408943176269,
"epoch": 0.04995004995004995,
"grad_norm": 4.75,
"learning_rate": 1.2e-05,
"loss": 10.6283,
"mean_token_accuracy": 0.03072175462730229,
"num_tokens": 79972.0,
"step": 25
},
{
"entropy": 10.74140043258667,
"epoch": 0.059940059940059943,
"grad_norm": 4.0,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.5246,
"mean_token_accuracy": 0.05747625604271889,
"num_tokens": 96254.0,
"step": 30
},
{
"entropy": 10.735374069213867,
"epoch": 0.06993006993006994,
"grad_norm": 2.875,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.3755,
"mean_token_accuracy": 0.06859578937292099,
"num_tokens": 112713.0,
"step": 35
},
{
"entropy": 10.707574653625489,
"epoch": 0.07992007992007992,
"grad_norm": 2.28125,
"learning_rate": 1.95e-05,
"loss": 10.1924,
"mean_token_accuracy": 0.06884920224547386,
"num_tokens": 128259.0,
"step": 40
},
{
"entropy": 10.654945564270019,
"epoch": 0.0899100899100899,
"grad_norm": 2.046875,
"learning_rate": 2.2e-05,
"loss": 10.1434,
"mean_token_accuracy": 0.06479340717196465,
"num_tokens": 145521.0,
"step": 45
},
{
"entropy": 10.624096393585205,
"epoch": 0.0999000999000999,
"grad_norm": 1.7734375,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0779,
"mean_token_accuracy": 0.06704385466873646,
"num_tokens": 162665.0,
"step": 50
},
{
"entropy": 10.62326774597168,
"epoch": 0.10989010989010989,
"grad_norm": 1.796875,
"learning_rate": 2.7e-05,
"loss": 10.0119,
"mean_token_accuracy": 0.06695662550628186,
"num_tokens": 178901.0,
"step": 55
},
{
"entropy": 10.61907787322998,
"epoch": 0.11988011988011989,
"grad_norm": 1.7421875,
"learning_rate": 2.95e-05,
"loss": 9.9679,
"mean_token_accuracy": 0.06775063388049603,
"num_tokens": 194617.0,
"step": 60
},
{
"entropy": 10.605632114410401,
"epoch": 0.12987012987012986,
"grad_norm": 1.7109375,
"learning_rate": 3.2e-05,
"loss": 9.8939,
"mean_token_accuracy": 0.07534115239977837,
"num_tokens": 209675.0,
"step": 65
},
{
"entropy": 10.59527235031128,
"epoch": 0.13986013986013987,
"grad_norm": 2.0,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.8733,
"mean_token_accuracy": 0.07048867233097553,
"num_tokens": 225848.0,
"step": 70
},
{
"entropy": 10.599591922760009,
"epoch": 0.14985014985014986,
"grad_norm": 1.796875,
"learning_rate": 3.7e-05,
"loss": 9.8167,
"mean_token_accuracy": 0.07247593812644482,
"num_tokens": 242981.0,
"step": 75
},
{
"entropy": 10.579588508605957,
"epoch": 0.15984015984015984,
"grad_norm": 1.546875,
"learning_rate": 3.95e-05,
"loss": 9.7625,
"mean_token_accuracy": 0.07427209392189979,
"num_tokens": 258173.0,
"step": 80
},
{
"entropy": 10.544640350341798,
"epoch": 0.16983016983016982,
"grad_norm": 1.6484375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.69,
"mean_token_accuracy": 0.07245487086474896,
"num_tokens": 273570.0,
"step": 85
},
{
"entropy": 10.5300874710083,
"epoch": 0.1798201798201798,
"grad_norm": 1.5625,
"learning_rate": 4.45e-05,
"loss": 9.6529,
"mean_token_accuracy": 0.07408605217933655,
"num_tokens": 290549.0,
"step": 90
},
{
"entropy": 10.528420066833496,
"epoch": 0.18981018981018982,
"grad_norm": 1.5390625,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.6194,
"mean_token_accuracy": 0.07625656872987747,
"num_tokens": 306856.0,
"step": 95
},
{
"entropy": 10.485299491882325,
"epoch": 0.1998001998001998,
"grad_norm": 1.5234375,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.5443,
"mean_token_accuracy": 0.08020635470747947,
"num_tokens": 322515.0,
"step": 100
},
{
"entropy": 10.434676933288575,
"epoch": 0.2097902097902098,
"grad_norm": 1.609375,
"learning_rate": 5.2e-05,
"loss": 9.4966,
"mean_token_accuracy": 0.07586914226412773,
"num_tokens": 337941.0,
"step": 105
},
{
"entropy": 10.45520372390747,
"epoch": 0.21978021978021978,
"grad_norm": 1.546875,
"learning_rate": 5.45e-05,
"loss": 9.4232,
"mean_token_accuracy": 0.08006052449345588,
"num_tokens": 353788.0,
"step": 110
},
{
"entropy": 10.380233097076417,
"epoch": 0.22977022977022976,
"grad_norm": 1.6015625,
"learning_rate": 5.7e-05,
"loss": 9.3782,
"mean_token_accuracy": 0.08523525297641754,
"num_tokens": 371012.0,
"step": 115
},
{
"entropy": 10.3286771774292,
"epoch": 0.23976023976023977,
"grad_norm": 1.765625,
"learning_rate": 5.9499999999999996e-05,
"loss": 9.2336,
"mean_token_accuracy": 0.08941392749547958,
"num_tokens": 387063.0,
"step": 120
},
{
"entropy": 10.305299186706543,
"epoch": 0.24975024975024976,
"grad_norm": 1.203125,
"learning_rate": 6.2e-05,
"loss": 9.2413,
"mean_token_accuracy": 0.08080004155635834,
"num_tokens": 404360.0,
"step": 125
},
{
"entropy": 10.245867156982422,
"epoch": 0.2597402597402597,
"grad_norm": 2.0625,
"learning_rate": 6.450000000000001e-05,
"loss": 9.0529,
"mean_token_accuracy": 0.09887080416083335,
"num_tokens": 421267.0,
"step": 130
},
{
"entropy": 10.113175201416016,
"epoch": 0.26973026973026976,
"grad_norm": 1.0390625,
"learning_rate": 6.7e-05,
"loss": 9.0745,
"mean_token_accuracy": 0.0869515560567379,
"num_tokens": 438900.0,
"step": 135
},
{
"entropy": 10.11645679473877,
"epoch": 0.27972027972027974,
"grad_norm": 1.2421875,
"learning_rate": 6.950000000000001e-05,
"loss": 8.9962,
"mean_token_accuracy": 0.08159712329506874,
"num_tokens": 454580.0,
"step": 140
},
{
"entropy": 10.033879661560059,
"epoch": 0.2897102897102897,
"grad_norm": 0.9375,
"learning_rate": 7.2e-05,
"loss": 8.9364,
"mean_token_accuracy": 0.082859006524086,
"num_tokens": 470894.0,
"step": 145
},
{
"entropy": 9.949287033081054,
"epoch": 0.2997002997002997,
"grad_norm": 1.15625,
"learning_rate": 7.45e-05,
"loss": 8.8864,
"mean_token_accuracy": 0.0842631220817566,
"num_tokens": 487872.0,
"step": 150
},
{
"entropy": 9.799868774414062,
"epoch": 0.3096903096903097,
"grad_norm": 1.375,
"learning_rate": 7.7e-05,
"loss": 8.7141,
"mean_token_accuracy": 0.09437366873025894,
"num_tokens": 503899.0,
"step": 155
},
{
"entropy": 9.570561790466309,
"epoch": 0.3196803196803197,
"grad_norm": 0.83203125,
"learning_rate": 7.950000000000001e-05,
"loss": 8.6153,
"mean_token_accuracy": 0.09862063378095627,
"num_tokens": 519023.0,
"step": 160
},
{
"entropy": 9.580165386199951,
"epoch": 0.32967032967032966,
"grad_norm": 0.796875,
"learning_rate": 8.2e-05,
"loss": 8.6321,
"mean_token_accuracy": 0.087054193764925,
"num_tokens": 535424.0,
"step": 165
},
{
"entropy": 9.45827875137329,
"epoch": 0.33966033966033965,
"grad_norm": 0.83203125,
"learning_rate": 8.450000000000001e-05,
"loss": 8.6716,
"mean_token_accuracy": 0.08567041307687759,
"num_tokens": 552528.0,
"step": 170
},
{
"entropy": 9.326940536499023,
"epoch": 0.34965034965034963,
"grad_norm": 0.70703125,
"learning_rate": 8.7e-05,
"loss": 8.5523,
"mean_token_accuracy": 0.08963110744953155,
"num_tokens": 567149.0,
"step": 175
},
{
"entropy": 9.181477642059326,
"epoch": 0.3596403596403596,
"grad_norm": 0.8984375,
"learning_rate": 8.95e-05,
"loss": 8.5255,
"mean_token_accuracy": 0.08932835683226585,
"num_tokens": 582033.0,
"step": 180
},
{
"entropy": 9.184029483795166,
"epoch": 0.3696303696303696,
"grad_norm": 0.9921875,
"learning_rate": 9.2e-05,
"loss": 8.492,
"mean_token_accuracy": 0.09364427700638771,
"num_tokens": 598930.0,
"step": 185
},
{
"entropy": 9.105390739440917,
"epoch": 0.37962037962037964,
"grad_norm": 0.91015625,
"learning_rate": 9.45e-05,
"loss": 8.4764,
"mean_token_accuracy": 0.08496234193444252,
"num_tokens": 615859.0,
"step": 190
},
{
"entropy": 9.057480430603027,
"epoch": 0.38961038961038963,
"grad_norm": 0.66015625,
"learning_rate": 9.7e-05,
"loss": 8.4525,
"mean_token_accuracy": 0.09097891747951507,
"num_tokens": 631984.0,
"step": 195
},
{
"entropy": 8.931283473968506,
"epoch": 0.3996003996003996,
"grad_norm": 0.76171875,
"learning_rate": 9.95e-05,
"loss": 8.4712,
"mean_token_accuracy": 0.09022903516888618,
"num_tokens": 648599.0,
"step": 200
},
{
"entropy": 8.999445819854737,
"epoch": 0.4095904095904096,
"grad_norm": 0.75,
"learning_rate": 0.000102,
"loss": 8.5152,
"mean_token_accuracy": 0.08909457549452782,
"num_tokens": 666196.0,
"step": 205
},
{
"entropy": 8.872494792938232,
"epoch": 0.4195804195804196,
"grad_norm": 0.66015625,
"learning_rate": 0.00010449999999999999,
"loss": 8.4462,
"mean_token_accuracy": 0.09361587092280388,
"num_tokens": 682848.0,
"step": 210
},
{
"entropy": 8.852845001220704,
"epoch": 0.42957042957042957,
"grad_norm": 0.5703125,
"learning_rate": 0.000107,
"loss": 8.3932,
"mean_token_accuracy": 0.0924599327147007,
"num_tokens": 700324.0,
"step": 215
},
{
"entropy": 8.826492881774902,
"epoch": 0.43956043956043955,
"grad_norm": 0.6796875,
"learning_rate": 0.0001095,
"loss": 8.438,
"mean_token_accuracy": 0.0906071975827217,
"num_tokens": 715401.0,
"step": 220
},
{
"entropy": 8.716631221771241,
"epoch": 0.44955044955044954,
"grad_norm": 0.68359375,
"learning_rate": 0.000112,
"loss": 8.4143,
"mean_token_accuracy": 0.09328261092305183,
"num_tokens": 730372.0,
"step": 225
},
{
"entropy": 8.727209281921386,
"epoch": 0.4595404595404595,
"grad_norm": 0.796875,
"learning_rate": 0.0001145,
"loss": 8.3391,
"mean_token_accuracy": 0.09173915013670922,
"num_tokens": 745880.0,
"step": 230
},
{
"entropy": 8.743009567260742,
"epoch": 0.4695304695304695,
"grad_norm": 0.7265625,
"learning_rate": 0.00011700000000000001,
"loss": 8.3552,
"mean_token_accuracy": 0.09261953458189964,
"num_tokens": 761474.0,
"step": 235
},
{
"entropy": 8.669536972045899,
"epoch": 0.47952047952047955,
"grad_norm": 0.62890625,
"learning_rate": 0.00011949999999999999,
"loss": 8.3798,
"mean_token_accuracy": 0.09077078998088836,
"num_tokens": 776871.0,
"step": 240
},
{
"entropy": 8.689266204833984,
"epoch": 0.48951048951048953,
"grad_norm": 0.70703125,
"learning_rate": 0.000122,
"loss": 8.3659,
"mean_token_accuracy": 0.09065382108092308,
"num_tokens": 793506.0,
"step": 245
},
{
"entropy": 8.591617012023926,
"epoch": 0.4995004995004995,
"grad_norm": 0.68359375,
"learning_rate": 0.0001245,
"loss": 8.3325,
"mean_token_accuracy": 0.09529750868678093,
"num_tokens": 808366.0,
"step": 250
},
{
"entropy": 8.718113708496094,
"epoch": 0.5094905094905094,
"grad_norm": 0.765625,
"learning_rate": 0.000127,
"loss": 8.2646,
"mean_token_accuracy": 0.10416125357151032,
"num_tokens": 825461.0,
"step": 255
},
{
"entropy": 8.644307136535645,
"epoch": 0.5194805194805194,
"grad_norm": 0.65625,
"learning_rate": 0.0001295,
"loss": 8.3552,
"mean_token_accuracy": 0.08870847970247268,
"num_tokens": 840998.0,
"step": 260
},
{
"entropy": 8.638798427581786,
"epoch": 0.5294705294705294,
"grad_norm": 0.70703125,
"learning_rate": 0.000132,
"loss": 8.4149,
"mean_token_accuracy": 0.08986097797751427,
"num_tokens": 858383.0,
"step": 265
},
{
"entropy": 8.622299480438233,
"epoch": 0.5394605394605395,
"grad_norm": 0.703125,
"learning_rate": 0.00013450000000000002,
"loss": 8.3192,
"mean_token_accuracy": 0.08967429846525192,
"num_tokens": 873611.0,
"step": 270
},
{
"entropy": 8.645909023284911,
"epoch": 0.5494505494505495,
"grad_norm": 0.8046875,
"learning_rate": 0.00013700000000000002,
"loss": 8.2318,
"mean_token_accuracy": 0.10625835433602333,
"num_tokens": 889918.0,
"step": 275
},
{
"entropy": 8.576266384124756,
"epoch": 0.5594405594405595,
"grad_norm": 0.80859375,
"learning_rate": 0.0001395,
"loss": 8.2966,
"mean_token_accuracy": 0.1017056480050087,
"num_tokens": 906967.0,
"step": 280
},
{
"entropy": 8.678112125396728,
"epoch": 0.5694305694305695,
"grad_norm": 0.73828125,
"learning_rate": 0.00014199999999999998,
"loss": 8.3848,
"mean_token_accuracy": 0.09247232899069786,
"num_tokens": 922954.0,
"step": 285
},
{
"entropy": 8.666139221191406,
"epoch": 0.5794205794205795,
"grad_norm": 0.7734375,
"learning_rate": 0.0001445,
"loss": 8.3586,
"mean_token_accuracy": 0.0921535387635231,
"num_tokens": 938920.0,
"step": 290
},
{
"entropy": 8.631329917907715,
"epoch": 0.5894105894105894,
"grad_norm": 0.66796875,
"learning_rate": 0.000147,
"loss": 8.3734,
"mean_token_accuracy": 0.0920196034014225,
"num_tokens": 956301.0,
"step": 295
},
{
"entropy": 8.548529148101807,
"epoch": 0.5994005994005994,
"grad_norm": 0.8515625,
"learning_rate": 0.0001495,
"loss": 8.2358,
"mean_token_accuracy": 0.09958092793822289,
"num_tokens": 972454.0,
"step": 300
},
{
"entropy": 8.61522102355957,
"epoch": 0.6093906093906094,
"grad_norm": 0.703125,
"learning_rate": 0.000152,
"loss": 8.333,
"mean_token_accuracy": 0.09208913743495942,
"num_tokens": 987326.0,
"step": 305
},
{
"entropy": 8.584405994415283,
"epoch": 0.6193806193806194,
"grad_norm": 0.69921875,
"learning_rate": 0.00015450000000000001,
"loss": 8.2977,
"mean_token_accuracy": 0.09532473459839821,
"num_tokens": 1002448.0,
"step": 310
},
{
"entropy": 8.536137676239013,
"epoch": 0.6293706293706294,
"grad_norm": 0.69921875,
"learning_rate": 0.000157,
"loss": 8.3265,
"mean_token_accuracy": 0.09180266484618187,
"num_tokens": 1020348.0,
"step": 315
},
{
"entropy": 8.623396396636963,
"epoch": 0.6393606393606394,
"grad_norm": 0.7265625,
"learning_rate": 0.0001595,
"loss": 8.3499,
"mean_token_accuracy": 0.08997747674584389,
"num_tokens": 1036562.0,
"step": 320
},
{
"entropy": 8.528428745269775,
"epoch": 0.6493506493506493,
"grad_norm": 0.7734375,
"learning_rate": 0.000162,
"loss": 8.3187,
"mean_token_accuracy": 0.09452675953507424,
"num_tokens": 1053106.0,
"step": 325
},
{
"entropy": 8.570547008514405,
"epoch": 0.6593406593406593,
"grad_norm": 0.80078125,
"learning_rate": 0.00016450000000000001,
"loss": 8.2708,
"mean_token_accuracy": 0.09287350997328758,
"num_tokens": 1068277.0,
"step": 330
},
{
"entropy": 8.505113983154297,
"epoch": 0.6693306693306693,
"grad_norm": 0.7109375,
"learning_rate": 0.00016700000000000002,
"loss": 8.212,
"mean_token_accuracy": 0.10472053438425064,
"num_tokens": 1083887.0,
"step": 335
},
{
"entropy": 8.494814014434814,
"epoch": 0.6793206793206793,
"grad_norm": 0.65234375,
"learning_rate": 0.00016950000000000003,
"loss": 8.2264,
"mean_token_accuracy": 0.0991443045437336,
"num_tokens": 1099791.0,
"step": 340
},
{
"entropy": 8.513353157043458,
"epoch": 0.6893106893106893,
"grad_norm": 0.9140625,
"learning_rate": 0.00017199999999999998,
"loss": 8.2843,
"mean_token_accuracy": 0.09210123345255852,
"num_tokens": 1116137.0,
"step": 345
},
{
"entropy": 8.550718784332275,
"epoch": 0.6993006993006993,
"grad_norm": 0.77734375,
"learning_rate": 0.00017449999999999999,
"loss": 8.2293,
"mean_token_accuracy": 0.10072905272245407,
"num_tokens": 1132449.0,
"step": 350
},
{
"entropy": 8.527479457855225,
"epoch": 0.7092907092907093,
"grad_norm": 1.1171875,
"learning_rate": 0.000177,
"loss": 8.3552,
"mean_token_accuracy": 0.09086157828569412,
"num_tokens": 1148316.0,
"step": 355
},
{
"entropy": 8.505389308929443,
"epoch": 0.7192807192807192,
"grad_norm": 0.74609375,
"learning_rate": 0.0001795,
"loss": 8.2142,
"mean_token_accuracy": 0.09256454855203629,
"num_tokens": 1164030.0,
"step": 360
},
{
"entropy": 8.580228328704834,
"epoch": 0.7292707292707292,
"grad_norm": 0.87109375,
"learning_rate": 0.000182,
"loss": 8.3049,
"mean_token_accuracy": 0.09622592777013779,
"num_tokens": 1180624.0,
"step": 365
},
{
"entropy": 8.496176528930665,
"epoch": 0.7392607392607392,
"grad_norm": 0.8671875,
"learning_rate": 0.0001845,
"loss": 8.2815,
"mean_token_accuracy": 0.09714617729187011,
"num_tokens": 1196986.0,
"step": 370
},
{
"entropy": 8.580214786529542,
"epoch": 0.7492507492507493,
"grad_norm": 0.72265625,
"learning_rate": 0.000187,
"loss": 8.2919,
"mean_token_accuracy": 0.09614738449454308,
"num_tokens": 1212754.0,
"step": 375
},
{
"entropy": 8.44631586074829,
"epoch": 0.7592407592407593,
"grad_norm": 0.91015625,
"learning_rate": 0.0001895,
"loss": 8.2324,
"mean_token_accuracy": 0.09536803364753724,
"num_tokens": 1229627.0,
"step": 380
},
{
"entropy": 8.515226554870605,
"epoch": 0.7692307692307693,
"grad_norm": 1.1796875,
"learning_rate": 0.000192,
"loss": 8.1816,
"mean_token_accuracy": 0.0967013455927372,
"num_tokens": 1245127.0,
"step": 385
},
{
"entropy": 8.458242416381836,
"epoch": 0.7792207792207793,
"grad_norm": 0.8125,
"learning_rate": 0.0001945,
"loss": 8.2483,
"mean_token_accuracy": 0.09477976039052009,
"num_tokens": 1261438.0,
"step": 390
},
{
"entropy": 8.479850482940673,
"epoch": 0.7892107892107892,
"grad_norm": 0.734375,
"learning_rate": 0.00019700000000000002,
"loss": 8.2152,
"mean_token_accuracy": 0.09673597514629365,
"num_tokens": 1277476.0,
"step": 395
},
{
"entropy": 8.536440181732178,
"epoch": 0.7992007992007992,
"grad_norm": 0.76953125,
"learning_rate": 0.00019950000000000002,
"loss": 8.1608,
"mean_token_accuracy": 0.09755991101264953,
"num_tokens": 1294659.0,
"step": 400
},
{
"entropy": 8.371343421936036,
"epoch": 0.8091908091908092,
"grad_norm": 0.8203125,
"learning_rate": 0.000202,
"loss": 8.1319,
"mean_token_accuracy": 0.10120925828814506,
"num_tokens": 1308829.0,
"step": 405
},
{
"entropy": 8.464437866210938,
"epoch": 0.8191808191808192,
"grad_norm": 0.765625,
"learning_rate": 0.00020449999999999998,
"loss": 8.1896,
"mean_token_accuracy": 0.10006042197346687,
"num_tokens": 1325659.0,
"step": 410
},
{
"entropy": 8.507107639312744,
"epoch": 0.8291708291708292,
"grad_norm": 0.87890625,
"learning_rate": 0.000207,
"loss": 8.2255,
"mean_token_accuracy": 0.09681524932384492,
"num_tokens": 1341643.0,
"step": 415
},
{
"entropy": 8.446794795989991,
"epoch": 0.8391608391608392,
"grad_norm": 0.9140625,
"learning_rate": 0.0002095,
"loss": 8.197,
"mean_token_accuracy": 0.09735974669456482,
"num_tokens": 1359197.0,
"step": 420
},
{
"entropy": 8.502279472351074,
"epoch": 0.8491508491508492,
"grad_norm": 0.6796875,
"learning_rate": 0.000212,
"loss": 8.1875,
"mean_token_accuracy": 0.09608993604779244,
"num_tokens": 1376107.0,
"step": 425
},
{
"entropy": 8.477056503295898,
"epoch": 0.8591408591408591,
"grad_norm": 0.79296875,
"learning_rate": 0.0002145,
"loss": 8.2042,
"mean_token_accuracy": 0.09094029515981675,
"num_tokens": 1392232.0,
"step": 430
},
{
"entropy": 8.460865306854249,
"epoch": 0.8691308691308691,
"grad_norm": 0.83984375,
"learning_rate": 0.00021700000000000002,
"loss": 8.1631,
"mean_token_accuracy": 0.09813632071018219,
"num_tokens": 1406747.0,
"step": 435
},
{
"entropy": 8.48235101699829,
"epoch": 0.8791208791208791,
"grad_norm": 0.7890625,
"learning_rate": 0.0002195,
"loss": 8.1609,
"mean_token_accuracy": 0.09457436800003052,
"num_tokens": 1423599.0,
"step": 440
},
{
"entropy": 8.372987842559814,
"epoch": 0.8891108891108891,
"grad_norm": 1.1640625,
"learning_rate": 0.000222,
"loss": 8.091,
"mean_token_accuracy": 0.1050879828631878,
"num_tokens": 1439330.0,
"step": 445
},
{
"entropy": 8.440707111358643,
"epoch": 0.8991008991008991,
"grad_norm": 0.66015625,
"learning_rate": 0.0002245,
"loss": 8.0636,
"mean_token_accuracy": 0.10564030036330223,
"num_tokens": 1456660.0,
"step": 450
},
{
"entropy": 8.463158130645752,
"epoch": 0.9090909090909091,
"grad_norm": 0.77734375,
"learning_rate": 0.00022700000000000002,
"loss": 8.1173,
"mean_token_accuracy": 0.10065716579556465,
"num_tokens": 1471619.0,
"step": 455
},
{
"entropy": 8.29682149887085,
"epoch": 0.919080919080919,
"grad_norm": 0.90625,
"learning_rate": 0.00022950000000000002,
"loss": 8.0752,
"mean_token_accuracy": 0.09712542369961738,
"num_tokens": 1486971.0,
"step": 460
},
{
"entropy": 8.374618434906006,
"epoch": 0.929070929070929,
"grad_norm": 0.7890625,
"learning_rate": 0.00023200000000000003,
"loss": 8.1102,
"mean_token_accuracy": 0.09521022215485572,
"num_tokens": 1502923.0,
"step": 465
},
{
"entropy": 8.45193510055542,
"epoch": 0.939060939060939,
"grad_norm": 1.1015625,
"learning_rate": 0.00023449999999999998,
"loss": 8.1818,
"mean_token_accuracy": 0.09111250266432762,
"num_tokens": 1520214.0,
"step": 470
},
{
"entropy": 8.413396072387695,
"epoch": 0.949050949050949,
"grad_norm": 0.875,
"learning_rate": 0.000237,
"loss": 8.0682,
"mean_token_accuracy": 0.10277181193232536,
"num_tokens": 1534946.0,
"step": 475
},
{
"entropy": 8.293998527526856,
"epoch": 0.9590409590409591,
"grad_norm": 0.74609375,
"learning_rate": 0.0002395,
"loss": 7.9474,
"mean_token_accuracy": 0.11179379150271415,
"num_tokens": 1551823.0,
"step": 480
},
{
"entropy": 8.366506767272949,
"epoch": 0.9690309690309691,
"grad_norm": 0.98828125,
"learning_rate": 0.000242,
"loss": 8.0529,
"mean_token_accuracy": 0.10311459228396416,
"num_tokens": 1567354.0,
"step": 485
},
{
"entropy": 8.338885498046874,
"epoch": 0.9790209790209791,
"grad_norm": 1.109375,
"learning_rate": 0.0002445,
"loss": 8.0225,
"mean_token_accuracy": 0.09862796664237976,
"num_tokens": 1583749.0,
"step": 490
},
{
"entropy": 8.336707592010498,
"epoch": 0.989010989010989,
"grad_norm": 0.87890625,
"learning_rate": 0.000247,
"loss": 8.1258,
"mean_token_accuracy": 0.09763901010155678,
"num_tokens": 1599678.0,
"step": 495
},
{
"entropy": 8.445067310333252,
"epoch": 0.999000999000999,
"grad_norm": 0.99609375,
"learning_rate": 0.0002495,
"loss": 8.1224,
"mean_token_accuracy": 0.0928703673183918,
"num_tokens": 1616737.0,
"step": 500
},
{
"epoch": 0.999000999000999,
"eval_entropy": 8.140788088618098,
"eval_loss": 8.047406196594238,
"eval_mean_token_accuracy": 0.09197118636724111,
"eval_num_tokens": 1616737.0,
"eval_runtime": 1.1978,
"eval_samples_per_second": 1230.577,
"eval_steps_per_second": 154.448,
"step": 500
}
],
"logging_steps": 5,
"max_steps": 5000,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 325253177671680.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}