4079 lines
110 KiB
JSON
4079 lines
110 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.993006993006993,
|
|
"eval_steps": 500,
|
|
"global_step": 2000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.74254903793335,
|
|
"epoch": 0.00999000999000999,
|
|
"grad_norm": 4.6875,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8409,
|
|
"mean_token_accuracy": 0.00010789126390591264,
|
|
"num_tokens": 17348.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.742575931549073,
|
|
"epoch": 0.01998001998001998,
|
|
"grad_norm": 5.28125,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.8325,
|
|
"mean_token_accuracy": 6.410256610251963e-05,
|
|
"num_tokens": 33613.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.742553329467773,
|
|
"epoch": 0.029970029970029972,
|
|
"grad_norm": 5.0625,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.8012,
|
|
"mean_token_accuracy": 0.00016108142444863914,
|
|
"num_tokens": 49416.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.742562675476075,
|
|
"epoch": 0.03996003996003996,
|
|
"grad_norm": 5.0625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.7438,
|
|
"mean_token_accuracy": 0.0010525182529818266,
|
|
"num_tokens": 64663.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.742408943176269,
|
|
"epoch": 0.04995004995004995,
|
|
"grad_norm": 4.75,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 10.6283,
|
|
"mean_token_accuracy": 0.03072175462730229,
|
|
"num_tokens": 79972.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.74140043258667,
|
|
"epoch": 0.059940059940059943,
|
|
"grad_norm": 4.0,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 10.5246,
|
|
"mean_token_accuracy": 0.05747625604271889,
|
|
"num_tokens": 96254.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.735374069213867,
|
|
"epoch": 0.06993006993006994,
|
|
"grad_norm": 2.875,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 10.3755,
|
|
"mean_token_accuracy": 0.06859578937292099,
|
|
"num_tokens": 112713.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.707574653625489,
|
|
"epoch": 0.07992007992007992,
|
|
"grad_norm": 2.28125,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 10.1924,
|
|
"mean_token_accuracy": 0.06884920224547386,
|
|
"num_tokens": 128259.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.654945564270019,
|
|
"epoch": 0.0899100899100899,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 10.1434,
|
|
"mean_token_accuracy": 0.06479340717196465,
|
|
"num_tokens": 145521.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.624096393585205,
|
|
"epoch": 0.0999000999000999,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 10.0779,
|
|
"mean_token_accuracy": 0.06704385466873646,
|
|
"num_tokens": 162665.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.62326774597168,
|
|
"epoch": 0.10989010989010989,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 10.0119,
|
|
"mean_token_accuracy": 0.06695662550628186,
|
|
"num_tokens": 178901.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.61907787322998,
|
|
"epoch": 0.11988011988011989,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.9679,
|
|
"mean_token_accuracy": 0.06775063388049603,
|
|
"num_tokens": 194617.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.605632114410401,
|
|
"epoch": 0.12987012987012986,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.8939,
|
|
"mean_token_accuracy": 0.07534115239977837,
|
|
"num_tokens": 209675.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.59527235031128,
|
|
"epoch": 0.13986013986013987,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.8733,
|
|
"mean_token_accuracy": 0.07048867233097553,
|
|
"num_tokens": 225848.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.599591922760009,
|
|
"epoch": 0.14985014985014986,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.8167,
|
|
"mean_token_accuracy": 0.07247593812644482,
|
|
"num_tokens": 242981.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.579588508605957,
|
|
"epoch": 0.15984015984015984,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.7625,
|
|
"mean_token_accuracy": 0.07427209392189979,
|
|
"num_tokens": 258173.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.544640350341798,
|
|
"epoch": 0.16983016983016982,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.69,
|
|
"mean_token_accuracy": 0.07245487086474896,
|
|
"num_tokens": 273570.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.5300874710083,
|
|
"epoch": 0.1798201798201798,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 9.6529,
|
|
"mean_token_accuracy": 0.07408605217933655,
|
|
"num_tokens": 290549.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.528420066833496,
|
|
"epoch": 0.18981018981018982,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 9.6194,
|
|
"mean_token_accuracy": 0.07625656872987747,
|
|
"num_tokens": 306856.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.485299491882325,
|
|
"epoch": 0.1998001998001998,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 9.5443,
|
|
"mean_token_accuracy": 0.08020635470747947,
|
|
"num_tokens": 322515.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.434676933288575,
|
|
"epoch": 0.2097902097902098,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 9.4966,
|
|
"mean_token_accuracy": 0.07586914226412773,
|
|
"num_tokens": 337941.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.45520372390747,
|
|
"epoch": 0.21978021978021978,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 9.4232,
|
|
"mean_token_accuracy": 0.08006052449345588,
|
|
"num_tokens": 353788.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.380233097076417,
|
|
"epoch": 0.22977022977022976,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 9.3782,
|
|
"mean_token_accuracy": 0.08523525297641754,
|
|
"num_tokens": 371012.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 10.3286771774292,
|
|
"epoch": 0.23976023976023977,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 9.2336,
|
|
"mean_token_accuracy": 0.08941392749547958,
|
|
"num_tokens": 387063.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 10.305299186706543,
|
|
"epoch": 0.24975024975024976,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 9.2413,
|
|
"mean_token_accuracy": 0.08080004155635834,
|
|
"num_tokens": 404360.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 10.245867156982422,
|
|
"epoch": 0.2597402597402597,
|
|
"grad_norm": 2.0625,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 9.0529,
|
|
"mean_token_accuracy": 0.09887080416083335,
|
|
"num_tokens": 421267.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 10.113175201416016,
|
|
"epoch": 0.26973026973026976,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 9.0745,
|
|
"mean_token_accuracy": 0.0869515560567379,
|
|
"num_tokens": 438900.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 10.11645679473877,
|
|
"epoch": 0.27972027972027974,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.9962,
|
|
"mean_token_accuracy": 0.08159712329506874,
|
|
"num_tokens": 454580.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 10.033879661560059,
|
|
"epoch": 0.2897102897102897,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.9364,
|
|
"mean_token_accuracy": 0.082859006524086,
|
|
"num_tokens": 470894.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 9.949287033081054,
|
|
"epoch": 0.2997002997002997,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.8864,
|
|
"mean_token_accuracy": 0.0842631220817566,
|
|
"num_tokens": 487872.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 9.799868774414062,
|
|
"epoch": 0.3096903096903097,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 8.7141,
|
|
"mean_token_accuracy": 0.09437366873025894,
|
|
"num_tokens": 503899.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 9.570561790466309,
|
|
"epoch": 0.3196803196803197,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 8.6153,
|
|
"mean_token_accuracy": 0.09862063378095627,
|
|
"num_tokens": 519023.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 9.580165386199951,
|
|
"epoch": 0.32967032967032966,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 8.6321,
|
|
"mean_token_accuracy": 0.087054193764925,
|
|
"num_tokens": 535424.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 9.45827875137329,
|
|
"epoch": 0.33966033966033965,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 8.6716,
|
|
"mean_token_accuracy": 0.08567041307687759,
|
|
"num_tokens": 552528.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 9.326940536499023,
|
|
"epoch": 0.34965034965034963,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 8.5523,
|
|
"mean_token_accuracy": 0.08963110744953155,
|
|
"num_tokens": 567149.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 9.181477642059326,
|
|
"epoch": 0.3596403596403596,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 8.5255,
|
|
"mean_token_accuracy": 0.08932835683226585,
|
|
"num_tokens": 582033.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 9.184029483795166,
|
|
"epoch": 0.3696303696303696,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 8.492,
|
|
"mean_token_accuracy": 0.09364427700638771,
|
|
"num_tokens": 598930.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 9.105390739440917,
|
|
"epoch": 0.37962037962037964,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 8.4764,
|
|
"mean_token_accuracy": 0.08496234193444252,
|
|
"num_tokens": 615859.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 9.057480430603027,
|
|
"epoch": 0.38961038961038963,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 8.4525,
|
|
"mean_token_accuracy": 0.09097891747951507,
|
|
"num_tokens": 631984.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.931283473968506,
|
|
"epoch": 0.3996003996003996,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 8.4712,
|
|
"mean_token_accuracy": 0.09022903516888618,
|
|
"num_tokens": 648599.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.999445819854737,
|
|
"epoch": 0.4095904095904096,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000102,
|
|
"loss": 8.5152,
|
|
"mean_token_accuracy": 0.08909457549452782,
|
|
"num_tokens": 666196.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.872494792938232,
|
|
"epoch": 0.4195804195804196,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 8.4462,
|
|
"mean_token_accuracy": 0.09361587092280388,
|
|
"num_tokens": 682848.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 8.852845001220704,
|
|
"epoch": 0.42957042957042957,
|
|
"grad_norm": 0.5703125,
|
|
"learning_rate": 0.000107,
|
|
"loss": 8.3932,
|
|
"mean_token_accuracy": 0.0924599327147007,
|
|
"num_tokens": 700324.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 8.826492881774902,
|
|
"epoch": 0.43956043956043955,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 8.438,
|
|
"mean_token_accuracy": 0.0906071975827217,
|
|
"num_tokens": 715401.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 8.716631221771241,
|
|
"epoch": 0.44955044955044954,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.000112,
|
|
"loss": 8.4143,
|
|
"mean_token_accuracy": 0.09328261092305183,
|
|
"num_tokens": 730372.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 8.727209281921386,
|
|
"epoch": 0.4595404595404595,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 8.3391,
|
|
"mean_token_accuracy": 0.09173915013670922,
|
|
"num_tokens": 745880.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 8.743009567260742,
|
|
"epoch": 0.4695304695304695,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 8.3552,
|
|
"mean_token_accuracy": 0.09261953458189964,
|
|
"num_tokens": 761474.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 8.669536972045899,
|
|
"epoch": 0.47952047952047955,
|
|
"grad_norm": 0.62890625,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 8.3798,
|
|
"mean_token_accuracy": 0.09077078998088836,
|
|
"num_tokens": 776871.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 8.689266204833984,
|
|
"epoch": 0.48951048951048953,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 8.3659,
|
|
"mean_token_accuracy": 0.09065382108092308,
|
|
"num_tokens": 793506.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 8.591617012023926,
|
|
"epoch": 0.4995004995004995,
|
|
"grad_norm": 0.68359375,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 8.3325,
|
|
"mean_token_accuracy": 0.09529750868678093,
|
|
"num_tokens": 808366.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 8.718113708496094,
|
|
"epoch": 0.5094905094905094,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000127,
|
|
"loss": 8.2646,
|
|
"mean_token_accuracy": 0.10416125357151032,
|
|
"num_tokens": 825461.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 8.644307136535645,
|
|
"epoch": 0.5194805194805194,
|
|
"grad_norm": 0.65625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 8.3552,
|
|
"mean_token_accuracy": 0.08870847970247268,
|
|
"num_tokens": 840998.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 8.638798427581786,
|
|
"epoch": 0.5294705294705294,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 8.4149,
|
|
"mean_token_accuracy": 0.08986097797751427,
|
|
"num_tokens": 858383.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 8.622299480438233,
|
|
"epoch": 0.5394605394605395,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 8.3192,
|
|
"mean_token_accuracy": 0.08967429846525192,
|
|
"num_tokens": 873611.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 8.645909023284911,
|
|
"epoch": 0.5494505494505495,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 8.2318,
|
|
"mean_token_accuracy": 0.10625835433602333,
|
|
"num_tokens": 889918.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 8.576266384124756,
|
|
"epoch": 0.5594405594405595,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 8.2966,
|
|
"mean_token_accuracy": 0.1017056480050087,
|
|
"num_tokens": 906967.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 8.678112125396728,
|
|
"epoch": 0.5694305694305695,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 8.3848,
|
|
"mean_token_accuracy": 0.09247232899069786,
|
|
"num_tokens": 922954.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 8.666139221191406,
|
|
"epoch": 0.5794205794205795,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 8.3586,
|
|
"mean_token_accuracy": 0.0921535387635231,
|
|
"num_tokens": 938920.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 8.631329917907715,
|
|
"epoch": 0.5894105894105894,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 8.3734,
|
|
"mean_token_accuracy": 0.0920196034014225,
|
|
"num_tokens": 956301.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 8.548529148101807,
|
|
"epoch": 0.5994005994005994,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 8.2358,
|
|
"mean_token_accuracy": 0.09958092793822289,
|
|
"num_tokens": 972454.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 8.61522102355957,
|
|
"epoch": 0.6093906093906094,
|
|
"grad_norm": 0.703125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 8.333,
|
|
"mean_token_accuracy": 0.09208913743495942,
|
|
"num_tokens": 987326.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 8.584405994415283,
|
|
"epoch": 0.6193806193806194,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 8.2977,
|
|
"mean_token_accuracy": 0.09532473459839821,
|
|
"num_tokens": 1002448.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 8.536137676239013,
|
|
"epoch": 0.6293706293706294,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.000157,
|
|
"loss": 8.3265,
|
|
"mean_token_accuracy": 0.09180266484618187,
|
|
"num_tokens": 1020348.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 8.623396396636963,
|
|
"epoch": 0.6393606393606394,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 8.3499,
|
|
"mean_token_accuracy": 0.08997747674584389,
|
|
"num_tokens": 1036562.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 8.528428745269775,
|
|
"epoch": 0.6493506493506493,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.000162,
|
|
"loss": 8.3187,
|
|
"mean_token_accuracy": 0.09452675953507424,
|
|
"num_tokens": 1053106.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 8.570547008514405,
|
|
"epoch": 0.6593406593406593,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 8.2708,
|
|
"mean_token_accuracy": 0.09287350997328758,
|
|
"num_tokens": 1068277.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 8.505113983154297,
|
|
"epoch": 0.6693306693306693,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 8.212,
|
|
"mean_token_accuracy": 0.10472053438425064,
|
|
"num_tokens": 1083887.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 8.494814014434814,
|
|
"epoch": 0.6793206793206793,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 8.2264,
|
|
"mean_token_accuracy": 0.0991443045437336,
|
|
"num_tokens": 1099791.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 8.513353157043458,
|
|
"epoch": 0.6893106893106893,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 8.2843,
|
|
"mean_token_accuracy": 0.09210123345255852,
|
|
"num_tokens": 1116137.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 8.550718784332275,
|
|
"epoch": 0.6993006993006993,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 8.2293,
|
|
"mean_token_accuracy": 0.10072905272245407,
|
|
"num_tokens": 1132449.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 8.527479457855225,
|
|
"epoch": 0.7092907092907093,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 8.3552,
|
|
"mean_token_accuracy": 0.09086157828569412,
|
|
"num_tokens": 1148316.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 8.505389308929443,
|
|
"epoch": 0.7192807192807192,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 8.2142,
|
|
"mean_token_accuracy": 0.09256454855203629,
|
|
"num_tokens": 1164030.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 8.580228328704834,
|
|
"epoch": 0.7292707292707292,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 8.3049,
|
|
"mean_token_accuracy": 0.09622592777013779,
|
|
"num_tokens": 1180624.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 8.496176528930665,
|
|
"epoch": 0.7392607392607392,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 8.2815,
|
|
"mean_token_accuracy": 0.09714617729187011,
|
|
"num_tokens": 1196986.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 8.580214786529542,
|
|
"epoch": 0.7492507492507493,
|
|
"grad_norm": 0.72265625,
|
|
"learning_rate": 0.000187,
|
|
"loss": 8.2919,
|
|
"mean_token_accuracy": 0.09614738449454308,
|
|
"num_tokens": 1212754.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 8.44631586074829,
|
|
"epoch": 0.7592407592407593,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 8.2324,
|
|
"mean_token_accuracy": 0.09536803364753724,
|
|
"num_tokens": 1229627.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 8.515226554870605,
|
|
"epoch": 0.7692307692307693,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 8.1816,
|
|
"mean_token_accuracy": 0.0967013455927372,
|
|
"num_tokens": 1245127.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 8.458242416381836,
|
|
"epoch": 0.7792207792207793,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 8.2483,
|
|
"mean_token_accuracy": 0.09477976039052009,
|
|
"num_tokens": 1261438.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 8.479850482940673,
|
|
"epoch": 0.7892107892107892,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 8.2152,
|
|
"mean_token_accuracy": 0.09673597514629365,
|
|
"num_tokens": 1277476.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 8.536440181732178,
|
|
"epoch": 0.7992007992007992,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 8.1608,
|
|
"mean_token_accuracy": 0.09755991101264953,
|
|
"num_tokens": 1294659.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 8.371343421936036,
|
|
"epoch": 0.8091908091908092,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000202,
|
|
"loss": 8.1319,
|
|
"mean_token_accuracy": 0.10120925828814506,
|
|
"num_tokens": 1308829.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 8.464437866210938,
|
|
"epoch": 0.8191808191808192,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 8.1896,
|
|
"mean_token_accuracy": 0.10006042197346687,
|
|
"num_tokens": 1325659.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 8.507107639312744,
|
|
"epoch": 0.8291708291708292,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000207,
|
|
"loss": 8.2255,
|
|
"mean_token_accuracy": 0.09681524932384492,
|
|
"num_tokens": 1341643.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 8.446794795989991,
|
|
"epoch": 0.8391608391608392,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 8.197,
|
|
"mean_token_accuracy": 0.09735974669456482,
|
|
"num_tokens": 1359197.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 8.502279472351074,
|
|
"epoch": 0.8491508491508492,
|
|
"grad_norm": 0.6796875,
|
|
"learning_rate": 0.000212,
|
|
"loss": 8.1875,
|
|
"mean_token_accuracy": 0.09608993604779244,
|
|
"num_tokens": 1376107.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 8.477056503295898,
|
|
"epoch": 0.8591408591408591,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 8.2042,
|
|
"mean_token_accuracy": 0.09094029515981675,
|
|
"num_tokens": 1392232.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 8.460865306854249,
|
|
"epoch": 0.8691308691308691,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 8.1631,
|
|
"mean_token_accuracy": 0.09813632071018219,
|
|
"num_tokens": 1406747.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 8.48235101699829,
|
|
"epoch": 0.8791208791208791,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 8.1609,
|
|
"mean_token_accuracy": 0.09457436800003052,
|
|
"num_tokens": 1423599.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 8.372987842559814,
|
|
"epoch": 0.8891108891108891,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000222,
|
|
"loss": 8.091,
|
|
"mean_token_accuracy": 0.1050879828631878,
|
|
"num_tokens": 1439330.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 8.440707111358643,
|
|
"epoch": 0.8991008991008991,
|
|
"grad_norm": 0.66015625,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 8.0636,
|
|
"mean_token_accuracy": 0.10564030036330223,
|
|
"num_tokens": 1456660.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 8.463158130645752,
|
|
"epoch": 0.9090909090909091,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 8.1173,
|
|
"mean_token_accuracy": 0.10065716579556465,
|
|
"num_tokens": 1471619.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 8.29682149887085,
|
|
"epoch": 0.919080919080919,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 8.0752,
|
|
"mean_token_accuracy": 0.09712542369961738,
|
|
"num_tokens": 1486971.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 8.374618434906006,
|
|
"epoch": 0.929070929070929,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 8.1102,
|
|
"mean_token_accuracy": 0.09521022215485572,
|
|
"num_tokens": 1502923.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 8.45193510055542,
|
|
"epoch": 0.939060939060939,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 8.1818,
|
|
"mean_token_accuracy": 0.09111250266432762,
|
|
"num_tokens": 1520214.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 8.413396072387695,
|
|
"epoch": 0.949050949050949,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 8.0682,
|
|
"mean_token_accuracy": 0.10277181193232536,
|
|
"num_tokens": 1534946.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 8.293998527526856,
|
|
"epoch": 0.9590409590409591,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 7.9474,
|
|
"mean_token_accuracy": 0.11179379150271415,
|
|
"num_tokens": 1551823.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 8.366506767272949,
|
|
"epoch": 0.9690309690309691,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.000242,
|
|
"loss": 8.0529,
|
|
"mean_token_accuracy": 0.10311459228396416,
|
|
"num_tokens": 1567354.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 8.338885498046874,
|
|
"epoch": 0.9790209790209791,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 8.0225,
|
|
"mean_token_accuracy": 0.09862796664237976,
|
|
"num_tokens": 1583749.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 8.336707592010498,
|
|
"epoch": 0.989010989010989,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000247,
|
|
"loss": 8.1258,
|
|
"mean_token_accuracy": 0.09763901010155678,
|
|
"num_tokens": 1599678.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 8.445067310333252,
|
|
"epoch": 0.999000999000999,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 8.1224,
|
|
"mean_token_accuracy": 0.0928703673183918,
|
|
"num_tokens": 1616737.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.999000999000999,
|
|
"eval_entropy": 8.140788088618098,
|
|
"eval_loss": 8.047406196594238,
|
|
"eval_mean_token_accuracy": 0.09197118636724111,
|
|
"eval_num_tokens": 1616737.0,
|
|
"eval_runtime": 1.1978,
|
|
"eval_samples_per_second": 1230.577,
|
|
"eval_steps_per_second": 154.448,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 8.344965828789604,
|
|
"epoch": 1.007992007992008,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000252,
|
|
"loss": 8.0423,
|
|
"mean_token_accuracy": 0.09306528833177355,
|
|
"num_tokens": 1629911.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 8.31555461883545,
|
|
"epoch": 1.017982017982018,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 7.9697,
|
|
"mean_token_accuracy": 0.0968889206647873,
|
|
"num_tokens": 1645944.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 8.219412803649902,
|
|
"epoch": 1.027972027972028,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.000257,
|
|
"loss": 7.944,
|
|
"mean_token_accuracy": 0.10192576050758362,
|
|
"num_tokens": 1660254.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 8.334071922302247,
|
|
"epoch": 1.037962037962038,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 7.9225,
|
|
"mean_token_accuracy": 0.10587546825408936,
|
|
"num_tokens": 1675805.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 8.385684299468995,
|
|
"epoch": 1.0479520479520479,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000262,
|
|
"loss": 7.9414,
|
|
"mean_token_accuracy": 0.09777224585413932,
|
|
"num_tokens": 1692248.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 8.283127307891846,
|
|
"epoch": 1.057942057942058,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 7.9208,
|
|
"mean_token_accuracy": 0.10127234905958175,
|
|
"num_tokens": 1708443.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 8.216063213348388,
|
|
"epoch": 1.0679320679320679,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 7.8234,
|
|
"mean_token_accuracy": 0.1095321536064148,
|
|
"num_tokens": 1723977.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 8.342953109741211,
|
|
"epoch": 1.077922077922078,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 7.9888,
|
|
"mean_token_accuracy": 0.09499371498823166,
|
|
"num_tokens": 1739362.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 8.271250534057618,
|
|
"epoch": 1.0879120879120878,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 7.9808,
|
|
"mean_token_accuracy": 0.09600954875349998,
|
|
"num_tokens": 1755106.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 8.257489347457886,
|
|
"epoch": 1.097902097902098,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 7.9237,
|
|
"mean_token_accuracy": 0.09950614199042321,
|
|
"num_tokens": 1771537.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 8.221052932739259,
|
|
"epoch": 1.1078921078921078,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 7.8883,
|
|
"mean_token_accuracy": 0.10020415410399437,
|
|
"num_tokens": 1786942.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 8.243068408966064,
|
|
"epoch": 1.1178821178821179,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 7.8005,
|
|
"mean_token_accuracy": 0.10907796397805214,
|
|
"num_tokens": 1803849.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 8.201099395751953,
|
|
"epoch": 1.127872127872128,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 7.8788,
|
|
"mean_token_accuracy": 0.10487436950206756,
|
|
"num_tokens": 1820439.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 8.326700115203858,
|
|
"epoch": 1.1378621378621379,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 7.9411,
|
|
"mean_token_accuracy": 0.10306010618805886,
|
|
"num_tokens": 1836008.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 8.20847806930542,
|
|
"epoch": 1.1478521478521477,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000287,
|
|
"loss": 7.8465,
|
|
"mean_token_accuracy": 0.10470956414937974,
|
|
"num_tokens": 1851887.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 8.185382175445557,
|
|
"epoch": 1.1578421578421578,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 7.8585,
|
|
"mean_token_accuracy": 0.0996880978345871,
|
|
"num_tokens": 1866979.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 8.20130467414856,
|
|
"epoch": 1.167832167832168,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000292,
|
|
"loss": 7.8965,
|
|
"mean_token_accuracy": 0.09827386811375619,
|
|
"num_tokens": 1881384.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 8.22911195755005,
|
|
"epoch": 1.1778221778221778,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 7.8368,
|
|
"mean_token_accuracy": 0.10659671127796173,
|
|
"num_tokens": 1898986.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 8.15971794128418,
|
|
"epoch": 1.187812187812188,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 7.8281,
|
|
"mean_token_accuracy": 0.10433512926101685,
|
|
"num_tokens": 1913303.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 8.172107124328614,
|
|
"epoch": 1.1978021978021978,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 7.8345,
|
|
"mean_token_accuracy": 0.11005568951368332,
|
|
"num_tokens": 1928906.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 8.24223837852478,
|
|
"epoch": 1.2077922077922079,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.000302,
|
|
"loss": 7.9028,
|
|
"mean_token_accuracy": 0.10041624084115028,
|
|
"num_tokens": 1944823.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 8.156695556640624,
|
|
"epoch": 1.2177822177822177,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 7.8661,
|
|
"mean_token_accuracy": 0.10058502033352852,
|
|
"num_tokens": 1960538.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 8.20977144241333,
|
|
"epoch": 1.2277722277722278,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000307,
|
|
"loss": 7.8367,
|
|
"mean_token_accuracy": 0.09877868816256523,
|
|
"num_tokens": 1979509.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 8.162244510650634,
|
|
"epoch": 1.2377622377622377,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 7.7884,
|
|
"mean_token_accuracy": 0.10074753984808922,
|
|
"num_tokens": 1995113.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 8.172338390350342,
|
|
"epoch": 1.2477522477522478,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.000312,
|
|
"loss": 7.7659,
|
|
"mean_token_accuracy": 0.10919720381498337,
|
|
"num_tokens": 2010212.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 8.09831461906433,
|
|
"epoch": 1.2577422577422577,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 7.8129,
|
|
"mean_token_accuracy": 0.10691071450710296,
|
|
"num_tokens": 2027483.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 8.133178567886352,
|
|
"epoch": 1.2677322677322678,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.000317,
|
|
"loss": 7.7896,
|
|
"mean_token_accuracy": 0.10240155979990959,
|
|
"num_tokens": 2043897.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 8.285891056060791,
|
|
"epoch": 1.2777222777222776,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 7.8684,
|
|
"mean_token_accuracy": 0.0982455164194107,
|
|
"num_tokens": 2061645.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 8.103964185714721,
|
|
"epoch": 1.2877122877122877,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 7.8364,
|
|
"mean_token_accuracy": 0.10459044799208642,
|
|
"num_tokens": 2077751.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 8.161087036132812,
|
|
"epoch": 1.2977022977022976,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 7.8622,
|
|
"mean_token_accuracy": 0.09868591278791428,
|
|
"num_tokens": 2093853.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 8.170791816711425,
|
|
"epoch": 1.3076923076923077,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 7.8347,
|
|
"mean_token_accuracy": 0.09927802458405495,
|
|
"num_tokens": 2110151.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 8.192026901245118,
|
|
"epoch": 1.3176823176823178,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 7.7538,
|
|
"mean_token_accuracy": 0.09446207582950591,
|
|
"num_tokens": 2125584.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 8.104029846191406,
|
|
"epoch": 1.3276723276723277,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 7.7273,
|
|
"mean_token_accuracy": 0.10806782469153405,
|
|
"num_tokens": 2142247.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 8.061339807510375,
|
|
"epoch": 1.3376623376623376,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 7.6168,
|
|
"mean_token_accuracy": 0.10972020626068116,
|
|
"num_tokens": 2159116.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 8.102464294433593,
|
|
"epoch": 1.3476523476523476,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000337,
|
|
"loss": 7.7746,
|
|
"mean_token_accuracy": 0.09734337553381919,
|
|
"num_tokens": 2175237.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 8.079360914230346,
|
|
"epoch": 1.3576423576423577,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 7.7702,
|
|
"mean_token_accuracy": 0.10102465003728867,
|
|
"num_tokens": 2191108.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 8.009714221954345,
|
|
"epoch": 1.3676323676323676,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000342,
|
|
"loss": 7.6556,
|
|
"mean_token_accuracy": 0.10901543200016021,
|
|
"num_tokens": 2207404.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 8.017986679077149,
|
|
"epoch": 1.3776223776223775,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 7.7225,
|
|
"mean_token_accuracy": 0.11000798493623734,
|
|
"num_tokens": 2223891.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 8.004034423828125,
|
|
"epoch": 1.3876123876123876,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000347,
|
|
"loss": 7.688,
|
|
"mean_token_accuracy": 0.10737730488181114,
|
|
"num_tokens": 2239750.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 8.089302206039429,
|
|
"epoch": 1.3976023976023977,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 7.7918,
|
|
"mean_token_accuracy": 0.09848668947815895,
|
|
"num_tokens": 2254475.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 8.038819551467896,
|
|
"epoch": 1.4075924075924076,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000352,
|
|
"loss": 7.7412,
|
|
"mean_token_accuracy": 0.10036000534892082,
|
|
"num_tokens": 2270403.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 8.05772099494934,
|
|
"epoch": 1.4175824175824177,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 7.7231,
|
|
"mean_token_accuracy": 0.10787450224161148,
|
|
"num_tokens": 2287440.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 8.031018495559692,
|
|
"epoch": 1.4275724275724275,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000357,
|
|
"loss": 7.5935,
|
|
"mean_token_accuracy": 0.11669361963868141,
|
|
"num_tokens": 2303606.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 8.10855507850647,
|
|
"epoch": 1.4375624375624376,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 7.7629,
|
|
"mean_token_accuracy": 0.09718288779258728,
|
|
"num_tokens": 2320304.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 8.033062314987182,
|
|
"epoch": 1.4475524475524475,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.000362,
|
|
"loss": 7.7269,
|
|
"mean_token_accuracy": 0.10353609770536423,
|
|
"num_tokens": 2335449.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 7.98488302230835,
|
|
"epoch": 1.4575424575424576,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 7.7298,
|
|
"mean_token_accuracy": 0.1053438015282154,
|
|
"num_tokens": 2350286.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 8.084484529495239,
|
|
"epoch": 1.4675324675324675,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000367,
|
|
"loss": 7.6562,
|
|
"mean_token_accuracy": 0.10364222973585129,
|
|
"num_tokens": 2367174.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 7.979038953781128,
|
|
"epoch": 1.4775224775224776,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 7.744,
|
|
"mean_token_accuracy": 0.09835705384612084,
|
|
"num_tokens": 2383379.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 7.950644826889038,
|
|
"epoch": 1.4875124875124874,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000372,
|
|
"loss": 7.6674,
|
|
"mean_token_accuracy": 0.10948423892259598,
|
|
"num_tokens": 2400055.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 7.948536825180054,
|
|
"epoch": 1.4975024975024975,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 7.7088,
|
|
"mean_token_accuracy": 0.104210115224123,
|
|
"num_tokens": 2415445.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 8.104103422164917,
|
|
"epoch": 1.5074925074925076,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000377,
|
|
"loss": 7.6183,
|
|
"mean_token_accuracy": 0.1110638789832592,
|
|
"num_tokens": 2431633.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 7.9167121887207035,
|
|
"epoch": 1.5174825174825175,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 7.6556,
|
|
"mean_token_accuracy": 0.10475207418203354,
|
|
"num_tokens": 2448053.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 8.011196660995484,
|
|
"epoch": 1.5274725274725274,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000382,
|
|
"loss": 7.7603,
|
|
"mean_token_accuracy": 0.10242786332964897,
|
|
"num_tokens": 2464962.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 7.854190301895142,
|
|
"epoch": 1.5374625374625375,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 7.6527,
|
|
"mean_token_accuracy": 0.10968720018863679,
|
|
"num_tokens": 2481728.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 7.93970217704773,
|
|
"epoch": 1.5474525474525476,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 7.6644,
|
|
"mean_token_accuracy": 0.10697980225086212,
|
|
"num_tokens": 2498249.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 7.971722221374511,
|
|
"epoch": 1.5574425574425574,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 7.6869,
|
|
"mean_token_accuracy": 0.10662917494773864,
|
|
"num_tokens": 2512832.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 8.0352463722229,
|
|
"epoch": 1.5674325674325673,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 7.8105,
|
|
"mean_token_accuracy": 0.09663845226168633,
|
|
"num_tokens": 2530065.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 7.965973043441773,
|
|
"epoch": 1.5774225774225774,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 7.6293,
|
|
"mean_token_accuracy": 0.1142218291759491,
|
|
"num_tokens": 2546812.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 7.914030504226685,
|
|
"epoch": 1.5874125874125875,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 7.5985,
|
|
"mean_token_accuracy": 0.10844378024339676,
|
|
"num_tokens": 2562955.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 7.9991395473480225,
|
|
"epoch": 1.5974025974025974,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 7.636,
|
|
"mean_token_accuracy": 0.10216034278273582,
|
|
"num_tokens": 2577644.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 7.804229784011841,
|
|
"epoch": 1.6073926073926073,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000402,
|
|
"loss": 7.479,
|
|
"mean_token_accuracy": 0.11868006139993667,
|
|
"num_tokens": 2592888.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 7.826851224899292,
|
|
"epoch": 1.6173826173826173,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 7.5642,
|
|
"mean_token_accuracy": 0.10893830135464669,
|
|
"num_tokens": 2610352.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 7.878586292266846,
|
|
"epoch": 1.6273726273726274,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 7.5595,
|
|
"mean_token_accuracy": 0.10943539440631866,
|
|
"num_tokens": 2626850.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 7.843348503112793,
|
|
"epoch": 1.6373626373626373,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 7.6166,
|
|
"mean_token_accuracy": 0.10784812793135642,
|
|
"num_tokens": 2642483.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 7.896633672714233,
|
|
"epoch": 1.6473526473526472,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 0.000412,
|
|
"loss": 7.6682,
|
|
"mean_token_accuracy": 0.10058582201600075,
|
|
"num_tokens": 2658801.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 7.992334079742432,
|
|
"epoch": 1.6573426573426573,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 7.6181,
|
|
"mean_token_accuracy": 0.10562084466218949,
|
|
"num_tokens": 2674320.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 7.871245288848877,
|
|
"epoch": 1.6673326673326674,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000417,
|
|
"loss": 7.5569,
|
|
"mean_token_accuracy": 0.1130405493080616,
|
|
"num_tokens": 2691468.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 7.854435968399048,
|
|
"epoch": 1.6773226773226773,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 7.6132,
|
|
"mean_token_accuracy": 0.10280844122171402,
|
|
"num_tokens": 2707795.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 7.798345613479614,
|
|
"epoch": 1.6873126873126874,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.000422,
|
|
"loss": 7.4358,
|
|
"mean_token_accuracy": 0.12156035900115966,
|
|
"num_tokens": 2725406.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 7.71482892036438,
|
|
"epoch": 1.6973026973026974,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 7.487,
|
|
"mean_token_accuracy": 0.11422280594706535,
|
|
"num_tokens": 2741080.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 8.022317790985108,
|
|
"epoch": 1.7072927072927073,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 7.6872,
|
|
"mean_token_accuracy": 0.10234800577163697,
|
|
"num_tokens": 2758052.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 7.710728740692138,
|
|
"epoch": 1.7172827172827172,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 7.5718,
|
|
"mean_token_accuracy": 0.10922266095876694,
|
|
"num_tokens": 2775414.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 7.858629941940308,
|
|
"epoch": 1.7272727272727273,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.000432,
|
|
"loss": 7.6087,
|
|
"mean_token_accuracy": 0.10396021082997323,
|
|
"num_tokens": 2792333.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 7.944055700302124,
|
|
"epoch": 1.7372627372627374,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 7.7243,
|
|
"mean_token_accuracy": 0.10027192905545235,
|
|
"num_tokens": 2807792.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 7.910960578918457,
|
|
"epoch": 1.7472527472527473,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000437,
|
|
"loss": 7.6288,
|
|
"mean_token_accuracy": 0.10449600145220757,
|
|
"num_tokens": 2823819.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 7.87107138633728,
|
|
"epoch": 1.7572427572427571,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 7.6212,
|
|
"mean_token_accuracy": 0.10314707756042481,
|
|
"num_tokens": 2840026.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 7.746200895309448,
|
|
"epoch": 1.7672327672327672,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.000442,
|
|
"loss": 7.4546,
|
|
"mean_token_accuracy": 0.11674722135066987,
|
|
"num_tokens": 2857041.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 7.842999696731567,
|
|
"epoch": 1.7772227772227773,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 7.5113,
|
|
"mean_token_accuracy": 0.11269463673233986,
|
|
"num_tokens": 2871815.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 7.798826599121094,
|
|
"epoch": 1.7872127872127872,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000447,
|
|
"loss": 7.5082,
|
|
"mean_token_accuracy": 0.1110450305044651,
|
|
"num_tokens": 2888902.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 7.773666000366211,
|
|
"epoch": 1.797202797202797,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 7.5503,
|
|
"mean_token_accuracy": 0.10609947964549064,
|
|
"num_tokens": 2905536.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 7.787226724624634,
|
|
"epoch": 1.8071928071928072,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 7.5587,
|
|
"mean_token_accuracy": 0.11197240501642228,
|
|
"num_tokens": 2922542.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 7.839496898651123,
|
|
"epoch": 1.8171828171828173,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 7.5326,
|
|
"mean_token_accuracy": 0.11128943562507629,
|
|
"num_tokens": 2937418.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 7.7856128215789795,
|
|
"epoch": 1.8271728271728271,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 7.5355,
|
|
"mean_token_accuracy": 0.10546828433871269,
|
|
"num_tokens": 2953989.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 7.75637378692627,
|
|
"epoch": 1.837162837162837,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 7.5363,
|
|
"mean_token_accuracy": 0.10771389603614807,
|
|
"num_tokens": 2970438.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 7.8310833930969235,
|
|
"epoch": 1.847152847152847,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000462,
|
|
"loss": 7.5979,
|
|
"mean_token_accuracy": 0.10760430172085762,
|
|
"num_tokens": 2986349.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 7.7756389617919925,
|
|
"epoch": 1.8571428571428572,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 7.5186,
|
|
"mean_token_accuracy": 0.10492026805877686,
|
|
"num_tokens": 3002199.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 7.850647354125977,
|
|
"epoch": 1.867132867132867,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.000467,
|
|
"loss": 7.574,
|
|
"mean_token_accuracy": 0.10573839843273163,
|
|
"num_tokens": 3019724.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 7.758398199081421,
|
|
"epoch": 1.8771228771228772,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 7.4861,
|
|
"mean_token_accuracy": 0.11178312376141548,
|
|
"num_tokens": 3036033.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 7.733203649520874,
|
|
"epoch": 1.8871128871128873,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.000472,
|
|
"loss": 7.5057,
|
|
"mean_token_accuracy": 0.10797822251915931,
|
|
"num_tokens": 3050535.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 7.606766033172607,
|
|
"epoch": 1.8971028971028971,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 7.4241,
|
|
"mean_token_accuracy": 0.11418468505144119,
|
|
"num_tokens": 3067487.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 7.811316347122192,
|
|
"epoch": 1.907092907092907,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.000477,
|
|
"loss": 7.4817,
|
|
"mean_token_accuracy": 0.11279602721333504,
|
|
"num_tokens": 3083368.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 7.764263772964478,
|
|
"epoch": 1.9170829170829171,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 7.5884,
|
|
"mean_token_accuracy": 0.0996214747428894,
|
|
"num_tokens": 3100158.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 7.664905261993408,
|
|
"epoch": 1.9270729270729272,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.000482,
|
|
"loss": 7.3969,
|
|
"mean_token_accuracy": 0.11512965932488442,
|
|
"num_tokens": 3115996.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 7.791405916213989,
|
|
"epoch": 1.937062937062937,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 7.5496,
|
|
"mean_token_accuracy": 0.10718825981020927,
|
|
"num_tokens": 3133485.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 7.791155099868774,
|
|
"epoch": 1.947052947052947,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000487,
|
|
"loss": 7.5339,
|
|
"mean_token_accuracy": 0.10318816006183625,
|
|
"num_tokens": 3149142.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 7.657593297958374,
|
|
"epoch": 1.957042957042957,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 7.4259,
|
|
"mean_token_accuracy": 0.10956193283200263,
|
|
"num_tokens": 3166372.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 7.687391233444214,
|
|
"epoch": 1.9670329670329672,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.000492,
|
|
"loss": 7.468,
|
|
"mean_token_accuracy": 0.10778944343328475,
|
|
"num_tokens": 3183178.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 7.7009885787963865,
|
|
"epoch": 1.977022977022977,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 7.4464,
|
|
"mean_token_accuracy": 0.10527636632323265,
|
|
"num_tokens": 3198857.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 7.761457204818726,
|
|
"epoch": 1.987012987012987,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000497,
|
|
"loss": 7.5091,
|
|
"mean_token_accuracy": 0.10296362712979316,
|
|
"num_tokens": 3214704.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 7.7881145000457765,
|
|
"epoch": 1.997002997002997,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 7.5984,
|
|
"mean_token_accuracy": 0.10085872560739517,
|
|
"num_tokens": 3230647.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 1.997002997002997,
|
|
"eval_entropy": 7.486649680782008,
|
|
"eval_loss": 7.484090328216553,
|
|
"eval_mean_token_accuracy": 0.10077464044899553,
|
|
"eval_num_tokens": 3230647.0,
|
|
"eval_runtime": 1.1798,
|
|
"eval_samples_per_second": 1249.323,
|
|
"eval_steps_per_second": 156.801,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 7.6556399133470325,
|
|
"epoch": 2.005994005994006,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999988896704182,
|
|
"loss": 7.29,
|
|
"mean_token_accuracy": 0.11673381593492296,
|
|
"num_tokens": 3244611.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 7.653675556182861,
|
|
"epoch": 2.015984015984016,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.000499994378975273,
|
|
"loss": 7.2449,
|
|
"mean_token_accuracy": 0.11277795657515526,
|
|
"num_tokens": 3261376.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 7.695202302932739,
|
|
"epoch": 2.0259740259740258,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004999863985884728,
|
|
"loss": 7.2594,
|
|
"mean_token_accuracy": 0.11385115906596184,
|
|
"num_tokens": 3279410.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 7.74162712097168,
|
|
"epoch": 2.035964035964036,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000499974948633085,
|
|
"loss": 7.2755,
|
|
"mean_token_accuracy": 0.10692020803689957,
|
|
"num_tokens": 3296012.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 7.66200361251831,
|
|
"epoch": 2.045954045954046,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000499960029285682,
|
|
"loss": 7.3217,
|
|
"mean_token_accuracy": 0.10635951608419418,
|
|
"num_tokens": 3311851.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 7.610789680480957,
|
|
"epoch": 2.055944055944056,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004999416407763387,
|
|
"loss": 7.2673,
|
|
"mean_token_accuracy": 0.1137266606092453,
|
|
"num_tokens": 3328590.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 7.579310369491577,
|
|
"epoch": 2.065934065934066,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004999197833886285,
|
|
"loss": 7.141,
|
|
"mean_token_accuracy": 0.11897332966327667,
|
|
"num_tokens": 3345266.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 7.628687334060669,
|
|
"epoch": 2.075924075924076,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004998944574596196,
|
|
"loss": 7.2871,
|
|
"mean_token_accuracy": 0.11039503365755081,
|
|
"num_tokens": 3361141.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 7.602729368209839,
|
|
"epoch": 2.085914085914086,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004998656633798689,
|
|
"loss": 7.1797,
|
|
"mean_token_accuracy": 0.11323749721050262,
|
|
"num_tokens": 3377710.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 7.550437688827515,
|
|
"epoch": 2.0959040959040958,
|
|
"grad_norm": 0.9140625,
|
|
"learning_rate": 0.0004998334015934169,
|
|
"loss": 7.285,
|
|
"mean_token_accuracy": 0.11525188460946083,
|
|
"num_tokens": 3392504.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 7.673173427581787,
|
|
"epoch": 2.105894105894106,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004997976725977802,
|
|
"loss": 7.3127,
|
|
"mean_token_accuracy": 0.10556894540786743,
|
|
"num_tokens": 3409907.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 7.63333158493042,
|
|
"epoch": 2.115884115884116,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000499758476943944,
|
|
"loss": 7.225,
|
|
"mean_token_accuracy": 0.11469244211912155,
|
|
"num_tokens": 3426681.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 7.532991075515747,
|
|
"epoch": 2.125874125874126,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.000499715815236354,
|
|
"loss": 7.2308,
|
|
"mean_token_accuracy": 0.11743310615420341,
|
|
"num_tokens": 3441537.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 7.663446712493896,
|
|
"epoch": 2.1358641358641357,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004996696881329063,
|
|
"loss": 7.2799,
|
|
"mean_token_accuracy": 0.10578939393162727,
|
|
"num_tokens": 3458262.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 7.667473649978637,
|
|
"epoch": 2.145854145854146,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.000499620096344938,
|
|
"loss": 7.3362,
|
|
"mean_token_accuracy": 0.10832573622465133,
|
|
"num_tokens": 3473982.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 7.614191579818725,
|
|
"epoch": 2.155844155844156,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004995670406372157,
|
|
"loss": 7.2587,
|
|
"mean_token_accuracy": 0.11001512333750725,
|
|
"num_tokens": 3489555.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 7.515730094909668,
|
|
"epoch": 2.1658341658341658,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004995105218279244,
|
|
"loss": 7.2139,
|
|
"mean_token_accuracy": 0.11276560798287391,
|
|
"num_tokens": 3506482.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 7.633500576019287,
|
|
"epoch": 2.1758241758241756,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004994505407886536,
|
|
"loss": 7.2319,
|
|
"mean_token_accuracy": 0.11254712715744972,
|
|
"num_tokens": 3521621.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 7.513222789764404,
|
|
"epoch": 2.185814185814186,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004993870984443854,
|
|
"loss": 7.1932,
|
|
"mean_token_accuracy": 0.11704366132616997,
|
|
"num_tokens": 3537485.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 7.469144868850708,
|
|
"epoch": 2.195804195804196,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004993201957734791,
|
|
"loss": 7.0765,
|
|
"mean_token_accuracy": 0.13212940245866775,
|
|
"num_tokens": 3553655.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 7.512252330780029,
|
|
"epoch": 2.2057942057942057,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004992498338076567,
|
|
"loss": 7.1613,
|
|
"mean_token_accuracy": 0.11379173919558525,
|
|
"num_tokens": 3568923.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 7.605458927154541,
|
|
"epoch": 2.2157842157842156,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004991760136319869,
|
|
"loss": 7.2288,
|
|
"mean_token_accuracy": 0.11029125973582268,
|
|
"num_tokens": 3585133.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 7.509175157546997,
|
|
"epoch": 2.225774225774226,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004990987363848678,
|
|
"loss": 7.279,
|
|
"mean_token_accuracy": 0.10764828473329544,
|
|
"num_tokens": 3600494.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 7.560824632644653,
|
|
"epoch": 2.2357642357642358,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004990180032580105,
|
|
"loss": 7.2435,
|
|
"mean_token_accuracy": 0.11270277500152588,
|
|
"num_tokens": 3615255.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 7.499869775772095,
|
|
"epoch": 2.2457542457542456,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 0.0004989338154964194,
|
|
"loss": 7.2064,
|
|
"mean_token_accuracy": 0.11745749786496162,
|
|
"num_tokens": 3632558.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 7.446692943572998,
|
|
"epoch": 2.255744255744256,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000498846174398374,
|
|
"loss": 7.1456,
|
|
"mean_token_accuracy": 0.11962621659040451,
|
|
"num_tokens": 3649348.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 7.542574071884156,
|
|
"epoch": 2.265734265734266,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.0004987550813154086,
|
|
"loss": 7.2743,
|
|
"mean_token_accuracy": 0.1114236980676651,
|
|
"num_tokens": 3665180.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 7.534678602218628,
|
|
"epoch": 2.2757242757242757,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004986605376522912,
|
|
"loss": 7.2108,
|
|
"mean_token_accuracy": 0.11057249754667282,
|
|
"num_tokens": 3682680.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 7.5682820796966555,
|
|
"epoch": 2.2857142857142856,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004985625448670019,
|
|
"loss": 7.3165,
|
|
"mean_token_accuracy": 0.104947979003191,
|
|
"num_tokens": 3698807.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 7.427041101455688,
|
|
"epoch": 2.2957042957042955,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004984611044707108,
|
|
"loss": 7.1514,
|
|
"mean_token_accuracy": 0.12294234782457351,
|
|
"num_tokens": 3714408.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 7.46859130859375,
|
|
"epoch": 2.305694305694306,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004983562180277541,
|
|
"loss": 7.2044,
|
|
"mean_token_accuracy": 0.11968692690134049,
|
|
"num_tokens": 3729290.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 7.515849208831787,
|
|
"epoch": 2.3156843156843157,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004982478871556107,
|
|
"loss": 7.201,
|
|
"mean_token_accuracy": 0.12022968605160714,
|
|
"num_tokens": 3746501.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 7.499651145935059,
|
|
"epoch": 2.3256743256743255,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004981361135248767,
|
|
"loss": 7.2576,
|
|
"mean_token_accuracy": 0.11078106462955475,
|
|
"num_tokens": 3762194.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 7.601353788375855,
|
|
"epoch": 2.335664335664336,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.0004980208988592395,
|
|
"loss": 7.2088,
|
|
"mean_token_accuracy": 0.11249012053012848,
|
|
"num_tokens": 3779048.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 7.40687837600708,
|
|
"epoch": 2.3456543456543457,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.000497902244935452,
|
|
"loss": 7.1122,
|
|
"mean_token_accuracy": 0.12347386628389359,
|
|
"num_tokens": 3797865.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 7.581765508651733,
|
|
"epoch": 2.3556443556443556,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004977801535833045,
|
|
"loss": 7.1779,
|
|
"mean_token_accuracy": 0.11289282962679863,
|
|
"num_tokens": 3813050.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 7.5143575191497805,
|
|
"epoch": 2.3656343656343655,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004976546266855965,
|
|
"loss": 7.211,
|
|
"mean_token_accuracy": 0.11399794220924378,
|
|
"num_tokens": 3830277.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 7.516488695144654,
|
|
"epoch": 2.375624375624376,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004975256661781082,
|
|
"loss": 7.3304,
|
|
"mean_token_accuracy": 0.10547359213232994,
|
|
"num_tokens": 3847221.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 7.528147983551025,
|
|
"epoch": 2.3856143856143857,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 0.0004973932740495701,
|
|
"loss": 7.2484,
|
|
"mean_token_accuracy": 0.10972600281238556,
|
|
"num_tokens": 3864601.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 7.4062048435211185,
|
|
"epoch": 2.3956043956043955,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004972574523416325,
|
|
"loss": 7.1501,
|
|
"mean_token_accuracy": 0.11819778755307198,
|
|
"num_tokens": 3881592.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 7.444576835632324,
|
|
"epoch": 2.4055944055944054,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 0.0004971182031488343,
|
|
"loss": 6.993,
|
|
"mean_token_accuracy": 0.1232140153646469,
|
|
"num_tokens": 3897334.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 7.580482769012451,
|
|
"epoch": 2.4155844155844157,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004969755286185703,
|
|
"loss": 7.3508,
|
|
"mean_token_accuracy": 0.10700739026069642,
|
|
"num_tokens": 3913001.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 7.3618980884552006,
|
|
"epoch": 2.4255744255744256,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004968294309510582,
|
|
"loss": 7.0278,
|
|
"mean_token_accuracy": 0.12532524466514589,
|
|
"num_tokens": 3928884.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 7.436668968200683,
|
|
"epoch": 2.4355644355644355,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0004966799123993049,
|
|
"loss": 7.1698,
|
|
"mean_token_accuracy": 0.11884979307651519,
|
|
"num_tokens": 3944998.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 7.505033302307129,
|
|
"epoch": 2.4455544455544453,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004965269752690713,
|
|
"loss": 7.2213,
|
|
"mean_token_accuracy": 0.11796300038695336,
|
|
"num_tokens": 3960650.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 7.496581268310547,
|
|
"epoch": 2.4555444555444557,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004963706219188371,
|
|
"loss": 7.2368,
|
|
"mean_token_accuracy": 0.11497806310653687,
|
|
"num_tokens": 3976718.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 7.4178626537323,
|
|
"epoch": 2.4655344655344655,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004962108547597643,
|
|
"loss": 7.2299,
|
|
"mean_token_accuracy": 0.11304686814546586,
|
|
"num_tokens": 3991637.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 7.496812868118286,
|
|
"epoch": 2.4755244755244754,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004960476762556604,
|
|
"loss": 7.1167,
|
|
"mean_token_accuracy": 0.11393559798598289,
|
|
"num_tokens": 4007493.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 7.37399730682373,
|
|
"epoch": 2.4855144855144857,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.0004958810889229397,
|
|
"loss": 7.1558,
|
|
"mean_token_accuracy": 0.11833534240722657,
|
|
"num_tokens": 4022983.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 7.5273942947387695,
|
|
"epoch": 2.4955044955044956,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004957110953305849,
|
|
"loss": 7.2263,
|
|
"mean_token_accuracy": 0.11028133109211921,
|
|
"num_tokens": 4038559.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 7.440155124664306,
|
|
"epoch": 2.5054945054945055,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004955376981001076,
|
|
"loss": 7.1248,
|
|
"mean_token_accuracy": 0.1180120624601841,
|
|
"num_tokens": 4054340.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 7.443907403945923,
|
|
"epoch": 2.5154845154845153,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0004953608999055073,
|
|
"loss": 7.2768,
|
|
"mean_token_accuracy": 0.12213831841945648,
|
|
"num_tokens": 4070874.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 7.441350984573364,
|
|
"epoch": 2.5254745254745252,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004951807034732313,
|
|
"loss": 7.1956,
|
|
"mean_token_accuracy": 0.11365060582756996,
|
|
"num_tokens": 4087260.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 7.531669092178345,
|
|
"epoch": 2.5354645354645355,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004949971115821311,
|
|
"loss": 7.1972,
|
|
"mean_token_accuracy": 0.11016765534877777,
|
|
"num_tokens": 4103304.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 7.416958332061768,
|
|
"epoch": 2.5454545454545454,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000494810127063421,
|
|
"loss": 7.1911,
|
|
"mean_token_accuracy": 0.11271554231643677,
|
|
"num_tokens": 4118386.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 7.376313781738281,
|
|
"epoch": 2.5554445554445553,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004946197528006335,
|
|
"loss": 7.1907,
|
|
"mean_token_accuracy": 0.11462600603699684,
|
|
"num_tokens": 4136240.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 7.443999099731445,
|
|
"epoch": 2.5654345654345656,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004944259917295752,
|
|
"loss": 7.0267,
|
|
"mean_token_accuracy": 0.12695256918668746,
|
|
"num_tokens": 4152756.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 7.382719278335571,
|
|
"epoch": 2.5754245754245755,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004942288468382818,
|
|
"loss": 7.2156,
|
|
"mean_token_accuracy": 0.11339443400502205,
|
|
"num_tokens": 4169482.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 7.495740270614624,
|
|
"epoch": 2.5854145854145854,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.000494028321166971,
|
|
"loss": 7.1848,
|
|
"mean_token_accuracy": 0.11903136670589447,
|
|
"num_tokens": 4184571.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 7.405131435394287,
|
|
"epoch": 2.5954045954045952,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.000493824417807997,
|
|
"loss": 7.088,
|
|
"mean_token_accuracy": 0.11924583464860916,
|
|
"num_tokens": 4199725.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 7.374294948577881,
|
|
"epoch": 2.6053946053946055,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0004936171399058017,
|
|
"loss": 7.1561,
|
|
"mean_token_accuracy": 0.11412992551922799,
|
|
"num_tokens": 4216309.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 7.4032941341400145,
|
|
"epoch": 2.6153846153846154,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004934064906568668,
|
|
"loss": 7.1233,
|
|
"mean_token_accuracy": 0.11502180323004722,
|
|
"num_tokens": 4230699.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 7.350087738037109,
|
|
"epoch": 2.6253746253746253,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004931924733096642,
|
|
"loss": 7.0452,
|
|
"mean_token_accuracy": 0.12624117210507393,
|
|
"num_tokens": 4248243.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 7.364322996139526,
|
|
"epoch": 2.6353646353646356,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004929750911646063,
|
|
"loss": 7.2285,
|
|
"mean_token_accuracy": 0.11374544575810433,
|
|
"num_tokens": 4265412.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 7.47800087928772,
|
|
"epoch": 2.6453546453546455,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004927543475739947,
|
|
"loss": 7.1683,
|
|
"mean_token_accuracy": 0.10902340710163116,
|
|
"num_tokens": 4281230.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 7.408435869216919,
|
|
"epoch": 2.6553446553446554,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004925302459419686,
|
|
"loss": 7.2304,
|
|
"mean_token_accuracy": 0.11668918058276176,
|
|
"num_tokens": 4297593.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 7.357152318954467,
|
|
"epoch": 2.6653346653346652,
|
|
"grad_norm": 0.6875,
|
|
"learning_rate": 0.0004923027897244524,
|
|
"loss": 7.1477,
|
|
"mean_token_accuracy": 0.11671698242425918,
|
|
"num_tokens": 4314370.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 7.425278186798096,
|
|
"epoch": 2.675324675324675,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004920719824291022,
|
|
"loss": 7.1329,
|
|
"mean_token_accuracy": 0.12105752229690551,
|
|
"num_tokens": 4329867.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 7.410067939758301,
|
|
"epoch": 2.6853146853146854,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.0004918378276152522,
|
|
"loss": 7.1883,
|
|
"mean_token_accuracy": 0.11553000509738923,
|
|
"num_tokens": 4346849.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 7.3710705757141115,
|
|
"epoch": 2.6953046953046953,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004916003288938592,
|
|
"loss": 7.1308,
|
|
"mean_token_accuracy": 0.12287419214844704,
|
|
"num_tokens": 4362591.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 7.361244201660156,
|
|
"epoch": 2.705294705294705,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004913594899274474,
|
|
"loss": 7.0903,
|
|
"mean_token_accuracy": 0.12431644871830941,
|
|
"num_tokens": 4378703.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 7.40083589553833,
|
|
"epoch": 2.7152847152847155,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004911153144300515,
|
|
"loss": 7.2019,
|
|
"mean_token_accuracy": 0.11094269454479218,
|
|
"num_tokens": 4394967.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 7.332432651519776,
|
|
"epoch": 2.7252747252747254,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004908678061671597,
|
|
"loss": 7.0549,
|
|
"mean_token_accuracy": 0.12529401928186418,
|
|
"num_tokens": 4411373.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 7.3352560043334964,
|
|
"epoch": 2.7352647352647352,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004906169689556557,
|
|
"loss": 6.9679,
|
|
"mean_token_accuracy": 0.129734043776989,
|
|
"num_tokens": 4427681.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 7.2624828815460205,
|
|
"epoch": 2.745254745254745,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004903628066637594,
|
|
"loss": 7.077,
|
|
"mean_token_accuracy": 0.12157689854502678,
|
|
"num_tokens": 4443423.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 7.387901639938354,
|
|
"epoch": 2.755244755244755,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004901053232109679,
|
|
"loss": 7.1599,
|
|
"mean_token_accuracy": 0.10635504648089408,
|
|
"num_tokens": 4460698.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 7.348285722732544,
|
|
"epoch": 2.7652347652347653,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004898445225679948,
|
|
"loss": 7.0845,
|
|
"mean_token_accuracy": 0.11898298934102058,
|
|
"num_tokens": 4475307.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 7.374725580215454,
|
|
"epoch": 2.775224775224775,
|
|
"grad_norm": 0.75,
|
|
"learning_rate": 0.000489580408756708,
|
|
"loss": 7.1782,
|
|
"mean_token_accuracy": 0.11079153269529343,
|
|
"num_tokens": 4492766.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 7.394331741333008,
|
|
"epoch": 2.785214785214785,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0004893129858500699,
|
|
"loss": 7.1781,
|
|
"mean_token_accuracy": 0.11092816591262818,
|
|
"num_tokens": 4508446.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 7.364388179779053,
|
|
"epoch": 2.7952047952047954,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0004890422579720722,
|
|
"loss": 7.1235,
|
|
"mean_token_accuracy": 0.11798743531107903,
|
|
"num_tokens": 4525208.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 7.394073629379273,
|
|
"epoch": 2.8051948051948052,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004887682292976736,
|
|
"loss": 7.0839,
|
|
"mean_token_accuracy": 0.12236481755971909,
|
|
"num_tokens": 4541638.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 7.301909923553467,
|
|
"epoch": 2.815184815184815,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 0.0004884909040527355,
|
|
"loss": 7.1186,
|
|
"mean_token_accuracy": 0.11743888035416603,
|
|
"num_tokens": 4557541.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 7.287791633605957,
|
|
"epoch": 2.825174825174825,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.000488210286513956,
|
|
"loss": 6.9349,
|
|
"mean_token_accuracy": 0.12849488556385041,
|
|
"num_tokens": 4573658.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 7.36132926940918,
|
|
"epoch": 2.8351648351648353,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00048792638100880487,
|
|
"loss": 7.0927,
|
|
"mean_token_accuracy": 0.12357950136065483,
|
|
"num_tokens": 4587683.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 7.418003797531128,
|
|
"epoch": 2.845154845154845,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00048763919191545607,
|
|
"loss": 7.1074,
|
|
"mean_token_accuracy": 0.12282117158174514,
|
|
"num_tokens": 4603983.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 7.308845472335816,
|
|
"epoch": 2.855144855144855,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0004873487236627208,
|
|
"loss": 7.1999,
|
|
"mean_token_accuracy": 0.1132714070379734,
|
|
"num_tokens": 4620925.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 7.363225841522217,
|
|
"epoch": 2.8651348651348654,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004870549807299788,
|
|
"loss": 7.0209,
|
|
"mean_token_accuracy": 0.11996846571564675,
|
|
"num_tokens": 4639214.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 7.384830951690674,
|
|
"epoch": 2.8751248751248752,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.00048675796764710946,
|
|
"loss": 7.2084,
|
|
"mean_token_accuracy": 0.11239797696471214,
|
|
"num_tokens": 4655289.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 7.336945819854736,
|
|
"epoch": 2.885114885114885,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00048645768899442194,
|
|
"loss": 7.1117,
|
|
"mean_token_accuracy": 0.10905599966645241,
|
|
"num_tokens": 4669773.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 7.397378444671631,
|
|
"epoch": 2.895104895104895,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 0.0004861541494025845,
|
|
"loss": 7.0236,
|
|
"mean_token_accuracy": 0.12204516381025314,
|
|
"num_tokens": 4685548.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 7.3122090816497805,
|
|
"epoch": 2.905094905094905,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00048584735355255325,
|
|
"loss": 7.1617,
|
|
"mean_token_accuracy": 0.10954023897647858,
|
|
"num_tokens": 4701784.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 7.368370532989502,
|
|
"epoch": 2.915084915084915,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00048553730617549964,
|
|
"loss": 7.1356,
|
|
"mean_token_accuracy": 0.11558711975812912,
|
|
"num_tokens": 4717140.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 7.350918292999268,
|
|
"epoch": 2.925074925074925,
|
|
"grad_norm": 0.89453125,
|
|
"learning_rate": 0.00048522401205273774,
|
|
"loss": 7.1422,
|
|
"mean_token_accuracy": 0.11404822468757629,
|
|
"num_tokens": 4732369.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 7.320491886138916,
|
|
"epoch": 2.935064935064935,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00048490747601565053,
|
|
"loss": 7.0975,
|
|
"mean_token_accuracy": 0.11320897936820984,
|
|
"num_tokens": 4749723.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 7.263767099380493,
|
|
"epoch": 2.9450549450549453,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.00048458770294561526,
|
|
"loss": 7.0367,
|
|
"mean_token_accuracy": 0.1221166156232357,
|
|
"num_tokens": 4765553.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 7.377514219284057,
|
|
"epoch": 2.955044955044955,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0004842646977739283,
|
|
"loss": 7.0588,
|
|
"mean_token_accuracy": 0.12238560244441032,
|
|
"num_tokens": 4781903.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 7.329219675064087,
|
|
"epoch": 2.965034965034965,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00048393846548172895,
|
|
"loss": 7.0711,
|
|
"mean_token_accuracy": 0.12050119936466216,
|
|
"num_tokens": 4798075.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 7.306816673278808,
|
|
"epoch": 2.975024975024975,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004836090110999226,
|
|
"loss": 7.0557,
|
|
"mean_token_accuracy": 0.1145715981721878,
|
|
"num_tokens": 4813257.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 7.298364782333374,
|
|
"epoch": 2.9850149850149847,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.0004832763397091036,
|
|
"loss": 7.054,
|
|
"mean_token_accuracy": 0.11942759305238723,
|
|
"num_tokens": 4829007.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 7.404904127120972,
|
|
"epoch": 2.995004995004995,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004829404564394762,
|
|
"loss": 7.1255,
|
|
"mean_token_accuracy": 0.1147141508758068,
|
|
"num_tokens": 4845449.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 2.995004995004995,
|
|
"eval_entropy": 7.222840590090365,
|
|
"eval_loss": 7.199999809265137,
|
|
"eval_mean_token_accuracy": 0.1078420261676247,
|
|
"eval_num_tokens": 4845449.0,
|
|
"eval_runtime": 1.1727,
|
|
"eval_samples_per_second": 1256.93,
|
|
"eval_steps_per_second": 157.756,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 7.309990617964003,
|
|
"epoch": 3.003996003996004,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00048260136647077585,
|
|
"loss": 6.9455,
|
|
"mean_token_accuracy": 0.11805139068100187,
|
|
"num_tokens": 4858156.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 7.340683937072754,
|
|
"epoch": 3.013986013986014,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00048225907503218946,
|
|
"loss": 6.8138,
|
|
"mean_token_accuracy": 0.12144542708992959,
|
|
"num_tokens": 4873172.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 7.257332801818848,
|
|
"epoch": 3.023976023976024,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00048191358740227444,
|
|
"loss": 6.7052,
|
|
"mean_token_accuracy": 0.1332525998353958,
|
|
"num_tokens": 4890921.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 7.281058216094971,
|
|
"epoch": 3.033966033966034,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 0.0004815649089088774,
|
|
"loss": 6.7754,
|
|
"mean_token_accuracy": 0.12657968327403069,
|
|
"num_tokens": 4905468.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 7.217862558364868,
|
|
"epoch": 3.043956043956044,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.00048121304492905204,
|
|
"loss": 6.7605,
|
|
"mean_token_accuracy": 0.12102149054408073,
|
|
"num_tokens": 4922178.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 7.316258478164673,
|
|
"epoch": 3.053946053946054,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.0004808580008889762,
|
|
"loss": 6.7796,
|
|
"mean_token_accuracy": 0.12334605678915977,
|
|
"num_tokens": 4937049.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 7.201441478729248,
|
|
"epoch": 3.063936063936064,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 0.0004804997822638683,
|
|
"loss": 6.773,
|
|
"mean_token_accuracy": 0.12532677873969078,
|
|
"num_tokens": 4952697.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 7.281438684463501,
|
|
"epoch": 3.073926073926074,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00048013839457790243,
|
|
"loss": 6.7791,
|
|
"mean_token_accuracy": 0.11991386488080025,
|
|
"num_tokens": 4968075.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 7.282547283172607,
|
|
"epoch": 3.0839160839160837,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00047977384340412406,
|
|
"loss": 6.6729,
|
|
"mean_token_accuracy": 0.12937781289219857,
|
|
"num_tokens": 4984003.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 7.2246640682220455,
|
|
"epoch": 3.093906093906094,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00047940613436436304,
|
|
"loss": 6.7624,
|
|
"mean_token_accuracy": 0.12386809512972832,
|
|
"num_tokens": 5000054.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 7.20565242767334,
|
|
"epoch": 3.103896103896104,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.00047903527312914777,
|
|
"loss": 6.6738,
|
|
"mean_token_accuracy": 0.12883116900920868,
|
|
"num_tokens": 5017097.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 7.172371339797974,
|
|
"epoch": 3.113886113886114,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004786612654176171,
|
|
"loss": 6.7014,
|
|
"mean_token_accuracy": 0.12019376754760742,
|
|
"num_tokens": 5032868.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 7.188371467590332,
|
|
"epoch": 3.1238761238761237,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00047828411699743284,
|
|
"loss": 6.7086,
|
|
"mean_token_accuracy": 0.13077392801642418,
|
|
"num_tokens": 5049897.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 7.309192419052124,
|
|
"epoch": 3.133866133866134,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.00047790383368469003,
|
|
"loss": 6.8366,
|
|
"mean_token_accuracy": 0.11674531251192093,
|
|
"num_tokens": 5065611.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 7.28448896408081,
|
|
"epoch": 3.143856143856144,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.0004775204213438279,
|
|
"loss": 6.8225,
|
|
"mean_token_accuracy": 0.12474308311939239,
|
|
"num_tokens": 5082059.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 7.264940309524536,
|
|
"epoch": 3.1538461538461537,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004771338858875389,
|
|
"loss": 6.8255,
|
|
"mean_token_accuracy": 0.11197493076324463,
|
|
"num_tokens": 5097893.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 7.158958482742309,
|
|
"epoch": 3.163836163836164,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004767442332766781,
|
|
"loss": 6.6944,
|
|
"mean_token_accuracy": 0.14125925526022912,
|
|
"num_tokens": 5116091.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 7.182612323760987,
|
|
"epoch": 3.173826173826174,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.0004763514695201706,
|
|
"loss": 6.7438,
|
|
"mean_token_accuracy": 0.1299310527741909,
|
|
"num_tokens": 5132251.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 7.098526906967163,
|
|
"epoch": 3.183816183816184,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00047595560067491955,
|
|
"loss": 6.6708,
|
|
"mean_token_accuracy": 0.13742291927337646,
|
|
"num_tokens": 5147909.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 7.198202323913574,
|
|
"epoch": 3.1938061938061937,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004755566328457122,
|
|
"loss": 6.7299,
|
|
"mean_token_accuracy": 0.12709784805774688,
|
|
"num_tokens": 5163932.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 7.182046699523926,
|
|
"epoch": 3.203796203796204,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0004751545721851261,
|
|
"loss": 6.7269,
|
|
"mean_token_accuracy": 0.12986161783337594,
|
|
"num_tokens": 5180177.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 7.191233539581299,
|
|
"epoch": 3.213786213786214,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004747494248934338,
|
|
"loss": 6.7791,
|
|
"mean_token_accuracy": 0.12523868530988694,
|
|
"num_tokens": 5195700.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 7.228579568862915,
|
|
"epoch": 3.2237762237762237,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 0.0004743411972185079,
|
|
"loss": 6.7803,
|
|
"mean_token_accuracy": 0.12069911062717438,
|
|
"num_tokens": 5211333.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 7.109642553329468,
|
|
"epoch": 3.2337662337662336,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004739298954557241,
|
|
"loss": 6.7349,
|
|
"mean_token_accuracy": 0.12927734106779099,
|
|
"num_tokens": 5227284.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 7.165005779266357,
|
|
"epoch": 3.243756243756244,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004735155259478645,
|
|
"loss": 6.7535,
|
|
"mean_token_accuracy": 0.13313452303409576,
|
|
"num_tokens": 5243421.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 7.205034351348877,
|
|
"epoch": 3.253746253746254,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004730980950850193,
|
|
"loss": 6.8124,
|
|
"mean_token_accuracy": 0.12308995798230171,
|
|
"num_tokens": 5260635.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 7.242312574386597,
|
|
"epoch": 3.2637362637362637,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.000472677609304489,
|
|
"loss": 6.8308,
|
|
"mean_token_accuracy": 0.12062100619077683,
|
|
"num_tokens": 5276940.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 7.175618886947632,
|
|
"epoch": 3.2737262737262736,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 0.00047225407509068434,
|
|
"loss": 6.8487,
|
|
"mean_token_accuracy": 0.12380371615290642,
|
|
"num_tokens": 5292901.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 7.139540910720825,
|
|
"epoch": 3.283716283716284,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004718274989750269,
|
|
"loss": 6.6743,
|
|
"mean_token_accuracy": 0.12544595673680306,
|
|
"num_tokens": 5309142.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 7.211938428878784,
|
|
"epoch": 3.2937062937062938,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0004713978875358481,
|
|
"loss": 6.8071,
|
|
"mean_token_accuracy": 0.1265795908868313,
|
|
"num_tokens": 5325647.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 7.0457368850708,
|
|
"epoch": 3.3036963036963036,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00047096524739828773,
|
|
"loss": 6.6749,
|
|
"mean_token_accuracy": 0.13383058980107307,
|
|
"num_tokens": 5343508.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 7.2579505443573,
|
|
"epoch": 3.3136863136863135,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004705295852341919,
|
|
"loss": 6.8725,
|
|
"mean_token_accuracy": 0.11918435022234916,
|
|
"num_tokens": 5360304.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 7.1316554069519045,
|
|
"epoch": 3.323676323676324,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00047009090776201025,
|
|
"loss": 6.7665,
|
|
"mean_token_accuracy": 0.1313614435493946,
|
|
"num_tokens": 5375900.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 7.106399965286255,
|
|
"epoch": 3.3336663336663337,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.000469649221746692,
|
|
"loss": 6.6452,
|
|
"mean_token_accuracy": 0.1318917080760002,
|
|
"num_tokens": 5392561.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 7.146276998519897,
|
|
"epoch": 3.3436563436563436,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00046920453399958183,
|
|
"loss": 6.8447,
|
|
"mean_token_accuracy": 0.11955956816673279,
|
|
"num_tokens": 5408621.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 7.1728660583496096,
|
|
"epoch": 3.3536463536463534,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00046875685137831504,
|
|
"loss": 6.8166,
|
|
"mean_token_accuracy": 0.12094830945134163,
|
|
"num_tokens": 5425233.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 7.126680326461792,
|
|
"epoch": 3.3636363636363638,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004683061807867113,
|
|
"loss": 6.7252,
|
|
"mean_token_accuracy": 0.12711559012532234,
|
|
"num_tokens": 5440711.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 7.179180097579956,
|
|
"epoch": 3.3736263736263736,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00046785252917466876,
|
|
"loss": 6.7219,
|
|
"mean_token_accuracy": 0.13417968526482582,
|
|
"num_tokens": 5456876.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 7.169342565536499,
|
|
"epoch": 3.3836163836163835,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004673959035380564,
|
|
"loss": 6.711,
|
|
"mean_token_accuracy": 0.12825691401958467,
|
|
"num_tokens": 5471508.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 7.093486499786377,
|
|
"epoch": 3.393606393606394,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004669363109186065,
|
|
"loss": 6.7385,
|
|
"mean_token_accuracy": 0.13329153656959533,
|
|
"num_tokens": 5487538.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 7.131129884719849,
|
|
"epoch": 3.4035964035964037,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004664737584038057,
|
|
"loss": 6.79,
|
|
"mean_token_accuracy": 0.12501160874962808,
|
|
"num_tokens": 5504743.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 7.080353593826294,
|
|
"epoch": 3.4135864135864136,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.000466008253126786,
|
|
"loss": 6.7621,
|
|
"mean_token_accuracy": 0.12809988111257553,
|
|
"num_tokens": 5521316.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 7.203873348236084,
|
|
"epoch": 3.4235764235764234,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00046553980226621467,
|
|
"loss": 6.7941,
|
|
"mean_token_accuracy": 0.12308660298585891,
|
|
"num_tokens": 5537219.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 7.163216590881348,
|
|
"epoch": 3.4335664335664333,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004650684130461834,
|
|
"loss": 6.7394,
|
|
"mean_token_accuracy": 0.12020886838436126,
|
|
"num_tokens": 5553169.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 7.2141258239746096,
|
|
"epoch": 3.4435564435564436,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.00046459409273609726,
|
|
"loss": 6.8279,
|
|
"mean_token_accuracy": 0.12372163832187652,
|
|
"num_tokens": 5567737.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 7.132944536209107,
|
|
"epoch": 3.4535464535464535,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.0004641168486505621,
|
|
"loss": 6.8364,
|
|
"mean_token_accuracy": 0.12375331446528434,
|
|
"num_tokens": 5582895.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 7.04546890258789,
|
|
"epoch": 3.4635364635364634,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 0.00046363668814927196,
|
|
"loss": 6.6477,
|
|
"mean_token_accuracy": 0.14077948927879333,
|
|
"num_tokens": 5600052.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 7.043627214431763,
|
|
"epoch": 3.4735264735264737,
|
|
"grad_norm": 0.734375,
|
|
"learning_rate": 0.000463153618636896,
|
|
"loss": 6.5844,
|
|
"mean_token_accuracy": 0.1464115023612976,
|
|
"num_tokens": 5616457.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 7.180050802230835,
|
|
"epoch": 3.4835164835164836,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.00046266764756296353,
|
|
"loss": 6.9142,
|
|
"mean_token_accuracy": 0.11584651321172715,
|
|
"num_tokens": 5633882.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 7.109540557861328,
|
|
"epoch": 3.4935064935064934,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004621787824217497,
|
|
"loss": 6.7533,
|
|
"mean_token_accuracy": 0.12787417694926262,
|
|
"num_tokens": 5650569.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 7.095486402511597,
|
|
"epoch": 3.5034965034965033,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00046168703075215984,
|
|
"loss": 6.7958,
|
|
"mean_token_accuracy": 0.12227514982223511,
|
|
"num_tokens": 5667246.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 7.170636796951294,
|
|
"epoch": 3.5134865134865136,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.00046119240013761296,
|
|
"loss": 6.8479,
|
|
"mean_token_accuracy": 0.12106348723173141,
|
|
"num_tokens": 5683335.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 7.064558315277099,
|
|
"epoch": 3.5234765234765235,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.00046069489820592494,
|
|
"loss": 6.7356,
|
|
"mean_token_accuracy": 0.12260126546025277,
|
|
"num_tokens": 5698788.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 7.176153135299683,
|
|
"epoch": 3.5334665334665334,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.0004601945326291911,
|
|
"loss": 6.6829,
|
|
"mean_token_accuracy": 0.13431058302521706,
|
|
"num_tokens": 5714442.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 7.022355699539185,
|
|
"epoch": 3.5434565434565437,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 0.0004596913111236676,
|
|
"loss": 6.7178,
|
|
"mean_token_accuracy": 0.13559423461556436,
|
|
"num_tokens": 5732474.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 7.124798107147217,
|
|
"epoch": 3.5534465534465536,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.00045918524144965256,
|
|
"loss": 6.7885,
|
|
"mean_token_accuracy": 0.12556643784046173,
|
|
"num_tokens": 5750106.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 7.197141981124878,
|
|
"epoch": 3.5634365634365635,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00045867633141136643,
|
|
"loss": 6.7928,
|
|
"mean_token_accuracy": 0.12685323283076286,
|
|
"num_tokens": 5766190.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 7.097241735458374,
|
|
"epoch": 3.5734265734265733,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004581645888568314,
|
|
"loss": 6.8304,
|
|
"mean_token_accuracy": 0.11702406927943229,
|
|
"num_tokens": 5781470.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 7.181303644180298,
|
|
"epoch": 3.583416583416583,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.000457650021677751,
|
|
"loss": 6.8001,
|
|
"mean_token_accuracy": 0.12274287939071656,
|
|
"num_tokens": 5796113.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 7.104009628295898,
|
|
"epoch": 3.5934065934065935,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 0.00045713263780938746,
|
|
"loss": 6.7815,
|
|
"mean_token_accuracy": 0.12324125319719315,
|
|
"num_tokens": 5811353.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 7.124893665313721,
|
|
"epoch": 3.6033966033966034,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00045661244523044004,
|
|
"loss": 6.7562,
|
|
"mean_token_accuracy": 0.12621590569615365,
|
|
"num_tokens": 5827293.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 7.037387800216675,
|
|
"epoch": 3.6133866133866133,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.000456089451962922,
|
|
"loss": 6.7026,
|
|
"mean_token_accuracy": 0.13180168494582176,
|
|
"num_tokens": 5842089.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 7.140062618255615,
|
|
"epoch": 3.6233766233766236,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 0.0004555636660720363,
|
|
"loss": 6.8578,
|
|
"mean_token_accuracy": 0.11671878173947334,
|
|
"num_tokens": 5858609.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 7.031110954284668,
|
|
"epoch": 3.6333666333666335,
|
|
"grad_norm": 0.8671875,
|
|
"learning_rate": 0.000455035095666052,
|
|
"loss": 6.6328,
|
|
"mean_token_accuracy": 0.14110387042164801,
|
|
"num_tokens": 5876041.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.971533203125,
|
|
"epoch": 3.6433566433566433,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045450374889617845,
|
|
"loss": 6.6081,
|
|
"mean_token_accuracy": 0.14888231158256532,
|
|
"num_tokens": 5892310.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 7.1198341846466064,
|
|
"epoch": 3.653346653346653,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004539696339564404,
|
|
"loss": 6.8253,
|
|
"mean_token_accuracy": 0.11925003081560134,
|
|
"num_tokens": 5908890.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 7.0790997505187985,
|
|
"epoch": 3.663336663336663,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.00045343275908355055,
|
|
"loss": 6.6573,
|
|
"mean_token_accuracy": 0.1363980256021023,
|
|
"num_tokens": 5924277.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.964910411834717,
|
|
"epoch": 3.6733266733266734,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 0.00045289313255678386,
|
|
"loss": 6.676,
|
|
"mean_token_accuracy": 0.1379535473883152,
|
|
"num_tokens": 5942177.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 7.128736352920532,
|
|
"epoch": 3.6833166833166833,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.000452350762697849,
|
|
"loss": 6.7822,
|
|
"mean_token_accuracy": 0.11843417510390282,
|
|
"num_tokens": 5957797.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 7.127052879333496,
|
|
"epoch": 3.693306693306693,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.00045180565787076,
|
|
"loss": 6.7712,
|
|
"mean_token_accuracy": 0.1192670740187168,
|
|
"num_tokens": 5974816.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 7.10209698677063,
|
|
"epoch": 3.7032967032967035,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0004512578264817076,
|
|
"loss": 6.7463,
|
|
"mean_token_accuracy": 0.1253843389451504,
|
|
"num_tokens": 5990247.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 7.069775342941284,
|
|
"epoch": 3.7132867132867133,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00045070727697892954,
|
|
"loss": 6.7733,
|
|
"mean_token_accuracy": 0.1255517013370991,
|
|
"num_tokens": 6007235.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 7.112951135635376,
|
|
"epoch": 3.723276723276723,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 0.00045015401785258034,
|
|
"loss": 6.66,
|
|
"mean_token_accuracy": 0.135778945684433,
|
|
"num_tokens": 6023449.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 7.058276891708374,
|
|
"epoch": 3.733266733266733,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.00044959805763459995,
|
|
"loss": 6.7356,
|
|
"mean_token_accuracy": 0.12650015875697135,
|
|
"num_tokens": 6039699.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 7.1094402313232425,
|
|
"epoch": 3.7432567432567434,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 0.00044903940489858274,
|
|
"loss": 6.7886,
|
|
"mean_token_accuracy": 0.12622693479061126,
|
|
"num_tokens": 6055186.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 7.06230583190918,
|
|
"epoch": 3.7532467532467533,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 0.00044847806825964505,
|
|
"loss": 6.7806,
|
|
"mean_token_accuracy": 0.12709858492016793,
|
|
"num_tokens": 6070413.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 7.0569939613342285,
|
|
"epoch": 3.763236763236763,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 0.0004479140563742922,
|
|
"loss": 6.7905,
|
|
"mean_token_accuracy": 0.12550225779414176,
|
|
"num_tokens": 6086140.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 7.120326662063599,
|
|
"epoch": 3.7732267732267735,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 0.0004473473779402853,
|
|
"loss": 6.7136,
|
|
"mean_token_accuracy": 0.12992869466543197,
|
|
"num_tokens": 6103766.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 7.07710452079773,
|
|
"epoch": 3.7832167832167833,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004467780416965067,
|
|
"loss": 6.8188,
|
|
"mean_token_accuracy": 0.1215907171368599,
|
|
"num_tokens": 6119949.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 7.073676347732544,
|
|
"epoch": 3.793206793206793,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00044620605642282555,
|
|
"loss": 6.8142,
|
|
"mean_token_accuracy": 0.12248084098100662,
|
|
"num_tokens": 6135242.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 7.213345336914062,
|
|
"epoch": 3.803196803196803,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.00044563143093996247,
|
|
"loss": 6.8843,
|
|
"mean_token_accuracy": 0.12051893100142479,
|
|
"num_tokens": 6151757.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.9489563465118405,
|
|
"epoch": 3.813186813186813,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 0.00044505417410935314,
|
|
"loss": 6.6061,
|
|
"mean_token_accuracy": 0.14097559526562692,
|
|
"num_tokens": 6168645.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 7.026501989364624,
|
|
"epoch": 3.8231768231768233,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.000444474294833012,
|
|
"loss": 6.646,
|
|
"mean_token_accuracy": 0.13266035094857215,
|
|
"num_tokens": 6187290.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 7.148423337936402,
|
|
"epoch": 3.833166833166833,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 0.0004438918020533949,
|
|
"loss": 6.8282,
|
|
"mean_token_accuracy": 0.12248983979225159,
|
|
"num_tokens": 6202559.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 7.037263345718384,
|
|
"epoch": 3.843156843156843,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 0.0004433067047532611,
|
|
"loss": 6.6334,
|
|
"mean_token_accuracy": 0.13536879271268845,
|
|
"num_tokens": 6218876.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.973905420303344,
|
|
"epoch": 3.8531468531468533,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 0.00044271901195553465,
|
|
"loss": 6.6515,
|
|
"mean_token_accuracy": 0.12920384258031845,
|
|
"num_tokens": 6235305.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 7.083110713958741,
|
|
"epoch": 3.863136863136863,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00044212873272316564,
|
|
"loss": 6.7521,
|
|
"mean_token_accuracy": 0.12410952597856521,
|
|
"num_tokens": 6250039.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 7.060521364212036,
|
|
"epoch": 3.873126873126873,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 0.0004415358761589899,
|
|
"loss": 6.7178,
|
|
"mean_token_accuracy": 0.13092741817235948,
|
|
"num_tokens": 6267479.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 7.0901649475097654,
|
|
"epoch": 3.883116883116883,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 0.00044094045140558914,
|
|
"loss": 6.8106,
|
|
"mean_token_accuracy": 0.12367469295859337,
|
|
"num_tokens": 6283564.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 7.154060745239258,
|
|
"epoch": 3.893106893106893,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.0004403424676451497,
|
|
"loss": 6.8632,
|
|
"mean_token_accuracy": 0.11547367498278618,
|
|
"num_tokens": 6298442.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 7.076562118530274,
|
|
"epoch": 3.903096903096903,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 0.0004397419340993207,
|
|
"loss": 6.751,
|
|
"mean_token_accuracy": 0.12074748352169991,
|
|
"num_tokens": 6314431.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 7.05272421836853,
|
|
"epoch": 3.913086913086913,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 0.0004391388600290724,
|
|
"loss": 6.74,
|
|
"mean_token_accuracy": 0.12377151399850846,
|
|
"num_tokens": 6331266.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 7.101782894134521,
|
|
"epoch": 3.9230769230769234,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.0004385332547345531,
|
|
"loss": 6.8382,
|
|
"mean_token_accuracy": 0.12267978042364121,
|
|
"num_tokens": 6347366.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 7.074215984344482,
|
|
"epoch": 3.9330669330669332,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 0.00043792512755494564,
|
|
"loss": 6.7722,
|
|
"mean_token_accuracy": 0.12224731072783471,
|
|
"num_tokens": 6363633.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 7.194826459884643,
|
|
"epoch": 3.943056943056943,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 0.00043731448786832317,
|
|
"loss": 6.7887,
|
|
"mean_token_accuracy": 0.12292017713189125,
|
|
"num_tokens": 6380264.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.990942764282226,
|
|
"epoch": 3.953046953046953,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 0.0004367013450915053,
|
|
"loss": 6.7275,
|
|
"mean_token_accuracy": 0.12456048503518105,
|
|
"num_tokens": 6395969.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 7.043016624450684,
|
|
"epoch": 3.963036963036963,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043608570867991196,
|
|
"loss": 6.7685,
|
|
"mean_token_accuracy": 0.12395606711506843,
|
|
"num_tokens": 6411883.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.9693458557128904,
|
|
"epoch": 3.973026973026973,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.00043546758812741844,
|
|
"loss": 6.6734,
|
|
"mean_token_accuracy": 0.13040299639105796,
|
|
"num_tokens": 6427476.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 7.094076013565063,
|
|
"epoch": 3.983016983016983,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 0.0004348469929662081,
|
|
"loss": 6.6441,
|
|
"mean_token_accuracy": 0.13878704532980918,
|
|
"num_tokens": 6443150.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 7.045284080505371,
|
|
"epoch": 3.993006993006993,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.00043422393276662595,
|
|
"loss": 6.8086,
|
|
"mean_token_accuracy": 0.12303325086832047,
|
|
"num_tokens": 6458582.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 3.993006993006993,
|
|
"eval_entropy": 6.972401072527911,
|
|
"eval_loss": 7.0694169998168945,
|
|
"eval_mean_token_accuracy": 0.11132242733965049,
|
|
"eval_num_tokens": 6458582.0,
|
|
"eval_runtime": 1.1886,
|
|
"eval_samples_per_second": 1240.161,
|
|
"eval_steps_per_second": 155.651,
|
|
"step": 2000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 5000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1300763324252160.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|