Files
zho-hans-10mb-10mb_seed3407/checkpoint-5000/trainer_state.json
ModelHub XC 299f5479e7 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/zho-hans-10mb-10mb_seed3407
Source: Original Platform
2026-09-28 06:53:17 +08:00

10145 lines
277 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 9.98101898101898,
"eval_steps": 500,
"global_step": 5000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.74254903793335,
"epoch": 0.00999000999000999,
"grad_norm": 4.6875,
"learning_rate": 2e-06,
"loss": 10.8409,
"mean_token_accuracy": 0.00010789126390591264,
"num_tokens": 17348.0,
"step": 5
},
{
"entropy": 10.742575931549073,
"epoch": 0.01998001998001998,
"grad_norm": 5.28125,
"learning_rate": 4.5e-06,
"loss": 10.8325,
"mean_token_accuracy": 6.410256610251963e-05,
"num_tokens": 33613.0,
"step": 10
},
{
"entropy": 10.742553329467773,
"epoch": 0.029970029970029972,
"grad_norm": 5.0625,
"learning_rate": 7e-06,
"loss": 10.8012,
"mean_token_accuracy": 0.00016108142444863914,
"num_tokens": 49416.0,
"step": 15
},
{
"entropy": 10.742562675476075,
"epoch": 0.03996003996003996,
"grad_norm": 5.0625,
"learning_rate": 9.5e-06,
"loss": 10.7438,
"mean_token_accuracy": 0.0010525182529818266,
"num_tokens": 64663.0,
"step": 20
},
{
"entropy": 10.742408943176269,
"epoch": 0.04995004995004995,
"grad_norm": 4.75,
"learning_rate": 1.2e-05,
"loss": 10.6283,
"mean_token_accuracy": 0.03072175462730229,
"num_tokens": 79972.0,
"step": 25
},
{
"entropy": 10.74140043258667,
"epoch": 0.059940059940059943,
"grad_norm": 4.0,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.5246,
"mean_token_accuracy": 0.05747625604271889,
"num_tokens": 96254.0,
"step": 30
},
{
"entropy": 10.735374069213867,
"epoch": 0.06993006993006994,
"grad_norm": 2.875,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.3755,
"mean_token_accuracy": 0.06859578937292099,
"num_tokens": 112713.0,
"step": 35
},
{
"entropy": 10.707574653625489,
"epoch": 0.07992007992007992,
"grad_norm": 2.28125,
"learning_rate": 1.95e-05,
"loss": 10.1924,
"mean_token_accuracy": 0.06884920224547386,
"num_tokens": 128259.0,
"step": 40
},
{
"entropy": 10.654945564270019,
"epoch": 0.0899100899100899,
"grad_norm": 2.046875,
"learning_rate": 2.2e-05,
"loss": 10.1434,
"mean_token_accuracy": 0.06479340717196465,
"num_tokens": 145521.0,
"step": 45
},
{
"entropy": 10.624096393585205,
"epoch": 0.0999000999000999,
"grad_norm": 1.7734375,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0779,
"mean_token_accuracy": 0.06704385466873646,
"num_tokens": 162665.0,
"step": 50
},
{
"entropy": 10.62326774597168,
"epoch": 0.10989010989010989,
"grad_norm": 1.796875,
"learning_rate": 2.7e-05,
"loss": 10.0119,
"mean_token_accuracy": 0.06695662550628186,
"num_tokens": 178901.0,
"step": 55
},
{
"entropy": 10.61907787322998,
"epoch": 0.11988011988011989,
"grad_norm": 1.7421875,
"learning_rate": 2.95e-05,
"loss": 9.9679,
"mean_token_accuracy": 0.06775063388049603,
"num_tokens": 194617.0,
"step": 60
},
{
"entropy": 10.605632114410401,
"epoch": 0.12987012987012986,
"grad_norm": 1.7109375,
"learning_rate": 3.2e-05,
"loss": 9.8939,
"mean_token_accuracy": 0.07534115239977837,
"num_tokens": 209675.0,
"step": 65
},
{
"entropy": 10.59527235031128,
"epoch": 0.13986013986013987,
"grad_norm": 2.0,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.8733,
"mean_token_accuracy": 0.07048867233097553,
"num_tokens": 225848.0,
"step": 70
},
{
"entropy": 10.599591922760009,
"epoch": 0.14985014985014986,
"grad_norm": 1.796875,
"learning_rate": 3.7e-05,
"loss": 9.8167,
"mean_token_accuracy": 0.07247593812644482,
"num_tokens": 242981.0,
"step": 75
},
{
"entropy": 10.579588508605957,
"epoch": 0.15984015984015984,
"grad_norm": 1.546875,
"learning_rate": 3.95e-05,
"loss": 9.7625,
"mean_token_accuracy": 0.07427209392189979,
"num_tokens": 258173.0,
"step": 80
},
{
"entropy": 10.544640350341798,
"epoch": 0.16983016983016982,
"grad_norm": 1.6484375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.69,
"mean_token_accuracy": 0.07245487086474896,
"num_tokens": 273570.0,
"step": 85
},
{
"entropy": 10.5300874710083,
"epoch": 0.1798201798201798,
"grad_norm": 1.5625,
"learning_rate": 4.45e-05,
"loss": 9.6529,
"mean_token_accuracy": 0.07408605217933655,
"num_tokens": 290549.0,
"step": 90
},
{
"entropy": 10.528420066833496,
"epoch": 0.18981018981018982,
"grad_norm": 1.5390625,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.6194,
"mean_token_accuracy": 0.07625656872987747,
"num_tokens": 306856.0,
"step": 95
},
{
"entropy": 10.485299491882325,
"epoch": 0.1998001998001998,
"grad_norm": 1.5234375,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.5443,
"mean_token_accuracy": 0.08020635470747947,
"num_tokens": 322515.0,
"step": 100
},
{
"entropy": 10.434676933288575,
"epoch": 0.2097902097902098,
"grad_norm": 1.609375,
"learning_rate": 5.2e-05,
"loss": 9.4966,
"mean_token_accuracy": 0.07586914226412773,
"num_tokens": 337941.0,
"step": 105
},
{
"entropy": 10.45520372390747,
"epoch": 0.21978021978021978,
"grad_norm": 1.546875,
"learning_rate": 5.45e-05,
"loss": 9.4232,
"mean_token_accuracy": 0.08006052449345588,
"num_tokens": 353788.0,
"step": 110
},
{
"entropy": 10.380233097076417,
"epoch": 0.22977022977022976,
"grad_norm": 1.6015625,
"learning_rate": 5.7e-05,
"loss": 9.3782,
"mean_token_accuracy": 0.08523525297641754,
"num_tokens": 371012.0,
"step": 115
},
{
"entropy": 10.3286771774292,
"epoch": 0.23976023976023977,
"grad_norm": 1.765625,
"learning_rate": 5.9499999999999996e-05,
"loss": 9.2336,
"mean_token_accuracy": 0.08941392749547958,
"num_tokens": 387063.0,
"step": 120
},
{
"entropy": 10.305299186706543,
"epoch": 0.24975024975024976,
"grad_norm": 1.203125,
"learning_rate": 6.2e-05,
"loss": 9.2413,
"mean_token_accuracy": 0.08080004155635834,
"num_tokens": 404360.0,
"step": 125
},
{
"entropy": 10.245867156982422,
"epoch": 0.2597402597402597,
"grad_norm": 2.0625,
"learning_rate": 6.450000000000001e-05,
"loss": 9.0529,
"mean_token_accuracy": 0.09887080416083335,
"num_tokens": 421267.0,
"step": 130
},
{
"entropy": 10.113175201416016,
"epoch": 0.26973026973026976,
"grad_norm": 1.0390625,
"learning_rate": 6.7e-05,
"loss": 9.0745,
"mean_token_accuracy": 0.0869515560567379,
"num_tokens": 438900.0,
"step": 135
},
{
"entropy": 10.11645679473877,
"epoch": 0.27972027972027974,
"grad_norm": 1.2421875,
"learning_rate": 6.950000000000001e-05,
"loss": 8.9962,
"mean_token_accuracy": 0.08159712329506874,
"num_tokens": 454580.0,
"step": 140
},
{
"entropy": 10.033879661560059,
"epoch": 0.2897102897102897,
"grad_norm": 0.9375,
"learning_rate": 7.2e-05,
"loss": 8.9364,
"mean_token_accuracy": 0.082859006524086,
"num_tokens": 470894.0,
"step": 145
},
{
"entropy": 9.949287033081054,
"epoch": 0.2997002997002997,
"grad_norm": 1.15625,
"learning_rate": 7.45e-05,
"loss": 8.8864,
"mean_token_accuracy": 0.0842631220817566,
"num_tokens": 487872.0,
"step": 150
},
{
"entropy": 9.799868774414062,
"epoch": 0.3096903096903097,
"grad_norm": 1.375,
"learning_rate": 7.7e-05,
"loss": 8.7141,
"mean_token_accuracy": 0.09437366873025894,
"num_tokens": 503899.0,
"step": 155
},
{
"entropy": 9.570561790466309,
"epoch": 0.3196803196803197,
"grad_norm": 0.83203125,
"learning_rate": 7.950000000000001e-05,
"loss": 8.6153,
"mean_token_accuracy": 0.09862063378095627,
"num_tokens": 519023.0,
"step": 160
},
{
"entropy": 9.580165386199951,
"epoch": 0.32967032967032966,
"grad_norm": 0.796875,
"learning_rate": 8.2e-05,
"loss": 8.6321,
"mean_token_accuracy": 0.087054193764925,
"num_tokens": 535424.0,
"step": 165
},
{
"entropy": 9.45827875137329,
"epoch": 0.33966033966033965,
"grad_norm": 0.83203125,
"learning_rate": 8.450000000000001e-05,
"loss": 8.6716,
"mean_token_accuracy": 0.08567041307687759,
"num_tokens": 552528.0,
"step": 170
},
{
"entropy": 9.326940536499023,
"epoch": 0.34965034965034963,
"grad_norm": 0.70703125,
"learning_rate": 8.7e-05,
"loss": 8.5523,
"mean_token_accuracy": 0.08963110744953155,
"num_tokens": 567149.0,
"step": 175
},
{
"entropy": 9.181477642059326,
"epoch": 0.3596403596403596,
"grad_norm": 0.8984375,
"learning_rate": 8.95e-05,
"loss": 8.5255,
"mean_token_accuracy": 0.08932835683226585,
"num_tokens": 582033.0,
"step": 180
},
{
"entropy": 9.184029483795166,
"epoch": 0.3696303696303696,
"grad_norm": 0.9921875,
"learning_rate": 9.2e-05,
"loss": 8.492,
"mean_token_accuracy": 0.09364427700638771,
"num_tokens": 598930.0,
"step": 185
},
{
"entropy": 9.105390739440917,
"epoch": 0.37962037962037964,
"grad_norm": 0.91015625,
"learning_rate": 9.45e-05,
"loss": 8.4764,
"mean_token_accuracy": 0.08496234193444252,
"num_tokens": 615859.0,
"step": 190
},
{
"entropy": 9.057480430603027,
"epoch": 0.38961038961038963,
"grad_norm": 0.66015625,
"learning_rate": 9.7e-05,
"loss": 8.4525,
"mean_token_accuracy": 0.09097891747951507,
"num_tokens": 631984.0,
"step": 195
},
{
"entropy": 8.931283473968506,
"epoch": 0.3996003996003996,
"grad_norm": 0.76171875,
"learning_rate": 9.95e-05,
"loss": 8.4712,
"mean_token_accuracy": 0.09022903516888618,
"num_tokens": 648599.0,
"step": 200
},
{
"entropy": 8.999445819854737,
"epoch": 0.4095904095904096,
"grad_norm": 0.75,
"learning_rate": 0.000102,
"loss": 8.5152,
"mean_token_accuracy": 0.08909457549452782,
"num_tokens": 666196.0,
"step": 205
},
{
"entropy": 8.872494792938232,
"epoch": 0.4195804195804196,
"grad_norm": 0.66015625,
"learning_rate": 0.00010449999999999999,
"loss": 8.4462,
"mean_token_accuracy": 0.09361587092280388,
"num_tokens": 682848.0,
"step": 210
},
{
"entropy": 8.852845001220704,
"epoch": 0.42957042957042957,
"grad_norm": 0.5703125,
"learning_rate": 0.000107,
"loss": 8.3932,
"mean_token_accuracy": 0.0924599327147007,
"num_tokens": 700324.0,
"step": 215
},
{
"entropy": 8.826492881774902,
"epoch": 0.43956043956043955,
"grad_norm": 0.6796875,
"learning_rate": 0.0001095,
"loss": 8.438,
"mean_token_accuracy": 0.0906071975827217,
"num_tokens": 715401.0,
"step": 220
},
{
"entropy": 8.716631221771241,
"epoch": 0.44955044955044954,
"grad_norm": 0.68359375,
"learning_rate": 0.000112,
"loss": 8.4143,
"mean_token_accuracy": 0.09328261092305183,
"num_tokens": 730372.0,
"step": 225
},
{
"entropy": 8.727209281921386,
"epoch": 0.4595404595404595,
"grad_norm": 0.796875,
"learning_rate": 0.0001145,
"loss": 8.3391,
"mean_token_accuracy": 0.09173915013670922,
"num_tokens": 745880.0,
"step": 230
},
{
"entropy": 8.743009567260742,
"epoch": 0.4695304695304695,
"grad_norm": 0.7265625,
"learning_rate": 0.00011700000000000001,
"loss": 8.3552,
"mean_token_accuracy": 0.09261953458189964,
"num_tokens": 761474.0,
"step": 235
},
{
"entropy": 8.669536972045899,
"epoch": 0.47952047952047955,
"grad_norm": 0.62890625,
"learning_rate": 0.00011949999999999999,
"loss": 8.3798,
"mean_token_accuracy": 0.09077078998088836,
"num_tokens": 776871.0,
"step": 240
},
{
"entropy": 8.689266204833984,
"epoch": 0.48951048951048953,
"grad_norm": 0.70703125,
"learning_rate": 0.000122,
"loss": 8.3659,
"mean_token_accuracy": 0.09065382108092308,
"num_tokens": 793506.0,
"step": 245
},
{
"entropy": 8.591617012023926,
"epoch": 0.4995004995004995,
"grad_norm": 0.68359375,
"learning_rate": 0.0001245,
"loss": 8.3325,
"mean_token_accuracy": 0.09529750868678093,
"num_tokens": 808366.0,
"step": 250
},
{
"entropy": 8.718113708496094,
"epoch": 0.5094905094905094,
"grad_norm": 0.765625,
"learning_rate": 0.000127,
"loss": 8.2646,
"mean_token_accuracy": 0.10416125357151032,
"num_tokens": 825461.0,
"step": 255
},
{
"entropy": 8.644307136535645,
"epoch": 0.5194805194805194,
"grad_norm": 0.65625,
"learning_rate": 0.0001295,
"loss": 8.3552,
"mean_token_accuracy": 0.08870847970247268,
"num_tokens": 840998.0,
"step": 260
},
{
"entropy": 8.638798427581786,
"epoch": 0.5294705294705294,
"grad_norm": 0.70703125,
"learning_rate": 0.000132,
"loss": 8.4149,
"mean_token_accuracy": 0.08986097797751427,
"num_tokens": 858383.0,
"step": 265
},
{
"entropy": 8.622299480438233,
"epoch": 0.5394605394605395,
"grad_norm": 0.703125,
"learning_rate": 0.00013450000000000002,
"loss": 8.3192,
"mean_token_accuracy": 0.08967429846525192,
"num_tokens": 873611.0,
"step": 270
},
{
"entropy": 8.645909023284911,
"epoch": 0.5494505494505495,
"grad_norm": 0.8046875,
"learning_rate": 0.00013700000000000002,
"loss": 8.2318,
"mean_token_accuracy": 0.10625835433602333,
"num_tokens": 889918.0,
"step": 275
},
{
"entropy": 8.576266384124756,
"epoch": 0.5594405594405595,
"grad_norm": 0.80859375,
"learning_rate": 0.0001395,
"loss": 8.2966,
"mean_token_accuracy": 0.1017056480050087,
"num_tokens": 906967.0,
"step": 280
},
{
"entropy": 8.678112125396728,
"epoch": 0.5694305694305695,
"grad_norm": 0.73828125,
"learning_rate": 0.00014199999999999998,
"loss": 8.3848,
"mean_token_accuracy": 0.09247232899069786,
"num_tokens": 922954.0,
"step": 285
},
{
"entropy": 8.666139221191406,
"epoch": 0.5794205794205795,
"grad_norm": 0.7734375,
"learning_rate": 0.0001445,
"loss": 8.3586,
"mean_token_accuracy": 0.0921535387635231,
"num_tokens": 938920.0,
"step": 290
},
{
"entropy": 8.631329917907715,
"epoch": 0.5894105894105894,
"grad_norm": 0.66796875,
"learning_rate": 0.000147,
"loss": 8.3734,
"mean_token_accuracy": 0.0920196034014225,
"num_tokens": 956301.0,
"step": 295
},
{
"entropy": 8.548529148101807,
"epoch": 0.5994005994005994,
"grad_norm": 0.8515625,
"learning_rate": 0.0001495,
"loss": 8.2358,
"mean_token_accuracy": 0.09958092793822289,
"num_tokens": 972454.0,
"step": 300
},
{
"entropy": 8.61522102355957,
"epoch": 0.6093906093906094,
"grad_norm": 0.703125,
"learning_rate": 0.000152,
"loss": 8.333,
"mean_token_accuracy": 0.09208913743495942,
"num_tokens": 987326.0,
"step": 305
},
{
"entropy": 8.584405994415283,
"epoch": 0.6193806193806194,
"grad_norm": 0.69921875,
"learning_rate": 0.00015450000000000001,
"loss": 8.2977,
"mean_token_accuracy": 0.09532473459839821,
"num_tokens": 1002448.0,
"step": 310
},
{
"entropy": 8.536137676239013,
"epoch": 0.6293706293706294,
"grad_norm": 0.69921875,
"learning_rate": 0.000157,
"loss": 8.3265,
"mean_token_accuracy": 0.09180266484618187,
"num_tokens": 1020348.0,
"step": 315
},
{
"entropy": 8.623396396636963,
"epoch": 0.6393606393606394,
"grad_norm": 0.7265625,
"learning_rate": 0.0001595,
"loss": 8.3499,
"mean_token_accuracy": 0.08997747674584389,
"num_tokens": 1036562.0,
"step": 320
},
{
"entropy": 8.528428745269775,
"epoch": 0.6493506493506493,
"grad_norm": 0.7734375,
"learning_rate": 0.000162,
"loss": 8.3187,
"mean_token_accuracy": 0.09452675953507424,
"num_tokens": 1053106.0,
"step": 325
},
{
"entropy": 8.570547008514405,
"epoch": 0.6593406593406593,
"grad_norm": 0.80078125,
"learning_rate": 0.00016450000000000001,
"loss": 8.2708,
"mean_token_accuracy": 0.09287350997328758,
"num_tokens": 1068277.0,
"step": 330
},
{
"entropy": 8.505113983154297,
"epoch": 0.6693306693306693,
"grad_norm": 0.7109375,
"learning_rate": 0.00016700000000000002,
"loss": 8.212,
"mean_token_accuracy": 0.10472053438425064,
"num_tokens": 1083887.0,
"step": 335
},
{
"entropy": 8.494814014434814,
"epoch": 0.6793206793206793,
"grad_norm": 0.65234375,
"learning_rate": 0.00016950000000000003,
"loss": 8.2264,
"mean_token_accuracy": 0.0991443045437336,
"num_tokens": 1099791.0,
"step": 340
},
{
"entropy": 8.513353157043458,
"epoch": 0.6893106893106893,
"grad_norm": 0.9140625,
"learning_rate": 0.00017199999999999998,
"loss": 8.2843,
"mean_token_accuracy": 0.09210123345255852,
"num_tokens": 1116137.0,
"step": 345
},
{
"entropy": 8.550718784332275,
"epoch": 0.6993006993006993,
"grad_norm": 0.77734375,
"learning_rate": 0.00017449999999999999,
"loss": 8.2293,
"mean_token_accuracy": 0.10072905272245407,
"num_tokens": 1132449.0,
"step": 350
},
{
"entropy": 8.527479457855225,
"epoch": 0.7092907092907093,
"grad_norm": 1.1171875,
"learning_rate": 0.000177,
"loss": 8.3552,
"mean_token_accuracy": 0.09086157828569412,
"num_tokens": 1148316.0,
"step": 355
},
{
"entropy": 8.505389308929443,
"epoch": 0.7192807192807192,
"grad_norm": 0.74609375,
"learning_rate": 0.0001795,
"loss": 8.2142,
"mean_token_accuracy": 0.09256454855203629,
"num_tokens": 1164030.0,
"step": 360
},
{
"entropy": 8.580228328704834,
"epoch": 0.7292707292707292,
"grad_norm": 0.87109375,
"learning_rate": 0.000182,
"loss": 8.3049,
"mean_token_accuracy": 0.09622592777013779,
"num_tokens": 1180624.0,
"step": 365
},
{
"entropy": 8.496176528930665,
"epoch": 0.7392607392607392,
"grad_norm": 0.8671875,
"learning_rate": 0.0001845,
"loss": 8.2815,
"mean_token_accuracy": 0.09714617729187011,
"num_tokens": 1196986.0,
"step": 370
},
{
"entropy": 8.580214786529542,
"epoch": 0.7492507492507493,
"grad_norm": 0.72265625,
"learning_rate": 0.000187,
"loss": 8.2919,
"mean_token_accuracy": 0.09614738449454308,
"num_tokens": 1212754.0,
"step": 375
},
{
"entropy": 8.44631586074829,
"epoch": 0.7592407592407593,
"grad_norm": 0.91015625,
"learning_rate": 0.0001895,
"loss": 8.2324,
"mean_token_accuracy": 0.09536803364753724,
"num_tokens": 1229627.0,
"step": 380
},
{
"entropy": 8.515226554870605,
"epoch": 0.7692307692307693,
"grad_norm": 1.1796875,
"learning_rate": 0.000192,
"loss": 8.1816,
"mean_token_accuracy": 0.0967013455927372,
"num_tokens": 1245127.0,
"step": 385
},
{
"entropy": 8.458242416381836,
"epoch": 0.7792207792207793,
"grad_norm": 0.8125,
"learning_rate": 0.0001945,
"loss": 8.2483,
"mean_token_accuracy": 0.09477976039052009,
"num_tokens": 1261438.0,
"step": 390
},
{
"entropy": 8.479850482940673,
"epoch": 0.7892107892107892,
"grad_norm": 0.734375,
"learning_rate": 0.00019700000000000002,
"loss": 8.2152,
"mean_token_accuracy": 0.09673597514629365,
"num_tokens": 1277476.0,
"step": 395
},
{
"entropy": 8.536440181732178,
"epoch": 0.7992007992007992,
"grad_norm": 0.76953125,
"learning_rate": 0.00019950000000000002,
"loss": 8.1608,
"mean_token_accuracy": 0.09755991101264953,
"num_tokens": 1294659.0,
"step": 400
},
{
"entropy": 8.371343421936036,
"epoch": 0.8091908091908092,
"grad_norm": 0.8203125,
"learning_rate": 0.000202,
"loss": 8.1319,
"mean_token_accuracy": 0.10120925828814506,
"num_tokens": 1308829.0,
"step": 405
},
{
"entropy": 8.464437866210938,
"epoch": 0.8191808191808192,
"grad_norm": 0.765625,
"learning_rate": 0.00020449999999999998,
"loss": 8.1896,
"mean_token_accuracy": 0.10006042197346687,
"num_tokens": 1325659.0,
"step": 410
},
{
"entropy": 8.507107639312744,
"epoch": 0.8291708291708292,
"grad_norm": 0.87890625,
"learning_rate": 0.000207,
"loss": 8.2255,
"mean_token_accuracy": 0.09681524932384492,
"num_tokens": 1341643.0,
"step": 415
},
{
"entropy": 8.446794795989991,
"epoch": 0.8391608391608392,
"grad_norm": 0.9140625,
"learning_rate": 0.0002095,
"loss": 8.197,
"mean_token_accuracy": 0.09735974669456482,
"num_tokens": 1359197.0,
"step": 420
},
{
"entropy": 8.502279472351074,
"epoch": 0.8491508491508492,
"grad_norm": 0.6796875,
"learning_rate": 0.000212,
"loss": 8.1875,
"mean_token_accuracy": 0.09608993604779244,
"num_tokens": 1376107.0,
"step": 425
},
{
"entropy": 8.477056503295898,
"epoch": 0.8591408591408591,
"grad_norm": 0.79296875,
"learning_rate": 0.0002145,
"loss": 8.2042,
"mean_token_accuracy": 0.09094029515981675,
"num_tokens": 1392232.0,
"step": 430
},
{
"entropy": 8.460865306854249,
"epoch": 0.8691308691308691,
"grad_norm": 0.83984375,
"learning_rate": 0.00021700000000000002,
"loss": 8.1631,
"mean_token_accuracy": 0.09813632071018219,
"num_tokens": 1406747.0,
"step": 435
},
{
"entropy": 8.48235101699829,
"epoch": 0.8791208791208791,
"grad_norm": 0.7890625,
"learning_rate": 0.0002195,
"loss": 8.1609,
"mean_token_accuracy": 0.09457436800003052,
"num_tokens": 1423599.0,
"step": 440
},
{
"entropy": 8.372987842559814,
"epoch": 0.8891108891108891,
"grad_norm": 1.1640625,
"learning_rate": 0.000222,
"loss": 8.091,
"mean_token_accuracy": 0.1050879828631878,
"num_tokens": 1439330.0,
"step": 445
},
{
"entropy": 8.440707111358643,
"epoch": 0.8991008991008991,
"grad_norm": 0.66015625,
"learning_rate": 0.0002245,
"loss": 8.0636,
"mean_token_accuracy": 0.10564030036330223,
"num_tokens": 1456660.0,
"step": 450
},
{
"entropy": 8.463158130645752,
"epoch": 0.9090909090909091,
"grad_norm": 0.77734375,
"learning_rate": 0.00022700000000000002,
"loss": 8.1173,
"mean_token_accuracy": 0.10065716579556465,
"num_tokens": 1471619.0,
"step": 455
},
{
"entropy": 8.29682149887085,
"epoch": 0.919080919080919,
"grad_norm": 0.90625,
"learning_rate": 0.00022950000000000002,
"loss": 8.0752,
"mean_token_accuracy": 0.09712542369961738,
"num_tokens": 1486971.0,
"step": 460
},
{
"entropy": 8.374618434906006,
"epoch": 0.929070929070929,
"grad_norm": 0.7890625,
"learning_rate": 0.00023200000000000003,
"loss": 8.1102,
"mean_token_accuracy": 0.09521022215485572,
"num_tokens": 1502923.0,
"step": 465
},
{
"entropy": 8.45193510055542,
"epoch": 0.939060939060939,
"grad_norm": 1.1015625,
"learning_rate": 0.00023449999999999998,
"loss": 8.1818,
"mean_token_accuracy": 0.09111250266432762,
"num_tokens": 1520214.0,
"step": 470
},
{
"entropy": 8.413396072387695,
"epoch": 0.949050949050949,
"grad_norm": 0.875,
"learning_rate": 0.000237,
"loss": 8.0682,
"mean_token_accuracy": 0.10277181193232536,
"num_tokens": 1534946.0,
"step": 475
},
{
"entropy": 8.293998527526856,
"epoch": 0.9590409590409591,
"grad_norm": 0.74609375,
"learning_rate": 0.0002395,
"loss": 7.9474,
"mean_token_accuracy": 0.11179379150271415,
"num_tokens": 1551823.0,
"step": 480
},
{
"entropy": 8.366506767272949,
"epoch": 0.9690309690309691,
"grad_norm": 0.98828125,
"learning_rate": 0.000242,
"loss": 8.0529,
"mean_token_accuracy": 0.10311459228396416,
"num_tokens": 1567354.0,
"step": 485
},
{
"entropy": 8.338885498046874,
"epoch": 0.9790209790209791,
"grad_norm": 1.109375,
"learning_rate": 0.0002445,
"loss": 8.0225,
"mean_token_accuracy": 0.09862796664237976,
"num_tokens": 1583749.0,
"step": 490
},
{
"entropy": 8.336707592010498,
"epoch": 0.989010989010989,
"grad_norm": 0.87890625,
"learning_rate": 0.000247,
"loss": 8.1258,
"mean_token_accuracy": 0.09763901010155678,
"num_tokens": 1599678.0,
"step": 495
},
{
"entropy": 8.445067310333252,
"epoch": 0.999000999000999,
"grad_norm": 0.99609375,
"learning_rate": 0.0002495,
"loss": 8.1224,
"mean_token_accuracy": 0.0928703673183918,
"num_tokens": 1616737.0,
"step": 500
},
{
"epoch": 0.999000999000999,
"eval_entropy": 8.140788088618098,
"eval_loss": 8.047406196594238,
"eval_mean_token_accuracy": 0.09197118636724111,
"eval_num_tokens": 1616737.0,
"eval_runtime": 1.1978,
"eval_samples_per_second": 1230.577,
"eval_steps_per_second": 154.448,
"step": 500
},
{
"entropy": 8.344965828789604,
"epoch": 1.007992007992008,
"grad_norm": 0.83203125,
"learning_rate": 0.000252,
"loss": 8.0423,
"mean_token_accuracy": 0.09306528833177355,
"num_tokens": 1629911.0,
"step": 505
},
{
"entropy": 8.31555461883545,
"epoch": 1.017982017982018,
"grad_norm": 0.75390625,
"learning_rate": 0.0002545,
"loss": 7.9697,
"mean_token_accuracy": 0.0968889206647873,
"num_tokens": 1645944.0,
"step": 510
},
{
"entropy": 8.219412803649902,
"epoch": 1.027972027972028,
"grad_norm": 0.8125,
"learning_rate": 0.000257,
"loss": 7.944,
"mean_token_accuracy": 0.10192576050758362,
"num_tokens": 1660254.0,
"step": 515
},
{
"entropy": 8.334071922302247,
"epoch": 1.037962037962038,
"grad_norm": 0.875,
"learning_rate": 0.0002595,
"loss": 7.9225,
"mean_token_accuracy": 0.10587546825408936,
"num_tokens": 1675805.0,
"step": 520
},
{
"entropy": 8.385684299468995,
"epoch": 1.0479520479520479,
"grad_norm": 0.84375,
"learning_rate": 0.000262,
"loss": 7.9414,
"mean_token_accuracy": 0.09777224585413932,
"num_tokens": 1692248.0,
"step": 525
},
{
"entropy": 8.283127307891846,
"epoch": 1.057942057942058,
"grad_norm": 0.82421875,
"learning_rate": 0.00026450000000000003,
"loss": 7.9208,
"mean_token_accuracy": 0.10127234905958175,
"num_tokens": 1708443.0,
"step": 530
},
{
"entropy": 8.216063213348388,
"epoch": 1.0679320679320679,
"grad_norm": 0.9140625,
"learning_rate": 0.00026700000000000004,
"loss": 7.8234,
"mean_token_accuracy": 0.1095321536064148,
"num_tokens": 1723977.0,
"step": 535
},
{
"entropy": 8.342953109741211,
"epoch": 1.077922077922078,
"grad_norm": 0.85546875,
"learning_rate": 0.00026950000000000005,
"loss": 7.9888,
"mean_token_accuracy": 0.09499371498823166,
"num_tokens": 1739362.0,
"step": 540
},
{
"entropy": 8.271250534057618,
"epoch": 1.0879120879120878,
"grad_norm": 0.90625,
"learning_rate": 0.00027200000000000005,
"loss": 7.9808,
"mean_token_accuracy": 0.09600954875349998,
"num_tokens": 1755106.0,
"step": 545
},
{
"entropy": 8.257489347457886,
"epoch": 1.097902097902098,
"grad_norm": 0.87890625,
"learning_rate": 0.0002745,
"loss": 7.9237,
"mean_token_accuracy": 0.09950614199042321,
"num_tokens": 1771537.0,
"step": 550
},
{
"entropy": 8.221052932739259,
"epoch": 1.1078921078921078,
"grad_norm": 0.921875,
"learning_rate": 0.000277,
"loss": 7.8883,
"mean_token_accuracy": 0.10020415410399437,
"num_tokens": 1786942.0,
"step": 555
},
{
"entropy": 8.243068408966064,
"epoch": 1.1178821178821179,
"grad_norm": 0.90625,
"learning_rate": 0.0002795,
"loss": 7.8005,
"mean_token_accuracy": 0.10907796397805214,
"num_tokens": 1803849.0,
"step": 560
},
{
"entropy": 8.201099395751953,
"epoch": 1.127872127872128,
"grad_norm": 0.765625,
"learning_rate": 0.00028199999999999997,
"loss": 7.8788,
"mean_token_accuracy": 0.10487436950206756,
"num_tokens": 1820439.0,
"step": 565
},
{
"entropy": 8.326700115203858,
"epoch": 1.1378621378621379,
"grad_norm": 0.9453125,
"learning_rate": 0.0002845,
"loss": 7.9411,
"mean_token_accuracy": 0.10306010618805886,
"num_tokens": 1836008.0,
"step": 570
},
{
"entropy": 8.20847806930542,
"epoch": 1.1478521478521477,
"grad_norm": 0.90625,
"learning_rate": 0.000287,
"loss": 7.8465,
"mean_token_accuracy": 0.10470956414937974,
"num_tokens": 1851887.0,
"step": 575
},
{
"entropy": 8.185382175445557,
"epoch": 1.1578421578421578,
"grad_norm": 0.84375,
"learning_rate": 0.0002895,
"loss": 7.8585,
"mean_token_accuracy": 0.0996880978345871,
"num_tokens": 1866979.0,
"step": 580
},
{
"entropy": 8.20130467414856,
"epoch": 1.167832167832168,
"grad_norm": 1.0859375,
"learning_rate": 0.000292,
"loss": 7.8965,
"mean_token_accuracy": 0.09827386811375619,
"num_tokens": 1881384.0,
"step": 585
},
{
"entropy": 8.22911195755005,
"epoch": 1.1778221778221778,
"grad_norm": 0.76953125,
"learning_rate": 0.0002945,
"loss": 7.8368,
"mean_token_accuracy": 0.10659671127796173,
"num_tokens": 1898986.0,
"step": 590
},
{
"entropy": 8.15971794128418,
"epoch": 1.187812187812188,
"grad_norm": 0.890625,
"learning_rate": 0.000297,
"loss": 7.8281,
"mean_token_accuracy": 0.10433512926101685,
"num_tokens": 1913303.0,
"step": 595
},
{
"entropy": 8.172107124328614,
"epoch": 1.1978021978021978,
"grad_norm": 1.09375,
"learning_rate": 0.0002995,
"loss": 7.8345,
"mean_token_accuracy": 0.11005568951368332,
"num_tokens": 1928906.0,
"step": 600
},
{
"entropy": 8.24223837852478,
"epoch": 1.2077922077922079,
"grad_norm": 0.90625,
"learning_rate": 0.000302,
"loss": 7.9028,
"mean_token_accuracy": 0.10041624084115028,
"num_tokens": 1944823.0,
"step": 605
},
{
"entropy": 8.156695556640624,
"epoch": 1.2177822177822177,
"grad_norm": 0.9296875,
"learning_rate": 0.0003045,
"loss": 7.8661,
"mean_token_accuracy": 0.10058502033352852,
"num_tokens": 1960538.0,
"step": 610
},
{
"entropy": 8.20977144241333,
"epoch": 1.2277722277722278,
"grad_norm": 0.92578125,
"learning_rate": 0.000307,
"loss": 7.8367,
"mean_token_accuracy": 0.09877868816256523,
"num_tokens": 1979509.0,
"step": 615
},
{
"entropy": 8.162244510650634,
"epoch": 1.2377622377622377,
"grad_norm": 0.8515625,
"learning_rate": 0.0003095,
"loss": 7.7884,
"mean_token_accuracy": 0.10074753984808922,
"num_tokens": 1995113.0,
"step": 620
},
{
"entropy": 8.172338390350342,
"epoch": 1.2477522477522478,
"grad_norm": 0.85546875,
"learning_rate": 0.000312,
"loss": 7.7659,
"mean_token_accuracy": 0.10919720381498337,
"num_tokens": 2010212.0,
"step": 625
},
{
"entropy": 8.09831461906433,
"epoch": 1.2577422577422577,
"grad_norm": 0.94921875,
"learning_rate": 0.0003145,
"loss": 7.8129,
"mean_token_accuracy": 0.10691071450710296,
"num_tokens": 2027483.0,
"step": 630
},
{
"entropy": 8.133178567886352,
"epoch": 1.2677322677322678,
"grad_norm": 0.79296875,
"learning_rate": 0.000317,
"loss": 7.7896,
"mean_token_accuracy": 0.10240155979990959,
"num_tokens": 2043897.0,
"step": 635
},
{
"entropy": 8.285891056060791,
"epoch": 1.2777222777222776,
"grad_norm": 0.78515625,
"learning_rate": 0.0003195,
"loss": 7.8684,
"mean_token_accuracy": 0.0982455164194107,
"num_tokens": 2061645.0,
"step": 640
},
{
"entropy": 8.103964185714721,
"epoch": 1.2877122877122877,
"grad_norm": 0.984375,
"learning_rate": 0.000322,
"loss": 7.8364,
"mean_token_accuracy": 0.10459044799208642,
"num_tokens": 2077751.0,
"step": 645
},
{
"entropy": 8.161087036132812,
"epoch": 1.2977022977022976,
"grad_norm": 0.78515625,
"learning_rate": 0.00032450000000000003,
"loss": 7.8622,
"mean_token_accuracy": 0.09868591278791428,
"num_tokens": 2093853.0,
"step": 650
},
{
"entropy": 8.170791816711425,
"epoch": 1.3076923076923077,
"grad_norm": 0.88671875,
"learning_rate": 0.00032700000000000003,
"loss": 7.8347,
"mean_token_accuracy": 0.09927802458405495,
"num_tokens": 2110151.0,
"step": 655
},
{
"entropy": 8.192026901245118,
"epoch": 1.3176823176823178,
"grad_norm": 1.1953125,
"learning_rate": 0.00032950000000000004,
"loss": 7.7538,
"mean_token_accuracy": 0.09446207582950591,
"num_tokens": 2125584.0,
"step": 660
},
{
"entropy": 8.104029846191406,
"epoch": 1.3276723276723277,
"grad_norm": 0.93359375,
"learning_rate": 0.00033200000000000005,
"loss": 7.7273,
"mean_token_accuracy": 0.10806782469153405,
"num_tokens": 2142247.0,
"step": 665
},
{
"entropy": 8.061339807510375,
"epoch": 1.3376623376623376,
"grad_norm": 1.203125,
"learning_rate": 0.00033450000000000005,
"loss": 7.6168,
"mean_token_accuracy": 0.10972020626068116,
"num_tokens": 2159116.0,
"step": 670
},
{
"entropy": 8.102464294433593,
"epoch": 1.3476523476523476,
"grad_norm": 0.84375,
"learning_rate": 0.000337,
"loss": 7.7746,
"mean_token_accuracy": 0.09734337553381919,
"num_tokens": 2175237.0,
"step": 675
},
{
"entropy": 8.079360914230346,
"epoch": 1.3576423576423577,
"grad_norm": 0.88671875,
"learning_rate": 0.0003395,
"loss": 7.7702,
"mean_token_accuracy": 0.10102465003728867,
"num_tokens": 2191108.0,
"step": 680
},
{
"entropy": 8.009714221954345,
"epoch": 1.3676323676323676,
"grad_norm": 1.140625,
"learning_rate": 0.000342,
"loss": 7.6556,
"mean_token_accuracy": 0.10901543200016021,
"num_tokens": 2207404.0,
"step": 685
},
{
"entropy": 8.017986679077149,
"epoch": 1.3776223776223775,
"grad_norm": 0.859375,
"learning_rate": 0.00034449999999999997,
"loss": 7.7225,
"mean_token_accuracy": 0.11000798493623734,
"num_tokens": 2223891.0,
"step": 690
},
{
"entropy": 8.004034423828125,
"epoch": 1.3876123876123876,
"grad_norm": 0.828125,
"learning_rate": 0.000347,
"loss": 7.688,
"mean_token_accuracy": 0.10737730488181114,
"num_tokens": 2239750.0,
"step": 695
},
{
"entropy": 8.089302206039429,
"epoch": 1.3976023976023977,
"grad_norm": 0.9765625,
"learning_rate": 0.0003495,
"loss": 7.7918,
"mean_token_accuracy": 0.09848668947815895,
"num_tokens": 2254475.0,
"step": 700
},
{
"entropy": 8.038819551467896,
"epoch": 1.4075924075924076,
"grad_norm": 0.8828125,
"learning_rate": 0.000352,
"loss": 7.7412,
"mean_token_accuracy": 0.10036000534892082,
"num_tokens": 2270403.0,
"step": 705
},
{
"entropy": 8.05772099494934,
"epoch": 1.4175824175824177,
"grad_norm": 0.82421875,
"learning_rate": 0.0003545,
"loss": 7.7231,
"mean_token_accuracy": 0.10787450224161148,
"num_tokens": 2287440.0,
"step": 710
},
{
"entropy": 8.031018495559692,
"epoch": 1.4275724275724275,
"grad_norm": 1.0703125,
"learning_rate": 0.000357,
"loss": 7.5935,
"mean_token_accuracy": 0.11669361963868141,
"num_tokens": 2303606.0,
"step": 715
},
{
"entropy": 8.10855507850647,
"epoch": 1.4375624375624376,
"grad_norm": 0.984375,
"learning_rate": 0.0003595,
"loss": 7.7629,
"mean_token_accuracy": 0.09718288779258728,
"num_tokens": 2320304.0,
"step": 720
},
{
"entropy": 8.033062314987182,
"epoch": 1.4475524475524475,
"grad_norm": 0.87109375,
"learning_rate": 0.000362,
"loss": 7.7269,
"mean_token_accuracy": 0.10353609770536423,
"num_tokens": 2335449.0,
"step": 725
},
{
"entropy": 7.98488302230835,
"epoch": 1.4575424575424576,
"grad_norm": 0.7890625,
"learning_rate": 0.0003645,
"loss": 7.7298,
"mean_token_accuracy": 0.1053438015282154,
"num_tokens": 2350286.0,
"step": 730
},
{
"entropy": 8.084484529495239,
"epoch": 1.4675324675324675,
"grad_norm": 0.83984375,
"learning_rate": 0.000367,
"loss": 7.6562,
"mean_token_accuracy": 0.10364222973585129,
"num_tokens": 2367174.0,
"step": 735
},
{
"entropy": 7.979038953781128,
"epoch": 1.4775224775224776,
"grad_norm": 0.8671875,
"learning_rate": 0.0003695,
"loss": 7.744,
"mean_token_accuracy": 0.09835705384612084,
"num_tokens": 2383379.0,
"step": 740
},
{
"entropy": 7.950644826889038,
"epoch": 1.4875124875124874,
"grad_norm": 0.859375,
"learning_rate": 0.000372,
"loss": 7.6674,
"mean_token_accuracy": 0.10948423892259598,
"num_tokens": 2400055.0,
"step": 745
},
{
"entropy": 7.948536825180054,
"epoch": 1.4975024975024975,
"grad_norm": 0.83203125,
"learning_rate": 0.0003745,
"loss": 7.7088,
"mean_token_accuracy": 0.104210115224123,
"num_tokens": 2415445.0,
"step": 750
},
{
"entropy": 8.104103422164917,
"epoch": 1.5074925074925076,
"grad_norm": 0.9765625,
"learning_rate": 0.000377,
"loss": 7.6183,
"mean_token_accuracy": 0.1110638789832592,
"num_tokens": 2431633.0,
"step": 755
},
{
"entropy": 7.9167121887207035,
"epoch": 1.5174825174825175,
"grad_norm": 1.1875,
"learning_rate": 0.0003795,
"loss": 7.6556,
"mean_token_accuracy": 0.10475207418203354,
"num_tokens": 2448053.0,
"step": 760
},
{
"entropy": 8.011196660995484,
"epoch": 1.5274725274725274,
"grad_norm": 0.80859375,
"learning_rate": 0.000382,
"loss": 7.7603,
"mean_token_accuracy": 0.10242786332964897,
"num_tokens": 2464962.0,
"step": 765
},
{
"entropy": 7.854190301895142,
"epoch": 1.5374625374625375,
"grad_norm": 0.8828125,
"learning_rate": 0.0003845,
"loss": 7.6527,
"mean_token_accuracy": 0.10968720018863679,
"num_tokens": 2481728.0,
"step": 770
},
{
"entropy": 7.93970217704773,
"epoch": 1.5474525474525476,
"grad_norm": 0.84765625,
"learning_rate": 0.00038700000000000003,
"loss": 7.6644,
"mean_token_accuracy": 0.10697980225086212,
"num_tokens": 2498249.0,
"step": 775
},
{
"entropy": 7.971722221374511,
"epoch": 1.5574425574425574,
"grad_norm": 0.98828125,
"learning_rate": 0.00038950000000000003,
"loss": 7.6869,
"mean_token_accuracy": 0.10662917494773864,
"num_tokens": 2512832.0,
"step": 780
},
{
"entropy": 8.0352463722229,
"epoch": 1.5674325674325673,
"grad_norm": 0.734375,
"learning_rate": 0.00039200000000000004,
"loss": 7.8105,
"mean_token_accuracy": 0.09663845226168633,
"num_tokens": 2530065.0,
"step": 785
},
{
"entropy": 7.965973043441773,
"epoch": 1.5774225774225774,
"grad_norm": 0.8359375,
"learning_rate": 0.00039450000000000005,
"loss": 7.6293,
"mean_token_accuracy": 0.1142218291759491,
"num_tokens": 2546812.0,
"step": 790
},
{
"entropy": 7.914030504226685,
"epoch": 1.5874125874125875,
"grad_norm": 0.76171875,
"learning_rate": 0.00039700000000000005,
"loss": 7.5985,
"mean_token_accuracy": 0.10844378024339676,
"num_tokens": 2562955.0,
"step": 795
},
{
"entropy": 7.9991395473480225,
"epoch": 1.5974025974025974,
"grad_norm": 0.92578125,
"learning_rate": 0.0003995,
"loss": 7.636,
"mean_token_accuracy": 0.10216034278273582,
"num_tokens": 2577644.0,
"step": 800
},
{
"entropy": 7.804229784011841,
"epoch": 1.6073926073926073,
"grad_norm": 0.8515625,
"learning_rate": 0.000402,
"loss": 7.479,
"mean_token_accuracy": 0.11868006139993667,
"num_tokens": 2592888.0,
"step": 805
},
{
"entropy": 7.826851224899292,
"epoch": 1.6173826173826173,
"grad_norm": 0.828125,
"learning_rate": 0.0004045,
"loss": 7.5642,
"mean_token_accuracy": 0.10893830135464669,
"num_tokens": 2610352.0,
"step": 810
},
{
"entropy": 7.878586292266846,
"epoch": 1.6273726273726274,
"grad_norm": 0.90625,
"learning_rate": 0.00040699999999999997,
"loss": 7.5595,
"mean_token_accuracy": 0.10943539440631866,
"num_tokens": 2626850.0,
"step": 815
},
{
"entropy": 7.843348503112793,
"epoch": 1.6373626373626373,
"grad_norm": 0.90234375,
"learning_rate": 0.0004095,
"loss": 7.6166,
"mean_token_accuracy": 0.10784812793135642,
"num_tokens": 2642483.0,
"step": 820
},
{
"entropy": 7.896633672714233,
"epoch": 1.6473526473526472,
"grad_norm": 0.75390625,
"learning_rate": 0.000412,
"loss": 7.6682,
"mean_token_accuracy": 0.10058582201600075,
"num_tokens": 2658801.0,
"step": 825
},
{
"entropy": 7.992334079742432,
"epoch": 1.6573426573426573,
"grad_norm": 0.84765625,
"learning_rate": 0.0004145,
"loss": 7.6181,
"mean_token_accuracy": 0.10562084466218949,
"num_tokens": 2674320.0,
"step": 830
},
{
"entropy": 7.871245288848877,
"epoch": 1.6673326673326674,
"grad_norm": 0.84765625,
"learning_rate": 0.000417,
"loss": 7.5569,
"mean_token_accuracy": 0.1130405493080616,
"num_tokens": 2691468.0,
"step": 835
},
{
"entropy": 7.854435968399048,
"epoch": 1.6773226773226773,
"grad_norm": 0.8515625,
"learning_rate": 0.0004195,
"loss": 7.6132,
"mean_token_accuracy": 0.10280844122171402,
"num_tokens": 2707795.0,
"step": 840
},
{
"entropy": 7.798345613479614,
"epoch": 1.6873126873126874,
"grad_norm": 0.82421875,
"learning_rate": 0.000422,
"loss": 7.4358,
"mean_token_accuracy": 0.12156035900115966,
"num_tokens": 2725406.0,
"step": 845
},
{
"entropy": 7.71482892036438,
"epoch": 1.6973026973026974,
"grad_norm": 0.9453125,
"learning_rate": 0.0004245,
"loss": 7.487,
"mean_token_accuracy": 0.11422280594706535,
"num_tokens": 2741080.0,
"step": 850
},
{
"entropy": 8.022317790985108,
"epoch": 1.7072927072927073,
"grad_norm": 0.87890625,
"learning_rate": 0.000427,
"loss": 7.6872,
"mean_token_accuracy": 0.10234800577163697,
"num_tokens": 2758052.0,
"step": 855
},
{
"entropy": 7.710728740692138,
"epoch": 1.7172827172827172,
"grad_norm": 0.859375,
"learning_rate": 0.0004295,
"loss": 7.5718,
"mean_token_accuracy": 0.10922266095876694,
"num_tokens": 2775414.0,
"step": 860
},
{
"entropy": 7.858629941940308,
"epoch": 1.7272727272727273,
"grad_norm": 0.9296875,
"learning_rate": 0.000432,
"loss": 7.6087,
"mean_token_accuracy": 0.10396021082997323,
"num_tokens": 2792333.0,
"step": 865
},
{
"entropy": 7.944055700302124,
"epoch": 1.7372627372627374,
"grad_norm": 0.8046875,
"learning_rate": 0.0004345,
"loss": 7.7243,
"mean_token_accuracy": 0.10027192905545235,
"num_tokens": 2807792.0,
"step": 870
},
{
"entropy": 7.910960578918457,
"epoch": 1.7472527472527473,
"grad_norm": 0.86328125,
"learning_rate": 0.000437,
"loss": 7.6288,
"mean_token_accuracy": 0.10449600145220757,
"num_tokens": 2823819.0,
"step": 875
},
{
"entropy": 7.87107138633728,
"epoch": 1.7572427572427571,
"grad_norm": 0.8671875,
"learning_rate": 0.0004395,
"loss": 7.6212,
"mean_token_accuracy": 0.10314707756042481,
"num_tokens": 2840026.0,
"step": 880
},
{
"entropy": 7.746200895309448,
"epoch": 1.7672327672327672,
"grad_norm": 0.765625,
"learning_rate": 0.000442,
"loss": 7.4546,
"mean_token_accuracy": 0.11674722135066987,
"num_tokens": 2857041.0,
"step": 885
},
{
"entropy": 7.842999696731567,
"epoch": 1.7772227772227773,
"grad_norm": 0.82421875,
"learning_rate": 0.0004445,
"loss": 7.5113,
"mean_token_accuracy": 0.11269463673233986,
"num_tokens": 2871815.0,
"step": 890
},
{
"entropy": 7.798826599121094,
"epoch": 1.7872127872127872,
"grad_norm": 0.92578125,
"learning_rate": 0.000447,
"loss": 7.5082,
"mean_token_accuracy": 0.1110450305044651,
"num_tokens": 2888902.0,
"step": 895
},
{
"entropy": 7.773666000366211,
"epoch": 1.797202797202797,
"grad_norm": 0.921875,
"learning_rate": 0.00044950000000000003,
"loss": 7.5503,
"mean_token_accuracy": 0.10609947964549064,
"num_tokens": 2905536.0,
"step": 900
},
{
"entropy": 7.787226724624634,
"epoch": 1.8071928071928072,
"grad_norm": 0.79296875,
"learning_rate": 0.00045200000000000004,
"loss": 7.5587,
"mean_token_accuracy": 0.11197240501642228,
"num_tokens": 2922542.0,
"step": 905
},
{
"entropy": 7.839496898651123,
"epoch": 1.8171828171828173,
"grad_norm": 0.859375,
"learning_rate": 0.00045450000000000004,
"loss": 7.5326,
"mean_token_accuracy": 0.11128943562507629,
"num_tokens": 2937418.0,
"step": 910
},
{
"entropy": 7.7856128215789795,
"epoch": 1.8271728271728271,
"grad_norm": 0.77734375,
"learning_rate": 0.00045700000000000005,
"loss": 7.5355,
"mean_token_accuracy": 0.10546828433871269,
"num_tokens": 2953989.0,
"step": 915
},
{
"entropy": 7.75637378692627,
"epoch": 1.837162837162837,
"grad_norm": 0.87109375,
"learning_rate": 0.00045950000000000006,
"loss": 7.5363,
"mean_token_accuracy": 0.10771389603614807,
"num_tokens": 2970438.0,
"step": 920
},
{
"entropy": 7.8310833930969235,
"epoch": 1.847152847152847,
"grad_norm": 0.90234375,
"learning_rate": 0.000462,
"loss": 7.5979,
"mean_token_accuracy": 0.10760430172085762,
"num_tokens": 2986349.0,
"step": 925
},
{
"entropy": 7.7756389617919925,
"epoch": 1.8571428571428572,
"grad_norm": 0.8046875,
"learning_rate": 0.0004645,
"loss": 7.5186,
"mean_token_accuracy": 0.10492026805877686,
"num_tokens": 3002199.0,
"step": 930
},
{
"entropy": 7.850647354125977,
"epoch": 1.867132867132867,
"grad_norm": 0.890625,
"learning_rate": 0.000467,
"loss": 7.574,
"mean_token_accuracy": 0.10573839843273163,
"num_tokens": 3019724.0,
"step": 935
},
{
"entropy": 7.758398199081421,
"epoch": 1.8771228771228772,
"grad_norm": 1.75,
"learning_rate": 0.0004695,
"loss": 7.4861,
"mean_token_accuracy": 0.11178312376141548,
"num_tokens": 3036033.0,
"step": 940
},
{
"entropy": 7.733203649520874,
"epoch": 1.8871128871128873,
"grad_norm": 0.84765625,
"learning_rate": 0.000472,
"loss": 7.5057,
"mean_token_accuracy": 0.10797822251915931,
"num_tokens": 3050535.0,
"step": 945
},
{
"entropy": 7.606766033172607,
"epoch": 1.8971028971028971,
"grad_norm": 0.83984375,
"learning_rate": 0.0004745,
"loss": 7.4241,
"mean_token_accuracy": 0.11418468505144119,
"num_tokens": 3067487.0,
"step": 950
},
{
"entropy": 7.811316347122192,
"epoch": 1.907092907092907,
"grad_norm": 0.78125,
"learning_rate": 0.000477,
"loss": 7.4817,
"mean_token_accuracy": 0.11279602721333504,
"num_tokens": 3083368.0,
"step": 955
},
{
"entropy": 7.764263772964478,
"epoch": 1.9170829170829171,
"grad_norm": 0.8515625,
"learning_rate": 0.0004795,
"loss": 7.5884,
"mean_token_accuracy": 0.0996214747428894,
"num_tokens": 3100158.0,
"step": 960
},
{
"entropy": 7.664905261993408,
"epoch": 1.9270729270729272,
"grad_norm": 0.84375,
"learning_rate": 0.000482,
"loss": 7.3969,
"mean_token_accuracy": 0.11512965932488442,
"num_tokens": 3115996.0,
"step": 965
},
{
"entropy": 7.791405916213989,
"epoch": 1.937062937062937,
"grad_norm": 0.8203125,
"learning_rate": 0.0004845,
"loss": 7.5496,
"mean_token_accuracy": 0.10718825981020927,
"num_tokens": 3133485.0,
"step": 970
},
{
"entropy": 7.791155099868774,
"epoch": 1.947052947052947,
"grad_norm": 0.80859375,
"learning_rate": 0.000487,
"loss": 7.5339,
"mean_token_accuracy": 0.10318816006183625,
"num_tokens": 3149142.0,
"step": 975
},
{
"entropy": 7.657593297958374,
"epoch": 1.957042957042957,
"grad_norm": 0.85546875,
"learning_rate": 0.0004895,
"loss": 7.4259,
"mean_token_accuracy": 0.10956193283200263,
"num_tokens": 3166372.0,
"step": 980
},
{
"entropy": 7.687391233444214,
"epoch": 1.9670329670329672,
"grad_norm": 0.859375,
"learning_rate": 0.000492,
"loss": 7.468,
"mean_token_accuracy": 0.10778944343328475,
"num_tokens": 3183178.0,
"step": 985
},
{
"entropy": 7.7009885787963865,
"epoch": 1.977022977022977,
"grad_norm": 0.8046875,
"learning_rate": 0.0004945,
"loss": 7.4464,
"mean_token_accuracy": 0.10527636632323265,
"num_tokens": 3198857.0,
"step": 990
},
{
"entropy": 7.761457204818726,
"epoch": 1.987012987012987,
"grad_norm": 0.9765625,
"learning_rate": 0.000497,
"loss": 7.5091,
"mean_token_accuracy": 0.10296362712979316,
"num_tokens": 3214704.0,
"step": 995
},
{
"entropy": 7.7881145000457765,
"epoch": 1.997002997002997,
"grad_norm": 0.8671875,
"learning_rate": 0.0004995,
"loss": 7.5984,
"mean_token_accuracy": 0.10085872560739517,
"num_tokens": 3230647.0,
"step": 1000
},
{
"epoch": 1.997002997002997,
"eval_entropy": 7.486649680782008,
"eval_loss": 7.484090328216553,
"eval_mean_token_accuracy": 0.10077464044899553,
"eval_num_tokens": 3230647.0,
"eval_runtime": 1.1798,
"eval_samples_per_second": 1249.323,
"eval_steps_per_second": 156.801,
"step": 1000
},
{
"entropy": 7.6556399133470325,
"epoch": 2.005994005994006,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999988896704182,
"loss": 7.29,
"mean_token_accuracy": 0.11673381593492296,
"num_tokens": 3244611.0,
"step": 1005
},
{
"entropy": 7.653675556182861,
"epoch": 2.015984015984016,
"grad_norm": 0.796875,
"learning_rate": 0.000499994378975273,
"loss": 7.2449,
"mean_token_accuracy": 0.11277795657515526,
"num_tokens": 3261376.0,
"step": 1010
},
{
"entropy": 7.695202302932739,
"epoch": 2.0259740259740258,
"grad_norm": 0.8515625,
"learning_rate": 0.0004999863985884728,
"loss": 7.2594,
"mean_token_accuracy": 0.11385115906596184,
"num_tokens": 3279410.0,
"step": 1015
},
{
"entropy": 7.74162712097168,
"epoch": 2.035964035964036,
"grad_norm": 1.1015625,
"learning_rate": 0.000499974948633085,
"loss": 7.2755,
"mean_token_accuracy": 0.10692020803689957,
"num_tokens": 3296012.0,
"step": 1020
},
{
"entropy": 7.66200361251831,
"epoch": 2.045954045954046,
"grad_norm": 0.90234375,
"learning_rate": 0.000499960029285682,
"loss": 7.3217,
"mean_token_accuracy": 0.10635951608419418,
"num_tokens": 3311851.0,
"step": 1025
},
{
"entropy": 7.610789680480957,
"epoch": 2.055944055944056,
"grad_norm": 0.79296875,
"learning_rate": 0.0004999416407763387,
"loss": 7.2673,
"mean_token_accuracy": 0.1137266606092453,
"num_tokens": 3328590.0,
"step": 1030
},
{
"entropy": 7.579310369491577,
"epoch": 2.065934065934066,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999197833886285,
"loss": 7.141,
"mean_token_accuracy": 0.11897332966327667,
"num_tokens": 3345266.0,
"step": 1035
},
{
"entropy": 7.628687334060669,
"epoch": 2.075924075924076,
"grad_norm": 0.859375,
"learning_rate": 0.0004998944574596196,
"loss": 7.2871,
"mean_token_accuracy": 0.11039503365755081,
"num_tokens": 3361141.0,
"step": 1040
},
{
"entropy": 7.602729368209839,
"epoch": 2.085914085914086,
"grad_norm": 0.87109375,
"learning_rate": 0.0004998656633798689,
"loss": 7.1797,
"mean_token_accuracy": 0.11323749721050262,
"num_tokens": 3377710.0,
"step": 1045
},
{
"entropy": 7.550437688827515,
"epoch": 2.0959040959040958,
"grad_norm": 0.9140625,
"learning_rate": 0.0004998334015934169,
"loss": 7.285,
"mean_token_accuracy": 0.11525188460946083,
"num_tokens": 3392504.0,
"step": 1050
},
{
"entropy": 7.673173427581787,
"epoch": 2.105894105894106,
"grad_norm": 0.828125,
"learning_rate": 0.0004997976725977802,
"loss": 7.3127,
"mean_token_accuracy": 0.10556894540786743,
"num_tokens": 3409907.0,
"step": 1055
},
{
"entropy": 7.63333158493042,
"epoch": 2.115884115884116,
"grad_norm": 0.76953125,
"learning_rate": 0.000499758476943944,
"loss": 7.225,
"mean_token_accuracy": 0.11469244211912155,
"num_tokens": 3426681.0,
"step": 1060
},
{
"entropy": 7.532991075515747,
"epoch": 2.125874125874126,
"grad_norm": 0.8828125,
"learning_rate": 0.000499715815236354,
"loss": 7.2308,
"mean_token_accuracy": 0.11743310615420341,
"num_tokens": 3441537.0,
"step": 1065
},
{
"entropy": 7.663446712493896,
"epoch": 2.1358641358641357,
"grad_norm": 0.75,
"learning_rate": 0.0004996696881329063,
"loss": 7.2799,
"mean_token_accuracy": 0.10578939393162727,
"num_tokens": 3458262.0,
"step": 1070
},
{
"entropy": 7.667473649978637,
"epoch": 2.145854145854146,
"grad_norm": 0.8515625,
"learning_rate": 0.000499620096344938,
"loss": 7.3362,
"mean_token_accuracy": 0.10832573622465133,
"num_tokens": 3473982.0,
"step": 1075
},
{
"entropy": 7.614191579818725,
"epoch": 2.155844155844156,
"grad_norm": 0.9296875,
"learning_rate": 0.0004995670406372157,
"loss": 7.2587,
"mean_token_accuracy": 0.11001512333750725,
"num_tokens": 3489555.0,
"step": 1080
},
{
"entropy": 7.515730094909668,
"epoch": 2.1658341658341658,
"grad_norm": 0.77734375,
"learning_rate": 0.0004995105218279244,
"loss": 7.2139,
"mean_token_accuracy": 0.11276560798287391,
"num_tokens": 3506482.0,
"step": 1085
},
{
"entropy": 7.633500576019287,
"epoch": 2.1758241758241756,
"grad_norm": 0.8515625,
"learning_rate": 0.0004994505407886536,
"loss": 7.2319,
"mean_token_accuracy": 0.11254712715744972,
"num_tokens": 3521621.0,
"step": 1090
},
{
"entropy": 7.513222789764404,
"epoch": 2.185814185814186,
"grad_norm": 0.875,
"learning_rate": 0.0004993870984443854,
"loss": 7.1932,
"mean_token_accuracy": 0.11704366132616997,
"num_tokens": 3537485.0,
"step": 1095
},
{
"entropy": 7.469144868850708,
"epoch": 2.195804195804196,
"grad_norm": 1.0,
"learning_rate": 0.0004993201957734791,
"loss": 7.0765,
"mean_token_accuracy": 0.13212940245866775,
"num_tokens": 3553655.0,
"step": 1100
},
{
"entropy": 7.512252330780029,
"epoch": 2.2057942057942057,
"grad_norm": 0.81640625,
"learning_rate": 0.0004992498338076567,
"loss": 7.1613,
"mean_token_accuracy": 0.11379173919558525,
"num_tokens": 3568923.0,
"step": 1105
},
{
"entropy": 7.605458927154541,
"epoch": 2.2157842157842156,
"grad_norm": 0.86328125,
"learning_rate": 0.0004991760136319869,
"loss": 7.2288,
"mean_token_accuracy": 0.11029125973582268,
"num_tokens": 3585133.0,
"step": 1110
},
{
"entropy": 7.509175157546997,
"epoch": 2.225774225774226,
"grad_norm": 0.86328125,
"learning_rate": 0.0004990987363848678,
"loss": 7.279,
"mean_token_accuracy": 0.10764828473329544,
"num_tokens": 3600494.0,
"step": 1115
},
{
"entropy": 7.560824632644653,
"epoch": 2.2357642357642358,
"grad_norm": 0.86328125,
"learning_rate": 0.0004990180032580105,
"loss": 7.2435,
"mean_token_accuracy": 0.11270277500152588,
"num_tokens": 3615255.0,
"step": 1120
},
{
"entropy": 7.499869775772095,
"epoch": 2.2457542457542456,
"grad_norm": 0.765625,
"learning_rate": 0.0004989338154964194,
"loss": 7.2064,
"mean_token_accuracy": 0.11745749786496162,
"num_tokens": 3632558.0,
"step": 1125
},
{
"entropy": 7.446692943572998,
"epoch": 2.255744255744256,
"grad_norm": 0.86328125,
"learning_rate": 0.000498846174398374,
"loss": 7.1456,
"mean_token_accuracy": 0.11962621659040451,
"num_tokens": 3649348.0,
"step": 1130
},
{
"entropy": 7.542574071884156,
"epoch": 2.265734265734266,
"grad_norm": 0.7734375,
"learning_rate": 0.0004987550813154086,
"loss": 7.2743,
"mean_token_accuracy": 0.1114236980676651,
"num_tokens": 3665180.0,
"step": 1135
},
{
"entropy": 7.534678602218628,
"epoch": 2.2757242757242757,
"grad_norm": 0.75,
"learning_rate": 0.0004986605376522912,
"loss": 7.2108,
"mean_token_accuracy": 0.11057249754667282,
"num_tokens": 3682680.0,
"step": 1140
},
{
"entropy": 7.5682820796966555,
"epoch": 2.2857142857142856,
"grad_norm": 0.8046875,
"learning_rate": 0.0004985625448670019,
"loss": 7.3165,
"mean_token_accuracy": 0.104947979003191,
"num_tokens": 3698807.0,
"step": 1145
},
{
"entropy": 7.427041101455688,
"epoch": 2.2957042957042955,
"grad_norm": 0.875,
"learning_rate": 0.0004984611044707108,
"loss": 7.1514,
"mean_token_accuracy": 0.12294234782457351,
"num_tokens": 3714408.0,
"step": 1150
},
{
"entropy": 7.46859130859375,
"epoch": 2.305694305694306,
"grad_norm": 0.84375,
"learning_rate": 0.0004983562180277541,
"loss": 7.2044,
"mean_token_accuracy": 0.11968692690134049,
"num_tokens": 3729290.0,
"step": 1155
},
{
"entropy": 7.515849208831787,
"epoch": 2.3156843156843157,
"grad_norm": 0.828125,
"learning_rate": 0.0004982478871556107,
"loss": 7.201,
"mean_token_accuracy": 0.12022968605160714,
"num_tokens": 3746501.0,
"step": 1160
},
{
"entropy": 7.499651145935059,
"epoch": 2.3256743256743255,
"grad_norm": 0.97265625,
"learning_rate": 0.0004981361135248767,
"loss": 7.2576,
"mean_token_accuracy": 0.11078106462955475,
"num_tokens": 3762194.0,
"step": 1165
},
{
"entropy": 7.601353788375855,
"epoch": 2.335664335664336,
"grad_norm": 0.75,
"learning_rate": 0.0004980208988592395,
"loss": 7.2088,
"mean_token_accuracy": 0.11249012053012848,
"num_tokens": 3779048.0,
"step": 1170
},
{
"entropy": 7.40687837600708,
"epoch": 2.3456543456543457,
"grad_norm": 0.76953125,
"learning_rate": 0.000497902244935452,
"loss": 7.1122,
"mean_token_accuracy": 0.12347386628389359,
"num_tokens": 3797865.0,
"step": 1175
},
{
"entropy": 7.581765508651733,
"epoch": 2.3556443556443556,
"grad_norm": 0.83203125,
"learning_rate": 0.0004977801535833045,
"loss": 7.1779,
"mean_token_accuracy": 0.11289282962679863,
"num_tokens": 3813050.0,
"step": 1180
},
{
"entropy": 7.5143575191497805,
"epoch": 2.3656343656343655,
"grad_norm": 0.76953125,
"learning_rate": 0.0004976546266855965,
"loss": 7.211,
"mean_token_accuracy": 0.11399794220924378,
"num_tokens": 3830277.0,
"step": 1185
},
{
"entropy": 7.516488695144654,
"epoch": 2.375624375624376,
"grad_norm": 0.921875,
"learning_rate": 0.0004975256661781082,
"loss": 7.3304,
"mean_token_accuracy": 0.10547359213232994,
"num_tokens": 3847221.0,
"step": 1190
},
{
"entropy": 7.528147983551025,
"epoch": 2.3856143856143857,
"grad_norm": 0.7421875,
"learning_rate": 0.0004973932740495701,
"loss": 7.2484,
"mean_token_accuracy": 0.10972600281238556,
"num_tokens": 3864601.0,
"step": 1195
},
{
"entropy": 7.4062048435211185,
"epoch": 2.3956043956043955,
"grad_norm": 0.79296875,
"learning_rate": 0.0004972574523416325,
"loss": 7.1501,
"mean_token_accuracy": 0.11819778755307198,
"num_tokens": 3881592.0,
"step": 1200
},
{
"entropy": 7.444576835632324,
"epoch": 2.4055944055944054,
"grad_norm": 0.77734375,
"learning_rate": 0.0004971182031488343,
"loss": 6.993,
"mean_token_accuracy": 0.1232140153646469,
"num_tokens": 3897334.0,
"step": 1205
},
{
"entropy": 7.580482769012451,
"epoch": 2.4155844155844157,
"grad_norm": 0.796875,
"learning_rate": 0.0004969755286185703,
"loss": 7.3508,
"mean_token_accuracy": 0.10700739026069642,
"num_tokens": 3913001.0,
"step": 1210
},
{
"entropy": 7.3618980884552006,
"epoch": 2.4255744255744256,
"grad_norm": 0.8828125,
"learning_rate": 0.0004968294309510582,
"loss": 7.0278,
"mean_token_accuracy": 0.12532524466514589,
"num_tokens": 3928884.0,
"step": 1215
},
{
"entropy": 7.436668968200683,
"epoch": 2.4355644355644355,
"grad_norm": 0.9375,
"learning_rate": 0.0004966799123993049,
"loss": 7.1698,
"mean_token_accuracy": 0.11884979307651519,
"num_tokens": 3944998.0,
"step": 1220
},
{
"entropy": 7.505033302307129,
"epoch": 2.4455544455544453,
"grad_norm": 0.8203125,
"learning_rate": 0.0004965269752690713,
"loss": 7.2213,
"mean_token_accuracy": 0.11796300038695336,
"num_tokens": 3960650.0,
"step": 1225
},
{
"entropy": 7.496581268310547,
"epoch": 2.4555444555444557,
"grad_norm": 0.8203125,
"learning_rate": 0.0004963706219188371,
"loss": 7.2368,
"mean_token_accuracy": 0.11497806310653687,
"num_tokens": 3976718.0,
"step": 1230
},
{
"entropy": 7.4178626537323,
"epoch": 2.4655344655344655,
"grad_norm": 0.90625,
"learning_rate": 0.0004962108547597643,
"loss": 7.2299,
"mean_token_accuracy": 0.11304686814546586,
"num_tokens": 3991637.0,
"step": 1235
},
{
"entropy": 7.496812868118286,
"epoch": 2.4755244755244754,
"grad_norm": 1.234375,
"learning_rate": 0.0004960476762556604,
"loss": 7.1167,
"mean_token_accuracy": 0.11393559798598289,
"num_tokens": 4007493.0,
"step": 1240
},
{
"entropy": 7.37399730682373,
"epoch": 2.4855144855144857,
"grad_norm": 0.890625,
"learning_rate": 0.0004958810889229397,
"loss": 7.1558,
"mean_token_accuracy": 0.11833534240722657,
"num_tokens": 4022983.0,
"step": 1245
},
{
"entropy": 7.5273942947387695,
"epoch": 2.4955044955044956,
"grad_norm": 0.8515625,
"learning_rate": 0.0004957110953305849,
"loss": 7.2263,
"mean_token_accuracy": 0.11028133109211921,
"num_tokens": 4038559.0,
"step": 1250
},
{
"entropy": 7.440155124664306,
"epoch": 2.5054945054945055,
"grad_norm": 0.8046875,
"learning_rate": 0.0004955376981001076,
"loss": 7.1248,
"mean_token_accuracy": 0.1180120624601841,
"num_tokens": 4054340.0,
"step": 1255
},
{
"entropy": 7.443907403945923,
"epoch": 2.5154845154845153,
"grad_norm": 0.73046875,
"learning_rate": 0.0004953608999055073,
"loss": 7.2768,
"mean_token_accuracy": 0.12213831841945648,
"num_tokens": 4070874.0,
"step": 1260
},
{
"entropy": 7.441350984573364,
"epoch": 2.5254745254745252,
"grad_norm": 0.82421875,
"learning_rate": 0.0004951807034732313,
"loss": 7.1956,
"mean_token_accuracy": 0.11365060582756996,
"num_tokens": 4087260.0,
"step": 1265
},
{
"entropy": 7.531669092178345,
"epoch": 2.5354645354645355,
"grad_norm": 0.85546875,
"learning_rate": 0.0004949971115821311,
"loss": 7.1972,
"mean_token_accuracy": 0.11016765534877777,
"num_tokens": 4103304.0,
"step": 1270
},
{
"entropy": 7.416958332061768,
"epoch": 2.5454545454545454,
"grad_norm": 0.83984375,
"learning_rate": 0.000494810127063421,
"loss": 7.1911,
"mean_token_accuracy": 0.11271554231643677,
"num_tokens": 4118386.0,
"step": 1275
},
{
"entropy": 7.376313781738281,
"epoch": 2.5554445554445553,
"grad_norm": 0.83203125,
"learning_rate": 0.0004946197528006335,
"loss": 7.1907,
"mean_token_accuracy": 0.11462600603699684,
"num_tokens": 4136240.0,
"step": 1280
},
{
"entropy": 7.443999099731445,
"epoch": 2.5654345654345656,
"grad_norm": 1.1875,
"learning_rate": 0.0004944259917295752,
"loss": 7.0267,
"mean_token_accuracy": 0.12695256918668746,
"num_tokens": 4152756.0,
"step": 1285
},
{
"entropy": 7.382719278335571,
"epoch": 2.5754245754245755,
"grad_norm": 0.78515625,
"learning_rate": 0.0004942288468382818,
"loss": 7.2156,
"mean_token_accuracy": 0.11339443400502205,
"num_tokens": 4169482.0,
"step": 1290
},
{
"entropy": 7.495740270614624,
"epoch": 2.5854145854145854,
"grad_norm": 0.953125,
"learning_rate": 0.000494028321166971,
"loss": 7.1848,
"mean_token_accuracy": 0.11903136670589447,
"num_tokens": 4184571.0,
"step": 1295
},
{
"entropy": 7.405131435394287,
"epoch": 2.5954045954045952,
"grad_norm": 0.828125,
"learning_rate": 0.000493824417807997,
"loss": 7.088,
"mean_token_accuracy": 0.11924583464860916,
"num_tokens": 4199725.0,
"step": 1300
},
{
"entropy": 7.374294948577881,
"epoch": 2.6053946053946055,
"grad_norm": 0.78125,
"learning_rate": 0.0004936171399058017,
"loss": 7.1561,
"mean_token_accuracy": 0.11412992551922799,
"num_tokens": 4216309.0,
"step": 1305
},
{
"entropy": 7.4032941341400145,
"epoch": 2.6153846153846154,
"grad_norm": 0.81640625,
"learning_rate": 0.0004934064906568668,
"loss": 7.1233,
"mean_token_accuracy": 0.11502180323004722,
"num_tokens": 4230699.0,
"step": 1310
},
{
"entropy": 7.350087738037109,
"epoch": 2.6253746253746253,
"grad_norm": 0.8046875,
"learning_rate": 0.0004931924733096642,
"loss": 7.0452,
"mean_token_accuracy": 0.12624117210507393,
"num_tokens": 4248243.0,
"step": 1315
},
{
"entropy": 7.364322996139526,
"epoch": 2.6353646353646356,
"grad_norm": 0.8203125,
"learning_rate": 0.0004929750911646063,
"loss": 7.2285,
"mean_token_accuracy": 0.11374544575810433,
"num_tokens": 4265412.0,
"step": 1320
},
{
"entropy": 7.47800087928772,
"epoch": 2.6453546453546455,
"grad_norm": 0.79296875,
"learning_rate": 0.0004927543475739947,
"loss": 7.1683,
"mean_token_accuracy": 0.10902340710163116,
"num_tokens": 4281230.0,
"step": 1325
},
{
"entropy": 7.408435869216919,
"epoch": 2.6553446553446554,
"grad_norm": 0.82421875,
"learning_rate": 0.0004925302459419686,
"loss": 7.2304,
"mean_token_accuracy": 0.11668918058276176,
"num_tokens": 4297593.0,
"step": 1330
},
{
"entropy": 7.357152318954467,
"epoch": 2.6653346653346652,
"grad_norm": 0.6875,
"learning_rate": 0.0004923027897244524,
"loss": 7.1477,
"mean_token_accuracy": 0.11671698242425918,
"num_tokens": 4314370.0,
"step": 1335
},
{
"entropy": 7.425278186798096,
"epoch": 2.675324675324675,
"grad_norm": 0.79296875,
"learning_rate": 0.0004920719824291022,
"loss": 7.1329,
"mean_token_accuracy": 0.12105752229690551,
"num_tokens": 4329867.0,
"step": 1340
},
{
"entropy": 7.410067939758301,
"epoch": 2.6853146853146854,
"grad_norm": 0.86328125,
"learning_rate": 0.0004918378276152522,
"loss": 7.1883,
"mean_token_accuracy": 0.11553000509738923,
"num_tokens": 4346849.0,
"step": 1345
},
{
"entropy": 7.3710705757141115,
"epoch": 2.6953046953046953,
"grad_norm": 0.828125,
"learning_rate": 0.0004916003288938592,
"loss": 7.1308,
"mean_token_accuracy": 0.12287419214844704,
"num_tokens": 4362591.0,
"step": 1350
},
{
"entropy": 7.361244201660156,
"epoch": 2.705294705294705,
"grad_norm": 0.81640625,
"learning_rate": 0.0004913594899274474,
"loss": 7.0903,
"mean_token_accuracy": 0.12431644871830941,
"num_tokens": 4378703.0,
"step": 1355
},
{
"entropy": 7.40083589553833,
"epoch": 2.7152847152847155,
"grad_norm": 0.85546875,
"learning_rate": 0.0004911153144300515,
"loss": 7.2019,
"mean_token_accuracy": 0.11094269454479218,
"num_tokens": 4394967.0,
"step": 1360
},
{
"entropy": 7.332432651519776,
"epoch": 2.7252747252747254,
"grad_norm": 0.87890625,
"learning_rate": 0.0004908678061671597,
"loss": 7.0549,
"mean_token_accuracy": 0.12529401928186418,
"num_tokens": 4411373.0,
"step": 1365
},
{
"entropy": 7.3352560043334964,
"epoch": 2.7352647352647352,
"grad_norm": 0.79296875,
"learning_rate": 0.0004906169689556557,
"loss": 6.9679,
"mean_token_accuracy": 0.129734043776989,
"num_tokens": 4427681.0,
"step": 1370
},
{
"entropy": 7.2624828815460205,
"epoch": 2.745254745254745,
"grad_norm": 0.84765625,
"learning_rate": 0.0004903628066637594,
"loss": 7.077,
"mean_token_accuracy": 0.12157689854502678,
"num_tokens": 4443423.0,
"step": 1375
},
{
"entropy": 7.387901639938354,
"epoch": 2.755244755244755,
"grad_norm": 0.8203125,
"learning_rate": 0.0004901053232109679,
"loss": 7.1599,
"mean_token_accuracy": 0.10635504648089408,
"num_tokens": 4460698.0,
"step": 1380
},
{
"entropy": 7.348285722732544,
"epoch": 2.7652347652347653,
"grad_norm": 0.99609375,
"learning_rate": 0.0004898445225679948,
"loss": 7.0845,
"mean_token_accuracy": 0.11898298934102058,
"num_tokens": 4475307.0,
"step": 1385
},
{
"entropy": 7.374725580215454,
"epoch": 2.775224775224775,
"grad_norm": 0.75,
"learning_rate": 0.000489580408756708,
"loss": 7.1782,
"mean_token_accuracy": 0.11079153269529343,
"num_tokens": 4492766.0,
"step": 1390
},
{
"entropy": 7.394331741333008,
"epoch": 2.785214785214785,
"grad_norm": 0.81640625,
"learning_rate": 0.0004893129858500699,
"loss": 7.1781,
"mean_token_accuracy": 0.11092816591262818,
"num_tokens": 4508446.0,
"step": 1395
},
{
"entropy": 7.364388179779053,
"epoch": 2.7952047952047954,
"grad_norm": 0.74609375,
"learning_rate": 0.0004890422579720722,
"loss": 7.1235,
"mean_token_accuracy": 0.11798743531107903,
"num_tokens": 4525208.0,
"step": 1400
},
{
"entropy": 7.394073629379273,
"epoch": 2.8051948051948052,
"grad_norm": 0.85546875,
"learning_rate": 0.0004887682292976736,
"loss": 7.0839,
"mean_token_accuracy": 0.12236481755971909,
"num_tokens": 4541638.0,
"step": 1405
},
{
"entropy": 7.301909923553467,
"epoch": 2.815184815184815,
"grad_norm": 0.8125,
"learning_rate": 0.0004884909040527355,
"loss": 7.1186,
"mean_token_accuracy": 0.11743888035416603,
"num_tokens": 4557541.0,
"step": 1410
},
{
"entropy": 7.287791633605957,
"epoch": 2.825174825174825,
"grad_norm": 0.83984375,
"learning_rate": 0.000488210286513956,
"loss": 6.9349,
"mean_token_accuracy": 0.12849488556385041,
"num_tokens": 4573658.0,
"step": 1415
},
{
"entropy": 7.36132926940918,
"epoch": 2.8351648351648353,
"grad_norm": 0.90625,
"learning_rate": 0.00048792638100880487,
"loss": 7.0927,
"mean_token_accuracy": 0.12357950136065483,
"num_tokens": 4587683.0,
"step": 1420
},
{
"entropy": 7.418003797531128,
"epoch": 2.845154845154845,
"grad_norm": 0.92578125,
"learning_rate": 0.00048763919191545607,
"loss": 7.1074,
"mean_token_accuracy": 0.12282117158174514,
"num_tokens": 4603983.0,
"step": 1425
},
{
"entropy": 7.308845472335816,
"epoch": 2.855144855144855,
"grad_norm": 0.73046875,
"learning_rate": 0.0004873487236627208,
"loss": 7.1999,
"mean_token_accuracy": 0.1132714070379734,
"num_tokens": 4620925.0,
"step": 1430
},
{
"entropy": 7.363225841522217,
"epoch": 2.8651348651348654,
"grad_norm": 0.85546875,
"learning_rate": 0.0004870549807299788,
"loss": 7.0209,
"mean_token_accuracy": 0.11996846571564675,
"num_tokens": 4639214.0,
"step": 1435
},
{
"entropy": 7.384830951690674,
"epoch": 2.8751248751248752,
"grad_norm": 0.74609375,
"learning_rate": 0.00048675796764710946,
"loss": 7.2084,
"mean_token_accuracy": 0.11239797696471214,
"num_tokens": 4655289.0,
"step": 1440
},
{
"entropy": 7.336945819854736,
"epoch": 2.885114885114885,
"grad_norm": 0.80078125,
"learning_rate": 0.00048645768899442194,
"loss": 7.1117,
"mean_token_accuracy": 0.10905599966645241,
"num_tokens": 4669773.0,
"step": 1445
},
{
"entropy": 7.397378444671631,
"epoch": 2.895104895104895,
"grad_norm": 0.859375,
"learning_rate": 0.0004861541494025845,
"loss": 7.0236,
"mean_token_accuracy": 0.12204516381025314,
"num_tokens": 4685548.0,
"step": 1450
},
{
"entropy": 7.3122090816497805,
"epoch": 2.905094905094905,
"grad_norm": 0.80859375,
"learning_rate": 0.00048584735355255325,
"loss": 7.1617,
"mean_token_accuracy": 0.10954023897647858,
"num_tokens": 4701784.0,
"step": 1455
},
{
"entropy": 7.368370532989502,
"epoch": 2.915084915084915,
"grad_norm": 0.8515625,
"learning_rate": 0.00048553730617549964,
"loss": 7.1356,
"mean_token_accuracy": 0.11558711975812912,
"num_tokens": 4717140.0,
"step": 1460
},
{
"entropy": 7.350918292999268,
"epoch": 2.925074925074925,
"grad_norm": 0.89453125,
"learning_rate": 0.00048522401205273774,
"loss": 7.1422,
"mean_token_accuracy": 0.11404822468757629,
"num_tokens": 4732369.0,
"step": 1465
},
{
"entropy": 7.320491886138916,
"epoch": 2.935064935064935,
"grad_norm": 0.8359375,
"learning_rate": 0.00048490747601565053,
"loss": 7.0975,
"mean_token_accuracy": 0.11320897936820984,
"num_tokens": 4749723.0,
"step": 1470
},
{
"entropy": 7.263767099380493,
"epoch": 2.9450549450549453,
"grad_norm": 0.74609375,
"learning_rate": 0.00048458770294561526,
"loss": 7.0367,
"mean_token_accuracy": 0.1221166156232357,
"num_tokens": 4765553.0,
"step": 1475
},
{
"entropy": 7.377514219284057,
"epoch": 2.955044955044955,
"grad_norm": 0.8046875,
"learning_rate": 0.0004842646977739283,
"loss": 7.0588,
"mean_token_accuracy": 0.12238560244441032,
"num_tokens": 4781903.0,
"step": 1480
},
{
"entropy": 7.329219675064087,
"epoch": 2.965034965034965,
"grad_norm": 0.796875,
"learning_rate": 0.00048393846548172895,
"loss": 7.0711,
"mean_token_accuracy": 0.12050119936466216,
"num_tokens": 4798075.0,
"step": 1485
},
{
"entropy": 7.306816673278808,
"epoch": 2.975024975024975,
"grad_norm": 0.8359375,
"learning_rate": 0.0004836090110999226,
"loss": 7.0557,
"mean_token_accuracy": 0.1145715981721878,
"num_tokens": 4813257.0,
"step": 1490
},
{
"entropy": 7.298364782333374,
"epoch": 2.9850149850149847,
"grad_norm": 0.796875,
"learning_rate": 0.0004832763397091036,
"loss": 7.054,
"mean_token_accuracy": 0.11942759305238723,
"num_tokens": 4829007.0,
"step": 1495
},
{
"entropy": 7.404904127120972,
"epoch": 2.995004995004995,
"grad_norm": 0.78515625,
"learning_rate": 0.0004829404564394762,
"loss": 7.1255,
"mean_token_accuracy": 0.1147141508758068,
"num_tokens": 4845449.0,
"step": 1500
},
{
"epoch": 2.995004995004995,
"eval_entropy": 7.222840590090365,
"eval_loss": 7.199999809265137,
"eval_mean_token_accuracy": 0.1078420261676247,
"eval_num_tokens": 4845449.0,
"eval_runtime": 1.1727,
"eval_samples_per_second": 1256.93,
"eval_steps_per_second": 157.756,
"step": 1500
},
{
"entropy": 7.309990617964003,
"epoch": 3.003996003996004,
"grad_norm": 0.796875,
"learning_rate": 0.00048260136647077585,
"loss": 6.9455,
"mean_token_accuracy": 0.11805139068100187,
"num_tokens": 4858156.0,
"step": 1505
},
{
"entropy": 7.340683937072754,
"epoch": 3.013986013986014,
"grad_norm": 0.83203125,
"learning_rate": 0.00048225907503218946,
"loss": 6.8138,
"mean_token_accuracy": 0.12144542708992959,
"num_tokens": 4873172.0,
"step": 1510
},
{
"entropy": 7.257332801818848,
"epoch": 3.023976023976024,
"grad_norm": 0.796875,
"learning_rate": 0.00048191358740227444,
"loss": 6.7052,
"mean_token_accuracy": 0.1332525998353958,
"num_tokens": 4890921.0,
"step": 1515
},
{
"entropy": 7.281058216094971,
"epoch": 3.033966033966034,
"grad_norm": 0.78515625,
"learning_rate": 0.0004815649089088774,
"loss": 6.7754,
"mean_token_accuracy": 0.12657968327403069,
"num_tokens": 4905468.0,
"step": 1520
},
{
"entropy": 7.217862558364868,
"epoch": 3.043956043956044,
"grad_norm": 0.79296875,
"learning_rate": 0.00048121304492905204,
"loss": 6.7605,
"mean_token_accuracy": 0.12102149054408073,
"num_tokens": 4922178.0,
"step": 1525
},
{
"entropy": 7.316258478164673,
"epoch": 3.053946053946054,
"grad_norm": 0.84765625,
"learning_rate": 0.0004808580008889762,
"loss": 6.7796,
"mean_token_accuracy": 0.12334605678915977,
"num_tokens": 4937049.0,
"step": 1530
},
{
"entropy": 7.201441478729248,
"epoch": 3.063936063936064,
"grad_norm": 0.828125,
"learning_rate": 0.0004804997822638683,
"loss": 6.773,
"mean_token_accuracy": 0.12532677873969078,
"num_tokens": 4952697.0,
"step": 1535
},
{
"entropy": 7.281438684463501,
"epoch": 3.073926073926074,
"grad_norm": 0.76171875,
"learning_rate": 0.00048013839457790243,
"loss": 6.7791,
"mean_token_accuracy": 0.11991386488080025,
"num_tokens": 4968075.0,
"step": 1540
},
{
"entropy": 7.282547283172607,
"epoch": 3.0839160839160837,
"grad_norm": 0.96875,
"learning_rate": 0.00047977384340412406,
"loss": 6.6729,
"mean_token_accuracy": 0.12937781289219857,
"num_tokens": 4984003.0,
"step": 1545
},
{
"entropy": 7.2246640682220455,
"epoch": 3.093906093906094,
"grad_norm": 1.1484375,
"learning_rate": 0.00047940613436436304,
"loss": 6.7624,
"mean_token_accuracy": 0.12386809512972832,
"num_tokens": 5000054.0,
"step": 1550
},
{
"entropy": 7.20565242767334,
"epoch": 3.103896103896104,
"grad_norm": 0.76171875,
"learning_rate": 0.00047903527312914777,
"loss": 6.6738,
"mean_token_accuracy": 0.12883116900920868,
"num_tokens": 5017097.0,
"step": 1555
},
{
"entropy": 7.172371339797974,
"epoch": 3.113886113886114,
"grad_norm": 0.76171875,
"learning_rate": 0.0004786612654176171,
"loss": 6.7014,
"mean_token_accuracy": 0.12019376754760742,
"num_tokens": 5032868.0,
"step": 1560
},
{
"entropy": 7.188371467590332,
"epoch": 3.1238761238761237,
"grad_norm": 0.91796875,
"learning_rate": 0.00047828411699743284,
"loss": 6.7086,
"mean_token_accuracy": 0.13077392801642418,
"num_tokens": 5049897.0,
"step": 1565
},
{
"entropy": 7.309192419052124,
"epoch": 3.133866133866134,
"grad_norm": 0.80078125,
"learning_rate": 0.00047790383368469003,
"loss": 6.8366,
"mean_token_accuracy": 0.11674531251192093,
"num_tokens": 5065611.0,
"step": 1570
},
{
"entropy": 7.28448896408081,
"epoch": 3.143856143856144,
"grad_norm": 0.84375,
"learning_rate": 0.0004775204213438279,
"loss": 6.8225,
"mean_token_accuracy": 0.12474308311939239,
"num_tokens": 5082059.0,
"step": 1575
},
{
"entropy": 7.264940309524536,
"epoch": 3.1538461538461537,
"grad_norm": 0.8828125,
"learning_rate": 0.0004771338858875389,
"loss": 6.8255,
"mean_token_accuracy": 0.11197493076324463,
"num_tokens": 5097893.0,
"step": 1580
},
{
"entropy": 7.158958482742309,
"epoch": 3.163836163836164,
"grad_norm": 0.87109375,
"learning_rate": 0.0004767442332766781,
"loss": 6.6944,
"mean_token_accuracy": 0.14125925526022912,
"num_tokens": 5116091.0,
"step": 1585
},
{
"entropy": 7.182612323760987,
"epoch": 3.173826173826174,
"grad_norm": 0.8359375,
"learning_rate": 0.0004763514695201706,
"loss": 6.7438,
"mean_token_accuracy": 0.1299310527741909,
"num_tokens": 5132251.0,
"step": 1590
},
{
"entropy": 7.098526906967163,
"epoch": 3.183816183816184,
"grad_norm": 0.90625,
"learning_rate": 0.00047595560067491955,
"loss": 6.6708,
"mean_token_accuracy": 0.13742291927337646,
"num_tokens": 5147909.0,
"step": 1595
},
{
"entropy": 7.198202323913574,
"epoch": 3.1938061938061937,
"grad_norm": 0.94921875,
"learning_rate": 0.0004755566328457122,
"loss": 6.7299,
"mean_token_accuracy": 0.12709784805774688,
"num_tokens": 5163932.0,
"step": 1600
},
{
"entropy": 7.182046699523926,
"epoch": 3.203796203796204,
"grad_norm": 0.80078125,
"learning_rate": 0.0004751545721851261,
"loss": 6.7269,
"mean_token_accuracy": 0.12986161783337594,
"num_tokens": 5180177.0,
"step": 1605
},
{
"entropy": 7.191233539581299,
"epoch": 3.213786213786214,
"grad_norm": 0.83203125,
"learning_rate": 0.0004747494248934338,
"loss": 6.7791,
"mean_token_accuracy": 0.12523868530988694,
"num_tokens": 5195700.0,
"step": 1610
},
{
"entropy": 7.228579568862915,
"epoch": 3.2237762237762237,
"grad_norm": 0.875,
"learning_rate": 0.0004743411972185079,
"loss": 6.7803,
"mean_token_accuracy": 0.12069911062717438,
"num_tokens": 5211333.0,
"step": 1615
},
{
"entropy": 7.109642553329468,
"epoch": 3.2337662337662336,
"grad_norm": 0.8671875,
"learning_rate": 0.0004739298954557241,
"loss": 6.7349,
"mean_token_accuracy": 0.12927734106779099,
"num_tokens": 5227284.0,
"step": 1620
},
{
"entropy": 7.165005779266357,
"epoch": 3.243756243756244,
"grad_norm": 0.8671875,
"learning_rate": 0.0004735155259478645,
"loss": 6.7535,
"mean_token_accuracy": 0.13313452303409576,
"num_tokens": 5243421.0,
"step": 1625
},
{
"entropy": 7.205034351348877,
"epoch": 3.253746253746254,
"grad_norm": 1.046875,
"learning_rate": 0.0004730980950850193,
"loss": 6.8124,
"mean_token_accuracy": 0.12308995798230171,
"num_tokens": 5260635.0,
"step": 1630
},
{
"entropy": 7.242312574386597,
"epoch": 3.2637362637362637,
"grad_norm": 0.92578125,
"learning_rate": 0.000472677609304489,
"loss": 6.8308,
"mean_token_accuracy": 0.12062100619077683,
"num_tokens": 5276940.0,
"step": 1635
},
{
"entropy": 7.175618886947632,
"epoch": 3.2737262737262736,
"grad_norm": 0.8359375,
"learning_rate": 0.00047225407509068434,
"loss": 6.8487,
"mean_token_accuracy": 0.12380371615290642,
"num_tokens": 5292901.0,
"step": 1640
},
{
"entropy": 7.139540910720825,
"epoch": 3.283716283716284,
"grad_norm": 0.921875,
"learning_rate": 0.0004718274989750269,
"loss": 6.6743,
"mean_token_accuracy": 0.12544595673680306,
"num_tokens": 5309142.0,
"step": 1645
},
{
"entropy": 7.211938428878784,
"epoch": 3.2937062937062938,
"grad_norm": 0.921875,
"learning_rate": 0.0004713978875358481,
"loss": 6.8071,
"mean_token_accuracy": 0.1265795908868313,
"num_tokens": 5325647.0,
"step": 1650
},
{
"entropy": 7.0457368850708,
"epoch": 3.3036963036963036,
"grad_norm": 0.80859375,
"learning_rate": 0.00047096524739828773,
"loss": 6.6749,
"mean_token_accuracy": 0.13383058980107307,
"num_tokens": 5343508.0,
"step": 1655
},
{
"entropy": 7.2579505443573,
"epoch": 3.3136863136863135,
"grad_norm": 1.0,
"learning_rate": 0.0004705295852341919,
"loss": 6.8725,
"mean_token_accuracy": 0.11918435022234916,
"num_tokens": 5360304.0,
"step": 1660
},
{
"entropy": 7.1316554069519045,
"epoch": 3.323676323676324,
"grad_norm": 0.93359375,
"learning_rate": 0.00047009090776201025,
"loss": 6.7665,
"mean_token_accuracy": 0.1313614435493946,
"num_tokens": 5375900.0,
"step": 1665
},
{
"entropy": 7.106399965286255,
"epoch": 3.3336663336663337,
"grad_norm": 0.88671875,
"learning_rate": 0.000469649221746692,
"loss": 6.6452,
"mean_token_accuracy": 0.1318917080760002,
"num_tokens": 5392561.0,
"step": 1670
},
{
"entropy": 7.146276998519897,
"epoch": 3.3436563436563436,
"grad_norm": 0.78125,
"learning_rate": 0.00046920453399958183,
"loss": 6.8447,
"mean_token_accuracy": 0.11955956816673279,
"num_tokens": 5408621.0,
"step": 1675
},
{
"entropy": 7.1728660583496096,
"epoch": 3.3536463536463534,
"grad_norm": 0.84375,
"learning_rate": 0.00046875685137831504,
"loss": 6.8166,
"mean_token_accuracy": 0.12094830945134163,
"num_tokens": 5425233.0,
"step": 1680
},
{
"entropy": 7.126680326461792,
"epoch": 3.3636363636363638,
"grad_norm": 0.87109375,
"learning_rate": 0.0004683061807867113,
"loss": 6.7252,
"mean_token_accuracy": 0.12711559012532234,
"num_tokens": 5440711.0,
"step": 1685
},
{
"entropy": 7.179180097579956,
"epoch": 3.3736263736263736,
"grad_norm": 0.86328125,
"learning_rate": 0.00046785252917466876,
"loss": 6.7219,
"mean_token_accuracy": 0.13417968526482582,
"num_tokens": 5456876.0,
"step": 1690
},
{
"entropy": 7.169342565536499,
"epoch": 3.3836163836163835,
"grad_norm": 0.9296875,
"learning_rate": 0.0004673959035380564,
"loss": 6.711,
"mean_token_accuracy": 0.12825691401958467,
"num_tokens": 5471508.0,
"step": 1695
},
{
"entropy": 7.093486499786377,
"epoch": 3.393606393606394,
"grad_norm": 0.82421875,
"learning_rate": 0.0004669363109186065,
"loss": 6.7385,
"mean_token_accuracy": 0.13329153656959533,
"num_tokens": 5487538.0,
"step": 1700
},
{
"entropy": 7.131129884719849,
"epoch": 3.4035964035964037,
"grad_norm": 0.90625,
"learning_rate": 0.0004664737584038057,
"loss": 6.79,
"mean_token_accuracy": 0.12501160874962808,
"num_tokens": 5504743.0,
"step": 1705
},
{
"entropy": 7.080353593826294,
"epoch": 3.4135864135864136,
"grad_norm": 0.86328125,
"learning_rate": 0.000466008253126786,
"loss": 6.7621,
"mean_token_accuracy": 0.12809988111257553,
"num_tokens": 5521316.0,
"step": 1710
},
{
"entropy": 7.203873348236084,
"epoch": 3.4235764235764234,
"grad_norm": 0.86328125,
"learning_rate": 0.00046553980226621467,
"loss": 6.7941,
"mean_token_accuracy": 0.12308660298585891,
"num_tokens": 5537219.0,
"step": 1715
},
{
"entropy": 7.163216590881348,
"epoch": 3.4335664335664333,
"grad_norm": 0.85546875,
"learning_rate": 0.0004650684130461834,
"loss": 6.7394,
"mean_token_accuracy": 0.12020886838436126,
"num_tokens": 5553169.0,
"step": 1720
},
{
"entropy": 7.2141258239746096,
"epoch": 3.4435564435564436,
"grad_norm": 0.921875,
"learning_rate": 0.00046459409273609726,
"loss": 6.8279,
"mean_token_accuracy": 0.12372163832187652,
"num_tokens": 5567737.0,
"step": 1725
},
{
"entropy": 7.132944536209107,
"epoch": 3.4535464535464535,
"grad_norm": 0.8671875,
"learning_rate": 0.0004641168486505621,
"loss": 6.8364,
"mean_token_accuracy": 0.12375331446528434,
"num_tokens": 5582895.0,
"step": 1730
},
{
"entropy": 7.04546890258789,
"epoch": 3.4635364635364634,
"grad_norm": 0.7734375,
"learning_rate": 0.00046363668814927196,
"loss": 6.6477,
"mean_token_accuracy": 0.14077948927879333,
"num_tokens": 5600052.0,
"step": 1735
},
{
"entropy": 7.043627214431763,
"epoch": 3.4735264735264737,
"grad_norm": 0.734375,
"learning_rate": 0.000463153618636896,
"loss": 6.5844,
"mean_token_accuracy": 0.1464115023612976,
"num_tokens": 5616457.0,
"step": 1740
},
{
"entropy": 7.180050802230835,
"epoch": 3.4835164835164836,
"grad_norm": 0.78125,
"learning_rate": 0.00046266764756296353,
"loss": 6.9142,
"mean_token_accuracy": 0.11584651321172715,
"num_tokens": 5633882.0,
"step": 1745
},
{
"entropy": 7.109540557861328,
"epoch": 3.4935064935064934,
"grad_norm": 0.87890625,
"learning_rate": 0.0004621787824217497,
"loss": 6.7533,
"mean_token_accuracy": 0.12787417694926262,
"num_tokens": 5650569.0,
"step": 1750
},
{
"entropy": 7.095486402511597,
"epoch": 3.5034965034965033,
"grad_norm": 0.8515625,
"learning_rate": 0.00046168703075215984,
"loss": 6.7958,
"mean_token_accuracy": 0.12227514982223511,
"num_tokens": 5667246.0,
"step": 1755
},
{
"entropy": 7.170636796951294,
"epoch": 3.5134865134865136,
"grad_norm": 0.8671875,
"learning_rate": 0.00046119240013761296,
"loss": 6.8479,
"mean_token_accuracy": 0.12106348723173141,
"num_tokens": 5683335.0,
"step": 1760
},
{
"entropy": 7.064558315277099,
"epoch": 3.5234765234765235,
"grad_norm": 0.83203125,
"learning_rate": 0.00046069489820592494,
"loss": 6.7356,
"mean_token_accuracy": 0.12260126546025277,
"num_tokens": 5698788.0,
"step": 1765
},
{
"entropy": 7.176153135299683,
"epoch": 3.5334665334665334,
"grad_norm": 0.8515625,
"learning_rate": 0.0004601945326291911,
"loss": 6.6829,
"mean_token_accuracy": 0.13431058302521706,
"num_tokens": 5714442.0,
"step": 1770
},
{
"entropy": 7.022355699539185,
"epoch": 3.5434565434565437,
"grad_norm": 0.79296875,
"learning_rate": 0.0004596913111236676,
"loss": 6.7178,
"mean_token_accuracy": 0.13559423461556436,
"num_tokens": 5732474.0,
"step": 1775
},
{
"entropy": 7.124798107147217,
"epoch": 3.5534465534465536,
"grad_norm": 0.76953125,
"learning_rate": 0.00045918524144965256,
"loss": 6.7885,
"mean_token_accuracy": 0.12556643784046173,
"num_tokens": 5750106.0,
"step": 1780
},
{
"entropy": 7.197141981124878,
"epoch": 3.5634365634365635,
"grad_norm": 0.87890625,
"learning_rate": 0.00045867633141136643,
"loss": 6.7928,
"mean_token_accuracy": 0.12685323283076286,
"num_tokens": 5766190.0,
"step": 1785
},
{
"entropy": 7.097241735458374,
"epoch": 3.5734265734265733,
"grad_norm": 0.90234375,
"learning_rate": 0.0004581645888568314,
"loss": 6.8304,
"mean_token_accuracy": 0.11702406927943229,
"num_tokens": 5781470.0,
"step": 1790
},
{
"entropy": 7.181303644180298,
"epoch": 3.583416583416583,
"grad_norm": 0.80859375,
"learning_rate": 0.000457650021677751,
"loss": 6.8001,
"mean_token_accuracy": 0.12274287939071656,
"num_tokens": 5796113.0,
"step": 1795
},
{
"entropy": 7.104009628295898,
"epoch": 3.5934065934065935,
"grad_norm": 0.890625,
"learning_rate": 0.00045713263780938746,
"loss": 6.7815,
"mean_token_accuracy": 0.12324125319719315,
"num_tokens": 5811353.0,
"step": 1800
},
{
"entropy": 7.124893665313721,
"epoch": 3.6033966033966034,
"grad_norm": 0.84765625,
"learning_rate": 0.00045661244523044004,
"loss": 6.7562,
"mean_token_accuracy": 0.12621590569615365,
"num_tokens": 5827293.0,
"step": 1805
},
{
"entropy": 7.037387800216675,
"epoch": 3.6133866133866133,
"grad_norm": 0.8203125,
"learning_rate": 0.000456089451962922,
"loss": 6.7026,
"mean_token_accuracy": 0.13180168494582176,
"num_tokens": 5842089.0,
"step": 1810
},
{
"entropy": 7.140062618255615,
"epoch": 3.6233766233766236,
"grad_norm": 0.88671875,
"learning_rate": 0.0004555636660720363,
"loss": 6.8578,
"mean_token_accuracy": 0.11671878173947334,
"num_tokens": 5858609.0,
"step": 1815
},
{
"entropy": 7.031110954284668,
"epoch": 3.6333666333666335,
"grad_norm": 0.8671875,
"learning_rate": 0.000455035095666052,
"loss": 6.6328,
"mean_token_accuracy": 0.14110387042164801,
"num_tokens": 5876041.0,
"step": 1820
},
{
"entropy": 6.971533203125,
"epoch": 3.6433566433566433,
"grad_norm": 0.9375,
"learning_rate": 0.00045450374889617845,
"loss": 6.6081,
"mean_token_accuracy": 0.14888231158256532,
"num_tokens": 5892310.0,
"step": 1825
},
{
"entropy": 7.1198341846466064,
"epoch": 3.653346653346653,
"grad_norm": 0.83203125,
"learning_rate": 0.0004539696339564404,
"loss": 6.8253,
"mean_token_accuracy": 0.11925003081560134,
"num_tokens": 5908890.0,
"step": 1830
},
{
"entropy": 7.0790997505187985,
"epoch": 3.663336663336663,
"grad_norm": 0.8828125,
"learning_rate": 0.00045343275908355055,
"loss": 6.6573,
"mean_token_accuracy": 0.1363980256021023,
"num_tokens": 5924277.0,
"step": 1835
},
{
"entropy": 6.964910411834717,
"epoch": 3.6733266733266734,
"grad_norm": 0.80859375,
"learning_rate": 0.00045289313255678386,
"loss": 6.676,
"mean_token_accuracy": 0.1379535473883152,
"num_tokens": 5942177.0,
"step": 1840
},
{
"entropy": 7.128736352920532,
"epoch": 3.6833166833166833,
"grad_norm": 0.90234375,
"learning_rate": 0.000452350762697849,
"loss": 6.7822,
"mean_token_accuracy": 0.11843417510390282,
"num_tokens": 5957797.0,
"step": 1845
},
{
"entropy": 7.127052879333496,
"epoch": 3.693306693306693,
"grad_norm": 0.91796875,
"learning_rate": 0.00045180565787076,
"loss": 6.7712,
"mean_token_accuracy": 0.1192670740187168,
"num_tokens": 5974816.0,
"step": 1850
},
{
"entropy": 7.10209698677063,
"epoch": 3.7032967032967035,
"grad_norm": 0.85546875,
"learning_rate": 0.0004512578264817076,
"loss": 6.7463,
"mean_token_accuracy": 0.1253843389451504,
"num_tokens": 5990247.0,
"step": 1855
},
{
"entropy": 7.069775342941284,
"epoch": 3.7132867132867133,
"grad_norm": 0.93359375,
"learning_rate": 0.00045070727697892954,
"loss": 6.7733,
"mean_token_accuracy": 0.1255517013370991,
"num_tokens": 6007235.0,
"step": 1860
},
{
"entropy": 7.112951135635376,
"epoch": 3.723276723276723,
"grad_norm": 0.84765625,
"learning_rate": 0.00045015401785258034,
"loss": 6.66,
"mean_token_accuracy": 0.135778945684433,
"num_tokens": 6023449.0,
"step": 1865
},
{
"entropy": 7.058276891708374,
"epoch": 3.733266733266733,
"grad_norm": 0.87890625,
"learning_rate": 0.00044959805763459995,
"loss": 6.7356,
"mean_token_accuracy": 0.12650015875697135,
"num_tokens": 6039699.0,
"step": 1870
},
{
"entropy": 7.1094402313232425,
"epoch": 3.7432567432567434,
"grad_norm": 0.86328125,
"learning_rate": 0.00044903940489858274,
"loss": 6.7886,
"mean_token_accuracy": 0.12622693479061126,
"num_tokens": 6055186.0,
"step": 1875
},
{
"entropy": 7.06230583190918,
"epoch": 3.7532467532467533,
"grad_norm": 0.84375,
"learning_rate": 0.00044847806825964505,
"loss": 6.7806,
"mean_token_accuracy": 0.12709858492016793,
"num_tokens": 6070413.0,
"step": 1880
},
{
"entropy": 7.0569939613342285,
"epoch": 3.763236763236763,
"grad_norm": 0.91796875,
"learning_rate": 0.0004479140563742922,
"loss": 6.7905,
"mean_token_accuracy": 0.12550225779414176,
"num_tokens": 6086140.0,
"step": 1885
},
{
"entropy": 7.120326662063599,
"epoch": 3.7732267732267735,
"grad_norm": 0.87109375,
"learning_rate": 0.0004473473779402853,
"loss": 6.7136,
"mean_token_accuracy": 0.12992869466543197,
"num_tokens": 6103766.0,
"step": 1890
},
{
"entropy": 7.07710452079773,
"epoch": 3.7832167832167833,
"grad_norm": 0.8203125,
"learning_rate": 0.0004467780416965067,
"loss": 6.8188,
"mean_token_accuracy": 0.1215907171368599,
"num_tokens": 6119949.0,
"step": 1895
},
{
"entropy": 7.073676347732544,
"epoch": 3.793206793206793,
"grad_norm": 0.96484375,
"learning_rate": 0.00044620605642282555,
"loss": 6.8142,
"mean_token_accuracy": 0.12248084098100662,
"num_tokens": 6135242.0,
"step": 1900
},
{
"entropy": 7.213345336914062,
"epoch": 3.803196803196803,
"grad_norm": 0.90234375,
"learning_rate": 0.00044563143093996247,
"loss": 6.8843,
"mean_token_accuracy": 0.12051893100142479,
"num_tokens": 6151757.0,
"step": 1905
},
{
"entropy": 6.9489563465118405,
"epoch": 3.813186813186813,
"grad_norm": 0.796875,
"learning_rate": 0.00044505417410935314,
"loss": 6.6061,
"mean_token_accuracy": 0.14097559526562692,
"num_tokens": 6168645.0,
"step": 1910
},
{
"entropy": 7.026501989364624,
"epoch": 3.8231768231768233,
"grad_norm": 0.83203125,
"learning_rate": 0.000444474294833012,
"loss": 6.646,
"mean_token_accuracy": 0.13266035094857215,
"num_tokens": 6187290.0,
"step": 1915
},
{
"entropy": 7.148423337936402,
"epoch": 3.833166833166833,
"grad_norm": 0.76171875,
"learning_rate": 0.0004438918020533949,
"loss": 6.8282,
"mean_token_accuracy": 0.12248983979225159,
"num_tokens": 6202559.0,
"step": 1920
},
{
"entropy": 7.037263345718384,
"epoch": 3.843156843156843,
"grad_norm": 0.90234375,
"learning_rate": 0.0004433067047532611,
"loss": 6.6334,
"mean_token_accuracy": 0.13536879271268845,
"num_tokens": 6218876.0,
"step": 1925
},
{
"entropy": 6.973905420303344,
"epoch": 3.8531468531468533,
"grad_norm": 0.8515625,
"learning_rate": 0.00044271901195553465,
"loss": 6.6515,
"mean_token_accuracy": 0.12920384258031845,
"num_tokens": 6235305.0,
"step": 1930
},
{
"entropy": 7.083110713958741,
"epoch": 3.863136863136863,
"grad_norm": 0.85546875,
"learning_rate": 0.00044212873272316564,
"loss": 6.7521,
"mean_token_accuracy": 0.12410952597856521,
"num_tokens": 6250039.0,
"step": 1935
},
{
"entropy": 7.060521364212036,
"epoch": 3.873126873126873,
"grad_norm": 0.8203125,
"learning_rate": 0.0004415358761589899,
"loss": 6.7178,
"mean_token_accuracy": 0.13092741817235948,
"num_tokens": 6267479.0,
"step": 1940
},
{
"entropy": 7.0901649475097654,
"epoch": 3.883116883116883,
"grad_norm": 0.83984375,
"learning_rate": 0.00044094045140558914,
"loss": 6.8106,
"mean_token_accuracy": 0.12367469295859337,
"num_tokens": 6283564.0,
"step": 1945
},
{
"entropy": 7.154060745239258,
"epoch": 3.893106893106893,
"grad_norm": 0.90625,
"learning_rate": 0.0004403424676451497,
"loss": 6.8632,
"mean_token_accuracy": 0.11547367498278618,
"num_tokens": 6298442.0,
"step": 1950
},
{
"entropy": 7.076562118530274,
"epoch": 3.903096903096903,
"grad_norm": 0.83203125,
"learning_rate": 0.0004397419340993207,
"loss": 6.751,
"mean_token_accuracy": 0.12074748352169991,
"num_tokens": 6314431.0,
"step": 1955
},
{
"entropy": 7.05272421836853,
"epoch": 3.913086913086913,
"grad_norm": 0.76953125,
"learning_rate": 0.0004391388600290724,
"loss": 6.74,
"mean_token_accuracy": 0.12377151399850846,
"num_tokens": 6331266.0,
"step": 1960
},
{
"entropy": 7.101782894134521,
"epoch": 3.9230769230769234,
"grad_norm": 0.82421875,
"learning_rate": 0.0004385332547345531,
"loss": 6.8382,
"mean_token_accuracy": 0.12267978042364121,
"num_tokens": 6347366.0,
"step": 1965
},
{
"entropy": 7.074215984344482,
"epoch": 3.9330669330669332,
"grad_norm": 0.90625,
"learning_rate": 0.00043792512755494564,
"loss": 6.7722,
"mean_token_accuracy": 0.12224731072783471,
"num_tokens": 6363633.0,
"step": 1970
},
{
"entropy": 7.194826459884643,
"epoch": 3.943056943056943,
"grad_norm": 0.82421875,
"learning_rate": 0.00043731448786832317,
"loss": 6.7887,
"mean_token_accuracy": 0.12292017713189125,
"num_tokens": 6380264.0,
"step": 1975
},
{
"entropy": 6.990942764282226,
"epoch": 3.953046953046953,
"grad_norm": 0.8828125,
"learning_rate": 0.0004367013450915053,
"loss": 6.7275,
"mean_token_accuracy": 0.12456048503518105,
"num_tokens": 6395969.0,
"step": 1980
},
{
"entropy": 7.043016624450684,
"epoch": 3.963036963036963,
"grad_norm": 1.1640625,
"learning_rate": 0.00043608570867991196,
"loss": 6.7685,
"mean_token_accuracy": 0.12395606711506843,
"num_tokens": 6411883.0,
"step": 1985
},
{
"entropy": 6.9693458557128904,
"epoch": 3.973026973026973,
"grad_norm": 0.85546875,
"learning_rate": 0.00043546758812741844,
"loss": 6.6734,
"mean_token_accuracy": 0.13040299639105796,
"num_tokens": 6427476.0,
"step": 1990
},
{
"entropy": 7.094076013565063,
"epoch": 3.983016983016983,
"grad_norm": 0.87890625,
"learning_rate": 0.0004348469929662081,
"loss": 6.6441,
"mean_token_accuracy": 0.13878704532980918,
"num_tokens": 6443150.0,
"step": 1995
},
{
"entropy": 7.045284080505371,
"epoch": 3.993006993006993,
"grad_norm": 0.81640625,
"learning_rate": 0.00043422393276662595,
"loss": 6.8086,
"mean_token_accuracy": 0.12303325086832047,
"num_tokens": 6458582.0,
"step": 2000
},
{
"epoch": 3.993006993006993,
"eval_entropy": 6.972401072527911,
"eval_loss": 7.0694169998168945,
"eval_mean_token_accuracy": 0.11132242733965049,
"eval_num_tokens": 6458582.0,
"eval_runtime": 1.1886,
"eval_samples_per_second": 1240.161,
"eval_steps_per_second": 155.651,
"step": 2000
},
{
"entropy": 7.096401638454861,
"epoch": 4.001998001998002,
"grad_norm": 0.8828125,
"learning_rate": 0.0004335984171370313,
"loss": 6.6861,
"mean_token_accuracy": 0.12398595362901688,
"num_tokens": 6471049.0,
"step": 2005
},
{
"entropy": 7.000304126739502,
"epoch": 4.011988011988012,
"grad_norm": 0.953125,
"learning_rate": 0.00043297045572364884,
"loss": 6.3705,
"mean_token_accuracy": 0.13804432302713393,
"num_tokens": 6487907.0,
"step": 2010
},
{
"entropy": 6.896741819381714,
"epoch": 4.021978021978022,
"grad_norm": 0.77734375,
"learning_rate": 0.0004323400582104204,
"loss": 6.1813,
"mean_token_accuracy": 0.14990440681576728,
"num_tokens": 6505062.0,
"step": 2015
},
{
"entropy": 7.011386251449585,
"epoch": 4.031968031968032,
"grad_norm": 0.8671875,
"learning_rate": 0.00043170723431885537,
"loss": 6.36,
"mean_token_accuracy": 0.1448569469153881,
"num_tokens": 6521057.0,
"step": 2020
},
{
"entropy": 7.045408296585083,
"epoch": 4.041958041958042,
"grad_norm": 0.8671875,
"learning_rate": 0.0004310719938078811,
"loss": 6.4343,
"mean_token_accuracy": 0.13550977110862733,
"num_tokens": 6535992.0,
"step": 2025
},
{
"entropy": 6.8560590744018555,
"epoch": 4.0519480519480515,
"grad_norm": 0.77734375,
"learning_rate": 0.0004304343464736921,
"loss": 6.2191,
"mean_token_accuracy": 0.15562399104237556,
"num_tokens": 6553269.0,
"step": 2030
},
{
"entropy": 7.07580041885376,
"epoch": 4.061938061938062,
"grad_norm": 0.7890625,
"learning_rate": 0.00042979430214959907,
"loss": 6.5009,
"mean_token_accuracy": 0.12860227823257447,
"num_tokens": 6569422.0,
"step": 2035
},
{
"entropy": 6.976323556900025,
"epoch": 4.071928071928072,
"grad_norm": 0.859375,
"learning_rate": 0.0004291518707058773,
"loss": 6.3401,
"mean_token_accuracy": 0.14290616512298585,
"num_tokens": 6584570.0,
"step": 2040
},
{
"entropy": 7.041407203674316,
"epoch": 4.081918081918082,
"grad_norm": 0.8984375,
"learning_rate": 0.0004285070620496142,
"loss": 6.4703,
"mean_token_accuracy": 0.12887632623314857,
"num_tokens": 6599297.0,
"step": 2045
},
{
"entropy": 7.043705081939697,
"epoch": 4.091908091908092,
"grad_norm": 0.84375,
"learning_rate": 0.00042785988612455714,
"loss": 6.4822,
"mean_token_accuracy": 0.12805523350834846,
"num_tokens": 6615073.0,
"step": 2050
},
{
"entropy": 6.997570323944092,
"epoch": 4.101898101898102,
"grad_norm": 0.77734375,
"learning_rate": 0.00042721035291095927,
"loss": 6.3232,
"mean_token_accuracy": 0.14648763537406922,
"num_tokens": 6631606.0,
"step": 2055
},
{
"entropy": 6.978628635406494,
"epoch": 4.111888111888112,
"grad_norm": 0.90234375,
"learning_rate": 0.00042655847242542637,
"loss": 6.434,
"mean_token_accuracy": 0.1406654089689255,
"num_tokens": 6647254.0,
"step": 2060
},
{
"entropy": 6.902737426757812,
"epoch": 4.1218781218781215,
"grad_norm": 0.8984375,
"learning_rate": 0.000425904254720762,
"loss": 6.3467,
"mean_token_accuracy": 0.14053556472063064,
"num_tokens": 6663318.0,
"step": 2065
},
{
"entropy": 6.984950065612793,
"epoch": 4.131868131868132,
"grad_norm": 0.859375,
"learning_rate": 0.0004252477098858124,
"loss": 6.4356,
"mean_token_accuracy": 0.13776141479611398,
"num_tokens": 6679926.0,
"step": 2070
},
{
"entropy": 7.005192565917969,
"epoch": 4.141858141858142,
"grad_norm": 0.8828125,
"learning_rate": 0.00042458884804531105,
"loss": 6.4349,
"mean_token_accuracy": 0.1354406990110874,
"num_tokens": 6696056.0,
"step": 2075
},
{
"entropy": 6.969394207000732,
"epoch": 4.151848151848152,
"grad_norm": 0.8359375,
"learning_rate": 0.0004239276793597227,
"loss": 6.4095,
"mean_token_accuracy": 0.13926568925380706,
"num_tokens": 6711995.0,
"step": 2080
},
{
"entropy": 7.012915992736817,
"epoch": 4.161838161838162,
"grad_norm": 0.84765625,
"learning_rate": 0.00042326421402508636,
"loss": 6.4457,
"mean_token_accuracy": 0.13269549906253814,
"num_tokens": 6728208.0,
"step": 2085
},
{
"entropy": 6.903886365890503,
"epoch": 4.171828171828172,
"grad_norm": 0.9453125,
"learning_rate": 0.0004225984622728581,
"loss": 6.3407,
"mean_token_accuracy": 0.1442622274160385,
"num_tokens": 6743270.0,
"step": 2090
},
{
"entropy": 6.858393859863281,
"epoch": 4.181818181818182,
"grad_norm": 0.89453125,
"learning_rate": 0.00042193043436975365,
"loss": 6.2573,
"mean_token_accuracy": 0.14693668633699417,
"num_tokens": 6759160.0,
"step": 2095
},
{
"entropy": 6.878496789932251,
"epoch": 4.1918081918081915,
"grad_norm": 0.83984375,
"learning_rate": 0.0004212601406175897,
"loss": 6.3036,
"mean_token_accuracy": 0.14269134551286697,
"num_tokens": 6773939.0,
"step": 2100
},
{
"entropy": 6.866790342330932,
"epoch": 4.201798201798201,
"grad_norm": 0.82421875,
"learning_rate": 0.00042058759135312504,
"loss": 6.2831,
"mean_token_accuracy": 0.1496070832014084,
"num_tokens": 6790902.0,
"step": 2105
},
{
"entropy": 6.919366979598999,
"epoch": 4.211788211788212,
"grad_norm": 0.88671875,
"learning_rate": 0.0004199127969479012,
"loss": 6.4617,
"mean_token_accuracy": 0.1320016346871853,
"num_tokens": 6806270.0,
"step": 2110
},
{
"entropy": 6.988452768325805,
"epoch": 4.221778221778222,
"grad_norm": 0.83984375,
"learning_rate": 0.0004192357678080828,
"loss": 6.413,
"mean_token_accuracy": 0.14049519151449202,
"num_tokens": 6822525.0,
"step": 2115
},
{
"entropy": 6.913089942932129,
"epoch": 4.231768231768232,
"grad_norm": 0.8828125,
"learning_rate": 0.0004185565143742968,
"loss": 6.4793,
"mean_token_accuracy": 0.1310143105685711,
"num_tokens": 6839091.0,
"step": 2120
},
{
"entropy": 6.985987806320191,
"epoch": 4.241758241758242,
"grad_norm": 0.921875,
"learning_rate": 0.0004178750471214712,
"loss": 6.4358,
"mean_token_accuracy": 0.1404714398086071,
"num_tokens": 6854277.0,
"step": 2125
},
{
"entropy": 6.9769031524658205,
"epoch": 4.251748251748252,
"grad_norm": 0.8828125,
"learning_rate": 0.00041719137655867413,
"loss": 6.446,
"mean_token_accuracy": 0.1365428499877453,
"num_tokens": 6870508.0,
"step": 2130
},
{
"entropy": 6.842640686035156,
"epoch": 4.2617382617382615,
"grad_norm": 0.88671875,
"learning_rate": 0.00041650551322895154,
"loss": 6.308,
"mean_token_accuracy": 0.14744904339313508,
"num_tokens": 6887361.0,
"step": 2135
},
{
"entropy": 6.900832891464233,
"epoch": 4.271728271728271,
"grad_norm": 0.91796875,
"learning_rate": 0.00041581746770916417,
"loss": 6.391,
"mean_token_accuracy": 0.13931121453642845,
"num_tokens": 6902076.0,
"step": 2140
},
{
"entropy": 6.8979002952575685,
"epoch": 4.281718281718282,
"grad_norm": 0.91796875,
"learning_rate": 0.0004151272506098253,
"loss": 6.4068,
"mean_token_accuracy": 0.13438273817300797,
"num_tokens": 6917931.0,
"step": 2145
},
{
"entropy": 6.990635061264038,
"epoch": 4.291708291708292,
"grad_norm": 0.90234375,
"learning_rate": 0.0004144348725749364,
"loss": 6.467,
"mean_token_accuracy": 0.13701085448265077,
"num_tokens": 6934519.0,
"step": 2150
},
{
"entropy": 6.896759700775147,
"epoch": 4.301698301698302,
"grad_norm": 0.91796875,
"learning_rate": 0.00041374034428182327,
"loss": 6.4301,
"mean_token_accuracy": 0.13709006011486052,
"num_tokens": 6949828.0,
"step": 2155
},
{
"entropy": 7.042719030380249,
"epoch": 4.311688311688312,
"grad_norm": 0.85546875,
"learning_rate": 0.00041304367644097136,
"loss": 6.5346,
"mean_token_accuracy": 0.12652225121855737,
"num_tokens": 6966874.0,
"step": 2160
},
{
"entropy": 6.905826568603516,
"epoch": 4.321678321678322,
"grad_norm": 0.8046875,
"learning_rate": 0.00041234487979586055,
"loss": 6.4229,
"mean_token_accuracy": 0.14220663160085678,
"num_tokens": 6984182.0,
"step": 2165
},
{
"entropy": 6.976738357543946,
"epoch": 4.3316683316683315,
"grad_norm": 0.796875,
"learning_rate": 0.00041164396512279966,
"loss": 6.5041,
"mean_token_accuracy": 0.13272078856825828,
"num_tokens": 7001573.0,
"step": 2170
},
{
"entropy": 6.99681544303894,
"epoch": 4.341658341658341,
"grad_norm": 1.03125,
"learning_rate": 0.00041094094323075993,
"loss": 6.4468,
"mean_token_accuracy": 0.14005056545138359,
"num_tokens": 7017791.0,
"step": 2175
},
{
"entropy": 6.963916015625,
"epoch": 4.351648351648351,
"grad_norm": 0.88671875,
"learning_rate": 0.0004102358249612086,
"loss": 6.4694,
"mean_token_accuracy": 0.12927123457193374,
"num_tokens": 7033066.0,
"step": 2180
},
{
"entropy": 6.970026445388794,
"epoch": 4.361638361638362,
"grad_norm": 0.828125,
"learning_rate": 0.0004095286211879418,
"loss": 6.486,
"mean_token_accuracy": 0.13157685324549676,
"num_tokens": 7051148.0,
"step": 2185
},
{
"entropy": 6.826376342773438,
"epoch": 4.371628371628372,
"grad_norm": 0.8828125,
"learning_rate": 0.00040881934281691634,
"loss": 6.3613,
"mean_token_accuracy": 0.14514607787132264,
"num_tokens": 7066554.0,
"step": 2190
},
{
"entropy": 6.967290830612183,
"epoch": 4.381618381618382,
"grad_norm": 0.87109375,
"learning_rate": 0.00040810800078608237,
"loss": 6.4716,
"mean_token_accuracy": 0.1343966767191887,
"num_tokens": 7083247.0,
"step": 2195
},
{
"entropy": 6.924704074859619,
"epoch": 4.391608391608392,
"grad_norm": 0.859375,
"learning_rate": 0.0004073946060652138,
"loss": 6.4479,
"mean_token_accuracy": 0.14146102145314216,
"num_tokens": 7099104.0,
"step": 2200
},
{
"entropy": 6.918974208831787,
"epoch": 4.4015984015984015,
"grad_norm": 0.90234375,
"learning_rate": 0.00040667916965573983,
"loss": 6.4514,
"mean_token_accuracy": 0.14054503217339515,
"num_tokens": 7114440.0,
"step": 2205
},
{
"entropy": 6.896188163757325,
"epoch": 4.411588411588411,
"grad_norm": 0.77734375,
"learning_rate": 0.0004059617025905748,
"loss": 6.4507,
"mean_token_accuracy": 0.137186661362648,
"num_tokens": 7130410.0,
"step": 2210
},
{
"entropy": 6.846044588088989,
"epoch": 4.421578421578421,
"grad_norm": 0.9765625,
"learning_rate": 0.00040524221593394856,
"loss": 6.386,
"mean_token_accuracy": 0.1397906646132469,
"num_tokens": 7144803.0,
"step": 2215
},
{
"entropy": 6.887253284454346,
"epoch": 4.431568431568431,
"grad_norm": 0.99609375,
"learning_rate": 0.0004045207207812354,
"loss": 6.3791,
"mean_token_accuracy": 0.1420623131096363,
"num_tokens": 7160680.0,
"step": 2220
},
{
"entropy": 6.857743835449218,
"epoch": 4.441558441558442,
"grad_norm": 0.90625,
"learning_rate": 0.000403797228258783,
"loss": 6.3374,
"mean_token_accuracy": 0.13977223932743071,
"num_tokens": 7177450.0,
"step": 2225
},
{
"entropy": 6.882814168930054,
"epoch": 4.451548451548452,
"grad_norm": 0.92578125,
"learning_rate": 0.0004030717495237411,
"loss": 6.4604,
"mean_token_accuracy": 0.13854006603360175,
"num_tokens": 7192482.0,
"step": 2230
},
{
"entropy": 7.053446912765503,
"epoch": 4.461538461538462,
"grad_norm": 0.97265625,
"learning_rate": 0.0004023442957638892,
"loss": 6.4821,
"mean_token_accuracy": 0.13466990888118743,
"num_tokens": 7209494.0,
"step": 2235
},
{
"entropy": 6.831972455978393,
"epoch": 4.4715284715284715,
"grad_norm": 0.875,
"learning_rate": 0.0004016148781974643,
"loss": 6.3666,
"mean_token_accuracy": 0.14500441253185273,
"num_tokens": 7225535.0,
"step": 2240
},
{
"entropy": 6.872930431365967,
"epoch": 4.481518481518481,
"grad_norm": 0.8515625,
"learning_rate": 0.0004008835080729876,
"loss": 6.242,
"mean_token_accuracy": 0.15063140094280242,
"num_tokens": 7243198.0,
"step": 2245
},
{
"entropy": 6.881392240524292,
"epoch": 4.491508491508491,
"grad_norm": 0.90234375,
"learning_rate": 0.00040015019666909106,
"loss": 6.4483,
"mean_token_accuracy": 0.13883696421980857,
"num_tokens": 7257931.0,
"step": 2250
},
{
"entropy": 6.950327968597412,
"epoch": 4.501498501498501,
"grad_norm": 0.88671875,
"learning_rate": 0.00039941495529434375,
"loss": 6.5614,
"mean_token_accuracy": 0.13021408692002295,
"num_tokens": 7274631.0,
"step": 2255
},
{
"entropy": 6.916135692596436,
"epoch": 4.511488511488512,
"grad_norm": 0.9375,
"learning_rate": 0.0003986777952870772,
"loss": 6.4462,
"mean_token_accuracy": 0.1361345499753952,
"num_tokens": 7291300.0,
"step": 2260
},
{
"entropy": 6.95969672203064,
"epoch": 4.521478521478522,
"grad_norm": 0.8125,
"learning_rate": 0.0003979387280152106,
"loss": 6.438,
"mean_token_accuracy": 0.14408094808459282,
"num_tokens": 7307140.0,
"step": 2265
},
{
"entropy": 6.837795305252075,
"epoch": 4.531468531468532,
"grad_norm": 0.9140625,
"learning_rate": 0.0003971977648760756,
"loss": 6.3903,
"mean_token_accuracy": 0.13501906394958496,
"num_tokens": 7321578.0,
"step": 2270
},
{
"entropy": 6.829850673675537,
"epoch": 4.5414585414585416,
"grad_norm": 0.95703125,
"learning_rate": 0.0003964549172962403,
"loss": 6.3328,
"mean_token_accuracy": 0.14925181940197946,
"num_tokens": 7338286.0,
"step": 2275
},
{
"entropy": 6.935940742492676,
"epoch": 4.551448551448551,
"grad_norm": 0.84375,
"learning_rate": 0.00039571019673133344,
"loss": 6.5561,
"mean_token_accuracy": 0.1315899409353733,
"num_tokens": 7356049.0,
"step": 2280
},
{
"entropy": 6.860372114181518,
"epoch": 4.561438561438561,
"grad_norm": 0.80078125,
"learning_rate": 0.00039496361466586743,
"loss": 6.356,
"mean_token_accuracy": 0.14854327514767646,
"num_tokens": 7373159.0,
"step": 2285
},
{
"entropy": 6.784941053390503,
"epoch": 4.571428571428571,
"grad_norm": 0.984375,
"learning_rate": 0.0003942151826130613,
"loss": 6.3758,
"mean_token_accuracy": 0.14404894411563873,
"num_tokens": 7389285.0,
"step": 2290
},
{
"entropy": 6.826180076599121,
"epoch": 4.581418581418581,
"grad_norm": 0.796875,
"learning_rate": 0.0003934649121146629,
"loss": 6.3899,
"mean_token_accuracy": 0.14161911457777024,
"num_tokens": 7406386.0,
"step": 2295
},
{
"entropy": 6.977476119995117,
"epoch": 4.591408591408591,
"grad_norm": 0.953125,
"learning_rate": 0.00039271281474077173,
"loss": 6.4494,
"mean_token_accuracy": 0.13891530334949492,
"num_tokens": 7421540.0,
"step": 2300
},
{
"entropy": 6.839320707321167,
"epoch": 4.601398601398602,
"grad_norm": 0.78515625,
"learning_rate": 0.0003919589020896596,
"loss": 6.4227,
"mean_token_accuracy": 0.13940232917666434,
"num_tokens": 7438394.0,
"step": 2305
},
{
"entropy": 6.9221405506134035,
"epoch": 4.611388611388612,
"grad_norm": 0.85546875,
"learning_rate": 0.00039120318578759225,
"loss": 6.4134,
"mean_token_accuracy": 0.1382547177374363,
"num_tokens": 7454275.0,
"step": 2310
},
{
"entropy": 6.931888771057129,
"epoch": 4.621378621378621,
"grad_norm": 0.98828125,
"learning_rate": 0.0003904456774886498,
"loss": 6.4787,
"mean_token_accuracy": 0.136423047631979,
"num_tokens": 7468872.0,
"step": 2315
},
{
"entropy": 6.7931678771972654,
"epoch": 4.631368631368631,
"grad_norm": 0.85546875,
"learning_rate": 0.0003896863888745475,
"loss": 6.4317,
"mean_token_accuracy": 0.13883610889315606,
"num_tokens": 7485614.0,
"step": 2320
},
{
"entropy": 6.9771514415740965,
"epoch": 4.641358641358641,
"grad_norm": 0.8515625,
"learning_rate": 0.0003889253316544548,
"loss": 6.5143,
"mean_token_accuracy": 0.12867238670587539,
"num_tokens": 7502577.0,
"step": 2325
},
{
"entropy": 6.869775629043579,
"epoch": 4.651348651348651,
"grad_norm": 1.1953125,
"learning_rate": 0.00038816251756481577,
"loss": 6.4091,
"mean_token_accuracy": 0.1344277046620846,
"num_tokens": 7519969.0,
"step": 2330
},
{
"entropy": 7.018423795700073,
"epoch": 4.661338661338661,
"grad_norm": 0.8515625,
"learning_rate": 0.0003873979583691671,
"loss": 6.5605,
"mean_token_accuracy": 0.12558562383055688,
"num_tokens": 7537078.0,
"step": 2335
},
{
"entropy": 6.866714382171631,
"epoch": 4.671328671328672,
"grad_norm": 0.75390625,
"learning_rate": 0.0003866316658579576,
"loss": 6.421,
"mean_token_accuracy": 0.13925058171153068,
"num_tokens": 7553680.0,
"step": 2340
},
{
"entropy": 6.901582145690918,
"epoch": 4.681318681318682,
"grad_norm": 1.0,
"learning_rate": 0.00038586365184836556,
"loss": 6.4216,
"mean_token_accuracy": 0.14001917839050293,
"num_tokens": 7569197.0,
"step": 2345
},
{
"entropy": 6.823400783538818,
"epoch": 4.691308691308691,
"grad_norm": 0.94140625,
"learning_rate": 0.0003850939281841173,
"loss": 6.4058,
"mean_token_accuracy": 0.13748618736863136,
"num_tokens": 7585862.0,
"step": 2350
},
{
"entropy": 6.835287475585938,
"epoch": 4.701298701298701,
"grad_norm": 0.890625,
"learning_rate": 0.0003843225067353036,
"loss": 6.398,
"mean_token_accuracy": 0.13771583437919616,
"num_tokens": 7600506.0,
"step": 2355
},
{
"entropy": 6.966355991363526,
"epoch": 4.711288711288711,
"grad_norm": 1.0390625,
"learning_rate": 0.00038354939939819785,
"loss": 6.5197,
"mean_token_accuracy": 0.1330697476863861,
"num_tokens": 7616067.0,
"step": 2360
},
{
"entropy": 6.843840646743774,
"epoch": 4.721278721278721,
"grad_norm": 0.9375,
"learning_rate": 0.0003827746180950712,
"loss": 6.4606,
"mean_token_accuracy": 0.13615441247820853,
"num_tokens": 7632542.0,
"step": 2365
},
{
"entropy": 6.873838472366333,
"epoch": 4.731268731268731,
"grad_norm": 0.9140625,
"learning_rate": 0.0003819981747740102,
"loss": 6.3692,
"mean_token_accuracy": 0.1446195088326931,
"num_tokens": 7648752.0,
"step": 2370
},
{
"entropy": 6.881458282470703,
"epoch": 4.741258741258742,
"grad_norm": 0.91015625,
"learning_rate": 0.0003812200814087309,
"loss": 6.4731,
"mean_token_accuracy": 0.13235363364219666,
"num_tokens": 7664364.0,
"step": 2375
},
{
"entropy": 6.844540405273437,
"epoch": 4.751248751248752,
"grad_norm": 1.0234375,
"learning_rate": 0.00038044034999839605,
"loss": 6.3305,
"mean_token_accuracy": 0.14687129333615304,
"num_tokens": 7680383.0,
"step": 2380
},
{
"entropy": 6.817474508285523,
"epoch": 4.761238761238761,
"grad_norm": 0.8984375,
"learning_rate": 0.00037965899256742815,
"loss": 6.3914,
"mean_token_accuracy": 0.14889568239450454,
"num_tokens": 7695832.0,
"step": 2385
},
{
"entropy": 6.908108520507812,
"epoch": 4.771228771228771,
"grad_norm": 0.87890625,
"learning_rate": 0.00037887602116532556,
"loss": 6.5908,
"mean_token_accuracy": 0.12793709486722946,
"num_tokens": 7712453.0,
"step": 2390
},
{
"entropy": 6.908516550064087,
"epoch": 4.781218781218781,
"grad_norm": 0.9140625,
"learning_rate": 0.00037809144786647594,
"loss": 6.4465,
"mean_token_accuracy": 0.13347138911485673,
"num_tokens": 7727746.0,
"step": 2395
},
{
"entropy": 6.907331275939941,
"epoch": 4.791208791208791,
"grad_norm": 0.8671875,
"learning_rate": 0.0003773052847699699,
"loss": 6.4219,
"mean_token_accuracy": 0.14402018189430238,
"num_tokens": 7743878.0,
"step": 2400
},
{
"entropy": 6.918729639053344,
"epoch": 4.801198801198801,
"grad_norm": 0.875,
"learning_rate": 0.00037651754399941516,
"loss": 6.4983,
"mean_token_accuracy": 0.1317797139286995,
"num_tokens": 7759628.0,
"step": 2405
},
{
"entropy": 6.908243465423584,
"epoch": 4.811188811188811,
"grad_norm": 0.92578125,
"learning_rate": 0.00037572823770274874,
"loss": 6.4725,
"mean_token_accuracy": 0.13213906362652778,
"num_tokens": 7776560.0,
"step": 2410
},
{
"entropy": 6.9069239616394045,
"epoch": 4.821178821178821,
"grad_norm": 0.8984375,
"learning_rate": 0.0003749373780520502,
"loss": 6.5278,
"mean_token_accuracy": 0.13267339393496513,
"num_tokens": 7792380.0,
"step": 2415
},
{
"entropy": 6.858670282363891,
"epoch": 4.8311688311688314,
"grad_norm": 0.88671875,
"learning_rate": 0.00037414497724335365,
"loss": 6.4234,
"mean_token_accuracy": 0.13867654502391816,
"num_tokens": 7807399.0,
"step": 2420
},
{
"entropy": 6.915921878814697,
"epoch": 4.841158841158841,
"grad_norm": 0.91796875,
"learning_rate": 0.00037335104749645995,
"loss": 6.5061,
"mean_token_accuracy": 0.13035957515239716,
"num_tokens": 7822886.0,
"step": 2425
},
{
"entropy": 6.822269439697266,
"epoch": 4.851148851148851,
"grad_norm": 0.87109375,
"learning_rate": 0.0003725556010547477,
"loss": 6.4195,
"mean_token_accuracy": 0.14344688802957534,
"num_tokens": 7839566.0,
"step": 2430
},
{
"entropy": 6.891341876983643,
"epoch": 4.861138861138861,
"grad_norm": 0.92578125,
"learning_rate": 0.0003717586501849853,
"loss": 6.4431,
"mean_token_accuracy": 0.1357530564069748,
"num_tokens": 7855575.0,
"step": 2435
},
{
"entropy": 6.816015005111694,
"epoch": 4.871128871128871,
"grad_norm": 0.8828125,
"learning_rate": 0.00037096020717714077,
"loss": 6.4148,
"mean_token_accuracy": 0.14372522458434106,
"num_tokens": 7871908.0,
"step": 2440
},
{
"entropy": 6.912888097763061,
"epoch": 4.881118881118881,
"grad_norm": 0.9296875,
"learning_rate": 0.0003701602843441932,
"loss": 6.5089,
"mean_token_accuracy": 0.13163238167762756,
"num_tokens": 7887986.0,
"step": 2445
},
{
"entropy": 6.812265014648437,
"epoch": 4.891108891108891,
"grad_norm": 0.82421875,
"learning_rate": 0.0003693588940219422,
"loss": 6.3936,
"mean_token_accuracy": 0.14253236576914788,
"num_tokens": 7905045.0,
"step": 2450
},
{
"entropy": 6.897704696655273,
"epoch": 4.9010989010989015,
"grad_norm": 0.875,
"learning_rate": 0.00036855604856881794,
"loss": 6.3795,
"mean_token_accuracy": 0.13932438269257547,
"num_tokens": 7920910.0,
"step": 2455
},
{
"entropy": 6.863029289245605,
"epoch": 4.911088911088911,
"grad_norm": 0.9375,
"learning_rate": 0.00036775176036569037,
"loss": 6.5525,
"mean_token_accuracy": 0.13276326581835746,
"num_tokens": 7938582.0,
"step": 2460
},
{
"entropy": 6.940312910079956,
"epoch": 4.921078921078921,
"grad_norm": 0.9375,
"learning_rate": 0.00036694604181567857,
"loss": 6.5128,
"mean_token_accuracy": 0.1404005207121372,
"num_tokens": 7956974.0,
"step": 2465
},
{
"entropy": 6.87377552986145,
"epoch": 4.931068931068931,
"grad_norm": 0.890625,
"learning_rate": 0.00036613890534395926,
"loss": 6.42,
"mean_token_accuracy": 0.13454653844237327,
"num_tokens": 7973039.0,
"step": 2470
},
{
"entropy": 6.845200920104981,
"epoch": 4.941058941058941,
"grad_norm": 0.87109375,
"learning_rate": 0.00036533036339757546,
"loss": 6.4954,
"mean_token_accuracy": 0.13850824236869813,
"num_tokens": 7990012.0,
"step": 2475
},
{
"entropy": 6.923229551315307,
"epoch": 4.951048951048951,
"grad_norm": 0.8984375,
"learning_rate": 0.00036452042844524403,
"loss": 6.4725,
"mean_token_accuracy": 0.13284012898802758,
"num_tokens": 8006660.0,
"step": 2480
},
{
"entropy": 6.894635772705078,
"epoch": 4.961038961038961,
"grad_norm": 0.9765625,
"learning_rate": 0.00036370911297716396,
"loss": 6.4136,
"mean_token_accuracy": 0.13401512503623964,
"num_tokens": 8021882.0,
"step": 2485
},
{
"entropy": 6.825757074356079,
"epoch": 4.9710289710289715,
"grad_norm": 0.8828125,
"learning_rate": 0.0003628964295048234,
"loss": 6.3503,
"mean_token_accuracy": 0.14384899139404297,
"num_tokens": 8038306.0,
"step": 2490
},
{
"entropy": 6.828709840774536,
"epoch": 4.981018981018981,
"grad_norm": 0.89453125,
"learning_rate": 0.00036208239056080685,
"loss": 6.4431,
"mean_token_accuracy": 0.13646155297756196,
"num_tokens": 8055064.0,
"step": 2495
},
{
"entropy": 6.887692546844482,
"epoch": 4.991008991008991,
"grad_norm": 0.890625,
"learning_rate": 0.0003612670086986018,
"loss": 6.4128,
"mean_token_accuracy": 0.14382297024130822,
"num_tokens": 8072444.0,
"step": 2500
},
{
"epoch": 4.991008991008991,
"eval_entropy": 6.7374067306518555,
"eval_loss": 7.007086277008057,
"eval_mean_token_accuracy": 0.11369705923102998,
"eval_num_tokens": 8072444.0,
"eval_runtime": 1.1755,
"eval_samples_per_second": 1253.942,
"eval_steps_per_second": 157.381,
"step": 2500
},
{
"entropy": 6.898542245229085,
"epoch": 5.0,
"grad_norm": 2.375,
"learning_rate": 0.0003604502964924053,
"loss": 6.5935,
"mean_token_accuracy": 0.13040180587106281,
"num_tokens": 8085445.0,
"step": 2505
},
{
"entropy": 6.9159050464630125,
"epoch": 5.00999000999001,
"grad_norm": 0.82421875,
"learning_rate": 0.00035963226653692976,
"loss": 6.1467,
"mean_token_accuracy": 0.14434437677264214,
"num_tokens": 8101276.0,
"step": 2510
},
{
"entropy": 6.878229475021362,
"epoch": 5.01998001998002,
"grad_norm": 0.82421875,
"learning_rate": 0.00035881293144720915,
"loss": 6.1114,
"mean_token_accuracy": 0.14664856046438218,
"num_tokens": 8117868.0,
"step": 2515
},
{
"entropy": 6.8993446826934814,
"epoch": 5.02997002997003,
"grad_norm": 0.88671875,
"learning_rate": 0.0003579923038584042,
"loss": 6.1441,
"mean_token_accuracy": 0.15033238381147385,
"num_tokens": 8133883.0,
"step": 2520
},
{
"entropy": 6.782688426971435,
"epoch": 5.03996003996004,
"grad_norm": 0.8828125,
"learning_rate": 0.00035717039642560726,
"loss": 6.0688,
"mean_token_accuracy": 0.1523089662194252,
"num_tokens": 8149073.0,
"step": 2525
},
{
"entropy": 6.821210479736328,
"epoch": 5.04995004995005,
"grad_norm": 0.93359375,
"learning_rate": 0.0003563472218236479,
"loss": 6.0601,
"mean_token_accuracy": 0.1525934472680092,
"num_tokens": 8166174.0,
"step": 2530
},
{
"entropy": 6.874574899673462,
"epoch": 5.05994005994006,
"grad_norm": 0.921875,
"learning_rate": 0.0003555227927468967,
"loss": 6.1508,
"mean_token_accuracy": 0.15101489722728728,
"num_tokens": 8180834.0,
"step": 2535
},
{
"entropy": 6.758509922027588,
"epoch": 5.06993006993007,
"grad_norm": 0.921875,
"learning_rate": 0.00035469712190907,
"loss": 6.041,
"mean_token_accuracy": 0.15453238114714624,
"num_tokens": 8198467.0,
"step": 2540
},
{
"entropy": 6.832466173171997,
"epoch": 5.07992007992008,
"grad_norm": 0.93359375,
"learning_rate": 0.00035387022204303326,
"loss": 6.1572,
"mean_token_accuracy": 0.14238883703947067,
"num_tokens": 8214233.0,
"step": 2545
},
{
"entropy": 6.844207906723023,
"epoch": 5.08991008991009,
"grad_norm": 0.87109375,
"learning_rate": 0.00035304210590060564,
"loss": 6.2343,
"mean_token_accuracy": 0.141249231249094,
"num_tokens": 8230846.0,
"step": 2550
},
{
"entropy": 6.781070899963379,
"epoch": 5.0999000999001,
"grad_norm": 0.90234375,
"learning_rate": 0.00035221278625236234,
"loss": 6.0177,
"mean_token_accuracy": 0.16515944004058838,
"num_tokens": 8247264.0,
"step": 2555
},
{
"entropy": 6.702904558181762,
"epoch": 5.1098901098901095,
"grad_norm": 0.94921875,
"learning_rate": 0.0003513822758874383,
"loss": 6.0765,
"mean_token_accuracy": 0.15743518620729446,
"num_tokens": 8263681.0,
"step": 2560
},
{
"entropy": 6.816042900085449,
"epoch": 5.11988011988012,
"grad_norm": 0.92578125,
"learning_rate": 0.00035055058761333064,
"loss": 6.2244,
"mean_token_accuracy": 0.14425530582666396,
"num_tokens": 8280162.0,
"step": 2565
},
{
"entropy": 6.8803774356842045,
"epoch": 5.12987012987013,
"grad_norm": 0.91796875,
"learning_rate": 0.00034971773425570153,
"loss": 6.1981,
"mean_token_accuracy": 0.14355578720569612,
"num_tokens": 8294381.0,
"step": 2570
},
{
"entropy": 6.774266910552979,
"epoch": 5.13986013986014,
"grad_norm": 0.83203125,
"learning_rate": 0.00034888372865817994,
"loss": 6.1406,
"mean_token_accuracy": 0.15092467218637468,
"num_tokens": 8311985.0,
"step": 2575
},
{
"entropy": 6.719998168945312,
"epoch": 5.14985014985015,
"grad_norm": 0.8828125,
"learning_rate": 0.00034804858368216396,
"loss": 6.1032,
"mean_token_accuracy": 0.15913226455450058,
"num_tokens": 8327714.0,
"step": 2580
},
{
"entropy": 6.780656147003174,
"epoch": 5.15984015984016,
"grad_norm": 0.83984375,
"learning_rate": 0.00034721231220662216,
"loss": 6.0884,
"mean_token_accuracy": 0.15305961519479752,
"num_tokens": 8343470.0,
"step": 2585
},
{
"entropy": 6.702918148040771,
"epoch": 5.16983016983017,
"grad_norm": 0.921875,
"learning_rate": 0.00034637492712789533,
"loss": 6.0909,
"mean_token_accuracy": 0.15377210527658464,
"num_tokens": 8359459.0,
"step": 2590
},
{
"entropy": 6.842664051055908,
"epoch": 5.1798201798201795,
"grad_norm": 0.91015625,
"learning_rate": 0.0003455364413594971,
"loss": 6.0988,
"mean_token_accuracy": 0.15020217299461364,
"num_tokens": 8376234.0,
"step": 2595
},
{
"entropy": 6.84317717552185,
"epoch": 5.18981018981019,
"grad_norm": 0.9296875,
"learning_rate": 0.0003446968678319154,
"loss": 6.1142,
"mean_token_accuracy": 0.14910392165184022,
"num_tokens": 8392264.0,
"step": 2600
},
{
"entropy": 6.74654631614685,
"epoch": 5.1998001998002,
"grad_norm": 0.921875,
"learning_rate": 0.0003438562194924127,
"loss": 6.1557,
"mean_token_accuracy": 0.1491137683391571,
"num_tokens": 8408780.0,
"step": 2605
},
{
"entropy": 6.838429307937622,
"epoch": 5.20979020979021,
"grad_norm": 0.953125,
"learning_rate": 0.0003430145093048261,
"loss": 6.173,
"mean_token_accuracy": 0.1463763326406479,
"num_tokens": 8423860.0,
"step": 2610
},
{
"entropy": 6.72910327911377,
"epoch": 5.21978021978022,
"grad_norm": 0.94921875,
"learning_rate": 0.0003421717502493683,
"loss": 6.0764,
"mean_token_accuracy": 0.1525864578783512,
"num_tokens": 8441772.0,
"step": 2615
},
{
"entropy": 6.85248498916626,
"epoch": 5.22977022977023,
"grad_norm": 0.984375,
"learning_rate": 0.00034132795532242603,
"loss": 6.191,
"mean_token_accuracy": 0.14192505776882172,
"num_tokens": 8456849.0,
"step": 2620
},
{
"entropy": 6.789510202407837,
"epoch": 5.23976023976024,
"grad_norm": 0.9921875,
"learning_rate": 0.00034048313753636114,
"loss": 6.1595,
"mean_token_accuracy": 0.14623874053359032,
"num_tokens": 8473380.0,
"step": 2625
},
{
"entropy": 6.813194751739502,
"epoch": 5.2497502497502495,
"grad_norm": 1.0234375,
"learning_rate": 0.0003396373099193091,
"loss": 6.1544,
"mean_token_accuracy": 0.14940615892410278,
"num_tokens": 8488165.0,
"step": 2630
},
{
"entropy": 6.619700717926025,
"epoch": 5.259740259740259,
"grad_norm": 0.95703125,
"learning_rate": 0.00033879048551497783,
"loss": 6.0124,
"mean_token_accuracy": 0.1557314984500408,
"num_tokens": 8503552.0,
"step": 2635
},
{
"entropy": 6.791070652008057,
"epoch": 5.26973026973027,
"grad_norm": 0.984375,
"learning_rate": 0.0003379426773824473,
"loss": 6.1493,
"mean_token_accuracy": 0.14780891090631484,
"num_tokens": 8519896.0,
"step": 2640
},
{
"entropy": 6.67166690826416,
"epoch": 5.27972027972028,
"grad_norm": 0.88671875,
"learning_rate": 0.0003370938985959678,
"loss": 6.0364,
"mean_token_accuracy": 0.16298322826623918,
"num_tokens": 8535352.0,
"step": 2645
},
{
"entropy": 6.7639524936676025,
"epoch": 5.28971028971029,
"grad_norm": 0.98828125,
"learning_rate": 0.00033624416224475813,
"loss": 6.1027,
"mean_token_accuracy": 0.16258821040391921,
"num_tokens": 8549844.0,
"step": 2650
},
{
"entropy": 6.742043781280517,
"epoch": 5.2997002997003,
"grad_norm": 1.0234375,
"learning_rate": 0.000335393481432804,
"loss": 6.1016,
"mean_token_accuracy": 0.1525222986936569,
"num_tokens": 8565525.0,
"step": 2655
},
{
"entropy": 6.698980665206909,
"epoch": 5.30969030969031,
"grad_norm": 1.1171875,
"learning_rate": 0.000334541869278656,
"loss": 6.0574,
"mean_token_accuracy": 0.16224250346422195,
"num_tokens": 8580249.0,
"step": 2660
},
{
"entropy": 6.795589780807495,
"epoch": 5.3196803196803195,
"grad_norm": 0.96484375,
"learning_rate": 0.00033368933891522685,
"loss": 6.1552,
"mean_token_accuracy": 0.147729279845953,
"num_tokens": 8596112.0,
"step": 2665
},
{
"entropy": 6.78569598197937,
"epoch": 5.329670329670329,
"grad_norm": 1.015625,
"learning_rate": 0.0003328359034895894,
"loss": 6.1751,
"mean_token_accuracy": 0.1452673152089119,
"num_tokens": 8611635.0,
"step": 2670
},
{
"entropy": 6.81738691329956,
"epoch": 5.339660339660339,
"grad_norm": 0.98828125,
"learning_rate": 0.00033198157616277387,
"loss": 6.2053,
"mean_token_accuracy": 0.1444336473941803,
"num_tokens": 8628466.0,
"step": 2675
},
{
"entropy": 6.836865377426148,
"epoch": 5.34965034965035,
"grad_norm": 0.88671875,
"learning_rate": 0.0003311263701095642,
"loss": 6.1745,
"mean_token_accuracy": 0.14085533171892167,
"num_tokens": 8645216.0,
"step": 2680
},
{
"entropy": 6.74297685623169,
"epoch": 5.35964035964036,
"grad_norm": 0.96484375,
"learning_rate": 0.000330270298518296,
"loss": 6.0872,
"mean_token_accuracy": 0.15877077728509903,
"num_tokens": 8661963.0,
"step": 2685
},
{
"entropy": 6.712607049942017,
"epoch": 5.36963036963037,
"grad_norm": 0.9375,
"learning_rate": 0.00032941337459065187,
"loss": 6.0998,
"mean_token_accuracy": 0.15611788034439086,
"num_tokens": 8679267.0,
"step": 2690
},
{
"entropy": 6.736807870864868,
"epoch": 5.37962037962038,
"grad_norm": 0.9453125,
"learning_rate": 0.0003285556115414591,
"loss": 6.0213,
"mean_token_accuracy": 0.16383236199617385,
"num_tokens": 8694975.0,
"step": 2695
},
{
"entropy": 6.690615606307984,
"epoch": 5.3896103896103895,
"grad_norm": 0.96875,
"learning_rate": 0.0003276970225984849,
"loss": 6.1027,
"mean_token_accuracy": 0.14643722102046014,
"num_tokens": 8709288.0,
"step": 2700
},
{
"entropy": 6.825256633758545,
"epoch": 5.399600399600399,
"grad_norm": 0.94140625,
"learning_rate": 0.0003268376210022329,
"loss": 6.2596,
"mean_token_accuracy": 0.1406122364103794,
"num_tokens": 8725984.0,
"step": 2705
},
{
"entropy": 6.7964051246643065,
"epoch": 5.409590409590409,
"grad_norm": 1.0234375,
"learning_rate": 0.0003259774200057389,
"loss": 6.2346,
"mean_token_accuracy": 0.13805721700191498,
"num_tokens": 8741847.0,
"step": 2710
},
{
"entropy": 6.787170267105102,
"epoch": 5.41958041958042,
"grad_norm": 0.94921875,
"learning_rate": 0.00032511643287436626,
"loss": 6.0868,
"mean_token_accuracy": 0.1611674025654793,
"num_tokens": 8759195.0,
"step": 2715
},
{
"entropy": 6.790749502182007,
"epoch": 5.42957042957043,
"grad_norm": 1.046875,
"learning_rate": 0.00032425467288560184,
"loss": 6.2106,
"mean_token_accuracy": 0.1481250897049904,
"num_tokens": 8776572.0,
"step": 2720
},
{
"entropy": 6.729101610183716,
"epoch": 5.43956043956044,
"grad_norm": 0.85546875,
"learning_rate": 0.0003233921533288505,
"loss": 6.1769,
"mean_token_accuracy": 0.1502446047961712,
"num_tokens": 8792760.0,
"step": 2725
},
{
"entropy": 6.85574860572815,
"epoch": 5.44955044955045,
"grad_norm": 0.95703125,
"learning_rate": 0.0003225288875052309,
"loss": 6.1796,
"mean_token_accuracy": 0.1519663080573082,
"num_tokens": 8808008.0,
"step": 2730
},
{
"entropy": 6.772447395324707,
"epoch": 5.4595404595404595,
"grad_norm": 0.859375,
"learning_rate": 0.00032166488872737006,
"loss": 6.2447,
"mean_token_accuracy": 0.14234700202941894,
"num_tokens": 8824637.0,
"step": 2735
},
{
"entropy": 6.805008840560913,
"epoch": 5.469530469530469,
"grad_norm": 0.9375,
"learning_rate": 0.0003208001703191977,
"loss": 6.1787,
"mean_token_accuracy": 0.1527337148785591,
"num_tokens": 8840686.0,
"step": 2740
},
{
"entropy": 6.7837025165557865,
"epoch": 5.479520479520479,
"grad_norm": 0.87109375,
"learning_rate": 0.00031993474561574153,
"loss": 6.256,
"mean_token_accuracy": 0.14082657918334007,
"num_tokens": 8859309.0,
"step": 2745
},
{
"entropy": 6.63448805809021,
"epoch": 5.489510489510489,
"grad_norm": 0.9453125,
"learning_rate": 0.0003190686279629211,
"loss": 5.9812,
"mean_token_accuracy": 0.15626030266284943,
"num_tokens": 8876230.0,
"step": 2750
},
{
"entropy": 6.840122938156128,
"epoch": 5.4995004995005,
"grad_norm": 0.93359375,
"learning_rate": 0.00031820183071734197,
"loss": 6.2296,
"mean_token_accuracy": 0.1374724492430687,
"num_tokens": 8892568.0,
"step": 2755
},
{
"entropy": 6.709605073928833,
"epoch": 5.50949050949051,
"grad_norm": 0.94140625,
"learning_rate": 0.00031733436724609005,
"loss": 6.1199,
"mean_token_accuracy": 0.15228664726018906,
"num_tokens": 8908826.0,
"step": 2760
},
{
"entropy": 6.76680850982666,
"epoch": 5.51948051948052,
"grad_norm": 0.8125,
"learning_rate": 0.00031646625092652506,
"loss": 6.1944,
"mean_token_accuracy": 0.1489237442612648,
"num_tokens": 8925892.0,
"step": 2765
},
{
"entropy": 6.749977159500122,
"epoch": 5.5294705294705295,
"grad_norm": 0.9453125,
"learning_rate": 0.0003155974951460745,
"loss": 6.1902,
"mean_token_accuracy": 0.14846026301383972,
"num_tokens": 8944276.0,
"step": 2770
},
{
"entropy": 6.794697666168213,
"epoch": 5.539460539460539,
"grad_norm": 0.93359375,
"learning_rate": 0.0003147281133020274,
"loss": 6.1979,
"mean_token_accuracy": 0.14596332460641862,
"num_tokens": 8960387.0,
"step": 2775
},
{
"entropy": 6.713502740859985,
"epoch": 5.549450549450549,
"grad_norm": 0.99609375,
"learning_rate": 0.0003138581188013271,
"loss": 6.1072,
"mean_token_accuracy": 0.15302377194166183,
"num_tokens": 8977366.0,
"step": 2780
},
{
"entropy": 6.782733058929443,
"epoch": 5.559440559440559,
"grad_norm": 0.90625,
"learning_rate": 0.0003129875250603651,
"loss": 6.1322,
"mean_token_accuracy": 0.14713452458381654,
"num_tokens": 8994217.0,
"step": 2785
},
{
"entropy": 6.758557415008545,
"epoch": 5.569430569430569,
"grad_norm": 0.953125,
"learning_rate": 0.00031211634550477397,
"loss": 6.2114,
"mean_token_accuracy": 0.1437595844268799,
"num_tokens": 9009782.0,
"step": 2790
},
{
"entropy": 6.554935073852539,
"epoch": 5.57942057942058,
"grad_norm": 0.9140625,
"learning_rate": 0.00031124459356921994,
"loss": 5.9289,
"mean_token_accuracy": 0.16744150817394257,
"num_tokens": 9026968.0,
"step": 2795
},
{
"entropy": 6.615646171569824,
"epoch": 5.58941058941059,
"grad_norm": 0.890625,
"learning_rate": 0.00031037228269719644,
"loss": 6.0043,
"mean_token_accuracy": 0.16536734253168106,
"num_tokens": 9044406.0,
"step": 2800
},
{
"entropy": 6.733282613754272,
"epoch": 5.5994005994005995,
"grad_norm": 0.90625,
"learning_rate": 0.00030949942634081614,
"loss": 6.1723,
"mean_token_accuracy": 0.15546176731586456,
"num_tokens": 9061333.0,
"step": 2805
},
{
"entropy": 6.590979480743409,
"epoch": 5.609390609390609,
"grad_norm": 0.87109375,
"learning_rate": 0.0003086260379606039,
"loss": 6.0079,
"mean_token_accuracy": 0.1656118005514145,
"num_tokens": 9079486.0,
"step": 2810
},
{
"entropy": 6.820206928253174,
"epoch": 5.619380619380619,
"grad_norm": 0.99609375,
"learning_rate": 0.0003077521310252889,
"loss": 6.2631,
"mean_token_accuracy": 0.14010816365480422,
"num_tokens": 9094409.0,
"step": 2815
},
{
"entropy": 6.764787817001343,
"epoch": 5.629370629370629,
"grad_norm": 0.9453125,
"learning_rate": 0.0003068777190115971,
"loss": 6.1876,
"mean_token_accuracy": 0.14723504558205605,
"num_tokens": 9110712.0,
"step": 2820
},
{
"entropy": 6.747758054733277,
"epoch": 5.639360639360639,
"grad_norm": 0.96484375,
"learning_rate": 0.0003060028154040436,
"loss": 6.1668,
"mean_token_accuracy": 0.15209394842386245,
"num_tokens": 9126426.0,
"step": 2825
},
{
"entropy": 6.803288507461548,
"epoch": 5.64935064935065,
"grad_norm": 0.9140625,
"learning_rate": 0.00030512743369472427,
"loss": 6.1557,
"mean_token_accuracy": 0.14992619454860687,
"num_tokens": 9142901.0,
"step": 2830
},
{
"entropy": 6.759994745254517,
"epoch": 5.65934065934066,
"grad_norm": 0.9765625,
"learning_rate": 0.0003042515873831079,
"loss": 6.1878,
"mean_token_accuracy": 0.14862883388996123,
"num_tokens": 9158974.0,
"step": 2835
},
{
"entropy": 6.736810684204102,
"epoch": 5.6693306693306695,
"grad_norm": 0.9921875,
"learning_rate": 0.00030337528997582817,
"loss": 6.1618,
"mean_token_accuracy": 0.15145443826913835,
"num_tokens": 9175144.0,
"step": 2840
},
{
"entropy": 6.772388362884522,
"epoch": 5.679320679320679,
"grad_norm": 0.98046875,
"learning_rate": 0.00030249855498647513,
"loss": 6.2011,
"mean_token_accuracy": 0.14533560425043107,
"num_tokens": 9190527.0,
"step": 2845
},
{
"entropy": 6.70671763420105,
"epoch": 5.689310689310689,
"grad_norm": 0.97265625,
"learning_rate": 0.00030162139593538687,
"loss": 6.1362,
"mean_token_accuracy": 0.15645534694194793,
"num_tokens": 9205161.0,
"step": 2850
},
{
"entropy": 6.652488327026367,
"epoch": 5.699300699300699,
"grad_norm": 0.86328125,
"learning_rate": 0.0003007438263494411,
"loss": 6.0405,
"mean_token_accuracy": 0.16484805941581726,
"num_tokens": 9219903.0,
"step": 2855
},
{
"entropy": 6.774199056625366,
"epoch": 5.709290709290709,
"grad_norm": 0.9765625,
"learning_rate": 0.0002998658597618463,
"loss": 6.2443,
"mean_token_accuracy": 0.14615929871797562,
"num_tokens": 9235352.0,
"step": 2860
},
{
"entropy": 6.834502792358398,
"epoch": 5.719280719280719,
"grad_norm": 0.984375,
"learning_rate": 0.0002989875097119335,
"loss": 6.2241,
"mean_token_accuracy": 0.14444975405931473,
"num_tokens": 9251192.0,
"step": 2865
},
{
"entropy": 6.7178901672363285,
"epoch": 5.729270729270729,
"grad_norm": 0.94921875,
"learning_rate": 0.000298108789744947,
"loss": 6.1513,
"mean_token_accuracy": 0.15107686445116997,
"num_tokens": 9266816.0,
"step": 2870
},
{
"entropy": 6.755792713165283,
"epoch": 5.7392607392607395,
"grad_norm": 1.015625,
"learning_rate": 0.0002972297134118356,
"loss": 6.2339,
"mean_token_accuracy": 0.1452716678380966,
"num_tokens": 9283248.0,
"step": 2875
},
{
"entropy": 6.7064189434051515,
"epoch": 5.749250749250749,
"grad_norm": 1.0078125,
"learning_rate": 0.0002963502942690441,
"loss": 6.094,
"mean_token_accuracy": 0.16428667902946473,
"num_tokens": 9300098.0,
"step": 2880
},
{
"entropy": 6.7218194007873535,
"epoch": 5.759240759240759,
"grad_norm": 0.9140625,
"learning_rate": 0.0002954705458783033,
"loss": 6.037,
"mean_token_accuracy": 0.14957161098718644,
"num_tokens": 9315295.0,
"step": 2885
},
{
"entropy": 6.6549944400787355,
"epoch": 5.769230769230769,
"grad_norm": 0.9375,
"learning_rate": 0.00029459048180642176,
"loss": 6.0487,
"mean_token_accuracy": 0.16057559698820115,
"num_tokens": 9330543.0,
"step": 2890
},
{
"entropy": 6.823046875,
"epoch": 5.779220779220779,
"grad_norm": 0.875,
"learning_rate": 0.0002937101156250763,
"loss": 6.3435,
"mean_token_accuracy": 0.1340113826096058,
"num_tokens": 9347648.0,
"step": 2895
},
{
"entropy": 6.738254690170288,
"epoch": 5.789210789210789,
"grad_norm": 0.89453125,
"learning_rate": 0.0002928294609106022,
"loss": 6.1946,
"mean_token_accuracy": 0.1494604006409645,
"num_tokens": 9363449.0,
"step": 2900
},
{
"entropy": 6.779056024551392,
"epoch": 5.799200799200799,
"grad_norm": 0.984375,
"learning_rate": 0.0002919485312437849,
"loss": 6.2378,
"mean_token_accuracy": 0.14085338786244392,
"num_tokens": 9379076.0,
"step": 2905
},
{
"entropy": 6.701514196395874,
"epoch": 5.8091908091908095,
"grad_norm": 0.890625,
"learning_rate": 0.00029106734020964946,
"loss": 6.0894,
"mean_token_accuracy": 0.15330516248941423,
"num_tokens": 9395189.0,
"step": 2910
},
{
"entropy": 6.644832420349121,
"epoch": 5.819180819180819,
"grad_norm": 0.8828125,
"learning_rate": 0.00029018590139725175,
"loss": 6.0975,
"mean_token_accuracy": 0.15905272886157035,
"num_tokens": 9412628.0,
"step": 2915
},
{
"entropy": 6.78626971244812,
"epoch": 5.829170829170829,
"grad_norm": 1.0625,
"learning_rate": 0.0002893042283994686,
"loss": 6.21,
"mean_token_accuracy": 0.1535573847591877,
"num_tokens": 9428611.0,
"step": 2920
},
{
"entropy": 6.741098833084107,
"epoch": 5.839160839160839,
"grad_norm": 0.97265625,
"learning_rate": 0.0002884223348127885,
"loss": 6.216,
"mean_token_accuracy": 0.1457300677895546,
"num_tokens": 9443061.0,
"step": 2925
},
{
"entropy": 6.764222621917725,
"epoch": 5.849150849150849,
"grad_norm": 0.94140625,
"learning_rate": 0.00028754023423710115,
"loss": 6.1228,
"mean_token_accuracy": 0.1505616247653961,
"num_tokens": 9460297.0,
"step": 2930
},
{
"entropy": 6.7355364799499515,
"epoch": 5.859140859140859,
"grad_norm": 0.93359375,
"learning_rate": 0.0002866579402754891,
"loss": 6.2792,
"mean_token_accuracy": 0.14343006461858748,
"num_tokens": 9476084.0,
"step": 2935
},
{
"entropy": 6.835593891143799,
"epoch": 5.869130869130869,
"grad_norm": 1.0,
"learning_rate": 0.0002857754665340162,
"loss": 6.2601,
"mean_token_accuracy": 0.14737984538078308,
"num_tokens": 9491797.0,
"step": 2940
},
{
"entropy": 6.735013103485107,
"epoch": 5.8791208791208796,
"grad_norm": 0.8984375,
"learning_rate": 0.00028489282662151963,
"loss": 6.2271,
"mean_token_accuracy": 0.14730442240834235,
"num_tokens": 9508132.0,
"step": 2945
},
{
"entropy": 6.7681694507598875,
"epoch": 5.889110889110889,
"grad_norm": 1.046875,
"learning_rate": 0.00028401003414939855,
"loss": 6.2146,
"mean_token_accuracy": 0.1433539569377899,
"num_tokens": 9522829.0,
"step": 2950
},
{
"entropy": 6.827762079238892,
"epoch": 5.899100899100899,
"grad_norm": 0.92578125,
"learning_rate": 0.00028312710273140486,
"loss": 6.2209,
"mean_token_accuracy": 0.1427636742591858,
"num_tokens": 9539765.0,
"step": 2955
},
{
"entropy": 6.7047460079193115,
"epoch": 5.909090909090909,
"grad_norm": 0.984375,
"learning_rate": 0.0002822440459834334,
"loss": 6.1373,
"mean_token_accuracy": 0.15112546533346177,
"num_tokens": 9556115.0,
"step": 2960
},
{
"entropy": 6.693974304199219,
"epoch": 5.919080919080919,
"grad_norm": 0.95703125,
"learning_rate": 0.00028136087752331153,
"loss": 6.1997,
"mean_token_accuracy": 0.14960069656372071,
"num_tokens": 9572055.0,
"step": 2965
},
{
"entropy": 6.7659505844116214,
"epoch": 5.929070929070929,
"grad_norm": 0.96484375,
"learning_rate": 0.0002804776109705895,
"loss": 6.2547,
"mean_token_accuracy": 0.14203526228666305,
"num_tokens": 9588193.0,
"step": 2970
},
{
"entropy": 6.758017873764038,
"epoch": 5.939060939060939,
"grad_norm": 0.94921875,
"learning_rate": 0.0002795942599463301,
"loss": 6.221,
"mean_token_accuracy": 0.14382123649120332,
"num_tokens": 9603330.0,
"step": 2975
},
{
"entropy": 6.736752033233643,
"epoch": 5.949050949050949,
"grad_norm": 0.953125,
"learning_rate": 0.00027871083807289905,
"loss": 6.1896,
"mean_token_accuracy": 0.15268184915184974,
"num_tokens": 9620703.0,
"step": 2980
},
{
"entropy": 6.779514265060425,
"epoch": 5.959040959040959,
"grad_norm": 0.96875,
"learning_rate": 0.0002778273589737544,
"loss": 6.2397,
"mean_token_accuracy": 0.14332889392971992,
"num_tokens": 9636420.0,
"step": 2985
},
{
"entropy": 6.694042062759399,
"epoch": 5.969030969030969,
"grad_norm": 0.90234375,
"learning_rate": 0.0002769438362732367,
"loss": 6.1708,
"mean_token_accuracy": 0.15217726826667785,
"num_tokens": 9653595.0,
"step": 2990
},
{
"entropy": 6.753486251831054,
"epoch": 5.979020979020979,
"grad_norm": 0.984375,
"learning_rate": 0.00027606028359635897,
"loss": 6.0968,
"mean_token_accuracy": 0.15684330314397812,
"num_tokens": 9670460.0,
"step": 2995
},
{
"entropy": 6.663070583343506,
"epoch": 5.989010989010989,
"grad_norm": 0.94921875,
"learning_rate": 0.0002751767145685967,
"loss": 6.1541,
"mean_token_accuracy": 0.15319789946079254,
"num_tokens": 9686872.0,
"step": 3000
},
{
"epoch": 5.989010989010989,
"eval_entropy": 6.5131735311972125,
"eval_loss": 7.009202480316162,
"eval_mean_token_accuracy": 0.11367595379014273,
"eval_num_tokens": 9686872.0,
"eval_runtime": 1.1756,
"eval_samples_per_second": 1253.854,
"eval_steps_per_second": 157.37,
"step": 3000
},
{
"entropy": 6.667050361633301,
"epoch": 5.999000999000999,
"grad_norm": 1.09375,
"learning_rate": 0.00027429314281567714,
"loss": 6.1054,
"mean_token_accuracy": 0.1524140864610672,
"num_tokens": 9701973.0,
"step": 3005
},
{
"entropy": 6.811369631025526,
"epoch": 6.007992007992008,
"grad_norm": 0.84765625,
"learning_rate": 0.00027340958196336976,
"loss": 5.9272,
"mean_token_accuracy": 0.15800701909595066,
"num_tokens": 9714961.0,
"step": 3010
},
{
"entropy": 6.794833135604859,
"epoch": 6.017982017982018,
"grad_norm": 0.89453125,
"learning_rate": 0.00027252604563727595,
"loss": 6.0496,
"mean_token_accuracy": 0.14867913946509362,
"num_tokens": 9731013.0,
"step": 3015
},
{
"entropy": 6.725656223297119,
"epoch": 6.027972027972028,
"grad_norm": 0.9453125,
"learning_rate": 0.00027164254746261875,
"loss": 5.9168,
"mean_token_accuracy": 0.1591576501727104,
"num_tokens": 9746223.0,
"step": 3020
},
{
"entropy": 6.70501480102539,
"epoch": 6.037962037962038,
"grad_norm": 0.90625,
"learning_rate": 0.0002707591010640332,
"loss": 5.8616,
"mean_token_accuracy": 0.16593915671110154,
"num_tokens": 9762626.0,
"step": 3025
},
{
"entropy": 6.698665618896484,
"epoch": 6.047952047952048,
"grad_norm": 0.9609375,
"learning_rate": 0.0002698757200653554,
"loss": 5.8605,
"mean_token_accuracy": 0.1670130595564842,
"num_tokens": 9778563.0,
"step": 3030
},
{
"entropy": 6.726486110687256,
"epoch": 6.057942057942058,
"grad_norm": 0.9140625,
"learning_rate": 0.00026899241808941326,
"loss": 5.9336,
"mean_token_accuracy": 0.15832085609436036,
"num_tokens": 9795250.0,
"step": 3035
},
{
"entropy": 6.718913221359253,
"epoch": 6.067932067932068,
"grad_norm": 0.96875,
"learning_rate": 0.0002681092087578159,
"loss": 5.9569,
"mean_token_accuracy": 0.15379346162080765,
"num_tokens": 9810695.0,
"step": 3040
},
{
"entropy": 6.479945373535156,
"epoch": 6.077922077922078,
"grad_norm": 0.94140625,
"learning_rate": 0.0002672261056907437,
"loss": 5.6432,
"mean_token_accuracy": 0.18392495214939117,
"num_tokens": 9826980.0,
"step": 3045
},
{
"entropy": 6.660666799545288,
"epoch": 6.087912087912088,
"grad_norm": 0.8125,
"learning_rate": 0.00026634312250673863,
"loss": 5.8529,
"mean_token_accuracy": 0.16628624498844147,
"num_tokens": 9842464.0,
"step": 3050
},
{
"entropy": 6.635022068023682,
"epoch": 6.0979020979020975,
"grad_norm": 0.94921875,
"learning_rate": 0.0002654602728224936,
"loss": 5.8526,
"mean_token_accuracy": 0.17187197804450988,
"num_tokens": 9858358.0,
"step": 3055
},
{
"entropy": 6.732779121398925,
"epoch": 6.107892107892108,
"grad_norm": 0.96875,
"learning_rate": 0.00026457757025264274,
"loss": 5.982,
"mean_token_accuracy": 0.1538893237709999,
"num_tokens": 9875970.0,
"step": 3060
},
{
"entropy": 6.8009437084197994,
"epoch": 6.117882117882118,
"grad_norm": 1.0,
"learning_rate": 0.0002636950284095519,
"loss": 6.004,
"mean_token_accuracy": 0.16047981530427932,
"num_tokens": 9891790.0,
"step": 3065
},
{
"entropy": 6.659499311447144,
"epoch": 6.127872127872128,
"grad_norm": 1.0234375,
"learning_rate": 0.0002628126609031078,
"loss": 5.9457,
"mean_token_accuracy": 0.16013357043266296,
"num_tokens": 9906510.0,
"step": 3070
},
{
"entropy": 6.662178611755371,
"epoch": 6.137862137862138,
"grad_norm": 1.046875,
"learning_rate": 0.000261930481340509,
"loss": 5.8334,
"mean_token_accuracy": 0.17112718373537064,
"num_tokens": 9921934.0,
"step": 3075
},
{
"entropy": 6.543264293670655,
"epoch": 6.147852147852148,
"grad_norm": 1.046875,
"learning_rate": 0.00026104850332605575,
"loss": 5.7794,
"mean_token_accuracy": 0.17351728826761245,
"num_tokens": 9937791.0,
"step": 3080
},
{
"entropy": 6.751798915863037,
"epoch": 6.157842157842158,
"grad_norm": 1.03125,
"learning_rate": 0.00026016674046093995,
"loss": 5.9961,
"mean_token_accuracy": 0.15603744834661484,
"num_tokens": 9952832.0,
"step": 3085
},
{
"entropy": 6.6119616508483885,
"epoch": 6.1678321678321675,
"grad_norm": 0.984375,
"learning_rate": 0.00025928520634303597,
"loss": 5.7803,
"mean_token_accuracy": 0.17755611389875411,
"num_tokens": 9968868.0,
"step": 3090
},
{
"entropy": 6.674328279495239,
"epoch": 6.177822177822178,
"grad_norm": 1.0390625,
"learning_rate": 0.0002584039145666903,
"loss": 5.9854,
"mean_token_accuracy": 0.153406497836113,
"num_tokens": 9985335.0,
"step": 3095
},
{
"entropy": 6.702618741989136,
"epoch": 6.187812187812188,
"grad_norm": 0.984375,
"learning_rate": 0.0002575228787225122,
"loss": 5.8918,
"mean_token_accuracy": 0.1584560126066208,
"num_tokens": 10001340.0,
"step": 3100
},
{
"entropy": 6.719108009338379,
"epoch": 6.197802197802198,
"grad_norm": 1.015625,
"learning_rate": 0.00025664211239716456,
"loss": 6.0052,
"mean_token_accuracy": 0.15488356947898865,
"num_tokens": 10017113.0,
"step": 3105
},
{
"entropy": 6.730152177810669,
"epoch": 6.207792207792208,
"grad_norm": 1.0,
"learning_rate": 0.00025576162917315354,
"loss": 5.9705,
"mean_token_accuracy": 0.15568059384822847,
"num_tokens": 10033608.0,
"step": 3110
},
{
"entropy": 6.674771642684936,
"epoch": 6.217782217782218,
"grad_norm": 0.9296875,
"learning_rate": 0.0002548814426286196,
"loss": 5.9112,
"mean_token_accuracy": 0.16848817467689514,
"num_tokens": 10050082.0,
"step": 3115
},
{
"entropy": 6.667506265640259,
"epoch": 6.227772227772228,
"grad_norm": 0.84765625,
"learning_rate": 0.0002540015663371282,
"loss": 5.9034,
"mean_token_accuracy": 0.16528174877166749,
"num_tokens": 10066461.0,
"step": 3120
},
{
"entropy": 6.715219736099243,
"epoch": 6.2377622377622375,
"grad_norm": 0.9921875,
"learning_rate": 0.0002531220138674601,
"loss": 5.917,
"mean_token_accuracy": 0.15922432541847228,
"num_tokens": 10082732.0,
"step": 3125
},
{
"entropy": 6.733363628387451,
"epoch": 6.247752247752247,
"grad_norm": 1.0390625,
"learning_rate": 0.00025224279878340266,
"loss": 5.9678,
"mean_token_accuracy": 0.1561704620718956,
"num_tokens": 10098532.0,
"step": 3130
},
{
"entropy": 6.467260646820068,
"epoch": 6.257742257742258,
"grad_norm": 0.86328125,
"learning_rate": 0.00025136393464353997,
"loss": 5.7319,
"mean_token_accuracy": 0.17858326733112334,
"num_tokens": 10115699.0,
"step": 3135
},
{
"entropy": 6.670676136016846,
"epoch": 6.267732267732268,
"grad_norm": 0.93359375,
"learning_rate": 0.0002504854350010442,
"loss": 5.8802,
"mean_token_accuracy": 0.16762400567531585,
"num_tokens": 10132737.0,
"step": 3140
},
{
"entropy": 6.539636659622192,
"epoch": 6.277722277722278,
"grad_norm": 0.95703125,
"learning_rate": 0.00024960731340346664,
"loss": 5.7859,
"mean_token_accuracy": 0.17589905112981796,
"num_tokens": 10151355.0,
"step": 3145
},
{
"entropy": 6.598786783218384,
"epoch": 6.287712287712288,
"grad_norm": 0.9375,
"learning_rate": 0.00024872958339252867,
"loss": 5.8141,
"mean_token_accuracy": 0.1812353700399399,
"num_tokens": 10168882.0,
"step": 3150
},
{
"entropy": 6.66910457611084,
"epoch": 6.297702297702298,
"grad_norm": 0.87109375,
"learning_rate": 0.0002478522585039129,
"loss": 5.9243,
"mean_token_accuracy": 0.165535007417202,
"num_tokens": 10186027.0,
"step": 3155
},
{
"entropy": 6.616514539718628,
"epoch": 6.3076923076923075,
"grad_norm": 1.015625,
"learning_rate": 0.00024697535226705437,
"loss": 5.8731,
"mean_token_accuracy": 0.16666304916143418,
"num_tokens": 10202961.0,
"step": 3160
},
{
"entropy": 6.683314466476441,
"epoch": 6.317682317682317,
"grad_norm": 0.98828125,
"learning_rate": 0.00024609887820493183,
"loss": 5.9605,
"mean_token_accuracy": 0.1603623390197754,
"num_tokens": 10220049.0,
"step": 3165
},
{
"entropy": 6.586607599258423,
"epoch": 6.327672327672328,
"grad_norm": 1.0390625,
"learning_rate": 0.00024522284983385993,
"loss": 5.8334,
"mean_token_accuracy": 0.17442394644021988,
"num_tokens": 10236202.0,
"step": 3170
},
{
"entropy": 6.744188976287842,
"epoch": 6.337662337662338,
"grad_norm": 0.97265625,
"learning_rate": 0.0002443472806632797,
"loss": 5.9936,
"mean_token_accuracy": 0.14994580149650574,
"num_tokens": 10252744.0,
"step": 3175
},
{
"entropy": 6.680088901519776,
"epoch": 6.347652347652348,
"grad_norm": 0.9765625,
"learning_rate": 0.0002434721841955508,
"loss": 5.9764,
"mean_token_accuracy": 0.15999541878700257,
"num_tokens": 10270116.0,
"step": 3180
},
{
"entropy": 6.6716166019439695,
"epoch": 6.357642357642358,
"grad_norm": 1.015625,
"learning_rate": 0.00024259757392574327,
"loss": 5.9068,
"mean_token_accuracy": 0.16267402321100236,
"num_tokens": 10285535.0,
"step": 3185
},
{
"entropy": 6.605439949035644,
"epoch": 6.367632367632368,
"grad_norm": 1.0234375,
"learning_rate": 0.00024172346334142957,
"loss": 5.8611,
"mean_token_accuracy": 0.16832938343286513,
"num_tokens": 10301885.0,
"step": 3190
},
{
"entropy": 6.622616386413574,
"epoch": 6.3776223776223775,
"grad_norm": 0.94140625,
"learning_rate": 0.0002408498659224762,
"loss": 5.883,
"mean_token_accuracy": 0.16275829821825027,
"num_tokens": 10318652.0,
"step": 3195
},
{
"entropy": 6.561596488952636,
"epoch": 6.387612387612387,
"grad_norm": 0.98828125,
"learning_rate": 0.00023997679514083616,
"loss": 5.7633,
"mean_token_accuracy": 0.17888872176408768,
"num_tokens": 10335472.0,
"step": 3200
},
{
"entropy": 6.770061922073364,
"epoch": 6.397602397602397,
"grad_norm": 1.1328125,
"learning_rate": 0.00023910426446034056,
"loss": 5.9736,
"mean_token_accuracy": 0.1615581527352333,
"num_tokens": 10351765.0,
"step": 3205
},
{
"entropy": 6.618225193023681,
"epoch": 6.407592407592408,
"grad_norm": 1.03125,
"learning_rate": 0.00023823228733649228,
"loss": 5.8996,
"mean_token_accuracy": 0.16589005142450333,
"num_tokens": 10367785.0,
"step": 3210
},
{
"entropy": 6.701905727386475,
"epoch": 6.417582417582418,
"grad_norm": 1.0390625,
"learning_rate": 0.00023736087721625704,
"loss": 5.9601,
"mean_token_accuracy": 0.15581939220428467,
"num_tokens": 10383321.0,
"step": 3215
},
{
"entropy": 6.667162084579468,
"epoch": 6.427572427572428,
"grad_norm": 0.97265625,
"learning_rate": 0.00023649004753785696,
"loss": 5.9097,
"mean_token_accuracy": 0.16299981772899627,
"num_tokens": 10400408.0,
"step": 3220
},
{
"entropy": 6.713379383087158,
"epoch": 6.437562437562438,
"grad_norm": 1.0703125,
"learning_rate": 0.0002356198117305629,
"loss": 5.9304,
"mean_token_accuracy": 0.15914269238710405,
"num_tokens": 10416081.0,
"step": 3225
},
{
"entropy": 6.6272495746612545,
"epoch": 6.4475524475524475,
"grad_norm": 0.8828125,
"learning_rate": 0.00023475018321448754,
"loss": 5.9052,
"mean_token_accuracy": 0.16455738097429276,
"num_tokens": 10433592.0,
"step": 3230
},
{
"entropy": 6.607774972915649,
"epoch": 6.457542457542457,
"grad_norm": 0.8984375,
"learning_rate": 0.0002338811754003785,
"loss": 5.8565,
"mean_token_accuracy": 0.16780562996864318,
"num_tokens": 10451316.0,
"step": 3235
},
{
"entropy": 6.640334224700927,
"epoch": 6.467532467532467,
"grad_norm": 1.0390625,
"learning_rate": 0.00023301280168941114,
"loss": 5.956,
"mean_token_accuracy": 0.15648091286420823,
"num_tokens": 10466541.0,
"step": 3240
},
{
"entropy": 6.626655054092407,
"epoch": 6.477522477522477,
"grad_norm": 0.94140625,
"learning_rate": 0.0002321450754729823,
"loss": 5.9533,
"mean_token_accuracy": 0.15833957493305206,
"num_tokens": 10482801.0,
"step": 3245
},
{
"entropy": 6.74118275642395,
"epoch": 6.487512487512488,
"grad_norm": 0.984375,
"learning_rate": 0.00023127801013250377,
"loss": 6.0075,
"mean_token_accuracy": 0.15086964070796965,
"num_tokens": 10498760.0,
"step": 3250
},
{
"entropy": 6.7118512153625485,
"epoch": 6.497502497502498,
"grad_norm": 1.1328125,
"learning_rate": 0.00023041161903919566,
"loss": 6.0083,
"mean_token_accuracy": 0.15017944872379302,
"num_tokens": 10514201.0,
"step": 3255
},
{
"entropy": 6.69952392578125,
"epoch": 6.507492507492508,
"grad_norm": 1.0703125,
"learning_rate": 0.00022954591555388043,
"loss": 5.9465,
"mean_token_accuracy": 0.16899550408124925,
"num_tokens": 10528651.0,
"step": 3260
},
{
"entropy": 6.703047037124634,
"epoch": 6.5174825174825175,
"grad_norm": 1.0859375,
"learning_rate": 0.00022868091302677678,
"loss": 6.0349,
"mean_token_accuracy": 0.15120028406381608,
"num_tokens": 10544164.0,
"step": 3265
},
{
"entropy": 6.736421346664429,
"epoch": 6.527472527472527,
"grad_norm": 0.984375,
"learning_rate": 0.00022781662479729354,
"loss": 6.0292,
"mean_token_accuracy": 0.15082689970731736,
"num_tokens": 10561337.0,
"step": 3270
},
{
"entropy": 6.639842367172241,
"epoch": 6.537462537462537,
"grad_norm": 0.9453125,
"learning_rate": 0.00022695306419382472,
"loss": 5.9328,
"mean_token_accuracy": 0.16010500639677047,
"num_tokens": 10577567.0,
"step": 3275
},
{
"entropy": 6.616949653625488,
"epoch": 6.547452547452547,
"grad_norm": 1.0703125,
"learning_rate": 0.00022609024453354283,
"loss": 5.8235,
"mean_token_accuracy": 0.1706709787249565,
"num_tokens": 10594767.0,
"step": 3280
},
{
"entropy": 6.635041046142578,
"epoch": 6.557442557442558,
"grad_norm": 0.9765625,
"learning_rate": 0.00022522817912219446,
"loss": 5.8821,
"mean_token_accuracy": 0.16167248860001565,
"num_tokens": 10610594.0,
"step": 3285
},
{
"entropy": 6.632221508026123,
"epoch": 6.567432567432568,
"grad_norm": 0.9375,
"learning_rate": 0.00022436688125389466,
"loss": 5.8474,
"mean_token_accuracy": 0.16641118377447128,
"num_tokens": 10627698.0,
"step": 3290
},
{
"entropy": 6.583418893814087,
"epoch": 6.577422577422578,
"grad_norm": 0.9921875,
"learning_rate": 0.00022350636421092213,
"loss": 5.8707,
"mean_token_accuracy": 0.16971496865153313,
"num_tokens": 10645744.0,
"step": 3295
},
{
"entropy": 6.7090983390808105,
"epoch": 6.5874125874125875,
"grad_norm": 1.03125,
"learning_rate": 0.0002226466412635141,
"loss": 6.034,
"mean_token_accuracy": 0.14708581790328026,
"num_tokens": 10661896.0,
"step": 3300
},
{
"entropy": 6.669993305206299,
"epoch": 6.597402597402597,
"grad_norm": 1.0390625,
"learning_rate": 0.00022178772566966198,
"loss": 5.9026,
"mean_token_accuracy": 0.16566328555345536,
"num_tokens": 10677241.0,
"step": 3305
},
{
"entropy": 6.60449252128601,
"epoch": 6.607392607392607,
"grad_norm": 1.0390625,
"learning_rate": 0.00022092963067490667,
"loss": 5.8478,
"mean_token_accuracy": 0.17454764544963836,
"num_tokens": 10692716.0,
"step": 3310
},
{
"entropy": 6.557140254974366,
"epoch": 6.617382617382617,
"grad_norm": 1.0078125,
"learning_rate": 0.0002200723695121347,
"loss": 5.8662,
"mean_token_accuracy": 0.16653716638684274,
"num_tokens": 10709061.0,
"step": 3315
},
{
"entropy": 6.741697168350219,
"epoch": 6.627372627372627,
"grad_norm": 1.109375,
"learning_rate": 0.0002192159554013735,
"loss": 5.9052,
"mean_token_accuracy": 0.16193668246269227,
"num_tokens": 10723779.0,
"step": 3320
},
{
"entropy": 6.678752851486206,
"epoch": 6.637362637362637,
"grad_norm": 1.0703125,
"learning_rate": 0.0002183604015495882,
"loss": 6.0355,
"mean_token_accuracy": 0.15054982751607895,
"num_tokens": 10739434.0,
"step": 3325
},
{
"entropy": 6.753955078125,
"epoch": 6.647352647352648,
"grad_norm": 1.03125,
"learning_rate": 0.00021750572115047744,
"loss": 6.0001,
"mean_token_accuracy": 0.1533624932169914,
"num_tokens": 10755673.0,
"step": 3330
},
{
"entropy": 6.688982105255127,
"epoch": 6.6573426573426575,
"grad_norm": 1.1171875,
"learning_rate": 0.00021665192738427037,
"loss": 5.9595,
"mean_token_accuracy": 0.15226165056228638,
"num_tokens": 10771391.0,
"step": 3335
},
{
"entropy": 6.657888507843017,
"epoch": 6.667332667332667,
"grad_norm": 1.015625,
"learning_rate": 0.00021579903341752311,
"loss": 5.9731,
"mean_token_accuracy": 0.15780570358037949,
"num_tokens": 10786521.0,
"step": 3340
},
{
"entropy": 6.692771291732788,
"epoch": 6.677322677322677,
"grad_norm": 1.0234375,
"learning_rate": 0.00021494705240291556,
"loss": 5.9591,
"mean_token_accuracy": 0.15971760749816893,
"num_tokens": 10802521.0,
"step": 3345
},
{
"entropy": 6.6980222225189205,
"epoch": 6.687312687312687,
"grad_norm": 1.09375,
"learning_rate": 0.00021409599747904896,
"loss": 5.9931,
"mean_token_accuracy": 0.1567689597606659,
"num_tokens": 10817993.0,
"step": 3350
},
{
"entropy": 6.713626289367676,
"epoch": 6.697302697302697,
"grad_norm": 1.0546875,
"learning_rate": 0.00021324588177024307,
"loss": 6.0065,
"mean_token_accuracy": 0.1490321561694145,
"num_tokens": 10834115.0,
"step": 3355
},
{
"entropy": 6.66970043182373,
"epoch": 6.707292707292707,
"grad_norm": 1.0625,
"learning_rate": 0.0002123967183863338,
"loss": 5.9272,
"mean_token_accuracy": 0.16388960182666779,
"num_tokens": 10849695.0,
"step": 3360
},
{
"entropy": 6.626486682891846,
"epoch": 6.717282717282718,
"grad_norm": 1.0546875,
"learning_rate": 0.00021154852042247092,
"loss": 5.9096,
"mean_token_accuracy": 0.16861118227243424,
"num_tokens": 10866950.0,
"step": 3365
},
{
"entropy": 6.742733383178711,
"epoch": 6.7272727272727275,
"grad_norm": 1.1171875,
"learning_rate": 0.00021070130095891628,
"loss": 6.0537,
"mean_token_accuracy": 0.15284008532762527,
"num_tokens": 10882035.0,
"step": 3370
},
{
"entropy": 6.651487350463867,
"epoch": 6.737262737262737,
"grad_norm": 0.9921875,
"learning_rate": 0.00020985507306084218,
"loss": 5.9644,
"mean_token_accuracy": 0.16457273215055465,
"num_tokens": 10898811.0,
"step": 3375
},
{
"entropy": 6.707548761367798,
"epoch": 6.747252747252747,
"grad_norm": 0.953125,
"learning_rate": 0.00020900984977812964,
"loss": 6.0446,
"mean_token_accuracy": 0.1516970418393612,
"num_tokens": 10914701.0,
"step": 3380
},
{
"entropy": 6.699026727676392,
"epoch": 6.757242757242757,
"grad_norm": 1.0234375,
"learning_rate": 0.0002081656441451672,
"loss": 6.0143,
"mean_token_accuracy": 0.15427461713552476,
"num_tokens": 10931773.0,
"step": 3385
},
{
"entropy": 6.6985736846923825,
"epoch": 6.767232767232767,
"grad_norm": 1.0546875,
"learning_rate": 0.00020732246918065005,
"loss": 5.9973,
"mean_token_accuracy": 0.15959020256996154,
"num_tokens": 10947929.0,
"step": 3390
},
{
"entropy": 6.68319182395935,
"epoch": 6.777222777222777,
"grad_norm": 1.0625,
"learning_rate": 0.00020648033788737914,
"loss": 6.0279,
"mean_token_accuracy": 0.15430406481027603,
"num_tokens": 10964798.0,
"step": 3395
},
{
"entropy": 6.675410461425781,
"epoch": 6.787212787212788,
"grad_norm": 1.09375,
"learning_rate": 0.00020563926325206094,
"loss": 5.9146,
"mean_token_accuracy": 0.16917263716459274,
"num_tokens": 10980815.0,
"step": 3400
},
{
"entropy": 6.660783338546753,
"epoch": 6.7972027972027975,
"grad_norm": 1.03125,
"learning_rate": 0.0002047992582451067,
"loss": 5.9614,
"mean_token_accuracy": 0.1624804586172104,
"num_tokens": 10997366.0,
"step": 3405
},
{
"entropy": 6.663835954666138,
"epoch": 6.807192807192807,
"grad_norm": 1.0078125,
"learning_rate": 0.0002039603358204328,
"loss": 5.9983,
"mean_token_accuracy": 0.15653773844242097,
"num_tokens": 11013609.0,
"step": 3410
},
{
"entropy": 6.603413772583008,
"epoch": 6.817182817182817,
"grad_norm": 0.93359375,
"learning_rate": 0.00020312250891526063,
"loss": 5.8663,
"mean_token_accuracy": 0.166923126578331,
"num_tokens": 11029362.0,
"step": 3415
},
{
"entropy": 6.613164949417114,
"epoch": 6.827172827172827,
"grad_norm": 0.99609375,
"learning_rate": 0.00020228579044991786,
"loss": 5.9028,
"mean_token_accuracy": 0.17450464218854905,
"num_tokens": 11046414.0,
"step": 3420
},
{
"entropy": 6.673628473281861,
"epoch": 6.837162837162837,
"grad_norm": 1.0390625,
"learning_rate": 0.000201450193327638,
"loss": 5.9125,
"mean_token_accuracy": 0.16300807595252992,
"num_tokens": 11062717.0,
"step": 3425
},
{
"entropy": 6.690763187408447,
"epoch": 6.847152847152847,
"grad_norm": 1.0078125,
"learning_rate": 0.00020061573043436243,
"loss": 5.9264,
"mean_token_accuracy": 0.15790411382913588,
"num_tokens": 11078471.0,
"step": 3430
},
{
"entropy": 6.696146726608276,
"epoch": 6.857142857142857,
"grad_norm": 0.99609375,
"learning_rate": 0.0001997824146385413,
"loss": 6.026,
"mean_token_accuracy": 0.1504951074719429,
"num_tokens": 11094232.0,
"step": 3435
},
{
"entropy": 6.708989524841309,
"epoch": 6.867132867132867,
"grad_norm": 0.890625,
"learning_rate": 0.0001989502587909351,
"loss": 5.9691,
"mean_token_accuracy": 0.15976719558238983,
"num_tokens": 11109229.0,
"step": 3440
},
{
"entropy": 6.651607513427734,
"epoch": 6.877122877122877,
"grad_norm": 1.046875,
"learning_rate": 0.0001981192757244163,
"loss": 5.8943,
"mean_token_accuracy": 0.16629891097545624,
"num_tokens": 11125114.0,
"step": 3445
},
{
"entropy": 6.711129951477051,
"epoch": 6.887112887112887,
"grad_norm": 0.99609375,
"learning_rate": 0.0001972894782537718,
"loss": 6.0519,
"mean_token_accuracy": 0.15405267030000686,
"num_tokens": 11140448.0,
"step": 3450
},
{
"entropy": 6.641443872451783,
"epoch": 6.897102897102897,
"grad_norm": 1.0234375,
"learning_rate": 0.00019646087917550505,
"loss": 5.9352,
"mean_token_accuracy": 0.168939571082592,
"num_tokens": 11157443.0,
"step": 3455
},
{
"entropy": 6.718652534484863,
"epoch": 6.907092907092907,
"grad_norm": 1.0703125,
"learning_rate": 0.00019563349126763902,
"loss": 5.9891,
"mean_token_accuracy": 0.15499554723501205,
"num_tokens": 11172803.0,
"step": 3460
},
{
"entropy": 6.705828380584717,
"epoch": 6.917082917082917,
"grad_norm": 1.1015625,
"learning_rate": 0.00019480732728951861,
"loss": 5.9615,
"mean_token_accuracy": 0.16026063561439513,
"num_tokens": 11188413.0,
"step": 3465
},
{
"entropy": 6.677292966842652,
"epoch": 6.927072927072927,
"grad_norm": 0.9296875,
"learning_rate": 0.0001939823999816145,
"loss": 6.0443,
"mean_token_accuracy": 0.15838810205459594,
"num_tokens": 11204696.0,
"step": 3470
},
{
"entropy": 6.653930139541626,
"epoch": 6.937062937062937,
"grad_norm": 1.046875,
"learning_rate": 0.00019315872206532615,
"loss": 5.9758,
"mean_token_accuracy": 0.16164977997541427,
"num_tokens": 11220370.0,
"step": 3475
},
{
"entropy": 6.59173583984375,
"epoch": 6.947052947052947,
"grad_norm": 1.0703125,
"learning_rate": 0.00019233630624278602,
"loss": 5.8121,
"mean_token_accuracy": 0.18040217757225036,
"num_tokens": 11236747.0,
"step": 3480
},
{
"entropy": 6.628941011428833,
"epoch": 6.957042957042957,
"grad_norm": 1.0390625,
"learning_rate": 0.00019151516519666357,
"loss": 5.9129,
"mean_token_accuracy": 0.16064394265413284,
"num_tokens": 11252983.0,
"step": 3485
},
{
"entropy": 6.6462867736816404,
"epoch": 6.967032967032967,
"grad_norm": 1.046875,
"learning_rate": 0.00019069531158996938,
"loss": 5.9991,
"mean_token_accuracy": 0.15687418431043626,
"num_tokens": 11268874.0,
"step": 3490
},
{
"entropy": 6.596605920791626,
"epoch": 6.977022977022977,
"grad_norm": 1.046875,
"learning_rate": 0.0001898767580658603,
"loss": 5.9186,
"mean_token_accuracy": 0.16048318147659302,
"num_tokens": 11284585.0,
"step": 3495
},
{
"entropy": 6.609864950180054,
"epoch": 6.987012987012987,
"grad_norm": 1.0,
"learning_rate": 0.0001890595172474443,
"loss": 5.8726,
"mean_token_accuracy": 0.16622989922761916,
"num_tokens": 11300532.0,
"step": 3500
},
{
"epoch": 6.987012987012987,
"eval_entropy": 6.5176446708473,
"eval_loss": 7.017940998077393,
"eval_mean_token_accuracy": 0.11280566020994573,
"eval_num_tokens": 11300532.0,
"eval_runtime": 1.1719,
"eval_samples_per_second": 1257.836,
"eval_steps_per_second": 157.869,
"step": 3500
},
{
"entropy": 6.663052368164062,
"epoch": 6.997002997002997,
"grad_norm": 1.046875,
"learning_rate": 0.0001882436017375858,
"loss": 5.983,
"mean_token_accuracy": 0.15732846558094024,
"num_tokens": 11315785.0,
"step": 3505
},
{
"entropy": 6.7186354001363116,
"epoch": 7.005994005994006,
"grad_norm": 0.90234375,
"learning_rate": 0.00018742902411871126,
"loss": 5.9485,
"mean_token_accuracy": 0.1631801277399063,
"num_tokens": 11330223.0,
"step": 3510
},
{
"entropy": 6.770174551010132,
"epoch": 7.015984015984016,
"grad_norm": 1.015625,
"learning_rate": 0.0001866157969526153,
"loss": 5.8788,
"mean_token_accuracy": 0.16505906283855437,
"num_tokens": 11345599.0,
"step": 3515
},
{
"entropy": 6.590628623962402,
"epoch": 7.025974025974026,
"grad_norm": 1.046875,
"learning_rate": 0.0001858039327802667,
"loss": 5.7034,
"mean_token_accuracy": 0.18024298250675203,
"num_tokens": 11360810.0,
"step": 3520
},
{
"entropy": 6.710958862304688,
"epoch": 7.035964035964036,
"grad_norm": 1.015625,
"learning_rate": 0.00018499344412161546,
"loss": 5.8469,
"mean_token_accuracy": 0.16105737686157226,
"num_tokens": 11377054.0,
"step": 3525
},
{
"entropy": 6.595843696594239,
"epoch": 7.045954045954046,
"grad_norm": 1.0546875,
"learning_rate": 0.00018418434347539924,
"loss": 5.6857,
"mean_token_accuracy": 0.18236356526613234,
"num_tokens": 11392176.0,
"step": 3530
},
{
"entropy": 6.686300468444824,
"epoch": 7.055944055944056,
"grad_norm": 1.09375,
"learning_rate": 0.000183376643318951,
"loss": 5.8602,
"mean_token_accuracy": 0.16392707526683808,
"num_tokens": 11408317.0,
"step": 3535
},
{
"entropy": 6.640545225143432,
"epoch": 7.065934065934066,
"grad_norm": 1.125,
"learning_rate": 0.00018257035610800616,
"loss": 5.7243,
"mean_token_accuracy": 0.1709170401096344,
"num_tokens": 11424129.0,
"step": 3540
},
{
"entropy": 6.7029365539550785,
"epoch": 7.075924075924076,
"grad_norm": 0.9609375,
"learning_rate": 0.00018176549427651107,
"loss": 5.8707,
"mean_token_accuracy": 0.15717865973711015,
"num_tokens": 11440980.0,
"step": 3545
},
{
"entropy": 6.645503759384155,
"epoch": 7.085914085914086,
"grad_norm": 1.078125,
"learning_rate": 0.00018096207023643085,
"loss": 5.7552,
"mean_token_accuracy": 0.17657144963741303,
"num_tokens": 11457537.0,
"step": 3550
},
{
"entropy": 6.592128705978394,
"epoch": 7.095904095904096,
"grad_norm": 1.046875,
"learning_rate": 0.000180160096377558,
"loss": 5.736,
"mean_token_accuracy": 0.17329273223876954,
"num_tokens": 11473485.0,
"step": 3555
},
{
"entropy": 6.5658777236938475,
"epoch": 7.105894105894106,
"grad_norm": 1.046875,
"learning_rate": 0.00017935958506732147,
"loss": 5.7199,
"mean_token_accuracy": 0.17719839811325072,
"num_tokens": 11489115.0,
"step": 3560
},
{
"entropy": 6.4145917892456055,
"epoch": 7.115884115884116,
"grad_norm": 0.890625,
"learning_rate": 0.00017856054865059617,
"loss": 5.5315,
"mean_token_accuracy": 0.1977701485157013,
"num_tokens": 11506112.0,
"step": 3565
},
{
"entropy": 6.563824701309204,
"epoch": 7.125874125874126,
"grad_norm": 1.1640625,
"learning_rate": 0.00017776299944951185,
"loss": 5.6643,
"mean_token_accuracy": 0.17600979059934616,
"num_tokens": 11522151.0,
"step": 3570
},
{
"entropy": 6.628887128829956,
"epoch": 7.135864135864136,
"grad_norm": 1.0546875,
"learning_rate": 0.00017696694976326394,
"loss": 5.7374,
"mean_token_accuracy": 0.1760731428861618,
"num_tokens": 11536872.0,
"step": 3575
},
{
"entropy": 6.61938328742981,
"epoch": 7.145854145854146,
"grad_norm": 1.0859375,
"learning_rate": 0.00017617241186792328,
"loss": 5.7206,
"mean_token_accuracy": 0.17701812982559204,
"num_tokens": 11551767.0,
"step": 3580
},
{
"entropy": 6.632746267318725,
"epoch": 7.1558441558441555,
"grad_norm": 0.98828125,
"learning_rate": 0.0001753793980162472,
"loss": 5.8948,
"mean_token_accuracy": 0.16603219658136367,
"num_tokens": 11570027.0,
"step": 3585
},
{
"entropy": 6.7298290729522705,
"epoch": 7.165834165834166,
"grad_norm": 1.03125,
"learning_rate": 0.00017458792043749017,
"loss": 5.8965,
"mean_token_accuracy": 0.1618497535586357,
"num_tokens": 11585197.0,
"step": 3590
},
{
"entropy": 6.628458404541016,
"epoch": 7.175824175824176,
"grad_norm": 1.0859375,
"learning_rate": 0.00017379799133721577,
"loss": 5.8133,
"mean_token_accuracy": 0.17163033932447433,
"num_tokens": 11599479.0,
"step": 3595
},
{
"entropy": 6.560936355590821,
"epoch": 7.185814185814186,
"grad_norm": 1.109375,
"learning_rate": 0.00017300962289710766,
"loss": 5.7055,
"mean_token_accuracy": 0.17093463838100434,
"num_tokens": 11615656.0,
"step": 3600
},
{
"entropy": 6.656382131576538,
"epoch": 7.195804195804196,
"grad_norm": 0.99609375,
"learning_rate": 0.0001722228272747826,
"loss": 5.7591,
"mean_token_accuracy": 0.16903391033411025,
"num_tokens": 11631748.0,
"step": 3605
},
{
"entropy": 6.606511545181275,
"epoch": 7.205794205794206,
"grad_norm": 1.1484375,
"learning_rate": 0.00017143761660360244,
"loss": 5.7929,
"mean_token_accuracy": 0.1716337412595749,
"num_tokens": 11647184.0,
"step": 3610
},
{
"entropy": 6.531059837341308,
"epoch": 7.215784215784216,
"grad_norm": 1.0546875,
"learning_rate": 0.000170654002992487,
"loss": 5.6254,
"mean_token_accuracy": 0.184749011695385,
"num_tokens": 11662978.0,
"step": 3615
},
{
"entropy": 6.64908504486084,
"epoch": 7.2257742257742255,
"grad_norm": 1.0625,
"learning_rate": 0.00016987199852572742,
"loss": 5.7934,
"mean_token_accuracy": 0.17288610935211182,
"num_tokens": 11678400.0,
"step": 3620
},
{
"entropy": 6.6434399604797365,
"epoch": 7.235764235764236,
"grad_norm": 1.1015625,
"learning_rate": 0.00016909161526280016,
"loss": 5.7822,
"mean_token_accuracy": 0.17110382169485092,
"num_tokens": 11694590.0,
"step": 3625
},
{
"entropy": 6.6768800735473635,
"epoch": 7.245754245754246,
"grad_norm": 1.078125,
"learning_rate": 0.00016831286523818053,
"loss": 5.8238,
"mean_token_accuracy": 0.16498062908649444,
"num_tokens": 11710346.0,
"step": 3630
},
{
"entropy": 6.645106267929077,
"epoch": 7.255744255744256,
"grad_norm": 0.984375,
"learning_rate": 0.00016753576046115706,
"loss": 5.7733,
"mean_token_accuracy": 0.16446049362421036,
"num_tokens": 11726274.0,
"step": 3635
},
{
"entropy": 6.4506245136260985,
"epoch": 7.265734265734266,
"grad_norm": 1.03125,
"learning_rate": 0.00016676031291564696,
"loss": 5.626,
"mean_token_accuracy": 0.19875700473785402,
"num_tokens": 11743601.0,
"step": 3640
},
{
"entropy": 6.555874538421631,
"epoch": 7.275724275724276,
"grad_norm": 1.0390625,
"learning_rate": 0.00016598653456001048,
"loss": 5.6669,
"mean_token_accuracy": 0.1775301903486252,
"num_tokens": 11760623.0,
"step": 3645
},
{
"entropy": 6.6439752101898195,
"epoch": 7.285714285714286,
"grad_norm": 1.0546875,
"learning_rate": 0.00016521443732686722,
"loss": 5.7602,
"mean_token_accuracy": 0.17340189814567566,
"num_tokens": 11777335.0,
"step": 3650
},
{
"entropy": 6.518510723114014,
"epoch": 7.2957042957042955,
"grad_norm": 1.15625,
"learning_rate": 0.0001644440331229115,
"loss": 5.6888,
"mean_token_accuracy": 0.1813320994377136,
"num_tokens": 11792737.0,
"step": 3655
},
{
"entropy": 6.667054319381714,
"epoch": 7.305694305694305,
"grad_norm": 1.1015625,
"learning_rate": 0.00016367533382872932,
"loss": 5.824,
"mean_token_accuracy": 0.16132206618785858,
"num_tokens": 11808369.0,
"step": 3660
},
{
"entropy": 6.688099050521851,
"epoch": 7.315684315684316,
"grad_norm": 1.046875,
"learning_rate": 0.0001629083512986146,
"loss": 5.7941,
"mean_token_accuracy": 0.1667774111032486,
"num_tokens": 11824556.0,
"step": 3665
},
{
"entropy": 6.660845756530762,
"epoch": 7.325674325674326,
"grad_norm": 1.03125,
"learning_rate": 0.0001621430973603868,
"loss": 5.8061,
"mean_token_accuracy": 0.16344435065984725,
"num_tokens": 11840897.0,
"step": 3670
},
{
"entropy": 6.64192214012146,
"epoch": 7.335664335664336,
"grad_norm": 1.015625,
"learning_rate": 0.0001613795838152084,
"loss": 5.7924,
"mean_token_accuracy": 0.1698761209845543,
"num_tokens": 11857226.0,
"step": 3675
},
{
"entropy": 6.660291385650635,
"epoch": 7.345654345654346,
"grad_norm": 1.0078125,
"learning_rate": 0.0001606178224374027,
"loss": 5.8701,
"mean_token_accuracy": 0.1639696717262268,
"num_tokens": 11873195.0,
"step": 3680
},
{
"entropy": 6.697933292388916,
"epoch": 7.355644355644356,
"grad_norm": 1.078125,
"learning_rate": 0.00015985782497427236,
"loss": 5.9375,
"mean_token_accuracy": 0.15698734521865845,
"num_tokens": 11889170.0,
"step": 3685
},
{
"entropy": 6.526859474182129,
"epoch": 7.3656343656343655,
"grad_norm": 0.93359375,
"learning_rate": 0.0001590996031459187,
"loss": 5.6298,
"mean_token_accuracy": 0.18256762325763704,
"num_tokens": 11906389.0,
"step": 3690
},
{
"entropy": 6.609104919433594,
"epoch": 7.375624375624375,
"grad_norm": 1.0625,
"learning_rate": 0.00015834316864506013,
"loss": 5.792,
"mean_token_accuracy": 0.17022771388292313,
"num_tokens": 11923113.0,
"step": 3695
},
{
"entropy": 6.59908356666565,
"epoch": 7.385614385614385,
"grad_norm": 0.98046875,
"learning_rate": 0.0001575885331368523,
"loss": 5.8181,
"mean_token_accuracy": 0.16873762011528015,
"num_tokens": 11940350.0,
"step": 3700
},
{
"entropy": 6.6856931209564205,
"epoch": 7.395604395604396,
"grad_norm": 1.0546875,
"learning_rate": 0.00015683570825870846,
"loss": 5.8237,
"mean_token_accuracy": 0.16349050849676133,
"num_tokens": 11956365.0,
"step": 3705
},
{
"entropy": 6.627903270721435,
"epoch": 7.405594405594406,
"grad_norm": 0.95703125,
"learning_rate": 0.00015608470562011948,
"loss": 5.7364,
"mean_token_accuracy": 0.17243467420339584,
"num_tokens": 11972909.0,
"step": 3710
},
{
"entropy": 6.559830951690674,
"epoch": 7.415584415584416,
"grad_norm": 1.046875,
"learning_rate": 0.00015533553680247505,
"loss": 5.635,
"mean_token_accuracy": 0.17551354616880416,
"num_tokens": 11990830.0,
"step": 3715
},
{
"entropy": 6.6408384323120115,
"epoch": 7.425574425574426,
"grad_norm": 1.0625,
"learning_rate": 0.00015458821335888502,
"loss": 5.7692,
"mean_token_accuracy": 0.17369808703660966,
"num_tokens": 12006737.0,
"step": 3720
},
{
"entropy": 6.5173032760620115,
"epoch": 7.4355644355644355,
"grad_norm": 1.09375,
"learning_rate": 0.00015384274681400146,
"loss": 5.7185,
"mean_token_accuracy": 0.17914607673883437,
"num_tokens": 12023877.0,
"step": 3725
},
{
"entropy": 6.583723497390747,
"epoch": 7.445554445554445,
"grad_norm": 1.1484375,
"learning_rate": 0.00015309914866384072,
"loss": 5.7294,
"mean_token_accuracy": 0.1711476430296898,
"num_tokens": 12039095.0,
"step": 3730
},
{
"entropy": 6.6257102489471436,
"epoch": 7.455544455544455,
"grad_norm": 1.1328125,
"learning_rate": 0.00015235743037560608,
"loss": 5.7844,
"mean_token_accuracy": 0.17418665140867234,
"num_tokens": 12055442.0,
"step": 3735
},
{
"entropy": 6.602275943756103,
"epoch": 7.465534465534466,
"grad_norm": 0.9921875,
"learning_rate": 0.00015161760338751115,
"loss": 5.7968,
"mean_token_accuracy": 0.16995560228824616,
"num_tokens": 12071654.0,
"step": 3740
},
{
"entropy": 6.591068696975708,
"epoch": 7.475524475524476,
"grad_norm": 1.15625,
"learning_rate": 0.00015087967910860323,
"loss": 5.7699,
"mean_token_accuracy": 0.17443897426128388,
"num_tokens": 12087203.0,
"step": 3745
},
{
"entropy": 6.570019960403442,
"epoch": 7.485514485514486,
"grad_norm": 0.9765625,
"learning_rate": 0.00015014366891858756,
"loss": 5.7374,
"mean_token_accuracy": 0.17059648483991624,
"num_tokens": 12104203.0,
"step": 3750
},
{
"entropy": 6.640076732635498,
"epoch": 7.495504495504496,
"grad_norm": 0.99609375,
"learning_rate": 0.0001494095841676518,
"loss": 5.8225,
"mean_token_accuracy": 0.1645973727107048,
"num_tokens": 12121533.0,
"step": 3755
},
{
"entropy": 6.626310396194458,
"epoch": 7.5054945054945055,
"grad_norm": 0.98828125,
"learning_rate": 0.00014867743617629102,
"loss": 5.8148,
"mean_token_accuracy": 0.16853301376104354,
"num_tokens": 12137577.0,
"step": 3760
},
{
"entropy": 6.638473463058472,
"epoch": 7.515484515484515,
"grad_norm": 1.0703125,
"learning_rate": 0.0001479472362351327,
"loss": 5.7622,
"mean_token_accuracy": 0.171138758957386,
"num_tokens": 12154603.0,
"step": 3765
},
{
"entropy": 6.56121244430542,
"epoch": 7.525474525474525,
"grad_norm": 1.140625,
"learning_rate": 0.00014721899560476339,
"loss": 5.6715,
"mean_token_accuracy": 0.18207142502069473,
"num_tokens": 12169644.0,
"step": 3770
},
{
"entropy": 6.609803485870361,
"epoch": 7.535464535464535,
"grad_norm": 1.078125,
"learning_rate": 0.0001464927255155545,
"loss": 5.8093,
"mean_token_accuracy": 0.1713679924607277,
"num_tokens": 12185752.0,
"step": 3775
},
{
"entropy": 6.683682870864868,
"epoch": 7.545454545454545,
"grad_norm": 1.0546875,
"learning_rate": 0.00014576843716748917,
"loss": 5.8392,
"mean_token_accuracy": 0.16137852072715758,
"num_tokens": 12202681.0,
"step": 3780
},
{
"entropy": 6.608212852478028,
"epoch": 7.555444555444556,
"grad_norm": 1.0625,
"learning_rate": 0.00014504614172998985,
"loss": 5.7923,
"mean_token_accuracy": 0.1661493569612503,
"num_tokens": 12218486.0,
"step": 3785
},
{
"entropy": 6.606582975387573,
"epoch": 7.565434565434566,
"grad_norm": 0.93359375,
"learning_rate": 0.0001443258503417455,
"loss": 5.7175,
"mean_token_accuracy": 0.17071602493524551,
"num_tokens": 12234345.0,
"step": 3790
},
{
"entropy": 6.491720485687256,
"epoch": 7.5754245754245755,
"grad_norm": 0.91796875,
"learning_rate": 0.0001436075741105406,
"loss": 5.6752,
"mean_token_accuracy": 0.18627673089504243,
"num_tokens": 12250475.0,
"step": 3795
},
{
"entropy": 6.573206949234009,
"epoch": 7.585414585414585,
"grad_norm": 1.140625,
"learning_rate": 0.00014289132411308297,
"loss": 5.6902,
"mean_token_accuracy": 0.18233504593372346,
"num_tokens": 12265832.0,
"step": 3800
},
{
"entropy": 6.690039396286011,
"epoch": 7.595404595404595,
"grad_norm": 1.125,
"learning_rate": 0.0001421771113948338,
"loss": 5.8597,
"mean_token_accuracy": 0.1667628213763237,
"num_tokens": 12280542.0,
"step": 3805
},
{
"entropy": 6.639490985870362,
"epoch": 7.605394605394605,
"grad_norm": 1.1328125,
"learning_rate": 0.00014146494696983653,
"loss": 5.7395,
"mean_token_accuracy": 0.18100628554821013,
"num_tokens": 12297431.0,
"step": 3810
},
{
"entropy": 6.658612442016602,
"epoch": 7.615384615384615,
"grad_norm": 1.0859375,
"learning_rate": 0.00014075484182054772,
"loss": 5.8318,
"mean_token_accuracy": 0.1652776703238487,
"num_tokens": 12313842.0,
"step": 3815
},
{
"entropy": 6.623839044570923,
"epoch": 7.625374625374626,
"grad_norm": 1.0703125,
"learning_rate": 0.0001400468068976673,
"loss": 5.845,
"mean_token_accuracy": 0.16607776135206223,
"num_tokens": 12330189.0,
"step": 3820
},
{
"entropy": 6.541777229309082,
"epoch": 7.635364635364636,
"grad_norm": 1.078125,
"learning_rate": 0.00013934085311996953,
"loss": 5.7004,
"mean_token_accuracy": 0.17605072408914565,
"num_tokens": 12347674.0,
"step": 3825
},
{
"entropy": 6.575506019592285,
"epoch": 7.6453546453546455,
"grad_norm": 1.0625,
"learning_rate": 0.00013863699137413484,
"loss": 5.6878,
"mean_token_accuracy": 0.1856866255402565,
"num_tokens": 12363735.0,
"step": 3830
},
{
"entropy": 6.493249416351318,
"epoch": 7.655344655344655,
"grad_norm": 1.171875,
"learning_rate": 0.00013793523251458235,
"loss": 5.7081,
"mean_token_accuracy": 0.18060380816459656,
"num_tokens": 12379500.0,
"step": 3835
},
{
"entropy": 6.523749780654907,
"epoch": 7.665334665334665,
"grad_norm": 0.890625,
"learning_rate": 0.00013723558736330167,
"loss": 5.6624,
"mean_token_accuracy": 0.1814500242471695,
"num_tokens": 12396185.0,
"step": 3840
},
{
"entropy": 6.692793941497802,
"epoch": 7.675324675324675,
"grad_norm": 1.078125,
"learning_rate": 0.0001365380667096864,
"loss": 5.8288,
"mean_token_accuracy": 0.1681785389780998,
"num_tokens": 12412098.0,
"step": 3845
},
{
"entropy": 6.6270708560943605,
"epoch": 7.685314685314685,
"grad_norm": 1.1328125,
"learning_rate": 0.0001358426813103681,
"loss": 5.7793,
"mean_token_accuracy": 0.17169039249420165,
"num_tokens": 12427402.0,
"step": 3850
},
{
"entropy": 6.6471555709838865,
"epoch": 7.695304695304696,
"grad_norm": 1.0625,
"learning_rate": 0.0001351494418890498,
"loss": 5.854,
"mean_token_accuracy": 0.1665297418832779,
"num_tokens": 12444069.0,
"step": 3855
},
{
"entropy": 6.615910863876342,
"epoch": 7.705294705294706,
"grad_norm": 1.171875,
"learning_rate": 0.00013445835913634098,
"loss": 5.7905,
"mean_token_accuracy": 0.17744431793689727,
"num_tokens": 12459775.0,
"step": 3860
},
{
"entropy": 6.659605598449707,
"epoch": 7.7152847152847155,
"grad_norm": 1.046875,
"learning_rate": 0.00013376944370959242,
"loss": 5.848,
"mean_token_accuracy": 0.16532238572835922,
"num_tokens": 12475063.0,
"step": 3865
},
{
"entropy": 6.567076969146728,
"epoch": 7.725274725274725,
"grad_norm": 1.0859375,
"learning_rate": 0.0001330827062327324,
"loss": 5.7879,
"mean_token_accuracy": 0.17397616505622865,
"num_tokens": 12492213.0,
"step": 3870
},
{
"entropy": 6.6325764656066895,
"epoch": 7.735264735264735,
"grad_norm": 1.1015625,
"learning_rate": 0.00013239815729610232,
"loss": 5.8131,
"mean_token_accuracy": 0.16737518608570098,
"num_tokens": 12508064.0,
"step": 3875
},
{
"entropy": 6.575936412811279,
"epoch": 7.745254745254745,
"grad_norm": 1.140625,
"learning_rate": 0.00013171580745629358,
"loss": 5.7211,
"mean_token_accuracy": 0.1728257268667221,
"num_tokens": 12524706.0,
"step": 3880
},
{
"entropy": 6.542951965332032,
"epoch": 7.755244755244755,
"grad_norm": 1.0390625,
"learning_rate": 0.00013103566723598488,
"loss": 5.7163,
"mean_token_accuracy": 0.180866014957428,
"num_tokens": 12541422.0,
"step": 3885
},
{
"entropy": 6.57264256477356,
"epoch": 7.765234765234765,
"grad_norm": 1.1796875,
"learning_rate": 0.00013035774712377975,
"loss": 5.7893,
"mean_token_accuracy": 0.16629691869020463,
"num_tokens": 12556731.0,
"step": 3890
},
{
"entropy": 6.616151523590088,
"epoch": 7.775224775224775,
"grad_norm": 1.1640625,
"learning_rate": 0.00012968205757404484,
"loss": 5.7673,
"mean_token_accuracy": 0.1756897434592247,
"num_tokens": 12571468.0,
"step": 3895
},
{
"entropy": 6.567837333679199,
"epoch": 7.7852147852147855,
"grad_norm": 1.2265625,
"learning_rate": 0.00012900860900674904,
"loss": 5.7534,
"mean_token_accuracy": 0.17781516164541245,
"num_tokens": 12586955.0,
"step": 3900
},
{
"entropy": 6.585996913909912,
"epoch": 7.795204795204795,
"grad_norm": 1.046875,
"learning_rate": 0.00012833741180730233,
"loss": 5.7492,
"mean_token_accuracy": 0.17664602249860764,
"num_tokens": 12601457.0,
"step": 3905
},
{
"entropy": 6.574141597747802,
"epoch": 7.805194805194805,
"grad_norm": 1.0078125,
"learning_rate": 0.00012766847632639572,
"loss": 5.747,
"mean_token_accuracy": 0.1792392462491989,
"num_tokens": 12620323.0,
"step": 3910
},
{
"entropy": 6.694469833374024,
"epoch": 7.815184815184815,
"grad_norm": 1.125,
"learning_rate": 0.00012700181287984193,
"loss": 5.8571,
"mean_token_accuracy": 0.16210900247097015,
"num_tokens": 12636255.0,
"step": 3915
},
{
"entropy": 6.683346748352051,
"epoch": 7.825174825174825,
"grad_norm": 1.0703125,
"learning_rate": 0.00012633743174841604,
"loss": 5.8525,
"mean_token_accuracy": 0.165432670712471,
"num_tokens": 12653080.0,
"step": 3920
},
{
"entropy": 6.638664627075196,
"epoch": 7.835164835164835,
"grad_norm": 1.1015625,
"learning_rate": 0.00012567534317769682,
"loss": 5.8383,
"mean_token_accuracy": 0.17068625539541243,
"num_tokens": 12669735.0,
"step": 3925
},
{
"entropy": 6.584664630889892,
"epoch": 7.845154845154845,
"grad_norm": 0.99609375,
"learning_rate": 0.00012501555737790928,
"loss": 5.7623,
"mean_token_accuracy": 0.17653609067201614,
"num_tokens": 12688007.0,
"step": 3930
},
{
"entropy": 6.553927803039551,
"epoch": 7.8551448551448555,
"grad_norm": 1.15625,
"learning_rate": 0.0001243580845237665,
"loss": 5.7411,
"mean_token_accuracy": 0.18110772371292114,
"num_tokens": 12704528.0,
"step": 3935
},
{
"entropy": 6.517689895629883,
"epoch": 7.865134865134865,
"grad_norm": 0.9296875,
"learning_rate": 0.00012370293475431332,
"loss": 5.6889,
"mean_token_accuracy": 0.1780701071023941,
"num_tokens": 12721412.0,
"step": 3940
},
{
"entropy": 6.612676429748535,
"epoch": 7.875124875124875,
"grad_norm": 1.1015625,
"learning_rate": 0.00012305011817276949,
"loss": 5.7935,
"mean_token_accuracy": 0.16655818223953248,
"num_tokens": 12737326.0,
"step": 3945
},
{
"entropy": 6.6610876560211185,
"epoch": 7.885114885114885,
"grad_norm": 1.125,
"learning_rate": 0.0001223996448463745,
"loss": 5.7708,
"mean_token_accuracy": 0.1731476902961731,
"num_tokens": 12753578.0,
"step": 3950
},
{
"entropy": 6.641850852966309,
"epoch": 7.895104895104895,
"grad_norm": 1.109375,
"learning_rate": 0.00012175152480623149,
"loss": 5.7657,
"mean_token_accuracy": 0.17379571497440338,
"num_tokens": 12769155.0,
"step": 3955
},
{
"entropy": 6.652761840820313,
"epoch": 7.905094905094905,
"grad_norm": 1.03125,
"learning_rate": 0.00012110576804715333,
"loss": 5.8958,
"mean_token_accuracy": 0.1638408362865448,
"num_tokens": 12785012.0,
"step": 3960
},
{
"entropy": 6.5546637058258055,
"epoch": 7.915084915084915,
"grad_norm": 1.0625,
"learning_rate": 0.00012046238452750817,
"loss": 5.6593,
"mean_token_accuracy": 0.18319484144449233,
"num_tokens": 12800924.0,
"step": 3965
},
{
"entropy": 6.702825546264648,
"epoch": 7.9250749250749255,
"grad_norm": 1.1640625,
"learning_rate": 0.00011982138416906573,
"loss": 5.8783,
"mean_token_accuracy": 0.16147090941667558,
"num_tokens": 12816179.0,
"step": 3970
},
{
"entropy": 6.60850682258606,
"epoch": 7.935064935064935,
"grad_norm": 1.046875,
"learning_rate": 0.00011918277685684438,
"loss": 5.8122,
"mean_token_accuracy": 0.17024821043014526,
"num_tokens": 12832388.0,
"step": 3975
},
{
"entropy": 6.5591573238372805,
"epoch": 7.945054945054945,
"grad_norm": 1.1484375,
"learning_rate": 0.00011854657243895896,
"loss": 5.769,
"mean_token_accuracy": 0.17416453808546067,
"num_tokens": 12847852.0,
"step": 3980
},
{
"entropy": 6.603835201263427,
"epoch": 7.955044955044955,
"grad_norm": 1.0859375,
"learning_rate": 0.00011791278072646868,
"loss": 5.7467,
"mean_token_accuracy": 0.16768178939819336,
"num_tokens": 12863278.0,
"step": 3985
},
{
"entropy": 6.694379234313965,
"epoch": 7.965034965034965,
"grad_norm": 1.140625,
"learning_rate": 0.00011728141149322567,
"loss": 5.815,
"mean_token_accuracy": 0.16590357273817063,
"num_tokens": 12878267.0,
"step": 3990
},
{
"entropy": 6.67466402053833,
"epoch": 7.975024975024975,
"grad_norm": 1.1015625,
"learning_rate": 0.00011665247447572459,
"loss": 5.8348,
"mean_token_accuracy": 0.16098665148019792,
"num_tokens": 12896793.0,
"step": 3995
},
{
"entropy": 6.642387056350708,
"epoch": 7.985014985014985,
"grad_norm": 1.0234375,
"learning_rate": 0.00011602597937295238,
"loss": 5.8664,
"mean_token_accuracy": 0.15969752222299577,
"num_tokens": 12913106.0,
"step": 4000
},
{
"epoch": 7.985014985014985,
"eval_entropy": 6.509865835550669,
"eval_loss": 7.048545837402344,
"eval_mean_token_accuracy": 0.11117837553894197,
"eval_num_tokens": 12913106.0,
"eval_runtime": 1.1728,
"eval_samples_per_second": 1256.789,
"eval_steps_per_second": 157.738,
"step": 4000
},
{
"entropy": 6.708018589019775,
"epoch": 7.995004995004995,
"grad_norm": 1.0390625,
"learning_rate": 0.00011540193584623844,
"loss": 5.8924,
"mean_token_accuracy": 0.15913865566253663,
"num_tokens": 12929766.0,
"step": 4005
},
{
"entropy": 6.690499782562256,
"epoch": 8.003996003996004,
"grad_norm": 1.1171875,
"learning_rate": 0.00011478035351910584,
"loss": 5.8259,
"mean_token_accuracy": 0.17000278333822885,
"num_tokens": 12942395.0,
"step": 4010
},
{
"entropy": 6.546853113174438,
"epoch": 8.013986013986013,
"grad_norm": 1.1171875,
"learning_rate": 0.00011416124197712319,
"loss": 5.623,
"mean_token_accuracy": 0.18236773759126662,
"num_tokens": 12957774.0,
"step": 4015
},
{
"entropy": 6.658700752258301,
"epoch": 8.023976023976024,
"grad_norm": 0.984375,
"learning_rate": 0.0001135446107677562,
"loss": 5.7369,
"mean_token_accuracy": 0.16562026292085646,
"num_tokens": 12974809.0,
"step": 4020
},
{
"entropy": 6.59889850616455,
"epoch": 8.033966033966035,
"grad_norm": 0.98828125,
"learning_rate": 0.00011293046940022095,
"loss": 5.7123,
"mean_token_accuracy": 0.17436665147542954,
"num_tokens": 12991862.0,
"step": 4025
},
{
"entropy": 6.632143354415893,
"epoch": 8.043956043956044,
"grad_norm": 1.1640625,
"learning_rate": 0.00011231882734533716,
"loss": 5.7115,
"mean_token_accuracy": 0.1777083918452263,
"num_tokens": 13007513.0,
"step": 4030
},
{
"entropy": 6.668722438812256,
"epoch": 8.053946053946055,
"grad_norm": 1.1171875,
"learning_rate": 0.0001117096940353819,
"loss": 5.7201,
"mean_token_accuracy": 0.17840286195278168,
"num_tokens": 13022860.0,
"step": 4035
},
{
"entropy": 6.576748847961426,
"epoch": 8.063936063936064,
"grad_norm": 1.1328125,
"learning_rate": 0.00011110307886394415,
"loss": 5.6638,
"mean_token_accuracy": 0.18314001858234405,
"num_tokens": 13038599.0,
"step": 4040
},
{
"entropy": 6.470821046829224,
"epoch": 8.073926073926074,
"grad_norm": 1.0625,
"learning_rate": 0.00011049899118578057,
"loss": 5.5455,
"mean_token_accuracy": 0.1973014920949936,
"num_tokens": 13055336.0,
"step": 4045
},
{
"entropy": 6.44102463722229,
"epoch": 8.083916083916083,
"grad_norm": 0.9765625,
"learning_rate": 0.00010989744031667037,
"loss": 5.4745,
"mean_token_accuracy": 0.19715564996004104,
"num_tokens": 13072207.0,
"step": 4050
},
{
"entropy": 6.649979448318481,
"epoch": 8.093906093906094,
"grad_norm": 1.0390625,
"learning_rate": 0.00010929843553327196,
"loss": 5.7645,
"mean_token_accuracy": 0.16423703730106354,
"num_tokens": 13089288.0,
"step": 4055
},
{
"entropy": 6.555937051773071,
"epoch": 8.103896103896103,
"grad_norm": 1.125,
"learning_rate": 0.00010870198607298022,
"loss": 5.588,
"mean_token_accuracy": 0.18531972616910936,
"num_tokens": 13105701.0,
"step": 4060
},
{
"entropy": 6.65061388015747,
"epoch": 8.113886113886114,
"grad_norm": 1.1640625,
"learning_rate": 0.00010810810113378372,
"loss": 5.721,
"mean_token_accuracy": 0.174058136343956,
"num_tokens": 13121408.0,
"step": 4065
},
{
"entropy": 6.628388166427612,
"epoch": 8.123876123876125,
"grad_norm": 1.0546875,
"learning_rate": 0.00010751678987412275,
"loss": 5.7365,
"mean_token_accuracy": 0.17408246248960496,
"num_tokens": 13138933.0,
"step": 4070
},
{
"entropy": 6.639469766616822,
"epoch": 8.133866133866134,
"grad_norm": 1.046875,
"learning_rate": 0.00010692806141274853,
"loss": 5.7174,
"mean_token_accuracy": 0.17059729546308516,
"num_tokens": 13154595.0,
"step": 4075
},
{
"entropy": 6.663714361190796,
"epoch": 8.143856143856144,
"grad_norm": 1.0234375,
"learning_rate": 0.00010634192482858217,
"loss": 5.7528,
"mean_token_accuracy": 0.16723113209009172,
"num_tokens": 13170989.0,
"step": 4080
},
{
"entropy": 6.497771453857422,
"epoch": 8.153846153846153,
"grad_norm": 1.015625,
"learning_rate": 0.00010575838916057498,
"loss": 5.6325,
"mean_token_accuracy": 0.17844102829694747,
"num_tokens": 13186826.0,
"step": 4085
},
{
"entropy": 6.698178815841675,
"epoch": 8.163836163836164,
"grad_norm": 1.0078125,
"learning_rate": 0.00010517746340756868,
"loss": 5.8033,
"mean_token_accuracy": 0.16790819466114043,
"num_tokens": 13204397.0,
"step": 4090
},
{
"entropy": 6.57105393409729,
"epoch": 8.173826173826173,
"grad_norm": 1.15625,
"learning_rate": 0.00010459915652815714,
"loss": 5.6582,
"mean_token_accuracy": 0.18001567721366882,
"num_tokens": 13220053.0,
"step": 4095
},
{
"entropy": 6.64002947807312,
"epoch": 8.183816183816184,
"grad_norm": 1.0546875,
"learning_rate": 0.00010402347744054773,
"loss": 5.7661,
"mean_token_accuracy": 0.17030880898237227,
"num_tokens": 13235215.0,
"step": 4100
},
{
"entropy": 6.659495115280151,
"epoch": 8.193806193806195,
"grad_norm": 1.03125,
"learning_rate": 0.0001034504350224242,
"loss": 5.7478,
"mean_token_accuracy": 0.1738527685403824,
"num_tokens": 13250691.0,
"step": 4105
},
{
"entropy": 6.637171983718872,
"epoch": 8.203796203796204,
"grad_norm": 1.0078125,
"learning_rate": 0.00010288003811080962,
"loss": 5.6984,
"mean_token_accuracy": 0.17765315622091293,
"num_tokens": 13267472.0,
"step": 4110
},
{
"entropy": 6.624198579788208,
"epoch": 8.213786213786214,
"grad_norm": 1.0625,
"learning_rate": 0.00010231229550192983,
"loss": 5.6817,
"mean_token_accuracy": 0.1793392464518547,
"num_tokens": 13282955.0,
"step": 4115
},
{
"entropy": 6.603564167022705,
"epoch": 8.223776223776223,
"grad_norm": 1.1171875,
"learning_rate": 0.00010174721595107821,
"loss": 5.6989,
"mean_token_accuracy": 0.17249709963798524,
"num_tokens": 13298694.0,
"step": 4120
},
{
"entropy": 6.58226900100708,
"epoch": 8.233766233766234,
"grad_norm": 0.9609375,
"learning_rate": 0.0001011848081724805,
"loss": 5.7171,
"mean_token_accuracy": 0.17811179012060166,
"num_tokens": 13315612.0,
"step": 4125
},
{
"entropy": 6.567302083969116,
"epoch": 8.243756243756243,
"grad_norm": 1.0234375,
"learning_rate": 0.00010062508083916045,
"loss": 5.6278,
"mean_token_accuracy": 0.1853811338543892,
"num_tokens": 13331355.0,
"step": 4130
},
{
"entropy": 6.596056890487671,
"epoch": 8.253746253746254,
"grad_norm": 1.234375,
"learning_rate": 0.0001000680425828058,
"loss": 5.6364,
"mean_token_accuracy": 0.18015409111976624,
"num_tokens": 13347518.0,
"step": 4135
},
{
"entropy": 6.638355731964111,
"epoch": 8.263736263736265,
"grad_norm": 1.1484375,
"learning_rate": 9.951370199363571e-05,
"loss": 5.7551,
"mean_token_accuracy": 0.17420727014541626,
"num_tokens": 13363202.0,
"step": 4140
},
{
"entropy": 6.607405948638916,
"epoch": 8.273726273726274,
"grad_norm": 1.171875,
"learning_rate": 9.896206762026768e-05,
"loss": 5.6954,
"mean_token_accuracy": 0.1751954436302185,
"num_tokens": 13377642.0,
"step": 4145
},
{
"entropy": 6.547289657592773,
"epoch": 8.283716283716284,
"grad_norm": 1.0078125,
"learning_rate": 9.841314796958629e-05,
"loss": 5.6681,
"mean_token_accuracy": 0.18557562977075576,
"num_tokens": 13393359.0,
"step": 4150
},
{
"entropy": 6.687372255325317,
"epoch": 8.293706293706293,
"grad_norm": 1.1328125,
"learning_rate": 9.786695150661143e-05,
"loss": 5.7984,
"mean_token_accuracy": 0.16761249154806138,
"num_tokens": 13408735.0,
"step": 4155
},
{
"entropy": 6.576523780822754,
"epoch": 8.303696303696304,
"grad_norm": 1.1171875,
"learning_rate": 9.732348665436843e-05,
"loss": 5.6105,
"mean_token_accuracy": 0.17739479392766952,
"num_tokens": 13424297.0,
"step": 4160
},
{
"entropy": 6.548263120651245,
"epoch": 8.313686313686313,
"grad_norm": 1.0859375,
"learning_rate": 9.678276179375743e-05,
"loss": 5.6429,
"mean_token_accuracy": 0.17942492812871932,
"num_tokens": 13440476.0,
"step": 4165
},
{
"entropy": 6.541148376464844,
"epoch": 8.323676323676324,
"grad_norm": 0.92578125,
"learning_rate": 9.624478526342478e-05,
"loss": 5.5606,
"mean_token_accuracy": 0.18558268696069719,
"num_tokens": 13458353.0,
"step": 4170
},
{
"entropy": 6.618422317504883,
"epoch": 8.333666333666333,
"grad_norm": 1.1328125,
"learning_rate": 9.570956535963412e-05,
"loss": 5.6839,
"mean_token_accuracy": 0.17825574427843094,
"num_tokens": 13474526.0,
"step": 4175
},
{
"entropy": 6.641184282302857,
"epoch": 8.343656343656344,
"grad_norm": 1.0859375,
"learning_rate": 9.517711033613846e-05,
"loss": 5.7364,
"mean_token_accuracy": 0.17284598350524902,
"num_tokens": 13490227.0,
"step": 4180
},
{
"entropy": 6.58631157875061,
"epoch": 8.353646353646354,
"grad_norm": 1.1015625,
"learning_rate": 9.464742840405274e-05,
"loss": 5.6017,
"mean_token_accuracy": 0.1830156460404396,
"num_tokens": 13505754.0,
"step": 4185
},
{
"entropy": 6.455103540420533,
"epoch": 8.363636363636363,
"grad_norm": 0.92578125,
"learning_rate": 9.412052773172788e-05,
"loss": 5.6165,
"mean_token_accuracy": 0.18646986186504363,
"num_tokens": 13523085.0,
"step": 4190
},
{
"entropy": 6.678836059570313,
"epoch": 8.373626373626374,
"grad_norm": 0.95703125,
"learning_rate": 9.359641644462396e-05,
"loss": 5.7984,
"mean_token_accuracy": 0.16259211599826812,
"num_tokens": 13540287.0,
"step": 4195
},
{
"entropy": 6.643093872070312,
"epoch": 8.383616383616383,
"grad_norm": 1.03125,
"learning_rate": 9.30751026251853e-05,
"loss": 5.6791,
"mean_token_accuracy": 0.18442320972681045,
"num_tokens": 13558123.0,
"step": 4200
},
{
"entropy": 6.623868989944458,
"epoch": 8.393606393606394,
"grad_norm": 0.98046875,
"learning_rate": 9.255659431271596e-05,
"loss": 5.7682,
"mean_token_accuracy": 0.17347396463155745,
"num_tokens": 13574506.0,
"step": 4205
},
{
"entropy": 6.595346117019654,
"epoch": 8.403596403596403,
"grad_norm": 1.1796875,
"learning_rate": 9.204089950325556e-05,
"loss": 5.706,
"mean_token_accuracy": 0.17174012064933777,
"num_tokens": 13590029.0,
"step": 4210
},
{
"entropy": 6.498262786865235,
"epoch": 8.413586413586414,
"grad_norm": 0.9765625,
"learning_rate": 9.152802614945602e-05,
"loss": 5.6391,
"mean_token_accuracy": 0.18892084807157516,
"num_tokens": 13606874.0,
"step": 4215
},
{
"entropy": 6.496121406555176,
"epoch": 8.423576423576424,
"grad_norm": 1.0546875,
"learning_rate": 9.101798216045878e-05,
"loss": 5.5434,
"mean_token_accuracy": 0.19402407258749008,
"num_tokens": 13622917.0,
"step": 4220
},
{
"entropy": 6.665012454986572,
"epoch": 8.433566433566433,
"grad_norm": 1.046875,
"learning_rate": 9.051077540177321e-05,
"loss": 5.8039,
"mean_token_accuracy": 0.16859310865402222,
"num_tokens": 13640171.0,
"step": 4225
},
{
"entropy": 6.5686780452728275,
"epoch": 8.443556443556444,
"grad_norm": 1.1171875,
"learning_rate": 9.000641369515503e-05,
"loss": 5.6966,
"mean_token_accuracy": 0.17796669900417328,
"num_tokens": 13655878.0,
"step": 4230
},
{
"entropy": 6.658001899719238,
"epoch": 8.453546453546453,
"grad_norm": 1.125,
"learning_rate": 8.950490481848556e-05,
"loss": 5.7701,
"mean_token_accuracy": 0.16969959139823915,
"num_tokens": 13671605.0,
"step": 4235
},
{
"entropy": 6.54094090461731,
"epoch": 8.463536463536464,
"grad_norm": 1.03125,
"learning_rate": 8.900625650565214e-05,
"loss": 5.5966,
"mean_token_accuracy": 0.18110958337783814,
"num_tokens": 13688146.0,
"step": 4240
},
{
"entropy": 6.597197866439819,
"epoch": 8.473526473526473,
"grad_norm": 1.0078125,
"learning_rate": 8.851047644642858e-05,
"loss": 5.6176,
"mean_token_accuracy": 0.1853731855750084,
"num_tokens": 13703828.0,
"step": 4245
},
{
"entropy": 6.499710273742676,
"epoch": 8.483516483516484,
"grad_norm": 1.0703125,
"learning_rate": 8.801757228635671e-05,
"loss": 5.5862,
"mean_token_accuracy": 0.18703063279390336,
"num_tokens": 13720103.0,
"step": 4250
},
{
"entropy": 6.524130630493164,
"epoch": 8.493506493506494,
"grad_norm": 1.015625,
"learning_rate": 8.752755162662848e-05,
"loss": 5.6257,
"mean_token_accuracy": 0.18301298320293427,
"num_tokens": 13737114.0,
"step": 4255
},
{
"entropy": 6.535678672790527,
"epoch": 8.503496503496503,
"grad_norm": 1.1484375,
"learning_rate": 8.704042202396862e-05,
"loss": 5.616,
"mean_token_accuracy": 0.1779239535331726,
"num_tokens": 13754110.0,
"step": 4260
},
{
"entropy": 6.587699604034424,
"epoch": 8.513486513486514,
"grad_norm": 1.0703125,
"learning_rate": 8.655619099051814e-05,
"loss": 5.7088,
"mean_token_accuracy": 0.17620895951986312,
"num_tokens": 13769571.0,
"step": 4265
},
{
"entropy": 6.55425500869751,
"epoch": 8.523476523476523,
"grad_norm": 1.0703125,
"learning_rate": 8.607486599371866e-05,
"loss": 5.7233,
"mean_token_accuracy": 0.1716888353228569,
"num_tokens": 13786161.0,
"step": 4270
},
{
"entropy": 6.614956092834473,
"epoch": 8.533466533466534,
"grad_norm": 1.109375,
"learning_rate": 8.559645445619709e-05,
"loss": 5.6745,
"mean_token_accuracy": 0.17230432331562043,
"num_tokens": 13802207.0,
"step": 4275
},
{
"entropy": 6.621044254302978,
"epoch": 8.543456543456543,
"grad_norm": 1.0625,
"learning_rate": 8.512096375565107e-05,
"loss": 5.6325,
"mean_token_accuracy": 0.18163369297981263,
"num_tokens": 13818721.0,
"step": 4280
},
{
"entropy": 6.705506753921509,
"epoch": 8.553446553446554,
"grad_norm": 1.0546875,
"learning_rate": 8.464840122473553e-05,
"loss": 5.8224,
"mean_token_accuracy": 0.1657765120267868,
"num_tokens": 13834595.0,
"step": 4285
},
{
"entropy": 6.483643627166748,
"epoch": 8.563436563436564,
"grad_norm": 1.109375,
"learning_rate": 8.417877415094919e-05,
"loss": 5.6488,
"mean_token_accuracy": 0.18199325650930404,
"num_tokens": 13851142.0,
"step": 4290
},
{
"entropy": 6.5265978336334225,
"epoch": 8.573426573426573,
"grad_norm": 1.09375,
"learning_rate": 8.371208977652253e-05,
"loss": 5.6404,
"mean_token_accuracy": 0.18214704394340514,
"num_tokens": 13867050.0,
"step": 4295
},
{
"entropy": 6.658955001831055,
"epoch": 8.583416583416584,
"grad_norm": 1.1484375,
"learning_rate": 8.324835529830587e-05,
"loss": 5.765,
"mean_token_accuracy": 0.17089197039604187,
"num_tokens": 13883375.0,
"step": 4300
},
{
"entropy": 6.576166391372681,
"epoch": 8.593406593406593,
"grad_norm": 1.0625,
"learning_rate": 8.278757786765861e-05,
"loss": 5.7152,
"mean_token_accuracy": 0.17454383373260499,
"num_tokens": 13899430.0,
"step": 4305
},
{
"entropy": 6.534755992889404,
"epoch": 8.603396603396604,
"grad_norm": 0.94921875,
"learning_rate": 8.232976459033866e-05,
"loss": 5.6611,
"mean_token_accuracy": 0.1825459286570549,
"num_tokens": 13915910.0,
"step": 4310
},
{
"entropy": 6.594773769378662,
"epoch": 8.613386613386613,
"grad_norm": 1.140625,
"learning_rate": 8.187492252639314e-05,
"loss": 5.6336,
"mean_token_accuracy": 0.18260664790868758,
"num_tokens": 13931069.0,
"step": 4315
},
{
"entropy": 6.613780498504639,
"epoch": 8.623376623376624,
"grad_norm": 1.1328125,
"learning_rate": 8.142305869004937e-05,
"loss": 5.7073,
"mean_token_accuracy": 0.174365770816803,
"num_tokens": 13948003.0,
"step": 4320
},
{
"entropy": 6.669010639190674,
"epoch": 8.633366633366633,
"grad_norm": 1.125,
"learning_rate": 8.097418004960665e-05,
"loss": 5.7612,
"mean_token_accuracy": 0.17211959958076478,
"num_tokens": 13963686.0,
"step": 4325
},
{
"entropy": 6.619667053222656,
"epoch": 8.643356643356643,
"grad_norm": 1.109375,
"learning_rate": 8.052829352732883e-05,
"loss": 5.7017,
"mean_token_accuracy": 0.17622666656970978,
"num_tokens": 13979270.0,
"step": 4330
},
{
"entropy": 6.4729931354522705,
"epoch": 8.653346653346654,
"grad_norm": 1.15625,
"learning_rate": 8.008540599933783e-05,
"loss": 5.4983,
"mean_token_accuracy": 0.19504622668027877,
"num_tokens": 13993112.0,
"step": 4335
},
{
"entropy": 6.469265794754028,
"epoch": 8.663336663336663,
"grad_norm": 0.94921875,
"learning_rate": 7.964552429550713e-05,
"loss": 5.6483,
"mean_token_accuracy": 0.19008894711732865,
"num_tokens": 14009321.0,
"step": 4340
},
{
"entropy": 6.624959468841553,
"epoch": 8.673326673326674,
"grad_norm": 1.0703125,
"learning_rate": 7.920865519935673e-05,
"loss": 5.7472,
"mean_token_accuracy": 0.1696748211979866,
"num_tokens": 14025543.0,
"step": 4345
},
{
"entropy": 6.649390506744385,
"epoch": 8.683316683316683,
"grad_norm": 1.1953125,
"learning_rate": 7.877480544794855e-05,
"loss": 5.745,
"mean_token_accuracy": 0.1761339247226715,
"num_tokens": 14039848.0,
"step": 4350
},
{
"entropy": 6.480779409408569,
"epoch": 8.693306693306694,
"grad_norm": 1.0625,
"learning_rate": 7.834398173178253e-05,
"loss": 5.6407,
"mean_token_accuracy": 0.1847129061818123,
"num_tokens": 14056524.0,
"step": 4355
},
{
"entropy": 6.541968441009521,
"epoch": 8.703296703296703,
"grad_norm": 0.92578125,
"learning_rate": 7.791619069469322e-05,
"loss": 5.5956,
"mean_token_accuracy": 0.18740863651037215,
"num_tokens": 14073247.0,
"step": 4360
},
{
"entropy": 6.6248459815979,
"epoch": 8.713286713286713,
"grad_norm": 1.0859375,
"learning_rate": 7.749143893374765e-05,
"loss": 5.72,
"mean_token_accuracy": 0.1726437985897064,
"num_tokens": 14089763.0,
"step": 4365
},
{
"entropy": 6.63503794670105,
"epoch": 8.723276723276724,
"grad_norm": 1.140625,
"learning_rate": 7.706973299914339e-05,
"loss": 5.7166,
"mean_token_accuracy": 0.17455221712589264,
"num_tokens": 14104500.0,
"step": 4370
},
{
"entropy": 6.661465072631836,
"epoch": 8.733266733266733,
"grad_norm": 1.0859375,
"learning_rate": 7.665107939410772e-05,
"loss": 5.7566,
"mean_token_accuracy": 0.17270952314138413,
"num_tokens": 14121550.0,
"step": 4375
},
{
"entropy": 6.548833560943604,
"epoch": 8.743256743256744,
"grad_norm": 1.125,
"learning_rate": 7.623548457479703e-05,
"loss": 5.6636,
"mean_token_accuracy": 0.17979439049959184,
"num_tokens": 14137644.0,
"step": 4380
},
{
"entropy": 6.580905103683472,
"epoch": 8.753246753246753,
"grad_norm": 1.0703125,
"learning_rate": 7.58229549501976e-05,
"loss": 5.626,
"mean_token_accuracy": 0.18286270052194595,
"num_tokens": 14154488.0,
"step": 4385
},
{
"entropy": 6.580533361434936,
"epoch": 8.763236763236764,
"grad_norm": 1.015625,
"learning_rate": 7.541349688202658e-05,
"loss": 5.627,
"mean_token_accuracy": 0.18657831847667694,
"num_tokens": 14170986.0,
"step": 4390
},
{
"entropy": 6.5391899108886715,
"epoch": 8.773226773226773,
"grad_norm": 1.109375,
"learning_rate": 7.500711668463377e-05,
"loss": 5.6776,
"mean_token_accuracy": 0.183927683532238,
"num_tokens": 14187888.0,
"step": 4395
},
{
"entropy": 6.559875869750977,
"epoch": 8.783216783216783,
"grad_norm": 1.1015625,
"learning_rate": 7.460382062490472e-05,
"loss": 5.6305,
"mean_token_accuracy": 0.18580815941095352,
"num_tokens": 14203413.0,
"step": 4400
},
{
"entropy": 6.514205694198608,
"epoch": 8.793206793206792,
"grad_norm": 0.98828125,
"learning_rate": 7.42036149221635e-05,
"loss": 5.5971,
"mean_token_accuracy": 0.18791152238845826,
"num_tokens": 14220550.0,
"step": 4405
},
{
"entropy": 6.61256971359253,
"epoch": 8.803196803196803,
"grad_norm": 1.125,
"learning_rate": 7.380650574807709e-05,
"loss": 5.7474,
"mean_token_accuracy": 0.17605276256799698,
"num_tokens": 14236555.0,
"step": 4410
},
{
"entropy": 6.488341522216797,
"epoch": 8.813186813186814,
"grad_norm": 1.203125,
"learning_rate": 7.341249922656016e-05,
"loss": 5.6106,
"mean_token_accuracy": 0.18714418560266494,
"num_tokens": 14254462.0,
"step": 4415
},
{
"entropy": 6.548106575012207,
"epoch": 8.823176823176823,
"grad_norm": 1.125,
"learning_rate": 7.302160143368084e-05,
"loss": 5.6091,
"mean_token_accuracy": 0.18026586920022963,
"num_tokens": 14270609.0,
"step": 4420
},
{
"entropy": 6.642305898666382,
"epoch": 8.833166833166834,
"grad_norm": 1.1328125,
"learning_rate": 7.26338183975665e-05,
"loss": 5.693,
"mean_token_accuracy": 0.17442094534635544,
"num_tokens": 14286077.0,
"step": 4425
},
{
"entropy": 6.612587404251099,
"epoch": 8.843156843156843,
"grad_norm": 1.046875,
"learning_rate": 7.22491560983114e-05,
"loss": 5.7443,
"mean_token_accuracy": 0.17187173515558243,
"num_tokens": 14302448.0,
"step": 4430
},
{
"entropy": 6.582760763168335,
"epoch": 8.853146853146853,
"grad_norm": 1.1484375,
"learning_rate": 7.186762046788392e-05,
"loss": 5.6617,
"mean_token_accuracy": 0.1807755261659622,
"num_tokens": 14318208.0,
"step": 4435
},
{
"entropy": 6.611913824081421,
"epoch": 8.863136863136862,
"grad_norm": 0.9609375,
"learning_rate": 7.148921739003554e-05,
"loss": 5.7311,
"mean_token_accuracy": 0.169320547580719,
"num_tokens": 14334594.0,
"step": 4440
},
{
"entropy": 6.590788841247559,
"epoch": 8.873126873126873,
"grad_norm": 1.1328125,
"learning_rate": 7.11139527002098e-05,
"loss": 5.6911,
"mean_token_accuracy": 0.17896728515625,
"num_tokens": 14350649.0,
"step": 4445
},
{
"entropy": 6.605124998092651,
"epoch": 8.883116883116884,
"grad_norm": 1.171875,
"learning_rate": 7.074183218545247e-05,
"loss": 5.7244,
"mean_token_accuracy": 0.17172927409410477,
"num_tokens": 14365302.0,
"step": 4450
},
{
"entropy": 6.580027294158936,
"epoch": 8.893106893106893,
"grad_norm": 1.0625,
"learning_rate": 7.037286158432215e-05,
"loss": 5.6471,
"mean_token_accuracy": 0.1845197334885597,
"num_tokens": 14381498.0,
"step": 4455
},
{
"entropy": 6.622518825531006,
"epoch": 8.903096903096904,
"grad_norm": 1.0859375,
"learning_rate": 7.000704658680201e-05,
"loss": 5.7356,
"mean_token_accuracy": 0.1727258250117302,
"num_tokens": 14397628.0,
"step": 4460
},
{
"entropy": 6.5275678634643555,
"epoch": 8.913086913086913,
"grad_norm": 0.94140625,
"learning_rate": 6.964439283421188e-05,
"loss": 5.6063,
"mean_token_accuracy": 0.17915378659963607,
"num_tokens": 14414203.0,
"step": 4465
},
{
"entropy": 6.596682834625244,
"epoch": 8.923076923076923,
"grad_norm": 1.234375,
"learning_rate": 6.928490591912121e-05,
"loss": 5.6491,
"mean_token_accuracy": 0.17994030714035034,
"num_tokens": 14429568.0,
"step": 4470
},
{
"entropy": 6.619744682312012,
"epoch": 8.933066933066932,
"grad_norm": 1.0625,
"learning_rate": 6.892859138526286e-05,
"loss": 5.6357,
"mean_token_accuracy": 0.17897205501794816,
"num_tokens": 14444646.0,
"step": 4475
},
{
"entropy": 6.63206934928894,
"epoch": 8.943056943056943,
"grad_norm": 1.078125,
"learning_rate": 6.857545472744783e-05,
"loss": 5.7778,
"mean_token_accuracy": 0.17256810367107392,
"num_tokens": 14460872.0,
"step": 4480
},
{
"entropy": 6.6366493701934814,
"epoch": 8.953046953046954,
"grad_norm": 1.0703125,
"learning_rate": 6.822550139148023e-05,
"loss": 5.8196,
"mean_token_accuracy": 0.17008961588144303,
"num_tokens": 14478099.0,
"step": 4485
},
{
"entropy": 6.674064111709595,
"epoch": 8.963036963036963,
"grad_norm": 0.98828125,
"learning_rate": 6.787873677407333e-05,
"loss": 5.8311,
"mean_token_accuracy": 0.1671227604150772,
"num_tokens": 14494017.0,
"step": 4490
},
{
"entropy": 6.55450029373169,
"epoch": 8.973026973026974,
"grad_norm": 1.0,
"learning_rate": 6.753516622276655e-05,
"loss": 5.7396,
"mean_token_accuracy": 0.18682378232479097,
"num_tokens": 14511115.0,
"step": 4495
},
{
"entropy": 6.639289903640747,
"epoch": 8.983016983016983,
"grad_norm": 1.0625,
"learning_rate": 6.719479503584287e-05,
"loss": 5.7752,
"mean_token_accuracy": 0.17506357729434968,
"num_tokens": 14526957.0,
"step": 4500
},
{
"epoch": 8.983016983016983,
"eval_entropy": 6.501000236820531,
"eval_loss": 7.067969799041748,
"eval_mean_token_accuracy": 0.1109247750728517,
"eval_num_tokens": 14526957.0,
"eval_runtime": 1.175,
"eval_samples_per_second": 1254.474,
"eval_steps_per_second": 157.448,
"step": 4500
},
{
"entropy": 6.585261631011963,
"epoch": 8.993006993006993,
"grad_norm": 1.0703125,
"learning_rate": 6.685762846224697e-05,
"loss": 5.6718,
"mean_token_accuracy": 0.18094309717416762,
"num_tokens": 14545169.0,
"step": 4505
},
{
"entropy": 6.625105539957683,
"epoch": 9.001998001998002,
"grad_norm": 0.9765625,
"learning_rate": 6.65236717015045e-05,
"loss": 5.7152,
"mean_token_accuracy": 0.17626477281252542,
"num_tokens": 14557658.0,
"step": 4510
},
{
"entropy": 6.592655420303345,
"epoch": 9.011988011988011,
"grad_norm": 1.09375,
"learning_rate": 6.619292990364191e-05,
"loss": 5.6279,
"mean_token_accuracy": 0.18174556791782379,
"num_tokens": 14573422.0,
"step": 4515
},
{
"entropy": 6.482929325103759,
"epoch": 9.021978021978022,
"grad_norm": 1.109375,
"learning_rate": 6.586540816910678e-05,
"loss": 5.5687,
"mean_token_accuracy": 0.19611476510763168,
"num_tokens": 14587012.0,
"step": 4520
},
{
"entropy": 6.544143438339233,
"epoch": 9.031968031968033,
"grad_norm": 1.03125,
"learning_rate": 6.554111154868945e-05,
"loss": 5.6175,
"mean_token_accuracy": 0.18382574021816253,
"num_tokens": 14604156.0,
"step": 4525
},
{
"entropy": 6.6144325733184814,
"epoch": 9.041958041958042,
"grad_norm": 1.1796875,
"learning_rate": 6.522004504344508e-05,
"loss": 5.6651,
"mean_token_accuracy": 0.17627399563789367,
"num_tokens": 14620874.0,
"step": 4530
},
{
"entropy": 6.619625854492187,
"epoch": 9.051948051948052,
"grad_norm": 1.125,
"learning_rate": 6.490221360461624e-05,
"loss": 5.6753,
"mean_token_accuracy": 0.17593786865472794,
"num_tokens": 14636396.0,
"step": 4535
},
{
"entropy": 6.503337097167969,
"epoch": 9.061938061938061,
"grad_norm": 1.015625,
"learning_rate": 6.458762213355685e-05,
"loss": 5.4992,
"mean_token_accuracy": 0.1959144502878189,
"num_tokens": 14653083.0,
"step": 4540
},
{
"entropy": 6.687210893630981,
"epoch": 9.071928071928072,
"grad_norm": 1.1171875,
"learning_rate": 6.427627548165674e-05,
"loss": 5.7131,
"mean_token_accuracy": 0.16840833723545073,
"num_tokens": 14669321.0,
"step": 4545
},
{
"entropy": 6.634840440750122,
"epoch": 9.081918081918081,
"grad_norm": 1.1484375,
"learning_rate": 6.396817845026633e-05,
"loss": 5.7341,
"mean_token_accuracy": 0.18002044707536696,
"num_tokens": 14686341.0,
"step": 4550
},
{
"entropy": 6.47555627822876,
"epoch": 9.091908091908092,
"grad_norm": 0.85546875,
"learning_rate": 6.366333579062292e-05,
"loss": 5.5429,
"mean_token_accuracy": 0.18737580478191376,
"num_tokens": 14703557.0,
"step": 4555
},
{
"entropy": 6.563258028030395,
"epoch": 9.101898101898103,
"grad_norm": 1.0,
"learning_rate": 6.336175220377752e-05,
"loss": 5.5916,
"mean_token_accuracy": 0.18967287689447404,
"num_tokens": 14720034.0,
"step": 4560
},
{
"entropy": 6.575451898574829,
"epoch": 9.111888111888112,
"grad_norm": 1.109375,
"learning_rate": 6.306343234052212e-05,
"loss": 5.6017,
"mean_token_accuracy": 0.18138467222452165,
"num_tokens": 14735501.0,
"step": 4565
},
{
"entropy": 6.603144407272339,
"epoch": 9.121878121878122,
"grad_norm": 1.0625,
"learning_rate": 6.2768380801318e-05,
"loss": 5.6264,
"mean_token_accuracy": 0.18400662541389465,
"num_tokens": 14752413.0,
"step": 4570
},
{
"entropy": 6.589936113357544,
"epoch": 9.131868131868131,
"grad_norm": 1.1328125,
"learning_rate": 6.247660213622493e-05,
"loss": 5.623,
"mean_token_accuracy": 0.18086908459663392,
"num_tokens": 14768037.0,
"step": 4575
},
{
"entropy": 6.577788019180298,
"epoch": 9.141858141858142,
"grad_norm": 1.1796875,
"learning_rate": 6.218810084483083e-05,
"loss": 5.6345,
"mean_token_accuracy": 0.18557588309049605,
"num_tokens": 14785432.0,
"step": 4580
},
{
"entropy": 6.628364515304566,
"epoch": 9.151848151848151,
"grad_norm": 1.0703125,
"learning_rate": 6.190288137618255e-05,
"loss": 5.6883,
"mean_token_accuracy": 0.1793934240937233,
"num_tokens": 14801704.0,
"step": 4585
},
{
"entropy": 6.5041361331939695,
"epoch": 9.161838161838162,
"grad_norm": 1.015625,
"learning_rate": 6.162094812871711e-05,
"loss": 5.5914,
"mean_token_accuracy": 0.18742053508758544,
"num_tokens": 14818778.0,
"step": 4590
},
{
"entropy": 6.622739315032959,
"epoch": 9.171828171828173,
"grad_norm": 1.140625,
"learning_rate": 6.134230545019396e-05,
"loss": 5.6881,
"mean_token_accuracy": 0.18067678958177566,
"num_tokens": 14834708.0,
"step": 4595
},
{
"entropy": 6.587009239196777,
"epoch": 9.181818181818182,
"grad_norm": 1.046875,
"learning_rate": 6.106695763762785e-05,
"loss": 5.6205,
"mean_token_accuracy": 0.18233224153518676,
"num_tokens": 14849794.0,
"step": 4600
},
{
"entropy": 6.535916137695312,
"epoch": 9.191808191808192,
"grad_norm": 1.015625,
"learning_rate": 6.0794908937222764e-05,
"loss": 5.5938,
"mean_token_accuracy": 0.1847222089767456,
"num_tokens": 14866537.0,
"step": 4605
},
{
"entropy": 6.5473497867584225,
"epoch": 9.201798201798201,
"grad_norm": 1.1328125,
"learning_rate": 6.052616354430614e-05,
"loss": 5.616,
"mean_token_accuracy": 0.186315555870533,
"num_tokens": 14883569.0,
"step": 4610
},
{
"entropy": 6.678972244262695,
"epoch": 9.211788211788212,
"grad_norm": 1.0234375,
"learning_rate": 6.026072560326442e-05,
"loss": 5.7195,
"mean_token_accuracy": 0.16966124027967452,
"num_tokens": 14899558.0,
"step": 4615
},
{
"entropy": 6.565244436264038,
"epoch": 9.221778221778221,
"grad_norm": 0.87890625,
"learning_rate": 5.9998599207478995e-05,
"loss": 5.6352,
"mean_token_accuracy": 0.17788492292165756,
"num_tokens": 14916429.0,
"step": 4620
},
{
"entropy": 6.484505701065063,
"epoch": 9.231768231768232,
"grad_norm": 1.1640625,
"learning_rate": 5.9739788399263136e-05,
"loss": 5.5951,
"mean_token_accuracy": 0.1882602885365486,
"num_tokens": 14932959.0,
"step": 4625
},
{
"entropy": 6.606488370895386,
"epoch": 9.241758241758241,
"grad_norm": 1.1171875,
"learning_rate": 5.948429716979973e-05,
"loss": 5.668,
"mean_token_accuracy": 0.17584800273180007,
"num_tokens": 14949120.0,
"step": 4630
},
{
"entropy": 6.55346302986145,
"epoch": 9.251748251748252,
"grad_norm": 1.09375,
"learning_rate": 5.923212945907954e-05,
"loss": 5.6735,
"mean_token_accuracy": 0.18046673983335496,
"num_tokens": 14965502.0,
"step": 4635
},
{
"entropy": 6.658154010772705,
"epoch": 9.261738261738262,
"grad_norm": 1.0546875,
"learning_rate": 5.898328915584065e-05,
"loss": 5.7632,
"mean_token_accuracy": 0.17193507701158522,
"num_tokens": 14982273.0,
"step": 4640
},
{
"entropy": 6.623137092590332,
"epoch": 9.271728271728271,
"grad_norm": 1.2421875,
"learning_rate": 5.873778009750832e-05,
"loss": 5.6485,
"mean_token_accuracy": 0.17903818935155869,
"num_tokens": 14997560.0,
"step": 4645
},
{
"entropy": 6.543309116363526,
"epoch": 9.281718281718282,
"grad_norm": 1.03125,
"learning_rate": 5.8495606070136e-05,
"loss": 5.6143,
"mean_token_accuracy": 0.18877297788858413,
"num_tokens": 15014859.0,
"step": 4650
},
{
"entropy": 6.493854427337647,
"epoch": 9.291708291708291,
"grad_norm": 1.03125,
"learning_rate": 5.825677080834671e-05,
"loss": 5.563,
"mean_token_accuracy": 0.19374835044145583,
"num_tokens": 15032166.0,
"step": 4655
},
{
"entropy": 6.554304027557373,
"epoch": 9.301698301698302,
"grad_norm": 1.0703125,
"learning_rate": 5.802127799527569e-05,
"loss": 5.5197,
"mean_token_accuracy": 0.18833510726690292,
"num_tokens": 15048177.0,
"step": 4660
},
{
"entropy": 6.486464023590088,
"epoch": 9.311688311688311,
"grad_norm": 1.1328125,
"learning_rate": 5.778913126251338e-05,
"loss": 5.5393,
"mean_token_accuracy": 0.20071997493505478,
"num_tokens": 15064440.0,
"step": 4665
},
{
"entropy": 6.668011426925659,
"epoch": 9.321678321678322,
"grad_norm": 0.96875,
"learning_rate": 5.756033419004963e-05,
"loss": 5.7126,
"mean_token_accuracy": 0.17583168745040895,
"num_tokens": 15081228.0,
"step": 4670
},
{
"entropy": 6.662775325775146,
"epoch": 9.331668331668332,
"grad_norm": 0.96875,
"learning_rate": 5.733489030621833e-05,
"loss": 5.7157,
"mean_token_accuracy": 0.16892925202846526,
"num_tokens": 15099256.0,
"step": 4675
},
{
"entropy": 6.553799486160278,
"epoch": 9.341658341658341,
"grad_norm": 0.94921875,
"learning_rate": 5.711280308764307e-05,
"loss": 5.6234,
"mean_token_accuracy": 0.17775641828775407,
"num_tokens": 15115249.0,
"step": 4680
},
{
"entropy": 6.516328430175781,
"epoch": 9.351648351648352,
"grad_norm": 1.1640625,
"learning_rate": 5.6894075959183396e-05,
"loss": 5.6135,
"mean_token_accuracy": 0.18262632936239243,
"num_tokens": 15131990.0,
"step": 4685
},
{
"entropy": 6.630344343185425,
"epoch": 9.361638361638361,
"grad_norm": 1.109375,
"learning_rate": 5.667871229388234e-05,
"loss": 5.6814,
"mean_token_accuracy": 0.1771764412522316,
"num_tokens": 15149519.0,
"step": 4690
},
{
"entropy": 6.648879337310791,
"epoch": 9.371628371628372,
"grad_norm": 1.109375,
"learning_rate": 5.646671541291398e-05,
"loss": 5.7229,
"mean_token_accuracy": 0.1753318876028061,
"num_tokens": 15165488.0,
"step": 4695
},
{
"entropy": 6.607115459442139,
"epoch": 9.381618381618381,
"grad_norm": 1.203125,
"learning_rate": 5.625808858553244e-05,
"loss": 5.6814,
"mean_token_accuracy": 0.17679887861013413,
"num_tokens": 15181179.0,
"step": 4700
},
{
"entropy": 6.65881929397583,
"epoch": 9.391608391608392,
"grad_norm": 1.1171875,
"learning_rate": 5.605283502902151e-05,
"loss": 5.7245,
"mean_token_accuracy": 0.17249663472175597,
"num_tokens": 15197623.0,
"step": 4705
},
{
"entropy": 6.553147792816162,
"epoch": 9.401598401598402,
"grad_norm": 1.1953125,
"learning_rate": 5.5850957908644986e-05,
"loss": 5.6377,
"mean_token_accuracy": 0.18265938460826875,
"num_tokens": 15211272.0,
"step": 4710
},
{
"entropy": 6.564072227478027,
"epoch": 9.411588411588411,
"grad_norm": 1.1640625,
"learning_rate": 5.565246033759775e-05,
"loss": 5.595,
"mean_token_accuracy": 0.18455305248498916,
"num_tokens": 15226706.0,
"step": 4715
},
{
"entropy": 6.623476219177246,
"epoch": 9.421578421578422,
"grad_norm": 1.15625,
"learning_rate": 5.545734537695789e-05,
"loss": 5.7312,
"mean_token_accuracy": 0.17008535712957382,
"num_tokens": 15241792.0,
"step": 4720
},
{
"entropy": 6.611056518554688,
"epoch": 9.431568431568431,
"grad_norm": 1.2578125,
"learning_rate": 5.526561603563947e-05,
"loss": 5.6468,
"mean_token_accuracy": 0.18209182620048522,
"num_tokens": 15256587.0,
"step": 4725
},
{
"entropy": 6.468847799301147,
"epoch": 9.441558441558442,
"grad_norm": 1.1328125,
"learning_rate": 5.507727527034616e-05,
"loss": 5.5303,
"mean_token_accuracy": 0.18883492052555084,
"num_tokens": 15273419.0,
"step": 4730
},
{
"entropy": 6.5579845905303955,
"epoch": 9.451548451548451,
"grad_norm": 1.1640625,
"learning_rate": 5.48923259855255e-05,
"loss": 5.6408,
"mean_token_accuracy": 0.17856216728687285,
"num_tokens": 15289533.0,
"step": 4735
},
{
"entropy": 6.53039813041687,
"epoch": 9.461538461538462,
"grad_norm": 1.1328125,
"learning_rate": 5.4710771033324294e-05,
"loss": 5.6177,
"mean_token_accuracy": 0.18866459727287294,
"num_tokens": 15305887.0,
"step": 4740
},
{
"entropy": 6.594729995727539,
"epoch": 9.471528471528472,
"grad_norm": 1.1015625,
"learning_rate": 5.453261321354446e-05,
"loss": 5.7227,
"mean_token_accuracy": 0.18324811160564422,
"num_tokens": 15321973.0,
"step": 4745
},
{
"entropy": 6.625926780700683,
"epoch": 9.481518481518481,
"grad_norm": 1.078125,
"learning_rate": 5.435785527359999e-05,
"loss": 5.6933,
"mean_token_accuracy": 0.17576399594545364,
"num_tokens": 15338855.0,
"step": 4750
},
{
"entropy": 6.666522359848022,
"epoch": 9.491508491508492,
"grad_norm": 1.109375,
"learning_rate": 5.418649990847452e-05,
"loss": 5.7648,
"mean_token_accuracy": 0.17153519093990327,
"num_tokens": 15355136.0,
"step": 4755
},
{
"entropy": 6.527340269088745,
"epoch": 9.501498501498501,
"grad_norm": 1.203125,
"learning_rate": 5.401854976067975e-05,
"loss": 5.6211,
"mean_token_accuracy": 0.18802438229322432,
"num_tokens": 15370860.0,
"step": 4760
},
{
"entropy": 6.510877084732056,
"epoch": 9.511488511488512,
"grad_norm": 1.2421875,
"learning_rate": 5.3854007420214694e-05,
"loss": 5.5353,
"mean_token_accuracy": 0.19215515106916428,
"num_tokens": 15385922.0,
"step": 4765
},
{
"entropy": 6.576299238204956,
"epoch": 9.521478521478521,
"grad_norm": 1.2265625,
"learning_rate": 5.3692875424525805e-05,
"loss": 5.7025,
"mean_token_accuracy": 0.1720760226249695,
"num_tokens": 15400532.0,
"step": 4770
},
{
"entropy": 6.419309186935425,
"epoch": 9.531468531468532,
"grad_norm": 1.0859375,
"learning_rate": 5.3535156258467796e-05,
"loss": 5.4746,
"mean_token_accuracy": 0.19992665499448775,
"num_tokens": 15416836.0,
"step": 4775
},
{
"entropy": 6.669402933120727,
"epoch": 9.54145854145854,
"grad_norm": 1.046875,
"learning_rate": 5.338085235426531e-05,
"loss": 5.7795,
"mean_token_accuracy": 0.1709643006324768,
"num_tokens": 15433477.0,
"step": 4780
},
{
"entropy": 6.5836122035980225,
"epoch": 9.551448551448551,
"grad_norm": 1.15625,
"learning_rate": 5.322996609147544e-05,
"loss": 5.6287,
"mean_token_accuracy": 0.18438417017459868,
"num_tokens": 15449328.0,
"step": 4785
},
{
"entropy": 6.622609043121338,
"epoch": 9.561438561438562,
"grad_norm": 1.1640625,
"learning_rate": 5.308249979695101e-05,
"loss": 5.6803,
"mean_token_accuracy": 0.17739938497543334,
"num_tokens": 15465005.0,
"step": 4790
},
{
"entropy": 6.546008634567261,
"epoch": 9.571428571428571,
"grad_norm": 1.1796875,
"learning_rate": 5.2938455744804715e-05,
"loss": 5.6189,
"mean_token_accuracy": 0.1764516532421112,
"num_tokens": 15481580.0,
"step": 4795
},
{
"entropy": 6.579231262207031,
"epoch": 9.581418581418582,
"grad_norm": 1.109375,
"learning_rate": 5.279783615637401e-05,
"loss": 5.6163,
"mean_token_accuracy": 0.18795849084854127,
"num_tokens": 15497323.0,
"step": 4800
},
{
"entropy": 6.4910914421081545,
"epoch": 9.591408591408591,
"grad_norm": 0.99609375,
"learning_rate": 5.2660643200186906e-05,
"loss": 5.6108,
"mean_token_accuracy": 0.19072694927453995,
"num_tokens": 15514974.0,
"step": 4805
},
{
"entropy": 6.466121768951416,
"epoch": 9.601398601398602,
"grad_norm": 1.125,
"learning_rate": 5.252687899192851e-05,
"loss": 5.5047,
"mean_token_accuracy": 0.19480836391448975,
"num_tokens": 15531382.0,
"step": 4810
},
{
"entropy": 6.561569881439209,
"epoch": 9.61138861138861,
"grad_norm": 1.1875,
"learning_rate": 5.239654559440837e-05,
"loss": 5.5744,
"mean_token_accuracy": 0.18659158498048783,
"num_tokens": 15546074.0,
"step": 4815
},
{
"entropy": 6.536590909957885,
"epoch": 9.621378621378621,
"grad_norm": 1.09375,
"learning_rate": 5.2269645017528745e-05,
"loss": 5.5978,
"mean_token_accuracy": 0.1881682574748993,
"num_tokens": 15562671.0,
"step": 4820
},
{
"entropy": 6.519865989685059,
"epoch": 9.631368631368632,
"grad_norm": 1.109375,
"learning_rate": 5.2146179218253483e-05,
"loss": 5.597,
"mean_token_accuracy": 0.18624135553836824,
"num_tokens": 15578826.0,
"step": 4825
},
{
"entropy": 6.545838499069214,
"epoch": 9.641358641358641,
"grad_norm": 0.9453125,
"learning_rate": 5.2026150100577956e-05,
"loss": 5.6377,
"mean_token_accuracy": 0.1813482329249382,
"num_tokens": 15594467.0,
"step": 4830
},
{
"entropy": 6.598823881149292,
"epoch": 9.651348651348652,
"grad_norm": 1.078125,
"learning_rate": 5.1909559515499627e-05,
"loss": 5.7121,
"mean_token_accuracy": 0.17370960116386414,
"num_tokens": 15609688.0,
"step": 4835
},
{
"entropy": 6.612124395370484,
"epoch": 9.661338661338661,
"grad_norm": 1.0546875,
"learning_rate": 5.179640926098958e-05,
"loss": 5.6696,
"mean_token_accuracy": 0.17642810940742493,
"num_tokens": 15624654.0,
"step": 4840
},
{
"entropy": 6.645905065536499,
"epoch": 9.671328671328672,
"grad_norm": 1.1328125,
"learning_rate": 5.1686701081964665e-05,
"loss": 5.7333,
"mean_token_accuracy": 0.1727768898010254,
"num_tokens": 15640640.0,
"step": 4845
},
{
"entropy": 6.671988248825073,
"epoch": 9.68131868131868,
"grad_norm": 0.98828125,
"learning_rate": 5.158043667026074e-05,
"loss": 5.7724,
"mean_token_accuracy": 0.16994875222444533,
"num_tokens": 15658063.0,
"step": 4850
},
{
"entropy": 6.574873971939087,
"epoch": 9.691308691308691,
"grad_norm": 1.1171875,
"learning_rate": 5.147761766460653e-05,
"loss": 5.6242,
"mean_token_accuracy": 0.1849856823682785,
"num_tokens": 15674560.0,
"step": 4855
},
{
"entropy": 6.637097597122192,
"epoch": 9.7012987012987,
"grad_norm": 1.03125,
"learning_rate": 5.1378245650598226e-05,
"loss": 5.7305,
"mean_token_accuracy": 0.17512189447879792,
"num_tokens": 15690128.0,
"step": 4860
},
{
"entropy": 6.606235408782959,
"epoch": 9.711288711288711,
"grad_norm": 1.1796875,
"learning_rate": 5.128232216067524e-05,
"loss": 5.6731,
"mean_token_accuracy": 0.17947318404912949,
"num_tokens": 15706850.0,
"step": 4865
},
{
"entropy": 6.599513673782349,
"epoch": 9.721278721278722,
"grad_norm": 1.21875,
"learning_rate": 5.118984867409647e-05,
"loss": 5.672,
"mean_token_accuracy": 0.17838481813669205,
"num_tokens": 15723194.0,
"step": 4870
},
{
"entropy": 6.643277931213379,
"epoch": 9.731268731268731,
"grad_norm": 1.0546875,
"learning_rate": 5.1100826616917475e-05,
"loss": 5.7004,
"mean_token_accuracy": 0.17396390289068223,
"num_tokens": 15739424.0,
"step": 4875
},
{
"entropy": 6.52038426399231,
"epoch": 9.741258741258742,
"grad_norm": 1.0546875,
"learning_rate": 5.101525736196847e-05,
"loss": 5.6239,
"mean_token_accuracy": 0.18808289915323256,
"num_tokens": 15755791.0,
"step": 4880
},
{
"entropy": 6.641349458694458,
"epoch": 9.75124875124875,
"grad_norm": 1.265625,
"learning_rate": 5.093314222883323e-05,
"loss": 5.7411,
"mean_token_accuracy": 0.16789134442806244,
"num_tokens": 15771917.0,
"step": 4885
},
{
"entropy": 6.479106330871582,
"epoch": 9.761238761238761,
"grad_norm": 1.171875,
"learning_rate": 5.085448248382869e-05,
"loss": 5.5448,
"mean_token_accuracy": 0.1874668374657631,
"num_tokens": 15788311.0,
"step": 4890
},
{
"entropy": 6.552467679977417,
"epoch": 9.77122877122877,
"grad_norm": 1.1171875,
"learning_rate": 5.0779279339985424e-05,
"loss": 5.5966,
"mean_token_accuracy": 0.18326291143894197,
"num_tokens": 15804603.0,
"step": 4895
},
{
"entropy": 6.568915796279907,
"epoch": 9.781218781218781,
"grad_norm": 1.1015625,
"learning_rate": 5.0707533957028983e-05,
"loss": 5.6522,
"mean_token_accuracy": 0.18439037799835206,
"num_tokens": 15820625.0,
"step": 4900
},
{
"entropy": 6.540463066101074,
"epoch": 9.791208791208792,
"grad_norm": 1.234375,
"learning_rate": 5.063924744136187e-05,
"loss": 5.5079,
"mean_token_accuracy": 0.19837560951709748,
"num_tokens": 15836340.0,
"step": 4905
},
{
"entropy": 6.601055049896241,
"epoch": 9.801198801198801,
"grad_norm": 1.1328125,
"learning_rate": 5.057442084604665e-05,
"loss": 5.7326,
"mean_token_accuracy": 0.17368686497211455,
"num_tokens": 15851604.0,
"step": 4910
},
{
"entropy": 6.569333505630493,
"epoch": 9.811188811188812,
"grad_norm": 1.2265625,
"learning_rate": 5.0513055170789604e-05,
"loss": 5.6637,
"mean_token_accuracy": 0.17966740876436232,
"num_tokens": 15867066.0,
"step": 4915
},
{
"entropy": 6.619227552413941,
"epoch": 9.82117882117882,
"grad_norm": 1.1640625,
"learning_rate": 5.0455151361925405e-05,
"loss": 5.7351,
"mean_token_accuracy": 0.16746960580348969,
"num_tokens": 15882640.0,
"step": 4920
},
{
"entropy": 6.645801162719726,
"epoch": 9.831168831168831,
"grad_norm": 0.96484375,
"learning_rate": 5.040071031240235e-05,
"loss": 5.7105,
"mean_token_accuracy": 0.1727930173277855,
"num_tokens": 15900292.0,
"step": 4925
},
{
"entropy": 6.617860460281372,
"epoch": 9.84115884115884,
"grad_norm": 1.1015625,
"learning_rate": 5.034973286176881e-05,
"loss": 5.6304,
"mean_token_accuracy": 0.18506597131490707,
"num_tokens": 15916423.0,
"step": 4930
},
{
"entropy": 6.6556047916412355,
"epoch": 9.851148851148851,
"grad_norm": 1.1875,
"learning_rate": 5.0302219796160134e-05,
"loss": 5.7757,
"mean_token_accuracy": 0.16685285568237304,
"num_tokens": 15932313.0,
"step": 4935
},
{
"entropy": 6.522368335723877,
"epoch": 9.861138861138862,
"grad_norm": 1.1484375,
"learning_rate": 5.025817184828657e-05,
"loss": 5.561,
"mean_token_accuracy": 0.18559598326683044,
"num_tokens": 15948754.0,
"step": 4940
},
{
"entropy": 6.592281007766724,
"epoch": 9.871128871128871,
"grad_norm": 1.109375,
"learning_rate": 5.0217589697421946e-05,
"loss": 5.6398,
"mean_token_accuracy": 0.18047972321510314,
"num_tokens": 15964160.0,
"step": 4945
},
{
"entropy": 6.679210996627807,
"epoch": 9.881118881118882,
"grad_norm": 1.0390625,
"learning_rate": 5.0180473969393244e-05,
"loss": 5.7319,
"mean_token_accuracy": 0.16809917241334915,
"num_tokens": 15981184.0,
"step": 4950
},
{
"entropy": 6.58340163230896,
"epoch": 9.89110889110889,
"grad_norm": 1.0625,
"learning_rate": 5.014682523657089e-05,
"loss": 5.6182,
"mean_token_accuracy": 0.1859930247068405,
"num_tokens": 15997883.0,
"step": 4955
},
{
"entropy": 6.644883108139038,
"epoch": 9.901098901098901,
"grad_norm": 1.078125,
"learning_rate": 5.011664401786001e-05,
"loss": 5.7319,
"mean_token_accuracy": 0.1722308561205864,
"num_tokens": 16013860.0,
"step": 4960
},
{
"entropy": 6.647361135482788,
"epoch": 9.91108891108891,
"grad_norm": 1.2109375,
"learning_rate": 5.008993077869228e-05,
"loss": 5.6742,
"mean_token_accuracy": 0.17641904950141907,
"num_tokens": 16029231.0,
"step": 4965
},
{
"entropy": 6.586844158172608,
"epoch": 9.921078921078921,
"grad_norm": 1.1015625,
"learning_rate": 5.0066685931018946e-05,
"loss": 5.6617,
"mean_token_accuracy": 0.18107237070798873,
"num_tokens": 16045431.0,
"step": 4970
},
{
"entropy": 6.605205011367798,
"epoch": 9.931068931068932,
"grad_norm": 1.1640625,
"learning_rate": 5.004690983330425e-05,
"loss": 5.6267,
"mean_token_accuracy": 0.18259226828813552,
"num_tokens": 16060969.0,
"step": 4975
},
{
"entropy": 6.547778224945068,
"epoch": 9.941058941058941,
"grad_norm": 1.296875,
"learning_rate": 5.003060279052015e-05,
"loss": 5.5907,
"mean_token_accuracy": 0.18539558351039886,
"num_tokens": 16076444.0,
"step": 4980
},
{
"entropy": 6.529587841033935,
"epoch": 9.951048951048952,
"grad_norm": 1.046875,
"learning_rate": 5.0017765054141375e-05,
"loss": 5.6592,
"mean_token_accuracy": 0.1831126555800438,
"num_tokens": 16092998.0,
"step": 4985
},
{
"entropy": 6.509506511688232,
"epoch": 9.96103896103896,
"grad_norm": 1.125,
"learning_rate": 5.000839682214173e-05,
"loss": 5.5305,
"mean_token_accuracy": 0.18782208263874053,
"num_tokens": 16108272.0,
"step": 4990
},
{
"entropy": 6.606856393814087,
"epoch": 9.971028971028971,
"grad_norm": 1.1328125,
"learning_rate": 5.0002498238990904e-05,
"loss": 5.719,
"mean_token_accuracy": 0.17680859565734863,
"num_tokens": 16125117.0,
"step": 4995
},
{
"entropy": 6.588427019119263,
"epoch": 9.98101898101898,
"grad_norm": 1.171875,
"learning_rate": 5.000006939565238e-05,
"loss": 5.6483,
"mean_token_accuracy": 0.17816835641860962,
"num_tokens": 16141118.0,
"step": 5000
},
{
"epoch": 9.98101898101898,
"eval_entropy": 6.481703235007621,
"eval_loss": 7.082968235015869,
"eval_mean_token_accuracy": 0.11054416713682381,
"eval_num_tokens": 16141118.0,
"eval_runtime": 1.1749,
"eval_samples_per_second": 1254.622,
"eval_steps_per_second": 157.466,
"step": 5000
}
],
"logging_steps": 5,
"max_steps": 5000,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3251594459013120.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}