Files
dan-latn-10mb-after-ppt-Dp-…/checkpoint-3000/trainer_state.json

6046 lines
164 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.25058469762779817,
"eval_steps": 3000,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 6.974994325637818,
"epoch": 0.000417641162712997,
"grad_norm": 1.015625,
"learning_rate": 2e-06,
"loss": 6.6015,
"mean_token_accuracy": 0.10177180394530297,
"num_tokens": 9371.0,
"step": 5
},
{
"entropy": 7.047821569442749,
"epoch": 0.000835282325425994,
"grad_norm": 1.125,
"learning_rate": 4.5e-06,
"loss": 6.6893,
"mean_token_accuracy": 0.10747795924544334,
"num_tokens": 18155.0,
"step": 10
},
{
"entropy": 7.001016473770141,
"epoch": 0.001252923488138991,
"grad_norm": 0.97265625,
"learning_rate": 7e-06,
"loss": 6.6687,
"mean_token_accuracy": 0.0982088290154934,
"num_tokens": 27776.0,
"step": 15
},
{
"entropy": 7.041731929779052,
"epoch": 0.001670564650851988,
"grad_norm": 1.0859375,
"learning_rate": 9.5e-06,
"loss": 6.6699,
"mean_token_accuracy": 0.10469619780778885,
"num_tokens": 37166.0,
"step": 20
},
{
"entropy": 7.000826597213745,
"epoch": 0.002088205813564985,
"grad_norm": 0.9375,
"learning_rate": 1.2e-05,
"loss": 6.618,
"mean_token_accuracy": 0.10739438831806183,
"num_tokens": 46667.0,
"step": 25
},
{
"entropy": 7.009681844711304,
"epoch": 0.002505846976277982,
"grad_norm": 0.93359375,
"learning_rate": 1.4500000000000002e-05,
"loss": 6.6186,
"mean_token_accuracy": 0.10922864452004433,
"num_tokens": 55738.0,
"step": 30
},
{
"entropy": 7.123480558395386,
"epoch": 0.002923488138990979,
"grad_norm": 0.921875,
"learning_rate": 1.7000000000000003e-05,
"loss": 6.7494,
"mean_token_accuracy": 0.1005694568157196,
"num_tokens": 65303.0,
"step": 35
},
{
"entropy": 7.074628782272339,
"epoch": 0.003341129301703976,
"grad_norm": 1.0546875,
"learning_rate": 1.95e-05,
"loss": 6.5241,
"mean_token_accuracy": 0.11036743149161339,
"num_tokens": 74876.0,
"step": 40
},
{
"entropy": 7.085372972488403,
"epoch": 0.003758770464416973,
"grad_norm": 1.1484375,
"learning_rate": 2.2e-05,
"loss": 6.6515,
"mean_token_accuracy": 0.11546419188380241,
"num_tokens": 84683.0,
"step": 45
},
{
"entropy": 7.120099067687988,
"epoch": 0.00417641162712997,
"grad_norm": 0.98828125,
"learning_rate": 2.4500000000000003e-05,
"loss": 6.6524,
"mean_token_accuracy": 0.10372202694416047,
"num_tokens": 94511.0,
"step": 50
},
{
"entropy": 7.116729831695556,
"epoch": 0.004594052789842967,
"grad_norm": 0.93359375,
"learning_rate": 2.7e-05,
"loss": 6.6418,
"mean_token_accuracy": 0.11203298419713974,
"num_tokens": 103820.0,
"step": 55
},
{
"entropy": 7.081749200820923,
"epoch": 0.005011693952555964,
"grad_norm": 0.921875,
"learning_rate": 2.95e-05,
"loss": 6.6178,
"mean_token_accuracy": 0.10972007438540458,
"num_tokens": 112398.0,
"step": 60
},
{
"entropy": 7.064388227462769,
"epoch": 0.005429335115268961,
"grad_norm": 1.03125,
"learning_rate": 3.2e-05,
"loss": 6.5782,
"mean_token_accuracy": 0.11708607077598572,
"num_tokens": 121167.0,
"step": 65
},
{
"entropy": 7.080944776535034,
"epoch": 0.005846976277981958,
"grad_norm": 1.0703125,
"learning_rate": 3.4500000000000005e-05,
"loss": 6.596,
"mean_token_accuracy": 0.11205784305930137,
"num_tokens": 129399.0,
"step": 70
},
{
"entropy": 7.128628587722778,
"epoch": 0.006264617440694955,
"grad_norm": 1.0625,
"learning_rate": 3.7e-05,
"loss": 6.5887,
"mean_token_accuracy": 0.10802783071994781,
"num_tokens": 138512.0,
"step": 75
},
{
"entropy": 7.073452806472778,
"epoch": 0.006682258603407952,
"grad_norm": 1.0234375,
"learning_rate": 3.95e-05,
"loss": 6.6437,
"mean_token_accuracy": 0.10293481424450875,
"num_tokens": 147712.0,
"step": 80
},
{
"entropy": 7.0505595207214355,
"epoch": 0.007099899766120949,
"grad_norm": 1.09375,
"learning_rate": 4.2000000000000004e-05,
"loss": 6.6094,
"mean_token_accuracy": 0.11598187386989593,
"num_tokens": 156759.0,
"step": 85
},
{
"entropy": 7.033814144134522,
"epoch": 0.007517540928833946,
"grad_norm": 1.0546875,
"learning_rate": 4.45e-05,
"loss": 6.6423,
"mean_token_accuracy": 0.10784239917993546,
"num_tokens": 166395.0,
"step": 90
},
{
"entropy": 7.128949785232544,
"epoch": 0.007935182091546943,
"grad_norm": 1.0390625,
"learning_rate": 4.7000000000000004e-05,
"loss": 6.5776,
"mean_token_accuracy": 0.11605502218008042,
"num_tokens": 174739.0,
"step": 95
},
{
"entropy": 7.042219877243042,
"epoch": 0.00835282325425994,
"grad_norm": 1.03125,
"learning_rate": 4.9500000000000004e-05,
"loss": 6.4709,
"mean_token_accuracy": 0.11599281206727027,
"num_tokens": 183010.0,
"step": 100
},
{
"entropy": 6.9831122875213625,
"epoch": 0.008770464416972937,
"grad_norm": 0.953125,
"learning_rate": 5.2e-05,
"loss": 6.6344,
"mean_token_accuracy": 0.1058510735630989,
"num_tokens": 192589.0,
"step": 105
},
{
"entropy": 7.014032506942749,
"epoch": 0.009188105579685933,
"grad_norm": 0.99609375,
"learning_rate": 5.45e-05,
"loss": 6.5731,
"mean_token_accuracy": 0.11620197221636772,
"num_tokens": 201638.0,
"step": 110
},
{
"entropy": 7.060356569290161,
"epoch": 0.00960574674239893,
"grad_norm": 1.140625,
"learning_rate": 5.7e-05,
"loss": 6.4989,
"mean_token_accuracy": 0.11458343639969826,
"num_tokens": 209862.0,
"step": 115
},
{
"entropy": 7.0534099578857425,
"epoch": 0.010023387905111928,
"grad_norm": 1.046875,
"learning_rate": 5.9499999999999996e-05,
"loss": 6.6346,
"mean_token_accuracy": 0.10284667909145355,
"num_tokens": 218897.0,
"step": 120
},
{
"entropy": 7.093526840209961,
"epoch": 0.010441029067824925,
"grad_norm": 1.09375,
"learning_rate": 6.2e-05,
"loss": 6.6924,
"mean_token_accuracy": 0.1075212113559246,
"num_tokens": 227682.0,
"step": 125
},
{
"entropy": 7.1558643817901615,
"epoch": 0.010858670230537921,
"grad_norm": 1.203125,
"learning_rate": 6.450000000000001e-05,
"loss": 6.5783,
"mean_token_accuracy": 0.11288131624460221,
"num_tokens": 236170.0,
"step": 130
},
{
"entropy": 7.093167066574097,
"epoch": 0.011276311393250919,
"grad_norm": 1.09375,
"learning_rate": 6.7e-05,
"loss": 6.6689,
"mean_token_accuracy": 0.10450198128819466,
"num_tokens": 245710.0,
"step": 135
},
{
"entropy": 6.978710603713989,
"epoch": 0.011693952555963916,
"grad_norm": 1.140625,
"learning_rate": 6.950000000000001e-05,
"loss": 6.6178,
"mean_token_accuracy": 0.10575460121035576,
"num_tokens": 254751.0,
"step": 140
},
{
"entropy": 7.034113359451294,
"epoch": 0.012111593718676913,
"grad_norm": 1.0546875,
"learning_rate": 7.2e-05,
"loss": 6.5614,
"mean_token_accuracy": 0.11512050479650497,
"num_tokens": 264210.0,
"step": 145
},
{
"entropy": 7.06213526725769,
"epoch": 0.01252923488138991,
"grad_norm": 1.125,
"learning_rate": 7.45e-05,
"loss": 6.5988,
"mean_token_accuracy": 0.11738329231739045,
"num_tokens": 272944.0,
"step": 150
},
{
"entropy": 7.066068315505982,
"epoch": 0.012946876044102907,
"grad_norm": 1.1328125,
"learning_rate": 7.7e-05,
"loss": 6.5057,
"mean_token_accuracy": 0.11759286895394325,
"num_tokens": 281311.0,
"step": 155
},
{
"entropy": 6.99861330986023,
"epoch": 0.013364517206815904,
"grad_norm": 1.0546875,
"learning_rate": 7.950000000000001e-05,
"loss": 6.4934,
"mean_token_accuracy": 0.11470050439238548,
"num_tokens": 289701.0,
"step": 160
},
{
"entropy": 6.999594020843506,
"epoch": 0.013782158369528901,
"grad_norm": 0.98046875,
"learning_rate": 8.2e-05,
"loss": 6.6443,
"mean_token_accuracy": 0.1106612429022789,
"num_tokens": 299459.0,
"step": 165
},
{
"entropy": 7.093910980224609,
"epoch": 0.014199799532241897,
"grad_norm": 1.171875,
"learning_rate": 8.450000000000001e-05,
"loss": 6.6559,
"mean_token_accuracy": 0.10836043506860733,
"num_tokens": 309343.0,
"step": 170
},
{
"entropy": 7.137103700637818,
"epoch": 0.014617440694954895,
"grad_norm": 1.296875,
"learning_rate": 8.7e-05,
"loss": 6.6505,
"mean_token_accuracy": 0.10711321234703064,
"num_tokens": 318840.0,
"step": 175
},
{
"entropy": 6.972873401641846,
"epoch": 0.015035081857667892,
"grad_norm": 1.0234375,
"learning_rate": 8.95e-05,
"loss": 6.4931,
"mean_token_accuracy": 0.11117812916636467,
"num_tokens": 328689.0,
"step": 180
},
{
"entropy": 6.988192701339722,
"epoch": 0.01545272302038089,
"grad_norm": 1.203125,
"learning_rate": 9.2e-05,
"loss": 6.6021,
"mean_token_accuracy": 0.10945339202880859,
"num_tokens": 338209.0,
"step": 185
},
{
"entropy": 7.049764633178711,
"epoch": 0.015870364183093885,
"grad_norm": 1.03125,
"learning_rate": 9.45e-05,
"loss": 6.5287,
"mean_token_accuracy": 0.11342571824789047,
"num_tokens": 347270.0,
"step": 190
},
{
"entropy": 7.03518533706665,
"epoch": 0.016288005345806884,
"grad_norm": 1.109375,
"learning_rate": 9.7e-05,
"loss": 6.5849,
"mean_token_accuracy": 0.11009221971035003,
"num_tokens": 356366.0,
"step": 195
},
{
"entropy": 7.03167085647583,
"epoch": 0.01670564650851988,
"grad_norm": 1.1875,
"learning_rate": 9.95e-05,
"loss": 6.5328,
"mean_token_accuracy": 0.11283481717109681,
"num_tokens": 365980.0,
"step": 200
},
{
"entropy": 6.968191242218017,
"epoch": 0.017123287671232876,
"grad_norm": 1.1015625,
"learning_rate": 0.000102,
"loss": 6.5148,
"mean_token_accuracy": 0.11944594606757164,
"num_tokens": 374591.0,
"step": 205
},
{
"entropy": 7.072711515426636,
"epoch": 0.017540928833945875,
"grad_norm": 1.2109375,
"learning_rate": 0.00010449999999999999,
"loss": 6.5385,
"mean_token_accuracy": 0.1136755608022213,
"num_tokens": 383250.0,
"step": 210
},
{
"entropy": 6.995183229446411,
"epoch": 0.01795856999665887,
"grad_norm": 1.1875,
"learning_rate": 0.000107,
"loss": 6.4583,
"mean_token_accuracy": 0.11463667005300522,
"num_tokens": 391502.0,
"step": 215
},
{
"entropy": 6.895081424713135,
"epoch": 0.018376211159371866,
"grad_norm": 1.203125,
"learning_rate": 0.0001095,
"loss": 6.3988,
"mean_token_accuracy": 0.11630335673689843,
"num_tokens": 400225.0,
"step": 220
},
{
"entropy": 7.06805739402771,
"epoch": 0.018793852322084866,
"grad_norm": 1.0625,
"learning_rate": 0.000112,
"loss": 6.6072,
"mean_token_accuracy": 0.10876822546124458,
"num_tokens": 410008.0,
"step": 225
},
{
"entropy": 7.0077355861663815,
"epoch": 0.01921149348479786,
"grad_norm": 1.1640625,
"learning_rate": 0.0001145,
"loss": 6.5571,
"mean_token_accuracy": 0.11483839824795723,
"num_tokens": 418979.0,
"step": 230
},
{
"entropy": 6.974493551254272,
"epoch": 0.01962913464751086,
"grad_norm": 1.09375,
"learning_rate": 0.00011700000000000001,
"loss": 6.5401,
"mean_token_accuracy": 0.11396894752979278,
"num_tokens": 428139.0,
"step": 235
},
{
"entropy": 7.025577116012573,
"epoch": 0.020046775810223856,
"grad_norm": 1.21875,
"learning_rate": 0.00011949999999999999,
"loss": 6.4599,
"mean_token_accuracy": 0.1212654784321785,
"num_tokens": 437113.0,
"step": 240
},
{
"entropy": 7.048428630828857,
"epoch": 0.020464416972936852,
"grad_norm": 1.3515625,
"learning_rate": 0.000122,
"loss": 6.7074,
"mean_token_accuracy": 0.10927195772528649,
"num_tokens": 446879.0,
"step": 245
},
{
"entropy": 7.040731477737427,
"epoch": 0.02088205813564985,
"grad_norm": 1.3125,
"learning_rate": 0.0001245,
"loss": 6.6006,
"mean_token_accuracy": 0.11155584380030632,
"num_tokens": 456362.0,
"step": 250
},
{
"entropy": 6.9144243717193605,
"epoch": 0.021299699298362847,
"grad_norm": 1.1875,
"learning_rate": 0.000127,
"loss": 6.4035,
"mean_token_accuracy": 0.12014602795243264,
"num_tokens": 464930.0,
"step": 255
},
{
"entropy": 7.058174657821655,
"epoch": 0.021717340461075842,
"grad_norm": 1.125,
"learning_rate": 0.0001295,
"loss": 6.5859,
"mean_token_accuracy": 0.10830959379673004,
"num_tokens": 474303.0,
"step": 260
},
{
"entropy": 7.00397891998291,
"epoch": 0.02213498162378884,
"grad_norm": 1.03125,
"learning_rate": 0.000132,
"loss": 6.6132,
"mean_token_accuracy": 0.10992222279310226,
"num_tokens": 483750.0,
"step": 265
},
{
"entropy": 6.9822266578674315,
"epoch": 0.022552622786501837,
"grad_norm": 1.015625,
"learning_rate": 0.00013450000000000002,
"loss": 6.5084,
"mean_token_accuracy": 0.11087508201599121,
"num_tokens": 493325.0,
"step": 270
},
{
"entropy": 7.009824895858765,
"epoch": 0.022970263949214833,
"grad_norm": 1.15625,
"learning_rate": 0.00013700000000000002,
"loss": 6.5137,
"mean_token_accuracy": 0.10929684713482857,
"num_tokens": 501907.0,
"step": 275
},
{
"entropy": 6.979407691955567,
"epoch": 0.023387905111927832,
"grad_norm": 1.125,
"learning_rate": 0.0001395,
"loss": 6.5808,
"mean_token_accuracy": 0.11485241651535034,
"num_tokens": 511522.0,
"step": 280
},
{
"entropy": 7.028356742858887,
"epoch": 0.023805546274640828,
"grad_norm": 1.1015625,
"learning_rate": 0.00014199999999999998,
"loss": 6.5271,
"mean_token_accuracy": 0.11359211280941964,
"num_tokens": 521287.0,
"step": 285
},
{
"entropy": 7.061210489273071,
"epoch": 0.024223187437353827,
"grad_norm": 1.1640625,
"learning_rate": 0.0001445,
"loss": 6.6216,
"mean_token_accuracy": 0.105019910633564,
"num_tokens": 530631.0,
"step": 290
},
{
"entropy": 6.979819393157959,
"epoch": 0.024640828600066823,
"grad_norm": 1.15625,
"learning_rate": 0.000147,
"loss": 6.5007,
"mean_token_accuracy": 0.12092425003647804,
"num_tokens": 540386.0,
"step": 295
},
{
"entropy": 6.993960380554199,
"epoch": 0.02505846976277982,
"grad_norm": 1.15625,
"learning_rate": 0.0001495,
"loss": 6.5707,
"mean_token_accuracy": 0.10561831966042519,
"num_tokens": 550121.0,
"step": 300
},
{
"entropy": 6.893993711471557,
"epoch": 0.025476110925492818,
"grad_norm": 1.2734375,
"learning_rate": 0.000152,
"loss": 6.4518,
"mean_token_accuracy": 0.11266563385725022,
"num_tokens": 559460.0,
"step": 305
},
{
"entropy": 7.0018908977508545,
"epoch": 0.025893752088205813,
"grad_norm": 1.140625,
"learning_rate": 0.00015450000000000001,
"loss": 6.4121,
"mean_token_accuracy": 0.12040314078330994,
"num_tokens": 568392.0,
"step": 310
},
{
"entropy": 6.900617361068726,
"epoch": 0.02631139325091881,
"grad_norm": 1.0234375,
"learning_rate": 0.000157,
"loss": 6.5224,
"mean_token_accuracy": 0.11066874042153359,
"num_tokens": 578248.0,
"step": 315
},
{
"entropy": 7.024792003631592,
"epoch": 0.026729034413631808,
"grad_norm": 1.0546875,
"learning_rate": 0.0001595,
"loss": 6.602,
"mean_token_accuracy": 0.10860413312911987,
"num_tokens": 588164.0,
"step": 320
},
{
"entropy": 6.956603240966797,
"epoch": 0.027146675576344804,
"grad_norm": 1.0859375,
"learning_rate": 0.000162,
"loss": 6.5426,
"mean_token_accuracy": 0.11270351558923722,
"num_tokens": 598715.0,
"step": 325
},
{
"entropy": 7.0015754222869875,
"epoch": 0.027564316739057803,
"grad_norm": 1.1953125,
"learning_rate": 0.00016450000000000001,
"loss": 6.4531,
"mean_token_accuracy": 0.11661125272512436,
"num_tokens": 606939.0,
"step": 330
},
{
"entropy": 6.93249478340149,
"epoch": 0.0279819579017708,
"grad_norm": 1.2734375,
"learning_rate": 0.00016700000000000002,
"loss": 6.5601,
"mean_token_accuracy": 0.1157400868833065,
"num_tokens": 615803.0,
"step": 335
},
{
"entropy": 6.946778154373169,
"epoch": 0.028399599064483794,
"grad_norm": 1.1328125,
"learning_rate": 0.00016950000000000003,
"loss": 6.4094,
"mean_token_accuracy": 0.11591838151216508,
"num_tokens": 624730.0,
"step": 340
},
{
"entropy": 6.9720173358917235,
"epoch": 0.028817240227196794,
"grad_norm": 1.28125,
"learning_rate": 0.00017199999999999998,
"loss": 6.5152,
"mean_token_accuracy": 0.11504784747958183,
"num_tokens": 634082.0,
"step": 345
},
{
"entropy": 7.009779977798462,
"epoch": 0.02923488138990979,
"grad_norm": 1.0703125,
"learning_rate": 0.00017449999999999999,
"loss": 6.5062,
"mean_token_accuracy": 0.11588201373815536,
"num_tokens": 643367.0,
"step": 350
},
{
"entropy": 6.747243738174438,
"epoch": 0.029652522552622785,
"grad_norm": 1.265625,
"learning_rate": 0.000177,
"loss": 6.3467,
"mean_token_accuracy": 0.11819797530770301,
"num_tokens": 651861.0,
"step": 355
},
{
"entropy": 6.997044849395752,
"epoch": 0.030070163715335784,
"grad_norm": 1.203125,
"learning_rate": 0.0001795,
"loss": 6.4763,
"mean_token_accuracy": 0.11358832642436027,
"num_tokens": 661064.0,
"step": 360
},
{
"entropy": 6.892722797393799,
"epoch": 0.03048780487804878,
"grad_norm": 1.1953125,
"learning_rate": 0.000182,
"loss": 6.4584,
"mean_token_accuracy": 0.12111971825361252,
"num_tokens": 669299.0,
"step": 365
},
{
"entropy": 6.900249767303467,
"epoch": 0.03090544604076178,
"grad_norm": 1.2265625,
"learning_rate": 0.0001845,
"loss": 6.5432,
"mean_token_accuracy": 0.11214440464973449,
"num_tokens": 678631.0,
"step": 370
},
{
"entropy": 6.960112619400024,
"epoch": 0.03132308720347477,
"grad_norm": 1.2109375,
"learning_rate": 0.000187,
"loss": 6.5439,
"mean_token_accuracy": 0.11418872177600861,
"num_tokens": 688511.0,
"step": 375
},
{
"entropy": 6.962337827682495,
"epoch": 0.03174072836618777,
"grad_norm": 1.109375,
"learning_rate": 0.0001895,
"loss": 6.4884,
"mean_token_accuracy": 0.11288235932588578,
"num_tokens": 697956.0,
"step": 380
},
{
"entropy": 6.944037771224975,
"epoch": 0.03215836952890077,
"grad_norm": 1.2265625,
"learning_rate": 0.000192,
"loss": 6.3916,
"mean_token_accuracy": 0.12509041503071786,
"num_tokens": 706779.0,
"step": 385
},
{
"entropy": 6.810015869140625,
"epoch": 0.03257601069161377,
"grad_norm": 1.1171875,
"learning_rate": 0.0001945,
"loss": 6.4229,
"mean_token_accuracy": 0.11323002874851226,
"num_tokens": 715749.0,
"step": 390
},
{
"entropy": 6.847266960144043,
"epoch": 0.03299365185432676,
"grad_norm": 1.3046875,
"learning_rate": 0.00019700000000000002,
"loss": 6.3759,
"mean_token_accuracy": 0.11320273652672767,
"num_tokens": 724756.0,
"step": 395
},
{
"entropy": 6.870378017425537,
"epoch": 0.03341129301703976,
"grad_norm": 1.2421875,
"learning_rate": 0.00019950000000000002,
"loss": 6.4005,
"mean_token_accuracy": 0.11667888462543488,
"num_tokens": 733288.0,
"step": 400
},
{
"entropy": 6.97679648399353,
"epoch": 0.03382893417975276,
"grad_norm": 1.4296875,
"learning_rate": 0.000202,
"loss": 6.5154,
"mean_token_accuracy": 0.11304147318005561,
"num_tokens": 741629.0,
"step": 405
},
{
"entropy": 6.885066270828247,
"epoch": 0.03424657534246575,
"grad_norm": 1.1953125,
"learning_rate": 0.00020449999999999998,
"loss": 6.4607,
"mean_token_accuracy": 0.11880626678466796,
"num_tokens": 751336.0,
"step": 410
},
{
"entropy": 7.025588083267212,
"epoch": 0.03466421650517875,
"grad_norm": 1.25,
"learning_rate": 0.000207,
"loss": 6.5438,
"mean_token_accuracy": 0.10914942175149918,
"num_tokens": 759725.0,
"step": 415
},
{
"entropy": 6.9342803955078125,
"epoch": 0.03508185766789175,
"grad_norm": 1.1640625,
"learning_rate": 0.0002095,
"loss": 6.5553,
"mean_token_accuracy": 0.1125187747180462,
"num_tokens": 769752.0,
"step": 420
},
{
"entropy": 6.87856764793396,
"epoch": 0.03549949883060474,
"grad_norm": 1.203125,
"learning_rate": 0.000212,
"loss": 6.4352,
"mean_token_accuracy": 0.11564558148384094,
"num_tokens": 779124.0,
"step": 425
},
{
"entropy": 6.843322324752807,
"epoch": 0.03591713999331774,
"grad_norm": 1.2578125,
"learning_rate": 0.0002145,
"loss": 6.4045,
"mean_token_accuracy": 0.11882894486188889,
"num_tokens": 788892.0,
"step": 430
},
{
"entropy": 6.755243921279908,
"epoch": 0.03633478115603074,
"grad_norm": 1.1171875,
"learning_rate": 0.00021700000000000002,
"loss": 6.3802,
"mean_token_accuracy": 0.12028775066137314,
"num_tokens": 798265.0,
"step": 435
},
{
"entropy": 6.811845159530639,
"epoch": 0.03675242231874373,
"grad_norm": 1.296875,
"learning_rate": 0.0002195,
"loss": 6.3309,
"mean_token_accuracy": 0.12370585277676582,
"num_tokens": 806896.0,
"step": 440
},
{
"entropy": 6.91562705039978,
"epoch": 0.03717006348145673,
"grad_norm": 1.2265625,
"learning_rate": 0.000222,
"loss": 6.4074,
"mean_token_accuracy": 0.12382019609212876,
"num_tokens": 815540.0,
"step": 445
},
{
"entropy": 6.7790063381195065,
"epoch": 0.03758770464416973,
"grad_norm": 1.140625,
"learning_rate": 0.0002245,
"loss": 6.4711,
"mean_token_accuracy": 0.11695906072854996,
"num_tokens": 824555.0,
"step": 450
},
{
"entropy": 6.968459796905518,
"epoch": 0.03800534580688272,
"grad_norm": 1.2578125,
"learning_rate": 0.00022700000000000002,
"loss": 6.5115,
"mean_token_accuracy": 0.11615965217351913,
"num_tokens": 833414.0,
"step": 455
},
{
"entropy": 6.775349855422974,
"epoch": 0.03842298696959572,
"grad_norm": 1.140625,
"learning_rate": 0.00022950000000000002,
"loss": 6.3606,
"mean_token_accuracy": 0.12755532786250115,
"num_tokens": 842644.0,
"step": 460
},
{
"entropy": 6.829344940185547,
"epoch": 0.03884062813230872,
"grad_norm": 1.1953125,
"learning_rate": 0.00023200000000000003,
"loss": 6.3942,
"mean_token_accuracy": 0.11902292668819428,
"num_tokens": 851786.0,
"step": 465
},
{
"entropy": 6.812217950820923,
"epoch": 0.03925826929502172,
"grad_norm": 1.1328125,
"learning_rate": 0.00023449999999999998,
"loss": 6.4623,
"mean_token_accuracy": 0.11948096305131913,
"num_tokens": 861508.0,
"step": 470
},
{
"entropy": 6.814907360076904,
"epoch": 0.03967591045773471,
"grad_norm": 1.21875,
"learning_rate": 0.000237,
"loss": 6.335,
"mean_token_accuracy": 0.12454579472541809,
"num_tokens": 870433.0,
"step": 475
},
{
"entropy": 6.905804967880249,
"epoch": 0.04009355162044771,
"grad_norm": 1.25,
"learning_rate": 0.0002395,
"loss": 6.4355,
"mean_token_accuracy": 0.11918441057205201,
"num_tokens": 879059.0,
"step": 480
},
{
"entropy": 6.840558004379273,
"epoch": 0.04051119278316071,
"grad_norm": 1.1328125,
"learning_rate": 0.000242,
"loss": 6.4766,
"mean_token_accuracy": 0.1148101843893528,
"num_tokens": 888009.0,
"step": 485
},
{
"entropy": 6.811307907104492,
"epoch": 0.040928833945873704,
"grad_norm": 1.25,
"learning_rate": 0.0002445,
"loss": 6.3523,
"mean_token_accuracy": 0.11887899562716484,
"num_tokens": 897335.0,
"step": 490
},
{
"entropy": 6.947777843475341,
"epoch": 0.0413464751085867,
"grad_norm": 1.1953125,
"learning_rate": 0.000247,
"loss": 6.3711,
"mean_token_accuracy": 0.12019851058721542,
"num_tokens": 905802.0,
"step": 495
},
{
"entropy": 6.698061895370484,
"epoch": 0.0417641162712997,
"grad_norm": 1.1796875,
"learning_rate": 0.0002495,
"loss": 6.3767,
"mean_token_accuracy": 0.12129626050591469,
"num_tokens": 914836.0,
"step": 500
},
{
"entropy": 6.701544523239136,
"epoch": 0.042181757434012694,
"grad_norm": 1.171875,
"learning_rate": 0.000252,
"loss": 6.3367,
"mean_token_accuracy": 0.12701809629797936,
"num_tokens": 924254.0,
"step": 505
},
{
"entropy": 6.849635410308838,
"epoch": 0.04259939859672569,
"grad_norm": 1.2109375,
"learning_rate": 0.0002545,
"loss": 6.4222,
"mean_token_accuracy": 0.1207270435988903,
"num_tokens": 933841.0,
"step": 510
},
{
"entropy": 6.831308794021607,
"epoch": 0.04301703975943869,
"grad_norm": 1.1875,
"learning_rate": 0.000257,
"loss": 6.4824,
"mean_token_accuracy": 0.11359498947858811,
"num_tokens": 943304.0,
"step": 515
},
{
"entropy": 6.787075567245483,
"epoch": 0.043434680922151685,
"grad_norm": 1.171875,
"learning_rate": 0.0002595,
"loss": 6.3107,
"mean_token_accuracy": 0.12178815752267838,
"num_tokens": 952915.0,
"step": 520
},
{
"entropy": 6.7996033191680905,
"epoch": 0.043852322084864684,
"grad_norm": 1.15625,
"learning_rate": 0.000262,
"loss": 6.376,
"mean_token_accuracy": 0.11833536252379417,
"num_tokens": 962752.0,
"step": 525
},
{
"entropy": 6.803986644744873,
"epoch": 0.04426996324757768,
"grad_norm": 1.328125,
"learning_rate": 0.00026450000000000003,
"loss": 6.3967,
"mean_token_accuracy": 0.11484252288937569,
"num_tokens": 971240.0,
"step": 530
},
{
"entropy": 6.836751461029053,
"epoch": 0.044687604410290675,
"grad_norm": 1.21875,
"learning_rate": 0.00026700000000000004,
"loss": 6.4379,
"mean_token_accuracy": 0.11609105840325355,
"num_tokens": 981391.0,
"step": 535
},
{
"entropy": 6.825729942321777,
"epoch": 0.045105245573003674,
"grad_norm": 1.0625,
"learning_rate": 0.00026950000000000005,
"loss": 6.4411,
"mean_token_accuracy": 0.12200247570872307,
"num_tokens": 990551.0,
"step": 540
},
{
"entropy": 6.753824377059937,
"epoch": 0.045522886735716674,
"grad_norm": 1.3125,
"learning_rate": 0.00027200000000000005,
"loss": 6.3708,
"mean_token_accuracy": 0.12560774609446526,
"num_tokens": 999593.0,
"step": 545
},
{
"entropy": 6.751221561431885,
"epoch": 0.045940527898429666,
"grad_norm": 1.3515625,
"learning_rate": 0.0002745,
"loss": 6.435,
"mean_token_accuracy": 0.1148043192923069,
"num_tokens": 1008785.0,
"step": 550
},
{
"entropy": 6.792971754074097,
"epoch": 0.046358169061142665,
"grad_norm": 1.359375,
"learning_rate": 0.000277,
"loss": 6.4275,
"mean_token_accuracy": 0.11967866346240044,
"num_tokens": 1016815.0,
"step": 555
},
{
"entropy": 6.81648211479187,
"epoch": 0.046775810223855664,
"grad_norm": 1.1484375,
"learning_rate": 0.0002795,
"loss": 6.3119,
"mean_token_accuracy": 0.12556978464126586,
"num_tokens": 1026182.0,
"step": 560
},
{
"entropy": 6.699583864212036,
"epoch": 0.04719345138656866,
"grad_norm": 1.3125,
"learning_rate": 0.00028199999999999997,
"loss": 6.2382,
"mean_token_accuracy": 0.1253122940659523,
"num_tokens": 1034032.0,
"step": 565
},
{
"entropy": 6.784116649627686,
"epoch": 0.047611092549281656,
"grad_norm": 1.0703125,
"learning_rate": 0.0002845,
"loss": 6.4463,
"mean_token_accuracy": 0.1194463238120079,
"num_tokens": 1043493.0,
"step": 570
},
{
"entropy": 6.798874998092652,
"epoch": 0.048028733711994655,
"grad_norm": 1.3203125,
"learning_rate": 0.000287,
"loss": 6.3696,
"mean_token_accuracy": 0.12368837371468544,
"num_tokens": 1052989.0,
"step": 575
},
{
"entropy": 6.72132363319397,
"epoch": 0.048446374874707654,
"grad_norm": 1.25,
"learning_rate": 0.0002895,
"loss": 6.3139,
"mean_token_accuracy": 0.1262795701622963,
"num_tokens": 1061803.0,
"step": 580
},
{
"entropy": 6.786125230789184,
"epoch": 0.048864016037420646,
"grad_norm": 1.0625,
"learning_rate": 0.000292,
"loss": 6.4369,
"mean_token_accuracy": 0.11582259833812714,
"num_tokens": 1071227.0,
"step": 585
},
{
"entropy": 6.798495769500732,
"epoch": 0.049281657200133645,
"grad_norm": 1.21875,
"learning_rate": 0.0002945,
"loss": 6.4515,
"mean_token_accuracy": 0.11928854063153267,
"num_tokens": 1080082.0,
"step": 590
},
{
"entropy": 6.744865560531617,
"epoch": 0.049699298362846644,
"grad_norm": 1.359375,
"learning_rate": 0.000297,
"loss": 6.2751,
"mean_token_accuracy": 0.129691481590271,
"num_tokens": 1089750.0,
"step": 595
},
{
"entropy": 6.612829875946045,
"epoch": 0.05011693952555964,
"grad_norm": 1.2890625,
"learning_rate": 0.0002995,
"loss": 6.2708,
"mean_token_accuracy": 0.12416435405611992,
"num_tokens": 1098691.0,
"step": 600
},
{
"entropy": 6.762234783172607,
"epoch": 0.050534580688272636,
"grad_norm": 1.234375,
"learning_rate": 0.000302,
"loss": 6.304,
"mean_token_accuracy": 0.12247414365410805,
"num_tokens": 1107602.0,
"step": 605
},
{
"entropy": 6.6523035049438475,
"epoch": 0.050952221850985635,
"grad_norm": 1.375,
"learning_rate": 0.0003045,
"loss": 6.2239,
"mean_token_accuracy": 0.1269650489091873,
"num_tokens": 1116426.0,
"step": 610
},
{
"entropy": 6.778998899459839,
"epoch": 0.05136986301369863,
"grad_norm": 1.078125,
"learning_rate": 0.000307,
"loss": 6.4285,
"mean_token_accuracy": 0.11890402808785439,
"num_tokens": 1126221.0,
"step": 615
},
{
"entropy": 6.653987455368042,
"epoch": 0.051787504176411626,
"grad_norm": 1.3671875,
"learning_rate": 0.0003095,
"loss": 6.2885,
"mean_token_accuracy": 0.1295793242752552,
"num_tokens": 1135662.0,
"step": 620
},
{
"entropy": 6.7479198455810545,
"epoch": 0.052205145339124626,
"grad_norm": 1.3046875,
"learning_rate": 0.000312,
"loss": 6.3947,
"mean_token_accuracy": 0.11984972506761551,
"num_tokens": 1143963.0,
"step": 625
},
{
"entropy": 6.682434034347534,
"epoch": 0.05262278650183762,
"grad_norm": 1.2578125,
"learning_rate": 0.0003145,
"loss": 6.2794,
"mean_token_accuracy": 0.1316371254622936,
"num_tokens": 1152470.0,
"step": 630
},
{
"entropy": 6.658819675445557,
"epoch": 0.05304042766455062,
"grad_norm": 1.1640625,
"learning_rate": 0.000317,
"loss": 6.2405,
"mean_token_accuracy": 0.12752789109945298,
"num_tokens": 1161257.0,
"step": 635
},
{
"entropy": 6.748351955413819,
"epoch": 0.053458068827263616,
"grad_norm": 1.1484375,
"learning_rate": 0.0003195,
"loss": 6.3653,
"mean_token_accuracy": 0.12206655815243721,
"num_tokens": 1170969.0,
"step": 640
},
{
"entropy": 6.841134929656983,
"epoch": 0.053875709989976615,
"grad_norm": 1.1171875,
"learning_rate": 0.000322,
"loss": 6.5096,
"mean_token_accuracy": 0.12022155672311782,
"num_tokens": 1181127.0,
"step": 645
},
{
"entropy": 6.656730985641479,
"epoch": 0.05429335115268961,
"grad_norm": 1.1015625,
"learning_rate": 0.00032450000000000003,
"loss": 6.3041,
"mean_token_accuracy": 0.1269573986530304,
"num_tokens": 1190260.0,
"step": 650
},
{
"entropy": 6.648819923400879,
"epoch": 0.05471099231540261,
"grad_norm": 1.1484375,
"learning_rate": 0.00032700000000000003,
"loss": 6.3811,
"mean_token_accuracy": 0.12258001565933227,
"num_tokens": 1200013.0,
"step": 655
},
{
"entropy": 6.800306510925293,
"epoch": 0.055128633478115606,
"grad_norm": 1.609375,
"learning_rate": 0.00032950000000000004,
"loss": 6.2984,
"mean_token_accuracy": 0.12799592241644858,
"num_tokens": 1209239.0,
"step": 660
},
{
"entropy": 6.62961049079895,
"epoch": 0.0555462746408286,
"grad_norm": 1.2421875,
"learning_rate": 0.00033200000000000005,
"loss": 6.2513,
"mean_token_accuracy": 0.12337995842099189,
"num_tokens": 1218552.0,
"step": 665
},
{
"entropy": 6.628785181045532,
"epoch": 0.0559639158035416,
"grad_norm": 1.1328125,
"learning_rate": 0.00033450000000000005,
"loss": 6.3244,
"mean_token_accuracy": 0.12454259842634201,
"num_tokens": 1227632.0,
"step": 670
},
{
"entropy": 6.668724393844604,
"epoch": 0.056381556966254597,
"grad_norm": 1.1796875,
"learning_rate": 0.000337,
"loss": 6.3478,
"mean_token_accuracy": 0.12489912509918213,
"num_tokens": 1236433.0,
"step": 675
},
{
"entropy": 6.6647257804870605,
"epoch": 0.05679919812896759,
"grad_norm": 1.2578125,
"learning_rate": 0.0003395,
"loss": 6.3787,
"mean_token_accuracy": 0.11425701901316643,
"num_tokens": 1245700.0,
"step": 680
},
{
"entropy": 6.721970319747925,
"epoch": 0.05721683929168059,
"grad_norm": 1.1796875,
"learning_rate": 0.000342,
"loss": 6.2294,
"mean_token_accuracy": 0.12574136778712272,
"num_tokens": 1254206.0,
"step": 685
},
{
"entropy": 6.5612939357757565,
"epoch": 0.05763448045439359,
"grad_norm": 1.125,
"learning_rate": 0.00034449999999999997,
"loss": 6.2778,
"mean_token_accuracy": 0.1284436322748661,
"num_tokens": 1263302.0,
"step": 690
},
{
"entropy": 6.64943904876709,
"epoch": 0.05805212161710658,
"grad_norm": 1.109375,
"learning_rate": 0.000347,
"loss": 6.3223,
"mean_token_accuracy": 0.1250022418797016,
"num_tokens": 1272998.0,
"step": 695
},
{
"entropy": 6.659237289428711,
"epoch": 0.05846976277981958,
"grad_norm": 1.203125,
"learning_rate": 0.0003495,
"loss": 6.2938,
"mean_token_accuracy": 0.12968498468399048,
"num_tokens": 1281955.0,
"step": 700
},
{
"entropy": 6.673580741882324,
"epoch": 0.05888740394253258,
"grad_norm": 1.09375,
"learning_rate": 0.000352,
"loss": 6.3191,
"mean_token_accuracy": 0.12429769113659858,
"num_tokens": 1291219.0,
"step": 705
},
{
"entropy": 6.618105745315551,
"epoch": 0.05930504510524557,
"grad_norm": 1.234375,
"learning_rate": 0.0003545,
"loss": 6.3399,
"mean_token_accuracy": 0.1173406608402729,
"num_tokens": 1300963.0,
"step": 710
},
{
"entropy": 6.732410621643067,
"epoch": 0.05972268626795857,
"grad_norm": 1.2265625,
"learning_rate": 0.000357,
"loss": 6.358,
"mean_token_accuracy": 0.12274901047348977,
"num_tokens": 1310112.0,
"step": 715
},
{
"entropy": 6.636858129501343,
"epoch": 0.06014032743067157,
"grad_norm": 1.1484375,
"learning_rate": 0.0003595,
"loss": 6.2925,
"mean_token_accuracy": 0.13005554676055908,
"num_tokens": 1319309.0,
"step": 720
},
{
"entropy": 6.491259765625,
"epoch": 0.06055796859338457,
"grad_norm": 1.1640625,
"learning_rate": 0.000362,
"loss": 6.2686,
"mean_token_accuracy": 0.12515867426991462,
"num_tokens": 1329049.0,
"step": 725
},
{
"entropy": 6.600369119644165,
"epoch": 0.06097560975609756,
"grad_norm": 1.328125,
"learning_rate": 0.0003645,
"loss": 6.109,
"mean_token_accuracy": 0.129255248606205,
"num_tokens": 1337770.0,
"step": 730
},
{
"entropy": 6.448912858963013,
"epoch": 0.06139325091881056,
"grad_norm": 1.234375,
"learning_rate": 0.000367,
"loss": 6.2189,
"mean_token_accuracy": 0.1278871200978756,
"num_tokens": 1346705.0,
"step": 735
},
{
"entropy": 6.637778997421265,
"epoch": 0.06181089208152356,
"grad_norm": 1.4375,
"learning_rate": 0.0003695,
"loss": 6.2804,
"mean_token_accuracy": 0.12408471331000329,
"num_tokens": 1354860.0,
"step": 740
},
{
"entropy": 6.631476402282715,
"epoch": 0.06222853324423655,
"grad_norm": 1.1015625,
"learning_rate": 0.000372,
"loss": 6.2386,
"mean_token_accuracy": 0.1262032598257065,
"num_tokens": 1364140.0,
"step": 745
},
{
"entropy": 6.6420732021331785,
"epoch": 0.06264617440694954,
"grad_norm": 1.109375,
"learning_rate": 0.0003745,
"loss": 6.383,
"mean_token_accuracy": 0.11741869822144509,
"num_tokens": 1373645.0,
"step": 750
},
{
"entropy": 6.614962768554688,
"epoch": 0.06306381556966255,
"grad_norm": 1.1640625,
"learning_rate": 0.000377,
"loss": 6.2628,
"mean_token_accuracy": 0.12924929931759835,
"num_tokens": 1383291.0,
"step": 755
},
{
"entropy": 6.541449499130249,
"epoch": 0.06348145673237554,
"grad_norm": 1.2578125,
"learning_rate": 0.0003795,
"loss": 6.1824,
"mean_token_accuracy": 0.12891636416316032,
"num_tokens": 1391172.0,
"step": 760
},
{
"entropy": 6.567931509017944,
"epoch": 0.06389909789508853,
"grad_norm": 1.140625,
"learning_rate": 0.000382,
"loss": 6.1962,
"mean_token_accuracy": 0.12836265712976455,
"num_tokens": 1400864.0,
"step": 765
},
{
"entropy": 6.577566814422608,
"epoch": 0.06431673905780154,
"grad_norm": 1.1328125,
"learning_rate": 0.0003845,
"loss": 6.2475,
"mean_token_accuracy": 0.13195167928934098,
"num_tokens": 1410570.0,
"step": 770
},
{
"entropy": 6.4961103916168215,
"epoch": 0.06473438022051453,
"grad_norm": 1.125,
"learning_rate": 0.00038700000000000003,
"loss": 6.2196,
"mean_token_accuracy": 0.12905707359313964,
"num_tokens": 1419536.0,
"step": 775
},
{
"entropy": 6.544592094421387,
"epoch": 0.06515202138322754,
"grad_norm": 1.2421875,
"learning_rate": 0.00038950000000000003,
"loss": 6.1379,
"mean_token_accuracy": 0.1324485160410404,
"num_tokens": 1428000.0,
"step": 780
},
{
"entropy": 6.524274158477783,
"epoch": 0.06556966254594053,
"grad_norm": 1.3125,
"learning_rate": 0.00039200000000000004,
"loss": 6.335,
"mean_token_accuracy": 0.12751191332936287,
"num_tokens": 1437789.0,
"step": 785
},
{
"entropy": 6.527570533752441,
"epoch": 0.06598730370865352,
"grad_norm": 1.2578125,
"learning_rate": 0.00039450000000000005,
"loss": 6.1479,
"mean_token_accuracy": 0.13085014671087264,
"num_tokens": 1446848.0,
"step": 790
},
{
"entropy": 6.503874588012695,
"epoch": 0.06640494487136653,
"grad_norm": 1.203125,
"learning_rate": 0.00039700000000000005,
"loss": 6.2138,
"mean_token_accuracy": 0.1266377955675125,
"num_tokens": 1455749.0,
"step": 795
},
{
"entropy": 6.490093851089478,
"epoch": 0.06682258603407952,
"grad_norm": 1.2890625,
"learning_rate": 0.0003995,
"loss": 6.1232,
"mean_token_accuracy": 0.1335439622402191,
"num_tokens": 1464556.0,
"step": 800
},
{
"entropy": 6.529352855682373,
"epoch": 0.06724022719679251,
"grad_norm": 1.2265625,
"learning_rate": 0.000402,
"loss": 6.2528,
"mean_token_accuracy": 0.12460074424743653,
"num_tokens": 1473617.0,
"step": 805
},
{
"entropy": 6.553039026260376,
"epoch": 0.06765786835950552,
"grad_norm": 1.0859375,
"learning_rate": 0.0004045,
"loss": 6.271,
"mean_token_accuracy": 0.127645106613636,
"num_tokens": 1483006.0,
"step": 810
},
{
"entropy": 6.596258735656738,
"epoch": 0.06807550952221851,
"grad_norm": 1.21875,
"learning_rate": 0.00040699999999999997,
"loss": 6.2902,
"mean_token_accuracy": 0.1250758670270443,
"num_tokens": 1493009.0,
"step": 815
},
{
"entropy": 6.5069859504699705,
"epoch": 0.0684931506849315,
"grad_norm": 1.3515625,
"learning_rate": 0.0004095,
"loss": 6.1761,
"mean_token_accuracy": 0.13094822615385054,
"num_tokens": 1501261.0,
"step": 820
},
{
"entropy": 6.490626192092895,
"epoch": 0.06891079184764451,
"grad_norm": 0.95703125,
"learning_rate": 0.000412,
"loss": 6.2834,
"mean_token_accuracy": 0.1269587032496929,
"num_tokens": 1511623.0,
"step": 825
},
{
"entropy": 6.578334522247315,
"epoch": 0.0693284330103575,
"grad_norm": 1.140625,
"learning_rate": 0.0004145,
"loss": 6.2791,
"mean_token_accuracy": 0.12188976258039474,
"num_tokens": 1521741.0,
"step": 830
},
{
"entropy": 6.502293491363526,
"epoch": 0.0697460741730705,
"grad_norm": 1.0234375,
"learning_rate": 0.000417,
"loss": 6.2152,
"mean_token_accuracy": 0.12901918739080429,
"num_tokens": 1530988.0,
"step": 835
},
{
"entropy": 6.41391224861145,
"epoch": 0.0701637153357835,
"grad_norm": 1.2578125,
"learning_rate": 0.0004195,
"loss": 6.0477,
"mean_token_accuracy": 0.13469421193003656,
"num_tokens": 1539415.0,
"step": 840
},
{
"entropy": 6.599431276321411,
"epoch": 0.07058135649849649,
"grad_norm": 1.2734375,
"learning_rate": 0.000422,
"loss": 6.2591,
"mean_token_accuracy": 0.13088077455759048,
"num_tokens": 1547969.0,
"step": 845
},
{
"entropy": 6.374254846572876,
"epoch": 0.07099899766120948,
"grad_norm": 1.09375,
"learning_rate": 0.0004245,
"loss": 6.1072,
"mean_token_accuracy": 0.13475026711821556,
"num_tokens": 1557526.0,
"step": 850
},
{
"entropy": 6.417814064025879,
"epoch": 0.07141663882392249,
"grad_norm": 1.2265625,
"learning_rate": 0.000427,
"loss": 6.0887,
"mean_token_accuracy": 0.13038780987262727,
"num_tokens": 1565982.0,
"step": 855
},
{
"entropy": 6.40412015914917,
"epoch": 0.07183427998663548,
"grad_norm": 1.1484375,
"learning_rate": 0.0004295,
"loss": 6.1433,
"mean_token_accuracy": 0.13692082837224007,
"num_tokens": 1574492.0,
"step": 860
},
{
"entropy": 6.388799810409546,
"epoch": 0.07225192114934847,
"grad_norm": 1.2421875,
"learning_rate": 0.000432,
"loss": 6.1205,
"mean_token_accuracy": 0.13500951156020163,
"num_tokens": 1583726.0,
"step": 865
},
{
"entropy": 6.44487509727478,
"epoch": 0.07266956231206148,
"grad_norm": 1.296875,
"learning_rate": 0.0004345,
"loss": 6.1361,
"mean_token_accuracy": 0.12648910656571388,
"num_tokens": 1593780.0,
"step": 870
},
{
"entropy": 6.468150472640991,
"epoch": 0.07308720347477447,
"grad_norm": 1.265625,
"learning_rate": 0.000437,
"loss": 6.1348,
"mean_token_accuracy": 0.13127309009432792,
"num_tokens": 1602746.0,
"step": 875
},
{
"entropy": 6.515667915344238,
"epoch": 0.07350484463748747,
"grad_norm": 1.0625,
"learning_rate": 0.0004395,
"loss": 6.1633,
"mean_token_accuracy": 0.13110396489501,
"num_tokens": 1611767.0,
"step": 880
},
{
"entropy": 6.435206174850464,
"epoch": 0.07392248580020047,
"grad_norm": 1.0859375,
"learning_rate": 0.000442,
"loss": 6.2406,
"mean_token_accuracy": 0.13171651512384414,
"num_tokens": 1621568.0,
"step": 885
},
{
"entropy": 6.482450342178344,
"epoch": 0.07434012696291346,
"grad_norm": 1.0703125,
"learning_rate": 0.0004445,
"loss": 6.1917,
"mean_token_accuracy": 0.13484023958444596,
"num_tokens": 1630650.0,
"step": 890
},
{
"entropy": 6.516539001464844,
"epoch": 0.07475776812562646,
"grad_norm": 1.1953125,
"learning_rate": 0.000447,
"loss": 6.1872,
"mean_token_accuracy": 0.12935673892498017,
"num_tokens": 1640482.0,
"step": 895
},
{
"entropy": 6.491699361801148,
"epoch": 0.07517540928833946,
"grad_norm": 1.265625,
"learning_rate": 0.00044950000000000003,
"loss": 6.2285,
"mean_token_accuracy": 0.12839881628751754,
"num_tokens": 1649344.0,
"step": 900
},
{
"entropy": 6.393206262588501,
"epoch": 0.07559305045105245,
"grad_norm": 1.0859375,
"learning_rate": 0.00045200000000000004,
"loss": 6.1696,
"mean_token_accuracy": 0.12845856323838234,
"num_tokens": 1658962.0,
"step": 905
},
{
"entropy": 6.4265542984008786,
"epoch": 0.07601069161376545,
"grad_norm": 1.0546875,
"learning_rate": 0.00045450000000000004,
"loss": 6.1747,
"mean_token_accuracy": 0.13029418736696244,
"num_tokens": 1668615.0,
"step": 910
},
{
"entropy": 6.521175193786621,
"epoch": 0.07642833277647845,
"grad_norm": 1.15625,
"learning_rate": 0.00045700000000000005,
"loss": 6.1143,
"mean_token_accuracy": 0.13495683968067168,
"num_tokens": 1679282.0,
"step": 915
},
{
"entropy": 6.303538370132446,
"epoch": 0.07684597393919144,
"grad_norm": 1.0546875,
"learning_rate": 0.00045950000000000006,
"loss": 6.2102,
"mean_token_accuracy": 0.13202547430992126,
"num_tokens": 1688362.0,
"step": 920
},
{
"entropy": 6.46322808265686,
"epoch": 0.07726361510190444,
"grad_norm": 0.95703125,
"learning_rate": 0.000462,
"loss": 6.1024,
"mean_token_accuracy": 0.12747513502836227,
"num_tokens": 1697593.0,
"step": 925
},
{
"entropy": 6.421608257293701,
"epoch": 0.07768125626461744,
"grad_norm": 1.1953125,
"learning_rate": 0.0004645,
"loss": 6.1735,
"mean_token_accuracy": 0.12738403007388116,
"num_tokens": 1706961.0,
"step": 930
},
{
"entropy": 6.462583541870117,
"epoch": 0.07809889742733044,
"grad_norm": 1.2109375,
"learning_rate": 0.000467,
"loss": 6.2079,
"mean_token_accuracy": 0.13471694365143777,
"num_tokens": 1716222.0,
"step": 935
},
{
"entropy": 6.365508604049682,
"epoch": 0.07851653859004344,
"grad_norm": 1.1875,
"learning_rate": 0.0004695,
"loss": 6.0777,
"mean_token_accuracy": 0.12822124660015105,
"num_tokens": 1726750.0,
"step": 940
},
{
"entropy": 6.432874298095703,
"epoch": 0.07893417975275643,
"grad_norm": 1.0703125,
"learning_rate": 0.000472,
"loss": 6.1788,
"mean_token_accuracy": 0.12462074533104897,
"num_tokens": 1736262.0,
"step": 945
},
{
"entropy": 6.418917083740235,
"epoch": 0.07935182091546943,
"grad_norm": 1.234375,
"learning_rate": 0.0004745,
"loss": 6.208,
"mean_token_accuracy": 0.13261273950338365,
"num_tokens": 1745555.0,
"step": 950
},
{
"entropy": 6.264679765701294,
"epoch": 0.07976946207818243,
"grad_norm": 1.4765625,
"learning_rate": 0.000477,
"loss": 6.0805,
"mean_token_accuracy": 0.12742999866604804,
"num_tokens": 1754107.0,
"step": 955
},
{
"entropy": 6.569329309463501,
"epoch": 0.08018710324089542,
"grad_norm": 1.1171875,
"learning_rate": 0.0004795,
"loss": 6.2585,
"mean_token_accuracy": 0.12915159463882447,
"num_tokens": 1762982.0,
"step": 960
},
{
"entropy": 6.333677053451538,
"epoch": 0.08060474440360842,
"grad_norm": 1.15625,
"learning_rate": 0.000482,
"loss": 6.1485,
"mean_token_accuracy": 0.1329043798148632,
"num_tokens": 1772545.0,
"step": 965
},
{
"entropy": 6.501676940917969,
"epoch": 0.08102238556632142,
"grad_norm": 1.171875,
"learning_rate": 0.0004845,
"loss": 6.2685,
"mean_token_accuracy": 0.12669501081109047,
"num_tokens": 1782052.0,
"step": 970
},
{
"entropy": 6.379133939743042,
"epoch": 0.08144002672903441,
"grad_norm": 1.1328125,
"learning_rate": 0.000487,
"loss": 6.078,
"mean_token_accuracy": 0.13307300806045533,
"num_tokens": 1791682.0,
"step": 975
},
{
"entropy": 6.325070905685425,
"epoch": 0.08185766789174741,
"grad_norm": 1.0234375,
"learning_rate": 0.0004895,
"loss": 6.0852,
"mean_token_accuracy": 0.136198490858078,
"num_tokens": 1800526.0,
"step": 980
},
{
"entropy": 6.438921642303467,
"epoch": 0.08227530905446041,
"grad_norm": 1.078125,
"learning_rate": 0.000492,
"loss": 6.2128,
"mean_token_accuracy": 0.1367432154715061,
"num_tokens": 1810062.0,
"step": 985
},
{
"entropy": 6.437668371200561,
"epoch": 0.0826929502171734,
"grad_norm": 1.140625,
"learning_rate": 0.0004945,
"loss": 6.193,
"mean_token_accuracy": 0.13399267047643662,
"num_tokens": 1818909.0,
"step": 990
},
{
"entropy": 6.417872190475464,
"epoch": 0.0831105913798864,
"grad_norm": 1.2578125,
"learning_rate": 0.000497,
"loss": 6.1495,
"mean_token_accuracy": 0.13555187806487085,
"num_tokens": 1827978.0,
"step": 995
},
{
"entropy": 6.295065593719483,
"epoch": 0.0835282325425994,
"grad_norm": 1.09375,
"learning_rate": 0.0004995,
"loss": 6.115,
"mean_token_accuracy": 0.13612975925207138,
"num_tokens": 1837955.0,
"step": 1000
},
{
"entropy": 6.429361057281494,
"epoch": 0.0839458737053124,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999999987395534,
"loss": 6.2009,
"mean_token_accuracy": 0.13162293881177903,
"num_tokens": 1847699.0,
"step": 1005
},
{
"entropy": 6.420073318481445,
"epoch": 0.08436351486802539,
"grad_norm": 1.078125,
"learning_rate": 0.0004999999936189888,
"loss": 6.1517,
"mean_token_accuracy": 0.13114715069532396,
"num_tokens": 1856490.0,
"step": 1010
},
{
"entropy": 6.38634729385376,
"epoch": 0.0847811560307384,
"grad_norm": 1.140625,
"learning_rate": 0.0004999999845595285,
"loss": 6.1503,
"mean_token_accuracy": 0.13426092267036438,
"num_tokens": 1865644.0,
"step": 1015
},
{
"entropy": 6.398542594909668,
"epoch": 0.08519879719345139,
"grad_norm": 1.2734375,
"learning_rate": 0.0004999999715611727,
"loss": 6.0839,
"mean_token_accuracy": 0.1395128108561039,
"num_tokens": 1874450.0,
"step": 1020
},
{
"entropy": 6.275608062744141,
"epoch": 0.08561643835616438,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999999546239215,
"loss": 6.104,
"mean_token_accuracy": 0.13559797704219817,
"num_tokens": 1883259.0,
"step": 1025
},
{
"entropy": 6.392034816741943,
"epoch": 0.08603407951887738,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999999337477753,
"loss": 6.1933,
"mean_token_accuracy": 0.12675563469529152,
"num_tokens": 1891897.0,
"step": 1030
},
{
"entropy": 6.44005560874939,
"epoch": 0.08645172068159038,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999999089327344,
"loss": 6.1532,
"mean_token_accuracy": 0.13319713696837426,
"num_tokens": 1901011.0,
"step": 1035
},
{
"entropy": 6.2367016792297365,
"epoch": 0.08686936184430337,
"grad_norm": 1.2578125,
"learning_rate": 0.0004999998801787993,
"loss": 6.0656,
"mean_token_accuracy": 0.13727857545018196,
"num_tokens": 1910132.0,
"step": 1040
},
{
"entropy": 6.4353138446807865,
"epoch": 0.08728700300701638,
"grad_norm": 1.15625,
"learning_rate": 0.0004999998474859704,
"loss": 6.1844,
"mean_token_accuracy": 0.13210511356592178,
"num_tokens": 1919938.0,
"step": 1045
},
{
"entropy": 6.260934543609619,
"epoch": 0.08770464416972937,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999998108542483,
"loss": 6.0466,
"mean_token_accuracy": 0.13039984107017516,
"num_tokens": 1928199.0,
"step": 1050
},
{
"entropy": 6.3116625308990475,
"epoch": 0.08812228533244236,
"grad_norm": 1.3046875,
"learning_rate": 0.0004999997702836339,
"loss": 6.0458,
"mean_token_accuracy": 0.13747427314519883,
"num_tokens": 1937133.0,
"step": 1055
},
{
"entropy": 6.441593408584595,
"epoch": 0.08853992649515537,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999997257741274,
"loss": 6.2143,
"mean_token_accuracy": 0.1290765218436718,
"num_tokens": 1946580.0,
"step": 1060
},
{
"entropy": 6.280451679229737,
"epoch": 0.08895756765786836,
"grad_norm": 1.1640625,
"learning_rate": 0.00049999967732573,
"loss": 6.1238,
"mean_token_accuracy": 0.13576303273439408,
"num_tokens": 1955413.0,
"step": 1065
},
{
"entropy": 6.547540473937988,
"epoch": 0.08937520882058135,
"grad_norm": 1.171875,
"learning_rate": 0.0004999996249384425,
"loss": 6.2026,
"mean_token_accuracy": 0.12969096824526788,
"num_tokens": 1964716.0,
"step": 1070
},
{
"entropy": 6.2454064846038815,
"epoch": 0.08979284998329436,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999995686122657,
"loss": 6.0586,
"mean_token_accuracy": 0.13843119516968727,
"num_tokens": 1974081.0,
"step": 1075
},
{
"entropy": 6.207799673080444,
"epoch": 0.09021049114600735,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999995083472006,
"loss": 6.0314,
"mean_token_accuracy": 0.13496628925204276,
"num_tokens": 1983035.0,
"step": 1080
},
{
"entropy": 6.349649572372437,
"epoch": 0.09062813230872034,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999994441432481,
"loss": 6.0406,
"mean_token_accuracy": 0.1435403674840927,
"num_tokens": 1992475.0,
"step": 1085
},
{
"entropy": 6.300027513504029,
"epoch": 0.09104577347143335,
"grad_norm": 1.0625,
"learning_rate": 0.0004999993760004097,
"loss": 6.1209,
"mean_token_accuracy": 0.13500647395849227,
"num_tokens": 2002729.0,
"step": 1090
},
{
"entropy": 6.230009746551514,
"epoch": 0.09146341463414634,
"grad_norm": 1.0625,
"learning_rate": 0.0004999993039186864,
"loss": 5.9614,
"mean_token_accuracy": 0.13840871751308442,
"num_tokens": 2011319.0,
"step": 1095
},
{
"entropy": 6.26380090713501,
"epoch": 0.09188105579685933,
"grad_norm": 1.109375,
"learning_rate": 0.0004999992278980794,
"loss": 6.0199,
"mean_token_accuracy": 0.13688360154628754,
"num_tokens": 2020456.0,
"step": 1100
},
{
"entropy": 6.208072185516357,
"epoch": 0.09229869695957234,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999991479385901,
"loss": 6.0945,
"mean_token_accuracy": 0.13740770444273948,
"num_tokens": 2029417.0,
"step": 1105
},
{
"entropy": 6.422892808914185,
"epoch": 0.09271633812228533,
"grad_norm": 1.140625,
"learning_rate": 0.0004999990640402198,
"loss": 6.1701,
"mean_token_accuracy": 0.1360443763434887,
"num_tokens": 2039290.0,
"step": 1110
},
{
"entropy": 6.3189490795135494,
"epoch": 0.09313397928499834,
"grad_norm": 1.265625,
"learning_rate": 0.0004999989762029701,
"loss": 5.9962,
"mean_token_accuracy": 0.13912804424762726,
"num_tokens": 2048485.0,
"step": 1115
},
{
"entropy": 6.146860980987549,
"epoch": 0.09355162044771133,
"grad_norm": 1.109375,
"learning_rate": 0.0004999988844268425,
"loss": 5.992,
"mean_token_accuracy": 0.14194743409752847,
"num_tokens": 2057131.0,
"step": 1120
},
{
"entropy": 6.23108491897583,
"epoch": 0.09396926161042432,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999987887118387,
"loss": 5.9713,
"mean_token_accuracy": 0.1364756427705288,
"num_tokens": 2066295.0,
"step": 1125
},
{
"entropy": 6.220802450180054,
"epoch": 0.09438690277313733,
"grad_norm": 1.203125,
"learning_rate": 0.0004999986890579602,
"loss": 5.9838,
"mean_token_accuracy": 0.14211056828498841,
"num_tokens": 2075656.0,
"step": 1130
},
{
"entropy": 6.2367716312408445,
"epoch": 0.09480454393585032,
"grad_norm": 0.96875,
"learning_rate": 0.0004999985854652087,
"loss": 6.1204,
"mean_token_accuracy": 0.1285279080271721,
"num_tokens": 2086046.0,
"step": 1135
},
{
"entropy": 6.345442581176758,
"epoch": 0.09522218509856331,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999984779335862,
"loss": 6.1342,
"mean_token_accuracy": 0.1319953002035618,
"num_tokens": 2094808.0,
"step": 1140
},
{
"entropy": 6.1862023830413815,
"epoch": 0.09563982626127632,
"grad_norm": 1.046875,
"learning_rate": 0.0004999983664630945,
"loss": 6.0694,
"mean_token_accuracy": 0.13912759348750114,
"num_tokens": 2104155.0,
"step": 1145
},
{
"entropy": 6.319784164428711,
"epoch": 0.09605746742398931,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999982510537357,
"loss": 5.9529,
"mean_token_accuracy": 0.13932174518704415,
"num_tokens": 2112517.0,
"step": 1150
},
{
"entropy": 6.080702924728394,
"epoch": 0.0964751085867023,
"grad_norm": 1.234375,
"learning_rate": 0.0004999981317055116,
"loss": 5.9205,
"mean_token_accuracy": 0.13805301561951638,
"num_tokens": 2121355.0,
"step": 1155
},
{
"entropy": 6.28314437866211,
"epoch": 0.09689274974941531,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999980084184244,
"loss": 6.04,
"mean_token_accuracy": 0.14036146476864814,
"num_tokens": 2129278.0,
"step": 1160
},
{
"entropy": 6.273211431503296,
"epoch": 0.0973103909121283,
"grad_norm": 1.078125,
"learning_rate": 0.0004999978811924762,
"loss": 6.1979,
"mean_token_accuracy": 0.13250343650579452,
"num_tokens": 2139548.0,
"step": 1165
},
{
"entropy": 6.278427934646606,
"epoch": 0.09772803207484129,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999977500276693,
"loss": 6.0961,
"mean_token_accuracy": 0.13529025316238402,
"num_tokens": 2148765.0,
"step": 1170
},
{
"entropy": 6.313056421279907,
"epoch": 0.0981456732375543,
"grad_norm": 1.21875,
"learning_rate": 0.0004999976149240058,
"loss": 6.0145,
"mean_token_accuracy": 0.14838937819004058,
"num_tokens": 2157482.0,
"step": 1175
},
{
"entropy": 6.236321830749512,
"epoch": 0.09856331440026729,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999974758814884,
"loss": 6.1097,
"mean_token_accuracy": 0.13229444101452828,
"num_tokens": 2167320.0,
"step": 1180
},
{
"entropy": 6.276017045974731,
"epoch": 0.09898095556298028,
"grad_norm": 1.171875,
"learning_rate": 0.0004999973329001193,
"loss": 6.0621,
"mean_token_accuracy": 0.13247895389795303,
"num_tokens": 2175454.0,
"step": 1185
},
{
"entropy": 6.221844720840454,
"epoch": 0.09939859672569329,
"grad_norm": 1.15625,
"learning_rate": 0.0004999971859799009,
"loss": 5.9926,
"mean_token_accuracy": 0.1372641235589981,
"num_tokens": 2184391.0,
"step": 1190
},
{
"entropy": 6.083957529067993,
"epoch": 0.09981623788840628,
"grad_norm": 1.15625,
"learning_rate": 0.0004999970351208361,
"loss": 5.8895,
"mean_token_accuracy": 0.1443878285586834,
"num_tokens": 2193309.0,
"step": 1195
},
{
"entropy": 6.318909502029419,
"epoch": 0.10023387905111927,
"grad_norm": 1.125,
"learning_rate": 0.0004999968803229275,
"loss": 6.0251,
"mean_token_accuracy": 0.13645748943090438,
"num_tokens": 2202057.0,
"step": 1200
},
{
"entropy": 6.210393238067627,
"epoch": 0.10065152021383228,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999967215861775,
"loss": 6.1176,
"mean_token_accuracy": 0.1318912997841835,
"num_tokens": 2212384.0,
"step": 1205
},
{
"entropy": 6.331364917755127,
"epoch": 0.10106916137654527,
"grad_norm": 1.09375,
"learning_rate": 0.000499996558910589,
"loss": 6.0333,
"mean_token_accuracy": 0.13522329032421113,
"num_tokens": 2221451.0,
"step": 1210
},
{
"entropy": 6.12385663986206,
"epoch": 0.10148680253925826,
"grad_norm": 1.21875,
"learning_rate": 0.000499996392296165,
"loss": 5.9336,
"mean_token_accuracy": 0.13527244850993156,
"num_tokens": 2230440.0,
"step": 1215
},
{
"entropy": 6.182936525344848,
"epoch": 0.10190444370197127,
"grad_norm": 1.078125,
"learning_rate": 0.0004999962217429083,
"loss": 6.1241,
"mean_token_accuracy": 0.1339232660830021,
"num_tokens": 2239985.0,
"step": 1220
},
{
"entropy": 6.22488694190979,
"epoch": 0.10232208486468426,
"grad_norm": 1.078125,
"learning_rate": 0.0004999960472508219,
"loss": 5.9821,
"mean_token_accuracy": 0.14048198014497756,
"num_tokens": 2250391.0,
"step": 1225
},
{
"entropy": 6.340797090530396,
"epoch": 0.10273972602739725,
"grad_norm": 1.15625,
"learning_rate": 0.000499995868819909,
"loss": 6.0896,
"mean_token_accuracy": 0.13700031563639642,
"num_tokens": 2260620.0,
"step": 1230
},
{
"entropy": 6.190806722640991,
"epoch": 0.10315736719011026,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999956864501725,
"loss": 6.0585,
"mean_token_accuracy": 0.13748134523630143,
"num_tokens": 2271176.0,
"step": 1235
},
{
"entropy": 6.3144207954406735,
"epoch": 0.10357500835282325,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999955001416156,
"loss": 5.967,
"mean_token_accuracy": 0.14711003750562668,
"num_tokens": 2280371.0,
"step": 1240
},
{
"entropy": 6.0102637767791744,
"epoch": 0.10399264951553625,
"grad_norm": 1.046875,
"learning_rate": 0.0004999953098942417,
"loss": 5.9442,
"mean_token_accuracy": 0.13787835761904715,
"num_tokens": 2289015.0,
"step": 1245
},
{
"entropy": 6.191421127319336,
"epoch": 0.10441029067824925,
"grad_norm": 1.2578125,
"learning_rate": 0.0004999951157080541,
"loss": 6.0136,
"mean_token_accuracy": 0.14192727878689765,
"num_tokens": 2297409.0,
"step": 1250
},
{
"entropy": 6.158661842346191,
"epoch": 0.10482793184096224,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999949175830561,
"loss": 6.0353,
"mean_token_accuracy": 0.13258421197533607,
"num_tokens": 2307017.0,
"step": 1255
},
{
"entropy": 6.216726875305175,
"epoch": 0.10524557300367524,
"grad_norm": 1.15625,
"learning_rate": 0.0004999947155192514,
"loss": 5.8686,
"mean_token_accuracy": 0.14748067185282707,
"num_tokens": 2316014.0,
"step": 1260
},
{
"entropy": 6.156877565383911,
"epoch": 0.10566321416638824,
"grad_norm": 1.21875,
"learning_rate": 0.0004999945095166433,
"loss": 5.9879,
"mean_token_accuracy": 0.1419251538813114,
"num_tokens": 2326326.0,
"step": 1265
},
{
"entropy": 6.325374746322632,
"epoch": 0.10608085532910123,
"grad_norm": 1.2734375,
"learning_rate": 0.0004999942995752354,
"loss": 6.0821,
"mean_token_accuracy": 0.13753873556852342,
"num_tokens": 2335108.0,
"step": 1270
},
{
"entropy": 6.153518962860107,
"epoch": 0.10649849649181423,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999940856950315,
"loss": 5.9915,
"mean_token_accuracy": 0.15058054327964782,
"num_tokens": 2343971.0,
"step": 1275
},
{
"entropy": 6.263919925689697,
"epoch": 0.10691613765452723,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999938678760354,
"loss": 6.0506,
"mean_token_accuracy": 0.13512684255838395,
"num_tokens": 2353742.0,
"step": 1280
},
{
"entropy": 6.151162433624267,
"epoch": 0.10733377881724022,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999936461182507,
"loss": 5.9985,
"mean_token_accuracy": 0.14433275312185287,
"num_tokens": 2363629.0,
"step": 1285
},
{
"entropy": 6.037757158279419,
"epoch": 0.10775141997995323,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999934204216814,
"loss": 5.8621,
"mean_token_accuracy": 0.14499263167381288,
"num_tokens": 2372705.0,
"step": 1290
},
{
"entropy": 6.187420225143432,
"epoch": 0.10816906114266622,
"grad_norm": 1.15625,
"learning_rate": 0.0004999931907863315,
"loss": 5.9654,
"mean_token_accuracy": 0.1408788852393627,
"num_tokens": 2382136.0,
"step": 1295
},
{
"entropy": 6.083423089981079,
"epoch": 0.10858670230537922,
"grad_norm": 1.15625,
"learning_rate": 0.000499992957212205,
"loss": 5.9401,
"mean_token_accuracy": 0.1388118125498295,
"num_tokens": 2391060.0,
"step": 1300
},
{
"entropy": 6.293563318252564,
"epoch": 0.10900434346809222,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999927196993059,
"loss": 6.0751,
"mean_token_accuracy": 0.13740024641156195,
"num_tokens": 2399885.0,
"step": 1305
},
{
"entropy": 6.209824800491333,
"epoch": 0.10942198463080521,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999924782476384,
"loss": 5.9442,
"mean_token_accuracy": 0.14959385469555855,
"num_tokens": 2409654.0,
"step": 1310
},
{
"entropy": 6.124826669692993,
"epoch": 0.1098396257935182,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999922328572068,
"loss": 6.0068,
"mean_token_accuracy": 0.14170742481946946,
"num_tokens": 2419342.0,
"step": 1315
},
{
"entropy": 6.088650369644165,
"epoch": 0.11025726695623121,
"grad_norm": 1.0625,
"learning_rate": 0.0004999919835280154,
"loss": 5.8928,
"mean_token_accuracy": 0.1480419561266899,
"num_tokens": 2428845.0,
"step": 1320
},
{
"entropy": 6.196817445755005,
"epoch": 0.1106749081189442,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999917302600684,
"loss": 5.8964,
"mean_token_accuracy": 0.14959906339645385,
"num_tokens": 2437134.0,
"step": 1325
},
{
"entropy": 5.955138206481934,
"epoch": 0.1110925492816572,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999914730533704,
"loss": 5.7375,
"mean_token_accuracy": 0.15773703902959824,
"num_tokens": 2445438.0,
"step": 1330
},
{
"entropy": 6.206940174102783,
"epoch": 0.1115101904443702,
"grad_norm": 1.015625,
"learning_rate": 0.0004999912119079258,
"loss": 6.0488,
"mean_token_accuracy": 0.1382726550102234,
"num_tokens": 2455039.0,
"step": 1335
},
{
"entropy": 6.197380590438843,
"epoch": 0.1119278316070832,
"grad_norm": 1.015625,
"learning_rate": 0.0004999909468237393,
"loss": 6.0001,
"mean_token_accuracy": 0.14009671807289123,
"num_tokens": 2465170.0,
"step": 1340
},
{
"entropy": 6.0352026462554935,
"epoch": 0.11234547276979619,
"grad_norm": 1.03125,
"learning_rate": 0.0004999906778008153,
"loss": 5.7484,
"mean_token_accuracy": 0.15088334530591965,
"num_tokens": 2473688.0,
"step": 1345
},
{
"entropy": 6.086208772659302,
"epoch": 0.11276311393250919,
"grad_norm": 1.09375,
"learning_rate": 0.0004999904048391588,
"loss": 5.9998,
"mean_token_accuracy": 0.13953111916780472,
"num_tokens": 2482335.0,
"step": 1350
},
{
"entropy": 6.136913299560547,
"epoch": 0.11318075509522219,
"grad_norm": 1.140625,
"learning_rate": 0.0004999901279387743,
"loss": 5.9396,
"mean_token_accuracy": 0.14635005444288254,
"num_tokens": 2491808.0,
"step": 1355
},
{
"entropy": 6.263986206054687,
"epoch": 0.11359839625793518,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999898470996669,
"loss": 6.081,
"mean_token_accuracy": 0.1350573979318142,
"num_tokens": 2501422.0,
"step": 1360
},
{
"entropy": 6.080953550338745,
"epoch": 0.11401603742064818,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999895623218415,
"loss": 5.8717,
"mean_token_accuracy": 0.149327090382576,
"num_tokens": 2511201.0,
"step": 1365
},
{
"entropy": 6.1295037269592285,
"epoch": 0.11443367858336118,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999892736053027,
"loss": 5.9104,
"mean_token_accuracy": 0.14041806608438492,
"num_tokens": 2519798.0,
"step": 1370
},
{
"entropy": 6.107069873809815,
"epoch": 0.11485131974607417,
"grad_norm": 1.0625,
"learning_rate": 0.0004999889809500561,
"loss": 5.9016,
"mean_token_accuracy": 0.14723242446780205,
"num_tokens": 2529177.0,
"step": 1375
},
{
"entropy": 6.182288074493409,
"epoch": 0.11526896090878717,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999886843561065,
"loss": 5.872,
"mean_token_accuracy": 0.1503610208630562,
"num_tokens": 2537571.0,
"step": 1380
},
{
"entropy": 6.0060066223144535,
"epoch": 0.11568660207150017,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999883838234592,
"loss": 5.8006,
"mean_token_accuracy": 0.15079671740531922,
"num_tokens": 2546258.0,
"step": 1385
},
{
"entropy": 6.066942644119263,
"epoch": 0.11610424323421316,
"grad_norm": 1.09375,
"learning_rate": 0.0004999880793521194,
"loss": 5.8136,
"mean_token_accuracy": 0.14280073940753937,
"num_tokens": 2555862.0,
"step": 1390
},
{
"entropy": 5.880656099319458,
"epoch": 0.11652188439692616,
"grad_norm": 1.109375,
"learning_rate": 0.0004999877709420924,
"loss": 5.8325,
"mean_token_accuracy": 0.14871919453144072,
"num_tokens": 2564583.0,
"step": 1395
},
{
"entropy": 6.192148923873901,
"epoch": 0.11693952555963916,
"grad_norm": 1.140625,
"learning_rate": 0.0004999874585933837,
"loss": 5.9361,
"mean_token_accuracy": 0.14413623362779618,
"num_tokens": 2574217.0,
"step": 1400
},
{
"entropy": 6.042350625991821,
"epoch": 0.11735716672235215,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999871423059987,
"loss": 5.8261,
"mean_token_accuracy": 0.15127213895320893,
"num_tokens": 2582821.0,
"step": 1405
},
{
"entropy": 6.120534801483155,
"epoch": 0.11777480788506516,
"grad_norm": 1.0234375,
"learning_rate": 0.000499986822079943,
"loss": 5.9869,
"mean_token_accuracy": 0.13811271116137505,
"num_tokens": 2592748.0,
"step": 1410
},
{
"entropy": 6.115459203720093,
"epoch": 0.11819244904777815,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999864979152221,
"loss": 5.8812,
"mean_token_accuracy": 0.1500445157289505,
"num_tokens": 2602053.0,
"step": 1415
},
{
"entropy": 6.0357581615448,
"epoch": 0.11861009021049114,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999861698118417,
"loss": 5.9734,
"mean_token_accuracy": 0.1448266699910164,
"num_tokens": 2610557.0,
"step": 1420
},
{
"entropy": 6.063483715057373,
"epoch": 0.11902773137320415,
"grad_norm": 1.046875,
"learning_rate": 0.0004999858377698076,
"loss": 5.8583,
"mean_token_accuracy": 0.1476134791970253,
"num_tokens": 2619628.0,
"step": 1425
},
{
"entropy": 6.24661111831665,
"epoch": 0.11944537253591714,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999855017891256,
"loss": 6.0248,
"mean_token_accuracy": 0.14348386973142624,
"num_tokens": 2629284.0,
"step": 1430
},
{
"entropy": 6.072677373886108,
"epoch": 0.11986301369863013,
"grad_norm": 1.140625,
"learning_rate": 0.0004999851618698017,
"loss": 5.9275,
"mean_token_accuracy": 0.1488335132598877,
"num_tokens": 2638001.0,
"step": 1435
},
{
"entropy": 6.050741863250733,
"epoch": 0.12028065486134314,
"grad_norm": 1.109375,
"learning_rate": 0.0004999848180118416,
"loss": 5.9276,
"mean_token_accuracy": 0.15267922058701516,
"num_tokens": 2647071.0,
"step": 1440
},
{
"entropy": 6.169870662689209,
"epoch": 0.12069829602405613,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999844702152516,
"loss": 5.9002,
"mean_token_accuracy": 0.15194404125213623,
"num_tokens": 2655826.0,
"step": 1445
},
{
"entropy": 6.010311937332153,
"epoch": 0.12111593718676913,
"grad_norm": 1.0625,
"learning_rate": 0.0004999841184800374,
"loss": 5.7654,
"mean_token_accuracy": 0.15490481853485108,
"num_tokens": 2664431.0,
"step": 1450
},
{
"entropy": 5.939828205108642,
"epoch": 0.12153357834948213,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999837628062055,
"loss": 5.7018,
"mean_token_accuracy": 0.15625880509614945,
"num_tokens": 2673631.0,
"step": 1455
},
{
"entropy": 6.022509479522705,
"epoch": 0.12195121951219512,
"grad_norm": 1.015625,
"learning_rate": 0.0004999834031937621,
"loss": 5.9699,
"mean_token_accuracy": 0.14635280668735504,
"num_tokens": 2683363.0,
"step": 1460
},
{
"entropy": 6.089596748352051,
"epoch": 0.12236886067490813,
"grad_norm": 1.03125,
"learning_rate": 0.0004999830396427133,
"loss": 5.9188,
"mean_token_accuracy": 0.14480822607874871,
"num_tokens": 2692533.0,
"step": 1465
},
{
"entropy": 6.08122296333313,
"epoch": 0.12278650183762112,
"grad_norm": 1.21875,
"learning_rate": 0.0004999826721530657,
"loss": 5.9124,
"mean_token_accuracy": 0.15013255774974824,
"num_tokens": 2701211.0,
"step": 1470
},
{
"entropy": 6.1377417087554935,
"epoch": 0.12320414300033411,
"grad_norm": 1.125,
"learning_rate": 0.0004999823007248255,
"loss": 5.9164,
"mean_token_accuracy": 0.1476438969373703,
"num_tokens": 2709543.0,
"step": 1475
},
{
"entropy": 6.091922330856323,
"epoch": 0.12362178416304712,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999819253579992,
"loss": 5.9091,
"mean_token_accuracy": 0.1487370640039444,
"num_tokens": 2718336.0,
"step": 1480
},
{
"entropy": 6.109616804122925,
"epoch": 0.12403942532576011,
"grad_norm": 1.109375,
"learning_rate": 0.0004999815460525938,
"loss": 5.8609,
"mean_token_accuracy": 0.15401075929403304,
"num_tokens": 2726504.0,
"step": 1485
},
{
"entropy": 6.007654333114624,
"epoch": 0.1244570664884731,
"grad_norm": 1.171875,
"learning_rate": 0.0004999811628086155,
"loss": 5.8721,
"mean_token_accuracy": 0.15031274408102036,
"num_tokens": 2736076.0,
"step": 1490
},
{
"entropy": 5.982239532470703,
"epoch": 0.1248747076511861,
"grad_norm": 1.0625,
"learning_rate": 0.000499980775626071,
"loss": 5.8002,
"mean_token_accuracy": 0.15212904959917067,
"num_tokens": 2745497.0,
"step": 1495
},
{
"entropy": 6.028728914260864,
"epoch": 0.12529234881389908,
"grad_norm": 1.265625,
"learning_rate": 0.0004999803845049674,
"loss": 5.9553,
"mean_token_accuracy": 0.14615222066640854,
"num_tokens": 2754455.0,
"step": 1500
},
{
"entropy": 6.188329696655273,
"epoch": 0.1257099899766121,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999799894453112,
"loss": 5.9689,
"mean_token_accuracy": 0.14670175090432166,
"num_tokens": 2763603.0,
"step": 1505
},
{
"entropy": 6.046121978759766,
"epoch": 0.1261276311393251,
"grad_norm": 1.21875,
"learning_rate": 0.0004999795904471095,
"loss": 5.823,
"mean_token_accuracy": 0.14852236732840537,
"num_tokens": 2772152.0,
"step": 1510
},
{
"entropy": 6.0766355991363525,
"epoch": 0.12654527230203808,
"grad_norm": 1.046875,
"learning_rate": 0.0004999791875103694,
"loss": 5.9296,
"mean_token_accuracy": 0.14995151311159133,
"num_tokens": 2781459.0,
"step": 1515
},
{
"entropy": 6.126511430740356,
"epoch": 0.12696291346475108,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999787806350977,
"loss": 5.8707,
"mean_token_accuracy": 0.14601188898086548,
"num_tokens": 2791177.0,
"step": 1520
},
{
"entropy": 5.947288370132446,
"epoch": 0.1273805546274641,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999783698213016,
"loss": 5.873,
"mean_token_accuracy": 0.15467000156641006,
"num_tokens": 2800543.0,
"step": 1525
},
{
"entropy": 5.972626209259033,
"epoch": 0.12779819579017707,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999779550689885,
"loss": 5.7196,
"mean_token_accuracy": 0.15765649527311326,
"num_tokens": 2809301.0,
"step": 1530
},
{
"entropy": 6.0915940284729,
"epoch": 0.12821583695289007,
"grad_norm": 1.109375,
"learning_rate": 0.0004999775363781654,
"loss": 5.9221,
"mean_token_accuracy": 0.14328951239585877,
"num_tokens": 2818269.0,
"step": 1535
},
{
"entropy": 6.007693910598755,
"epoch": 0.12863347811560308,
"grad_norm": 1.125,
"learning_rate": 0.0004999771137488395,
"loss": 5.776,
"mean_token_accuracy": 0.15171888172626496,
"num_tokens": 2827170.0,
"step": 1540
},
{
"entropy": 5.956274175643921,
"epoch": 0.12905111927831608,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999766871810188,
"loss": 5.7801,
"mean_token_accuracy": 0.15684526711702346,
"num_tokens": 2835320.0,
"step": 1545
},
{
"entropy": 5.969413709640503,
"epoch": 0.12946876044102906,
"grad_norm": 1.140625,
"learning_rate": 0.0004999762566747101,
"loss": 5.857,
"mean_token_accuracy": 0.15092990100383757,
"num_tokens": 2843755.0,
"step": 1550
},
{
"entropy": 6.063136291503906,
"epoch": 0.12988640160374207,
"grad_norm": 1.09375,
"learning_rate": 0.0004999758222299214,
"loss": 5.8867,
"mean_token_accuracy": 0.14139319956302643,
"num_tokens": 2853462.0,
"step": 1555
},
{
"entropy": 6.024035835266114,
"epoch": 0.13030404276645507,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999753838466601,
"loss": 5.7984,
"mean_token_accuracy": 0.1518419101834297,
"num_tokens": 2863041.0,
"step": 1560
},
{
"entropy": 6.192575836181641,
"epoch": 0.13072168392916805,
"grad_norm": 1.0625,
"learning_rate": 0.0004999749415249338,
"loss": 6.0118,
"mean_token_accuracy": 0.14672885984182357,
"num_tokens": 2873019.0,
"step": 1565
},
{
"entropy": 5.968512344360351,
"epoch": 0.13113932509188106,
"grad_norm": 1.109375,
"learning_rate": 0.0004999744952647505,
"loss": 5.7642,
"mean_token_accuracy": 0.14861792474985122,
"num_tokens": 2881467.0,
"step": 1570
},
{
"entropy": 5.945395612716675,
"epoch": 0.13155696625459407,
"grad_norm": 1.078125,
"learning_rate": 0.0004999740450661176,
"loss": 5.8507,
"mean_token_accuracy": 0.14255610182881356,
"num_tokens": 2890914.0,
"step": 1575
},
{
"entropy": 5.9906907081604,
"epoch": 0.13197460741730704,
"grad_norm": 1.03125,
"learning_rate": 0.0004999735909290436,
"loss": 5.7662,
"mean_token_accuracy": 0.15616359561681747,
"num_tokens": 2901164.0,
"step": 1580
},
{
"entropy": 6.008242225646972,
"epoch": 0.13239224858002005,
"grad_norm": 1.09375,
"learning_rate": 0.0004999731328535358,
"loss": 5.9214,
"mean_token_accuracy": 0.14676916003227233,
"num_tokens": 2910560.0,
"step": 1585
},
{
"entropy": 5.969047927856446,
"epoch": 0.13280988974273306,
"grad_norm": 1.203125,
"learning_rate": 0.0004999726708396026,
"loss": 5.7288,
"mean_token_accuracy": 0.1559065029025078,
"num_tokens": 2918980.0,
"step": 1590
},
{
"entropy": 5.996972751617432,
"epoch": 0.13322753090544603,
"grad_norm": 0.96484375,
"learning_rate": 0.000499972204887252,
"loss": 5.9386,
"mean_token_accuracy": 0.14731249064207078,
"num_tokens": 2929516.0,
"step": 1595
},
{
"entropy": 6.111129522323608,
"epoch": 0.13364517206815904,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999717349964922,
"loss": 6.001,
"mean_token_accuracy": 0.140457571297884,
"num_tokens": 2940603.0,
"step": 1600
},
{
"entropy": 6.054074048995972,
"epoch": 0.13406281323087205,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999712611673313,
"loss": 5.851,
"mean_token_accuracy": 0.14854641109704972,
"num_tokens": 2950082.0,
"step": 1605
},
{
"entropy": 5.9107592582702635,
"epoch": 0.13448045439358502,
"grad_norm": 1.1875,
"learning_rate": 0.0004999707833997777,
"loss": 5.7105,
"mean_token_accuracy": 0.15870693773031236,
"num_tokens": 2959098.0,
"step": 1610
},
{
"entropy": 6.108852100372315,
"epoch": 0.13489809555629803,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999703016938398,
"loss": 5.8475,
"mean_token_accuracy": 0.15099167972803115,
"num_tokens": 2968585.0,
"step": 1615
},
{
"entropy": 6.004882907867431,
"epoch": 0.13531573671901104,
"grad_norm": 1.0078125,
"learning_rate": 0.000499969816049526,
"loss": 5.8873,
"mean_token_accuracy": 0.1482114464044571,
"num_tokens": 2978430.0,
"step": 1620
},
{
"entropy": 6.122372436523437,
"epoch": 0.13573337788172402,
"grad_norm": 0.96875,
"learning_rate": 0.0004999693264668446,
"loss": 5.9446,
"mean_token_accuracy": 0.14382612630724906,
"num_tokens": 2988398.0,
"step": 1625
},
{
"entropy": 6.039432668685913,
"epoch": 0.13615101904443702,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999688329458045,
"loss": 5.9617,
"mean_token_accuracy": 0.14274221137166024,
"num_tokens": 2999255.0,
"step": 1630
},
{
"entropy": 6.129848527908325,
"epoch": 0.13656866020715003,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999683354864141,
"loss": 5.8284,
"mean_token_accuracy": 0.15093710422515869,
"num_tokens": 3008638.0,
"step": 1635
},
{
"entropy": 5.9884625434875485,
"epoch": 0.136986301369863,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999678340886823,
"loss": 5.8524,
"mean_token_accuracy": 0.14955973774194717,
"num_tokens": 3018070.0,
"step": 1640
},
{
"entropy": 5.922165441513061,
"epoch": 0.137403942532576,
"grad_norm": 1.015625,
"learning_rate": 0.0004999673287526176,
"loss": 5.8151,
"mean_token_accuracy": 0.15436604022979736,
"num_tokens": 3027878.0,
"step": 1645
},
{
"entropy": 6.128602933883667,
"epoch": 0.13782158369528902,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999668194782291,
"loss": 5.9886,
"mean_token_accuracy": 0.14296915978193284,
"num_tokens": 3037031.0,
"step": 1650
},
{
"entropy": 6.110314464569091,
"epoch": 0.138239224858002,
"grad_norm": 1.0625,
"learning_rate": 0.0004999663062655257,
"loss": 5.9556,
"mean_token_accuracy": 0.13569552153348924,
"num_tokens": 3046311.0,
"step": 1655
},
{
"entropy": 6.003753995895385,
"epoch": 0.138656866020715,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999657891145162,
"loss": 5.7534,
"mean_token_accuracy": 0.15544594079256058,
"num_tokens": 3055108.0,
"step": 1660
},
{
"entropy": 5.924490451812744,
"epoch": 0.139074507183428,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999652680252099,
"loss": 5.7931,
"mean_token_accuracy": 0.1543886348605156,
"num_tokens": 3063492.0,
"step": 1665
},
{
"entropy": 6.126929235458374,
"epoch": 0.139492148346141,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999647429976157,
"loss": 5.8302,
"mean_token_accuracy": 0.1553393468260765,
"num_tokens": 3072572.0,
"step": 1670
},
{
"entropy": 6.044676351547241,
"epoch": 0.139909789508854,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999642140317429,
"loss": 5.9059,
"mean_token_accuracy": 0.14429560154676438,
"num_tokens": 3082942.0,
"step": 1675
},
{
"entropy": 5.997855949401855,
"epoch": 0.140327430671567,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999636811276007,
"loss": 5.8469,
"mean_token_accuracy": 0.1536177761852741,
"num_tokens": 3091410.0,
"step": 1680
},
{
"entropy": 6.0224682807922365,
"epoch": 0.14074507183427998,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999631442851986,
"loss": 5.9257,
"mean_token_accuracy": 0.15009904503822327,
"num_tokens": 3100626.0,
"step": 1685
},
{
"entropy": 6.0320216655731205,
"epoch": 0.14116271299699298,
"grad_norm": 1.09375,
"learning_rate": 0.0004999626035045458,
"loss": 5.7261,
"mean_token_accuracy": 0.1567755565047264,
"num_tokens": 3109339.0,
"step": 1690
},
{
"entropy": 6.0257481098175045,
"epoch": 0.141580354159706,
"grad_norm": 1.109375,
"learning_rate": 0.0004999620587856519,
"loss": 5.8463,
"mean_token_accuracy": 0.1439797654747963,
"num_tokens": 3118636.0,
"step": 1695
},
{
"entropy": 5.952003431320191,
"epoch": 0.14199799532241897,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999615101285262,
"loss": 5.8113,
"mean_token_accuracy": 0.14703552275896073,
"num_tokens": 3128162.0,
"step": 1700
},
{
"entropy": 6.0136284828186035,
"epoch": 0.14241563648513197,
"grad_norm": 1.109375,
"learning_rate": 0.0004999609575331786,
"loss": 5.8267,
"mean_token_accuracy": 0.15116721987724305,
"num_tokens": 3136451.0,
"step": 1705
},
{
"entropy": 5.987718105316162,
"epoch": 0.14283327764784498,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999604009996186,
"loss": 5.8243,
"mean_token_accuracy": 0.1483292445540428,
"num_tokens": 3146599.0,
"step": 1710
},
{
"entropy": 6.0418936252594,
"epoch": 0.14325091881055796,
"grad_norm": 1.0703125,
"learning_rate": 0.000499959840527856,
"loss": 5.865,
"mean_token_accuracy": 0.14836757779121398,
"num_tokens": 3155941.0,
"step": 1715
},
{
"entropy": 5.981376600265503,
"epoch": 0.14366855997327097,
"grad_norm": 1.171875,
"learning_rate": 0.0004999592761179007,
"loss": 5.799,
"mean_token_accuracy": 0.15541139990091324,
"num_tokens": 3164641.0,
"step": 1720
},
{
"entropy": 5.985382604598999,
"epoch": 0.14408620113598397,
"grad_norm": 1.0625,
"learning_rate": 0.0004999587077697624,
"loss": 5.836,
"mean_token_accuracy": 0.15462168231606482,
"num_tokens": 3173701.0,
"step": 1725
},
{
"entropy": 5.883602571487427,
"epoch": 0.14450384229869695,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999581354834512,
"loss": 5.6754,
"mean_token_accuracy": 0.15326338410377502,
"num_tokens": 3182268.0,
"step": 1730
},
{
"entropy": 5.8569074153900145,
"epoch": 0.14492148346140996,
"grad_norm": 1.109375,
"learning_rate": 0.000499957559258977,
"loss": 5.7703,
"mean_token_accuracy": 0.15202518552541733,
"num_tokens": 3191513.0,
"step": 1735
},
{
"entropy": 5.987961149215698,
"epoch": 0.14533912462412296,
"grad_norm": 1.0625,
"learning_rate": 0.00049995697909635,
"loss": 5.7246,
"mean_token_accuracy": 0.15589588582515718,
"num_tokens": 3200580.0,
"step": 1740
},
{
"entropy": 5.856524658203125,
"epoch": 0.14575676578683594,
"grad_norm": 1.125,
"learning_rate": 0.0004999563949955803,
"loss": 5.8087,
"mean_token_accuracy": 0.1553361989557743,
"num_tokens": 3209053.0,
"step": 1745
},
{
"entropy": 6.0035093307495115,
"epoch": 0.14617440694954895,
"grad_norm": 1.0234375,
"learning_rate": 0.000499955806956678,
"loss": 5.7911,
"mean_token_accuracy": 0.15282343551516533,
"num_tokens": 3218241.0,
"step": 1750
},
{
"entropy": 6.058890104293823,
"epoch": 0.14659204811226195,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999552149796536,
"loss": 5.8465,
"mean_token_accuracy": 0.14872528836131096,
"num_tokens": 3227887.0,
"step": 1755
},
{
"entropy": 5.856602144241333,
"epoch": 0.14700968927497493,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999546190645175,
"loss": 5.6597,
"mean_token_accuracy": 0.16461554318666458,
"num_tokens": 3237281.0,
"step": 1760
},
{
"entropy": 5.890706157684326,
"epoch": 0.14742733043768794,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999540192112799,
"loss": 5.7021,
"mean_token_accuracy": 0.15412323474884032,
"num_tokens": 3246907.0,
"step": 1765
},
{
"entropy": 5.820692110061645,
"epoch": 0.14784497160040094,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999534154199514,
"loss": 5.7168,
"mean_token_accuracy": 0.15027530640363693,
"num_tokens": 3256312.0,
"step": 1770
},
{
"entropy": 6.074083471298218,
"epoch": 0.14826261276311392,
"grad_norm": 0.9375,
"learning_rate": 0.0004999528076905426,
"loss": 5.8001,
"mean_token_accuracy": 0.1542187049984932,
"num_tokens": 3265554.0,
"step": 1775
},
{
"entropy": 5.754930448532105,
"epoch": 0.14868025392582693,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999521960230641,
"loss": 5.6494,
"mean_token_accuracy": 0.1565927043557167,
"num_tokens": 3274731.0,
"step": 1780
},
{
"entropy": 5.933595037460327,
"epoch": 0.14909789508853993,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999515804175268,
"loss": 5.7895,
"mean_token_accuracy": 0.14958274662494658,
"num_tokens": 3283518.0,
"step": 1785
},
{
"entropy": 5.951525926589966,
"epoch": 0.1495155362512529,
"grad_norm": 0.96484375,
"learning_rate": 0.000499950960873941,
"loss": 5.7859,
"mean_token_accuracy": 0.15745193660259246,
"num_tokens": 3292244.0,
"step": 1790
},
{
"entropy": 5.963454151153565,
"epoch": 0.14993317741396592,
"grad_norm": 1.109375,
"learning_rate": 0.0004999503373923182,
"loss": 5.765,
"mean_token_accuracy": 0.16077590733766556,
"num_tokens": 3301198.0,
"step": 1795
},
{
"entropy": 5.918994140625,
"epoch": 0.15035081857667892,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999497099726687,
"loss": 5.7452,
"mean_token_accuracy": 0.1589679017663002,
"num_tokens": 3309983.0,
"step": 1800
},
{
"entropy": 5.970966100692749,
"epoch": 0.1507684597393919,
"grad_norm": 0.9609375,
"learning_rate": 0.0004999490786150039,
"loss": 5.837,
"mean_token_accuracy": 0.15418724715709686,
"num_tokens": 3319313.0,
"step": 1805
},
{
"entropy": 5.909102869033814,
"epoch": 0.1511861009021049,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999484433193348,
"loss": 5.6928,
"mean_token_accuracy": 0.1517741158604622,
"num_tokens": 3327497.0,
"step": 1810
},
{
"entropy": 5.8330848693847654,
"epoch": 0.15160374206481791,
"grad_norm": 1.03125,
"learning_rate": 0.0004999478040856722,
"loss": 5.6975,
"mean_token_accuracy": 0.15902745127677917,
"num_tokens": 3337029.0,
"step": 1815
},
{
"entropy": 5.866577863693237,
"epoch": 0.1520213832275309,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999471609140276,
"loss": 5.6811,
"mean_token_accuracy": 0.15399467051029206,
"num_tokens": 3346243.0,
"step": 1820
},
{
"entropy": 5.9908100128173825,
"epoch": 0.1524390243902439,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999465138044122,
"loss": 5.8181,
"mean_token_accuracy": 0.15329389721155168,
"num_tokens": 3354846.0,
"step": 1825
},
{
"entropy": 5.896318197250366,
"epoch": 0.1528566655529569,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999458627568373,
"loss": 5.7948,
"mean_token_accuracy": 0.14822318404912949,
"num_tokens": 3364683.0,
"step": 1830
},
{
"entropy": 5.946144962310791,
"epoch": 0.15327430671566988,
"grad_norm": 0.984375,
"learning_rate": 0.0004999452077713144,
"loss": 5.7304,
"mean_token_accuracy": 0.1531567633152008,
"num_tokens": 3374652.0,
"step": 1835
},
{
"entropy": 5.936914443969727,
"epoch": 0.1536919478783829,
"grad_norm": 1.0625,
"learning_rate": 0.0004999445488478547,
"loss": 5.7449,
"mean_token_accuracy": 0.1530358150601387,
"num_tokens": 3384040.0,
"step": 1840
},
{
"entropy": 5.872563695907592,
"epoch": 0.1541095890410959,
"grad_norm": 1.234375,
"learning_rate": 0.00049994388598647,
"loss": 5.809,
"mean_token_accuracy": 0.15368022173643112,
"num_tokens": 3393185.0,
"step": 1845
},
{
"entropy": 5.916036987304688,
"epoch": 0.15452723020380887,
"grad_norm": 1.046875,
"learning_rate": 0.0004999432191871719,
"loss": 5.7424,
"mean_token_accuracy": 0.1590338796377182,
"num_tokens": 3403077.0,
"step": 1850
},
{
"entropy": 5.922382068634033,
"epoch": 0.15494487136652188,
"grad_norm": 1.109375,
"learning_rate": 0.0004999425484499718,
"loss": 5.7088,
"mean_token_accuracy": 0.16295739710330964,
"num_tokens": 3412165.0,
"step": 1855
},
{
"entropy": 5.917156219482422,
"epoch": 0.1553625125292349,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999418737748817,
"loss": 5.7864,
"mean_token_accuracy": 0.15014993846416474,
"num_tokens": 3421162.0,
"step": 1860
},
{
"entropy": 6.0512267589569095,
"epoch": 0.15578015369194786,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999411951619134,
"loss": 5.8381,
"mean_token_accuracy": 0.14904813170433046,
"num_tokens": 3430363.0,
"step": 1865
},
{
"entropy": 5.9039225578308105,
"epoch": 0.15619779485466087,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999405126110786,
"loss": 5.7589,
"mean_token_accuracy": 0.15248761922121049,
"num_tokens": 3439199.0,
"step": 1870
},
{
"entropy": 6.058674573898315,
"epoch": 0.15661543601737388,
"grad_norm": 1.171875,
"learning_rate": 0.0004999398261223895,
"loss": 5.8786,
"mean_token_accuracy": 0.14814874157309532,
"num_tokens": 3448720.0,
"step": 1875
},
{
"entropy": 5.953385496139527,
"epoch": 0.15703307718008688,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999391356958579,
"loss": 5.8496,
"mean_token_accuracy": 0.15151757299900054,
"num_tokens": 3458472.0,
"step": 1880
},
{
"entropy": 5.901563405990601,
"epoch": 0.15745071834279986,
"grad_norm": 1.1015625,
"learning_rate": 0.000499938441331496,
"loss": 5.7974,
"mean_token_accuracy": 0.15049149096012115,
"num_tokens": 3467140.0,
"step": 1885
},
{
"entropy": 6.021198081970215,
"epoch": 0.15786835950551287,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999377430293159,
"loss": 5.7648,
"mean_token_accuracy": 0.15717735141515732,
"num_tokens": 3476431.0,
"step": 1890
},
{
"entropy": 5.848060035705567,
"epoch": 0.15828600066822587,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999370407893299,
"loss": 5.6897,
"mean_token_accuracy": 0.16121015697717667,
"num_tokens": 3485768.0,
"step": 1895
},
{
"entropy": 5.948093843460083,
"epoch": 0.15870364183093885,
"grad_norm": 1.125,
"learning_rate": 0.0004999363346115501,
"loss": 5.8474,
"mean_token_accuracy": 0.14542020708322526,
"num_tokens": 3495678.0,
"step": 1900
},
{
"entropy": 5.946852588653565,
"epoch": 0.15912128299365186,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999356244959893,
"loss": 5.8267,
"mean_token_accuracy": 0.1487009271979332,
"num_tokens": 3505168.0,
"step": 1905
},
{
"entropy": 5.898217058181762,
"epoch": 0.15953892415636486,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999349104426594,
"loss": 5.7751,
"mean_token_accuracy": 0.1467003971338272,
"num_tokens": 3514498.0,
"step": 1910
},
{
"entropy": 5.959862756729126,
"epoch": 0.15995656531907784,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999341924515732,
"loss": 5.6972,
"mean_token_accuracy": 0.15165367797017099,
"num_tokens": 3524617.0,
"step": 1915
},
{
"entropy": 5.876605606079101,
"epoch": 0.16037420648179085,
"grad_norm": 1.09375,
"learning_rate": 0.0004999334705227431,
"loss": 5.6697,
"mean_token_accuracy": 0.16165476739406587,
"num_tokens": 3533523.0,
"step": 1920
},
{
"entropy": 5.918030166625977,
"epoch": 0.16079184764450385,
"grad_norm": 0.9765625,
"learning_rate": 0.000499932744656182,
"loss": 5.7491,
"mean_token_accuracy": 0.15332375168800355,
"num_tokens": 3542922.0,
"step": 1925
},
{
"entropy": 5.910229635238648,
"epoch": 0.16120948880721683,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999320148519024,
"loss": 5.7379,
"mean_token_accuracy": 0.15843380093574524,
"num_tokens": 3551827.0,
"step": 1930
},
{
"entropy": 5.871778774261474,
"epoch": 0.16162712996992984,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999312811099171,
"loss": 5.7178,
"mean_token_accuracy": 0.1555511921644211,
"num_tokens": 3560911.0,
"step": 1935
},
{
"entropy": 5.904352331161499,
"epoch": 0.16204477113264285,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999305434302391,
"loss": 5.7368,
"mean_token_accuracy": 0.15174949616193772,
"num_tokens": 3569473.0,
"step": 1940
},
{
"entropy": 5.919321489334107,
"epoch": 0.16246241229535582,
"grad_norm": 1.125,
"learning_rate": 0.000499929801812881,
"loss": 5.7277,
"mean_token_accuracy": 0.15868740230798722,
"num_tokens": 3578843.0,
"step": 1945
},
{
"entropy": 5.860245084762573,
"epoch": 0.16288005345806883,
"grad_norm": 1.109375,
"learning_rate": 0.0004999290562578561,
"loss": 5.7353,
"mean_token_accuracy": 0.15620914250612258,
"num_tokens": 3588304.0,
"step": 1950
},
{
"entropy": 5.888051176071167,
"epoch": 0.16329769462078184,
"grad_norm": 1.046875,
"learning_rate": 0.0004999283067651773,
"loss": 5.8009,
"mean_token_accuracy": 0.1543695256114006,
"num_tokens": 3598354.0,
"step": 1955
},
{
"entropy": 6.011698055267334,
"epoch": 0.16371533578349481,
"grad_norm": 1.03125,
"learning_rate": 0.0004999275533348577,
"loss": 5.8477,
"mean_token_accuracy": 0.1474734641611576,
"num_tokens": 3607503.0,
"step": 1960
},
{
"entropy": 5.79921932220459,
"epoch": 0.16413297694620782,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999267959669106,
"loss": 5.6562,
"mean_token_accuracy": 0.16296175867319107,
"num_tokens": 3617467.0,
"step": 1965
},
{
"entropy": 5.922436189651489,
"epoch": 0.16455061810892083,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999260346613491,
"loss": 5.6689,
"mean_token_accuracy": 0.1523266538977623,
"num_tokens": 3627048.0,
"step": 1970
},
{
"entropy": 5.803083086013794,
"epoch": 0.1649682592716338,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999252694181867,
"loss": 5.6984,
"mean_token_accuracy": 0.15438316911458969,
"num_tokens": 3636683.0,
"step": 1975
},
{
"entropy": 5.812573051452636,
"epoch": 0.1653859004343468,
"grad_norm": 1.09375,
"learning_rate": 0.0004999245002374367,
"loss": 5.5985,
"mean_token_accuracy": 0.16638619005680083,
"num_tokens": 3645231.0,
"step": 1980
},
{
"entropy": 5.846198654174804,
"epoch": 0.16580354159705982,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999237271191125,
"loss": 5.6846,
"mean_token_accuracy": 0.1619308263063431,
"num_tokens": 3653851.0,
"step": 1985
},
{
"entropy": 5.832628393173218,
"epoch": 0.1662211827597728,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999229500632279,
"loss": 5.6668,
"mean_token_accuracy": 0.16223268061876298,
"num_tokens": 3662720.0,
"step": 1990
},
{
"entropy": 5.705533599853515,
"epoch": 0.1666388239224858,
"grad_norm": 1.2109375,
"learning_rate": 0.0004999221690697961,
"loss": 5.6132,
"mean_token_accuracy": 0.16336482465267183,
"num_tokens": 3671777.0,
"step": 1995
},
{
"entropy": 5.847080707550049,
"epoch": 0.1670564650851988,
"grad_norm": 1.109375,
"learning_rate": 0.0004999213841388312,
"loss": 5.6881,
"mean_token_accuracy": 0.16348690390586854,
"num_tokens": 3681390.0,
"step": 2000
},
{
"entropy": 5.917251682281494,
"epoch": 0.16747410624791179,
"grad_norm": 1.078125,
"learning_rate": 0.0004999205952703466,
"loss": 5.7464,
"mean_token_accuracy": 0.1585702434182167,
"num_tokens": 3690899.0,
"step": 2005
},
{
"entropy": 5.978084659576416,
"epoch": 0.1678917474106248,
"grad_norm": 1.109375,
"learning_rate": 0.0004999198024643563,
"loss": 5.8358,
"mean_token_accuracy": 0.1485416978597641,
"num_tokens": 3699891.0,
"step": 2010
},
{
"entropy": 5.7726466178894045,
"epoch": 0.1683093885733378,
"grad_norm": 1.09375,
"learning_rate": 0.0004999190057208741,
"loss": 5.631,
"mean_token_accuracy": 0.16494597047567366,
"num_tokens": 3709860.0,
"step": 2015
},
{
"entropy": 5.8699462890625,
"epoch": 0.16872702973605078,
"grad_norm": 1.046875,
"learning_rate": 0.000499918205039914,
"loss": 5.7542,
"mean_token_accuracy": 0.15509038269519806,
"num_tokens": 3718896.0,
"step": 2020
},
{
"entropy": 5.803660774230957,
"epoch": 0.16914467089876378,
"grad_norm": 1.09375,
"learning_rate": 0.0004999174004214899,
"loss": 5.5717,
"mean_token_accuracy": 0.1623939424753189,
"num_tokens": 3727355.0,
"step": 2025
},
{
"entropy": 5.7896076202392575,
"epoch": 0.1695623120614768,
"grad_norm": 1.046875,
"learning_rate": 0.0004999165918656161,
"loss": 5.6764,
"mean_token_accuracy": 0.15922652035951615,
"num_tokens": 3736191.0,
"step": 2030
},
{
"entropy": 5.883917236328125,
"epoch": 0.16997995322418977,
"grad_norm": 1.109375,
"learning_rate": 0.0004999157793723065,
"loss": 5.7058,
"mean_token_accuracy": 0.15698790550231934,
"num_tokens": 3744832.0,
"step": 2035
},
{
"entropy": 5.81550817489624,
"epoch": 0.17039759438690277,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999149629415755,
"loss": 5.6608,
"mean_token_accuracy": 0.15519305020570756,
"num_tokens": 3753835.0,
"step": 2040
},
{
"entropy": 5.9895366668701175,
"epoch": 0.17081523554961578,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999141425734374,
"loss": 5.7431,
"mean_token_accuracy": 0.1554757535457611,
"num_tokens": 3762816.0,
"step": 2045
},
{
"entropy": 5.809294700622559,
"epoch": 0.17123287671232876,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999133182679064,
"loss": 5.7946,
"mean_token_accuracy": 0.15067907720804213,
"num_tokens": 3773244.0,
"step": 2050
},
{
"entropy": 5.8846066951751705,
"epoch": 0.17165051787504176,
"grad_norm": 1.125,
"learning_rate": 0.0004999124900249971,
"loss": 5.6432,
"mean_token_accuracy": 0.16037556380033494,
"num_tokens": 3782122.0,
"step": 2055
},
{
"entropy": 5.842645502090454,
"epoch": 0.17206815903775477,
"grad_norm": 1.15625,
"learning_rate": 0.0004999116578447239,
"loss": 5.6351,
"mean_token_accuracy": 0.16681777983903884,
"num_tokens": 3791303.0,
"step": 2060
},
{
"entropy": 5.874477386474609,
"epoch": 0.17248580020046775,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999108217271015,
"loss": 5.7206,
"mean_token_accuracy": 0.1557923972606659,
"num_tokens": 3800991.0,
"step": 2065
},
{
"entropy": 5.81466908454895,
"epoch": 0.17290344136318075,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999099816721444,
"loss": 5.6298,
"mean_token_accuracy": 0.15679699778556824,
"num_tokens": 3811293.0,
"step": 2070
},
{
"entropy": 5.934940910339355,
"epoch": 0.17332108252589376,
"grad_norm": 1.046875,
"learning_rate": 0.0004999091376798673,
"loss": 5.7245,
"mean_token_accuracy": 0.1563497804105282,
"num_tokens": 3820013.0,
"step": 2075
},
{
"entropy": 5.82628173828125,
"epoch": 0.17373872368860674,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999082897502849,
"loss": 5.6062,
"mean_token_accuracy": 0.16271923631429672,
"num_tokens": 3829099.0,
"step": 2080
},
{
"entropy": 5.759806680679321,
"epoch": 0.17415636485131974,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999074378834123,
"loss": 5.7196,
"mean_token_accuracy": 0.1553027555346489,
"num_tokens": 3838308.0,
"step": 2085
},
{
"entropy": 5.896584510803223,
"epoch": 0.17457400601403275,
"grad_norm": 1.0,
"learning_rate": 0.0004999065820792644,
"loss": 5.6668,
"mean_token_accuracy": 0.16025962680578232,
"num_tokens": 3847650.0,
"step": 2090
},
{
"entropy": 5.934039211273193,
"epoch": 0.17499164717674573,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999057223378559,
"loss": 5.844,
"mean_token_accuracy": 0.14192623198032378,
"num_tokens": 3857252.0,
"step": 2095
},
{
"entropy": 5.864416837692261,
"epoch": 0.17540928833945874,
"grad_norm": 1.078125,
"learning_rate": 0.000499904858659202,
"loss": 5.7049,
"mean_token_accuracy": 0.15697439014911652,
"num_tokens": 3865747.0,
"step": 2100
},
{
"entropy": 5.810830020904541,
"epoch": 0.17582692950217174,
"grad_norm": 1.0,
"learning_rate": 0.0004999039910433179,
"loss": 5.659,
"mean_token_accuracy": 0.1645386263728142,
"num_tokens": 3874958.0,
"step": 2105
},
{
"entropy": 5.744087553024292,
"epoch": 0.17624457066488472,
"grad_norm": 0.9609375,
"learning_rate": 0.0004999031194902187,
"loss": 5.6159,
"mean_token_accuracy": 0.16506801843643187,
"num_tokens": 3885216.0,
"step": 2110
},
{
"entropy": 5.754455709457398,
"epoch": 0.17666221182759773,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999022439999198,
"loss": 5.6546,
"mean_token_accuracy": 0.1671660214662552,
"num_tokens": 3893973.0,
"step": 2115
},
{
"entropy": 5.944645500183105,
"epoch": 0.17707985299031073,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999013645724362,
"loss": 5.7435,
"mean_token_accuracy": 0.15572567880153657,
"num_tokens": 3903532.0,
"step": 2120
},
{
"entropy": 5.836982297897339,
"epoch": 0.1774974941530237,
"grad_norm": 0.984375,
"learning_rate": 0.0004999004812077836,
"loss": 5.6585,
"mean_token_accuracy": 0.15952192693948747,
"num_tokens": 3913427.0,
"step": 2125
},
{
"entropy": 5.893245220184326,
"epoch": 0.17791513531573672,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998995939059773,
"loss": 5.795,
"mean_token_accuracy": 0.14690941274166108,
"num_tokens": 3923870.0,
"step": 2130
},
{
"entropy": 5.807616281509399,
"epoch": 0.17833277647844972,
"grad_norm": 1.015625,
"learning_rate": 0.000499898702667033,
"loss": 5.6093,
"mean_token_accuracy": 0.16058423221111298,
"num_tokens": 3933469.0,
"step": 2135
},
{
"entropy": 5.830925941467285,
"epoch": 0.1787504176411627,
"grad_norm": 1.171875,
"learning_rate": 0.0004998978074909661,
"loss": 5.6402,
"mean_token_accuracy": 0.17098447531461716,
"num_tokens": 3942427.0,
"step": 2140
},
{
"entropy": 5.76401195526123,
"epoch": 0.1791680588038757,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998969083777925,
"loss": 5.6649,
"mean_token_accuracy": 0.1665211722254753,
"num_tokens": 3951250.0,
"step": 2145
},
{
"entropy": 5.841114616394043,
"epoch": 0.1795856999665887,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998960053275277,
"loss": 5.6491,
"mean_token_accuracy": 0.16053525656461715,
"num_tokens": 3959969.0,
"step": 2150
},
{
"entropy": 5.82116289138794,
"epoch": 0.1800033411293017,
"grad_norm": 1.1484375,
"learning_rate": 0.0004998950983401875,
"loss": 5.6963,
"mean_token_accuracy": 0.1598428264260292,
"num_tokens": 3968171.0,
"step": 2155
},
{
"entropy": 5.894432878494262,
"epoch": 0.1804209822920147,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998941874157882,
"loss": 5.5892,
"mean_token_accuracy": 0.1645335629582405,
"num_tokens": 3976686.0,
"step": 2160
},
{
"entropy": 5.7327415466308596,
"epoch": 0.1808386234547277,
"grad_norm": 0.98046875,
"learning_rate": 0.0004998932725543453,
"loss": 5.7023,
"mean_token_accuracy": 0.1576009765267372,
"num_tokens": 3986552.0,
"step": 2165
},
{
"entropy": 5.8359321594238285,
"epoch": 0.18125626461744068,
"grad_norm": 1.140625,
"learning_rate": 0.0004998923537558749,
"loss": 5.587,
"mean_token_accuracy": 0.15782566368579865,
"num_tokens": 3995501.0,
"step": 2170
},
{
"entropy": 5.710008239746093,
"epoch": 0.1816739057801537,
"grad_norm": 1.03125,
"learning_rate": 0.0004998914310203932,
"loss": 5.5716,
"mean_token_accuracy": 0.1638147160410881,
"num_tokens": 4004423.0,
"step": 2175
},
{
"entropy": 5.84242000579834,
"epoch": 0.1820915469428667,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998905043479163,
"loss": 5.7582,
"mean_token_accuracy": 0.15638344138860702,
"num_tokens": 4013324.0,
"step": 2180
},
{
"entropy": 5.852623367309571,
"epoch": 0.18250918810557967,
"grad_norm": 1.09375,
"learning_rate": 0.0004998895737384605,
"loss": 5.6477,
"mean_token_accuracy": 0.15933823138475417,
"num_tokens": 4021896.0,
"step": 2185
},
{
"entropy": 5.727082061767578,
"epoch": 0.18292682926829268,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998886391920418,
"loss": 5.6379,
"mean_token_accuracy": 0.15712598264217376,
"num_tokens": 4030590.0,
"step": 2190
},
{
"entropy": 5.802021408081055,
"epoch": 0.18334447043100568,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998877007086769,
"loss": 5.5297,
"mean_token_accuracy": 0.16887603253126143,
"num_tokens": 4040041.0,
"step": 2195
},
{
"entropy": 5.7888710498809814,
"epoch": 0.18376211159371866,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998867582883821,
"loss": 5.6962,
"mean_token_accuracy": 0.1554000347852707,
"num_tokens": 4049119.0,
"step": 2200
},
{
"entropy": 5.80960488319397,
"epoch": 0.18417975275643167,
"grad_norm": 1.046875,
"learning_rate": 0.0004998858119311739,
"loss": 5.6301,
"mean_token_accuracy": 0.15796089097857474,
"num_tokens": 4059265.0,
"step": 2205
},
{
"entropy": 5.779888057708741,
"epoch": 0.18459739391914468,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998848616370689,
"loss": 5.6687,
"mean_token_accuracy": 0.159270016849041,
"num_tokens": 4068363.0,
"step": 2210
},
{
"entropy": 5.799966812133789,
"epoch": 0.18501503508185768,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998839074060837,
"loss": 5.5607,
"mean_token_accuracy": 0.16761811226606368,
"num_tokens": 4077390.0,
"step": 2215
},
{
"entropy": 5.7324597358703615,
"epoch": 0.18543267624457066,
"grad_norm": 1.09375,
"learning_rate": 0.000499882949238235,
"loss": 5.6528,
"mean_token_accuracy": 0.15475580096244812,
"num_tokens": 4087331.0,
"step": 2220
},
{
"entropy": 5.980052328109741,
"epoch": 0.18585031740728367,
"grad_norm": 1.03125,
"learning_rate": 0.0004998819871335396,
"loss": 5.8267,
"mean_token_accuracy": 0.15336512476205827,
"num_tokens": 4096425.0,
"step": 2225
},
{
"entropy": 5.77472767829895,
"epoch": 0.18626795856999667,
"grad_norm": 1.078125,
"learning_rate": 0.0004998810210920142,
"loss": 5.5997,
"mean_token_accuracy": 0.16035911142826081,
"num_tokens": 4106056.0,
"step": 2230
},
{
"entropy": 5.701298999786377,
"epoch": 0.18668559973270965,
"grad_norm": 1.078125,
"learning_rate": 0.0004998800511136759,
"loss": 5.6814,
"mean_token_accuracy": 0.15928506404161452,
"num_tokens": 4115133.0,
"step": 2235
},
{
"entropy": 5.816712808609009,
"epoch": 0.18710324089542266,
"grad_norm": 0.984375,
"learning_rate": 0.0004998790771985417,
"loss": 5.5912,
"mean_token_accuracy": 0.160226671397686,
"num_tokens": 4123630.0,
"step": 2240
},
{
"entropy": 5.731363201141358,
"epoch": 0.18752088205813566,
"grad_norm": 0.9921875,
"learning_rate": 0.0004998780993466284,
"loss": 5.7214,
"mean_token_accuracy": 0.16045138984918594,
"num_tokens": 4133337.0,
"step": 2245
},
{
"entropy": 5.8761168956756595,
"epoch": 0.18793852322084864,
"grad_norm": 1.0859375,
"learning_rate": 0.0004998771175579534,
"loss": 5.6467,
"mean_token_accuracy": 0.16236401796340943,
"num_tokens": 4142240.0,
"step": 2250
},
{
"entropy": 5.759765577316284,
"epoch": 0.18835616438356165,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998761318325337,
"loss": 5.631,
"mean_token_accuracy": 0.15987929254770278,
"num_tokens": 4151297.0,
"step": 2255
},
{
"entropy": 5.761353254318237,
"epoch": 0.18877380554627465,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998751421703868,
"loss": 5.5913,
"mean_token_accuracy": 0.1627461642026901,
"num_tokens": 4160193.0,
"step": 2260
},
{
"entropy": 5.856572532653809,
"epoch": 0.18919144670898763,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998741485715297,
"loss": 5.7475,
"mean_token_accuracy": 0.15776600688695908,
"num_tokens": 4169948.0,
"step": 2265
},
{
"entropy": 5.932883214950562,
"epoch": 0.18960908787170064,
"grad_norm": 0.94140625,
"learning_rate": 0.00049987315103598,
"loss": 5.7576,
"mean_token_accuracy": 0.15294902846217157,
"num_tokens": 4179981.0,
"step": 2270
},
{
"entropy": 5.834502363204956,
"epoch": 0.19002672903441364,
"grad_norm": 1.015625,
"learning_rate": 0.0004998721495637551,
"loss": 5.7752,
"mean_token_accuracy": 0.15345177948474883,
"num_tokens": 4189172.0,
"step": 2275
},
{
"entropy": 5.774939393997192,
"epoch": 0.19044437019712662,
"grad_norm": 1.09375,
"learning_rate": 0.0004998711441548726,
"loss": 5.5836,
"mean_token_accuracy": 0.15776675045490265,
"num_tokens": 4197312.0,
"step": 2280
},
{
"entropy": 5.827042913436889,
"epoch": 0.19086201135983963,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998701348093499,
"loss": 5.6343,
"mean_token_accuracy": 0.1647990196943283,
"num_tokens": 4206828.0,
"step": 2285
},
{
"entropy": 5.904668378829956,
"epoch": 0.19127965252255263,
"grad_norm": 1.0390625,
"learning_rate": 0.000499869121527205,
"loss": 5.5972,
"mean_token_accuracy": 0.16681263595819473,
"num_tokens": 4214835.0,
"step": 2290
},
{
"entropy": 5.8230327606201175,
"epoch": 0.1916972936852656,
"grad_norm": 1.015625,
"learning_rate": 0.0004998681043084553,
"loss": 5.7899,
"mean_token_accuracy": 0.14819930419325827,
"num_tokens": 4225119.0,
"step": 2295
},
{
"entropy": 5.684073781967163,
"epoch": 0.19211493484797862,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998670831531188,
"loss": 5.625,
"mean_token_accuracy": 0.16301271319389343,
"num_tokens": 4235257.0,
"step": 2300
},
{
"entropy": 5.862882328033447,
"epoch": 0.19253257601069163,
"grad_norm": 0.9609375,
"learning_rate": 0.0004998660580612135,
"loss": 5.6971,
"mean_token_accuracy": 0.16653790175914765,
"num_tokens": 4244211.0,
"step": 2305
},
{
"entropy": 5.840312385559082,
"epoch": 0.1929502171734046,
"grad_norm": 1.09375,
"learning_rate": 0.0004998650290327569,
"loss": 5.7149,
"mean_token_accuracy": 0.15949375480413436,
"num_tokens": 4253149.0,
"step": 2310
},
{
"entropy": 5.719400072097779,
"epoch": 0.1933678583361176,
"grad_norm": 1.046875,
"learning_rate": 0.0004998639960677675,
"loss": 5.6045,
"mean_token_accuracy": 0.16629393100738527,
"num_tokens": 4262557.0,
"step": 2315
},
{
"entropy": 5.765211296081543,
"epoch": 0.19378549949883062,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998629591662631,
"loss": 5.6186,
"mean_token_accuracy": 0.1608939915895462,
"num_tokens": 4272881.0,
"step": 2320
},
{
"entropy": 5.732853174209595,
"epoch": 0.1942031406615436,
"grad_norm": 1.1875,
"learning_rate": 0.000499861918328262,
"loss": 5.6153,
"mean_token_accuracy": 0.16830391734838485,
"num_tokens": 4281158.0,
"step": 2325
},
{
"entropy": 5.767421293258667,
"epoch": 0.1946207818242566,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998608735537822,
"loss": 5.613,
"mean_token_accuracy": 0.15854829102754592,
"num_tokens": 4290319.0,
"step": 2330
},
{
"entropy": 5.8061658382415775,
"epoch": 0.1950384229869696,
"grad_norm": 1.078125,
"learning_rate": 0.0004998598248428423,
"loss": 5.6996,
"mean_token_accuracy": 0.1628992959856987,
"num_tokens": 4299276.0,
"step": 2335
},
{
"entropy": 5.820240068435669,
"epoch": 0.19545606414968258,
"grad_norm": 1.078125,
"learning_rate": 0.0004998587721954604,
"loss": 5.6563,
"mean_token_accuracy": 0.16527265459299087,
"num_tokens": 4308291.0,
"step": 2340
},
{
"entropy": 5.764502143859863,
"epoch": 0.1958737053123956,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998577156116551,
"loss": 5.6204,
"mean_token_accuracy": 0.1616749197244644,
"num_tokens": 4316654.0,
"step": 2345
},
{
"entropy": 5.757666826248169,
"epoch": 0.1962913464751086,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998566550914448,
"loss": 5.5593,
"mean_token_accuracy": 0.16192719340324402,
"num_tokens": 4325911.0,
"step": 2350
},
{
"entropy": 5.76278510093689,
"epoch": 0.19670898763782158,
"grad_norm": 1.03125,
"learning_rate": 0.0004998555906348481,
"loss": 5.7319,
"mean_token_accuracy": 0.15768774896860122,
"num_tokens": 4334846.0,
"step": 2355
},
{
"entropy": 5.823022794723511,
"epoch": 0.19712662880053458,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998545222418836,
"loss": 5.6169,
"mean_token_accuracy": 0.1655540272593498,
"num_tokens": 4343728.0,
"step": 2360
},
{
"entropy": 5.810211420059204,
"epoch": 0.1975442699632476,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998534499125701,
"loss": 5.6015,
"mean_token_accuracy": 0.1647025465965271,
"num_tokens": 4352774.0,
"step": 2365
},
{
"entropy": 5.798485040664673,
"epoch": 0.19796191112596057,
"grad_norm": 1.125,
"learning_rate": 0.0004998523736469263,
"loss": 5.7515,
"mean_token_accuracy": 0.15903669595718384,
"num_tokens": 4361663.0,
"step": 2370
},
{
"entropy": 5.767217540740967,
"epoch": 0.19837955228867357,
"grad_norm": 1.09375,
"learning_rate": 0.000499851293444971,
"loss": 5.5813,
"mean_token_accuracy": 0.17194907814264299,
"num_tokens": 4370278.0,
"step": 2375
},
{
"entropy": 5.825853443145752,
"epoch": 0.19879719345138658,
"grad_norm": 1.03125,
"learning_rate": 0.0004998502093067231,
"loss": 5.6353,
"mean_token_accuracy": 0.16817053258419037,
"num_tokens": 4379010.0,
"step": 2380
},
{
"entropy": 5.835199785232544,
"epoch": 0.19921483461409956,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998491212322017,
"loss": 5.6098,
"mean_token_accuracy": 0.161689792573452,
"num_tokens": 4388145.0,
"step": 2385
},
{
"entropy": 5.710544586181641,
"epoch": 0.19963247577681256,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998480292214258,
"loss": 5.7491,
"mean_token_accuracy": 0.16246786564588547,
"num_tokens": 4396321.0,
"step": 2390
},
{
"entropy": 5.789666175842285,
"epoch": 0.20005011693952557,
"grad_norm": 1.1484375,
"learning_rate": 0.0004998469332744144,
"loss": 5.5277,
"mean_token_accuracy": 0.1656605526804924,
"num_tokens": 4404854.0,
"step": 2395
},
{
"entropy": 5.63559889793396,
"epoch": 0.20046775810223855,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998458333911869,
"loss": 5.5222,
"mean_token_accuracy": 0.169854998588562,
"num_tokens": 4413890.0,
"step": 2400
},
{
"entropy": 5.735365390777588,
"epoch": 0.20088539926495155,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998447295717624,
"loss": 5.6776,
"mean_token_accuracy": 0.15991291105747224,
"num_tokens": 4423019.0,
"step": 2405
},
{
"entropy": 5.759283638000488,
"epoch": 0.20130304042766456,
"grad_norm": 1.0625,
"learning_rate": 0.0004998436218161602,
"loss": 5.6051,
"mean_token_accuracy": 0.16260855495929719,
"num_tokens": 4432340.0,
"step": 2410
},
{
"entropy": 5.737146377563477,
"epoch": 0.20172068159037754,
"grad_norm": 1.015625,
"learning_rate": 0.0004998425101243999,
"loss": 5.5848,
"mean_token_accuracy": 0.16569507718086243,
"num_tokens": 4441834.0,
"step": 2415
},
{
"entropy": 5.740446710586548,
"epoch": 0.20213832275309054,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998413944965007,
"loss": 5.6195,
"mean_token_accuracy": 0.16548486649990082,
"num_tokens": 4450864.0,
"step": 2420
},
{
"entropy": 5.706497478485107,
"epoch": 0.20255596391580355,
"grad_norm": 1.03125,
"learning_rate": 0.0004998402749324823,
"loss": 5.6982,
"mean_token_accuracy": 0.1565281093120575,
"num_tokens": 4460697.0,
"step": 2425
},
{
"entropy": 5.930861711502075,
"epoch": 0.20297360507851653,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998391514323642,
"loss": 5.7108,
"mean_token_accuracy": 0.1600305914878845,
"num_tokens": 4469926.0,
"step": 2430
},
{
"entropy": 5.704679727554321,
"epoch": 0.20339124624122953,
"grad_norm": 1.046875,
"learning_rate": 0.0004998380239961661,
"loss": 5.6271,
"mean_token_accuracy": 0.16277854442596434,
"num_tokens": 4478818.0,
"step": 2435
},
{
"entropy": 5.797401666641235,
"epoch": 0.20380888740394254,
"grad_norm": 0.97265625,
"learning_rate": 0.0004998368926239078,
"loss": 5.5596,
"mean_token_accuracy": 0.16615838557481766,
"num_tokens": 4487451.0,
"step": 2440
},
{
"entropy": 5.729301643371582,
"epoch": 0.20422652856665552,
"grad_norm": 1.0703125,
"learning_rate": 0.000499835757315609,
"loss": 5.6466,
"mean_token_accuracy": 0.15662010610103608,
"num_tokens": 4497674.0,
"step": 2445
},
{
"entropy": 5.70154185295105,
"epoch": 0.20464416972936852,
"grad_norm": 1.0859375,
"learning_rate": 0.0004998346180712898,
"loss": 5.5992,
"mean_token_accuracy": 0.17245133817195893,
"num_tokens": 4507666.0,
"step": 2450
},
{
"entropy": 5.775140380859375,
"epoch": 0.20506181089208153,
"grad_norm": 1.078125,
"learning_rate": 0.0004998334748909698,
"loss": 5.7042,
"mean_token_accuracy": 0.15649858564138414,
"num_tokens": 4517409.0,
"step": 2455
},
{
"entropy": 5.744282531738281,
"epoch": 0.2054794520547945,
"grad_norm": 1.0625,
"learning_rate": 0.0004998323277746694,
"loss": 5.4972,
"mean_token_accuracy": 0.167903570830822,
"num_tokens": 4526495.0,
"step": 2460
},
{
"entropy": 5.750102710723877,
"epoch": 0.20589709321750752,
"grad_norm": 1.0078125,
"learning_rate": 0.0004998311767224081,
"loss": 5.5807,
"mean_token_accuracy": 0.17419597804546355,
"num_tokens": 4535240.0,
"step": 2465
},
{
"entropy": 5.732834100723267,
"epoch": 0.20631473438022052,
"grad_norm": 0.92578125,
"learning_rate": 0.0004998300217342067,
"loss": 5.6707,
"mean_token_accuracy": 0.15876903831958772,
"num_tokens": 4544716.0,
"step": 2470
},
{
"entropy": 5.706253528594971,
"epoch": 0.2067323755429335,
"grad_norm": 1.046875,
"learning_rate": 0.0004998288628100851,
"loss": 5.6031,
"mean_token_accuracy": 0.1646232396364212,
"num_tokens": 4553867.0,
"step": 2475
},
{
"entropy": 5.765943002700806,
"epoch": 0.2071500167056465,
"grad_norm": 1.0234375,
"learning_rate": 0.0004998276999500636,
"loss": 5.657,
"mean_token_accuracy": 0.15891273021698,
"num_tokens": 4562529.0,
"step": 2480
},
{
"entropy": 5.631934547424317,
"epoch": 0.2075676578683595,
"grad_norm": 1.078125,
"learning_rate": 0.0004998265331541627,
"loss": 5.4415,
"mean_token_accuracy": 0.17996778339147568,
"num_tokens": 4571041.0,
"step": 2485
},
{
"entropy": 5.640371704101563,
"epoch": 0.2079852990310725,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998253624224026,
"loss": 5.5778,
"mean_token_accuracy": 0.16657757610082627,
"num_tokens": 4579914.0,
"step": 2490
},
{
"entropy": 5.763918113708496,
"epoch": 0.2084029401937855,
"grad_norm": 1.265625,
"learning_rate": 0.000499824187754804,
"loss": 5.6614,
"mean_token_accuracy": 0.16418944895267487,
"num_tokens": 4590277.0,
"step": 2495
},
{
"entropy": 5.712745714187622,
"epoch": 0.2088205813564985,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998230091513872,
"loss": 5.585,
"mean_token_accuracy": 0.1670702204108238,
"num_tokens": 4598719.0,
"step": 2500
},
{
"entropy": 5.713497543334961,
"epoch": 0.20923822251921148,
"grad_norm": 0.98828125,
"learning_rate": 0.0004998218266121731,
"loss": 5.5443,
"mean_token_accuracy": 0.16411634981632234,
"num_tokens": 4607804.0,
"step": 2505
},
{
"entropy": 5.684199476242066,
"epoch": 0.2096558636819245,
"grad_norm": 0.9921875,
"learning_rate": 0.0004998206401371823,
"loss": 5.5348,
"mean_token_accuracy": 0.16946808695793153,
"num_tokens": 4616529.0,
"step": 2510
},
{
"entropy": 5.745693397521973,
"epoch": 0.2100735048446375,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998194497264357,
"loss": 5.5853,
"mean_token_accuracy": 0.16157063841819763,
"num_tokens": 4624545.0,
"step": 2515
},
{
"entropy": 5.682206106185913,
"epoch": 0.21049114600735047,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998182553799538,
"loss": 5.5612,
"mean_token_accuracy": 0.16494014412164687,
"num_tokens": 4633316.0,
"step": 2520
},
{
"entropy": 5.716932487487793,
"epoch": 0.21090878717006348,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998170570977579,
"loss": 5.5239,
"mean_token_accuracy": 0.17361541986465454,
"num_tokens": 4643353.0,
"step": 2525
},
{
"entropy": 5.672225570678711,
"epoch": 0.21132642833277648,
"grad_norm": 0.98828125,
"learning_rate": 0.0004998158548798687,
"loss": 5.6111,
"mean_token_accuracy": 0.15904673039913178,
"num_tokens": 4651998.0,
"step": 2530
},
{
"entropy": 5.804123878479004,
"epoch": 0.21174406949548946,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998146487263074,
"loss": 5.5887,
"mean_token_accuracy": 0.16919029206037522,
"num_tokens": 4659937.0,
"step": 2535
},
{
"entropy": 5.694881916046143,
"epoch": 0.21216171065820247,
"grad_norm": 0.97265625,
"learning_rate": 0.0004998134386370951,
"loss": 5.584,
"mean_token_accuracy": 0.16248628944158555,
"num_tokens": 4669396.0,
"step": 2540
},
{
"entropy": 5.780102729797363,
"epoch": 0.21257935182091547,
"grad_norm": 0.96875,
"learning_rate": 0.0004998122246122529,
"loss": 5.6553,
"mean_token_accuracy": 0.16667612195014953,
"num_tokens": 4679320.0,
"step": 2545
},
{
"entropy": 5.78121657371521,
"epoch": 0.21299699298362845,
"grad_norm": 0.9921875,
"learning_rate": 0.0004998110066518021,
"loss": 5.572,
"mean_token_accuracy": 0.16336911022663117,
"num_tokens": 4688807.0,
"step": 2550
},
{
"entropy": 5.7891148090362545,
"epoch": 0.21341463414634146,
"grad_norm": 1.09375,
"learning_rate": 0.000499809784755764,
"loss": 5.586,
"mean_token_accuracy": 0.1745486855506897,
"num_tokens": 4697819.0,
"step": 2555
},
{
"entropy": 5.657274389266968,
"epoch": 0.21383227530905446,
"grad_norm": 1.0,
"learning_rate": 0.00049980855892416,
"loss": 5.5525,
"mean_token_accuracy": 0.16846721321344377,
"num_tokens": 4706931.0,
"step": 2560
},
{
"entropy": 5.702887630462646,
"epoch": 0.21424991647176747,
"grad_norm": 0.99609375,
"learning_rate": 0.0004998073291570116,
"loss": 5.5458,
"mean_token_accuracy": 0.16121839135885238,
"num_tokens": 4716262.0,
"step": 2565
},
{
"entropy": 5.719077396392822,
"epoch": 0.21466755763448045,
"grad_norm": 0.96875,
"learning_rate": 0.0004998060954543404,
"loss": 5.5625,
"mean_token_accuracy": 0.16510672271251678,
"num_tokens": 4725415.0,
"step": 2570
},
{
"entropy": 5.698775100708008,
"epoch": 0.21508519879719346,
"grad_norm": 1.09375,
"learning_rate": 0.0004998048578161678,
"loss": 5.6218,
"mean_token_accuracy": 0.1652575522661209,
"num_tokens": 4734580.0,
"step": 2575
},
{
"entropy": 5.629653978347778,
"epoch": 0.21550283995990646,
"grad_norm": 1.03125,
"learning_rate": 0.0004998036162425155,
"loss": 5.4384,
"mean_token_accuracy": 0.1736736297607422,
"num_tokens": 4742966.0,
"step": 2580
},
{
"entropy": 5.673403930664063,
"epoch": 0.21592048112261944,
"grad_norm": 1.109375,
"learning_rate": 0.0004998023707334055,
"loss": 5.5845,
"mean_token_accuracy": 0.16784193962812424,
"num_tokens": 4751696.0,
"step": 2585
},
{
"entropy": 5.810158061981201,
"epoch": 0.21633812228533245,
"grad_norm": 1.046875,
"learning_rate": 0.0004998011212888592,
"loss": 5.6367,
"mean_token_accuracy": 0.1684272915124893,
"num_tokens": 4760460.0,
"step": 2590
},
{
"entropy": 5.736129999160767,
"epoch": 0.21675576344804545,
"grad_norm": 0.96484375,
"learning_rate": 0.0004997998679088988,
"loss": 5.5736,
"mean_token_accuracy": 0.16521882116794587,
"num_tokens": 4769004.0,
"step": 2595
},
{
"entropy": 5.699703645706177,
"epoch": 0.21717340461075843,
"grad_norm": 1.0078125,
"learning_rate": 0.0004997986105935461,
"loss": 5.5441,
"mean_token_accuracy": 0.17166536301374435,
"num_tokens": 4777204.0,
"step": 2600
},
{
"entropy": 5.832093715667725,
"epoch": 0.21759104577347144,
"grad_norm": 1.0,
"learning_rate": 0.0004997973493428231,
"loss": 5.68,
"mean_token_accuracy": 0.16324937492609023,
"num_tokens": 4786766.0,
"step": 2605
},
{
"entropy": 5.5970458984375,
"epoch": 0.21800868693618444,
"grad_norm": 1.078125,
"learning_rate": 0.0004997960841567519,
"loss": 5.5624,
"mean_token_accuracy": 0.16770660877227783,
"num_tokens": 4796676.0,
"step": 2610
},
{
"entropy": 5.866506433486938,
"epoch": 0.21842632809889742,
"grad_norm": 1.1015625,
"learning_rate": 0.0004997948150353548,
"loss": 5.5635,
"mean_token_accuracy": 0.16808499097824098,
"num_tokens": 4805514.0,
"step": 2615
},
{
"entropy": 5.711924076080322,
"epoch": 0.21884396926161043,
"grad_norm": 1.03125,
"learning_rate": 0.0004997935419786537,
"loss": 5.6443,
"mean_token_accuracy": 0.1581789255142212,
"num_tokens": 4815487.0,
"step": 2620
},
{
"entropy": 5.754567623138428,
"epoch": 0.21926161042432343,
"grad_norm": 0.9296875,
"learning_rate": 0.0004997922649866712,
"loss": 5.6067,
"mean_token_accuracy": 0.1666237533092499,
"num_tokens": 4825044.0,
"step": 2625
},
{
"entropy": 5.642407846450806,
"epoch": 0.2196792515870364,
"grad_norm": 1.0,
"learning_rate": 0.0004997909840594294,
"loss": 5.396,
"mean_token_accuracy": 0.1773268923163414,
"num_tokens": 4833875.0,
"step": 2630
},
{
"entropy": 5.627975368499756,
"epoch": 0.22009689274974942,
"grad_norm": 0.96875,
"learning_rate": 0.0004997896991969509,
"loss": 5.625,
"mean_token_accuracy": 0.15834506303071977,
"num_tokens": 4843317.0,
"step": 2635
},
{
"entropy": 5.7512366771698,
"epoch": 0.22051453391246242,
"grad_norm": 0.96875,
"learning_rate": 0.0004997884103992581,
"loss": 5.6001,
"mean_token_accuracy": 0.16193510740995407,
"num_tokens": 4852514.0,
"step": 2640
},
{
"entropy": 5.652145338058472,
"epoch": 0.2209321750751754,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997871176663736,
"loss": 5.5531,
"mean_token_accuracy": 0.17478466778993607,
"num_tokens": 4861260.0,
"step": 2645
},
{
"entropy": 5.647412824630737,
"epoch": 0.2213498162378884,
"grad_norm": 1.0625,
"learning_rate": 0.0004997858209983201,
"loss": 5.5174,
"mean_token_accuracy": 0.1661353215575218,
"num_tokens": 4869654.0,
"step": 2650
},
{
"entropy": 5.697892093658448,
"epoch": 0.22176745740060141,
"grad_norm": 0.98046875,
"learning_rate": 0.0004997845203951202,
"loss": 5.5662,
"mean_token_accuracy": 0.15931454449892044,
"num_tokens": 4878311.0,
"step": 2655
},
{
"entropy": 5.775735664367676,
"epoch": 0.2221850985633144,
"grad_norm": 1.125,
"learning_rate": 0.0004997832158567967,
"loss": 5.6336,
"mean_token_accuracy": 0.16189286559820176,
"num_tokens": 4887251.0,
"step": 2660
},
{
"entropy": 5.661660861968994,
"epoch": 0.2226027397260274,
"grad_norm": 0.98046875,
"learning_rate": 0.0004997819073833724,
"loss": 5.5103,
"mean_token_accuracy": 0.16523526906967162,
"num_tokens": 4896528.0,
"step": 2665
},
{
"entropy": 5.6543995380401615,
"epoch": 0.2230203808887404,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997805949748702,
"loss": 5.5511,
"mean_token_accuracy": 0.16553283780813216,
"num_tokens": 4904962.0,
"step": 2670
},
{
"entropy": 5.735087060928345,
"epoch": 0.22343802205145338,
"grad_norm": 0.92578125,
"learning_rate": 0.0004997792786313132,
"loss": 5.5574,
"mean_token_accuracy": 0.16544881463050842,
"num_tokens": 4914735.0,
"step": 2675
},
{
"entropy": 5.543456125259399,
"epoch": 0.2238556632141664,
"grad_norm": 1.03125,
"learning_rate": 0.0004997779583527243,
"loss": 5.441,
"mean_token_accuracy": 0.1624772235751152,
"num_tokens": 4924271.0,
"step": 2680
},
{
"entropy": 5.808428812026977,
"epoch": 0.2242733043768794,
"grad_norm": 1.0703125,
"learning_rate": 0.0004997766341391268,
"loss": 5.671,
"mean_token_accuracy": 0.16082177311182022,
"num_tokens": 4933928.0,
"step": 2685
},
{
"entropy": 5.692340898513794,
"epoch": 0.22469094553959237,
"grad_norm": 1.0546875,
"learning_rate": 0.0004997753059905437,
"loss": 5.3854,
"mean_token_accuracy": 0.17430844008922577,
"num_tokens": 4942714.0,
"step": 2690
},
{
"entropy": 5.564800643920899,
"epoch": 0.22510858670230538,
"grad_norm": 1.1015625,
"learning_rate": 0.0004997739739069981,
"loss": 5.5172,
"mean_token_accuracy": 0.17042783945798873,
"num_tokens": 4952297.0,
"step": 2695
},
{
"entropy": 5.639291620254516,
"epoch": 0.22552622786501839,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997726378885138,
"loss": 5.4558,
"mean_token_accuracy": 0.17526621520519256,
"num_tokens": 4960947.0,
"step": 2700
},
{
"entropy": 5.712133836746216,
"epoch": 0.22594386902773136,
"grad_norm": 1.234375,
"learning_rate": 0.0004997712979351137,
"loss": 5.615,
"mean_token_accuracy": 0.16013166829943656,
"num_tokens": 4969705.0,
"step": 2705
},
{
"entropy": 5.725390529632568,
"epoch": 0.22636151019044437,
"grad_norm": 1.0625,
"learning_rate": 0.0004997699540468216,
"loss": 5.5918,
"mean_token_accuracy": 0.16332891583442688,
"num_tokens": 4979112.0,
"step": 2710
},
{
"entropy": 5.675234031677246,
"epoch": 0.22677915135315738,
"grad_norm": 1.0390625,
"learning_rate": 0.0004997686062236609,
"loss": 5.506,
"mean_token_accuracy": 0.1692604660987854,
"num_tokens": 4987894.0,
"step": 2715
},
{
"entropy": 5.71347975730896,
"epoch": 0.22719679251587035,
"grad_norm": 0.890625,
"learning_rate": 0.0004997672544656553,
"loss": 5.6388,
"mean_token_accuracy": 0.16482105404138564,
"num_tokens": 4997774.0,
"step": 2720
},
{
"entropy": 5.727224731445313,
"epoch": 0.22761443367858336,
"grad_norm": 1.0234375,
"learning_rate": 0.0004997658987728283,
"loss": 5.5714,
"mean_token_accuracy": 0.17016370892524718,
"num_tokens": 5006183.0,
"step": 2725
},
{
"entropy": 5.6868468761444095,
"epoch": 0.22803207484129637,
"grad_norm": 0.9609375,
"learning_rate": 0.0004997645391452035,
"loss": 5.5612,
"mean_token_accuracy": 0.16689683645963668,
"num_tokens": 5016909.0,
"step": 2730
},
{
"entropy": 5.735447740554809,
"epoch": 0.22844971600400935,
"grad_norm": 1.0390625,
"learning_rate": 0.000499763175582805,
"loss": 5.6099,
"mean_token_accuracy": 0.16711424440145492,
"num_tokens": 5027326.0,
"step": 2735
},
{
"entropy": 5.719646978378296,
"epoch": 0.22886735716672235,
"grad_norm": 0.94921875,
"learning_rate": 0.0004997618080856566,
"loss": 5.5495,
"mean_token_accuracy": 0.16903014183044435,
"num_tokens": 5037043.0,
"step": 2740
},
{
"entropy": 5.604584503173828,
"epoch": 0.22928499832943536,
"grad_norm": 1.0078125,
"learning_rate": 0.0004997604366537823,
"loss": 5.5415,
"mean_token_accuracy": 0.1673525631427765,
"num_tokens": 5045992.0,
"step": 2745
},
{
"entropy": 5.626076936721802,
"epoch": 0.22970263949214834,
"grad_norm": 1.015625,
"learning_rate": 0.0004997590612872058,
"loss": 5.5183,
"mean_token_accuracy": 0.1726035326719284,
"num_tokens": 5055568.0,
"step": 2750
},
{
"entropy": 5.741823148727417,
"epoch": 0.23012028065486134,
"grad_norm": 0.83984375,
"learning_rate": 0.0004997576819859515,
"loss": 5.5923,
"mean_token_accuracy": 0.16661985069513321,
"num_tokens": 5065512.0,
"step": 2755
},
{
"entropy": 5.562215900421142,
"epoch": 0.23053792181757435,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997562987500434,
"loss": 5.4391,
"mean_token_accuracy": 0.17851751446723937,
"num_tokens": 5074776.0,
"step": 2760
},
{
"entropy": 5.584406423568725,
"epoch": 0.23095556298028733,
"grad_norm": 0.9765625,
"learning_rate": 0.0004997549115795058,
"loss": 5.5014,
"mean_token_accuracy": 0.17101089656352997,
"num_tokens": 5084743.0,
"step": 2765
},
{
"entropy": 5.762922859191894,
"epoch": 0.23137320414300033,
"grad_norm": 1.03125,
"learning_rate": 0.000499753520474363,
"loss": 5.6616,
"mean_token_accuracy": 0.16293612420558928,
"num_tokens": 5095387.0,
"step": 2770
},
{
"entropy": 5.643383598327636,
"epoch": 0.23179084530571334,
"grad_norm": 1.015625,
"learning_rate": 0.0004997521254346391,
"loss": 5.5731,
"mean_token_accuracy": 0.17110240757465361,
"num_tokens": 5104628.0,
"step": 2775
},
{
"entropy": 5.731733131408691,
"epoch": 0.23220848646842632,
"grad_norm": 0.97265625,
"learning_rate": 0.0004997507264603589,
"loss": 5.5097,
"mean_token_accuracy": 0.17133565843105317,
"num_tokens": 5113169.0,
"step": 2780
},
{
"entropy": 5.664657878875732,
"epoch": 0.23262612763113932,
"grad_norm": 1.0,
"learning_rate": 0.0004997493235515466,
"loss": 5.576,
"mean_token_accuracy": 0.16721148937940597,
"num_tokens": 5122294.0,
"step": 2785
},
{
"entropy": 5.568096113204956,
"epoch": 0.23304376879385233,
"grad_norm": 0.9609375,
"learning_rate": 0.0004997479167082269,
"loss": 5.4109,
"mean_token_accuracy": 0.17732056379318237,
"num_tokens": 5131191.0,
"step": 2790
},
{
"entropy": 5.633753061294556,
"epoch": 0.2334614099565653,
"grad_norm": 1.0078125,
"learning_rate": 0.0004997465059304243,
"loss": 5.6207,
"mean_token_accuracy": 0.16502068489789962,
"num_tokens": 5141974.0,
"step": 2795
},
{
"entropy": 5.777873897552491,
"epoch": 0.23387905111927831,
"grad_norm": 1.0625,
"learning_rate": 0.0004997450912181637,
"loss": 5.5661,
"mean_token_accuracy": 0.16790447533130645,
"num_tokens": 5151412.0,
"step": 2800
},
{
"entropy": 5.601756000518799,
"epoch": 0.23429669228199132,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997436725714696,
"loss": 5.4844,
"mean_token_accuracy": 0.17448533326387405,
"num_tokens": 5160989.0,
"step": 2805
},
{
"entropy": 5.64455623626709,
"epoch": 0.2347143334447043,
"grad_norm": 0.98828125,
"learning_rate": 0.0004997422499903671,
"loss": 5.5539,
"mean_token_accuracy": 0.16700967252254487,
"num_tokens": 5170241.0,
"step": 2810
},
{
"entropy": 5.763780546188355,
"epoch": 0.2351319746074173,
"grad_norm": 0.9921875,
"learning_rate": 0.000499740823474881,
"loss": 5.6783,
"mean_token_accuracy": 0.16039506942033768,
"num_tokens": 5180247.0,
"step": 2815
},
{
"entropy": 5.686127328872681,
"epoch": 0.2355496157701303,
"grad_norm": 1.046875,
"learning_rate": 0.0004997393930250363,
"loss": 5.5622,
"mean_token_accuracy": 0.1688424378633499,
"num_tokens": 5189144.0,
"step": 2820
},
{
"entropy": 5.624299049377441,
"epoch": 0.2359672569328433,
"grad_norm": 0.96484375,
"learning_rate": 0.000499737958640858,
"loss": 5.6187,
"mean_token_accuracy": 0.1643349289894104,
"num_tokens": 5199410.0,
"step": 2825
},
{
"entropy": 5.713594150543213,
"epoch": 0.2363848980955563,
"grad_norm": 0.921875,
"learning_rate": 0.0004997365203223711,
"loss": 5.4866,
"mean_token_accuracy": 0.1714593917131424,
"num_tokens": 5209032.0,
"step": 2830
},
{
"entropy": 5.528335237503052,
"epoch": 0.2368025392582693,
"grad_norm": 1.0078125,
"learning_rate": 0.000499735078069601,
"loss": 5.3834,
"mean_token_accuracy": 0.17411164492368697,
"num_tokens": 5217787.0,
"step": 2835
},
{
"entropy": 5.589128541946411,
"epoch": 0.23722018042098228,
"grad_norm": 1.078125,
"learning_rate": 0.0004997336318825728,
"loss": 5.5084,
"mean_token_accuracy": 0.17099891901016234,
"num_tokens": 5226962.0,
"step": 2840
},
{
"entropy": 5.6476799011230465,
"epoch": 0.23763782158369529,
"grad_norm": 0.97265625,
"learning_rate": 0.0004997321817613119,
"loss": 5.4659,
"mean_token_accuracy": 0.17186253815889357,
"num_tokens": 5236111.0,
"step": 2845
},
{
"entropy": 5.721078395843506,
"epoch": 0.2380554627464083,
"grad_norm": 0.9140625,
"learning_rate": 0.0004997307277058436,
"loss": 5.6169,
"mean_token_accuracy": 0.1622317001223564,
"num_tokens": 5246628.0,
"step": 2850
},
{
"entropy": 5.663838911056518,
"epoch": 0.23847310390912127,
"grad_norm": 0.9921875,
"learning_rate": 0.0004997292697161935,
"loss": 5.5422,
"mean_token_accuracy": 0.16941989213228226,
"num_tokens": 5255543.0,
"step": 2855
},
{
"entropy": 5.553099489212036,
"epoch": 0.23889074507183428,
"grad_norm": 1.015625,
"learning_rate": 0.000499727807792387,
"loss": 5.3969,
"mean_token_accuracy": 0.17895766198635102,
"num_tokens": 5264559.0,
"step": 2860
},
{
"entropy": 5.56001091003418,
"epoch": 0.23930838623454728,
"grad_norm": 0.93359375,
"learning_rate": 0.0004997263419344495,
"loss": 5.4773,
"mean_token_accuracy": 0.1690398707985878,
"num_tokens": 5274599.0,
"step": 2865
},
{
"entropy": 5.5944366455078125,
"epoch": 0.23972602739726026,
"grad_norm": 1.0625,
"learning_rate": 0.0004997248721424071,
"loss": 5.4417,
"mean_token_accuracy": 0.17228546887636184,
"num_tokens": 5283495.0,
"step": 2870
},
{
"entropy": 5.7175524711608885,
"epoch": 0.24014366855997327,
"grad_norm": 1.125,
"learning_rate": 0.0004997233984162853,
"loss": 5.492,
"mean_token_accuracy": 0.1762276753783226,
"num_tokens": 5292064.0,
"step": 2875
},
{
"entropy": 5.618496513366699,
"epoch": 0.24056130972268627,
"grad_norm": 0.9453125,
"learning_rate": 0.0004997219207561099,
"loss": 5.5134,
"mean_token_accuracy": 0.16717917770147322,
"num_tokens": 5301696.0,
"step": 2880
},
{
"entropy": 5.672824716567993,
"epoch": 0.24097895088539925,
"grad_norm": 0.8984375,
"learning_rate": 0.0004997204391619068,
"loss": 5.6309,
"mean_token_accuracy": 0.16025216281414031,
"num_tokens": 5311427.0,
"step": 2885
},
{
"entropy": 5.8007079601287845,
"epoch": 0.24139659204811226,
"grad_norm": 0.96484375,
"learning_rate": 0.0004997189536337018,
"loss": 5.5449,
"mean_token_accuracy": 0.1670021340250969,
"num_tokens": 5321406.0,
"step": 2890
},
{
"entropy": 5.68375244140625,
"epoch": 0.24181423321082526,
"grad_norm": 1.125,
"learning_rate": 0.0004997174641715211,
"loss": 5.6241,
"mean_token_accuracy": 0.16562104225158691,
"num_tokens": 5332257.0,
"step": 2895
},
{
"entropy": 5.524214267730713,
"epoch": 0.24223187437353827,
"grad_norm": 0.95703125,
"learning_rate": 0.0004997159707753906,
"loss": 5.3649,
"mean_token_accuracy": 0.1770200565457344,
"num_tokens": 5341857.0,
"step": 2900
},
{
"entropy": 5.61238694190979,
"epoch": 0.24264951553625125,
"grad_norm": 0.97265625,
"learning_rate": 0.0004997144734453367,
"loss": 5.5135,
"mean_token_accuracy": 0.17293385416269302,
"num_tokens": 5351367.0,
"step": 2905
},
{
"entropy": 5.561303424835205,
"epoch": 0.24306715669896425,
"grad_norm": 1.0078125,
"learning_rate": 0.0004997129721813853,
"loss": 5.3682,
"mean_token_accuracy": 0.17672393321990967,
"num_tokens": 5360627.0,
"step": 2910
},
{
"entropy": 5.612178468704224,
"epoch": 0.24348479786167726,
"grad_norm": 1.0625,
"learning_rate": 0.0004997114669835629,
"loss": 5.4527,
"mean_token_accuracy": 0.18178218305110933,
"num_tokens": 5369703.0,
"step": 2915
},
{
"entropy": 5.626357889175415,
"epoch": 0.24390243902439024,
"grad_norm": 1.15625,
"learning_rate": 0.0004997099578518959,
"loss": 5.5219,
"mean_token_accuracy": 0.16822381019592286,
"num_tokens": 5378432.0,
"step": 2920
},
{
"entropy": 5.549802303314209,
"epoch": 0.24432008018710324,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997084447864105,
"loss": 5.3753,
"mean_token_accuracy": 0.1717028349637985,
"num_tokens": 5386489.0,
"step": 2925
},
{
"entropy": 5.731553316116333,
"epoch": 0.24473772134981625,
"grad_norm": 1.015625,
"learning_rate": 0.0004997069277871333,
"loss": 5.5927,
"mean_token_accuracy": 0.16572516411542892,
"num_tokens": 5395908.0,
"step": 2930
},
{
"entropy": 5.730947780609131,
"epoch": 0.24515536251252923,
"grad_norm": 1.03125,
"learning_rate": 0.0004997054068540908,
"loss": 5.5232,
"mean_token_accuracy": 0.17338006645441056,
"num_tokens": 5404822.0,
"step": 2935
},
{
"entropy": 5.546732187271118,
"epoch": 0.24557300367524224,
"grad_norm": 0.94921875,
"learning_rate": 0.0004997038819873098,
"loss": 5.4271,
"mean_token_accuracy": 0.1758014366030693,
"num_tokens": 5413980.0,
"step": 2940
},
{
"entropy": 5.5830179214477536,
"epoch": 0.24599064483795524,
"grad_norm": 0.98828125,
"learning_rate": 0.0004997023531868167,
"loss": 5.4993,
"mean_token_accuracy": 0.1676984280347824,
"num_tokens": 5423538.0,
"step": 2945
},
{
"entropy": 5.577688503265381,
"epoch": 0.24640828600066822,
"grad_norm": 1.0078125,
"learning_rate": 0.0004997008204526386,
"loss": 5.4356,
"mean_token_accuracy": 0.17327087819576265,
"num_tokens": 5431930.0,
"step": 2950
},
{
"entropy": 5.603110074996948,
"epoch": 0.24682592716338123,
"grad_norm": 0.94140625,
"learning_rate": 0.0004996992837848021,
"loss": 5.4261,
"mean_token_accuracy": 0.1806345522403717,
"num_tokens": 5440721.0,
"step": 2955
},
{
"entropy": 5.566134643554688,
"epoch": 0.24724356832609423,
"grad_norm": 1.09375,
"learning_rate": 0.0004996977431833342,
"loss": 5.4975,
"mean_token_accuracy": 0.1686984345316887,
"num_tokens": 5449617.0,
"step": 2960
},
{
"entropy": 5.592004728317261,
"epoch": 0.2476612094888072,
"grad_norm": 1.015625,
"learning_rate": 0.0004996961986482618,
"loss": 5.5288,
"mean_token_accuracy": 0.16898861825466155,
"num_tokens": 5458827.0,
"step": 2965
},
{
"entropy": 5.65282416343689,
"epoch": 0.24807885065152022,
"grad_norm": 1.078125,
"learning_rate": 0.0004996946501796119,
"loss": 5.4183,
"mean_token_accuracy": 0.1748599410057068,
"num_tokens": 5467348.0,
"step": 2970
},
{
"entropy": 5.639726400375366,
"epoch": 0.24849649181423322,
"grad_norm": 1.0,
"learning_rate": 0.0004996930977774118,
"loss": 5.485,
"mean_token_accuracy": 0.16322759091854094,
"num_tokens": 5476645.0,
"step": 2975
},
{
"entropy": 5.68959789276123,
"epoch": 0.2489141329769462,
"grad_norm": 0.953125,
"learning_rate": 0.0004996915414416885,
"loss": 5.5282,
"mean_token_accuracy": 0.16389098167419433,
"num_tokens": 5486120.0,
"step": 2980
},
{
"entropy": 5.6930344581604,
"epoch": 0.2493317741396592,
"grad_norm": 1.0546875,
"learning_rate": 0.0004996899811724693,
"loss": 5.5118,
"mean_token_accuracy": 0.1725097730755806,
"num_tokens": 5495313.0,
"step": 2985
},
{
"entropy": 5.617242097854614,
"epoch": 0.2497494153023722,
"grad_norm": 0.984375,
"learning_rate": 0.0004996884169697816,
"loss": 5.5018,
"mean_token_accuracy": 0.16844751238822936,
"num_tokens": 5504587.0,
"step": 2990
},
{
"entropy": 5.582669925689697,
"epoch": 0.2501670564650852,
"grad_norm": 0.90625,
"learning_rate": 0.0004996868488336526,
"loss": 5.5258,
"mean_token_accuracy": 0.17021068334579467,
"num_tokens": 5514188.0,
"step": 2995
},
{
"entropy": 5.647515344619751,
"epoch": 0.25058469762779817,
"grad_norm": 1.0390625,
"learning_rate": 0.0004996852767641099,
"loss": 5.5618,
"mean_token_accuracy": 0.16375300735235215,
"num_tokens": 5524075.0,
"step": 3000
},
{
"epoch": 0.25058469762779817,
"eval_entropy": 5.439305083677441,
"eval_loss": 5.4750590324401855,
"eval_mean_token_accuracy": 0.1805651797318239,
"eval_num_tokens": 5524075.0,
"eval_runtime": 20.8359,
"eval_samples_per_second": 1812.405,
"eval_steps_per_second": 226.581,
"step": 3000
}
],
"logging_steps": 5,
"max_steps": 119720,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1208069049876480.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}