Files

7035 lines
191 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.18002726127099247,
"eval_steps": 500,
"global_step": 3500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.691593360900878,
"epoch": 0.0002571818018157035,
"grad_norm": 13.5625,
"learning_rate": 2e-06,
"loss": 10.761,
"mean_token_accuracy": 0.00011363636003807187,
"num_tokens": 8373.0,
"step": 5
},
{
"entropy": 10.691572093963623,
"epoch": 0.000514363603631407,
"grad_norm": 12.375,
"learning_rate": 4.5e-06,
"loss": 10.7039,
"mean_token_accuracy": 0.0,
"num_tokens": 17090.0,
"step": 10
},
{
"entropy": 10.691090297698974,
"epoch": 0.0007715454054471106,
"grad_norm": 9.875,
"learning_rate": 7e-06,
"loss": 10.5011,
"mean_token_accuracy": 0.018853903049603105,
"num_tokens": 26219.0,
"step": 15
},
{
"entropy": 10.680709075927734,
"epoch": 0.001028727207262814,
"grad_norm": 6.03125,
"learning_rate": 9.5e-06,
"loss": 10.2462,
"mean_token_accuracy": 0.04484990499913692,
"num_tokens": 36191.0,
"step": 20
},
{
"entropy": 10.582563495635986,
"epoch": 0.0012859090090785177,
"grad_norm": 3.9375,
"learning_rate": 1.2e-05,
"loss": 9.9749,
"mean_token_accuracy": 0.040961484611034396,
"num_tokens": 45318.0,
"step": 25
},
{
"entropy": 10.534116744995117,
"epoch": 0.0015430908108942211,
"grad_norm": 3.703125,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.8021,
"mean_token_accuracy": 0.04536043591797352,
"num_tokens": 53102.0,
"step": 30
},
{
"entropy": 10.562399864196777,
"epoch": 0.0018002726127099246,
"grad_norm": 2.984375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.7539,
"mean_token_accuracy": 0.042898242548108104,
"num_tokens": 61808.0,
"step": 35
},
{
"entropy": 10.547216129302978,
"epoch": 0.002057454414525628,
"grad_norm": 2.8125,
"learning_rate": 1.95e-05,
"loss": 9.7136,
"mean_token_accuracy": 0.044699297100305554,
"num_tokens": 70708.0,
"step": 40
},
{
"entropy": 10.517444515228272,
"epoch": 0.0023146362163413317,
"grad_norm": 2.5,
"learning_rate": 2.2e-05,
"loss": 9.632,
"mean_token_accuracy": 0.04661537855863571,
"num_tokens": 79541.0,
"step": 45
},
{
"entropy": 10.505586051940918,
"epoch": 0.0025718180181570354,
"grad_norm": 2.40625,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5459,
"mean_token_accuracy": 0.05164888352155685,
"num_tokens": 87073.0,
"step": 50
},
{
"entropy": 10.474337196350097,
"epoch": 0.0028289998199727386,
"grad_norm": 2.25,
"learning_rate": 2.7e-05,
"loss": 9.5486,
"mean_token_accuracy": 0.059509020671248435,
"num_tokens": 96581.0,
"step": 55
},
{
"entropy": 10.405019569396973,
"epoch": 0.0030861816217884423,
"grad_norm": 2.359375,
"learning_rate": 2.95e-05,
"loss": 9.4782,
"mean_token_accuracy": 0.060714465007185935,
"num_tokens": 105741.0,
"step": 60
},
{
"entropy": 10.288742446899414,
"epoch": 0.003343363423604146,
"grad_norm": 2.125,
"learning_rate": 3.2e-05,
"loss": 9.385,
"mean_token_accuracy": 0.061338124051690104,
"num_tokens": 114609.0,
"step": 65
},
{
"entropy": 10.352596855163574,
"epoch": 0.003600545225419849,
"grad_norm": 2.125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.35,
"mean_token_accuracy": 0.05903933756053448,
"num_tokens": 123922.0,
"step": 70
},
{
"entropy": 10.332678699493409,
"epoch": 0.003857727027235553,
"grad_norm": 2.125,
"learning_rate": 3.7e-05,
"loss": 9.2218,
"mean_token_accuracy": 0.06484894305467606,
"num_tokens": 133213.0,
"step": 75
},
{
"entropy": 10.27952938079834,
"epoch": 0.004114908829051256,
"grad_norm": 1.96875,
"learning_rate": 3.95e-05,
"loss": 9.1737,
"mean_token_accuracy": 0.06273005269467831,
"num_tokens": 141582.0,
"step": 80
},
{
"entropy": 10.254050540924073,
"epoch": 0.00437209063086696,
"grad_norm": 2.0625,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.9925,
"mean_token_accuracy": 0.06865651868283748,
"num_tokens": 149709.0,
"step": 85
},
{
"entropy": 10.210903453826905,
"epoch": 0.004629272432682663,
"grad_norm": 1.8203125,
"learning_rate": 4.45e-05,
"loss": 8.856,
"mean_token_accuracy": 0.07082752697169781,
"num_tokens": 158239.0,
"step": 90
},
{
"entropy": 10.24482765197754,
"epoch": 0.004886454234498367,
"grad_norm": 1.7578125,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.9023,
"mean_token_accuracy": 0.0604440800845623,
"num_tokens": 168046.0,
"step": 95
},
{
"entropy": 10.135429000854492,
"epoch": 0.005143636036314071,
"grad_norm": 1.53125,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.8077,
"mean_token_accuracy": 0.06280115209519863,
"num_tokens": 177797.0,
"step": 100
},
{
"entropy": 10.110702419281006,
"epoch": 0.0054008178381297735,
"grad_norm": 1.796875,
"learning_rate": 5.2e-05,
"loss": 8.6609,
"mean_token_accuracy": 0.06286422722041607,
"num_tokens": 186664.0,
"step": 105
},
{
"entropy": 10.024668121337891,
"epoch": 0.005657999639945477,
"grad_norm": 1.5546875,
"learning_rate": 5.45e-05,
"loss": 8.5449,
"mean_token_accuracy": 0.06326077207922935,
"num_tokens": 195404.0,
"step": 110
},
{
"entropy": 9.922544002532959,
"epoch": 0.005915181441761181,
"grad_norm": 1.5546875,
"learning_rate": 5.7e-05,
"loss": 8.4327,
"mean_token_accuracy": 0.06552885584533215,
"num_tokens": 204248.0,
"step": 115
},
{
"entropy": 9.780591869354248,
"epoch": 0.0061723632435768845,
"grad_norm": 1.515625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.2869,
"mean_token_accuracy": 0.060110585764050484,
"num_tokens": 214042.0,
"step": 120
},
{
"entropy": 9.649379444122314,
"epoch": 0.006429545045392588,
"grad_norm": 1.390625,
"learning_rate": 6.2e-05,
"loss": 8.189,
"mean_token_accuracy": 0.06577248759567737,
"num_tokens": 223194.0,
"step": 125
},
{
"entropy": 9.431284046173095,
"epoch": 0.006686726847208292,
"grad_norm": 1.484375,
"learning_rate": 6.450000000000001e-05,
"loss": 7.9307,
"mean_token_accuracy": 0.07218964248895646,
"num_tokens": 230929.0,
"step": 130
},
{
"entropy": 9.260346984863281,
"epoch": 0.006943908649023995,
"grad_norm": 1.734375,
"learning_rate": 6.7e-05,
"loss": 7.9081,
"mean_token_accuracy": 0.07038265988230705,
"num_tokens": 238687.0,
"step": 135
},
{
"entropy": 9.035238265991211,
"epoch": 0.007201090450839698,
"grad_norm": 1.4921875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.8152,
"mean_token_accuracy": 0.07054561264812946,
"num_tokens": 247397.0,
"step": 140
},
{
"entropy": 8.894649696350097,
"epoch": 0.007458272252655402,
"grad_norm": 1.4453125,
"learning_rate": 7.2e-05,
"loss": 7.7444,
"mean_token_accuracy": 0.07246604040265084,
"num_tokens": 255924.0,
"step": 145
},
{
"entropy": 8.742353820800782,
"epoch": 0.007715454054471106,
"grad_norm": 1.2890625,
"learning_rate": 7.45e-05,
"loss": 7.6781,
"mean_token_accuracy": 0.06747029088437557,
"num_tokens": 264767.0,
"step": 150
},
{
"entropy": 8.636024761199952,
"epoch": 0.00797263585628681,
"grad_norm": 1.1640625,
"learning_rate": 7.7e-05,
"loss": 7.6787,
"mean_token_accuracy": 0.07033539973199368,
"num_tokens": 274250.0,
"step": 155
},
{
"entropy": 8.433564472198487,
"epoch": 0.008229817658102512,
"grad_norm": 1.3828125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.5648,
"mean_token_accuracy": 0.07707317210733891,
"num_tokens": 282568.0,
"step": 160
},
{
"entropy": 8.366222667694093,
"epoch": 0.008486999459918217,
"grad_norm": 1.3671875,
"learning_rate": 8.2e-05,
"loss": 7.5969,
"mean_token_accuracy": 0.06956044659018516,
"num_tokens": 291126.0,
"step": 165
},
{
"entropy": 8.285852527618408,
"epoch": 0.00874418126173392,
"grad_norm": 1.1953125,
"learning_rate": 8.450000000000001e-05,
"loss": 7.5209,
"mean_token_accuracy": 0.07576571702957154,
"num_tokens": 299751.0,
"step": 170
},
{
"entropy": 8.235202884674072,
"epoch": 0.009001363063549624,
"grad_norm": 1.2734375,
"learning_rate": 8.7e-05,
"loss": 7.5119,
"mean_token_accuracy": 0.07470664568245411,
"num_tokens": 309560.0,
"step": 175
},
{
"entropy": 8.157529830932617,
"epoch": 0.009258544865365327,
"grad_norm": 1.296875,
"learning_rate": 8.95e-05,
"loss": 7.4928,
"mean_token_accuracy": 0.06981925927102565,
"num_tokens": 318613.0,
"step": 180
},
{
"entropy": 8.12168264389038,
"epoch": 0.00951572666718103,
"grad_norm": 1.328125,
"learning_rate": 9.2e-05,
"loss": 7.551,
"mean_token_accuracy": 0.07186717689037322,
"num_tokens": 327650.0,
"step": 185
},
{
"entropy": 8.121650791168213,
"epoch": 0.009772908468996734,
"grad_norm": 1.125,
"learning_rate": 9.45e-05,
"loss": 7.4394,
"mean_token_accuracy": 0.07240154445171357,
"num_tokens": 337198.0,
"step": 190
},
{
"entropy": 8.03664698600769,
"epoch": 0.010030090270812437,
"grad_norm": 1.34375,
"learning_rate": 9.7e-05,
"loss": 7.5301,
"mean_token_accuracy": 0.07011710181832313,
"num_tokens": 346179.0,
"step": 195
},
{
"entropy": 8.069316053390503,
"epoch": 0.010287272072628141,
"grad_norm": 1.6875,
"learning_rate": 9.95e-05,
"loss": 7.4276,
"mean_token_accuracy": 0.07499495595693588,
"num_tokens": 355972.0,
"step": 200
},
{
"entropy": 7.968952226638794,
"epoch": 0.010544453874443844,
"grad_norm": 1.4375,
"learning_rate": 0.000102,
"loss": 7.3626,
"mean_token_accuracy": 0.077250687032938,
"num_tokens": 364635.0,
"step": 205
},
{
"entropy": 7.948678016662598,
"epoch": 0.010801635676259547,
"grad_norm": 1.328125,
"learning_rate": 0.00010449999999999999,
"loss": 7.5125,
"mean_token_accuracy": 0.07722728103399276,
"num_tokens": 374161.0,
"step": 210
},
{
"entropy": 7.955185747146606,
"epoch": 0.011058817478075252,
"grad_norm": 1.1875,
"learning_rate": 0.000107,
"loss": 7.3673,
"mean_token_accuracy": 0.0733168862760067,
"num_tokens": 383641.0,
"step": 215
},
{
"entropy": 7.921580362319946,
"epoch": 0.011315999279890954,
"grad_norm": 1.3515625,
"learning_rate": 0.0001095,
"loss": 7.3171,
"mean_token_accuracy": 0.0784445971250534,
"num_tokens": 392300.0,
"step": 220
},
{
"entropy": 7.939724063873291,
"epoch": 0.011573181081706659,
"grad_norm": 1.3125,
"learning_rate": 0.000112,
"loss": 7.3486,
"mean_token_accuracy": 0.07721329033374787,
"num_tokens": 400721.0,
"step": 225
},
{
"entropy": 7.914973640441895,
"epoch": 0.011830362883522362,
"grad_norm": 1.265625,
"learning_rate": 0.0001145,
"loss": 7.3563,
"mean_token_accuracy": 0.08054085932672024,
"num_tokens": 410261.0,
"step": 230
},
{
"entropy": 7.840137624740601,
"epoch": 0.012087544685338066,
"grad_norm": 1.296875,
"learning_rate": 0.00011700000000000001,
"loss": 7.2993,
"mean_token_accuracy": 0.08381507098674774,
"num_tokens": 419006.0,
"step": 235
},
{
"entropy": 7.865709638595581,
"epoch": 0.012344726487153769,
"grad_norm": 1.1953125,
"learning_rate": 0.00011949999999999999,
"loss": 7.3679,
"mean_token_accuracy": 0.07533743120729923,
"num_tokens": 428773.0,
"step": 240
},
{
"entropy": 7.8893204689025875,
"epoch": 0.012601908288969472,
"grad_norm": 1.5390625,
"learning_rate": 0.000122,
"loss": 7.2843,
"mean_token_accuracy": 0.08408410698175431,
"num_tokens": 438111.0,
"step": 245
},
{
"entropy": 7.718148136138916,
"epoch": 0.012859090090785176,
"grad_norm": 1.3046875,
"learning_rate": 0.0001245,
"loss": 7.2826,
"mean_token_accuracy": 0.07801055312156677,
"num_tokens": 447352.0,
"step": 250
},
{
"entropy": 7.834936952590942,
"epoch": 0.01311627189260088,
"grad_norm": 1.2421875,
"learning_rate": 0.000127,
"loss": 7.2718,
"mean_token_accuracy": 0.08380828946828842,
"num_tokens": 456118.0,
"step": 255
},
{
"entropy": 7.78115496635437,
"epoch": 0.013373453694416584,
"grad_norm": 1.3359375,
"learning_rate": 0.0001295,
"loss": 7.3091,
"mean_token_accuracy": 0.0782765805721283,
"num_tokens": 465016.0,
"step": 260
},
{
"entropy": 7.746971464157104,
"epoch": 0.013630635496232286,
"grad_norm": 1.234375,
"learning_rate": 0.000132,
"loss": 7.2129,
"mean_token_accuracy": 0.0813664972782135,
"num_tokens": 473828.0,
"step": 265
},
{
"entropy": 7.73144416809082,
"epoch": 0.01388781729804799,
"grad_norm": 1.125,
"learning_rate": 0.00013450000000000002,
"loss": 7.1867,
"mean_token_accuracy": 0.08951399773359299,
"num_tokens": 482481.0,
"step": 270
},
{
"entropy": 7.821958923339844,
"epoch": 0.014144999099863694,
"grad_norm": 1.34375,
"learning_rate": 0.00013700000000000002,
"loss": 7.2565,
"mean_token_accuracy": 0.08631709441542626,
"num_tokens": 491784.0,
"step": 275
},
{
"entropy": 7.713495445251465,
"epoch": 0.014402180901679397,
"grad_norm": 1.421875,
"learning_rate": 0.0001395,
"loss": 7.3491,
"mean_token_accuracy": 0.0803300604224205,
"num_tokens": 501227.0,
"step": 280
},
{
"entropy": 7.609055280685425,
"epoch": 0.014659362703495101,
"grad_norm": 1.6640625,
"learning_rate": 0.00014199999999999998,
"loss": 7.1247,
"mean_token_accuracy": 0.0826262541115284,
"num_tokens": 509566.0,
"step": 285
},
{
"entropy": 7.692761611938477,
"epoch": 0.014916544505310804,
"grad_norm": 1.3984375,
"learning_rate": 0.0001445,
"loss": 7.1787,
"mean_token_accuracy": 0.09211432188749313,
"num_tokens": 517517.0,
"step": 290
},
{
"entropy": 7.6960266590118405,
"epoch": 0.015173726307126508,
"grad_norm": 1.21875,
"learning_rate": 0.000147,
"loss": 7.2176,
"mean_token_accuracy": 0.0820289522409439,
"num_tokens": 526279.0,
"step": 295
},
{
"entropy": 7.665759134292602,
"epoch": 0.015430908108942211,
"grad_norm": 1.171875,
"learning_rate": 0.0001495,
"loss": 7.1406,
"mean_token_accuracy": 0.0928925946354866,
"num_tokens": 534516.0,
"step": 300
},
{
"entropy": 7.661193418502807,
"epoch": 0.015688089910757916,
"grad_norm": 1.3671875,
"learning_rate": 0.000152,
"loss": 7.2216,
"mean_token_accuracy": 0.08248281478881836,
"num_tokens": 543828.0,
"step": 305
},
{
"entropy": 7.662406015396118,
"epoch": 0.01594527171257362,
"grad_norm": 1.2734375,
"learning_rate": 0.00015450000000000001,
"loss": 7.1559,
"mean_token_accuracy": 0.08263281881809234,
"num_tokens": 552530.0,
"step": 310
},
{
"entropy": 7.536833572387695,
"epoch": 0.01620245351438932,
"grad_norm": 1.359375,
"learning_rate": 0.000157,
"loss": 7.1062,
"mean_token_accuracy": 0.08527780249714852,
"num_tokens": 561475.0,
"step": 315
},
{
"entropy": 7.684497308731079,
"epoch": 0.016459635316205024,
"grad_norm": 1.4609375,
"learning_rate": 0.0001595,
"loss": 7.1742,
"mean_token_accuracy": 0.08275718316435814,
"num_tokens": 569852.0,
"step": 320
},
{
"entropy": 7.586278247833252,
"epoch": 0.01671681711802073,
"grad_norm": 1.203125,
"learning_rate": 0.000162,
"loss": 7.2073,
"mean_token_accuracy": 0.08587946742773056,
"num_tokens": 578326.0,
"step": 325
},
{
"entropy": 7.664967060089111,
"epoch": 0.016973998919836433,
"grad_norm": 1.1484375,
"learning_rate": 0.00016450000000000001,
"loss": 7.238,
"mean_token_accuracy": 0.08378956839442253,
"num_tokens": 587606.0,
"step": 330
},
{
"entropy": 7.510732364654541,
"epoch": 0.017231180721652136,
"grad_norm": 1.3828125,
"learning_rate": 0.00016700000000000002,
"loss": 6.9636,
"mean_token_accuracy": 0.09541863054037095,
"num_tokens": 595321.0,
"step": 335
},
{
"entropy": 7.525554895401001,
"epoch": 0.01748836252346784,
"grad_norm": 1.1875,
"learning_rate": 0.00016950000000000003,
"loss": 7.0757,
"mean_token_accuracy": 0.08646541684865952,
"num_tokens": 603836.0,
"step": 340
},
{
"entropy": 7.485527229309082,
"epoch": 0.01774554432528354,
"grad_norm": 1.359375,
"learning_rate": 0.00017199999999999998,
"loss": 7.0746,
"mean_token_accuracy": 0.08882175087928772,
"num_tokens": 612847.0,
"step": 345
},
{
"entropy": 7.5213652610778805,
"epoch": 0.018002726127099248,
"grad_norm": 1.2734375,
"learning_rate": 0.00017449999999999999,
"loss": 7.1177,
"mean_token_accuracy": 0.08585901409387589,
"num_tokens": 620840.0,
"step": 350
},
{
"entropy": 7.538561153411865,
"epoch": 0.01825990792891495,
"grad_norm": 1.4140625,
"learning_rate": 0.000177,
"loss": 7.0237,
"mean_token_accuracy": 0.09108547568321228,
"num_tokens": 629495.0,
"step": 355
},
{
"entropy": 7.50935378074646,
"epoch": 0.018517089730730654,
"grad_norm": 1.203125,
"learning_rate": 0.0001795,
"loss": 7.1784,
"mean_token_accuracy": 0.08739718049764633,
"num_tokens": 638589.0,
"step": 360
},
{
"entropy": 7.4144041538238525,
"epoch": 0.018774271532546356,
"grad_norm": 1.2890625,
"learning_rate": 0.000182,
"loss": 7.05,
"mean_token_accuracy": 0.08531938642263412,
"num_tokens": 647713.0,
"step": 365
},
{
"entropy": 7.665746688842773,
"epoch": 0.01903145333436206,
"grad_norm": 1.40625,
"learning_rate": 0.0001845,
"loss": 7.1511,
"mean_token_accuracy": 0.08770897537469864,
"num_tokens": 656472.0,
"step": 370
},
{
"entropy": 7.371031093597412,
"epoch": 0.019288635136177765,
"grad_norm": 1.5625,
"learning_rate": 0.000187,
"loss": 7.0004,
"mean_token_accuracy": 0.09101735278964043,
"num_tokens": 664858.0,
"step": 375
},
{
"entropy": 7.439912271499634,
"epoch": 0.019545816937993468,
"grad_norm": 1.1796875,
"learning_rate": 0.0001895,
"loss": 7.0322,
"mean_token_accuracy": 0.09086323380470276,
"num_tokens": 673675.0,
"step": 380
},
{
"entropy": 7.4977442741394045,
"epoch": 0.01980299873980917,
"grad_norm": 1.3046875,
"learning_rate": 0.000192,
"loss": 7.1526,
"mean_token_accuracy": 0.0906866118311882,
"num_tokens": 681968.0,
"step": 385
},
{
"entropy": 7.431271123886108,
"epoch": 0.020060180541624874,
"grad_norm": 1.1640625,
"learning_rate": 0.0001945,
"loss": 7.0089,
"mean_token_accuracy": 0.09397086799144745,
"num_tokens": 690447.0,
"step": 390
},
{
"entropy": 7.5096940994262695,
"epoch": 0.020317362343440577,
"grad_norm": 1.1953125,
"learning_rate": 0.00019700000000000002,
"loss": 7.0298,
"mean_token_accuracy": 0.09151682630181313,
"num_tokens": 699659.0,
"step": 395
},
{
"entropy": 7.40989465713501,
"epoch": 0.020574544145256283,
"grad_norm": 1.4921875,
"learning_rate": 0.00019950000000000002,
"loss": 7.0506,
"mean_token_accuracy": 0.09182499945163727,
"num_tokens": 708342.0,
"step": 400
},
{
"entropy": 7.437063407897949,
"epoch": 0.020831725947071986,
"grad_norm": 1.2421875,
"learning_rate": 0.000202,
"loss": 7.0589,
"mean_token_accuracy": 0.08685924187302589,
"num_tokens": 717986.0,
"step": 405
},
{
"entropy": 7.506326389312744,
"epoch": 0.02108890774888769,
"grad_norm": 1.1875,
"learning_rate": 0.00020449999999999998,
"loss": 7.0868,
"mean_token_accuracy": 0.08464771658182144,
"num_tokens": 727397.0,
"step": 410
},
{
"entropy": 7.389501142501831,
"epoch": 0.02134608955070339,
"grad_norm": 1.109375,
"learning_rate": 0.000207,
"loss": 7.0421,
"mean_token_accuracy": 0.09134713932871819,
"num_tokens": 736291.0,
"step": 415
},
{
"entropy": 7.398612976074219,
"epoch": 0.021603271352519094,
"grad_norm": 1.3046875,
"learning_rate": 0.0002095,
"loss": 7.0983,
"mean_token_accuracy": 0.08749841973185539,
"num_tokens": 745132.0,
"step": 420
},
{
"entropy": 7.387109804153442,
"epoch": 0.0218604531543348,
"grad_norm": 1.359375,
"learning_rate": 0.000212,
"loss": 6.9801,
"mean_token_accuracy": 0.09526508301496506,
"num_tokens": 753535.0,
"step": 425
},
{
"entropy": 7.287825727462769,
"epoch": 0.022117634956150503,
"grad_norm": 1.34375,
"learning_rate": 0.0002145,
"loss": 6.8881,
"mean_token_accuracy": 0.09665613695979118,
"num_tokens": 762626.0,
"step": 430
},
{
"entropy": 7.425317716598511,
"epoch": 0.022374816757966206,
"grad_norm": 1.265625,
"learning_rate": 0.00021700000000000002,
"loss": 7.0183,
"mean_token_accuracy": 0.08952494263648987,
"num_tokens": 771802.0,
"step": 435
},
{
"entropy": 7.3904194831848145,
"epoch": 0.02263199855978191,
"grad_norm": 1.109375,
"learning_rate": 0.0002195,
"loss": 7.055,
"mean_token_accuracy": 0.09687120616436004,
"num_tokens": 780444.0,
"step": 440
},
{
"entropy": 7.46030330657959,
"epoch": 0.022889180361597615,
"grad_norm": 1.28125,
"learning_rate": 0.000222,
"loss": 7.0891,
"mean_token_accuracy": 0.08583850935101509,
"num_tokens": 789335.0,
"step": 445
},
{
"entropy": 7.254354047775268,
"epoch": 0.023146362163413318,
"grad_norm": 1.3828125,
"learning_rate": 0.0002245,
"loss": 6.9291,
"mean_token_accuracy": 0.09709356278181076,
"num_tokens": 797891.0,
"step": 450
},
{
"entropy": 7.221427774429321,
"epoch": 0.02340354396522902,
"grad_norm": 1.328125,
"learning_rate": 0.00022700000000000002,
"loss": 6.9026,
"mean_token_accuracy": 0.09430735632777214,
"num_tokens": 806238.0,
"step": 455
},
{
"entropy": 7.3990577220916744,
"epoch": 0.023660725767044723,
"grad_norm": 1.4765625,
"learning_rate": 0.00022950000000000002,
"loss": 6.9081,
"mean_token_accuracy": 0.09148178026080131,
"num_tokens": 814430.0,
"step": 460
},
{
"entropy": 7.347194242477417,
"epoch": 0.023917907568860426,
"grad_norm": 1.140625,
"learning_rate": 0.00023200000000000003,
"loss": 7.0802,
"mean_token_accuracy": 0.08918680474162102,
"num_tokens": 823546.0,
"step": 465
},
{
"entropy": 7.322706604003907,
"epoch": 0.024175089370676132,
"grad_norm": 1.3203125,
"learning_rate": 0.00023449999999999998,
"loss": 6.8709,
"mean_token_accuracy": 0.0952567420899868,
"num_tokens": 832885.0,
"step": 470
},
{
"entropy": 7.260769939422607,
"epoch": 0.024432271172491835,
"grad_norm": 1.171875,
"learning_rate": 0.000237,
"loss": 6.8382,
"mean_token_accuracy": 0.09813853800296783,
"num_tokens": 841140.0,
"step": 475
},
{
"entropy": 7.244242477416992,
"epoch": 0.024689452974307538,
"grad_norm": 1.5703125,
"learning_rate": 0.0002395,
"loss": 6.9147,
"mean_token_accuracy": 0.09300818815827369,
"num_tokens": 849768.0,
"step": 480
},
{
"entropy": 7.25398006439209,
"epoch": 0.02494663477612324,
"grad_norm": 1.09375,
"learning_rate": 0.000242,
"loss": 6.8165,
"mean_token_accuracy": 0.09476587101817131,
"num_tokens": 859080.0,
"step": 485
},
{
"entropy": 7.220676612854004,
"epoch": 0.025203816577938944,
"grad_norm": 1.1328125,
"learning_rate": 0.0002445,
"loss": 6.9026,
"mean_token_accuracy": 0.0947590596973896,
"num_tokens": 868624.0,
"step": 490
},
{
"entropy": 7.27272310256958,
"epoch": 0.02546099837975465,
"grad_norm": 1.15625,
"learning_rate": 0.000247,
"loss": 6.893,
"mean_token_accuracy": 0.09338614419102668,
"num_tokens": 877592.0,
"step": 495
},
{
"entropy": 7.275995779037475,
"epoch": 0.025718180181570353,
"grad_norm": 1.2578125,
"learning_rate": 0.0002495,
"loss": 6.8668,
"mean_token_accuracy": 0.09461153075098991,
"num_tokens": 886470.0,
"step": 500
},
{
"entropy": 7.182675886154175,
"epoch": 0.025975361983386056,
"grad_norm": 1.203125,
"learning_rate": 0.000252,
"loss": 6.9033,
"mean_token_accuracy": 0.09226062297821044,
"num_tokens": 895940.0,
"step": 505
},
{
"entropy": 7.2134950160980225,
"epoch": 0.02623254378520176,
"grad_norm": 1.1328125,
"learning_rate": 0.0002545,
"loss": 6.9523,
"mean_token_accuracy": 0.09598998427391052,
"num_tokens": 905344.0,
"step": 510
},
{
"entropy": 7.144832706451416,
"epoch": 0.02648972558701746,
"grad_norm": 1.28125,
"learning_rate": 0.000257,
"loss": 6.8974,
"mean_token_accuracy": 0.09212475568056107,
"num_tokens": 914323.0,
"step": 515
},
{
"entropy": 7.195075178146363,
"epoch": 0.026746907388833167,
"grad_norm": 1.3515625,
"learning_rate": 0.0002595,
"loss": 6.8358,
"mean_token_accuracy": 0.0931648664176464,
"num_tokens": 922913.0,
"step": 520
},
{
"entropy": 7.201556158065796,
"epoch": 0.02700408919064887,
"grad_norm": 1.2109375,
"learning_rate": 0.000262,
"loss": 6.9151,
"mean_token_accuracy": 0.08820494934916497,
"num_tokens": 931487.0,
"step": 525
},
{
"entropy": 7.12173867225647,
"epoch": 0.027261270992464573,
"grad_norm": 1.25,
"learning_rate": 0.00026450000000000003,
"loss": 6.8622,
"mean_token_accuracy": 0.09719429761171341,
"num_tokens": 939694.0,
"step": 530
},
{
"entropy": 7.300619316101074,
"epoch": 0.027518452794280276,
"grad_norm": 1.3203125,
"learning_rate": 0.00026700000000000004,
"loss": 6.8258,
"mean_token_accuracy": 0.1024305358529091,
"num_tokens": 948437.0,
"step": 535
},
{
"entropy": 7.087061405181885,
"epoch": 0.02777563459609598,
"grad_norm": 1.359375,
"learning_rate": 0.00026950000000000005,
"loss": 6.7424,
"mean_token_accuracy": 0.09930474832653999,
"num_tokens": 957490.0,
"step": 540
},
{
"entropy": 6.975574159622193,
"epoch": 0.028032816397911685,
"grad_norm": 1.2109375,
"learning_rate": 0.00027200000000000005,
"loss": 6.6873,
"mean_token_accuracy": 0.10134570002555847,
"num_tokens": 966077.0,
"step": 545
},
{
"entropy": 7.103092670440674,
"epoch": 0.028289998199727388,
"grad_norm": 1.1875,
"learning_rate": 0.0002745,
"loss": 6.7758,
"mean_token_accuracy": 0.09924016520380974,
"num_tokens": 974788.0,
"step": 550
},
{
"entropy": 7.049304628372193,
"epoch": 0.02854718000154309,
"grad_norm": 1.453125,
"learning_rate": 0.000277,
"loss": 6.8437,
"mean_token_accuracy": 0.09455109983682633,
"num_tokens": 983645.0,
"step": 555
},
{
"entropy": 7.199927759170532,
"epoch": 0.028804361803358793,
"grad_norm": 1.3984375,
"learning_rate": 0.0002795,
"loss": 6.8972,
"mean_token_accuracy": 0.09381847679615021,
"num_tokens": 991795.0,
"step": 560
},
{
"entropy": 7.130536651611328,
"epoch": 0.0290615436051745,
"grad_norm": 1.234375,
"learning_rate": 0.00028199999999999997,
"loss": 6.8817,
"mean_token_accuracy": 0.0921133041381836,
"num_tokens": 1000732.0,
"step": 565
},
{
"entropy": 7.128713464736938,
"epoch": 0.029318725406990202,
"grad_norm": 1.2421875,
"learning_rate": 0.0002845,
"loss": 6.7298,
"mean_token_accuracy": 0.10322466343641282,
"num_tokens": 1009016.0,
"step": 570
},
{
"entropy": 7.071855258941651,
"epoch": 0.029575907208805905,
"grad_norm": 1.28125,
"learning_rate": 0.000287,
"loss": 6.8085,
"mean_token_accuracy": 0.10027840360999107,
"num_tokens": 1017497.0,
"step": 575
},
{
"entropy": 7.045392799377441,
"epoch": 0.029833089010621608,
"grad_norm": 1.390625,
"learning_rate": 0.0002895,
"loss": 6.7627,
"mean_token_accuracy": 0.09184609279036522,
"num_tokens": 1026437.0,
"step": 580
},
{
"entropy": 7.177649688720703,
"epoch": 0.03009027081243731,
"grad_norm": 1.4375,
"learning_rate": 0.000292,
"loss": 6.7745,
"mean_token_accuracy": 0.10040023326873779,
"num_tokens": 1034621.0,
"step": 585
},
{
"entropy": 7.030013942718506,
"epoch": 0.030347452614253017,
"grad_norm": 1.140625,
"learning_rate": 0.0002945,
"loss": 6.8522,
"mean_token_accuracy": 0.09577706381678582,
"num_tokens": 1043665.0,
"step": 590
},
{
"entropy": 7.080531978607178,
"epoch": 0.03060463441606872,
"grad_norm": 1.359375,
"learning_rate": 0.000297,
"loss": 6.8845,
"mean_token_accuracy": 0.09267403185367584,
"num_tokens": 1052891.0,
"step": 595
},
{
"entropy": 7.106464290618897,
"epoch": 0.030861816217884423,
"grad_norm": 1.3984375,
"learning_rate": 0.0002995,
"loss": 6.7591,
"mean_token_accuracy": 0.10866603180766106,
"num_tokens": 1060520.0,
"step": 600
},
{
"entropy": 7.065040636062622,
"epoch": 0.031118998019700125,
"grad_norm": 1.3671875,
"learning_rate": 0.000302,
"loss": 6.7758,
"mean_token_accuracy": 0.09805820658802986,
"num_tokens": 1069150.0,
"step": 605
},
{
"entropy": 6.90897569656372,
"epoch": 0.03137617982151583,
"grad_norm": 1.3203125,
"learning_rate": 0.0003045,
"loss": 6.6602,
"mean_token_accuracy": 0.10792294815182686,
"num_tokens": 1077015.0,
"step": 610
},
{
"entropy": 6.989263916015625,
"epoch": 0.03163336162333153,
"grad_norm": 1.2421875,
"learning_rate": 0.000307,
"loss": 6.732,
"mean_token_accuracy": 0.09874670803546906,
"num_tokens": 1085630.0,
"step": 615
},
{
"entropy": 7.091088914871216,
"epoch": 0.03189054342514724,
"grad_norm": 1.3125,
"learning_rate": 0.0003095,
"loss": 6.8404,
"mean_token_accuracy": 0.093934640660882,
"num_tokens": 1094423.0,
"step": 620
},
{
"entropy": 6.986142826080322,
"epoch": 0.032147725226962943,
"grad_norm": 1.1328125,
"learning_rate": 0.000312,
"loss": 6.7539,
"mean_token_accuracy": 0.09798811599612237,
"num_tokens": 1103049.0,
"step": 625
},
{
"entropy": 7.063631439208985,
"epoch": 0.03240490702877864,
"grad_norm": 1.375,
"learning_rate": 0.0003145,
"loss": 6.7592,
"mean_token_accuracy": 0.09810860157012939,
"num_tokens": 1111852.0,
"step": 630
},
{
"entropy": 6.935723733901978,
"epoch": 0.03266208883059435,
"grad_norm": 1.296875,
"learning_rate": 0.000317,
"loss": 6.6757,
"mean_token_accuracy": 0.09773161709308624,
"num_tokens": 1121545.0,
"step": 635
},
{
"entropy": 6.963910818099976,
"epoch": 0.03291927063241005,
"grad_norm": 1.140625,
"learning_rate": 0.0003195,
"loss": 6.6986,
"mean_token_accuracy": 0.0950073927640915,
"num_tokens": 1130639.0,
"step": 640
},
{
"entropy": 6.92723650932312,
"epoch": 0.033176452434225755,
"grad_norm": 1.171875,
"learning_rate": 0.000322,
"loss": 6.6173,
"mean_token_accuracy": 0.10274656191468239,
"num_tokens": 1138741.0,
"step": 645
},
{
"entropy": 6.957373142242432,
"epoch": 0.03343363423604146,
"grad_norm": 1.2578125,
"learning_rate": 0.00032450000000000003,
"loss": 6.7487,
"mean_token_accuracy": 0.10246102660894393,
"num_tokens": 1146985.0,
"step": 650
},
{
"entropy": 6.968684911727905,
"epoch": 0.03369081603785716,
"grad_norm": 1.2734375,
"learning_rate": 0.00032700000000000003,
"loss": 6.6421,
"mean_token_accuracy": 0.10296816006302834,
"num_tokens": 1155393.0,
"step": 655
},
{
"entropy": 7.074275159835816,
"epoch": 0.03394799783967287,
"grad_norm": 1.359375,
"learning_rate": 0.00032950000000000004,
"loss": 6.7709,
"mean_token_accuracy": 0.09904137998819351,
"num_tokens": 1164285.0,
"step": 660
},
{
"entropy": 6.8998229026794435,
"epoch": 0.034205179641488566,
"grad_norm": 1.1875,
"learning_rate": 0.00033200000000000005,
"loss": 6.7359,
"mean_token_accuracy": 0.10153986811637879,
"num_tokens": 1172997.0,
"step": 665
},
{
"entropy": 6.809995031356811,
"epoch": 0.03446236144330427,
"grad_norm": 1.3515625,
"learning_rate": 0.00033450000000000005,
"loss": 6.5043,
"mean_token_accuracy": 0.10296982899308205,
"num_tokens": 1182316.0,
"step": 670
},
{
"entropy": 6.95496187210083,
"epoch": 0.03471954324511998,
"grad_norm": 1.359375,
"learning_rate": 0.000337,
"loss": 6.7375,
"mean_token_accuracy": 0.10285088196396827,
"num_tokens": 1190660.0,
"step": 675
},
{
"entropy": 6.985808277130127,
"epoch": 0.03497672504693568,
"grad_norm": 1.25,
"learning_rate": 0.0003395,
"loss": 6.7359,
"mean_token_accuracy": 0.10022683814167976,
"num_tokens": 1199158.0,
"step": 680
},
{
"entropy": 6.826939868927002,
"epoch": 0.035233906848751384,
"grad_norm": 1.2734375,
"learning_rate": 0.000342,
"loss": 6.6363,
"mean_token_accuracy": 0.10053048059344291,
"num_tokens": 1208550.0,
"step": 685
},
{
"entropy": 6.928761577606201,
"epoch": 0.03549108865056708,
"grad_norm": 1.1875,
"learning_rate": 0.00034449999999999997,
"loss": 6.7171,
"mean_token_accuracy": 0.09703745916485787,
"num_tokens": 1218526.0,
"step": 690
},
{
"entropy": 6.970518112182617,
"epoch": 0.03574827045238279,
"grad_norm": 1.265625,
"learning_rate": 0.000347,
"loss": 6.8224,
"mean_token_accuracy": 0.09267975017428398,
"num_tokens": 1227247.0,
"step": 695
},
{
"entropy": 6.905700254440307,
"epoch": 0.036005452254198496,
"grad_norm": 1.21875,
"learning_rate": 0.0003495,
"loss": 6.7287,
"mean_token_accuracy": 0.10465597808361053,
"num_tokens": 1236146.0,
"step": 700
},
{
"entropy": 6.922169589996338,
"epoch": 0.036262634056014195,
"grad_norm": 1.234375,
"learning_rate": 0.000352,
"loss": 6.7667,
"mean_token_accuracy": 0.1004488743841648,
"num_tokens": 1244958.0,
"step": 705
},
{
"entropy": 6.962793493270874,
"epoch": 0.0365198158578299,
"grad_norm": 1.234375,
"learning_rate": 0.0003545,
"loss": 6.7626,
"mean_token_accuracy": 0.09757086858153344,
"num_tokens": 1254502.0,
"step": 710
},
{
"entropy": 6.917850494384766,
"epoch": 0.0367769976596456,
"grad_norm": 1.28125,
"learning_rate": 0.000357,
"loss": 6.691,
"mean_token_accuracy": 0.10314588993787766,
"num_tokens": 1263291.0,
"step": 715
},
{
"entropy": 6.852348566055298,
"epoch": 0.03703417946146131,
"grad_norm": 1.1875,
"learning_rate": 0.0003595,
"loss": 6.6744,
"mean_token_accuracy": 0.10638380572199821,
"num_tokens": 1272494.0,
"step": 720
},
{
"entropy": 6.917734289169312,
"epoch": 0.03729136126327701,
"grad_norm": 1.328125,
"learning_rate": 0.000362,
"loss": 6.8097,
"mean_token_accuracy": 0.0955355480313301,
"num_tokens": 1281611.0,
"step": 725
},
{
"entropy": 6.913245725631714,
"epoch": 0.03754854306509271,
"grad_norm": 1.125,
"learning_rate": 0.0003645,
"loss": 6.6715,
"mean_token_accuracy": 0.09784635901451111,
"num_tokens": 1291512.0,
"step": 730
},
{
"entropy": 6.8256752490997314,
"epoch": 0.03780572486690842,
"grad_norm": 1.2421875,
"learning_rate": 0.000367,
"loss": 6.5595,
"mean_token_accuracy": 0.10571763291954994,
"num_tokens": 1300413.0,
"step": 735
},
{
"entropy": 6.930764818191529,
"epoch": 0.03806290666872412,
"grad_norm": 1.2421875,
"learning_rate": 0.0003695,
"loss": 6.7698,
"mean_token_accuracy": 0.09721217602491379,
"num_tokens": 1309524.0,
"step": 740
},
{
"entropy": 6.896268653869629,
"epoch": 0.038320088470539825,
"grad_norm": 1.140625,
"learning_rate": 0.000372,
"loss": 6.6535,
"mean_token_accuracy": 0.10513104945421219,
"num_tokens": 1318128.0,
"step": 745
},
{
"entropy": 6.851891374588012,
"epoch": 0.03857727027235553,
"grad_norm": 1.2734375,
"learning_rate": 0.0003745,
"loss": 6.7028,
"mean_token_accuracy": 0.09935224205255508,
"num_tokens": 1326705.0,
"step": 750
},
{
"entropy": 6.729863882064819,
"epoch": 0.03883445207417123,
"grad_norm": 1.234375,
"learning_rate": 0.000377,
"loss": 6.5243,
"mean_token_accuracy": 0.10701719000935554,
"num_tokens": 1335271.0,
"step": 755
},
{
"entropy": 6.829174661636353,
"epoch": 0.039091633875986936,
"grad_norm": 1.359375,
"learning_rate": 0.0003795,
"loss": 6.5755,
"mean_token_accuracy": 0.10041920840740204,
"num_tokens": 1343944.0,
"step": 760
},
{
"entropy": 6.730857849121094,
"epoch": 0.039348815677802636,
"grad_norm": 1.1796875,
"learning_rate": 0.000382,
"loss": 6.5869,
"mean_token_accuracy": 0.10631005689501763,
"num_tokens": 1352294.0,
"step": 765
},
{
"entropy": 6.8131995677948,
"epoch": 0.03960599747961834,
"grad_norm": 1.359375,
"learning_rate": 0.0003845,
"loss": 6.6112,
"mean_token_accuracy": 0.10081271678209305,
"num_tokens": 1360533.0,
"step": 770
},
{
"entropy": 6.826685190200806,
"epoch": 0.03986317928143405,
"grad_norm": 1.28125,
"learning_rate": 0.00038700000000000003,
"loss": 6.5435,
"mean_token_accuracy": 0.10690599977970124,
"num_tokens": 1368880.0,
"step": 775
},
{
"entropy": 6.743242073059082,
"epoch": 0.04012036108324975,
"grad_norm": 1.203125,
"learning_rate": 0.00038950000000000003,
"loss": 6.568,
"mean_token_accuracy": 0.10478584542870521,
"num_tokens": 1377226.0,
"step": 780
},
{
"entropy": 6.831422472000122,
"epoch": 0.040377542885065454,
"grad_norm": 1.296875,
"learning_rate": 0.00039200000000000004,
"loss": 6.6902,
"mean_token_accuracy": 0.1015243612229824,
"num_tokens": 1386196.0,
"step": 785
},
{
"entropy": 6.745612382888794,
"epoch": 0.04063472468688115,
"grad_norm": 1.2109375,
"learning_rate": 0.00039450000000000005,
"loss": 6.6026,
"mean_token_accuracy": 0.10642225667834282,
"num_tokens": 1395019.0,
"step": 790
},
{
"entropy": 6.7675634860992435,
"epoch": 0.04089190648869686,
"grad_norm": 1.296875,
"learning_rate": 0.00039700000000000005,
"loss": 6.7062,
"mean_token_accuracy": 0.10018283650279045,
"num_tokens": 1404120.0,
"step": 795
},
{
"entropy": 6.898847818374634,
"epoch": 0.041149088290512566,
"grad_norm": 1.2421875,
"learning_rate": 0.0003995,
"loss": 6.5752,
"mean_token_accuracy": 0.0967138335108757,
"num_tokens": 1412812.0,
"step": 800
},
{
"entropy": 6.683012008666992,
"epoch": 0.041406270092328265,
"grad_norm": 1.0859375,
"learning_rate": 0.000402,
"loss": 6.5476,
"mean_token_accuracy": 0.10471888035535812,
"num_tokens": 1421439.0,
"step": 805
},
{
"entropy": 6.711639165878296,
"epoch": 0.04166345189414397,
"grad_norm": 1.1953125,
"learning_rate": 0.0004045,
"loss": 6.5496,
"mean_token_accuracy": 0.10460042878985405,
"num_tokens": 1429882.0,
"step": 810
},
{
"entropy": 6.719864559173584,
"epoch": 0.04192063369595967,
"grad_norm": 1.21875,
"learning_rate": 0.00040699999999999997,
"loss": 6.5972,
"mean_token_accuracy": 0.10305096060037613,
"num_tokens": 1438918.0,
"step": 815
},
{
"entropy": 6.770114183425903,
"epoch": 0.04217781549777538,
"grad_norm": 1.2578125,
"learning_rate": 0.0004095,
"loss": 6.7244,
"mean_token_accuracy": 0.09797946363687515,
"num_tokens": 1448337.0,
"step": 820
},
{
"entropy": 6.901697778701783,
"epoch": 0.04243499729959108,
"grad_norm": 1.28125,
"learning_rate": 0.000412,
"loss": 6.6691,
"mean_token_accuracy": 0.10322674512863159,
"num_tokens": 1457928.0,
"step": 825
},
{
"entropy": 6.765479469299317,
"epoch": 0.04269217910140678,
"grad_norm": 1.25,
"learning_rate": 0.0004145,
"loss": 6.6076,
"mean_token_accuracy": 0.11027010977268219,
"num_tokens": 1467022.0,
"step": 830
},
{
"entropy": 6.64197793006897,
"epoch": 0.04294936090322249,
"grad_norm": 1.09375,
"learning_rate": 0.000417,
"loss": 6.5992,
"mean_token_accuracy": 0.10252309665083885,
"num_tokens": 1476510.0,
"step": 835
},
{
"entropy": 6.800649499893188,
"epoch": 0.04320654270503819,
"grad_norm": 1.1484375,
"learning_rate": 0.0004195,
"loss": 6.5706,
"mean_token_accuracy": 0.10807883217930794,
"num_tokens": 1485141.0,
"step": 840
},
{
"entropy": 6.722679805755615,
"epoch": 0.043463724506853894,
"grad_norm": 1.3125,
"learning_rate": 0.000422,
"loss": 6.6423,
"mean_token_accuracy": 0.10095877721905708,
"num_tokens": 1494343.0,
"step": 845
},
{
"entropy": 6.649412488937378,
"epoch": 0.0437209063086696,
"grad_norm": 1.1171875,
"learning_rate": 0.0004245,
"loss": 6.5835,
"mean_token_accuracy": 0.10432918965816498,
"num_tokens": 1503753.0,
"step": 850
},
{
"entropy": 6.760374069213867,
"epoch": 0.0439780881104853,
"grad_norm": 1.1875,
"learning_rate": 0.000427,
"loss": 6.6178,
"mean_token_accuracy": 0.09621104225516319,
"num_tokens": 1512434.0,
"step": 855
},
{
"entropy": 6.713858127593994,
"epoch": 0.044235269912301006,
"grad_norm": 1.265625,
"learning_rate": 0.0004295,
"loss": 6.4808,
"mean_token_accuracy": 0.10826214924454688,
"num_tokens": 1521201.0,
"step": 860
},
{
"entropy": 6.593627119064331,
"epoch": 0.04449245171411671,
"grad_norm": 1.2734375,
"learning_rate": 0.000432,
"loss": 6.5988,
"mean_token_accuracy": 0.10316284075379371,
"num_tokens": 1529958.0,
"step": 865
},
{
"entropy": 6.778238105773926,
"epoch": 0.04474963351593241,
"grad_norm": 1.125,
"learning_rate": 0.0004345,
"loss": 6.5475,
"mean_token_accuracy": 0.10538713037967681,
"num_tokens": 1539524.0,
"step": 870
},
{
"entropy": 6.572915077209473,
"epoch": 0.04500681531774812,
"grad_norm": 1.140625,
"learning_rate": 0.000437,
"loss": 6.4783,
"mean_token_accuracy": 0.10733042433857917,
"num_tokens": 1547955.0,
"step": 875
},
{
"entropy": 6.661984968185425,
"epoch": 0.04526399711956382,
"grad_norm": 1.2578125,
"learning_rate": 0.0004395,
"loss": 6.5371,
"mean_token_accuracy": 0.10633926317095757,
"num_tokens": 1557401.0,
"step": 880
},
{
"entropy": 6.592761278152466,
"epoch": 0.045521178921379524,
"grad_norm": 1.265625,
"learning_rate": 0.000442,
"loss": 6.5084,
"mean_token_accuracy": 0.10569668263196945,
"num_tokens": 1566022.0,
"step": 885
},
{
"entropy": 6.636467218399048,
"epoch": 0.04577836072319523,
"grad_norm": 1.171875,
"learning_rate": 0.0004445,
"loss": 6.5551,
"mean_token_accuracy": 0.10752687007188796,
"num_tokens": 1575035.0,
"step": 890
},
{
"entropy": 6.695861721038819,
"epoch": 0.04603554252501093,
"grad_norm": 1.140625,
"learning_rate": 0.000447,
"loss": 6.5778,
"mean_token_accuracy": 0.10746671482920647,
"num_tokens": 1583357.0,
"step": 895
},
{
"entropy": 6.70294976234436,
"epoch": 0.046292724326826636,
"grad_norm": 1.1875,
"learning_rate": 0.00044950000000000003,
"loss": 6.3892,
"mean_token_accuracy": 0.11069994270801545,
"num_tokens": 1591702.0,
"step": 900
},
{
"entropy": 6.617056608200073,
"epoch": 0.046549906128642335,
"grad_norm": 1.1171875,
"learning_rate": 0.00045200000000000004,
"loss": 6.4792,
"mean_token_accuracy": 0.11211444064974785,
"num_tokens": 1600562.0,
"step": 905
},
{
"entropy": 6.684534406661987,
"epoch": 0.04680708793045804,
"grad_norm": 1.0625,
"learning_rate": 0.00045450000000000004,
"loss": 6.6204,
"mean_token_accuracy": 0.10558928847312928,
"num_tokens": 1610139.0,
"step": 910
},
{
"entropy": 6.765460586547851,
"epoch": 0.04706426973227375,
"grad_norm": 1.2734375,
"learning_rate": 0.00045700000000000005,
"loss": 6.6139,
"mean_token_accuracy": 0.10323682352900505,
"num_tokens": 1619464.0,
"step": 915
},
{
"entropy": 6.656091642379761,
"epoch": 0.04732145153408945,
"grad_norm": 1.1171875,
"learning_rate": 0.00045950000000000006,
"loss": 6.4596,
"mean_token_accuracy": 0.1120453879237175,
"num_tokens": 1628632.0,
"step": 920
},
{
"entropy": 6.445028781890869,
"epoch": 0.04757863333590515,
"grad_norm": 1.265625,
"learning_rate": 0.000462,
"loss": 6.4023,
"mean_token_accuracy": 0.11046137437224388,
"num_tokens": 1636855.0,
"step": 925
},
{
"entropy": 6.55358853340149,
"epoch": 0.04783581513772085,
"grad_norm": 1.1484375,
"learning_rate": 0.0004645,
"loss": 6.3969,
"mean_token_accuracy": 0.11445706561207772,
"num_tokens": 1645204.0,
"step": 930
},
{
"entropy": 6.668329048156738,
"epoch": 0.04809299693953656,
"grad_norm": 1.203125,
"learning_rate": 0.000467,
"loss": 6.5778,
"mean_token_accuracy": 0.10868966206908226,
"num_tokens": 1654231.0,
"step": 935
},
{
"entropy": 6.57129602432251,
"epoch": 0.048350178741352265,
"grad_norm": 1.1953125,
"learning_rate": 0.0004695,
"loss": 6.5478,
"mean_token_accuracy": 0.1099221870303154,
"num_tokens": 1663312.0,
"step": 940
},
{
"entropy": 6.630906820297241,
"epoch": 0.048607360543167964,
"grad_norm": 1.0859375,
"learning_rate": 0.000472,
"loss": 6.5729,
"mean_token_accuracy": 0.10720053240656853,
"num_tokens": 1672672.0,
"step": 945
},
{
"entropy": 6.701202535629273,
"epoch": 0.04886454234498367,
"grad_norm": 1.2421875,
"learning_rate": 0.0004745,
"loss": 6.6146,
"mean_token_accuracy": 0.10442524701356888,
"num_tokens": 1681497.0,
"step": 950
},
{
"entropy": 6.558098268508911,
"epoch": 0.04912172414679937,
"grad_norm": 1.203125,
"learning_rate": 0.000477,
"loss": 6.5076,
"mean_token_accuracy": 0.10559550374746322,
"num_tokens": 1690429.0,
"step": 955
},
{
"entropy": 6.602577352523804,
"epoch": 0.049378905948615076,
"grad_norm": 1.3125,
"learning_rate": 0.0004795,
"loss": 6.4754,
"mean_token_accuracy": 0.11203035712242126,
"num_tokens": 1698804.0,
"step": 960
},
{
"entropy": 6.621676778793335,
"epoch": 0.04963608775043078,
"grad_norm": 1.15625,
"learning_rate": 0.000482,
"loss": 6.5161,
"mean_token_accuracy": 0.1092241458594799,
"num_tokens": 1707309.0,
"step": 965
},
{
"entropy": 6.533698225021363,
"epoch": 0.04989326955224648,
"grad_norm": 1.171875,
"learning_rate": 0.0004845,
"loss": 6.4973,
"mean_token_accuracy": 0.11040452271699905,
"num_tokens": 1716163.0,
"step": 970
},
{
"entropy": 6.572607231140137,
"epoch": 0.05015045135406219,
"grad_norm": 1.109375,
"learning_rate": 0.000487,
"loss": 6.547,
"mean_token_accuracy": 0.10961430817842484,
"num_tokens": 1725316.0,
"step": 975
},
{
"entropy": 6.6284825801849365,
"epoch": 0.05040763315587789,
"grad_norm": 1.125,
"learning_rate": 0.0004895,
"loss": 6.5083,
"mean_token_accuracy": 0.11171742677688598,
"num_tokens": 1735193.0,
"step": 980
},
{
"entropy": 6.561748790740967,
"epoch": 0.050664814957693594,
"grad_norm": 1.1328125,
"learning_rate": 0.000492,
"loss": 6.4313,
"mean_token_accuracy": 0.10571753829717637,
"num_tokens": 1744624.0,
"step": 985
},
{
"entropy": 6.532333707809448,
"epoch": 0.0509219967595093,
"grad_norm": 1.171875,
"learning_rate": 0.0004945,
"loss": 6.4262,
"mean_token_accuracy": 0.1134820282459259,
"num_tokens": 1753566.0,
"step": 990
},
{
"entropy": 6.585614109039307,
"epoch": 0.051179178561325,
"grad_norm": 1.2734375,
"learning_rate": 0.000497,
"loss": 6.5563,
"mean_token_accuracy": 0.10488807931542396,
"num_tokens": 1762793.0,
"step": 995
},
{
"entropy": 6.60942120552063,
"epoch": 0.051436360363140705,
"grad_norm": 1.1328125,
"learning_rate": 0.0004995,
"loss": 6.5411,
"mean_token_accuracy": 0.10642052963376045,
"num_tokens": 1771511.0,
"step": 1000
},
{
"entropy": 6.607848262786865,
"epoch": 0.051693542164956405,
"grad_norm": 1.171875,
"learning_rate": 0.000499998026082006,
"loss": 6.5517,
"mean_token_accuracy": 0.10087490379810334,
"num_tokens": 1780230.0,
"step": 1005
},
{
"entropy": 6.517893648147583,
"epoch": 0.05195072396677211,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999900070995136,
"loss": 6.4313,
"mean_token_accuracy": 0.11181956753134728,
"num_tokens": 1789372.0,
"step": 1010
},
{
"entropy": 6.466477012634277,
"epoch": 0.05220790576858782,
"grad_norm": 1.21875,
"learning_rate": 0.0004999758199023239,
"loss": 6.3947,
"mean_token_accuracy": 0.11296560466289521,
"num_tokens": 1798312.0,
"step": 1015
},
{
"entropy": 6.519049787521363,
"epoch": 0.05246508757040352,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999554648793858,
"loss": 6.3971,
"mean_token_accuracy": 0.11271054744720459,
"num_tokens": 1806354.0,
"step": 1020
},
{
"entropy": 6.451335763931274,
"epoch": 0.05272226937221922,
"grad_norm": 1.265625,
"learning_rate": 0.0004999289425887425,
"loss": 6.4042,
"mean_token_accuracy": 0.11678544953465461,
"num_tokens": 1815366.0,
"step": 1025
},
{
"entropy": 6.533133411407471,
"epoch": 0.05297945117403492,
"grad_norm": 1.109375,
"learning_rate": 0.0004998962537575161,
"loss": 6.4659,
"mean_token_accuracy": 0.1081003189086914,
"num_tokens": 1824645.0,
"step": 1030
},
{
"entropy": 6.429107570648194,
"epoch": 0.05323663297585063,
"grad_norm": 1.03125,
"learning_rate": 0.0004998573992818874,
"loss": 6.4251,
"mean_token_accuracy": 0.11395458430051804,
"num_tokens": 1833166.0,
"step": 1035
},
{
"entropy": 6.645290565490723,
"epoch": 0.053493814777666335,
"grad_norm": 1.109375,
"learning_rate": 0.0004998123802270715,
"loss": 6.555,
"mean_token_accuracy": 0.10978370234370231,
"num_tokens": 1842390.0,
"step": 1040
},
{
"entropy": 6.419606733322143,
"epoch": 0.053750996579482034,
"grad_norm": 1.140625,
"learning_rate": 0.0004997611978272886,
"loss": 6.3838,
"mean_token_accuracy": 0.1112293429672718,
"num_tokens": 1851645.0,
"step": 1045
},
{
"entropy": 6.453891038894653,
"epoch": 0.05400817838129774,
"grad_norm": 1.2734375,
"learning_rate": 0.0004997038534857298,
"loss": 6.3782,
"mean_token_accuracy": 0.11755769476294517,
"num_tokens": 1860008.0,
"step": 1050
},
{
"entropy": 6.4972833633422855,
"epoch": 0.05426536018311344,
"grad_norm": 1.09375,
"learning_rate": 0.0004996403487745194,
"loss": 6.4343,
"mean_token_accuracy": 0.1094091109931469,
"num_tokens": 1869329.0,
"step": 1055
},
{
"entropy": 6.387360382080078,
"epoch": 0.054522541984929146,
"grad_norm": 1.0859375,
"learning_rate": 0.000499570685434671,
"loss": 6.3339,
"mean_token_accuracy": 0.11642076373100281,
"num_tokens": 1878054.0,
"step": 1060
},
{
"entropy": 6.484694147109986,
"epoch": 0.05477972378674485,
"grad_norm": 1.1171875,
"learning_rate": 0.0004994948653760405,
"loss": 6.3946,
"mean_token_accuracy": 0.11390996798872947,
"num_tokens": 1886581.0,
"step": 1065
},
{
"entropy": 6.580167531967163,
"epoch": 0.05503690558856055,
"grad_norm": 1.1328125,
"learning_rate": 0.0004994128906772729,
"loss": 6.4711,
"mean_token_accuracy": 0.11259651854634285,
"num_tokens": 1895731.0,
"step": 1070
},
{
"entropy": 6.423868322372437,
"epoch": 0.05529408739037626,
"grad_norm": 1.1015625,
"learning_rate": 0.000499324763585746,
"loss": 6.3499,
"mean_token_accuracy": 0.11970952153205872,
"num_tokens": 1904181.0,
"step": 1075
},
{
"entropy": 6.406012630462646,
"epoch": 0.05555126919219196,
"grad_norm": 1.0859375,
"learning_rate": 0.0004992304865175085,
"loss": 6.3772,
"mean_token_accuracy": 0.11032988727092743,
"num_tokens": 1913335.0,
"step": 1080
},
{
"entropy": 6.484732151031494,
"epoch": 0.05580845099400766,
"grad_norm": 1.15625,
"learning_rate": 0.0004991300620572138,
"loss": 6.3966,
"mean_token_accuracy": 0.11090287342667579,
"num_tokens": 1922789.0,
"step": 1085
},
{
"entropy": 6.436389446258545,
"epoch": 0.05606563279582337,
"grad_norm": 1.0859375,
"learning_rate": 0.0004990234929580494,
"loss": 6.3178,
"mean_token_accuracy": 0.11508271917700767,
"num_tokens": 1931214.0,
"step": 1090
},
{
"entropy": 6.433405256271362,
"epoch": 0.05632281459763907,
"grad_norm": 1.1015625,
"learning_rate": 0.0004989107821416609,
"loss": 6.4827,
"mean_token_accuracy": 0.10500127375125885,
"num_tokens": 1941151.0,
"step": 1095
},
{
"entropy": 6.4416193008422855,
"epoch": 0.056579996399454775,
"grad_norm": 1.1328125,
"learning_rate": 0.0004987919326980723,
"loss": 6.331,
"mean_token_accuracy": 0.11337620094418525,
"num_tokens": 1949326.0,
"step": 1100
},
{
"entropy": 6.514848232269287,
"epoch": 0.05683717820127048,
"grad_norm": 1.1171875,
"learning_rate": 0.0004986669478856011,
"loss": 6.4664,
"mean_token_accuracy": 0.10760492980480194,
"num_tokens": 1958929.0,
"step": 1105
},
{
"entropy": 6.39950590133667,
"epoch": 0.05709436000308618,
"grad_norm": 1.0703125,
"learning_rate": 0.0004985358311307688,
"loss": 6.2505,
"mean_token_accuracy": 0.11898310258984565,
"num_tokens": 1967690.0,
"step": 1110
},
{
"entropy": 6.384913921356201,
"epoch": 0.05735154180490189,
"grad_norm": 1.015625,
"learning_rate": 0.0004983985860282081,
"loss": 6.3981,
"mean_token_accuracy": 0.11035036444664001,
"num_tokens": 1977786.0,
"step": 1115
},
{
"entropy": 6.379779815673828,
"epoch": 0.057608723606717586,
"grad_norm": 1.0859375,
"learning_rate": 0.0004982552163405623,
"loss": 6.3107,
"mean_token_accuracy": 0.11793362498283386,
"num_tokens": 1986708.0,
"step": 1120
},
{
"entropy": 6.341381025314331,
"epoch": 0.05786590540853329,
"grad_norm": 1.078125,
"learning_rate": 0.0004981057259983839,
"loss": 6.3345,
"mean_token_accuracy": 0.11417381316423417,
"num_tokens": 1996309.0,
"step": 1125
},
{
"entropy": 6.446984195709229,
"epoch": 0.058123087210349,
"grad_norm": 1.140625,
"learning_rate": 0.0004979501191000262,
"loss": 6.2712,
"mean_token_accuracy": 0.11331850737333297,
"num_tokens": 2004754.0,
"step": 1130
},
{
"entropy": 6.322438764572143,
"epoch": 0.0583802690121647,
"grad_norm": 1.09375,
"learning_rate": 0.0004977883999115311,
"loss": 6.3644,
"mean_token_accuracy": 0.11575946882367134,
"num_tokens": 2013231.0,
"step": 1135
},
{
"entropy": 6.3898763179779055,
"epoch": 0.058637450813980405,
"grad_norm": 1.1328125,
"learning_rate": 0.0004976205728665113,
"loss": 6.3163,
"mean_token_accuracy": 0.11673919707536698,
"num_tokens": 2021918.0,
"step": 1140
},
{
"entropy": 6.395988273620605,
"epoch": 0.058894632615796104,
"grad_norm": 1.109375,
"learning_rate": 0.0004974466425660307,
"loss": 6.3607,
"mean_token_accuracy": 0.1184878721833229,
"num_tokens": 2030341.0,
"step": 1145
},
{
"entropy": 6.378729295730591,
"epoch": 0.05915181441761181,
"grad_norm": 1.1953125,
"learning_rate": 0.0004972666137784759,
"loss": 6.3114,
"mean_token_accuracy": 0.11576305478811263,
"num_tokens": 2038869.0,
"step": 1150
},
{
"entropy": 6.363564395904541,
"epoch": 0.059408996219427516,
"grad_norm": 1.09375,
"learning_rate": 0.0004970804914394271,
"loss": 6.3938,
"mean_token_accuracy": 0.1138048842549324,
"num_tokens": 2047545.0,
"step": 1155
},
{
"entropy": 6.406496477127075,
"epoch": 0.059666178021243216,
"grad_norm": 1.078125,
"learning_rate": 0.0004968882806515225,
"loss": 6.4462,
"mean_token_accuracy": 0.11089355796575547,
"num_tokens": 2056802.0,
"step": 1160
},
{
"entropy": 6.383754062652588,
"epoch": 0.05992335982305892,
"grad_norm": 1.1328125,
"learning_rate": 0.0004966899866843177,
"loss": 6.3043,
"mean_token_accuracy": 0.11790038123726845,
"num_tokens": 2065106.0,
"step": 1165
},
{
"entropy": 6.439864730834961,
"epoch": 0.06018054162487462,
"grad_norm": 1.0859375,
"learning_rate": 0.000496485614974142,
"loss": 6.3607,
"mean_token_accuracy": 0.11016541495919227,
"num_tokens": 2073723.0,
"step": 1170
},
{
"entropy": 6.336991977691651,
"epoch": 0.06043772342669033,
"grad_norm": 1.0859375,
"learning_rate": 0.0004962751711239492,
"loss": 6.2888,
"mean_token_accuracy": 0.1206134170293808,
"num_tokens": 2082296.0,
"step": 1175
},
{
"entropy": 6.377587127685547,
"epoch": 0.060694905228506034,
"grad_norm": 1.140625,
"learning_rate": 0.0004960586609031636,
"loss": 6.3447,
"mean_token_accuracy": 0.11322090104222297,
"num_tokens": 2091239.0,
"step": 1180
},
{
"entropy": 6.373478603363037,
"epoch": 0.06095208703032173,
"grad_norm": 1.09375,
"learning_rate": 0.0004958360902475224,
"loss": 6.3073,
"mean_token_accuracy": 0.11865990906953812,
"num_tokens": 2100809.0,
"step": 1185
},
{
"entropy": 6.37120213508606,
"epoch": 0.06120926883213744,
"grad_norm": 1.1953125,
"learning_rate": 0.0004956074652589125,
"loss": 6.3806,
"mean_token_accuracy": 0.11596836000680924,
"num_tokens": 2109373.0,
"step": 1190
},
{
"entropy": 6.386609125137329,
"epoch": 0.06146645063395314,
"grad_norm": 1.125,
"learning_rate": 0.0004953727922052035,
"loss": 6.335,
"mean_token_accuracy": 0.1201685570180416,
"num_tokens": 2117351.0,
"step": 1195
},
{
"entropy": 6.3725518703460695,
"epoch": 0.061723632435768845,
"grad_norm": 1.09375,
"learning_rate": 0.0004951320775200756,
"loss": 6.2876,
"mean_token_accuracy": 0.12080588638782501,
"num_tokens": 2125792.0,
"step": 1200
},
{
"entropy": 6.261738634109497,
"epoch": 0.06198081423758455,
"grad_norm": 1.0703125,
"learning_rate": 0.0004948853278028436,
"loss": 6.2851,
"mean_token_accuracy": 0.12247317284345627,
"num_tokens": 2134755.0,
"step": 1205
},
{
"entropy": 6.426895523071289,
"epoch": 0.06223799603940025,
"grad_norm": 1.171875,
"learning_rate": 0.0004946325498182755,
"loss": 6.2479,
"mean_token_accuracy": 0.11313225403428077,
"num_tokens": 2144063.0,
"step": 1210
},
{
"entropy": 6.373356294631958,
"epoch": 0.06249517784121596,
"grad_norm": 1.109375,
"learning_rate": 0.0004943737504964076,
"loss": 6.3527,
"mean_token_accuracy": 0.11966249272227288,
"num_tokens": 2153664.0,
"step": 1215
},
{
"entropy": 6.227408838272095,
"epoch": 0.06275235964303166,
"grad_norm": 1.1015625,
"learning_rate": 0.000494108936932354,
"loss": 6.1855,
"mean_token_accuracy": 0.1191711500287056,
"num_tokens": 2161797.0,
"step": 1220
},
{
"entropy": 6.517656993865967,
"epoch": 0.06300954144484737,
"grad_norm": 1.0859375,
"learning_rate": 0.0004938381163861124,
"loss": 6.3498,
"mean_token_accuracy": 0.11286477893590927,
"num_tokens": 2170312.0,
"step": 1225
},
{
"entropy": 6.230176687240601,
"epoch": 0.06326672324666306,
"grad_norm": 1.0859375,
"learning_rate": 0.0004935612962823645,
"loss": 6.3298,
"mean_token_accuracy": 0.11120934784412384,
"num_tokens": 2179850.0,
"step": 1230
},
{
"entropy": 6.308627033233643,
"epoch": 0.06352390504847877,
"grad_norm": 1.109375,
"learning_rate": 0.0004932784842102739,
"loss": 6.2072,
"mean_token_accuracy": 0.11979541927576065,
"num_tokens": 2189201.0,
"step": 1235
},
{
"entropy": 6.313740825653076,
"epoch": 0.06378108685029447,
"grad_norm": 0.984375,
"learning_rate": 0.0004929896879232758,
"loss": 6.3061,
"mean_token_accuracy": 0.11951600462198257,
"num_tokens": 2198362.0,
"step": 1240
},
{
"entropy": 6.322280406951904,
"epoch": 0.06403826865211018,
"grad_norm": 1.09375,
"learning_rate": 0.0004926949153388668,
"loss": 6.2858,
"mean_token_accuracy": 0.1180046945810318,
"num_tokens": 2207261.0,
"step": 1245
},
{
"entropy": 6.374325513839722,
"epoch": 0.06429545045392589,
"grad_norm": 1.0546875,
"learning_rate": 0.0004923941745383859,
"loss": 6.324,
"mean_token_accuracy": 0.12014769464731216,
"num_tokens": 2216293.0,
"step": 1250
},
{
"entropy": 6.248019790649414,
"epoch": 0.06455263225574158,
"grad_norm": 1.1796875,
"learning_rate": 0.000492087473766794,
"loss": 6.1756,
"mean_token_accuracy": 0.12480147182941437,
"num_tokens": 2224638.0,
"step": 1255
},
{
"entropy": 6.246414041519165,
"epoch": 0.06480981405755729,
"grad_norm": 1.140625,
"learning_rate": 0.000491774821432448,
"loss": 6.174,
"mean_token_accuracy": 0.12405480146408081,
"num_tokens": 2233422.0,
"step": 1260
},
{
"entropy": 6.36962661743164,
"epoch": 0.06506699585937299,
"grad_norm": 1.0390625,
"learning_rate": 0.0004914562261068693,
"loss": 6.3003,
"mean_token_accuracy": 0.11817166209220886,
"num_tokens": 2242497.0,
"step": 1265
},
{
"entropy": 6.283186435699463,
"epoch": 0.0653241776611887,
"grad_norm": 1.09375,
"learning_rate": 0.0004911316965245098,
"loss": 6.3951,
"mean_token_accuracy": 0.11700899675488471,
"num_tokens": 2251876.0,
"step": 1270
},
{
"entropy": 6.4162839412689205,
"epoch": 0.0655813594630044,
"grad_norm": 1.046875,
"learning_rate": 0.000490801241582512,
"loss": 6.3263,
"mean_token_accuracy": 0.11120393425226212,
"num_tokens": 2261476.0,
"step": 1275
},
{
"entropy": 6.217834234237671,
"epoch": 0.0658385412648201,
"grad_norm": 1.09375,
"learning_rate": 0.000490464870340465,
"loss": 6.2036,
"mean_token_accuracy": 0.12037949934601784,
"num_tokens": 2269830.0,
"step": 1280
},
{
"entropy": 6.354285717010498,
"epoch": 0.0660957230666358,
"grad_norm": 1.0546875,
"learning_rate": 0.0004901225920201563,
"loss": 6.2549,
"mean_token_accuracy": 0.1226073995232582,
"num_tokens": 2278846.0,
"step": 1285
},
{
"entropy": 6.259861993789673,
"epoch": 0.06635290486845151,
"grad_norm": 1.1015625,
"learning_rate": 0.000489774416005319,
"loss": 6.1377,
"mean_token_accuracy": 0.12190483957529068,
"num_tokens": 2287379.0,
"step": 1290
},
{
"entropy": 6.185118103027344,
"epoch": 0.06661008667026722,
"grad_norm": 1.1015625,
"learning_rate": 0.0004894203518413742,
"loss": 6.232,
"mean_token_accuracy": 0.11986896097660064,
"num_tokens": 2296071.0,
"step": 1295
},
{
"entropy": 6.285954570770263,
"epoch": 0.06686726847208292,
"grad_norm": 1.1015625,
"learning_rate": 0.0004890604092351701,
"loss": 6.1568,
"mean_token_accuracy": 0.12937120646238326,
"num_tokens": 2305629.0,
"step": 1300
},
{
"entropy": 6.352389907836914,
"epoch": 0.06712445027389861,
"grad_norm": 1.15625,
"learning_rate": 0.000488694598054715,
"loss": 6.2792,
"mean_token_accuracy": 0.11652439460158348,
"num_tokens": 2314297.0,
"step": 1305
},
{
"entropy": 6.281135702133179,
"epoch": 0.06738163207571432,
"grad_norm": 1.015625,
"learning_rate": 0.0004883229283289071,
"loss": 6.2421,
"mean_token_accuracy": 0.1163830317556858,
"num_tokens": 2323583.0,
"step": 1310
},
{
"entropy": 6.275307750701904,
"epoch": 0.06763881387753003,
"grad_norm": 1.125,
"learning_rate": 0.00048794541024725993,
"loss": 6.1962,
"mean_token_accuracy": 0.12070676833391189,
"num_tokens": 2332362.0,
"step": 1315
},
{
"entropy": 6.247883081436157,
"epoch": 0.06789599567934573,
"grad_norm": 1.03125,
"learning_rate": 0.0004875620541596221,
"loss": 6.2433,
"mean_token_accuracy": 0.11916191950440407,
"num_tokens": 2341724.0,
"step": 1320
},
{
"entropy": 6.323701190948486,
"epoch": 0.06815317748116144,
"grad_norm": 1.1953125,
"learning_rate": 0.00048717287057589454,
"loss": 6.3094,
"mean_token_accuracy": 0.11830834746360779,
"num_tokens": 2350687.0,
"step": 1325
},
{
"entropy": 6.180278348922729,
"epoch": 0.06841035928297713,
"grad_norm": 1.0078125,
"learning_rate": 0.0004867778701657417,
"loss": 6.123,
"mean_token_accuracy": 0.12217027693986893,
"num_tokens": 2359761.0,
"step": 1330
},
{
"entropy": 6.274547529220581,
"epoch": 0.06866754108479284,
"grad_norm": 0.99609375,
"learning_rate": 0.00048637706375829955,
"loss": 6.2057,
"mean_token_accuracy": 0.12222478315234184,
"num_tokens": 2369203.0,
"step": 1335
},
{
"entropy": 6.284049701690674,
"epoch": 0.06892472288660854,
"grad_norm": 1.0625,
"learning_rate": 0.000485970462341878,
"loss": 6.2373,
"mean_token_accuracy": 0.12175923585891724,
"num_tokens": 2377576.0,
"step": 1340
},
{
"entropy": 6.255672264099121,
"epoch": 0.06918190468842425,
"grad_norm": 1.1640625,
"learning_rate": 0.00048555807706366044,
"loss": 6.2313,
"mean_token_accuracy": 0.11880970671772957,
"num_tokens": 2386658.0,
"step": 1345
},
{
"entropy": 6.267937898635864,
"epoch": 0.06943908649023996,
"grad_norm": 1.125,
"learning_rate": 0.00048513991922939756,
"loss": 6.2557,
"mean_token_accuracy": 0.12166587859392167,
"num_tokens": 2395340.0,
"step": 1350
},
{
"entropy": 6.228494787216187,
"epoch": 0.06969626829205565,
"grad_norm": 1.046875,
"learning_rate": 0.00048471600030309744,
"loss": 6.287,
"mean_token_accuracy": 0.11910992339253426,
"num_tokens": 2404844.0,
"step": 1355
},
{
"entropy": 6.3855327606201175,
"epoch": 0.06995345009387136,
"grad_norm": 1.1484375,
"learning_rate": 0.00048428633190671186,
"loss": 6.2122,
"mean_token_accuracy": 0.11871807649731636,
"num_tokens": 2413641.0,
"step": 1360
},
{
"entropy": 6.2528892993927006,
"epoch": 0.07021063189568706,
"grad_norm": 1.0859375,
"learning_rate": 0.0004838509258198167,
"loss": 6.2608,
"mean_token_accuracy": 0.12074613049626351,
"num_tokens": 2423065.0,
"step": 1365
},
{
"entropy": 6.365111207962036,
"epoch": 0.07046781369750277,
"grad_norm": 1.1640625,
"learning_rate": 0.00048340979397929,
"loss": 6.1988,
"mean_token_accuracy": 0.1260582149028778,
"num_tokens": 2432486.0,
"step": 1370
},
{
"entropy": 6.297368955612183,
"epoch": 0.07072499549931847,
"grad_norm": 1.171875,
"learning_rate": 0.00048296294847898386,
"loss": 6.2855,
"mean_token_accuracy": 0.1175057515501976,
"num_tokens": 2441582.0,
"step": 1375
},
{
"entropy": 6.272958660125733,
"epoch": 0.07098217730113417,
"grad_norm": 1.046875,
"learning_rate": 0.0004825104015693934,
"loss": 6.1998,
"mean_token_accuracy": 0.1187170147895813,
"num_tokens": 2450618.0,
"step": 1380
},
{
"entropy": 6.21057162284851,
"epoch": 0.07123935910294987,
"grad_norm": 1.0234375,
"learning_rate": 0.0004820521656573208,
"loss": 6.2205,
"mean_token_accuracy": 0.11892557591199875,
"num_tokens": 2459346.0,
"step": 1385
},
{
"entropy": 6.275320386886596,
"epoch": 0.07149654090476558,
"grad_norm": 1.15625,
"learning_rate": 0.00048158825330553505,
"loss": 6.2183,
"mean_token_accuracy": 0.12063762545585632,
"num_tokens": 2467775.0,
"step": 1390
},
{
"entropy": 6.233735370635986,
"epoch": 0.07175372270658129,
"grad_norm": 1.21875,
"learning_rate": 0.00048111867723242763,
"loss": 6.0805,
"mean_token_accuracy": 0.12942860201001166,
"num_tokens": 2475732.0,
"step": 1395
},
{
"entropy": 6.302308511734009,
"epoch": 0.07201090450839699,
"grad_norm": 1.0859375,
"learning_rate": 0.0004806434503116637,
"loss": 6.2751,
"mean_token_accuracy": 0.11736578792333603,
"num_tokens": 2484468.0,
"step": 1400
},
{
"entropy": 6.20477180480957,
"epoch": 0.07226808631021268,
"grad_norm": 1.1015625,
"learning_rate": 0.0004801625855718296,
"loss": 6.0979,
"mean_token_accuracy": 0.12714530006051064,
"num_tokens": 2492945.0,
"step": 1405
},
{
"entropy": 6.303807067871094,
"epoch": 0.07252526811202839,
"grad_norm": 1.015625,
"learning_rate": 0.00047967609619607477,
"loss": 6.2581,
"mean_token_accuracy": 0.12180023640394211,
"num_tokens": 2502267.0,
"step": 1410
},
{
"entropy": 6.076932668685913,
"epoch": 0.0727824499138441,
"grad_norm": 1.1171875,
"learning_rate": 0.0004791839955217513,
"loss": 6.1385,
"mean_token_accuracy": 0.12108586356043816,
"num_tokens": 2511182.0,
"step": 1415
},
{
"entropy": 6.260076665878296,
"epoch": 0.0730396317156598,
"grad_norm": 1.09375,
"learning_rate": 0.00047868629704004786,
"loss": 6.2165,
"mean_token_accuracy": 0.11969843655824661,
"num_tokens": 2519756.0,
"step": 1420
},
{
"entropy": 6.295289468765259,
"epoch": 0.07329681351747551,
"grad_norm": 1.078125,
"learning_rate": 0.00047818301439561965,
"loss": 6.2174,
"mean_token_accuracy": 0.12359980940818786,
"num_tokens": 2528925.0,
"step": 1425
},
{
"entropy": 6.314094161987304,
"epoch": 0.0735539953192912,
"grad_norm": 1.078125,
"learning_rate": 0.00047767416138621454,
"loss": 6.2839,
"mean_token_accuracy": 0.11689749956130982,
"num_tokens": 2538557.0,
"step": 1430
},
{
"entropy": 6.229358911514282,
"epoch": 0.07381117712110691,
"grad_norm": 1.1484375,
"learning_rate": 0.000477159751962295,
"loss": 6.1894,
"mean_token_accuracy": 0.12646755203604698,
"num_tokens": 2547190.0,
"step": 1435
},
{
"entropy": 6.241942453384399,
"epoch": 0.07406835892292261,
"grad_norm": 1.1015625,
"learning_rate": 0.00047663980022665507,
"loss": 6.2148,
"mean_token_accuracy": 0.12242325693368912,
"num_tokens": 2556168.0,
"step": 1440
},
{
"entropy": 6.306135368347168,
"epoch": 0.07432554072473832,
"grad_norm": 1.078125,
"learning_rate": 0.00047611432043403437,
"loss": 6.2626,
"mean_token_accuracy": 0.1197875827550888,
"num_tokens": 2565409.0,
"step": 1445
},
{
"entropy": 6.228486442565918,
"epoch": 0.07458272252655403,
"grad_norm": 1.1328125,
"learning_rate": 0.0004755833269907267,
"loss": 6.0994,
"mean_token_accuracy": 0.12629354000091553,
"num_tokens": 2574710.0,
"step": 1450
},
{
"entropy": 6.119667053222656,
"epoch": 0.07483990432836972,
"grad_norm": 1.09375,
"learning_rate": 0.0004750468344541857,
"loss": 6.0366,
"mean_token_accuracy": 0.13156967237591743,
"num_tokens": 2583210.0,
"step": 1455
},
{
"entropy": 6.1274964809417725,
"epoch": 0.07509708613018543,
"grad_norm": 1.078125,
"learning_rate": 0.00047450485753262525,
"loss": 6.0896,
"mean_token_accuracy": 0.13029113933444023,
"num_tokens": 2592143.0,
"step": 1460
},
{
"entropy": 6.23237795829773,
"epoch": 0.07535426793200113,
"grad_norm": 1.234375,
"learning_rate": 0.00047395741108461633,
"loss": 6.0884,
"mean_token_accuracy": 0.1269154392182827,
"num_tokens": 2601051.0,
"step": 1465
},
{
"entropy": 6.124324464797974,
"epoch": 0.07561144973381684,
"grad_norm": 1.25,
"learning_rate": 0.00047340451011867985,
"loss": 6.1757,
"mean_token_accuracy": 0.12620116993784905,
"num_tokens": 2609334.0,
"step": 1470
},
{
"entropy": 6.34974856376648,
"epoch": 0.07586863153563254,
"grad_norm": 1.0078125,
"learning_rate": 0.00047284616979287515,
"loss": 6.2833,
"mean_token_accuracy": 0.1270563654601574,
"num_tokens": 2618670.0,
"step": 1475
},
{
"entropy": 6.1445026874542235,
"epoch": 0.07612581333744824,
"grad_norm": 1.1015625,
"learning_rate": 0.00047228240541438433,
"loss": 6.1026,
"mean_token_accuracy": 0.12804780080914496,
"num_tokens": 2627829.0,
"step": 1480
},
{
"entropy": 6.234681034088135,
"epoch": 0.07638299513926394,
"grad_norm": 1.1171875,
"learning_rate": 0.00047171323243909257,
"loss": 6.0433,
"mean_token_accuracy": 0.132904352247715,
"num_tokens": 2636508.0,
"step": 1485
},
{
"entropy": 6.130121564865112,
"epoch": 0.07664017694107965,
"grad_norm": 1.078125,
"learning_rate": 0.00047113866647116457,
"loss": 6.1347,
"mean_token_accuracy": 0.12549900785088539,
"num_tokens": 2645713.0,
"step": 1490
},
{
"entropy": 6.149539947509766,
"epoch": 0.07689735874289536,
"grad_norm": 1.09375,
"learning_rate": 0.0004705587232626164,
"loss": 6.0803,
"mean_token_accuracy": 0.13423071429133415,
"num_tokens": 2654194.0,
"step": 1495
},
{
"entropy": 6.214192914962768,
"epoch": 0.07715454054471106,
"grad_norm": 1.1171875,
"learning_rate": 0.00046997341871288424,
"loss": 6.1258,
"mean_token_accuracy": 0.12882963046431542,
"num_tokens": 2662932.0,
"step": 1500
},
{
"entropy": 6.174128580093384,
"epoch": 0.07741172234652675,
"grad_norm": 1.140625,
"learning_rate": 0.0004693827688683879,
"loss": 6.1027,
"mean_token_accuracy": 0.12451449260115624,
"num_tokens": 2671245.0,
"step": 1505
},
{
"entropy": 6.222696208953858,
"epoch": 0.07766890414834246,
"grad_norm": 1.140625,
"learning_rate": 0.0004687867899220914,
"loss": 6.1711,
"mean_token_accuracy": 0.12424503639340401,
"num_tokens": 2680046.0,
"step": 1510
},
{
"entropy": 6.313079404830932,
"epoch": 0.07792608595015817,
"grad_norm": 1.15625,
"learning_rate": 0.00046818549821305846,
"loss": 6.2791,
"mean_token_accuracy": 0.1235924281179905,
"num_tokens": 2689068.0,
"step": 1515
},
{
"entropy": 6.171900749206543,
"epoch": 0.07818326775197387,
"grad_norm": 1.1328125,
"learning_rate": 0.00046757891022600494,
"loss": 6.1385,
"mean_token_accuracy": 0.1261700503528118,
"num_tokens": 2697769.0,
"step": 1520
},
{
"entropy": 6.238068675994873,
"epoch": 0.07844044955378958,
"grad_norm": 1.1640625,
"learning_rate": 0.0004669670425908471,
"loss": 6.1439,
"mean_token_accuracy": 0.1273744858801365,
"num_tokens": 2705974.0,
"step": 1525
},
{
"entropy": 6.148878479003907,
"epoch": 0.07869763135560527,
"grad_norm": 1.1171875,
"learning_rate": 0.0004663499120822451,
"loss": 6.1141,
"mean_token_accuracy": 0.12810297608375548,
"num_tokens": 2714877.0,
"step": 1530
},
{
"entropy": 6.266905450820923,
"epoch": 0.07895481315742098,
"grad_norm": 1.0703125,
"learning_rate": 0.0004657275356191437,
"loss": 6.2756,
"mean_token_accuracy": 0.11889293268322945,
"num_tokens": 2723922.0,
"step": 1535
},
{
"entropy": 6.159636354446411,
"epoch": 0.07921199495923668,
"grad_norm": 1.1328125,
"learning_rate": 0.00046509993026430804,
"loss": 6.0852,
"mean_token_accuracy": 0.12158769443631172,
"num_tokens": 2733233.0,
"step": 1540
},
{
"entropy": 6.244900512695312,
"epoch": 0.07946917676105239,
"grad_norm": 1.078125,
"learning_rate": 0.0004644671132238558,
"loss": 6.1514,
"mean_token_accuracy": 0.12227895259857177,
"num_tokens": 2741977.0,
"step": 1545
},
{
"entropy": 6.198960208892823,
"epoch": 0.0797263585628681,
"grad_norm": 1.1484375,
"learning_rate": 0.00046382910184678585,
"loss": 6.1703,
"mean_token_accuracy": 0.12280954793095589,
"num_tokens": 2750761.0,
"step": 1550
},
{
"entropy": 6.193390226364135,
"epoch": 0.07998354036468379,
"grad_norm": 1.015625,
"learning_rate": 0.0004631859136245025,
"loss": 6.1144,
"mean_token_accuracy": 0.12151789665222168,
"num_tokens": 2760738.0,
"step": 1555
},
{
"entropy": 6.193670558929443,
"epoch": 0.0802407221664995,
"grad_norm": 1.09375,
"learning_rate": 0.0004625375661903357,
"loss": 6.1398,
"mean_token_accuracy": 0.12551755905151368,
"num_tokens": 2769818.0,
"step": 1560
},
{
"entropy": 6.144148969650269,
"epoch": 0.0804979039683152,
"grad_norm": 1.09375,
"learning_rate": 0.00046188407731905787,
"loss": 6.06,
"mean_token_accuracy": 0.12714403718709946,
"num_tokens": 2778779.0,
"step": 1565
},
{
"entropy": 6.2248434066772464,
"epoch": 0.08075508577013091,
"grad_norm": 1.09375,
"learning_rate": 0.00046122546492639643,
"loss": 6.1296,
"mean_token_accuracy": 0.12499245777726173,
"num_tokens": 2787977.0,
"step": 1570
},
{
"entropy": 6.065084409713745,
"epoch": 0.08101226757194661,
"grad_norm": 1.1171875,
"learning_rate": 0.000460561747068543,
"loss": 6.0838,
"mean_token_accuracy": 0.13301576748490335,
"num_tokens": 2796565.0,
"step": 1575
},
{
"entropy": 6.25233154296875,
"epoch": 0.0812694493737623,
"grad_norm": 1.109375,
"learning_rate": 0.0004598929419416578,
"loss": 6.144,
"mean_token_accuracy": 0.12637140676379205,
"num_tokens": 2805338.0,
"step": 1580
},
{
"entropy": 6.19027190208435,
"epoch": 0.08152663117557801,
"grad_norm": 1.125,
"learning_rate": 0.00045921906788137123,
"loss": 6.1522,
"mean_token_accuracy": 0.12466087937355042,
"num_tokens": 2815288.0,
"step": 1585
},
{
"entropy": 6.151868438720703,
"epoch": 0.08178381297739372,
"grad_norm": 1.1015625,
"learning_rate": 0.00045854014336228115,
"loss": 6.0995,
"mean_token_accuracy": 0.12922126054763794,
"num_tokens": 2824544.0,
"step": 1590
},
{
"entropy": 6.101247835159302,
"epoch": 0.08204099477920943,
"grad_norm": 1.078125,
"learning_rate": 0.00045785618699744615,
"loss": 6.0348,
"mean_token_accuracy": 0.133967836946249,
"num_tokens": 2833252.0,
"step": 1595
},
{
"entropy": 6.20477991104126,
"epoch": 0.08229817658102513,
"grad_norm": 1.21875,
"learning_rate": 0.00045716721753787543,
"loss": 6.1093,
"mean_token_accuracy": 0.12315899506211281,
"num_tokens": 2842205.0,
"step": 1600
},
{
"entropy": 6.083947086334229,
"epoch": 0.08255535838284082,
"grad_norm": 1.078125,
"learning_rate": 0.0004564732538720148,
"loss": 6.0383,
"mean_token_accuracy": 0.12902023196220397,
"num_tokens": 2850665.0,
"step": 1605
},
{
"entropy": 6.144789600372315,
"epoch": 0.08281254018465653,
"grad_norm": 1.0859375,
"learning_rate": 0.00045577431502522877,
"loss": 6.061,
"mean_token_accuracy": 0.12983368337154388,
"num_tokens": 2859757.0,
"step": 1610
},
{
"entropy": 6.245366430282592,
"epoch": 0.08306972198647224,
"grad_norm": 1.0546875,
"learning_rate": 0.0004550704201592787,
"loss": 6.1424,
"mean_token_accuracy": 0.12511212080717088,
"num_tokens": 2869478.0,
"step": 1615
},
{
"entropy": 6.078303718566895,
"epoch": 0.08332690378828794,
"grad_norm": 1.1484375,
"learning_rate": 0.0004543615885717981,
"loss": 5.9903,
"mean_token_accuracy": 0.13801901265978814,
"num_tokens": 2877014.0,
"step": 1620
},
{
"entropy": 6.053305196762085,
"epoch": 0.08358408559010365,
"grad_norm": 1.09375,
"learning_rate": 0.00045364783969576296,
"loss": 5.9403,
"mean_token_accuracy": 0.1358281835913658,
"num_tokens": 2885532.0,
"step": 1625
},
{
"entropy": 6.125780868530273,
"epoch": 0.08384126739191934,
"grad_norm": 1.09375,
"learning_rate": 0.0004529291930989592,
"loss": 6.0559,
"mean_token_accuracy": 0.12762951701879502,
"num_tokens": 2894723.0,
"step": 1630
},
{
"entropy": 6.033651685714721,
"epoch": 0.08409844919373505,
"grad_norm": 1.1171875,
"learning_rate": 0.0004522056684834464,
"loss": 5.9844,
"mean_token_accuracy": 0.13187647312879563,
"num_tokens": 2903479.0,
"step": 1635
},
{
"entropy": 6.216282892227173,
"epoch": 0.08435563099555075,
"grad_norm": 1.0859375,
"learning_rate": 0.0004514772856850173,
"loss": 6.0733,
"mean_token_accuracy": 0.126427498459816,
"num_tokens": 2912339.0,
"step": 1640
},
{
"entropy": 6.062296152114868,
"epoch": 0.08461281279736646,
"grad_norm": 1.0546875,
"learning_rate": 0.0004507440646726542,
"loss": 5.9916,
"mean_token_accuracy": 0.1297301597893238,
"num_tokens": 2921525.0,
"step": 1645
},
{
"entropy": 6.131249952316284,
"epoch": 0.08486999459918217,
"grad_norm": 1.078125,
"learning_rate": 0.0004500060255479818,
"loss": 6.0996,
"mean_token_accuracy": 0.1292259730398655,
"num_tokens": 2930007.0,
"step": 1650
},
{
"entropy": 6.113132810592651,
"epoch": 0.08512717640099786,
"grad_norm": 1.109375,
"learning_rate": 0.0004492631885447151,
"loss": 6.0075,
"mean_token_accuracy": 0.13707797154784201,
"num_tokens": 2938781.0,
"step": 1655
},
{
"entropy": 6.17734169960022,
"epoch": 0.08538435820281357,
"grad_norm": 1.046875,
"learning_rate": 0.00044851557402810616,
"loss": 6.1489,
"mean_token_accuracy": 0.12741673737764359,
"num_tokens": 2947219.0,
"step": 1660
},
{
"entropy": 6.159033012390137,
"epoch": 0.08564154000462927,
"grad_norm": 1.1328125,
"learning_rate": 0.00044776320249438444,
"loss": 6.102,
"mean_token_accuracy": 0.13058205023407937,
"num_tokens": 2956055.0,
"step": 1665
},
{
"entropy": 6.106929969787598,
"epoch": 0.08589872180644498,
"grad_norm": 1.1015625,
"learning_rate": 0.00044700609457019565,
"loss": 6.0306,
"mean_token_accuracy": 0.1294600822031498,
"num_tokens": 2965232.0,
"step": 1670
},
{
"entropy": 6.1184930324554445,
"epoch": 0.08615590360826068,
"grad_norm": 1.0625,
"learning_rate": 0.0004462442710120359,
"loss": 6.0627,
"mean_token_accuracy": 0.13047947734594345,
"num_tokens": 2974055.0,
"step": 1675
},
{
"entropy": 6.149667358398437,
"epoch": 0.08641308541007638,
"grad_norm": 1.1171875,
"learning_rate": 0.000445477752705683,
"loss": 6.058,
"mean_token_accuracy": 0.13411957547068595,
"num_tokens": 2982674.0,
"step": 1680
},
{
"entropy": 6.188984203338623,
"epoch": 0.08667026721189208,
"grad_norm": 1.1328125,
"learning_rate": 0.00044470656066562336,
"loss": 6.1543,
"mean_token_accuracy": 0.1249298483133316,
"num_tokens": 2990829.0,
"step": 1685
},
{
"entropy": 6.120514965057373,
"epoch": 0.08692744901370779,
"grad_norm": 1.03125,
"learning_rate": 0.0004439307160344765,
"loss": 6.106,
"mean_token_accuracy": 0.13009767308831216,
"num_tokens": 2999601.0,
"step": 1690
},
{
"entropy": 6.106043910980224,
"epoch": 0.0871846308155235,
"grad_norm": 1.15625,
"learning_rate": 0.00044315024008241473,
"loss": 6.0826,
"mean_token_accuracy": 0.1321030043065548,
"num_tokens": 3008428.0,
"step": 1695
},
{
"entropy": 6.21539421081543,
"epoch": 0.0874418126173392,
"grad_norm": 1.0390625,
"learning_rate": 0.0004423651542065806,
"loss": 6.1421,
"mean_token_accuracy": 0.12425650283694267,
"num_tokens": 3017535.0,
"step": 1700
},
{
"entropy": 6.081898880004883,
"epoch": 0.0876989944191549,
"grad_norm": 1.0546875,
"learning_rate": 0.00044157547993050006,
"loss": 6.1069,
"mean_token_accuracy": 0.12386454865336419,
"num_tokens": 3026091.0,
"step": 1705
},
{
"entropy": 6.190816974639892,
"epoch": 0.0879561762209706,
"grad_norm": 1.1015625,
"learning_rate": 0.00044078123890349227,
"loss": 6.0314,
"mean_token_accuracy": 0.12939157485961914,
"num_tokens": 3034622.0,
"step": 1710
},
{
"entropy": 6.089109134674072,
"epoch": 0.0882133580227863,
"grad_norm": 1.1875,
"learning_rate": 0.00043998245290007606,
"loss": 6.1176,
"mean_token_accuracy": 0.12585034891963004,
"num_tokens": 3044166.0,
"step": 1715
},
{
"entropy": 6.06969723701477,
"epoch": 0.08847053982460201,
"grad_norm": 1.078125,
"learning_rate": 0.00043917914381937323,
"loss": 5.9706,
"mean_token_accuracy": 0.1360363095998764,
"num_tokens": 3052770.0,
"step": 1720
},
{
"entropy": 6.098641729354858,
"epoch": 0.08872772162641772,
"grad_norm": 1.0703125,
"learning_rate": 0.00043837133368450815,
"loss": 5.9318,
"mean_token_accuracy": 0.1331650085747242,
"num_tokens": 3061967.0,
"step": 1725
},
{
"entropy": 6.091753768920898,
"epoch": 0.08898490342823343,
"grad_norm": 1.1015625,
"learning_rate": 0.0004375590446420037,
"loss": 6.1044,
"mean_token_accuracy": 0.12449745461344719,
"num_tokens": 3071470.0,
"step": 1730
},
{
"entropy": 6.173467111587525,
"epoch": 0.08924208523004912,
"grad_norm": 1.09375,
"learning_rate": 0.0004367422989611743,
"loss": 6.2809,
"mean_token_accuracy": 0.11852860525250435,
"num_tokens": 3081776.0,
"step": 1735
},
{
"entropy": 6.250823545455932,
"epoch": 0.08949926703186482,
"grad_norm": 1.0546875,
"learning_rate": 0.0004359211190335153,
"loss": 6.0688,
"mean_token_accuracy": 0.12610838413238526,
"num_tokens": 3091284.0,
"step": 1740
},
{
"entropy": 6.147873067855835,
"epoch": 0.08975644883368053,
"grad_norm": 1.109375,
"learning_rate": 0.00043509552737208923,
"loss": 6.0852,
"mean_token_accuracy": 0.13501820713281631,
"num_tokens": 3100129.0,
"step": 1745
},
{
"entropy": 6.126709890365601,
"epoch": 0.09001363063549624,
"grad_norm": 1.15625,
"learning_rate": 0.00043426554661090853,
"loss": 6.0035,
"mean_token_accuracy": 0.13482855185866355,
"num_tokens": 3109255.0,
"step": 1750
},
{
"entropy": 6.014013624191284,
"epoch": 0.09027081243731194,
"grad_norm": 1.0859375,
"learning_rate": 0.00043343119950431516,
"loss": 5.9668,
"mean_token_accuracy": 0.13436976298689843,
"num_tokens": 3118562.0,
"step": 1755
},
{
"entropy": 6.143547010421753,
"epoch": 0.09052799423912763,
"grad_norm": 1.1171875,
"learning_rate": 0.00043259250892635644,
"loss": 6.0631,
"mean_token_accuracy": 0.13537074699997903,
"num_tokens": 3127139.0,
"step": 1760
},
{
"entropy": 6.104552841186523,
"epoch": 0.09078517604094334,
"grad_norm": 1.1015625,
"learning_rate": 0.0004317494978701582,
"loss": 6.0492,
"mean_token_accuracy": 0.13329893127083778,
"num_tokens": 3135434.0,
"step": 1765
},
{
"entropy": 6.1294732093811035,
"epoch": 0.09104235784275905,
"grad_norm": 1.125,
"learning_rate": 0.0004309021894472943,
"loss": 6.0021,
"mean_token_accuracy": 0.1337900497019291,
"num_tokens": 3144173.0,
"step": 1770
},
{
"entropy": 6.173466730117798,
"epoch": 0.09129953964457475,
"grad_norm": 1.1328125,
"learning_rate": 0.0004300506068871534,
"loss": 6.0893,
"mean_token_accuracy": 0.1304582491517067,
"num_tokens": 3153112.0,
"step": 1775
},
{
"entropy": 6.128057193756104,
"epoch": 0.09155672144639046,
"grad_norm": 1.03125,
"learning_rate": 0.00042919477353630135,
"loss": 5.9737,
"mean_token_accuracy": 0.13518399819731713,
"num_tokens": 3161738.0,
"step": 1780
},
{
"entropy": 6.069469690322876,
"epoch": 0.09181390324820615,
"grad_norm": 1.1171875,
"learning_rate": 0.000428334712857842,
"loss": 6.0349,
"mean_token_accuracy": 0.13572588711977004,
"num_tokens": 3170407.0,
"step": 1785
},
{
"entropy": 6.1224860668182375,
"epoch": 0.09207108505002186,
"grad_norm": 1.125,
"learning_rate": 0.00042747044843077304,
"loss": 6.0035,
"mean_token_accuracy": 0.13542618602514267,
"num_tokens": 3178883.0,
"step": 1790
},
{
"entropy": 6.139774894714355,
"epoch": 0.09232826685183756,
"grad_norm": 1.0546875,
"learning_rate": 0.00042660200394934047,
"loss": 6.0829,
"mean_token_accuracy": 0.1297149181365967,
"num_tokens": 3188003.0,
"step": 1795
},
{
"entropy": 6.077296495437622,
"epoch": 0.09258544865365327,
"grad_norm": 0.96875,
"learning_rate": 0.00042572940322238844,
"loss": 5.9886,
"mean_token_accuracy": 0.13486197963356972,
"num_tokens": 3197525.0,
"step": 1800
},
{
"entropy": 6.095264530181884,
"epoch": 0.09284263045546898,
"grad_norm": 1.125,
"learning_rate": 0.00042485267017270664,
"loss": 6.0382,
"mean_token_accuracy": 0.1342827245593071,
"num_tokens": 3206255.0,
"step": 1805
},
{
"entropy": 6.041297388076782,
"epoch": 0.09309981225728467,
"grad_norm": 1.125,
"learning_rate": 0.0004239718288363745,
"loss": 6.0391,
"mean_token_accuracy": 0.13267314657568932,
"num_tokens": 3216132.0,
"step": 1810
},
{
"entropy": 6.128677415847778,
"epoch": 0.09335699405910038,
"grad_norm": 1.140625,
"learning_rate": 0.0004230869033621023,
"loss": 5.922,
"mean_token_accuracy": 0.12952762022614478,
"num_tokens": 3224740.0,
"step": 1815
},
{
"entropy": 6.015822505950927,
"epoch": 0.09361417586091608,
"grad_norm": 1.203125,
"learning_rate": 0.0004221979180105688,
"loss": 5.976,
"mean_token_accuracy": 0.13513584956526756,
"num_tokens": 3233408.0,
"step": 1820
},
{
"entropy": 6.133046579360962,
"epoch": 0.09387135766273179,
"grad_norm": 1.1171875,
"learning_rate": 0.00042130489715375645,
"loss": 6.0176,
"mean_token_accuracy": 0.13694472312927247,
"num_tokens": 3242488.0,
"step": 1825
},
{
"entropy": 6.024254989624024,
"epoch": 0.0941285394645475,
"grad_norm": 1.0703125,
"learning_rate": 0.00042040786527428335,
"loss": 5.9989,
"mean_token_accuracy": 0.13015589714050294,
"num_tokens": 3251255.0,
"step": 1830
},
{
"entropy": 6.021305656433105,
"epoch": 0.09438572126636319,
"grad_norm": 1.0703125,
"learning_rate": 0.0004195068469647315,
"loss": 5.9459,
"mean_token_accuracy": 0.1366763137280941,
"num_tokens": 3260057.0,
"step": 1835
},
{
"entropy": 6.105194091796875,
"epoch": 0.0946429030681789,
"grad_norm": 1.1484375,
"learning_rate": 0.00041860186692697297,
"loss": 6.0506,
"mean_token_accuracy": 0.1300404965877533,
"num_tokens": 3269568.0,
"step": 1840
},
{
"entropy": 6.051248598098755,
"epoch": 0.0949000848699946,
"grad_norm": 1.0625,
"learning_rate": 0.00041769294997149264,
"loss": 5.9672,
"mean_token_accuracy": 0.13426859453320503,
"num_tokens": 3278709.0,
"step": 1845
},
{
"entropy": 6.1222248554229735,
"epoch": 0.0951572666718103,
"grad_norm": 1.046875,
"learning_rate": 0.0004167801210167081,
"loss": 6.0727,
"mean_token_accuracy": 0.12258832827210427,
"num_tokens": 3287870.0,
"step": 1850
},
{
"entropy": 6.1391997814178465,
"epoch": 0.09541444847362601,
"grad_norm": 1.125,
"learning_rate": 0.0004158634050882861,
"loss": 6.0296,
"mean_token_accuracy": 0.13176685199141502,
"num_tokens": 3296681.0,
"step": 1855
},
{
"entropy": 6.014973878860474,
"epoch": 0.0956716302754417,
"grad_norm": 1.25,
"learning_rate": 0.0004149428273184569,
"loss": 5.9713,
"mean_token_accuracy": 0.13487191423773764,
"num_tokens": 3305201.0,
"step": 1860
},
{
"entropy": 6.063941383361817,
"epoch": 0.09592881207725741,
"grad_norm": 1.109375,
"learning_rate": 0.0004140184129453253,
"loss": 5.972,
"mean_token_accuracy": 0.13490609005093573,
"num_tokens": 3314005.0,
"step": 1865
},
{
"entropy": 6.057723140716552,
"epoch": 0.09618599387907312,
"grad_norm": 1.0859375,
"learning_rate": 0.000413090187312178,
"loss": 5.8632,
"mean_token_accuracy": 0.1374638482928276,
"num_tokens": 3322599.0,
"step": 1870
},
{
"entropy": 5.972152233123779,
"epoch": 0.09644317568088882,
"grad_norm": 1.1796875,
"learning_rate": 0.0004121581758667898,
"loss": 5.9519,
"mean_token_accuracy": 0.13511499017477036,
"num_tokens": 3331230.0,
"step": 1875
},
{
"entropy": 6.020901203155518,
"epoch": 0.09670035748270453,
"grad_norm": 1.15625,
"learning_rate": 0.00041122240416072533,
"loss": 5.8722,
"mean_token_accuracy": 0.14036940708756446,
"num_tokens": 3339313.0,
"step": 1880
},
{
"entropy": 6.072263526916504,
"epoch": 0.09695753928452022,
"grad_norm": 1.078125,
"learning_rate": 0.0004102828978486385,
"loss": 5.9417,
"mean_token_accuracy": 0.1329902485013008,
"num_tokens": 3348482.0,
"step": 1885
},
{
"entropy": 6.092586088180542,
"epoch": 0.09721472108633593,
"grad_norm": 1.140625,
"learning_rate": 0.0004093396826875695,
"loss": 6.0033,
"mean_token_accuracy": 0.1268253058195114,
"num_tokens": 3357282.0,
"step": 1890
},
{
"entropy": 6.038345813751221,
"epoch": 0.09747190288815163,
"grad_norm": 1.4375,
"learning_rate": 0.00040839278453623837,
"loss": 5.955,
"mean_token_accuracy": 0.13438157737255096,
"num_tokens": 3366215.0,
"step": 1895
},
{
"entropy": 6.0843383312225345,
"epoch": 0.09772908468996734,
"grad_norm": 1.015625,
"learning_rate": 0.0004074422293543363,
"loss": 5.9925,
"mean_token_accuracy": 0.13472680374979973,
"num_tokens": 3375235.0,
"step": 1900
},
{
"entropy": 6.089998579025268,
"epoch": 0.09798626649178305,
"grad_norm": 1.1171875,
"learning_rate": 0.0004064880432018137,
"loss": 6.0797,
"mean_token_accuracy": 0.12867710292339324,
"num_tokens": 3384474.0,
"step": 1905
},
{
"entropy": 6.151446151733398,
"epoch": 0.09824344829359874,
"grad_norm": 1.046875,
"learning_rate": 0.00040553025223816615,
"loss": 6.0629,
"mean_token_accuracy": 0.12482186406850815,
"num_tokens": 3393204.0,
"step": 1910
},
{
"entropy": 6.147669410705566,
"epoch": 0.09850063009541445,
"grad_norm": 1.1640625,
"learning_rate": 0.00040456888272171653,
"loss": 6.0145,
"mean_token_accuracy": 0.13083723485469817,
"num_tokens": 3402563.0,
"step": 1915
},
{
"entropy": 6.008180046081543,
"epoch": 0.09875781189723015,
"grad_norm": 1.0859375,
"learning_rate": 0.00040360396100889577,
"loss": 5.8704,
"mean_token_accuracy": 0.1350298307836056,
"num_tokens": 3411368.0,
"step": 1920
},
{
"entropy": 6.0020557880401615,
"epoch": 0.09901499369904586,
"grad_norm": 1.078125,
"learning_rate": 0.0004026355135535202,
"loss": 5.8921,
"mean_token_accuracy": 0.13632030189037322,
"num_tokens": 3420720.0,
"step": 1925
},
{
"entropy": 6.069166278839111,
"epoch": 0.09927217550086156,
"grad_norm": 1.203125,
"learning_rate": 0.000401663566906066,
"loss": 5.9239,
"mean_token_accuracy": 0.13785183504223825,
"num_tokens": 3428916.0,
"step": 1930
},
{
"entropy": 5.978689289093017,
"epoch": 0.09952935730267726,
"grad_norm": 1.1015625,
"learning_rate": 0.00040068814771294134,
"loss": 5.9116,
"mean_token_accuracy": 0.140623939037323,
"num_tokens": 3437173.0,
"step": 1935
},
{
"entropy": 5.957523679733276,
"epoch": 0.09978653910449296,
"grad_norm": 1.03125,
"learning_rate": 0.0003997092827157562,
"loss": 5.8591,
"mean_token_accuracy": 0.14056172966957092,
"num_tokens": 3445798.0,
"step": 1940
},
{
"entropy": 6.047778511047364,
"epoch": 0.10004372090630867,
"grad_norm": 1.1328125,
"learning_rate": 0.000398726998750589,
"loss": 5.9273,
"mean_token_accuracy": 0.13311707004904746,
"num_tokens": 3454052.0,
"step": 1945
},
{
"entropy": 6.044436407089234,
"epoch": 0.10030090270812438,
"grad_norm": 1.078125,
"learning_rate": 0.00039774132274725076,
"loss": 5.9193,
"mean_token_accuracy": 0.1355873964726925,
"num_tokens": 3462336.0,
"step": 1950
},
{
"entropy": 5.979900550842285,
"epoch": 0.10055808450994008,
"grad_norm": 1.1015625,
"learning_rate": 0.00039675228172854707,
"loss": 5.9603,
"mean_token_accuracy": 0.13676296770572663,
"num_tokens": 3471212.0,
"step": 1955
},
{
"entropy": 6.07159686088562,
"epoch": 0.10081526631175577,
"grad_norm": 1.171875,
"learning_rate": 0.0003957599028095371,
"loss": 5.9078,
"mean_token_accuracy": 0.13837847262620925,
"num_tokens": 3479607.0,
"step": 1960
},
{
"entropy": 6.047497510910034,
"epoch": 0.10107244811357148,
"grad_norm": 1.2578125,
"learning_rate": 0.00039476421319679017,
"loss": 6.0042,
"mean_token_accuracy": 0.13707230389118194,
"num_tokens": 3488337.0,
"step": 1965
},
{
"entropy": 6.111591434478759,
"epoch": 0.10132962991538719,
"grad_norm": 1.1484375,
"learning_rate": 0.00039376524018764,
"loss": 6.1034,
"mean_token_accuracy": 0.13102759942412376,
"num_tokens": 3497460.0,
"step": 1970
},
{
"entropy": 6.185532951354981,
"epoch": 0.1015868117172029,
"grad_norm": 1.0859375,
"learning_rate": 0.00039276301116943616,
"loss": 6.0032,
"mean_token_accuracy": 0.13004203960299493,
"num_tokens": 3506634.0,
"step": 1975
},
{
"entropy": 5.98096661567688,
"epoch": 0.1018439935190186,
"grad_norm": 1.09375,
"learning_rate": 0.0003917575536187936,
"loss": 5.9191,
"mean_token_accuracy": 0.13960360884666442,
"num_tokens": 3515644.0,
"step": 1980
},
{
"entropy": 5.970981121063232,
"epoch": 0.10210117532083429,
"grad_norm": 1.21875,
"learning_rate": 0.00039074889510083894,
"loss": 5.8547,
"mean_token_accuracy": 0.14273056983947754,
"num_tokens": 3524194.0,
"step": 1985
},
{
"entropy": 6.01817135810852,
"epoch": 0.10235835712265,
"grad_norm": 1.125,
"learning_rate": 0.00038973706326845495,
"loss": 5.9229,
"mean_token_accuracy": 0.1372055910527706,
"num_tokens": 3533909.0,
"step": 1990
},
{
"entropy": 6.011876392364502,
"epoch": 0.1026155389244657,
"grad_norm": 1.1015625,
"learning_rate": 0.0003887220858615225,
"loss": 5.966,
"mean_token_accuracy": 0.13570310175418854,
"num_tokens": 3542379.0,
"step": 1995
},
{
"entropy": 5.983093881607056,
"epoch": 0.10287272072628141,
"grad_norm": 1.125,
"learning_rate": 0.0003877039907061597,
"loss": 5.8474,
"mean_token_accuracy": 0.1440593920648098,
"num_tokens": 3551109.0,
"step": 2000
},
{
"entropy": 6.021899604797364,
"epoch": 0.10312990252809712,
"grad_norm": 1.140625,
"learning_rate": 0.0003866828057139598,
"loss": 5.9388,
"mean_token_accuracy": 0.13910572826862336,
"num_tokens": 3559366.0,
"step": 2005
},
{
"entropy": 5.953703784942627,
"epoch": 0.10338708432991281,
"grad_norm": 1.1015625,
"learning_rate": 0.00038565855888122503,
"loss": 5.8378,
"mean_token_accuracy": 0.1402948908507824,
"num_tokens": 3567713.0,
"step": 2010
},
{
"entropy": 6.010533189773559,
"epoch": 0.10364426613172852,
"grad_norm": 1.1328125,
"learning_rate": 0.00038463127828819975,
"loss": 6.0274,
"mean_token_accuracy": 0.13361438736319542,
"num_tokens": 3577609.0,
"step": 2015
},
{
"entropy": 6.03451361656189,
"epoch": 0.10390144793354422,
"grad_norm": 1.125,
"learning_rate": 0.00038360099209830043,
"loss": 5.8385,
"mean_token_accuracy": 0.14586896002292632,
"num_tokens": 3586735.0,
"step": 2020
},
{
"entropy": 6.068939876556397,
"epoch": 0.10415862973535993,
"grad_norm": 1.09375,
"learning_rate": 0.0003825677285573433,
"loss": 5.9755,
"mean_token_accuracy": 0.1315617948770523,
"num_tokens": 3595499.0,
"step": 2025
},
{
"entropy": 6.00121750831604,
"epoch": 0.10441581153717563,
"grad_norm": 1.1015625,
"learning_rate": 0.00038153151599277027,
"loss": 5.9199,
"mean_token_accuracy": 0.14222098216414453,
"num_tokens": 3604160.0,
"step": 2030
},
{
"entropy": 6.096150064468384,
"epoch": 0.10467299333899133,
"grad_norm": 1.1015625,
"learning_rate": 0.0003804923828128723,
"loss": 5.9753,
"mean_token_accuracy": 0.12967631593346596,
"num_tokens": 3612623.0,
"step": 2035
},
{
"entropy": 6.059585428237915,
"epoch": 0.10493017514080703,
"grad_norm": 1.1875,
"learning_rate": 0.0003794503575060104,
"loss": 5.9046,
"mean_token_accuracy": 0.134611614048481,
"num_tokens": 3621254.0,
"step": 2040
},
{
"entropy": 5.889829015731811,
"epoch": 0.10518735694262274,
"grad_norm": 1.109375,
"learning_rate": 0.00037840546863983484,
"loss": 5.893,
"mean_token_accuracy": 0.14060052409768103,
"num_tokens": 3630304.0,
"step": 2045
},
{
"entropy": 6.063463830947876,
"epoch": 0.10544453874443845,
"grad_norm": 1.0703125,
"learning_rate": 0.0003773577448605015,
"loss": 5.8709,
"mean_token_accuracy": 0.14505155757069588,
"num_tokens": 3638998.0,
"step": 2050
},
{
"entropy": 6.033182001113891,
"epoch": 0.10570172054625415,
"grad_norm": 1.0078125,
"learning_rate": 0.0003763072148918872,
"loss": 5.8719,
"mean_token_accuracy": 0.13738297373056413,
"num_tokens": 3648460.0,
"step": 2055
},
{
"entropy": 5.934378385543823,
"epoch": 0.10595890234806984,
"grad_norm": 1.171875,
"learning_rate": 0.0003752539075348017,
"loss": 5.8969,
"mean_token_accuracy": 0.1421407587826252,
"num_tokens": 3657453.0,
"step": 2060
},
{
"entropy": 5.934575700759888,
"epoch": 0.10621608414988555,
"grad_norm": 1.09375,
"learning_rate": 0.00037419785166619817,
"loss": 5.8757,
"mean_token_accuracy": 0.14191291332244874,
"num_tokens": 3666674.0,
"step": 2065
},
{
"entropy": 6.116357278823853,
"epoch": 0.10647326595170126,
"grad_norm": 1.09375,
"learning_rate": 0.0003731390762383818,
"loss": 5.9335,
"mean_token_accuracy": 0.1388901025056839,
"num_tokens": 3675081.0,
"step": 2070
},
{
"entropy": 6.037048578262329,
"epoch": 0.10673044775351696,
"grad_norm": 1.109375,
"learning_rate": 0.0003720776102782158,
"loss": 5.8962,
"mean_token_accuracy": 0.1339455910027027,
"num_tokens": 3684317.0,
"step": 2075
},
{
"entropy": 5.939728164672852,
"epoch": 0.10698762955533267,
"grad_norm": 1.1015625,
"learning_rate": 0.00037101348288632555,
"loss": 5.8328,
"mean_token_accuracy": 0.14282255843281746,
"num_tokens": 3692607.0,
"step": 2080
},
{
"entropy": 6.1606145858764645,
"epoch": 0.10724481135714836,
"grad_norm": 1.1328125,
"learning_rate": 0.0003699467232363012,
"loss": 6.0506,
"mean_token_accuracy": 0.13110460415482522,
"num_tokens": 3701733.0,
"step": 2085
},
{
"entropy": 6.007357835769653,
"epoch": 0.10750199315896407,
"grad_norm": 1.125,
"learning_rate": 0.0003688773605738973,
"loss": 5.8779,
"mean_token_accuracy": 0.13223487213253976,
"num_tokens": 3710618.0,
"step": 2090
},
{
"entropy": 5.94810266494751,
"epoch": 0.10775917496077977,
"grad_norm": 1.1015625,
"learning_rate": 0.00036780542421623134,
"loss": 5.8592,
"mean_token_accuracy": 0.1421344593167305,
"num_tokens": 3719736.0,
"step": 2095
},
{
"entropy": 5.966670894622803,
"epoch": 0.10801635676259548,
"grad_norm": 1.2109375,
"learning_rate": 0.0003667309435509802,
"loss": 5.873,
"mean_token_accuracy": 0.14545931667089462,
"num_tokens": 3728554.0,
"step": 2100
},
{
"entropy": 5.962731409072876,
"epoch": 0.10827353856441119,
"grad_norm": 1.125,
"learning_rate": 0.0003656539480355741,
"loss": 5.8829,
"mean_token_accuracy": 0.13873566016554834,
"num_tokens": 3737278.0,
"step": 2105
},
{
"entropy": 5.947574758529663,
"epoch": 0.10853072036622688,
"grad_norm": 1.09375,
"learning_rate": 0.0003645744671963891,
"loss": 5.8388,
"mean_token_accuracy": 0.1452670894563198,
"num_tokens": 3746470.0,
"step": 2110
},
{
"entropy": 5.99600191116333,
"epoch": 0.10878790216804259,
"grad_norm": 1.109375,
"learning_rate": 0.0003634925306279376,
"loss": 5.9006,
"mean_token_accuracy": 0.13959722667932511,
"num_tokens": 3755661.0,
"step": 2115
},
{
"entropy": 6.022242259979248,
"epoch": 0.10904508396985829,
"grad_norm": 1.015625,
"learning_rate": 0.0003624081679920574,
"loss": 6.0371,
"mean_token_accuracy": 0.13342893719673157,
"num_tokens": 3764832.0,
"step": 2120
},
{
"entropy": 6.087024259567261,
"epoch": 0.109302265771674,
"grad_norm": 1.1171875,
"learning_rate": 0.0003613214090170977,
"loss": 5.8853,
"mean_token_accuracy": 0.13842237889766693,
"num_tokens": 3773633.0,
"step": 2125
},
{
"entropy": 6.0287542819976805,
"epoch": 0.1095594475734897,
"grad_norm": 1.171875,
"learning_rate": 0.0003602322834971048,
"loss": 5.9697,
"mean_token_accuracy": 0.1348352313041687,
"num_tokens": 3781622.0,
"step": 2130
},
{
"entropy": 5.97002649307251,
"epoch": 0.1098166293753054,
"grad_norm": 1.0703125,
"learning_rate": 0.0003591408212910051,
"loss": 5.8459,
"mean_token_accuracy": 0.13936637341976166,
"num_tokens": 3790678.0,
"step": 2135
},
{
"entropy": 6.014022493362427,
"epoch": 0.1100738111771211,
"grad_norm": 1.1953125,
"learning_rate": 0.0003580470523217863,
"loss": 5.967,
"mean_token_accuracy": 0.13305697664618493,
"num_tokens": 3799260.0,
"step": 2140
},
{
"entropy": 6.105735874176025,
"epoch": 0.11033099297893681,
"grad_norm": 1.0546875,
"learning_rate": 0.0003569510065756771,
"loss": 5.9684,
"mean_token_accuracy": 0.1358775392174721,
"num_tokens": 3809015.0,
"step": 2145
},
{
"entropy": 5.99890923500061,
"epoch": 0.11058817478075252,
"grad_norm": 1.0546875,
"learning_rate": 0.0003558527141013254,
"loss": 5.8978,
"mean_token_accuracy": 0.13542463704943658,
"num_tokens": 3817591.0,
"step": 2150
},
{
"entropy": 6.0370848178863525,
"epoch": 0.11084535658256822,
"grad_norm": 1.1875,
"learning_rate": 0.0003547522050089742,
"loss": 6.021,
"mean_token_accuracy": 0.13292460292577743,
"num_tokens": 3827426.0,
"step": 2155
},
{
"entropy": 6.12569842338562,
"epoch": 0.11110253838438391,
"grad_norm": 1.203125,
"learning_rate": 0.00035364950946963606,
"loss": 5.9108,
"mean_token_accuracy": 0.13678978830575944,
"num_tokens": 3835535.0,
"step": 2160
},
{
"entropy": 5.991197919845581,
"epoch": 0.11135972018619962,
"grad_norm": 1.15625,
"learning_rate": 0.0003525446577142663,
"loss": 5.8521,
"mean_token_accuracy": 0.13940271139144897,
"num_tokens": 3843807.0,
"step": 2165
},
{
"entropy": 6.020745277404785,
"epoch": 0.11161690198801533,
"grad_norm": 1.1171875,
"learning_rate": 0.00035143768003293395,
"loss": 5.9114,
"mean_token_accuracy": 0.1366816468536854,
"num_tokens": 3852821.0,
"step": 2170
},
{
"entropy": 6.005236577987671,
"epoch": 0.11187408378983103,
"grad_norm": 1.0234375,
"learning_rate": 0.0003503286067739913,
"loss": 5.9094,
"mean_token_accuracy": 0.13549749478697776,
"num_tokens": 3862483.0,
"step": 2175
},
{
"entropy": 6.071946811676026,
"epoch": 0.11213126559164674,
"grad_norm": 1.171875,
"learning_rate": 0.00034921746834324193,
"loss": 5.9423,
"mean_token_accuracy": 0.13592587783932686,
"num_tokens": 3871702.0,
"step": 2180
},
{
"entropy": 5.981179523468017,
"epoch": 0.11238844739346243,
"grad_norm": 1.078125,
"learning_rate": 0.0003481042952031072,
"loss": 5.877,
"mean_token_accuracy": 0.14119011908769608,
"num_tokens": 3879489.0,
"step": 2185
},
{
"entropy": 6.002960681915283,
"epoch": 0.11264562919527814,
"grad_norm": 1.078125,
"learning_rate": 0.0003469891178717911,
"loss": 5.9092,
"mean_token_accuracy": 0.13691228330135347,
"num_tokens": 3889042.0,
"step": 2190
},
{
"entropy": 5.930085325241089,
"epoch": 0.11290281099709384,
"grad_norm": 1.1484375,
"learning_rate": 0.0003458719669224436,
"loss": 5.8274,
"mean_token_accuracy": 0.1413699135184288,
"num_tokens": 3897787.0,
"step": 2195
},
{
"entropy": 5.974176216125488,
"epoch": 0.11315999279890955,
"grad_norm": 1.078125,
"learning_rate": 0.0003447528729823221,
"loss": 5.8985,
"mean_token_accuracy": 0.13640068992972373,
"num_tokens": 3907117.0,
"step": 2200
},
{
"entropy": 6.045211410522461,
"epoch": 0.11341717460072526,
"grad_norm": 1.1796875,
"learning_rate": 0.0003436318667319525,
"loss": 5.8875,
"mean_token_accuracy": 0.136257354170084,
"num_tokens": 3915832.0,
"step": 2205
},
{
"entropy": 5.961761140823365,
"epoch": 0.11367435640254096,
"grad_norm": 1.1171875,
"learning_rate": 0.00034250897890428716,
"loss": 5.92,
"mean_token_accuracy": 0.14180033877491952,
"num_tokens": 3925291.0,
"step": 2210
},
{
"entropy": 5.964248991012573,
"epoch": 0.11393153820435666,
"grad_norm": 1.15625,
"learning_rate": 0.0003413842402838633,
"loss": 5.6798,
"mean_token_accuracy": 0.15023099184036254,
"num_tokens": 3933784.0,
"step": 2215
},
{
"entropy": 5.867644309997559,
"epoch": 0.11418872000617236,
"grad_norm": 1.0546875,
"learning_rate": 0.00034025768170595834,
"loss": 5.744,
"mean_token_accuracy": 0.14695340394973755,
"num_tokens": 3942166.0,
"step": 2220
},
{
"entropy": 5.947494602203369,
"epoch": 0.11444590180798807,
"grad_norm": 1.109375,
"learning_rate": 0.0003391293340557446,
"loss": 5.821,
"mean_token_accuracy": 0.14130731597542762,
"num_tokens": 3951236.0,
"step": 2225
},
{
"entropy": 5.957868671417236,
"epoch": 0.11470308360980377,
"grad_norm": 1.1015625,
"learning_rate": 0.0003379992282674431,
"loss": 5.8349,
"mean_token_accuracy": 0.13815009593963623,
"num_tokens": 3959865.0,
"step": 2230
},
{
"entropy": 5.949271821975708,
"epoch": 0.11496026541161948,
"grad_norm": 1.1875,
"learning_rate": 0.0003368673953234749,
"loss": 5.8612,
"mean_token_accuracy": 0.14323789328336717,
"num_tokens": 3968683.0,
"step": 2235
},
{
"entropy": 6.008644342422485,
"epoch": 0.11521744721343517,
"grad_norm": 1.09375,
"learning_rate": 0.00033573386625361176,
"loss": 5.8504,
"mean_token_accuracy": 0.13288640454411507,
"num_tokens": 3977729.0,
"step": 2240
},
{
"entropy": 5.971594619750976,
"epoch": 0.11547462901525088,
"grad_norm": 1.1875,
"learning_rate": 0.00033459867213412567,
"loss": 5.7966,
"mean_token_accuracy": 0.14251609444618224,
"num_tokens": 3986552.0,
"step": 2245
},
{
"entropy": 5.949598693847657,
"epoch": 0.11573181081706659,
"grad_norm": 1.0234375,
"learning_rate": 0.000333461844086937,
"loss": 5.7854,
"mean_token_accuracy": 0.14427516832947732,
"num_tokens": 3995721.0,
"step": 2250
},
{
"entropy": 5.895298337936401,
"epoch": 0.11598899261888229,
"grad_norm": 1.21875,
"learning_rate": 0.00033232341327876097,
"loss": 5.7933,
"mean_token_accuracy": 0.14527158439159393,
"num_tokens": 4003912.0,
"step": 2255
},
{
"entropy": 5.952937936782837,
"epoch": 0.116246174420698,
"grad_norm": 1.078125,
"learning_rate": 0.0003311834109202531,
"loss": 5.8264,
"mean_token_accuracy": 0.14057933837175368,
"num_tokens": 4013127.0,
"step": 2260
},
{
"entropy": 5.956308174133301,
"epoch": 0.11650335622251369,
"grad_norm": 1.2109375,
"learning_rate": 0.00033004186826515416,
"loss": 5.8836,
"mean_token_accuracy": 0.13978948220610618,
"num_tokens": 4022650.0,
"step": 2265
},
{
"entropy": 5.934606456756592,
"epoch": 0.1167605380243294,
"grad_norm": 1.0546875,
"learning_rate": 0.0003288988166094324,
"loss": 5.8271,
"mean_token_accuracy": 0.14565607085824012,
"num_tokens": 4032337.0,
"step": 2270
},
{
"entropy": 6.088882493972778,
"epoch": 0.1170177198261451,
"grad_norm": 1.1953125,
"learning_rate": 0.00032775428729042656,
"loss": 5.9627,
"mean_token_accuracy": 0.1381226435303688,
"num_tokens": 4040849.0,
"step": 2275
},
{
"entropy": 6.047893333435058,
"epoch": 0.11727490162796081,
"grad_norm": 1.0546875,
"learning_rate": 0.000326608311685986,
"loss": 5.8383,
"mean_token_accuracy": 0.14196593686938286,
"num_tokens": 4050085.0,
"step": 2280
},
{
"entropy": 5.916841983795166,
"epoch": 0.11753208342977652,
"grad_norm": 1.203125,
"learning_rate": 0.0003254609212136108,
"loss": 5.7805,
"mean_token_accuracy": 0.14623728320002555,
"num_tokens": 4058435.0,
"step": 2285
},
{
"entropy": 5.881429529190063,
"epoch": 0.11778926523159221,
"grad_norm": 1.1015625,
"learning_rate": 0.00032431214732959036,
"loss": 5.7854,
"mean_token_accuracy": 0.14314507246017455,
"num_tokens": 4067307.0,
"step": 2290
},
{
"entropy": 5.845193719863891,
"epoch": 0.11804644703340791,
"grad_norm": 1.046875,
"learning_rate": 0.000323162021528141,
"loss": 5.8497,
"mean_token_accuracy": 0.13934367150068283,
"num_tokens": 4076794.0,
"step": 2295
},
{
"entropy": 5.98328595161438,
"epoch": 0.11830362883522362,
"grad_norm": 1.0390625,
"learning_rate": 0.00032201057534054264,
"loss": 5.8994,
"mean_token_accuracy": 0.14008660316467286,
"num_tokens": 4085856.0,
"step": 2300
},
{
"entropy": 5.992867755889892,
"epoch": 0.11856081063703933,
"grad_norm": 1.046875,
"learning_rate": 0.00032085784033427414,
"loss": 5.8536,
"mean_token_accuracy": 0.1433585487306118,
"num_tokens": 4095297.0,
"step": 2305
},
{
"entropy": 6.014429998397827,
"epoch": 0.11881799243885503,
"grad_norm": 1.0078125,
"learning_rate": 0.0003197038481121478,
"loss": 5.8979,
"mean_token_accuracy": 0.13549182265996934,
"num_tokens": 4105066.0,
"step": 2310
},
{
"entropy": 6.060473871231079,
"epoch": 0.11907517424067073,
"grad_norm": 1.1328125,
"learning_rate": 0.0003185486303114436,
"loss": 5.8629,
"mean_token_accuracy": 0.13635988309979438,
"num_tokens": 4113473.0,
"step": 2315
},
{
"entropy": 5.887990808486938,
"epoch": 0.11933235604248643,
"grad_norm": 1.0859375,
"learning_rate": 0.0003173922186030409,
"loss": 5.8707,
"mean_token_accuracy": 0.14502280503511428,
"num_tokens": 4122544.0,
"step": 2320
},
{
"entropy": 6.007597160339356,
"epoch": 0.11958953784430214,
"grad_norm": 1.1875,
"learning_rate": 0.000316234644690551,
"loss": 5.9357,
"mean_token_accuracy": 0.14004722833633423,
"num_tokens": 4131548.0,
"step": 2325
},
{
"entropy": 6.023855304718017,
"epoch": 0.11984671964611784,
"grad_norm": 1.109375,
"learning_rate": 0.0003150759403094473,
"loss": 5.8971,
"mean_token_accuracy": 0.14639964699745178,
"num_tokens": 4140025.0,
"step": 2330
},
{
"entropy": 5.937837791442871,
"epoch": 0.12010390144793355,
"grad_norm": 1.171875,
"learning_rate": 0.00031391613722619587,
"loss": 5.8293,
"mean_token_accuracy": 0.14603792652487754,
"num_tokens": 4148684.0,
"step": 2335
},
{
"entropy": 6.02265305519104,
"epoch": 0.12036108324974924,
"grad_norm": 1.0625,
"learning_rate": 0.000312755267237384,
"loss": 5.9147,
"mean_token_accuracy": 0.136139065772295,
"num_tokens": 4158405.0,
"step": 2340
},
{
"entropy": 5.976344728469849,
"epoch": 0.12061826505156495,
"grad_norm": 1.09375,
"learning_rate": 0.0003115933621688488,
"loss": 5.6959,
"mean_token_accuracy": 0.14749561250209808,
"num_tokens": 4167643.0,
"step": 2345
},
{
"entropy": 5.885197925567627,
"epoch": 0.12087544685338066,
"grad_norm": 1.046875,
"learning_rate": 0.00031043045387480487,
"loss": 5.8377,
"mean_token_accuracy": 0.14639547243714332,
"num_tokens": 4177761.0,
"step": 2350
},
{
"entropy": 6.0259346008300785,
"epoch": 0.12113262865519636,
"grad_norm": 1.140625,
"learning_rate": 0.0003092665742369703,
"loss": 5.809,
"mean_token_accuracy": 0.14031819701194764,
"num_tokens": 4186143.0,
"step": 2355
},
{
"entropy": 5.943132781982422,
"epoch": 0.12138981045701207,
"grad_norm": 1.15625,
"learning_rate": 0.00030810175516369343,
"loss": 5.8055,
"mean_token_accuracy": 0.1441400282084942,
"num_tokens": 4194959.0,
"step": 2360
},
{
"entropy": 5.915530729293823,
"epoch": 0.12164699225882776,
"grad_norm": 1.1328125,
"learning_rate": 0.0003069360285890775,
"loss": 5.7974,
"mean_token_accuracy": 0.1439046949148178,
"num_tokens": 4203642.0,
"step": 2365
},
{
"entropy": 5.9029628276824955,
"epoch": 0.12190417406064347,
"grad_norm": 1.1328125,
"learning_rate": 0.00030576942647210547,
"loss": 5.8055,
"mean_token_accuracy": 0.1408913992345333,
"num_tokens": 4213006.0,
"step": 2370
},
{
"entropy": 5.975221157073975,
"epoch": 0.12216135586245917,
"grad_norm": 1.0859375,
"learning_rate": 0.00030460198079576355,
"loss": 5.7381,
"mean_token_accuracy": 0.15421162396669388,
"num_tokens": 4222149.0,
"step": 2375
},
{
"entropy": 5.8654869556427,
"epoch": 0.12241853766427488,
"grad_norm": 1.1875,
"learning_rate": 0.0003034337235661648,
"loss": 5.7474,
"mean_token_accuracy": 0.1494328647851944,
"num_tokens": 4230718.0,
"step": 2380
},
{
"entropy": 5.978770732879639,
"epoch": 0.12267571946609059,
"grad_norm": 1.1484375,
"learning_rate": 0.0003022646868116714,
"loss": 5.9697,
"mean_token_accuracy": 0.1301795445382595,
"num_tokens": 4239958.0,
"step": 2385
},
{
"entropy": 5.979018259048462,
"epoch": 0.12293290126790628,
"grad_norm": 1.078125,
"learning_rate": 0.0003010949025820163,
"loss": 5.7852,
"mean_token_accuracy": 0.13845039382576943,
"num_tokens": 4248468.0,
"step": 2390
},
{
"entropy": 5.9493214130401615,
"epoch": 0.12319008306972198,
"grad_norm": 1.1640625,
"learning_rate": 0.0002999244029474252,
"loss": 5.8451,
"mean_token_accuracy": 0.14041090309619902,
"num_tokens": 4257394.0,
"step": 2395
},
{
"entropy": 5.8784568309783936,
"epoch": 0.12344726487153769,
"grad_norm": 1.125,
"learning_rate": 0.00029875321999773684,
"loss": 5.7533,
"mean_token_accuracy": 0.14877835065126419,
"num_tokens": 4265971.0,
"step": 2400
},
{
"entropy": 5.9012456893920895,
"epoch": 0.1237044466733534,
"grad_norm": 1.0546875,
"learning_rate": 0.00029758138584152333,
"loss": 5.8083,
"mean_token_accuracy": 0.1378701776266098,
"num_tokens": 4275672.0,
"step": 2405
},
{
"entropy": 5.956387281417847,
"epoch": 0.1239616284751691,
"grad_norm": 1.1171875,
"learning_rate": 0.0002964089326052102,
"loss": 5.7706,
"mean_token_accuracy": 0.14205614998936653,
"num_tokens": 4284487.0,
"step": 2410
},
{
"entropy": 5.970116043090821,
"epoch": 0.1242188102769848,
"grad_norm": 1.0859375,
"learning_rate": 0.0002952358924321949,
"loss": 5.7826,
"mean_token_accuracy": 0.1519901379942894,
"num_tokens": 4293404.0,
"step": 2415
},
{
"entropy": 6.005149602890015,
"epoch": 0.1244759920788005,
"grad_norm": 1.1796875,
"learning_rate": 0.00029406229748196657,
"loss": 5.8048,
"mean_token_accuracy": 0.1412213161587715,
"num_tokens": 4302261.0,
"step": 2420
},
{
"entropy": 5.932501649856567,
"epoch": 0.12473317388061621,
"grad_norm": 1.046875,
"learning_rate": 0.0002928881799292235,
"loss": 5.7883,
"mean_token_accuracy": 0.14596713930368424,
"num_tokens": 4311488.0,
"step": 2425
},
{
"entropy": 5.963835191726685,
"epoch": 0.12499035568243191,
"grad_norm": 1.2265625,
"learning_rate": 0.00029171357196299154,
"loss": 5.8064,
"mean_token_accuracy": 0.13890780359506608,
"num_tokens": 4321194.0,
"step": 2430
},
{
"entropy": 5.9551738739013675,
"epoch": 0.1252475374842476,
"grad_norm": 1.0859375,
"learning_rate": 0.0002905385057857414,
"loss": 5.8245,
"mean_token_accuracy": 0.13930185437202453,
"num_tokens": 4329906.0,
"step": 2435
},
{
"entropy": 5.947234010696411,
"epoch": 0.12550471928606333,
"grad_norm": 1.1015625,
"learning_rate": 0.0002893630136125058,
"loss": 5.8544,
"mean_token_accuracy": 0.1406613238155842,
"num_tokens": 4339386.0,
"step": 2440
},
{
"entropy": 5.956067037582398,
"epoch": 0.12576190108787902,
"grad_norm": 1.0546875,
"learning_rate": 0.0002881871276699967,
"loss": 5.7791,
"mean_token_accuracy": 0.1507390022277832,
"num_tokens": 4348039.0,
"step": 2445
},
{
"entropy": 5.951892757415772,
"epoch": 0.12601908288969474,
"grad_norm": 1.2109375,
"learning_rate": 0.00028701088019572114,
"loss": 5.8444,
"mean_token_accuracy": 0.14090602099895477,
"num_tokens": 4356171.0,
"step": 2450
},
{
"entropy": 6.020451068878174,
"epoch": 0.12627626469151043,
"grad_norm": 1.0859375,
"learning_rate": 0.0002858343034370977,
"loss": 5.8681,
"mean_token_accuracy": 0.14203555062413215,
"num_tokens": 4365140.0,
"step": 2455
},
{
"entropy": 5.911239242553711,
"epoch": 0.12653344649332612,
"grad_norm": 1.1796875,
"learning_rate": 0.00028465742965057267,
"loss": 5.6277,
"mean_token_accuracy": 0.15792713835835456,
"num_tokens": 4373435.0,
"step": 2460
},
{
"entropy": 5.798923444747925,
"epoch": 0.12679062829514184,
"grad_norm": 1.1640625,
"learning_rate": 0.00028348029110073533,
"loss": 5.7314,
"mean_token_accuracy": 0.14894369319081308,
"num_tokens": 4381411.0,
"step": 2465
},
{
"entropy": 5.923311853408814,
"epoch": 0.12704781009695754,
"grad_norm": 1.0859375,
"learning_rate": 0.00028230292005943365,
"loss": 5.769,
"mean_token_accuracy": 0.14870745241641997,
"num_tokens": 4389899.0,
"step": 2470
},
{
"entropy": 5.958002614974975,
"epoch": 0.12730499189877326,
"grad_norm": 1.125,
"learning_rate": 0.00028112534880488945,
"loss": 5.8097,
"mean_token_accuracy": 0.14627409875392913,
"num_tokens": 4399004.0,
"step": 2475
},
{
"entropy": 5.978843307495117,
"epoch": 0.12756217370058895,
"grad_norm": 1.09375,
"learning_rate": 0.0002799476096208137,
"loss": 5.8341,
"mean_token_accuracy": 0.14349768534302712,
"num_tokens": 4407963.0,
"step": 2480
},
{
"entropy": 5.999022006988525,
"epoch": 0.12781935550240464,
"grad_norm": 1.1171875,
"learning_rate": 0.00027876973479552087,
"loss": 5.8285,
"mean_token_accuracy": 0.14875191003084182,
"num_tokens": 4416562.0,
"step": 2485
},
{
"entropy": 5.941763925552368,
"epoch": 0.12807653730422036,
"grad_norm": 1.0859375,
"learning_rate": 0.00027759175662104424,
"loss": 5.8246,
"mean_token_accuracy": 0.135814069211483,
"num_tokens": 4425961.0,
"step": 2490
},
{
"entropy": 5.953846645355225,
"epoch": 0.12833371910603605,
"grad_norm": 1.09375,
"learning_rate": 0.0002764137073922508,
"loss": 5.8864,
"mean_token_accuracy": 0.1416388437151909,
"num_tokens": 4435167.0,
"step": 2495
},
{
"entropy": 5.9248755931854244,
"epoch": 0.12859090090785177,
"grad_norm": 1.1640625,
"learning_rate": 0.00027523561940595505,
"loss": 5.8169,
"mean_token_accuracy": 0.14142304435372352,
"num_tokens": 4444207.0,
"step": 2500
},
{
"entropy": 6.038079309463501,
"epoch": 0.12884808270966747,
"grad_norm": 1.0859375,
"learning_rate": 0.0002740575249600342,
"loss": 5.9115,
"mean_token_accuracy": 0.1447101503610611,
"num_tokens": 4453437.0,
"step": 2505
},
{
"entropy": 5.950088453292847,
"epoch": 0.12910526451148316,
"grad_norm": 1.015625,
"learning_rate": 0.00027287945635254263,
"loss": 5.7212,
"mean_token_accuracy": 0.15202828198671342,
"num_tokens": 4462225.0,
"step": 2510
},
{
"entropy": 5.944004249572754,
"epoch": 0.12936244631329888,
"grad_norm": 1.15625,
"learning_rate": 0.00027170144588082635,
"loss": 5.8029,
"mean_token_accuracy": 0.1497768573462963,
"num_tokens": 4471524.0,
"step": 2515
},
{
"entropy": 5.955462265014648,
"epoch": 0.12961962811511457,
"grad_norm": 1.1171875,
"learning_rate": 0.00027052352584063763,
"loss": 5.8171,
"mean_token_accuracy": 0.1394263669848442,
"num_tokens": 4480842.0,
"step": 2520
},
{
"entropy": 6.016254425048828,
"epoch": 0.1298768099169303,
"grad_norm": 1.125,
"learning_rate": 0.00026934572852524907,
"loss": 5.8041,
"mean_token_accuracy": 0.14456221759319304,
"num_tokens": 4489252.0,
"step": 2525
},
{
"entropy": 5.962445497512817,
"epoch": 0.13013399171874598,
"grad_norm": 1.109375,
"learning_rate": 0.00026816808622456937,
"loss": 5.751,
"mean_token_accuracy": 0.14099297150969506,
"num_tokens": 4498092.0,
"step": 2530
},
{
"entropy": 5.888944292068482,
"epoch": 0.13039117352056168,
"grad_norm": 1.109375,
"learning_rate": 0.0002669906312242569,
"loss": 5.8182,
"mean_token_accuracy": 0.1458373673260212,
"num_tokens": 4507458.0,
"step": 2535
},
{
"entropy": 5.87163348197937,
"epoch": 0.1306483553223774,
"grad_norm": 1.125,
"learning_rate": 0.00026581339580483525,
"loss": 5.6555,
"mean_token_accuracy": 0.14610802978277207,
"num_tokens": 4516500.0,
"step": 2540
},
{
"entropy": 5.9336553573608395,
"epoch": 0.1309055371241931,
"grad_norm": 1.03125,
"learning_rate": 0.0002646364122408082,
"loss": 5.7971,
"mean_token_accuracy": 0.14564713165163995,
"num_tokens": 4525563.0,
"step": 2545
},
{
"entropy": 5.964129304885864,
"epoch": 0.1311627189260088,
"grad_norm": 1.09375,
"learning_rate": 0.0002634597127997749,
"loss": 5.8177,
"mean_token_accuracy": 0.14048824459314346,
"num_tokens": 4534089.0,
"step": 2550
},
{
"entropy": 5.954702997207642,
"epoch": 0.1314199007278245,
"grad_norm": 1.1484375,
"learning_rate": 0.0002622833297415445,
"loss": 5.8048,
"mean_token_accuracy": 0.14476812183856963,
"num_tokens": 4542846.0,
"step": 2555
},
{
"entropy": 5.939824199676513,
"epoch": 0.1316770825296402,
"grad_norm": 1.0625,
"learning_rate": 0.0002611072953172531,
"loss": 5.8477,
"mean_token_accuracy": 0.14269847571849822,
"num_tokens": 4552297.0,
"step": 2560
},
{
"entropy": 6.007514333724975,
"epoch": 0.1319342643314559,
"grad_norm": 1.109375,
"learning_rate": 0.00025993164176847845,
"loss": 5.8132,
"mean_token_accuracy": 0.14156687557697295,
"num_tokens": 4561444.0,
"step": 2565
},
{
"entropy": 6.02439775466919,
"epoch": 0.1321914461332716,
"grad_norm": 1.1796875,
"learning_rate": 0.0002587564013263564,
"loss": 5.8099,
"mean_token_accuracy": 0.14534456878900529,
"num_tokens": 4570661.0,
"step": 2570
},
{
"entropy": 5.8748493671417235,
"epoch": 0.13244862793508733,
"grad_norm": 1.203125,
"learning_rate": 0.0002575816062106974,
"loss": 5.6757,
"mean_token_accuracy": 0.14598242715001106,
"num_tokens": 4578777.0,
"step": 2575
},
{
"entropy": 5.807692241668701,
"epoch": 0.13270580973690302,
"grad_norm": 1.1328125,
"learning_rate": 0.00025640728862910293,
"loss": 5.7508,
"mean_token_accuracy": 0.1477329283952713,
"num_tokens": 4586888.0,
"step": 2580
},
{
"entropy": 5.893733835220337,
"epoch": 0.1329629915387187,
"grad_norm": 1.1015625,
"learning_rate": 0.00025523348077608285,
"loss": 5.6646,
"mean_token_accuracy": 0.15274369195103646,
"num_tokens": 4594983.0,
"step": 2585
},
{
"entropy": 5.864890909194946,
"epoch": 0.13322017334053443,
"grad_norm": 1.125,
"learning_rate": 0.00025406021483217225,
"loss": 5.7269,
"mean_token_accuracy": 0.14728641286492347,
"num_tokens": 4603886.0,
"step": 2590
},
{
"entropy": 5.983772325515747,
"epoch": 0.13347735514235012,
"grad_norm": 1.0859375,
"learning_rate": 0.00025288752296304963,
"loss": 5.8426,
"mean_token_accuracy": 0.137150888890028,
"num_tokens": 4612723.0,
"step": 2595
},
{
"entropy": 5.947617816925049,
"epoch": 0.13373453694416584,
"grad_norm": 1.0703125,
"learning_rate": 0.000251715437318655,
"loss": 5.6468,
"mean_token_accuracy": 0.15530167669057846,
"num_tokens": 4621584.0,
"step": 2600
},
{
"entropy": 5.802928686141968,
"epoch": 0.13399171874598154,
"grad_norm": 1.0625,
"learning_rate": 0.0002505439900323084,
"loss": 5.7151,
"mean_token_accuracy": 0.1468648336827755,
"num_tokens": 4630523.0,
"step": 2605
},
{
"entropy": 5.8552350997924805,
"epoch": 0.13424890054779723,
"grad_norm": 1.171875,
"learning_rate": 0.00024937321321982894,
"loss": 5.7215,
"mean_token_accuracy": 0.15691960453987122,
"num_tokens": 4639527.0,
"step": 2610
},
{
"entropy": 5.914655923843384,
"epoch": 0.13450608234961295,
"grad_norm": 1.171875,
"learning_rate": 0.00024820313897865433,
"loss": 5.7114,
"mean_token_accuracy": 0.15264911204576492,
"num_tokens": 4647939.0,
"step": 2615
},
{
"entropy": 5.881383657455444,
"epoch": 0.13476326415142864,
"grad_norm": 1.1015625,
"learning_rate": 0.00024703379938696105,
"loss": 5.7997,
"mean_token_accuracy": 0.13958094269037247,
"num_tokens": 4657287.0,
"step": 2620
},
{
"entropy": 5.8907615661621096,
"epoch": 0.13502044595324436,
"grad_norm": 1.125,
"learning_rate": 0.00024586522650278447,
"loss": 5.6564,
"mean_token_accuracy": 0.14980467706918715,
"num_tokens": 4665391.0,
"step": 2625
},
{
"entropy": 5.8882465839385985,
"epoch": 0.13527762775506005,
"grad_norm": 1.234375,
"learning_rate": 0.00024469745236314064,
"loss": 5.7079,
"mean_token_accuracy": 0.15327545553445815,
"num_tokens": 4673704.0,
"step": 2630
},
{
"entropy": 6.0655638694763185,
"epoch": 0.13553480955687575,
"grad_norm": 1.0546875,
"learning_rate": 0.00024353050898314767,
"loss": 5.9473,
"mean_token_accuracy": 0.13833739161491393,
"num_tokens": 4682969.0,
"step": 2635
},
{
"entropy": 5.9324102878570555,
"epoch": 0.13579199135869147,
"grad_norm": 1.1640625,
"learning_rate": 0.00024236442835514743,
"loss": 5.6438,
"mean_token_accuracy": 0.14957863092422485,
"num_tokens": 4691786.0,
"step": 2640
},
{
"entropy": 5.762153291702271,
"epoch": 0.13604917316050716,
"grad_norm": 1.1484375,
"learning_rate": 0.00024119924244782965,
"loss": 5.7241,
"mean_token_accuracy": 0.15027930289506913,
"num_tokens": 4700944.0,
"step": 2645
},
{
"entropy": 5.862569570541382,
"epoch": 0.13630635496232288,
"grad_norm": 1.1015625,
"learning_rate": 0.00024003498320535462,
"loss": 5.709,
"mean_token_accuracy": 0.1430109515786171,
"num_tokens": 4709802.0,
"step": 2650
},
{
"entropy": 5.950196361541748,
"epoch": 0.13656353676413857,
"grad_norm": 1.1953125,
"learning_rate": 0.00023887168254647727,
"loss": 5.77,
"mean_token_accuracy": 0.14267563819885254,
"num_tokens": 4719282.0,
"step": 2655
},
{
"entropy": 6.000500011444092,
"epoch": 0.13682071856595426,
"grad_norm": 1.0703125,
"learning_rate": 0.00023770937236367308,
"loss": 5.8215,
"mean_token_accuracy": 0.14113259688019753,
"num_tokens": 4728762.0,
"step": 2660
},
{
"entropy": 5.90273871421814,
"epoch": 0.13707790036776998,
"grad_norm": 1.0703125,
"learning_rate": 0.00023654808452226278,
"loss": 5.5937,
"mean_token_accuracy": 0.14730694591999055,
"num_tokens": 4737178.0,
"step": 2665
},
{
"entropy": 5.901443719863892,
"epoch": 0.13733508216958568,
"grad_norm": 1.15625,
"learning_rate": 0.00023538785085953912,
"loss": 5.7031,
"mean_token_accuracy": 0.15266731828451158,
"num_tokens": 4745819.0,
"step": 2670
},
{
"entropy": 5.813074254989624,
"epoch": 0.1375922639714014,
"grad_norm": 1.0703125,
"learning_rate": 0.00023422870318389404,
"loss": 5.7465,
"mean_token_accuracy": 0.1519558846950531,
"num_tokens": 4754656.0,
"step": 2675
},
{
"entropy": 5.913999032974243,
"epoch": 0.1378494457732171,
"grad_norm": 1.0859375,
"learning_rate": 0.0002330706732739468,
"loss": 5.7406,
"mean_token_accuracy": 0.14824089780449867,
"num_tokens": 4763346.0,
"step": 2680
},
{
"entropy": 5.8917923927307125,
"epoch": 0.13810662757503278,
"grad_norm": 1.0546875,
"learning_rate": 0.00023191379287767211,
"loss": 5.7179,
"mean_token_accuracy": 0.14699299037456512,
"num_tokens": 4771611.0,
"step": 2685
},
{
"entropy": 5.872665691375732,
"epoch": 0.1383638093768485,
"grad_norm": 1.203125,
"learning_rate": 0.0002307580937115305,
"loss": 5.7956,
"mean_token_accuracy": 0.14343073591589928,
"num_tokens": 4780741.0,
"step": 2690
},
{
"entropy": 5.963706064224243,
"epoch": 0.1386209911786642,
"grad_norm": 1.140625,
"learning_rate": 0.00022960360745959846,
"loss": 5.8486,
"mean_token_accuracy": 0.13829033076763153,
"num_tokens": 4790190.0,
"step": 2695
},
{
"entropy": 5.902351331710816,
"epoch": 0.1388781729804799,
"grad_norm": 1.1875,
"learning_rate": 0.00022845036577269972,
"loss": 5.6052,
"mean_token_accuracy": 0.15682805180549622,
"num_tokens": 4798563.0,
"step": 2700
},
{
"entropy": 5.907444286346435,
"epoch": 0.1391353547822956,
"grad_norm": 1.0703125,
"learning_rate": 0.00022729840026753777,
"loss": 5.802,
"mean_token_accuracy": 0.13890419751405716,
"num_tokens": 4807189.0,
"step": 2705
},
{
"entropy": 5.871195507049561,
"epoch": 0.1393925365841113,
"grad_norm": 1.1875,
"learning_rate": 0.0002261477425258287,
"loss": 5.7676,
"mean_token_accuracy": 0.14524144679307938,
"num_tokens": 4816343.0,
"step": 2710
},
{
"entropy": 5.9607168674469,
"epoch": 0.13964971838592702,
"grad_norm": 1.0078125,
"learning_rate": 0.0002249984240934358,
"loss": 5.7289,
"mean_token_accuracy": 0.14837161004543303,
"num_tokens": 4825296.0,
"step": 2715
},
{
"entropy": 5.922761869430542,
"epoch": 0.1399069001877427,
"grad_norm": 1.0703125,
"learning_rate": 0.00022385047647950464,
"loss": 5.691,
"mean_token_accuracy": 0.15108680725097656,
"num_tokens": 4834332.0,
"step": 2720
},
{
"entropy": 5.955756044387817,
"epoch": 0.14016408198955843,
"grad_norm": 1.171875,
"learning_rate": 0.0002227039311555986,
"loss": 5.7661,
"mean_token_accuracy": 0.1478307694196701,
"num_tokens": 4843573.0,
"step": 2725
},
{
"entropy": 5.951103067398071,
"epoch": 0.14042126379137412,
"grad_norm": 1.0546875,
"learning_rate": 0.0002215588195548372,
"loss": 5.8034,
"mean_token_accuracy": 0.14295736625790595,
"num_tokens": 4852471.0,
"step": 2730
},
{
"entropy": 5.937809133529663,
"epoch": 0.14067844559318982,
"grad_norm": 1.0703125,
"learning_rate": 0.00022041517307103337,
"loss": 5.7293,
"mean_token_accuracy": 0.14729402661323548,
"num_tokens": 4861361.0,
"step": 2735
},
{
"entropy": 5.91626615524292,
"epoch": 0.14093562739500554,
"grad_norm": 1.1484375,
"learning_rate": 0.0002192730230578331,
"loss": 5.8058,
"mean_token_accuracy": 0.1489897146821022,
"num_tokens": 4870429.0,
"step": 2740
},
{
"entropy": 5.956934118270874,
"epoch": 0.14119280919682123,
"grad_norm": 1.0625,
"learning_rate": 0.0002181324008278559,
"loss": 5.6819,
"mean_token_accuracy": 0.14700148552656173,
"num_tokens": 4879635.0,
"step": 2745
},
{
"entropy": 5.871394920349121,
"epoch": 0.14144999099863695,
"grad_norm": 1.1171875,
"learning_rate": 0.00021699333765183655,
"loss": 5.6465,
"mean_token_accuracy": 0.15123720914125444,
"num_tokens": 4888041.0,
"step": 2750
},
{
"entropy": 5.875310802459717,
"epoch": 0.14170717280045264,
"grad_norm": 1.1171875,
"learning_rate": 0.0002158558647577673,
"loss": 5.7745,
"mean_token_accuracy": 0.14221168756484986,
"num_tokens": 4897088.0,
"step": 2755
},
{
"entropy": 5.943839645385742,
"epoch": 0.14196435460226833,
"grad_norm": 1.1015625,
"learning_rate": 0.00021472001333004215,
"loss": 5.7421,
"mean_token_accuracy": 0.1458420291543007,
"num_tokens": 4905722.0,
"step": 2760
},
{
"entropy": 5.947792053222656,
"epoch": 0.14222153640408405,
"grad_norm": 1.078125,
"learning_rate": 0.00021358581450860186,
"loss": 5.7851,
"mean_token_accuracy": 0.14722041487693788,
"num_tokens": 4914954.0,
"step": 2765
},
{
"entropy": 6.009203195571899,
"epoch": 0.14247871820589975,
"grad_norm": 1.1171875,
"learning_rate": 0.0002124532993880799,
"loss": 5.7727,
"mean_token_accuracy": 0.14699561893939972,
"num_tokens": 4923617.0,
"step": 2770
},
{
"entropy": 5.872904253005982,
"epoch": 0.14273590000771547,
"grad_norm": 1.1015625,
"learning_rate": 0.00021132249901695044,
"loss": 5.6698,
"mean_token_accuracy": 0.15182799845933914,
"num_tokens": 4932392.0,
"step": 2775
},
{
"entropy": 5.942844295501709,
"epoch": 0.14299308180953116,
"grad_norm": 1.046875,
"learning_rate": 0.00021019344439667705,
"loss": 5.7992,
"mean_token_accuracy": 0.14551443457603455,
"num_tokens": 4941286.0,
"step": 2780
},
{
"entropy": 5.960988092422485,
"epoch": 0.14325026361134685,
"grad_norm": 1.1171875,
"learning_rate": 0.00020906616648086213,
"loss": 5.7667,
"mean_token_accuracy": 0.14625853151082993,
"num_tokens": 4949907.0,
"step": 2785
},
{
"entropy": 5.977736568450927,
"epoch": 0.14350744541316257,
"grad_norm": 1.09375,
"learning_rate": 0.00020794069617439942,
"loss": 5.834,
"mean_token_accuracy": 0.1429489754140377,
"num_tokens": 4959115.0,
"step": 2790
},
{
"entropy": 5.970361328125,
"epoch": 0.14376462721497826,
"grad_norm": 1.0703125,
"learning_rate": 0.00020681706433262593,
"loss": 5.7972,
"mean_token_accuracy": 0.1437188670039177,
"num_tokens": 4967547.0,
"step": 2795
},
{
"entropy": 5.911842775344849,
"epoch": 0.14402180901679398,
"grad_norm": 1.1015625,
"learning_rate": 0.00020569530176047602,
"loss": 5.7177,
"mean_token_accuracy": 0.14318782836198807,
"num_tokens": 4976531.0,
"step": 2800
},
{
"entropy": 5.9328851222991945,
"epoch": 0.14427899081860968,
"grad_norm": 1.0625,
"learning_rate": 0.0002045754392116374,
"loss": 5.7947,
"mean_token_accuracy": 0.14737410992383956,
"num_tokens": 4985589.0,
"step": 2805
},
{
"entropy": 5.88200044631958,
"epoch": 0.14453617262042537,
"grad_norm": 1.15625,
"learning_rate": 0.00020345750738770757,
"loss": 5.6939,
"mean_token_accuracy": 0.1540876194834709,
"num_tokens": 4994356.0,
"step": 2810
},
{
"entropy": 5.871546030044556,
"epoch": 0.1447933544222411,
"grad_norm": 1.1640625,
"learning_rate": 0.00020234153693735214,
"loss": 5.7366,
"mean_token_accuracy": 0.14891282320022584,
"num_tokens": 5003075.0,
"step": 2815
},
{
"entropy": 5.931076526641846,
"epoch": 0.14505053622405678,
"grad_norm": 1.0625,
"learning_rate": 0.0002012275584554647,
"loss": 5.7089,
"mean_token_accuracy": 0.14783241748809814,
"num_tokens": 5012171.0,
"step": 2820
},
{
"entropy": 5.906200504302978,
"epoch": 0.1453077180258725,
"grad_norm": 1.1171875,
"learning_rate": 0.00020011560248232803,
"loss": 5.6612,
"mean_token_accuracy": 0.15873602479696275,
"num_tokens": 5021627.0,
"step": 2825
},
{
"entropy": 5.907571601867676,
"epoch": 0.1455648998276882,
"grad_norm": 1.046875,
"learning_rate": 0.00019900569950277692,
"loss": 5.6891,
"mean_token_accuracy": 0.15038043409585952,
"num_tokens": 5031281.0,
"step": 2830
},
{
"entropy": 5.873400497436523,
"epoch": 0.14582208162950389,
"grad_norm": 1.0234375,
"learning_rate": 0.00019789787994536228,
"loss": 5.7201,
"mean_token_accuracy": 0.1496950700879097,
"num_tokens": 5039774.0,
"step": 2835
},
{
"entropy": 5.932717323303223,
"epoch": 0.1460792634313196,
"grad_norm": 1.140625,
"learning_rate": 0.00019679217418151667,
"loss": 5.666,
"mean_token_accuracy": 0.15262340754270554,
"num_tokens": 5048668.0,
"step": 2840
},
{
"entropy": 5.87169075012207,
"epoch": 0.1463364452331353,
"grad_norm": 1.15625,
"learning_rate": 0.00019568861252472236,
"loss": 5.6107,
"mean_token_accuracy": 0.15350384563207625,
"num_tokens": 5057738.0,
"step": 2845
},
{
"entropy": 5.866910600662232,
"epoch": 0.14659362703495102,
"grad_norm": 1.125,
"learning_rate": 0.00019458722522967952,
"loss": 5.6726,
"mean_token_accuracy": 0.15096358209848404,
"num_tokens": 5066323.0,
"step": 2850
},
{
"entropy": 5.874738025665283,
"epoch": 0.1468508088367667,
"grad_norm": 1.03125,
"learning_rate": 0.00019348804249147723,
"loss": 5.7234,
"mean_token_accuracy": 0.14299118369817734,
"num_tokens": 5075260.0,
"step": 2855
},
{
"entropy": 5.849239873886108,
"epoch": 0.1471079906385824,
"grad_norm": 1.1484375,
"learning_rate": 0.0001923910944447655,
"loss": 5.6979,
"mean_token_accuracy": 0.14599353969097137,
"num_tokens": 5084328.0,
"step": 2860
},
{
"entropy": 5.9075206279754635,
"epoch": 0.14736517244039812,
"grad_norm": 1.1796875,
"learning_rate": 0.00019129641116292928,
"loss": 5.6463,
"mean_token_accuracy": 0.14645669609308243,
"num_tokens": 5093069.0,
"step": 2865
},
{
"entropy": 5.867852687835693,
"epoch": 0.14762235424221382,
"grad_norm": 1.0234375,
"learning_rate": 0.00019020402265726343,
"loss": 5.6485,
"mean_token_accuracy": 0.1528791606426239,
"num_tokens": 5102364.0,
"step": 2870
},
{
"entropy": 5.869380331039428,
"epoch": 0.14787953604402954,
"grad_norm": 1.046875,
"learning_rate": 0.0001891139588761509,
"loss": 5.6715,
"mean_token_accuracy": 0.14551375508308412,
"num_tokens": 5111594.0,
"step": 2875
},
{
"entropy": 5.900653219223022,
"epoch": 0.14813671784584523,
"grad_norm": 1.109375,
"learning_rate": 0.00018802624970424076,
"loss": 5.6857,
"mean_token_accuracy": 0.15399120897054672,
"num_tokens": 5120266.0,
"step": 2880
},
{
"entropy": 5.844643306732178,
"epoch": 0.14839389964766092,
"grad_norm": 1.171875,
"learning_rate": 0.00018694092496162945,
"loss": 5.6084,
"mean_token_accuracy": 0.1535620719194412,
"num_tokens": 5128866.0,
"step": 2885
},
{
"entropy": 5.882418870925903,
"epoch": 0.14865108144947664,
"grad_norm": 1.09375,
"learning_rate": 0.00018585801440304306,
"loss": 5.6843,
"mean_token_accuracy": 0.15050104409456252,
"num_tokens": 5138447.0,
"step": 2890
},
{
"entropy": 5.868085289001465,
"epoch": 0.14890826325129233,
"grad_norm": 1.1953125,
"learning_rate": 0.00018477754771702165,
"loss": 5.6836,
"mean_token_accuracy": 0.14722221344709396,
"num_tokens": 5146959.0,
"step": 2895
},
{
"entropy": 5.857029676437378,
"epoch": 0.14916544505310805,
"grad_norm": 1.0234375,
"learning_rate": 0.00018369955452510506,
"loss": 5.6488,
"mean_token_accuracy": 0.150224170088768,
"num_tokens": 5156436.0,
"step": 2900
},
{
"entropy": 5.9019042491912845,
"epoch": 0.14942262685492375,
"grad_norm": 1.15625,
"learning_rate": 0.0001826240643810212,
"loss": 5.6536,
"mean_token_accuracy": 0.15107073485851288,
"num_tokens": 5165017.0,
"step": 2905
},
{
"entropy": 5.85205864906311,
"epoch": 0.14967980865673944,
"grad_norm": 1.109375,
"learning_rate": 0.0001815511067698758,
"loss": 5.5853,
"mean_token_accuracy": 0.16217051148414613,
"num_tokens": 5174002.0,
"step": 2910
},
{
"entropy": 5.840191125869751,
"epoch": 0.14993699045855516,
"grad_norm": 1.0390625,
"learning_rate": 0.0001804807111073436,
"loss": 5.6849,
"mean_token_accuracy": 0.14772054851055144,
"num_tokens": 5183969.0,
"step": 2915
},
{
"entropy": 5.947837972640992,
"epoch": 0.15019417226037085,
"grad_norm": 1.0703125,
"learning_rate": 0.0001794129067388625,
"loss": 5.7407,
"mean_token_accuracy": 0.14477377384901047,
"num_tokens": 5193009.0,
"step": 2920
},
{
"entropy": 5.91709337234497,
"epoch": 0.15045135406218657,
"grad_norm": 1.140625,
"learning_rate": 0.00017834772293882868,
"loss": 5.7202,
"mean_token_accuracy": 0.14974097311496734,
"num_tokens": 5201666.0,
"step": 2925
},
{
"entropy": 5.758265352249145,
"epoch": 0.15070853586400226,
"grad_norm": 1.1328125,
"learning_rate": 0.000177285188909794,
"loss": 5.4679,
"mean_token_accuracy": 0.16278080493211747,
"num_tokens": 5210202.0,
"step": 2930
},
{
"entropy": 5.800893688201905,
"epoch": 0.15096571766581796,
"grad_norm": 1.15625,
"learning_rate": 0.0001762253337816656,
"loss": 5.637,
"mean_token_accuracy": 0.15741105228662491,
"num_tokens": 5218911.0,
"step": 2935
},
{
"entropy": 5.854615879058838,
"epoch": 0.15122289946763368,
"grad_norm": 1.0703125,
"learning_rate": 0.00017516818661090738,
"loss": 5.6489,
"mean_token_accuracy": 0.15447764992713928,
"num_tokens": 5227943.0,
"step": 2940
},
{
"entropy": 5.961043357849121,
"epoch": 0.15148008126944937,
"grad_norm": 1.15625,
"learning_rate": 0.0001741137763797428,
"loss": 5.7363,
"mean_token_accuracy": 0.14479249864816665,
"num_tokens": 5237624.0,
"step": 2945
},
{
"entropy": 5.919877624511718,
"epoch": 0.1517372630712651,
"grad_norm": 1.125,
"learning_rate": 0.00017306213199536115,
"loss": 5.7558,
"mean_token_accuracy": 0.14476376995444298,
"num_tokens": 5247031.0,
"step": 2950
},
{
"entropy": 5.84567928314209,
"epoch": 0.15199444487308078,
"grad_norm": 1.15625,
"learning_rate": 0.0001720132822891243,
"loss": 5.6031,
"mean_token_accuracy": 0.1566247284412384,
"num_tokens": 5256263.0,
"step": 2955
},
{
"entropy": 5.859348344802856,
"epoch": 0.15225162667489647,
"grad_norm": 1.1171875,
"learning_rate": 0.0001709672560157769,
"loss": 5.7168,
"mean_token_accuracy": 0.1484427310526371,
"num_tokens": 5266216.0,
"step": 2960
},
{
"entropy": 5.968145370483398,
"epoch": 0.1525088084767122,
"grad_norm": 1.1796875,
"learning_rate": 0.00016992408185265758,
"loss": 5.7021,
"mean_token_accuracy": 0.15091535225510597,
"num_tokens": 5274598.0,
"step": 2965
},
{
"entropy": 5.963071680068969,
"epoch": 0.15276599027852789,
"grad_norm": 1.0546875,
"learning_rate": 0.00016888378839891298,
"loss": 5.8042,
"mean_token_accuracy": 0.14827325642108918,
"num_tokens": 5283456.0,
"step": 2970
},
{
"entropy": 5.920269632339478,
"epoch": 0.1530231720803436,
"grad_norm": 1.046875,
"learning_rate": 0.0001678464041747137,
"loss": 5.7123,
"mean_token_accuracy": 0.14628702104091645,
"num_tokens": 5292423.0,
"step": 2975
},
{
"entropy": 5.90811595916748,
"epoch": 0.1532803538821593,
"grad_norm": 1.1640625,
"learning_rate": 0.00016681195762047223,
"loss": 5.6593,
"mean_token_accuracy": 0.15627681463956833,
"num_tokens": 5301169.0,
"step": 2980
},
{
"entropy": 5.960396146774292,
"epoch": 0.153537535683975,
"grad_norm": 1.171875,
"learning_rate": 0.00016578047709606337,
"loss": 5.7784,
"mean_token_accuracy": 0.14361969381570816,
"num_tokens": 5310675.0,
"step": 2985
},
{
"entropy": 5.904791069030762,
"epoch": 0.1537947174857907,
"grad_norm": 1.1484375,
"learning_rate": 0.00016475199088004678,
"loss": 5.6729,
"mean_token_accuracy": 0.15331293269991875,
"num_tokens": 5319419.0,
"step": 2990
},
{
"entropy": 5.814844703674316,
"epoch": 0.1540518992876064,
"grad_norm": 1.0625,
"learning_rate": 0.00016372652716889163,
"loss": 5.6102,
"mean_token_accuracy": 0.1528927803039551,
"num_tokens": 5328109.0,
"step": 2995
},
{
"entropy": 5.868056392669677,
"epoch": 0.15430908108942212,
"grad_norm": 1.265625,
"learning_rate": 0.0001627041140762035,
"loss": 5.7415,
"mean_token_accuracy": 0.14752336889505385,
"num_tokens": 5336600.0,
"step": 3000
},
{
"entropy": 5.869272661209107,
"epoch": 0.15456626289123782,
"grad_norm": 1.109375,
"learning_rate": 0.00016168477963195382,
"loss": 5.6449,
"mean_token_accuracy": 0.1595918707549572,
"num_tokens": 5345297.0,
"step": 3005
},
{
"entropy": 5.887246322631836,
"epoch": 0.1548234446930535,
"grad_norm": 1.046875,
"learning_rate": 0.0001606685517817114,
"loss": 5.6165,
"mean_token_accuracy": 0.15166592299938203,
"num_tokens": 5353770.0,
"step": 3010
},
{
"entropy": 5.8231791973114015,
"epoch": 0.15508062649486923,
"grad_norm": 1.140625,
"learning_rate": 0.00015965545838587592,
"loss": 5.6478,
"mean_token_accuracy": 0.1543812185525894,
"num_tokens": 5362195.0,
"step": 3015
},
{
"entropy": 5.797528409957886,
"epoch": 0.15533780829668492,
"grad_norm": 1.1328125,
"learning_rate": 0.00015864552721891467,
"loss": 5.5926,
"mean_token_accuracy": 0.15777522772550584,
"num_tokens": 5370881.0,
"step": 3020
},
{
"entropy": 5.8520911693572994,
"epoch": 0.15559499009850064,
"grad_norm": 1.1171875,
"learning_rate": 0.00015763878596860076,
"loss": 5.624,
"mean_token_accuracy": 0.15304535925388335,
"num_tokens": 5379932.0,
"step": 3025
},
{
"entropy": 5.889757585525513,
"epoch": 0.15585217190031633,
"grad_norm": 1.078125,
"learning_rate": 0.00015663526223525412,
"loss": 5.7209,
"mean_token_accuracy": 0.1467019125819206,
"num_tokens": 5389306.0,
"step": 3030
},
{
"entropy": 5.850079345703125,
"epoch": 0.15610935370213203,
"grad_norm": 1.0390625,
"learning_rate": 0.0001556349835309848,
"loss": 5.6122,
"mean_token_accuracy": 0.15075162947177886,
"num_tokens": 5398954.0,
"step": 3035
},
{
"entropy": 5.894767093658447,
"epoch": 0.15636653550394775,
"grad_norm": 1.1171875,
"learning_rate": 0.0001546379772789389,
"loss": 5.7657,
"mean_token_accuracy": 0.15032526701688767,
"num_tokens": 5408337.0,
"step": 3040
},
{
"entropy": 5.8905736923217775,
"epoch": 0.15662371730576344,
"grad_norm": 1.09375,
"learning_rate": 0.00015364427081254622,
"loss": 5.6242,
"mean_token_accuracy": 0.15853206664323807,
"num_tokens": 5417197.0,
"step": 3045
},
{
"entropy": 5.854434061050415,
"epoch": 0.15688089910757916,
"grad_norm": 1.09375,
"learning_rate": 0.00015265389137477165,
"loss": 5.6282,
"mean_token_accuracy": 0.1569242537021637,
"num_tokens": 5426617.0,
"step": 3050
},
{
"entropy": 5.829791641235351,
"epoch": 0.15713808090939485,
"grad_norm": 1.1171875,
"learning_rate": 0.00015166686611736786,
"loss": 5.5579,
"mean_token_accuracy": 0.16443739980459213,
"num_tokens": 5435120.0,
"step": 3055
},
{
"entropy": 5.94751009941101,
"epoch": 0.15739526271121054,
"grad_norm": 1.1484375,
"learning_rate": 0.00015068322210013064,
"loss": 5.6793,
"mean_token_accuracy": 0.14547759518027306,
"num_tokens": 5443594.0,
"step": 3060
},
{
"entropy": 5.872846698760986,
"epoch": 0.15765244451302626,
"grad_norm": 1.140625,
"learning_rate": 0.0001497029862901578,
"loss": 5.6976,
"mean_token_accuracy": 0.15286043286323547,
"num_tokens": 5451812.0,
"step": 3065
},
{
"entropy": 5.926684713363647,
"epoch": 0.15790962631484196,
"grad_norm": 1.0546875,
"learning_rate": 0.00014872618556110905,
"loss": 5.7572,
"mean_token_accuracy": 0.14206624329090117,
"num_tokens": 5460476.0,
"step": 3070
},
{
"entropy": 5.931269025802612,
"epoch": 0.15816680811665768,
"grad_norm": 1.1484375,
"learning_rate": 0.00014775284669246992,
"loss": 5.6817,
"mean_token_accuracy": 0.15364545583724976,
"num_tokens": 5468849.0,
"step": 3075
},
{
"entropy": 5.855931663513184,
"epoch": 0.15842398991847337,
"grad_norm": 1.140625,
"learning_rate": 0.00014678299636881716,
"loss": 5.6261,
"mean_token_accuracy": 0.1608524963259697,
"num_tokens": 5477081.0,
"step": 3080
},
{
"entropy": 5.86461992263794,
"epoch": 0.15868117172028906,
"grad_norm": 1.03125,
"learning_rate": 0.0001458166611790873,
"loss": 5.6902,
"mean_token_accuracy": 0.1473114401102066,
"num_tokens": 5486816.0,
"step": 3085
},
{
"entropy": 5.8415953636169435,
"epoch": 0.15893835352210478,
"grad_norm": 1.078125,
"learning_rate": 0.00014485386761584773,
"loss": 5.5607,
"mean_token_accuracy": 0.1571323826909065,
"num_tokens": 5495632.0,
"step": 3090
},
{
"entropy": 5.886722803115845,
"epoch": 0.15919553532392047,
"grad_norm": 1.171875,
"learning_rate": 0.00014389464207457042,
"loss": 5.6117,
"mean_token_accuracy": 0.15660452991724014,
"num_tokens": 5503659.0,
"step": 3095
},
{
"entropy": 5.870863771438598,
"epoch": 0.1594527171257362,
"grad_norm": 1.0859375,
"learning_rate": 0.00014293901085290795,
"loss": 5.6972,
"mean_token_accuracy": 0.1557433471083641,
"num_tokens": 5512551.0,
"step": 3100
},
{
"entropy": 5.903251266479492,
"epoch": 0.15970989892755189,
"grad_norm": 1.21875,
"learning_rate": 0.00014198700014997307,
"loss": 5.8239,
"mean_token_accuracy": 0.14162530824542047,
"num_tokens": 5522599.0,
"step": 3105
},
{
"entropy": 5.892457675933838,
"epoch": 0.15996708072936758,
"grad_norm": 1.1328125,
"learning_rate": 0.00014103863606562016,
"loss": 5.657,
"mean_token_accuracy": 0.15857381969690323,
"num_tokens": 5531010.0,
"step": 3110
},
{
"entropy": 6.002671098709106,
"epoch": 0.1602242625311833,
"grad_norm": 1.109375,
"learning_rate": 0.00014009394459972964,
"loss": 5.8061,
"mean_token_accuracy": 0.14713286757469177,
"num_tokens": 5539742.0,
"step": 3115
},
{
"entropy": 5.979238080978393,
"epoch": 0.160481444332999,
"grad_norm": 1.1328125,
"learning_rate": 0.00013915295165149513,
"loss": 5.661,
"mean_token_accuracy": 0.15637649595737457,
"num_tokens": 5548151.0,
"step": 3120
},
{
"entropy": 5.901192903518677,
"epoch": 0.1607386261348147,
"grad_norm": 1.140625,
"learning_rate": 0.00013821568301871384,
"loss": 5.7147,
"mean_token_accuracy": 0.14485700130462648,
"num_tokens": 5556730.0,
"step": 3125
},
{
"entropy": 5.840697860717773,
"epoch": 0.1609958079366304,
"grad_norm": 1.0703125,
"learning_rate": 0.00013728216439707862,
"loss": 5.5561,
"mean_token_accuracy": 0.16001487225294114,
"num_tokens": 5565394.0,
"step": 3130
},
{
"entropy": 5.9222324848175045,
"epoch": 0.1612529897384461,
"grad_norm": 1.109375,
"learning_rate": 0.00013635242137947419,
"loss": 5.7061,
"mean_token_accuracy": 0.15493210405111313,
"num_tokens": 5574412.0,
"step": 3135
},
{
"entropy": 5.898713111877441,
"epoch": 0.16151017154026182,
"grad_norm": 1.1484375,
"learning_rate": 0.00013542647945527498,
"loss": 5.5912,
"mean_token_accuracy": 0.15648852586746215,
"num_tokens": 5583162.0,
"step": 3140
},
{
"entropy": 5.832360887527466,
"epoch": 0.1617673533420775,
"grad_norm": 1.03125,
"learning_rate": 0.0001345043640096465,
"loss": 5.6531,
"mean_token_accuracy": 0.15861258506774903,
"num_tokens": 5592416.0,
"step": 3145
},
{
"entropy": 5.842728853225708,
"epoch": 0.16202453514389323,
"grad_norm": 1.109375,
"learning_rate": 0.00013358610032284957,
"loss": 5.6627,
"mean_token_accuracy": 0.1591075912117958,
"num_tokens": 5601513.0,
"step": 3150
},
{
"entropy": 5.815179967880249,
"epoch": 0.16228171694570892,
"grad_norm": 1.171875,
"learning_rate": 0.000132671713569547,
"loss": 5.564,
"mean_token_accuracy": 0.15632705837488176,
"num_tokens": 5610142.0,
"step": 3155
},
{
"entropy": 5.886871719360352,
"epoch": 0.1625388987475246,
"grad_norm": 1.109375,
"learning_rate": 0.0001317612288181136,
"loss": 5.6572,
"mean_token_accuracy": 0.15508203357458114,
"num_tokens": 5618799.0,
"step": 3160
},
{
"entropy": 5.790243768692017,
"epoch": 0.16279608054934033,
"grad_norm": 1.0546875,
"learning_rate": 0.00013085467102994864,
"loss": 5.5527,
"mean_token_accuracy": 0.1618959426879883,
"num_tokens": 5627387.0,
"step": 3165
},
{
"entropy": 5.856798505783081,
"epoch": 0.16305326235115603,
"grad_norm": 1.140625,
"learning_rate": 0.00012995206505879198,
"loss": 5.6488,
"mean_token_accuracy": 0.15180497914552687,
"num_tokens": 5636434.0,
"step": 3170
},
{
"entropy": 5.839874887466431,
"epoch": 0.16331044415297175,
"grad_norm": 1.109375,
"learning_rate": 0.0001290534356500421,
"loss": 5.6527,
"mean_token_accuracy": 0.1571456253528595,
"num_tokens": 5645649.0,
"step": 3175
},
{
"entropy": 5.920530939102173,
"epoch": 0.16356762595478744,
"grad_norm": 1.15625,
"learning_rate": 0.00012815880744007827,
"loss": 5.7334,
"mean_token_accuracy": 0.1433591991662979,
"num_tokens": 5654436.0,
"step": 3180
},
{
"entropy": 5.862914419174194,
"epoch": 0.16382480775660313,
"grad_norm": 1.109375,
"learning_rate": 0.00012726820495558483,
"loss": 5.6447,
"mean_token_accuracy": 0.15773307383060456,
"num_tokens": 5662866.0,
"step": 3185
},
{
"entropy": 5.877509832382202,
"epoch": 0.16408198955841885,
"grad_norm": 1.0859375,
"learning_rate": 0.00012638165261287868,
"loss": 5.6363,
"mean_token_accuracy": 0.1500219315290451,
"num_tokens": 5672088.0,
"step": 3190
},
{
"entropy": 5.899864864349365,
"epoch": 0.16433917136023454,
"grad_norm": 1.125,
"learning_rate": 0.0001254991747172402,
"loss": 5.7645,
"mean_token_accuracy": 0.14970659017562865,
"num_tokens": 5681147.0,
"step": 3195
},
{
"entropy": 5.889403867721557,
"epoch": 0.16459635316205026,
"grad_norm": 1.03125,
"learning_rate": 0.00012462079546224662,
"loss": 5.6537,
"mean_token_accuracy": 0.1522204026579857,
"num_tokens": 5690650.0,
"step": 3200
},
{
"entropy": 5.899818658828735,
"epoch": 0.16485353496386596,
"grad_norm": 1.3359375,
"learning_rate": 0.00012374653892910896,
"loss": 5.6169,
"mean_token_accuracy": 0.1577785536646843,
"num_tokens": 5698925.0,
"step": 3205
},
{
"entropy": 5.902076196670532,
"epoch": 0.16511071676568165,
"grad_norm": 1.0859375,
"learning_rate": 0.00012287642908601166,
"loss": 5.6797,
"mean_token_accuracy": 0.15833307504653932,
"num_tokens": 5707778.0,
"step": 3210
},
{
"entropy": 5.87751612663269,
"epoch": 0.16536789856749737,
"grad_norm": 1.0546875,
"learning_rate": 0.00012201048978745569,
"loss": 5.6206,
"mean_token_accuracy": 0.15206317156553267,
"num_tokens": 5716794.0,
"step": 3215
},
{
"entropy": 5.83094482421875,
"epoch": 0.16562508036931306,
"grad_norm": 1.1171875,
"learning_rate": 0.00012114874477360427,
"loss": 5.5928,
"mean_token_accuracy": 0.1638439729809761,
"num_tokens": 5725150.0,
"step": 3220
},
{
"entropy": 5.845945835113525,
"epoch": 0.16588226217112878,
"grad_norm": 1.1484375,
"learning_rate": 0.00012029121766963236,
"loss": 5.574,
"mean_token_accuracy": 0.15535639375448226,
"num_tokens": 5733261.0,
"step": 3225
},
{
"entropy": 5.824334907531738,
"epoch": 0.16613944397294447,
"grad_norm": 1.0859375,
"learning_rate": 0.00011943793198507858,
"loss": 5.6552,
"mean_token_accuracy": 0.1499141775071621,
"num_tokens": 5742118.0,
"step": 3230
},
{
"entropy": 5.760670375823975,
"epoch": 0.16639662577476017,
"grad_norm": 1.0625,
"learning_rate": 0.00011858891111320104,
"loss": 5.4608,
"mean_token_accuracy": 0.16681069731712342,
"num_tokens": 5750814.0,
"step": 3235
},
{
"entropy": 5.826913642883301,
"epoch": 0.16665380757657589,
"grad_norm": 1.046875,
"learning_rate": 0.0001177441783303359,
"loss": 5.6597,
"mean_token_accuracy": 0.15008566305041313,
"num_tokens": 5759794.0,
"step": 3240
},
{
"entropy": 5.870846605300903,
"epoch": 0.16691098937839158,
"grad_norm": 1.2109375,
"learning_rate": 0.00011690375679525896,
"loss": 5.6762,
"mean_token_accuracy": 0.14791131615638733,
"num_tokens": 5768519.0,
"step": 3245
},
{
"entropy": 5.8364499568939205,
"epoch": 0.1671681711802073,
"grad_norm": 1.09375,
"learning_rate": 0.00011606766954855124,
"loss": 5.5322,
"mean_token_accuracy": 0.15842335820198059,
"num_tokens": 5777896.0,
"step": 3250
},
{
"entropy": 5.939679765701294,
"epoch": 0.167425352982023,
"grad_norm": 1.1328125,
"learning_rate": 0.00011523593951196702,
"loss": 5.7579,
"mean_token_accuracy": 0.14403122514486313,
"num_tokens": 5787407.0,
"step": 3255
},
{
"entropy": 5.859194707870484,
"epoch": 0.16768253478383868,
"grad_norm": 1.15625,
"learning_rate": 0.00011440858948780523,
"loss": 5.6431,
"mean_token_accuracy": 0.15607468485832215,
"num_tokens": 5796755.0,
"step": 3260
},
{
"entropy": 5.8848268508911135,
"epoch": 0.1679397165856544,
"grad_norm": 1.140625,
"learning_rate": 0.00011358564215828484,
"loss": 5.6047,
"mean_token_accuracy": 0.15192519575357438,
"num_tokens": 5805287.0,
"step": 3265
},
{
"entropy": 5.906562662124633,
"epoch": 0.1681968983874701,
"grad_norm": 1.0859375,
"learning_rate": 0.00011276712008492254,
"loss": 5.675,
"mean_token_accuracy": 0.1457243949174881,
"num_tokens": 5814063.0,
"step": 3270
},
{
"entropy": 5.881565189361572,
"epoch": 0.16845408018928582,
"grad_norm": 1.0859375,
"learning_rate": 0.00011195304570791451,
"loss": 5.6289,
"mean_token_accuracy": 0.15594786852598191,
"num_tokens": 5822806.0,
"step": 3275
},
{
"entropy": 5.907270908355713,
"epoch": 0.1687112619911015,
"grad_norm": 1.1484375,
"learning_rate": 0.00011114344134552094,
"loss": 5.7399,
"mean_token_accuracy": 0.14997021853923798,
"num_tokens": 5832063.0,
"step": 3280
},
{
"entropy": 5.953375959396363,
"epoch": 0.1689684437929172,
"grad_norm": 1.1171875,
"learning_rate": 0.0001103383291934545,
"loss": 5.7004,
"mean_token_accuracy": 0.15198036134243012,
"num_tokens": 5841074.0,
"step": 3285
},
{
"entropy": 5.969113302230835,
"epoch": 0.16922562559473292,
"grad_norm": 1.140625,
"learning_rate": 0.00010953773132427141,
"loss": 5.6453,
"mean_token_accuracy": 0.14734388515353203,
"num_tokens": 5849684.0,
"step": 3290
},
{
"entropy": 5.924904155731201,
"epoch": 0.1694828073965486,
"grad_norm": 1.1640625,
"learning_rate": 0.00010874166968676677,
"loss": 5.6203,
"mean_token_accuracy": 0.15403129756450654,
"num_tokens": 5859061.0,
"step": 3295
},
{
"entropy": 5.871574020385742,
"epoch": 0.16973998919836433,
"grad_norm": 1.0625,
"learning_rate": 0.00010795016610537251,
"loss": 5.632,
"mean_token_accuracy": 0.1510557383298874,
"num_tokens": 5868503.0,
"step": 3300
},
{
"entropy": 5.867011499404907,
"epoch": 0.16999717100018003,
"grad_norm": 1.09375,
"learning_rate": 0.00010716324227955904,
"loss": 5.6134,
"mean_token_accuracy": 0.16062485426664352,
"num_tokens": 5876423.0,
"step": 3305
},
{
"entropy": 5.856789302825928,
"epoch": 0.17025435280199572,
"grad_norm": 1.15625,
"learning_rate": 0.0001063809197832406,
"loss": 5.5683,
"mean_token_accuracy": 0.1588930994272232,
"num_tokens": 5886344.0,
"step": 3310
},
{
"entropy": 5.881897830963135,
"epoch": 0.17051153460381144,
"grad_norm": 1.125,
"learning_rate": 0.00010560322006418368,
"loss": 5.6169,
"mean_token_accuracy": 0.1640718847513199,
"num_tokens": 5895796.0,
"step": 3315
},
{
"entropy": 5.850374698638916,
"epoch": 0.17076871640562713,
"grad_norm": 1.1484375,
"learning_rate": 0.00010483016444341887,
"loss": 5.5439,
"mean_token_accuracy": 0.15615021735429763,
"num_tokens": 5904468.0,
"step": 3320
},
{
"entropy": 5.849407625198364,
"epoch": 0.17102589820744285,
"grad_norm": 1.0546875,
"learning_rate": 0.00010406177411465654,
"loss": 5.6368,
"mean_token_accuracy": 0.15428726151585578,
"num_tokens": 5913400.0,
"step": 3325
},
{
"entropy": 5.88852891921997,
"epoch": 0.17128308000925854,
"grad_norm": 1.0625,
"learning_rate": 0.00010329807014370562,
"loss": 5.6754,
"mean_token_accuracy": 0.14732003286480905,
"num_tokens": 5923090.0,
"step": 3330
},
{
"entropy": 5.885419511795044,
"epoch": 0.17154026181107423,
"grad_norm": 1.1640625,
"learning_rate": 0.00010253907346789632,
"loss": 5.7346,
"mean_token_accuracy": 0.15103226751089097,
"num_tokens": 5932161.0,
"step": 3335
},
{
"entropy": 5.883248662948608,
"epoch": 0.17179744361288996,
"grad_norm": 1.015625,
"learning_rate": 0.00010178480489550596,
"loss": 5.6232,
"mean_token_accuracy": 0.1532620370388031,
"num_tokens": 5941648.0,
"step": 3340
},
{
"entropy": 5.794731855392456,
"epoch": 0.17205462541470565,
"grad_norm": 1.0625,
"learning_rate": 0.00010103528510518836,
"loss": 5.5958,
"mean_token_accuracy": 0.15565524250268936,
"num_tokens": 5950626.0,
"step": 3345
},
{
"entropy": 5.915850353240967,
"epoch": 0.17231180721652137,
"grad_norm": 1.1484375,
"learning_rate": 0.0001002905346454073,
"loss": 5.6745,
"mean_token_accuracy": 0.15810006111860275,
"num_tokens": 5959121.0,
"step": 3350
},
{
"entropy": 5.86071810722351,
"epoch": 0.17256898901833706,
"grad_norm": 1.0625,
"learning_rate": 9.955057393387285e-05,
"loss": 5.6103,
"mean_token_accuracy": 0.15181936770677568,
"num_tokens": 5968103.0,
"step": 3355
},
{
"entropy": 5.904258584976196,
"epoch": 0.17282617082015275,
"grad_norm": 1.0234375,
"learning_rate": 9.88154232569816e-05,
"loss": 5.6643,
"mean_token_accuracy": 0.15518343448638916,
"num_tokens": 5977254.0,
"step": 3360
},
{
"entropy": 5.899582624435425,
"epoch": 0.17308335262196847,
"grad_norm": 1.078125,
"learning_rate": 9.808510276926075e-05,
"loss": 5.6762,
"mean_token_accuracy": 0.15250316262245178,
"num_tokens": 5986465.0,
"step": 3365
},
{
"entropy": 5.887260246276855,
"epoch": 0.17334053442378416,
"grad_norm": 1.0078125,
"learning_rate": 9.735963249281549e-05,
"loss": 5.6653,
"mean_token_accuracy": 0.15385335832834243,
"num_tokens": 5995485.0,
"step": 3370
},
{
"entropy": 5.884924602508545,
"epoch": 0.17359771622559989,
"grad_norm": 1.09375,
"learning_rate": 9.663903231677974e-05,
"loss": 5.6764,
"mean_token_accuracy": 0.15418671518564225,
"num_tokens": 6004841.0,
"step": 3375
},
{
"entropy": 5.911768388748169,
"epoch": 0.17385489802741558,
"grad_norm": 1.0859375,
"learning_rate": 9.592332199677145e-05,
"loss": 5.7133,
"mean_token_accuracy": 0.15220142304897308,
"num_tokens": 6014085.0,
"step": 3380
},
{
"entropy": 5.925537586212158,
"epoch": 0.17411207982923127,
"grad_norm": 1.234375,
"learning_rate": 9.521252115435061e-05,
"loss": 5.6319,
"mean_token_accuracy": 0.157326902449131,
"num_tokens": 6022832.0,
"step": 3385
},
{
"entropy": 5.880453252792359,
"epoch": 0.174369261631047,
"grad_norm": 1.0859375,
"learning_rate": 9.450664927648126e-05,
"loss": 5.6333,
"mean_token_accuracy": 0.1549530029296875,
"num_tokens": 6031691.0,
"step": 3390
},
{
"entropy": 5.865253829956055,
"epoch": 0.17462644343286268,
"grad_norm": 1.0703125,
"learning_rate": 9.380572571499758e-05,
"loss": 5.6492,
"mean_token_accuracy": 0.15932365134358406,
"num_tokens": 6040152.0,
"step": 3395
},
{
"entropy": 5.992641925811768,
"epoch": 0.1748836252346784,
"grad_norm": 1.0859375,
"learning_rate": 9.310976968607307e-05,
"loss": 5.8133,
"mean_token_accuracy": 0.14270031005144118,
"num_tokens": 6048442.0,
"step": 3400
},
{
"entropy": 5.924678897857666,
"epoch": 0.1751408070364941,
"grad_norm": 1.09375,
"learning_rate": 9.241880026969381e-05,
"loss": 5.5985,
"mean_token_accuracy": 0.16025597006082534,
"num_tokens": 6056866.0,
"step": 3405
},
{
"entropy": 5.947360467910767,
"epoch": 0.1753979888383098,
"grad_norm": 1.1171875,
"learning_rate": 9.173283640913537e-05,
"loss": 5.6802,
"mean_token_accuracy": 0.15019971132278442,
"num_tokens": 6066135.0,
"step": 3410
},
{
"entropy": 5.87064847946167,
"epoch": 0.1756551706401255,
"grad_norm": 1.109375,
"learning_rate": 9.10518969104436e-05,
"loss": 5.5018,
"mean_token_accuracy": 0.16035284996032714,
"num_tokens": 6074988.0,
"step": 3415
},
{
"entropy": 5.828763103485107,
"epoch": 0.1759123524419412,
"grad_norm": 1.1328125,
"learning_rate": 9.037600044191868e-05,
"loss": 5.5372,
"mean_token_accuracy": 0.16439700722694398,
"num_tokens": 6083529.0,
"step": 3420
},
{
"entropy": 5.821255922317505,
"epoch": 0.17616953424375692,
"grad_norm": 1.0703125,
"learning_rate": 8.970516553360383e-05,
"loss": 5.6481,
"mean_token_accuracy": 0.15584711730480194,
"num_tokens": 6092297.0,
"step": 3425
},
{
"entropy": 5.847524404525757,
"epoch": 0.1764267160455726,
"grad_norm": 1.1484375,
"learning_rate": 8.903941057677692e-05,
"loss": 5.6899,
"mean_token_accuracy": 0.15124824047088622,
"num_tokens": 6101684.0,
"step": 3430
},
{
"entropy": 5.901174688339234,
"epoch": 0.17668389784738833,
"grad_norm": 1.1328125,
"learning_rate": 8.837875382344635e-05,
"loss": 5.6799,
"mean_token_accuracy": 0.15357163697481155,
"num_tokens": 6110177.0,
"step": 3435
},
{
"entropy": 5.854598903656006,
"epoch": 0.17694107964920402,
"grad_norm": 1.1484375,
"learning_rate": 8.772321338585076e-05,
"loss": 5.6343,
"mean_token_accuracy": 0.15378045439720153,
"num_tokens": 6119478.0,
"step": 3440
},
{
"entropy": 5.812266826629639,
"epoch": 0.17719826145101972,
"grad_norm": 1.0625,
"learning_rate": 8.707280723596242e-05,
"loss": 5.5068,
"mean_token_accuracy": 0.16030199378728865,
"num_tokens": 6128139.0,
"step": 3445
},
{
"entropy": 5.8546020030975345,
"epoch": 0.17745544325283544,
"grad_norm": 1.0859375,
"learning_rate": 8.64275532049944e-05,
"loss": 5.5987,
"mean_token_accuracy": 0.15252354592084885,
"num_tokens": 6137327.0,
"step": 3450
},
{
"entropy": 5.837123441696167,
"epoch": 0.17771262505465113,
"grad_norm": 1.0703125,
"learning_rate": 8.578746898291198e-05,
"loss": 5.625,
"mean_token_accuracy": 0.15577959567308425,
"num_tokens": 6145897.0,
"step": 3455
},
{
"entropy": 5.930476522445678,
"epoch": 0.17796980685646685,
"grad_norm": 1.140625,
"learning_rate": 8.515257211794742e-05,
"loss": 5.6481,
"mean_token_accuracy": 0.1561284691095352,
"num_tokens": 6153899.0,
"step": 3460
},
{
"entropy": 5.863068532943726,
"epoch": 0.17822698865828254,
"grad_norm": 1.0546875,
"learning_rate": 8.452288001611896e-05,
"loss": 5.5791,
"mean_token_accuracy": 0.15927855372428895,
"num_tokens": 6162916.0,
"step": 3465
},
{
"entropy": 5.935356950759887,
"epoch": 0.17848417046009823,
"grad_norm": 1.1328125,
"learning_rate": 8.389840994075379e-05,
"loss": 5.6967,
"mean_token_accuracy": 0.15271873027086258,
"num_tokens": 6171492.0,
"step": 3470
},
{
"entropy": 5.934307670593261,
"epoch": 0.17874135226191395,
"grad_norm": 1.046875,
"learning_rate": 8.327917901201435e-05,
"loss": 5.7046,
"mean_token_accuracy": 0.14614737629890442,
"num_tokens": 6181942.0,
"step": 3475
},
{
"entropy": 5.855259418487549,
"epoch": 0.17899853406372965,
"grad_norm": 1.1171875,
"learning_rate": 8.266520420642931e-05,
"loss": 5.6575,
"mean_token_accuracy": 0.15523471981287001,
"num_tokens": 6190952.0,
"step": 3480
},
{
"entropy": 5.90379958152771,
"epoch": 0.17925571586554537,
"grad_norm": 1.09375,
"learning_rate": 8.205650235642828e-05,
"loss": 5.7315,
"mean_token_accuracy": 0.14720751941204072,
"num_tokens": 6200832.0,
"step": 3485
},
{
"entropy": 5.827523422241211,
"epoch": 0.17951289766736106,
"grad_norm": 1.109375,
"learning_rate": 8.145309014987978e-05,
"loss": 5.4486,
"mean_token_accuracy": 0.16118114292621613,
"num_tokens": 6209702.0,
"step": 3490
},
{
"entropy": 5.872140502929687,
"epoch": 0.17977007946917675,
"grad_norm": 1.1640625,
"learning_rate": 8.085498412963437e-05,
"loss": 5.669,
"mean_token_accuracy": 0.1495615378022194,
"num_tokens": 6219312.0,
"step": 3495
},
{
"entropy": 5.8615274906158445,
"epoch": 0.18002726127099247,
"grad_norm": 1.125,
"learning_rate": 8.026220069307078e-05,
"loss": 5.6061,
"mean_token_accuracy": 0.15797984451055527,
"num_tokens": 6228008.0,
"step": 3500
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 8371086317568000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}