Files
jpn-jpan-100mb-after-ppt-Dp…/checkpoint-4000/trainer_state.json
ModelHub XC fa35c70621 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/jpn-jpan-100mb-after-ppt-Dp-10mb-ckpt500_seed3407
Source: Original Platform
2026-07-30 03:39:19 +08:00

8123 lines
221 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.678362573099415,
"eval_steps": 500,
"global_step": 4000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 7.7522684097290036,
"epoch": 0.005847953216374269,
"grad_norm": 1.3359375,
"learning_rate": 2e-06,
"loss": 7.7708,
"mean_token_accuracy": 0.11476039662957191,
"num_tokens": 13999.0,
"step": 5
},
{
"entropy": 7.7173127174377445,
"epoch": 0.011695906432748537,
"grad_norm": 1.3203125,
"learning_rate": 4.5e-06,
"loss": 7.712,
"mean_token_accuracy": 0.1273074522614479,
"num_tokens": 25888.0,
"step": 10
},
{
"entropy": 7.66694827079773,
"epoch": 0.017543859649122806,
"grad_norm": 1.1953125,
"learning_rate": 7e-06,
"loss": 7.7338,
"mean_token_accuracy": 0.1251409351825714,
"num_tokens": 37699.0,
"step": 15
},
{
"entropy": 7.703865337371826,
"epoch": 0.023391812865497075,
"grad_norm": 1.0546875,
"learning_rate": 9.5e-06,
"loss": 7.7576,
"mean_token_accuracy": 0.12076537683606148,
"num_tokens": 49648.0,
"step": 20
},
{
"entropy": 7.764259910583496,
"epoch": 0.029239766081871343,
"grad_norm": 1.0234375,
"learning_rate": 1.2e-05,
"loss": 7.6864,
"mean_token_accuracy": 0.12975538596510888,
"num_tokens": 62255.0,
"step": 25
},
{
"entropy": 7.769811201095581,
"epoch": 0.03508771929824561,
"grad_norm": 0.99609375,
"learning_rate": 1.4500000000000002e-05,
"loss": 7.7319,
"mean_token_accuracy": 0.11793469190597534,
"num_tokens": 76003.0,
"step": 30
},
{
"entropy": 7.772569704055786,
"epoch": 0.04093567251461988,
"grad_norm": 0.9609375,
"learning_rate": 1.7000000000000003e-05,
"loss": 7.7096,
"mean_token_accuracy": 0.12931248769164086,
"num_tokens": 87585.0,
"step": 35
},
{
"entropy": 7.823340511322021,
"epoch": 0.04678362573099415,
"grad_norm": 1.1953125,
"learning_rate": 1.95e-05,
"loss": 7.678,
"mean_token_accuracy": 0.13150709196925164,
"num_tokens": 100404.0,
"step": 40
},
{
"entropy": 7.852498149871826,
"epoch": 0.05263157894736842,
"grad_norm": 0.98046875,
"learning_rate": 2.2e-05,
"loss": 7.6639,
"mean_token_accuracy": 0.12596714943647386,
"num_tokens": 113130.0,
"step": 45
},
{
"entropy": 7.778350687026977,
"epoch": 0.05847953216374269,
"grad_norm": 1.3828125,
"learning_rate": 2.4500000000000003e-05,
"loss": 7.6141,
"mean_token_accuracy": 0.1402079403400421,
"num_tokens": 125430.0,
"step": 50
},
{
"entropy": 7.769484996795654,
"epoch": 0.06432748538011696,
"grad_norm": 1.234375,
"learning_rate": 2.7e-05,
"loss": 7.6257,
"mean_token_accuracy": 0.1291840709745884,
"num_tokens": 137550.0,
"step": 55
},
{
"entropy": 7.694907188415527,
"epoch": 0.07017543859649122,
"grad_norm": 1.125,
"learning_rate": 2.95e-05,
"loss": 7.616,
"mean_token_accuracy": 0.13245319500565528,
"num_tokens": 149530.0,
"step": 60
},
{
"entropy": 7.757121801376343,
"epoch": 0.07602339181286549,
"grad_norm": 1.03125,
"learning_rate": 3.2e-05,
"loss": 7.6541,
"mean_token_accuracy": 0.12211295440793038,
"num_tokens": 161671.0,
"step": 65
},
{
"entropy": 7.8260785102844235,
"epoch": 0.08187134502923976,
"grad_norm": 1.03125,
"learning_rate": 3.4500000000000005e-05,
"loss": 7.6742,
"mean_token_accuracy": 0.12763192057609557,
"num_tokens": 174160.0,
"step": 70
},
{
"entropy": 7.788219547271728,
"epoch": 0.08771929824561403,
"grad_norm": 1.0625,
"learning_rate": 3.7e-05,
"loss": 7.6979,
"mean_token_accuracy": 0.12294255271553993,
"num_tokens": 186969.0,
"step": 75
},
{
"entropy": 7.8217706203460695,
"epoch": 0.0935672514619883,
"grad_norm": 0.9375,
"learning_rate": 3.95e-05,
"loss": 7.7355,
"mean_token_accuracy": 0.12626317963004113,
"num_tokens": 199470.0,
"step": 80
},
{
"entropy": 7.854635381698609,
"epoch": 0.09941520467836257,
"grad_norm": 1.0,
"learning_rate": 4.2000000000000004e-05,
"loss": 7.6322,
"mean_token_accuracy": 0.12727101594209672,
"num_tokens": 211306.0,
"step": 85
},
{
"entropy": 7.728736543655396,
"epoch": 0.10526315789473684,
"grad_norm": 1.0703125,
"learning_rate": 4.45e-05,
"loss": 7.5895,
"mean_token_accuracy": 0.12458127737045288,
"num_tokens": 223323.0,
"step": 90
},
{
"entropy": 7.74114408493042,
"epoch": 0.1111111111111111,
"grad_norm": 1.1484375,
"learning_rate": 4.7000000000000004e-05,
"loss": 7.6427,
"mean_token_accuracy": 0.1298776350915432,
"num_tokens": 235896.0,
"step": 95
},
{
"entropy": 7.772605514526367,
"epoch": 0.11695906432748537,
"grad_norm": 1.015625,
"learning_rate": 4.9500000000000004e-05,
"loss": 7.6593,
"mean_token_accuracy": 0.1269608959555626,
"num_tokens": 247879.0,
"step": 100
},
{
"entropy": 7.805002164840698,
"epoch": 0.12280701754385964,
"grad_norm": 0.96484375,
"learning_rate": 5.2e-05,
"loss": 7.5639,
"mean_token_accuracy": 0.13140838518738746,
"num_tokens": 259714.0,
"step": 105
},
{
"entropy": 7.809066724777222,
"epoch": 0.1286549707602339,
"grad_norm": 0.98046875,
"learning_rate": 5.45e-05,
"loss": 7.6391,
"mean_token_accuracy": 0.13385654166340827,
"num_tokens": 272429.0,
"step": 110
},
{
"entropy": 7.754804039001465,
"epoch": 0.13450292397660818,
"grad_norm": 1.0234375,
"learning_rate": 5.7e-05,
"loss": 7.6567,
"mean_token_accuracy": 0.1242964319884777,
"num_tokens": 285924.0,
"step": 115
},
{
"entropy": 7.7574787616729735,
"epoch": 0.14035087719298245,
"grad_norm": 0.8828125,
"learning_rate": 5.9499999999999996e-05,
"loss": 7.6416,
"mean_token_accuracy": 0.13203905522823334,
"num_tokens": 299453.0,
"step": 120
},
{
"entropy": 7.7849445819854735,
"epoch": 0.14619883040935672,
"grad_norm": 0.94921875,
"learning_rate": 6.2e-05,
"loss": 7.6541,
"mean_token_accuracy": 0.12795712649822236,
"num_tokens": 312295.0,
"step": 125
},
{
"entropy": 7.830564260482788,
"epoch": 0.15204678362573099,
"grad_norm": 1.03125,
"learning_rate": 6.450000000000001e-05,
"loss": 7.5997,
"mean_token_accuracy": 0.12964659035205842,
"num_tokens": 324730.0,
"step": 130
},
{
"entropy": 7.782875347137451,
"epoch": 0.15789473684210525,
"grad_norm": 0.9921875,
"learning_rate": 6.7e-05,
"loss": 7.5392,
"mean_token_accuracy": 0.1364399917423725,
"num_tokens": 336481.0,
"step": 135
},
{
"entropy": 7.790884017944336,
"epoch": 0.16374269005847952,
"grad_norm": 1.0234375,
"learning_rate": 6.950000000000001e-05,
"loss": 7.6003,
"mean_token_accuracy": 0.13024170324206352,
"num_tokens": 348987.0,
"step": 140
},
{
"entropy": 7.8166107654571535,
"epoch": 0.1695906432748538,
"grad_norm": 1.0078125,
"learning_rate": 7.2e-05,
"loss": 7.5865,
"mean_token_accuracy": 0.13023216873407364,
"num_tokens": 360390.0,
"step": 145
},
{
"entropy": 7.732658720016479,
"epoch": 0.17543859649122806,
"grad_norm": 1.0390625,
"learning_rate": 7.45e-05,
"loss": 7.5953,
"mean_token_accuracy": 0.1306314319372177,
"num_tokens": 372456.0,
"step": 150
},
{
"entropy": 7.831650114059448,
"epoch": 0.18128654970760233,
"grad_norm": 1.0703125,
"learning_rate": 7.7e-05,
"loss": 7.6024,
"mean_token_accuracy": 0.1245631642639637,
"num_tokens": 384185.0,
"step": 155
},
{
"entropy": 7.759004211425781,
"epoch": 0.1871345029239766,
"grad_norm": 1.09375,
"learning_rate": 7.950000000000001e-05,
"loss": 7.6135,
"mean_token_accuracy": 0.12875869423151015,
"num_tokens": 395399.0,
"step": 160
},
{
"entropy": 7.860350131988525,
"epoch": 0.19298245614035087,
"grad_norm": 1.0859375,
"learning_rate": 8.2e-05,
"loss": 7.611,
"mean_token_accuracy": 0.13090025410056114,
"num_tokens": 408676.0,
"step": 165
},
{
"entropy": 7.830869817733765,
"epoch": 0.19883040935672514,
"grad_norm": 1.0546875,
"learning_rate": 8.450000000000001e-05,
"loss": 7.6944,
"mean_token_accuracy": 0.1266174718737602,
"num_tokens": 421861.0,
"step": 170
},
{
"entropy": 7.768104171752929,
"epoch": 0.2046783625730994,
"grad_norm": 1.0625,
"learning_rate": 8.7e-05,
"loss": 7.623,
"mean_token_accuracy": 0.12830190733075142,
"num_tokens": 434852.0,
"step": 175
},
{
"entropy": 7.895460224151611,
"epoch": 0.21052631578947367,
"grad_norm": 1.0546875,
"learning_rate": 8.95e-05,
"loss": 7.6433,
"mean_token_accuracy": 0.12308355942368507,
"num_tokens": 447313.0,
"step": 180
},
{
"entropy": 7.782856607437134,
"epoch": 0.21637426900584794,
"grad_norm": 1.0390625,
"learning_rate": 9.2e-05,
"loss": 7.603,
"mean_token_accuracy": 0.13218898475170135,
"num_tokens": 460271.0,
"step": 185
},
{
"entropy": 7.745411825180054,
"epoch": 0.2222222222222222,
"grad_norm": 0.98046875,
"learning_rate": 9.45e-05,
"loss": 7.5913,
"mean_token_accuracy": 0.1339310348033905,
"num_tokens": 473006.0,
"step": 190
},
{
"entropy": 7.795257663726806,
"epoch": 0.22807017543859648,
"grad_norm": 1.09375,
"learning_rate": 9.7e-05,
"loss": 7.5571,
"mean_token_accuracy": 0.12507525384426116,
"num_tokens": 486100.0,
"step": 195
},
{
"entropy": 7.703856325149536,
"epoch": 0.23391812865497075,
"grad_norm": 1.2265625,
"learning_rate": 9.95e-05,
"loss": 7.4979,
"mean_token_accuracy": 0.1399431958794594,
"num_tokens": 499460.0,
"step": 200
},
{
"entropy": 7.747776317596435,
"epoch": 0.23976608187134502,
"grad_norm": 1.109375,
"learning_rate": 0.000102,
"loss": 7.5644,
"mean_token_accuracy": 0.13211438804864883,
"num_tokens": 511795.0,
"step": 205
},
{
"entropy": 7.779720592498779,
"epoch": 0.24561403508771928,
"grad_norm": 1.2265625,
"learning_rate": 0.00010449999999999999,
"loss": 7.6583,
"mean_token_accuracy": 0.13016858398914338,
"num_tokens": 524897.0,
"step": 210
},
{
"entropy": 7.713862800598145,
"epoch": 0.25146198830409355,
"grad_norm": 1.03125,
"learning_rate": 0.000107,
"loss": 7.5462,
"mean_token_accuracy": 0.12787842825055123,
"num_tokens": 538325.0,
"step": 215
},
{
"entropy": 7.847299242019654,
"epoch": 0.2573099415204678,
"grad_norm": 1.109375,
"learning_rate": 0.0001095,
"loss": 7.6379,
"mean_token_accuracy": 0.12373388409614564,
"num_tokens": 550979.0,
"step": 220
},
{
"entropy": 7.7990621566772464,
"epoch": 0.2631578947368421,
"grad_norm": 1.1171875,
"learning_rate": 0.000112,
"loss": 7.6099,
"mean_token_accuracy": 0.12962906658649445,
"num_tokens": 563001.0,
"step": 225
},
{
"entropy": 7.734949684143066,
"epoch": 0.26900584795321636,
"grad_norm": 1.09375,
"learning_rate": 0.0001145,
"loss": 7.508,
"mean_token_accuracy": 0.12917143255472183,
"num_tokens": 573600.0,
"step": 230
},
{
"entropy": 7.779465579986573,
"epoch": 0.27485380116959063,
"grad_norm": 1.1796875,
"learning_rate": 0.00011700000000000001,
"loss": 7.5455,
"mean_token_accuracy": 0.1345866911113262,
"num_tokens": 585287.0,
"step": 235
},
{
"entropy": 7.695637369155884,
"epoch": 0.2807017543859649,
"grad_norm": 1.3359375,
"learning_rate": 0.00011949999999999999,
"loss": 7.5678,
"mean_token_accuracy": 0.12697237282991408,
"num_tokens": 597386.0,
"step": 240
},
{
"entropy": 7.780313444137573,
"epoch": 0.28654970760233917,
"grad_norm": 1.03125,
"learning_rate": 0.000122,
"loss": 7.5723,
"mean_token_accuracy": 0.12808034643530847,
"num_tokens": 609256.0,
"step": 245
},
{
"entropy": 7.76597580909729,
"epoch": 0.29239766081871343,
"grad_norm": 1.15625,
"learning_rate": 0.0001245,
"loss": 7.5533,
"mean_token_accuracy": 0.13153037279844285,
"num_tokens": 621506.0,
"step": 250
},
{
"entropy": 7.672491025924683,
"epoch": 0.2982456140350877,
"grad_norm": 1.25,
"learning_rate": 0.000127,
"loss": 7.4974,
"mean_token_accuracy": 0.13769207671284675,
"num_tokens": 633512.0,
"step": 255
},
{
"entropy": 7.770991230010987,
"epoch": 0.30409356725146197,
"grad_norm": 1.1171875,
"learning_rate": 0.0001295,
"loss": 7.6359,
"mean_token_accuracy": 0.12444958984851837,
"num_tokens": 647098.0,
"step": 260
},
{
"entropy": 7.846727418899536,
"epoch": 0.30994152046783624,
"grad_norm": 1.0625,
"learning_rate": 0.000132,
"loss": 7.6429,
"mean_token_accuracy": 0.12304245010018348,
"num_tokens": 659559.0,
"step": 265
},
{
"entropy": 7.775905132293701,
"epoch": 0.3157894736842105,
"grad_norm": 1.0859375,
"learning_rate": 0.00013450000000000002,
"loss": 7.5725,
"mean_token_accuracy": 0.12677664533257485,
"num_tokens": 672621.0,
"step": 270
},
{
"entropy": 7.75470609664917,
"epoch": 0.3216374269005848,
"grad_norm": 1.0703125,
"learning_rate": 0.00013700000000000002,
"loss": 7.5534,
"mean_token_accuracy": 0.13169768303632737,
"num_tokens": 685652.0,
"step": 275
},
{
"entropy": 7.797368335723877,
"epoch": 0.32748538011695905,
"grad_norm": 1.109375,
"learning_rate": 0.0001395,
"loss": 7.6286,
"mean_token_accuracy": 0.1279862903058529,
"num_tokens": 696910.0,
"step": 280
},
{
"entropy": 7.671004962921143,
"epoch": 0.3333333333333333,
"grad_norm": 1.7265625,
"learning_rate": 0.00014199999999999998,
"loss": 7.4883,
"mean_token_accuracy": 0.13524112179875375,
"num_tokens": 709054.0,
"step": 285
},
{
"entropy": 7.824522686004639,
"epoch": 0.3391812865497076,
"grad_norm": 1.046875,
"learning_rate": 0.0001445,
"loss": 7.4892,
"mean_token_accuracy": 0.13072189688682556,
"num_tokens": 720902.0,
"step": 290
},
{
"entropy": 7.761558198928833,
"epoch": 0.34502923976608185,
"grad_norm": 1.203125,
"learning_rate": 0.000147,
"loss": 7.5921,
"mean_token_accuracy": 0.1260167084634304,
"num_tokens": 733319.0,
"step": 295
},
{
"entropy": 7.650327444076538,
"epoch": 0.3508771929824561,
"grad_norm": 1.0703125,
"learning_rate": 0.0001495,
"loss": 7.4744,
"mean_token_accuracy": 0.13074510917067528,
"num_tokens": 744817.0,
"step": 300
},
{
"entropy": 7.753329420089722,
"epoch": 0.3567251461988304,
"grad_norm": 1.0859375,
"learning_rate": 0.000152,
"loss": 7.5266,
"mean_token_accuracy": 0.125571209192276,
"num_tokens": 756582.0,
"step": 305
},
{
"entropy": 7.731254577636719,
"epoch": 0.36257309941520466,
"grad_norm": 1.125,
"learning_rate": 0.00015450000000000001,
"loss": 7.4451,
"mean_token_accuracy": 0.13850152045488356,
"num_tokens": 769273.0,
"step": 310
},
{
"entropy": 7.6755951881408695,
"epoch": 0.3684210526315789,
"grad_norm": 1.328125,
"learning_rate": 0.000157,
"loss": 7.5185,
"mean_token_accuracy": 0.13168835863471032,
"num_tokens": 782001.0,
"step": 315
},
{
"entropy": 7.720033788681031,
"epoch": 0.3742690058479532,
"grad_norm": 1.1171875,
"learning_rate": 0.0001595,
"loss": 7.5397,
"mean_token_accuracy": 0.13381237834692,
"num_tokens": 794575.0,
"step": 320
},
{
"entropy": 7.720466375350952,
"epoch": 0.38011695906432746,
"grad_norm": 1.0625,
"learning_rate": 0.000162,
"loss": 7.5329,
"mean_token_accuracy": 0.1308806821703911,
"num_tokens": 805583.0,
"step": 325
},
{
"entropy": 7.728007459640503,
"epoch": 0.38596491228070173,
"grad_norm": 1.171875,
"learning_rate": 0.00016450000000000001,
"loss": 7.5653,
"mean_token_accuracy": 0.1306055575609207,
"num_tokens": 817617.0,
"step": 330
},
{
"entropy": 7.779255723953247,
"epoch": 0.391812865497076,
"grad_norm": 1.125,
"learning_rate": 0.00016700000000000002,
"loss": 7.482,
"mean_token_accuracy": 0.13038639426231385,
"num_tokens": 830043.0,
"step": 335
},
{
"entropy": 7.62467098236084,
"epoch": 0.39766081871345027,
"grad_norm": 1.09375,
"learning_rate": 0.00016950000000000003,
"loss": 7.4178,
"mean_token_accuracy": 0.13518237322568893,
"num_tokens": 843200.0,
"step": 340
},
{
"entropy": 7.600871419906616,
"epoch": 0.40350877192982454,
"grad_norm": 1.3515625,
"learning_rate": 0.00017199999999999998,
"loss": 7.4983,
"mean_token_accuracy": 0.13517106473445892,
"num_tokens": 856031.0,
"step": 345
},
{
"entropy": 7.789513301849365,
"epoch": 0.4093567251461988,
"grad_norm": 1.59375,
"learning_rate": 0.00017449999999999999,
"loss": 7.491,
"mean_token_accuracy": 0.13276956006884574,
"num_tokens": 869119.0,
"step": 350
},
{
"entropy": 7.601604795455932,
"epoch": 0.4152046783625731,
"grad_norm": 1.125,
"learning_rate": 0.000177,
"loss": 7.4994,
"mean_token_accuracy": 0.13779703229665757,
"num_tokens": 880802.0,
"step": 355
},
{
"entropy": 7.7842954158782955,
"epoch": 0.42105263157894735,
"grad_norm": 1.1015625,
"learning_rate": 0.0001795,
"loss": 7.5207,
"mean_token_accuracy": 0.13423604667186737,
"num_tokens": 894237.0,
"step": 360
},
{
"entropy": 7.737492561340332,
"epoch": 0.4269005847953216,
"grad_norm": 1.1796875,
"learning_rate": 0.000182,
"loss": 7.5183,
"mean_token_accuracy": 0.13320327475667,
"num_tokens": 906695.0,
"step": 365
},
{
"entropy": 7.619091510772705,
"epoch": 0.4327485380116959,
"grad_norm": 1.15625,
"learning_rate": 0.0001845,
"loss": 7.49,
"mean_token_accuracy": 0.13559429571032525,
"num_tokens": 918955.0,
"step": 370
},
{
"entropy": 7.669496536254883,
"epoch": 0.43859649122807015,
"grad_norm": 1.0390625,
"learning_rate": 0.000187,
"loss": 7.544,
"mean_token_accuracy": 0.1327928401529789,
"num_tokens": 931812.0,
"step": 375
},
{
"entropy": 7.779175567626953,
"epoch": 0.4444444444444444,
"grad_norm": 1.0703125,
"learning_rate": 0.0001895,
"loss": 7.5409,
"mean_token_accuracy": 0.12402037903666496,
"num_tokens": 945261.0,
"step": 380
},
{
"entropy": 7.642067909240723,
"epoch": 0.4502923976608187,
"grad_norm": 1.296875,
"learning_rate": 0.000192,
"loss": 7.4515,
"mean_token_accuracy": 0.13938093855977057,
"num_tokens": 958376.0,
"step": 385
},
{
"entropy": 7.622897481918335,
"epoch": 0.45614035087719296,
"grad_norm": 1.0625,
"learning_rate": 0.0001945,
"loss": 7.4556,
"mean_token_accuracy": 0.1381414406001568,
"num_tokens": 971709.0,
"step": 390
},
{
"entropy": 7.7873311042785645,
"epoch": 0.4619883040935672,
"grad_norm": 1.234375,
"learning_rate": 0.00019700000000000002,
"loss": 7.451,
"mean_token_accuracy": 0.13401587978005408,
"num_tokens": 983847.0,
"step": 395
},
{
"entropy": 7.600602531433106,
"epoch": 0.4678362573099415,
"grad_norm": 1.078125,
"learning_rate": 0.00019950000000000002,
"loss": 7.5516,
"mean_token_accuracy": 0.1232217237353325,
"num_tokens": 997034.0,
"step": 400
},
{
"entropy": 7.722095966339111,
"epoch": 0.47368421052631576,
"grad_norm": 1.1875,
"learning_rate": 0.000202,
"loss": 7.5863,
"mean_token_accuracy": 0.1275957316160202,
"num_tokens": 1010213.0,
"step": 405
},
{
"entropy": 7.782728147506714,
"epoch": 0.47953216374269003,
"grad_norm": 1.234375,
"learning_rate": 0.00020449999999999998,
"loss": 7.4336,
"mean_token_accuracy": 0.13219931200146676,
"num_tokens": 1021618.0,
"step": 410
},
{
"entropy": 7.5872598648071286,
"epoch": 0.4853801169590643,
"grad_norm": 1.1796875,
"learning_rate": 0.000207,
"loss": 7.4806,
"mean_token_accuracy": 0.1273957036435604,
"num_tokens": 1033809.0,
"step": 415
},
{
"entropy": 7.725764799118042,
"epoch": 0.49122807017543857,
"grad_norm": 1.0859375,
"learning_rate": 0.0002095,
"loss": 7.4478,
"mean_token_accuracy": 0.1341485410928726,
"num_tokens": 1045291.0,
"step": 420
},
{
"entropy": 7.599104166030884,
"epoch": 0.49707602339181284,
"grad_norm": 1.0859375,
"learning_rate": 0.000212,
"loss": 7.4463,
"mean_token_accuracy": 0.13240791261196136,
"num_tokens": 1057516.0,
"step": 425
},
{
"entropy": 7.597379302978515,
"epoch": 0.5029239766081871,
"grad_norm": 1.078125,
"learning_rate": 0.0002145,
"loss": 7.4051,
"mean_token_accuracy": 0.14025759547948838,
"num_tokens": 1070675.0,
"step": 430
},
{
"entropy": 7.742543315887451,
"epoch": 0.5087719298245614,
"grad_norm": 1.09375,
"learning_rate": 0.00021700000000000002,
"loss": 7.4834,
"mean_token_accuracy": 0.13848798274993895,
"num_tokens": 1082965.0,
"step": 435
},
{
"entropy": 7.514439630508423,
"epoch": 0.5146198830409356,
"grad_norm": 1.046875,
"learning_rate": 0.0002195,
"loss": 7.4668,
"mean_token_accuracy": 0.12758100926876068,
"num_tokens": 1095922.0,
"step": 440
},
{
"entropy": 7.691053152084351,
"epoch": 0.52046783625731,
"grad_norm": 1.2421875,
"learning_rate": 0.000222,
"loss": 7.445,
"mean_token_accuracy": 0.13450392335653305,
"num_tokens": 1109002.0,
"step": 445
},
{
"entropy": 7.727744150161743,
"epoch": 0.5263157894736842,
"grad_norm": 1.15625,
"learning_rate": 0.0002245,
"loss": 7.4662,
"mean_token_accuracy": 0.12763761729002,
"num_tokens": 1121199.0,
"step": 450
},
{
"entropy": 7.560290861129761,
"epoch": 0.5321637426900585,
"grad_norm": 1.0625,
"learning_rate": 0.00022700000000000002,
"loss": 7.4169,
"mean_token_accuracy": 0.13524916470050813,
"num_tokens": 1134721.0,
"step": 455
},
{
"entropy": 7.655321359634399,
"epoch": 0.5380116959064327,
"grad_norm": 1.1015625,
"learning_rate": 0.00022950000000000002,
"loss": 7.5093,
"mean_token_accuracy": 0.1298431448638439,
"num_tokens": 1147954.0,
"step": 460
},
{
"entropy": 7.60046911239624,
"epoch": 0.543859649122807,
"grad_norm": 1.0859375,
"learning_rate": 0.00023200000000000003,
"loss": 7.4142,
"mean_token_accuracy": 0.13469598144292833,
"num_tokens": 1161208.0,
"step": 465
},
{
"entropy": 7.722092056274414,
"epoch": 0.5497076023391813,
"grad_norm": 1.09375,
"learning_rate": 0.00023449999999999998,
"loss": 7.5282,
"mean_token_accuracy": 0.12658010125160218,
"num_tokens": 1173789.0,
"step": 470
},
{
"entropy": 7.6619044780731205,
"epoch": 0.5555555555555556,
"grad_norm": 1.0390625,
"learning_rate": 0.000237,
"loss": 7.424,
"mean_token_accuracy": 0.13303308114409446,
"num_tokens": 1185765.0,
"step": 475
},
{
"entropy": 7.570261764526367,
"epoch": 0.5614035087719298,
"grad_norm": 1.0703125,
"learning_rate": 0.0002395,
"loss": 7.451,
"mean_token_accuracy": 0.13050716370344162,
"num_tokens": 1197954.0,
"step": 480
},
{
"entropy": 7.640900421142578,
"epoch": 0.5672514619883041,
"grad_norm": 1.0625,
"learning_rate": 0.000242,
"loss": 7.3757,
"mean_token_accuracy": 0.13130198270082474,
"num_tokens": 1211285.0,
"step": 485
},
{
"entropy": 7.608647298812866,
"epoch": 0.5730994152046783,
"grad_norm": 1.1171875,
"learning_rate": 0.0002445,
"loss": 7.4658,
"mean_token_accuracy": 0.12969516664743425,
"num_tokens": 1223197.0,
"step": 490
},
{
"entropy": 7.631179285049439,
"epoch": 0.5789473684210527,
"grad_norm": 1.0546875,
"learning_rate": 0.000247,
"loss": 7.3974,
"mean_token_accuracy": 0.1334150068461895,
"num_tokens": 1234817.0,
"step": 495
},
{
"entropy": 7.633148241043091,
"epoch": 0.5847953216374269,
"grad_norm": 1.15625,
"learning_rate": 0.0002495,
"loss": 7.4529,
"mean_token_accuracy": 0.1385871522128582,
"num_tokens": 1249305.0,
"step": 500
},
{
"epoch": 0.5847953216374269,
"eval_entropy": 7.589141852736121,
"eval_loss": 7.436342716217041,
"eval_mean_token_accuracy": 0.12382437618707573,
"eval_num_tokens": 1249305.0,
"eval_runtime": 2.3017,
"eval_samples_per_second": 1176.107,
"eval_steps_per_second": 147.285,
"step": 500
},
{
"entropy": 7.552242279052734,
"epoch": 0.5906432748538012,
"grad_norm": 1.1953125,
"learning_rate": 0.000252,
"loss": 7.4344,
"mean_token_accuracy": 0.13413268253207206,
"num_tokens": 1262182.0,
"step": 505
},
{
"entropy": 7.569356870651245,
"epoch": 0.5964912280701754,
"grad_norm": 1.046875,
"learning_rate": 0.0002545,
"loss": 7.4669,
"mean_token_accuracy": 0.130877798050642,
"num_tokens": 1274616.0,
"step": 510
},
{
"entropy": 7.56549391746521,
"epoch": 0.6023391812865497,
"grad_norm": 1.1640625,
"learning_rate": 0.000257,
"loss": 7.4634,
"mean_token_accuracy": 0.12909993678331375,
"num_tokens": 1287306.0,
"step": 515
},
{
"entropy": 7.517426347732544,
"epoch": 0.6081871345029239,
"grad_norm": 1.234375,
"learning_rate": 0.0002595,
"loss": 7.342,
"mean_token_accuracy": 0.13786138594150543,
"num_tokens": 1299472.0,
"step": 520
},
{
"entropy": 7.555473279953003,
"epoch": 0.6140350877192983,
"grad_norm": 1.953125,
"learning_rate": 0.000262,
"loss": 7.283,
"mean_token_accuracy": 0.14004315435886383,
"num_tokens": 1312636.0,
"step": 525
},
{
"entropy": 7.51561393737793,
"epoch": 0.6198830409356725,
"grad_norm": 1.265625,
"learning_rate": 0.00026450000000000003,
"loss": 7.3192,
"mean_token_accuracy": 0.14248516857624055,
"num_tokens": 1324058.0,
"step": 530
},
{
"entropy": 7.568233871459961,
"epoch": 0.6257309941520468,
"grad_norm": 1.0703125,
"learning_rate": 0.00026700000000000004,
"loss": 7.4306,
"mean_token_accuracy": 0.12730365842580796,
"num_tokens": 1337605.0,
"step": 535
},
{
"entropy": 7.645518589019775,
"epoch": 0.631578947368421,
"grad_norm": 1.1796875,
"learning_rate": 0.00026950000000000005,
"loss": 7.4333,
"mean_token_accuracy": 0.1309638313949108,
"num_tokens": 1350658.0,
"step": 540
},
{
"entropy": 7.496008110046387,
"epoch": 0.6374269005847953,
"grad_norm": 1.3359375,
"learning_rate": 0.00027200000000000005,
"loss": 7.3572,
"mean_token_accuracy": 0.13723124265670777,
"num_tokens": 1362091.0,
"step": 545
},
{
"entropy": 7.592266511917114,
"epoch": 0.6432748538011696,
"grad_norm": 1.0078125,
"learning_rate": 0.0002745,
"loss": 7.3788,
"mean_token_accuracy": 0.13762461990118027,
"num_tokens": 1374055.0,
"step": 550
},
{
"entropy": 7.408201408386231,
"epoch": 0.6491228070175439,
"grad_norm": 1.28125,
"learning_rate": 0.000277,
"loss": 7.2616,
"mean_token_accuracy": 0.13666822388768196,
"num_tokens": 1385269.0,
"step": 555
},
{
"entropy": 7.505675172805786,
"epoch": 0.6549707602339181,
"grad_norm": 1.0546875,
"learning_rate": 0.0002795,
"loss": 7.3816,
"mean_token_accuracy": 0.13430810645222663,
"num_tokens": 1396559.0,
"step": 560
},
{
"entropy": 7.50752067565918,
"epoch": 0.6608187134502924,
"grad_norm": 1.71875,
"learning_rate": 0.00028199999999999997,
"loss": 7.4251,
"mean_token_accuracy": 0.13418283313512802,
"num_tokens": 1408838.0,
"step": 565
},
{
"entropy": 7.553399276733399,
"epoch": 0.6666666666666666,
"grad_norm": 1.1484375,
"learning_rate": 0.0002845,
"loss": 7.2892,
"mean_token_accuracy": 0.14057099148631097,
"num_tokens": 1421023.0,
"step": 570
},
{
"entropy": 7.452613353729248,
"epoch": 0.672514619883041,
"grad_norm": 1.1953125,
"learning_rate": 0.000287,
"loss": 7.3615,
"mean_token_accuracy": 0.135744871199131,
"num_tokens": 1433912.0,
"step": 575
},
{
"entropy": 7.519769906997681,
"epoch": 0.6783625730994152,
"grad_norm": 1.15625,
"learning_rate": 0.0002895,
"loss": 7.3484,
"mean_token_accuracy": 0.1338112011551857,
"num_tokens": 1445262.0,
"step": 580
},
{
"entropy": 7.566982316970825,
"epoch": 0.6842105263157895,
"grad_norm": 0.9609375,
"learning_rate": 0.000292,
"loss": 7.3174,
"mean_token_accuracy": 0.13909269124269485,
"num_tokens": 1457927.0,
"step": 585
},
{
"entropy": 7.478474092483521,
"epoch": 0.6900584795321637,
"grad_norm": 1.078125,
"learning_rate": 0.0002945,
"loss": 7.3998,
"mean_token_accuracy": 0.13400934338569642,
"num_tokens": 1470116.0,
"step": 590
},
{
"entropy": 7.556169080734253,
"epoch": 0.695906432748538,
"grad_norm": 1.2734375,
"learning_rate": 0.000297,
"loss": 7.2901,
"mean_token_accuracy": 0.13774340003728866,
"num_tokens": 1482067.0,
"step": 595
},
{
"entropy": 7.410288572311401,
"epoch": 0.7017543859649122,
"grad_norm": 1.3125,
"learning_rate": 0.0002995,
"loss": 7.3664,
"mean_token_accuracy": 0.13011181652545928,
"num_tokens": 1493902.0,
"step": 600
},
{
"entropy": 7.562840366363526,
"epoch": 0.7076023391812866,
"grad_norm": 1.09375,
"learning_rate": 0.000302,
"loss": 7.3262,
"mean_token_accuracy": 0.1308012142777443,
"num_tokens": 1505689.0,
"step": 605
},
{
"entropy": 7.458141326904297,
"epoch": 0.7134502923976608,
"grad_norm": 1.1875,
"learning_rate": 0.0003045,
"loss": 7.2804,
"mean_token_accuracy": 0.14782539159059524,
"num_tokens": 1518002.0,
"step": 610
},
{
"entropy": 7.489599323272705,
"epoch": 0.7192982456140351,
"grad_norm": 1.0625,
"learning_rate": 0.000307,
"loss": 7.3166,
"mean_token_accuracy": 0.13400111868977546,
"num_tokens": 1529307.0,
"step": 615
},
{
"entropy": 7.606138706207275,
"epoch": 0.7251461988304093,
"grad_norm": 1.109375,
"learning_rate": 0.0003095,
"loss": 7.4568,
"mean_token_accuracy": 0.12007877230644226,
"num_tokens": 1542351.0,
"step": 620
},
{
"entropy": 7.29756646156311,
"epoch": 0.7309941520467836,
"grad_norm": 1.2109375,
"learning_rate": 0.000312,
"loss": 7.2716,
"mean_token_accuracy": 0.1381143569946289,
"num_tokens": 1556263.0,
"step": 625
},
{
"entropy": 7.489748096466064,
"epoch": 0.7368421052631579,
"grad_norm": 1.265625,
"learning_rate": 0.0003145,
"loss": 7.3245,
"mean_token_accuracy": 0.136425893753767,
"num_tokens": 1568906.0,
"step": 630
},
{
"entropy": 7.391974353790284,
"epoch": 0.7426900584795322,
"grad_norm": 1.0625,
"learning_rate": 0.000317,
"loss": 7.297,
"mean_token_accuracy": 0.14263810962438583,
"num_tokens": 1580631.0,
"step": 635
},
{
"entropy": 7.490023469924926,
"epoch": 0.7485380116959064,
"grad_norm": 1.2265625,
"learning_rate": 0.0003195,
"loss": 7.289,
"mean_token_accuracy": 0.1338388778269291,
"num_tokens": 1592369.0,
"step": 640
},
{
"entropy": 7.392187595367432,
"epoch": 0.7543859649122807,
"grad_norm": 1.1484375,
"learning_rate": 0.000322,
"loss": 7.339,
"mean_token_accuracy": 0.14198264628648757,
"num_tokens": 1604888.0,
"step": 645
},
{
"entropy": 7.5100304126739506,
"epoch": 0.7602339181286549,
"grad_norm": 1.3203125,
"learning_rate": 0.00032450000000000003,
"loss": 7.2629,
"mean_token_accuracy": 0.14026070460677148,
"num_tokens": 1617128.0,
"step": 650
},
{
"entropy": 7.432464599609375,
"epoch": 0.7660818713450293,
"grad_norm": 1.0390625,
"learning_rate": 0.00032700000000000003,
"loss": 7.3001,
"mean_token_accuracy": 0.13010574504733086,
"num_tokens": 1629350.0,
"step": 655
},
{
"entropy": 7.502846670150757,
"epoch": 0.7719298245614035,
"grad_norm": 1.1953125,
"learning_rate": 0.00032950000000000004,
"loss": 7.3361,
"mean_token_accuracy": 0.12987025827169418,
"num_tokens": 1643082.0,
"step": 660
},
{
"entropy": 7.421878957748413,
"epoch": 0.7777777777777778,
"grad_norm": 1.046875,
"learning_rate": 0.00033200000000000005,
"loss": 7.3107,
"mean_token_accuracy": 0.13674438670277594,
"num_tokens": 1654785.0,
"step": 665
},
{
"entropy": 7.4461047649383545,
"epoch": 0.783625730994152,
"grad_norm": 1.1328125,
"learning_rate": 0.00033450000000000005,
"loss": 7.3228,
"mean_token_accuracy": 0.13429757431149483,
"num_tokens": 1667704.0,
"step": 670
},
{
"entropy": 7.477173137664795,
"epoch": 0.7894736842105263,
"grad_norm": 1.03125,
"learning_rate": 0.000337,
"loss": 7.2898,
"mean_token_accuracy": 0.13417055681347848,
"num_tokens": 1680459.0,
"step": 675
},
{
"entropy": 7.343410968780518,
"epoch": 0.7953216374269005,
"grad_norm": 1.3203125,
"learning_rate": 0.0003395,
"loss": 7.2102,
"mean_token_accuracy": 0.13917673528194427,
"num_tokens": 1692912.0,
"step": 680
},
{
"entropy": 7.442608833312988,
"epoch": 0.8011695906432749,
"grad_norm": 2.59375,
"learning_rate": 0.000342,
"loss": 7.236,
"mean_token_accuracy": 0.1385551854968071,
"num_tokens": 1705329.0,
"step": 685
},
{
"entropy": 7.451218032836914,
"epoch": 0.8070175438596491,
"grad_norm": 1.15625,
"learning_rate": 0.00034449999999999997,
"loss": 7.3228,
"mean_token_accuracy": 0.1291360892355442,
"num_tokens": 1717283.0,
"step": 690
},
{
"entropy": 7.335363721847534,
"epoch": 0.8128654970760234,
"grad_norm": 1.1875,
"learning_rate": 0.000347,
"loss": 7.2772,
"mean_token_accuracy": 0.1356094777584076,
"num_tokens": 1730308.0,
"step": 695
},
{
"entropy": 7.4717034816741945,
"epoch": 0.8187134502923976,
"grad_norm": 1.234375,
"learning_rate": 0.0003495,
"loss": 7.3221,
"mean_token_accuracy": 0.1344013422727585,
"num_tokens": 1742716.0,
"step": 700
},
{
"entropy": 7.367938613891601,
"epoch": 0.8245614035087719,
"grad_norm": 1.1640625,
"learning_rate": 0.000352,
"loss": 7.2753,
"mean_token_accuracy": 0.13793661966919898,
"num_tokens": 1754183.0,
"step": 705
},
{
"entropy": 7.361904954910278,
"epoch": 0.8304093567251462,
"grad_norm": 1.1640625,
"learning_rate": 0.0003545,
"loss": 7.2833,
"mean_token_accuracy": 0.13037458211183547,
"num_tokens": 1766601.0,
"step": 710
},
{
"entropy": 7.394190931320191,
"epoch": 0.8362573099415205,
"grad_norm": 1.7578125,
"learning_rate": 0.000357,
"loss": 7.1833,
"mean_token_accuracy": 0.14882892221212388,
"num_tokens": 1778756.0,
"step": 715
},
{
"entropy": 7.174529027938843,
"epoch": 0.8421052631578947,
"grad_norm": 1.1171875,
"learning_rate": 0.0003595,
"loss": 7.2478,
"mean_token_accuracy": 0.1429412543773651,
"num_tokens": 1791485.0,
"step": 720
},
{
"entropy": 7.4221092700958256,
"epoch": 0.847953216374269,
"grad_norm": 1.1875,
"learning_rate": 0.000362,
"loss": 7.2633,
"mean_token_accuracy": 0.1324923552572727,
"num_tokens": 1803712.0,
"step": 725
},
{
"entropy": 7.2948565006256105,
"epoch": 0.8538011695906432,
"grad_norm": 1.0078125,
"learning_rate": 0.0003645,
"loss": 7.2204,
"mean_token_accuracy": 0.1371877059340477,
"num_tokens": 1818387.0,
"step": 730
},
{
"entropy": 7.388651275634766,
"epoch": 0.8596491228070176,
"grad_norm": 1.1171875,
"learning_rate": 0.000367,
"loss": 7.2283,
"mean_token_accuracy": 0.13937100917100906,
"num_tokens": 1830113.0,
"step": 735
},
{
"entropy": 7.378299808502197,
"epoch": 0.8654970760233918,
"grad_norm": 1.1875,
"learning_rate": 0.0003695,
"loss": 7.3293,
"mean_token_accuracy": 0.13593609109520913,
"num_tokens": 1841789.0,
"step": 740
},
{
"entropy": 7.341324663162231,
"epoch": 0.8713450292397661,
"grad_norm": 1.09375,
"learning_rate": 0.000372,
"loss": 7.2004,
"mean_token_accuracy": 0.13838357105851173,
"num_tokens": 1853669.0,
"step": 745
},
{
"entropy": 7.236590003967285,
"epoch": 0.8771929824561403,
"grad_norm": 1.078125,
"learning_rate": 0.0003745,
"loss": 7.2461,
"mean_token_accuracy": 0.136163379997015,
"num_tokens": 1865322.0,
"step": 750
},
{
"entropy": 7.365720558166504,
"epoch": 0.8830409356725146,
"grad_norm": 1.0546875,
"learning_rate": 0.000377,
"loss": 7.1657,
"mean_token_accuracy": 0.14459074139595032,
"num_tokens": 1879039.0,
"step": 755
},
{
"entropy": 7.403848600387573,
"epoch": 0.8888888888888888,
"grad_norm": 1.0390625,
"learning_rate": 0.0003795,
"loss": 7.2886,
"mean_token_accuracy": 0.13285375908017158,
"num_tokens": 1893078.0,
"step": 760
},
{
"entropy": 7.370996904373169,
"epoch": 0.8947368421052632,
"grad_norm": 1.1171875,
"learning_rate": 0.000382,
"loss": 7.3194,
"mean_token_accuracy": 0.13308921158313752,
"num_tokens": 1907399.0,
"step": 765
},
{
"entropy": 7.321315145492553,
"epoch": 0.9005847953216374,
"grad_norm": 1.0,
"learning_rate": 0.0003845,
"loss": 7.2799,
"mean_token_accuracy": 0.13092010468244553,
"num_tokens": 1919290.0,
"step": 770
},
{
"entropy": 7.46008620262146,
"epoch": 0.9064327485380117,
"grad_norm": 1.140625,
"learning_rate": 0.00038700000000000003,
"loss": 7.2349,
"mean_token_accuracy": 0.1373835727572441,
"num_tokens": 1931658.0,
"step": 775
},
{
"entropy": 7.3157525062561035,
"epoch": 0.9122807017543859,
"grad_norm": 1.1171875,
"learning_rate": 0.00038950000000000003,
"loss": 7.2629,
"mean_token_accuracy": 0.13429330810904502,
"num_tokens": 1943881.0,
"step": 780
},
{
"entropy": 7.276627683639527,
"epoch": 0.9181286549707602,
"grad_norm": 1.1171875,
"learning_rate": 0.00039200000000000004,
"loss": 7.1786,
"mean_token_accuracy": 0.1390835165977478,
"num_tokens": 1956288.0,
"step": 785
},
{
"entropy": 7.266375255584717,
"epoch": 0.9239766081871345,
"grad_norm": 1.1171875,
"learning_rate": 0.00039450000000000005,
"loss": 7.0636,
"mean_token_accuracy": 0.14030921161174775,
"num_tokens": 1967265.0,
"step": 790
},
{
"entropy": 7.203761053085327,
"epoch": 0.9298245614035088,
"grad_norm": 1.1484375,
"learning_rate": 0.00039700000000000005,
"loss": 7.1881,
"mean_token_accuracy": 0.13456991314888,
"num_tokens": 1980039.0,
"step": 795
},
{
"entropy": 7.337719869613648,
"epoch": 0.935672514619883,
"grad_norm": 1.1015625,
"learning_rate": 0.0003995,
"loss": 7.1764,
"mean_token_accuracy": 0.13603565096855164,
"num_tokens": 1992735.0,
"step": 800
},
{
"entropy": 7.296339225769043,
"epoch": 0.9415204678362573,
"grad_norm": 1.15625,
"learning_rate": 0.000402,
"loss": 7.2013,
"mean_token_accuracy": 0.13806802779436111,
"num_tokens": 2004545.0,
"step": 805
},
{
"entropy": 7.24875774383545,
"epoch": 0.9473684210526315,
"grad_norm": 1.09375,
"learning_rate": 0.0004045,
"loss": 7.1875,
"mean_token_accuracy": 0.13867619559168815,
"num_tokens": 2017100.0,
"step": 810
},
{
"entropy": 7.204592752456665,
"epoch": 0.9532163742690059,
"grad_norm": 1.1875,
"learning_rate": 0.00040699999999999997,
"loss": 7.1545,
"mean_token_accuracy": 0.14778759256005286,
"num_tokens": 2029868.0,
"step": 815
},
{
"entropy": 7.328850173950196,
"epoch": 0.9590643274853801,
"grad_norm": 1.15625,
"learning_rate": 0.0004095,
"loss": 7.2096,
"mean_token_accuracy": 0.13469874411821364,
"num_tokens": 2041334.0,
"step": 820
},
{
"entropy": 7.2642162322998045,
"epoch": 0.9649122807017544,
"grad_norm": 1.0,
"learning_rate": 0.000412,
"loss": 7.2774,
"mean_token_accuracy": 0.1368864133954048,
"num_tokens": 2054797.0,
"step": 825
},
{
"entropy": 7.313835954666137,
"epoch": 0.9707602339181286,
"grad_norm": 0.98828125,
"learning_rate": 0.0004145,
"loss": 7.1486,
"mean_token_accuracy": 0.13503469973802568,
"num_tokens": 2068337.0,
"step": 830
},
{
"entropy": 7.304871654510498,
"epoch": 0.9766081871345029,
"grad_norm": 1.078125,
"learning_rate": 0.000417,
"loss": 7.2026,
"mean_token_accuracy": 0.14170103818178176,
"num_tokens": 2079984.0,
"step": 835
},
{
"entropy": 7.234012746810913,
"epoch": 0.9824561403508771,
"grad_norm": 1.1484375,
"learning_rate": 0.0004195,
"loss": 7.192,
"mean_token_accuracy": 0.14052301198244094,
"num_tokens": 2093069.0,
"step": 840
},
{
"entropy": 7.241004896163941,
"epoch": 0.9883040935672515,
"grad_norm": 1.109375,
"learning_rate": 0.000422,
"loss": 7.1643,
"mean_token_accuracy": 0.13957486748695375,
"num_tokens": 2104753.0,
"step": 845
},
{
"entropy": 7.209813642501831,
"epoch": 0.9941520467836257,
"grad_norm": 0.98046875,
"learning_rate": 0.0004245,
"loss": 7.165,
"mean_token_accuracy": 0.13409762531518937,
"num_tokens": 2116576.0,
"step": 850
},
{
"entropy": 7.2191554546356205,
"epoch": 1.0,
"grad_norm": 1.1796875,
"learning_rate": 0.000427,
"loss": 7.1645,
"mean_token_accuracy": 0.1336888462305069,
"num_tokens": 2129484.0,
"step": 855
},
{
"entropy": 7.1861903190612795,
"epoch": 1.0058479532163742,
"grad_norm": 1.1484375,
"learning_rate": 0.0004295,
"loss": 6.9777,
"mean_token_accuracy": 0.14769867211580276,
"num_tokens": 2142000.0,
"step": 860
},
{
"entropy": 7.141885423660279,
"epoch": 1.0116959064327484,
"grad_norm": 1.140625,
"learning_rate": 0.000432,
"loss": 6.9415,
"mean_token_accuracy": 0.15276771709322928,
"num_tokens": 2152965.0,
"step": 865
},
{
"entropy": 7.1822991371154785,
"epoch": 1.0175438596491229,
"grad_norm": 1.0078125,
"learning_rate": 0.0004345,
"loss": 7.0209,
"mean_token_accuracy": 0.136310812830925,
"num_tokens": 2165078.0,
"step": 870
},
{
"entropy": 7.08724045753479,
"epoch": 1.023391812865497,
"grad_norm": 1.1484375,
"learning_rate": 0.000437,
"loss": 6.9511,
"mean_token_accuracy": 0.14670970737934114,
"num_tokens": 2176706.0,
"step": 875
},
{
"entropy": 7.297170639038086,
"epoch": 1.0292397660818713,
"grad_norm": 1.1171875,
"learning_rate": 0.0004395,
"loss": 6.9646,
"mean_token_accuracy": 0.1434108167886734,
"num_tokens": 2190157.0,
"step": 880
},
{
"entropy": 7.129994964599609,
"epoch": 1.0350877192982457,
"grad_norm": 1.0625,
"learning_rate": 0.000442,
"loss": 6.9484,
"mean_token_accuracy": 0.1423846922814846,
"num_tokens": 2201821.0,
"step": 885
},
{
"entropy": 7.031896543502808,
"epoch": 1.04093567251462,
"grad_norm": 1.0625,
"learning_rate": 0.0004445,
"loss": 6.8791,
"mean_token_accuracy": 0.14986850768327714,
"num_tokens": 2214504.0,
"step": 890
},
{
"entropy": 7.176162052154541,
"epoch": 1.0467836257309941,
"grad_norm": 1.015625,
"learning_rate": 0.000447,
"loss": 7.0018,
"mean_token_accuracy": 0.14039593786001206,
"num_tokens": 2226318.0,
"step": 895
},
{
"entropy": 7.179743337631225,
"epoch": 1.0526315789473684,
"grad_norm": 1.109375,
"learning_rate": 0.00044950000000000003,
"loss": 7.0454,
"mean_token_accuracy": 0.13472965955734253,
"num_tokens": 2237892.0,
"step": 900
},
{
"entropy": 7.097790002822876,
"epoch": 1.0584795321637426,
"grad_norm": 1.2109375,
"learning_rate": 0.00045200000000000004,
"loss": 6.9788,
"mean_token_accuracy": 0.14418615847826005,
"num_tokens": 2250656.0,
"step": 905
},
{
"entropy": 7.133308935165405,
"epoch": 1.064327485380117,
"grad_norm": 0.9921875,
"learning_rate": 0.00045450000000000004,
"loss": 7.0098,
"mean_token_accuracy": 0.14070403948426247,
"num_tokens": 2263685.0,
"step": 910
},
{
"entropy": 7.104922723770142,
"epoch": 1.0701754385964912,
"grad_norm": 1.015625,
"learning_rate": 0.00045700000000000005,
"loss": 6.9873,
"mean_token_accuracy": 0.13877484947443008,
"num_tokens": 2275413.0,
"step": 915
},
{
"entropy": 7.1140893459320065,
"epoch": 1.0760233918128654,
"grad_norm": 1.0,
"learning_rate": 0.00045950000000000006,
"loss": 6.97,
"mean_token_accuracy": 0.14143042415380477,
"num_tokens": 2288165.0,
"step": 920
},
{
"entropy": 7.182982397079468,
"epoch": 1.0818713450292399,
"grad_norm": 1.0078125,
"learning_rate": 0.000462,
"loss": 6.9813,
"mean_token_accuracy": 0.13951057344675064,
"num_tokens": 2300574.0,
"step": 925
},
{
"entropy": 7.078811120986939,
"epoch": 1.087719298245614,
"grad_norm": 1.2734375,
"learning_rate": 0.0004645,
"loss": 6.9801,
"mean_token_accuracy": 0.1362003989517689,
"num_tokens": 2311631.0,
"step": 930
},
{
"entropy": 7.15027084350586,
"epoch": 1.0935672514619883,
"grad_norm": 1.0859375,
"learning_rate": 0.000467,
"loss": 6.9854,
"mean_token_accuracy": 0.14325082898139954,
"num_tokens": 2324312.0,
"step": 935
},
{
"entropy": 7.1474010944366455,
"epoch": 1.0994152046783625,
"grad_norm": 1.015625,
"learning_rate": 0.0004695,
"loss": 7.0872,
"mean_token_accuracy": 0.13512967377901078,
"num_tokens": 2337747.0,
"step": 940
},
{
"entropy": 7.074398517608643,
"epoch": 1.1052631578947367,
"grad_norm": 0.92578125,
"learning_rate": 0.000472,
"loss": 7.0155,
"mean_token_accuracy": 0.14261559247970582,
"num_tokens": 2349830.0,
"step": 945
},
{
"entropy": 7.10729398727417,
"epoch": 1.1111111111111112,
"grad_norm": 1.21875,
"learning_rate": 0.0004745,
"loss": 6.9669,
"mean_token_accuracy": 0.1496504321694374,
"num_tokens": 2361825.0,
"step": 950
},
{
"entropy": 7.026542329788208,
"epoch": 1.1169590643274854,
"grad_norm": 0.9765625,
"learning_rate": 0.000477,
"loss": 6.9057,
"mean_token_accuracy": 0.14415617287158966,
"num_tokens": 2373963.0,
"step": 955
},
{
"entropy": 7.144531345367431,
"epoch": 1.1228070175438596,
"grad_norm": 1.015625,
"learning_rate": 0.0004795,
"loss": 7.056,
"mean_token_accuracy": 0.13805767446756362,
"num_tokens": 2386348.0,
"step": 960
},
{
"entropy": 7.1077625274658205,
"epoch": 1.128654970760234,
"grad_norm": 1.0234375,
"learning_rate": 0.000482,
"loss": 6.9714,
"mean_token_accuracy": 0.13752444088459015,
"num_tokens": 2398338.0,
"step": 965
},
{
"entropy": 7.0632524490356445,
"epoch": 1.1345029239766082,
"grad_norm": 1.046875,
"learning_rate": 0.0004845,
"loss": 6.9275,
"mean_token_accuracy": 0.14290639460086824,
"num_tokens": 2411855.0,
"step": 970
},
{
"entropy": 7.059965705871582,
"epoch": 1.1403508771929824,
"grad_norm": 1.0703125,
"learning_rate": 0.000487,
"loss": 7.0115,
"mean_token_accuracy": 0.1466517761349678,
"num_tokens": 2424271.0,
"step": 975
},
{
"entropy": 7.02401294708252,
"epoch": 1.1461988304093567,
"grad_norm": 1.0703125,
"learning_rate": 0.0004895,
"loss": 7.0055,
"mean_token_accuracy": 0.1405914232134819,
"num_tokens": 2436668.0,
"step": 980
},
{
"entropy": 7.073333978652954,
"epoch": 1.1520467836257309,
"grad_norm": 1.0625,
"learning_rate": 0.000492,
"loss": 6.9482,
"mean_token_accuracy": 0.1412999577820301,
"num_tokens": 2449451.0,
"step": 985
},
{
"entropy": 7.103520298004151,
"epoch": 1.1578947368421053,
"grad_norm": 1.0234375,
"learning_rate": 0.0004945,
"loss": 7.0655,
"mean_token_accuracy": 0.13647906705737115,
"num_tokens": 2463107.0,
"step": 990
},
{
"entropy": 7.134810161590576,
"epoch": 1.1637426900584795,
"grad_norm": 1.015625,
"learning_rate": 0.000497,
"loss": 7.0015,
"mean_token_accuracy": 0.13996057361364364,
"num_tokens": 2475443.0,
"step": 995
},
{
"entropy": 7.027540588378907,
"epoch": 1.1695906432748537,
"grad_norm": 0.96875,
"learning_rate": 0.0004995,
"loss": 6.9309,
"mean_token_accuracy": 0.14212803095579146,
"num_tokens": 2486884.0,
"step": 1000
},
{
"epoch": 1.1695906432748537,
"eval_entropy": 7.025503185294722,
"eval_loss": 7.157474517822266,
"eval_mean_token_accuracy": 0.13106913304720127,
"eval_num_tokens": 2486884.0,
"eval_runtime": 2.2531,
"eval_samples_per_second": 1201.45,
"eval_steps_per_second": 150.459,
"step": 1000
},
{
"entropy": 6.979807329177857,
"epoch": 1.1754385964912282,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999996875147963,
"loss": 6.892,
"mean_token_accuracy": 0.15283920094370843,
"num_tokens": 2499310.0,
"step": 1005
},
{
"entropy": 7.101342678070068,
"epoch": 1.1812865497076024,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999984180451436,
"loss": 7.0351,
"mean_token_accuracy": 0.1321335293352604,
"num_tokens": 2512230.0,
"step": 1010
},
{
"entropy": 7.048287725448608,
"epoch": 1.1871345029239766,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999961720662221,
"loss": 7.0786,
"mean_token_accuracy": 0.13702130541205407,
"num_tokens": 2525255.0,
"step": 1015
},
{
"entropy": 7.002170991897583,
"epoch": 1.1929824561403508,
"grad_norm": 1.109375,
"learning_rate": 0.0004999929495877796,
"loss": 6.9527,
"mean_token_accuracy": 0.1432950221002102,
"num_tokens": 2537672.0,
"step": 1020
},
{
"entropy": 6.989665222167969,
"epoch": 1.198830409356725,
"grad_norm": 0.9375,
"learning_rate": 0.0004999887506238018,
"loss": 6.9835,
"mean_token_accuracy": 0.14342591613531114,
"num_tokens": 2550371.0,
"step": 1025
},
{
"entropy": 7.050039863586425,
"epoch": 1.2046783625730995,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999835751925124,
"loss": 7.0056,
"mean_token_accuracy": 0.13500169217586516,
"num_tokens": 2563708.0,
"step": 1030
},
{
"entropy": 7.09551887512207,
"epoch": 1.2105263157894737,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999774233163734,
"loss": 6.9677,
"mean_token_accuracy": 0.13617606908082963,
"num_tokens": 2576529.0,
"step": 1035
},
{
"entropy": 7.029808092117309,
"epoch": 1.2163742690058479,
"grad_norm": 0.984375,
"learning_rate": 0.0004999702950220841,
"loss": 6.9991,
"mean_token_accuracy": 0.13568439111113548,
"num_tokens": 2588970.0,
"step": 1040
},
{
"entropy": 7.0275428771972654,
"epoch": 1.2222222222222223,
"grad_norm": 1.03125,
"learning_rate": 0.0004999621903405819,
"loss": 6.9464,
"mean_token_accuracy": 0.1417937010526657,
"num_tokens": 2601134.0,
"step": 1045
},
{
"entropy": 7.014184284210205,
"epoch": 1.2280701754385965,
"grad_norm": 1.0390625,
"learning_rate": 0.000499953109307042,
"loss": 7.0107,
"mean_token_accuracy": 0.13796233609318734,
"num_tokens": 2612670.0,
"step": 1050
},
{
"entropy": 6.969291162490845,
"epoch": 1.2339181286549707,
"grad_norm": 0.94921875,
"learning_rate": 0.0004999430519608762,
"loss": 6.9681,
"mean_token_accuracy": 0.1497281849384308,
"num_tokens": 2625157.0,
"step": 1055
},
{
"entropy": 7.100042295455933,
"epoch": 1.239766081871345,
"grad_norm": 0.9765625,
"learning_rate": 0.0004999320183457346,
"loss": 6.9569,
"mean_token_accuracy": 0.13751377016305924,
"num_tokens": 2638318.0,
"step": 1060
},
{
"entropy": 7.008196592330933,
"epoch": 1.2456140350877192,
"grad_norm": 1.0625,
"learning_rate": 0.0004999200085095035,
"loss": 6.9446,
"mean_token_accuracy": 0.14191727340221405,
"num_tokens": 2651024.0,
"step": 1065
},
{
"entropy": 6.810675716400146,
"epoch": 1.2514619883040936,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999070225043068,
"loss": 6.8837,
"mean_token_accuracy": 0.1498500719666481,
"num_tokens": 2665568.0,
"step": 1070
},
{
"entropy": 7.1478063583374025,
"epoch": 1.2573099415204678,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998930603865042,
"loss": 7.0059,
"mean_token_accuracy": 0.13958486467599868,
"num_tokens": 2678748.0,
"step": 1075
},
{
"entropy": 7.033294582366944,
"epoch": 1.263157894736842,
"grad_norm": 0.9921875,
"learning_rate": 0.0004998781222166929,
"loss": 6.9588,
"mean_token_accuracy": 0.14076827839016914,
"num_tokens": 2690682.0,
"step": 1080
},
{
"entropy": 6.9186183452606205,
"epoch": 1.2690058479532165,
"grad_norm": 0.97265625,
"learning_rate": 0.0004998622080597052,
"loss": 6.9853,
"mean_token_accuracy": 0.13392557948827744,
"num_tokens": 2703077.0,
"step": 1085
},
{
"entropy": 7.00119915008545,
"epoch": 1.2748538011695907,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998453179846098,
"loss": 6.9615,
"mean_token_accuracy": 0.13907949030399322,
"num_tokens": 2714609.0,
"step": 1090
},
{
"entropy": 7.074500322341919,
"epoch": 1.280701754385965,
"grad_norm": 0.97265625,
"learning_rate": 0.0004998274520647109,
"loss": 6.9282,
"mean_token_accuracy": 0.14250491559505463,
"num_tokens": 2726907.0,
"step": 1095
},
{
"entropy": 6.838219261169433,
"epoch": 1.286549707602339,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998086103775478,
"loss": 6.9617,
"mean_token_accuracy": 0.14029049202799798,
"num_tokens": 2739248.0,
"step": 1100
},
{
"entropy": 7.036256265640259,
"epoch": 1.2923976608187133,
"grad_norm": 1.046875,
"learning_rate": 0.0004997887930048947,
"loss": 6.8889,
"mean_token_accuracy": 0.14379191845655442,
"num_tokens": 2753842.0,
"step": 1105
},
{
"entropy": 6.885680103302002,
"epoch": 1.2982456140350878,
"grad_norm": 0.98046875,
"learning_rate": 0.0004997680000327607,
"loss": 6.9546,
"mean_token_accuracy": 0.13402040377259256,
"num_tokens": 2767249.0,
"step": 1110
},
{
"entropy": 7.031604290008545,
"epoch": 1.304093567251462,
"grad_norm": 1.0625,
"learning_rate": 0.0004997462315513884,
"loss": 6.9374,
"mean_token_accuracy": 0.1431535616517067,
"num_tokens": 2779657.0,
"step": 1115
},
{
"entropy": 6.946121454238892,
"epoch": 1.3099415204678362,
"grad_norm": 1.6328125,
"learning_rate": 0.000499723487655255,
"loss": 6.8436,
"mean_token_accuracy": 0.14475864619016648,
"num_tokens": 2792760.0,
"step": 1120
},
{
"entropy": 6.936051940917968,
"epoch": 1.3157894736842106,
"grad_norm": 0.94140625,
"learning_rate": 0.0004996997684430703,
"loss": 6.8776,
"mean_token_accuracy": 0.14265076816082,
"num_tokens": 2805277.0,
"step": 1125
},
{
"entropy": 6.961184453964234,
"epoch": 1.3216374269005848,
"grad_norm": 0.96484375,
"learning_rate": 0.0004996750740177775,
"loss": 7.0026,
"mean_token_accuracy": 0.1412787467241287,
"num_tokens": 2818341.0,
"step": 1130
},
{
"entropy": 7.070265436172486,
"epoch": 1.327485380116959,
"grad_norm": 0.9609375,
"learning_rate": 0.0004996494044865521,
"loss": 6.9404,
"mean_token_accuracy": 0.1430366963148117,
"num_tokens": 2830199.0,
"step": 1135
},
{
"entropy": 6.805611324310303,
"epoch": 1.3333333333333333,
"grad_norm": 1.0,
"learning_rate": 0.0004996227599608018,
"loss": 6.8311,
"mean_token_accuracy": 0.14909116476774215,
"num_tokens": 2842141.0,
"step": 1140
},
{
"entropy": 7.002711963653565,
"epoch": 1.3391812865497075,
"grad_norm": 1.078125,
"learning_rate": 0.0004995951405561658,
"loss": 6.9512,
"mean_token_accuracy": 0.13545295223593712,
"num_tokens": 2854929.0,
"step": 1145
},
{
"entropy": 6.921211051940918,
"epoch": 1.345029239766082,
"grad_norm": 1.09375,
"learning_rate": 0.0004995665463925142,
"loss": 6.9319,
"mean_token_accuracy": 0.1432844214141369,
"num_tokens": 2867034.0,
"step": 1150
},
{
"entropy": 6.984521532058716,
"epoch": 1.3508771929824561,
"grad_norm": 0.91015625,
"learning_rate": 0.0004995369775939478,
"loss": 6.8507,
"mean_token_accuracy": 0.14970757812261581,
"num_tokens": 2881254.0,
"step": 1155
},
{
"entropy": 6.876342678070069,
"epoch": 1.3567251461988303,
"grad_norm": 0.9296875,
"learning_rate": 0.0004995064342887972,
"loss": 6.9515,
"mean_token_accuracy": 0.14343279600143433,
"num_tokens": 2894592.0,
"step": 1160
},
{
"entropy": 6.904094123840332,
"epoch": 1.3625730994152048,
"grad_norm": 1.0390625,
"learning_rate": 0.0004994749166096226,
"loss": 6.8629,
"mean_token_accuracy": 0.14436162114143372,
"num_tokens": 2907196.0,
"step": 1165
},
{
"entropy": 6.960309219360352,
"epoch": 1.368421052631579,
"grad_norm": 0.95703125,
"learning_rate": 0.0004994424246932129,
"loss": 6.9383,
"mean_token_accuracy": 0.1376577876508236,
"num_tokens": 2920398.0,
"step": 1170
},
{
"entropy": 6.878757905960083,
"epoch": 1.3742690058479532,
"grad_norm": 0.98828125,
"learning_rate": 0.0004994089586805856,
"loss": 6.8508,
"mean_token_accuracy": 0.14595492482185363,
"num_tokens": 2932052.0,
"step": 1175
},
{
"entropy": 7.06005220413208,
"epoch": 1.3801169590643274,
"grad_norm": 1.0,
"learning_rate": 0.0004993745187169852,
"loss": 6.9287,
"mean_token_accuracy": 0.1375073656439781,
"num_tokens": 2943620.0,
"step": 1180
},
{
"entropy": 6.855983829498291,
"epoch": 1.3859649122807016,
"grad_norm": 0.984375,
"learning_rate": 0.000499339104951884,
"loss": 6.8938,
"mean_token_accuracy": 0.15123256742954255,
"num_tokens": 2956159.0,
"step": 1185
},
{
"entropy": 6.924196577072143,
"epoch": 1.391812865497076,
"grad_norm": 0.9921875,
"learning_rate": 0.00049930271753898,
"loss": 6.9,
"mean_token_accuracy": 0.14046342819929122,
"num_tokens": 2967332.0,
"step": 1190
},
{
"entropy": 6.889228439331054,
"epoch": 1.3976608187134503,
"grad_norm": 0.98046875,
"learning_rate": 0.0004992653566361974,
"loss": 6.9015,
"mean_token_accuracy": 0.1373600736260414,
"num_tokens": 2980168.0,
"step": 1195
},
{
"entropy": 6.93927321434021,
"epoch": 1.4035087719298245,
"grad_norm": 0.96484375,
"learning_rate": 0.0004992270224056849,
"loss": 6.9826,
"mean_token_accuracy": 0.13944907411932944,
"num_tokens": 2993509.0,
"step": 1200
},
{
"entropy": 6.949486160278321,
"epoch": 1.409356725146199,
"grad_norm": 0.98828125,
"learning_rate": 0.0004991877150138162,
"loss": 6.8945,
"mean_token_accuracy": 0.14218948408961296,
"num_tokens": 3005827.0,
"step": 1205
},
{
"entropy": 6.871033239364624,
"epoch": 1.4152046783625731,
"grad_norm": 0.9140625,
"learning_rate": 0.0004991474346311879,
"loss": 6.8768,
"mean_token_accuracy": 0.14366292506456374,
"num_tokens": 3018968.0,
"step": 1210
},
{
"entropy": 6.929807806015015,
"epoch": 1.4210526315789473,
"grad_norm": 1.046875,
"learning_rate": 0.0004991061814326198,
"loss": 6.9135,
"mean_token_accuracy": 0.13588419929146767,
"num_tokens": 3031892.0,
"step": 1215
},
{
"entropy": 6.92696590423584,
"epoch": 1.4269005847953216,
"grad_norm": 1.6640625,
"learning_rate": 0.0004990639555971539,
"loss": 6.8453,
"mean_token_accuracy": 0.150522081553936,
"num_tokens": 3045994.0,
"step": 1220
},
{
"entropy": 6.801218414306641,
"epoch": 1.4327485380116958,
"grad_norm": 0.91015625,
"learning_rate": 0.0004990207573080533,
"loss": 6.8506,
"mean_token_accuracy": 0.149581628292799,
"num_tokens": 3058304.0,
"step": 1225
},
{
"entropy": 6.902471113204956,
"epoch": 1.4385964912280702,
"grad_norm": 0.9765625,
"learning_rate": 0.0004989765867528014,
"loss": 6.8681,
"mean_token_accuracy": 0.1441365472972393,
"num_tokens": 3071102.0,
"step": 1230
},
{
"entropy": 6.81841254234314,
"epoch": 1.4444444444444444,
"grad_norm": 0.96484375,
"learning_rate": 0.0004989314441231019,
"loss": 6.9074,
"mean_token_accuracy": 0.1388896532356739,
"num_tokens": 3084653.0,
"step": 1235
},
{
"entropy": 6.912723541259766,
"epoch": 1.4502923976608186,
"grad_norm": 1.0,
"learning_rate": 0.000498885329614877,
"loss": 6.9009,
"mean_token_accuracy": 0.14601168483495713,
"num_tokens": 3097425.0,
"step": 1240
},
{
"entropy": 6.887241220474243,
"epoch": 1.456140350877193,
"grad_norm": 1.0,
"learning_rate": 0.0004988382434282668,
"loss": 6.9244,
"mean_token_accuracy": 0.14221828803420067,
"num_tokens": 3111898.0,
"step": 1245
},
{
"entropy": 6.905599069595337,
"epoch": 1.4619883040935673,
"grad_norm": 1.0703125,
"learning_rate": 0.000498790185767629,
"loss": 6.8614,
"mean_token_accuracy": 0.14325395748019218,
"num_tokens": 3124271.0,
"step": 1250
},
{
"entropy": 6.929810428619385,
"epoch": 1.4678362573099415,
"grad_norm": 0.94140625,
"learning_rate": 0.000498741156841537,
"loss": 6.9486,
"mean_token_accuracy": 0.1420268952846527,
"num_tokens": 3136344.0,
"step": 1255
},
{
"entropy": 6.911685276031494,
"epoch": 1.4736842105263157,
"grad_norm": 1.1171875,
"learning_rate": 0.00049869115686278,
"loss": 6.8542,
"mean_token_accuracy": 0.14559442698955535,
"num_tokens": 3148299.0,
"step": 1260
},
{
"entropy": 6.937784719467163,
"epoch": 1.47953216374269,
"grad_norm": 0.8671875,
"learning_rate": 0.0004986401860483615,
"loss": 6.9151,
"mean_token_accuracy": 0.14457187727093695,
"num_tokens": 3161537.0,
"step": 1265
},
{
"entropy": 6.829940843582153,
"epoch": 1.4853801169590644,
"grad_norm": 0.9453125,
"learning_rate": 0.0004985882446194984,
"loss": 6.8594,
"mean_token_accuracy": 0.14513164460659028,
"num_tokens": 3173676.0,
"step": 1270
},
{
"entropy": 6.917054986953735,
"epoch": 1.4912280701754386,
"grad_norm": 1.7890625,
"learning_rate": 0.0004985353328016204,
"loss": 6.819,
"mean_token_accuracy": 0.1553460657596588,
"num_tokens": 3186542.0,
"step": 1275
},
{
"entropy": 6.822628211975098,
"epoch": 1.4970760233918128,
"grad_norm": 1.046875,
"learning_rate": 0.0004984814508243685,
"loss": 6.8335,
"mean_token_accuracy": 0.14759107008576394,
"num_tokens": 3197867.0,
"step": 1280
},
{
"entropy": 6.894301414489746,
"epoch": 1.5029239766081872,
"grad_norm": 1.0625,
"learning_rate": 0.0004984265989215942,
"loss": 6.8249,
"mean_token_accuracy": 0.1432124361395836,
"num_tokens": 3209671.0,
"step": 1285
},
{
"entropy": 6.8511247634887695,
"epoch": 1.5087719298245614,
"grad_norm": 1.09375,
"learning_rate": 0.0004983707773313589,
"loss": 6.8196,
"mean_token_accuracy": 0.15341102480888366,
"num_tokens": 3220707.0,
"step": 1290
},
{
"entropy": 6.715557336807251,
"epoch": 1.5146198830409356,
"grad_norm": 1.015625,
"learning_rate": 0.0004983139862959322,
"loss": 6.7834,
"mean_token_accuracy": 0.154496743530035,
"num_tokens": 3235122.0,
"step": 1295
},
{
"entropy": 6.907053995132446,
"epoch": 1.52046783625731,
"grad_norm": 0.94921875,
"learning_rate": 0.0004982562260617912,
"loss": 6.7848,
"mean_token_accuracy": 0.1419589526951313,
"num_tokens": 3246833.0,
"step": 1300
},
{
"entropy": 6.8496777534484865,
"epoch": 1.526315789473684,
"grad_norm": 0.98046875,
"learning_rate": 0.0004981974968796197,
"loss": 6.8826,
"mean_token_accuracy": 0.1394804447889328,
"num_tokens": 3260493.0,
"step": 1305
},
{
"entropy": 6.791020298004151,
"epoch": 1.5321637426900585,
"grad_norm": 1.078125,
"learning_rate": 0.0004981377990043064,
"loss": 6.8302,
"mean_token_accuracy": 0.14329657703638077,
"num_tokens": 3272445.0,
"step": 1310
},
{
"entropy": 6.856331872940063,
"epoch": 1.5380116959064327,
"grad_norm": 0.98828125,
"learning_rate": 0.0004980771326949442,
"loss": 6.8378,
"mean_token_accuracy": 0.14126284345984458,
"num_tokens": 3284360.0,
"step": 1315
},
{
"entropy": 6.84411244392395,
"epoch": 1.543859649122807,
"grad_norm": 0.92578125,
"learning_rate": 0.0004980154982148296,
"loss": 6.8287,
"mean_token_accuracy": 0.14228586554527284,
"num_tokens": 3296841.0,
"step": 1320
},
{
"entropy": 6.804647207260132,
"epoch": 1.5497076023391814,
"grad_norm": 0.9140625,
"learning_rate": 0.0004979528958314604,
"loss": 6.82,
"mean_token_accuracy": 0.142367422580719,
"num_tokens": 3309393.0,
"step": 1325
},
{
"entropy": 6.910936260223389,
"epoch": 1.5555555555555556,
"grad_norm": 0.99609375,
"learning_rate": 0.0004978893258165354,
"loss": 6.9056,
"mean_token_accuracy": 0.1410933665931225,
"num_tokens": 3322094.0,
"step": 1330
},
{
"entropy": 6.825253486633301,
"epoch": 1.5614035087719298,
"grad_norm": 0.9375,
"learning_rate": 0.0004978247884459532,
"loss": 6.8156,
"mean_token_accuracy": 0.14649758189916612,
"num_tokens": 3334468.0,
"step": 1335
},
{
"entropy": 6.852710199356079,
"epoch": 1.5672514619883042,
"grad_norm": 1.03125,
"learning_rate": 0.0004977592839998105,
"loss": 6.8036,
"mean_token_accuracy": 0.14304608553647996,
"num_tokens": 3346367.0,
"step": 1340
},
{
"entropy": 6.791905450820923,
"epoch": 1.5730994152046782,
"grad_norm": 1.0390625,
"learning_rate": 0.0004976928127624013,
"loss": 6.793,
"mean_token_accuracy": 0.14914015531539918,
"num_tokens": 3357463.0,
"step": 1345
},
{
"entropy": 6.742348051071167,
"epoch": 1.5789473684210527,
"grad_norm": 1.1953125,
"learning_rate": 0.0004976253750222157,
"loss": 6.7969,
"mean_token_accuracy": 0.14524156600236893,
"num_tokens": 3369465.0,
"step": 1350
},
{
"entropy": 6.838311195373535,
"epoch": 1.5847953216374269,
"grad_norm": 0.984375,
"learning_rate": 0.0004975569710719382,
"loss": 6.9109,
"mean_token_accuracy": 0.1383696511387825,
"num_tokens": 3382859.0,
"step": 1355
},
{
"entropy": 6.865691041946411,
"epoch": 1.590643274853801,
"grad_norm": 0.9921875,
"learning_rate": 0.0004974876012084468,
"loss": 6.8452,
"mean_token_accuracy": 0.14151466339826585,
"num_tokens": 3395431.0,
"step": 1360
},
{
"entropy": 6.795973062515259,
"epoch": 1.5964912280701755,
"grad_norm": 1.15625,
"learning_rate": 0.0004974172657328116,
"loss": 6.7491,
"mean_token_accuracy": 0.14309013560414313,
"num_tokens": 3408388.0,
"step": 1365
},
{
"entropy": 6.784850358963013,
"epoch": 1.6023391812865497,
"grad_norm": 1.1953125,
"learning_rate": 0.0004973459649502939,
"loss": 6.7616,
"mean_token_accuracy": 0.14853412210941314,
"num_tokens": 3421275.0,
"step": 1370
},
{
"entropy": 6.804135656356811,
"epoch": 1.608187134502924,
"grad_norm": 0.9765625,
"learning_rate": 0.0004972736991703439,
"loss": 6.8119,
"mean_token_accuracy": 0.14620652347803115,
"num_tokens": 3433537.0,
"step": 1375
},
{
"entropy": 6.811048221588135,
"epoch": 1.6140350877192984,
"grad_norm": 1.2109375,
"learning_rate": 0.0004972004687066005,
"loss": 6.7985,
"mean_token_accuracy": 0.14614380970597268,
"num_tokens": 3445167.0,
"step": 1380
},
{
"entropy": 6.662167978286743,
"epoch": 1.6198830409356724,
"grad_norm": 0.90625,
"learning_rate": 0.000497126273876889,
"loss": 6.7943,
"mean_token_accuracy": 0.15630243718624115,
"num_tokens": 3458529.0,
"step": 1385
},
{
"entropy": 6.829443407058716,
"epoch": 1.6257309941520468,
"grad_norm": 0.97265625,
"learning_rate": 0.0004970511150032205,
"loss": 6.7945,
"mean_token_accuracy": 0.14732301533222197,
"num_tokens": 3470315.0,
"step": 1390
},
{
"entropy": 6.75582447052002,
"epoch": 1.631578947368421,
"grad_norm": 0.9921875,
"learning_rate": 0.0004969749924117896,
"loss": 6.701,
"mean_token_accuracy": 0.14506951123476028,
"num_tokens": 3481899.0,
"step": 1395
},
{
"entropy": 6.743738031387329,
"epoch": 1.6374269005847952,
"grad_norm": 1.0,
"learning_rate": 0.0004968979064329741,
"loss": 6.8369,
"mean_token_accuracy": 0.15120789930224418,
"num_tokens": 3494076.0,
"step": 1400
},
{
"entropy": 6.9596514225006105,
"epoch": 1.6432748538011697,
"grad_norm": 0.93359375,
"learning_rate": 0.0004968198574013323,
"loss": 6.8425,
"mean_token_accuracy": 0.13812664225697519,
"num_tokens": 3507670.0,
"step": 1405
},
{
"entropy": 6.792782258987427,
"epoch": 1.6491228070175439,
"grad_norm": 0.9921875,
"learning_rate": 0.000496740845655603,
"loss": 6.7433,
"mean_token_accuracy": 0.14641203954815865,
"num_tokens": 3519704.0,
"step": 1410
},
{
"entropy": 6.787240839004516,
"epoch": 1.654970760233918,
"grad_norm": 1.0,
"learning_rate": 0.0004966608715387029,
"loss": 6.8121,
"mean_token_accuracy": 0.1471842497587204,
"num_tokens": 3531665.0,
"step": 1415
},
{
"entropy": 6.757086753845215,
"epoch": 1.6608187134502925,
"grad_norm": 0.94140625,
"learning_rate": 0.0004965799353977248,
"loss": 6.818,
"mean_token_accuracy": 0.15390484631061555,
"num_tokens": 3543876.0,
"step": 1420
},
{
"entropy": 6.686848163604736,
"epoch": 1.6666666666666665,
"grad_norm": 0.97265625,
"learning_rate": 0.0004964980375839379,
"loss": 6.7267,
"mean_token_accuracy": 0.15046528726816177,
"num_tokens": 3556517.0,
"step": 1425
},
{
"entropy": 6.811561536788941,
"epoch": 1.672514619883041,
"grad_norm": 0.94921875,
"learning_rate": 0.0004964151784527844,
"loss": 6.7403,
"mean_token_accuracy": 0.15317897498607635,
"num_tokens": 3569378.0,
"step": 1430
},
{
"entropy": 6.782307195663452,
"epoch": 1.6783625730994152,
"grad_norm": 1.2890625,
"learning_rate": 0.000496331358363879,
"loss": 6.742,
"mean_token_accuracy": 0.14681075811386107,
"num_tokens": 3581684.0,
"step": 1435
},
{
"entropy": 6.74970383644104,
"epoch": 1.6842105263157894,
"grad_norm": 0.953125,
"learning_rate": 0.0004962465776810066,
"loss": 6.7141,
"mean_token_accuracy": 0.1596361830830574,
"num_tokens": 3594961.0,
"step": 1440
},
{
"entropy": 6.716477537155152,
"epoch": 1.6900584795321638,
"grad_norm": 0.94140625,
"learning_rate": 0.0004961608367721217,
"loss": 6.7673,
"mean_token_accuracy": 0.1440455324947834,
"num_tokens": 3607197.0,
"step": 1445
},
{
"entropy": 6.746997737884522,
"epoch": 1.695906432748538,
"grad_norm": 0.95703125,
"learning_rate": 0.0004960741360093459,
"loss": 6.7691,
"mean_token_accuracy": 0.14761832132935523,
"num_tokens": 3618728.0,
"step": 1450
},
{
"entropy": 6.850161504745484,
"epoch": 1.7017543859649122,
"grad_norm": 1.015625,
"learning_rate": 0.0004959864757689669,
"loss": 6.8823,
"mean_token_accuracy": 0.13523451015353202,
"num_tokens": 3630872.0,
"step": 1455
},
{
"entropy": 6.786969089508057,
"epoch": 1.7076023391812867,
"grad_norm": 1.046875,
"learning_rate": 0.0004958978564314361,
"loss": 6.7577,
"mean_token_accuracy": 0.1469944402575493,
"num_tokens": 3642657.0,
"step": 1460
},
{
"entropy": 6.790769910812378,
"epoch": 1.7134502923976607,
"grad_norm": 0.97265625,
"learning_rate": 0.000495808278381368,
"loss": 6.7841,
"mean_token_accuracy": 0.14498233646154404,
"num_tokens": 3654505.0,
"step": 1465
},
{
"entropy": 6.619856500625611,
"epoch": 1.719298245614035,
"grad_norm": 0.8984375,
"learning_rate": 0.0004957177420075377,
"loss": 6.6889,
"mean_token_accuracy": 0.16183902323246002,
"num_tokens": 3668554.0,
"step": 1470
},
{
"entropy": 6.789491319656372,
"epoch": 1.7251461988304093,
"grad_norm": 1.0,
"learning_rate": 0.0004956262477028797,
"loss": 6.8489,
"mean_token_accuracy": 0.14220609217882157,
"num_tokens": 3681448.0,
"step": 1475
},
{
"entropy": 6.78629059791565,
"epoch": 1.7309941520467835,
"grad_norm": 1.0546875,
"learning_rate": 0.0004955337958644857,
"loss": 6.7818,
"mean_token_accuracy": 0.14065006971359253,
"num_tokens": 3693677.0,
"step": 1480
},
{
"entropy": 6.67854528427124,
"epoch": 1.736842105263158,
"grad_norm": 1.015625,
"learning_rate": 0.0004954403868936032,
"loss": 6.7757,
"mean_token_accuracy": 0.14981362596154213,
"num_tokens": 3706204.0,
"step": 1485
},
{
"entropy": 6.828735208511352,
"epoch": 1.7426900584795322,
"grad_norm": 1.0078125,
"learning_rate": 0.000495346021195634,
"loss": 6.7136,
"mean_token_accuracy": 0.15087691098451614,
"num_tokens": 3718255.0,
"step": 1490
},
{
"entropy": 6.721991968154907,
"epoch": 1.7485380116959064,
"grad_norm": 1.296875,
"learning_rate": 0.0004952506991801319,
"loss": 6.7482,
"mean_token_accuracy": 0.1513845443725586,
"num_tokens": 3730623.0,
"step": 1495
},
{
"entropy": 6.797335052490235,
"epoch": 1.7543859649122808,
"grad_norm": 1.0234375,
"learning_rate": 0.0004951544212608015,
"loss": 6.7744,
"mean_token_accuracy": 0.14590126723051072,
"num_tokens": 3743636.0,
"step": 1500
},
{
"epoch": 1.7543859649122808,
"eval_entropy": 6.667961138891259,
"eval_loss": 6.917067527770996,
"eval_mean_token_accuracy": 0.13639764849558078,
"eval_num_tokens": 3743636.0,
"eval_runtime": 2.2883,
"eval_samples_per_second": 1182.982,
"eval_steps_per_second": 148.146,
"step": 1500
},
{
"entropy": 6.773481369018555,
"epoch": 1.7602339181286548,
"grad_norm": 0.98046875,
"learning_rate": 0.0004950571878554956,
"loss": 6.8289,
"mean_token_accuracy": 0.13798004239797593,
"num_tokens": 3755608.0,
"step": 1505
},
{
"entropy": 6.820890808105469,
"epoch": 1.7660818713450293,
"grad_norm": 1.3828125,
"learning_rate": 0.0004949589993862143,
"loss": 6.7279,
"mean_token_accuracy": 0.14071404933929443,
"num_tokens": 3768208.0,
"step": 1510
},
{
"entropy": 6.652836704254151,
"epoch": 1.7719298245614035,
"grad_norm": 0.9921875,
"learning_rate": 0.0004948598562791025,
"loss": 6.7483,
"mean_token_accuracy": 0.14532892256975175,
"num_tokens": 3780550.0,
"step": 1515
},
{
"entropy": 6.701921987533569,
"epoch": 1.7777777777777777,
"grad_norm": 1.015625,
"learning_rate": 0.0004947597589644484,
"loss": 6.7275,
"mean_token_accuracy": 0.14661479890346527,
"num_tokens": 3792417.0,
"step": 1520
},
{
"entropy": 6.778319072723389,
"epoch": 1.7836257309941521,
"grad_norm": 1.0,
"learning_rate": 0.0004946587078766818,
"loss": 6.7056,
"mean_token_accuracy": 0.14873959571123124,
"num_tokens": 3803887.0,
"step": 1525
},
{
"entropy": 6.7453224658966064,
"epoch": 1.7894736842105263,
"grad_norm": 0.9921875,
"learning_rate": 0.0004945567034543712,
"loss": 6.8554,
"mean_token_accuracy": 0.13670146614313125,
"num_tokens": 3816534.0,
"step": 1530
},
{
"entropy": 6.739562368392944,
"epoch": 1.7953216374269005,
"grad_norm": 1.0625,
"learning_rate": 0.0004944537461402234,
"loss": 6.8007,
"mean_token_accuracy": 0.145442333817482,
"num_tokens": 3827790.0,
"step": 1535
},
{
"entropy": 6.763753271102905,
"epoch": 1.801169590643275,
"grad_norm": 0.98828125,
"learning_rate": 0.0004943498363810807,
"loss": 6.7366,
"mean_token_accuracy": 0.1517603263258934,
"num_tokens": 3839800.0,
"step": 1540
},
{
"entropy": 6.550221014022827,
"epoch": 1.807017543859649,
"grad_norm": 1.15625,
"learning_rate": 0.0004942449746279184,
"loss": 6.6812,
"mean_token_accuracy": 0.1559474416077137,
"num_tokens": 3852621.0,
"step": 1545
},
{
"entropy": 6.809410285949707,
"epoch": 1.8128654970760234,
"grad_norm": 0.98828125,
"learning_rate": 0.0004941391613358444,
"loss": 6.7302,
"mean_token_accuracy": 0.14366067498922347,
"num_tokens": 3864184.0,
"step": 1550
},
{
"entropy": 6.6795368671417235,
"epoch": 1.8187134502923976,
"grad_norm": 0.98828125,
"learning_rate": 0.000494032396964096,
"loss": 6.7137,
"mean_token_accuracy": 0.144209386408329,
"num_tokens": 3876750.0,
"step": 1555
},
{
"entropy": 6.765053367614746,
"epoch": 1.8245614035087718,
"grad_norm": 0.9609375,
"learning_rate": 0.000493924681976038,
"loss": 6.7561,
"mean_token_accuracy": 0.1497082605957985,
"num_tokens": 3888788.0,
"step": 1560
},
{
"entropy": 6.683570432662964,
"epoch": 1.8304093567251463,
"grad_norm": 0.91796875,
"learning_rate": 0.0004938160168391614,
"loss": 6.8067,
"mean_token_accuracy": 0.14153953790664672,
"num_tokens": 3901816.0,
"step": 1565
},
{
"entropy": 6.717455673217773,
"epoch": 1.8362573099415205,
"grad_norm": 1.015625,
"learning_rate": 0.0004937064020250804,
"loss": 6.7082,
"mean_token_accuracy": 0.15452922284603118,
"num_tokens": 3913127.0,
"step": 1570
},
{
"entropy": 6.710938596725464,
"epoch": 1.8421052631578947,
"grad_norm": 0.88671875,
"learning_rate": 0.0004935958380095316,
"loss": 6.7152,
"mean_token_accuracy": 0.14983516037464142,
"num_tokens": 3924878.0,
"step": 1575
},
{
"entropy": 6.763432884216309,
"epoch": 1.8479532163742691,
"grad_norm": 0.8828125,
"learning_rate": 0.0004934843252723702,
"loss": 6.7907,
"mean_token_accuracy": 0.14768668934702872,
"num_tokens": 3938334.0,
"step": 1580
},
{
"entropy": 6.697846746444702,
"epoch": 1.8538011695906431,
"grad_norm": 0.953125,
"learning_rate": 0.00049337186429757,
"loss": 6.7497,
"mean_token_accuracy": 0.14224957451224327,
"num_tokens": 3949733.0,
"step": 1585
},
{
"entropy": 6.859390497207642,
"epoch": 1.8596491228070176,
"grad_norm": 0.94921875,
"learning_rate": 0.0004932584555732192,
"loss": 6.7792,
"mean_token_accuracy": 0.14625833928585052,
"num_tokens": 3963109.0,
"step": 1590
},
{
"entropy": 6.711243629455566,
"epoch": 1.8654970760233918,
"grad_norm": 0.9296875,
"learning_rate": 0.0004931440995915203,
"loss": 6.7679,
"mean_token_accuracy": 0.1448171094059944,
"num_tokens": 3975477.0,
"step": 1595
},
{
"entropy": 6.703889417648315,
"epoch": 1.871345029239766,
"grad_norm": 0.9765625,
"learning_rate": 0.000493028796848786,
"loss": 6.7266,
"mean_token_accuracy": 0.1536541074514389,
"num_tokens": 3987757.0,
"step": 1600
},
{
"entropy": 6.768518257141113,
"epoch": 1.8771929824561404,
"grad_norm": 0.9140625,
"learning_rate": 0.0004929125478454389,
"loss": 6.6084,
"mean_token_accuracy": 0.1534947231411934,
"num_tokens": 3998807.0,
"step": 1605
},
{
"entropy": 6.581795883178711,
"epoch": 1.8830409356725146,
"grad_norm": 1.0234375,
"learning_rate": 0.0004927953530860077,
"loss": 6.6819,
"mean_token_accuracy": 0.15274996906518937,
"num_tokens": 4010320.0,
"step": 1610
},
{
"entropy": 6.7965796947479244,
"epoch": 1.8888888888888888,
"grad_norm": 1.03125,
"learning_rate": 0.0004926772130791261,
"loss": 6.826,
"mean_token_accuracy": 0.13788622617721558,
"num_tokens": 4023432.0,
"step": 1615
},
{
"entropy": 6.700895690917969,
"epoch": 1.8947368421052633,
"grad_norm": 0.95703125,
"learning_rate": 0.0004925581283375303,
"loss": 6.795,
"mean_token_accuracy": 0.14080951884388923,
"num_tokens": 4036282.0,
"step": 1620
},
{
"entropy": 6.700714445114135,
"epoch": 1.9005847953216373,
"grad_norm": 1.0,
"learning_rate": 0.0004924380993780566,
"loss": 6.6669,
"mean_token_accuracy": 0.151615709066391,
"num_tokens": 4048164.0,
"step": 1625
},
{
"entropy": 6.649501609802246,
"epoch": 1.9064327485380117,
"grad_norm": 1.078125,
"learning_rate": 0.0004923171267216392,
"loss": 6.7166,
"mean_token_accuracy": 0.1475498579442501,
"num_tokens": 4059287.0,
"step": 1630
},
{
"entropy": 6.73433108329773,
"epoch": 1.912280701754386,
"grad_norm": 0.90234375,
"learning_rate": 0.0004921952108933083,
"loss": 6.7009,
"mean_token_accuracy": 0.1452985569834709,
"num_tokens": 4071976.0,
"step": 1635
},
{
"entropy": 6.63075819015503,
"epoch": 1.9181286549707601,
"grad_norm": 0.96875,
"learning_rate": 0.0004920723524221871,
"loss": 6.7257,
"mean_token_accuracy": 0.1505735158920288,
"num_tokens": 4085116.0,
"step": 1640
},
{
"entropy": 6.821420669555664,
"epoch": 1.9239766081871346,
"grad_norm": 0.953125,
"learning_rate": 0.0004919485518414902,
"loss": 6.7257,
"mean_token_accuracy": 0.14405375793576242,
"num_tokens": 4096778.0,
"step": 1645
},
{
"entropy": 6.569125509262085,
"epoch": 1.9298245614035088,
"grad_norm": 0.93359375,
"learning_rate": 0.0004918238096885213,
"loss": 6.6464,
"mean_token_accuracy": 0.14594240933656694,
"num_tokens": 4109490.0,
"step": 1650
},
{
"entropy": 6.743563842773438,
"epoch": 1.935672514619883,
"grad_norm": 0.92578125,
"learning_rate": 0.00049169812650467,
"loss": 6.6825,
"mean_token_accuracy": 0.14895619004964827,
"num_tokens": 4122832.0,
"step": 1655
},
{
"entropy": 6.760922002792358,
"epoch": 1.9415204678362574,
"grad_norm": 0.94140625,
"learning_rate": 0.0004915715028354102,
"loss": 6.7155,
"mean_token_accuracy": 0.14306744039058686,
"num_tokens": 4134585.0,
"step": 1660
},
{
"entropy": 6.676833295822144,
"epoch": 1.9473684210526314,
"grad_norm": 1.046875,
"learning_rate": 0.0004914439392302981,
"loss": 6.6534,
"mean_token_accuracy": 0.14623788222670556,
"num_tokens": 4145909.0,
"step": 1665
},
{
"entropy": 6.638128709793091,
"epoch": 1.9532163742690059,
"grad_norm": 1.5625,
"learning_rate": 0.0004913154362429686,
"loss": 6.5708,
"mean_token_accuracy": 0.1626603677868843,
"num_tokens": 4157360.0,
"step": 1670
},
{
"entropy": 6.61951060295105,
"epoch": 1.95906432748538,
"grad_norm": 0.8828125,
"learning_rate": 0.0004911859944311341,
"loss": 6.7538,
"mean_token_accuracy": 0.14292526990175247,
"num_tokens": 4169789.0,
"step": 1675
},
{
"entropy": 6.807030773162841,
"epoch": 1.9649122807017543,
"grad_norm": 1.0703125,
"learning_rate": 0.0004910556143565812,
"loss": 6.7507,
"mean_token_accuracy": 0.14247536286711693,
"num_tokens": 4183131.0,
"step": 1680
},
{
"entropy": 6.65710768699646,
"epoch": 1.9707602339181287,
"grad_norm": 0.9453125,
"learning_rate": 0.0004909242965851688,
"loss": 6.7215,
"mean_token_accuracy": 0.14660251662135124,
"num_tokens": 4194865.0,
"step": 1685
},
{
"entropy": 6.722817039489746,
"epoch": 1.976608187134503,
"grad_norm": 0.9453125,
"learning_rate": 0.0004907920416868253,
"loss": 6.7376,
"mean_token_accuracy": 0.1446162924170494,
"num_tokens": 4207406.0,
"step": 1690
},
{
"entropy": 6.653514719009399,
"epoch": 1.9824561403508771,
"grad_norm": 1.34375,
"learning_rate": 0.0004906588502355467,
"loss": 6.6644,
"mean_token_accuracy": 0.151543128490448,
"num_tokens": 4221623.0,
"step": 1695
},
{
"entropy": 6.626381301879883,
"epoch": 1.9883040935672516,
"grad_norm": 0.92578125,
"learning_rate": 0.0004905247228093933,
"loss": 6.6192,
"mean_token_accuracy": 0.16244074702262878,
"num_tokens": 4233699.0,
"step": 1700
},
{
"entropy": 6.637777948379517,
"epoch": 1.9941520467836256,
"grad_norm": 0.99609375,
"learning_rate": 0.0004903896599904878,
"loss": 6.6459,
"mean_token_accuracy": 0.14810366034507752,
"num_tokens": 4247669.0,
"step": 1705
},
{
"entropy": 6.68798680305481,
"epoch": 2.0,
"grad_norm": 1.0078125,
"learning_rate": 0.0004902536623650125,
"loss": 6.6853,
"mean_token_accuracy": 0.14486114978790282,
"num_tokens": 4258968.0,
"step": 1710
},
{
"entropy": 6.643886661529541,
"epoch": 2.0058479532163744,
"grad_norm": 0.8828125,
"learning_rate": 0.0004901167305232068,
"loss": 6.3809,
"mean_token_accuracy": 0.15380410775542258,
"num_tokens": 4270684.0,
"step": 1715
},
{
"entropy": 6.586440896987915,
"epoch": 2.0116959064327484,
"grad_norm": 0.9765625,
"learning_rate": 0.0004899788650593648,
"loss": 6.3091,
"mean_token_accuracy": 0.15897125452756883,
"num_tokens": 4282567.0,
"step": 1720
},
{
"entropy": 6.668914461135865,
"epoch": 2.017543859649123,
"grad_norm": 0.97265625,
"learning_rate": 0.0004898400665718325,
"loss": 6.3511,
"mean_token_accuracy": 0.1542159616947174,
"num_tokens": 4294803.0,
"step": 1725
},
{
"entropy": 6.565510225296021,
"epoch": 2.023391812865497,
"grad_norm": 0.94921875,
"learning_rate": 0.0004897003356630052,
"loss": 6.3279,
"mean_token_accuracy": 0.1587565705180168,
"num_tokens": 4305898.0,
"step": 1730
},
{
"entropy": 6.60882887840271,
"epoch": 2.0292397660818713,
"grad_norm": 1.03125,
"learning_rate": 0.0004895596729393252,
"loss": 6.281,
"mean_token_accuracy": 0.1608104281127453,
"num_tokens": 4317985.0,
"step": 1735
},
{
"entropy": 6.481542301177979,
"epoch": 2.0350877192982457,
"grad_norm": 1.046875,
"learning_rate": 0.0004894180790112787,
"loss": 6.324,
"mean_token_accuracy": 0.1583850935101509,
"num_tokens": 4330482.0,
"step": 1740
},
{
"entropy": 6.62475471496582,
"epoch": 2.0409356725146197,
"grad_norm": 0.9140625,
"learning_rate": 0.0004892755544933934,
"loss": 6.3866,
"mean_token_accuracy": 0.1473647505044937,
"num_tokens": 4342782.0,
"step": 1745
},
{
"entropy": 6.589581489562988,
"epoch": 2.046783625730994,
"grad_norm": 0.95703125,
"learning_rate": 0.0004891321000042361,
"loss": 6.3981,
"mean_token_accuracy": 0.14989148527383805,
"num_tokens": 4356204.0,
"step": 1750
},
{
"entropy": 6.555098009109497,
"epoch": 2.0526315789473686,
"grad_norm": 0.89453125,
"learning_rate": 0.0004889877161664096,
"loss": 6.2954,
"mean_token_accuracy": 0.15734054297208785,
"num_tokens": 4370003.0,
"step": 1755
},
{
"entropy": 6.556944847106934,
"epoch": 2.0584795321637426,
"grad_norm": 0.9765625,
"learning_rate": 0.00048884240360655,
"loss": 6.3652,
"mean_token_accuracy": 0.1530483216047287,
"num_tokens": 4381972.0,
"step": 1760
},
{
"entropy": 6.5152829647064205,
"epoch": 2.064327485380117,
"grad_norm": 0.9375,
"learning_rate": 0.0004886961629553242,
"loss": 6.2826,
"mean_token_accuracy": 0.1597229301929474,
"num_tokens": 4394033.0,
"step": 1765
},
{
"entropy": 6.549741458892822,
"epoch": 2.0701754385964914,
"grad_norm": 0.94921875,
"learning_rate": 0.0004885489948474272,
"loss": 6.3764,
"mean_token_accuracy": 0.15717436522245407,
"num_tokens": 4406799.0,
"step": 1770
},
{
"entropy": 6.581701135635376,
"epoch": 2.0760233918128654,
"grad_norm": 0.9140625,
"learning_rate": 0.0004884008999215792,
"loss": 6.3863,
"mean_token_accuracy": 0.1525584027171135,
"num_tokens": 4420182.0,
"step": 1775
},
{
"entropy": 6.562080049514771,
"epoch": 2.08187134502924,
"grad_norm": 0.9140625,
"learning_rate": 0.0004882518788205225,
"loss": 6.3464,
"mean_token_accuracy": 0.15422090739011765,
"num_tokens": 4432014.0,
"step": 1780
},
{
"entropy": 6.630814456939698,
"epoch": 2.087719298245614,
"grad_norm": 0.953125,
"learning_rate": 0.0004881019321910198,
"loss": 6.3614,
"mean_token_accuracy": 0.15514631122350692,
"num_tokens": 4444755.0,
"step": 1785
},
{
"entropy": 6.534572124481201,
"epoch": 2.0935672514619883,
"grad_norm": 0.96875,
"learning_rate": 0.00048795106068384985,
"loss": 6.4213,
"mean_token_accuracy": 0.15710592418909072,
"num_tokens": 4456390.0,
"step": 1790
},
{
"entropy": 6.5219732284545895,
"epoch": 2.0994152046783627,
"grad_norm": 1.03125,
"learning_rate": 0.000487799264953806,
"loss": 6.3277,
"mean_token_accuracy": 0.15784730911254882,
"num_tokens": 4468567.0,
"step": 1795
},
{
"entropy": 6.541611814498902,
"epoch": 2.1052631578947367,
"grad_norm": 1.0,
"learning_rate": 0.0004876465456596926,
"loss": 6.2979,
"mean_token_accuracy": 0.16154114454984664,
"num_tokens": 4479553.0,
"step": 1800
},
{
"entropy": 6.484474182128906,
"epoch": 2.111111111111111,
"grad_norm": 0.953125,
"learning_rate": 0.0004874929034643223,
"loss": 6.3236,
"mean_token_accuracy": 0.16534094363451005,
"num_tokens": 4491505.0,
"step": 1805
},
{
"entropy": 6.516670846939087,
"epoch": 2.116959064327485,
"grad_norm": 0.97265625,
"learning_rate": 0.0004873383390345132,
"loss": 6.3868,
"mean_token_accuracy": 0.15607934296131135,
"num_tokens": 4504896.0,
"step": 1810
},
{
"entropy": 6.484438180923462,
"epoch": 2.1228070175438596,
"grad_norm": 1.0703125,
"learning_rate": 0.00048718285304108613,
"loss": 6.3846,
"mean_token_accuracy": 0.1541048213839531,
"num_tokens": 4516319.0,
"step": 1815
},
{
"entropy": 6.54402985572815,
"epoch": 2.128654970760234,
"grad_norm": 0.9375,
"learning_rate": 0.00048702644615886137,
"loss": 6.3906,
"mean_token_accuracy": 0.1502683565020561,
"num_tokens": 4529132.0,
"step": 1820
},
{
"entropy": 6.552376317977905,
"epoch": 2.134502923976608,
"grad_norm": 1.0234375,
"learning_rate": 0.00048686911906665597,
"loss": 6.3654,
"mean_token_accuracy": 0.15541319847106932,
"num_tokens": 4541080.0,
"step": 1825
},
{
"entropy": 6.5099975109100345,
"epoch": 2.1403508771929824,
"grad_norm": 0.90625,
"learning_rate": 0.00048671087244728093,
"loss": 6.3821,
"mean_token_accuracy": 0.15705351382493973,
"num_tokens": 4553442.0,
"step": 1830
},
{
"entropy": 6.41774549484253,
"epoch": 2.146198830409357,
"grad_norm": 0.984375,
"learning_rate": 0.00048655170698753774,
"loss": 6.3002,
"mean_token_accuracy": 0.16742938607931138,
"num_tokens": 4565617.0,
"step": 1835
},
{
"entropy": 6.564418745040894,
"epoch": 2.152046783625731,
"grad_norm": 1.109375,
"learning_rate": 0.000486391623378216,
"loss": 6.4026,
"mean_token_accuracy": 0.14829304218292236,
"num_tokens": 4577418.0,
"step": 1840
},
{
"entropy": 6.530992031097412,
"epoch": 2.1578947368421053,
"grad_norm": 1.046875,
"learning_rate": 0.0004862306223140901,
"loss": 6.3136,
"mean_token_accuracy": 0.15470418930053711,
"num_tokens": 4589763.0,
"step": 1845
},
{
"entropy": 6.557789993286133,
"epoch": 2.1637426900584797,
"grad_norm": 1.15625,
"learning_rate": 0.00048606870449391604,
"loss": 6.4235,
"mean_token_accuracy": 0.156028550863266,
"num_tokens": 4602522.0,
"step": 1850
},
{
"entropy": 6.546232748031616,
"epoch": 2.1695906432748537,
"grad_norm": 0.9140625,
"learning_rate": 0.00048590587062042907,
"loss": 6.3776,
"mean_token_accuracy": 0.15916143357753754,
"num_tokens": 4614680.0,
"step": 1855
},
{
"entropy": 6.513281297683716,
"epoch": 2.175438596491228,
"grad_norm": 0.97265625,
"learning_rate": 0.00048574212140033965,
"loss": 6.4012,
"mean_token_accuracy": 0.15022704005241394,
"num_tokens": 4628166.0,
"step": 1860
},
{
"entropy": 6.561741781234741,
"epoch": 2.181286549707602,
"grad_norm": 0.95703125,
"learning_rate": 0.0004855774575443311,
"loss": 6.4295,
"mean_token_accuracy": 0.1567647084593773,
"num_tokens": 4640200.0,
"step": 1865
},
{
"entropy": 6.50845365524292,
"epoch": 2.1871345029239766,
"grad_norm": 0.9140625,
"learning_rate": 0.00048541187976705645,
"loss": 6.3524,
"mean_token_accuracy": 0.15414940416812897,
"num_tokens": 4652968.0,
"step": 1870
},
{
"entropy": 6.531794738769531,
"epoch": 2.192982456140351,
"grad_norm": 0.98046875,
"learning_rate": 0.00048524538878713517,
"loss": 6.368,
"mean_token_accuracy": 0.1512238785624504,
"num_tokens": 4665741.0,
"step": 1875
},
{
"entropy": 6.422167873382568,
"epoch": 2.198830409356725,
"grad_norm": 0.80078125,
"learning_rate": 0.00048507798532715005,
"loss": 6.357,
"mean_token_accuracy": 0.15698761194944383,
"num_tokens": 4680074.0,
"step": 1880
},
{
"entropy": 6.563512086868286,
"epoch": 2.2046783625730995,
"grad_norm": 0.98046875,
"learning_rate": 0.00048490967011364394,
"loss": 6.3947,
"mean_token_accuracy": 0.15807026028633117,
"num_tokens": 4692340.0,
"step": 1885
},
{
"entropy": 6.4716023921966555,
"epoch": 2.2105263157894735,
"grad_norm": 0.9921875,
"learning_rate": 0.0004847404438771172,
"loss": 6.3972,
"mean_token_accuracy": 0.1524466946721077,
"num_tokens": 4704470.0,
"step": 1890
},
{
"entropy": 6.58318247795105,
"epoch": 2.216374269005848,
"grad_norm": 1.03125,
"learning_rate": 0.0004845703073520236,
"loss": 6.4247,
"mean_token_accuracy": 0.14934150949120523,
"num_tokens": 4716253.0,
"step": 1895
},
{
"entropy": 6.6000570297241214,
"epoch": 2.2222222222222223,
"grad_norm": 0.9296875,
"learning_rate": 0.00048439926127676796,
"loss": 6.5434,
"mean_token_accuracy": 0.1455829843878746,
"num_tokens": 4730083.0,
"step": 1900
},
{
"entropy": 6.580502653121949,
"epoch": 2.2280701754385963,
"grad_norm": 0.90625,
"learning_rate": 0.00048422730639370256,
"loss": 6.3077,
"mean_token_accuracy": 0.1627151057124138,
"num_tokens": 4742770.0,
"step": 1905
},
{
"entropy": 6.4603077411651615,
"epoch": 2.2339181286549707,
"grad_norm": 0.96484375,
"learning_rate": 0.0004840544434491238,
"loss": 6.4235,
"mean_token_accuracy": 0.15239125192165376,
"num_tokens": 4754299.0,
"step": 1910
},
{
"entropy": 6.525413131713867,
"epoch": 2.239766081871345,
"grad_norm": 0.96875,
"learning_rate": 0.00048388067319326937,
"loss": 6.4002,
"mean_token_accuracy": 0.14994391426444054,
"num_tokens": 4766964.0,
"step": 1915
},
{
"entropy": 6.47767276763916,
"epoch": 2.245614035087719,
"grad_norm": 1.25,
"learning_rate": 0.00048370599638031464,
"loss": 6.4286,
"mean_token_accuracy": 0.15133118629455566,
"num_tokens": 4779921.0,
"step": 1920
},
{
"entropy": 6.575333738327027,
"epoch": 2.2514619883040936,
"grad_norm": 0.95703125,
"learning_rate": 0.00048353041376836937,
"loss": 6.4111,
"mean_token_accuracy": 0.15030388981103898,
"num_tokens": 4792233.0,
"step": 1925
},
{
"entropy": 6.474625205993652,
"epoch": 2.257309941520468,
"grad_norm": 0.98046875,
"learning_rate": 0.0004833539261194749,
"loss": 6.4079,
"mean_token_accuracy": 0.15869509875774385,
"num_tokens": 4803348.0,
"step": 1930
},
{
"entropy": 6.526451253890992,
"epoch": 2.263157894736842,
"grad_norm": 0.8984375,
"learning_rate": 0.00048317653419960007,
"loss": 6.4769,
"mean_token_accuracy": 0.14866361171007156,
"num_tokens": 4816574.0,
"step": 1935
},
{
"entropy": 6.448498773574829,
"epoch": 2.2690058479532165,
"grad_norm": 1.0390625,
"learning_rate": 0.00048299823877863857,
"loss": 6.3916,
"mean_token_accuracy": 0.15632276237010956,
"num_tokens": 4828008.0,
"step": 1940
},
{
"entropy": 6.590533351898193,
"epoch": 2.2748538011695905,
"grad_norm": 0.92578125,
"learning_rate": 0.0004828190406304054,
"loss": 6.4638,
"mean_token_accuracy": 0.14904911667108536,
"num_tokens": 4840621.0,
"step": 1945
},
{
"entropy": 6.481203413009643,
"epoch": 2.280701754385965,
"grad_norm": 0.921875,
"learning_rate": 0.0004826389405326334,
"loss": 6.3621,
"mean_token_accuracy": 0.15114055722951888,
"num_tokens": 4853503.0,
"step": 1950
},
{
"entropy": 6.519671154022217,
"epoch": 2.2865497076023393,
"grad_norm": 0.89453125,
"learning_rate": 0.0004824579392669698,
"loss": 6.3723,
"mean_token_accuracy": 0.15419053584337233,
"num_tokens": 4865925.0,
"step": 1955
},
{
"entropy": 6.494964981079102,
"epoch": 2.2923976608187133,
"grad_norm": 1.0,
"learning_rate": 0.00048227603761897316,
"loss": 6.4369,
"mean_token_accuracy": 0.1508437529206276,
"num_tokens": 4878704.0,
"step": 1960
},
{
"entropy": 6.535792446136474,
"epoch": 2.2982456140350878,
"grad_norm": 0.92578125,
"learning_rate": 0.0004820932363781096,
"loss": 6.4078,
"mean_token_accuracy": 0.1539498969912529,
"num_tokens": 4891750.0,
"step": 1965
},
{
"entropy": 6.534383153915405,
"epoch": 2.3040935672514617,
"grad_norm": 1.0234375,
"learning_rate": 0.0004819095363377496,
"loss": 6.3997,
"mean_token_accuracy": 0.158636175096035,
"num_tokens": 4904539.0,
"step": 1970
},
{
"entropy": 6.423919820785523,
"epoch": 2.309941520467836,
"grad_norm": 0.94140625,
"learning_rate": 0.00048172493829516465,
"loss": 6.2828,
"mean_token_accuracy": 0.1626374155282974,
"num_tokens": 4916210.0,
"step": 1975
},
{
"entropy": 6.479878091812134,
"epoch": 2.3157894736842106,
"grad_norm": 0.91796875,
"learning_rate": 0.0004815394430515234,
"loss": 6.3473,
"mean_token_accuracy": 0.15623345077037812,
"num_tokens": 4929011.0,
"step": 1980
},
{
"entropy": 6.42811393737793,
"epoch": 2.3216374269005846,
"grad_norm": 0.91796875,
"learning_rate": 0.0004813530514118884,
"loss": 6.3289,
"mean_token_accuracy": 0.16032439172267915,
"num_tokens": 4942484.0,
"step": 1985
},
{
"entropy": 6.4271008491516115,
"epoch": 2.327485380116959,
"grad_norm": 0.98828125,
"learning_rate": 0.0004811657641852129,
"loss": 6.324,
"mean_token_accuracy": 0.1544616237282753,
"num_tokens": 4955395.0,
"step": 1990
},
{
"entropy": 6.505549621582031,
"epoch": 2.3333333333333335,
"grad_norm": 1.0703125,
"learning_rate": 0.00048097758218433687,
"loss": 6.357,
"mean_token_accuracy": 0.1575777605175972,
"num_tokens": 4966853.0,
"step": 1995
},
{
"entropy": 6.362820386886597,
"epoch": 2.3391812865497075,
"grad_norm": 1.0390625,
"learning_rate": 0.00048078850622598355,
"loss": 6.2381,
"mean_token_accuracy": 0.166496641933918,
"num_tokens": 4978514.0,
"step": 2000
},
{
"epoch": 2.3391812865497075,
"eval_entropy": 6.397943067691319,
"eval_loss": 6.796247482299805,
"eval_mean_token_accuracy": 0.1402603484344034,
"eval_num_tokens": 4978514.0,
"eval_runtime": 2.2635,
"eval_samples_per_second": 1195.932,
"eval_steps_per_second": 149.768,
"step": 2000
},
{
"entropy": 6.480894231796265,
"epoch": 2.345029239766082,
"grad_norm": 0.88671875,
"learning_rate": 0.00048059853713075637,
"loss": 6.3738,
"mean_token_accuracy": 0.14930783808231354,
"num_tokens": 4991331.0,
"step": 2005
},
{
"entropy": 6.467019128799438,
"epoch": 2.3508771929824563,
"grad_norm": 0.97265625,
"learning_rate": 0.0004804076757231347,
"loss": 6.3576,
"mean_token_accuracy": 0.1548823118209839,
"num_tokens": 5004652.0,
"step": 2010
},
{
"entropy": 6.514573955535889,
"epoch": 2.3567251461988303,
"grad_norm": 0.9765625,
"learning_rate": 0.00048021592283147073,
"loss": 6.3739,
"mean_token_accuracy": 0.16613236665725709,
"num_tokens": 5017204.0,
"step": 2015
},
{
"entropy": 6.388540935516358,
"epoch": 2.3625730994152048,
"grad_norm": 0.96484375,
"learning_rate": 0.0004800232792879858,
"loss": 6.3943,
"mean_token_accuracy": 0.15944379568099976,
"num_tokens": 5029667.0,
"step": 2020
},
{
"entropy": 6.39902777671814,
"epoch": 2.3684210526315788,
"grad_norm": 1.015625,
"learning_rate": 0.00047982974592876665,
"loss": 6.2602,
"mean_token_accuracy": 0.163812293112278,
"num_tokens": 5041490.0,
"step": 2025
},
{
"entropy": 6.440528869628906,
"epoch": 2.374269005847953,
"grad_norm": 1.078125,
"learning_rate": 0.000479635323593762,
"loss": 6.4086,
"mean_token_accuracy": 0.15252931267023087,
"num_tokens": 5054353.0,
"step": 2030
},
{
"entropy": 6.4456743717193605,
"epoch": 2.3801169590643276,
"grad_norm": 1.03125,
"learning_rate": 0.00047944001312677867,
"loss": 6.3493,
"mean_token_accuracy": 0.1541864275932312,
"num_tokens": 5067322.0,
"step": 2035
},
{
"entropy": 6.507485198974609,
"epoch": 2.3859649122807016,
"grad_norm": 0.93359375,
"learning_rate": 0.0004792438153754782,
"loss": 6.4113,
"mean_token_accuracy": 0.16207012832164763,
"num_tokens": 5079957.0,
"step": 2040
},
{
"entropy": 6.39950647354126,
"epoch": 2.391812865497076,
"grad_norm": 1.09375,
"learning_rate": 0.0004790467311913727,
"loss": 6.3881,
"mean_token_accuracy": 0.14974744021892547,
"num_tokens": 5091975.0,
"step": 2045
},
{
"entropy": 6.503816938400268,
"epoch": 2.39766081871345,
"grad_norm": 0.98046875,
"learning_rate": 0.0004788487614298219,
"loss": 6.4017,
"mean_token_accuracy": 0.150410458445549,
"num_tokens": 5103847.0,
"step": 2050
},
{
"entropy": 6.4235986232757565,
"epoch": 2.4035087719298245,
"grad_norm": 1.0859375,
"learning_rate": 0.0004786499069500286,
"loss": 6.328,
"mean_token_accuracy": 0.16121934354305267,
"num_tokens": 5115153.0,
"step": 2055
},
{
"entropy": 6.3792219161987305,
"epoch": 2.409356725146199,
"grad_norm": 0.9765625,
"learning_rate": 0.00047845016861503556,
"loss": 6.2971,
"mean_token_accuracy": 0.16659771800041198,
"num_tokens": 5128008.0,
"step": 2060
},
{
"entropy": 6.362333679199219,
"epoch": 2.415204678362573,
"grad_norm": 1.0390625,
"learning_rate": 0.00047824954729172136,
"loss": 6.2441,
"mean_token_accuracy": 0.16585201323032378,
"num_tokens": 5140023.0,
"step": 2065
},
{
"entropy": 6.442836713790894,
"epoch": 2.4210526315789473,
"grad_norm": 0.89453125,
"learning_rate": 0.0004780480438507972,
"loss": 6.29,
"mean_token_accuracy": 0.16436051428318024,
"num_tokens": 5152660.0,
"step": 2070
},
{
"entropy": 6.335717296600341,
"epoch": 2.426900584795322,
"grad_norm": 1.015625,
"learning_rate": 0.00047784565916680216,
"loss": 6.3159,
"mean_token_accuracy": 0.15852166563272477,
"num_tokens": 5164481.0,
"step": 2075
},
{
"entropy": 6.519096946716308,
"epoch": 2.4327485380116958,
"grad_norm": 0.98828125,
"learning_rate": 0.0004776423941181005,
"loss": 6.3583,
"mean_token_accuracy": 0.16100526303052903,
"num_tokens": 5177178.0,
"step": 2080
},
{
"entropy": 6.400270652770996,
"epoch": 2.43859649122807,
"grad_norm": 1.046875,
"learning_rate": 0.00047743824958687694,
"loss": 6.3056,
"mean_token_accuracy": 0.15958069264888763,
"num_tokens": 5189385.0,
"step": 2085
},
{
"entropy": 6.409837150573731,
"epoch": 2.4444444444444446,
"grad_norm": 1.0234375,
"learning_rate": 0.00047723322645913354,
"loss": 6.3554,
"mean_token_accuracy": 0.15839209258556367,
"num_tokens": 5201839.0,
"step": 2090
},
{
"entropy": 6.475348615646363,
"epoch": 2.4502923976608186,
"grad_norm": 1.0390625,
"learning_rate": 0.0004770273256246853,
"loss": 6.3958,
"mean_token_accuracy": 0.1496080830693245,
"num_tokens": 5214565.0,
"step": 2095
},
{
"entropy": 6.4554190158844,
"epoch": 2.456140350877193,
"grad_norm": 1.03125,
"learning_rate": 0.0004768205479771566,
"loss": 6.3598,
"mean_token_accuracy": 0.1599205270409584,
"num_tokens": 5227029.0,
"step": 2100
},
{
"entropy": 6.452576923370361,
"epoch": 2.461988304093567,
"grad_norm": 0.90625,
"learning_rate": 0.00047661289441397724,
"loss": 6.3939,
"mean_token_accuracy": 0.16022101789712906,
"num_tokens": 5239208.0,
"step": 2105
},
{
"entropy": 6.38828125,
"epoch": 2.4678362573099415,
"grad_norm": 0.98828125,
"learning_rate": 0.00047640436583637865,
"loss": 6.3611,
"mean_token_accuracy": 0.16401683390140534,
"num_tokens": 5252272.0,
"step": 2110
},
{
"entropy": 6.527974271774292,
"epoch": 2.473684210526316,
"grad_norm": 0.90625,
"learning_rate": 0.00047619496314938977,
"loss": 6.4695,
"mean_token_accuracy": 0.14824046343564987,
"num_tokens": 5264387.0,
"step": 2115
},
{
"entropy": 6.429781675338745,
"epoch": 2.47953216374269,
"grad_norm": 1.1484375,
"learning_rate": 0.0004759846872618332,
"loss": 6.436,
"mean_token_accuracy": 0.15525103211402894,
"num_tokens": 5276662.0,
"step": 2120
},
{
"entropy": 6.447323322296143,
"epoch": 2.4853801169590644,
"grad_norm": 0.97265625,
"learning_rate": 0.00047577353908632156,
"loss": 6.3606,
"mean_token_accuracy": 0.162351331114769,
"num_tokens": 5290734.0,
"step": 2125
},
{
"entropy": 6.330474472045898,
"epoch": 2.4912280701754383,
"grad_norm": 1.046875,
"learning_rate": 0.00047556151953925287,
"loss": 6.2377,
"mean_token_accuracy": 0.16758267730474471,
"num_tokens": 5302510.0,
"step": 2130
},
{
"entropy": 6.535420703887939,
"epoch": 2.497076023391813,
"grad_norm": 1.0625,
"learning_rate": 0.0004753486295408073,
"loss": 6.3289,
"mean_token_accuracy": 0.1602902188897133,
"num_tokens": 5313243.0,
"step": 2135
},
{
"entropy": 6.331748390197754,
"epoch": 2.502923976608187,
"grad_norm": 0.92578125,
"learning_rate": 0.00047513487001494257,
"loss": 6.4321,
"mean_token_accuracy": 0.15394319146871566,
"num_tokens": 5325485.0,
"step": 2140
},
{
"entropy": 6.538753080368042,
"epoch": 2.5087719298245617,
"grad_norm": 0.89453125,
"learning_rate": 0.00047492024188939056,
"loss": 6.4585,
"mean_token_accuracy": 0.15101682543754577,
"num_tokens": 5339335.0,
"step": 2145
},
{
"entropy": 6.467768907546997,
"epoch": 2.5146198830409356,
"grad_norm": 0.93359375,
"learning_rate": 0.0004747047460956525,
"loss": 6.4198,
"mean_token_accuracy": 0.15421560704708098,
"num_tokens": 5351195.0,
"step": 2150
},
{
"entropy": 6.425017833709717,
"epoch": 2.52046783625731,
"grad_norm": 0.9609375,
"learning_rate": 0.0004744883835689958,
"loss": 6.3601,
"mean_token_accuracy": 0.15972158014774324,
"num_tokens": 5362884.0,
"step": 2155
},
{
"entropy": 6.3913373947143555,
"epoch": 2.526315789473684,
"grad_norm": 0.9765625,
"learning_rate": 0.0004742711552484492,
"loss": 6.3916,
"mean_token_accuracy": 0.1555731013417244,
"num_tokens": 5375770.0,
"step": 2160
},
{
"entropy": 6.485252094268799,
"epoch": 2.5321637426900585,
"grad_norm": 1.0078125,
"learning_rate": 0.00047405306207679926,
"loss": 6.3808,
"mean_token_accuracy": 0.15146116465330123,
"num_tokens": 5388673.0,
"step": 2165
},
{
"entropy": 6.263543128967285,
"epoch": 2.538011695906433,
"grad_norm": 1.1171875,
"learning_rate": 0.0004738341050005859,
"loss": 6.2365,
"mean_token_accuracy": 0.1644042655825615,
"num_tokens": 5400454.0,
"step": 2170
},
{
"entropy": 6.458364200592041,
"epoch": 2.543859649122807,
"grad_norm": 0.828125,
"learning_rate": 0.0004736142849700986,
"loss": 6.3611,
"mean_token_accuracy": 0.1593544602394104,
"num_tokens": 5413740.0,
"step": 2175
},
{
"entropy": 6.472718286514282,
"epoch": 2.5497076023391814,
"grad_norm": 1.0078125,
"learning_rate": 0.0004733936029393721,
"loss": 6.3765,
"mean_token_accuracy": 0.1610200211405754,
"num_tokens": 5426089.0,
"step": 2180
},
{
"entropy": 6.439489936828613,
"epoch": 2.5555555555555554,
"grad_norm": 0.953125,
"learning_rate": 0.0004731720598661821,
"loss": 6.4386,
"mean_token_accuracy": 0.14995427131652833,
"num_tokens": 5438835.0,
"step": 2185
},
{
"entropy": 6.347745180130005,
"epoch": 2.56140350877193,
"grad_norm": 1.0234375,
"learning_rate": 0.0004729496567120415,
"loss": 6.3907,
"mean_token_accuracy": 0.1583314836025238,
"num_tokens": 5452054.0,
"step": 2190
},
{
"entropy": 6.4327795028686525,
"epoch": 2.5672514619883042,
"grad_norm": 0.96484375,
"learning_rate": 0.000472726394442196,
"loss": 6.3253,
"mean_token_accuracy": 0.15102468878030778,
"num_tokens": 5466455.0,
"step": 2195
},
{
"entropy": 6.378901433944702,
"epoch": 2.573099415204678,
"grad_norm": 0.98828125,
"learning_rate": 0.00047250227402561976,
"loss": 6.3467,
"mean_token_accuracy": 0.15637744665145875,
"num_tokens": 5479990.0,
"step": 2200
},
{
"entropy": 6.4899311542510985,
"epoch": 2.5789473684210527,
"grad_norm": 1.0078125,
"learning_rate": 0.0004722772964350115,
"loss": 6.4134,
"mean_token_accuracy": 0.1580400973558426,
"num_tokens": 5493035.0,
"step": 2205
},
{
"entropy": 6.3998095989227295,
"epoch": 2.5847953216374266,
"grad_norm": 1.0078125,
"learning_rate": 0.00047205146264679015,
"loss": 6.4085,
"mean_token_accuracy": 0.1564834401011467,
"num_tokens": 5506093.0,
"step": 2210
},
{
"entropy": 6.430679607391357,
"epoch": 2.590643274853801,
"grad_norm": 0.9453125,
"learning_rate": 0.00047182477364109045,
"loss": 6.3809,
"mean_token_accuracy": 0.16323979943990707,
"num_tokens": 5518552.0,
"step": 2215
},
{
"entropy": 6.371867942810058,
"epoch": 2.5964912280701755,
"grad_norm": 0.96484375,
"learning_rate": 0.00047159723040175896,
"loss": 6.3862,
"mean_token_accuracy": 0.1559700384736061,
"num_tokens": 5530123.0,
"step": 2220
},
{
"entropy": 6.540740919113159,
"epoch": 2.60233918128655,
"grad_norm": 0.8984375,
"learning_rate": 0.00047136883391634966,
"loss": 6.4042,
"mean_token_accuracy": 0.14944163262844085,
"num_tokens": 5542769.0,
"step": 2225
},
{
"entropy": 6.279228162765503,
"epoch": 2.608187134502924,
"grad_norm": 1.1328125,
"learning_rate": 0.0004711395851761198,
"loss": 6.2349,
"mean_token_accuracy": 0.1725244089961052,
"num_tokens": 5555975.0,
"step": 2230
},
{
"entropy": 6.378747272491455,
"epoch": 2.6140350877192984,
"grad_norm": 1.09375,
"learning_rate": 0.0004709094851760251,
"loss": 6.3292,
"mean_token_accuracy": 0.15727580934762955,
"num_tokens": 5569059.0,
"step": 2235
},
{
"entropy": 6.452804231643677,
"epoch": 2.6198830409356724,
"grad_norm": 1.6953125,
"learning_rate": 0.0004706785349147163,
"loss": 6.3769,
"mean_token_accuracy": 0.15244505405426026,
"num_tokens": 5581358.0,
"step": 2240
},
{
"entropy": 6.370846271514893,
"epoch": 2.625730994152047,
"grad_norm": 0.91796875,
"learning_rate": 0.000470446735394534,
"loss": 6.355,
"mean_token_accuracy": 0.1546326532959938,
"num_tokens": 5594256.0,
"step": 2245
},
{
"entropy": 6.4742106914520265,
"epoch": 2.6315789473684212,
"grad_norm": 0.94921875,
"learning_rate": 0.0004702140876215047,
"loss": 6.3688,
"mean_token_accuracy": 0.15458932071924208,
"num_tokens": 5607236.0,
"step": 2250
},
{
"entropy": 6.453370571136475,
"epoch": 2.6374269005847952,
"grad_norm": 0.92578125,
"learning_rate": 0.0004699805926053365,
"loss": 6.4485,
"mean_token_accuracy": 0.1468624457716942,
"num_tokens": 5619550.0,
"step": 2255
},
{
"entropy": 6.42191071510315,
"epoch": 2.6432748538011697,
"grad_norm": 0.96484375,
"learning_rate": 0.00046974625135941445,
"loss": 6.3209,
"mean_token_accuracy": 0.1635372146964073,
"num_tokens": 5632721.0,
"step": 2260
},
{
"entropy": 6.292844820022583,
"epoch": 2.6491228070175437,
"grad_norm": 1.0,
"learning_rate": 0.00046951106490079636,
"loss": 6.1628,
"mean_token_accuracy": 0.16240906715393066,
"num_tokens": 5643672.0,
"step": 2265
},
{
"entropy": 6.416713523864746,
"epoch": 2.654970760233918,
"grad_norm": 0.94140625,
"learning_rate": 0.00046927503425020847,
"loss": 6.3154,
"mean_token_accuracy": 0.1603567898273468,
"num_tokens": 5656072.0,
"step": 2270
},
{
"entropy": 6.424367380142212,
"epoch": 2.6608187134502925,
"grad_norm": 1.015625,
"learning_rate": 0.00046903816043204045,
"loss": 6.3209,
"mean_token_accuracy": 0.16185720711946489,
"num_tokens": 5668365.0,
"step": 2275
},
{
"entropy": 6.36755862236023,
"epoch": 2.6666666666666665,
"grad_norm": 0.95703125,
"learning_rate": 0.0004688004444743419,
"loss": 6.2953,
"mean_token_accuracy": 0.1602882906794548,
"num_tokens": 5680013.0,
"step": 2280
},
{
"entropy": 6.336581182479859,
"epoch": 2.672514619883041,
"grad_norm": 1.03125,
"learning_rate": 0.000468561887408817,
"loss": 6.3057,
"mean_token_accuracy": 0.16570388078689574,
"num_tokens": 5691884.0,
"step": 2285
},
{
"entropy": 6.452933692932129,
"epoch": 2.678362573099415,
"grad_norm": 0.95703125,
"learning_rate": 0.0004683224902708206,
"loss": 6.3805,
"mean_token_accuracy": 0.15759104639291763,
"num_tokens": 5704340.0,
"step": 2290
},
{
"entropy": 6.458897542953491,
"epoch": 2.6842105263157894,
"grad_norm": 0.90234375,
"learning_rate": 0.0004680822540993534,
"loss": 6.4474,
"mean_token_accuracy": 0.1541441336274147,
"num_tokens": 5717792.0,
"step": 2295
},
{
"entropy": 6.405977010726929,
"epoch": 2.690058479532164,
"grad_norm": 0.96484375,
"learning_rate": 0.00046784117993705753,
"loss": 6.3126,
"mean_token_accuracy": 0.15851492285728455,
"num_tokens": 5730237.0,
"step": 2300
},
{
"entropy": 6.3309938430786135,
"epoch": 2.6959064327485383,
"grad_norm": 0.9921875,
"learning_rate": 0.00046759926883021234,
"loss": 6.3274,
"mean_token_accuracy": 0.1620144173502922,
"num_tokens": 5743953.0,
"step": 2305
},
{
"entropy": 6.280972290039062,
"epoch": 2.7017543859649122,
"grad_norm": 0.96484375,
"learning_rate": 0.00046735652182872925,
"loss": 6.2824,
"mean_token_accuracy": 0.1625583678483963,
"num_tokens": 5756148.0,
"step": 2310
},
{
"entropy": 6.4063561916351315,
"epoch": 2.7076023391812867,
"grad_norm": 0.95703125,
"learning_rate": 0.0004671129399861476,
"loss": 6.3086,
"mean_token_accuracy": 0.16160560995340348,
"num_tokens": 5769163.0,
"step": 2315
},
{
"entropy": 6.432324314117432,
"epoch": 2.7134502923976607,
"grad_norm": 1.0546875,
"learning_rate": 0.00046686852435963016,
"loss": 6.3567,
"mean_token_accuracy": 0.1563731849193573,
"num_tokens": 5781832.0,
"step": 2320
},
{
"entropy": 6.4083678245544435,
"epoch": 2.719298245614035,
"grad_norm": 0.95703125,
"learning_rate": 0.0004666232760099583,
"loss": 6.3313,
"mean_token_accuracy": 0.15613825470209122,
"num_tokens": 5794803.0,
"step": 2325
},
{
"entropy": 6.33583664894104,
"epoch": 2.7251461988304095,
"grad_norm": 1.046875,
"learning_rate": 0.00046637719600152737,
"loss": 6.3744,
"mean_token_accuracy": 0.15271316468715668,
"num_tokens": 5806768.0,
"step": 2330
},
{
"entropy": 6.463951921463012,
"epoch": 2.7309941520467835,
"grad_norm": 0.96875,
"learning_rate": 0.00046613028540234226,
"loss": 6.362,
"mean_token_accuracy": 0.15153847485780716,
"num_tokens": 5819113.0,
"step": 2335
},
{
"entropy": 6.4841100692749025,
"epoch": 2.736842105263158,
"grad_norm": 1.015625,
"learning_rate": 0.00046588254528401264,
"loss": 6.3487,
"mean_token_accuracy": 0.15776934921741487,
"num_tokens": 5830067.0,
"step": 2340
},
{
"entropy": 6.357795190811157,
"epoch": 2.742690058479532,
"grad_norm": 0.9140625,
"learning_rate": 0.0004656339767217485,
"loss": 6.3903,
"mean_token_accuracy": 0.15893999636173248,
"num_tokens": 5842882.0,
"step": 2345
},
{
"entropy": 6.362135028839111,
"epoch": 2.7485380116959064,
"grad_norm": 1.0078125,
"learning_rate": 0.00046538458079435516,
"loss": 6.3471,
"mean_token_accuracy": 0.1559979036450386,
"num_tokens": 5854041.0,
"step": 2350
},
{
"entropy": 6.3982950210571286,
"epoch": 2.754385964912281,
"grad_norm": 0.90625,
"learning_rate": 0.0004651343585842287,
"loss": 6.3622,
"mean_token_accuracy": 0.16023843735456467,
"num_tokens": 5866027.0,
"step": 2355
},
{
"entropy": 6.420347070693969,
"epoch": 2.760233918128655,
"grad_norm": 0.9453125,
"learning_rate": 0.00046488331117735176,
"loss": 6.4012,
"mean_token_accuracy": 0.15767731219530107,
"num_tokens": 5877064.0,
"step": 2360
},
{
"entropy": 6.4100385189056395,
"epoch": 2.7660818713450293,
"grad_norm": 0.92578125,
"learning_rate": 0.0004646314396632878,
"loss": 6.36,
"mean_token_accuracy": 0.1527327373623848,
"num_tokens": 5889190.0,
"step": 2365
},
{
"entropy": 6.4071427345275875,
"epoch": 2.7719298245614032,
"grad_norm": 0.98828125,
"learning_rate": 0.0004643787451351774,
"loss": 6.3214,
"mean_token_accuracy": 0.16360556483268737,
"num_tokens": 5901615.0,
"step": 2370
},
{
"entropy": 6.344958639144897,
"epoch": 2.7777777777777777,
"grad_norm": 0.984375,
"learning_rate": 0.00046412522868973297,
"loss": 6.3348,
"mean_token_accuracy": 0.16286085695028304,
"num_tokens": 5913797.0,
"step": 2375
},
{
"entropy": 6.495028638839722,
"epoch": 2.783625730994152,
"grad_norm": 1.140625,
"learning_rate": 0.00046387089142723386,
"loss": 6.423,
"mean_token_accuracy": 0.1536428764462471,
"num_tokens": 5927607.0,
"step": 2380
},
{
"entropy": 6.278487586975098,
"epoch": 2.7894736842105265,
"grad_norm": 0.87109375,
"learning_rate": 0.00046361573445152224,
"loss": 6.244,
"mean_token_accuracy": 0.16840714812278748,
"num_tokens": 5940254.0,
"step": 2385
},
{
"entropy": 6.286334753036499,
"epoch": 2.7953216374269005,
"grad_norm": 0.91796875,
"learning_rate": 0.00046335975886999754,
"loss": 6.1057,
"mean_token_accuracy": 0.18146230429410934,
"num_tokens": 5953341.0,
"step": 2390
},
{
"entropy": 6.189684867858887,
"epoch": 2.801169590643275,
"grad_norm": 1.0390625,
"learning_rate": 0.00046310296579361225,
"loss": 6.1227,
"mean_token_accuracy": 0.1759614497423172,
"num_tokens": 5965148.0,
"step": 2395
},
{
"entropy": 6.396270895004273,
"epoch": 2.807017543859649,
"grad_norm": 1.0,
"learning_rate": 0.0004628453563368666,
"loss": 6.427,
"mean_token_accuracy": 0.15592924356460572,
"num_tokens": 5979143.0,
"step": 2400
},
{
"entropy": 6.432704257965088,
"epoch": 2.8128654970760234,
"grad_norm": 0.87109375,
"learning_rate": 0.0004625869316178043,
"loss": 6.3801,
"mean_token_accuracy": 0.15802184641361236,
"num_tokens": 5992735.0,
"step": 2405
},
{
"entropy": 6.3870086669921875,
"epoch": 2.818713450292398,
"grad_norm": 0.984375,
"learning_rate": 0.000462327692758007,
"loss": 6.4392,
"mean_token_accuracy": 0.1521684244275093,
"num_tokens": 6005033.0,
"step": 2410
},
{
"entropy": 6.421163511276245,
"epoch": 2.824561403508772,
"grad_norm": 0.9609375,
"learning_rate": 0.00046206764088259003,
"loss": 6.2863,
"mean_token_accuracy": 0.15989122688770294,
"num_tokens": 6016746.0,
"step": 2415
},
{
"entropy": 6.33553147315979,
"epoch": 2.8304093567251463,
"grad_norm": 0.9140625,
"learning_rate": 0.00046180677712019707,
"loss": 6.4096,
"mean_token_accuracy": 0.16018725782632828,
"num_tokens": 6029774.0,
"step": 2420
},
{
"entropy": 6.409818172454834,
"epoch": 2.8362573099415203,
"grad_norm": 0.86328125,
"learning_rate": 0.0004615451026029957,
"loss": 6.4146,
"mean_token_accuracy": 0.15117032825946808,
"num_tokens": 6043773.0,
"step": 2425
},
{
"entropy": 6.425046586990357,
"epoch": 2.8421052631578947,
"grad_norm": 0.97265625,
"learning_rate": 0.000461282618466672,
"loss": 6.3445,
"mean_token_accuracy": 0.15665405690670015,
"num_tokens": 6055840.0,
"step": 2430
},
{
"entropy": 6.339585781097412,
"epoch": 2.847953216374269,
"grad_norm": 0.9453125,
"learning_rate": 0.00046101932585042597,
"loss": 6.2673,
"mean_token_accuracy": 0.1643536388874054,
"num_tokens": 6069170.0,
"step": 2435
},
{
"entropy": 6.342624139785767,
"epoch": 2.853801169590643,
"grad_norm": 0.99609375,
"learning_rate": 0.00046075522589696636,
"loss": 6.3106,
"mean_token_accuracy": 0.16063767522573472,
"num_tokens": 6080888.0,
"step": 2440
},
{
"entropy": 6.340544939041138,
"epoch": 2.8596491228070176,
"grad_norm": 0.9765625,
"learning_rate": 0.000460490319752506,
"loss": 6.2528,
"mean_token_accuracy": 0.16264109164476395,
"num_tokens": 6093035.0,
"step": 2445
},
{
"entropy": 6.338132858276367,
"epoch": 2.8654970760233915,
"grad_norm": 0.84375,
"learning_rate": 0.00046022460856675663,
"loss": 6.3084,
"mean_token_accuracy": 0.15992005169391632,
"num_tokens": 6105963.0,
"step": 2450
},
{
"entropy": 6.492386102676392,
"epoch": 2.871345029239766,
"grad_norm": 0.92578125,
"learning_rate": 0.0004599580934929237,
"loss": 6.363,
"mean_token_accuracy": 0.1540924310684204,
"num_tokens": 6118541.0,
"step": 2455
},
{
"entropy": 6.305073308944702,
"epoch": 2.8771929824561404,
"grad_norm": 0.83203125,
"learning_rate": 0.0004596907756877018,
"loss": 6.2757,
"mean_token_accuracy": 0.1591099828481674,
"num_tokens": 6131317.0,
"step": 2460
},
{
"entropy": 6.313772678375244,
"epoch": 2.883040935672515,
"grad_norm": 0.96484375,
"learning_rate": 0.00045942265631126935,
"loss": 6.3297,
"mean_token_accuracy": 0.1558357760310173,
"num_tokens": 6143721.0,
"step": 2465
},
{
"entropy": 6.422686243057251,
"epoch": 2.888888888888889,
"grad_norm": 0.9140625,
"learning_rate": 0.0004591537365272837,
"loss": 6.3368,
"mean_token_accuracy": 0.15447324216365815,
"num_tokens": 6156497.0,
"step": 2470
},
{
"entropy": 6.3003072261810305,
"epoch": 2.8947368421052633,
"grad_norm": 0.9765625,
"learning_rate": 0.000458884017502876,
"loss": 6.3197,
"mean_token_accuracy": 0.15949088782072068,
"num_tokens": 6168140.0,
"step": 2475
},
{
"entropy": 6.447915410995483,
"epoch": 2.9005847953216373,
"grad_norm": 1.015625,
"learning_rate": 0.0004586135004086461,
"loss": 6.3075,
"mean_token_accuracy": 0.1587062209844589,
"num_tokens": 6181067.0,
"step": 2480
},
{
"entropy": 6.37141695022583,
"epoch": 2.9064327485380117,
"grad_norm": 1.0078125,
"learning_rate": 0.0004583421864186577,
"loss": 6.2878,
"mean_token_accuracy": 0.15840196162462233,
"num_tokens": 6194072.0,
"step": 2485
},
{
"entropy": 6.398710060119629,
"epoch": 2.912280701754386,
"grad_norm": 0.94140625,
"learning_rate": 0.0004580700767104328,
"loss": 6.3502,
"mean_token_accuracy": 0.15895379483699798,
"num_tokens": 6206711.0,
"step": 2490
},
{
"entropy": 6.2833679676055905,
"epoch": 2.91812865497076,
"grad_norm": 0.9921875,
"learning_rate": 0.00045779717246494724,
"loss": 6.2929,
"mean_token_accuracy": 0.16018681973218918,
"num_tokens": 6219903.0,
"step": 2495
},
{
"entropy": 6.422380065917968,
"epoch": 2.9239766081871346,
"grad_norm": 0.86328125,
"learning_rate": 0.0004575234748666249,
"loss": 6.3322,
"mean_token_accuracy": 0.1575925275683403,
"num_tokens": 6232947.0,
"step": 2500
},
{
"epoch": 2.9239766081871346,
"eval_entropy": 6.228010782449998,
"eval_loss": 6.686753749847412,
"eval_mean_token_accuracy": 0.14343646748106828,
"eval_num_tokens": 6232947.0,
"eval_runtime": 2.4623,
"eval_samples_per_second": 1099.401,
"eval_steps_per_second": 137.679,
"step": 2500
},
{
"entropy": 6.381910753250122,
"epoch": 2.9298245614035086,
"grad_norm": 0.96484375,
"learning_rate": 0.000457248985103333,
"loss": 6.2954,
"mean_token_accuracy": 0.16335611939430236,
"num_tokens": 6245597.0,
"step": 2505
},
{
"entropy": 6.293904399871826,
"epoch": 2.935672514619883,
"grad_norm": 0.87890625,
"learning_rate": 0.0004569737043663768,
"loss": 6.2384,
"mean_token_accuracy": 0.15765101015567778,
"num_tokens": 6257745.0,
"step": 2510
},
{
"entropy": 6.377149963378907,
"epoch": 2.9415204678362574,
"grad_norm": 0.953125,
"learning_rate": 0.0004566976338504945,
"loss": 6.3258,
"mean_token_accuracy": 0.16138820350170135,
"num_tokens": 6268871.0,
"step": 2515
},
{
"entropy": 6.309790897369385,
"epoch": 2.9473684210526314,
"grad_norm": 0.84765625,
"learning_rate": 0.00045642077475385186,
"loss": 6.2771,
"mean_token_accuracy": 0.16179230958223342,
"num_tokens": 6281487.0,
"step": 2520
},
{
"entropy": 6.288878536224365,
"epoch": 2.953216374269006,
"grad_norm": 0.96484375,
"learning_rate": 0.0004561431282780372,
"loss": 6.27,
"mean_token_accuracy": 0.16087991297245025,
"num_tokens": 6292928.0,
"step": 2525
},
{
"entropy": 6.338937902450562,
"epoch": 2.95906432748538,
"grad_norm": 0.96875,
"learning_rate": 0.00045586469562805624,
"loss": 6.2631,
"mean_token_accuracy": 0.1764080673456192,
"num_tokens": 6304340.0,
"step": 2530
},
{
"entropy": 6.333574485778809,
"epoch": 2.9649122807017543,
"grad_norm": 1.0078125,
"learning_rate": 0.0004555854780123265,
"loss": 6.3068,
"mean_token_accuracy": 0.15834459513425828,
"num_tokens": 6315972.0,
"step": 2535
},
{
"entropy": 6.420508766174317,
"epoch": 2.9707602339181287,
"grad_norm": 0.96875,
"learning_rate": 0.0004553054766426725,
"loss": 6.3244,
"mean_token_accuracy": 0.16149794608354567,
"num_tokens": 6327482.0,
"step": 2540
},
{
"entropy": 6.330016708374023,
"epoch": 2.976608187134503,
"grad_norm": 0.94921875,
"learning_rate": 0.0004550246927343203,
"loss": 6.3,
"mean_token_accuracy": 0.15959006398916245,
"num_tokens": 6338932.0,
"step": 2545
},
{
"entropy": 6.319592094421386,
"epoch": 2.982456140350877,
"grad_norm": 0.90625,
"learning_rate": 0.00045474312750589226,
"loss": 6.3153,
"mean_token_accuracy": 0.16303989440202712,
"num_tokens": 6350770.0,
"step": 2550
},
{
"entropy": 6.4416406631469725,
"epoch": 2.9883040935672516,
"grad_norm": 0.9140625,
"learning_rate": 0.00045446078217940155,
"loss": 6.3326,
"mean_token_accuracy": 0.15646135210990905,
"num_tokens": 6363472.0,
"step": 2555
},
{
"entropy": 6.353861141204834,
"epoch": 2.9941520467836256,
"grad_norm": 0.9921875,
"learning_rate": 0.00045417765798024716,
"loss": 6.3248,
"mean_token_accuracy": 0.1572430282831192,
"num_tokens": 6377174.0,
"step": 2560
},
{
"entropy": 6.3105700492858885,
"epoch": 3.0,
"grad_norm": 1.0546875,
"learning_rate": 0.0004538937561372086,
"loss": 6.2852,
"mean_token_accuracy": 0.15677970498800278,
"num_tokens": 6388452.0,
"step": 2565
},
{
"entropy": 6.392526578903198,
"epoch": 3.0058479532163744,
"grad_norm": 0.8671875,
"learning_rate": 0.0004536090778824398,
"loss": 5.9463,
"mean_token_accuracy": 0.16792120933532714,
"num_tokens": 6401740.0,
"step": 2570
},
{
"entropy": 6.278876066207886,
"epoch": 3.0116959064327484,
"grad_norm": 0.9140625,
"learning_rate": 0.0004533236244514652,
"loss": 5.9219,
"mean_token_accuracy": 0.17937717735767364,
"num_tokens": 6414850.0,
"step": 2575
},
{
"entropy": 6.3321695804595945,
"epoch": 3.017543859649123,
"grad_norm": 0.8203125,
"learning_rate": 0.00045303739708317303,
"loss": 6.07,
"mean_token_accuracy": 0.1595938354730606,
"num_tokens": 6429250.0,
"step": 2580
},
{
"entropy": 6.327478551864624,
"epoch": 3.023391812865497,
"grad_norm": 0.9921875,
"learning_rate": 0.0004527503970198105,
"loss": 5.9049,
"mean_token_accuracy": 0.17174699604511262,
"num_tokens": 6440583.0,
"step": 2585
},
{
"entropy": 6.248927450180053,
"epoch": 3.0292397660818713,
"grad_norm": 0.9453125,
"learning_rate": 0.0004524626255069786,
"loss": 5.9137,
"mean_token_accuracy": 0.1715962216258049,
"num_tokens": 6452678.0,
"step": 2590
},
{
"entropy": 6.342889261245728,
"epoch": 3.0350877192982457,
"grad_norm": 1.0078125,
"learning_rate": 0.00045217408379362635,
"loss": 5.9651,
"mean_token_accuracy": 0.16405910402536392,
"num_tokens": 6464751.0,
"step": 2595
},
{
"entropy": 6.165900850296021,
"epoch": 3.0409356725146197,
"grad_norm": 0.9765625,
"learning_rate": 0.00045188477313204536,
"loss": 5.9485,
"mean_token_accuracy": 0.16895277351140975,
"num_tokens": 6476017.0,
"step": 2600
},
{
"entropy": 6.410179710388183,
"epoch": 3.046783625730994,
"grad_norm": 1.109375,
"learning_rate": 0.00045159469477786457,
"loss": 5.9593,
"mean_token_accuracy": 0.16621456444263458,
"num_tokens": 6487404.0,
"step": 2605
},
{
"entropy": 6.260316276550293,
"epoch": 3.0526315789473686,
"grad_norm": 1.0,
"learning_rate": 0.0004513038499900451,
"loss": 6.0081,
"mean_token_accuracy": 0.16388956606388091,
"num_tokens": 6500027.0,
"step": 2610
},
{
"entropy": 6.213790369033814,
"epoch": 3.0584795321637426,
"grad_norm": 0.9375,
"learning_rate": 0.000451012240030874,
"loss": 5.9951,
"mean_token_accuracy": 0.16142894178628922,
"num_tokens": 6513067.0,
"step": 2615
},
{
"entropy": 6.309322500228882,
"epoch": 3.064327485380117,
"grad_norm": 1.1484375,
"learning_rate": 0.00045071986616595946,
"loss": 5.9291,
"mean_token_accuracy": 0.1655563920736313,
"num_tokens": 6524932.0,
"step": 2620
},
{
"entropy": 6.280933475494384,
"epoch": 3.0701754385964914,
"grad_norm": 0.9609375,
"learning_rate": 0.00045042672966422506,
"loss": 5.9913,
"mean_token_accuracy": 0.16312527656555176,
"num_tokens": 6536843.0,
"step": 2625
},
{
"entropy": 6.313777446746826,
"epoch": 3.0760233918128654,
"grad_norm": 0.98828125,
"learning_rate": 0.0004501328317979041,
"loss": 5.8913,
"mean_token_accuracy": 0.17492551803588868,
"num_tokens": 6549414.0,
"step": 2630
},
{
"entropy": 6.229874134063721,
"epoch": 3.08187134502924,
"grad_norm": 1.015625,
"learning_rate": 0.0004498381738425346,
"loss": 5.981,
"mean_token_accuracy": 0.16901359260082244,
"num_tokens": 6561492.0,
"step": 2635
},
{
"entropy": 6.252202033996582,
"epoch": 3.087719298245614,
"grad_norm": 0.99609375,
"learning_rate": 0.00044954275707695304,
"loss": 5.9041,
"mean_token_accuracy": 0.17166143506765366,
"num_tokens": 6572873.0,
"step": 2640
},
{
"entropy": 6.206519222259521,
"epoch": 3.0935672514619883,
"grad_norm": 0.97265625,
"learning_rate": 0.0004492465827832894,
"loss": 6.032,
"mean_token_accuracy": 0.16835819631814958,
"num_tokens": 6584902.0,
"step": 2645
},
{
"entropy": 6.3408056735992435,
"epoch": 3.0994152046783627,
"grad_norm": 0.93359375,
"learning_rate": 0.00044894965224696144,
"loss": 6.0486,
"mean_token_accuracy": 0.165729159116745,
"num_tokens": 6596792.0,
"step": 2650
},
{
"entropy": 6.311260986328125,
"epoch": 3.1052631578947367,
"grad_norm": 0.9765625,
"learning_rate": 0.00044865196675666886,
"loss": 5.9631,
"mean_token_accuracy": 0.1684489741921425,
"num_tokens": 6608559.0,
"step": 2655
},
{
"entropy": 6.212856483459473,
"epoch": 3.111111111111111,
"grad_norm": 0.98828125,
"learning_rate": 0.0004483535276043881,
"loss": 6.035,
"mean_token_accuracy": 0.16534904688596724,
"num_tokens": 6619938.0,
"step": 2660
},
{
"entropy": 6.30443434715271,
"epoch": 3.116959064327485,
"grad_norm": 0.9375,
"learning_rate": 0.0004480543360853665,
"loss": 5.9972,
"mean_token_accuracy": 0.1677457019686699,
"num_tokens": 6632850.0,
"step": 2665
},
{
"entropy": 6.163619470596314,
"epoch": 3.1228070175438596,
"grad_norm": 1.171875,
"learning_rate": 0.0004477543934981167,
"loss": 5.9369,
"mean_token_accuracy": 0.1831407740712166,
"num_tokens": 6645761.0,
"step": 2670
},
{
"entropy": 6.258465099334717,
"epoch": 3.128654970760234,
"grad_norm": 1.0546875,
"learning_rate": 0.00044745370114441103,
"loss": 5.9796,
"mean_token_accuracy": 0.1701487898826599,
"num_tokens": 6657861.0,
"step": 2675
},
{
"entropy": 6.261053085327148,
"epoch": 3.134502923976608,
"grad_norm": 1.0546875,
"learning_rate": 0.00044715226032927585,
"loss": 5.9501,
"mean_token_accuracy": 0.18009420931339265,
"num_tokens": 6670495.0,
"step": 2680
},
{
"entropy": 6.14657826423645,
"epoch": 3.1403508771929824,
"grad_norm": 0.96875,
"learning_rate": 0.0004468500723609859,
"loss": 5.9073,
"mean_token_accuracy": 0.17263732850551605,
"num_tokens": 6683127.0,
"step": 2685
},
{
"entropy": 6.2960309982299805,
"epoch": 3.146198830409357,
"grad_norm": 1.0234375,
"learning_rate": 0.00044654713855105864,
"loss": 5.9924,
"mean_token_accuracy": 0.16101895570755004,
"num_tokens": 6696159.0,
"step": 2690
},
{
"entropy": 6.228329229354858,
"epoch": 3.152046783625731,
"grad_norm": 0.93359375,
"learning_rate": 0.0004462434602142486,
"loss": 6.0678,
"mean_token_accuracy": 0.1601095601916313,
"num_tokens": 6708993.0,
"step": 2695
},
{
"entropy": 6.307772207260132,
"epoch": 3.1578947368421053,
"grad_norm": 0.98046875,
"learning_rate": 0.0004459390386685414,
"loss": 6.0599,
"mean_token_accuracy": 0.163961498439312,
"num_tokens": 6722121.0,
"step": 2700
},
{
"entropy": 6.195414209365845,
"epoch": 3.1637426900584797,
"grad_norm": 0.953125,
"learning_rate": 0.00044563387523514854,
"loss": 5.8931,
"mean_token_accuracy": 0.17495398819446564,
"num_tokens": 6734167.0,
"step": 2705
},
{
"entropy": 6.1669127464294435,
"epoch": 3.1695906432748537,
"grad_norm": 1.03125,
"learning_rate": 0.0004453279712385011,
"loss": 5.9708,
"mean_token_accuracy": 0.16320591270923615,
"num_tokens": 6745720.0,
"step": 2710
},
{
"entropy": 6.239703941345215,
"epoch": 3.175438596491228,
"grad_norm": 0.98046875,
"learning_rate": 0.0004450213280062444,
"loss": 5.9795,
"mean_token_accuracy": 0.16724556684494019,
"num_tokens": 6757523.0,
"step": 2715
},
{
"entropy": 6.281918716430664,
"epoch": 3.181286549707602,
"grad_norm": 1.109375,
"learning_rate": 0.00044471394686923206,
"loss": 6.0019,
"mean_token_accuracy": 0.16458411812782286,
"num_tokens": 6768775.0,
"step": 2720
},
{
"entropy": 6.183592939376831,
"epoch": 3.1871345029239766,
"grad_norm": 1.0234375,
"learning_rate": 0.0004444058291615202,
"loss": 5.9806,
"mean_token_accuracy": 0.1631944075226784,
"num_tokens": 6781547.0,
"step": 2725
},
{
"entropy": 6.251674652099609,
"epoch": 3.192982456140351,
"grad_norm": 1.015625,
"learning_rate": 0.0004440969762203618,
"loss": 6.0357,
"mean_token_accuracy": 0.161992709338665,
"num_tokens": 6794708.0,
"step": 2730
},
{
"entropy": 6.188206624984741,
"epoch": 3.198830409356725,
"grad_norm": 0.91015625,
"learning_rate": 0.0004437873893862008,
"loss": 5.9687,
"mean_token_accuracy": 0.17510785907506943,
"num_tokens": 6807738.0,
"step": 2735
},
{
"entropy": 6.241711664199829,
"epoch": 3.2046783625730995,
"grad_norm": 0.96484375,
"learning_rate": 0.00044347707000266627,
"loss": 6.0063,
"mean_token_accuracy": 0.16787075698375703,
"num_tokens": 6820851.0,
"step": 2740
},
{
"entropy": 6.255652666091919,
"epoch": 3.2105263157894735,
"grad_norm": 1.296875,
"learning_rate": 0.00044316601941656655,
"loss": 5.971,
"mean_token_accuracy": 0.1767507664859295,
"num_tokens": 6833888.0,
"step": 2745
},
{
"entropy": 6.278566694259643,
"epoch": 3.216374269005848,
"grad_norm": 1.0234375,
"learning_rate": 0.0004428542389778834,
"loss": 6.0006,
"mean_token_accuracy": 0.16937347799539565,
"num_tokens": 6846104.0,
"step": 2750
},
{
"entropy": 6.154065656661987,
"epoch": 3.2222222222222223,
"grad_norm": 1.0,
"learning_rate": 0.0004425417300397665,
"loss": 5.9868,
"mean_token_accuracy": 0.17263167649507521,
"num_tokens": 6857458.0,
"step": 2755
},
{
"entropy": 6.197227334976196,
"epoch": 3.2280701754385963,
"grad_norm": 1.015625,
"learning_rate": 0.00044222849395852683,
"loss": 5.9455,
"mean_token_accuracy": 0.17374100685119628,
"num_tokens": 6870455.0,
"step": 2760
},
{
"entropy": 6.2625514507293705,
"epoch": 3.2339181286549707,
"grad_norm": 0.99609375,
"learning_rate": 0.00044191453209363165,
"loss": 6.0172,
"mean_token_accuracy": 0.16407291442155839,
"num_tokens": 6883359.0,
"step": 2765
},
{
"entropy": 6.167972183227539,
"epoch": 3.239766081871345,
"grad_norm": 1.015625,
"learning_rate": 0.0004415998458076978,
"loss": 5.9507,
"mean_token_accuracy": 0.17144950926303865,
"num_tokens": 6894940.0,
"step": 2770
},
{
"entropy": 6.219690275192261,
"epoch": 3.245614035087719,
"grad_norm": 1.0078125,
"learning_rate": 0.00044128443646648634,
"loss": 6.0031,
"mean_token_accuracy": 0.16717838495969772,
"num_tokens": 6905422.0,
"step": 2775
},
{
"entropy": 6.209583377838134,
"epoch": 3.2514619883040936,
"grad_norm": 1.078125,
"learning_rate": 0.00044096830543889653,
"loss": 5.9953,
"mean_token_accuracy": 0.1705407604575157,
"num_tokens": 6918106.0,
"step": 2780
},
{
"entropy": 6.295555973052979,
"epoch": 3.257309941520468,
"grad_norm": 0.9375,
"learning_rate": 0.0004406514540969596,
"loss": 5.9881,
"mean_token_accuracy": 0.17306460589170455,
"num_tokens": 6930975.0,
"step": 2785
},
{
"entropy": 6.242832279205322,
"epoch": 3.263157894736842,
"grad_norm": 0.98828125,
"learning_rate": 0.00044033388381583324,
"loss": 6.073,
"mean_token_accuracy": 0.15740747302770614,
"num_tokens": 6944436.0,
"step": 2790
},
{
"entropy": 6.216654205322266,
"epoch": 3.2690058479532165,
"grad_norm": 0.9296875,
"learning_rate": 0.00044001559597379503,
"loss": 6.0163,
"mean_token_accuracy": 0.16310405135154724,
"num_tokens": 6957095.0,
"step": 2795
},
{
"entropy": 6.271782493591308,
"epoch": 3.2748538011695905,
"grad_norm": 1.0078125,
"learning_rate": 0.0004396965919522373,
"loss": 5.9706,
"mean_token_accuracy": 0.17239529341459275,
"num_tokens": 6969792.0,
"step": 2800
},
{
"entropy": 6.191951513290405,
"epoch": 3.280701754385965,
"grad_norm": 0.96484375,
"learning_rate": 0.00043937687313565997,
"loss": 6.041,
"mean_token_accuracy": 0.16589197963476182,
"num_tokens": 6982054.0,
"step": 2805
},
{
"entropy": 6.269471025466919,
"epoch": 3.2865497076023393,
"grad_norm": 1.0078125,
"learning_rate": 0.0004390564409116661,
"loss": 6.0088,
"mean_token_accuracy": 0.16702333688735962,
"num_tokens": 6994057.0,
"step": 2810
},
{
"entropy": 6.176166009902954,
"epoch": 3.2923976608187133,
"grad_norm": 0.8828125,
"learning_rate": 0.00043873529667095423,
"loss": 6.0212,
"mean_token_accuracy": 0.16764808893203736,
"num_tokens": 7006417.0,
"step": 2815
},
{
"entropy": 6.266703510284424,
"epoch": 3.2982456140350878,
"grad_norm": 1.0390625,
"learning_rate": 0.00043841344180731346,
"loss": 6.0281,
"mean_token_accuracy": 0.16158117055892945,
"num_tokens": 7018331.0,
"step": 2820
},
{
"entropy": 6.160199213027954,
"epoch": 3.3040935672514617,
"grad_norm": 1.5859375,
"learning_rate": 0.000438090877717617,
"loss": 5.9242,
"mean_token_accuracy": 0.17272595465183258,
"num_tokens": 7031654.0,
"step": 2825
},
{
"entropy": 6.310096740722656,
"epoch": 3.309941520467836,
"grad_norm": 0.9609375,
"learning_rate": 0.0004377676058018161,
"loss": 6.0147,
"mean_token_accuracy": 0.17139537930488585,
"num_tokens": 7044921.0,
"step": 2830
},
{
"entropy": 6.204626655578613,
"epoch": 3.3157894736842106,
"grad_norm": 0.98046875,
"learning_rate": 0.0004374436274629341,
"loss": 5.9735,
"mean_token_accuracy": 0.16763016879558562,
"num_tokens": 7056700.0,
"step": 2835
},
{
"entropy": 6.1761843204498295,
"epoch": 3.3216374269005846,
"grad_norm": 1.1015625,
"learning_rate": 0.0004371189441070602,
"loss": 5.9157,
"mean_token_accuracy": 0.16867847591638566,
"num_tokens": 7069196.0,
"step": 2840
},
{
"entropy": 6.12023959159851,
"epoch": 3.327485380116959,
"grad_norm": 1.078125,
"learning_rate": 0.0004367935571433433,
"loss": 5.9505,
"mean_token_accuracy": 0.17163126021623612,
"num_tokens": 7081528.0,
"step": 2845
},
{
"entropy": 6.265584135055542,
"epoch": 3.3333333333333335,
"grad_norm": 1.015625,
"learning_rate": 0.0004364674679839864,
"loss": 6.0549,
"mean_token_accuracy": 0.1606398344039917,
"num_tokens": 7093474.0,
"step": 2850
},
{
"entropy": 6.172379398345948,
"epoch": 3.3391812865497075,
"grad_norm": 0.9765625,
"learning_rate": 0.0004361406780442398,
"loss": 5.9714,
"mean_token_accuracy": 0.17294029146432877,
"num_tokens": 7105508.0,
"step": 2855
},
{
"entropy": 6.132690143585205,
"epoch": 3.345029239766082,
"grad_norm": 0.95703125,
"learning_rate": 0.00043581318874239504,
"loss": 5.9953,
"mean_token_accuracy": 0.1723817065358162,
"num_tokens": 7117952.0,
"step": 2860
},
{
"entropy": 6.188911104202271,
"epoch": 3.3508771929824563,
"grad_norm": 1.0859375,
"learning_rate": 0.00043548500149977946,
"loss": 5.9842,
"mean_token_accuracy": 0.1761474370956421,
"num_tokens": 7130666.0,
"step": 2865
},
{
"entropy": 6.174688911437988,
"epoch": 3.3567251461988303,
"grad_norm": 1.078125,
"learning_rate": 0.0004351561177407491,
"loss": 5.9988,
"mean_token_accuracy": 0.16925353258848191,
"num_tokens": 7142717.0,
"step": 2870
},
{
"entropy": 6.264885139465332,
"epoch": 3.3625730994152048,
"grad_norm": 1.015625,
"learning_rate": 0.0004348265388926831,
"loss": 6.0392,
"mean_token_accuracy": 0.1675310716032982,
"num_tokens": 7154794.0,
"step": 2875
},
{
"entropy": 6.2017535209655765,
"epoch": 3.3684210526315788,
"grad_norm": 0.90234375,
"learning_rate": 0.0004344962663859771,
"loss": 6.0935,
"mean_token_accuracy": 0.16042060852050782,
"num_tokens": 7168907.0,
"step": 2880
},
{
"entropy": 6.177575397491455,
"epoch": 3.374269005847953,
"grad_norm": 0.9765625,
"learning_rate": 0.00043416530165403777,
"loss": 5.9328,
"mean_token_accuracy": 0.1788468763232231,
"num_tokens": 7180828.0,
"step": 2885
},
{
"entropy": 6.134566736221314,
"epoch": 3.3801169590643276,
"grad_norm": 1.046875,
"learning_rate": 0.0004338336461332756,
"loss": 5.9277,
"mean_token_accuracy": 0.17241569012403488,
"num_tokens": 7193493.0,
"step": 2890
},
{
"entropy": 6.188924264907837,
"epoch": 3.3859649122807016,
"grad_norm": 0.98046875,
"learning_rate": 0.00043350130126309936,
"loss": 5.9393,
"mean_token_accuracy": 0.17040509432554246,
"num_tokens": 7206033.0,
"step": 2895
},
{
"entropy": 6.2149004459381105,
"epoch": 3.391812865497076,
"grad_norm": 0.92578125,
"learning_rate": 0.00043316826848590955,
"loss": 5.9879,
"mean_token_accuracy": 0.1668877825140953,
"num_tokens": 7218813.0,
"step": 2900
},
{
"entropy": 6.133463573455811,
"epoch": 3.39766081871345,
"grad_norm": 1.046875,
"learning_rate": 0.0004328345492470924,
"loss": 5.9972,
"mean_token_accuracy": 0.1709141507744789,
"num_tokens": 7230698.0,
"step": 2905
},
{
"entropy": 6.16968002319336,
"epoch": 3.4035087719298245,
"grad_norm": 1.09375,
"learning_rate": 0.0004325001449950134,
"loss": 6.0196,
"mean_token_accuracy": 0.16263867169618607,
"num_tokens": 7243354.0,
"step": 2910
},
{
"entropy": 6.1444470405578615,
"epoch": 3.409356725146199,
"grad_norm": 0.93359375,
"learning_rate": 0.0004321650571810109,
"loss": 5.9456,
"mean_token_accuracy": 0.17527865320444108,
"num_tokens": 7255855.0,
"step": 2915
},
{
"entropy": 6.1285984992980955,
"epoch": 3.415204678362573,
"grad_norm": 0.94140625,
"learning_rate": 0.0004318292872593899,
"loss": 6.0579,
"mean_token_accuracy": 0.16902580261230468,
"num_tokens": 7268921.0,
"step": 2920
},
{
"entropy": 6.288447093963623,
"epoch": 3.4210526315789473,
"grad_norm": 1.0625,
"learning_rate": 0.0004314928366874162,
"loss": 6.0447,
"mean_token_accuracy": 0.16461026519536973,
"num_tokens": 7281467.0,
"step": 2925
},
{
"entropy": 6.15428729057312,
"epoch": 3.426900584795322,
"grad_norm": 1.015625,
"learning_rate": 0.0004311557069253092,
"loss": 5.9603,
"mean_token_accuracy": 0.16882845461368562,
"num_tokens": 7294887.0,
"step": 2930
},
{
"entropy": 6.256271076202393,
"epoch": 3.4327485380116958,
"grad_norm": 0.9765625,
"learning_rate": 0.0004308178994362364,
"loss": 6.0711,
"mean_token_accuracy": 0.17041621059179307,
"num_tokens": 7307009.0,
"step": 2935
},
{
"entropy": 6.143927049636841,
"epoch": 3.43859649122807,
"grad_norm": 0.9765625,
"learning_rate": 0.00043047941568630644,
"loss": 5.9898,
"mean_token_accuracy": 0.1640391692519188,
"num_tokens": 7319751.0,
"step": 2940
},
{
"entropy": 6.278747653961181,
"epoch": 3.4444444444444446,
"grad_norm": 1.0078125,
"learning_rate": 0.00043014025714456305,
"loss": 6.1141,
"mean_token_accuracy": 0.16568706333637237,
"num_tokens": 7333952.0,
"step": 2945
},
{
"entropy": 6.166254758834839,
"epoch": 3.4502923976608186,
"grad_norm": 0.953125,
"learning_rate": 0.0004298004252829787,
"loss": 5.8521,
"mean_token_accuracy": 0.17793419361114501,
"num_tokens": 7346834.0,
"step": 2950
},
{
"entropy": 6.181408214569092,
"epoch": 3.456140350877193,
"grad_norm": 0.9609375,
"learning_rate": 0.000429459921576448,
"loss": 6.0164,
"mean_token_accuracy": 0.16523997187614442,
"num_tokens": 7359165.0,
"step": 2955
},
{
"entropy": 6.248525333404541,
"epoch": 3.461988304093567,
"grad_norm": 1.015625,
"learning_rate": 0.00042911874750278133,
"loss": 6.0995,
"mean_token_accuracy": 0.16399604231119155,
"num_tokens": 7371585.0,
"step": 2960
},
{
"entropy": 6.183741044998169,
"epoch": 3.4678362573099415,
"grad_norm": 0.96484375,
"learning_rate": 0.00042877690454269884,
"loss": 5.9939,
"mean_token_accuracy": 0.1728069931268692,
"num_tokens": 7383455.0,
"step": 2965
},
{
"entropy": 6.163669443130493,
"epoch": 3.473684210526316,
"grad_norm": 1.296875,
"learning_rate": 0.00042843439417982344,
"loss": 6.0357,
"mean_token_accuracy": 0.1664002001285553,
"num_tokens": 7395918.0,
"step": 2970
},
{
"entropy": 6.240420866012573,
"epoch": 3.47953216374269,
"grad_norm": 1.0078125,
"learning_rate": 0.0004280912179006746,
"loss": 6.0288,
"mean_token_accuracy": 0.16767937690019608,
"num_tokens": 7408053.0,
"step": 2975
},
{
"entropy": 6.21848349571228,
"epoch": 3.4853801169590644,
"grad_norm": 0.99609375,
"learning_rate": 0.000427747377194662,
"loss": 6.0713,
"mean_token_accuracy": 0.16040903925895691,
"num_tokens": 7419947.0,
"step": 2980
},
{
"entropy": 6.1501240730285645,
"epoch": 3.4912280701754383,
"grad_norm": 1.0078125,
"learning_rate": 0.0004274028735540789,
"loss": 5.9555,
"mean_token_accuracy": 0.16594758480787278,
"num_tokens": 7433022.0,
"step": 2985
},
{
"entropy": 6.160979461669922,
"epoch": 3.497076023391813,
"grad_norm": 1.0078125,
"learning_rate": 0.00042705770847409596,
"loss": 5.9557,
"mean_token_accuracy": 0.17573656290769576,
"num_tokens": 7445280.0,
"step": 2990
},
{
"entropy": 6.229852199554443,
"epoch": 3.502923976608187,
"grad_norm": 0.98828125,
"learning_rate": 0.00042671188345275423,
"loss": 5.9577,
"mean_token_accuracy": 0.1677226185798645,
"num_tokens": 7457324.0,
"step": 2995
},
{
"entropy": 6.147160577774048,
"epoch": 3.5087719298245617,
"grad_norm": 1.0625,
"learning_rate": 0.0004263653999909593,
"loss": 5.9988,
"mean_token_accuracy": 0.1643926292657852,
"num_tokens": 7469070.0,
"step": 3000
},
{
"epoch": 3.5087719298245617,
"eval_entropy": 6.115740476456364,
"eval_loss": 6.666450023651123,
"eval_mean_token_accuracy": 0.14517788045591837,
"eval_num_tokens": 7469070.0,
"eval_runtime": 2.2519,
"eval_samples_per_second": 1202.07,
"eval_steps_per_second": 150.536,
"step": 3000
},
{
"entropy": 6.184430265426636,
"epoch": 3.5146198830409356,
"grad_norm": 1.0703125,
"learning_rate": 0.000426018259592474,
"loss": 6.0837,
"mean_token_accuracy": 0.15831924527883529,
"num_tokens": 7480988.0,
"step": 3005
},
{
"entropy": 6.163422060012818,
"epoch": 3.52046783625731,
"grad_norm": 0.984375,
"learning_rate": 0.0004256704637639126,
"loss": 5.9838,
"mean_token_accuracy": 0.17578862309455873,
"num_tokens": 7493557.0,
"step": 3010
},
{
"entropy": 6.206086158752441,
"epoch": 3.526315789473684,
"grad_norm": 1.1171875,
"learning_rate": 0.0004253220140147341,
"loss": 6.0224,
"mean_token_accuracy": 0.16361560374498368,
"num_tokens": 7507446.0,
"step": 3015
},
{
"entropy": 6.199255466461182,
"epoch": 3.5321637426900585,
"grad_norm": 1.0390625,
"learning_rate": 0.0004249729118572352,
"loss": 5.9641,
"mean_token_accuracy": 0.1649053007364273,
"num_tokens": 7520054.0,
"step": 3020
},
{
"entropy": 6.135600757598877,
"epoch": 3.538011695906433,
"grad_norm": 0.94140625,
"learning_rate": 0.0004246231588065444,
"loss": 5.8661,
"mean_token_accuracy": 0.17815568596124648,
"num_tokens": 7533141.0,
"step": 3025
},
{
"entropy": 6.142067241668701,
"epoch": 3.543859649122807,
"grad_norm": 0.9140625,
"learning_rate": 0.000424272756380615,
"loss": 6.0498,
"mean_token_accuracy": 0.1649346187710762,
"num_tokens": 7545544.0,
"step": 3030
},
{
"entropy": 6.221088457107544,
"epoch": 3.5497076023391814,
"grad_norm": 0.9609375,
"learning_rate": 0.0004239217061002188,
"loss": 6.0188,
"mean_token_accuracy": 0.17284639775753022,
"num_tokens": 7558055.0,
"step": 3035
},
{
"entropy": 6.097956657409668,
"epoch": 3.5555555555555554,
"grad_norm": 0.99609375,
"learning_rate": 0.00042357000948893894,
"loss": 5.9166,
"mean_token_accuracy": 0.17839913815259933,
"num_tokens": 7569951.0,
"step": 3040
},
{
"entropy": 6.189938402175903,
"epoch": 3.56140350877193,
"grad_norm": 1.1328125,
"learning_rate": 0.00042321766807316405,
"loss": 6.0575,
"mean_token_accuracy": 0.16201525926589966,
"num_tokens": 7581810.0,
"step": 3045
},
{
"entropy": 6.261252927780151,
"epoch": 3.5672514619883042,
"grad_norm": 0.953125,
"learning_rate": 0.00042286468338208113,
"loss": 6.02,
"mean_token_accuracy": 0.16690725237131118,
"num_tokens": 7594896.0,
"step": 3050
},
{
"entropy": 6.16382212638855,
"epoch": 3.573099415204678,
"grad_norm": 1.03125,
"learning_rate": 0.0004225110569476691,
"loss": 6.0416,
"mean_token_accuracy": 0.16896597295999527,
"num_tokens": 7606620.0,
"step": 3055
},
{
"entropy": 6.084327983856201,
"epoch": 3.5789473684210527,
"grad_norm": 1.03125,
"learning_rate": 0.000422156790304692,
"loss": 5.8923,
"mean_token_accuracy": 0.18167843967676162,
"num_tokens": 7619493.0,
"step": 3060
},
{
"entropy": 6.1676939010620115,
"epoch": 3.5847953216374266,
"grad_norm": 1.140625,
"learning_rate": 0.00042180188499069246,
"loss": 5.9136,
"mean_token_accuracy": 0.1693320393562317,
"num_tokens": 7632711.0,
"step": 3065
},
{
"entropy": 6.170799446105957,
"epoch": 3.590643274853801,
"grad_norm": 1.0546875,
"learning_rate": 0.000421446342545985,
"loss": 5.9873,
"mean_token_accuracy": 0.1680728331208229,
"num_tokens": 7645209.0,
"step": 3070
},
{
"entropy": 6.1912548542022705,
"epoch": 3.5964912280701755,
"grad_norm": 1.0390625,
"learning_rate": 0.00042109016451364933,
"loss": 6.0783,
"mean_token_accuracy": 0.16205669492483138,
"num_tokens": 7657347.0,
"step": 3075
},
{
"entropy": 6.325735664367675,
"epoch": 3.60233918128655,
"grad_norm": 0.9375,
"learning_rate": 0.00042073335243952354,
"loss": 6.027,
"mean_token_accuracy": 0.15933430939912796,
"num_tokens": 7669593.0,
"step": 3080
},
{
"entropy": 6.1051122665405275,
"epoch": 3.608187134502924,
"grad_norm": 0.9453125,
"learning_rate": 0.0004203759078721979,
"loss": 6.0559,
"mean_token_accuracy": 0.16100477278232575,
"num_tokens": 7682548.0,
"step": 3085
},
{
"entropy": 6.241509819030762,
"epoch": 3.6140350877192984,
"grad_norm": 0.97265625,
"learning_rate": 0.0004200178323630072,
"loss": 6.0557,
"mean_token_accuracy": 0.16582066863775252,
"num_tokens": 7694554.0,
"step": 3090
},
{
"entropy": 6.2057740688323975,
"epoch": 3.6198830409356724,
"grad_norm": 0.96875,
"learning_rate": 0.00041965912746602495,
"loss": 6.1016,
"mean_token_accuracy": 0.16551845520734787,
"num_tokens": 7707747.0,
"step": 3095
},
{
"entropy": 6.197789335250855,
"epoch": 3.625730994152047,
"grad_norm": 0.9375,
"learning_rate": 0.00041929979473805606,
"loss": 6.0544,
"mean_token_accuracy": 0.1695205733180046,
"num_tokens": 7719487.0,
"step": 3100
},
{
"entropy": 6.273909950256348,
"epoch": 3.6315789473684212,
"grad_norm": 1.03125,
"learning_rate": 0.00041893983573863044,
"loss": 6.0786,
"mean_token_accuracy": 0.16118555665016174,
"num_tokens": 7732531.0,
"step": 3105
},
{
"entropy": 6.159653520584106,
"epoch": 3.6374269005847952,
"grad_norm": 0.9765625,
"learning_rate": 0.00041857925202999586,
"loss": 6.0041,
"mean_token_accuracy": 0.17146434932947158,
"num_tokens": 7745034.0,
"step": 3110
},
{
"entropy": 6.192782783508301,
"epoch": 3.6432748538011697,
"grad_norm": 0.94921875,
"learning_rate": 0.0004182180451771115,
"loss": 6.0088,
"mean_token_accuracy": 0.16949553042650223,
"num_tokens": 7757442.0,
"step": 3115
},
{
"entropy": 6.137195301055908,
"epoch": 3.6491228070175437,
"grad_norm": 1.125,
"learning_rate": 0.0004178562167476409,
"loss": 6.0249,
"mean_token_accuracy": 0.1661702498793602,
"num_tokens": 7770358.0,
"step": 3120
},
{
"entropy": 6.1444440364837645,
"epoch": 3.654970760233918,
"grad_norm": 0.91015625,
"learning_rate": 0.00041749376831194565,
"loss": 6.016,
"mean_token_accuracy": 0.16683562994003295,
"num_tokens": 7783611.0,
"step": 3125
},
{
"entropy": 6.1328047752380375,
"epoch": 3.6608187134502925,
"grad_norm": 1.0546875,
"learning_rate": 0.0004171307014430777,
"loss": 6.0074,
"mean_token_accuracy": 0.167020221054554,
"num_tokens": 7795522.0,
"step": 3130
},
{
"entropy": 6.2084015846252445,
"epoch": 3.6666666666666665,
"grad_norm": 1.0390625,
"learning_rate": 0.00041676701771677343,
"loss": 5.9844,
"mean_token_accuracy": 0.1737287938594818,
"num_tokens": 7806801.0,
"step": 3135
},
{
"entropy": 6.178243112564087,
"epoch": 3.672514619883041,
"grad_norm": 0.9921875,
"learning_rate": 0.0004164027187114463,
"loss": 6.0806,
"mean_token_accuracy": 0.1616395190358162,
"num_tokens": 7821084.0,
"step": 3140
},
{
"entropy": 6.021677923202515,
"epoch": 3.678362573099415,
"grad_norm": 0.99609375,
"learning_rate": 0.00041603780600818,
"loss": 5.8247,
"mean_token_accuracy": 0.1877183049917221,
"num_tokens": 7834065.0,
"step": 3145
},
{
"entropy": 6.161631917953491,
"epoch": 3.6842105263157894,
"grad_norm": 0.96875,
"learning_rate": 0.0004156722811907219,
"loss": 6.0087,
"mean_token_accuracy": 0.17382322400808334,
"num_tokens": 7846378.0,
"step": 3150
},
{
"entropy": 6.133734512329101,
"epoch": 3.690058479532164,
"grad_norm": 1.09375,
"learning_rate": 0.00041530614584547594,
"loss": 6.0186,
"mean_token_accuracy": 0.16601720899343492,
"num_tokens": 7858933.0,
"step": 3155
},
{
"entropy": 6.096647024154663,
"epoch": 3.6959064327485383,
"grad_norm": 0.9921875,
"learning_rate": 0.00041493940156149577,
"loss": 5.8664,
"mean_token_accuracy": 0.17515315264463424,
"num_tokens": 7870408.0,
"step": 3160
},
{
"entropy": 6.2309386253356935,
"epoch": 3.7017543859649122,
"grad_norm": 1.0234375,
"learning_rate": 0.000414572049930478,
"loss": 6.04,
"mean_token_accuracy": 0.16121004149317741,
"num_tokens": 7882778.0,
"step": 3165
},
{
"entropy": 6.092856693267822,
"epoch": 3.7076023391812867,
"grad_norm": 1.0078125,
"learning_rate": 0.00041420409254675465,
"loss": 6.0009,
"mean_token_accuracy": 0.16824234873056412,
"num_tokens": 7895169.0,
"step": 3170
},
{
"entropy": 6.192110013961792,
"epoch": 3.7134502923976607,
"grad_norm": 0.91796875,
"learning_rate": 0.0004138355310072876,
"loss": 6.058,
"mean_token_accuracy": 0.16652755290269852,
"num_tokens": 7908607.0,
"step": 3175
},
{
"entropy": 6.155030250549316,
"epoch": 3.719298245614035,
"grad_norm": 0.9453125,
"learning_rate": 0.00041346636691166015,
"loss": 6.0189,
"mean_token_accuracy": 0.16947076171636583,
"num_tokens": 7922269.0,
"step": 3180
},
{
"entropy": 6.127139711380005,
"epoch": 3.7251461988304095,
"grad_norm": 0.953125,
"learning_rate": 0.00041309660186207093,
"loss": 5.9659,
"mean_token_accuracy": 0.17107198536396026,
"num_tokens": 7935205.0,
"step": 3185
},
{
"entropy": 6.166498613357544,
"epoch": 3.7309941520467835,
"grad_norm": 1.0703125,
"learning_rate": 0.00041272623746332687,
"loss": 6.0103,
"mean_token_accuracy": 0.16744403094053267,
"num_tokens": 7947970.0,
"step": 3190
},
{
"entropy": 5.9714654922485355,
"epoch": 3.736842105263158,
"grad_norm": 1.015625,
"learning_rate": 0.00041235527532283603,
"loss": 5.8698,
"mean_token_accuracy": 0.18125962764024733,
"num_tokens": 7961978.0,
"step": 3195
},
{
"entropy": 6.233316802978516,
"epoch": 3.742690058479532,
"grad_norm": 0.9921875,
"learning_rate": 0.0004119837170506005,
"loss": 6.0334,
"mean_token_accuracy": 0.16853988766670228,
"num_tokens": 7974708.0,
"step": 3200
},
{
"entropy": 6.168910121917724,
"epoch": 3.7485380116959064,
"grad_norm": 1.0859375,
"learning_rate": 0.00041161156425921004,
"loss": 6.0292,
"mean_token_accuracy": 0.17343229949474334,
"num_tokens": 7986179.0,
"step": 3205
},
{
"entropy": 6.101172685623169,
"epoch": 3.754385964912281,
"grad_norm": 1.0625,
"learning_rate": 0.00041123881856383436,
"loss": 6.0503,
"mean_token_accuracy": 0.16954441964626313,
"num_tokens": 7997816.0,
"step": 3210
},
{
"entropy": 6.183773136138916,
"epoch": 3.760233918128655,
"grad_norm": 1.0859375,
"learning_rate": 0.0004108654815822165,
"loss": 5.968,
"mean_token_accuracy": 0.16754042357206345,
"num_tokens": 8009407.0,
"step": 3215
},
{
"entropy": 6.162422847747803,
"epoch": 3.7660818713450293,
"grad_norm": 1.0234375,
"learning_rate": 0.0004104915549346658,
"loss": 6.0512,
"mean_token_accuracy": 0.15713782012462615,
"num_tokens": 8021446.0,
"step": 3220
},
{
"entropy": 6.199100065231323,
"epoch": 3.7719298245614032,
"grad_norm": 0.98828125,
"learning_rate": 0.00041011704024405065,
"loss": 6.0742,
"mean_token_accuracy": 0.16481891125440598,
"num_tokens": 8035219.0,
"step": 3225
},
{
"entropy": 6.150408506393433,
"epoch": 3.7777777777777777,
"grad_norm": 1.09375,
"learning_rate": 0.00040974193913579174,
"loss": 5.8648,
"mean_token_accuracy": 0.1882886365056038,
"num_tokens": 8047619.0,
"step": 3230
},
{
"entropy": 6.208406400680542,
"epoch": 3.783625730994152,
"grad_norm": 1.0703125,
"learning_rate": 0.0004093662532378547,
"loss": 6.0853,
"mean_token_accuracy": 0.16479384005069733,
"num_tokens": 8059241.0,
"step": 3235
},
{
"entropy": 6.1294066429138185,
"epoch": 3.7894736842105265,
"grad_norm": 1.015625,
"learning_rate": 0.0004089899841807433,
"loss": 6.02,
"mean_token_accuracy": 0.16831666529178618,
"num_tokens": 8071543.0,
"step": 3240
},
{
"entropy": 6.220297908782959,
"epoch": 3.7953216374269005,
"grad_norm": 0.953125,
"learning_rate": 0.00040861313359749217,
"loss": 6.058,
"mean_token_accuracy": 0.1679780513048172,
"num_tokens": 8083515.0,
"step": 3245
},
{
"entropy": 6.077556133270264,
"epoch": 3.801169590643275,
"grad_norm": 0.9140625,
"learning_rate": 0.00040823570312366005,
"loss": 5.997,
"mean_token_accuracy": 0.1737971380352974,
"num_tokens": 8095703.0,
"step": 3250
},
{
"entropy": 6.202634239196778,
"epoch": 3.807017543859649,
"grad_norm": 0.9453125,
"learning_rate": 0.000407857694397322,
"loss": 6.1066,
"mean_token_accuracy": 0.16334267556667328,
"num_tokens": 8108285.0,
"step": 3255
},
{
"entropy": 6.145488929748535,
"epoch": 3.8128654970760234,
"grad_norm": 1.015625,
"learning_rate": 0.0004074791090590632,
"loss": 6.0245,
"mean_token_accuracy": 0.16463562101125717,
"num_tokens": 8120943.0,
"step": 3260
},
{
"entropy": 6.164313459396363,
"epoch": 3.818713450292398,
"grad_norm": 1.0234375,
"learning_rate": 0.0004070999487519711,
"loss": 6.0444,
"mean_token_accuracy": 0.16274773925542832,
"num_tokens": 8133086.0,
"step": 3265
},
{
"entropy": 6.257319402694702,
"epoch": 3.824561403508772,
"grad_norm": 0.92578125,
"learning_rate": 0.00040672021512162864,
"loss": 6.0748,
"mean_token_accuracy": 0.1645069733262062,
"num_tokens": 8147320.0,
"step": 3270
},
{
"entropy": 6.1589056015014645,
"epoch": 3.8304093567251463,
"grad_norm": 1.0078125,
"learning_rate": 0.000406339909816107,
"loss": 6.0346,
"mean_token_accuracy": 0.16649759113788604,
"num_tokens": 8160796.0,
"step": 3275
},
{
"entropy": 6.223127174377441,
"epoch": 3.8362573099415203,
"grad_norm": 0.93359375,
"learning_rate": 0.0004059590344859584,
"loss": 5.9731,
"mean_token_accuracy": 0.17208759486675262,
"num_tokens": 8173087.0,
"step": 3280
},
{
"entropy": 6.056473875045777,
"epoch": 3.8421052631578947,
"grad_norm": 1.0546875,
"learning_rate": 0.0004055775907842092,
"loss": 5.9515,
"mean_token_accuracy": 0.17173496931791304,
"num_tokens": 8185274.0,
"step": 3285
},
{
"entropy": 6.16464786529541,
"epoch": 3.847953216374269,
"grad_norm": 0.9296875,
"learning_rate": 0.0004051955803663523,
"loss": 6.0159,
"mean_token_accuracy": 0.17173873335123063,
"num_tokens": 8197753.0,
"step": 3290
},
{
"entropy": 6.142757940292358,
"epoch": 3.853801169590643,
"grad_norm": 0.9296875,
"learning_rate": 0.0004048130048903404,
"loss": 6.0139,
"mean_token_accuracy": 0.1693773850798607,
"num_tokens": 8211882.0,
"step": 3295
},
{
"entropy": 6.065456104278565,
"epoch": 3.8596491228070176,
"grad_norm": 0.98828125,
"learning_rate": 0.0004044298660165786,
"loss": 5.8779,
"mean_token_accuracy": 0.18270704597234727,
"num_tokens": 8225089.0,
"step": 3300
},
{
"entropy": 6.1357215404510494,
"epoch": 3.8654970760233915,
"grad_norm": 1.15625,
"learning_rate": 0.00040404616540791683,
"loss": 6.0722,
"mean_token_accuracy": 0.1639912948012352,
"num_tokens": 8238808.0,
"step": 3305
},
{
"entropy": 6.1387238025665285,
"epoch": 3.871345029239766,
"grad_norm": 0.9609375,
"learning_rate": 0.0004036619047296435,
"loss": 5.9892,
"mean_token_accuracy": 0.17460379153490066,
"num_tokens": 8252482.0,
"step": 3310
},
{
"entropy": 6.097236680984497,
"epoch": 3.8771929824561404,
"grad_norm": 1.0,
"learning_rate": 0.0004032770856494772,
"loss": 6.0369,
"mean_token_accuracy": 0.16676513254642486,
"num_tokens": 8264232.0,
"step": 3315
},
{
"entropy": 6.1821564674377445,
"epoch": 3.883040935672515,
"grad_norm": 0.9453125,
"learning_rate": 0.00040289170983756075,
"loss": 6.011,
"mean_token_accuracy": 0.165736885368824,
"num_tokens": 8276784.0,
"step": 3320
},
{
"entropy": 6.151600503921509,
"epoch": 3.888888888888889,
"grad_norm": 1.203125,
"learning_rate": 0.0004025057789664524,
"loss": 5.957,
"mean_token_accuracy": 0.17464775294065477,
"num_tokens": 8287887.0,
"step": 3325
},
{
"entropy": 6.010442018508911,
"epoch": 3.8947368421052633,
"grad_norm": 1.0,
"learning_rate": 0.0004021192947111201,
"loss": 5.796,
"mean_token_accuracy": 0.18555550277233124,
"num_tokens": 8301258.0,
"step": 3330
},
{
"entropy": 6.107139253616333,
"epoch": 3.9005847953216373,
"grad_norm": 1.34375,
"learning_rate": 0.00040173225874893305,
"loss": 6.0069,
"mean_token_accuracy": 0.16914664655923844,
"num_tokens": 8313520.0,
"step": 3335
},
{
"entropy": 6.31382303237915,
"epoch": 3.9064327485380117,
"grad_norm": 1.1171875,
"learning_rate": 0.00040134467275965515,
"loss": 6.0714,
"mean_token_accuracy": 0.1644605204463005,
"num_tokens": 8325597.0,
"step": 3340
},
{
"entropy": 6.151138877868652,
"epoch": 3.912280701754386,
"grad_norm": 0.99609375,
"learning_rate": 0.0004009565384254374,
"loss": 6.1056,
"mean_token_accuracy": 0.1639931857585907,
"num_tokens": 8337449.0,
"step": 3345
},
{
"entropy": 6.155855703353882,
"epoch": 3.91812865497076,
"grad_norm": 1.0234375,
"learning_rate": 0.00040056785743081065,
"loss": 6.0161,
"mean_token_accuracy": 0.16946520656347275,
"num_tokens": 8348802.0,
"step": 3350
},
{
"entropy": 6.143162584304809,
"epoch": 3.9239766081871346,
"grad_norm": 1.0390625,
"learning_rate": 0.0004001786314626783,
"loss": 6.0072,
"mean_token_accuracy": 0.16525934636592865,
"num_tokens": 8360284.0,
"step": 3355
},
{
"entropy": 6.155442380905152,
"epoch": 3.9298245614035086,
"grad_norm": 1.1171875,
"learning_rate": 0.0003997888622103088,
"loss": 6.0452,
"mean_token_accuracy": 0.16701786667108537,
"num_tokens": 8372080.0,
"step": 3360
},
{
"entropy": 6.2178631782531735,
"epoch": 3.935672514619883,
"grad_norm": 0.984375,
"learning_rate": 0.0003993985513653289,
"loss": 5.9903,
"mean_token_accuracy": 0.17290984988212585,
"num_tokens": 8385178.0,
"step": 3365
},
{
"entropy": 6.099476051330567,
"epoch": 3.9415204678362574,
"grad_norm": 0.99609375,
"learning_rate": 0.0003990077006217155,
"loss": 5.9605,
"mean_token_accuracy": 0.17520292848348618,
"num_tokens": 8397735.0,
"step": 3370
},
{
"entropy": 6.166955423355103,
"epoch": 3.9473684210526314,
"grad_norm": 1.0234375,
"learning_rate": 0.000398616311675789,
"loss": 6.0633,
"mean_token_accuracy": 0.16438339948654174,
"num_tokens": 8409916.0,
"step": 3375
},
{
"entropy": 6.2152971744537355,
"epoch": 3.953216374269006,
"grad_norm": 1.03125,
"learning_rate": 0.00039822438622620523,
"loss": 6.0577,
"mean_token_accuracy": 0.1653839096426964,
"num_tokens": 8421883.0,
"step": 3380
},
{
"entropy": 6.050079822540283,
"epoch": 3.95906432748538,
"grad_norm": 1.046875,
"learning_rate": 0.00039783192597394896,
"loss": 5.9195,
"mean_token_accuracy": 0.18110269755125047,
"num_tokens": 8433610.0,
"step": 3385
},
{
"entropy": 6.123357248306275,
"epoch": 3.9649122807017543,
"grad_norm": 1.0078125,
"learning_rate": 0.00039743893262232584,
"loss": 5.9951,
"mean_token_accuracy": 0.16854868680238724,
"num_tokens": 8446194.0,
"step": 3390
},
{
"entropy": 6.1859273433685305,
"epoch": 3.9707602339181287,
"grad_norm": 0.984375,
"learning_rate": 0.0003970454078769551,
"loss": 5.9556,
"mean_token_accuracy": 0.1772779792547226,
"num_tokens": 8458846.0,
"step": 3395
},
{
"entropy": 6.08966031074524,
"epoch": 3.976608187134503,
"grad_norm": 1.015625,
"learning_rate": 0.0003966513534457623,
"loss": 5.974,
"mean_token_accuracy": 0.1729067400097847,
"num_tokens": 8470087.0,
"step": 3400
},
{
"entropy": 6.108100509643554,
"epoch": 3.982456140350877,
"grad_norm": 1.015625,
"learning_rate": 0.0003962567710389721,
"loss": 6.0136,
"mean_token_accuracy": 0.1683551177382469,
"num_tokens": 8481293.0,
"step": 3405
},
{
"entropy": 6.216971588134766,
"epoch": 3.9883040935672516,
"grad_norm": 1.0625,
"learning_rate": 0.00039586166236910033,
"loss": 6.0394,
"mean_token_accuracy": 0.17632750272750855,
"num_tokens": 8493376.0,
"step": 3410
},
{
"entropy": 6.0278932571411135,
"epoch": 3.9941520467836256,
"grad_norm": 1.0234375,
"learning_rate": 0.0003954660291509469,
"loss": 5.9332,
"mean_token_accuracy": 0.1720741868019104,
"num_tokens": 8506132.0,
"step": 3415
},
{
"entropy": 6.14831428527832,
"epoch": 4.0,
"grad_norm": 1.0859375,
"learning_rate": 0.00039506987310158854,
"loss": 6.0041,
"mean_token_accuracy": 0.16918612867593766,
"num_tokens": 8517936.0,
"step": 3420
},
{
"entropy": 6.20543098449707,
"epoch": 4.005847953216374,
"grad_norm": 0.96875,
"learning_rate": 0.00039467319594037076,
"loss": 5.6426,
"mean_token_accuracy": 0.17536057084798812,
"num_tokens": 8529863.0,
"step": 3425
},
{
"entropy": 6.076360750198364,
"epoch": 4.011695906432749,
"grad_norm": 0.89453125,
"learning_rate": 0.0003942759993889009,
"loss": 5.6514,
"mean_token_accuracy": 0.17822496145963668,
"num_tokens": 8543621.0,
"step": 3430
},
{
"entropy": 6.092388486862182,
"epoch": 4.017543859649122,
"grad_norm": 1.0859375,
"learning_rate": 0.00039387828517104044,
"loss": 5.6223,
"mean_token_accuracy": 0.1877385839819908,
"num_tokens": 8557865.0,
"step": 3435
},
{
"entropy": 6.057973623275757,
"epoch": 4.023391812865497,
"grad_norm": 0.984375,
"learning_rate": 0.00039348005501289775,
"loss": 5.553,
"mean_token_accuracy": 0.18458822071552278,
"num_tokens": 8570203.0,
"step": 3440
},
{
"entropy": 5.985939025878906,
"epoch": 4.029239766081871,
"grad_norm": 0.93359375,
"learning_rate": 0.00039308131064282016,
"loss": 5.6327,
"mean_token_accuracy": 0.19060563445091247,
"num_tokens": 8582638.0,
"step": 3445
},
{
"entropy": 6.1293745040893555,
"epoch": 4.035087719298246,
"grad_norm": 0.984375,
"learning_rate": 0.0003926820537913868,
"loss": 5.7373,
"mean_token_accuracy": 0.17999661415815355,
"num_tokens": 8594973.0,
"step": 3450
},
{
"entropy": 6.0812681198120115,
"epoch": 4.04093567251462,
"grad_norm": 0.97265625,
"learning_rate": 0.0003922822861914012,
"loss": 5.5753,
"mean_token_accuracy": 0.18953726440668106,
"num_tokens": 8607216.0,
"step": 3455
},
{
"entropy": 6.141413164138794,
"epoch": 4.046783625730994,
"grad_norm": 1.0078125,
"learning_rate": 0.0003918820095778832,
"loss": 5.7928,
"mean_token_accuracy": 0.17498659491539,
"num_tokens": 8620833.0,
"step": 3460
},
{
"entropy": 6.109050273895264,
"epoch": 4.052631578947368,
"grad_norm": 0.94921875,
"learning_rate": 0.00039148122568806215,
"loss": 5.636,
"mean_token_accuracy": 0.19257341623306273,
"num_tokens": 8632931.0,
"step": 3465
},
{
"entropy": 5.979008150100708,
"epoch": 4.058479532163743,
"grad_norm": 1.046875,
"learning_rate": 0.0003910799362613688,
"loss": 5.7074,
"mean_token_accuracy": 0.1811279296875,
"num_tokens": 8644226.0,
"step": 3470
},
{
"entropy": 6.032506084442138,
"epoch": 4.064327485380117,
"grad_norm": 1.0546875,
"learning_rate": 0.00039067814303942806,
"loss": 5.5335,
"mean_token_accuracy": 0.20319486856460572,
"num_tokens": 8656569.0,
"step": 3475
},
{
"entropy": 5.9702965259552006,
"epoch": 4.0701754385964914,
"grad_norm": 1.0546875,
"learning_rate": 0.00039027584776605136,
"loss": 5.5479,
"mean_token_accuracy": 0.19039100855588914,
"num_tokens": 8668077.0,
"step": 3480
},
{
"entropy": 6.046207046508789,
"epoch": 4.076023391812866,
"grad_norm": 1.0078125,
"learning_rate": 0.00038987305218722904,
"loss": 5.6225,
"mean_token_accuracy": 0.18301156759262086,
"num_tokens": 8680227.0,
"step": 3485
},
{
"entropy": 6.139988803863526,
"epoch": 4.081871345029239,
"grad_norm": 1.0234375,
"learning_rate": 0.0003894697580511226,
"loss": 5.7198,
"mean_token_accuracy": 0.1793661504983902,
"num_tokens": 8692354.0,
"step": 3490
},
{
"entropy": 6.074919605255127,
"epoch": 4.087719298245614,
"grad_norm": 1.0,
"learning_rate": 0.0003890659671080579,
"loss": 5.6725,
"mean_token_accuracy": 0.1717061623930931,
"num_tokens": 8704634.0,
"step": 3495
},
{
"entropy": 6.088999891281128,
"epoch": 4.093567251461988,
"grad_norm": 1.0390625,
"learning_rate": 0.0003886616811105162,
"loss": 5.727,
"mean_token_accuracy": 0.17501896768808364,
"num_tokens": 8717253.0,
"step": 3500
},
{
"epoch": 4.093567251461988,
"eval_entropy": 6.04509066410121,
"eval_loss": 6.6196184158325195,
"eval_mean_token_accuracy": 0.1474711267294082,
"eval_num_tokens": 8717253.0,
"eval_runtime": 2.5223,
"eval_samples_per_second": 1073.236,
"eval_steps_per_second": 134.402,
"step": 3500
},
{
"entropy": 6.131563472747803,
"epoch": 4.099415204678363,
"grad_norm": 1.03125,
"learning_rate": 0.00038825690181312793,
"loss": 5.71,
"mean_token_accuracy": 0.17986170649528505,
"num_tokens": 8729840.0,
"step": 3505
},
{
"entropy": 5.996961212158203,
"epoch": 4.105263157894737,
"grad_norm": 1.046875,
"learning_rate": 0.00038785163097266424,
"loss": 5.5693,
"mean_token_accuracy": 0.19463008642196655,
"num_tokens": 8742065.0,
"step": 3510
},
{
"entropy": 6.0744704246521,
"epoch": 4.111111111111111,
"grad_norm": 1.0234375,
"learning_rate": 0.0003874458703480296,
"loss": 5.7101,
"mean_token_accuracy": 0.18273295611143112,
"num_tokens": 8754113.0,
"step": 3515
},
{
"entropy": 6.151042890548706,
"epoch": 4.116959064327485,
"grad_norm": 1.0390625,
"learning_rate": 0.0003870396217002542,
"loss": 5.7748,
"mean_token_accuracy": 0.1688615620136261,
"num_tokens": 8767255.0,
"step": 3520
},
{
"entropy": 6.053809022903442,
"epoch": 4.12280701754386,
"grad_norm": 0.984375,
"learning_rate": 0.0003866328867924864,
"loss": 5.6875,
"mean_token_accuracy": 0.1782376691699028,
"num_tokens": 8781010.0,
"step": 3525
},
{
"entropy": 6.117657995223999,
"epoch": 4.128654970760234,
"grad_norm": 1.015625,
"learning_rate": 0.0003862256673899848,
"loss": 5.7146,
"mean_token_accuracy": 0.17905851751565932,
"num_tokens": 8794393.0,
"step": 3530
},
{
"entropy": 6.107480478286743,
"epoch": 4.1345029239766085,
"grad_norm": 0.98046875,
"learning_rate": 0.0003858179652601108,
"loss": 5.7905,
"mean_token_accuracy": 0.1684487909078598,
"num_tokens": 8806496.0,
"step": 3535
},
{
"entropy": 6.0534919738769535,
"epoch": 4.140350877192983,
"grad_norm": 1.0234375,
"learning_rate": 0.00038540978217232086,
"loss": 5.5891,
"mean_token_accuracy": 0.18708058148622514,
"num_tokens": 8818411.0,
"step": 3540
},
{
"entropy": 6.09735221862793,
"epoch": 4.146198830409356,
"grad_norm": 1.0625,
"learning_rate": 0.00038500111989815894,
"loss": 5.6859,
"mean_token_accuracy": 0.18041049540042878,
"num_tokens": 8829714.0,
"step": 3545
},
{
"entropy": 6.025902128219604,
"epoch": 4.152046783625731,
"grad_norm": 1.078125,
"learning_rate": 0.00038459198021124853,
"loss": 5.6602,
"mean_token_accuracy": 0.1812974199652672,
"num_tokens": 8842393.0,
"step": 3550
},
{
"entropy": 6.102361488342285,
"epoch": 4.157894736842105,
"grad_norm": 1.03125,
"learning_rate": 0.0003841823648872852,
"loss": 5.6762,
"mean_token_accuracy": 0.17634568512439727,
"num_tokens": 8855263.0,
"step": 3555
},
{
"entropy": 6.0864283561706545,
"epoch": 4.16374269005848,
"grad_norm": 0.984375,
"learning_rate": 0.0003837722757040289,
"loss": 5.7299,
"mean_token_accuracy": 0.1759195253252983,
"num_tokens": 8868220.0,
"step": 3560
},
{
"entropy": 6.062915229797364,
"epoch": 4.169590643274854,
"grad_norm": 1.1171875,
"learning_rate": 0.0003833617144412961,
"loss": 5.6719,
"mean_token_accuracy": 0.18289318531751633,
"num_tokens": 8879106.0,
"step": 3565
},
{
"entropy": 6.049778890609741,
"epoch": 4.175438596491228,
"grad_norm": 0.91796875,
"learning_rate": 0.0003829506828809521,
"loss": 5.7548,
"mean_token_accuracy": 0.18035261631011962,
"num_tokens": 8891358.0,
"step": 3570
},
{
"entropy": 6.1216654777526855,
"epoch": 4.181286549707602,
"grad_norm": 1.0625,
"learning_rate": 0.0003825391828069032,
"loss": 5.6874,
"mean_token_accuracy": 0.1796052187681198,
"num_tokens": 8904327.0,
"step": 3575
},
{
"entropy": 6.048942995071411,
"epoch": 4.187134502923977,
"grad_norm": 1.046875,
"learning_rate": 0.0003821272160050894,
"loss": 5.6369,
"mean_token_accuracy": 0.17855555713176727,
"num_tokens": 8916515.0,
"step": 3580
},
{
"entropy": 6.064371585845947,
"epoch": 4.192982456140351,
"grad_norm": 1.015625,
"learning_rate": 0.0003817147842634762,
"loss": 5.7288,
"mean_token_accuracy": 0.1770629495382309,
"num_tokens": 8929482.0,
"step": 3585
},
{
"entropy": 6.15021824836731,
"epoch": 4.1988304093567255,
"grad_norm": 0.94921875,
"learning_rate": 0.0003813018893720468,
"loss": 5.7785,
"mean_token_accuracy": 0.17122844159603118,
"num_tokens": 8942328.0,
"step": 3590
},
{
"entropy": 6.04944372177124,
"epoch": 4.204678362573099,
"grad_norm": 1.09375,
"learning_rate": 0.00038088853312279473,
"loss": 5.6907,
"mean_token_accuracy": 0.18117449432611465,
"num_tokens": 8955116.0,
"step": 3595
},
{
"entropy": 6.107272005081176,
"epoch": 4.2105263157894735,
"grad_norm": 1.109375,
"learning_rate": 0.0003804747173097157,
"loss": 5.7609,
"mean_token_accuracy": 0.17150648236274718,
"num_tokens": 8967459.0,
"step": 3600
},
{
"entropy": 6.060251331329345,
"epoch": 4.216374269005848,
"grad_norm": 1.0234375,
"learning_rate": 0.00038006044372880006,
"loss": 5.6946,
"mean_token_accuracy": 0.17851730585098266,
"num_tokens": 8980079.0,
"step": 3605
},
{
"entropy": 6.100224113464355,
"epoch": 4.222222222222222,
"grad_norm": 1.03125,
"learning_rate": 0.00037964571417802473,
"loss": 5.7074,
"mean_token_accuracy": 0.18233946561813355,
"num_tokens": 8992764.0,
"step": 3610
},
{
"entropy": 5.974664163589478,
"epoch": 4.228070175438597,
"grad_norm": 1.0859375,
"learning_rate": 0.00037923053045734595,
"loss": 5.5766,
"mean_token_accuracy": 0.1792639195919037,
"num_tokens": 9004904.0,
"step": 3615
},
{
"entropy": 6.193356609344482,
"epoch": 4.23391812865497,
"grad_norm": 1.0078125,
"learning_rate": 0.00037881489436869054,
"loss": 5.8193,
"mean_token_accuracy": 0.16851516664028168,
"num_tokens": 9018411.0,
"step": 3620
},
{
"entropy": 6.04724497795105,
"epoch": 4.239766081871345,
"grad_norm": 1.09375,
"learning_rate": 0.0003783988077159491,
"loss": 5.6485,
"mean_token_accuracy": 0.1867110773921013,
"num_tokens": 9030593.0,
"step": 3625
},
{
"entropy": 5.966316509246826,
"epoch": 4.245614035087719,
"grad_norm": 1.0703125,
"learning_rate": 0.00037798227230496754,
"loss": 5.6454,
"mean_token_accuracy": 0.18925793915987016,
"num_tokens": 9043715.0,
"step": 3630
},
{
"entropy": 5.970798063278198,
"epoch": 4.251461988304094,
"grad_norm": 0.98046875,
"learning_rate": 0.00037756528994353945,
"loss": 5.6019,
"mean_token_accuracy": 0.1878896102309227,
"num_tokens": 9056384.0,
"step": 3635
},
{
"entropy": 6.044772434234619,
"epoch": 4.257309941520468,
"grad_norm": 1.21875,
"learning_rate": 0.000377147862441398,
"loss": 5.7155,
"mean_token_accuracy": 0.17982163280248642,
"num_tokens": 9069444.0,
"step": 3640
},
{
"entropy": 6.037049388885498,
"epoch": 4.2631578947368425,
"grad_norm": 1.1171875,
"learning_rate": 0.00037672999161020873,
"loss": 5.6304,
"mean_token_accuracy": 0.17920852154493333,
"num_tokens": 9080933.0,
"step": 3645
},
{
"entropy": 6.066276741027832,
"epoch": 4.269005847953216,
"grad_norm": 1.0078125,
"learning_rate": 0.00037631167926356087,
"loss": 5.7132,
"mean_token_accuracy": 0.18188369870185853,
"num_tokens": 9093405.0,
"step": 3650
},
{
"entropy": 5.991379690170288,
"epoch": 4.2748538011695905,
"grad_norm": 1.0859375,
"learning_rate": 0.0003758929272169599,
"loss": 5.6826,
"mean_token_accuracy": 0.18282952010631562,
"num_tokens": 9105707.0,
"step": 3655
},
{
"entropy": 6.096354579925537,
"epoch": 4.280701754385965,
"grad_norm": 0.9765625,
"learning_rate": 0.00037547373728781996,
"loss": 5.6228,
"mean_token_accuracy": 0.1831882268190384,
"num_tokens": 9119476.0,
"step": 3660
},
{
"entropy": 6.009134292602539,
"epoch": 4.286549707602339,
"grad_norm": 1.0703125,
"learning_rate": 0.0003750541112954552,
"loss": 5.6144,
"mean_token_accuracy": 0.1871513307094574,
"num_tokens": 9131788.0,
"step": 3665
},
{
"entropy": 6.018839502334595,
"epoch": 4.292397660818714,
"grad_norm": 1.03125,
"learning_rate": 0.0003746340510610727,
"loss": 5.7242,
"mean_token_accuracy": 0.17679602056741714,
"num_tokens": 9144340.0,
"step": 3670
},
{
"entropy": 6.080672121047973,
"epoch": 4.298245614035087,
"grad_norm": 1.0390625,
"learning_rate": 0.00037421355840776396,
"loss": 5.6807,
"mean_token_accuracy": 0.18258961290121078,
"num_tokens": 9156757.0,
"step": 3675
},
{
"entropy": 5.981054782867432,
"epoch": 4.304093567251462,
"grad_norm": 1.078125,
"learning_rate": 0.0003737926351604971,
"loss": 5.6653,
"mean_token_accuracy": 0.1839475855231285,
"num_tokens": 9169975.0,
"step": 3680
},
{
"entropy": 6.0798088073730465,
"epoch": 4.309941520467836,
"grad_norm": 1.0390625,
"learning_rate": 0.00037337128314610926,
"loss": 5.6903,
"mean_token_accuracy": 0.1850095272064209,
"num_tokens": 9181891.0,
"step": 3685
},
{
"entropy": 6.070284843444824,
"epoch": 4.315789473684211,
"grad_norm": 1.0703125,
"learning_rate": 0.0003729495041932984,
"loss": 5.7177,
"mean_token_accuracy": 0.17408514022827148,
"num_tokens": 9194068.0,
"step": 3690
},
{
"entropy": 6.063306093215942,
"epoch": 4.321637426900585,
"grad_norm": 1.1015625,
"learning_rate": 0.0003725273001326155,
"loss": 5.7577,
"mean_token_accuracy": 0.1726976603269577,
"num_tokens": 9205530.0,
"step": 3695
},
{
"entropy": 6.020684671401978,
"epoch": 4.3274853801169595,
"grad_norm": 0.99609375,
"learning_rate": 0.0003721046727964565,
"loss": 5.6408,
"mean_token_accuracy": 0.18605955243110656,
"num_tokens": 9218444.0,
"step": 3700
},
{
"entropy": 6.033743143081665,
"epoch": 4.333333333333333,
"grad_norm": 1.0546875,
"learning_rate": 0.00037168162401905416,
"loss": 5.7582,
"mean_token_accuracy": 0.18215816020965575,
"num_tokens": 9229507.0,
"step": 3705
},
{
"entropy": 6.104024362564087,
"epoch": 4.3391812865497075,
"grad_norm": 1.0703125,
"learning_rate": 0.00037125815563647063,
"loss": 5.8004,
"mean_token_accuracy": 0.17324102222919463,
"num_tokens": 9242128.0,
"step": 3710
},
{
"entropy": 6.0390842914581295,
"epoch": 4.345029239766082,
"grad_norm": 0.96875,
"learning_rate": 0.00037083426948658903,
"loss": 5.7639,
"mean_token_accuracy": 0.1721993491053581,
"num_tokens": 9255598.0,
"step": 3715
},
{
"entropy": 6.081149435043335,
"epoch": 4.350877192982456,
"grad_norm": 1.0625,
"learning_rate": 0.00037040996740910566,
"loss": 5.6934,
"mean_token_accuracy": 0.18470181822776793,
"num_tokens": 9267568.0,
"step": 3720
},
{
"entropy": 6.041148519515991,
"epoch": 4.356725146198831,
"grad_norm": 0.94140625,
"learning_rate": 0.000369985251245522,
"loss": 5.7304,
"mean_token_accuracy": 0.1785113885998726,
"num_tokens": 9280223.0,
"step": 3725
},
{
"entropy": 6.049468564987182,
"epoch": 4.362573099415204,
"grad_norm": 1.015625,
"learning_rate": 0.00036956012283913655,
"loss": 5.7991,
"mean_token_accuracy": 0.1769685611128807,
"num_tokens": 9292933.0,
"step": 3730
},
{
"entropy": 6.075206518173218,
"epoch": 4.368421052631579,
"grad_norm": 1.0,
"learning_rate": 0.00036913458403503715,
"loss": 5.7402,
"mean_token_accuracy": 0.1829718381166458,
"num_tokens": 9306739.0,
"step": 3735
},
{
"entropy": 6.09669451713562,
"epoch": 4.374269005847953,
"grad_norm": 1.140625,
"learning_rate": 0.0003687086366800927,
"loss": 5.6977,
"mean_token_accuracy": 0.17831959426403046,
"num_tokens": 9319151.0,
"step": 3740
},
{
"entropy": 6.053274154663086,
"epoch": 4.380116959064328,
"grad_norm": 1.046875,
"learning_rate": 0.0003682822826229453,
"loss": 5.7481,
"mean_token_accuracy": 0.17510512471199036,
"num_tokens": 9332035.0,
"step": 3745
},
{
"entropy": 6.107750606536865,
"epoch": 4.385964912280702,
"grad_norm": 1.1328125,
"learning_rate": 0.00036785552371400206,
"loss": 5.7919,
"mean_token_accuracy": 0.17232683897018433,
"num_tokens": 9345248.0,
"step": 3750
},
{
"entropy": 6.090496635437011,
"epoch": 4.391812865497076,
"grad_norm": 1.09375,
"learning_rate": 0.0003674283618054273,
"loss": 5.7551,
"mean_token_accuracy": 0.17803856134414672,
"num_tokens": 9357514.0,
"step": 3755
},
{
"entropy": 6.063120174407959,
"epoch": 4.39766081871345,
"grad_norm": 1.046875,
"learning_rate": 0.0003670007987511344,
"loss": 5.7602,
"mean_token_accuracy": 0.17122178375720978,
"num_tokens": 9368627.0,
"step": 3760
},
{
"entropy": 5.993347024917602,
"epoch": 4.4035087719298245,
"grad_norm": 0.90234375,
"learning_rate": 0.0003665728364067776,
"loss": 5.6898,
"mean_token_accuracy": 0.1826734200119972,
"num_tokens": 9380591.0,
"step": 3765
},
{
"entropy": 6.006692790985108,
"epoch": 4.409356725146199,
"grad_norm": 0.9921875,
"learning_rate": 0.00036614447662974413,
"loss": 5.6616,
"mean_token_accuracy": 0.1791582316160202,
"num_tokens": 9392873.0,
"step": 3770
},
{
"entropy": 6.137070274353027,
"epoch": 4.415204678362573,
"grad_norm": 1.0859375,
"learning_rate": 0.0003657157212791462,
"loss": 5.8051,
"mean_token_accuracy": 0.17032919973134994,
"num_tokens": 9404252.0,
"step": 3775
},
{
"entropy": 5.994381332397461,
"epoch": 4.421052631578947,
"grad_norm": 1.125,
"learning_rate": 0.0003652865722158128,
"loss": 5.7435,
"mean_token_accuracy": 0.18393605649471284,
"num_tokens": 9416091.0,
"step": 3780
},
{
"entropy": 6.039236211776734,
"epoch": 4.426900584795321,
"grad_norm": 1.046875,
"learning_rate": 0.00036485703130228147,
"loss": 5.6762,
"mean_token_accuracy": 0.18609912246465682,
"num_tokens": 9429913.0,
"step": 3785
},
{
"entropy": 6.082646417617798,
"epoch": 4.432748538011696,
"grad_norm": 1.0703125,
"learning_rate": 0.00036442710040279086,
"loss": 5.6597,
"mean_token_accuracy": 0.185782328248024,
"num_tokens": 9442413.0,
"step": 3790
},
{
"entropy": 5.84837589263916,
"epoch": 4.43859649122807,
"grad_norm": 1.1640625,
"learning_rate": 0.0003639967813832717,
"loss": 5.5634,
"mean_token_accuracy": 0.18899640589952468,
"num_tokens": 9453636.0,
"step": 3795
},
{
"entropy": 6.045081329345703,
"epoch": 4.444444444444445,
"grad_norm": 1.0859375,
"learning_rate": 0.0003635660761113394,
"loss": 5.6793,
"mean_token_accuracy": 0.18390674144029617,
"num_tokens": 9466577.0,
"step": 3800
},
{
"entropy": 5.990505218505859,
"epoch": 4.450292397660819,
"grad_norm": 0.9609375,
"learning_rate": 0.0003631349864562857,
"loss": 5.6833,
"mean_token_accuracy": 0.17791927754878997,
"num_tokens": 9479852.0,
"step": 3805
},
{
"entropy": 5.985594892501831,
"epoch": 4.456140350877193,
"grad_norm": 0.9765625,
"learning_rate": 0.0003627035142890708,
"loss": 5.6402,
"mean_token_accuracy": 0.17985960394144057,
"num_tokens": 9493373.0,
"step": 3810
},
{
"entropy": 6.017840957641601,
"epoch": 4.461988304093567,
"grad_norm": 1.09375,
"learning_rate": 0.0003622716614823147,
"loss": 5.7423,
"mean_token_accuracy": 0.18267811834812164,
"num_tokens": 9505793.0,
"step": 3815
},
{
"entropy": 6.0193885326385494,
"epoch": 4.4678362573099415,
"grad_norm": 1.0625,
"learning_rate": 0.0003618394299102896,
"loss": 5.7515,
"mean_token_accuracy": 0.17129353880882264,
"num_tokens": 9517810.0,
"step": 3820
},
{
"entropy": 6.03486180305481,
"epoch": 4.473684210526316,
"grad_norm": 1.1328125,
"learning_rate": 0.00036140682144891143,
"loss": 5.7345,
"mean_token_accuracy": 0.17498974353075028,
"num_tokens": 9529430.0,
"step": 3825
},
{
"entropy": 6.045903491973877,
"epoch": 4.47953216374269,
"grad_norm": 0.91015625,
"learning_rate": 0.00036097383797573205,
"loss": 5.7172,
"mean_token_accuracy": 0.1837750643491745,
"num_tokens": 9542385.0,
"step": 3830
},
{
"entropy": 6.040508556365967,
"epoch": 4.485380116959064,
"grad_norm": 1.046875,
"learning_rate": 0.00036054048136993075,
"loss": 5.6907,
"mean_token_accuracy": 0.1796013042330742,
"num_tokens": 9553955.0,
"step": 3835
},
{
"entropy": 6.1091564178466795,
"epoch": 4.491228070175438,
"grad_norm": 1.1015625,
"learning_rate": 0.00036010675351230616,
"loss": 5.7465,
"mean_token_accuracy": 0.17438559085130692,
"num_tokens": 9566494.0,
"step": 3840
},
{
"entropy": 5.956915283203125,
"epoch": 4.497076023391813,
"grad_norm": 0.98828125,
"learning_rate": 0.0003596726562852684,
"loss": 5.6609,
"mean_token_accuracy": 0.19354186207056046,
"num_tokens": 9579122.0,
"step": 3845
},
{
"entropy": 6.011682462692261,
"epoch": 4.502923976608187,
"grad_norm": 1.0234375,
"learning_rate": 0.00035923819157283074,
"loss": 5.683,
"mean_token_accuracy": 0.18062492311000825,
"num_tokens": 9592144.0,
"step": 3850
},
{
"entropy": 5.952674436569214,
"epoch": 4.508771929824562,
"grad_norm": 1.09375,
"learning_rate": 0.00035880336126060074,
"loss": 5.587,
"mean_token_accuracy": 0.1831655442714691,
"num_tokens": 9604533.0,
"step": 3855
},
{
"entropy": 6.050215864181519,
"epoch": 4.514619883040936,
"grad_norm": 1.0859375,
"learning_rate": 0.00035836816723577354,
"loss": 5.7574,
"mean_token_accuracy": 0.1809080123901367,
"num_tokens": 9617349.0,
"step": 3860
},
{
"entropy": 6.02703742980957,
"epoch": 4.52046783625731,
"grad_norm": 0.99609375,
"learning_rate": 0.0003579326113871222,
"loss": 5.7319,
"mean_token_accuracy": 0.17817693203687668,
"num_tokens": 9629599.0,
"step": 3865
},
{
"entropy": 6.010656070709229,
"epoch": 4.526315789473684,
"grad_norm": 1.0859375,
"learning_rate": 0.0003574966956049904,
"loss": 5.7111,
"mean_token_accuracy": 0.1806437462568283,
"num_tokens": 9642041.0,
"step": 3870
},
{
"entropy": 6.022445154190064,
"epoch": 4.5321637426900585,
"grad_norm": 1.09375,
"learning_rate": 0.00035706042178128397,
"loss": 5.7251,
"mean_token_accuracy": 0.17670760601758956,
"num_tokens": 9654796.0,
"step": 3875
},
{
"entropy": 6.047770309448242,
"epoch": 4.538011695906433,
"grad_norm": 1.0703125,
"learning_rate": 0.0003566237918094625,
"loss": 5.749,
"mean_token_accuracy": 0.18157323002815245,
"num_tokens": 9667211.0,
"step": 3880
},
{
"entropy": 5.989737796783447,
"epoch": 4.543859649122807,
"grad_norm": 1.0546875,
"learning_rate": 0.0003561868075845313,
"loss": 5.675,
"mean_token_accuracy": 0.18230662494897842,
"num_tokens": 9679526.0,
"step": 3885
},
{
"entropy": 6.093787622451782,
"epoch": 4.549707602339181,
"grad_norm": 1.0546875,
"learning_rate": 0.00035574947100303327,
"loss": 5.8498,
"mean_token_accuracy": 0.16826178431510924,
"num_tokens": 9691760.0,
"step": 3890
},
{
"entropy": 6.072186279296875,
"epoch": 4.555555555555555,
"grad_norm": 1.0859375,
"learning_rate": 0.00035531178396304083,
"loss": 5.7572,
"mean_token_accuracy": 0.1798931583762169,
"num_tokens": 9704154.0,
"step": 3895
},
{
"entropy": 5.930134582519531,
"epoch": 4.56140350877193,
"grad_norm": 1.1015625,
"learning_rate": 0.00035487374836414676,
"loss": 5.5537,
"mean_token_accuracy": 0.19115636497735977,
"num_tokens": 9715850.0,
"step": 3900
},
{
"entropy": 6.024199438095093,
"epoch": 4.567251461988304,
"grad_norm": 1.0234375,
"learning_rate": 0.00035443536610745707,
"loss": 5.7416,
"mean_token_accuracy": 0.17926808446645737,
"num_tokens": 9728202.0,
"step": 3905
},
{
"entropy": 6.115915679931641,
"epoch": 4.573099415204679,
"grad_norm": 0.9375,
"learning_rate": 0.00035399663909558226,
"loss": 5.7251,
"mean_token_accuracy": 0.17293728440999984,
"num_tokens": 9741363.0,
"step": 3910
},
{
"entropy": 5.976093006134033,
"epoch": 4.578947368421053,
"grad_norm": 0.9765625,
"learning_rate": 0.00035355756923262897,
"loss": 5.728,
"mean_token_accuracy": 0.17764360457658768,
"num_tokens": 9755231.0,
"step": 3915
},
{
"entropy": 5.962514877319336,
"epoch": 4.584795321637427,
"grad_norm": 1.046875,
"learning_rate": 0.0003531181584241919,
"loss": 5.5574,
"mean_token_accuracy": 0.18968022614717484,
"num_tokens": 9768972.0,
"step": 3920
},
{
"entropy": 6.0777302265167235,
"epoch": 4.590643274853801,
"grad_norm": 1.0859375,
"learning_rate": 0.0003526784085773455,
"loss": 5.7722,
"mean_token_accuracy": 0.17629178762435913,
"num_tokens": 9781356.0,
"step": 3925
},
{
"entropy": 6.000986051559448,
"epoch": 4.5964912280701755,
"grad_norm": 1.140625,
"learning_rate": 0.0003522383216006356,
"loss": 5.7163,
"mean_token_accuracy": 0.17624385207891463,
"num_tokens": 9793227.0,
"step": 3930
},
{
"entropy": 6.037758493423462,
"epoch": 4.60233918128655,
"grad_norm": 1.03125,
"learning_rate": 0.0003517978994040713,
"loss": 5.6977,
"mean_token_accuracy": 0.18110876828432082,
"num_tokens": 9805968.0,
"step": 3935
},
{
"entropy": 6.046218919754028,
"epoch": 4.6081871345029235,
"grad_norm": 1.0546875,
"learning_rate": 0.00035135714389911637,
"loss": 5.7008,
"mean_token_accuracy": 0.17963413000106812,
"num_tokens": 9817864.0,
"step": 3940
},
{
"entropy": 5.970970535278321,
"epoch": 4.614035087719298,
"grad_norm": 1.0625,
"learning_rate": 0.0003509160569986814,
"loss": 5.6923,
"mean_token_accuracy": 0.18651033341884612,
"num_tokens": 9831192.0,
"step": 3945
},
{
"entropy": 6.005720090866089,
"epoch": 4.619883040935672,
"grad_norm": 1.046875,
"learning_rate": 0.00035047464061711527,
"loss": 5.693,
"mean_token_accuracy": 0.1775913044810295,
"num_tokens": 9842813.0,
"step": 3950
},
{
"entropy": 6.057656860351562,
"epoch": 4.625730994152047,
"grad_norm": 1.0546875,
"learning_rate": 0.00035003289667019655,
"loss": 5.7267,
"mean_token_accuracy": 0.18199362605810165,
"num_tokens": 9854500.0,
"step": 3955
},
{
"entropy": 6.003658819198608,
"epoch": 4.631578947368421,
"grad_norm": 1.1015625,
"learning_rate": 0.0003495908270751257,
"loss": 5.6997,
"mean_token_accuracy": 0.18199258893728257,
"num_tokens": 9865729.0,
"step": 3960
},
{
"entropy": 6.078597784042358,
"epoch": 4.637426900584796,
"grad_norm": 1.0234375,
"learning_rate": 0.0003491484337505166,
"loss": 5.7519,
"mean_token_accuracy": 0.1757547900080681,
"num_tokens": 9878306.0,
"step": 3965
},
{
"entropy": 6.017028093338013,
"epoch": 4.643274853801169,
"grad_norm": 0.98828125,
"learning_rate": 0.00034870571861638785,
"loss": 5.7607,
"mean_token_accuracy": 0.18215884864330292,
"num_tokens": 9890384.0,
"step": 3970
},
{
"entropy": 6.031449842453003,
"epoch": 4.649122807017544,
"grad_norm": 1.046875,
"learning_rate": 0.00034826268359415487,
"loss": 5.7126,
"mean_token_accuracy": 0.18075830042362212,
"num_tokens": 9902960.0,
"step": 3975
},
{
"entropy": 5.995539712905884,
"epoch": 4.654970760233918,
"grad_norm": 1.046875,
"learning_rate": 0.0003478193306066215,
"loss": 5.6879,
"mean_token_accuracy": 0.1825384646654129,
"num_tokens": 9915143.0,
"step": 3980
},
{
"entropy": 6.048296976089477,
"epoch": 4.6608187134502925,
"grad_norm": 1.03125,
"learning_rate": 0.00034737566157797147,
"loss": 5.7958,
"mean_token_accuracy": 0.17306877970695494,
"num_tokens": 9928440.0,
"step": 3985
},
{
"entropy": 6.079747581481934,
"epoch": 4.666666666666667,
"grad_norm": 1.046875,
"learning_rate": 0.00034693167843376016,
"loss": 5.805,
"mean_token_accuracy": 0.17498603761196135,
"num_tokens": 9940973.0,
"step": 3990
},
{
"entropy": 5.9982061862945555,
"epoch": 4.6725146198830405,
"grad_norm": 1.140625,
"learning_rate": 0.00034648738310090634,
"loss": 5.6915,
"mean_token_accuracy": 0.18175050169229506,
"num_tokens": 9953433.0,
"step": 3995
},
{
"entropy": 5.9178807735443115,
"epoch": 4.678362573099415,
"grad_norm": 1.046875,
"learning_rate": 0.0003460427775076835,
"loss": 5.6034,
"mean_token_accuracy": 0.1913096770644188,
"num_tokens": 9964641.0,
"step": 4000
},
{
"epoch": 4.678362573099415,
"eval_entropy": 5.941208401964126,
"eval_loss": 6.58283805847168,
"eval_mean_token_accuracy": 0.14886031340488995,
"eval_num_tokens": 9964641.0,
"eval_runtime": 2.2746,
"eval_samples_per_second": 1190.11,
"eval_steps_per_second": 149.039,
"step": 4000
}
],
"logging_steps": 5,
"max_steps": 8540,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.4419789661952e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}