Files
rus-cyrl-10mb-after-ppt-Dp-…/checkpoint-7500/trainer_state.json
ModelHub XC 506b135ec4 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/rus-cyrl-10mb-after-ppt-Dp-10mb-ckpt500_seed10
Source: Original Platform
2026-09-28 01:09:25 +08:00

15200 lines
415 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.655126498002663,
"eval_steps": 500,
"global_step": 7500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 7.78931941986084,
"epoch": 0.004438526409232135,
"grad_norm": 1.0390625,
"learning_rate": 2e-06,
"loss": 7.4769,
"mean_token_accuracy": 0.08522442281246186,
"num_tokens": 10699.0,
"step": 5
},
{
"entropy": 7.787262725830078,
"epoch": 0.00887705281846427,
"grad_norm": 1.0546875,
"learning_rate": 4.5e-06,
"loss": 7.4824,
"mean_token_accuracy": 0.08313449285924435,
"num_tokens": 20868.0,
"step": 10
},
{
"entropy": 7.764151668548584,
"epoch": 0.013315579227696404,
"grad_norm": 1.046875,
"learning_rate": 7e-06,
"loss": 7.4352,
"mean_token_accuracy": 0.08592776954174042,
"num_tokens": 31565.0,
"step": 15
},
{
"entropy": 7.8020752429962155,
"epoch": 0.01775410563692854,
"grad_norm": 0.91796875,
"learning_rate": 9.5e-06,
"loss": 7.5052,
"mean_token_accuracy": 0.08421143889427185,
"num_tokens": 42396.0,
"step": 20
},
{
"entropy": 7.809156513214111,
"epoch": 0.022192632046160676,
"grad_norm": 1.015625,
"learning_rate": 1.2e-05,
"loss": 7.5029,
"mean_token_accuracy": 0.08358340412378311,
"num_tokens": 52422.0,
"step": 25
},
{
"entropy": 7.804666757583618,
"epoch": 0.02663115845539281,
"grad_norm": 1.0078125,
"learning_rate": 1.4500000000000002e-05,
"loss": 7.4415,
"mean_token_accuracy": 0.0846289798617363,
"num_tokens": 63167.0,
"step": 30
},
{
"entropy": 7.820871639251709,
"epoch": 0.031069684864624945,
"grad_norm": 0.94921875,
"learning_rate": 1.7000000000000003e-05,
"loss": 7.4654,
"mean_token_accuracy": 0.08765448182821274,
"num_tokens": 73620.0,
"step": 35
},
{
"entropy": 7.827526521682739,
"epoch": 0.03550821127385708,
"grad_norm": 0.9140625,
"learning_rate": 1.95e-05,
"loss": 7.3795,
"mean_token_accuracy": 0.08707336336374283,
"num_tokens": 83176.0,
"step": 40
},
{
"entropy": 7.789561748504639,
"epoch": 0.03994673768308921,
"grad_norm": 0.9921875,
"learning_rate": 2.2e-05,
"loss": 7.435,
"mean_token_accuracy": 0.0886497862637043,
"num_tokens": 94238.0,
"step": 45
},
{
"entropy": 7.7829310417175295,
"epoch": 0.04438526409232135,
"grad_norm": 0.84375,
"learning_rate": 2.4500000000000003e-05,
"loss": 7.4332,
"mean_token_accuracy": 0.08750618845224381,
"num_tokens": 104855.0,
"step": 50
},
{
"entropy": 7.799046611785888,
"epoch": 0.048823790501553485,
"grad_norm": 0.90625,
"learning_rate": 2.7e-05,
"loss": 7.4366,
"mean_token_accuracy": 0.09203671216964722,
"num_tokens": 113812.0,
"step": 55
},
{
"entropy": 7.795975160598755,
"epoch": 0.05326231691078562,
"grad_norm": 0.84375,
"learning_rate": 2.95e-05,
"loss": 7.4903,
"mean_token_accuracy": 0.08637641668319702,
"num_tokens": 123392.0,
"step": 60
},
{
"entropy": 7.796218681335449,
"epoch": 0.05770084332001776,
"grad_norm": 0.8984375,
"learning_rate": 3.2e-05,
"loss": 7.4831,
"mean_token_accuracy": 0.08530961498618125,
"num_tokens": 132764.0,
"step": 65
},
{
"entropy": 7.810373401641845,
"epoch": 0.06213936972924989,
"grad_norm": 1.0625,
"learning_rate": 3.4500000000000005e-05,
"loss": 7.434,
"mean_token_accuracy": 0.08844730108976365,
"num_tokens": 142965.0,
"step": 70
},
{
"entropy": 7.803947973251343,
"epoch": 0.06657789613848203,
"grad_norm": 0.90234375,
"learning_rate": 3.7e-05,
"loss": 7.4512,
"mean_token_accuracy": 0.08455823883414268,
"num_tokens": 152939.0,
"step": 75
},
{
"entropy": 7.8467789649963375,
"epoch": 0.07101642254771416,
"grad_norm": 0.82421875,
"learning_rate": 3.95e-05,
"loss": 7.5052,
"mean_token_accuracy": 0.08405138589441777,
"num_tokens": 164455.0,
"step": 80
},
{
"entropy": 7.778741502761841,
"epoch": 0.0754549489569463,
"grad_norm": 0.90234375,
"learning_rate": 4.2000000000000004e-05,
"loss": 7.4599,
"mean_token_accuracy": 0.08571180626749993,
"num_tokens": 174110.0,
"step": 85
},
{
"entropy": 7.789217472076416,
"epoch": 0.07989347536617843,
"grad_norm": 0.8671875,
"learning_rate": 4.45e-05,
"loss": 7.4293,
"mean_token_accuracy": 0.0909264013171196,
"num_tokens": 184160.0,
"step": 90
},
{
"entropy": 7.8063740730285645,
"epoch": 0.08433200177541056,
"grad_norm": 0.87109375,
"learning_rate": 4.7000000000000004e-05,
"loss": 7.4067,
"mean_token_accuracy": 0.08633613213896751,
"num_tokens": 194797.0,
"step": 95
},
{
"entropy": 7.8098077297210695,
"epoch": 0.0887705281846427,
"grad_norm": 0.87109375,
"learning_rate": 4.9500000000000004e-05,
"loss": 7.4494,
"mean_token_accuracy": 0.08306959643959999,
"num_tokens": 204108.0,
"step": 100
},
{
"entropy": 7.793222093582154,
"epoch": 0.09320905459387484,
"grad_norm": 1.0625,
"learning_rate": 5.2e-05,
"loss": 7.4157,
"mean_token_accuracy": 0.08446534052491188,
"num_tokens": 214945.0,
"step": 105
},
{
"entropy": 7.810083961486816,
"epoch": 0.09764758100310697,
"grad_norm": 0.87890625,
"learning_rate": 5.45e-05,
"loss": 7.5058,
"mean_token_accuracy": 0.08473781980574131,
"num_tokens": 226787.0,
"step": 110
},
{
"entropy": 7.764282941818237,
"epoch": 0.1020861074123391,
"grad_norm": 0.88671875,
"learning_rate": 5.7e-05,
"loss": 7.3897,
"mean_token_accuracy": 0.08418168947100639,
"num_tokens": 237273.0,
"step": 115
},
{
"entropy": 7.864174175262451,
"epoch": 0.10652463382157124,
"grad_norm": 1.0078125,
"learning_rate": 5.9499999999999996e-05,
"loss": 7.4156,
"mean_token_accuracy": 0.09291890189051628,
"num_tokens": 246793.0,
"step": 120
},
{
"entropy": 7.779165315628052,
"epoch": 0.11096316023080337,
"grad_norm": 0.83984375,
"learning_rate": 6.2e-05,
"loss": 7.4275,
"mean_token_accuracy": 0.0859360195696354,
"num_tokens": 258022.0,
"step": 125
},
{
"entropy": 7.7436638355255125,
"epoch": 0.11540168664003551,
"grad_norm": 0.90625,
"learning_rate": 6.450000000000001e-05,
"loss": 7.4169,
"mean_token_accuracy": 0.08928811252117157,
"num_tokens": 267670.0,
"step": 130
},
{
"entropy": 7.7615663528442385,
"epoch": 0.11984021304926765,
"grad_norm": 1.0078125,
"learning_rate": 6.7e-05,
"loss": 7.4734,
"mean_token_accuracy": 0.08662445694208146,
"num_tokens": 278441.0,
"step": 135
},
{
"entropy": 7.868949317932129,
"epoch": 0.12427873945849978,
"grad_norm": 0.98046875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.44,
"mean_token_accuracy": 0.0834168739616871,
"num_tokens": 288501.0,
"step": 140
},
{
"entropy": 7.918918085098267,
"epoch": 0.1287172658677319,
"grad_norm": 1.0078125,
"learning_rate": 7.2e-05,
"loss": 7.5111,
"mean_token_accuracy": 0.08065465465188026,
"num_tokens": 299557.0,
"step": 145
},
{
"entropy": 7.7995758056640625,
"epoch": 0.13315579227696406,
"grad_norm": 0.8828125,
"learning_rate": 7.45e-05,
"loss": 7.4013,
"mean_token_accuracy": 0.09215340986847878,
"num_tokens": 309221.0,
"step": 150
},
{
"entropy": 7.789921569824219,
"epoch": 0.13759431868619618,
"grad_norm": 0.9609375,
"learning_rate": 7.7e-05,
"loss": 7.3926,
"mean_token_accuracy": 0.0882001981139183,
"num_tokens": 318890.0,
"step": 155
},
{
"entropy": 7.7831714153289795,
"epoch": 0.14203284509542832,
"grad_norm": 0.96484375,
"learning_rate": 7.950000000000001e-05,
"loss": 7.3731,
"mean_token_accuracy": 0.08587820529937744,
"num_tokens": 329547.0,
"step": 160
},
{
"entropy": 7.732769966125488,
"epoch": 0.14647137150466044,
"grad_norm": 0.8203125,
"learning_rate": 8.2e-05,
"loss": 7.4036,
"mean_token_accuracy": 0.09170155450701714,
"num_tokens": 339819.0,
"step": 165
},
{
"entropy": 7.838970375061035,
"epoch": 0.1509098979138926,
"grad_norm": 0.96875,
"learning_rate": 8.450000000000001e-05,
"loss": 7.4284,
"mean_token_accuracy": 0.09364147260785102,
"num_tokens": 349132.0,
"step": 170
},
{
"entropy": 7.720353078842163,
"epoch": 0.15534842432312473,
"grad_norm": 0.98046875,
"learning_rate": 8.7e-05,
"loss": 7.4269,
"mean_token_accuracy": 0.08701886683702469,
"num_tokens": 358950.0,
"step": 175
},
{
"entropy": 7.802455282211303,
"epoch": 0.15978695073235685,
"grad_norm": 0.93359375,
"learning_rate": 8.95e-05,
"loss": 7.3911,
"mean_token_accuracy": 0.08798973783850669,
"num_tokens": 368710.0,
"step": 180
},
{
"entropy": 7.7396303653717045,
"epoch": 0.164225477141589,
"grad_norm": 1.03125,
"learning_rate": 9.2e-05,
"loss": 7.4086,
"mean_token_accuracy": 0.09115821123123169,
"num_tokens": 377388.0,
"step": 185
},
{
"entropy": 7.784192132949829,
"epoch": 0.16866400355082112,
"grad_norm": 1.0078125,
"learning_rate": 9.45e-05,
"loss": 7.368,
"mean_token_accuracy": 0.08906726986169815,
"num_tokens": 387860.0,
"step": 190
},
{
"entropy": 7.78899359703064,
"epoch": 0.17310252996005326,
"grad_norm": 1.03125,
"learning_rate": 9.7e-05,
"loss": 7.3988,
"mean_token_accuracy": 0.09347473680973054,
"num_tokens": 397737.0,
"step": 195
},
{
"entropy": 7.7772763729095455,
"epoch": 0.1775410563692854,
"grad_norm": 0.93359375,
"learning_rate": 9.95e-05,
"loss": 7.4405,
"mean_token_accuracy": 0.08559705466032028,
"num_tokens": 408016.0,
"step": 200
},
{
"entropy": 7.831363105773926,
"epoch": 0.18197958277851753,
"grad_norm": 0.90625,
"learning_rate": 0.000102,
"loss": 7.4124,
"mean_token_accuracy": 0.08368377536535263,
"num_tokens": 417578.0,
"step": 205
},
{
"entropy": 7.737787818908691,
"epoch": 0.18641810918774968,
"grad_norm": 1.03125,
"learning_rate": 0.00010449999999999999,
"loss": 7.3308,
"mean_token_accuracy": 0.08822357207536698,
"num_tokens": 428746.0,
"step": 210
},
{
"entropy": 7.837935161590576,
"epoch": 0.1908566355969818,
"grad_norm": 1.0078125,
"learning_rate": 0.000107,
"loss": 7.39,
"mean_token_accuracy": 0.08428716734051704,
"num_tokens": 439500.0,
"step": 215
},
{
"entropy": 7.771363592147827,
"epoch": 0.19529516200621394,
"grad_norm": 1.0078125,
"learning_rate": 0.0001095,
"loss": 7.4119,
"mean_token_accuracy": 0.08383373767137528,
"num_tokens": 450105.0,
"step": 220
},
{
"entropy": 7.8077551364898685,
"epoch": 0.19973368841544606,
"grad_norm": 0.96484375,
"learning_rate": 0.000112,
"loss": 7.3646,
"mean_token_accuracy": 0.09255110621452331,
"num_tokens": 459800.0,
"step": 225
},
{
"entropy": 7.745184326171875,
"epoch": 0.2041722148246782,
"grad_norm": 0.94921875,
"learning_rate": 0.0001145,
"loss": 7.2759,
"mean_token_accuracy": 0.09842955991625786,
"num_tokens": 470371.0,
"step": 230
},
{
"entropy": 7.753671360015869,
"epoch": 0.20861074123391035,
"grad_norm": 1.0859375,
"learning_rate": 0.00011700000000000001,
"loss": 7.3007,
"mean_token_accuracy": 0.09646429568529129,
"num_tokens": 480347.0,
"step": 235
},
{
"entropy": 7.81769061088562,
"epoch": 0.21304926764314247,
"grad_norm": 0.90625,
"learning_rate": 0.00011949999999999999,
"loss": 7.3843,
"mean_token_accuracy": 0.08836668208241463,
"num_tokens": 491058.0,
"step": 240
},
{
"entropy": 7.67605414390564,
"epoch": 0.21748779405237462,
"grad_norm": 1.125,
"learning_rate": 0.000122,
"loss": 7.3048,
"mean_token_accuracy": 0.08849572688341141,
"num_tokens": 500826.0,
"step": 245
},
{
"entropy": 7.790542507171631,
"epoch": 0.22192632046160674,
"grad_norm": 1.1875,
"learning_rate": 0.0001245,
"loss": 7.284,
"mean_token_accuracy": 0.08906695693731308,
"num_tokens": 510952.0,
"step": 250
},
{
"entropy": 7.7136742115020756,
"epoch": 0.22636484687083888,
"grad_norm": 0.94921875,
"learning_rate": 0.000127,
"loss": 7.2967,
"mean_token_accuracy": 0.09439613595604897,
"num_tokens": 520680.0,
"step": 255
},
{
"entropy": 7.686872863769532,
"epoch": 0.23080337328007103,
"grad_norm": 0.98828125,
"learning_rate": 0.0001295,
"loss": 7.378,
"mean_token_accuracy": 0.0834910437464714,
"num_tokens": 531400.0,
"step": 260
},
{
"entropy": 7.752029180526733,
"epoch": 0.23524189968930315,
"grad_norm": 1.3125,
"learning_rate": 0.000132,
"loss": 7.4008,
"mean_token_accuracy": 0.08466090187430382,
"num_tokens": 541657.0,
"step": 265
},
{
"entropy": 7.805071783065796,
"epoch": 0.2396804260985353,
"grad_norm": 1.0703125,
"learning_rate": 0.00013450000000000002,
"loss": 7.3264,
"mean_token_accuracy": 0.09501602202653885,
"num_tokens": 550609.0,
"step": 270
},
{
"entropy": 7.560798215866089,
"epoch": 0.2441189525077674,
"grad_norm": 1.046875,
"learning_rate": 0.00013700000000000002,
"loss": 7.292,
"mean_token_accuracy": 0.09585189595818519,
"num_tokens": 561482.0,
"step": 275
},
{
"entropy": 7.8325278759002686,
"epoch": 0.24855747891699956,
"grad_norm": 1.1171875,
"learning_rate": 0.0001395,
"loss": 7.2829,
"mean_token_accuracy": 0.09389769136905671,
"num_tokens": 570582.0,
"step": 280
},
{
"entropy": 7.7413294315338135,
"epoch": 0.2529960053262317,
"grad_norm": 1.015625,
"learning_rate": 0.00014199999999999998,
"loss": 7.392,
"mean_token_accuracy": 0.0857204593718052,
"num_tokens": 581206.0,
"step": 285
},
{
"entropy": 7.825753402709961,
"epoch": 0.2574345317354638,
"grad_norm": 1.5546875,
"learning_rate": 0.0001445,
"loss": 7.193,
"mean_token_accuracy": 0.09314141124486923,
"num_tokens": 592122.0,
"step": 290
},
{
"entropy": 7.66306438446045,
"epoch": 0.26187305814469597,
"grad_norm": 1.0546875,
"learning_rate": 0.000147,
"loss": 7.3151,
"mean_token_accuracy": 0.08986739963293075,
"num_tokens": 602919.0,
"step": 295
},
{
"entropy": 7.771809720993042,
"epoch": 0.2663115845539281,
"grad_norm": 1.0625,
"learning_rate": 0.0001495,
"loss": 7.2954,
"mean_token_accuracy": 0.09381957724690437,
"num_tokens": 612864.0,
"step": 300
},
{
"entropy": 7.627486038208008,
"epoch": 0.2707501109631602,
"grad_norm": 0.9765625,
"learning_rate": 0.000152,
"loss": 7.2278,
"mean_token_accuracy": 0.09549270346760749,
"num_tokens": 622682.0,
"step": 305
},
{
"entropy": 7.6965526103973385,
"epoch": 0.27518863737239235,
"grad_norm": 0.9609375,
"learning_rate": 0.00015450000000000001,
"loss": 7.3782,
"mean_token_accuracy": 0.09121644049882889,
"num_tokens": 634017.0,
"step": 310
},
{
"entropy": 7.837769556045532,
"epoch": 0.2796271637816245,
"grad_norm": 1.109375,
"learning_rate": 0.000157,
"loss": 7.4513,
"mean_token_accuracy": 0.08749650418758392,
"num_tokens": 644132.0,
"step": 315
},
{
"entropy": 7.789153337478638,
"epoch": 0.28406569019085665,
"grad_norm": 1.0703125,
"learning_rate": 0.0001595,
"loss": 7.3349,
"mean_token_accuracy": 0.09567861631512642,
"num_tokens": 655246.0,
"step": 320
},
{
"entropy": 7.75645751953125,
"epoch": 0.2885042166000888,
"grad_norm": 1.125,
"learning_rate": 0.000162,
"loss": 7.3554,
"mean_token_accuracy": 0.08929399326443672,
"num_tokens": 664899.0,
"step": 325
},
{
"entropy": 7.748797941207886,
"epoch": 0.2929427430093209,
"grad_norm": 1.0390625,
"learning_rate": 0.00016450000000000001,
"loss": 7.375,
"mean_token_accuracy": 0.09080832377076149,
"num_tokens": 675989.0,
"step": 330
},
{
"entropy": 7.664048528671264,
"epoch": 0.29738126941855303,
"grad_norm": 1.1328125,
"learning_rate": 0.00016700000000000002,
"loss": 7.3221,
"mean_token_accuracy": 0.09584744423627853,
"num_tokens": 687759.0,
"step": 335
},
{
"entropy": 7.7706445217132565,
"epoch": 0.3018197958277852,
"grad_norm": 1.015625,
"learning_rate": 0.00016950000000000003,
"loss": 7.2649,
"mean_token_accuracy": 0.09178439974784851,
"num_tokens": 696943.0,
"step": 340
},
{
"entropy": 7.699291706085205,
"epoch": 0.3062583222370173,
"grad_norm": 1.265625,
"learning_rate": 0.00017199999999999998,
"loss": 7.2908,
"mean_token_accuracy": 0.0902982622385025,
"num_tokens": 708139.0,
"step": 345
},
{
"entropy": 7.69988489151001,
"epoch": 0.31069684864624947,
"grad_norm": 1.125,
"learning_rate": 0.00017449999999999999,
"loss": 7.2561,
"mean_token_accuracy": 0.09475043341517449,
"num_tokens": 718000.0,
"step": 350
},
{
"entropy": 7.659535074234009,
"epoch": 0.31513537505548156,
"grad_norm": 1.140625,
"learning_rate": 0.000177,
"loss": 7.2602,
"mean_token_accuracy": 0.09070580154657364,
"num_tokens": 728188.0,
"step": 355
},
{
"entropy": 7.705199956893921,
"epoch": 0.3195739014647137,
"grad_norm": 1.0546875,
"learning_rate": 0.0001795,
"loss": 7.291,
"mean_token_accuracy": 0.09317795038223267,
"num_tokens": 738590.0,
"step": 360
},
{
"entropy": 7.739383554458618,
"epoch": 0.32401242787394585,
"grad_norm": 1.109375,
"learning_rate": 0.000182,
"loss": 7.3736,
"mean_token_accuracy": 0.09111551642417907,
"num_tokens": 748628.0,
"step": 365
},
{
"entropy": 7.654271173477173,
"epoch": 0.328450954283178,
"grad_norm": 1.3515625,
"learning_rate": 0.0001845,
"loss": 7.2501,
"mean_token_accuracy": 0.09355314895510673,
"num_tokens": 760126.0,
"step": 370
},
{
"entropy": 7.799070549011231,
"epoch": 0.33288948069241014,
"grad_norm": 1.140625,
"learning_rate": 0.000187,
"loss": 7.3846,
"mean_token_accuracy": 0.08661651834845543,
"num_tokens": 770255.0,
"step": 375
},
{
"entropy": 7.63041615486145,
"epoch": 0.33732800710164224,
"grad_norm": 0.95703125,
"learning_rate": 0.0001895,
"loss": 7.3517,
"mean_token_accuracy": 0.08633785173296929,
"num_tokens": 780744.0,
"step": 380
},
{
"entropy": 7.73739104270935,
"epoch": 0.3417665335108744,
"grad_norm": 1.0390625,
"learning_rate": 0.000192,
"loss": 7.2372,
"mean_token_accuracy": 0.09704277291893959,
"num_tokens": 790617.0,
"step": 385
},
{
"entropy": 7.6727227687835695,
"epoch": 0.34620505992010653,
"grad_norm": 0.9765625,
"learning_rate": 0.0001945,
"loss": 7.2751,
"mean_token_accuracy": 0.09424345120787621,
"num_tokens": 800751.0,
"step": 390
},
{
"entropy": 7.7567243576049805,
"epoch": 0.3506435863293387,
"grad_norm": 1.2265625,
"learning_rate": 0.00019700000000000002,
"loss": 7.3627,
"mean_token_accuracy": 0.09301683828234672,
"num_tokens": 810596.0,
"step": 395
},
{
"entropy": 7.74293794631958,
"epoch": 0.3550821127385708,
"grad_norm": 1.078125,
"learning_rate": 0.00019950000000000002,
"loss": 7.3311,
"mean_token_accuracy": 0.08610923066735268,
"num_tokens": 821001.0,
"step": 400
},
{
"entropy": 7.658763313293457,
"epoch": 0.3595206391478029,
"grad_norm": 1.1171875,
"learning_rate": 0.000202,
"loss": 7.2313,
"mean_token_accuracy": 0.09779016748070717,
"num_tokens": 831653.0,
"step": 405
},
{
"entropy": 7.616789484024048,
"epoch": 0.36395916555703506,
"grad_norm": 1.0859375,
"learning_rate": 0.00020449999999999998,
"loss": 7.1687,
"mean_token_accuracy": 0.10131467953324318,
"num_tokens": 842953.0,
"step": 410
},
{
"entropy": 7.563587284088134,
"epoch": 0.3683976919662672,
"grad_norm": 1.0703125,
"learning_rate": 0.000207,
"loss": 7.2395,
"mean_token_accuracy": 0.0917266458272934,
"num_tokens": 853521.0,
"step": 415
},
{
"entropy": 7.62612771987915,
"epoch": 0.37283621837549935,
"grad_norm": 0.98828125,
"learning_rate": 0.0002095,
"loss": 7.1909,
"mean_token_accuracy": 0.09840409010648728,
"num_tokens": 863525.0,
"step": 420
},
{
"entropy": 7.7186483383178714,
"epoch": 0.37727474478473144,
"grad_norm": 1.2109375,
"learning_rate": 0.000212,
"loss": 7.2794,
"mean_token_accuracy": 0.09545301347970962,
"num_tokens": 874101.0,
"step": 425
},
{
"entropy": 7.579249715805053,
"epoch": 0.3817132711939636,
"grad_norm": 1.1875,
"learning_rate": 0.0002145,
"loss": 7.1828,
"mean_token_accuracy": 0.1006378948688507,
"num_tokens": 884422.0,
"step": 430
},
{
"entropy": 7.561653470993042,
"epoch": 0.38615179760319573,
"grad_norm": 1.0234375,
"learning_rate": 0.00021700000000000002,
"loss": 7.1764,
"mean_token_accuracy": 0.09805170893669128,
"num_tokens": 894787.0,
"step": 435
},
{
"entropy": 7.73306303024292,
"epoch": 0.3905903240124279,
"grad_norm": 1.0546875,
"learning_rate": 0.0002195,
"loss": 7.2928,
"mean_token_accuracy": 0.08978268429636956,
"num_tokens": 906295.0,
"step": 440
},
{
"entropy": 7.6030584335327145,
"epoch": 0.39502885042166,
"grad_norm": 1.078125,
"learning_rate": 0.000222,
"loss": 7.2112,
"mean_token_accuracy": 0.09668504521250725,
"num_tokens": 916791.0,
"step": 445
},
{
"entropy": 7.55758113861084,
"epoch": 0.3994673768308921,
"grad_norm": 1.0546875,
"learning_rate": 0.0002245,
"loss": 7.1147,
"mean_token_accuracy": 0.09961161985993386,
"num_tokens": 926383.0,
"step": 450
},
{
"entropy": 7.644591426849365,
"epoch": 0.40390590324012426,
"grad_norm": 1.0859375,
"learning_rate": 0.00022700000000000002,
"loss": 7.1943,
"mean_token_accuracy": 0.10151847004890442,
"num_tokens": 937319.0,
"step": 455
},
{
"entropy": 7.615101528167725,
"epoch": 0.4083444296493564,
"grad_norm": 1.234375,
"learning_rate": 0.00022950000000000002,
"loss": 7.2615,
"mean_token_accuracy": 0.09779548048973083,
"num_tokens": 947641.0,
"step": 460
},
{
"entropy": 7.583732938766479,
"epoch": 0.41278295605858856,
"grad_norm": 1.2421875,
"learning_rate": 0.00023200000000000003,
"loss": 7.1568,
"mean_token_accuracy": 0.09658500477671624,
"num_tokens": 957778.0,
"step": 465
},
{
"entropy": 7.627662897109985,
"epoch": 0.4172214824678207,
"grad_norm": 1.171875,
"learning_rate": 0.00023449999999999998,
"loss": 7.1428,
"mean_token_accuracy": 0.09743335545063019,
"num_tokens": 967619.0,
"step": 470
},
{
"entropy": 7.599508905410767,
"epoch": 0.4216600088770528,
"grad_norm": 1.09375,
"learning_rate": 0.000237,
"loss": 7.2186,
"mean_token_accuracy": 0.09613262861967087,
"num_tokens": 978301.0,
"step": 475
},
{
"entropy": 7.5192223072052,
"epoch": 0.42609853528628494,
"grad_norm": 1.09375,
"learning_rate": 0.0002395,
"loss": 7.2032,
"mean_token_accuracy": 0.09714524820446968,
"num_tokens": 989783.0,
"step": 480
},
{
"entropy": 7.552160596847534,
"epoch": 0.4305370616955171,
"grad_norm": 1.0546875,
"learning_rate": 0.000242,
"loss": 7.0988,
"mean_token_accuracy": 0.10628278627991676,
"num_tokens": 999827.0,
"step": 485
},
{
"entropy": 7.5833902835845945,
"epoch": 0.43497558810474923,
"grad_norm": 1.078125,
"learning_rate": 0.0002445,
"loss": 7.2168,
"mean_token_accuracy": 0.09577535167336464,
"num_tokens": 1011294.0,
"step": 490
},
{
"entropy": 7.581695985794068,
"epoch": 0.4394141145139814,
"grad_norm": 1.09375,
"learning_rate": 0.000247,
"loss": 7.1425,
"mean_token_accuracy": 0.09786203876137733,
"num_tokens": 1021672.0,
"step": 495
},
{
"entropy": 7.592150259017944,
"epoch": 0.44385264092321347,
"grad_norm": 1.1796875,
"learning_rate": 0.0002495,
"loss": 7.1239,
"mean_token_accuracy": 0.10068506821990013,
"num_tokens": 1031281.0,
"step": 500
},
{
"epoch": 0.44385264092321347,
"eval_entropy": 7.398865165166787,
"eval_loss": 7.180932521820068,
"eval_mean_token_accuracy": 0.09428256430669806,
"eval_num_tokens": 1031281.0,
"eval_runtime": 2.1123,
"eval_samples_per_second": 1593.963,
"eval_steps_per_second": 199.305,
"step": 500
},
{
"entropy": 7.5125542163848875,
"epoch": 0.4482911673324456,
"grad_norm": 1.1875,
"learning_rate": 0.000252,
"loss": 7.1865,
"mean_token_accuracy": 0.09644722416996956,
"num_tokens": 1042458.0,
"step": 505
},
{
"entropy": 7.581930828094483,
"epoch": 0.45272969374167776,
"grad_norm": 1.203125,
"learning_rate": 0.0002545,
"loss": 7.1654,
"mean_token_accuracy": 0.10110429748892784,
"num_tokens": 1051645.0,
"step": 510
},
{
"entropy": 7.556396198272705,
"epoch": 0.4571682201509099,
"grad_norm": 1.1328125,
"learning_rate": 0.000257,
"loss": 7.1574,
"mean_token_accuracy": 0.10311417281627655,
"num_tokens": 1061634.0,
"step": 515
},
{
"entropy": 7.615333938598633,
"epoch": 0.46160674656014206,
"grad_norm": 1.15625,
"learning_rate": 0.0002595,
"loss": 7.1778,
"mean_token_accuracy": 0.10142057165503501,
"num_tokens": 1071666.0,
"step": 520
},
{
"entropy": 7.468676328659058,
"epoch": 0.46604527296937415,
"grad_norm": 1.0703125,
"learning_rate": 0.000262,
"loss": 7.1345,
"mean_token_accuracy": 0.09515785649418831,
"num_tokens": 1082652.0,
"step": 525
},
{
"entropy": 7.533456087112427,
"epoch": 0.4704837993786063,
"grad_norm": 1.1640625,
"learning_rate": 0.00026450000000000003,
"loss": 7.0998,
"mean_token_accuracy": 0.0970863476395607,
"num_tokens": 1092396.0,
"step": 530
},
{
"entropy": 7.495568656921387,
"epoch": 0.47492232578783844,
"grad_norm": 1.015625,
"learning_rate": 0.00026700000000000004,
"loss": 7.0605,
"mean_token_accuracy": 0.10546803250908851,
"num_tokens": 1102504.0,
"step": 535
},
{
"entropy": 7.440021228790283,
"epoch": 0.4793608521970706,
"grad_norm": 1.15625,
"learning_rate": 0.00026950000000000005,
"loss": 7.112,
"mean_token_accuracy": 0.09773821383714676,
"num_tokens": 1112505.0,
"step": 540
},
{
"entropy": 7.558693218231201,
"epoch": 0.48379937860630273,
"grad_norm": 1.296875,
"learning_rate": 0.00027200000000000005,
"loss": 7.1158,
"mean_token_accuracy": 0.0986550621688366,
"num_tokens": 1122603.0,
"step": 545
},
{
"entropy": 7.461544179916382,
"epoch": 0.4882379050155348,
"grad_norm": 1.0859375,
"learning_rate": 0.0002745,
"loss": 7.1284,
"mean_token_accuracy": 0.09657116010785102,
"num_tokens": 1132178.0,
"step": 550
},
{
"entropy": 7.562966060638428,
"epoch": 0.49267643142476697,
"grad_norm": 1.171875,
"learning_rate": 0.000277,
"loss": 7.0946,
"mean_token_accuracy": 0.09613885954022408,
"num_tokens": 1141712.0,
"step": 555
},
{
"entropy": 7.508441638946533,
"epoch": 0.4971149578339991,
"grad_norm": 1.3828125,
"learning_rate": 0.0002795,
"loss": 7.1157,
"mean_token_accuracy": 0.0992264598608017,
"num_tokens": 1151748.0,
"step": 560
},
{
"entropy": 7.558133125305176,
"epoch": 0.5015534842432312,
"grad_norm": 2.265625,
"learning_rate": 0.00028199999999999997,
"loss": 7.0116,
"mean_token_accuracy": 0.10735590234398842,
"num_tokens": 1161234.0,
"step": 565
},
{
"entropy": 7.4882372379302975,
"epoch": 0.5059920106524634,
"grad_norm": 1.359375,
"learning_rate": 0.0002845,
"loss": 7.0915,
"mean_token_accuracy": 0.10239496752619744,
"num_tokens": 1171656.0,
"step": 570
},
{
"entropy": 7.4804298877716064,
"epoch": 0.5104305370616955,
"grad_norm": 1.0390625,
"learning_rate": 0.000287,
"loss": 7.1359,
"mean_token_accuracy": 0.09924655333161354,
"num_tokens": 1182983.0,
"step": 575
},
{
"entropy": 7.447319459915161,
"epoch": 0.5148690634709276,
"grad_norm": 1.25,
"learning_rate": 0.0002895,
"loss": 7.1005,
"mean_token_accuracy": 0.09991766214370727,
"num_tokens": 1193720.0,
"step": 580
},
{
"entropy": 7.4760712623596195,
"epoch": 0.5193075898801598,
"grad_norm": 1.21875,
"learning_rate": 0.000292,
"loss": 7.0304,
"mean_token_accuracy": 0.10363117456436158,
"num_tokens": 1203286.0,
"step": 585
},
{
"entropy": 7.436632061004639,
"epoch": 0.5237461162893919,
"grad_norm": 1.140625,
"learning_rate": 0.0002945,
"loss": 7.0193,
"mean_token_accuracy": 0.10448477938771247,
"num_tokens": 1212875.0,
"step": 590
},
{
"entropy": 7.479945039749145,
"epoch": 0.5281846426986241,
"grad_norm": 1.1953125,
"learning_rate": 0.000297,
"loss": 7.0455,
"mean_token_accuracy": 0.09875646382570266,
"num_tokens": 1223629.0,
"step": 595
},
{
"entropy": 7.455782127380371,
"epoch": 0.5326231691078562,
"grad_norm": 1.3671875,
"learning_rate": 0.0002995,
"loss": 7.1663,
"mean_token_accuracy": 0.10330844521522523,
"num_tokens": 1233670.0,
"step": 600
},
{
"entropy": 7.540210819244384,
"epoch": 0.5370616955170884,
"grad_norm": 1.3828125,
"learning_rate": 0.000302,
"loss": 7.0882,
"mean_token_accuracy": 0.10033463165163994,
"num_tokens": 1244140.0,
"step": 605
},
{
"entropy": 7.42637152671814,
"epoch": 0.5415002219263204,
"grad_norm": 1.0390625,
"learning_rate": 0.0003045,
"loss": 7.0617,
"mean_token_accuracy": 0.10370045378804207,
"num_tokens": 1254496.0,
"step": 610
},
{
"entropy": 7.397940731048584,
"epoch": 0.5459387483355526,
"grad_norm": 1.0859375,
"learning_rate": 0.000307,
"loss": 7.0262,
"mean_token_accuracy": 0.10960142239928246,
"num_tokens": 1265391.0,
"step": 615
},
{
"entropy": 7.426065683364868,
"epoch": 0.5503772747447847,
"grad_norm": 1.046875,
"learning_rate": 0.0003095,
"loss": 6.9633,
"mean_token_accuracy": 0.10688221156597137,
"num_tokens": 1275857.0,
"step": 620
},
{
"entropy": 7.255760049819946,
"epoch": 0.5548158011540169,
"grad_norm": 1.109375,
"learning_rate": 0.000312,
"loss": 6.9785,
"mean_token_accuracy": 0.10750289410352706,
"num_tokens": 1285122.0,
"step": 625
},
{
"entropy": 7.525947952270508,
"epoch": 0.559254327563249,
"grad_norm": 1.390625,
"learning_rate": 0.0003145,
"loss": 7.0365,
"mean_token_accuracy": 0.10156842395663261,
"num_tokens": 1294476.0,
"step": 630
},
{
"entropy": 7.383149433135986,
"epoch": 0.5636928539724811,
"grad_norm": 1.0703125,
"learning_rate": 0.000317,
"loss": 7.0386,
"mean_token_accuracy": 0.10288441628217697,
"num_tokens": 1304959.0,
"step": 635
},
{
"entropy": 7.389831638336181,
"epoch": 0.5681313803817133,
"grad_norm": 1.0234375,
"learning_rate": 0.0003195,
"loss": 6.9818,
"mean_token_accuracy": 0.10231715813279152,
"num_tokens": 1316121.0,
"step": 640
},
{
"entropy": 7.392814636230469,
"epoch": 0.5725699067909454,
"grad_norm": 1.21875,
"learning_rate": 0.000322,
"loss": 7.0793,
"mean_token_accuracy": 0.10169301480054856,
"num_tokens": 1326750.0,
"step": 645
},
{
"entropy": 7.383424234390259,
"epoch": 0.5770084332001776,
"grad_norm": 1.1015625,
"learning_rate": 0.00032450000000000003,
"loss": 6.9712,
"mean_token_accuracy": 0.10646747648715973,
"num_tokens": 1337044.0,
"step": 650
},
{
"entropy": 7.4170256614685055,
"epoch": 0.5814469596094097,
"grad_norm": 1.1484375,
"learning_rate": 0.00032700000000000003,
"loss": 7.0334,
"mean_token_accuracy": 0.09991655647754669,
"num_tokens": 1347610.0,
"step": 655
},
{
"entropy": 7.2603747844696045,
"epoch": 0.5858854860186418,
"grad_norm": 1.1875,
"learning_rate": 0.00032950000000000004,
"loss": 6.9609,
"mean_token_accuracy": 0.10539844930171967,
"num_tokens": 1356521.0,
"step": 660
},
{
"entropy": 7.422995662689209,
"epoch": 0.5903240124278739,
"grad_norm": 1.1953125,
"learning_rate": 0.00033200000000000005,
"loss": 6.9662,
"mean_token_accuracy": 0.10543927997350692,
"num_tokens": 1366741.0,
"step": 665
},
{
"entropy": 7.369775009155274,
"epoch": 0.5947625388371061,
"grad_norm": 1.203125,
"learning_rate": 0.00033450000000000005,
"loss": 7.0411,
"mean_token_accuracy": 0.10072910860180855,
"num_tokens": 1377018.0,
"step": 670
},
{
"entropy": 7.43230504989624,
"epoch": 0.5992010652463382,
"grad_norm": 1.1171875,
"learning_rate": 0.000337,
"loss": 6.959,
"mean_token_accuracy": 0.10484865829348564,
"num_tokens": 1386387.0,
"step": 675
},
{
"entropy": 7.3505573749542235,
"epoch": 0.6036395916555704,
"grad_norm": 1.2109375,
"learning_rate": 0.0003395,
"loss": 6.961,
"mean_token_accuracy": 0.10673004984855652,
"num_tokens": 1396049.0,
"step": 680
},
{
"entropy": 7.355041980743408,
"epoch": 0.6080781180648025,
"grad_norm": 1.125,
"learning_rate": 0.000342,
"loss": 7.0803,
"mean_token_accuracy": 0.0983244001865387,
"num_tokens": 1406952.0,
"step": 685
},
{
"entropy": 7.410180234909058,
"epoch": 0.6125166444740346,
"grad_norm": 1.0703125,
"learning_rate": 0.00034449999999999997,
"loss": 6.9874,
"mean_token_accuracy": 0.10184509009122848,
"num_tokens": 1417146.0,
"step": 690
},
{
"entropy": 7.331110858917237,
"epoch": 0.6169551708832668,
"grad_norm": 1.2109375,
"learning_rate": 0.000347,
"loss": 6.9654,
"mean_token_accuracy": 0.11014403700828553,
"num_tokens": 1426146.0,
"step": 695
},
{
"entropy": 7.430603981018066,
"epoch": 0.6213936972924989,
"grad_norm": 1.0390625,
"learning_rate": 0.0003495,
"loss": 7.0644,
"mean_token_accuracy": 0.10093853399157524,
"num_tokens": 1437913.0,
"step": 700
},
{
"entropy": 7.3031325340271,
"epoch": 0.625832223701731,
"grad_norm": 1.125,
"learning_rate": 0.000352,
"loss": 6.9308,
"mean_token_accuracy": 0.11181655824184418,
"num_tokens": 1448329.0,
"step": 705
},
{
"entropy": 7.382747077941895,
"epoch": 0.6302707501109631,
"grad_norm": 1.265625,
"learning_rate": 0.0003545,
"loss": 6.9559,
"mean_token_accuracy": 0.10284734219312668,
"num_tokens": 1457896.0,
"step": 710
},
{
"entropy": 7.310059356689453,
"epoch": 0.6347092765201953,
"grad_norm": 1.21875,
"learning_rate": 0.000357,
"loss": 6.9601,
"mean_token_accuracy": 0.1071910947561264,
"num_tokens": 1467705.0,
"step": 715
},
{
"entropy": 7.25341272354126,
"epoch": 0.6391478029294274,
"grad_norm": 1.1328125,
"learning_rate": 0.0003595,
"loss": 6.9512,
"mean_token_accuracy": 0.10645409822463989,
"num_tokens": 1478132.0,
"step": 720
},
{
"entropy": 7.391849327087402,
"epoch": 0.6435863293386596,
"grad_norm": 1.203125,
"learning_rate": 0.000362,
"loss": 7.019,
"mean_token_accuracy": 0.10602135583758354,
"num_tokens": 1488424.0,
"step": 725
},
{
"entropy": 7.310156202316284,
"epoch": 0.6480248557478917,
"grad_norm": 1.0859375,
"learning_rate": 0.0003645,
"loss": 6.8812,
"mean_token_accuracy": 0.11527719348669052,
"num_tokens": 1498197.0,
"step": 730
},
{
"entropy": 7.234117460250855,
"epoch": 0.6524633821571239,
"grad_norm": 1.1640625,
"learning_rate": 0.000367,
"loss": 6.9052,
"mean_token_accuracy": 0.10894913673400879,
"num_tokens": 1508242.0,
"step": 735
},
{
"entropy": 7.232631635665894,
"epoch": 0.656901908566356,
"grad_norm": 1.0859375,
"learning_rate": 0.0003695,
"loss": 6.8983,
"mean_token_accuracy": 0.11159973964095116,
"num_tokens": 1517652.0,
"step": 740
},
{
"entropy": 7.2952375411987305,
"epoch": 0.6613404349755881,
"grad_norm": 1.1484375,
"learning_rate": 0.000372,
"loss": 6.9347,
"mean_token_accuracy": 0.10787282809615135,
"num_tokens": 1527501.0,
"step": 745
},
{
"entropy": 7.291040468215942,
"epoch": 0.6657789613848203,
"grad_norm": 0.97265625,
"learning_rate": 0.0003745,
"loss": 6.9339,
"mean_token_accuracy": 0.11132785305380821,
"num_tokens": 1537640.0,
"step": 750
},
{
"entropy": 7.20764536857605,
"epoch": 0.6702174877940523,
"grad_norm": 1.1640625,
"learning_rate": 0.000377,
"loss": 6.8701,
"mean_token_accuracy": 0.11440131813287735,
"num_tokens": 1548049.0,
"step": 755
},
{
"entropy": 7.340287876129151,
"epoch": 0.6746560142032845,
"grad_norm": 1.28125,
"learning_rate": 0.0003795,
"loss": 7.0474,
"mean_token_accuracy": 0.10261607840657234,
"num_tokens": 1558389.0,
"step": 760
},
{
"entropy": 7.222410678863525,
"epoch": 0.6790945406125166,
"grad_norm": 1.0859375,
"learning_rate": 0.000382,
"loss": 6.8176,
"mean_token_accuracy": 0.11613213866949082,
"num_tokens": 1568489.0,
"step": 765
},
{
"entropy": 7.2836723804473875,
"epoch": 0.6835330670217488,
"grad_norm": 1.1953125,
"learning_rate": 0.0003845,
"loss": 6.9313,
"mean_token_accuracy": 0.10658463388681412,
"num_tokens": 1578430.0,
"step": 770
},
{
"entropy": 7.352204275131226,
"epoch": 0.6879715934309809,
"grad_norm": 1.09375,
"learning_rate": 0.00038700000000000003,
"loss": 7.001,
"mean_token_accuracy": 0.10380481109023094,
"num_tokens": 1590307.0,
"step": 775
},
{
"entropy": 7.313673448562622,
"epoch": 0.6924101198402131,
"grad_norm": 1.84375,
"learning_rate": 0.00038950000000000003,
"loss": 6.8585,
"mean_token_accuracy": 0.11356580927968025,
"num_tokens": 1601719.0,
"step": 780
},
{
"entropy": 7.149180507659912,
"epoch": 0.6968486462494452,
"grad_norm": 1.140625,
"learning_rate": 0.00039200000000000004,
"loss": 6.8735,
"mean_token_accuracy": 0.11371317654848098,
"num_tokens": 1612047.0,
"step": 785
},
{
"entropy": 7.195708179473877,
"epoch": 0.7012871726586773,
"grad_norm": 1.0546875,
"learning_rate": 0.00039450000000000005,
"loss": 6.8651,
"mean_token_accuracy": 0.11098539307713509,
"num_tokens": 1623141.0,
"step": 790
},
{
"entropy": 7.241322708129883,
"epoch": 0.7057256990679095,
"grad_norm": 1.1015625,
"learning_rate": 0.00039700000000000005,
"loss": 6.8738,
"mean_token_accuracy": 0.1125923864543438,
"num_tokens": 1633249.0,
"step": 795
},
{
"entropy": 7.270007610321045,
"epoch": 0.7101642254771416,
"grad_norm": 1.1328125,
"learning_rate": 0.0003995,
"loss": 6.9612,
"mean_token_accuracy": 0.10728915557265281,
"num_tokens": 1644451.0,
"step": 800
},
{
"entropy": 7.245293235778808,
"epoch": 0.7146027518863737,
"grad_norm": 1.140625,
"learning_rate": 0.000402,
"loss": 6.8967,
"mean_token_accuracy": 0.11031619012355805,
"num_tokens": 1655196.0,
"step": 805
},
{
"entropy": 7.137471008300781,
"epoch": 0.7190412782956058,
"grad_norm": 1.015625,
"learning_rate": 0.0004045,
"loss": 6.8781,
"mean_token_accuracy": 0.11013623625040055,
"num_tokens": 1665613.0,
"step": 810
},
{
"entropy": 7.282591247558594,
"epoch": 0.723479804704838,
"grad_norm": 1.140625,
"learning_rate": 0.00040699999999999997,
"loss": 6.8188,
"mean_token_accuracy": 0.11500794291496277,
"num_tokens": 1675116.0,
"step": 815
},
{
"entropy": 7.219833612442017,
"epoch": 0.7279183311140701,
"grad_norm": 1.3984375,
"learning_rate": 0.0004095,
"loss": 6.9236,
"mean_token_accuracy": 0.10631008669734002,
"num_tokens": 1684055.0,
"step": 820
},
{
"entropy": 7.231753492355347,
"epoch": 0.7323568575233023,
"grad_norm": 1.1328125,
"learning_rate": 0.000412,
"loss": 6.7797,
"mean_token_accuracy": 0.12125139310956001,
"num_tokens": 1694046.0,
"step": 825
},
{
"entropy": 7.143084859848022,
"epoch": 0.7367953839325344,
"grad_norm": 1.5078125,
"learning_rate": 0.0004145,
"loss": 6.8325,
"mean_token_accuracy": 0.1153494082391262,
"num_tokens": 1704133.0,
"step": 830
},
{
"entropy": 7.14149580001831,
"epoch": 0.7412339103417666,
"grad_norm": 1.09375,
"learning_rate": 0.000417,
"loss": 6.9275,
"mean_token_accuracy": 0.11007370427250862,
"num_tokens": 1714678.0,
"step": 835
},
{
"entropy": 7.204297304153442,
"epoch": 0.7456724367509987,
"grad_norm": 1.21875,
"learning_rate": 0.0004195,
"loss": 6.7453,
"mean_token_accuracy": 0.12288743630051613,
"num_tokens": 1725145.0,
"step": 840
},
{
"entropy": 7.071165657043457,
"epoch": 0.7501109631602308,
"grad_norm": 1.2109375,
"learning_rate": 0.000422,
"loss": 6.8729,
"mean_token_accuracy": 0.11628773137927055,
"num_tokens": 1735530.0,
"step": 845
},
{
"entropy": 7.21942458152771,
"epoch": 0.7545494895694629,
"grad_norm": 1.0703125,
"learning_rate": 0.0004245,
"loss": 6.8964,
"mean_token_accuracy": 0.11181129217147827,
"num_tokens": 1746520.0,
"step": 850
},
{
"entropy": 7.154268980026245,
"epoch": 0.758988015978695,
"grad_norm": 1.1953125,
"learning_rate": 0.000427,
"loss": 6.8532,
"mean_token_accuracy": 0.1179992400109768,
"num_tokens": 1756091.0,
"step": 855
},
{
"entropy": 7.089676809310913,
"epoch": 0.7634265423879272,
"grad_norm": 1.03125,
"learning_rate": 0.0004295,
"loss": 6.8561,
"mean_token_accuracy": 0.10415932089090348,
"num_tokens": 1765968.0,
"step": 860
},
{
"entropy": 7.192745923995972,
"epoch": 0.7678650687971593,
"grad_norm": 1.0078125,
"learning_rate": 0.000432,
"loss": 6.8773,
"mean_token_accuracy": 0.11299539059400558,
"num_tokens": 1777409.0,
"step": 865
},
{
"entropy": 7.130894994735717,
"epoch": 0.7723035952063915,
"grad_norm": 1.1171875,
"learning_rate": 0.0004345,
"loss": 6.8824,
"mean_token_accuracy": 0.10640934631228446,
"num_tokens": 1788440.0,
"step": 870
},
{
"entropy": 7.20861964225769,
"epoch": 0.7767421216156236,
"grad_norm": 1.15625,
"learning_rate": 0.000437,
"loss": 6.8417,
"mean_token_accuracy": 0.11558186262845993,
"num_tokens": 1799145.0,
"step": 875
},
{
"entropy": 7.05075421333313,
"epoch": 0.7811806480248558,
"grad_norm": 1.2109375,
"learning_rate": 0.0004395,
"loss": 6.808,
"mean_token_accuracy": 0.116386828571558,
"num_tokens": 1809366.0,
"step": 880
},
{
"entropy": 7.129081392288208,
"epoch": 0.7856191744340879,
"grad_norm": 1.046875,
"learning_rate": 0.000442,
"loss": 6.8875,
"mean_token_accuracy": 0.10899080038070678,
"num_tokens": 1820878.0,
"step": 885
},
{
"entropy": 7.155272579193115,
"epoch": 0.79005770084332,
"grad_norm": 1.046875,
"learning_rate": 0.0004445,
"loss": 6.8349,
"mean_token_accuracy": 0.11343251317739486,
"num_tokens": 1831870.0,
"step": 890
},
{
"entropy": 7.249894714355468,
"epoch": 0.7944962272525522,
"grad_norm": 1.15625,
"learning_rate": 0.000447,
"loss": 6.801,
"mean_token_accuracy": 0.11338023543357849,
"num_tokens": 1841482.0,
"step": 895
},
{
"entropy": 6.969785833358765,
"epoch": 0.7989347536617842,
"grad_norm": 1.125,
"learning_rate": 0.00044950000000000003,
"loss": 6.8102,
"mean_token_accuracy": 0.11380291059613228,
"num_tokens": 1851748.0,
"step": 900
},
{
"entropy": 7.100828695297241,
"epoch": 0.8033732800710164,
"grad_norm": 1.109375,
"learning_rate": 0.00045200000000000004,
"loss": 6.7389,
"mean_token_accuracy": 0.1162735216319561,
"num_tokens": 1862292.0,
"step": 905
},
{
"entropy": 7.249449729919434,
"epoch": 0.8078118064802485,
"grad_norm": 1.1171875,
"learning_rate": 0.00045450000000000004,
"loss": 6.959,
"mean_token_accuracy": 0.10582878962159156,
"num_tokens": 1873825.0,
"step": 910
},
{
"entropy": 7.126041460037231,
"epoch": 0.8122503328894807,
"grad_norm": 1.1171875,
"learning_rate": 0.00045700000000000005,
"loss": 6.7795,
"mean_token_accuracy": 0.11718677878379821,
"num_tokens": 1883824.0,
"step": 915
},
{
"entropy": 7.029882144927979,
"epoch": 0.8166888592987128,
"grad_norm": 1.0703125,
"learning_rate": 0.00045950000000000006,
"loss": 6.7984,
"mean_token_accuracy": 0.10695101991295815,
"num_tokens": 1894236.0,
"step": 920
},
{
"entropy": 7.212645196914673,
"epoch": 0.821127385707945,
"grad_norm": 1.21875,
"learning_rate": 0.000462,
"loss": 6.779,
"mean_token_accuracy": 0.11693326756358147,
"num_tokens": 1904083.0,
"step": 925
},
{
"entropy": 7.023255491256714,
"epoch": 0.8255659121171771,
"grad_norm": 0.98828125,
"learning_rate": 0.0004645,
"loss": 6.7907,
"mean_token_accuracy": 0.11693133264780045,
"num_tokens": 1914845.0,
"step": 930
},
{
"entropy": 7.073426914215088,
"epoch": 0.8300044385264093,
"grad_norm": 1.03125,
"learning_rate": 0.000467,
"loss": 6.7945,
"mean_token_accuracy": 0.11135339140892028,
"num_tokens": 1925999.0,
"step": 935
},
{
"entropy": 7.0789491653442385,
"epoch": 0.8344429649356414,
"grad_norm": 1.171875,
"learning_rate": 0.0004695,
"loss": 6.694,
"mean_token_accuracy": 0.1280534103512764,
"num_tokens": 1935401.0,
"step": 940
},
{
"entropy": 6.9891969680786135,
"epoch": 0.8388814913448736,
"grad_norm": 1.25,
"learning_rate": 0.000472,
"loss": 6.7607,
"mean_token_accuracy": 0.12046314924955367,
"num_tokens": 1945510.0,
"step": 945
},
{
"entropy": 7.16357650756836,
"epoch": 0.8433200177541056,
"grad_norm": 1.203125,
"learning_rate": 0.0004745,
"loss": 6.7473,
"mean_token_accuracy": 0.11847912147641182,
"num_tokens": 1956934.0,
"step": 950
},
{
"entropy": 7.054219198226929,
"epoch": 0.8477585441633377,
"grad_norm": 1.03125,
"learning_rate": 0.000477,
"loss": 6.7688,
"mean_token_accuracy": 0.11719952076673508,
"num_tokens": 1967032.0,
"step": 955
},
{
"entropy": 7.080799579620361,
"epoch": 0.8521970705725699,
"grad_norm": 1.0546875,
"learning_rate": 0.0004795,
"loss": 6.8584,
"mean_token_accuracy": 0.11015522852540016,
"num_tokens": 1978895.0,
"step": 960
},
{
"entropy": 7.09550929069519,
"epoch": 0.856635596981802,
"grad_norm": 1.0390625,
"learning_rate": 0.000482,
"loss": 6.816,
"mean_token_accuracy": 0.11443090364336968,
"num_tokens": 1990156.0,
"step": 965
},
{
"entropy": 7.139660930633545,
"epoch": 0.8610741233910342,
"grad_norm": 1.1953125,
"learning_rate": 0.0004845,
"loss": 6.7035,
"mean_token_accuracy": 0.11342604532837867,
"num_tokens": 1999643.0,
"step": 970
},
{
"entropy": 6.957034969329834,
"epoch": 0.8655126498002663,
"grad_norm": 1.0390625,
"learning_rate": 0.000487,
"loss": 6.7472,
"mean_token_accuracy": 0.11747978329658508,
"num_tokens": 2010328.0,
"step": 975
},
{
"entropy": 7.062716341018676,
"epoch": 0.8699511762094985,
"grad_norm": 1.0625,
"learning_rate": 0.0004895,
"loss": 6.8272,
"mean_token_accuracy": 0.11245640963315964,
"num_tokens": 2021353.0,
"step": 980
},
{
"entropy": 7.081027889251709,
"epoch": 0.8743897026187306,
"grad_norm": 1.140625,
"learning_rate": 0.000492,
"loss": 6.7701,
"mean_token_accuracy": 0.11547347530722618,
"num_tokens": 2032331.0,
"step": 985
},
{
"entropy": 7.023243951797485,
"epoch": 0.8788282290279628,
"grad_norm": 1.078125,
"learning_rate": 0.0004945,
"loss": 6.7011,
"mean_token_accuracy": 0.1206856571137905,
"num_tokens": 2041786.0,
"step": 990
},
{
"entropy": 6.975612211227417,
"epoch": 0.8832667554371949,
"grad_norm": 1.03125,
"learning_rate": 0.000497,
"loss": 6.6885,
"mean_token_accuracy": 0.11817316859960555,
"num_tokens": 2052512.0,
"step": 995
},
{
"entropy": 7.02327561378479,
"epoch": 0.8877052818464269,
"grad_norm": 1.265625,
"learning_rate": 0.0004995,
"loss": 6.6295,
"mean_token_accuracy": 0.12657489329576493,
"num_tokens": 2062785.0,
"step": 1000
},
{
"epoch": 0.8877052818464269,
"eval_entropy": 6.811686369698857,
"eval_loss": 6.767911434173584,
"eval_mean_token_accuracy": 0.11571601520772501,
"eval_num_tokens": 2062785.0,
"eval_runtime": 2.1114,
"eval_samples_per_second": 1594.66,
"eval_steps_per_second": 199.392,
"step": 1000
},
{
"entropy": 7.073720645904541,
"epoch": 0.8921438082556591,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999998312369076,
"loss": 6.7709,
"mean_token_accuracy": 0.11314490139484405,
"num_tokens": 2072621.0,
"step": 1005
},
{
"entropy": 7.060971355438232,
"epoch": 0.8965823346648912,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999991456372788,
"loss": 6.8178,
"mean_token_accuracy": 0.10872112512588501,
"num_tokens": 2083356.0,
"step": 1010
},
{
"entropy": 7.0227889060974125,
"epoch": 0.9010208610741234,
"grad_norm": 1.203125,
"learning_rate": 0.000499997932655026,
"loss": 6.7777,
"mean_token_accuracy": 0.11077685430645942,
"num_tokens": 2092787.0,
"step": 1015
},
{
"entropy": 6.9889302253723145,
"epoch": 0.9054593874833555,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999961922929925,
"loss": 6.6739,
"mean_token_accuracy": 0.11871889233589172,
"num_tokens": 2103721.0,
"step": 1020
},
{
"entropy": 6.950629568099975,
"epoch": 0.9098979138925877,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999939245552573,
"loss": 6.6956,
"mean_token_accuracy": 0.12753814980387687,
"num_tokens": 2115016.0,
"step": 1025
},
{
"entropy": 6.951031637191773,
"epoch": 0.9143364403018198,
"grad_norm": 1.1640625,
"learning_rate": 0.000499991129447136,
"loss": 6.6594,
"mean_token_accuracy": 0.1263865128159523,
"num_tokens": 2126183.0,
"step": 1030
},
{
"entropy": 6.928300905227661,
"epoch": 0.918774966711052,
"grad_norm": 1.15625,
"learning_rate": 0.0004999878069751803,
"loss": 6.7069,
"mean_token_accuracy": 0.11957084909081458,
"num_tokens": 2135955.0,
"step": 1035
},
{
"entropy": 6.915622138977051,
"epoch": 0.9232134931202841,
"grad_norm": 1.171875,
"learning_rate": 0.0004999839571471776,
"loss": 6.6919,
"mean_token_accuracy": 0.11919597014784813,
"num_tokens": 2146064.0,
"step": 1040
},
{
"entropy": 6.9707104682922365,
"epoch": 0.9276520195295161,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999795799721517,
"loss": 6.6444,
"mean_token_accuracy": 0.1262632966041565,
"num_tokens": 2155707.0,
"step": 1045
},
{
"entropy": 6.99800386428833,
"epoch": 0.9320905459387483,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999746754603624,
"loss": 6.6928,
"mean_token_accuracy": 0.11961428299546242,
"num_tokens": 2166037.0,
"step": 1050
},
{
"entropy": 6.904142761230469,
"epoch": 0.9365290723479804,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999692436233055,
"loss": 6.7519,
"mean_token_accuracy": 0.11929019168019295,
"num_tokens": 2175993.0,
"step": 1055
},
{
"entropy": 7.008247995376587,
"epoch": 0.9409675987572126,
"grad_norm": 1.2265625,
"learning_rate": 0.000499963284473713,
"loss": 6.7099,
"mean_token_accuracy": 0.12117866948246955,
"num_tokens": 2186829.0,
"step": 1060
},
{
"entropy": 6.9378032207489015,
"epoch": 0.9454061251664447,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999567980255526,
"loss": 6.665,
"mean_token_accuracy": 0.12237748578190803,
"num_tokens": 2195845.0,
"step": 1065
},
{
"entropy": 7.0276360511779785,
"epoch": 0.9498446515756769,
"grad_norm": 1.1875,
"learning_rate": 0.0004999497842940282,
"loss": 6.6921,
"mean_token_accuracy": 0.12066913396120071,
"num_tokens": 2204937.0,
"step": 1070
},
{
"entropy": 6.900293159484863,
"epoch": 0.954283177984909,
"grad_norm": 1.078125,
"learning_rate": 0.0004999422432955794,
"loss": 6.6703,
"mean_token_accuracy": 0.12011573910713196,
"num_tokens": 2214582.0,
"step": 1075
},
{
"entropy": 6.922044038772583,
"epoch": 0.9587217043941412,
"grad_norm": 1.09375,
"learning_rate": 0.0004999341750478818,
"loss": 6.6229,
"mean_token_accuracy": 0.1269613318145275,
"num_tokens": 2225157.0,
"step": 1080
},
{
"entropy": 6.99785623550415,
"epoch": 0.9631602308033733,
"grad_norm": 1.078125,
"learning_rate": 0.000499925579569847,
"loss": 6.6932,
"mean_token_accuracy": 0.12152787148952485,
"num_tokens": 2234823.0,
"step": 1085
},
{
"entropy": 6.851722621917725,
"epoch": 0.9675987572126055,
"grad_norm": 1.0625,
"learning_rate": 0.0004999164568816219,
"loss": 6.6802,
"mean_token_accuracy": 0.119229806214571,
"num_tokens": 2244666.0,
"step": 1090
},
{
"entropy": 7.007480764389038,
"epoch": 0.9720372836218375,
"grad_norm": 1.078125,
"learning_rate": 0.0004999068070045897,
"loss": 6.6412,
"mean_token_accuracy": 0.117543176561594,
"num_tokens": 2254586.0,
"step": 1095
},
{
"entropy": 6.836320638656616,
"epoch": 0.9764758100310696,
"grad_norm": 1.015625,
"learning_rate": 0.000499896629961369,
"loss": 6.6026,
"mean_token_accuracy": 0.12370306029915809,
"num_tokens": 2264453.0,
"step": 1100
},
{
"entropy": 6.999147844314575,
"epoch": 0.9809143364403018,
"grad_norm": 0.93359375,
"learning_rate": 0.000499885925775814,
"loss": 6.6656,
"mean_token_accuracy": 0.11901217773556709,
"num_tokens": 2275170.0,
"step": 1105
},
{
"entropy": 6.810418939590454,
"epoch": 0.9853528628495339,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998746944730148,
"loss": 6.6517,
"mean_token_accuracy": 0.12251685783267022,
"num_tokens": 2285448.0,
"step": 1110
},
{
"entropy": 6.978043413162231,
"epoch": 0.9897913892587661,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998629360792965,
"loss": 6.6361,
"mean_token_accuracy": 0.1255613885819912,
"num_tokens": 2295673.0,
"step": 1115
},
{
"entropy": 6.860985517501831,
"epoch": 0.9942299156679982,
"grad_norm": 1.03125,
"learning_rate": 0.0004998506506222202,
"loss": 6.644,
"mean_token_accuracy": 0.12026142254471779,
"num_tokens": 2306115.0,
"step": 1120
},
{
"entropy": 6.872910737991333,
"epoch": 0.9986684420772304,
"grad_norm": 1.2265625,
"learning_rate": 0.0004998378381305821,
"loss": 6.637,
"mean_token_accuracy": 0.12394563928246498,
"num_tokens": 2316495.0,
"step": 1125
},
{
"entropy": 6.93203698264228,
"epoch": 1.0026631158455392,
"grad_norm": 1.21875,
"learning_rate": 0.0004998244986344138,
"loss": 6.5838,
"mean_token_accuracy": 0.1257213337553872,
"num_tokens": 2326409.0,
"step": 1130
},
{
"entropy": 6.777434873580932,
"epoch": 1.0071016422547714,
"grad_norm": 1.140625,
"learning_rate": 0.0004998106321649822,
"loss": 6.439,
"mean_token_accuracy": 0.1350421704351902,
"num_tokens": 2337394.0,
"step": 1135
},
{
"entropy": 6.8583564281463625,
"epoch": 1.0115401686640035,
"grad_norm": 0.93359375,
"learning_rate": 0.0004997962387547893,
"loss": 6.5089,
"mean_token_accuracy": 0.12366606816649436,
"num_tokens": 2347768.0,
"step": 1140
},
{
"entropy": 6.965995025634766,
"epoch": 1.0159786950732357,
"grad_norm": 1.0859375,
"learning_rate": 0.0004997813184375723,
"loss": 6.5134,
"mean_token_accuracy": 0.12577569335699082,
"num_tokens": 2357969.0,
"step": 1145
},
{
"entropy": 6.872522068023682,
"epoch": 1.0204172214824678,
"grad_norm": 1.125,
"learning_rate": 0.0004997658712483034,
"loss": 6.4866,
"mean_token_accuracy": 0.1270396701991558,
"num_tokens": 2367878.0,
"step": 1150
},
{
"entropy": 6.814556646347046,
"epoch": 1.0248557478917,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997498972231898,
"loss": 6.4781,
"mean_token_accuracy": 0.12578893974423408,
"num_tokens": 2377072.0,
"step": 1155
},
{
"entropy": 6.867713165283203,
"epoch": 1.0292942743009321,
"grad_norm": 1.140625,
"learning_rate": 0.0004997333963996734,
"loss": 6.503,
"mean_token_accuracy": 0.13253186494112015,
"num_tokens": 2387348.0,
"step": 1160
},
{
"entropy": 6.912645387649536,
"epoch": 1.0337328007101643,
"grad_norm": 1.0234375,
"learning_rate": 0.0004997163688164313,
"loss": 6.4919,
"mean_token_accuracy": 0.12540172412991524,
"num_tokens": 2398113.0,
"step": 1165
},
{
"entropy": 6.738404178619385,
"epoch": 1.0381713271193964,
"grad_norm": 1.03125,
"learning_rate": 0.0004996988145133745,
"loss": 6.3882,
"mean_token_accuracy": 0.13407822996377944,
"num_tokens": 2408074.0,
"step": 1170
},
{
"entropy": 6.699475193023682,
"epoch": 1.0426098535286286,
"grad_norm": 1.015625,
"learning_rate": 0.0004996807335316496,
"loss": 6.3874,
"mean_token_accuracy": 0.1336548797786236,
"num_tokens": 2419752.0,
"step": 1175
},
{
"entropy": 6.843112182617188,
"epoch": 1.0470483799378607,
"grad_norm": 1.0703125,
"learning_rate": 0.0004996621259136368,
"loss": 6.4743,
"mean_token_accuracy": 0.1282840073108673,
"num_tokens": 2430853.0,
"step": 1180
},
{
"entropy": 6.741962194442749,
"epoch": 1.0514869063470929,
"grad_norm": 1.109375,
"learning_rate": 0.0004996429917029513,
"loss": 6.4597,
"mean_token_accuracy": 0.1284678265452385,
"num_tokens": 2440686.0,
"step": 1185
},
{
"entropy": 6.87503981590271,
"epoch": 1.055925432756325,
"grad_norm": 1.0625,
"learning_rate": 0.0004996233309444424,
"loss": 6.4862,
"mean_token_accuracy": 0.1273033231496811,
"num_tokens": 2450849.0,
"step": 1190
},
{
"entropy": 6.7747828483581545,
"epoch": 1.060363959165557,
"grad_norm": 1.09375,
"learning_rate": 0.0004996031436841934,
"loss": 6.3842,
"mean_token_accuracy": 0.13247138634324074,
"num_tokens": 2460827.0,
"step": 1195
},
{
"entropy": 6.7094989776611325,
"epoch": 1.064802485574789,
"grad_norm": 1.125,
"learning_rate": 0.0004995824299695219,
"loss": 6.4723,
"mean_token_accuracy": 0.1337954096496105,
"num_tokens": 2471265.0,
"step": 1200
},
{
"entropy": 6.8431929588317875,
"epoch": 1.0692410119840212,
"grad_norm": 1.078125,
"learning_rate": 0.0004995611898489796,
"loss": 6.3655,
"mean_token_accuracy": 0.13849280402064323,
"num_tokens": 2481346.0,
"step": 1205
},
{
"entropy": 6.77330379486084,
"epoch": 1.0736795383932534,
"grad_norm": 1.0390625,
"learning_rate": 0.0004995394233723516,
"loss": 6.4696,
"mean_token_accuracy": 0.13246190845966338,
"num_tokens": 2492281.0,
"step": 1210
},
{
"entropy": 6.771844577789307,
"epoch": 1.0781180648024855,
"grad_norm": 1.0703125,
"learning_rate": 0.0004995171305906574,
"loss": 6.397,
"mean_token_accuracy": 0.1389589823782444,
"num_tokens": 2502094.0,
"step": 1215
},
{
"entropy": 6.706840229034424,
"epoch": 1.0825565912117177,
"grad_norm": 1.1640625,
"learning_rate": 0.0004994943115561495,
"loss": 6.3975,
"mean_token_accuracy": 0.13392824158072472,
"num_tokens": 2512553.0,
"step": 1220
},
{
"entropy": 6.795430517196655,
"epoch": 1.0869951176209498,
"grad_norm": 1.140625,
"learning_rate": 0.0004994709663223143,
"loss": 6.3947,
"mean_token_accuracy": 0.13575630336999894,
"num_tokens": 2522350.0,
"step": 1225
},
{
"entropy": 6.717914056777954,
"epoch": 1.091433644030182,
"grad_norm": 1.1796875,
"learning_rate": 0.0004994470949438712,
"loss": 6.4571,
"mean_token_accuracy": 0.12943646237254142,
"num_tokens": 2532884.0,
"step": 1230
},
{
"entropy": 6.821149110794067,
"epoch": 1.095872170439414,
"grad_norm": 1.078125,
"learning_rate": 0.0004994226974767734,
"loss": 6.4947,
"mean_token_accuracy": 0.12449371442198753,
"num_tokens": 2543364.0,
"step": 1235
},
{
"entropy": 6.7451752662658695,
"epoch": 1.1003106968486462,
"grad_norm": 1.1328125,
"learning_rate": 0.0004993977739782066,
"loss": 6.3817,
"mean_token_accuracy": 0.13001500964164733,
"num_tokens": 2552281.0,
"step": 1240
},
{
"entropy": 6.721602582931519,
"epoch": 1.1047492232578784,
"grad_norm": 1.1953125,
"learning_rate": 0.00049937232450659,
"loss": 6.446,
"mean_token_accuracy": 0.12717969268560408,
"num_tokens": 2561963.0,
"step": 1245
},
{
"entropy": 6.7753888130187985,
"epoch": 1.1091877496671105,
"grad_norm": 1.0546875,
"learning_rate": 0.0004993463491215753,
"loss": 6.4337,
"mean_token_accuracy": 0.13999854624271393,
"num_tokens": 2572951.0,
"step": 1250
},
{
"entropy": 6.816381406784058,
"epoch": 1.1136262760763427,
"grad_norm": 1.140625,
"learning_rate": 0.000499319847884047,
"loss": 6.4535,
"mean_token_accuracy": 0.1278873711824417,
"num_tokens": 2583019.0,
"step": 1255
},
{
"entropy": 6.7529043674469,
"epoch": 1.1180648024855748,
"grad_norm": 1.0234375,
"learning_rate": 0.0004992928208561224,
"loss": 6.3902,
"mean_token_accuracy": 0.13753967881202697,
"num_tokens": 2593385.0,
"step": 1260
},
{
"entropy": 6.774140882492065,
"epoch": 1.122503328894807,
"grad_norm": 1.078125,
"learning_rate": 0.0004992652681011508,
"loss": 6.3959,
"mean_token_accuracy": 0.13451069965958595,
"num_tokens": 2603679.0,
"step": 1265
},
{
"entropy": 6.745535135269165,
"epoch": 1.1269418553040391,
"grad_norm": 1.2109375,
"learning_rate": 0.000499237189683714,
"loss": 6.458,
"mean_token_accuracy": 0.1327129691839218,
"num_tokens": 2614029.0,
"step": 1270
},
{
"entropy": 6.658591461181641,
"epoch": 1.1313803817132713,
"grad_norm": 1.03125,
"learning_rate": 0.0004992085856696259,
"loss": 6.4209,
"mean_token_accuracy": 0.1382272757589817,
"num_tokens": 2624063.0,
"step": 1275
},
{
"entropy": 6.722748279571533,
"epoch": 1.1358189081225034,
"grad_norm": 1.1953125,
"learning_rate": 0.0004991794561259325,
"loss": 6.3691,
"mean_token_accuracy": 0.14201630800962448,
"num_tokens": 2633792.0,
"step": 1280
},
{
"entropy": 6.6542223453521725,
"epoch": 1.1402574345317356,
"grad_norm": 1.15625,
"learning_rate": 0.0004991498011209112,
"loss": 6.3232,
"mean_token_accuracy": 0.13645180314779282,
"num_tokens": 2643401.0,
"step": 1285
},
{
"entropy": 6.773741817474365,
"epoch": 1.1446959609409677,
"grad_norm": 1.1328125,
"learning_rate": 0.0004991196207240714,
"loss": 6.4539,
"mean_token_accuracy": 0.1282748505473137,
"num_tokens": 2653909.0,
"step": 1290
},
{
"entropy": 6.693137884140015,
"epoch": 1.1491344873501999,
"grad_norm": 1.25,
"learning_rate": 0.0004990889150061541,
"loss": 6.4317,
"mean_token_accuracy": 0.1349467732012272,
"num_tokens": 2664386.0,
"step": 1295
},
{
"entropy": 6.766120195388794,
"epoch": 1.1535730137594318,
"grad_norm": 1.171875,
"learning_rate": 0.0004990576840391312,
"loss": 6.4865,
"mean_token_accuracy": 0.12709747180342673,
"num_tokens": 2675398.0,
"step": 1300
},
{
"entropy": 6.749423599243164,
"epoch": 1.158011540168664,
"grad_norm": 1.1953125,
"learning_rate": 0.000499025927896206,
"loss": 6.389,
"mean_token_accuracy": 0.1319727636873722,
"num_tokens": 2684895.0,
"step": 1305
},
{
"entropy": 6.622655010223388,
"epoch": 1.162450066577896,
"grad_norm": 1.296875,
"learning_rate": 0.0004989936466518127,
"loss": 6.367,
"mean_token_accuracy": 0.1397032156586647,
"num_tokens": 2694706.0,
"step": 1310
},
{
"entropy": 6.733213758468628,
"epoch": 1.1668885929871282,
"grad_norm": 1.0234375,
"learning_rate": 0.0004989608403816164,
"loss": 6.3576,
"mean_token_accuracy": 0.13502043187618257,
"num_tokens": 2706486.0,
"step": 1315
},
{
"entropy": 6.691570997238159,
"epoch": 1.1713271193963604,
"grad_norm": 1.0625,
"learning_rate": 0.0004989275091625126,
"loss": 6.4414,
"mean_token_accuracy": 0.14210355877876282,
"num_tokens": 2716613.0,
"step": 1320
},
{
"entropy": 6.886738586425781,
"epoch": 1.1757656458055925,
"grad_norm": 0.96875,
"learning_rate": 0.0004988936530726276,
"loss": 6.5302,
"mean_token_accuracy": 0.1268772892653942,
"num_tokens": 2727313.0,
"step": 1325
},
{
"entropy": 6.723033380508423,
"epoch": 1.1802041722148247,
"grad_norm": 1.0546875,
"learning_rate": 0.0004988592721913176,
"loss": 6.3995,
"mean_token_accuracy": 0.1361616112291813,
"num_tokens": 2737826.0,
"step": 1330
},
{
"entropy": 6.63746075630188,
"epoch": 1.1846426986240568,
"grad_norm": 1.4609375,
"learning_rate": 0.0004988243665991692,
"loss": 6.3232,
"mean_token_accuracy": 0.13523943722248077,
"num_tokens": 2748962.0,
"step": 1335
},
{
"entropy": 6.7660548210144045,
"epoch": 1.189081225033289,
"grad_norm": 1.0078125,
"learning_rate": 0.0004987889363779985,
"loss": 6.3726,
"mean_token_accuracy": 0.13909099400043487,
"num_tokens": 2760116.0,
"step": 1340
},
{
"entropy": 6.642192268371582,
"epoch": 1.193519751442521,
"grad_norm": 1.015625,
"learning_rate": 0.0004987529816108517,
"loss": 6.3868,
"mean_token_accuracy": 0.13063296377658845,
"num_tokens": 2771664.0,
"step": 1345
},
{
"entropy": 6.735338401794434,
"epoch": 1.1979582778517532,
"grad_norm": 1.1796875,
"learning_rate": 0.0004987165023820043,
"loss": 6.3339,
"mean_token_accuracy": 0.13763192743062974,
"num_tokens": 2781792.0,
"step": 1350
},
{
"entropy": 6.5532543659210205,
"epoch": 1.2023968042609854,
"grad_norm": 1.015625,
"learning_rate": 0.0004986794987769611,
"loss": 6.3272,
"mean_token_accuracy": 0.1380511462688446,
"num_tokens": 2792203.0,
"step": 1355
},
{
"entropy": 6.720197010040283,
"epoch": 1.2068353306702175,
"grad_norm": 1.1015625,
"learning_rate": 0.000498641970882456,
"loss": 6.4867,
"mean_token_accuracy": 0.13111176937818528,
"num_tokens": 2802077.0,
"step": 1360
},
{
"entropy": 6.638952589035034,
"epoch": 1.2112738570794497,
"grad_norm": 1.078125,
"learning_rate": 0.0004986039187864518,
"loss": 6.3655,
"mean_token_accuracy": 0.14026057049632074,
"num_tokens": 2811993.0,
"step": 1365
},
{
"entropy": 6.676184177398682,
"epoch": 1.2157123834886818,
"grad_norm": 1.125,
"learning_rate": 0.0004985653425781401,
"loss": 6.402,
"mean_token_accuracy": 0.13089463859796524,
"num_tokens": 2821924.0,
"step": 1370
},
{
"entropy": 6.675514078140258,
"epoch": 1.220150909897914,
"grad_norm": 1.1796875,
"learning_rate": 0.0004985262423479408,
"loss": 6.3627,
"mean_token_accuracy": 0.1411583587527275,
"num_tokens": 2831521.0,
"step": 1375
},
{
"entropy": 6.686585426330566,
"epoch": 1.2245894363071461,
"grad_norm": 1.109375,
"learning_rate": 0.0004984866181875021,
"loss": 6.3526,
"mean_token_accuracy": 0.13705047890543937,
"num_tokens": 2841864.0,
"step": 1380
},
{
"entropy": 6.604874324798584,
"epoch": 1.229027962716378,
"grad_norm": 1.171875,
"learning_rate": 0.0004984464701897005,
"loss": 6.3588,
"mean_token_accuracy": 0.13925145491957663,
"num_tokens": 2852199.0,
"step": 1385
},
{
"entropy": 6.6554466724395756,
"epoch": 1.2334664891256102,
"grad_norm": 1.140625,
"learning_rate": 0.0004984057984486402,
"loss": 6.3641,
"mean_token_accuracy": 0.1341533102095127,
"num_tokens": 2862167.0,
"step": 1390
},
{
"entropy": 6.686126089096069,
"epoch": 1.2379050155348423,
"grad_norm": 1.125,
"learning_rate": 0.0004983646030596527,
"loss": 6.4079,
"mean_token_accuracy": 0.13984917402267455,
"num_tokens": 2872604.0,
"step": 1395
},
{
"entropy": 6.672490835189819,
"epoch": 1.2423435419440745,
"grad_norm": 1.3203125,
"learning_rate": 0.0004983228841192975,
"loss": 6.3752,
"mean_token_accuracy": 0.13595345988869667,
"num_tokens": 2882401.0,
"step": 1400
},
{
"entropy": 6.631757831573486,
"epoch": 1.2467820683533066,
"grad_norm": 1.1328125,
"learning_rate": 0.0004982806417253607,
"loss": 6.3511,
"mean_token_accuracy": 0.13876891285181045,
"num_tokens": 2892004.0,
"step": 1405
},
{
"entropy": 6.63784236907959,
"epoch": 1.2512205947625388,
"grad_norm": 1.1171875,
"learning_rate": 0.0004982378759768557,
"loss": 6.3538,
"mean_token_accuracy": 0.13770614489912986,
"num_tokens": 2902369.0,
"step": 1410
},
{
"entropy": 6.656727027893067,
"epoch": 1.255659121171771,
"grad_norm": 1.0546875,
"learning_rate": 0.0004981945869740225,
"loss": 6.3934,
"mean_token_accuracy": 0.13234489262104035,
"num_tokens": 2912532.0,
"step": 1415
},
{
"entropy": 6.692376708984375,
"epoch": 1.260097647581003,
"grad_norm": 1.1875,
"learning_rate": 0.0004981507748183276,
"loss": 6.3853,
"mean_token_accuracy": 0.1314159318804741,
"num_tokens": 2922621.0,
"step": 1420
},
{
"entropy": 6.710336446762085,
"epoch": 1.2645361739902352,
"grad_norm": 1.125,
"learning_rate": 0.0004981064396124635,
"loss": 6.3583,
"mean_token_accuracy": 0.13584646657109262,
"num_tokens": 2932510.0,
"step": 1425
},
{
"entropy": 6.6139873504638675,
"epoch": 1.2689747003994674,
"grad_norm": 1.140625,
"learning_rate": 0.0004980615814603492,
"loss": 6.3846,
"mean_token_accuracy": 0.12972714975476266,
"num_tokens": 2942982.0,
"step": 1430
},
{
"entropy": 6.653766632080078,
"epoch": 1.2734132268086995,
"grad_norm": 1.25,
"learning_rate": 0.0004980162004671288,
"loss": 6.2817,
"mean_token_accuracy": 0.1397496670484543,
"num_tokens": 2953417.0,
"step": 1435
},
{
"entropy": 6.590647983551025,
"epoch": 1.2778517532179317,
"grad_norm": 1.171875,
"learning_rate": 0.0004979702967391725,
"loss": 6.287,
"mean_token_accuracy": 0.14722541570663453,
"num_tokens": 2961771.0,
"step": 1440
},
{
"entropy": 6.587854480743408,
"epoch": 1.2822902796271638,
"grad_norm": 1.09375,
"learning_rate": 0.0004979238703840755,
"loss": 6.3671,
"mean_token_accuracy": 0.13086313456296922,
"num_tokens": 2971980.0,
"step": 1445
},
{
"entropy": 6.69378170967102,
"epoch": 1.286728806036396,
"grad_norm": 1.0625,
"learning_rate": 0.0004978769215106579,
"loss": 6.3792,
"mean_token_accuracy": 0.13028891906142234,
"num_tokens": 2982087.0,
"step": 1450
},
{
"entropy": 6.681559753417969,
"epoch": 1.291167332445628,
"grad_norm": 1.1484375,
"learning_rate": 0.0004978294502289646,
"loss": 6.4874,
"mean_token_accuracy": 0.12749797403812407,
"num_tokens": 2993424.0,
"step": 1455
},
{
"entropy": 6.710448789596557,
"epoch": 1.2956058588548602,
"grad_norm": 1.125,
"learning_rate": 0.0004977814566502651,
"loss": 6.3213,
"mean_token_accuracy": 0.1379827730357647,
"num_tokens": 3003081.0,
"step": 1460
},
{
"entropy": 6.677050495147705,
"epoch": 1.3000443852640924,
"grad_norm": 1.21875,
"learning_rate": 0.0004977329408870532,
"loss": 6.4048,
"mean_token_accuracy": 0.1378847599029541,
"num_tokens": 3013829.0,
"step": 1465
},
{
"entropy": 6.576231288909912,
"epoch": 1.3044829116733245,
"grad_norm": 1.015625,
"learning_rate": 0.0004976839030530464,
"loss": 6.3102,
"mean_token_accuracy": 0.1419086903333664,
"num_tokens": 3024511.0,
"step": 1470
},
{
"entropy": 6.593928623199463,
"epoch": 1.3089214380825567,
"grad_norm": 1.0859375,
"learning_rate": 0.000497634343263186,
"loss": 6.4043,
"mean_token_accuracy": 0.12826052978634833,
"num_tokens": 3034503.0,
"step": 1475
},
{
"entropy": 6.648963260650635,
"epoch": 1.3133599644917888,
"grad_norm": 1.0234375,
"learning_rate": 0.0004975842616336369,
"loss": 6.3201,
"mean_token_accuracy": 0.141230496019125,
"num_tokens": 3044823.0,
"step": 1480
},
{
"entropy": 6.510059928894043,
"epoch": 1.317798490901021,
"grad_norm": 0.93359375,
"learning_rate": 0.0004975336582817869,
"loss": 6.33,
"mean_token_accuracy": 0.1362045116722584,
"num_tokens": 3056412.0,
"step": 1485
},
{
"entropy": 6.728832674026489,
"epoch": 1.3222370173102531,
"grad_norm": 0.99609375,
"learning_rate": 0.0004974825333262469,
"loss": 6.3945,
"mean_token_accuracy": 0.12927686050534248,
"num_tokens": 3067101.0,
"step": 1490
},
{
"entropy": 6.7084520816802975,
"epoch": 1.3266755437194853,
"grad_norm": 1.0078125,
"learning_rate": 0.0004974308868868501,
"loss": 6.3995,
"mean_token_accuracy": 0.12630158364772798,
"num_tokens": 3077638.0,
"step": 1495
},
{
"entropy": 6.551306915283203,
"epoch": 1.3311140701287172,
"grad_norm": 1.265625,
"learning_rate": 0.0004973787190846524,
"loss": 6.3218,
"mean_token_accuracy": 0.14200132787227632,
"num_tokens": 3087970.0,
"step": 1500
},
{
"epoch": 1.3311140701287172,
"eval_entropy": 6.368161134651891,
"eval_loss": 6.45974588394165,
"eval_mean_token_accuracy": 0.13263512823969623,
"eval_num_tokens": 3087970.0,
"eval_runtime": 2.0891,
"eval_samples_per_second": 1611.728,
"eval_steps_per_second": 201.526,
"step": 1500
},
{
"entropy": 6.630201387405395,
"epoch": 1.3355525965379493,
"grad_norm": 1.09375,
"learning_rate": 0.0004973260300419316,
"loss": 6.3578,
"mean_token_accuracy": 0.13766367435455323,
"num_tokens": 3097895.0,
"step": 1505
},
{
"entropy": 6.590450048446655,
"epoch": 1.3399911229471815,
"grad_norm": 1.1640625,
"learning_rate": 0.0004972728198821871,
"loss": 6.3072,
"mean_token_accuracy": 0.1387806810438633,
"num_tokens": 3107042.0,
"step": 1510
},
{
"entropy": 6.625532007217407,
"epoch": 1.3444296493564136,
"grad_norm": 1.046875,
"learning_rate": 0.00049721908873014,
"loss": 6.315,
"mean_token_accuracy": 0.14337668791413308,
"num_tokens": 3117959.0,
"step": 1515
},
{
"entropy": 6.558200359344482,
"epoch": 1.3488681757656458,
"grad_norm": 0.9921875,
"learning_rate": 0.0004971648367117323,
"loss": 6.3543,
"mean_token_accuracy": 0.13464199230074883,
"num_tokens": 3128407.0,
"step": 1520
},
{
"entropy": 6.676009941101074,
"epoch": 1.353306702174878,
"grad_norm": 1.234375,
"learning_rate": 0.0004971100639541271,
"loss": 6.3267,
"mean_token_accuracy": 0.14146978706121444,
"num_tokens": 3138265.0,
"step": 1525
},
{
"entropy": 6.57694182395935,
"epoch": 1.35774522858411,
"grad_norm": 1.1171875,
"learning_rate": 0.000497054770585708,
"loss": 6.3353,
"mean_token_accuracy": 0.13715606033802033,
"num_tokens": 3148677.0,
"step": 1530
},
{
"entropy": 6.556269979476928,
"epoch": 1.3621837549933422,
"grad_norm": 1.2109375,
"learning_rate": 0.0004969989567360788,
"loss": 6.3503,
"mean_token_accuracy": 0.13542981594800949,
"num_tokens": 3158684.0,
"step": 1535
},
{
"entropy": 6.643629789352417,
"epoch": 1.3666222814025744,
"grad_norm": 1.1171875,
"learning_rate": 0.0004969426225360635,
"loss": 6.3543,
"mean_token_accuracy": 0.1378885067999363,
"num_tokens": 3169124.0,
"step": 1540
},
{
"entropy": 6.596967315673828,
"epoch": 1.3710608078118065,
"grad_norm": 1.3125,
"learning_rate": 0.0004968857681177056,
"loss": 6.2667,
"mean_token_accuracy": 0.1364466980099678,
"num_tokens": 3179282.0,
"step": 1545
},
{
"entropy": 6.605694532394409,
"epoch": 1.3754993342210386,
"grad_norm": 1.109375,
"learning_rate": 0.0004968283936142679,
"loss": 6.301,
"mean_token_accuracy": 0.13783995881676675,
"num_tokens": 3190144.0,
"step": 1550
},
{
"entropy": 6.484689426422119,
"epoch": 1.3799378606302708,
"grad_norm": 0.89453125,
"learning_rate": 0.0004967704991602322,
"loss": 6.3025,
"mean_token_accuracy": 0.14239512234926224,
"num_tokens": 3201277.0,
"step": 1555
},
{
"entropy": 6.584119367599487,
"epoch": 1.384376387039503,
"grad_norm": 1.1171875,
"learning_rate": 0.0004967120848912995,
"loss": 6.318,
"mean_token_accuracy": 0.13924861773848535,
"num_tokens": 3211691.0,
"step": 1560
},
{
"entropy": 6.51182188987732,
"epoch": 1.388814913448735,
"grad_norm": 1.0625,
"learning_rate": 0.0004966531509443884,
"loss": 6.2972,
"mean_token_accuracy": 0.1423930622637272,
"num_tokens": 3220452.0,
"step": 1565
},
{
"entropy": 6.665063858032227,
"epoch": 1.3932534398579672,
"grad_norm": 1.078125,
"learning_rate": 0.0004965936974576363,
"loss": 6.2572,
"mean_token_accuracy": 0.1434251219034195,
"num_tokens": 3230821.0,
"step": 1570
},
{
"entropy": 6.569358205795288,
"epoch": 1.3976919662671992,
"grad_norm": 1.171875,
"learning_rate": 0.0004965337245703981,
"loss": 6.333,
"mean_token_accuracy": 0.13867368102073668,
"num_tokens": 3240621.0,
"step": 1575
},
{
"entropy": 6.564372253417969,
"epoch": 1.4021304926764313,
"grad_norm": 0.99609375,
"learning_rate": 0.0004964732324232462,
"loss": 6.302,
"mean_token_accuracy": 0.13816518783569337,
"num_tokens": 3251442.0,
"step": 1580
},
{
"entropy": 6.6255796432495115,
"epoch": 1.4065690190856635,
"grad_norm": 1.140625,
"learning_rate": 0.00049641222115797,
"loss": 6.3077,
"mean_token_accuracy": 0.13412498235702514,
"num_tokens": 3261164.0,
"step": 1585
},
{
"entropy": 6.539021825790405,
"epoch": 1.4110075454948956,
"grad_norm": 1.140625,
"learning_rate": 0.0004963506909175758,
"loss": 6.3365,
"mean_token_accuracy": 0.13258393555879594,
"num_tokens": 3271442.0,
"step": 1590
},
{
"entropy": 6.633949136734008,
"epoch": 1.4154460719041277,
"grad_norm": 1.0234375,
"learning_rate": 0.000496288641846286,
"loss": 6.3385,
"mean_token_accuracy": 0.13758450075984002,
"num_tokens": 3282159.0,
"step": 1595
},
{
"entropy": 6.485613584518433,
"epoch": 1.41988459831336,
"grad_norm": 1.09375,
"learning_rate": 0.0004962260740895398,
"loss": 6.2791,
"mean_token_accuracy": 0.14571996703743934,
"num_tokens": 3291424.0,
"step": 1600
},
{
"entropy": 6.557862329483032,
"epoch": 1.424323124722592,
"grad_norm": 1.15625,
"learning_rate": 0.0004961629877939913,
"loss": 6.3422,
"mean_token_accuracy": 0.1376090705394745,
"num_tokens": 3302098.0,
"step": 1605
},
{
"entropy": 6.554436111450196,
"epoch": 1.4287616511318242,
"grad_norm": 1.0546875,
"learning_rate": 0.000496099383107511,
"loss": 6.3472,
"mean_token_accuracy": 0.13372454419732094,
"num_tokens": 3313292.0,
"step": 1610
},
{
"entropy": 6.600845575332642,
"epoch": 1.4332001775410563,
"grad_norm": 1.0546875,
"learning_rate": 0.0004960352601791835,
"loss": 6.2123,
"mean_token_accuracy": 0.14182500839233397,
"num_tokens": 3324272.0,
"step": 1615
},
{
"entropy": 6.54074878692627,
"epoch": 1.4376387039502885,
"grad_norm": 0.921875,
"learning_rate": 0.0004959706191593087,
"loss": 6.3102,
"mean_token_accuracy": 0.1401732988655567,
"num_tokens": 3335299.0,
"step": 1620
},
{
"entropy": 6.616578388214111,
"epoch": 1.4420772303595206,
"grad_norm": 1.1953125,
"learning_rate": 0.0004959054601994007,
"loss": 6.2826,
"mean_token_accuracy": 0.1450162336230278,
"num_tokens": 3344652.0,
"step": 1625
},
{
"entropy": 6.52901258468628,
"epoch": 1.4465157567687528,
"grad_norm": 0.96484375,
"learning_rate": 0.0004958397834521878,
"loss": 6.3048,
"mean_token_accuracy": 0.139273801445961,
"num_tokens": 3355166.0,
"step": 1630
},
{
"entropy": 6.562482261657715,
"epoch": 1.450954283177985,
"grad_norm": 1.09375,
"learning_rate": 0.0004957735890716115,
"loss": 6.2622,
"mean_token_accuracy": 0.1440594784915447,
"num_tokens": 3366330.0,
"step": 1635
},
{
"entropy": 6.549576234817505,
"epoch": 1.455392809587217,
"grad_norm": 1.09375,
"learning_rate": 0.0004957068772128273,
"loss": 6.3315,
"mean_token_accuracy": 0.14034282714128493,
"num_tokens": 3375930.0,
"step": 1640
},
{
"entropy": 6.5108832836151125,
"epoch": 1.4598313359964492,
"grad_norm": 1.0703125,
"learning_rate": 0.000495639648032203,
"loss": 6.1684,
"mean_token_accuracy": 0.16133927404880524,
"num_tokens": 3387310.0,
"step": 1645
},
{
"entropy": 6.47861647605896,
"epoch": 1.4642698624056814,
"grad_norm": 1.0234375,
"learning_rate": 0.0004955719016873192,
"loss": 6.2004,
"mean_token_accuracy": 0.1491427481174469,
"num_tokens": 3398022.0,
"step": 1650
},
{
"entropy": 6.540802431106568,
"epoch": 1.4687083888149135,
"grad_norm": 1.1953125,
"learning_rate": 0.0004955036383369688,
"loss": 6.216,
"mean_token_accuracy": 0.14632173478603364,
"num_tokens": 3407315.0,
"step": 1655
},
{
"entropy": 6.459036493301392,
"epoch": 1.4731469152241456,
"grad_norm": 1.03125,
"learning_rate": 0.0004954348581411564,
"loss": 6.3148,
"mean_token_accuracy": 0.14125865548849106,
"num_tokens": 3418009.0,
"step": 1660
},
{
"entropy": 6.666120433807373,
"epoch": 1.4775854416333778,
"grad_norm": 1.0703125,
"learning_rate": 0.000495365561261098,
"loss": 6.3262,
"mean_token_accuracy": 0.13915122225880622,
"num_tokens": 3428659.0,
"step": 1665
},
{
"entropy": 6.513209629058838,
"epoch": 1.48202396804261,
"grad_norm": 1.1796875,
"learning_rate": 0.0004952957478592209,
"loss": 6.2605,
"mean_token_accuracy": 0.14562821611762047,
"num_tokens": 3439102.0,
"step": 1670
},
{
"entropy": 6.495951080322266,
"epoch": 1.486462494451842,
"grad_norm": 1.234375,
"learning_rate": 0.0004952254180991628,
"loss": 6.3143,
"mean_token_accuracy": 0.14086345955729485,
"num_tokens": 3450269.0,
"step": 1675
},
{
"entropy": 6.550183248519898,
"epoch": 1.4909010208610742,
"grad_norm": 1.0859375,
"learning_rate": 0.0004951545721457719,
"loss": 6.2323,
"mean_token_accuracy": 0.15024334490299224,
"num_tokens": 3459876.0,
"step": 1680
},
{
"entropy": 6.439149618148804,
"epoch": 1.4953395472703064,
"grad_norm": 1.2109375,
"learning_rate": 0.0004950832101651062,
"loss": 6.2879,
"mean_token_accuracy": 0.1395568035542965,
"num_tokens": 3469276.0,
"step": 1685
},
{
"entropy": 6.540930128097534,
"epoch": 1.4997780736795385,
"grad_norm": 1.0703125,
"learning_rate": 0.0004950113323244336,
"loss": 6.1873,
"mean_token_accuracy": 0.14649046510457991,
"num_tokens": 3479835.0,
"step": 1690
},
{
"entropy": 6.476472091674805,
"epoch": 1.5042166000887707,
"grad_norm": 1.0,
"learning_rate": 0.0004949389387922305,
"loss": 6.2472,
"mean_token_accuracy": 0.14312107488512993,
"num_tokens": 3491176.0,
"step": 1695
},
{
"entropy": 6.531066989898681,
"epoch": 1.5086551264980028,
"grad_norm": 1.1171875,
"learning_rate": 0.0004948660297381826,
"loss": 6.2262,
"mean_token_accuracy": 0.14610032215714455,
"num_tokens": 3501122.0,
"step": 1700
},
{
"entropy": 6.392983913421631,
"epoch": 1.5130936529072347,
"grad_norm": 1.140625,
"learning_rate": 0.0004947926053331836,
"loss": 6.1558,
"mean_token_accuracy": 0.1542304791510105,
"num_tokens": 3510875.0,
"step": 1705
},
{
"entropy": 6.541310834884643,
"epoch": 1.517532179316467,
"grad_norm": 1.0078125,
"learning_rate": 0.0004947186657493354,
"loss": 6.2377,
"mean_token_accuracy": 0.1494641751050949,
"num_tokens": 3521798.0,
"step": 1710
},
{
"entropy": 6.438729286193848,
"epoch": 1.521970705725699,
"grad_norm": 1.0390625,
"learning_rate": 0.0004946442111599473,
"loss": 6.2043,
"mean_token_accuracy": 0.1451006591320038,
"num_tokens": 3531456.0,
"step": 1715
},
{
"entropy": 6.580926847457886,
"epoch": 1.5264092321349312,
"grad_norm": 1.140625,
"learning_rate": 0.0004945692417395358,
"loss": 6.251,
"mean_token_accuracy": 0.14176156222820283,
"num_tokens": 3541315.0,
"step": 1720
},
{
"entropy": 6.448061084747314,
"epoch": 1.5308477585441633,
"grad_norm": 0.9453125,
"learning_rate": 0.000494493757663824,
"loss": 6.2238,
"mean_token_accuracy": 0.14351213127374648,
"num_tokens": 3552876.0,
"step": 1725
},
{
"entropy": 6.4509584426879885,
"epoch": 1.5352862849533955,
"grad_norm": 0.96875,
"learning_rate": 0.0004944177591097415,
"loss": 6.2331,
"mean_token_accuracy": 0.14354335144162178,
"num_tokens": 3563967.0,
"step": 1730
},
{
"entropy": 6.457042932510376,
"epoch": 1.5397248113626276,
"grad_norm": 1.1015625,
"learning_rate": 0.0004943412462554236,
"loss": 6.2159,
"mean_token_accuracy": 0.1507117457687855,
"num_tokens": 3573510.0,
"step": 1735
},
{
"entropy": 6.546308755874634,
"epoch": 1.5441633377718598,
"grad_norm": 1.0078125,
"learning_rate": 0.0004942642192802114,
"loss": 6.3099,
"mean_token_accuracy": 0.13970684260129929,
"num_tokens": 3584863.0,
"step": 1740
},
{
"entropy": 6.455177211761475,
"epoch": 1.548601864181092,
"grad_norm": 1.203125,
"learning_rate": 0.0004941866783646508,
"loss": 6.2268,
"mean_token_accuracy": 0.14618334472179412,
"num_tokens": 3594489.0,
"step": 1745
},
{
"entropy": 6.556396770477295,
"epoch": 1.553040390590324,
"grad_norm": 1.0,
"learning_rate": 0.0004941086236904923,
"loss": 6.2043,
"mean_token_accuracy": 0.14727460145950316,
"num_tokens": 3605159.0,
"step": 1750
},
{
"entropy": 6.481395721435547,
"epoch": 1.557478916999556,
"grad_norm": 1.0859375,
"learning_rate": 0.0004940300554406909,
"loss": 6.3012,
"mean_token_accuracy": 0.14313508197665215,
"num_tokens": 3615254.0,
"step": 1755
},
{
"entropy": 6.445766162872315,
"epoch": 1.5619174434087881,
"grad_norm": 1.0390625,
"learning_rate": 0.000493950973799405,
"loss": 6.1703,
"mean_token_accuracy": 0.15018191039562226,
"num_tokens": 3625015.0,
"step": 1760
},
{
"entropy": 6.42508454322815,
"epoch": 1.5663559698180203,
"grad_norm": 1.171875,
"learning_rate": 0.0004938713789519967,
"loss": 6.2497,
"mean_token_accuracy": 0.1505135826766491,
"num_tokens": 3636083.0,
"step": 1765
},
{
"entropy": 6.512313747406006,
"epoch": 1.5707944962272524,
"grad_norm": 1.2265625,
"learning_rate": 0.0004937912710850309,
"loss": 6.166,
"mean_token_accuracy": 0.1465531922876835,
"num_tokens": 3646363.0,
"step": 1770
},
{
"entropy": 6.370706844329834,
"epoch": 1.5752330226364846,
"grad_norm": 1.046875,
"learning_rate": 0.0004937106503862749,
"loss": 6.1685,
"mean_token_accuracy": 0.1537150263786316,
"num_tokens": 3656868.0,
"step": 1775
},
{
"entropy": 6.539106035232544,
"epoch": 1.5796715490457167,
"grad_norm": 1.1953125,
"learning_rate": 0.0004936295170446981,
"loss": 6.3492,
"mean_token_accuracy": 0.1347063384950161,
"num_tokens": 3668105.0,
"step": 1780
},
{
"entropy": 6.607371664047241,
"epoch": 1.5841100754549489,
"grad_norm": 1.0234375,
"learning_rate": 0.0004935478712504715,
"loss": 6.2487,
"mean_token_accuracy": 0.1385604441165924,
"num_tokens": 3678841.0,
"step": 1785
},
{
"entropy": 6.4086525440216064,
"epoch": 1.588548601864181,
"grad_norm": 1.125,
"learning_rate": 0.0004934657131949674,
"loss": 6.2415,
"mean_token_accuracy": 0.14987936168909072,
"num_tokens": 3688603.0,
"step": 1790
},
{
"entropy": 6.529016494750977,
"epoch": 1.5929871282734132,
"grad_norm": 1.359375,
"learning_rate": 0.0004933830430707585,
"loss": 6.2542,
"mean_token_accuracy": 0.13600879460573195,
"num_tokens": 3698312.0,
"step": 1795
},
{
"entropy": 6.4327093124389645,
"epoch": 1.5974256546826453,
"grad_norm": 1.046875,
"learning_rate": 0.000493299861071618,
"loss": 6.1204,
"mean_token_accuracy": 0.15229299366474153,
"num_tokens": 3708252.0,
"step": 1800
},
{
"entropy": 6.483391284942627,
"epoch": 1.6018641810918774,
"grad_norm": 1.1015625,
"learning_rate": 0.0004932161673925189,
"loss": 6.1691,
"mean_token_accuracy": 0.1462477594614029,
"num_tokens": 3718431.0,
"step": 1805
},
{
"entropy": 6.433411121368408,
"epoch": 1.6063027075011096,
"grad_norm": 1.0078125,
"learning_rate": 0.0004931319622296333,
"loss": 6.0884,
"mean_token_accuracy": 0.15784337967634202,
"num_tokens": 3729170.0,
"step": 1810
},
{
"entropy": 6.474455261230469,
"epoch": 1.6107412339103417,
"grad_norm": 1.140625,
"learning_rate": 0.0004930472457803324,
"loss": 6.1861,
"mean_token_accuracy": 0.1482206791639328,
"num_tokens": 3738885.0,
"step": 1815
},
{
"entropy": 6.340183973312378,
"epoch": 1.6151797603195739,
"grad_norm": 1.1640625,
"learning_rate": 0.0004929620182431858,
"loss": 6.1744,
"mean_token_accuracy": 0.15203531160950662,
"num_tokens": 3748535.0,
"step": 1820
},
{
"entropy": 6.444498491287232,
"epoch": 1.619618286728806,
"grad_norm": 1.0390625,
"learning_rate": 0.0004928762798179612,
"loss": 6.237,
"mean_token_accuracy": 0.14974780827760698,
"num_tokens": 3758827.0,
"step": 1825
},
{
"entropy": 6.455253171920776,
"epoch": 1.6240568131380382,
"grad_norm": 1.046875,
"learning_rate": 0.0004927900307056233,
"loss": 6.1615,
"mean_token_accuracy": 0.1510964810848236,
"num_tokens": 3768632.0,
"step": 1830
},
{
"entropy": 6.441723012924195,
"epoch": 1.6284953395472703,
"grad_norm": 1.09375,
"learning_rate": 0.0004927032711083342,
"loss": 6.214,
"mean_token_accuracy": 0.14101684093475342,
"num_tokens": 3779324.0,
"step": 1835
},
{
"entropy": 6.381724882125854,
"epoch": 1.6329338659565025,
"grad_norm": 1.0546875,
"learning_rate": 0.0004926160012294526,
"loss": 6.1586,
"mean_token_accuracy": 0.15024627447128297,
"num_tokens": 3789744.0,
"step": 1840
},
{
"entropy": 6.370701789855957,
"epoch": 1.6373723923657346,
"grad_norm": 1.1171875,
"learning_rate": 0.000492528221273533,
"loss": 6.1104,
"mean_token_accuracy": 0.1493580684065819,
"num_tokens": 3799831.0,
"step": 1845
},
{
"entropy": 6.542438220977783,
"epoch": 1.6418109187749668,
"grad_norm": 1.078125,
"learning_rate": 0.0004924399314463258,
"loss": 6.2365,
"mean_token_accuracy": 0.14592818170785904,
"num_tokens": 3812102.0,
"step": 1850
},
{
"entropy": 6.4679584980010985,
"epoch": 1.646249445184199,
"grad_norm": 1.03125,
"learning_rate": 0.0004923511319547761,
"loss": 6.2914,
"mean_token_accuracy": 0.13645976781845093,
"num_tokens": 3822750.0,
"step": 1855
},
{
"entropy": 6.439510631561279,
"epoch": 1.650687971593431,
"grad_norm": 1.0546875,
"learning_rate": 0.000492261823007024,
"loss": 6.2064,
"mean_token_accuracy": 0.1489210918545723,
"num_tokens": 3832354.0,
"step": 1860
},
{
"entropy": 6.458003902435303,
"epoch": 1.6551264980026632,
"grad_norm": 1.1015625,
"learning_rate": 0.0004921720048124034,
"loss": 6.2224,
"mean_token_accuracy": 0.1468009516596794,
"num_tokens": 3842930.0,
"step": 1865
},
{
"entropy": 6.5039207458496096,
"epoch": 1.6595650244118954,
"grad_norm": 1.171875,
"learning_rate": 0.0004920816775814422,
"loss": 6.2599,
"mean_token_accuracy": 0.14020814523100852,
"num_tokens": 3852952.0,
"step": 1870
},
{
"entropy": 6.454715347290039,
"epoch": 1.6640035508211275,
"grad_norm": 1.1484375,
"learning_rate": 0.0004919908415258612,
"loss": 6.2067,
"mean_token_accuracy": 0.14455220550298692,
"num_tokens": 3863070.0,
"step": 1875
},
{
"entropy": 6.4132616996765135,
"epoch": 1.6684420772303596,
"grad_norm": 1.1484375,
"learning_rate": 0.000491899496858574,
"loss": 6.1501,
"mean_token_accuracy": 0.15156037211418152,
"num_tokens": 3872767.0,
"step": 1880
},
{
"entropy": 6.3353992938995365,
"epoch": 1.6728806036395918,
"grad_norm": 1.0546875,
"learning_rate": 0.0004918076437936859,
"loss": 6.1056,
"mean_token_accuracy": 0.15438561514019966,
"num_tokens": 3883183.0,
"step": 1885
},
{
"entropy": 6.433599185943604,
"epoch": 1.677319130048824,
"grad_norm": 0.9921875,
"learning_rate": 0.0004917152825464947,
"loss": 6.1996,
"mean_token_accuracy": 0.1471118450164795,
"num_tokens": 3893304.0,
"step": 1890
},
{
"entropy": 6.44781608581543,
"epoch": 1.681757656458056,
"grad_norm": 1.0,
"learning_rate": 0.0004916224133334885,
"loss": 6.135,
"mean_token_accuracy": 0.1504994697868824,
"num_tokens": 3903786.0,
"step": 1895
},
{
"entropy": 6.413273906707763,
"epoch": 1.686196182867288,
"grad_norm": 1.1171875,
"learning_rate": 0.0004915290363723465,
"loss": 6.1426,
"mean_token_accuracy": 0.14888948425650597,
"num_tokens": 3913703.0,
"step": 1900
},
{
"entropy": 6.3861230373382565,
"epoch": 1.6906347092765202,
"grad_norm": 0.96875,
"learning_rate": 0.0004914351518819379,
"loss": 6.197,
"mean_token_accuracy": 0.14716671407222748,
"num_tokens": 3923653.0,
"step": 1905
},
{
"entropy": 6.3618451118469235,
"epoch": 1.6950732356857523,
"grad_norm": 1.1875,
"learning_rate": 0.0004913407600823216,
"loss": 6.0837,
"mean_token_accuracy": 0.15539871603250505,
"num_tokens": 3933915.0,
"step": 1910
},
{
"entropy": 6.429026556015015,
"epoch": 1.6995117620949844,
"grad_norm": 1.109375,
"learning_rate": 0.0004912458611947454,
"loss": 6.1613,
"mean_token_accuracy": 0.14607803374528885,
"num_tokens": 3943334.0,
"step": 1915
},
{
"entropy": 6.512318658828735,
"epoch": 1.7039502885042166,
"grad_norm": 1.1015625,
"learning_rate": 0.000491150455441646,
"loss": 6.2164,
"mean_token_accuracy": 0.13555126562714576,
"num_tokens": 3952608.0,
"step": 1920
},
{
"entropy": 6.345305156707764,
"epoch": 1.7083888149134487,
"grad_norm": 1.0390625,
"learning_rate": 0.0004910545430466478,
"loss": 6.123,
"mean_token_accuracy": 0.1472136050462723,
"num_tokens": 3963398.0,
"step": 1925
},
{
"entropy": 6.38430609703064,
"epoch": 1.7128273413226809,
"grad_norm": 1.046875,
"learning_rate": 0.0004909581242345628,
"loss": 6.1552,
"mean_token_accuracy": 0.14694450199604034,
"num_tokens": 3973878.0,
"step": 1930
},
{
"entropy": 6.430195760726929,
"epoch": 1.717265867731913,
"grad_norm": 1.2109375,
"learning_rate": 0.0004908611992313905,
"loss": 6.1648,
"mean_token_accuracy": 0.13664614632725716,
"num_tokens": 3983681.0,
"step": 1935
},
{
"entropy": 6.39329776763916,
"epoch": 1.7217043941411452,
"grad_norm": 1.1953125,
"learning_rate": 0.0004907637682643162,
"loss": 6.201,
"mean_token_accuracy": 0.14567800536751746,
"num_tokens": 3995026.0,
"step": 1940
},
{
"entropy": 6.430534839630127,
"epoch": 1.7261429205503773,
"grad_norm": 1.1015625,
"learning_rate": 0.0004906658315617112,
"loss": 6.2022,
"mean_token_accuracy": 0.14595392793416978,
"num_tokens": 4005089.0,
"step": 1945
},
{
"entropy": 6.359121513366699,
"epoch": 1.7305814469596092,
"grad_norm": 1.0078125,
"learning_rate": 0.0004905673893531331,
"loss": 6.1076,
"mean_token_accuracy": 0.15097568482160567,
"num_tokens": 4014795.0,
"step": 1950
},
{
"entropy": 6.326131105422974,
"epoch": 1.7350199733688414,
"grad_norm": 1.5703125,
"learning_rate": 0.0004904684418693231,
"loss": 6.1828,
"mean_token_accuracy": 0.14517654925584794,
"num_tokens": 4025563.0,
"step": 1955
},
{
"entropy": 6.499860239028931,
"epoch": 1.7394584997780735,
"grad_norm": 1.0546875,
"learning_rate": 0.0004903689893422077,
"loss": 6.116,
"mean_token_accuracy": 0.1486818477511406,
"num_tokens": 4035050.0,
"step": 1960
},
{
"entropy": 6.305110931396484,
"epoch": 1.7438970261873057,
"grad_norm": 0.984375,
"learning_rate": 0.0004902690320048966,
"loss": 6.1345,
"mean_token_accuracy": 0.14928318560123444,
"num_tokens": 4046109.0,
"step": 1965
},
{
"entropy": 6.449776601791382,
"epoch": 1.7483355525965378,
"grad_norm": 1.0703125,
"learning_rate": 0.000490168570091683,
"loss": 6.1848,
"mean_token_accuracy": 0.1390085846185684,
"num_tokens": 4056776.0,
"step": 1970
},
{
"entropy": 6.319344854354858,
"epoch": 1.75277407900577,
"grad_norm": 1.125,
"learning_rate": 0.0004900676038380429,
"loss": 6.0406,
"mean_token_accuracy": 0.16621824055910112,
"num_tokens": 4066326.0,
"step": 1975
},
{
"entropy": 6.454939699172973,
"epoch": 1.7572126054150021,
"grad_norm": 0.98828125,
"learning_rate": 0.0004899661334806342,
"loss": 6.1759,
"mean_token_accuracy": 0.15071096420288085,
"num_tokens": 4077478.0,
"step": 1980
},
{
"entropy": 6.262599611282349,
"epoch": 1.7616511318242343,
"grad_norm": 1.109375,
"learning_rate": 0.0004898641592572965,
"loss": 6.1057,
"mean_token_accuracy": 0.15066718459129333,
"num_tokens": 4087661.0,
"step": 1985
},
{
"entropy": 6.442129898071289,
"epoch": 1.7660896582334664,
"grad_norm": 1.0625,
"learning_rate": 0.0004897616814070505,
"loss": 6.1694,
"mean_token_accuracy": 0.15258410200476646,
"num_tokens": 4097450.0,
"step": 1990
},
{
"entropy": 6.382274055480957,
"epoch": 1.7705281846426986,
"grad_norm": 1.0546875,
"learning_rate": 0.0004896587001700972,
"loss": 6.2003,
"mean_token_accuracy": 0.14331723377108574,
"num_tokens": 4106850.0,
"step": 1995
},
{
"entropy": 6.4386186599731445,
"epoch": 1.7749667110519307,
"grad_norm": 0.9375,
"learning_rate": 0.0004895552157878174,
"loss": 6.2273,
"mean_token_accuracy": 0.1446727268397808,
"num_tokens": 4117561.0,
"step": 2000
},
{
"epoch": 1.7749667110519307,
"eval_entropy": 6.304367476574315,
"eval_loss": 6.241267681121826,
"eval_mean_token_accuracy": 0.14483241421876214,
"eval_num_tokens": 4117561.0,
"eval_runtime": 2.0862,
"eval_samples_per_second": 1613.972,
"eval_steps_per_second": 201.806,
"step": 2000
},
{
"entropy": 6.513484525680542,
"epoch": 1.7794052374611629,
"grad_norm": 1.1875,
"learning_rate": 0.0004894512285027717,
"loss": 6.1375,
"mean_token_accuracy": 0.15294163376092912,
"num_tokens": 4126913.0,
"step": 2005
},
{
"entropy": 6.32349796295166,
"epoch": 1.783843763870395,
"grad_norm": 1.046875,
"learning_rate": 0.0004893467385586991,
"loss": 6.1763,
"mean_token_accuracy": 0.14652613997459413,
"num_tokens": 4136501.0,
"step": 2010
},
{
"entropy": 6.455650901794433,
"epoch": 1.7882822902796272,
"grad_norm": 1.0234375,
"learning_rate": 0.000489241746200517,
"loss": 6.1304,
"mean_token_accuracy": 0.14899376183748245,
"num_tokens": 4147263.0,
"step": 2015
},
{
"entropy": 6.39251856803894,
"epoch": 1.7927208166888593,
"grad_norm": 0.91796875,
"learning_rate": 0.0004891362516743201,
"loss": 6.1805,
"mean_token_accuracy": 0.1439195953309536,
"num_tokens": 4159251.0,
"step": 2020
},
{
"entropy": 6.375892972946167,
"epoch": 1.7971593430980914,
"grad_norm": 1.03125,
"learning_rate": 0.0004890302552273805,
"loss": 6.1605,
"mean_token_accuracy": 0.14276045113801955,
"num_tokens": 4170601.0,
"step": 2025
},
{
"entropy": 6.455142402648926,
"epoch": 1.8015978695073236,
"grad_norm": 1.0703125,
"learning_rate": 0.0004889237571081465,
"loss": 6.1291,
"mean_token_accuracy": 0.1502329871058464,
"num_tokens": 4181650.0,
"step": 2030
},
{
"entropy": 6.3142640590667725,
"epoch": 1.8060363959165557,
"grad_norm": 1.0234375,
"learning_rate": 0.0004888167575662425,
"loss": 6.0242,
"mean_token_accuracy": 0.1540951281785965,
"num_tokens": 4191514.0,
"step": 2035
},
{
"entropy": 6.364542388916016,
"epoch": 1.8104749223257879,
"grad_norm": 1.0234375,
"learning_rate": 0.0004887092568524682,
"loss": 6.1543,
"mean_token_accuracy": 0.1545771673321724,
"num_tokens": 4200909.0,
"step": 2040
},
{
"entropy": 6.418929243087769,
"epoch": 1.81491344873502,
"grad_norm": 1.0625,
"learning_rate": 0.0004886012552187979,
"loss": 6.0958,
"mean_token_accuracy": 0.1500440776348114,
"num_tokens": 4211139.0,
"step": 2045
},
{
"entropy": 6.353375577926636,
"epoch": 1.8193519751442522,
"grad_norm": 0.89453125,
"learning_rate": 0.0004884927529183799,
"loss": 6.1404,
"mean_token_accuracy": 0.1507970094680786,
"num_tokens": 4221754.0,
"step": 2050
},
{
"entropy": 6.401797246932984,
"epoch": 1.8237905015534843,
"grad_norm": 1.0703125,
"learning_rate": 0.0004883837502055363,
"loss": 6.0354,
"mean_token_accuracy": 0.15554228723049163,
"num_tokens": 4232771.0,
"step": 2055
},
{
"entropy": 6.274783992767334,
"epoch": 1.8282290279627165,
"grad_norm": 1.0,
"learning_rate": 0.0004882742473357619,
"loss": 6.047,
"mean_token_accuracy": 0.162461756169796,
"num_tokens": 4242860.0,
"step": 2060
},
{
"entropy": 6.384546136856079,
"epoch": 1.8326675543719486,
"grad_norm": 0.98828125,
"learning_rate": 0.00048816424456572403,
"loss": 6.2057,
"mean_token_accuracy": 0.1450534589588642,
"num_tokens": 4253442.0,
"step": 2065
},
{
"entropy": 6.373266220092773,
"epoch": 1.8371060807811808,
"grad_norm": 1.171875,
"learning_rate": 0.0004880537421532618,
"loss": 6.1037,
"mean_token_accuracy": 0.14555230140686035,
"num_tokens": 4263856.0,
"step": 2070
},
{
"entropy": 6.2938440322875975,
"epoch": 1.841544607190413,
"grad_norm": 1.0546875,
"learning_rate": 0.00048794274035738515,
"loss": 6.0456,
"mean_token_accuracy": 0.158289635181427,
"num_tokens": 4274251.0,
"step": 2075
},
{
"entropy": 6.333366107940674,
"epoch": 1.845983133599645,
"grad_norm": 1.2109375,
"learning_rate": 0.0004878312394382747,
"loss": 6.0724,
"mean_token_accuracy": 0.15534539371728898,
"num_tokens": 4283486.0,
"step": 2080
},
{
"entropy": 6.355884695053101,
"epoch": 1.8504216600088772,
"grad_norm": 1.03125,
"learning_rate": 0.000487719239657281,
"loss": 6.168,
"mean_token_accuracy": 0.14514408335089685,
"num_tokens": 4293908.0,
"step": 2085
},
{
"entropy": 6.315519952774048,
"epoch": 1.8548601864181093,
"grad_norm": 1.03125,
"learning_rate": 0.000487606741276924,
"loss": 6.0074,
"mean_token_accuracy": 0.15041493326425553,
"num_tokens": 4303255.0,
"step": 2090
},
{
"entropy": 6.367549180984497,
"epoch": 1.8592987128273413,
"grad_norm": 1.5703125,
"learning_rate": 0.0004874937445608921,
"loss": 6.222,
"mean_token_accuracy": 0.14236995279788972,
"num_tokens": 4313981.0,
"step": 2095
},
{
"entropy": 6.414429569244385,
"epoch": 1.8637372392365734,
"grad_norm": 0.96875,
"learning_rate": 0.0004873802497740418,
"loss": 6.1659,
"mean_token_accuracy": 0.1489059269428253,
"num_tokens": 4325010.0,
"step": 2100
},
{
"entropy": 6.336979866027832,
"epoch": 1.8681757656458056,
"grad_norm": 1.078125,
"learning_rate": 0.0004872662571823973,
"loss": 6.142,
"mean_token_accuracy": 0.15032578706741334,
"num_tokens": 4336279.0,
"step": 2105
},
{
"entropy": 6.276753234863281,
"epoch": 1.8726142920550377,
"grad_norm": 0.984375,
"learning_rate": 0.00048715176705314936,
"loss": 6.0886,
"mean_token_accuracy": 0.15055317282676697,
"num_tokens": 4345816.0,
"step": 2110
},
{
"entropy": 6.390111589431763,
"epoch": 1.8770528184642699,
"grad_norm": 1.15625,
"learning_rate": 0.00048703677965465506,
"loss": 6.1546,
"mean_token_accuracy": 0.14694484174251557,
"num_tokens": 4356520.0,
"step": 2115
},
{
"entropy": 6.38926854133606,
"epoch": 1.881491344873502,
"grad_norm": 1.03125,
"learning_rate": 0.00048692129525643694,
"loss": 6.0455,
"mean_token_accuracy": 0.15440051704645158,
"num_tokens": 4367517.0,
"step": 2120
},
{
"entropy": 6.319567394256592,
"epoch": 1.8859298712827341,
"grad_norm": 1.140625,
"learning_rate": 0.00048680531412918267,
"loss": 6.1221,
"mean_token_accuracy": 0.14795979335904122,
"num_tokens": 4378043.0,
"step": 2125
},
{
"entropy": 6.339055061340332,
"epoch": 1.8903683976919663,
"grad_norm": 1.0703125,
"learning_rate": 0.0004866888365447439,
"loss": 6.1116,
"mean_token_accuracy": 0.15579188615083694,
"num_tokens": 4388098.0,
"step": 2130
},
{
"entropy": 6.342102432250977,
"epoch": 1.8948069241011984,
"grad_norm": 1.1640625,
"learning_rate": 0.0004865718627761363,
"loss": 6.0351,
"mean_token_accuracy": 0.16426317244768143,
"num_tokens": 4397745.0,
"step": 2135
},
{
"entropy": 6.255016899108886,
"epoch": 1.8992454505104306,
"grad_norm": 1.1015625,
"learning_rate": 0.0004864543930975383,
"loss": 6.1125,
"mean_token_accuracy": 0.1508719764649868,
"num_tokens": 4407995.0,
"step": 2140
},
{
"entropy": 6.372575426101685,
"epoch": 1.9036839769196625,
"grad_norm": 1.125,
"learning_rate": 0.0004863364277842908,
"loss": 6.0864,
"mean_token_accuracy": 0.1544354021549225,
"num_tokens": 4417574.0,
"step": 2145
},
{
"entropy": 6.287673425674439,
"epoch": 1.9081225033288947,
"grad_norm": 1.046875,
"learning_rate": 0.0004862179671128965,
"loss": 6.0029,
"mean_token_accuracy": 0.1653035208582878,
"num_tokens": 4428772.0,
"step": 2150
},
{
"entropy": 6.284837818145752,
"epoch": 1.9125610297381268,
"grad_norm": 1.1015625,
"learning_rate": 0.000486099011361019,
"loss": 6.0921,
"mean_token_accuracy": 0.156430184841156,
"num_tokens": 4438971.0,
"step": 2155
},
{
"entropy": 6.439360094070435,
"epoch": 1.916999556147359,
"grad_norm": 0.953125,
"learning_rate": 0.00048597956080748264,
"loss": 6.2184,
"mean_token_accuracy": 0.147563187032938,
"num_tokens": 4449685.0,
"step": 2160
},
{
"entropy": 6.310244178771972,
"epoch": 1.921438082556591,
"grad_norm": 1.0078125,
"learning_rate": 0.00048585961573227116,
"loss": 6.1103,
"mean_token_accuracy": 0.15256588608026506,
"num_tokens": 4460260.0,
"step": 2165
},
{
"entropy": 6.324094629287719,
"epoch": 1.9258766089658232,
"grad_norm": 1.1015625,
"learning_rate": 0.0004857391764165277,
"loss": 6.0654,
"mean_token_accuracy": 0.15756789296865464,
"num_tokens": 4471149.0,
"step": 2170
},
{
"entropy": 6.27415452003479,
"epoch": 1.9303151353750554,
"grad_norm": 1.0234375,
"learning_rate": 0.00048561824314255383,
"loss": 6.0969,
"mean_token_accuracy": 0.15434358417987823,
"num_tokens": 4481506.0,
"step": 2175
},
{
"entropy": 6.373397016525269,
"epoch": 1.9347536617842875,
"grad_norm": 1.015625,
"learning_rate": 0.00048549681619380886,
"loss": 6.1389,
"mean_token_accuracy": 0.14398213624954223,
"num_tokens": 4492541.0,
"step": 2180
},
{
"entropy": 6.348176717758179,
"epoch": 1.9391921881935197,
"grad_norm": 1.046875,
"learning_rate": 0.0004853748958549092,
"loss": 6.0879,
"mean_token_accuracy": 0.15113953053951262,
"num_tokens": 4502727.0,
"step": 2185
},
{
"entropy": 6.243179750442505,
"epoch": 1.9436307146027518,
"grad_norm": 1.1171875,
"learning_rate": 0.0004852524824116278,
"loss": 6.1136,
"mean_token_accuracy": 0.14689265042543412,
"num_tokens": 4512657.0,
"step": 2190
},
{
"entropy": 6.332787084579468,
"epoch": 1.948069241011984,
"grad_norm": 1.140625,
"learning_rate": 0.00048512957615089354,
"loss": 5.9777,
"mean_token_accuracy": 0.15856263190507888,
"num_tokens": 4522083.0,
"step": 2195
},
{
"entropy": 6.226612901687622,
"epoch": 1.9525077674212161,
"grad_norm": 1.0078125,
"learning_rate": 0.0004850061773607902,
"loss": 6.0255,
"mean_token_accuracy": 0.1586281806230545,
"num_tokens": 4531882.0,
"step": 2200
},
{
"entropy": 6.2661069393157955,
"epoch": 1.9569462938304483,
"grad_norm": 1.078125,
"learning_rate": 0.000484882286330556,
"loss": 6.0668,
"mean_token_accuracy": 0.15751879066228866,
"num_tokens": 4541724.0,
"step": 2205
},
{
"entropy": 6.290356159210205,
"epoch": 1.9613848202396804,
"grad_norm": 0.984375,
"learning_rate": 0.0004847579033505833,
"loss": 6.0823,
"mean_token_accuracy": 0.1551389679312706,
"num_tokens": 4551889.0,
"step": 2210
},
{
"entropy": 6.299551630020142,
"epoch": 1.9658233466489126,
"grad_norm": 1.015625,
"learning_rate": 0.0004846330287124171,
"loss": 6.1149,
"mean_token_accuracy": 0.1571243390440941,
"num_tokens": 4561792.0,
"step": 2215
},
{
"entropy": 6.349295568466187,
"epoch": 1.9702618730581447,
"grad_norm": 1.0078125,
"learning_rate": 0.00048450766270875513,
"loss": 6.0104,
"mean_token_accuracy": 0.1578826203942299,
"num_tokens": 4572021.0,
"step": 2220
},
{
"entropy": 6.304033708572388,
"epoch": 1.9747003994673769,
"grad_norm": 1.03125,
"learning_rate": 0.00048438180563344666,
"loss": 6.0659,
"mean_token_accuracy": 0.15220063626766206,
"num_tokens": 4582800.0,
"step": 2225
},
{
"entropy": 6.356626272201538,
"epoch": 1.979138925876609,
"grad_norm": 1.046875,
"learning_rate": 0.00048425545778149213,
"loss": 6.1376,
"mean_token_accuracy": 0.1478087991476059,
"num_tokens": 4593035.0,
"step": 2230
},
{
"entropy": 6.293792295455932,
"epoch": 1.9835774522858411,
"grad_norm": 1.0859375,
"learning_rate": 0.0004841286194490423,
"loss": 6.0004,
"mean_token_accuracy": 0.1586893692612648,
"num_tokens": 4602625.0,
"step": 2235
},
{
"entropy": 6.298813009262085,
"epoch": 1.9880159786950733,
"grad_norm": 0.95703125,
"learning_rate": 0.00048400129093339745,
"loss": 6.0939,
"mean_token_accuracy": 0.15187210515141486,
"num_tokens": 4613419.0,
"step": 2240
},
{
"entropy": 6.2934352397918705,
"epoch": 1.9924545051043054,
"grad_norm": 1.2578125,
"learning_rate": 0.00048387347253300703,
"loss": 6.0592,
"mean_token_accuracy": 0.15442992970347405,
"num_tokens": 4622575.0,
"step": 2245
},
{
"entropy": 6.2924830436706545,
"epoch": 1.9968930315135376,
"grad_norm": 1.0546875,
"learning_rate": 0.0004837451645474685,
"loss": 6.0589,
"mean_token_accuracy": 0.15284667909145355,
"num_tokens": 4632497.0,
"step": 2250
},
{
"entropy": 6.336415661705865,
"epoch": 2.0008877052818463,
"grad_norm": 1.0390625,
"learning_rate": 0.00048361636727752716,
"loss": 6.0301,
"mean_token_accuracy": 0.15711821946832868,
"num_tokens": 4641305.0,
"step": 2255
},
{
"entropy": 6.320528984069824,
"epoch": 2.0053262316910785,
"grad_norm": 1.109375,
"learning_rate": 0.000483487081025075,
"loss": 5.826,
"mean_token_accuracy": 0.16330702155828475,
"num_tokens": 4650986.0,
"step": 2260
},
{
"entropy": 6.267225694656372,
"epoch": 2.0097647581003106,
"grad_norm": 1.015625,
"learning_rate": 0.00048335730609315,
"loss": 5.7919,
"mean_token_accuracy": 0.165120992064476,
"num_tokens": 4661836.0,
"step": 2265
},
{
"entropy": 6.285591506958008,
"epoch": 2.014203284509543,
"grad_norm": 1.078125,
"learning_rate": 0.00048322704278593595,
"loss": 5.7822,
"mean_token_accuracy": 0.1718212589621544,
"num_tokens": 4671325.0,
"step": 2270
},
{
"entropy": 6.2631378173828125,
"epoch": 2.018641810918775,
"grad_norm": 1.0390625,
"learning_rate": 0.00048309629140876097,
"loss": 5.7983,
"mean_token_accuracy": 0.16487672328948974,
"num_tokens": 4682334.0,
"step": 2275
},
{
"entropy": 6.278176546096802,
"epoch": 2.023080337328007,
"grad_norm": 1.0078125,
"learning_rate": 0.0004829650522680974,
"loss": 5.8037,
"mean_token_accuracy": 0.16945539861917497,
"num_tokens": 4691486.0,
"step": 2280
},
{
"entropy": 6.2450908660888675,
"epoch": 2.027518863737239,
"grad_norm": 1.0546875,
"learning_rate": 0.0004828333256715609,
"loss": 5.7808,
"mean_token_accuracy": 0.1654707446694374,
"num_tokens": 4700841.0,
"step": 2285
},
{
"entropy": 6.16944465637207,
"epoch": 2.0319573901464714,
"grad_norm": 1.015625,
"learning_rate": 0.0004827011119279096,
"loss": 5.7364,
"mean_token_accuracy": 0.17380234599113464,
"num_tokens": 4709842.0,
"step": 2290
},
{
"entropy": 6.2213818550109865,
"epoch": 2.0363959165557035,
"grad_norm": 1.015625,
"learning_rate": 0.00048256841134704335,
"loss": 5.7495,
"mean_token_accuracy": 0.1679978162050247,
"num_tokens": 4720193.0,
"step": 2295
},
{
"entropy": 6.182414245605469,
"epoch": 2.0408344429649357,
"grad_norm": 1.03125,
"learning_rate": 0.00048243522424000333,
"loss": 5.8063,
"mean_token_accuracy": 0.1693178117275238,
"num_tokens": 4729503.0,
"step": 2300
},
{
"entropy": 6.248026180267334,
"epoch": 2.045272969374168,
"grad_norm": 1.0390625,
"learning_rate": 0.000482301550918971,
"loss": 5.7874,
"mean_token_accuracy": 0.17118435055017472,
"num_tokens": 4740241.0,
"step": 2305
},
{
"entropy": 6.120760440826416,
"epoch": 2.0497114957834,
"grad_norm": 0.99609375,
"learning_rate": 0.0004821673916972676,
"loss": 5.676,
"mean_token_accuracy": 0.18444487154483796,
"num_tokens": 4749616.0,
"step": 2310
},
{
"entropy": 6.1944496631622314,
"epoch": 2.054150022192632,
"grad_norm": 1.0859375,
"learning_rate": 0.000482032746889353,
"loss": 5.7767,
"mean_token_accuracy": 0.16697147488594055,
"num_tokens": 4759846.0,
"step": 2315
},
{
"entropy": 6.24187216758728,
"epoch": 2.0585885486018642,
"grad_norm": 1.078125,
"learning_rate": 0.00048189761681082557,
"loss": 5.8296,
"mean_token_accuracy": 0.16175905466079712,
"num_tokens": 4769441.0,
"step": 2320
},
{
"entropy": 6.2141406536102295,
"epoch": 2.0630270750110964,
"grad_norm": 1.1875,
"learning_rate": 0.0004817620017784209,
"loss": 5.7617,
"mean_token_accuracy": 0.16938935965299606,
"num_tokens": 4779962.0,
"step": 2325
},
{
"entropy": 6.242314195632934,
"epoch": 2.0674656014203285,
"grad_norm": 1.078125,
"learning_rate": 0.00048162590211001143,
"loss": 5.8326,
"mean_token_accuracy": 0.16407378911972045,
"num_tokens": 4790275.0,
"step": 2330
},
{
"entropy": 6.061077022552491,
"epoch": 2.0719041278295607,
"grad_norm": 1.0859375,
"learning_rate": 0.00048148931812460536,
"loss": 5.7234,
"mean_token_accuracy": 0.17769070863723754,
"num_tokens": 4800799.0,
"step": 2335
},
{
"entropy": 6.300735187530518,
"epoch": 2.076342654238793,
"grad_norm": 1.1875,
"learning_rate": 0.0004813522501423464,
"loss": 5.8311,
"mean_token_accuracy": 0.16275566965341567,
"num_tokens": 4811786.0,
"step": 2340
},
{
"entropy": 6.152251577377319,
"epoch": 2.080781180648025,
"grad_norm": 1.0625,
"learning_rate": 0.0004812146984845124,
"loss": 5.7383,
"mean_token_accuracy": 0.17451401948928832,
"num_tokens": 4821321.0,
"step": 2345
},
{
"entropy": 6.21392674446106,
"epoch": 2.085219707057257,
"grad_norm": 1.0234375,
"learning_rate": 0.00048107666347351505,
"loss": 5.7691,
"mean_token_accuracy": 0.17131485641002656,
"num_tokens": 4831418.0,
"step": 2350
},
{
"entropy": 6.152781057357788,
"epoch": 2.0896582334664893,
"grad_norm": 0.984375,
"learning_rate": 0.00048093814543289894,
"loss": 5.7544,
"mean_token_accuracy": 0.1736764594912529,
"num_tokens": 4843326.0,
"step": 2355
},
{
"entropy": 6.162942695617676,
"epoch": 2.0940967598757214,
"grad_norm": 1.1796875,
"learning_rate": 0.00048079914468734117,
"loss": 5.7209,
"mean_token_accuracy": 0.17366211116313934,
"num_tokens": 4853946.0,
"step": 2360
},
{
"entropy": 6.194116878509521,
"epoch": 2.0985352862849536,
"grad_norm": 1.1171875,
"learning_rate": 0.00048065966156264964,
"loss": 5.761,
"mean_token_accuracy": 0.1711730867624283,
"num_tokens": 4863494.0,
"step": 2365
},
{
"entropy": 6.145648765563965,
"epoch": 2.1029738126941857,
"grad_norm": 1.1484375,
"learning_rate": 0.00048051969638576345,
"loss": 5.749,
"mean_token_accuracy": 0.16969802528619765,
"num_tokens": 4872583.0,
"step": 2370
},
{
"entropy": 6.198772192001343,
"epoch": 2.107412339103418,
"grad_norm": 0.97265625,
"learning_rate": 0.00048037924948475134,
"loss": 5.6999,
"mean_token_accuracy": 0.18126114159822465,
"num_tokens": 4882333.0,
"step": 2375
},
{
"entropy": 6.133423471450806,
"epoch": 2.11185086551265,
"grad_norm": 1.0703125,
"learning_rate": 0.0004802383211888114,
"loss": 5.8388,
"mean_token_accuracy": 0.16247562766075135,
"num_tokens": 4892874.0,
"step": 2380
},
{
"entropy": 6.190569829940796,
"epoch": 2.116289391921882,
"grad_norm": 1.0,
"learning_rate": 0.0004800969118282697,
"loss": 5.7077,
"mean_token_accuracy": 0.17178617119789125,
"num_tokens": 4903666.0,
"step": 2385
},
{
"entropy": 6.148941993713379,
"epoch": 2.120727918331114,
"grad_norm": 1.0390625,
"learning_rate": 0.0004799550217345803,
"loss": 5.8135,
"mean_token_accuracy": 0.16479915231466294,
"num_tokens": 4913565.0,
"step": 2390
},
{
"entropy": 6.25219759941101,
"epoch": 2.125166444740346,
"grad_norm": 1.015625,
"learning_rate": 0.00047981265124032375,
"loss": 5.8806,
"mean_token_accuracy": 0.16119145303964616,
"num_tokens": 4924664.0,
"step": 2395
},
{
"entropy": 6.1365477561950685,
"epoch": 2.129604971149578,
"grad_norm": 1.015625,
"learning_rate": 0.00047966980067920686,
"loss": 5.787,
"mean_token_accuracy": 0.16446771174669267,
"num_tokens": 4935361.0,
"step": 2400
},
{
"entropy": 6.212709236145019,
"epoch": 2.1340434975588103,
"grad_norm": 0.96484375,
"learning_rate": 0.00047952647038606157,
"loss": 5.7139,
"mean_token_accuracy": 0.1764111801981926,
"num_tokens": 4946954.0,
"step": 2405
},
{
"entropy": 6.166495609283447,
"epoch": 2.1384820239680424,
"grad_norm": 1.1484375,
"learning_rate": 0.0004793826606968443,
"loss": 5.8285,
"mean_token_accuracy": 0.1607503190636635,
"num_tokens": 4957497.0,
"step": 2410
},
{
"entropy": 6.101367950439453,
"epoch": 2.1429205503772746,
"grad_norm": 1.1640625,
"learning_rate": 0.000479238371948635,
"loss": 5.7757,
"mean_token_accuracy": 0.16357363164424896,
"num_tokens": 4968069.0,
"step": 2415
},
{
"entropy": 6.219218921661377,
"epoch": 2.1473590767865067,
"grad_norm": 1.0625,
"learning_rate": 0.0004790936044796369,
"loss": 5.7844,
"mean_token_accuracy": 0.17338328510522844,
"num_tokens": 4978417.0,
"step": 2420
},
{
"entropy": 6.17771635055542,
"epoch": 2.151797603195739,
"grad_norm": 1.1015625,
"learning_rate": 0.00047894835862917473,
"loss": 5.7621,
"mean_token_accuracy": 0.16970881968736648,
"num_tokens": 4989670.0,
"step": 2425
},
{
"entropy": 6.143991899490357,
"epoch": 2.156236129604971,
"grad_norm": 0.9921875,
"learning_rate": 0.00047880263473769514,
"loss": 5.8096,
"mean_token_accuracy": 0.16401513367891313,
"num_tokens": 5000346.0,
"step": 2430
},
{
"entropy": 6.209756994247437,
"epoch": 2.160674656014203,
"grad_norm": 1.078125,
"learning_rate": 0.0004786564331467648,
"loss": 5.7988,
"mean_token_accuracy": 0.16377755850553513,
"num_tokens": 5011878.0,
"step": 2435
},
{
"entropy": 6.224458789825439,
"epoch": 2.1651131824234353,
"grad_norm": 1.0234375,
"learning_rate": 0.00047850975419907034,
"loss": 5.8718,
"mean_token_accuracy": 0.162304849922657,
"num_tokens": 5022939.0,
"step": 2440
},
{
"entropy": 6.232002401351929,
"epoch": 2.1695517088326675,
"grad_norm": 1.1953125,
"learning_rate": 0.00047836259823841716,
"loss": 5.7963,
"mean_token_accuracy": 0.1669462203979492,
"num_tokens": 5033613.0,
"step": 2445
},
{
"entropy": 6.125792789459228,
"epoch": 2.1739902352418996,
"grad_norm": 1.0625,
"learning_rate": 0.0004782149656097287,
"loss": 5.7654,
"mean_token_accuracy": 0.1679580643773079,
"num_tokens": 5043926.0,
"step": 2450
},
{
"entropy": 6.151848697662354,
"epoch": 2.1784287616511318,
"grad_norm": 1.0859375,
"learning_rate": 0.00047806685665904586,
"loss": 5.8006,
"mean_token_accuracy": 0.17178182303905487,
"num_tokens": 5054179.0,
"step": 2455
},
{
"entropy": 6.080358839035034,
"epoch": 2.182867288060364,
"grad_norm": 1.140625,
"learning_rate": 0.0004779182717335258,
"loss": 5.7625,
"mean_token_accuracy": 0.16996095776557923,
"num_tokens": 5063654.0,
"step": 2460
},
{
"entropy": 6.169263648986816,
"epoch": 2.187305814469596,
"grad_norm": 1.078125,
"learning_rate": 0.00047776921118144154,
"loss": 5.8695,
"mean_token_accuracy": 0.1624024137854576,
"num_tokens": 5073558.0,
"step": 2465
},
{
"entropy": 6.250872087478638,
"epoch": 2.191744340878828,
"grad_norm": 1.0625,
"learning_rate": 0.00047761967535218084,
"loss": 5.8175,
"mean_token_accuracy": 0.16334515810012817,
"num_tokens": 5083218.0,
"step": 2470
},
{
"entropy": 6.116773986816407,
"epoch": 2.1961828672880603,
"grad_norm": 1.0859375,
"learning_rate": 0.0004774696645962453,
"loss": 5.7848,
"mean_token_accuracy": 0.17051488161087036,
"num_tokens": 5093037.0,
"step": 2475
},
{
"entropy": 6.085236072540283,
"epoch": 2.2006213936972925,
"grad_norm": 1.015625,
"learning_rate": 0.0004773191792652501,
"loss": 5.7379,
"mean_token_accuracy": 0.17253995835781097,
"num_tokens": 5103434.0,
"step": 2480
},
{
"entropy": 6.203386831283569,
"epoch": 2.2050599201065246,
"grad_norm": 1.046875,
"learning_rate": 0.0004771682197119224,
"loss": 5.8513,
"mean_token_accuracy": 0.16081491261720657,
"num_tokens": 5113325.0,
"step": 2485
},
{
"entropy": 6.135442781448364,
"epoch": 2.2094984465157568,
"grad_norm": 1.0625,
"learning_rate": 0.00047701678629010115,
"loss": 5.812,
"mean_token_accuracy": 0.16577334851026534,
"num_tokens": 5124957.0,
"step": 2490
},
{
"entropy": 6.2259856224060055,
"epoch": 2.213936972924989,
"grad_norm": 1.0859375,
"learning_rate": 0.0004768648793547359,
"loss": 5.7559,
"mean_token_accuracy": 0.17162533700466157,
"num_tokens": 5134491.0,
"step": 2495
},
{
"entropy": 6.040803050994873,
"epoch": 2.218375499334221,
"grad_norm": 1.0390625,
"learning_rate": 0.0004767124992618863,
"loss": 5.7236,
"mean_token_accuracy": 0.17656566202640533,
"num_tokens": 5145063.0,
"step": 2500
},
{
"epoch": 2.218375499334221,
"eval_entropy": 5.758825140157958,
"eval_loss": 6.117055416107178,
"eval_mean_token_accuracy": 0.15501565050838112,
"eval_num_tokens": 5145063.0,
"eval_runtime": 2.0862,
"eval_samples_per_second": 1613.95,
"eval_steps_per_second": 201.804,
"step": 2500
},
{
"entropy": 6.138974285125732,
"epoch": 2.222814025743453,
"grad_norm": 1.203125,
"learning_rate": 0.0004765596463687207,
"loss": 5.839,
"mean_token_accuracy": 0.16339409202337266,
"num_tokens": 5155396.0,
"step": 2505
},
{
"entropy": 6.151093578338623,
"epoch": 2.2272525521526854,
"grad_norm": 1.046875,
"learning_rate": 0.00047640632103351576,
"loss": 5.7831,
"mean_token_accuracy": 0.16532318145036698,
"num_tokens": 5166499.0,
"step": 2510
},
{
"entropy": 6.171177387237549,
"epoch": 2.2316910785619175,
"grad_norm": 1.1484375,
"learning_rate": 0.00047625252361565586,
"loss": 5.8143,
"mean_token_accuracy": 0.1652636408805847,
"num_tokens": 5177530.0,
"step": 2515
},
{
"entropy": 6.115115642547607,
"epoch": 2.2361296049711497,
"grad_norm": 1.21875,
"learning_rate": 0.00047609825447563137,
"loss": 5.6925,
"mean_token_accuracy": 0.1710483983159065,
"num_tokens": 5187427.0,
"step": 2520
},
{
"entropy": 6.033501386642456,
"epoch": 2.240568131380382,
"grad_norm": 1.1015625,
"learning_rate": 0.0004759435139750388,
"loss": 5.6936,
"mean_token_accuracy": 0.17407233715057374,
"num_tokens": 5198888.0,
"step": 2525
},
{
"entropy": 6.088896322250366,
"epoch": 2.245006657789614,
"grad_norm": 1.109375,
"learning_rate": 0.00047578830247657915,
"loss": 5.6968,
"mean_token_accuracy": 0.17464374303817748,
"num_tokens": 5208463.0,
"step": 2530
},
{
"entropy": 6.135959005355835,
"epoch": 2.249445184198846,
"grad_norm": 1.171875,
"learning_rate": 0.00047563262034405773,
"loss": 5.8129,
"mean_token_accuracy": 0.16065521836280822,
"num_tokens": 5219989.0,
"step": 2535
},
{
"entropy": 6.196387863159179,
"epoch": 2.2538837106080782,
"grad_norm": 1.15625,
"learning_rate": 0.00047547646794238277,
"loss": 5.823,
"mean_token_accuracy": 0.16879613399505616,
"num_tokens": 5231443.0,
"step": 2540
},
{
"entropy": 6.069067049026489,
"epoch": 2.2583222370173104,
"grad_norm": 1.1484375,
"learning_rate": 0.0004753198456375647,
"loss": 5.7687,
"mean_token_accuracy": 0.17048330157995223,
"num_tokens": 5241633.0,
"step": 2545
},
{
"entropy": 6.197365951538086,
"epoch": 2.2627607634265425,
"grad_norm": 1.0546875,
"learning_rate": 0.0004751627537967158,
"loss": 5.7616,
"mean_token_accuracy": 0.17182915061712264,
"num_tokens": 5252486.0,
"step": 2550
},
{
"entropy": 6.106606483459473,
"epoch": 2.2671992898357747,
"grad_norm": 1.015625,
"learning_rate": 0.00047500519278804835,
"loss": 5.7842,
"mean_token_accuracy": 0.16441592425107956,
"num_tokens": 5262672.0,
"step": 2555
},
{
"entropy": 6.161299324035644,
"epoch": 2.271637816245007,
"grad_norm": 1.046875,
"learning_rate": 0.0004748471629808746,
"loss": 5.7257,
"mean_token_accuracy": 0.1692223384976387,
"num_tokens": 5273547.0,
"step": 2560
},
{
"entropy": 6.044488430023193,
"epoch": 2.276076342654239,
"grad_norm": 1.0078125,
"learning_rate": 0.00047468866474560575,
"loss": 5.7477,
"mean_token_accuracy": 0.1677919000387192,
"num_tokens": 5284935.0,
"step": 2565
},
{
"entropy": 6.1366087913513185,
"epoch": 2.280514869063471,
"grad_norm": 1.1328125,
"learning_rate": 0.00047452969845375074,
"loss": 5.7731,
"mean_token_accuracy": 0.17664981484413148,
"num_tokens": 5295237.0,
"step": 2570
},
{
"entropy": 6.143746471405029,
"epoch": 2.2849533954727033,
"grad_norm": 1.15625,
"learning_rate": 0.0004743702644779157,
"loss": 5.8109,
"mean_token_accuracy": 0.16415809839963913,
"num_tokens": 5305288.0,
"step": 2575
},
{
"entropy": 6.148390245437622,
"epoch": 2.2893919218819354,
"grad_norm": 0.98828125,
"learning_rate": 0.000474210363191803,
"loss": 5.7359,
"mean_token_accuracy": 0.1691213622689247,
"num_tokens": 5316031.0,
"step": 2580
},
{
"entropy": 6.067453241348266,
"epoch": 2.2938304482911676,
"grad_norm": 1.0390625,
"learning_rate": 0.0004740499949702103,
"loss": 5.7778,
"mean_token_accuracy": 0.16342108249664306,
"num_tokens": 5327544.0,
"step": 2585
},
{
"entropy": 6.038386487960816,
"epoch": 2.2982689747003997,
"grad_norm": 1.109375,
"learning_rate": 0.0004738891601890298,
"loss": 5.718,
"mean_token_accuracy": 0.17032305002212525,
"num_tokens": 5338282.0,
"step": 2590
},
{
"entropy": 6.144178962707519,
"epoch": 2.302707501109632,
"grad_norm": 1.078125,
"learning_rate": 0.0004737278592252473,
"loss": 5.7589,
"mean_token_accuracy": 0.17450494766235353,
"num_tokens": 5348300.0,
"step": 2595
},
{
"entropy": 6.15695972442627,
"epoch": 2.3071460275188636,
"grad_norm": 0.98828125,
"learning_rate": 0.0004735660924569411,
"loss": 5.8636,
"mean_token_accuracy": 0.16162828356027603,
"num_tokens": 5360193.0,
"step": 2600
},
{
"entropy": 6.121260452270508,
"epoch": 2.3115845539280957,
"grad_norm": 1.0703125,
"learning_rate": 0.0004734038602632815,
"loss": 5.7297,
"mean_token_accuracy": 0.1731833279132843,
"num_tokens": 5369655.0,
"step": 2605
},
{
"entropy": 6.111371564865112,
"epoch": 2.316023080337328,
"grad_norm": 0.94921875,
"learning_rate": 0.00047324116302452975,
"loss": 5.792,
"mean_token_accuracy": 0.16499196141958236,
"num_tokens": 5379654.0,
"step": 2610
},
{
"entropy": 6.121448135375976,
"epoch": 2.32046160674656,
"grad_norm": 1.0625,
"learning_rate": 0.0004730780011220369,
"loss": 5.7201,
"mean_token_accuracy": 0.17435721009969712,
"num_tokens": 5389527.0,
"step": 2615
},
{
"entropy": 6.137268733978272,
"epoch": 2.324900133155792,
"grad_norm": 1.0390625,
"learning_rate": 0.0004729143749382435,
"loss": 5.8075,
"mean_token_accuracy": 0.1641774520277977,
"num_tokens": 5399480.0,
"step": 2620
},
{
"entropy": 6.093860912322998,
"epoch": 2.3293386595650243,
"grad_norm": 1.015625,
"learning_rate": 0.00047275028485667793,
"loss": 5.6667,
"mean_token_accuracy": 0.17897211164236068,
"num_tokens": 5410065.0,
"step": 2625
},
{
"entropy": 6.025512218475342,
"epoch": 2.3337771859742564,
"grad_norm": 1.1171875,
"learning_rate": 0.0004725857312619563,
"loss": 5.7156,
"mean_token_accuracy": 0.17173065543174743,
"num_tokens": 5419519.0,
"step": 2630
},
{
"entropy": 6.155104923248291,
"epoch": 2.3382157123834886,
"grad_norm": 1.03125,
"learning_rate": 0.0004724207145397809,
"loss": 5.7943,
"mean_token_accuracy": 0.1667987123131752,
"num_tokens": 5429907.0,
"step": 2635
},
{
"entropy": 6.147578144073487,
"epoch": 2.3426542387927207,
"grad_norm": 1.09375,
"learning_rate": 0.0004722552350769397,
"loss": 5.7846,
"mean_token_accuracy": 0.1689673498272896,
"num_tokens": 5440051.0,
"step": 2640
},
{
"entropy": 6.044529819488526,
"epoch": 2.347092765201953,
"grad_norm": 0.93359375,
"learning_rate": 0.00047208929326130535,
"loss": 5.7874,
"mean_token_accuracy": 0.16316695511341095,
"num_tokens": 5452596.0,
"step": 2645
},
{
"entropy": 6.1003374576568605,
"epoch": 2.351531291611185,
"grad_norm": 0.9921875,
"learning_rate": 0.00047192288948183394,
"loss": 5.8084,
"mean_token_accuracy": 0.15916725099086762,
"num_tokens": 5463133.0,
"step": 2650
},
{
"entropy": 6.074586248397827,
"epoch": 2.355969818020417,
"grad_norm": 1.0390625,
"learning_rate": 0.00047175602412856453,
"loss": 5.7162,
"mean_token_accuracy": 0.17868943214416505,
"num_tokens": 5473934.0,
"step": 2655
},
{
"entropy": 6.048851585388183,
"epoch": 2.3604083444296493,
"grad_norm": 1.1171875,
"learning_rate": 0.00047158869759261843,
"loss": 5.7626,
"mean_token_accuracy": 0.1687912866473198,
"num_tokens": 5483921.0,
"step": 2660
},
{
"entropy": 6.145990705490112,
"epoch": 2.3648468708388815,
"grad_norm": 1.0546875,
"learning_rate": 0.0004714209102661973,
"loss": 5.7686,
"mean_token_accuracy": 0.16941458731889725,
"num_tokens": 5494218.0,
"step": 2665
},
{
"entropy": 6.121583032608032,
"epoch": 2.3692853972481136,
"grad_norm": 0.97265625,
"learning_rate": 0.0004712526625425832,
"loss": 5.811,
"mean_token_accuracy": 0.1643875315785408,
"num_tokens": 5504942.0,
"step": 2670
},
{
"entropy": 6.102924728393555,
"epoch": 2.3737239236573457,
"grad_norm": 1.0703125,
"learning_rate": 0.00047108395481613736,
"loss": 5.8558,
"mean_token_accuracy": 0.15613222420215606,
"num_tokens": 5514624.0,
"step": 2675
},
{
"entropy": 6.14481372833252,
"epoch": 2.378162450066578,
"grad_norm": 1.078125,
"learning_rate": 0.00047091478748229927,
"loss": 5.6984,
"mean_token_accuracy": 0.17392003685235977,
"num_tokens": 5524098.0,
"step": 2680
},
{
"entropy": 6.04828372001648,
"epoch": 2.38260097647581,
"grad_norm": 0.96484375,
"learning_rate": 0.0004707451609375854,
"loss": 5.7557,
"mean_token_accuracy": 0.1692517578601837,
"num_tokens": 5534585.0,
"step": 2685
},
{
"entropy": 6.10555362701416,
"epoch": 2.387039502885042,
"grad_norm": 1.125,
"learning_rate": 0.0004705750755795889,
"loss": 5.7966,
"mean_token_accuracy": 0.168571537733078,
"num_tokens": 5544136.0,
"step": 2690
},
{
"entropy": 6.117819595336914,
"epoch": 2.3914780292942743,
"grad_norm": 0.9921875,
"learning_rate": 0.00047040453180697823,
"loss": 5.691,
"mean_token_accuracy": 0.1738590866327286,
"num_tokens": 5554939.0,
"step": 2695
},
{
"entropy": 6.123975086212158,
"epoch": 2.3959165557035065,
"grad_norm": 1.0390625,
"learning_rate": 0.0004702335300194963,
"loss": 5.7762,
"mean_token_accuracy": 0.16760747879743576,
"num_tokens": 5564533.0,
"step": 2700
},
{
"entropy": 6.117423820495605,
"epoch": 2.4003550821127386,
"grad_norm": 1.0,
"learning_rate": 0.0004700620706179596,
"loss": 5.8196,
"mean_token_accuracy": 0.16853979229927063,
"num_tokens": 5575140.0,
"step": 2705
},
{
"entropy": 6.141474914550781,
"epoch": 2.4047936085219708,
"grad_norm": 1.0546875,
"learning_rate": 0.0004698901540042573,
"loss": 5.7775,
"mean_token_accuracy": 0.16901845932006837,
"num_tokens": 5585399.0,
"step": 2710
},
{
"entropy": 6.079065132141113,
"epoch": 2.409232134931203,
"grad_norm": 0.98828125,
"learning_rate": 0.00046971778058135024,
"loss": 5.6638,
"mean_token_accuracy": 0.18335538804531099,
"num_tokens": 5596194.0,
"step": 2715
},
{
"entropy": 6.042174386978149,
"epoch": 2.413670661340435,
"grad_norm": 1.2734375,
"learning_rate": 0.00046954495075326986,
"loss": 5.8439,
"mean_token_accuracy": 0.16659024804830552,
"num_tokens": 5608317.0,
"step": 2720
},
{
"entropy": 6.13245415687561,
"epoch": 2.418109187749667,
"grad_norm": 1.140625,
"learning_rate": 0.00046937166492511746,
"loss": 5.725,
"mean_token_accuracy": 0.1753625452518463,
"num_tokens": 5617777.0,
"step": 2725
},
{
"entropy": 6.06634931564331,
"epoch": 2.4225477141588994,
"grad_norm": 1.1875,
"learning_rate": 0.00046919792350306317,
"loss": 5.7311,
"mean_token_accuracy": 0.1771342933177948,
"num_tokens": 5628056.0,
"step": 2730
},
{
"entropy": 5.94120683670044,
"epoch": 2.4269862405681315,
"grad_norm": 1.015625,
"learning_rate": 0.0004690237268943451,
"loss": 5.7222,
"mean_token_accuracy": 0.17666102647781373,
"num_tokens": 5638073.0,
"step": 2735
},
{
"entropy": 6.103239822387695,
"epoch": 2.4314247669773636,
"grad_norm": 1.140625,
"learning_rate": 0.00046884907550726816,
"loss": 5.6812,
"mean_token_accuracy": 0.1819820836186409,
"num_tokens": 5647290.0,
"step": 2740
},
{
"entropy": 6.077079916000367,
"epoch": 2.435863293386596,
"grad_norm": 1.0859375,
"learning_rate": 0.00046867396975120324,
"loss": 5.7744,
"mean_token_accuracy": 0.16964205503463745,
"num_tokens": 5656882.0,
"step": 2745
},
{
"entropy": 6.1173424243927,
"epoch": 2.440301819795828,
"grad_norm": 1.03125,
"learning_rate": 0.0004684984100365863,
"loss": 5.8316,
"mean_token_accuracy": 0.16495220363140106,
"num_tokens": 5667803.0,
"step": 2750
},
{
"entropy": 6.142762899398804,
"epoch": 2.44474034620506,
"grad_norm": 1.0625,
"learning_rate": 0.00046832239677491736,
"loss": 5.7461,
"mean_token_accuracy": 0.1722828820347786,
"num_tokens": 5678319.0,
"step": 2755
},
{
"entropy": 6.022468090057373,
"epoch": 2.4491788726142922,
"grad_norm": 1.0703125,
"learning_rate": 0.0004681459303787594,
"loss": 5.7948,
"mean_token_accuracy": 0.16484333127737044,
"num_tokens": 5688677.0,
"step": 2760
},
{
"entropy": 6.150290822982788,
"epoch": 2.4536173990235244,
"grad_norm": 0.99609375,
"learning_rate": 0.0004679690112617376,
"loss": 5.8075,
"mean_token_accuracy": 0.16610533744096756,
"num_tokens": 5699538.0,
"step": 2765
},
{
"entropy": 6.095004320144653,
"epoch": 2.458055925432756,
"grad_norm": 1.046875,
"learning_rate": 0.0004677916398385383,
"loss": 5.6928,
"mean_token_accuracy": 0.18449453860521317,
"num_tokens": 5709461.0,
"step": 2770
},
{
"entropy": 6.063209056854248,
"epoch": 2.4624944518419882,
"grad_norm": 1.109375,
"learning_rate": 0.000467613816524908,
"loss": 5.7058,
"mean_token_accuracy": 0.17079256027936934,
"num_tokens": 5718220.0,
"step": 2775
},
{
"entropy": 6.105566453933716,
"epoch": 2.4669329782512204,
"grad_norm": 0.9765625,
"learning_rate": 0.0004674355417376524,
"loss": 5.7678,
"mean_token_accuracy": 0.16715284287929535,
"num_tokens": 5728638.0,
"step": 2780
},
{
"entropy": 6.0401427268981935,
"epoch": 2.4713715046604525,
"grad_norm": 1.1015625,
"learning_rate": 0.00046725681589463537,
"loss": 5.7113,
"mean_token_accuracy": 0.17297857254743576,
"num_tokens": 5738854.0,
"step": 2785
},
{
"entropy": 6.040780830383301,
"epoch": 2.4758100310696847,
"grad_norm": 1.1796875,
"learning_rate": 0.00046707763941477817,
"loss": 5.6819,
"mean_token_accuracy": 0.1767168715596199,
"num_tokens": 5748624.0,
"step": 2790
},
{
"entropy": 6.007115411758423,
"epoch": 2.480248557478917,
"grad_norm": 1.046875,
"learning_rate": 0.0004668980127180582,
"loss": 5.7215,
"mean_token_accuracy": 0.17497175931930542,
"num_tokens": 5759846.0,
"step": 2795
},
{
"entropy": 6.1033079624176025,
"epoch": 2.484687083888149,
"grad_norm": 1.0078125,
"learning_rate": 0.0004667179362255081,
"loss": 5.7512,
"mean_token_accuracy": 0.17809866815805436,
"num_tokens": 5769983.0,
"step": 2800
},
{
"entropy": 6.070840358734131,
"epoch": 2.489125610297381,
"grad_norm": 1.078125,
"learning_rate": 0.0004665374103592149,
"loss": 5.7566,
"mean_token_accuracy": 0.1682102620601654,
"num_tokens": 5780691.0,
"step": 2805
},
{
"entropy": 6.047124242782592,
"epoch": 2.4935641367066133,
"grad_norm": 1.046875,
"learning_rate": 0.0004663564355423189,
"loss": 5.6824,
"mean_token_accuracy": 0.17610101848840715,
"num_tokens": 5790690.0,
"step": 2810
},
{
"entropy": 6.104051399230957,
"epoch": 2.4980026631158454,
"grad_norm": 1.0546875,
"learning_rate": 0.0004661750121990128,
"loss": 5.7507,
"mean_token_accuracy": 0.17295027673244476,
"num_tokens": 5801088.0,
"step": 2815
},
{
"entropy": 5.899098825454712,
"epoch": 2.5024411895250775,
"grad_norm": 1.0703125,
"learning_rate": 0.00046599314075454034,
"loss": 5.6632,
"mean_token_accuracy": 0.17894352227449417,
"num_tokens": 5811451.0,
"step": 2820
},
{
"entropy": 6.042473268508911,
"epoch": 2.5068797159343097,
"grad_norm": 1.0859375,
"learning_rate": 0.00046581082163519585,
"loss": 5.6985,
"mean_token_accuracy": 0.1734083727002144,
"num_tokens": 5822024.0,
"step": 2825
},
{
"entropy": 5.998702621459961,
"epoch": 2.511318242343542,
"grad_norm": 1.046875,
"learning_rate": 0.00046562805526832284,
"loss": 5.7612,
"mean_token_accuracy": 0.1688615247607231,
"num_tokens": 5831634.0,
"step": 2830
},
{
"entropy": 6.080638408660889,
"epoch": 2.515756768752774,
"grad_norm": 1.1484375,
"learning_rate": 0.0004654448420823133,
"loss": 5.7544,
"mean_token_accuracy": 0.17119256556034088,
"num_tokens": 5842422.0,
"step": 2835
},
{
"entropy": 6.030310201644897,
"epoch": 2.520195295162006,
"grad_norm": 1.140625,
"learning_rate": 0.00046526118250660636,
"loss": 5.7404,
"mean_token_accuracy": 0.17302993685007095,
"num_tokens": 5851658.0,
"step": 2840
},
{
"entropy": 6.0097393035888675,
"epoch": 2.5246338215712383,
"grad_norm": 1.046875,
"learning_rate": 0.0004650770769716875,
"loss": 5.7635,
"mean_token_accuracy": 0.16970502585172653,
"num_tokens": 5861900.0,
"step": 2845
},
{
"entropy": 6.13044376373291,
"epoch": 2.5290723479804704,
"grad_norm": 1.1015625,
"learning_rate": 0.0004648925259090875,
"loss": 5.8304,
"mean_token_accuracy": 0.16660041362047195,
"num_tokens": 5872675.0,
"step": 2850
},
{
"entropy": 6.098389196395874,
"epoch": 2.5335108743897026,
"grad_norm": 0.984375,
"learning_rate": 0.00046470752975138146,
"loss": 5.7127,
"mean_token_accuracy": 0.17505834698677064,
"num_tokens": 5882768.0,
"step": 2855
},
{
"entropy": 5.994097661972046,
"epoch": 2.5379494007989347,
"grad_norm": 1.1171875,
"learning_rate": 0.00046452208893218777,
"loss": 5.7086,
"mean_token_accuracy": 0.17897956669330597,
"num_tokens": 5892970.0,
"step": 2860
},
{
"entropy": 6.031912326812744,
"epoch": 2.542387927208167,
"grad_norm": 1.0390625,
"learning_rate": 0.000464336203886167,
"loss": 5.6679,
"mean_token_accuracy": 0.17664587646722793,
"num_tokens": 5903597.0,
"step": 2865
},
{
"entropy": 6.076654577255249,
"epoch": 2.546826453617399,
"grad_norm": 1.03125,
"learning_rate": 0.000464149875049021,
"loss": 5.7082,
"mean_token_accuracy": 0.17591760605573653,
"num_tokens": 5913908.0,
"step": 2870
},
{
"entropy": 6.035532999038696,
"epoch": 2.551264980026631,
"grad_norm": 1.015625,
"learning_rate": 0.00046396310285749175,
"loss": 5.7447,
"mean_token_accuracy": 0.17051061540842055,
"num_tokens": 5923022.0,
"step": 2875
},
{
"entropy": 6.030104494094848,
"epoch": 2.5557035064358633,
"grad_norm": 1.125,
"learning_rate": 0.00046377588774936077,
"loss": 5.7383,
"mean_token_accuracy": 0.17380277961492538,
"num_tokens": 5933005.0,
"step": 2880
},
{
"entropy": 6.0437328815460205,
"epoch": 2.5601420328450954,
"grad_norm": 1.1015625,
"learning_rate": 0.00046358823016344713,
"loss": 5.7029,
"mean_token_accuracy": 0.17715244591236115,
"num_tokens": 5943197.0,
"step": 2885
},
{
"entropy": 6.017801523208618,
"epoch": 2.5645805592543276,
"grad_norm": 0.9765625,
"learning_rate": 0.0004634001305396076,
"loss": 5.7701,
"mean_token_accuracy": 0.17026674896478652,
"num_tokens": 5954788.0,
"step": 2890
},
{
"entropy": 6.168081951141358,
"epoch": 2.5690190856635597,
"grad_norm": 1.1484375,
"learning_rate": 0.00046321158931873486,
"loss": 5.7751,
"mean_token_accuracy": 0.16409984081983567,
"num_tokens": 5965896.0,
"step": 2895
},
{
"entropy": 5.9579003810882565,
"epoch": 2.573457612072792,
"grad_norm": 1.203125,
"learning_rate": 0.0004630226069427566,
"loss": 5.616,
"mean_token_accuracy": 0.18554621189832687,
"num_tokens": 5975492.0,
"step": 2900
},
{
"entropy": 6.020355606079102,
"epoch": 2.577896138482024,
"grad_norm": 1.1015625,
"learning_rate": 0.00046283318385463454,
"loss": 5.6971,
"mean_token_accuracy": 0.1745652511715889,
"num_tokens": 5985489.0,
"step": 2905
},
{
"entropy": 5.985205554962159,
"epoch": 2.582334664891256,
"grad_norm": 1.1953125,
"learning_rate": 0.0004626433204983636,
"loss": 5.647,
"mean_token_accuracy": 0.174534772336483,
"num_tokens": 5995031.0,
"step": 2910
},
{
"entropy": 6.006907415390015,
"epoch": 2.5867731913004883,
"grad_norm": 1.0625,
"learning_rate": 0.00046245301731897024,
"loss": 5.7595,
"mean_token_accuracy": 0.16590401232242585,
"num_tokens": 6005010.0,
"step": 2915
},
{
"entropy": 6.114031076431274,
"epoch": 2.5912117177097205,
"grad_norm": 0.984375,
"learning_rate": 0.00046226227476251256,
"loss": 5.6742,
"mean_token_accuracy": 0.1767223834991455,
"num_tokens": 6016403.0,
"step": 2920
},
{
"entropy": 5.938989210128784,
"epoch": 2.5956502441189526,
"grad_norm": 1.0546875,
"learning_rate": 0.0004620710932760776,
"loss": 5.6682,
"mean_token_accuracy": 0.18038018196821212,
"num_tokens": 6026312.0,
"step": 2925
},
{
"entropy": 6.016516923904419,
"epoch": 2.6000887705281848,
"grad_norm": 1.078125,
"learning_rate": 0.000461879473307782,
"loss": 5.867,
"mean_token_accuracy": 0.16858119815587996,
"num_tokens": 6036857.0,
"step": 2930
},
{
"entropy": 6.142938184738159,
"epoch": 2.604527296937417,
"grad_norm": 1.0625,
"learning_rate": 0.0004616874153067698,
"loss": 5.7728,
"mean_token_accuracy": 0.16579627990722656,
"num_tokens": 6048270.0,
"step": 2935
},
{
"entropy": 6.05487551689148,
"epoch": 2.608965823346649,
"grad_norm": 1.0234375,
"learning_rate": 0.0004614949197232118,
"loss": 5.696,
"mean_token_accuracy": 0.17658320367336272,
"num_tokens": 6059351.0,
"step": 2940
},
{
"entropy": 5.983553838729859,
"epoch": 2.613404349755881,
"grad_norm": 1.0390625,
"learning_rate": 0.0004613019870083045,
"loss": 5.7345,
"mean_token_accuracy": 0.1750687301158905,
"num_tokens": 6069639.0,
"step": 2945
},
{
"entropy": 6.009236431121826,
"epoch": 2.6178428761651134,
"grad_norm": 0.96484375,
"learning_rate": 0.00046110861761426903,
"loss": 5.7475,
"mean_token_accuracy": 0.16875652074813843,
"num_tokens": 6081393.0,
"step": 2950
},
{
"entropy": 6.063278436660767,
"epoch": 2.6222814025743455,
"grad_norm": 1.078125,
"learning_rate": 0.00046091481199435005,
"loss": 5.7469,
"mean_token_accuracy": 0.1720976859331131,
"num_tokens": 6091043.0,
"step": 2955
},
{
"entropy": 6.051684427261352,
"epoch": 2.6267199289835776,
"grad_norm": 1.0234375,
"learning_rate": 0.0004607205706028147,
"loss": 5.733,
"mean_token_accuracy": 0.1665470317006111,
"num_tokens": 6101502.0,
"step": 2960
},
{
"entropy": 5.959883069992065,
"epoch": 2.63115845539281,
"grad_norm": 1.09375,
"learning_rate": 0.0004605258938949514,
"loss": 5.6537,
"mean_token_accuracy": 0.1800918236374855,
"num_tokens": 6110908.0,
"step": 2965
},
{
"entropy": 6.070306491851807,
"epoch": 2.635596981802042,
"grad_norm": 1.09375,
"learning_rate": 0.00046033078232706923,
"loss": 5.7551,
"mean_token_accuracy": 0.17454806268215178,
"num_tokens": 6120189.0,
"step": 2970
},
{
"entropy": 6.073927783966065,
"epoch": 2.640035508211274,
"grad_norm": 1.1953125,
"learning_rate": 0.00046013523635649625,
"loss": 5.7497,
"mean_token_accuracy": 0.16859546005725862,
"num_tokens": 6129095.0,
"step": 2975
},
{
"entropy": 6.0158473491668705,
"epoch": 2.6444740346205062,
"grad_norm": 0.94921875,
"learning_rate": 0.00045993925644157883,
"loss": 5.7132,
"mean_token_accuracy": 0.1755117155611515,
"num_tokens": 6139129.0,
"step": 2980
},
{
"entropy": 5.979988050460816,
"epoch": 2.6489125610297384,
"grad_norm": 1.0703125,
"learning_rate": 0.0004597428430416807,
"loss": 5.7295,
"mean_token_accuracy": 0.17120434045791627,
"num_tokens": 6148966.0,
"step": 2985
},
{
"entropy": 6.136995887756347,
"epoch": 2.6533510874389705,
"grad_norm": 1.1796875,
"learning_rate": 0.00045954599661718126,
"loss": 5.8193,
"mean_token_accuracy": 0.1676889553666115,
"num_tokens": 6158254.0,
"step": 2990
},
{
"entropy": 6.045438051223755,
"epoch": 2.6577896138482027,
"grad_norm": 0.97265625,
"learning_rate": 0.00045934871762947504,
"loss": 5.6964,
"mean_token_accuracy": 0.17370334416627883,
"num_tokens": 6167922.0,
"step": 2995
},
{
"entropy": 5.940775346755982,
"epoch": 2.6622281402574344,
"grad_norm": 1.0390625,
"learning_rate": 0.00045915100654097076,
"loss": 5.7092,
"mean_token_accuracy": 0.17816627770662308,
"num_tokens": 6179494.0,
"step": 3000
},
{
"epoch": 2.6622281402574344,
"eval_entropy": 5.789337054001181,
"eval_loss": 6.018830299377441,
"eval_mean_token_accuracy": 0.16076800524480553,
"eval_num_tokens": 6179494.0,
"eval_runtime": 2.0923,
"eval_samples_per_second": 1609.206,
"eval_steps_per_second": 201.211,
"step": 3000
},
{
"entropy": 6.011846494674683,
"epoch": 2.6666666666666665,
"grad_norm": 1.234375,
"learning_rate": 0.00045895286381508944,
"loss": 5.7312,
"mean_token_accuracy": 0.1753581464290619,
"num_tokens": 6189732.0,
"step": 3005
},
{
"entropy": 6.029772520065308,
"epoch": 2.6711051930758987,
"grad_norm": 0.95703125,
"learning_rate": 0.0004587542899162642,
"loss": 5.7683,
"mean_token_accuracy": 0.16387217342853547,
"num_tokens": 6200582.0,
"step": 3010
},
{
"entropy": 6.066657304763794,
"epoch": 2.675543719485131,
"grad_norm": 1.1171875,
"learning_rate": 0.00045855528530993874,
"loss": 5.7476,
"mean_token_accuracy": 0.17216766774654388,
"num_tokens": 6210009.0,
"step": 3015
},
{
"entropy": 6.039933919906616,
"epoch": 2.679982245894363,
"grad_norm": 1.03125,
"learning_rate": 0.0004583558504625661,
"loss": 5.7558,
"mean_token_accuracy": 0.1696187898516655,
"num_tokens": 6220178.0,
"step": 3020
},
{
"entropy": 5.955683088302612,
"epoch": 2.684420772303595,
"grad_norm": 0.9921875,
"learning_rate": 0.00045815598584160824,
"loss": 5.6471,
"mean_token_accuracy": 0.1844172552227974,
"num_tokens": 6230147.0,
"step": 3025
},
{
"entropy": 6.097689056396485,
"epoch": 2.6888592987128273,
"grad_norm": 0.98046875,
"learning_rate": 0.00045795569191553384,
"loss": 5.7985,
"mean_token_accuracy": 0.16727579087018968,
"num_tokens": 6241561.0,
"step": 3030
},
{
"entropy": 5.979752445220948,
"epoch": 2.6932978251220594,
"grad_norm": 1.078125,
"learning_rate": 0.0004577549691538183,
"loss": 5.7252,
"mean_token_accuracy": 0.18227578103542327,
"num_tokens": 6251360.0,
"step": 3035
},
{
"entropy": 6.113001489639283,
"epoch": 2.6977363515312915,
"grad_norm": 1.2421875,
"learning_rate": 0.00045755381802694206,
"loss": 5.7266,
"mean_token_accuracy": 0.1760123386979103,
"num_tokens": 6261947.0,
"step": 3040
},
{
"entropy": 6.00572943687439,
"epoch": 2.7021748779405237,
"grad_norm": 1.1484375,
"learning_rate": 0.00045735223900638967,
"loss": 5.7118,
"mean_token_accuracy": 0.16842464506626129,
"num_tokens": 6272247.0,
"step": 3045
},
{
"entropy": 6.02584981918335,
"epoch": 2.706613404349756,
"grad_norm": 1.109375,
"learning_rate": 0.00045715023256464855,
"loss": 5.7608,
"mean_token_accuracy": 0.1715293511748314,
"num_tokens": 6282171.0,
"step": 3050
},
{
"entropy": 6.107793283462525,
"epoch": 2.711051930758988,
"grad_norm": 1.1796875,
"learning_rate": 0.00045694779917520797,
"loss": 5.7451,
"mean_token_accuracy": 0.17290424555540085,
"num_tokens": 6290993.0,
"step": 3055
},
{
"entropy": 5.978008699417114,
"epoch": 2.71549045716822,
"grad_norm": 1.09375,
"learning_rate": 0.000456744939312558,
"loss": 5.6471,
"mean_token_accuracy": 0.18025294095277786,
"num_tokens": 6301039.0,
"step": 3060
},
{
"entropy": 5.9843508243560795,
"epoch": 2.7199289835774523,
"grad_norm": 1.09375,
"learning_rate": 0.0004565416534521883,
"loss": 5.7301,
"mean_token_accuracy": 0.16947097778320314,
"num_tokens": 6312095.0,
"step": 3065
},
{
"entropy": 5.932244157791137,
"epoch": 2.7243675099866844,
"grad_norm": 1.1015625,
"learning_rate": 0.000456337942070587,
"loss": 5.6472,
"mean_token_accuracy": 0.18285827040672303,
"num_tokens": 6322621.0,
"step": 3070
},
{
"entropy": 6.0621102809906,
"epoch": 2.7288060363959166,
"grad_norm": 1.046875,
"learning_rate": 0.0004561338056452396,
"loss": 5.7749,
"mean_token_accuracy": 0.17220864966511726,
"num_tokens": 6332733.0,
"step": 3075
},
{
"entropy": 5.973612880706787,
"epoch": 2.7332445628051487,
"grad_norm": 1.0703125,
"learning_rate": 0.0004559292446546281,
"loss": 5.7143,
"mean_token_accuracy": 0.17332967817783357,
"num_tokens": 6343162.0,
"step": 3080
},
{
"entropy": 6.0895998001098635,
"epoch": 2.737683089214381,
"grad_norm": 0.984375,
"learning_rate": 0.0004557242595782293,
"loss": 5.742,
"mean_token_accuracy": 0.17037878483533858,
"num_tokens": 6354283.0,
"step": 3085
},
{
"entropy": 6.039672994613648,
"epoch": 2.742121615623613,
"grad_norm": 1.0078125,
"learning_rate": 0.0004555188508965144,
"loss": 5.6795,
"mean_token_accuracy": 0.17761039584875107,
"num_tokens": 6364645.0,
"step": 3090
},
{
"entropy": 5.966477537155152,
"epoch": 2.746560142032845,
"grad_norm": 1.09375,
"learning_rate": 0.00045531301909094724,
"loss": 5.6686,
"mean_token_accuracy": 0.17619081139564513,
"num_tokens": 6375156.0,
"step": 3095
},
{
"entropy": 6.012517929077148,
"epoch": 2.7509986684420773,
"grad_norm": 1.078125,
"learning_rate": 0.0004551067646439834,
"loss": 5.6824,
"mean_token_accuracy": 0.17580184042453767,
"num_tokens": 6385105.0,
"step": 3100
},
{
"entropy": 6.031947231292724,
"epoch": 2.7554371948513094,
"grad_norm": 1.140625,
"learning_rate": 0.00045490008803906936,
"loss": 5.7849,
"mean_token_accuracy": 0.1666751965880394,
"num_tokens": 6396122.0,
"step": 3105
},
{
"entropy": 6.084775066375732,
"epoch": 2.7598757212605416,
"grad_norm": 1.1640625,
"learning_rate": 0.0004546929897606409,
"loss": 5.6284,
"mean_token_accuracy": 0.18060048222541808,
"num_tokens": 6405668.0,
"step": 3110
},
{
"entropy": 5.962884092330933,
"epoch": 2.7643142476697737,
"grad_norm": 1.078125,
"learning_rate": 0.00045448547029412225,
"loss": 5.7133,
"mean_token_accuracy": 0.17631541192531586,
"num_tokens": 6415845.0,
"step": 3115
},
{
"entropy": 5.991909742355347,
"epoch": 2.768752774079006,
"grad_norm": 1.0625,
"learning_rate": 0.00045427753012592477,
"loss": 5.6724,
"mean_token_accuracy": 0.1697130471467972,
"num_tokens": 6424945.0,
"step": 3120
},
{
"entropy": 6.0469557762146,
"epoch": 2.773191300488238,
"grad_norm": 1.046875,
"learning_rate": 0.00045406916974344617,
"loss": 5.7563,
"mean_token_accuracy": 0.17011816203594207,
"num_tokens": 6435224.0,
"step": 3125
},
{
"entropy": 6.046081399917602,
"epoch": 2.77762982689747,
"grad_norm": 1.1953125,
"learning_rate": 0.00045386038963506883,
"loss": 5.7334,
"mean_token_accuracy": 0.1699560046195984,
"num_tokens": 6444519.0,
"step": 3130
},
{
"entropy": 5.950239896774292,
"epoch": 2.7820683533067023,
"grad_norm": 1.0546875,
"learning_rate": 0.0004536511902901591,
"loss": 5.7693,
"mean_token_accuracy": 0.17263632714748384,
"num_tokens": 6454377.0,
"step": 3135
},
{
"entropy": 5.952496862411499,
"epoch": 2.7865068797159345,
"grad_norm": 1.1640625,
"learning_rate": 0.0004534415721990659,
"loss": 5.5402,
"mean_token_accuracy": 0.1998279348015785,
"num_tokens": 6464073.0,
"step": 3140
},
{
"entropy": 6.071445178985596,
"epoch": 2.790945406125166,
"grad_norm": 1.1484375,
"learning_rate": 0.00045323153585311975,
"loss": 5.7179,
"mean_token_accuracy": 0.1706698343157768,
"num_tokens": 6473517.0,
"step": 3145
},
{
"entropy": 6.029016780853271,
"epoch": 2.7953839325343983,
"grad_norm": 1.1328125,
"learning_rate": 0.0004530210817446316,
"loss": 5.6796,
"mean_token_accuracy": 0.17350984811782838,
"num_tokens": 6482465.0,
"step": 3150
},
{
"entropy": 6.018514966964721,
"epoch": 2.7998224589436305,
"grad_norm": 1.0625,
"learning_rate": 0.0004528102103668913,
"loss": 5.7618,
"mean_token_accuracy": 0.17125869393348694,
"num_tokens": 6493420.0,
"step": 3155
},
{
"entropy": 6.028185033798218,
"epoch": 2.8042609853528626,
"grad_norm": 1.078125,
"learning_rate": 0.0004525989222141671,
"loss": 5.719,
"mean_token_accuracy": 0.1788898825645447,
"num_tokens": 6503395.0,
"step": 3160
},
{
"entropy": 6.030786037445068,
"epoch": 2.8086995117620948,
"grad_norm": 1.046875,
"learning_rate": 0.00045238721778170386,
"loss": 5.7436,
"mean_token_accuracy": 0.17074056565761567,
"num_tokens": 6514353.0,
"step": 3165
},
{
"entropy": 6.061694574356079,
"epoch": 2.813138038171327,
"grad_norm": 1.1484375,
"learning_rate": 0.00045217509756572256,
"loss": 5.6871,
"mean_token_accuracy": 0.17090310156345367,
"num_tokens": 6523501.0,
"step": 3170
},
{
"entropy": 5.97159743309021,
"epoch": 2.817576564580559,
"grad_norm": 0.96875,
"learning_rate": 0.0004519625620634182,
"loss": 5.7318,
"mean_token_accuracy": 0.16962333917617797,
"num_tokens": 6535135.0,
"step": 3175
},
{
"entropy": 6.10450177192688,
"epoch": 2.822015090989791,
"grad_norm": 0.98046875,
"learning_rate": 0.00045174961177295964,
"loss": 5.7209,
"mean_token_accuracy": 0.17412717789411544,
"num_tokens": 6546100.0,
"step": 3180
},
{
"entropy": 5.934656810760498,
"epoch": 2.8264536173990233,
"grad_norm": 1.0078125,
"learning_rate": 0.00045153624719348773,
"loss": 5.6484,
"mean_token_accuracy": 0.17352755069732667,
"num_tokens": 6557091.0,
"step": 3185
},
{
"entropy": 5.935671329498291,
"epoch": 2.8308921438082555,
"grad_norm": 1.03125,
"learning_rate": 0.00045132246882511457,
"loss": 5.6754,
"mean_token_accuracy": 0.17148020267486572,
"num_tokens": 6567469.0,
"step": 3190
},
{
"entropy": 6.015770435333252,
"epoch": 2.8353306702174876,
"grad_norm": 1.109375,
"learning_rate": 0.0004511082771689219,
"loss": 5.7007,
"mean_token_accuracy": 0.17414820641279222,
"num_tokens": 6577442.0,
"step": 3195
},
{
"entropy": 6.07279109954834,
"epoch": 2.83976919662672,
"grad_norm": 1.1875,
"learning_rate": 0.00045089367272696046,
"loss": 5.6299,
"mean_token_accuracy": 0.1816476598381996,
"num_tokens": 6587321.0,
"step": 3200
},
{
"entropy": 6.001161098480225,
"epoch": 2.844207723035952,
"grad_norm": 1.0390625,
"learning_rate": 0.00045067865600224833,
"loss": 5.7098,
"mean_token_accuracy": 0.17837129086256026,
"num_tokens": 6597971.0,
"step": 3205
},
{
"entropy": 5.96258053779602,
"epoch": 2.848646249445184,
"grad_norm": 1.0078125,
"learning_rate": 0.00045046322749877005,
"loss": 5.6859,
"mean_token_accuracy": 0.1785979002714157,
"num_tokens": 6608251.0,
"step": 3210
},
{
"entropy": 6.015719032287597,
"epoch": 2.853084775854416,
"grad_norm": 0.96875,
"learning_rate": 0.00045024738772147534,
"loss": 5.6568,
"mean_token_accuracy": 0.1777540847659111,
"num_tokens": 6618045.0,
"step": 3215
},
{
"entropy": 6.079815149307251,
"epoch": 2.8575233022636484,
"grad_norm": 0.95703125,
"learning_rate": 0.0004500311371762778,
"loss": 5.723,
"mean_token_accuracy": 0.1762673020362854,
"num_tokens": 6628162.0,
"step": 3220
},
{
"entropy": 6.04972767829895,
"epoch": 2.8619618286728805,
"grad_norm": 0.99609375,
"learning_rate": 0.00044981447637005396,
"loss": 5.7761,
"mean_token_accuracy": 0.16095962822437287,
"num_tokens": 6639225.0,
"step": 3225
},
{
"entropy": 5.983947801589966,
"epoch": 2.8664003550821127,
"grad_norm": 1.0078125,
"learning_rate": 0.000449597405810642,
"loss": 5.6133,
"mean_token_accuracy": 0.17978738248348236,
"num_tokens": 6649248.0,
"step": 3230
},
{
"entropy": 5.941468191146851,
"epoch": 2.870838881491345,
"grad_norm": 1.03125,
"learning_rate": 0.0004493799260068405,
"loss": 5.7351,
"mean_token_accuracy": 0.17311612367630005,
"num_tokens": 6660458.0,
"step": 3235
},
{
"entropy": 6.038877630233765,
"epoch": 2.875277407900577,
"grad_norm": 1.078125,
"learning_rate": 0.0004491620374684072,
"loss": 5.6762,
"mean_token_accuracy": 0.17014368772506713,
"num_tokens": 6669951.0,
"step": 3240
},
{
"entropy": 6.017770910263062,
"epoch": 2.879715934309809,
"grad_norm": 1.1171875,
"learning_rate": 0.00044894374070605795,
"loss": 5.743,
"mean_token_accuracy": 0.17674416303634644,
"num_tokens": 6680472.0,
"step": 3245
},
{
"entropy": 6.084974384307861,
"epoch": 2.8841544607190412,
"grad_norm": 1.15625,
"learning_rate": 0.00044872503623146544,
"loss": 5.7117,
"mean_token_accuracy": 0.16619863510131835,
"num_tokens": 6690939.0,
"step": 3250
},
{
"entropy": 5.94278769493103,
"epoch": 2.8885929871282734,
"grad_norm": 1.171875,
"learning_rate": 0.00044850592455725804,
"loss": 5.7764,
"mean_token_accuracy": 0.17108806669712068,
"num_tokens": 6701087.0,
"step": 3255
},
{
"entropy": 6.017983531951904,
"epoch": 2.8930315135375055,
"grad_norm": 1.0859375,
"learning_rate": 0.0004482864061970185,
"loss": 5.6862,
"mean_token_accuracy": 0.18754952698945998,
"num_tokens": 6712292.0,
"step": 3260
},
{
"entropy": 6.036191987991333,
"epoch": 2.8974700399467377,
"grad_norm": 1.046875,
"learning_rate": 0.00044806648166528286,
"loss": 5.659,
"mean_token_accuracy": 0.17132395058870314,
"num_tokens": 6722818.0,
"step": 3265
},
{
"entropy": 5.893555545806885,
"epoch": 2.90190856635597,
"grad_norm": 1.078125,
"learning_rate": 0.00044784615147753934,
"loss": 5.6816,
"mean_token_accuracy": 0.1757792666554451,
"num_tokens": 6733303.0,
"step": 3270
},
{
"entropy": 5.996296119689942,
"epoch": 2.906347092765202,
"grad_norm": 1.109375,
"learning_rate": 0.00044762541615022664,
"loss": 5.7015,
"mean_token_accuracy": 0.17875064462423323,
"num_tokens": 6742483.0,
"step": 3275
},
{
"entropy": 5.979998683929443,
"epoch": 2.910785619174434,
"grad_norm": 1.03125,
"learning_rate": 0.00044740427620073344,
"loss": 5.6603,
"mean_token_accuracy": 0.17813819795846939,
"num_tokens": 6752836.0,
"step": 3280
},
{
"entropy": 5.954287004470825,
"epoch": 2.9152241455836663,
"grad_norm": 1.0390625,
"learning_rate": 0.00044718273214739654,
"loss": 5.7308,
"mean_token_accuracy": 0.17084962874650955,
"num_tokens": 6764321.0,
"step": 3285
},
{
"entropy": 6.067618417739868,
"epoch": 2.9196626719928984,
"grad_norm": 1.09375,
"learning_rate": 0.0004469607845095002,
"loss": 5.6775,
"mean_token_accuracy": 0.1735297128558159,
"num_tokens": 6774034.0,
"step": 3290
},
{
"entropy": 5.988525152206421,
"epoch": 2.9241011984021306,
"grad_norm": 1.03125,
"learning_rate": 0.0004467384338072744,
"loss": 5.7772,
"mean_token_accuracy": 0.1673002153635025,
"num_tokens": 6786182.0,
"step": 3295
},
{
"entropy": 6.02162880897522,
"epoch": 2.9285397248113627,
"grad_norm": 1.0703125,
"learning_rate": 0.0004465156805618941,
"loss": 5.6475,
"mean_token_accuracy": 0.17642576694488527,
"num_tokens": 6795631.0,
"step": 3300
},
{
"entropy": 5.964630270004273,
"epoch": 2.932978251220595,
"grad_norm": 1.09375,
"learning_rate": 0.0004462925252954775,
"loss": 5.7392,
"mean_token_accuracy": 0.16975196450948715,
"num_tokens": 6805212.0,
"step": 3305
},
{
"entropy": 6.031642150878906,
"epoch": 2.937416777629827,
"grad_norm": 1.0859375,
"learning_rate": 0.0004460689685310855,
"loss": 5.7476,
"mean_token_accuracy": 0.1703239858150482,
"num_tokens": 6815680.0,
"step": 3310
},
{
"entropy": 6.008225917816162,
"epoch": 2.941855304039059,
"grad_norm": 1.109375,
"learning_rate": 0.0004458450107927199,
"loss": 5.6538,
"mean_token_accuracy": 0.180711767077446,
"num_tokens": 6824694.0,
"step": 3315
},
{
"entropy": 5.845587253570557,
"epoch": 2.9462938304482913,
"grad_norm": 1.0625,
"learning_rate": 0.00044562065260532214,
"loss": 5.621,
"mean_token_accuracy": 0.17849345952272416,
"num_tokens": 6835219.0,
"step": 3320
},
{
"entropy": 6.04475736618042,
"epoch": 2.9507323568575234,
"grad_norm": 1.0390625,
"learning_rate": 0.00044539589449477265,
"loss": 5.7213,
"mean_token_accuracy": 0.1738622322678566,
"num_tokens": 6845992.0,
"step": 3325
},
{
"entropy": 6.052994966506958,
"epoch": 2.9551708832667556,
"grad_norm": 1.0546875,
"learning_rate": 0.000445170736987889,
"loss": 5.6658,
"mean_token_accuracy": 0.18287943601608275,
"num_tokens": 6855287.0,
"step": 3330
},
{
"entropy": 6.029227447509766,
"epoch": 2.9596094096759877,
"grad_norm": 1.046875,
"learning_rate": 0.000444945180612425,
"loss": 5.775,
"mean_token_accuracy": 0.17114163041114808,
"num_tokens": 6865841.0,
"step": 3335
},
{
"entropy": 6.034116411209107,
"epoch": 2.96404793608522,
"grad_norm": 1.0078125,
"learning_rate": 0.00044471922589706944,
"loss": 5.8053,
"mean_token_accuracy": 0.16967750638723372,
"num_tokens": 6875931.0,
"step": 3340
},
{
"entropy": 6.023122358322143,
"epoch": 2.968486462494452,
"grad_norm": 1.0546875,
"learning_rate": 0.0004444928733714446,
"loss": 5.7363,
"mean_token_accuracy": 0.17056947499513625,
"num_tokens": 6886092.0,
"step": 3345
},
{
"entropy": 6.0595800399780275,
"epoch": 2.972924988903684,
"grad_norm": 1.0859375,
"learning_rate": 0.00044426612356610555,
"loss": 5.7344,
"mean_token_accuracy": 0.16704397201538085,
"num_tokens": 6897312.0,
"step": 3350
},
{
"entropy": 5.955773544311524,
"epoch": 2.9773635153129163,
"grad_norm": 1.0703125,
"learning_rate": 0.0004440389770125382,
"loss": 5.6457,
"mean_token_accuracy": 0.18342512249946594,
"num_tokens": 6907838.0,
"step": 3355
},
{
"entropy": 5.930391263961792,
"epoch": 2.9818020417221485,
"grad_norm": 1.109375,
"learning_rate": 0.0004438114342431586,
"loss": 5.6485,
"mean_token_accuracy": 0.17502613514661788,
"num_tokens": 6916729.0,
"step": 3360
},
{
"entropy": 5.983162069320679,
"epoch": 2.9862405681313806,
"grad_norm": 1.078125,
"learning_rate": 0.00044358349579131143,
"loss": 5.5849,
"mean_token_accuracy": 0.1869617834687233,
"num_tokens": 6927074.0,
"step": 3365
},
{
"entropy": 5.962836027145386,
"epoch": 2.9906790945406128,
"grad_norm": 1.1015625,
"learning_rate": 0.00044335516219126876,
"loss": 5.6287,
"mean_token_accuracy": 0.17767293900251388,
"num_tokens": 6938437.0,
"step": 3370
},
{
"entropy": 5.964249944686889,
"epoch": 2.995117620949845,
"grad_norm": 1.046875,
"learning_rate": 0.00044312643397822907,
"loss": 5.6745,
"mean_token_accuracy": 0.18153784573078155,
"num_tokens": 6949036.0,
"step": 3375
},
{
"entropy": 6.030031394958496,
"epoch": 2.999556147359077,
"grad_norm": 1.0390625,
"learning_rate": 0.00044289731168831566,
"loss": 5.5911,
"mean_token_accuracy": 0.18498829305171965,
"num_tokens": 6958459.0,
"step": 3380
},
{
"entropy": 5.8808572557237415,
"epoch": 3.003550821127386,
"grad_norm": 1.0078125,
"learning_rate": 0.0004426677958585755,
"loss": 5.4157,
"mean_token_accuracy": 0.19034291472699907,
"num_tokens": 6967264.0,
"step": 3385
},
{
"entropy": 5.903432178497314,
"epoch": 3.007989347536618,
"grad_norm": 0.99609375,
"learning_rate": 0.00044243788702697797,
"loss": 5.3709,
"mean_token_accuracy": 0.19530602395534516,
"num_tokens": 6977465.0,
"step": 3390
},
{
"entropy": 5.998833322525025,
"epoch": 3.01242787394585,
"grad_norm": 0.9765625,
"learning_rate": 0.0004422075857324137,
"loss": 5.3929,
"mean_token_accuracy": 0.19290464073419572,
"num_tokens": 6987583.0,
"step": 3395
},
{
"entropy": 5.954317235946656,
"epoch": 3.0168664003550822,
"grad_norm": 1.109375,
"learning_rate": 0.00044197689251469324,
"loss": 5.38,
"mean_token_accuracy": 0.1891101285815239,
"num_tokens": 6997894.0,
"step": 3400
},
{
"entropy": 5.9602972030639645,
"epoch": 3.0213049267643144,
"grad_norm": 1.0703125,
"learning_rate": 0.00044174580791454555,
"loss": 5.3515,
"mean_token_accuracy": 0.19597329050302506,
"num_tokens": 7008019.0,
"step": 3405
},
{
"entropy": 5.9017480373382565,
"epoch": 3.0257434531735465,
"grad_norm": 1.0546875,
"learning_rate": 0.0004415143324736174,
"loss": 5.3916,
"mean_token_accuracy": 0.19494948536157608,
"num_tokens": 7018272.0,
"step": 3410
},
{
"entropy": 5.968024396896363,
"epoch": 3.0301819795827787,
"grad_norm": 1.0703125,
"learning_rate": 0.0004412824667344712,
"loss": 5.439,
"mean_token_accuracy": 0.1884671375155449,
"num_tokens": 7028185.0,
"step": 3415
},
{
"entropy": 6.047925806045532,
"epoch": 3.034620505992011,
"grad_norm": 1.046875,
"learning_rate": 0.00044105021124058455,
"loss": 5.4481,
"mean_token_accuracy": 0.18440557271242142,
"num_tokens": 7038123.0,
"step": 3420
},
{
"entropy": 5.86896710395813,
"epoch": 3.039059032401243,
"grad_norm": 1.03125,
"learning_rate": 0.00044081756653634825,
"loss": 5.342,
"mean_token_accuracy": 0.1948542922735214,
"num_tokens": 7048379.0,
"step": 3425
},
{
"entropy": 5.908081436157227,
"epoch": 3.043497558810475,
"grad_norm": 1.0234375,
"learning_rate": 0.0004405845331670659,
"loss": 5.323,
"mean_token_accuracy": 0.20013415217399597,
"num_tokens": 7057878.0,
"step": 3430
},
{
"entropy": 5.90395884513855,
"epoch": 3.0479360852197073,
"grad_norm": 1.1171875,
"learning_rate": 0.0004403511116789514,
"loss": 5.4602,
"mean_token_accuracy": 0.18673462122678758,
"num_tokens": 7067998.0,
"step": 3435
},
{
"entropy": 5.890441370010376,
"epoch": 3.052374611628939,
"grad_norm": 1.046875,
"learning_rate": 0.00044011730261912915,
"loss": 5.3764,
"mean_token_accuracy": 0.19622484892606734,
"num_tokens": 7079236.0,
"step": 3440
},
{
"entropy": 5.89832239151001,
"epoch": 3.056813138038171,
"grad_norm": 1.1015625,
"learning_rate": 0.0004398831065356314,
"loss": 5.3428,
"mean_token_accuracy": 0.19831295162439347,
"num_tokens": 7088947.0,
"step": 3445
},
{
"entropy": 5.946053075790405,
"epoch": 3.0612516644474033,
"grad_norm": 1.109375,
"learning_rate": 0.00043964852397739793,
"loss": 5.4557,
"mean_token_accuracy": 0.18364953398704528,
"num_tokens": 7099480.0,
"step": 3450
},
{
"entropy": 5.869796800613403,
"epoch": 3.0656901908566354,
"grad_norm": 1.3125,
"learning_rate": 0.000439413555494274,
"loss": 5.3686,
"mean_token_accuracy": 0.1966594323515892,
"num_tokens": 7109471.0,
"step": 3455
},
{
"entropy": 5.870002937316895,
"epoch": 3.0701287172658676,
"grad_norm": 1.109375,
"learning_rate": 0.0004391782016370098,
"loss": 5.4148,
"mean_token_accuracy": 0.1896324947476387,
"num_tokens": 7119790.0,
"step": 3460
},
{
"entropy": 5.988854026794433,
"epoch": 3.0745672436750997,
"grad_norm": 1.0859375,
"learning_rate": 0.0004389424629572586,
"loss": 5.3878,
"mean_token_accuracy": 0.19112442284822465,
"num_tokens": 7129736.0,
"step": 3465
},
{
"entropy": 5.899620294570923,
"epoch": 3.079005770084332,
"grad_norm": 1.109375,
"learning_rate": 0.00043870634000757605,
"loss": 5.3816,
"mean_token_accuracy": 0.18703049421310425,
"num_tokens": 7139786.0,
"step": 3470
},
{
"entropy": 5.943547010421753,
"epoch": 3.083444296493564,
"grad_norm": 1.140625,
"learning_rate": 0.0004384698333414179,
"loss": 5.387,
"mean_token_accuracy": 0.1897724226117134,
"num_tokens": 7150742.0,
"step": 3475
},
{
"entropy": 5.958523893356324,
"epoch": 3.087882822902796,
"grad_norm": 1.0859375,
"learning_rate": 0.0004382329435131396,
"loss": 5.4457,
"mean_token_accuracy": 0.18277957141399384,
"num_tokens": 7161740.0,
"step": 3480
},
{
"entropy": 5.954104804992676,
"epoch": 3.0923213493120283,
"grad_norm": 0.98046875,
"learning_rate": 0.00043799567107799504,
"loss": 5.423,
"mean_token_accuracy": 0.18841141164302827,
"num_tokens": 7172615.0,
"step": 3485
},
{
"entropy": 5.788148641586304,
"epoch": 3.0967598757212604,
"grad_norm": 1.0859375,
"learning_rate": 0.00043775801659213425,
"loss": 5.3323,
"mean_token_accuracy": 0.20167517215013503,
"num_tokens": 7183037.0,
"step": 3490
},
{
"entropy": 5.911949014663696,
"epoch": 3.1011984021304926,
"grad_norm": 1.015625,
"learning_rate": 0.0004375199806126034,
"loss": 5.4289,
"mean_token_accuracy": 0.19386280030012132,
"num_tokens": 7193621.0,
"step": 3495
},
{
"entropy": 5.8650144100189205,
"epoch": 3.1056369285397247,
"grad_norm": 1.15625,
"learning_rate": 0.00043728156369734236,
"loss": 5.313,
"mean_token_accuracy": 0.20414462238550185,
"num_tokens": 7204419.0,
"step": 3500
},
{
"epoch": 3.1056369285397247,
"eval_entropy": 5.6460988130818635,
"eval_loss": 5.959334373474121,
"eval_mean_token_accuracy": 0.16493839260872073,
"eval_num_tokens": 7204419.0,
"eval_runtime": 2.0846,
"eval_samples_per_second": 1615.155,
"eval_steps_per_second": 201.954,
"step": 3500
},
{
"entropy": 5.834872102737426,
"epoch": 3.110075454948957,
"grad_norm": 1.1875,
"learning_rate": 0.0004370427664051841,
"loss": 5.3529,
"mean_token_accuracy": 0.19269932806491852,
"num_tokens": 7214372.0,
"step": 3505
},
{
"entropy": 5.863707590103149,
"epoch": 3.114513981358189,
"grad_norm": 1.0703125,
"learning_rate": 0.0004368035892958533,
"loss": 5.3994,
"mean_token_accuracy": 0.19355032294988633,
"num_tokens": 7224990.0,
"step": 3510
},
{
"entropy": 5.937055206298828,
"epoch": 3.118952507767421,
"grad_norm": 1.1171875,
"learning_rate": 0.00043656403292996454,
"loss": 5.4193,
"mean_token_accuracy": 0.1840432032942772,
"num_tokens": 7235487.0,
"step": 3515
},
{
"entropy": 5.885832786560059,
"epoch": 3.1233910341766533,
"grad_norm": 1.0546875,
"learning_rate": 0.0004363240978690218,
"loss": 5.4026,
"mean_token_accuracy": 0.19053976088762284,
"num_tokens": 7245942.0,
"step": 3520
},
{
"entropy": 5.951666831970215,
"epoch": 3.1278295605858855,
"grad_norm": 1.09375,
"learning_rate": 0.00043608378467541626,
"loss": 5.4028,
"mean_token_accuracy": 0.18414484113454818,
"num_tokens": 7255323.0,
"step": 3525
},
{
"entropy": 5.941895866394043,
"epoch": 3.1322680869951176,
"grad_norm": 1.046875,
"learning_rate": 0.00043584309391242584,
"loss": 5.4639,
"mean_token_accuracy": 0.1837260752916336,
"num_tokens": 7266339.0,
"step": 3530
},
{
"entropy": 5.955119895935058,
"epoch": 3.1367066134043498,
"grad_norm": 1.125,
"learning_rate": 0.0004356020261442131,
"loss": 5.4029,
"mean_token_accuracy": 0.1911745175719261,
"num_tokens": 7277501.0,
"step": 3535
},
{
"entropy": 5.9398706436157225,
"epoch": 3.141145139813582,
"grad_norm": 1.0703125,
"learning_rate": 0.00043536058193582443,
"loss": 5.455,
"mean_token_accuracy": 0.1892775923013687,
"num_tokens": 7287639.0,
"step": 3540
},
{
"entropy": 5.849388504028321,
"epoch": 3.145583666222814,
"grad_norm": 1.03125,
"learning_rate": 0.0004351187618531886,
"loss": 5.3415,
"mean_token_accuracy": 0.19347691684961318,
"num_tokens": 7297333.0,
"step": 3545
},
{
"entropy": 5.835960865020752,
"epoch": 3.150022192632046,
"grad_norm": 1.0390625,
"learning_rate": 0.00043487656646311535,
"loss": 5.4584,
"mean_token_accuracy": 0.18551218509674072,
"num_tokens": 7307750.0,
"step": 3550
},
{
"entropy": 5.860294580459595,
"epoch": 3.1544607190412783,
"grad_norm": 1.125,
"learning_rate": 0.0004346339963332941,
"loss": 5.3436,
"mean_token_accuracy": 0.20199633687734603,
"num_tokens": 7317128.0,
"step": 3555
},
{
"entropy": 5.871670961380005,
"epoch": 3.1588992454505105,
"grad_norm": 1.1015625,
"learning_rate": 0.0004343910520322927,
"loss": 5.4169,
"mean_token_accuracy": 0.1937512531876564,
"num_tokens": 7327574.0,
"step": 3560
},
{
"entropy": 5.894437789916992,
"epoch": 3.1633377718597426,
"grad_norm": 1.1796875,
"learning_rate": 0.000434147734129556,
"loss": 5.4207,
"mean_token_accuracy": 0.192408949136734,
"num_tokens": 7337776.0,
"step": 3565
},
{
"entropy": 5.906270456314087,
"epoch": 3.1677762982689748,
"grad_norm": 1.1328125,
"learning_rate": 0.00043390404319540443,
"loss": 5.4257,
"mean_token_accuracy": 0.19216728061437607,
"num_tokens": 7347691.0,
"step": 3570
},
{
"entropy": 5.894905376434326,
"epoch": 3.172214824678207,
"grad_norm": 1.125,
"learning_rate": 0.00043365997980103304,
"loss": 5.4454,
"mean_token_accuracy": 0.18370102643966674,
"num_tokens": 7358152.0,
"step": 3575
},
{
"entropy": 5.903047180175781,
"epoch": 3.176653351087439,
"grad_norm": 1.1015625,
"learning_rate": 0.00043341554451850964,
"loss": 5.3993,
"mean_token_accuracy": 0.19171175360679626,
"num_tokens": 7369017.0,
"step": 3580
},
{
"entropy": 5.9143860816955565,
"epoch": 3.181091877496671,
"grad_norm": 1.0546875,
"learning_rate": 0.00043317073792077394,
"loss": 5.4409,
"mean_token_accuracy": 0.19202805012464524,
"num_tokens": 7378589.0,
"step": 3585
},
{
"entropy": 5.907209157943726,
"epoch": 3.1855304039059034,
"grad_norm": 1.140625,
"learning_rate": 0.0004329255605816357,
"loss": 5.3684,
"mean_token_accuracy": 0.19171188175678253,
"num_tokens": 7388053.0,
"step": 3590
},
{
"entropy": 5.889437580108643,
"epoch": 3.1899689303151355,
"grad_norm": 1.078125,
"learning_rate": 0.000432680013075774,
"loss": 5.4492,
"mean_token_accuracy": 0.18419877737760543,
"num_tokens": 7398200.0,
"step": 3595
},
{
"entropy": 5.893877220153809,
"epoch": 3.1944074567243677,
"grad_norm": 1.046875,
"learning_rate": 0.0004324340959787354,
"loss": 5.3605,
"mean_token_accuracy": 0.20110263228416442,
"num_tokens": 7408378.0,
"step": 3600
},
{
"entropy": 5.872954082489014,
"epoch": 3.1988459831336,
"grad_norm": 1.2265625,
"learning_rate": 0.00043218780986693274,
"loss": 5.4328,
"mean_token_accuracy": 0.1992975264787674,
"num_tokens": 7418961.0,
"step": 3605
},
{
"entropy": 5.846698236465454,
"epoch": 3.203284509542832,
"grad_norm": 1.0703125,
"learning_rate": 0.0004319411553176438,
"loss": 5.5195,
"mean_token_accuracy": 0.18346895426511764,
"num_tokens": 7429844.0,
"step": 3610
},
{
"entropy": 5.879422616958618,
"epoch": 3.207723035952064,
"grad_norm": 1.0625,
"learning_rate": 0.0004316941329090101,
"loss": 5.3498,
"mean_token_accuracy": 0.20174553096294404,
"num_tokens": 7440824.0,
"step": 3615
},
{
"entropy": 5.9176287174224855,
"epoch": 3.2121615623612962,
"grad_norm": 1.21875,
"learning_rate": 0.00043144674322003525,
"loss": 5.4666,
"mean_token_accuracy": 0.1915660098195076,
"num_tokens": 7451666.0,
"step": 3620
},
{
"entropy": 5.904341077804565,
"epoch": 3.2166000887705284,
"grad_norm": 1.1328125,
"learning_rate": 0.0004311989868305837,
"loss": 5.4375,
"mean_token_accuracy": 0.1913430780172348,
"num_tokens": 7462476.0,
"step": 3625
},
{
"entropy": 5.900774383544922,
"epoch": 3.2210386151797605,
"grad_norm": 1.171875,
"learning_rate": 0.00043095086432137954,
"loss": 5.4534,
"mean_token_accuracy": 0.18185227811336518,
"num_tokens": 7472388.0,
"step": 3630
},
{
"entropy": 5.887851858139038,
"epoch": 3.2254771415889927,
"grad_norm": 1.125,
"learning_rate": 0.000430702376274005,
"loss": 5.401,
"mean_token_accuracy": 0.19130902141332626,
"num_tokens": 7482770.0,
"step": 3635
},
{
"entropy": 5.906753969192505,
"epoch": 3.2299156679982244,
"grad_norm": 1.1171875,
"learning_rate": 0.00043045352327089907,
"loss": 5.468,
"mean_token_accuracy": 0.1859576016664505,
"num_tokens": 7492107.0,
"step": 3640
},
{
"entropy": 5.898250150680542,
"epoch": 3.2343541944074565,
"grad_norm": 1.140625,
"learning_rate": 0.00043020430589535625,
"loss": 5.3594,
"mean_token_accuracy": 0.19287962913513185,
"num_tokens": 7501597.0,
"step": 3645
},
{
"entropy": 5.905869817733764,
"epoch": 3.2387927208166887,
"grad_norm": 1.109375,
"learning_rate": 0.000429954724731525,
"loss": 5.4058,
"mean_token_accuracy": 0.19971251338720322,
"num_tokens": 7513200.0,
"step": 3650
},
{
"entropy": 5.91200532913208,
"epoch": 3.243231247225921,
"grad_norm": 1.1015625,
"learning_rate": 0.0004297047803644063,
"loss": 5.3459,
"mean_token_accuracy": 0.19347363710403442,
"num_tokens": 7522807.0,
"step": 3655
},
{
"entropy": 5.8334047317504885,
"epoch": 3.247669773635153,
"grad_norm": 1.0234375,
"learning_rate": 0.000429454473379853,
"loss": 5.3477,
"mean_token_accuracy": 0.1945561319589615,
"num_tokens": 7533577.0,
"step": 3660
},
{
"entropy": 5.883318090438843,
"epoch": 3.252108300044385,
"grad_norm": 1.125,
"learning_rate": 0.0004292038043645675,
"loss": 5.4106,
"mean_token_accuracy": 0.18551634699106218,
"num_tokens": 7543640.0,
"step": 3665
},
{
"entropy": 5.794455099105835,
"epoch": 3.2565468264536173,
"grad_norm": 0.95703125,
"learning_rate": 0.00042895277390610074,
"loss": 5.4428,
"mean_token_accuracy": 0.19491562098264695,
"num_tokens": 7554692.0,
"step": 3670
},
{
"entropy": 5.990721559524536,
"epoch": 3.2609853528628494,
"grad_norm": 1.1484375,
"learning_rate": 0.0004287013825928509,
"loss": 5.385,
"mean_token_accuracy": 0.18947930932044982,
"num_tokens": 7563925.0,
"step": 3675
},
{
"entropy": 5.733651828765869,
"epoch": 3.2654238792720816,
"grad_norm": 1.34375,
"learning_rate": 0.0004284496310140622,
"loss": 5.2984,
"mean_token_accuracy": 0.20197273343801497,
"num_tokens": 7573484.0,
"step": 3680
},
{
"entropy": 5.799650478363037,
"epoch": 3.2698624056813137,
"grad_norm": 1.125,
"learning_rate": 0.0004281975197598231,
"loss": 5.3955,
"mean_token_accuracy": 0.19549006968736649,
"num_tokens": 7582808.0,
"step": 3685
},
{
"entropy": 5.88456883430481,
"epoch": 3.274300932090546,
"grad_norm": 1.125,
"learning_rate": 0.0004279450494210651,
"loss": 5.4827,
"mean_token_accuracy": 0.18646293729543686,
"num_tokens": 7593790.0,
"step": 3690
},
{
"entropy": 5.911808729171753,
"epoch": 3.278739458499778,
"grad_norm": 1.0546875,
"learning_rate": 0.0004276922205895614,
"loss": 5.48,
"mean_token_accuracy": 0.1881803423166275,
"num_tokens": 7603756.0,
"step": 3695
},
{
"entropy": 5.939221954345703,
"epoch": 3.28317798490901,
"grad_norm": 1.0703125,
"learning_rate": 0.0004274390338579257,
"loss": 5.4207,
"mean_token_accuracy": 0.19052503407001495,
"num_tokens": 7614126.0,
"step": 3700
},
{
"entropy": 5.749071359634399,
"epoch": 3.2876165113182423,
"grad_norm": 1.109375,
"learning_rate": 0.0004271854898196102,
"loss": 5.3746,
"mean_token_accuracy": 0.19580249339342118,
"num_tokens": 7624573.0,
"step": 3705
},
{
"entropy": 5.878935194015503,
"epoch": 3.2920550377274744,
"grad_norm": 1.1484375,
"learning_rate": 0.0004269315890689049,
"loss": 5.4431,
"mean_token_accuracy": 0.1863309696316719,
"num_tokens": 7634715.0,
"step": 3710
},
{
"entropy": 5.853589487075806,
"epoch": 3.2964935641367066,
"grad_norm": 1.140625,
"learning_rate": 0.00042667733220093574,
"loss": 5.3239,
"mean_token_accuracy": 0.20386914610862733,
"num_tokens": 7644241.0,
"step": 3715
},
{
"entropy": 5.874784135818482,
"epoch": 3.3009320905459387,
"grad_norm": 1.125,
"learning_rate": 0.0004264227198116635,
"loss": 5.4795,
"mean_token_accuracy": 0.18705491870641708,
"num_tokens": 7655655.0,
"step": 3720
},
{
"entropy": 5.848001718521118,
"epoch": 3.305370616955171,
"grad_norm": 1.1796875,
"learning_rate": 0.00042616775249788223,
"loss": 5.4973,
"mean_token_accuracy": 0.18835359066724777,
"num_tokens": 7665232.0,
"step": 3725
},
{
"entropy": 5.913939046859741,
"epoch": 3.309809143364403,
"grad_norm": 1.171875,
"learning_rate": 0.0004259124308572178,
"loss": 5.4316,
"mean_token_accuracy": 0.1916329488158226,
"num_tokens": 7675178.0,
"step": 3730
},
{
"entropy": 5.899500942230224,
"epoch": 3.314247669773635,
"grad_norm": 1.0390625,
"learning_rate": 0.0004256567554881268,
"loss": 5.3627,
"mean_token_accuracy": 0.1938821107149124,
"num_tokens": 7685835.0,
"step": 3735
},
{
"entropy": 5.912274503707886,
"epoch": 3.3186861961828673,
"grad_norm": 1.2578125,
"learning_rate": 0.0004254007269898948,
"loss": 5.3577,
"mean_token_accuracy": 0.1939299672842026,
"num_tokens": 7694828.0,
"step": 3740
},
{
"entropy": 5.82884202003479,
"epoch": 3.3231247225920995,
"grad_norm": 1.046875,
"learning_rate": 0.00042514434596263513,
"loss": 5.4271,
"mean_token_accuracy": 0.1924677923321724,
"num_tokens": 7706055.0,
"step": 3745
},
{
"entropy": 5.830545425415039,
"epoch": 3.3275632490013316,
"grad_norm": 1.1328125,
"learning_rate": 0.0004248876130072873,
"loss": 5.4581,
"mean_token_accuracy": 0.1842326655983925,
"num_tokens": 7716220.0,
"step": 3750
},
{
"entropy": 5.860052013397217,
"epoch": 3.3320017754105637,
"grad_norm": 0.98828125,
"learning_rate": 0.00042463052872561587,
"loss": 5.4372,
"mean_token_accuracy": 0.19057605415582657,
"num_tokens": 7726709.0,
"step": 3755
},
{
"entropy": 5.963085699081421,
"epoch": 3.336440301819796,
"grad_norm": 1.2265625,
"learning_rate": 0.00042437309372020886,
"loss": 5.4012,
"mean_token_accuracy": 0.1977565497159958,
"num_tokens": 7736507.0,
"step": 3760
},
{
"entropy": 5.872720527648926,
"epoch": 3.340878828229028,
"grad_norm": 1.140625,
"learning_rate": 0.00042411530859447634,
"loss": 5.4912,
"mean_token_accuracy": 0.1859763205051422,
"num_tokens": 7747031.0,
"step": 3765
},
{
"entropy": 5.914382410049439,
"epoch": 3.34531735463826,
"grad_norm": 1.1328125,
"learning_rate": 0.0004238571739526489,
"loss": 5.5078,
"mean_token_accuracy": 0.18674080073833466,
"num_tokens": 7756896.0,
"step": 3770
},
{
"entropy": 5.829860639572144,
"epoch": 3.3497558810474923,
"grad_norm": 1.0234375,
"learning_rate": 0.0004235986903997767,
"loss": 5.3098,
"mean_token_accuracy": 0.1985625222325325,
"num_tokens": 7768243.0,
"step": 3775
},
{
"entropy": 5.909512329101562,
"epoch": 3.3541944074567245,
"grad_norm": 1.1484375,
"learning_rate": 0.0004233398585417275,
"loss": 5.3886,
"mean_token_accuracy": 0.1947034165263176,
"num_tokens": 7778017.0,
"step": 3780
},
{
"entropy": 5.905759811401367,
"epoch": 3.3586329338659566,
"grad_norm": 1.171875,
"learning_rate": 0.0004230806789851854,
"loss": 5.4766,
"mean_token_accuracy": 0.18501238375902176,
"num_tokens": 7788648.0,
"step": 3785
},
{
"entropy": 5.870203638076783,
"epoch": 3.3630714602751888,
"grad_norm": 1.0859375,
"learning_rate": 0.00042282115233764953,
"loss": 5.4228,
"mean_token_accuracy": 0.1922216847538948,
"num_tokens": 7799444.0,
"step": 3790
},
{
"entropy": 5.915548610687256,
"epoch": 3.367509986684421,
"grad_norm": 1.1875,
"learning_rate": 0.0004225612792074326,
"loss": 5.4095,
"mean_token_accuracy": 0.18869893848896027,
"num_tokens": 7809324.0,
"step": 3795
},
{
"entropy": 5.847271156311035,
"epoch": 3.371948513093653,
"grad_norm": 1.0859375,
"learning_rate": 0.00042230106020365964,
"loss": 5.4219,
"mean_token_accuracy": 0.18740808665752412,
"num_tokens": 7819835.0,
"step": 3800
},
{
"entropy": 5.823662281036377,
"epoch": 3.376387039502885,
"grad_norm": 1.125,
"learning_rate": 0.00042204049593626617,
"loss": 5.3148,
"mean_token_accuracy": 0.19989162534475327,
"num_tokens": 7829978.0,
"step": 3805
},
{
"entropy": 5.8751567840576175,
"epoch": 3.3808255659121174,
"grad_norm": 1.1875,
"learning_rate": 0.00042177958701599696,
"loss": 5.466,
"mean_token_accuracy": 0.1890934631228447,
"num_tokens": 7840638.0,
"step": 3810
},
{
"entropy": 5.777163314819336,
"epoch": 3.3852640923213495,
"grad_norm": 1.1171875,
"learning_rate": 0.0004215183340544047,
"loss": 5.2881,
"mean_token_accuracy": 0.20688982158899308,
"num_tokens": 7852025.0,
"step": 3815
},
{
"entropy": 5.833953237533569,
"epoch": 3.389702618730581,
"grad_norm": 1.1328125,
"learning_rate": 0.0004212567376638485,
"loss": 5.3775,
"mean_token_accuracy": 0.19608416706323623,
"num_tokens": 7861446.0,
"step": 3820
},
{
"entropy": 5.823704862594605,
"epoch": 3.3941411451398134,
"grad_norm": 1.2421875,
"learning_rate": 0.00042099479845749256,
"loss": 5.4895,
"mean_token_accuracy": 0.18594682961702347,
"num_tokens": 7871521.0,
"step": 3825
},
{
"entropy": 5.859103012084961,
"epoch": 3.3985796715490455,
"grad_norm": 1.125,
"learning_rate": 0.00042073251704930414,
"loss": 5.4215,
"mean_token_accuracy": 0.19555966407060624,
"num_tokens": 7882352.0,
"step": 3830
},
{
"entropy": 5.895108985900879,
"epoch": 3.4030181979582776,
"grad_norm": 1.0625,
"learning_rate": 0.00042046989405405326,
"loss": 5.3998,
"mean_token_accuracy": 0.19245795011520386,
"num_tokens": 7892487.0,
"step": 3835
},
{
"entropy": 5.786870241165161,
"epoch": 3.40745672436751,
"grad_norm": 1.1171875,
"learning_rate": 0.0004202069300873102,
"loss": 5.3629,
"mean_token_accuracy": 0.19259919673204423,
"num_tokens": 7902262.0,
"step": 3840
},
{
"entropy": 5.887244415283203,
"epoch": 3.411895250776742,
"grad_norm": 1.4765625,
"learning_rate": 0.0004199436257654445,
"loss": 5.3403,
"mean_token_accuracy": 0.19992637187242507,
"num_tokens": 7913415.0,
"step": 3845
},
{
"entropy": 5.800942850112915,
"epoch": 3.416333777185974,
"grad_norm": 1.0859375,
"learning_rate": 0.0004196799817056234,
"loss": 5.3702,
"mean_token_accuracy": 0.1944957345724106,
"num_tokens": 7923378.0,
"step": 3850
},
{
"entropy": 5.833743000030518,
"epoch": 3.4207723035952062,
"grad_norm": 1.296875,
"learning_rate": 0.00041941599852581067,
"loss": 5.4005,
"mean_token_accuracy": 0.192107592523098,
"num_tokens": 7932155.0,
"step": 3855
},
{
"entropy": 5.866676568984985,
"epoch": 3.4252108300044384,
"grad_norm": 1.109375,
"learning_rate": 0.00041915167684476495,
"loss": 5.4391,
"mean_token_accuracy": 0.1913757935166359,
"num_tokens": 7942236.0,
"step": 3860
},
{
"entropy": 5.916124677658081,
"epoch": 3.4296493564136705,
"grad_norm": 1.171875,
"learning_rate": 0.000418887017282038,
"loss": 5.4685,
"mean_token_accuracy": 0.19052421748638154,
"num_tokens": 7952067.0,
"step": 3865
},
{
"entropy": 5.809151649475098,
"epoch": 3.4340878828229027,
"grad_norm": 1.0859375,
"learning_rate": 0.00041862202045797386,
"loss": 5.3092,
"mean_token_accuracy": 0.19900714755058288,
"num_tokens": 7961456.0,
"step": 3870
},
{
"entropy": 5.823811960220337,
"epoch": 3.438526409232135,
"grad_norm": 1.0546875,
"learning_rate": 0.0004183566869937069,
"loss": 5.3782,
"mean_token_accuracy": 0.20037556439638138,
"num_tokens": 7971601.0,
"step": 3875
},
{
"entropy": 5.87151517868042,
"epoch": 3.442964935641367,
"grad_norm": 1.1953125,
"learning_rate": 0.0004180910175111608,
"loss": 5.4483,
"mean_token_accuracy": 0.18243330270051955,
"num_tokens": 7982732.0,
"step": 3880
},
{
"entropy": 5.812599134445191,
"epoch": 3.447403462050599,
"grad_norm": 1.34375,
"learning_rate": 0.00041782501263304655,
"loss": 5.4182,
"mean_token_accuracy": 0.18896383941173553,
"num_tokens": 7993550.0,
"step": 3885
},
{
"entropy": 5.85041913986206,
"epoch": 3.4518419884598313,
"grad_norm": 1.1015625,
"learning_rate": 0.0004175586729828614,
"loss": 5.3866,
"mean_token_accuracy": 0.1983974426984787,
"num_tokens": 8003753.0,
"step": 3890
},
{
"entropy": 5.848913478851318,
"epoch": 3.4562805148690634,
"grad_norm": 1.0703125,
"learning_rate": 0.00041729199918488725,
"loss": 5.367,
"mean_token_accuracy": 0.1954442948102951,
"num_tokens": 8014516.0,
"step": 3895
},
{
"entropy": 5.776366281509399,
"epoch": 3.4607190412782955,
"grad_norm": 1.1953125,
"learning_rate": 0.00041702499186418936,
"loss": 5.4013,
"mean_token_accuracy": 0.191869093477726,
"num_tokens": 8024734.0,
"step": 3900
},
{
"entropy": 5.825012636184693,
"epoch": 3.4651575676875277,
"grad_norm": 1.234375,
"learning_rate": 0.00041675765164661473,
"loss": 5.2844,
"mean_token_accuracy": 0.20244546234607697,
"num_tokens": 8033681.0,
"step": 3905
},
{
"entropy": 5.812342643737793,
"epoch": 3.46959609409676,
"grad_norm": 1.25,
"learning_rate": 0.0004164899791587903,
"loss": 5.4335,
"mean_token_accuracy": 0.18668857365846633,
"num_tokens": 8043202.0,
"step": 3910
},
{
"entropy": 5.874458456039429,
"epoch": 3.474034620505992,
"grad_norm": 1.2734375,
"learning_rate": 0.00041622197502812224,
"loss": 5.4737,
"mean_token_accuracy": 0.18350510895252228,
"num_tokens": 8052964.0,
"step": 3915
},
{
"entropy": 5.868040704727173,
"epoch": 3.478473146915224,
"grad_norm": 0.97265625,
"learning_rate": 0.000415953639882794,
"loss": 5.4358,
"mean_token_accuracy": 0.191118323802948,
"num_tokens": 8063964.0,
"step": 3920
},
{
"entropy": 5.817435216903687,
"epoch": 3.4829116733244563,
"grad_norm": 1.078125,
"learning_rate": 0.00041568497435176473,
"loss": 5.3394,
"mean_token_accuracy": 0.1965772658586502,
"num_tokens": 8073659.0,
"step": 3925
},
{
"entropy": 5.775618934631348,
"epoch": 3.4873501997336884,
"grad_norm": 1.25,
"learning_rate": 0.0004154159790647681,
"loss": 5.4096,
"mean_token_accuracy": 0.1935155361890793,
"num_tokens": 8083850.0,
"step": 3930
},
{
"entropy": 5.857674884796142,
"epoch": 3.4917887261429206,
"grad_norm": 1.0703125,
"learning_rate": 0.00041514665465231063,
"loss": 5.3836,
"mean_token_accuracy": 0.19599000364542007,
"num_tokens": 8094308.0,
"step": 3935
},
{
"entropy": 5.884661388397217,
"epoch": 3.4962272525521527,
"grad_norm": 0.98046875,
"learning_rate": 0.00041487700174567036,
"loss": 5.4342,
"mean_token_accuracy": 0.1878661945462227,
"num_tokens": 8105383.0,
"step": 3940
},
{
"entropy": 5.894474458694458,
"epoch": 3.500665778961385,
"grad_norm": 1.2265625,
"learning_rate": 0.00041460702097689535,
"loss": 5.4853,
"mean_token_accuracy": 0.1829699918627739,
"num_tokens": 8116888.0,
"step": 3945
},
{
"entropy": 5.815571308135986,
"epoch": 3.505104305370617,
"grad_norm": 1.0859375,
"learning_rate": 0.00041433671297880204,
"loss": 5.3644,
"mean_token_accuracy": 0.2002154141664505,
"num_tokens": 8126419.0,
"step": 3950
},
{
"entropy": 5.856853008270264,
"epoch": 3.509542831779849,
"grad_norm": 1.109375,
"learning_rate": 0.0004140660783849739,
"loss": 5.4585,
"mean_token_accuracy": 0.18545352667570114,
"num_tokens": 8136734.0,
"step": 3955
},
{
"entropy": 5.7611549377441404,
"epoch": 3.5139813581890813,
"grad_norm": 1.109375,
"learning_rate": 0.00041379511782975995,
"loss": 5.4275,
"mean_token_accuracy": 0.18803369849920273,
"num_tokens": 8146362.0,
"step": 3960
},
{
"entropy": 5.867103481292725,
"epoch": 3.5184198845983135,
"grad_norm": 1.2265625,
"learning_rate": 0.0004135238319482731,
"loss": 5.3396,
"mean_token_accuracy": 0.19985446333885193,
"num_tokens": 8156493.0,
"step": 3965
},
{
"entropy": 5.827406597137451,
"epoch": 3.5228584110075456,
"grad_norm": 1.1796875,
"learning_rate": 0.00041325222137638914,
"loss": 5.3822,
"mean_token_accuracy": 0.198279732465744,
"num_tokens": 8166693.0,
"step": 3970
},
{
"entropy": 5.8414324760437015,
"epoch": 3.5272969374167777,
"grad_norm": 1.0234375,
"learning_rate": 0.0004129802867507444,
"loss": 5.5056,
"mean_token_accuracy": 0.18893716484308243,
"num_tokens": 8177819.0,
"step": 3975
},
{
"entropy": 5.8395007133483885,
"epoch": 3.53173546382601,
"grad_norm": 1.140625,
"learning_rate": 0.0004127080287087354,
"loss": 5.4563,
"mean_token_accuracy": 0.19080454111099243,
"num_tokens": 8187559.0,
"step": 3980
},
{
"entropy": 5.878630113601685,
"epoch": 3.536173990235242,
"grad_norm": 1.1015625,
"learning_rate": 0.00041243544788851616,
"loss": 5.4661,
"mean_token_accuracy": 0.18955991715192794,
"num_tokens": 8198051.0,
"step": 3985
},
{
"entropy": 5.788226985931397,
"epoch": 3.540612516644474,
"grad_norm": 1.0859375,
"learning_rate": 0.00041216254492899753,
"loss": 5.2939,
"mean_token_accuracy": 0.20163479596376419,
"num_tokens": 8207969.0,
"step": 3990
},
{
"entropy": 5.814974308013916,
"epoch": 3.5450510430537063,
"grad_norm": 0.91796875,
"learning_rate": 0.0004118893204698454,
"loss": 5.3902,
"mean_token_accuracy": 0.18923236578702926,
"num_tokens": 8219057.0,
"step": 3995
},
{
"entropy": 5.7541250705719,
"epoch": 3.5494895694629385,
"grad_norm": 1.1875,
"learning_rate": 0.0004116157751514793,
"loss": 5.3578,
"mean_token_accuracy": 0.19907362014055252,
"num_tokens": 8228156.0,
"step": 4000
},
{
"epoch": 3.5494895694629385,
"eval_entropy": 5.581153839047901,
"eval_loss": 5.913293838500977,
"eval_mean_token_accuracy": 0.16851918041847663,
"eval_num_tokens": 8228156.0,
"eval_runtime": 2.0884,
"eval_samples_per_second": 1612.224,
"eval_steps_per_second": 201.588,
"step": 4000
},
{
"entropy": 5.824972915649414,
"epoch": 3.5539280958721706,
"grad_norm": 1.0703125,
"learning_rate": 0.00041134190961507073,
"loss": 5.4659,
"mean_token_accuracy": 0.19036727249622346,
"num_tokens": 8238707.0,
"step": 4005
},
{
"entropy": 5.870899343490601,
"epoch": 3.5583666222814028,
"grad_norm": 1.1640625,
"learning_rate": 0.00041106772450254177,
"loss": 5.4352,
"mean_token_accuracy": 0.19054232090711593,
"num_tokens": 8248026.0,
"step": 4010
},
{
"entropy": 5.803697156906128,
"epoch": 3.562805148690635,
"grad_norm": 1.046875,
"learning_rate": 0.00041079322045656366,
"loss": 5.3887,
"mean_token_accuracy": 0.2025946080684662,
"num_tokens": 8258615.0,
"step": 4015
},
{
"entropy": 5.885553455352783,
"epoch": 3.567243675099867,
"grad_norm": 1.0859375,
"learning_rate": 0.000410518398120555,
"loss": 5.4536,
"mean_token_accuracy": 0.1920897349715233,
"num_tokens": 8268912.0,
"step": 4020
},
{
"entropy": 5.87697319984436,
"epoch": 3.571682201509099,
"grad_norm": 1.0703125,
"learning_rate": 0.00041024325813868065,
"loss": 5.4202,
"mean_token_accuracy": 0.19221669733524321,
"num_tokens": 8278503.0,
"step": 4025
},
{
"entropy": 5.786037254333496,
"epoch": 3.5761207279183314,
"grad_norm": 1.15625,
"learning_rate": 0.00040996780115584995,
"loss": 5.4195,
"mean_token_accuracy": 0.1956888884305954,
"num_tokens": 8289725.0,
"step": 4030
},
{
"entropy": 5.849604320526123,
"epoch": 3.5805592543275635,
"grad_norm": 1.09375,
"learning_rate": 0.0004096920278177153,
"loss": 5.4054,
"mean_token_accuracy": 0.19833215177059174,
"num_tokens": 8300391.0,
"step": 4035
},
{
"entropy": 5.870030736923217,
"epoch": 3.5849977807367956,
"grad_norm": 1.15625,
"learning_rate": 0.0004094159387706703,
"loss": 5.4031,
"mean_token_accuracy": 0.19163014888763427,
"num_tokens": 8310656.0,
"step": 4040
},
{
"entropy": 5.793809986114502,
"epoch": 3.589436307146028,
"grad_norm": 1.1328125,
"learning_rate": 0.0004091395346618491,
"loss": 5.3533,
"mean_token_accuracy": 0.2000315383076668,
"num_tokens": 8320605.0,
"step": 4045
},
{
"entropy": 5.88753571510315,
"epoch": 3.5938748335552595,
"grad_norm": 1.15625,
"learning_rate": 0.00040886281613912396,
"loss": 5.4909,
"mean_token_accuracy": 0.18160921484231948,
"num_tokens": 8331683.0,
"step": 4050
},
{
"entropy": 5.859517431259155,
"epoch": 3.5983133599644916,
"grad_norm": 1.0859375,
"learning_rate": 0.0004085857838511042,
"loss": 5.494,
"mean_token_accuracy": 0.18673501014709473,
"num_tokens": 8342132.0,
"step": 4055
},
{
"entropy": 5.813091182708741,
"epoch": 3.602751886373724,
"grad_norm": 1.0703125,
"learning_rate": 0.00040830843844713447,
"loss": 5.4091,
"mean_token_accuracy": 0.1943575844168663,
"num_tokens": 8352202.0,
"step": 4060
},
{
"entropy": 5.824704217910766,
"epoch": 3.607190412782956,
"grad_norm": 1.140625,
"learning_rate": 0.00040803078057729354,
"loss": 5.4583,
"mean_token_accuracy": 0.18807061463594438,
"num_tokens": 8362204.0,
"step": 4065
},
{
"entropy": 5.858654499053955,
"epoch": 3.611628939192188,
"grad_norm": 1.140625,
"learning_rate": 0.0004077528108923924,
"loss": 5.4523,
"mean_token_accuracy": 0.19497880935668946,
"num_tokens": 8372525.0,
"step": 4070
},
{
"entropy": 5.830624771118164,
"epoch": 3.6160674656014202,
"grad_norm": 1.1015625,
"learning_rate": 0.0004074745300439732,
"loss": 5.4152,
"mean_token_accuracy": 0.1913478270173073,
"num_tokens": 8383007.0,
"step": 4075
},
{
"entropy": 5.777306318283081,
"epoch": 3.6205059920106524,
"grad_norm": 1.078125,
"learning_rate": 0.000407195938684307,
"loss": 5.3941,
"mean_token_accuracy": 0.19022576361894608,
"num_tokens": 8392928.0,
"step": 4080
},
{
"entropy": 5.886033535003662,
"epoch": 3.6249445184198845,
"grad_norm": 1.078125,
"learning_rate": 0.000406917037466393,
"loss": 5.4263,
"mean_token_accuracy": 0.19012691229581832,
"num_tokens": 8403008.0,
"step": 4085
},
{
"entropy": 5.789344787597656,
"epoch": 3.6293830448291167,
"grad_norm": 1.09375,
"learning_rate": 0.0004066378270439567,
"loss": 5.4782,
"mean_token_accuracy": 0.17886057496070862,
"num_tokens": 8413513.0,
"step": 4090
},
{
"entropy": 5.841081666946411,
"epoch": 3.633821571238349,
"grad_norm": 1.203125,
"learning_rate": 0.0004063583080714481,
"loss": 5.3738,
"mean_token_accuracy": 0.1967576861381531,
"num_tokens": 8423894.0,
"step": 4095
},
{
"entropy": 5.8004848003387455,
"epoch": 3.638260097647581,
"grad_norm": 1.15625,
"learning_rate": 0.00040607848120404063,
"loss": 5.413,
"mean_token_accuracy": 0.19520466923713684,
"num_tokens": 8434467.0,
"step": 4100
},
{
"entropy": 5.803511476516723,
"epoch": 3.642698624056813,
"grad_norm": 1.2734375,
"learning_rate": 0.0004057983470976293,
"loss": 5.357,
"mean_token_accuracy": 0.2016320988535881,
"num_tokens": 8446037.0,
"step": 4105
},
{
"entropy": 5.77181224822998,
"epoch": 3.6471371504660453,
"grad_norm": 1.140625,
"learning_rate": 0.00040551790640882954,
"loss": 5.4094,
"mean_token_accuracy": 0.20021369606256484,
"num_tokens": 8457032.0,
"step": 4110
},
{
"entropy": 5.854924535751342,
"epoch": 3.6515756768752774,
"grad_norm": 1.203125,
"learning_rate": 0.00040523715979497486,
"loss": 5.4118,
"mean_token_accuracy": 0.19359598606824874,
"num_tokens": 8466088.0,
"step": 4115
},
{
"entropy": 5.865506505966186,
"epoch": 3.6560142032845095,
"grad_norm": 1.1171875,
"learning_rate": 0.0004049561079141163,
"loss": 5.4117,
"mean_token_accuracy": 0.19178108721971512,
"num_tokens": 8477214.0,
"step": 4120
},
{
"entropy": 5.798425579071045,
"epoch": 3.6604527296937417,
"grad_norm": 1.125,
"learning_rate": 0.0004046747514250202,
"loss": 5.4725,
"mean_token_accuracy": 0.19099220335483552,
"num_tokens": 8488031.0,
"step": 4125
},
{
"entropy": 5.95139889717102,
"epoch": 3.664891256102974,
"grad_norm": 1.078125,
"learning_rate": 0.0004043930909871671,
"loss": 5.5991,
"mean_token_accuracy": 0.18338969349861145,
"num_tokens": 8500214.0,
"step": 4130
},
{
"entropy": 5.890401697158813,
"epoch": 3.669329782512206,
"grad_norm": 1.046875,
"learning_rate": 0.00040411112726074954,
"loss": 5.439,
"mean_token_accuracy": 0.19255967885255815,
"num_tokens": 8509768.0,
"step": 4135
},
{
"entropy": 5.854125690460205,
"epoch": 3.673768308921438,
"grad_norm": 1.109375,
"learning_rate": 0.00040382886090667154,
"loss": 5.4488,
"mean_token_accuracy": 0.19439015686511993,
"num_tokens": 8519967.0,
"step": 4140
},
{
"entropy": 5.899671220779419,
"epoch": 3.6782068353306703,
"grad_norm": 1.09375,
"learning_rate": 0.0004035462925865459,
"loss": 5.4697,
"mean_token_accuracy": 0.18602120280265808,
"num_tokens": 8531624.0,
"step": 4145
},
{
"entropy": 5.917951536178589,
"epoch": 3.6826453617399024,
"grad_norm": 1.1796875,
"learning_rate": 0.00040326342296269363,
"loss": 5.4044,
"mean_token_accuracy": 0.19721968472003937,
"num_tokens": 8542130.0,
"step": 4150
},
{
"entropy": 5.776456356048584,
"epoch": 3.6870838881491346,
"grad_norm": 1.1640625,
"learning_rate": 0.00040298025269814165,
"loss": 5.4315,
"mean_token_accuracy": 0.19611175805330278,
"num_tokens": 8552155.0,
"step": 4155
},
{
"entropy": 5.807200622558594,
"epoch": 3.6915224145583667,
"grad_norm": 1.1640625,
"learning_rate": 0.0004026967824566218,
"loss": 5.3751,
"mean_token_accuracy": 0.19862941205501555,
"num_tokens": 8561602.0,
"step": 4160
},
{
"entropy": 5.829988574981689,
"epoch": 3.695960940967599,
"grad_norm": 1.15625,
"learning_rate": 0.000402413012902569,
"loss": 5.3549,
"mean_token_accuracy": 0.1946346491575241,
"num_tokens": 8571957.0,
"step": 4165
},
{
"entropy": 5.757293558120727,
"epoch": 3.700399467376831,
"grad_norm": 1.15625,
"learning_rate": 0.00040212894470111966,
"loss": 5.3879,
"mean_token_accuracy": 0.19661612063646317,
"num_tokens": 8582550.0,
"step": 4170
},
{
"entropy": 5.827823162078857,
"epoch": 3.704837993786063,
"grad_norm": 1.234375,
"learning_rate": 0.0004018445785181102,
"loss": 5.422,
"mean_token_accuracy": 0.19695309102535247,
"num_tokens": 8592353.0,
"step": 4175
},
{
"entropy": 5.832696485519409,
"epoch": 3.7092765201952953,
"grad_norm": 1.2265625,
"learning_rate": 0.0004015599150200755,
"loss": 5.4116,
"mean_token_accuracy": 0.1886480987071991,
"num_tokens": 8602629.0,
"step": 4180
},
{
"entropy": 5.811392307281494,
"epoch": 3.7137150466045274,
"grad_norm": 1.171875,
"learning_rate": 0.00040127495487424735,
"loss": 5.4699,
"mean_token_accuracy": 0.19141082167625428,
"num_tokens": 8612308.0,
"step": 4185
},
{
"entropy": 5.834705829620361,
"epoch": 3.7181535730137596,
"grad_norm": 1.125,
"learning_rate": 0.0004009896987485531,
"loss": 5.366,
"mean_token_accuracy": 0.20177424997091292,
"num_tokens": 8622177.0,
"step": 4190
},
{
"entropy": 5.809908723831176,
"epoch": 3.7225920994229913,
"grad_norm": 1.078125,
"learning_rate": 0.00040070414731161326,
"loss": 5.443,
"mean_token_accuracy": 0.19458999037742614,
"num_tokens": 8632435.0,
"step": 4195
},
{
"entropy": 5.747843647003174,
"epoch": 3.7270306258322234,
"grad_norm": 1.140625,
"learning_rate": 0.00040041830123274105,
"loss": 5.2288,
"mean_token_accuracy": 0.20880044400691986,
"num_tokens": 8642331.0,
"step": 4200
},
{
"entropy": 5.903952407836914,
"epoch": 3.7314691522414556,
"grad_norm": 1.0859375,
"learning_rate": 0.0004001321611819401,
"loss": 5.3903,
"mean_token_accuracy": 0.18388656824827193,
"num_tokens": 8652838.0,
"step": 4205
},
{
"entropy": 5.80471625328064,
"epoch": 3.7359076786506877,
"grad_norm": 1.1015625,
"learning_rate": 0.0003998457278299033,
"loss": 5.4137,
"mean_token_accuracy": 0.19091238379478453,
"num_tokens": 8662908.0,
"step": 4210
},
{
"entropy": 5.801855611801147,
"epoch": 3.74034620505992,
"grad_norm": 1.0625,
"learning_rate": 0.0003995590018480107,
"loss": 5.4813,
"mean_token_accuracy": 0.18728871196508406,
"num_tokens": 8673015.0,
"step": 4215
},
{
"entropy": 5.828760576248169,
"epoch": 3.744784731469152,
"grad_norm": 1.15625,
"learning_rate": 0.00039927198390832843,
"loss": 5.3716,
"mean_token_accuracy": 0.20105525702238083,
"num_tokens": 8682149.0,
"step": 4220
},
{
"entropy": 5.803042364120484,
"epoch": 3.749223257878384,
"grad_norm": 1.0234375,
"learning_rate": 0.000398984674683607,
"loss": 5.3658,
"mean_token_accuracy": 0.19573144614696503,
"num_tokens": 8692715.0,
"step": 4225
},
{
"entropy": 5.784009027481079,
"epoch": 3.7536617842876163,
"grad_norm": 1.1328125,
"learning_rate": 0.0003986970748472795,
"loss": 5.4067,
"mean_token_accuracy": 0.20018333494663237,
"num_tokens": 8702379.0,
"step": 4230
},
{
"entropy": 5.8258195400238035,
"epoch": 3.7581003106968485,
"grad_norm": 1.1484375,
"learning_rate": 0.0003984091850734604,
"loss": 5.3853,
"mean_token_accuracy": 0.19552432000637054,
"num_tokens": 8712653.0,
"step": 4235
},
{
"entropy": 5.8420146942138675,
"epoch": 3.7625388371060806,
"grad_norm": 0.9609375,
"learning_rate": 0.0003981210060369435,
"loss": 5.4715,
"mean_token_accuracy": 0.18399242907762528,
"num_tokens": 8724054.0,
"step": 4240
},
{
"entropy": 5.857115030288696,
"epoch": 3.7669773635153128,
"grad_norm": 1.078125,
"learning_rate": 0.000397832538413201,
"loss": 5.5001,
"mean_token_accuracy": 0.18325462341308593,
"num_tokens": 8734629.0,
"step": 4245
},
{
"entropy": 5.845765590667725,
"epoch": 3.771415889924545,
"grad_norm": 1.0,
"learning_rate": 0.0003975437828783811,
"loss": 5.4329,
"mean_token_accuracy": 0.1934712439775467,
"num_tokens": 8746198.0,
"step": 4250
},
{
"entropy": 5.730560302734375,
"epoch": 3.775854416333777,
"grad_norm": 1.09375,
"learning_rate": 0.00039725474010930716,
"loss": 5.3907,
"mean_token_accuracy": 0.20444272756576537,
"num_tokens": 8756604.0,
"step": 4255
},
{
"entropy": 5.827708339691162,
"epoch": 3.780292942743009,
"grad_norm": 1.171875,
"learning_rate": 0.0003969654107834756,
"loss": 5.4509,
"mean_token_accuracy": 0.1945435181260109,
"num_tokens": 8768088.0,
"step": 4260
},
{
"entropy": 5.82703127861023,
"epoch": 3.7847314691522413,
"grad_norm": 0.9765625,
"learning_rate": 0.0003966757955790547,
"loss": 5.3874,
"mean_token_accuracy": 0.19351006299257278,
"num_tokens": 8778318.0,
"step": 4265
},
{
"entropy": 5.848085165023804,
"epoch": 3.7891699955614735,
"grad_norm": 1.1171875,
"learning_rate": 0.0003963858951748826,
"loss": 5.4017,
"mean_token_accuracy": 0.1907930001616478,
"num_tokens": 8788659.0,
"step": 4270
},
{
"entropy": 5.796998500823975,
"epoch": 3.7936085219707056,
"grad_norm": 1.0546875,
"learning_rate": 0.0003960957102504661,
"loss": 5.4293,
"mean_token_accuracy": 0.18963894993066788,
"num_tokens": 8799052.0,
"step": 4275
},
{
"entropy": 5.907032918930054,
"epoch": 3.798047048379938,
"grad_norm": 1.1171875,
"learning_rate": 0.0003958052414859788,
"loss": 5.4359,
"mean_token_accuracy": 0.1835399091243744,
"num_tokens": 8808534.0,
"step": 4280
},
{
"entropy": 5.759076499938965,
"epoch": 3.80248557478917,
"grad_norm": 1.0625,
"learning_rate": 0.0003955144895622597,
"loss": 5.3888,
"mean_token_accuracy": 0.1968761757016182,
"num_tokens": 8818802.0,
"step": 4285
},
{
"entropy": 5.813445806503296,
"epoch": 3.806924101198402,
"grad_norm": 1.1171875,
"learning_rate": 0.0003952234551608114,
"loss": 5.3661,
"mean_token_accuracy": 0.18817414045333863,
"num_tokens": 8829123.0,
"step": 4290
},
{
"entropy": 5.800790023803711,
"epoch": 3.8113626276076342,
"grad_norm": 1.1171875,
"learning_rate": 0.0003949321389637986,
"loss": 5.4292,
"mean_token_accuracy": 0.19044290333986283,
"num_tokens": 8839771.0,
"step": 4295
},
{
"entropy": 5.825014877319336,
"epoch": 3.8158011540168664,
"grad_norm": 1.109375,
"learning_rate": 0.0003946405416540466,
"loss": 5.4491,
"mean_token_accuracy": 0.18945735543966294,
"num_tokens": 8849621.0,
"step": 4300
},
{
"entropy": 5.940211343765259,
"epoch": 3.8202396804260985,
"grad_norm": 1.125,
"learning_rate": 0.00039434866391503963,
"loss": 5.4527,
"mean_token_accuracy": 0.1803130567073822,
"num_tokens": 8860672.0,
"step": 4305
},
{
"entropy": 5.789125680923462,
"epoch": 3.8246782068353307,
"grad_norm": 1.09375,
"learning_rate": 0.00039405650643091917,
"loss": 5.3998,
"mean_token_accuracy": 0.19494441598653794,
"num_tokens": 8870721.0,
"step": 4310
},
{
"entropy": 5.757489824295044,
"epoch": 3.829116733244563,
"grad_norm": 1.0859375,
"learning_rate": 0.0003937640698864823,
"loss": 5.4515,
"mean_token_accuracy": 0.19027765691280366,
"num_tokens": 8882142.0,
"step": 4315
},
{
"entropy": 5.861147117614746,
"epoch": 3.833555259653795,
"grad_norm": 1.0390625,
"learning_rate": 0.00039347135496718027,
"loss": 5.4136,
"mean_token_accuracy": 0.1945791110396385,
"num_tokens": 8892573.0,
"step": 4320
},
{
"entropy": 5.772451877593994,
"epoch": 3.837993786063027,
"grad_norm": 1.015625,
"learning_rate": 0.00039317836235911705,
"loss": 5.4017,
"mean_token_accuracy": 0.195092111825943,
"num_tokens": 8902942.0,
"step": 4325
},
{
"entropy": 5.806214046478272,
"epoch": 3.8424323124722592,
"grad_norm": 1.140625,
"learning_rate": 0.0003928850927490472,
"loss": 5.4216,
"mean_token_accuracy": 0.18946156948804854,
"num_tokens": 8913208.0,
"step": 4330
},
{
"entropy": 5.805463075637817,
"epoch": 3.8468708388814914,
"grad_norm": 1.2265625,
"learning_rate": 0.0003925915468243746,
"loss": 5.4276,
"mean_token_accuracy": 0.1883111536502838,
"num_tokens": 8923080.0,
"step": 4335
},
{
"entropy": 5.89415135383606,
"epoch": 3.8513093652907235,
"grad_norm": 1.2421875,
"learning_rate": 0.00039229772527315073,
"loss": 5.4224,
"mean_token_accuracy": 0.18533381819725037,
"num_tokens": 8933823.0,
"step": 4340
},
{
"entropy": 5.795059251785278,
"epoch": 3.8557478916999557,
"grad_norm": 1.1484375,
"learning_rate": 0.0003920036287840734,
"loss": 5.3395,
"mean_token_accuracy": 0.19785182178020477,
"num_tokens": 8943412.0,
"step": 4345
},
{
"entropy": 5.793986701965332,
"epoch": 3.860186418109188,
"grad_norm": 1.125,
"learning_rate": 0.00039170925804648486,
"loss": 5.4513,
"mean_token_accuracy": 0.19680401533842087,
"num_tokens": 8953616.0,
"step": 4350
},
{
"entropy": 5.841963052749634,
"epoch": 3.86462494451842,
"grad_norm": 1.140625,
"learning_rate": 0.00039141461375036957,
"loss": 5.4467,
"mean_token_accuracy": 0.18167138546705247,
"num_tokens": 8964790.0,
"step": 4355
},
{
"entropy": 5.803447532653808,
"epoch": 3.869063470927652,
"grad_norm": 1.125,
"learning_rate": 0.0003911196965863539,
"loss": 5.3662,
"mean_token_accuracy": 0.1910330817103386,
"num_tokens": 8975476.0,
"step": 4360
},
{
"entropy": 5.852850914001465,
"epoch": 3.8735019973368843,
"grad_norm": 1.0625,
"learning_rate": 0.00039082450724570357,
"loss": 5.4888,
"mean_token_accuracy": 0.18827887177467345,
"num_tokens": 8986132.0,
"step": 4365
},
{
"entropy": 5.80005111694336,
"epoch": 3.8779405237461164,
"grad_norm": 1.234375,
"learning_rate": 0.0003905290464203221,
"loss": 5.4303,
"mean_token_accuracy": 0.19234416782855987,
"num_tokens": 8996384.0,
"step": 4370
},
{
"entropy": 5.816908454895019,
"epoch": 3.8823790501553486,
"grad_norm": 1.0546875,
"learning_rate": 0.0003902333148027495,
"loss": 5.391,
"mean_token_accuracy": 0.20051574110984802,
"num_tokens": 9006288.0,
"step": 4375
},
{
"entropy": 5.857726764678955,
"epoch": 3.8868175765645807,
"grad_norm": 1.109375,
"learning_rate": 0.0003899373130861605,
"loss": 5.4102,
"mean_token_accuracy": 0.19304264485836028,
"num_tokens": 9016713.0,
"step": 4380
},
{
"entropy": 5.917016649246216,
"epoch": 3.891256102973813,
"grad_norm": 1.046875,
"learning_rate": 0.00038964104196436284,
"loss": 5.3835,
"mean_token_accuracy": 0.19150962233543395,
"num_tokens": 9026524.0,
"step": 4385
},
{
"entropy": 5.777474451065063,
"epoch": 3.895694629383045,
"grad_norm": 1.2109375,
"learning_rate": 0.00038934450213179596,
"loss": 5.4493,
"mean_token_accuracy": 0.1875316545367241,
"num_tokens": 9037063.0,
"step": 4390
},
{
"entropy": 5.824544095993042,
"epoch": 3.900133155792277,
"grad_norm": 1.1171875,
"learning_rate": 0.00038904769428352873,
"loss": 5.4017,
"mean_token_accuracy": 0.1963329166173935,
"num_tokens": 9047685.0,
"step": 4395
},
{
"entropy": 5.849619722366333,
"epoch": 3.9045716822015093,
"grad_norm": 1.109375,
"learning_rate": 0.00038875061911525856,
"loss": 5.3666,
"mean_token_accuracy": 0.1921242356300354,
"num_tokens": 9058084.0,
"step": 4400
},
{
"entropy": 5.744299793243409,
"epoch": 3.9090102086107414,
"grad_norm": 1.046875,
"learning_rate": 0.0003884532773233094,
"loss": 5.3635,
"mean_token_accuracy": 0.20264142900705337,
"num_tokens": 9068384.0,
"step": 4405
},
{
"entropy": 5.833960247039795,
"epoch": 3.9134487350199736,
"grad_norm": 1.078125,
"learning_rate": 0.00038815566960463015,
"loss": 5.4482,
"mean_token_accuracy": 0.18840712010860444,
"num_tokens": 9079222.0,
"step": 4410
},
{
"entropy": 5.850077724456787,
"epoch": 3.9178872614292057,
"grad_norm": 1.125,
"learning_rate": 0.00038785779665679275,
"loss": 5.4202,
"mean_token_accuracy": 0.18839995115995406,
"num_tokens": 9089526.0,
"step": 4415
},
{
"entropy": 5.751740980148315,
"epoch": 3.922325787838438,
"grad_norm": 1.0859375,
"learning_rate": 0.0003875596591779913,
"loss": 5.3186,
"mean_token_accuracy": 0.2056492105126381,
"num_tokens": 9099054.0,
"step": 4420
},
{
"entropy": 5.793323278427124,
"epoch": 3.92676431424767,
"grad_norm": 1.09375,
"learning_rate": 0.0003872612578670395,
"loss": 5.4754,
"mean_token_accuracy": 0.18841795325279237,
"num_tokens": 9109290.0,
"step": 4425
},
{
"entropy": 5.885016775131225,
"epoch": 3.931202840656902,
"grad_norm": 1.078125,
"learning_rate": 0.00038696259342336966,
"loss": 5.499,
"mean_token_accuracy": 0.18841444998979567,
"num_tokens": 9120796.0,
"step": 4430
},
{
"entropy": 5.861675357818603,
"epoch": 3.935641367066134,
"grad_norm": 1.2734375,
"learning_rate": 0.00038666366654703077,
"loss": 5.4846,
"mean_token_accuracy": 0.1862151712179184,
"num_tokens": 9131306.0,
"step": 4435
},
{
"entropy": 5.840978145599365,
"epoch": 3.940079893475366,
"grad_norm": 1.203125,
"learning_rate": 0.00038636447793868715,
"loss": 5.4734,
"mean_token_accuracy": 0.18990519195795058,
"num_tokens": 9140278.0,
"step": 4440
},
{
"entropy": 5.851602220535279,
"epoch": 3.944518419884598,
"grad_norm": 1.0703125,
"learning_rate": 0.00038606502829961645,
"loss": 5.4267,
"mean_token_accuracy": 0.19005220383405685,
"num_tokens": 9150742.0,
"step": 4445
},
{
"entropy": 5.7608050346374515,
"epoch": 3.9489569462938303,
"grad_norm": 1.2734375,
"learning_rate": 0.0003857653183317081,
"loss": 5.3303,
"mean_token_accuracy": 0.19899591207504272,
"num_tokens": 9160227.0,
"step": 4450
},
{
"entropy": 5.791858434677124,
"epoch": 3.9533954727030625,
"grad_norm": 1.0390625,
"learning_rate": 0.0003854653487374617,
"loss": 5.4306,
"mean_token_accuracy": 0.19147539585828782,
"num_tokens": 9170733.0,
"step": 4455
},
{
"entropy": 5.8443633079528805,
"epoch": 3.9578339991122946,
"grad_norm": 1.140625,
"learning_rate": 0.0003851651202199856,
"loss": 5.413,
"mean_token_accuracy": 0.19143973886966706,
"num_tokens": 9180582.0,
"step": 4460
},
{
"entropy": 5.821952390670776,
"epoch": 3.9622725255215268,
"grad_norm": 1.1640625,
"learning_rate": 0.0003848646334829949,
"loss": 5.4525,
"mean_token_accuracy": 0.1855350062251091,
"num_tokens": 9191245.0,
"step": 4465
},
{
"entropy": 5.840106630325318,
"epoch": 3.966711051930759,
"grad_norm": 1.03125,
"learning_rate": 0.00038456388923081006,
"loss": 5.4459,
"mean_token_accuracy": 0.18592941164970397,
"num_tokens": 9201657.0,
"step": 4470
},
{
"entropy": 5.830752325057984,
"epoch": 3.971149578339991,
"grad_norm": 1.1953125,
"learning_rate": 0.00038426288816835485,
"loss": 5.4103,
"mean_token_accuracy": 0.18891609460115433,
"num_tokens": 9212102.0,
"step": 4475
},
{
"entropy": 5.847698926925659,
"epoch": 3.975588104749223,
"grad_norm": 1.1171875,
"learning_rate": 0.0003839616310011554,
"loss": 5.3934,
"mean_token_accuracy": 0.18960051685571672,
"num_tokens": 9221022.0,
"step": 4480
},
{
"entropy": 5.806353616714477,
"epoch": 3.9800266311584553,
"grad_norm": 0.98046875,
"learning_rate": 0.0003836601184353379,
"loss": 5.4564,
"mean_token_accuracy": 0.18732759356498718,
"num_tokens": 9232105.0,
"step": 4485
},
{
"entropy": 5.804685926437378,
"epoch": 3.9844651575676875,
"grad_norm": 0.90625,
"learning_rate": 0.00038335835117762706,
"loss": 5.3984,
"mean_token_accuracy": 0.1938449651002884,
"num_tokens": 9242338.0,
"step": 4490
},
{
"entropy": 5.864504861831665,
"epoch": 3.9889036839769196,
"grad_norm": 1.140625,
"learning_rate": 0.00038305632993534483,
"loss": 5.4276,
"mean_token_accuracy": 0.1886606141924858,
"num_tokens": 9252551.0,
"step": 4495
},
{
"entropy": 5.843533515930176,
"epoch": 3.993342210386152,
"grad_norm": 1.1328125,
"learning_rate": 0.00038275405541640835,
"loss": 5.403,
"mean_token_accuracy": 0.19167436361312867,
"num_tokens": 9263424.0,
"step": 4500
},
{
"epoch": 3.993342210386152,
"eval_entropy": 5.580333083372501,
"eval_loss": 5.84522008895874,
"eval_mean_token_accuracy": 0.17348938688388063,
"eval_num_tokens": 9263424.0,
"eval_runtime": 2.2779,
"eval_samples_per_second": 1478.121,
"eval_steps_per_second": 184.82,
"step": 4500
},
{
"entropy": 5.849137592315674,
"epoch": 3.997780736795384,
"grad_norm": 1.0546875,
"learning_rate": 0.00038245152832932843,
"loss": 5.4953,
"mean_token_accuracy": 0.1837543785572052,
"num_tokens": 9274355.0,
"step": 4505
},
{
"entropy": 5.780615064832899,
"epoch": 4.001775410563693,
"grad_norm": 0.984375,
"learning_rate": 0.00038214874938320795,
"loss": 5.2503,
"mean_token_accuracy": 0.205965217616823,
"num_tokens": 9283179.0,
"step": 4510
},
{
"entropy": 5.817928743362427,
"epoch": 4.006213936972925,
"grad_norm": 1.15625,
"learning_rate": 0.0003818457192877399,
"loss": 5.1978,
"mean_token_accuracy": 0.208414126932621,
"num_tokens": 9293709.0,
"step": 4515
},
{
"entropy": 5.824892950057984,
"epoch": 4.010652463382157,
"grad_norm": 1.1328125,
"learning_rate": 0.0003815424387532063,
"loss": 5.2238,
"mean_token_accuracy": 0.21198973655700684,
"num_tokens": 9303971.0,
"step": 4520
},
{
"entropy": 5.810022640228271,
"epoch": 4.015090989791389,
"grad_norm": 1.109375,
"learning_rate": 0.000381238908490476,
"loss": 5.1717,
"mean_token_accuracy": 0.208732508122921,
"num_tokens": 9313578.0,
"step": 4525
},
{
"entropy": 5.752050828933716,
"epoch": 4.019529516200621,
"grad_norm": 1.09375,
"learning_rate": 0.00038093512921100306,
"loss": 5.1907,
"mean_token_accuracy": 0.2054088294506073,
"num_tokens": 9323538.0,
"step": 4530
},
{
"entropy": 5.838475942611694,
"epoch": 4.023968042609853,
"grad_norm": 1.1171875,
"learning_rate": 0.0003806311016268254,
"loss": 5.1886,
"mean_token_accuracy": 0.20790643393993377,
"num_tokens": 9335266.0,
"step": 4535
},
{
"entropy": 5.79393162727356,
"epoch": 4.028406569019086,
"grad_norm": 1.15625,
"learning_rate": 0.000380326826450563,
"loss": 5.1481,
"mean_token_accuracy": 0.20686888098716735,
"num_tokens": 9345247.0,
"step": 4540
},
{
"entropy": 5.778472805023194,
"epoch": 4.032845095428318,
"grad_norm": 1.2265625,
"learning_rate": 0.00038002230439541603,
"loss": 5.1838,
"mean_token_accuracy": 0.20136410593986512,
"num_tokens": 9355435.0,
"step": 4545
},
{
"entropy": 5.719447374343872,
"epoch": 4.03728362183755,
"grad_norm": 1.109375,
"learning_rate": 0.00037971753617516336,
"loss": 5.109,
"mean_token_accuracy": 0.2196057543158531,
"num_tokens": 9365503.0,
"step": 4550
},
{
"entropy": 5.798331022262573,
"epoch": 4.041722148246782,
"grad_norm": 1.21875,
"learning_rate": 0.00037941252250416074,
"loss": 5.0692,
"mean_token_accuracy": 0.21513248682022096,
"num_tokens": 9374361.0,
"step": 4555
},
{
"entropy": 5.722120237350464,
"epoch": 4.046160674656014,
"grad_norm": 1.1640625,
"learning_rate": 0.00037910726409733965,
"loss": 5.0786,
"mean_token_accuracy": 0.22050419300794602,
"num_tokens": 9383992.0,
"step": 4560
},
{
"entropy": 5.756671810150147,
"epoch": 4.050599201065246,
"grad_norm": 1.03125,
"learning_rate": 0.0003788017616702048,
"loss": 5.2069,
"mean_token_accuracy": 0.20192554146051406,
"num_tokens": 9394270.0,
"step": 4565
},
{
"entropy": 5.837602424621582,
"epoch": 4.055037727474478,
"grad_norm": 1.15625,
"learning_rate": 0.00037849601593883297,
"loss": 5.1378,
"mean_token_accuracy": 0.20951651483774186,
"num_tokens": 9404913.0,
"step": 4570
},
{
"entropy": 5.830431222915649,
"epoch": 4.059476253883711,
"grad_norm": 1.0703125,
"learning_rate": 0.00037819002761987127,
"loss": 5.2469,
"mean_token_accuracy": 0.20075388699769975,
"num_tokens": 9415718.0,
"step": 4575
},
{
"entropy": 5.777271699905396,
"epoch": 4.063914780292943,
"grad_norm": 1.0625,
"learning_rate": 0.0003778837974305355,
"loss": 5.1694,
"mean_token_accuracy": 0.20675463527441024,
"num_tokens": 9425761.0,
"step": 4580
},
{
"entropy": 5.696642255783081,
"epoch": 4.068353306702175,
"grad_norm": 1.0546875,
"learning_rate": 0.00037757732608860824,
"loss": 5.1757,
"mean_token_accuracy": 0.2074501171708107,
"num_tokens": 9437519.0,
"step": 4585
},
{
"entropy": 5.773201513290405,
"epoch": 4.072791833111407,
"grad_norm": 1.2265625,
"learning_rate": 0.00037727061431243737,
"loss": 5.0117,
"mean_token_accuracy": 0.22399133294820786,
"num_tokens": 9447452.0,
"step": 4590
},
{
"entropy": 5.802689504623413,
"epoch": 4.077230359520639,
"grad_norm": 1.2890625,
"learning_rate": 0.00037696366282093433,
"loss": 5.2194,
"mean_token_accuracy": 0.20754450112581252,
"num_tokens": 9458155.0,
"step": 4595
},
{
"entropy": 5.665275192260742,
"epoch": 4.081668885929871,
"grad_norm": 1.1796875,
"learning_rate": 0.00037665647233357243,
"loss": 5.035,
"mean_token_accuracy": 0.22337092012166976,
"num_tokens": 9467478.0,
"step": 4600
},
{
"entropy": 5.747597599029541,
"epoch": 4.0861074123391035,
"grad_norm": 1.15625,
"learning_rate": 0.0003763490435703853,
"loss": 5.1954,
"mean_token_accuracy": 0.2060795918107033,
"num_tokens": 9478636.0,
"step": 4605
},
{
"entropy": 5.818109655380249,
"epoch": 4.090545938748336,
"grad_norm": 1.3125,
"learning_rate": 0.0003760413772519648,
"loss": 5.1343,
"mean_token_accuracy": 0.21224167048931122,
"num_tokens": 9488626.0,
"step": 4610
},
{
"entropy": 5.805790519714355,
"epoch": 4.094984465157568,
"grad_norm": 1.015625,
"learning_rate": 0.00037573347409945983,
"loss": 5.2094,
"mean_token_accuracy": 0.20401569008827208,
"num_tokens": 9501119.0,
"step": 4615
},
{
"entropy": 5.736809253692627,
"epoch": 4.0994229915668,
"grad_norm": 1.2578125,
"learning_rate": 0.0003754253348345743,
"loss": 5.0526,
"mean_token_accuracy": 0.21723955422639846,
"num_tokens": 9511075.0,
"step": 4620
},
{
"entropy": 5.720714664459228,
"epoch": 4.103861517976032,
"grad_norm": 1.2265625,
"learning_rate": 0.0003751169601795657,
"loss": 5.1149,
"mean_token_accuracy": 0.2152253657579422,
"num_tokens": 9520956.0,
"step": 4625
},
{
"entropy": 5.765715742111206,
"epoch": 4.108300044385264,
"grad_norm": 1.1328125,
"learning_rate": 0.00037480835085724313,
"loss": 5.1922,
"mean_token_accuracy": 0.20740145891904832,
"num_tokens": 9531020.0,
"step": 4630
},
{
"entropy": 5.826910781860351,
"epoch": 4.112738570794496,
"grad_norm": 1.1640625,
"learning_rate": 0.0003744995075909656,
"loss": 5.1995,
"mean_token_accuracy": 0.20915032178163528,
"num_tokens": 9541230.0,
"step": 4635
},
{
"entropy": 5.742929315567016,
"epoch": 4.1171770972037285,
"grad_norm": 1.265625,
"learning_rate": 0.0003741904311046408,
"loss": 5.1937,
"mean_token_accuracy": 0.20653378814458848,
"num_tokens": 9551055.0,
"step": 4640
},
{
"entropy": 5.820126247406006,
"epoch": 4.121615623612961,
"grad_norm": 1.15625,
"learning_rate": 0.0003738811221227228,
"loss": 5.2131,
"mean_token_accuracy": 0.2067299783229828,
"num_tokens": 9560982.0,
"step": 4645
},
{
"entropy": 5.5898134231567385,
"epoch": 4.126054150022193,
"grad_norm": 1.1484375,
"learning_rate": 0.00037357158137021077,
"loss": 5.0703,
"mean_token_accuracy": 0.21925579160451888,
"num_tokens": 9571950.0,
"step": 4650
},
{
"entropy": 5.7765885353088375,
"epoch": 4.130492676431425,
"grad_norm": 1.2265625,
"learning_rate": 0.000373261809572647,
"loss": 5.192,
"mean_token_accuracy": 0.2030755400657654,
"num_tokens": 9581670.0,
"step": 4655
},
{
"entropy": 5.8400060653686525,
"epoch": 4.134931202840657,
"grad_norm": 1.109375,
"learning_rate": 0.00037295180745611553,
"loss": 5.2075,
"mean_token_accuracy": 0.2056944653391838,
"num_tokens": 9592282.0,
"step": 4660
},
{
"entropy": 5.656895732879638,
"epoch": 4.139369729249889,
"grad_norm": 1.1015625,
"learning_rate": 0.0003726415757472401,
"loss": 5.1455,
"mean_token_accuracy": 0.21399735808372497,
"num_tokens": 9602530.0,
"step": 4665
},
{
"entropy": 5.784669542312622,
"epoch": 4.143808255659121,
"grad_norm": 1.2578125,
"learning_rate": 0.00037233111517318257,
"loss": 5.2154,
"mean_token_accuracy": 0.20880706161260604,
"num_tokens": 9612454.0,
"step": 4670
},
{
"entropy": 5.761039924621582,
"epoch": 4.1482467820683535,
"grad_norm": 1.0390625,
"learning_rate": 0.0003720204264616414,
"loss": 5.1301,
"mean_token_accuracy": 0.21270381510257722,
"num_tokens": 9623461.0,
"step": 4675
},
{
"entropy": 5.727607536315918,
"epoch": 4.152685308477586,
"grad_norm": 1.109375,
"learning_rate": 0.0003717095103408497,
"loss": 5.1241,
"mean_token_accuracy": 0.21046421229839324,
"num_tokens": 9632502.0,
"step": 4680
},
{
"entropy": 5.74509973526001,
"epoch": 4.157123834886818,
"grad_norm": 1.1953125,
"learning_rate": 0.00037139836753957353,
"loss": 5.1327,
"mean_token_accuracy": 0.2110206052660942,
"num_tokens": 9642801.0,
"step": 4685
},
{
"entropy": 5.717509031295776,
"epoch": 4.16156236129605,
"grad_norm": 1.296875,
"learning_rate": 0.00037108699878711044,
"loss": 5.1467,
"mean_token_accuracy": 0.22023138552904128,
"num_tokens": 9652638.0,
"step": 4690
},
{
"entropy": 5.7005359649658205,
"epoch": 4.166000887705282,
"grad_norm": 1.1484375,
"learning_rate": 0.00037077540481328744,
"loss": 5.1091,
"mean_token_accuracy": 0.21125866025686263,
"num_tokens": 9662480.0,
"step": 4695
},
{
"entropy": 5.737263202667236,
"epoch": 4.170439414114514,
"grad_norm": 1.21875,
"learning_rate": 0.0003704635863484596,
"loss": 5.2501,
"mean_token_accuracy": 0.20748572200536727,
"num_tokens": 9673269.0,
"step": 4700
},
{
"entropy": 5.7536533832550045,
"epoch": 4.174877940523746,
"grad_norm": 1.2265625,
"learning_rate": 0.00037015154412350806,
"loss": 5.0887,
"mean_token_accuracy": 0.20911131352186202,
"num_tokens": 9682905.0,
"step": 4705
},
{
"entropy": 5.684925746917725,
"epoch": 4.1793164669329785,
"grad_norm": 1.1953125,
"learning_rate": 0.00036983927886983847,
"loss": 5.1556,
"mean_token_accuracy": 0.212339323759079,
"num_tokens": 9693609.0,
"step": 4710
},
{
"entropy": 5.720796203613281,
"epoch": 4.183754993342211,
"grad_norm": 1.1171875,
"learning_rate": 0.00036952679131937923,
"loss": 5.1308,
"mean_token_accuracy": 0.21655481159687043,
"num_tokens": 9703927.0,
"step": 4715
},
{
"entropy": 5.760318803787231,
"epoch": 4.188193519751443,
"grad_norm": 1.15625,
"learning_rate": 0.0003692140822045798,
"loss": 5.1275,
"mean_token_accuracy": 0.21760178804397584,
"num_tokens": 9714440.0,
"step": 4720
},
{
"entropy": 5.6793900489807125,
"epoch": 4.192632046160675,
"grad_norm": 1.1640625,
"learning_rate": 0.00036890115225840904,
"loss": 5.1579,
"mean_token_accuracy": 0.21766061335802078,
"num_tokens": 9724586.0,
"step": 4725
},
{
"entropy": 5.717368078231812,
"epoch": 4.197070572569907,
"grad_norm": 1.1484375,
"learning_rate": 0.0003685880022143533,
"loss": 5.1252,
"mean_token_accuracy": 0.2100989669561386,
"num_tokens": 9734602.0,
"step": 4730
},
{
"entropy": 5.812760972976685,
"epoch": 4.201509098979139,
"grad_norm": 1.328125,
"learning_rate": 0.00036827463280641494,
"loss": 5.2243,
"mean_token_accuracy": 0.19821423143148423,
"num_tokens": 9744970.0,
"step": 4735
},
{
"entropy": 5.766703367233276,
"epoch": 4.205947625388371,
"grad_norm": 1.2578125,
"learning_rate": 0.00036796104476911033,
"loss": 5.1653,
"mean_token_accuracy": 0.2106243133544922,
"num_tokens": 9754529.0,
"step": 4740
},
{
"entropy": 5.708454179763794,
"epoch": 4.210386151797604,
"grad_norm": 1.2734375,
"learning_rate": 0.00036764723883746865,
"loss": 5.1962,
"mean_token_accuracy": 0.20117447674274444,
"num_tokens": 9765742.0,
"step": 4745
},
{
"entropy": 5.742970275878906,
"epoch": 4.214824678206836,
"grad_norm": 1.3203125,
"learning_rate": 0.0003673332157470293,
"loss": 5.1156,
"mean_token_accuracy": 0.2144193544983864,
"num_tokens": 9776563.0,
"step": 4750
},
{
"entropy": 5.772315835952758,
"epoch": 4.219263204616068,
"grad_norm": 1.2109375,
"learning_rate": 0.000367018976233841,
"loss": 5.137,
"mean_token_accuracy": 0.2113969936966896,
"num_tokens": 9786663.0,
"step": 4755
},
{
"entropy": 5.725389003753662,
"epoch": 4.2237017310253,
"grad_norm": 1.1875,
"learning_rate": 0.0003667045210344598,
"loss": 5.1432,
"mean_token_accuracy": 0.2056875169277191,
"num_tokens": 9796499.0,
"step": 4760
},
{
"entropy": 5.7241839408874515,
"epoch": 4.228140257434532,
"grad_norm": 1.1640625,
"learning_rate": 0.0003663898508859471,
"loss": 5.1622,
"mean_token_accuracy": 0.21654269099235535,
"num_tokens": 9807305.0,
"step": 4765
},
{
"entropy": 5.753515100479126,
"epoch": 4.232578783843764,
"grad_norm": 1.140625,
"learning_rate": 0.0003660749665258684,
"loss": 5.1908,
"mean_token_accuracy": 0.20672854781150818,
"num_tokens": 9818259.0,
"step": 4770
},
{
"entropy": 5.696164798736572,
"epoch": 4.237017310252996,
"grad_norm": 1.0078125,
"learning_rate": 0.0003657598686922909,
"loss": 5.1094,
"mean_token_accuracy": 0.21507840007543563,
"num_tokens": 9830146.0,
"step": 4775
},
{
"entropy": 5.7545092582702635,
"epoch": 4.241455836662228,
"grad_norm": 1.1953125,
"learning_rate": 0.0003654445581237824,
"loss": 5.1845,
"mean_token_accuracy": 0.20769521594047546,
"num_tokens": 9840847.0,
"step": 4780
},
{
"entropy": 5.662838459014893,
"epoch": 4.245894363071461,
"grad_norm": 1.234375,
"learning_rate": 0.0003651290355594096,
"loss": 5.1024,
"mean_token_accuracy": 0.2179262727499008,
"num_tokens": 9850948.0,
"step": 4785
},
{
"entropy": 5.748239183425904,
"epoch": 4.250332889480692,
"grad_norm": 1.09375,
"learning_rate": 0.0003648133017387356,
"loss": 5.1987,
"mean_token_accuracy": 0.20759087502956391,
"num_tokens": 9861205.0,
"step": 4790
},
{
"entropy": 5.666525506973267,
"epoch": 4.254771415889924,
"grad_norm": 1.046875,
"learning_rate": 0.00036449735740181884,
"loss": 5.1803,
"mean_token_accuracy": 0.205241397023201,
"num_tokens": 9871660.0,
"step": 4795
},
{
"entropy": 5.73541841506958,
"epoch": 4.259209942299156,
"grad_norm": 1.1328125,
"learning_rate": 0.00036418120328921146,
"loss": 5.0938,
"mean_token_accuracy": 0.22027103304862977,
"num_tokens": 9881533.0,
"step": 4800
},
{
"entropy": 5.766236066818237,
"epoch": 4.263648468708388,
"grad_norm": 1.21875,
"learning_rate": 0.00036386484014195696,
"loss": 5.2506,
"mean_token_accuracy": 0.20312998443841934,
"num_tokens": 9892707.0,
"step": 4805
},
{
"entropy": 5.696821928024292,
"epoch": 4.268086995117621,
"grad_norm": 1.28125,
"learning_rate": 0.0003635482687015891,
"loss": 5.0745,
"mean_token_accuracy": 0.21657687425613403,
"num_tokens": 9901562.0,
"step": 4810
},
{
"entropy": 5.70862922668457,
"epoch": 4.272525521526853,
"grad_norm": 1.25,
"learning_rate": 0.00036323148971012954,
"loss": 5.1427,
"mean_token_accuracy": 0.2149751827120781,
"num_tokens": 9910742.0,
"step": 4815
},
{
"entropy": 5.784573650360107,
"epoch": 4.276964047936085,
"grad_norm": 1.03125,
"learning_rate": 0.00036291450391008655,
"loss": 5.2066,
"mean_token_accuracy": 0.20904852747917174,
"num_tokens": 9922322.0,
"step": 4820
},
{
"entropy": 5.728090095520019,
"epoch": 4.281402574345317,
"grad_norm": 1.25,
"learning_rate": 0.00036259731204445347,
"loss": 5.117,
"mean_token_accuracy": 0.20740775316953658,
"num_tokens": 9931868.0,
"step": 4825
},
{
"entropy": 5.731380271911621,
"epoch": 4.285841100754549,
"grad_norm": 1.125,
"learning_rate": 0.0003622799148567061,
"loss": 5.179,
"mean_token_accuracy": 0.21309688240289687,
"num_tokens": 9942198.0,
"step": 4830
},
{
"entropy": 5.804520463943481,
"epoch": 4.290279627163781,
"grad_norm": 1.0859375,
"learning_rate": 0.0003619623130908017,
"loss": 5.209,
"mean_token_accuracy": 0.2023901730775833,
"num_tokens": 9953094.0,
"step": 4835
},
{
"entropy": 5.745091295242309,
"epoch": 4.2947181535730135,
"grad_norm": 1.1484375,
"learning_rate": 0.0003616445074911774,
"loss": 5.1656,
"mean_token_accuracy": 0.2081662744283676,
"num_tokens": 9964759.0,
"step": 4840
},
{
"entropy": 5.738615322113037,
"epoch": 4.299156679982246,
"grad_norm": 1.3125,
"learning_rate": 0.0003613264988027477,
"loss": 5.1629,
"mean_token_accuracy": 0.2116822764277458,
"num_tokens": 9973916.0,
"step": 4845
},
{
"entropy": 5.72474102973938,
"epoch": 4.303595206391478,
"grad_norm": 1.171875,
"learning_rate": 0.0003610082877709031,
"loss": 5.2008,
"mean_token_accuracy": 0.20751210302114487,
"num_tokens": 9985388.0,
"step": 4850
},
{
"entropy": 5.754292154312134,
"epoch": 4.30803373280071,
"grad_norm": 1.1953125,
"learning_rate": 0.00036068987514150866,
"loss": 5.1662,
"mean_token_accuracy": 0.21000789403915404,
"num_tokens": 9996143.0,
"step": 4855
},
{
"entropy": 5.7305224418640135,
"epoch": 4.312472259209942,
"grad_norm": 1.171875,
"learning_rate": 0.00036037126166090167,
"loss": 5.2454,
"mean_token_accuracy": 0.1990845561027527,
"num_tokens": 10007376.0,
"step": 4860
},
{
"entropy": 5.722129201889038,
"epoch": 4.316910785619174,
"grad_norm": 1.296875,
"learning_rate": 0.0003600524480758906,
"loss": 5.1317,
"mean_token_accuracy": 0.2125830441713333,
"num_tokens": 10016435.0,
"step": 4865
},
{
"entropy": 5.771578645706176,
"epoch": 4.321349312028406,
"grad_norm": 1.1640625,
"learning_rate": 0.00035973343513375254,
"loss": 5.2502,
"mean_token_accuracy": 0.20185581594705582,
"num_tokens": 10027577.0,
"step": 4870
},
{
"entropy": 5.819239234924316,
"epoch": 4.3257878384376385,
"grad_norm": 1.171875,
"learning_rate": 0.000359414223582232,
"loss": 5.1953,
"mean_token_accuracy": 0.1998763546347618,
"num_tokens": 10037099.0,
"step": 4875
},
{
"entropy": 5.746256351470947,
"epoch": 4.330226364846871,
"grad_norm": 1.171875,
"learning_rate": 0.0003590948141695392,
"loss": 5.1537,
"mean_token_accuracy": 0.20699663162231446,
"num_tokens": 10047718.0,
"step": 4880
},
{
"entropy": 5.696747159957885,
"epoch": 4.334664891256103,
"grad_norm": 1.1953125,
"learning_rate": 0.0003587752076443479,
"loss": 5.1114,
"mean_token_accuracy": 0.2158285990357399,
"num_tokens": 10057507.0,
"step": 4885
},
{
"entropy": 5.7871781349182125,
"epoch": 4.339103417665335,
"grad_norm": 1.2421875,
"learning_rate": 0.0003584554047557939,
"loss": 5.2184,
"mean_token_accuracy": 0.20748222768306732,
"num_tokens": 10067643.0,
"step": 4890
},
{
"entropy": 5.658500385284424,
"epoch": 4.343541944074567,
"grad_norm": 1.1953125,
"learning_rate": 0.00035813540625347334,
"loss": 5.0818,
"mean_token_accuracy": 0.21400361955165864,
"num_tokens": 10077296.0,
"step": 4895
},
{
"entropy": 5.799658584594726,
"epoch": 4.347980470483799,
"grad_norm": 1.375,
"learning_rate": 0.0003578152128874409,
"loss": 5.2096,
"mean_token_accuracy": 0.20976602435112,
"num_tokens": 10087218.0,
"step": 4900
},
{
"entropy": 5.7649839401245115,
"epoch": 4.352418996893031,
"grad_norm": 1.21875,
"learning_rate": 0.00035749482540820796,
"loss": 5.2046,
"mean_token_accuracy": 0.2050032064318657,
"num_tokens": 10096915.0,
"step": 4905
},
{
"entropy": 5.669079971313477,
"epoch": 4.3568575233022635,
"grad_norm": 1.25,
"learning_rate": 0.00035717424456674086,
"loss": 5.1605,
"mean_token_accuracy": 0.20748622417449952,
"num_tokens": 10108096.0,
"step": 4910
},
{
"entropy": 5.729409265518188,
"epoch": 4.361296049711496,
"grad_norm": 1.25,
"learning_rate": 0.0003568534711144591,
"loss": 5.1616,
"mean_token_accuracy": 0.20923524498939514,
"num_tokens": 10119131.0,
"step": 4915
},
{
"entropy": 5.727017021179199,
"epoch": 4.365734576120728,
"grad_norm": 1.1640625,
"learning_rate": 0.00035653250580323383,
"loss": 5.2125,
"mean_token_accuracy": 0.2000671833753586,
"num_tokens": 10129490.0,
"step": 4920
},
{
"entropy": 5.716195392608642,
"epoch": 4.37017310252996,
"grad_norm": 1.125,
"learning_rate": 0.00035621134938538585,
"loss": 5.0923,
"mean_token_accuracy": 0.2212134048342705,
"num_tokens": 10140282.0,
"step": 4925
},
{
"entropy": 5.7920060634613035,
"epoch": 4.374611628939192,
"grad_norm": 1.1328125,
"learning_rate": 0.0003558900026136838,
"loss": 5.2556,
"mean_token_accuracy": 0.20267445594072342,
"num_tokens": 10150256.0,
"step": 4930
},
{
"entropy": 5.661780214309692,
"epoch": 4.379050155348424,
"grad_norm": 1.171875,
"learning_rate": 0.0003555684662413424,
"loss": 5.1197,
"mean_token_accuracy": 0.21318988204002381,
"num_tokens": 10160993.0,
"step": 4935
},
{
"entropy": 5.699134492874146,
"epoch": 4.383488681757656,
"grad_norm": 1.21875,
"learning_rate": 0.0003552467410220212,
"loss": 5.1816,
"mean_token_accuracy": 0.20566583573818206,
"num_tokens": 10171585.0,
"step": 4940
},
{
"entropy": 5.622805070877075,
"epoch": 4.3879272081668885,
"grad_norm": 1.3046875,
"learning_rate": 0.0003549248277098221,
"loss": 5.1294,
"mean_token_accuracy": 0.21171367913484573,
"num_tokens": 10180923.0,
"step": 4945
},
{
"entropy": 5.71085786819458,
"epoch": 4.392365734576121,
"grad_norm": 1.140625,
"learning_rate": 0.0003546027270592878,
"loss": 5.1071,
"mean_token_accuracy": 0.21543533205986024,
"num_tokens": 10190365.0,
"step": 4950
},
{
"entropy": 5.789462852478027,
"epoch": 4.396804260985353,
"grad_norm": 1.1953125,
"learning_rate": 0.00035428043982540017,
"loss": 5.2529,
"mean_token_accuracy": 0.2044300004839897,
"num_tokens": 10200400.0,
"step": 4955
},
{
"entropy": 5.729992198944092,
"epoch": 4.401242787394585,
"grad_norm": 1.125,
"learning_rate": 0.00035395796676357855,
"loss": 5.174,
"mean_token_accuracy": 0.21109428107738495,
"num_tokens": 10210489.0,
"step": 4960
},
{
"entropy": 5.7173525333404545,
"epoch": 4.405681313803817,
"grad_norm": 1.1484375,
"learning_rate": 0.0003536353086296778,
"loss": 5.1718,
"mean_token_accuracy": 0.20589128136634827,
"num_tokens": 10221141.0,
"step": 4965
},
{
"entropy": 5.723089933395386,
"epoch": 4.410119840213049,
"grad_norm": 1.2421875,
"learning_rate": 0.00035331246617998654,
"loss": 5.1542,
"mean_token_accuracy": 0.2141341060400009,
"num_tokens": 10230776.0,
"step": 4970
},
{
"entropy": 5.744500684738159,
"epoch": 4.414558366622281,
"grad_norm": 1.2578125,
"learning_rate": 0.0003529894401712253,
"loss": 5.1449,
"mean_token_accuracy": 0.21146791875362397,
"num_tokens": 10240366.0,
"step": 4975
},
{
"entropy": 5.6858978271484375,
"epoch": 4.4189968930315136,
"grad_norm": 1.1875,
"learning_rate": 0.00035266623136054505,
"loss": 5.1778,
"mean_token_accuracy": 0.20696759223937988,
"num_tokens": 10250833.0,
"step": 4980
},
{
"entropy": 5.750640869140625,
"epoch": 4.423435419440746,
"grad_norm": 1.3359375,
"learning_rate": 0.00035234284050552516,
"loss": 5.2571,
"mean_token_accuracy": 0.2038218379020691,
"num_tokens": 10260242.0,
"step": 4985
},
{
"entropy": 5.765140056610107,
"epoch": 4.427873945849978,
"grad_norm": 1.1015625,
"learning_rate": 0.0003520192683641718,
"loss": 5.2297,
"mean_token_accuracy": 0.2027687519788742,
"num_tokens": 10272362.0,
"step": 4990
},
{
"entropy": 5.744220781326294,
"epoch": 4.43231247225921,
"grad_norm": 1.140625,
"learning_rate": 0.0003516955156949157,
"loss": 5.1941,
"mean_token_accuracy": 0.20152689814567565,
"num_tokens": 10283176.0,
"step": 4995
},
{
"entropy": 5.7464361667633055,
"epoch": 4.436750998668442,
"grad_norm": 1.1953125,
"learning_rate": 0.00035137158325661115,
"loss": 5.2608,
"mean_token_accuracy": 0.20259124040603638,
"num_tokens": 10293630.0,
"step": 5000
},
{
"epoch": 4.436750998668442,
"eval_entropy": 5.5769944247610495,
"eval_loss": 5.8343658447265625,
"eval_mean_token_accuracy": 0.17468414655632192,
"eval_num_tokens": 10293630.0,
"eval_runtime": 2.0854,
"eval_samples_per_second": 1614.524,
"eval_steps_per_second": 201.875,
"step": 5000
},
{
"entropy": 5.790251922607422,
"epoch": 4.441189525077674,
"grad_norm": 1.1640625,
"learning_rate": 0.00035104747180853376,
"loss": 5.1822,
"mean_token_accuracy": 0.20639875233173371,
"num_tokens": 10303775.0,
"step": 5005
},
{
"entropy": 5.715227222442627,
"epoch": 4.445628051486906,
"grad_norm": 1.078125,
"learning_rate": 0.0003507231821103785,
"loss": 5.1551,
"mean_token_accuracy": 0.21106622070074083,
"num_tokens": 10314142.0,
"step": 5010
},
{
"entropy": 5.747024440765381,
"epoch": 4.450066577896139,
"grad_norm": 1.1328125,
"learning_rate": 0.00035039871492225814,
"loss": 5.1535,
"mean_token_accuracy": 0.2024983510375023,
"num_tokens": 10324401.0,
"step": 5015
},
{
"entropy": 5.675720167160034,
"epoch": 4.454505104305371,
"grad_norm": 1.2265625,
"learning_rate": 0.00035007407100470187,
"loss": 5.1739,
"mean_token_accuracy": 0.21270538568496705,
"num_tokens": 10334872.0,
"step": 5020
},
{
"entropy": 5.7632105350494385,
"epoch": 4.458943630714603,
"grad_norm": 1.078125,
"learning_rate": 0.0003497492511186527,
"loss": 5.253,
"mean_token_accuracy": 0.1968903511762619,
"num_tokens": 10345504.0,
"step": 5025
},
{
"entropy": 5.672514867782593,
"epoch": 4.463382157123835,
"grad_norm": 1.28125,
"learning_rate": 0.00034942425602546616,
"loss": 5.1775,
"mean_token_accuracy": 0.2216365560889244,
"num_tokens": 10355191.0,
"step": 5030
},
{
"entropy": 5.778588008880615,
"epoch": 4.467820683533067,
"grad_norm": 1.296875,
"learning_rate": 0.00034909908648690874,
"loss": 5.2407,
"mean_token_accuracy": 0.20244300067424775,
"num_tokens": 10365185.0,
"step": 5035
},
{
"entropy": 5.789299154281617,
"epoch": 4.472259209942299,
"grad_norm": 1.1875,
"learning_rate": 0.00034877374326515556,
"loss": 5.1825,
"mean_token_accuracy": 0.207652448117733,
"num_tokens": 10374977.0,
"step": 5040
},
{
"entropy": 5.714522647857666,
"epoch": 4.4766977363515315,
"grad_norm": 1.1640625,
"learning_rate": 0.00034844822712278874,
"loss": 5.2086,
"mean_token_accuracy": 0.21069382429122924,
"num_tokens": 10385182.0,
"step": 5045
},
{
"entropy": 5.704091644287109,
"epoch": 4.481136262760764,
"grad_norm": 1.125,
"learning_rate": 0.0003481225388227961,
"loss": 5.1767,
"mean_token_accuracy": 0.21677854061126708,
"num_tokens": 10395685.0,
"step": 5050
},
{
"entropy": 5.69912896156311,
"epoch": 4.485574789169996,
"grad_norm": 1.1796875,
"learning_rate": 0.00034779667912856864,
"loss": 5.1712,
"mean_token_accuracy": 0.2076883152127266,
"num_tokens": 10405920.0,
"step": 5055
},
{
"entropy": 5.758427858352661,
"epoch": 4.490013315579228,
"grad_norm": 1.265625,
"learning_rate": 0.0003474706488038993,
"loss": 5.2679,
"mean_token_accuracy": 0.19982607960700988,
"num_tokens": 10417815.0,
"step": 5060
},
{
"entropy": 5.775757932662964,
"epoch": 4.49445184198846,
"grad_norm": 1.125,
"learning_rate": 0.00034714444861298077,
"loss": 5.2791,
"mean_token_accuracy": 0.20297911316156386,
"num_tokens": 10428603.0,
"step": 5065
},
{
"entropy": 5.725766277313232,
"epoch": 4.498890368397692,
"grad_norm": 1.3515625,
"learning_rate": 0.00034681807932040407,
"loss": 5.1524,
"mean_token_accuracy": 0.2125113993883133,
"num_tokens": 10438053.0,
"step": 5070
},
{
"entropy": 5.751907110214233,
"epoch": 4.503328894806924,
"grad_norm": 1.2421875,
"learning_rate": 0.0003464915416911565,
"loss": 5.2354,
"mean_token_accuracy": 0.2079993560910225,
"num_tokens": 10447750.0,
"step": 5075
},
{
"entropy": 5.751536750793457,
"epoch": 4.5077674212161565,
"grad_norm": 1.1796875,
"learning_rate": 0.00034616483649062003,
"loss": 5.2334,
"mean_token_accuracy": 0.19996216744184495,
"num_tokens": 10458168.0,
"step": 5080
},
{
"entropy": 5.77265772819519,
"epoch": 4.512205947625389,
"grad_norm": 1.234375,
"learning_rate": 0.0003458379644845693,
"loss": 5.2019,
"mean_token_accuracy": 0.20402003526687623,
"num_tokens": 10468537.0,
"step": 5085
},
{
"entropy": 5.749958181381226,
"epoch": 4.516644474034621,
"grad_norm": 1.1328125,
"learning_rate": 0.0003455109264391699,
"loss": 5.2142,
"mean_token_accuracy": 0.20577894747257233,
"num_tokens": 10478549.0,
"step": 5090
},
{
"entropy": 5.679034996032715,
"epoch": 4.521083000443853,
"grad_norm": 1.2265625,
"learning_rate": 0.0003451837231209766,
"loss": 5.1651,
"mean_token_accuracy": 0.22028762549161912,
"num_tokens": 10488579.0,
"step": 5095
},
{
"entropy": 5.727813005447388,
"epoch": 4.525521526853085,
"grad_norm": 1.203125,
"learning_rate": 0.00034485635529693173,
"loss": 5.2168,
"mean_token_accuracy": 0.21334245204925537,
"num_tokens": 10498869.0,
"step": 5100
},
{
"entropy": 5.774104833602905,
"epoch": 4.529960053262317,
"grad_norm": 1.09375,
"learning_rate": 0.0003445288237343632,
"loss": 5.1222,
"mean_token_accuracy": 0.21038362979888917,
"num_tokens": 10509994.0,
"step": 5105
},
{
"entropy": 5.692390060424804,
"epoch": 4.534398579671549,
"grad_norm": 1.25,
"learning_rate": 0.00034420112920098247,
"loss": 5.1689,
"mean_token_accuracy": 0.20680999457836152,
"num_tokens": 10520386.0,
"step": 5110
},
{
"entropy": 5.761635255813599,
"epoch": 4.5388371060807815,
"grad_norm": 1.1640625,
"learning_rate": 0.0003438732724648831,
"loss": 5.3269,
"mean_token_accuracy": 0.19650017619132995,
"num_tokens": 10530802.0,
"step": 5115
},
{
"entropy": 5.7955528736114506,
"epoch": 4.543275632490014,
"grad_norm": 1.1640625,
"learning_rate": 0.00034354525429453894,
"loss": 5.1972,
"mean_token_accuracy": 0.2062854290008545,
"num_tokens": 10540581.0,
"step": 5120
},
{
"entropy": 5.708793306350708,
"epoch": 4.547714158899246,
"grad_norm": 1.1484375,
"learning_rate": 0.00034321707545880223,
"loss": 5.1542,
"mean_token_accuracy": 0.21162179708480836,
"num_tokens": 10550908.0,
"step": 5125
},
{
"entropy": 5.64053750038147,
"epoch": 4.552152685308478,
"grad_norm": 1.1015625,
"learning_rate": 0.00034288873672690167,
"loss": 5.1124,
"mean_token_accuracy": 0.21572550535202026,
"num_tokens": 10561710.0,
"step": 5130
},
{
"entropy": 5.748101234436035,
"epoch": 4.55659121171771,
"grad_norm": 1.28125,
"learning_rate": 0.00034256023886844076,
"loss": 5.1799,
"mean_token_accuracy": 0.20977407246828078,
"num_tokens": 10571469.0,
"step": 5135
},
{
"entropy": 5.795603084564209,
"epoch": 4.561029738126942,
"grad_norm": 1.1875,
"learning_rate": 0.00034223158265339615,
"loss": 5.1568,
"mean_token_accuracy": 0.2124243423342705,
"num_tokens": 10580968.0,
"step": 5140
},
{
"entropy": 5.732140684127808,
"epoch": 4.5654682645361735,
"grad_norm": 1.2265625,
"learning_rate": 0.00034190276885211554,
"loss": 5.1957,
"mean_token_accuracy": 0.20838963836431504,
"num_tokens": 10590848.0,
"step": 5145
},
{
"entropy": 5.73495044708252,
"epoch": 4.5699067909454065,
"grad_norm": 1.3203125,
"learning_rate": 0.0003415737982353159,
"loss": 5.1829,
"mean_token_accuracy": 0.202427276968956,
"num_tokens": 10600341.0,
"step": 5150
},
{
"entropy": 5.7257547855377195,
"epoch": 4.574345317354638,
"grad_norm": 1.2578125,
"learning_rate": 0.000341244671574082,
"loss": 5.1245,
"mean_token_accuracy": 0.21159932017326355,
"num_tokens": 10611733.0,
"step": 5155
},
{
"entropy": 5.703883457183838,
"epoch": 4.578783843763871,
"grad_norm": 1.2578125,
"learning_rate": 0.0003409153896398641,
"loss": 5.1376,
"mean_token_accuracy": 0.20912213623523712,
"num_tokens": 10621570.0,
"step": 5160
},
{
"entropy": 5.7086564064025875,
"epoch": 4.583222370173102,
"grad_norm": 1.203125,
"learning_rate": 0.00034058595320447685,
"loss": 5.1727,
"mean_token_accuracy": 0.20659724175930022,
"num_tokens": 10632438.0,
"step": 5165
},
{
"entropy": 5.724616813659668,
"epoch": 4.587660896582335,
"grad_norm": 1.234375,
"learning_rate": 0.00034025636304009646,
"loss": 5.0619,
"mean_token_accuracy": 0.21662326902151108,
"num_tokens": 10641738.0,
"step": 5170
},
{
"entropy": 5.72975525856018,
"epoch": 4.592099422991566,
"grad_norm": 1.078125,
"learning_rate": 0.0003399266199192597,
"loss": 5.2308,
"mean_token_accuracy": 0.20958700329065322,
"num_tokens": 10652854.0,
"step": 5175
},
{
"entropy": 5.65272216796875,
"epoch": 4.596537949400799,
"grad_norm": 1.203125,
"learning_rate": 0.0003395967246148622,
"loss": 5.1518,
"mean_token_accuracy": 0.2112141489982605,
"num_tokens": 10663401.0,
"step": 5180
},
{
"entropy": 5.7544811248779295,
"epoch": 4.600976475810031,
"grad_norm": 1.1328125,
"learning_rate": 0.00033926667790015584,
"loss": 5.2547,
"mean_token_accuracy": 0.20084319710731507,
"num_tokens": 10675126.0,
"step": 5185
},
{
"entropy": 5.77255654335022,
"epoch": 4.605415002219264,
"grad_norm": 1.3203125,
"learning_rate": 0.0003389364805487476,
"loss": 5.2229,
"mean_token_accuracy": 0.20229778736829757,
"num_tokens": 10685212.0,
"step": 5190
},
{
"entropy": 5.691144752502441,
"epoch": 4.609853528628495,
"grad_norm": 1.1953125,
"learning_rate": 0.00033860613333459757,
"loss": 5.1348,
"mean_token_accuracy": 0.2177197515964508,
"num_tokens": 10695467.0,
"step": 5195
},
{
"entropy": 5.67885947227478,
"epoch": 4.614292055037727,
"grad_norm": 1.2265625,
"learning_rate": 0.0003382756370320169,
"loss": 5.1713,
"mean_token_accuracy": 0.20744576752185823,
"num_tokens": 10706089.0,
"step": 5200
},
{
"entropy": 5.803925657272339,
"epoch": 4.618730581446959,
"grad_norm": 1.125,
"learning_rate": 0.0003379449924156664,
"loss": 5.1694,
"mean_token_accuracy": 0.20873753428459169,
"num_tokens": 10716593.0,
"step": 5205
},
{
"entropy": 5.753027248382568,
"epoch": 4.623169107856191,
"grad_norm": 1.1875,
"learning_rate": 0.0003376142002605547,
"loss": 5.1973,
"mean_token_accuracy": 0.20896549969911576,
"num_tokens": 10727642.0,
"step": 5210
},
{
"entropy": 5.683163452148437,
"epoch": 4.6276076342654235,
"grad_norm": 1.2265625,
"learning_rate": 0.0003372832613420356,
"loss": 5.0631,
"mean_token_accuracy": 0.21866176128387452,
"num_tokens": 10737135.0,
"step": 5215
},
{
"entropy": 5.693540334701538,
"epoch": 4.632046160674656,
"grad_norm": 1.109375,
"learning_rate": 0.0003369521764358075,
"loss": 5.2051,
"mean_token_accuracy": 0.20459542274475098,
"num_tokens": 10747527.0,
"step": 5220
},
{
"entropy": 5.647522068023681,
"epoch": 4.636484687083888,
"grad_norm": 1.171875,
"learning_rate": 0.0003366209463179109,
"loss": 5.072,
"mean_token_accuracy": 0.21823544502258302,
"num_tokens": 10757082.0,
"step": 5225
},
{
"entropy": 5.7527947425842285,
"epoch": 4.64092321349312,
"grad_norm": 1.2265625,
"learning_rate": 0.0003362895717647265,
"loss": 5.2071,
"mean_token_accuracy": 0.20612578988075256,
"num_tokens": 10768280.0,
"step": 5230
},
{
"entropy": 5.79077115058899,
"epoch": 4.645361739902352,
"grad_norm": 1.1328125,
"learning_rate": 0.0003359580535529735,
"loss": 5.1666,
"mean_token_accuracy": 0.20676536858081818,
"num_tokens": 10778276.0,
"step": 5235
},
{
"entropy": 5.723053407669068,
"epoch": 4.649800266311584,
"grad_norm": 1.296875,
"learning_rate": 0.00033562639245970807,
"loss": 5.1456,
"mean_token_accuracy": 0.206996351480484,
"num_tokens": 10788004.0,
"step": 5240
},
{
"entropy": 5.712559366226197,
"epoch": 4.654238792720816,
"grad_norm": 1.203125,
"learning_rate": 0.00033529458926232105,
"loss": 5.2224,
"mean_token_accuracy": 0.2089390218257904,
"num_tokens": 10797918.0,
"step": 5245
},
{
"entropy": 5.691585636138916,
"epoch": 4.658677319130049,
"grad_norm": 1.15625,
"learning_rate": 0.0003349626447385366,
"loss": 5.157,
"mean_token_accuracy": 0.2116892606019974,
"num_tokens": 10808545.0,
"step": 5250
},
{
"entropy": 5.678885221481323,
"epoch": 4.663115845539281,
"grad_norm": 1.1875,
"learning_rate": 0.0003346305596664099,
"loss": 5.2123,
"mean_token_accuracy": 0.20954641252756118,
"num_tokens": 10818941.0,
"step": 5255
},
{
"entropy": 5.76534628868103,
"epoch": 4.667554371948513,
"grad_norm": 1.2578125,
"learning_rate": 0.00033429833482432567,
"loss": 5.2666,
"mean_token_accuracy": 0.2046421304345131,
"num_tokens": 10829980.0,
"step": 5260
},
{
"entropy": 5.735799407958984,
"epoch": 4.671992898357745,
"grad_norm": 1.1171875,
"learning_rate": 0.00033396597099099624,
"loss": 5.1517,
"mean_token_accuracy": 0.212375408411026,
"num_tokens": 10840512.0,
"step": 5265
},
{
"entropy": 5.748387145996094,
"epoch": 4.676431424766977,
"grad_norm": 1.2109375,
"learning_rate": 0.00033363346894545984,
"loss": 5.1999,
"mean_token_accuracy": 0.2036992847919464,
"num_tokens": 10850837.0,
"step": 5270
},
{
"entropy": 5.699161005020142,
"epoch": 4.680869951176209,
"grad_norm": 1.140625,
"learning_rate": 0.00033330082946707827,
"loss": 5.1828,
"mean_token_accuracy": 0.21137236356735228,
"num_tokens": 10862036.0,
"step": 5275
},
{
"entropy": 5.781758213043213,
"epoch": 4.6853084775854414,
"grad_norm": 1.2890625,
"learning_rate": 0.000332968053335536,
"loss": 5.1708,
"mean_token_accuracy": 0.211983323097229,
"num_tokens": 10870900.0,
"step": 5280
},
{
"entropy": 5.730520582199096,
"epoch": 4.689747003994674,
"grad_norm": 1.1640625,
"learning_rate": 0.00033263514133083757,
"loss": 5.2581,
"mean_token_accuracy": 0.20092154294252396,
"num_tokens": 10880989.0,
"step": 5285
},
{
"entropy": 5.704589605331421,
"epoch": 4.694185530403906,
"grad_norm": 1.21875,
"learning_rate": 0.00033230209423330587,
"loss": 5.178,
"mean_token_accuracy": 0.2079184263944626,
"num_tokens": 10890759.0,
"step": 5290
},
{
"entropy": 5.781274271011353,
"epoch": 4.698624056813138,
"grad_norm": 1.171875,
"learning_rate": 0.0003319689128235804,
"loss": 5.1725,
"mean_token_accuracy": 0.20617727935314178,
"num_tokens": 10900700.0,
"step": 5295
},
{
"entropy": 5.6957298755645756,
"epoch": 4.70306258322237,
"grad_norm": 1.2578125,
"learning_rate": 0.00033163559788261575,
"loss": 5.1661,
"mean_token_accuracy": 0.20840034782886505,
"num_tokens": 10910378.0,
"step": 5300
},
{
"entropy": 5.7365562915802,
"epoch": 4.707501109631602,
"grad_norm": 1.421875,
"learning_rate": 0.0003313021501916795,
"loss": 5.1849,
"mean_token_accuracy": 0.20706552118062974,
"num_tokens": 10920605.0,
"step": 5305
},
{
"entropy": 5.672279596328735,
"epoch": 4.711939636040834,
"grad_norm": 1.1328125,
"learning_rate": 0.00033096857053235016,
"loss": 5.14,
"mean_token_accuracy": 0.21455953121185303,
"num_tokens": 10931063.0,
"step": 5310
},
{
"entropy": 5.710047006607056,
"epoch": 4.7163781624500665,
"grad_norm": 1.171875,
"learning_rate": 0.00033063485968651545,
"loss": 5.1996,
"mean_token_accuracy": 0.21062558740377427,
"num_tokens": 10941418.0,
"step": 5315
},
{
"entropy": 5.646402835845947,
"epoch": 4.720816688859299,
"grad_norm": 1.09375,
"learning_rate": 0.0003303010184363711,
"loss": 5.1237,
"mean_token_accuracy": 0.21142874658107758,
"num_tokens": 10951664.0,
"step": 5320
},
{
"entropy": 5.749710512161255,
"epoch": 4.725255215268531,
"grad_norm": 1.2578125,
"learning_rate": 0.00032996704756441803,
"loss": 5.2223,
"mean_token_accuracy": 0.20792291164398194,
"num_tokens": 10962060.0,
"step": 5325
},
{
"entropy": 5.758749008178711,
"epoch": 4.729693741677763,
"grad_norm": 1.1484375,
"learning_rate": 0.0003296329478534612,
"loss": 5.2622,
"mean_token_accuracy": 0.20276703983545302,
"num_tokens": 10973630.0,
"step": 5330
},
{
"entropy": 5.694210529327393,
"epoch": 4.734132268086995,
"grad_norm": 1.1484375,
"learning_rate": 0.0003292987200866075,
"loss": 5.2161,
"mean_token_accuracy": 0.2052842602133751,
"num_tokens": 10984016.0,
"step": 5335
},
{
"entropy": 5.766045379638672,
"epoch": 4.738570794496227,
"grad_norm": 1.3203125,
"learning_rate": 0.0003289643650472639,
"loss": 5.1933,
"mean_token_accuracy": 0.217355939745903,
"num_tokens": 10994531.0,
"step": 5340
},
{
"entropy": 5.7393327236175535,
"epoch": 4.743009320905459,
"grad_norm": 1.328125,
"learning_rate": 0.0003286298835191358,
"loss": 5.1673,
"mean_token_accuracy": 0.2125002473592758,
"num_tokens": 11004498.0,
"step": 5345
},
{
"entropy": 5.7455676078796385,
"epoch": 4.7474478473146915,
"grad_norm": 1.2734375,
"learning_rate": 0.00032829527628622517,
"loss": 5.1947,
"mean_token_accuracy": 0.20545327067375183,
"num_tokens": 11014460.0,
"step": 5350
},
{
"entropy": 5.711310625076294,
"epoch": 4.751886373723924,
"grad_norm": 1.1796875,
"learning_rate": 0.00032796054413282834,
"loss": 5.1853,
"mean_token_accuracy": 0.2101360887289047,
"num_tokens": 11024488.0,
"step": 5355
},
{
"entropy": 5.7556007385253904,
"epoch": 4.756324900133156,
"grad_norm": 1.1953125,
"learning_rate": 0.0003276256878435347,
"loss": 5.2054,
"mean_token_accuracy": 0.21297023296356202,
"num_tokens": 11033652.0,
"step": 5360
},
{
"entropy": 5.807051658630371,
"epoch": 4.760763426542388,
"grad_norm": 1.265625,
"learning_rate": 0.0003272907082032244,
"loss": 5.2588,
"mean_token_accuracy": 0.20238023847341538,
"num_tokens": 11044587.0,
"step": 5365
},
{
"entropy": 5.66930661201477,
"epoch": 4.76520195295162,
"grad_norm": 1.2734375,
"learning_rate": 0.00032695560599706706,
"loss": 5.1097,
"mean_token_accuracy": 0.21576271057128907,
"num_tokens": 11053836.0,
"step": 5370
},
{
"entropy": 5.657267951965332,
"epoch": 4.769640479360852,
"grad_norm": 1.1328125,
"learning_rate": 0.00032662038201051915,
"loss": 5.1985,
"mean_token_accuracy": 0.2085062623023987,
"num_tokens": 11064250.0,
"step": 5375
},
{
"entropy": 5.730874490737915,
"epoch": 4.774079005770084,
"grad_norm": 1.2734375,
"learning_rate": 0.00032628503702932275,
"loss": 5.2485,
"mean_token_accuracy": 0.2009250283241272,
"num_tokens": 11074516.0,
"step": 5380
},
{
"entropy": 5.77521390914917,
"epoch": 4.7785175321793165,
"grad_norm": 1.28125,
"learning_rate": 0.0003259495718395038,
"loss": 5.1925,
"mean_token_accuracy": 0.21358498334884643,
"num_tokens": 11084519.0,
"step": 5385
},
{
"entropy": 5.704379510879517,
"epoch": 4.782956058588549,
"grad_norm": 1.2734375,
"learning_rate": 0.0003256139872273696,
"loss": 5.2315,
"mean_token_accuracy": 0.20225883275270462,
"num_tokens": 11094492.0,
"step": 5390
},
{
"entropy": 5.678598880767822,
"epoch": 4.787394584997781,
"grad_norm": 1.234375,
"learning_rate": 0.00032527828397950763,
"loss": 5.1649,
"mean_token_accuracy": 0.2148972600698471,
"num_tokens": 11104196.0,
"step": 5395
},
{
"entropy": 5.673313236236572,
"epoch": 4.791833111407013,
"grad_norm": 1.25,
"learning_rate": 0.0003249424628827834,
"loss": 5.071,
"mean_token_accuracy": 0.2209952265024185,
"num_tokens": 11114436.0,
"step": 5400
},
{
"entropy": 5.779289436340332,
"epoch": 4.796271637816245,
"grad_norm": 1.2265625,
"learning_rate": 0.00032460652472433854,
"loss": 5.2209,
"mean_token_accuracy": 0.20202610343694688,
"num_tokens": 11123866.0,
"step": 5405
},
{
"entropy": 5.7611284255981445,
"epoch": 4.800710164225477,
"grad_norm": 1.1796875,
"learning_rate": 0.00032427047029158924,
"loss": 5.2148,
"mean_token_accuracy": 0.21345822662115096,
"num_tokens": 11134817.0,
"step": 5410
},
{
"entropy": 5.715837097167968,
"epoch": 4.805148690634709,
"grad_norm": 1.1640625,
"learning_rate": 0.0003239343003722239,
"loss": 5.1417,
"mean_token_accuracy": 0.2122260719537735,
"num_tokens": 11145252.0,
"step": 5415
},
{
"entropy": 5.738485956192017,
"epoch": 4.8095872170439415,
"grad_norm": 1.15625,
"learning_rate": 0.000323598015754202,
"loss": 5.2536,
"mean_token_accuracy": 0.20232891887426377,
"num_tokens": 11154957.0,
"step": 5420
},
{
"entropy": 5.721615982055664,
"epoch": 4.814025743453174,
"grad_norm": 1.1328125,
"learning_rate": 0.0003232616172257518,
"loss": 5.1721,
"mean_token_accuracy": 0.21200567334890366,
"num_tokens": 11166565.0,
"step": 5425
},
{
"entropy": 5.751074361801147,
"epoch": 4.818464269862406,
"grad_norm": 1.1640625,
"learning_rate": 0.00032292510557536844,
"loss": 5.2772,
"mean_token_accuracy": 0.20485566854476928,
"num_tokens": 11176922.0,
"step": 5430
},
{
"entropy": 5.765995121002197,
"epoch": 4.822902796271638,
"grad_norm": 1.21875,
"learning_rate": 0.000322588481591812,
"loss": 5.1212,
"mean_token_accuracy": 0.21359312385320664,
"num_tokens": 11187526.0,
"step": 5435
},
{
"entropy": 5.726685285568237,
"epoch": 4.82734132268087,
"grad_norm": 1.109375,
"learning_rate": 0.00032225174606410634,
"loss": 5.1969,
"mean_token_accuracy": 0.20894990414381026,
"num_tokens": 11199138.0,
"step": 5440
},
{
"entropy": 5.756986904144287,
"epoch": 4.831779849090102,
"grad_norm": 1.21875,
"learning_rate": 0.00032191489978153646,
"loss": 5.2013,
"mean_token_accuracy": 0.20594589412212372,
"num_tokens": 11209158.0,
"step": 5445
},
{
"entropy": 5.692794561386108,
"epoch": 4.836218375499334,
"grad_norm": 1.1953125,
"learning_rate": 0.0003215779435336471,
"loss": 5.11,
"mean_token_accuracy": 0.22132737040519715,
"num_tokens": 11218202.0,
"step": 5450
},
{
"entropy": 5.732383728027344,
"epoch": 4.840656901908567,
"grad_norm": 1.140625,
"learning_rate": 0.0003212408781102404,
"loss": 5.1896,
"mean_token_accuracy": 0.20523899495601655,
"num_tokens": 11227885.0,
"step": 5455
},
{
"entropy": 5.655904531478882,
"epoch": 4.845095428317799,
"grad_norm": 1.09375,
"learning_rate": 0.0003209037043013751,
"loss": 5.2079,
"mean_token_accuracy": 0.20618089586496352,
"num_tokens": 11237686.0,
"step": 5460
},
{
"entropy": 5.712638187408447,
"epoch": 4.849533954727031,
"grad_norm": 1.03125,
"learning_rate": 0.0003205664228973632,
"loss": 5.1826,
"mean_token_accuracy": 0.20865253657102584,
"num_tokens": 11248287.0,
"step": 5465
},
{
"entropy": 5.777940988540649,
"epoch": 4.853972481136263,
"grad_norm": 1.0625,
"learning_rate": 0.0003202290346887696,
"loss": 5.1814,
"mean_token_accuracy": 0.20437095165252686,
"num_tokens": 11258376.0,
"step": 5470
},
{
"entropy": 5.766065216064453,
"epoch": 4.858411007545495,
"grad_norm": 1.1953125,
"learning_rate": 0.0003198915404664088,
"loss": 5.2219,
"mean_token_accuracy": 0.19672314822673798,
"num_tokens": 11268966.0,
"step": 5475
},
{
"entropy": 5.700806474685669,
"epoch": 4.862849533954727,
"grad_norm": 1.2734375,
"learning_rate": 0.00031955394102134454,
"loss": 5.2355,
"mean_token_accuracy": 0.2040538489818573,
"num_tokens": 11279836.0,
"step": 5480
},
{
"entropy": 5.7688816547393795,
"epoch": 4.8672880603639594,
"grad_norm": 1.203125,
"learning_rate": 0.0003192162371448868,
"loss": 5.2809,
"mean_token_accuracy": 0.20273662358522415,
"num_tokens": 11290009.0,
"step": 5485
},
{
"entropy": 5.706856298446655,
"epoch": 4.871726586773192,
"grad_norm": 1.15625,
"learning_rate": 0.00031887842962859033,
"loss": 5.1465,
"mean_token_accuracy": 0.2068696990609169,
"num_tokens": 11300460.0,
"step": 5490
},
{
"entropy": 5.7477126121521,
"epoch": 4.876165113182424,
"grad_norm": 1.171875,
"learning_rate": 0.00031854051926425277,
"loss": 5.2111,
"mean_token_accuracy": 0.20210069715976714,
"num_tokens": 11309995.0,
"step": 5495
},
{
"entropy": 5.722295808792114,
"epoch": 4.880603639591656,
"grad_norm": 1.2890625,
"learning_rate": 0.00031820250684391304,
"loss": 5.1839,
"mean_token_accuracy": 0.21283525675535203,
"num_tokens": 11319682.0,
"step": 5500
},
{
"epoch": 4.880603639591656,
"eval_entropy": 5.523329989643957,
"eval_loss": 5.800832271575928,
"eval_mean_token_accuracy": 0.17711487331044928,
"eval_num_tokens": 11319682.0,
"eval_runtime": 2.2641,
"eval_samples_per_second": 1487.117,
"eval_steps_per_second": 185.945,
"step": 5500
},
{
"entropy": 5.73695330619812,
"epoch": 4.885042166000888,
"grad_norm": 1.171875,
"learning_rate": 0.00031786439315984925,
"loss": 5.2303,
"mean_token_accuracy": 0.20797490924596787,
"num_tokens": 11330186.0,
"step": 5505
},
{
"entropy": 5.770789432525635,
"epoch": 4.88948069241012,
"grad_norm": 1.265625,
"learning_rate": 0.00031752617900457656,
"loss": 5.2255,
"mean_token_accuracy": 0.21493835896253585,
"num_tokens": 11340284.0,
"step": 5510
},
{
"entropy": 5.741439962387085,
"epoch": 4.893919218819352,
"grad_norm": 1.2109375,
"learning_rate": 0.000317187865170846,
"loss": 5.2033,
"mean_token_accuracy": 0.2078318029642105,
"num_tokens": 11351098.0,
"step": 5515
},
{
"entropy": 5.707396221160889,
"epoch": 4.8983577452285845,
"grad_norm": 1.125,
"learning_rate": 0.000316849452451642,
"loss": 5.2368,
"mean_token_accuracy": 0.20806288421154023,
"num_tokens": 11361783.0,
"step": 5520
},
{
"entropy": 5.690252161026001,
"epoch": 4.902796271637817,
"grad_norm": 1.15625,
"learning_rate": 0.00031651094164018097,
"loss": 5.1346,
"mean_token_accuracy": 0.21844119280576707,
"num_tokens": 11372840.0,
"step": 5525
},
{
"entropy": 5.7909657001495365,
"epoch": 4.907234798047049,
"grad_norm": 1.1015625,
"learning_rate": 0.0003161723335299089,
"loss": 5.1128,
"mean_token_accuracy": 0.2176864340901375,
"num_tokens": 11382785.0,
"step": 5530
},
{
"entropy": 5.6382709503173825,
"epoch": 4.911673324456281,
"grad_norm": 1.1484375,
"learning_rate": 0.0003158336289145003,
"loss": 5.1838,
"mean_token_accuracy": 0.21205998063087464,
"num_tokens": 11392714.0,
"step": 5535
},
{
"entropy": 5.741606950759888,
"epoch": 4.916111850865512,
"grad_norm": 1.171875,
"learning_rate": 0.00031549482858785554,
"loss": 5.2685,
"mean_token_accuracy": 0.19965731650590895,
"num_tokens": 11404755.0,
"step": 5540
},
{
"entropy": 5.803937005996704,
"epoch": 4.920550377274745,
"grad_norm": 1.25,
"learning_rate": 0.00031515593334409934,
"loss": 5.2045,
"mean_token_accuracy": 0.20873982608318328,
"num_tokens": 11414938.0,
"step": 5545
},
{
"entropy": 5.686682176589966,
"epoch": 4.9249889036839765,
"grad_norm": 1.1015625,
"learning_rate": 0.0003148169439775792,
"loss": 5.1479,
"mean_token_accuracy": 0.21138025522232057,
"num_tokens": 11424962.0,
"step": 5550
},
{
"entropy": 5.696095275878906,
"epoch": 4.9294274300932095,
"grad_norm": 0.98828125,
"learning_rate": 0.00031447786128286286,
"loss": 5.1778,
"mean_token_accuracy": 0.21060777753591536,
"num_tokens": 11436416.0,
"step": 5555
},
{
"entropy": 5.765445613861084,
"epoch": 4.933865956502441,
"grad_norm": 1.1796875,
"learning_rate": 0.0003141386860547371,
"loss": 5.2256,
"mean_token_accuracy": 0.20483573526144028,
"num_tokens": 11446820.0,
"step": 5560
},
{
"entropy": 5.775624513626099,
"epoch": 4.938304482911674,
"grad_norm": 1.1171875,
"learning_rate": 0.0003137994190882054,
"loss": 5.1784,
"mean_token_accuracy": 0.2152741551399231,
"num_tokens": 11456880.0,
"step": 5565
},
{
"entropy": 5.679759883880616,
"epoch": 4.942743009320905,
"grad_norm": 1.28125,
"learning_rate": 0.0003134600611784865,
"loss": 5.1812,
"mean_token_accuracy": 0.20349172353744507,
"num_tokens": 11465758.0,
"step": 5570
},
{
"entropy": 5.664295959472656,
"epoch": 4.947181535730138,
"grad_norm": 1.1640625,
"learning_rate": 0.0003131206131210119,
"loss": 5.0953,
"mean_token_accuracy": 0.21441334635019302,
"num_tokens": 11476209.0,
"step": 5575
},
{
"entropy": 5.703896141052246,
"epoch": 4.951620062139369,
"grad_norm": 1.1796875,
"learning_rate": 0.0003127810757114249,
"loss": 5.1239,
"mean_token_accuracy": 0.21405192017555236,
"num_tokens": 11486510.0,
"step": 5580
},
{
"entropy": 5.755063581466675,
"epoch": 4.9560585885486015,
"grad_norm": 1.203125,
"learning_rate": 0.00031244144974557775,
"loss": 5.1462,
"mean_token_accuracy": 0.2157666265964508,
"num_tokens": 11496910.0,
"step": 5585
},
{
"entropy": 5.703655195236206,
"epoch": 4.960497114957834,
"grad_norm": 1.0703125,
"learning_rate": 0.0003121017360195308,
"loss": 5.1891,
"mean_token_accuracy": 0.20666308254003524,
"num_tokens": 11507488.0,
"step": 5590
},
{
"entropy": 5.749307441711426,
"epoch": 4.964935641367066,
"grad_norm": 1.1015625,
"learning_rate": 0.00031176193532954957,
"loss": 5.2232,
"mean_token_accuracy": 0.20651409029960632,
"num_tokens": 11518398.0,
"step": 5595
},
{
"entropy": 5.7297381401062015,
"epoch": 4.969374167776298,
"grad_norm": 1.171875,
"learning_rate": 0.0003114220484721038,
"loss": 5.1564,
"mean_token_accuracy": 0.20705897808074952,
"num_tokens": 11528470.0,
"step": 5600
},
{
"entropy": 5.670311784744262,
"epoch": 4.97381269418553,
"grad_norm": 1.203125,
"learning_rate": 0.00031108207624386486,
"loss": 5.1299,
"mean_token_accuracy": 0.2155166521668434,
"num_tokens": 11537765.0,
"step": 5605
},
{
"entropy": 5.7339622497558596,
"epoch": 4.978251220594762,
"grad_norm": 1.1953125,
"learning_rate": 0.0003107420194417047,
"loss": 5.249,
"mean_token_accuracy": 0.2012795925140381,
"num_tokens": 11549065.0,
"step": 5610
},
{
"entropy": 5.769830179214478,
"epoch": 4.982689747003994,
"grad_norm": 1.0859375,
"learning_rate": 0.000310401878862693,
"loss": 5.2641,
"mean_token_accuracy": 0.20485369861125946,
"num_tokens": 11559010.0,
"step": 5615
},
{
"entropy": 5.698846435546875,
"epoch": 4.9871282734132265,
"grad_norm": 1.2109375,
"learning_rate": 0.0003100616553040962,
"loss": 5.1158,
"mean_token_accuracy": 0.21705816090106964,
"num_tokens": 11567978.0,
"step": 5620
},
{
"entropy": 5.703730916976928,
"epoch": 4.991566799822459,
"grad_norm": 1.2109375,
"learning_rate": 0.00030972134956337493,
"loss": 5.1565,
"mean_token_accuracy": 0.20373631715774537,
"num_tokens": 11579433.0,
"step": 5625
},
{
"entropy": 5.69541335105896,
"epoch": 4.996005326231691,
"grad_norm": 1.171875,
"learning_rate": 0.00030938096243818275,
"loss": 5.1387,
"mean_token_accuracy": 0.21119639426469802,
"num_tokens": 11589882.0,
"step": 5630
},
{
"entropy": 5.7001016404893665,
"epoch": 5.0,
"grad_norm": 2.296875,
"learning_rate": 0.00030904049472636367,
"loss": 5.1901,
"mean_token_accuracy": 0.21247350341743892,
"num_tokens": 11598630.0,
"step": 5635
},
{
"entropy": 5.739415073394776,
"epoch": 5.004438526409232,
"grad_norm": 1.1875,
"learning_rate": 0.00030869994722595095,
"loss": 5.008,
"mean_token_accuracy": 0.22126824110746385,
"num_tokens": 11608797.0,
"step": 5640
},
{
"entropy": 5.663621139526367,
"epoch": 5.008877052818464,
"grad_norm": 1.1796875,
"learning_rate": 0.0003083593207351644,
"loss": 5.0175,
"mean_token_accuracy": 0.22501287162303923,
"num_tokens": 11619095.0,
"step": 5645
},
{
"entropy": 5.700268888473511,
"epoch": 5.013315579227696,
"grad_norm": 1.234375,
"learning_rate": 0.0003080186160524095,
"loss": 5.0311,
"mean_token_accuracy": 0.22601672559976577,
"num_tokens": 11629770.0,
"step": 5650
},
{
"entropy": 5.718568563461304,
"epoch": 5.017754105636929,
"grad_norm": 1.2421875,
"learning_rate": 0.0003076778339762745,
"loss": 4.948,
"mean_token_accuracy": 0.23284862637519838,
"num_tokens": 11640785.0,
"step": 5655
},
{
"entropy": 5.695920658111572,
"epoch": 5.022192632046161,
"grad_norm": 1.1640625,
"learning_rate": 0.00030733697530552955,
"loss": 4.9336,
"mean_token_accuracy": 0.22667457312345504,
"num_tokens": 11651995.0,
"step": 5660
},
{
"entropy": 5.738033103942871,
"epoch": 5.026631158455393,
"grad_norm": 1.2109375,
"learning_rate": 0.0003069960408391239,
"loss": 5.0168,
"mean_token_accuracy": 0.21783950328826904,
"num_tokens": 11662821.0,
"step": 5665
},
{
"entropy": 5.666689348220825,
"epoch": 5.031069684864625,
"grad_norm": 1.21875,
"learning_rate": 0.00030665503137618466,
"loss": 4.8584,
"mean_token_accuracy": 0.2404223471879959,
"num_tokens": 11672423.0,
"step": 5670
},
{
"entropy": 5.6299999237060545,
"epoch": 5.035508211273857,
"grad_norm": 1.1484375,
"learning_rate": 0.0003063139477160147,
"loss": 4.918,
"mean_token_accuracy": 0.23635224550962447,
"num_tokens": 11683010.0,
"step": 5675
},
{
"entropy": 5.682493114471436,
"epoch": 5.039946737683089,
"grad_norm": 1.1953125,
"learning_rate": 0.00030597279065809103,
"loss": 4.9942,
"mean_token_accuracy": 0.22202890664339064,
"num_tokens": 11693887.0,
"step": 5680
},
{
"entropy": 5.711723518371582,
"epoch": 5.0443852640923215,
"grad_norm": 1.0234375,
"learning_rate": 0.0003056315610020622,
"loss": 5.0131,
"mean_token_accuracy": 0.22168050855398178,
"num_tokens": 11705152.0,
"step": 5685
},
{
"entropy": 5.658341979980468,
"epoch": 5.048823790501554,
"grad_norm": 1.3359375,
"learning_rate": 0.0003052902595477474,
"loss": 4.9349,
"mean_token_accuracy": 0.22618422508239747,
"num_tokens": 11714953.0,
"step": 5690
},
{
"entropy": 5.796881008148193,
"epoch": 5.053262316910786,
"grad_norm": 1.3671875,
"learning_rate": 0.00030494888709513377,
"loss": 5.048,
"mean_token_accuracy": 0.2163314253091812,
"num_tokens": 11725273.0,
"step": 5695
},
{
"entropy": 5.722124481201172,
"epoch": 5.057700843320018,
"grad_norm": 1.15625,
"learning_rate": 0.0003046074444443751,
"loss": 5.0219,
"mean_token_accuracy": 0.21710677593946456,
"num_tokens": 11735757.0,
"step": 5700
},
{
"entropy": 5.642864036560058,
"epoch": 5.06213936972925,
"grad_norm": 1.328125,
"learning_rate": 0.00030426593239578966,
"loss": 5.0246,
"mean_token_accuracy": 0.22806545048952104,
"num_tokens": 11746190.0,
"step": 5705
},
{
"entropy": 5.654903078079224,
"epoch": 5.066577896138482,
"grad_norm": 1.2578125,
"learning_rate": 0.0003039243517498583,
"loss": 4.9854,
"mean_token_accuracy": 0.2298506259918213,
"num_tokens": 11756692.0,
"step": 5710
},
{
"entropy": 5.702650833129883,
"epoch": 5.071016422547714,
"grad_norm": 1.1875,
"learning_rate": 0.0003035827033072228,
"loss": 4.9319,
"mean_token_accuracy": 0.22459085732698442,
"num_tokens": 11768071.0,
"step": 5715
},
{
"entropy": 5.720613718032837,
"epoch": 5.0754549489569465,
"grad_norm": 1.1640625,
"learning_rate": 0.00030324098786868364,
"loss": 5.0182,
"mean_token_accuracy": 0.22162954807281493,
"num_tokens": 11778685.0,
"step": 5720
},
{
"entropy": 5.6652062892913815,
"epoch": 5.079893475366179,
"grad_norm": 1.1640625,
"learning_rate": 0.00030289920623519854,
"loss": 4.9676,
"mean_token_accuracy": 0.2229399025440216,
"num_tokens": 11788078.0,
"step": 5725
},
{
"entropy": 5.676460599899292,
"epoch": 5.084332001775411,
"grad_norm": 1.3359375,
"learning_rate": 0.0003025573592078803,
"loss": 4.9833,
"mean_token_accuracy": 0.22160238772630692,
"num_tokens": 11796440.0,
"step": 5730
},
{
"entropy": 5.745248508453369,
"epoch": 5.088770528184643,
"grad_norm": 1.3359375,
"learning_rate": 0.000302215447587995,
"loss": 5.0358,
"mean_token_accuracy": 0.21714013665914536,
"num_tokens": 11806263.0,
"step": 5735
},
{
"entropy": 5.646965360641479,
"epoch": 5.093209054593875,
"grad_norm": 1.1875,
"learning_rate": 0.00030187347217696005,
"loss": 4.9496,
"mean_token_accuracy": 0.22523796260356904,
"num_tokens": 11816368.0,
"step": 5740
},
{
"entropy": 5.5966925621032715,
"epoch": 5.097647581003107,
"grad_norm": 1.125,
"learning_rate": 0.00030153143377634244,
"loss": 4.9276,
"mean_token_accuracy": 0.22945380359888076,
"num_tokens": 11826319.0,
"step": 5745
},
{
"entropy": 5.676280736923218,
"epoch": 5.102086107412339,
"grad_norm": 1.1171875,
"learning_rate": 0.0003011893331878569,
"loss": 4.9664,
"mean_token_accuracy": 0.23140579015016555,
"num_tokens": 11835971.0,
"step": 5750
},
{
"entropy": 5.701886701583862,
"epoch": 5.1065246338215715,
"grad_norm": 1.28125,
"learning_rate": 0.00030084717121336383,
"loss": 4.9618,
"mean_token_accuracy": 0.22556509524583818,
"num_tokens": 11845506.0,
"step": 5755
},
{
"entropy": 5.715242481231689,
"epoch": 5.110963160230804,
"grad_norm": 1.125,
"learning_rate": 0.00030050494865486744,
"loss": 5.0605,
"mean_token_accuracy": 0.2205240473151207,
"num_tokens": 11856083.0,
"step": 5760
},
{
"entropy": 5.595279550552368,
"epoch": 5.115401686640036,
"grad_norm": 1.265625,
"learning_rate": 0.0003001626663145141,
"loss": 4.9238,
"mean_token_accuracy": 0.23146225064992904,
"num_tokens": 11867061.0,
"step": 5765
},
{
"entropy": 5.720956182479858,
"epoch": 5.119840213049268,
"grad_norm": 1.25,
"learning_rate": 0.00029982032499459017,
"loss": 5.0122,
"mean_token_accuracy": 0.22077643722295762,
"num_tokens": 11877751.0,
"step": 5770
},
{
"entropy": 5.651248216629028,
"epoch": 5.1242787394585,
"grad_norm": 1.21875,
"learning_rate": 0.00029947792549752034,
"loss": 4.9893,
"mean_token_accuracy": 0.22719825357198714,
"num_tokens": 11887649.0,
"step": 5775
},
{
"entropy": 5.659734487533569,
"epoch": 5.128717265867732,
"grad_norm": 1.109375,
"learning_rate": 0.00029913546862586567,
"loss": 5.0319,
"mean_token_accuracy": 0.223132161796093,
"num_tokens": 11898833.0,
"step": 5780
},
{
"entropy": 5.735756158828735,
"epoch": 5.133155792276964,
"grad_norm": 1.1640625,
"learning_rate": 0.0002987929551823215,
"loss": 5.0595,
"mean_token_accuracy": 0.22174521237611772,
"num_tokens": 11910341.0,
"step": 5785
},
{
"entropy": 5.6615043640136715,
"epoch": 5.1375943186861965,
"grad_norm": 1.28125,
"learning_rate": 0.0002984503859697162,
"loss": 4.9508,
"mean_token_accuracy": 0.23014761209487916,
"num_tokens": 11919393.0,
"step": 5790
},
{
"entropy": 5.6714434146881105,
"epoch": 5.142032845095429,
"grad_norm": 1.3203125,
"learning_rate": 0.0002981077617910085,
"loss": 4.9194,
"mean_token_accuracy": 0.23738617449998856,
"num_tokens": 11930765.0,
"step": 5795
},
{
"entropy": 5.629246377944947,
"epoch": 5.146471371504661,
"grad_norm": 1.2265625,
"learning_rate": 0.00029776508344928597,
"loss": 4.9687,
"mean_token_accuracy": 0.22703385949134827,
"num_tokens": 11940054.0,
"step": 5800
},
{
"entropy": 5.650801801681519,
"epoch": 5.150909897913893,
"grad_norm": 1.109375,
"learning_rate": 0.0002974223517477633,
"loss": 4.9464,
"mean_token_accuracy": 0.23225471675395964,
"num_tokens": 11950756.0,
"step": 5805
},
{
"entropy": 5.657662773132325,
"epoch": 5.155348424323125,
"grad_norm": 1.09375,
"learning_rate": 0.0002970795674897802,
"loss": 4.9582,
"mean_token_accuracy": 0.22137288451194764,
"num_tokens": 11961062.0,
"step": 5810
},
{
"entropy": 5.690600299835205,
"epoch": 5.159786950732357,
"grad_norm": 1.234375,
"learning_rate": 0.0002967367314787995,
"loss": 4.9235,
"mean_token_accuracy": 0.22654454112052919,
"num_tokens": 11970557.0,
"step": 5815
},
{
"entropy": 5.638317346572876,
"epoch": 5.164225477141589,
"grad_norm": 1.125,
"learning_rate": 0.00029639384451840545,
"loss": 4.9384,
"mean_token_accuracy": 0.22700047940015794,
"num_tokens": 11981331.0,
"step": 5820
},
{
"entropy": 5.6244978427886965,
"epoch": 5.168664003550822,
"grad_norm": 1.2265625,
"learning_rate": 0.0002960509074123015,
"loss": 4.9891,
"mean_token_accuracy": 0.21644605994224547,
"num_tokens": 11992159.0,
"step": 5825
},
{
"entropy": 5.716595268249511,
"epoch": 5.173102529960053,
"grad_norm": 1.234375,
"learning_rate": 0.000295707920964309,
"loss": 4.9931,
"mean_token_accuracy": 0.22334617823362352,
"num_tokens": 12002603.0,
"step": 5830
},
{
"entropy": 5.7139030456542965,
"epoch": 5.177541056369286,
"grad_norm": 1.2421875,
"learning_rate": 0.0002953648859783646,
"loss": 5.1011,
"mean_token_accuracy": 0.21508881002664565,
"num_tokens": 12012623.0,
"step": 5835
},
{
"entropy": 5.665186405181885,
"epoch": 5.181979582778517,
"grad_norm": 1.1484375,
"learning_rate": 0.0002950218032585191,
"loss": 4.9749,
"mean_token_accuracy": 0.22413384765386582,
"num_tokens": 12023017.0,
"step": 5840
},
{
"entropy": 5.671549224853516,
"epoch": 5.186418109187749,
"grad_norm": 1.21875,
"learning_rate": 0.0002946786736089346,
"loss": 4.9773,
"mean_token_accuracy": 0.2214719161391258,
"num_tokens": 12033032.0,
"step": 5845
},
{
"entropy": 5.677174139022827,
"epoch": 5.190856635596981,
"grad_norm": 1.125,
"learning_rate": 0.0002943354978338838,
"loss": 5.0024,
"mean_token_accuracy": 0.2283272624015808,
"num_tokens": 12043609.0,
"step": 5850
},
{
"entropy": 5.730323934555054,
"epoch": 5.1952951620062136,
"grad_norm": 1.2578125,
"learning_rate": 0.0002939922767377472,
"loss": 5.0104,
"mean_token_accuracy": 0.22389555275440215,
"num_tokens": 12053282.0,
"step": 5855
},
{
"entropy": 5.7337881565094,
"epoch": 5.199733688415446,
"grad_norm": 1.1484375,
"learning_rate": 0.0002936490111250116,
"loss": 5.0561,
"mean_token_accuracy": 0.217279052734375,
"num_tokens": 12063672.0,
"step": 5860
},
{
"entropy": 5.663741397857666,
"epoch": 5.204172214824678,
"grad_norm": 1.3125,
"learning_rate": 0.0002933057018002681,
"loss": 4.9316,
"mean_token_accuracy": 0.22680189162492753,
"num_tokens": 12073921.0,
"step": 5865
},
{
"entropy": 5.718992376327515,
"epoch": 5.20861074123391,
"grad_norm": 1.1953125,
"learning_rate": 0.00029296234956821044,
"loss": 4.9402,
"mean_token_accuracy": 0.22692192792892457,
"num_tokens": 12085149.0,
"step": 5870
},
{
"entropy": 5.621643352508545,
"epoch": 5.213049267643142,
"grad_norm": 1.1484375,
"learning_rate": 0.0002926189552336326,
"loss": 4.9647,
"mean_token_accuracy": 0.2331915631890297,
"num_tokens": 12096515.0,
"step": 5875
},
{
"entropy": 5.674287557601929,
"epoch": 5.217487794052374,
"grad_norm": 1.203125,
"learning_rate": 0.0002922755196014277,
"loss": 4.9135,
"mean_token_accuracy": 0.22644905298948287,
"num_tokens": 12106352.0,
"step": 5880
},
{
"entropy": 5.652184581756591,
"epoch": 5.221926320461606,
"grad_norm": 1.3125,
"learning_rate": 0.000291932043476585,
"loss": 4.9627,
"mean_token_accuracy": 0.2293543979525566,
"num_tokens": 12116344.0,
"step": 5885
},
{
"entropy": 5.67815523147583,
"epoch": 5.226364846870839,
"grad_norm": 1.0703125,
"learning_rate": 0.0002915885276641895,
"loss": 5.1006,
"mean_token_accuracy": 0.21285598427057267,
"num_tokens": 12127402.0,
"step": 5890
},
{
"entropy": 5.687961149215698,
"epoch": 5.230803373280071,
"grad_norm": 1.359375,
"learning_rate": 0.00029124497296941843,
"loss": 4.9267,
"mean_token_accuracy": 0.22959166169166564,
"num_tokens": 12138065.0,
"step": 5895
},
{
"entropy": 5.636407089233399,
"epoch": 5.235241899689303,
"grad_norm": 1.203125,
"learning_rate": 0.00029090138019754075,
"loss": 4.9783,
"mean_token_accuracy": 0.22571838796138763,
"num_tokens": 12148450.0,
"step": 5900
},
{
"entropy": 5.608906221389771,
"epoch": 5.239680426098535,
"grad_norm": 1.265625,
"learning_rate": 0.0002905577501539144,
"loss": 4.9822,
"mean_token_accuracy": 0.21735644042491914,
"num_tokens": 12158587.0,
"step": 5905
},
{
"entropy": 5.650953483581543,
"epoch": 5.244118952507767,
"grad_norm": 1.2734375,
"learning_rate": 0.0002902140836439847,
"loss": 4.9359,
"mean_token_accuracy": 0.22076532393693923,
"num_tokens": 12169139.0,
"step": 5910
},
{
"entropy": 5.664229774475098,
"epoch": 5.248557478916999,
"grad_norm": 1.3125,
"learning_rate": 0.0002898703814732824,
"loss": 4.9963,
"mean_token_accuracy": 0.22586210668087006,
"num_tokens": 12179178.0,
"step": 5915
},
{
"entropy": 5.747469329833985,
"epoch": 5.2529960053262315,
"grad_norm": 1.2734375,
"learning_rate": 0.00028952664444742204,
"loss": 5.0667,
"mean_token_accuracy": 0.21449797302484513,
"num_tokens": 12189018.0,
"step": 5920
},
{
"entropy": 5.725044107437133,
"epoch": 5.257434531735464,
"grad_norm": 1.2734375,
"learning_rate": 0.0002891828733720996,
"loss": 5.0464,
"mean_token_accuracy": 0.22428497821092605,
"num_tokens": 12199250.0,
"step": 5925
},
{
"entropy": 5.674435091018677,
"epoch": 5.261873058144696,
"grad_norm": 1.359375,
"learning_rate": 0.00028883906905309103,
"loss": 5.0602,
"mean_token_accuracy": 0.21731068789958954,
"num_tokens": 12209572.0,
"step": 5930
},
{
"entropy": 5.678584957122803,
"epoch": 5.266311584553928,
"grad_norm": 1.265625,
"learning_rate": 0.0002884952322962502,
"loss": 5.0185,
"mean_token_accuracy": 0.22419251948595048,
"num_tokens": 12220168.0,
"step": 5935
},
{
"entropy": 5.725101184844971,
"epoch": 5.27075011096316,
"grad_norm": 1.3046875,
"learning_rate": 0.00028815136390750694,
"loss": 4.967,
"mean_token_accuracy": 0.2251395106315613,
"num_tokens": 12229765.0,
"step": 5940
},
{
"entropy": 5.604526662826538,
"epoch": 5.275188637372392,
"grad_norm": 1.3828125,
"learning_rate": 0.0002878074646928653,
"loss": 4.9616,
"mean_token_accuracy": 0.22482145875692366,
"num_tokens": 12240087.0,
"step": 5945
},
{
"entropy": 5.676482009887695,
"epoch": 5.279627163781624,
"grad_norm": 1.203125,
"learning_rate": 0.0002874635354584015,
"loss": 4.9899,
"mean_token_accuracy": 0.22442464679479598,
"num_tokens": 12251489.0,
"step": 5950
},
{
"entropy": 5.718767786026001,
"epoch": 5.2840656901908565,
"grad_norm": 1.2890625,
"learning_rate": 0.0002871195770102621,
"loss": 5.0116,
"mean_token_accuracy": 0.22521375119686127,
"num_tokens": 12261114.0,
"step": 5955
},
{
"entropy": 5.649609994888306,
"epoch": 5.288504216600089,
"grad_norm": 1.3125,
"learning_rate": 0.0002867755901546624,
"loss": 4.9961,
"mean_token_accuracy": 0.21924589872360228,
"num_tokens": 12271840.0,
"step": 5960
},
{
"entropy": 5.661839437484741,
"epoch": 5.292942743009321,
"grad_norm": 1.25,
"learning_rate": 0.00028643157569788386,
"loss": 4.9661,
"mean_token_accuracy": 0.22587821185588836,
"num_tokens": 12281407.0,
"step": 5965
},
{
"entropy": 5.667834806442261,
"epoch": 5.297381269418553,
"grad_norm": 1.1640625,
"learning_rate": 0.00028608753444627307,
"loss": 4.9471,
"mean_token_accuracy": 0.23786964565515517,
"num_tokens": 12293087.0,
"step": 5970
},
{
"entropy": 5.657839250564575,
"epoch": 5.301819795827785,
"grad_norm": 1.1328125,
"learning_rate": 0.000285743467206239,
"loss": 4.9241,
"mean_token_accuracy": 0.23313162177801133,
"num_tokens": 12303638.0,
"step": 5975
},
{
"entropy": 5.723939514160156,
"epoch": 5.306258322237017,
"grad_norm": 1.1796875,
"learning_rate": 0.00028539937478425196,
"loss": 5.004,
"mean_token_accuracy": 0.22194170355796813,
"num_tokens": 12314059.0,
"step": 5980
},
{
"entropy": 5.626681756973267,
"epoch": 5.310696848646249,
"grad_norm": 1.265625,
"learning_rate": 0.0002850552579868409,
"loss": 4.9439,
"mean_token_accuracy": 0.23021697402000427,
"num_tokens": 12323447.0,
"step": 5985
},
{
"entropy": 5.587870359420776,
"epoch": 5.3151353750554815,
"grad_norm": 1.3203125,
"learning_rate": 0.0002847111176205922,
"loss": 4.9479,
"mean_token_accuracy": 0.23014504015445708,
"num_tokens": 12333676.0,
"step": 5990
},
{
"entropy": 5.688661241531372,
"epoch": 5.319573901464714,
"grad_norm": 1.3125,
"learning_rate": 0.0002843669544921473,
"loss": 5.0272,
"mean_token_accuracy": 0.22250010669231415,
"num_tokens": 12344188.0,
"step": 5995
},
{
"entropy": 5.607497310638427,
"epoch": 5.324012427873946,
"grad_norm": 1.3515625,
"learning_rate": 0.0002840227694082011,
"loss": 4.8953,
"mean_token_accuracy": 0.2363758459687233,
"num_tokens": 12353898.0,
"step": 6000
},
{
"epoch": 5.324012427873946,
"eval_entropy": 5.461305147112124,
"eval_loss": 5.801708221435547,
"eval_mean_token_accuracy": 0.1778349627579193,
"eval_num_tokens": 12353898.0,
"eval_runtime": 2.0862,
"eval_samples_per_second": 1613.94,
"eval_steps_per_second": 201.802,
"step": 6000
},
{
"entropy": 5.694605779647827,
"epoch": 5.328450954283178,
"grad_norm": 1.28125,
"learning_rate": 0.0002836785631754998,
"loss": 5.0717,
"mean_token_accuracy": 0.21206305921077728,
"num_tokens": 12364775.0,
"step": 6005
},
{
"entropy": 5.655154228210449,
"epoch": 5.33288948069241,
"grad_norm": 1.25,
"learning_rate": 0.0002833343366008396,
"loss": 5.0325,
"mean_token_accuracy": 0.2215897798538208,
"num_tokens": 12376072.0,
"step": 6010
},
{
"entropy": 5.734228801727295,
"epoch": 5.337328007101642,
"grad_norm": 1.1953125,
"learning_rate": 0.00028299009049106364,
"loss": 4.9952,
"mean_token_accuracy": 0.2188931554555893,
"num_tokens": 12385616.0,
"step": 6015
},
{
"entropy": 5.680519723892212,
"epoch": 5.341766533510874,
"grad_norm": 1.2265625,
"learning_rate": 0.0002826458256530617,
"loss": 5.0288,
"mean_token_accuracy": 0.2136446177959442,
"num_tokens": 12395860.0,
"step": 6020
},
{
"entropy": 5.6432453155517575,
"epoch": 5.3462050599201065,
"grad_norm": 1.3046875,
"learning_rate": 0.00028230154289376677,
"loss": 5.0099,
"mean_token_accuracy": 0.22122237384319304,
"num_tokens": 12405827.0,
"step": 6025
},
{
"entropy": 5.597190999984742,
"epoch": 5.350643586329339,
"grad_norm": 1.2734375,
"learning_rate": 0.0002819572430201542,
"loss": 4.8931,
"mean_token_accuracy": 0.23657583594322204,
"num_tokens": 12415957.0,
"step": 6030
},
{
"entropy": 5.564443159103393,
"epoch": 5.355082112738571,
"grad_norm": 1.1953125,
"learning_rate": 0.0002816129268392393,
"loss": 4.9235,
"mean_token_accuracy": 0.2252490147948265,
"num_tokens": 12426120.0,
"step": 6035
},
{
"entropy": 5.659930801391601,
"epoch": 5.359520639147803,
"grad_norm": 1.3125,
"learning_rate": 0.00028126859515807575,
"loss": 5.0185,
"mean_token_accuracy": 0.22204705625772475,
"num_tokens": 12436771.0,
"step": 6040
},
{
"entropy": 5.64413104057312,
"epoch": 5.363959165557035,
"grad_norm": 1.1015625,
"learning_rate": 0.00028092424878375347,
"loss": 4.9902,
"mean_token_accuracy": 0.22899802029132843,
"num_tokens": 12448171.0,
"step": 6045
},
{
"entropy": 5.6428248405456545,
"epoch": 5.368397691966267,
"grad_norm": 1.3984375,
"learning_rate": 0.00028057988852339677,
"loss": 4.9936,
"mean_token_accuracy": 0.2263574168086052,
"num_tokens": 12457646.0,
"step": 6050
},
{
"entropy": 5.736252880096435,
"epoch": 5.372836218375499,
"grad_norm": 1.25,
"learning_rate": 0.0002802355151841627,
"loss": 5.0063,
"mean_token_accuracy": 0.21641401946544647,
"num_tokens": 12467141.0,
"step": 6055
},
{
"entropy": 5.617092132568359,
"epoch": 5.3772747447847316,
"grad_norm": 1.1875,
"learning_rate": 0.00027989112957323874,
"loss": 5.024,
"mean_token_accuracy": 0.2205627903342247,
"num_tokens": 12477263.0,
"step": 6060
},
{
"entropy": 5.65948166847229,
"epoch": 5.381713271193964,
"grad_norm": 1.2421875,
"learning_rate": 0.00027954673249784123,
"loss": 5.0292,
"mean_token_accuracy": 0.21856732070446014,
"num_tokens": 12487686.0,
"step": 6065
},
{
"entropy": 5.6798900127410885,
"epoch": 5.386151797603196,
"grad_norm": 1.125,
"learning_rate": 0.0002792023247652135,
"loss": 4.9648,
"mean_token_accuracy": 0.23209285140037536,
"num_tokens": 12498661.0,
"step": 6070
},
{
"entropy": 5.649793338775635,
"epoch": 5.390590324012428,
"grad_norm": 1.21875,
"learning_rate": 0.00027885790718262354,
"loss": 5.0383,
"mean_token_accuracy": 0.22359896451234818,
"num_tokens": 12509618.0,
"step": 6075
},
{
"entropy": 5.650465726852417,
"epoch": 5.39502885042166,
"grad_norm": 1.3359375,
"learning_rate": 0.0002785134805573628,
"loss": 4.9869,
"mean_token_accuracy": 0.2266141027212143,
"num_tokens": 12519005.0,
"step": 6080
},
{
"entropy": 5.665211725234985,
"epoch": 5.399467376830892,
"grad_norm": 1.25,
"learning_rate": 0.00027816904569674363,
"loss": 4.965,
"mean_token_accuracy": 0.22762566953897476,
"num_tokens": 12528217.0,
"step": 6085
},
{
"entropy": 5.599503660202027,
"epoch": 5.403905903240124,
"grad_norm": 1.21875,
"learning_rate": 0.00027782460340809793,
"loss": 4.9359,
"mean_token_accuracy": 0.2310307577252388,
"num_tokens": 12537721.0,
"step": 6090
},
{
"entropy": 5.658894205093384,
"epoch": 5.408344429649357,
"grad_norm": 1.28125,
"learning_rate": 0.00027748015449877486,
"loss": 5.0124,
"mean_token_accuracy": 0.21849820911884307,
"num_tokens": 12548140.0,
"step": 6095
},
{
"entropy": 5.683730030059815,
"epoch": 5.412782956058589,
"grad_norm": 1.296875,
"learning_rate": 0.00027713569977613913,
"loss": 5.0007,
"mean_token_accuracy": 0.22294105142354964,
"num_tokens": 12558488.0,
"step": 6100
},
{
"entropy": 5.671377372741699,
"epoch": 5.417221482467821,
"grad_norm": 1.34375,
"learning_rate": 0.0002767912400475689,
"loss": 4.9683,
"mean_token_accuracy": 0.22906655818223953,
"num_tokens": 12568175.0,
"step": 6105
},
{
"entropy": 5.677095890045166,
"epoch": 5.421660008877053,
"grad_norm": 1.2265625,
"learning_rate": 0.00027644677612045454,
"loss": 5.0371,
"mean_token_accuracy": 0.21587695181369781,
"num_tokens": 12579019.0,
"step": 6110
},
{
"entropy": 5.705719900131226,
"epoch": 5.426098535286285,
"grad_norm": 1.2421875,
"learning_rate": 0.00027610230880219575,
"loss": 4.9961,
"mean_token_accuracy": 0.22534764558076859,
"num_tokens": 12589693.0,
"step": 6115
},
{
"entropy": 5.676087188720703,
"epoch": 5.430537061695517,
"grad_norm": 1.25,
"learning_rate": 0.00027575783890020045,
"loss": 5.0388,
"mean_token_accuracy": 0.21792452335357665,
"num_tokens": 12599149.0,
"step": 6120
},
{
"entropy": 5.611163806915283,
"epoch": 5.4349755881047495,
"grad_norm": 1.2265625,
"learning_rate": 0.00027541336722188253,
"loss": 4.9999,
"mean_token_accuracy": 0.22886097729206084,
"num_tokens": 12608389.0,
"step": 6125
},
{
"entropy": 5.721693277359009,
"epoch": 5.439414114513982,
"grad_norm": 1.328125,
"learning_rate": 0.0002750688945746601,
"loss": 5.0188,
"mean_token_accuracy": 0.2188421055674553,
"num_tokens": 12618664.0,
"step": 6130
},
{
"entropy": 5.714936113357544,
"epoch": 5.443852640923214,
"grad_norm": 1.296875,
"learning_rate": 0.0002747244217659535,
"loss": 5.0174,
"mean_token_accuracy": 0.2265838772058487,
"num_tokens": 12629044.0,
"step": 6135
},
{
"entropy": 5.736785793304444,
"epoch": 5.448291167332446,
"grad_norm": 1.21875,
"learning_rate": 0.0002743799496031834,
"loss": 5.0571,
"mean_token_accuracy": 0.22291236519813537,
"num_tokens": 12639354.0,
"step": 6140
},
{
"entropy": 5.632248735427856,
"epoch": 5.452729693741678,
"grad_norm": 1.328125,
"learning_rate": 0.0002740354788937691,
"loss": 4.9996,
"mean_token_accuracy": 0.21985315829515456,
"num_tokens": 12648845.0,
"step": 6145
},
{
"entropy": 5.619083642959595,
"epoch": 5.45716822015091,
"grad_norm": 1.2421875,
"learning_rate": 0.0002736910104451263,
"loss": 5.0694,
"mean_token_accuracy": 0.21995143890380858,
"num_tokens": 12659245.0,
"step": 6150
},
{
"entropy": 5.719312000274658,
"epoch": 5.461606746560142,
"grad_norm": 1.265625,
"learning_rate": 0.00027334654506466576,
"loss": 5.0977,
"mean_token_accuracy": 0.21217371821403502,
"num_tokens": 12670436.0,
"step": 6155
},
{
"entropy": 5.736315631866455,
"epoch": 5.4660452729693745,
"grad_norm": 1.296875,
"learning_rate": 0.00027300208355979054,
"loss": 5.0745,
"mean_token_accuracy": 0.21208183467388153,
"num_tokens": 12680735.0,
"step": 6160
},
{
"entropy": 5.63333215713501,
"epoch": 5.470483799378607,
"grad_norm": 1.25,
"learning_rate": 0.00027265762673789497,
"loss": 4.9634,
"mean_token_accuracy": 0.2283572718501091,
"num_tokens": 12691125.0,
"step": 6165
},
{
"entropy": 5.688968515396118,
"epoch": 5.474922325787839,
"grad_norm": 1.2578125,
"learning_rate": 0.00027231317540636217,
"loss": 4.9945,
"mean_token_accuracy": 0.21915152668952942,
"num_tokens": 12700838.0,
"step": 6170
},
{
"entropy": 5.692178964614868,
"epoch": 5.479360852197071,
"grad_norm": 1.3046875,
"learning_rate": 0.00027196873037256265,
"loss": 5.0622,
"mean_token_accuracy": 0.21220242083072663,
"num_tokens": 12710960.0,
"step": 6175
},
{
"entropy": 5.7159651756286625,
"epoch": 5.483799378606303,
"grad_norm": 1.203125,
"learning_rate": 0.0002716242924438521,
"loss": 5.0347,
"mean_token_accuracy": 0.21605148762464524,
"num_tokens": 12721958.0,
"step": 6180
},
{
"entropy": 5.668157291412354,
"epoch": 5.488237905015535,
"grad_norm": 1.2890625,
"learning_rate": 0.00027127986242756933,
"loss": 5.0048,
"mean_token_accuracy": 0.22361987084150314,
"num_tokens": 12731104.0,
"step": 6185
},
{
"entropy": 5.601274681091309,
"epoch": 5.492676431424767,
"grad_norm": 1.25,
"learning_rate": 0.0002709354411310349,
"loss": 4.9887,
"mean_token_accuracy": 0.2279864251613617,
"num_tokens": 12740759.0,
"step": 6190
},
{
"entropy": 5.652634859085083,
"epoch": 5.4971149578339995,
"grad_norm": 1.28125,
"learning_rate": 0.0002705910293615487,
"loss": 4.9924,
"mean_token_accuracy": 0.22392220199108123,
"num_tokens": 12750109.0,
"step": 6195
},
{
"entropy": 5.653663682937622,
"epoch": 5.501553484243232,
"grad_norm": 1.1640625,
"learning_rate": 0.00027024662792638854,
"loss": 4.9645,
"mean_token_accuracy": 0.2316619038581848,
"num_tokens": 12760629.0,
"step": 6200
},
{
"entropy": 5.623260498046875,
"epoch": 5.505992010652463,
"grad_norm": 1.40625,
"learning_rate": 0.00026990223763280767,
"loss": 5.0239,
"mean_token_accuracy": 0.21955691128969193,
"num_tokens": 12770282.0,
"step": 6205
},
{
"entropy": 5.649196434020996,
"epoch": 5.510430537061696,
"grad_norm": 1.1953125,
"learning_rate": 0.00026955785928803344,
"loss": 5.0416,
"mean_token_accuracy": 0.22228744626045227,
"num_tokens": 12781417.0,
"step": 6210
},
{
"entropy": 5.641202163696289,
"epoch": 5.514869063470927,
"grad_norm": 1.0625,
"learning_rate": 0.00026921349369926525,
"loss": 4.936,
"mean_token_accuracy": 0.22368472665548325,
"num_tokens": 12792052.0,
"step": 6215
},
{
"entropy": 5.703455018997192,
"epoch": 5.51930758988016,
"grad_norm": 1.1015625,
"learning_rate": 0.00026886914167367244,
"loss": 5.0203,
"mean_token_accuracy": 0.22575272768735885,
"num_tokens": 12802748.0,
"step": 6220
},
{
"entropy": 5.765030145645142,
"epoch": 5.5237461162893915,
"grad_norm": 1.3203125,
"learning_rate": 0.0002685248040183926,
"loss": 4.9543,
"mean_token_accuracy": 0.2244446337223053,
"num_tokens": 12812036.0,
"step": 6225
},
{
"entropy": 5.613691759109497,
"epoch": 5.5281846426986245,
"grad_norm": 1.421875,
"learning_rate": 0.0002681804815405297,
"loss": 5.0105,
"mean_token_accuracy": 0.2189746007323265,
"num_tokens": 12821555.0,
"step": 6230
},
{
"entropy": 5.620352506637573,
"epoch": 5.532623169107856,
"grad_norm": 1.3828125,
"learning_rate": 0.0002678361750471522,
"loss": 4.9934,
"mean_token_accuracy": 0.22740308046340943,
"num_tokens": 12831802.0,
"step": 6235
},
{
"entropy": 5.764811611175537,
"epoch": 5.537061695517089,
"grad_norm": 1.2578125,
"learning_rate": 0.0002674918853452909,
"loss": 5.1639,
"mean_token_accuracy": 0.209571872651577,
"num_tokens": 12843051.0,
"step": 6240
},
{
"entropy": 5.740146160125732,
"epoch": 5.54150022192632,
"grad_norm": 1.203125,
"learning_rate": 0.0002671476132419374,
"loss": 5.097,
"mean_token_accuracy": 0.21217051148414612,
"num_tokens": 12853595.0,
"step": 6245
},
{
"entropy": 5.7057901382446286,
"epoch": 5.545938748335552,
"grad_norm": 1.2265625,
"learning_rate": 0.00026680335954404176,
"loss": 5.0752,
"mean_token_accuracy": 0.2123361885547638,
"num_tokens": 12864217.0,
"step": 6250
},
{
"entropy": 5.699584007263184,
"epoch": 5.550377274744784,
"grad_norm": 1.25,
"learning_rate": 0.0002664591250585114,
"loss": 5.0434,
"mean_token_accuracy": 0.22167427241802215,
"num_tokens": 12874707.0,
"step": 6255
},
{
"entropy": 5.711703157424926,
"epoch": 5.5548158011540165,
"grad_norm": 1.2109375,
"learning_rate": 0.0002661149105922083,
"loss": 5.0713,
"mean_token_accuracy": 0.21682032346725463,
"num_tokens": 12885434.0,
"step": 6260
},
{
"entropy": 5.633283376693726,
"epoch": 5.559254327563249,
"grad_norm": 1.2109375,
"learning_rate": 0.0002657707169519477,
"loss": 5.0226,
"mean_token_accuracy": 0.2257848098874092,
"num_tokens": 12896104.0,
"step": 6265
},
{
"entropy": 5.749885225296021,
"epoch": 5.563692853972481,
"grad_norm": 1.3125,
"learning_rate": 0.00026542654494449597,
"loss": 5.0371,
"mean_token_accuracy": 0.2217355713248253,
"num_tokens": 12906885.0,
"step": 6270
},
{
"entropy": 5.638136959075927,
"epoch": 5.568131380381713,
"grad_norm": 1.40625,
"learning_rate": 0.0002650823953765688,
"loss": 5.0413,
"mean_token_accuracy": 0.2228425621986389,
"num_tokens": 12918075.0,
"step": 6275
},
{
"entropy": 5.705075645446778,
"epoch": 5.572569906790945,
"grad_norm": 1.1015625,
"learning_rate": 0.00026473826905482924,
"loss": 5.0307,
"mean_token_accuracy": 0.22413425594568254,
"num_tokens": 12929147.0,
"step": 6280
},
{
"entropy": 5.732161951065064,
"epoch": 5.577008433200177,
"grad_norm": 1.28125,
"learning_rate": 0.00026439416678588593,
"loss": 5.0882,
"mean_token_accuracy": 0.22053047120571137,
"num_tokens": 12940123.0,
"step": 6285
},
{
"entropy": 5.709658288955689,
"epoch": 5.581446959609409,
"grad_norm": 1.1796875,
"learning_rate": 0.0002640500893762908,
"loss": 4.959,
"mean_token_accuracy": 0.22130573987960817,
"num_tokens": 12950587.0,
"step": 6290
},
{
"entropy": 5.643577623367309,
"epoch": 5.5858854860186415,
"grad_norm": 1.203125,
"learning_rate": 0.00026370603763253814,
"loss": 4.9522,
"mean_token_accuracy": 0.22671314030885698,
"num_tokens": 12961034.0,
"step": 6295
},
{
"entropy": 5.694207715988159,
"epoch": 5.590324012427874,
"grad_norm": 1.265625,
"learning_rate": 0.0002633620123610616,
"loss": 4.9965,
"mean_token_accuracy": 0.22679226994514465,
"num_tokens": 12971385.0,
"step": 6300
},
{
"entropy": 5.7326904296875,
"epoch": 5.594762538837106,
"grad_norm": 1.25,
"learning_rate": 0.00026301801436823285,
"loss": 5.1144,
"mean_token_accuracy": 0.21260396838188172,
"num_tokens": 12982263.0,
"step": 6305
},
{
"entropy": 5.6141676902771,
"epoch": 5.599201065246338,
"grad_norm": 1.2578125,
"learning_rate": 0.0002626740444603598,
"loss": 4.9541,
"mean_token_accuracy": 0.22624145448207855,
"num_tokens": 12992246.0,
"step": 6310
},
{
"entropy": 5.60584135055542,
"epoch": 5.60363959165557,
"grad_norm": 1.2734375,
"learning_rate": 0.00026233010344368425,
"loss": 4.9833,
"mean_token_accuracy": 0.22964728623628616,
"num_tokens": 13002696.0,
"step": 6315
},
{
"entropy": 5.671609258651733,
"epoch": 5.608078118064802,
"grad_norm": 1.234375,
"learning_rate": 0.0002619861921243806,
"loss": 5.0442,
"mean_token_accuracy": 0.21581459939479827,
"num_tokens": 13013156.0,
"step": 6320
},
{
"entropy": 5.672356510162354,
"epoch": 5.612516644474034,
"grad_norm": 1.2265625,
"learning_rate": 0.0002616423113085535,
"loss": 4.9933,
"mean_token_accuracy": 0.22206830531358718,
"num_tokens": 13024357.0,
"step": 6325
},
{
"entropy": 5.690655517578125,
"epoch": 5.616955170883267,
"grad_norm": 1.2265625,
"learning_rate": 0.00026129846180223586,
"loss": 5.0451,
"mean_token_accuracy": 0.22947421222925185,
"num_tokens": 13035214.0,
"step": 6330
},
{
"entropy": 5.641977167129516,
"epoch": 5.621393697292499,
"grad_norm": 1.296875,
"learning_rate": 0.0002609546444113876,
"loss": 4.9429,
"mean_token_accuracy": 0.23031658828258514,
"num_tokens": 13044978.0,
"step": 6335
},
{
"entropy": 5.707359695434571,
"epoch": 5.625832223701731,
"grad_norm": 1.1796875,
"learning_rate": 0.0002606108599418933,
"loss": 5.0968,
"mean_token_accuracy": 0.22304710894823074,
"num_tokens": 13055023.0,
"step": 6340
},
{
"entropy": 5.682846355438232,
"epoch": 5.630270750110963,
"grad_norm": 1.140625,
"learning_rate": 0.00026026710919956,
"loss": 5.0717,
"mean_token_accuracy": 0.21679206639528276,
"num_tokens": 13065992.0,
"step": 6345
},
{
"entropy": 5.62232928276062,
"epoch": 5.634709276520195,
"grad_norm": 1.328125,
"learning_rate": 0.00025992339299011616,
"loss": 4.9318,
"mean_token_accuracy": 0.236390919983387,
"num_tokens": 13076550.0,
"step": 6350
},
{
"entropy": 5.664689016342163,
"epoch": 5.639147802929427,
"grad_norm": 1.328125,
"learning_rate": 0.00025957971211920894,
"loss": 5.0736,
"mean_token_accuracy": 0.22434719055891036,
"num_tokens": 13085785.0,
"step": 6355
},
{
"entropy": 5.683269357681274,
"epoch": 5.6435863293386594,
"grad_norm": 1.125,
"learning_rate": 0.00025923606739240306,
"loss": 4.9591,
"mean_token_accuracy": 0.22180295884609222,
"num_tokens": 13096411.0,
"step": 6360
},
{
"entropy": 5.74550051689148,
"epoch": 5.648024855747892,
"grad_norm": 1.2421875,
"learning_rate": 0.000258892459615178,
"loss": 5.0569,
"mean_token_accuracy": 0.21744260042905808,
"num_tokens": 13106624.0,
"step": 6365
},
{
"entropy": 5.6472186088562015,
"epoch": 5.652463382157124,
"grad_norm": 1.40625,
"learning_rate": 0.000258548889592927,
"loss": 4.9247,
"mean_token_accuracy": 0.23228488862514496,
"num_tokens": 13116487.0,
"step": 6370
},
{
"entropy": 5.677945470809936,
"epoch": 5.656901908566356,
"grad_norm": 1.28125,
"learning_rate": 0.00025820535813095475,
"loss": 5.024,
"mean_token_accuracy": 0.2238454282283783,
"num_tokens": 13126210.0,
"step": 6375
},
{
"entropy": 5.658624219894409,
"epoch": 5.661340434975588,
"grad_norm": 1.1484375,
"learning_rate": 0.0002578618660344756,
"loss": 5.0801,
"mean_token_accuracy": 0.21515882164239883,
"num_tokens": 13136964.0,
"step": 6380
},
{
"entropy": 5.690809345245361,
"epoch": 5.66577896138482,
"grad_norm": 1.15625,
"learning_rate": 0.0002575184141086114,
"loss": 4.9476,
"mean_token_accuracy": 0.23027436584234237,
"num_tokens": 13147332.0,
"step": 6385
},
{
"entropy": 5.693671369552613,
"epoch": 5.670217487794052,
"grad_norm": 1.21875,
"learning_rate": 0.0002571750031583901,
"loss": 5.0634,
"mean_token_accuracy": 0.21712343990802765,
"num_tokens": 13157021.0,
"step": 6390
},
{
"entropy": 5.610699081420899,
"epoch": 5.6746560142032845,
"grad_norm": 1.1640625,
"learning_rate": 0.00025683163398874356,
"loss": 4.9216,
"mean_token_accuracy": 0.23084259927272796,
"num_tokens": 13166802.0,
"step": 6395
},
{
"entropy": 5.657120323181152,
"epoch": 5.679094540612517,
"grad_norm": 1.2890625,
"learning_rate": 0.0002564883074045055,
"loss": 4.976,
"mean_token_accuracy": 0.22509267032146454,
"num_tokens": 13176032.0,
"step": 6400
},
{
"entropy": 5.660452222824096,
"epoch": 5.683533067021749,
"grad_norm": 1.3359375,
"learning_rate": 0.00025614502421041004,
"loss": 5.0065,
"mean_token_accuracy": 0.22530782520771026,
"num_tokens": 13186941.0,
"step": 6405
},
{
"entropy": 5.66192135810852,
"epoch": 5.687971593430981,
"grad_norm": 1.3515625,
"learning_rate": 0.0002558017852110895,
"loss": 5.0014,
"mean_token_accuracy": 0.2287282794713974,
"num_tokens": 13196641.0,
"step": 6410
},
{
"entropy": 5.625327491760254,
"epoch": 5.692410119840213,
"grad_norm": 1.1015625,
"learning_rate": 0.00025545859121107274,
"loss": 4.9805,
"mean_token_accuracy": 0.2243235483765602,
"num_tokens": 13207610.0,
"step": 6415
},
{
"entropy": 5.660505294799805,
"epoch": 5.696848646249445,
"grad_norm": 1.2265625,
"learning_rate": 0.00025511544301478294,
"loss": 5.026,
"mean_token_accuracy": 0.2201002851128578,
"num_tokens": 13217436.0,
"step": 6420
},
{
"entropy": 5.70370454788208,
"epoch": 5.701287172658677,
"grad_norm": 1.2890625,
"learning_rate": 0.0002547723414265361,
"loss": 5.1099,
"mean_token_accuracy": 0.21733487248420716,
"num_tokens": 13228309.0,
"step": 6425
},
{
"entropy": 5.684768295288086,
"epoch": 5.7057256990679095,
"grad_norm": 1.15625,
"learning_rate": 0.0002544292872505388,
"loss": 4.9975,
"mean_token_accuracy": 0.21937978714704515,
"num_tokens": 13239109.0,
"step": 6430
},
{
"entropy": 5.662685775756836,
"epoch": 5.710164225477142,
"grad_norm": 1.2421875,
"learning_rate": 0.0002540862812908868,
"loss": 5.0534,
"mean_token_accuracy": 0.22029348760843276,
"num_tokens": 13250000.0,
"step": 6435
},
{
"entropy": 5.609535360336304,
"epoch": 5.714602751886374,
"grad_norm": 1.34375,
"learning_rate": 0.00025374332435156244,
"loss": 4.9416,
"mean_token_accuracy": 0.2313062146306038,
"num_tokens": 13259866.0,
"step": 6440
},
{
"entropy": 5.75750241279602,
"epoch": 5.719041278295606,
"grad_norm": 1.25,
"learning_rate": 0.00025340041723643337,
"loss": 5.1141,
"mean_token_accuracy": 0.21256275922060014,
"num_tokens": 13271362.0,
"step": 6445
},
{
"entropy": 5.719785213470459,
"epoch": 5.723479804704838,
"grad_norm": 1.1484375,
"learning_rate": 0.00025305756074925047,
"loss": 4.9946,
"mean_token_accuracy": 0.2274504005908966,
"num_tokens": 13281301.0,
"step": 6450
},
{
"entropy": 5.620000314712525,
"epoch": 5.72791833111407,
"grad_norm": 1.28125,
"learning_rate": 0.00025271475569364586,
"loss": 5.0276,
"mean_token_accuracy": 0.22291718572378158,
"num_tokens": 13291027.0,
"step": 6455
},
{
"entropy": 5.663481092453003,
"epoch": 5.732356857523302,
"grad_norm": 1.109375,
"learning_rate": 0.00025237200287313137,
"loss": 5.0262,
"mean_token_accuracy": 0.22112659811973573,
"num_tokens": 13302115.0,
"step": 6460
},
{
"entropy": 5.692264604568481,
"epoch": 5.7367953839325345,
"grad_norm": 1.3046875,
"learning_rate": 0.00025202930309109597,
"loss": 4.9641,
"mean_token_accuracy": 0.21913922280073167,
"num_tokens": 13310881.0,
"step": 6465
},
{
"entropy": 5.692331790924072,
"epoch": 5.741233910341767,
"grad_norm": 1.265625,
"learning_rate": 0.00025168665715080463,
"loss": 5.023,
"mean_token_accuracy": 0.22164955586194993,
"num_tokens": 13321205.0,
"step": 6470
},
{
"entropy": 5.639096593856811,
"epoch": 5.745672436750999,
"grad_norm": 1.3203125,
"learning_rate": 0.00025134406585539603,
"loss": 4.9374,
"mean_token_accuracy": 0.22749236226081848,
"num_tokens": 13330719.0,
"step": 6475
},
{
"entropy": 5.630515432357788,
"epoch": 5.750110963160231,
"grad_norm": 1.234375,
"learning_rate": 0.0002510015300078808,
"loss": 4.9898,
"mean_token_accuracy": 0.22950752973556518,
"num_tokens": 13340637.0,
"step": 6480
},
{
"entropy": 5.60786190032959,
"epoch": 5.754549489569463,
"grad_norm": 1.2578125,
"learning_rate": 0.0002506590504111394,
"loss": 4.9795,
"mean_token_accuracy": 0.23011483550071715,
"num_tokens": 13351614.0,
"step": 6485
},
{
"entropy": 5.668804073333741,
"epoch": 5.758988015978695,
"grad_norm": 1.3515625,
"learning_rate": 0.0002503166278679207,
"loss": 4.9276,
"mean_token_accuracy": 0.2333003029227257,
"num_tokens": 13360674.0,
"step": 6490
},
{
"entropy": 5.683562183380127,
"epoch": 5.763426542387927,
"grad_norm": 1.3359375,
"learning_rate": 0.0002499742631808398,
"loss": 4.9955,
"mean_token_accuracy": 0.22023021876811982,
"num_tokens": 13369766.0,
"step": 6495
},
{
"entropy": 5.62109260559082,
"epoch": 5.7678650687971595,
"grad_norm": 1.21875,
"learning_rate": 0.000249631957152376,
"loss": 5.0218,
"mean_token_accuracy": 0.21475125700235367,
"num_tokens": 13380343.0,
"step": 6500
},
{
"epoch": 5.7678650687971595,
"eval_entropy": 5.407964576168468,
"eval_loss": 5.782175064086914,
"eval_mean_token_accuracy": 0.1802773434412168,
"eval_num_tokens": 13380343.0,
"eval_runtime": 2.0862,
"eval_samples_per_second": 1613.953,
"eval_steps_per_second": 201.804,
"step": 6500
},
{
"entropy": 5.584969186782837,
"epoch": 5.772303595206392,
"grad_norm": 1.3046875,
"learning_rate": 0.0002492897105848714,
"loss": 4.98,
"mean_token_accuracy": 0.22692383378744124,
"num_tokens": 13389321.0,
"step": 6505
},
{
"entropy": 5.726426792144776,
"epoch": 5.776742121615624,
"grad_norm": 1.2421875,
"learning_rate": 0.00024894752428052846,
"loss": 5.0393,
"mean_token_accuracy": 0.21606299877166749,
"num_tokens": 13399962.0,
"step": 6510
},
{
"entropy": 5.56514983177185,
"epoch": 5.781180648024856,
"grad_norm": 1.1171875,
"learning_rate": 0.00024860539904140853,
"loss": 4.8783,
"mean_token_accuracy": 0.24556800127029418,
"num_tokens": 13411272.0,
"step": 6515
},
{
"entropy": 5.647047424316407,
"epoch": 5.785619174434088,
"grad_norm": 1.234375,
"learning_rate": 0.00024826333566942995,
"loss": 4.9628,
"mean_token_accuracy": 0.2233626127243042,
"num_tokens": 13421332.0,
"step": 6520
},
{
"entropy": 5.62768177986145,
"epoch": 5.79005770084332,
"grad_norm": 1.25,
"learning_rate": 0.00024792133496636553,
"loss": 5.0542,
"mean_token_accuracy": 0.2192031517624855,
"num_tokens": 13431984.0,
"step": 6525
},
{
"entropy": 5.647650861740113,
"epoch": 5.794496227252552,
"grad_norm": 1.1953125,
"learning_rate": 0.00024757939773384184,
"loss": 4.9519,
"mean_token_accuracy": 0.23061719238758088,
"num_tokens": 13441565.0,
"step": 6530
},
{
"entropy": 5.641554975509644,
"epoch": 5.798934753661785,
"grad_norm": 1.171875,
"learning_rate": 0.00024723752477333625,
"loss": 4.9632,
"mean_token_accuracy": 0.2289481893181801,
"num_tokens": 13451950.0,
"step": 6535
},
{
"entropy": 5.621675825119018,
"epoch": 5.803373280071017,
"grad_norm": 1.3125,
"learning_rate": 0.0002468957168861758,
"loss": 5.0089,
"mean_token_accuracy": 0.22343629747629165,
"num_tokens": 13461382.0,
"step": 6540
},
{
"entropy": 5.665220546722412,
"epoch": 5.807811806480249,
"grad_norm": 1.3828125,
"learning_rate": 0.0002465539748735346,
"loss": 5.006,
"mean_token_accuracy": 0.22176862955093385,
"num_tokens": 13470402.0,
"step": 6545
},
{
"entropy": 5.71075325012207,
"epoch": 5.812250332889481,
"grad_norm": 1.34375,
"learning_rate": 0.0002462122995364327,
"loss": 4.9876,
"mean_token_accuracy": 0.22950772643089296,
"num_tokens": 13480272.0,
"step": 6550
},
{
"entropy": 5.701600456237793,
"epoch": 5.816688859298713,
"grad_norm": 1.234375,
"learning_rate": 0.0002458706916757338,
"loss": 5.059,
"mean_token_accuracy": 0.2181694835424423,
"num_tokens": 13491366.0,
"step": 6555
},
{
"entropy": 5.66182165145874,
"epoch": 5.821127385707945,
"grad_norm": 1.328125,
"learning_rate": 0.00024552915209214327,
"loss": 5.1043,
"mean_token_accuracy": 0.21448306888341903,
"num_tokens": 13501887.0,
"step": 6560
},
{
"entropy": 5.631567716598511,
"epoch": 5.8255659121171774,
"grad_norm": 1.5,
"learning_rate": 0.00024518768158620654,
"loss": 5.0124,
"mean_token_accuracy": 0.22701208740472795,
"num_tokens": 13512254.0,
"step": 6565
},
{
"entropy": 5.75889220237732,
"epoch": 5.83000443852641,
"grad_norm": 1.3125,
"learning_rate": 0.0002448462809583072,
"loss": 5.0506,
"mean_token_accuracy": 0.2189397171139717,
"num_tokens": 13522082.0,
"step": 6570
},
{
"entropy": 5.705504655838013,
"epoch": 5.834442964935642,
"grad_norm": 1.2890625,
"learning_rate": 0.000244504951008665,
"loss": 5.0196,
"mean_token_accuracy": 0.22250390648841858,
"num_tokens": 13531879.0,
"step": 6575
},
{
"entropy": 5.679951810836792,
"epoch": 5.838881491344874,
"grad_norm": 1.28125,
"learning_rate": 0.00024416369253733405,
"loss": 5.1403,
"mean_token_accuracy": 0.21508430540561677,
"num_tokens": 13543089.0,
"step": 6580
},
{
"entropy": 5.677362966537475,
"epoch": 5.843320017754106,
"grad_norm": 1.328125,
"learning_rate": 0.00024382250634420085,
"loss": 4.9994,
"mean_token_accuracy": 0.22156949639320372,
"num_tokens": 13553677.0,
"step": 6585
},
{
"entropy": 5.660028409957886,
"epoch": 5.847758544163337,
"grad_norm": 1.15625,
"learning_rate": 0.0002434813932289825,
"loss": 5.0117,
"mean_token_accuracy": 0.22413584291934968,
"num_tokens": 13564787.0,
"step": 6590
},
{
"entropy": 5.7271475315094,
"epoch": 5.85219707057257,
"grad_norm": 1.2109375,
"learning_rate": 0.00024314035399122485,
"loss": 5.0934,
"mean_token_accuracy": 0.21186063587665557,
"num_tokens": 13575382.0,
"step": 6595
},
{
"entropy": 5.598541164398194,
"epoch": 5.856635596981802,
"grad_norm": 1.234375,
"learning_rate": 0.00024279938943030073,
"loss": 4.9572,
"mean_token_accuracy": 0.22869121432304382,
"num_tokens": 13585213.0,
"step": 6600
},
{
"entropy": 5.6470095157623295,
"epoch": 5.861074123391035,
"grad_norm": 1.2265625,
"learning_rate": 0.0002424585003454075,
"loss": 5.0741,
"mean_token_accuracy": 0.21848224103450775,
"num_tokens": 13595305.0,
"step": 6605
},
{
"entropy": 5.72409954071045,
"epoch": 5.865512649800266,
"grad_norm": 1.2734375,
"learning_rate": 0.00024211768753556602,
"loss": 5.1366,
"mean_token_accuracy": 0.21125885993242263,
"num_tokens": 13605988.0,
"step": 6610
},
{
"entropy": 5.680611324310303,
"epoch": 5.869951176209499,
"grad_norm": 1.375,
"learning_rate": 0.00024177695179961823,
"loss": 4.9716,
"mean_token_accuracy": 0.23375285118818284,
"num_tokens": 13615279.0,
"step": 6615
},
{
"entropy": 5.692046737670898,
"epoch": 5.87438970261873,
"grad_norm": 1.4375,
"learning_rate": 0.00024143629393622541,
"loss": 5.0182,
"mean_token_accuracy": 0.2263980969786644,
"num_tokens": 13624837.0,
"step": 6620
},
{
"entropy": 5.699664449691772,
"epoch": 5.878828229027963,
"grad_norm": 1.2578125,
"learning_rate": 0.00024109571474386631,
"loss": 5.164,
"mean_token_accuracy": 0.20575061440467834,
"num_tokens": 13635695.0,
"step": 6625
},
{
"entropy": 5.673453092575073,
"epoch": 5.8832667554371945,
"grad_norm": 1.375,
"learning_rate": 0.00024075521502083525,
"loss": 4.9855,
"mean_token_accuracy": 0.22787272781133652,
"num_tokens": 13645631.0,
"step": 6630
},
{
"entropy": 5.693185091018677,
"epoch": 5.887705281846427,
"grad_norm": 1.2265625,
"learning_rate": 0.00024041479556524044,
"loss": 5.0198,
"mean_token_accuracy": 0.22435105293989183,
"num_tokens": 13657008.0,
"step": 6635
},
{
"entropy": 5.682106876373291,
"epoch": 5.892143808255659,
"grad_norm": 1.34375,
"learning_rate": 0.00024007445717500175,
"loss": 4.9906,
"mean_token_accuracy": 0.22617370635271072,
"num_tokens": 13666436.0,
"step": 6640
},
{
"entropy": 5.6378443241119385,
"epoch": 5.896582334664891,
"grad_norm": 1.2109375,
"learning_rate": 0.00023973420064784908,
"loss": 4.9667,
"mean_token_accuracy": 0.2313501387834549,
"num_tokens": 13677533.0,
"step": 6645
},
{
"entropy": 5.637309503555298,
"epoch": 5.901020861074123,
"grad_norm": 1.328125,
"learning_rate": 0.00023939402678132044,
"loss": 5.0153,
"mean_token_accuracy": 0.22506245523691176,
"num_tokens": 13688965.0,
"step": 6650
},
{
"entropy": 5.590819215774536,
"epoch": 5.905459387483355,
"grad_norm": 1.3046875,
"learning_rate": 0.00023905393637276018,
"loss": 4.8899,
"mean_token_accuracy": 0.23322740644216539,
"num_tokens": 13699025.0,
"step": 6655
},
{
"entropy": 5.649019622802735,
"epoch": 5.909897913892587,
"grad_norm": 1.34375,
"learning_rate": 0.0002387139302193171,
"loss": 5.0254,
"mean_token_accuracy": 0.2191639542579651,
"num_tokens": 13708922.0,
"step": 6660
},
{
"entropy": 5.6550849914550785,
"epoch": 5.9143364403018195,
"grad_norm": 1.2890625,
"learning_rate": 0.00023837400911794215,
"loss": 4.9824,
"mean_token_accuracy": 0.22595618963241576,
"num_tokens": 13718921.0,
"step": 6665
},
{
"entropy": 5.743515682220459,
"epoch": 5.918774966711052,
"grad_norm": 1.1953125,
"learning_rate": 0.0002380341738653874,
"loss": 5.1055,
"mean_token_accuracy": 0.2134455546736717,
"num_tokens": 13729921.0,
"step": 6670
},
{
"entropy": 5.599254369735718,
"epoch": 5.923213493120284,
"grad_norm": 1.3125,
"learning_rate": 0.00023769442525820334,
"loss": 4.9852,
"mean_token_accuracy": 0.22476375699043274,
"num_tokens": 13739620.0,
"step": 6675
},
{
"entropy": 5.607891178131103,
"epoch": 5.927652019529516,
"grad_norm": 1.4453125,
"learning_rate": 0.0002373547640927375,
"loss": 5.0571,
"mean_token_accuracy": 0.22019446194171904,
"num_tokens": 13749229.0,
"step": 6680
},
{
"entropy": 5.659670448303222,
"epoch": 5.932090545938748,
"grad_norm": 1.3671875,
"learning_rate": 0.00023701519116513253,
"loss": 4.9967,
"mean_token_accuracy": 0.22971152812242507,
"num_tokens": 13759610.0,
"step": 6685
},
{
"entropy": 5.695259475708008,
"epoch": 5.93652907234798,
"grad_norm": 1.15625,
"learning_rate": 0.00023667570727132405,
"loss": 4.9922,
"mean_token_accuracy": 0.22517374008893967,
"num_tokens": 13769907.0,
"step": 6690
},
{
"entropy": 5.684794235229492,
"epoch": 5.940967598757212,
"grad_norm": 1.2890625,
"learning_rate": 0.00023633631320703918,
"loss": 5.0675,
"mean_token_accuracy": 0.2160962328314781,
"num_tokens": 13779982.0,
"step": 6695
},
{
"entropy": 5.639357566833496,
"epoch": 5.9454061251664445,
"grad_norm": 1.25,
"learning_rate": 0.00023599700976779432,
"loss": 5.043,
"mean_token_accuracy": 0.21850094348192214,
"num_tokens": 13789771.0,
"step": 6700
},
{
"entropy": 5.628429841995239,
"epoch": 5.949844651575677,
"grad_norm": 1.4609375,
"learning_rate": 0.00023565779774889367,
"loss": 4.9659,
"mean_token_accuracy": 0.2278966560959816,
"num_tokens": 13800205.0,
"step": 6705
},
{
"entropy": 5.6213545322418215,
"epoch": 5.954283177984909,
"grad_norm": 1.3671875,
"learning_rate": 0.00023531867794542694,
"loss": 4.9304,
"mean_token_accuracy": 0.22960940152406692,
"num_tokens": 13810745.0,
"step": 6710
},
{
"entropy": 5.568739891052246,
"epoch": 5.958721704394141,
"grad_norm": 1.2109375,
"learning_rate": 0.00023497965115226794,
"loss": 4.9683,
"mean_token_accuracy": 0.2309238538146019,
"num_tokens": 13820775.0,
"step": 6715
},
{
"entropy": 5.683120155334473,
"epoch": 5.963160230803373,
"grad_norm": 1.1640625,
"learning_rate": 0.00023464071816407206,
"loss": 5.0246,
"mean_token_accuracy": 0.22314121723175048,
"num_tokens": 13831654.0,
"step": 6720
},
{
"entropy": 5.650092029571534,
"epoch": 5.967598757212605,
"grad_norm": 1.265625,
"learning_rate": 0.00023430187977527533,
"loss": 5.0141,
"mean_token_accuracy": 0.22444996535778045,
"num_tokens": 13841596.0,
"step": 6725
},
{
"entropy": 5.697477531433106,
"epoch": 5.972037283621837,
"grad_norm": 1.2578125,
"learning_rate": 0.00023396313678009158,
"loss": 5.0705,
"mean_token_accuracy": 0.2211512729525566,
"num_tokens": 13852000.0,
"step": 6730
},
{
"entropy": 5.647402238845825,
"epoch": 5.9764758100310695,
"grad_norm": 1.3671875,
"learning_rate": 0.00023362448997251128,
"loss": 4.9566,
"mean_token_accuracy": 0.2314678579568863,
"num_tokens": 13861778.0,
"step": 6735
},
{
"entropy": 5.721929597854614,
"epoch": 5.980914336440302,
"grad_norm": 1.1640625,
"learning_rate": 0.00023328594014629945,
"loss": 5.117,
"mean_token_accuracy": 0.2070889353752136,
"num_tokens": 13873480.0,
"step": 6740
},
{
"entropy": 5.716448974609375,
"epoch": 5.985352862849534,
"grad_norm": 1.2734375,
"learning_rate": 0.0002329474880949937,
"loss": 5.0325,
"mean_token_accuracy": 0.22087830156087876,
"num_tokens": 13884072.0,
"step": 6745
},
{
"entropy": 5.689628601074219,
"epoch": 5.989791389258766,
"grad_norm": 1.296875,
"learning_rate": 0.0002326091346119026,
"loss": 4.9494,
"mean_token_accuracy": 0.23061742037534713,
"num_tokens": 13893968.0,
"step": 6750
},
{
"entropy": 5.630706739425659,
"epoch": 5.994229915667998,
"grad_norm": 1.265625,
"learning_rate": 0.0002322708804901036,
"loss": 4.994,
"mean_token_accuracy": 0.22329082787036897,
"num_tokens": 13904929.0,
"step": 6755
},
{
"entropy": 5.6796722412109375,
"epoch": 5.99866844207723,
"grad_norm": 1.3671875,
"learning_rate": 0.00023193272652244113,
"loss": 5.1024,
"mean_token_accuracy": 0.21085811257362366,
"num_tokens": 13915694.0,
"step": 6760
},
{
"entropy": 5.692179414961073,
"epoch": 6.0026631158455395,
"grad_norm": 1.2109375,
"learning_rate": 0.00023159467350152515,
"loss": 4.8489,
"mean_token_accuracy": 0.23016820516851214,
"num_tokens": 13924820.0,
"step": 6765
},
{
"entropy": 5.666901588439941,
"epoch": 6.007101642254772,
"grad_norm": 1.1953125,
"learning_rate": 0.00023125672221972865,
"loss": 4.9123,
"mean_token_accuracy": 0.2299010157585144,
"num_tokens": 13934479.0,
"step": 6770
},
{
"entropy": 5.616270542144775,
"epoch": 6.011540168664004,
"grad_norm": 1.1953125,
"learning_rate": 0.0002309188734691865,
"loss": 4.8134,
"mean_token_accuracy": 0.2453361839056015,
"num_tokens": 13943992.0,
"step": 6775
},
{
"entropy": 5.675692939758301,
"epoch": 6.015978695073236,
"grad_norm": 1.375,
"learning_rate": 0.00023058112804179298,
"loss": 4.8678,
"mean_token_accuracy": 0.23117896914482117,
"num_tokens": 13953227.0,
"step": 6780
},
{
"entropy": 5.601825332641601,
"epoch": 6.020417221482468,
"grad_norm": 1.328125,
"learning_rate": 0.0002302434867292003,
"loss": 4.7923,
"mean_token_accuracy": 0.2510546937584877,
"num_tokens": 13962801.0,
"step": 6785
},
{
"entropy": 5.6510995388031,
"epoch": 6.0248557478917,
"grad_norm": 1.28125,
"learning_rate": 0.00022990595032281675,
"loss": 4.8471,
"mean_token_accuracy": 0.2332788363099098,
"num_tokens": 13972875.0,
"step": 6790
},
{
"entropy": 5.633752536773682,
"epoch": 6.029294274300932,
"grad_norm": 1.21875,
"learning_rate": 0.0002295685196138045,
"loss": 4.8729,
"mean_token_accuracy": 0.23518357425928116,
"num_tokens": 13983064.0,
"step": 6795
},
{
"entropy": 5.6549684524536135,
"epoch": 6.0337328007101645,
"grad_norm": 1.1953125,
"learning_rate": 0.00022923119539307806,
"loss": 4.8019,
"mean_token_accuracy": 0.24193447679281235,
"num_tokens": 13993912.0,
"step": 6800
},
{
"entropy": 5.6357931137084964,
"epoch": 6.038171327119397,
"grad_norm": 1.171875,
"learning_rate": 0.00022889397845130254,
"loss": 4.8466,
"mean_token_accuracy": 0.24493976086378097,
"num_tokens": 14004731.0,
"step": 6805
},
{
"entropy": 5.654474878311158,
"epoch": 6.042609853528629,
"grad_norm": 1.2421875,
"learning_rate": 0.00022855686957889116,
"loss": 4.9095,
"mean_token_accuracy": 0.23571256697177886,
"num_tokens": 14015260.0,
"step": 6810
},
{
"entropy": 5.693507862091065,
"epoch": 6.047048379937861,
"grad_norm": 1.2109375,
"learning_rate": 0.0002282198695660042,
"loss": 4.835,
"mean_token_accuracy": 0.23543342649936677,
"num_tokens": 14025598.0,
"step": 6815
},
{
"entropy": 5.665556144714356,
"epoch": 6.051486906347093,
"grad_norm": 1.328125,
"learning_rate": 0.00022788297920254663,
"loss": 4.8342,
"mean_token_accuracy": 0.2411949336528778,
"num_tokens": 14036058.0,
"step": 6820
},
{
"entropy": 5.634428071975708,
"epoch": 6.055925432756325,
"grad_norm": 1.15625,
"learning_rate": 0.0002275461992781665,
"loss": 4.8578,
"mean_token_accuracy": 0.2349405601620674,
"num_tokens": 14046181.0,
"step": 6825
},
{
"entropy": 5.765952777862549,
"epoch": 6.060363959165557,
"grad_norm": 1.265625,
"learning_rate": 0.00022720953058225286,
"loss": 4.916,
"mean_token_accuracy": 0.22795970290899276,
"num_tokens": 14056891.0,
"step": 6830
},
{
"entropy": 5.662580060958862,
"epoch": 6.0648024855747895,
"grad_norm": 1.3828125,
"learning_rate": 0.00022687297390393426,
"loss": 4.8952,
"mean_token_accuracy": 0.23405720591545104,
"num_tokens": 14065753.0,
"step": 6835
},
{
"entropy": 5.625827646255493,
"epoch": 6.069241011984022,
"grad_norm": 1.375,
"learning_rate": 0.00022653653003207642,
"loss": 4.8419,
"mean_token_accuracy": 0.23657547682523727,
"num_tokens": 14075923.0,
"step": 6840
},
{
"entropy": 5.643268251419068,
"epoch": 6.073679538393254,
"grad_norm": 1.2265625,
"learning_rate": 0.0002262001997552809,
"loss": 4.8538,
"mean_token_accuracy": 0.2408415660262108,
"num_tokens": 14085359.0,
"step": 6845
},
{
"entropy": 5.700117111206055,
"epoch": 6.078118064802486,
"grad_norm": 1.2890625,
"learning_rate": 0.00022586398386188278,
"loss": 4.961,
"mean_token_accuracy": 0.2297465369105339,
"num_tokens": 14096061.0,
"step": 6850
},
{
"entropy": 5.676120615005493,
"epoch": 6.082556591211718,
"grad_norm": 1.125,
"learning_rate": 0.00022552788313994922,
"loss": 4.9442,
"mean_token_accuracy": 0.23140277862548828,
"num_tokens": 14107077.0,
"step": 6855
},
{
"entropy": 5.717546367645264,
"epoch": 6.08699511762095,
"grad_norm": 1.4296875,
"learning_rate": 0.00022519189837727727,
"loss": 4.8767,
"mean_token_accuracy": 0.24003577083349228,
"num_tokens": 14117493.0,
"step": 6860
},
{
"entropy": 5.621216297149658,
"epoch": 6.091433644030182,
"grad_norm": 1.171875,
"learning_rate": 0.00022485603036139236,
"loss": 4.8463,
"mean_token_accuracy": 0.24116085171699525,
"num_tokens": 14128048.0,
"step": 6865
},
{
"entropy": 5.609436750411987,
"epoch": 6.0958721704394145,
"grad_norm": 1.234375,
"learning_rate": 0.0002245202798795461,
"loss": 4.918,
"mean_token_accuracy": 0.23105758875608445,
"num_tokens": 14137743.0,
"step": 6870
},
{
"entropy": 5.683057594299316,
"epoch": 6.100310696848647,
"grad_norm": 1.265625,
"learning_rate": 0.00022418464771871473,
"loss": 4.9015,
"mean_token_accuracy": 0.23463036864995956,
"num_tokens": 14148607.0,
"step": 6875
},
{
"entropy": 5.664183139801025,
"epoch": 6.104749223257878,
"grad_norm": 1.1953125,
"learning_rate": 0.00022384913466559704,
"loss": 4.8985,
"mean_token_accuracy": 0.23701905459165573,
"num_tokens": 14159000.0,
"step": 6880
},
{
"entropy": 5.639634990692139,
"epoch": 6.10918774966711,
"grad_norm": 1.2890625,
"learning_rate": 0.0002235137415066128,
"loss": 4.82,
"mean_token_accuracy": 0.24064428955316544,
"num_tokens": 14169358.0,
"step": 6885
},
{
"entropy": 5.665800952911377,
"epoch": 6.113626276076342,
"grad_norm": 1.3359375,
"learning_rate": 0.0002231784690279005,
"loss": 4.8579,
"mean_token_accuracy": 0.23416383415460587,
"num_tokens": 14179183.0,
"step": 6890
},
{
"entropy": 5.708160400390625,
"epoch": 6.118064802485574,
"grad_norm": 1.21875,
"learning_rate": 0.0002228433180153161,
"loss": 4.948,
"mean_token_accuracy": 0.23335806876420975,
"num_tokens": 14189984.0,
"step": 6895
},
{
"entropy": 5.732094764709473,
"epoch": 6.1225033288948065,
"grad_norm": 1.140625,
"learning_rate": 0.0002225082892544305,
"loss": 4.9469,
"mean_token_accuracy": 0.23224007040262223,
"num_tokens": 14200926.0,
"step": 6900
},
{
"entropy": 5.557865715026855,
"epoch": 6.126941855304039,
"grad_norm": 1.4375,
"learning_rate": 0.0002221733835305283,
"loss": 4.8578,
"mean_token_accuracy": 0.23204921036958695,
"num_tokens": 14210234.0,
"step": 6905
},
{
"entropy": 5.569741487503052,
"epoch": 6.131380381713271,
"grad_norm": 1.2578125,
"learning_rate": 0.00022183860162860568,
"loss": 4.8321,
"mean_token_accuracy": 0.23886339515447616,
"num_tokens": 14219657.0,
"step": 6910
},
{
"entropy": 5.658196544647216,
"epoch": 6.135818908122503,
"grad_norm": 1.3125,
"learning_rate": 0.00022150394433336857,
"loss": 4.8518,
"mean_token_accuracy": 0.24155458062887192,
"num_tokens": 14229670.0,
"step": 6915
},
{
"entropy": 5.683429384231568,
"epoch": 6.140257434531735,
"grad_norm": 1.3359375,
"learning_rate": 0.00022116941242923067,
"loss": 4.8616,
"mean_token_accuracy": 0.23926016241312026,
"num_tokens": 14240647.0,
"step": 6920
},
{
"entropy": 5.687435626983643,
"epoch": 6.144695960940967,
"grad_norm": 1.5,
"learning_rate": 0.00022083500670031208,
"loss": 4.9326,
"mean_token_accuracy": 0.22271257191896437,
"num_tokens": 14250780.0,
"step": 6925
},
{
"entropy": 5.650713872909546,
"epoch": 6.149134487350199,
"grad_norm": 1.34375,
"learning_rate": 0.0002205007279304368,
"loss": 4.8902,
"mean_token_accuracy": 0.23237428516149522,
"num_tokens": 14260103.0,
"step": 6930
},
{
"entropy": 5.616778898239136,
"epoch": 6.1535730137594316,
"grad_norm": 1.0859375,
"learning_rate": 0.00022016657690313151,
"loss": 4.8788,
"mean_token_accuracy": 0.23531609922647476,
"num_tokens": 14271279.0,
"step": 6935
},
{
"entropy": 5.657024240493774,
"epoch": 6.158011540168664,
"grad_norm": 1.265625,
"learning_rate": 0.00021983255440162337,
"loss": 4.8206,
"mean_token_accuracy": 0.23231412321329117,
"num_tokens": 14283616.0,
"step": 6940
},
{
"entropy": 5.593470096588135,
"epoch": 6.162450066577896,
"grad_norm": 1.2734375,
"learning_rate": 0.00021949866120883832,
"loss": 4.8775,
"mean_token_accuracy": 0.23365422189235688,
"num_tokens": 14294364.0,
"step": 6945
},
{
"entropy": 5.707459211349487,
"epoch": 6.166888592987128,
"grad_norm": 1.4375,
"learning_rate": 0.0002191648981073992,
"loss": 4.9597,
"mean_token_accuracy": 0.2304862216114998,
"num_tokens": 14304719.0,
"step": 6950
},
{
"entropy": 5.694037342071534,
"epoch": 6.17132711939636,
"grad_norm": 1.34375,
"learning_rate": 0.00021883126587962393,
"loss": 4.9022,
"mean_token_accuracy": 0.2382871016860008,
"num_tokens": 14315802.0,
"step": 6955
},
{
"entropy": 5.64510407447815,
"epoch": 6.175765645805592,
"grad_norm": 1.4921875,
"learning_rate": 0.00021849776530752352,
"loss": 4.8146,
"mean_token_accuracy": 0.24049257338047028,
"num_tokens": 14325612.0,
"step": 6960
},
{
"entropy": 5.609499311447143,
"epoch": 6.180204172214824,
"grad_norm": 1.2265625,
"learning_rate": 0.0002181643971728008,
"loss": 4.8274,
"mean_token_accuracy": 0.24286553859710694,
"num_tokens": 14336104.0,
"step": 6965
},
{
"entropy": 5.629146242141724,
"epoch": 6.184642698624057,
"grad_norm": 1.25,
"learning_rate": 0.00021783116225684756,
"loss": 4.9035,
"mean_token_accuracy": 0.23919736891984938,
"num_tokens": 14346339.0,
"step": 6970
},
{
"entropy": 5.579304122924805,
"epoch": 6.189081225033289,
"grad_norm": 1.234375,
"learning_rate": 0.00021749806134074395,
"loss": 4.8422,
"mean_token_accuracy": 0.24013746976852418,
"num_tokens": 14357101.0,
"step": 6975
},
{
"entropy": 5.669518184661865,
"epoch": 6.193519751442521,
"grad_norm": 1.3515625,
"learning_rate": 0.00021716509520525564,
"loss": 4.9278,
"mean_token_accuracy": 0.22939721792936324,
"num_tokens": 14366712.0,
"step": 6980
},
{
"entropy": 5.678557634353638,
"epoch": 6.197958277851753,
"grad_norm": 1.2734375,
"learning_rate": 0.00021683226463083238,
"loss": 4.974,
"mean_token_accuracy": 0.2297002613544464,
"num_tokens": 14377920.0,
"step": 6985
},
{
"entropy": 5.657860898971558,
"epoch": 6.202396804260985,
"grad_norm": 1.4453125,
"learning_rate": 0.0002164995703976066,
"loss": 4.8676,
"mean_token_accuracy": 0.2351352483034134,
"num_tokens": 14387005.0,
"step": 6990
},
{
"entropy": 5.639587545394898,
"epoch": 6.206835330670217,
"grad_norm": 1.375,
"learning_rate": 0.00021616701328539057,
"loss": 4.8971,
"mean_token_accuracy": 0.23374675512313842,
"num_tokens": 14396201.0,
"step": 6995
},
{
"entropy": 5.607171297073364,
"epoch": 6.2112738570794495,
"grad_norm": 1.296875,
"learning_rate": 0.00021583459407367557,
"loss": 4.8544,
"mean_token_accuracy": 0.23507434725761414,
"num_tokens": 14406481.0,
"step": 7000
},
{
"epoch": 6.2112738570794495,
"eval_entropy": 5.412511341928586,
"eval_loss": 5.790064334869385,
"eval_mean_token_accuracy": 0.18045707795583155,
"eval_num_tokens": 14406481.0,
"eval_runtime": 2.0827,
"eval_samples_per_second": 1616.643,
"eval_steps_per_second": 202.14,
"step": 7000
},
{
"entropy": 5.615001440048218,
"epoch": 6.215712383488682,
"grad_norm": 1.3671875,
"learning_rate": 0.00021550231354162957,
"loss": 4.9424,
"mean_token_accuracy": 0.22658960223197938,
"num_tokens": 14416624.0,
"step": 7005
},
{
"entropy": 5.713114929199219,
"epoch": 6.220150909897914,
"grad_norm": 1.1875,
"learning_rate": 0.0002151701724680952,
"loss": 4.9738,
"mean_token_accuracy": 0.22456389367580415,
"num_tokens": 14427962.0,
"step": 7010
},
{
"entropy": 5.660664367675781,
"epoch": 6.224589436307146,
"grad_norm": 1.359375,
"learning_rate": 0.00021483817163158876,
"loss": 4.8579,
"mean_token_accuracy": 0.23523758053779603,
"num_tokens": 14437472.0,
"step": 7015
},
{
"entropy": 5.642330932617187,
"epoch": 6.229027962716378,
"grad_norm": 1.3046875,
"learning_rate": 0.00021450631181029733,
"loss": 4.8862,
"mean_token_accuracy": 0.2419634908437729,
"num_tokens": 14447642.0,
"step": 7020
},
{
"entropy": 5.627429723739624,
"epoch": 6.23346648912561,
"grad_norm": 1.2265625,
"learning_rate": 0.0002141745937820776,
"loss": 4.8557,
"mean_token_accuracy": 0.23747613430023193,
"num_tokens": 14457877.0,
"step": 7025
},
{
"entropy": 5.695980024337769,
"epoch": 6.237905015534842,
"grad_norm": 1.375,
"learning_rate": 0.0002138430183244542,
"loss": 4.9587,
"mean_token_accuracy": 0.218131722509861,
"num_tokens": 14467954.0,
"step": 7030
},
{
"entropy": 5.681252717971802,
"epoch": 6.2423435419440745,
"grad_norm": 1.3828125,
"learning_rate": 0.00021351158621461707,
"loss": 4.8773,
"mean_token_accuracy": 0.23452190905809403,
"num_tokens": 14478430.0,
"step": 7035
},
{
"entropy": 5.727174472808838,
"epoch": 6.246782068353307,
"grad_norm": 1.2734375,
"learning_rate": 0.00021318029822942059,
"loss": 4.9696,
"mean_token_accuracy": 0.22943937182426452,
"num_tokens": 14488961.0,
"step": 7040
},
{
"entropy": 5.676918077468872,
"epoch": 6.251220594762539,
"grad_norm": 1.328125,
"learning_rate": 0.00021284915514538128,
"loss": 4.9253,
"mean_token_accuracy": 0.23082171231508256,
"num_tokens": 14499311.0,
"step": 7045
},
{
"entropy": 5.664526510238647,
"epoch": 6.255659121171771,
"grad_norm": 1.3359375,
"learning_rate": 0.0002125181577386756,
"loss": 4.8889,
"mean_token_accuracy": 0.2293272003531456,
"num_tokens": 14509823.0,
"step": 7050
},
{
"entropy": 5.624607181549072,
"epoch": 6.260097647581003,
"grad_norm": 1.21875,
"learning_rate": 0.0002121873067851391,
"loss": 4.8879,
"mean_token_accuracy": 0.23438603281974793,
"num_tokens": 14520591.0,
"step": 7055
},
{
"entropy": 5.639122581481933,
"epoch": 6.264536173990235,
"grad_norm": 1.375,
"learning_rate": 0.00021185660306026366,
"loss": 4.8637,
"mean_token_accuracy": 0.23611437976360322,
"num_tokens": 14529921.0,
"step": 7060
},
{
"entropy": 5.630729007720947,
"epoch": 6.268974700399467,
"grad_norm": 1.328125,
"learning_rate": 0.00021152604733919628,
"loss": 4.8801,
"mean_token_accuracy": 0.23746803402900696,
"num_tokens": 14540809.0,
"step": 7065
},
{
"entropy": 5.625325870513916,
"epoch": 6.2734132268086995,
"grad_norm": 1.171875,
"learning_rate": 0.000211195640396737,
"loss": 4.8364,
"mean_token_accuracy": 0.23659609109163285,
"num_tokens": 14552302.0,
"step": 7070
},
{
"entropy": 5.71686315536499,
"epoch": 6.277851753217932,
"grad_norm": 1.3515625,
"learning_rate": 0.0002108653830073371,
"loss": 4.914,
"mean_token_accuracy": 0.223981074988842,
"num_tokens": 14562520.0,
"step": 7075
},
{
"entropy": 5.585401248931885,
"epoch": 6.282290279627164,
"grad_norm": 1.40625,
"learning_rate": 0.00021053527594509731,
"loss": 4.8052,
"mean_token_accuracy": 0.2348144382238388,
"num_tokens": 14572356.0,
"step": 7080
},
{
"entropy": 5.654277801513672,
"epoch": 6.286728806036396,
"grad_norm": 1.3359375,
"learning_rate": 0.0002102053199837662,
"loss": 4.8697,
"mean_token_accuracy": 0.23135853707790374,
"num_tokens": 14582315.0,
"step": 7085
},
{
"entropy": 5.6194806575775145,
"epoch": 6.291167332445628,
"grad_norm": 1.171875,
"learning_rate": 0.0002098755158967377,
"loss": 4.906,
"mean_token_accuracy": 0.23014334738254547,
"num_tokens": 14593053.0,
"step": 7090
},
{
"entropy": 5.674391412734986,
"epoch": 6.29560585885486,
"grad_norm": 1.2890625,
"learning_rate": 0.00020954586445705027,
"loss": 4.92,
"mean_token_accuracy": 0.23151278197765351,
"num_tokens": 14604325.0,
"step": 7095
},
{
"entropy": 5.639675903320312,
"epoch": 6.300044385264092,
"grad_norm": 1.5546875,
"learning_rate": 0.00020921636643738429,
"loss": 4.8611,
"mean_token_accuracy": 0.2337682381272316,
"num_tokens": 14613827.0,
"step": 7100
},
{
"entropy": 5.595416641235351,
"epoch": 6.3044829116733245,
"grad_norm": 1.265625,
"learning_rate": 0.0002088870226100606,
"loss": 4.8384,
"mean_token_accuracy": 0.242666994035244,
"num_tokens": 14623778.0,
"step": 7105
},
{
"entropy": 5.6498009204864506,
"epoch": 6.308921438082557,
"grad_norm": 1.28125,
"learning_rate": 0.00020855783374703861,
"loss": 4.9455,
"mean_token_accuracy": 0.23030229955911635,
"num_tokens": 14635388.0,
"step": 7110
},
{
"entropy": 5.607757091522217,
"epoch": 6.313359964491789,
"grad_norm": 1.3828125,
"learning_rate": 0.0002082288006199146,
"loss": 4.8515,
"mean_token_accuracy": 0.24223090708255768,
"num_tokens": 14646004.0,
"step": 7115
},
{
"entropy": 5.606477165222168,
"epoch": 6.317798490901021,
"grad_norm": 1.3671875,
"learning_rate": 0.00020789992399991965,
"loss": 4.7971,
"mean_token_accuracy": 0.24364340603351592,
"num_tokens": 14655192.0,
"step": 7120
},
{
"entropy": 5.700380420684814,
"epoch": 6.322237017310253,
"grad_norm": 1.3046875,
"learning_rate": 0.00020757120465791823,
"loss": 4.9447,
"mean_token_accuracy": 0.23280777037143707,
"num_tokens": 14665275.0,
"step": 7125
},
{
"entropy": 5.644902658462525,
"epoch": 6.326675543719485,
"grad_norm": 1.4609375,
"learning_rate": 0.00020724264336440584,
"loss": 4.8422,
"mean_token_accuracy": 0.2432616949081421,
"num_tokens": 14675021.0,
"step": 7130
},
{
"entropy": 5.627721071243286,
"epoch": 6.331114070128717,
"grad_norm": 1.390625,
"learning_rate": 0.00020691424088950782,
"loss": 4.8976,
"mean_token_accuracy": 0.23562218099832535,
"num_tokens": 14684685.0,
"step": 7135
},
{
"entropy": 5.6213939666748045,
"epoch": 6.3355525965379496,
"grad_norm": 1.2890625,
"learning_rate": 0.00020658599800297707,
"loss": 4.8603,
"mean_token_accuracy": 0.23688842058181764,
"num_tokens": 14695224.0,
"step": 7140
},
{
"entropy": 5.573054313659668,
"epoch": 6.339991122947182,
"grad_norm": 1.1875,
"learning_rate": 0.0002062579154741925,
"loss": 4.8881,
"mean_token_accuracy": 0.2448859840631485,
"num_tokens": 14706466.0,
"step": 7145
},
{
"entropy": 5.583721399307251,
"epoch": 6.344429649356414,
"grad_norm": 1.3203125,
"learning_rate": 0.00020592999407215718,
"loss": 4.832,
"mean_token_accuracy": 0.23735189139842988,
"num_tokens": 14716054.0,
"step": 7150
},
{
"entropy": 5.69507098197937,
"epoch": 6.348868175765646,
"grad_norm": 1.4609375,
"learning_rate": 0.00020560223456549638,
"loss": 4.9087,
"mean_token_accuracy": 0.23078093826770782,
"num_tokens": 14727039.0,
"step": 7155
},
{
"entropy": 5.630094718933106,
"epoch": 6.353306702174878,
"grad_norm": 1.234375,
"learning_rate": 0.0002052746377224561,
"loss": 4.8636,
"mean_token_accuracy": 0.23590660691261292,
"num_tokens": 14737713.0,
"step": 7160
},
{
"entropy": 5.601201391220092,
"epoch": 6.35774522858411,
"grad_norm": 1.28125,
"learning_rate": 0.00020494720431090096,
"loss": 4.8156,
"mean_token_accuracy": 0.23504213839769364,
"num_tokens": 14748361.0,
"step": 7165
},
{
"entropy": 5.600072193145752,
"epoch": 6.362183754993342,
"grad_norm": 1.390625,
"learning_rate": 0.00020461993509831238,
"loss": 4.858,
"mean_token_accuracy": 0.2413262441754341,
"num_tokens": 14759074.0,
"step": 7170
},
{
"entropy": 5.715661287307739,
"epoch": 6.366622281402575,
"grad_norm": 1.3125,
"learning_rate": 0.00020429283085178713,
"loss": 4.972,
"mean_token_accuracy": 0.2220981925725937,
"num_tokens": 14769546.0,
"step": 7175
},
{
"entropy": 5.646831226348877,
"epoch": 6.371060807811807,
"grad_norm": 1.421875,
"learning_rate": 0.00020396589233803513,
"loss": 4.9025,
"mean_token_accuracy": 0.23244934827089309,
"num_tokens": 14779150.0,
"step": 7180
},
{
"entropy": 5.639772558212281,
"epoch": 6.375499334221039,
"grad_norm": 1.203125,
"learning_rate": 0.000203639120323378,
"loss": 4.9233,
"mean_token_accuracy": 0.23125887513160706,
"num_tokens": 14791400.0,
"step": 7185
},
{
"entropy": 5.572238826751709,
"epoch": 6.379937860630271,
"grad_norm": 1.3515625,
"learning_rate": 0.0002033125155737471,
"loss": 4.7976,
"mean_token_accuracy": 0.2403891295194626,
"num_tokens": 14801386.0,
"step": 7190
},
{
"entropy": 5.6020301342010494,
"epoch": 6.384376387039503,
"grad_norm": 1.515625,
"learning_rate": 0.0002029860788546814,
"loss": 4.8491,
"mean_token_accuracy": 0.23611615598201752,
"num_tokens": 14810998.0,
"step": 7195
},
{
"entropy": 5.675145769119263,
"epoch": 6.388814913448735,
"grad_norm": 1.34375,
"learning_rate": 0.00020265981093132646,
"loss": 4.8518,
"mean_token_accuracy": 0.23608860820531846,
"num_tokens": 14820792.0,
"step": 7200
},
{
"entropy": 5.657589626312256,
"epoch": 6.3932534398579675,
"grad_norm": 1.3125,
"learning_rate": 0.00020233371256843198,
"loss": 4.9124,
"mean_token_accuracy": 0.24230266064405442,
"num_tokens": 14830399.0,
"step": 7205
},
{
"entropy": 5.629939174652099,
"epoch": 6.3976919662672,
"grad_norm": 1.3828125,
"learning_rate": 0.00020200778453035017,
"loss": 4.9127,
"mean_token_accuracy": 0.23107272684574126,
"num_tokens": 14840425.0,
"step": 7210
},
{
"entropy": 5.71688027381897,
"epoch": 6.402130492676432,
"grad_norm": 1.28125,
"learning_rate": 0.00020168202758103415,
"loss": 4.8756,
"mean_token_accuracy": 0.23498946130275727,
"num_tokens": 14851241.0,
"step": 7215
},
{
"entropy": 5.658588933944702,
"epoch": 6.406569019085664,
"grad_norm": 1.2265625,
"learning_rate": 0.00020135644248403585,
"loss": 4.8872,
"mean_token_accuracy": 0.23236081898212432,
"num_tokens": 14862432.0,
"step": 7220
},
{
"entropy": 5.57954888343811,
"epoch": 6.411007545494896,
"grad_norm": 1.2578125,
"learning_rate": 0.00020103103000250456,
"loss": 4.8924,
"mean_token_accuracy": 0.24108029156923294,
"num_tokens": 14872967.0,
"step": 7225
},
{
"entropy": 5.661067914962769,
"epoch": 6.415446071904128,
"grad_norm": 1.390625,
"learning_rate": 0.000200705790899185,
"loss": 4.958,
"mean_token_accuracy": 0.22953315675258637,
"num_tokens": 14883761.0,
"step": 7230
},
{
"entropy": 5.631343793869019,
"epoch": 6.41988459831336,
"grad_norm": 1.328125,
"learning_rate": 0.0002003807259364152,
"loss": 4.8924,
"mean_token_accuracy": 0.2356957033276558,
"num_tokens": 14893769.0,
"step": 7235
},
{
"entropy": 5.690106344223023,
"epoch": 6.4243231247225925,
"grad_norm": 1.2265625,
"learning_rate": 0.00020005583587612535,
"loss": 4.8853,
"mean_token_accuracy": 0.2385820046067238,
"num_tokens": 14903984.0,
"step": 7240
},
{
"entropy": 5.613562297821045,
"epoch": 6.428761651131825,
"grad_norm": 1.34375,
"learning_rate": 0.00019973112147983563,
"loss": 4.8509,
"mean_token_accuracy": 0.23809456080198288,
"num_tokens": 14914710.0,
"step": 7245
},
{
"entropy": 5.653356075286865,
"epoch": 6.433200177541057,
"grad_norm": 1.4765625,
"learning_rate": 0.00019940658350865422,
"loss": 4.9327,
"mean_token_accuracy": 0.22687021642923355,
"num_tokens": 14924806.0,
"step": 7250
},
{
"entropy": 5.616370105743409,
"epoch": 6.437638703950288,
"grad_norm": 1.484375,
"learning_rate": 0.00019908222272327608,
"loss": 4.8763,
"mean_token_accuracy": 0.23514180332422258,
"num_tokens": 14934301.0,
"step": 7255
},
{
"entropy": 5.636706256866455,
"epoch": 6.442077230359521,
"grad_norm": 1.1875,
"learning_rate": 0.0001987580398839806,
"loss": 4.9406,
"mean_token_accuracy": 0.22921711951494217,
"num_tokens": 14946660.0,
"step": 7260
},
{
"entropy": 5.691154718399048,
"epoch": 6.446515756768752,
"grad_norm": 1.25,
"learning_rate": 0.00019843403575063028,
"loss": 4.9662,
"mean_token_accuracy": 0.2253483772277832,
"num_tokens": 14957383.0,
"step": 7265
},
{
"entropy": 5.678403759002686,
"epoch": 6.450954283177985,
"grad_norm": 1.2890625,
"learning_rate": 0.0001981102110826688,
"loss": 4.8742,
"mean_token_accuracy": 0.23139094114303588,
"num_tokens": 14967784.0,
"step": 7270
},
{
"entropy": 5.641230297088623,
"epoch": 6.455392809587217,
"grad_norm": 1.2890625,
"learning_rate": 0.00019778656663911883,
"loss": 4.8382,
"mean_token_accuracy": 0.23628487586975097,
"num_tokens": 14977374.0,
"step": 7275
},
{
"entropy": 5.61148362159729,
"epoch": 6.459831335996449,
"grad_norm": 1.28125,
"learning_rate": 0.0001974631031785809,
"loss": 4.8508,
"mean_token_accuracy": 0.23570340275764465,
"num_tokens": 14987529.0,
"step": 7280
},
{
"entropy": 5.626633501052856,
"epoch": 6.464269862405681,
"grad_norm": 1.4609375,
"learning_rate": 0.00019713982145923149,
"loss": 4.8438,
"mean_token_accuracy": 0.24089188277721404,
"num_tokens": 14996878.0,
"step": 7285
},
{
"entropy": 5.57475848197937,
"epoch": 6.468708388814913,
"grad_norm": 1.1484375,
"learning_rate": 0.00019681672223882047,
"loss": 4.8538,
"mean_token_accuracy": 0.24125839471817018,
"num_tokens": 15008560.0,
"step": 7290
},
{
"entropy": 5.644071102142334,
"epoch": 6.473146915224145,
"grad_norm": 1.265625,
"learning_rate": 0.00019649380627467062,
"loss": 4.8226,
"mean_token_accuracy": 0.2429828017950058,
"num_tokens": 15018837.0,
"step": 7295
},
{
"entropy": 5.601809978485107,
"epoch": 6.477585441633377,
"grad_norm": 1.484375,
"learning_rate": 0.00019617107432367477,
"loss": 4.8497,
"mean_token_accuracy": 0.23642477840185167,
"num_tokens": 15028844.0,
"step": 7300
},
{
"entropy": 5.60591402053833,
"epoch": 6.4820239680426095,
"grad_norm": 1.2734375,
"learning_rate": 0.00019584852714229456,
"loss": 4.9256,
"mean_token_accuracy": 0.22939349859952926,
"num_tokens": 15038318.0,
"step": 7305
},
{
"entropy": 5.648140001296997,
"epoch": 6.486462494451842,
"grad_norm": 1.4296875,
"learning_rate": 0.00019552616548655866,
"loss": 4.8503,
"mean_token_accuracy": 0.2392851486802101,
"num_tokens": 15048744.0,
"step": 7310
},
{
"entropy": 5.623563575744629,
"epoch": 6.490901020861074,
"grad_norm": 1.25,
"learning_rate": 0.00019520399011206064,
"loss": 4.9062,
"mean_token_accuracy": 0.23606253117322923,
"num_tokens": 15058458.0,
"step": 7315
},
{
"entropy": 5.642405605316162,
"epoch": 6.495339547270306,
"grad_norm": 1.2265625,
"learning_rate": 0.0001948820017739576,
"loss": 4.9307,
"mean_token_accuracy": 0.22659213989973068,
"num_tokens": 15068520.0,
"step": 7320
},
{
"entropy": 5.69501142501831,
"epoch": 6.499778073679538,
"grad_norm": 1.3359375,
"learning_rate": 0.00019456020122696834,
"loss": 4.9282,
"mean_token_accuracy": 0.23074082285165787,
"num_tokens": 15078405.0,
"step": 7325
},
{
"entropy": 5.689974164962768,
"epoch": 6.50421660008877,
"grad_norm": 1.2265625,
"learning_rate": 0.00019423858922537108,
"loss": 4.8855,
"mean_token_accuracy": 0.23277142345905305,
"num_tokens": 15088777.0,
"step": 7330
},
{
"entropy": 5.656842422485352,
"epoch": 6.508655126498002,
"grad_norm": 1.4375,
"learning_rate": 0.00019391716652300263,
"loss": 4.861,
"mean_token_accuracy": 0.23903997093439103,
"num_tokens": 15098240.0,
"step": 7335
},
{
"entropy": 5.604224157333374,
"epoch": 6.5130936529072345,
"grad_norm": 1.3984375,
"learning_rate": 0.00019359593387325568,
"loss": 4.8821,
"mean_token_accuracy": 0.23923973590135575,
"num_tokens": 15108537.0,
"step": 7340
},
{
"entropy": 5.630281448364258,
"epoch": 6.517532179316467,
"grad_norm": 1.265625,
"learning_rate": 0.00019327489202907773,
"loss": 4.9323,
"mean_token_accuracy": 0.22366443127393723,
"num_tokens": 15119207.0,
"step": 7345
},
{
"entropy": 5.660913276672363,
"epoch": 6.521970705725699,
"grad_norm": 1.6328125,
"learning_rate": 0.00019295404174296887,
"loss": 4.9099,
"mean_token_accuracy": 0.23395536541938783,
"num_tokens": 15128679.0,
"step": 7350
},
{
"entropy": 5.6129961013793945,
"epoch": 6.526409232134931,
"grad_norm": 1.390625,
"learning_rate": 0.0001926333837669802,
"loss": 4.8457,
"mean_token_accuracy": 0.23017606437206267,
"num_tokens": 15139104.0,
"step": 7355
},
{
"entropy": 5.668904113769531,
"epoch": 6.530847758544163,
"grad_norm": 1.25,
"learning_rate": 0.00019231291885271214,
"loss": 4.9458,
"mean_token_accuracy": 0.22286424338817595,
"num_tokens": 15150810.0,
"step": 7360
},
{
"entropy": 5.683821392059326,
"epoch": 6.535286284953395,
"grad_norm": 1.3359375,
"learning_rate": 0.0001919926477513127,
"loss": 4.911,
"mean_token_accuracy": 0.23413541167974472,
"num_tokens": 15160809.0,
"step": 7365
},
{
"entropy": 5.6379194259643555,
"epoch": 6.539724811362627,
"grad_norm": 1.1953125,
"learning_rate": 0.0001916725712134752,
"loss": 4.9,
"mean_token_accuracy": 0.2355610266327858,
"num_tokens": 15171987.0,
"step": 7370
},
{
"entropy": 5.534349250793457,
"epoch": 6.5441633377718595,
"grad_norm": 1.1484375,
"learning_rate": 0.00019135268998943738,
"loss": 4.8263,
"mean_token_accuracy": 0.25055228769779203,
"num_tokens": 15181947.0,
"step": 7375
},
{
"entropy": 5.670077896118164,
"epoch": 6.548601864181092,
"grad_norm": 1.3203125,
"learning_rate": 0.00019103300482897884,
"loss": 4.9093,
"mean_token_accuracy": 0.2327532261610031,
"num_tokens": 15193321.0,
"step": 7380
},
{
"entropy": 5.677333498001099,
"epoch": 6.553040390590324,
"grad_norm": 1.46875,
"learning_rate": 0.00019071351648141977,
"loss": 4.9312,
"mean_token_accuracy": 0.2269109845161438,
"num_tokens": 15203519.0,
"step": 7385
},
{
"entropy": 5.63700590133667,
"epoch": 6.557478916999556,
"grad_norm": 1.15625,
"learning_rate": 0.0001903942256956192,
"loss": 4.8802,
"mean_token_accuracy": 0.24052705764770507,
"num_tokens": 15213109.0,
"step": 7390
},
{
"entropy": 5.619002008438111,
"epoch": 6.561917443408788,
"grad_norm": 1.2890625,
"learning_rate": 0.00019007513321997265,
"loss": 4.8994,
"mean_token_accuracy": 0.23233902901411058,
"num_tokens": 15222797.0,
"step": 7395
},
{
"entropy": 5.651479578018188,
"epoch": 6.56635596981802,
"grad_norm": 1.296875,
"learning_rate": 0.00018975623980241124,
"loss": 4.8911,
"mean_token_accuracy": 0.23779234439134597,
"num_tokens": 15232416.0,
"step": 7400
},
{
"entropy": 5.662068700790405,
"epoch": 6.570794496227252,
"grad_norm": 1.1796875,
"learning_rate": 0.00018943754619039942,
"loss": 4.9369,
"mean_token_accuracy": 0.23430106937885284,
"num_tokens": 15243020.0,
"step": 7405
},
{
"entropy": 5.5887304782867435,
"epoch": 6.575233022636485,
"grad_norm": 1.390625,
"learning_rate": 0.00018911905313093307,
"loss": 4.8263,
"mean_token_accuracy": 0.23923749029636382,
"num_tokens": 15252733.0,
"step": 7410
},
{
"entropy": 5.563994359970093,
"epoch": 6.579671549045717,
"grad_norm": 1.421875,
"learning_rate": 0.00018880076137053827,
"loss": 4.7685,
"mean_token_accuracy": 0.24913979470729827,
"num_tokens": 15261913.0,
"step": 7415
},
{
"entropy": 5.651371669769287,
"epoch": 6.584110075454949,
"grad_norm": 1.40625,
"learning_rate": 0.00018848267165526912,
"loss": 4.8773,
"mean_token_accuracy": 0.2341095745563507,
"num_tokens": 15272871.0,
"step": 7420
},
{
"entropy": 5.638633298873901,
"epoch": 6.588548601864181,
"grad_norm": 1.2421875,
"learning_rate": 0.00018816478473070608,
"loss": 4.8492,
"mean_token_accuracy": 0.2379048854112625,
"num_tokens": 15283218.0,
"step": 7425
},
{
"entropy": 5.639962291717529,
"epoch": 6.592987128273413,
"grad_norm": 1.328125,
"learning_rate": 0.00018784710134195465,
"loss": 4.8734,
"mean_token_accuracy": 0.2387226015329361,
"num_tokens": 15293040.0,
"step": 7430
},
{
"entropy": 5.615225982666016,
"epoch": 6.597425654682645,
"grad_norm": 1.21875,
"learning_rate": 0.00018752962223364268,
"loss": 4.8725,
"mean_token_accuracy": 0.23257046937942505,
"num_tokens": 15303422.0,
"step": 7435
},
{
"entropy": 5.655850124359131,
"epoch": 6.6018641810918774,
"grad_norm": 1.46875,
"learning_rate": 0.00018721234814991967,
"loss": 4.8898,
"mean_token_accuracy": 0.22835646271705629,
"num_tokens": 15313589.0,
"step": 7440
},
{
"entropy": 5.572815036773681,
"epoch": 6.60630270750111,
"grad_norm": 1.203125,
"learning_rate": 0.00018689527983445448,
"loss": 4.8663,
"mean_token_accuracy": 0.2393585979938507,
"num_tokens": 15324007.0,
"step": 7445
},
{
"entropy": 5.6924981594085695,
"epoch": 6.610741233910342,
"grad_norm": 1.3515625,
"learning_rate": 0.00018657841803043342,
"loss": 4.9154,
"mean_token_accuracy": 0.22886577993631363,
"num_tokens": 15334601.0,
"step": 7450
},
{
"entropy": 5.688579797744751,
"epoch": 6.615179760319574,
"grad_norm": 1.2421875,
"learning_rate": 0.0001862617634805589,
"loss": 4.9144,
"mean_token_accuracy": 0.2311697095632553,
"num_tokens": 15345459.0,
"step": 7455
},
{
"entropy": 5.623719263076782,
"epoch": 6.619618286728806,
"grad_norm": 1.265625,
"learning_rate": 0.00018594531692704764,
"loss": 4.8966,
"mean_token_accuracy": 0.2258065462112427,
"num_tokens": 15356031.0,
"step": 7460
},
{
"entropy": 5.651442193984986,
"epoch": 6.624056813138038,
"grad_norm": 1.4140625,
"learning_rate": 0.0001856290791116287,
"loss": 4.8827,
"mean_token_accuracy": 0.2345448449254036,
"num_tokens": 15366023.0,
"step": 7465
},
{
"entropy": 5.650465106964111,
"epoch": 6.62849533954727,
"grad_norm": 1.2734375,
"learning_rate": 0.00018531305077554194,
"loss": 4.8677,
"mean_token_accuracy": 0.2378988280892372,
"num_tokens": 15376626.0,
"step": 7470
},
{
"entropy": 5.65687928199768,
"epoch": 6.6329338659565025,
"grad_norm": 1.203125,
"learning_rate": 0.00018499723265953617,
"loss": 4.8474,
"mean_token_accuracy": 0.23806278705596923,
"num_tokens": 15387704.0,
"step": 7475
},
{
"entropy": 5.639648532867431,
"epoch": 6.637372392365735,
"grad_norm": 1.359375,
"learning_rate": 0.00018468162550386741,
"loss": 4.8351,
"mean_token_accuracy": 0.23378264605998994,
"num_tokens": 15397700.0,
"step": 7480
},
{
"entropy": 5.63367862701416,
"epoch": 6.641810918774967,
"grad_norm": 1.2109375,
"learning_rate": 0.00018436623004829746,
"loss": 4.9241,
"mean_token_accuracy": 0.23234807848930358,
"num_tokens": 15408311.0,
"step": 7485
},
{
"entropy": 5.655848789215088,
"epoch": 6.646249445184199,
"grad_norm": 1.4609375,
"learning_rate": 0.00018405104703209145,
"loss": 5.0114,
"mean_token_accuracy": 0.21867426186800004,
"num_tokens": 15418351.0,
"step": 7490
},
{
"entropy": 5.564092350006104,
"epoch": 6.650687971593431,
"grad_norm": 1.4453125,
"learning_rate": 0.0001837360771940171,
"loss": 4.7873,
"mean_token_accuracy": 0.24043413549661635,
"num_tokens": 15428833.0,
"step": 7495
},
{
"entropy": 5.609026527404785,
"epoch": 6.655126498002663,
"grad_norm": 1.2734375,
"learning_rate": 0.0001834213212723419,
"loss": 4.8847,
"mean_token_accuracy": 0.23354386985301973,
"num_tokens": 15439460.0,
"step": 7500
},
{
"epoch": 6.655126498002663,
"eval_entropy": 5.492083697874019,
"eval_loss": 5.773307800292969,
"eval_mean_token_accuracy": 0.18101677521532336,
"eval_num_tokens": 15439460.0,
"eval_runtime": 2.0854,
"eval_samples_per_second": 1614.527,
"eval_steps_per_second": 201.876,
"step": 7500
}
],
"logging_steps": 5,
"max_steps": 11260,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3471934410639360.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}