Files
ModelHub XC 88d41ed81e 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/rus-cyrl-100mb-10mb_seed3407
Source: Original Platform
2026-07-18 14:37:15 +08:00

10145 lines
276 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.436750998668442,
"eval_steps": 500,
"global_step": 5000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.692031192779542,
"epoch": 0.004438526409232135,
"grad_norm": 14.75,
"learning_rate": 2e-06,
"loss": 10.8207,
"mean_token_accuracy": 0.000128369708545506,
"num_tokens": 9810.0,
"step": 5
},
{
"entropy": 10.691952133178711,
"epoch": 0.00887705281846427,
"grad_norm": 12.9375,
"learning_rate": 4.5e-06,
"loss": 10.7613,
"mean_token_accuracy": 0.0,
"num_tokens": 20538.0,
"step": 10
},
{
"entropy": 10.690592384338379,
"epoch": 0.013315579227696404,
"grad_norm": 9.9375,
"learning_rate": 7e-06,
"loss": 10.5054,
"mean_token_accuracy": 0.03474730136804283,
"num_tokens": 30258.0,
"step": 15
},
{
"entropy": 10.66368646621704,
"epoch": 0.01775410563692854,
"grad_norm": 5.875,
"learning_rate": 9.5e-06,
"loss": 10.1947,
"mean_token_accuracy": 0.04976645708084106,
"num_tokens": 41249.0,
"step": 20
},
{
"entropy": 10.518089294433594,
"epoch": 0.022192632046160676,
"grad_norm": 3.609375,
"learning_rate": 1.2e-05,
"loss": 9.9,
"mean_token_accuracy": 0.053335465490818024,
"num_tokens": 51738.0,
"step": 25
},
{
"entropy": 10.489847755432129,
"epoch": 0.02663115845539281,
"grad_norm": 3.0625,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.8161,
"mean_token_accuracy": 0.05364362597465515,
"num_tokens": 62920.0,
"step": 30
},
{
"entropy": 10.506165885925293,
"epoch": 0.031069684864624945,
"grad_norm": 2.859375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.7103,
"mean_token_accuracy": 0.05455525256693363,
"num_tokens": 73163.0,
"step": 35
},
{
"entropy": 10.478147506713867,
"epoch": 0.03550821127385708,
"grad_norm": 2.40625,
"learning_rate": 1.95e-05,
"loss": 9.682,
"mean_token_accuracy": 0.05231944099068642,
"num_tokens": 84180.0,
"step": 40
},
{
"entropy": 10.461441326141358,
"epoch": 0.03994673768308921,
"grad_norm": 2.359375,
"learning_rate": 2.2e-05,
"loss": 9.6388,
"mean_token_accuracy": 0.05221981666982174,
"num_tokens": 94108.0,
"step": 45
},
{
"entropy": 10.476018333435059,
"epoch": 0.04438526409232135,
"grad_norm": 3.140625,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.6253,
"mean_token_accuracy": 0.05243444815278053,
"num_tokens": 104696.0,
"step": 50
},
{
"entropy": 10.478155612945557,
"epoch": 0.048823790501553485,
"grad_norm": 2.375,
"learning_rate": 2.7e-05,
"loss": 9.5235,
"mean_token_accuracy": 0.0584161002188921,
"num_tokens": 114568.0,
"step": 55
},
{
"entropy": 10.39725103378296,
"epoch": 0.05326231691078562,
"grad_norm": 2.125,
"learning_rate": 2.95e-05,
"loss": 9.4713,
"mean_token_accuracy": 0.064088149741292,
"num_tokens": 126251.0,
"step": 60
},
{
"entropy": 10.248920154571532,
"epoch": 0.05770084332001776,
"grad_norm": 2.109375,
"learning_rate": 3.2e-05,
"loss": 9.3504,
"mean_token_accuracy": 0.06839247606694698,
"num_tokens": 135612.0,
"step": 65
},
{
"entropy": 10.320736598968505,
"epoch": 0.06213936972924989,
"grad_norm": 2.078125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.4004,
"mean_token_accuracy": 0.0615400142967701,
"num_tokens": 145962.0,
"step": 70
},
{
"entropy": 10.323652744293213,
"epoch": 0.06657789613848203,
"grad_norm": 1.890625,
"learning_rate": 3.7e-05,
"loss": 9.1911,
"mean_token_accuracy": 0.07103513963520527,
"num_tokens": 155587.0,
"step": 75
},
{
"entropy": 10.258409976959229,
"epoch": 0.07101642254771416,
"grad_norm": 2.109375,
"learning_rate": 3.95e-05,
"loss": 9.1343,
"mean_token_accuracy": 0.06803948283195496,
"num_tokens": 165657.0,
"step": 80
},
{
"entropy": 10.24950189590454,
"epoch": 0.0754549489569463,
"grad_norm": 2.34375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.1277,
"mean_token_accuracy": 0.06729609742760659,
"num_tokens": 175844.0,
"step": 85
},
{
"entropy": 10.224775981903075,
"epoch": 0.07989347536617843,
"grad_norm": 2.046875,
"learning_rate": 4.45e-05,
"loss": 8.9736,
"mean_token_accuracy": 0.06970795653760434,
"num_tokens": 185453.0,
"step": 90
},
{
"entropy": 10.128818893432618,
"epoch": 0.08433200177541056,
"grad_norm": 1.8046875,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.9469,
"mean_token_accuracy": 0.07015660107135772,
"num_tokens": 195296.0,
"step": 95
},
{
"entropy": 10.158192539215088,
"epoch": 0.0887705281846427,
"grad_norm": 1.7578125,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.8594,
"mean_token_accuracy": 0.0717735793441534,
"num_tokens": 204491.0,
"step": 100
},
{
"entropy": 10.063592338562012,
"epoch": 0.09320905459387484,
"grad_norm": 1.578125,
"learning_rate": 5.2e-05,
"loss": 8.8275,
"mean_token_accuracy": 0.06594390086829663,
"num_tokens": 214916.0,
"step": 105
},
{
"entropy": 10.0551118850708,
"epoch": 0.09764758100310697,
"grad_norm": 1.640625,
"learning_rate": 5.45e-05,
"loss": 8.6661,
"mean_token_accuracy": 0.07398808561265469,
"num_tokens": 226660.0,
"step": 110
},
{
"entropy": 9.929056739807129,
"epoch": 0.1020861074123391,
"grad_norm": 2.203125,
"learning_rate": 5.7e-05,
"loss": 8.6191,
"mean_token_accuracy": 0.06771207004785537,
"num_tokens": 236554.0,
"step": 115
},
{
"entropy": 9.87773323059082,
"epoch": 0.10652463382157124,
"grad_norm": 1.390625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.5466,
"mean_token_accuracy": 0.07039828561246395,
"num_tokens": 247388.0,
"step": 120
},
{
"entropy": 9.78554401397705,
"epoch": 0.11096316023080337,
"grad_norm": 1.34375,
"learning_rate": 6.2e-05,
"loss": 8.3693,
"mean_token_accuracy": 0.07505594864487648,
"num_tokens": 257404.0,
"step": 125
},
{
"entropy": 9.569751739501953,
"epoch": 0.11540168664003551,
"grad_norm": 1.5859375,
"learning_rate": 6.450000000000001e-05,
"loss": 8.366,
"mean_token_accuracy": 0.0721758782863617,
"num_tokens": 268024.0,
"step": 130
},
{
"entropy": 9.49385757446289,
"epoch": 0.11984021304926765,
"grad_norm": 1.7890625,
"learning_rate": 6.7e-05,
"loss": 8.3116,
"mean_token_accuracy": 0.07231119871139527,
"num_tokens": 278477.0,
"step": 135
},
{
"entropy": 9.405902671813966,
"epoch": 0.12427873945849978,
"grad_norm": 1.2109375,
"learning_rate": 6.950000000000001e-05,
"loss": 8.2427,
"mean_token_accuracy": 0.06903640553355217,
"num_tokens": 289974.0,
"step": 140
},
{
"entropy": 9.16763277053833,
"epoch": 0.1287172658677319,
"grad_norm": 1.1953125,
"learning_rate": 7.2e-05,
"loss": 8.1839,
"mean_token_accuracy": 0.06725569888949394,
"num_tokens": 300150.0,
"step": 145
},
{
"entropy": 9.045907497406006,
"epoch": 0.13315579227696406,
"grad_norm": 1.2578125,
"learning_rate": 7.45e-05,
"loss": 8.0648,
"mean_token_accuracy": 0.07113164104521275,
"num_tokens": 310482.0,
"step": 150
},
{
"entropy": 8.951902961730957,
"epoch": 0.13759431868619618,
"grad_norm": 1.1875,
"learning_rate": 7.7e-05,
"loss": 8.1043,
"mean_token_accuracy": 0.07190654650330544,
"num_tokens": 321350.0,
"step": 155
},
{
"entropy": 8.734932899475098,
"epoch": 0.14203284509542832,
"grad_norm": 1.25,
"learning_rate": 7.950000000000001e-05,
"loss": 7.9902,
"mean_token_accuracy": 0.07260116301476956,
"num_tokens": 332009.0,
"step": 160
},
{
"entropy": 8.618322277069092,
"epoch": 0.14647137150466044,
"grad_norm": 1.4140625,
"learning_rate": 8.2e-05,
"loss": 8.0046,
"mean_token_accuracy": 0.07010005228221416,
"num_tokens": 341980.0,
"step": 165
},
{
"entropy": 8.576034545898438,
"epoch": 0.1509098979138926,
"grad_norm": 1.609375,
"learning_rate": 8.450000000000001e-05,
"loss": 7.9965,
"mean_token_accuracy": 0.06660077758133412,
"num_tokens": 354249.0,
"step": 170
},
{
"entropy": 8.524139022827148,
"epoch": 0.15534842432312473,
"grad_norm": 1.1875,
"learning_rate": 8.7e-05,
"loss": 7.9076,
"mean_token_accuracy": 0.07078476324677467,
"num_tokens": 364295.0,
"step": 175
},
{
"entropy": 8.328704929351806,
"epoch": 0.15978695073235685,
"grad_norm": 1.09375,
"learning_rate": 8.95e-05,
"loss": 7.8464,
"mean_token_accuracy": 0.0794072538614273,
"num_tokens": 373601.0,
"step": 180
},
{
"entropy": 8.382467269897461,
"epoch": 0.164225477141589,
"grad_norm": 1.8515625,
"learning_rate": 9.2e-05,
"loss": 7.8583,
"mean_token_accuracy": 0.07436131834983825,
"num_tokens": 384260.0,
"step": 185
},
{
"entropy": 8.316840362548827,
"epoch": 0.16866400355082112,
"grad_norm": 1.390625,
"learning_rate": 9.45e-05,
"loss": 7.9058,
"mean_token_accuracy": 0.06711366176605224,
"num_tokens": 394964.0,
"step": 190
},
{
"entropy": 8.204895782470704,
"epoch": 0.17310252996005326,
"grad_norm": 1.1484375,
"learning_rate": 9.7e-05,
"loss": 7.8384,
"mean_token_accuracy": 0.07343141734600067,
"num_tokens": 404470.0,
"step": 195
},
{
"entropy": 8.270458793640136,
"epoch": 0.1775410563692854,
"grad_norm": 1.0078125,
"learning_rate": 9.95e-05,
"loss": 7.9041,
"mean_token_accuracy": 0.07145134881138801,
"num_tokens": 414822.0,
"step": 200
},
{
"entropy": 8.344293403625489,
"epoch": 0.18197958277851753,
"grad_norm": 1.2578125,
"learning_rate": 0.000102,
"loss": 7.8228,
"mean_token_accuracy": 0.07206394150853157,
"num_tokens": 424367.0,
"step": 205
},
{
"entropy": 8.169469261169434,
"epoch": 0.18641810918774968,
"grad_norm": 1.4296875,
"learning_rate": 0.00010449999999999999,
"loss": 7.8063,
"mean_token_accuracy": 0.06796807795763016,
"num_tokens": 434911.0,
"step": 210
},
{
"entropy": 8.127049207687378,
"epoch": 0.1908566355969818,
"grad_norm": 1.0703125,
"learning_rate": 0.000107,
"loss": 7.7417,
"mean_token_accuracy": 0.08103418126702308,
"num_tokens": 445215.0,
"step": 215
},
{
"entropy": 8.216034698486329,
"epoch": 0.19529516200621394,
"grad_norm": 1.1875,
"learning_rate": 0.0001095,
"loss": 7.7919,
"mean_token_accuracy": 0.07842708677053452,
"num_tokens": 454786.0,
"step": 220
},
{
"entropy": 8.140088844299317,
"epoch": 0.19973368841544606,
"grad_norm": 1.4765625,
"learning_rate": 0.000112,
"loss": 7.8219,
"mean_token_accuracy": 0.07302889823913575,
"num_tokens": 465185.0,
"step": 225
},
{
"entropy": 8.021256399154662,
"epoch": 0.2041722148246782,
"grad_norm": 1.2890625,
"learning_rate": 0.0001145,
"loss": 7.7156,
"mean_token_accuracy": 0.08027704544365406,
"num_tokens": 475235.0,
"step": 230
},
{
"entropy": 8.17042875289917,
"epoch": 0.20861074123391035,
"grad_norm": 1.453125,
"learning_rate": 0.00011700000000000001,
"loss": 7.7317,
"mean_token_accuracy": 0.07805200070142745,
"num_tokens": 485408.0,
"step": 235
},
{
"entropy": 8.040202140808105,
"epoch": 0.21304926764314247,
"grad_norm": 1.28125,
"learning_rate": 0.00011949999999999999,
"loss": 7.7331,
"mean_token_accuracy": 0.0744746584445238,
"num_tokens": 495570.0,
"step": 240
},
{
"entropy": 8.125858116149903,
"epoch": 0.21748779405237462,
"grad_norm": 1.1953125,
"learning_rate": 0.000122,
"loss": 7.7248,
"mean_token_accuracy": 0.07628845125436783,
"num_tokens": 506103.0,
"step": 245
},
{
"entropy": 8.083836793899536,
"epoch": 0.22192632046160674,
"grad_norm": 0.94921875,
"learning_rate": 0.0001245,
"loss": 7.6989,
"mean_token_accuracy": 0.07588708400726318,
"num_tokens": 516416.0,
"step": 250
},
{
"entropy": 8.041877603530883,
"epoch": 0.22636484687083888,
"grad_norm": 1.0546875,
"learning_rate": 0.000127,
"loss": 7.7498,
"mean_token_accuracy": 0.0751910775899887,
"num_tokens": 525841.0,
"step": 255
},
{
"entropy": 8.231132793426514,
"epoch": 0.23080337328007103,
"grad_norm": 1.0390625,
"learning_rate": 0.0001295,
"loss": 7.7681,
"mean_token_accuracy": 0.07214248739182949,
"num_tokens": 536426.0,
"step": 260
},
{
"entropy": 8.028632116317748,
"epoch": 0.23524189968930315,
"grad_norm": 1.0703125,
"learning_rate": 0.000132,
"loss": 7.7229,
"mean_token_accuracy": 0.07526009976863861,
"num_tokens": 545852.0,
"step": 265
},
{
"entropy": 7.998026943206787,
"epoch": 0.2396804260985353,
"grad_norm": 1.015625,
"learning_rate": 0.00013450000000000002,
"loss": 7.6466,
"mean_token_accuracy": 0.07897478640079499,
"num_tokens": 555222.0,
"step": 270
},
{
"entropy": 7.9018083095550535,
"epoch": 0.2441189525077674,
"grad_norm": 1.046875,
"learning_rate": 0.00013700000000000002,
"loss": 7.6683,
"mean_token_accuracy": 0.0769478440284729,
"num_tokens": 566311.0,
"step": 275
},
{
"entropy": 8.067350673675538,
"epoch": 0.24855747891699956,
"grad_norm": 0.91015625,
"learning_rate": 0.0001395,
"loss": 7.6718,
"mean_token_accuracy": 0.07673554085195064,
"num_tokens": 576883.0,
"step": 280
},
{
"entropy": 8.010624122619628,
"epoch": 0.2529960053262317,
"grad_norm": 1.265625,
"learning_rate": 0.00014199999999999998,
"loss": 7.8136,
"mean_token_accuracy": 0.07454071268439293,
"num_tokens": 587387.0,
"step": 285
},
{
"entropy": 8.04631519317627,
"epoch": 0.2574345317354638,
"grad_norm": 0.99609375,
"learning_rate": 0.0001445,
"loss": 7.6914,
"mean_token_accuracy": 0.07921014353632927,
"num_tokens": 597229.0,
"step": 290
},
{
"entropy": 8.029859972000121,
"epoch": 0.26187305814469597,
"grad_norm": 1.0390625,
"learning_rate": 0.000147,
"loss": 7.6793,
"mean_token_accuracy": 0.0733891949057579,
"num_tokens": 606997.0,
"step": 295
},
{
"entropy": 7.9327795028686525,
"epoch": 0.2663115845539281,
"grad_norm": 1.2890625,
"learning_rate": 0.0001495,
"loss": 7.6346,
"mean_token_accuracy": 0.07976229339838029,
"num_tokens": 617316.0,
"step": 300
},
{
"entropy": 7.945201730728149,
"epoch": 0.2707501109631602,
"grad_norm": 1.125,
"learning_rate": 0.000152,
"loss": 7.6262,
"mean_token_accuracy": 0.07671116665005684,
"num_tokens": 626494.0,
"step": 305
},
{
"entropy": 7.911632776260376,
"epoch": 0.27518863737239235,
"grad_norm": 1.296875,
"learning_rate": 0.00015450000000000001,
"loss": 7.6211,
"mean_token_accuracy": 0.07656443342566491,
"num_tokens": 636816.0,
"step": 310
},
{
"entropy": 7.9385381698608395,
"epoch": 0.2796271637816245,
"grad_norm": 0.92578125,
"learning_rate": 0.000157,
"loss": 7.5921,
"mean_token_accuracy": 0.07875077873468399,
"num_tokens": 647520.0,
"step": 315
},
{
"entropy": 7.8889247417449955,
"epoch": 0.28406569019085665,
"grad_norm": 1.296875,
"learning_rate": 0.0001595,
"loss": 7.5615,
"mean_token_accuracy": 0.0802665926516056,
"num_tokens": 656772.0,
"step": 320
},
{
"entropy": 7.87529935836792,
"epoch": 0.2885042166000888,
"grad_norm": 1.0390625,
"learning_rate": 0.000162,
"loss": 7.6269,
"mean_token_accuracy": 0.07935804799199105,
"num_tokens": 666570.0,
"step": 325
},
{
"entropy": 7.889472913742066,
"epoch": 0.2929427430093209,
"grad_norm": 0.984375,
"learning_rate": 0.00016450000000000001,
"loss": 7.6449,
"mean_token_accuracy": 0.07449713721871376,
"num_tokens": 676873.0,
"step": 330
},
{
"entropy": 7.901484632492066,
"epoch": 0.29738126941855303,
"grad_norm": 1.0859375,
"learning_rate": 0.00016700000000000002,
"loss": 7.556,
"mean_token_accuracy": 0.0819828025996685,
"num_tokens": 687322.0,
"step": 335
},
{
"entropy": 7.938011121749878,
"epoch": 0.3018197958277852,
"grad_norm": 1.0859375,
"learning_rate": 0.00016950000000000003,
"loss": 7.6304,
"mean_token_accuracy": 0.07710144743323326,
"num_tokens": 697657.0,
"step": 340
},
{
"entropy": 7.953681612014771,
"epoch": 0.3062583222370173,
"grad_norm": 1.2265625,
"learning_rate": 0.00017199999999999998,
"loss": 7.5355,
"mean_token_accuracy": 0.07943713515996934,
"num_tokens": 707713.0,
"step": 345
},
{
"entropy": 7.818657636642456,
"epoch": 0.31069684864624947,
"grad_norm": 1.0546875,
"learning_rate": 0.00017449999999999999,
"loss": 7.5792,
"mean_token_accuracy": 0.08700495660305023,
"num_tokens": 719438.0,
"step": 350
},
{
"entropy": 7.922421979904175,
"epoch": 0.31513537505548156,
"grad_norm": 1.109375,
"learning_rate": 0.000177,
"loss": 7.5211,
"mean_token_accuracy": 0.0777974933385849,
"num_tokens": 728991.0,
"step": 355
},
{
"entropy": 7.7726140975952145,
"epoch": 0.3195739014647137,
"grad_norm": 1.7421875,
"learning_rate": 0.0001795,
"loss": 7.4375,
"mean_token_accuracy": 0.09254143610596657,
"num_tokens": 738276.0,
"step": 360
},
{
"entropy": 7.8144529342651365,
"epoch": 0.32401242787394585,
"grad_norm": 1.109375,
"learning_rate": 0.000182,
"loss": 7.537,
"mean_token_accuracy": 0.07724328823387623,
"num_tokens": 748405.0,
"step": 365
},
{
"entropy": 7.8304845809936525,
"epoch": 0.328450954283178,
"grad_norm": 1.015625,
"learning_rate": 0.0001845,
"loss": 7.5365,
"mean_token_accuracy": 0.08004771247506141,
"num_tokens": 759111.0,
"step": 370
},
{
"entropy": 7.755885601043701,
"epoch": 0.33288948069241014,
"grad_norm": 1.203125,
"learning_rate": 0.000187,
"loss": 7.4431,
"mean_token_accuracy": 0.08885042890906333,
"num_tokens": 770315.0,
"step": 375
},
{
"entropy": 7.815682411193848,
"epoch": 0.33732800710164224,
"grad_norm": 1.078125,
"learning_rate": 0.0001895,
"loss": 7.5761,
"mean_token_accuracy": 0.07824730798602104,
"num_tokens": 781390.0,
"step": 380
},
{
"entropy": 7.868446302413941,
"epoch": 0.3417665335108744,
"grad_norm": 1.0546875,
"learning_rate": 0.000192,
"loss": 7.4659,
"mean_token_accuracy": 0.08218091987073421,
"num_tokens": 790710.0,
"step": 385
},
{
"entropy": 7.664791536331177,
"epoch": 0.34620505992010653,
"grad_norm": 1.0625,
"learning_rate": 0.0001945,
"loss": 7.4344,
"mean_token_accuracy": 0.08516876846551895,
"num_tokens": 800475.0,
"step": 390
},
{
"entropy": 7.776907110214234,
"epoch": 0.3506435863293387,
"grad_norm": 1.109375,
"learning_rate": 0.00019700000000000002,
"loss": 7.5457,
"mean_token_accuracy": 0.07697484940290451,
"num_tokens": 810394.0,
"step": 395
},
{
"entropy": 7.851606655120849,
"epoch": 0.3550821127385708,
"grad_norm": 1.2421875,
"learning_rate": 0.00019950000000000002,
"loss": 7.5259,
"mean_token_accuracy": 0.07952482551336289,
"num_tokens": 820493.0,
"step": 400
},
{
"entropy": 7.881973552703857,
"epoch": 0.3595206391478029,
"grad_norm": 1.1796875,
"learning_rate": 0.000202,
"loss": 7.5896,
"mean_token_accuracy": 0.07090779766440392,
"num_tokens": 831570.0,
"step": 405
},
{
"entropy": 7.75118236541748,
"epoch": 0.36395916555703506,
"grad_norm": 1.09375,
"learning_rate": 0.00020449999999999998,
"loss": 7.5822,
"mean_token_accuracy": 0.07436199747025966,
"num_tokens": 841851.0,
"step": 410
},
{
"entropy": 7.8130326747894285,
"epoch": 0.3683976919662672,
"grad_norm": 1.2109375,
"learning_rate": 0.000207,
"loss": 7.4771,
"mean_token_accuracy": 0.08917279317975044,
"num_tokens": 851221.0,
"step": 415
},
{
"entropy": 7.784592771530152,
"epoch": 0.37283621837549935,
"grad_norm": 1.0703125,
"learning_rate": 0.0002095,
"loss": 7.5136,
"mean_token_accuracy": 0.08482674360275269,
"num_tokens": 861876.0,
"step": 420
},
{
"entropy": 7.806199550628662,
"epoch": 0.37727474478473144,
"grad_norm": 1.2265625,
"learning_rate": 0.000212,
"loss": 7.5012,
"mean_token_accuracy": 0.08520847856998444,
"num_tokens": 871742.0,
"step": 425
},
{
"entropy": 7.63223876953125,
"epoch": 0.3817132711939636,
"grad_norm": 1.0625,
"learning_rate": 0.0002145,
"loss": 7.4356,
"mean_token_accuracy": 0.08614917695522309,
"num_tokens": 881968.0,
"step": 430
},
{
"entropy": 7.708009338378906,
"epoch": 0.38615179760319573,
"grad_norm": 1.0546875,
"learning_rate": 0.00021700000000000002,
"loss": 7.3441,
"mean_token_accuracy": 0.0903160773217678,
"num_tokens": 892142.0,
"step": 435
},
{
"entropy": 7.681766939163208,
"epoch": 0.3905903240124279,
"grad_norm": 1.15625,
"learning_rate": 0.0002195,
"loss": 7.408,
"mean_token_accuracy": 0.09188471287488938,
"num_tokens": 901992.0,
"step": 440
},
{
"entropy": 7.797896862030029,
"epoch": 0.39502885042166,
"grad_norm": 1.1171875,
"learning_rate": 0.000222,
"loss": 7.5382,
"mean_token_accuracy": 0.07850045077502728,
"num_tokens": 913438.0,
"step": 445
},
{
"entropy": 7.55986213684082,
"epoch": 0.3994673768308921,
"grad_norm": 2.109375,
"learning_rate": 0.0002245,
"loss": 7.273,
"mean_token_accuracy": 0.10574427619576454,
"num_tokens": 923879.0,
"step": 450
},
{
"entropy": 7.674528026580811,
"epoch": 0.40390590324012426,
"grad_norm": 1.1015625,
"learning_rate": 0.00022700000000000002,
"loss": 7.4341,
"mean_token_accuracy": 0.08904042169451713,
"num_tokens": 933954.0,
"step": 455
},
{
"entropy": 7.707700920104981,
"epoch": 0.4083444296493564,
"grad_norm": 1.15625,
"learning_rate": 0.00022950000000000002,
"loss": 7.4156,
"mean_token_accuracy": 0.0867860458791256,
"num_tokens": 942992.0,
"step": 460
},
{
"entropy": 7.656433868408203,
"epoch": 0.41278295605858856,
"grad_norm": 1.25,
"learning_rate": 0.00023200000000000003,
"loss": 7.4528,
"mean_token_accuracy": 0.08972205594182014,
"num_tokens": 953822.0,
"step": 465
},
{
"entropy": 7.627706384658813,
"epoch": 0.4172214824678207,
"grad_norm": 1.1015625,
"learning_rate": 0.00023449999999999998,
"loss": 7.3472,
"mean_token_accuracy": 0.08931803703308105,
"num_tokens": 964475.0,
"step": 470
},
{
"entropy": 7.642127990722656,
"epoch": 0.4216600088770528,
"grad_norm": 1.0859375,
"learning_rate": 0.000237,
"loss": 7.434,
"mean_token_accuracy": 0.0859565369784832,
"num_tokens": 974535.0,
"step": 475
},
{
"entropy": 7.666657447814941,
"epoch": 0.42609853528628494,
"grad_norm": 1.0703125,
"learning_rate": 0.0002395,
"loss": 7.3944,
"mean_token_accuracy": 0.08582191392779351,
"num_tokens": 984674.0,
"step": 480
},
{
"entropy": 7.544086360931397,
"epoch": 0.4305370616955171,
"grad_norm": 1.171875,
"learning_rate": 0.000242,
"loss": 7.37,
"mean_token_accuracy": 0.09044271633028984,
"num_tokens": 995248.0,
"step": 485
},
{
"entropy": 7.742295646667481,
"epoch": 0.43497558810474923,
"grad_norm": 1.2890625,
"learning_rate": 0.0002445,
"loss": 7.3632,
"mean_token_accuracy": 0.0895160473883152,
"num_tokens": 1005547.0,
"step": 490
},
{
"entropy": 7.550811624526977,
"epoch": 0.4394141145139814,
"grad_norm": 1.171875,
"learning_rate": 0.000247,
"loss": 7.3413,
"mean_token_accuracy": 0.08750802129507065,
"num_tokens": 1015498.0,
"step": 495
},
{
"entropy": 7.609345579147339,
"epoch": 0.44385264092321347,
"grad_norm": 1.1015625,
"learning_rate": 0.0002495,
"loss": 7.4055,
"mean_token_accuracy": 0.08584300205111503,
"num_tokens": 1025420.0,
"step": 500
},
{
"epoch": 0.44385264092321347,
"eval_entropy": 7.669124412989673,
"eval_loss": 7.446435451507568,
"eval_mean_token_accuracy": 0.08312557260738132,
"eval_num_tokens": 1025420.0,
"eval_runtime": 2.7854,
"eval_samples_per_second": 1208.804,
"eval_steps_per_second": 151.145,
"step": 500
},
{
"entropy": 7.6334656238555905,
"epoch": 0.4482911673324456,
"grad_norm": 1.125,
"learning_rate": 0.000252,
"loss": 7.3295,
"mean_token_accuracy": 0.09022360593080521,
"num_tokens": 1036556.0,
"step": 505
},
{
"entropy": 7.584210634231567,
"epoch": 0.45272969374167776,
"grad_norm": 1.1640625,
"learning_rate": 0.0002545,
"loss": 7.3593,
"mean_token_accuracy": 0.08703627660870553,
"num_tokens": 1046676.0,
"step": 510
},
{
"entropy": 7.6705080509185795,
"epoch": 0.4571682201509099,
"grad_norm": 1.2109375,
"learning_rate": 0.000257,
"loss": 7.4042,
"mean_token_accuracy": 0.08590352982282638,
"num_tokens": 1057088.0,
"step": 515
},
{
"entropy": 7.5486232280731205,
"epoch": 0.46160674656014206,
"grad_norm": 0.98828125,
"learning_rate": 0.0002595,
"loss": 7.2982,
"mean_token_accuracy": 0.09567688480019569,
"num_tokens": 1067814.0,
"step": 520
},
{
"entropy": 7.543769884109497,
"epoch": 0.46604527296937415,
"grad_norm": 1.1015625,
"learning_rate": 0.000262,
"loss": 7.3327,
"mean_token_accuracy": 0.0892727330327034,
"num_tokens": 1078600.0,
"step": 525
},
{
"entropy": 7.641923093795777,
"epoch": 0.4704837993786063,
"grad_norm": 1.171875,
"learning_rate": 0.00026450000000000003,
"loss": 7.3363,
"mean_token_accuracy": 0.08722671940922737,
"num_tokens": 1089158.0,
"step": 530
},
{
"entropy": 7.568871212005615,
"epoch": 0.47492232578783844,
"grad_norm": 1.2421875,
"learning_rate": 0.00026700000000000004,
"loss": 7.3497,
"mean_token_accuracy": 0.08428739383816719,
"num_tokens": 1100365.0,
"step": 535
},
{
"entropy": 7.500961780548096,
"epoch": 0.4793608521970706,
"grad_norm": 1.09375,
"learning_rate": 0.00026950000000000005,
"loss": 7.305,
"mean_token_accuracy": 0.09392210468649864,
"num_tokens": 1111168.0,
"step": 540
},
{
"entropy": 7.573345041275024,
"epoch": 0.48379937860630273,
"grad_norm": 1.171875,
"learning_rate": 0.00027200000000000005,
"loss": 7.3194,
"mean_token_accuracy": 0.09149189814925193,
"num_tokens": 1121520.0,
"step": 545
},
{
"entropy": 7.536744737625122,
"epoch": 0.4882379050155348,
"grad_norm": 1.1953125,
"learning_rate": 0.0002745,
"loss": 7.2073,
"mean_token_accuracy": 0.09879742562770844,
"num_tokens": 1131300.0,
"step": 550
},
{
"entropy": 7.364904880523682,
"epoch": 0.49267643142476697,
"grad_norm": 1.0546875,
"learning_rate": 0.000277,
"loss": 7.2532,
"mean_token_accuracy": 0.0986358568072319,
"num_tokens": 1141897.0,
"step": 555
},
{
"entropy": 7.541038084030151,
"epoch": 0.4971149578339991,
"grad_norm": 1.3046875,
"learning_rate": 0.0002795,
"loss": 7.2956,
"mean_token_accuracy": 0.08940311297774314,
"num_tokens": 1152510.0,
"step": 560
},
{
"entropy": 7.552376794815063,
"epoch": 0.5015534842432312,
"grad_norm": 1.1640625,
"learning_rate": 0.00028199999999999997,
"loss": 7.3001,
"mean_token_accuracy": 0.09093584269285201,
"num_tokens": 1161762.0,
"step": 565
},
{
"entropy": 7.479511404037476,
"epoch": 0.5059920106524634,
"grad_norm": 1.1171875,
"learning_rate": 0.0002845,
"loss": 7.2394,
"mean_token_accuracy": 0.09156333580613137,
"num_tokens": 1172836.0,
"step": 570
},
{
"entropy": 7.480563068389893,
"epoch": 0.5104305370616955,
"grad_norm": 1.1953125,
"learning_rate": 0.000287,
"loss": 7.2935,
"mean_token_accuracy": 0.09051846116781234,
"num_tokens": 1182101.0,
"step": 575
},
{
"entropy": 7.511827182769776,
"epoch": 0.5148690634709276,
"grad_norm": 1.0859375,
"learning_rate": 0.0002895,
"loss": 7.2868,
"mean_token_accuracy": 0.08703599572181701,
"num_tokens": 1191925.0,
"step": 580
},
{
"entropy": 7.430129528045654,
"epoch": 0.5193075898801598,
"grad_norm": 1.109375,
"learning_rate": 0.000292,
"loss": 7.1629,
"mean_token_accuracy": 0.09691138043999672,
"num_tokens": 1202030.0,
"step": 585
},
{
"entropy": 7.408132934570313,
"epoch": 0.5237461162893919,
"grad_norm": 1.109375,
"learning_rate": 0.0002945,
"loss": 7.253,
"mean_token_accuracy": 0.09141650795936584,
"num_tokens": 1212178.0,
"step": 590
},
{
"entropy": 7.515611791610718,
"epoch": 0.5281846426986241,
"grad_norm": 1.0703125,
"learning_rate": 0.000297,
"loss": 7.1971,
"mean_token_accuracy": 0.0950719341635704,
"num_tokens": 1221685.0,
"step": 595
},
{
"entropy": 7.383773374557495,
"epoch": 0.5326231691078562,
"grad_norm": 1.1015625,
"learning_rate": 0.0002995,
"loss": 7.197,
"mean_token_accuracy": 0.08822897970676422,
"num_tokens": 1233178.0,
"step": 600
},
{
"entropy": 7.4588648796081545,
"epoch": 0.5370616955170884,
"grad_norm": 1.0859375,
"learning_rate": 0.000302,
"loss": 7.1611,
"mean_token_accuracy": 0.09191120117902755,
"num_tokens": 1243687.0,
"step": 605
},
{
"entropy": 7.358021211624146,
"epoch": 0.5415002219263204,
"grad_norm": 1.0078125,
"learning_rate": 0.0003045,
"loss": 7.2349,
"mean_token_accuracy": 0.08815527036786079,
"num_tokens": 1255124.0,
"step": 610
},
{
"entropy": 7.400767421722412,
"epoch": 0.5459387483355526,
"grad_norm": 1.3671875,
"learning_rate": 0.000307,
"loss": 7.2452,
"mean_token_accuracy": 0.09174467995762825,
"num_tokens": 1265517.0,
"step": 615
},
{
"entropy": 7.310306978225708,
"epoch": 0.5503772747447847,
"grad_norm": 1.296875,
"learning_rate": 0.0003095,
"loss": 7.1176,
"mean_token_accuracy": 0.09506009593605995,
"num_tokens": 1275877.0,
"step": 620
},
{
"entropy": 7.400981378555298,
"epoch": 0.5548158011540169,
"grad_norm": 1.1875,
"learning_rate": 0.000312,
"loss": 7.2286,
"mean_token_accuracy": 0.09438399225473404,
"num_tokens": 1285951.0,
"step": 625
},
{
"entropy": 7.509041738510132,
"epoch": 0.559254327563249,
"grad_norm": 1.296875,
"learning_rate": 0.0003145,
"loss": 7.1567,
"mean_token_accuracy": 0.09806277230381966,
"num_tokens": 1295209.0,
"step": 630
},
{
"entropy": 7.316894149780273,
"epoch": 0.5636928539724811,
"grad_norm": 1.171875,
"learning_rate": 0.000317,
"loss": 7.2208,
"mean_token_accuracy": 0.09708264470100403,
"num_tokens": 1304733.0,
"step": 635
},
{
"entropy": 7.342378044128418,
"epoch": 0.5681313803817133,
"grad_norm": 1.0546875,
"learning_rate": 0.0003195,
"loss": 7.1539,
"mean_token_accuracy": 0.08910495042800903,
"num_tokens": 1314981.0,
"step": 640
},
{
"entropy": 7.538545989990235,
"epoch": 0.5725699067909454,
"grad_norm": 1.0859375,
"learning_rate": 0.000322,
"loss": 7.198,
"mean_token_accuracy": 0.0895936667919159,
"num_tokens": 1325211.0,
"step": 645
},
{
"entropy": 7.2863500118255615,
"epoch": 0.5770084332001776,
"grad_norm": 1.0546875,
"learning_rate": 0.00032450000000000003,
"loss": 7.1309,
"mean_token_accuracy": 0.09338074773550034,
"num_tokens": 1335625.0,
"step": 650
},
{
"entropy": 7.436445474624634,
"epoch": 0.5814469596094097,
"grad_norm": 1.3828125,
"learning_rate": 0.00032700000000000003,
"loss": 7.2488,
"mean_token_accuracy": 0.0991661287844181,
"num_tokens": 1345158.0,
"step": 655
},
{
"entropy": 7.262508535385132,
"epoch": 0.5858854860186418,
"grad_norm": 1.1875,
"learning_rate": 0.00032950000000000004,
"loss": 7.081,
"mean_token_accuracy": 0.10250589922070504,
"num_tokens": 1355092.0,
"step": 660
},
{
"entropy": 7.307907056808472,
"epoch": 0.5903240124278739,
"grad_norm": 1.15625,
"learning_rate": 0.00033200000000000005,
"loss": 7.1329,
"mean_token_accuracy": 0.09874422326683999,
"num_tokens": 1364919.0,
"step": 665
},
{
"entropy": 7.2338110446929935,
"epoch": 0.5947625388371061,
"grad_norm": 1.171875,
"learning_rate": 0.00033450000000000005,
"loss": 7.1726,
"mean_token_accuracy": 0.09538876637816429,
"num_tokens": 1375200.0,
"step": 670
},
{
"entropy": 7.331265687942505,
"epoch": 0.5992010652463382,
"grad_norm": 1.265625,
"learning_rate": 0.000337,
"loss": 7.1466,
"mean_token_accuracy": 0.09369650185108185,
"num_tokens": 1385728.0,
"step": 675
},
{
"entropy": 7.4757524013519285,
"epoch": 0.6036395916555704,
"grad_norm": 1.203125,
"learning_rate": 0.0003395,
"loss": 7.196,
"mean_token_accuracy": 0.08721103966236114,
"num_tokens": 1395542.0,
"step": 680
},
{
"entropy": 7.264866781234741,
"epoch": 0.6080781180648025,
"grad_norm": 1.140625,
"learning_rate": 0.000342,
"loss": 7.1667,
"mean_token_accuracy": 0.09908052235841751,
"num_tokens": 1406350.0,
"step": 685
},
{
"entropy": 7.250851583480835,
"epoch": 0.6125166444740346,
"grad_norm": 1.1484375,
"learning_rate": 0.00034449999999999997,
"loss": 7.0933,
"mean_token_accuracy": 0.09707043692469597,
"num_tokens": 1418229.0,
"step": 690
},
{
"entropy": 7.257457447052002,
"epoch": 0.6169551708832668,
"grad_norm": 1.109375,
"learning_rate": 0.000347,
"loss": 7.101,
"mean_token_accuracy": 0.10156845226883889,
"num_tokens": 1428290.0,
"step": 695
},
{
"entropy": 7.389108514785766,
"epoch": 0.6213936972924989,
"grad_norm": 1.0390625,
"learning_rate": 0.0003495,
"loss": 7.1644,
"mean_token_accuracy": 0.08962787240743637,
"num_tokens": 1439837.0,
"step": 700
},
{
"entropy": 7.230832195281982,
"epoch": 0.625832223701731,
"grad_norm": 1.046875,
"learning_rate": 0.000352,
"loss": 7.1004,
"mean_token_accuracy": 0.09468400254845619,
"num_tokens": 1450831.0,
"step": 705
},
{
"entropy": 7.241072797775269,
"epoch": 0.6302707501109631,
"grad_norm": 1.09375,
"learning_rate": 0.0003545,
"loss": 7.0787,
"mean_token_accuracy": 0.0992747537791729,
"num_tokens": 1461772.0,
"step": 710
},
{
"entropy": 7.251083326339722,
"epoch": 0.6347092765201953,
"grad_norm": 0.93359375,
"learning_rate": 0.000357,
"loss": 7.0678,
"mean_token_accuracy": 0.10479466319084167,
"num_tokens": 1471669.0,
"step": 715
},
{
"entropy": 7.284691286087036,
"epoch": 0.6391478029294274,
"grad_norm": 1.2265625,
"learning_rate": 0.0003595,
"loss": 7.0922,
"mean_token_accuracy": 0.0977623738348484,
"num_tokens": 1482319.0,
"step": 720
},
{
"entropy": 7.207487869262695,
"epoch": 0.6435863293386596,
"grad_norm": 1.1328125,
"learning_rate": 0.000362,
"loss": 7.0654,
"mean_token_accuracy": 0.09616786390542983,
"num_tokens": 1492393.0,
"step": 725
},
{
"entropy": 7.214288234710693,
"epoch": 0.6480248557478917,
"grad_norm": 1.09375,
"learning_rate": 0.0003645,
"loss": 7.1377,
"mean_token_accuracy": 0.10020551234483718,
"num_tokens": 1502986.0,
"step": 730
},
{
"entropy": 7.309820938110351,
"epoch": 0.6524633821571239,
"grad_norm": 1.0703125,
"learning_rate": 0.000367,
"loss": 7.1195,
"mean_token_accuracy": 0.09985571056604385,
"num_tokens": 1514046.0,
"step": 735
},
{
"entropy": 7.249904489517212,
"epoch": 0.656901908566356,
"grad_norm": 1.2890625,
"learning_rate": 0.0003695,
"loss": 7.133,
"mean_token_accuracy": 0.0978231132030487,
"num_tokens": 1523789.0,
"step": 740
},
{
"entropy": 7.303426790237427,
"epoch": 0.6613404349755881,
"grad_norm": 1.28125,
"learning_rate": 0.000372,
"loss": 7.0636,
"mean_token_accuracy": 0.0984602726995945,
"num_tokens": 1533449.0,
"step": 745
},
{
"entropy": 7.157350540161133,
"epoch": 0.6657789613848203,
"grad_norm": 1.21875,
"learning_rate": 0.0003745,
"loss": 7.1052,
"mean_token_accuracy": 0.0913457877933979,
"num_tokens": 1543449.0,
"step": 750
},
{
"entropy": 7.232370662689209,
"epoch": 0.6702174877940523,
"grad_norm": 1.2578125,
"learning_rate": 0.000377,
"loss": 6.957,
"mean_token_accuracy": 0.10332913659512996,
"num_tokens": 1553529.0,
"step": 755
},
{
"entropy": 7.166843461990356,
"epoch": 0.6746560142032845,
"grad_norm": 1.0859375,
"learning_rate": 0.0003795,
"loss": 7.0559,
"mean_token_accuracy": 0.1009259507060051,
"num_tokens": 1564245.0,
"step": 760
},
{
"entropy": 7.135752153396607,
"epoch": 0.6790945406125166,
"grad_norm": 1.15625,
"learning_rate": 0.000382,
"loss": 6.9787,
"mean_token_accuracy": 0.0997254841029644,
"num_tokens": 1573834.0,
"step": 765
},
{
"entropy": 7.034980821609497,
"epoch": 0.6835330670217488,
"grad_norm": 1.09375,
"learning_rate": 0.0003845,
"loss": 6.9407,
"mean_token_accuracy": 0.10062595605850219,
"num_tokens": 1583782.0,
"step": 770
},
{
"entropy": 7.211769485473633,
"epoch": 0.6879715934309809,
"grad_norm": 1.1640625,
"learning_rate": 0.00038700000000000003,
"loss": 7.0625,
"mean_token_accuracy": 0.10229107290506363,
"num_tokens": 1594056.0,
"step": 775
},
{
"entropy": 7.17944564819336,
"epoch": 0.6924101198402131,
"grad_norm": 1.125,
"learning_rate": 0.00038950000000000003,
"loss": 7.0671,
"mean_token_accuracy": 0.09898089095950127,
"num_tokens": 1604177.0,
"step": 780
},
{
"entropy": 7.1694622993469235,
"epoch": 0.6968486462494452,
"grad_norm": 1.09375,
"learning_rate": 0.00039200000000000004,
"loss": 6.9696,
"mean_token_accuracy": 0.10202183946967125,
"num_tokens": 1614439.0,
"step": 785
},
{
"entropy": 7.079647397994995,
"epoch": 0.7012871726586773,
"grad_norm": 1.3984375,
"learning_rate": 0.00039450000000000005,
"loss": 6.99,
"mean_token_accuracy": 0.09851381108164788,
"num_tokens": 1625004.0,
"step": 790
},
{
"entropy": 7.182702732086182,
"epoch": 0.7057256990679095,
"grad_norm": 1.09375,
"learning_rate": 0.00039700000000000005,
"loss": 7.0091,
"mean_token_accuracy": 0.09595384523272514,
"num_tokens": 1634188.0,
"step": 795
},
{
"entropy": 7.0714222431182865,
"epoch": 0.7101642254771416,
"grad_norm": 1.3125,
"learning_rate": 0.0003995,
"loss": 6.9157,
"mean_token_accuracy": 0.1082749105989933,
"num_tokens": 1642633.0,
"step": 800
},
{
"entropy": 7.0621692657470705,
"epoch": 0.7146027518863737,
"grad_norm": 1.15625,
"learning_rate": 0.000402,
"loss": 6.9424,
"mean_token_accuracy": 0.10712620615959167,
"num_tokens": 1654536.0,
"step": 805
},
{
"entropy": 7.148227691650391,
"epoch": 0.7190412782956058,
"grad_norm": 1.0546875,
"learning_rate": 0.0004045,
"loss": 7.0822,
"mean_token_accuracy": 0.09017667174339294,
"num_tokens": 1665083.0,
"step": 810
},
{
"entropy": 7.069796466827393,
"epoch": 0.723479804704838,
"grad_norm": 1.0234375,
"learning_rate": 0.00040699999999999997,
"loss": 7.033,
"mean_token_accuracy": 0.09541632980108261,
"num_tokens": 1675826.0,
"step": 815
},
{
"entropy": 7.110815143585205,
"epoch": 0.7279183311140701,
"grad_norm": 1.046875,
"learning_rate": 0.0004095,
"loss": 6.9946,
"mean_token_accuracy": 0.10398527979850769,
"num_tokens": 1685806.0,
"step": 820
},
{
"entropy": 7.097141170501709,
"epoch": 0.7323568575233023,
"grad_norm": 1.078125,
"learning_rate": 0.000412,
"loss": 7.0632,
"mean_token_accuracy": 0.10135304108262062,
"num_tokens": 1695984.0,
"step": 825
},
{
"entropy": 7.124357271194458,
"epoch": 0.7367953839325344,
"grad_norm": 1.1015625,
"learning_rate": 0.0004145,
"loss": 7.0575,
"mean_token_accuracy": 0.09942566752433776,
"num_tokens": 1706086.0,
"step": 830
},
{
"entropy": 7.091458511352539,
"epoch": 0.7412339103417666,
"grad_norm": 0.9609375,
"learning_rate": 0.000417,
"loss": 7.0284,
"mean_token_accuracy": 0.10059899911284446,
"num_tokens": 1718040.0,
"step": 835
},
{
"entropy": 7.131758165359497,
"epoch": 0.7456724367509987,
"grad_norm": 0.98828125,
"learning_rate": 0.0004195,
"loss": 7.0191,
"mean_token_accuracy": 0.09906580075621604,
"num_tokens": 1729009.0,
"step": 840
},
{
"entropy": 7.087246465682983,
"epoch": 0.7501109631602308,
"grad_norm": 1.1875,
"learning_rate": 0.000422,
"loss": 6.9929,
"mean_token_accuracy": 0.10902519077062607,
"num_tokens": 1738895.0,
"step": 845
},
{
"entropy": 7.113551664352417,
"epoch": 0.7545494895694629,
"grad_norm": 1.0703125,
"learning_rate": 0.0004245,
"loss": 7.0261,
"mean_token_accuracy": 0.10415812507271767,
"num_tokens": 1750225.0,
"step": 850
},
{
"entropy": 7.0047619342803955,
"epoch": 0.758988015978695,
"grad_norm": 1.140625,
"learning_rate": 0.000427,
"loss": 6.9292,
"mean_token_accuracy": 0.105811557918787,
"num_tokens": 1761224.0,
"step": 855
},
{
"entropy": 7.085004186630249,
"epoch": 0.7634265423879272,
"grad_norm": 1.0390625,
"learning_rate": 0.0004295,
"loss": 7.0169,
"mean_token_accuracy": 0.09775067865848541,
"num_tokens": 1771853.0,
"step": 860
},
{
"entropy": 7.146742153167724,
"epoch": 0.7678650687971593,
"grad_norm": 1.046875,
"learning_rate": 0.000432,
"loss": 6.9895,
"mean_token_accuracy": 0.10439399853348733,
"num_tokens": 1781186.0,
"step": 865
},
{
"entropy": 7.151022291183471,
"epoch": 0.7723035952063915,
"grad_norm": 1.109375,
"learning_rate": 0.0004345,
"loss": 6.9711,
"mean_token_accuracy": 0.09423294179141521,
"num_tokens": 1792887.0,
"step": 870
},
{
"entropy": 6.941896152496338,
"epoch": 0.7767421216156236,
"grad_norm": 1.203125,
"learning_rate": 0.000437,
"loss": 6.8708,
"mean_token_accuracy": 0.10734946057200431,
"num_tokens": 1803050.0,
"step": 875
},
{
"entropy": 6.811341190338135,
"epoch": 0.7811806480248558,
"grad_norm": 1.25,
"learning_rate": 0.0004395,
"loss": 6.9879,
"mean_token_accuracy": 0.10939516723155976,
"num_tokens": 1813287.0,
"step": 880
},
{
"entropy": 7.056670713424682,
"epoch": 0.7856191744340879,
"grad_norm": 1.4609375,
"learning_rate": 0.000442,
"loss": 6.9735,
"mean_token_accuracy": 0.1008478730916977,
"num_tokens": 1824425.0,
"step": 885
},
{
"entropy": 6.97848916053772,
"epoch": 0.79005770084332,
"grad_norm": 1.125,
"learning_rate": 0.0004445,
"loss": 6.8898,
"mean_token_accuracy": 0.11324303895235062,
"num_tokens": 1833968.0,
"step": 890
},
{
"entropy": 6.980572080612182,
"epoch": 0.7944962272525522,
"grad_norm": 1.0703125,
"learning_rate": 0.000447,
"loss": 7.0128,
"mean_token_accuracy": 0.10274540036916732,
"num_tokens": 1844097.0,
"step": 895
},
{
"entropy": 7.055815601348877,
"epoch": 0.7989347536617842,
"grad_norm": 1.0625,
"learning_rate": 0.00044950000000000003,
"loss": 6.934,
"mean_token_accuracy": 0.10776300206780434,
"num_tokens": 1854395.0,
"step": 900
},
{
"entropy": 6.931429195404053,
"epoch": 0.8033732800710164,
"grad_norm": 1.1484375,
"learning_rate": 0.00045200000000000004,
"loss": 6.949,
"mean_token_accuracy": 0.10048572197556496,
"num_tokens": 1864531.0,
"step": 905
},
{
"entropy": 6.998499774932862,
"epoch": 0.8078118064802485,
"grad_norm": 1.0703125,
"learning_rate": 0.00045450000000000004,
"loss": 6.8224,
"mean_token_accuracy": 0.11029603257775307,
"num_tokens": 1875071.0,
"step": 910
},
{
"entropy": 6.971027994155884,
"epoch": 0.8122503328894807,
"grad_norm": 1.09375,
"learning_rate": 0.00045700000000000005,
"loss": 6.947,
"mean_token_accuracy": 0.10487593412399292,
"num_tokens": 1884633.0,
"step": 915
},
{
"entropy": 6.975761222839355,
"epoch": 0.8166888592987128,
"grad_norm": 1.171875,
"learning_rate": 0.00045950000000000006,
"loss": 6.9402,
"mean_token_accuracy": 0.10628680288791656,
"num_tokens": 1895204.0,
"step": 920
},
{
"entropy": 7.054645633697509,
"epoch": 0.821127385707945,
"grad_norm": 0.98828125,
"learning_rate": 0.000462,
"loss": 6.9658,
"mean_token_accuracy": 0.10290167108178139,
"num_tokens": 1906187.0,
"step": 925
},
{
"entropy": 7.008241748809814,
"epoch": 0.8255659121171771,
"grad_norm": 1.078125,
"learning_rate": 0.0004645,
"loss": 6.9215,
"mean_token_accuracy": 0.09948821216821671,
"num_tokens": 1915585.0,
"step": 930
},
{
"entropy": 6.954188346862793,
"epoch": 0.8300044385264093,
"grad_norm": 0.9140625,
"learning_rate": 0.000467,
"loss": 6.9624,
"mean_token_accuracy": 0.1034872155636549,
"num_tokens": 1926912.0,
"step": 935
},
{
"entropy": 6.975879383087158,
"epoch": 0.8344429649356414,
"grad_norm": 1.140625,
"learning_rate": 0.0004695,
"loss": 6.8828,
"mean_token_accuracy": 0.1049314372241497,
"num_tokens": 1936542.0,
"step": 940
},
{
"entropy": 7.032291650772095,
"epoch": 0.8388814913448736,
"grad_norm": 1.1640625,
"learning_rate": 0.000472,
"loss": 6.8869,
"mean_token_accuracy": 0.1079288512468338,
"num_tokens": 1946052.0,
"step": 945
},
{
"entropy": 6.855350923538208,
"epoch": 0.8433200177541056,
"grad_norm": 1.1171875,
"learning_rate": 0.0004745,
"loss": 6.9479,
"mean_token_accuracy": 0.10810579061508178,
"num_tokens": 1957352.0,
"step": 950
},
{
"entropy": 7.012834692001343,
"epoch": 0.8477585441633377,
"grad_norm": 1.0546875,
"learning_rate": 0.000477,
"loss": 6.9165,
"mean_token_accuracy": 0.10588640198111535,
"num_tokens": 1967538.0,
"step": 955
},
{
"entropy": 6.953670644760132,
"epoch": 0.8521970705725699,
"grad_norm": 0.9609375,
"learning_rate": 0.0004795,
"loss": 6.9437,
"mean_token_accuracy": 0.10475035384297371,
"num_tokens": 1977620.0,
"step": 960
},
{
"entropy": 7.001286792755127,
"epoch": 0.856635596981802,
"grad_norm": 0.9609375,
"learning_rate": 0.000482,
"loss": 6.8474,
"mean_token_accuracy": 0.10972543135285377,
"num_tokens": 1987534.0,
"step": 965
},
{
"entropy": 6.883567142486572,
"epoch": 0.8610741233910342,
"grad_norm": 1.046875,
"learning_rate": 0.0004845,
"loss": 6.8677,
"mean_token_accuracy": 0.11282802000641823,
"num_tokens": 1997817.0,
"step": 970
},
{
"entropy": 6.960841703414917,
"epoch": 0.8655126498002663,
"grad_norm": 1.1328125,
"learning_rate": 0.000487,
"loss": 6.8693,
"mean_token_accuracy": 0.10804260671138763,
"num_tokens": 2007529.0,
"step": 975
},
{
"entropy": 6.893871688842774,
"epoch": 0.8699511762094985,
"grad_norm": 1.0625,
"learning_rate": 0.0004895,
"loss": 6.8747,
"mean_token_accuracy": 0.1100342482328415,
"num_tokens": 2017317.0,
"step": 980
},
{
"entropy": 6.920565032958985,
"epoch": 0.8743897026187306,
"grad_norm": 1.0234375,
"learning_rate": 0.000492,
"loss": 6.8925,
"mean_token_accuracy": 0.10560473203659057,
"num_tokens": 2028427.0,
"step": 985
},
{
"entropy": 6.928885173797608,
"epoch": 0.8788282290279628,
"grad_norm": 1.078125,
"learning_rate": 0.0004945,
"loss": 6.8469,
"mean_token_accuracy": 0.111257666349411,
"num_tokens": 2038464.0,
"step": 990
},
{
"entropy": 6.895605516433716,
"epoch": 0.8832667554371949,
"grad_norm": 1.03125,
"learning_rate": 0.000497,
"loss": 6.9248,
"mean_token_accuracy": 0.10252941846847534,
"num_tokens": 2049006.0,
"step": 995
},
{
"entropy": 6.840125465393067,
"epoch": 0.8877052818464269,
"grad_norm": 1.1484375,
"learning_rate": 0.0004995,
"loss": 6.8673,
"mean_token_accuracy": 0.10938069224357605,
"num_tokens": 2060436.0,
"step": 1000
},
{
"epoch": 0.8877052818464269,
"eval_entropy": 6.823905027394057,
"eval_loss": 6.903217315673828,
"eval_mean_token_accuracy": 0.10246794701790583,
"eval_num_tokens": 2060436.0,
"eval_runtime": 2.7045,
"eval_samples_per_second": 1244.948,
"eval_steps_per_second": 155.665,
"step": 1000
},
{
"entropy": 6.8510839462280275,
"epoch": 0.8921438082556591,
"grad_norm": 0.9375,
"learning_rate": 0.0004999998312369076,
"loss": 6.7705,
"mean_token_accuracy": 0.1085792139172554,
"num_tokens": 2070906.0,
"step": 1005
},
{
"entropy": 6.848130416870117,
"epoch": 0.8965823346648912,
"grad_norm": 1.015625,
"learning_rate": 0.0004999991456372788,
"loss": 6.8232,
"mean_token_accuracy": 0.10221576392650604,
"num_tokens": 2080563.0,
"step": 1010
},
{
"entropy": 6.826877164840698,
"epoch": 0.9010208610741234,
"grad_norm": 1.078125,
"learning_rate": 0.000499997932655026,
"loss": 6.7509,
"mean_token_accuracy": 0.11835153996944428,
"num_tokens": 2089785.0,
"step": 1015
},
{
"entropy": 6.89136643409729,
"epoch": 0.9054593874833555,
"grad_norm": 1.0625,
"learning_rate": 0.0004999961922929925,
"loss": 6.798,
"mean_token_accuracy": 0.11268565952777862,
"num_tokens": 2099609.0,
"step": 1020
},
{
"entropy": 6.894064235687256,
"epoch": 0.9098979138925877,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999939245552573,
"loss": 6.8422,
"mean_token_accuracy": 0.11023318842053413,
"num_tokens": 2110043.0,
"step": 1025
},
{
"entropy": 6.8520002365112305,
"epoch": 0.9143364403018198,
"grad_norm": 1.03125,
"learning_rate": 0.000499991129447136,
"loss": 6.8665,
"mean_token_accuracy": 0.1076730340719223,
"num_tokens": 2119748.0,
"step": 1030
},
{
"entropy": 6.8474874019622805,
"epoch": 0.918774966711052,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999878069751803,
"loss": 6.8907,
"mean_token_accuracy": 0.10536454170942307,
"num_tokens": 2130347.0,
"step": 1035
},
{
"entropy": 6.900251626968384,
"epoch": 0.9232134931202841,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999839571471776,
"loss": 6.7778,
"mean_token_accuracy": 0.1090541049838066,
"num_tokens": 2140499.0,
"step": 1040
},
{
"entropy": 6.788918542861938,
"epoch": 0.9276520195295161,
"grad_norm": 1.125,
"learning_rate": 0.0004999795799721517,
"loss": 6.7795,
"mean_token_accuracy": 0.10508258789777755,
"num_tokens": 2151143.0,
"step": 1045
},
{
"entropy": 6.702548313140869,
"epoch": 0.9320905459387483,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999746754603624,
"loss": 6.8099,
"mean_token_accuracy": 0.1090174950659275,
"num_tokens": 2161651.0,
"step": 1050
},
{
"entropy": 6.934295988082885,
"epoch": 0.9365290723479804,
"grad_norm": 1.078125,
"learning_rate": 0.0004999692436233055,
"loss": 6.8146,
"mean_token_accuracy": 0.1094007097184658,
"num_tokens": 2172152.0,
"step": 1055
},
{
"entropy": 6.8816564083099365,
"epoch": 0.9409675987572126,
"grad_norm": 1.140625,
"learning_rate": 0.000499963284473713,
"loss": 6.8335,
"mean_token_accuracy": 0.1026708424091339,
"num_tokens": 2182912.0,
"step": 1060
},
{
"entropy": 6.725460863113403,
"epoch": 0.9454061251664447,
"grad_norm": 1.03125,
"learning_rate": 0.0004999567980255526,
"loss": 6.8253,
"mean_token_accuracy": 0.10950745418667793,
"num_tokens": 2193573.0,
"step": 1065
},
{
"entropy": 6.998191976547242,
"epoch": 0.9498446515756769,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999497842940282,
"loss": 6.8627,
"mean_token_accuracy": 0.1091019332408905,
"num_tokens": 2204157.0,
"step": 1070
},
{
"entropy": 6.804390239715576,
"epoch": 0.954283177984909,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999422432955794,
"loss": 6.8426,
"mean_token_accuracy": 0.11238477602601052,
"num_tokens": 2214433.0,
"step": 1075
},
{
"entropy": 6.7941382884979244,
"epoch": 0.9587217043941412,
"grad_norm": 0.859375,
"learning_rate": 0.0004999341750478818,
"loss": 6.7722,
"mean_token_accuracy": 0.1097018837928772,
"num_tokens": 2224913.0,
"step": 1080
},
{
"entropy": 6.810701084136963,
"epoch": 0.9631602308033733,
"grad_norm": 1.09375,
"learning_rate": 0.000499925579569847,
"loss": 6.7335,
"mean_token_accuracy": 0.12259945124387742,
"num_tokens": 2234871.0,
"step": 1085
},
{
"entropy": 6.818542575836181,
"epoch": 0.9675987572126055,
"grad_norm": 1.2734375,
"learning_rate": 0.0004999164568816219,
"loss": 6.7889,
"mean_token_accuracy": 0.10602138787508011,
"num_tokens": 2244462.0,
"step": 1090
},
{
"entropy": 6.706165170669555,
"epoch": 0.9720372836218375,
"grad_norm": 1.140625,
"learning_rate": 0.0004999068070045897,
"loss": 6.7827,
"mean_token_accuracy": 0.10748272910714149,
"num_tokens": 2256145.0,
"step": 1095
},
{
"entropy": 6.83993878364563,
"epoch": 0.9764758100310696,
"grad_norm": 1.0859375,
"learning_rate": 0.000499896629961369,
"loss": 6.7837,
"mean_token_accuracy": 0.11425440460443496,
"num_tokens": 2265913.0,
"step": 1100
},
{
"entropy": 6.725751304626465,
"epoch": 0.9809143364403018,
"grad_norm": 1.0546875,
"learning_rate": 0.000499885925775814,
"loss": 6.7316,
"mean_token_accuracy": 0.11490511074662209,
"num_tokens": 2274874.0,
"step": 1105
},
{
"entropy": 6.830372858047485,
"epoch": 0.9853528628495339,
"grad_norm": 1.046875,
"learning_rate": 0.0004998746944730148,
"loss": 6.7131,
"mean_token_accuracy": 0.11283201426267624,
"num_tokens": 2284767.0,
"step": 1110
},
{
"entropy": 6.874453449249268,
"epoch": 0.9897913892587661,
"grad_norm": 1.0625,
"learning_rate": 0.0004998629360792965,
"loss": 6.8831,
"mean_token_accuracy": 0.10844636484980583,
"num_tokens": 2295196.0,
"step": 1115
},
{
"entropy": 6.715284633636474,
"epoch": 0.9942299156679982,
"grad_norm": 0.9296875,
"learning_rate": 0.0004998506506222202,
"loss": 6.7286,
"mean_token_accuracy": 0.11680992171168328,
"num_tokens": 2306078.0,
"step": 1120
},
{
"entropy": 6.814456415176392,
"epoch": 0.9986684420772304,
"grad_norm": 0.890625,
"learning_rate": 0.0004998378381305821,
"loss": 6.8094,
"mean_token_accuracy": 0.10992804765701295,
"num_tokens": 2317229.0,
"step": 1125
},
{
"entropy": 6.859947204589844,
"epoch": 1.0026631158455392,
"grad_norm": 0.98046875,
"learning_rate": 0.0004998244986344138,
"loss": 6.688,
"mean_token_accuracy": 0.11234754075606664,
"num_tokens": 2326312.0,
"step": 1130
},
{
"entropy": 6.762184476852417,
"epoch": 1.0071016422547714,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998106321649822,
"loss": 6.5436,
"mean_token_accuracy": 0.12012127339839936,
"num_tokens": 2335548.0,
"step": 1135
},
{
"entropy": 6.783463954925537,
"epoch": 1.0115401686640035,
"grad_norm": 1.1015625,
"learning_rate": 0.0004997962387547893,
"loss": 6.5731,
"mean_token_accuracy": 0.11604165062308311,
"num_tokens": 2346180.0,
"step": 1140
},
{
"entropy": 6.728586292266845,
"epoch": 1.0159786950732357,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997813184375723,
"loss": 6.5403,
"mean_token_accuracy": 0.11700786501169205,
"num_tokens": 2355682.0,
"step": 1145
},
{
"entropy": 6.737982702255249,
"epoch": 1.0204172214824678,
"grad_norm": 1.0703125,
"learning_rate": 0.0004997658712483034,
"loss": 6.5789,
"mean_token_accuracy": 0.11569899022579193,
"num_tokens": 2365529.0,
"step": 1150
},
{
"entropy": 6.645860004425049,
"epoch": 1.0248557478917,
"grad_norm": 1.109375,
"learning_rate": 0.0004997498972231898,
"loss": 6.4906,
"mean_token_accuracy": 0.12428833544254303,
"num_tokens": 2375527.0,
"step": 1155
},
{
"entropy": 6.723867797851563,
"epoch": 1.0292942743009321,
"grad_norm": 1.0546875,
"learning_rate": 0.0004997333963996734,
"loss": 6.6103,
"mean_token_accuracy": 0.11796300113201141,
"num_tokens": 2386425.0,
"step": 1160
},
{
"entropy": 6.686568021774292,
"epoch": 1.0337328007101643,
"grad_norm": 0.98828125,
"learning_rate": 0.0004997163688164313,
"loss": 6.6209,
"mean_token_accuracy": 0.11397269815206527,
"num_tokens": 2396897.0,
"step": 1165
},
{
"entropy": 6.736155891418457,
"epoch": 1.0381713271193964,
"grad_norm": 0.98046875,
"learning_rate": 0.0004996988145133745,
"loss": 6.6215,
"mean_token_accuracy": 0.11120860427618026,
"num_tokens": 2408671.0,
"step": 1170
},
{
"entropy": 6.68158974647522,
"epoch": 1.0426098535286286,
"grad_norm": 1.125,
"learning_rate": 0.0004996807335316496,
"loss": 6.5968,
"mean_token_accuracy": 0.11955826655030251,
"num_tokens": 2418373.0,
"step": 1175
},
{
"entropy": 6.73370852470398,
"epoch": 1.0470483799378607,
"grad_norm": 1.15625,
"learning_rate": 0.0004996621259136368,
"loss": 6.5516,
"mean_token_accuracy": 0.12124700546264648,
"num_tokens": 2429094.0,
"step": 1180
},
{
"entropy": 6.58090991973877,
"epoch": 1.0514869063470929,
"grad_norm": 1.109375,
"learning_rate": 0.0004996429917029513,
"loss": 6.5521,
"mean_token_accuracy": 0.11974199712276459,
"num_tokens": 2439522.0,
"step": 1185
},
{
"entropy": 6.689072942733764,
"epoch": 1.055925432756325,
"grad_norm": 1.109375,
"learning_rate": 0.0004996233309444424,
"loss": 6.5334,
"mean_token_accuracy": 0.12693726643919945,
"num_tokens": 2449900.0,
"step": 1190
},
{
"entropy": 6.648254156112671,
"epoch": 1.060363959165557,
"grad_norm": 0.97265625,
"learning_rate": 0.0004996031436841934,
"loss": 6.528,
"mean_token_accuracy": 0.11835195198655128,
"num_tokens": 2461187.0,
"step": 1195
},
{
"entropy": 6.613636541366577,
"epoch": 1.064802485574789,
"grad_norm": 0.98828125,
"learning_rate": 0.0004995824299695219,
"loss": 6.5522,
"mean_token_accuracy": 0.12386145591735839,
"num_tokens": 2471897.0,
"step": 1200
},
{
"entropy": 6.695000886917114,
"epoch": 1.0692410119840212,
"grad_norm": 1.015625,
"learning_rate": 0.0004995611898489796,
"loss": 6.4835,
"mean_token_accuracy": 0.13428002893924712,
"num_tokens": 2482668.0,
"step": 1205
},
{
"entropy": 6.542116737365722,
"epoch": 1.0736795383932534,
"grad_norm": 1.171875,
"learning_rate": 0.0004995394233723516,
"loss": 6.5273,
"mean_token_accuracy": 0.12380995452404023,
"num_tokens": 2492375.0,
"step": 1210
},
{
"entropy": 6.612301158905029,
"epoch": 1.0781180648024855,
"grad_norm": 0.96875,
"learning_rate": 0.0004995171305906574,
"loss": 6.5553,
"mean_token_accuracy": 0.12436272650957107,
"num_tokens": 2504176.0,
"step": 1215
},
{
"entropy": 6.712629508972168,
"epoch": 1.0825565912117177,
"grad_norm": 1.2265625,
"learning_rate": 0.0004994943115561495,
"loss": 6.5802,
"mean_token_accuracy": 0.12135286405682563,
"num_tokens": 2513437.0,
"step": 1220
},
{
"entropy": 6.71323561668396,
"epoch": 1.0869951176209498,
"grad_norm": 0.9765625,
"learning_rate": 0.0004994709663223143,
"loss": 6.5305,
"mean_token_accuracy": 0.12117772102355957,
"num_tokens": 2524907.0,
"step": 1225
},
{
"entropy": 6.586472082138061,
"epoch": 1.091433644030182,
"grad_norm": 1.1171875,
"learning_rate": 0.0004994470949438712,
"loss": 6.4818,
"mean_token_accuracy": 0.1203920915722847,
"num_tokens": 2535288.0,
"step": 1230
},
{
"entropy": 6.5804437637329105,
"epoch": 1.095872170439414,
"grad_norm": 0.9921875,
"learning_rate": 0.0004994226974767734,
"loss": 6.5353,
"mean_token_accuracy": 0.11931732892990113,
"num_tokens": 2545896.0,
"step": 1235
},
{
"entropy": 6.543254709243774,
"epoch": 1.1003106968486462,
"grad_norm": 1.0546875,
"learning_rate": 0.0004993977739782066,
"loss": 6.4584,
"mean_token_accuracy": 0.13561398088932036,
"num_tokens": 2555440.0,
"step": 1240
},
{
"entropy": 6.59882869720459,
"epoch": 1.1047492232578784,
"grad_norm": 1.0078125,
"learning_rate": 0.00049937232450659,
"loss": 6.4693,
"mean_token_accuracy": 0.12519273459911345,
"num_tokens": 2565474.0,
"step": 1245
},
{
"entropy": 6.621742391586304,
"epoch": 1.1091877496671105,
"grad_norm": 1.296875,
"learning_rate": 0.0004993463491215753,
"loss": 6.5707,
"mean_token_accuracy": 0.11752136424183846,
"num_tokens": 2576090.0,
"step": 1250
},
{
"entropy": 6.66785740852356,
"epoch": 1.1136262760763427,
"grad_norm": 1.0,
"learning_rate": 0.000499319847884047,
"loss": 6.48,
"mean_token_accuracy": 0.12498680129647255,
"num_tokens": 2585719.0,
"step": 1255
},
{
"entropy": 6.547177171707153,
"epoch": 1.1180648024855748,
"grad_norm": 1.046875,
"learning_rate": 0.0004992928208561224,
"loss": 6.4818,
"mean_token_accuracy": 0.12778932899236678,
"num_tokens": 2594797.0,
"step": 1260
},
{
"entropy": 6.544874048233032,
"epoch": 1.122503328894807,
"grad_norm": 0.9921875,
"learning_rate": 0.0004992652681011508,
"loss": 6.5028,
"mean_token_accuracy": 0.12365371584892274,
"num_tokens": 2605525.0,
"step": 1265
},
{
"entropy": 6.667212867736817,
"epoch": 1.1269418553040391,
"grad_norm": 0.9765625,
"learning_rate": 0.000499237189683714,
"loss": 6.543,
"mean_token_accuracy": 0.12363962829113007,
"num_tokens": 2616478.0,
"step": 1270
},
{
"entropy": 6.585494756698608,
"epoch": 1.1313803817132713,
"grad_norm": 1.046875,
"learning_rate": 0.0004992085856696259,
"loss": 6.5255,
"mean_token_accuracy": 0.12803056016564368,
"num_tokens": 2626290.0,
"step": 1275
},
{
"entropy": 6.660335063934326,
"epoch": 1.1358189081225034,
"grad_norm": 1.0625,
"learning_rate": 0.0004991794561259325,
"loss": 6.5861,
"mean_token_accuracy": 0.11459894254803657,
"num_tokens": 2637319.0,
"step": 1280
},
{
"entropy": 6.654719829559326,
"epoch": 1.1402574345317356,
"grad_norm": 1.0546875,
"learning_rate": 0.0004991498011209112,
"loss": 6.5036,
"mean_token_accuracy": 0.1196965254843235,
"num_tokens": 2648140.0,
"step": 1285
},
{
"entropy": 6.520665168762207,
"epoch": 1.1446959609409677,
"grad_norm": 1.078125,
"learning_rate": 0.0004991196207240714,
"loss": 6.5534,
"mean_token_accuracy": 0.12024708986282348,
"num_tokens": 2658561.0,
"step": 1290
},
{
"entropy": 6.740872001647949,
"epoch": 1.1491344873501999,
"grad_norm": 1.59375,
"learning_rate": 0.0004990889150061541,
"loss": 6.421,
"mean_token_accuracy": 0.13026004359126092,
"num_tokens": 2670233.0,
"step": 1295
},
{
"entropy": 6.636859560012818,
"epoch": 1.1535730137594318,
"grad_norm": 1.0546875,
"learning_rate": 0.0004990576840391312,
"loss": 6.4896,
"mean_token_accuracy": 0.12343377694487571,
"num_tokens": 2681047.0,
"step": 1300
},
{
"entropy": 6.514160776138306,
"epoch": 1.158011540168664,
"grad_norm": 1.15625,
"learning_rate": 0.000499025927896206,
"loss": 6.4793,
"mean_token_accuracy": 0.12569797188043594,
"num_tokens": 2691284.0,
"step": 1305
},
{
"entropy": 6.50507082939148,
"epoch": 1.162450066577896,
"grad_norm": 1.0234375,
"learning_rate": 0.0004989936466518127,
"loss": 6.4791,
"mean_token_accuracy": 0.12733488231897355,
"num_tokens": 2702105.0,
"step": 1310
},
{
"entropy": 6.660071849822998,
"epoch": 1.1668885929871282,
"grad_norm": 1.0546875,
"learning_rate": 0.0004989608403816164,
"loss": 6.4392,
"mean_token_accuracy": 0.1262727789580822,
"num_tokens": 2712003.0,
"step": 1315
},
{
"entropy": 6.480842781066895,
"epoch": 1.1713271193963604,
"grad_norm": 1.234375,
"learning_rate": 0.0004989275091625126,
"loss": 6.4644,
"mean_token_accuracy": 0.12619971707463265,
"num_tokens": 2721609.0,
"step": 1320
},
{
"entropy": 6.514829921722412,
"epoch": 1.1757656458055925,
"grad_norm": 1.0390625,
"learning_rate": 0.0004988936530726276,
"loss": 6.3574,
"mean_token_accuracy": 0.1336055465042591,
"num_tokens": 2731036.0,
"step": 1325
},
{
"entropy": 6.577421188354492,
"epoch": 1.1802041722148247,
"grad_norm": 1.0078125,
"learning_rate": 0.0004988592721913176,
"loss": 6.4856,
"mean_token_accuracy": 0.12642226815223695,
"num_tokens": 2741860.0,
"step": 1330
},
{
"entropy": 6.4255718231201175,
"epoch": 1.1846426986240568,
"grad_norm": 1.015625,
"learning_rate": 0.0004988243665991692,
"loss": 6.4757,
"mean_token_accuracy": 0.12892607748508453,
"num_tokens": 2751898.0,
"step": 1335
},
{
"entropy": 6.610957288742066,
"epoch": 1.189081225033289,
"grad_norm": 1.1171875,
"learning_rate": 0.0004987889363779985,
"loss": 6.4425,
"mean_token_accuracy": 0.13178927153348924,
"num_tokens": 2761193.0,
"step": 1340
},
{
"entropy": 6.46262493133545,
"epoch": 1.193519751442521,
"grad_norm": 0.953125,
"learning_rate": 0.0004987529816108517,
"loss": 6.4799,
"mean_token_accuracy": 0.1273398607969284,
"num_tokens": 2771693.0,
"step": 1345
},
{
"entropy": 6.6233940601348875,
"epoch": 1.1979582778517532,
"grad_norm": 1.0703125,
"learning_rate": 0.0004987165023820043,
"loss": 6.4757,
"mean_token_accuracy": 0.12488154098391532,
"num_tokens": 2780680.0,
"step": 1350
},
{
"entropy": 6.422232627868652,
"epoch": 1.2023968042609854,
"grad_norm": 1.078125,
"learning_rate": 0.0004986794987769611,
"loss": 6.4691,
"mean_token_accuracy": 0.13016403540968896,
"num_tokens": 2792049.0,
"step": 1355
},
{
"entropy": 6.61912989616394,
"epoch": 1.2068353306702175,
"grad_norm": 0.98046875,
"learning_rate": 0.000498641970882456,
"loss": 6.5094,
"mean_token_accuracy": 0.11824153885245323,
"num_tokens": 2802284.0,
"step": 1360
},
{
"entropy": 6.5044067859649655,
"epoch": 1.2112738570794497,
"grad_norm": 1.0859375,
"learning_rate": 0.0004986039187864518,
"loss": 6.4687,
"mean_token_accuracy": 0.1283252492547035,
"num_tokens": 2812791.0,
"step": 1365
},
{
"entropy": 6.563082885742188,
"epoch": 1.2157123834886818,
"grad_norm": 1.0546875,
"learning_rate": 0.0004985653425781401,
"loss": 6.5185,
"mean_token_accuracy": 0.12203285768628121,
"num_tokens": 2823216.0,
"step": 1370
},
{
"entropy": 6.505474853515625,
"epoch": 1.220150909897914,
"grad_norm": 1.0234375,
"learning_rate": 0.0004985262423479408,
"loss": 6.4274,
"mean_token_accuracy": 0.13895628824830056,
"num_tokens": 2832582.0,
"step": 1375
},
{
"entropy": 6.52580771446228,
"epoch": 1.2245894363071461,
"grad_norm": 0.93359375,
"learning_rate": 0.0004984866181875021,
"loss": 6.4579,
"mean_token_accuracy": 0.12877390310168266,
"num_tokens": 2843576.0,
"step": 1380
},
{
"entropy": 6.516999197006226,
"epoch": 1.229027962716378,
"grad_norm": 1.140625,
"learning_rate": 0.0004984464701897005,
"loss": 6.456,
"mean_token_accuracy": 0.12886594235897064,
"num_tokens": 2854028.0,
"step": 1385
},
{
"entropy": 6.550729846954345,
"epoch": 1.2334664891256102,
"grad_norm": 1.015625,
"learning_rate": 0.0004984057984486402,
"loss": 6.4491,
"mean_token_accuracy": 0.1290650874376297,
"num_tokens": 2863695.0,
"step": 1390
},
{
"entropy": 6.497787046432495,
"epoch": 1.2379050155348423,
"grad_norm": 1.046875,
"learning_rate": 0.0004983646030596527,
"loss": 6.4078,
"mean_token_accuracy": 0.12960500344634057,
"num_tokens": 2873134.0,
"step": 1395
},
{
"entropy": 6.530357122421265,
"epoch": 1.2423435419440745,
"grad_norm": 1.078125,
"learning_rate": 0.0004983228841192975,
"loss": 6.4504,
"mean_token_accuracy": 0.12851642668247223,
"num_tokens": 2883559.0,
"step": 1400
},
{
"entropy": 6.488299894332886,
"epoch": 1.2467820683533066,
"grad_norm": 1.1796875,
"learning_rate": 0.0004982806417253607,
"loss": 6.422,
"mean_token_accuracy": 0.12727490290999413,
"num_tokens": 2893541.0,
"step": 1405
},
{
"entropy": 6.5642862796783445,
"epoch": 1.2512205947625388,
"grad_norm": 1.078125,
"learning_rate": 0.0004982378759768557,
"loss": 6.459,
"mean_token_accuracy": 0.12929099127650262,
"num_tokens": 2903390.0,
"step": 1410
},
{
"entropy": 6.462419414520264,
"epoch": 1.255659121171771,
"grad_norm": 1.1015625,
"learning_rate": 0.0004981945869740225,
"loss": 6.3934,
"mean_token_accuracy": 0.13202970251441,
"num_tokens": 2913071.0,
"step": 1415
},
{
"entropy": 6.547803783416748,
"epoch": 1.260097647581003,
"grad_norm": 1.03125,
"learning_rate": 0.0004981507748183276,
"loss": 6.5538,
"mean_token_accuracy": 0.12963883131742476,
"num_tokens": 2925266.0,
"step": 1420
},
{
"entropy": 6.489030170440674,
"epoch": 1.2645361739902352,
"grad_norm": 1.0703125,
"learning_rate": 0.0004981064396124635,
"loss": 6.4396,
"mean_token_accuracy": 0.12705525755882263,
"num_tokens": 2935347.0,
"step": 1425
},
{
"entropy": 6.553302574157715,
"epoch": 1.2689747003994674,
"grad_norm": 1.1640625,
"learning_rate": 0.0004980615814603492,
"loss": 6.5228,
"mean_token_accuracy": 0.12255004495382309,
"num_tokens": 2945381.0,
"step": 1430
},
{
"entropy": 6.548076343536377,
"epoch": 1.2734132268086995,
"grad_norm": 1.0703125,
"learning_rate": 0.0004980162004671288,
"loss": 6.4853,
"mean_token_accuracy": 0.12323620095849037,
"num_tokens": 2956332.0,
"step": 1435
},
{
"entropy": 6.490498161315918,
"epoch": 1.2778517532179317,
"grad_norm": 1.0,
"learning_rate": 0.0004979702967391725,
"loss": 6.4637,
"mean_token_accuracy": 0.1297840654850006,
"num_tokens": 2966563.0,
"step": 1440
},
{
"entropy": 6.459001588821411,
"epoch": 1.2822902796271638,
"grad_norm": 1.2421875,
"learning_rate": 0.0004979238703840755,
"loss": 6.4291,
"mean_token_accuracy": 0.13188086450099945,
"num_tokens": 2976078.0,
"step": 1445
},
{
"entropy": 6.535675382614135,
"epoch": 1.286728806036396,
"grad_norm": 1.0234375,
"learning_rate": 0.0004978769215106579,
"loss": 6.51,
"mean_token_accuracy": 0.11516684889793397,
"num_tokens": 2985889.0,
"step": 1450
},
{
"entropy": 6.561489534378052,
"epoch": 1.291167332445628,
"grad_norm": 1.53125,
"learning_rate": 0.0004978294502289646,
"loss": 6.4789,
"mean_token_accuracy": 0.12259078919887542,
"num_tokens": 2996244.0,
"step": 1455
},
{
"entropy": 6.490956830978393,
"epoch": 1.2956058588548602,
"grad_norm": 1.109375,
"learning_rate": 0.0004977814566502651,
"loss": 6.4193,
"mean_token_accuracy": 0.12861331328749656,
"num_tokens": 3006212.0,
"step": 1460
},
{
"entropy": 6.499041128158569,
"epoch": 1.3000443852640924,
"grad_norm": 1.0234375,
"learning_rate": 0.0004977329408870532,
"loss": 6.409,
"mean_token_accuracy": 0.12722128033638,
"num_tokens": 3016763.0,
"step": 1465
},
{
"entropy": 6.4857086658477785,
"epoch": 1.3044829116733245,
"grad_norm": 1.0390625,
"learning_rate": 0.0004976839030530464,
"loss": 6.3783,
"mean_token_accuracy": 0.13740343004465103,
"num_tokens": 3027111.0,
"step": 1470
},
{
"entropy": 6.542345571517944,
"epoch": 1.3089214380825567,
"grad_norm": 1.0390625,
"learning_rate": 0.000497634343263186,
"loss": 6.4623,
"mean_token_accuracy": 0.12753049805760383,
"num_tokens": 3037549.0,
"step": 1475
},
{
"entropy": 6.353925800323486,
"epoch": 1.3133599644917888,
"grad_norm": 1.09375,
"learning_rate": 0.0004975842616336369,
"loss": 6.386,
"mean_token_accuracy": 0.13300835117697715,
"num_tokens": 3048033.0,
"step": 1480
},
{
"entropy": 6.501514005661011,
"epoch": 1.317798490901021,
"grad_norm": 1.03125,
"learning_rate": 0.0004975336582817869,
"loss": 6.3997,
"mean_token_accuracy": 0.13204055801033973,
"num_tokens": 3057503.0,
"step": 1485
},
{
"entropy": 6.487248039245605,
"epoch": 1.3222370173102531,
"grad_norm": 0.97265625,
"learning_rate": 0.0004974825333262469,
"loss": 6.4642,
"mean_token_accuracy": 0.12323634922504426,
"num_tokens": 3068216.0,
"step": 1490
},
{
"entropy": 6.558629322052002,
"epoch": 1.3266755437194853,
"grad_norm": 0.98046875,
"learning_rate": 0.0004974308868868501,
"loss": 6.4271,
"mean_token_accuracy": 0.13236989378929137,
"num_tokens": 3079471.0,
"step": 1495
},
{
"entropy": 6.5367296695709225,
"epoch": 1.3311140701287172,
"grad_norm": 0.91015625,
"learning_rate": 0.0004973787190846524,
"loss": 6.518,
"mean_token_accuracy": 0.12429615929722786,
"num_tokens": 3090996.0,
"step": 1500
},
{
"epoch": 1.3311140701287172,
"eval_entropy": 6.421620451639497,
"eval_loss": 6.5496826171875,
"eval_mean_token_accuracy": 0.12521972324955774,
"eval_num_tokens": 3090996.0,
"eval_runtime": 2.6959,
"eval_samples_per_second": 1248.929,
"eval_steps_per_second": 156.163,
"step": 1500
},
{
"entropy": 6.472316646575928,
"epoch": 1.3355525965379493,
"grad_norm": 1.2734375,
"learning_rate": 0.0004973260300419316,
"loss": 6.466,
"mean_token_accuracy": 0.1273823134601116,
"num_tokens": 3100445.0,
"step": 1505
},
{
"entropy": 6.405650186538696,
"epoch": 1.3399911229471815,
"grad_norm": 0.96875,
"learning_rate": 0.0004972728198821871,
"loss": 6.3772,
"mean_token_accuracy": 0.13720163628458976,
"num_tokens": 3110065.0,
"step": 1510
},
{
"entropy": 6.48620924949646,
"epoch": 1.3444296493564136,
"grad_norm": 1.0078125,
"learning_rate": 0.00049721908873014,
"loss": 6.4228,
"mean_token_accuracy": 0.12824928835034372,
"num_tokens": 3120323.0,
"step": 1515
},
{
"entropy": 6.523930549621582,
"epoch": 1.3488681757656458,
"grad_norm": 0.8828125,
"learning_rate": 0.0004971648367117323,
"loss": 6.464,
"mean_token_accuracy": 0.12202735692262649,
"num_tokens": 3131268.0,
"step": 1520
},
{
"entropy": 6.500436449050904,
"epoch": 1.353306702174878,
"grad_norm": 0.93359375,
"learning_rate": 0.0004971100639541271,
"loss": 6.3697,
"mean_token_accuracy": 0.13300676867365838,
"num_tokens": 3141529.0,
"step": 1525
},
{
"entropy": 6.385044431686401,
"epoch": 1.35774522858411,
"grad_norm": 1.015625,
"learning_rate": 0.000497054770585708,
"loss": 6.3884,
"mean_token_accuracy": 0.13427990674972534,
"num_tokens": 3151096.0,
"step": 1530
},
{
"entropy": 6.540951824188232,
"epoch": 1.3621837549933422,
"grad_norm": 1.03125,
"learning_rate": 0.0004969989567360788,
"loss": 6.3651,
"mean_token_accuracy": 0.126102414727211,
"num_tokens": 3160900.0,
"step": 1535
},
{
"entropy": 6.315720701217652,
"epoch": 1.3666222814025744,
"grad_norm": 1.1484375,
"learning_rate": 0.0004969426225360635,
"loss": 6.3444,
"mean_token_accuracy": 0.1334808275103569,
"num_tokens": 3171303.0,
"step": 1540
},
{
"entropy": 6.431712341308594,
"epoch": 1.3710608078118065,
"grad_norm": 1.609375,
"learning_rate": 0.0004968857681177056,
"loss": 6.4942,
"mean_token_accuracy": 0.12975035086274148,
"num_tokens": 3181924.0,
"step": 1545
},
{
"entropy": 6.435882043838501,
"epoch": 1.3754993342210386,
"grad_norm": 1.0234375,
"learning_rate": 0.0004968283936142679,
"loss": 6.359,
"mean_token_accuracy": 0.13290246427059174,
"num_tokens": 3192018.0,
"step": 1550
},
{
"entropy": 6.475548458099365,
"epoch": 1.3799378606302708,
"grad_norm": 0.96484375,
"learning_rate": 0.0004967704991602322,
"loss": 6.3652,
"mean_token_accuracy": 0.1294732205569744,
"num_tokens": 3203064.0,
"step": 1555
},
{
"entropy": 6.439318323135376,
"epoch": 1.384376387039503,
"grad_norm": 1.0703125,
"learning_rate": 0.0004967120848912995,
"loss": 6.3961,
"mean_token_accuracy": 0.12799521535634995,
"num_tokens": 3213651.0,
"step": 1560
},
{
"entropy": 6.372346305847168,
"epoch": 1.388814913448735,
"grad_norm": 1.0625,
"learning_rate": 0.0004966531509443884,
"loss": 6.3479,
"mean_token_accuracy": 0.13649084344506263,
"num_tokens": 3224152.0,
"step": 1565
},
{
"entropy": 6.471084785461426,
"epoch": 1.3932534398579672,
"grad_norm": 0.95703125,
"learning_rate": 0.0004965936974576363,
"loss": 6.3545,
"mean_token_accuracy": 0.13298841714859008,
"num_tokens": 3234185.0,
"step": 1570
},
{
"entropy": 6.455093669891357,
"epoch": 1.3976919662671992,
"grad_norm": 1.0078125,
"learning_rate": 0.0004965337245703981,
"loss": 6.3767,
"mean_token_accuracy": 0.12946312502026558,
"num_tokens": 3244509.0,
"step": 1575
},
{
"entropy": 6.458269500732422,
"epoch": 1.4021304926764313,
"grad_norm": 1.140625,
"learning_rate": 0.0004964732324232462,
"loss": 6.4008,
"mean_token_accuracy": 0.12682827115058898,
"num_tokens": 3255157.0,
"step": 1580
},
{
"entropy": 6.34567403793335,
"epoch": 1.4065690190856635,
"grad_norm": 1.09375,
"learning_rate": 0.00049641222115797,
"loss": 6.2956,
"mean_token_accuracy": 0.13407586440443992,
"num_tokens": 3264367.0,
"step": 1585
},
{
"entropy": 6.4444191455841064,
"epoch": 1.4110075454948956,
"grad_norm": 1.015625,
"learning_rate": 0.0004963506909175758,
"loss": 6.3853,
"mean_token_accuracy": 0.12875387147068978,
"num_tokens": 3274678.0,
"step": 1590
},
{
"entropy": 6.426648998260498,
"epoch": 1.4154460719041277,
"grad_norm": 0.95703125,
"learning_rate": 0.000496288641846286,
"loss": 6.3707,
"mean_token_accuracy": 0.1277147874236107,
"num_tokens": 3285817.0,
"step": 1595
},
{
"entropy": 6.372090244293213,
"epoch": 1.41988459831336,
"grad_norm": 1.0390625,
"learning_rate": 0.0004962260740895398,
"loss": 6.2855,
"mean_token_accuracy": 0.13827268779277802,
"num_tokens": 3296303.0,
"step": 1600
},
{
"entropy": 6.379140472412109,
"epoch": 1.424323124722592,
"grad_norm": 1.1328125,
"learning_rate": 0.0004961629877939913,
"loss": 6.3871,
"mean_token_accuracy": 0.1381452649831772,
"num_tokens": 3305686.0,
"step": 1605
},
{
"entropy": 6.410601949691772,
"epoch": 1.4287616511318242,
"grad_norm": 0.98046875,
"learning_rate": 0.000496099383107511,
"loss": 6.3337,
"mean_token_accuracy": 0.13385034054517747,
"num_tokens": 3316243.0,
"step": 1610
},
{
"entropy": 6.363243675231933,
"epoch": 1.4332001775410563,
"grad_norm": 1.0390625,
"learning_rate": 0.0004960352601791835,
"loss": 6.3509,
"mean_token_accuracy": 0.1326597101986408,
"num_tokens": 3326118.0,
"step": 1615
},
{
"entropy": 6.420337390899658,
"epoch": 1.4376387039502885,
"grad_norm": 1.03125,
"learning_rate": 0.0004959706191593087,
"loss": 6.2826,
"mean_token_accuracy": 0.139851226657629,
"num_tokens": 3336597.0,
"step": 1620
},
{
"entropy": 6.367270183563233,
"epoch": 1.4420772303595206,
"grad_norm": 1.1328125,
"learning_rate": 0.0004959054601994007,
"loss": 6.3475,
"mean_token_accuracy": 0.13378802165389062,
"num_tokens": 3346958.0,
"step": 1625
},
{
"entropy": 6.393503141403198,
"epoch": 1.4465157567687528,
"grad_norm": 1.0546875,
"learning_rate": 0.0004958397834521878,
"loss": 6.3568,
"mean_token_accuracy": 0.1363594651222229,
"num_tokens": 3357068.0,
"step": 1630
},
{
"entropy": 6.357707118988037,
"epoch": 1.450954283177985,
"grad_norm": 1.0,
"learning_rate": 0.0004957735890716115,
"loss": 6.3272,
"mean_token_accuracy": 0.1293055720627308,
"num_tokens": 3367710.0,
"step": 1635
},
{
"entropy": 6.438919878005981,
"epoch": 1.455392809587217,
"grad_norm": 1.046875,
"learning_rate": 0.0004957068772128273,
"loss": 6.3926,
"mean_token_accuracy": 0.12550436183810235,
"num_tokens": 3377146.0,
"step": 1640
},
{
"entropy": 6.4241721630096436,
"epoch": 1.4598313359964492,
"grad_norm": 1.0703125,
"learning_rate": 0.000495639648032203,
"loss": 6.2687,
"mean_token_accuracy": 0.13697705715894698,
"num_tokens": 3387494.0,
"step": 1645
},
{
"entropy": 6.404942893981934,
"epoch": 1.4642698624056814,
"grad_norm": 1.03125,
"learning_rate": 0.0004955719016873192,
"loss": 6.271,
"mean_token_accuracy": 0.1324605606496334,
"num_tokens": 3397667.0,
"step": 1650
},
{
"entropy": 6.341697072982788,
"epoch": 1.4687083888149135,
"grad_norm": 1.0390625,
"learning_rate": 0.0004955036383369688,
"loss": 6.2882,
"mean_token_accuracy": 0.13828188329935073,
"num_tokens": 3407245.0,
"step": 1655
},
{
"entropy": 6.33912615776062,
"epoch": 1.4731469152241456,
"grad_norm": 0.9765625,
"learning_rate": 0.0004954348581411564,
"loss": 6.3502,
"mean_token_accuracy": 0.13207383826375008,
"num_tokens": 3417796.0,
"step": 1660
},
{
"entropy": 6.365179395675659,
"epoch": 1.4775854416333778,
"grad_norm": 1.0625,
"learning_rate": 0.000495365561261098,
"loss": 6.3521,
"mean_token_accuracy": 0.13066228553652764,
"num_tokens": 3427665.0,
"step": 1665
},
{
"entropy": 6.460514163970947,
"epoch": 1.48202396804261,
"grad_norm": 1.0859375,
"learning_rate": 0.0004952957478592209,
"loss": 6.4161,
"mean_token_accuracy": 0.13068753182888032,
"num_tokens": 3438279.0,
"step": 1670
},
{
"entropy": 6.346782398223877,
"epoch": 1.486462494451842,
"grad_norm": 1.28125,
"learning_rate": 0.0004952254180991628,
"loss": 6.3924,
"mean_token_accuracy": 0.1330470062792301,
"num_tokens": 3448722.0,
"step": 1675
},
{
"entropy": 6.355397272109985,
"epoch": 1.4909010208610742,
"grad_norm": 1.0546875,
"learning_rate": 0.0004951545721457719,
"loss": 6.3045,
"mean_token_accuracy": 0.14068271815776826,
"num_tokens": 3459050.0,
"step": 1680
},
{
"entropy": 6.3841273307800295,
"epoch": 1.4953395472703064,
"grad_norm": 1.078125,
"learning_rate": 0.0004950832101651062,
"loss": 6.2644,
"mean_token_accuracy": 0.13605008125305176,
"num_tokens": 3468833.0,
"step": 1685
},
{
"entropy": 6.393172645568848,
"epoch": 1.4997780736795385,
"grad_norm": 1.109375,
"learning_rate": 0.0004950113323244336,
"loss": 6.3353,
"mean_token_accuracy": 0.13272473365068435,
"num_tokens": 3479119.0,
"step": 1690
},
{
"entropy": 6.422500705718994,
"epoch": 1.5042166000887707,
"grad_norm": 0.99609375,
"learning_rate": 0.0004949389387922305,
"loss": 6.3001,
"mean_token_accuracy": 0.13518199026584626,
"num_tokens": 3490339.0,
"step": 1695
},
{
"entropy": 6.375849771499634,
"epoch": 1.5086551264980028,
"grad_norm": 1.0703125,
"learning_rate": 0.0004948660297381826,
"loss": 6.2959,
"mean_token_accuracy": 0.13820037841796876,
"num_tokens": 3500645.0,
"step": 1700
},
{
"entropy": 6.326462697982788,
"epoch": 1.5130936529072347,
"grad_norm": 1.0,
"learning_rate": 0.0004947926053331836,
"loss": 6.273,
"mean_token_accuracy": 0.139491256326437,
"num_tokens": 3510393.0,
"step": 1705
},
{
"entropy": 6.408394193649292,
"epoch": 1.517532179316467,
"grad_norm": 1.03125,
"learning_rate": 0.0004947186657493354,
"loss": 6.2666,
"mean_token_accuracy": 0.14247287064790726,
"num_tokens": 3520707.0,
"step": 1710
},
{
"entropy": 6.333920478820801,
"epoch": 1.521970705725699,
"grad_norm": 0.99609375,
"learning_rate": 0.0004946442111599473,
"loss": 6.4165,
"mean_token_accuracy": 0.13150266110897063,
"num_tokens": 3532101.0,
"step": 1715
},
{
"entropy": 6.405943059921265,
"epoch": 1.5264092321349312,
"grad_norm": 1.015625,
"learning_rate": 0.0004945692417395358,
"loss": 6.2607,
"mean_token_accuracy": 0.13934548795223237,
"num_tokens": 3541270.0,
"step": 1720
},
{
"entropy": 6.301887083053589,
"epoch": 1.5308477585441633,
"grad_norm": 1.1640625,
"learning_rate": 0.000494493757663824,
"loss": 6.3411,
"mean_token_accuracy": 0.13587306886911393,
"num_tokens": 3550959.0,
"step": 1725
},
{
"entropy": 6.384119939804077,
"epoch": 1.5352862849533955,
"grad_norm": 1.0234375,
"learning_rate": 0.0004944177591097415,
"loss": 6.3751,
"mean_token_accuracy": 0.13755866140127182,
"num_tokens": 3561853.0,
"step": 1730
},
{
"entropy": 6.344173955917358,
"epoch": 1.5397248113626276,
"grad_norm": 1.0078125,
"learning_rate": 0.0004943412462554236,
"loss": 6.3123,
"mean_token_accuracy": 0.13452489599585532,
"num_tokens": 3573060.0,
"step": 1735
},
{
"entropy": 6.308044004440307,
"epoch": 1.5441633377718598,
"grad_norm": 1.1328125,
"learning_rate": 0.0004942642192802114,
"loss": 6.328,
"mean_token_accuracy": 0.1374310664832592,
"num_tokens": 3582777.0,
"step": 1740
},
{
"entropy": 6.439042711257935,
"epoch": 1.548601864181092,
"grad_norm": 1.0546875,
"learning_rate": 0.0004941866783646508,
"loss": 6.3345,
"mean_token_accuracy": 0.13529076278209687,
"num_tokens": 3592978.0,
"step": 1745
},
{
"entropy": 6.348781871795654,
"epoch": 1.553040390590324,
"grad_norm": 1.1015625,
"learning_rate": 0.0004941086236904923,
"loss": 6.3061,
"mean_token_accuracy": 0.13936796635389329,
"num_tokens": 3603355.0,
"step": 1750
},
{
"entropy": 6.436870050430298,
"epoch": 1.557478916999556,
"grad_norm": 1.0234375,
"learning_rate": 0.0004940300554406909,
"loss": 6.3498,
"mean_token_accuracy": 0.1272510677576065,
"num_tokens": 3614843.0,
"step": 1755
},
{
"entropy": 6.3685750484466555,
"epoch": 1.5619174434087881,
"grad_norm": 1.09375,
"learning_rate": 0.000493950973799405,
"loss": 6.2738,
"mean_token_accuracy": 0.14151667505502702,
"num_tokens": 3623953.0,
"step": 1760
},
{
"entropy": 6.366236734390259,
"epoch": 1.5663559698180203,
"grad_norm": 0.9609375,
"learning_rate": 0.0004938713789519967,
"loss": 6.3528,
"mean_token_accuracy": 0.13301268741488456,
"num_tokens": 3634762.0,
"step": 1765
},
{
"entropy": 6.44322018623352,
"epoch": 1.5707944962272524,
"grad_norm": 1.0234375,
"learning_rate": 0.0004937912710850309,
"loss": 6.3909,
"mean_token_accuracy": 0.12702670469880104,
"num_tokens": 3645597.0,
"step": 1770
},
{
"entropy": 6.3498796939849855,
"epoch": 1.5752330226364846,
"grad_norm": 1.1484375,
"learning_rate": 0.0004937106503862749,
"loss": 6.2962,
"mean_token_accuracy": 0.1402463473379612,
"num_tokens": 3655895.0,
"step": 1775
},
{
"entropy": 6.3070460796356205,
"epoch": 1.5796715490457167,
"grad_norm": 1.0234375,
"learning_rate": 0.0004936295170446981,
"loss": 6.2705,
"mean_token_accuracy": 0.13688953965902328,
"num_tokens": 3667181.0,
"step": 1780
},
{
"entropy": 6.274955320358276,
"epoch": 1.5841100754549489,
"grad_norm": 1.03125,
"learning_rate": 0.0004935478712504715,
"loss": 6.2313,
"mean_token_accuracy": 0.14355697929859162,
"num_tokens": 3676675.0,
"step": 1785
},
{
"entropy": 6.3787109375,
"epoch": 1.588548601864181,
"grad_norm": 0.99609375,
"learning_rate": 0.0004934657131949674,
"loss": 6.293,
"mean_token_accuracy": 0.13846610561013223,
"num_tokens": 3687354.0,
"step": 1790
},
{
"entropy": 6.278066110610962,
"epoch": 1.5929871282734132,
"grad_norm": 1.078125,
"learning_rate": 0.0004933830430707585,
"loss": 6.3331,
"mean_token_accuracy": 0.1389099143445492,
"num_tokens": 3696762.0,
"step": 1795
},
{
"entropy": 6.403505325317383,
"epoch": 1.5974256546826453,
"grad_norm": 0.96875,
"learning_rate": 0.000493299861071618,
"loss": 6.3193,
"mean_token_accuracy": 0.13765995875000953,
"num_tokens": 3706671.0,
"step": 1800
},
{
"entropy": 6.346765232086182,
"epoch": 1.6018641810918774,
"grad_norm": 1.1015625,
"learning_rate": 0.0004932161673925189,
"loss": 6.3211,
"mean_token_accuracy": 0.14222623705863952,
"num_tokens": 3716047.0,
"step": 1805
},
{
"entropy": 6.480462837219238,
"epoch": 1.6063027075011096,
"grad_norm": 0.9609375,
"learning_rate": 0.0004931319622296333,
"loss": 6.3733,
"mean_token_accuracy": 0.12890343070030214,
"num_tokens": 3728249.0,
"step": 1810
},
{
"entropy": 6.327421188354492,
"epoch": 1.6107412339103417,
"grad_norm": 0.9765625,
"learning_rate": 0.0004930472457803324,
"loss": 6.2919,
"mean_token_accuracy": 0.14020831808447837,
"num_tokens": 3739164.0,
"step": 1815
},
{
"entropy": 6.408966207504273,
"epoch": 1.6151797603195739,
"grad_norm": 1.0625,
"learning_rate": 0.0004929620182431858,
"loss": 6.303,
"mean_token_accuracy": 0.142412880808115,
"num_tokens": 3749190.0,
"step": 1820
},
{
"entropy": 6.261825037002564,
"epoch": 1.619618286728806,
"grad_norm": 1.2109375,
"learning_rate": 0.0004928762798179612,
"loss": 6.2169,
"mean_token_accuracy": 0.1475951187312603,
"num_tokens": 3760265.0,
"step": 1825
},
{
"entropy": 6.274430656433106,
"epoch": 1.6240568131380382,
"grad_norm": 1.109375,
"learning_rate": 0.0004927900307056233,
"loss": 6.2945,
"mean_token_accuracy": 0.13552614152431489,
"num_tokens": 3771068.0,
"step": 1830
},
{
"entropy": 6.3409483432769775,
"epoch": 1.6284953395472703,
"grad_norm": 1.03125,
"learning_rate": 0.0004927032711083342,
"loss": 6.297,
"mean_token_accuracy": 0.13993098884820937,
"num_tokens": 3781230.0,
"step": 1835
},
{
"entropy": 6.295605039596557,
"epoch": 1.6329338659565025,
"grad_norm": 1.0625,
"learning_rate": 0.0004926160012294526,
"loss": 6.2502,
"mean_token_accuracy": 0.14423105642199516,
"num_tokens": 3791435.0,
"step": 1840
},
{
"entropy": 6.265171527862549,
"epoch": 1.6373723923657346,
"grad_norm": 1.0859375,
"learning_rate": 0.000492528221273533,
"loss": 6.2049,
"mean_token_accuracy": 0.14195780605077743,
"num_tokens": 3801680.0,
"step": 1845
},
{
"entropy": 6.373475074768066,
"epoch": 1.6418109187749668,
"grad_norm": 1.1015625,
"learning_rate": 0.0004924399314463258,
"loss": 6.3058,
"mean_token_accuracy": 0.13744521513581276,
"num_tokens": 3812005.0,
"step": 1850
},
{
"entropy": 6.294007301330566,
"epoch": 1.646249445184199,
"grad_norm": 1.390625,
"learning_rate": 0.0004923511319547761,
"loss": 6.2355,
"mean_token_accuracy": 0.1440819539129734,
"num_tokens": 3821682.0,
"step": 1855
},
{
"entropy": 6.319647216796875,
"epoch": 1.650687971593431,
"grad_norm": 1.03125,
"learning_rate": 0.000492261823007024,
"loss": 6.2157,
"mean_token_accuracy": 0.14868459478020668,
"num_tokens": 3831725.0,
"step": 1860
},
{
"entropy": 6.311188554763794,
"epoch": 1.6551264980026632,
"grad_norm": 1.109375,
"learning_rate": 0.0004921720048124034,
"loss": 6.2569,
"mean_token_accuracy": 0.13653967306017875,
"num_tokens": 3840647.0,
"step": 1865
},
{
"entropy": 6.402250814437866,
"epoch": 1.6595650244118954,
"grad_norm": 1.0625,
"learning_rate": 0.0004920816775814422,
"loss": 6.3124,
"mean_token_accuracy": 0.1325970098376274,
"num_tokens": 3852869.0,
"step": 1870
},
{
"entropy": 6.3165970802307125,
"epoch": 1.6640035508211275,
"grad_norm": 1.0234375,
"learning_rate": 0.0004919908415258612,
"loss": 6.2912,
"mean_token_accuracy": 0.14089620634913444,
"num_tokens": 3863484.0,
"step": 1875
},
{
"entropy": 6.288156318664551,
"epoch": 1.6684420772303596,
"grad_norm": 1.046875,
"learning_rate": 0.000491899496858574,
"loss": 6.2841,
"mean_token_accuracy": 0.13467081785202026,
"num_tokens": 3874564.0,
"step": 1880
},
{
"entropy": 6.395035028457642,
"epoch": 1.6728806036395918,
"grad_norm": 1.03125,
"learning_rate": 0.0004918076437936859,
"loss": 6.3119,
"mean_token_accuracy": 0.1333139009773731,
"num_tokens": 3884315.0,
"step": 1885
},
{
"entropy": 6.327268505096436,
"epoch": 1.677319130048824,
"grad_norm": 1.015625,
"learning_rate": 0.0004917152825464947,
"loss": 6.2965,
"mean_token_accuracy": 0.13294868022203446,
"num_tokens": 3893948.0,
"step": 1890
},
{
"entropy": 6.396142435073853,
"epoch": 1.681757656458056,
"grad_norm": 0.94921875,
"learning_rate": 0.0004916224133334885,
"loss": 6.311,
"mean_token_accuracy": 0.13014644309878348,
"num_tokens": 3905099.0,
"step": 1895
},
{
"entropy": 6.286337661743164,
"epoch": 1.686196182867288,
"grad_norm": 1.0234375,
"learning_rate": 0.0004915290363723465,
"loss": 6.2342,
"mean_token_accuracy": 0.14227957800030708,
"num_tokens": 3914674.0,
"step": 1900
},
{
"entropy": 6.324175691604614,
"epoch": 1.6906347092765202,
"grad_norm": 1.03125,
"learning_rate": 0.0004914351518819379,
"loss": 6.2272,
"mean_token_accuracy": 0.14022424072027206,
"num_tokens": 3925096.0,
"step": 1905
},
{
"entropy": 6.305720806121826,
"epoch": 1.6950732356857523,
"grad_norm": 1.0625,
"learning_rate": 0.0004913407600823216,
"loss": 6.2887,
"mean_token_accuracy": 0.1422324001789093,
"num_tokens": 3935048.0,
"step": 1910
},
{
"entropy": 6.279489135742187,
"epoch": 1.6995117620949844,
"grad_norm": 1.1171875,
"learning_rate": 0.0004912458611947454,
"loss": 6.2333,
"mean_token_accuracy": 0.14147737249732018,
"num_tokens": 3944021.0,
"step": 1915
},
{
"entropy": 6.27567949295044,
"epoch": 1.7039502885042166,
"grad_norm": 1.0,
"learning_rate": 0.000491150455441646,
"loss": 6.166,
"mean_token_accuracy": 0.14739958047866822,
"num_tokens": 3953587.0,
"step": 1920
},
{
"entropy": 6.247754430770874,
"epoch": 1.7083888149134487,
"grad_norm": 1.1015625,
"learning_rate": 0.0004910545430466478,
"loss": 6.2706,
"mean_token_accuracy": 0.13362218514084817,
"num_tokens": 3963981.0,
"step": 1925
},
{
"entropy": 6.270370864868164,
"epoch": 1.7128273413226809,
"grad_norm": 1.296875,
"learning_rate": 0.0004909581242345628,
"loss": 6.2833,
"mean_token_accuracy": 0.14019264951348304,
"num_tokens": 3973720.0,
"step": 1930
},
{
"entropy": 6.295551729202271,
"epoch": 1.717265867731913,
"grad_norm": 1.0703125,
"learning_rate": 0.0004908611992313905,
"loss": 6.222,
"mean_token_accuracy": 0.14261915981769563,
"num_tokens": 3984579.0,
"step": 1935
},
{
"entropy": 6.264960384368896,
"epoch": 1.7217043941411452,
"grad_norm": 1.03125,
"learning_rate": 0.0004907637682643162,
"loss": 6.245,
"mean_token_accuracy": 0.1404101848602295,
"num_tokens": 3994609.0,
"step": 1940
},
{
"entropy": 6.302646636962891,
"epoch": 1.7261429205503773,
"grad_norm": 1.0234375,
"learning_rate": 0.0004906658315617112,
"loss": 6.2902,
"mean_token_accuracy": 0.13819315508008004,
"num_tokens": 4004969.0,
"step": 1945
},
{
"entropy": 6.248818016052246,
"epoch": 1.7305814469596092,
"grad_norm": 0.984375,
"learning_rate": 0.0004905673893531331,
"loss": 6.3268,
"mean_token_accuracy": 0.1326567329466343,
"num_tokens": 4016098.0,
"step": 1950
},
{
"entropy": 6.397868633270264,
"epoch": 1.7350199733688414,
"grad_norm": 1.046875,
"learning_rate": 0.0004904684418693231,
"loss": 6.233,
"mean_token_accuracy": 0.14564677476882934,
"num_tokens": 4025744.0,
"step": 1955
},
{
"entropy": 6.238390398025513,
"epoch": 1.7394584997780735,
"grad_norm": 1.046875,
"learning_rate": 0.0004903689893422077,
"loss": 6.2537,
"mean_token_accuracy": 0.13860218822956086,
"num_tokens": 4036532.0,
"step": 1960
},
{
"entropy": 6.4320872783660885,
"epoch": 1.7438970261873057,
"grad_norm": 1.0703125,
"learning_rate": 0.0004902690320048966,
"loss": 6.3386,
"mean_token_accuracy": 0.13317947015166282,
"num_tokens": 4047350.0,
"step": 1965
},
{
"entropy": 6.341959428787232,
"epoch": 1.7483355525965378,
"grad_norm": 1.0703125,
"learning_rate": 0.000490168570091683,
"loss": 6.3134,
"mean_token_accuracy": 0.14479754120111465,
"num_tokens": 4058223.0,
"step": 1970
},
{
"entropy": 6.26735486984253,
"epoch": 1.75277407900577,
"grad_norm": 1.0859375,
"learning_rate": 0.0004900676038380429,
"loss": 6.2377,
"mean_token_accuracy": 0.1400671385228634,
"num_tokens": 4067741.0,
"step": 1975
},
{
"entropy": 6.2349577903747555,
"epoch": 1.7572126054150021,
"grad_norm": 1.015625,
"learning_rate": 0.0004899661334806342,
"loss": 6.2507,
"mean_token_accuracy": 0.1395649529993534,
"num_tokens": 4078598.0,
"step": 1980
},
{
"entropy": 6.328679370880127,
"epoch": 1.7616511318242343,
"grad_norm": 1.0078125,
"learning_rate": 0.0004898641592572965,
"loss": 6.2545,
"mean_token_accuracy": 0.1380497135221958,
"num_tokens": 4089230.0,
"step": 1985
},
{
"entropy": 6.289399909973144,
"epoch": 1.7660896582334664,
"grad_norm": 1.0703125,
"learning_rate": 0.0004897616814070505,
"loss": 6.1316,
"mean_token_accuracy": 0.14506224393844605,
"num_tokens": 4099104.0,
"step": 1990
},
{
"entropy": 6.196705055236817,
"epoch": 1.7705281846426986,
"grad_norm": 1.0234375,
"learning_rate": 0.0004896587001700972,
"loss": 6.2359,
"mean_token_accuracy": 0.13811009451746942,
"num_tokens": 4109008.0,
"step": 1995
},
{
"entropy": 6.3165913105010985,
"epoch": 1.7749667110519307,
"grad_norm": 1.0625,
"learning_rate": 0.0004895552157878174,
"loss": 6.1727,
"mean_token_accuracy": 0.14556334167718887,
"num_tokens": 4118219.0,
"step": 2000
},
{
"epoch": 1.7749667110519307,
"eval_entropy": 6.189312974517533,
"eval_loss": 6.335569858551025,
"eval_mean_token_accuracy": 0.136928480658282,
"eval_num_tokens": 4118219.0,
"eval_runtime": 2.7093,
"eval_samples_per_second": 1242.755,
"eval_steps_per_second": 155.39,
"step": 2000
},
{
"entropy": 6.294293546676636,
"epoch": 1.7794052374611629,
"grad_norm": 1.1171875,
"learning_rate": 0.0004894512285027717,
"loss": 6.1793,
"mean_token_accuracy": 0.14657135903835297,
"num_tokens": 4127255.0,
"step": 2005
},
{
"entropy": 6.239873313903809,
"epoch": 1.783843763870395,
"grad_norm": 0.94921875,
"learning_rate": 0.0004893467385586991,
"loss": 6.1614,
"mean_token_accuracy": 0.14499758780002595,
"num_tokens": 4137222.0,
"step": 2010
},
{
"entropy": 6.136928653717041,
"epoch": 1.7882822902796272,
"grad_norm": 1.140625,
"learning_rate": 0.000489241746200517,
"loss": 6.1773,
"mean_token_accuracy": 0.14779955595731736,
"num_tokens": 4147746.0,
"step": 2015
},
{
"entropy": 6.287437057495117,
"epoch": 1.7927208166888593,
"grad_norm": 1.078125,
"learning_rate": 0.0004891362516743201,
"loss": 6.2624,
"mean_token_accuracy": 0.13894592374563217,
"num_tokens": 4157270.0,
"step": 2020
},
{
"entropy": 6.25756139755249,
"epoch": 1.7971593430980914,
"grad_norm": 0.98828125,
"learning_rate": 0.0004890302552273805,
"loss": 6.1967,
"mean_token_accuracy": 0.14151124581694602,
"num_tokens": 4167239.0,
"step": 2025
},
{
"entropy": 6.1199119091033936,
"epoch": 1.8015978695073236,
"grad_norm": 1.0390625,
"learning_rate": 0.0004889237571081465,
"loss": 6.1876,
"mean_token_accuracy": 0.14599697291851044,
"num_tokens": 4177829.0,
"step": 2030
},
{
"entropy": 6.389132165908814,
"epoch": 1.8060363959165557,
"grad_norm": 1.03125,
"learning_rate": 0.0004888167575662425,
"loss": 6.2991,
"mean_token_accuracy": 0.13579059466719628,
"num_tokens": 4189015.0,
"step": 2035
},
{
"entropy": 6.2341320514678955,
"epoch": 1.8104749223257879,
"grad_norm": 1.2421875,
"learning_rate": 0.0004887092568524682,
"loss": 6.252,
"mean_token_accuracy": 0.13997769802808763,
"num_tokens": 4198895.0,
"step": 2040
},
{
"entropy": 6.282239961624145,
"epoch": 1.81491344873502,
"grad_norm": 0.94140625,
"learning_rate": 0.0004886012552187979,
"loss": 6.2221,
"mean_token_accuracy": 0.14225052297115326,
"num_tokens": 4209845.0,
"step": 2045
},
{
"entropy": 6.251390075683593,
"epoch": 1.8193519751442522,
"grad_norm": 1.0625,
"learning_rate": 0.0004884927529183799,
"loss": 6.1844,
"mean_token_accuracy": 0.14328595399856567,
"num_tokens": 4220065.0,
"step": 2050
},
{
"entropy": 6.233511972427368,
"epoch": 1.8237905015534843,
"grad_norm": 1.1015625,
"learning_rate": 0.0004883837502055363,
"loss": 6.2135,
"mean_token_accuracy": 0.14167198091745375,
"num_tokens": 4229720.0,
"step": 2055
},
{
"entropy": 6.30111985206604,
"epoch": 1.8282290279627165,
"grad_norm": 1.0,
"learning_rate": 0.0004882742473357619,
"loss": 6.22,
"mean_token_accuracy": 0.13643964901566505,
"num_tokens": 4239585.0,
"step": 2060
},
{
"entropy": 6.267259979248047,
"epoch": 1.8326675543719486,
"grad_norm": 1.0390625,
"learning_rate": 0.00048816424456572403,
"loss": 6.2476,
"mean_token_accuracy": 0.14258809238672257,
"num_tokens": 4250294.0,
"step": 2065
},
{
"entropy": 6.305874967575074,
"epoch": 1.8371060807811808,
"grad_norm": 0.98828125,
"learning_rate": 0.0004880537421532618,
"loss": 6.1402,
"mean_token_accuracy": 0.14959779605269433,
"num_tokens": 4260089.0,
"step": 2070
},
{
"entropy": 6.234825468063354,
"epoch": 1.841544607190413,
"grad_norm": 1.0,
"learning_rate": 0.00048794274035738515,
"loss": 6.1932,
"mean_token_accuracy": 0.1468948632478714,
"num_tokens": 4270282.0,
"step": 2075
},
{
"entropy": 6.299134731292725,
"epoch": 1.845983133599645,
"grad_norm": 1.1484375,
"learning_rate": 0.0004878312394382747,
"loss": 6.2185,
"mean_token_accuracy": 0.13943059742450714,
"num_tokens": 4279308.0,
"step": 2080
},
{
"entropy": 6.163238048553467,
"epoch": 1.8504216600088772,
"grad_norm": 0.96875,
"learning_rate": 0.000487719239657281,
"loss": 6.1957,
"mean_token_accuracy": 0.14037612825632095,
"num_tokens": 4291101.0,
"step": 2085
},
{
"entropy": 6.286023044586182,
"epoch": 1.8548601864181093,
"grad_norm": 1.0625,
"learning_rate": 0.000487606741276924,
"loss": 6.1967,
"mean_token_accuracy": 0.143647962808609,
"num_tokens": 4301479.0,
"step": 2090
},
{
"entropy": 6.24072036743164,
"epoch": 1.8592987128273413,
"grad_norm": 1.1171875,
"learning_rate": 0.0004874937445608921,
"loss": 6.1618,
"mean_token_accuracy": 0.14226512238383293,
"num_tokens": 4310876.0,
"step": 2095
},
{
"entropy": 6.294512367248535,
"epoch": 1.8637372392365734,
"grad_norm": 0.98046875,
"learning_rate": 0.0004873802497740418,
"loss": 6.1967,
"mean_token_accuracy": 0.14145390689373016,
"num_tokens": 4320788.0,
"step": 2100
},
{
"entropy": 6.25504732131958,
"epoch": 1.8681757656458056,
"grad_norm": 1.0234375,
"learning_rate": 0.0004872662571823973,
"loss": 6.1915,
"mean_token_accuracy": 0.14332777559757232,
"num_tokens": 4331609.0,
"step": 2105
},
{
"entropy": 6.1963708877563475,
"epoch": 1.8726142920550377,
"grad_norm": 1.0625,
"learning_rate": 0.00048715176705314936,
"loss": 6.1427,
"mean_token_accuracy": 0.14273860454559326,
"num_tokens": 4341495.0,
"step": 2110
},
{
"entropy": 6.178388929367065,
"epoch": 1.8770528184642699,
"grad_norm": 1.234375,
"learning_rate": 0.00048703677965465506,
"loss": 6.1335,
"mean_token_accuracy": 0.15152502655982972,
"num_tokens": 4351827.0,
"step": 2115
},
{
"entropy": 6.253129768371582,
"epoch": 1.881491344873502,
"grad_norm": 0.953125,
"learning_rate": 0.00048692129525643694,
"loss": 6.2925,
"mean_token_accuracy": 0.13464196175336837,
"num_tokens": 4363291.0,
"step": 2120
},
{
"entropy": 6.251963663101196,
"epoch": 1.8859298712827341,
"grad_norm": 0.98828125,
"learning_rate": 0.00048680531412918267,
"loss": 6.1861,
"mean_token_accuracy": 0.14269427880644797,
"num_tokens": 4373458.0,
"step": 2125
},
{
"entropy": 6.263167381286621,
"epoch": 1.8903683976919663,
"grad_norm": 1.1171875,
"learning_rate": 0.0004866888365447439,
"loss": 6.1529,
"mean_token_accuracy": 0.1422121912240982,
"num_tokens": 4383562.0,
"step": 2130
},
{
"entropy": 6.234077024459839,
"epoch": 1.8948069241011984,
"grad_norm": 1.0625,
"learning_rate": 0.0004865718627761363,
"loss": 6.2679,
"mean_token_accuracy": 0.13356237038969992,
"num_tokens": 4394970.0,
"step": 2135
},
{
"entropy": 6.317501831054687,
"epoch": 1.8992454505104306,
"grad_norm": 1.0703125,
"learning_rate": 0.0004864543930975383,
"loss": 6.2377,
"mean_token_accuracy": 0.13947510719299316,
"num_tokens": 4405117.0,
"step": 2140
},
{
"entropy": 6.127161931991577,
"epoch": 1.9036839769196625,
"grad_norm": 0.97265625,
"learning_rate": 0.0004863364277842908,
"loss": 6.1427,
"mean_token_accuracy": 0.14334554746747016,
"num_tokens": 4416392.0,
"step": 2145
},
{
"entropy": 6.275495529174805,
"epoch": 1.9081225033288947,
"grad_norm": 0.921875,
"learning_rate": 0.0004862179671128965,
"loss": 6.1993,
"mean_token_accuracy": 0.13783841133117675,
"num_tokens": 4426309.0,
"step": 2150
},
{
"entropy": 6.237747573852539,
"epoch": 1.9125610297381268,
"grad_norm": 1.0703125,
"learning_rate": 0.000486099011361019,
"loss": 6.1996,
"mean_token_accuracy": 0.1414594329893589,
"num_tokens": 4437044.0,
"step": 2155
},
{
"entropy": 6.329879093170166,
"epoch": 1.916999556147359,
"grad_norm": 0.93359375,
"learning_rate": 0.00048597956080748264,
"loss": 6.2209,
"mean_token_accuracy": 0.14464983716607094,
"num_tokens": 4447391.0,
"step": 2160
},
{
"entropy": 6.203670978546143,
"epoch": 1.921438082556591,
"grad_norm": 0.98046875,
"learning_rate": 0.00048585961573227116,
"loss": 6.1001,
"mean_token_accuracy": 0.145625601708889,
"num_tokens": 4457465.0,
"step": 2165
},
{
"entropy": 6.1996794700622555,
"epoch": 1.9258766089658232,
"grad_norm": 0.984375,
"learning_rate": 0.0004857391764165277,
"loss": 6.1805,
"mean_token_accuracy": 0.14704733341932297,
"num_tokens": 4467798.0,
"step": 2170
},
{
"entropy": 6.195384168624878,
"epoch": 1.9303151353750554,
"grad_norm": 0.94140625,
"learning_rate": 0.00048561824314255383,
"loss": 6.1378,
"mean_token_accuracy": 0.15038661435246467,
"num_tokens": 4478789.0,
"step": 2175
},
{
"entropy": 6.092350435256958,
"epoch": 1.9347536617842875,
"grad_norm": 2.09375,
"learning_rate": 0.00048549681619380886,
"loss": 6.1211,
"mean_token_accuracy": 0.14591658264398574,
"num_tokens": 4490521.0,
"step": 2180
},
{
"entropy": 6.228357648849487,
"epoch": 1.9391921881935197,
"grad_norm": 1.0546875,
"learning_rate": 0.0004853748958549092,
"loss": 6.1215,
"mean_token_accuracy": 0.14524291455745697,
"num_tokens": 4499484.0,
"step": 2185
},
{
"entropy": 6.248248529434204,
"epoch": 1.9436307146027518,
"grad_norm": 1.0625,
"learning_rate": 0.0004852524824116278,
"loss": 6.1538,
"mean_token_accuracy": 0.14293037131428718,
"num_tokens": 4509329.0,
"step": 2190
},
{
"entropy": 6.160349798202515,
"epoch": 1.948069241011984,
"grad_norm": 1.078125,
"learning_rate": 0.00048512957615089354,
"loss": 6.2247,
"mean_token_accuracy": 0.14221593588590623,
"num_tokens": 4518806.0,
"step": 2195
},
{
"entropy": 6.36239857673645,
"epoch": 1.9525077674212161,
"grad_norm": 1.015625,
"learning_rate": 0.0004850061773607902,
"loss": 6.3015,
"mean_token_accuracy": 0.13219987377524375,
"num_tokens": 4530760.0,
"step": 2200
},
{
"entropy": 6.284463357925415,
"epoch": 1.9569462938304483,
"grad_norm": 1.1015625,
"learning_rate": 0.000484882286330556,
"loss": 6.2875,
"mean_token_accuracy": 0.1374896213412285,
"num_tokens": 4541754.0,
"step": 2205
},
{
"entropy": 6.271965026855469,
"epoch": 1.9613848202396804,
"grad_norm": 1.1171875,
"learning_rate": 0.0004847579033505833,
"loss": 6.1348,
"mean_token_accuracy": 0.1421991430222988,
"num_tokens": 4553124.0,
"step": 2210
},
{
"entropy": 6.1756409168243405,
"epoch": 1.9658233466489126,
"grad_norm": 1.203125,
"learning_rate": 0.0004846330287124171,
"loss": 6.0553,
"mean_token_accuracy": 0.14253825396299363,
"num_tokens": 4563558.0,
"step": 2215
},
{
"entropy": 6.236325645446778,
"epoch": 1.9702618730581447,
"grad_norm": 1.1328125,
"learning_rate": 0.00048450766270875513,
"loss": 6.2018,
"mean_token_accuracy": 0.13894723802804948,
"num_tokens": 4572584.0,
"step": 2220
},
{
"entropy": 6.235476398468018,
"epoch": 1.9747003994673769,
"grad_norm": 1.171875,
"learning_rate": 0.00048438180563344666,
"loss": 6.166,
"mean_token_accuracy": 0.14769693315029145,
"num_tokens": 4583009.0,
"step": 2225
},
{
"entropy": 6.15409779548645,
"epoch": 1.979138925876609,
"grad_norm": 1.171875,
"learning_rate": 0.00048425545778149213,
"loss": 6.0949,
"mean_token_accuracy": 0.14991173148155212,
"num_tokens": 4593073.0,
"step": 2230
},
{
"entropy": 6.135072088241577,
"epoch": 1.9835774522858411,
"grad_norm": 1.015625,
"learning_rate": 0.0004841286194490423,
"loss": 6.0433,
"mean_token_accuracy": 0.14960258230566978,
"num_tokens": 4602419.0,
"step": 2235
},
{
"entropy": 6.148426246643067,
"epoch": 1.9880159786950733,
"grad_norm": 1.25,
"learning_rate": 0.00048400129093339745,
"loss": 6.0559,
"mean_token_accuracy": 0.147773315012455,
"num_tokens": 4613023.0,
"step": 2240
},
{
"entropy": 6.228465175628662,
"epoch": 1.9924545051043054,
"grad_norm": 1.125,
"learning_rate": 0.00048387347253300703,
"loss": 6.1037,
"mean_token_accuracy": 0.14951256513595582,
"num_tokens": 4622202.0,
"step": 2245
},
{
"entropy": 6.119011068344117,
"epoch": 1.9968930315135376,
"grad_norm": 1.1328125,
"learning_rate": 0.0004837451645474685,
"loss": 6.1319,
"mean_token_accuracy": 0.1470404915511608,
"num_tokens": 4632223.0,
"step": 2250
},
{
"entropy": 6.2560236189100475,
"epoch": 2.0008877052818463,
"grad_norm": 1.0625,
"learning_rate": 0.00048361636727752716,
"loss": 6.0661,
"mean_token_accuracy": 0.14733944171004826,
"num_tokens": 4641379.0,
"step": 2255
},
{
"entropy": 6.137987041473389,
"epoch": 2.0053262316910785,
"grad_norm": 1.0546875,
"learning_rate": 0.000483487081025075,
"loss": 5.756,
"mean_token_accuracy": 0.1647419661283493,
"num_tokens": 4650474.0,
"step": 2260
},
{
"entropy": 6.123887157440185,
"epoch": 2.0097647581003106,
"grad_norm": 1.03125,
"learning_rate": 0.00048335730609315,
"loss": 5.7524,
"mean_token_accuracy": 0.16743734031915664,
"num_tokens": 4660151.0,
"step": 2265
},
{
"entropy": 6.119118976593017,
"epoch": 2.014203284509543,
"grad_norm": 1.0546875,
"learning_rate": 0.00048322704278593595,
"loss": 5.8702,
"mean_token_accuracy": 0.14718232825398445,
"num_tokens": 4669852.0,
"step": 2270
},
{
"entropy": 6.116711235046386,
"epoch": 2.018641810918775,
"grad_norm": 1.0625,
"learning_rate": 0.00048309629140876097,
"loss": 5.8726,
"mean_token_accuracy": 0.15764627158641814,
"num_tokens": 4679867.0,
"step": 2275
},
{
"entropy": 6.149226093292237,
"epoch": 2.023080337328007,
"grad_norm": 1.0,
"learning_rate": 0.0004829650522680974,
"loss": 5.7536,
"mean_token_accuracy": 0.1666225776076317,
"num_tokens": 4690866.0,
"step": 2280
},
{
"entropy": 6.088321590423584,
"epoch": 2.027518863737239,
"grad_norm": 1.109375,
"learning_rate": 0.0004828333256715609,
"loss": 5.8065,
"mean_token_accuracy": 0.15734207332134248,
"num_tokens": 4701081.0,
"step": 2285
},
{
"entropy": 6.169612789154053,
"epoch": 2.0319573901464714,
"grad_norm": 1.1328125,
"learning_rate": 0.0004827011119279096,
"loss": 5.9393,
"mean_token_accuracy": 0.1523371458053589,
"num_tokens": 4712468.0,
"step": 2290
},
{
"entropy": 6.127353048324585,
"epoch": 2.0363959165557035,
"grad_norm": 1.1171875,
"learning_rate": 0.00048256841134704335,
"loss": 5.8486,
"mean_token_accuracy": 0.15824615359306335,
"num_tokens": 4722887.0,
"step": 2295
},
{
"entropy": 6.078661012649536,
"epoch": 2.0408344429649357,
"grad_norm": 1.0234375,
"learning_rate": 0.00048243522424000333,
"loss": 5.8774,
"mean_token_accuracy": 0.14893866032361985,
"num_tokens": 4733806.0,
"step": 2300
},
{
"entropy": 6.1255724906921385,
"epoch": 2.045272969374168,
"grad_norm": 0.94921875,
"learning_rate": 0.000482301550918971,
"loss": 5.8143,
"mean_token_accuracy": 0.16233171075582503,
"num_tokens": 4744172.0,
"step": 2305
},
{
"entropy": 6.110927534103394,
"epoch": 2.0497114957834,
"grad_norm": 1.0625,
"learning_rate": 0.0004821673916972676,
"loss": 5.8643,
"mean_token_accuracy": 0.15222925841808319,
"num_tokens": 4754543.0,
"step": 2310
},
{
"entropy": 6.109183931350708,
"epoch": 2.054150022192632,
"grad_norm": 1.0859375,
"learning_rate": 0.000482032746889353,
"loss": 5.7969,
"mean_token_accuracy": 0.16298202574253082,
"num_tokens": 4765617.0,
"step": 2315
},
{
"entropy": 5.983950281143189,
"epoch": 2.0585885486018642,
"grad_norm": 1.078125,
"learning_rate": 0.00048189761681082557,
"loss": 5.796,
"mean_token_accuracy": 0.158494932949543,
"num_tokens": 4775718.0,
"step": 2320
},
{
"entropy": 6.1368935108184814,
"epoch": 2.0630270750110964,
"grad_norm": 1.078125,
"learning_rate": 0.0004817620017784209,
"loss": 5.8967,
"mean_token_accuracy": 0.14975014999508857,
"num_tokens": 4785651.0,
"step": 2325
},
{
"entropy": 6.024167013168335,
"epoch": 2.0674656014203285,
"grad_norm": 1.1484375,
"learning_rate": 0.00048162590211001143,
"loss": 5.7429,
"mean_token_accuracy": 0.16594669073820115,
"num_tokens": 4795541.0,
"step": 2330
},
{
"entropy": 6.079076719284058,
"epoch": 2.0719041278295607,
"grad_norm": 1.140625,
"learning_rate": 0.00048148931812460536,
"loss": 5.8856,
"mean_token_accuracy": 0.15231603533029556,
"num_tokens": 4804863.0,
"step": 2335
},
{
"entropy": 6.1893517017364506,
"epoch": 2.076342654238793,
"grad_norm": 1.1171875,
"learning_rate": 0.0004813522501423464,
"loss": 5.8937,
"mean_token_accuracy": 0.1559199094772339,
"num_tokens": 4814782.0,
"step": 2340
},
{
"entropy": 6.05956449508667,
"epoch": 2.080781180648025,
"grad_norm": 0.99609375,
"learning_rate": 0.0004812146984845124,
"loss": 5.8515,
"mean_token_accuracy": 0.15324196219444275,
"num_tokens": 4825847.0,
"step": 2345
},
{
"entropy": 6.04329924583435,
"epoch": 2.085219707057257,
"grad_norm": 1.1328125,
"learning_rate": 0.00048107666347351505,
"loss": 5.8137,
"mean_token_accuracy": 0.1576656773686409,
"num_tokens": 4836537.0,
"step": 2350
},
{
"entropy": 6.060811710357666,
"epoch": 2.0896582334664893,
"grad_norm": 1.1171875,
"learning_rate": 0.00048093814543289894,
"loss": 5.7875,
"mean_token_accuracy": 0.16412230134010314,
"num_tokens": 4847031.0,
"step": 2355
},
{
"entropy": 6.0803258419036865,
"epoch": 2.0940967598757214,
"grad_norm": 1.046875,
"learning_rate": 0.00048079914468734117,
"loss": 5.7767,
"mean_token_accuracy": 0.15763533413410186,
"num_tokens": 4857031.0,
"step": 2360
},
{
"entropy": 5.995853662490845,
"epoch": 2.0985352862849536,
"grad_norm": 1.1171875,
"learning_rate": 0.00048065966156264964,
"loss": 5.761,
"mean_token_accuracy": 0.16315652430057526,
"num_tokens": 4866413.0,
"step": 2365
},
{
"entropy": 5.984428453445434,
"epoch": 2.1029738126941857,
"grad_norm": 1.015625,
"learning_rate": 0.00048051969638576345,
"loss": 5.8756,
"mean_token_accuracy": 0.15949649065732957,
"num_tokens": 4878840.0,
"step": 2370
},
{
"entropy": 6.032569789886475,
"epoch": 2.107412339103418,
"grad_norm": 1.1171875,
"learning_rate": 0.00048037924948475134,
"loss": 5.8749,
"mean_token_accuracy": 0.15843928158283233,
"num_tokens": 4889182.0,
"step": 2375
},
{
"entropy": 6.064680576324463,
"epoch": 2.11185086551265,
"grad_norm": 1.078125,
"learning_rate": 0.0004802383211888114,
"loss": 5.8504,
"mean_token_accuracy": 0.15740898102521897,
"num_tokens": 4899497.0,
"step": 2380
},
{
"entropy": 6.0131433486938475,
"epoch": 2.116289391921882,
"grad_norm": 1.09375,
"learning_rate": 0.0004800969118282697,
"loss": 5.8147,
"mean_token_accuracy": 0.15467424541711808,
"num_tokens": 4910232.0,
"step": 2385
},
{
"entropy": 6.156729316711425,
"epoch": 2.120727918331114,
"grad_norm": 1.1015625,
"learning_rate": 0.0004799550217345803,
"loss": 5.8762,
"mean_token_accuracy": 0.15463934987783431,
"num_tokens": 4920986.0,
"step": 2390
},
{
"entropy": 5.9624425888061525,
"epoch": 2.125166444740346,
"grad_norm": 1.015625,
"learning_rate": 0.00047981265124032375,
"loss": 5.8132,
"mean_token_accuracy": 0.16584520637989045,
"num_tokens": 4930630.0,
"step": 2395
},
{
"entropy": 6.077665233612061,
"epoch": 2.129604971149578,
"grad_norm": 1.0546875,
"learning_rate": 0.00047966980067920686,
"loss": 5.8461,
"mean_token_accuracy": 0.1554732069373131,
"num_tokens": 4941414.0,
"step": 2400
},
{
"entropy": 6.0890580177307125,
"epoch": 2.1340434975588103,
"grad_norm": 1.1640625,
"learning_rate": 0.00047952647038606157,
"loss": 5.824,
"mean_token_accuracy": 0.15972182601690293,
"num_tokens": 4952087.0,
"step": 2405
},
{
"entropy": 5.965068292617798,
"epoch": 2.1384820239680424,
"grad_norm": 1.21875,
"learning_rate": 0.0004793826606968443,
"loss": 5.7824,
"mean_token_accuracy": 0.16058602333068847,
"num_tokens": 4962340.0,
"step": 2410
},
{
"entropy": 6.062709331512451,
"epoch": 2.1429205503772746,
"grad_norm": 0.984375,
"learning_rate": 0.000479238371948635,
"loss": 5.8172,
"mean_token_accuracy": 0.15823266208171843,
"num_tokens": 4972793.0,
"step": 2415
},
{
"entropy": 6.068630790710449,
"epoch": 2.1473590767865067,
"grad_norm": 1.0625,
"learning_rate": 0.0004790936044796369,
"loss": 5.7894,
"mean_token_accuracy": 0.15582628548145294,
"num_tokens": 4982851.0,
"step": 2420
},
{
"entropy": 6.043807077407837,
"epoch": 2.151797603195739,
"grad_norm": 1.140625,
"learning_rate": 0.00047894835862917473,
"loss": 5.8587,
"mean_token_accuracy": 0.15432205498218537,
"num_tokens": 4993367.0,
"step": 2425
},
{
"entropy": 6.0602922439575195,
"epoch": 2.156236129604971,
"grad_norm": 1.0859375,
"learning_rate": 0.00047880263473769514,
"loss": 5.8847,
"mean_token_accuracy": 0.15590363442897798,
"num_tokens": 5004678.0,
"step": 2430
},
{
"entropy": 6.016771364212036,
"epoch": 2.160674656014203,
"grad_norm": 1.15625,
"learning_rate": 0.0004786564331467648,
"loss": 5.9167,
"mean_token_accuracy": 0.15726353973150253,
"num_tokens": 5015707.0,
"step": 2435
},
{
"entropy": 6.097188186645508,
"epoch": 2.1651131824234353,
"grad_norm": 1.046875,
"learning_rate": 0.00047850975419907034,
"loss": 5.8521,
"mean_token_accuracy": 0.16086476445198059,
"num_tokens": 5025627.0,
"step": 2440
},
{
"entropy": 6.054884433746338,
"epoch": 2.1695517088326675,
"grad_norm": 0.98046875,
"learning_rate": 0.00047836259823841716,
"loss": 5.901,
"mean_token_accuracy": 0.15026813372969627,
"num_tokens": 5037109.0,
"step": 2445
},
{
"entropy": 6.021889686584473,
"epoch": 2.1739902352418996,
"grad_norm": 0.984375,
"learning_rate": 0.0004782149656097287,
"loss": 5.8724,
"mean_token_accuracy": 0.1604078121483326,
"num_tokens": 5047547.0,
"step": 2450
},
{
"entropy": 6.027349185943604,
"epoch": 2.1784287616511318,
"grad_norm": 1.25,
"learning_rate": 0.00047806685665904586,
"loss": 5.6991,
"mean_token_accuracy": 0.17207456529140472,
"num_tokens": 5057491.0,
"step": 2455
},
{
"entropy": 6.059153509140015,
"epoch": 2.182867288060364,
"grad_norm": 1.015625,
"learning_rate": 0.0004779182717335258,
"loss": 5.88,
"mean_token_accuracy": 0.15979125201702118,
"num_tokens": 5067779.0,
"step": 2460
},
{
"entropy": 5.914556980133057,
"epoch": 2.187305814469596,
"grad_norm": 1.1171875,
"learning_rate": 0.00047776921118144154,
"loss": 5.7787,
"mean_token_accuracy": 0.16236073076725005,
"num_tokens": 5079933.0,
"step": 2465
},
{
"entropy": 6.0363281726837155,
"epoch": 2.191744340878828,
"grad_norm": 1.1328125,
"learning_rate": 0.00047761967535218084,
"loss": 5.7699,
"mean_token_accuracy": 0.1603487879037857,
"num_tokens": 5090511.0,
"step": 2470
},
{
"entropy": 5.9814863204956055,
"epoch": 2.1961828672880603,
"grad_norm": 1.09375,
"learning_rate": 0.0004774696645962453,
"loss": 5.8209,
"mean_token_accuracy": 0.155949005484581,
"num_tokens": 5100374.0,
"step": 2475
},
{
"entropy": 6.025760889053345,
"epoch": 2.2006213936972925,
"grad_norm": 1.0625,
"learning_rate": 0.0004773191792652501,
"loss": 5.8747,
"mean_token_accuracy": 0.15608740150928496,
"num_tokens": 5110729.0,
"step": 2480
},
{
"entropy": 6.043809127807617,
"epoch": 2.2050599201065246,
"grad_norm": 1.0546875,
"learning_rate": 0.0004771682197119224,
"loss": 5.9689,
"mean_token_accuracy": 0.1561452865600586,
"num_tokens": 5121512.0,
"step": 2485
},
{
"entropy": 6.116773700714111,
"epoch": 2.2094984465157568,
"grad_norm": 1.1640625,
"learning_rate": 0.00047701678629010115,
"loss": 5.7927,
"mean_token_accuracy": 0.16145216375589372,
"num_tokens": 5132244.0,
"step": 2490
},
{
"entropy": 5.996910858154297,
"epoch": 2.213936972924989,
"grad_norm": 1.1953125,
"learning_rate": 0.0004768648793547359,
"loss": 5.8645,
"mean_token_accuracy": 0.15332240164279937,
"num_tokens": 5142499.0,
"step": 2495
},
{
"entropy": 6.124018716812134,
"epoch": 2.218375499334221,
"grad_norm": 1.1015625,
"learning_rate": 0.0004767124992618863,
"loss": 5.9254,
"mean_token_accuracy": 0.14778615534305573,
"num_tokens": 5154082.0,
"step": 2500
},
{
"epoch": 2.218375499334221,
"eval_entropy": 5.912582218505425,
"eval_loss": 6.2384443283081055,
"eval_mean_token_accuracy": 0.14352747247578695,
"eval_num_tokens": 5154082.0,
"eval_runtime": 2.7018,
"eval_samples_per_second": 1246.209,
"eval_steps_per_second": 155.822,
"step": 2500
},
{
"entropy": 5.979514408111572,
"epoch": 2.222814025743453,
"grad_norm": 1.1796875,
"learning_rate": 0.0004765596463687207,
"loss": 5.8599,
"mean_token_accuracy": 0.16360579580068588,
"num_tokens": 5164473.0,
"step": 2505
},
{
"entropy": 6.0302653312683105,
"epoch": 2.2272525521526854,
"grad_norm": 1.0390625,
"learning_rate": 0.00047640632103351576,
"loss": 5.823,
"mean_token_accuracy": 0.1529782608151436,
"num_tokens": 5174505.0,
"step": 2510
},
{
"entropy": 5.984198331832886,
"epoch": 2.2316910785619175,
"grad_norm": 1.1875,
"learning_rate": 0.00047625252361565586,
"loss": 5.86,
"mean_token_accuracy": 0.16072332859039307,
"num_tokens": 5183730.0,
"step": 2515
},
{
"entropy": 6.080876970291138,
"epoch": 2.2361296049711497,
"grad_norm": 1.078125,
"learning_rate": 0.00047609825447563137,
"loss": 5.8875,
"mean_token_accuracy": 0.15377844423055648,
"num_tokens": 5194589.0,
"step": 2520
},
{
"entropy": 6.031586074829102,
"epoch": 2.240568131380382,
"grad_norm": 1.2421875,
"learning_rate": 0.0004759435139750388,
"loss": 5.8224,
"mean_token_accuracy": 0.1603144511580467,
"num_tokens": 5204865.0,
"step": 2525
},
{
"entropy": 5.950521659851074,
"epoch": 2.245006657789614,
"grad_norm": 1.078125,
"learning_rate": 0.00047578830247657915,
"loss": 5.7883,
"mean_token_accuracy": 0.15542953312397004,
"num_tokens": 5214174.0,
"step": 2530
},
{
"entropy": 6.086405277252197,
"epoch": 2.249445184198846,
"grad_norm": 1.0703125,
"learning_rate": 0.00047563262034405773,
"loss": 5.8553,
"mean_token_accuracy": 0.15860657542943954,
"num_tokens": 5224776.0,
"step": 2535
},
{
"entropy": 5.879979848861694,
"epoch": 2.2538837106080782,
"grad_norm": 1.0859375,
"learning_rate": 0.00047547646794238277,
"loss": 5.774,
"mean_token_accuracy": 0.16944229304790498,
"num_tokens": 5235808.0,
"step": 2540
},
{
"entropy": 6.069366598129273,
"epoch": 2.2583222370173104,
"grad_norm": 1.03125,
"learning_rate": 0.0004753198456375647,
"loss": 5.8768,
"mean_token_accuracy": 0.15542600452899932,
"num_tokens": 5246870.0,
"step": 2545
},
{
"entropy": 5.9477842330932615,
"epoch": 2.2627607634265425,
"grad_norm": 1.1796875,
"learning_rate": 0.0004751627537967158,
"loss": 5.814,
"mean_token_accuracy": 0.15728210359811784,
"num_tokens": 5256713.0,
"step": 2550
},
{
"entropy": 6.079386186599732,
"epoch": 2.2671992898357747,
"grad_norm": 1.1796875,
"learning_rate": 0.00047500519278804835,
"loss": 5.8594,
"mean_token_accuracy": 0.15244215726852417,
"num_tokens": 5266205.0,
"step": 2555
},
{
"entropy": 5.994957637786865,
"epoch": 2.271637816245007,
"grad_norm": 1.1015625,
"learning_rate": 0.0004748471629808746,
"loss": 5.8492,
"mean_token_accuracy": 0.16054973602294922,
"num_tokens": 5275790.0,
"step": 2560
},
{
"entropy": 5.990897369384766,
"epoch": 2.276076342654239,
"grad_norm": 1.140625,
"learning_rate": 0.00047468866474560575,
"loss": 5.8324,
"mean_token_accuracy": 0.16462789922952653,
"num_tokens": 5286644.0,
"step": 2565
},
{
"entropy": 6.060874319076538,
"epoch": 2.280514869063471,
"grad_norm": 1.0859375,
"learning_rate": 0.00047452969845375074,
"loss": 5.8517,
"mean_token_accuracy": 0.15758478343486787,
"num_tokens": 5297218.0,
"step": 2570
},
{
"entropy": 5.967515182495117,
"epoch": 2.2849533954727033,
"grad_norm": 1.0625,
"learning_rate": 0.0004743702644779157,
"loss": 5.8643,
"mean_token_accuracy": 0.16127976924180984,
"num_tokens": 5306963.0,
"step": 2575
},
{
"entropy": 6.041119766235352,
"epoch": 2.2893919218819354,
"grad_norm": 1.0546875,
"learning_rate": 0.000474210363191803,
"loss": 5.8436,
"mean_token_accuracy": 0.15753196477890014,
"num_tokens": 5317831.0,
"step": 2580
},
{
"entropy": 6.07420163154602,
"epoch": 2.2938304482911676,
"grad_norm": 1.1171875,
"learning_rate": 0.0004740499949702103,
"loss": 5.9116,
"mean_token_accuracy": 0.1521080181002617,
"num_tokens": 5328441.0,
"step": 2585
},
{
"entropy": 6.023616170883178,
"epoch": 2.2982689747003997,
"grad_norm": 1.1640625,
"learning_rate": 0.0004738891601890298,
"loss": 5.8882,
"mean_token_accuracy": 0.15639281421899795,
"num_tokens": 5339196.0,
"step": 2590
},
{
"entropy": 6.031891489028931,
"epoch": 2.302707501109632,
"grad_norm": 1.140625,
"learning_rate": 0.0004737278592252473,
"loss": 5.8922,
"mean_token_accuracy": 0.15469010919332504,
"num_tokens": 5350607.0,
"step": 2595
},
{
"entropy": 6.049084806442261,
"epoch": 2.3071460275188636,
"grad_norm": 1.1875,
"learning_rate": 0.0004735660924569411,
"loss": 5.8015,
"mean_token_accuracy": 0.16298002377152443,
"num_tokens": 5359882.0,
"step": 2600
},
{
"entropy": 5.998689460754394,
"epoch": 2.3115845539280957,
"grad_norm": 1.0859375,
"learning_rate": 0.0004734038602632815,
"loss": 5.901,
"mean_token_accuracy": 0.1472710005939007,
"num_tokens": 5369895.0,
"step": 2605
},
{
"entropy": 6.047903060913086,
"epoch": 2.316023080337328,
"grad_norm": 1.0546875,
"learning_rate": 0.00047324116302452975,
"loss": 5.8089,
"mean_token_accuracy": 0.1612442836165428,
"num_tokens": 5380603.0,
"step": 2610
},
{
"entropy": 5.948516035079956,
"epoch": 2.32046160674656,
"grad_norm": 1.125,
"learning_rate": 0.0004730780011220369,
"loss": 5.824,
"mean_token_accuracy": 0.1603932797908783,
"num_tokens": 5390638.0,
"step": 2615
},
{
"entropy": 6.000922441482544,
"epoch": 2.324900133155792,
"grad_norm": 1.1875,
"learning_rate": 0.0004729143749382435,
"loss": 5.8306,
"mean_token_accuracy": 0.15756168812513352,
"num_tokens": 5401420.0,
"step": 2620
},
{
"entropy": 5.9953662872314455,
"epoch": 2.3293386595650243,
"grad_norm": 1.1171875,
"learning_rate": 0.00047275028485667793,
"loss": 5.7782,
"mean_token_accuracy": 0.16370837688446044,
"num_tokens": 5410609.0,
"step": 2625
},
{
"entropy": 6.01699743270874,
"epoch": 2.3337771859742564,
"grad_norm": 1.15625,
"learning_rate": 0.0004725857312619563,
"loss": 5.8682,
"mean_token_accuracy": 0.15251740217208862,
"num_tokens": 5420443.0,
"step": 2630
},
{
"entropy": 6.033771324157715,
"epoch": 2.3382157123834886,
"grad_norm": 1.0546875,
"learning_rate": 0.0004724207145397809,
"loss": 5.8648,
"mean_token_accuracy": 0.15294097363948822,
"num_tokens": 5431385.0,
"step": 2635
},
{
"entropy": 5.970233392715454,
"epoch": 2.3426542387927207,
"grad_norm": 1.03125,
"learning_rate": 0.0004722552350769397,
"loss": 5.8391,
"mean_token_accuracy": 0.1535698138177395,
"num_tokens": 5443030.0,
"step": 2640
},
{
"entropy": 6.052612066268921,
"epoch": 2.347092765201953,
"grad_norm": 1.0703125,
"learning_rate": 0.00047208929326130535,
"loss": 5.9079,
"mean_token_accuracy": 0.15419892519712447,
"num_tokens": 5454165.0,
"step": 2645
},
{
"entropy": 5.993892097473145,
"epoch": 2.351531291611185,
"grad_norm": 1.1484375,
"learning_rate": 0.00047192288948183394,
"loss": 5.8514,
"mean_token_accuracy": 0.1610301211476326,
"num_tokens": 5464677.0,
"step": 2650
},
{
"entropy": 6.002200412750244,
"epoch": 2.355969818020417,
"grad_norm": 1.1328125,
"learning_rate": 0.00047175602412856453,
"loss": 5.8932,
"mean_token_accuracy": 0.15303485542535783,
"num_tokens": 5474800.0,
"step": 2655
},
{
"entropy": 5.996066761016846,
"epoch": 2.3604083444296493,
"grad_norm": 1.1875,
"learning_rate": 0.00047158869759261843,
"loss": 5.8812,
"mean_token_accuracy": 0.15533178001642228,
"num_tokens": 5484560.0,
"step": 2660
},
{
"entropy": 6.029137420654297,
"epoch": 2.3648468708388815,
"grad_norm": 1.203125,
"learning_rate": 0.0004714209102661973,
"loss": 5.7492,
"mean_token_accuracy": 0.16394296288490295,
"num_tokens": 5494044.0,
"step": 2665
},
{
"entropy": 5.91089277267456,
"epoch": 2.3692853972481136,
"grad_norm": 1.109375,
"learning_rate": 0.0004712526625425832,
"loss": 5.7802,
"mean_token_accuracy": 0.16682939529418944,
"num_tokens": 5504699.0,
"step": 2670
},
{
"entropy": 5.978672981262207,
"epoch": 2.3737239236573457,
"grad_norm": 0.95703125,
"learning_rate": 0.00047108395481613736,
"loss": 5.8211,
"mean_token_accuracy": 0.15940958112478257,
"num_tokens": 5515653.0,
"step": 2675
},
{
"entropy": 5.973521709442139,
"epoch": 2.378162450066578,
"grad_norm": 1.140625,
"learning_rate": 0.00047091478748229927,
"loss": 5.8413,
"mean_token_accuracy": 0.1611622080206871,
"num_tokens": 5525598.0,
"step": 2680
},
{
"entropy": 5.935227870941162,
"epoch": 2.38260097647581,
"grad_norm": 1.40625,
"learning_rate": 0.0004707451609375854,
"loss": 5.7347,
"mean_token_accuracy": 0.16550450325012206,
"num_tokens": 5535022.0,
"step": 2685
},
{
"entropy": 5.960200691223145,
"epoch": 2.387039502885042,
"grad_norm": 1.171875,
"learning_rate": 0.0004705750755795889,
"loss": 5.8633,
"mean_token_accuracy": 0.15553324073553085,
"num_tokens": 5544766.0,
"step": 2690
},
{
"entropy": 6.048462724685669,
"epoch": 2.3914780292942743,
"grad_norm": 1.1953125,
"learning_rate": 0.00047040453180697823,
"loss": 5.8656,
"mean_token_accuracy": 0.15715541690587997,
"num_tokens": 5556475.0,
"step": 2695
},
{
"entropy": 5.987107372283935,
"epoch": 2.3959165557035065,
"grad_norm": 1.0859375,
"learning_rate": 0.0004702335300194963,
"loss": 5.8351,
"mean_token_accuracy": 0.1529506891965866,
"num_tokens": 5567679.0,
"step": 2700
},
{
"entropy": 5.9911316394805905,
"epoch": 2.4003550821127386,
"grad_norm": 1.109375,
"learning_rate": 0.0004700620706179596,
"loss": 5.8734,
"mean_token_accuracy": 0.15287387520074844,
"num_tokens": 5579154.0,
"step": 2705
},
{
"entropy": 6.002614164352417,
"epoch": 2.4047936085219708,
"grad_norm": 1.21875,
"learning_rate": 0.0004698901540042573,
"loss": 5.8182,
"mean_token_accuracy": 0.15594158917665482,
"num_tokens": 5588597.0,
"step": 2710
},
{
"entropy": 5.956090831756592,
"epoch": 2.409232134931203,
"grad_norm": 1.109375,
"learning_rate": 0.00046971778058135024,
"loss": 5.8452,
"mean_token_accuracy": 0.16208919137716293,
"num_tokens": 5598744.0,
"step": 2715
},
{
"entropy": 6.036012983322143,
"epoch": 2.413670661340435,
"grad_norm": 1.25,
"learning_rate": 0.00046954495075326986,
"loss": 5.8405,
"mean_token_accuracy": 0.1533527597784996,
"num_tokens": 5608684.0,
"step": 2720
},
{
"entropy": 6.065688228607177,
"epoch": 2.418109187749667,
"grad_norm": 1.1328125,
"learning_rate": 0.00046937166492511746,
"loss": 5.869,
"mean_token_accuracy": 0.1580584764480591,
"num_tokens": 5619073.0,
"step": 2725
},
{
"entropy": 5.885785341262817,
"epoch": 2.4225477141588994,
"grad_norm": 1.140625,
"learning_rate": 0.00046919792350306317,
"loss": 5.8433,
"mean_token_accuracy": 0.1607219859957695,
"num_tokens": 5628764.0,
"step": 2730
},
{
"entropy": 5.997347974777222,
"epoch": 2.4269862405681315,
"grad_norm": 1.0625,
"learning_rate": 0.0004690237268943451,
"loss": 5.8939,
"mean_token_accuracy": 0.1569211430847645,
"num_tokens": 5640132.0,
"step": 2735
},
{
"entropy": 6.014172315597534,
"epoch": 2.4314247669773636,
"grad_norm": 1.015625,
"learning_rate": 0.00046884907550726816,
"loss": 5.832,
"mean_token_accuracy": 0.16245327293872833,
"num_tokens": 5650104.0,
"step": 2740
},
{
"entropy": 6.030955839157104,
"epoch": 2.435863293386596,
"grad_norm": 1.1171875,
"learning_rate": 0.00046867396975120324,
"loss": 5.8838,
"mean_token_accuracy": 0.1566794067621231,
"num_tokens": 5660570.0,
"step": 2745
},
{
"entropy": 5.935262775421142,
"epoch": 2.440301819795828,
"grad_norm": 1.15625,
"learning_rate": 0.0004684984100365863,
"loss": 5.8102,
"mean_token_accuracy": 0.16272856444120407,
"num_tokens": 5670416.0,
"step": 2750
},
{
"entropy": 5.952510738372803,
"epoch": 2.44474034620506,
"grad_norm": 1.0625,
"learning_rate": 0.00046832239677491736,
"loss": 5.8026,
"mean_token_accuracy": 0.159297114610672,
"num_tokens": 5680103.0,
"step": 2755
},
{
"entropy": 5.9763203144073485,
"epoch": 2.4491788726142922,
"grad_norm": 1.0546875,
"learning_rate": 0.0004681459303787594,
"loss": 5.7618,
"mean_token_accuracy": 0.1663880541920662,
"num_tokens": 5690177.0,
"step": 2760
},
{
"entropy": 5.848566389083862,
"epoch": 2.4536173990235244,
"grad_norm": 1.0390625,
"learning_rate": 0.0004679690112617376,
"loss": 5.7924,
"mean_token_accuracy": 0.1640610784292221,
"num_tokens": 5700618.0,
"step": 2765
},
{
"entropy": 6.005400848388672,
"epoch": 2.458055925432756,
"grad_norm": 1.203125,
"learning_rate": 0.0004677916398385383,
"loss": 5.6976,
"mean_token_accuracy": 0.16924956142902375,
"num_tokens": 5709363.0,
"step": 2770
},
{
"entropy": 5.92542405128479,
"epoch": 2.4624944518419882,
"grad_norm": 1.1640625,
"learning_rate": 0.000467613816524908,
"loss": 5.7632,
"mean_token_accuracy": 0.16014119535684584,
"num_tokens": 5718337.0,
"step": 2775
},
{
"entropy": 5.98035454750061,
"epoch": 2.4669329782512204,
"grad_norm": 1.0078125,
"learning_rate": 0.0004674355417376524,
"loss": 5.8899,
"mean_token_accuracy": 0.15295967012643813,
"num_tokens": 5729728.0,
"step": 2780
},
{
"entropy": 6.071887493133545,
"epoch": 2.4713715046604525,
"grad_norm": 1.09375,
"learning_rate": 0.00046725681589463537,
"loss": 5.8657,
"mean_token_accuracy": 0.156499744951725,
"num_tokens": 5739417.0,
"step": 2785
},
{
"entropy": 5.863467073440551,
"epoch": 2.4758100310696847,
"grad_norm": 1.109375,
"learning_rate": 0.00046707763941477817,
"loss": 5.752,
"mean_token_accuracy": 0.16586533784866334,
"num_tokens": 5749262.0,
"step": 2790
},
{
"entropy": 5.958102178573609,
"epoch": 2.480248557478917,
"grad_norm": 1.09375,
"learning_rate": 0.0004668980127180582,
"loss": 5.7598,
"mean_token_accuracy": 0.16487552374601364,
"num_tokens": 5758631.0,
"step": 2795
},
{
"entropy": 6.010591220855713,
"epoch": 2.484687083888149,
"grad_norm": 1.140625,
"learning_rate": 0.0004667179362255081,
"loss": 5.8768,
"mean_token_accuracy": 0.15696858763694763,
"num_tokens": 5768216.0,
"step": 2800
},
{
"entropy": 5.944836568832398,
"epoch": 2.489125610297381,
"grad_norm": 1.0703125,
"learning_rate": 0.0004665374103592149,
"loss": 5.8615,
"mean_token_accuracy": 0.15959977358579636,
"num_tokens": 5779497.0,
"step": 2805
},
{
"entropy": 5.9987327575683596,
"epoch": 2.4935641367066133,
"grad_norm": 1.5078125,
"learning_rate": 0.0004663564355423189,
"loss": 5.8722,
"mean_token_accuracy": 0.1550326645374298,
"num_tokens": 5790354.0,
"step": 2810
},
{
"entropy": 5.994489002227783,
"epoch": 2.4980026631158454,
"grad_norm": 1.09375,
"learning_rate": 0.0004661750121990128,
"loss": 5.8588,
"mean_token_accuracy": 0.15960408747196198,
"num_tokens": 5801444.0,
"step": 2815
},
{
"entropy": 5.916463232040405,
"epoch": 2.5024411895250775,
"grad_norm": 1.078125,
"learning_rate": 0.00046599314075454034,
"loss": 5.7893,
"mean_token_accuracy": 0.16704044193029405,
"num_tokens": 5811444.0,
"step": 2820
},
{
"entropy": 5.954709720611572,
"epoch": 2.5068797159343097,
"grad_norm": 1.140625,
"learning_rate": 0.00046581082163519585,
"loss": 5.8053,
"mean_token_accuracy": 0.16441214680671692,
"num_tokens": 5821470.0,
"step": 2825
},
{
"entropy": 6.026654958724976,
"epoch": 2.511318242343542,
"grad_norm": 1.0703125,
"learning_rate": 0.00046562805526832284,
"loss": 5.9117,
"mean_token_accuracy": 0.1474317044019699,
"num_tokens": 5831946.0,
"step": 2830
},
{
"entropy": 5.968541955947876,
"epoch": 2.515756768752774,
"grad_norm": 1.0625,
"learning_rate": 0.0004654448420823133,
"loss": 5.7507,
"mean_token_accuracy": 0.16840852946043014,
"num_tokens": 5841871.0,
"step": 2835
},
{
"entropy": 5.894213438034058,
"epoch": 2.520195295162006,
"grad_norm": 1.140625,
"learning_rate": 0.00046526118250660636,
"loss": 5.7572,
"mean_token_accuracy": 0.1637505128979683,
"num_tokens": 5852177.0,
"step": 2840
},
{
"entropy": 5.925645160675049,
"epoch": 2.5246338215712383,
"grad_norm": 1.1015625,
"learning_rate": 0.0004650770769716875,
"loss": 5.8017,
"mean_token_accuracy": 0.16091584861278535,
"num_tokens": 5861833.0,
"step": 2845
},
{
"entropy": 6.0279539108276365,
"epoch": 2.5290723479804704,
"grad_norm": 1.296875,
"learning_rate": 0.0004648925259090875,
"loss": 5.8965,
"mean_token_accuracy": 0.15736780315637589,
"num_tokens": 5872356.0,
"step": 2850
},
{
"entropy": 5.906160831451416,
"epoch": 2.5335108743897026,
"grad_norm": 1.140625,
"learning_rate": 0.00046470752975138146,
"loss": 5.766,
"mean_token_accuracy": 0.1651814177632332,
"num_tokens": 5882191.0,
"step": 2855
},
{
"entropy": 5.877144622802734,
"epoch": 2.5379494007989347,
"grad_norm": 1.3828125,
"learning_rate": 0.00046452208893218777,
"loss": 5.8292,
"mean_token_accuracy": 0.15751032680273055,
"num_tokens": 5892166.0,
"step": 2860
},
{
"entropy": 6.012645864486695,
"epoch": 2.542387927208167,
"grad_norm": 1.1640625,
"learning_rate": 0.000464336203886167,
"loss": 5.8779,
"mean_token_accuracy": 0.15454574823379516,
"num_tokens": 5902736.0,
"step": 2865
},
{
"entropy": 6.037869215011597,
"epoch": 2.546826453617399,
"grad_norm": 1.15625,
"learning_rate": 0.000464149875049021,
"loss": 5.8828,
"mean_token_accuracy": 0.1547730416059494,
"num_tokens": 5913118.0,
"step": 2870
},
{
"entropy": 5.903016805648804,
"epoch": 2.551264980026631,
"grad_norm": 1.3125,
"learning_rate": 0.00046396310285749175,
"loss": 5.7814,
"mean_token_accuracy": 0.16758745312690734,
"num_tokens": 5922748.0,
"step": 2875
},
{
"entropy": 5.863944339752197,
"epoch": 2.5557035064358633,
"grad_norm": 1.15625,
"learning_rate": 0.00046377588774936077,
"loss": 5.7403,
"mean_token_accuracy": 0.16544996947050095,
"num_tokens": 5932107.0,
"step": 2880
},
{
"entropy": 6.011892890930175,
"epoch": 2.5601420328450954,
"grad_norm": 1.1171875,
"learning_rate": 0.00046358823016344713,
"loss": 5.9142,
"mean_token_accuracy": 0.15287835970520974,
"num_tokens": 5942231.0,
"step": 2885
},
{
"entropy": 5.860071897506714,
"epoch": 2.5645805592543276,
"grad_norm": 1.2421875,
"learning_rate": 0.0004634001305396076,
"loss": 5.7025,
"mean_token_accuracy": 0.17802257537841798,
"num_tokens": 5952768.0,
"step": 2890
},
{
"entropy": 5.9685780048370365,
"epoch": 2.5690190856635597,
"grad_norm": 1.1875,
"learning_rate": 0.00046321158931873486,
"loss": 5.8106,
"mean_token_accuracy": 0.16438037455081939,
"num_tokens": 5963588.0,
"step": 2895
},
{
"entropy": 5.918586349487304,
"epoch": 2.573457612072792,
"grad_norm": 1.0703125,
"learning_rate": 0.0004630226069427566,
"loss": 5.8375,
"mean_token_accuracy": 0.15472524762153625,
"num_tokens": 5974010.0,
"step": 2900
},
{
"entropy": 5.987170839309693,
"epoch": 2.577896138482024,
"grad_norm": 1.25,
"learning_rate": 0.00046283318385463454,
"loss": 5.8025,
"mean_token_accuracy": 0.15875670611858367,
"num_tokens": 5983788.0,
"step": 2905
},
{
"entropy": 6.004740524291992,
"epoch": 2.582334664891256,
"grad_norm": 1.234375,
"learning_rate": 0.0004626433204983636,
"loss": 5.8272,
"mean_token_accuracy": 0.15208624452352523,
"num_tokens": 5993757.0,
"step": 2910
},
{
"entropy": 5.989063167572022,
"epoch": 2.5867731913004883,
"grad_norm": 1.1171875,
"learning_rate": 0.00046245301731897024,
"loss": 5.8965,
"mean_token_accuracy": 0.15564585849642754,
"num_tokens": 6004298.0,
"step": 2915
},
{
"entropy": 5.924497413635254,
"epoch": 2.5912117177097205,
"grad_norm": 1.1640625,
"learning_rate": 0.00046226227476251256,
"loss": 5.7492,
"mean_token_accuracy": 0.1677611857652664,
"num_tokens": 6014338.0,
"step": 2920
},
{
"entropy": 5.932976245880127,
"epoch": 2.5956502441189526,
"grad_norm": 1.109375,
"learning_rate": 0.0004620710932760776,
"loss": 5.7697,
"mean_token_accuracy": 0.16785314530134202,
"num_tokens": 6024162.0,
"step": 2925
},
{
"entropy": 5.958101367950439,
"epoch": 2.6000887705281848,
"grad_norm": 1.015625,
"learning_rate": 0.000461879473307782,
"loss": 5.9011,
"mean_token_accuracy": 0.15391672402620316,
"num_tokens": 6035618.0,
"step": 2930
},
{
"entropy": 6.020662879943847,
"epoch": 2.604527296937417,
"grad_norm": 1.03125,
"learning_rate": 0.0004616874153067698,
"loss": 5.8625,
"mean_token_accuracy": 0.15793592631816863,
"num_tokens": 6046958.0,
"step": 2935
},
{
"entropy": 5.986457204818725,
"epoch": 2.608965823346649,
"grad_norm": 1.1875,
"learning_rate": 0.0004614949197232118,
"loss": 5.7603,
"mean_token_accuracy": 0.15999703258275985,
"num_tokens": 6056605.0,
"step": 2940
},
{
"entropy": 6.014141416549682,
"epoch": 2.613404349755881,
"grad_norm": 1.0546875,
"learning_rate": 0.0004613019870083045,
"loss": 5.8777,
"mean_token_accuracy": 0.15496069490909575,
"num_tokens": 6066820.0,
"step": 2945
},
{
"entropy": 5.97690601348877,
"epoch": 2.6178428761651134,
"grad_norm": 1.1875,
"learning_rate": 0.00046110861761426903,
"loss": 5.8899,
"mean_token_accuracy": 0.15131543576717377,
"num_tokens": 6076894.0,
"step": 2950
},
{
"entropy": 5.9907660484313965,
"epoch": 2.6222814025743455,
"grad_norm": 1.1640625,
"learning_rate": 0.00046091481199435005,
"loss": 5.8772,
"mean_token_accuracy": 0.16070771217346191,
"num_tokens": 6087603.0,
"step": 2955
},
{
"entropy": 5.969569063186645,
"epoch": 2.6267199289835776,
"grad_norm": 1.125,
"learning_rate": 0.0004607205706028147,
"loss": 5.8553,
"mean_token_accuracy": 0.1571110799908638,
"num_tokens": 6097742.0,
"step": 2960
},
{
"entropy": 5.947077798843384,
"epoch": 2.63115845539281,
"grad_norm": 1.1171875,
"learning_rate": 0.0004605258938949514,
"loss": 5.7632,
"mean_token_accuracy": 0.16355187743902205,
"num_tokens": 6107589.0,
"step": 2965
},
{
"entropy": 5.910353899002075,
"epoch": 2.635596981802042,
"grad_norm": 1.1328125,
"learning_rate": 0.00046033078232706923,
"loss": 5.8305,
"mean_token_accuracy": 0.16115528345108032,
"num_tokens": 6117487.0,
"step": 2970
},
{
"entropy": 5.9662243843078615,
"epoch": 2.640035508211274,
"grad_norm": 1.234375,
"learning_rate": 0.00046013523635649625,
"loss": 5.7886,
"mean_token_accuracy": 0.1626285195350647,
"num_tokens": 6127326.0,
"step": 2975
},
{
"entropy": 5.9658843040466305,
"epoch": 2.6444740346205062,
"grad_norm": 1.171875,
"learning_rate": 0.00045993925644157883,
"loss": 5.8586,
"mean_token_accuracy": 0.15528757721185685,
"num_tokens": 6137314.0,
"step": 2980
},
{
"entropy": 5.949848461151123,
"epoch": 2.6489125610297384,
"grad_norm": 1.171875,
"learning_rate": 0.0004597428430416807,
"loss": 5.7777,
"mean_token_accuracy": 0.15900478214025499,
"num_tokens": 6147307.0,
"step": 2985
},
{
"entropy": 5.903331708908081,
"epoch": 2.6533510874389705,
"grad_norm": 1.203125,
"learning_rate": 0.00045954599661718126,
"loss": 5.7782,
"mean_token_accuracy": 0.15989653617143632,
"num_tokens": 6157251.0,
"step": 2990
},
{
"entropy": 5.940880393981933,
"epoch": 2.6577896138482027,
"grad_norm": 1.1640625,
"learning_rate": 0.00045934871762947504,
"loss": 5.8187,
"mean_token_accuracy": 0.1611912429332733,
"num_tokens": 6167190.0,
"step": 2995
},
{
"entropy": 5.969712638854981,
"epoch": 2.6622281402574344,
"grad_norm": 1.1171875,
"learning_rate": 0.00045915100654097076,
"loss": 5.9253,
"mean_token_accuracy": 0.14869051277637482,
"num_tokens": 6177276.0,
"step": 3000
},
{
"epoch": 2.6622281402574344,
"eval_entropy": 5.890340174178896,
"eval_loss": 6.156768798828125,
"eval_mean_token_accuracy": 0.1474443507201598,
"eval_num_tokens": 6177276.0,
"eval_runtime": 2.8874,
"eval_samples_per_second": 1166.085,
"eval_steps_per_second": 145.804,
"step": 3000
},
{
"entropy": 5.963724184036255,
"epoch": 2.6666666666666665,
"grad_norm": 1.1640625,
"learning_rate": 0.00045895286381508944,
"loss": 5.7761,
"mean_token_accuracy": 0.16845725029706954,
"num_tokens": 6187477.0,
"step": 3005
},
{
"entropy": 5.930504608154297,
"epoch": 2.6711051930758987,
"grad_norm": 1.2421875,
"learning_rate": 0.0004587542899162642,
"loss": 5.8067,
"mean_token_accuracy": 0.16042507588863372,
"num_tokens": 6196961.0,
"step": 3010
},
{
"entropy": 5.972206020355225,
"epoch": 2.675543719485131,
"grad_norm": 1.265625,
"learning_rate": 0.00045855528530993874,
"loss": 5.8621,
"mean_token_accuracy": 0.15465489625930787,
"num_tokens": 6206267.0,
"step": 3015
},
{
"entropy": 5.989437532424927,
"epoch": 2.679982245894363,
"grad_norm": 1.1796875,
"learning_rate": 0.0004583558504625661,
"loss": 5.8806,
"mean_token_accuracy": 0.1598665952682495,
"num_tokens": 6216960.0,
"step": 3020
},
{
"entropy": 5.972441625595093,
"epoch": 2.684420772303595,
"grad_norm": 1.09375,
"learning_rate": 0.00045815598584160824,
"loss": 5.8508,
"mean_token_accuracy": 0.15688182711601256,
"num_tokens": 6227843.0,
"step": 3025
},
{
"entropy": 5.931846618652344,
"epoch": 2.6888592987128273,
"grad_norm": 1.2578125,
"learning_rate": 0.00045795569191553384,
"loss": 5.7869,
"mean_token_accuracy": 0.1634823426604271,
"num_tokens": 6236712.0,
"step": 3030
},
{
"entropy": 6.0422979354858395,
"epoch": 2.6932978251220594,
"grad_norm": 1.078125,
"learning_rate": 0.0004577549691538183,
"loss": 5.867,
"mean_token_accuracy": 0.15649005323648452,
"num_tokens": 6248021.0,
"step": 3035
},
{
"entropy": 6.038855028152466,
"epoch": 2.6977363515312915,
"grad_norm": 1.2265625,
"learning_rate": 0.00045755381802694206,
"loss": 5.9027,
"mean_token_accuracy": 0.15194420740008355,
"num_tokens": 6259582.0,
"step": 3040
},
{
"entropy": 5.9294596195220945,
"epoch": 2.7021748779405237,
"grad_norm": 1.2109375,
"learning_rate": 0.00045735223900638967,
"loss": 5.8207,
"mean_token_accuracy": 0.15803860276937484,
"num_tokens": 6269835.0,
"step": 3045
},
{
"entropy": 5.9558673858642575,
"epoch": 2.706613404349756,
"grad_norm": 1.21875,
"learning_rate": 0.00045715023256464855,
"loss": 5.746,
"mean_token_accuracy": 0.16712094992399215,
"num_tokens": 6279486.0,
"step": 3050
},
{
"entropy": 5.922696256637574,
"epoch": 2.711051930758988,
"grad_norm": 1.0234375,
"learning_rate": 0.00045694779917520797,
"loss": 5.817,
"mean_token_accuracy": 0.16085006594657897,
"num_tokens": 6290273.0,
"step": 3055
},
{
"entropy": 5.900194597244263,
"epoch": 2.71549045716822,
"grad_norm": 1.2265625,
"learning_rate": 0.000456744939312558,
"loss": 5.6937,
"mean_token_accuracy": 0.17415937334299086,
"num_tokens": 6299543.0,
"step": 3060
},
{
"entropy": 5.909957361221314,
"epoch": 2.7199289835774523,
"grad_norm": 1.0703125,
"learning_rate": 0.0004565416534521883,
"loss": 5.7641,
"mean_token_accuracy": 0.1630728706717491,
"num_tokens": 6309813.0,
"step": 3065
},
{
"entropy": 5.874665069580078,
"epoch": 2.7243675099866844,
"grad_norm": 1.15625,
"learning_rate": 0.000456337942070587,
"loss": 5.7821,
"mean_token_accuracy": 0.1703098714351654,
"num_tokens": 6319961.0,
"step": 3070
},
{
"entropy": 5.964541339874268,
"epoch": 2.7288060363959166,
"grad_norm": 1.09375,
"learning_rate": 0.0004561338056452396,
"loss": 5.737,
"mean_token_accuracy": 0.16806395202875138,
"num_tokens": 6329585.0,
"step": 3075
},
{
"entropy": 5.92868595123291,
"epoch": 2.7332445628051487,
"grad_norm": 1.1484375,
"learning_rate": 0.0004559292446546281,
"loss": 5.7987,
"mean_token_accuracy": 0.16131089478731156,
"num_tokens": 6339527.0,
"step": 3080
},
{
"entropy": 5.970851278305053,
"epoch": 2.737683089214381,
"grad_norm": 1.078125,
"learning_rate": 0.0004557242595782293,
"loss": 5.7985,
"mean_token_accuracy": 0.15973087251186371,
"num_tokens": 6350079.0,
"step": 3085
},
{
"entropy": 5.91132082939148,
"epoch": 2.742121615623613,
"grad_norm": 1.125,
"learning_rate": 0.0004555188508965144,
"loss": 5.7925,
"mean_token_accuracy": 0.16054237484931946,
"num_tokens": 6359999.0,
"step": 3090
},
{
"entropy": 5.912930011749268,
"epoch": 2.746560142032845,
"grad_norm": 1.0703125,
"learning_rate": 0.00045531301909094724,
"loss": 5.7963,
"mean_token_accuracy": 0.1637853652238846,
"num_tokens": 6370643.0,
"step": 3095
},
{
"entropy": 5.9343184471130375,
"epoch": 2.7509986684420773,
"grad_norm": 1.09375,
"learning_rate": 0.0004551067646439834,
"loss": 5.8199,
"mean_token_accuracy": 0.15766822546720505,
"num_tokens": 6381132.0,
"step": 3100
},
{
"entropy": 5.960313940048218,
"epoch": 2.7554371948513094,
"grad_norm": 1.15625,
"learning_rate": 0.00045490008803906936,
"loss": 5.7392,
"mean_token_accuracy": 0.16581773906946182,
"num_tokens": 6391143.0,
"step": 3105
},
{
"entropy": 5.841590690612793,
"epoch": 2.7598757212605416,
"grad_norm": 1.0625,
"learning_rate": 0.0004546929897606409,
"loss": 5.7849,
"mean_token_accuracy": 0.16631501466035842,
"num_tokens": 6401079.0,
"step": 3110
},
{
"entropy": 5.993973875045777,
"epoch": 2.7643142476697737,
"grad_norm": 1.203125,
"learning_rate": 0.00045448547029412225,
"loss": 5.8225,
"mean_token_accuracy": 0.16507848501205444,
"num_tokens": 6412380.0,
"step": 3115
},
{
"entropy": 5.91737003326416,
"epoch": 2.768752774079006,
"grad_norm": 1.234375,
"learning_rate": 0.00045427753012592477,
"loss": 5.7552,
"mean_token_accuracy": 0.1646926447749138,
"num_tokens": 6423198.0,
"step": 3120
},
{
"entropy": 5.957061624526977,
"epoch": 2.773191300488238,
"grad_norm": 1.0859375,
"learning_rate": 0.00045406916974344617,
"loss": 5.8218,
"mean_token_accuracy": 0.15380569249391557,
"num_tokens": 6433850.0,
"step": 3125
},
{
"entropy": 5.903844690322876,
"epoch": 2.77762982689747,
"grad_norm": 1.109375,
"learning_rate": 0.00045386038963506883,
"loss": 5.7171,
"mean_token_accuracy": 0.16169303506612778,
"num_tokens": 6443296.0,
"step": 3130
},
{
"entropy": 5.890790748596191,
"epoch": 2.7820683533067023,
"grad_norm": 1.15625,
"learning_rate": 0.0004536511902901591,
"loss": 5.7452,
"mean_token_accuracy": 0.17047004401683807,
"num_tokens": 6452857.0,
"step": 3135
},
{
"entropy": 5.9857110500335695,
"epoch": 2.7865068797159345,
"grad_norm": 1.1875,
"learning_rate": 0.0004534415721990659,
"loss": 5.8426,
"mean_token_accuracy": 0.15422120094299316,
"num_tokens": 6463027.0,
"step": 3140
},
{
"entropy": 5.9161601066589355,
"epoch": 2.790945406125166,
"grad_norm": 1.1640625,
"learning_rate": 0.00045323153585311975,
"loss": 5.7903,
"mean_token_accuracy": 0.16016594916582108,
"num_tokens": 6473667.0,
"step": 3145
},
{
"entropy": 5.91183705329895,
"epoch": 2.7953839325343983,
"grad_norm": 1.1328125,
"learning_rate": 0.0004530210817446316,
"loss": 5.7923,
"mean_token_accuracy": 0.1590562269091606,
"num_tokens": 6484935.0,
"step": 3150
},
{
"entropy": 5.96208758354187,
"epoch": 2.7998224589436305,
"grad_norm": 1.140625,
"learning_rate": 0.0004528102103668913,
"loss": 5.824,
"mean_token_accuracy": 0.1598386511206627,
"num_tokens": 6496436.0,
"step": 3155
},
{
"entropy": 5.941922044754028,
"epoch": 2.8042609853528626,
"grad_norm": 1.0625,
"learning_rate": 0.0004525989222141671,
"loss": 5.8385,
"mean_token_accuracy": 0.16108565628528596,
"num_tokens": 6506426.0,
"step": 3160
},
{
"entropy": 5.909464502334595,
"epoch": 2.8086995117620948,
"grad_norm": 1.328125,
"learning_rate": 0.00045238721778170386,
"loss": 5.7245,
"mean_token_accuracy": 0.17027909755706788,
"num_tokens": 6516208.0,
"step": 3165
},
{
"entropy": 5.904296827316284,
"epoch": 2.813138038171327,
"grad_norm": 1.15625,
"learning_rate": 0.00045217509756572256,
"loss": 5.8064,
"mean_token_accuracy": 0.16750676929950714,
"num_tokens": 6526989.0,
"step": 3170
},
{
"entropy": 5.950080680847168,
"epoch": 2.817576564580559,
"grad_norm": 1.2265625,
"learning_rate": 0.0004519625620634182,
"loss": 5.779,
"mean_token_accuracy": 0.16853131651878356,
"num_tokens": 6536623.0,
"step": 3175
},
{
"entropy": 5.996464633941651,
"epoch": 2.822015090989791,
"grad_norm": 1.2421875,
"learning_rate": 0.00045174961177295964,
"loss": 5.8603,
"mean_token_accuracy": 0.15565441995859147,
"num_tokens": 6546362.0,
"step": 3180
},
{
"entropy": 5.882690143585205,
"epoch": 2.8264536173990233,
"grad_norm": 1.2265625,
"learning_rate": 0.00045153624719348773,
"loss": 5.7412,
"mean_token_accuracy": 0.16545474231243135,
"num_tokens": 6556018.0,
"step": 3185
},
{
"entropy": 5.9369165897369385,
"epoch": 2.8308921438082555,
"grad_norm": 1.1640625,
"learning_rate": 0.00045132246882511457,
"loss": 5.8711,
"mean_token_accuracy": 0.15271297544240953,
"num_tokens": 6566633.0,
"step": 3190
},
{
"entropy": 5.928608226776123,
"epoch": 2.8353306702174876,
"grad_norm": 1.078125,
"learning_rate": 0.0004511082771689219,
"loss": 5.7848,
"mean_token_accuracy": 0.162632454931736,
"num_tokens": 6577078.0,
"step": 3195
},
{
"entropy": 5.87532901763916,
"epoch": 2.83976919662672,
"grad_norm": 1.140625,
"learning_rate": 0.00045089367272696046,
"loss": 5.7296,
"mean_token_accuracy": 0.16761246025562287,
"num_tokens": 6587012.0,
"step": 3200
},
{
"entropy": 5.853836631774902,
"epoch": 2.844207723035952,
"grad_norm": 1.2734375,
"learning_rate": 0.00045067865600224833,
"loss": 5.7389,
"mean_token_accuracy": 0.16479332596063614,
"num_tokens": 6597487.0,
"step": 3205
},
{
"entropy": 5.851861524581909,
"epoch": 2.848646249445184,
"grad_norm": 1.2109375,
"learning_rate": 0.00045046322749877005,
"loss": 5.8008,
"mean_token_accuracy": 0.16307896375656128,
"num_tokens": 6607959.0,
"step": 3210
},
{
"entropy": 5.999709367752075,
"epoch": 2.853084775854416,
"grad_norm": 1.0859375,
"learning_rate": 0.00045024738772147534,
"loss": 5.8787,
"mean_token_accuracy": 0.15614837110042573,
"num_tokens": 6618790.0,
"step": 3215
},
{
"entropy": 5.923825883865357,
"epoch": 2.8575233022636484,
"grad_norm": 1.2265625,
"learning_rate": 0.0004500311371762778,
"loss": 5.8501,
"mean_token_accuracy": 0.15941908359527587,
"num_tokens": 6628472.0,
"step": 3220
},
{
"entropy": 5.905185556411743,
"epoch": 2.8619618286728805,
"grad_norm": 1.21875,
"learning_rate": 0.00044981447637005396,
"loss": 5.8651,
"mean_token_accuracy": 0.16131409406661987,
"num_tokens": 6638912.0,
"step": 3225
},
{
"entropy": 5.949870872497558,
"epoch": 2.8664003550821127,
"grad_norm": 1.046875,
"learning_rate": 0.000449597405810642,
"loss": 5.8519,
"mean_token_accuracy": 0.1583707645535469,
"num_tokens": 6649533.0,
"step": 3230
},
{
"entropy": 5.891813468933106,
"epoch": 2.870838881491345,
"grad_norm": 1.1328125,
"learning_rate": 0.0004493799260068405,
"loss": 5.7662,
"mean_token_accuracy": 0.1668047934770584,
"num_tokens": 6658936.0,
"step": 3235
},
{
"entropy": 5.957934093475342,
"epoch": 2.875277407900577,
"grad_norm": 1.328125,
"learning_rate": 0.0004491620374684072,
"loss": 5.8351,
"mean_token_accuracy": 0.16199405193328859,
"num_tokens": 6669555.0,
"step": 3240
},
{
"entropy": 5.974352836608887,
"epoch": 2.879715934309809,
"grad_norm": 1.1796875,
"learning_rate": 0.00044894374070605795,
"loss": 5.7669,
"mean_token_accuracy": 0.15872932597994804,
"num_tokens": 6680298.0,
"step": 3245
},
{
"entropy": 5.8650794506073,
"epoch": 2.8841544607190412,
"grad_norm": 1.1875,
"learning_rate": 0.00044872503623146544,
"loss": 5.8364,
"mean_token_accuracy": 0.1566520646214485,
"num_tokens": 6690852.0,
"step": 3250
},
{
"entropy": 5.917939901351929,
"epoch": 2.8885929871282734,
"grad_norm": 1.1484375,
"learning_rate": 0.00044850592455725804,
"loss": 5.8772,
"mean_token_accuracy": 0.16597653180360794,
"num_tokens": 6701442.0,
"step": 3255
},
{
"entropy": 5.969485950469971,
"epoch": 2.8930315135375055,
"grad_norm": 1.1640625,
"learning_rate": 0.0004482864061970185,
"loss": 5.812,
"mean_token_accuracy": 0.15813857614994048,
"num_tokens": 6711176.0,
"step": 3260
},
{
"entropy": 5.85574049949646,
"epoch": 2.8974700399467377,
"grad_norm": 1.1328125,
"learning_rate": 0.00044806648166528286,
"loss": 5.7762,
"mean_token_accuracy": 0.16221853271126746,
"num_tokens": 6721869.0,
"step": 3265
},
{
"entropy": 5.909014701843262,
"epoch": 2.90190856635597,
"grad_norm": 1.2421875,
"learning_rate": 0.00044784615147753934,
"loss": 5.7292,
"mean_token_accuracy": 0.1643129900097847,
"num_tokens": 6731004.0,
"step": 3270
},
{
"entropy": 6.034462118148804,
"epoch": 2.906347092765202,
"grad_norm": 1.359375,
"learning_rate": 0.00044762541615022664,
"loss": 5.8652,
"mean_token_accuracy": 0.15844893604516982,
"num_tokens": 6741793.0,
"step": 3275
},
{
"entropy": 6.018981266021728,
"epoch": 2.910785619174434,
"grad_norm": 1.0625,
"learning_rate": 0.00044740427620073344,
"loss": 5.8222,
"mean_token_accuracy": 0.1608099490404129,
"num_tokens": 6753177.0,
"step": 3280
},
{
"entropy": 5.9532171249389645,
"epoch": 2.9152241455836663,
"grad_norm": 1.125,
"learning_rate": 0.00044718273214739654,
"loss": 5.8773,
"mean_token_accuracy": 0.15125300288200377,
"num_tokens": 6763104.0,
"step": 3285
},
{
"entropy": 5.929151487350464,
"epoch": 2.9196626719928984,
"grad_norm": 1.171875,
"learning_rate": 0.0004469607845095002,
"loss": 5.8162,
"mean_token_accuracy": 0.16089233607053757,
"num_tokens": 6773823.0,
"step": 3290
},
{
"entropy": 5.9447283267974855,
"epoch": 2.9241011984021306,
"grad_norm": 1.2265625,
"learning_rate": 0.0004467384338072744,
"loss": 5.7967,
"mean_token_accuracy": 0.16282767355442046,
"num_tokens": 6783445.0,
"step": 3295
},
{
"entropy": 5.851709604263306,
"epoch": 2.9285397248113627,
"grad_norm": 1.2734375,
"learning_rate": 0.0004465156805618941,
"loss": 5.681,
"mean_token_accuracy": 0.1752907082438469,
"num_tokens": 6794199.0,
"step": 3300
},
{
"entropy": 5.876345252990722,
"epoch": 2.932978251220595,
"grad_norm": 1.140625,
"learning_rate": 0.0004462925252954775,
"loss": 5.8756,
"mean_token_accuracy": 0.15152985453605652,
"num_tokens": 6804817.0,
"step": 3305
},
{
"entropy": 5.9312444686889645,
"epoch": 2.937416777629827,
"grad_norm": 1.1796875,
"learning_rate": 0.0004460689685310855,
"loss": 5.8161,
"mean_token_accuracy": 0.16338575184345244,
"num_tokens": 6815592.0,
"step": 3310
},
{
"entropy": 5.860175895690918,
"epoch": 2.941855304039059,
"grad_norm": 1.1171875,
"learning_rate": 0.0004458450107927199,
"loss": 5.759,
"mean_token_accuracy": 0.17119106501340867,
"num_tokens": 6825653.0,
"step": 3315
},
{
"entropy": 5.963648462295533,
"epoch": 2.9462938304482913,
"grad_norm": 1.109375,
"learning_rate": 0.00044562065260532214,
"loss": 5.9028,
"mean_token_accuracy": 0.15333495438098907,
"num_tokens": 6836610.0,
"step": 3320
},
{
"entropy": 5.885528802871704,
"epoch": 2.9507323568575234,
"grad_norm": 1.1015625,
"learning_rate": 0.00044539589449477265,
"loss": 5.6927,
"mean_token_accuracy": 0.16941193193197251,
"num_tokens": 6846700.0,
"step": 3325
},
{
"entropy": 5.940938091278076,
"epoch": 2.9551708832667556,
"grad_norm": 1.4921875,
"learning_rate": 0.000445170736987889,
"loss": 5.8498,
"mean_token_accuracy": 0.15794429033994675,
"num_tokens": 6857796.0,
"step": 3330
},
{
"entropy": 5.989238452911377,
"epoch": 2.9596094096759877,
"grad_norm": 1.171875,
"learning_rate": 0.000444945180612425,
"loss": 5.8447,
"mean_token_accuracy": 0.15649579018354415,
"num_tokens": 6868038.0,
"step": 3335
},
{
"entropy": 5.952742576599121,
"epoch": 2.96404793608522,
"grad_norm": 1.1953125,
"learning_rate": 0.00044471922589706944,
"loss": 5.8328,
"mean_token_accuracy": 0.1704735830426216,
"num_tokens": 6878356.0,
"step": 3340
},
{
"entropy": 5.956376743316651,
"epoch": 2.968486462494452,
"grad_norm": 1.2109375,
"learning_rate": 0.0004444928733714446,
"loss": 5.801,
"mean_token_accuracy": 0.1637368842959404,
"num_tokens": 6889087.0,
"step": 3345
},
{
"entropy": 5.929503870010376,
"epoch": 2.972924988903684,
"grad_norm": 1.40625,
"learning_rate": 0.00044426612356610555,
"loss": 5.8323,
"mean_token_accuracy": 0.15772309452295302,
"num_tokens": 6898357.0,
"step": 3350
},
{
"entropy": 5.9494575500488285,
"epoch": 2.9773635153129163,
"grad_norm": 1.515625,
"learning_rate": 0.0004440389770125382,
"loss": 5.9006,
"mean_token_accuracy": 0.1598823130130768,
"num_tokens": 6908363.0,
"step": 3355
},
{
"entropy": 5.953467893600464,
"epoch": 2.9818020417221485,
"grad_norm": 1.1640625,
"learning_rate": 0.0004438114342431586,
"loss": 5.7412,
"mean_token_accuracy": 0.16902253776788712,
"num_tokens": 6918680.0,
"step": 3360
},
{
"entropy": 5.909799098968506,
"epoch": 2.9862405681313806,
"grad_norm": 1.171875,
"learning_rate": 0.00044358349579131143,
"loss": 5.8004,
"mean_token_accuracy": 0.16135867238044738,
"num_tokens": 6929063.0,
"step": 3365
},
{
"entropy": 5.941587018966675,
"epoch": 2.9906790945406128,
"grad_norm": 1.265625,
"learning_rate": 0.00044335516219126876,
"loss": 5.805,
"mean_token_accuracy": 0.15798759311437607,
"num_tokens": 6937862.0,
"step": 3370
},
{
"entropy": 5.936902904510498,
"epoch": 2.995117620949845,
"grad_norm": 1.2421875,
"learning_rate": 0.00044312643397822907,
"loss": 5.8394,
"mean_token_accuracy": 0.16224613785743713,
"num_tokens": 6948838.0,
"step": 3375
},
{
"entropy": 5.955539321899414,
"epoch": 2.999556147359077,
"grad_norm": 1.21875,
"learning_rate": 0.00044289731168831566,
"loss": 5.8572,
"mean_token_accuracy": 0.15817692875862122,
"num_tokens": 6958496.0,
"step": 3380
},
{
"entropy": 5.930147065056695,
"epoch": 3.003550821127386,
"grad_norm": 1.34375,
"learning_rate": 0.0004426677958585755,
"loss": 5.5163,
"mean_token_accuracy": 0.17406127519077724,
"num_tokens": 6967392.0,
"step": 3385
},
{
"entropy": 5.90186071395874,
"epoch": 3.007989347536618,
"grad_norm": 1.2578125,
"learning_rate": 0.00044243788702697797,
"loss": 5.4168,
"mean_token_accuracy": 0.18226586729288102,
"num_tokens": 6976740.0,
"step": 3390
},
{
"entropy": 5.921399211883545,
"epoch": 3.01242787394585,
"grad_norm": 1.2109375,
"learning_rate": 0.0004422075857324137,
"loss": 5.461,
"mean_token_accuracy": 0.17682978212833406,
"num_tokens": 6986058.0,
"step": 3395
},
{
"entropy": 5.805210304260254,
"epoch": 3.0168664003550822,
"grad_norm": 1.1953125,
"learning_rate": 0.00044197689251469324,
"loss": 5.4366,
"mean_token_accuracy": 0.17929895371198654,
"num_tokens": 6997796.0,
"step": 3400
},
{
"entropy": 5.819172430038452,
"epoch": 3.0213049267643144,
"grad_norm": 1.203125,
"learning_rate": 0.00044174580791454555,
"loss": 5.4213,
"mean_token_accuracy": 0.18021279126405715,
"num_tokens": 7008367.0,
"step": 3405
},
{
"entropy": 5.90168023109436,
"epoch": 3.0257434531735465,
"grad_norm": 1.3046875,
"learning_rate": 0.0004415143324736174,
"loss": 5.5685,
"mean_token_accuracy": 0.1715884819626808,
"num_tokens": 7019134.0,
"step": 3410
},
{
"entropy": 5.9204421043396,
"epoch": 3.0301819795827787,
"grad_norm": 1.1484375,
"learning_rate": 0.0004412824667344712,
"loss": 5.4352,
"mean_token_accuracy": 0.17551446259021758,
"num_tokens": 7030078.0,
"step": 3415
},
{
"entropy": 5.873832845687867,
"epoch": 3.034620505992011,
"grad_norm": 1.375,
"learning_rate": 0.00044105021124058455,
"loss": 5.4334,
"mean_token_accuracy": 0.17652692794799804,
"num_tokens": 7039828.0,
"step": 3420
},
{
"entropy": 5.702576208114624,
"epoch": 3.039059032401243,
"grad_norm": 1.140625,
"learning_rate": 0.00044081756653634825,
"loss": 5.4346,
"mean_token_accuracy": 0.19161795526742936,
"num_tokens": 7050842.0,
"step": 3425
},
{
"entropy": 5.811843490600586,
"epoch": 3.043497558810475,
"grad_norm": 1.2890625,
"learning_rate": 0.0004405845331670659,
"loss": 5.4042,
"mean_token_accuracy": 0.1850294515490532,
"num_tokens": 7059872.0,
"step": 3430
},
{
"entropy": 5.8140980243682865,
"epoch": 3.0479360852197073,
"grad_norm": 1.2421875,
"learning_rate": 0.0004403511116789514,
"loss": 5.4583,
"mean_token_accuracy": 0.17900667041540147,
"num_tokens": 7069625.0,
"step": 3435
},
{
"entropy": 5.849609327316284,
"epoch": 3.052374611628939,
"grad_norm": 1.25,
"learning_rate": 0.00044011730261912915,
"loss": 5.4784,
"mean_token_accuracy": 0.1747259259223938,
"num_tokens": 7078890.0,
"step": 3440
},
{
"entropy": 5.818154144287109,
"epoch": 3.056813138038171,
"grad_norm": 1.2265625,
"learning_rate": 0.0004398831065356314,
"loss": 5.4591,
"mean_token_accuracy": 0.18030397742986679,
"num_tokens": 7089123.0,
"step": 3445
},
{
"entropy": 5.864135217666626,
"epoch": 3.0612516644474033,
"grad_norm": 1.1640625,
"learning_rate": 0.00043964852397739793,
"loss": 5.4633,
"mean_token_accuracy": 0.1758294314146042,
"num_tokens": 7100053.0,
"step": 3450
},
{
"entropy": 5.854467535018921,
"epoch": 3.0656901908566354,
"grad_norm": 3.125,
"learning_rate": 0.000439413555494274,
"loss": 5.5035,
"mean_token_accuracy": 0.17171409279108046,
"num_tokens": 7110528.0,
"step": 3455
},
{
"entropy": 5.797104597091675,
"epoch": 3.0701287172658676,
"grad_norm": 1.25,
"learning_rate": 0.0004391782016370098,
"loss": 5.552,
"mean_token_accuracy": 0.17069081217050552,
"num_tokens": 7121691.0,
"step": 3460
},
{
"entropy": 5.799645948410034,
"epoch": 3.0745672436750997,
"grad_norm": 1.140625,
"learning_rate": 0.0004389424629572586,
"loss": 5.4676,
"mean_token_accuracy": 0.17778647989034652,
"num_tokens": 7131689.0,
"step": 3465
},
{
"entropy": 5.832806205749511,
"epoch": 3.079005770084332,
"grad_norm": 1.1796875,
"learning_rate": 0.00043870634000757605,
"loss": 5.5696,
"mean_token_accuracy": 0.1696484714746475,
"num_tokens": 7142595.0,
"step": 3470
},
{
"entropy": 5.8818260669708256,
"epoch": 3.083444296493564,
"grad_norm": 1.453125,
"learning_rate": 0.0004384698333414179,
"loss": 5.4671,
"mean_token_accuracy": 0.17925113886594773,
"num_tokens": 7152092.0,
"step": 3475
},
{
"entropy": 5.796309995651245,
"epoch": 3.087882822902796,
"grad_norm": 1.1875,
"learning_rate": 0.0004382329435131396,
"loss": 5.4868,
"mean_token_accuracy": 0.17726072669029236,
"num_tokens": 7163053.0,
"step": 3480
},
{
"entropy": 5.830512142181396,
"epoch": 3.0923213493120283,
"grad_norm": 1.3828125,
"learning_rate": 0.00043799567107799504,
"loss": 5.435,
"mean_token_accuracy": 0.18380391746759414,
"num_tokens": 7172812.0,
"step": 3485
},
{
"entropy": 5.815919589996338,
"epoch": 3.0967598757212604,
"grad_norm": 1.4140625,
"learning_rate": 0.00043775801659213425,
"loss": 5.4432,
"mean_token_accuracy": 0.18219853341579437,
"num_tokens": 7183234.0,
"step": 3490
},
{
"entropy": 5.867840814590454,
"epoch": 3.1011984021304926,
"grad_norm": 1.171875,
"learning_rate": 0.0004375199806126034,
"loss": 5.5505,
"mean_token_accuracy": 0.17434204816818238,
"num_tokens": 7193614.0,
"step": 3495
},
{
"entropy": 5.865722894668579,
"epoch": 3.1056369285397247,
"grad_norm": 1.0859375,
"learning_rate": 0.00043728156369734236,
"loss": 5.5435,
"mean_token_accuracy": 0.17825270295143128,
"num_tokens": 7204836.0,
"step": 3500
},
{
"epoch": 3.1056369285397247,
"eval_entropy": 5.67943718654243,
"eval_loss": 6.10019063949585,
"eval_mean_token_accuracy": 0.15331950948314826,
"eval_num_tokens": 7204836.0,
"eval_runtime": 2.6975,
"eval_samples_per_second": 1248.216,
"eval_steps_per_second": 156.073,
"step": 3500
},
{
"entropy": 5.769807004928589,
"epoch": 3.110075454948957,
"grad_norm": 1.203125,
"learning_rate": 0.0004370427664051841,
"loss": 5.4519,
"mean_token_accuracy": 0.17842291593551635,
"num_tokens": 7215138.0,
"step": 3505
},
{
"entropy": 5.7893476486206055,
"epoch": 3.114513981358189,
"grad_norm": 1.1953125,
"learning_rate": 0.0004368035892958533,
"loss": 5.5557,
"mean_token_accuracy": 0.17136096805334092,
"num_tokens": 7226468.0,
"step": 3510
},
{
"entropy": 5.889794778823853,
"epoch": 3.118952507767421,
"grad_norm": 1.1328125,
"learning_rate": 0.00043656403292996454,
"loss": 5.5482,
"mean_token_accuracy": 0.17302740216255189,
"num_tokens": 7235904.0,
"step": 3515
},
{
"entropy": 5.793400382995605,
"epoch": 3.1233910341766533,
"grad_norm": 1.234375,
"learning_rate": 0.0004363240978690218,
"loss": 5.5274,
"mean_token_accuracy": 0.17253278195858002,
"num_tokens": 7245933.0,
"step": 3520
},
{
"entropy": 5.846996784210205,
"epoch": 3.1278295605858855,
"grad_norm": 1.2421875,
"learning_rate": 0.00043608378467541626,
"loss": 5.5482,
"mean_token_accuracy": 0.17442068457603455,
"num_tokens": 7255626.0,
"step": 3525
},
{
"entropy": 5.793939161300659,
"epoch": 3.1322680869951176,
"grad_norm": 1.2265625,
"learning_rate": 0.00043584309391242584,
"loss": 5.471,
"mean_token_accuracy": 0.17612817138433456,
"num_tokens": 7264579.0,
"step": 3530
},
{
"entropy": 5.80440616607666,
"epoch": 3.1367066134043498,
"grad_norm": 1.15625,
"learning_rate": 0.0004356020261442131,
"loss": 5.4877,
"mean_token_accuracy": 0.17804499417543412,
"num_tokens": 7274860.0,
"step": 3535
},
{
"entropy": 5.832252120971679,
"epoch": 3.141145139813582,
"grad_norm": 1.2578125,
"learning_rate": 0.00043536058193582443,
"loss": 5.4445,
"mean_token_accuracy": 0.17826966494321822,
"num_tokens": 7285236.0,
"step": 3540
},
{
"entropy": 5.774497222900391,
"epoch": 3.145583666222814,
"grad_norm": 1.2890625,
"learning_rate": 0.0004351187618531886,
"loss": 5.4918,
"mean_token_accuracy": 0.17440381795167922,
"num_tokens": 7295291.0,
"step": 3545
},
{
"entropy": 5.885190725326538,
"epoch": 3.150022192632046,
"grad_norm": 1.1484375,
"learning_rate": 0.00043487656646311535,
"loss": 5.5069,
"mean_token_accuracy": 0.17112795114517212,
"num_tokens": 7306237.0,
"step": 3550
},
{
"entropy": 5.744331693649292,
"epoch": 3.1544607190412783,
"grad_norm": 1.2890625,
"learning_rate": 0.0004346339963332941,
"loss": 5.4601,
"mean_token_accuracy": 0.18217105120420457,
"num_tokens": 7316695.0,
"step": 3555
},
{
"entropy": 5.734088611602783,
"epoch": 3.1588992454505105,
"grad_norm": 1.28125,
"learning_rate": 0.0004343910520322927,
"loss": 5.4478,
"mean_token_accuracy": 0.18409417420625687,
"num_tokens": 7325942.0,
"step": 3560
},
{
"entropy": 5.781349754333496,
"epoch": 3.1633377718597426,
"grad_norm": 1.1328125,
"learning_rate": 0.000434147734129556,
"loss": 5.557,
"mean_token_accuracy": 0.17307535111904143,
"num_tokens": 7336817.0,
"step": 3565
},
{
"entropy": 5.821921443939209,
"epoch": 3.1677762982689748,
"grad_norm": 1.125,
"learning_rate": 0.00043390404319540443,
"loss": 5.5423,
"mean_token_accuracy": 0.17289045602083206,
"num_tokens": 7347072.0,
"step": 3570
},
{
"entropy": 5.850234889984131,
"epoch": 3.172214824678207,
"grad_norm": 1.2265625,
"learning_rate": 0.00043365997980103304,
"loss": 5.4943,
"mean_token_accuracy": 0.1778233155608177,
"num_tokens": 7357125.0,
"step": 3575
},
{
"entropy": 5.763746833801269,
"epoch": 3.176653351087439,
"grad_norm": 1.1171875,
"learning_rate": 0.00043341554451850964,
"loss": 5.4796,
"mean_token_accuracy": 0.1793802037835121,
"num_tokens": 7367290.0,
"step": 3580
},
{
"entropy": 5.780725145339966,
"epoch": 3.181091877496671,
"grad_norm": 1.171875,
"learning_rate": 0.00043317073792077394,
"loss": 5.4474,
"mean_token_accuracy": 0.18791042119264603,
"num_tokens": 7377126.0,
"step": 3585
},
{
"entropy": 5.8030867099761965,
"epoch": 3.1855304039059034,
"grad_norm": 1.03125,
"learning_rate": 0.0004329255605816357,
"loss": 5.4992,
"mean_token_accuracy": 0.17195357382297516,
"num_tokens": 7388136.0,
"step": 3590
},
{
"entropy": 5.821031093597412,
"epoch": 3.1899689303151355,
"grad_norm": 1.2421875,
"learning_rate": 0.000432680013075774,
"loss": 5.436,
"mean_token_accuracy": 0.17939778566360473,
"num_tokens": 7397781.0,
"step": 3595
},
{
"entropy": 5.805264902114868,
"epoch": 3.1944074567243677,
"grad_norm": 1.1640625,
"learning_rate": 0.0004324340959787354,
"loss": 5.4492,
"mean_token_accuracy": 0.17887378931045533,
"num_tokens": 7407135.0,
"step": 3600
},
{
"entropy": 5.814063787460327,
"epoch": 3.1988459831336,
"grad_norm": 1.140625,
"learning_rate": 0.00043218780986693274,
"loss": 5.5155,
"mean_token_accuracy": 0.1740931436419487,
"num_tokens": 7417614.0,
"step": 3605
},
{
"entropy": 5.742436218261719,
"epoch": 3.203284509542832,
"grad_norm": 1.21875,
"learning_rate": 0.0004319411553176438,
"loss": 5.5237,
"mean_token_accuracy": 0.17489579766988755,
"num_tokens": 7427792.0,
"step": 3610
},
{
"entropy": 5.751005458831787,
"epoch": 3.207723035952064,
"grad_norm": 1.28125,
"learning_rate": 0.0004316941329090101,
"loss": 5.4246,
"mean_token_accuracy": 0.1843129500746727,
"num_tokens": 7437310.0,
"step": 3615
},
{
"entropy": 5.804794406890869,
"epoch": 3.2121615623612962,
"grad_norm": 1.2265625,
"learning_rate": 0.00043144674322003525,
"loss": 5.5249,
"mean_token_accuracy": 0.1753912925720215,
"num_tokens": 7447451.0,
"step": 3620
},
{
"entropy": 5.8752443313598635,
"epoch": 3.2166000887705284,
"grad_norm": 1.2265625,
"learning_rate": 0.0004311989868305837,
"loss": 5.536,
"mean_token_accuracy": 0.1762519434094429,
"num_tokens": 7456837.0,
"step": 3625
},
{
"entropy": 5.7469000816345215,
"epoch": 3.2210386151797605,
"grad_norm": 1.28125,
"learning_rate": 0.00043095086432137954,
"loss": 5.5601,
"mean_token_accuracy": 0.17813700139522554,
"num_tokens": 7466832.0,
"step": 3630
},
{
"entropy": 5.867207765579224,
"epoch": 3.2254771415889927,
"grad_norm": 1.0703125,
"learning_rate": 0.000430702376274005,
"loss": 5.5123,
"mean_token_accuracy": 0.181433866918087,
"num_tokens": 7476833.0,
"step": 3635
},
{
"entropy": 5.72882194519043,
"epoch": 3.2299156679982244,
"grad_norm": 1.21875,
"learning_rate": 0.00043045352327089907,
"loss": 5.4978,
"mean_token_accuracy": 0.17953841239213944,
"num_tokens": 7486980.0,
"step": 3640
},
{
"entropy": 5.76573543548584,
"epoch": 3.2343541944074565,
"grad_norm": 1.375,
"learning_rate": 0.00043020430589535625,
"loss": 5.511,
"mean_token_accuracy": 0.1714419886469841,
"num_tokens": 7496612.0,
"step": 3645
},
{
"entropy": 5.787287712097168,
"epoch": 3.2387927208166887,
"grad_norm": 1.2109375,
"learning_rate": 0.000429954724731525,
"loss": 5.5044,
"mean_token_accuracy": 0.17498656511306762,
"num_tokens": 7506704.0,
"step": 3650
},
{
"entropy": 5.848012685775757,
"epoch": 3.243231247225921,
"grad_norm": 1.1328125,
"learning_rate": 0.0004297047803644063,
"loss": 5.5579,
"mean_token_accuracy": 0.16941310465335846,
"num_tokens": 7517914.0,
"step": 3655
},
{
"entropy": 5.829830932617187,
"epoch": 3.247669773635153,
"grad_norm": 1.1953125,
"learning_rate": 0.000429454473379853,
"loss": 5.5851,
"mean_token_accuracy": 0.16952553391456604,
"num_tokens": 7527610.0,
"step": 3660
},
{
"entropy": 5.78036208152771,
"epoch": 3.252108300044385,
"grad_norm": 1.421875,
"learning_rate": 0.0004292038043645675,
"loss": 5.579,
"mean_token_accuracy": 0.17085347920656205,
"num_tokens": 7536721.0,
"step": 3665
},
{
"entropy": 5.835186433792114,
"epoch": 3.2565468264536173,
"grad_norm": 1.21875,
"learning_rate": 0.00042895277390610074,
"loss": 5.5393,
"mean_token_accuracy": 0.16900095343589783,
"num_tokens": 7546508.0,
"step": 3670
},
{
"entropy": 5.8003698825836185,
"epoch": 3.2609853528628494,
"grad_norm": 1.2578125,
"learning_rate": 0.0004287013825928509,
"loss": 5.4926,
"mean_token_accuracy": 0.1826077312231064,
"num_tokens": 7556024.0,
"step": 3675
},
{
"entropy": 5.807423114776611,
"epoch": 3.2654238792720816,
"grad_norm": 1.234375,
"learning_rate": 0.0004284496310140622,
"loss": 5.6074,
"mean_token_accuracy": 0.16542265564203262,
"num_tokens": 7566033.0,
"step": 3680
},
{
"entropy": 5.8312273025512695,
"epoch": 3.2698624056813137,
"grad_norm": 1.296875,
"learning_rate": 0.0004281975197598231,
"loss": 5.6146,
"mean_token_accuracy": 0.17007148563861846,
"num_tokens": 7576956.0,
"step": 3685
},
{
"entropy": 5.792421102523804,
"epoch": 3.274300932090546,
"grad_norm": 1.1328125,
"learning_rate": 0.0004279450494210651,
"loss": 5.5571,
"mean_token_accuracy": 0.17620914578437805,
"num_tokens": 7588185.0,
"step": 3690
},
{
"entropy": 5.833206367492676,
"epoch": 3.278739458499778,
"grad_norm": 1.1796875,
"learning_rate": 0.0004276922205895614,
"loss": 5.4967,
"mean_token_accuracy": 0.17706188112497329,
"num_tokens": 7598886.0,
"step": 3695
},
{
"entropy": 5.774030017852783,
"epoch": 3.28317798490901,
"grad_norm": 1.1640625,
"learning_rate": 0.0004274390338579257,
"loss": 5.4094,
"mean_token_accuracy": 0.18668818473815918,
"num_tokens": 7609238.0,
"step": 3700
},
{
"entropy": 5.7815450668334964,
"epoch": 3.2876165113182423,
"grad_norm": 1.1953125,
"learning_rate": 0.0004271854898196102,
"loss": 5.4946,
"mean_token_accuracy": 0.1777348294854164,
"num_tokens": 7619873.0,
"step": 3705
},
{
"entropy": 5.715425872802735,
"epoch": 3.2920550377274744,
"grad_norm": 1.5625,
"learning_rate": 0.0004269315890689049,
"loss": 5.4391,
"mean_token_accuracy": 0.18781703263521193,
"num_tokens": 7628903.0,
"step": 3710
},
{
"entropy": 5.795434141159058,
"epoch": 3.2964935641367066,
"grad_norm": 1.25,
"learning_rate": 0.00042667733220093574,
"loss": 5.6098,
"mean_token_accuracy": 0.16501247882843018,
"num_tokens": 7639774.0,
"step": 3715
},
{
"entropy": 5.788212394714355,
"epoch": 3.3009320905459387,
"grad_norm": 1.34375,
"learning_rate": 0.0004264227198116635,
"loss": 5.5198,
"mean_token_accuracy": 0.17427263855934144,
"num_tokens": 7649739.0,
"step": 3720
},
{
"entropy": 5.754326581954956,
"epoch": 3.305370616955171,
"grad_norm": 1.1875,
"learning_rate": 0.00042616775249788223,
"loss": 5.4986,
"mean_token_accuracy": 0.17347201257944106,
"num_tokens": 7659329.0,
"step": 3725
},
{
"entropy": 5.818285989761352,
"epoch": 3.309809143364403,
"grad_norm": 1.25,
"learning_rate": 0.0004259124308572178,
"loss": 5.5031,
"mean_token_accuracy": 0.17783356904983522,
"num_tokens": 7669754.0,
"step": 3730
},
{
"entropy": 5.849746561050415,
"epoch": 3.314247669773635,
"grad_norm": 1.2578125,
"learning_rate": 0.0004256567554881268,
"loss": 5.5744,
"mean_token_accuracy": 0.16835701167583467,
"num_tokens": 7679139.0,
"step": 3735
},
{
"entropy": 5.756852912902832,
"epoch": 3.3186861961828673,
"grad_norm": 1.4765625,
"learning_rate": 0.0004254007269898948,
"loss": 5.4857,
"mean_token_accuracy": 0.17899881154298783,
"num_tokens": 7689210.0,
"step": 3740
},
{
"entropy": 5.784307432174683,
"epoch": 3.3231247225920995,
"grad_norm": 1.3203125,
"learning_rate": 0.00042514434596263513,
"loss": 5.5316,
"mean_token_accuracy": 0.17348483949899673,
"num_tokens": 7698741.0,
"step": 3745
},
{
"entropy": 5.769883012771606,
"epoch": 3.3275632490013316,
"grad_norm": 1.78125,
"learning_rate": 0.0004248876130072873,
"loss": 5.5304,
"mean_token_accuracy": 0.1791750445961952,
"num_tokens": 7708398.0,
"step": 3750
},
{
"entropy": 5.805131721496582,
"epoch": 3.3320017754105637,
"grad_norm": 1.2421875,
"learning_rate": 0.00042463052872561587,
"loss": 5.4996,
"mean_token_accuracy": 0.17841846048831939,
"num_tokens": 7718574.0,
"step": 3755
},
{
"entropy": 5.776119947433472,
"epoch": 3.336440301819796,
"grad_norm": 1.25,
"learning_rate": 0.00042437309372020886,
"loss": 5.491,
"mean_token_accuracy": 0.18578603267669677,
"num_tokens": 7728453.0,
"step": 3760
},
{
"entropy": 5.758517026901245,
"epoch": 3.340878828229028,
"grad_norm": 1.2578125,
"learning_rate": 0.00042411530859447634,
"loss": 5.4694,
"mean_token_accuracy": 0.17349309474229813,
"num_tokens": 7738928.0,
"step": 3765
},
{
"entropy": 5.788589143753052,
"epoch": 3.34531735463826,
"grad_norm": 1.1640625,
"learning_rate": 0.0004238571739526489,
"loss": 5.5044,
"mean_token_accuracy": 0.18183342814445497,
"num_tokens": 7748828.0,
"step": 3770
},
{
"entropy": 5.8095966339111325,
"epoch": 3.3497558810474923,
"grad_norm": 1.203125,
"learning_rate": 0.0004235986903997767,
"loss": 5.5192,
"mean_token_accuracy": 0.17913017868995668,
"num_tokens": 7759533.0,
"step": 3775
},
{
"entropy": 5.770309352874756,
"epoch": 3.3541944074567245,
"grad_norm": 1.3671875,
"learning_rate": 0.0004233398585417275,
"loss": 5.4932,
"mean_token_accuracy": 0.17637839764356614,
"num_tokens": 7769511.0,
"step": 3780
},
{
"entropy": 5.806517553329468,
"epoch": 3.3586329338659566,
"grad_norm": 1.1015625,
"learning_rate": 0.0004230806789851854,
"loss": 5.5236,
"mean_token_accuracy": 0.1788152739405632,
"num_tokens": 7779579.0,
"step": 3785
},
{
"entropy": 5.761344146728516,
"epoch": 3.3630714602751888,
"grad_norm": 1.328125,
"learning_rate": 0.00042282115233764953,
"loss": 5.5373,
"mean_token_accuracy": 0.18033097833395004,
"num_tokens": 7789739.0,
"step": 3790
},
{
"entropy": 5.832413530349731,
"epoch": 3.367509986684421,
"grad_norm": 1.3515625,
"learning_rate": 0.0004225612792074326,
"loss": 5.5743,
"mean_token_accuracy": 0.17297957986593246,
"num_tokens": 7798744.0,
"step": 3795
},
{
"entropy": 5.769485569000244,
"epoch": 3.371948513093653,
"grad_norm": 1.28125,
"learning_rate": 0.00042230106020365964,
"loss": 5.4193,
"mean_token_accuracy": 0.1825847089290619,
"num_tokens": 7808111.0,
"step": 3800
},
{
"entropy": 5.798009586334229,
"epoch": 3.376387039502885,
"grad_norm": 1.203125,
"learning_rate": 0.00042204049593626617,
"loss": 5.4902,
"mean_token_accuracy": 0.17742030769586564,
"num_tokens": 7818673.0,
"step": 3805
},
{
"entropy": 5.741698551177978,
"epoch": 3.3808255659121174,
"grad_norm": 1.2265625,
"learning_rate": 0.00042177958701599696,
"loss": 5.508,
"mean_token_accuracy": 0.17802224904298783,
"num_tokens": 7829165.0,
"step": 3810
},
{
"entropy": 5.735812187194824,
"epoch": 3.3852640923213495,
"grad_norm": 1.2890625,
"learning_rate": 0.0004215183340544047,
"loss": 5.4262,
"mean_token_accuracy": 0.1855878248810768,
"num_tokens": 7839345.0,
"step": 3815
},
{
"entropy": 5.765830135345459,
"epoch": 3.389702618730581,
"grad_norm": 1.109375,
"learning_rate": 0.0004212567376638485,
"loss": 5.5266,
"mean_token_accuracy": 0.18168332129716874,
"num_tokens": 7850232.0,
"step": 3820
},
{
"entropy": 5.817579126358032,
"epoch": 3.3941411451398134,
"grad_norm": 1.265625,
"learning_rate": 0.00042099479845749256,
"loss": 5.5961,
"mean_token_accuracy": 0.16893403679132463,
"num_tokens": 7860109.0,
"step": 3825
},
{
"entropy": 5.775877475738525,
"epoch": 3.3985796715490455,
"grad_norm": 1.1328125,
"learning_rate": 0.00042073251704930414,
"loss": 5.5559,
"mean_token_accuracy": 0.17739353477954864,
"num_tokens": 7870466.0,
"step": 3830
},
{
"entropy": 5.847122144699097,
"epoch": 3.4030181979582776,
"grad_norm": 1.1328125,
"learning_rate": 0.00042046989405405326,
"loss": 5.5934,
"mean_token_accuracy": 0.17239516228437424,
"num_tokens": 7880460.0,
"step": 3835
},
{
"entropy": 5.73626298904419,
"epoch": 3.40745672436751,
"grad_norm": 1.2109375,
"learning_rate": 0.0004202069300873102,
"loss": 5.444,
"mean_token_accuracy": 0.17805344611406326,
"num_tokens": 7890099.0,
"step": 3840
},
{
"entropy": 5.804626178741455,
"epoch": 3.411895250776742,
"grad_norm": 1.2265625,
"learning_rate": 0.0004199436257654445,
"loss": 5.5374,
"mean_token_accuracy": 0.17474997490644456,
"num_tokens": 7900484.0,
"step": 3845
},
{
"entropy": 5.791158151626587,
"epoch": 3.416333777185974,
"grad_norm": 1.1484375,
"learning_rate": 0.0004196799817056234,
"loss": 5.5676,
"mean_token_accuracy": 0.1661073759198189,
"num_tokens": 7911408.0,
"step": 3850
},
{
"entropy": 5.822518634796142,
"epoch": 3.4207723035952062,
"grad_norm": 1.1953125,
"learning_rate": 0.00041941599852581067,
"loss": 5.5941,
"mean_token_accuracy": 0.16456971168518067,
"num_tokens": 7922317.0,
"step": 3855
},
{
"entropy": 5.850543022155762,
"epoch": 3.4252108300044384,
"grad_norm": 1.1953125,
"learning_rate": 0.00041915167684476495,
"loss": 5.5218,
"mean_token_accuracy": 0.18075551390647887,
"num_tokens": 7932713.0,
"step": 3860
},
{
"entropy": 5.771756839752197,
"epoch": 3.4296493564136705,
"grad_norm": 1.265625,
"learning_rate": 0.000418887017282038,
"loss": 5.4753,
"mean_token_accuracy": 0.1776781052350998,
"num_tokens": 7942639.0,
"step": 3865
},
{
"entropy": 5.707421112060547,
"epoch": 3.4340878828229027,
"grad_norm": 1.25,
"learning_rate": 0.00041862202045797386,
"loss": 5.5052,
"mean_token_accuracy": 0.18350479304790496,
"num_tokens": 7953094.0,
"step": 3870
},
{
"entropy": 5.789714384078979,
"epoch": 3.438526409232135,
"grad_norm": 1.234375,
"learning_rate": 0.0004183566869937069,
"loss": 5.5103,
"mean_token_accuracy": 0.17723090648651124,
"num_tokens": 7963070.0,
"step": 3875
},
{
"entropy": 5.729114675521851,
"epoch": 3.442964935641367,
"grad_norm": 1.2109375,
"learning_rate": 0.0004180910175111608,
"loss": 5.4825,
"mean_token_accuracy": 0.18474385887384415,
"num_tokens": 7972957.0,
"step": 3880
},
{
"entropy": 5.81961579322815,
"epoch": 3.447403462050599,
"grad_norm": 1.1875,
"learning_rate": 0.00041782501263304655,
"loss": 5.5174,
"mean_token_accuracy": 0.17037456184625627,
"num_tokens": 7982759.0,
"step": 3885
},
{
"entropy": 5.793990993499756,
"epoch": 3.4518419884598313,
"grad_norm": 1.21875,
"learning_rate": 0.0004175586729828614,
"loss": 5.6276,
"mean_token_accuracy": 0.1665704995393753,
"num_tokens": 7993300.0,
"step": 3890
},
{
"entropy": 5.737445640563965,
"epoch": 3.4562805148690634,
"grad_norm": 1.1484375,
"learning_rate": 0.00041729199918488725,
"loss": 5.4466,
"mean_token_accuracy": 0.1841512829065323,
"num_tokens": 8003175.0,
"step": 3895
},
{
"entropy": 5.7286967754364015,
"epoch": 3.4607190412782955,
"grad_norm": 1.1484375,
"learning_rate": 0.00041702499186418936,
"loss": 5.4967,
"mean_token_accuracy": 0.18316451460123062,
"num_tokens": 8013399.0,
"step": 3900
},
{
"entropy": 5.761036109924317,
"epoch": 3.4651575676875277,
"grad_norm": 1.25,
"learning_rate": 0.00041675765164661473,
"loss": 5.5364,
"mean_token_accuracy": 0.1704569160938263,
"num_tokens": 8022939.0,
"step": 3905
},
{
"entropy": 5.758256196975708,
"epoch": 3.46959609409676,
"grad_norm": 1.2265625,
"learning_rate": 0.0004164899791587903,
"loss": 5.5904,
"mean_token_accuracy": 0.17271675616502763,
"num_tokens": 8034267.0,
"step": 3910
},
{
"entropy": 5.749184274673462,
"epoch": 3.474034620505992,
"grad_norm": 1.3203125,
"learning_rate": 0.00041622197502812224,
"loss": 5.4549,
"mean_token_accuracy": 0.17980799823999405,
"num_tokens": 8044270.0,
"step": 3915
},
{
"entropy": 5.827999448776245,
"epoch": 3.478473146915224,
"grad_norm": 1.046875,
"learning_rate": 0.000415953639882794,
"loss": 5.5304,
"mean_token_accuracy": 0.1710374191403389,
"num_tokens": 8055775.0,
"step": 3920
},
{
"entropy": 5.766659116744995,
"epoch": 3.4829116733244563,
"grad_norm": 1.2890625,
"learning_rate": 0.00041568497435176473,
"loss": 5.5221,
"mean_token_accuracy": 0.17611446529626845,
"num_tokens": 8065768.0,
"step": 3925
},
{
"entropy": 5.748378419876099,
"epoch": 3.4873501997336884,
"grad_norm": 1.1640625,
"learning_rate": 0.0004154159790647681,
"loss": 5.4649,
"mean_token_accuracy": 0.18407126516103745,
"num_tokens": 8075759.0,
"step": 3930
},
{
"entropy": 5.7725756645202635,
"epoch": 3.4917887261429206,
"grad_norm": 1.234375,
"learning_rate": 0.00041514665465231063,
"loss": 5.4982,
"mean_token_accuracy": 0.18658517599105834,
"num_tokens": 8085658.0,
"step": 3935
},
{
"entropy": 5.741648721694946,
"epoch": 3.4962272525521527,
"grad_norm": 1.1796875,
"learning_rate": 0.00041487700174567036,
"loss": 5.5052,
"mean_token_accuracy": 0.17059303522109986,
"num_tokens": 8096094.0,
"step": 3940
},
{
"entropy": 5.767246150970459,
"epoch": 3.500665778961385,
"grad_norm": 1.1484375,
"learning_rate": 0.00041460702097689535,
"loss": 5.5218,
"mean_token_accuracy": 0.1741237834095955,
"num_tokens": 8106617.0,
"step": 3945
},
{
"entropy": 5.773199129104614,
"epoch": 3.505104305370617,
"grad_norm": 1.234375,
"learning_rate": 0.00041433671297880204,
"loss": 5.5496,
"mean_token_accuracy": 0.16931709200143813,
"num_tokens": 8116621.0,
"step": 3950
},
{
"entropy": 5.806981468200684,
"epoch": 3.509542831779849,
"grad_norm": 1.3046875,
"learning_rate": 0.0004140660783849739,
"loss": 5.5137,
"mean_token_accuracy": 0.17311855256557465,
"num_tokens": 8127433.0,
"step": 3955
},
{
"entropy": 5.786522340774536,
"epoch": 3.5139813581890813,
"grad_norm": 1.1640625,
"learning_rate": 0.00041379511782975995,
"loss": 5.5991,
"mean_token_accuracy": 0.17303308695554734,
"num_tokens": 8138568.0,
"step": 3960
},
{
"entropy": 5.76244478225708,
"epoch": 3.5184198845983135,
"grad_norm": 1.25,
"learning_rate": 0.0004135238319482731,
"loss": 5.5114,
"mean_token_accuracy": 0.18091665506362914,
"num_tokens": 8148358.0,
"step": 3965
},
{
"entropy": 5.7167627811431885,
"epoch": 3.5228584110075456,
"grad_norm": 1.25,
"learning_rate": 0.00041325222137638914,
"loss": 5.3969,
"mean_token_accuracy": 0.18320150971412658,
"num_tokens": 8157817.0,
"step": 3970
},
{
"entropy": 5.775286912918091,
"epoch": 3.5272969374167777,
"grad_norm": 1.3203125,
"learning_rate": 0.0004129802867507444,
"loss": 5.5544,
"mean_token_accuracy": 0.17027477473020552,
"num_tokens": 8167599.0,
"step": 3975
},
{
"entropy": 5.696363019943237,
"epoch": 3.53173546382601,
"grad_norm": 1.140625,
"learning_rate": 0.0004127080287087354,
"loss": 5.5232,
"mean_token_accuracy": 0.17984641939401627,
"num_tokens": 8179004.0,
"step": 3980
},
{
"entropy": 5.784954500198364,
"epoch": 3.536173990235242,
"grad_norm": 1.171875,
"learning_rate": 0.00041243544788851616,
"loss": 5.4638,
"mean_token_accuracy": 0.18233600854873658,
"num_tokens": 8189410.0,
"step": 3985
},
{
"entropy": 5.829836797714234,
"epoch": 3.540612516644474,
"grad_norm": 1.1875,
"learning_rate": 0.00041216254492899753,
"loss": 5.6603,
"mean_token_accuracy": 0.1625197023153305,
"num_tokens": 8200712.0,
"step": 3990
},
{
"entropy": 5.799665212631226,
"epoch": 3.5450510430537063,
"grad_norm": 1.171875,
"learning_rate": 0.0004118893204698454,
"loss": 5.5192,
"mean_token_accuracy": 0.17453998774290086,
"num_tokens": 8209907.0,
"step": 3995
},
{
"entropy": 5.747171545028687,
"epoch": 3.5494895694629385,
"grad_norm": 1.1328125,
"learning_rate": 0.0004116157751514793,
"loss": 5.5106,
"mean_token_accuracy": 0.18200805485248567,
"num_tokens": 8220216.0,
"step": 4000
},
{
"epoch": 3.5494895694629385,
"eval_entropy": 5.639556728462709,
"eval_loss": 6.055363178253174,
"eval_mean_token_accuracy": 0.1559798157377934,
"eval_num_tokens": 8220216.0,
"eval_runtime": 2.6999,
"eval_samples_per_second": 1247.088,
"eval_steps_per_second": 155.932,
"step": 4000
},
{
"entropy": 5.758590269088745,
"epoch": 3.5539280958721706,
"grad_norm": 1.2109375,
"learning_rate": 0.00041134190961507073,
"loss": 5.5321,
"mean_token_accuracy": 0.17542774826288224,
"num_tokens": 8230336.0,
"step": 4005
},
{
"entropy": 5.784881734848023,
"epoch": 3.5583666222814028,
"grad_norm": 1.1328125,
"learning_rate": 0.00041106772450254177,
"loss": 5.4653,
"mean_token_accuracy": 0.17452345192432403,
"num_tokens": 8240874.0,
"step": 4010
},
{
"entropy": 5.783570194244385,
"epoch": 3.562805148690635,
"grad_norm": 1.1875,
"learning_rate": 0.00041079322045656366,
"loss": 5.5892,
"mean_token_accuracy": 0.17384659200906755,
"num_tokens": 8252841.0,
"step": 4015
},
{
"entropy": 5.830329322814942,
"epoch": 3.567243675099867,
"grad_norm": 1.1484375,
"learning_rate": 0.000410518398120555,
"loss": 5.5175,
"mean_token_accuracy": 0.17372012734413148,
"num_tokens": 8263302.0,
"step": 4020
},
{
"entropy": 5.751014280319214,
"epoch": 3.571682201509099,
"grad_norm": 1.2421875,
"learning_rate": 0.00041024325813868065,
"loss": 5.5459,
"mean_token_accuracy": 0.17314320653676987,
"num_tokens": 8274057.0,
"step": 4025
},
{
"entropy": 5.72536072731018,
"epoch": 3.5761207279183314,
"grad_norm": 1.2265625,
"learning_rate": 0.00040996780115584995,
"loss": 5.5958,
"mean_token_accuracy": 0.1759219765663147,
"num_tokens": 8286464.0,
"step": 4030
},
{
"entropy": 5.826333808898926,
"epoch": 3.5805592543275635,
"grad_norm": 1.1015625,
"learning_rate": 0.0004096920278177153,
"loss": 5.5092,
"mean_token_accuracy": 0.18037501573562623,
"num_tokens": 8296892.0,
"step": 4035
},
{
"entropy": 5.790096998214722,
"epoch": 3.5849977807367956,
"grad_norm": 1.171875,
"learning_rate": 0.0004094159387706703,
"loss": 5.5125,
"mean_token_accuracy": 0.18033478856086732,
"num_tokens": 8306657.0,
"step": 4040
},
{
"entropy": 5.824331569671631,
"epoch": 3.589436307146028,
"grad_norm": 1.2109375,
"learning_rate": 0.0004091395346618491,
"loss": 5.6575,
"mean_token_accuracy": 0.16630110293626785,
"num_tokens": 8316827.0,
"step": 4045
},
{
"entropy": 5.805656099319458,
"epoch": 3.5938748335552595,
"grad_norm": 1.2265625,
"learning_rate": 0.00040886281613912396,
"loss": 5.4919,
"mean_token_accuracy": 0.17849037796258926,
"num_tokens": 8328373.0,
"step": 4050
},
{
"entropy": 5.827359437942505,
"epoch": 3.5983133599644916,
"grad_norm": 1.015625,
"learning_rate": 0.0004085857838511042,
"loss": 5.5818,
"mean_token_accuracy": 0.17678980827331542,
"num_tokens": 8341237.0,
"step": 4055
},
{
"entropy": 5.710772895812989,
"epoch": 3.602751886373724,
"grad_norm": 1.0546875,
"learning_rate": 0.00040830843844713447,
"loss": 5.5011,
"mean_token_accuracy": 0.1750195726752281,
"num_tokens": 8352017.0,
"step": 4060
},
{
"entropy": 5.81193175315857,
"epoch": 3.607190412782956,
"grad_norm": 1.1484375,
"learning_rate": 0.00040803078057729354,
"loss": 5.5159,
"mean_token_accuracy": 0.17865791022777558,
"num_tokens": 8362928.0,
"step": 4065
},
{
"entropy": 5.748114824295044,
"epoch": 3.611628939192188,
"grad_norm": 1.3359375,
"learning_rate": 0.0004077528108923924,
"loss": 5.5559,
"mean_token_accuracy": 0.17659952044486998,
"num_tokens": 8373381.0,
"step": 4070
},
{
"entropy": 5.803421354293823,
"epoch": 3.6160674656014202,
"grad_norm": 1.1328125,
"learning_rate": 0.0004074745300439732,
"loss": 5.6322,
"mean_token_accuracy": 0.1618813991546631,
"num_tokens": 8384582.0,
"step": 4075
},
{
"entropy": 5.8019660949707035,
"epoch": 3.6205059920106524,
"grad_norm": 1.34375,
"learning_rate": 0.000407195938684307,
"loss": 5.4872,
"mean_token_accuracy": 0.17608115077018738,
"num_tokens": 8394519.0,
"step": 4080
},
{
"entropy": 5.7562150955200195,
"epoch": 3.6249445184198845,
"grad_norm": 1.203125,
"learning_rate": 0.000406917037466393,
"loss": 5.5079,
"mean_token_accuracy": 0.18082676380872725,
"num_tokens": 8405010.0,
"step": 4085
},
{
"entropy": 5.736172008514404,
"epoch": 3.6293830448291167,
"grad_norm": 1.2421875,
"learning_rate": 0.0004066378270439567,
"loss": 5.4797,
"mean_token_accuracy": 0.18313054293394088,
"num_tokens": 8414933.0,
"step": 4090
},
{
"entropy": 5.825035905838012,
"epoch": 3.633821571238349,
"grad_norm": 1.3984375,
"learning_rate": 0.0004063583080714481,
"loss": 5.4873,
"mean_token_accuracy": 0.17869255542755128,
"num_tokens": 8426086.0,
"step": 4095
},
{
"entropy": 5.788977384567261,
"epoch": 3.638260097647581,
"grad_norm": 1.15625,
"learning_rate": 0.00040607848120404063,
"loss": 5.587,
"mean_token_accuracy": 0.16598645299673082,
"num_tokens": 8436157.0,
"step": 4100
},
{
"entropy": 5.757912921905517,
"epoch": 3.642698624056813,
"grad_norm": 1.3359375,
"learning_rate": 0.0004057983470976293,
"loss": 5.5187,
"mean_token_accuracy": 0.17786410450935364,
"num_tokens": 8446602.0,
"step": 4105
},
{
"entropy": 5.770361804962159,
"epoch": 3.6471371504660453,
"grad_norm": 1.2890625,
"learning_rate": 0.00040551790640882954,
"loss": 5.5779,
"mean_token_accuracy": 0.17473774552345275,
"num_tokens": 8457029.0,
"step": 4110
},
{
"entropy": 5.7793317317962645,
"epoch": 3.6515756768752774,
"grad_norm": 1.1953125,
"learning_rate": 0.00040523715979497486,
"loss": 5.5423,
"mean_token_accuracy": 0.1721513971686363,
"num_tokens": 8466965.0,
"step": 4115
},
{
"entropy": 5.807348728179932,
"epoch": 3.6560142032845095,
"grad_norm": 1.2890625,
"learning_rate": 0.0004049561079141163,
"loss": 5.5432,
"mean_token_accuracy": 0.1787703663110733,
"num_tokens": 8477009.0,
"step": 4120
},
{
"entropy": 5.7499840259552,
"epoch": 3.6604527296937417,
"grad_norm": 1.265625,
"learning_rate": 0.0004046747514250202,
"loss": 5.5504,
"mean_token_accuracy": 0.17546208202838898,
"num_tokens": 8487931.0,
"step": 4125
},
{
"entropy": 5.652848815917968,
"epoch": 3.664891256102974,
"grad_norm": 1.171875,
"learning_rate": 0.0004043930909871671,
"loss": 5.4463,
"mean_token_accuracy": 0.1887633755803108,
"num_tokens": 8498347.0,
"step": 4130
},
{
"entropy": 5.742549324035645,
"epoch": 3.669329782512206,
"grad_norm": 1.25,
"learning_rate": 0.00040411112726074954,
"loss": 5.4154,
"mean_token_accuracy": 0.18402329832315445,
"num_tokens": 8508032.0,
"step": 4135
},
{
"entropy": 5.75079312324524,
"epoch": 3.673768308921438,
"grad_norm": 1.375,
"learning_rate": 0.00040382886090667154,
"loss": 5.4874,
"mean_token_accuracy": 0.1806105464696884,
"num_tokens": 8517279.0,
"step": 4140
},
{
"entropy": 5.771097898483276,
"epoch": 3.6782068353306703,
"grad_norm": 1.2109375,
"learning_rate": 0.0004035462925865459,
"loss": 5.5024,
"mean_token_accuracy": 0.17528152018785476,
"num_tokens": 8526978.0,
"step": 4145
},
{
"entropy": 5.67859206199646,
"epoch": 3.6826453617399024,
"grad_norm": 1.21875,
"learning_rate": 0.00040326342296269363,
"loss": 5.4488,
"mean_token_accuracy": 0.18660874664783478,
"num_tokens": 8537203.0,
"step": 4150
},
{
"entropy": 5.743128395080566,
"epoch": 3.6870838881491346,
"grad_norm": 1.234375,
"learning_rate": 0.00040298025269814165,
"loss": 5.4749,
"mean_token_accuracy": 0.17928291708230973,
"num_tokens": 8548761.0,
"step": 4155
},
{
"entropy": 5.839509391784668,
"epoch": 3.6915224145583667,
"grad_norm": 1.1875,
"learning_rate": 0.0004026967824566218,
"loss": 5.5589,
"mean_token_accuracy": 0.16653368175029754,
"num_tokens": 8559428.0,
"step": 4160
},
{
"entropy": 5.729336977005005,
"epoch": 3.695960940967599,
"grad_norm": 1.1875,
"learning_rate": 0.000402413012902569,
"loss": 5.4503,
"mean_token_accuracy": 0.17860912382602692,
"num_tokens": 8570173.0,
"step": 4165
},
{
"entropy": 5.747783279418945,
"epoch": 3.700399467376831,
"grad_norm": 1.046875,
"learning_rate": 0.00040212894470111966,
"loss": 5.5785,
"mean_token_accuracy": 0.17391075789928437,
"num_tokens": 8581673.0,
"step": 4170
},
{
"entropy": 5.77725305557251,
"epoch": 3.704837993786063,
"grad_norm": 1.2265625,
"learning_rate": 0.0004018445785181102,
"loss": 5.4539,
"mean_token_accuracy": 0.18218168914318084,
"num_tokens": 8591375.0,
"step": 4175
},
{
"entropy": 5.710399770736695,
"epoch": 3.7092765201952953,
"grad_norm": 1.3671875,
"learning_rate": 0.0004015599150200755,
"loss": 5.5329,
"mean_token_accuracy": 0.1777075231075287,
"num_tokens": 8601940.0,
"step": 4180
},
{
"entropy": 5.707136774063111,
"epoch": 3.7137150466045274,
"grad_norm": 1.296875,
"learning_rate": 0.00040127495487424735,
"loss": 5.4598,
"mean_token_accuracy": 0.18140023648738862,
"num_tokens": 8612346.0,
"step": 4185
},
{
"entropy": 5.744045686721802,
"epoch": 3.7181535730137596,
"grad_norm": 1.2265625,
"learning_rate": 0.0004009896987485531,
"loss": 5.5638,
"mean_token_accuracy": 0.17714692652225494,
"num_tokens": 8622994.0,
"step": 4190
},
{
"entropy": 5.775576734542847,
"epoch": 3.7225920994229913,
"grad_norm": 1.265625,
"learning_rate": 0.00040070414731161326,
"loss": 5.5267,
"mean_token_accuracy": 0.1812612682580948,
"num_tokens": 8633684.0,
"step": 4195
},
{
"entropy": 5.662596607208252,
"epoch": 3.7270306258322234,
"grad_norm": 1.2734375,
"learning_rate": 0.00040041830123274105,
"loss": 5.4511,
"mean_token_accuracy": 0.18718448132276536,
"num_tokens": 8642799.0,
"step": 4200
},
{
"entropy": 5.827040672302246,
"epoch": 3.7314691522414556,
"grad_norm": 1.234375,
"learning_rate": 0.0004001321611819401,
"loss": 5.5311,
"mean_token_accuracy": 0.18084388226270676,
"num_tokens": 8652611.0,
"step": 4205
},
{
"entropy": 5.714217329025269,
"epoch": 3.7359076786506877,
"grad_norm": 1.234375,
"learning_rate": 0.0003998457278299033,
"loss": 5.5617,
"mean_token_accuracy": 0.17636579573154448,
"num_tokens": 8662819.0,
"step": 4210
},
{
"entropy": 5.70295467376709,
"epoch": 3.74034620505992,
"grad_norm": 1.21875,
"learning_rate": 0.0003995590018480107,
"loss": 5.4903,
"mean_token_accuracy": 0.18014921694993974,
"num_tokens": 8673276.0,
"step": 4215
},
{
"entropy": 5.848191595077514,
"epoch": 3.744784731469152,
"grad_norm": 1.2109375,
"learning_rate": 0.00039927198390832843,
"loss": 5.6112,
"mean_token_accuracy": 0.1720762312412262,
"num_tokens": 8684106.0,
"step": 4220
},
{
"entropy": 5.776020240783692,
"epoch": 3.749223257878384,
"grad_norm": 1.25,
"learning_rate": 0.000398984674683607,
"loss": 5.4998,
"mean_token_accuracy": 0.1755255162715912,
"num_tokens": 8694533.0,
"step": 4225
},
{
"entropy": 5.738758993148804,
"epoch": 3.7536617842876163,
"grad_norm": 1.2109375,
"learning_rate": 0.0003986970748472795,
"loss": 5.5222,
"mean_token_accuracy": 0.17897798866033554,
"num_tokens": 8704241.0,
"step": 4230
},
{
"entropy": 5.78121862411499,
"epoch": 3.7581003106968485,
"grad_norm": 1.234375,
"learning_rate": 0.0003984091850734604,
"loss": 5.5512,
"mean_token_accuracy": 0.16789624243974685,
"num_tokens": 8714364.0,
"step": 4235
},
{
"entropy": 5.697751045227051,
"epoch": 3.7625388371060806,
"grad_norm": 1.15625,
"learning_rate": 0.0003981210060369435,
"loss": 5.5404,
"mean_token_accuracy": 0.1779459834098816,
"num_tokens": 8724443.0,
"step": 4240
},
{
"entropy": 5.702847146987915,
"epoch": 3.7669773635153128,
"grad_norm": 1.1796875,
"learning_rate": 0.000397832538413201,
"loss": 5.4592,
"mean_token_accuracy": 0.1797871246933937,
"num_tokens": 8733880.0,
"step": 4245
},
{
"entropy": 5.8351147174835205,
"epoch": 3.771415889924545,
"grad_norm": 1.40625,
"learning_rate": 0.0003975437828783811,
"loss": 5.524,
"mean_token_accuracy": 0.1804560035467148,
"num_tokens": 8744437.0,
"step": 4250
},
{
"entropy": 5.753838205337525,
"epoch": 3.775854416333777,
"grad_norm": 1.28125,
"learning_rate": 0.00039725474010930716,
"loss": 5.5152,
"mean_token_accuracy": 0.1822276994585991,
"num_tokens": 8756107.0,
"step": 4255
},
{
"entropy": 5.7022788524627686,
"epoch": 3.780292942743009,
"grad_norm": 1.28125,
"learning_rate": 0.0003969654107834756,
"loss": 5.5006,
"mean_token_accuracy": 0.17494045644998552,
"num_tokens": 8766490.0,
"step": 4260
},
{
"entropy": 5.785413694381714,
"epoch": 3.7847314691522413,
"grad_norm": 1.2265625,
"learning_rate": 0.0003966757955790547,
"loss": 5.4772,
"mean_token_accuracy": 0.18133565336465834,
"num_tokens": 8776401.0,
"step": 4265
},
{
"entropy": 5.750336790084839,
"epoch": 3.7891699955614735,
"grad_norm": 1.515625,
"learning_rate": 0.0003963858951748826,
"loss": 5.5201,
"mean_token_accuracy": 0.1766982913017273,
"num_tokens": 8786816.0,
"step": 4270
},
{
"entropy": 5.6869926929473875,
"epoch": 3.7936085219707056,
"grad_norm": 1.2421875,
"learning_rate": 0.0003960957102504661,
"loss": 5.4366,
"mean_token_accuracy": 0.18434616476297377,
"num_tokens": 8796692.0,
"step": 4275
},
{
"entropy": 5.746105194091797,
"epoch": 3.798047048379938,
"grad_norm": 1.2421875,
"learning_rate": 0.0003958052414859788,
"loss": 5.5203,
"mean_token_accuracy": 0.17907101064920425,
"num_tokens": 8807118.0,
"step": 4280
},
{
"entropy": 5.681885862350464,
"epoch": 3.80248557478917,
"grad_norm": 1.078125,
"learning_rate": 0.0003955144895622597,
"loss": 5.4925,
"mean_token_accuracy": 0.1807284712791443,
"num_tokens": 8817914.0,
"step": 4285
},
{
"entropy": 5.751665019989014,
"epoch": 3.806924101198402,
"grad_norm": 1.1796875,
"learning_rate": 0.0003952234551608114,
"loss": 5.5089,
"mean_token_accuracy": 0.17762693464756013,
"num_tokens": 8828236.0,
"step": 4290
},
{
"entropy": 5.7408606052398685,
"epoch": 3.8113626276076342,
"grad_norm": 1.1953125,
"learning_rate": 0.0003949321389637986,
"loss": 5.4302,
"mean_token_accuracy": 0.18315188437700272,
"num_tokens": 8838911.0,
"step": 4295
},
{
"entropy": 5.7521624088287355,
"epoch": 3.8158011540168664,
"grad_norm": 1.2265625,
"learning_rate": 0.0003946405416540466,
"loss": 5.4319,
"mean_token_accuracy": 0.1811888560652733,
"num_tokens": 8849116.0,
"step": 4300
},
{
"entropy": 5.720421886444091,
"epoch": 3.8202396804260985,
"grad_norm": 1.09375,
"learning_rate": 0.00039434866391503963,
"loss": 5.4994,
"mean_token_accuracy": 0.17618632167577744,
"num_tokens": 8860279.0,
"step": 4305
},
{
"entropy": 5.7000336170196535,
"epoch": 3.8246782068353307,
"grad_norm": 1.28125,
"learning_rate": 0.00039405650643091917,
"loss": 5.5333,
"mean_token_accuracy": 0.18363996148109435,
"num_tokens": 8869910.0,
"step": 4310
},
{
"entropy": 5.730699825286865,
"epoch": 3.829116733244563,
"grad_norm": 1.234375,
"learning_rate": 0.0003937640698864823,
"loss": 5.5585,
"mean_token_accuracy": 0.1803690657019615,
"num_tokens": 8880781.0,
"step": 4315
},
{
"entropy": 5.7924156665802,
"epoch": 3.833555259653795,
"grad_norm": 1.1328125,
"learning_rate": 0.00039347135496718027,
"loss": 5.5631,
"mean_token_accuracy": 0.16978129595518113,
"num_tokens": 8891812.0,
"step": 4320
},
{
"entropy": 5.719081401824951,
"epoch": 3.837993786063027,
"grad_norm": 1.2265625,
"learning_rate": 0.00039317836235911705,
"loss": 5.4632,
"mean_token_accuracy": 0.17845752388238906,
"num_tokens": 8902112.0,
"step": 4325
},
{
"entropy": 5.681349039077759,
"epoch": 3.8424323124722592,
"grad_norm": 1.2421875,
"learning_rate": 0.0003928850927490472,
"loss": 5.4173,
"mean_token_accuracy": 0.18779767602682113,
"num_tokens": 8912009.0,
"step": 4330
},
{
"entropy": 5.729856777191162,
"epoch": 3.8468708388814914,
"grad_norm": 1.390625,
"learning_rate": 0.0003925915468243746,
"loss": 5.4864,
"mean_token_accuracy": 0.18054269552230834,
"num_tokens": 8921986.0,
"step": 4335
},
{
"entropy": 5.698644685745239,
"epoch": 3.8513093652907235,
"grad_norm": 1.1953125,
"learning_rate": 0.00039229772527315073,
"loss": 5.5588,
"mean_token_accuracy": 0.1698625460267067,
"num_tokens": 8932103.0,
"step": 4340
},
{
"entropy": 5.785820150375367,
"epoch": 3.8557478916999557,
"grad_norm": 1.296875,
"learning_rate": 0.0003920036287840734,
"loss": 5.5093,
"mean_token_accuracy": 0.18339616656303406,
"num_tokens": 8942587.0,
"step": 4345
},
{
"entropy": 5.716684341430664,
"epoch": 3.860186418109188,
"grad_norm": 1.125,
"learning_rate": 0.00039170925804648486,
"loss": 5.4901,
"mean_token_accuracy": 0.18353802263736724,
"num_tokens": 8954882.0,
"step": 4350
},
{
"entropy": 5.640814590454101,
"epoch": 3.86462494451842,
"grad_norm": 1.125,
"learning_rate": 0.00039141461375036957,
"loss": 5.4216,
"mean_token_accuracy": 0.1882522866129875,
"num_tokens": 8965400.0,
"step": 4355
},
{
"entropy": 5.732454633712768,
"epoch": 3.869063470927652,
"grad_norm": 1.234375,
"learning_rate": 0.0003911196965863539,
"loss": 5.4433,
"mean_token_accuracy": 0.17967188507318496,
"num_tokens": 8975425.0,
"step": 4360
},
{
"entropy": 5.708558893203735,
"epoch": 3.8735019973368843,
"grad_norm": 1.2421875,
"learning_rate": 0.00039082450724570357,
"loss": 5.5334,
"mean_token_accuracy": 0.17930300831794738,
"num_tokens": 8986111.0,
"step": 4365
},
{
"entropy": 5.737200307846069,
"epoch": 3.8779405237461164,
"grad_norm": 1.1015625,
"learning_rate": 0.0003905290464203221,
"loss": 5.5118,
"mean_token_accuracy": 0.17625806480646133,
"num_tokens": 8996503.0,
"step": 4370
},
{
"entropy": 5.806273937225342,
"epoch": 3.8823790501553486,
"grad_norm": 1.0390625,
"learning_rate": 0.0003902333148027495,
"loss": 5.5558,
"mean_token_accuracy": 0.17663292586803436,
"num_tokens": 9008370.0,
"step": 4375
},
{
"entropy": 5.737713384628296,
"epoch": 3.8868175765645807,
"grad_norm": 1.234375,
"learning_rate": 0.0003899373130861605,
"loss": 5.5651,
"mean_token_accuracy": 0.17326079905033112,
"num_tokens": 9020077.0,
"step": 4380
},
{
"entropy": 5.8152988910675045,
"epoch": 3.891256102973813,
"grad_norm": 1.3359375,
"learning_rate": 0.00038964104196436284,
"loss": 5.5894,
"mean_token_accuracy": 0.17162887006998062,
"num_tokens": 9030627.0,
"step": 4385
},
{
"entropy": 5.762547349929809,
"epoch": 3.895694629383045,
"grad_norm": 1.203125,
"learning_rate": 0.00038934450213179596,
"loss": 5.4845,
"mean_token_accuracy": 0.18070337772369385,
"num_tokens": 9041138.0,
"step": 4390
},
{
"entropy": 5.631207036972046,
"epoch": 3.900133155792277,
"grad_norm": 1.1953125,
"learning_rate": 0.00038904769428352873,
"loss": 5.4612,
"mean_token_accuracy": 0.18537994474172592,
"num_tokens": 9050830.0,
"step": 4395
},
{
"entropy": 5.788889026641845,
"epoch": 3.9045716822015093,
"grad_norm": 1.28125,
"learning_rate": 0.00038875061911525856,
"loss": 5.5402,
"mean_token_accuracy": 0.17427804619073867,
"num_tokens": 9061113.0,
"step": 4400
},
{
"entropy": 5.746660757064819,
"epoch": 3.9090102086107414,
"grad_norm": 1.21875,
"learning_rate": 0.0003884532773233094,
"loss": 5.5819,
"mean_token_accuracy": 0.17695318460464476,
"num_tokens": 9070655.0,
"step": 4405
},
{
"entropy": 5.663952970504761,
"epoch": 3.9134487350199736,
"grad_norm": 1.2890625,
"learning_rate": 0.00038815566960463015,
"loss": 5.3662,
"mean_token_accuracy": 0.18698422610759735,
"num_tokens": 9079019.0,
"step": 4410
},
{
"entropy": 5.727706336975098,
"epoch": 3.9178872614292057,
"grad_norm": 1.1953125,
"learning_rate": 0.00038785779665679275,
"loss": 5.5219,
"mean_token_accuracy": 0.17985262721776962,
"num_tokens": 9089545.0,
"step": 4415
},
{
"entropy": 5.709404706954956,
"epoch": 3.922325787838438,
"grad_norm": 1.21875,
"learning_rate": 0.0003875596591779913,
"loss": 5.4711,
"mean_token_accuracy": 0.17852504402399064,
"num_tokens": 9099539.0,
"step": 4420
},
{
"entropy": 5.659719467163086,
"epoch": 3.92676431424767,
"grad_norm": 1.4296875,
"learning_rate": 0.0003872612578670395,
"loss": 5.432,
"mean_token_accuracy": 0.18161263316869736,
"num_tokens": 9110721.0,
"step": 4425
},
{
"entropy": 5.731282758712768,
"epoch": 3.931202840656902,
"grad_norm": 1.2734375,
"learning_rate": 0.00038696259342336966,
"loss": 5.4644,
"mean_token_accuracy": 0.17836183905601502,
"num_tokens": 9121014.0,
"step": 4430
},
{
"entropy": 5.750094223022461,
"epoch": 3.935641367066134,
"grad_norm": 1.2109375,
"learning_rate": 0.00038666366654703077,
"loss": 5.5449,
"mean_token_accuracy": 0.17551416903734207,
"num_tokens": 9131085.0,
"step": 4435
},
{
"entropy": 5.752908182144165,
"epoch": 3.940079893475366,
"grad_norm": 1.15625,
"learning_rate": 0.00038636447793868715,
"loss": 5.4715,
"mean_token_accuracy": 0.18193041980266572,
"num_tokens": 9140844.0,
"step": 4440
},
{
"entropy": 5.7174254894256595,
"epoch": 3.944518419884598,
"grad_norm": 1.2734375,
"learning_rate": 0.00038606502829961645,
"loss": 5.5679,
"mean_token_accuracy": 0.17696069329977035,
"num_tokens": 9151185.0,
"step": 4445
},
{
"entropy": 5.754332447052002,
"epoch": 3.9489569462938303,
"grad_norm": 1.203125,
"learning_rate": 0.0003857653183317081,
"loss": 5.4548,
"mean_token_accuracy": 0.1789930745959282,
"num_tokens": 9162031.0,
"step": 4450
},
{
"entropy": 5.769329786300659,
"epoch": 3.9533954727030625,
"grad_norm": 1.2890625,
"learning_rate": 0.0003854653487374617,
"loss": 5.5161,
"mean_token_accuracy": 0.17834289520978927,
"num_tokens": 9172896.0,
"step": 4455
},
{
"entropy": 5.715093040466309,
"epoch": 3.9578339991122946,
"grad_norm": 1.2734375,
"learning_rate": 0.0003851651202199856,
"loss": 5.4465,
"mean_token_accuracy": 0.1802556499838829,
"num_tokens": 9182364.0,
"step": 4460
},
{
"entropy": 5.703181409835816,
"epoch": 3.9622725255215268,
"grad_norm": 1.1015625,
"learning_rate": 0.0003848646334829949,
"loss": 5.4415,
"mean_token_accuracy": 0.1801273450255394,
"num_tokens": 9192740.0,
"step": 4465
},
{
"entropy": 5.674679946899414,
"epoch": 3.966711051930759,
"grad_norm": 1.1953125,
"learning_rate": 0.00038456388923081006,
"loss": 5.5164,
"mean_token_accuracy": 0.18230873495340347,
"num_tokens": 9202638.0,
"step": 4470
},
{
"entropy": 5.741348552703857,
"epoch": 3.971149578339991,
"grad_norm": 1.21875,
"learning_rate": 0.00038426288816835485,
"loss": 5.4495,
"mean_token_accuracy": 0.17755311280488967,
"num_tokens": 9212282.0,
"step": 4475
},
{
"entropy": 5.726871204376221,
"epoch": 3.975588104749223,
"grad_norm": 1.15625,
"learning_rate": 0.0003839616310011554,
"loss": 5.5127,
"mean_token_accuracy": 0.17680146396160126,
"num_tokens": 9222352.0,
"step": 4480
},
{
"entropy": 5.784638833999634,
"epoch": 3.9800266311584553,
"grad_norm": 1.375,
"learning_rate": 0.0003836601184353379,
"loss": 5.5881,
"mean_token_accuracy": 0.17251629903912544,
"num_tokens": 9233801.0,
"step": 4485
},
{
"entropy": 5.749805593490601,
"epoch": 3.9844651575676875,
"grad_norm": 1.1796875,
"learning_rate": 0.00038335835117762706,
"loss": 5.5791,
"mean_token_accuracy": 0.17449699193239213,
"num_tokens": 9244265.0,
"step": 4490
},
{
"entropy": 5.760185623168946,
"epoch": 3.9889036839769196,
"grad_norm": 1.3515625,
"learning_rate": 0.00038305632993534483,
"loss": 5.4196,
"mean_token_accuracy": 0.18088131695985793,
"num_tokens": 9254071.0,
"step": 4495
},
{
"entropy": 5.707600259780884,
"epoch": 3.993342210386152,
"grad_norm": 1.3203125,
"learning_rate": 0.00038275405541640835,
"loss": 5.4296,
"mean_token_accuracy": 0.19716665893793106,
"num_tokens": 9264144.0,
"step": 4500
},
{
"epoch": 3.993342210386152,
"eval_entropy": 5.5763132815689485,
"eval_loss": 5.997529983520508,
"eval_mean_token_accuracy": 0.16018386616984343,
"eval_num_tokens": 9264144.0,
"eval_runtime": 2.7056,
"eval_samples_per_second": 1244.433,
"eval_steps_per_second": 155.6,
"step": 4500
},
{
"entropy": 5.701356315612793,
"epoch": 3.997780736795384,
"grad_norm": 1.3359375,
"learning_rate": 0.00038245152832932843,
"loss": 5.5425,
"mean_token_accuracy": 0.1744165375828743,
"num_tokens": 9274514.0,
"step": 4505
},
{
"entropy": 5.850748009151882,
"epoch": 4.001775410563693,
"grad_norm": 1.1640625,
"learning_rate": 0.00038214874938320795,
"loss": 5.5387,
"mean_token_accuracy": 0.17106109195285374,
"num_tokens": 9283806.0,
"step": 4510
},
{
"entropy": 5.729006147384643,
"epoch": 4.006213936972925,
"grad_norm": 1.09375,
"learning_rate": 0.0003818457192877399,
"loss": 5.2642,
"mean_token_accuracy": 0.18925500512123108,
"num_tokens": 9293878.0,
"step": 4515
},
{
"entropy": 5.720128965377808,
"epoch": 4.010652463382157,
"grad_norm": 1.2890625,
"learning_rate": 0.0003815424387532063,
"loss": 5.3185,
"mean_token_accuracy": 0.18909395337104798,
"num_tokens": 9304527.0,
"step": 4520
},
{
"entropy": 5.720921659469605,
"epoch": 4.015090989791389,
"grad_norm": 1.1484375,
"learning_rate": 0.000381238908490476,
"loss": 5.237,
"mean_token_accuracy": 0.18835289925336837,
"num_tokens": 9314726.0,
"step": 4525
},
{
"entropy": 5.692098760604859,
"epoch": 4.019529516200621,
"grad_norm": 1.375,
"learning_rate": 0.00038093512921100306,
"loss": 5.1707,
"mean_token_accuracy": 0.19642118662595748,
"num_tokens": 9324715.0,
"step": 4530
},
{
"entropy": 5.629355716705322,
"epoch": 4.023968042609853,
"grad_norm": 1.265625,
"learning_rate": 0.0003806311016268254,
"loss": 5.1799,
"mean_token_accuracy": 0.19247162342071533,
"num_tokens": 9335237.0,
"step": 4535
},
{
"entropy": 5.7696263790130615,
"epoch": 4.028406569019086,
"grad_norm": 1.1875,
"learning_rate": 0.000380326826450563,
"loss": 5.1995,
"mean_token_accuracy": 0.1953647792339325,
"num_tokens": 9346380.0,
"step": 4540
},
{
"entropy": 5.63343915939331,
"epoch": 4.032845095428318,
"grad_norm": 1.265625,
"learning_rate": 0.00038002230439541603,
"loss": 5.2162,
"mean_token_accuracy": 0.19140224754810334,
"num_tokens": 9357002.0,
"step": 4545
},
{
"entropy": 5.699198818206787,
"epoch": 4.03728362183755,
"grad_norm": 1.1953125,
"learning_rate": 0.00037971753617516336,
"loss": 5.2713,
"mean_token_accuracy": 0.1927043616771698,
"num_tokens": 9367095.0,
"step": 4550
},
{
"entropy": 5.744393634796142,
"epoch": 4.041722148246782,
"grad_norm": 1.2421875,
"learning_rate": 0.00037941252250416074,
"loss": 5.2923,
"mean_token_accuracy": 0.19106441736221313,
"num_tokens": 9376557.0,
"step": 4555
},
{
"entropy": 5.664052677154541,
"epoch": 4.046160674656014,
"grad_norm": 1.2578125,
"learning_rate": 0.00037910726409733965,
"loss": 5.297,
"mean_token_accuracy": 0.18930719494819642,
"num_tokens": 9387355.0,
"step": 4560
},
{
"entropy": 5.69176549911499,
"epoch": 4.050599201065246,
"grad_norm": 1.203125,
"learning_rate": 0.0003788017616702048,
"loss": 5.31,
"mean_token_accuracy": 0.1926235094666481,
"num_tokens": 9398472.0,
"step": 4565
},
{
"entropy": 5.7388163089752195,
"epoch": 4.055037727474478,
"grad_norm": 1.3046875,
"learning_rate": 0.00037849601593883297,
"loss": 5.2272,
"mean_token_accuracy": 0.19727225750684738,
"num_tokens": 9408229.0,
"step": 4570
},
{
"entropy": 5.5694373607635494,
"epoch": 4.059476253883711,
"grad_norm": 1.3125,
"learning_rate": 0.00037819002761987127,
"loss": 5.237,
"mean_token_accuracy": 0.19977665394544603,
"num_tokens": 9418732.0,
"step": 4575
},
{
"entropy": 5.78159465789795,
"epoch": 4.063914780292943,
"grad_norm": 1.1015625,
"learning_rate": 0.0003778837974305355,
"loss": 5.3161,
"mean_token_accuracy": 0.17896658927202225,
"num_tokens": 9429390.0,
"step": 4580
},
{
"entropy": 5.748556661605835,
"epoch": 4.068353306702175,
"grad_norm": 1.1953125,
"learning_rate": 0.00037757732608860824,
"loss": 5.2833,
"mean_token_accuracy": 0.18809683322906495,
"num_tokens": 9440634.0,
"step": 4585
},
{
"entropy": 5.628183794021607,
"epoch": 4.072791833111407,
"grad_norm": 1.4375,
"learning_rate": 0.00037727061431243737,
"loss": 5.3021,
"mean_token_accuracy": 0.18863182365894318,
"num_tokens": 9451523.0,
"step": 4590
},
{
"entropy": 5.795997381210327,
"epoch": 4.077230359520639,
"grad_norm": 1.4375,
"learning_rate": 0.00037696366282093433,
"loss": 5.2465,
"mean_token_accuracy": 0.18781881034374237,
"num_tokens": 9460637.0,
"step": 4595
},
{
"entropy": 5.725009632110596,
"epoch": 4.081668885929871,
"grad_norm": 1.171875,
"learning_rate": 0.00037665647233357243,
"loss": 5.2701,
"mean_token_accuracy": 0.18813904821872712,
"num_tokens": 9472274.0,
"step": 4600
},
{
"entropy": 5.649727058410645,
"epoch": 4.0861074123391035,
"grad_norm": 1.359375,
"learning_rate": 0.0003763490435703853,
"loss": 5.286,
"mean_token_accuracy": 0.1922745645046234,
"num_tokens": 9481508.0,
"step": 4605
},
{
"entropy": 5.73937463760376,
"epoch": 4.090545938748336,
"grad_norm": 1.2109375,
"learning_rate": 0.0003760413772519648,
"loss": 5.2717,
"mean_token_accuracy": 0.18653745353221893,
"num_tokens": 9491111.0,
"step": 4610
},
{
"entropy": 5.665762710571289,
"epoch": 4.094984465157568,
"grad_norm": 1.2734375,
"learning_rate": 0.00037573347409945983,
"loss": 5.2281,
"mean_token_accuracy": 0.19926678538322448,
"num_tokens": 9501499.0,
"step": 4615
},
{
"entropy": 5.729472923278808,
"epoch": 4.0994229915668,
"grad_norm": 1.2734375,
"learning_rate": 0.0003754253348345743,
"loss": 5.3109,
"mean_token_accuracy": 0.18431389182806016,
"num_tokens": 9512770.0,
"step": 4620
},
{
"entropy": 5.63422040939331,
"epoch": 4.103861517976032,
"grad_norm": 1.234375,
"learning_rate": 0.0003751169601795657,
"loss": 5.2295,
"mean_token_accuracy": 0.19330070316791534,
"num_tokens": 9522663.0,
"step": 4625
},
{
"entropy": 5.720160961151123,
"epoch": 4.108300044385264,
"grad_norm": 1.171875,
"learning_rate": 0.00037480835085724313,
"loss": 5.2717,
"mean_token_accuracy": 0.1893833637237549,
"num_tokens": 9532652.0,
"step": 4630
},
{
"entropy": 5.611191701889038,
"epoch": 4.112738570794496,
"grad_norm": 1.171875,
"learning_rate": 0.0003744995075909656,
"loss": 5.2573,
"mean_token_accuracy": 0.19513216018676757,
"num_tokens": 9542632.0,
"step": 4635
},
{
"entropy": 5.735529994964599,
"epoch": 4.1171770972037285,
"grad_norm": 1.171875,
"learning_rate": 0.0003741904311046408,
"loss": 5.2186,
"mean_token_accuracy": 0.19701965749263764,
"num_tokens": 9552182.0,
"step": 4640
},
{
"entropy": 5.659197998046875,
"epoch": 4.121615623612961,
"grad_norm": 1.1953125,
"learning_rate": 0.0003738811221227228,
"loss": 5.2847,
"mean_token_accuracy": 0.19813647866249084,
"num_tokens": 9562570.0,
"step": 4645
},
{
"entropy": 5.602932691574097,
"epoch": 4.126054150022193,
"grad_norm": 1.203125,
"learning_rate": 0.00037357158137021077,
"loss": 5.2181,
"mean_token_accuracy": 0.1899891808629036,
"num_tokens": 9572928.0,
"step": 4650
},
{
"entropy": 5.699469041824341,
"epoch": 4.130492676431425,
"grad_norm": 1.234375,
"learning_rate": 0.000373261809572647,
"loss": 5.1659,
"mean_token_accuracy": 0.20609040707349777,
"num_tokens": 9583387.0,
"step": 4655
},
{
"entropy": 5.673456764221191,
"epoch": 4.134931202840657,
"grad_norm": 1.171875,
"learning_rate": 0.00037295180745611553,
"loss": 5.2844,
"mean_token_accuracy": 0.18709968775510788,
"num_tokens": 9592876.0,
"step": 4660
},
{
"entropy": 5.634208106994629,
"epoch": 4.139369729249889,
"grad_norm": 1.2578125,
"learning_rate": 0.0003726415757472401,
"loss": 5.2281,
"mean_token_accuracy": 0.1973868727684021,
"num_tokens": 9603818.0,
"step": 4665
},
{
"entropy": 5.697757434844971,
"epoch": 4.143808255659121,
"grad_norm": 1.2109375,
"learning_rate": 0.00037233111517318257,
"loss": 5.2405,
"mean_token_accuracy": 0.19370168149471284,
"num_tokens": 9613726.0,
"step": 4670
},
{
"entropy": 5.638398885726929,
"epoch": 4.1482467820683535,
"grad_norm": 1.328125,
"learning_rate": 0.0003720204264616414,
"loss": 5.2381,
"mean_token_accuracy": 0.19537219703197478,
"num_tokens": 9624566.0,
"step": 4675
},
{
"entropy": 5.605507707595825,
"epoch": 4.152685308477586,
"grad_norm": 1.2578125,
"learning_rate": 0.0003717095103408497,
"loss": 5.2355,
"mean_token_accuracy": 0.19357358068227767,
"num_tokens": 9634558.0,
"step": 4680
},
{
"entropy": 5.650458574295044,
"epoch": 4.157123834886818,
"grad_norm": 1.3203125,
"learning_rate": 0.00037139836753957353,
"loss": 5.315,
"mean_token_accuracy": 0.18568638265132903,
"num_tokens": 9644937.0,
"step": 4685
},
{
"entropy": 5.73355770111084,
"epoch": 4.16156236129605,
"grad_norm": 1.265625,
"learning_rate": 0.00037108699878711044,
"loss": 5.3145,
"mean_token_accuracy": 0.18074976205825805,
"num_tokens": 9654407.0,
"step": 4690
},
{
"entropy": 5.638219738006592,
"epoch": 4.166000887705282,
"grad_norm": 1.265625,
"learning_rate": 0.00037077540481328744,
"loss": 5.1966,
"mean_token_accuracy": 0.19675681591033936,
"num_tokens": 9664116.0,
"step": 4695
},
{
"entropy": 5.643871116638183,
"epoch": 4.170439414114514,
"grad_norm": 1.1484375,
"learning_rate": 0.0003704635863484596,
"loss": 5.1979,
"mean_token_accuracy": 0.19657710641622544,
"num_tokens": 9674710.0,
"step": 4700
},
{
"entropy": 5.739799880981446,
"epoch": 4.174877940523746,
"grad_norm": 1.09375,
"learning_rate": 0.00037015154412350806,
"loss": 5.3521,
"mean_token_accuracy": 0.1823303997516632,
"num_tokens": 9685321.0,
"step": 4705
},
{
"entropy": 5.62279691696167,
"epoch": 4.1793164669329785,
"grad_norm": 1.34375,
"learning_rate": 0.00036983927886983847,
"loss": 5.2145,
"mean_token_accuracy": 0.19245072156190873,
"num_tokens": 9694390.0,
"step": 4710
},
{
"entropy": 5.585807514190674,
"epoch": 4.183754993342211,
"grad_norm": 1.3359375,
"learning_rate": 0.00036952679131937923,
"loss": 5.1868,
"mean_token_accuracy": 0.19732326567173003,
"num_tokens": 9703999.0,
"step": 4715
},
{
"entropy": 5.686507225036621,
"epoch": 4.188193519751443,
"grad_norm": 1.21875,
"learning_rate": 0.0003692140822045798,
"loss": 5.257,
"mean_token_accuracy": 0.19399092495441436,
"num_tokens": 9714853.0,
"step": 4720
},
{
"entropy": 5.697870445251465,
"epoch": 4.192632046160675,
"grad_norm": 1.140625,
"learning_rate": 0.00036890115225840904,
"loss": 5.3467,
"mean_token_accuracy": 0.1930564671754837,
"num_tokens": 9726006.0,
"step": 4725
},
{
"entropy": 5.677460718154907,
"epoch": 4.197070572569907,
"grad_norm": 1.1015625,
"learning_rate": 0.0003685880022143533,
"loss": 5.2474,
"mean_token_accuracy": 0.19850908517837523,
"num_tokens": 9735918.0,
"step": 4730
},
{
"entropy": 5.694363260269165,
"epoch": 4.201509098979139,
"grad_norm": 1.1796875,
"learning_rate": 0.00036827463280641494,
"loss": 5.2696,
"mean_token_accuracy": 0.19284430593252183,
"num_tokens": 9746207.0,
"step": 4735
},
{
"entropy": 5.636784505844116,
"epoch": 4.205947625388371,
"grad_norm": 1.328125,
"learning_rate": 0.00036796104476911033,
"loss": 5.2579,
"mean_token_accuracy": 0.19579048752784728,
"num_tokens": 9757076.0,
"step": 4740
},
{
"entropy": 5.693604230880737,
"epoch": 4.210386151797604,
"grad_norm": 1.203125,
"learning_rate": 0.00036764723883746865,
"loss": 5.2048,
"mean_token_accuracy": 0.20219410210847855,
"num_tokens": 9767776.0,
"step": 4745
},
{
"entropy": 5.739891386032104,
"epoch": 4.214824678206836,
"grad_norm": 1.3046875,
"learning_rate": 0.0003673332157470293,
"loss": 5.2705,
"mean_token_accuracy": 0.1894511416554451,
"num_tokens": 9778316.0,
"step": 4750
},
{
"entropy": 5.589966917037964,
"epoch": 4.219263204616068,
"grad_norm": 1.25,
"learning_rate": 0.000367018976233841,
"loss": 5.154,
"mean_token_accuracy": 0.20144910216331482,
"num_tokens": 9788735.0,
"step": 4755
},
{
"entropy": 5.646427965164184,
"epoch": 4.2237017310253,
"grad_norm": 1.4140625,
"learning_rate": 0.0003667045210344598,
"loss": 5.2837,
"mean_token_accuracy": 0.1887564703822136,
"num_tokens": 9799020.0,
"step": 4760
},
{
"entropy": 5.6686927318573,
"epoch": 4.228140257434532,
"grad_norm": 1.2265625,
"learning_rate": 0.0003663898508859471,
"loss": 5.2098,
"mean_token_accuracy": 0.1981448546051979,
"num_tokens": 9810421.0,
"step": 4765
},
{
"entropy": 5.637562465667725,
"epoch": 4.232578783843764,
"grad_norm": 1.203125,
"learning_rate": 0.0003660749665258684,
"loss": 5.2807,
"mean_token_accuracy": 0.18643705397844315,
"num_tokens": 9820816.0,
"step": 4770
},
{
"entropy": 5.656064462661743,
"epoch": 4.237017310252996,
"grad_norm": 1.28125,
"learning_rate": 0.0003657598686922909,
"loss": 5.1875,
"mean_token_accuracy": 0.20534438788890838,
"num_tokens": 9830827.0,
"step": 4775
},
{
"entropy": 5.667426013946534,
"epoch": 4.241455836662228,
"grad_norm": 1.34375,
"learning_rate": 0.0003654445581237824,
"loss": 5.242,
"mean_token_accuracy": 0.18796127587556838,
"num_tokens": 9840928.0,
"step": 4780
},
{
"entropy": 5.566523122787475,
"epoch": 4.245894363071461,
"grad_norm": 1.28125,
"learning_rate": 0.0003651290355594096,
"loss": 5.1411,
"mean_token_accuracy": 0.20217157006263733,
"num_tokens": 9851042.0,
"step": 4785
},
{
"entropy": 5.705053472518921,
"epoch": 4.250332889480692,
"grad_norm": 1.1875,
"learning_rate": 0.0003648133017387356,
"loss": 5.3601,
"mean_token_accuracy": 0.18476287126541138,
"num_tokens": 9862598.0,
"step": 4790
},
{
"entropy": 5.754878854751587,
"epoch": 4.254771415889924,
"grad_norm": 1.2265625,
"learning_rate": 0.00036449735740181884,
"loss": 5.2864,
"mean_token_accuracy": 0.18946309983730317,
"num_tokens": 9872537.0,
"step": 4795
},
{
"entropy": 5.604499864578247,
"epoch": 4.259209942299156,
"grad_norm": 1.328125,
"learning_rate": 0.00036418120328921146,
"loss": 5.2632,
"mean_token_accuracy": 0.190321084856987,
"num_tokens": 9883091.0,
"step": 4800
},
{
"entropy": 5.649293565750122,
"epoch": 4.263648468708388,
"grad_norm": 1.3984375,
"learning_rate": 0.00036386484014195696,
"loss": 5.2218,
"mean_token_accuracy": 0.19319310337305068,
"num_tokens": 9892580.0,
"step": 4805
},
{
"entropy": 5.754296684265137,
"epoch": 4.268086995117621,
"grad_norm": 1.28125,
"learning_rate": 0.0003635482687015891,
"loss": 5.3169,
"mean_token_accuracy": 0.18868042081594466,
"num_tokens": 9902618.0,
"step": 4810
},
{
"entropy": 5.6679424285888675,
"epoch": 4.272525521526853,
"grad_norm": 1.3046875,
"learning_rate": 0.00036323148971012954,
"loss": 5.2416,
"mean_token_accuracy": 0.1906725734472275,
"num_tokens": 9912148.0,
"step": 4815
},
{
"entropy": 5.6508142948150635,
"epoch": 4.276964047936085,
"grad_norm": 1.2421875,
"learning_rate": 0.00036291450391008655,
"loss": 5.3068,
"mean_token_accuracy": 0.18597807735204697,
"num_tokens": 9922843.0,
"step": 4820
},
{
"entropy": 5.685378742218018,
"epoch": 4.281402574345317,
"grad_norm": 1.2109375,
"learning_rate": 0.00036259731204445347,
"loss": 5.2813,
"mean_token_accuracy": 0.1838116839528084,
"num_tokens": 9933503.0,
"step": 4825
},
{
"entropy": 5.6864439964294435,
"epoch": 4.285841100754549,
"grad_norm": 1.3828125,
"learning_rate": 0.0003622799148567061,
"loss": 5.2686,
"mean_token_accuracy": 0.1897219806909561,
"num_tokens": 9943991.0,
"step": 4830
},
{
"entropy": 5.695897388458252,
"epoch": 4.290279627163781,
"grad_norm": 1.484375,
"learning_rate": 0.0003619623130908017,
"loss": 5.244,
"mean_token_accuracy": 0.19663725346326827,
"num_tokens": 9954498.0,
"step": 4835
},
{
"entropy": 5.625618648529053,
"epoch": 4.2947181535730135,
"grad_norm": 1.1953125,
"learning_rate": 0.0003616445074911774,
"loss": 5.3275,
"mean_token_accuracy": 0.18534286618232726,
"num_tokens": 9965206.0,
"step": 4840
},
{
"entropy": 5.635822486877442,
"epoch": 4.299156679982246,
"grad_norm": 1.2578125,
"learning_rate": 0.0003613264988027477,
"loss": 5.2884,
"mean_token_accuracy": 0.19060297310352325,
"num_tokens": 9975214.0,
"step": 4845
},
{
"entropy": 5.659406042098999,
"epoch": 4.303595206391478,
"grad_norm": 1.2265625,
"learning_rate": 0.0003610082877709031,
"loss": 5.286,
"mean_token_accuracy": 0.18736871629953383,
"num_tokens": 9986225.0,
"step": 4850
},
{
"entropy": 5.660641241073608,
"epoch": 4.30803373280071,
"grad_norm": 1.3046875,
"learning_rate": 0.00036068987514150866,
"loss": 5.2555,
"mean_token_accuracy": 0.19821808636188507,
"num_tokens": 9995779.0,
"step": 4855
},
{
"entropy": 5.64681830406189,
"epoch": 4.312472259209942,
"grad_norm": 1.40625,
"learning_rate": 0.00036037126166090167,
"loss": 5.3489,
"mean_token_accuracy": 0.18932785391807555,
"num_tokens": 10007252.0,
"step": 4860
},
{
"entropy": 5.637697410583496,
"epoch": 4.316910785619174,
"grad_norm": 1.2734375,
"learning_rate": 0.0003600524480758906,
"loss": 5.2318,
"mean_token_accuracy": 0.19486922770738602,
"num_tokens": 10017578.0,
"step": 4865
},
{
"entropy": 5.6532087326049805,
"epoch": 4.321349312028406,
"grad_norm": 1.203125,
"learning_rate": 0.00035973343513375254,
"loss": 5.3188,
"mean_token_accuracy": 0.19158722460269928,
"num_tokens": 10027666.0,
"step": 4870
},
{
"entropy": 5.680660104751587,
"epoch": 4.3257878384376385,
"grad_norm": 1.2734375,
"learning_rate": 0.000359414223582232,
"loss": 5.3116,
"mean_token_accuracy": 0.19016897827386856,
"num_tokens": 10037663.0,
"step": 4875
},
{
"entropy": 5.622398471832275,
"epoch": 4.330226364846871,
"grad_norm": 1.3203125,
"learning_rate": 0.0003590948141695392,
"loss": 5.2118,
"mean_token_accuracy": 0.20080626308917998,
"num_tokens": 10046807.0,
"step": 4880
},
{
"entropy": 5.632709121704101,
"epoch": 4.334664891256103,
"grad_norm": 1.3515625,
"learning_rate": 0.0003587752076443479,
"loss": 5.2463,
"mean_token_accuracy": 0.1918161079287529,
"num_tokens": 10056838.0,
"step": 4885
},
{
"entropy": 5.664422035217285,
"epoch": 4.339103417665335,
"grad_norm": 1.4609375,
"learning_rate": 0.0003584554047557939,
"loss": 5.2491,
"mean_token_accuracy": 0.18712048828601838,
"num_tokens": 10067789.0,
"step": 4890
},
{
"entropy": 5.653136253356934,
"epoch": 4.343541944074567,
"grad_norm": 1.2109375,
"learning_rate": 0.00035813540625347334,
"loss": 5.2398,
"mean_token_accuracy": 0.19476775527000428,
"num_tokens": 10077492.0,
"step": 4895
},
{
"entropy": 5.632155656814575,
"epoch": 4.347980470483799,
"grad_norm": 1.203125,
"learning_rate": 0.0003578152128874409,
"loss": 5.2462,
"mean_token_accuracy": 0.19236094504594803,
"num_tokens": 10087609.0,
"step": 4900
},
{
"entropy": 5.652819108963013,
"epoch": 4.352418996893031,
"grad_norm": 1.2734375,
"learning_rate": 0.00035749482540820796,
"loss": 5.3211,
"mean_token_accuracy": 0.1850426435470581,
"num_tokens": 10097566.0,
"step": 4905
},
{
"entropy": 5.714115858078003,
"epoch": 4.3568575233022635,
"grad_norm": 1.2578125,
"learning_rate": 0.00035717424456674086,
"loss": 5.3343,
"mean_token_accuracy": 0.18456389158964157,
"num_tokens": 10108928.0,
"step": 4910
},
{
"entropy": 5.649772787094117,
"epoch": 4.361296049711496,
"grad_norm": 1.21875,
"learning_rate": 0.0003568534711144591,
"loss": 5.2653,
"mean_token_accuracy": 0.1963585063815117,
"num_tokens": 10119017.0,
"step": 4915
},
{
"entropy": 5.679361629486084,
"epoch": 4.365734576120728,
"grad_norm": 1.1640625,
"learning_rate": 0.00035653250580323383,
"loss": 5.2774,
"mean_token_accuracy": 0.19579027891159057,
"num_tokens": 10129162.0,
"step": 4920
},
{
"entropy": 5.689876365661621,
"epoch": 4.37017310252996,
"grad_norm": 1.2265625,
"learning_rate": 0.00035621134938538585,
"loss": 5.2676,
"mean_token_accuracy": 0.18924943059682847,
"num_tokens": 10139477.0,
"step": 4925
},
{
"entropy": 5.679563999176025,
"epoch": 4.374611628939192,
"grad_norm": 1.1640625,
"learning_rate": 0.0003558900026136838,
"loss": 5.3398,
"mean_token_accuracy": 0.18372707217931747,
"num_tokens": 10149787.0,
"step": 4930
},
{
"entropy": 5.606500291824341,
"epoch": 4.379050155348424,
"grad_norm": 1.3125,
"learning_rate": 0.0003555684662413424,
"loss": 5.2255,
"mean_token_accuracy": 0.20049355775117875,
"num_tokens": 10159073.0,
"step": 4935
},
{
"entropy": 5.642777729034424,
"epoch": 4.383488681757656,
"grad_norm": 1.3984375,
"learning_rate": 0.0003552467410220212,
"loss": 5.3377,
"mean_token_accuracy": 0.18747732937335967,
"num_tokens": 10169649.0,
"step": 4940
},
{
"entropy": 5.662962293624878,
"epoch": 4.3879272081668885,
"grad_norm": 1.2734375,
"learning_rate": 0.0003549248277098221,
"loss": 5.2077,
"mean_token_accuracy": 0.20882650166749955,
"num_tokens": 10179207.0,
"step": 4945
},
{
"entropy": 5.672674179077148,
"epoch": 4.392365734576121,
"grad_norm": 1.390625,
"learning_rate": 0.0003546027270592878,
"loss": 5.3379,
"mean_token_accuracy": 0.18902564346790313,
"num_tokens": 10190784.0,
"step": 4950
},
{
"entropy": 5.629483890533447,
"epoch": 4.396804260985353,
"grad_norm": 1.359375,
"learning_rate": 0.00035428043982540017,
"loss": 5.1926,
"mean_token_accuracy": 0.19381997883319854,
"num_tokens": 10200708.0,
"step": 4955
},
{
"entropy": 5.693956756591797,
"epoch": 4.401242787394585,
"grad_norm": 1.6484375,
"learning_rate": 0.00035395796676357855,
"loss": 5.3106,
"mean_token_accuracy": 0.18499992042779922,
"num_tokens": 10212137.0,
"step": 4960
},
{
"entropy": 5.628724479675293,
"epoch": 4.405681313803817,
"grad_norm": 1.0625,
"learning_rate": 0.0003536353086296778,
"loss": 5.2644,
"mean_token_accuracy": 0.1989094153046608,
"num_tokens": 10223298.0,
"step": 4965
},
{
"entropy": 5.661438131332398,
"epoch": 4.410119840213049,
"grad_norm": 1.25,
"learning_rate": 0.00035331246617998654,
"loss": 5.3061,
"mean_token_accuracy": 0.1842536136507988,
"num_tokens": 10233086.0,
"step": 4970
},
{
"entropy": 5.674805450439453,
"epoch": 4.414558366622281,
"grad_norm": 1.3125,
"learning_rate": 0.0003529894401712253,
"loss": 5.3157,
"mean_token_accuracy": 0.19099296629428864,
"num_tokens": 10243579.0,
"step": 4975
},
{
"entropy": 5.70593490600586,
"epoch": 4.4189968930315136,
"grad_norm": 1.3359375,
"learning_rate": 0.00035266623136054505,
"loss": 5.351,
"mean_token_accuracy": 0.18827414959669114,
"num_tokens": 10254027.0,
"step": 4980
},
{
"entropy": 5.577308177947998,
"epoch": 4.423435419440746,
"grad_norm": 1.21875,
"learning_rate": 0.00035234284050552516,
"loss": 5.2328,
"mean_token_accuracy": 0.19931498169898987,
"num_tokens": 10263640.0,
"step": 4985
},
{
"entropy": 5.624858951568603,
"epoch": 4.427873945849978,
"grad_norm": 1.2578125,
"learning_rate": 0.0003520192683641718,
"loss": 5.3176,
"mean_token_accuracy": 0.1865358293056488,
"num_tokens": 10273782.0,
"step": 4990
},
{
"entropy": 5.662206935882568,
"epoch": 4.43231247225921,
"grad_norm": 1.4453125,
"learning_rate": 0.0003516955156949157,
"loss": 5.283,
"mean_token_accuracy": 0.19057476669549941,
"num_tokens": 10283183.0,
"step": 4995
},
{
"entropy": 5.674851894378662,
"epoch": 4.436750998668442,
"grad_norm": 1.1953125,
"learning_rate": 0.00035137158325661115,
"loss": 5.226,
"mean_token_accuracy": 0.19591174125671387,
"num_tokens": 10293423.0,
"step": 5000
},
{
"epoch": 4.436750998668442,
"eval_entropy": 5.567853355634241,
"eval_loss": 5.981941223144531,
"eval_mean_token_accuracy": 0.16250542425627945,
"eval_num_tokens": 10293423.0,
"eval_runtime": 2.7031,
"eval_samples_per_second": 1245.604,
"eval_steps_per_second": 155.747,
"step": 5000
}
],
"logging_steps": 5,
"max_steps": 11260,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.5619006283904e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}