Files
rus-cyrl-100mb-10mb_seed3407/checkpoint-11000/trainer_state.json
ModelHub XC 88d41ed81e 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/rus-cyrl-100mb-10mb_seed3407
Source: Original Platform
2026-07-18 14:37:15 +08:00

22277 lines
610 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 9.760763426542388,
"eval_steps": 500,
"global_step": 11000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.692031192779542,
"epoch": 0.004438526409232135,
"grad_norm": 14.75,
"learning_rate": 2e-06,
"loss": 10.8207,
"mean_token_accuracy": 0.000128369708545506,
"num_tokens": 9810.0,
"step": 5
},
{
"entropy": 10.691952133178711,
"epoch": 0.00887705281846427,
"grad_norm": 12.9375,
"learning_rate": 4.5e-06,
"loss": 10.7613,
"mean_token_accuracy": 0.0,
"num_tokens": 20538.0,
"step": 10
},
{
"entropy": 10.690592384338379,
"epoch": 0.013315579227696404,
"grad_norm": 9.9375,
"learning_rate": 7e-06,
"loss": 10.5054,
"mean_token_accuracy": 0.03474730136804283,
"num_tokens": 30258.0,
"step": 15
},
{
"entropy": 10.66368646621704,
"epoch": 0.01775410563692854,
"grad_norm": 5.875,
"learning_rate": 9.5e-06,
"loss": 10.1947,
"mean_token_accuracy": 0.04976645708084106,
"num_tokens": 41249.0,
"step": 20
},
{
"entropy": 10.518089294433594,
"epoch": 0.022192632046160676,
"grad_norm": 3.609375,
"learning_rate": 1.2e-05,
"loss": 9.9,
"mean_token_accuracy": 0.053335465490818024,
"num_tokens": 51738.0,
"step": 25
},
{
"entropy": 10.489847755432129,
"epoch": 0.02663115845539281,
"grad_norm": 3.0625,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.8161,
"mean_token_accuracy": 0.05364362597465515,
"num_tokens": 62920.0,
"step": 30
},
{
"entropy": 10.506165885925293,
"epoch": 0.031069684864624945,
"grad_norm": 2.859375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.7103,
"mean_token_accuracy": 0.05455525256693363,
"num_tokens": 73163.0,
"step": 35
},
{
"entropy": 10.478147506713867,
"epoch": 0.03550821127385708,
"grad_norm": 2.40625,
"learning_rate": 1.95e-05,
"loss": 9.682,
"mean_token_accuracy": 0.05231944099068642,
"num_tokens": 84180.0,
"step": 40
},
{
"entropy": 10.461441326141358,
"epoch": 0.03994673768308921,
"grad_norm": 2.359375,
"learning_rate": 2.2e-05,
"loss": 9.6388,
"mean_token_accuracy": 0.05221981666982174,
"num_tokens": 94108.0,
"step": 45
},
{
"entropy": 10.476018333435059,
"epoch": 0.04438526409232135,
"grad_norm": 3.140625,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.6253,
"mean_token_accuracy": 0.05243444815278053,
"num_tokens": 104696.0,
"step": 50
},
{
"entropy": 10.478155612945557,
"epoch": 0.048823790501553485,
"grad_norm": 2.375,
"learning_rate": 2.7e-05,
"loss": 9.5235,
"mean_token_accuracy": 0.0584161002188921,
"num_tokens": 114568.0,
"step": 55
},
{
"entropy": 10.39725103378296,
"epoch": 0.05326231691078562,
"grad_norm": 2.125,
"learning_rate": 2.95e-05,
"loss": 9.4713,
"mean_token_accuracy": 0.064088149741292,
"num_tokens": 126251.0,
"step": 60
},
{
"entropy": 10.248920154571532,
"epoch": 0.05770084332001776,
"grad_norm": 2.109375,
"learning_rate": 3.2e-05,
"loss": 9.3504,
"mean_token_accuracy": 0.06839247606694698,
"num_tokens": 135612.0,
"step": 65
},
{
"entropy": 10.320736598968505,
"epoch": 0.06213936972924989,
"grad_norm": 2.078125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.4004,
"mean_token_accuracy": 0.0615400142967701,
"num_tokens": 145962.0,
"step": 70
},
{
"entropy": 10.323652744293213,
"epoch": 0.06657789613848203,
"grad_norm": 1.890625,
"learning_rate": 3.7e-05,
"loss": 9.1911,
"mean_token_accuracy": 0.07103513963520527,
"num_tokens": 155587.0,
"step": 75
},
{
"entropy": 10.258409976959229,
"epoch": 0.07101642254771416,
"grad_norm": 2.109375,
"learning_rate": 3.95e-05,
"loss": 9.1343,
"mean_token_accuracy": 0.06803948283195496,
"num_tokens": 165657.0,
"step": 80
},
{
"entropy": 10.24950189590454,
"epoch": 0.0754549489569463,
"grad_norm": 2.34375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.1277,
"mean_token_accuracy": 0.06729609742760659,
"num_tokens": 175844.0,
"step": 85
},
{
"entropy": 10.224775981903075,
"epoch": 0.07989347536617843,
"grad_norm": 2.046875,
"learning_rate": 4.45e-05,
"loss": 8.9736,
"mean_token_accuracy": 0.06970795653760434,
"num_tokens": 185453.0,
"step": 90
},
{
"entropy": 10.128818893432618,
"epoch": 0.08433200177541056,
"grad_norm": 1.8046875,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.9469,
"mean_token_accuracy": 0.07015660107135772,
"num_tokens": 195296.0,
"step": 95
},
{
"entropy": 10.158192539215088,
"epoch": 0.0887705281846427,
"grad_norm": 1.7578125,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.8594,
"mean_token_accuracy": 0.0717735793441534,
"num_tokens": 204491.0,
"step": 100
},
{
"entropy": 10.063592338562012,
"epoch": 0.09320905459387484,
"grad_norm": 1.578125,
"learning_rate": 5.2e-05,
"loss": 8.8275,
"mean_token_accuracy": 0.06594390086829663,
"num_tokens": 214916.0,
"step": 105
},
{
"entropy": 10.0551118850708,
"epoch": 0.09764758100310697,
"grad_norm": 1.640625,
"learning_rate": 5.45e-05,
"loss": 8.6661,
"mean_token_accuracy": 0.07398808561265469,
"num_tokens": 226660.0,
"step": 110
},
{
"entropy": 9.929056739807129,
"epoch": 0.1020861074123391,
"grad_norm": 2.203125,
"learning_rate": 5.7e-05,
"loss": 8.6191,
"mean_token_accuracy": 0.06771207004785537,
"num_tokens": 236554.0,
"step": 115
},
{
"entropy": 9.87773323059082,
"epoch": 0.10652463382157124,
"grad_norm": 1.390625,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.5466,
"mean_token_accuracy": 0.07039828561246395,
"num_tokens": 247388.0,
"step": 120
},
{
"entropy": 9.78554401397705,
"epoch": 0.11096316023080337,
"grad_norm": 1.34375,
"learning_rate": 6.2e-05,
"loss": 8.3693,
"mean_token_accuracy": 0.07505594864487648,
"num_tokens": 257404.0,
"step": 125
},
{
"entropy": 9.569751739501953,
"epoch": 0.11540168664003551,
"grad_norm": 1.5859375,
"learning_rate": 6.450000000000001e-05,
"loss": 8.366,
"mean_token_accuracy": 0.0721758782863617,
"num_tokens": 268024.0,
"step": 130
},
{
"entropy": 9.49385757446289,
"epoch": 0.11984021304926765,
"grad_norm": 1.7890625,
"learning_rate": 6.7e-05,
"loss": 8.3116,
"mean_token_accuracy": 0.07231119871139527,
"num_tokens": 278477.0,
"step": 135
},
{
"entropy": 9.405902671813966,
"epoch": 0.12427873945849978,
"grad_norm": 1.2109375,
"learning_rate": 6.950000000000001e-05,
"loss": 8.2427,
"mean_token_accuracy": 0.06903640553355217,
"num_tokens": 289974.0,
"step": 140
},
{
"entropy": 9.16763277053833,
"epoch": 0.1287172658677319,
"grad_norm": 1.1953125,
"learning_rate": 7.2e-05,
"loss": 8.1839,
"mean_token_accuracy": 0.06725569888949394,
"num_tokens": 300150.0,
"step": 145
},
{
"entropy": 9.045907497406006,
"epoch": 0.13315579227696406,
"grad_norm": 1.2578125,
"learning_rate": 7.45e-05,
"loss": 8.0648,
"mean_token_accuracy": 0.07113164104521275,
"num_tokens": 310482.0,
"step": 150
},
{
"entropy": 8.951902961730957,
"epoch": 0.13759431868619618,
"grad_norm": 1.1875,
"learning_rate": 7.7e-05,
"loss": 8.1043,
"mean_token_accuracy": 0.07190654650330544,
"num_tokens": 321350.0,
"step": 155
},
{
"entropy": 8.734932899475098,
"epoch": 0.14203284509542832,
"grad_norm": 1.25,
"learning_rate": 7.950000000000001e-05,
"loss": 7.9902,
"mean_token_accuracy": 0.07260116301476956,
"num_tokens": 332009.0,
"step": 160
},
{
"entropy": 8.618322277069092,
"epoch": 0.14647137150466044,
"grad_norm": 1.4140625,
"learning_rate": 8.2e-05,
"loss": 8.0046,
"mean_token_accuracy": 0.07010005228221416,
"num_tokens": 341980.0,
"step": 165
},
{
"entropy": 8.576034545898438,
"epoch": 0.1509098979138926,
"grad_norm": 1.609375,
"learning_rate": 8.450000000000001e-05,
"loss": 7.9965,
"mean_token_accuracy": 0.06660077758133412,
"num_tokens": 354249.0,
"step": 170
},
{
"entropy": 8.524139022827148,
"epoch": 0.15534842432312473,
"grad_norm": 1.1875,
"learning_rate": 8.7e-05,
"loss": 7.9076,
"mean_token_accuracy": 0.07078476324677467,
"num_tokens": 364295.0,
"step": 175
},
{
"entropy": 8.328704929351806,
"epoch": 0.15978695073235685,
"grad_norm": 1.09375,
"learning_rate": 8.95e-05,
"loss": 7.8464,
"mean_token_accuracy": 0.0794072538614273,
"num_tokens": 373601.0,
"step": 180
},
{
"entropy": 8.382467269897461,
"epoch": 0.164225477141589,
"grad_norm": 1.8515625,
"learning_rate": 9.2e-05,
"loss": 7.8583,
"mean_token_accuracy": 0.07436131834983825,
"num_tokens": 384260.0,
"step": 185
},
{
"entropy": 8.316840362548827,
"epoch": 0.16866400355082112,
"grad_norm": 1.390625,
"learning_rate": 9.45e-05,
"loss": 7.9058,
"mean_token_accuracy": 0.06711366176605224,
"num_tokens": 394964.0,
"step": 190
},
{
"entropy": 8.204895782470704,
"epoch": 0.17310252996005326,
"grad_norm": 1.1484375,
"learning_rate": 9.7e-05,
"loss": 7.8384,
"mean_token_accuracy": 0.07343141734600067,
"num_tokens": 404470.0,
"step": 195
},
{
"entropy": 8.270458793640136,
"epoch": 0.1775410563692854,
"grad_norm": 1.0078125,
"learning_rate": 9.95e-05,
"loss": 7.9041,
"mean_token_accuracy": 0.07145134881138801,
"num_tokens": 414822.0,
"step": 200
},
{
"entropy": 8.344293403625489,
"epoch": 0.18197958277851753,
"grad_norm": 1.2578125,
"learning_rate": 0.000102,
"loss": 7.8228,
"mean_token_accuracy": 0.07206394150853157,
"num_tokens": 424367.0,
"step": 205
},
{
"entropy": 8.169469261169434,
"epoch": 0.18641810918774968,
"grad_norm": 1.4296875,
"learning_rate": 0.00010449999999999999,
"loss": 7.8063,
"mean_token_accuracy": 0.06796807795763016,
"num_tokens": 434911.0,
"step": 210
},
{
"entropy": 8.127049207687378,
"epoch": 0.1908566355969818,
"grad_norm": 1.0703125,
"learning_rate": 0.000107,
"loss": 7.7417,
"mean_token_accuracy": 0.08103418126702308,
"num_tokens": 445215.0,
"step": 215
},
{
"entropy": 8.216034698486329,
"epoch": 0.19529516200621394,
"grad_norm": 1.1875,
"learning_rate": 0.0001095,
"loss": 7.7919,
"mean_token_accuracy": 0.07842708677053452,
"num_tokens": 454786.0,
"step": 220
},
{
"entropy": 8.140088844299317,
"epoch": 0.19973368841544606,
"grad_norm": 1.4765625,
"learning_rate": 0.000112,
"loss": 7.8219,
"mean_token_accuracy": 0.07302889823913575,
"num_tokens": 465185.0,
"step": 225
},
{
"entropy": 8.021256399154662,
"epoch": 0.2041722148246782,
"grad_norm": 1.2890625,
"learning_rate": 0.0001145,
"loss": 7.7156,
"mean_token_accuracy": 0.08027704544365406,
"num_tokens": 475235.0,
"step": 230
},
{
"entropy": 8.17042875289917,
"epoch": 0.20861074123391035,
"grad_norm": 1.453125,
"learning_rate": 0.00011700000000000001,
"loss": 7.7317,
"mean_token_accuracy": 0.07805200070142745,
"num_tokens": 485408.0,
"step": 235
},
{
"entropy": 8.040202140808105,
"epoch": 0.21304926764314247,
"grad_norm": 1.28125,
"learning_rate": 0.00011949999999999999,
"loss": 7.7331,
"mean_token_accuracy": 0.0744746584445238,
"num_tokens": 495570.0,
"step": 240
},
{
"entropy": 8.125858116149903,
"epoch": 0.21748779405237462,
"grad_norm": 1.1953125,
"learning_rate": 0.000122,
"loss": 7.7248,
"mean_token_accuracy": 0.07628845125436783,
"num_tokens": 506103.0,
"step": 245
},
{
"entropy": 8.083836793899536,
"epoch": 0.22192632046160674,
"grad_norm": 0.94921875,
"learning_rate": 0.0001245,
"loss": 7.6989,
"mean_token_accuracy": 0.07588708400726318,
"num_tokens": 516416.0,
"step": 250
},
{
"entropy": 8.041877603530883,
"epoch": 0.22636484687083888,
"grad_norm": 1.0546875,
"learning_rate": 0.000127,
"loss": 7.7498,
"mean_token_accuracy": 0.0751910775899887,
"num_tokens": 525841.0,
"step": 255
},
{
"entropy": 8.231132793426514,
"epoch": 0.23080337328007103,
"grad_norm": 1.0390625,
"learning_rate": 0.0001295,
"loss": 7.7681,
"mean_token_accuracy": 0.07214248739182949,
"num_tokens": 536426.0,
"step": 260
},
{
"entropy": 8.028632116317748,
"epoch": 0.23524189968930315,
"grad_norm": 1.0703125,
"learning_rate": 0.000132,
"loss": 7.7229,
"mean_token_accuracy": 0.07526009976863861,
"num_tokens": 545852.0,
"step": 265
},
{
"entropy": 7.998026943206787,
"epoch": 0.2396804260985353,
"grad_norm": 1.015625,
"learning_rate": 0.00013450000000000002,
"loss": 7.6466,
"mean_token_accuracy": 0.07897478640079499,
"num_tokens": 555222.0,
"step": 270
},
{
"entropy": 7.9018083095550535,
"epoch": 0.2441189525077674,
"grad_norm": 1.046875,
"learning_rate": 0.00013700000000000002,
"loss": 7.6683,
"mean_token_accuracy": 0.0769478440284729,
"num_tokens": 566311.0,
"step": 275
},
{
"entropy": 8.067350673675538,
"epoch": 0.24855747891699956,
"grad_norm": 0.91015625,
"learning_rate": 0.0001395,
"loss": 7.6718,
"mean_token_accuracy": 0.07673554085195064,
"num_tokens": 576883.0,
"step": 280
},
{
"entropy": 8.010624122619628,
"epoch": 0.2529960053262317,
"grad_norm": 1.265625,
"learning_rate": 0.00014199999999999998,
"loss": 7.8136,
"mean_token_accuracy": 0.07454071268439293,
"num_tokens": 587387.0,
"step": 285
},
{
"entropy": 8.04631519317627,
"epoch": 0.2574345317354638,
"grad_norm": 0.99609375,
"learning_rate": 0.0001445,
"loss": 7.6914,
"mean_token_accuracy": 0.07921014353632927,
"num_tokens": 597229.0,
"step": 290
},
{
"entropy": 8.029859972000121,
"epoch": 0.26187305814469597,
"grad_norm": 1.0390625,
"learning_rate": 0.000147,
"loss": 7.6793,
"mean_token_accuracy": 0.0733891949057579,
"num_tokens": 606997.0,
"step": 295
},
{
"entropy": 7.9327795028686525,
"epoch": 0.2663115845539281,
"grad_norm": 1.2890625,
"learning_rate": 0.0001495,
"loss": 7.6346,
"mean_token_accuracy": 0.07976229339838029,
"num_tokens": 617316.0,
"step": 300
},
{
"entropy": 7.945201730728149,
"epoch": 0.2707501109631602,
"grad_norm": 1.125,
"learning_rate": 0.000152,
"loss": 7.6262,
"mean_token_accuracy": 0.07671116665005684,
"num_tokens": 626494.0,
"step": 305
},
{
"entropy": 7.911632776260376,
"epoch": 0.27518863737239235,
"grad_norm": 1.296875,
"learning_rate": 0.00015450000000000001,
"loss": 7.6211,
"mean_token_accuracy": 0.07656443342566491,
"num_tokens": 636816.0,
"step": 310
},
{
"entropy": 7.9385381698608395,
"epoch": 0.2796271637816245,
"grad_norm": 0.92578125,
"learning_rate": 0.000157,
"loss": 7.5921,
"mean_token_accuracy": 0.07875077873468399,
"num_tokens": 647520.0,
"step": 315
},
{
"entropy": 7.8889247417449955,
"epoch": 0.28406569019085665,
"grad_norm": 1.296875,
"learning_rate": 0.0001595,
"loss": 7.5615,
"mean_token_accuracy": 0.0802665926516056,
"num_tokens": 656772.0,
"step": 320
},
{
"entropy": 7.87529935836792,
"epoch": 0.2885042166000888,
"grad_norm": 1.0390625,
"learning_rate": 0.000162,
"loss": 7.6269,
"mean_token_accuracy": 0.07935804799199105,
"num_tokens": 666570.0,
"step": 325
},
{
"entropy": 7.889472913742066,
"epoch": 0.2929427430093209,
"grad_norm": 0.984375,
"learning_rate": 0.00016450000000000001,
"loss": 7.6449,
"mean_token_accuracy": 0.07449713721871376,
"num_tokens": 676873.0,
"step": 330
},
{
"entropy": 7.901484632492066,
"epoch": 0.29738126941855303,
"grad_norm": 1.0859375,
"learning_rate": 0.00016700000000000002,
"loss": 7.556,
"mean_token_accuracy": 0.0819828025996685,
"num_tokens": 687322.0,
"step": 335
},
{
"entropy": 7.938011121749878,
"epoch": 0.3018197958277852,
"grad_norm": 1.0859375,
"learning_rate": 0.00016950000000000003,
"loss": 7.6304,
"mean_token_accuracy": 0.07710144743323326,
"num_tokens": 697657.0,
"step": 340
},
{
"entropy": 7.953681612014771,
"epoch": 0.3062583222370173,
"grad_norm": 1.2265625,
"learning_rate": 0.00017199999999999998,
"loss": 7.5355,
"mean_token_accuracy": 0.07943713515996934,
"num_tokens": 707713.0,
"step": 345
},
{
"entropy": 7.818657636642456,
"epoch": 0.31069684864624947,
"grad_norm": 1.0546875,
"learning_rate": 0.00017449999999999999,
"loss": 7.5792,
"mean_token_accuracy": 0.08700495660305023,
"num_tokens": 719438.0,
"step": 350
},
{
"entropy": 7.922421979904175,
"epoch": 0.31513537505548156,
"grad_norm": 1.109375,
"learning_rate": 0.000177,
"loss": 7.5211,
"mean_token_accuracy": 0.0777974933385849,
"num_tokens": 728991.0,
"step": 355
},
{
"entropy": 7.7726140975952145,
"epoch": 0.3195739014647137,
"grad_norm": 1.7421875,
"learning_rate": 0.0001795,
"loss": 7.4375,
"mean_token_accuracy": 0.09254143610596657,
"num_tokens": 738276.0,
"step": 360
},
{
"entropy": 7.8144529342651365,
"epoch": 0.32401242787394585,
"grad_norm": 1.109375,
"learning_rate": 0.000182,
"loss": 7.537,
"mean_token_accuracy": 0.07724328823387623,
"num_tokens": 748405.0,
"step": 365
},
{
"entropy": 7.8304845809936525,
"epoch": 0.328450954283178,
"grad_norm": 1.015625,
"learning_rate": 0.0001845,
"loss": 7.5365,
"mean_token_accuracy": 0.08004771247506141,
"num_tokens": 759111.0,
"step": 370
},
{
"entropy": 7.755885601043701,
"epoch": 0.33288948069241014,
"grad_norm": 1.203125,
"learning_rate": 0.000187,
"loss": 7.4431,
"mean_token_accuracy": 0.08885042890906333,
"num_tokens": 770315.0,
"step": 375
},
{
"entropy": 7.815682411193848,
"epoch": 0.33732800710164224,
"grad_norm": 1.078125,
"learning_rate": 0.0001895,
"loss": 7.5761,
"mean_token_accuracy": 0.07824730798602104,
"num_tokens": 781390.0,
"step": 380
},
{
"entropy": 7.868446302413941,
"epoch": 0.3417665335108744,
"grad_norm": 1.0546875,
"learning_rate": 0.000192,
"loss": 7.4659,
"mean_token_accuracy": 0.08218091987073421,
"num_tokens": 790710.0,
"step": 385
},
{
"entropy": 7.664791536331177,
"epoch": 0.34620505992010653,
"grad_norm": 1.0625,
"learning_rate": 0.0001945,
"loss": 7.4344,
"mean_token_accuracy": 0.08516876846551895,
"num_tokens": 800475.0,
"step": 390
},
{
"entropy": 7.776907110214234,
"epoch": 0.3506435863293387,
"grad_norm": 1.109375,
"learning_rate": 0.00019700000000000002,
"loss": 7.5457,
"mean_token_accuracy": 0.07697484940290451,
"num_tokens": 810394.0,
"step": 395
},
{
"entropy": 7.851606655120849,
"epoch": 0.3550821127385708,
"grad_norm": 1.2421875,
"learning_rate": 0.00019950000000000002,
"loss": 7.5259,
"mean_token_accuracy": 0.07952482551336289,
"num_tokens": 820493.0,
"step": 400
},
{
"entropy": 7.881973552703857,
"epoch": 0.3595206391478029,
"grad_norm": 1.1796875,
"learning_rate": 0.000202,
"loss": 7.5896,
"mean_token_accuracy": 0.07090779766440392,
"num_tokens": 831570.0,
"step": 405
},
{
"entropy": 7.75118236541748,
"epoch": 0.36395916555703506,
"grad_norm": 1.09375,
"learning_rate": 0.00020449999999999998,
"loss": 7.5822,
"mean_token_accuracy": 0.07436199747025966,
"num_tokens": 841851.0,
"step": 410
},
{
"entropy": 7.8130326747894285,
"epoch": 0.3683976919662672,
"grad_norm": 1.2109375,
"learning_rate": 0.000207,
"loss": 7.4771,
"mean_token_accuracy": 0.08917279317975044,
"num_tokens": 851221.0,
"step": 415
},
{
"entropy": 7.784592771530152,
"epoch": 0.37283621837549935,
"grad_norm": 1.0703125,
"learning_rate": 0.0002095,
"loss": 7.5136,
"mean_token_accuracy": 0.08482674360275269,
"num_tokens": 861876.0,
"step": 420
},
{
"entropy": 7.806199550628662,
"epoch": 0.37727474478473144,
"grad_norm": 1.2265625,
"learning_rate": 0.000212,
"loss": 7.5012,
"mean_token_accuracy": 0.08520847856998444,
"num_tokens": 871742.0,
"step": 425
},
{
"entropy": 7.63223876953125,
"epoch": 0.3817132711939636,
"grad_norm": 1.0625,
"learning_rate": 0.0002145,
"loss": 7.4356,
"mean_token_accuracy": 0.08614917695522309,
"num_tokens": 881968.0,
"step": 430
},
{
"entropy": 7.708009338378906,
"epoch": 0.38615179760319573,
"grad_norm": 1.0546875,
"learning_rate": 0.00021700000000000002,
"loss": 7.3441,
"mean_token_accuracy": 0.0903160773217678,
"num_tokens": 892142.0,
"step": 435
},
{
"entropy": 7.681766939163208,
"epoch": 0.3905903240124279,
"grad_norm": 1.15625,
"learning_rate": 0.0002195,
"loss": 7.408,
"mean_token_accuracy": 0.09188471287488938,
"num_tokens": 901992.0,
"step": 440
},
{
"entropy": 7.797896862030029,
"epoch": 0.39502885042166,
"grad_norm": 1.1171875,
"learning_rate": 0.000222,
"loss": 7.5382,
"mean_token_accuracy": 0.07850045077502728,
"num_tokens": 913438.0,
"step": 445
},
{
"entropy": 7.55986213684082,
"epoch": 0.3994673768308921,
"grad_norm": 2.109375,
"learning_rate": 0.0002245,
"loss": 7.273,
"mean_token_accuracy": 0.10574427619576454,
"num_tokens": 923879.0,
"step": 450
},
{
"entropy": 7.674528026580811,
"epoch": 0.40390590324012426,
"grad_norm": 1.1015625,
"learning_rate": 0.00022700000000000002,
"loss": 7.4341,
"mean_token_accuracy": 0.08904042169451713,
"num_tokens": 933954.0,
"step": 455
},
{
"entropy": 7.707700920104981,
"epoch": 0.4083444296493564,
"grad_norm": 1.15625,
"learning_rate": 0.00022950000000000002,
"loss": 7.4156,
"mean_token_accuracy": 0.0867860458791256,
"num_tokens": 942992.0,
"step": 460
},
{
"entropy": 7.656433868408203,
"epoch": 0.41278295605858856,
"grad_norm": 1.25,
"learning_rate": 0.00023200000000000003,
"loss": 7.4528,
"mean_token_accuracy": 0.08972205594182014,
"num_tokens": 953822.0,
"step": 465
},
{
"entropy": 7.627706384658813,
"epoch": 0.4172214824678207,
"grad_norm": 1.1015625,
"learning_rate": 0.00023449999999999998,
"loss": 7.3472,
"mean_token_accuracy": 0.08931803703308105,
"num_tokens": 964475.0,
"step": 470
},
{
"entropy": 7.642127990722656,
"epoch": 0.4216600088770528,
"grad_norm": 1.0859375,
"learning_rate": 0.000237,
"loss": 7.434,
"mean_token_accuracy": 0.0859565369784832,
"num_tokens": 974535.0,
"step": 475
},
{
"entropy": 7.666657447814941,
"epoch": 0.42609853528628494,
"grad_norm": 1.0703125,
"learning_rate": 0.0002395,
"loss": 7.3944,
"mean_token_accuracy": 0.08582191392779351,
"num_tokens": 984674.0,
"step": 480
},
{
"entropy": 7.544086360931397,
"epoch": 0.4305370616955171,
"grad_norm": 1.171875,
"learning_rate": 0.000242,
"loss": 7.37,
"mean_token_accuracy": 0.09044271633028984,
"num_tokens": 995248.0,
"step": 485
},
{
"entropy": 7.742295646667481,
"epoch": 0.43497558810474923,
"grad_norm": 1.2890625,
"learning_rate": 0.0002445,
"loss": 7.3632,
"mean_token_accuracy": 0.0895160473883152,
"num_tokens": 1005547.0,
"step": 490
},
{
"entropy": 7.550811624526977,
"epoch": 0.4394141145139814,
"grad_norm": 1.171875,
"learning_rate": 0.000247,
"loss": 7.3413,
"mean_token_accuracy": 0.08750802129507065,
"num_tokens": 1015498.0,
"step": 495
},
{
"entropy": 7.609345579147339,
"epoch": 0.44385264092321347,
"grad_norm": 1.1015625,
"learning_rate": 0.0002495,
"loss": 7.4055,
"mean_token_accuracy": 0.08584300205111503,
"num_tokens": 1025420.0,
"step": 500
},
{
"epoch": 0.44385264092321347,
"eval_entropy": 7.669124412989673,
"eval_loss": 7.446435451507568,
"eval_mean_token_accuracy": 0.08312557260738132,
"eval_num_tokens": 1025420.0,
"eval_runtime": 2.7854,
"eval_samples_per_second": 1208.804,
"eval_steps_per_second": 151.145,
"step": 500
},
{
"entropy": 7.6334656238555905,
"epoch": 0.4482911673324456,
"grad_norm": 1.125,
"learning_rate": 0.000252,
"loss": 7.3295,
"mean_token_accuracy": 0.09022360593080521,
"num_tokens": 1036556.0,
"step": 505
},
{
"entropy": 7.584210634231567,
"epoch": 0.45272969374167776,
"grad_norm": 1.1640625,
"learning_rate": 0.0002545,
"loss": 7.3593,
"mean_token_accuracy": 0.08703627660870553,
"num_tokens": 1046676.0,
"step": 510
},
{
"entropy": 7.6705080509185795,
"epoch": 0.4571682201509099,
"grad_norm": 1.2109375,
"learning_rate": 0.000257,
"loss": 7.4042,
"mean_token_accuracy": 0.08590352982282638,
"num_tokens": 1057088.0,
"step": 515
},
{
"entropy": 7.5486232280731205,
"epoch": 0.46160674656014206,
"grad_norm": 0.98828125,
"learning_rate": 0.0002595,
"loss": 7.2982,
"mean_token_accuracy": 0.09567688480019569,
"num_tokens": 1067814.0,
"step": 520
},
{
"entropy": 7.543769884109497,
"epoch": 0.46604527296937415,
"grad_norm": 1.1015625,
"learning_rate": 0.000262,
"loss": 7.3327,
"mean_token_accuracy": 0.0892727330327034,
"num_tokens": 1078600.0,
"step": 525
},
{
"entropy": 7.641923093795777,
"epoch": 0.4704837993786063,
"grad_norm": 1.171875,
"learning_rate": 0.00026450000000000003,
"loss": 7.3363,
"mean_token_accuracy": 0.08722671940922737,
"num_tokens": 1089158.0,
"step": 530
},
{
"entropy": 7.568871212005615,
"epoch": 0.47492232578783844,
"grad_norm": 1.2421875,
"learning_rate": 0.00026700000000000004,
"loss": 7.3497,
"mean_token_accuracy": 0.08428739383816719,
"num_tokens": 1100365.0,
"step": 535
},
{
"entropy": 7.500961780548096,
"epoch": 0.4793608521970706,
"grad_norm": 1.09375,
"learning_rate": 0.00026950000000000005,
"loss": 7.305,
"mean_token_accuracy": 0.09392210468649864,
"num_tokens": 1111168.0,
"step": 540
},
{
"entropy": 7.573345041275024,
"epoch": 0.48379937860630273,
"grad_norm": 1.171875,
"learning_rate": 0.00027200000000000005,
"loss": 7.3194,
"mean_token_accuracy": 0.09149189814925193,
"num_tokens": 1121520.0,
"step": 545
},
{
"entropy": 7.536744737625122,
"epoch": 0.4882379050155348,
"grad_norm": 1.1953125,
"learning_rate": 0.0002745,
"loss": 7.2073,
"mean_token_accuracy": 0.09879742562770844,
"num_tokens": 1131300.0,
"step": 550
},
{
"entropy": 7.364904880523682,
"epoch": 0.49267643142476697,
"grad_norm": 1.0546875,
"learning_rate": 0.000277,
"loss": 7.2532,
"mean_token_accuracy": 0.0986358568072319,
"num_tokens": 1141897.0,
"step": 555
},
{
"entropy": 7.541038084030151,
"epoch": 0.4971149578339991,
"grad_norm": 1.3046875,
"learning_rate": 0.0002795,
"loss": 7.2956,
"mean_token_accuracy": 0.08940311297774314,
"num_tokens": 1152510.0,
"step": 560
},
{
"entropy": 7.552376794815063,
"epoch": 0.5015534842432312,
"grad_norm": 1.1640625,
"learning_rate": 0.00028199999999999997,
"loss": 7.3001,
"mean_token_accuracy": 0.09093584269285201,
"num_tokens": 1161762.0,
"step": 565
},
{
"entropy": 7.479511404037476,
"epoch": 0.5059920106524634,
"grad_norm": 1.1171875,
"learning_rate": 0.0002845,
"loss": 7.2394,
"mean_token_accuracy": 0.09156333580613137,
"num_tokens": 1172836.0,
"step": 570
},
{
"entropy": 7.480563068389893,
"epoch": 0.5104305370616955,
"grad_norm": 1.1953125,
"learning_rate": 0.000287,
"loss": 7.2935,
"mean_token_accuracy": 0.09051846116781234,
"num_tokens": 1182101.0,
"step": 575
},
{
"entropy": 7.511827182769776,
"epoch": 0.5148690634709276,
"grad_norm": 1.0859375,
"learning_rate": 0.0002895,
"loss": 7.2868,
"mean_token_accuracy": 0.08703599572181701,
"num_tokens": 1191925.0,
"step": 580
},
{
"entropy": 7.430129528045654,
"epoch": 0.5193075898801598,
"grad_norm": 1.109375,
"learning_rate": 0.000292,
"loss": 7.1629,
"mean_token_accuracy": 0.09691138043999672,
"num_tokens": 1202030.0,
"step": 585
},
{
"entropy": 7.408132934570313,
"epoch": 0.5237461162893919,
"grad_norm": 1.109375,
"learning_rate": 0.0002945,
"loss": 7.253,
"mean_token_accuracy": 0.09141650795936584,
"num_tokens": 1212178.0,
"step": 590
},
{
"entropy": 7.515611791610718,
"epoch": 0.5281846426986241,
"grad_norm": 1.0703125,
"learning_rate": 0.000297,
"loss": 7.1971,
"mean_token_accuracy": 0.0950719341635704,
"num_tokens": 1221685.0,
"step": 595
},
{
"entropy": 7.383773374557495,
"epoch": 0.5326231691078562,
"grad_norm": 1.1015625,
"learning_rate": 0.0002995,
"loss": 7.197,
"mean_token_accuracy": 0.08822897970676422,
"num_tokens": 1233178.0,
"step": 600
},
{
"entropy": 7.4588648796081545,
"epoch": 0.5370616955170884,
"grad_norm": 1.0859375,
"learning_rate": 0.000302,
"loss": 7.1611,
"mean_token_accuracy": 0.09191120117902755,
"num_tokens": 1243687.0,
"step": 605
},
{
"entropy": 7.358021211624146,
"epoch": 0.5415002219263204,
"grad_norm": 1.0078125,
"learning_rate": 0.0003045,
"loss": 7.2349,
"mean_token_accuracy": 0.08815527036786079,
"num_tokens": 1255124.0,
"step": 610
},
{
"entropy": 7.400767421722412,
"epoch": 0.5459387483355526,
"grad_norm": 1.3671875,
"learning_rate": 0.000307,
"loss": 7.2452,
"mean_token_accuracy": 0.09174467995762825,
"num_tokens": 1265517.0,
"step": 615
},
{
"entropy": 7.310306978225708,
"epoch": 0.5503772747447847,
"grad_norm": 1.296875,
"learning_rate": 0.0003095,
"loss": 7.1176,
"mean_token_accuracy": 0.09506009593605995,
"num_tokens": 1275877.0,
"step": 620
},
{
"entropy": 7.400981378555298,
"epoch": 0.5548158011540169,
"grad_norm": 1.1875,
"learning_rate": 0.000312,
"loss": 7.2286,
"mean_token_accuracy": 0.09438399225473404,
"num_tokens": 1285951.0,
"step": 625
},
{
"entropy": 7.509041738510132,
"epoch": 0.559254327563249,
"grad_norm": 1.296875,
"learning_rate": 0.0003145,
"loss": 7.1567,
"mean_token_accuracy": 0.09806277230381966,
"num_tokens": 1295209.0,
"step": 630
},
{
"entropy": 7.316894149780273,
"epoch": 0.5636928539724811,
"grad_norm": 1.171875,
"learning_rate": 0.000317,
"loss": 7.2208,
"mean_token_accuracy": 0.09708264470100403,
"num_tokens": 1304733.0,
"step": 635
},
{
"entropy": 7.342378044128418,
"epoch": 0.5681313803817133,
"grad_norm": 1.0546875,
"learning_rate": 0.0003195,
"loss": 7.1539,
"mean_token_accuracy": 0.08910495042800903,
"num_tokens": 1314981.0,
"step": 640
},
{
"entropy": 7.538545989990235,
"epoch": 0.5725699067909454,
"grad_norm": 1.0859375,
"learning_rate": 0.000322,
"loss": 7.198,
"mean_token_accuracy": 0.0895936667919159,
"num_tokens": 1325211.0,
"step": 645
},
{
"entropy": 7.2863500118255615,
"epoch": 0.5770084332001776,
"grad_norm": 1.0546875,
"learning_rate": 0.00032450000000000003,
"loss": 7.1309,
"mean_token_accuracy": 0.09338074773550034,
"num_tokens": 1335625.0,
"step": 650
},
{
"entropy": 7.436445474624634,
"epoch": 0.5814469596094097,
"grad_norm": 1.3828125,
"learning_rate": 0.00032700000000000003,
"loss": 7.2488,
"mean_token_accuracy": 0.0991661287844181,
"num_tokens": 1345158.0,
"step": 655
},
{
"entropy": 7.262508535385132,
"epoch": 0.5858854860186418,
"grad_norm": 1.1875,
"learning_rate": 0.00032950000000000004,
"loss": 7.081,
"mean_token_accuracy": 0.10250589922070504,
"num_tokens": 1355092.0,
"step": 660
},
{
"entropy": 7.307907056808472,
"epoch": 0.5903240124278739,
"grad_norm": 1.15625,
"learning_rate": 0.00033200000000000005,
"loss": 7.1329,
"mean_token_accuracy": 0.09874422326683999,
"num_tokens": 1364919.0,
"step": 665
},
{
"entropy": 7.2338110446929935,
"epoch": 0.5947625388371061,
"grad_norm": 1.171875,
"learning_rate": 0.00033450000000000005,
"loss": 7.1726,
"mean_token_accuracy": 0.09538876637816429,
"num_tokens": 1375200.0,
"step": 670
},
{
"entropy": 7.331265687942505,
"epoch": 0.5992010652463382,
"grad_norm": 1.265625,
"learning_rate": 0.000337,
"loss": 7.1466,
"mean_token_accuracy": 0.09369650185108185,
"num_tokens": 1385728.0,
"step": 675
},
{
"entropy": 7.4757524013519285,
"epoch": 0.6036395916555704,
"grad_norm": 1.203125,
"learning_rate": 0.0003395,
"loss": 7.196,
"mean_token_accuracy": 0.08721103966236114,
"num_tokens": 1395542.0,
"step": 680
},
{
"entropy": 7.264866781234741,
"epoch": 0.6080781180648025,
"grad_norm": 1.140625,
"learning_rate": 0.000342,
"loss": 7.1667,
"mean_token_accuracy": 0.09908052235841751,
"num_tokens": 1406350.0,
"step": 685
},
{
"entropy": 7.250851583480835,
"epoch": 0.6125166444740346,
"grad_norm": 1.1484375,
"learning_rate": 0.00034449999999999997,
"loss": 7.0933,
"mean_token_accuracy": 0.09707043692469597,
"num_tokens": 1418229.0,
"step": 690
},
{
"entropy": 7.257457447052002,
"epoch": 0.6169551708832668,
"grad_norm": 1.109375,
"learning_rate": 0.000347,
"loss": 7.101,
"mean_token_accuracy": 0.10156845226883889,
"num_tokens": 1428290.0,
"step": 695
},
{
"entropy": 7.389108514785766,
"epoch": 0.6213936972924989,
"grad_norm": 1.0390625,
"learning_rate": 0.0003495,
"loss": 7.1644,
"mean_token_accuracy": 0.08962787240743637,
"num_tokens": 1439837.0,
"step": 700
},
{
"entropy": 7.230832195281982,
"epoch": 0.625832223701731,
"grad_norm": 1.046875,
"learning_rate": 0.000352,
"loss": 7.1004,
"mean_token_accuracy": 0.09468400254845619,
"num_tokens": 1450831.0,
"step": 705
},
{
"entropy": 7.241072797775269,
"epoch": 0.6302707501109631,
"grad_norm": 1.09375,
"learning_rate": 0.0003545,
"loss": 7.0787,
"mean_token_accuracy": 0.0992747537791729,
"num_tokens": 1461772.0,
"step": 710
},
{
"entropy": 7.251083326339722,
"epoch": 0.6347092765201953,
"grad_norm": 0.93359375,
"learning_rate": 0.000357,
"loss": 7.0678,
"mean_token_accuracy": 0.10479466319084167,
"num_tokens": 1471669.0,
"step": 715
},
{
"entropy": 7.284691286087036,
"epoch": 0.6391478029294274,
"grad_norm": 1.2265625,
"learning_rate": 0.0003595,
"loss": 7.0922,
"mean_token_accuracy": 0.0977623738348484,
"num_tokens": 1482319.0,
"step": 720
},
{
"entropy": 7.207487869262695,
"epoch": 0.6435863293386596,
"grad_norm": 1.1328125,
"learning_rate": 0.000362,
"loss": 7.0654,
"mean_token_accuracy": 0.09616786390542983,
"num_tokens": 1492393.0,
"step": 725
},
{
"entropy": 7.214288234710693,
"epoch": 0.6480248557478917,
"grad_norm": 1.09375,
"learning_rate": 0.0003645,
"loss": 7.1377,
"mean_token_accuracy": 0.10020551234483718,
"num_tokens": 1502986.0,
"step": 730
},
{
"entropy": 7.309820938110351,
"epoch": 0.6524633821571239,
"grad_norm": 1.0703125,
"learning_rate": 0.000367,
"loss": 7.1195,
"mean_token_accuracy": 0.09985571056604385,
"num_tokens": 1514046.0,
"step": 735
},
{
"entropy": 7.249904489517212,
"epoch": 0.656901908566356,
"grad_norm": 1.2890625,
"learning_rate": 0.0003695,
"loss": 7.133,
"mean_token_accuracy": 0.0978231132030487,
"num_tokens": 1523789.0,
"step": 740
},
{
"entropy": 7.303426790237427,
"epoch": 0.6613404349755881,
"grad_norm": 1.28125,
"learning_rate": 0.000372,
"loss": 7.0636,
"mean_token_accuracy": 0.0984602726995945,
"num_tokens": 1533449.0,
"step": 745
},
{
"entropy": 7.157350540161133,
"epoch": 0.6657789613848203,
"grad_norm": 1.21875,
"learning_rate": 0.0003745,
"loss": 7.1052,
"mean_token_accuracy": 0.0913457877933979,
"num_tokens": 1543449.0,
"step": 750
},
{
"entropy": 7.232370662689209,
"epoch": 0.6702174877940523,
"grad_norm": 1.2578125,
"learning_rate": 0.000377,
"loss": 6.957,
"mean_token_accuracy": 0.10332913659512996,
"num_tokens": 1553529.0,
"step": 755
},
{
"entropy": 7.166843461990356,
"epoch": 0.6746560142032845,
"grad_norm": 1.0859375,
"learning_rate": 0.0003795,
"loss": 7.0559,
"mean_token_accuracy": 0.1009259507060051,
"num_tokens": 1564245.0,
"step": 760
},
{
"entropy": 7.135752153396607,
"epoch": 0.6790945406125166,
"grad_norm": 1.15625,
"learning_rate": 0.000382,
"loss": 6.9787,
"mean_token_accuracy": 0.0997254841029644,
"num_tokens": 1573834.0,
"step": 765
},
{
"entropy": 7.034980821609497,
"epoch": 0.6835330670217488,
"grad_norm": 1.09375,
"learning_rate": 0.0003845,
"loss": 6.9407,
"mean_token_accuracy": 0.10062595605850219,
"num_tokens": 1583782.0,
"step": 770
},
{
"entropy": 7.211769485473633,
"epoch": 0.6879715934309809,
"grad_norm": 1.1640625,
"learning_rate": 0.00038700000000000003,
"loss": 7.0625,
"mean_token_accuracy": 0.10229107290506363,
"num_tokens": 1594056.0,
"step": 775
},
{
"entropy": 7.17944564819336,
"epoch": 0.6924101198402131,
"grad_norm": 1.125,
"learning_rate": 0.00038950000000000003,
"loss": 7.0671,
"mean_token_accuracy": 0.09898089095950127,
"num_tokens": 1604177.0,
"step": 780
},
{
"entropy": 7.1694622993469235,
"epoch": 0.6968486462494452,
"grad_norm": 1.09375,
"learning_rate": 0.00039200000000000004,
"loss": 6.9696,
"mean_token_accuracy": 0.10202183946967125,
"num_tokens": 1614439.0,
"step": 785
},
{
"entropy": 7.079647397994995,
"epoch": 0.7012871726586773,
"grad_norm": 1.3984375,
"learning_rate": 0.00039450000000000005,
"loss": 6.99,
"mean_token_accuracy": 0.09851381108164788,
"num_tokens": 1625004.0,
"step": 790
},
{
"entropy": 7.182702732086182,
"epoch": 0.7057256990679095,
"grad_norm": 1.09375,
"learning_rate": 0.00039700000000000005,
"loss": 7.0091,
"mean_token_accuracy": 0.09595384523272514,
"num_tokens": 1634188.0,
"step": 795
},
{
"entropy": 7.0714222431182865,
"epoch": 0.7101642254771416,
"grad_norm": 1.3125,
"learning_rate": 0.0003995,
"loss": 6.9157,
"mean_token_accuracy": 0.1082749105989933,
"num_tokens": 1642633.0,
"step": 800
},
{
"entropy": 7.0621692657470705,
"epoch": 0.7146027518863737,
"grad_norm": 1.15625,
"learning_rate": 0.000402,
"loss": 6.9424,
"mean_token_accuracy": 0.10712620615959167,
"num_tokens": 1654536.0,
"step": 805
},
{
"entropy": 7.148227691650391,
"epoch": 0.7190412782956058,
"grad_norm": 1.0546875,
"learning_rate": 0.0004045,
"loss": 7.0822,
"mean_token_accuracy": 0.09017667174339294,
"num_tokens": 1665083.0,
"step": 810
},
{
"entropy": 7.069796466827393,
"epoch": 0.723479804704838,
"grad_norm": 1.0234375,
"learning_rate": 0.00040699999999999997,
"loss": 7.033,
"mean_token_accuracy": 0.09541632980108261,
"num_tokens": 1675826.0,
"step": 815
},
{
"entropy": 7.110815143585205,
"epoch": 0.7279183311140701,
"grad_norm": 1.046875,
"learning_rate": 0.0004095,
"loss": 6.9946,
"mean_token_accuracy": 0.10398527979850769,
"num_tokens": 1685806.0,
"step": 820
},
{
"entropy": 7.097141170501709,
"epoch": 0.7323568575233023,
"grad_norm": 1.078125,
"learning_rate": 0.000412,
"loss": 7.0632,
"mean_token_accuracy": 0.10135304108262062,
"num_tokens": 1695984.0,
"step": 825
},
{
"entropy": 7.124357271194458,
"epoch": 0.7367953839325344,
"grad_norm": 1.1015625,
"learning_rate": 0.0004145,
"loss": 7.0575,
"mean_token_accuracy": 0.09942566752433776,
"num_tokens": 1706086.0,
"step": 830
},
{
"entropy": 7.091458511352539,
"epoch": 0.7412339103417666,
"grad_norm": 0.9609375,
"learning_rate": 0.000417,
"loss": 7.0284,
"mean_token_accuracy": 0.10059899911284446,
"num_tokens": 1718040.0,
"step": 835
},
{
"entropy": 7.131758165359497,
"epoch": 0.7456724367509987,
"grad_norm": 0.98828125,
"learning_rate": 0.0004195,
"loss": 7.0191,
"mean_token_accuracy": 0.09906580075621604,
"num_tokens": 1729009.0,
"step": 840
},
{
"entropy": 7.087246465682983,
"epoch": 0.7501109631602308,
"grad_norm": 1.1875,
"learning_rate": 0.000422,
"loss": 6.9929,
"mean_token_accuracy": 0.10902519077062607,
"num_tokens": 1738895.0,
"step": 845
},
{
"entropy": 7.113551664352417,
"epoch": 0.7545494895694629,
"grad_norm": 1.0703125,
"learning_rate": 0.0004245,
"loss": 7.0261,
"mean_token_accuracy": 0.10415812507271767,
"num_tokens": 1750225.0,
"step": 850
},
{
"entropy": 7.0047619342803955,
"epoch": 0.758988015978695,
"grad_norm": 1.140625,
"learning_rate": 0.000427,
"loss": 6.9292,
"mean_token_accuracy": 0.105811557918787,
"num_tokens": 1761224.0,
"step": 855
},
{
"entropy": 7.085004186630249,
"epoch": 0.7634265423879272,
"grad_norm": 1.0390625,
"learning_rate": 0.0004295,
"loss": 7.0169,
"mean_token_accuracy": 0.09775067865848541,
"num_tokens": 1771853.0,
"step": 860
},
{
"entropy": 7.146742153167724,
"epoch": 0.7678650687971593,
"grad_norm": 1.046875,
"learning_rate": 0.000432,
"loss": 6.9895,
"mean_token_accuracy": 0.10439399853348733,
"num_tokens": 1781186.0,
"step": 865
},
{
"entropy": 7.151022291183471,
"epoch": 0.7723035952063915,
"grad_norm": 1.109375,
"learning_rate": 0.0004345,
"loss": 6.9711,
"mean_token_accuracy": 0.09423294179141521,
"num_tokens": 1792887.0,
"step": 870
},
{
"entropy": 6.941896152496338,
"epoch": 0.7767421216156236,
"grad_norm": 1.203125,
"learning_rate": 0.000437,
"loss": 6.8708,
"mean_token_accuracy": 0.10734946057200431,
"num_tokens": 1803050.0,
"step": 875
},
{
"entropy": 6.811341190338135,
"epoch": 0.7811806480248558,
"grad_norm": 1.25,
"learning_rate": 0.0004395,
"loss": 6.9879,
"mean_token_accuracy": 0.10939516723155976,
"num_tokens": 1813287.0,
"step": 880
},
{
"entropy": 7.056670713424682,
"epoch": 0.7856191744340879,
"grad_norm": 1.4609375,
"learning_rate": 0.000442,
"loss": 6.9735,
"mean_token_accuracy": 0.1008478730916977,
"num_tokens": 1824425.0,
"step": 885
},
{
"entropy": 6.97848916053772,
"epoch": 0.79005770084332,
"grad_norm": 1.125,
"learning_rate": 0.0004445,
"loss": 6.8898,
"mean_token_accuracy": 0.11324303895235062,
"num_tokens": 1833968.0,
"step": 890
},
{
"entropy": 6.980572080612182,
"epoch": 0.7944962272525522,
"grad_norm": 1.0703125,
"learning_rate": 0.000447,
"loss": 7.0128,
"mean_token_accuracy": 0.10274540036916732,
"num_tokens": 1844097.0,
"step": 895
},
{
"entropy": 7.055815601348877,
"epoch": 0.7989347536617842,
"grad_norm": 1.0625,
"learning_rate": 0.00044950000000000003,
"loss": 6.934,
"mean_token_accuracy": 0.10776300206780434,
"num_tokens": 1854395.0,
"step": 900
},
{
"entropy": 6.931429195404053,
"epoch": 0.8033732800710164,
"grad_norm": 1.1484375,
"learning_rate": 0.00045200000000000004,
"loss": 6.949,
"mean_token_accuracy": 0.10048572197556496,
"num_tokens": 1864531.0,
"step": 905
},
{
"entropy": 6.998499774932862,
"epoch": 0.8078118064802485,
"grad_norm": 1.0703125,
"learning_rate": 0.00045450000000000004,
"loss": 6.8224,
"mean_token_accuracy": 0.11029603257775307,
"num_tokens": 1875071.0,
"step": 910
},
{
"entropy": 6.971027994155884,
"epoch": 0.8122503328894807,
"grad_norm": 1.09375,
"learning_rate": 0.00045700000000000005,
"loss": 6.947,
"mean_token_accuracy": 0.10487593412399292,
"num_tokens": 1884633.0,
"step": 915
},
{
"entropy": 6.975761222839355,
"epoch": 0.8166888592987128,
"grad_norm": 1.171875,
"learning_rate": 0.00045950000000000006,
"loss": 6.9402,
"mean_token_accuracy": 0.10628680288791656,
"num_tokens": 1895204.0,
"step": 920
},
{
"entropy": 7.054645633697509,
"epoch": 0.821127385707945,
"grad_norm": 0.98828125,
"learning_rate": 0.000462,
"loss": 6.9658,
"mean_token_accuracy": 0.10290167108178139,
"num_tokens": 1906187.0,
"step": 925
},
{
"entropy": 7.008241748809814,
"epoch": 0.8255659121171771,
"grad_norm": 1.078125,
"learning_rate": 0.0004645,
"loss": 6.9215,
"mean_token_accuracy": 0.09948821216821671,
"num_tokens": 1915585.0,
"step": 930
},
{
"entropy": 6.954188346862793,
"epoch": 0.8300044385264093,
"grad_norm": 0.9140625,
"learning_rate": 0.000467,
"loss": 6.9624,
"mean_token_accuracy": 0.1034872155636549,
"num_tokens": 1926912.0,
"step": 935
},
{
"entropy": 6.975879383087158,
"epoch": 0.8344429649356414,
"grad_norm": 1.140625,
"learning_rate": 0.0004695,
"loss": 6.8828,
"mean_token_accuracy": 0.1049314372241497,
"num_tokens": 1936542.0,
"step": 940
},
{
"entropy": 7.032291650772095,
"epoch": 0.8388814913448736,
"grad_norm": 1.1640625,
"learning_rate": 0.000472,
"loss": 6.8869,
"mean_token_accuracy": 0.1079288512468338,
"num_tokens": 1946052.0,
"step": 945
},
{
"entropy": 6.855350923538208,
"epoch": 0.8433200177541056,
"grad_norm": 1.1171875,
"learning_rate": 0.0004745,
"loss": 6.9479,
"mean_token_accuracy": 0.10810579061508178,
"num_tokens": 1957352.0,
"step": 950
},
{
"entropy": 7.012834692001343,
"epoch": 0.8477585441633377,
"grad_norm": 1.0546875,
"learning_rate": 0.000477,
"loss": 6.9165,
"mean_token_accuracy": 0.10588640198111535,
"num_tokens": 1967538.0,
"step": 955
},
{
"entropy": 6.953670644760132,
"epoch": 0.8521970705725699,
"grad_norm": 0.9609375,
"learning_rate": 0.0004795,
"loss": 6.9437,
"mean_token_accuracy": 0.10475035384297371,
"num_tokens": 1977620.0,
"step": 960
},
{
"entropy": 7.001286792755127,
"epoch": 0.856635596981802,
"grad_norm": 0.9609375,
"learning_rate": 0.000482,
"loss": 6.8474,
"mean_token_accuracy": 0.10972543135285377,
"num_tokens": 1987534.0,
"step": 965
},
{
"entropy": 6.883567142486572,
"epoch": 0.8610741233910342,
"grad_norm": 1.046875,
"learning_rate": 0.0004845,
"loss": 6.8677,
"mean_token_accuracy": 0.11282802000641823,
"num_tokens": 1997817.0,
"step": 970
},
{
"entropy": 6.960841703414917,
"epoch": 0.8655126498002663,
"grad_norm": 1.1328125,
"learning_rate": 0.000487,
"loss": 6.8693,
"mean_token_accuracy": 0.10804260671138763,
"num_tokens": 2007529.0,
"step": 975
},
{
"entropy": 6.893871688842774,
"epoch": 0.8699511762094985,
"grad_norm": 1.0625,
"learning_rate": 0.0004895,
"loss": 6.8747,
"mean_token_accuracy": 0.1100342482328415,
"num_tokens": 2017317.0,
"step": 980
},
{
"entropy": 6.920565032958985,
"epoch": 0.8743897026187306,
"grad_norm": 1.0234375,
"learning_rate": 0.000492,
"loss": 6.8925,
"mean_token_accuracy": 0.10560473203659057,
"num_tokens": 2028427.0,
"step": 985
},
{
"entropy": 6.928885173797608,
"epoch": 0.8788282290279628,
"grad_norm": 1.078125,
"learning_rate": 0.0004945,
"loss": 6.8469,
"mean_token_accuracy": 0.111257666349411,
"num_tokens": 2038464.0,
"step": 990
},
{
"entropy": 6.895605516433716,
"epoch": 0.8832667554371949,
"grad_norm": 1.03125,
"learning_rate": 0.000497,
"loss": 6.9248,
"mean_token_accuracy": 0.10252941846847534,
"num_tokens": 2049006.0,
"step": 995
},
{
"entropy": 6.840125465393067,
"epoch": 0.8877052818464269,
"grad_norm": 1.1484375,
"learning_rate": 0.0004995,
"loss": 6.8673,
"mean_token_accuracy": 0.10938069224357605,
"num_tokens": 2060436.0,
"step": 1000
},
{
"epoch": 0.8877052818464269,
"eval_entropy": 6.823905027394057,
"eval_loss": 6.903217315673828,
"eval_mean_token_accuracy": 0.10246794701790583,
"eval_num_tokens": 2060436.0,
"eval_runtime": 2.7045,
"eval_samples_per_second": 1244.948,
"eval_steps_per_second": 155.665,
"step": 1000
},
{
"entropy": 6.8510839462280275,
"epoch": 0.8921438082556591,
"grad_norm": 0.9375,
"learning_rate": 0.0004999998312369076,
"loss": 6.7705,
"mean_token_accuracy": 0.1085792139172554,
"num_tokens": 2070906.0,
"step": 1005
},
{
"entropy": 6.848130416870117,
"epoch": 0.8965823346648912,
"grad_norm": 1.015625,
"learning_rate": 0.0004999991456372788,
"loss": 6.8232,
"mean_token_accuracy": 0.10221576392650604,
"num_tokens": 2080563.0,
"step": 1010
},
{
"entropy": 6.826877164840698,
"epoch": 0.9010208610741234,
"grad_norm": 1.078125,
"learning_rate": 0.000499997932655026,
"loss": 6.7509,
"mean_token_accuracy": 0.11835153996944428,
"num_tokens": 2089785.0,
"step": 1015
},
{
"entropy": 6.89136643409729,
"epoch": 0.9054593874833555,
"grad_norm": 1.0625,
"learning_rate": 0.0004999961922929925,
"loss": 6.798,
"mean_token_accuracy": 0.11268565952777862,
"num_tokens": 2099609.0,
"step": 1020
},
{
"entropy": 6.894064235687256,
"epoch": 0.9098979138925877,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999939245552573,
"loss": 6.8422,
"mean_token_accuracy": 0.11023318842053413,
"num_tokens": 2110043.0,
"step": 1025
},
{
"entropy": 6.8520002365112305,
"epoch": 0.9143364403018198,
"grad_norm": 1.03125,
"learning_rate": 0.000499991129447136,
"loss": 6.8665,
"mean_token_accuracy": 0.1076730340719223,
"num_tokens": 2119748.0,
"step": 1030
},
{
"entropy": 6.8474874019622805,
"epoch": 0.918774966711052,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999878069751803,
"loss": 6.8907,
"mean_token_accuracy": 0.10536454170942307,
"num_tokens": 2130347.0,
"step": 1035
},
{
"entropy": 6.900251626968384,
"epoch": 0.9232134931202841,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999839571471776,
"loss": 6.7778,
"mean_token_accuracy": 0.1090541049838066,
"num_tokens": 2140499.0,
"step": 1040
},
{
"entropy": 6.788918542861938,
"epoch": 0.9276520195295161,
"grad_norm": 1.125,
"learning_rate": 0.0004999795799721517,
"loss": 6.7795,
"mean_token_accuracy": 0.10508258789777755,
"num_tokens": 2151143.0,
"step": 1045
},
{
"entropy": 6.702548313140869,
"epoch": 0.9320905459387483,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999746754603624,
"loss": 6.8099,
"mean_token_accuracy": 0.1090174950659275,
"num_tokens": 2161651.0,
"step": 1050
},
{
"entropy": 6.934295988082885,
"epoch": 0.9365290723479804,
"grad_norm": 1.078125,
"learning_rate": 0.0004999692436233055,
"loss": 6.8146,
"mean_token_accuracy": 0.1094007097184658,
"num_tokens": 2172152.0,
"step": 1055
},
{
"entropy": 6.8816564083099365,
"epoch": 0.9409675987572126,
"grad_norm": 1.140625,
"learning_rate": 0.000499963284473713,
"loss": 6.8335,
"mean_token_accuracy": 0.1026708424091339,
"num_tokens": 2182912.0,
"step": 1060
},
{
"entropy": 6.725460863113403,
"epoch": 0.9454061251664447,
"grad_norm": 1.03125,
"learning_rate": 0.0004999567980255526,
"loss": 6.8253,
"mean_token_accuracy": 0.10950745418667793,
"num_tokens": 2193573.0,
"step": 1065
},
{
"entropy": 6.998191976547242,
"epoch": 0.9498446515756769,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999497842940282,
"loss": 6.8627,
"mean_token_accuracy": 0.1091019332408905,
"num_tokens": 2204157.0,
"step": 1070
},
{
"entropy": 6.804390239715576,
"epoch": 0.954283177984909,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999422432955794,
"loss": 6.8426,
"mean_token_accuracy": 0.11238477602601052,
"num_tokens": 2214433.0,
"step": 1075
},
{
"entropy": 6.7941382884979244,
"epoch": 0.9587217043941412,
"grad_norm": 0.859375,
"learning_rate": 0.0004999341750478818,
"loss": 6.7722,
"mean_token_accuracy": 0.1097018837928772,
"num_tokens": 2224913.0,
"step": 1080
},
{
"entropy": 6.810701084136963,
"epoch": 0.9631602308033733,
"grad_norm": 1.09375,
"learning_rate": 0.000499925579569847,
"loss": 6.7335,
"mean_token_accuracy": 0.12259945124387742,
"num_tokens": 2234871.0,
"step": 1085
},
{
"entropy": 6.818542575836181,
"epoch": 0.9675987572126055,
"grad_norm": 1.2734375,
"learning_rate": 0.0004999164568816219,
"loss": 6.7889,
"mean_token_accuracy": 0.10602138787508011,
"num_tokens": 2244462.0,
"step": 1090
},
{
"entropy": 6.706165170669555,
"epoch": 0.9720372836218375,
"grad_norm": 1.140625,
"learning_rate": 0.0004999068070045897,
"loss": 6.7827,
"mean_token_accuracy": 0.10748272910714149,
"num_tokens": 2256145.0,
"step": 1095
},
{
"entropy": 6.83993878364563,
"epoch": 0.9764758100310696,
"grad_norm": 1.0859375,
"learning_rate": 0.000499896629961369,
"loss": 6.7837,
"mean_token_accuracy": 0.11425440460443496,
"num_tokens": 2265913.0,
"step": 1100
},
{
"entropy": 6.725751304626465,
"epoch": 0.9809143364403018,
"grad_norm": 1.0546875,
"learning_rate": 0.000499885925775814,
"loss": 6.7316,
"mean_token_accuracy": 0.11490511074662209,
"num_tokens": 2274874.0,
"step": 1105
},
{
"entropy": 6.830372858047485,
"epoch": 0.9853528628495339,
"grad_norm": 1.046875,
"learning_rate": 0.0004998746944730148,
"loss": 6.7131,
"mean_token_accuracy": 0.11283201426267624,
"num_tokens": 2284767.0,
"step": 1110
},
{
"entropy": 6.874453449249268,
"epoch": 0.9897913892587661,
"grad_norm": 1.0625,
"learning_rate": 0.0004998629360792965,
"loss": 6.8831,
"mean_token_accuracy": 0.10844636484980583,
"num_tokens": 2295196.0,
"step": 1115
},
{
"entropy": 6.715284633636474,
"epoch": 0.9942299156679982,
"grad_norm": 0.9296875,
"learning_rate": 0.0004998506506222202,
"loss": 6.7286,
"mean_token_accuracy": 0.11680992171168328,
"num_tokens": 2306078.0,
"step": 1120
},
{
"entropy": 6.814456415176392,
"epoch": 0.9986684420772304,
"grad_norm": 0.890625,
"learning_rate": 0.0004998378381305821,
"loss": 6.8094,
"mean_token_accuracy": 0.10992804765701295,
"num_tokens": 2317229.0,
"step": 1125
},
{
"entropy": 6.859947204589844,
"epoch": 1.0026631158455392,
"grad_norm": 0.98046875,
"learning_rate": 0.0004998244986344138,
"loss": 6.688,
"mean_token_accuracy": 0.11234754075606664,
"num_tokens": 2326312.0,
"step": 1130
},
{
"entropy": 6.762184476852417,
"epoch": 1.0071016422547714,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998106321649822,
"loss": 6.5436,
"mean_token_accuracy": 0.12012127339839936,
"num_tokens": 2335548.0,
"step": 1135
},
{
"entropy": 6.783463954925537,
"epoch": 1.0115401686640035,
"grad_norm": 1.1015625,
"learning_rate": 0.0004997962387547893,
"loss": 6.5731,
"mean_token_accuracy": 0.11604165062308311,
"num_tokens": 2346180.0,
"step": 1140
},
{
"entropy": 6.728586292266845,
"epoch": 1.0159786950732357,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997813184375723,
"loss": 6.5403,
"mean_token_accuracy": 0.11700786501169205,
"num_tokens": 2355682.0,
"step": 1145
},
{
"entropy": 6.737982702255249,
"epoch": 1.0204172214824678,
"grad_norm": 1.0703125,
"learning_rate": 0.0004997658712483034,
"loss": 6.5789,
"mean_token_accuracy": 0.11569899022579193,
"num_tokens": 2365529.0,
"step": 1150
},
{
"entropy": 6.645860004425049,
"epoch": 1.0248557478917,
"grad_norm": 1.109375,
"learning_rate": 0.0004997498972231898,
"loss": 6.4906,
"mean_token_accuracy": 0.12428833544254303,
"num_tokens": 2375527.0,
"step": 1155
},
{
"entropy": 6.723867797851563,
"epoch": 1.0292942743009321,
"grad_norm": 1.0546875,
"learning_rate": 0.0004997333963996734,
"loss": 6.6103,
"mean_token_accuracy": 0.11796300113201141,
"num_tokens": 2386425.0,
"step": 1160
},
{
"entropy": 6.686568021774292,
"epoch": 1.0337328007101643,
"grad_norm": 0.98828125,
"learning_rate": 0.0004997163688164313,
"loss": 6.6209,
"mean_token_accuracy": 0.11397269815206527,
"num_tokens": 2396897.0,
"step": 1165
},
{
"entropy": 6.736155891418457,
"epoch": 1.0381713271193964,
"grad_norm": 0.98046875,
"learning_rate": 0.0004996988145133745,
"loss": 6.6215,
"mean_token_accuracy": 0.11120860427618026,
"num_tokens": 2408671.0,
"step": 1170
},
{
"entropy": 6.68158974647522,
"epoch": 1.0426098535286286,
"grad_norm": 1.125,
"learning_rate": 0.0004996807335316496,
"loss": 6.5968,
"mean_token_accuracy": 0.11955826655030251,
"num_tokens": 2418373.0,
"step": 1175
},
{
"entropy": 6.73370852470398,
"epoch": 1.0470483799378607,
"grad_norm": 1.15625,
"learning_rate": 0.0004996621259136368,
"loss": 6.5516,
"mean_token_accuracy": 0.12124700546264648,
"num_tokens": 2429094.0,
"step": 1180
},
{
"entropy": 6.58090991973877,
"epoch": 1.0514869063470929,
"grad_norm": 1.109375,
"learning_rate": 0.0004996429917029513,
"loss": 6.5521,
"mean_token_accuracy": 0.11974199712276459,
"num_tokens": 2439522.0,
"step": 1185
},
{
"entropy": 6.689072942733764,
"epoch": 1.055925432756325,
"grad_norm": 1.109375,
"learning_rate": 0.0004996233309444424,
"loss": 6.5334,
"mean_token_accuracy": 0.12693726643919945,
"num_tokens": 2449900.0,
"step": 1190
},
{
"entropy": 6.648254156112671,
"epoch": 1.060363959165557,
"grad_norm": 0.97265625,
"learning_rate": 0.0004996031436841934,
"loss": 6.528,
"mean_token_accuracy": 0.11835195198655128,
"num_tokens": 2461187.0,
"step": 1195
},
{
"entropy": 6.613636541366577,
"epoch": 1.064802485574789,
"grad_norm": 0.98828125,
"learning_rate": 0.0004995824299695219,
"loss": 6.5522,
"mean_token_accuracy": 0.12386145591735839,
"num_tokens": 2471897.0,
"step": 1200
},
{
"entropy": 6.695000886917114,
"epoch": 1.0692410119840212,
"grad_norm": 1.015625,
"learning_rate": 0.0004995611898489796,
"loss": 6.4835,
"mean_token_accuracy": 0.13428002893924712,
"num_tokens": 2482668.0,
"step": 1205
},
{
"entropy": 6.542116737365722,
"epoch": 1.0736795383932534,
"grad_norm": 1.171875,
"learning_rate": 0.0004995394233723516,
"loss": 6.5273,
"mean_token_accuracy": 0.12380995452404023,
"num_tokens": 2492375.0,
"step": 1210
},
{
"entropy": 6.612301158905029,
"epoch": 1.0781180648024855,
"grad_norm": 0.96875,
"learning_rate": 0.0004995171305906574,
"loss": 6.5553,
"mean_token_accuracy": 0.12436272650957107,
"num_tokens": 2504176.0,
"step": 1215
},
{
"entropy": 6.712629508972168,
"epoch": 1.0825565912117177,
"grad_norm": 1.2265625,
"learning_rate": 0.0004994943115561495,
"loss": 6.5802,
"mean_token_accuracy": 0.12135286405682563,
"num_tokens": 2513437.0,
"step": 1220
},
{
"entropy": 6.71323561668396,
"epoch": 1.0869951176209498,
"grad_norm": 0.9765625,
"learning_rate": 0.0004994709663223143,
"loss": 6.5305,
"mean_token_accuracy": 0.12117772102355957,
"num_tokens": 2524907.0,
"step": 1225
},
{
"entropy": 6.586472082138061,
"epoch": 1.091433644030182,
"grad_norm": 1.1171875,
"learning_rate": 0.0004994470949438712,
"loss": 6.4818,
"mean_token_accuracy": 0.1203920915722847,
"num_tokens": 2535288.0,
"step": 1230
},
{
"entropy": 6.5804437637329105,
"epoch": 1.095872170439414,
"grad_norm": 0.9921875,
"learning_rate": 0.0004994226974767734,
"loss": 6.5353,
"mean_token_accuracy": 0.11931732892990113,
"num_tokens": 2545896.0,
"step": 1235
},
{
"entropy": 6.543254709243774,
"epoch": 1.1003106968486462,
"grad_norm": 1.0546875,
"learning_rate": 0.0004993977739782066,
"loss": 6.4584,
"mean_token_accuracy": 0.13561398088932036,
"num_tokens": 2555440.0,
"step": 1240
},
{
"entropy": 6.59882869720459,
"epoch": 1.1047492232578784,
"grad_norm": 1.0078125,
"learning_rate": 0.00049937232450659,
"loss": 6.4693,
"mean_token_accuracy": 0.12519273459911345,
"num_tokens": 2565474.0,
"step": 1245
},
{
"entropy": 6.621742391586304,
"epoch": 1.1091877496671105,
"grad_norm": 1.296875,
"learning_rate": 0.0004993463491215753,
"loss": 6.5707,
"mean_token_accuracy": 0.11752136424183846,
"num_tokens": 2576090.0,
"step": 1250
},
{
"entropy": 6.66785740852356,
"epoch": 1.1136262760763427,
"grad_norm": 1.0,
"learning_rate": 0.000499319847884047,
"loss": 6.48,
"mean_token_accuracy": 0.12498680129647255,
"num_tokens": 2585719.0,
"step": 1255
},
{
"entropy": 6.547177171707153,
"epoch": 1.1180648024855748,
"grad_norm": 1.046875,
"learning_rate": 0.0004992928208561224,
"loss": 6.4818,
"mean_token_accuracy": 0.12778932899236678,
"num_tokens": 2594797.0,
"step": 1260
},
{
"entropy": 6.544874048233032,
"epoch": 1.122503328894807,
"grad_norm": 0.9921875,
"learning_rate": 0.0004992652681011508,
"loss": 6.5028,
"mean_token_accuracy": 0.12365371584892274,
"num_tokens": 2605525.0,
"step": 1265
},
{
"entropy": 6.667212867736817,
"epoch": 1.1269418553040391,
"grad_norm": 0.9765625,
"learning_rate": 0.000499237189683714,
"loss": 6.543,
"mean_token_accuracy": 0.12363962829113007,
"num_tokens": 2616478.0,
"step": 1270
},
{
"entropy": 6.585494756698608,
"epoch": 1.1313803817132713,
"grad_norm": 1.046875,
"learning_rate": 0.0004992085856696259,
"loss": 6.5255,
"mean_token_accuracy": 0.12803056016564368,
"num_tokens": 2626290.0,
"step": 1275
},
{
"entropy": 6.660335063934326,
"epoch": 1.1358189081225034,
"grad_norm": 1.0625,
"learning_rate": 0.0004991794561259325,
"loss": 6.5861,
"mean_token_accuracy": 0.11459894254803657,
"num_tokens": 2637319.0,
"step": 1280
},
{
"entropy": 6.654719829559326,
"epoch": 1.1402574345317356,
"grad_norm": 1.0546875,
"learning_rate": 0.0004991498011209112,
"loss": 6.5036,
"mean_token_accuracy": 0.1196965254843235,
"num_tokens": 2648140.0,
"step": 1285
},
{
"entropy": 6.520665168762207,
"epoch": 1.1446959609409677,
"grad_norm": 1.078125,
"learning_rate": 0.0004991196207240714,
"loss": 6.5534,
"mean_token_accuracy": 0.12024708986282348,
"num_tokens": 2658561.0,
"step": 1290
},
{
"entropy": 6.740872001647949,
"epoch": 1.1491344873501999,
"grad_norm": 1.59375,
"learning_rate": 0.0004990889150061541,
"loss": 6.421,
"mean_token_accuracy": 0.13026004359126092,
"num_tokens": 2670233.0,
"step": 1295
},
{
"entropy": 6.636859560012818,
"epoch": 1.1535730137594318,
"grad_norm": 1.0546875,
"learning_rate": 0.0004990576840391312,
"loss": 6.4896,
"mean_token_accuracy": 0.12343377694487571,
"num_tokens": 2681047.0,
"step": 1300
},
{
"entropy": 6.514160776138306,
"epoch": 1.158011540168664,
"grad_norm": 1.15625,
"learning_rate": 0.000499025927896206,
"loss": 6.4793,
"mean_token_accuracy": 0.12569797188043594,
"num_tokens": 2691284.0,
"step": 1305
},
{
"entropy": 6.50507082939148,
"epoch": 1.162450066577896,
"grad_norm": 1.0234375,
"learning_rate": 0.0004989936466518127,
"loss": 6.4791,
"mean_token_accuracy": 0.12733488231897355,
"num_tokens": 2702105.0,
"step": 1310
},
{
"entropy": 6.660071849822998,
"epoch": 1.1668885929871282,
"grad_norm": 1.0546875,
"learning_rate": 0.0004989608403816164,
"loss": 6.4392,
"mean_token_accuracy": 0.1262727789580822,
"num_tokens": 2712003.0,
"step": 1315
},
{
"entropy": 6.480842781066895,
"epoch": 1.1713271193963604,
"grad_norm": 1.234375,
"learning_rate": 0.0004989275091625126,
"loss": 6.4644,
"mean_token_accuracy": 0.12619971707463265,
"num_tokens": 2721609.0,
"step": 1320
},
{
"entropy": 6.514829921722412,
"epoch": 1.1757656458055925,
"grad_norm": 1.0390625,
"learning_rate": 0.0004988936530726276,
"loss": 6.3574,
"mean_token_accuracy": 0.1336055465042591,
"num_tokens": 2731036.0,
"step": 1325
},
{
"entropy": 6.577421188354492,
"epoch": 1.1802041722148247,
"grad_norm": 1.0078125,
"learning_rate": 0.0004988592721913176,
"loss": 6.4856,
"mean_token_accuracy": 0.12642226815223695,
"num_tokens": 2741860.0,
"step": 1330
},
{
"entropy": 6.4255718231201175,
"epoch": 1.1846426986240568,
"grad_norm": 1.015625,
"learning_rate": 0.0004988243665991692,
"loss": 6.4757,
"mean_token_accuracy": 0.12892607748508453,
"num_tokens": 2751898.0,
"step": 1335
},
{
"entropy": 6.610957288742066,
"epoch": 1.189081225033289,
"grad_norm": 1.1171875,
"learning_rate": 0.0004987889363779985,
"loss": 6.4425,
"mean_token_accuracy": 0.13178927153348924,
"num_tokens": 2761193.0,
"step": 1340
},
{
"entropy": 6.46262493133545,
"epoch": 1.193519751442521,
"grad_norm": 0.953125,
"learning_rate": 0.0004987529816108517,
"loss": 6.4799,
"mean_token_accuracy": 0.1273398607969284,
"num_tokens": 2771693.0,
"step": 1345
},
{
"entropy": 6.6233940601348875,
"epoch": 1.1979582778517532,
"grad_norm": 1.0703125,
"learning_rate": 0.0004987165023820043,
"loss": 6.4757,
"mean_token_accuracy": 0.12488154098391532,
"num_tokens": 2780680.0,
"step": 1350
},
{
"entropy": 6.422232627868652,
"epoch": 1.2023968042609854,
"grad_norm": 1.078125,
"learning_rate": 0.0004986794987769611,
"loss": 6.4691,
"mean_token_accuracy": 0.13016403540968896,
"num_tokens": 2792049.0,
"step": 1355
},
{
"entropy": 6.61912989616394,
"epoch": 1.2068353306702175,
"grad_norm": 0.98046875,
"learning_rate": 0.000498641970882456,
"loss": 6.5094,
"mean_token_accuracy": 0.11824153885245323,
"num_tokens": 2802284.0,
"step": 1360
},
{
"entropy": 6.5044067859649655,
"epoch": 1.2112738570794497,
"grad_norm": 1.0859375,
"learning_rate": 0.0004986039187864518,
"loss": 6.4687,
"mean_token_accuracy": 0.1283252492547035,
"num_tokens": 2812791.0,
"step": 1365
},
{
"entropy": 6.563082885742188,
"epoch": 1.2157123834886818,
"grad_norm": 1.0546875,
"learning_rate": 0.0004985653425781401,
"loss": 6.5185,
"mean_token_accuracy": 0.12203285768628121,
"num_tokens": 2823216.0,
"step": 1370
},
{
"entropy": 6.505474853515625,
"epoch": 1.220150909897914,
"grad_norm": 1.0234375,
"learning_rate": 0.0004985262423479408,
"loss": 6.4274,
"mean_token_accuracy": 0.13895628824830056,
"num_tokens": 2832582.0,
"step": 1375
},
{
"entropy": 6.52580771446228,
"epoch": 1.2245894363071461,
"grad_norm": 0.93359375,
"learning_rate": 0.0004984866181875021,
"loss": 6.4579,
"mean_token_accuracy": 0.12877390310168266,
"num_tokens": 2843576.0,
"step": 1380
},
{
"entropy": 6.516999197006226,
"epoch": 1.229027962716378,
"grad_norm": 1.140625,
"learning_rate": 0.0004984464701897005,
"loss": 6.456,
"mean_token_accuracy": 0.12886594235897064,
"num_tokens": 2854028.0,
"step": 1385
},
{
"entropy": 6.550729846954345,
"epoch": 1.2334664891256102,
"grad_norm": 1.015625,
"learning_rate": 0.0004984057984486402,
"loss": 6.4491,
"mean_token_accuracy": 0.1290650874376297,
"num_tokens": 2863695.0,
"step": 1390
},
{
"entropy": 6.497787046432495,
"epoch": 1.2379050155348423,
"grad_norm": 1.046875,
"learning_rate": 0.0004983646030596527,
"loss": 6.4078,
"mean_token_accuracy": 0.12960500344634057,
"num_tokens": 2873134.0,
"step": 1395
},
{
"entropy": 6.530357122421265,
"epoch": 1.2423435419440745,
"grad_norm": 1.078125,
"learning_rate": 0.0004983228841192975,
"loss": 6.4504,
"mean_token_accuracy": 0.12851642668247223,
"num_tokens": 2883559.0,
"step": 1400
},
{
"entropy": 6.488299894332886,
"epoch": 1.2467820683533066,
"grad_norm": 1.1796875,
"learning_rate": 0.0004982806417253607,
"loss": 6.422,
"mean_token_accuracy": 0.12727490290999413,
"num_tokens": 2893541.0,
"step": 1405
},
{
"entropy": 6.5642862796783445,
"epoch": 1.2512205947625388,
"grad_norm": 1.078125,
"learning_rate": 0.0004982378759768557,
"loss": 6.459,
"mean_token_accuracy": 0.12929099127650262,
"num_tokens": 2903390.0,
"step": 1410
},
{
"entropy": 6.462419414520264,
"epoch": 1.255659121171771,
"grad_norm": 1.1015625,
"learning_rate": 0.0004981945869740225,
"loss": 6.3934,
"mean_token_accuracy": 0.13202970251441,
"num_tokens": 2913071.0,
"step": 1415
},
{
"entropy": 6.547803783416748,
"epoch": 1.260097647581003,
"grad_norm": 1.03125,
"learning_rate": 0.0004981507748183276,
"loss": 6.5538,
"mean_token_accuracy": 0.12963883131742476,
"num_tokens": 2925266.0,
"step": 1420
},
{
"entropy": 6.489030170440674,
"epoch": 1.2645361739902352,
"grad_norm": 1.0703125,
"learning_rate": 0.0004981064396124635,
"loss": 6.4396,
"mean_token_accuracy": 0.12705525755882263,
"num_tokens": 2935347.0,
"step": 1425
},
{
"entropy": 6.553302574157715,
"epoch": 1.2689747003994674,
"grad_norm": 1.1640625,
"learning_rate": 0.0004980615814603492,
"loss": 6.5228,
"mean_token_accuracy": 0.12255004495382309,
"num_tokens": 2945381.0,
"step": 1430
},
{
"entropy": 6.548076343536377,
"epoch": 1.2734132268086995,
"grad_norm": 1.0703125,
"learning_rate": 0.0004980162004671288,
"loss": 6.4853,
"mean_token_accuracy": 0.12323620095849037,
"num_tokens": 2956332.0,
"step": 1435
},
{
"entropy": 6.490498161315918,
"epoch": 1.2778517532179317,
"grad_norm": 1.0,
"learning_rate": 0.0004979702967391725,
"loss": 6.4637,
"mean_token_accuracy": 0.1297840654850006,
"num_tokens": 2966563.0,
"step": 1440
},
{
"entropy": 6.459001588821411,
"epoch": 1.2822902796271638,
"grad_norm": 1.2421875,
"learning_rate": 0.0004979238703840755,
"loss": 6.4291,
"mean_token_accuracy": 0.13188086450099945,
"num_tokens": 2976078.0,
"step": 1445
},
{
"entropy": 6.535675382614135,
"epoch": 1.286728806036396,
"grad_norm": 1.0234375,
"learning_rate": 0.0004978769215106579,
"loss": 6.51,
"mean_token_accuracy": 0.11516684889793397,
"num_tokens": 2985889.0,
"step": 1450
},
{
"entropy": 6.561489534378052,
"epoch": 1.291167332445628,
"grad_norm": 1.53125,
"learning_rate": 0.0004978294502289646,
"loss": 6.4789,
"mean_token_accuracy": 0.12259078919887542,
"num_tokens": 2996244.0,
"step": 1455
},
{
"entropy": 6.490956830978393,
"epoch": 1.2956058588548602,
"grad_norm": 1.109375,
"learning_rate": 0.0004977814566502651,
"loss": 6.4193,
"mean_token_accuracy": 0.12861331328749656,
"num_tokens": 3006212.0,
"step": 1460
},
{
"entropy": 6.499041128158569,
"epoch": 1.3000443852640924,
"grad_norm": 1.0234375,
"learning_rate": 0.0004977329408870532,
"loss": 6.409,
"mean_token_accuracy": 0.12722128033638,
"num_tokens": 3016763.0,
"step": 1465
},
{
"entropy": 6.4857086658477785,
"epoch": 1.3044829116733245,
"grad_norm": 1.0390625,
"learning_rate": 0.0004976839030530464,
"loss": 6.3783,
"mean_token_accuracy": 0.13740343004465103,
"num_tokens": 3027111.0,
"step": 1470
},
{
"entropy": 6.542345571517944,
"epoch": 1.3089214380825567,
"grad_norm": 1.0390625,
"learning_rate": 0.000497634343263186,
"loss": 6.4623,
"mean_token_accuracy": 0.12753049805760383,
"num_tokens": 3037549.0,
"step": 1475
},
{
"entropy": 6.353925800323486,
"epoch": 1.3133599644917888,
"grad_norm": 1.09375,
"learning_rate": 0.0004975842616336369,
"loss": 6.386,
"mean_token_accuracy": 0.13300835117697715,
"num_tokens": 3048033.0,
"step": 1480
},
{
"entropy": 6.501514005661011,
"epoch": 1.317798490901021,
"grad_norm": 1.03125,
"learning_rate": 0.0004975336582817869,
"loss": 6.3997,
"mean_token_accuracy": 0.13204055801033973,
"num_tokens": 3057503.0,
"step": 1485
},
{
"entropy": 6.487248039245605,
"epoch": 1.3222370173102531,
"grad_norm": 0.97265625,
"learning_rate": 0.0004974825333262469,
"loss": 6.4642,
"mean_token_accuracy": 0.12323634922504426,
"num_tokens": 3068216.0,
"step": 1490
},
{
"entropy": 6.558629322052002,
"epoch": 1.3266755437194853,
"grad_norm": 0.98046875,
"learning_rate": 0.0004974308868868501,
"loss": 6.4271,
"mean_token_accuracy": 0.13236989378929137,
"num_tokens": 3079471.0,
"step": 1495
},
{
"entropy": 6.5367296695709225,
"epoch": 1.3311140701287172,
"grad_norm": 0.91015625,
"learning_rate": 0.0004973787190846524,
"loss": 6.518,
"mean_token_accuracy": 0.12429615929722786,
"num_tokens": 3090996.0,
"step": 1500
},
{
"epoch": 1.3311140701287172,
"eval_entropy": 6.421620451639497,
"eval_loss": 6.5496826171875,
"eval_mean_token_accuracy": 0.12521972324955774,
"eval_num_tokens": 3090996.0,
"eval_runtime": 2.6959,
"eval_samples_per_second": 1248.929,
"eval_steps_per_second": 156.163,
"step": 1500
},
{
"entropy": 6.472316646575928,
"epoch": 1.3355525965379493,
"grad_norm": 1.2734375,
"learning_rate": 0.0004973260300419316,
"loss": 6.466,
"mean_token_accuracy": 0.1273823134601116,
"num_tokens": 3100445.0,
"step": 1505
},
{
"entropy": 6.405650186538696,
"epoch": 1.3399911229471815,
"grad_norm": 0.96875,
"learning_rate": 0.0004972728198821871,
"loss": 6.3772,
"mean_token_accuracy": 0.13720163628458976,
"num_tokens": 3110065.0,
"step": 1510
},
{
"entropy": 6.48620924949646,
"epoch": 1.3444296493564136,
"grad_norm": 1.0078125,
"learning_rate": 0.00049721908873014,
"loss": 6.4228,
"mean_token_accuracy": 0.12824928835034372,
"num_tokens": 3120323.0,
"step": 1515
},
{
"entropy": 6.523930549621582,
"epoch": 1.3488681757656458,
"grad_norm": 0.8828125,
"learning_rate": 0.0004971648367117323,
"loss": 6.464,
"mean_token_accuracy": 0.12202735692262649,
"num_tokens": 3131268.0,
"step": 1520
},
{
"entropy": 6.500436449050904,
"epoch": 1.353306702174878,
"grad_norm": 0.93359375,
"learning_rate": 0.0004971100639541271,
"loss": 6.3697,
"mean_token_accuracy": 0.13300676867365838,
"num_tokens": 3141529.0,
"step": 1525
},
{
"entropy": 6.385044431686401,
"epoch": 1.35774522858411,
"grad_norm": 1.015625,
"learning_rate": 0.000497054770585708,
"loss": 6.3884,
"mean_token_accuracy": 0.13427990674972534,
"num_tokens": 3151096.0,
"step": 1530
},
{
"entropy": 6.540951824188232,
"epoch": 1.3621837549933422,
"grad_norm": 1.03125,
"learning_rate": 0.0004969989567360788,
"loss": 6.3651,
"mean_token_accuracy": 0.126102414727211,
"num_tokens": 3160900.0,
"step": 1535
},
{
"entropy": 6.315720701217652,
"epoch": 1.3666222814025744,
"grad_norm": 1.1484375,
"learning_rate": 0.0004969426225360635,
"loss": 6.3444,
"mean_token_accuracy": 0.1334808275103569,
"num_tokens": 3171303.0,
"step": 1540
},
{
"entropy": 6.431712341308594,
"epoch": 1.3710608078118065,
"grad_norm": 1.609375,
"learning_rate": 0.0004968857681177056,
"loss": 6.4942,
"mean_token_accuracy": 0.12975035086274148,
"num_tokens": 3181924.0,
"step": 1545
},
{
"entropy": 6.435882043838501,
"epoch": 1.3754993342210386,
"grad_norm": 1.0234375,
"learning_rate": 0.0004968283936142679,
"loss": 6.359,
"mean_token_accuracy": 0.13290246427059174,
"num_tokens": 3192018.0,
"step": 1550
},
{
"entropy": 6.475548458099365,
"epoch": 1.3799378606302708,
"grad_norm": 0.96484375,
"learning_rate": 0.0004967704991602322,
"loss": 6.3652,
"mean_token_accuracy": 0.1294732205569744,
"num_tokens": 3203064.0,
"step": 1555
},
{
"entropy": 6.439318323135376,
"epoch": 1.384376387039503,
"grad_norm": 1.0703125,
"learning_rate": 0.0004967120848912995,
"loss": 6.3961,
"mean_token_accuracy": 0.12799521535634995,
"num_tokens": 3213651.0,
"step": 1560
},
{
"entropy": 6.372346305847168,
"epoch": 1.388814913448735,
"grad_norm": 1.0625,
"learning_rate": 0.0004966531509443884,
"loss": 6.3479,
"mean_token_accuracy": 0.13649084344506263,
"num_tokens": 3224152.0,
"step": 1565
},
{
"entropy": 6.471084785461426,
"epoch": 1.3932534398579672,
"grad_norm": 0.95703125,
"learning_rate": 0.0004965936974576363,
"loss": 6.3545,
"mean_token_accuracy": 0.13298841714859008,
"num_tokens": 3234185.0,
"step": 1570
},
{
"entropy": 6.455093669891357,
"epoch": 1.3976919662671992,
"grad_norm": 1.0078125,
"learning_rate": 0.0004965337245703981,
"loss": 6.3767,
"mean_token_accuracy": 0.12946312502026558,
"num_tokens": 3244509.0,
"step": 1575
},
{
"entropy": 6.458269500732422,
"epoch": 1.4021304926764313,
"grad_norm": 1.140625,
"learning_rate": 0.0004964732324232462,
"loss": 6.4008,
"mean_token_accuracy": 0.12682827115058898,
"num_tokens": 3255157.0,
"step": 1580
},
{
"entropy": 6.34567403793335,
"epoch": 1.4065690190856635,
"grad_norm": 1.09375,
"learning_rate": 0.00049641222115797,
"loss": 6.2956,
"mean_token_accuracy": 0.13407586440443992,
"num_tokens": 3264367.0,
"step": 1585
},
{
"entropy": 6.4444191455841064,
"epoch": 1.4110075454948956,
"grad_norm": 1.015625,
"learning_rate": 0.0004963506909175758,
"loss": 6.3853,
"mean_token_accuracy": 0.12875387147068978,
"num_tokens": 3274678.0,
"step": 1590
},
{
"entropy": 6.426648998260498,
"epoch": 1.4154460719041277,
"grad_norm": 0.95703125,
"learning_rate": 0.000496288641846286,
"loss": 6.3707,
"mean_token_accuracy": 0.1277147874236107,
"num_tokens": 3285817.0,
"step": 1595
},
{
"entropy": 6.372090244293213,
"epoch": 1.41988459831336,
"grad_norm": 1.0390625,
"learning_rate": 0.0004962260740895398,
"loss": 6.2855,
"mean_token_accuracy": 0.13827268779277802,
"num_tokens": 3296303.0,
"step": 1600
},
{
"entropy": 6.379140472412109,
"epoch": 1.424323124722592,
"grad_norm": 1.1328125,
"learning_rate": 0.0004961629877939913,
"loss": 6.3871,
"mean_token_accuracy": 0.1381452649831772,
"num_tokens": 3305686.0,
"step": 1605
},
{
"entropy": 6.410601949691772,
"epoch": 1.4287616511318242,
"grad_norm": 0.98046875,
"learning_rate": 0.000496099383107511,
"loss": 6.3337,
"mean_token_accuracy": 0.13385034054517747,
"num_tokens": 3316243.0,
"step": 1610
},
{
"entropy": 6.363243675231933,
"epoch": 1.4332001775410563,
"grad_norm": 1.0390625,
"learning_rate": 0.0004960352601791835,
"loss": 6.3509,
"mean_token_accuracy": 0.1326597101986408,
"num_tokens": 3326118.0,
"step": 1615
},
{
"entropy": 6.420337390899658,
"epoch": 1.4376387039502885,
"grad_norm": 1.03125,
"learning_rate": 0.0004959706191593087,
"loss": 6.2826,
"mean_token_accuracy": 0.139851226657629,
"num_tokens": 3336597.0,
"step": 1620
},
{
"entropy": 6.367270183563233,
"epoch": 1.4420772303595206,
"grad_norm": 1.1328125,
"learning_rate": 0.0004959054601994007,
"loss": 6.3475,
"mean_token_accuracy": 0.13378802165389062,
"num_tokens": 3346958.0,
"step": 1625
},
{
"entropy": 6.393503141403198,
"epoch": 1.4465157567687528,
"grad_norm": 1.0546875,
"learning_rate": 0.0004958397834521878,
"loss": 6.3568,
"mean_token_accuracy": 0.1363594651222229,
"num_tokens": 3357068.0,
"step": 1630
},
{
"entropy": 6.357707118988037,
"epoch": 1.450954283177985,
"grad_norm": 1.0,
"learning_rate": 0.0004957735890716115,
"loss": 6.3272,
"mean_token_accuracy": 0.1293055720627308,
"num_tokens": 3367710.0,
"step": 1635
},
{
"entropy": 6.438919878005981,
"epoch": 1.455392809587217,
"grad_norm": 1.046875,
"learning_rate": 0.0004957068772128273,
"loss": 6.3926,
"mean_token_accuracy": 0.12550436183810235,
"num_tokens": 3377146.0,
"step": 1640
},
{
"entropy": 6.4241721630096436,
"epoch": 1.4598313359964492,
"grad_norm": 1.0703125,
"learning_rate": 0.000495639648032203,
"loss": 6.2687,
"mean_token_accuracy": 0.13697705715894698,
"num_tokens": 3387494.0,
"step": 1645
},
{
"entropy": 6.404942893981934,
"epoch": 1.4642698624056814,
"grad_norm": 1.03125,
"learning_rate": 0.0004955719016873192,
"loss": 6.271,
"mean_token_accuracy": 0.1324605606496334,
"num_tokens": 3397667.0,
"step": 1650
},
{
"entropy": 6.341697072982788,
"epoch": 1.4687083888149135,
"grad_norm": 1.0390625,
"learning_rate": 0.0004955036383369688,
"loss": 6.2882,
"mean_token_accuracy": 0.13828188329935073,
"num_tokens": 3407245.0,
"step": 1655
},
{
"entropy": 6.33912615776062,
"epoch": 1.4731469152241456,
"grad_norm": 0.9765625,
"learning_rate": 0.0004954348581411564,
"loss": 6.3502,
"mean_token_accuracy": 0.13207383826375008,
"num_tokens": 3417796.0,
"step": 1660
},
{
"entropy": 6.365179395675659,
"epoch": 1.4775854416333778,
"grad_norm": 1.0625,
"learning_rate": 0.000495365561261098,
"loss": 6.3521,
"mean_token_accuracy": 0.13066228553652764,
"num_tokens": 3427665.0,
"step": 1665
},
{
"entropy": 6.460514163970947,
"epoch": 1.48202396804261,
"grad_norm": 1.0859375,
"learning_rate": 0.0004952957478592209,
"loss": 6.4161,
"mean_token_accuracy": 0.13068753182888032,
"num_tokens": 3438279.0,
"step": 1670
},
{
"entropy": 6.346782398223877,
"epoch": 1.486462494451842,
"grad_norm": 1.28125,
"learning_rate": 0.0004952254180991628,
"loss": 6.3924,
"mean_token_accuracy": 0.1330470062792301,
"num_tokens": 3448722.0,
"step": 1675
},
{
"entropy": 6.355397272109985,
"epoch": 1.4909010208610742,
"grad_norm": 1.0546875,
"learning_rate": 0.0004951545721457719,
"loss": 6.3045,
"mean_token_accuracy": 0.14068271815776826,
"num_tokens": 3459050.0,
"step": 1680
},
{
"entropy": 6.3841273307800295,
"epoch": 1.4953395472703064,
"grad_norm": 1.078125,
"learning_rate": 0.0004950832101651062,
"loss": 6.2644,
"mean_token_accuracy": 0.13605008125305176,
"num_tokens": 3468833.0,
"step": 1685
},
{
"entropy": 6.393172645568848,
"epoch": 1.4997780736795385,
"grad_norm": 1.109375,
"learning_rate": 0.0004950113323244336,
"loss": 6.3353,
"mean_token_accuracy": 0.13272473365068435,
"num_tokens": 3479119.0,
"step": 1690
},
{
"entropy": 6.422500705718994,
"epoch": 1.5042166000887707,
"grad_norm": 0.99609375,
"learning_rate": 0.0004949389387922305,
"loss": 6.3001,
"mean_token_accuracy": 0.13518199026584626,
"num_tokens": 3490339.0,
"step": 1695
},
{
"entropy": 6.375849771499634,
"epoch": 1.5086551264980028,
"grad_norm": 1.0703125,
"learning_rate": 0.0004948660297381826,
"loss": 6.2959,
"mean_token_accuracy": 0.13820037841796876,
"num_tokens": 3500645.0,
"step": 1700
},
{
"entropy": 6.326462697982788,
"epoch": 1.5130936529072347,
"grad_norm": 1.0,
"learning_rate": 0.0004947926053331836,
"loss": 6.273,
"mean_token_accuracy": 0.139491256326437,
"num_tokens": 3510393.0,
"step": 1705
},
{
"entropy": 6.408394193649292,
"epoch": 1.517532179316467,
"grad_norm": 1.03125,
"learning_rate": 0.0004947186657493354,
"loss": 6.2666,
"mean_token_accuracy": 0.14247287064790726,
"num_tokens": 3520707.0,
"step": 1710
},
{
"entropy": 6.333920478820801,
"epoch": 1.521970705725699,
"grad_norm": 0.99609375,
"learning_rate": 0.0004946442111599473,
"loss": 6.4165,
"mean_token_accuracy": 0.13150266110897063,
"num_tokens": 3532101.0,
"step": 1715
},
{
"entropy": 6.405943059921265,
"epoch": 1.5264092321349312,
"grad_norm": 1.015625,
"learning_rate": 0.0004945692417395358,
"loss": 6.2607,
"mean_token_accuracy": 0.13934548795223237,
"num_tokens": 3541270.0,
"step": 1720
},
{
"entropy": 6.301887083053589,
"epoch": 1.5308477585441633,
"grad_norm": 1.1640625,
"learning_rate": 0.000494493757663824,
"loss": 6.3411,
"mean_token_accuracy": 0.13587306886911393,
"num_tokens": 3550959.0,
"step": 1725
},
{
"entropy": 6.384119939804077,
"epoch": 1.5352862849533955,
"grad_norm": 1.0234375,
"learning_rate": 0.0004944177591097415,
"loss": 6.3751,
"mean_token_accuracy": 0.13755866140127182,
"num_tokens": 3561853.0,
"step": 1730
},
{
"entropy": 6.344173955917358,
"epoch": 1.5397248113626276,
"grad_norm": 1.0078125,
"learning_rate": 0.0004943412462554236,
"loss": 6.3123,
"mean_token_accuracy": 0.13452489599585532,
"num_tokens": 3573060.0,
"step": 1735
},
{
"entropy": 6.308044004440307,
"epoch": 1.5441633377718598,
"grad_norm": 1.1328125,
"learning_rate": 0.0004942642192802114,
"loss": 6.328,
"mean_token_accuracy": 0.1374310664832592,
"num_tokens": 3582777.0,
"step": 1740
},
{
"entropy": 6.439042711257935,
"epoch": 1.548601864181092,
"grad_norm": 1.0546875,
"learning_rate": 0.0004941866783646508,
"loss": 6.3345,
"mean_token_accuracy": 0.13529076278209687,
"num_tokens": 3592978.0,
"step": 1745
},
{
"entropy": 6.348781871795654,
"epoch": 1.553040390590324,
"grad_norm": 1.1015625,
"learning_rate": 0.0004941086236904923,
"loss": 6.3061,
"mean_token_accuracy": 0.13936796635389329,
"num_tokens": 3603355.0,
"step": 1750
},
{
"entropy": 6.436870050430298,
"epoch": 1.557478916999556,
"grad_norm": 1.0234375,
"learning_rate": 0.0004940300554406909,
"loss": 6.3498,
"mean_token_accuracy": 0.1272510677576065,
"num_tokens": 3614843.0,
"step": 1755
},
{
"entropy": 6.3685750484466555,
"epoch": 1.5619174434087881,
"grad_norm": 1.09375,
"learning_rate": 0.000493950973799405,
"loss": 6.2738,
"mean_token_accuracy": 0.14151667505502702,
"num_tokens": 3623953.0,
"step": 1760
},
{
"entropy": 6.366236734390259,
"epoch": 1.5663559698180203,
"grad_norm": 0.9609375,
"learning_rate": 0.0004938713789519967,
"loss": 6.3528,
"mean_token_accuracy": 0.13301268741488456,
"num_tokens": 3634762.0,
"step": 1765
},
{
"entropy": 6.44322018623352,
"epoch": 1.5707944962272524,
"grad_norm": 1.0234375,
"learning_rate": 0.0004937912710850309,
"loss": 6.3909,
"mean_token_accuracy": 0.12702670469880104,
"num_tokens": 3645597.0,
"step": 1770
},
{
"entropy": 6.3498796939849855,
"epoch": 1.5752330226364846,
"grad_norm": 1.1484375,
"learning_rate": 0.0004937106503862749,
"loss": 6.2962,
"mean_token_accuracy": 0.1402463473379612,
"num_tokens": 3655895.0,
"step": 1775
},
{
"entropy": 6.3070460796356205,
"epoch": 1.5796715490457167,
"grad_norm": 1.0234375,
"learning_rate": 0.0004936295170446981,
"loss": 6.2705,
"mean_token_accuracy": 0.13688953965902328,
"num_tokens": 3667181.0,
"step": 1780
},
{
"entropy": 6.274955320358276,
"epoch": 1.5841100754549489,
"grad_norm": 1.03125,
"learning_rate": 0.0004935478712504715,
"loss": 6.2313,
"mean_token_accuracy": 0.14355697929859162,
"num_tokens": 3676675.0,
"step": 1785
},
{
"entropy": 6.3787109375,
"epoch": 1.588548601864181,
"grad_norm": 0.99609375,
"learning_rate": 0.0004934657131949674,
"loss": 6.293,
"mean_token_accuracy": 0.13846610561013223,
"num_tokens": 3687354.0,
"step": 1790
},
{
"entropy": 6.278066110610962,
"epoch": 1.5929871282734132,
"grad_norm": 1.078125,
"learning_rate": 0.0004933830430707585,
"loss": 6.3331,
"mean_token_accuracy": 0.1389099143445492,
"num_tokens": 3696762.0,
"step": 1795
},
{
"entropy": 6.403505325317383,
"epoch": 1.5974256546826453,
"grad_norm": 0.96875,
"learning_rate": 0.000493299861071618,
"loss": 6.3193,
"mean_token_accuracy": 0.13765995875000953,
"num_tokens": 3706671.0,
"step": 1800
},
{
"entropy": 6.346765232086182,
"epoch": 1.6018641810918774,
"grad_norm": 1.1015625,
"learning_rate": 0.0004932161673925189,
"loss": 6.3211,
"mean_token_accuracy": 0.14222623705863952,
"num_tokens": 3716047.0,
"step": 1805
},
{
"entropy": 6.480462837219238,
"epoch": 1.6063027075011096,
"grad_norm": 0.9609375,
"learning_rate": 0.0004931319622296333,
"loss": 6.3733,
"mean_token_accuracy": 0.12890343070030214,
"num_tokens": 3728249.0,
"step": 1810
},
{
"entropy": 6.327421188354492,
"epoch": 1.6107412339103417,
"grad_norm": 0.9765625,
"learning_rate": 0.0004930472457803324,
"loss": 6.2919,
"mean_token_accuracy": 0.14020831808447837,
"num_tokens": 3739164.0,
"step": 1815
},
{
"entropy": 6.408966207504273,
"epoch": 1.6151797603195739,
"grad_norm": 1.0625,
"learning_rate": 0.0004929620182431858,
"loss": 6.303,
"mean_token_accuracy": 0.142412880808115,
"num_tokens": 3749190.0,
"step": 1820
},
{
"entropy": 6.261825037002564,
"epoch": 1.619618286728806,
"grad_norm": 1.2109375,
"learning_rate": 0.0004928762798179612,
"loss": 6.2169,
"mean_token_accuracy": 0.1475951187312603,
"num_tokens": 3760265.0,
"step": 1825
},
{
"entropy": 6.274430656433106,
"epoch": 1.6240568131380382,
"grad_norm": 1.109375,
"learning_rate": 0.0004927900307056233,
"loss": 6.2945,
"mean_token_accuracy": 0.13552614152431489,
"num_tokens": 3771068.0,
"step": 1830
},
{
"entropy": 6.3409483432769775,
"epoch": 1.6284953395472703,
"grad_norm": 1.03125,
"learning_rate": 0.0004927032711083342,
"loss": 6.297,
"mean_token_accuracy": 0.13993098884820937,
"num_tokens": 3781230.0,
"step": 1835
},
{
"entropy": 6.295605039596557,
"epoch": 1.6329338659565025,
"grad_norm": 1.0625,
"learning_rate": 0.0004926160012294526,
"loss": 6.2502,
"mean_token_accuracy": 0.14423105642199516,
"num_tokens": 3791435.0,
"step": 1840
},
{
"entropy": 6.265171527862549,
"epoch": 1.6373723923657346,
"grad_norm": 1.0859375,
"learning_rate": 0.000492528221273533,
"loss": 6.2049,
"mean_token_accuracy": 0.14195780605077743,
"num_tokens": 3801680.0,
"step": 1845
},
{
"entropy": 6.373475074768066,
"epoch": 1.6418109187749668,
"grad_norm": 1.1015625,
"learning_rate": 0.0004924399314463258,
"loss": 6.3058,
"mean_token_accuracy": 0.13744521513581276,
"num_tokens": 3812005.0,
"step": 1850
},
{
"entropy": 6.294007301330566,
"epoch": 1.646249445184199,
"grad_norm": 1.390625,
"learning_rate": 0.0004923511319547761,
"loss": 6.2355,
"mean_token_accuracy": 0.1440819539129734,
"num_tokens": 3821682.0,
"step": 1855
},
{
"entropy": 6.319647216796875,
"epoch": 1.650687971593431,
"grad_norm": 1.03125,
"learning_rate": 0.000492261823007024,
"loss": 6.2157,
"mean_token_accuracy": 0.14868459478020668,
"num_tokens": 3831725.0,
"step": 1860
},
{
"entropy": 6.311188554763794,
"epoch": 1.6551264980026632,
"grad_norm": 1.109375,
"learning_rate": 0.0004921720048124034,
"loss": 6.2569,
"mean_token_accuracy": 0.13653967306017875,
"num_tokens": 3840647.0,
"step": 1865
},
{
"entropy": 6.402250814437866,
"epoch": 1.6595650244118954,
"grad_norm": 1.0625,
"learning_rate": 0.0004920816775814422,
"loss": 6.3124,
"mean_token_accuracy": 0.1325970098376274,
"num_tokens": 3852869.0,
"step": 1870
},
{
"entropy": 6.3165970802307125,
"epoch": 1.6640035508211275,
"grad_norm": 1.0234375,
"learning_rate": 0.0004919908415258612,
"loss": 6.2912,
"mean_token_accuracy": 0.14089620634913444,
"num_tokens": 3863484.0,
"step": 1875
},
{
"entropy": 6.288156318664551,
"epoch": 1.6684420772303596,
"grad_norm": 1.046875,
"learning_rate": 0.000491899496858574,
"loss": 6.2841,
"mean_token_accuracy": 0.13467081785202026,
"num_tokens": 3874564.0,
"step": 1880
},
{
"entropy": 6.395035028457642,
"epoch": 1.6728806036395918,
"grad_norm": 1.03125,
"learning_rate": 0.0004918076437936859,
"loss": 6.3119,
"mean_token_accuracy": 0.1333139009773731,
"num_tokens": 3884315.0,
"step": 1885
},
{
"entropy": 6.327268505096436,
"epoch": 1.677319130048824,
"grad_norm": 1.015625,
"learning_rate": 0.0004917152825464947,
"loss": 6.2965,
"mean_token_accuracy": 0.13294868022203446,
"num_tokens": 3893948.0,
"step": 1890
},
{
"entropy": 6.396142435073853,
"epoch": 1.681757656458056,
"grad_norm": 0.94921875,
"learning_rate": 0.0004916224133334885,
"loss": 6.311,
"mean_token_accuracy": 0.13014644309878348,
"num_tokens": 3905099.0,
"step": 1895
},
{
"entropy": 6.286337661743164,
"epoch": 1.686196182867288,
"grad_norm": 1.0234375,
"learning_rate": 0.0004915290363723465,
"loss": 6.2342,
"mean_token_accuracy": 0.14227957800030708,
"num_tokens": 3914674.0,
"step": 1900
},
{
"entropy": 6.324175691604614,
"epoch": 1.6906347092765202,
"grad_norm": 1.03125,
"learning_rate": 0.0004914351518819379,
"loss": 6.2272,
"mean_token_accuracy": 0.14022424072027206,
"num_tokens": 3925096.0,
"step": 1905
},
{
"entropy": 6.305720806121826,
"epoch": 1.6950732356857523,
"grad_norm": 1.0625,
"learning_rate": 0.0004913407600823216,
"loss": 6.2887,
"mean_token_accuracy": 0.1422324001789093,
"num_tokens": 3935048.0,
"step": 1910
},
{
"entropy": 6.279489135742187,
"epoch": 1.6995117620949844,
"grad_norm": 1.1171875,
"learning_rate": 0.0004912458611947454,
"loss": 6.2333,
"mean_token_accuracy": 0.14147737249732018,
"num_tokens": 3944021.0,
"step": 1915
},
{
"entropy": 6.27567949295044,
"epoch": 1.7039502885042166,
"grad_norm": 1.0,
"learning_rate": 0.000491150455441646,
"loss": 6.166,
"mean_token_accuracy": 0.14739958047866822,
"num_tokens": 3953587.0,
"step": 1920
},
{
"entropy": 6.247754430770874,
"epoch": 1.7083888149134487,
"grad_norm": 1.1015625,
"learning_rate": 0.0004910545430466478,
"loss": 6.2706,
"mean_token_accuracy": 0.13362218514084817,
"num_tokens": 3963981.0,
"step": 1925
},
{
"entropy": 6.270370864868164,
"epoch": 1.7128273413226809,
"grad_norm": 1.296875,
"learning_rate": 0.0004909581242345628,
"loss": 6.2833,
"mean_token_accuracy": 0.14019264951348304,
"num_tokens": 3973720.0,
"step": 1930
},
{
"entropy": 6.295551729202271,
"epoch": 1.717265867731913,
"grad_norm": 1.0703125,
"learning_rate": 0.0004908611992313905,
"loss": 6.222,
"mean_token_accuracy": 0.14261915981769563,
"num_tokens": 3984579.0,
"step": 1935
},
{
"entropy": 6.264960384368896,
"epoch": 1.7217043941411452,
"grad_norm": 1.03125,
"learning_rate": 0.0004907637682643162,
"loss": 6.245,
"mean_token_accuracy": 0.1404101848602295,
"num_tokens": 3994609.0,
"step": 1940
},
{
"entropy": 6.302646636962891,
"epoch": 1.7261429205503773,
"grad_norm": 1.0234375,
"learning_rate": 0.0004906658315617112,
"loss": 6.2902,
"mean_token_accuracy": 0.13819315508008004,
"num_tokens": 4004969.0,
"step": 1945
},
{
"entropy": 6.248818016052246,
"epoch": 1.7305814469596092,
"grad_norm": 0.984375,
"learning_rate": 0.0004905673893531331,
"loss": 6.3268,
"mean_token_accuracy": 0.1326567329466343,
"num_tokens": 4016098.0,
"step": 1950
},
{
"entropy": 6.397868633270264,
"epoch": 1.7350199733688414,
"grad_norm": 1.046875,
"learning_rate": 0.0004904684418693231,
"loss": 6.233,
"mean_token_accuracy": 0.14564677476882934,
"num_tokens": 4025744.0,
"step": 1955
},
{
"entropy": 6.238390398025513,
"epoch": 1.7394584997780735,
"grad_norm": 1.046875,
"learning_rate": 0.0004903689893422077,
"loss": 6.2537,
"mean_token_accuracy": 0.13860218822956086,
"num_tokens": 4036532.0,
"step": 1960
},
{
"entropy": 6.4320872783660885,
"epoch": 1.7438970261873057,
"grad_norm": 1.0703125,
"learning_rate": 0.0004902690320048966,
"loss": 6.3386,
"mean_token_accuracy": 0.13317947015166282,
"num_tokens": 4047350.0,
"step": 1965
},
{
"entropy": 6.341959428787232,
"epoch": 1.7483355525965378,
"grad_norm": 1.0703125,
"learning_rate": 0.000490168570091683,
"loss": 6.3134,
"mean_token_accuracy": 0.14479754120111465,
"num_tokens": 4058223.0,
"step": 1970
},
{
"entropy": 6.26735486984253,
"epoch": 1.75277407900577,
"grad_norm": 1.0859375,
"learning_rate": 0.0004900676038380429,
"loss": 6.2377,
"mean_token_accuracy": 0.1400671385228634,
"num_tokens": 4067741.0,
"step": 1975
},
{
"entropy": 6.2349577903747555,
"epoch": 1.7572126054150021,
"grad_norm": 1.015625,
"learning_rate": 0.0004899661334806342,
"loss": 6.2507,
"mean_token_accuracy": 0.1395649529993534,
"num_tokens": 4078598.0,
"step": 1980
},
{
"entropy": 6.328679370880127,
"epoch": 1.7616511318242343,
"grad_norm": 1.0078125,
"learning_rate": 0.0004898641592572965,
"loss": 6.2545,
"mean_token_accuracy": 0.1380497135221958,
"num_tokens": 4089230.0,
"step": 1985
},
{
"entropy": 6.289399909973144,
"epoch": 1.7660896582334664,
"grad_norm": 1.0703125,
"learning_rate": 0.0004897616814070505,
"loss": 6.1316,
"mean_token_accuracy": 0.14506224393844605,
"num_tokens": 4099104.0,
"step": 1990
},
{
"entropy": 6.196705055236817,
"epoch": 1.7705281846426986,
"grad_norm": 1.0234375,
"learning_rate": 0.0004896587001700972,
"loss": 6.2359,
"mean_token_accuracy": 0.13811009451746942,
"num_tokens": 4109008.0,
"step": 1995
},
{
"entropy": 6.3165913105010985,
"epoch": 1.7749667110519307,
"grad_norm": 1.0625,
"learning_rate": 0.0004895552157878174,
"loss": 6.1727,
"mean_token_accuracy": 0.14556334167718887,
"num_tokens": 4118219.0,
"step": 2000
},
{
"epoch": 1.7749667110519307,
"eval_entropy": 6.189312974517533,
"eval_loss": 6.335569858551025,
"eval_mean_token_accuracy": 0.136928480658282,
"eval_num_tokens": 4118219.0,
"eval_runtime": 2.7093,
"eval_samples_per_second": 1242.755,
"eval_steps_per_second": 155.39,
"step": 2000
},
{
"entropy": 6.294293546676636,
"epoch": 1.7794052374611629,
"grad_norm": 1.1171875,
"learning_rate": 0.0004894512285027717,
"loss": 6.1793,
"mean_token_accuracy": 0.14657135903835297,
"num_tokens": 4127255.0,
"step": 2005
},
{
"entropy": 6.239873313903809,
"epoch": 1.783843763870395,
"grad_norm": 0.94921875,
"learning_rate": 0.0004893467385586991,
"loss": 6.1614,
"mean_token_accuracy": 0.14499758780002595,
"num_tokens": 4137222.0,
"step": 2010
},
{
"entropy": 6.136928653717041,
"epoch": 1.7882822902796272,
"grad_norm": 1.140625,
"learning_rate": 0.000489241746200517,
"loss": 6.1773,
"mean_token_accuracy": 0.14779955595731736,
"num_tokens": 4147746.0,
"step": 2015
},
{
"entropy": 6.287437057495117,
"epoch": 1.7927208166888593,
"grad_norm": 1.078125,
"learning_rate": 0.0004891362516743201,
"loss": 6.2624,
"mean_token_accuracy": 0.13894592374563217,
"num_tokens": 4157270.0,
"step": 2020
},
{
"entropy": 6.25756139755249,
"epoch": 1.7971593430980914,
"grad_norm": 0.98828125,
"learning_rate": 0.0004890302552273805,
"loss": 6.1967,
"mean_token_accuracy": 0.14151124581694602,
"num_tokens": 4167239.0,
"step": 2025
},
{
"entropy": 6.1199119091033936,
"epoch": 1.8015978695073236,
"grad_norm": 1.0390625,
"learning_rate": 0.0004889237571081465,
"loss": 6.1876,
"mean_token_accuracy": 0.14599697291851044,
"num_tokens": 4177829.0,
"step": 2030
},
{
"entropy": 6.389132165908814,
"epoch": 1.8060363959165557,
"grad_norm": 1.03125,
"learning_rate": 0.0004888167575662425,
"loss": 6.2991,
"mean_token_accuracy": 0.13579059466719628,
"num_tokens": 4189015.0,
"step": 2035
},
{
"entropy": 6.2341320514678955,
"epoch": 1.8104749223257879,
"grad_norm": 1.2421875,
"learning_rate": 0.0004887092568524682,
"loss": 6.252,
"mean_token_accuracy": 0.13997769802808763,
"num_tokens": 4198895.0,
"step": 2040
},
{
"entropy": 6.282239961624145,
"epoch": 1.81491344873502,
"grad_norm": 0.94140625,
"learning_rate": 0.0004886012552187979,
"loss": 6.2221,
"mean_token_accuracy": 0.14225052297115326,
"num_tokens": 4209845.0,
"step": 2045
},
{
"entropy": 6.251390075683593,
"epoch": 1.8193519751442522,
"grad_norm": 1.0625,
"learning_rate": 0.0004884927529183799,
"loss": 6.1844,
"mean_token_accuracy": 0.14328595399856567,
"num_tokens": 4220065.0,
"step": 2050
},
{
"entropy": 6.233511972427368,
"epoch": 1.8237905015534843,
"grad_norm": 1.1015625,
"learning_rate": 0.0004883837502055363,
"loss": 6.2135,
"mean_token_accuracy": 0.14167198091745375,
"num_tokens": 4229720.0,
"step": 2055
},
{
"entropy": 6.30111985206604,
"epoch": 1.8282290279627165,
"grad_norm": 1.0,
"learning_rate": 0.0004882742473357619,
"loss": 6.22,
"mean_token_accuracy": 0.13643964901566505,
"num_tokens": 4239585.0,
"step": 2060
},
{
"entropy": 6.267259979248047,
"epoch": 1.8326675543719486,
"grad_norm": 1.0390625,
"learning_rate": 0.00048816424456572403,
"loss": 6.2476,
"mean_token_accuracy": 0.14258809238672257,
"num_tokens": 4250294.0,
"step": 2065
},
{
"entropy": 6.305874967575074,
"epoch": 1.8371060807811808,
"grad_norm": 0.98828125,
"learning_rate": 0.0004880537421532618,
"loss": 6.1402,
"mean_token_accuracy": 0.14959779605269433,
"num_tokens": 4260089.0,
"step": 2070
},
{
"entropy": 6.234825468063354,
"epoch": 1.841544607190413,
"grad_norm": 1.0,
"learning_rate": 0.00048794274035738515,
"loss": 6.1932,
"mean_token_accuracy": 0.1468948632478714,
"num_tokens": 4270282.0,
"step": 2075
},
{
"entropy": 6.299134731292725,
"epoch": 1.845983133599645,
"grad_norm": 1.1484375,
"learning_rate": 0.0004878312394382747,
"loss": 6.2185,
"mean_token_accuracy": 0.13943059742450714,
"num_tokens": 4279308.0,
"step": 2080
},
{
"entropy": 6.163238048553467,
"epoch": 1.8504216600088772,
"grad_norm": 0.96875,
"learning_rate": 0.000487719239657281,
"loss": 6.1957,
"mean_token_accuracy": 0.14037612825632095,
"num_tokens": 4291101.0,
"step": 2085
},
{
"entropy": 6.286023044586182,
"epoch": 1.8548601864181093,
"grad_norm": 1.0625,
"learning_rate": 0.000487606741276924,
"loss": 6.1967,
"mean_token_accuracy": 0.143647962808609,
"num_tokens": 4301479.0,
"step": 2090
},
{
"entropy": 6.24072036743164,
"epoch": 1.8592987128273413,
"grad_norm": 1.1171875,
"learning_rate": 0.0004874937445608921,
"loss": 6.1618,
"mean_token_accuracy": 0.14226512238383293,
"num_tokens": 4310876.0,
"step": 2095
},
{
"entropy": 6.294512367248535,
"epoch": 1.8637372392365734,
"grad_norm": 0.98046875,
"learning_rate": 0.0004873802497740418,
"loss": 6.1967,
"mean_token_accuracy": 0.14145390689373016,
"num_tokens": 4320788.0,
"step": 2100
},
{
"entropy": 6.25504732131958,
"epoch": 1.8681757656458056,
"grad_norm": 1.0234375,
"learning_rate": 0.0004872662571823973,
"loss": 6.1915,
"mean_token_accuracy": 0.14332777559757232,
"num_tokens": 4331609.0,
"step": 2105
},
{
"entropy": 6.1963708877563475,
"epoch": 1.8726142920550377,
"grad_norm": 1.0625,
"learning_rate": 0.00048715176705314936,
"loss": 6.1427,
"mean_token_accuracy": 0.14273860454559326,
"num_tokens": 4341495.0,
"step": 2110
},
{
"entropy": 6.178388929367065,
"epoch": 1.8770528184642699,
"grad_norm": 1.234375,
"learning_rate": 0.00048703677965465506,
"loss": 6.1335,
"mean_token_accuracy": 0.15152502655982972,
"num_tokens": 4351827.0,
"step": 2115
},
{
"entropy": 6.253129768371582,
"epoch": 1.881491344873502,
"grad_norm": 0.953125,
"learning_rate": 0.00048692129525643694,
"loss": 6.2925,
"mean_token_accuracy": 0.13464196175336837,
"num_tokens": 4363291.0,
"step": 2120
},
{
"entropy": 6.251963663101196,
"epoch": 1.8859298712827341,
"grad_norm": 0.98828125,
"learning_rate": 0.00048680531412918267,
"loss": 6.1861,
"mean_token_accuracy": 0.14269427880644797,
"num_tokens": 4373458.0,
"step": 2125
},
{
"entropy": 6.263167381286621,
"epoch": 1.8903683976919663,
"grad_norm": 1.1171875,
"learning_rate": 0.0004866888365447439,
"loss": 6.1529,
"mean_token_accuracy": 0.1422121912240982,
"num_tokens": 4383562.0,
"step": 2130
},
{
"entropy": 6.234077024459839,
"epoch": 1.8948069241011984,
"grad_norm": 1.0625,
"learning_rate": 0.0004865718627761363,
"loss": 6.2679,
"mean_token_accuracy": 0.13356237038969992,
"num_tokens": 4394970.0,
"step": 2135
},
{
"entropy": 6.317501831054687,
"epoch": 1.8992454505104306,
"grad_norm": 1.0703125,
"learning_rate": 0.0004864543930975383,
"loss": 6.2377,
"mean_token_accuracy": 0.13947510719299316,
"num_tokens": 4405117.0,
"step": 2140
},
{
"entropy": 6.127161931991577,
"epoch": 1.9036839769196625,
"grad_norm": 0.97265625,
"learning_rate": 0.0004863364277842908,
"loss": 6.1427,
"mean_token_accuracy": 0.14334554746747016,
"num_tokens": 4416392.0,
"step": 2145
},
{
"entropy": 6.275495529174805,
"epoch": 1.9081225033288947,
"grad_norm": 0.921875,
"learning_rate": 0.0004862179671128965,
"loss": 6.1993,
"mean_token_accuracy": 0.13783841133117675,
"num_tokens": 4426309.0,
"step": 2150
},
{
"entropy": 6.237747573852539,
"epoch": 1.9125610297381268,
"grad_norm": 1.0703125,
"learning_rate": 0.000486099011361019,
"loss": 6.1996,
"mean_token_accuracy": 0.1414594329893589,
"num_tokens": 4437044.0,
"step": 2155
},
{
"entropy": 6.329879093170166,
"epoch": 1.916999556147359,
"grad_norm": 0.93359375,
"learning_rate": 0.00048597956080748264,
"loss": 6.2209,
"mean_token_accuracy": 0.14464983716607094,
"num_tokens": 4447391.0,
"step": 2160
},
{
"entropy": 6.203670978546143,
"epoch": 1.921438082556591,
"grad_norm": 0.98046875,
"learning_rate": 0.00048585961573227116,
"loss": 6.1001,
"mean_token_accuracy": 0.145625601708889,
"num_tokens": 4457465.0,
"step": 2165
},
{
"entropy": 6.1996794700622555,
"epoch": 1.9258766089658232,
"grad_norm": 0.984375,
"learning_rate": 0.0004857391764165277,
"loss": 6.1805,
"mean_token_accuracy": 0.14704733341932297,
"num_tokens": 4467798.0,
"step": 2170
},
{
"entropy": 6.195384168624878,
"epoch": 1.9303151353750554,
"grad_norm": 0.94140625,
"learning_rate": 0.00048561824314255383,
"loss": 6.1378,
"mean_token_accuracy": 0.15038661435246467,
"num_tokens": 4478789.0,
"step": 2175
},
{
"entropy": 6.092350435256958,
"epoch": 1.9347536617842875,
"grad_norm": 2.09375,
"learning_rate": 0.00048549681619380886,
"loss": 6.1211,
"mean_token_accuracy": 0.14591658264398574,
"num_tokens": 4490521.0,
"step": 2180
},
{
"entropy": 6.228357648849487,
"epoch": 1.9391921881935197,
"grad_norm": 1.0546875,
"learning_rate": 0.0004853748958549092,
"loss": 6.1215,
"mean_token_accuracy": 0.14524291455745697,
"num_tokens": 4499484.0,
"step": 2185
},
{
"entropy": 6.248248529434204,
"epoch": 1.9436307146027518,
"grad_norm": 1.0625,
"learning_rate": 0.0004852524824116278,
"loss": 6.1538,
"mean_token_accuracy": 0.14293037131428718,
"num_tokens": 4509329.0,
"step": 2190
},
{
"entropy": 6.160349798202515,
"epoch": 1.948069241011984,
"grad_norm": 1.078125,
"learning_rate": 0.00048512957615089354,
"loss": 6.2247,
"mean_token_accuracy": 0.14221593588590623,
"num_tokens": 4518806.0,
"step": 2195
},
{
"entropy": 6.36239857673645,
"epoch": 1.9525077674212161,
"grad_norm": 1.015625,
"learning_rate": 0.0004850061773607902,
"loss": 6.3015,
"mean_token_accuracy": 0.13219987377524375,
"num_tokens": 4530760.0,
"step": 2200
},
{
"entropy": 6.284463357925415,
"epoch": 1.9569462938304483,
"grad_norm": 1.1015625,
"learning_rate": 0.000484882286330556,
"loss": 6.2875,
"mean_token_accuracy": 0.1374896213412285,
"num_tokens": 4541754.0,
"step": 2205
},
{
"entropy": 6.271965026855469,
"epoch": 1.9613848202396804,
"grad_norm": 1.1171875,
"learning_rate": 0.0004847579033505833,
"loss": 6.1348,
"mean_token_accuracy": 0.1421991430222988,
"num_tokens": 4553124.0,
"step": 2210
},
{
"entropy": 6.1756409168243405,
"epoch": 1.9658233466489126,
"grad_norm": 1.203125,
"learning_rate": 0.0004846330287124171,
"loss": 6.0553,
"mean_token_accuracy": 0.14253825396299363,
"num_tokens": 4563558.0,
"step": 2215
},
{
"entropy": 6.236325645446778,
"epoch": 1.9702618730581447,
"grad_norm": 1.1328125,
"learning_rate": 0.00048450766270875513,
"loss": 6.2018,
"mean_token_accuracy": 0.13894723802804948,
"num_tokens": 4572584.0,
"step": 2220
},
{
"entropy": 6.235476398468018,
"epoch": 1.9747003994673769,
"grad_norm": 1.171875,
"learning_rate": 0.00048438180563344666,
"loss": 6.166,
"mean_token_accuracy": 0.14769693315029145,
"num_tokens": 4583009.0,
"step": 2225
},
{
"entropy": 6.15409779548645,
"epoch": 1.979138925876609,
"grad_norm": 1.171875,
"learning_rate": 0.00048425545778149213,
"loss": 6.0949,
"mean_token_accuracy": 0.14991173148155212,
"num_tokens": 4593073.0,
"step": 2230
},
{
"entropy": 6.135072088241577,
"epoch": 1.9835774522858411,
"grad_norm": 1.015625,
"learning_rate": 0.0004841286194490423,
"loss": 6.0433,
"mean_token_accuracy": 0.14960258230566978,
"num_tokens": 4602419.0,
"step": 2235
},
{
"entropy": 6.148426246643067,
"epoch": 1.9880159786950733,
"grad_norm": 1.25,
"learning_rate": 0.00048400129093339745,
"loss": 6.0559,
"mean_token_accuracy": 0.147773315012455,
"num_tokens": 4613023.0,
"step": 2240
},
{
"entropy": 6.228465175628662,
"epoch": 1.9924545051043054,
"grad_norm": 1.125,
"learning_rate": 0.00048387347253300703,
"loss": 6.1037,
"mean_token_accuracy": 0.14951256513595582,
"num_tokens": 4622202.0,
"step": 2245
},
{
"entropy": 6.119011068344117,
"epoch": 1.9968930315135376,
"grad_norm": 1.1328125,
"learning_rate": 0.0004837451645474685,
"loss": 6.1319,
"mean_token_accuracy": 0.1470404915511608,
"num_tokens": 4632223.0,
"step": 2250
},
{
"entropy": 6.2560236189100475,
"epoch": 2.0008877052818463,
"grad_norm": 1.0625,
"learning_rate": 0.00048361636727752716,
"loss": 6.0661,
"mean_token_accuracy": 0.14733944171004826,
"num_tokens": 4641379.0,
"step": 2255
},
{
"entropy": 6.137987041473389,
"epoch": 2.0053262316910785,
"grad_norm": 1.0546875,
"learning_rate": 0.000483487081025075,
"loss": 5.756,
"mean_token_accuracy": 0.1647419661283493,
"num_tokens": 4650474.0,
"step": 2260
},
{
"entropy": 6.123887157440185,
"epoch": 2.0097647581003106,
"grad_norm": 1.03125,
"learning_rate": 0.00048335730609315,
"loss": 5.7524,
"mean_token_accuracy": 0.16743734031915664,
"num_tokens": 4660151.0,
"step": 2265
},
{
"entropy": 6.119118976593017,
"epoch": 2.014203284509543,
"grad_norm": 1.0546875,
"learning_rate": 0.00048322704278593595,
"loss": 5.8702,
"mean_token_accuracy": 0.14718232825398445,
"num_tokens": 4669852.0,
"step": 2270
},
{
"entropy": 6.116711235046386,
"epoch": 2.018641810918775,
"grad_norm": 1.0625,
"learning_rate": 0.00048309629140876097,
"loss": 5.8726,
"mean_token_accuracy": 0.15764627158641814,
"num_tokens": 4679867.0,
"step": 2275
},
{
"entropy": 6.149226093292237,
"epoch": 2.023080337328007,
"grad_norm": 1.0,
"learning_rate": 0.0004829650522680974,
"loss": 5.7536,
"mean_token_accuracy": 0.1666225776076317,
"num_tokens": 4690866.0,
"step": 2280
},
{
"entropy": 6.088321590423584,
"epoch": 2.027518863737239,
"grad_norm": 1.109375,
"learning_rate": 0.0004828333256715609,
"loss": 5.8065,
"mean_token_accuracy": 0.15734207332134248,
"num_tokens": 4701081.0,
"step": 2285
},
{
"entropy": 6.169612789154053,
"epoch": 2.0319573901464714,
"grad_norm": 1.1328125,
"learning_rate": 0.0004827011119279096,
"loss": 5.9393,
"mean_token_accuracy": 0.1523371458053589,
"num_tokens": 4712468.0,
"step": 2290
},
{
"entropy": 6.127353048324585,
"epoch": 2.0363959165557035,
"grad_norm": 1.1171875,
"learning_rate": 0.00048256841134704335,
"loss": 5.8486,
"mean_token_accuracy": 0.15824615359306335,
"num_tokens": 4722887.0,
"step": 2295
},
{
"entropy": 6.078661012649536,
"epoch": 2.0408344429649357,
"grad_norm": 1.0234375,
"learning_rate": 0.00048243522424000333,
"loss": 5.8774,
"mean_token_accuracy": 0.14893866032361985,
"num_tokens": 4733806.0,
"step": 2300
},
{
"entropy": 6.1255724906921385,
"epoch": 2.045272969374168,
"grad_norm": 0.94921875,
"learning_rate": 0.000482301550918971,
"loss": 5.8143,
"mean_token_accuracy": 0.16233171075582503,
"num_tokens": 4744172.0,
"step": 2305
},
{
"entropy": 6.110927534103394,
"epoch": 2.0497114957834,
"grad_norm": 1.0625,
"learning_rate": 0.0004821673916972676,
"loss": 5.8643,
"mean_token_accuracy": 0.15222925841808319,
"num_tokens": 4754543.0,
"step": 2310
},
{
"entropy": 6.109183931350708,
"epoch": 2.054150022192632,
"grad_norm": 1.0859375,
"learning_rate": 0.000482032746889353,
"loss": 5.7969,
"mean_token_accuracy": 0.16298202574253082,
"num_tokens": 4765617.0,
"step": 2315
},
{
"entropy": 5.983950281143189,
"epoch": 2.0585885486018642,
"grad_norm": 1.078125,
"learning_rate": 0.00048189761681082557,
"loss": 5.796,
"mean_token_accuracy": 0.158494932949543,
"num_tokens": 4775718.0,
"step": 2320
},
{
"entropy": 6.1368935108184814,
"epoch": 2.0630270750110964,
"grad_norm": 1.078125,
"learning_rate": 0.0004817620017784209,
"loss": 5.8967,
"mean_token_accuracy": 0.14975014999508857,
"num_tokens": 4785651.0,
"step": 2325
},
{
"entropy": 6.024167013168335,
"epoch": 2.0674656014203285,
"grad_norm": 1.1484375,
"learning_rate": 0.00048162590211001143,
"loss": 5.7429,
"mean_token_accuracy": 0.16594669073820115,
"num_tokens": 4795541.0,
"step": 2330
},
{
"entropy": 6.079076719284058,
"epoch": 2.0719041278295607,
"grad_norm": 1.140625,
"learning_rate": 0.00048148931812460536,
"loss": 5.8856,
"mean_token_accuracy": 0.15231603533029556,
"num_tokens": 4804863.0,
"step": 2335
},
{
"entropy": 6.1893517017364506,
"epoch": 2.076342654238793,
"grad_norm": 1.1171875,
"learning_rate": 0.0004813522501423464,
"loss": 5.8937,
"mean_token_accuracy": 0.1559199094772339,
"num_tokens": 4814782.0,
"step": 2340
},
{
"entropy": 6.05956449508667,
"epoch": 2.080781180648025,
"grad_norm": 0.99609375,
"learning_rate": 0.0004812146984845124,
"loss": 5.8515,
"mean_token_accuracy": 0.15324196219444275,
"num_tokens": 4825847.0,
"step": 2345
},
{
"entropy": 6.04329924583435,
"epoch": 2.085219707057257,
"grad_norm": 1.1328125,
"learning_rate": 0.00048107666347351505,
"loss": 5.8137,
"mean_token_accuracy": 0.1576656773686409,
"num_tokens": 4836537.0,
"step": 2350
},
{
"entropy": 6.060811710357666,
"epoch": 2.0896582334664893,
"grad_norm": 1.1171875,
"learning_rate": 0.00048093814543289894,
"loss": 5.7875,
"mean_token_accuracy": 0.16412230134010314,
"num_tokens": 4847031.0,
"step": 2355
},
{
"entropy": 6.0803258419036865,
"epoch": 2.0940967598757214,
"grad_norm": 1.046875,
"learning_rate": 0.00048079914468734117,
"loss": 5.7767,
"mean_token_accuracy": 0.15763533413410186,
"num_tokens": 4857031.0,
"step": 2360
},
{
"entropy": 5.995853662490845,
"epoch": 2.0985352862849536,
"grad_norm": 1.1171875,
"learning_rate": 0.00048065966156264964,
"loss": 5.761,
"mean_token_accuracy": 0.16315652430057526,
"num_tokens": 4866413.0,
"step": 2365
},
{
"entropy": 5.984428453445434,
"epoch": 2.1029738126941857,
"grad_norm": 1.015625,
"learning_rate": 0.00048051969638576345,
"loss": 5.8756,
"mean_token_accuracy": 0.15949649065732957,
"num_tokens": 4878840.0,
"step": 2370
},
{
"entropy": 6.032569789886475,
"epoch": 2.107412339103418,
"grad_norm": 1.1171875,
"learning_rate": 0.00048037924948475134,
"loss": 5.8749,
"mean_token_accuracy": 0.15843928158283233,
"num_tokens": 4889182.0,
"step": 2375
},
{
"entropy": 6.064680576324463,
"epoch": 2.11185086551265,
"grad_norm": 1.078125,
"learning_rate": 0.0004802383211888114,
"loss": 5.8504,
"mean_token_accuracy": 0.15740898102521897,
"num_tokens": 4899497.0,
"step": 2380
},
{
"entropy": 6.0131433486938475,
"epoch": 2.116289391921882,
"grad_norm": 1.09375,
"learning_rate": 0.0004800969118282697,
"loss": 5.8147,
"mean_token_accuracy": 0.15467424541711808,
"num_tokens": 4910232.0,
"step": 2385
},
{
"entropy": 6.156729316711425,
"epoch": 2.120727918331114,
"grad_norm": 1.1015625,
"learning_rate": 0.0004799550217345803,
"loss": 5.8762,
"mean_token_accuracy": 0.15463934987783431,
"num_tokens": 4920986.0,
"step": 2390
},
{
"entropy": 5.9624425888061525,
"epoch": 2.125166444740346,
"grad_norm": 1.015625,
"learning_rate": 0.00047981265124032375,
"loss": 5.8132,
"mean_token_accuracy": 0.16584520637989045,
"num_tokens": 4930630.0,
"step": 2395
},
{
"entropy": 6.077665233612061,
"epoch": 2.129604971149578,
"grad_norm": 1.0546875,
"learning_rate": 0.00047966980067920686,
"loss": 5.8461,
"mean_token_accuracy": 0.1554732069373131,
"num_tokens": 4941414.0,
"step": 2400
},
{
"entropy": 6.0890580177307125,
"epoch": 2.1340434975588103,
"grad_norm": 1.1640625,
"learning_rate": 0.00047952647038606157,
"loss": 5.824,
"mean_token_accuracy": 0.15972182601690293,
"num_tokens": 4952087.0,
"step": 2405
},
{
"entropy": 5.965068292617798,
"epoch": 2.1384820239680424,
"grad_norm": 1.21875,
"learning_rate": 0.0004793826606968443,
"loss": 5.7824,
"mean_token_accuracy": 0.16058602333068847,
"num_tokens": 4962340.0,
"step": 2410
},
{
"entropy": 6.062709331512451,
"epoch": 2.1429205503772746,
"grad_norm": 0.984375,
"learning_rate": 0.000479238371948635,
"loss": 5.8172,
"mean_token_accuracy": 0.15823266208171843,
"num_tokens": 4972793.0,
"step": 2415
},
{
"entropy": 6.068630790710449,
"epoch": 2.1473590767865067,
"grad_norm": 1.0625,
"learning_rate": 0.0004790936044796369,
"loss": 5.7894,
"mean_token_accuracy": 0.15582628548145294,
"num_tokens": 4982851.0,
"step": 2420
},
{
"entropy": 6.043807077407837,
"epoch": 2.151797603195739,
"grad_norm": 1.140625,
"learning_rate": 0.00047894835862917473,
"loss": 5.8587,
"mean_token_accuracy": 0.15432205498218537,
"num_tokens": 4993367.0,
"step": 2425
},
{
"entropy": 6.0602922439575195,
"epoch": 2.156236129604971,
"grad_norm": 1.0859375,
"learning_rate": 0.00047880263473769514,
"loss": 5.8847,
"mean_token_accuracy": 0.15590363442897798,
"num_tokens": 5004678.0,
"step": 2430
},
{
"entropy": 6.016771364212036,
"epoch": 2.160674656014203,
"grad_norm": 1.15625,
"learning_rate": 0.0004786564331467648,
"loss": 5.9167,
"mean_token_accuracy": 0.15726353973150253,
"num_tokens": 5015707.0,
"step": 2435
},
{
"entropy": 6.097188186645508,
"epoch": 2.1651131824234353,
"grad_norm": 1.046875,
"learning_rate": 0.00047850975419907034,
"loss": 5.8521,
"mean_token_accuracy": 0.16086476445198059,
"num_tokens": 5025627.0,
"step": 2440
},
{
"entropy": 6.054884433746338,
"epoch": 2.1695517088326675,
"grad_norm": 0.98046875,
"learning_rate": 0.00047836259823841716,
"loss": 5.901,
"mean_token_accuracy": 0.15026813372969627,
"num_tokens": 5037109.0,
"step": 2445
},
{
"entropy": 6.021889686584473,
"epoch": 2.1739902352418996,
"grad_norm": 0.984375,
"learning_rate": 0.0004782149656097287,
"loss": 5.8724,
"mean_token_accuracy": 0.1604078121483326,
"num_tokens": 5047547.0,
"step": 2450
},
{
"entropy": 6.027349185943604,
"epoch": 2.1784287616511318,
"grad_norm": 1.25,
"learning_rate": 0.00047806685665904586,
"loss": 5.6991,
"mean_token_accuracy": 0.17207456529140472,
"num_tokens": 5057491.0,
"step": 2455
},
{
"entropy": 6.059153509140015,
"epoch": 2.182867288060364,
"grad_norm": 1.015625,
"learning_rate": 0.0004779182717335258,
"loss": 5.88,
"mean_token_accuracy": 0.15979125201702118,
"num_tokens": 5067779.0,
"step": 2460
},
{
"entropy": 5.914556980133057,
"epoch": 2.187305814469596,
"grad_norm": 1.1171875,
"learning_rate": 0.00047776921118144154,
"loss": 5.7787,
"mean_token_accuracy": 0.16236073076725005,
"num_tokens": 5079933.0,
"step": 2465
},
{
"entropy": 6.0363281726837155,
"epoch": 2.191744340878828,
"grad_norm": 1.1328125,
"learning_rate": 0.00047761967535218084,
"loss": 5.7699,
"mean_token_accuracy": 0.1603487879037857,
"num_tokens": 5090511.0,
"step": 2470
},
{
"entropy": 5.9814863204956055,
"epoch": 2.1961828672880603,
"grad_norm": 1.09375,
"learning_rate": 0.0004774696645962453,
"loss": 5.8209,
"mean_token_accuracy": 0.155949005484581,
"num_tokens": 5100374.0,
"step": 2475
},
{
"entropy": 6.025760889053345,
"epoch": 2.2006213936972925,
"grad_norm": 1.0625,
"learning_rate": 0.0004773191792652501,
"loss": 5.8747,
"mean_token_accuracy": 0.15608740150928496,
"num_tokens": 5110729.0,
"step": 2480
},
{
"entropy": 6.043809127807617,
"epoch": 2.2050599201065246,
"grad_norm": 1.0546875,
"learning_rate": 0.0004771682197119224,
"loss": 5.9689,
"mean_token_accuracy": 0.1561452865600586,
"num_tokens": 5121512.0,
"step": 2485
},
{
"entropy": 6.116773700714111,
"epoch": 2.2094984465157568,
"grad_norm": 1.1640625,
"learning_rate": 0.00047701678629010115,
"loss": 5.7927,
"mean_token_accuracy": 0.16145216375589372,
"num_tokens": 5132244.0,
"step": 2490
},
{
"entropy": 5.996910858154297,
"epoch": 2.213936972924989,
"grad_norm": 1.1953125,
"learning_rate": 0.0004768648793547359,
"loss": 5.8645,
"mean_token_accuracy": 0.15332240164279937,
"num_tokens": 5142499.0,
"step": 2495
},
{
"entropy": 6.124018716812134,
"epoch": 2.218375499334221,
"grad_norm": 1.1015625,
"learning_rate": 0.0004767124992618863,
"loss": 5.9254,
"mean_token_accuracy": 0.14778615534305573,
"num_tokens": 5154082.0,
"step": 2500
},
{
"epoch": 2.218375499334221,
"eval_entropy": 5.912582218505425,
"eval_loss": 6.2384443283081055,
"eval_mean_token_accuracy": 0.14352747247578695,
"eval_num_tokens": 5154082.0,
"eval_runtime": 2.7018,
"eval_samples_per_second": 1246.209,
"eval_steps_per_second": 155.822,
"step": 2500
},
{
"entropy": 5.979514408111572,
"epoch": 2.222814025743453,
"grad_norm": 1.1796875,
"learning_rate": 0.0004765596463687207,
"loss": 5.8599,
"mean_token_accuracy": 0.16360579580068588,
"num_tokens": 5164473.0,
"step": 2505
},
{
"entropy": 6.0302653312683105,
"epoch": 2.2272525521526854,
"grad_norm": 1.0390625,
"learning_rate": 0.00047640632103351576,
"loss": 5.823,
"mean_token_accuracy": 0.1529782608151436,
"num_tokens": 5174505.0,
"step": 2510
},
{
"entropy": 5.984198331832886,
"epoch": 2.2316910785619175,
"grad_norm": 1.1875,
"learning_rate": 0.00047625252361565586,
"loss": 5.86,
"mean_token_accuracy": 0.16072332859039307,
"num_tokens": 5183730.0,
"step": 2515
},
{
"entropy": 6.080876970291138,
"epoch": 2.2361296049711497,
"grad_norm": 1.078125,
"learning_rate": 0.00047609825447563137,
"loss": 5.8875,
"mean_token_accuracy": 0.15377844423055648,
"num_tokens": 5194589.0,
"step": 2520
},
{
"entropy": 6.031586074829102,
"epoch": 2.240568131380382,
"grad_norm": 1.2421875,
"learning_rate": 0.0004759435139750388,
"loss": 5.8224,
"mean_token_accuracy": 0.1603144511580467,
"num_tokens": 5204865.0,
"step": 2525
},
{
"entropy": 5.950521659851074,
"epoch": 2.245006657789614,
"grad_norm": 1.078125,
"learning_rate": 0.00047578830247657915,
"loss": 5.7883,
"mean_token_accuracy": 0.15542953312397004,
"num_tokens": 5214174.0,
"step": 2530
},
{
"entropy": 6.086405277252197,
"epoch": 2.249445184198846,
"grad_norm": 1.0703125,
"learning_rate": 0.00047563262034405773,
"loss": 5.8553,
"mean_token_accuracy": 0.15860657542943954,
"num_tokens": 5224776.0,
"step": 2535
},
{
"entropy": 5.879979848861694,
"epoch": 2.2538837106080782,
"grad_norm": 1.0859375,
"learning_rate": 0.00047547646794238277,
"loss": 5.774,
"mean_token_accuracy": 0.16944229304790498,
"num_tokens": 5235808.0,
"step": 2540
},
{
"entropy": 6.069366598129273,
"epoch": 2.2583222370173104,
"grad_norm": 1.03125,
"learning_rate": 0.0004753198456375647,
"loss": 5.8768,
"mean_token_accuracy": 0.15542600452899932,
"num_tokens": 5246870.0,
"step": 2545
},
{
"entropy": 5.9477842330932615,
"epoch": 2.2627607634265425,
"grad_norm": 1.1796875,
"learning_rate": 0.0004751627537967158,
"loss": 5.814,
"mean_token_accuracy": 0.15728210359811784,
"num_tokens": 5256713.0,
"step": 2550
},
{
"entropy": 6.079386186599732,
"epoch": 2.2671992898357747,
"grad_norm": 1.1796875,
"learning_rate": 0.00047500519278804835,
"loss": 5.8594,
"mean_token_accuracy": 0.15244215726852417,
"num_tokens": 5266205.0,
"step": 2555
},
{
"entropy": 5.994957637786865,
"epoch": 2.271637816245007,
"grad_norm": 1.1015625,
"learning_rate": 0.0004748471629808746,
"loss": 5.8492,
"mean_token_accuracy": 0.16054973602294922,
"num_tokens": 5275790.0,
"step": 2560
},
{
"entropy": 5.990897369384766,
"epoch": 2.276076342654239,
"grad_norm": 1.140625,
"learning_rate": 0.00047468866474560575,
"loss": 5.8324,
"mean_token_accuracy": 0.16462789922952653,
"num_tokens": 5286644.0,
"step": 2565
},
{
"entropy": 6.060874319076538,
"epoch": 2.280514869063471,
"grad_norm": 1.0859375,
"learning_rate": 0.00047452969845375074,
"loss": 5.8517,
"mean_token_accuracy": 0.15758478343486787,
"num_tokens": 5297218.0,
"step": 2570
},
{
"entropy": 5.967515182495117,
"epoch": 2.2849533954727033,
"grad_norm": 1.0625,
"learning_rate": 0.0004743702644779157,
"loss": 5.8643,
"mean_token_accuracy": 0.16127976924180984,
"num_tokens": 5306963.0,
"step": 2575
},
{
"entropy": 6.041119766235352,
"epoch": 2.2893919218819354,
"grad_norm": 1.0546875,
"learning_rate": 0.000474210363191803,
"loss": 5.8436,
"mean_token_accuracy": 0.15753196477890014,
"num_tokens": 5317831.0,
"step": 2580
},
{
"entropy": 6.07420163154602,
"epoch": 2.2938304482911676,
"grad_norm": 1.1171875,
"learning_rate": 0.0004740499949702103,
"loss": 5.9116,
"mean_token_accuracy": 0.1521080181002617,
"num_tokens": 5328441.0,
"step": 2585
},
{
"entropy": 6.023616170883178,
"epoch": 2.2982689747003997,
"grad_norm": 1.1640625,
"learning_rate": 0.0004738891601890298,
"loss": 5.8882,
"mean_token_accuracy": 0.15639281421899795,
"num_tokens": 5339196.0,
"step": 2590
},
{
"entropy": 6.031891489028931,
"epoch": 2.302707501109632,
"grad_norm": 1.140625,
"learning_rate": 0.0004737278592252473,
"loss": 5.8922,
"mean_token_accuracy": 0.15469010919332504,
"num_tokens": 5350607.0,
"step": 2595
},
{
"entropy": 6.049084806442261,
"epoch": 2.3071460275188636,
"grad_norm": 1.1875,
"learning_rate": 0.0004735660924569411,
"loss": 5.8015,
"mean_token_accuracy": 0.16298002377152443,
"num_tokens": 5359882.0,
"step": 2600
},
{
"entropy": 5.998689460754394,
"epoch": 2.3115845539280957,
"grad_norm": 1.0859375,
"learning_rate": 0.0004734038602632815,
"loss": 5.901,
"mean_token_accuracy": 0.1472710005939007,
"num_tokens": 5369895.0,
"step": 2605
},
{
"entropy": 6.047903060913086,
"epoch": 2.316023080337328,
"grad_norm": 1.0546875,
"learning_rate": 0.00047324116302452975,
"loss": 5.8089,
"mean_token_accuracy": 0.1612442836165428,
"num_tokens": 5380603.0,
"step": 2610
},
{
"entropy": 5.948516035079956,
"epoch": 2.32046160674656,
"grad_norm": 1.125,
"learning_rate": 0.0004730780011220369,
"loss": 5.824,
"mean_token_accuracy": 0.1603932797908783,
"num_tokens": 5390638.0,
"step": 2615
},
{
"entropy": 6.000922441482544,
"epoch": 2.324900133155792,
"grad_norm": 1.1875,
"learning_rate": 0.0004729143749382435,
"loss": 5.8306,
"mean_token_accuracy": 0.15756168812513352,
"num_tokens": 5401420.0,
"step": 2620
},
{
"entropy": 5.9953662872314455,
"epoch": 2.3293386595650243,
"grad_norm": 1.1171875,
"learning_rate": 0.00047275028485667793,
"loss": 5.7782,
"mean_token_accuracy": 0.16370837688446044,
"num_tokens": 5410609.0,
"step": 2625
},
{
"entropy": 6.01699743270874,
"epoch": 2.3337771859742564,
"grad_norm": 1.15625,
"learning_rate": 0.0004725857312619563,
"loss": 5.8682,
"mean_token_accuracy": 0.15251740217208862,
"num_tokens": 5420443.0,
"step": 2630
},
{
"entropy": 6.033771324157715,
"epoch": 2.3382157123834886,
"grad_norm": 1.0546875,
"learning_rate": 0.0004724207145397809,
"loss": 5.8648,
"mean_token_accuracy": 0.15294097363948822,
"num_tokens": 5431385.0,
"step": 2635
},
{
"entropy": 5.970233392715454,
"epoch": 2.3426542387927207,
"grad_norm": 1.03125,
"learning_rate": 0.0004722552350769397,
"loss": 5.8391,
"mean_token_accuracy": 0.1535698138177395,
"num_tokens": 5443030.0,
"step": 2640
},
{
"entropy": 6.052612066268921,
"epoch": 2.347092765201953,
"grad_norm": 1.0703125,
"learning_rate": 0.00047208929326130535,
"loss": 5.9079,
"mean_token_accuracy": 0.15419892519712447,
"num_tokens": 5454165.0,
"step": 2645
},
{
"entropy": 5.993892097473145,
"epoch": 2.351531291611185,
"grad_norm": 1.1484375,
"learning_rate": 0.00047192288948183394,
"loss": 5.8514,
"mean_token_accuracy": 0.1610301211476326,
"num_tokens": 5464677.0,
"step": 2650
},
{
"entropy": 6.002200412750244,
"epoch": 2.355969818020417,
"grad_norm": 1.1328125,
"learning_rate": 0.00047175602412856453,
"loss": 5.8932,
"mean_token_accuracy": 0.15303485542535783,
"num_tokens": 5474800.0,
"step": 2655
},
{
"entropy": 5.996066761016846,
"epoch": 2.3604083444296493,
"grad_norm": 1.1875,
"learning_rate": 0.00047158869759261843,
"loss": 5.8812,
"mean_token_accuracy": 0.15533178001642228,
"num_tokens": 5484560.0,
"step": 2660
},
{
"entropy": 6.029137420654297,
"epoch": 2.3648468708388815,
"grad_norm": 1.203125,
"learning_rate": 0.0004714209102661973,
"loss": 5.7492,
"mean_token_accuracy": 0.16394296288490295,
"num_tokens": 5494044.0,
"step": 2665
},
{
"entropy": 5.91089277267456,
"epoch": 2.3692853972481136,
"grad_norm": 1.109375,
"learning_rate": 0.0004712526625425832,
"loss": 5.7802,
"mean_token_accuracy": 0.16682939529418944,
"num_tokens": 5504699.0,
"step": 2670
},
{
"entropy": 5.978672981262207,
"epoch": 2.3737239236573457,
"grad_norm": 0.95703125,
"learning_rate": 0.00047108395481613736,
"loss": 5.8211,
"mean_token_accuracy": 0.15940958112478257,
"num_tokens": 5515653.0,
"step": 2675
},
{
"entropy": 5.973521709442139,
"epoch": 2.378162450066578,
"grad_norm": 1.140625,
"learning_rate": 0.00047091478748229927,
"loss": 5.8413,
"mean_token_accuracy": 0.1611622080206871,
"num_tokens": 5525598.0,
"step": 2680
},
{
"entropy": 5.935227870941162,
"epoch": 2.38260097647581,
"grad_norm": 1.40625,
"learning_rate": 0.0004707451609375854,
"loss": 5.7347,
"mean_token_accuracy": 0.16550450325012206,
"num_tokens": 5535022.0,
"step": 2685
},
{
"entropy": 5.960200691223145,
"epoch": 2.387039502885042,
"grad_norm": 1.171875,
"learning_rate": 0.0004705750755795889,
"loss": 5.8633,
"mean_token_accuracy": 0.15553324073553085,
"num_tokens": 5544766.0,
"step": 2690
},
{
"entropy": 6.048462724685669,
"epoch": 2.3914780292942743,
"grad_norm": 1.1953125,
"learning_rate": 0.00047040453180697823,
"loss": 5.8656,
"mean_token_accuracy": 0.15715541690587997,
"num_tokens": 5556475.0,
"step": 2695
},
{
"entropy": 5.987107372283935,
"epoch": 2.3959165557035065,
"grad_norm": 1.0859375,
"learning_rate": 0.0004702335300194963,
"loss": 5.8351,
"mean_token_accuracy": 0.1529506891965866,
"num_tokens": 5567679.0,
"step": 2700
},
{
"entropy": 5.9911316394805905,
"epoch": 2.4003550821127386,
"grad_norm": 1.109375,
"learning_rate": 0.0004700620706179596,
"loss": 5.8734,
"mean_token_accuracy": 0.15287387520074844,
"num_tokens": 5579154.0,
"step": 2705
},
{
"entropy": 6.002614164352417,
"epoch": 2.4047936085219708,
"grad_norm": 1.21875,
"learning_rate": 0.0004698901540042573,
"loss": 5.8182,
"mean_token_accuracy": 0.15594158917665482,
"num_tokens": 5588597.0,
"step": 2710
},
{
"entropy": 5.956090831756592,
"epoch": 2.409232134931203,
"grad_norm": 1.109375,
"learning_rate": 0.00046971778058135024,
"loss": 5.8452,
"mean_token_accuracy": 0.16208919137716293,
"num_tokens": 5598744.0,
"step": 2715
},
{
"entropy": 6.036012983322143,
"epoch": 2.413670661340435,
"grad_norm": 1.25,
"learning_rate": 0.00046954495075326986,
"loss": 5.8405,
"mean_token_accuracy": 0.1533527597784996,
"num_tokens": 5608684.0,
"step": 2720
},
{
"entropy": 6.065688228607177,
"epoch": 2.418109187749667,
"grad_norm": 1.1328125,
"learning_rate": 0.00046937166492511746,
"loss": 5.869,
"mean_token_accuracy": 0.1580584764480591,
"num_tokens": 5619073.0,
"step": 2725
},
{
"entropy": 5.885785341262817,
"epoch": 2.4225477141588994,
"grad_norm": 1.140625,
"learning_rate": 0.00046919792350306317,
"loss": 5.8433,
"mean_token_accuracy": 0.1607219859957695,
"num_tokens": 5628764.0,
"step": 2730
},
{
"entropy": 5.997347974777222,
"epoch": 2.4269862405681315,
"grad_norm": 1.0625,
"learning_rate": 0.0004690237268943451,
"loss": 5.8939,
"mean_token_accuracy": 0.1569211430847645,
"num_tokens": 5640132.0,
"step": 2735
},
{
"entropy": 6.014172315597534,
"epoch": 2.4314247669773636,
"grad_norm": 1.015625,
"learning_rate": 0.00046884907550726816,
"loss": 5.832,
"mean_token_accuracy": 0.16245327293872833,
"num_tokens": 5650104.0,
"step": 2740
},
{
"entropy": 6.030955839157104,
"epoch": 2.435863293386596,
"grad_norm": 1.1171875,
"learning_rate": 0.00046867396975120324,
"loss": 5.8838,
"mean_token_accuracy": 0.1566794067621231,
"num_tokens": 5660570.0,
"step": 2745
},
{
"entropy": 5.935262775421142,
"epoch": 2.440301819795828,
"grad_norm": 1.15625,
"learning_rate": 0.0004684984100365863,
"loss": 5.8102,
"mean_token_accuracy": 0.16272856444120407,
"num_tokens": 5670416.0,
"step": 2750
},
{
"entropy": 5.952510738372803,
"epoch": 2.44474034620506,
"grad_norm": 1.0625,
"learning_rate": 0.00046832239677491736,
"loss": 5.8026,
"mean_token_accuracy": 0.159297114610672,
"num_tokens": 5680103.0,
"step": 2755
},
{
"entropy": 5.9763203144073485,
"epoch": 2.4491788726142922,
"grad_norm": 1.0546875,
"learning_rate": 0.0004681459303787594,
"loss": 5.7618,
"mean_token_accuracy": 0.1663880541920662,
"num_tokens": 5690177.0,
"step": 2760
},
{
"entropy": 5.848566389083862,
"epoch": 2.4536173990235244,
"grad_norm": 1.0390625,
"learning_rate": 0.0004679690112617376,
"loss": 5.7924,
"mean_token_accuracy": 0.1640610784292221,
"num_tokens": 5700618.0,
"step": 2765
},
{
"entropy": 6.005400848388672,
"epoch": 2.458055925432756,
"grad_norm": 1.203125,
"learning_rate": 0.0004677916398385383,
"loss": 5.6976,
"mean_token_accuracy": 0.16924956142902375,
"num_tokens": 5709363.0,
"step": 2770
},
{
"entropy": 5.92542405128479,
"epoch": 2.4624944518419882,
"grad_norm": 1.1640625,
"learning_rate": 0.000467613816524908,
"loss": 5.7632,
"mean_token_accuracy": 0.16014119535684584,
"num_tokens": 5718337.0,
"step": 2775
},
{
"entropy": 5.98035454750061,
"epoch": 2.4669329782512204,
"grad_norm": 1.0078125,
"learning_rate": 0.0004674355417376524,
"loss": 5.8899,
"mean_token_accuracy": 0.15295967012643813,
"num_tokens": 5729728.0,
"step": 2780
},
{
"entropy": 6.071887493133545,
"epoch": 2.4713715046604525,
"grad_norm": 1.09375,
"learning_rate": 0.00046725681589463537,
"loss": 5.8657,
"mean_token_accuracy": 0.156499744951725,
"num_tokens": 5739417.0,
"step": 2785
},
{
"entropy": 5.863467073440551,
"epoch": 2.4758100310696847,
"grad_norm": 1.109375,
"learning_rate": 0.00046707763941477817,
"loss": 5.752,
"mean_token_accuracy": 0.16586533784866334,
"num_tokens": 5749262.0,
"step": 2790
},
{
"entropy": 5.958102178573609,
"epoch": 2.480248557478917,
"grad_norm": 1.09375,
"learning_rate": 0.0004668980127180582,
"loss": 5.7598,
"mean_token_accuracy": 0.16487552374601364,
"num_tokens": 5758631.0,
"step": 2795
},
{
"entropy": 6.010591220855713,
"epoch": 2.484687083888149,
"grad_norm": 1.140625,
"learning_rate": 0.0004667179362255081,
"loss": 5.8768,
"mean_token_accuracy": 0.15696858763694763,
"num_tokens": 5768216.0,
"step": 2800
},
{
"entropy": 5.944836568832398,
"epoch": 2.489125610297381,
"grad_norm": 1.0703125,
"learning_rate": 0.0004665374103592149,
"loss": 5.8615,
"mean_token_accuracy": 0.15959977358579636,
"num_tokens": 5779497.0,
"step": 2805
},
{
"entropy": 5.9987327575683596,
"epoch": 2.4935641367066133,
"grad_norm": 1.5078125,
"learning_rate": 0.0004663564355423189,
"loss": 5.8722,
"mean_token_accuracy": 0.1550326645374298,
"num_tokens": 5790354.0,
"step": 2810
},
{
"entropy": 5.994489002227783,
"epoch": 2.4980026631158454,
"grad_norm": 1.09375,
"learning_rate": 0.0004661750121990128,
"loss": 5.8588,
"mean_token_accuracy": 0.15960408747196198,
"num_tokens": 5801444.0,
"step": 2815
},
{
"entropy": 5.916463232040405,
"epoch": 2.5024411895250775,
"grad_norm": 1.078125,
"learning_rate": 0.00046599314075454034,
"loss": 5.7893,
"mean_token_accuracy": 0.16704044193029405,
"num_tokens": 5811444.0,
"step": 2820
},
{
"entropy": 5.954709720611572,
"epoch": 2.5068797159343097,
"grad_norm": 1.140625,
"learning_rate": 0.00046581082163519585,
"loss": 5.8053,
"mean_token_accuracy": 0.16441214680671692,
"num_tokens": 5821470.0,
"step": 2825
},
{
"entropy": 6.026654958724976,
"epoch": 2.511318242343542,
"grad_norm": 1.0703125,
"learning_rate": 0.00046562805526832284,
"loss": 5.9117,
"mean_token_accuracy": 0.1474317044019699,
"num_tokens": 5831946.0,
"step": 2830
},
{
"entropy": 5.968541955947876,
"epoch": 2.515756768752774,
"grad_norm": 1.0625,
"learning_rate": 0.0004654448420823133,
"loss": 5.7507,
"mean_token_accuracy": 0.16840852946043014,
"num_tokens": 5841871.0,
"step": 2835
},
{
"entropy": 5.894213438034058,
"epoch": 2.520195295162006,
"grad_norm": 1.140625,
"learning_rate": 0.00046526118250660636,
"loss": 5.7572,
"mean_token_accuracy": 0.1637505128979683,
"num_tokens": 5852177.0,
"step": 2840
},
{
"entropy": 5.925645160675049,
"epoch": 2.5246338215712383,
"grad_norm": 1.1015625,
"learning_rate": 0.0004650770769716875,
"loss": 5.8017,
"mean_token_accuracy": 0.16091584861278535,
"num_tokens": 5861833.0,
"step": 2845
},
{
"entropy": 6.0279539108276365,
"epoch": 2.5290723479804704,
"grad_norm": 1.296875,
"learning_rate": 0.0004648925259090875,
"loss": 5.8965,
"mean_token_accuracy": 0.15736780315637589,
"num_tokens": 5872356.0,
"step": 2850
},
{
"entropy": 5.906160831451416,
"epoch": 2.5335108743897026,
"grad_norm": 1.140625,
"learning_rate": 0.00046470752975138146,
"loss": 5.766,
"mean_token_accuracy": 0.1651814177632332,
"num_tokens": 5882191.0,
"step": 2855
},
{
"entropy": 5.877144622802734,
"epoch": 2.5379494007989347,
"grad_norm": 1.3828125,
"learning_rate": 0.00046452208893218777,
"loss": 5.8292,
"mean_token_accuracy": 0.15751032680273055,
"num_tokens": 5892166.0,
"step": 2860
},
{
"entropy": 6.012645864486695,
"epoch": 2.542387927208167,
"grad_norm": 1.1640625,
"learning_rate": 0.000464336203886167,
"loss": 5.8779,
"mean_token_accuracy": 0.15454574823379516,
"num_tokens": 5902736.0,
"step": 2865
},
{
"entropy": 6.037869215011597,
"epoch": 2.546826453617399,
"grad_norm": 1.15625,
"learning_rate": 0.000464149875049021,
"loss": 5.8828,
"mean_token_accuracy": 0.1547730416059494,
"num_tokens": 5913118.0,
"step": 2870
},
{
"entropy": 5.903016805648804,
"epoch": 2.551264980026631,
"grad_norm": 1.3125,
"learning_rate": 0.00046396310285749175,
"loss": 5.7814,
"mean_token_accuracy": 0.16758745312690734,
"num_tokens": 5922748.0,
"step": 2875
},
{
"entropy": 5.863944339752197,
"epoch": 2.5557035064358633,
"grad_norm": 1.15625,
"learning_rate": 0.00046377588774936077,
"loss": 5.7403,
"mean_token_accuracy": 0.16544996947050095,
"num_tokens": 5932107.0,
"step": 2880
},
{
"entropy": 6.011892890930175,
"epoch": 2.5601420328450954,
"grad_norm": 1.1171875,
"learning_rate": 0.00046358823016344713,
"loss": 5.9142,
"mean_token_accuracy": 0.15287835970520974,
"num_tokens": 5942231.0,
"step": 2885
},
{
"entropy": 5.860071897506714,
"epoch": 2.5645805592543276,
"grad_norm": 1.2421875,
"learning_rate": 0.0004634001305396076,
"loss": 5.7025,
"mean_token_accuracy": 0.17802257537841798,
"num_tokens": 5952768.0,
"step": 2890
},
{
"entropy": 5.9685780048370365,
"epoch": 2.5690190856635597,
"grad_norm": 1.1875,
"learning_rate": 0.00046321158931873486,
"loss": 5.8106,
"mean_token_accuracy": 0.16438037455081939,
"num_tokens": 5963588.0,
"step": 2895
},
{
"entropy": 5.918586349487304,
"epoch": 2.573457612072792,
"grad_norm": 1.0703125,
"learning_rate": 0.0004630226069427566,
"loss": 5.8375,
"mean_token_accuracy": 0.15472524762153625,
"num_tokens": 5974010.0,
"step": 2900
},
{
"entropy": 5.987170839309693,
"epoch": 2.577896138482024,
"grad_norm": 1.25,
"learning_rate": 0.00046283318385463454,
"loss": 5.8025,
"mean_token_accuracy": 0.15875670611858367,
"num_tokens": 5983788.0,
"step": 2905
},
{
"entropy": 6.004740524291992,
"epoch": 2.582334664891256,
"grad_norm": 1.234375,
"learning_rate": 0.0004626433204983636,
"loss": 5.8272,
"mean_token_accuracy": 0.15208624452352523,
"num_tokens": 5993757.0,
"step": 2910
},
{
"entropy": 5.989063167572022,
"epoch": 2.5867731913004883,
"grad_norm": 1.1171875,
"learning_rate": 0.00046245301731897024,
"loss": 5.8965,
"mean_token_accuracy": 0.15564585849642754,
"num_tokens": 6004298.0,
"step": 2915
},
{
"entropy": 5.924497413635254,
"epoch": 2.5912117177097205,
"grad_norm": 1.1640625,
"learning_rate": 0.00046226227476251256,
"loss": 5.7492,
"mean_token_accuracy": 0.1677611857652664,
"num_tokens": 6014338.0,
"step": 2920
},
{
"entropy": 5.932976245880127,
"epoch": 2.5956502441189526,
"grad_norm": 1.109375,
"learning_rate": 0.0004620710932760776,
"loss": 5.7697,
"mean_token_accuracy": 0.16785314530134202,
"num_tokens": 6024162.0,
"step": 2925
},
{
"entropy": 5.958101367950439,
"epoch": 2.6000887705281848,
"grad_norm": 1.015625,
"learning_rate": 0.000461879473307782,
"loss": 5.9011,
"mean_token_accuracy": 0.15391672402620316,
"num_tokens": 6035618.0,
"step": 2930
},
{
"entropy": 6.020662879943847,
"epoch": 2.604527296937417,
"grad_norm": 1.03125,
"learning_rate": 0.0004616874153067698,
"loss": 5.8625,
"mean_token_accuracy": 0.15793592631816863,
"num_tokens": 6046958.0,
"step": 2935
},
{
"entropy": 5.986457204818725,
"epoch": 2.608965823346649,
"grad_norm": 1.1875,
"learning_rate": 0.0004614949197232118,
"loss": 5.7603,
"mean_token_accuracy": 0.15999703258275985,
"num_tokens": 6056605.0,
"step": 2940
},
{
"entropy": 6.014141416549682,
"epoch": 2.613404349755881,
"grad_norm": 1.0546875,
"learning_rate": 0.0004613019870083045,
"loss": 5.8777,
"mean_token_accuracy": 0.15496069490909575,
"num_tokens": 6066820.0,
"step": 2945
},
{
"entropy": 5.97690601348877,
"epoch": 2.6178428761651134,
"grad_norm": 1.1875,
"learning_rate": 0.00046110861761426903,
"loss": 5.8899,
"mean_token_accuracy": 0.15131543576717377,
"num_tokens": 6076894.0,
"step": 2950
},
{
"entropy": 5.9907660484313965,
"epoch": 2.6222814025743455,
"grad_norm": 1.1640625,
"learning_rate": 0.00046091481199435005,
"loss": 5.8772,
"mean_token_accuracy": 0.16070771217346191,
"num_tokens": 6087603.0,
"step": 2955
},
{
"entropy": 5.969569063186645,
"epoch": 2.6267199289835776,
"grad_norm": 1.125,
"learning_rate": 0.0004607205706028147,
"loss": 5.8553,
"mean_token_accuracy": 0.1571110799908638,
"num_tokens": 6097742.0,
"step": 2960
},
{
"entropy": 5.947077798843384,
"epoch": 2.63115845539281,
"grad_norm": 1.1171875,
"learning_rate": 0.0004605258938949514,
"loss": 5.7632,
"mean_token_accuracy": 0.16355187743902205,
"num_tokens": 6107589.0,
"step": 2965
},
{
"entropy": 5.910353899002075,
"epoch": 2.635596981802042,
"grad_norm": 1.1328125,
"learning_rate": 0.00046033078232706923,
"loss": 5.8305,
"mean_token_accuracy": 0.16115528345108032,
"num_tokens": 6117487.0,
"step": 2970
},
{
"entropy": 5.9662243843078615,
"epoch": 2.640035508211274,
"grad_norm": 1.234375,
"learning_rate": 0.00046013523635649625,
"loss": 5.7886,
"mean_token_accuracy": 0.1626285195350647,
"num_tokens": 6127326.0,
"step": 2975
},
{
"entropy": 5.9658843040466305,
"epoch": 2.6444740346205062,
"grad_norm": 1.171875,
"learning_rate": 0.00045993925644157883,
"loss": 5.8586,
"mean_token_accuracy": 0.15528757721185685,
"num_tokens": 6137314.0,
"step": 2980
},
{
"entropy": 5.949848461151123,
"epoch": 2.6489125610297384,
"grad_norm": 1.171875,
"learning_rate": 0.0004597428430416807,
"loss": 5.7777,
"mean_token_accuracy": 0.15900478214025499,
"num_tokens": 6147307.0,
"step": 2985
},
{
"entropy": 5.903331708908081,
"epoch": 2.6533510874389705,
"grad_norm": 1.203125,
"learning_rate": 0.00045954599661718126,
"loss": 5.7782,
"mean_token_accuracy": 0.15989653617143632,
"num_tokens": 6157251.0,
"step": 2990
},
{
"entropy": 5.940880393981933,
"epoch": 2.6577896138482027,
"grad_norm": 1.1640625,
"learning_rate": 0.00045934871762947504,
"loss": 5.8187,
"mean_token_accuracy": 0.1611912429332733,
"num_tokens": 6167190.0,
"step": 2995
},
{
"entropy": 5.969712638854981,
"epoch": 2.6622281402574344,
"grad_norm": 1.1171875,
"learning_rate": 0.00045915100654097076,
"loss": 5.9253,
"mean_token_accuracy": 0.14869051277637482,
"num_tokens": 6177276.0,
"step": 3000
},
{
"epoch": 2.6622281402574344,
"eval_entropy": 5.890340174178896,
"eval_loss": 6.156768798828125,
"eval_mean_token_accuracy": 0.1474443507201598,
"eval_num_tokens": 6177276.0,
"eval_runtime": 2.8874,
"eval_samples_per_second": 1166.085,
"eval_steps_per_second": 145.804,
"step": 3000
},
{
"entropy": 5.963724184036255,
"epoch": 2.6666666666666665,
"grad_norm": 1.1640625,
"learning_rate": 0.00045895286381508944,
"loss": 5.7761,
"mean_token_accuracy": 0.16845725029706954,
"num_tokens": 6187477.0,
"step": 3005
},
{
"entropy": 5.930504608154297,
"epoch": 2.6711051930758987,
"grad_norm": 1.2421875,
"learning_rate": 0.0004587542899162642,
"loss": 5.8067,
"mean_token_accuracy": 0.16042507588863372,
"num_tokens": 6196961.0,
"step": 3010
},
{
"entropy": 5.972206020355225,
"epoch": 2.675543719485131,
"grad_norm": 1.265625,
"learning_rate": 0.00045855528530993874,
"loss": 5.8621,
"mean_token_accuracy": 0.15465489625930787,
"num_tokens": 6206267.0,
"step": 3015
},
{
"entropy": 5.989437532424927,
"epoch": 2.679982245894363,
"grad_norm": 1.1796875,
"learning_rate": 0.0004583558504625661,
"loss": 5.8806,
"mean_token_accuracy": 0.1598665952682495,
"num_tokens": 6216960.0,
"step": 3020
},
{
"entropy": 5.972441625595093,
"epoch": 2.684420772303595,
"grad_norm": 1.09375,
"learning_rate": 0.00045815598584160824,
"loss": 5.8508,
"mean_token_accuracy": 0.15688182711601256,
"num_tokens": 6227843.0,
"step": 3025
},
{
"entropy": 5.931846618652344,
"epoch": 2.6888592987128273,
"grad_norm": 1.2578125,
"learning_rate": 0.00045795569191553384,
"loss": 5.7869,
"mean_token_accuracy": 0.1634823426604271,
"num_tokens": 6236712.0,
"step": 3030
},
{
"entropy": 6.0422979354858395,
"epoch": 2.6932978251220594,
"grad_norm": 1.078125,
"learning_rate": 0.0004577549691538183,
"loss": 5.867,
"mean_token_accuracy": 0.15649005323648452,
"num_tokens": 6248021.0,
"step": 3035
},
{
"entropy": 6.038855028152466,
"epoch": 2.6977363515312915,
"grad_norm": 1.2265625,
"learning_rate": 0.00045755381802694206,
"loss": 5.9027,
"mean_token_accuracy": 0.15194420740008355,
"num_tokens": 6259582.0,
"step": 3040
},
{
"entropy": 5.9294596195220945,
"epoch": 2.7021748779405237,
"grad_norm": 1.2109375,
"learning_rate": 0.00045735223900638967,
"loss": 5.8207,
"mean_token_accuracy": 0.15803860276937484,
"num_tokens": 6269835.0,
"step": 3045
},
{
"entropy": 5.9558673858642575,
"epoch": 2.706613404349756,
"grad_norm": 1.21875,
"learning_rate": 0.00045715023256464855,
"loss": 5.746,
"mean_token_accuracy": 0.16712094992399215,
"num_tokens": 6279486.0,
"step": 3050
},
{
"entropy": 5.922696256637574,
"epoch": 2.711051930758988,
"grad_norm": 1.0234375,
"learning_rate": 0.00045694779917520797,
"loss": 5.817,
"mean_token_accuracy": 0.16085006594657897,
"num_tokens": 6290273.0,
"step": 3055
},
{
"entropy": 5.900194597244263,
"epoch": 2.71549045716822,
"grad_norm": 1.2265625,
"learning_rate": 0.000456744939312558,
"loss": 5.6937,
"mean_token_accuracy": 0.17415937334299086,
"num_tokens": 6299543.0,
"step": 3060
},
{
"entropy": 5.909957361221314,
"epoch": 2.7199289835774523,
"grad_norm": 1.0703125,
"learning_rate": 0.0004565416534521883,
"loss": 5.7641,
"mean_token_accuracy": 0.1630728706717491,
"num_tokens": 6309813.0,
"step": 3065
},
{
"entropy": 5.874665069580078,
"epoch": 2.7243675099866844,
"grad_norm": 1.15625,
"learning_rate": 0.000456337942070587,
"loss": 5.7821,
"mean_token_accuracy": 0.1703098714351654,
"num_tokens": 6319961.0,
"step": 3070
},
{
"entropy": 5.964541339874268,
"epoch": 2.7288060363959166,
"grad_norm": 1.09375,
"learning_rate": 0.0004561338056452396,
"loss": 5.737,
"mean_token_accuracy": 0.16806395202875138,
"num_tokens": 6329585.0,
"step": 3075
},
{
"entropy": 5.92868595123291,
"epoch": 2.7332445628051487,
"grad_norm": 1.1484375,
"learning_rate": 0.0004559292446546281,
"loss": 5.7987,
"mean_token_accuracy": 0.16131089478731156,
"num_tokens": 6339527.0,
"step": 3080
},
{
"entropy": 5.970851278305053,
"epoch": 2.737683089214381,
"grad_norm": 1.078125,
"learning_rate": 0.0004557242595782293,
"loss": 5.7985,
"mean_token_accuracy": 0.15973087251186371,
"num_tokens": 6350079.0,
"step": 3085
},
{
"entropy": 5.91132082939148,
"epoch": 2.742121615623613,
"grad_norm": 1.125,
"learning_rate": 0.0004555188508965144,
"loss": 5.7925,
"mean_token_accuracy": 0.16054237484931946,
"num_tokens": 6359999.0,
"step": 3090
},
{
"entropy": 5.912930011749268,
"epoch": 2.746560142032845,
"grad_norm": 1.0703125,
"learning_rate": 0.00045531301909094724,
"loss": 5.7963,
"mean_token_accuracy": 0.1637853652238846,
"num_tokens": 6370643.0,
"step": 3095
},
{
"entropy": 5.9343184471130375,
"epoch": 2.7509986684420773,
"grad_norm": 1.09375,
"learning_rate": 0.0004551067646439834,
"loss": 5.8199,
"mean_token_accuracy": 0.15766822546720505,
"num_tokens": 6381132.0,
"step": 3100
},
{
"entropy": 5.960313940048218,
"epoch": 2.7554371948513094,
"grad_norm": 1.15625,
"learning_rate": 0.00045490008803906936,
"loss": 5.7392,
"mean_token_accuracy": 0.16581773906946182,
"num_tokens": 6391143.0,
"step": 3105
},
{
"entropy": 5.841590690612793,
"epoch": 2.7598757212605416,
"grad_norm": 1.0625,
"learning_rate": 0.0004546929897606409,
"loss": 5.7849,
"mean_token_accuracy": 0.16631501466035842,
"num_tokens": 6401079.0,
"step": 3110
},
{
"entropy": 5.993973875045777,
"epoch": 2.7643142476697737,
"grad_norm": 1.203125,
"learning_rate": 0.00045448547029412225,
"loss": 5.8225,
"mean_token_accuracy": 0.16507848501205444,
"num_tokens": 6412380.0,
"step": 3115
},
{
"entropy": 5.91737003326416,
"epoch": 2.768752774079006,
"grad_norm": 1.234375,
"learning_rate": 0.00045427753012592477,
"loss": 5.7552,
"mean_token_accuracy": 0.1646926447749138,
"num_tokens": 6423198.0,
"step": 3120
},
{
"entropy": 5.957061624526977,
"epoch": 2.773191300488238,
"grad_norm": 1.0859375,
"learning_rate": 0.00045406916974344617,
"loss": 5.8218,
"mean_token_accuracy": 0.15380569249391557,
"num_tokens": 6433850.0,
"step": 3125
},
{
"entropy": 5.903844690322876,
"epoch": 2.77762982689747,
"grad_norm": 1.109375,
"learning_rate": 0.00045386038963506883,
"loss": 5.7171,
"mean_token_accuracy": 0.16169303506612778,
"num_tokens": 6443296.0,
"step": 3130
},
{
"entropy": 5.890790748596191,
"epoch": 2.7820683533067023,
"grad_norm": 1.15625,
"learning_rate": 0.0004536511902901591,
"loss": 5.7452,
"mean_token_accuracy": 0.17047004401683807,
"num_tokens": 6452857.0,
"step": 3135
},
{
"entropy": 5.9857110500335695,
"epoch": 2.7865068797159345,
"grad_norm": 1.1875,
"learning_rate": 0.0004534415721990659,
"loss": 5.8426,
"mean_token_accuracy": 0.15422120094299316,
"num_tokens": 6463027.0,
"step": 3140
},
{
"entropy": 5.9161601066589355,
"epoch": 2.790945406125166,
"grad_norm": 1.1640625,
"learning_rate": 0.00045323153585311975,
"loss": 5.7903,
"mean_token_accuracy": 0.16016594916582108,
"num_tokens": 6473667.0,
"step": 3145
},
{
"entropy": 5.91183705329895,
"epoch": 2.7953839325343983,
"grad_norm": 1.1328125,
"learning_rate": 0.0004530210817446316,
"loss": 5.7923,
"mean_token_accuracy": 0.1590562269091606,
"num_tokens": 6484935.0,
"step": 3150
},
{
"entropy": 5.96208758354187,
"epoch": 2.7998224589436305,
"grad_norm": 1.140625,
"learning_rate": 0.0004528102103668913,
"loss": 5.824,
"mean_token_accuracy": 0.1598386511206627,
"num_tokens": 6496436.0,
"step": 3155
},
{
"entropy": 5.941922044754028,
"epoch": 2.8042609853528626,
"grad_norm": 1.0625,
"learning_rate": 0.0004525989222141671,
"loss": 5.8385,
"mean_token_accuracy": 0.16108565628528596,
"num_tokens": 6506426.0,
"step": 3160
},
{
"entropy": 5.909464502334595,
"epoch": 2.8086995117620948,
"grad_norm": 1.328125,
"learning_rate": 0.00045238721778170386,
"loss": 5.7245,
"mean_token_accuracy": 0.17027909755706788,
"num_tokens": 6516208.0,
"step": 3165
},
{
"entropy": 5.904296827316284,
"epoch": 2.813138038171327,
"grad_norm": 1.15625,
"learning_rate": 0.00045217509756572256,
"loss": 5.8064,
"mean_token_accuracy": 0.16750676929950714,
"num_tokens": 6526989.0,
"step": 3170
},
{
"entropy": 5.950080680847168,
"epoch": 2.817576564580559,
"grad_norm": 1.2265625,
"learning_rate": 0.0004519625620634182,
"loss": 5.779,
"mean_token_accuracy": 0.16853131651878356,
"num_tokens": 6536623.0,
"step": 3175
},
{
"entropy": 5.996464633941651,
"epoch": 2.822015090989791,
"grad_norm": 1.2421875,
"learning_rate": 0.00045174961177295964,
"loss": 5.8603,
"mean_token_accuracy": 0.15565441995859147,
"num_tokens": 6546362.0,
"step": 3180
},
{
"entropy": 5.882690143585205,
"epoch": 2.8264536173990233,
"grad_norm": 1.2265625,
"learning_rate": 0.00045153624719348773,
"loss": 5.7412,
"mean_token_accuracy": 0.16545474231243135,
"num_tokens": 6556018.0,
"step": 3185
},
{
"entropy": 5.9369165897369385,
"epoch": 2.8308921438082555,
"grad_norm": 1.1640625,
"learning_rate": 0.00045132246882511457,
"loss": 5.8711,
"mean_token_accuracy": 0.15271297544240953,
"num_tokens": 6566633.0,
"step": 3190
},
{
"entropy": 5.928608226776123,
"epoch": 2.8353306702174876,
"grad_norm": 1.078125,
"learning_rate": 0.0004511082771689219,
"loss": 5.7848,
"mean_token_accuracy": 0.162632454931736,
"num_tokens": 6577078.0,
"step": 3195
},
{
"entropy": 5.87532901763916,
"epoch": 2.83976919662672,
"grad_norm": 1.140625,
"learning_rate": 0.00045089367272696046,
"loss": 5.7296,
"mean_token_accuracy": 0.16761246025562287,
"num_tokens": 6587012.0,
"step": 3200
},
{
"entropy": 5.853836631774902,
"epoch": 2.844207723035952,
"grad_norm": 1.2734375,
"learning_rate": 0.00045067865600224833,
"loss": 5.7389,
"mean_token_accuracy": 0.16479332596063614,
"num_tokens": 6597487.0,
"step": 3205
},
{
"entropy": 5.851861524581909,
"epoch": 2.848646249445184,
"grad_norm": 1.2109375,
"learning_rate": 0.00045046322749877005,
"loss": 5.8008,
"mean_token_accuracy": 0.16307896375656128,
"num_tokens": 6607959.0,
"step": 3210
},
{
"entropy": 5.999709367752075,
"epoch": 2.853084775854416,
"grad_norm": 1.0859375,
"learning_rate": 0.00045024738772147534,
"loss": 5.8787,
"mean_token_accuracy": 0.15614837110042573,
"num_tokens": 6618790.0,
"step": 3215
},
{
"entropy": 5.923825883865357,
"epoch": 2.8575233022636484,
"grad_norm": 1.2265625,
"learning_rate": 0.0004500311371762778,
"loss": 5.8501,
"mean_token_accuracy": 0.15941908359527587,
"num_tokens": 6628472.0,
"step": 3220
},
{
"entropy": 5.905185556411743,
"epoch": 2.8619618286728805,
"grad_norm": 1.21875,
"learning_rate": 0.00044981447637005396,
"loss": 5.8651,
"mean_token_accuracy": 0.16131409406661987,
"num_tokens": 6638912.0,
"step": 3225
},
{
"entropy": 5.949870872497558,
"epoch": 2.8664003550821127,
"grad_norm": 1.046875,
"learning_rate": 0.000449597405810642,
"loss": 5.8519,
"mean_token_accuracy": 0.1583707645535469,
"num_tokens": 6649533.0,
"step": 3230
},
{
"entropy": 5.891813468933106,
"epoch": 2.870838881491345,
"grad_norm": 1.1328125,
"learning_rate": 0.0004493799260068405,
"loss": 5.7662,
"mean_token_accuracy": 0.1668047934770584,
"num_tokens": 6658936.0,
"step": 3235
},
{
"entropy": 5.957934093475342,
"epoch": 2.875277407900577,
"grad_norm": 1.328125,
"learning_rate": 0.0004491620374684072,
"loss": 5.8351,
"mean_token_accuracy": 0.16199405193328859,
"num_tokens": 6669555.0,
"step": 3240
},
{
"entropy": 5.974352836608887,
"epoch": 2.879715934309809,
"grad_norm": 1.1796875,
"learning_rate": 0.00044894374070605795,
"loss": 5.7669,
"mean_token_accuracy": 0.15872932597994804,
"num_tokens": 6680298.0,
"step": 3245
},
{
"entropy": 5.8650794506073,
"epoch": 2.8841544607190412,
"grad_norm": 1.1875,
"learning_rate": 0.00044872503623146544,
"loss": 5.8364,
"mean_token_accuracy": 0.1566520646214485,
"num_tokens": 6690852.0,
"step": 3250
},
{
"entropy": 5.917939901351929,
"epoch": 2.8885929871282734,
"grad_norm": 1.1484375,
"learning_rate": 0.00044850592455725804,
"loss": 5.8772,
"mean_token_accuracy": 0.16597653180360794,
"num_tokens": 6701442.0,
"step": 3255
},
{
"entropy": 5.969485950469971,
"epoch": 2.8930315135375055,
"grad_norm": 1.1640625,
"learning_rate": 0.0004482864061970185,
"loss": 5.812,
"mean_token_accuracy": 0.15813857614994048,
"num_tokens": 6711176.0,
"step": 3260
},
{
"entropy": 5.85574049949646,
"epoch": 2.8974700399467377,
"grad_norm": 1.1328125,
"learning_rate": 0.00044806648166528286,
"loss": 5.7762,
"mean_token_accuracy": 0.16221853271126746,
"num_tokens": 6721869.0,
"step": 3265
},
{
"entropy": 5.909014701843262,
"epoch": 2.90190856635597,
"grad_norm": 1.2421875,
"learning_rate": 0.00044784615147753934,
"loss": 5.7292,
"mean_token_accuracy": 0.1643129900097847,
"num_tokens": 6731004.0,
"step": 3270
},
{
"entropy": 6.034462118148804,
"epoch": 2.906347092765202,
"grad_norm": 1.359375,
"learning_rate": 0.00044762541615022664,
"loss": 5.8652,
"mean_token_accuracy": 0.15844893604516982,
"num_tokens": 6741793.0,
"step": 3275
},
{
"entropy": 6.018981266021728,
"epoch": 2.910785619174434,
"grad_norm": 1.0625,
"learning_rate": 0.00044740427620073344,
"loss": 5.8222,
"mean_token_accuracy": 0.1608099490404129,
"num_tokens": 6753177.0,
"step": 3280
},
{
"entropy": 5.9532171249389645,
"epoch": 2.9152241455836663,
"grad_norm": 1.125,
"learning_rate": 0.00044718273214739654,
"loss": 5.8773,
"mean_token_accuracy": 0.15125300288200377,
"num_tokens": 6763104.0,
"step": 3285
},
{
"entropy": 5.929151487350464,
"epoch": 2.9196626719928984,
"grad_norm": 1.171875,
"learning_rate": 0.0004469607845095002,
"loss": 5.8162,
"mean_token_accuracy": 0.16089233607053757,
"num_tokens": 6773823.0,
"step": 3290
},
{
"entropy": 5.9447283267974855,
"epoch": 2.9241011984021306,
"grad_norm": 1.2265625,
"learning_rate": 0.0004467384338072744,
"loss": 5.7967,
"mean_token_accuracy": 0.16282767355442046,
"num_tokens": 6783445.0,
"step": 3295
},
{
"entropy": 5.851709604263306,
"epoch": 2.9285397248113627,
"grad_norm": 1.2734375,
"learning_rate": 0.0004465156805618941,
"loss": 5.681,
"mean_token_accuracy": 0.1752907082438469,
"num_tokens": 6794199.0,
"step": 3300
},
{
"entropy": 5.876345252990722,
"epoch": 2.932978251220595,
"grad_norm": 1.140625,
"learning_rate": 0.0004462925252954775,
"loss": 5.8756,
"mean_token_accuracy": 0.15152985453605652,
"num_tokens": 6804817.0,
"step": 3305
},
{
"entropy": 5.9312444686889645,
"epoch": 2.937416777629827,
"grad_norm": 1.1796875,
"learning_rate": 0.0004460689685310855,
"loss": 5.8161,
"mean_token_accuracy": 0.16338575184345244,
"num_tokens": 6815592.0,
"step": 3310
},
{
"entropy": 5.860175895690918,
"epoch": 2.941855304039059,
"grad_norm": 1.1171875,
"learning_rate": 0.0004458450107927199,
"loss": 5.759,
"mean_token_accuracy": 0.17119106501340867,
"num_tokens": 6825653.0,
"step": 3315
},
{
"entropy": 5.963648462295533,
"epoch": 2.9462938304482913,
"grad_norm": 1.109375,
"learning_rate": 0.00044562065260532214,
"loss": 5.9028,
"mean_token_accuracy": 0.15333495438098907,
"num_tokens": 6836610.0,
"step": 3320
},
{
"entropy": 5.885528802871704,
"epoch": 2.9507323568575234,
"grad_norm": 1.1015625,
"learning_rate": 0.00044539589449477265,
"loss": 5.6927,
"mean_token_accuracy": 0.16941193193197251,
"num_tokens": 6846700.0,
"step": 3325
},
{
"entropy": 5.940938091278076,
"epoch": 2.9551708832667556,
"grad_norm": 1.4921875,
"learning_rate": 0.000445170736987889,
"loss": 5.8498,
"mean_token_accuracy": 0.15794429033994675,
"num_tokens": 6857796.0,
"step": 3330
},
{
"entropy": 5.989238452911377,
"epoch": 2.9596094096759877,
"grad_norm": 1.171875,
"learning_rate": 0.000444945180612425,
"loss": 5.8447,
"mean_token_accuracy": 0.15649579018354415,
"num_tokens": 6868038.0,
"step": 3335
},
{
"entropy": 5.952742576599121,
"epoch": 2.96404793608522,
"grad_norm": 1.1953125,
"learning_rate": 0.00044471922589706944,
"loss": 5.8328,
"mean_token_accuracy": 0.1704735830426216,
"num_tokens": 6878356.0,
"step": 3340
},
{
"entropy": 5.956376743316651,
"epoch": 2.968486462494452,
"grad_norm": 1.2109375,
"learning_rate": 0.0004444928733714446,
"loss": 5.801,
"mean_token_accuracy": 0.1637368842959404,
"num_tokens": 6889087.0,
"step": 3345
},
{
"entropy": 5.929503870010376,
"epoch": 2.972924988903684,
"grad_norm": 1.40625,
"learning_rate": 0.00044426612356610555,
"loss": 5.8323,
"mean_token_accuracy": 0.15772309452295302,
"num_tokens": 6898357.0,
"step": 3350
},
{
"entropy": 5.9494575500488285,
"epoch": 2.9773635153129163,
"grad_norm": 1.515625,
"learning_rate": 0.0004440389770125382,
"loss": 5.9006,
"mean_token_accuracy": 0.1598823130130768,
"num_tokens": 6908363.0,
"step": 3355
},
{
"entropy": 5.953467893600464,
"epoch": 2.9818020417221485,
"grad_norm": 1.1640625,
"learning_rate": 0.0004438114342431586,
"loss": 5.7412,
"mean_token_accuracy": 0.16902253776788712,
"num_tokens": 6918680.0,
"step": 3360
},
{
"entropy": 5.909799098968506,
"epoch": 2.9862405681313806,
"grad_norm": 1.171875,
"learning_rate": 0.00044358349579131143,
"loss": 5.8004,
"mean_token_accuracy": 0.16135867238044738,
"num_tokens": 6929063.0,
"step": 3365
},
{
"entropy": 5.941587018966675,
"epoch": 2.9906790945406128,
"grad_norm": 1.265625,
"learning_rate": 0.00044335516219126876,
"loss": 5.805,
"mean_token_accuracy": 0.15798759311437607,
"num_tokens": 6937862.0,
"step": 3370
},
{
"entropy": 5.936902904510498,
"epoch": 2.995117620949845,
"grad_norm": 1.2421875,
"learning_rate": 0.00044312643397822907,
"loss": 5.8394,
"mean_token_accuracy": 0.16224613785743713,
"num_tokens": 6948838.0,
"step": 3375
},
{
"entropy": 5.955539321899414,
"epoch": 2.999556147359077,
"grad_norm": 1.21875,
"learning_rate": 0.00044289731168831566,
"loss": 5.8572,
"mean_token_accuracy": 0.15817692875862122,
"num_tokens": 6958496.0,
"step": 3380
},
{
"entropy": 5.930147065056695,
"epoch": 3.003550821127386,
"grad_norm": 1.34375,
"learning_rate": 0.0004426677958585755,
"loss": 5.5163,
"mean_token_accuracy": 0.17406127519077724,
"num_tokens": 6967392.0,
"step": 3385
},
{
"entropy": 5.90186071395874,
"epoch": 3.007989347536618,
"grad_norm": 1.2578125,
"learning_rate": 0.00044243788702697797,
"loss": 5.4168,
"mean_token_accuracy": 0.18226586729288102,
"num_tokens": 6976740.0,
"step": 3390
},
{
"entropy": 5.921399211883545,
"epoch": 3.01242787394585,
"grad_norm": 1.2109375,
"learning_rate": 0.0004422075857324137,
"loss": 5.461,
"mean_token_accuracy": 0.17682978212833406,
"num_tokens": 6986058.0,
"step": 3395
},
{
"entropy": 5.805210304260254,
"epoch": 3.0168664003550822,
"grad_norm": 1.1953125,
"learning_rate": 0.00044197689251469324,
"loss": 5.4366,
"mean_token_accuracy": 0.17929895371198654,
"num_tokens": 6997796.0,
"step": 3400
},
{
"entropy": 5.819172430038452,
"epoch": 3.0213049267643144,
"grad_norm": 1.203125,
"learning_rate": 0.00044174580791454555,
"loss": 5.4213,
"mean_token_accuracy": 0.18021279126405715,
"num_tokens": 7008367.0,
"step": 3405
},
{
"entropy": 5.90168023109436,
"epoch": 3.0257434531735465,
"grad_norm": 1.3046875,
"learning_rate": 0.0004415143324736174,
"loss": 5.5685,
"mean_token_accuracy": 0.1715884819626808,
"num_tokens": 7019134.0,
"step": 3410
},
{
"entropy": 5.9204421043396,
"epoch": 3.0301819795827787,
"grad_norm": 1.1484375,
"learning_rate": 0.0004412824667344712,
"loss": 5.4352,
"mean_token_accuracy": 0.17551446259021758,
"num_tokens": 7030078.0,
"step": 3415
},
{
"entropy": 5.873832845687867,
"epoch": 3.034620505992011,
"grad_norm": 1.375,
"learning_rate": 0.00044105021124058455,
"loss": 5.4334,
"mean_token_accuracy": 0.17652692794799804,
"num_tokens": 7039828.0,
"step": 3420
},
{
"entropy": 5.702576208114624,
"epoch": 3.039059032401243,
"grad_norm": 1.140625,
"learning_rate": 0.00044081756653634825,
"loss": 5.4346,
"mean_token_accuracy": 0.19161795526742936,
"num_tokens": 7050842.0,
"step": 3425
},
{
"entropy": 5.811843490600586,
"epoch": 3.043497558810475,
"grad_norm": 1.2890625,
"learning_rate": 0.0004405845331670659,
"loss": 5.4042,
"mean_token_accuracy": 0.1850294515490532,
"num_tokens": 7059872.0,
"step": 3430
},
{
"entropy": 5.8140980243682865,
"epoch": 3.0479360852197073,
"grad_norm": 1.2421875,
"learning_rate": 0.0004403511116789514,
"loss": 5.4583,
"mean_token_accuracy": 0.17900667041540147,
"num_tokens": 7069625.0,
"step": 3435
},
{
"entropy": 5.849609327316284,
"epoch": 3.052374611628939,
"grad_norm": 1.25,
"learning_rate": 0.00044011730261912915,
"loss": 5.4784,
"mean_token_accuracy": 0.1747259259223938,
"num_tokens": 7078890.0,
"step": 3440
},
{
"entropy": 5.818154144287109,
"epoch": 3.056813138038171,
"grad_norm": 1.2265625,
"learning_rate": 0.0004398831065356314,
"loss": 5.4591,
"mean_token_accuracy": 0.18030397742986679,
"num_tokens": 7089123.0,
"step": 3445
},
{
"entropy": 5.864135217666626,
"epoch": 3.0612516644474033,
"grad_norm": 1.1640625,
"learning_rate": 0.00043964852397739793,
"loss": 5.4633,
"mean_token_accuracy": 0.1758294314146042,
"num_tokens": 7100053.0,
"step": 3450
},
{
"entropy": 5.854467535018921,
"epoch": 3.0656901908566354,
"grad_norm": 3.125,
"learning_rate": 0.000439413555494274,
"loss": 5.5035,
"mean_token_accuracy": 0.17171409279108046,
"num_tokens": 7110528.0,
"step": 3455
},
{
"entropy": 5.797104597091675,
"epoch": 3.0701287172658676,
"grad_norm": 1.25,
"learning_rate": 0.0004391782016370098,
"loss": 5.552,
"mean_token_accuracy": 0.17069081217050552,
"num_tokens": 7121691.0,
"step": 3460
},
{
"entropy": 5.799645948410034,
"epoch": 3.0745672436750997,
"grad_norm": 1.140625,
"learning_rate": 0.0004389424629572586,
"loss": 5.4676,
"mean_token_accuracy": 0.17778647989034652,
"num_tokens": 7131689.0,
"step": 3465
},
{
"entropy": 5.832806205749511,
"epoch": 3.079005770084332,
"grad_norm": 1.1796875,
"learning_rate": 0.00043870634000757605,
"loss": 5.5696,
"mean_token_accuracy": 0.1696484714746475,
"num_tokens": 7142595.0,
"step": 3470
},
{
"entropy": 5.8818260669708256,
"epoch": 3.083444296493564,
"grad_norm": 1.453125,
"learning_rate": 0.0004384698333414179,
"loss": 5.4671,
"mean_token_accuracy": 0.17925113886594773,
"num_tokens": 7152092.0,
"step": 3475
},
{
"entropy": 5.796309995651245,
"epoch": 3.087882822902796,
"grad_norm": 1.1875,
"learning_rate": 0.0004382329435131396,
"loss": 5.4868,
"mean_token_accuracy": 0.17726072669029236,
"num_tokens": 7163053.0,
"step": 3480
},
{
"entropy": 5.830512142181396,
"epoch": 3.0923213493120283,
"grad_norm": 1.3828125,
"learning_rate": 0.00043799567107799504,
"loss": 5.435,
"mean_token_accuracy": 0.18380391746759414,
"num_tokens": 7172812.0,
"step": 3485
},
{
"entropy": 5.815919589996338,
"epoch": 3.0967598757212604,
"grad_norm": 1.4140625,
"learning_rate": 0.00043775801659213425,
"loss": 5.4432,
"mean_token_accuracy": 0.18219853341579437,
"num_tokens": 7183234.0,
"step": 3490
},
{
"entropy": 5.867840814590454,
"epoch": 3.1011984021304926,
"grad_norm": 1.171875,
"learning_rate": 0.0004375199806126034,
"loss": 5.5505,
"mean_token_accuracy": 0.17434204816818238,
"num_tokens": 7193614.0,
"step": 3495
},
{
"entropy": 5.865722894668579,
"epoch": 3.1056369285397247,
"grad_norm": 1.0859375,
"learning_rate": 0.00043728156369734236,
"loss": 5.5435,
"mean_token_accuracy": 0.17825270295143128,
"num_tokens": 7204836.0,
"step": 3500
},
{
"epoch": 3.1056369285397247,
"eval_entropy": 5.67943718654243,
"eval_loss": 6.10019063949585,
"eval_mean_token_accuracy": 0.15331950948314826,
"eval_num_tokens": 7204836.0,
"eval_runtime": 2.6975,
"eval_samples_per_second": 1248.216,
"eval_steps_per_second": 156.073,
"step": 3500
},
{
"entropy": 5.769807004928589,
"epoch": 3.110075454948957,
"grad_norm": 1.203125,
"learning_rate": 0.0004370427664051841,
"loss": 5.4519,
"mean_token_accuracy": 0.17842291593551635,
"num_tokens": 7215138.0,
"step": 3505
},
{
"entropy": 5.7893476486206055,
"epoch": 3.114513981358189,
"grad_norm": 1.1953125,
"learning_rate": 0.0004368035892958533,
"loss": 5.5557,
"mean_token_accuracy": 0.17136096805334092,
"num_tokens": 7226468.0,
"step": 3510
},
{
"entropy": 5.889794778823853,
"epoch": 3.118952507767421,
"grad_norm": 1.1328125,
"learning_rate": 0.00043656403292996454,
"loss": 5.5482,
"mean_token_accuracy": 0.17302740216255189,
"num_tokens": 7235904.0,
"step": 3515
},
{
"entropy": 5.793400382995605,
"epoch": 3.1233910341766533,
"grad_norm": 1.234375,
"learning_rate": 0.0004363240978690218,
"loss": 5.5274,
"mean_token_accuracy": 0.17253278195858002,
"num_tokens": 7245933.0,
"step": 3520
},
{
"entropy": 5.846996784210205,
"epoch": 3.1278295605858855,
"grad_norm": 1.2421875,
"learning_rate": 0.00043608378467541626,
"loss": 5.5482,
"mean_token_accuracy": 0.17442068457603455,
"num_tokens": 7255626.0,
"step": 3525
},
{
"entropy": 5.793939161300659,
"epoch": 3.1322680869951176,
"grad_norm": 1.2265625,
"learning_rate": 0.00043584309391242584,
"loss": 5.471,
"mean_token_accuracy": 0.17612817138433456,
"num_tokens": 7264579.0,
"step": 3530
},
{
"entropy": 5.80440616607666,
"epoch": 3.1367066134043498,
"grad_norm": 1.15625,
"learning_rate": 0.0004356020261442131,
"loss": 5.4877,
"mean_token_accuracy": 0.17804499417543412,
"num_tokens": 7274860.0,
"step": 3535
},
{
"entropy": 5.832252120971679,
"epoch": 3.141145139813582,
"grad_norm": 1.2578125,
"learning_rate": 0.00043536058193582443,
"loss": 5.4445,
"mean_token_accuracy": 0.17826966494321822,
"num_tokens": 7285236.0,
"step": 3540
},
{
"entropy": 5.774497222900391,
"epoch": 3.145583666222814,
"grad_norm": 1.2890625,
"learning_rate": 0.0004351187618531886,
"loss": 5.4918,
"mean_token_accuracy": 0.17440381795167922,
"num_tokens": 7295291.0,
"step": 3545
},
{
"entropy": 5.885190725326538,
"epoch": 3.150022192632046,
"grad_norm": 1.1484375,
"learning_rate": 0.00043487656646311535,
"loss": 5.5069,
"mean_token_accuracy": 0.17112795114517212,
"num_tokens": 7306237.0,
"step": 3550
},
{
"entropy": 5.744331693649292,
"epoch": 3.1544607190412783,
"grad_norm": 1.2890625,
"learning_rate": 0.0004346339963332941,
"loss": 5.4601,
"mean_token_accuracy": 0.18217105120420457,
"num_tokens": 7316695.0,
"step": 3555
},
{
"entropy": 5.734088611602783,
"epoch": 3.1588992454505105,
"grad_norm": 1.28125,
"learning_rate": 0.0004343910520322927,
"loss": 5.4478,
"mean_token_accuracy": 0.18409417420625687,
"num_tokens": 7325942.0,
"step": 3560
},
{
"entropy": 5.781349754333496,
"epoch": 3.1633377718597426,
"grad_norm": 1.1328125,
"learning_rate": 0.000434147734129556,
"loss": 5.557,
"mean_token_accuracy": 0.17307535111904143,
"num_tokens": 7336817.0,
"step": 3565
},
{
"entropy": 5.821921443939209,
"epoch": 3.1677762982689748,
"grad_norm": 1.125,
"learning_rate": 0.00043390404319540443,
"loss": 5.5423,
"mean_token_accuracy": 0.17289045602083206,
"num_tokens": 7347072.0,
"step": 3570
},
{
"entropy": 5.850234889984131,
"epoch": 3.172214824678207,
"grad_norm": 1.2265625,
"learning_rate": 0.00043365997980103304,
"loss": 5.4943,
"mean_token_accuracy": 0.1778233155608177,
"num_tokens": 7357125.0,
"step": 3575
},
{
"entropy": 5.763746833801269,
"epoch": 3.176653351087439,
"grad_norm": 1.1171875,
"learning_rate": 0.00043341554451850964,
"loss": 5.4796,
"mean_token_accuracy": 0.1793802037835121,
"num_tokens": 7367290.0,
"step": 3580
},
{
"entropy": 5.780725145339966,
"epoch": 3.181091877496671,
"grad_norm": 1.171875,
"learning_rate": 0.00043317073792077394,
"loss": 5.4474,
"mean_token_accuracy": 0.18791042119264603,
"num_tokens": 7377126.0,
"step": 3585
},
{
"entropy": 5.8030867099761965,
"epoch": 3.1855304039059034,
"grad_norm": 1.03125,
"learning_rate": 0.0004329255605816357,
"loss": 5.4992,
"mean_token_accuracy": 0.17195357382297516,
"num_tokens": 7388136.0,
"step": 3590
},
{
"entropy": 5.821031093597412,
"epoch": 3.1899689303151355,
"grad_norm": 1.2421875,
"learning_rate": 0.000432680013075774,
"loss": 5.436,
"mean_token_accuracy": 0.17939778566360473,
"num_tokens": 7397781.0,
"step": 3595
},
{
"entropy": 5.805264902114868,
"epoch": 3.1944074567243677,
"grad_norm": 1.1640625,
"learning_rate": 0.0004324340959787354,
"loss": 5.4492,
"mean_token_accuracy": 0.17887378931045533,
"num_tokens": 7407135.0,
"step": 3600
},
{
"entropy": 5.814063787460327,
"epoch": 3.1988459831336,
"grad_norm": 1.140625,
"learning_rate": 0.00043218780986693274,
"loss": 5.5155,
"mean_token_accuracy": 0.1740931436419487,
"num_tokens": 7417614.0,
"step": 3605
},
{
"entropy": 5.742436218261719,
"epoch": 3.203284509542832,
"grad_norm": 1.21875,
"learning_rate": 0.0004319411553176438,
"loss": 5.5237,
"mean_token_accuracy": 0.17489579766988755,
"num_tokens": 7427792.0,
"step": 3610
},
{
"entropy": 5.751005458831787,
"epoch": 3.207723035952064,
"grad_norm": 1.28125,
"learning_rate": 0.0004316941329090101,
"loss": 5.4246,
"mean_token_accuracy": 0.1843129500746727,
"num_tokens": 7437310.0,
"step": 3615
},
{
"entropy": 5.804794406890869,
"epoch": 3.2121615623612962,
"grad_norm": 1.2265625,
"learning_rate": 0.00043144674322003525,
"loss": 5.5249,
"mean_token_accuracy": 0.1753912925720215,
"num_tokens": 7447451.0,
"step": 3620
},
{
"entropy": 5.8752443313598635,
"epoch": 3.2166000887705284,
"grad_norm": 1.2265625,
"learning_rate": 0.0004311989868305837,
"loss": 5.536,
"mean_token_accuracy": 0.1762519434094429,
"num_tokens": 7456837.0,
"step": 3625
},
{
"entropy": 5.7469000816345215,
"epoch": 3.2210386151797605,
"grad_norm": 1.28125,
"learning_rate": 0.00043095086432137954,
"loss": 5.5601,
"mean_token_accuracy": 0.17813700139522554,
"num_tokens": 7466832.0,
"step": 3630
},
{
"entropy": 5.867207765579224,
"epoch": 3.2254771415889927,
"grad_norm": 1.0703125,
"learning_rate": 0.000430702376274005,
"loss": 5.5123,
"mean_token_accuracy": 0.181433866918087,
"num_tokens": 7476833.0,
"step": 3635
},
{
"entropy": 5.72882194519043,
"epoch": 3.2299156679982244,
"grad_norm": 1.21875,
"learning_rate": 0.00043045352327089907,
"loss": 5.4978,
"mean_token_accuracy": 0.17953841239213944,
"num_tokens": 7486980.0,
"step": 3640
},
{
"entropy": 5.76573543548584,
"epoch": 3.2343541944074565,
"grad_norm": 1.375,
"learning_rate": 0.00043020430589535625,
"loss": 5.511,
"mean_token_accuracy": 0.1714419886469841,
"num_tokens": 7496612.0,
"step": 3645
},
{
"entropy": 5.787287712097168,
"epoch": 3.2387927208166887,
"grad_norm": 1.2109375,
"learning_rate": 0.000429954724731525,
"loss": 5.5044,
"mean_token_accuracy": 0.17498656511306762,
"num_tokens": 7506704.0,
"step": 3650
},
{
"entropy": 5.848012685775757,
"epoch": 3.243231247225921,
"grad_norm": 1.1328125,
"learning_rate": 0.0004297047803644063,
"loss": 5.5579,
"mean_token_accuracy": 0.16941310465335846,
"num_tokens": 7517914.0,
"step": 3655
},
{
"entropy": 5.829830932617187,
"epoch": 3.247669773635153,
"grad_norm": 1.1953125,
"learning_rate": 0.000429454473379853,
"loss": 5.5851,
"mean_token_accuracy": 0.16952553391456604,
"num_tokens": 7527610.0,
"step": 3660
},
{
"entropy": 5.78036208152771,
"epoch": 3.252108300044385,
"grad_norm": 1.421875,
"learning_rate": 0.0004292038043645675,
"loss": 5.579,
"mean_token_accuracy": 0.17085347920656205,
"num_tokens": 7536721.0,
"step": 3665
},
{
"entropy": 5.835186433792114,
"epoch": 3.2565468264536173,
"grad_norm": 1.21875,
"learning_rate": 0.00042895277390610074,
"loss": 5.5393,
"mean_token_accuracy": 0.16900095343589783,
"num_tokens": 7546508.0,
"step": 3670
},
{
"entropy": 5.8003698825836185,
"epoch": 3.2609853528628494,
"grad_norm": 1.2578125,
"learning_rate": 0.0004287013825928509,
"loss": 5.4926,
"mean_token_accuracy": 0.1826077312231064,
"num_tokens": 7556024.0,
"step": 3675
},
{
"entropy": 5.807423114776611,
"epoch": 3.2654238792720816,
"grad_norm": 1.234375,
"learning_rate": 0.0004284496310140622,
"loss": 5.6074,
"mean_token_accuracy": 0.16542265564203262,
"num_tokens": 7566033.0,
"step": 3680
},
{
"entropy": 5.8312273025512695,
"epoch": 3.2698624056813137,
"grad_norm": 1.296875,
"learning_rate": 0.0004281975197598231,
"loss": 5.6146,
"mean_token_accuracy": 0.17007148563861846,
"num_tokens": 7576956.0,
"step": 3685
},
{
"entropy": 5.792421102523804,
"epoch": 3.274300932090546,
"grad_norm": 1.1328125,
"learning_rate": 0.0004279450494210651,
"loss": 5.5571,
"mean_token_accuracy": 0.17620914578437805,
"num_tokens": 7588185.0,
"step": 3690
},
{
"entropy": 5.833206367492676,
"epoch": 3.278739458499778,
"grad_norm": 1.1796875,
"learning_rate": 0.0004276922205895614,
"loss": 5.4967,
"mean_token_accuracy": 0.17706188112497329,
"num_tokens": 7598886.0,
"step": 3695
},
{
"entropy": 5.774030017852783,
"epoch": 3.28317798490901,
"grad_norm": 1.1640625,
"learning_rate": 0.0004274390338579257,
"loss": 5.4094,
"mean_token_accuracy": 0.18668818473815918,
"num_tokens": 7609238.0,
"step": 3700
},
{
"entropy": 5.7815450668334964,
"epoch": 3.2876165113182423,
"grad_norm": 1.1953125,
"learning_rate": 0.0004271854898196102,
"loss": 5.4946,
"mean_token_accuracy": 0.1777348294854164,
"num_tokens": 7619873.0,
"step": 3705
},
{
"entropy": 5.715425872802735,
"epoch": 3.2920550377274744,
"grad_norm": 1.5625,
"learning_rate": 0.0004269315890689049,
"loss": 5.4391,
"mean_token_accuracy": 0.18781703263521193,
"num_tokens": 7628903.0,
"step": 3710
},
{
"entropy": 5.795434141159058,
"epoch": 3.2964935641367066,
"grad_norm": 1.25,
"learning_rate": 0.00042667733220093574,
"loss": 5.6098,
"mean_token_accuracy": 0.16501247882843018,
"num_tokens": 7639774.0,
"step": 3715
},
{
"entropy": 5.788212394714355,
"epoch": 3.3009320905459387,
"grad_norm": 1.34375,
"learning_rate": 0.0004264227198116635,
"loss": 5.5198,
"mean_token_accuracy": 0.17427263855934144,
"num_tokens": 7649739.0,
"step": 3720
},
{
"entropy": 5.754326581954956,
"epoch": 3.305370616955171,
"grad_norm": 1.1875,
"learning_rate": 0.00042616775249788223,
"loss": 5.4986,
"mean_token_accuracy": 0.17347201257944106,
"num_tokens": 7659329.0,
"step": 3725
},
{
"entropy": 5.818285989761352,
"epoch": 3.309809143364403,
"grad_norm": 1.25,
"learning_rate": 0.0004259124308572178,
"loss": 5.5031,
"mean_token_accuracy": 0.17783356904983522,
"num_tokens": 7669754.0,
"step": 3730
},
{
"entropy": 5.849746561050415,
"epoch": 3.314247669773635,
"grad_norm": 1.2578125,
"learning_rate": 0.0004256567554881268,
"loss": 5.5744,
"mean_token_accuracy": 0.16835701167583467,
"num_tokens": 7679139.0,
"step": 3735
},
{
"entropy": 5.756852912902832,
"epoch": 3.3186861961828673,
"grad_norm": 1.4765625,
"learning_rate": 0.0004254007269898948,
"loss": 5.4857,
"mean_token_accuracy": 0.17899881154298783,
"num_tokens": 7689210.0,
"step": 3740
},
{
"entropy": 5.784307432174683,
"epoch": 3.3231247225920995,
"grad_norm": 1.3203125,
"learning_rate": 0.00042514434596263513,
"loss": 5.5316,
"mean_token_accuracy": 0.17348483949899673,
"num_tokens": 7698741.0,
"step": 3745
},
{
"entropy": 5.769883012771606,
"epoch": 3.3275632490013316,
"grad_norm": 1.78125,
"learning_rate": 0.0004248876130072873,
"loss": 5.5304,
"mean_token_accuracy": 0.1791750445961952,
"num_tokens": 7708398.0,
"step": 3750
},
{
"entropy": 5.805131721496582,
"epoch": 3.3320017754105637,
"grad_norm": 1.2421875,
"learning_rate": 0.00042463052872561587,
"loss": 5.4996,
"mean_token_accuracy": 0.17841846048831939,
"num_tokens": 7718574.0,
"step": 3755
},
{
"entropy": 5.776119947433472,
"epoch": 3.336440301819796,
"grad_norm": 1.25,
"learning_rate": 0.00042437309372020886,
"loss": 5.491,
"mean_token_accuracy": 0.18578603267669677,
"num_tokens": 7728453.0,
"step": 3760
},
{
"entropy": 5.758517026901245,
"epoch": 3.340878828229028,
"grad_norm": 1.2578125,
"learning_rate": 0.00042411530859447634,
"loss": 5.4694,
"mean_token_accuracy": 0.17349309474229813,
"num_tokens": 7738928.0,
"step": 3765
},
{
"entropy": 5.788589143753052,
"epoch": 3.34531735463826,
"grad_norm": 1.1640625,
"learning_rate": 0.0004238571739526489,
"loss": 5.5044,
"mean_token_accuracy": 0.18183342814445497,
"num_tokens": 7748828.0,
"step": 3770
},
{
"entropy": 5.8095966339111325,
"epoch": 3.3497558810474923,
"grad_norm": 1.203125,
"learning_rate": 0.0004235986903997767,
"loss": 5.5192,
"mean_token_accuracy": 0.17913017868995668,
"num_tokens": 7759533.0,
"step": 3775
},
{
"entropy": 5.770309352874756,
"epoch": 3.3541944074567245,
"grad_norm": 1.3671875,
"learning_rate": 0.0004233398585417275,
"loss": 5.4932,
"mean_token_accuracy": 0.17637839764356614,
"num_tokens": 7769511.0,
"step": 3780
},
{
"entropy": 5.806517553329468,
"epoch": 3.3586329338659566,
"grad_norm": 1.1015625,
"learning_rate": 0.0004230806789851854,
"loss": 5.5236,
"mean_token_accuracy": 0.1788152739405632,
"num_tokens": 7779579.0,
"step": 3785
},
{
"entropy": 5.761344146728516,
"epoch": 3.3630714602751888,
"grad_norm": 1.328125,
"learning_rate": 0.00042282115233764953,
"loss": 5.5373,
"mean_token_accuracy": 0.18033097833395004,
"num_tokens": 7789739.0,
"step": 3790
},
{
"entropy": 5.832413530349731,
"epoch": 3.367509986684421,
"grad_norm": 1.3515625,
"learning_rate": 0.0004225612792074326,
"loss": 5.5743,
"mean_token_accuracy": 0.17297957986593246,
"num_tokens": 7798744.0,
"step": 3795
},
{
"entropy": 5.769485569000244,
"epoch": 3.371948513093653,
"grad_norm": 1.28125,
"learning_rate": 0.00042230106020365964,
"loss": 5.4193,
"mean_token_accuracy": 0.1825847089290619,
"num_tokens": 7808111.0,
"step": 3800
},
{
"entropy": 5.798009586334229,
"epoch": 3.376387039502885,
"grad_norm": 1.203125,
"learning_rate": 0.00042204049593626617,
"loss": 5.4902,
"mean_token_accuracy": 0.17742030769586564,
"num_tokens": 7818673.0,
"step": 3805
},
{
"entropy": 5.741698551177978,
"epoch": 3.3808255659121174,
"grad_norm": 1.2265625,
"learning_rate": 0.00042177958701599696,
"loss": 5.508,
"mean_token_accuracy": 0.17802224904298783,
"num_tokens": 7829165.0,
"step": 3810
},
{
"entropy": 5.735812187194824,
"epoch": 3.3852640923213495,
"grad_norm": 1.2890625,
"learning_rate": 0.0004215183340544047,
"loss": 5.4262,
"mean_token_accuracy": 0.1855878248810768,
"num_tokens": 7839345.0,
"step": 3815
},
{
"entropy": 5.765830135345459,
"epoch": 3.389702618730581,
"grad_norm": 1.109375,
"learning_rate": 0.0004212567376638485,
"loss": 5.5266,
"mean_token_accuracy": 0.18168332129716874,
"num_tokens": 7850232.0,
"step": 3820
},
{
"entropy": 5.817579126358032,
"epoch": 3.3941411451398134,
"grad_norm": 1.265625,
"learning_rate": 0.00042099479845749256,
"loss": 5.5961,
"mean_token_accuracy": 0.16893403679132463,
"num_tokens": 7860109.0,
"step": 3825
},
{
"entropy": 5.775877475738525,
"epoch": 3.3985796715490455,
"grad_norm": 1.1328125,
"learning_rate": 0.00042073251704930414,
"loss": 5.5559,
"mean_token_accuracy": 0.17739353477954864,
"num_tokens": 7870466.0,
"step": 3830
},
{
"entropy": 5.847122144699097,
"epoch": 3.4030181979582776,
"grad_norm": 1.1328125,
"learning_rate": 0.00042046989405405326,
"loss": 5.5934,
"mean_token_accuracy": 0.17239516228437424,
"num_tokens": 7880460.0,
"step": 3835
},
{
"entropy": 5.73626298904419,
"epoch": 3.40745672436751,
"grad_norm": 1.2109375,
"learning_rate": 0.0004202069300873102,
"loss": 5.444,
"mean_token_accuracy": 0.17805344611406326,
"num_tokens": 7890099.0,
"step": 3840
},
{
"entropy": 5.804626178741455,
"epoch": 3.411895250776742,
"grad_norm": 1.2265625,
"learning_rate": 0.0004199436257654445,
"loss": 5.5374,
"mean_token_accuracy": 0.17474997490644456,
"num_tokens": 7900484.0,
"step": 3845
},
{
"entropy": 5.791158151626587,
"epoch": 3.416333777185974,
"grad_norm": 1.1484375,
"learning_rate": 0.0004196799817056234,
"loss": 5.5676,
"mean_token_accuracy": 0.1661073759198189,
"num_tokens": 7911408.0,
"step": 3850
},
{
"entropy": 5.822518634796142,
"epoch": 3.4207723035952062,
"grad_norm": 1.1953125,
"learning_rate": 0.00041941599852581067,
"loss": 5.5941,
"mean_token_accuracy": 0.16456971168518067,
"num_tokens": 7922317.0,
"step": 3855
},
{
"entropy": 5.850543022155762,
"epoch": 3.4252108300044384,
"grad_norm": 1.1953125,
"learning_rate": 0.00041915167684476495,
"loss": 5.5218,
"mean_token_accuracy": 0.18075551390647887,
"num_tokens": 7932713.0,
"step": 3860
},
{
"entropy": 5.771756839752197,
"epoch": 3.4296493564136705,
"grad_norm": 1.265625,
"learning_rate": 0.000418887017282038,
"loss": 5.4753,
"mean_token_accuracy": 0.1776781052350998,
"num_tokens": 7942639.0,
"step": 3865
},
{
"entropy": 5.707421112060547,
"epoch": 3.4340878828229027,
"grad_norm": 1.25,
"learning_rate": 0.00041862202045797386,
"loss": 5.5052,
"mean_token_accuracy": 0.18350479304790496,
"num_tokens": 7953094.0,
"step": 3870
},
{
"entropy": 5.789714384078979,
"epoch": 3.438526409232135,
"grad_norm": 1.234375,
"learning_rate": 0.0004183566869937069,
"loss": 5.5103,
"mean_token_accuracy": 0.17723090648651124,
"num_tokens": 7963070.0,
"step": 3875
},
{
"entropy": 5.729114675521851,
"epoch": 3.442964935641367,
"grad_norm": 1.2109375,
"learning_rate": 0.0004180910175111608,
"loss": 5.4825,
"mean_token_accuracy": 0.18474385887384415,
"num_tokens": 7972957.0,
"step": 3880
},
{
"entropy": 5.81961579322815,
"epoch": 3.447403462050599,
"grad_norm": 1.1875,
"learning_rate": 0.00041782501263304655,
"loss": 5.5174,
"mean_token_accuracy": 0.17037456184625627,
"num_tokens": 7982759.0,
"step": 3885
},
{
"entropy": 5.793990993499756,
"epoch": 3.4518419884598313,
"grad_norm": 1.21875,
"learning_rate": 0.0004175586729828614,
"loss": 5.6276,
"mean_token_accuracy": 0.1665704995393753,
"num_tokens": 7993300.0,
"step": 3890
},
{
"entropy": 5.737445640563965,
"epoch": 3.4562805148690634,
"grad_norm": 1.1484375,
"learning_rate": 0.00041729199918488725,
"loss": 5.4466,
"mean_token_accuracy": 0.1841512829065323,
"num_tokens": 8003175.0,
"step": 3895
},
{
"entropy": 5.7286967754364015,
"epoch": 3.4607190412782955,
"grad_norm": 1.1484375,
"learning_rate": 0.00041702499186418936,
"loss": 5.4967,
"mean_token_accuracy": 0.18316451460123062,
"num_tokens": 8013399.0,
"step": 3900
},
{
"entropy": 5.761036109924317,
"epoch": 3.4651575676875277,
"grad_norm": 1.25,
"learning_rate": 0.00041675765164661473,
"loss": 5.5364,
"mean_token_accuracy": 0.1704569160938263,
"num_tokens": 8022939.0,
"step": 3905
},
{
"entropy": 5.758256196975708,
"epoch": 3.46959609409676,
"grad_norm": 1.2265625,
"learning_rate": 0.0004164899791587903,
"loss": 5.5904,
"mean_token_accuracy": 0.17271675616502763,
"num_tokens": 8034267.0,
"step": 3910
},
{
"entropy": 5.749184274673462,
"epoch": 3.474034620505992,
"grad_norm": 1.3203125,
"learning_rate": 0.00041622197502812224,
"loss": 5.4549,
"mean_token_accuracy": 0.17980799823999405,
"num_tokens": 8044270.0,
"step": 3915
},
{
"entropy": 5.827999448776245,
"epoch": 3.478473146915224,
"grad_norm": 1.046875,
"learning_rate": 0.000415953639882794,
"loss": 5.5304,
"mean_token_accuracy": 0.1710374191403389,
"num_tokens": 8055775.0,
"step": 3920
},
{
"entropy": 5.766659116744995,
"epoch": 3.4829116733244563,
"grad_norm": 1.2890625,
"learning_rate": 0.00041568497435176473,
"loss": 5.5221,
"mean_token_accuracy": 0.17611446529626845,
"num_tokens": 8065768.0,
"step": 3925
},
{
"entropy": 5.748378419876099,
"epoch": 3.4873501997336884,
"grad_norm": 1.1640625,
"learning_rate": 0.0004154159790647681,
"loss": 5.4649,
"mean_token_accuracy": 0.18407126516103745,
"num_tokens": 8075759.0,
"step": 3930
},
{
"entropy": 5.7725756645202635,
"epoch": 3.4917887261429206,
"grad_norm": 1.234375,
"learning_rate": 0.00041514665465231063,
"loss": 5.4982,
"mean_token_accuracy": 0.18658517599105834,
"num_tokens": 8085658.0,
"step": 3935
},
{
"entropy": 5.741648721694946,
"epoch": 3.4962272525521527,
"grad_norm": 1.1796875,
"learning_rate": 0.00041487700174567036,
"loss": 5.5052,
"mean_token_accuracy": 0.17059303522109986,
"num_tokens": 8096094.0,
"step": 3940
},
{
"entropy": 5.767246150970459,
"epoch": 3.500665778961385,
"grad_norm": 1.1484375,
"learning_rate": 0.00041460702097689535,
"loss": 5.5218,
"mean_token_accuracy": 0.1741237834095955,
"num_tokens": 8106617.0,
"step": 3945
},
{
"entropy": 5.773199129104614,
"epoch": 3.505104305370617,
"grad_norm": 1.234375,
"learning_rate": 0.00041433671297880204,
"loss": 5.5496,
"mean_token_accuracy": 0.16931709200143813,
"num_tokens": 8116621.0,
"step": 3950
},
{
"entropy": 5.806981468200684,
"epoch": 3.509542831779849,
"grad_norm": 1.3046875,
"learning_rate": 0.0004140660783849739,
"loss": 5.5137,
"mean_token_accuracy": 0.17311855256557465,
"num_tokens": 8127433.0,
"step": 3955
},
{
"entropy": 5.786522340774536,
"epoch": 3.5139813581890813,
"grad_norm": 1.1640625,
"learning_rate": 0.00041379511782975995,
"loss": 5.5991,
"mean_token_accuracy": 0.17303308695554734,
"num_tokens": 8138568.0,
"step": 3960
},
{
"entropy": 5.76244478225708,
"epoch": 3.5184198845983135,
"grad_norm": 1.25,
"learning_rate": 0.0004135238319482731,
"loss": 5.5114,
"mean_token_accuracy": 0.18091665506362914,
"num_tokens": 8148358.0,
"step": 3965
},
{
"entropy": 5.7167627811431885,
"epoch": 3.5228584110075456,
"grad_norm": 1.25,
"learning_rate": 0.00041325222137638914,
"loss": 5.3969,
"mean_token_accuracy": 0.18320150971412658,
"num_tokens": 8157817.0,
"step": 3970
},
{
"entropy": 5.775286912918091,
"epoch": 3.5272969374167777,
"grad_norm": 1.3203125,
"learning_rate": 0.0004129802867507444,
"loss": 5.5544,
"mean_token_accuracy": 0.17027477473020552,
"num_tokens": 8167599.0,
"step": 3975
},
{
"entropy": 5.696363019943237,
"epoch": 3.53173546382601,
"grad_norm": 1.140625,
"learning_rate": 0.0004127080287087354,
"loss": 5.5232,
"mean_token_accuracy": 0.17984641939401627,
"num_tokens": 8179004.0,
"step": 3980
},
{
"entropy": 5.784954500198364,
"epoch": 3.536173990235242,
"grad_norm": 1.171875,
"learning_rate": 0.00041243544788851616,
"loss": 5.4638,
"mean_token_accuracy": 0.18233600854873658,
"num_tokens": 8189410.0,
"step": 3985
},
{
"entropy": 5.829836797714234,
"epoch": 3.540612516644474,
"grad_norm": 1.1875,
"learning_rate": 0.00041216254492899753,
"loss": 5.6603,
"mean_token_accuracy": 0.1625197023153305,
"num_tokens": 8200712.0,
"step": 3990
},
{
"entropy": 5.799665212631226,
"epoch": 3.5450510430537063,
"grad_norm": 1.171875,
"learning_rate": 0.0004118893204698454,
"loss": 5.5192,
"mean_token_accuracy": 0.17453998774290086,
"num_tokens": 8209907.0,
"step": 3995
},
{
"entropy": 5.747171545028687,
"epoch": 3.5494895694629385,
"grad_norm": 1.1328125,
"learning_rate": 0.0004116157751514793,
"loss": 5.5106,
"mean_token_accuracy": 0.18200805485248567,
"num_tokens": 8220216.0,
"step": 4000
},
{
"epoch": 3.5494895694629385,
"eval_entropy": 5.639556728462709,
"eval_loss": 6.055363178253174,
"eval_mean_token_accuracy": 0.1559798157377934,
"eval_num_tokens": 8220216.0,
"eval_runtime": 2.6999,
"eval_samples_per_second": 1247.088,
"eval_steps_per_second": 155.932,
"step": 4000
},
{
"entropy": 5.758590269088745,
"epoch": 3.5539280958721706,
"grad_norm": 1.2109375,
"learning_rate": 0.00041134190961507073,
"loss": 5.5321,
"mean_token_accuracy": 0.17542774826288224,
"num_tokens": 8230336.0,
"step": 4005
},
{
"entropy": 5.784881734848023,
"epoch": 3.5583666222814028,
"grad_norm": 1.1328125,
"learning_rate": 0.00041106772450254177,
"loss": 5.4653,
"mean_token_accuracy": 0.17452345192432403,
"num_tokens": 8240874.0,
"step": 4010
},
{
"entropy": 5.783570194244385,
"epoch": 3.562805148690635,
"grad_norm": 1.1875,
"learning_rate": 0.00041079322045656366,
"loss": 5.5892,
"mean_token_accuracy": 0.17384659200906755,
"num_tokens": 8252841.0,
"step": 4015
},
{
"entropy": 5.830329322814942,
"epoch": 3.567243675099867,
"grad_norm": 1.1484375,
"learning_rate": 0.000410518398120555,
"loss": 5.5175,
"mean_token_accuracy": 0.17372012734413148,
"num_tokens": 8263302.0,
"step": 4020
},
{
"entropy": 5.751014280319214,
"epoch": 3.571682201509099,
"grad_norm": 1.2421875,
"learning_rate": 0.00041024325813868065,
"loss": 5.5459,
"mean_token_accuracy": 0.17314320653676987,
"num_tokens": 8274057.0,
"step": 4025
},
{
"entropy": 5.72536072731018,
"epoch": 3.5761207279183314,
"grad_norm": 1.2265625,
"learning_rate": 0.00040996780115584995,
"loss": 5.5958,
"mean_token_accuracy": 0.1759219765663147,
"num_tokens": 8286464.0,
"step": 4030
},
{
"entropy": 5.826333808898926,
"epoch": 3.5805592543275635,
"grad_norm": 1.1015625,
"learning_rate": 0.0004096920278177153,
"loss": 5.5092,
"mean_token_accuracy": 0.18037501573562623,
"num_tokens": 8296892.0,
"step": 4035
},
{
"entropy": 5.790096998214722,
"epoch": 3.5849977807367956,
"grad_norm": 1.171875,
"learning_rate": 0.0004094159387706703,
"loss": 5.5125,
"mean_token_accuracy": 0.18033478856086732,
"num_tokens": 8306657.0,
"step": 4040
},
{
"entropy": 5.824331569671631,
"epoch": 3.589436307146028,
"grad_norm": 1.2109375,
"learning_rate": 0.0004091395346618491,
"loss": 5.6575,
"mean_token_accuracy": 0.16630110293626785,
"num_tokens": 8316827.0,
"step": 4045
},
{
"entropy": 5.805656099319458,
"epoch": 3.5938748335552595,
"grad_norm": 1.2265625,
"learning_rate": 0.00040886281613912396,
"loss": 5.4919,
"mean_token_accuracy": 0.17849037796258926,
"num_tokens": 8328373.0,
"step": 4050
},
{
"entropy": 5.827359437942505,
"epoch": 3.5983133599644916,
"grad_norm": 1.015625,
"learning_rate": 0.0004085857838511042,
"loss": 5.5818,
"mean_token_accuracy": 0.17678980827331542,
"num_tokens": 8341237.0,
"step": 4055
},
{
"entropy": 5.710772895812989,
"epoch": 3.602751886373724,
"grad_norm": 1.0546875,
"learning_rate": 0.00040830843844713447,
"loss": 5.5011,
"mean_token_accuracy": 0.1750195726752281,
"num_tokens": 8352017.0,
"step": 4060
},
{
"entropy": 5.81193175315857,
"epoch": 3.607190412782956,
"grad_norm": 1.1484375,
"learning_rate": 0.00040803078057729354,
"loss": 5.5159,
"mean_token_accuracy": 0.17865791022777558,
"num_tokens": 8362928.0,
"step": 4065
},
{
"entropy": 5.748114824295044,
"epoch": 3.611628939192188,
"grad_norm": 1.3359375,
"learning_rate": 0.0004077528108923924,
"loss": 5.5559,
"mean_token_accuracy": 0.17659952044486998,
"num_tokens": 8373381.0,
"step": 4070
},
{
"entropy": 5.803421354293823,
"epoch": 3.6160674656014202,
"grad_norm": 1.1328125,
"learning_rate": 0.0004074745300439732,
"loss": 5.6322,
"mean_token_accuracy": 0.1618813991546631,
"num_tokens": 8384582.0,
"step": 4075
},
{
"entropy": 5.8019660949707035,
"epoch": 3.6205059920106524,
"grad_norm": 1.34375,
"learning_rate": 0.000407195938684307,
"loss": 5.4872,
"mean_token_accuracy": 0.17608115077018738,
"num_tokens": 8394519.0,
"step": 4080
},
{
"entropy": 5.7562150955200195,
"epoch": 3.6249445184198845,
"grad_norm": 1.203125,
"learning_rate": 0.000406917037466393,
"loss": 5.5079,
"mean_token_accuracy": 0.18082676380872725,
"num_tokens": 8405010.0,
"step": 4085
},
{
"entropy": 5.736172008514404,
"epoch": 3.6293830448291167,
"grad_norm": 1.2421875,
"learning_rate": 0.0004066378270439567,
"loss": 5.4797,
"mean_token_accuracy": 0.18313054293394088,
"num_tokens": 8414933.0,
"step": 4090
},
{
"entropy": 5.825035905838012,
"epoch": 3.633821571238349,
"grad_norm": 1.3984375,
"learning_rate": 0.0004063583080714481,
"loss": 5.4873,
"mean_token_accuracy": 0.17869255542755128,
"num_tokens": 8426086.0,
"step": 4095
},
{
"entropy": 5.788977384567261,
"epoch": 3.638260097647581,
"grad_norm": 1.15625,
"learning_rate": 0.00040607848120404063,
"loss": 5.587,
"mean_token_accuracy": 0.16598645299673082,
"num_tokens": 8436157.0,
"step": 4100
},
{
"entropy": 5.757912921905517,
"epoch": 3.642698624056813,
"grad_norm": 1.3359375,
"learning_rate": 0.0004057983470976293,
"loss": 5.5187,
"mean_token_accuracy": 0.17786410450935364,
"num_tokens": 8446602.0,
"step": 4105
},
{
"entropy": 5.770361804962159,
"epoch": 3.6471371504660453,
"grad_norm": 1.2890625,
"learning_rate": 0.00040551790640882954,
"loss": 5.5779,
"mean_token_accuracy": 0.17473774552345275,
"num_tokens": 8457029.0,
"step": 4110
},
{
"entropy": 5.7793317317962645,
"epoch": 3.6515756768752774,
"grad_norm": 1.1953125,
"learning_rate": 0.00040523715979497486,
"loss": 5.5423,
"mean_token_accuracy": 0.1721513971686363,
"num_tokens": 8466965.0,
"step": 4115
},
{
"entropy": 5.807348728179932,
"epoch": 3.6560142032845095,
"grad_norm": 1.2890625,
"learning_rate": 0.0004049561079141163,
"loss": 5.5432,
"mean_token_accuracy": 0.1787703663110733,
"num_tokens": 8477009.0,
"step": 4120
},
{
"entropy": 5.7499840259552,
"epoch": 3.6604527296937417,
"grad_norm": 1.265625,
"learning_rate": 0.0004046747514250202,
"loss": 5.5504,
"mean_token_accuracy": 0.17546208202838898,
"num_tokens": 8487931.0,
"step": 4125
},
{
"entropy": 5.652848815917968,
"epoch": 3.664891256102974,
"grad_norm": 1.171875,
"learning_rate": 0.0004043930909871671,
"loss": 5.4463,
"mean_token_accuracy": 0.1887633755803108,
"num_tokens": 8498347.0,
"step": 4130
},
{
"entropy": 5.742549324035645,
"epoch": 3.669329782512206,
"grad_norm": 1.25,
"learning_rate": 0.00040411112726074954,
"loss": 5.4154,
"mean_token_accuracy": 0.18402329832315445,
"num_tokens": 8508032.0,
"step": 4135
},
{
"entropy": 5.75079312324524,
"epoch": 3.673768308921438,
"grad_norm": 1.375,
"learning_rate": 0.00040382886090667154,
"loss": 5.4874,
"mean_token_accuracy": 0.1806105464696884,
"num_tokens": 8517279.0,
"step": 4140
},
{
"entropy": 5.771097898483276,
"epoch": 3.6782068353306703,
"grad_norm": 1.2109375,
"learning_rate": 0.0004035462925865459,
"loss": 5.5024,
"mean_token_accuracy": 0.17528152018785476,
"num_tokens": 8526978.0,
"step": 4145
},
{
"entropy": 5.67859206199646,
"epoch": 3.6826453617399024,
"grad_norm": 1.21875,
"learning_rate": 0.00040326342296269363,
"loss": 5.4488,
"mean_token_accuracy": 0.18660874664783478,
"num_tokens": 8537203.0,
"step": 4150
},
{
"entropy": 5.743128395080566,
"epoch": 3.6870838881491346,
"grad_norm": 1.234375,
"learning_rate": 0.00040298025269814165,
"loss": 5.4749,
"mean_token_accuracy": 0.17928291708230973,
"num_tokens": 8548761.0,
"step": 4155
},
{
"entropy": 5.839509391784668,
"epoch": 3.6915224145583667,
"grad_norm": 1.1875,
"learning_rate": 0.0004026967824566218,
"loss": 5.5589,
"mean_token_accuracy": 0.16653368175029754,
"num_tokens": 8559428.0,
"step": 4160
},
{
"entropy": 5.729336977005005,
"epoch": 3.695960940967599,
"grad_norm": 1.1875,
"learning_rate": 0.000402413012902569,
"loss": 5.4503,
"mean_token_accuracy": 0.17860912382602692,
"num_tokens": 8570173.0,
"step": 4165
},
{
"entropy": 5.747783279418945,
"epoch": 3.700399467376831,
"grad_norm": 1.046875,
"learning_rate": 0.00040212894470111966,
"loss": 5.5785,
"mean_token_accuracy": 0.17391075789928437,
"num_tokens": 8581673.0,
"step": 4170
},
{
"entropy": 5.77725305557251,
"epoch": 3.704837993786063,
"grad_norm": 1.2265625,
"learning_rate": 0.0004018445785181102,
"loss": 5.4539,
"mean_token_accuracy": 0.18218168914318084,
"num_tokens": 8591375.0,
"step": 4175
},
{
"entropy": 5.710399770736695,
"epoch": 3.7092765201952953,
"grad_norm": 1.3671875,
"learning_rate": 0.0004015599150200755,
"loss": 5.5329,
"mean_token_accuracy": 0.1777075231075287,
"num_tokens": 8601940.0,
"step": 4180
},
{
"entropy": 5.707136774063111,
"epoch": 3.7137150466045274,
"grad_norm": 1.296875,
"learning_rate": 0.00040127495487424735,
"loss": 5.4598,
"mean_token_accuracy": 0.18140023648738862,
"num_tokens": 8612346.0,
"step": 4185
},
{
"entropy": 5.744045686721802,
"epoch": 3.7181535730137596,
"grad_norm": 1.2265625,
"learning_rate": 0.0004009896987485531,
"loss": 5.5638,
"mean_token_accuracy": 0.17714692652225494,
"num_tokens": 8622994.0,
"step": 4190
},
{
"entropy": 5.775576734542847,
"epoch": 3.7225920994229913,
"grad_norm": 1.265625,
"learning_rate": 0.00040070414731161326,
"loss": 5.5267,
"mean_token_accuracy": 0.1812612682580948,
"num_tokens": 8633684.0,
"step": 4195
},
{
"entropy": 5.662596607208252,
"epoch": 3.7270306258322234,
"grad_norm": 1.2734375,
"learning_rate": 0.00040041830123274105,
"loss": 5.4511,
"mean_token_accuracy": 0.18718448132276536,
"num_tokens": 8642799.0,
"step": 4200
},
{
"entropy": 5.827040672302246,
"epoch": 3.7314691522414556,
"grad_norm": 1.234375,
"learning_rate": 0.0004001321611819401,
"loss": 5.5311,
"mean_token_accuracy": 0.18084388226270676,
"num_tokens": 8652611.0,
"step": 4205
},
{
"entropy": 5.714217329025269,
"epoch": 3.7359076786506877,
"grad_norm": 1.234375,
"learning_rate": 0.0003998457278299033,
"loss": 5.5617,
"mean_token_accuracy": 0.17636579573154448,
"num_tokens": 8662819.0,
"step": 4210
},
{
"entropy": 5.70295467376709,
"epoch": 3.74034620505992,
"grad_norm": 1.21875,
"learning_rate": 0.0003995590018480107,
"loss": 5.4903,
"mean_token_accuracy": 0.18014921694993974,
"num_tokens": 8673276.0,
"step": 4215
},
{
"entropy": 5.848191595077514,
"epoch": 3.744784731469152,
"grad_norm": 1.2109375,
"learning_rate": 0.00039927198390832843,
"loss": 5.6112,
"mean_token_accuracy": 0.1720762312412262,
"num_tokens": 8684106.0,
"step": 4220
},
{
"entropy": 5.776020240783692,
"epoch": 3.749223257878384,
"grad_norm": 1.25,
"learning_rate": 0.000398984674683607,
"loss": 5.4998,
"mean_token_accuracy": 0.1755255162715912,
"num_tokens": 8694533.0,
"step": 4225
},
{
"entropy": 5.738758993148804,
"epoch": 3.7536617842876163,
"grad_norm": 1.2109375,
"learning_rate": 0.0003986970748472795,
"loss": 5.5222,
"mean_token_accuracy": 0.17897798866033554,
"num_tokens": 8704241.0,
"step": 4230
},
{
"entropy": 5.78121862411499,
"epoch": 3.7581003106968485,
"grad_norm": 1.234375,
"learning_rate": 0.0003984091850734604,
"loss": 5.5512,
"mean_token_accuracy": 0.16789624243974685,
"num_tokens": 8714364.0,
"step": 4235
},
{
"entropy": 5.697751045227051,
"epoch": 3.7625388371060806,
"grad_norm": 1.15625,
"learning_rate": 0.0003981210060369435,
"loss": 5.5404,
"mean_token_accuracy": 0.1779459834098816,
"num_tokens": 8724443.0,
"step": 4240
},
{
"entropy": 5.702847146987915,
"epoch": 3.7669773635153128,
"grad_norm": 1.1796875,
"learning_rate": 0.000397832538413201,
"loss": 5.4592,
"mean_token_accuracy": 0.1797871246933937,
"num_tokens": 8733880.0,
"step": 4245
},
{
"entropy": 5.8351147174835205,
"epoch": 3.771415889924545,
"grad_norm": 1.40625,
"learning_rate": 0.0003975437828783811,
"loss": 5.524,
"mean_token_accuracy": 0.1804560035467148,
"num_tokens": 8744437.0,
"step": 4250
},
{
"entropy": 5.753838205337525,
"epoch": 3.775854416333777,
"grad_norm": 1.28125,
"learning_rate": 0.00039725474010930716,
"loss": 5.5152,
"mean_token_accuracy": 0.1822276994585991,
"num_tokens": 8756107.0,
"step": 4255
},
{
"entropy": 5.7022788524627686,
"epoch": 3.780292942743009,
"grad_norm": 1.28125,
"learning_rate": 0.0003969654107834756,
"loss": 5.5006,
"mean_token_accuracy": 0.17494045644998552,
"num_tokens": 8766490.0,
"step": 4260
},
{
"entropy": 5.785413694381714,
"epoch": 3.7847314691522413,
"grad_norm": 1.2265625,
"learning_rate": 0.0003966757955790547,
"loss": 5.4772,
"mean_token_accuracy": 0.18133565336465834,
"num_tokens": 8776401.0,
"step": 4265
},
{
"entropy": 5.750336790084839,
"epoch": 3.7891699955614735,
"grad_norm": 1.515625,
"learning_rate": 0.0003963858951748826,
"loss": 5.5201,
"mean_token_accuracy": 0.1766982913017273,
"num_tokens": 8786816.0,
"step": 4270
},
{
"entropy": 5.6869926929473875,
"epoch": 3.7936085219707056,
"grad_norm": 1.2421875,
"learning_rate": 0.0003960957102504661,
"loss": 5.4366,
"mean_token_accuracy": 0.18434616476297377,
"num_tokens": 8796692.0,
"step": 4275
},
{
"entropy": 5.746105194091797,
"epoch": 3.798047048379938,
"grad_norm": 1.2421875,
"learning_rate": 0.0003958052414859788,
"loss": 5.5203,
"mean_token_accuracy": 0.17907101064920425,
"num_tokens": 8807118.0,
"step": 4280
},
{
"entropy": 5.681885862350464,
"epoch": 3.80248557478917,
"grad_norm": 1.078125,
"learning_rate": 0.0003955144895622597,
"loss": 5.4925,
"mean_token_accuracy": 0.1807284712791443,
"num_tokens": 8817914.0,
"step": 4285
},
{
"entropy": 5.751665019989014,
"epoch": 3.806924101198402,
"grad_norm": 1.1796875,
"learning_rate": 0.0003952234551608114,
"loss": 5.5089,
"mean_token_accuracy": 0.17762693464756013,
"num_tokens": 8828236.0,
"step": 4290
},
{
"entropy": 5.7408606052398685,
"epoch": 3.8113626276076342,
"grad_norm": 1.1953125,
"learning_rate": 0.0003949321389637986,
"loss": 5.4302,
"mean_token_accuracy": 0.18315188437700272,
"num_tokens": 8838911.0,
"step": 4295
},
{
"entropy": 5.7521624088287355,
"epoch": 3.8158011540168664,
"grad_norm": 1.2265625,
"learning_rate": 0.0003946405416540466,
"loss": 5.4319,
"mean_token_accuracy": 0.1811888560652733,
"num_tokens": 8849116.0,
"step": 4300
},
{
"entropy": 5.720421886444091,
"epoch": 3.8202396804260985,
"grad_norm": 1.09375,
"learning_rate": 0.00039434866391503963,
"loss": 5.4994,
"mean_token_accuracy": 0.17618632167577744,
"num_tokens": 8860279.0,
"step": 4305
},
{
"entropy": 5.7000336170196535,
"epoch": 3.8246782068353307,
"grad_norm": 1.28125,
"learning_rate": 0.00039405650643091917,
"loss": 5.5333,
"mean_token_accuracy": 0.18363996148109435,
"num_tokens": 8869910.0,
"step": 4310
},
{
"entropy": 5.730699825286865,
"epoch": 3.829116733244563,
"grad_norm": 1.234375,
"learning_rate": 0.0003937640698864823,
"loss": 5.5585,
"mean_token_accuracy": 0.1803690657019615,
"num_tokens": 8880781.0,
"step": 4315
},
{
"entropy": 5.7924156665802,
"epoch": 3.833555259653795,
"grad_norm": 1.1328125,
"learning_rate": 0.00039347135496718027,
"loss": 5.5631,
"mean_token_accuracy": 0.16978129595518113,
"num_tokens": 8891812.0,
"step": 4320
},
{
"entropy": 5.719081401824951,
"epoch": 3.837993786063027,
"grad_norm": 1.2265625,
"learning_rate": 0.00039317836235911705,
"loss": 5.4632,
"mean_token_accuracy": 0.17845752388238906,
"num_tokens": 8902112.0,
"step": 4325
},
{
"entropy": 5.681349039077759,
"epoch": 3.8424323124722592,
"grad_norm": 1.2421875,
"learning_rate": 0.0003928850927490472,
"loss": 5.4173,
"mean_token_accuracy": 0.18779767602682113,
"num_tokens": 8912009.0,
"step": 4330
},
{
"entropy": 5.729856777191162,
"epoch": 3.8468708388814914,
"grad_norm": 1.390625,
"learning_rate": 0.0003925915468243746,
"loss": 5.4864,
"mean_token_accuracy": 0.18054269552230834,
"num_tokens": 8921986.0,
"step": 4335
},
{
"entropy": 5.698644685745239,
"epoch": 3.8513093652907235,
"grad_norm": 1.1953125,
"learning_rate": 0.00039229772527315073,
"loss": 5.5588,
"mean_token_accuracy": 0.1698625460267067,
"num_tokens": 8932103.0,
"step": 4340
},
{
"entropy": 5.785820150375367,
"epoch": 3.8557478916999557,
"grad_norm": 1.296875,
"learning_rate": 0.0003920036287840734,
"loss": 5.5093,
"mean_token_accuracy": 0.18339616656303406,
"num_tokens": 8942587.0,
"step": 4345
},
{
"entropy": 5.716684341430664,
"epoch": 3.860186418109188,
"grad_norm": 1.125,
"learning_rate": 0.00039170925804648486,
"loss": 5.4901,
"mean_token_accuracy": 0.18353802263736724,
"num_tokens": 8954882.0,
"step": 4350
},
{
"entropy": 5.640814590454101,
"epoch": 3.86462494451842,
"grad_norm": 1.125,
"learning_rate": 0.00039141461375036957,
"loss": 5.4216,
"mean_token_accuracy": 0.1882522866129875,
"num_tokens": 8965400.0,
"step": 4355
},
{
"entropy": 5.732454633712768,
"epoch": 3.869063470927652,
"grad_norm": 1.234375,
"learning_rate": 0.0003911196965863539,
"loss": 5.4433,
"mean_token_accuracy": 0.17967188507318496,
"num_tokens": 8975425.0,
"step": 4360
},
{
"entropy": 5.708558893203735,
"epoch": 3.8735019973368843,
"grad_norm": 1.2421875,
"learning_rate": 0.00039082450724570357,
"loss": 5.5334,
"mean_token_accuracy": 0.17930300831794738,
"num_tokens": 8986111.0,
"step": 4365
},
{
"entropy": 5.737200307846069,
"epoch": 3.8779405237461164,
"grad_norm": 1.1015625,
"learning_rate": 0.0003905290464203221,
"loss": 5.5118,
"mean_token_accuracy": 0.17625806480646133,
"num_tokens": 8996503.0,
"step": 4370
},
{
"entropy": 5.806273937225342,
"epoch": 3.8823790501553486,
"grad_norm": 1.0390625,
"learning_rate": 0.0003902333148027495,
"loss": 5.5558,
"mean_token_accuracy": 0.17663292586803436,
"num_tokens": 9008370.0,
"step": 4375
},
{
"entropy": 5.737713384628296,
"epoch": 3.8868175765645807,
"grad_norm": 1.234375,
"learning_rate": 0.0003899373130861605,
"loss": 5.5651,
"mean_token_accuracy": 0.17326079905033112,
"num_tokens": 9020077.0,
"step": 4380
},
{
"entropy": 5.8152988910675045,
"epoch": 3.891256102973813,
"grad_norm": 1.3359375,
"learning_rate": 0.00038964104196436284,
"loss": 5.5894,
"mean_token_accuracy": 0.17162887006998062,
"num_tokens": 9030627.0,
"step": 4385
},
{
"entropy": 5.762547349929809,
"epoch": 3.895694629383045,
"grad_norm": 1.203125,
"learning_rate": 0.00038934450213179596,
"loss": 5.4845,
"mean_token_accuracy": 0.18070337772369385,
"num_tokens": 9041138.0,
"step": 4390
},
{
"entropy": 5.631207036972046,
"epoch": 3.900133155792277,
"grad_norm": 1.1953125,
"learning_rate": 0.00038904769428352873,
"loss": 5.4612,
"mean_token_accuracy": 0.18537994474172592,
"num_tokens": 9050830.0,
"step": 4395
},
{
"entropy": 5.788889026641845,
"epoch": 3.9045716822015093,
"grad_norm": 1.28125,
"learning_rate": 0.00038875061911525856,
"loss": 5.5402,
"mean_token_accuracy": 0.17427804619073867,
"num_tokens": 9061113.0,
"step": 4400
},
{
"entropy": 5.746660757064819,
"epoch": 3.9090102086107414,
"grad_norm": 1.21875,
"learning_rate": 0.0003884532773233094,
"loss": 5.5819,
"mean_token_accuracy": 0.17695318460464476,
"num_tokens": 9070655.0,
"step": 4405
},
{
"entropy": 5.663952970504761,
"epoch": 3.9134487350199736,
"grad_norm": 1.2890625,
"learning_rate": 0.00038815566960463015,
"loss": 5.3662,
"mean_token_accuracy": 0.18698422610759735,
"num_tokens": 9079019.0,
"step": 4410
},
{
"entropy": 5.727706336975098,
"epoch": 3.9178872614292057,
"grad_norm": 1.1953125,
"learning_rate": 0.00038785779665679275,
"loss": 5.5219,
"mean_token_accuracy": 0.17985262721776962,
"num_tokens": 9089545.0,
"step": 4415
},
{
"entropy": 5.709404706954956,
"epoch": 3.922325787838438,
"grad_norm": 1.21875,
"learning_rate": 0.0003875596591779913,
"loss": 5.4711,
"mean_token_accuracy": 0.17852504402399064,
"num_tokens": 9099539.0,
"step": 4420
},
{
"entropy": 5.659719467163086,
"epoch": 3.92676431424767,
"grad_norm": 1.4296875,
"learning_rate": 0.0003872612578670395,
"loss": 5.432,
"mean_token_accuracy": 0.18161263316869736,
"num_tokens": 9110721.0,
"step": 4425
},
{
"entropy": 5.731282758712768,
"epoch": 3.931202840656902,
"grad_norm": 1.2734375,
"learning_rate": 0.00038696259342336966,
"loss": 5.4644,
"mean_token_accuracy": 0.17836183905601502,
"num_tokens": 9121014.0,
"step": 4430
},
{
"entropy": 5.750094223022461,
"epoch": 3.935641367066134,
"grad_norm": 1.2109375,
"learning_rate": 0.00038666366654703077,
"loss": 5.5449,
"mean_token_accuracy": 0.17551416903734207,
"num_tokens": 9131085.0,
"step": 4435
},
{
"entropy": 5.752908182144165,
"epoch": 3.940079893475366,
"grad_norm": 1.15625,
"learning_rate": 0.00038636447793868715,
"loss": 5.4715,
"mean_token_accuracy": 0.18193041980266572,
"num_tokens": 9140844.0,
"step": 4440
},
{
"entropy": 5.7174254894256595,
"epoch": 3.944518419884598,
"grad_norm": 1.2734375,
"learning_rate": 0.00038606502829961645,
"loss": 5.5679,
"mean_token_accuracy": 0.17696069329977035,
"num_tokens": 9151185.0,
"step": 4445
},
{
"entropy": 5.754332447052002,
"epoch": 3.9489569462938303,
"grad_norm": 1.203125,
"learning_rate": 0.0003857653183317081,
"loss": 5.4548,
"mean_token_accuracy": 0.1789930745959282,
"num_tokens": 9162031.0,
"step": 4450
},
{
"entropy": 5.769329786300659,
"epoch": 3.9533954727030625,
"grad_norm": 1.2890625,
"learning_rate": 0.0003854653487374617,
"loss": 5.5161,
"mean_token_accuracy": 0.17834289520978927,
"num_tokens": 9172896.0,
"step": 4455
},
{
"entropy": 5.715093040466309,
"epoch": 3.9578339991122946,
"grad_norm": 1.2734375,
"learning_rate": 0.0003851651202199856,
"loss": 5.4465,
"mean_token_accuracy": 0.1802556499838829,
"num_tokens": 9182364.0,
"step": 4460
},
{
"entropy": 5.703181409835816,
"epoch": 3.9622725255215268,
"grad_norm": 1.1015625,
"learning_rate": 0.0003848646334829949,
"loss": 5.4415,
"mean_token_accuracy": 0.1801273450255394,
"num_tokens": 9192740.0,
"step": 4465
},
{
"entropy": 5.674679946899414,
"epoch": 3.966711051930759,
"grad_norm": 1.1953125,
"learning_rate": 0.00038456388923081006,
"loss": 5.5164,
"mean_token_accuracy": 0.18230873495340347,
"num_tokens": 9202638.0,
"step": 4470
},
{
"entropy": 5.741348552703857,
"epoch": 3.971149578339991,
"grad_norm": 1.21875,
"learning_rate": 0.00038426288816835485,
"loss": 5.4495,
"mean_token_accuracy": 0.17755311280488967,
"num_tokens": 9212282.0,
"step": 4475
},
{
"entropy": 5.726871204376221,
"epoch": 3.975588104749223,
"grad_norm": 1.15625,
"learning_rate": 0.0003839616310011554,
"loss": 5.5127,
"mean_token_accuracy": 0.17680146396160126,
"num_tokens": 9222352.0,
"step": 4480
},
{
"entropy": 5.784638833999634,
"epoch": 3.9800266311584553,
"grad_norm": 1.375,
"learning_rate": 0.0003836601184353379,
"loss": 5.5881,
"mean_token_accuracy": 0.17251629903912544,
"num_tokens": 9233801.0,
"step": 4485
},
{
"entropy": 5.749805593490601,
"epoch": 3.9844651575676875,
"grad_norm": 1.1796875,
"learning_rate": 0.00038335835117762706,
"loss": 5.5791,
"mean_token_accuracy": 0.17449699193239213,
"num_tokens": 9244265.0,
"step": 4490
},
{
"entropy": 5.760185623168946,
"epoch": 3.9889036839769196,
"grad_norm": 1.3515625,
"learning_rate": 0.00038305632993534483,
"loss": 5.4196,
"mean_token_accuracy": 0.18088131695985793,
"num_tokens": 9254071.0,
"step": 4495
},
{
"entropy": 5.707600259780884,
"epoch": 3.993342210386152,
"grad_norm": 1.3203125,
"learning_rate": 0.00038275405541640835,
"loss": 5.4296,
"mean_token_accuracy": 0.19716665893793106,
"num_tokens": 9264144.0,
"step": 4500
},
{
"epoch": 3.993342210386152,
"eval_entropy": 5.5763132815689485,
"eval_loss": 5.997529983520508,
"eval_mean_token_accuracy": 0.16018386616984343,
"eval_num_tokens": 9264144.0,
"eval_runtime": 2.7056,
"eval_samples_per_second": 1244.433,
"eval_steps_per_second": 155.6,
"step": 4500
},
{
"entropy": 5.701356315612793,
"epoch": 3.997780736795384,
"grad_norm": 1.3359375,
"learning_rate": 0.00038245152832932843,
"loss": 5.5425,
"mean_token_accuracy": 0.1744165375828743,
"num_tokens": 9274514.0,
"step": 4505
},
{
"entropy": 5.850748009151882,
"epoch": 4.001775410563693,
"grad_norm": 1.1640625,
"learning_rate": 0.00038214874938320795,
"loss": 5.5387,
"mean_token_accuracy": 0.17106109195285374,
"num_tokens": 9283806.0,
"step": 4510
},
{
"entropy": 5.729006147384643,
"epoch": 4.006213936972925,
"grad_norm": 1.09375,
"learning_rate": 0.0003818457192877399,
"loss": 5.2642,
"mean_token_accuracy": 0.18925500512123108,
"num_tokens": 9293878.0,
"step": 4515
},
{
"entropy": 5.720128965377808,
"epoch": 4.010652463382157,
"grad_norm": 1.2890625,
"learning_rate": 0.0003815424387532063,
"loss": 5.3185,
"mean_token_accuracy": 0.18909395337104798,
"num_tokens": 9304527.0,
"step": 4520
},
{
"entropy": 5.720921659469605,
"epoch": 4.015090989791389,
"grad_norm": 1.1484375,
"learning_rate": 0.000381238908490476,
"loss": 5.237,
"mean_token_accuracy": 0.18835289925336837,
"num_tokens": 9314726.0,
"step": 4525
},
{
"entropy": 5.692098760604859,
"epoch": 4.019529516200621,
"grad_norm": 1.375,
"learning_rate": 0.00038093512921100306,
"loss": 5.1707,
"mean_token_accuracy": 0.19642118662595748,
"num_tokens": 9324715.0,
"step": 4530
},
{
"entropy": 5.629355716705322,
"epoch": 4.023968042609853,
"grad_norm": 1.265625,
"learning_rate": 0.0003806311016268254,
"loss": 5.1799,
"mean_token_accuracy": 0.19247162342071533,
"num_tokens": 9335237.0,
"step": 4535
},
{
"entropy": 5.7696263790130615,
"epoch": 4.028406569019086,
"grad_norm": 1.1875,
"learning_rate": 0.000380326826450563,
"loss": 5.1995,
"mean_token_accuracy": 0.1953647792339325,
"num_tokens": 9346380.0,
"step": 4540
},
{
"entropy": 5.63343915939331,
"epoch": 4.032845095428318,
"grad_norm": 1.265625,
"learning_rate": 0.00038002230439541603,
"loss": 5.2162,
"mean_token_accuracy": 0.19140224754810334,
"num_tokens": 9357002.0,
"step": 4545
},
{
"entropy": 5.699198818206787,
"epoch": 4.03728362183755,
"grad_norm": 1.1953125,
"learning_rate": 0.00037971753617516336,
"loss": 5.2713,
"mean_token_accuracy": 0.1927043616771698,
"num_tokens": 9367095.0,
"step": 4550
},
{
"entropy": 5.744393634796142,
"epoch": 4.041722148246782,
"grad_norm": 1.2421875,
"learning_rate": 0.00037941252250416074,
"loss": 5.2923,
"mean_token_accuracy": 0.19106441736221313,
"num_tokens": 9376557.0,
"step": 4555
},
{
"entropy": 5.664052677154541,
"epoch": 4.046160674656014,
"grad_norm": 1.2578125,
"learning_rate": 0.00037910726409733965,
"loss": 5.297,
"mean_token_accuracy": 0.18930719494819642,
"num_tokens": 9387355.0,
"step": 4560
},
{
"entropy": 5.69176549911499,
"epoch": 4.050599201065246,
"grad_norm": 1.203125,
"learning_rate": 0.0003788017616702048,
"loss": 5.31,
"mean_token_accuracy": 0.1926235094666481,
"num_tokens": 9398472.0,
"step": 4565
},
{
"entropy": 5.7388163089752195,
"epoch": 4.055037727474478,
"grad_norm": 1.3046875,
"learning_rate": 0.00037849601593883297,
"loss": 5.2272,
"mean_token_accuracy": 0.19727225750684738,
"num_tokens": 9408229.0,
"step": 4570
},
{
"entropy": 5.5694373607635494,
"epoch": 4.059476253883711,
"grad_norm": 1.3125,
"learning_rate": 0.00037819002761987127,
"loss": 5.237,
"mean_token_accuracy": 0.19977665394544603,
"num_tokens": 9418732.0,
"step": 4575
},
{
"entropy": 5.78159465789795,
"epoch": 4.063914780292943,
"grad_norm": 1.1015625,
"learning_rate": 0.0003778837974305355,
"loss": 5.3161,
"mean_token_accuracy": 0.17896658927202225,
"num_tokens": 9429390.0,
"step": 4580
},
{
"entropy": 5.748556661605835,
"epoch": 4.068353306702175,
"grad_norm": 1.1953125,
"learning_rate": 0.00037757732608860824,
"loss": 5.2833,
"mean_token_accuracy": 0.18809683322906495,
"num_tokens": 9440634.0,
"step": 4585
},
{
"entropy": 5.628183794021607,
"epoch": 4.072791833111407,
"grad_norm": 1.4375,
"learning_rate": 0.00037727061431243737,
"loss": 5.3021,
"mean_token_accuracy": 0.18863182365894318,
"num_tokens": 9451523.0,
"step": 4590
},
{
"entropy": 5.795997381210327,
"epoch": 4.077230359520639,
"grad_norm": 1.4375,
"learning_rate": 0.00037696366282093433,
"loss": 5.2465,
"mean_token_accuracy": 0.18781881034374237,
"num_tokens": 9460637.0,
"step": 4595
},
{
"entropy": 5.725009632110596,
"epoch": 4.081668885929871,
"grad_norm": 1.171875,
"learning_rate": 0.00037665647233357243,
"loss": 5.2701,
"mean_token_accuracy": 0.18813904821872712,
"num_tokens": 9472274.0,
"step": 4600
},
{
"entropy": 5.649727058410645,
"epoch": 4.0861074123391035,
"grad_norm": 1.359375,
"learning_rate": 0.0003763490435703853,
"loss": 5.286,
"mean_token_accuracy": 0.1922745645046234,
"num_tokens": 9481508.0,
"step": 4605
},
{
"entropy": 5.73937463760376,
"epoch": 4.090545938748336,
"grad_norm": 1.2109375,
"learning_rate": 0.0003760413772519648,
"loss": 5.2717,
"mean_token_accuracy": 0.18653745353221893,
"num_tokens": 9491111.0,
"step": 4610
},
{
"entropy": 5.665762710571289,
"epoch": 4.094984465157568,
"grad_norm": 1.2734375,
"learning_rate": 0.00037573347409945983,
"loss": 5.2281,
"mean_token_accuracy": 0.19926678538322448,
"num_tokens": 9501499.0,
"step": 4615
},
{
"entropy": 5.729472923278808,
"epoch": 4.0994229915668,
"grad_norm": 1.2734375,
"learning_rate": 0.0003754253348345743,
"loss": 5.3109,
"mean_token_accuracy": 0.18431389182806016,
"num_tokens": 9512770.0,
"step": 4620
},
{
"entropy": 5.63422040939331,
"epoch": 4.103861517976032,
"grad_norm": 1.234375,
"learning_rate": 0.0003751169601795657,
"loss": 5.2295,
"mean_token_accuracy": 0.19330070316791534,
"num_tokens": 9522663.0,
"step": 4625
},
{
"entropy": 5.720160961151123,
"epoch": 4.108300044385264,
"grad_norm": 1.171875,
"learning_rate": 0.00037480835085724313,
"loss": 5.2717,
"mean_token_accuracy": 0.1893833637237549,
"num_tokens": 9532652.0,
"step": 4630
},
{
"entropy": 5.611191701889038,
"epoch": 4.112738570794496,
"grad_norm": 1.171875,
"learning_rate": 0.0003744995075909656,
"loss": 5.2573,
"mean_token_accuracy": 0.19513216018676757,
"num_tokens": 9542632.0,
"step": 4635
},
{
"entropy": 5.735529994964599,
"epoch": 4.1171770972037285,
"grad_norm": 1.171875,
"learning_rate": 0.0003741904311046408,
"loss": 5.2186,
"mean_token_accuracy": 0.19701965749263764,
"num_tokens": 9552182.0,
"step": 4640
},
{
"entropy": 5.659197998046875,
"epoch": 4.121615623612961,
"grad_norm": 1.1953125,
"learning_rate": 0.0003738811221227228,
"loss": 5.2847,
"mean_token_accuracy": 0.19813647866249084,
"num_tokens": 9562570.0,
"step": 4645
},
{
"entropy": 5.602932691574097,
"epoch": 4.126054150022193,
"grad_norm": 1.203125,
"learning_rate": 0.00037357158137021077,
"loss": 5.2181,
"mean_token_accuracy": 0.1899891808629036,
"num_tokens": 9572928.0,
"step": 4650
},
{
"entropy": 5.699469041824341,
"epoch": 4.130492676431425,
"grad_norm": 1.234375,
"learning_rate": 0.000373261809572647,
"loss": 5.1659,
"mean_token_accuracy": 0.20609040707349777,
"num_tokens": 9583387.0,
"step": 4655
},
{
"entropy": 5.673456764221191,
"epoch": 4.134931202840657,
"grad_norm": 1.171875,
"learning_rate": 0.00037295180745611553,
"loss": 5.2844,
"mean_token_accuracy": 0.18709968775510788,
"num_tokens": 9592876.0,
"step": 4660
},
{
"entropy": 5.634208106994629,
"epoch": 4.139369729249889,
"grad_norm": 1.2578125,
"learning_rate": 0.0003726415757472401,
"loss": 5.2281,
"mean_token_accuracy": 0.1973868727684021,
"num_tokens": 9603818.0,
"step": 4665
},
{
"entropy": 5.697757434844971,
"epoch": 4.143808255659121,
"grad_norm": 1.2109375,
"learning_rate": 0.00037233111517318257,
"loss": 5.2405,
"mean_token_accuracy": 0.19370168149471284,
"num_tokens": 9613726.0,
"step": 4670
},
{
"entropy": 5.638398885726929,
"epoch": 4.1482467820683535,
"grad_norm": 1.328125,
"learning_rate": 0.0003720204264616414,
"loss": 5.2381,
"mean_token_accuracy": 0.19537219703197478,
"num_tokens": 9624566.0,
"step": 4675
},
{
"entropy": 5.605507707595825,
"epoch": 4.152685308477586,
"grad_norm": 1.2578125,
"learning_rate": 0.0003717095103408497,
"loss": 5.2355,
"mean_token_accuracy": 0.19357358068227767,
"num_tokens": 9634558.0,
"step": 4680
},
{
"entropy": 5.650458574295044,
"epoch": 4.157123834886818,
"grad_norm": 1.3203125,
"learning_rate": 0.00037139836753957353,
"loss": 5.315,
"mean_token_accuracy": 0.18568638265132903,
"num_tokens": 9644937.0,
"step": 4685
},
{
"entropy": 5.73355770111084,
"epoch": 4.16156236129605,
"grad_norm": 1.265625,
"learning_rate": 0.00037108699878711044,
"loss": 5.3145,
"mean_token_accuracy": 0.18074976205825805,
"num_tokens": 9654407.0,
"step": 4690
},
{
"entropy": 5.638219738006592,
"epoch": 4.166000887705282,
"grad_norm": 1.265625,
"learning_rate": 0.00037077540481328744,
"loss": 5.1966,
"mean_token_accuracy": 0.19675681591033936,
"num_tokens": 9664116.0,
"step": 4695
},
{
"entropy": 5.643871116638183,
"epoch": 4.170439414114514,
"grad_norm": 1.1484375,
"learning_rate": 0.0003704635863484596,
"loss": 5.1979,
"mean_token_accuracy": 0.19657710641622544,
"num_tokens": 9674710.0,
"step": 4700
},
{
"entropy": 5.739799880981446,
"epoch": 4.174877940523746,
"grad_norm": 1.09375,
"learning_rate": 0.00037015154412350806,
"loss": 5.3521,
"mean_token_accuracy": 0.1823303997516632,
"num_tokens": 9685321.0,
"step": 4705
},
{
"entropy": 5.62279691696167,
"epoch": 4.1793164669329785,
"grad_norm": 1.34375,
"learning_rate": 0.00036983927886983847,
"loss": 5.2145,
"mean_token_accuracy": 0.19245072156190873,
"num_tokens": 9694390.0,
"step": 4710
},
{
"entropy": 5.585807514190674,
"epoch": 4.183754993342211,
"grad_norm": 1.3359375,
"learning_rate": 0.00036952679131937923,
"loss": 5.1868,
"mean_token_accuracy": 0.19732326567173003,
"num_tokens": 9703999.0,
"step": 4715
},
{
"entropy": 5.686507225036621,
"epoch": 4.188193519751443,
"grad_norm": 1.21875,
"learning_rate": 0.0003692140822045798,
"loss": 5.257,
"mean_token_accuracy": 0.19399092495441436,
"num_tokens": 9714853.0,
"step": 4720
},
{
"entropy": 5.697870445251465,
"epoch": 4.192632046160675,
"grad_norm": 1.140625,
"learning_rate": 0.00036890115225840904,
"loss": 5.3467,
"mean_token_accuracy": 0.1930564671754837,
"num_tokens": 9726006.0,
"step": 4725
},
{
"entropy": 5.677460718154907,
"epoch": 4.197070572569907,
"grad_norm": 1.1015625,
"learning_rate": 0.0003685880022143533,
"loss": 5.2474,
"mean_token_accuracy": 0.19850908517837523,
"num_tokens": 9735918.0,
"step": 4730
},
{
"entropy": 5.694363260269165,
"epoch": 4.201509098979139,
"grad_norm": 1.1796875,
"learning_rate": 0.00036827463280641494,
"loss": 5.2696,
"mean_token_accuracy": 0.19284430593252183,
"num_tokens": 9746207.0,
"step": 4735
},
{
"entropy": 5.636784505844116,
"epoch": 4.205947625388371,
"grad_norm": 1.328125,
"learning_rate": 0.00036796104476911033,
"loss": 5.2579,
"mean_token_accuracy": 0.19579048752784728,
"num_tokens": 9757076.0,
"step": 4740
},
{
"entropy": 5.693604230880737,
"epoch": 4.210386151797604,
"grad_norm": 1.203125,
"learning_rate": 0.00036764723883746865,
"loss": 5.2048,
"mean_token_accuracy": 0.20219410210847855,
"num_tokens": 9767776.0,
"step": 4745
},
{
"entropy": 5.739891386032104,
"epoch": 4.214824678206836,
"grad_norm": 1.3046875,
"learning_rate": 0.0003673332157470293,
"loss": 5.2705,
"mean_token_accuracy": 0.1894511416554451,
"num_tokens": 9778316.0,
"step": 4750
},
{
"entropy": 5.589966917037964,
"epoch": 4.219263204616068,
"grad_norm": 1.25,
"learning_rate": 0.000367018976233841,
"loss": 5.154,
"mean_token_accuracy": 0.20144910216331482,
"num_tokens": 9788735.0,
"step": 4755
},
{
"entropy": 5.646427965164184,
"epoch": 4.2237017310253,
"grad_norm": 1.4140625,
"learning_rate": 0.0003667045210344598,
"loss": 5.2837,
"mean_token_accuracy": 0.1887564703822136,
"num_tokens": 9799020.0,
"step": 4760
},
{
"entropy": 5.6686927318573,
"epoch": 4.228140257434532,
"grad_norm": 1.2265625,
"learning_rate": 0.0003663898508859471,
"loss": 5.2098,
"mean_token_accuracy": 0.1981448546051979,
"num_tokens": 9810421.0,
"step": 4765
},
{
"entropy": 5.637562465667725,
"epoch": 4.232578783843764,
"grad_norm": 1.203125,
"learning_rate": 0.0003660749665258684,
"loss": 5.2807,
"mean_token_accuracy": 0.18643705397844315,
"num_tokens": 9820816.0,
"step": 4770
},
{
"entropy": 5.656064462661743,
"epoch": 4.237017310252996,
"grad_norm": 1.28125,
"learning_rate": 0.0003657598686922909,
"loss": 5.1875,
"mean_token_accuracy": 0.20534438788890838,
"num_tokens": 9830827.0,
"step": 4775
},
{
"entropy": 5.667426013946534,
"epoch": 4.241455836662228,
"grad_norm": 1.34375,
"learning_rate": 0.0003654445581237824,
"loss": 5.242,
"mean_token_accuracy": 0.18796127587556838,
"num_tokens": 9840928.0,
"step": 4780
},
{
"entropy": 5.566523122787475,
"epoch": 4.245894363071461,
"grad_norm": 1.28125,
"learning_rate": 0.0003651290355594096,
"loss": 5.1411,
"mean_token_accuracy": 0.20217157006263733,
"num_tokens": 9851042.0,
"step": 4785
},
{
"entropy": 5.705053472518921,
"epoch": 4.250332889480692,
"grad_norm": 1.1875,
"learning_rate": 0.0003648133017387356,
"loss": 5.3601,
"mean_token_accuracy": 0.18476287126541138,
"num_tokens": 9862598.0,
"step": 4790
},
{
"entropy": 5.754878854751587,
"epoch": 4.254771415889924,
"grad_norm": 1.2265625,
"learning_rate": 0.00036449735740181884,
"loss": 5.2864,
"mean_token_accuracy": 0.18946309983730317,
"num_tokens": 9872537.0,
"step": 4795
},
{
"entropy": 5.604499864578247,
"epoch": 4.259209942299156,
"grad_norm": 1.328125,
"learning_rate": 0.00036418120328921146,
"loss": 5.2632,
"mean_token_accuracy": 0.190321084856987,
"num_tokens": 9883091.0,
"step": 4800
},
{
"entropy": 5.649293565750122,
"epoch": 4.263648468708388,
"grad_norm": 1.3984375,
"learning_rate": 0.00036386484014195696,
"loss": 5.2218,
"mean_token_accuracy": 0.19319310337305068,
"num_tokens": 9892580.0,
"step": 4805
},
{
"entropy": 5.754296684265137,
"epoch": 4.268086995117621,
"grad_norm": 1.28125,
"learning_rate": 0.0003635482687015891,
"loss": 5.3169,
"mean_token_accuracy": 0.18868042081594466,
"num_tokens": 9902618.0,
"step": 4810
},
{
"entropy": 5.6679424285888675,
"epoch": 4.272525521526853,
"grad_norm": 1.3046875,
"learning_rate": 0.00036323148971012954,
"loss": 5.2416,
"mean_token_accuracy": 0.1906725734472275,
"num_tokens": 9912148.0,
"step": 4815
},
{
"entropy": 5.6508142948150635,
"epoch": 4.276964047936085,
"grad_norm": 1.2421875,
"learning_rate": 0.00036291450391008655,
"loss": 5.3068,
"mean_token_accuracy": 0.18597807735204697,
"num_tokens": 9922843.0,
"step": 4820
},
{
"entropy": 5.685378742218018,
"epoch": 4.281402574345317,
"grad_norm": 1.2109375,
"learning_rate": 0.00036259731204445347,
"loss": 5.2813,
"mean_token_accuracy": 0.1838116839528084,
"num_tokens": 9933503.0,
"step": 4825
},
{
"entropy": 5.6864439964294435,
"epoch": 4.285841100754549,
"grad_norm": 1.3828125,
"learning_rate": 0.0003622799148567061,
"loss": 5.2686,
"mean_token_accuracy": 0.1897219806909561,
"num_tokens": 9943991.0,
"step": 4830
},
{
"entropy": 5.695897388458252,
"epoch": 4.290279627163781,
"grad_norm": 1.484375,
"learning_rate": 0.0003619623130908017,
"loss": 5.244,
"mean_token_accuracy": 0.19663725346326827,
"num_tokens": 9954498.0,
"step": 4835
},
{
"entropy": 5.625618648529053,
"epoch": 4.2947181535730135,
"grad_norm": 1.1953125,
"learning_rate": 0.0003616445074911774,
"loss": 5.3275,
"mean_token_accuracy": 0.18534286618232726,
"num_tokens": 9965206.0,
"step": 4840
},
{
"entropy": 5.635822486877442,
"epoch": 4.299156679982246,
"grad_norm": 1.2578125,
"learning_rate": 0.0003613264988027477,
"loss": 5.2884,
"mean_token_accuracy": 0.19060297310352325,
"num_tokens": 9975214.0,
"step": 4845
},
{
"entropy": 5.659406042098999,
"epoch": 4.303595206391478,
"grad_norm": 1.2265625,
"learning_rate": 0.0003610082877709031,
"loss": 5.286,
"mean_token_accuracy": 0.18736871629953383,
"num_tokens": 9986225.0,
"step": 4850
},
{
"entropy": 5.660641241073608,
"epoch": 4.30803373280071,
"grad_norm": 1.3046875,
"learning_rate": 0.00036068987514150866,
"loss": 5.2555,
"mean_token_accuracy": 0.19821808636188507,
"num_tokens": 9995779.0,
"step": 4855
},
{
"entropy": 5.64681830406189,
"epoch": 4.312472259209942,
"grad_norm": 1.40625,
"learning_rate": 0.00036037126166090167,
"loss": 5.3489,
"mean_token_accuracy": 0.18932785391807555,
"num_tokens": 10007252.0,
"step": 4860
},
{
"entropy": 5.637697410583496,
"epoch": 4.316910785619174,
"grad_norm": 1.2734375,
"learning_rate": 0.0003600524480758906,
"loss": 5.2318,
"mean_token_accuracy": 0.19486922770738602,
"num_tokens": 10017578.0,
"step": 4865
},
{
"entropy": 5.6532087326049805,
"epoch": 4.321349312028406,
"grad_norm": 1.203125,
"learning_rate": 0.00035973343513375254,
"loss": 5.3188,
"mean_token_accuracy": 0.19158722460269928,
"num_tokens": 10027666.0,
"step": 4870
},
{
"entropy": 5.680660104751587,
"epoch": 4.3257878384376385,
"grad_norm": 1.2734375,
"learning_rate": 0.000359414223582232,
"loss": 5.3116,
"mean_token_accuracy": 0.19016897827386856,
"num_tokens": 10037663.0,
"step": 4875
},
{
"entropy": 5.622398471832275,
"epoch": 4.330226364846871,
"grad_norm": 1.3203125,
"learning_rate": 0.0003590948141695392,
"loss": 5.2118,
"mean_token_accuracy": 0.20080626308917998,
"num_tokens": 10046807.0,
"step": 4880
},
{
"entropy": 5.632709121704101,
"epoch": 4.334664891256103,
"grad_norm": 1.3515625,
"learning_rate": 0.0003587752076443479,
"loss": 5.2463,
"mean_token_accuracy": 0.1918161079287529,
"num_tokens": 10056838.0,
"step": 4885
},
{
"entropy": 5.664422035217285,
"epoch": 4.339103417665335,
"grad_norm": 1.4609375,
"learning_rate": 0.0003584554047557939,
"loss": 5.2491,
"mean_token_accuracy": 0.18712048828601838,
"num_tokens": 10067789.0,
"step": 4890
},
{
"entropy": 5.653136253356934,
"epoch": 4.343541944074567,
"grad_norm": 1.2109375,
"learning_rate": 0.00035813540625347334,
"loss": 5.2398,
"mean_token_accuracy": 0.19476775527000428,
"num_tokens": 10077492.0,
"step": 4895
},
{
"entropy": 5.632155656814575,
"epoch": 4.347980470483799,
"grad_norm": 1.203125,
"learning_rate": 0.0003578152128874409,
"loss": 5.2462,
"mean_token_accuracy": 0.19236094504594803,
"num_tokens": 10087609.0,
"step": 4900
},
{
"entropy": 5.652819108963013,
"epoch": 4.352418996893031,
"grad_norm": 1.2734375,
"learning_rate": 0.00035749482540820796,
"loss": 5.3211,
"mean_token_accuracy": 0.1850426435470581,
"num_tokens": 10097566.0,
"step": 4905
},
{
"entropy": 5.714115858078003,
"epoch": 4.3568575233022635,
"grad_norm": 1.2578125,
"learning_rate": 0.00035717424456674086,
"loss": 5.3343,
"mean_token_accuracy": 0.18456389158964157,
"num_tokens": 10108928.0,
"step": 4910
},
{
"entropy": 5.649772787094117,
"epoch": 4.361296049711496,
"grad_norm": 1.21875,
"learning_rate": 0.0003568534711144591,
"loss": 5.2653,
"mean_token_accuracy": 0.1963585063815117,
"num_tokens": 10119017.0,
"step": 4915
},
{
"entropy": 5.679361629486084,
"epoch": 4.365734576120728,
"grad_norm": 1.1640625,
"learning_rate": 0.00035653250580323383,
"loss": 5.2774,
"mean_token_accuracy": 0.19579027891159057,
"num_tokens": 10129162.0,
"step": 4920
},
{
"entropy": 5.689876365661621,
"epoch": 4.37017310252996,
"grad_norm": 1.2265625,
"learning_rate": 0.00035621134938538585,
"loss": 5.2676,
"mean_token_accuracy": 0.18924943059682847,
"num_tokens": 10139477.0,
"step": 4925
},
{
"entropy": 5.679563999176025,
"epoch": 4.374611628939192,
"grad_norm": 1.1640625,
"learning_rate": 0.0003558900026136838,
"loss": 5.3398,
"mean_token_accuracy": 0.18372707217931747,
"num_tokens": 10149787.0,
"step": 4930
},
{
"entropy": 5.606500291824341,
"epoch": 4.379050155348424,
"grad_norm": 1.3125,
"learning_rate": 0.0003555684662413424,
"loss": 5.2255,
"mean_token_accuracy": 0.20049355775117875,
"num_tokens": 10159073.0,
"step": 4935
},
{
"entropy": 5.642777729034424,
"epoch": 4.383488681757656,
"grad_norm": 1.3984375,
"learning_rate": 0.0003552467410220212,
"loss": 5.3377,
"mean_token_accuracy": 0.18747732937335967,
"num_tokens": 10169649.0,
"step": 4940
},
{
"entropy": 5.662962293624878,
"epoch": 4.3879272081668885,
"grad_norm": 1.2734375,
"learning_rate": 0.0003549248277098221,
"loss": 5.2077,
"mean_token_accuracy": 0.20882650166749955,
"num_tokens": 10179207.0,
"step": 4945
},
{
"entropy": 5.672674179077148,
"epoch": 4.392365734576121,
"grad_norm": 1.390625,
"learning_rate": 0.0003546027270592878,
"loss": 5.3379,
"mean_token_accuracy": 0.18902564346790313,
"num_tokens": 10190784.0,
"step": 4950
},
{
"entropy": 5.629483890533447,
"epoch": 4.396804260985353,
"grad_norm": 1.359375,
"learning_rate": 0.00035428043982540017,
"loss": 5.1926,
"mean_token_accuracy": 0.19381997883319854,
"num_tokens": 10200708.0,
"step": 4955
},
{
"entropy": 5.693956756591797,
"epoch": 4.401242787394585,
"grad_norm": 1.6484375,
"learning_rate": 0.00035395796676357855,
"loss": 5.3106,
"mean_token_accuracy": 0.18499992042779922,
"num_tokens": 10212137.0,
"step": 4960
},
{
"entropy": 5.628724479675293,
"epoch": 4.405681313803817,
"grad_norm": 1.0625,
"learning_rate": 0.0003536353086296778,
"loss": 5.2644,
"mean_token_accuracy": 0.1989094153046608,
"num_tokens": 10223298.0,
"step": 4965
},
{
"entropy": 5.661438131332398,
"epoch": 4.410119840213049,
"grad_norm": 1.25,
"learning_rate": 0.00035331246617998654,
"loss": 5.3061,
"mean_token_accuracy": 0.1842536136507988,
"num_tokens": 10233086.0,
"step": 4970
},
{
"entropy": 5.674805450439453,
"epoch": 4.414558366622281,
"grad_norm": 1.3125,
"learning_rate": 0.0003529894401712253,
"loss": 5.3157,
"mean_token_accuracy": 0.19099296629428864,
"num_tokens": 10243579.0,
"step": 4975
},
{
"entropy": 5.70593490600586,
"epoch": 4.4189968930315136,
"grad_norm": 1.3359375,
"learning_rate": 0.00035266623136054505,
"loss": 5.351,
"mean_token_accuracy": 0.18827414959669114,
"num_tokens": 10254027.0,
"step": 4980
},
{
"entropy": 5.577308177947998,
"epoch": 4.423435419440746,
"grad_norm": 1.21875,
"learning_rate": 0.00035234284050552516,
"loss": 5.2328,
"mean_token_accuracy": 0.19931498169898987,
"num_tokens": 10263640.0,
"step": 4985
},
{
"entropy": 5.624858951568603,
"epoch": 4.427873945849978,
"grad_norm": 1.2578125,
"learning_rate": 0.0003520192683641718,
"loss": 5.3176,
"mean_token_accuracy": 0.1865358293056488,
"num_tokens": 10273782.0,
"step": 4990
},
{
"entropy": 5.662206935882568,
"epoch": 4.43231247225921,
"grad_norm": 1.4453125,
"learning_rate": 0.0003516955156949157,
"loss": 5.283,
"mean_token_accuracy": 0.19057476669549941,
"num_tokens": 10283183.0,
"step": 4995
},
{
"entropy": 5.674851894378662,
"epoch": 4.436750998668442,
"grad_norm": 1.1953125,
"learning_rate": 0.00035137158325661115,
"loss": 5.226,
"mean_token_accuracy": 0.19591174125671387,
"num_tokens": 10293423.0,
"step": 5000
},
{
"epoch": 4.436750998668442,
"eval_entropy": 5.567853355634241,
"eval_loss": 5.981941223144531,
"eval_mean_token_accuracy": 0.16250542425627945,
"eval_num_tokens": 10293423.0,
"eval_runtime": 2.7031,
"eval_samples_per_second": 1245.604,
"eval_steps_per_second": 155.747,
"step": 5000
},
{
"entropy": 5.654122638702392,
"epoch": 4.441189525077674,
"grad_norm": 1.2578125,
"learning_rate": 0.00035104747180853376,
"loss": 5.2947,
"mean_token_accuracy": 0.18767934292554855,
"num_tokens": 10303271.0,
"step": 5005
},
{
"entropy": 5.6119753360748295,
"epoch": 4.445628051486906,
"grad_norm": 1.1328125,
"learning_rate": 0.0003507231821103785,
"loss": 5.2817,
"mean_token_accuracy": 0.19101752191781998,
"num_tokens": 10313178.0,
"step": 5010
},
{
"entropy": 5.629220962524414,
"epoch": 4.450066577896139,
"grad_norm": 1.28125,
"learning_rate": 0.00035039871492225814,
"loss": 5.2726,
"mean_token_accuracy": 0.19079317450523375,
"num_tokens": 10322545.0,
"step": 5015
},
{
"entropy": 5.609466409683227,
"epoch": 4.454505104305371,
"grad_norm": 1.3828125,
"learning_rate": 0.00035007407100470187,
"loss": 5.287,
"mean_token_accuracy": 0.19432370364665985,
"num_tokens": 10332409.0,
"step": 5020
},
{
"entropy": 5.683311319351196,
"epoch": 4.458943630714603,
"grad_norm": 1.359375,
"learning_rate": 0.0003497492511186527,
"loss": 5.2575,
"mean_token_accuracy": 0.1963579922914505,
"num_tokens": 10342386.0,
"step": 5025
},
{
"entropy": 5.622466516494751,
"epoch": 4.463382157123835,
"grad_norm": 1.2890625,
"learning_rate": 0.00034942425602546616,
"loss": 5.2756,
"mean_token_accuracy": 0.19172120541334153,
"num_tokens": 10352708.0,
"step": 5030
},
{
"entropy": 5.6206597805023195,
"epoch": 4.467820683533067,
"grad_norm": 1.1953125,
"learning_rate": 0.00034909908648690874,
"loss": 5.2499,
"mean_token_accuracy": 0.1950252041220665,
"num_tokens": 10363012.0,
"step": 5035
},
{
"entropy": 5.630757093429565,
"epoch": 4.472259209942299,
"grad_norm": 1.3125,
"learning_rate": 0.00034877374326515556,
"loss": 5.3145,
"mean_token_accuracy": 0.18441115617752074,
"num_tokens": 10374013.0,
"step": 5040
},
{
"entropy": 5.672241115570069,
"epoch": 4.4766977363515315,
"grad_norm": 1.3046875,
"learning_rate": 0.00034844822712278874,
"loss": 5.2635,
"mean_token_accuracy": 0.19501564651727676,
"num_tokens": 10385113.0,
"step": 5045
},
{
"entropy": 5.62173228263855,
"epoch": 4.481136262760764,
"grad_norm": 1.34375,
"learning_rate": 0.0003481225388227961,
"loss": 5.2596,
"mean_token_accuracy": 0.19639810621738435,
"num_tokens": 10394870.0,
"step": 5050
},
{
"entropy": 5.61270432472229,
"epoch": 4.485574789169996,
"grad_norm": 1.2421875,
"learning_rate": 0.00034779667912856864,
"loss": 5.2597,
"mean_token_accuracy": 0.19666437953710555,
"num_tokens": 10405366.0,
"step": 5055
},
{
"entropy": 5.635061597824096,
"epoch": 4.490013315579228,
"grad_norm": 1.1875,
"learning_rate": 0.0003474706488038993,
"loss": 5.3051,
"mean_token_accuracy": 0.19377691447734832,
"num_tokens": 10416167.0,
"step": 5060
},
{
"entropy": 5.649030971527099,
"epoch": 4.49445184198846,
"grad_norm": 1.2109375,
"learning_rate": 0.00034714444861298077,
"loss": 5.2935,
"mean_token_accuracy": 0.19156765341758727,
"num_tokens": 10426462.0,
"step": 5065
},
{
"entropy": 5.678150844573975,
"epoch": 4.498890368397692,
"grad_norm": 1.3203125,
"learning_rate": 0.00034681807932040407,
"loss": 5.2768,
"mean_token_accuracy": 0.19505888521671294,
"num_tokens": 10436877.0,
"step": 5070
},
{
"entropy": 5.646652936935425,
"epoch": 4.503328894806924,
"grad_norm": 1.2421875,
"learning_rate": 0.0003464915416911565,
"loss": 5.211,
"mean_token_accuracy": 0.1991257518529892,
"num_tokens": 10446825.0,
"step": 5075
},
{
"entropy": 5.607460594177246,
"epoch": 4.5077674212161565,
"grad_norm": 1.2109375,
"learning_rate": 0.00034616483649062003,
"loss": 5.3141,
"mean_token_accuracy": 0.18773615658283233,
"num_tokens": 10457461.0,
"step": 5080
},
{
"entropy": 5.660916757583618,
"epoch": 4.512205947625389,
"grad_norm": 1.203125,
"learning_rate": 0.0003458379644845693,
"loss": 5.2876,
"mean_token_accuracy": 0.19307054132223128,
"num_tokens": 10468536.0,
"step": 5085
},
{
"entropy": 5.569738674163818,
"epoch": 4.516644474034621,
"grad_norm": 1.25,
"learning_rate": 0.0003455109264391699,
"loss": 5.2311,
"mean_token_accuracy": 0.2075985327363014,
"num_tokens": 10477975.0,
"step": 5090
},
{
"entropy": 5.672913312911987,
"epoch": 4.521083000443853,
"grad_norm": 1.21875,
"learning_rate": 0.0003451837231209766,
"loss": 5.3438,
"mean_token_accuracy": 0.1885087013244629,
"num_tokens": 10488778.0,
"step": 5095
},
{
"entropy": 5.656591367721558,
"epoch": 4.525521526853085,
"grad_norm": 1.203125,
"learning_rate": 0.00034485635529693173,
"loss": 5.3156,
"mean_token_accuracy": 0.19488475471735,
"num_tokens": 10499048.0,
"step": 5100
},
{
"entropy": 5.605901145935059,
"epoch": 4.529960053262317,
"grad_norm": 1.109375,
"learning_rate": 0.0003445288237343632,
"loss": 5.2402,
"mean_token_accuracy": 0.194477578997612,
"num_tokens": 10510069.0,
"step": 5105
},
{
"entropy": 5.632487487792969,
"epoch": 4.534398579671549,
"grad_norm": 1.296875,
"learning_rate": 0.00034420112920098247,
"loss": 5.2078,
"mean_token_accuracy": 0.19704542309045792,
"num_tokens": 10519982.0,
"step": 5110
},
{
"entropy": 5.610809469223023,
"epoch": 4.5388371060807815,
"grad_norm": 1.25,
"learning_rate": 0.0003438732724648831,
"loss": 5.2617,
"mean_token_accuracy": 0.19183198362588882,
"num_tokens": 10530557.0,
"step": 5115
},
{
"entropy": 5.6930591583251955,
"epoch": 4.543275632490014,
"grad_norm": 1.1875,
"learning_rate": 0.00034354525429453894,
"loss": 5.3641,
"mean_token_accuracy": 0.19053901880979537,
"num_tokens": 10541868.0,
"step": 5120
},
{
"entropy": 5.725565814971924,
"epoch": 4.547714158899246,
"grad_norm": 1.328125,
"learning_rate": 0.00034321707545880223,
"loss": 5.3051,
"mean_token_accuracy": 0.18928719758987428,
"num_tokens": 10552697.0,
"step": 5125
},
{
"entropy": 5.6639995098114015,
"epoch": 4.552152685308478,
"grad_norm": 1.3359375,
"learning_rate": 0.00034288873672690167,
"loss": 5.3462,
"mean_token_accuracy": 0.18529921025037766,
"num_tokens": 10563589.0,
"step": 5130
},
{
"entropy": 5.6188617706298825,
"epoch": 4.55659121171771,
"grad_norm": 1.3515625,
"learning_rate": 0.00034256023886844076,
"loss": 5.2437,
"mean_token_accuracy": 0.19360621720552446,
"num_tokens": 10573463.0,
"step": 5135
},
{
"entropy": 5.6811785221099855,
"epoch": 4.561029738126942,
"grad_norm": 1.3046875,
"learning_rate": 0.00034223158265339615,
"loss": 5.2545,
"mean_token_accuracy": 0.19319794178009034,
"num_tokens": 10583101.0,
"step": 5140
},
{
"entropy": 5.556000089645385,
"epoch": 4.5654682645361735,
"grad_norm": 1.1171875,
"learning_rate": 0.00034190276885211554,
"loss": 5.2716,
"mean_token_accuracy": 0.18423331677913665,
"num_tokens": 10593690.0,
"step": 5145
},
{
"entropy": 5.635164499282837,
"epoch": 4.5699067909454065,
"grad_norm": 1.2890625,
"learning_rate": 0.0003415737982353159,
"loss": 5.2941,
"mean_token_accuracy": 0.1903964877128601,
"num_tokens": 10603191.0,
"step": 5150
},
{
"entropy": 5.681883096694946,
"epoch": 4.574345317354638,
"grad_norm": 1.2578125,
"learning_rate": 0.000341244671574082,
"loss": 5.3017,
"mean_token_accuracy": 0.18837089836597443,
"num_tokens": 10613659.0,
"step": 5155
},
{
"entropy": 5.564352560043335,
"epoch": 4.578783843763871,
"grad_norm": 1.2734375,
"learning_rate": 0.0003409153896398641,
"loss": 5.1305,
"mean_token_accuracy": 0.20727834850549698,
"num_tokens": 10624045.0,
"step": 5160
},
{
"entropy": 5.673906660079956,
"epoch": 4.583222370173102,
"grad_norm": 1.2109375,
"learning_rate": 0.00034058595320447685,
"loss": 5.3353,
"mean_token_accuracy": 0.17562085539102554,
"num_tokens": 10634158.0,
"step": 5165
},
{
"entropy": 5.61040620803833,
"epoch": 4.587660896582335,
"grad_norm": 1.203125,
"learning_rate": 0.00034025636304009646,
"loss": 5.3226,
"mean_token_accuracy": 0.19618920981884003,
"num_tokens": 10645080.0,
"step": 5170
},
{
"entropy": 5.631897068023681,
"epoch": 4.592099422991566,
"grad_norm": 1.3828125,
"learning_rate": 0.0003399266199192597,
"loss": 5.2425,
"mean_token_accuracy": 0.19404248893260956,
"num_tokens": 10655623.0,
"step": 5175
},
{
"entropy": 5.641080236434936,
"epoch": 4.596537949400799,
"grad_norm": 1.2421875,
"learning_rate": 0.0003395967246148622,
"loss": 5.2854,
"mean_token_accuracy": 0.18656337410211563,
"num_tokens": 10666685.0,
"step": 5180
},
{
"entropy": 5.587111949920654,
"epoch": 4.600976475810031,
"grad_norm": 1.4296875,
"learning_rate": 0.00033926667790015584,
"loss": 5.2656,
"mean_token_accuracy": 0.19923681169748306,
"num_tokens": 10675809.0,
"step": 5185
},
{
"entropy": 5.662479639053345,
"epoch": 4.605415002219264,
"grad_norm": 1.359375,
"learning_rate": 0.0003389364805487476,
"loss": 5.3413,
"mean_token_accuracy": 0.18461865037679673,
"num_tokens": 10685260.0,
"step": 5190
},
{
"entropy": 5.611877202987671,
"epoch": 4.609853528628495,
"grad_norm": 1.140625,
"learning_rate": 0.00033860613333459757,
"loss": 5.2462,
"mean_token_accuracy": 0.19999865740537642,
"num_tokens": 10696091.0,
"step": 5195
},
{
"entropy": 5.605573225021362,
"epoch": 4.614292055037727,
"grad_norm": 1.1328125,
"learning_rate": 0.0003382756370320169,
"loss": 5.2886,
"mean_token_accuracy": 0.19352062195539474,
"num_tokens": 10706583.0,
"step": 5200
},
{
"entropy": 5.739141893386841,
"epoch": 4.618730581446959,
"grad_norm": 1.34375,
"learning_rate": 0.0003379449924156664,
"loss": 5.2623,
"mean_token_accuracy": 0.1936701849102974,
"num_tokens": 10716065.0,
"step": 5205
},
{
"entropy": 5.683768081665039,
"epoch": 4.623169107856191,
"grad_norm": 1.28125,
"learning_rate": 0.0003376142002605547,
"loss": 5.2843,
"mean_token_accuracy": 0.19705345034599303,
"num_tokens": 10726230.0,
"step": 5210
},
{
"entropy": 5.640566396713257,
"epoch": 4.6276076342654235,
"grad_norm": 1.2109375,
"learning_rate": 0.0003372832613420356,
"loss": 5.2944,
"mean_token_accuracy": 0.19027775526046753,
"num_tokens": 10737465.0,
"step": 5215
},
{
"entropy": 5.639433574676514,
"epoch": 4.632046160674656,
"grad_norm": 1.21875,
"learning_rate": 0.0003369521764358075,
"loss": 5.2702,
"mean_token_accuracy": 0.19792116135358812,
"num_tokens": 10747528.0,
"step": 5220
},
{
"entropy": 5.6411927223205565,
"epoch": 4.636484687083888,
"grad_norm": 1.28125,
"learning_rate": 0.0003366209463179109,
"loss": 5.3429,
"mean_token_accuracy": 0.1818401500582695,
"num_tokens": 10758029.0,
"step": 5225
},
{
"entropy": 5.640262508392334,
"epoch": 4.64092321349312,
"grad_norm": 1.296875,
"learning_rate": 0.0003362895717647265,
"loss": 5.2086,
"mean_token_accuracy": 0.19509417563676834,
"num_tokens": 10767966.0,
"step": 5230
},
{
"entropy": 5.618955183029175,
"epoch": 4.645361739902352,
"grad_norm": 1.1953125,
"learning_rate": 0.0003359580535529735,
"loss": 5.3655,
"mean_token_accuracy": 0.19132119715213775,
"num_tokens": 10778109.0,
"step": 5235
},
{
"entropy": 5.642926549911499,
"epoch": 4.649800266311584,
"grad_norm": 1.25,
"learning_rate": 0.00033562639245970807,
"loss": 5.1965,
"mean_token_accuracy": 0.20074644684791565,
"num_tokens": 10788208.0,
"step": 5240
},
{
"entropy": 5.67922830581665,
"epoch": 4.654238792720816,
"grad_norm": 1.4375,
"learning_rate": 0.00033529458926232105,
"loss": 5.3116,
"mean_token_accuracy": 0.18762012124061583,
"num_tokens": 10798708.0,
"step": 5245
},
{
"entropy": 5.60074291229248,
"epoch": 4.658677319130049,
"grad_norm": 1.1875,
"learning_rate": 0.0003349626447385366,
"loss": 5.2437,
"mean_token_accuracy": 0.19076474905014038,
"num_tokens": 10809605.0,
"step": 5250
},
{
"entropy": 5.638704633712768,
"epoch": 4.663115845539281,
"grad_norm": 1.296875,
"learning_rate": 0.0003346305596664099,
"loss": 5.2174,
"mean_token_accuracy": 0.19353772103786468,
"num_tokens": 10818983.0,
"step": 5255
},
{
"entropy": 5.607289361953735,
"epoch": 4.667554371948513,
"grad_norm": 1.2421875,
"learning_rate": 0.00033429833482432567,
"loss": 5.2177,
"mean_token_accuracy": 0.20427365750074386,
"num_tokens": 10827765.0,
"step": 5260
},
{
"entropy": 5.592062091827392,
"epoch": 4.671992898357745,
"grad_norm": 1.328125,
"learning_rate": 0.00033396597099099624,
"loss": 5.2666,
"mean_token_accuracy": 0.1946563631296158,
"num_tokens": 10837505.0,
"step": 5265
},
{
"entropy": 5.60541524887085,
"epoch": 4.676431424766977,
"grad_norm": 1.3828125,
"learning_rate": 0.00033363346894545984,
"loss": 5.2645,
"mean_token_accuracy": 0.19506226778030394,
"num_tokens": 10847882.0,
"step": 5270
},
{
"entropy": 5.595429611206055,
"epoch": 4.680869951176209,
"grad_norm": 1.3515625,
"learning_rate": 0.00033330082946707827,
"loss": 5.2496,
"mean_token_accuracy": 0.19965140521526337,
"num_tokens": 10857798.0,
"step": 5275
},
{
"entropy": 5.6422858238220215,
"epoch": 4.6853084775854414,
"grad_norm": 1.3359375,
"learning_rate": 0.000332968053335536,
"loss": 5.3098,
"mean_token_accuracy": 0.18733831942081453,
"num_tokens": 10868709.0,
"step": 5280
},
{
"entropy": 5.637231636047363,
"epoch": 4.689747003994674,
"grad_norm": 1.2109375,
"learning_rate": 0.00033263514133083757,
"loss": 5.2483,
"mean_token_accuracy": 0.19040373861789703,
"num_tokens": 10879745.0,
"step": 5285
},
{
"entropy": 5.613223361968994,
"epoch": 4.694185530403906,
"grad_norm": 1.2421875,
"learning_rate": 0.00033230209423330587,
"loss": 5.2751,
"mean_token_accuracy": 0.19259334802627565,
"num_tokens": 10890562.0,
"step": 5290
},
{
"entropy": 5.669538974761963,
"epoch": 4.698624056813138,
"grad_norm": 1.359375,
"learning_rate": 0.0003319689128235804,
"loss": 5.274,
"mean_token_accuracy": 0.18844619989395142,
"num_tokens": 10900576.0,
"step": 5295
},
{
"entropy": 5.690864086151123,
"epoch": 4.70306258322237,
"grad_norm": 1.140625,
"learning_rate": 0.00033163559788261575,
"loss": 5.3173,
"mean_token_accuracy": 0.18966183066368103,
"num_tokens": 10912183.0,
"step": 5300
},
{
"entropy": 5.565565013885498,
"epoch": 4.707501109631602,
"grad_norm": 1.359375,
"learning_rate": 0.0003313021501916795,
"loss": 5.1953,
"mean_token_accuracy": 0.2010662868618965,
"num_tokens": 10921856.0,
"step": 5305
},
{
"entropy": 5.677471017837524,
"epoch": 4.711939636040834,
"grad_norm": 1.3203125,
"learning_rate": 0.00033096857053235016,
"loss": 5.3378,
"mean_token_accuracy": 0.18726189136505128,
"num_tokens": 10932534.0,
"step": 5310
},
{
"entropy": 5.641095590591431,
"epoch": 4.7163781624500665,
"grad_norm": 1.2734375,
"learning_rate": 0.00033063485968651545,
"loss": 5.249,
"mean_token_accuracy": 0.1999572589993477,
"num_tokens": 10943188.0,
"step": 5315
},
{
"entropy": 5.6503016471862795,
"epoch": 4.720816688859299,
"grad_norm": 1.234375,
"learning_rate": 0.0003303010184363711,
"loss": 5.3246,
"mean_token_accuracy": 0.18445967882871628,
"num_tokens": 10953602.0,
"step": 5320
},
{
"entropy": 5.6475958824157715,
"epoch": 4.725255215268531,
"grad_norm": 1.328125,
"learning_rate": 0.00032996704756441803,
"loss": 5.2699,
"mean_token_accuracy": 0.19611910581588746,
"num_tokens": 10963397.0,
"step": 5325
},
{
"entropy": 5.53646068572998,
"epoch": 4.729693741677763,
"grad_norm": 1.234375,
"learning_rate": 0.0003296329478534612,
"loss": 5.2109,
"mean_token_accuracy": 0.20465768426656722,
"num_tokens": 10973643.0,
"step": 5330
},
{
"entropy": 5.630436706542969,
"epoch": 4.734132268086995,
"grad_norm": 1.328125,
"learning_rate": 0.0003292987200866075,
"loss": 5.2402,
"mean_token_accuracy": 0.19249440282583236,
"num_tokens": 10983667.0,
"step": 5335
},
{
"entropy": 5.588424873352051,
"epoch": 4.738570794496227,
"grad_norm": 1.5234375,
"learning_rate": 0.0003289643650472639,
"loss": 5.2597,
"mean_token_accuracy": 0.19734693318605423,
"num_tokens": 10993373.0,
"step": 5340
},
{
"entropy": 5.59550290107727,
"epoch": 4.743009320905459,
"grad_norm": 1.296875,
"learning_rate": 0.0003286298835191358,
"loss": 5.3057,
"mean_token_accuracy": 0.1939626529812813,
"num_tokens": 11003388.0,
"step": 5345
},
{
"entropy": 5.582844638824463,
"epoch": 4.7474478473146915,
"grad_norm": 1.3046875,
"learning_rate": 0.00032829527628622517,
"loss": 5.179,
"mean_token_accuracy": 0.20016789436340332,
"num_tokens": 11014436.0,
"step": 5350
},
{
"entropy": 5.695787811279297,
"epoch": 4.751886373723924,
"grad_norm": 1.2109375,
"learning_rate": 0.00032796054413282834,
"loss": 5.3532,
"mean_token_accuracy": 0.1878980353474617,
"num_tokens": 11025065.0,
"step": 5355
},
{
"entropy": 5.6283598899841305,
"epoch": 4.756324900133156,
"grad_norm": 1.328125,
"learning_rate": 0.0003276256878435347,
"loss": 5.1878,
"mean_token_accuracy": 0.19970009326934815,
"num_tokens": 11033959.0,
"step": 5360
},
{
"entropy": 5.6868609428405765,
"epoch": 4.760763426542388,
"grad_norm": 1.3359375,
"learning_rate": 0.0003272907082032244,
"loss": 5.2691,
"mean_token_accuracy": 0.1895872637629509,
"num_tokens": 11043662.0,
"step": 5365
},
{
"entropy": 5.6718062400817875,
"epoch": 4.76520195295162,
"grad_norm": 1.3671875,
"learning_rate": 0.00032695560599706706,
"loss": 5.4886,
"mean_token_accuracy": 0.1745270237326622,
"num_tokens": 11055351.0,
"step": 5370
},
{
"entropy": 5.6680046081542965,
"epoch": 4.769640479360852,
"grad_norm": 1.34375,
"learning_rate": 0.00032662038201051915,
"loss": 5.2491,
"mean_token_accuracy": 0.19356611073017121,
"num_tokens": 11065937.0,
"step": 5375
},
{
"entropy": 5.6382208347320555,
"epoch": 4.774079005770084,
"grad_norm": 1.3671875,
"learning_rate": 0.00032628503702932275,
"loss": 5.2965,
"mean_token_accuracy": 0.19127077460289002,
"num_tokens": 11075983.0,
"step": 5380
},
{
"entropy": 5.617775297164917,
"epoch": 4.7785175321793165,
"grad_norm": 1.2578125,
"learning_rate": 0.0003259495718395038,
"loss": 5.3317,
"mean_token_accuracy": 0.19082656055688857,
"num_tokens": 11086818.0,
"step": 5385
},
{
"entropy": 5.631493854522705,
"epoch": 4.782956058588549,
"grad_norm": 1.2265625,
"learning_rate": 0.0003256139872273696,
"loss": 5.2669,
"mean_token_accuracy": 0.19227593392133713,
"num_tokens": 11097941.0,
"step": 5390
},
{
"entropy": 5.673382186889649,
"epoch": 4.787394584997781,
"grad_norm": 1.1796875,
"learning_rate": 0.00032527828397950763,
"loss": 5.2502,
"mean_token_accuracy": 0.1887993887066841,
"num_tokens": 11108155.0,
"step": 5395
},
{
"entropy": 5.588239288330078,
"epoch": 4.791833111407013,
"grad_norm": 1.3125,
"learning_rate": 0.0003249424628827834,
"loss": 5.3165,
"mean_token_accuracy": 0.1904405176639557,
"num_tokens": 11117822.0,
"step": 5400
},
{
"entropy": 5.672802591323853,
"epoch": 4.796271637816245,
"grad_norm": 1.2109375,
"learning_rate": 0.00032460652472433854,
"loss": 5.2608,
"mean_token_accuracy": 0.19372894912958144,
"num_tokens": 11128322.0,
"step": 5405
},
{
"entropy": 5.715357065200806,
"epoch": 4.800710164225477,
"grad_norm": 1.234375,
"learning_rate": 0.00032427047029158924,
"loss": 5.3032,
"mean_token_accuracy": 0.19178959727287292,
"num_tokens": 11138528.0,
"step": 5410
},
{
"entropy": 5.588251304626465,
"epoch": 4.805148690634709,
"grad_norm": 1.265625,
"learning_rate": 0.0003239343003722239,
"loss": 5.3395,
"mean_token_accuracy": 0.19131782352924348,
"num_tokens": 11150124.0,
"step": 5415
},
{
"entropy": 5.695693492889404,
"epoch": 4.8095872170439415,
"grad_norm": 1.1484375,
"learning_rate": 0.000323598015754202,
"loss": 5.2757,
"mean_token_accuracy": 0.19160598665475845,
"num_tokens": 11160864.0,
"step": 5420
},
{
"entropy": 5.612943649291992,
"epoch": 4.814025743453174,
"grad_norm": 1.203125,
"learning_rate": 0.0003232616172257518,
"loss": 5.291,
"mean_token_accuracy": 0.19477419108152388,
"num_tokens": 11172273.0,
"step": 5425
},
{
"entropy": 5.536879062652588,
"epoch": 4.818464269862406,
"grad_norm": 1.1796875,
"learning_rate": 0.00032292510557536844,
"loss": 5.2375,
"mean_token_accuracy": 0.18924187272787094,
"num_tokens": 11182367.0,
"step": 5430
},
{
"entropy": 5.6457702159881595,
"epoch": 4.822902796271638,
"grad_norm": 1.3046875,
"learning_rate": 0.000322588481591812,
"loss": 5.2336,
"mean_token_accuracy": 0.19279612451791764,
"num_tokens": 11193196.0,
"step": 5435
},
{
"entropy": 5.646676540374756,
"epoch": 4.82734132268087,
"grad_norm": 1.2265625,
"learning_rate": 0.00032225174606410634,
"loss": 5.2909,
"mean_token_accuracy": 0.19228778928518295,
"num_tokens": 11202926.0,
"step": 5440
},
{
"entropy": 5.68856406211853,
"epoch": 4.831779849090102,
"grad_norm": 1.359375,
"learning_rate": 0.00032191489978153646,
"loss": 5.3878,
"mean_token_accuracy": 0.18282851576805115,
"num_tokens": 11213548.0,
"step": 5445
},
{
"entropy": 5.6710638999938965,
"epoch": 4.836218375499334,
"grad_norm": 1.2421875,
"learning_rate": 0.0003215779435336471,
"loss": 5.23,
"mean_token_accuracy": 0.19917183816432954,
"num_tokens": 11223404.0,
"step": 5450
},
{
"entropy": 5.577983474731445,
"epoch": 4.840656901908567,
"grad_norm": 1.21875,
"learning_rate": 0.0003212408781102404,
"loss": 5.2642,
"mean_token_accuracy": 0.19608746469020844,
"num_tokens": 11233586.0,
"step": 5455
},
{
"entropy": 5.603341770172119,
"epoch": 4.845095428317799,
"grad_norm": 1.3359375,
"learning_rate": 0.0003209037043013751,
"loss": 5.1927,
"mean_token_accuracy": 0.197077240049839,
"num_tokens": 11243816.0,
"step": 5460
},
{
"entropy": 5.606571054458618,
"epoch": 4.849533954727031,
"grad_norm": 1.265625,
"learning_rate": 0.0003205664228973632,
"loss": 5.2969,
"mean_token_accuracy": 0.18979629129171371,
"num_tokens": 11253451.0,
"step": 5465
},
{
"entropy": 5.66569504737854,
"epoch": 4.853972481136263,
"grad_norm": 1.2578125,
"learning_rate": 0.0003202290346887696,
"loss": 5.304,
"mean_token_accuracy": 0.18910456597805023,
"num_tokens": 11263985.0,
"step": 5470
},
{
"entropy": 5.622323417663575,
"epoch": 4.858411007545495,
"grad_norm": 1.1640625,
"learning_rate": 0.0003198915404664088,
"loss": 5.2887,
"mean_token_accuracy": 0.18854654878377913,
"num_tokens": 11274557.0,
"step": 5475
},
{
"entropy": 5.629386043548584,
"epoch": 4.862849533954727,
"grad_norm": 1.2421875,
"learning_rate": 0.00031955394102134454,
"loss": 5.227,
"mean_token_accuracy": 0.19979529976844787,
"num_tokens": 11284220.0,
"step": 5480
},
{
"entropy": 5.553300237655639,
"epoch": 4.8672880603639594,
"grad_norm": 1.3984375,
"learning_rate": 0.0003192162371448868,
"loss": 5.2902,
"mean_token_accuracy": 0.18757660388946534,
"num_tokens": 11295281.0,
"step": 5485
},
{
"entropy": 5.592968368530274,
"epoch": 4.871726586773192,
"grad_norm": 1.171875,
"learning_rate": 0.00031887842962859033,
"loss": 5.2361,
"mean_token_accuracy": 0.19308489561080933,
"num_tokens": 11305483.0,
"step": 5490
},
{
"entropy": 5.710874938964844,
"epoch": 4.876165113182424,
"grad_norm": 1.1875,
"learning_rate": 0.00031854051926425277,
"loss": 5.2688,
"mean_token_accuracy": 0.19588978737592697,
"num_tokens": 11315236.0,
"step": 5495
},
{
"entropy": 5.636416244506836,
"epoch": 4.880603639591656,
"grad_norm": 1.2421875,
"learning_rate": 0.00031820250684391304,
"loss": 5.3134,
"mean_token_accuracy": 0.1919151797890663,
"num_tokens": 11325729.0,
"step": 5500
},
{
"epoch": 4.880603639591656,
"eval_entropy": 5.471726274830146,
"eval_loss": 5.943048000335693,
"eval_mean_token_accuracy": 0.16503392612990744,
"eval_num_tokens": 11325729.0,
"eval_runtime": 2.6952,
"eval_samples_per_second": 1249.263,
"eval_steps_per_second": 156.204,
"step": 5500
},
{
"entropy": 5.542026567459106,
"epoch": 4.885042166000888,
"grad_norm": 1.3125,
"learning_rate": 0.00031786439315984925,
"loss": 5.2973,
"mean_token_accuracy": 0.19267825186252593,
"num_tokens": 11335368.0,
"step": 5505
},
{
"entropy": 5.6588369846344,
"epoch": 4.88948069241012,
"grad_norm": 1.21875,
"learning_rate": 0.00031752617900457656,
"loss": 5.2859,
"mean_token_accuracy": 0.18471840023994446,
"num_tokens": 11344696.0,
"step": 5510
},
{
"entropy": 5.695864963531494,
"epoch": 4.893919218819352,
"grad_norm": 1.34375,
"learning_rate": 0.000317187865170846,
"loss": 5.3761,
"mean_token_accuracy": 0.17981996685266494,
"num_tokens": 11355391.0,
"step": 5515
},
{
"entropy": 5.603839492797851,
"epoch": 4.8983577452285845,
"grad_norm": 1.3203125,
"learning_rate": 0.000316849452451642,
"loss": 5.2798,
"mean_token_accuracy": 0.19502321481704712,
"num_tokens": 11365493.0,
"step": 5520
},
{
"entropy": 5.586929035186768,
"epoch": 4.902796271637817,
"grad_norm": 1.3125,
"learning_rate": 0.00031651094164018097,
"loss": 5.2471,
"mean_token_accuracy": 0.1947021484375,
"num_tokens": 11376192.0,
"step": 5525
},
{
"entropy": 5.642178583145141,
"epoch": 4.907234798047049,
"grad_norm": 1.1796875,
"learning_rate": 0.0003161723335299089,
"loss": 5.3408,
"mean_token_accuracy": 0.19162992835044862,
"num_tokens": 11386920.0,
"step": 5530
},
{
"entropy": 5.631239175796509,
"epoch": 4.911673324456281,
"grad_norm": 1.34375,
"learning_rate": 0.0003158336289145003,
"loss": 5.2499,
"mean_token_accuracy": 0.19778143465518952,
"num_tokens": 11396668.0,
"step": 5535
},
{
"entropy": 5.675585317611694,
"epoch": 4.916111850865512,
"grad_norm": 1.2578125,
"learning_rate": 0.00031549482858785554,
"loss": 5.3227,
"mean_token_accuracy": 0.184337118268013,
"num_tokens": 11407479.0,
"step": 5540
},
{
"entropy": 5.624910354614258,
"epoch": 4.920550377274745,
"grad_norm": 1.1640625,
"learning_rate": 0.00031515593334409934,
"loss": 5.2995,
"mean_token_accuracy": 0.19436507821083068,
"num_tokens": 11417431.0,
"step": 5545
},
{
"entropy": 5.6332221031188965,
"epoch": 4.9249889036839765,
"grad_norm": 1.1953125,
"learning_rate": 0.0003148169439775792,
"loss": 5.2554,
"mean_token_accuracy": 0.19847005605697632,
"num_tokens": 11427262.0,
"step": 5550
},
{
"entropy": 5.664980173110962,
"epoch": 4.9294274300932095,
"grad_norm": 1.21875,
"learning_rate": 0.00031447786128286286,
"loss": 5.2158,
"mean_token_accuracy": 0.19394159615039824,
"num_tokens": 11437958.0,
"step": 5555
},
{
"entropy": 5.560730075836181,
"epoch": 4.933865956502441,
"grad_norm": 1.265625,
"learning_rate": 0.0003141386860547371,
"loss": 5.2121,
"mean_token_accuracy": 0.2035077393054962,
"num_tokens": 11447233.0,
"step": 5560
},
{
"entropy": 5.6375902652740475,
"epoch": 4.938304482911674,
"grad_norm": 1.421875,
"learning_rate": 0.0003137994190882054,
"loss": 5.3308,
"mean_token_accuracy": 0.18119245618581772,
"num_tokens": 11458458.0,
"step": 5565
},
{
"entropy": 5.6583921909332275,
"epoch": 4.942743009320905,
"grad_norm": 1.1953125,
"learning_rate": 0.0003134600611784865,
"loss": 5.3601,
"mean_token_accuracy": 0.19218487590551375,
"num_tokens": 11469197.0,
"step": 5570
},
{
"entropy": 5.685963153839111,
"epoch": 4.947181535730138,
"grad_norm": 1.3203125,
"learning_rate": 0.0003131206131210119,
"loss": 5.3439,
"mean_token_accuracy": 0.18568494468927382,
"num_tokens": 11479103.0,
"step": 5575
},
{
"entropy": 5.6125835418701175,
"epoch": 4.951620062139369,
"grad_norm": 1.3515625,
"learning_rate": 0.0003127810757114249,
"loss": 5.26,
"mean_token_accuracy": 0.19918753504753112,
"num_tokens": 11489205.0,
"step": 5580
},
{
"entropy": 5.633475351333618,
"epoch": 4.9560585885486015,
"grad_norm": 1.1640625,
"learning_rate": 0.00031244144974557775,
"loss": 5.2449,
"mean_token_accuracy": 0.2015002354979515,
"num_tokens": 11498441.0,
"step": 5585
},
{
"entropy": 5.5904388427734375,
"epoch": 4.960497114957834,
"grad_norm": 1.2421875,
"learning_rate": 0.0003121017360195308,
"loss": 5.2319,
"mean_token_accuracy": 0.20153346359729768,
"num_tokens": 11509109.0,
"step": 5590
},
{
"entropy": 5.630889749526977,
"epoch": 4.964935641367066,
"grad_norm": 1.5703125,
"learning_rate": 0.00031176193532954957,
"loss": 5.2786,
"mean_token_accuracy": 0.19114782959222792,
"num_tokens": 11518979.0,
"step": 5595
},
{
"entropy": 5.634117698669433,
"epoch": 4.969374167776298,
"grad_norm": 1.203125,
"learning_rate": 0.0003114220484721038,
"loss": 5.3592,
"mean_token_accuracy": 0.18462447971105575,
"num_tokens": 11529236.0,
"step": 5600
},
{
"entropy": 5.653819942474366,
"epoch": 4.97381269418553,
"grad_norm": 1.203125,
"learning_rate": 0.00031108207624386486,
"loss": 5.2658,
"mean_token_accuracy": 0.1887330949306488,
"num_tokens": 11538992.0,
"step": 5605
},
{
"entropy": 5.611984825134277,
"epoch": 4.978251220594762,
"grad_norm": 1.2578125,
"learning_rate": 0.0003107420194417047,
"loss": 5.2459,
"mean_token_accuracy": 0.19865258336067199,
"num_tokens": 11549033.0,
"step": 5610
},
{
"entropy": 5.648901462554932,
"epoch": 4.982689747003994,
"grad_norm": 1.2109375,
"learning_rate": 0.000310401878862693,
"loss": 5.3271,
"mean_token_accuracy": 0.19301538914442062,
"num_tokens": 11559386.0,
"step": 5615
},
{
"entropy": 5.537397050857544,
"epoch": 4.9871282734132265,
"grad_norm": 1.2734375,
"learning_rate": 0.0003100616553040962,
"loss": 5.1865,
"mean_token_accuracy": 0.1997347354888916,
"num_tokens": 11570101.0,
"step": 5620
},
{
"entropy": 5.666191101074219,
"epoch": 4.991566799822459,
"grad_norm": 1.234375,
"learning_rate": 0.00030972134956337493,
"loss": 5.2824,
"mean_token_accuracy": 0.19162117540836335,
"num_tokens": 11580081.0,
"step": 5625
},
{
"entropy": 5.675402212142944,
"epoch": 4.996005326231691,
"grad_norm": 1.1953125,
"learning_rate": 0.00030938096243818275,
"loss": 5.2921,
"mean_token_accuracy": 0.1961108550429344,
"num_tokens": 11590285.0,
"step": 5630
},
{
"entropy": 5.6483564376831055,
"epoch": 5.0,
"grad_norm": 2.109375,
"learning_rate": 0.00030904049472636367,
"loss": 5.3088,
"mean_token_accuracy": 0.18876984549893272,
"num_tokens": 11598630.0,
"step": 5635
},
{
"entropy": 5.578065586090088,
"epoch": 5.004438526409232,
"grad_norm": 1.1640625,
"learning_rate": 0.00030869994722595095,
"loss": 5.133,
"mean_token_accuracy": 0.20324181020259857,
"num_tokens": 11608750.0,
"step": 5640
},
{
"entropy": 5.601625633239746,
"epoch": 5.008877052818464,
"grad_norm": 1.34375,
"learning_rate": 0.0003083593207351644,
"loss": 5.0247,
"mean_token_accuracy": 0.2162548914551735,
"num_tokens": 11619429.0,
"step": 5645
},
{
"entropy": 5.6836292266845705,
"epoch": 5.013315579227696,
"grad_norm": 1.2734375,
"learning_rate": 0.0003080186160524095,
"loss": 5.0634,
"mean_token_accuracy": 0.2087712988257408,
"num_tokens": 11628940.0,
"step": 5650
},
{
"entropy": 5.647754287719726,
"epoch": 5.017754105636929,
"grad_norm": 1.328125,
"learning_rate": 0.0003076778339762745,
"loss": 5.1085,
"mean_token_accuracy": 0.19888755679130554,
"num_tokens": 11639635.0,
"step": 5655
},
{
"entropy": 5.679539012908935,
"epoch": 5.022192632046161,
"grad_norm": 1.34375,
"learning_rate": 0.00030733697530552955,
"loss": 5.1282,
"mean_token_accuracy": 0.20206331312656403,
"num_tokens": 11649565.0,
"step": 5660
},
{
"entropy": 5.57519793510437,
"epoch": 5.026631158455393,
"grad_norm": 1.3203125,
"learning_rate": 0.0003069960408391239,
"loss": 4.9929,
"mean_token_accuracy": 0.21066118031740189,
"num_tokens": 11658805.0,
"step": 5665
},
{
"entropy": 5.607788848876953,
"epoch": 5.031069684864625,
"grad_norm": 1.3671875,
"learning_rate": 0.00030665503137618466,
"loss": 5.0327,
"mean_token_accuracy": 0.20983841568231582,
"num_tokens": 11667875.0,
"step": 5670
},
{
"entropy": 5.608612155914306,
"epoch": 5.035508211273857,
"grad_norm": 1.3046875,
"learning_rate": 0.0003063139477160147,
"loss": 5.0269,
"mean_token_accuracy": 0.20639787912368773,
"num_tokens": 11678397.0,
"step": 5675
},
{
"entropy": 5.621532392501831,
"epoch": 5.039946737683089,
"grad_norm": 1.296875,
"learning_rate": 0.00030597279065809103,
"loss": 5.0719,
"mean_token_accuracy": 0.19961849600076675,
"num_tokens": 11688672.0,
"step": 5680
},
{
"entropy": 5.607308101654053,
"epoch": 5.0443852640923215,
"grad_norm": 1.28125,
"learning_rate": 0.0003056315610020622,
"loss": 5.0717,
"mean_token_accuracy": 0.20271217823028564,
"num_tokens": 11698807.0,
"step": 5685
},
{
"entropy": 5.604615497589111,
"epoch": 5.048823790501554,
"grad_norm": 1.2890625,
"learning_rate": 0.0003052902595477474,
"loss": 4.9989,
"mean_token_accuracy": 0.2087470233440399,
"num_tokens": 11708332.0,
"step": 5690
},
{
"entropy": 5.51806411743164,
"epoch": 5.053262316910786,
"grad_norm": 1.328125,
"learning_rate": 0.00030494888709513377,
"loss": 4.9813,
"mean_token_accuracy": 0.2174397587776184,
"num_tokens": 11717509.0,
"step": 5695
},
{
"entropy": 5.486528110504151,
"epoch": 5.057700843320018,
"grad_norm": 1.296875,
"learning_rate": 0.0003046074444443751,
"loss": 4.9325,
"mean_token_accuracy": 0.22246583700180053,
"num_tokens": 11727447.0,
"step": 5700
},
{
"entropy": 5.590923547744751,
"epoch": 5.06213936972925,
"grad_norm": 1.2578125,
"learning_rate": 0.00030426593239578966,
"loss": 5.0835,
"mean_token_accuracy": 0.2037480965256691,
"num_tokens": 11738068.0,
"step": 5705
},
{
"entropy": 5.598885774612427,
"epoch": 5.066577896138482,
"grad_norm": 1.3046875,
"learning_rate": 0.0003039243517498583,
"loss": 4.9602,
"mean_token_accuracy": 0.21319418251514435,
"num_tokens": 11748867.0,
"step": 5710
},
{
"entropy": 5.641113233566284,
"epoch": 5.071016422547714,
"grad_norm": 1.3203125,
"learning_rate": 0.0003035827033072228,
"loss": 5.089,
"mean_token_accuracy": 0.2028583437204361,
"num_tokens": 11758217.0,
"step": 5715
},
{
"entropy": 5.616635942459107,
"epoch": 5.0754549489569465,
"grad_norm": 1.234375,
"learning_rate": 0.00030324098786868364,
"loss": 5.1001,
"mean_token_accuracy": 0.20311024636030198,
"num_tokens": 11768656.0,
"step": 5720
},
{
"entropy": 5.558078241348267,
"epoch": 5.079893475366179,
"grad_norm": 1.3828125,
"learning_rate": 0.00030289920623519854,
"loss": 5.02,
"mean_token_accuracy": 0.2149716630578041,
"num_tokens": 11779222.0,
"step": 5725
},
{
"entropy": 5.502596426010132,
"epoch": 5.084332001775411,
"grad_norm": 1.171875,
"learning_rate": 0.0003025573592078803,
"loss": 4.9762,
"mean_token_accuracy": 0.21715585589408876,
"num_tokens": 11789489.0,
"step": 5730
},
{
"entropy": 5.6058704376220705,
"epoch": 5.088770528184643,
"grad_norm": 1.390625,
"learning_rate": 0.000302215447587995,
"loss": 5.0407,
"mean_token_accuracy": 0.205974081158638,
"num_tokens": 11799365.0,
"step": 5735
},
{
"entropy": 5.550213241577149,
"epoch": 5.093209054593875,
"grad_norm": 1.3046875,
"learning_rate": 0.00030187347217696005,
"loss": 5.0634,
"mean_token_accuracy": 0.21454951018095017,
"num_tokens": 11810871.0,
"step": 5740
},
{
"entropy": 5.64659538269043,
"epoch": 5.097647581003107,
"grad_norm": 1.1015625,
"learning_rate": 0.00030153143377634244,
"loss": 5.1786,
"mean_token_accuracy": 0.19919128865003585,
"num_tokens": 11822320.0,
"step": 5745
},
{
"entropy": 5.516408824920655,
"epoch": 5.102086107412339,
"grad_norm": 1.2109375,
"learning_rate": 0.0003011893331878569,
"loss": 4.9717,
"mean_token_accuracy": 0.21831310093402861,
"num_tokens": 11832823.0,
"step": 5750
},
{
"entropy": 5.581918239593506,
"epoch": 5.1065246338215715,
"grad_norm": 1.2265625,
"learning_rate": 0.00030084717121336383,
"loss": 5.0316,
"mean_token_accuracy": 0.2116502895951271,
"num_tokens": 11842963.0,
"step": 5755
},
{
"entropy": 5.584142208099365,
"epoch": 5.110963160230804,
"grad_norm": 1.453125,
"learning_rate": 0.00030050494865486744,
"loss": 5.0307,
"mean_token_accuracy": 0.2093645766377449,
"num_tokens": 11853795.0,
"step": 5760
},
{
"entropy": 5.592232656478882,
"epoch": 5.115401686640036,
"grad_norm": 1.3828125,
"learning_rate": 0.0003001626663145141,
"loss": 5.0086,
"mean_token_accuracy": 0.20560475587844848,
"num_tokens": 11863392.0,
"step": 5765
},
{
"entropy": 5.547612714767456,
"epoch": 5.119840213049268,
"grad_norm": 1.25,
"learning_rate": 0.00029982032499459017,
"loss": 5.008,
"mean_token_accuracy": 0.21953772604465485,
"num_tokens": 11873182.0,
"step": 5770
},
{
"entropy": 5.585672092437744,
"epoch": 5.1242787394585,
"grad_norm": 1.2578125,
"learning_rate": 0.00029947792549752034,
"loss": 5.0224,
"mean_token_accuracy": 0.20585456043481826,
"num_tokens": 11883611.0,
"step": 5775
},
{
"entropy": 5.526079797744751,
"epoch": 5.128717265867732,
"grad_norm": 1.296875,
"learning_rate": 0.00029913546862586567,
"loss": 5.0221,
"mean_token_accuracy": 0.20663823187351227,
"num_tokens": 11893378.0,
"step": 5780
},
{
"entropy": 5.615198993682862,
"epoch": 5.133155792276964,
"grad_norm": 1.2890625,
"learning_rate": 0.0002987929551823215,
"loss": 5.1043,
"mean_token_accuracy": 0.19898212403059007,
"num_tokens": 11904167.0,
"step": 5785
},
{
"entropy": 5.590409278869629,
"epoch": 5.1375943186861965,
"grad_norm": 1.2890625,
"learning_rate": 0.0002984503859697162,
"loss": 5.0604,
"mean_token_accuracy": 0.19891392439603806,
"num_tokens": 11914414.0,
"step": 5790
},
{
"entropy": 5.534732341766357,
"epoch": 5.142032845095429,
"grad_norm": 1.3046875,
"learning_rate": 0.0002981077617910085,
"loss": 5.0314,
"mean_token_accuracy": 0.2104380398988724,
"num_tokens": 11925065.0,
"step": 5795
},
{
"entropy": 5.566891670227051,
"epoch": 5.146471371504661,
"grad_norm": 1.359375,
"learning_rate": 0.00029776508344928597,
"loss": 5.0835,
"mean_token_accuracy": 0.2008894294500351,
"num_tokens": 11934452.0,
"step": 5800
},
{
"entropy": 5.629260444641114,
"epoch": 5.150909897913893,
"grad_norm": 1.21875,
"learning_rate": 0.0002974223517477633,
"loss": 5.1517,
"mean_token_accuracy": 0.19960906356573105,
"num_tokens": 11945233.0,
"step": 5805
},
{
"entropy": 5.649737453460693,
"epoch": 5.155348424323125,
"grad_norm": 1.359375,
"learning_rate": 0.0002970795674897802,
"loss": 5.0896,
"mean_token_accuracy": 0.19956457167863845,
"num_tokens": 11955846.0,
"step": 5810
},
{
"entropy": 5.536502981185913,
"epoch": 5.159786950732357,
"grad_norm": 1.40625,
"learning_rate": 0.0002967367314787995,
"loss": 5.0534,
"mean_token_accuracy": 0.2123357966542244,
"num_tokens": 11965617.0,
"step": 5815
},
{
"entropy": 5.543145799636841,
"epoch": 5.164225477141589,
"grad_norm": 1.265625,
"learning_rate": 0.00029639384451840545,
"loss": 5.0238,
"mean_token_accuracy": 0.2106179490685463,
"num_tokens": 11975720.0,
"step": 5820
},
{
"entropy": 5.607858180999756,
"epoch": 5.168664003550822,
"grad_norm": 1.3046875,
"learning_rate": 0.0002960509074123015,
"loss": 5.0567,
"mean_token_accuracy": 0.20483888536691666,
"num_tokens": 11985240.0,
"step": 5825
},
{
"entropy": 5.573398208618164,
"epoch": 5.173102529960053,
"grad_norm": 1.2734375,
"learning_rate": 0.000295707920964309,
"loss": 5.03,
"mean_token_accuracy": 0.21344470232725143,
"num_tokens": 11995723.0,
"step": 5830
},
{
"entropy": 5.524889850616455,
"epoch": 5.177541056369286,
"grad_norm": 1.2421875,
"learning_rate": 0.0002953648859783646,
"loss": 5.0129,
"mean_token_accuracy": 0.2085215851664543,
"num_tokens": 12004369.0,
"step": 5835
},
{
"entropy": 5.590805339813232,
"epoch": 5.181979582778517,
"grad_norm": 1.0390625,
"learning_rate": 0.0002950218032585191,
"loss": 5.1073,
"mean_token_accuracy": 0.20238737761974335,
"num_tokens": 12015179.0,
"step": 5840
},
{
"entropy": 5.597344923019409,
"epoch": 5.186418109187749,
"grad_norm": 1.1875,
"learning_rate": 0.0002946786736089346,
"loss": 5.058,
"mean_token_accuracy": 0.20639242827892304,
"num_tokens": 12025871.0,
"step": 5845
},
{
"entropy": 5.620744848251343,
"epoch": 5.190856635596981,
"grad_norm": 1.2890625,
"learning_rate": 0.0002943354978338838,
"loss": 5.139,
"mean_token_accuracy": 0.20422376394271852,
"num_tokens": 12036467.0,
"step": 5850
},
{
"entropy": 5.626263284683228,
"epoch": 5.1952951620062136,
"grad_norm": 1.28125,
"learning_rate": 0.0002939922767377472,
"loss": 5.0605,
"mean_token_accuracy": 0.20900676995515824,
"num_tokens": 12047048.0,
"step": 5855
},
{
"entropy": 5.614035606384277,
"epoch": 5.199733688415446,
"grad_norm": 1.3828125,
"learning_rate": 0.0002936490111250116,
"loss": 5.0232,
"mean_token_accuracy": 0.21099703162908554,
"num_tokens": 12055958.0,
"step": 5860
},
{
"entropy": 5.497699499130249,
"epoch": 5.204172214824678,
"grad_norm": 1.34375,
"learning_rate": 0.0002933057018002681,
"loss": 5.0886,
"mean_token_accuracy": 0.20526396930217744,
"num_tokens": 12067045.0,
"step": 5865
},
{
"entropy": 5.527740383148194,
"epoch": 5.20861074123391,
"grad_norm": 1.296875,
"learning_rate": 0.00029296234956821044,
"loss": 5.0447,
"mean_token_accuracy": 0.2035256266593933,
"num_tokens": 12077615.0,
"step": 5870
},
{
"entropy": 5.631336879730225,
"epoch": 5.213049267643142,
"grad_norm": 1.2265625,
"learning_rate": 0.0002926189552336326,
"loss": 5.1111,
"mean_token_accuracy": 0.20148058980703354,
"num_tokens": 12087704.0,
"step": 5875
},
{
"entropy": 5.588882112503052,
"epoch": 5.217487794052374,
"grad_norm": 1.328125,
"learning_rate": 0.0002922755196014277,
"loss": 5.0818,
"mean_token_accuracy": 0.20626674145460128,
"num_tokens": 12098006.0,
"step": 5880
},
{
"entropy": 5.643190526962281,
"epoch": 5.221926320461606,
"grad_norm": 1.3671875,
"learning_rate": 0.000291932043476585,
"loss": 5.096,
"mean_token_accuracy": 0.2011096343398094,
"num_tokens": 12108289.0,
"step": 5885
},
{
"entropy": 5.525919628143311,
"epoch": 5.226364846870839,
"grad_norm": 1.3046875,
"learning_rate": 0.0002915885276641895,
"loss": 5.0037,
"mean_token_accuracy": 0.21124742925167084,
"num_tokens": 12118389.0,
"step": 5890
},
{
"entropy": 5.558362579345703,
"epoch": 5.230803373280071,
"grad_norm": 1.203125,
"learning_rate": 0.00029124497296941843,
"loss": 5.0267,
"mean_token_accuracy": 0.209383824467659,
"num_tokens": 12129551.0,
"step": 5895
},
{
"entropy": 5.573451709747315,
"epoch": 5.235241899689303,
"grad_norm": 1.3359375,
"learning_rate": 0.00029090138019754075,
"loss": 5.0837,
"mean_token_accuracy": 0.20430581122636796,
"num_tokens": 12141097.0,
"step": 5900
},
{
"entropy": 5.607167053222656,
"epoch": 5.239680426098535,
"grad_norm": 1.25,
"learning_rate": 0.0002905577501539144,
"loss": 5.0633,
"mean_token_accuracy": 0.2045643150806427,
"num_tokens": 12150664.0,
"step": 5905
},
{
"entropy": 5.617243003845215,
"epoch": 5.244118952507767,
"grad_norm": 1.625,
"learning_rate": 0.0002902140836439847,
"loss": 5.1259,
"mean_token_accuracy": 0.20352842658758163,
"num_tokens": 12161483.0,
"step": 5910
},
{
"entropy": 5.538080930709839,
"epoch": 5.248557478916999,
"grad_norm": 1.1796875,
"learning_rate": 0.0002898703814732824,
"loss": 4.9657,
"mean_token_accuracy": 0.2118803322315216,
"num_tokens": 12171364.0,
"step": 5915
},
{
"entropy": 5.553083276748657,
"epoch": 5.2529960053262315,
"grad_norm": 1.1953125,
"learning_rate": 0.00028952664444742204,
"loss": 5.0186,
"mean_token_accuracy": 0.21196339577436446,
"num_tokens": 12181375.0,
"step": 5920
},
{
"entropy": 5.6105516910552975,
"epoch": 5.257434531735464,
"grad_norm": 1.28125,
"learning_rate": 0.0002891828733720996,
"loss": 5.1144,
"mean_token_accuracy": 0.20475836247205734,
"num_tokens": 12192225.0,
"step": 5925
},
{
"entropy": 5.535951709747314,
"epoch": 5.261873058144696,
"grad_norm": 1.3125,
"learning_rate": 0.00028883906905309103,
"loss": 5.0363,
"mean_token_accuracy": 0.2053716629743576,
"num_tokens": 12202386.0,
"step": 5930
},
{
"entropy": 5.593074989318848,
"epoch": 5.266311584553928,
"grad_norm": 1.3203125,
"learning_rate": 0.0002884952322962502,
"loss": 5.1044,
"mean_token_accuracy": 0.200898414850235,
"num_tokens": 12213358.0,
"step": 5935
},
{
"entropy": 5.485325574874878,
"epoch": 5.27075011096316,
"grad_norm": 1.34375,
"learning_rate": 0.00028815136390750694,
"loss": 5.0031,
"mean_token_accuracy": 0.21439032703638078,
"num_tokens": 12223819.0,
"step": 5940
},
{
"entropy": 5.638899469375611,
"epoch": 5.275188637372392,
"grad_norm": 1.2578125,
"learning_rate": 0.0002878074646928653,
"loss": 5.1032,
"mean_token_accuracy": 0.2074124902486801,
"num_tokens": 12234973.0,
"step": 5945
},
{
"entropy": 5.598820209503174,
"epoch": 5.279627163781624,
"grad_norm": 1.4921875,
"learning_rate": 0.0002874635354584015,
"loss": 5.101,
"mean_token_accuracy": 0.20702701508998872,
"num_tokens": 12246819.0,
"step": 5950
},
{
"entropy": 5.623632478713989,
"epoch": 5.2840656901908565,
"grad_norm": 1.3125,
"learning_rate": 0.0002871195770102621,
"loss": 5.1166,
"mean_token_accuracy": 0.20531850755214692,
"num_tokens": 12256195.0,
"step": 5955
},
{
"entropy": 5.573619079589844,
"epoch": 5.288504216600089,
"grad_norm": 1.3203125,
"learning_rate": 0.0002867755901546624,
"loss": 5.1343,
"mean_token_accuracy": 0.19836855828762054,
"num_tokens": 12267105.0,
"step": 5960
},
{
"entropy": 5.5811749458312985,
"epoch": 5.292942743009321,
"grad_norm": 1.2109375,
"learning_rate": 0.00028643157569788386,
"loss": 5.1259,
"mean_token_accuracy": 0.20249876379966736,
"num_tokens": 12277534.0,
"step": 5965
},
{
"entropy": 5.604808521270752,
"epoch": 5.297381269418553,
"grad_norm": 1.2734375,
"learning_rate": 0.00028608753444627307,
"loss": 5.0402,
"mean_token_accuracy": 0.2057702973484993,
"num_tokens": 12287342.0,
"step": 5970
},
{
"entropy": 5.6337807178497314,
"epoch": 5.301819795827785,
"grad_norm": 1.125,
"learning_rate": 0.000285743467206239,
"loss": 5.1331,
"mean_token_accuracy": 0.19976214617490767,
"num_tokens": 12299127.0,
"step": 5975
},
{
"entropy": 5.579834604263306,
"epoch": 5.306258322237017,
"grad_norm": 1.3203125,
"learning_rate": 0.00028539937478425196,
"loss": 5.096,
"mean_token_accuracy": 0.2002892404794693,
"num_tokens": 12309186.0,
"step": 5980
},
{
"entropy": 5.6033408641815186,
"epoch": 5.310696848646249,
"grad_norm": 1.3671875,
"learning_rate": 0.0002850552579868409,
"loss": 5.0645,
"mean_token_accuracy": 0.20565202087163925,
"num_tokens": 12319246.0,
"step": 5985
},
{
"entropy": 5.6327873229980465,
"epoch": 5.3151353750554815,
"grad_norm": 1.4453125,
"learning_rate": 0.0002847111176205922,
"loss": 5.1272,
"mean_token_accuracy": 0.20285700708627702,
"num_tokens": 12330328.0,
"step": 5990
},
{
"entropy": 5.524570274353027,
"epoch": 5.319573901464714,
"grad_norm": 1.421875,
"learning_rate": 0.0002843669544921473,
"loss": 5.0906,
"mean_token_accuracy": 0.2001372069120407,
"num_tokens": 12339554.0,
"step": 5995
},
{
"entropy": 5.553857755661011,
"epoch": 5.324012427873946,
"grad_norm": 1.28125,
"learning_rate": 0.0002840227694082011,
"loss": 5.1673,
"mean_token_accuracy": 0.19471082091331482,
"num_tokens": 12350925.0,
"step": 6000
},
{
"epoch": 5.324012427873946,
"eval_entropy": 5.546145657745506,
"eval_loss": 5.925079822540283,
"eval_mean_token_accuracy": 0.16672020655063438,
"eval_num_tokens": 12350925.0,
"eval_runtime": 2.6935,
"eval_samples_per_second": 1250.037,
"eval_steps_per_second": 156.301,
"step": 6000
},
{
"entropy": 5.662134456634521,
"epoch": 5.328450954283178,
"grad_norm": 1.28125,
"learning_rate": 0.0002836785631754998,
"loss": 5.0496,
"mean_token_accuracy": 0.20719179511070251,
"num_tokens": 12361140.0,
"step": 6005
},
{
"entropy": 5.548701333999634,
"epoch": 5.33288948069241,
"grad_norm": 1.4296875,
"learning_rate": 0.0002833343366008396,
"loss": 5.084,
"mean_token_accuracy": 0.2034963384270668,
"num_tokens": 12370794.0,
"step": 6010
},
{
"entropy": 5.6618561267852785,
"epoch": 5.337328007101642,
"grad_norm": 1.25,
"learning_rate": 0.00028299009049106364,
"loss": 5.1648,
"mean_token_accuracy": 0.1947068303823471,
"num_tokens": 12382211.0,
"step": 6015
},
{
"entropy": 5.5460282325744625,
"epoch": 5.341766533510874,
"grad_norm": 1.2578125,
"learning_rate": 0.0002826458256530617,
"loss": 5.0251,
"mean_token_accuracy": 0.213189934194088,
"num_tokens": 12391749.0,
"step": 6020
},
{
"entropy": 5.591916704177857,
"epoch": 5.3462050599201065,
"grad_norm": 1.3515625,
"learning_rate": 0.00028230154289376677,
"loss": 5.1025,
"mean_token_accuracy": 0.1996217891573906,
"num_tokens": 12401607.0,
"step": 6025
},
{
"entropy": 5.566343593597412,
"epoch": 5.350643586329339,
"grad_norm": 1.203125,
"learning_rate": 0.0002819572430201542,
"loss": 5.1012,
"mean_token_accuracy": 0.20017844587564468,
"num_tokens": 12412025.0,
"step": 6030
},
{
"entropy": 5.591163396835327,
"epoch": 5.355082112738571,
"grad_norm": 1.3046875,
"learning_rate": 0.0002816129268392393,
"loss": 5.119,
"mean_token_accuracy": 0.20444039404392242,
"num_tokens": 12421674.0,
"step": 6035
},
{
"entropy": 5.638062381744385,
"epoch": 5.359520639147803,
"grad_norm": 1.3359375,
"learning_rate": 0.00028126859515807575,
"loss": 5.1834,
"mean_token_accuracy": 0.19409443587064742,
"num_tokens": 12431439.0,
"step": 6040
},
{
"entropy": 5.653153753280639,
"epoch": 5.363959165557035,
"grad_norm": 1.265625,
"learning_rate": 0.00028092424878375347,
"loss": 5.0666,
"mean_token_accuracy": 0.2100761964917183,
"num_tokens": 12440914.0,
"step": 6045
},
{
"entropy": 5.571391248703003,
"epoch": 5.368397691966267,
"grad_norm": 1.3515625,
"learning_rate": 0.00028057988852339677,
"loss": 5.0766,
"mean_token_accuracy": 0.20178451091051103,
"num_tokens": 12451397.0,
"step": 6050
},
{
"entropy": 5.618826103210449,
"epoch": 5.372836218375499,
"grad_norm": 1.3828125,
"learning_rate": 0.0002802355151841627,
"loss": 5.0942,
"mean_token_accuracy": 0.1956700414419174,
"num_tokens": 12461609.0,
"step": 6055
},
{
"entropy": 5.555040407180786,
"epoch": 5.3772747447847316,
"grad_norm": 1.3046875,
"learning_rate": 0.00027989112957323874,
"loss": 5.114,
"mean_token_accuracy": 0.2043379083275795,
"num_tokens": 12471388.0,
"step": 6060
},
{
"entropy": 5.5462562084198,
"epoch": 5.381713271193964,
"grad_norm": 1.265625,
"learning_rate": 0.00027954673249784123,
"loss": 5.0682,
"mean_token_accuracy": 0.20022315084934234,
"num_tokens": 12480955.0,
"step": 6065
},
{
"entropy": 5.499785852432251,
"epoch": 5.386151797603196,
"grad_norm": 1.2265625,
"learning_rate": 0.0002792023247652135,
"loss": 5.0221,
"mean_token_accuracy": 0.20753575265407562,
"num_tokens": 12491056.0,
"step": 6070
},
{
"entropy": 5.607504510879517,
"epoch": 5.390590324012428,
"grad_norm": 1.265625,
"learning_rate": 0.00027885790718262354,
"loss": 5.0996,
"mean_token_accuracy": 0.19739820659160615,
"num_tokens": 12501634.0,
"step": 6075
},
{
"entropy": 5.575655174255371,
"epoch": 5.39502885042166,
"grad_norm": 1.2578125,
"learning_rate": 0.0002785134805573628,
"loss": 5.1236,
"mean_token_accuracy": 0.20160026252269744,
"num_tokens": 12512496.0,
"step": 6080
},
{
"entropy": 5.587437438964844,
"epoch": 5.399467376830892,
"grad_norm": 1.3125,
"learning_rate": 0.00027816904569674363,
"loss": 5.0713,
"mean_token_accuracy": 0.20747292339801787,
"num_tokens": 12522494.0,
"step": 6085
},
{
"entropy": 5.7026749610900875,
"epoch": 5.403905903240124,
"grad_norm": 1.296875,
"learning_rate": 0.00027782460340809793,
"loss": 5.1806,
"mean_token_accuracy": 0.19498033374547957,
"num_tokens": 12533969.0,
"step": 6090
},
{
"entropy": 5.569170951843262,
"epoch": 5.408344429649357,
"grad_norm": 1.2421875,
"learning_rate": 0.00027748015449877486,
"loss": 5.0142,
"mean_token_accuracy": 0.2154815077781677,
"num_tokens": 12543484.0,
"step": 6095
},
{
"entropy": 5.5392396450042725,
"epoch": 5.412782956058589,
"grad_norm": 1.375,
"learning_rate": 0.00027713569977613913,
"loss": 5.0738,
"mean_token_accuracy": 0.20868272483348846,
"num_tokens": 12552954.0,
"step": 6100
},
{
"entropy": 5.641184234619141,
"epoch": 5.417221482467821,
"grad_norm": 1.3203125,
"learning_rate": 0.0002767912400475689,
"loss": 5.1017,
"mean_token_accuracy": 0.19845348000526428,
"num_tokens": 12563269.0,
"step": 6105
},
{
"entropy": 5.584108161926269,
"epoch": 5.421660008877053,
"grad_norm": 1.2109375,
"learning_rate": 0.00027644677612045454,
"loss": 5.0805,
"mean_token_accuracy": 0.208245387673378,
"num_tokens": 12573327.0,
"step": 6110
},
{
"entropy": 5.581417274475098,
"epoch": 5.426098535286285,
"grad_norm": 1.1953125,
"learning_rate": 0.00027610230880219575,
"loss": 5.0816,
"mean_token_accuracy": 0.20271376818418502,
"num_tokens": 12583297.0,
"step": 6115
},
{
"entropy": 5.552739763259888,
"epoch": 5.430537061695517,
"grad_norm": 1.2265625,
"learning_rate": 0.00027575783890020045,
"loss": 5.0949,
"mean_token_accuracy": 0.20238072723150252,
"num_tokens": 12593656.0,
"step": 6120
},
{
"entropy": 5.523594236373901,
"epoch": 5.4349755881047495,
"grad_norm": 1.3125,
"learning_rate": 0.00027541336722188253,
"loss": 5.0287,
"mean_token_accuracy": 0.20966356843709946,
"num_tokens": 12603242.0,
"step": 6125
},
{
"entropy": 5.580938482284546,
"epoch": 5.439414114513982,
"grad_norm": 1.0703125,
"learning_rate": 0.0002750688945746601,
"loss": 5.1222,
"mean_token_accuracy": 0.19789490401744841,
"num_tokens": 12614510.0,
"step": 6130
},
{
"entropy": 5.644650602340699,
"epoch": 5.443852640923214,
"grad_norm": 1.2578125,
"learning_rate": 0.0002747244217659535,
"loss": 5.0496,
"mean_token_accuracy": 0.20694887787103652,
"num_tokens": 12624525.0,
"step": 6135
},
{
"entropy": 5.51423282623291,
"epoch": 5.448291167332446,
"grad_norm": 1.2421875,
"learning_rate": 0.0002743799496031834,
"loss": 4.9961,
"mean_token_accuracy": 0.21388078331947327,
"num_tokens": 12634856.0,
"step": 6140
},
{
"entropy": 5.532556390762329,
"epoch": 5.452729693741678,
"grad_norm": 1.34375,
"learning_rate": 0.0002740354788937691,
"loss": 5.0825,
"mean_token_accuracy": 0.20512001365423202,
"num_tokens": 12644595.0,
"step": 6145
},
{
"entropy": 5.605690145492554,
"epoch": 5.45716822015091,
"grad_norm": 1.25,
"learning_rate": 0.0002736910104451263,
"loss": 5.1696,
"mean_token_accuracy": 0.1970501348376274,
"num_tokens": 12656588.0,
"step": 6150
},
{
"entropy": 5.585254907608032,
"epoch": 5.461606746560142,
"grad_norm": 1.2109375,
"learning_rate": 0.00027334654506466576,
"loss": 5.0683,
"mean_token_accuracy": 0.21022608876228333,
"num_tokens": 12667540.0,
"step": 6155
},
{
"entropy": 5.5905224800109865,
"epoch": 5.4660452729693745,
"grad_norm": 1.3203125,
"learning_rate": 0.00027300208355979054,
"loss": 5.081,
"mean_token_accuracy": 0.21323304921388625,
"num_tokens": 12678252.0,
"step": 6160
},
{
"entropy": 5.567399549484253,
"epoch": 5.470483799378607,
"grad_norm": 1.2421875,
"learning_rate": 0.00027265762673789497,
"loss": 5.0328,
"mean_token_accuracy": 0.21125102043151855,
"num_tokens": 12688455.0,
"step": 6165
},
{
"entropy": 5.544572591781616,
"epoch": 5.474922325787839,
"grad_norm": 1.28125,
"learning_rate": 0.00027231317540636217,
"loss": 5.0715,
"mean_token_accuracy": 0.20413849055767058,
"num_tokens": 12699261.0,
"step": 6170
},
{
"entropy": 5.557119560241699,
"epoch": 5.479360852197071,
"grad_norm": 1.4375,
"learning_rate": 0.00027196873037256265,
"loss": 5.1211,
"mean_token_accuracy": 0.20442508459091185,
"num_tokens": 12709209.0,
"step": 6175
},
{
"entropy": 5.618570470809937,
"epoch": 5.483799378606303,
"grad_norm": 1.203125,
"learning_rate": 0.0002716242924438521,
"loss": 5.0871,
"mean_token_accuracy": 0.2136775240302086,
"num_tokens": 12720196.0,
"step": 6180
},
{
"entropy": 5.6269590854644775,
"epoch": 5.488237905015535,
"grad_norm": 1.46875,
"learning_rate": 0.00027127986242756933,
"loss": 5.1723,
"mean_token_accuracy": 0.19949438720941542,
"num_tokens": 12729664.0,
"step": 6185
},
{
"entropy": 5.561153841018677,
"epoch": 5.492676431424767,
"grad_norm": 1.265625,
"learning_rate": 0.0002709354411310349,
"loss": 5.094,
"mean_token_accuracy": 0.20299144238233566,
"num_tokens": 12739223.0,
"step": 6190
},
{
"entropy": 5.599923086166382,
"epoch": 5.4971149578339995,
"grad_norm": 1.2578125,
"learning_rate": 0.0002705910293615487,
"loss": 5.1144,
"mean_token_accuracy": 0.1993901625275612,
"num_tokens": 12748344.0,
"step": 6195
},
{
"entropy": 5.61824893951416,
"epoch": 5.501553484243232,
"grad_norm": 1.3125,
"learning_rate": 0.00027024662792638854,
"loss": 5.1287,
"mean_token_accuracy": 0.20007070302963256,
"num_tokens": 12758725.0,
"step": 6200
},
{
"entropy": 5.514189720153809,
"epoch": 5.505992010652463,
"grad_norm": 1.3515625,
"learning_rate": 0.00026990223763280767,
"loss": 5.0171,
"mean_token_accuracy": 0.21372074633836746,
"num_tokens": 12768183.0,
"step": 6205
},
{
"entropy": 5.611531543731689,
"epoch": 5.510430537061696,
"grad_norm": 1.34375,
"learning_rate": 0.00026955785928803344,
"loss": 5.1551,
"mean_token_accuracy": 0.19791555404663086,
"num_tokens": 12778947.0,
"step": 6210
},
{
"entropy": 5.564114761352539,
"epoch": 5.514869063470927,
"grad_norm": 1.1953125,
"learning_rate": 0.00026921349369926525,
"loss": 5.0888,
"mean_token_accuracy": 0.20085929930210114,
"num_tokens": 12789580.0,
"step": 6215
},
{
"entropy": 5.659040212631226,
"epoch": 5.51930758988016,
"grad_norm": 1.3046875,
"learning_rate": 0.00026886914167367244,
"loss": 5.1212,
"mean_token_accuracy": 0.20163543224334718,
"num_tokens": 12800926.0,
"step": 6220
},
{
"entropy": 5.529235315322876,
"epoch": 5.5237461162893915,
"grad_norm": 1.25,
"learning_rate": 0.0002685248040183926,
"loss": 5.0214,
"mean_token_accuracy": 0.21549215763807297,
"num_tokens": 12811017.0,
"step": 6225
},
{
"entropy": 5.546945571899414,
"epoch": 5.5281846426986245,
"grad_norm": 1.5625,
"learning_rate": 0.0002681804815405297,
"loss": 5.0504,
"mean_token_accuracy": 0.21143288910388947,
"num_tokens": 12821028.0,
"step": 6230
},
{
"entropy": 5.560630178451538,
"epoch": 5.532623169107856,
"grad_norm": 1.28125,
"learning_rate": 0.0002678361750471522,
"loss": 5.0529,
"mean_token_accuracy": 0.2028401628136635,
"num_tokens": 12830176.0,
"step": 6235
},
{
"entropy": 5.55534029006958,
"epoch": 5.537061695517089,
"grad_norm": 1.21875,
"learning_rate": 0.0002674918853452909,
"loss": 5.0722,
"mean_token_accuracy": 0.20871641933918,
"num_tokens": 12840525.0,
"step": 6240
},
{
"entropy": 5.626813220977783,
"epoch": 5.54150022192632,
"grad_norm": 1.453125,
"learning_rate": 0.0002671476132419374,
"loss": 5.1409,
"mean_token_accuracy": 0.20306331068277358,
"num_tokens": 12850698.0,
"step": 6245
},
{
"entropy": 5.599089765548706,
"epoch": 5.545938748335552,
"grad_norm": 1.3203125,
"learning_rate": 0.00026680335954404176,
"loss": 5.144,
"mean_token_accuracy": 0.20015592277050018,
"num_tokens": 12860613.0,
"step": 6250
},
{
"entropy": 5.536163234710694,
"epoch": 5.550377274744784,
"grad_norm": 1.3125,
"learning_rate": 0.0002664591250585114,
"loss": 5.0393,
"mean_token_accuracy": 0.20839242786169052,
"num_tokens": 12871651.0,
"step": 6255
},
{
"entropy": 5.610751438140869,
"epoch": 5.5548158011540165,
"grad_norm": 1.328125,
"learning_rate": 0.0002661149105922083,
"loss": 5.1218,
"mean_token_accuracy": 0.20223393440246581,
"num_tokens": 12881477.0,
"step": 6260
},
{
"entropy": 5.633294534683228,
"epoch": 5.559254327563249,
"grad_norm": 1.34375,
"learning_rate": 0.0002657707169519477,
"loss": 5.0636,
"mean_token_accuracy": 0.20507729798555374,
"num_tokens": 12891217.0,
"step": 6265
},
{
"entropy": 5.536508226394654,
"epoch": 5.563692853972481,
"grad_norm": 1.3515625,
"learning_rate": 0.00026542654494449597,
"loss": 5.1129,
"mean_token_accuracy": 0.2077334776520729,
"num_tokens": 12901940.0,
"step": 6270
},
{
"entropy": 5.574195098876953,
"epoch": 5.568131380381713,
"grad_norm": 1.21875,
"learning_rate": 0.0002650823953765688,
"loss": 5.0735,
"mean_token_accuracy": 0.20476429611444474,
"num_tokens": 12911974.0,
"step": 6275
},
{
"entropy": 5.641457462310791,
"epoch": 5.572569906790945,
"grad_norm": 1.265625,
"learning_rate": 0.00026473826905482924,
"loss": 5.1327,
"mean_token_accuracy": 0.19755058288574218,
"num_tokens": 12921865.0,
"step": 6280
},
{
"entropy": 5.598918676376343,
"epoch": 5.577008433200177,
"grad_norm": 1.359375,
"learning_rate": 0.00026439416678588593,
"loss": 5.0806,
"mean_token_accuracy": 0.20567530542612075,
"num_tokens": 12932370.0,
"step": 6285
},
{
"entropy": 5.597425556182861,
"epoch": 5.581446959609409,
"grad_norm": 1.2734375,
"learning_rate": 0.0002640500893762908,
"loss": 5.0451,
"mean_token_accuracy": 0.209423665702343,
"num_tokens": 12943101.0,
"step": 6290
},
{
"entropy": 5.568455410003662,
"epoch": 5.5858854860186415,
"grad_norm": 1.296875,
"learning_rate": 0.00026370603763253814,
"loss": 5.0633,
"mean_token_accuracy": 0.21115909665822982,
"num_tokens": 12952419.0,
"step": 6295
},
{
"entropy": 5.523344945907593,
"epoch": 5.590324012427874,
"grad_norm": 1.28125,
"learning_rate": 0.0002633620123610616,
"loss": 5.0175,
"mean_token_accuracy": 0.21355213671922685,
"num_tokens": 12962797.0,
"step": 6300
},
{
"entropy": 5.500270414352417,
"epoch": 5.594762538837106,
"grad_norm": 1.2578125,
"learning_rate": 0.00026301801436823285,
"loss": 5.1217,
"mean_token_accuracy": 0.20372316390275955,
"num_tokens": 12973266.0,
"step": 6305
},
{
"entropy": 5.609734296798706,
"epoch": 5.599201065246338,
"grad_norm": 1.390625,
"learning_rate": 0.0002626740444603598,
"loss": 5.158,
"mean_token_accuracy": 0.19786878526210785,
"num_tokens": 12983155.0,
"step": 6310
},
{
"entropy": 5.702747917175293,
"epoch": 5.60363959165557,
"grad_norm": 1.3046875,
"learning_rate": 0.00026233010344368425,
"loss": 5.1969,
"mean_token_accuracy": 0.19020256400108337,
"num_tokens": 12994159.0,
"step": 6315
},
{
"entropy": 5.651484584808349,
"epoch": 5.608078118064802,
"grad_norm": 1.4609375,
"learning_rate": 0.0002619861921243806,
"loss": 5.1413,
"mean_token_accuracy": 0.20623185336589814,
"num_tokens": 13005322.0,
"step": 6320
},
{
"entropy": 5.5671463966369625,
"epoch": 5.612516644474034,
"grad_norm": 1.2734375,
"learning_rate": 0.0002616423113085535,
"loss": 5.0896,
"mean_token_accuracy": 0.2094891607761383,
"num_tokens": 13016193.0,
"step": 6325
},
{
"entropy": 5.557018184661866,
"epoch": 5.616955170883267,
"grad_norm": 1.21875,
"learning_rate": 0.00026129846180223586,
"loss": 5.0625,
"mean_token_accuracy": 0.20653146803379058,
"num_tokens": 13026270.0,
"step": 6330
},
{
"entropy": 5.559992170333862,
"epoch": 5.621393697292499,
"grad_norm": 1.203125,
"learning_rate": 0.0002609546444113876,
"loss": 5.0531,
"mean_token_accuracy": 0.20299082100391388,
"num_tokens": 13035958.0,
"step": 6335
},
{
"entropy": 5.570192480087281,
"epoch": 5.625832223701731,
"grad_norm": 1.3046875,
"learning_rate": 0.0002606108599418933,
"loss": 5.0952,
"mean_token_accuracy": 0.2037765219807625,
"num_tokens": 13045938.0,
"step": 6340
},
{
"entropy": 5.589366436004639,
"epoch": 5.630270750110963,
"grad_norm": 1.2890625,
"learning_rate": 0.00026026710919956,
"loss": 5.1079,
"mean_token_accuracy": 0.20677500218153,
"num_tokens": 13055876.0,
"step": 6345
},
{
"entropy": 5.620864963531494,
"epoch": 5.634709276520195,
"grad_norm": 1.328125,
"learning_rate": 0.00025992339299011616,
"loss": 5.1793,
"mean_token_accuracy": 0.19748032689094544,
"num_tokens": 13066121.0,
"step": 6350
},
{
"entropy": 5.576847934722901,
"epoch": 5.639147802929427,
"grad_norm": 1.25,
"learning_rate": 0.00025957971211920894,
"loss": 5.1185,
"mean_token_accuracy": 0.20461114048957824,
"num_tokens": 13075927.0,
"step": 6355
},
{
"entropy": 5.608967685699463,
"epoch": 5.6435863293386594,
"grad_norm": 1.296875,
"learning_rate": 0.00025923606739240306,
"loss": 5.1309,
"mean_token_accuracy": 0.2012041077017784,
"num_tokens": 13086469.0,
"step": 6360
},
{
"entropy": 5.554079198837281,
"epoch": 5.648024855747892,
"grad_norm": 1.1875,
"learning_rate": 0.000258892459615178,
"loss": 5.0471,
"mean_token_accuracy": 0.21921688169240952,
"num_tokens": 13096781.0,
"step": 6365
},
{
"entropy": 5.593461990356445,
"epoch": 5.652463382157124,
"grad_norm": 1.5234375,
"learning_rate": 0.000258548889592927,
"loss": 5.0659,
"mean_token_accuracy": 0.20000619143247605,
"num_tokens": 13107279.0,
"step": 6370
},
{
"entropy": 5.510042524337768,
"epoch": 5.656901908566356,
"grad_norm": 1.2734375,
"learning_rate": 0.00025820535813095475,
"loss": 5.0243,
"mean_token_accuracy": 0.21235457807779312,
"num_tokens": 13116154.0,
"step": 6375
},
{
"entropy": 5.541016626358032,
"epoch": 5.661340434975588,
"grad_norm": 1.21875,
"learning_rate": 0.0002578618660344756,
"loss": 5.0481,
"mean_token_accuracy": 0.2115420863032341,
"num_tokens": 13125720.0,
"step": 6380
},
{
"entropy": 5.670938491821289,
"epoch": 5.66577896138482,
"grad_norm": 1.296875,
"learning_rate": 0.0002575184141086114,
"loss": 5.1537,
"mean_token_accuracy": 0.20022787749767304,
"num_tokens": 13135313.0,
"step": 6385
},
{
"entropy": 5.561427640914917,
"epoch": 5.670217487794052,
"grad_norm": 1.4140625,
"learning_rate": 0.0002571750031583901,
"loss": 5.1389,
"mean_token_accuracy": 0.19568807631731033,
"num_tokens": 13145852.0,
"step": 6390
},
{
"entropy": 5.55481276512146,
"epoch": 5.6746560142032845,
"grad_norm": 1.296875,
"learning_rate": 0.00025683163398874356,
"loss": 5.0508,
"mean_token_accuracy": 0.21583274602890015,
"num_tokens": 13155957.0,
"step": 6395
},
{
"entropy": 5.567706632614136,
"epoch": 5.679094540612517,
"grad_norm": 1.1953125,
"learning_rate": 0.0002564883074045055,
"loss": 5.0444,
"mean_token_accuracy": 0.20912159830331803,
"num_tokens": 13166914.0,
"step": 6400
},
{
"entropy": 5.576488924026489,
"epoch": 5.683533067021749,
"grad_norm": 1.3125,
"learning_rate": 0.00025614502421041004,
"loss": 5.0466,
"mean_token_accuracy": 0.20984987318515777,
"num_tokens": 13177071.0,
"step": 6405
},
{
"entropy": 5.568351316452026,
"epoch": 5.687971593430981,
"grad_norm": 1.265625,
"learning_rate": 0.0002558017852110895,
"loss": 5.1336,
"mean_token_accuracy": 0.20015836358070374,
"num_tokens": 13187574.0,
"step": 6410
},
{
"entropy": 5.570750045776367,
"epoch": 5.692410119840213,
"grad_norm": 1.25,
"learning_rate": 0.00025545859121107274,
"loss": 5.0511,
"mean_token_accuracy": 0.21021770387887956,
"num_tokens": 13197029.0,
"step": 6415
},
{
"entropy": 5.662575674057007,
"epoch": 5.696848646249445,
"grad_norm": 1.3828125,
"learning_rate": 0.00025511544301478294,
"loss": 5.1974,
"mean_token_accuracy": 0.19245787411928178,
"num_tokens": 13208146.0,
"step": 6420
},
{
"entropy": 5.5649487495422365,
"epoch": 5.701287172658677,
"grad_norm": 1.328125,
"learning_rate": 0.0002547723414265361,
"loss": 5.0931,
"mean_token_accuracy": 0.21084344387054443,
"num_tokens": 13217557.0,
"step": 6425
},
{
"entropy": 5.587751960754394,
"epoch": 5.7057256990679095,
"grad_norm": 1.265625,
"learning_rate": 0.0002544292872505388,
"loss": 5.1087,
"mean_token_accuracy": 0.2058153361082077,
"num_tokens": 13226916.0,
"step": 6430
},
{
"entropy": 5.495823097229004,
"epoch": 5.710164225477142,
"grad_norm": 1.2265625,
"learning_rate": 0.0002540862812908868,
"loss": 5.0381,
"mean_token_accuracy": 0.2152624875307083,
"num_tokens": 13237639.0,
"step": 6435
},
{
"entropy": 5.599671411514282,
"epoch": 5.714602751886374,
"grad_norm": 1.359375,
"learning_rate": 0.00025374332435156244,
"loss": 5.1204,
"mean_token_accuracy": 0.20174115151166916,
"num_tokens": 13247697.0,
"step": 6440
},
{
"entropy": 5.543997573852539,
"epoch": 5.719041278295606,
"grad_norm": 1.3125,
"learning_rate": 0.00025340041723643337,
"loss": 5.0251,
"mean_token_accuracy": 0.21282418072223663,
"num_tokens": 13257622.0,
"step": 6445
},
{
"entropy": 5.582433128356934,
"epoch": 5.723479804704838,
"grad_norm": 1.2734375,
"learning_rate": 0.00025305756074925047,
"loss": 5.0738,
"mean_token_accuracy": 0.20590440481901168,
"num_tokens": 13268272.0,
"step": 6450
},
{
"entropy": 5.590435028076172,
"epoch": 5.72791833111407,
"grad_norm": 1.2890625,
"learning_rate": 0.00025271475569364586,
"loss": 5.149,
"mean_token_accuracy": 0.19441523253917695,
"num_tokens": 13279395.0,
"step": 6455
},
{
"entropy": 5.604456090927124,
"epoch": 5.732356857523302,
"grad_norm": 1.21875,
"learning_rate": 0.00025237200287313137,
"loss": 5.1081,
"mean_token_accuracy": 0.19952116459608077,
"num_tokens": 13289171.0,
"step": 6460
},
{
"entropy": 5.6032037258148195,
"epoch": 5.7367953839325345,
"grad_norm": 1.1953125,
"learning_rate": 0.00025202930309109597,
"loss": 5.0955,
"mean_token_accuracy": 0.20548186749219893,
"num_tokens": 13299339.0,
"step": 6465
},
{
"entropy": 5.548041152954101,
"epoch": 5.741233910341767,
"grad_norm": 1.3515625,
"learning_rate": 0.00025168665715080463,
"loss": 5.0836,
"mean_token_accuracy": 0.20553600937128066,
"num_tokens": 13309363.0,
"step": 6470
},
{
"entropy": 5.532993221282959,
"epoch": 5.745672436750999,
"grad_norm": 1.1875,
"learning_rate": 0.00025134406585539603,
"loss": 5.0704,
"mean_token_accuracy": 0.21398436576128005,
"num_tokens": 13319722.0,
"step": 6475
},
{
"entropy": 5.574262571334839,
"epoch": 5.750110963160231,
"grad_norm": 1.296875,
"learning_rate": 0.0002510015300078808,
"loss": 5.1294,
"mean_token_accuracy": 0.20138103514909744,
"num_tokens": 13330034.0,
"step": 6480
},
{
"entropy": 5.561505126953125,
"epoch": 5.754549489569463,
"grad_norm": 1.296875,
"learning_rate": 0.0002506590504111394,
"loss": 5.0781,
"mean_token_accuracy": 0.21250172853469848,
"num_tokens": 13340846.0,
"step": 6485
},
{
"entropy": 5.610709095001221,
"epoch": 5.758988015978695,
"grad_norm": 1.2265625,
"learning_rate": 0.0002503166278679207,
"loss": 5.0885,
"mean_token_accuracy": 0.20365740358829498,
"num_tokens": 13351785.0,
"step": 6490
},
{
"entropy": 5.575344657897949,
"epoch": 5.763426542387927,
"grad_norm": 1.3515625,
"learning_rate": 0.0002499742631808398,
"loss": 5.027,
"mean_token_accuracy": 0.20383460223674774,
"num_tokens": 13362322.0,
"step": 6495
},
{
"entropy": 5.505190086364746,
"epoch": 5.7678650687971595,
"grad_norm": 1.1953125,
"learning_rate": 0.000249631957152376,
"loss": 5.0279,
"mean_token_accuracy": 0.2089679092168808,
"num_tokens": 13372355.0,
"step": 6500
},
{
"epoch": 5.7678650687971595,
"eval_entropy": 5.395023606452126,
"eval_loss": 5.90569543838501,
"eval_mean_token_accuracy": 0.16883616795378456,
"eval_num_tokens": 13372355.0,
"eval_runtime": 2.7028,
"eval_samples_per_second": 1245.735,
"eval_steps_per_second": 155.763,
"step": 6500
},
{
"entropy": 5.486952066421509,
"epoch": 5.772303595206392,
"grad_norm": 1.3359375,
"learning_rate": 0.0002492897105848714,
"loss": 5.0374,
"mean_token_accuracy": 0.20795274674892425,
"num_tokens": 13381759.0,
"step": 6505
},
{
"entropy": 5.581659507751465,
"epoch": 5.776742121615624,
"grad_norm": 1.15625,
"learning_rate": 0.00024894752428052846,
"loss": 5.1711,
"mean_token_accuracy": 0.1940222665667534,
"num_tokens": 13393491.0,
"step": 6510
},
{
"entropy": 5.588375282287598,
"epoch": 5.781180648024856,
"grad_norm": 1.1484375,
"learning_rate": 0.00024860539904140853,
"loss": 5.1193,
"mean_token_accuracy": 0.2004074990749359,
"num_tokens": 13403603.0,
"step": 6515
},
{
"entropy": 5.607946729660034,
"epoch": 5.785619174434088,
"grad_norm": 1.3125,
"learning_rate": 0.00024826333566942995,
"loss": 5.0644,
"mean_token_accuracy": 0.21309028416872025,
"num_tokens": 13413784.0,
"step": 6520
},
{
"entropy": 5.547456836700439,
"epoch": 5.79005770084332,
"grad_norm": 1.40625,
"learning_rate": 0.00024792133496636553,
"loss": 5.0718,
"mean_token_accuracy": 0.20509508550167083,
"num_tokens": 13422953.0,
"step": 6525
},
{
"entropy": 5.510232162475586,
"epoch": 5.794496227252552,
"grad_norm": 1.2578125,
"learning_rate": 0.00024757939773384184,
"loss": 5.0742,
"mean_token_accuracy": 0.20572683364152908,
"num_tokens": 13433188.0,
"step": 6530
},
{
"entropy": 5.565609693527222,
"epoch": 5.798934753661785,
"grad_norm": 1.3984375,
"learning_rate": 0.00024723752477333625,
"loss": 5.0235,
"mean_token_accuracy": 0.21056320518255234,
"num_tokens": 13443815.0,
"step": 6535
},
{
"entropy": 5.670208215713501,
"epoch": 5.803373280071017,
"grad_norm": 1.1796875,
"learning_rate": 0.0002468957168861758,
"loss": 5.1307,
"mean_token_accuracy": 0.19810602217912673,
"num_tokens": 13453927.0,
"step": 6540
},
{
"entropy": 5.585939931869507,
"epoch": 5.807811806480249,
"grad_norm": 1.1640625,
"learning_rate": 0.0002465539748735346,
"loss": 5.0682,
"mean_token_accuracy": 0.21096296310424806,
"num_tokens": 13465431.0,
"step": 6545
},
{
"entropy": 5.624184417724609,
"epoch": 5.812250332889481,
"grad_norm": 1.3359375,
"learning_rate": 0.0002462122995364327,
"loss": 5.1785,
"mean_token_accuracy": 0.18811278641223908,
"num_tokens": 13476323.0,
"step": 6550
},
{
"entropy": 5.624741268157959,
"epoch": 5.816688859298713,
"grad_norm": 1.296875,
"learning_rate": 0.0002458706916757338,
"loss": 5.1479,
"mean_token_accuracy": 0.20121028870344163,
"num_tokens": 13486741.0,
"step": 6555
},
{
"entropy": 5.503808879852295,
"epoch": 5.821127385707945,
"grad_norm": 1.3828125,
"learning_rate": 0.00024552915209214327,
"loss": 5.0612,
"mean_token_accuracy": 0.20564158856868744,
"num_tokens": 13497151.0,
"step": 6560
},
{
"entropy": 5.586016988754272,
"epoch": 5.8255659121171774,
"grad_norm": 1.4140625,
"learning_rate": 0.00024518768158620654,
"loss": 5.0161,
"mean_token_accuracy": 0.2136678770184517,
"num_tokens": 13508072.0,
"step": 6565
},
{
"entropy": 5.60361967086792,
"epoch": 5.83000443852641,
"grad_norm": 1.3046875,
"learning_rate": 0.0002448462809583072,
"loss": 5.1092,
"mean_token_accuracy": 0.20014549046754837,
"num_tokens": 13518421.0,
"step": 6570
},
{
"entropy": 5.560875797271729,
"epoch": 5.834442964935642,
"grad_norm": 1.2421875,
"learning_rate": 0.000244504951008665,
"loss": 5.1264,
"mean_token_accuracy": 0.21313424408435822,
"num_tokens": 13527920.0,
"step": 6575
},
{
"entropy": 5.528744125366211,
"epoch": 5.838881491344874,
"grad_norm": 1.15625,
"learning_rate": 0.00024416369253733405,
"loss": 5.0393,
"mean_token_accuracy": 0.20386240929365157,
"num_tokens": 13539288.0,
"step": 6580
},
{
"entropy": 5.554074335098266,
"epoch": 5.843320017754106,
"grad_norm": 1.28125,
"learning_rate": 0.00024382250634420085,
"loss": 5.0883,
"mean_token_accuracy": 0.20932643860578537,
"num_tokens": 13549178.0,
"step": 6585
},
{
"entropy": 5.62343053817749,
"epoch": 5.847758544163337,
"grad_norm": 1.359375,
"learning_rate": 0.0002434813932289825,
"loss": 5.0808,
"mean_token_accuracy": 0.20308277904987335,
"num_tokens": 13560442.0,
"step": 6590
},
{
"entropy": 5.586601591110229,
"epoch": 5.85219707057257,
"grad_norm": 1.328125,
"learning_rate": 0.00024314035399122485,
"loss": 5.065,
"mean_token_accuracy": 0.21043608486652374,
"num_tokens": 13571007.0,
"step": 6595
},
{
"entropy": 5.522235107421875,
"epoch": 5.856635596981802,
"grad_norm": 1.1875,
"learning_rate": 0.00024279938943030073,
"loss": 5.0848,
"mean_token_accuracy": 0.208780737221241,
"num_tokens": 13581774.0,
"step": 6600
},
{
"entropy": 5.59641809463501,
"epoch": 5.861074123391035,
"grad_norm": 1.40625,
"learning_rate": 0.0002424585003454075,
"loss": 5.1463,
"mean_token_accuracy": 0.19471298903226852,
"num_tokens": 13591820.0,
"step": 6605
},
{
"entropy": 5.576270675659179,
"epoch": 5.865512649800266,
"grad_norm": 1.3828125,
"learning_rate": 0.00024211768753556602,
"loss": 5.0553,
"mean_token_accuracy": 0.20980488508939743,
"num_tokens": 13601631.0,
"step": 6610
},
{
"entropy": 5.616266059875488,
"epoch": 5.869951176209499,
"grad_norm": 1.3359375,
"learning_rate": 0.00024177695179961823,
"loss": 5.1118,
"mean_token_accuracy": 0.20324235409498215,
"num_tokens": 13611010.0,
"step": 6615
},
{
"entropy": 5.523974752426147,
"epoch": 5.87438970261873,
"grad_norm": 1.265625,
"learning_rate": 0.00024143629393622541,
"loss": 5.0795,
"mean_token_accuracy": 0.2068472161889076,
"num_tokens": 13621480.0,
"step": 6620
},
{
"entropy": 5.592173433303833,
"epoch": 5.878828229027963,
"grad_norm": 1.203125,
"learning_rate": 0.00024109571474386631,
"loss": 5.18,
"mean_token_accuracy": 0.19840116798877716,
"num_tokens": 13631868.0,
"step": 6625
},
{
"entropy": 5.63975977897644,
"epoch": 5.8832667554371945,
"grad_norm": 1.2890625,
"learning_rate": 0.00024075521502083525,
"loss": 5.1471,
"mean_token_accuracy": 0.20076769590377808,
"num_tokens": 13642444.0,
"step": 6630
},
{
"entropy": 5.602757835388184,
"epoch": 5.887705281846427,
"grad_norm": 1.1953125,
"learning_rate": 0.00024041479556524044,
"loss": 5.0928,
"mean_token_accuracy": 0.20409242957830429,
"num_tokens": 13652675.0,
"step": 6635
},
{
"entropy": 5.561541318893433,
"epoch": 5.892143808255659,
"grad_norm": 1.1875,
"learning_rate": 0.00024007445717500175,
"loss": 5.1267,
"mean_token_accuracy": 0.2063656270503998,
"num_tokens": 13664209.0,
"step": 6640
},
{
"entropy": 5.529283952713013,
"epoch": 5.896582334664891,
"grad_norm": 1.3359375,
"learning_rate": 0.00023973420064784908,
"loss": 5.081,
"mean_token_accuracy": 0.2037829801440239,
"num_tokens": 13675249.0,
"step": 6645
},
{
"entropy": 5.597996425628662,
"epoch": 5.901020861074123,
"grad_norm": 1.46875,
"learning_rate": 0.00023939402678132044,
"loss": 5.035,
"mean_token_accuracy": 0.2080688178539276,
"num_tokens": 13685827.0,
"step": 6650
},
{
"entropy": 5.614791297912598,
"epoch": 5.905459387483355,
"grad_norm": 1.2265625,
"learning_rate": 0.00023905393637276018,
"loss": 5.1164,
"mean_token_accuracy": 0.19920257925987245,
"num_tokens": 13696391.0,
"step": 6655
},
{
"entropy": 5.586729669570923,
"epoch": 5.909897913892587,
"grad_norm": 1.2265625,
"learning_rate": 0.0002387139302193171,
"loss": 5.0999,
"mean_token_accuracy": 0.20862944722175597,
"num_tokens": 13705917.0,
"step": 6660
},
{
"entropy": 5.584148120880127,
"epoch": 5.9143364403018195,
"grad_norm": 1.1953125,
"learning_rate": 0.00023837400911794215,
"loss": 5.0723,
"mean_token_accuracy": 0.2055222660303116,
"num_tokens": 13716499.0,
"step": 6665
},
{
"entropy": 5.520716762542724,
"epoch": 5.918774966711052,
"grad_norm": 1.2421875,
"learning_rate": 0.0002380341738653874,
"loss": 5.0979,
"mean_token_accuracy": 0.20228934586048125,
"num_tokens": 13726292.0,
"step": 6670
},
{
"entropy": 5.539011859893799,
"epoch": 5.923213493120284,
"grad_norm": 1.28125,
"learning_rate": 0.00023769442525820334,
"loss": 5.0227,
"mean_token_accuracy": 0.20357633084058763,
"num_tokens": 13737368.0,
"step": 6675
},
{
"entropy": 5.584113931655883,
"epoch": 5.927652019529516,
"grad_norm": 1.28125,
"learning_rate": 0.0002373547640927375,
"loss": 5.1391,
"mean_token_accuracy": 0.1995089456439018,
"num_tokens": 13747193.0,
"step": 6680
},
{
"entropy": 5.5580991268157955,
"epoch": 5.932090545938748,
"grad_norm": 1.265625,
"learning_rate": 0.00023701519116513253,
"loss": 5.0749,
"mean_token_accuracy": 0.20574639588594437,
"num_tokens": 13758467.0,
"step": 6685
},
{
"entropy": 5.5872362613677975,
"epoch": 5.93652907234798,
"grad_norm": 1.2890625,
"learning_rate": 0.00023667570727132405,
"loss": 5.1663,
"mean_token_accuracy": 0.2031402051448822,
"num_tokens": 13768122.0,
"step": 6690
},
{
"entropy": 5.527556371688843,
"epoch": 5.940967598757212,
"grad_norm": 1.234375,
"learning_rate": 0.00023633631320703918,
"loss": 5.0464,
"mean_token_accuracy": 0.21761444509029387,
"num_tokens": 13778010.0,
"step": 6695
},
{
"entropy": 5.55449366569519,
"epoch": 5.9454061251664445,
"grad_norm": 1.25,
"learning_rate": 0.00023599700976779432,
"loss": 5.091,
"mean_token_accuracy": 0.20930832773447036,
"num_tokens": 13788564.0,
"step": 6700
},
{
"entropy": 5.629205846786499,
"epoch": 5.949844651575677,
"grad_norm": 1.171875,
"learning_rate": 0.00023565779774889367,
"loss": 5.1206,
"mean_token_accuracy": 0.20180112570524217,
"num_tokens": 13799111.0,
"step": 6705
},
{
"entropy": 5.640710783004761,
"epoch": 5.954283177984909,
"grad_norm": 1.1875,
"learning_rate": 0.00023531867794542694,
"loss": 5.1349,
"mean_token_accuracy": 0.20038243979215623,
"num_tokens": 13809609.0,
"step": 6710
},
{
"entropy": 5.550815439224243,
"epoch": 5.958721704394141,
"grad_norm": 1.28125,
"learning_rate": 0.00023497965115226794,
"loss": 5.1328,
"mean_token_accuracy": 0.20198143422603607,
"num_tokens": 13820497.0,
"step": 6715
},
{
"entropy": 5.5442609786987305,
"epoch": 5.963160230803373,
"grad_norm": 1.15625,
"learning_rate": 0.00023464071816407206,
"loss": 5.0974,
"mean_token_accuracy": 0.2144639238715172,
"num_tokens": 13830807.0,
"step": 6720
},
{
"entropy": 5.58894190788269,
"epoch": 5.967598757212605,
"grad_norm": 1.4296875,
"learning_rate": 0.00023430187977527533,
"loss": 5.0969,
"mean_token_accuracy": 0.20274531692266465,
"num_tokens": 13839967.0,
"step": 6725
},
{
"entropy": 5.563863468170166,
"epoch": 5.972037283621837,
"grad_norm": 1.171875,
"learning_rate": 0.00023396313678009158,
"loss": 5.1262,
"mean_token_accuracy": 0.20454970449209214,
"num_tokens": 13850741.0,
"step": 6730
},
{
"entropy": 5.540625286102295,
"epoch": 5.9764758100310695,
"grad_norm": 1.2421875,
"learning_rate": 0.00023362448997251128,
"loss": 5.1619,
"mean_token_accuracy": 0.1981108382344246,
"num_tokens": 13861309.0,
"step": 6735
},
{
"entropy": 5.643215322494507,
"epoch": 5.980914336440302,
"grad_norm": 1.546875,
"learning_rate": 0.00023328594014629945,
"loss": 5.0826,
"mean_token_accuracy": 0.20924076735973357,
"num_tokens": 13872190.0,
"step": 6740
},
{
"entropy": 5.52737946510315,
"epoch": 5.985352862849534,
"grad_norm": 1.1640625,
"learning_rate": 0.0002329474880949937,
"loss": 5.0304,
"mean_token_accuracy": 0.21228506416082382,
"num_tokens": 13882973.0,
"step": 6745
},
{
"entropy": 5.522306108474732,
"epoch": 5.989791389258766,
"grad_norm": 1.515625,
"learning_rate": 0.0002326091346119026,
"loss": 5.0696,
"mean_token_accuracy": 0.20860151052474976,
"num_tokens": 13894254.0,
"step": 6750
},
{
"entropy": 5.575989580154419,
"epoch": 5.994229915667998,
"grad_norm": 1.3359375,
"learning_rate": 0.0002322708804901036,
"loss": 5.1609,
"mean_token_accuracy": 0.2007613718509674,
"num_tokens": 13905553.0,
"step": 6755
},
{
"entropy": 5.623301839828491,
"epoch": 5.99866844207723,
"grad_norm": 1.1796875,
"learning_rate": 0.00023193272652244113,
"loss": 5.0959,
"mean_token_accuracy": 0.20574696362018585,
"num_tokens": 13915488.0,
"step": 6760
},
{
"entropy": 5.574898348914252,
"epoch": 6.0026631158455395,
"grad_norm": 1.3828125,
"learning_rate": 0.00023159467350152515,
"loss": 5.0308,
"mean_token_accuracy": 0.21161833736631605,
"num_tokens": 13924671.0,
"step": 6765
},
{
"entropy": 5.570318222045898,
"epoch": 6.007101642254772,
"grad_norm": 1.3203125,
"learning_rate": 0.00023125672221972865,
"loss": 4.9148,
"mean_token_accuracy": 0.22097623944282532,
"num_tokens": 13934299.0,
"step": 6770
},
{
"entropy": 5.573090076446533,
"epoch": 6.011540168664004,
"grad_norm": 1.25,
"learning_rate": 0.0002309188734691865,
"loss": 4.9069,
"mean_token_accuracy": 0.21901576817035676,
"num_tokens": 13945614.0,
"step": 6775
},
{
"entropy": 5.577006053924561,
"epoch": 6.015978695073236,
"grad_norm": 1.1484375,
"learning_rate": 0.00023058112804179298,
"loss": 5.0099,
"mean_token_accuracy": 0.2100958600640297,
"num_tokens": 13956859.0,
"step": 6780
},
{
"entropy": 5.595920896530151,
"epoch": 6.020417221482468,
"grad_norm": 1.25,
"learning_rate": 0.0002302434867292003,
"loss": 4.9683,
"mean_token_accuracy": 0.21894738227128982,
"num_tokens": 13967572.0,
"step": 6785
},
{
"entropy": 5.558254957199097,
"epoch": 6.0248557478917,
"grad_norm": 1.2109375,
"learning_rate": 0.00022990595032281675,
"loss": 4.9206,
"mean_token_accuracy": 0.2240821823477745,
"num_tokens": 13977669.0,
"step": 6790
},
{
"entropy": 5.605133867263794,
"epoch": 6.029294274300932,
"grad_norm": 1.2734375,
"learning_rate": 0.0002295685196138045,
"loss": 4.917,
"mean_token_accuracy": 0.21340941190719603,
"num_tokens": 13987452.0,
"step": 6795
},
{
"entropy": 5.606102848052979,
"epoch": 6.0337328007101645,
"grad_norm": 1.46875,
"learning_rate": 0.00022923119539307806,
"loss": 4.9886,
"mean_token_accuracy": 0.20658108741044998,
"num_tokens": 13997433.0,
"step": 6800
},
{
"entropy": 5.59543399810791,
"epoch": 6.038171327119397,
"grad_norm": 1.359375,
"learning_rate": 0.00022889397845130254,
"loss": 5.0201,
"mean_token_accuracy": 0.21266337633132934,
"num_tokens": 14008129.0,
"step": 6805
},
{
"entropy": 5.562005090713501,
"epoch": 6.042609853528629,
"grad_norm": 1.390625,
"learning_rate": 0.00022855686957889116,
"loss": 4.9403,
"mean_token_accuracy": 0.22045661211013795,
"num_tokens": 14018690.0,
"step": 6810
},
{
"entropy": 5.547663164138794,
"epoch": 6.047048379937861,
"grad_norm": 1.2265625,
"learning_rate": 0.0002282198695660042,
"loss": 4.8688,
"mean_token_accuracy": 0.22229637205600739,
"num_tokens": 14029021.0,
"step": 6815
},
{
"entropy": 5.62746229171753,
"epoch": 6.051486906347093,
"grad_norm": 1.3046875,
"learning_rate": 0.00022788297920254663,
"loss": 4.9808,
"mean_token_accuracy": 0.21179607808589934,
"num_tokens": 14038856.0,
"step": 6820
},
{
"entropy": 5.560137414932251,
"epoch": 6.055925432756325,
"grad_norm": 1.2265625,
"learning_rate": 0.0002275461992781665,
"loss": 4.8557,
"mean_token_accuracy": 0.2237355023622513,
"num_tokens": 14049781.0,
"step": 6825
},
{
"entropy": 5.595793104171753,
"epoch": 6.060363959165557,
"grad_norm": 1.2421875,
"learning_rate": 0.00022720953058225286,
"loss": 4.953,
"mean_token_accuracy": 0.21852329671382903,
"num_tokens": 14060248.0,
"step": 6830
},
{
"entropy": 5.526202297210693,
"epoch": 6.0648024855747895,
"grad_norm": 1.3046875,
"learning_rate": 0.00022687297390393426,
"loss": 4.8112,
"mean_token_accuracy": 0.22845348417758943,
"num_tokens": 14069461.0,
"step": 6835
},
{
"entropy": 5.5649689674377445,
"epoch": 6.069241011984022,
"grad_norm": 1.2734375,
"learning_rate": 0.00022653653003207642,
"loss": 4.922,
"mean_token_accuracy": 0.2146340489387512,
"num_tokens": 14080019.0,
"step": 6840
},
{
"entropy": 5.5446208953857425,
"epoch": 6.073679538393254,
"grad_norm": 1.3828125,
"learning_rate": 0.0002262001997552809,
"loss": 4.9114,
"mean_token_accuracy": 0.2177823379635811,
"num_tokens": 14090453.0,
"step": 6845
},
{
"entropy": 5.499939012527466,
"epoch": 6.078118064802486,
"grad_norm": 1.3125,
"learning_rate": 0.00022586398386188278,
"loss": 4.9356,
"mean_token_accuracy": 0.2196785107254982,
"num_tokens": 14101865.0,
"step": 6850
},
{
"entropy": 5.565708923339844,
"epoch": 6.082556591211718,
"grad_norm": 1.3125,
"learning_rate": 0.00022552788313994922,
"loss": 4.8761,
"mean_token_accuracy": 0.22282514572143555,
"num_tokens": 14111649.0,
"step": 6855
},
{
"entropy": 5.636212491989136,
"epoch": 6.08699511762095,
"grad_norm": 1.4609375,
"learning_rate": 0.00022519189837727727,
"loss": 4.9518,
"mean_token_accuracy": 0.21787493526935578,
"num_tokens": 14122203.0,
"step": 6860
},
{
"entropy": 5.565778303146362,
"epoch": 6.091433644030182,
"grad_norm": 1.2421875,
"learning_rate": 0.00022485603036139236,
"loss": 4.97,
"mean_token_accuracy": 0.21275963336229325,
"num_tokens": 14132120.0,
"step": 6865
},
{
"entropy": 5.528501749038696,
"epoch": 6.0958721704394145,
"grad_norm": 1.3515625,
"learning_rate": 0.0002245202798795461,
"loss": 4.8767,
"mean_token_accuracy": 0.22740499526262284,
"num_tokens": 14142626.0,
"step": 6870
},
{
"entropy": 5.590403699874878,
"epoch": 6.100310696848647,
"grad_norm": 1.3203125,
"learning_rate": 0.00022418464771871473,
"loss": 5.0033,
"mean_token_accuracy": 0.21154555380344392,
"num_tokens": 14153707.0,
"step": 6875
},
{
"entropy": 5.521816730499268,
"epoch": 6.104749223257878,
"grad_norm": 1.328125,
"learning_rate": 0.00022384913466559704,
"loss": 4.9088,
"mean_token_accuracy": 0.22512754797935486,
"num_tokens": 14163194.0,
"step": 6880
},
{
"entropy": 5.512416982650757,
"epoch": 6.10918774966711,
"grad_norm": 1.1796875,
"learning_rate": 0.0002235137415066128,
"loss": 4.8982,
"mean_token_accuracy": 0.22106172293424606,
"num_tokens": 14174376.0,
"step": 6885
},
{
"entropy": 5.576170587539673,
"epoch": 6.113626276076342,
"grad_norm": 1.1875,
"learning_rate": 0.0002231784690279005,
"loss": 4.9781,
"mean_token_accuracy": 0.21190883219242096,
"num_tokens": 14186251.0,
"step": 6890
},
{
"entropy": 5.586230754852295,
"epoch": 6.118064802485574,
"grad_norm": 1.3515625,
"learning_rate": 0.0002228433180153161,
"loss": 4.9858,
"mean_token_accuracy": 0.2136741042137146,
"num_tokens": 14196816.0,
"step": 6895
},
{
"entropy": 5.567343139648438,
"epoch": 6.1225033288948065,
"grad_norm": 1.2109375,
"learning_rate": 0.0002225082892544305,
"loss": 4.9328,
"mean_token_accuracy": 0.2175935685634613,
"num_tokens": 14207942.0,
"step": 6900
},
{
"entropy": 5.587808227539062,
"epoch": 6.126941855304039,
"grad_norm": 1.296875,
"learning_rate": 0.0002221733835305283,
"loss": 4.9094,
"mean_token_accuracy": 0.21719594895839692,
"num_tokens": 14218686.0,
"step": 6905
},
{
"entropy": 5.631440019607544,
"epoch": 6.131380381713271,
"grad_norm": 1.328125,
"learning_rate": 0.00022183860162860568,
"loss": 4.9468,
"mean_token_accuracy": 0.2097667023539543,
"num_tokens": 14228611.0,
"step": 6910
},
{
"entropy": 5.543772602081299,
"epoch": 6.135818908122503,
"grad_norm": 1.3046875,
"learning_rate": 0.00022150394433336857,
"loss": 4.8756,
"mean_token_accuracy": 0.22756686359643935,
"num_tokens": 14238630.0,
"step": 6915
},
{
"entropy": 5.518515300750733,
"epoch": 6.140257434531735,
"grad_norm": 1.3359375,
"learning_rate": 0.00022116941242923067,
"loss": 4.9336,
"mean_token_accuracy": 0.21143654733896255,
"num_tokens": 14248388.0,
"step": 6920
},
{
"entropy": 5.620897626876831,
"epoch": 6.144695960940967,
"grad_norm": 1.234375,
"learning_rate": 0.00022083500670031208,
"loss": 4.9677,
"mean_token_accuracy": 0.21778711080551147,
"num_tokens": 14258898.0,
"step": 6925
},
{
"entropy": 5.585202980041504,
"epoch": 6.149134487350199,
"grad_norm": 1.296875,
"learning_rate": 0.0002205007279304368,
"loss": 4.8468,
"mean_token_accuracy": 0.2330240786075592,
"num_tokens": 14269316.0,
"step": 6930
},
{
"entropy": 5.560101747512817,
"epoch": 6.1535730137594316,
"grad_norm": 1.2734375,
"learning_rate": 0.00022016657690313151,
"loss": 4.9169,
"mean_token_accuracy": 0.22099239081144334,
"num_tokens": 14279843.0,
"step": 6935
},
{
"entropy": 5.5503302097320555,
"epoch": 6.158011540168664,
"grad_norm": 1.4609375,
"learning_rate": 0.00021983255440162337,
"loss": 4.8757,
"mean_token_accuracy": 0.22673001140356064,
"num_tokens": 14288827.0,
"step": 6940
},
{
"entropy": 5.56884241104126,
"epoch": 6.162450066577896,
"grad_norm": 1.328125,
"learning_rate": 0.00021949866120883832,
"loss": 4.9644,
"mean_token_accuracy": 0.21202533394098283,
"num_tokens": 14299273.0,
"step": 6945
},
{
"entropy": 5.59989857673645,
"epoch": 6.166888592987128,
"grad_norm": 1.203125,
"learning_rate": 0.0002191648981073992,
"loss": 4.9163,
"mean_token_accuracy": 0.21220019161701204,
"num_tokens": 14309416.0,
"step": 6950
},
{
"entropy": 5.5525611400604244,
"epoch": 6.17132711939636,
"grad_norm": 1.3984375,
"learning_rate": 0.00021883126587962393,
"loss": 4.968,
"mean_token_accuracy": 0.21182450652122498,
"num_tokens": 14319077.0,
"step": 6955
},
{
"entropy": 5.559889698028565,
"epoch": 6.175765645805592,
"grad_norm": 1.453125,
"learning_rate": 0.00021849776530752352,
"loss": 4.9841,
"mean_token_accuracy": 0.21414981186389923,
"num_tokens": 14329995.0,
"step": 6960
},
{
"entropy": 5.61794958114624,
"epoch": 6.180204172214824,
"grad_norm": 1.375,
"learning_rate": 0.0002181643971728008,
"loss": 4.9596,
"mean_token_accuracy": 0.20955124795436858,
"num_tokens": 14340455.0,
"step": 6965
},
{
"entropy": 5.584700012207032,
"epoch": 6.184642698624057,
"grad_norm": 1.2265625,
"learning_rate": 0.00021783116225684756,
"loss": 4.9347,
"mean_token_accuracy": 0.2132657915353775,
"num_tokens": 14351491.0,
"step": 6970
},
{
"entropy": 5.578726291656494,
"epoch": 6.189081225033289,
"grad_norm": 1.4921875,
"learning_rate": 0.00021749806134074395,
"loss": 5.0009,
"mean_token_accuracy": 0.2053453207015991,
"num_tokens": 14362655.0,
"step": 6975
},
{
"entropy": 5.541824436187744,
"epoch": 6.193519751442521,
"grad_norm": 1.3125,
"learning_rate": 0.00021716509520525564,
"loss": 4.9268,
"mean_token_accuracy": 0.21462586224079133,
"num_tokens": 14372391.0,
"step": 6980
},
{
"entropy": 5.5617835521698,
"epoch": 6.197958277851753,
"grad_norm": 1.4375,
"learning_rate": 0.00021683226463083238,
"loss": 4.8949,
"mean_token_accuracy": 0.2212710663676262,
"num_tokens": 14383404.0,
"step": 6985
},
{
"entropy": 5.507156562805176,
"epoch": 6.202396804260985,
"grad_norm": 1.234375,
"learning_rate": 0.0002164995703976066,
"loss": 4.9054,
"mean_token_accuracy": 0.21920328438282013,
"num_tokens": 14393603.0,
"step": 6990
},
{
"entropy": 5.47821159362793,
"epoch": 6.206835330670217,
"grad_norm": 1.40625,
"learning_rate": 0.00021616701328539057,
"loss": 4.9131,
"mean_token_accuracy": 0.22882269322872162,
"num_tokens": 14403249.0,
"step": 6995
},
{
"entropy": 5.472233676910401,
"epoch": 6.2112738570794495,
"grad_norm": 1.28125,
"learning_rate": 0.00021583459407367557,
"loss": 4.8924,
"mean_token_accuracy": 0.22245227992534639,
"num_tokens": 14413359.0,
"step": 7000
},
{
"epoch": 6.2112738570794495,
"eval_entropy": 5.415627414993322,
"eval_loss": 5.894550323486328,
"eval_mean_token_accuracy": 0.17017376936104972,
"eval_num_tokens": 14413359.0,
"eval_runtime": 2.697,
"eval_samples_per_second": 1248.442,
"eval_steps_per_second": 156.102,
"step": 7000
},
{
"entropy": 5.5439781665802,
"epoch": 6.215712383488682,
"grad_norm": 1.359375,
"learning_rate": 0.00021550231354162957,
"loss": 4.9004,
"mean_token_accuracy": 0.22160688787698746,
"num_tokens": 14423198.0,
"step": 7005
},
{
"entropy": 5.598263692855835,
"epoch": 6.220150909897914,
"grad_norm": 1.3359375,
"learning_rate": 0.0002151701724680952,
"loss": 4.9546,
"mean_token_accuracy": 0.21566907912492753,
"num_tokens": 14432994.0,
"step": 7010
},
{
"entropy": 5.534407472610473,
"epoch": 6.224589436307146,
"grad_norm": 1.3984375,
"learning_rate": 0.00021483817163158876,
"loss": 4.9085,
"mean_token_accuracy": 0.21766563951969148,
"num_tokens": 14443192.0,
"step": 7015
},
{
"entropy": 5.574075365066529,
"epoch": 6.229027962716378,
"grad_norm": 1.4765625,
"learning_rate": 0.00021450631181029733,
"loss": 4.9435,
"mean_token_accuracy": 0.21509276032447816,
"num_tokens": 14454059.0,
"step": 7020
},
{
"entropy": 5.5993444442749025,
"epoch": 6.23346648912561,
"grad_norm": 1.3515625,
"learning_rate": 0.0002141745937820776,
"loss": 4.9748,
"mean_token_accuracy": 0.2133477210998535,
"num_tokens": 14463759.0,
"step": 7025
},
{
"entropy": 5.590779209136963,
"epoch": 6.237905015534842,
"grad_norm": 1.3828125,
"learning_rate": 0.0002138430183244542,
"loss": 4.9243,
"mean_token_accuracy": 0.21228954643011094,
"num_tokens": 14474181.0,
"step": 7030
},
{
"entropy": 5.515654850006103,
"epoch": 6.2423435419440745,
"grad_norm": 1.21875,
"learning_rate": 0.00021351158621461707,
"loss": 4.8771,
"mean_token_accuracy": 0.21910371780395507,
"num_tokens": 14483982.0,
"step": 7035
},
{
"entropy": 5.480132055282593,
"epoch": 6.246782068353307,
"grad_norm": 1.359375,
"learning_rate": 0.00021318029822942059,
"loss": 4.8526,
"mean_token_accuracy": 0.22817063182592393,
"num_tokens": 14494972.0,
"step": 7040
},
{
"entropy": 5.552070379257202,
"epoch": 6.251220594762539,
"grad_norm": 1.40625,
"learning_rate": 0.00021284915514538128,
"loss": 4.8857,
"mean_token_accuracy": 0.21987539827823638,
"num_tokens": 14505749.0,
"step": 7045
},
{
"entropy": 5.521484851837158,
"epoch": 6.255659121171771,
"grad_norm": 1.3984375,
"learning_rate": 0.0002125181577386756,
"loss": 4.8593,
"mean_token_accuracy": 0.23223900347948073,
"num_tokens": 14515078.0,
"step": 7050
},
{
"entropy": 5.539416217803955,
"epoch": 6.260097647581003,
"grad_norm": 1.2890625,
"learning_rate": 0.0002121873067851391,
"loss": 4.9507,
"mean_token_accuracy": 0.21154749095439912,
"num_tokens": 14525421.0,
"step": 7055
},
{
"entropy": 5.55464448928833,
"epoch": 6.264536173990235,
"grad_norm": 1.4375,
"learning_rate": 0.00021185660306026366,
"loss": 4.9274,
"mean_token_accuracy": 0.22232799082994462,
"num_tokens": 14535352.0,
"step": 7060
},
{
"entropy": 5.51084532737732,
"epoch": 6.268974700399467,
"grad_norm": 1.3515625,
"learning_rate": 0.00021152604733919628,
"loss": 4.9556,
"mean_token_accuracy": 0.21935131400823593,
"num_tokens": 14545196.0,
"step": 7065
},
{
"entropy": 5.59230260848999,
"epoch": 6.2734132268086995,
"grad_norm": 1.3203125,
"learning_rate": 0.000211195640396737,
"loss": 4.9719,
"mean_token_accuracy": 0.21324086636304856,
"num_tokens": 14555060.0,
"step": 7070
},
{
"entropy": 5.556578731536865,
"epoch": 6.277851753217932,
"grad_norm": 1.484375,
"learning_rate": 0.0002108653830073371,
"loss": 4.8782,
"mean_token_accuracy": 0.22991495430469513,
"num_tokens": 14564580.0,
"step": 7075
},
{
"entropy": 5.5330891609191895,
"epoch": 6.282290279627164,
"grad_norm": 1.1953125,
"learning_rate": 0.00021053527594509731,
"loss": 4.9589,
"mean_token_accuracy": 0.21836420595645906,
"num_tokens": 14575872.0,
"step": 7080
},
{
"entropy": 5.539455604553223,
"epoch": 6.286728806036396,
"grad_norm": 1.21875,
"learning_rate": 0.0002102053199837662,
"loss": 5.022,
"mean_token_accuracy": 0.20693743228912354,
"num_tokens": 14586787.0,
"step": 7085
},
{
"entropy": 5.494345235824585,
"epoch": 6.291167332445628,
"grad_norm": 1.390625,
"learning_rate": 0.0002098755158967377,
"loss": 4.8962,
"mean_token_accuracy": 0.22479941844940185,
"num_tokens": 14597215.0,
"step": 7090
},
{
"entropy": 5.572389602661133,
"epoch": 6.29560585885486,
"grad_norm": 1.296875,
"learning_rate": 0.00020954586445705027,
"loss": 4.9326,
"mean_token_accuracy": 0.2146194890141487,
"num_tokens": 14608081.0,
"step": 7095
},
{
"entropy": 5.5912513256073,
"epoch": 6.300044385264092,
"grad_norm": 1.3046875,
"learning_rate": 0.00020921636643738429,
"loss": 5.0152,
"mean_token_accuracy": 0.20137862265110015,
"num_tokens": 14618027.0,
"step": 7100
},
{
"entropy": 5.4752177715301515,
"epoch": 6.3044829116733245,
"grad_norm": 1.3203125,
"learning_rate": 0.0002088870226100606,
"loss": 4.8619,
"mean_token_accuracy": 0.22098766416311263,
"num_tokens": 14628828.0,
"step": 7105
},
{
"entropy": 5.553564214706421,
"epoch": 6.308921438082557,
"grad_norm": 1.3359375,
"learning_rate": 0.00020855783374703861,
"loss": 4.9717,
"mean_token_accuracy": 0.20831257104873657,
"num_tokens": 14638913.0,
"step": 7110
},
{
"entropy": 5.497220373153686,
"epoch": 6.313359964491789,
"grad_norm": 1.3046875,
"learning_rate": 0.0002082288006199146,
"loss": 4.7927,
"mean_token_accuracy": 0.2333698570728302,
"num_tokens": 14648392.0,
"step": 7115
},
{
"entropy": 5.51929202079773,
"epoch": 6.317798490901021,
"grad_norm": 1.40625,
"learning_rate": 0.00020789992399991965,
"loss": 4.9533,
"mean_token_accuracy": 0.21903302073478698,
"num_tokens": 14659422.0,
"step": 7120
},
{
"entropy": 5.508348655700684,
"epoch": 6.322237017310253,
"grad_norm": 1.2890625,
"learning_rate": 0.00020757120465791823,
"loss": 4.8942,
"mean_token_accuracy": 0.21924525648355483,
"num_tokens": 14669419.0,
"step": 7125
},
{
"entropy": 5.628988456726074,
"epoch": 6.326675543719485,
"grad_norm": 1.53125,
"learning_rate": 0.00020724264336440584,
"loss": 4.9656,
"mean_token_accuracy": 0.20997923612594604,
"num_tokens": 14678843.0,
"step": 7130
},
{
"entropy": 5.566967105865478,
"epoch": 6.331114070128717,
"grad_norm": 1.4296875,
"learning_rate": 0.00020691424088950782,
"loss": 4.9551,
"mean_token_accuracy": 0.2179657518863678,
"num_tokens": 14688636.0,
"step": 7135
},
{
"entropy": 5.525785160064697,
"epoch": 6.3355525965379496,
"grad_norm": 1.4140625,
"learning_rate": 0.00020658599800297707,
"loss": 4.9855,
"mean_token_accuracy": 0.21035348623991013,
"num_tokens": 14699781.0,
"step": 7140
},
{
"entropy": 5.540164136886597,
"epoch": 6.339991122947182,
"grad_norm": 1.296875,
"learning_rate": 0.0002062579154741925,
"loss": 4.9754,
"mean_token_accuracy": 0.21742237359285355,
"num_tokens": 14709657.0,
"step": 7145
},
{
"entropy": 5.602196598052979,
"epoch": 6.344429649356414,
"grad_norm": 1.328125,
"learning_rate": 0.00020592999407215718,
"loss": 4.9722,
"mean_token_accuracy": 0.21528039425611495,
"num_tokens": 14719999.0,
"step": 7150
},
{
"entropy": 5.5818932056427,
"epoch": 6.348868175765646,
"grad_norm": 1.3828125,
"learning_rate": 0.00020560223456549638,
"loss": 5.0083,
"mean_token_accuracy": 0.21144500225782395,
"num_tokens": 14730014.0,
"step": 7155
},
{
"entropy": 5.510139751434326,
"epoch": 6.353306702174878,
"grad_norm": 1.3515625,
"learning_rate": 0.0002052746377224561,
"loss": 4.8984,
"mean_token_accuracy": 0.22431433349847793,
"num_tokens": 14740251.0,
"step": 7160
},
{
"entropy": 5.539159488677979,
"epoch": 6.35774522858411,
"grad_norm": 1.3125,
"learning_rate": 0.00020494720431090096,
"loss": 4.9593,
"mean_token_accuracy": 0.2163797825574875,
"num_tokens": 14749658.0,
"step": 7165
},
{
"entropy": 5.553530168533325,
"epoch": 6.362183754993342,
"grad_norm": 1.4765625,
"learning_rate": 0.00020461993509831238,
"loss": 4.9113,
"mean_token_accuracy": 0.22412171810865403,
"num_tokens": 14759561.0,
"step": 7170
},
{
"entropy": 5.5949631690979,
"epoch": 6.366622281402575,
"grad_norm": 1.3046875,
"learning_rate": 0.00020429283085178713,
"loss": 4.997,
"mean_token_accuracy": 0.21032286137342454,
"num_tokens": 14770313.0,
"step": 7175
},
{
"entropy": 5.512533473968506,
"epoch": 6.371060807811807,
"grad_norm": 1.2109375,
"learning_rate": 0.00020396589233803513,
"loss": 4.8402,
"mean_token_accuracy": 0.22684555351734162,
"num_tokens": 14780502.0,
"step": 7180
},
{
"entropy": 5.566857242584229,
"epoch": 6.375499334221039,
"grad_norm": 1.3671875,
"learning_rate": 0.000203639120323378,
"loss": 4.9538,
"mean_token_accuracy": 0.2116124227643013,
"num_tokens": 14790904.0,
"step": 7185
},
{
"entropy": 5.52278208732605,
"epoch": 6.379937860630271,
"grad_norm": 1.3828125,
"learning_rate": 0.0002033125155737471,
"loss": 4.88,
"mean_token_accuracy": 0.23080461025238036,
"num_tokens": 14800834.0,
"step": 7190
},
{
"entropy": 5.570139455795288,
"epoch": 6.384376387039503,
"grad_norm": 1.3203125,
"learning_rate": 0.0002029860788546814,
"loss": 4.9122,
"mean_token_accuracy": 0.21681701242923737,
"num_tokens": 14810748.0,
"step": 7195
},
{
"entropy": 5.552179908752441,
"epoch": 6.388814913448735,
"grad_norm": 1.359375,
"learning_rate": 0.00020265981093132646,
"loss": 4.9086,
"mean_token_accuracy": 0.2180839627981186,
"num_tokens": 14821453.0,
"step": 7200
},
{
"entropy": 5.571068620681762,
"epoch": 6.3932534398579675,
"grad_norm": 1.4296875,
"learning_rate": 0.00020233371256843198,
"loss": 4.9906,
"mean_token_accuracy": 0.21032893061637878,
"num_tokens": 14831651.0,
"step": 7205
},
{
"entropy": 5.582639169692993,
"epoch": 6.3976919662672,
"grad_norm": 1.3046875,
"learning_rate": 0.00020200778453035017,
"loss": 4.9279,
"mean_token_accuracy": 0.2177841067314148,
"num_tokens": 14841856.0,
"step": 7210
},
{
"entropy": 5.6155554294586185,
"epoch": 6.402130492676432,
"grad_norm": 1.2734375,
"learning_rate": 0.00020168202758103415,
"loss": 4.9881,
"mean_token_accuracy": 0.20622386634349824,
"num_tokens": 14851981.0,
"step": 7215
},
{
"entropy": 5.620007038116455,
"epoch": 6.406569019085664,
"grad_norm": 1.28125,
"learning_rate": 0.00020135644248403585,
"loss": 4.9927,
"mean_token_accuracy": 0.2059517666697502,
"num_tokens": 14862928.0,
"step": 7220
},
{
"entropy": 5.565825510025024,
"epoch": 6.411007545494896,
"grad_norm": 1.1484375,
"learning_rate": 0.00020103103000250456,
"loss": 4.9571,
"mean_token_accuracy": 0.2124220073223114,
"num_tokens": 14873704.0,
"step": 7225
},
{
"entropy": 5.5490161895751955,
"epoch": 6.415446071904128,
"grad_norm": 1.578125,
"learning_rate": 0.000200705790899185,
"loss": 4.9306,
"mean_token_accuracy": 0.21215646117925643,
"num_tokens": 14883483.0,
"step": 7230
},
{
"entropy": 5.51604208946228,
"epoch": 6.41988459831336,
"grad_norm": 1.390625,
"learning_rate": 0.0002003807259364152,
"loss": 4.8848,
"mean_token_accuracy": 0.21850584596395492,
"num_tokens": 14893469.0,
"step": 7235
},
{
"entropy": 5.570466136932373,
"epoch": 6.4243231247225925,
"grad_norm": 1.46875,
"learning_rate": 0.00020005583587612535,
"loss": 4.9813,
"mean_token_accuracy": 0.22117258757352828,
"num_tokens": 14903323.0,
"step": 7240
},
{
"entropy": 5.58856954574585,
"epoch": 6.428761651131825,
"grad_norm": 1.3125,
"learning_rate": 0.00019973112147983563,
"loss": 4.944,
"mean_token_accuracy": 0.21649894416332244,
"num_tokens": 14914516.0,
"step": 7245
},
{
"entropy": 5.554163026809692,
"epoch": 6.433200177541057,
"grad_norm": 1.3046875,
"learning_rate": 0.00019940658350865422,
"loss": 4.9261,
"mean_token_accuracy": 0.22312809228897096,
"num_tokens": 14924799.0,
"step": 7250
},
{
"entropy": 5.5466584205627445,
"epoch": 6.437638703950288,
"grad_norm": 1.3203125,
"learning_rate": 0.00019908222272327608,
"loss": 4.934,
"mean_token_accuracy": 0.21238065659999847,
"num_tokens": 14934725.0,
"step": 7255
},
{
"entropy": 5.519527578353882,
"epoch": 6.442077230359521,
"grad_norm": 1.2890625,
"learning_rate": 0.0001987580398839806,
"loss": 4.9117,
"mean_token_accuracy": 0.21712051331996918,
"num_tokens": 14944954.0,
"step": 7260
},
{
"entropy": 5.606967544555664,
"epoch": 6.446515756768752,
"grad_norm": 1.171875,
"learning_rate": 0.00019843403575063028,
"loss": 4.989,
"mean_token_accuracy": 0.20784797966480256,
"num_tokens": 14956614.0,
"step": 7265
},
{
"entropy": 5.537259244918824,
"epoch": 6.450954283177985,
"grad_norm": 1.1796875,
"learning_rate": 0.0001981102110826688,
"loss": 4.9348,
"mean_token_accuracy": 0.21783325970172882,
"num_tokens": 14967766.0,
"step": 7270
},
{
"entropy": 5.502602243423462,
"epoch": 6.455392809587217,
"grad_norm": 1.1328125,
"learning_rate": 0.00019778656663911883,
"loss": 4.873,
"mean_token_accuracy": 0.2198093429207802,
"num_tokens": 14977754.0,
"step": 7275
},
{
"entropy": 5.539269208908081,
"epoch": 6.459831335996449,
"grad_norm": 1.1484375,
"learning_rate": 0.0001974631031785809,
"loss": 5.018,
"mean_token_accuracy": 0.20795969516038895,
"num_tokens": 14988239.0,
"step": 7280
},
{
"entropy": 5.540018606185913,
"epoch": 6.464269862405681,
"grad_norm": 1.28125,
"learning_rate": 0.00019713982145923149,
"loss": 4.965,
"mean_token_accuracy": 0.22250630259513854,
"num_tokens": 14998037.0,
"step": 7285
},
{
"entropy": 5.575396919250489,
"epoch": 6.468708388814913,
"grad_norm": 1.3515625,
"learning_rate": 0.00019681672223882047,
"loss": 4.8789,
"mean_token_accuracy": 0.21838145703077316,
"num_tokens": 15008076.0,
"step": 7290
},
{
"entropy": 5.575087308883667,
"epoch": 6.473146915224145,
"grad_norm": 1.328125,
"learning_rate": 0.00019649380627467062,
"loss": 4.9572,
"mean_token_accuracy": 0.21463317126035691,
"num_tokens": 15018484.0,
"step": 7295
},
{
"entropy": 5.5347404956817625,
"epoch": 6.477585441633377,
"grad_norm": 1.390625,
"learning_rate": 0.00019617107432367477,
"loss": 5.0057,
"mean_token_accuracy": 0.2054355576634407,
"num_tokens": 15028377.0,
"step": 7300
},
{
"entropy": 5.521458387374878,
"epoch": 6.4820239680426095,
"grad_norm": 1.265625,
"learning_rate": 0.00019584852714229456,
"loss": 4.9849,
"mean_token_accuracy": 0.21593954861164094,
"num_tokens": 15039739.0,
"step": 7305
},
{
"entropy": 5.577728700637818,
"epoch": 6.486462494451842,
"grad_norm": 1.1796875,
"learning_rate": 0.00019552616548655866,
"loss": 4.9734,
"mean_token_accuracy": 0.21477217227220535,
"num_tokens": 15051008.0,
"step": 7310
},
{
"entropy": 5.590926170349121,
"epoch": 6.490901020861074,
"grad_norm": 1.390625,
"learning_rate": 0.00019520399011206064,
"loss": 4.9301,
"mean_token_accuracy": 0.21706142723560334,
"num_tokens": 15062389.0,
"step": 7315
},
{
"entropy": 5.5129210472106935,
"epoch": 6.495339547270306,
"grad_norm": 1.421875,
"learning_rate": 0.0001948820017739576,
"loss": 4.937,
"mean_token_accuracy": 0.21531863063573836,
"num_tokens": 15072152.0,
"step": 7320
},
{
"entropy": 5.569131374359131,
"epoch": 6.499778073679538,
"grad_norm": 1.40625,
"learning_rate": 0.00019456020122696834,
"loss": 4.9409,
"mean_token_accuracy": 0.21280237287282944,
"num_tokens": 15082441.0,
"step": 7325
},
{
"entropy": 5.606104135513306,
"epoch": 6.50421660008877,
"grad_norm": 1.2421875,
"learning_rate": 0.00019423858922537108,
"loss": 4.9619,
"mean_token_accuracy": 0.2136653557419777,
"num_tokens": 15093815.0,
"step": 7330
},
{
"entropy": 5.489365291595459,
"epoch": 6.508655126498002,
"grad_norm": 1.40625,
"learning_rate": 0.00019391716652300263,
"loss": 4.8621,
"mean_token_accuracy": 0.22243182808160783,
"num_tokens": 15103852.0,
"step": 7335
},
{
"entropy": 5.494791889190674,
"epoch": 6.5130936529072345,
"grad_norm": 1.375,
"learning_rate": 0.00019359593387325568,
"loss": 4.8751,
"mean_token_accuracy": 0.22394601702690126,
"num_tokens": 15113240.0,
"step": 7340
},
{
"entropy": 5.440359354019165,
"epoch": 6.517532179316467,
"grad_norm": 1.25,
"learning_rate": 0.00019327489202907773,
"loss": 4.8125,
"mean_token_accuracy": 0.23842044323682784,
"num_tokens": 15122670.0,
"step": 7345
},
{
"entropy": 5.555277252197266,
"epoch": 6.521970705725699,
"grad_norm": 1.296875,
"learning_rate": 0.00019295404174296887,
"loss": 4.9713,
"mean_token_accuracy": 0.2124989315867424,
"num_tokens": 15133656.0,
"step": 7350
},
{
"entropy": 5.547752857208252,
"epoch": 6.526409232134931,
"grad_norm": 1.265625,
"learning_rate": 0.0001926333837669802,
"loss": 4.9106,
"mean_token_accuracy": 0.2165180802345276,
"num_tokens": 15144197.0,
"step": 7355
},
{
"entropy": 5.521604919433594,
"epoch": 6.530847758544163,
"grad_norm": 1.3828125,
"learning_rate": 0.00019231291885271214,
"loss": 4.9025,
"mean_token_accuracy": 0.21249637752771378,
"num_tokens": 15154186.0,
"step": 7360
},
{
"entropy": 5.512654066085815,
"epoch": 6.535286284953395,
"grad_norm": 1.2109375,
"learning_rate": 0.0001919926477513127,
"loss": 4.9267,
"mean_token_accuracy": 0.21667930781841277,
"num_tokens": 15165000.0,
"step": 7365
},
{
"entropy": 5.571691656112671,
"epoch": 6.539724811362627,
"grad_norm": 1.421875,
"learning_rate": 0.0001916725712134752,
"loss": 4.8703,
"mean_token_accuracy": 0.22219718098640442,
"num_tokens": 15173717.0,
"step": 7370
},
{
"entropy": 5.530984878540039,
"epoch": 6.5441633377718595,
"grad_norm": 1.3203125,
"learning_rate": 0.00019135268998943738,
"loss": 4.9476,
"mean_token_accuracy": 0.21453277319669722,
"num_tokens": 15184347.0,
"step": 7375
},
{
"entropy": 5.583292293548584,
"epoch": 6.548601864181092,
"grad_norm": 1.3046875,
"learning_rate": 0.00019103300482897884,
"loss": 5.0056,
"mean_token_accuracy": 0.20867671221494674,
"num_tokens": 15194211.0,
"step": 7380
},
{
"entropy": 5.5603893280029295,
"epoch": 6.553040390590324,
"grad_norm": 1.3671875,
"learning_rate": 0.00019071351648141977,
"loss": 4.9244,
"mean_token_accuracy": 0.215047487616539,
"num_tokens": 15204205.0,
"step": 7385
},
{
"entropy": 5.543908643722534,
"epoch": 6.557478916999556,
"grad_norm": 1.2578125,
"learning_rate": 0.0001903942256956192,
"loss": 4.9546,
"mean_token_accuracy": 0.21952016949653624,
"num_tokens": 15213639.0,
"step": 7390
},
{
"entropy": 5.443136262893677,
"epoch": 6.561917443408788,
"grad_norm": 1.265625,
"learning_rate": 0.00019007513321997265,
"loss": 4.8108,
"mean_token_accuracy": 0.22921429425477982,
"num_tokens": 15224116.0,
"step": 7395
},
{
"entropy": 5.5761871337890625,
"epoch": 6.56635596981802,
"grad_norm": 1.265625,
"learning_rate": 0.00018975623980241124,
"loss": 5.0467,
"mean_token_accuracy": 0.19705019742250443,
"num_tokens": 15234698.0,
"step": 7400
},
{
"entropy": 5.528809499740601,
"epoch": 6.570794496227252,
"grad_norm": 1.3125,
"learning_rate": 0.00018943754619039942,
"loss": 4.9477,
"mean_token_accuracy": 0.22121944576501845,
"num_tokens": 15246712.0,
"step": 7405
},
{
"entropy": 5.552549219131469,
"epoch": 6.575233022636485,
"grad_norm": 1.34375,
"learning_rate": 0.00018911905313093307,
"loss": 4.9194,
"mean_token_accuracy": 0.22004495412111283,
"num_tokens": 15256212.0,
"step": 7410
},
{
"entropy": 5.474944829940796,
"epoch": 6.579671549045717,
"grad_norm": 1.3046875,
"learning_rate": 0.00018880076137053827,
"loss": 4.9697,
"mean_token_accuracy": 0.21426863223314285,
"num_tokens": 15266387.0,
"step": 7415
},
{
"entropy": 5.512602376937866,
"epoch": 6.584110075454949,
"grad_norm": 1.234375,
"learning_rate": 0.00018848267165526912,
"loss": 4.9557,
"mean_token_accuracy": 0.2115221843123436,
"num_tokens": 15276758.0,
"step": 7420
},
{
"entropy": 5.584454536437988,
"epoch": 6.588548601864181,
"grad_norm": 1.2109375,
"learning_rate": 0.00018816478473070608,
"loss": 5.0191,
"mean_token_accuracy": 0.20571426451206207,
"num_tokens": 15287761.0,
"step": 7425
},
{
"entropy": 5.523955917358398,
"epoch": 6.592987128273413,
"grad_norm": 1.28125,
"learning_rate": 0.00018784710134195465,
"loss": 4.8963,
"mean_token_accuracy": 0.21990615129470825,
"num_tokens": 15297977.0,
"step": 7430
},
{
"entropy": 5.6014564037323,
"epoch": 6.597425654682645,
"grad_norm": 1.2890625,
"learning_rate": 0.00018752962223364268,
"loss": 5.0225,
"mean_token_accuracy": 0.2103557303547859,
"num_tokens": 15307775.0,
"step": 7435
},
{
"entropy": 5.567426967620849,
"epoch": 6.6018641810918774,
"grad_norm": 1.3359375,
"learning_rate": 0.00018721234814991967,
"loss": 4.9965,
"mean_token_accuracy": 0.20939726531505584,
"num_tokens": 15318207.0,
"step": 7440
},
{
"entropy": 5.518761920928955,
"epoch": 6.60630270750111,
"grad_norm": 1.3515625,
"learning_rate": 0.00018689527983445448,
"loss": 4.8966,
"mean_token_accuracy": 0.2349304050207138,
"num_tokens": 15327679.0,
"step": 7445
},
{
"entropy": 5.533396291732788,
"epoch": 6.610741233910342,
"grad_norm": 1.296875,
"learning_rate": 0.00018657841803043342,
"loss": 4.8862,
"mean_token_accuracy": 0.21814586371183395,
"num_tokens": 15338116.0,
"step": 7450
},
{
"entropy": 5.5464195728302,
"epoch": 6.615179760319574,
"grad_norm": 1.265625,
"learning_rate": 0.0001862617634805589,
"loss": 4.9738,
"mean_token_accuracy": 0.20787449330091476,
"num_tokens": 15348616.0,
"step": 7455
},
{
"entropy": 5.451552391052246,
"epoch": 6.619618286728806,
"grad_norm": 1.2578125,
"learning_rate": 0.00018594531692704764,
"loss": 4.7663,
"mean_token_accuracy": 0.2325999692082405,
"num_tokens": 15358756.0,
"step": 7460
},
{
"entropy": 5.480347204208374,
"epoch": 6.624056813138038,
"grad_norm": 1.3203125,
"learning_rate": 0.0001856290791116287,
"loss": 4.8428,
"mean_token_accuracy": 0.23378848433494567,
"num_tokens": 15368613.0,
"step": 7465
},
{
"entropy": 5.572533750534058,
"epoch": 6.62849533954727,
"grad_norm": 1.34375,
"learning_rate": 0.00018531305077554194,
"loss": 4.9706,
"mean_token_accuracy": 0.21170900613069535,
"num_tokens": 15379404.0,
"step": 7470
},
{
"entropy": 5.5782238960266115,
"epoch": 6.6329338659565025,
"grad_norm": 1.3125,
"learning_rate": 0.00018499723265953617,
"loss": 4.916,
"mean_token_accuracy": 0.21391223669052123,
"num_tokens": 15389834.0,
"step": 7475
},
{
"entropy": 5.539776039123535,
"epoch": 6.637372392365735,
"grad_norm": 1.453125,
"learning_rate": 0.00018468162550386741,
"loss": 4.9276,
"mean_token_accuracy": 0.21960266083478927,
"num_tokens": 15399638.0,
"step": 7480
},
{
"entropy": 5.537761163711548,
"epoch": 6.641810918774967,
"grad_norm": 1.1953125,
"learning_rate": 0.00018436623004829746,
"loss": 4.967,
"mean_token_accuracy": 0.2131970763206482,
"num_tokens": 15410332.0,
"step": 7485
},
{
"entropy": 5.54385027885437,
"epoch": 6.646249445184199,
"grad_norm": 1.34375,
"learning_rate": 0.00018405104703209145,
"loss": 4.9299,
"mean_token_accuracy": 0.21461192518472672,
"num_tokens": 15420786.0,
"step": 7490
},
{
"entropy": 5.583719491958618,
"epoch": 6.650687971593431,
"grad_norm": 1.2734375,
"learning_rate": 0.0001837360771940171,
"loss": 5.0111,
"mean_token_accuracy": 0.21125808209180832,
"num_tokens": 15431117.0,
"step": 7495
},
{
"entropy": 5.562678384780884,
"epoch": 6.655126498002663,
"grad_norm": 1.3359375,
"learning_rate": 0.0001834213212723419,
"loss": 4.9551,
"mean_token_accuracy": 0.21025206744670868,
"num_tokens": 15441011.0,
"step": 7500
},
{
"epoch": 6.655126498002663,
"eval_entropy": 5.433451703495198,
"eval_loss": 5.872466087341309,
"eval_mean_token_accuracy": 0.17129931521033448,
"eval_num_tokens": 15441011.0,
"eval_runtime": 2.6906,
"eval_samples_per_second": 1251.379,
"eval_steps_per_second": 156.469,
"step": 7500
},
{
"entropy": 5.565105867385864,
"epoch": 6.659565024411895,
"grad_norm": 1.296875,
"learning_rate": 0.0001831067800048325,
"loss": 4.9893,
"mean_token_accuracy": 0.21508434265851975,
"num_tokens": 15452241.0,
"step": 7505
},
{
"entropy": 5.5772076606750485,
"epoch": 6.6640035508211275,
"grad_norm": 1.28125,
"learning_rate": 0.000182792454128752,
"loss": 4.9832,
"mean_token_accuracy": 0.20836001187562941,
"num_tokens": 15462245.0,
"step": 7510
},
{
"entropy": 5.453781414031982,
"epoch": 6.66844207723036,
"grad_norm": 1.21875,
"learning_rate": 0.00018247834438085876,
"loss": 4.8834,
"mean_token_accuracy": 0.2298267349600792,
"num_tokens": 15473154.0,
"step": 7515
},
{
"entropy": 5.564900684356689,
"epoch": 6.672880603639592,
"grad_norm": 1.296875,
"learning_rate": 0.00018216445149740463,
"loss": 4.9673,
"mean_token_accuracy": 0.2112121433019638,
"num_tokens": 15484348.0,
"step": 7520
},
{
"entropy": 5.496655035018921,
"epoch": 6.677319130048824,
"grad_norm": 1.484375,
"learning_rate": 0.00018185077621413315,
"loss": 4.8569,
"mean_token_accuracy": 0.2250566825270653,
"num_tokens": 15494242.0,
"step": 7525
},
{
"entropy": 5.597740602493286,
"epoch": 6.681757656458056,
"grad_norm": 1.3125,
"learning_rate": 0.0001815373192662776,
"loss": 5.0132,
"mean_token_accuracy": 0.2117848128080368,
"num_tokens": 15505054.0,
"step": 7530
},
{
"entropy": 5.629758358001709,
"epoch": 6.686196182867288,
"grad_norm": 1.2109375,
"learning_rate": 0.00018122408138855972,
"loss": 5.094,
"mean_token_accuracy": 0.20787640511989594,
"num_tokens": 15517053.0,
"step": 7535
},
{
"entropy": 5.578078699111939,
"epoch": 6.69063470927652,
"grad_norm": 1.21875,
"learning_rate": 0.00018091106331518764,
"loss": 4.9678,
"mean_token_accuracy": 0.2137841433286667,
"num_tokens": 15526698.0,
"step": 7540
},
{
"entropy": 5.5597199440002445,
"epoch": 6.6950732356857525,
"grad_norm": 1.265625,
"learning_rate": 0.0001805982657798544,
"loss": 4.9396,
"mean_token_accuracy": 0.22155947983264923,
"num_tokens": 15537550.0,
"step": 7545
},
{
"entropy": 5.5322150707244875,
"epoch": 6.699511762094985,
"grad_norm": 1.171875,
"learning_rate": 0.00018028568951573604,
"loss": 4.9237,
"mean_token_accuracy": 0.22312415093183519,
"num_tokens": 15548059.0,
"step": 7550
},
{
"entropy": 5.531038808822632,
"epoch": 6.703950288504217,
"grad_norm": 1.3125,
"learning_rate": 0.00017997333525548987,
"loss": 4.8844,
"mean_token_accuracy": 0.22331589609384536,
"num_tokens": 15557643.0,
"step": 7555
},
{
"entropy": 5.5061217784881595,
"epoch": 6.708388814913449,
"grad_norm": 1.3046875,
"learning_rate": 0.00017966120373125315,
"loss": 4.9971,
"mean_token_accuracy": 0.21540144979953765,
"num_tokens": 15567311.0,
"step": 7560
},
{
"entropy": 5.577610778808594,
"epoch": 6.712827341322681,
"grad_norm": 1.2109375,
"learning_rate": 0.0001793492956746408,
"loss": 4.9855,
"mean_token_accuracy": 0.21024437844753266,
"num_tokens": 15578568.0,
"step": 7565
},
{
"entropy": 5.58430027961731,
"epoch": 6.717265867731913,
"grad_norm": 1.28125,
"learning_rate": 0.00017903761181674373,
"loss": 5.0033,
"mean_token_accuracy": 0.2131154552102089,
"num_tokens": 15588261.0,
"step": 7570
},
{
"entropy": 5.5942832946777346,
"epoch": 6.721704394141145,
"grad_norm": 1.28125,
"learning_rate": 0.00017872615288812787,
"loss": 4.972,
"mean_token_accuracy": 0.21587662845849992,
"num_tokens": 15598277.0,
"step": 7575
},
{
"entropy": 5.576036357879639,
"epoch": 6.7261429205503775,
"grad_norm": 1.328125,
"learning_rate": 0.00017841491961883155,
"loss": 5.0137,
"mean_token_accuracy": 0.21150822788476945,
"num_tokens": 15608378.0,
"step": 7580
},
{
"entropy": 5.440856790542602,
"epoch": 6.73058144695961,
"grad_norm": 1.265625,
"learning_rate": 0.00017810391273836423,
"loss": 4.8656,
"mean_token_accuracy": 0.22235908806324006,
"num_tokens": 15618718.0,
"step": 7585
},
{
"entropy": 5.538923454284668,
"epoch": 6.735019973368842,
"grad_norm": 1.2265625,
"learning_rate": 0.00017779313297570503,
"loss": 4.9984,
"mean_token_accuracy": 0.21473804116249084,
"num_tokens": 15628814.0,
"step": 7590
},
{
"entropy": 5.546994590759278,
"epoch": 6.739458499778074,
"grad_norm": 1.1875,
"learning_rate": 0.0001774825810593002,
"loss": 4.9366,
"mean_token_accuracy": 0.22057251185178756,
"num_tokens": 15638845.0,
"step": 7595
},
{
"entropy": 5.51106276512146,
"epoch": 6.743897026187306,
"grad_norm": 1.4765625,
"learning_rate": 0.00017717225771706247,
"loss": 4.8866,
"mean_token_accuracy": 0.22599420696496964,
"num_tokens": 15649869.0,
"step": 7600
},
{
"entropy": 5.567038726806641,
"epoch": 6.748335552596538,
"grad_norm": 1.4453125,
"learning_rate": 0.00017686216367636843,
"loss": 4.9987,
"mean_token_accuracy": 0.21562597751617432,
"num_tokens": 15661114.0,
"step": 7605
},
{
"entropy": 5.534251260757446,
"epoch": 6.75277407900577,
"grad_norm": 1.25,
"learning_rate": 0.00017655229966405723,
"loss": 4.9744,
"mean_token_accuracy": 0.21633935421705247,
"num_tokens": 15671753.0,
"step": 7610
},
{
"entropy": 5.568616580963135,
"epoch": 6.757212605415003,
"grad_norm": 1.2421875,
"learning_rate": 0.00017624266640642905,
"loss": 4.9541,
"mean_token_accuracy": 0.21877749264240265,
"num_tokens": 15681275.0,
"step": 7615
},
{
"entropy": 5.569207382202149,
"epoch": 6.761651131824235,
"grad_norm": 1.3984375,
"learning_rate": 0.00017593326462924308,
"loss": 5.0089,
"mean_token_accuracy": 0.2117543026804924,
"num_tokens": 15691818.0,
"step": 7620
},
{
"entropy": 5.54941840171814,
"epoch": 6.766089658233467,
"grad_norm": 1.375,
"learning_rate": 0.00017562409505771586,
"loss": 4.9161,
"mean_token_accuracy": 0.22721419632434844,
"num_tokens": 15701621.0,
"step": 7625
},
{
"entropy": 5.545981407165527,
"epoch": 6.770528184642699,
"grad_norm": 1.3046875,
"learning_rate": 0.00017531515841651997,
"loss": 4.9604,
"mean_token_accuracy": 0.2164713516831398,
"num_tokens": 15712246.0,
"step": 7630
},
{
"entropy": 5.555404710769653,
"epoch": 6.774966711051931,
"grad_norm": 1.359375,
"learning_rate": 0.00017500645542978144,
"loss": 4.9692,
"mean_token_accuracy": 0.22068429589271546,
"num_tokens": 15722295.0,
"step": 7635
},
{
"entropy": 5.52449369430542,
"epoch": 6.779405237461162,
"grad_norm": 1.34375,
"learning_rate": 0.0001746979868210793,
"loss": 4.8808,
"mean_token_accuracy": 0.22128682136535643,
"num_tokens": 15731898.0,
"step": 7640
},
{
"entropy": 5.538254261016846,
"epoch": 6.7838437638703954,
"grad_norm": 1.203125,
"learning_rate": 0.00017438975331344285,
"loss": 4.9089,
"mean_token_accuracy": 0.2163728505373001,
"num_tokens": 15742338.0,
"step": 7645
},
{
"entropy": 5.503296041488648,
"epoch": 6.788282290279627,
"grad_norm": 1.296875,
"learning_rate": 0.0001740817556293501,
"loss": 4.8689,
"mean_token_accuracy": 0.22529321312904357,
"num_tokens": 15751642.0,
"step": 7650
},
{
"entropy": 5.543597173690796,
"epoch": 6.79272081668886,
"grad_norm": 1.0859375,
"learning_rate": 0.0001737739944907269,
"loss": 4.9519,
"mean_token_accuracy": 0.21429035067558289,
"num_tokens": 15762223.0,
"step": 7655
},
{
"entropy": 5.527972936630249,
"epoch": 6.797159343098091,
"grad_norm": 1.1484375,
"learning_rate": 0.0001734664706189441,
"loss": 4.8971,
"mean_token_accuracy": 0.21979204416275025,
"num_tokens": 15772324.0,
"step": 7660
},
{
"entropy": 5.5575508117675785,
"epoch": 6.801597869507324,
"grad_norm": 1.2109375,
"learning_rate": 0.00017315918473481673,
"loss": 4.9669,
"mean_token_accuracy": 0.21212748885154725,
"num_tokens": 15782361.0,
"step": 7665
},
{
"entropy": 5.518660640716552,
"epoch": 6.806036395916555,
"grad_norm": 1.3984375,
"learning_rate": 0.000172852137558602,
"loss": 4.8935,
"mean_token_accuracy": 0.2195412129163742,
"num_tokens": 15791882.0,
"step": 7670
},
{
"entropy": 5.5690549373626705,
"epoch": 6.810474922325788,
"grad_norm": 1.265625,
"learning_rate": 0.00017254532980999731,
"loss": 4.8992,
"mean_token_accuracy": 0.2253511518239975,
"num_tokens": 15801385.0,
"step": 7675
},
{
"entropy": 5.518895864486694,
"epoch": 6.81491344873502,
"grad_norm": 1.3203125,
"learning_rate": 0.00017223876220813928,
"loss": 4.9283,
"mean_token_accuracy": 0.21845995038747787,
"num_tokens": 15811729.0,
"step": 7680
},
{
"entropy": 5.490466022491455,
"epoch": 6.819351975144252,
"grad_norm": 1.3828125,
"learning_rate": 0.00017193243547160137,
"loss": 4.936,
"mean_token_accuracy": 0.22149820178747176,
"num_tokens": 15821669.0,
"step": 7685
},
{
"entropy": 5.613123369216919,
"epoch": 6.823790501553484,
"grad_norm": 1.28125,
"learning_rate": 0.00017162635031839235,
"loss": 5.059,
"mean_token_accuracy": 0.21032467633485794,
"num_tokens": 15832555.0,
"step": 7690
},
{
"entropy": 5.607917594909668,
"epoch": 6.828229027962716,
"grad_norm": 1.2890625,
"learning_rate": 0.00017132050746595506,
"loss": 4.944,
"mean_token_accuracy": 0.21487554609775544,
"num_tokens": 15841866.0,
"step": 7695
},
{
"entropy": 5.5373986721038815,
"epoch": 6.832667554371948,
"grad_norm": 1.296875,
"learning_rate": 0.00017101490763116425,
"loss": 4.8652,
"mean_token_accuracy": 0.22313926219940186,
"num_tokens": 15851403.0,
"step": 7700
},
{
"entropy": 5.403235673904419,
"epoch": 6.83710608078118,
"grad_norm": 1.2890625,
"learning_rate": 0.0001707095515303249,
"loss": 4.819,
"mean_token_accuracy": 0.23036244362592698,
"num_tokens": 15861136.0,
"step": 7705
},
{
"entropy": 5.508434629440307,
"epoch": 6.8415446071904125,
"grad_norm": 1.0625,
"learning_rate": 0.00017040443987917107,
"loss": 4.9685,
"mean_token_accuracy": 0.21057210862636566,
"num_tokens": 15872000.0,
"step": 7710
},
{
"entropy": 5.562422561645508,
"epoch": 6.845983133599645,
"grad_norm": 1.3671875,
"learning_rate": 0.00017009957339286346,
"loss": 4.9852,
"mean_token_accuracy": 0.21071284711360933,
"num_tokens": 15881721.0,
"step": 7715
},
{
"entropy": 5.5122603416442875,
"epoch": 6.850421660008877,
"grad_norm": 1.265625,
"learning_rate": 0.00016979495278598834,
"loss": 4.8697,
"mean_token_accuracy": 0.22172239869832994,
"num_tokens": 15891939.0,
"step": 7720
},
{
"entropy": 5.534740734100342,
"epoch": 6.854860186418109,
"grad_norm": 1.3828125,
"learning_rate": 0.00016949057877255568,
"loss": 4.8869,
"mean_token_accuracy": 0.22549089938402175,
"num_tokens": 15901955.0,
"step": 7725
},
{
"entropy": 5.527624988555909,
"epoch": 6.859298712827341,
"grad_norm": 1.34375,
"learning_rate": 0.00016918645206599715,
"loss": 4.8805,
"mean_token_accuracy": 0.21357282400131225,
"num_tokens": 15911906.0,
"step": 7730
},
{
"entropy": 5.537739896774292,
"epoch": 6.863737239236573,
"grad_norm": 1.328125,
"learning_rate": 0.0001688825733791652,
"loss": 4.8817,
"mean_token_accuracy": 0.215438637137413,
"num_tokens": 15921389.0,
"step": 7735
},
{
"entropy": 5.6014237880706785,
"epoch": 6.868175765645805,
"grad_norm": 1.2265625,
"learning_rate": 0.0001685789434243306,
"loss": 5.0405,
"mean_token_accuracy": 0.21656180918216705,
"num_tokens": 15932419.0,
"step": 7740
},
{
"entropy": 5.588205718994141,
"epoch": 6.8726142920550375,
"grad_norm": 1.3046875,
"learning_rate": 0.00016827556291318117,
"loss": 5.0265,
"mean_token_accuracy": 0.20712802112102507,
"num_tokens": 15942861.0,
"step": 7745
},
{
"entropy": 5.5192646980285645,
"epoch": 6.87705281846427,
"grad_norm": 1.3515625,
"learning_rate": 0.00016797243255682026,
"loss": 4.8868,
"mean_token_accuracy": 0.22516984045505523,
"num_tokens": 15952205.0,
"step": 7750
},
{
"entropy": 5.543596839904785,
"epoch": 6.881491344873502,
"grad_norm": 1.28125,
"learning_rate": 0.00016766955306576458,
"loss": 4.9872,
"mean_token_accuracy": 0.21560545414686202,
"num_tokens": 15963222.0,
"step": 7755
},
{
"entropy": 5.540840721130371,
"epoch": 6.885929871282734,
"grad_norm": 1.234375,
"learning_rate": 0.0001673669251499429,
"loss": 4.8694,
"mean_token_accuracy": 0.2329263225197792,
"num_tokens": 15973309.0,
"step": 7760
},
{
"entropy": 5.603669309616089,
"epoch": 6.890368397691966,
"grad_norm": 1.3828125,
"learning_rate": 0.00016706454951869468,
"loss": 4.9901,
"mean_token_accuracy": 0.21477916091680527,
"num_tokens": 15983434.0,
"step": 7765
},
{
"entropy": 5.5009620666503904,
"epoch": 6.894806924101198,
"grad_norm": 1.2578125,
"learning_rate": 0.00016676242688076737,
"loss": 4.8267,
"mean_token_accuracy": 0.22609834522008895,
"num_tokens": 15994229.0,
"step": 7770
},
{
"entropy": 5.514490699768066,
"epoch": 6.89924545051043,
"grad_norm": 1.3984375,
"learning_rate": 0.00016646055794431602,
"loss": 4.998,
"mean_token_accuracy": 0.2085113435983658,
"num_tokens": 16004322.0,
"step": 7775
},
{
"entropy": 5.5758161544799805,
"epoch": 6.9036839769196625,
"grad_norm": 1.2421875,
"learning_rate": 0.00016615894341690074,
"loss": 4.9419,
"mean_token_accuracy": 0.22001910358667373,
"num_tokens": 16013846.0,
"step": 7780
},
{
"entropy": 5.631315755844116,
"epoch": 6.908122503328895,
"grad_norm": 1.296875,
"learning_rate": 0.0001658575840054853,
"loss": 5.0109,
"mean_token_accuracy": 0.2098667725920677,
"num_tokens": 16024230.0,
"step": 7785
},
{
"entropy": 5.560648584365845,
"epoch": 6.912561029738127,
"grad_norm": 1.1953125,
"learning_rate": 0.00016555648041643566,
"loss": 4.9415,
"mean_token_accuracy": 0.21280067563056945,
"num_tokens": 16034299.0,
"step": 7790
},
{
"entropy": 5.5424243927001955,
"epoch": 6.916999556147359,
"grad_norm": 1.4453125,
"learning_rate": 0.00016525563335551804,
"loss": 4.9421,
"mean_token_accuracy": 0.22658007144927977,
"num_tokens": 16044180.0,
"step": 7795
},
{
"entropy": 5.534834194183349,
"epoch": 6.921438082556591,
"grad_norm": 1.2734375,
"learning_rate": 0.00016495504352789735,
"loss": 4.9855,
"mean_token_accuracy": 0.21532035619020462,
"num_tokens": 16054461.0,
"step": 7800
},
{
"entropy": 5.510569429397583,
"epoch": 6.925876608965823,
"grad_norm": 1.21875,
"learning_rate": 0.00016465471163813576,
"loss": 4.9646,
"mean_token_accuracy": 0.21625108569860457,
"num_tokens": 16065962.0,
"step": 7805
},
{
"entropy": 5.518696546554565,
"epoch": 6.930315135375055,
"grad_norm": 1.2734375,
"learning_rate": 0.00016435463839019045,
"loss": 4.8412,
"mean_token_accuracy": 0.2187938243150711,
"num_tokens": 16076125.0,
"step": 7810
},
{
"entropy": 5.530542373657227,
"epoch": 6.9347536617842875,
"grad_norm": 1.34375,
"learning_rate": 0.0001640548244874128,
"loss": 4.9254,
"mean_token_accuracy": 0.2178049236536026,
"num_tokens": 16086582.0,
"step": 7815
},
{
"entropy": 5.510978507995605,
"epoch": 6.93919218819352,
"grad_norm": 1.25,
"learning_rate": 0.00016375527063254604,
"loss": 4.9403,
"mean_token_accuracy": 0.2125280275940895,
"num_tokens": 16097072.0,
"step": 7820
},
{
"entropy": 5.543430233001709,
"epoch": 6.943630714602752,
"grad_norm": 1.2734375,
"learning_rate": 0.0001634559775277239,
"loss": 4.8512,
"mean_token_accuracy": 0.2229102522134781,
"num_tokens": 16107155.0,
"step": 7825
},
{
"entropy": 5.465942001342773,
"epoch": 6.948069241011984,
"grad_norm": 1.2578125,
"learning_rate": 0.0001631569458744691,
"loss": 4.788,
"mean_token_accuracy": 0.2326107367873192,
"num_tokens": 16116320.0,
"step": 7830
},
{
"entropy": 5.527227830886841,
"epoch": 6.952507767421216,
"grad_norm": 1.171875,
"learning_rate": 0.00016285817637369133,
"loss": 4.9287,
"mean_token_accuracy": 0.21412108689546586,
"num_tokens": 16127160.0,
"step": 7835
},
{
"entropy": 5.474220418930054,
"epoch": 6.956946293830448,
"grad_norm": 1.3515625,
"learning_rate": 0.00016255966972568574,
"loss": 4.9013,
"mean_token_accuracy": 0.22032673358917237,
"num_tokens": 16137512.0,
"step": 7840
},
{
"entropy": 5.539914226531982,
"epoch": 6.96138482023968,
"grad_norm": 1.2890625,
"learning_rate": 0.0001622614266301319,
"loss": 4.942,
"mean_token_accuracy": 0.22001080960035324,
"num_tokens": 16147360.0,
"step": 7845
},
{
"entropy": 5.562770509719849,
"epoch": 6.965823346648913,
"grad_norm": 1.2265625,
"learning_rate": 0.0001619634477860908,
"loss": 4.9612,
"mean_token_accuracy": 0.21766769737005234,
"num_tokens": 16156831.0,
"step": 7850
},
{
"entropy": 5.514585828781128,
"epoch": 6.970261873058145,
"grad_norm": 1.3984375,
"learning_rate": 0.00016166573389200478,
"loss": 4.9254,
"mean_token_accuracy": 0.21982194483280182,
"num_tokens": 16167435.0,
"step": 7855
},
{
"entropy": 5.539769268035888,
"epoch": 6.974700399467377,
"grad_norm": 1.40625,
"learning_rate": 0.00016136828564569482,
"loss": 5.0289,
"mean_token_accuracy": 0.21073384582996368,
"num_tokens": 16177400.0,
"step": 7860
},
{
"entropy": 5.435232019424438,
"epoch": 6.979138925876609,
"grad_norm": 1.21875,
"learning_rate": 0.00016107110374435912,
"loss": 4.8471,
"mean_token_accuracy": 0.23319431096315385,
"num_tokens": 16187529.0,
"step": 7865
},
{
"entropy": 5.45747447013855,
"epoch": 6.983577452285841,
"grad_norm": 1.3984375,
"learning_rate": 0.00016077418888457197,
"loss": 4.8004,
"mean_token_accuracy": 0.2349813848733902,
"num_tokens": 16197515.0,
"step": 7870
},
{
"entropy": 5.580996084213257,
"epoch": 6.988015978695073,
"grad_norm": 1.234375,
"learning_rate": 0.00016047754176228145,
"loss": 5.0835,
"mean_token_accuracy": 0.206863734126091,
"num_tokens": 16208407.0,
"step": 7875
},
{
"entropy": 5.5298388481140135,
"epoch": 6.992454505104305,
"grad_norm": 1.1171875,
"learning_rate": 0.00016018116307280801,
"loss": 4.8976,
"mean_token_accuracy": 0.21983272433280945,
"num_tokens": 16220079.0,
"step": 7880
},
{
"entropy": 5.535926485061646,
"epoch": 6.996893031513538,
"grad_norm": 1.3046875,
"learning_rate": 0.00015988505351084334,
"loss": 4.8715,
"mean_token_accuracy": 0.22571598887443542,
"num_tokens": 16230652.0,
"step": 7885
},
{
"entropy": 5.5292445288764105,
"epoch": 7.000887705281847,
"grad_norm": 1.265625,
"learning_rate": 0.00015958921377044765,
"loss": 4.932,
"mean_token_accuracy": 0.22119410004880694,
"num_tokens": 16240468.0,
"step": 7890
},
{
"entropy": 5.565903282165527,
"epoch": 7.005326231691079,
"grad_norm": 1.3125,
"learning_rate": 0.00015929364454504935,
"loss": 4.8382,
"mean_token_accuracy": 0.21748816668987275,
"num_tokens": 16249703.0,
"step": 7895
},
{
"entropy": 5.5517669200897215,
"epoch": 7.009764758100311,
"grad_norm": 1.203125,
"learning_rate": 0.00015899834652744247,
"loss": 4.8414,
"mean_token_accuracy": 0.21986480355262755,
"num_tokens": 16260998.0,
"step": 7900
},
{
"entropy": 5.534623432159424,
"epoch": 7.014203284509543,
"grad_norm": 1.3203125,
"learning_rate": 0.0001587033204097852,
"loss": 4.8262,
"mean_token_accuracy": 0.2315726563334465,
"num_tokens": 16270718.0,
"step": 7905
},
{
"entropy": 5.499970531463623,
"epoch": 7.018641810918775,
"grad_norm": 1.296875,
"learning_rate": 0.00015840856688359887,
"loss": 4.8604,
"mean_token_accuracy": 0.2276461660861969,
"num_tokens": 16281573.0,
"step": 7910
},
{
"entropy": 5.489800643920899,
"epoch": 7.0230803373280075,
"grad_norm": 1.125,
"learning_rate": 0.00015811408663976546,
"loss": 4.7549,
"mean_token_accuracy": 0.23386742174625397,
"num_tokens": 16293543.0,
"step": 7915
},
{
"entropy": 5.481780529022217,
"epoch": 7.02751886373724,
"grad_norm": 1.3359375,
"learning_rate": 0.00015781988036852647,
"loss": 4.7375,
"mean_token_accuracy": 0.23514950424432754,
"num_tokens": 16303030.0,
"step": 7920
},
{
"entropy": 5.551403141021728,
"epoch": 7.031957390146472,
"grad_norm": 1.2890625,
"learning_rate": 0.00015752594875948156,
"loss": 4.8416,
"mean_token_accuracy": 0.22496299147605897,
"num_tokens": 16312923.0,
"step": 7925
},
{
"entropy": 5.554946804046631,
"epoch": 7.036395916555703,
"grad_norm": 1.1953125,
"learning_rate": 0.00015723229250158598,
"loss": 4.8175,
"mean_token_accuracy": 0.22460051774978637,
"num_tokens": 16324347.0,
"step": 7930
},
{
"entropy": 5.537577056884766,
"epoch": 7.040834442964935,
"grad_norm": 1.3046875,
"learning_rate": 0.00015693891228315025,
"loss": 4.6995,
"mean_token_accuracy": 0.2363031968474388,
"num_tokens": 16334160.0,
"step": 7935
},
{
"entropy": 5.566307640075683,
"epoch": 7.045272969374167,
"grad_norm": 1.453125,
"learning_rate": 0.00015664580879183737,
"loss": 4.842,
"mean_token_accuracy": 0.22375402152538298,
"num_tokens": 16343381.0,
"step": 7940
},
{
"entropy": 5.593927335739136,
"epoch": 7.0497114957833995,
"grad_norm": 1.328125,
"learning_rate": 0.00015635298271466188,
"loss": 4.9271,
"mean_token_accuracy": 0.21231627017259597,
"num_tokens": 16354539.0,
"step": 7945
},
{
"entropy": 5.536477994918823,
"epoch": 7.054150022192632,
"grad_norm": 1.3359375,
"learning_rate": 0.0001560604347379883,
"loss": 4.8844,
"mean_token_accuracy": 0.2209285467863083,
"num_tokens": 16364886.0,
"step": 7950
},
{
"entropy": 5.545589971542358,
"epoch": 7.058588548601864,
"grad_norm": 1.390625,
"learning_rate": 0.00015576816554752892,
"loss": 4.8537,
"mean_token_accuracy": 0.22095734924077987,
"num_tokens": 16374341.0,
"step": 7955
},
{
"entropy": 5.582144355773925,
"epoch": 7.063027075011096,
"grad_norm": 1.265625,
"learning_rate": 0.00015547617582834273,
"loss": 4.8919,
"mean_token_accuracy": 0.21359026581048965,
"num_tokens": 16385619.0,
"step": 7960
},
{
"entropy": 5.563768529891968,
"epoch": 7.067465601420328,
"grad_norm": 1.3515625,
"learning_rate": 0.00015518446626483392,
"loss": 4.8257,
"mean_token_accuracy": 0.22679323256015776,
"num_tokens": 16395807.0,
"step": 7965
},
{
"entropy": 5.580456829071045,
"epoch": 7.07190412782956,
"grad_norm": 1.3046875,
"learning_rate": 0.00015489303754074945,
"loss": 4.8699,
"mean_token_accuracy": 0.2149389088153839,
"num_tokens": 16405647.0,
"step": 7970
},
{
"entropy": 5.500267887115479,
"epoch": 7.076342654238792,
"grad_norm": 1.328125,
"learning_rate": 0.0001546018903391786,
"loss": 4.8523,
"mean_token_accuracy": 0.22563212364912033,
"num_tokens": 16415194.0,
"step": 7975
},
{
"entropy": 5.568335008621216,
"epoch": 7.0807811806480245,
"grad_norm": 1.3671875,
"learning_rate": 0.00015431102534255037,
"loss": 4.8703,
"mean_token_accuracy": 0.21965404599905014,
"num_tokens": 16425195.0,
"step": 7980
},
{
"entropy": 5.51585373878479,
"epoch": 7.085219707057257,
"grad_norm": 1.359375,
"learning_rate": 0.00015402044323263242,
"loss": 4.7516,
"mean_token_accuracy": 0.2385525271296501,
"num_tokens": 16435643.0,
"step": 7985
},
{
"entropy": 5.551548194885254,
"epoch": 7.089658233466489,
"grad_norm": 1.3203125,
"learning_rate": 0.00015373014469052948,
"loss": 4.7653,
"mean_token_accuracy": 0.23402368575334548,
"num_tokens": 16445925.0,
"step": 7990
},
{
"entropy": 5.484806203842163,
"epoch": 7.094096759875721,
"grad_norm": 1.3671875,
"learning_rate": 0.00015344013039668148,
"loss": 4.7979,
"mean_token_accuracy": 0.22974969297647477,
"num_tokens": 16456433.0,
"step": 7995
},
{
"entropy": 5.5673164367675785,
"epoch": 7.098535286284953,
"grad_norm": 1.40625,
"learning_rate": 0.00015315040103086196,
"loss": 4.8894,
"mean_token_accuracy": 0.21772680729627608,
"num_tokens": 16468007.0,
"step": 8000
},
{
"epoch": 7.098535286284953,
"eval_entropy": 5.417081438730562,
"eval_loss": 5.868298530578613,
"eval_mean_token_accuracy": 0.17251386265148744,
"eval_num_tokens": 16468007.0,
"eval_runtime": 2.7016,
"eval_samples_per_second": 1246.311,
"eval_steps_per_second": 155.835,
"step": 8000
},
{
"entropy": 5.547671842575073,
"epoch": 7.102973812694185,
"grad_norm": 1.265625,
"learning_rate": 0.00015286095727217702,
"loss": 4.8401,
"mean_token_accuracy": 0.2188134655356407,
"num_tokens": 16477025.0,
"step": 8005
},
{
"entropy": 5.5542027950286865,
"epoch": 7.107412339103417,
"grad_norm": 1.3671875,
"learning_rate": 0.00015257179979906278,
"loss": 4.804,
"mean_token_accuracy": 0.23099099695682526,
"num_tokens": 16486515.0,
"step": 8010
},
{
"entropy": 5.475750875473023,
"epoch": 7.1118508655126496,
"grad_norm": 1.3515625,
"learning_rate": 0.00015228292928928471,
"loss": 4.7812,
"mean_token_accuracy": 0.22622407525777816,
"num_tokens": 16495978.0,
"step": 8015
},
{
"entropy": 5.578029155731201,
"epoch": 7.116289391921882,
"grad_norm": 1.328125,
"learning_rate": 0.00015199434641993565,
"loss": 4.9103,
"mean_token_accuracy": 0.21572188585996627,
"num_tokens": 16506911.0,
"step": 8020
},
{
"entropy": 5.57917013168335,
"epoch": 7.120727918331114,
"grad_norm": 1.359375,
"learning_rate": 0.00015170605186743392,
"loss": 4.8321,
"mean_token_accuracy": 0.23019132614135743,
"num_tokens": 16516311.0,
"step": 8025
},
{
"entropy": 5.542527723312378,
"epoch": 7.125166444740346,
"grad_norm": 1.2734375,
"learning_rate": 0.00015141804630752244,
"loss": 4.7415,
"mean_token_accuracy": 0.23034332692623138,
"num_tokens": 16526681.0,
"step": 8030
},
{
"entropy": 5.588299083709717,
"epoch": 7.129604971149578,
"grad_norm": 1.3984375,
"learning_rate": 0.00015113033041526652,
"loss": 4.7978,
"mean_token_accuracy": 0.2255474552512169,
"num_tokens": 16537423.0,
"step": 8035
},
{
"entropy": 5.505769491195679,
"epoch": 7.13404349755881,
"grad_norm": 1.390625,
"learning_rate": 0.00015084290486505242,
"loss": 4.8383,
"mean_token_accuracy": 0.2282260313630104,
"num_tokens": 16547597.0,
"step": 8040
},
{
"entropy": 5.483242607116699,
"epoch": 7.138482023968042,
"grad_norm": 1.296875,
"learning_rate": 0.00015055577033058626,
"loss": 4.7709,
"mean_token_accuracy": 0.2337564632296562,
"num_tokens": 16558041.0,
"step": 8045
},
{
"entropy": 5.515174627304077,
"epoch": 7.142920550377275,
"grad_norm": 1.40625,
"learning_rate": 0.0001502689274848914,
"loss": 4.8708,
"mean_token_accuracy": 0.23410458117723465,
"num_tokens": 16568852.0,
"step": 8050
},
{
"entropy": 5.489902353286743,
"epoch": 7.147359076786507,
"grad_norm": 1.3046875,
"learning_rate": 0.00014998237700030822,
"loss": 4.7999,
"mean_token_accuracy": 0.22890048772096633,
"num_tokens": 16578621.0,
"step": 8055
},
{
"entropy": 5.549872493743896,
"epoch": 7.151797603195739,
"grad_norm": 1.2890625,
"learning_rate": 0.00014969611954849133,
"loss": 4.8904,
"mean_token_accuracy": 0.22757930755615235,
"num_tokens": 16589276.0,
"step": 8060
},
{
"entropy": 5.578784704208374,
"epoch": 7.156236129604971,
"grad_norm": 1.4765625,
"learning_rate": 0.00014941015580040854,
"loss": 4.8428,
"mean_token_accuracy": 0.2250010758638382,
"num_tokens": 16598684.0,
"step": 8065
},
{
"entropy": 5.54313645362854,
"epoch": 7.160674656014203,
"grad_norm": 1.171875,
"learning_rate": 0.00014912448642633952,
"loss": 4.8411,
"mean_token_accuracy": 0.2198699176311493,
"num_tokens": 16609809.0,
"step": 8070
},
{
"entropy": 5.484795713424683,
"epoch": 7.165113182423435,
"grad_norm": 1.3203125,
"learning_rate": 0.00014883911209587366,
"loss": 4.8334,
"mean_token_accuracy": 0.22378929555416108,
"num_tokens": 16620542.0,
"step": 8075
},
{
"entropy": 5.572915744781494,
"epoch": 7.1695517088326675,
"grad_norm": 1.1953125,
"learning_rate": 0.00014855403347790885,
"loss": 4.8565,
"mean_token_accuracy": 0.22495311200618745,
"num_tokens": 16632469.0,
"step": 8080
},
{
"entropy": 5.508671426773072,
"epoch": 7.1739902352419,
"grad_norm": 1.28125,
"learning_rate": 0.00014826925124065014,
"loss": 4.8023,
"mean_token_accuracy": 0.23364190608263016,
"num_tokens": 16643392.0,
"step": 8085
},
{
"entropy": 5.549451017379761,
"epoch": 7.178428761651132,
"grad_norm": 1.203125,
"learning_rate": 0.00014798476605160728,
"loss": 4.8544,
"mean_token_accuracy": 0.2243693932890892,
"num_tokens": 16654342.0,
"step": 8090
},
{
"entropy": 5.52611813545227,
"epoch": 7.182867288060364,
"grad_norm": 1.40625,
"learning_rate": 0.00014770057857759438,
"loss": 4.8278,
"mean_token_accuracy": 0.22625938057899475,
"num_tokens": 16663987.0,
"step": 8095
},
{
"entropy": 5.502599811553955,
"epoch": 7.187305814469596,
"grad_norm": 1.34375,
"learning_rate": 0.00014741668948472735,
"loss": 4.7703,
"mean_token_accuracy": 0.23049034625291825,
"num_tokens": 16674039.0,
"step": 8100
},
{
"entropy": 5.54769082069397,
"epoch": 7.191744340878828,
"grad_norm": 1.3203125,
"learning_rate": 0.00014713309943842272,
"loss": 4.8235,
"mean_token_accuracy": 0.22678229212760925,
"num_tokens": 16684956.0,
"step": 8105
},
{
"entropy": 5.542664337158203,
"epoch": 7.19618286728806,
"grad_norm": 1.3203125,
"learning_rate": 0.00014684980910339645,
"loss": 4.811,
"mean_token_accuracy": 0.22825126200914383,
"num_tokens": 16694386.0,
"step": 8110
},
{
"entropy": 5.567810678482056,
"epoch": 7.2006213936972925,
"grad_norm": 1.3046875,
"learning_rate": 0.0001465668191436616,
"loss": 4.8191,
"mean_token_accuracy": 0.22737596780061722,
"num_tokens": 16704102.0,
"step": 8115
},
{
"entropy": 5.525670337677002,
"epoch": 7.205059920106525,
"grad_norm": 1.390625,
"learning_rate": 0.00014628413022252715,
"loss": 4.8254,
"mean_token_accuracy": 0.22843316495418547,
"num_tokens": 16714091.0,
"step": 8120
},
{
"entropy": 5.462945365905762,
"epoch": 7.209498446515757,
"grad_norm": 1.3046875,
"learning_rate": 0.00014600174300259693,
"loss": 4.7493,
"mean_token_accuracy": 0.23545086532831191,
"num_tokens": 16725368.0,
"step": 8125
},
{
"entropy": 5.504182481765747,
"epoch": 7.213936972924989,
"grad_norm": 1.4296875,
"learning_rate": 0.000145719658145767,
"loss": 4.7538,
"mean_token_accuracy": 0.22991939634084702,
"num_tokens": 16735174.0,
"step": 8130
},
{
"entropy": 5.522628545761108,
"epoch": 7.218375499334221,
"grad_norm": 1.453125,
"learning_rate": 0.00014543787631322513,
"loss": 4.8879,
"mean_token_accuracy": 0.22089564055204391,
"num_tokens": 16745772.0,
"step": 8135
},
{
"entropy": 5.550188446044922,
"epoch": 7.222814025743453,
"grad_norm": 1.1875,
"learning_rate": 0.00014515639816544865,
"loss": 4.8424,
"mean_token_accuracy": 0.21901417672634124,
"num_tokens": 16756771.0,
"step": 8140
},
{
"entropy": 5.508692789077759,
"epoch": 7.227252552152685,
"grad_norm": 1.3125,
"learning_rate": 0.00014487522436220304,
"loss": 4.8438,
"mean_token_accuracy": 0.22418237179517747,
"num_tokens": 16767199.0,
"step": 8145
},
{
"entropy": 5.579889440536499,
"epoch": 7.2316910785619175,
"grad_norm": 1.203125,
"learning_rate": 0.00014459435556254062,
"loss": 4.9329,
"mean_token_accuracy": 0.21205476969480513,
"num_tokens": 16778303.0,
"step": 8150
},
{
"entropy": 5.5756187915802,
"epoch": 7.23612960497115,
"grad_norm": 1.21875,
"learning_rate": 0.00014431379242479863,
"loss": 4.8782,
"mean_token_accuracy": 0.22583089917898178,
"num_tokens": 16789043.0,
"step": 8155
},
{
"entropy": 5.502965259552002,
"epoch": 7.240568131380382,
"grad_norm": 1.3046875,
"learning_rate": 0.00014403353560659776,
"loss": 4.8176,
"mean_token_accuracy": 0.22689286917448043,
"num_tokens": 16799261.0,
"step": 8160
},
{
"entropy": 5.4611681461334225,
"epoch": 7.245006657789614,
"grad_norm": 1.421875,
"learning_rate": 0.00014375358576484114,
"loss": 4.797,
"mean_token_accuracy": 0.23626856207847596,
"num_tokens": 16809392.0,
"step": 8165
},
{
"entropy": 5.527022075653076,
"epoch": 7.249445184198846,
"grad_norm": 1.3203125,
"learning_rate": 0.00014347394355571167,
"loss": 4.8138,
"mean_token_accuracy": 0.22673380970954896,
"num_tokens": 16818645.0,
"step": 8170
},
{
"entropy": 5.52257285118103,
"epoch": 7.253883710608078,
"grad_norm": 1.2578125,
"learning_rate": 0.0001431946096346719,
"loss": 4.8578,
"mean_token_accuracy": 0.2238910511136055,
"num_tokens": 16827998.0,
"step": 8175
},
{
"entropy": 5.553846597671509,
"epoch": 7.25832223701731,
"grad_norm": 1.40625,
"learning_rate": 0.00014291558465646132,
"loss": 4.8377,
"mean_token_accuracy": 0.22434737384319306,
"num_tokens": 16838314.0,
"step": 8180
},
{
"entropy": 5.5643891334533695,
"epoch": 7.2627607634265425,
"grad_norm": 1.3984375,
"learning_rate": 0.0001426368692750954,
"loss": 4.8456,
"mean_token_accuracy": 0.22257078886032106,
"num_tokens": 16847978.0,
"step": 8185
},
{
"entropy": 5.473025560379028,
"epoch": 7.267199289835775,
"grad_norm": 1.390625,
"learning_rate": 0.000142358464143864,
"loss": 4.8104,
"mean_token_accuracy": 0.23016615509986876,
"num_tokens": 16858105.0,
"step": 8190
},
{
"entropy": 5.457581567764282,
"epoch": 7.271637816245007,
"grad_norm": 1.2109375,
"learning_rate": 0.00014208036991532978,
"loss": 4.7493,
"mean_token_accuracy": 0.23675765246152877,
"num_tokens": 16868574.0,
"step": 8195
},
{
"entropy": 5.500149965286255,
"epoch": 7.276076342654239,
"grad_norm": 1.34375,
"learning_rate": 0.0001418025872413264,
"loss": 4.7875,
"mean_token_accuracy": 0.2306971177458763,
"num_tokens": 16878456.0,
"step": 8200
},
{
"entropy": 5.54533200263977,
"epoch": 7.280514869063471,
"grad_norm": 1.2890625,
"learning_rate": 0.00014152511677295785,
"loss": 4.856,
"mean_token_accuracy": 0.22881562411785125,
"num_tokens": 16887687.0,
"step": 8205
},
{
"entropy": 5.532986259460449,
"epoch": 7.284953395472703,
"grad_norm": 1.3046875,
"learning_rate": 0.00014124795916059548,
"loss": 4.8357,
"mean_token_accuracy": 0.22583044022321702,
"num_tokens": 16898846.0,
"step": 8210
},
{
"entropy": 5.574441719055176,
"epoch": 7.289391921881935,
"grad_norm": 1.28125,
"learning_rate": 0.00014097111505387817,
"loss": 4.8899,
"mean_token_accuracy": 0.21410389095544816,
"num_tokens": 16908820.0,
"step": 8215
},
{
"entropy": 5.524200057983398,
"epoch": 7.293830448291168,
"grad_norm": 1.21875,
"learning_rate": 0.0001406945851017094,
"loss": 4.912,
"mean_token_accuracy": 0.2211119070649147,
"num_tokens": 16920229.0,
"step": 8220
},
{
"entropy": 5.500553894042969,
"epoch": 7.2982689747004,
"grad_norm": 1.421875,
"learning_rate": 0.00014041836995225645,
"loss": 4.7488,
"mean_token_accuracy": 0.23597707003355026,
"num_tokens": 16929534.0,
"step": 8225
},
{
"entropy": 5.5176365852355955,
"epoch": 7.302707501109632,
"grad_norm": 1.3359375,
"learning_rate": 0.00014014247025294897,
"loss": 4.761,
"mean_token_accuracy": 0.22832667082548141,
"num_tokens": 16939405.0,
"step": 8230
},
{
"entropy": 5.515739059448242,
"epoch": 7.307146027518864,
"grad_norm": 1.3203125,
"learning_rate": 0.0001398668866504768,
"loss": 4.8566,
"mean_token_accuracy": 0.22204002141952514,
"num_tokens": 16950653.0,
"step": 8235
},
{
"entropy": 5.539560985565186,
"epoch": 7.311584553928096,
"grad_norm": 1.28125,
"learning_rate": 0.0001395916197907891,
"loss": 4.8745,
"mean_token_accuracy": 0.2229080006480217,
"num_tokens": 16961061.0,
"step": 8240
},
{
"entropy": 5.506972122192383,
"epoch": 7.316023080337328,
"grad_norm": 1.2578125,
"learning_rate": 0.00013931667031909283,
"loss": 4.8393,
"mean_token_accuracy": 0.22425775676965715,
"num_tokens": 16971005.0,
"step": 8245
},
{
"entropy": 5.5056829929351805,
"epoch": 7.32046160674656,
"grad_norm": 1.3046875,
"learning_rate": 0.00013904203887985035,
"loss": 4.7999,
"mean_token_accuracy": 0.23558456301689149,
"num_tokens": 16981818.0,
"step": 8250
},
{
"entropy": 5.5343590259552,
"epoch": 7.324900133155793,
"grad_norm": 1.4375,
"learning_rate": 0.0001387677261167793,
"loss": 4.8117,
"mean_token_accuracy": 0.2205576404929161,
"num_tokens": 16991476.0,
"step": 8255
},
{
"entropy": 5.526212167739868,
"epoch": 7.329338659565025,
"grad_norm": 1.359375,
"learning_rate": 0.00013849373267284997,
"loss": 4.7656,
"mean_token_accuracy": 0.23142243772745133,
"num_tokens": 17001590.0,
"step": 8260
},
{
"entropy": 5.568186807632446,
"epoch": 7.333777185974257,
"grad_norm": 1.3203125,
"learning_rate": 0.00013822005919028412,
"loss": 4.8976,
"mean_token_accuracy": 0.22561565041542053,
"num_tokens": 17010866.0,
"step": 8265
},
{
"entropy": 5.6258691310882565,
"epoch": 7.338215712383489,
"grad_norm": 1.34375,
"learning_rate": 0.00013794670631055395,
"loss": 4.8762,
"mean_token_accuracy": 0.21288719922304153,
"num_tokens": 17020594.0,
"step": 8270
},
{
"entropy": 5.5284508228302,
"epoch": 7.342654238792721,
"grad_norm": 1.15625,
"learning_rate": 0.00013767367467437986,
"loss": 4.8882,
"mean_token_accuracy": 0.21825562417507172,
"num_tokens": 17031553.0,
"step": 8275
},
{
"entropy": 5.521149492263794,
"epoch": 7.347092765201953,
"grad_norm": 1.296875,
"learning_rate": 0.00013740096492172917,
"loss": 4.8175,
"mean_token_accuracy": 0.21843705028295518,
"num_tokens": 17041926.0,
"step": 8280
},
{
"entropy": 5.628622388839721,
"epoch": 7.3515312916111855,
"grad_norm": 1.296875,
"learning_rate": 0.00013712857769181518,
"loss": 4.9479,
"mean_token_accuracy": 0.21376848667860032,
"num_tokens": 17053085.0,
"step": 8285
},
{
"entropy": 5.513779497146606,
"epoch": 7.355969818020418,
"grad_norm": 1.375,
"learning_rate": 0.0001368565136230947,
"loss": 4.8289,
"mean_token_accuracy": 0.22480135411024094,
"num_tokens": 17063045.0,
"step": 8290
},
{
"entropy": 5.518791627883911,
"epoch": 7.36040834442965,
"grad_norm": 1.40625,
"learning_rate": 0.0001365847733532675,
"loss": 4.7868,
"mean_token_accuracy": 0.22614157497882842,
"num_tokens": 17073923.0,
"step": 8295
},
{
"entropy": 5.526434278488159,
"epoch": 7.364846870838882,
"grad_norm": 1.859375,
"learning_rate": 0.0001363133575192741,
"loss": 4.8127,
"mean_token_accuracy": 0.22693072259426117,
"num_tokens": 17083659.0,
"step": 8300
},
{
"entropy": 5.511857891082764,
"epoch": 7.369285397248113,
"grad_norm": 1.2890625,
"learning_rate": 0.00013604226675729465,
"loss": 4.7973,
"mean_token_accuracy": 0.23052221089601516,
"num_tokens": 17094258.0,
"step": 8305
},
{
"entropy": 5.531572914123535,
"epoch": 7.373723923657346,
"grad_norm": 1.546875,
"learning_rate": 0.0001357715017027475,
"loss": 4.8425,
"mean_token_accuracy": 0.22183124274015426,
"num_tokens": 17102983.0,
"step": 8310
},
{
"entropy": 5.5259300708770756,
"epoch": 7.3781624500665774,
"grad_norm": 1.5859375,
"learning_rate": 0.00013550106299028733,
"loss": 4.8894,
"mean_token_accuracy": 0.22089309394359588,
"num_tokens": 17112940.0,
"step": 8315
},
{
"entropy": 5.527954483032227,
"epoch": 7.3826009764758105,
"grad_norm": 1.2421875,
"learning_rate": 0.00013523095125380396,
"loss": 4.8544,
"mean_token_accuracy": 0.224172443151474,
"num_tokens": 17123574.0,
"step": 8320
},
{
"entropy": 5.551538753509521,
"epoch": 7.387039502885042,
"grad_norm": 1.3125,
"learning_rate": 0.00013496116712642108,
"loss": 4.8772,
"mean_token_accuracy": 0.22175752520561218,
"num_tokens": 17134914.0,
"step": 8325
},
{
"entropy": 5.480142831802368,
"epoch": 7.391478029294274,
"grad_norm": 1.4375,
"learning_rate": 0.00013469171124049398,
"loss": 4.8045,
"mean_token_accuracy": 0.23609121292829513,
"num_tokens": 17144670.0,
"step": 8330
},
{
"entropy": 5.481876802444458,
"epoch": 7.395916555703506,
"grad_norm": 1.375,
"learning_rate": 0.000134422584227609,
"loss": 4.7476,
"mean_token_accuracy": 0.2342465564608574,
"num_tokens": 17154276.0,
"step": 8335
},
{
"entropy": 5.487003374099731,
"epoch": 7.400355082112738,
"grad_norm": 1.390625,
"learning_rate": 0.00013415378671858142,
"loss": 4.7674,
"mean_token_accuracy": 0.23292025923728943,
"num_tokens": 17165139.0,
"step": 8340
},
{
"entropy": 5.5097075462341305,
"epoch": 7.40479360852197,
"grad_norm": 1.3515625,
"learning_rate": 0.00013388531934345417,
"loss": 4.8342,
"mean_token_accuracy": 0.22711736261844634,
"num_tokens": 17175604.0,
"step": 8345
},
{
"entropy": 5.5641197681427,
"epoch": 7.4092321349312025,
"grad_norm": 1.3125,
"learning_rate": 0.0001336171827314966,
"loss": 4.8327,
"mean_token_accuracy": 0.22450610399246215,
"num_tokens": 17185976.0,
"step": 8350
},
{
"entropy": 5.50412769317627,
"epoch": 7.413670661340435,
"grad_norm": 1.2265625,
"learning_rate": 0.00013334937751120247,
"loss": 4.8453,
"mean_token_accuracy": 0.2299114391207695,
"num_tokens": 17196836.0,
"step": 8355
},
{
"entropy": 5.5768190860748295,
"epoch": 7.418109187749667,
"grad_norm": 1.6796875,
"learning_rate": 0.00013308190431028893,
"loss": 4.9488,
"mean_token_accuracy": 0.21491037160158158,
"num_tokens": 17207511.0,
"step": 8360
},
{
"entropy": 5.553695201873779,
"epoch": 7.422547714158899,
"grad_norm": 1.5234375,
"learning_rate": 0.00013281476375569503,
"loss": 4.7938,
"mean_token_accuracy": 0.2326598882675171,
"num_tokens": 17217611.0,
"step": 8365
},
{
"entropy": 5.528583288192749,
"epoch": 7.426986240568131,
"grad_norm": 1.3984375,
"learning_rate": 0.00013254795647357976,
"loss": 4.8362,
"mean_token_accuracy": 0.22520908415317537,
"num_tokens": 17227721.0,
"step": 8370
},
{
"entropy": 5.476093578338623,
"epoch": 7.431424766977363,
"grad_norm": 1.2734375,
"learning_rate": 0.0001322814830893213,
"loss": 4.7469,
"mean_token_accuracy": 0.23049061745405197,
"num_tokens": 17237611.0,
"step": 8375
},
{
"entropy": 5.523039531707764,
"epoch": 7.435863293386595,
"grad_norm": 1.609375,
"learning_rate": 0.00013201534422751504,
"loss": 4.8555,
"mean_token_accuracy": 0.2302015706896782,
"num_tokens": 17249165.0,
"step": 8380
},
{
"entropy": 5.51413049697876,
"epoch": 7.4403018197958275,
"grad_norm": 1.234375,
"learning_rate": 0.0001317495405119722,
"loss": 4.8349,
"mean_token_accuracy": 0.230510413646698,
"num_tokens": 17259970.0,
"step": 8385
},
{
"entropy": 5.528391933441162,
"epoch": 7.44474034620506,
"grad_norm": 1.4609375,
"learning_rate": 0.00013148407256571864,
"loss": 4.8569,
"mean_token_accuracy": 0.2208354115486145,
"num_tokens": 17270583.0,
"step": 8390
},
{
"entropy": 5.4800660610198975,
"epoch": 7.449178872614292,
"grad_norm": 1.125,
"learning_rate": 0.0001312189410109931,
"loss": 4.7726,
"mean_token_accuracy": 0.23840725123882295,
"num_tokens": 17280523.0,
"step": 8395
},
{
"entropy": 5.52663025856018,
"epoch": 7.453617399023524,
"grad_norm": 1.2265625,
"learning_rate": 0.00013095414646924563,
"loss": 4.8237,
"mean_token_accuracy": 0.22444128692150117,
"num_tokens": 17290334.0,
"step": 8400
},
{
"entropy": 5.537862110137939,
"epoch": 7.458055925432756,
"grad_norm": 1.3671875,
"learning_rate": 0.00013068968956113686,
"loss": 4.825,
"mean_token_accuracy": 0.22732312083244324,
"num_tokens": 17300573.0,
"step": 8405
},
{
"entropy": 5.494001770019532,
"epoch": 7.462494451841988,
"grad_norm": 1.3671875,
"learning_rate": 0.00013042557090653538,
"loss": 4.7484,
"mean_token_accuracy": 0.23765261173248292,
"num_tokens": 17310081.0,
"step": 8410
},
{
"entropy": 5.491052436828613,
"epoch": 7.46693297825122,
"grad_norm": 1.359375,
"learning_rate": 0.00013016179112451754,
"loss": 4.7297,
"mean_token_accuracy": 0.2428295537829399,
"num_tokens": 17320941.0,
"step": 8415
},
{
"entropy": 5.518697881698609,
"epoch": 7.4713715046604525,
"grad_norm": 1.3515625,
"learning_rate": 0.000129898350833365,
"loss": 4.8659,
"mean_token_accuracy": 0.22780809849500655,
"num_tokens": 17332574.0,
"step": 8420
},
{
"entropy": 5.417581176757812,
"epoch": 7.475810031069685,
"grad_norm": 1.3046875,
"learning_rate": 0.0001296352506505637,
"loss": 4.6881,
"mean_token_accuracy": 0.24527059644460678,
"num_tokens": 17342567.0,
"step": 8425
},
{
"entropy": 5.505463790893555,
"epoch": 7.480248557478917,
"grad_norm": 1.2890625,
"learning_rate": 0.00012937249119280276,
"loss": 4.8062,
"mean_token_accuracy": 0.22198499292135238,
"num_tokens": 17352599.0,
"step": 8430
},
{
"entropy": 5.50503830909729,
"epoch": 7.484687083888149,
"grad_norm": 1.3125,
"learning_rate": 0.00012911007307597216,
"loss": 4.826,
"mean_token_accuracy": 0.2316443592309952,
"num_tokens": 17362457.0,
"step": 8435
},
{
"entropy": 5.558705615997314,
"epoch": 7.489125610297381,
"grad_norm": 1.484375,
"learning_rate": 0.00012884799691516207,
"loss": 4.866,
"mean_token_accuracy": 0.2235052093863487,
"num_tokens": 17371939.0,
"step": 8440
},
{
"entropy": 5.576251029968262,
"epoch": 7.493564136706613,
"grad_norm": 1.3359375,
"learning_rate": 0.00012858626332466134,
"loss": 4.874,
"mean_token_accuracy": 0.22011675238609313,
"num_tokens": 17381727.0,
"step": 8445
},
{
"entropy": 5.487157583236694,
"epoch": 7.498002663115845,
"grad_norm": 1.40625,
"learning_rate": 0.00012832487291795529,
"loss": 4.7783,
"mean_token_accuracy": 0.23089126646518707,
"num_tokens": 17392035.0,
"step": 8450
},
{
"entropy": 5.507126045227051,
"epoch": 7.5024411895250775,
"grad_norm": 1.390625,
"learning_rate": 0.00012806382630772538,
"loss": 4.7595,
"mean_token_accuracy": 0.2336970940232277,
"num_tokens": 17402021.0,
"step": 8455
},
{
"entropy": 5.542128849029541,
"epoch": 7.50687971593431,
"grad_norm": 1.328125,
"learning_rate": 0.00012780312410584695,
"loss": 4.8438,
"mean_token_accuracy": 0.22735902518033982,
"num_tokens": 17412091.0,
"step": 8460
},
{
"entropy": 5.5118200302124025,
"epoch": 7.511318242343542,
"grad_norm": 1.28125,
"learning_rate": 0.00012754276692338807,
"loss": 4.8416,
"mean_token_accuracy": 0.22556969821453093,
"num_tokens": 17422486.0,
"step": 8465
},
{
"entropy": 5.515256452560425,
"epoch": 7.515756768752774,
"grad_norm": 1.21875,
"learning_rate": 0.0001272827553706084,
"loss": 4.8273,
"mean_token_accuracy": 0.22171308547258378,
"num_tokens": 17432853.0,
"step": 8470
},
{
"entropy": 5.541082525253296,
"epoch": 7.520195295162006,
"grad_norm": 1.453125,
"learning_rate": 0.00012702309005695715,
"loss": 4.8205,
"mean_token_accuracy": 0.23031286746263505,
"num_tokens": 17442921.0,
"step": 8475
},
{
"entropy": 5.472198009490967,
"epoch": 7.524633821571238,
"grad_norm": 1.234375,
"learning_rate": 0.00012676377159107194,
"loss": 4.7382,
"mean_token_accuracy": 0.23142171204090117,
"num_tokens": 17453728.0,
"step": 8480
},
{
"entropy": 5.553830671310425,
"epoch": 7.52907234798047,
"grad_norm": 1.328125,
"learning_rate": 0.00012650480058077785,
"loss": 4.8315,
"mean_token_accuracy": 0.2260192424058914,
"num_tokens": 17464263.0,
"step": 8485
},
{
"entropy": 5.491733026504517,
"epoch": 7.533510874389703,
"grad_norm": 1.25,
"learning_rate": 0.00012624617763308486,
"loss": 4.7833,
"mean_token_accuracy": 0.2294919490814209,
"num_tokens": 17474529.0,
"step": 8490
},
{
"entropy": 5.554998779296875,
"epoch": 7.537949400798935,
"grad_norm": 1.21875,
"learning_rate": 0.00012598790335418774,
"loss": 4.8687,
"mean_token_accuracy": 0.2203487917780876,
"num_tokens": 17484955.0,
"step": 8495
},
{
"entropy": 5.521708965301514,
"epoch": 7.542387927208167,
"grad_norm": 1.359375,
"learning_rate": 0.00012572997834946371,
"loss": 4.7601,
"mean_token_accuracy": 0.23390865623950957,
"num_tokens": 17494511.0,
"step": 8500
},
{
"epoch": 7.542387927208167,
"eval_entropy": 5.417753244522348,
"eval_loss": 5.858129978179932,
"eval_mean_token_accuracy": 0.1735702339657129,
"eval_num_tokens": 17494511.0,
"eval_runtime": 2.6847,
"eval_samples_per_second": 1254.157,
"eval_steps_per_second": 156.816,
"step": 8500
},
{
"entropy": 5.5250678062438965,
"epoch": 7.546826453617399,
"grad_norm": 1.375,
"learning_rate": 0.00012547240322347122,
"loss": 4.7879,
"mean_token_accuracy": 0.2308879241347313,
"num_tokens": 17503873.0,
"step": 8505
},
{
"entropy": 5.5558990955352785,
"epoch": 7.551264980026631,
"grad_norm": 1.3359375,
"learning_rate": 0.00012521517857994895,
"loss": 4.8245,
"mean_token_accuracy": 0.22850705236196517,
"num_tokens": 17515681.0,
"step": 8510
},
{
"entropy": 5.499555873870849,
"epoch": 7.555703506435863,
"grad_norm": 1.4453125,
"learning_rate": 0.00012495830502181387,
"loss": 4.7977,
"mean_token_accuracy": 0.2280339777469635,
"num_tokens": 17525300.0,
"step": 8515
},
{
"entropy": 5.521435499191284,
"epoch": 7.5601420328450954,
"grad_norm": 1.4140625,
"learning_rate": 0.00012470178315115987,
"loss": 4.9059,
"mean_token_accuracy": 0.2221609577536583,
"num_tokens": 17536049.0,
"step": 8520
},
{
"entropy": 5.556616735458374,
"epoch": 7.564580559254328,
"grad_norm": 1.3203125,
"learning_rate": 0.00012444561356925697,
"loss": 4.8785,
"mean_token_accuracy": 0.2231447160243988,
"num_tokens": 17546294.0,
"step": 8525
},
{
"entropy": 5.526573038101196,
"epoch": 7.56901908566356,
"grad_norm": 1.3828125,
"learning_rate": 0.00012418979687654888,
"loss": 4.8849,
"mean_token_accuracy": 0.22129187732934952,
"num_tokens": 17557202.0,
"step": 8530
},
{
"entropy": 5.397485160827637,
"epoch": 7.573457612072792,
"grad_norm": 1.2890625,
"learning_rate": 0.0001239343336726526,
"loss": 4.7635,
"mean_token_accuracy": 0.24531075209379197,
"num_tokens": 17567982.0,
"step": 8535
},
{
"entropy": 5.574466753005981,
"epoch": 7.577896138482024,
"grad_norm": 1.234375,
"learning_rate": 0.00012367922455635644,
"loss": 4.8606,
"mean_token_accuracy": 0.22121091634035112,
"num_tokens": 17577911.0,
"step": 8540
},
{
"entropy": 5.516995859146118,
"epoch": 7.582334664891256,
"grad_norm": 1.4453125,
"learning_rate": 0.00012342447012561863,
"loss": 4.8121,
"mean_token_accuracy": 0.2234480172395706,
"num_tokens": 17587867.0,
"step": 8545
},
{
"entropy": 5.499090909957886,
"epoch": 7.586773191300488,
"grad_norm": 1.484375,
"learning_rate": 0.00012317007097756627,
"loss": 4.8215,
"mean_token_accuracy": 0.22983253747224808,
"num_tokens": 17597665.0,
"step": 8550
},
{
"entropy": 5.423785448074341,
"epoch": 7.5912117177097205,
"grad_norm": 1.453125,
"learning_rate": 0.00012291602770849353,
"loss": 4.7192,
"mean_token_accuracy": 0.24927148073911667,
"num_tokens": 17608081.0,
"step": 8555
},
{
"entropy": 5.571401596069336,
"epoch": 7.595650244118953,
"grad_norm": 1.2890625,
"learning_rate": 0.0001226623409138604,
"loss": 4.8507,
"mean_token_accuracy": 0.2312807634472847,
"num_tokens": 17620146.0,
"step": 8560
},
{
"entropy": 5.6068775177001955,
"epoch": 7.600088770528185,
"grad_norm": 1.40625,
"learning_rate": 0.0001224090111882916,
"loss": 4.8674,
"mean_token_accuracy": 0.22157650142908097,
"num_tokens": 17630535.0,
"step": 8565
},
{
"entropy": 5.593964052200318,
"epoch": 7.604527296937417,
"grad_norm": 1.359375,
"learning_rate": 0.00012215603912557447,
"loss": 4.9289,
"mean_token_accuracy": 0.2195365846157074,
"num_tokens": 17641278.0,
"step": 8570
},
{
"entropy": 5.480939292907715,
"epoch": 7.608965823346649,
"grad_norm": 1.2421875,
"learning_rate": 0.00012190342531865837,
"loss": 4.7968,
"mean_token_accuracy": 0.22860725224018097,
"num_tokens": 17652730.0,
"step": 8575
},
{
"entropy": 5.52091498374939,
"epoch": 7.613404349755881,
"grad_norm": 1.328125,
"learning_rate": 0.0001216511703596528,
"loss": 4.7502,
"mean_token_accuracy": 0.23379470109939576,
"num_tokens": 17661978.0,
"step": 8580
},
{
"entropy": 5.529548311233521,
"epoch": 7.617842876165113,
"grad_norm": 1.3984375,
"learning_rate": 0.00012139927483982601,
"loss": 4.8188,
"mean_token_accuracy": 0.22166130244731902,
"num_tokens": 17672394.0,
"step": 8585
},
{
"entropy": 5.4765965938568115,
"epoch": 7.6222814025743455,
"grad_norm": 1.3125,
"learning_rate": 0.00012114773934960408,
"loss": 4.8486,
"mean_token_accuracy": 0.22920041382312775,
"num_tokens": 17682828.0,
"step": 8590
},
{
"entropy": 5.516771125793457,
"epoch": 7.626719928983578,
"grad_norm": 1.375,
"learning_rate": 0.00012089656447856892,
"loss": 4.8548,
"mean_token_accuracy": 0.22131503969430924,
"num_tokens": 17692547.0,
"step": 8595
},
{
"entropy": 5.559178876876831,
"epoch": 7.63115845539281,
"grad_norm": 1.4609375,
"learning_rate": 0.0001206457508154572,
"loss": 4.8654,
"mean_token_accuracy": 0.21908055394887924,
"num_tokens": 17702179.0,
"step": 8600
},
{
"entropy": 5.521388721466065,
"epoch": 7.635596981802042,
"grad_norm": 1.3515625,
"learning_rate": 0.00012039529894815924,
"loss": 4.8163,
"mean_token_accuracy": 0.2325139284133911,
"num_tokens": 17711674.0,
"step": 8605
},
{
"entropy": 5.52794189453125,
"epoch": 7.640035508211274,
"grad_norm": 1.1953125,
"learning_rate": 0.00012014520946371675,
"loss": 4.7865,
"mean_token_accuracy": 0.23072536289691925,
"num_tokens": 17721954.0,
"step": 8610
},
{
"entropy": 5.57104344367981,
"epoch": 7.644474034620506,
"grad_norm": 1.4375,
"learning_rate": 0.0001198954829483227,
"loss": 4.917,
"mean_token_accuracy": 0.2173857718706131,
"num_tokens": 17733187.0,
"step": 8615
},
{
"entropy": 5.538820886611939,
"epoch": 7.648912561029738,
"grad_norm": 1.3828125,
"learning_rate": 0.0001196461199873189,
"loss": 4.8293,
"mean_token_accuracy": 0.2199716806411743,
"num_tokens": 17743167.0,
"step": 8620
},
{
"entropy": 5.543489694595337,
"epoch": 7.6533510874389705,
"grad_norm": 1.1328125,
"learning_rate": 0.00011939712116519494,
"loss": 4.7988,
"mean_token_accuracy": 0.22360094785690307,
"num_tokens": 17754232.0,
"step": 8625
},
{
"entropy": 5.5572075843811035,
"epoch": 7.657789613848203,
"grad_norm": 1.40625,
"learning_rate": 0.00011914848706558726,
"loss": 4.9074,
"mean_token_accuracy": 0.21729654520750047,
"num_tokens": 17764223.0,
"step": 8630
},
{
"entropy": 5.486240816116333,
"epoch": 7.662228140257435,
"grad_norm": 1.265625,
"learning_rate": 0.0001189002182712771,
"loss": 4.7927,
"mean_token_accuracy": 0.23020248115062714,
"num_tokens": 17773957.0,
"step": 8635
},
{
"entropy": 5.541817760467529,
"epoch": 7.666666666666667,
"grad_norm": 1.421875,
"learning_rate": 0.00011865231536418948,
"loss": 4.8065,
"mean_token_accuracy": 0.2260996639728546,
"num_tokens": 17783016.0,
"step": 8640
},
{
"entropy": 5.51589412689209,
"epoch": 7.671105193075899,
"grad_norm": 1.171875,
"learning_rate": 0.0001184047789253921,
"loss": 4.8263,
"mean_token_accuracy": 0.23161399960517884,
"num_tokens": 17794189.0,
"step": 8645
},
{
"entropy": 5.577518892288208,
"epoch": 7.675543719485131,
"grad_norm": 1.28125,
"learning_rate": 0.0001181576095350932,
"loss": 4.9603,
"mean_token_accuracy": 0.21940330564975738,
"num_tokens": 17804915.0,
"step": 8650
},
{
"entropy": 5.523958826065064,
"epoch": 7.679982245894363,
"grad_norm": 1.1953125,
"learning_rate": 0.00011791080777264111,
"loss": 4.885,
"mean_token_accuracy": 0.22324447333812714,
"num_tokens": 17815324.0,
"step": 8655
},
{
"entropy": 5.4906425952911375,
"epoch": 7.6844207723035955,
"grad_norm": 1.1640625,
"learning_rate": 0.00011766437421652223,
"loss": 4.8136,
"mean_token_accuracy": 0.22610076516866684,
"num_tokens": 17826276.0,
"step": 8660
},
{
"entropy": 5.53193850517273,
"epoch": 7.688859298712828,
"grad_norm": 1.3828125,
"learning_rate": 0.00011741830944435994,
"loss": 4.8479,
"mean_token_accuracy": 0.22147312611341477,
"num_tokens": 17836162.0,
"step": 8665
},
{
"entropy": 5.574075746536255,
"epoch": 7.69329782512206,
"grad_norm": 1.34375,
"learning_rate": 0.00011717261403291336,
"loss": 4.8155,
"mean_token_accuracy": 0.2189062386751175,
"num_tokens": 17846380.0,
"step": 8670
},
{
"entropy": 5.546022748947143,
"epoch": 7.697736351531292,
"grad_norm": 1.2734375,
"learning_rate": 0.0001169272885580757,
"loss": 4.8734,
"mean_token_accuracy": 0.219287970662117,
"num_tokens": 17857073.0,
"step": 8675
},
{
"entropy": 5.472138261795044,
"epoch": 7.702174877940524,
"grad_norm": 1.4296875,
"learning_rate": 0.00011668233359487303,
"loss": 4.7321,
"mean_token_accuracy": 0.23839522898197174,
"num_tokens": 17867576.0,
"step": 8680
},
{
"entropy": 5.519084024429321,
"epoch": 7.706613404349756,
"grad_norm": 1.4296875,
"learning_rate": 0.00011643774971746326,
"loss": 4.8842,
"mean_token_accuracy": 0.22231787592172622,
"num_tokens": 17878319.0,
"step": 8685
},
{
"entropy": 5.493455314636231,
"epoch": 7.7110519307589875,
"grad_norm": 1.234375,
"learning_rate": 0.00011619353749913403,
"loss": 4.8044,
"mean_token_accuracy": 0.23032058477401735,
"num_tokens": 17889786.0,
"step": 8690
},
{
"entropy": 5.509057235717774,
"epoch": 7.715490457168221,
"grad_norm": 1.390625,
"learning_rate": 0.00011594969751230224,
"loss": 4.7935,
"mean_token_accuracy": 0.22978353202342988,
"num_tokens": 17900932.0,
"step": 8695
},
{
"entropy": 5.508798217773437,
"epoch": 7.719928983577452,
"grad_norm": 1.3828125,
"learning_rate": 0.00011570623032851214,
"loss": 4.823,
"mean_token_accuracy": 0.2255034938454628,
"num_tokens": 17910985.0,
"step": 8700
},
{
"entropy": 5.569445276260376,
"epoch": 7.724367509986685,
"grad_norm": 1.1796875,
"learning_rate": 0.00011546313651843412,
"loss": 4.9551,
"mean_token_accuracy": 0.210782253742218,
"num_tokens": 17922923.0,
"step": 8705
},
{
"entropy": 5.508803415298462,
"epoch": 7.728806036395916,
"grad_norm": 1.2109375,
"learning_rate": 0.00011522041665186356,
"loss": 4.8163,
"mean_token_accuracy": 0.22762422859668732,
"num_tokens": 17933619.0,
"step": 8710
},
{
"entropy": 5.536534404754638,
"epoch": 7.733244562805149,
"grad_norm": 1.171875,
"learning_rate": 0.00011497807129771916,
"loss": 4.8449,
"mean_token_accuracy": 0.23125416934490203,
"num_tokens": 17944584.0,
"step": 8715
},
{
"entropy": 5.4448188781738285,
"epoch": 7.73768308921438,
"grad_norm": 1.359375,
"learning_rate": 0.00011473610102404184,
"loss": 4.7655,
"mean_token_accuracy": 0.23355314880609512,
"num_tokens": 17955076.0,
"step": 8720
},
{
"entropy": 5.4814516544342045,
"epoch": 7.7421216156236135,
"grad_norm": 1.296875,
"learning_rate": 0.0001144945063979936,
"loss": 4.8358,
"mean_token_accuracy": 0.22968773245811464,
"num_tokens": 17964527.0,
"step": 8725
},
{
"entropy": 5.515767621994018,
"epoch": 7.746560142032845,
"grad_norm": 1.5,
"learning_rate": 0.00011425328798585544,
"loss": 4.861,
"mean_token_accuracy": 0.2284746989607811,
"num_tokens": 17974279.0,
"step": 8730
},
{
"entropy": 5.566736650466919,
"epoch": 7.750998668442077,
"grad_norm": 1.2734375,
"learning_rate": 0.00011401244635302704,
"loss": 4.7477,
"mean_token_accuracy": 0.22742162942886351,
"num_tokens": 17985039.0,
"step": 8735
},
{
"entropy": 5.478198289871216,
"epoch": 7.755437194851309,
"grad_norm": 1.328125,
"learning_rate": 0.0001137719820640247,
"loss": 4.8392,
"mean_token_accuracy": 0.22531141787767411,
"num_tokens": 17995554.0,
"step": 8740
},
{
"entropy": 5.438498878479004,
"epoch": 7.759875721260541,
"grad_norm": 1.3125,
"learning_rate": 0.00011353189568248015,
"loss": 4.7265,
"mean_token_accuracy": 0.2402109295129776,
"num_tokens": 18005321.0,
"step": 8745
},
{
"entropy": 5.51060266494751,
"epoch": 7.764314247669773,
"grad_norm": 1.421875,
"learning_rate": 0.00011329218777113965,
"loss": 4.7904,
"mean_token_accuracy": 0.2305187091231346,
"num_tokens": 18016008.0,
"step": 8750
},
{
"entropy": 5.573731374740601,
"epoch": 7.768752774079005,
"grad_norm": 1.328125,
"learning_rate": 0.00011305285889186207,
"loss": 4.8491,
"mean_token_accuracy": 0.23133554607629775,
"num_tokens": 18026433.0,
"step": 8755
},
{
"entropy": 5.557860231399536,
"epoch": 7.773191300488238,
"grad_norm": 1.3203125,
"learning_rate": 0.00011281390960561791,
"loss": 4.8496,
"mean_token_accuracy": 0.21802178770303726,
"num_tokens": 18037533.0,
"step": 8760
},
{
"entropy": 5.518392133712768,
"epoch": 7.77762982689747,
"grad_norm": 1.3515625,
"learning_rate": 0.00011257534047248816,
"loss": 4.7693,
"mean_token_accuracy": 0.23333774507045746,
"num_tokens": 18046564.0,
"step": 8765
},
{
"entropy": 5.5076854705810545,
"epoch": 7.782068353306702,
"grad_norm": 1.296875,
"learning_rate": 0.00011233715205166231,
"loss": 4.8813,
"mean_token_accuracy": 0.2230132520198822,
"num_tokens": 18057515.0,
"step": 8770
},
{
"entropy": 5.508595275878906,
"epoch": 7.786506879715934,
"grad_norm": 1.4375,
"learning_rate": 0.0001120993449014379,
"loss": 4.7852,
"mean_token_accuracy": 0.23008816242218016,
"num_tokens": 18065990.0,
"step": 8775
},
{
"entropy": 5.53666615486145,
"epoch": 7.790945406125166,
"grad_norm": 1.3359375,
"learning_rate": 0.00011186191957921862,
"loss": 4.8407,
"mean_token_accuracy": 0.22502628117799758,
"num_tokens": 18076594.0,
"step": 8780
},
{
"entropy": 5.4848020553588865,
"epoch": 7.795383932534398,
"grad_norm": 1.3359375,
"learning_rate": 0.00011162487664151313,
"loss": 4.7834,
"mean_token_accuracy": 0.23348850309848784,
"num_tokens": 18086456.0,
"step": 8785
},
{
"entropy": 5.550656795501709,
"epoch": 7.7998224589436305,
"grad_norm": 1.3515625,
"learning_rate": 0.000111388216643934,
"loss": 4.8798,
"mean_token_accuracy": 0.21799631267786027,
"num_tokens": 18096189.0,
"step": 8790
},
{
"entropy": 5.548898601531983,
"epoch": 7.804260985352863,
"grad_norm": 1.3359375,
"learning_rate": 0.00011115194014119606,
"loss": 4.8994,
"mean_token_accuracy": 0.22215149700641632,
"num_tokens": 18107146.0,
"step": 8795
},
{
"entropy": 5.539883613586426,
"epoch": 7.808699511762095,
"grad_norm": 1.453125,
"learning_rate": 0.00011091604768711517,
"loss": 4.7639,
"mean_token_accuracy": 0.2320783630013466,
"num_tokens": 18116380.0,
"step": 8800
},
{
"entropy": 5.547922658920288,
"epoch": 7.813138038171327,
"grad_norm": 1.4296875,
"learning_rate": 0.00011068053983460736,
"loss": 4.8312,
"mean_token_accuracy": 0.22256851494312285,
"num_tokens": 18126218.0,
"step": 8805
},
{
"entropy": 5.560447788238525,
"epoch": 7.817576564580559,
"grad_norm": 1.5078125,
"learning_rate": 0.00011044541713568665,
"loss": 4.853,
"mean_token_accuracy": 0.22795532047748565,
"num_tokens": 18136315.0,
"step": 8810
},
{
"entropy": 5.522366237640381,
"epoch": 7.822015090989791,
"grad_norm": 1.375,
"learning_rate": 0.00011021068014146483,
"loss": 4.8595,
"mean_token_accuracy": 0.22368412613868713,
"num_tokens": 18145921.0,
"step": 8815
},
{
"entropy": 5.51537561416626,
"epoch": 7.826453617399023,
"grad_norm": 1.3828125,
"learning_rate": 0.00010997632940214924,
"loss": 4.8527,
"mean_token_accuracy": 0.22324531078338622,
"num_tokens": 18156781.0,
"step": 8820
},
{
"entropy": 5.508488368988037,
"epoch": 7.8308921438082555,
"grad_norm": 1.4453125,
"learning_rate": 0.000109742365467042,
"loss": 4.8381,
"mean_token_accuracy": 0.2276904597878456,
"num_tokens": 18167053.0,
"step": 8825
},
{
"entropy": 5.529995727539062,
"epoch": 7.835330670217488,
"grad_norm": 1.328125,
"learning_rate": 0.00010950878888453872,
"loss": 4.8813,
"mean_token_accuracy": 0.2198058247566223,
"num_tokens": 18177289.0,
"step": 8830
},
{
"entropy": 5.535861492156982,
"epoch": 7.83976919662672,
"grad_norm": 1.4609375,
"learning_rate": 0.00010927560020212682,
"loss": 4.7965,
"mean_token_accuracy": 0.2283168613910675,
"num_tokens": 18186698.0,
"step": 8835
},
{
"entropy": 5.514022874832153,
"epoch": 7.844207723035952,
"grad_norm": 1.375,
"learning_rate": 0.0001090427999663846,
"loss": 4.8243,
"mean_token_accuracy": 0.22577032595872878,
"num_tokens": 18197158.0,
"step": 8840
},
{
"entropy": 5.557280969619751,
"epoch": 7.848646249445184,
"grad_norm": 1.4140625,
"learning_rate": 0.00010881038872298014,
"loss": 4.8997,
"mean_token_accuracy": 0.21947368532419204,
"num_tokens": 18206429.0,
"step": 8845
},
{
"entropy": 5.518510532379151,
"epoch": 7.853084775854416,
"grad_norm": 1.40625,
"learning_rate": 0.00010857836701666923,
"loss": 4.818,
"mean_token_accuracy": 0.22450481504201888,
"num_tokens": 18216526.0,
"step": 8850
},
{
"entropy": 5.541376113891602,
"epoch": 7.857523302263648,
"grad_norm": 1.265625,
"learning_rate": 0.00010834673539129506,
"loss": 4.873,
"mean_token_accuracy": 0.22380498498678209,
"num_tokens": 18227340.0,
"step": 8855
},
{
"entropy": 5.477765798568726,
"epoch": 7.8619618286728805,
"grad_norm": 1.359375,
"learning_rate": 0.00010811549438978633,
"loss": 4.7912,
"mean_token_accuracy": 0.22984451651573182,
"num_tokens": 18238425.0,
"step": 8860
},
{
"entropy": 5.534372854232788,
"epoch": 7.866400355082113,
"grad_norm": 1.3359375,
"learning_rate": 0.00010788464455415602,
"loss": 4.7665,
"mean_token_accuracy": 0.2335157424211502,
"num_tokens": 18249050.0,
"step": 8865
},
{
"entropy": 5.523896837234497,
"epoch": 7.870838881491345,
"grad_norm": 1.3203125,
"learning_rate": 0.00010765418642550053,
"loss": 4.8546,
"mean_token_accuracy": 0.22614182233810426,
"num_tokens": 18259952.0,
"step": 8870
},
{
"entropy": 5.529813385009765,
"epoch": 7.875277407900577,
"grad_norm": 1.28125,
"learning_rate": 0.00010742412054399791,
"loss": 4.8082,
"mean_token_accuracy": 0.22530926913022994,
"num_tokens": 18270256.0,
"step": 8875
},
{
"entropy": 5.476798486709595,
"epoch": 7.879715934309809,
"grad_norm": 1.328125,
"learning_rate": 0.00010719444744890683,
"loss": 4.7686,
"mean_token_accuracy": 0.2383452147245407,
"num_tokens": 18280755.0,
"step": 8880
},
{
"entropy": 5.552324438095093,
"epoch": 7.884154460719041,
"grad_norm": 1.34375,
"learning_rate": 0.00010696516767856545,
"loss": 4.8974,
"mean_token_accuracy": 0.22011606991291047,
"num_tokens": 18292206.0,
"step": 8885
},
{
"entropy": 5.551198244094849,
"epoch": 7.888592987128273,
"grad_norm": 1.3671875,
"learning_rate": 0.00010673628177038966,
"loss": 4.9158,
"mean_token_accuracy": 0.2141529440879822,
"num_tokens": 18302808.0,
"step": 8890
},
{
"entropy": 5.518300342559814,
"epoch": 7.8930315135375055,
"grad_norm": 1.3515625,
"learning_rate": 0.00010650779026087263,
"loss": 4.8937,
"mean_token_accuracy": 0.2223954975605011,
"num_tokens": 18313469.0,
"step": 8895
},
{
"entropy": 5.60967698097229,
"epoch": 7.897470039946738,
"grad_norm": 1.28125,
"learning_rate": 0.0001062796936855827,
"loss": 4.8828,
"mean_token_accuracy": 0.22586873024702073,
"num_tokens": 18324204.0,
"step": 8900
},
{
"entropy": 5.561729812622071,
"epoch": 7.90190856635597,
"grad_norm": 1.2421875,
"learning_rate": 0.00010605199257916269,
"loss": 4.9032,
"mean_token_accuracy": 0.21938958913087844,
"num_tokens": 18334968.0,
"step": 8905
},
{
"entropy": 5.5323351383209225,
"epoch": 7.906347092765202,
"grad_norm": 1.3046875,
"learning_rate": 0.00010582468747532848,
"loss": 4.8645,
"mean_token_accuracy": 0.22808050960302353,
"num_tokens": 18345983.0,
"step": 8910
},
{
"entropy": 5.492877388000489,
"epoch": 7.910785619174434,
"grad_norm": 1.1640625,
"learning_rate": 0.00010559777890686766,
"loss": 4.8252,
"mean_token_accuracy": 0.23101968914270402,
"num_tokens": 18357001.0,
"step": 8915
},
{
"entropy": 5.565626430511474,
"epoch": 7.915224145583666,
"grad_norm": 1.3046875,
"learning_rate": 0.00010537126740563838,
"loss": 4.8906,
"mean_token_accuracy": 0.21490684449672698,
"num_tokens": 18367033.0,
"step": 8920
},
{
"entropy": 5.526720380783081,
"epoch": 7.919662671992898,
"grad_norm": 1.3125,
"learning_rate": 0.00010514515350256825,
"loss": 4.8748,
"mean_token_accuracy": 0.22452143728733062,
"num_tokens": 18376060.0,
"step": 8925
},
{
"entropy": 5.5491547107696535,
"epoch": 7.924101198402131,
"grad_norm": 1.390625,
"learning_rate": 0.00010491943772765264,
"loss": 4.905,
"mean_token_accuracy": 0.21478988975286484,
"num_tokens": 18385937.0,
"step": 8930
},
{
"entropy": 5.57955412864685,
"epoch": 7.928539724811363,
"grad_norm": 1.328125,
"learning_rate": 0.00010469412060995404,
"loss": 4.8638,
"mean_token_accuracy": 0.22902661859989165,
"num_tokens": 18396180.0,
"step": 8935
},
{
"entropy": 5.606887865066528,
"epoch": 7.932978251220595,
"grad_norm": 1.3359375,
"learning_rate": 0.00010446920267760028,
"loss": 4.8425,
"mean_token_accuracy": 0.22685208171606064,
"num_tokens": 18405430.0,
"step": 8940
},
{
"entropy": 5.463298749923706,
"epoch": 7.937416777629827,
"grad_norm": 1.3515625,
"learning_rate": 0.00010424468445778365,
"loss": 4.7842,
"mean_token_accuracy": 0.22720548659563064,
"num_tokens": 18415755.0,
"step": 8945
},
{
"entropy": 5.5281373977661135,
"epoch": 7.941855304039059,
"grad_norm": 1.328125,
"learning_rate": 0.00010402056647675958,
"loss": 4.8737,
"mean_token_accuracy": 0.21984899044036865,
"num_tokens": 18426825.0,
"step": 8950
},
{
"entropy": 5.554888391494751,
"epoch": 7.946293830448291,
"grad_norm": 1.375,
"learning_rate": 0.00010379684925984525,
"loss": 4.8583,
"mean_token_accuracy": 0.21590252667665483,
"num_tokens": 18436772.0,
"step": 8955
},
{
"entropy": 5.5233241558074955,
"epoch": 7.950732356857523,
"grad_norm": 1.4453125,
"learning_rate": 0.0001035735333314185,
"loss": 4.7888,
"mean_token_accuracy": 0.22861692309379578,
"num_tokens": 18446777.0,
"step": 8960
},
{
"entropy": 5.577347278594971,
"epoch": 7.955170883266756,
"grad_norm": 1.34375,
"learning_rate": 0.00010335061921491679,
"loss": 4.8494,
"mean_token_accuracy": 0.2308831110596657,
"num_tokens": 18457054.0,
"step": 8965
},
{
"entropy": 5.606191968917846,
"epoch": 7.959609409675988,
"grad_norm": 1.546875,
"learning_rate": 0.0001031281074328353,
"loss": 4.9527,
"mean_token_accuracy": 0.20974261313676834,
"num_tokens": 18467639.0,
"step": 8970
},
{
"entropy": 5.545734691619873,
"epoch": 7.96404793608522,
"grad_norm": 1.6171875,
"learning_rate": 0.0001029059985067266,
"loss": 4.8322,
"mean_token_accuracy": 0.22921389043331147,
"num_tokens": 18477395.0,
"step": 8975
},
{
"entropy": 5.516326284408569,
"epoch": 7.968486462494452,
"grad_norm": 1.4375,
"learning_rate": 0.00010268429295719886,
"loss": 4.7758,
"mean_token_accuracy": 0.22973539680242538,
"num_tokens": 18487533.0,
"step": 8980
},
{
"entropy": 5.535935544967652,
"epoch": 7.972924988903684,
"grad_norm": 1.3203125,
"learning_rate": 0.00010246299130391462,
"loss": 4.8485,
"mean_token_accuracy": 0.22032086104154586,
"num_tokens": 18498167.0,
"step": 8985
},
{
"entropy": 5.557373666763306,
"epoch": 7.977363515312916,
"grad_norm": 1.328125,
"learning_rate": 0.00010224209406558997,
"loss": 4.8657,
"mean_token_accuracy": 0.22085580825805665,
"num_tokens": 18508695.0,
"step": 8990
},
{
"entropy": 5.482311677932739,
"epoch": 7.9818020417221485,
"grad_norm": 1.4453125,
"learning_rate": 0.00010202160175999293,
"loss": 4.7819,
"mean_token_accuracy": 0.2350700467824936,
"num_tokens": 18518130.0,
"step": 8995
},
{
"entropy": 5.541825962066651,
"epoch": 7.986240568131381,
"grad_norm": 1.28125,
"learning_rate": 0.00010180151490394221,
"loss": 4.8632,
"mean_token_accuracy": 0.21929781436920165,
"num_tokens": 18528551.0,
"step": 9000
},
{
"epoch": 7.986240568131381,
"eval_entropy": 5.428067480300214,
"eval_loss": 5.8507981300354,
"eval_mean_token_accuracy": 0.17412096424793688,
"eval_num_tokens": 18528551.0,
"eval_runtime": 2.6827,
"eval_samples_per_second": 1255.072,
"eval_steps_per_second": 156.931,
"step": 9000
},
{
"entropy": 5.5274420261383055,
"epoch": 7.990679094540613,
"grad_norm": 1.328125,
"learning_rate": 0.00010158183401330669,
"loss": 4.8132,
"mean_token_accuracy": 0.22902776151895524,
"num_tokens": 18538058.0,
"step": 9005
},
{
"entropy": 5.540129089355469,
"epoch": 7.995117620949845,
"grad_norm": 1.421875,
"learning_rate": 0.00010136255960300304,
"loss": 4.835,
"mean_token_accuracy": 0.23212106823921203,
"num_tokens": 18548361.0,
"step": 9010
},
{
"entropy": 5.576272487640381,
"epoch": 7.999556147359077,
"grad_norm": 1.4375,
"learning_rate": 0.00010114369218699571,
"loss": 4.8688,
"mean_token_accuracy": 0.23091581612825393,
"num_tokens": 18557201.0,
"step": 9015
},
{
"entropy": 5.564248720804851,
"epoch": 8.003550821127385,
"grad_norm": 1.3828125,
"learning_rate": 0.00010092523227829492,
"loss": 4.7607,
"mean_token_accuracy": 0.231922490729226,
"num_tokens": 18565334.0,
"step": 9020
},
{
"entropy": 5.524493646621704,
"epoch": 8.007989347536618,
"grad_norm": 1.40625,
"learning_rate": 0.00010070718038895565,
"loss": 4.7093,
"mean_token_accuracy": 0.23903445154428482,
"num_tokens": 18575053.0,
"step": 9025
},
{
"entropy": 5.536652374267578,
"epoch": 8.01242787394585,
"grad_norm": 1.3125,
"learning_rate": 0.0001004895370300768,
"loss": 4.7929,
"mean_token_accuracy": 0.22713127732276917,
"num_tokens": 18585712.0,
"step": 9030
},
{
"entropy": 5.528022623062133,
"epoch": 8.016866400355083,
"grad_norm": 1.28125,
"learning_rate": 0.00010027230271179947,
"loss": 4.7239,
"mean_token_accuracy": 0.23597533106803895,
"num_tokens": 18595891.0,
"step": 9035
},
{
"entropy": 5.550457382202149,
"epoch": 8.021304926764314,
"grad_norm": 1.1953125,
"learning_rate": 0.00010005547794330596,
"loss": 4.8266,
"mean_token_accuracy": 0.23265185505151748,
"num_tokens": 18606840.0,
"step": 9040
},
{
"entropy": 5.53079514503479,
"epoch": 8.025743453173547,
"grad_norm": 1.453125,
"learning_rate": 9.983906323281896e-05,
"loss": 4.6892,
"mean_token_accuracy": 0.23528325855731963,
"num_tokens": 18616471.0,
"step": 9045
},
{
"entropy": 5.461957025527954,
"epoch": 8.030181979582778,
"grad_norm": 1.234375,
"learning_rate": 9.962305908759947e-05,
"loss": 4.6661,
"mean_token_accuracy": 0.2398424983024597,
"num_tokens": 18627043.0,
"step": 9050
},
{
"entropy": 5.605092000961304,
"epoch": 8.034620505992011,
"grad_norm": 1.4453125,
"learning_rate": 9.940746601394665e-05,
"loss": 4.9146,
"mean_token_accuracy": 0.2153011977672577,
"num_tokens": 18637513.0,
"step": 9055
},
{
"entropy": 5.540894269943237,
"epoch": 8.039059032401243,
"grad_norm": 1.484375,
"learning_rate": 9.919228451719586e-05,
"loss": 4.7133,
"mean_token_accuracy": 0.24061339199543,
"num_tokens": 18648212.0,
"step": 9060
},
{
"entropy": 5.555710220336914,
"epoch": 8.043497558810476,
"grad_norm": 1.359375,
"learning_rate": 9.897751510171777e-05,
"loss": 4.8077,
"mean_token_accuracy": 0.23113755881786346,
"num_tokens": 18658671.0,
"step": 9065
},
{
"entropy": 5.537944650650024,
"epoch": 8.047936085219707,
"grad_norm": 1.3671875,
"learning_rate": 9.876315827091733e-05,
"loss": 4.7569,
"mean_token_accuracy": 0.22958007603883743,
"num_tokens": 18668049.0,
"step": 9070
},
{
"entropy": 5.512982559204102,
"epoch": 8.05237461162894,
"grad_norm": 1.2734375,
"learning_rate": 9.854921452723229e-05,
"loss": 4.7163,
"mean_token_accuracy": 0.2393386796116829,
"num_tokens": 18678396.0,
"step": 9075
},
{
"entropy": 5.541017627716064,
"epoch": 8.056813138038171,
"grad_norm": 1.4453125,
"learning_rate": 9.833568437213206e-05,
"loss": 4.7883,
"mean_token_accuracy": 0.23481515645980836,
"num_tokens": 18687959.0,
"step": 9080
},
{
"entropy": 5.5000848293304445,
"epoch": 8.061251664447404,
"grad_norm": 1.40625,
"learning_rate": 9.812256830611691e-05,
"loss": 4.766,
"mean_token_accuracy": 0.23509853035211564,
"num_tokens": 18697741.0,
"step": 9085
},
{
"entropy": 5.513149356842041,
"epoch": 8.065690190856635,
"grad_norm": 1.25,
"learning_rate": 9.790986682871612e-05,
"loss": 4.7547,
"mean_token_accuracy": 0.23307934552431106,
"num_tokens": 18708758.0,
"step": 9090
},
{
"entropy": 5.486678743362427,
"epoch": 8.070128717265868,
"grad_norm": 1.359375,
"learning_rate": 9.76975804384876e-05,
"loss": 4.6917,
"mean_token_accuracy": 0.238458089530468,
"num_tokens": 18719236.0,
"step": 9095
},
{
"entropy": 5.547485828399658,
"epoch": 8.0745672436751,
"grad_norm": 1.2890625,
"learning_rate": 9.748570963301607e-05,
"loss": 4.7913,
"mean_token_accuracy": 0.22847978621721268,
"num_tokens": 18729467.0,
"step": 9100
},
{
"entropy": 5.493706703186035,
"epoch": 8.079005770084333,
"grad_norm": 1.4453125,
"learning_rate": 9.727425490891217e-05,
"loss": 4.7527,
"mean_token_accuracy": 0.232248055934906,
"num_tokens": 18741053.0,
"step": 9105
},
{
"entropy": 5.553925800323486,
"epoch": 8.083444296493564,
"grad_norm": 1.3671875,
"learning_rate": 9.706321676181142e-05,
"loss": 4.7869,
"mean_token_accuracy": 0.23709060847759247,
"num_tokens": 18750376.0,
"step": 9110
},
{
"entropy": 5.5531352996826175,
"epoch": 8.087882822902797,
"grad_norm": 1.3046875,
"learning_rate": 9.685259568637279e-05,
"loss": 4.8179,
"mean_token_accuracy": 0.2207489252090454,
"num_tokens": 18761050.0,
"step": 9115
},
{
"entropy": 5.4737001895904545,
"epoch": 8.092321349312028,
"grad_norm": 1.328125,
"learning_rate": 9.664239217627765e-05,
"loss": 4.7197,
"mean_token_accuracy": 0.24053823798894883,
"num_tokens": 18772178.0,
"step": 9120
},
{
"entropy": 5.501503610610962,
"epoch": 8.096759875721261,
"grad_norm": 1.2265625,
"learning_rate": 9.643260672422879e-05,
"loss": 4.7313,
"mean_token_accuracy": 0.23011073470115662,
"num_tokens": 18782398.0,
"step": 9125
},
{
"entropy": 5.522367906570435,
"epoch": 8.101198402130493,
"grad_norm": 1.375,
"learning_rate": 9.622323982194876e-05,
"loss": 4.7502,
"mean_token_accuracy": 0.23586821258068086,
"num_tokens": 18792045.0,
"step": 9130
},
{
"entropy": 5.502495861053466,
"epoch": 8.105636928539726,
"grad_norm": 1.3046875,
"learning_rate": 9.601429196017945e-05,
"loss": 4.7392,
"mean_token_accuracy": 0.23209448754787446,
"num_tokens": 18802760.0,
"step": 9135
},
{
"entropy": 5.515348339080811,
"epoch": 8.110075454948957,
"grad_norm": 1.484375,
"learning_rate": 9.580576362868034e-05,
"loss": 4.7889,
"mean_token_accuracy": 0.22821114808321,
"num_tokens": 18812564.0,
"step": 9140
},
{
"entropy": 5.471339702606201,
"epoch": 8.11451398135819,
"grad_norm": 1.328125,
"learning_rate": 9.55976553162275e-05,
"loss": 4.7278,
"mean_token_accuracy": 0.2415887787938118,
"num_tokens": 18822940.0,
"step": 9145
},
{
"entropy": 5.469609165191651,
"epoch": 8.118952507767421,
"grad_norm": 1.296875,
"learning_rate": 9.53899675106127e-05,
"loss": 4.7134,
"mean_token_accuracy": 0.23635677099227906,
"num_tokens": 18832439.0,
"step": 9150
},
{
"entropy": 5.536976718902588,
"epoch": 8.123391034176654,
"grad_norm": 1.421875,
"learning_rate": 9.518270069864194e-05,
"loss": 4.7472,
"mean_token_accuracy": 0.2314641371369362,
"num_tokens": 18842314.0,
"step": 9155
},
{
"entropy": 5.567486381530761,
"epoch": 8.127829560585885,
"grad_norm": 1.359375,
"learning_rate": 9.49758553661344e-05,
"loss": 4.8109,
"mean_token_accuracy": 0.22504182010889054,
"num_tokens": 18853143.0,
"step": 9160
},
{
"entropy": 5.530188417434692,
"epoch": 8.132268086995118,
"grad_norm": 1.40625,
"learning_rate": 9.476943199792159e-05,
"loss": 4.7625,
"mean_token_accuracy": 0.22873036563396454,
"num_tokens": 18864236.0,
"step": 9165
},
{
"entropy": 5.502843189239502,
"epoch": 8.13670661340435,
"grad_norm": 1.4921875,
"learning_rate": 9.456343107784552e-05,
"loss": 4.8246,
"mean_token_accuracy": 0.2276325687766075,
"num_tokens": 18875011.0,
"step": 9170
},
{
"entropy": 5.536035537719727,
"epoch": 8.141145139813581,
"grad_norm": 1.34375,
"learning_rate": 9.435785308875847e-05,
"loss": 4.7437,
"mean_token_accuracy": 0.23043781220912934,
"num_tokens": 18885038.0,
"step": 9175
},
{
"entropy": 5.567473936080932,
"epoch": 8.145583666222814,
"grad_norm": 1.3359375,
"learning_rate": 9.415269851252112e-05,
"loss": 4.8357,
"mean_token_accuracy": 0.2290906250476837,
"num_tokens": 18896009.0,
"step": 9180
},
{
"entropy": 5.5274864673614506,
"epoch": 8.150022192632045,
"grad_norm": 1.4765625,
"learning_rate": 9.394796783000173e-05,
"loss": 4.7463,
"mean_token_accuracy": 0.24023734480142594,
"num_tokens": 18904690.0,
"step": 9185
},
{
"entropy": 5.574559354782105,
"epoch": 8.154460719041278,
"grad_norm": 1.234375,
"learning_rate": 9.374366152107516e-05,
"loss": 4.8825,
"mean_token_accuracy": 0.22338451892137529,
"num_tokens": 18916647.0,
"step": 9190
},
{
"entropy": 5.544428396224975,
"epoch": 8.15889924545051,
"grad_norm": 1.359375,
"learning_rate": 9.353978006462135e-05,
"loss": 4.7523,
"mean_token_accuracy": 0.2375463977456093,
"num_tokens": 18926387.0,
"step": 9195
},
{
"entropy": 5.496169567108154,
"epoch": 8.163337771859743,
"grad_norm": 1.3125,
"learning_rate": 9.333632393852449e-05,
"loss": 4.7432,
"mean_token_accuracy": 0.2356122463941574,
"num_tokens": 18935929.0,
"step": 9200
},
{
"entropy": 5.521384048461914,
"epoch": 8.167776298268974,
"grad_norm": 1.375,
"learning_rate": 9.313329361967198e-05,
"loss": 4.8205,
"mean_token_accuracy": 0.22696655988693237,
"num_tokens": 18945875.0,
"step": 9205
},
{
"entropy": 5.544740152359009,
"epoch": 8.172214824678207,
"grad_norm": 1.2421875,
"learning_rate": 9.293068958395281e-05,
"loss": 4.7976,
"mean_token_accuracy": 0.22982836663722991,
"num_tokens": 18955915.0,
"step": 9210
},
{
"entropy": 5.493546676635742,
"epoch": 8.176653351087438,
"grad_norm": 1.2578125,
"learning_rate": 9.272851230625715e-05,
"loss": 4.7093,
"mean_token_accuracy": 0.23800816535949706,
"num_tokens": 18966396.0,
"step": 9215
},
{
"entropy": 5.513923835754395,
"epoch": 8.181091877496671,
"grad_norm": 1.390625,
"learning_rate": 9.252676226047464e-05,
"loss": 4.7453,
"mean_token_accuracy": 0.2464535042643547,
"num_tokens": 18976144.0,
"step": 9220
},
{
"entropy": 5.5350417137146,
"epoch": 8.185530403905902,
"grad_norm": 1.3828125,
"learning_rate": 9.23254399194936e-05,
"loss": 4.7013,
"mean_token_accuracy": 0.2389968141913414,
"num_tokens": 18986626.0,
"step": 9225
},
{
"entropy": 5.4924163818359375,
"epoch": 8.189968930315136,
"grad_norm": 1.2421875,
"learning_rate": 9.212454575519992e-05,
"loss": 4.7527,
"mean_token_accuracy": 0.23163316994905472,
"num_tokens": 18996712.0,
"step": 9230
},
{
"entropy": 5.585897636413574,
"epoch": 8.194407456724367,
"grad_norm": 1.3671875,
"learning_rate": 9.192408023847573e-05,
"loss": 4.8572,
"mean_token_accuracy": 0.22339283376932145,
"num_tokens": 19007434.0,
"step": 9235
},
{
"entropy": 5.486374855041504,
"epoch": 8.1988459831336,
"grad_norm": 1.40625,
"learning_rate": 9.17240438391985e-05,
"loss": 4.752,
"mean_token_accuracy": 0.23487935215234756,
"num_tokens": 19016963.0,
"step": 9240
},
{
"entropy": 5.516498470306397,
"epoch": 8.203284509542831,
"grad_norm": 1.3671875,
"learning_rate": 9.152443702623993e-05,
"loss": 4.7158,
"mean_token_accuracy": 0.24053029268980025,
"num_tokens": 19026881.0,
"step": 9245
},
{
"entropy": 5.505452632904053,
"epoch": 8.207723035952064,
"grad_norm": 1.265625,
"learning_rate": 9.132526026746476e-05,
"loss": 4.7113,
"mean_token_accuracy": 0.23878167420625687,
"num_tokens": 19037185.0,
"step": 9250
},
{
"entropy": 5.5648938655853275,
"epoch": 8.212161562361295,
"grad_norm": 1.375,
"learning_rate": 9.112651402972962e-05,
"loss": 4.8562,
"mean_token_accuracy": 0.2236933633685112,
"num_tokens": 19049020.0,
"step": 9255
},
{
"entropy": 5.4700299263000485,
"epoch": 8.216600088770528,
"grad_norm": 1.140625,
"learning_rate": 9.09281987788822e-05,
"loss": 4.7421,
"mean_token_accuracy": 0.23488860726356506,
"num_tokens": 19059776.0,
"step": 9260
},
{
"entropy": 5.5285501956939695,
"epoch": 8.22103861517976,
"grad_norm": 1.46875,
"learning_rate": 9.073031497975981e-05,
"loss": 4.8095,
"mean_token_accuracy": 0.24489085674285888,
"num_tokens": 19069899.0,
"step": 9265
},
{
"entropy": 5.552821636199951,
"epoch": 8.225477141588993,
"grad_norm": 1.2265625,
"learning_rate": 9.053286309618861e-05,
"loss": 4.8003,
"mean_token_accuracy": 0.22677543014287949,
"num_tokens": 19080522.0,
"step": 9270
},
{
"entropy": 5.494792556762695,
"epoch": 8.229915667998224,
"grad_norm": 1.421875,
"learning_rate": 9.033584359098234e-05,
"loss": 4.7388,
"mean_token_accuracy": 0.23966412246227264,
"num_tokens": 19089528.0,
"step": 9275
},
{
"entropy": 5.564038515090942,
"epoch": 8.234354194407457,
"grad_norm": 1.3671875,
"learning_rate": 9.013925692594121e-05,
"loss": 4.817,
"mean_token_accuracy": 0.22776744067668914,
"num_tokens": 19098949.0,
"step": 9280
},
{
"entropy": 5.5699258804321286,
"epoch": 8.238792720816688,
"grad_norm": 1.390625,
"learning_rate": 8.994310356185098e-05,
"loss": 4.8391,
"mean_token_accuracy": 0.22998194694519042,
"num_tokens": 19109196.0,
"step": 9285
},
{
"entropy": 5.503975582122803,
"epoch": 8.243231247225921,
"grad_norm": 1.265625,
"learning_rate": 8.974738395848171e-05,
"loss": 4.6596,
"mean_token_accuracy": 0.24253153353929519,
"num_tokens": 19119455.0,
"step": 9290
},
{
"entropy": 5.533790969848633,
"epoch": 8.247669773635153,
"grad_norm": 1.40625,
"learning_rate": 8.955209857458679e-05,
"loss": 4.7831,
"mean_token_accuracy": 0.2344629153609276,
"num_tokens": 19129623.0,
"step": 9295
},
{
"entropy": 5.521896076202393,
"epoch": 8.252108300044386,
"grad_norm": 1.3125,
"learning_rate": 8.935724786790181e-05,
"loss": 4.7681,
"mean_token_accuracy": 0.22446090430021287,
"num_tokens": 19140021.0,
"step": 9300
},
{
"entropy": 5.497184371948242,
"epoch": 8.256546826453617,
"grad_norm": 1.3046875,
"learning_rate": 8.916283229514342e-05,
"loss": 4.7647,
"mean_token_accuracy": 0.2294624149799347,
"num_tokens": 19150669.0,
"step": 9305
},
{
"entropy": 5.522274541854858,
"epoch": 8.26098535286285,
"grad_norm": 1.390625,
"learning_rate": 8.89688523120086e-05,
"loss": 4.7993,
"mean_token_accuracy": 0.2291727066040039,
"num_tokens": 19162334.0,
"step": 9310
},
{
"entropy": 5.51942548751831,
"epoch": 8.265423879272081,
"grad_norm": 1.4296875,
"learning_rate": 8.87753083731731e-05,
"loss": 4.7681,
"mean_token_accuracy": 0.23500664681196212,
"num_tokens": 19171753.0,
"step": 9315
},
{
"entropy": 5.538489532470703,
"epoch": 8.269862405681314,
"grad_norm": 1.3984375,
"learning_rate": 8.858220093229062e-05,
"loss": 4.7856,
"mean_token_accuracy": 0.23224723488092422,
"num_tokens": 19181693.0,
"step": 9320
},
{
"entropy": 5.49764494895935,
"epoch": 8.274300932090545,
"grad_norm": 1.3828125,
"learning_rate": 8.838953044199196e-05,
"loss": 4.7371,
"mean_token_accuracy": 0.24010088741779329,
"num_tokens": 19192172.0,
"step": 9325
},
{
"entropy": 5.544925785064697,
"epoch": 8.278739458499778,
"grad_norm": 1.34375,
"learning_rate": 8.819729735388348e-05,
"loss": 4.7859,
"mean_token_accuracy": 0.22752300649881363,
"num_tokens": 19202253.0,
"step": 9330
},
{
"entropy": 5.479160165786743,
"epoch": 8.28317798490901,
"grad_norm": 1.28125,
"learning_rate": 8.800550211854643e-05,
"loss": 4.7005,
"mean_token_accuracy": 0.241083824634552,
"num_tokens": 19213043.0,
"step": 9335
},
{
"entropy": 5.504450702667237,
"epoch": 8.287616511318243,
"grad_norm": 1.359375,
"learning_rate": 8.781414518553572e-05,
"loss": 4.7942,
"mean_token_accuracy": 0.23475057482719422,
"num_tokens": 19223220.0,
"step": 9340
},
{
"entropy": 5.501762104034424,
"epoch": 8.292055037727474,
"grad_norm": 1.2109375,
"learning_rate": 8.762322700337891e-05,
"loss": 4.7607,
"mean_token_accuracy": 0.23693139106035233,
"num_tokens": 19233881.0,
"step": 9345
},
{
"entropy": 5.559514665603638,
"epoch": 8.296493564136707,
"grad_norm": 1.2578125,
"learning_rate": 8.743274801957523e-05,
"loss": 4.8784,
"mean_token_accuracy": 0.21944281011819838,
"num_tokens": 19244407.0,
"step": 9350
},
{
"entropy": 5.4935173988342285,
"epoch": 8.300932090545938,
"grad_norm": 1.4765625,
"learning_rate": 8.724270868059442e-05,
"loss": 4.7489,
"mean_token_accuracy": 0.24032629430294036,
"num_tokens": 19254892.0,
"step": 9355
},
{
"entropy": 5.506518411636352,
"epoch": 8.305370616955171,
"grad_norm": 1.390625,
"learning_rate": 8.705310943187556e-05,
"loss": 4.7619,
"mean_token_accuracy": 0.2328503906726837,
"num_tokens": 19265347.0,
"step": 9360
},
{
"entropy": 5.574012756347656,
"epoch": 8.309809143364403,
"grad_norm": 1.2890625,
"learning_rate": 8.686395071782651e-05,
"loss": 4.8766,
"mean_token_accuracy": 0.21546884179115294,
"num_tokens": 19276155.0,
"step": 9365
},
{
"entropy": 5.539609336853028,
"epoch": 8.314247669773636,
"grad_norm": 1.3984375,
"learning_rate": 8.667523298182229e-05,
"loss": 4.7871,
"mean_token_accuracy": 0.22656074166297913,
"num_tokens": 19286305.0,
"step": 9370
},
{
"entropy": 5.5059668064117435,
"epoch": 8.318686196182867,
"grad_norm": 1.328125,
"learning_rate": 8.64869566662044e-05,
"loss": 4.7996,
"mean_token_accuracy": 0.23410040587186814,
"num_tokens": 19296950.0,
"step": 9375
},
{
"entropy": 5.547997999191284,
"epoch": 8.3231247225921,
"grad_norm": 1.25,
"learning_rate": 8.629912221227962e-05,
"loss": 4.7638,
"mean_token_accuracy": 0.2401889055967331,
"num_tokens": 19307184.0,
"step": 9380
},
{
"entropy": 5.577024459838867,
"epoch": 8.327563249001331,
"grad_norm": 1.578125,
"learning_rate": 8.611173006031906e-05,
"loss": 4.8041,
"mean_token_accuracy": 0.22814675122499467,
"num_tokens": 19316769.0,
"step": 9385
},
{
"entropy": 5.594141149520874,
"epoch": 8.332001775410564,
"grad_norm": 1.4765625,
"learning_rate": 8.592478064955723e-05,
"loss": 4.8423,
"mean_token_accuracy": 0.2243447408080101,
"num_tokens": 19326639.0,
"step": 9390
},
{
"entropy": 5.525498151779175,
"epoch": 8.336440301819795,
"grad_norm": 1.1796875,
"learning_rate": 8.573827441819068e-05,
"loss": 4.709,
"mean_token_accuracy": 0.24149055778980255,
"num_tokens": 19337580.0,
"step": 9395
},
{
"entropy": 5.491425657272339,
"epoch": 8.340878828229028,
"grad_norm": 1.3125,
"learning_rate": 8.555221180337728e-05,
"loss": 4.7758,
"mean_token_accuracy": 0.22916120886802674,
"num_tokens": 19348407.0,
"step": 9400
},
{
"entropy": 5.485869026184082,
"epoch": 8.34531735463826,
"grad_norm": 1.4296875,
"learning_rate": 8.536659324123513e-05,
"loss": 4.7418,
"mean_token_accuracy": 0.24086770564317703,
"num_tokens": 19358762.0,
"step": 9405
},
{
"entropy": 5.506166648864746,
"epoch": 8.349755881047493,
"grad_norm": 1.3359375,
"learning_rate": 8.518141916684145e-05,
"loss": 4.7051,
"mean_token_accuracy": 0.24545371532440186,
"num_tokens": 19368803.0,
"step": 9410
},
{
"entropy": 5.504174470901489,
"epoch": 8.354194407456724,
"grad_norm": 1.3125,
"learning_rate": 8.499669001423161e-05,
"loss": 4.7075,
"mean_token_accuracy": 0.23998791426420213,
"num_tokens": 19379021.0,
"step": 9415
},
{
"entropy": 5.489093208312989,
"epoch": 8.358632933865957,
"grad_norm": 1.3203125,
"learning_rate": 8.481240621639811e-05,
"loss": 4.7341,
"mean_token_accuracy": 0.24076532572507858,
"num_tokens": 19388395.0,
"step": 9420
},
{
"entropy": 5.548724746704101,
"epoch": 8.363071460275188,
"grad_norm": 1.2578125,
"learning_rate": 8.46285682052895e-05,
"loss": 4.8932,
"mean_token_accuracy": 0.21990901827812195,
"num_tokens": 19398345.0,
"step": 9425
},
{
"entropy": 5.543989753723144,
"epoch": 8.367509986684421,
"grad_norm": 1.3046875,
"learning_rate": 8.444517641180972e-05,
"loss": 4.8093,
"mean_token_accuracy": 0.22736156582832337,
"num_tokens": 19409016.0,
"step": 9430
},
{
"entropy": 5.513630962371826,
"epoch": 8.371948513093653,
"grad_norm": 1.296875,
"learning_rate": 8.426223126581642e-05,
"loss": 4.7599,
"mean_token_accuracy": 0.23516931235790253,
"num_tokens": 19419276.0,
"step": 9435
},
{
"entropy": 5.499025011062622,
"epoch": 8.376387039502886,
"grad_norm": 1.3671875,
"learning_rate": 8.407973319612055e-05,
"loss": 4.7128,
"mean_token_accuracy": 0.2366909921169281,
"num_tokens": 19429576.0,
"step": 9440
},
{
"entropy": 5.5045167922973635,
"epoch": 8.380825565912117,
"grad_norm": 1.3515625,
"learning_rate": 8.389768263048522e-05,
"loss": 4.7469,
"mean_token_accuracy": 0.23800566792488098,
"num_tokens": 19438904.0,
"step": 9445
},
{
"entropy": 5.521352481842041,
"epoch": 8.38526409232135,
"grad_norm": 1.3828125,
"learning_rate": 8.371607999562445e-05,
"loss": 4.7592,
"mean_token_accuracy": 0.2305511102080345,
"num_tokens": 19448496.0,
"step": 9450
},
{
"entropy": 5.5736151218414305,
"epoch": 8.389702618730581,
"grad_norm": 1.4609375,
"learning_rate": 8.353492571720239e-05,
"loss": 4.8159,
"mean_token_accuracy": 0.22852290272712708,
"num_tokens": 19458650.0,
"step": 9455
},
{
"entropy": 5.5026754379272464,
"epoch": 8.394141145139814,
"grad_norm": 1.453125,
"learning_rate": 8.33542202198323e-05,
"loss": 4.7227,
"mean_token_accuracy": 0.23163039982318878,
"num_tokens": 19468073.0,
"step": 9460
},
{
"entropy": 5.527408838272095,
"epoch": 8.398579671549046,
"grad_norm": 1.2421875,
"learning_rate": 8.317396392707549e-05,
"loss": 4.7896,
"mean_token_accuracy": 0.2322364330291748,
"num_tokens": 19480377.0,
"step": 9465
},
{
"entropy": 5.501632452011108,
"epoch": 8.403018197958279,
"grad_norm": 1.3125,
"learning_rate": 8.299415726144047e-05,
"loss": 4.8061,
"mean_token_accuracy": 0.23190983533859252,
"num_tokens": 19489959.0,
"step": 9470
},
{
"entropy": 5.56592493057251,
"epoch": 8.40745672436751,
"grad_norm": 1.328125,
"learning_rate": 8.281480064438176e-05,
"loss": 4.7955,
"mean_token_accuracy": 0.22627756595611573,
"num_tokens": 19499786.0,
"step": 9475
},
{
"entropy": 5.54936990737915,
"epoch": 8.411895250776743,
"grad_norm": 1.3125,
"learning_rate": 8.263589449629894e-05,
"loss": 4.8062,
"mean_token_accuracy": 0.22562486976385115,
"num_tokens": 19509964.0,
"step": 9480
},
{
"entropy": 5.48337025642395,
"epoch": 8.416333777185974,
"grad_norm": 1.359375,
"learning_rate": 8.24574392365359e-05,
"loss": 4.7578,
"mean_token_accuracy": 0.24041553288698198,
"num_tokens": 19520266.0,
"step": 9485
},
{
"entropy": 5.485185956954956,
"epoch": 8.420772303595207,
"grad_norm": 1.296875,
"learning_rate": 8.227943528337953e-05,
"loss": 4.7604,
"mean_token_accuracy": 0.22689348608255386,
"num_tokens": 19530087.0,
"step": 9490
},
{
"entropy": 5.517862796783447,
"epoch": 8.425210830004438,
"grad_norm": 1.28125,
"learning_rate": 8.210188305405893e-05,
"loss": 4.7331,
"mean_token_accuracy": 0.2316621109843254,
"num_tokens": 19539968.0,
"step": 9495
},
{
"entropy": 5.554932928085327,
"epoch": 8.429649356413671,
"grad_norm": 1.3359375,
"learning_rate": 8.192478296474437e-05,
"loss": 4.7857,
"mean_token_accuracy": 0.22947621941566468,
"num_tokens": 19549593.0,
"step": 9500
},
{
"epoch": 8.429649356413671,
"eval_entropy": 5.416213118265474,
"eval_loss": 5.850149631500244,
"eval_mean_token_accuracy": 0.17406961249271652,
"eval_num_tokens": 19549593.0,
"eval_runtime": 2.8579,
"eval_samples_per_second": 1178.126,
"eval_steps_per_second": 147.309,
"step": 9500
},
{
"entropy": 5.5417482376098635,
"epoch": 8.434087882822903,
"grad_norm": 1.359375,
"learning_rate": 8.174813543054638e-05,
"loss": 4.7522,
"mean_token_accuracy": 0.2329458624124527,
"num_tokens": 19560055.0,
"step": 9505
},
{
"entropy": 5.499113655090332,
"epoch": 8.438526409232136,
"grad_norm": 1.2109375,
"learning_rate": 8.157194086551475e-05,
"loss": 4.7433,
"mean_token_accuracy": 0.23357740938663482,
"num_tokens": 19571238.0,
"step": 9510
},
{
"entropy": 5.4521290302276615,
"epoch": 8.442964935641367,
"grad_norm": 1.28125,
"learning_rate": 8.139619968263745e-05,
"loss": 4.7415,
"mean_token_accuracy": 0.2420793890953064,
"num_tokens": 19582089.0,
"step": 9515
},
{
"entropy": 5.546719408035278,
"epoch": 8.4474034620506,
"grad_norm": 1.265625,
"learning_rate": 8.12209122938398e-05,
"loss": 4.844,
"mean_token_accuracy": 0.22013940811157226,
"num_tokens": 19592901.0,
"step": 9520
},
{
"entropy": 5.501932144165039,
"epoch": 8.451841988459831,
"grad_norm": 1.3125,
"learning_rate": 8.10460791099835e-05,
"loss": 4.7586,
"mean_token_accuracy": 0.23002112209796904,
"num_tokens": 19602675.0,
"step": 9525
},
{
"entropy": 5.493412208557129,
"epoch": 8.456280514869064,
"grad_norm": 1.46875,
"learning_rate": 8.087170054086558e-05,
"loss": 4.711,
"mean_token_accuracy": 0.24073880165815353,
"num_tokens": 19612295.0,
"step": 9530
},
{
"entropy": 5.50322847366333,
"epoch": 8.460719041278296,
"grad_norm": 1.3046875,
"learning_rate": 8.069777699521749e-05,
"loss": 4.7309,
"mean_token_accuracy": 0.22775111049413682,
"num_tokens": 19622753.0,
"step": 9535
},
{
"entropy": 5.5291783809661865,
"epoch": 8.465157567687529,
"grad_norm": 1.359375,
"learning_rate": 8.052430888070415e-05,
"loss": 4.7808,
"mean_token_accuracy": 0.22778575122356415,
"num_tokens": 19632087.0,
"step": 9540
},
{
"entropy": 5.5328240394592285,
"epoch": 8.46959609409676,
"grad_norm": 1.4140625,
"learning_rate": 8.035129660392288e-05,
"loss": 4.7764,
"mean_token_accuracy": 0.23297585546970367,
"num_tokens": 19642096.0,
"step": 9545
},
{
"entropy": 5.562929344177246,
"epoch": 8.474034620505993,
"grad_norm": 1.5,
"learning_rate": 8.017874057040274e-05,
"loss": 4.782,
"mean_token_accuracy": 0.22624499201774598,
"num_tokens": 19652278.0,
"step": 9550
},
{
"entropy": 5.527111959457398,
"epoch": 8.478473146915224,
"grad_norm": 1.2578125,
"learning_rate": 8.000664118460325e-05,
"loss": 4.8497,
"mean_token_accuracy": 0.22667205929756165,
"num_tokens": 19664257.0,
"step": 9555
},
{
"entropy": 5.4916459083557125,
"epoch": 8.482911673324455,
"grad_norm": 1.4453125,
"learning_rate": 7.983499884991356e-05,
"loss": 4.6948,
"mean_token_accuracy": 0.24415883272886277,
"num_tokens": 19675093.0,
"step": 9560
},
{
"entropy": 5.536289930343628,
"epoch": 8.487350199733688,
"grad_norm": 1.3515625,
"learning_rate": 7.966381396865169e-05,
"loss": 4.8378,
"mean_token_accuracy": 0.22096568048000337,
"num_tokens": 19684672.0,
"step": 9565
},
{
"entropy": 5.52120623588562,
"epoch": 8.491788726142921,
"grad_norm": 1.1796875,
"learning_rate": 7.949308694206323e-05,
"loss": 4.8214,
"mean_token_accuracy": 0.23016716092824935,
"num_tokens": 19695085.0,
"step": 9570
},
{
"entropy": 5.537389945983887,
"epoch": 8.496227252552153,
"grad_norm": 1.40625,
"learning_rate": 7.932281817032065e-05,
"loss": 4.7553,
"mean_token_accuracy": 0.23001490533351898,
"num_tokens": 19705042.0,
"step": 9575
},
{
"entropy": 5.494133234024048,
"epoch": 8.500665778961384,
"grad_norm": 1.53125,
"learning_rate": 7.915300805252237e-05,
"loss": 4.7346,
"mean_token_accuracy": 0.2346693217754364,
"num_tokens": 19715317.0,
"step": 9580
},
{
"entropy": 5.510550212860108,
"epoch": 8.505104305370617,
"grad_norm": 1.2890625,
"learning_rate": 7.89836569866916e-05,
"loss": 4.7681,
"mean_token_accuracy": 0.23248301595449447,
"num_tokens": 19725286.0,
"step": 9585
},
{
"entropy": 5.532899999618531,
"epoch": 8.509542831779848,
"grad_norm": 1.375,
"learning_rate": 7.88147653697758e-05,
"loss": 4.8103,
"mean_token_accuracy": 0.22701820284128188,
"num_tokens": 19734484.0,
"step": 9590
},
{
"entropy": 5.602574682235717,
"epoch": 8.513981358189081,
"grad_norm": 1.2578125,
"learning_rate": 7.864633359764534e-05,
"loss": 4.8297,
"mean_token_accuracy": 0.22263017892837525,
"num_tokens": 19745834.0,
"step": 9595
},
{
"entropy": 5.493256235122681,
"epoch": 8.518419884598313,
"grad_norm": 1.328125,
"learning_rate": 7.847836206509267e-05,
"loss": 4.6396,
"mean_token_accuracy": 0.24397653788328172,
"num_tokens": 19754834.0,
"step": 9600
},
{
"entropy": 5.449935722351074,
"epoch": 8.522858411007546,
"grad_norm": 1.359375,
"learning_rate": 7.831085116583176e-05,
"loss": 4.7791,
"mean_token_accuracy": 0.23400386571884155,
"num_tokens": 19764777.0,
"step": 9605
},
{
"entropy": 5.493365526199341,
"epoch": 8.527296937416777,
"grad_norm": 1.3828125,
"learning_rate": 7.814380129249663e-05,
"loss": 4.7492,
"mean_token_accuracy": 0.23068651258945466,
"num_tokens": 19775554.0,
"step": 9610
},
{
"entropy": 5.535855674743653,
"epoch": 8.53173546382601,
"grad_norm": 1.328125,
"learning_rate": 7.797721283664077e-05,
"loss": 4.7602,
"mean_token_accuracy": 0.23622832596302032,
"num_tokens": 19785512.0,
"step": 9615
},
{
"entropy": 5.498302602767945,
"epoch": 8.536173990235241,
"grad_norm": 1.3046875,
"learning_rate": 7.781108618873614e-05,
"loss": 4.7397,
"mean_token_accuracy": 0.23634256720542907,
"num_tokens": 19795689.0,
"step": 9620
},
{
"entropy": 5.488301944732666,
"epoch": 8.540612516644474,
"grad_norm": 1.3984375,
"learning_rate": 7.764542173817221e-05,
"loss": 4.7557,
"mean_token_accuracy": 0.23292654305696486,
"num_tokens": 19806024.0,
"step": 9625
},
{
"entropy": 5.456901264190674,
"epoch": 8.545051043053705,
"grad_norm": 1.390625,
"learning_rate": 7.748021987325523e-05,
"loss": 4.7132,
"mean_token_accuracy": 0.23660846352577208,
"num_tokens": 19816320.0,
"step": 9630
},
{
"entropy": 5.549684715270996,
"epoch": 8.549489569462938,
"grad_norm": 1.3359375,
"learning_rate": 7.731548098120701e-05,
"loss": 4.771,
"mean_token_accuracy": 0.23219175040721893,
"num_tokens": 19826593.0,
"step": 9635
},
{
"entropy": 5.507291841506958,
"epoch": 8.55392809587217,
"grad_norm": 1.484375,
"learning_rate": 7.715120544816425e-05,
"loss": 4.7758,
"mean_token_accuracy": 0.22952704280614852,
"num_tokens": 19837182.0,
"step": 9640
},
{
"entropy": 5.478663444519043,
"epoch": 8.558366622281403,
"grad_norm": 1.328125,
"learning_rate": 7.698739365917764e-05,
"loss": 4.7637,
"mean_token_accuracy": 0.2380097433924675,
"num_tokens": 19847855.0,
"step": 9645
},
{
"entropy": 5.54415225982666,
"epoch": 8.562805148690634,
"grad_norm": 1.1953125,
"learning_rate": 7.682404599821084e-05,
"loss": 4.7991,
"mean_token_accuracy": 0.230449877679348,
"num_tokens": 19858739.0,
"step": 9650
},
{
"entropy": 5.468395376205445,
"epoch": 8.567243675099867,
"grad_norm": 1.359375,
"learning_rate": 7.666116284813942e-05,
"loss": 4.7988,
"mean_token_accuracy": 0.23000284731388093,
"num_tokens": 19868789.0,
"step": 9655
},
{
"entropy": 5.521364641189575,
"epoch": 8.571682201509098,
"grad_norm": 1.3203125,
"learning_rate": 7.649874459075057e-05,
"loss": 4.7447,
"mean_token_accuracy": 0.23275650292634964,
"num_tokens": 19879093.0,
"step": 9660
},
{
"entropy": 5.469178104400635,
"epoch": 8.576120727918331,
"grad_norm": 1.3828125,
"learning_rate": 7.633679160674144e-05,
"loss": 4.6962,
"mean_token_accuracy": 0.2438605934381485,
"num_tokens": 19889253.0,
"step": 9665
},
{
"entropy": 5.540501880645752,
"epoch": 8.580559254327563,
"grad_norm": 1.3359375,
"learning_rate": 7.617530427571886e-05,
"loss": 4.8336,
"mean_token_accuracy": 0.22254648357629775,
"num_tokens": 19900104.0,
"step": 9670
},
{
"entropy": 5.518979263305664,
"epoch": 8.584997780736796,
"grad_norm": 1.3515625,
"learning_rate": 7.601428297619805e-05,
"loss": 4.7773,
"mean_token_accuracy": 0.23023637235164643,
"num_tokens": 19910863.0,
"step": 9675
},
{
"entropy": 5.528198289871216,
"epoch": 8.589436307146027,
"grad_norm": 1.296875,
"learning_rate": 7.585372808560192e-05,
"loss": 4.742,
"mean_token_accuracy": 0.2323218196630478,
"num_tokens": 19921214.0,
"step": 9680
},
{
"entropy": 5.559651660919189,
"epoch": 8.59387483355526,
"grad_norm": 1.8046875,
"learning_rate": 7.569363998026021e-05,
"loss": 4.8121,
"mean_token_accuracy": 0.23514225482940673,
"num_tokens": 19930337.0,
"step": 9685
},
{
"entropy": 5.505900716781616,
"epoch": 8.598313359964491,
"grad_norm": 1.25,
"learning_rate": 7.553401903540857e-05,
"loss": 4.7702,
"mean_token_accuracy": 0.23090167343616486,
"num_tokens": 19941329.0,
"step": 9690
},
{
"entropy": 5.46249623298645,
"epoch": 8.602751886373724,
"grad_norm": 1.328125,
"learning_rate": 7.537486562518735e-05,
"loss": 4.7274,
"mean_token_accuracy": 0.23341498225927354,
"num_tokens": 19952710.0,
"step": 9695
},
{
"entropy": 5.537999868392944,
"epoch": 8.607190412782955,
"grad_norm": 1.2421875,
"learning_rate": 7.521618012264149e-05,
"loss": 4.7155,
"mean_token_accuracy": 0.2305786982178688,
"num_tokens": 19964718.0,
"step": 9700
},
{
"entropy": 5.499637603759766,
"epoch": 8.611628939192189,
"grad_norm": 1.4375,
"learning_rate": 7.505796289971885e-05,
"loss": 4.6858,
"mean_token_accuracy": 0.23282495141029358,
"num_tokens": 19973896.0,
"step": 9705
},
{
"entropy": 5.57208890914917,
"epoch": 8.61606746560142,
"grad_norm": 1.40625,
"learning_rate": 7.490021432726987e-05,
"loss": 4.8398,
"mean_token_accuracy": 0.2273474544286728,
"num_tokens": 19984255.0,
"step": 9710
},
{
"entropy": 5.563538980484009,
"epoch": 8.620505992010653,
"grad_norm": 1.4453125,
"learning_rate": 7.474293477504637e-05,
"loss": 4.821,
"mean_token_accuracy": 0.22293324917554855,
"num_tokens": 19995139.0,
"step": 9715
},
{
"entropy": 5.5361793518066404,
"epoch": 8.624944518419884,
"grad_norm": 1.3203125,
"learning_rate": 7.458612461170086e-05,
"loss": 4.7594,
"mean_token_accuracy": 0.2299353763461113,
"num_tokens": 20005002.0,
"step": 9720
},
{
"entropy": 5.496047401428223,
"epoch": 8.629383044829117,
"grad_norm": 1.25,
"learning_rate": 7.44297842047857e-05,
"loss": 4.7454,
"mean_token_accuracy": 0.234815414249897,
"num_tokens": 20016144.0,
"step": 9725
},
{
"entropy": 5.575048351287842,
"epoch": 8.633821571238348,
"grad_norm": 1.296875,
"learning_rate": 7.427391392075219e-05,
"loss": 4.8403,
"mean_token_accuracy": 0.22622893303632735,
"num_tokens": 20027667.0,
"step": 9730
},
{
"entropy": 5.492922687530518,
"epoch": 8.638260097647581,
"grad_norm": 1.40625,
"learning_rate": 7.411851412494943e-05,
"loss": 4.7804,
"mean_token_accuracy": 0.2270881474018097,
"num_tokens": 20037778.0,
"step": 9735
},
{
"entropy": 5.5301882266998295,
"epoch": 8.642698624056813,
"grad_norm": 1.3203125,
"learning_rate": 7.396358518162405e-05,
"loss": 4.7654,
"mean_token_accuracy": 0.23267012983560562,
"num_tokens": 20047679.0,
"step": 9740
},
{
"entropy": 5.548095989227295,
"epoch": 8.647137150466046,
"grad_norm": 1.1171875,
"learning_rate": 7.380912745391888e-05,
"loss": 4.8269,
"mean_token_accuracy": 0.2271960750222206,
"num_tokens": 20058765.0,
"step": 9745
},
{
"entropy": 5.518854236602783,
"epoch": 8.651575676875277,
"grad_norm": 1.3984375,
"learning_rate": 7.36551413038723e-05,
"loss": 4.7733,
"mean_token_accuracy": 0.23128276616334914,
"num_tokens": 20069036.0,
"step": 9750
},
{
"entropy": 5.535914897918701,
"epoch": 8.65601420328451,
"grad_norm": 1.3984375,
"learning_rate": 7.350162709241734e-05,
"loss": 4.8468,
"mean_token_accuracy": 0.21787732988595962,
"num_tokens": 20079062.0,
"step": 9755
},
{
"entropy": 5.559089183807373,
"epoch": 8.660452729693741,
"grad_norm": 1.3984375,
"learning_rate": 7.334858517938074e-05,
"loss": 4.8022,
"mean_token_accuracy": 0.22950206995010375,
"num_tokens": 20089752.0,
"step": 9760
},
{
"entropy": 5.535069322586059,
"epoch": 8.664891256102974,
"grad_norm": 1.3515625,
"learning_rate": 7.319601592348238e-05,
"loss": 4.7458,
"mean_token_accuracy": 0.23865058422088622,
"num_tokens": 20099094.0,
"step": 9765
},
{
"entropy": 5.519786596298218,
"epoch": 8.669329782512206,
"grad_norm": 1.2265625,
"learning_rate": 7.304391968233418e-05,
"loss": 4.7941,
"mean_token_accuracy": 0.23107607215642928,
"num_tokens": 20109145.0,
"step": 9770
},
{
"entropy": 5.566598987579345,
"epoch": 8.673768308921439,
"grad_norm": 1.3671875,
"learning_rate": 7.28922968124392e-05,
"loss": 4.8097,
"mean_token_accuracy": 0.21964459717273713,
"num_tokens": 20119953.0,
"step": 9775
},
{
"entropy": 5.474442672729492,
"epoch": 8.67820683533067,
"grad_norm": 1.4140625,
"learning_rate": 7.27411476691912e-05,
"loss": 4.7226,
"mean_token_accuracy": 0.23574139475822448,
"num_tokens": 20130362.0,
"step": 9780
},
{
"entropy": 5.481369972229004,
"epoch": 8.682645361739903,
"grad_norm": 1.359375,
"learning_rate": 7.25904726068734e-05,
"loss": 4.6851,
"mean_token_accuracy": 0.2324271470308304,
"num_tokens": 20140149.0,
"step": 9785
},
{
"entropy": 5.4753632068634035,
"epoch": 8.687083888149134,
"grad_norm": 1.3125,
"learning_rate": 7.244027197865793e-05,
"loss": 4.6966,
"mean_token_accuracy": 0.2406598746776581,
"num_tokens": 20150452.0,
"step": 9790
},
{
"entropy": 5.453383922576904,
"epoch": 8.691522414558367,
"grad_norm": 1.296875,
"learning_rate": 7.229054613660472e-05,
"loss": 4.6125,
"mean_token_accuracy": 0.23984317630529403,
"num_tokens": 20160763.0,
"step": 9795
},
{
"entropy": 5.498008728027344,
"epoch": 8.695960940967598,
"grad_norm": 1.2890625,
"learning_rate": 7.21412954316609e-05,
"loss": 4.7423,
"mean_token_accuracy": 0.23824133723974228,
"num_tokens": 20171217.0,
"step": 9800
},
{
"entropy": 5.54000506401062,
"epoch": 8.700399467376831,
"grad_norm": 1.3984375,
"learning_rate": 7.199252021366e-05,
"loss": 4.9028,
"mean_token_accuracy": 0.21947446018457412,
"num_tokens": 20182688.0,
"step": 9805
},
{
"entropy": 5.486901426315308,
"epoch": 8.704837993786063,
"grad_norm": 1.265625,
"learning_rate": 7.184422083132097e-05,
"loss": 4.8131,
"mean_token_accuracy": 0.2298983633518219,
"num_tokens": 20194095.0,
"step": 9810
},
{
"entropy": 5.532335233688355,
"epoch": 8.709276520195296,
"grad_norm": 1.328125,
"learning_rate": 7.16963976322473e-05,
"loss": 4.7962,
"mean_token_accuracy": 0.2296323984861374,
"num_tokens": 20204575.0,
"step": 9815
},
{
"entropy": 5.526471138000488,
"epoch": 8.713715046604527,
"grad_norm": 1.265625,
"learning_rate": 7.154905096292662e-05,
"loss": 4.826,
"mean_token_accuracy": 0.2282497078180313,
"num_tokens": 20215069.0,
"step": 9820
},
{
"entropy": 5.516374921798706,
"epoch": 8.71815357301376,
"grad_norm": 1.296875,
"learning_rate": 7.140218116872932e-05,
"loss": 4.7375,
"mean_token_accuracy": 0.23372119516134263,
"num_tokens": 20225132.0,
"step": 9825
},
{
"entropy": 5.503606796264648,
"epoch": 8.722592099422991,
"grad_norm": 1.34375,
"learning_rate": 7.125578859390828e-05,
"loss": 4.7837,
"mean_token_accuracy": 0.23138995766639708,
"num_tokens": 20234797.0,
"step": 9830
},
{
"entropy": 5.492996597290039,
"epoch": 8.727030625832224,
"grad_norm": 1.3046875,
"learning_rate": 7.110987358159763e-05,
"loss": 4.7634,
"mean_token_accuracy": 0.23167468905448912,
"num_tokens": 20245075.0,
"step": 9835
},
{
"entropy": 5.516223382949829,
"epoch": 8.731469152241456,
"grad_norm": 1.3828125,
"learning_rate": 7.09644364738122e-05,
"loss": 4.814,
"mean_token_accuracy": 0.22969421446323396,
"num_tokens": 20255729.0,
"step": 9840
},
{
"entropy": 5.522350454330445,
"epoch": 8.735907678650689,
"grad_norm": 1.359375,
"learning_rate": 7.081947761144665e-05,
"loss": 4.7605,
"mean_token_accuracy": 0.23422917276620864,
"num_tokens": 20266638.0,
"step": 9845
},
{
"entropy": 5.51732873916626,
"epoch": 8.74034620505992,
"grad_norm": 1.2734375,
"learning_rate": 7.067499733427466e-05,
"loss": 4.6929,
"mean_token_accuracy": 0.24654830247163773,
"num_tokens": 20276927.0,
"step": 9850
},
{
"entropy": 5.556275033950806,
"epoch": 8.744784731469153,
"grad_norm": 1.484375,
"learning_rate": 7.053099598094804e-05,
"loss": 4.7794,
"mean_token_accuracy": 0.23401879370212555,
"num_tokens": 20286960.0,
"step": 9855
},
{
"entropy": 5.5193338871002195,
"epoch": 8.749223257878384,
"grad_norm": 1.390625,
"learning_rate": 7.038747388899624e-05,
"loss": 4.7324,
"mean_token_accuracy": 0.23848005384206772,
"num_tokens": 20297623.0,
"step": 9860
},
{
"entropy": 5.485701656341552,
"epoch": 8.753661784287617,
"grad_norm": 1.2734375,
"learning_rate": 7.024443139482514e-05,
"loss": 4.8011,
"mean_token_accuracy": 0.22937335968017578,
"num_tokens": 20308089.0,
"step": 9865
},
{
"entropy": 5.490072250366211,
"epoch": 8.758100310696848,
"grad_norm": 1.328125,
"learning_rate": 7.010186883371667e-05,
"loss": 4.7441,
"mean_token_accuracy": 0.2342752531170845,
"num_tokens": 20317314.0,
"step": 9870
},
{
"entropy": 5.4882453918457035,
"epoch": 8.762538837106082,
"grad_norm": 1.3125,
"learning_rate": 6.995978653982765e-05,
"loss": 4.7986,
"mean_token_accuracy": 0.2269292578101158,
"num_tokens": 20327888.0,
"step": 9875
},
{
"entropy": 5.554427289962769,
"epoch": 8.766977363515313,
"grad_norm": 1.3828125,
"learning_rate": 6.981818484618926e-05,
"loss": 4.7827,
"mean_token_accuracy": 0.2302411451935768,
"num_tokens": 20337636.0,
"step": 9880
},
{
"entropy": 5.508083295822144,
"epoch": 8.771415889924546,
"grad_norm": 1.484375,
"learning_rate": 6.967706408470628e-05,
"loss": 4.783,
"mean_token_accuracy": 0.23305133432149888,
"num_tokens": 20348370.0,
"step": 9885
},
{
"entropy": 5.525426626205444,
"epoch": 8.775854416333777,
"grad_norm": 1.25,
"learning_rate": 6.953642458615616e-05,
"loss": 4.7939,
"mean_token_accuracy": 0.23202591091394426,
"num_tokens": 20359656.0,
"step": 9890
},
{
"entropy": 5.544418430328369,
"epoch": 8.78029294274301,
"grad_norm": 1.1875,
"learning_rate": 6.939626668018806e-05,
"loss": 4.8007,
"mean_token_accuracy": 0.22351673245429993,
"num_tokens": 20370526.0,
"step": 9895
},
{
"entropy": 5.555383729934692,
"epoch": 8.784731469152241,
"grad_norm": 1.453125,
"learning_rate": 6.925659069532276e-05,
"loss": 4.745,
"mean_token_accuracy": 0.2246900260448456,
"num_tokens": 20379716.0,
"step": 9900
},
{
"entropy": 5.535406541824341,
"epoch": 8.789169995561474,
"grad_norm": 1.453125,
"learning_rate": 6.911739695895108e-05,
"loss": 4.7626,
"mean_token_accuracy": 0.2337111711502075,
"num_tokens": 20390369.0,
"step": 9905
},
{
"entropy": 5.5400303363800045,
"epoch": 8.793608521970706,
"grad_norm": 1.375,
"learning_rate": 6.897868579733373e-05,
"loss": 4.7497,
"mean_token_accuracy": 0.23331557512283324,
"num_tokens": 20400188.0,
"step": 9910
},
{
"entropy": 5.498782587051392,
"epoch": 8.798047048379939,
"grad_norm": 1.3515625,
"learning_rate": 6.884045753560016e-05,
"loss": 4.7731,
"mean_token_accuracy": 0.2317243054509163,
"num_tokens": 20410008.0,
"step": 9915
},
{
"entropy": 5.475151014328003,
"epoch": 8.80248557478917,
"grad_norm": 1.1875,
"learning_rate": 6.870271249774793e-05,
"loss": 4.7667,
"mean_token_accuracy": 0.2383279338479042,
"num_tokens": 20421205.0,
"step": 9920
},
{
"entropy": 5.507953834533692,
"epoch": 8.806924101198401,
"grad_norm": 1.4375,
"learning_rate": 6.856545100664203e-05,
"loss": 4.7779,
"mean_token_accuracy": 0.23082384318113328,
"num_tokens": 20432478.0,
"step": 9925
},
{
"entropy": 5.533805179595947,
"epoch": 8.811362627607634,
"grad_norm": 1.3515625,
"learning_rate": 6.842867338401409e-05,
"loss": 4.7783,
"mean_token_accuracy": 0.23170479834079744,
"num_tokens": 20443546.0,
"step": 9930
},
{
"entropy": 5.547921276092529,
"epoch": 8.815801154016867,
"grad_norm": 1.328125,
"learning_rate": 6.829237995046138e-05,
"loss": 4.8601,
"mean_token_accuracy": 0.2271231785416603,
"num_tokens": 20455069.0,
"step": 9935
},
{
"entropy": 5.61183352470398,
"epoch": 8.820239680426099,
"grad_norm": 1.4140625,
"learning_rate": 6.815657102544648e-05,
"loss": 4.8508,
"mean_token_accuracy": 0.22385960519313813,
"num_tokens": 20466592.0,
"step": 9940
},
{
"entropy": 5.5380267143249515,
"epoch": 8.82467820683533,
"grad_norm": 1.3828125,
"learning_rate": 6.802124692729613e-05,
"loss": 4.7659,
"mean_token_accuracy": 0.22524937242269516,
"num_tokens": 20477817.0,
"step": 9945
},
{
"entropy": 5.4453453540802,
"epoch": 8.829116733244563,
"grad_norm": 1.34375,
"learning_rate": 6.788640797320092e-05,
"loss": 4.7418,
"mean_token_accuracy": 0.24071793556213378,
"num_tokens": 20488320.0,
"step": 9950
},
{
"entropy": 5.493866682052612,
"epoch": 8.833555259653796,
"grad_norm": 1.3046875,
"learning_rate": 6.775205447921409e-05,
"loss": 4.8012,
"mean_token_accuracy": 0.23522679805755614,
"num_tokens": 20498834.0,
"step": 9955
},
{
"entropy": 5.464108943939209,
"epoch": 8.837993786063027,
"grad_norm": 1.2890625,
"learning_rate": 6.761818676025096e-05,
"loss": 4.7344,
"mean_token_accuracy": 0.2362118035554886,
"num_tokens": 20509077.0,
"step": 9960
},
{
"entropy": 5.547714328765869,
"epoch": 8.842432312472258,
"grad_norm": 1.4921875,
"learning_rate": 6.748480513008843e-05,
"loss": 4.8241,
"mean_token_accuracy": 0.2292942076921463,
"num_tokens": 20519263.0,
"step": 9965
},
{
"entropy": 5.524181985855103,
"epoch": 8.846870838881491,
"grad_norm": 1.359375,
"learning_rate": 6.735190990136394e-05,
"loss": 4.7649,
"mean_token_accuracy": 0.23648161292076111,
"num_tokens": 20529164.0,
"step": 9970
},
{
"entropy": 5.493105363845825,
"epoch": 8.851309365290723,
"grad_norm": 1.28125,
"learning_rate": 6.721950138557468e-05,
"loss": 4.7854,
"mean_token_accuracy": 0.23499795496463777,
"num_tokens": 20540442.0,
"step": 9975
},
{
"entropy": 5.538046169281006,
"epoch": 8.855747891699956,
"grad_norm": 1.34375,
"learning_rate": 6.708757989307729e-05,
"loss": 4.8203,
"mean_token_accuracy": 0.2239013820886612,
"num_tokens": 20550535.0,
"step": 9980
},
{
"entropy": 5.553622436523438,
"epoch": 8.860186418109187,
"grad_norm": 1.4453125,
"learning_rate": 6.695614573308673e-05,
"loss": 4.7881,
"mean_token_accuracy": 0.23241582959890367,
"num_tokens": 20559750.0,
"step": 9985
},
{
"entropy": 5.558172369003296,
"epoch": 8.86462494451842,
"grad_norm": 1.296875,
"learning_rate": 6.68251992136756e-05,
"loss": 4.8046,
"mean_token_accuracy": 0.22624700665473937,
"num_tokens": 20570007.0,
"step": 9990
},
{
"entropy": 5.556117105484009,
"epoch": 8.869063470927651,
"grad_norm": 1.359375,
"learning_rate": 6.66947406417737e-05,
"loss": 4.8638,
"mean_token_accuracy": 0.22003440111875533,
"num_tokens": 20580440.0,
"step": 9995
},
{
"entropy": 5.512663888931274,
"epoch": 8.873501997336884,
"grad_norm": 1.3359375,
"learning_rate": 6.65647703231669e-05,
"loss": 4.7895,
"mean_token_accuracy": 0.23371849358081817,
"num_tokens": 20590441.0,
"step": 10000
},
{
"epoch": 8.873501997336884,
"eval_entropy": 5.401691513786407,
"eval_loss": 5.8470540046691895,
"eval_mean_token_accuracy": 0.1741063350063888,
"eval_num_tokens": 20590441.0,
"eval_runtime": 2.6927,
"eval_samples_per_second": 1250.42,
"eval_steps_per_second": 156.349,
"step": 10000
},
{
"entropy": 5.450224351882935,
"epoch": 8.877940523746116,
"grad_norm": 1.40625,
"learning_rate": 6.643528856249688e-05,
"loss": 4.7382,
"mean_token_accuracy": 0.24139240235090256,
"num_tokens": 20600108.0,
"step": 10005
},
{
"entropy": 5.531251096725464,
"epoch": 8.882379050155349,
"grad_norm": 1.3671875,
"learning_rate": 6.630629566325999e-05,
"loss": 4.7832,
"mean_token_accuracy": 0.2318937212228775,
"num_tokens": 20609938.0,
"step": 10010
},
{
"entropy": 5.488429927825928,
"epoch": 8.88681757656458,
"grad_norm": 1.1875,
"learning_rate": 6.617779192780671e-05,
"loss": 4.662,
"mean_token_accuracy": 0.24616407752037048,
"num_tokens": 20620705.0,
"step": 10015
},
{
"entropy": 5.582185888290406,
"epoch": 8.891256102973813,
"grad_norm": 1.359375,
"learning_rate": 6.604977765734105e-05,
"loss": 4.9225,
"mean_token_accuracy": 0.21983425468206405,
"num_tokens": 20630621.0,
"step": 10020
},
{
"entropy": 5.5678637504577635,
"epoch": 8.895694629383044,
"grad_norm": 1.3515625,
"learning_rate": 6.592225315191974e-05,
"loss": 4.8582,
"mean_token_accuracy": 0.22117769569158555,
"num_tokens": 20641153.0,
"step": 10025
},
{
"entropy": 5.553381109237671,
"epoch": 8.900133155792277,
"grad_norm": 1.421875,
"learning_rate": 6.579521871045147e-05,
"loss": 4.8059,
"mean_token_accuracy": 0.22869402021169663,
"num_tokens": 20651255.0,
"step": 10030
},
{
"entropy": 5.514214897155762,
"epoch": 8.904571682201508,
"grad_norm": 1.5234375,
"learning_rate": 6.566867463069631e-05,
"loss": 4.8085,
"mean_token_accuracy": 0.2360523074865341,
"num_tokens": 20661784.0,
"step": 10035
},
{
"entropy": 5.519687557220459,
"epoch": 8.909010208610741,
"grad_norm": 1.2890625,
"learning_rate": 6.554262120926494e-05,
"loss": 4.741,
"mean_token_accuracy": 0.23803699612617493,
"num_tokens": 20673180.0,
"step": 10040
},
{
"entropy": 5.516700077056885,
"epoch": 8.913448735019973,
"grad_norm": 1.46875,
"learning_rate": 6.541705874161795e-05,
"loss": 4.6803,
"mean_token_accuracy": 0.24361468553543092,
"num_tokens": 20683506.0,
"step": 10045
},
{
"entropy": 5.53422908782959,
"epoch": 8.917887261429206,
"grad_norm": 1.3046875,
"learning_rate": 6.529198752206528e-05,
"loss": 4.8346,
"mean_token_accuracy": 0.23075076192617416,
"num_tokens": 20693514.0,
"step": 10050
},
{
"entropy": 5.490427923202515,
"epoch": 8.922325787838437,
"grad_norm": 1.2734375,
"learning_rate": 6.516740784376516e-05,
"loss": 4.7104,
"mean_token_accuracy": 0.23527978360652924,
"num_tokens": 20703026.0,
"step": 10055
},
{
"entropy": 5.4830833911895756,
"epoch": 8.92676431424767,
"grad_norm": 1.3671875,
"learning_rate": 6.504331999872395e-05,
"loss": 4.7395,
"mean_token_accuracy": 0.23174940943717956,
"num_tokens": 20713056.0,
"step": 10060
},
{
"entropy": 5.550501155853271,
"epoch": 8.931202840656901,
"grad_norm": 1.4609375,
"learning_rate": 6.491972427779507e-05,
"loss": 4.7723,
"mean_token_accuracy": 0.2302994430065155,
"num_tokens": 20722269.0,
"step": 10065
},
{
"entropy": 5.458361387252808,
"epoch": 8.935641367066134,
"grad_norm": 1.296875,
"learning_rate": 6.479662097067837e-05,
"loss": 4.7333,
"mean_token_accuracy": 0.23455849438905715,
"num_tokens": 20732618.0,
"step": 10070
},
{
"entropy": 5.529345941543579,
"epoch": 8.940079893475366,
"grad_norm": 1.4375,
"learning_rate": 6.467401036591972e-05,
"loss": 4.7914,
"mean_token_accuracy": 0.23216214030981064,
"num_tokens": 20741287.0,
"step": 10075
},
{
"entropy": 5.565483713150025,
"epoch": 8.944518419884599,
"grad_norm": 1.328125,
"learning_rate": 6.455189275090985e-05,
"loss": 4.8069,
"mean_token_accuracy": 0.22476845234632492,
"num_tokens": 20751496.0,
"step": 10080
},
{
"entropy": 5.531020736694336,
"epoch": 8.94895694629383,
"grad_norm": 1.3828125,
"learning_rate": 6.443026841188426e-05,
"loss": 4.7804,
"mean_token_accuracy": 0.23130278736352922,
"num_tokens": 20761593.0,
"step": 10085
},
{
"entropy": 5.546991157531738,
"epoch": 8.953395472703063,
"grad_norm": 1.359375,
"learning_rate": 6.430913763392202e-05,
"loss": 4.7946,
"mean_token_accuracy": 0.22942245602607728,
"num_tokens": 20771565.0,
"step": 10090
},
{
"entropy": 5.504369115829467,
"epoch": 8.957833999112294,
"grad_norm": 1.359375,
"learning_rate": 6.418850070094535e-05,
"loss": 4.7205,
"mean_token_accuracy": 0.2323445960879326,
"num_tokens": 20780896.0,
"step": 10095
},
{
"entropy": 5.550302410125733,
"epoch": 8.962272525521527,
"grad_norm": 1.5,
"learning_rate": 6.406835789571905e-05,
"loss": 4.771,
"mean_token_accuracy": 0.22577528655529022,
"num_tokens": 20790526.0,
"step": 10100
},
{
"entropy": 5.52872748374939,
"epoch": 8.966711051930758,
"grad_norm": 1.375,
"learning_rate": 6.394870949984962e-05,
"loss": 4.8416,
"mean_token_accuracy": 0.22468873113393784,
"num_tokens": 20800365.0,
"step": 10105
},
{
"entropy": 5.511211204528808,
"epoch": 8.971149578339991,
"grad_norm": 1.40625,
"learning_rate": 6.382955579378468e-05,
"loss": 4.7657,
"mean_token_accuracy": 0.23514631390571594,
"num_tokens": 20811173.0,
"step": 10110
},
{
"entropy": 5.509348154067993,
"epoch": 8.975588104749223,
"grad_norm": 1.390625,
"learning_rate": 6.37108970568125e-05,
"loss": 4.7938,
"mean_token_accuracy": 0.23086624294519426,
"num_tokens": 20821174.0,
"step": 10115
},
{
"entropy": 5.565616703033447,
"epoch": 8.980026631158456,
"grad_norm": 1.4140625,
"learning_rate": 6.359273356706088e-05,
"loss": 4.8037,
"mean_token_accuracy": 0.22674722969532013,
"num_tokens": 20829686.0,
"step": 10120
},
{
"entropy": 5.518183183670044,
"epoch": 8.984465157567687,
"grad_norm": 1.4140625,
"learning_rate": 6.347506560149712e-05,
"loss": 4.8098,
"mean_token_accuracy": 0.23083883672952651,
"num_tokens": 20839437.0,
"step": 10125
},
{
"entropy": 5.464258813858033,
"epoch": 8.98890368397692,
"grad_norm": 1.171875,
"learning_rate": 6.335789343592687e-05,
"loss": 4.6796,
"mean_token_accuracy": 0.24318164736032485,
"num_tokens": 20850681.0,
"step": 10130
},
{
"entropy": 5.566712665557861,
"epoch": 8.993342210386151,
"grad_norm": 1.3671875,
"learning_rate": 6.324121734499355e-05,
"loss": 4.9054,
"mean_token_accuracy": 0.21726099848747255,
"num_tokens": 20862514.0,
"step": 10135
},
{
"entropy": 5.529117822647095,
"epoch": 8.997780736795384,
"grad_norm": 1.265625,
"learning_rate": 6.312503760217809e-05,
"loss": 4.7471,
"mean_token_accuracy": 0.23360429853200912,
"num_tokens": 20873251.0,
"step": 10140
},
{
"entropy": 5.528994242350261,
"epoch": 9.001775410563694,
"grad_norm": 1.4140625,
"learning_rate": 6.300935447979779e-05,
"loss": 4.7169,
"mean_token_accuracy": 0.23384134968121847,
"num_tokens": 20881647.0,
"step": 10145
},
{
"entropy": 5.532529878616333,
"epoch": 9.006213936972925,
"grad_norm": 1.4375,
"learning_rate": 6.289416824900597e-05,
"loss": 4.7535,
"mean_token_accuracy": 0.23468233197927474,
"num_tokens": 20890995.0,
"step": 10150
},
{
"entropy": 5.5220701694488525,
"epoch": 9.010652463382158,
"grad_norm": 1.25,
"learning_rate": 6.277947917979139e-05,
"loss": 4.7336,
"mean_token_accuracy": 0.2317524090409279,
"num_tokens": 20901392.0,
"step": 10155
},
{
"entropy": 5.616314315795899,
"epoch": 9.01509098979139,
"grad_norm": 1.375,
"learning_rate": 6.266528754097726e-05,
"loss": 4.9234,
"mean_token_accuracy": 0.21836830526590348,
"num_tokens": 20913849.0,
"step": 10160
},
{
"entropy": 5.472108173370361,
"epoch": 9.019529516200622,
"grad_norm": 1.234375,
"learning_rate": 6.255159360022109e-05,
"loss": 4.7081,
"mean_token_accuracy": 0.23889304101467132,
"num_tokens": 20925258.0,
"step": 10165
},
{
"entropy": 5.521774196624756,
"epoch": 9.023968042609853,
"grad_norm": 1.328125,
"learning_rate": 6.24383976240137e-05,
"loss": 4.7519,
"mean_token_accuracy": 0.23272427171468735,
"num_tokens": 20935387.0,
"step": 10170
},
{
"entropy": 5.495536994934082,
"epoch": 9.028406569019086,
"grad_norm": 1.359375,
"learning_rate": 6.23256998776786e-05,
"loss": 4.6899,
"mean_token_accuracy": 0.23805803954601287,
"num_tokens": 20944942.0,
"step": 10175
},
{
"entropy": 5.444762563705444,
"epoch": 9.032845095428318,
"grad_norm": 1.1328125,
"learning_rate": 6.221350062537173e-05,
"loss": 4.6805,
"mean_token_accuracy": 0.24426343888044358,
"num_tokens": 20956264.0,
"step": 10180
},
{
"entropy": 5.481463289260864,
"epoch": 9.03728362183755,
"grad_norm": 1.28125,
"learning_rate": 6.210180013008046e-05,
"loss": 4.6972,
"mean_token_accuracy": 0.24119472056627272,
"num_tokens": 20966737.0,
"step": 10185
},
{
"entropy": 5.423492813110352,
"epoch": 9.041722148246782,
"grad_norm": 1.2421875,
"learning_rate": 6.199059865362303e-05,
"loss": 4.6985,
"mean_token_accuracy": 0.2334475487470627,
"num_tokens": 20977386.0,
"step": 10190
},
{
"entropy": 5.4792670726776125,
"epoch": 9.046160674656015,
"grad_norm": 1.390625,
"learning_rate": 6.187989645664822e-05,
"loss": 4.7487,
"mean_token_accuracy": 0.23878291845321656,
"num_tokens": 20987897.0,
"step": 10195
},
{
"entropy": 5.509481477737427,
"epoch": 9.050599201065246,
"grad_norm": 1.2734375,
"learning_rate": 6.176969379863433e-05,
"loss": 4.7506,
"mean_token_accuracy": 0.2361926630139351,
"num_tokens": 20998062.0,
"step": 10200
},
{
"entropy": 5.528634119033813,
"epoch": 9.05503772747448,
"grad_norm": 1.296875,
"learning_rate": 6.165999093788894e-05,
"loss": 4.7624,
"mean_token_accuracy": 0.23542358130216598,
"num_tokens": 21009419.0,
"step": 10205
},
{
"entropy": 5.504809808731079,
"epoch": 9.05947625388371,
"grad_norm": 1.3125,
"learning_rate": 6.1550788131548e-05,
"loss": 4.6893,
"mean_token_accuracy": 0.23956870436668395,
"num_tokens": 21020287.0,
"step": 10210
},
{
"entropy": 5.520776700973511,
"epoch": 9.063914780292944,
"grad_norm": 1.4609375,
"learning_rate": 6.144208563557543e-05,
"loss": 4.7166,
"mean_token_accuracy": 0.235405895113945,
"num_tokens": 21029979.0,
"step": 10215
},
{
"entropy": 5.517230415344239,
"epoch": 9.068353306702175,
"grad_norm": 1.25,
"learning_rate": 6.133388370476245e-05,
"loss": 4.7346,
"mean_token_accuracy": 0.2399444580078125,
"num_tokens": 21039654.0,
"step": 10220
},
{
"entropy": 5.5568938732147215,
"epoch": 9.072791833111406,
"grad_norm": 1.3515625,
"learning_rate": 6.122618259272702e-05,
"loss": 4.7291,
"mean_token_accuracy": 0.23563320338726043,
"num_tokens": 21048857.0,
"step": 10225
},
{
"entropy": 5.515057897567749,
"epoch": 9.07723035952064,
"grad_norm": 1.421875,
"learning_rate": 6.111898255191316e-05,
"loss": 4.7229,
"mean_token_accuracy": 0.2390875607728958,
"num_tokens": 21058171.0,
"step": 10230
},
{
"entropy": 5.498465538024902,
"epoch": 9.08166888592987,
"grad_norm": 1.5546875,
"learning_rate": 6.1012283833590465e-05,
"loss": 4.6485,
"mean_token_accuracy": 0.2419521689414978,
"num_tokens": 21067005.0,
"step": 10235
},
{
"entropy": 5.553633832931519,
"epoch": 9.086107412339103,
"grad_norm": 1.3671875,
"learning_rate": 6.0906086687853404e-05,
"loss": 4.8089,
"mean_token_accuracy": 0.23313574492931366,
"num_tokens": 21077171.0,
"step": 10240
},
{
"entropy": 5.5345700740814205,
"epoch": 9.090545938748335,
"grad_norm": 1.3359375,
"learning_rate": 6.0800391363620873e-05,
"loss": 4.8339,
"mean_token_accuracy": 0.2285278022289276,
"num_tokens": 21087807.0,
"step": 10245
},
{
"entropy": 5.5131172180175785,
"epoch": 9.094984465157568,
"grad_norm": 1.5234375,
"learning_rate": 6.069519810863552e-05,
"loss": 4.7877,
"mean_token_accuracy": 0.23459189832210542,
"num_tokens": 21097789.0,
"step": 10250
},
{
"entropy": 5.5414563655853275,
"epoch": 9.099422991566799,
"grad_norm": 1.3828125,
"learning_rate": 6.059050716946304e-05,
"loss": 4.7531,
"mean_token_accuracy": 0.23549041748046876,
"num_tokens": 21108441.0,
"step": 10255
},
{
"entropy": 5.522828245162964,
"epoch": 9.103861517976032,
"grad_norm": 1.4375,
"learning_rate": 6.048631879149193e-05,
"loss": 4.6725,
"mean_token_accuracy": 0.23748221546411513,
"num_tokens": 21117884.0,
"step": 10260
},
{
"entropy": 5.576062726974487,
"epoch": 9.108300044385263,
"grad_norm": 1.4453125,
"learning_rate": 6.038263321893259e-05,
"loss": 4.848,
"mean_token_accuracy": 0.2250259265303612,
"num_tokens": 21127831.0,
"step": 10265
},
{
"entropy": 5.514261484146118,
"epoch": 9.112738570794496,
"grad_norm": 1.4609375,
"learning_rate": 6.027945069481691e-05,
"loss": 4.7657,
"mean_token_accuracy": 0.23503907322883605,
"num_tokens": 21138483.0,
"step": 10270
},
{
"entropy": 5.516885471343994,
"epoch": 9.117177097203728,
"grad_norm": 1.2578125,
"learning_rate": 6.017677146099773e-05,
"loss": 4.732,
"mean_token_accuracy": 0.2340249866247177,
"num_tokens": 21150727.0,
"step": 10275
},
{
"entropy": 5.50878210067749,
"epoch": 9.12161562361296,
"grad_norm": 1.2265625,
"learning_rate": 6.007459575814812e-05,
"loss": 4.7195,
"mean_token_accuracy": 0.23274319469928742,
"num_tokens": 21161006.0,
"step": 10280
},
{
"entropy": 5.507541179656982,
"epoch": 9.126054150022192,
"grad_norm": 1.2421875,
"learning_rate": 5.997292382576092e-05,
"loss": 4.7147,
"mean_token_accuracy": 0.238101726770401,
"num_tokens": 21171366.0,
"step": 10285
},
{
"entropy": 5.45190167427063,
"epoch": 9.130492676431425,
"grad_norm": 1.2890625,
"learning_rate": 5.987175590214827e-05,
"loss": 4.7274,
"mean_token_accuracy": 0.24022093862295152,
"num_tokens": 21181658.0,
"step": 10290
},
{
"entropy": 5.531783676147461,
"epoch": 9.134931202840656,
"grad_norm": 1.2890625,
"learning_rate": 5.977109222444078e-05,
"loss": 4.6775,
"mean_token_accuracy": 0.23907614648342132,
"num_tokens": 21192699.0,
"step": 10295
},
{
"entropy": 5.498057413101196,
"epoch": 9.13936972924989,
"grad_norm": 1.40625,
"learning_rate": 5.9670933028587296e-05,
"loss": 4.746,
"mean_token_accuracy": 0.2347620740532875,
"num_tokens": 21202636.0,
"step": 10300
},
{
"entropy": 5.503952550888061,
"epoch": 9.14380825565912,
"grad_norm": 1.296875,
"learning_rate": 5.957127854935411e-05,
"loss": 4.7725,
"mean_token_accuracy": 0.230139422416687,
"num_tokens": 21212674.0,
"step": 10305
},
{
"entropy": 5.520496845245361,
"epoch": 9.148246782068354,
"grad_norm": 1.484375,
"learning_rate": 5.9472129020324476e-05,
"loss": 4.7906,
"mean_token_accuracy": 0.22601723670959473,
"num_tokens": 21223100.0,
"step": 10310
},
{
"entropy": 5.558461284637451,
"epoch": 9.152685308477585,
"grad_norm": 1.3359375,
"learning_rate": 5.93734846738982e-05,
"loss": 4.7891,
"mean_token_accuracy": 0.232218836247921,
"num_tokens": 21232850.0,
"step": 10315
},
{
"entropy": 5.523850584030152,
"epoch": 9.157123834886818,
"grad_norm": 1.203125,
"learning_rate": 5.927534574129081e-05,
"loss": 4.7126,
"mean_token_accuracy": 0.23391901403665544,
"num_tokens": 21243463.0,
"step": 10320
},
{
"entropy": 5.558882141113282,
"epoch": 9.161562361296049,
"grad_norm": 1.234375,
"learning_rate": 5.917771245253329e-05,
"loss": 4.792,
"mean_token_accuracy": 0.23285408616065978,
"num_tokens": 21253974.0,
"step": 10325
},
{
"entropy": 5.514503860473633,
"epoch": 9.166000887705282,
"grad_norm": 1.390625,
"learning_rate": 5.908058503647146e-05,
"loss": 4.7748,
"mean_token_accuracy": 0.2370190680027008,
"num_tokens": 21264639.0,
"step": 10330
},
{
"entropy": 5.523117923736573,
"epoch": 9.170439414114513,
"grad_norm": 1.3515625,
"learning_rate": 5.898396372076519e-05,
"loss": 4.7357,
"mean_token_accuracy": 0.2325824186205864,
"num_tokens": 21274974.0,
"step": 10335
},
{
"entropy": 5.534482336044311,
"epoch": 9.174877940523746,
"grad_norm": 1.53125,
"learning_rate": 5.888784873188839e-05,
"loss": 4.7381,
"mean_token_accuracy": 0.23985077291727067,
"num_tokens": 21284186.0,
"step": 10340
},
{
"entropy": 5.582151556015015,
"epoch": 9.179316466932978,
"grad_norm": 1.40625,
"learning_rate": 5.879224029512797e-05,
"loss": 4.7517,
"mean_token_accuracy": 0.23774406164884568,
"num_tokens": 21294151.0,
"step": 10345
},
{
"entropy": 5.551569318771362,
"epoch": 9.18375499334221,
"grad_norm": 1.4609375,
"learning_rate": 5.869713863458353e-05,
"loss": 4.7507,
"mean_token_accuracy": 0.23154722303152084,
"num_tokens": 21303453.0,
"step": 10350
},
{
"entropy": 5.53880763053894,
"epoch": 9.188193519751442,
"grad_norm": 1.3671875,
"learning_rate": 5.8602543973166966e-05,
"loss": 4.7351,
"mean_token_accuracy": 0.23967312574386596,
"num_tokens": 21314220.0,
"step": 10355
},
{
"entropy": 5.52753381729126,
"epoch": 9.192632046160675,
"grad_norm": 1.328125,
"learning_rate": 5.850845653260163e-05,
"loss": 4.7479,
"mean_token_accuracy": 0.22816836684942246,
"num_tokens": 21324466.0,
"step": 10360
},
{
"entropy": 5.494998741149902,
"epoch": 9.197070572569906,
"grad_norm": 1.4140625,
"learning_rate": 5.8414876533422044e-05,
"loss": 4.7279,
"mean_token_accuracy": 0.23925139605998993,
"num_tokens": 21334926.0,
"step": 10365
},
{
"entropy": 5.50531702041626,
"epoch": 9.20150909897914,
"grad_norm": 1.546875,
"learning_rate": 5.83218041949734e-05,
"loss": 4.7773,
"mean_token_accuracy": 0.22940786480903624,
"num_tokens": 21344841.0,
"step": 10370
},
{
"entropy": 5.477608633041382,
"epoch": 9.20594762538837,
"grad_norm": 1.3515625,
"learning_rate": 5.822923973541083e-05,
"loss": 4.6553,
"mean_token_accuracy": 0.24701591581106186,
"num_tokens": 21354401.0,
"step": 10375
},
{
"entropy": 5.525211572647095,
"epoch": 9.210386151797604,
"grad_norm": 1.4140625,
"learning_rate": 5.813718337169913e-05,
"loss": 4.7635,
"mean_token_accuracy": 0.23385855406522751,
"num_tokens": 21364351.0,
"step": 10380
},
{
"entropy": 5.570415019989014,
"epoch": 9.214824678206835,
"grad_norm": 1.2421875,
"learning_rate": 5.804563531961214e-05,
"loss": 4.8342,
"mean_token_accuracy": 0.2267597422003746,
"num_tokens": 21375546.0,
"step": 10385
},
{
"entropy": 5.575598859786988,
"epoch": 9.219263204616068,
"grad_norm": 1.28125,
"learning_rate": 5.79545957937322e-05,
"loss": 4.8416,
"mean_token_accuracy": 0.22186541706323623,
"num_tokens": 21386708.0,
"step": 10390
},
{
"entropy": 5.534681987762451,
"epoch": 9.223701731025299,
"grad_norm": 1.328125,
"learning_rate": 5.786406500744978e-05,
"loss": 4.7484,
"mean_token_accuracy": 0.23666498959064483,
"num_tokens": 21396467.0,
"step": 10395
},
{
"entropy": 5.517252731323242,
"epoch": 9.228140257434532,
"grad_norm": 1.3046875,
"learning_rate": 5.777404317296288e-05,
"loss": 4.7677,
"mean_token_accuracy": 0.22751708179712296,
"num_tokens": 21407185.0,
"step": 10400
},
{
"entropy": 5.549304580688476,
"epoch": 9.232578783843763,
"grad_norm": 1.40625,
"learning_rate": 5.768453050127642e-05,
"loss": 4.777,
"mean_token_accuracy": 0.23060714602470397,
"num_tokens": 21417114.0,
"step": 10405
},
{
"entropy": 5.502925872802734,
"epoch": 9.237017310252996,
"grad_norm": 1.421875,
"learning_rate": 5.759552720220212e-05,
"loss": 4.6924,
"mean_token_accuracy": 0.23594841063022615,
"num_tokens": 21426488.0,
"step": 10410
},
{
"entropy": 5.523327922821045,
"epoch": 9.241455836662228,
"grad_norm": 1.4375,
"learning_rate": 5.7507033484357536e-05,
"loss": 4.7576,
"mean_token_accuracy": 0.23241776674985887,
"num_tokens": 21436401.0,
"step": 10415
},
{
"entropy": 5.573087692260742,
"epoch": 9.24589436307146,
"grad_norm": 1.1796875,
"learning_rate": 5.741904955516594e-05,
"loss": 4.7938,
"mean_token_accuracy": 0.22876379638910294,
"num_tokens": 21446970.0,
"step": 10420
},
{
"entropy": 5.53557562828064,
"epoch": 9.250332889480692,
"grad_norm": 1.4765625,
"learning_rate": 5.733157562085565e-05,
"loss": 4.7005,
"mean_token_accuracy": 0.2426733359694481,
"num_tokens": 21456326.0,
"step": 10425
},
{
"entropy": 5.49278769493103,
"epoch": 9.254771415889925,
"grad_norm": 1.28125,
"learning_rate": 5.7244611886459526e-05,
"loss": 4.751,
"mean_token_accuracy": 0.23753970265388488,
"num_tokens": 21467037.0,
"step": 10430
},
{
"entropy": 5.529236125946045,
"epoch": 9.259209942299156,
"grad_norm": 1.3515625,
"learning_rate": 5.7158158555814715e-05,
"loss": 4.7326,
"mean_token_accuracy": 0.2357396140694618,
"num_tokens": 21477848.0,
"step": 10435
},
{
"entropy": 5.533825874328613,
"epoch": 9.26364846870839,
"grad_norm": 1.3046875,
"learning_rate": 5.707221583156189e-05,
"loss": 4.6977,
"mean_token_accuracy": 0.23852810263633728,
"num_tokens": 21487436.0,
"step": 10440
},
{
"entropy": 5.498164701461792,
"epoch": 9.26808699511762,
"grad_norm": 1.46875,
"learning_rate": 5.6986783915144874e-05,
"loss": 4.7903,
"mean_token_accuracy": 0.2346888765692711,
"num_tokens": 21497426.0,
"step": 10445
},
{
"entropy": 5.5170801162719725,
"epoch": 9.272525521526854,
"grad_norm": 1.3125,
"learning_rate": 5.6901863006810345e-05,
"loss": 4.7483,
"mean_token_accuracy": 0.23494856357574462,
"num_tokens": 21508016.0,
"step": 10450
},
{
"entropy": 5.579160499572754,
"epoch": 9.276964047936085,
"grad_norm": 1.4140625,
"learning_rate": 5.681745330560695e-05,
"loss": 4.7483,
"mean_token_accuracy": 0.2311336189508438,
"num_tokens": 21518007.0,
"step": 10455
},
{
"entropy": 5.473288440704346,
"epoch": 9.281402574345318,
"grad_norm": 1.2890625,
"learning_rate": 5.673355500938542e-05,
"loss": 4.6716,
"mean_token_accuracy": 0.24184043258428572,
"num_tokens": 21528297.0,
"step": 10460
},
{
"entropy": 5.5097767353057865,
"epoch": 9.28584110075455,
"grad_norm": 1.484375,
"learning_rate": 5.665016831479755e-05,
"loss": 4.7808,
"mean_token_accuracy": 0.23172836005687714,
"num_tokens": 21538629.0,
"step": 10465
},
{
"entropy": 5.544354629516602,
"epoch": 9.290279627163782,
"grad_norm": 1.3046875,
"learning_rate": 5.6567293417296044e-05,
"loss": 4.7287,
"mean_token_accuracy": 0.23352448046207427,
"num_tokens": 21548653.0,
"step": 10470
},
{
"entropy": 5.55192003250122,
"epoch": 9.294718153573013,
"grad_norm": 1.2890625,
"learning_rate": 5.648493051113404e-05,
"loss": 4.7572,
"mean_token_accuracy": 0.2304514929652214,
"num_tokens": 21558879.0,
"step": 10475
},
{
"entropy": 5.5208516120910645,
"epoch": 9.299156679982246,
"grad_norm": 1.390625,
"learning_rate": 5.640307978936455e-05,
"loss": 4.7478,
"mean_token_accuracy": 0.23311531841754912,
"num_tokens": 21569632.0,
"step": 10480
},
{
"entropy": 5.519157600402832,
"epoch": 9.303595206391478,
"grad_norm": 1.34375,
"learning_rate": 5.6321741443840045e-05,
"loss": 4.8104,
"mean_token_accuracy": 0.229851695895195,
"num_tokens": 21580060.0,
"step": 10485
},
{
"entropy": 5.4952771186828615,
"epoch": 9.30803373280071,
"grad_norm": 1.609375,
"learning_rate": 5.624091566521212e-05,
"loss": 4.6914,
"mean_token_accuracy": 0.23929717689752578,
"num_tokens": 21590599.0,
"step": 10490
},
{
"entropy": 5.4924314498901365,
"epoch": 9.312472259209942,
"grad_norm": 1.3984375,
"learning_rate": 5.6160602642930795e-05,
"loss": 4.7581,
"mean_token_accuracy": 0.23954855650663376,
"num_tokens": 21601282.0,
"step": 10495
},
{
"entropy": 5.528427267074585,
"epoch": 9.316910785619175,
"grad_norm": 1.453125,
"learning_rate": 5.608080256524435e-05,
"loss": 4.818,
"mean_token_accuracy": 0.2251923844218254,
"num_tokens": 21610985.0,
"step": 10500
},
{
"epoch": 9.316910785619175,
"eval_entropy": 5.419428169585747,
"eval_loss": 5.847888946533203,
"eval_mean_token_accuracy": 0.1743175589663116,
"eval_num_tokens": 21610985.0,
"eval_runtime": 2.6929,
"eval_samples_per_second": 1250.345,
"eval_steps_per_second": 156.34,
"step": 10500
},
{
"entropy": 5.5016770362854,
"epoch": 9.321349312028406,
"grad_norm": 1.3515625,
"learning_rate": 5.6001515619198706e-05,
"loss": 4.6683,
"mean_token_accuracy": 0.2469113975763321,
"num_tokens": 21620474.0,
"step": 10505
},
{
"entropy": 5.524845790863037,
"epoch": 9.32578783843764,
"grad_norm": 1.4453125,
"learning_rate": 5.5922741990637034e-05,
"loss": 4.7427,
"mean_token_accuracy": 0.23655041605234145,
"num_tokens": 21630490.0,
"step": 10510
},
{
"entropy": 5.520772218704224,
"epoch": 9.33022636484687,
"grad_norm": 1.3203125,
"learning_rate": 5.584448186419936e-05,
"loss": 4.7114,
"mean_token_accuracy": 0.2330810993909836,
"num_tokens": 21640514.0,
"step": 10515
},
{
"entropy": 5.4947509765625,
"epoch": 9.334664891256104,
"grad_norm": 1.328125,
"learning_rate": 5.57667354233221e-05,
"loss": 4.7131,
"mean_token_accuracy": 0.23879799842834473,
"num_tokens": 21651443.0,
"step": 10520
},
{
"entropy": 5.499390649795532,
"epoch": 9.339103417665335,
"grad_norm": 1.3828125,
"learning_rate": 5.5689502850237505e-05,
"loss": 4.7222,
"mean_token_accuracy": 0.22914037257432937,
"num_tokens": 21661031.0,
"step": 10525
},
{
"entropy": 5.478826856613159,
"epoch": 9.343541944074568,
"grad_norm": 1.359375,
"learning_rate": 5.561278432597357e-05,
"loss": 4.7479,
"mean_token_accuracy": 0.2353922799229622,
"num_tokens": 21671418.0,
"step": 10530
},
{
"entropy": 5.51774263381958,
"epoch": 9.3479804704838,
"grad_norm": 1.375,
"learning_rate": 5.5536580030353146e-05,
"loss": 4.6873,
"mean_token_accuracy": 0.24156455546617508,
"num_tokens": 21681306.0,
"step": 10535
},
{
"entropy": 5.502202892303467,
"epoch": 9.352418996893032,
"grad_norm": 1.390625,
"learning_rate": 5.546089014199402e-05,
"loss": 4.6692,
"mean_token_accuracy": 0.24276307970285416,
"num_tokens": 21691061.0,
"step": 10540
},
{
"entropy": 5.535330724716187,
"epoch": 9.356857523302264,
"grad_norm": 1.375,
"learning_rate": 5.538571483830803e-05,
"loss": 4.7857,
"mean_token_accuracy": 0.23262048214673997,
"num_tokens": 21701268.0,
"step": 10545
},
{
"entropy": 5.502979135513305,
"epoch": 9.361296049711497,
"grad_norm": 1.3984375,
"learning_rate": 5.531105429550097e-05,
"loss": 4.7223,
"mean_token_accuracy": 0.2445885419845581,
"num_tokens": 21711619.0,
"step": 10550
},
{
"entropy": 5.521427774429322,
"epoch": 9.365734576120728,
"grad_norm": 1.40625,
"learning_rate": 5.523690868857207e-05,
"loss": 4.7622,
"mean_token_accuracy": 0.23147758543491365,
"num_tokens": 21721736.0,
"step": 10555
},
{
"entropy": 5.514032459259033,
"epoch": 9.37017310252996,
"grad_norm": 1.3515625,
"learning_rate": 5.5163278191313566e-05,
"loss": 4.6818,
"mean_token_accuracy": 0.2355811908841133,
"num_tokens": 21732668.0,
"step": 10560
},
{
"entropy": 5.455507040023804,
"epoch": 9.374611628939192,
"grad_norm": 1.265625,
"learning_rate": 5.509016297631029e-05,
"loss": 4.7194,
"mean_token_accuracy": 0.23581882566213608,
"num_tokens": 21743329.0,
"step": 10565
},
{
"entropy": 5.512049722671509,
"epoch": 9.379050155348425,
"grad_norm": 1.28125,
"learning_rate": 5.501756321493936e-05,
"loss": 4.7209,
"mean_token_accuracy": 0.2416471377015114,
"num_tokens": 21753017.0,
"step": 10570
},
{
"entropy": 5.508881616592407,
"epoch": 9.383488681757656,
"grad_norm": 1.3203125,
"learning_rate": 5.4945479077369575e-05,
"loss": 4.7146,
"mean_token_accuracy": 0.23627785444259644,
"num_tokens": 21762947.0,
"step": 10575
},
{
"entropy": 5.5192783832550045,
"epoch": 9.38792720816689,
"grad_norm": 1.2890625,
"learning_rate": 5.4873910732561314e-05,
"loss": 4.6935,
"mean_token_accuracy": 0.24248596131801606,
"num_tokens": 21772286.0,
"step": 10580
},
{
"entropy": 5.506292629241943,
"epoch": 9.39236573457612,
"grad_norm": 1.3671875,
"learning_rate": 5.480285834826585e-05,
"loss": 4.7391,
"mean_token_accuracy": 0.23417745530605316,
"num_tokens": 21782500.0,
"step": 10585
},
{
"entropy": 5.508247423171997,
"epoch": 9.396804260985354,
"grad_norm": 1.1328125,
"learning_rate": 5.473232209102508e-05,
"loss": 4.7024,
"mean_token_accuracy": 0.23573141694068908,
"num_tokens": 21793607.0,
"step": 10590
},
{
"entropy": 5.507767200469971,
"epoch": 9.401242787394585,
"grad_norm": 1.265625,
"learning_rate": 5.466230212617122e-05,
"loss": 4.7729,
"mean_token_accuracy": 0.2350640118122101,
"num_tokens": 21803142.0,
"step": 10595
},
{
"entropy": 5.545652723312378,
"epoch": 9.405681313803818,
"grad_norm": 1.2421875,
"learning_rate": 5.4592798617826284e-05,
"loss": 4.7617,
"mean_token_accuracy": 0.22767950147390364,
"num_tokens": 21813306.0,
"step": 10600
},
{
"entropy": 5.548501110076904,
"epoch": 9.41011984021305,
"grad_norm": 1.1640625,
"learning_rate": 5.4523811728901705e-05,
"loss": 4.7963,
"mean_token_accuracy": 0.23139353692531586,
"num_tokens": 21825475.0,
"step": 10605
},
{
"entropy": 5.5257996082305905,
"epoch": 9.41455836662228,
"grad_norm": 1.4375,
"learning_rate": 5.4455341621098095e-05,
"loss": 4.7726,
"mean_token_accuracy": 0.2345852345228195,
"num_tokens": 21835961.0,
"step": 10610
},
{
"entropy": 5.480703592300415,
"epoch": 9.418996893031514,
"grad_norm": 1.34375,
"learning_rate": 5.4387388454904656e-05,
"loss": 4.7474,
"mean_token_accuracy": 0.2366489738225937,
"num_tokens": 21846335.0,
"step": 10615
},
{
"entropy": 5.555735969543457,
"epoch": 9.423435419440747,
"grad_norm": 1.3359375,
"learning_rate": 5.4319952389599e-05,
"loss": 4.7494,
"mean_token_accuracy": 0.2322918102145195,
"num_tokens": 21856710.0,
"step": 10620
},
{
"entropy": 5.485498428344727,
"epoch": 9.427873945849978,
"grad_norm": 1.328125,
"learning_rate": 5.4253033583246675e-05,
"loss": 4.6956,
"mean_token_accuracy": 0.23784482032060622,
"num_tokens": 21867163.0,
"step": 10625
},
{
"entropy": 5.55334701538086,
"epoch": 9.432312472259209,
"grad_norm": 1.359375,
"learning_rate": 5.418663219270069e-05,
"loss": 4.8139,
"mean_token_accuracy": 0.22621923834085464,
"num_tokens": 21877798.0,
"step": 10630
},
{
"entropy": 5.560311126708984,
"epoch": 9.436750998668442,
"grad_norm": 1.3828125,
"learning_rate": 5.412074837360148e-05,
"loss": 4.7084,
"mean_token_accuracy": 0.23012179881334305,
"num_tokens": 21887494.0,
"step": 10635
},
{
"entropy": 5.539159822463989,
"epoch": 9.441189525077673,
"grad_norm": 1.3359375,
"learning_rate": 5.4055382280376195e-05,
"loss": 4.7469,
"mean_token_accuracy": 0.22999259680509568,
"num_tokens": 21897591.0,
"step": 10640
},
{
"entropy": 5.5591175079345705,
"epoch": 9.445628051486906,
"grad_norm": 1.3515625,
"learning_rate": 5.399053406623843e-05,
"loss": 4.8257,
"mean_token_accuracy": 0.2316971465945244,
"num_tokens": 21908541.0,
"step": 10645
},
{
"entropy": 5.4922950744628904,
"epoch": 9.450066577896138,
"grad_norm": 1.3203125,
"learning_rate": 5.392620388318803e-05,
"loss": 4.7475,
"mean_token_accuracy": 0.23347120434045793,
"num_tokens": 21919141.0,
"step": 10650
},
{
"entropy": 5.53553466796875,
"epoch": 9.45450510430537,
"grad_norm": 1.3515625,
"learning_rate": 5.386239188201052e-05,
"loss": 4.7299,
"mean_token_accuracy": 0.23639290332794188,
"num_tokens": 21928572.0,
"step": 10655
},
{
"entropy": 5.488956260681152,
"epoch": 9.458943630714602,
"grad_norm": 1.3515625,
"learning_rate": 5.379909821227688e-05,
"loss": 4.6419,
"mean_token_accuracy": 0.24516819715499877,
"num_tokens": 21939133.0,
"step": 10660
},
{
"entropy": 5.513172197341919,
"epoch": 9.463382157123835,
"grad_norm": 1.359375,
"learning_rate": 5.373632302234314e-05,
"loss": 4.7473,
"mean_token_accuracy": 0.22820065617561341,
"num_tokens": 21949597.0,
"step": 10665
},
{
"entropy": 5.565381479263306,
"epoch": 9.467820683533066,
"grad_norm": 1.390625,
"learning_rate": 5.3674066459350035e-05,
"loss": 4.8299,
"mean_token_accuracy": 0.2283849760890007,
"num_tokens": 21959425.0,
"step": 10670
},
{
"entropy": 5.540665531158448,
"epoch": 9.4722592099423,
"grad_norm": 1.3125,
"learning_rate": 5.3612328669222746e-05,
"loss": 4.7275,
"mean_token_accuracy": 0.24266316145658492,
"num_tokens": 21969689.0,
"step": 10675
},
{
"entropy": 5.460536527633667,
"epoch": 9.47669773635153,
"grad_norm": 1.453125,
"learning_rate": 5.3551109796670416e-05,
"loss": 4.6673,
"mean_token_accuracy": 0.23671979010105132,
"num_tokens": 21978941.0,
"step": 10680
},
{
"entropy": 5.514604759216309,
"epoch": 9.481136262760764,
"grad_norm": 1.359375,
"learning_rate": 5.349040998518589e-05,
"loss": 4.752,
"mean_token_accuracy": 0.22982103675603865,
"num_tokens": 21989523.0,
"step": 10685
},
{
"entropy": 5.4690742015838625,
"epoch": 9.485574789169995,
"grad_norm": 1.3828125,
"learning_rate": 5.34302293770454e-05,
"loss": 4.6288,
"mean_token_accuracy": 0.24490970224142075,
"num_tokens": 21999865.0,
"step": 10690
},
{
"entropy": 5.489066314697266,
"epoch": 9.490013315579228,
"grad_norm": 1.25,
"learning_rate": 5.337056811330812e-05,
"loss": 4.6863,
"mean_token_accuracy": 0.2407575234770775,
"num_tokens": 22010037.0,
"step": 10695
},
{
"entropy": 5.504932117462158,
"epoch": 9.49445184198846,
"grad_norm": 1.234375,
"learning_rate": 5.331142633381604e-05,
"loss": 4.7789,
"mean_token_accuracy": 0.2295147269964218,
"num_tokens": 22020754.0,
"step": 10700
},
{
"entropy": 5.480744981765747,
"epoch": 9.498890368397692,
"grad_norm": 1.328125,
"learning_rate": 5.3252804177193415e-05,
"loss": 4.7418,
"mean_token_accuracy": 0.23348432779312134,
"num_tokens": 22032246.0,
"step": 10705
},
{
"entropy": 5.499876260757446,
"epoch": 9.503328894806923,
"grad_norm": 1.265625,
"learning_rate": 5.319470178084658e-05,
"loss": 4.7087,
"mean_token_accuracy": 0.23370147198438646,
"num_tokens": 22042080.0,
"step": 10710
},
{
"entropy": 5.539479732513428,
"epoch": 9.507767421216156,
"grad_norm": 1.28125,
"learning_rate": 5.31371192809636e-05,
"loss": 4.8116,
"mean_token_accuracy": 0.22858900278806688,
"num_tokens": 22052268.0,
"step": 10715
},
{
"entropy": 5.50176362991333,
"epoch": 9.512205947625388,
"grad_norm": 1.15625,
"learning_rate": 5.308005681251392e-05,
"loss": 4.7418,
"mean_token_accuracy": 0.2326953664422035,
"num_tokens": 22062610.0,
"step": 10720
},
{
"entropy": 5.505497884750366,
"epoch": 9.51664447403462,
"grad_norm": 1.3359375,
"learning_rate": 5.302351450924803e-05,
"loss": 4.7428,
"mean_token_accuracy": 0.23610890358686448,
"num_tokens": 22072689.0,
"step": 10725
},
{
"entropy": 5.478803396224976,
"epoch": 9.521083000443852,
"grad_norm": 1.4296875,
"learning_rate": 5.2967492503697285e-05,
"loss": 4.7541,
"mean_token_accuracy": 0.23917314410209656,
"num_tokens": 22082559.0,
"step": 10730
},
{
"entropy": 5.4752954006195065,
"epoch": 9.525521526853085,
"grad_norm": 1.2890625,
"learning_rate": 5.291199092717338e-05,
"loss": 4.7296,
"mean_token_accuracy": 0.23478154093027115,
"num_tokens": 22093122.0,
"step": 10735
},
{
"entropy": 5.556293487548828,
"epoch": 9.529960053262316,
"grad_norm": 1.375,
"learning_rate": 5.285700990976824e-05,
"loss": 4.8035,
"mean_token_accuracy": 0.22990306317806244,
"num_tokens": 22103060.0,
"step": 10740
},
{
"entropy": 5.51897611618042,
"epoch": 9.53439857967155,
"grad_norm": 1.2890625,
"learning_rate": 5.2802549580353625e-05,
"loss": 4.7009,
"mean_token_accuracy": 0.23711079806089402,
"num_tokens": 22112961.0,
"step": 10745
},
{
"entropy": 5.514896249771118,
"epoch": 9.53883710608078,
"grad_norm": 1.2734375,
"learning_rate": 5.27486100665808e-05,
"loss": 4.7851,
"mean_token_accuracy": 0.23470329046249389,
"num_tokens": 22123439.0,
"step": 10750
},
{
"entropy": 5.474027538299561,
"epoch": 9.543275632490014,
"grad_norm": 1.421875,
"learning_rate": 5.2695191494880347e-05,
"loss": 4.63,
"mean_token_accuracy": 0.24945397078990936,
"num_tokens": 22133547.0,
"step": 10755
},
{
"entropy": 5.526610565185547,
"epoch": 9.547714158899245,
"grad_norm": 1.328125,
"learning_rate": 5.26422939904617e-05,
"loss": 4.7426,
"mean_token_accuracy": 0.23535797595977784,
"num_tokens": 22143126.0,
"step": 10760
},
{
"entropy": 5.508662176132202,
"epoch": 9.552152685308478,
"grad_norm": 1.3984375,
"learning_rate": 5.258991767731302e-05,
"loss": 4.7942,
"mean_token_accuracy": 0.23052098900079726,
"num_tokens": 22152964.0,
"step": 10765
},
{
"entropy": 5.477191162109375,
"epoch": 9.55659121171771,
"grad_norm": 1.3203125,
"learning_rate": 5.2538062678200796e-05,
"loss": 4.6423,
"mean_token_accuracy": 0.24248867183923722,
"num_tokens": 22162525.0,
"step": 10770
},
{
"entropy": 5.443877410888672,
"epoch": 9.561029738126942,
"grad_norm": 1.3125,
"learning_rate": 5.248672911466959e-05,
"loss": 4.7023,
"mean_token_accuracy": 0.24046212881803514,
"num_tokens": 22172469.0,
"step": 10775
},
{
"entropy": 5.491368246078491,
"epoch": 9.565468264536173,
"grad_norm": 1.2578125,
"learning_rate": 5.243591710704181e-05,
"loss": 4.6846,
"mean_token_accuracy": 0.23607354164123534,
"num_tokens": 22182192.0,
"step": 10780
},
{
"entropy": 5.52177848815918,
"epoch": 9.569906790945407,
"grad_norm": 1.328125,
"learning_rate": 5.238562677441731e-05,
"loss": 4.7934,
"mean_token_accuracy": 0.2285286083817482,
"num_tokens": 22193450.0,
"step": 10785
},
{
"entropy": 5.534942245483398,
"epoch": 9.574345317354638,
"grad_norm": 1.203125,
"learning_rate": 5.233585823467314e-05,
"loss": 4.7625,
"mean_token_accuracy": 0.2347737431526184,
"num_tokens": 22204260.0,
"step": 10790
},
{
"entropy": 5.5311225891113285,
"epoch": 9.57878384376387,
"grad_norm": 1.46875,
"learning_rate": 5.2286611604463445e-05,
"loss": 4.7542,
"mean_token_accuracy": 0.23239482194185257,
"num_tokens": 22214434.0,
"step": 10795
},
{
"entropy": 5.554865407943725,
"epoch": 9.583222370173102,
"grad_norm": 1.3046875,
"learning_rate": 5.223788699921892e-05,
"loss": 4.8037,
"mean_token_accuracy": 0.22807635217905045,
"num_tokens": 22225727.0,
"step": 10800
},
{
"entropy": 5.491705369949341,
"epoch": 9.587660896582335,
"grad_norm": 1.3359375,
"learning_rate": 5.2189684533146676e-05,
"loss": 4.7016,
"mean_token_accuracy": 0.23985832333564758,
"num_tokens": 22235684.0,
"step": 10805
},
{
"entropy": 5.517684268951416,
"epoch": 9.592099422991566,
"grad_norm": 1.421875,
"learning_rate": 5.2142004319230076e-05,
"loss": 4.7256,
"mean_token_accuracy": 0.23059632033109664,
"num_tokens": 22245605.0,
"step": 10810
},
{
"entropy": 5.530982494354248,
"epoch": 9.5965379494008,
"grad_norm": 1.2578125,
"learning_rate": 5.209484646922822e-05,
"loss": 4.753,
"mean_token_accuracy": 0.2337806284427643,
"num_tokens": 22256533.0,
"step": 10815
},
{
"entropy": 5.583384561538696,
"epoch": 9.60097647581003,
"grad_norm": 1.4609375,
"learning_rate": 5.204821109367592e-05,
"loss": 4.8057,
"mean_token_accuracy": 0.2321531817317009,
"num_tokens": 22266410.0,
"step": 10820
},
{
"entropy": 5.526106929779052,
"epoch": 9.605415002219264,
"grad_norm": 1.2421875,
"learning_rate": 5.2002098301883284e-05,
"loss": 4.6591,
"mean_token_accuracy": 0.24043622016906738,
"num_tokens": 22277213.0,
"step": 10825
},
{
"entropy": 5.522353219985962,
"epoch": 9.609853528628495,
"grad_norm": 1.2890625,
"learning_rate": 5.195650820193557e-05,
"loss": 4.7007,
"mean_token_accuracy": 0.2435010552406311,
"num_tokens": 22287940.0,
"step": 10830
},
{
"entropy": 5.483122253417969,
"epoch": 9.614292055037728,
"grad_norm": 1.328125,
"learning_rate": 5.191144090069284e-05,
"loss": 4.7059,
"mean_token_accuracy": 0.2362801805138588,
"num_tokens": 22297795.0,
"step": 10835
},
{
"entropy": 5.50098762512207,
"epoch": 9.61873058144696,
"grad_norm": 1.3671875,
"learning_rate": 5.186689650378977e-05,
"loss": 4.739,
"mean_token_accuracy": 0.2345166802406311,
"num_tokens": 22308968.0,
"step": 10840
},
{
"entropy": 5.548341512680054,
"epoch": 9.623169107856192,
"grad_norm": 1.46875,
"learning_rate": 5.182287511563538e-05,
"loss": 4.817,
"mean_token_accuracy": 0.22238245010375976,
"num_tokens": 22319419.0,
"step": 10845
},
{
"entropy": 5.534679937362671,
"epoch": 9.627607634265424,
"grad_norm": 1.3359375,
"learning_rate": 5.177937683941284e-05,
"loss": 4.7233,
"mean_token_accuracy": 0.23924784660339354,
"num_tokens": 22329337.0,
"step": 10850
},
{
"entropy": 5.508337068557739,
"epoch": 9.632046160674657,
"grad_norm": 1.4140625,
"learning_rate": 5.173640177707909e-05,
"loss": 4.7351,
"mean_token_accuracy": 0.23659745156764983,
"num_tokens": 22340017.0,
"step": 10855
},
{
"entropy": 5.559932613372803,
"epoch": 9.636484687083888,
"grad_norm": 1.3984375,
"learning_rate": 5.169395002936473e-05,
"loss": 4.8363,
"mean_token_accuracy": 0.22920661121606828,
"num_tokens": 22350934.0,
"step": 10860
},
{
"entropy": 5.527348279953003,
"epoch": 9.64092321349312,
"grad_norm": 1.3515625,
"learning_rate": 5.165202169577381e-05,
"loss": 4.7271,
"mean_token_accuracy": 0.23838536739349364,
"num_tokens": 22362630.0,
"step": 10865
},
{
"entropy": 5.560224962234497,
"epoch": 9.645361739902352,
"grad_norm": 1.2109375,
"learning_rate": 5.1610616874583426e-05,
"loss": 4.8074,
"mean_token_accuracy": 0.22543988674879073,
"num_tokens": 22373415.0,
"step": 10870
},
{
"entropy": 5.545101833343506,
"epoch": 9.649800266311585,
"grad_norm": 1.453125,
"learning_rate": 5.156973566284366e-05,
"loss": 4.7222,
"mean_token_accuracy": 0.2396716445684433,
"num_tokens": 22382520.0,
"step": 10875
},
{
"entropy": 5.5496917247772215,
"epoch": 9.654238792720816,
"grad_norm": 1.3984375,
"learning_rate": 5.152937815637731e-05,
"loss": 4.7156,
"mean_token_accuracy": 0.23371366560459136,
"num_tokens": 22391939.0,
"step": 10880
},
{
"entropy": 5.542783117294311,
"epoch": 9.65867731913005,
"grad_norm": 1.3671875,
"learning_rate": 5.148954444977957e-05,
"loss": 4.7768,
"mean_token_accuracy": 0.23308333307504653,
"num_tokens": 22401545.0,
"step": 10885
},
{
"entropy": 5.489278841018677,
"epoch": 9.66311584553928,
"grad_norm": 1.421875,
"learning_rate": 5.145023463641798e-05,
"loss": 4.711,
"mean_token_accuracy": 0.23249289244413376,
"num_tokens": 22411801.0,
"step": 10890
},
{
"entropy": 5.5321601867675785,
"epoch": 9.667554371948514,
"grad_norm": 1.328125,
"learning_rate": 5.141144880843202e-05,
"loss": 4.7329,
"mean_token_accuracy": 0.2317222088575363,
"num_tokens": 22421148.0,
"step": 10895
},
{
"entropy": 5.5526872158050535,
"epoch": 9.671992898357745,
"grad_norm": 1.25,
"learning_rate": 5.137318705673301e-05,
"loss": 4.8139,
"mean_token_accuracy": 0.23268913924694062,
"num_tokens": 22431316.0,
"step": 10900
},
{
"entropy": 5.5185071468353275,
"epoch": 9.676431424766978,
"grad_norm": 1.328125,
"learning_rate": 5.133544947100392e-05,
"loss": 4.7469,
"mean_token_accuracy": 0.22927917689085006,
"num_tokens": 22441187.0,
"step": 10905
},
{
"entropy": 5.504330778121949,
"epoch": 9.68086995117621,
"grad_norm": 1.359375,
"learning_rate": 5.129823613969904e-05,
"loss": 4.7702,
"mean_token_accuracy": 0.22546374201774597,
"num_tokens": 22451692.0,
"step": 10910
},
{
"entropy": 5.531069040298462,
"epoch": 9.685308477585442,
"grad_norm": 1.3671875,
"learning_rate": 5.126154715004389e-05,
"loss": 4.7894,
"mean_token_accuracy": 0.2286270558834076,
"num_tokens": 22461879.0,
"step": 10915
},
{
"entropy": 5.511849117279053,
"epoch": 9.689747003994674,
"grad_norm": 1.4921875,
"learning_rate": 5.122538258803494e-05,
"loss": 4.7699,
"mean_token_accuracy": 0.23182130604982376,
"num_tokens": 22471065.0,
"step": 10920
},
{
"entropy": 5.5003458023071286,
"epoch": 9.694185530403907,
"grad_norm": 1.3125,
"learning_rate": 5.118974253843948e-05,
"loss": 4.735,
"mean_token_accuracy": 0.2367671713232994,
"num_tokens": 22481035.0,
"step": 10925
},
{
"entropy": 5.485413026809693,
"epoch": 9.698624056813138,
"grad_norm": 1.3359375,
"learning_rate": 5.115462708479533e-05,
"loss": 4.7223,
"mean_token_accuracy": 0.2364801675081253,
"num_tokens": 22491280.0,
"step": 10930
},
{
"entropy": 5.565241718292237,
"epoch": 9.703062583222371,
"grad_norm": 1.3671875,
"learning_rate": 5.112003630941073e-05,
"loss": 4.8391,
"mean_token_accuracy": 0.2284337267279625,
"num_tokens": 22502889.0,
"step": 10935
},
{
"entropy": 5.513417768478393,
"epoch": 9.707501109631602,
"grad_norm": 1.5078125,
"learning_rate": 5.108597029336407e-05,
"loss": 4.7693,
"mean_token_accuracy": 0.23704074770212175,
"num_tokens": 22512330.0,
"step": 10940
},
{
"entropy": 5.556479978561401,
"epoch": 9.711939636040835,
"grad_norm": 1.546875,
"learning_rate": 5.105242911650378e-05,
"loss": 4.7354,
"mean_token_accuracy": 0.23776071518659592,
"num_tokens": 22521661.0,
"step": 10945
},
{
"entropy": 5.547818660736084,
"epoch": 9.716378162450066,
"grad_norm": 1.265625,
"learning_rate": 5.1019412857448086e-05,
"loss": 4.7434,
"mean_token_accuracy": 0.23642710745334625,
"num_tokens": 22532955.0,
"step": 10950
},
{
"entropy": 5.4838722229003904,
"epoch": 9.7208166888593,
"grad_norm": 1.25,
"learning_rate": 5.098692159358484e-05,
"loss": 4.6964,
"mean_token_accuracy": 0.24216821938753127,
"num_tokens": 22543592.0,
"step": 10955
},
{
"entropy": 5.539860773086548,
"epoch": 9.72525521526853,
"grad_norm": 1.3828125,
"learning_rate": 5.095495540107134e-05,
"loss": 4.7977,
"mean_token_accuracy": 0.2334725245833397,
"num_tokens": 22553940.0,
"step": 10960
},
{
"entropy": 5.489623641967773,
"epoch": 9.729693741677764,
"grad_norm": 1.3828125,
"learning_rate": 5.092351435483418e-05,
"loss": 4.7931,
"mean_token_accuracy": 0.23527146875858307,
"num_tokens": 22564178.0,
"step": 10965
},
{
"entropy": 5.522753810882568,
"epoch": 9.734132268086995,
"grad_norm": 1.46875,
"learning_rate": 5.0892598528569006e-05,
"loss": 4.7103,
"mean_token_accuracy": 0.23342842757701873,
"num_tokens": 22574003.0,
"step": 10970
},
{
"entropy": 5.527922058105469,
"epoch": 9.738570794496226,
"grad_norm": 1.4296875,
"learning_rate": 5.086220799474039e-05,
"loss": 4.7705,
"mean_token_accuracy": 0.22883379757404326,
"num_tokens": 22584601.0,
"step": 10975
},
{
"entropy": 5.525746250152588,
"epoch": 9.74300932090546,
"grad_norm": 1.296875,
"learning_rate": 5.083234282458168e-05,
"loss": 4.7666,
"mean_token_accuracy": 0.2240194410085678,
"num_tokens": 22594446.0,
"step": 10980
},
{
"entropy": 5.523791551589966,
"epoch": 9.747447847314692,
"grad_norm": 1.3125,
"learning_rate": 5.0803003088094824e-05,
"loss": 4.6935,
"mean_token_accuracy": 0.23732226192951203,
"num_tokens": 22604879.0,
"step": 10985
},
{
"entropy": 5.53860559463501,
"epoch": 9.751886373723924,
"grad_norm": 1.3828125,
"learning_rate": 5.07741888540501e-05,
"loss": 4.8039,
"mean_token_accuracy": 0.23498346656560898,
"num_tokens": 22615476.0,
"step": 10990
},
{
"entropy": 5.502054500579834,
"epoch": 9.756324900133155,
"grad_norm": 1.328125,
"learning_rate": 5.074590018998614e-05,
"loss": 4.7441,
"mean_token_accuracy": 0.23609272688627242,
"num_tokens": 22625664.0,
"step": 10995
},
{
"entropy": 5.49818787574768,
"epoch": 9.760763426542388,
"grad_norm": 1.375,
"learning_rate": 5.0718137162209655e-05,
"loss": 4.7559,
"mean_token_accuracy": 0.23424861580133438,
"num_tokens": 22637544.0,
"step": 11000
},
{
"epoch": 9.760763426542388,
"eval_entropy": 5.412094886399221,
"eval_loss": 5.845874309539795,
"eval_mean_token_accuracy": 0.17460828700994369,
"eval_num_tokens": 22637544.0,
"eval_runtime": 2.8491,
"eval_samples_per_second": 1181.788,
"eval_steps_per_second": 147.767,
"step": 11000
}
],
"logging_steps": 5,
"max_steps": 11260,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.4349774079744e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}