Files
hin-deva-10mb-ppt-Dp-10mb_s…/checkpoint-3000/trainer_state.json

6035 lines
164 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.19288883173664245,
"eval_steps": 500,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742568206787109,
"epoch": 0.00032148138622773744,
"grad_norm": 4.65625,
"learning_rate": 2e-06,
"loss": 10.8036,
"mean_token_accuracy": 0.0,
"num_tokens": 12742.0,
"step": 5
},
{
"entropy": 10.742579936981201,
"epoch": 0.0006429627724554749,
"grad_norm": 4.53125,
"learning_rate": 4.5e-06,
"loss": 10.7869,
"mean_token_accuracy": 0.0002144496247638017,
"num_tokens": 24140.0,
"step": 10
},
{
"entropy": 10.742603588104249,
"epoch": 0.0009644441586832123,
"grad_norm": 4.90625,
"learning_rate": 7e-06,
"loss": 10.7587,
"mean_token_accuracy": 0.00010395010467618704,
"num_tokens": 35301.0,
"step": 15
},
{
"entropy": 10.742618370056153,
"epoch": 0.0012859255449109497,
"grad_norm": 4.84375,
"learning_rate": 9.5e-06,
"loss": 10.7259,
"mean_token_accuracy": 8.291873964481056e-05,
"num_tokens": 47594.0,
"step": 20
},
{
"entropy": 10.742617893218995,
"epoch": 0.001607406931138687,
"grad_norm": 4.5,
"learning_rate": 1.2e-05,
"loss": 10.6444,
"mean_token_accuracy": 0.0009544001193717122,
"num_tokens": 60157.0,
"step": 25
},
{
"entropy": 10.742464923858643,
"epoch": 0.0019288883173664245,
"grad_norm": 3.90625,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.5219,
"mean_token_accuracy": 0.008633292093873025,
"num_tokens": 71681.0,
"step": 30
},
{
"entropy": 10.741884708404541,
"epoch": 0.002250369703594162,
"grad_norm": 3.015625,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.4068,
"mean_token_accuracy": 0.022283684648573398,
"num_tokens": 84059.0,
"step": 35
},
{
"entropy": 10.740736961364746,
"epoch": 0.0025718510898218995,
"grad_norm": 2.53125,
"learning_rate": 1.95e-05,
"loss": 10.2636,
"mean_token_accuracy": 0.029509490355849266,
"num_tokens": 95765.0,
"step": 40
},
{
"entropy": 10.739063930511474,
"epoch": 0.0028933324760496365,
"grad_norm": 2.140625,
"learning_rate": 2.2e-05,
"loss": 10.1737,
"mean_token_accuracy": 0.033080863580107686,
"num_tokens": 108095.0,
"step": 45
},
{
"entropy": 10.738058280944824,
"epoch": 0.003214813862277374,
"grad_norm": 2.078125,
"learning_rate": 2.4500000000000003e-05,
"loss": 10.0966,
"mean_token_accuracy": 0.03380006831139326,
"num_tokens": 120722.0,
"step": 50
},
{
"entropy": 10.73799819946289,
"epoch": 0.0035362952485051115,
"grad_norm": 1.9921875,
"learning_rate": 2.7e-05,
"loss": 10.006,
"mean_token_accuracy": 0.03798699378967285,
"num_tokens": 132684.0,
"step": 55
},
{
"entropy": 10.73742036819458,
"epoch": 0.003857776634732849,
"grad_norm": 1.90625,
"learning_rate": 2.95e-05,
"loss": 9.9558,
"mean_token_accuracy": 0.03450928349047899,
"num_tokens": 143940.0,
"step": 60
},
{
"entropy": 10.736388874053954,
"epoch": 0.0041792580209605865,
"grad_norm": 1.796875,
"learning_rate": 3.2e-05,
"loss": 9.9101,
"mean_token_accuracy": 0.04125991053879261,
"num_tokens": 156206.0,
"step": 65
},
{
"entropy": 10.73477258682251,
"epoch": 0.004500739407188324,
"grad_norm": 1.8359375,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.7902,
"mean_token_accuracy": 0.03981789126992226,
"num_tokens": 167417.0,
"step": 70
},
{
"entropy": 10.732693958282471,
"epoch": 0.0048222207934160615,
"grad_norm": 1.8125,
"learning_rate": 3.7e-05,
"loss": 9.7708,
"mean_token_accuracy": 0.04258622564375401,
"num_tokens": 180372.0,
"step": 75
},
{
"entropy": 10.729571533203124,
"epoch": 0.005143702179643799,
"grad_norm": 1.90625,
"learning_rate": 3.95e-05,
"loss": 9.6547,
"mean_token_accuracy": 0.045089634135365486,
"num_tokens": 191614.0,
"step": 80
},
{
"entropy": 10.72476511001587,
"epoch": 0.0054651835658715365,
"grad_norm": 1.796875,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.6147,
"mean_token_accuracy": 0.040345224365592,
"num_tokens": 202885.0,
"step": 85
},
{
"entropy": 10.71826524734497,
"epoch": 0.005786664952099273,
"grad_norm": 1.7421875,
"learning_rate": 4.45e-05,
"loss": 9.5588,
"mean_token_accuracy": 0.0393321730196476,
"num_tokens": 215099.0,
"step": 90
},
{
"entropy": 10.710640907287598,
"epoch": 0.0061081463383270106,
"grad_norm": 1.7734375,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.4198,
"mean_token_accuracy": 0.042821163311600685,
"num_tokens": 227257.0,
"step": 95
},
{
"entropy": 10.7003662109375,
"epoch": 0.006429627724554748,
"grad_norm": 1.796875,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.3598,
"mean_token_accuracy": 0.046982531622052195,
"num_tokens": 240338.0,
"step": 100
},
{
"entropy": 10.68521671295166,
"epoch": 0.0067511091107824855,
"grad_norm": 1.8203125,
"learning_rate": 5.2e-05,
"loss": 9.2122,
"mean_token_accuracy": 0.0441419318318367,
"num_tokens": 251438.0,
"step": 105
},
{
"entropy": 10.664322471618652,
"epoch": 0.007072590497010223,
"grad_norm": 1.78125,
"learning_rate": 5.45e-05,
"loss": 9.1438,
"mean_token_accuracy": 0.050481327995657924,
"num_tokens": 264614.0,
"step": 110
},
{
"entropy": 10.634937763214111,
"epoch": 0.0073940718832379605,
"grad_norm": 1.75,
"learning_rate": 5.7e-05,
"loss": 9.0251,
"mean_token_accuracy": 0.049148940667510035,
"num_tokens": 278360.0,
"step": 115
},
{
"entropy": 10.593732261657715,
"epoch": 0.007715553269465698,
"grad_norm": 1.6171875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.9153,
"mean_token_accuracy": 0.05156457796692848,
"num_tokens": 290884.0,
"step": 120
},
{
"entropy": 10.54275369644165,
"epoch": 0.008037034655693436,
"grad_norm": 1.6484375,
"learning_rate": 6.2e-05,
"loss": 8.8351,
"mean_token_accuracy": 0.052396486327052114,
"num_tokens": 304431.0,
"step": 125
},
{
"entropy": 10.474855613708495,
"epoch": 0.008358516041921173,
"grad_norm": 1.6796875,
"learning_rate": 6.450000000000001e-05,
"loss": 8.6397,
"mean_token_accuracy": 0.05697291418910026,
"num_tokens": 317555.0,
"step": 130
},
{
"entropy": 10.39169454574585,
"epoch": 0.00867999742814891,
"grad_norm": 1.59375,
"learning_rate": 6.7e-05,
"loss": 8.4698,
"mean_token_accuracy": 0.058742289617657664,
"num_tokens": 329754.0,
"step": 135
},
{
"entropy": 10.3007230758667,
"epoch": 0.009001478814376648,
"grad_norm": 1.4296875,
"learning_rate": 6.950000000000001e-05,
"loss": 8.3392,
"mean_token_accuracy": 0.07013382948935032,
"num_tokens": 341808.0,
"step": 140
},
{
"entropy": 10.171103858947754,
"epoch": 0.009322960200604385,
"grad_norm": 1.4609375,
"learning_rate": 7.2e-05,
"loss": 8.1587,
"mean_token_accuracy": 0.06642449870705605,
"num_tokens": 353209.0,
"step": 145
},
{
"entropy": 10.069665241241456,
"epoch": 0.009644441586832123,
"grad_norm": 1.2734375,
"learning_rate": 7.45e-05,
"loss": 8.1634,
"mean_token_accuracy": 0.06020556911826134,
"num_tokens": 365744.0,
"step": 150
},
{
"entropy": 9.936939144134522,
"epoch": 0.00996592297305986,
"grad_norm": 1.3828125,
"learning_rate": 7.7e-05,
"loss": 8.0462,
"mean_token_accuracy": 0.06147486455738545,
"num_tokens": 379133.0,
"step": 155
},
{
"entropy": 9.757997035980225,
"epoch": 0.010287404359287598,
"grad_norm": 1.203125,
"learning_rate": 7.950000000000001e-05,
"loss": 7.9266,
"mean_token_accuracy": 0.06376843340694904,
"num_tokens": 390921.0,
"step": 160
},
{
"entropy": 9.523485374450683,
"epoch": 0.010608885745515335,
"grad_norm": 1.3125,
"learning_rate": 8.2e-05,
"loss": 7.8396,
"mean_token_accuracy": 0.07127328738570213,
"num_tokens": 404468.0,
"step": 165
},
{
"entropy": 9.345615196228028,
"epoch": 0.010930367131743073,
"grad_norm": 1.21875,
"learning_rate": 8.450000000000001e-05,
"loss": 7.6793,
"mean_token_accuracy": 0.07266218103468418,
"num_tokens": 414790.0,
"step": 170
},
{
"entropy": 9.119754123687745,
"epoch": 0.011251848517970809,
"grad_norm": 1.1953125,
"learning_rate": 8.7e-05,
"loss": 7.6479,
"mean_token_accuracy": 0.06817427426576614,
"num_tokens": 427720.0,
"step": 175
},
{
"entropy": 8.906557750701904,
"epoch": 0.011573329904198546,
"grad_norm": 0.91015625,
"learning_rate": 8.95e-05,
"loss": 7.5546,
"mean_token_accuracy": 0.07729550525546074,
"num_tokens": 438501.0,
"step": 180
},
{
"entropy": 8.68680248260498,
"epoch": 0.011894811290426284,
"grad_norm": 0.96484375,
"learning_rate": 9.2e-05,
"loss": 7.5063,
"mean_token_accuracy": 0.07282244712114334,
"num_tokens": 450035.0,
"step": 185
},
{
"entropy": 8.589659690856934,
"epoch": 0.012216292676654021,
"grad_norm": 1.1796875,
"learning_rate": 9.45e-05,
"loss": 7.4857,
"mean_token_accuracy": 0.0773538451641798,
"num_tokens": 461665.0,
"step": 190
},
{
"entropy": 8.466110229492188,
"epoch": 0.012537774062881759,
"grad_norm": 1.34375,
"learning_rate": 9.7e-05,
"loss": 7.407,
"mean_token_accuracy": 0.07190582565963269,
"num_tokens": 472514.0,
"step": 195
},
{
"entropy": 8.35852632522583,
"epoch": 0.012859255449109496,
"grad_norm": 0.9453125,
"learning_rate": 9.95e-05,
"loss": 7.469,
"mean_token_accuracy": 0.07612953037023544,
"num_tokens": 484057.0,
"step": 200
},
{
"entropy": 8.286659240722656,
"epoch": 0.013180736835337234,
"grad_norm": 1.1640625,
"learning_rate": 0.000102,
"loss": 7.2817,
"mean_token_accuracy": 0.07883379608392715,
"num_tokens": 496374.0,
"step": 205
},
{
"entropy": 8.222426700592042,
"epoch": 0.013502218221564971,
"grad_norm": 1.1875,
"learning_rate": 0.00010449999999999999,
"loss": 7.4006,
"mean_token_accuracy": 0.08155124634504318,
"num_tokens": 508816.0,
"step": 210
},
{
"entropy": 8.164955520629883,
"epoch": 0.013823699607792709,
"grad_norm": 1.1875,
"learning_rate": 0.000107,
"loss": 7.2353,
"mean_token_accuracy": 0.08206439130008221,
"num_tokens": 520738.0,
"step": 215
},
{
"entropy": 8.113754081726075,
"epoch": 0.014145180994020446,
"grad_norm": 0.98828125,
"learning_rate": 0.0001095,
"loss": 7.1869,
"mean_token_accuracy": 0.08583443649113179,
"num_tokens": 531924.0,
"step": 220
},
{
"entropy": 8.066366481781007,
"epoch": 0.014466662380248184,
"grad_norm": 0.96875,
"learning_rate": 0.000112,
"loss": 7.2385,
"mean_token_accuracy": 0.09169937074184417,
"num_tokens": 543924.0,
"step": 225
},
{
"entropy": 8.05418610572815,
"epoch": 0.014788143766475921,
"grad_norm": 1.40625,
"learning_rate": 0.0001145,
"loss": 7.3141,
"mean_token_accuracy": 0.0864493004977703,
"num_tokens": 555669.0,
"step": 230
},
{
"entropy": 8.044883394241333,
"epoch": 0.015109625152703659,
"grad_norm": 1.3828125,
"learning_rate": 0.00011700000000000001,
"loss": 7.2002,
"mean_token_accuracy": 0.09331929311156273,
"num_tokens": 567187.0,
"step": 235
},
{
"entropy": 7.921926689147949,
"epoch": 0.015431106538931396,
"grad_norm": 1.171875,
"learning_rate": 0.00011949999999999999,
"loss": 7.1648,
"mean_token_accuracy": 0.08909451588988304,
"num_tokens": 579812.0,
"step": 240
},
{
"entropy": 7.9616796493530275,
"epoch": 0.015752587925159132,
"grad_norm": 1.171875,
"learning_rate": 0.000122,
"loss": 7.2286,
"mean_token_accuracy": 0.0948996253311634,
"num_tokens": 592539.0,
"step": 245
},
{
"entropy": 7.915118932723999,
"epoch": 0.01607406931138687,
"grad_norm": 0.984375,
"learning_rate": 0.0001245,
"loss": 7.1744,
"mean_token_accuracy": 0.09123623445630073,
"num_tokens": 603561.0,
"step": 250
},
{
"entropy": 7.95502872467041,
"epoch": 0.016395550697614607,
"grad_norm": 1.0390625,
"learning_rate": 0.000127,
"loss": 7.1403,
"mean_token_accuracy": 0.09563293382525444,
"num_tokens": 615309.0,
"step": 255
},
{
"entropy": 7.883571195602417,
"epoch": 0.016717032083842346,
"grad_norm": 1.0546875,
"learning_rate": 0.0001295,
"loss": 7.2078,
"mean_token_accuracy": 0.09283049032092094,
"num_tokens": 628213.0,
"step": 260
},
{
"entropy": 7.916977882385254,
"epoch": 0.017038513470070082,
"grad_norm": 0.96875,
"learning_rate": 0.000132,
"loss": 7.1712,
"mean_token_accuracy": 0.09053821936249733,
"num_tokens": 640786.0,
"step": 265
},
{
"entropy": 7.736500692367554,
"epoch": 0.01735999485629782,
"grad_norm": 1.15625,
"learning_rate": 0.00013450000000000002,
"loss": 6.9442,
"mean_token_accuracy": 0.09789396971464157,
"num_tokens": 653298.0,
"step": 270
},
{
"entropy": 7.796767520904541,
"epoch": 0.017681476242525557,
"grad_norm": 1.03125,
"learning_rate": 0.00013700000000000002,
"loss": 7.1179,
"mean_token_accuracy": 0.09451311975717544,
"num_tokens": 667729.0,
"step": 275
},
{
"entropy": 7.758620405197144,
"epoch": 0.018002957628753296,
"grad_norm": 1.1953125,
"learning_rate": 0.0001395,
"loss": 6.9965,
"mean_token_accuracy": 0.10174397602677346,
"num_tokens": 678289.0,
"step": 280
},
{
"entropy": 7.761229801177978,
"epoch": 0.01832443901498103,
"grad_norm": 1.125,
"learning_rate": 0.00014199999999999998,
"loss": 7.1014,
"mean_token_accuracy": 0.09417134001851082,
"num_tokens": 689595.0,
"step": 285
},
{
"entropy": 7.707542467117309,
"epoch": 0.01864592040120877,
"grad_norm": 1.3125,
"learning_rate": 0.0001445,
"loss": 6.9575,
"mean_token_accuracy": 0.10247044488787652,
"num_tokens": 701044.0,
"step": 290
},
{
"entropy": 7.664159297943115,
"epoch": 0.018967401787436507,
"grad_norm": 1.265625,
"learning_rate": 0.000147,
"loss": 7.0154,
"mean_token_accuracy": 0.09950036033988,
"num_tokens": 713616.0,
"step": 295
},
{
"entropy": 7.647959280014038,
"epoch": 0.019288883173664246,
"grad_norm": 1.21875,
"learning_rate": 0.0001495,
"loss": 6.9233,
"mean_token_accuracy": 0.1026333898305893,
"num_tokens": 725328.0,
"step": 300
},
{
"entropy": 7.647801685333252,
"epoch": 0.01961036455989198,
"grad_norm": 1.1953125,
"learning_rate": 0.000152,
"loss": 6.9827,
"mean_token_accuracy": 0.10479021072387695,
"num_tokens": 738135.0,
"step": 305
},
{
"entropy": 7.666160726547242,
"epoch": 0.01993184594611972,
"grad_norm": 1.21875,
"learning_rate": 0.00015450000000000001,
"loss": 7.0659,
"mean_token_accuracy": 0.09956069737672806,
"num_tokens": 750746.0,
"step": 310
},
{
"entropy": 7.654135274887085,
"epoch": 0.020253327332347457,
"grad_norm": 1.0703125,
"learning_rate": 0.000157,
"loss": 6.8949,
"mean_token_accuracy": 0.10135210454463958,
"num_tokens": 763983.0,
"step": 315
},
{
"entropy": 7.494717454910278,
"epoch": 0.020574808718575196,
"grad_norm": 1.0703125,
"learning_rate": 0.0001595,
"loss": 6.8483,
"mean_token_accuracy": 0.1055855043232441,
"num_tokens": 776047.0,
"step": 320
},
{
"entropy": 7.538181352615356,
"epoch": 0.02089629010480293,
"grad_norm": 0.93359375,
"learning_rate": 0.000162,
"loss": 6.8979,
"mean_token_accuracy": 0.10393242165446281,
"num_tokens": 789551.0,
"step": 325
},
{
"entropy": 7.569456100463867,
"epoch": 0.02121777149103067,
"grad_norm": 0.95703125,
"learning_rate": 0.00016450000000000001,
"loss": 6.8266,
"mean_token_accuracy": 0.1120136708021164,
"num_tokens": 801870.0,
"step": 330
},
{
"entropy": 7.441139793395996,
"epoch": 0.021539252877258407,
"grad_norm": 1.0546875,
"learning_rate": 0.00016700000000000002,
"loss": 6.8251,
"mean_token_accuracy": 0.10700582489371299,
"num_tokens": 813782.0,
"step": 335
},
{
"entropy": 7.5361223220825195,
"epoch": 0.021860734263486146,
"grad_norm": 1.140625,
"learning_rate": 0.00016950000000000003,
"loss": 6.886,
"mean_token_accuracy": 0.11066097766160965,
"num_tokens": 826179.0,
"step": 340
},
{
"entropy": 7.415356826782227,
"epoch": 0.02218221564971388,
"grad_norm": 1.0703125,
"learning_rate": 0.00017199999999999998,
"loss": 6.8989,
"mean_token_accuracy": 0.10546407401561737,
"num_tokens": 838827.0,
"step": 345
},
{
"entropy": 7.442149639129639,
"epoch": 0.022503697035941617,
"grad_norm": 1.0625,
"learning_rate": 0.00017449999999999999,
"loss": 6.8217,
"mean_token_accuracy": 0.11060597971081734,
"num_tokens": 851543.0,
"step": 350
},
{
"entropy": 7.508502197265625,
"epoch": 0.022825178422169357,
"grad_norm": 1.1953125,
"learning_rate": 0.000177,
"loss": 6.8139,
"mean_token_accuracy": 0.112100800126791,
"num_tokens": 863557.0,
"step": 355
},
{
"entropy": 7.371269845962525,
"epoch": 0.023146659808397092,
"grad_norm": 1.1171875,
"learning_rate": 0.0001795,
"loss": 6.8226,
"mean_token_accuracy": 0.11001520678400993,
"num_tokens": 877640.0,
"step": 360
},
{
"entropy": 7.435138940811157,
"epoch": 0.02346814119462483,
"grad_norm": 0.96484375,
"learning_rate": 0.000182,
"loss": 6.9016,
"mean_token_accuracy": 0.11292736753821372,
"num_tokens": 889521.0,
"step": 365
},
{
"entropy": 7.44185962677002,
"epoch": 0.023789622580852567,
"grad_norm": 1.359375,
"learning_rate": 0.0001845,
"loss": 6.7138,
"mean_token_accuracy": 0.11192596107721328,
"num_tokens": 899886.0,
"step": 370
},
{
"entropy": 7.424141836166382,
"epoch": 0.024111103967080307,
"grad_norm": 1.2109375,
"learning_rate": 0.000187,
"loss": 6.835,
"mean_token_accuracy": 0.10648501366376877,
"num_tokens": 911448.0,
"step": 375
},
{
"entropy": 7.346240711212158,
"epoch": 0.024432585353308042,
"grad_norm": 1.171875,
"learning_rate": 0.0001895,
"loss": 6.8403,
"mean_token_accuracy": 0.10451060682535171,
"num_tokens": 922938.0,
"step": 380
},
{
"entropy": 7.440135097503662,
"epoch": 0.02475406673953578,
"grad_norm": 1.125,
"learning_rate": 0.000192,
"loss": 6.816,
"mean_token_accuracy": 0.10817886143922806,
"num_tokens": 935037.0,
"step": 385
},
{
"entropy": 7.338301467895508,
"epoch": 0.025075548125763517,
"grad_norm": 1.171875,
"learning_rate": 0.0001945,
"loss": 6.7998,
"mean_token_accuracy": 0.10885120332241058,
"num_tokens": 946395.0,
"step": 390
},
{
"entropy": 7.387865447998047,
"epoch": 0.025397029511991256,
"grad_norm": 1.03125,
"learning_rate": 0.00019700000000000002,
"loss": 6.7903,
"mean_token_accuracy": 0.11720103770494461,
"num_tokens": 957963.0,
"step": 395
},
{
"entropy": 7.322666645050049,
"epoch": 0.025718510898218992,
"grad_norm": 1.1875,
"learning_rate": 0.00019950000000000002,
"loss": 6.7715,
"mean_token_accuracy": 0.10996255949139595,
"num_tokens": 970474.0,
"step": 400
},
{
"entropy": 7.304989814758301,
"epoch": 0.02603999228444673,
"grad_norm": 1.171875,
"learning_rate": 0.000202,
"loss": 6.7076,
"mean_token_accuracy": 0.1160525843501091,
"num_tokens": 984090.0,
"step": 405
},
{
"entropy": 7.233718299865723,
"epoch": 0.026361473670674467,
"grad_norm": 1.0859375,
"learning_rate": 0.00020449999999999998,
"loss": 6.6529,
"mean_token_accuracy": 0.1177474744617939,
"num_tokens": 997159.0,
"step": 410
},
{
"entropy": 7.222785997390747,
"epoch": 0.026682955056902206,
"grad_norm": 1.265625,
"learning_rate": 0.000207,
"loss": 6.654,
"mean_token_accuracy": 0.11934740170836448,
"num_tokens": 1009350.0,
"step": 415
},
{
"entropy": 7.325893259048462,
"epoch": 0.027004436443129942,
"grad_norm": 1.1328125,
"learning_rate": 0.0002095,
"loss": 6.7141,
"mean_token_accuracy": 0.11572676599025726,
"num_tokens": 1021170.0,
"step": 420
},
{
"entropy": 7.200784921646118,
"epoch": 0.02732591782935768,
"grad_norm": 1.1484375,
"learning_rate": 0.000212,
"loss": 6.7053,
"mean_token_accuracy": 0.11510597914457321,
"num_tokens": 1033173.0,
"step": 425
},
{
"entropy": 7.3387078762054445,
"epoch": 0.027647399215585417,
"grad_norm": 1.1875,
"learning_rate": 0.0002145,
"loss": 6.6451,
"mean_token_accuracy": 0.11399412080645561,
"num_tokens": 1045811.0,
"step": 430
},
{
"entropy": 7.223242235183716,
"epoch": 0.027968880601813156,
"grad_norm": 1.15625,
"learning_rate": 0.00021700000000000002,
"loss": 6.6814,
"mean_token_accuracy": 0.11766811162233352,
"num_tokens": 1058519.0,
"step": 435
},
{
"entropy": 7.186439037322998,
"epoch": 0.028290361988040892,
"grad_norm": 1.234375,
"learning_rate": 0.0002195,
"loss": 6.661,
"mean_token_accuracy": 0.11952715441584587,
"num_tokens": 1069977.0,
"step": 440
},
{
"entropy": 7.247150611877442,
"epoch": 0.02861184337426863,
"grad_norm": 1.328125,
"learning_rate": 0.000222,
"loss": 6.7042,
"mean_token_accuracy": 0.12207212299108505,
"num_tokens": 1081368.0,
"step": 445
},
{
"entropy": 7.224388504028321,
"epoch": 0.028933324760496367,
"grad_norm": 1.046875,
"learning_rate": 0.0002245,
"loss": 6.7154,
"mean_token_accuracy": 0.11299246326088905,
"num_tokens": 1093936.0,
"step": 450
},
{
"entropy": 7.168924283981323,
"epoch": 0.029254806146724106,
"grad_norm": 0.953125,
"learning_rate": 0.00022700000000000002,
"loss": 6.6693,
"mean_token_accuracy": 0.1225433073937893,
"num_tokens": 1106217.0,
"step": 455
},
{
"entropy": 7.140732955932617,
"epoch": 0.029576287532951842,
"grad_norm": 1.1328125,
"learning_rate": 0.00022950000000000002,
"loss": 6.6131,
"mean_token_accuracy": 0.1190965436398983,
"num_tokens": 1120108.0,
"step": 460
},
{
"entropy": 7.190146207809448,
"epoch": 0.029897768919179578,
"grad_norm": 1.1796875,
"learning_rate": 0.00023200000000000003,
"loss": 6.691,
"mean_token_accuracy": 0.1148249328136444,
"num_tokens": 1132390.0,
"step": 465
},
{
"entropy": 7.1808641910552975,
"epoch": 0.030219250305407317,
"grad_norm": 1.046875,
"learning_rate": 0.00023449999999999998,
"loss": 6.6407,
"mean_token_accuracy": 0.1223123162984848,
"num_tokens": 1144612.0,
"step": 470
},
{
"entropy": 7.130864477157592,
"epoch": 0.030540731691635053,
"grad_norm": 1.2109375,
"learning_rate": 0.000237,
"loss": 6.5913,
"mean_token_accuracy": 0.1303763821721077,
"num_tokens": 1156151.0,
"step": 475
},
{
"entropy": 7.050965404510498,
"epoch": 0.030862213077862792,
"grad_norm": 1.1953125,
"learning_rate": 0.0002395,
"loss": 6.5653,
"mean_token_accuracy": 0.1250072978436947,
"num_tokens": 1168777.0,
"step": 480
},
{
"entropy": 7.13370532989502,
"epoch": 0.031183694464090528,
"grad_norm": 1.1484375,
"learning_rate": 0.000242,
"loss": 6.6091,
"mean_token_accuracy": 0.1207241289317608,
"num_tokens": 1181233.0,
"step": 485
},
{
"entropy": 7.062533330917359,
"epoch": 0.031505175850318264,
"grad_norm": 1.1328125,
"learning_rate": 0.0002445,
"loss": 6.4888,
"mean_token_accuracy": 0.12689791172742843,
"num_tokens": 1192315.0,
"step": 490
},
{
"entropy": 7.057355880737305,
"epoch": 0.031826657236546006,
"grad_norm": 1.2890625,
"learning_rate": 0.000247,
"loss": 6.5874,
"mean_token_accuracy": 0.12290141731500626,
"num_tokens": 1203452.0,
"step": 495
},
{
"entropy": 7.104999351501465,
"epoch": 0.03214813862277374,
"grad_norm": 1.03125,
"learning_rate": 0.0002495,
"loss": 6.4607,
"mean_token_accuracy": 0.12253987565636634,
"num_tokens": 1215024.0,
"step": 500
},
{
"entropy": 6.960715389251709,
"epoch": 0.03246962000900148,
"grad_norm": 1.1484375,
"learning_rate": 0.000252,
"loss": 6.5357,
"mean_token_accuracy": 0.12099924460053443,
"num_tokens": 1227389.0,
"step": 505
},
{
"entropy": 7.088908338546753,
"epoch": 0.032791101395229214,
"grad_norm": 1.125,
"learning_rate": 0.0002545,
"loss": 6.5929,
"mean_token_accuracy": 0.12899895682930945,
"num_tokens": 1239580.0,
"step": 510
},
{
"entropy": 6.991267108917237,
"epoch": 0.033112582781456956,
"grad_norm": 1.2890625,
"learning_rate": 0.000257,
"loss": 6.4972,
"mean_token_accuracy": 0.12959347441792488,
"num_tokens": 1251057.0,
"step": 515
},
{
"entropy": 7.053374528884888,
"epoch": 0.03343406416768469,
"grad_norm": 1.2265625,
"learning_rate": 0.0002595,
"loss": 6.5123,
"mean_token_accuracy": 0.12708231583237647,
"num_tokens": 1261979.0,
"step": 520
},
{
"entropy": 7.0755468845367435,
"epoch": 0.03375554555391243,
"grad_norm": 1.234375,
"learning_rate": 0.000262,
"loss": 6.5544,
"mean_token_accuracy": 0.1266493871808052,
"num_tokens": 1274862.0,
"step": 525
},
{
"entropy": 6.957923030853271,
"epoch": 0.034077026940140163,
"grad_norm": 1.1953125,
"learning_rate": 0.00026450000000000003,
"loss": 6.5144,
"mean_token_accuracy": 0.12210054397583008,
"num_tokens": 1286798.0,
"step": 530
},
{
"entropy": 6.912027025222779,
"epoch": 0.034398508326367906,
"grad_norm": 1.0234375,
"learning_rate": 0.00026700000000000004,
"loss": 6.4476,
"mean_token_accuracy": 0.13111426010727883,
"num_tokens": 1298709.0,
"step": 535
},
{
"entropy": 7.059010982513428,
"epoch": 0.03471998971259564,
"grad_norm": 1.1015625,
"learning_rate": 0.00026950000000000005,
"loss": 6.5366,
"mean_token_accuracy": 0.12991197258234025,
"num_tokens": 1310597.0,
"step": 540
},
{
"entropy": 7.001475191116333,
"epoch": 0.03504147109882338,
"grad_norm": 1.203125,
"learning_rate": 0.00027200000000000005,
"loss": 6.5354,
"mean_token_accuracy": 0.1257152423262596,
"num_tokens": 1321986.0,
"step": 545
},
{
"entropy": 6.898067474365234,
"epoch": 0.03536295248505111,
"grad_norm": 1.1640625,
"learning_rate": 0.0002745,
"loss": 6.4693,
"mean_token_accuracy": 0.12922092527151108,
"num_tokens": 1334042.0,
"step": 550
},
{
"entropy": 7.061205530166626,
"epoch": 0.035684433871278856,
"grad_norm": 1.171875,
"learning_rate": 0.000277,
"loss": 6.4141,
"mean_token_accuracy": 0.13716451823711395,
"num_tokens": 1345544.0,
"step": 555
},
{
"entropy": 6.891375637054443,
"epoch": 0.03600591525750659,
"grad_norm": 1.0546875,
"learning_rate": 0.0002795,
"loss": 6.4736,
"mean_token_accuracy": 0.13048869818449021,
"num_tokens": 1356390.0,
"step": 560
},
{
"entropy": 6.955321550369263,
"epoch": 0.03632739664373433,
"grad_norm": 1.1484375,
"learning_rate": 0.00028199999999999997,
"loss": 6.4478,
"mean_token_accuracy": 0.12905914708971977,
"num_tokens": 1367673.0,
"step": 565
},
{
"entropy": 6.978991460800171,
"epoch": 0.03664887802996206,
"grad_norm": 1.0703125,
"learning_rate": 0.0002845,
"loss": 6.5471,
"mean_token_accuracy": 0.12287317663431167,
"num_tokens": 1378831.0,
"step": 570
},
{
"entropy": 6.9239545345306395,
"epoch": 0.0369703594161898,
"grad_norm": 1.15625,
"learning_rate": 0.000287,
"loss": 6.4504,
"mean_token_accuracy": 0.12795896902680398,
"num_tokens": 1390664.0,
"step": 575
},
{
"entropy": 6.862272691726685,
"epoch": 0.03729184080241754,
"grad_norm": 1.265625,
"learning_rate": 0.0002895,
"loss": 6.4401,
"mean_token_accuracy": 0.12892675697803496,
"num_tokens": 1402452.0,
"step": 580
},
{
"entropy": 6.953590202331543,
"epoch": 0.03761332218864528,
"grad_norm": 1.203125,
"learning_rate": 0.000292,
"loss": 6.4336,
"mean_token_accuracy": 0.1350032038986683,
"num_tokens": 1414961.0,
"step": 585
},
{
"entropy": 6.967419624328613,
"epoch": 0.03793480357487301,
"grad_norm": 1.25,
"learning_rate": 0.0002945,
"loss": 6.5459,
"mean_token_accuracy": 0.12986136153340339,
"num_tokens": 1427130.0,
"step": 590
},
{
"entropy": 6.999366188049317,
"epoch": 0.03825628496110075,
"grad_norm": 1.09375,
"learning_rate": 0.000297,
"loss": 6.5246,
"mean_token_accuracy": 0.12499598488211631,
"num_tokens": 1439670.0,
"step": 595
},
{
"entropy": 6.75904483795166,
"epoch": 0.03857776634732849,
"grad_norm": 1.0703125,
"learning_rate": 0.0002995,
"loss": 6.3962,
"mean_token_accuracy": 0.13737771436572074,
"num_tokens": 1451083.0,
"step": 600
},
{
"entropy": 6.9564125537872314,
"epoch": 0.03889924773355623,
"grad_norm": 1.125,
"learning_rate": 0.000302,
"loss": 6.5001,
"mean_token_accuracy": 0.12657159492373465,
"num_tokens": 1461668.0,
"step": 605
},
{
"entropy": 6.856050968170166,
"epoch": 0.03922072911978396,
"grad_norm": 1.0703125,
"learning_rate": 0.0003045,
"loss": 6.4294,
"mean_token_accuracy": 0.12893444746732713,
"num_tokens": 1474610.0,
"step": 610
},
{
"entropy": 6.858731031417847,
"epoch": 0.0395422105060117,
"grad_norm": 1.046875,
"learning_rate": 0.000307,
"loss": 6.4416,
"mean_token_accuracy": 0.13238393440842627,
"num_tokens": 1486322.0,
"step": 615
},
{
"entropy": 6.896153497695923,
"epoch": 0.03986369189223944,
"grad_norm": 1.2734375,
"learning_rate": 0.0003095,
"loss": 6.3976,
"mean_token_accuracy": 0.13269342258572578,
"num_tokens": 1498463.0,
"step": 620
},
{
"entropy": 6.833624172210693,
"epoch": 0.04018517327846718,
"grad_norm": 1.0625,
"learning_rate": 0.000312,
"loss": 6.4049,
"mean_token_accuracy": 0.1366283804178238,
"num_tokens": 1509636.0,
"step": 625
},
{
"entropy": 6.8152320861816404,
"epoch": 0.04050665466469491,
"grad_norm": 1.28125,
"learning_rate": 0.0003145,
"loss": 6.3352,
"mean_token_accuracy": 0.1357703410089016,
"num_tokens": 1523039.0,
"step": 630
},
{
"entropy": 6.893960666656494,
"epoch": 0.04082813605092265,
"grad_norm": 1.1875,
"learning_rate": 0.000317,
"loss": 6.5259,
"mean_token_accuracy": 0.12882191091775894,
"num_tokens": 1535491.0,
"step": 635
},
{
"entropy": 6.884737253189087,
"epoch": 0.04114961743715039,
"grad_norm": 1.046875,
"learning_rate": 0.0003195,
"loss": 6.4357,
"mean_token_accuracy": 0.13706220015883447,
"num_tokens": 1547246.0,
"step": 640
},
{
"entropy": 6.814633703231811,
"epoch": 0.04147109882337813,
"grad_norm": 1.2421875,
"learning_rate": 0.000322,
"loss": 6.4277,
"mean_token_accuracy": 0.1322600543498993,
"num_tokens": 1558948.0,
"step": 645
},
{
"entropy": 6.686750745773315,
"epoch": 0.04179258020960586,
"grad_norm": 1.1640625,
"learning_rate": 0.00032450000000000003,
"loss": 6.2122,
"mean_token_accuracy": 0.1456362023949623,
"num_tokens": 1571590.0,
"step": 650
},
{
"entropy": 6.888936519622803,
"epoch": 0.0421140615958336,
"grad_norm": 1.09375,
"learning_rate": 0.00032700000000000003,
"loss": 6.4346,
"mean_token_accuracy": 0.1308947794139385,
"num_tokens": 1582646.0,
"step": 655
},
{
"entropy": 6.749909734725952,
"epoch": 0.04243554298206134,
"grad_norm": 1.234375,
"learning_rate": 0.00032950000000000004,
"loss": 6.413,
"mean_token_accuracy": 0.13245051279664039,
"num_tokens": 1595393.0,
"step": 660
},
{
"entropy": 6.742237949371338,
"epoch": 0.04275702436828908,
"grad_norm": 1.296875,
"learning_rate": 0.00033200000000000005,
"loss": 6.3141,
"mean_token_accuracy": 0.13743347227573394,
"num_tokens": 1607048.0,
"step": 665
},
{
"entropy": 6.773509550094604,
"epoch": 0.04307850575451681,
"grad_norm": 1.125,
"learning_rate": 0.00033450000000000005,
"loss": 6.41,
"mean_token_accuracy": 0.12926661148667334,
"num_tokens": 1619572.0,
"step": 670
},
{
"entropy": 6.804459476470948,
"epoch": 0.04339998714074455,
"grad_norm": 1.2109375,
"learning_rate": 0.000337,
"loss": 6.3502,
"mean_token_accuracy": 0.1368434838950634,
"num_tokens": 1631342.0,
"step": 675
},
{
"entropy": 6.70438814163208,
"epoch": 0.04372146852697229,
"grad_norm": 1.078125,
"learning_rate": 0.0003395,
"loss": 6.2264,
"mean_token_accuracy": 0.14183585047721864,
"num_tokens": 1644192.0,
"step": 680
},
{
"entropy": 6.752353096008301,
"epoch": 0.04404294991320003,
"grad_norm": 1.2265625,
"learning_rate": 0.000342,
"loss": 6.3503,
"mean_token_accuracy": 0.13174555450677872,
"num_tokens": 1656080.0,
"step": 685
},
{
"entropy": 6.761217737197876,
"epoch": 0.04436443129942776,
"grad_norm": 1.0546875,
"learning_rate": 0.00034449999999999997,
"loss": 6.4007,
"mean_token_accuracy": 0.12576238363981246,
"num_tokens": 1669649.0,
"step": 690
},
{
"entropy": 6.725815725326538,
"epoch": 0.0446859126856555,
"grad_norm": 1.1640625,
"learning_rate": 0.000347,
"loss": 6.2721,
"mean_token_accuracy": 0.13926005065441133,
"num_tokens": 1680722.0,
"step": 695
},
{
"entropy": 6.70696120262146,
"epoch": 0.045007394071883235,
"grad_norm": 1.046875,
"learning_rate": 0.0003495,
"loss": 6.3386,
"mean_token_accuracy": 0.1366697758436203,
"num_tokens": 1693477.0,
"step": 700
},
{
"entropy": 6.703974771499634,
"epoch": 0.04532887545811098,
"grad_norm": 1.03125,
"learning_rate": 0.000352,
"loss": 6.2352,
"mean_token_accuracy": 0.1410387024283409,
"num_tokens": 1705823.0,
"step": 705
},
{
"entropy": 6.785667657852173,
"epoch": 0.04565035684433871,
"grad_norm": 1.03125,
"learning_rate": 0.0003545,
"loss": 6.3254,
"mean_token_accuracy": 0.14233048632740974,
"num_tokens": 1717339.0,
"step": 710
},
{
"entropy": 6.76090669631958,
"epoch": 0.04597183823056645,
"grad_norm": 1.125,
"learning_rate": 0.000357,
"loss": 6.3435,
"mean_token_accuracy": 0.13566424325108528,
"num_tokens": 1729407.0,
"step": 715
},
{
"entropy": 6.704364395141601,
"epoch": 0.046293319616794185,
"grad_norm": 1.109375,
"learning_rate": 0.0003595,
"loss": 6.29,
"mean_token_accuracy": 0.13379911631345748,
"num_tokens": 1741876.0,
"step": 720
},
{
"entropy": 6.77631402015686,
"epoch": 0.04661480100302193,
"grad_norm": 1.1328125,
"learning_rate": 0.000362,
"loss": 6.4265,
"mean_token_accuracy": 0.13033137172460557,
"num_tokens": 1755751.0,
"step": 725
},
{
"entropy": 6.657670211791992,
"epoch": 0.04693628238924966,
"grad_norm": 1.0,
"learning_rate": 0.0003645,
"loss": 6.1913,
"mean_token_accuracy": 0.1418625645339489,
"num_tokens": 1766711.0,
"step": 730
},
{
"entropy": 6.637538290023803,
"epoch": 0.0472577637754774,
"grad_norm": 0.9609375,
"learning_rate": 0.000367,
"loss": 6.342,
"mean_token_accuracy": 0.13235798180103303,
"num_tokens": 1781099.0,
"step": 735
},
{
"entropy": 6.792068195343018,
"epoch": 0.047579245161705135,
"grad_norm": 1.1328125,
"learning_rate": 0.0003695,
"loss": 6.3176,
"mean_token_accuracy": 0.1338970459997654,
"num_tokens": 1793964.0,
"step": 740
},
{
"entropy": 6.59170298576355,
"epoch": 0.04790072654793288,
"grad_norm": 1.0078125,
"learning_rate": 0.000372,
"loss": 6.3336,
"mean_token_accuracy": 0.136866308003664,
"num_tokens": 1806013.0,
"step": 745
},
{
"entropy": 6.797374200820923,
"epoch": 0.04822220793416061,
"grad_norm": 1.296875,
"learning_rate": 0.0003745,
"loss": 6.3025,
"mean_token_accuracy": 0.1357277400791645,
"num_tokens": 1819486.0,
"step": 750
},
{
"entropy": 6.608404302597046,
"epoch": 0.04854368932038835,
"grad_norm": 1.1328125,
"learning_rate": 0.000377,
"loss": 6.209,
"mean_token_accuracy": 0.139783376455307,
"num_tokens": 1830707.0,
"step": 755
},
{
"entropy": 6.744276094436645,
"epoch": 0.048865170706616085,
"grad_norm": 1.1640625,
"learning_rate": 0.0003795,
"loss": 6.4339,
"mean_token_accuracy": 0.13964696526527404,
"num_tokens": 1842601.0,
"step": 760
},
{
"entropy": 6.641026306152344,
"epoch": 0.04918665209284383,
"grad_norm": 0.98828125,
"learning_rate": 0.000382,
"loss": 6.2247,
"mean_token_accuracy": 0.14221392944455147,
"num_tokens": 1854989.0,
"step": 765
},
{
"entropy": 6.668173885345459,
"epoch": 0.04950813347907156,
"grad_norm": 1.046875,
"learning_rate": 0.0003845,
"loss": 6.3488,
"mean_token_accuracy": 0.13909211456775666,
"num_tokens": 1867613.0,
"step": 770
},
{
"entropy": 6.559179830551147,
"epoch": 0.0498296148652993,
"grad_norm": 1.0546875,
"learning_rate": 0.00038700000000000003,
"loss": 6.1666,
"mean_token_accuracy": 0.1398898646235466,
"num_tokens": 1879203.0,
"step": 775
},
{
"entropy": 6.739627838134766,
"epoch": 0.050151096251527034,
"grad_norm": 1.1015625,
"learning_rate": 0.00038950000000000003,
"loss": 6.3404,
"mean_token_accuracy": 0.13396444767713547,
"num_tokens": 1892402.0,
"step": 780
},
{
"entropy": 6.695523881912232,
"epoch": 0.05047257763775478,
"grad_norm": 1.171875,
"learning_rate": 0.00039200000000000004,
"loss": 6.3368,
"mean_token_accuracy": 0.13424392864108087,
"num_tokens": 1904777.0,
"step": 785
},
{
"entropy": 6.697699403762817,
"epoch": 0.05079405902398251,
"grad_norm": 1.171875,
"learning_rate": 0.00039450000000000005,
"loss": 6.3303,
"mean_token_accuracy": 0.14127687290310859,
"num_tokens": 1915303.0,
"step": 790
},
{
"entropy": 6.605134391784668,
"epoch": 0.05111554041021025,
"grad_norm": 1.171875,
"learning_rate": 0.00039700000000000005,
"loss": 6.1703,
"mean_token_accuracy": 0.14601608961820603,
"num_tokens": 1927440.0,
"step": 795
},
{
"entropy": 6.599157094955444,
"epoch": 0.051437021796437984,
"grad_norm": 1.03125,
"learning_rate": 0.0003995,
"loss": 6.2865,
"mean_token_accuracy": 0.14217782020568848,
"num_tokens": 1939028.0,
"step": 800
},
{
"entropy": 6.546269845962525,
"epoch": 0.05175850318266572,
"grad_norm": 1.1953125,
"learning_rate": 0.000402,
"loss": 6.0901,
"mean_token_accuracy": 0.14469429180026055,
"num_tokens": 1949002.0,
"step": 805
},
{
"entropy": 6.540508651733399,
"epoch": 0.05207998456889346,
"grad_norm": 1.0390625,
"learning_rate": 0.0004045,
"loss": 6.1717,
"mean_token_accuracy": 0.14316056221723555,
"num_tokens": 1960724.0,
"step": 810
},
{
"entropy": 6.635583829879761,
"epoch": 0.0524014659551212,
"grad_norm": 1.1953125,
"learning_rate": 0.00040699999999999997,
"loss": 6.2174,
"mean_token_accuracy": 0.15010152757167816,
"num_tokens": 1972874.0,
"step": 815
},
{
"entropy": 6.5239417552948,
"epoch": 0.052722947341348934,
"grad_norm": 1.140625,
"learning_rate": 0.0004095,
"loss": 6.2177,
"mean_token_accuracy": 0.14256786555051804,
"num_tokens": 1985303.0,
"step": 820
},
{
"entropy": 6.585869884490966,
"epoch": 0.05304442872757667,
"grad_norm": 1.1796875,
"learning_rate": 0.000412,
"loss": 6.2209,
"mean_token_accuracy": 0.1398877792060375,
"num_tokens": 1996460.0,
"step": 825
},
{
"entropy": 6.571089553833008,
"epoch": 0.05336591011380441,
"grad_norm": 1.09375,
"learning_rate": 0.0004145,
"loss": 6.2383,
"mean_token_accuracy": 0.14395796954631807,
"num_tokens": 2008237.0,
"step": 830
},
{
"entropy": 6.622538232803345,
"epoch": 0.05368739150003215,
"grad_norm": 0.9765625,
"learning_rate": 0.000417,
"loss": 6.2403,
"mean_token_accuracy": 0.14386678040027617,
"num_tokens": 2020207.0,
"step": 835
},
{
"entropy": 6.661964750289917,
"epoch": 0.054008872886259884,
"grad_norm": 1.21875,
"learning_rate": 0.0004195,
"loss": 6.2427,
"mean_token_accuracy": 0.13739722222089767,
"num_tokens": 2031521.0,
"step": 840
},
{
"entropy": 6.462450408935547,
"epoch": 0.05433035427248762,
"grad_norm": 1.09375,
"learning_rate": 0.000422,
"loss": 6.2228,
"mean_token_accuracy": 0.14301058202981948,
"num_tokens": 2043455.0,
"step": 845
},
{
"entropy": 6.503607940673828,
"epoch": 0.05465183565871536,
"grad_norm": 1.15625,
"learning_rate": 0.0004245,
"loss": 6.1393,
"mean_token_accuracy": 0.14353580325841903,
"num_tokens": 2055173.0,
"step": 850
},
{
"entropy": 6.541472578048706,
"epoch": 0.0549733170449431,
"grad_norm": 0.96875,
"learning_rate": 0.000427,
"loss": 6.1403,
"mean_token_accuracy": 0.15179161876440048,
"num_tokens": 2066734.0,
"step": 855
},
{
"entropy": 6.639166307449341,
"epoch": 0.055294798431170834,
"grad_norm": 1.09375,
"learning_rate": 0.0004295,
"loss": 6.2761,
"mean_token_accuracy": 0.1436140313744545,
"num_tokens": 2078000.0,
"step": 860
},
{
"entropy": 6.475754165649414,
"epoch": 0.05561627981739857,
"grad_norm": 1.0625,
"learning_rate": 0.000432,
"loss": 6.2339,
"mean_token_accuracy": 0.13742900639772415,
"num_tokens": 2090853.0,
"step": 865
},
{
"entropy": 6.5641477584838865,
"epoch": 0.05593776120362631,
"grad_norm": 1.2265625,
"learning_rate": 0.0004345,
"loss": 6.2037,
"mean_token_accuracy": 0.14319348186254502,
"num_tokens": 2102077.0,
"step": 870
},
{
"entropy": 6.494472360610962,
"epoch": 0.05625924258985405,
"grad_norm": 1.125,
"learning_rate": 0.000437,
"loss": 6.2086,
"mean_token_accuracy": 0.1428264133632183,
"num_tokens": 2114102.0,
"step": 875
},
{
"entropy": 6.49079270362854,
"epoch": 0.056580723976081784,
"grad_norm": 1.0703125,
"learning_rate": 0.0004395,
"loss": 6.0957,
"mean_token_accuracy": 0.14935592859983443,
"num_tokens": 2125155.0,
"step": 880
},
{
"entropy": 6.433831787109375,
"epoch": 0.05690220536230952,
"grad_norm": 1.109375,
"learning_rate": 0.000442,
"loss": 6.0576,
"mean_token_accuracy": 0.14371880292892455,
"num_tokens": 2136501.0,
"step": 885
},
{
"entropy": 6.521292591094971,
"epoch": 0.05722368674853726,
"grad_norm": 1.109375,
"learning_rate": 0.0004445,
"loss": 6.1641,
"mean_token_accuracy": 0.14184854477643966,
"num_tokens": 2149142.0,
"step": 890
},
{
"entropy": 6.478517198562622,
"epoch": 0.057545168134765,
"grad_norm": 1.03125,
"learning_rate": 0.000447,
"loss": 6.079,
"mean_token_accuracy": 0.15349558889865875,
"num_tokens": 2161548.0,
"step": 895
},
{
"entropy": 6.435318660736084,
"epoch": 0.057866649520992734,
"grad_norm": 1.0625,
"learning_rate": 0.00044950000000000003,
"loss": 6.1254,
"mean_token_accuracy": 0.14672751501202583,
"num_tokens": 2174109.0,
"step": 900
},
{
"entropy": 6.477844858169556,
"epoch": 0.05818813090722047,
"grad_norm": 1.0390625,
"learning_rate": 0.00045200000000000004,
"loss": 6.089,
"mean_token_accuracy": 0.15101353526115419,
"num_tokens": 2186559.0,
"step": 905
},
{
"entropy": 6.43283166885376,
"epoch": 0.05850961229344821,
"grad_norm": 1.0625,
"learning_rate": 0.00045450000000000004,
"loss": 6.1185,
"mean_token_accuracy": 0.15171128660440444,
"num_tokens": 2199397.0,
"step": 910
},
{
"entropy": 6.388595533370972,
"epoch": 0.05883109367967595,
"grad_norm": 1.1484375,
"learning_rate": 0.00045700000000000005,
"loss": 6.1171,
"mean_token_accuracy": 0.1468488872051239,
"num_tokens": 2211176.0,
"step": 915
},
{
"entropy": 6.3985847473144535,
"epoch": 0.059152575065903684,
"grad_norm": 1.078125,
"learning_rate": 0.00045950000000000006,
"loss": 6.078,
"mean_token_accuracy": 0.15174092650413512,
"num_tokens": 2223661.0,
"step": 920
},
{
"entropy": 6.408503246307373,
"epoch": 0.05947405645213142,
"grad_norm": 1.1796875,
"learning_rate": 0.000462,
"loss": 6.0222,
"mean_token_accuracy": 0.14833907932043075,
"num_tokens": 2233609.0,
"step": 925
},
{
"entropy": 6.424277496337891,
"epoch": 0.059795537838359156,
"grad_norm": 1.1953125,
"learning_rate": 0.0004645,
"loss": 6.1108,
"mean_token_accuracy": 0.14718108102679253,
"num_tokens": 2245791.0,
"step": 930
},
{
"entropy": 6.391247034072876,
"epoch": 0.0601170192245869,
"grad_norm": 1.09375,
"learning_rate": 0.000467,
"loss": 6.0183,
"mean_token_accuracy": 0.14811496585607528,
"num_tokens": 2258640.0,
"step": 935
},
{
"entropy": 6.4228808879852295,
"epoch": 0.060438500610814634,
"grad_norm": 1.171875,
"learning_rate": 0.0004695,
"loss": 6.118,
"mean_token_accuracy": 0.13841042444109916,
"num_tokens": 2270487.0,
"step": 940
},
{
"entropy": 6.4019317626953125,
"epoch": 0.06075998199704237,
"grad_norm": 1.375,
"learning_rate": 0.000472,
"loss": 6.1586,
"mean_token_accuracy": 0.14111901223659515,
"num_tokens": 2283852.0,
"step": 945
},
{
"entropy": 6.472497415542603,
"epoch": 0.061081463383270106,
"grad_norm": 1.1015625,
"learning_rate": 0.0004745,
"loss": 6.1262,
"mean_token_accuracy": 0.14592221304774283,
"num_tokens": 2295351.0,
"step": 950
},
{
"entropy": 6.520536708831787,
"epoch": 0.06140294476949785,
"grad_norm": 1.21875,
"learning_rate": 0.000477,
"loss": 6.1374,
"mean_token_accuracy": 0.14523889273405075,
"num_tokens": 2307723.0,
"step": 955
},
{
"entropy": 6.310831737518311,
"epoch": 0.061724426155725584,
"grad_norm": 1.203125,
"learning_rate": 0.0004795,
"loss": 6.0438,
"mean_token_accuracy": 0.15202855616807937,
"num_tokens": 2320273.0,
"step": 960
},
{
"entropy": 6.316798114776612,
"epoch": 0.06204590754195332,
"grad_norm": 1.046875,
"learning_rate": 0.000482,
"loss": 6.055,
"mean_token_accuracy": 0.15343189984560013,
"num_tokens": 2332142.0,
"step": 965
},
{
"entropy": 6.3915996074676515,
"epoch": 0.062367388928181056,
"grad_norm": 0.984375,
"learning_rate": 0.0004845,
"loss": 6.1411,
"mean_token_accuracy": 0.1484244257211685,
"num_tokens": 2346027.0,
"step": 970
},
{
"entropy": 6.468223333358765,
"epoch": 0.0626888703144088,
"grad_norm": 1.078125,
"learning_rate": 0.000487,
"loss": 6.1227,
"mean_token_accuracy": 0.1468320369720459,
"num_tokens": 2357606.0,
"step": 975
},
{
"entropy": 6.406705331802368,
"epoch": 0.06301035170063653,
"grad_norm": 1.0546875,
"learning_rate": 0.0004895,
"loss": 6.0776,
"mean_token_accuracy": 0.15517954528331757,
"num_tokens": 2369122.0,
"step": 980
},
{
"entropy": 6.341184473037719,
"epoch": 0.06333183308686427,
"grad_norm": 1.15625,
"learning_rate": 0.000492,
"loss": 5.9906,
"mean_token_accuracy": 0.15497024059295655,
"num_tokens": 2380313.0,
"step": 985
},
{
"entropy": 6.496398115158081,
"epoch": 0.06365331447309201,
"grad_norm": 1.203125,
"learning_rate": 0.0004945,
"loss": 6.187,
"mean_token_accuracy": 0.1426093466579914,
"num_tokens": 2392535.0,
"step": 990
},
{
"entropy": 6.377195549011231,
"epoch": 0.06397479585931974,
"grad_norm": 1.1875,
"learning_rate": 0.000497,
"loss": 6.1267,
"mean_token_accuracy": 0.14542814046144487,
"num_tokens": 2404878.0,
"step": 995
},
{
"entropy": 6.302570390701294,
"epoch": 0.06429627724554748,
"grad_norm": 1.1328125,
"learning_rate": 0.0004995,
"loss": 5.99,
"mean_token_accuracy": 0.15718609392642974,
"num_tokens": 2416656.0,
"step": 1000
},
{
"entropy": 6.394310522079468,
"epoch": 0.06461775863177523,
"grad_norm": 1.0546875,
"learning_rate": 0.000499998026082006,
"loss": 6.0817,
"mean_token_accuracy": 0.14592474773526193,
"num_tokens": 2428666.0,
"step": 1005
},
{
"entropy": 6.298369979858398,
"epoch": 0.06493924001800296,
"grad_norm": 1.125,
"learning_rate": 0.0004999900070995136,
"loss": 6.0213,
"mean_token_accuracy": 0.14751595705747605,
"num_tokens": 2440183.0,
"step": 1010
},
{
"entropy": 6.303510761260986,
"epoch": 0.0652607214042307,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999758199023239,
"loss": 6.0006,
"mean_token_accuracy": 0.1451709449291229,
"num_tokens": 2452380.0,
"step": 1015
},
{
"entropy": 6.476188898086548,
"epoch": 0.06558220279045843,
"grad_norm": 0.8984375,
"learning_rate": 0.0004999554648793858,
"loss": 6.1831,
"mean_token_accuracy": 0.13650565296411515,
"num_tokens": 2466418.0,
"step": 1020
},
{
"entropy": 6.272005653381347,
"epoch": 0.06590368417668617,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999289425887425,
"loss": 5.9469,
"mean_token_accuracy": 0.15635564625263215,
"num_tokens": 2478900.0,
"step": 1025
},
{
"entropy": 6.3220130443573,
"epoch": 0.06622516556291391,
"grad_norm": 1.046875,
"learning_rate": 0.0004998962537575161,
"loss": 6.056,
"mean_token_accuracy": 0.1513557553291321,
"num_tokens": 2491059.0,
"step": 1030
},
{
"entropy": 6.254553413391113,
"epoch": 0.06654664694914164,
"grad_norm": 1.0,
"learning_rate": 0.0004998573992818874,
"loss": 5.9955,
"mean_token_accuracy": 0.1543598785996437,
"num_tokens": 2503090.0,
"step": 1035
},
{
"entropy": 6.381179428100586,
"epoch": 0.06686812833536938,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998123802270715,
"loss": 6.0787,
"mean_token_accuracy": 0.15112028270959854,
"num_tokens": 2513716.0,
"step": 1040
},
{
"entropy": 6.2655613899230955,
"epoch": 0.06718960972159711,
"grad_norm": 1.046875,
"learning_rate": 0.0004997611978272886,
"loss": 6.0051,
"mean_token_accuracy": 0.15200867950916291,
"num_tokens": 2526295.0,
"step": 1045
},
{
"entropy": 6.446440315246582,
"epoch": 0.06751109110782486,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997038534857298,
"loss": 6.0981,
"mean_token_accuracy": 0.1533021330833435,
"num_tokens": 2538026.0,
"step": 1050
},
{
"entropy": 6.268654203414917,
"epoch": 0.0678325724940526,
"grad_norm": 1.0859375,
"learning_rate": 0.0004996403487745194,
"loss": 6.0517,
"mean_token_accuracy": 0.15148577690124512,
"num_tokens": 2549041.0,
"step": 1055
},
{
"entropy": 6.328129005432129,
"epoch": 0.06815405388028033,
"grad_norm": 1.078125,
"learning_rate": 0.000499570685434671,
"loss": 5.9757,
"mean_token_accuracy": 0.15270224064588547,
"num_tokens": 2561843.0,
"step": 1060
},
{
"entropy": 6.40714201927185,
"epoch": 0.06847553526650807,
"grad_norm": 1.0859375,
"learning_rate": 0.0004994948653760405,
"loss": 6.0571,
"mean_token_accuracy": 0.15040460601449013,
"num_tokens": 2573834.0,
"step": 1065
},
{
"entropy": 6.334405422210693,
"epoch": 0.06879701665273581,
"grad_norm": 1.2265625,
"learning_rate": 0.0004994128906772729,
"loss": 6.0512,
"mean_token_accuracy": 0.14916755259037018,
"num_tokens": 2584577.0,
"step": 1070
},
{
"entropy": 6.18700156211853,
"epoch": 0.06911849803896354,
"grad_norm": 1.0546875,
"learning_rate": 0.000499324763585746,
"loss": 5.8854,
"mean_token_accuracy": 0.15264845192432402,
"num_tokens": 2596511.0,
"step": 1075
},
{
"entropy": 6.373612308502198,
"epoch": 0.06943997942519128,
"grad_norm": 1.0625,
"learning_rate": 0.0004992304865175085,
"loss": 6.106,
"mean_token_accuracy": 0.14183942899107932,
"num_tokens": 2608338.0,
"step": 1080
},
{
"entropy": 6.362950563430786,
"epoch": 0.06976146081141901,
"grad_norm": 1.09375,
"learning_rate": 0.0004991300620572138,
"loss": 6.0426,
"mean_token_accuracy": 0.14951156824827194,
"num_tokens": 2620081.0,
"step": 1085
},
{
"entropy": 6.342620515823365,
"epoch": 0.07008294219764676,
"grad_norm": 1.1171875,
"learning_rate": 0.0004990234929580494,
"loss": 6.067,
"mean_token_accuracy": 0.1514773279428482,
"num_tokens": 2633153.0,
"step": 1090
},
{
"entropy": 6.23214864730835,
"epoch": 0.0704044235838745,
"grad_norm": 1.1171875,
"learning_rate": 0.0004989107821416609,
"loss": 5.9612,
"mean_token_accuracy": 0.15713730603456497,
"num_tokens": 2645055.0,
"step": 1095
},
{
"entropy": 6.279799699783325,
"epoch": 0.07072590497010223,
"grad_norm": 0.984375,
"learning_rate": 0.0004987919326980723,
"loss": 5.9652,
"mean_token_accuracy": 0.1615489676594734,
"num_tokens": 2657798.0,
"step": 1100
},
{
"entropy": 6.290076160430909,
"epoch": 0.07104738635632997,
"grad_norm": 1.0546875,
"learning_rate": 0.0004986669478856011,
"loss": 6.0442,
"mean_token_accuracy": 0.14735963940620422,
"num_tokens": 2669095.0,
"step": 1105
},
{
"entropy": 6.239100980758667,
"epoch": 0.07136886774255771,
"grad_norm": 1.0859375,
"learning_rate": 0.0004985358311307688,
"loss": 5.9351,
"mean_token_accuracy": 0.15722962766885756,
"num_tokens": 2680533.0,
"step": 1110
},
{
"entropy": 6.191725826263427,
"epoch": 0.07169034912878544,
"grad_norm": 1.03125,
"learning_rate": 0.0004983985860282081,
"loss": 5.9617,
"mean_token_accuracy": 0.15354472547769546,
"num_tokens": 2694164.0,
"step": 1115
},
{
"entropy": 6.282885503768921,
"epoch": 0.07201183051501318,
"grad_norm": 0.97265625,
"learning_rate": 0.0004982552163405623,
"loss": 5.9871,
"mean_token_accuracy": 0.15190175026655198,
"num_tokens": 2705709.0,
"step": 1120
},
{
"entropy": 6.209733486175537,
"epoch": 0.07233331190124091,
"grad_norm": 1.203125,
"learning_rate": 0.0004981057259983839,
"loss": 5.9358,
"mean_token_accuracy": 0.15684126019477845,
"num_tokens": 2716682.0,
"step": 1125
},
{
"entropy": 6.260201930999756,
"epoch": 0.07265479328746866,
"grad_norm": 1.09375,
"learning_rate": 0.0004979501191000262,
"loss": 5.9749,
"mean_token_accuracy": 0.14660124331712723,
"num_tokens": 2728336.0,
"step": 1130
},
{
"entropy": 6.213229560852051,
"epoch": 0.0729762746736964,
"grad_norm": 1.1875,
"learning_rate": 0.0004977883999115311,
"loss": 5.8836,
"mean_token_accuracy": 0.15912517607212068,
"num_tokens": 2740588.0,
"step": 1135
},
{
"entropy": 6.234706211090088,
"epoch": 0.07329775605992413,
"grad_norm": 1.046875,
"learning_rate": 0.0004976205728665113,
"loss": 5.9084,
"mean_token_accuracy": 0.15942537635564805,
"num_tokens": 2751202.0,
"step": 1140
},
{
"entropy": 6.186249780654907,
"epoch": 0.07361923744615187,
"grad_norm": 1.0234375,
"learning_rate": 0.0004974466425660307,
"loss": 5.9218,
"mean_token_accuracy": 0.15814530849456787,
"num_tokens": 2763200.0,
"step": 1145
},
{
"entropy": 6.275615692138672,
"epoch": 0.0739407188323796,
"grad_norm": 1.0625,
"learning_rate": 0.0004972666137784759,
"loss": 5.977,
"mean_token_accuracy": 0.15757482796907424,
"num_tokens": 2774775.0,
"step": 1150
},
{
"entropy": 6.196810531616211,
"epoch": 0.07426220021860734,
"grad_norm": 1.0078125,
"learning_rate": 0.0004970804914394271,
"loss": 6.0315,
"mean_token_accuracy": 0.14435624480247497,
"num_tokens": 2787502.0,
"step": 1155
},
{
"entropy": 6.270943975448608,
"epoch": 0.07458368160483508,
"grad_norm": 1.03125,
"learning_rate": 0.0004968882806515225,
"loss": 5.9405,
"mean_token_accuracy": 0.15502338707447053,
"num_tokens": 2799054.0,
"step": 1160
},
{
"entropy": 6.246717548370361,
"epoch": 0.07490516299106281,
"grad_norm": 1.0546875,
"learning_rate": 0.0004966899866843177,
"loss": 6.068,
"mean_token_accuracy": 0.1496472030878067,
"num_tokens": 2813068.0,
"step": 1165
},
{
"entropy": 6.332323694229126,
"epoch": 0.07522664437729056,
"grad_norm": 1.1875,
"learning_rate": 0.000496485614974142,
"loss": 5.9714,
"mean_token_accuracy": 0.1508554771542549,
"num_tokens": 2826341.0,
"step": 1170
},
{
"entropy": 6.190732860565186,
"epoch": 0.0755481257635183,
"grad_norm": 1.171875,
"learning_rate": 0.0004962751711239492,
"loss": 5.9695,
"mean_token_accuracy": 0.15956569463014603,
"num_tokens": 2838963.0,
"step": 1175
},
{
"entropy": 6.236918926239014,
"epoch": 0.07586960714974603,
"grad_norm": 1.140625,
"learning_rate": 0.0004960586609031636,
"loss": 5.8992,
"mean_token_accuracy": 0.15990909934043884,
"num_tokens": 2851092.0,
"step": 1180
},
{
"entropy": 6.212152576446533,
"epoch": 0.07619108853597377,
"grad_norm": 1.0078125,
"learning_rate": 0.0004958360902475224,
"loss": 5.9219,
"mean_token_accuracy": 0.1583631619811058,
"num_tokens": 2863779.0,
"step": 1185
},
{
"entropy": 6.197848796844482,
"epoch": 0.0765125699222015,
"grad_norm": 1.046875,
"learning_rate": 0.0004956074652589125,
"loss": 5.9935,
"mean_token_accuracy": 0.15426847636699675,
"num_tokens": 2875827.0,
"step": 1190
},
{
"entropy": 6.268373584747314,
"epoch": 0.07683405130842924,
"grad_norm": 1.1171875,
"learning_rate": 0.0004953727922052035,
"loss": 5.9528,
"mean_token_accuracy": 0.1541168585419655,
"num_tokens": 2887881.0,
"step": 1195
},
{
"entropy": 6.1501389503479,
"epoch": 0.07715553269465698,
"grad_norm": 0.96484375,
"learning_rate": 0.0004951320775200756,
"loss": 5.8044,
"mean_token_accuracy": 0.16239132285118102,
"num_tokens": 2899607.0,
"step": 1200
},
{
"entropy": 6.136989784240723,
"epoch": 0.07747701408088471,
"grad_norm": 1.2265625,
"learning_rate": 0.0004948853278028436,
"loss": 5.8496,
"mean_token_accuracy": 0.16230373978614807,
"num_tokens": 2911423.0,
"step": 1205
},
{
"entropy": 6.205084800720215,
"epoch": 0.07779849546711246,
"grad_norm": 1.078125,
"learning_rate": 0.0004946325498182755,
"loss": 5.9853,
"mean_token_accuracy": 0.1523156225681305,
"num_tokens": 2925360.0,
"step": 1210
},
{
"entropy": 6.194045448303223,
"epoch": 0.0781199768533402,
"grad_norm": 1.0546875,
"learning_rate": 0.0004943737504964076,
"loss": 5.9173,
"mean_token_accuracy": 0.1579758957028389,
"num_tokens": 2937760.0,
"step": 1215
},
{
"entropy": 6.1570957660675045,
"epoch": 0.07844145823956793,
"grad_norm": 1.078125,
"learning_rate": 0.000494108936932354,
"loss": 5.8932,
"mean_token_accuracy": 0.16087926626205445,
"num_tokens": 2950439.0,
"step": 1220
},
{
"entropy": 6.266901922225952,
"epoch": 0.07876293962579567,
"grad_norm": 1.09375,
"learning_rate": 0.0004938381163861124,
"loss": 6.014,
"mean_token_accuracy": 0.14868946373462677,
"num_tokens": 2962664.0,
"step": 1225
},
{
"entropy": 6.095866441726685,
"epoch": 0.0790844210120234,
"grad_norm": 0.99609375,
"learning_rate": 0.0004935612962823645,
"loss": 5.9046,
"mean_token_accuracy": 0.15208775401115418,
"num_tokens": 2974490.0,
"step": 1230
},
{
"entropy": 6.195926570892334,
"epoch": 0.07940590239825114,
"grad_norm": 1.0390625,
"learning_rate": 0.0004932784842102739,
"loss": 5.8682,
"mean_token_accuracy": 0.1580081731081009,
"num_tokens": 2987204.0,
"step": 1235
},
{
"entropy": 6.1595056533813475,
"epoch": 0.07972738378447888,
"grad_norm": 1.046875,
"learning_rate": 0.0004929896879232758,
"loss": 5.9712,
"mean_token_accuracy": 0.15987634658813477,
"num_tokens": 2998803.0,
"step": 1240
},
{
"entropy": 6.277051019668579,
"epoch": 0.08004886517070661,
"grad_norm": 1.171875,
"learning_rate": 0.0004926949153388668,
"loss": 5.9109,
"mean_token_accuracy": 0.16382880806922911,
"num_tokens": 3009699.0,
"step": 1245
},
{
"entropy": 6.08549280166626,
"epoch": 0.08037034655693436,
"grad_norm": 1.234375,
"learning_rate": 0.0004923941745383859,
"loss": 5.8865,
"mean_token_accuracy": 0.15905096381902695,
"num_tokens": 3020917.0,
"step": 1250
},
{
"entropy": 6.149177408218383,
"epoch": 0.0806918279431621,
"grad_norm": 1.109375,
"learning_rate": 0.000492087473766794,
"loss": 5.8303,
"mean_token_accuracy": 0.1584074839949608,
"num_tokens": 3033456.0,
"step": 1255
},
{
"entropy": 6.166597366333008,
"epoch": 0.08101330932938983,
"grad_norm": 1.0859375,
"learning_rate": 0.000491774821432448,
"loss": 6.0052,
"mean_token_accuracy": 0.14997194707393646,
"num_tokens": 3046176.0,
"step": 1260
},
{
"entropy": 6.307433652877807,
"epoch": 0.08133479071561757,
"grad_norm": 1.015625,
"learning_rate": 0.0004914562261068693,
"loss": 6.0066,
"mean_token_accuracy": 0.15461492016911507,
"num_tokens": 3057842.0,
"step": 1265
},
{
"entropy": 6.054072427749634,
"epoch": 0.0816562721018453,
"grad_norm": 1.1875,
"learning_rate": 0.0004911316965245098,
"loss": 5.8168,
"mean_token_accuracy": 0.15909599289298057,
"num_tokens": 3068571.0,
"step": 1270
},
{
"entropy": 6.198695945739746,
"epoch": 0.08197775348807304,
"grad_norm": 1.0390625,
"learning_rate": 0.000490801241582512,
"loss": 5.8535,
"mean_token_accuracy": 0.15899356454610825,
"num_tokens": 3081008.0,
"step": 1275
},
{
"entropy": 6.10587100982666,
"epoch": 0.08229923487430078,
"grad_norm": 1.1875,
"learning_rate": 0.000490464870340465,
"loss": 5.8437,
"mean_token_accuracy": 0.15855197459459305,
"num_tokens": 3092520.0,
"step": 1280
},
{
"entropy": 6.330335187911987,
"epoch": 0.08262071626052851,
"grad_norm": 1.0703125,
"learning_rate": 0.0004901225920201563,
"loss": 6.0411,
"mean_token_accuracy": 0.14842546507716178,
"num_tokens": 3104994.0,
"step": 1285
},
{
"entropy": 6.09021487236023,
"epoch": 0.08294219764675625,
"grad_norm": 1.25,
"learning_rate": 0.000489774416005319,
"loss": 5.8597,
"mean_token_accuracy": 0.16196220368146896,
"num_tokens": 3116630.0,
"step": 1290
},
{
"entropy": 6.14417290687561,
"epoch": 0.08326367903298398,
"grad_norm": 0.96875,
"learning_rate": 0.0004894203518413742,
"loss": 5.9314,
"mean_token_accuracy": 0.15356178283691407,
"num_tokens": 3130901.0,
"step": 1295
},
{
"entropy": 5.983477401733398,
"epoch": 0.08358516041921173,
"grad_norm": 0.984375,
"learning_rate": 0.0004890604092351701,
"loss": 5.8086,
"mean_token_accuracy": 0.1642161339521408,
"num_tokens": 3142889.0,
"step": 1300
},
{
"entropy": 6.177248144149781,
"epoch": 0.08390664180543947,
"grad_norm": 1.09375,
"learning_rate": 0.000488694598054715,
"loss": 5.877,
"mean_token_accuracy": 0.15873171985149384,
"num_tokens": 3155480.0,
"step": 1305
},
{
"entropy": 6.148008251190186,
"epoch": 0.0842281231916672,
"grad_norm": 1.0859375,
"learning_rate": 0.0004883229283289071,
"loss": 5.8713,
"mean_token_accuracy": 0.16119552850723268,
"num_tokens": 3166741.0,
"step": 1310
},
{
"entropy": 6.148603343963623,
"epoch": 0.08454960457789494,
"grad_norm": 1.0546875,
"learning_rate": 0.00048794541024725993,
"loss": 5.8541,
"mean_token_accuracy": 0.15728282779455185,
"num_tokens": 3179642.0,
"step": 1315
},
{
"entropy": 6.1732546329498295,
"epoch": 0.08487108596412268,
"grad_norm": 1.0390625,
"learning_rate": 0.0004875620541596221,
"loss": 5.9588,
"mean_token_accuracy": 0.15470116436481476,
"num_tokens": 3191737.0,
"step": 1320
},
{
"entropy": 6.115213203430176,
"epoch": 0.08519256735035041,
"grad_norm": 1.03125,
"learning_rate": 0.00048717287057589454,
"loss": 5.7712,
"mean_token_accuracy": 0.16634340584278107,
"num_tokens": 3204712.0,
"step": 1325
},
{
"entropy": 6.015933704376221,
"epoch": 0.08551404873657815,
"grad_norm": 0.9765625,
"learning_rate": 0.0004867778701657417,
"loss": 5.759,
"mean_token_accuracy": 0.16800687313079835,
"num_tokens": 3217394.0,
"step": 1330
},
{
"entropy": 6.0952574729919435,
"epoch": 0.08583553012280588,
"grad_norm": 1.109375,
"learning_rate": 0.00048637706375829955,
"loss": 5.7798,
"mean_token_accuracy": 0.16281396746635438,
"num_tokens": 3228550.0,
"step": 1335
},
{
"entropy": 6.004730653762818,
"epoch": 0.08615701150903363,
"grad_norm": 0.9921875,
"learning_rate": 0.000485970462341878,
"loss": 5.7723,
"mean_token_accuracy": 0.17149952352046965,
"num_tokens": 3240535.0,
"step": 1340
},
{
"entropy": 6.06542935371399,
"epoch": 0.08647849289526137,
"grad_norm": 1.0234375,
"learning_rate": 0.00048555807706366044,
"loss": 5.7642,
"mean_token_accuracy": 0.16032337993383408,
"num_tokens": 3251876.0,
"step": 1345
},
{
"entropy": 6.217990589141846,
"epoch": 0.0867999742814891,
"grad_norm": 1.1328125,
"learning_rate": 0.00048513991922939756,
"loss": 5.9447,
"mean_token_accuracy": 0.16245564594864845,
"num_tokens": 3264834.0,
"step": 1350
},
{
"entropy": 6.037310266494751,
"epoch": 0.08712145566771684,
"grad_norm": 1.125,
"learning_rate": 0.00048471600030309744,
"loss": 5.8879,
"mean_token_accuracy": 0.15801134556531907,
"num_tokens": 3276556.0,
"step": 1355
},
{
"entropy": 6.192209720611572,
"epoch": 0.08744293705394458,
"grad_norm": 1.1015625,
"learning_rate": 0.00048428633190671186,
"loss": 5.8204,
"mean_token_accuracy": 0.1574784353375435,
"num_tokens": 3288321.0,
"step": 1360
},
{
"entropy": 6.083817100524902,
"epoch": 0.08776441844017231,
"grad_norm": 1.0390625,
"learning_rate": 0.0004838509258198167,
"loss": 5.8902,
"mean_token_accuracy": 0.15389755517244338,
"num_tokens": 3301141.0,
"step": 1365
},
{
"entropy": 6.1486015796661375,
"epoch": 0.08808589982640005,
"grad_norm": 1.0,
"learning_rate": 0.00048340979397929,
"loss": 5.8995,
"mean_token_accuracy": 0.1567264527082443,
"num_tokens": 3313508.0,
"step": 1370
},
{
"entropy": 6.13810887336731,
"epoch": 0.08840738121262778,
"grad_norm": 0.953125,
"learning_rate": 0.00048296294847898386,
"loss": 5.8768,
"mean_token_accuracy": 0.1589060604572296,
"num_tokens": 3325548.0,
"step": 1375
},
{
"entropy": 5.974321031570435,
"epoch": 0.08872886259885553,
"grad_norm": 1.0390625,
"learning_rate": 0.0004825104015693934,
"loss": 5.7542,
"mean_token_accuracy": 0.1705598786473274,
"num_tokens": 3337409.0,
"step": 1380
},
{
"entropy": 6.113429403305053,
"epoch": 0.08905034398508327,
"grad_norm": 1.015625,
"learning_rate": 0.0004820521656573208,
"loss": 5.8314,
"mean_token_accuracy": 0.16559924334287643,
"num_tokens": 3349083.0,
"step": 1385
},
{
"entropy": 6.080103778839112,
"epoch": 0.089371825371311,
"grad_norm": 0.8828125,
"learning_rate": 0.00048158825330553505,
"loss": 5.8608,
"mean_token_accuracy": 0.15842643529176711,
"num_tokens": 3362145.0,
"step": 1390
},
{
"entropy": 6.0918474197387695,
"epoch": 0.08969330675753874,
"grad_norm": 1.078125,
"learning_rate": 0.00048111867723242763,
"loss": 5.7481,
"mean_token_accuracy": 0.16890449076890945,
"num_tokens": 3374472.0,
"step": 1395
},
{
"entropy": 6.049900007247925,
"epoch": 0.09001478814376647,
"grad_norm": 1.046875,
"learning_rate": 0.0004806434503116637,
"loss": 5.793,
"mean_token_accuracy": 0.1702058121562004,
"num_tokens": 3386431.0,
"step": 1400
},
{
"entropy": 6.105265045166016,
"epoch": 0.09033626952999421,
"grad_norm": 1.1484375,
"learning_rate": 0.0004801625855718296,
"loss": 5.8445,
"mean_token_accuracy": 0.1575576588511467,
"num_tokens": 3398456.0,
"step": 1405
},
{
"entropy": 6.04578046798706,
"epoch": 0.09065775091622195,
"grad_norm": 1.078125,
"learning_rate": 0.00047967609619607477,
"loss": 5.7742,
"mean_token_accuracy": 0.16186919063329697,
"num_tokens": 3409982.0,
"step": 1410
},
{
"entropy": 6.018639183044433,
"epoch": 0.09097923230244968,
"grad_norm": 0.92578125,
"learning_rate": 0.0004791839955217513,
"loss": 5.843,
"mean_token_accuracy": 0.1640510618686676,
"num_tokens": 3423098.0,
"step": 1415
},
{
"entropy": 6.030447006225586,
"epoch": 0.09130071368867743,
"grad_norm": 0.98046875,
"learning_rate": 0.00047868629704004786,
"loss": 5.7711,
"mean_token_accuracy": 0.1604703187942505,
"num_tokens": 3435572.0,
"step": 1420
},
{
"entropy": 6.01783299446106,
"epoch": 0.09162219507490517,
"grad_norm": 1.140625,
"learning_rate": 0.00047818301439561965,
"loss": 5.8236,
"mean_token_accuracy": 0.1562732681632042,
"num_tokens": 3448468.0,
"step": 1425
},
{
"entropy": 6.0785534381866455,
"epoch": 0.0919436764611329,
"grad_norm": 0.9921875,
"learning_rate": 0.00047767416138621454,
"loss": 5.8157,
"mean_token_accuracy": 0.16070456504821778,
"num_tokens": 3460450.0,
"step": 1430
},
{
"entropy": 6.0592879295349125,
"epoch": 0.09226515784736064,
"grad_norm": 1.0078125,
"learning_rate": 0.000477159751962295,
"loss": 5.8261,
"mean_token_accuracy": 0.15531291663646699,
"num_tokens": 3473091.0,
"step": 1435
},
{
"entropy": 6.079493522644043,
"epoch": 0.09258663923358837,
"grad_norm": 1.0234375,
"learning_rate": 0.00047663980022665507,
"loss": 5.8345,
"mean_token_accuracy": 0.1659800574183464,
"num_tokens": 3484727.0,
"step": 1440
},
{
"entropy": 5.929708814620971,
"epoch": 0.09290812061981611,
"grad_norm": 0.99609375,
"learning_rate": 0.00047611432043403437,
"loss": 5.6772,
"mean_token_accuracy": 0.16626399755477905,
"num_tokens": 3497349.0,
"step": 1445
},
{
"entropy": 6.129834794998169,
"epoch": 0.09322960200604385,
"grad_norm": 1.1875,
"learning_rate": 0.0004755833269907267,
"loss": 5.9135,
"mean_token_accuracy": 0.15423834919929505,
"num_tokens": 3508879.0,
"step": 1450
},
{
"entropy": 5.948153877258301,
"epoch": 0.09355108339227158,
"grad_norm": 1.046875,
"learning_rate": 0.0004750468344541857,
"loss": 5.6625,
"mean_token_accuracy": 0.17003892362117767,
"num_tokens": 3520524.0,
"step": 1455
},
{
"entropy": 6.036735153198242,
"epoch": 0.09387256477849933,
"grad_norm": 0.9921875,
"learning_rate": 0.00047450485753262525,
"loss": 5.7696,
"mean_token_accuracy": 0.16654942631721498,
"num_tokens": 3533929.0,
"step": 1460
},
{
"entropy": 6.083649492263794,
"epoch": 0.09419404616472707,
"grad_norm": 1.09375,
"learning_rate": 0.00047395741108461633,
"loss": 5.7687,
"mean_token_accuracy": 0.1623277947306633,
"num_tokens": 3545203.0,
"step": 1465
},
{
"entropy": 6.000326490402221,
"epoch": 0.0945155275509548,
"grad_norm": 0.96484375,
"learning_rate": 0.00047340451011867985,
"loss": 5.7797,
"mean_token_accuracy": 0.15959457457065582,
"num_tokens": 3557203.0,
"step": 1470
},
{
"entropy": 6.104987621307373,
"epoch": 0.09483700893718254,
"grad_norm": 1.0,
"learning_rate": 0.00047284616979287515,
"loss": 5.7919,
"mean_token_accuracy": 0.17074221521615982,
"num_tokens": 3568844.0,
"step": 1475
},
{
"entropy": 6.020106410980224,
"epoch": 0.09515849032341027,
"grad_norm": 1.0,
"learning_rate": 0.00047228240541438433,
"loss": 5.7881,
"mean_token_accuracy": 0.1655557185411453,
"num_tokens": 3581186.0,
"step": 1480
},
{
"entropy": 5.944919109344482,
"epoch": 0.09547997170963801,
"grad_norm": 1.078125,
"learning_rate": 0.00047171323243909257,
"loss": 5.7272,
"mean_token_accuracy": 0.16357500553131105,
"num_tokens": 3592679.0,
"step": 1485
},
{
"entropy": 6.149051380157471,
"epoch": 0.09580145309586575,
"grad_norm": 0.953125,
"learning_rate": 0.00047113866647116457,
"loss": 5.8955,
"mean_token_accuracy": 0.1526908665895462,
"num_tokens": 3605414.0,
"step": 1490
},
{
"entropy": 5.936412954330445,
"epoch": 0.09612293448209348,
"grad_norm": 1.0234375,
"learning_rate": 0.0004705587232626164,
"loss": 5.7614,
"mean_token_accuracy": 0.1623243123292923,
"num_tokens": 3618662.0,
"step": 1495
},
{
"entropy": 5.98573784828186,
"epoch": 0.09644441586832123,
"grad_norm": 1.0546875,
"learning_rate": 0.00046997341871288424,
"loss": 5.6834,
"mean_token_accuracy": 0.17313943356275557,
"num_tokens": 3629721.0,
"step": 1500
},
{
"entropy": 5.988020706176758,
"epoch": 0.09676589725454895,
"grad_norm": 1.03125,
"learning_rate": 0.0004693827688683879,
"loss": 5.6817,
"mean_token_accuracy": 0.1712356060743332,
"num_tokens": 3643031.0,
"step": 1505
},
{
"entropy": 5.948742055892945,
"epoch": 0.0970873786407767,
"grad_norm": 1.125,
"learning_rate": 0.0004687867899220914,
"loss": 5.7325,
"mean_token_accuracy": 0.15706687420606613,
"num_tokens": 3654260.0,
"step": 1510
},
{
"entropy": 6.096729373931884,
"epoch": 0.09740886002700444,
"grad_norm": 1.109375,
"learning_rate": 0.00046818549821305846,
"loss": 5.8357,
"mean_token_accuracy": 0.16078440248966216,
"num_tokens": 3665672.0,
"step": 1515
},
{
"entropy": 6.047589254379273,
"epoch": 0.09773034141323217,
"grad_norm": 1.0078125,
"learning_rate": 0.00046757891022600494,
"loss": 5.7997,
"mean_token_accuracy": 0.1640141412615776,
"num_tokens": 3678633.0,
"step": 1520
},
{
"entropy": 5.985074663162232,
"epoch": 0.09805182279945991,
"grad_norm": 1.125,
"learning_rate": 0.0004669670425908471,
"loss": 5.7481,
"mean_token_accuracy": 0.17160257697105408,
"num_tokens": 3691500.0,
"step": 1525
},
{
"entropy": 5.960325527191162,
"epoch": 0.09837330418568765,
"grad_norm": 0.91796875,
"learning_rate": 0.0004663499120822451,
"loss": 5.6994,
"mean_token_accuracy": 0.16570399701595306,
"num_tokens": 3704601.0,
"step": 1530
},
{
"entropy": 5.992954969406128,
"epoch": 0.09869478557191538,
"grad_norm": 1.046875,
"learning_rate": 0.0004657275356191437,
"loss": 5.7037,
"mean_token_accuracy": 0.1652768522500992,
"num_tokens": 3715838.0,
"step": 1535
},
{
"entropy": 5.938394212722779,
"epoch": 0.09901626695814313,
"grad_norm": 1.078125,
"learning_rate": 0.00046509993026430804,
"loss": 5.6596,
"mean_token_accuracy": 0.17287949323654175,
"num_tokens": 3727605.0,
"step": 1540
},
{
"entropy": 6.024389791488647,
"epoch": 0.09933774834437085,
"grad_norm": 1.140625,
"learning_rate": 0.0004644671132238558,
"loss": 5.7384,
"mean_token_accuracy": 0.1638980522751808,
"num_tokens": 3739991.0,
"step": 1545
},
{
"entropy": 6.037438774108887,
"epoch": 0.0996592297305986,
"grad_norm": 1.1484375,
"learning_rate": 0.00046382910184678585,
"loss": 5.8098,
"mean_token_accuracy": 0.1669749930500984,
"num_tokens": 3752175.0,
"step": 1550
},
{
"entropy": 5.935793876647949,
"epoch": 0.09998071111682634,
"grad_norm": 1.125,
"learning_rate": 0.0004631859136245025,
"loss": 5.6979,
"mean_token_accuracy": 0.16765902042388917,
"num_tokens": 3763505.0,
"step": 1555
},
{
"entropy": 5.962877321243286,
"epoch": 0.10030219250305407,
"grad_norm": 1.0390625,
"learning_rate": 0.0004625375661903357,
"loss": 5.7065,
"mean_token_accuracy": 0.17439793795347214,
"num_tokens": 3775278.0,
"step": 1560
},
{
"entropy": 5.958874225616455,
"epoch": 0.10062367388928181,
"grad_norm": 0.9921875,
"learning_rate": 0.00046188407731905787,
"loss": 5.696,
"mean_token_accuracy": 0.16563132107257844,
"num_tokens": 3787100.0,
"step": 1565
},
{
"entropy": 5.881431341171265,
"epoch": 0.10094515527550955,
"grad_norm": 1.0625,
"learning_rate": 0.00046122546492639643,
"loss": 5.6794,
"mean_token_accuracy": 0.17307680398225783,
"num_tokens": 3798020.0,
"step": 1570
},
{
"entropy": 5.964326190948486,
"epoch": 0.10126663666173728,
"grad_norm": 1.0078125,
"learning_rate": 0.000460561747068543,
"loss": 5.6378,
"mean_token_accuracy": 0.17502547353506087,
"num_tokens": 3809114.0,
"step": 1575
},
{
"entropy": 5.958069276809693,
"epoch": 0.10158811804796503,
"grad_norm": 1.0390625,
"learning_rate": 0.0004598929419416578,
"loss": 5.726,
"mean_token_accuracy": 0.16351143270730972,
"num_tokens": 3821065.0,
"step": 1580
},
{
"entropy": 5.973008537292481,
"epoch": 0.10190959943419275,
"grad_norm": 1.1328125,
"learning_rate": 0.00045921906788137123,
"loss": 5.6973,
"mean_token_accuracy": 0.16471869349479676,
"num_tokens": 3832784.0,
"step": 1585
},
{
"entropy": 5.910749292373657,
"epoch": 0.1022310808204205,
"grad_norm": 1.140625,
"learning_rate": 0.00045854014336228115,
"loss": 5.6468,
"mean_token_accuracy": 0.1710452049970627,
"num_tokens": 3843746.0,
"step": 1590
},
{
"entropy": 5.872445678710937,
"epoch": 0.10255256220664824,
"grad_norm": 1.1015625,
"learning_rate": 0.00045785618699744615,
"loss": 5.6636,
"mean_token_accuracy": 0.1720869243144989,
"num_tokens": 3855570.0,
"step": 1595
},
{
"entropy": 5.9480163097381595,
"epoch": 0.10287404359287597,
"grad_norm": 1.0859375,
"learning_rate": 0.00045716721753787543,
"loss": 5.6376,
"mean_token_accuracy": 0.16848402619361877,
"num_tokens": 3866744.0,
"step": 1600
},
{
"entropy": 5.955452537536621,
"epoch": 0.10319552497910371,
"grad_norm": 0.9453125,
"learning_rate": 0.0004564732538720148,
"loss": 5.7248,
"mean_token_accuracy": 0.16833148002624512,
"num_tokens": 3879019.0,
"step": 1605
},
{
"entropy": 5.9315619468688965,
"epoch": 0.10351700636533144,
"grad_norm": 0.98828125,
"learning_rate": 0.00045577431502522877,
"loss": 5.7581,
"mean_token_accuracy": 0.16690098345279694,
"num_tokens": 3892836.0,
"step": 1610
},
{
"entropy": 6.027340459823608,
"epoch": 0.10383848775155918,
"grad_norm": 1.015625,
"learning_rate": 0.0004550704201592787,
"loss": 5.6782,
"mean_token_accuracy": 0.168406842648983,
"num_tokens": 3905099.0,
"step": 1615
},
{
"entropy": 5.89118800163269,
"epoch": 0.10415996913778693,
"grad_norm": 1.0390625,
"learning_rate": 0.0004543615885717981,
"loss": 5.6785,
"mean_token_accuracy": 0.16635265797376633,
"num_tokens": 3917044.0,
"step": 1620
},
{
"entropy": 5.919010496139526,
"epoch": 0.10448145052401465,
"grad_norm": 1.0625,
"learning_rate": 0.00045364783969576296,
"loss": 5.6282,
"mean_token_accuracy": 0.1762469157576561,
"num_tokens": 3928066.0,
"step": 1625
},
{
"entropy": 5.96668643951416,
"epoch": 0.1048029319102424,
"grad_norm": 1.0859375,
"learning_rate": 0.0004529291930989592,
"loss": 5.8176,
"mean_token_accuracy": 0.1627002775669098,
"num_tokens": 3939969.0,
"step": 1630
},
{
"entropy": 6.01760630607605,
"epoch": 0.10512441329647014,
"grad_norm": 1.1171875,
"learning_rate": 0.0004522056684834464,
"loss": 5.7026,
"mean_token_accuracy": 0.17166565954685212,
"num_tokens": 3951193.0,
"step": 1635
},
{
"entropy": 5.8352165699005125,
"epoch": 0.10544589468269787,
"grad_norm": 1.0078125,
"learning_rate": 0.0004514772856850173,
"loss": 5.7228,
"mean_token_accuracy": 0.17300599217414855,
"num_tokens": 3963628.0,
"step": 1640
},
{
"entropy": 6.032732105255127,
"epoch": 0.10576737606892561,
"grad_norm": 1.09375,
"learning_rate": 0.0004507440646726542,
"loss": 5.7151,
"mean_token_accuracy": 0.1679761916399002,
"num_tokens": 3975692.0,
"step": 1645
},
{
"entropy": 5.910207986831665,
"epoch": 0.10608885745515334,
"grad_norm": 0.9375,
"learning_rate": 0.0004500060255479818,
"loss": 5.6858,
"mean_token_accuracy": 0.17569718807935714,
"num_tokens": 3987551.0,
"step": 1650
},
{
"entropy": 5.992750072479248,
"epoch": 0.10641033884138108,
"grad_norm": 1.046875,
"learning_rate": 0.0004492631885447151,
"loss": 5.7327,
"mean_token_accuracy": 0.16714347451925277,
"num_tokens": 3998810.0,
"step": 1655
},
{
"entropy": 6.0109038829803465,
"epoch": 0.10673182022760883,
"grad_norm": 1.109375,
"learning_rate": 0.00044851557402810616,
"loss": 5.7052,
"mean_token_accuracy": 0.17118439078330994,
"num_tokens": 4009208.0,
"step": 1660
},
{
"entropy": 5.853578186035156,
"epoch": 0.10705330161383655,
"grad_norm": 1.15625,
"learning_rate": 0.00044776320249438444,
"loss": 5.7413,
"mean_token_accuracy": 0.1665416806936264,
"num_tokens": 4020156.0,
"step": 1665
},
{
"entropy": 6.052140712738037,
"epoch": 0.1073747830000643,
"grad_norm": 0.9609375,
"learning_rate": 0.00044700609457019565,
"loss": 5.69,
"mean_token_accuracy": 0.17266564667224885,
"num_tokens": 4032530.0,
"step": 1670
},
{
"entropy": 5.909550714492798,
"epoch": 0.10769626438629204,
"grad_norm": 1.015625,
"learning_rate": 0.0004462442710120359,
"loss": 5.6881,
"mean_token_accuracy": 0.1665107548236847,
"num_tokens": 4045009.0,
"step": 1675
},
{
"entropy": 5.874087619781494,
"epoch": 0.10801774577251977,
"grad_norm": 0.87109375,
"learning_rate": 0.000445477752705683,
"loss": 5.6803,
"mean_token_accuracy": 0.18234034329652787,
"num_tokens": 4058719.0,
"step": 1680
},
{
"entropy": 5.9365478515625,
"epoch": 0.10833922715874751,
"grad_norm": 0.99609375,
"learning_rate": 0.00044470656066562336,
"loss": 5.6093,
"mean_token_accuracy": 0.17888884395360946,
"num_tokens": 4070163.0,
"step": 1685
},
{
"entropy": 5.911435508728028,
"epoch": 0.10866070854497524,
"grad_norm": 0.984375,
"learning_rate": 0.0004439307160344765,
"loss": 5.6714,
"mean_token_accuracy": 0.17036347985267639,
"num_tokens": 4083975.0,
"step": 1690
},
{
"entropy": 5.889103841781616,
"epoch": 0.10898218993120298,
"grad_norm": 0.94921875,
"learning_rate": 0.00044315024008241473,
"loss": 5.6843,
"mean_token_accuracy": 0.16422206908464432,
"num_tokens": 4096969.0,
"step": 1695
},
{
"entropy": 5.898795938491821,
"epoch": 0.10930367131743073,
"grad_norm": 1.09375,
"learning_rate": 0.0004423651542065806,
"loss": 5.6318,
"mean_token_accuracy": 0.17020974308252335,
"num_tokens": 4108540.0,
"step": 1700
},
{
"entropy": 5.957143688201905,
"epoch": 0.10962515270365845,
"grad_norm": 1.0390625,
"learning_rate": 0.00044157547993050006,
"loss": 5.7208,
"mean_token_accuracy": 0.1688693046569824,
"num_tokens": 4121037.0,
"step": 1705
},
{
"entropy": 5.8640303134918215,
"epoch": 0.1099466340898862,
"grad_norm": 0.890625,
"learning_rate": 0.00044078123890349227,
"loss": 5.6641,
"mean_token_accuracy": 0.16424248963594437,
"num_tokens": 4133950.0,
"step": 1710
},
{
"entropy": 5.858451509475708,
"epoch": 0.11026811547611394,
"grad_norm": 1.015625,
"learning_rate": 0.00043998245290007606,
"loss": 5.5772,
"mean_token_accuracy": 0.17258207947015763,
"num_tokens": 4147371.0,
"step": 1715
},
{
"entropy": 6.020438194274902,
"epoch": 0.11058959686234167,
"grad_norm": 1.1171875,
"learning_rate": 0.00043917914381937323,
"loss": 5.7849,
"mean_token_accuracy": 0.16778419762849808,
"num_tokens": 4159431.0,
"step": 1720
},
{
"entropy": 5.89661283493042,
"epoch": 0.11091107824856941,
"grad_norm": 1.0234375,
"learning_rate": 0.00043837133368450815,
"loss": 5.6101,
"mean_token_accuracy": 0.17763638794422149,
"num_tokens": 4170225.0,
"step": 1725
},
{
"entropy": 5.895733213424682,
"epoch": 0.11123255963479714,
"grad_norm": 1.0703125,
"learning_rate": 0.0004375590446420037,
"loss": 5.6476,
"mean_token_accuracy": 0.17097645103931428,
"num_tokens": 4182230.0,
"step": 1730
},
{
"entropy": 5.9664935111999515,
"epoch": 0.11155404102102488,
"grad_norm": 1.0234375,
"learning_rate": 0.0004367422989611743,
"loss": 5.7167,
"mean_token_accuracy": 0.16534337699413298,
"num_tokens": 4193268.0,
"step": 1735
},
{
"entropy": 5.910691118240356,
"epoch": 0.11187552240725263,
"grad_norm": 0.9921875,
"learning_rate": 0.0004359211190335153,
"loss": 5.7288,
"mean_token_accuracy": 0.16493058055639268,
"num_tokens": 4205916.0,
"step": 1740
},
{
"entropy": 5.9636599063873295,
"epoch": 0.11219700379348035,
"grad_norm": 0.95703125,
"learning_rate": 0.00043509552737208923,
"loss": 5.6866,
"mean_token_accuracy": 0.16581161320209503,
"num_tokens": 4217447.0,
"step": 1745
},
{
"entropy": 5.918504953384399,
"epoch": 0.1125184851797081,
"grad_norm": 1.0078125,
"learning_rate": 0.00043426554661090853,
"loss": 5.6645,
"mean_token_accuracy": 0.17159862965345382,
"num_tokens": 4230561.0,
"step": 1750
},
{
"entropy": 5.978391313552857,
"epoch": 0.11283996656593583,
"grad_norm": 1.03125,
"learning_rate": 0.00043343119950431516,
"loss": 5.8399,
"mean_token_accuracy": 0.1623585380613804,
"num_tokens": 4244640.0,
"step": 1755
},
{
"entropy": 5.959365892410278,
"epoch": 0.11316144795216357,
"grad_norm": 1.0390625,
"learning_rate": 0.00043259250892635644,
"loss": 5.6403,
"mean_token_accuracy": 0.176731576025486,
"num_tokens": 4256940.0,
"step": 1760
},
{
"entropy": 5.887542104721069,
"epoch": 0.11348292933839131,
"grad_norm": 0.95703125,
"learning_rate": 0.0004317494978701582,
"loss": 5.7198,
"mean_token_accuracy": 0.1675652876496315,
"num_tokens": 4269972.0,
"step": 1765
},
{
"entropy": 5.94051947593689,
"epoch": 0.11380441072461904,
"grad_norm": 1.15625,
"learning_rate": 0.0004309021894472943,
"loss": 5.6572,
"mean_token_accuracy": 0.1695004880428314,
"num_tokens": 4281938.0,
"step": 1770
},
{
"entropy": 5.94478669166565,
"epoch": 0.11412589211084678,
"grad_norm": 1.0234375,
"learning_rate": 0.0004300506068871534,
"loss": 5.7405,
"mean_token_accuracy": 0.16731222346425056,
"num_tokens": 4294164.0,
"step": 1775
},
{
"entropy": 5.858164119720459,
"epoch": 0.11444737349707453,
"grad_norm": 1.046875,
"learning_rate": 0.00042919477353630135,
"loss": 5.569,
"mean_token_accuracy": 0.1731950283050537,
"num_tokens": 4305542.0,
"step": 1780
},
{
"entropy": 5.876661157608032,
"epoch": 0.11476885488330225,
"grad_norm": 1.0546875,
"learning_rate": 0.000428334712857842,
"loss": 5.5484,
"mean_token_accuracy": 0.1760912388563156,
"num_tokens": 4315814.0,
"step": 1785
},
{
"entropy": 5.958914470672608,
"epoch": 0.11509033626953,
"grad_norm": 1.046875,
"learning_rate": 0.00042747044843077304,
"loss": 5.7469,
"mean_token_accuracy": 0.16798093765974045,
"num_tokens": 4327308.0,
"step": 1790
},
{
"entropy": 6.085859775543213,
"epoch": 0.11541181765575773,
"grad_norm": 1.015625,
"learning_rate": 0.00042660200394934047,
"loss": 5.8251,
"mean_token_accuracy": 0.1617446556687355,
"num_tokens": 4340719.0,
"step": 1795
},
{
"entropy": 5.871499538421631,
"epoch": 0.11573329904198547,
"grad_norm": 0.99609375,
"learning_rate": 0.00042572940322238844,
"loss": 5.622,
"mean_token_accuracy": 0.17820285856723786,
"num_tokens": 4352529.0,
"step": 1800
},
{
"entropy": 5.838696050643921,
"epoch": 0.11605478042821321,
"grad_norm": 1.140625,
"learning_rate": 0.00042485267017270664,
"loss": 5.627,
"mean_token_accuracy": 0.17486343681812286,
"num_tokens": 4363859.0,
"step": 1805
},
{
"entropy": 5.8888983726501465,
"epoch": 0.11637626181444094,
"grad_norm": 1.1328125,
"learning_rate": 0.0004239718288363745,
"loss": 5.6055,
"mean_token_accuracy": 0.17151245027780532,
"num_tokens": 4375297.0,
"step": 1810
},
{
"entropy": 5.759175539016724,
"epoch": 0.11669774320066868,
"grad_norm": 1.0390625,
"learning_rate": 0.0004230869033621023,
"loss": 5.5683,
"mean_token_accuracy": 0.17936437129974364,
"num_tokens": 4387204.0,
"step": 1815
},
{
"entropy": 5.944360208511353,
"epoch": 0.11701922458689643,
"grad_norm": 1.0,
"learning_rate": 0.0004221979180105688,
"loss": 5.6965,
"mean_token_accuracy": 0.16732241064310074,
"num_tokens": 4400461.0,
"step": 1820
},
{
"entropy": 5.893303918838501,
"epoch": 0.11734070597312415,
"grad_norm": 1.0234375,
"learning_rate": 0.00042130489715375645,
"loss": 5.6169,
"mean_token_accuracy": 0.17313757240772248,
"num_tokens": 4413150.0,
"step": 1825
},
{
"entropy": 5.8112153053283695,
"epoch": 0.1176621873593519,
"grad_norm": 1.0390625,
"learning_rate": 0.00042040786527428335,
"loss": 5.6318,
"mean_token_accuracy": 0.17437280267477034,
"num_tokens": 4424919.0,
"step": 1830
},
{
"entropy": 5.856292104721069,
"epoch": 0.11798366874557963,
"grad_norm": 1.125,
"learning_rate": 0.0004195068469647315,
"loss": 5.5968,
"mean_token_accuracy": 0.17334085702896118,
"num_tokens": 4437305.0,
"step": 1835
},
{
"entropy": 5.937565803527832,
"epoch": 0.11830515013180737,
"grad_norm": 1.0859375,
"learning_rate": 0.00041860186692697297,
"loss": 5.7008,
"mean_token_accuracy": 0.16629609167575837,
"num_tokens": 4449121.0,
"step": 1840
},
{
"entropy": 5.924497175216675,
"epoch": 0.11862663151803511,
"grad_norm": 1.0703125,
"learning_rate": 0.00041769294997149264,
"loss": 5.6028,
"mean_token_accuracy": 0.17515215873718262,
"num_tokens": 4460526.0,
"step": 1845
},
{
"entropy": 5.912448835372925,
"epoch": 0.11894811290426284,
"grad_norm": 1.03125,
"learning_rate": 0.0004167801210167081,
"loss": 5.7183,
"mean_token_accuracy": 0.16868967115879058,
"num_tokens": 4472852.0,
"step": 1850
},
{
"entropy": 5.9101356029510494,
"epoch": 0.11926959429049058,
"grad_norm": 1.140625,
"learning_rate": 0.0004158634050882861,
"loss": 5.5948,
"mean_token_accuracy": 0.17210926860570908,
"num_tokens": 4485226.0,
"step": 1855
},
{
"entropy": 5.802251291275025,
"epoch": 0.11959107567671831,
"grad_norm": 0.984375,
"learning_rate": 0.0004149428273184569,
"loss": 5.6473,
"mean_token_accuracy": 0.17440788447856903,
"num_tokens": 4497441.0,
"step": 1860
},
{
"entropy": 5.891997289657593,
"epoch": 0.11991255706294605,
"grad_norm": 1.0390625,
"learning_rate": 0.0004140184129453253,
"loss": 5.6062,
"mean_token_accuracy": 0.17910100221633912,
"num_tokens": 4509699.0,
"step": 1865
},
{
"entropy": 5.926146841049194,
"epoch": 0.1202340384491738,
"grad_norm": 1.015625,
"learning_rate": 0.000413090187312178,
"loss": 5.627,
"mean_token_accuracy": 0.17063527107238768,
"num_tokens": 4521556.0,
"step": 1870
},
{
"entropy": 5.808397722244263,
"epoch": 0.12055551983540153,
"grad_norm": 0.98828125,
"learning_rate": 0.0004121581758667898,
"loss": 5.5079,
"mean_token_accuracy": 0.18462960422039032,
"num_tokens": 4532734.0,
"step": 1875
},
{
"entropy": 5.86313910484314,
"epoch": 0.12087700122162927,
"grad_norm": 1.015625,
"learning_rate": 0.00041122240416072533,
"loss": 5.625,
"mean_token_accuracy": 0.17456342428922653,
"num_tokens": 4544614.0,
"step": 1880
},
{
"entropy": 5.813703775405884,
"epoch": 0.12119848260785701,
"grad_norm": 1.0625,
"learning_rate": 0.0004102828978486385,
"loss": 5.4986,
"mean_token_accuracy": 0.18180812150239944,
"num_tokens": 4555152.0,
"step": 1885
},
{
"entropy": 5.8646917819976805,
"epoch": 0.12151996399408474,
"grad_norm": 1.0078125,
"learning_rate": 0.0004093396826875695,
"loss": 5.6198,
"mean_token_accuracy": 0.17630153447389602,
"num_tokens": 4568535.0,
"step": 1890
},
{
"entropy": 5.934072732925415,
"epoch": 0.12184144538031248,
"grad_norm": 1.0546875,
"learning_rate": 0.00040839278453623837,
"loss": 5.6782,
"mean_token_accuracy": 0.17143154591321946,
"num_tokens": 4580741.0,
"step": 1895
},
{
"entropy": 5.871197080612182,
"epoch": 0.12216292676654021,
"grad_norm": 1.03125,
"learning_rate": 0.0004074422293543363,
"loss": 5.6403,
"mean_token_accuracy": 0.17499494403600693,
"num_tokens": 4592765.0,
"step": 1900
},
{
"entropy": 5.911958885192871,
"epoch": 0.12248440815276795,
"grad_norm": 0.9453125,
"learning_rate": 0.0004064880432018137,
"loss": 5.6881,
"mean_token_accuracy": 0.16715567409992219,
"num_tokens": 4606140.0,
"step": 1905
},
{
"entropy": 5.830193710327149,
"epoch": 0.1228058895389957,
"grad_norm": 1.015625,
"learning_rate": 0.00040553025223816615,
"loss": 5.5333,
"mean_token_accuracy": 0.17858823239803315,
"num_tokens": 4618330.0,
"step": 1910
},
{
"entropy": 5.8352135181427,
"epoch": 0.12312737092522343,
"grad_norm": 1.03125,
"learning_rate": 0.00040456888272171653,
"loss": 5.6288,
"mean_token_accuracy": 0.1699838399887085,
"num_tokens": 4632054.0,
"step": 1915
},
{
"entropy": 5.927229547500611,
"epoch": 0.12344885231145117,
"grad_norm": 1.0390625,
"learning_rate": 0.00040360396100889577,
"loss": 5.5545,
"mean_token_accuracy": 0.17679750621318818,
"num_tokens": 4643455.0,
"step": 1920
},
{
"entropy": 5.791709327697754,
"epoch": 0.12377033369767891,
"grad_norm": 0.9921875,
"learning_rate": 0.0004026355135535202,
"loss": 5.5401,
"mean_token_accuracy": 0.18370288759469985,
"num_tokens": 4654847.0,
"step": 1925
},
{
"entropy": 5.728792953491211,
"epoch": 0.12409181508390664,
"grad_norm": 1.09375,
"learning_rate": 0.000401663566906066,
"loss": 5.5198,
"mean_token_accuracy": 0.17564617097377777,
"num_tokens": 4666470.0,
"step": 1930
},
{
"entropy": 5.888561820983886,
"epoch": 0.12441329647013438,
"grad_norm": 1.0,
"learning_rate": 0.00040068814771294134,
"loss": 5.6093,
"mean_token_accuracy": 0.16564541310071945,
"num_tokens": 4678170.0,
"step": 1935
},
{
"entropy": 5.820088195800781,
"epoch": 0.12473477785636211,
"grad_norm": 1.046875,
"learning_rate": 0.0003997092827157562,
"loss": 5.5675,
"mean_token_accuracy": 0.1804538369178772,
"num_tokens": 4689566.0,
"step": 1940
},
{
"entropy": 5.852392339706421,
"epoch": 0.12505625924258987,
"grad_norm": 1.015625,
"learning_rate": 0.000398726998750589,
"loss": 5.6228,
"mean_token_accuracy": 0.17476158291101457,
"num_tokens": 4701435.0,
"step": 1945
},
{
"entropy": 5.866113948822021,
"epoch": 0.1253777406288176,
"grad_norm": 1.0390625,
"learning_rate": 0.00039774132274725076,
"loss": 5.6331,
"mean_token_accuracy": 0.16894355714321135,
"num_tokens": 4712967.0,
"step": 1950
},
{
"entropy": 5.777560710906982,
"epoch": 0.12569922201504533,
"grad_norm": 0.94921875,
"learning_rate": 0.00039675228172854707,
"loss": 5.5104,
"mean_token_accuracy": 0.1788500264286995,
"num_tokens": 4726069.0,
"step": 1955
},
{
"entropy": 5.858283996582031,
"epoch": 0.12602070340127305,
"grad_norm": 1.0625,
"learning_rate": 0.0003957599028095371,
"loss": 5.6574,
"mean_token_accuracy": 0.1739150106906891,
"num_tokens": 4738152.0,
"step": 1960
},
{
"entropy": 5.825857877731323,
"epoch": 0.1263421847875008,
"grad_norm": 1.1171875,
"learning_rate": 0.00039476421319679017,
"loss": 5.5468,
"mean_token_accuracy": 0.18615946024656296,
"num_tokens": 4749534.0,
"step": 1965
},
{
"entropy": 5.84704909324646,
"epoch": 0.12666366617372854,
"grad_norm": 1.015625,
"learning_rate": 0.00039376524018764,
"loss": 5.6463,
"mean_token_accuracy": 0.17194101214408875,
"num_tokens": 4762366.0,
"step": 1970
},
{
"entropy": 5.774642133712769,
"epoch": 0.12698514755995627,
"grad_norm": 1.0625,
"learning_rate": 0.00039276301116943616,
"loss": 5.4578,
"mean_token_accuracy": 0.18943510353565216,
"num_tokens": 4773179.0,
"step": 1975
},
{
"entropy": 5.831448745727539,
"epoch": 0.12730662894618403,
"grad_norm": 0.9765625,
"learning_rate": 0.0003917575536187936,
"loss": 5.5963,
"mean_token_accuracy": 0.1808122232556343,
"num_tokens": 4785558.0,
"step": 1980
},
{
"entropy": 5.8009332656860355,
"epoch": 0.12762811033241175,
"grad_norm": 1.1328125,
"learning_rate": 0.00039074889510083894,
"loss": 5.4533,
"mean_token_accuracy": 0.18390973210334777,
"num_tokens": 4797091.0,
"step": 1985
},
{
"entropy": 5.769080257415771,
"epoch": 0.12794959171863948,
"grad_norm": 1.234375,
"learning_rate": 0.00038973706326845495,
"loss": 5.5238,
"mean_token_accuracy": 0.1799728289246559,
"num_tokens": 4808797.0,
"step": 1990
},
{
"entropy": 5.878709316253662,
"epoch": 0.12827107310486724,
"grad_norm": 1.0859375,
"learning_rate": 0.0003887220858615225,
"loss": 5.6114,
"mean_token_accuracy": 0.1800337553024292,
"num_tokens": 4820478.0,
"step": 1995
},
{
"entropy": 5.8096688747406,
"epoch": 0.12859255449109497,
"grad_norm": 1.125,
"learning_rate": 0.0003877039907061597,
"loss": 5.6022,
"mean_token_accuracy": 0.17257340848445893,
"num_tokens": 4831844.0,
"step": 2000
},
{
"entropy": 5.919677352905273,
"epoch": 0.1289140358773227,
"grad_norm": 1.1953125,
"learning_rate": 0.0003866828057139598,
"loss": 5.5825,
"mean_token_accuracy": 0.17797942608594894,
"num_tokens": 4842288.0,
"step": 2005
},
{
"entropy": 5.872733688354492,
"epoch": 0.12923551726355045,
"grad_norm": 0.984375,
"learning_rate": 0.00038565855888122503,
"loss": 5.7411,
"mean_token_accuracy": 0.17056984454393387,
"num_tokens": 4853948.0,
"step": 2010
},
{
"entropy": 5.858399724960327,
"epoch": 0.12955699864977818,
"grad_norm": 1.078125,
"learning_rate": 0.00038463127828819975,
"loss": 5.6022,
"mean_token_accuracy": 0.16876842379570006,
"num_tokens": 4866362.0,
"step": 2015
},
{
"entropy": 5.878206729888916,
"epoch": 0.1298784800360059,
"grad_norm": 1.140625,
"learning_rate": 0.00038360099209830043,
"loss": 5.5798,
"mean_token_accuracy": 0.1781992644071579,
"num_tokens": 4879210.0,
"step": 2020
},
{
"entropy": 5.840360450744629,
"epoch": 0.13019996142223364,
"grad_norm": 1.1328125,
"learning_rate": 0.0003825677285573433,
"loss": 5.5631,
"mean_token_accuracy": 0.17579235881567,
"num_tokens": 4889902.0,
"step": 2025
},
{
"entropy": 5.75586519241333,
"epoch": 0.1305214428084614,
"grad_norm": 1.0546875,
"learning_rate": 0.00038153151599277027,
"loss": 5.4272,
"mean_token_accuracy": 0.18684688210487366,
"num_tokens": 4901397.0,
"step": 2030
},
{
"entropy": 5.7365635395050045,
"epoch": 0.13084292419468913,
"grad_norm": 1.21875,
"learning_rate": 0.0003804923828128723,
"loss": 5.4988,
"mean_token_accuracy": 0.18069776743650437,
"num_tokens": 4913696.0,
"step": 2035
},
{
"entropy": 5.874265050888061,
"epoch": 0.13116440558091685,
"grad_norm": 0.9765625,
"learning_rate": 0.0003794503575060104,
"loss": 5.6402,
"mean_token_accuracy": 0.17227176576852798,
"num_tokens": 4926791.0,
"step": 2040
},
{
"entropy": 5.704010343551635,
"epoch": 0.1314858869671446,
"grad_norm": 1.0,
"learning_rate": 0.00037840546863983484,
"loss": 5.4826,
"mean_token_accuracy": 0.1833141714334488,
"num_tokens": 4939351.0,
"step": 2045
},
{
"entropy": 5.826752424240112,
"epoch": 0.13180736835337234,
"grad_norm": 1.03125,
"learning_rate": 0.0003773577448605015,
"loss": 5.5714,
"mean_token_accuracy": 0.17286380082368852,
"num_tokens": 4950917.0,
"step": 2050
},
{
"entropy": 5.838059997558593,
"epoch": 0.13212884973960007,
"grad_norm": 1.0390625,
"learning_rate": 0.0003763072148918872,
"loss": 5.4334,
"mean_token_accuracy": 0.18617289364337922,
"num_tokens": 4961893.0,
"step": 2055
},
{
"entropy": 5.793173170089721,
"epoch": 0.13245033112582782,
"grad_norm": 1.078125,
"learning_rate": 0.0003752539075348017,
"loss": 5.6416,
"mean_token_accuracy": 0.17536002174019813,
"num_tokens": 4973444.0,
"step": 2060
},
{
"entropy": 5.7246537685394285,
"epoch": 0.13277181251205555,
"grad_norm": 1.03125,
"learning_rate": 0.00037419785166619817,
"loss": 5.4548,
"mean_token_accuracy": 0.1816334158182144,
"num_tokens": 4985747.0,
"step": 2065
},
{
"entropy": 5.820780515670776,
"epoch": 0.13309329389828328,
"grad_norm": 1.09375,
"learning_rate": 0.0003731390762383818,
"loss": 5.5141,
"mean_token_accuracy": 0.18240729123353958,
"num_tokens": 4996913.0,
"step": 2070
},
{
"entropy": 5.843408203125,
"epoch": 0.13341477528451104,
"grad_norm": 0.96484375,
"learning_rate": 0.0003720776102782158,
"loss": 5.6422,
"mean_token_accuracy": 0.17854170948266984,
"num_tokens": 5009047.0,
"step": 2075
},
{
"entropy": 5.83007435798645,
"epoch": 0.13373625667073877,
"grad_norm": 0.9921875,
"learning_rate": 0.00037101348288632555,
"loss": 5.6189,
"mean_token_accuracy": 0.17441239804029465,
"num_tokens": 5022510.0,
"step": 2080
},
{
"entropy": 5.867375993728638,
"epoch": 0.1340577380569665,
"grad_norm": 1.09375,
"learning_rate": 0.0003699467232363012,
"loss": 5.5291,
"mean_token_accuracy": 0.17958373576402664,
"num_tokens": 5032764.0,
"step": 2085
},
{
"entropy": 5.757033014297486,
"epoch": 0.13437921944319423,
"grad_norm": 1.0078125,
"learning_rate": 0.0003688773605738973,
"loss": 5.544,
"mean_token_accuracy": 0.1788751170039177,
"num_tokens": 5045527.0,
"step": 2090
},
{
"entropy": 5.856579065322876,
"epoch": 0.13470070082942198,
"grad_norm": 0.98828125,
"learning_rate": 0.00036780542421623134,
"loss": 5.6033,
"mean_token_accuracy": 0.1763172432780266,
"num_tokens": 5058521.0,
"step": 2095
},
{
"entropy": 5.742293071746826,
"epoch": 0.1350221822156497,
"grad_norm": 1.1015625,
"learning_rate": 0.0003667309435509802,
"loss": 5.4872,
"mean_token_accuracy": 0.1765799954533577,
"num_tokens": 5071261.0,
"step": 2100
},
{
"entropy": 5.828065490722656,
"epoch": 0.13534366360187744,
"grad_norm": 0.9921875,
"learning_rate": 0.0003656539480355741,
"loss": 5.5371,
"mean_token_accuracy": 0.17912457138299942,
"num_tokens": 5084214.0,
"step": 2105
},
{
"entropy": 5.722700548171997,
"epoch": 0.1356651449881052,
"grad_norm": 1.015625,
"learning_rate": 0.0003645744671963891,
"loss": 5.4465,
"mean_token_accuracy": 0.1847703978419304,
"num_tokens": 5095124.0,
"step": 2110
},
{
"entropy": 5.777438449859619,
"epoch": 0.13598662637433293,
"grad_norm": 1.0546875,
"learning_rate": 0.0003634925306279376,
"loss": 5.4986,
"mean_token_accuracy": 0.18323094844818116,
"num_tokens": 5107563.0,
"step": 2115
},
{
"entropy": 5.89500994682312,
"epoch": 0.13630810776056065,
"grad_norm": 0.99609375,
"learning_rate": 0.0003624081679920574,
"loss": 5.6492,
"mean_token_accuracy": 0.17285479754209518,
"num_tokens": 5120170.0,
"step": 2120
},
{
"entropy": 5.830893707275391,
"epoch": 0.1366295891467884,
"grad_norm": 1.078125,
"learning_rate": 0.0003613214090170977,
"loss": 5.5751,
"mean_token_accuracy": 0.17507488578557967,
"num_tokens": 5133273.0,
"step": 2125
},
{
"entropy": 5.836175107955933,
"epoch": 0.13695107053301614,
"grad_norm": 1.015625,
"learning_rate": 0.0003602322834971048,
"loss": 5.517,
"mean_token_accuracy": 0.1816059961915016,
"num_tokens": 5143975.0,
"step": 2130
},
{
"entropy": 5.773233890533447,
"epoch": 0.13727255191924387,
"grad_norm": 1.03125,
"learning_rate": 0.0003591408212910051,
"loss": 5.5724,
"mean_token_accuracy": 0.1769774705171585,
"num_tokens": 5156924.0,
"step": 2135
},
{
"entropy": 5.878602504730225,
"epoch": 0.13759403330547162,
"grad_norm": 1.1640625,
"learning_rate": 0.0003580470523217863,
"loss": 5.5706,
"mean_token_accuracy": 0.18045302480459213,
"num_tokens": 5168639.0,
"step": 2140
},
{
"entropy": 5.906446743011474,
"epoch": 0.13791551469169935,
"grad_norm": 1.03125,
"learning_rate": 0.0003569510065756771,
"loss": 5.5815,
"mean_token_accuracy": 0.17343540787696837,
"num_tokens": 5180657.0,
"step": 2145
},
{
"entropy": 5.691700077056884,
"epoch": 0.13823699607792708,
"grad_norm": 0.98828125,
"learning_rate": 0.0003558527141013254,
"loss": 5.4185,
"mean_token_accuracy": 0.19074572175741195,
"num_tokens": 5193228.0,
"step": 2150
},
{
"entropy": 5.75026216506958,
"epoch": 0.13855847746415484,
"grad_norm": 1.125,
"learning_rate": 0.0003547522050089742,
"loss": 5.4512,
"mean_token_accuracy": 0.18468687683343887,
"num_tokens": 5204033.0,
"step": 2155
},
{
"entropy": 5.78372540473938,
"epoch": 0.13887995885038257,
"grad_norm": 0.98046875,
"learning_rate": 0.00035364950946963606,
"loss": 5.4935,
"mean_token_accuracy": 0.18386655300855637,
"num_tokens": 5215648.0,
"step": 2160
},
{
"entropy": 5.642017412185669,
"epoch": 0.1392014402366103,
"grad_norm": 1.015625,
"learning_rate": 0.0003525446577142663,
"loss": 5.4377,
"mean_token_accuracy": 0.18879669159650803,
"num_tokens": 5227222.0,
"step": 2165
},
{
"entropy": 5.773434734344482,
"epoch": 0.13952292162283803,
"grad_norm": 1.15625,
"learning_rate": 0.00035143768003293395,
"loss": 5.5372,
"mean_token_accuracy": 0.1755597859621048,
"num_tokens": 5239471.0,
"step": 2170
},
{
"entropy": 5.804629898071289,
"epoch": 0.13984440300906578,
"grad_norm": 0.96875,
"learning_rate": 0.0003503286067739913,
"loss": 5.5917,
"mean_token_accuracy": 0.18128340542316437,
"num_tokens": 5251824.0,
"step": 2175
},
{
"entropy": 5.975850200653076,
"epoch": 0.1401658843952935,
"grad_norm": 1.0234375,
"learning_rate": 0.00034921746834324193,
"loss": 5.6202,
"mean_token_accuracy": 0.17198764234781266,
"num_tokens": 5263868.0,
"step": 2180
},
{
"entropy": 5.762776851654053,
"epoch": 0.14048736578152124,
"grad_norm": 1.046875,
"learning_rate": 0.0003481042952031072,
"loss": 5.4968,
"mean_token_accuracy": 0.18749105483293532,
"num_tokens": 5275850.0,
"step": 2185
},
{
"entropy": 5.784327030181885,
"epoch": 0.140808847167749,
"grad_norm": 1.0390625,
"learning_rate": 0.0003469891178717911,
"loss": 5.5442,
"mean_token_accuracy": 0.18206566125154494,
"num_tokens": 5287802.0,
"step": 2190
},
{
"entropy": 5.898681354522705,
"epoch": 0.14113032855397672,
"grad_norm": 1.0859375,
"learning_rate": 0.0003458719669224436,
"loss": 5.6004,
"mean_token_accuracy": 0.17990543842315673,
"num_tokens": 5299175.0,
"step": 2195
},
{
"entropy": 5.780115461349487,
"epoch": 0.14145180994020445,
"grad_norm": 1.1015625,
"learning_rate": 0.0003447528729823221,
"loss": 5.5065,
"mean_token_accuracy": 0.18278697282075881,
"num_tokens": 5312817.0,
"step": 2200
},
{
"entropy": 5.799724388122558,
"epoch": 0.1417732913264322,
"grad_norm": 0.98046875,
"learning_rate": 0.0003436318667319525,
"loss": 5.5411,
"mean_token_accuracy": 0.17945564091205596,
"num_tokens": 5324342.0,
"step": 2205
},
{
"entropy": 5.73377366065979,
"epoch": 0.14209477271265994,
"grad_norm": 0.921875,
"learning_rate": 0.00034250897890428716,
"loss": 5.5726,
"mean_token_accuracy": 0.18047667294740677,
"num_tokens": 5338285.0,
"step": 2210
},
{
"entropy": 5.805589962005615,
"epoch": 0.14241625409888767,
"grad_norm": 1.1171875,
"learning_rate": 0.0003413842402838633,
"loss": 5.4702,
"mean_token_accuracy": 0.18539964705705642,
"num_tokens": 5349366.0,
"step": 2215
},
{
"entropy": 5.857856798171997,
"epoch": 0.14273773548511542,
"grad_norm": 0.98046875,
"learning_rate": 0.00034025768170595834,
"loss": 5.5252,
"mean_token_accuracy": 0.17573347240686416,
"num_tokens": 5361625.0,
"step": 2220
},
{
"entropy": 5.753371334075927,
"epoch": 0.14305921687134315,
"grad_norm": 0.96875,
"learning_rate": 0.0003391293340557446,
"loss": 5.4823,
"mean_token_accuracy": 0.19018028378486634,
"num_tokens": 5373546.0,
"step": 2225
},
{
"entropy": 5.79620246887207,
"epoch": 0.14338069825757088,
"grad_norm": 1.171875,
"learning_rate": 0.0003379992282674431,
"loss": 5.4999,
"mean_token_accuracy": 0.17952882945537568,
"num_tokens": 5384949.0,
"step": 2230
},
{
"entropy": 5.787704944610596,
"epoch": 0.1437021796437986,
"grad_norm": 1.0,
"learning_rate": 0.0003368673953234749,
"loss": 5.5081,
"mean_token_accuracy": 0.17685756981372833,
"num_tokens": 5398436.0,
"step": 2235
},
{
"entropy": 5.752358722686767,
"epoch": 0.14402366103002637,
"grad_norm": 1.0546875,
"learning_rate": 0.00033573386625361176,
"loss": 5.5063,
"mean_token_accuracy": 0.18653873801231385,
"num_tokens": 5410382.0,
"step": 2240
},
{
"entropy": 5.776981163024902,
"epoch": 0.1443451424162541,
"grad_norm": 0.98828125,
"learning_rate": 0.00033459867213412567,
"loss": 5.4852,
"mean_token_accuracy": 0.18849310427904128,
"num_tokens": 5422964.0,
"step": 2245
},
{
"entropy": 5.776259326934815,
"epoch": 0.14466662380248183,
"grad_norm": 1.03125,
"learning_rate": 0.000333461844086937,
"loss": 5.5186,
"mean_token_accuracy": 0.18011581003665925,
"num_tokens": 5434071.0,
"step": 2250
},
{
"entropy": 5.799129438400269,
"epoch": 0.14498810518870958,
"grad_norm": 0.96875,
"learning_rate": 0.00033232341327876097,
"loss": 5.4723,
"mean_token_accuracy": 0.1915254294872284,
"num_tokens": 5444868.0,
"step": 2255
},
{
"entropy": 5.70671238899231,
"epoch": 0.1453095865749373,
"grad_norm": 1.0546875,
"learning_rate": 0.0003311834109202531,
"loss": 5.464,
"mean_token_accuracy": 0.17862757444381713,
"num_tokens": 5457110.0,
"step": 2260
},
{
"entropy": 5.701373052597046,
"epoch": 0.14563106796116504,
"grad_norm": 1.0234375,
"learning_rate": 0.00033004186826515416,
"loss": 5.3783,
"mean_token_accuracy": 0.18717634528875352,
"num_tokens": 5467699.0,
"step": 2265
},
{
"entropy": 5.828847599029541,
"epoch": 0.1459525493473928,
"grad_norm": 0.9921875,
"learning_rate": 0.0003288988166094324,
"loss": 5.5679,
"mean_token_accuracy": 0.18301764577627183,
"num_tokens": 5479224.0,
"step": 2270
},
{
"entropy": 5.806013059616089,
"epoch": 0.14627403073362052,
"grad_norm": 1.109375,
"learning_rate": 0.00032775428729042656,
"loss": 5.4358,
"mean_token_accuracy": 0.1843643754720688,
"num_tokens": 5491108.0,
"step": 2275
},
{
"entropy": 5.745375919342041,
"epoch": 0.14659551211984825,
"grad_norm": 1.0078125,
"learning_rate": 0.000326608311685986,
"loss": 5.4586,
"mean_token_accuracy": 0.18050407618284225,
"num_tokens": 5503794.0,
"step": 2280
},
{
"entropy": 5.763010025024414,
"epoch": 0.146916993506076,
"grad_norm": 1.1328125,
"learning_rate": 0.0003254609212136108,
"loss": 5.5078,
"mean_token_accuracy": 0.1771639108657837,
"num_tokens": 5515307.0,
"step": 2285
},
{
"entropy": 5.75267653465271,
"epoch": 0.14723847489230374,
"grad_norm": 1.1171875,
"learning_rate": 0.00032431214732959036,
"loss": 5.4366,
"mean_token_accuracy": 0.18485282659530639,
"num_tokens": 5527279.0,
"step": 2290
},
{
"entropy": 5.822976732254029,
"epoch": 0.14755995627853147,
"grad_norm": 1.0859375,
"learning_rate": 0.000323162021528141,
"loss": 5.4664,
"mean_token_accuracy": 0.18673109114170075,
"num_tokens": 5537732.0,
"step": 2295
},
{
"entropy": 5.692873430252075,
"epoch": 0.1478814376647592,
"grad_norm": 0.984375,
"learning_rate": 0.00032201057534054264,
"loss": 5.5275,
"mean_token_accuracy": 0.18040425479412078,
"num_tokens": 5549770.0,
"step": 2300
},
{
"entropy": 5.742526388168335,
"epoch": 0.14820291905098695,
"grad_norm": 1.0546875,
"learning_rate": 0.00032085784033427414,
"loss": 5.4671,
"mean_token_accuracy": 0.1811862215399742,
"num_tokens": 5561295.0,
"step": 2305
},
{
"entropy": 5.7422816276550295,
"epoch": 0.14852440043721468,
"grad_norm": 1.1015625,
"learning_rate": 0.0003197038481121478,
"loss": 5.4238,
"mean_token_accuracy": 0.18678140938282012,
"num_tokens": 5573560.0,
"step": 2310
},
{
"entropy": 5.710636758804322,
"epoch": 0.1488458818234424,
"grad_norm": 0.93359375,
"learning_rate": 0.0003185486303114436,
"loss": 5.5006,
"mean_token_accuracy": 0.1786792904138565,
"num_tokens": 5585599.0,
"step": 2315
},
{
"entropy": 5.813146781921387,
"epoch": 0.14916736320967017,
"grad_norm": 1.0625,
"learning_rate": 0.0003173922186030409,
"loss": 5.5171,
"mean_token_accuracy": 0.18085834383964539,
"num_tokens": 5597229.0,
"step": 2320
},
{
"entropy": 5.760472679138184,
"epoch": 0.1494888445958979,
"grad_norm": 1.0546875,
"learning_rate": 0.000316234644690551,
"loss": 5.5202,
"mean_token_accuracy": 0.1810265526175499,
"num_tokens": 5609233.0,
"step": 2325
},
{
"entropy": 5.704453706741333,
"epoch": 0.14981032598212563,
"grad_norm": 1.0,
"learning_rate": 0.0003150759403094473,
"loss": 5.4332,
"mean_token_accuracy": 0.1881174549460411,
"num_tokens": 5621557.0,
"step": 2330
},
{
"entropy": 5.765605020523071,
"epoch": 0.15013180736835338,
"grad_norm": 1.0703125,
"learning_rate": 0.00031391613722619587,
"loss": 5.5073,
"mean_token_accuracy": 0.1858796000480652,
"num_tokens": 5632661.0,
"step": 2335
},
{
"entropy": 5.725235271453857,
"epoch": 0.1504532887545811,
"grad_norm": 1.03125,
"learning_rate": 0.000312755267237384,
"loss": 5.4224,
"mean_token_accuracy": 0.18897470086812973,
"num_tokens": 5643904.0,
"step": 2340
},
{
"entropy": 5.719667053222656,
"epoch": 0.15077477014080884,
"grad_norm": 1.0390625,
"learning_rate": 0.0003115933621688488,
"loss": 5.3622,
"mean_token_accuracy": 0.19180522561073304,
"num_tokens": 5655099.0,
"step": 2345
},
{
"entropy": 5.694875764846802,
"epoch": 0.1510962515270366,
"grad_norm": 0.953125,
"learning_rate": 0.00031043045387480487,
"loss": 5.4741,
"mean_token_accuracy": 0.18500417172908784,
"num_tokens": 5669107.0,
"step": 2350
},
{
"entropy": 5.850914573669433,
"epoch": 0.15141773291326432,
"grad_norm": 1.171875,
"learning_rate": 0.0003092665742369703,
"loss": 5.527,
"mean_token_accuracy": 0.1840333580970764,
"num_tokens": 5679889.0,
"step": 2355
},
{
"entropy": 5.680944347381592,
"epoch": 0.15173921429949205,
"grad_norm": 1.046875,
"learning_rate": 0.00030810175516369343,
"loss": 5.4678,
"mean_token_accuracy": 0.18365078866481782,
"num_tokens": 5692779.0,
"step": 2360
},
{
"entropy": 5.853222942352295,
"epoch": 0.1520606956857198,
"grad_norm": 1.0625,
"learning_rate": 0.0003069360285890775,
"loss": 5.5623,
"mean_token_accuracy": 0.18162844628095626,
"num_tokens": 5704012.0,
"step": 2365
},
{
"entropy": 5.825670146942139,
"epoch": 0.15238217707194754,
"grad_norm": 1.078125,
"learning_rate": 0.00030576942647210547,
"loss": 5.5856,
"mean_token_accuracy": 0.18198317289352417,
"num_tokens": 5716863.0,
"step": 2370
},
{
"entropy": 5.768058156967163,
"epoch": 0.15270365845817527,
"grad_norm": 1.0625,
"learning_rate": 0.00030460198079576355,
"loss": 5.4689,
"mean_token_accuracy": 0.18682965785264968,
"num_tokens": 5729237.0,
"step": 2375
},
{
"entropy": 5.820621395111084,
"epoch": 0.153025139844403,
"grad_norm": 1.171875,
"learning_rate": 0.0003034337235661648,
"loss": 5.4814,
"mean_token_accuracy": 0.18316928297281265,
"num_tokens": 5741117.0,
"step": 2380
},
{
"entropy": 5.730013799667359,
"epoch": 0.15334662123063075,
"grad_norm": 1.09375,
"learning_rate": 0.0003022646868116714,
"loss": 5.5308,
"mean_token_accuracy": 0.18377971053123474,
"num_tokens": 5752290.0,
"step": 2385
},
{
"entropy": 5.798203802108764,
"epoch": 0.15366810261685848,
"grad_norm": 1.0859375,
"learning_rate": 0.0003010949025820163,
"loss": 5.4525,
"mean_token_accuracy": 0.19051013588905336,
"num_tokens": 5764936.0,
"step": 2390
},
{
"entropy": 5.646590757369995,
"epoch": 0.1539895840030862,
"grad_norm": 1.0,
"learning_rate": 0.0002999244029474252,
"loss": 5.3973,
"mean_token_accuracy": 0.19195785075426103,
"num_tokens": 5777179.0,
"step": 2395
},
{
"entropy": 5.7870406150817875,
"epoch": 0.15431106538931397,
"grad_norm": 1.078125,
"learning_rate": 0.00029875321999773684,
"loss": 5.5314,
"mean_token_accuracy": 0.1770056590437889,
"num_tokens": 5788840.0,
"step": 2400
},
{
"entropy": 5.711698436737061,
"epoch": 0.1546325467755417,
"grad_norm": 1.0546875,
"learning_rate": 0.00029758138584152333,
"loss": 5.4395,
"mean_token_accuracy": 0.18638285249471664,
"num_tokens": 5800614.0,
"step": 2405
},
{
"entropy": 5.702682018280029,
"epoch": 0.15495402816176942,
"grad_norm": 0.953125,
"learning_rate": 0.0002964089326052102,
"loss": 5.3987,
"mean_token_accuracy": 0.1937675043940544,
"num_tokens": 5812293.0,
"step": 2410
},
{
"entropy": 5.730542373657227,
"epoch": 0.15527550954799718,
"grad_norm": 1.0625,
"learning_rate": 0.0002952358924321949,
"loss": 5.4695,
"mean_token_accuracy": 0.18649707436561586,
"num_tokens": 5823308.0,
"step": 2415
},
{
"entropy": 5.675483322143554,
"epoch": 0.1555969909342249,
"grad_norm": 1.0546875,
"learning_rate": 0.00029406229748196657,
"loss": 5.3871,
"mean_token_accuracy": 0.18851224035024644,
"num_tokens": 5836259.0,
"step": 2420
},
{
"entropy": 5.658445405960083,
"epoch": 0.15591847232045264,
"grad_norm": 1.0859375,
"learning_rate": 0.0002928881799292235,
"loss": 5.3248,
"mean_token_accuracy": 0.19337240010499954,
"num_tokens": 5848261.0,
"step": 2425
},
{
"entropy": 5.733229446411133,
"epoch": 0.1562399537066804,
"grad_norm": 1.0546875,
"learning_rate": 0.00029171357196299154,
"loss": 5.3978,
"mean_token_accuracy": 0.20093960613012313,
"num_tokens": 5859534.0,
"step": 2430
},
{
"entropy": 5.70960545539856,
"epoch": 0.15656143509290812,
"grad_norm": 1.0546875,
"learning_rate": 0.0002905385057857414,
"loss": 5.5448,
"mean_token_accuracy": 0.1782195284962654,
"num_tokens": 5873765.0,
"step": 2435
},
{
"entropy": 5.8176521301269535,
"epoch": 0.15688291647913585,
"grad_norm": 1.171875,
"learning_rate": 0.0002893630136125058,
"loss": 5.5264,
"mean_token_accuracy": 0.17921065986156465,
"num_tokens": 5884865.0,
"step": 2440
},
{
"entropy": 5.692349100112915,
"epoch": 0.15720439786536358,
"grad_norm": 1.078125,
"learning_rate": 0.0002881871276699967,
"loss": 5.4017,
"mean_token_accuracy": 0.19409674108028413,
"num_tokens": 5896364.0,
"step": 2445
},
{
"entropy": 5.628628826141357,
"epoch": 0.15752587925159134,
"grad_norm": 1.0078125,
"learning_rate": 0.00028701088019572114,
"loss": 5.3224,
"mean_token_accuracy": 0.1953787237405777,
"num_tokens": 5907605.0,
"step": 2450
},
{
"entropy": 5.750797414779663,
"epoch": 0.15784736063781907,
"grad_norm": 1.0234375,
"learning_rate": 0.0002858343034370977,
"loss": 5.4426,
"mean_token_accuracy": 0.19289697110652923,
"num_tokens": 5919018.0,
"step": 2455
},
{
"entropy": 5.688705921173096,
"epoch": 0.1581688420240468,
"grad_norm": 1.0703125,
"learning_rate": 0.00028465742965057267,
"loss": 5.4072,
"mean_token_accuracy": 0.1973178803920746,
"num_tokens": 5930821.0,
"step": 2460
},
{
"entropy": 5.699823617935181,
"epoch": 0.15849032341027455,
"grad_norm": 0.96875,
"learning_rate": 0.00028348029110073533,
"loss": 5.4522,
"mean_token_accuracy": 0.18845292925834656,
"num_tokens": 5944101.0,
"step": 2465
},
{
"entropy": 5.876083564758301,
"epoch": 0.15881180479650228,
"grad_norm": 0.8984375,
"learning_rate": 0.00028230292005943365,
"loss": 5.5191,
"mean_token_accuracy": 0.17925772368907927,
"num_tokens": 5955728.0,
"step": 2470
},
{
"entropy": 5.74138240814209,
"epoch": 0.15913328618273,
"grad_norm": 1.1015625,
"learning_rate": 0.00028112534880488945,
"loss": 5.3934,
"mean_token_accuracy": 0.19208399653434755,
"num_tokens": 5968479.0,
"step": 2475
},
{
"entropy": 5.646874475479126,
"epoch": 0.15945476756895777,
"grad_norm": 0.98046875,
"learning_rate": 0.0002799476096208137,
"loss": 5.372,
"mean_token_accuracy": 0.19051045328378677,
"num_tokens": 5981093.0,
"step": 2480
},
{
"entropy": 5.7319427013397215,
"epoch": 0.1597762489551855,
"grad_norm": 1.015625,
"learning_rate": 0.00027876973479552087,
"loss": 5.4665,
"mean_token_accuracy": 0.1835111767053604,
"num_tokens": 5993199.0,
"step": 2485
},
{
"entropy": 5.79546012878418,
"epoch": 0.16009773034141322,
"grad_norm": 1.09375,
"learning_rate": 0.00027759175662104424,
"loss": 5.5146,
"mean_token_accuracy": 0.18165112733840943,
"num_tokens": 6006612.0,
"step": 2490
},
{
"entropy": 5.73551115989685,
"epoch": 0.16041921172764098,
"grad_norm": 1.0078125,
"learning_rate": 0.0002764137073922508,
"loss": 5.4227,
"mean_token_accuracy": 0.19056462049484252,
"num_tokens": 6019080.0,
"step": 2495
},
{
"entropy": 5.7126837253570555,
"epoch": 0.1607406931138687,
"grad_norm": 1.0703125,
"learning_rate": 0.00027523561940595505,
"loss": 5.4349,
"mean_token_accuracy": 0.1902421310544014,
"num_tokens": 6030566.0,
"step": 2500
},
{
"entropy": 5.601206684112549,
"epoch": 0.16106217450009644,
"grad_norm": 1.0390625,
"learning_rate": 0.0002740575249600342,
"loss": 5.3337,
"mean_token_accuracy": 0.1942153200507164,
"num_tokens": 6042125.0,
"step": 2505
},
{
"entropy": 5.734588241577148,
"epoch": 0.1613836558863242,
"grad_norm": 1.0625,
"learning_rate": 0.00027287945635254263,
"loss": 5.4454,
"mean_token_accuracy": 0.1834137335419655,
"num_tokens": 6054520.0,
"step": 2510
},
{
"entropy": 5.659747076034546,
"epoch": 0.16170513727255192,
"grad_norm": 0.98828125,
"learning_rate": 0.00027170144588082635,
"loss": 5.2951,
"mean_token_accuracy": 0.19772608280181886,
"num_tokens": 6065637.0,
"step": 2515
},
{
"entropy": 5.733216714859009,
"epoch": 0.16202661865877965,
"grad_norm": 1.078125,
"learning_rate": 0.00027052352584063763,
"loss": 5.4402,
"mean_token_accuracy": 0.18665452301502228,
"num_tokens": 6076829.0,
"step": 2520
},
{
"entropy": 5.740676689147949,
"epoch": 0.16234810004500738,
"grad_norm": 1.0546875,
"learning_rate": 0.00026934572852524907,
"loss": 5.4196,
"mean_token_accuracy": 0.19163961708545685,
"num_tokens": 6089695.0,
"step": 2525
},
{
"entropy": 5.748185825347901,
"epoch": 0.16266958143123514,
"grad_norm": 1.0390625,
"learning_rate": 0.00026816808622456937,
"loss": 5.4212,
"mean_token_accuracy": 0.19583147317171096,
"num_tokens": 6100758.0,
"step": 2530
},
{
"entropy": 5.8306163311004635,
"epoch": 0.16299106281746287,
"grad_norm": 1.0234375,
"learning_rate": 0.0002669906312242569,
"loss": 5.514,
"mean_token_accuracy": 0.1832474648952484,
"num_tokens": 6112447.0,
"step": 2535
},
{
"entropy": 5.742656660079956,
"epoch": 0.1633125442036906,
"grad_norm": 1.109375,
"learning_rate": 0.00026581339580483525,
"loss": 5.4434,
"mean_token_accuracy": 0.18145051151514052,
"num_tokens": 6124152.0,
"step": 2540
},
{
"entropy": 5.761282014846802,
"epoch": 0.16363402558991835,
"grad_norm": 1.015625,
"learning_rate": 0.0002646364122408082,
"loss": 5.4315,
"mean_token_accuracy": 0.18913477808237075,
"num_tokens": 6136612.0,
"step": 2545
},
{
"entropy": 5.829135751724243,
"epoch": 0.16395550697614608,
"grad_norm": 1.015625,
"learning_rate": 0.0002634597127997749,
"loss": 5.5754,
"mean_token_accuracy": 0.1779845491051674,
"num_tokens": 6149423.0,
"step": 2550
},
{
"entropy": 5.7153746604919435,
"epoch": 0.1642769883623738,
"grad_norm": 1.1171875,
"learning_rate": 0.0002622833297415445,
"loss": 5.3294,
"mean_token_accuracy": 0.1932559937238693,
"num_tokens": 6161156.0,
"step": 2555
},
{
"entropy": 5.895244407653808,
"epoch": 0.16459846974860157,
"grad_norm": 1.3984375,
"learning_rate": 0.0002611072953172531,
"loss": 5.61,
"mean_token_accuracy": 0.1807553857564926,
"num_tokens": 6172953.0,
"step": 2560
},
{
"entropy": 5.767319440841675,
"epoch": 0.1649199511348293,
"grad_norm": 0.9453125,
"learning_rate": 0.00025993164176847845,
"loss": 5.4331,
"mean_token_accuracy": 0.18407219350337983,
"num_tokens": 6186432.0,
"step": 2565
},
{
"entropy": 5.679287910461426,
"epoch": 0.16524143252105702,
"grad_norm": 1.1015625,
"learning_rate": 0.0002587564013263564,
"loss": 5.3161,
"mean_token_accuracy": 0.19006088376045227,
"num_tokens": 6197690.0,
"step": 2570
},
{
"entropy": 5.660651779174804,
"epoch": 0.16556291390728478,
"grad_norm": 1.046875,
"learning_rate": 0.0002575816062106974,
"loss": 5.3123,
"mean_token_accuracy": 0.19503892362117767,
"num_tokens": 6208591.0,
"step": 2575
},
{
"entropy": 5.713583612442017,
"epoch": 0.1658843952935125,
"grad_norm": 1.046875,
"learning_rate": 0.00025640728862910293,
"loss": 5.4253,
"mean_token_accuracy": 0.18537079840898513,
"num_tokens": 6221017.0,
"step": 2580
},
{
"entropy": 5.661649370193482,
"epoch": 0.16620587667974024,
"grad_norm": 1.1015625,
"learning_rate": 0.00025523348077608285,
"loss": 5.4697,
"mean_token_accuracy": 0.18130361884832383,
"num_tokens": 6232652.0,
"step": 2585
},
{
"entropy": 5.719376134872436,
"epoch": 0.16652735806596797,
"grad_norm": 1.1953125,
"learning_rate": 0.00025406021483217225,
"loss": 5.367,
"mean_token_accuracy": 0.19203415215015412,
"num_tokens": 6244618.0,
"step": 2590
},
{
"entropy": 5.705153083801269,
"epoch": 0.16684883945219572,
"grad_norm": 1.0859375,
"learning_rate": 0.00025288752296304963,
"loss": 5.2581,
"mean_token_accuracy": 0.2053500160574913,
"num_tokens": 6255576.0,
"step": 2595
},
{
"entropy": 5.648711156845093,
"epoch": 0.16717032083842345,
"grad_norm": 1.0,
"learning_rate": 0.000251715437318655,
"loss": 5.3699,
"mean_token_accuracy": 0.19053217470645906,
"num_tokens": 6268190.0,
"step": 2600
},
{
"entropy": 5.7031269550323485,
"epoch": 0.16749180222465118,
"grad_norm": 1.046875,
"learning_rate": 0.0002505439900323084,
"loss": 5.3833,
"mean_token_accuracy": 0.18957084864377977,
"num_tokens": 6279646.0,
"step": 2605
},
{
"entropy": 5.828313684463501,
"epoch": 0.16781328361087894,
"grad_norm": 1.09375,
"learning_rate": 0.00024937321321982894,
"loss": 5.5176,
"mean_token_accuracy": 0.17979485392570496,
"num_tokens": 6291057.0,
"step": 2610
},
{
"entropy": 5.695797395706177,
"epoch": 0.16813476499710667,
"grad_norm": 1.03125,
"learning_rate": 0.00024820313897865433,
"loss": 5.3587,
"mean_token_accuracy": 0.19424397200345994,
"num_tokens": 6302198.0,
"step": 2615
},
{
"entropy": 5.648639726638794,
"epoch": 0.1684562463833344,
"grad_norm": 0.9375,
"learning_rate": 0.00024703379938696105,
"loss": 5.3779,
"mean_token_accuracy": 0.18908071666955947,
"num_tokens": 6314560.0,
"step": 2620
},
{
"entropy": 5.705744457244873,
"epoch": 0.16877772776956215,
"grad_norm": 1.0546875,
"learning_rate": 0.00024586522650278447,
"loss": 5.3798,
"mean_token_accuracy": 0.1917642667889595,
"num_tokens": 6326026.0,
"step": 2625
},
{
"entropy": 5.749826192855835,
"epoch": 0.16909920915578988,
"grad_norm": 1.0859375,
"learning_rate": 0.00024469745236314064,
"loss": 5.5124,
"mean_token_accuracy": 0.17833657711744308,
"num_tokens": 6339344.0,
"step": 2630
},
{
"entropy": 5.73265266418457,
"epoch": 0.1694206905420176,
"grad_norm": 1.1484375,
"learning_rate": 0.00024353050898314767,
"loss": 5.4649,
"mean_token_accuracy": 0.19097912460565566,
"num_tokens": 6351246.0,
"step": 2635
},
{
"entropy": 5.771390914916992,
"epoch": 0.16974217192824537,
"grad_norm": 1.0703125,
"learning_rate": 0.00024236442835514743,
"loss": 5.4037,
"mean_token_accuracy": 0.1888517364859581,
"num_tokens": 6362424.0,
"step": 2640
},
{
"entropy": 5.794133853912354,
"epoch": 0.1700636533144731,
"grad_norm": 1.0703125,
"learning_rate": 0.00024119924244782965,
"loss": 5.5311,
"mean_token_accuracy": 0.17905715107917786,
"num_tokens": 6374646.0,
"step": 2645
},
{
"entropy": 5.666694450378418,
"epoch": 0.17038513470070082,
"grad_norm": 0.99609375,
"learning_rate": 0.00024003498320535462,
"loss": 5.3554,
"mean_token_accuracy": 0.19141269624233245,
"num_tokens": 6386117.0,
"step": 2650
},
{
"entropy": 5.707786941528321,
"epoch": 0.17070661608692855,
"grad_norm": 1.09375,
"learning_rate": 0.00023887168254647727,
"loss": 5.3578,
"mean_token_accuracy": 0.1878366157412529,
"num_tokens": 6397005.0,
"step": 2655
},
{
"entropy": 5.7389263153076175,
"epoch": 0.1710280974731563,
"grad_norm": 1.1484375,
"learning_rate": 0.00023770937236367308,
"loss": 5.3652,
"mean_token_accuracy": 0.1891992285847664,
"num_tokens": 6410268.0,
"step": 2660
},
{
"entropy": 5.761455535888672,
"epoch": 0.17134957885938404,
"grad_norm": 1.0078125,
"learning_rate": 0.00023654808452226278,
"loss": 5.4214,
"mean_token_accuracy": 0.188455431163311,
"num_tokens": 6422787.0,
"step": 2665
},
{
"entropy": 5.695436239242554,
"epoch": 0.17167106024561177,
"grad_norm": 1.03125,
"learning_rate": 0.00023538785085953912,
"loss": 5.428,
"mean_token_accuracy": 0.18696846067905426,
"num_tokens": 6435384.0,
"step": 2670
},
{
"entropy": 5.74292483329773,
"epoch": 0.17199254163183952,
"grad_norm": 1.078125,
"learning_rate": 0.00023422870318389404,
"loss": 5.4342,
"mean_token_accuracy": 0.19003283828496934,
"num_tokens": 6447335.0,
"step": 2675
},
{
"entropy": 5.636992788314819,
"epoch": 0.17231402301806725,
"grad_norm": 1.1484375,
"learning_rate": 0.0002330706732739468,
"loss": 5.1801,
"mean_token_accuracy": 0.20048911720514298,
"num_tokens": 6457989.0,
"step": 2680
},
{
"entropy": 5.6160484790802006,
"epoch": 0.17263550440429498,
"grad_norm": 1.1796875,
"learning_rate": 0.00023191379287767211,
"loss": 5.3063,
"mean_token_accuracy": 0.1947341576218605,
"num_tokens": 6468775.0,
"step": 2685
},
{
"entropy": 5.557216787338257,
"epoch": 0.17295698579052274,
"grad_norm": 1.0625,
"learning_rate": 0.0002307580937115305,
"loss": 5.2709,
"mean_token_accuracy": 0.19750789254903794,
"num_tokens": 6481561.0,
"step": 2690
},
{
"entropy": 5.626670455932617,
"epoch": 0.17327846717675047,
"grad_norm": 1.1015625,
"learning_rate": 0.00022960360745959846,
"loss": 5.3504,
"mean_token_accuracy": 0.19608103930950166,
"num_tokens": 6492677.0,
"step": 2695
},
{
"entropy": 5.676241064071656,
"epoch": 0.1735999485629782,
"grad_norm": 1.046875,
"learning_rate": 0.00022845036577269972,
"loss": 5.3735,
"mean_token_accuracy": 0.19294600784778596,
"num_tokens": 6504798.0,
"step": 2700
},
{
"entropy": 5.712233257293701,
"epoch": 0.17392142994920595,
"grad_norm": 1.015625,
"learning_rate": 0.00022729840026753777,
"loss": 5.4191,
"mean_token_accuracy": 0.1935994267463684,
"num_tokens": 6516659.0,
"step": 2705
},
{
"entropy": 5.661012363433838,
"epoch": 0.17424291133543368,
"grad_norm": 1.09375,
"learning_rate": 0.0002261477425258287,
"loss": 5.296,
"mean_token_accuracy": 0.19211649298667907,
"num_tokens": 6528717.0,
"step": 2710
},
{
"entropy": 5.627685976028443,
"epoch": 0.1745643927216614,
"grad_norm": 0.9296875,
"learning_rate": 0.0002249984240934358,
"loss": 5.3509,
"mean_token_accuracy": 0.19882777631282805,
"num_tokens": 6541624.0,
"step": 2715
},
{
"entropy": 5.692911291122437,
"epoch": 0.17488587410788917,
"grad_norm": 1.0234375,
"learning_rate": 0.00022385047647950464,
"loss": 5.2942,
"mean_token_accuracy": 0.1969117194414139,
"num_tokens": 6553716.0,
"step": 2720
},
{
"entropy": 5.636322021484375,
"epoch": 0.1752073554941169,
"grad_norm": 1.2109375,
"learning_rate": 0.0002227039311555986,
"loss": 5.2904,
"mean_token_accuracy": 0.19710214138031007,
"num_tokens": 6565685.0,
"step": 2725
},
{
"entropy": 5.730114555358886,
"epoch": 0.17552883688034462,
"grad_norm": 1.3125,
"learning_rate": 0.0002215588195548372,
"loss": 5.448,
"mean_token_accuracy": 0.1929459884762764,
"num_tokens": 6578965.0,
"step": 2730
},
{
"entropy": 5.663021898269653,
"epoch": 0.17585031826657235,
"grad_norm": 1.140625,
"learning_rate": 0.00022041517307103337,
"loss": 5.2461,
"mean_token_accuracy": 0.19922932833433152,
"num_tokens": 6590317.0,
"step": 2735
},
{
"entropy": 5.713327884674072,
"epoch": 0.1761717996528001,
"grad_norm": 1.171875,
"learning_rate": 0.0002192730230578331,
"loss": 5.4381,
"mean_token_accuracy": 0.19072858691215516,
"num_tokens": 6601509.0,
"step": 2740
},
{
"entropy": 5.741206502914428,
"epoch": 0.17649328103902784,
"grad_norm": 1.0625,
"learning_rate": 0.0002181324008278559,
"loss": 5.4519,
"mean_token_accuracy": 0.19128611981868743,
"num_tokens": 6612613.0,
"step": 2745
},
{
"entropy": 5.691315221786499,
"epoch": 0.17681476242525557,
"grad_norm": 1.109375,
"learning_rate": 0.00021699333765183655,
"loss": 5.3019,
"mean_token_accuracy": 0.19911172837018967,
"num_tokens": 6623818.0,
"step": 2750
},
{
"entropy": 5.619183492660523,
"epoch": 0.17713624381148332,
"grad_norm": 0.9453125,
"learning_rate": 0.0002158558647577673,
"loss": 5.2621,
"mean_token_accuracy": 0.19751902371644975,
"num_tokens": 6636463.0,
"step": 2755
},
{
"entropy": 5.705693531036377,
"epoch": 0.17745772519771105,
"grad_norm": 1.109375,
"learning_rate": 0.00021472001333004215,
"loss": 5.3928,
"mean_token_accuracy": 0.19049957990646363,
"num_tokens": 6648506.0,
"step": 2760
},
{
"entropy": 5.719524669647217,
"epoch": 0.17777920658393878,
"grad_norm": 0.9296875,
"learning_rate": 0.00021358581450860186,
"loss": 5.3622,
"mean_token_accuracy": 0.1973290517926216,
"num_tokens": 6661558.0,
"step": 2765
},
{
"entropy": 5.711318254470825,
"epoch": 0.17810068797016654,
"grad_norm": 1.0234375,
"learning_rate": 0.0002124532993880799,
"loss": 5.3269,
"mean_token_accuracy": 0.20065791308879852,
"num_tokens": 6673998.0,
"step": 2770
},
{
"entropy": 5.654186820983886,
"epoch": 0.17842216935639427,
"grad_norm": 1.0859375,
"learning_rate": 0.00021132249901695044,
"loss": 5.4083,
"mean_token_accuracy": 0.19524823278188705,
"num_tokens": 6685906.0,
"step": 2775
},
{
"entropy": 5.664220380783081,
"epoch": 0.178743650742622,
"grad_norm": 1.0625,
"learning_rate": 0.00021019344439667705,
"loss": 5.4163,
"mean_token_accuracy": 0.19513677507638932,
"num_tokens": 6698593.0,
"step": 2780
},
{
"entropy": 5.723659515380859,
"epoch": 0.17906513212884975,
"grad_norm": 1.0234375,
"learning_rate": 0.00020906616648086213,
"loss": 5.3185,
"mean_token_accuracy": 0.19421276450157166,
"num_tokens": 6709506.0,
"step": 2785
},
{
"entropy": 5.7294293403625485,
"epoch": 0.17938661351507748,
"grad_norm": 1.09375,
"learning_rate": 0.00020794069617439942,
"loss": 5.3475,
"mean_token_accuracy": 0.20169540941715242,
"num_tokens": 6720495.0,
"step": 2790
},
{
"entropy": 5.646097421646118,
"epoch": 0.1797080949013052,
"grad_norm": 1.0546875,
"learning_rate": 0.00020681706433262593,
"loss": 5.3664,
"mean_token_accuracy": 0.1922983258962631,
"num_tokens": 6732306.0,
"step": 2795
},
{
"entropy": 5.6273116111755375,
"epoch": 0.18002957628753294,
"grad_norm": 0.97265625,
"learning_rate": 0.00020569530176047602,
"loss": 5.2824,
"mean_token_accuracy": 0.2005715101957321,
"num_tokens": 6744920.0,
"step": 2800
},
{
"entropy": 5.628582763671875,
"epoch": 0.1803510576737607,
"grad_norm": 1.203125,
"learning_rate": 0.0002045754392116374,
"loss": 5.341,
"mean_token_accuracy": 0.19044844657182694,
"num_tokens": 6756294.0,
"step": 2805
},
{
"entropy": 5.765797519683838,
"epoch": 0.18067253905998842,
"grad_norm": 1.046875,
"learning_rate": 0.00020345750738770757,
"loss": 5.4344,
"mean_token_accuracy": 0.19234465807676315,
"num_tokens": 6767593.0,
"step": 2810
},
{
"entropy": 5.773240232467652,
"epoch": 0.18099402044621615,
"grad_norm": 1.1796875,
"learning_rate": 0.00020234153693735214,
"loss": 5.457,
"mean_token_accuracy": 0.18729385286569594,
"num_tokens": 6779113.0,
"step": 2815
},
{
"entropy": 5.639952182769775,
"epoch": 0.1813155018324439,
"grad_norm": 1.0859375,
"learning_rate": 0.0002012275584554647,
"loss": 5.3504,
"mean_token_accuracy": 0.1932524859905243,
"num_tokens": 6790590.0,
"step": 2820
},
{
"entropy": 5.636771392822266,
"epoch": 0.18163698321867164,
"grad_norm": 1.0859375,
"learning_rate": 0.00020011560248232803,
"loss": 5.2596,
"mean_token_accuracy": 0.19949929267168046,
"num_tokens": 6801938.0,
"step": 2825
},
{
"entropy": 5.724048662185669,
"epoch": 0.18195846460489937,
"grad_norm": 1.1015625,
"learning_rate": 0.00019900569950277692,
"loss": 5.4126,
"mean_token_accuracy": 0.1861017182469368,
"num_tokens": 6815376.0,
"step": 2830
},
{
"entropy": 5.770434141159058,
"epoch": 0.18227994599112712,
"grad_norm": 0.984375,
"learning_rate": 0.00019789787994536228,
"loss": 5.4036,
"mean_token_accuracy": 0.19645324498414993,
"num_tokens": 6827030.0,
"step": 2835
},
{
"entropy": 5.603908681869507,
"epoch": 0.18260142737735485,
"grad_norm": 1.0390625,
"learning_rate": 0.00019679217418151667,
"loss": 5.27,
"mean_token_accuracy": 0.19686641693115234,
"num_tokens": 6838576.0,
"step": 2840
},
{
"entropy": 5.6269402503967285,
"epoch": 0.18292290876358258,
"grad_norm": 1.015625,
"learning_rate": 0.00019568861252472236,
"loss": 5.3011,
"mean_token_accuracy": 0.19713620990514755,
"num_tokens": 6850562.0,
"step": 2845
},
{
"entropy": 5.750699758529663,
"epoch": 0.18324439014981034,
"grad_norm": 1.21875,
"learning_rate": 0.00019458722522967952,
"loss": 5.4364,
"mean_token_accuracy": 0.19009985029697418,
"num_tokens": 6862733.0,
"step": 2850
},
{
"entropy": 5.6633421897888185,
"epoch": 0.18356587153603807,
"grad_norm": 1.0859375,
"learning_rate": 0.00019348804249147723,
"loss": 5.2945,
"mean_token_accuracy": 0.20110946297645568,
"num_tokens": 6874360.0,
"step": 2855
},
{
"entropy": 5.641790533065796,
"epoch": 0.1838873529222658,
"grad_norm": 1.09375,
"learning_rate": 0.0001923910944447655,
"loss": 5.349,
"mean_token_accuracy": 0.1922568514943123,
"num_tokens": 6886210.0,
"step": 2860
},
{
"entropy": 5.693332004547119,
"epoch": 0.18420883430849355,
"grad_norm": 0.90234375,
"learning_rate": 0.00019129641116292928,
"loss": 5.4017,
"mean_token_accuracy": 0.18896787762641906,
"num_tokens": 6898798.0,
"step": 2865
},
{
"entropy": 5.723224687576294,
"epoch": 0.18453031569472128,
"grad_norm": 1.0859375,
"learning_rate": 0.00019020402265726343,
"loss": 5.3449,
"mean_token_accuracy": 0.19354059994220735,
"num_tokens": 6911228.0,
"step": 2870
},
{
"entropy": 5.721487712860108,
"epoch": 0.184851797080949,
"grad_norm": 1.0,
"learning_rate": 0.0001891139588761509,
"loss": 5.4023,
"mean_token_accuracy": 0.19011295437812806,
"num_tokens": 6923442.0,
"step": 2875
},
{
"entropy": 5.697617435455323,
"epoch": 0.18517327846717674,
"grad_norm": 1.109375,
"learning_rate": 0.00018802624970424076,
"loss": 5.4182,
"mean_token_accuracy": 0.1970663845539093,
"num_tokens": 6935365.0,
"step": 2880
},
{
"entropy": 5.717934799194336,
"epoch": 0.1854947598534045,
"grad_norm": 1.046875,
"learning_rate": 0.00018694092496162945,
"loss": 5.3855,
"mean_token_accuracy": 0.19063631892204286,
"num_tokens": 6946349.0,
"step": 2885
},
{
"entropy": 5.620476388931275,
"epoch": 0.18581624123963222,
"grad_norm": 1.015625,
"learning_rate": 0.00018585801440304306,
"loss": 5.3415,
"mean_token_accuracy": 0.19189786165952682,
"num_tokens": 6958656.0,
"step": 2890
},
{
"entropy": 5.667048168182373,
"epoch": 0.18613772262585995,
"grad_norm": 1.0546875,
"learning_rate": 0.00018477754771702165,
"loss": 5.2773,
"mean_token_accuracy": 0.19527566879987718,
"num_tokens": 6970435.0,
"step": 2895
},
{
"entropy": 5.670431089401245,
"epoch": 0.1864592040120877,
"grad_norm": 1.1171875,
"learning_rate": 0.00018369955452510506,
"loss": 5.4116,
"mean_token_accuracy": 0.1929891049861908,
"num_tokens": 6983129.0,
"step": 2900
},
{
"entropy": 5.790882968902588,
"epoch": 0.18678068539831544,
"grad_norm": 0.97265625,
"learning_rate": 0.0001826240643810212,
"loss": 5.4265,
"mean_token_accuracy": 0.18887285739183426,
"num_tokens": 6995904.0,
"step": 2905
},
{
"entropy": 5.695527839660644,
"epoch": 0.18710216678454317,
"grad_norm": 1.1484375,
"learning_rate": 0.0001815511067698758,
"loss": 5.3687,
"mean_token_accuracy": 0.198017854988575,
"num_tokens": 7007688.0,
"step": 2910
},
{
"entropy": 5.726076221466064,
"epoch": 0.18742364817077092,
"grad_norm": 0.90625,
"learning_rate": 0.0001804807111073436,
"loss": 5.4324,
"mean_token_accuracy": 0.18802389204502107,
"num_tokens": 7021596.0,
"step": 2915
},
{
"entropy": 5.667981863021851,
"epoch": 0.18774512955699865,
"grad_norm": 1.0,
"learning_rate": 0.0001794129067388625,
"loss": 5.3157,
"mean_token_accuracy": 0.19114758521318437,
"num_tokens": 7034619.0,
"step": 2920
},
{
"entropy": 5.684429025650024,
"epoch": 0.18806661094322638,
"grad_norm": 1.1796875,
"learning_rate": 0.00017834772293882868,
"loss": 5.3234,
"mean_token_accuracy": 0.1954457387328148,
"num_tokens": 7046208.0,
"step": 2925
},
{
"entropy": 5.715197134017944,
"epoch": 0.18838809232945414,
"grad_norm": 1.1875,
"learning_rate": 0.000177285188909794,
"loss": 5.3604,
"mean_token_accuracy": 0.19942552894353865,
"num_tokens": 7056963.0,
"step": 2930
},
{
"entropy": 5.707495832443238,
"epoch": 0.18870957371568187,
"grad_norm": 1.078125,
"learning_rate": 0.0001762253337816656,
"loss": 5.3404,
"mean_token_accuracy": 0.19765315651893617,
"num_tokens": 7068797.0,
"step": 2935
},
{
"entropy": 5.744600057601929,
"epoch": 0.1890310551019096,
"grad_norm": 1.140625,
"learning_rate": 0.00017516818661090738,
"loss": 5.3992,
"mean_token_accuracy": 0.1966458573937416,
"num_tokens": 7080806.0,
"step": 2940
},
{
"entropy": 5.737425947189331,
"epoch": 0.18935253648813732,
"grad_norm": 1.0546875,
"learning_rate": 0.0001741137763797428,
"loss": 5.4022,
"mean_token_accuracy": 0.18506599515676497,
"num_tokens": 7092082.0,
"step": 2945
},
{
"entropy": 5.6681403636932375,
"epoch": 0.18967401787436508,
"grad_norm": 1.0546875,
"learning_rate": 0.00017306213199536115,
"loss": 5.3532,
"mean_token_accuracy": 0.19148197919130325,
"num_tokens": 7103789.0,
"step": 2950
},
{
"entropy": 5.551540803909302,
"epoch": 0.1899954992605928,
"grad_norm": 1.0859375,
"learning_rate": 0.0001720132822891243,
"loss": 5.1612,
"mean_token_accuracy": 0.2179010406136513,
"num_tokens": 7114372.0,
"step": 2955
},
{
"entropy": 5.690138626098633,
"epoch": 0.19031698064682054,
"grad_norm": 1.0390625,
"learning_rate": 0.0001709672560157769,
"loss": 5.4054,
"mean_token_accuracy": 0.19148825258016586,
"num_tokens": 7126312.0,
"step": 2960
},
{
"entropy": 5.686584234237671,
"epoch": 0.1906384620330483,
"grad_norm": 1.0703125,
"learning_rate": 0.00016992408185265758,
"loss": 5.3711,
"mean_token_accuracy": 0.19448594450950624,
"num_tokens": 7139261.0,
"step": 2965
},
{
"entropy": 5.65612473487854,
"epoch": 0.19095994341927602,
"grad_norm": 1.0859375,
"learning_rate": 0.00016888378839891298,
"loss": 5.2825,
"mean_token_accuracy": 0.20106442719697953,
"num_tokens": 7149771.0,
"step": 2970
},
{
"entropy": 5.7447144985198975,
"epoch": 0.19128142480550375,
"grad_norm": 1.0546875,
"learning_rate": 0.0001678464041747137,
"loss": 5.458,
"mean_token_accuracy": 0.1896897152066231,
"num_tokens": 7162090.0,
"step": 2975
},
{
"entropy": 5.6877055168151855,
"epoch": 0.1916029061917315,
"grad_norm": 1.015625,
"learning_rate": 0.00016681195762047223,
"loss": 5.3379,
"mean_token_accuracy": 0.1835348203778267,
"num_tokens": 7173412.0,
"step": 2980
},
{
"entropy": 5.656432485580444,
"epoch": 0.19192438757795924,
"grad_norm": 1.0390625,
"learning_rate": 0.00016578047709606337,
"loss": 5.3421,
"mean_token_accuracy": 0.19733187854290007,
"num_tokens": 7186390.0,
"step": 2985
},
{
"entropy": 5.674517297744751,
"epoch": 0.19224586896418697,
"grad_norm": 1.046875,
"learning_rate": 0.00016475199088004678,
"loss": 5.3356,
"mean_token_accuracy": 0.19353183805942537,
"num_tokens": 7198134.0,
"step": 2990
},
{
"entropy": 5.5856561183929445,
"epoch": 0.19256735035041472,
"grad_norm": 1.0859375,
"learning_rate": 0.00016372652716889163,
"loss": 5.1782,
"mean_token_accuracy": 0.20354364216327667,
"num_tokens": 7209836.0,
"step": 2995
},
{
"entropy": 5.649115419387817,
"epoch": 0.19288883173664245,
"grad_norm": 1.1796875,
"learning_rate": 0.0001627041140762035,
"loss": 5.3402,
"mean_token_accuracy": 0.2029052421450615,
"num_tokens": 7220880.0,
"step": 3000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1632535657021440.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}