Files
ModelHub XC 0403ed2c1e 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/ind-latn-100mb-100mb_seed3407
Source: Original Platform
2026-07-07 19:47:52 +08:00

78178 lines
2.1 MiB

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.034312390585489,
"eval_steps": 3000,
"global_step": 39000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.692063236236573,
"epoch": 0.00038902937171756465,
"grad_norm": 13.75,
"learning_rate": 2e-06,
"loss": 10.8016,
"mean_token_accuracy": 0.0,
"num_tokens": 8755.0,
"step": 5
},
{
"entropy": 10.691958236694337,
"epoch": 0.0007780587434351293,
"grad_norm": 14.0625,
"learning_rate": 4.5e-06,
"loss": 10.7404,
"mean_token_accuracy": 0.000141643057577312,
"num_tokens": 17641.0,
"step": 10
},
{
"entropy": 10.690918159484863,
"epoch": 0.001167088115152694,
"grad_norm": 10.3125,
"learning_rate": 7e-06,
"loss": 10.4828,
"mean_token_accuracy": 0.025441211403813214,
"num_tokens": 26293.0,
"step": 15
},
{
"entropy": 10.67647647857666,
"epoch": 0.0015561174868702586,
"grad_norm": 6.5,
"learning_rate": 9.5e-06,
"loss": 10.2109,
"mean_token_accuracy": 0.040661663934588435,
"num_tokens": 35627.0,
"step": 20
},
{
"entropy": 10.60925121307373,
"epoch": 0.0019451468585878235,
"grad_norm": 4.28125,
"learning_rate": 1.2e-05,
"loss": 9.8983,
"mean_token_accuracy": 0.04408857449889183,
"num_tokens": 43861.0,
"step": 25
},
{
"entropy": 10.547060012817383,
"epoch": 0.002334176230305388,
"grad_norm": 3.625,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.7771,
"mean_token_accuracy": 0.04438098855316639,
"num_tokens": 52816.0,
"step": 30
},
{
"entropy": 10.550695419311523,
"epoch": 0.0027232056020229526,
"grad_norm": 3.046875,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.716,
"mean_token_accuracy": 0.044043789803981784,
"num_tokens": 61370.0,
"step": 35
},
{
"entropy": 10.541547393798828,
"epoch": 0.0031122349737405172,
"grad_norm": 2.84375,
"learning_rate": 1.95e-05,
"loss": 9.6407,
"mean_token_accuracy": 0.04505775421857834,
"num_tokens": 69444.0,
"step": 40
},
{
"entropy": 10.531424808502198,
"epoch": 0.003501264345458082,
"grad_norm": 2.6875,
"learning_rate": 2.2e-05,
"loss": 9.591,
"mean_token_accuracy": 0.04762658141553402,
"num_tokens": 77892.0,
"step": 45
},
{
"entropy": 10.512275695800781,
"epoch": 0.003890293717175647,
"grad_norm": 2.53125,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5439,
"mean_token_accuracy": 0.061067067086696625,
"num_tokens": 86154.0,
"step": 50
},
{
"entropy": 10.401442527770996,
"epoch": 0.004279323088893211,
"grad_norm": 2.3125,
"learning_rate": 2.7e-05,
"loss": 9.4981,
"mean_token_accuracy": 0.06119193881750107,
"num_tokens": 95589.0,
"step": 55
},
{
"entropy": 10.321024227142335,
"epoch": 0.004668352460610776,
"grad_norm": 2.296875,
"learning_rate": 2.95e-05,
"loss": 9.4607,
"mean_token_accuracy": 0.06384341418743134,
"num_tokens": 105268.0,
"step": 60
},
{
"entropy": 10.332015323638917,
"epoch": 0.0050573818323283405,
"grad_norm": 2.0,
"learning_rate": 3.2e-05,
"loss": 9.2989,
"mean_token_accuracy": 0.06944983527064323,
"num_tokens": 113347.0,
"step": 65
},
{
"entropy": 10.328180885314941,
"epoch": 0.005446411204045905,
"grad_norm": 2.390625,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.2579,
"mean_token_accuracy": 0.06596625149250031,
"num_tokens": 121235.0,
"step": 70
},
{
"entropy": 10.303812599182129,
"epoch": 0.00583544057576347,
"grad_norm": 1.9296875,
"learning_rate": 3.7e-05,
"loss": 9.152,
"mean_token_accuracy": 0.06924093440175057,
"num_tokens": 129529.0,
"step": 75
},
{
"entropy": 10.268609428405762,
"epoch": 0.0062244699474810344,
"grad_norm": 1.9375,
"learning_rate": 3.95e-05,
"loss": 9.0909,
"mean_token_accuracy": 0.06597104258835315,
"num_tokens": 137918.0,
"step": 80
},
{
"entropy": 10.261999797821044,
"epoch": 0.006613499319198599,
"grad_norm": 2.078125,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.9463,
"mean_token_accuracy": 0.06913249380886555,
"num_tokens": 146445.0,
"step": 85
},
{
"entropy": 10.207746601104736,
"epoch": 0.007002528690916164,
"grad_norm": 1.9921875,
"learning_rate": 4.45e-05,
"loss": 8.9607,
"mean_token_accuracy": 0.0626212403178215,
"num_tokens": 155904.0,
"step": 90
},
{
"entropy": 10.237759494781494,
"epoch": 0.007391558062633729,
"grad_norm": 1.8828125,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.8494,
"mean_token_accuracy": 0.06117668002843857,
"num_tokens": 164436.0,
"step": 95
},
{
"entropy": 10.121377658843993,
"epoch": 0.007780587434351294,
"grad_norm": 1.6171875,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.7265,
"mean_token_accuracy": 0.06574496850371361,
"num_tokens": 172985.0,
"step": 100
},
{
"entropy": 10.09178113937378,
"epoch": 0.008169616806068859,
"grad_norm": 1.625,
"learning_rate": 5.2e-05,
"loss": 8.5893,
"mean_token_accuracy": 0.0671191781759262,
"num_tokens": 182084.0,
"step": 105
},
{
"entropy": 10.011064624786377,
"epoch": 0.008558646177786422,
"grad_norm": 1.609375,
"learning_rate": 5.45e-05,
"loss": 8.4644,
"mean_token_accuracy": 0.07035542875528336,
"num_tokens": 190742.0,
"step": 110
},
{
"entropy": 9.856452560424804,
"epoch": 0.008947675549503988,
"grad_norm": 1.609375,
"learning_rate": 5.7e-05,
"loss": 8.3796,
"mean_token_accuracy": 0.06666092537343501,
"num_tokens": 199600.0,
"step": 115
},
{
"entropy": 9.79461441040039,
"epoch": 0.009336704921221552,
"grad_norm": 1.7578125,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.2817,
"mean_token_accuracy": 0.06714933924376965,
"num_tokens": 207883.0,
"step": 120
},
{
"entropy": 9.610589599609375,
"epoch": 0.009725734292939117,
"grad_norm": 1.9453125,
"learning_rate": 6.2e-05,
"loss": 8.2106,
"mean_token_accuracy": 0.06839943863451481,
"num_tokens": 216216.0,
"step": 125
},
{
"entropy": 9.441116333007812,
"epoch": 0.010114763664656681,
"grad_norm": 1.4140625,
"learning_rate": 6.450000000000001e-05,
"loss": 8.0674,
"mean_token_accuracy": 0.06686468720436096,
"num_tokens": 225250.0,
"step": 130
},
{
"entropy": 9.317984580993652,
"epoch": 0.010503793036374246,
"grad_norm": 1.3984375,
"learning_rate": 6.7e-05,
"loss": 7.9861,
"mean_token_accuracy": 0.06643427908420563,
"num_tokens": 233748.0,
"step": 135
},
{
"entropy": 9.106039714813232,
"epoch": 0.01089282240809181,
"grad_norm": 1.578125,
"learning_rate": 6.950000000000001e-05,
"loss": 7.9137,
"mean_token_accuracy": 0.06834710240364075,
"num_tokens": 242629.0,
"step": 140
},
{
"entropy": 9.014894771575928,
"epoch": 0.011281851779809376,
"grad_norm": 1.34375,
"learning_rate": 7.2e-05,
"loss": 7.825,
"mean_token_accuracy": 0.06285446509718895,
"num_tokens": 251458.0,
"step": 145
},
{
"entropy": 8.738780689239501,
"epoch": 0.01167088115152694,
"grad_norm": 1.328125,
"learning_rate": 7.45e-05,
"loss": 7.7458,
"mean_token_accuracy": 0.07414877340197563,
"num_tokens": 260557.0,
"step": 150
},
{
"entropy": 8.657924938201905,
"epoch": 0.012059910523244505,
"grad_norm": 1.1875,
"learning_rate": 7.7e-05,
"loss": 7.7607,
"mean_token_accuracy": 0.06932397484779358,
"num_tokens": 269262.0,
"step": 155
},
{
"entropy": 8.543195724487305,
"epoch": 0.012448939894962069,
"grad_norm": 1.1875,
"learning_rate": 7.950000000000001e-05,
"loss": 7.662,
"mean_token_accuracy": 0.07255172692239284,
"num_tokens": 277804.0,
"step": 160
},
{
"entropy": 8.427197933197021,
"epoch": 0.012837969266679634,
"grad_norm": 1.46875,
"learning_rate": 8.2e-05,
"loss": 7.6187,
"mean_token_accuracy": 0.0732395388185978,
"num_tokens": 287450.0,
"step": 165
},
{
"entropy": 8.372405529022217,
"epoch": 0.013226998638397198,
"grad_norm": 1.125,
"learning_rate": 8.450000000000001e-05,
"loss": 7.6324,
"mean_token_accuracy": 0.07173264883458615,
"num_tokens": 296497.0,
"step": 170
},
{
"entropy": 8.20972490310669,
"epoch": 0.013616028010114764,
"grad_norm": 1.546875,
"learning_rate": 8.7e-05,
"loss": 7.5358,
"mean_token_accuracy": 0.07566781267523766,
"num_tokens": 305414.0,
"step": 175
},
{
"entropy": 8.156252384185791,
"epoch": 0.014005057381832327,
"grad_norm": 1.4140625,
"learning_rate": 8.95e-05,
"loss": 7.5503,
"mean_token_accuracy": 0.07218287587165832,
"num_tokens": 313639.0,
"step": 180
},
{
"entropy": 8.146188354492187,
"epoch": 0.014394086753549893,
"grad_norm": 1.5,
"learning_rate": 9.2e-05,
"loss": 7.5511,
"mean_token_accuracy": 0.07190043628215789,
"num_tokens": 322855.0,
"step": 185
},
{
"entropy": 8.109641361236573,
"epoch": 0.014783116125267459,
"grad_norm": 1.7109375,
"learning_rate": 9.45e-05,
"loss": 7.6463,
"mean_token_accuracy": 0.07696216627955436,
"num_tokens": 332071.0,
"step": 190
},
{
"entropy": 8.094918823242187,
"epoch": 0.015172145496985022,
"grad_norm": 1.3359375,
"learning_rate": 9.7e-05,
"loss": 7.4403,
"mean_token_accuracy": 0.077825241163373,
"num_tokens": 339990.0,
"step": 195
},
{
"entropy": 7.986162710189819,
"epoch": 0.015561174868702588,
"grad_norm": 1.3125,
"learning_rate": 9.95e-05,
"loss": 7.489,
"mean_token_accuracy": 0.0800612710416317,
"num_tokens": 348581.0,
"step": 200
},
{
"entropy": 8.061878490447999,
"epoch": 0.01595020424042015,
"grad_norm": 1.15625,
"learning_rate": 0.000102,
"loss": 7.4901,
"mean_token_accuracy": 0.07649841569364071,
"num_tokens": 357032.0,
"step": 205
},
{
"entropy": 7.995882654190064,
"epoch": 0.016339233612137717,
"grad_norm": 1.28125,
"learning_rate": 0.00010449999999999999,
"loss": 7.4516,
"mean_token_accuracy": 0.0756280355155468,
"num_tokens": 366562.0,
"step": 210
},
{
"entropy": 7.987649202346802,
"epoch": 0.016728262983855283,
"grad_norm": 1.4375,
"learning_rate": 0.000107,
"loss": 7.4428,
"mean_token_accuracy": 0.07756799235939979,
"num_tokens": 374555.0,
"step": 215
},
{
"entropy": 7.977654266357422,
"epoch": 0.017117292355572845,
"grad_norm": 1.40625,
"learning_rate": 0.0001095,
"loss": 7.4725,
"mean_token_accuracy": 0.07444248832762242,
"num_tokens": 383583.0,
"step": 220
},
{
"entropy": 7.902964973449707,
"epoch": 0.01750632172729041,
"grad_norm": 1.2578125,
"learning_rate": 0.000112,
"loss": 7.4967,
"mean_token_accuracy": 0.07443738169968128,
"num_tokens": 392932.0,
"step": 225
},
{
"entropy": 7.966854381561279,
"epoch": 0.017895351099007976,
"grad_norm": 1.3671875,
"learning_rate": 0.0001145,
"loss": 7.3305,
"mean_token_accuracy": 0.07826850302517414,
"num_tokens": 401653.0,
"step": 230
},
{
"entropy": 7.823260259628296,
"epoch": 0.01828438047072554,
"grad_norm": 1.296875,
"learning_rate": 0.00011700000000000001,
"loss": 7.4224,
"mean_token_accuracy": 0.08165781088173389,
"num_tokens": 410432.0,
"step": 235
},
{
"entropy": 7.791707134246826,
"epoch": 0.018673409842443103,
"grad_norm": 1.1015625,
"learning_rate": 0.00011949999999999999,
"loss": 7.3874,
"mean_token_accuracy": 0.07677992731332779,
"num_tokens": 419380.0,
"step": 240
},
{
"entropy": 7.91221809387207,
"epoch": 0.01906243921416067,
"grad_norm": 1.328125,
"learning_rate": 0.000122,
"loss": 7.2983,
"mean_token_accuracy": 0.08029103949666024,
"num_tokens": 427682.0,
"step": 245
},
{
"entropy": 7.782497692108154,
"epoch": 0.019451468585878234,
"grad_norm": 1.140625,
"learning_rate": 0.0001245,
"loss": 7.3944,
"mean_token_accuracy": 0.07596049457788467,
"num_tokens": 437708.0,
"step": 250
},
{
"entropy": 7.839935350418091,
"epoch": 0.0198404979575958,
"grad_norm": 1.2890625,
"learning_rate": 0.000127,
"loss": 7.3625,
"mean_token_accuracy": 0.08329648077487946,
"num_tokens": 446480.0,
"step": 255
},
{
"entropy": 7.786860942840576,
"epoch": 0.020229527329313362,
"grad_norm": 1.3359375,
"learning_rate": 0.0001295,
"loss": 7.3896,
"mean_token_accuracy": 0.0760398305952549,
"num_tokens": 455273.0,
"step": 260
},
{
"entropy": 7.816596269607544,
"epoch": 0.020618556701030927,
"grad_norm": 1.296875,
"learning_rate": 0.000132,
"loss": 7.308,
"mean_token_accuracy": 0.08219457417726517,
"num_tokens": 464306.0,
"step": 265
},
{
"entropy": 7.677759218215942,
"epoch": 0.021007586072748493,
"grad_norm": 1.2265625,
"learning_rate": 0.00013450000000000002,
"loss": 7.3139,
"mean_token_accuracy": 0.0749464474618435,
"num_tokens": 472812.0,
"step": 270
},
{
"entropy": 7.768700742721558,
"epoch": 0.02139661544446606,
"grad_norm": 1.3125,
"learning_rate": 0.00013700000000000002,
"loss": 7.2851,
"mean_token_accuracy": 0.08093390390276908,
"num_tokens": 481326.0,
"step": 275
},
{
"entropy": 7.76422529220581,
"epoch": 0.02178564481618362,
"grad_norm": 1.375,
"learning_rate": 0.0001395,
"loss": 7.2397,
"mean_token_accuracy": 0.08092119097709656,
"num_tokens": 489147.0,
"step": 280
},
{
"entropy": 7.733962726593018,
"epoch": 0.022174674187901186,
"grad_norm": 1.296875,
"learning_rate": 0.00014199999999999998,
"loss": 7.2303,
"mean_token_accuracy": 0.08891455829143524,
"num_tokens": 497455.0,
"step": 285
},
{
"entropy": 7.637256097793579,
"epoch": 0.02256370355961875,
"grad_norm": 1.3671875,
"learning_rate": 0.0001445,
"loss": 7.1567,
"mean_token_accuracy": 0.08741839975118637,
"num_tokens": 506735.0,
"step": 290
},
{
"entropy": 7.682271909713745,
"epoch": 0.022952732931336317,
"grad_norm": 1.296875,
"learning_rate": 0.000147,
"loss": 7.2384,
"mean_token_accuracy": 0.08303680419921874,
"num_tokens": 515976.0,
"step": 295
},
{
"entropy": 7.649052429199219,
"epoch": 0.02334176230305388,
"grad_norm": 1.3515625,
"learning_rate": 0.0001495,
"loss": 7.2294,
"mean_token_accuracy": 0.08583831116557121,
"num_tokens": 524986.0,
"step": 300
},
{
"entropy": 7.687331056594848,
"epoch": 0.023730791674771445,
"grad_norm": 1.390625,
"learning_rate": 0.000152,
"loss": 7.2415,
"mean_token_accuracy": 0.09258508980274201,
"num_tokens": 533146.0,
"step": 305
},
{
"entropy": 7.660231113433838,
"epoch": 0.02411982104648901,
"grad_norm": 1.2734375,
"learning_rate": 0.00015450000000000001,
"loss": 7.1305,
"mean_token_accuracy": 0.09208664670586586,
"num_tokens": 541704.0,
"step": 310
},
{
"entropy": 7.569728803634644,
"epoch": 0.024508850418206576,
"grad_norm": 1.421875,
"learning_rate": 0.000157,
"loss": 7.1132,
"mean_token_accuracy": 0.09219249933958054,
"num_tokens": 550088.0,
"step": 315
},
{
"entropy": 7.553810167312622,
"epoch": 0.024897879789924138,
"grad_norm": 1.375,
"learning_rate": 0.0001595,
"loss": 7.1116,
"mean_token_accuracy": 0.08964145854115486,
"num_tokens": 558763.0,
"step": 320
},
{
"entropy": 7.644041442871094,
"epoch": 0.025286909161641703,
"grad_norm": 1.171875,
"learning_rate": 0.000162,
"loss": 7.2054,
"mean_token_accuracy": 0.08601472824811936,
"num_tokens": 567538.0,
"step": 325
},
{
"entropy": 7.581082773208618,
"epoch": 0.02567593853335927,
"grad_norm": 1.265625,
"learning_rate": 0.00016450000000000001,
"loss": 7.2187,
"mean_token_accuracy": 0.0808300495147705,
"num_tokens": 577626.0,
"step": 330
},
{
"entropy": 7.481959867477417,
"epoch": 0.026064967905076834,
"grad_norm": 1.328125,
"learning_rate": 0.00016700000000000002,
"loss": 7.1528,
"mean_token_accuracy": 0.08528566733002663,
"num_tokens": 587163.0,
"step": 335
},
{
"entropy": 7.5628759384155275,
"epoch": 0.026453997276794396,
"grad_norm": 1.1796875,
"learning_rate": 0.00016950000000000003,
"loss": 7.1352,
"mean_token_accuracy": 0.08886056169867515,
"num_tokens": 595896.0,
"step": 340
},
{
"entropy": 7.6669008255004885,
"epoch": 0.026843026648511962,
"grad_norm": 1.328125,
"learning_rate": 0.00017199999999999998,
"loss": 7.1495,
"mean_token_accuracy": 0.08720074668526649,
"num_tokens": 603815.0,
"step": 345
},
{
"entropy": 7.511917448043823,
"epoch": 0.027232056020229527,
"grad_norm": 1.3125,
"learning_rate": 0.00017449999999999999,
"loss": 7.1631,
"mean_token_accuracy": 0.09270136058330536,
"num_tokens": 612208.0,
"step": 350
},
{
"entropy": 7.517125844955444,
"epoch": 0.027621085391947093,
"grad_norm": 1.21875,
"learning_rate": 0.000177,
"loss": 7.1271,
"mean_token_accuracy": 0.09068955928087234,
"num_tokens": 621840.0,
"step": 355
},
{
"entropy": 7.542174816131592,
"epoch": 0.028010114763664655,
"grad_norm": 1.234375,
"learning_rate": 0.0001795,
"loss": 7.1365,
"mean_token_accuracy": 0.0883019782602787,
"num_tokens": 630770.0,
"step": 360
},
{
"entropy": 7.5013352394104,
"epoch": 0.02839914413538222,
"grad_norm": 1.1796875,
"learning_rate": 0.000182,
"loss": 7.1354,
"mean_token_accuracy": 0.08821968138217925,
"num_tokens": 640313.0,
"step": 365
},
{
"entropy": 7.581635475158691,
"epoch": 0.028788173507099786,
"grad_norm": 1.3046875,
"learning_rate": 0.0001845,
"loss": 7.1571,
"mean_token_accuracy": 0.09343784376978874,
"num_tokens": 648594.0,
"step": 370
},
{
"entropy": 7.465378761291504,
"epoch": 0.02917720287881735,
"grad_norm": 1.5078125,
"learning_rate": 0.000187,
"loss": 7.1645,
"mean_token_accuracy": 0.09112582504749298,
"num_tokens": 656478.0,
"step": 375
},
{
"entropy": 7.526745271682739,
"epoch": 0.029566232250534917,
"grad_norm": 1.1953125,
"learning_rate": 0.0001895,
"loss": 7.1162,
"mean_token_accuracy": 0.09759116843342781,
"num_tokens": 665405.0,
"step": 380
},
{
"entropy": 7.474437618255616,
"epoch": 0.02995526162225248,
"grad_norm": 1.4921875,
"learning_rate": 0.000192,
"loss": 7.1315,
"mean_token_accuracy": 0.09043080434203148,
"num_tokens": 674301.0,
"step": 385
},
{
"entropy": 7.500934886932373,
"epoch": 0.030344290993970045,
"grad_norm": 1.2890625,
"learning_rate": 0.0001945,
"loss": 7.1395,
"mean_token_accuracy": 0.09345336705446243,
"num_tokens": 683159.0,
"step": 390
},
{
"entropy": 7.383391237258911,
"epoch": 0.03073332036568761,
"grad_norm": 1.296875,
"learning_rate": 0.00019700000000000002,
"loss": 6.9546,
"mean_token_accuracy": 0.09936677888035775,
"num_tokens": 690992.0,
"step": 395
},
{
"entropy": 7.346968412399292,
"epoch": 0.031122349737405176,
"grad_norm": 1.3046875,
"learning_rate": 0.00019950000000000002,
"loss": 7.0703,
"mean_token_accuracy": 0.09284654334187507,
"num_tokens": 699934.0,
"step": 400
},
{
"entropy": 7.553390264511108,
"epoch": 0.03151137910912274,
"grad_norm": 1.578125,
"learning_rate": 0.000202,
"loss": 7.1035,
"mean_token_accuracy": 0.09367862120270729,
"num_tokens": 708844.0,
"step": 405
},
{
"entropy": 7.4107770919799805,
"epoch": 0.0319004084808403,
"grad_norm": 1.203125,
"learning_rate": 0.00020449999999999998,
"loss": 7.1629,
"mean_token_accuracy": 0.08833086043596268,
"num_tokens": 718148.0,
"step": 410
},
{
"entropy": 7.559677696228027,
"epoch": 0.03228943785255787,
"grad_norm": 1.359375,
"learning_rate": 0.000207,
"loss": 7.0958,
"mean_token_accuracy": 0.08757410496473313,
"num_tokens": 726859.0,
"step": 415
},
{
"entropy": 7.36133918762207,
"epoch": 0.032678467224275434,
"grad_norm": 1.375,
"learning_rate": 0.0002095,
"loss": 7.1026,
"mean_token_accuracy": 0.09037772119045258,
"num_tokens": 735045.0,
"step": 420
},
{
"entropy": 7.265546607971191,
"epoch": 0.033067496595993,
"grad_norm": 1.09375,
"learning_rate": 0.000212,
"loss": 6.9826,
"mean_token_accuracy": 0.0958486907184124,
"num_tokens": 743538.0,
"step": 425
},
{
"entropy": 7.454471921920776,
"epoch": 0.033456525967710565,
"grad_norm": 1.2421875,
"learning_rate": 0.0002145,
"loss": 7.017,
"mean_token_accuracy": 0.09482243955135346,
"num_tokens": 752518.0,
"step": 430
},
{
"entropy": 7.29300708770752,
"epoch": 0.033845555339428124,
"grad_norm": 1.375,
"learning_rate": 0.00021700000000000002,
"loss": 7.0525,
"mean_token_accuracy": 0.09259525015950203,
"num_tokens": 760354.0,
"step": 435
},
{
"entropy": 7.4215178966522215,
"epoch": 0.03423458471114569,
"grad_norm": 1.3671875,
"learning_rate": 0.0002195,
"loss": 7.1053,
"mean_token_accuracy": 0.09021464213728905,
"num_tokens": 769522.0,
"step": 440
},
{
"entropy": 7.375669765472412,
"epoch": 0.034623614082863255,
"grad_norm": 1.359375,
"learning_rate": 0.000222,
"loss": 7.023,
"mean_token_accuracy": 0.09649827480316162,
"num_tokens": 778548.0,
"step": 445
},
{
"entropy": 7.265977478027343,
"epoch": 0.03501264345458082,
"grad_norm": 1.328125,
"learning_rate": 0.0002245,
"loss": 7.0381,
"mean_token_accuracy": 0.09258587285876274,
"num_tokens": 787666.0,
"step": 450
},
{
"entropy": 7.404888343811035,
"epoch": 0.035401672826298386,
"grad_norm": 1.40625,
"learning_rate": 0.00022700000000000002,
"loss": 6.9548,
"mean_token_accuracy": 0.09554951265454292,
"num_tokens": 796550.0,
"step": 455
},
{
"entropy": 7.379618072509766,
"epoch": 0.03579070219801595,
"grad_norm": 1.5859375,
"learning_rate": 0.00022950000000000002,
"loss": 7.0295,
"mean_token_accuracy": 0.09436309635639191,
"num_tokens": 804549.0,
"step": 460
},
{
"entropy": 7.194296884536743,
"epoch": 0.03617973156973352,
"grad_norm": 1.1640625,
"learning_rate": 0.00023200000000000003,
"loss": 7.0004,
"mean_token_accuracy": 0.09524615257978439,
"num_tokens": 813328.0,
"step": 465
},
{
"entropy": 7.384324455261231,
"epoch": 0.03656876094145108,
"grad_norm": 1.21875,
"learning_rate": 0.00023449999999999998,
"loss": 7.0326,
"mean_token_accuracy": 0.09230693653225899,
"num_tokens": 821733.0,
"step": 470
},
{
"entropy": 7.3139783382415775,
"epoch": 0.03695779031316864,
"grad_norm": 1.234375,
"learning_rate": 0.000237,
"loss": 6.9669,
"mean_token_accuracy": 0.09483846426010131,
"num_tokens": 830243.0,
"step": 475
},
{
"entropy": 7.309220647811889,
"epoch": 0.03734681968488621,
"grad_norm": 1.28125,
"learning_rate": 0.0002395,
"loss": 6.9553,
"mean_token_accuracy": 0.09212375655770302,
"num_tokens": 839059.0,
"step": 480
},
{
"entropy": 7.19914059638977,
"epoch": 0.03773584905660377,
"grad_norm": 1.265625,
"learning_rate": 0.000242,
"loss": 6.8376,
"mean_token_accuracy": 0.10036729499697686,
"num_tokens": 846932.0,
"step": 485
},
{
"entropy": 7.361199140548706,
"epoch": 0.03812487842832134,
"grad_norm": 1.28125,
"learning_rate": 0.0002445,
"loss": 7.0514,
"mean_token_accuracy": 0.08944635763764382,
"num_tokens": 855333.0,
"step": 490
},
{
"entropy": 7.1707884788513185,
"epoch": 0.0385139078000389,
"grad_norm": 1.328125,
"learning_rate": 0.000247,
"loss": 6.809,
"mean_token_accuracy": 0.09626470431685448,
"num_tokens": 863571.0,
"step": 495
},
{
"entropy": 7.152101230621338,
"epoch": 0.03890293717175647,
"grad_norm": 1.21875,
"learning_rate": 0.0002495,
"loss": 6.8996,
"mean_token_accuracy": 0.10517843365669251,
"num_tokens": 872145.0,
"step": 500
},
{
"entropy": 7.187833833694458,
"epoch": 0.039291966543474034,
"grad_norm": 1.1796875,
"learning_rate": 0.000252,
"loss": 6.9394,
"mean_token_accuracy": 0.09892025515437126,
"num_tokens": 880634.0,
"step": 505
},
{
"entropy": 7.235556554794312,
"epoch": 0.0396809959151916,
"grad_norm": 1.359375,
"learning_rate": 0.0002545,
"loss": 6.8712,
"mean_token_accuracy": 0.09984394237399101,
"num_tokens": 889178.0,
"step": 510
},
{
"entropy": 7.149497556686401,
"epoch": 0.04007002528690916,
"grad_norm": 1.34375,
"learning_rate": 0.000257,
"loss": 6.885,
"mean_token_accuracy": 0.09859361201524734,
"num_tokens": 898255.0,
"step": 515
},
{
"entropy": 7.130793571472168,
"epoch": 0.040459054658626724,
"grad_norm": 1.4453125,
"learning_rate": 0.0002595,
"loss": 6.9412,
"mean_token_accuracy": 0.08988485783338547,
"num_tokens": 907369.0,
"step": 520
},
{
"entropy": 7.193523645401001,
"epoch": 0.04084808403034429,
"grad_norm": 1.3046875,
"learning_rate": 0.000262,
"loss": 6.8381,
"mean_token_accuracy": 0.0956579439342022,
"num_tokens": 915946.0,
"step": 525
},
{
"entropy": 7.214367437362671,
"epoch": 0.041237113402061855,
"grad_norm": 1.109375,
"learning_rate": 0.00026450000000000003,
"loss": 6.8968,
"mean_token_accuracy": 0.09464456140995026,
"num_tokens": 925579.0,
"step": 530
},
{
"entropy": 7.194347190856933,
"epoch": 0.04162614277377942,
"grad_norm": 1.1875,
"learning_rate": 0.00026700000000000004,
"loss": 6.8929,
"mean_token_accuracy": 0.09103822857141494,
"num_tokens": 934732.0,
"step": 535
},
{
"entropy": 7.1877021312713625,
"epoch": 0.042015172145496986,
"grad_norm": 1.390625,
"learning_rate": 0.00026950000000000005,
"loss": 6.9548,
"mean_token_accuracy": 0.09189340770244599,
"num_tokens": 943371.0,
"step": 540
},
{
"entropy": 7.129611682891846,
"epoch": 0.04240420151721455,
"grad_norm": 1.28125,
"learning_rate": 0.00027200000000000005,
"loss": 6.7935,
"mean_token_accuracy": 0.09684587121009827,
"num_tokens": 951977.0,
"step": 545
},
{
"entropy": 7.075324392318725,
"epoch": 0.04279323088893212,
"grad_norm": 1.1875,
"learning_rate": 0.0002745,
"loss": 6.7956,
"mean_token_accuracy": 0.09852224737405776,
"num_tokens": 960474.0,
"step": 550
},
{
"entropy": 7.242029809951783,
"epoch": 0.04318226026064968,
"grad_norm": 1.1796875,
"learning_rate": 0.000277,
"loss": 6.921,
"mean_token_accuracy": 0.09615759328007698,
"num_tokens": 969823.0,
"step": 555
},
{
"entropy": 7.148642349243164,
"epoch": 0.04357128963236724,
"grad_norm": 1.421875,
"learning_rate": 0.0002795,
"loss": 6.8541,
"mean_token_accuracy": 0.10372538045048714,
"num_tokens": 977417.0,
"step": 560
},
{
"entropy": 7.050511121749878,
"epoch": 0.04396031900408481,
"grad_norm": 1.3671875,
"learning_rate": 0.00028199999999999997,
"loss": 6.8525,
"mean_token_accuracy": 0.10765723884105682,
"num_tokens": 985519.0,
"step": 565
},
{
"entropy": 7.106280851364136,
"epoch": 0.04434934837580237,
"grad_norm": 1.546875,
"learning_rate": 0.0002845,
"loss": 6.8486,
"mean_token_accuracy": 0.10191520527005196,
"num_tokens": 994136.0,
"step": 570
},
{
"entropy": 7.03365535736084,
"epoch": 0.04473837774751994,
"grad_norm": 1.3359375,
"learning_rate": 0.000287,
"loss": 6.8207,
"mean_token_accuracy": 0.09769327566027641,
"num_tokens": 1002896.0,
"step": 575
},
{
"entropy": 7.198338603973388,
"epoch": 0.0451274071192375,
"grad_norm": 1.34375,
"learning_rate": 0.0002895,
"loss": 6.9061,
"mean_token_accuracy": 0.10421423837542534,
"num_tokens": 1011032.0,
"step": 580
},
{
"entropy": 7.051746559143067,
"epoch": 0.04551643649095507,
"grad_norm": 1.140625,
"learning_rate": 0.000292,
"loss": 6.8708,
"mean_token_accuracy": 0.09394787698984146,
"num_tokens": 1019901.0,
"step": 585
},
{
"entropy": 7.067822074890136,
"epoch": 0.045905465862672634,
"grad_norm": 1.21875,
"learning_rate": 0.0002945,
"loss": 6.8482,
"mean_token_accuracy": 0.09919805154204368,
"num_tokens": 1029049.0,
"step": 590
},
{
"entropy": 6.9990034103393555,
"epoch": 0.0462944952343902,
"grad_norm": 1.25,
"learning_rate": 0.000297,
"loss": 6.8086,
"mean_token_accuracy": 0.10822348445653915,
"num_tokens": 1037580.0,
"step": 595
},
{
"entropy": 7.196728610992432,
"epoch": 0.04668352460610776,
"grad_norm": 1.2421875,
"learning_rate": 0.0002995,
"loss": 6.8679,
"mean_token_accuracy": 0.10288131684064865,
"num_tokens": 1045804.0,
"step": 600
},
{
"entropy": 7.0782746315002445,
"epoch": 0.047072553977825324,
"grad_norm": 1.2421875,
"learning_rate": 0.000302,
"loss": 6.8362,
"mean_token_accuracy": 0.09710147231817245,
"num_tokens": 1054719.0,
"step": 605
},
{
"entropy": 7.09404673576355,
"epoch": 0.04746158334954289,
"grad_norm": 1.328125,
"learning_rate": 0.0003045,
"loss": 6.8149,
"mean_token_accuracy": 0.1012077234685421,
"num_tokens": 1063373.0,
"step": 610
},
{
"entropy": 6.984814739227295,
"epoch": 0.047850612721260455,
"grad_norm": 1.1953125,
"learning_rate": 0.000307,
"loss": 6.8058,
"mean_token_accuracy": 0.10036636292934417,
"num_tokens": 1073021.0,
"step": 615
},
{
"entropy": 7.0786560535430905,
"epoch": 0.04823964209297802,
"grad_norm": 1.3125,
"learning_rate": 0.0003095,
"loss": 6.8696,
"mean_token_accuracy": 0.09600509628653527,
"num_tokens": 1081547.0,
"step": 620
},
{
"entropy": 7.0220740795135494,
"epoch": 0.048628671464695586,
"grad_norm": 1.15625,
"learning_rate": 0.000312,
"loss": 6.8233,
"mean_token_accuracy": 0.09918136522173882,
"num_tokens": 1090695.0,
"step": 625
},
{
"entropy": 6.9606041431427,
"epoch": 0.04901770083641315,
"grad_norm": 1.2109375,
"learning_rate": 0.0003145,
"loss": 6.7198,
"mean_token_accuracy": 0.10607226341962814,
"num_tokens": 1099563.0,
"step": 630
},
{
"entropy": 7.042634630203247,
"epoch": 0.04940673020813072,
"grad_norm": 1.15625,
"learning_rate": 0.000317,
"loss": 6.8025,
"mean_token_accuracy": 0.09708617925643921,
"num_tokens": 1109021.0,
"step": 635
},
{
"entropy": 7.036008024215699,
"epoch": 0.049795759579848276,
"grad_norm": 1.2734375,
"learning_rate": 0.0003195,
"loss": 6.7915,
"mean_token_accuracy": 0.10409486815333366,
"num_tokens": 1118281.0,
"step": 640
},
{
"entropy": 7.0259270668029785,
"epoch": 0.05018478895156584,
"grad_norm": 1.2421875,
"learning_rate": 0.000322,
"loss": 6.8364,
"mean_token_accuracy": 0.09575799703598023,
"num_tokens": 1127513.0,
"step": 645
},
{
"entropy": 6.843554496765137,
"epoch": 0.05057381832328341,
"grad_norm": 1.296875,
"learning_rate": 0.00032450000000000003,
"loss": 6.7179,
"mean_token_accuracy": 0.10220488980412483,
"num_tokens": 1136140.0,
"step": 650
},
{
"entropy": 7.010839796066284,
"epoch": 0.05096284769500097,
"grad_norm": 1.1875,
"learning_rate": 0.00032700000000000003,
"loss": 6.7449,
"mean_token_accuracy": 0.10034143850207329,
"num_tokens": 1144297.0,
"step": 655
},
{
"entropy": 7.005735111236572,
"epoch": 0.05135187706671854,
"grad_norm": 1.3046875,
"learning_rate": 0.00032950000000000004,
"loss": 6.8315,
"mean_token_accuracy": 0.09598958343267441,
"num_tokens": 1153639.0,
"step": 660
},
{
"entropy": 7.042137622833252,
"epoch": 0.0517409064384361,
"grad_norm": 1.1796875,
"learning_rate": 0.00033200000000000005,
"loss": 6.8044,
"mean_token_accuracy": 0.09692039787769317,
"num_tokens": 1162825.0,
"step": 665
},
{
"entropy": 6.893413639068603,
"epoch": 0.05212993581015367,
"grad_norm": 1.2734375,
"learning_rate": 0.00033450000000000005,
"loss": 6.8242,
"mean_token_accuracy": 0.10342787951231003,
"num_tokens": 1171887.0,
"step": 670
},
{
"entropy": 6.990288639068604,
"epoch": 0.052518965181871234,
"grad_norm": 1.28125,
"learning_rate": 0.000337,
"loss": 6.723,
"mean_token_accuracy": 0.10218419954180717,
"num_tokens": 1179963.0,
"step": 675
},
{
"entropy": 6.915320777893067,
"epoch": 0.05290799455358879,
"grad_norm": 1.2578125,
"learning_rate": 0.0003395,
"loss": 6.6987,
"mean_token_accuracy": 0.10984139442443848,
"num_tokens": 1188408.0,
"step": 680
},
{
"entropy": 6.944253206253052,
"epoch": 0.05329702392530636,
"grad_norm": 1.1875,
"learning_rate": 0.000342,
"loss": 6.7404,
"mean_token_accuracy": 0.09963250234723091,
"num_tokens": 1197751.0,
"step": 685
},
{
"entropy": 6.910943222045899,
"epoch": 0.053686053297023924,
"grad_norm": 1.2421875,
"learning_rate": 0.00034449999999999997,
"loss": 6.8019,
"mean_token_accuracy": 0.10173860564827919,
"num_tokens": 1207101.0,
"step": 690
},
{
"entropy": 6.96247820854187,
"epoch": 0.05407508266874149,
"grad_norm": 1.078125,
"learning_rate": 0.000347,
"loss": 6.7768,
"mean_token_accuracy": 0.10386782586574554,
"num_tokens": 1216395.0,
"step": 695
},
{
"entropy": 6.914447498321533,
"epoch": 0.054464112040459055,
"grad_norm": 1.265625,
"learning_rate": 0.0003495,
"loss": 6.7579,
"mean_token_accuracy": 0.10488244742155076,
"num_tokens": 1225496.0,
"step": 700
},
{
"entropy": 6.9863011837005615,
"epoch": 0.05485314141217662,
"grad_norm": 1.21875,
"learning_rate": 0.000352,
"loss": 6.8255,
"mean_token_accuracy": 0.10280769392848015,
"num_tokens": 1233934.0,
"step": 705
},
{
"entropy": 6.947722387313843,
"epoch": 0.055242170783894186,
"grad_norm": 1.4140625,
"learning_rate": 0.0003545,
"loss": 6.6909,
"mean_token_accuracy": 0.10623404085636139,
"num_tokens": 1242165.0,
"step": 710
},
{
"entropy": 6.864742231369019,
"epoch": 0.05563120015561175,
"grad_norm": 1.3203125,
"learning_rate": 0.000357,
"loss": 6.7451,
"mean_token_accuracy": 0.10805843472480774,
"num_tokens": 1250021.0,
"step": 715
},
{
"entropy": 6.967834186553955,
"epoch": 0.05602022952732931,
"grad_norm": 1.15625,
"learning_rate": 0.0003595,
"loss": 6.7789,
"mean_token_accuracy": 0.1014004610478878,
"num_tokens": 1258397.0,
"step": 720
},
{
"entropy": 6.895936393737793,
"epoch": 0.056409258899046875,
"grad_norm": 1.25,
"learning_rate": 0.000362,
"loss": 6.7594,
"mean_token_accuracy": 0.10026679039001465,
"num_tokens": 1266764.0,
"step": 725
},
{
"entropy": 6.976710271835327,
"epoch": 0.05679828827076444,
"grad_norm": 1.2265625,
"learning_rate": 0.0003645,
"loss": 6.7604,
"mean_token_accuracy": 0.10308134779334069,
"num_tokens": 1275643.0,
"step": 730
},
{
"entropy": 6.854802751541138,
"epoch": 0.057187317642482006,
"grad_norm": 1.21875,
"learning_rate": 0.000367,
"loss": 6.7414,
"mean_token_accuracy": 0.10123410001397133,
"num_tokens": 1284379.0,
"step": 735
},
{
"entropy": 6.858791494369507,
"epoch": 0.05757634701419957,
"grad_norm": 1.2578125,
"learning_rate": 0.0003695,
"loss": 6.5942,
"mean_token_accuracy": 0.10925214067101478,
"num_tokens": 1293115.0,
"step": 740
},
{
"entropy": 6.892751264572143,
"epoch": 0.05796537638591714,
"grad_norm": 1.296875,
"learning_rate": 0.000372,
"loss": 6.796,
"mean_token_accuracy": 0.09836092367768287,
"num_tokens": 1301583.0,
"step": 745
},
{
"entropy": 6.954816818237305,
"epoch": 0.0583544057576347,
"grad_norm": 1.1171875,
"learning_rate": 0.0003745,
"loss": 6.7001,
"mean_token_accuracy": 0.10808140113949775,
"num_tokens": 1310721.0,
"step": 750
},
{
"entropy": 6.923498821258545,
"epoch": 0.05874343512935227,
"grad_norm": 1.4140625,
"learning_rate": 0.000377,
"loss": 6.8595,
"mean_token_accuracy": 0.09595380201935769,
"num_tokens": 1319056.0,
"step": 755
},
{
"entropy": 6.839234256744385,
"epoch": 0.059132464501069834,
"grad_norm": 1.1875,
"learning_rate": 0.0003795,
"loss": 6.7416,
"mean_token_accuracy": 0.10261751636862755,
"num_tokens": 1327259.0,
"step": 760
},
{
"entropy": 6.819512987136841,
"epoch": 0.05952149387278739,
"grad_norm": 1.28125,
"learning_rate": 0.000382,
"loss": 6.6414,
"mean_token_accuracy": 0.10097026452422142,
"num_tokens": 1335906.0,
"step": 765
},
{
"entropy": 6.879472923278809,
"epoch": 0.05991052324450496,
"grad_norm": 1.140625,
"learning_rate": 0.0003845,
"loss": 6.6938,
"mean_token_accuracy": 0.09806213229894638,
"num_tokens": 1344743.0,
"step": 770
},
{
"entropy": 6.840222930908203,
"epoch": 0.060299552616222524,
"grad_norm": 1.234375,
"learning_rate": 0.00038700000000000003,
"loss": 6.6834,
"mean_token_accuracy": 0.10951419249176979,
"num_tokens": 1353211.0,
"step": 775
},
{
"entropy": 6.946290063858032,
"epoch": 0.06068858198794009,
"grad_norm": 1.1796875,
"learning_rate": 0.00038950000000000003,
"loss": 6.812,
"mean_token_accuracy": 0.10016649737954139,
"num_tokens": 1361849.0,
"step": 780
},
{
"entropy": 6.8946840286254885,
"epoch": 0.061077611359657655,
"grad_norm": 1.46875,
"learning_rate": 0.00039200000000000004,
"loss": 6.7945,
"mean_token_accuracy": 0.10707032829523086,
"num_tokens": 1369804.0,
"step": 785
},
{
"entropy": 6.7396095275878904,
"epoch": 0.06146664073137522,
"grad_norm": 1.1171875,
"learning_rate": 0.00039450000000000005,
"loss": 6.5766,
"mean_token_accuracy": 0.10397438257932663,
"num_tokens": 1378478.0,
"step": 790
},
{
"entropy": 6.9116943359375,
"epoch": 0.061855670103092786,
"grad_norm": 1.2890625,
"learning_rate": 0.00039700000000000005,
"loss": 6.6789,
"mean_token_accuracy": 0.10764730274677277,
"num_tokens": 1387225.0,
"step": 795
},
{
"entropy": 6.7650645732879635,
"epoch": 0.06224469947481035,
"grad_norm": 1.265625,
"learning_rate": 0.0003995,
"loss": 6.6492,
"mean_token_accuracy": 0.10592131912708283,
"num_tokens": 1395338.0,
"step": 800
},
{
"entropy": 6.821805953979492,
"epoch": 0.06263372884652792,
"grad_norm": 1.1640625,
"learning_rate": 0.000402,
"loss": 6.63,
"mean_token_accuracy": 0.10603216290473938,
"num_tokens": 1403794.0,
"step": 805
},
{
"entropy": 6.708382701873779,
"epoch": 0.06302275821824548,
"grad_norm": 1.109375,
"learning_rate": 0.0004045,
"loss": 6.7133,
"mean_token_accuracy": 0.10304158627986908,
"num_tokens": 1412522.0,
"step": 810
},
{
"entropy": 6.788723707199097,
"epoch": 0.06341178758996305,
"grad_norm": 1.15625,
"learning_rate": 0.00040699999999999997,
"loss": 6.6937,
"mean_token_accuracy": 0.10893446058034897,
"num_tokens": 1421347.0,
"step": 815
},
{
"entropy": 6.8365006923675535,
"epoch": 0.0638008169616806,
"grad_norm": 1.234375,
"learning_rate": 0.0004095,
"loss": 6.6695,
"mean_token_accuracy": 0.11350144445896149,
"num_tokens": 1429788.0,
"step": 820
},
{
"entropy": 6.760780572891235,
"epoch": 0.06418984633339817,
"grad_norm": 1.3046875,
"learning_rate": 0.000412,
"loss": 6.6727,
"mean_token_accuracy": 0.10774989053606987,
"num_tokens": 1437442.0,
"step": 825
},
{
"entropy": 6.757859325408935,
"epoch": 0.06457887570511574,
"grad_norm": 1.09375,
"learning_rate": 0.0004145,
"loss": 6.5954,
"mean_token_accuracy": 0.10944118574261666,
"num_tokens": 1445604.0,
"step": 830
},
{
"entropy": 6.786571073532104,
"epoch": 0.0649679050768333,
"grad_norm": 1.1875,
"learning_rate": 0.000417,
"loss": 6.6634,
"mean_token_accuracy": 0.1089187815785408,
"num_tokens": 1454342.0,
"step": 835
},
{
"entropy": 6.77791576385498,
"epoch": 0.06535693444855087,
"grad_norm": 1.1875,
"learning_rate": 0.0004195,
"loss": 6.661,
"mean_token_accuracy": 0.11053230538964272,
"num_tokens": 1463189.0,
"step": 840
},
{
"entropy": 6.787366485595703,
"epoch": 0.06574596382026843,
"grad_norm": 1.203125,
"learning_rate": 0.000422,
"loss": 6.7166,
"mean_token_accuracy": 0.10734177976846696,
"num_tokens": 1471608.0,
"step": 845
},
{
"entropy": 6.799466276168824,
"epoch": 0.066134993191986,
"grad_norm": 1.3125,
"learning_rate": 0.0004245,
"loss": 6.7296,
"mean_token_accuracy": 0.10613490417599677,
"num_tokens": 1480452.0,
"step": 850
},
{
"entropy": 6.822136163711548,
"epoch": 0.06652402256370356,
"grad_norm": 1.2421875,
"learning_rate": 0.000427,
"loss": 6.6437,
"mean_token_accuracy": 0.10718747153878212,
"num_tokens": 1489118.0,
"step": 855
},
{
"entropy": 6.686193990707397,
"epoch": 0.06691305193542113,
"grad_norm": 1.2421875,
"learning_rate": 0.0004295,
"loss": 6.6342,
"mean_token_accuracy": 0.10919305682182312,
"num_tokens": 1498961.0,
"step": 860
},
{
"entropy": 6.819766521453857,
"epoch": 0.06730208130713869,
"grad_norm": 1.2421875,
"learning_rate": 0.000432,
"loss": 6.6401,
"mean_token_accuracy": 0.11007228568196296,
"num_tokens": 1506772.0,
"step": 865
},
{
"entropy": 6.681567525863647,
"epoch": 0.06769111067885625,
"grad_norm": 1.2734375,
"learning_rate": 0.0004345,
"loss": 6.5275,
"mean_token_accuracy": 0.11715472564101219,
"num_tokens": 1515095.0,
"step": 870
},
{
"entropy": 6.6687061309814455,
"epoch": 0.06808014005057382,
"grad_norm": 1.1484375,
"learning_rate": 0.000437,
"loss": 6.5653,
"mean_token_accuracy": 0.11424972265958785,
"num_tokens": 1523477.0,
"step": 875
},
{
"entropy": 6.689616775512695,
"epoch": 0.06846916942229138,
"grad_norm": 1.1015625,
"learning_rate": 0.0004395,
"loss": 6.6037,
"mean_token_accuracy": 0.10498946905136108,
"num_tokens": 1531786.0,
"step": 880
},
{
"entropy": 6.736538553237915,
"epoch": 0.06885819879400895,
"grad_norm": 1.171875,
"learning_rate": 0.000442,
"loss": 6.7016,
"mean_token_accuracy": 0.10352547094225883,
"num_tokens": 1540737.0,
"step": 885
},
{
"entropy": 6.637676811218261,
"epoch": 0.06924722816572651,
"grad_norm": 1.1953125,
"learning_rate": 0.0004445,
"loss": 6.5418,
"mean_token_accuracy": 0.1120985560119152,
"num_tokens": 1548923.0,
"step": 890
},
{
"entropy": 6.724155473709106,
"epoch": 0.06963625753744408,
"grad_norm": 1.375,
"learning_rate": 0.000447,
"loss": 6.5185,
"mean_token_accuracy": 0.11639119386672973,
"num_tokens": 1557043.0,
"step": 895
},
{
"entropy": 6.5780919075012205,
"epoch": 0.07002528690916164,
"grad_norm": 1.2890625,
"learning_rate": 0.00044950000000000003,
"loss": 6.5535,
"mean_token_accuracy": 0.11611853837966919,
"num_tokens": 1564994.0,
"step": 900
},
{
"entropy": 6.693197536468506,
"epoch": 0.0704143162808792,
"grad_norm": 1.171875,
"learning_rate": 0.00045200000000000004,
"loss": 6.5559,
"mean_token_accuracy": 0.11024467647075653,
"num_tokens": 1573859.0,
"step": 905
},
{
"entropy": 6.661924743652344,
"epoch": 0.07080334565259677,
"grad_norm": 1.1328125,
"learning_rate": 0.00045450000000000004,
"loss": 6.5138,
"mean_token_accuracy": 0.10926207825541497,
"num_tokens": 1581947.0,
"step": 910
},
{
"entropy": 6.66906771659851,
"epoch": 0.07119237502431433,
"grad_norm": 1.15625,
"learning_rate": 0.00045700000000000005,
"loss": 6.4995,
"mean_token_accuracy": 0.11228668987751007,
"num_tokens": 1589971.0,
"step": 915
},
{
"entropy": 6.555896234512329,
"epoch": 0.0715814043960319,
"grad_norm": 1.21875,
"learning_rate": 0.00045950000000000006,
"loss": 6.4518,
"mean_token_accuracy": 0.11207407787442207,
"num_tokens": 1598612.0,
"step": 920
},
{
"entropy": 6.718100690841675,
"epoch": 0.07197043376774946,
"grad_norm": 1.1328125,
"learning_rate": 0.000462,
"loss": 6.6111,
"mean_token_accuracy": 0.10551391988992691,
"num_tokens": 1607378.0,
"step": 925
},
{
"entropy": 6.653341817855835,
"epoch": 0.07235946313946703,
"grad_norm": 1.078125,
"learning_rate": 0.0004645,
"loss": 6.6081,
"mean_token_accuracy": 0.11038231924176216,
"num_tokens": 1615987.0,
"step": 930
},
{
"entropy": 6.486403131484986,
"epoch": 0.07274849251118459,
"grad_norm": 1.125,
"learning_rate": 0.000467,
"loss": 6.4005,
"mean_token_accuracy": 0.11754591017961502,
"num_tokens": 1625366.0,
"step": 935
},
{
"entropy": 6.682313919067383,
"epoch": 0.07313752188290217,
"grad_norm": 1.1015625,
"learning_rate": 0.0004695,
"loss": 6.5758,
"mean_token_accuracy": 0.11200849413871765,
"num_tokens": 1633020.0,
"step": 940
},
{
"entropy": 6.592645740509033,
"epoch": 0.07352655125461972,
"grad_norm": 1.1484375,
"learning_rate": 0.000472,
"loss": 6.4715,
"mean_token_accuracy": 0.11014393791556358,
"num_tokens": 1641518.0,
"step": 945
},
{
"entropy": 6.5744109630584715,
"epoch": 0.07391558062633728,
"grad_norm": 1.125,
"learning_rate": 0.0004745,
"loss": 6.5601,
"mean_token_accuracy": 0.1099576011300087,
"num_tokens": 1650472.0,
"step": 950
},
{
"entropy": 6.645666933059692,
"epoch": 0.07430460999805485,
"grad_norm": 1.1796875,
"learning_rate": 0.000477,
"loss": 6.5753,
"mean_token_accuracy": 0.11195494011044502,
"num_tokens": 1659037.0,
"step": 955
},
{
"entropy": 6.697547388076782,
"epoch": 0.07469363936977241,
"grad_norm": 1.1875,
"learning_rate": 0.0004795,
"loss": 6.6649,
"mean_token_accuracy": 0.11236765310168266,
"num_tokens": 1667897.0,
"step": 960
},
{
"entropy": 6.552785778045655,
"epoch": 0.07508266874148999,
"grad_norm": 1.1484375,
"learning_rate": 0.000482,
"loss": 6.5075,
"mean_token_accuracy": 0.10858357399702072,
"num_tokens": 1676535.0,
"step": 965
},
{
"entropy": 6.665571069717407,
"epoch": 0.07547169811320754,
"grad_norm": 1.1796875,
"learning_rate": 0.0004845,
"loss": 6.5258,
"mean_token_accuracy": 0.11193247660994529,
"num_tokens": 1684415.0,
"step": 970
},
{
"entropy": 6.619773483276367,
"epoch": 0.07586072748492512,
"grad_norm": 1.25,
"learning_rate": 0.000487,
"loss": 6.4873,
"mean_token_accuracy": 0.1161974124610424,
"num_tokens": 1692443.0,
"step": 975
},
{
"entropy": 6.469988203048706,
"epoch": 0.07624975685664268,
"grad_norm": 1.1015625,
"learning_rate": 0.0004895,
"loss": 6.4908,
"mean_token_accuracy": 0.11075597926974297,
"num_tokens": 1700814.0,
"step": 980
},
{
"entropy": 6.469910621643066,
"epoch": 0.07663878622836025,
"grad_norm": 1.1328125,
"learning_rate": 0.000492,
"loss": 6.3349,
"mean_token_accuracy": 0.1179271623492241,
"num_tokens": 1709591.0,
"step": 985
},
{
"entropy": 6.605605697631836,
"epoch": 0.0770278156000778,
"grad_norm": 1.046875,
"learning_rate": 0.0004945,
"loss": 6.5879,
"mean_token_accuracy": 0.10372007116675377,
"num_tokens": 1718951.0,
"step": 990
},
{
"entropy": 6.66983380317688,
"epoch": 0.07741684497179536,
"grad_norm": 1.1953125,
"learning_rate": 0.000497,
"loss": 6.5431,
"mean_token_accuracy": 0.11147809475660324,
"num_tokens": 1727481.0,
"step": 995
},
{
"entropy": 6.5515549659729,
"epoch": 0.07780587434351294,
"grad_norm": 1.09375,
"learning_rate": 0.0004995,
"loss": 6.5418,
"mean_token_accuracy": 0.11638221740722657,
"num_tokens": 1736985.0,
"step": 1000
},
{
"entropy": 6.616484832763672,
"epoch": 0.0781949037152305,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999999989075146,
"loss": 6.5945,
"mean_token_accuracy": 0.10921485722064972,
"num_tokens": 1745470.0,
"step": 1005
},
{
"entropy": 6.620965623855591,
"epoch": 0.07858393308694807,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999999944692927,
"loss": 6.5176,
"mean_token_accuracy": 0.11291603669524193,
"num_tokens": 1754185.0,
"step": 1010
},
{
"entropy": 6.570215940475464,
"epoch": 0.07897296245866563,
"grad_norm": 1.1796875,
"learning_rate": 0.000499999986617054,
"loss": 6.5153,
"mean_token_accuracy": 0.11022635996341705,
"num_tokens": 1762100.0,
"step": 1015
},
{
"entropy": 6.5821075439453125,
"epoch": 0.0793619918303832,
"grad_norm": 1.171875,
"learning_rate": 0.0004999999753507986,
"loss": 6.5529,
"mean_token_accuracy": 0.11068348959088326,
"num_tokens": 1771070.0,
"step": 1020
},
{
"entropy": 6.546429920196533,
"epoch": 0.07975102120210076,
"grad_norm": 1.109375,
"learning_rate": 0.0004999999606705267,
"loss": 6.5267,
"mean_token_accuracy": 0.11509618312120437,
"num_tokens": 1780085.0,
"step": 1025
},
{
"entropy": 6.625613689422607,
"epoch": 0.08014005057381832,
"grad_norm": 1.03125,
"learning_rate": 0.0004999999425762385,
"loss": 6.5244,
"mean_token_accuracy": 0.11561840996146203,
"num_tokens": 1789316.0,
"step": 1030
},
{
"entropy": 6.537080764770508,
"epoch": 0.08052907994553589,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999999210679344,
"loss": 6.4437,
"mean_token_accuracy": 0.1176496423780918,
"num_tokens": 1797975.0,
"step": 1035
},
{
"entropy": 6.498772668838501,
"epoch": 0.08091810931725345,
"grad_norm": 1.125,
"learning_rate": 0.0004999998961456145,
"loss": 6.5537,
"mean_token_accuracy": 0.11998764723539353,
"num_tokens": 1806129.0,
"step": 1040
},
{
"entropy": 6.631723117828369,
"epoch": 0.08130713868897102,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999998678092794,
"loss": 6.5327,
"mean_token_accuracy": 0.11050191894173622,
"num_tokens": 1813956.0,
"step": 1045
},
{
"entropy": 6.599989175796509,
"epoch": 0.08169616806068858,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999998360589293,
"loss": 6.5657,
"mean_token_accuracy": 0.11095986440777779,
"num_tokens": 1822572.0,
"step": 1050
},
{
"entropy": 6.480882072448731,
"epoch": 0.08208519743240615,
"grad_norm": 1.0703125,
"learning_rate": 0.000499999800894565,
"loss": 6.4681,
"mean_token_accuracy": 0.11177131086587906,
"num_tokens": 1831870.0,
"step": 1055
},
{
"entropy": 6.47617883682251,
"epoch": 0.08247422680412371,
"grad_norm": 1.1875,
"learning_rate": 0.0004999997623161866,
"loss": 6.5107,
"mean_token_accuracy": 0.1112887792289257,
"num_tokens": 1840414.0,
"step": 1060
},
{
"entropy": 6.575576829910278,
"epoch": 0.08286325617584128,
"grad_norm": 1.078125,
"learning_rate": 0.0004999997203237951,
"loss": 6.527,
"mean_token_accuracy": 0.1100434735417366,
"num_tokens": 1850385.0,
"step": 1065
},
{
"entropy": 6.428466129302978,
"epoch": 0.08325228554755884,
"grad_norm": 1.125,
"learning_rate": 0.000499999674917391,
"loss": 6.4336,
"mean_token_accuracy": 0.12001706510782242,
"num_tokens": 1858479.0,
"step": 1070
},
{
"entropy": 6.507694816589355,
"epoch": 0.0836413149192764,
"grad_norm": 1.046875,
"learning_rate": 0.0004999996260969748,
"loss": 6.4857,
"mean_token_accuracy": 0.11208872050046921,
"num_tokens": 1867357.0,
"step": 1075
},
{
"entropy": 6.512378454208374,
"epoch": 0.08403034429099397,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999995738625475,
"loss": 6.4521,
"mean_token_accuracy": 0.1077382005751133,
"num_tokens": 1876211.0,
"step": 1080
},
{
"entropy": 6.390499639511108,
"epoch": 0.08441937366271153,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999995182141099,
"loss": 6.3633,
"mean_token_accuracy": 0.1128227360546589,
"num_tokens": 1884301.0,
"step": 1085
},
{
"entropy": 6.635722494125366,
"epoch": 0.0848084030344291,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999994591516626,
"loss": 6.5416,
"mean_token_accuracy": 0.11540148556232452,
"num_tokens": 1893191.0,
"step": 1090
},
{
"entropy": 6.37746410369873,
"epoch": 0.08519743240614666,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999993966752066,
"loss": 6.4131,
"mean_token_accuracy": 0.11306635513901711,
"num_tokens": 1901434.0,
"step": 1095
},
{
"entropy": 6.484576797485351,
"epoch": 0.08558646177786423,
"grad_norm": 1.140625,
"learning_rate": 0.000499999330784743,
"loss": 6.3908,
"mean_token_accuracy": 0.12002351284027099,
"num_tokens": 1910054.0,
"step": 1100
},
{
"entropy": 6.490119457244873,
"epoch": 0.08597549114958179,
"grad_norm": 1.109375,
"learning_rate": 0.0004999992614802725,
"loss": 6.5397,
"mean_token_accuracy": 0.11540758833289147,
"num_tokens": 1918607.0,
"step": 1105
},
{
"entropy": 6.551545763015747,
"epoch": 0.08636452052129936,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999991887617966,
"loss": 6.4828,
"mean_token_accuracy": 0.11358762234449386,
"num_tokens": 1927610.0,
"step": 1110
},
{
"entropy": 6.389538955688477,
"epoch": 0.08675354989301692,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999991126293158,
"loss": 6.4366,
"mean_token_accuracy": 0.11365601867437362,
"num_tokens": 1936174.0,
"step": 1115
},
{
"entropy": 6.459973239898682,
"epoch": 0.08714257926473448,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999990330828318,
"loss": 6.3439,
"mean_token_accuracy": 0.12333748191595077,
"num_tokens": 1944228.0,
"step": 1120
},
{
"entropy": 6.483522081375122,
"epoch": 0.08753160863645205,
"grad_norm": 1.09375,
"learning_rate": 0.0004999989501223456,
"loss": 6.4502,
"mean_token_accuracy": 0.11555779352784157,
"num_tokens": 1953144.0,
"step": 1125
},
{
"entropy": 6.46024751663208,
"epoch": 0.08792063800816961,
"grad_norm": 1.15625,
"learning_rate": 0.0004999988637478584,
"loss": 6.5161,
"mean_token_accuracy": 0.1126246102154255,
"num_tokens": 1961947.0,
"step": 1130
},
{
"entropy": 6.5634512424469,
"epoch": 0.08830966737988719,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999987739593716,
"loss": 6.4809,
"mean_token_accuracy": 0.11571738943457603,
"num_tokens": 1970674.0,
"step": 1135
},
{
"entropy": 6.490915060043335,
"epoch": 0.08869869675160474,
"grad_norm": 1.09375,
"learning_rate": 0.0004999986807568865,
"loss": 6.4496,
"mean_token_accuracy": 0.11765117347240447,
"num_tokens": 1979173.0,
"step": 1140
},
{
"entropy": 6.474772596359253,
"epoch": 0.08908772612332232,
"grad_norm": 1.171875,
"learning_rate": 0.0004999985841404045,
"loss": 6.4392,
"mean_token_accuracy": 0.11643676534295082,
"num_tokens": 1988134.0,
"step": 1145
},
{
"entropy": 6.441124773025512,
"epoch": 0.08947675549503988,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999984841099271,
"loss": 6.3768,
"mean_token_accuracy": 0.12014681100845337,
"num_tokens": 1996977.0,
"step": 1150
},
{
"entropy": 6.50206184387207,
"epoch": 0.08986578486675743,
"grad_norm": 1.0859375,
"learning_rate": 0.000499998380665456,
"loss": 6.4588,
"mean_token_accuracy": 0.1176146350800991,
"num_tokens": 2005946.0,
"step": 1155
},
{
"entropy": 6.388955450057983,
"epoch": 0.090254814238475,
"grad_norm": 1.2890625,
"learning_rate": 0.0004999982738069924,
"loss": 6.2831,
"mean_token_accuracy": 0.12113617286086083,
"num_tokens": 2014882.0,
"step": 1160
},
{
"entropy": 6.391384267807007,
"epoch": 0.09064384361019256,
"grad_norm": 1.203125,
"learning_rate": 0.0004999981635345382,
"loss": 6.4771,
"mean_token_accuracy": 0.1094152309000492,
"num_tokens": 2024858.0,
"step": 1165
},
{
"entropy": 6.371677255630493,
"epoch": 0.09103287298191014,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999980498480949,
"loss": 6.3701,
"mean_token_accuracy": 0.11717021316289902,
"num_tokens": 2034072.0,
"step": 1170
},
{
"entropy": 6.45729169845581,
"epoch": 0.0914219023536277,
"grad_norm": 1.078125,
"learning_rate": 0.0004999979327476644,
"loss": 6.3869,
"mean_token_accuracy": 0.11678455844521522,
"num_tokens": 2042649.0,
"step": 1175
},
{
"entropy": 6.433530855178833,
"epoch": 0.09181093172534527,
"grad_norm": 1.109375,
"learning_rate": 0.0004999978122332485,
"loss": 6.4431,
"mean_token_accuracy": 0.1181255742907524,
"num_tokens": 2050866.0,
"step": 1180
},
{
"entropy": 6.4381969451904295,
"epoch": 0.09219996109706283,
"grad_norm": 1.203125,
"learning_rate": 0.0004999976883048487,
"loss": 6.4242,
"mean_token_accuracy": 0.11656152158975601,
"num_tokens": 2058914.0,
"step": 1185
},
{
"entropy": 6.419391775131226,
"epoch": 0.0925889904687804,
"grad_norm": 1.125,
"learning_rate": 0.0004999975609624673,
"loss": 6.362,
"mean_token_accuracy": 0.11579015702009202,
"num_tokens": 2068098.0,
"step": 1190
},
{
"entropy": 6.418846511840821,
"epoch": 0.09297801984049796,
"grad_norm": 1.078125,
"learning_rate": 0.0004999974302061059,
"loss": 6.3645,
"mean_token_accuracy": 0.11124148517847061,
"num_tokens": 2077299.0,
"step": 1195
},
{
"entropy": 6.40845251083374,
"epoch": 0.09336704921221552,
"grad_norm": 1.25,
"learning_rate": 0.0004999972960357666,
"loss": 6.4689,
"mean_token_accuracy": 0.11288349330425262,
"num_tokens": 2087868.0,
"step": 1200
},
{
"entropy": 6.447312068939209,
"epoch": 0.09375607858393309,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999971584514516,
"loss": 6.3783,
"mean_token_accuracy": 0.123850879073143,
"num_tokens": 2096553.0,
"step": 1205
},
{
"entropy": 6.458125257492066,
"epoch": 0.09414510795565065,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999970174531627,
"loss": 6.3609,
"mean_token_accuracy": 0.11663044691085815,
"num_tokens": 2104809.0,
"step": 1210
},
{
"entropy": 6.294647073745727,
"epoch": 0.09453413732736822,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999968730409022,
"loss": 6.3464,
"mean_token_accuracy": 0.11563503369688988,
"num_tokens": 2113869.0,
"step": 1215
},
{
"entropy": 6.34133825302124,
"epoch": 0.09492316669908578,
"grad_norm": 1.140625,
"learning_rate": 0.0004999967252146723,
"loss": 6.1603,
"mean_token_accuracy": 0.11609101369976997,
"num_tokens": 2121749.0,
"step": 1220
},
{
"entropy": 6.341687250137329,
"epoch": 0.09531219607080335,
"grad_norm": 1.09375,
"learning_rate": 0.0004999965739744752,
"loss": 6.3824,
"mean_token_accuracy": 0.11490623876452447,
"num_tokens": 2130828.0,
"step": 1225
},
{
"entropy": 6.462488079071045,
"epoch": 0.09570122544252091,
"grad_norm": 1.125,
"learning_rate": 0.0004999964193203132,
"loss": 6.35,
"mean_token_accuracy": 0.11846289187669753,
"num_tokens": 2138928.0,
"step": 1230
},
{
"entropy": 6.407934045791626,
"epoch": 0.09609025481423847,
"grad_norm": 1.0625,
"learning_rate": 0.0004999962612521888,
"loss": 6.3864,
"mean_token_accuracy": 0.11911074891686439,
"num_tokens": 2147643.0,
"step": 1235
},
{
"entropy": 6.398451328277588,
"epoch": 0.09647928418595604,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999960997701041,
"loss": 6.3112,
"mean_token_accuracy": 0.12286981865763665,
"num_tokens": 2156766.0,
"step": 1240
},
{
"entropy": 6.415870094299317,
"epoch": 0.0968683135576736,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999959348740618,
"loss": 6.3735,
"mean_token_accuracy": 0.11572954803705215,
"num_tokens": 2165517.0,
"step": 1245
},
{
"entropy": 6.276720762252808,
"epoch": 0.09725734292939117,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999957665640641,
"loss": 6.2391,
"mean_token_accuracy": 0.12221750989556313,
"num_tokens": 2174812.0,
"step": 1250
},
{
"entropy": 6.389494466781616,
"epoch": 0.09764637230110873,
"grad_norm": 1.046875,
"learning_rate": 0.000499995594840114,
"loss": 6.3961,
"mean_token_accuracy": 0.1142569437623024,
"num_tokens": 2183968.0,
"step": 1255
},
{
"entropy": 6.395362615585327,
"epoch": 0.0980354016728263,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999954197022138,
"loss": 6.4207,
"mean_token_accuracy": 0.12095934301614761,
"num_tokens": 2191947.0,
"step": 1260
},
{
"entropy": 6.362047100067139,
"epoch": 0.09842443104454386,
"grad_norm": 1.09375,
"learning_rate": 0.0004999952411503661,
"loss": 6.2524,
"mean_token_accuracy": 0.12708474695682526,
"num_tokens": 2199951.0,
"step": 1265
},
{
"entropy": 6.345381879806519,
"epoch": 0.09881346041626143,
"grad_norm": 1.1875,
"learning_rate": 0.0004999950591845738,
"loss": 6.4025,
"mean_token_accuracy": 0.11825087368488311,
"num_tokens": 2208714.0,
"step": 1270
},
{
"entropy": 6.296407985687256,
"epoch": 0.09920248978797899,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999948738048397,
"loss": 6.2605,
"mean_token_accuracy": 0.12081179469823837,
"num_tokens": 2217250.0,
"step": 1275
},
{
"entropy": 6.371564292907715,
"epoch": 0.09959151915969655,
"grad_norm": 1.203125,
"learning_rate": 0.0004999946850111663,
"loss": 6.329,
"mean_token_accuracy": 0.12220223546028137,
"num_tokens": 2225468.0,
"step": 1280
},
{
"entropy": 6.248642206192017,
"epoch": 0.09998054853141412,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999944928035569,
"loss": 6.2729,
"mean_token_accuracy": 0.12882675752043724,
"num_tokens": 2233893.0,
"step": 1285
},
{
"entropy": 6.485666704177857,
"epoch": 0.10036957790313168,
"grad_norm": 1.15625,
"learning_rate": 0.000499994297182014,
"loss": 6.3387,
"mean_token_accuracy": 0.11729943826794624,
"num_tokens": 2242487.0,
"step": 1290
},
{
"entropy": 6.232321691513062,
"epoch": 0.10075860727484925,
"grad_norm": 1.109375,
"learning_rate": 0.0004999940981465408,
"loss": 6.1769,
"mean_token_accuracy": 0.12584130242466926,
"num_tokens": 2250518.0,
"step": 1295
},
{
"entropy": 6.359662485122681,
"epoch": 0.10114763664656681,
"grad_norm": 1.15625,
"learning_rate": 0.0004999938956971404,
"loss": 6.35,
"mean_token_accuracy": 0.11376101300120353,
"num_tokens": 2259024.0,
"step": 1300
},
{
"entropy": 6.315293645858764,
"epoch": 0.10153666601828439,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999936898338156,
"loss": 6.406,
"mean_token_accuracy": 0.11127450317144394,
"num_tokens": 2267832.0,
"step": 1305
},
{
"entropy": 6.441192197799682,
"epoch": 0.10192569539000194,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999934805565698,
"loss": 6.4422,
"mean_token_accuracy": 0.11080272123217583,
"num_tokens": 2276834.0,
"step": 1310
},
{
"entropy": 6.482887125015258,
"epoch": 0.10231472476171952,
"grad_norm": 1.0625,
"learning_rate": 0.000499993267865406,
"loss": 6.3746,
"mean_token_accuracy": 0.11520213186740876,
"num_tokens": 2285736.0,
"step": 1315
},
{
"entropy": 6.384394311904908,
"epoch": 0.10270375413343708,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999930517603275,
"loss": 6.3234,
"mean_token_accuracy": 0.1279608964920044,
"num_tokens": 2294177.0,
"step": 1320
},
{
"entropy": 6.272417211532593,
"epoch": 0.10309278350515463,
"grad_norm": 1.171875,
"learning_rate": 0.0004999928322413374,
"loss": 6.1152,
"mean_token_accuracy": 0.13164947628974916,
"num_tokens": 2302784.0,
"step": 1325
},
{
"entropy": 6.1753613471984865,
"epoch": 0.1034818128768722,
"grad_norm": 1.0625,
"learning_rate": 0.0004999926093084394,
"loss": 6.2247,
"mean_token_accuracy": 0.1209910273551941,
"num_tokens": 2311650.0,
"step": 1330
},
{
"entropy": 6.426689910888672,
"epoch": 0.10387084224858976,
"grad_norm": 1.09375,
"learning_rate": 0.0004999923829616365,
"loss": 6.3461,
"mean_token_accuracy": 0.12103552594780922,
"num_tokens": 2319828.0,
"step": 1335
},
{
"entropy": 6.360848712921142,
"epoch": 0.10425987162030734,
"grad_norm": 1.109375,
"learning_rate": 0.0004999921532009323,
"loss": 6.3423,
"mean_token_accuracy": 0.11625662669539452,
"num_tokens": 2328636.0,
"step": 1340
},
{
"entropy": 6.244861602783203,
"epoch": 0.1046489009920249,
"grad_norm": 1.1875,
"learning_rate": 0.0004999919200263304,
"loss": 6.2352,
"mean_token_accuracy": 0.1234541155397892,
"num_tokens": 2336771.0,
"step": 1345
},
{
"entropy": 6.352584886550903,
"epoch": 0.10503793036374247,
"grad_norm": 1.046875,
"learning_rate": 0.0004999916834378342,
"loss": 6.3854,
"mean_token_accuracy": 0.11652181446552276,
"num_tokens": 2346106.0,
"step": 1350
},
{
"entropy": 6.42938871383667,
"epoch": 0.10542695973546003,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999914434354472,
"loss": 6.3661,
"mean_token_accuracy": 0.11678783521056176,
"num_tokens": 2354943.0,
"step": 1355
},
{
"entropy": 6.208476591110229,
"epoch": 0.10581598910717759,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999912000191733,
"loss": 6.2707,
"mean_token_accuracy": 0.12307048067450524,
"num_tokens": 2363699.0,
"step": 1360
},
{
"entropy": 6.340670251846314,
"epoch": 0.10620501847889516,
"grad_norm": 1.1015625,
"learning_rate": 0.000499990953189016,
"loss": 6.4154,
"mean_token_accuracy": 0.11648116931319237,
"num_tokens": 2373316.0,
"step": 1365
},
{
"entropy": 6.536358499526978,
"epoch": 0.10659404785061272,
"grad_norm": 1.140625,
"learning_rate": 0.0004999907029449791,
"loss": 6.4774,
"mean_token_accuracy": 0.1135114923119545,
"num_tokens": 2381550.0,
"step": 1370
},
{
"entropy": 6.30794472694397,
"epoch": 0.10698307722233029,
"grad_norm": 1.140625,
"learning_rate": 0.0004999904492870663,
"loss": 6.2883,
"mean_token_accuracy": 0.12282988801598549,
"num_tokens": 2389546.0,
"step": 1375
},
{
"entropy": 6.380693864822388,
"epoch": 0.10737210659404785,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999901922152816,
"loss": 6.244,
"mean_token_accuracy": 0.12719449624419213,
"num_tokens": 2398852.0,
"step": 1380
},
{
"entropy": 6.272253751754761,
"epoch": 0.10776113596576542,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999899317296288,
"loss": 6.3308,
"mean_token_accuracy": 0.12012203708291054,
"num_tokens": 2407815.0,
"step": 1385
},
{
"entropy": 6.317573165893554,
"epoch": 0.10815016533748298,
"grad_norm": 1.046875,
"learning_rate": 0.0004999896678301121,
"loss": 6.1922,
"mean_token_accuracy": 0.12548744305968285,
"num_tokens": 2417300.0,
"step": 1390
},
{
"entropy": 6.297150897979736,
"epoch": 0.10853919470920055,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999894005167352,
"loss": 6.3578,
"mean_token_accuracy": 0.11943556964397431,
"num_tokens": 2426257.0,
"step": 1395
},
{
"entropy": 6.4665430068969725,
"epoch": 0.10892822408091811,
"grad_norm": 1.0703125,
"learning_rate": 0.000499989129789502,
"loss": 6.3817,
"mean_token_accuracy": 0.12104496955871583,
"num_tokens": 2434595.0,
"step": 1400
},
{
"entropy": 6.406263446807861,
"epoch": 0.10931725345263567,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999888556484172,
"loss": 6.39,
"mean_token_accuracy": 0.11528819128870964,
"num_tokens": 2443945.0,
"step": 1405
},
{
"entropy": 6.226689291000366,
"epoch": 0.10970628282435324,
"grad_norm": 1.125,
"learning_rate": 0.0004999885780934845,
"loss": 6.2536,
"mean_token_accuracy": 0.12194890603423118,
"num_tokens": 2453141.0,
"step": 1410
},
{
"entropy": 6.352630996704102,
"epoch": 0.1100953121960708,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999882971247081,
"loss": 6.3336,
"mean_token_accuracy": 0.122190822660923,
"num_tokens": 2461873.0,
"step": 1415
},
{
"entropy": 6.317797040939331,
"epoch": 0.11048434156778837,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999880127420926,
"loss": 6.3632,
"mean_token_accuracy": 0.11227262541651725,
"num_tokens": 2471238.0,
"step": 1420
},
{
"entropy": 6.334433937072754,
"epoch": 0.11087337093950593,
"grad_norm": 1.203125,
"learning_rate": 0.0004999877249456421,
"loss": 6.2408,
"mean_token_accuracy": 0.1272654689848423,
"num_tokens": 2479412.0,
"step": 1425
},
{
"entropy": 6.188841533660889,
"epoch": 0.1112624003112235,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999874337353609,
"loss": 6.1292,
"mean_token_accuracy": 0.12458490431308747,
"num_tokens": 2488150.0,
"step": 1430
},
{
"entropy": 6.280575132369995,
"epoch": 0.11165142968294106,
"grad_norm": 1.046875,
"learning_rate": 0.0004999871391112535,
"loss": 6.309,
"mean_token_accuracy": 0.12516588494181632,
"num_tokens": 2498103.0,
"step": 1435
},
{
"entropy": 6.1986839294433596,
"epoch": 0.11204045905465862,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999868410733244,
"loss": 6.1695,
"mean_token_accuracy": 0.125221885740757,
"num_tokens": 2506211.0,
"step": 1440
},
{
"entropy": 6.172796535491943,
"epoch": 0.11242948842637619,
"grad_norm": 1.140625,
"learning_rate": 0.000499986539621578,
"loss": 6.2162,
"mean_token_accuracy": 0.12384542673826218,
"num_tokens": 2514743.0,
"step": 1445
},
{
"entropy": 6.167073822021484,
"epoch": 0.11281851779809375,
"grad_norm": 1.03125,
"learning_rate": 0.0004999862347560191,
"loss": 6.2027,
"mean_token_accuracy": 0.12268847003579139,
"num_tokens": 2523824.0,
"step": 1450
},
{
"entropy": 6.387971639633179,
"epoch": 0.11320754716981132,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999859264766521,
"loss": 6.2719,
"mean_token_accuracy": 0.12253661304712296,
"num_tokens": 2532360.0,
"step": 1455
},
{
"entropy": 6.257190561294555,
"epoch": 0.11359657654152888,
"grad_norm": 1.109375,
"learning_rate": 0.0004999856147834817,
"loss": 6.2217,
"mean_token_accuracy": 0.1282711908221245,
"num_tokens": 2540547.0,
"step": 1460
},
{
"entropy": 6.174588632583618,
"epoch": 0.11398560591324645,
"grad_norm": 1.140625,
"learning_rate": 0.0004999852996765129,
"loss": 6.2459,
"mean_token_accuracy": 0.12327087596058846,
"num_tokens": 2549193.0,
"step": 1465
},
{
"entropy": 6.317156839370727,
"epoch": 0.11437463528496401,
"grad_norm": 1.09375,
"learning_rate": 0.0004999849811557502,
"loss": 6.254,
"mean_token_accuracy": 0.12232557386159897,
"num_tokens": 2557553.0,
"step": 1470
},
{
"entropy": 6.374777555465698,
"epoch": 0.11476366465668159,
"grad_norm": 1.09375,
"learning_rate": 0.0004999846592211984,
"loss": 6.3602,
"mean_token_accuracy": 0.11835889741778374,
"num_tokens": 2565945.0,
"step": 1475
},
{
"entropy": 6.324231147766113,
"epoch": 0.11515269402839914,
"grad_norm": 1.2109375,
"learning_rate": 0.0004999843338728626,
"loss": 6.2285,
"mean_token_accuracy": 0.11772384941577911,
"num_tokens": 2574364.0,
"step": 1480
},
{
"entropy": 6.176779270172119,
"epoch": 0.1155417234001167,
"grad_norm": 1.0,
"learning_rate": 0.0004999840051107476,
"loss": 6.1531,
"mean_token_accuracy": 0.1252761095762253,
"num_tokens": 2582825.0,
"step": 1485
},
{
"entropy": 6.367834663391113,
"epoch": 0.11593075277183428,
"grad_norm": 1.078125,
"learning_rate": 0.0004999836729348584,
"loss": 6.2943,
"mean_token_accuracy": 0.12382682561874389,
"num_tokens": 2591628.0,
"step": 1490
},
{
"entropy": 6.331791353225708,
"epoch": 0.11631978214355183,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999833373452,
"loss": 6.2892,
"mean_token_accuracy": 0.1190582662820816,
"num_tokens": 2600436.0,
"step": 1495
},
{
"entropy": 6.217423963546753,
"epoch": 0.1167088115152694,
"grad_norm": 1.1875,
"learning_rate": 0.0004999829983417778,
"loss": 6.2596,
"mean_token_accuracy": 0.12188921868801117,
"num_tokens": 2609709.0,
"step": 1500
},
{
"entropy": 6.359324789047241,
"epoch": 0.11709784088698696,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999826559245965,
"loss": 6.2586,
"mean_token_accuracy": 0.12367889285087585,
"num_tokens": 2617992.0,
"step": 1505
},
{
"entropy": 6.17459282875061,
"epoch": 0.11748687025870454,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999823100936615,
"loss": 6.1695,
"mean_token_accuracy": 0.12516930997371672,
"num_tokens": 2626706.0,
"step": 1510
},
{
"entropy": 6.3931690692901615,
"epoch": 0.1178758996304221,
"grad_norm": 1.203125,
"learning_rate": 0.0004999819608489781,
"loss": 6.2359,
"mean_token_accuracy": 0.13169281259179116,
"num_tokens": 2634642.0,
"step": 1515
},
{
"entropy": 6.271792840957642,
"epoch": 0.11826492900213967,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999816081905515,
"loss": 6.2722,
"mean_token_accuracy": 0.11658980697393417,
"num_tokens": 2644160.0,
"step": 1520
},
{
"entropy": 6.214734745025635,
"epoch": 0.11865395837385723,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999812521183872,
"loss": 6.2285,
"mean_token_accuracy": 0.1217222385108471,
"num_tokens": 2653390.0,
"step": 1525
},
{
"entropy": 6.356004905700684,
"epoch": 0.11904298774557479,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999808926324903,
"loss": 6.2785,
"mean_token_accuracy": 0.12192253395915031,
"num_tokens": 2662561.0,
"step": 1530
},
{
"entropy": 6.280083322525025,
"epoch": 0.11943201711729236,
"grad_norm": 1.2109375,
"learning_rate": 0.0004999805297328665,
"loss": 6.2453,
"mean_token_accuracy": 0.12399770319461823,
"num_tokens": 2670694.0,
"step": 1535
},
{
"entropy": 6.214053916931152,
"epoch": 0.11982104648900992,
"grad_norm": 1.125,
"learning_rate": 0.0004999801634195214,
"loss": 6.1408,
"mean_token_accuracy": 0.12651772275567055,
"num_tokens": 2679583.0,
"step": 1540
},
{
"entropy": 6.181328582763672,
"epoch": 0.12021007586072749,
"grad_norm": 1.09375,
"learning_rate": 0.0004999797936924603,
"loss": 6.1127,
"mean_token_accuracy": 0.12723355293273925,
"num_tokens": 2688429.0,
"step": 1545
},
{
"entropy": 6.365040397644043,
"epoch": 0.12059910523244505,
"grad_norm": 1.109375,
"learning_rate": 0.000499979420551689,
"loss": 6.2115,
"mean_token_accuracy": 0.12122456356883049,
"num_tokens": 2697134.0,
"step": 1550
},
{
"entropy": 6.182654905319214,
"epoch": 0.12098813460416262,
"grad_norm": 1.09375,
"learning_rate": 0.000499979043997213,
"loss": 6.3483,
"mean_token_accuracy": 0.11888098418712616,
"num_tokens": 2705641.0,
"step": 1555
},
{
"entropy": 6.314460563659668,
"epoch": 0.12137716397588018,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999786640290381,
"loss": 6.2908,
"mean_token_accuracy": 0.12467942461371422,
"num_tokens": 2714977.0,
"step": 1560
},
{
"entropy": 6.2193540096282955,
"epoch": 0.12176619334759774,
"grad_norm": 1.1875,
"learning_rate": 0.0004999782806471701,
"loss": 6.1337,
"mean_token_accuracy": 0.1347135454416275,
"num_tokens": 2723120.0,
"step": 1565
},
{
"entropy": 6.0879443168640135,
"epoch": 0.12215522271931531,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999778938516147,
"loss": 6.1317,
"mean_token_accuracy": 0.13238951042294503,
"num_tokens": 2731964.0,
"step": 1570
},
{
"entropy": 6.39334282875061,
"epoch": 0.12254425209103287,
"grad_norm": 1.0703125,
"learning_rate": 0.000499977503642378,
"loss": 6.1931,
"mean_token_accuracy": 0.127005735039711,
"num_tokens": 2741537.0,
"step": 1575
},
{
"entropy": 6.138741397857666,
"epoch": 0.12293328146275044,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999771100194656,
"loss": 6.3277,
"mean_token_accuracy": 0.1212069720029831,
"num_tokens": 2751522.0,
"step": 1580
},
{
"entropy": 6.3773661136627195,
"epoch": 0.123322310834468,
"grad_norm": 1.03125,
"learning_rate": 0.0004999767129828837,
"loss": 6.3125,
"mean_token_accuracy": 0.11907947659492493,
"num_tokens": 2761100.0,
"step": 1585
},
{
"entropy": 6.22048397064209,
"epoch": 0.12371134020618557,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999763125326383,
"loss": 6.2478,
"mean_token_accuracy": 0.12256922721862792,
"num_tokens": 2769171.0,
"step": 1590
},
{
"entropy": 6.243303442001343,
"epoch": 0.12410036957790313,
"grad_norm": 1.140625,
"learning_rate": 0.0004999759086687355,
"loss": 6.1867,
"mean_token_accuracy": 0.12792484536767007,
"num_tokens": 2778021.0,
"step": 1595
},
{
"entropy": 6.166972827911377,
"epoch": 0.1244893989496207,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999755013911813,
"loss": 6.1195,
"mean_token_accuracy": 0.13010439202189444,
"num_tokens": 2787206.0,
"step": 1600
},
{
"entropy": 6.148937082290649,
"epoch": 0.12487842832133826,
"grad_norm": 1.09375,
"learning_rate": 0.000499975090699982,
"loss": 6.1981,
"mean_token_accuracy": 0.1204142227768898,
"num_tokens": 2796051.0,
"step": 1605
},
{
"entropy": 6.247499084472656,
"epoch": 0.12526745769305583,
"grad_norm": 1.015625,
"learning_rate": 0.0004999746765951438,
"loss": 6.144,
"mean_token_accuracy": 0.12628112062811853,
"num_tokens": 2804961.0,
"step": 1610
},
{
"entropy": 6.156633281707764,
"epoch": 0.1256564870647734,
"grad_norm": 1.140625,
"learning_rate": 0.0004999742590766729,
"loss": 6.0863,
"mean_token_accuracy": 0.13187484741210936,
"num_tokens": 2813691.0,
"step": 1615
},
{
"entropy": 6.225268125534058,
"epoch": 0.12604551643649095,
"grad_norm": 1.140625,
"learning_rate": 0.0004999738381445757,
"loss": 6.248,
"mean_token_accuracy": 0.12675216943025588,
"num_tokens": 2822248.0,
"step": 1620
},
{
"entropy": 6.251285171508789,
"epoch": 0.1264345458082085,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999734137988586,
"loss": 6.1923,
"mean_token_accuracy": 0.12956587076187134,
"num_tokens": 2830826.0,
"step": 1625
},
{
"entropy": 6.216675090789795,
"epoch": 0.1268235751799261,
"grad_norm": 1.1875,
"learning_rate": 0.000499972986039528,
"loss": 6.1839,
"mean_token_accuracy": 0.12593767046928406,
"num_tokens": 2839766.0,
"step": 1630
},
{
"entropy": 6.123473691940307,
"epoch": 0.12721260455164365,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999725548665904,
"loss": 6.1228,
"mean_token_accuracy": 0.13010624870657922,
"num_tokens": 2848728.0,
"step": 1635
},
{
"entropy": 6.1722784519195555,
"epoch": 0.1276016339233612,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999721202800524,
"loss": 6.1396,
"mean_token_accuracy": 0.13079047277569772,
"num_tokens": 2857221.0,
"step": 1640
},
{
"entropy": 6.263162755966187,
"epoch": 0.12799066329507877,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999716822799206,
"loss": 6.2131,
"mean_token_accuracy": 0.12727918699383736,
"num_tokens": 2865314.0,
"step": 1645
},
{
"entropy": 6.1169415473937985,
"epoch": 0.12837969266679633,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999712408662016,
"loss": 6.088,
"mean_token_accuracy": 0.12827678620815278,
"num_tokens": 2873654.0,
"step": 1650
},
{
"entropy": 6.114794111251831,
"epoch": 0.12876872203851392,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999707960389021,
"loss": 5.9976,
"mean_token_accuracy": 0.1390816293656826,
"num_tokens": 2881604.0,
"step": 1655
},
{
"entropy": 6.175813865661621,
"epoch": 0.12915775141023147,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999703477980288,
"loss": 6.1899,
"mean_token_accuracy": 0.12590051293373108,
"num_tokens": 2890427.0,
"step": 1660
},
{
"entropy": 6.176800918579102,
"epoch": 0.12954678078194903,
"grad_norm": 1.15625,
"learning_rate": 0.0004999698961435885,
"loss": 6.1608,
"mean_token_accuracy": 0.1278068646788597,
"num_tokens": 2899206.0,
"step": 1665
},
{
"entropy": 6.1610307693481445,
"epoch": 0.1299358101536666,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999694410755882,
"loss": 6.0803,
"mean_token_accuracy": 0.1307940810918808,
"num_tokens": 2907738.0,
"step": 1670
},
{
"entropy": 6.264579439163208,
"epoch": 0.13032483952538418,
"grad_norm": 1.0625,
"learning_rate": 0.0004999689825940347,
"loss": 6.3124,
"mean_token_accuracy": 0.12490758523344994,
"num_tokens": 2916881.0,
"step": 1675
},
{
"entropy": 6.203776741027832,
"epoch": 0.13071386889710174,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999685206989349,
"loss": 6.2506,
"mean_token_accuracy": 0.12321256548166275,
"num_tokens": 2926467.0,
"step": 1680
},
{
"entropy": 6.266940355300903,
"epoch": 0.1311028982688193,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999680553902959,
"loss": 6.1586,
"mean_token_accuracy": 0.12849143967032434,
"num_tokens": 2934671.0,
"step": 1685
},
{
"entropy": 6.153891229629517,
"epoch": 0.13149192764053685,
"grad_norm": 1.015625,
"learning_rate": 0.0004999675866681247,
"loss": 6.1937,
"mean_token_accuracy": 0.12307270169258118,
"num_tokens": 2943925.0,
"step": 1690
},
{
"entropy": 6.251479959487915,
"epoch": 0.1318809570122544,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999671145324286,
"loss": 6.2351,
"mean_token_accuracy": 0.12551012486219407,
"num_tokens": 2952118.0,
"step": 1695
},
{
"entropy": 6.142472887039185,
"epoch": 0.132269986383972,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999666389832144,
"loss": 6.2185,
"mean_token_accuracy": 0.12478951662778855,
"num_tokens": 2961110.0,
"step": 1700
},
{
"entropy": 6.258459663391113,
"epoch": 0.13265901575568956,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999661600204897,
"loss": 6.1492,
"mean_token_accuracy": 0.1310803025960922,
"num_tokens": 2968877.0,
"step": 1705
},
{
"entropy": 6.205829286575318,
"epoch": 0.13304804512740712,
"grad_norm": 1.09375,
"learning_rate": 0.0004999656776442615,
"loss": 6.2062,
"mean_token_accuracy": 0.12969572320580483,
"num_tokens": 2977346.0,
"step": 1710
},
{
"entropy": 6.306067752838135,
"epoch": 0.13343707449912467,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999651918545372,
"loss": 6.2403,
"mean_token_accuracy": 0.12232028320431709,
"num_tokens": 2987494.0,
"step": 1715
},
{
"entropy": 6.168236112594604,
"epoch": 0.13382610387084226,
"grad_norm": 1.09375,
"learning_rate": 0.0004999647026513243,
"loss": 6.167,
"mean_token_accuracy": 0.12709078639745713,
"num_tokens": 2996728.0,
"step": 1720
},
{
"entropy": 6.16880464553833,
"epoch": 0.13421513324255982,
"grad_norm": 1.140625,
"learning_rate": 0.00049996421003463,
"loss": 6.1947,
"mean_token_accuracy": 0.12163503617048263,
"num_tokens": 3005810.0,
"step": 1725
},
{
"entropy": 6.225845766067505,
"epoch": 0.13460416261427738,
"grad_norm": 1.171875,
"learning_rate": 0.0004999637140044619,
"loss": 6.2057,
"mean_token_accuracy": 0.12583187147974967,
"num_tokens": 3014603.0,
"step": 1730
},
{
"entropy": 6.286410093307495,
"epoch": 0.13499319198599494,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999632145608275,
"loss": 6.2073,
"mean_token_accuracy": 0.12976924255490302,
"num_tokens": 3023170.0,
"step": 1735
},
{
"entropy": 6.047111463546753,
"epoch": 0.1353822213577125,
"grad_norm": 1.140625,
"learning_rate": 0.0004999627117037343,
"loss": 5.952,
"mean_token_accuracy": 0.13934574648737907,
"num_tokens": 3030565.0,
"step": 1740
},
{
"entropy": 6.201064538955689,
"epoch": 0.13577125072943008,
"grad_norm": 1.0234375,
"learning_rate": 0.00049996220543319,
"loss": 6.2296,
"mean_token_accuracy": 0.1313652738928795,
"num_tokens": 3040124.0,
"step": 1745
},
{
"entropy": 6.118889284133911,
"epoch": 0.13616028010114764,
"grad_norm": 1.125,
"learning_rate": 0.0004999616957492025,
"loss": 6.0833,
"mean_token_accuracy": 0.1335503078997135,
"num_tokens": 3048458.0,
"step": 1750
},
{
"entropy": 6.115156173706055,
"epoch": 0.1365493094728652,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999611826517793,
"loss": 6.0529,
"mean_token_accuracy": 0.12220517992973327,
"num_tokens": 3057926.0,
"step": 1755
},
{
"entropy": 6.074193906784058,
"epoch": 0.13693833884458276,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999606661409281,
"loss": 6.0902,
"mean_token_accuracy": 0.12791807651519777,
"num_tokens": 3066683.0,
"step": 1760
},
{
"entropy": 6.162175607681275,
"epoch": 0.13732736821630034,
"grad_norm": 1.09375,
"learning_rate": 0.0004999601462166569,
"loss": 6.1736,
"mean_token_accuracy": 0.12800901383161545,
"num_tokens": 3075117.0,
"step": 1765
},
{
"entropy": 6.291727209091187,
"epoch": 0.1377163975880179,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999596228789736,
"loss": 6.2362,
"mean_token_accuracy": 0.12387871071696281,
"num_tokens": 3084399.0,
"step": 1770
},
{
"entropy": 6.073335409164429,
"epoch": 0.13810542695973546,
"grad_norm": 1.046875,
"learning_rate": 0.0004999590961278859,
"loss": 6.0154,
"mean_token_accuracy": 0.13292096480727195,
"num_tokens": 3093030.0,
"step": 1775
},
{
"entropy": 6.19185700416565,
"epoch": 0.13849445633145302,
"grad_norm": 1.109375,
"learning_rate": 0.0004999585659634021,
"loss": 6.0716,
"mean_token_accuracy": 0.13075146377086638,
"num_tokens": 3101670.0,
"step": 1780
},
{
"entropy": 6.05259747505188,
"epoch": 0.13888348570317058,
"grad_norm": 1.0625,
"learning_rate": 0.0004999580323855301,
"loss": 6.0614,
"mean_token_accuracy": 0.13134398460388183,
"num_tokens": 3109703.0,
"step": 1785
},
{
"entropy": 6.102718019485474,
"epoch": 0.13927251507488816,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999574953942781,
"loss": 6.0242,
"mean_token_accuracy": 0.13451038673520088,
"num_tokens": 3118388.0,
"step": 1790
},
{
"entropy": 6.110586404800415,
"epoch": 0.13966154444660572,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999569549896541,
"loss": 6.0341,
"mean_token_accuracy": 0.13156714141368867,
"num_tokens": 3126466.0,
"step": 1795
},
{
"entropy": 6.112448740005493,
"epoch": 0.14005057381832328,
"grad_norm": 1.0625,
"learning_rate": 0.0004999564111716665,
"loss": 6.0781,
"mean_token_accuracy": 0.1335633009672165,
"num_tokens": 3135322.0,
"step": 1800
},
{
"entropy": 6.108473491668701,
"epoch": 0.14043960319004084,
"grad_norm": 1.078125,
"learning_rate": 0.0004999558639403232,
"loss": 6.0755,
"mean_token_accuracy": 0.13613163232803344,
"num_tokens": 3144498.0,
"step": 1805
},
{
"entropy": 6.045802354812622,
"epoch": 0.1408286325617584,
"grad_norm": 1.0625,
"learning_rate": 0.0004999553132956328,
"loss": 6.0512,
"mean_token_accuracy": 0.12877680659294127,
"num_tokens": 3153573.0,
"step": 1810
},
{
"entropy": 6.046996307373047,
"epoch": 0.14121766193347599,
"grad_norm": 1.078125,
"learning_rate": 0.0004999547592376035,
"loss": 5.9939,
"mean_token_accuracy": 0.1377910055220127,
"num_tokens": 3161705.0,
"step": 1815
},
{
"entropy": 6.138423156738281,
"epoch": 0.14160669130519354,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999542017662438,
"loss": 6.1474,
"mean_token_accuracy": 0.13016104623675345,
"num_tokens": 3170068.0,
"step": 1820
},
{
"entropy": 6.134330701828003,
"epoch": 0.1419957206769111,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999536408815623,
"loss": 6.152,
"mean_token_accuracy": 0.12710127755999565,
"num_tokens": 3178140.0,
"step": 1825
},
{
"entropy": 6.159389972686768,
"epoch": 0.14238475004862866,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999530765835672,
"loss": 6.117,
"mean_token_accuracy": 0.1319376789033413,
"num_tokens": 3186518.0,
"step": 1830
},
{
"entropy": 6.114027595520019,
"epoch": 0.14277377942034625,
"grad_norm": 1.109375,
"learning_rate": 0.0004999525088722673,
"loss": 6.1086,
"mean_token_accuracy": 0.126016952842474,
"num_tokens": 3195246.0,
"step": 1835
},
{
"entropy": 6.2064361572265625,
"epoch": 0.1431628087920638,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999519377476711,
"loss": 6.1239,
"mean_token_accuracy": 0.12959307059645653,
"num_tokens": 3203946.0,
"step": 1840
},
{
"entropy": 6.125613784790039,
"epoch": 0.14355183816378136,
"grad_norm": 1.171875,
"learning_rate": 0.0004999513632097872,
"loss": 6.1511,
"mean_token_accuracy": 0.12730584666132927,
"num_tokens": 3212208.0,
"step": 1845
},
{
"entropy": 6.112041807174682,
"epoch": 0.14394086753549892,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999507852586245,
"loss": 6.078,
"mean_token_accuracy": 0.12968963086605073,
"num_tokens": 3221572.0,
"step": 1850
},
{
"entropy": 6.241564416885376,
"epoch": 0.14432989690721648,
"grad_norm": 1.09375,
"learning_rate": 0.0004999502038941917,
"loss": 6.2186,
"mean_token_accuracy": 0.11879752650856971,
"num_tokens": 3230898.0,
"step": 1855
},
{
"entropy": 6.053813362121582,
"epoch": 0.14471892627893407,
"grad_norm": 1.046875,
"learning_rate": 0.0004999496191164975,
"loss": 6.1755,
"mean_token_accuracy": 0.12418220117688179,
"num_tokens": 3240524.0,
"step": 1860
},
{
"entropy": 6.186307144165039,
"epoch": 0.14510795565065163,
"grad_norm": 1.0703125,
"learning_rate": 0.000499949030925551,
"loss": 5.9339,
"mean_token_accuracy": 0.1323039062321186,
"num_tokens": 3248864.0,
"step": 1865
},
{
"entropy": 6.05433611869812,
"epoch": 0.14549698502236919,
"grad_norm": 1.15625,
"learning_rate": 0.0004999484393213609,
"loss": 6.1267,
"mean_token_accuracy": 0.12983283996582032,
"num_tokens": 3256823.0,
"step": 1870
},
{
"entropy": 6.093509531021118,
"epoch": 0.14588601439408674,
"grad_norm": 1.09375,
"learning_rate": 0.0004999478443039363,
"loss": 6.0317,
"mean_token_accuracy": 0.13464081212878226,
"num_tokens": 3265621.0,
"step": 1875
},
{
"entropy": 6.031926536560059,
"epoch": 0.14627504376580433,
"grad_norm": 1.140625,
"learning_rate": 0.0004999472458732862,
"loss": 6.0619,
"mean_token_accuracy": 0.13131768479943276,
"num_tokens": 3273515.0,
"step": 1880
},
{
"entropy": 6.207943487167358,
"epoch": 0.1466640731375219,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999466440294198,
"loss": 6.131,
"mean_token_accuracy": 0.12989283427596093,
"num_tokens": 3282283.0,
"step": 1885
},
{
"entropy": 6.049416828155517,
"epoch": 0.14705310250923945,
"grad_norm": 1.1328125,
"learning_rate": 0.000499946038772346,
"loss": 6.1341,
"mean_token_accuracy": 0.13318516165018082,
"num_tokens": 3290792.0,
"step": 1890
},
{
"entropy": 6.044079065322876,
"epoch": 0.147442131880957,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999454301020741,
"loss": 5.9918,
"mean_token_accuracy": 0.13286386504769326,
"num_tokens": 3299430.0,
"step": 1895
},
{
"entropy": 6.067660093307495,
"epoch": 0.14783116125267456,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999448180186133,
"loss": 6.0334,
"mean_token_accuracy": 0.13755829334259034,
"num_tokens": 3307949.0,
"step": 1900
},
{
"entropy": 6.091364002227783,
"epoch": 0.14822019062439215,
"grad_norm": 1.109375,
"learning_rate": 0.000499944202521973,
"loss": 6.098,
"mean_token_accuracy": 0.13308693766593932,
"num_tokens": 3316900.0,
"step": 1905
},
{
"entropy": 6.114401006698609,
"epoch": 0.1486092199961097,
"grad_norm": 1.109375,
"learning_rate": 0.0004999435836121624,
"loss": 6.0263,
"mean_token_accuracy": 0.1365790992975235,
"num_tokens": 3325656.0,
"step": 1910
},
{
"entropy": 6.054609870910644,
"epoch": 0.14899824936782727,
"grad_norm": 1.0859375,
"learning_rate": 0.000499942961289191,
"loss": 6.2408,
"mean_token_accuracy": 0.11948857307434083,
"num_tokens": 3334219.0,
"step": 1915
},
{
"entropy": 6.100892877578735,
"epoch": 0.14938727873954483,
"grad_norm": 1.015625,
"learning_rate": 0.0004999423355530683,
"loss": 5.987,
"mean_token_accuracy": 0.1356291465461254,
"num_tokens": 3343637.0,
"step": 1920
},
{
"entropy": 6.047068405151367,
"epoch": 0.1497763081112624,
"grad_norm": 1.09375,
"learning_rate": 0.0004999417064038035,
"loss": 6.1349,
"mean_token_accuracy": 0.1278958112001419,
"num_tokens": 3352624.0,
"step": 1925
},
{
"entropy": 6.089813709259033,
"epoch": 0.15016533748297997,
"grad_norm": 1.0625,
"learning_rate": 0.0004999410738414065,
"loss": 6.0577,
"mean_token_accuracy": 0.13661672845482825,
"num_tokens": 3361394.0,
"step": 1930
},
{
"entropy": 6.1655097007751465,
"epoch": 0.15055436685469753,
"grad_norm": 1.078125,
"learning_rate": 0.0004999404378658866,
"loss": 6.1106,
"mean_token_accuracy": 0.13267300873994828,
"num_tokens": 3369406.0,
"step": 1935
},
{
"entropy": 6.093273782730103,
"epoch": 0.1509433962264151,
"grad_norm": 1.09375,
"learning_rate": 0.0004999397984772536,
"loss": 6.0514,
"mean_token_accuracy": 0.1275075666606426,
"num_tokens": 3377737.0,
"step": 1940
},
{
"entropy": 6.077555751800537,
"epoch": 0.15133242559813265,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999391556755172,
"loss": 6.1175,
"mean_token_accuracy": 0.12663735300302506,
"num_tokens": 3385514.0,
"step": 1945
},
{
"entropy": 6.144791460037231,
"epoch": 0.15172145496985023,
"grad_norm": 1.09375,
"learning_rate": 0.0004999385094606872,
"loss": 6.0261,
"mean_token_accuracy": 0.13351787775754928,
"num_tokens": 3394500.0,
"step": 1950
},
{
"entropy": 6.004178762435913,
"epoch": 0.1521104843415678,
"grad_norm": 1.09375,
"learning_rate": 0.0004999378598327733,
"loss": 6.0057,
"mean_token_accuracy": 0.13412315174937248,
"num_tokens": 3403289.0,
"step": 1955
},
{
"entropy": 6.04636549949646,
"epoch": 0.15249951371328535,
"grad_norm": 1.09375,
"learning_rate": 0.0004999372067917854,
"loss": 5.9441,
"mean_token_accuracy": 0.14245061874389647,
"num_tokens": 3410892.0,
"step": 1960
},
{
"entropy": 5.918894290924072,
"epoch": 0.1528885430850029,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999365503377335,
"loss": 6.0281,
"mean_token_accuracy": 0.13515010178089143,
"num_tokens": 3420329.0,
"step": 1965
},
{
"entropy": 6.066119909286499,
"epoch": 0.1532775724567205,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999358904706273,
"loss": 6.0257,
"mean_token_accuracy": 0.13282209038734435,
"num_tokens": 3429429.0,
"step": 1970
},
{
"entropy": 6.137219715118408,
"epoch": 0.15366660182843805,
"grad_norm": 1.09375,
"learning_rate": 0.0004999352271904771,
"loss": 6.1381,
"mean_token_accuracy": 0.12859977707266806,
"num_tokens": 3438198.0,
"step": 1975
},
{
"entropy": 6.2691608428955075,
"epoch": 0.1540556312001556,
"grad_norm": 1.109375,
"learning_rate": 0.0004999345604972928,
"loss": 6.2676,
"mean_token_accuracy": 0.129219963401556,
"num_tokens": 3447732.0,
"step": 1980
},
{
"entropy": 6.048369979858398,
"epoch": 0.15444466057187317,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999338903910846,
"loss": 6.0545,
"mean_token_accuracy": 0.13279973939061165,
"num_tokens": 3456392.0,
"step": 1985
},
{
"entropy": 6.084347772598266,
"epoch": 0.15483368994359073,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999332168718626,
"loss": 6.0832,
"mean_token_accuracy": 0.1306935466825962,
"num_tokens": 3464473.0,
"step": 1990
},
{
"entropy": 6.114197492599487,
"epoch": 0.15522271931530832,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999325399396371,
"loss": 6.0531,
"mean_token_accuracy": 0.1318880908191204,
"num_tokens": 3473740.0,
"step": 1995
},
{
"entropy": 5.95880823135376,
"epoch": 0.15561174868702587,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999318595944183,
"loss": 5.9461,
"mean_token_accuracy": 0.13854984045028687,
"num_tokens": 3482249.0,
"step": 2000
},
{
"entropy": 6.20720682144165,
"epoch": 0.15600077805874343,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999311758362166,
"loss": 6.194,
"mean_token_accuracy": 0.1284084811806679,
"num_tokens": 3490753.0,
"step": 2005
},
{
"entropy": 6.1580390453338625,
"epoch": 0.156389807430461,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999304886650422,
"loss": 6.1388,
"mean_token_accuracy": 0.13328585550189018,
"num_tokens": 3499373.0,
"step": 2010
},
{
"entropy": 6.130110073089599,
"epoch": 0.15677883680217858,
"grad_norm": 1.125,
"learning_rate": 0.0004999297980809058,
"loss": 6.0894,
"mean_token_accuracy": 0.12947576269507408,
"num_tokens": 3508344.0,
"step": 2015
},
{
"entropy": 6.102607488632202,
"epoch": 0.15716786617389614,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999291040838176,
"loss": 6.0589,
"mean_token_accuracy": 0.12978120669722557,
"num_tokens": 3517009.0,
"step": 2020
},
{
"entropy": 6.054499006271362,
"epoch": 0.1575568955456137,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999284066737884,
"loss": 6.11,
"mean_token_accuracy": 0.12718966975808144,
"num_tokens": 3525989.0,
"step": 2025
},
{
"entropy": 6.133045625686646,
"epoch": 0.15794592491733125,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999277058508285,
"loss": 5.9964,
"mean_token_accuracy": 0.13161147758364677,
"num_tokens": 3533947.0,
"step": 2030
},
{
"entropy": 6.014222860336304,
"epoch": 0.1583349542890488,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999270016149486,
"loss": 6.0552,
"mean_token_accuracy": 0.135345246642828,
"num_tokens": 3541974.0,
"step": 2035
},
{
"entropy": 6.0979108810424805,
"epoch": 0.1587239836607664,
"grad_norm": 1.2734375,
"learning_rate": 0.0004999262939661596,
"loss": 6.0053,
"mean_token_accuracy": 0.14074506014585494,
"num_tokens": 3550436.0,
"step": 2040
},
{
"entropy": 6.0076916217803955,
"epoch": 0.15911301303248396,
"grad_norm": 1.140625,
"learning_rate": 0.0004999255829044721,
"loss": 5.9924,
"mean_token_accuracy": 0.13720230460166932,
"num_tokens": 3558283.0,
"step": 2045
},
{
"entropy": 5.98124508857727,
"epoch": 0.15950204240420152,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999248684298968,
"loss": 5.9144,
"mean_token_accuracy": 0.13598482608795165,
"num_tokens": 3566968.0,
"step": 2050
},
{
"entropy": 6.084092378616333,
"epoch": 0.15989107177591907,
"grad_norm": 1.109375,
"learning_rate": 0.0004999241505424447,
"loss": 6.0515,
"mean_token_accuracy": 0.13149691969156266,
"num_tokens": 3575580.0,
"step": 2055
},
{
"entropy": 6.089936590194702,
"epoch": 0.16028010114763663,
"grad_norm": 1.078125,
"learning_rate": 0.0004999234292421265,
"loss": 6.1059,
"mean_token_accuracy": 0.13127018511295319,
"num_tokens": 3584389.0,
"step": 2060
},
{
"entropy": 6.056532669067383,
"epoch": 0.16066913051935422,
"grad_norm": 1.09375,
"learning_rate": 0.0004999227045289535,
"loss": 5.9472,
"mean_token_accuracy": 0.13698288649320603,
"num_tokens": 3593009.0,
"step": 2065
},
{
"entropy": 5.953234529495239,
"epoch": 0.16105815989107178,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999219764029363,
"loss": 5.9771,
"mean_token_accuracy": 0.13605064973235131,
"num_tokens": 3601914.0,
"step": 2070
},
{
"entropy": 5.964067173004151,
"epoch": 0.16144718926278934,
"grad_norm": 1.15625,
"learning_rate": 0.0004999212448640861,
"loss": 5.9458,
"mean_token_accuracy": 0.1372133381664753,
"num_tokens": 3609883.0,
"step": 2075
},
{
"entropy": 5.984559869766235,
"epoch": 0.1618362186345069,
"grad_norm": 1.1953125,
"learning_rate": 0.0004999205099124141,
"loss": 5.8776,
"mean_token_accuracy": 0.14128663763403893,
"num_tokens": 3618103.0,
"step": 2080
},
{
"entropy": 6.163353109359742,
"epoch": 0.16222524800622448,
"grad_norm": 1.140625,
"learning_rate": 0.0004999197715479313,
"loss": 6.1465,
"mean_token_accuracy": 0.13133149743080139,
"num_tokens": 3625861.0,
"step": 2085
},
{
"entropy": 5.983381605148315,
"epoch": 0.16261427737794204,
"grad_norm": 1.140625,
"learning_rate": 0.0004999190297706489,
"loss": 5.9377,
"mean_token_accuracy": 0.13726572021842004,
"num_tokens": 3634498.0,
"step": 2090
},
{
"entropy": 5.900870990753174,
"epoch": 0.1630033067496596,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999182845805783,
"loss": 5.903,
"mean_token_accuracy": 0.13446398749947547,
"num_tokens": 3644186.0,
"step": 2095
},
{
"entropy": 5.978477811813354,
"epoch": 0.16339233612137716,
"grad_norm": 1.15625,
"learning_rate": 0.0004999175359777306,
"loss": 6.0346,
"mean_token_accuracy": 0.13290069103240967,
"num_tokens": 3652831.0,
"step": 2100
},
{
"entropy": 6.1047296047210695,
"epoch": 0.16378136549309472,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999167839621174,
"loss": 5.9013,
"mean_token_accuracy": 0.13871957510709762,
"num_tokens": 3661230.0,
"step": 2105
},
{
"entropy": 6.000889015197754,
"epoch": 0.1641703948648123,
"grad_norm": 1.09375,
"learning_rate": 0.0004999160285337501,
"loss": 6.0459,
"mean_token_accuracy": 0.1324700802564621,
"num_tokens": 3669250.0,
"step": 2110
},
{
"entropy": 6.074883890151978,
"epoch": 0.16455942423652986,
"grad_norm": 1.140625,
"learning_rate": 0.0004999152696926399,
"loss": 6.0221,
"mean_token_accuracy": 0.1307499475777149,
"num_tokens": 3677568.0,
"step": 2115
},
{
"entropy": 6.026207399368286,
"epoch": 0.16494845360824742,
"grad_norm": 1.140625,
"learning_rate": 0.0004999145074387985,
"loss": 6.0186,
"mean_token_accuracy": 0.14040926843881607,
"num_tokens": 3685488.0,
"step": 2120
},
{
"entropy": 5.997472858428955,
"epoch": 0.16533748297996498,
"grad_norm": 1.125,
"learning_rate": 0.0004999137417722374,
"loss": 5.9989,
"mean_token_accuracy": 0.13259485363960266,
"num_tokens": 3694357.0,
"step": 2125
},
{
"entropy": 6.097675323486328,
"epoch": 0.16572651235168256,
"grad_norm": 1.1875,
"learning_rate": 0.0004999129726929684,
"loss": 6.0534,
"mean_token_accuracy": 0.1371625356376171,
"num_tokens": 3703173.0,
"step": 2130
},
{
"entropy": 6.020848321914673,
"epoch": 0.16611554172340012,
"grad_norm": 1.15625,
"learning_rate": 0.0004999122002010029,
"loss": 6.0185,
"mean_token_accuracy": 0.13592875599861146,
"num_tokens": 3712070.0,
"step": 2135
},
{
"entropy": 6.032235813140869,
"epoch": 0.16650457109511768,
"grad_norm": 1.21875,
"learning_rate": 0.0004999114242963527,
"loss": 5.9062,
"mean_token_accuracy": 0.14077977910637857,
"num_tokens": 3720245.0,
"step": 2140
},
{
"entropy": 5.971114015579223,
"epoch": 0.16689360046683524,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999106449790298,
"loss": 6.0256,
"mean_token_accuracy": 0.1356363706290722,
"num_tokens": 3730064.0,
"step": 2145
},
{
"entropy": 6.012196159362793,
"epoch": 0.1672826298385528,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999098622490458,
"loss": 5.9673,
"mean_token_accuracy": 0.13840274810791015,
"num_tokens": 3738741.0,
"step": 2150
},
{
"entropy": 6.0317319393157955,
"epoch": 0.16767165921027039,
"grad_norm": 1.125,
"learning_rate": 0.0004999090761064125,
"loss": 6.0445,
"mean_token_accuracy": 0.13798771649599076,
"num_tokens": 3747472.0,
"step": 2155
},
{
"entropy": 6.042453670501709,
"epoch": 0.16806068858198794,
"grad_norm": 1.140625,
"learning_rate": 0.000499908286551142,
"loss": 6.0614,
"mean_token_accuracy": 0.1325035110116005,
"num_tokens": 3756643.0,
"step": 2160
},
{
"entropy": 6.098313522338867,
"epoch": 0.1684497179537055,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999074935832463,
"loss": 6.1743,
"mean_token_accuracy": 0.1302264779806137,
"num_tokens": 3765490.0,
"step": 2165
},
{
"entropy": 6.109912395477295,
"epoch": 0.16883874732542306,
"grad_norm": 1.15625,
"learning_rate": 0.0004999066972027373,
"loss": 5.9293,
"mean_token_accuracy": 0.13885341733694076,
"num_tokens": 3773063.0,
"step": 2170
},
{
"entropy": 6.057087755203247,
"epoch": 0.16922777669714065,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999058974096271,
"loss": 6.081,
"mean_token_accuracy": 0.12848760411143303,
"num_tokens": 3781763.0,
"step": 2175
},
{
"entropy": 6.050684452056885,
"epoch": 0.1696168060688582,
"grad_norm": 1.125,
"learning_rate": 0.000499905094203928,
"loss": 6.0706,
"mean_token_accuracy": 0.13044458702206613,
"num_tokens": 3790582.0,
"step": 2180
},
{
"entropy": 5.997987556457519,
"epoch": 0.17000583544057576,
"grad_norm": 1.1484375,
"learning_rate": 0.000499904287585652,
"loss": 5.8916,
"mean_token_accuracy": 0.13762697726488113,
"num_tokens": 3798745.0,
"step": 2185
},
{
"entropy": 5.99886155128479,
"epoch": 0.17039486481229332,
"grad_norm": 1.109375,
"learning_rate": 0.0004999034775548113,
"loss": 5.9924,
"mean_token_accuracy": 0.13636661395430566,
"num_tokens": 3806901.0,
"step": 2190
},
{
"entropy": 6.0307700634002686,
"epoch": 0.17078389418401088,
"grad_norm": 1.328125,
"learning_rate": 0.0004999026641114185,
"loss": 5.9387,
"mean_token_accuracy": 0.14335163310170174,
"num_tokens": 3815742.0,
"step": 2195
},
{
"entropy": 5.951791095733642,
"epoch": 0.17117292355572847,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999018472554857,
"loss": 6.0196,
"mean_token_accuracy": 0.13228272050619125,
"num_tokens": 3824468.0,
"step": 2200
},
{
"entropy": 6.030127143859863,
"epoch": 0.17156195292744603,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999010269870253,
"loss": 5.9848,
"mean_token_accuracy": 0.14022162035107613,
"num_tokens": 3832834.0,
"step": 2205
},
{
"entropy": 6.018565368652344,
"epoch": 0.17195098229916359,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999002033060498,
"loss": 6.0239,
"mean_token_accuracy": 0.14021265134215355,
"num_tokens": 3841780.0,
"step": 2210
},
{
"entropy": 6.101462125778198,
"epoch": 0.17234001167088114,
"grad_norm": 1.125,
"learning_rate": 0.0004998993762125716,
"loss": 6.1403,
"mean_token_accuracy": 0.1279483050107956,
"num_tokens": 3849840.0,
"step": 2215
},
{
"entropy": 6.102045392990112,
"epoch": 0.17272904104259873,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998985457066034,
"loss": 6.0699,
"mean_token_accuracy": 0.12550090849399567,
"num_tokens": 3858204.0,
"step": 2220
},
{
"entropy": 6.012039756774902,
"epoch": 0.1731180704143163,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998977117881576,
"loss": 6.0052,
"mean_token_accuracy": 0.13568017780780792,
"num_tokens": 3866615.0,
"step": 2225
},
{
"entropy": 6.037418842315674,
"epoch": 0.17350709978603385,
"grad_norm": 0.99609375,
"learning_rate": 0.0004998968744572472,
"loss": 6.0343,
"mean_token_accuracy": 0.13920788690447808,
"num_tokens": 3876003.0,
"step": 2230
},
{
"entropy": 6.0176434993743895,
"epoch": 0.1738961291577514,
"grad_norm": 1.140625,
"learning_rate": 0.0004998960337138845,
"loss": 5.9605,
"mean_token_accuracy": 0.1377207651734352,
"num_tokens": 3884362.0,
"step": 2235
},
{
"entropy": 5.990269565582276,
"epoch": 0.17428515852946896,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998951895580826,
"loss": 5.9158,
"mean_token_accuracy": 0.13989226818084716,
"num_tokens": 3893177.0,
"step": 2240
},
{
"entropy": 6.01600284576416,
"epoch": 0.17467418790118655,
"grad_norm": 1.2109375,
"learning_rate": 0.0004998943419898542,
"loss": 5.9773,
"mean_token_accuracy": 0.1380767658352852,
"num_tokens": 3903006.0,
"step": 2245
},
{
"entropy": 5.9797093868255615,
"epoch": 0.1750632172729041,
"grad_norm": 1.125,
"learning_rate": 0.0004998934910092119,
"loss": 5.8372,
"mean_token_accuracy": 0.13846131414175034,
"num_tokens": 3912256.0,
"step": 2250
},
{
"entropy": 5.916180229187011,
"epoch": 0.17545224664462167,
"grad_norm": 1.15625,
"learning_rate": 0.0004998926366161689,
"loss": 5.9986,
"mean_token_accuracy": 0.13596335276961327,
"num_tokens": 3921121.0,
"step": 2255
},
{
"entropy": 6.018570613861084,
"epoch": 0.17584127601633923,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998917788107383,
"loss": 5.9479,
"mean_token_accuracy": 0.139829271286726,
"num_tokens": 3929348.0,
"step": 2260
},
{
"entropy": 6.029901313781738,
"epoch": 0.17623030538805678,
"grad_norm": 1.140625,
"learning_rate": 0.0004998909175929326,
"loss": 6.1262,
"mean_token_accuracy": 0.13413718938827515,
"num_tokens": 3938073.0,
"step": 2265
},
{
"entropy": 6.116082048416137,
"epoch": 0.17661933475977437,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998900529627653,
"loss": 6.1048,
"mean_token_accuracy": 0.13597819358110427,
"num_tokens": 3946641.0,
"step": 2270
},
{
"entropy": 6.074714040756225,
"epoch": 0.17700836413149193,
"grad_norm": 1.109375,
"learning_rate": 0.0004998891849202495,
"loss": 5.9587,
"mean_token_accuracy": 0.14048855975270272,
"num_tokens": 3954586.0,
"step": 2275
},
{
"entropy": 6.009363508224487,
"epoch": 0.1773973935032095,
"grad_norm": 1.2109375,
"learning_rate": 0.000499888313465398,
"loss": 6.0295,
"mean_token_accuracy": 0.13712368234992028,
"num_tokens": 3963745.0,
"step": 2280
},
{
"entropy": 5.937222337722778,
"epoch": 0.17778642287492705,
"grad_norm": 1.171875,
"learning_rate": 0.0004998874385982247,
"loss": 5.8522,
"mean_token_accuracy": 0.1412455268204212,
"num_tokens": 3972452.0,
"step": 2285
},
{
"entropy": 5.94044041633606,
"epoch": 0.17817545224664463,
"grad_norm": 1.140625,
"learning_rate": 0.0004998865603187421,
"loss": 5.9574,
"mean_token_accuracy": 0.13704333379864692,
"num_tokens": 3980770.0,
"step": 2290
},
{
"entropy": 6.060723733901978,
"epoch": 0.1785644816183622,
"grad_norm": 1.0859375,
"learning_rate": 0.000499885678626964,
"loss": 5.9805,
"mean_token_accuracy": 0.13396030068397521,
"num_tokens": 3989545.0,
"step": 2295
},
{
"entropy": 6.062776803970337,
"epoch": 0.17895351099007975,
"grad_norm": 1.078125,
"learning_rate": 0.0004998847935229038,
"loss": 5.9424,
"mean_token_accuracy": 0.13457537293434144,
"num_tokens": 3998034.0,
"step": 2300
},
{
"entropy": 5.905241298675537,
"epoch": 0.1793425403617973,
"grad_norm": 1.140625,
"learning_rate": 0.0004998839050065746,
"loss": 5.9822,
"mean_token_accuracy": 0.14144275784492494,
"num_tokens": 4007110.0,
"step": 2305
},
{
"entropy": 6.042173862457275,
"epoch": 0.17973156973351487,
"grad_norm": 1.1796875,
"learning_rate": 0.0004998830130779902,
"loss": 6.0362,
"mean_token_accuracy": 0.12785631343722342,
"num_tokens": 4015930.0,
"step": 2310
},
{
"entropy": 5.92177267074585,
"epoch": 0.18012059910523245,
"grad_norm": 1.109375,
"learning_rate": 0.000499882117737164,
"loss": 5.8567,
"mean_token_accuracy": 0.13938324376940728,
"num_tokens": 4024510.0,
"step": 2315
},
{
"entropy": 5.9428199291229244,
"epoch": 0.18050962847695,
"grad_norm": 1.09375,
"learning_rate": 0.0004998812189841096,
"loss": 5.9629,
"mean_token_accuracy": 0.13904105722904206,
"num_tokens": 4033714.0,
"step": 2320
},
{
"entropy": 6.135042381286621,
"epoch": 0.18089865784866757,
"grad_norm": 1.1875,
"learning_rate": 0.0004998803168188407,
"loss": 6.1461,
"mean_token_accuracy": 0.12715203911066056,
"num_tokens": 4042376.0,
"step": 2325
},
{
"entropy": 6.03497052192688,
"epoch": 0.18128768722038513,
"grad_norm": 1.125,
"learning_rate": 0.0004998794112413708,
"loss": 5.9316,
"mean_token_accuracy": 0.1389988273382187,
"num_tokens": 4050521.0,
"step": 2330
},
{
"entropy": 6.097191667556762,
"epoch": 0.18167671659210272,
"grad_norm": 1.109375,
"learning_rate": 0.0004998785022517137,
"loss": 6.0873,
"mean_token_accuracy": 0.13467619195580482,
"num_tokens": 4059384.0,
"step": 2335
},
{
"entropy": 5.945719146728516,
"epoch": 0.18206574596382027,
"grad_norm": 1.203125,
"learning_rate": 0.0004998775898498835,
"loss": 5.947,
"mean_token_accuracy": 0.1388249836862087,
"num_tokens": 4067655.0,
"step": 2340
},
{
"entropy": 6.028331184387207,
"epoch": 0.18245477533553783,
"grad_norm": 1.140625,
"learning_rate": 0.0004998766740358936,
"loss": 5.9342,
"mean_token_accuracy": 0.1423063322901726,
"num_tokens": 4075828.0,
"step": 2345
},
{
"entropy": 6.014834260940551,
"epoch": 0.1828438047072554,
"grad_norm": 1.1796875,
"learning_rate": 0.0004998757548097582,
"loss": 5.9053,
"mean_token_accuracy": 0.14048654288053514,
"num_tokens": 4083796.0,
"step": 2350
},
{
"entropy": 5.980800151824951,
"epoch": 0.18323283407897295,
"grad_norm": 1.0859375,
"learning_rate": 0.0004998748321714911,
"loss": 6.0421,
"mean_token_accuracy": 0.13735400661826133,
"num_tokens": 4092981.0,
"step": 2355
},
{
"entropy": 6.020400857925415,
"epoch": 0.18362186345069054,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998739061211065,
"loss": 5.8484,
"mean_token_accuracy": 0.14194852709770203,
"num_tokens": 4101363.0,
"step": 2360
},
{
"entropy": 5.96309461593628,
"epoch": 0.1840108928224081,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998729766586181,
"loss": 5.9272,
"mean_token_accuracy": 0.1333435907959938,
"num_tokens": 4110164.0,
"step": 2365
},
{
"entropy": 6.044630527496338,
"epoch": 0.18439992219412565,
"grad_norm": 1.15625,
"learning_rate": 0.0004998720437840403,
"loss": 6.0444,
"mean_token_accuracy": 0.13811287730932237,
"num_tokens": 4119098.0,
"step": 2370
},
{
"entropy": 5.991950607299804,
"epoch": 0.1847889515658432,
"grad_norm": 1.21875,
"learning_rate": 0.0004998711074973871,
"loss": 5.9532,
"mean_token_accuracy": 0.13917487487196922,
"num_tokens": 4127522.0,
"step": 2375
},
{
"entropy": 6.0055859088897705,
"epoch": 0.1851779809375608,
"grad_norm": 1.125,
"learning_rate": 0.0004998701677986728,
"loss": 5.9803,
"mean_token_accuracy": 0.14277126044034957,
"num_tokens": 4136311.0,
"step": 2380
},
{
"entropy": 5.935305976867676,
"epoch": 0.18556701030927836,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998692246879116,
"loss": 5.9124,
"mean_token_accuracy": 0.13691533505916595,
"num_tokens": 4145160.0,
"step": 2385
},
{
"entropy": 6.005577945709229,
"epoch": 0.18595603968099592,
"grad_norm": 1.1875,
"learning_rate": 0.0004998682781651178,
"loss": 5.886,
"mean_token_accuracy": 0.14444762617349624,
"num_tokens": 4153921.0,
"step": 2390
},
{
"entropy": 5.912683391571045,
"epoch": 0.18634506905271347,
"grad_norm": 1.1796875,
"learning_rate": 0.0004998673282303059,
"loss": 5.9582,
"mean_token_accuracy": 0.13400443345308305,
"num_tokens": 4162580.0,
"step": 2395
},
{
"entropy": 5.9940591812133786,
"epoch": 0.18673409842443103,
"grad_norm": 1.109375,
"learning_rate": 0.0004998663748834901,
"loss": 5.9552,
"mean_token_accuracy": 0.14112788587808608,
"num_tokens": 4170623.0,
"step": 2400
},
{
"entropy": 5.947180700302124,
"epoch": 0.18712312779614862,
"grad_norm": 1.140625,
"learning_rate": 0.0004998654181246851,
"loss": 5.9519,
"mean_token_accuracy": 0.14752146303653718,
"num_tokens": 4178724.0,
"step": 2405
},
{
"entropy": 5.964427280426025,
"epoch": 0.18751215716786618,
"grad_norm": 1.140625,
"learning_rate": 0.0004998644579539052,
"loss": 5.963,
"mean_token_accuracy": 0.13656028136610984,
"num_tokens": 4187773.0,
"step": 2410
},
{
"entropy": 6.009492588043213,
"epoch": 0.18790118653958374,
"grad_norm": 1.109375,
"learning_rate": 0.000499863494371165,
"loss": 5.9618,
"mean_token_accuracy": 0.13550449684262275,
"num_tokens": 4196628.0,
"step": 2415
},
{
"entropy": 5.984348201751709,
"epoch": 0.1882902159113013,
"grad_norm": 1.203125,
"learning_rate": 0.0004998625273764793,
"loss": 5.9827,
"mean_token_accuracy": 0.13410525098443032,
"num_tokens": 4205090.0,
"step": 2420
},
{
"entropy": 5.990939712524414,
"epoch": 0.18867924528301888,
"grad_norm": 1.15625,
"learning_rate": 0.0004998615569698626,
"loss": 5.8965,
"mean_token_accuracy": 0.1415567897260189,
"num_tokens": 4212757.0,
"step": 2425
},
{
"entropy": 5.883493232727051,
"epoch": 0.18906827465473644,
"grad_norm": 1.203125,
"learning_rate": 0.0004998605831513296,
"loss": 5.9637,
"mean_token_accuracy": 0.14001091420650483,
"num_tokens": 4221556.0,
"step": 2430
},
{
"entropy": 5.936648797988892,
"epoch": 0.189457304026454,
"grad_norm": 1.203125,
"learning_rate": 0.0004998596059208953,
"loss": 5.9587,
"mean_token_accuracy": 0.13833684399724006,
"num_tokens": 4231524.0,
"step": 2435
},
{
"entropy": 6.036439371109009,
"epoch": 0.18984633339817156,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998586252785743,
"loss": 5.9826,
"mean_token_accuracy": 0.1431053563952446,
"num_tokens": 4240229.0,
"step": 2440
},
{
"entropy": 5.956485605239868,
"epoch": 0.19023536276988912,
"grad_norm": 1.1875,
"learning_rate": 0.0004998576412243816,
"loss": 5.8587,
"mean_token_accuracy": 0.14437367022037506,
"num_tokens": 4248053.0,
"step": 2445
},
{
"entropy": 5.988489770889283,
"epoch": 0.1906243921416067,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998566537583321,
"loss": 5.9007,
"mean_token_accuracy": 0.13747418969869613,
"num_tokens": 4256019.0,
"step": 2450
},
{
"entropy": 5.89534101486206,
"epoch": 0.19101342151332426,
"grad_norm": 1.203125,
"learning_rate": 0.0004998556628804408,
"loss": 5.8917,
"mean_token_accuracy": 0.14226853474974632,
"num_tokens": 4263805.0,
"step": 2455
},
{
"entropy": 5.958291482925415,
"epoch": 0.19140245088504182,
"grad_norm": 1.2265625,
"learning_rate": 0.0004998546685907225,
"loss": 5.9534,
"mean_token_accuracy": 0.13563379049301147,
"num_tokens": 4272712.0,
"step": 2460
},
{
"entropy": 6.066695690155029,
"epoch": 0.19179148025675938,
"grad_norm": 1.140625,
"learning_rate": 0.0004998536708891927,
"loss": 5.8824,
"mean_token_accuracy": 0.14191587790846824,
"num_tokens": 4281222.0,
"step": 2465
},
{
"entropy": 5.9650391101837155,
"epoch": 0.19218050962847694,
"grad_norm": 1.15625,
"learning_rate": 0.0004998526697758663,
"loss": 6.0121,
"mean_token_accuracy": 0.13257578536868095,
"num_tokens": 4290558.0,
"step": 2470
},
{
"entropy": 6.109343481063843,
"epoch": 0.19256953900019452,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998516652507585,
"loss": 6.0253,
"mean_token_accuracy": 0.13303112387657165,
"num_tokens": 4299684.0,
"step": 2475
},
{
"entropy": 5.899087524414062,
"epoch": 0.19295856837191208,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998506573138846,
"loss": 5.9633,
"mean_token_accuracy": 0.14104458689689636,
"num_tokens": 4308938.0,
"step": 2480
},
{
"entropy": 5.9440470218658445,
"epoch": 0.19334759774362964,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998496459652598,
"loss": 5.8208,
"mean_token_accuracy": 0.14647359624505044,
"num_tokens": 4317646.0,
"step": 2485
},
{
"entropy": 5.964761638641358,
"epoch": 0.1937366271153472,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998486312048995,
"loss": 5.9621,
"mean_token_accuracy": 0.13583191409707068,
"num_tokens": 4326876.0,
"step": 2490
},
{
"entropy": 5.967274475097656,
"epoch": 0.19412565648706478,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998476130328193,
"loss": 5.931,
"mean_token_accuracy": 0.13568915724754332,
"num_tokens": 4335391.0,
"step": 2495
},
{
"entropy": 6.055395555496216,
"epoch": 0.19451468585878234,
"grad_norm": 1.140625,
"learning_rate": 0.0004998465914490343,
"loss": 5.9052,
"mean_token_accuracy": 0.1406179554760456,
"num_tokens": 4343253.0,
"step": 2500
},
{
"entropy": 5.760255670547485,
"epoch": 0.1949037152304999,
"grad_norm": 1.0546875,
"learning_rate": 0.00049984556645356,
"loss": 5.8742,
"mean_token_accuracy": 0.14200342074036598,
"num_tokens": 4352161.0,
"step": 2505
},
{
"entropy": 5.938892364501953,
"epoch": 0.19529274460221746,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998445380464124,
"loss": 5.8385,
"mean_token_accuracy": 0.1466829337179661,
"num_tokens": 4360414.0,
"step": 2510
},
{
"entropy": 5.896971416473389,
"epoch": 0.19568177397393502,
"grad_norm": 1.15625,
"learning_rate": 0.0004998435062276066,
"loss": 5.8228,
"mean_token_accuracy": 0.14513540267944336,
"num_tokens": 4369375.0,
"step": 2515
},
{
"entropy": 5.903877830505371,
"epoch": 0.1960708033456526,
"grad_norm": 1.1953125,
"learning_rate": 0.0004998424709971586,
"loss": 5.8483,
"mean_token_accuracy": 0.14223146587610244,
"num_tokens": 4378638.0,
"step": 2520
},
{
"entropy": 5.983705711364746,
"epoch": 0.19645983271737016,
"grad_norm": 1.171875,
"learning_rate": 0.0004998414323550839,
"loss": 5.8616,
"mean_token_accuracy": 0.14103932306170464,
"num_tokens": 4388262.0,
"step": 2525
},
{
"entropy": 5.874213314056396,
"epoch": 0.19684886208908772,
"grad_norm": 1.109375,
"learning_rate": 0.0004998403903013984,
"loss": 5.8501,
"mean_token_accuracy": 0.1444000080227852,
"num_tokens": 4396894.0,
"step": 2530
},
{
"entropy": 5.949297761917114,
"epoch": 0.19723789146080528,
"grad_norm": 1.03125,
"learning_rate": 0.0004998393448361179,
"loss": 6.0004,
"mean_token_accuracy": 0.1377578116953373,
"num_tokens": 4405455.0,
"step": 2535
},
{
"entropy": 5.937081432342529,
"epoch": 0.19762692083252287,
"grad_norm": 1.359375,
"learning_rate": 0.000499838295959258,
"loss": 5.8999,
"mean_token_accuracy": 0.13834612667560578,
"num_tokens": 4414355.0,
"step": 2540
},
{
"entropy": 5.8034745216369625,
"epoch": 0.19801595020424043,
"grad_norm": 1.1875,
"learning_rate": 0.000499837243670835,
"loss": 5.7847,
"mean_token_accuracy": 0.14933302402496337,
"num_tokens": 4422305.0,
"step": 2545
},
{
"entropy": 5.9695093631744385,
"epoch": 0.19840497957595798,
"grad_norm": 1.0859375,
"learning_rate": 0.0004998361879708646,
"loss": 5.9185,
"mean_token_accuracy": 0.13912818506360053,
"num_tokens": 4430813.0,
"step": 2550
},
{
"entropy": 5.963333559036255,
"epoch": 0.19879400894767554,
"grad_norm": 1.09375,
"learning_rate": 0.000499835128859363,
"loss": 5.8774,
"mean_token_accuracy": 0.14088211506605147,
"num_tokens": 4440229.0,
"step": 2555
},
{
"entropy": 5.8513782024383545,
"epoch": 0.1991830383193931,
"grad_norm": 1.140625,
"learning_rate": 0.0004998340663363461,
"loss": 5.9025,
"mean_token_accuracy": 0.13724920377135277,
"num_tokens": 4449417.0,
"step": 2560
},
{
"entropy": 5.9853545188903805,
"epoch": 0.1995720676911107,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998330004018301,
"loss": 5.944,
"mean_token_accuracy": 0.13790054023265838,
"num_tokens": 4457377.0,
"step": 2565
},
{
"entropy": 5.990766906738282,
"epoch": 0.19996109706282825,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998319310558312,
"loss": 5.8617,
"mean_token_accuracy": 0.14069739058613778,
"num_tokens": 4466839.0,
"step": 2570
},
{
"entropy": 5.904648494720459,
"epoch": 0.2003501264345458,
"grad_norm": 1.2265625,
"learning_rate": 0.0004998308582983657,
"loss": 5.9051,
"mean_token_accuracy": 0.14068260937929153,
"num_tokens": 4476369.0,
"step": 2575
},
{
"entropy": 5.9384589195251465,
"epoch": 0.20073915580626336,
"grad_norm": 1.125,
"learning_rate": 0.0004998297821294497,
"loss": 5.9575,
"mean_token_accuracy": 0.13891851380467415,
"num_tokens": 4485609.0,
"step": 2580
},
{
"entropy": 5.939151048660278,
"epoch": 0.20112818517798095,
"grad_norm": 1.171875,
"learning_rate": 0.0004998287025490995,
"loss": 5.9092,
"mean_token_accuracy": 0.1407192036509514,
"num_tokens": 4494535.0,
"step": 2585
},
{
"entropy": 5.945156764984131,
"epoch": 0.2015172145496985,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998276195573317,
"loss": 5.8844,
"mean_token_accuracy": 0.1363791175186634,
"num_tokens": 4503133.0,
"step": 2590
},
{
"entropy": 5.885627603530883,
"epoch": 0.20190624392141607,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998265331541627,
"loss": 5.7876,
"mean_token_accuracy": 0.15038875490427017,
"num_tokens": 4511465.0,
"step": 2595
},
{
"entropy": 5.883782386779785,
"epoch": 0.20229527329313363,
"grad_norm": 1.2109375,
"learning_rate": 0.0004998254433396088,
"loss": 5.8499,
"mean_token_accuracy": 0.14612346962094308,
"num_tokens": 4520177.0,
"step": 2600
},
{
"entropy": 5.947019147872925,
"epoch": 0.20268430266485118,
"grad_norm": 1.1875,
"learning_rate": 0.0004998243501136867,
"loss": 6.0221,
"mean_token_accuracy": 0.13749735280871392,
"num_tokens": 4528370.0,
"step": 2605
},
{
"entropy": 6.0327956199646,
"epoch": 0.20307333203656877,
"grad_norm": 1.2109375,
"learning_rate": 0.0004998232534764129,
"loss": 6.0424,
"mean_token_accuracy": 0.13159574791789055,
"num_tokens": 4538258.0,
"step": 2610
},
{
"entropy": 5.933379316329956,
"epoch": 0.20346236140828633,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998221534278041,
"loss": 5.9334,
"mean_token_accuracy": 0.13688500002026557,
"num_tokens": 4547300.0,
"step": 2615
},
{
"entropy": 6.0140650272369385,
"epoch": 0.2038513907800039,
"grad_norm": 1.015625,
"learning_rate": 0.0004998210499678769,
"loss": 5.9854,
"mean_token_accuracy": 0.1308668576180935,
"num_tokens": 4556877.0,
"step": 2620
},
{
"entropy": 5.907776832580566,
"epoch": 0.20424042015172145,
"grad_norm": 1.125,
"learning_rate": 0.0004998199430966481,
"loss": 5.8302,
"mean_token_accuracy": 0.14112840071320534,
"num_tokens": 4565999.0,
"step": 2625
},
{
"entropy": 5.913699102401734,
"epoch": 0.20462944952343903,
"grad_norm": 1.1875,
"learning_rate": 0.0004998188328141346,
"loss": 5.8793,
"mean_token_accuracy": 0.13416805639863014,
"num_tokens": 4574027.0,
"step": 2630
},
{
"entropy": 5.887786960601806,
"epoch": 0.2050184788951566,
"grad_norm": 1.15625,
"learning_rate": 0.0004998177191203531,
"loss": 5.8994,
"mean_token_accuracy": 0.1329669289290905,
"num_tokens": 4582402.0,
"step": 2635
},
{
"entropy": 5.92496690750122,
"epoch": 0.20540750826687415,
"grad_norm": 1.2734375,
"learning_rate": 0.0004998166020153204,
"loss": 5.8358,
"mean_token_accuracy": 0.14105968326330184,
"num_tokens": 4590381.0,
"step": 2640
},
{
"entropy": 5.917643356323242,
"epoch": 0.2057965376385917,
"grad_norm": 1.2578125,
"learning_rate": 0.0004998154814990538,
"loss": 5.885,
"mean_token_accuracy": 0.14099830090999604,
"num_tokens": 4598910.0,
"step": 2645
},
{
"entropy": 6.011348581314087,
"epoch": 0.20618556701030927,
"grad_norm": 1.1953125,
"learning_rate": 0.00049981435757157,
"loss": 6.015,
"mean_token_accuracy": 0.13125852718949318,
"num_tokens": 4607400.0,
"step": 2650
},
{
"entropy": 5.917462635040283,
"epoch": 0.20657459638202685,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998132302328862,
"loss": 5.9403,
"mean_token_accuracy": 0.14050790518522263,
"num_tokens": 4616510.0,
"step": 2655
},
{
"entropy": 6.007234954833985,
"epoch": 0.2069636257537444,
"grad_norm": 1.2109375,
"learning_rate": 0.0004998120994830195,
"loss": 5.9072,
"mean_token_accuracy": 0.14376826882362365,
"num_tokens": 4624529.0,
"step": 2660
},
{
"entropy": 5.918785476684571,
"epoch": 0.20735265512546197,
"grad_norm": 1.1640625,
"learning_rate": 0.000499810965321987,
"loss": 5.8346,
"mean_token_accuracy": 0.14414578527212143,
"num_tokens": 4632141.0,
"step": 2665
},
{
"entropy": 5.9577617168426515,
"epoch": 0.20774168449717953,
"grad_norm": 1.21875,
"learning_rate": 0.0004998098277498059,
"loss": 6.0381,
"mean_token_accuracy": 0.1350015841424465,
"num_tokens": 4640378.0,
"step": 2670
},
{
"entropy": 5.925170755386352,
"epoch": 0.2081307138688971,
"grad_norm": 1.09375,
"learning_rate": 0.0004998086867664934,
"loss": 5.8409,
"mean_token_accuracy": 0.1414250299334526,
"num_tokens": 4649313.0,
"step": 2675
},
{
"entropy": 5.9586829662323,
"epoch": 0.20851974324061467,
"grad_norm": 1.203125,
"learning_rate": 0.000499807542372067,
"loss": 5.9164,
"mean_token_accuracy": 0.14138886630535125,
"num_tokens": 4658272.0,
"step": 2680
},
{
"entropy": 5.856334686279297,
"epoch": 0.20890877261233223,
"grad_norm": 1.203125,
"learning_rate": 0.0004998063945665439,
"loss": 5.7767,
"mean_token_accuracy": 0.14743116796016692,
"num_tokens": 4665970.0,
"step": 2685
},
{
"entropy": 5.974782228469849,
"epoch": 0.2092978019840498,
"grad_norm": 1.125,
"learning_rate": 0.0004998052433499416,
"loss": 6.0326,
"mean_token_accuracy": 0.13459649160504342,
"num_tokens": 4675308.0,
"step": 2690
},
{
"entropy": 5.90858154296875,
"epoch": 0.20968683135576735,
"grad_norm": 1.203125,
"learning_rate": 0.0004998040887222776,
"loss": 5.8772,
"mean_token_accuracy": 0.14054309129714965,
"num_tokens": 4684316.0,
"step": 2695
},
{
"entropy": 5.852538108825684,
"epoch": 0.21007586072748494,
"grad_norm": 1.234375,
"learning_rate": 0.0004998029306835693,
"loss": 5.7932,
"mean_token_accuracy": 0.1447305828332901,
"num_tokens": 4693029.0,
"step": 2700
},
{
"entropy": 5.91006441116333,
"epoch": 0.2104648900992025,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998017692338344,
"loss": 5.9919,
"mean_token_accuracy": 0.1333250030875206,
"num_tokens": 4702404.0,
"step": 2705
},
{
"entropy": 5.972537851333618,
"epoch": 0.21085391947092005,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998006043730905,
"loss": 5.9484,
"mean_token_accuracy": 0.13651543334126473,
"num_tokens": 4711126.0,
"step": 2710
},
{
"entropy": 5.994960069656372,
"epoch": 0.2112429488426376,
"grad_norm": 1.09375,
"learning_rate": 0.0004997994361013551,
"loss": 5.9405,
"mean_token_accuracy": 0.14613958448171616,
"num_tokens": 4719816.0,
"step": 2715
},
{
"entropy": 5.966370105743408,
"epoch": 0.21163197821435517,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997982644186461,
"loss": 5.8798,
"mean_token_accuracy": 0.13973141759634017,
"num_tokens": 4728294.0,
"step": 2720
},
{
"entropy": 5.888756990432739,
"epoch": 0.21202100758607276,
"grad_norm": 1.109375,
"learning_rate": 0.0004997970893249813,
"loss": 5.8275,
"mean_token_accuracy": 0.1435457229614258,
"num_tokens": 4736708.0,
"step": 2725
},
{
"entropy": 5.873240041732788,
"epoch": 0.21241003695779032,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997959108203785,
"loss": 6.0039,
"mean_token_accuracy": 0.13070807754993438,
"num_tokens": 4744893.0,
"step": 2730
},
{
"entropy": 6.096560430526734,
"epoch": 0.21279906632950787,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997947289048554,
"loss": 5.9623,
"mean_token_accuracy": 0.13920049890875816,
"num_tokens": 4753246.0,
"step": 2735
},
{
"entropy": 5.931299209594727,
"epoch": 0.21318809570122543,
"grad_norm": 1.140625,
"learning_rate": 0.0004997935435784302,
"loss": 5.8833,
"mean_token_accuracy": 0.13352058157324792,
"num_tokens": 4762229.0,
"step": 2740
},
{
"entropy": 5.805833244323731,
"epoch": 0.21357712507294302,
"grad_norm": 1.1328125,
"learning_rate": 0.0004997923548411208,
"loss": 5.8366,
"mean_token_accuracy": 0.14200862497091293,
"num_tokens": 4771315.0,
"step": 2745
},
{
"entropy": 5.755913734436035,
"epoch": 0.21396615444466058,
"grad_norm": 1.1796875,
"learning_rate": 0.000499791162692945,
"loss": 5.7604,
"mean_token_accuracy": 0.15337736159563065,
"num_tokens": 4779848.0,
"step": 2750
},
{
"entropy": 5.984225654602051,
"epoch": 0.21435518381637814,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997899671339214,
"loss": 6.0054,
"mean_token_accuracy": 0.14065569192171096,
"num_tokens": 4788939.0,
"step": 2755
},
{
"entropy": 5.942894124984742,
"epoch": 0.2147442131880957,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997887681640675,
"loss": 5.906,
"mean_token_accuracy": 0.13755589798092843,
"num_tokens": 4797719.0,
"step": 2760
},
{
"entropy": 5.928773069381714,
"epoch": 0.21513324255981325,
"grad_norm": 1.2109375,
"learning_rate": 0.0004997875657834021,
"loss": 5.9602,
"mean_token_accuracy": 0.1399763911962509,
"num_tokens": 4805601.0,
"step": 2765
},
{
"entropy": 6.0012726306915285,
"epoch": 0.21552227193153084,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997863599919432,
"loss": 5.9298,
"mean_token_accuracy": 0.13780287876725197,
"num_tokens": 4814993.0,
"step": 2770
},
{
"entropy": 5.983278465270996,
"epoch": 0.2159113013032484,
"grad_norm": 1.171875,
"learning_rate": 0.0004997851507897089,
"loss": 5.8699,
"mean_token_accuracy": 0.14026867374777793,
"num_tokens": 4824156.0,
"step": 2775
},
{
"entropy": 5.871163606643677,
"epoch": 0.21630033067496596,
"grad_norm": 1.15625,
"learning_rate": 0.0004997839381767178,
"loss": 5.9559,
"mean_token_accuracy": 0.13493574261665345,
"num_tokens": 4833827.0,
"step": 2780
},
{
"entropy": 5.923353576660157,
"epoch": 0.21668936004668352,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997827221529882,
"loss": 5.9086,
"mean_token_accuracy": 0.14079293385148048,
"num_tokens": 4842801.0,
"step": 2785
},
{
"entropy": 5.858642721176148,
"epoch": 0.2170783894184011,
"grad_norm": 1.1875,
"learning_rate": 0.0004997815027185386,
"loss": 5.7611,
"mean_token_accuracy": 0.14427610188722612,
"num_tokens": 4850928.0,
"step": 2790
},
{
"entropy": 5.874434089660644,
"epoch": 0.21746741879011866,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997802798733874,
"loss": 5.8683,
"mean_token_accuracy": 0.14393499940633775,
"num_tokens": 4859510.0,
"step": 2795
},
{
"entropy": 5.975643491744995,
"epoch": 0.21785644816183622,
"grad_norm": 1.015625,
"learning_rate": 0.0004997790536175534,
"loss": 5.9173,
"mean_token_accuracy": 0.14145495295524596,
"num_tokens": 4868201.0,
"step": 2800
},
{
"entropy": 5.86905689239502,
"epoch": 0.21824547753355378,
"grad_norm": 1.140625,
"learning_rate": 0.0004997778239510548,
"loss": 5.8335,
"mean_token_accuracy": 0.14240052700042724,
"num_tokens": 4876896.0,
"step": 2805
},
{
"entropy": 5.826552057266236,
"epoch": 0.21863450690527134,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997765908739106,
"loss": 5.7898,
"mean_token_accuracy": 0.15225823372602462,
"num_tokens": 4885136.0,
"step": 2810
},
{
"entropy": 5.826451778411865,
"epoch": 0.21902353627698892,
"grad_norm": 1.203125,
"learning_rate": 0.0004997753543861395,
"loss": 5.8053,
"mean_token_accuracy": 0.1449057564139366,
"num_tokens": 4893277.0,
"step": 2815
},
{
"entropy": 5.87442626953125,
"epoch": 0.21941256564870648,
"grad_norm": 1.1328125,
"learning_rate": 0.00049977411448776,
"loss": 5.962,
"mean_token_accuracy": 0.1370394378900528,
"num_tokens": 4901977.0,
"step": 2820
},
{
"entropy": 6.066293048858642,
"epoch": 0.21980159502042404,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997728711787912,
"loss": 5.9498,
"mean_token_accuracy": 0.13320593908429146,
"num_tokens": 4910888.0,
"step": 2825
},
{
"entropy": 5.899124479293823,
"epoch": 0.2201906243921416,
"grad_norm": 1.125,
"learning_rate": 0.0004997716244592518,
"loss": 5.9556,
"mean_token_accuracy": 0.13331344723701477,
"num_tokens": 4920369.0,
"step": 2830
},
{
"entropy": 5.970640707015991,
"epoch": 0.22057965376385918,
"grad_norm": 1.2578125,
"learning_rate": 0.0004997703743291607,
"loss": 5.9372,
"mean_token_accuracy": 0.13818638548254966,
"num_tokens": 4928799.0,
"step": 2835
},
{
"entropy": 5.959006452560425,
"epoch": 0.22096868313557674,
"grad_norm": 1.140625,
"learning_rate": 0.000499769120788537,
"loss": 5.8186,
"mean_token_accuracy": 0.14796194583177566,
"num_tokens": 4937194.0,
"step": 2840
},
{
"entropy": 5.892886638641357,
"epoch": 0.2213577125072943,
"grad_norm": 1.2265625,
"learning_rate": 0.0004997678638373995,
"loss": 5.9246,
"mean_token_accuracy": 0.13645815178751947,
"num_tokens": 4946174.0,
"step": 2845
},
{
"entropy": 5.890604877471924,
"epoch": 0.22174674187901186,
"grad_norm": 1.1015625,
"learning_rate": 0.0004997666034757676,
"loss": 5.8636,
"mean_token_accuracy": 0.1371280185878277,
"num_tokens": 4955376.0,
"step": 2850
},
{
"entropy": 5.896667575836181,
"epoch": 0.22213577125072942,
"grad_norm": 1.0703125,
"learning_rate": 0.0004997653397036603,
"loss": 5.8672,
"mean_token_accuracy": 0.14396676495671273,
"num_tokens": 4964138.0,
"step": 2855
},
{
"entropy": 5.889484786987305,
"epoch": 0.222524800622447,
"grad_norm": 1.109375,
"learning_rate": 0.0004997640725210965,
"loss": 5.9614,
"mean_token_accuracy": 0.13742173463106155,
"num_tokens": 4973868.0,
"step": 2860
},
{
"entropy": 5.917964696884155,
"epoch": 0.22291382999416456,
"grad_norm": 1.28125,
"learning_rate": 0.0004997628019280958,
"loss": 5.8382,
"mean_token_accuracy": 0.1428116887807846,
"num_tokens": 4982687.0,
"step": 2865
},
{
"entropy": 5.931079006195068,
"epoch": 0.22330285936588212,
"grad_norm": 1.1953125,
"learning_rate": 0.0004997615279246773,
"loss": 5.8865,
"mean_token_accuracy": 0.13743261098861695,
"num_tokens": 4992072.0,
"step": 2870
},
{
"entropy": 5.911539316177368,
"epoch": 0.22369188873759968,
"grad_norm": 1.125,
"learning_rate": 0.0004997602505108603,
"loss": 5.8446,
"mean_token_accuracy": 0.1401855692267418,
"num_tokens": 5000551.0,
"step": 2875
},
{
"entropy": 5.937168121337891,
"epoch": 0.22408091810931724,
"grad_norm": 1.140625,
"learning_rate": 0.0004997589696866644,
"loss": 5.9994,
"mean_token_accuracy": 0.13774950057268143,
"num_tokens": 5009292.0,
"step": 2880
},
{
"entropy": 5.91554889678955,
"epoch": 0.22446994748103483,
"grad_norm": 1.125,
"learning_rate": 0.0004997576854521088,
"loss": 5.8535,
"mean_token_accuracy": 0.13967245817184448,
"num_tokens": 5018407.0,
"step": 2885
},
{
"entropy": 5.8885914325714115,
"epoch": 0.22485897685275238,
"grad_norm": 1.1171875,
"learning_rate": 0.000499756397807213,
"loss": 5.9008,
"mean_token_accuracy": 0.1394205868244171,
"num_tokens": 5027353.0,
"step": 2890
},
{
"entropy": 6.03417592048645,
"epoch": 0.22524800622446994,
"grad_norm": 1.140625,
"learning_rate": 0.0004997551067519966,
"loss": 5.9215,
"mean_token_accuracy": 0.13638510555028915,
"num_tokens": 5036476.0,
"step": 2895
},
{
"entropy": 5.861401844024658,
"epoch": 0.2256370355961875,
"grad_norm": 1.0859375,
"learning_rate": 0.0004997538122864792,
"loss": 5.8525,
"mean_token_accuracy": 0.13833182156085969,
"num_tokens": 5045132.0,
"step": 2900
},
{
"entropy": 5.916049289703369,
"epoch": 0.2260260649679051,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997525144106804,
"loss": 5.872,
"mean_token_accuracy": 0.14037140905857087,
"num_tokens": 5053665.0,
"step": 2905
},
{
"entropy": 5.922544813156128,
"epoch": 0.22641509433962265,
"grad_norm": 1.109375,
"learning_rate": 0.00049975121312462,
"loss": 5.8271,
"mean_token_accuracy": 0.14556183218955993,
"num_tokens": 5062516.0,
"step": 2910
},
{
"entropy": 5.899590253829956,
"epoch": 0.2268041237113402,
"grad_norm": 1.203125,
"learning_rate": 0.0004997499084283177,
"loss": 5.8772,
"mean_token_accuracy": 0.13606662452220916,
"num_tokens": 5071260.0,
"step": 2915
},
{
"entropy": 5.827817678451538,
"epoch": 0.22719315308305776,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997486003217932,
"loss": 5.8196,
"mean_token_accuracy": 0.1497701920568943,
"num_tokens": 5079215.0,
"step": 2920
},
{
"entropy": 5.8816290378570555,
"epoch": 0.22758218245477532,
"grad_norm": 1.140625,
"learning_rate": 0.0004997472888050664,
"loss": 5.8938,
"mean_token_accuracy": 0.14027459546923637,
"num_tokens": 5088404.0,
"step": 2925
},
{
"entropy": 5.900744438171387,
"epoch": 0.2279712118264929,
"grad_norm": 1.2109375,
"learning_rate": 0.0004997459738781573,
"loss": 5.8239,
"mean_token_accuracy": 0.1431146442890167,
"num_tokens": 5096756.0,
"step": 2930
},
{
"entropy": 5.979656934738159,
"epoch": 0.22836024119821047,
"grad_norm": 1.078125,
"learning_rate": 0.0004997446555410857,
"loss": 5.9904,
"mean_token_accuracy": 0.13891934603452682,
"num_tokens": 5106160.0,
"step": 2935
},
{
"entropy": 5.7854640007019045,
"epoch": 0.22874927056992803,
"grad_norm": 1.15625,
"learning_rate": 0.0004997433337938716,
"loss": 5.9235,
"mean_token_accuracy": 0.14122586995363234,
"num_tokens": 5114915.0,
"step": 2940
},
{
"entropy": 5.964998531341553,
"epoch": 0.22913829994164558,
"grad_norm": 1.171875,
"learning_rate": 0.0004997420086365351,
"loss": 5.8379,
"mean_token_accuracy": 0.1387510970234871,
"num_tokens": 5123249.0,
"step": 2945
},
{
"entropy": 5.894250869750977,
"epoch": 0.22952732931336317,
"grad_norm": 1.0859375,
"learning_rate": 0.0004997406800690966,
"loss": 5.8134,
"mean_token_accuracy": 0.138453159481287,
"num_tokens": 5131906.0,
"step": 2950
},
{
"entropy": 5.863798522949219,
"epoch": 0.22991635868508073,
"grad_norm": 1.2109375,
"learning_rate": 0.0004997393480915758,
"loss": 5.8003,
"mean_token_accuracy": 0.146034524589777,
"num_tokens": 5140740.0,
"step": 2955
},
{
"entropy": 5.900701189041138,
"epoch": 0.2303053880567983,
"grad_norm": 1.140625,
"learning_rate": 0.0004997380127039931,
"loss": 5.9917,
"mean_token_accuracy": 0.13965021297335625,
"num_tokens": 5149748.0,
"step": 2960
},
{
"entropy": 5.876333379745484,
"epoch": 0.23069441742851585,
"grad_norm": 1.140625,
"learning_rate": 0.0004997366739063688,
"loss": 5.719,
"mean_token_accuracy": 0.14996112510561943,
"num_tokens": 5158475.0,
"step": 2965
},
{
"entropy": 5.8662495613098145,
"epoch": 0.2310834468002334,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997353316987231,
"loss": 5.913,
"mean_token_accuracy": 0.13812702000141144,
"num_tokens": 5166593.0,
"step": 2970
},
{
"entropy": 5.93091893196106,
"epoch": 0.231472476171951,
"grad_norm": 1.203125,
"learning_rate": 0.0004997339860810765,
"loss": 5.8913,
"mean_token_accuracy": 0.14304886758327484,
"num_tokens": 5175557.0,
"step": 2975
},
{
"entropy": 5.873473691940307,
"epoch": 0.23186150554366855,
"grad_norm": 1.140625,
"learning_rate": 0.0004997326370534495,
"loss": 5.7973,
"mean_token_accuracy": 0.14339174702763557,
"num_tokens": 5184140.0,
"step": 2980
},
{
"entropy": 5.962021112442017,
"epoch": 0.2322505349153861,
"grad_norm": 1.1953125,
"learning_rate": 0.0004997312846158622,
"loss": 5.8895,
"mean_token_accuracy": 0.13540481626987458,
"num_tokens": 5192347.0,
"step": 2985
},
{
"entropy": 5.857995939254761,
"epoch": 0.23263956428710367,
"grad_norm": 1.203125,
"learning_rate": 0.0004997299287683355,
"loss": 5.8516,
"mean_token_accuracy": 0.1456963911652565,
"num_tokens": 5201327.0,
"step": 2990
},
{
"entropy": 5.914484262466431,
"epoch": 0.23302859365882125,
"grad_norm": 1.2421875,
"learning_rate": 0.0004997285695108898,
"loss": 5.9333,
"mean_token_accuracy": 0.14006564170122146,
"num_tokens": 5209873.0,
"step": 2995
},
{
"entropy": 5.987733602523804,
"epoch": 0.2334176230305388,
"grad_norm": 1.21875,
"learning_rate": 0.0004997272068435458,
"loss": 5.8368,
"mean_token_accuracy": 0.14314770549535752,
"num_tokens": 5219176.0,
"step": 3000
},
{
"epoch": 0.2334176230305388,
"eval_entropy": 5.733757502672417,
"eval_loss": 5.909061431884766,
"eval_mean_token_accuracy": 0.1476683286819123,
"eval_num_tokens": 5219176.0,
"eval_runtime": 28.6428,
"eval_samples_per_second": 1450.906,
"eval_steps_per_second": 181.372,
"step": 3000
},
{
"entropy": 5.831014919281006,
"epoch": 0.23380665240225637,
"grad_norm": 1.265625,
"learning_rate": 0.000499725840766324,
"loss": 5.781,
"mean_token_accuracy": 0.15310309678316117,
"num_tokens": 5227310.0,
"step": 3005
},
{
"entropy": 5.916271114349366,
"epoch": 0.23419568177397393,
"grad_norm": 1.25,
"learning_rate": 0.0004997244712792453,
"loss": 5.871,
"mean_token_accuracy": 0.13849457129836082,
"num_tokens": 5235882.0,
"step": 3010
},
{
"entropy": 5.8643897533416744,
"epoch": 0.2345847111456915,
"grad_norm": 1.203125,
"learning_rate": 0.0004997230983823305,
"loss": 5.7895,
"mean_token_accuracy": 0.14129805639386178,
"num_tokens": 5244149.0,
"step": 3015
},
{
"entropy": 5.725203800201416,
"epoch": 0.23497374051740907,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997217220756003,
"loss": 5.6533,
"mean_token_accuracy": 0.14943938702344894,
"num_tokens": 5252473.0,
"step": 3020
},
{
"entropy": 5.831255388259888,
"epoch": 0.23536276988912663,
"grad_norm": 1.171875,
"learning_rate": 0.0004997203423590757,
"loss": 5.8125,
"mean_token_accuracy": 0.14606485813856124,
"num_tokens": 5260972.0,
"step": 3025
},
{
"entropy": 5.885420131683349,
"epoch": 0.2357517992608442,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997189592327775,
"loss": 5.8225,
"mean_token_accuracy": 0.13927970007061957,
"num_tokens": 5270513.0,
"step": 3030
},
{
"entropy": 5.882440185546875,
"epoch": 0.23614082863256175,
"grad_norm": 1.203125,
"learning_rate": 0.0004997175726967268,
"loss": 5.803,
"mean_token_accuracy": 0.1392829418182373,
"num_tokens": 5278433.0,
"step": 3035
},
{
"entropy": 5.83907732963562,
"epoch": 0.23652985800427934,
"grad_norm": 1.2421875,
"learning_rate": 0.0004997161827509447,
"loss": 5.7977,
"mean_token_accuracy": 0.13926001712679864,
"num_tokens": 5287389.0,
"step": 3040
},
{
"entropy": 5.8517955303192135,
"epoch": 0.2369188873759969,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997147893954521,
"loss": 5.9115,
"mean_token_accuracy": 0.1402236580848694,
"num_tokens": 5296220.0,
"step": 3045
},
{
"entropy": 5.955138111114502,
"epoch": 0.23730791674771445,
"grad_norm": 1.203125,
"learning_rate": 0.0004997133926302702,
"loss": 5.8328,
"mean_token_accuracy": 0.14494856148958207,
"num_tokens": 5304152.0,
"step": 3050
},
{
"entropy": 5.933644962310791,
"epoch": 0.237696946119432,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997119924554204,
"loss": 5.8697,
"mean_token_accuracy": 0.14269917458295822,
"num_tokens": 5312374.0,
"step": 3055
},
{
"entropy": 5.800216960906982,
"epoch": 0.23808597549114957,
"grad_norm": 1.1015625,
"learning_rate": 0.0004997105888709236,
"loss": 5.7876,
"mean_token_accuracy": 0.14500768929719926,
"num_tokens": 5320696.0,
"step": 3060
},
{
"entropy": 5.906084728240967,
"epoch": 0.23847500486286716,
"grad_norm": 1.2578125,
"learning_rate": 0.0004997091818768015,
"loss": 5.927,
"mean_token_accuracy": 0.13957108333706855,
"num_tokens": 5328754.0,
"step": 3065
},
{
"entropy": 5.924434232711792,
"epoch": 0.23886403423458472,
"grad_norm": 1.140625,
"learning_rate": 0.000499707771473075,
"loss": 5.878,
"mean_token_accuracy": 0.1405944973230362,
"num_tokens": 5337553.0,
"step": 3070
},
{
"entropy": 5.905769205093383,
"epoch": 0.23925306360630227,
"grad_norm": 1.2578125,
"learning_rate": 0.0004997063576597659,
"loss": 5.809,
"mean_token_accuracy": 0.14863870143890381,
"num_tokens": 5346063.0,
"step": 3075
},
{
"entropy": 5.871305704116821,
"epoch": 0.23964209297801983,
"grad_norm": 1.28125,
"learning_rate": 0.0004997049404368954,
"loss": 5.8745,
"mean_token_accuracy": 0.14547610208392142,
"num_tokens": 5354187.0,
"step": 3080
},
{
"entropy": 5.925069046020508,
"epoch": 0.2400311223497374,
"grad_norm": 1.3046875,
"learning_rate": 0.000499703519804485,
"loss": 5.9096,
"mean_token_accuracy": 0.1328617438673973,
"num_tokens": 5362819.0,
"step": 3085
},
{
"entropy": 5.897925138473511,
"epoch": 0.24042015172145498,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997020957625564,
"loss": 5.7919,
"mean_token_accuracy": 0.15332378596067428,
"num_tokens": 5371249.0,
"step": 3090
},
{
"entropy": 5.877030849456787,
"epoch": 0.24080918109317254,
"grad_norm": 1.140625,
"learning_rate": 0.0004997006683111312,
"loss": 5.7994,
"mean_token_accuracy": 0.1433065228164196,
"num_tokens": 5379284.0,
"step": 3095
},
{
"entropy": 5.884299421310425,
"epoch": 0.2411982104648901,
"grad_norm": 1.1328125,
"learning_rate": 0.000499699237450231,
"loss": 5.8996,
"mean_token_accuracy": 0.14278156086802482,
"num_tokens": 5388541.0,
"step": 3100
},
{
"entropy": 5.94818902015686,
"epoch": 0.24158723983660765,
"grad_norm": 1.125,
"learning_rate": 0.0004996978031798774,
"loss": 5.9485,
"mean_token_accuracy": 0.13989101499319076,
"num_tokens": 5397226.0,
"step": 3105
},
{
"entropy": 5.939749002456665,
"epoch": 0.24197626920832524,
"grad_norm": 1.2265625,
"learning_rate": 0.0004996963655000924,
"loss": 5.8573,
"mean_token_accuracy": 0.1397051528096199,
"num_tokens": 5405579.0,
"step": 3110
},
{
"entropy": 5.892177295684815,
"epoch": 0.2423652985800428,
"grad_norm": 1.171875,
"learning_rate": 0.0004996949244108977,
"loss": 5.9838,
"mean_token_accuracy": 0.12947663366794587,
"num_tokens": 5414529.0,
"step": 3115
},
{
"entropy": 5.9776526927948,
"epoch": 0.24275432795176036,
"grad_norm": 1.15625,
"learning_rate": 0.000499693479912315,
"loss": 5.9389,
"mean_token_accuracy": 0.14825934171676636,
"num_tokens": 5423641.0,
"step": 3120
},
{
"entropy": 5.853601503372192,
"epoch": 0.24314335732347792,
"grad_norm": 1.1875,
"learning_rate": 0.0004996920320043666,
"loss": 5.8381,
"mean_token_accuracy": 0.1416511431336403,
"num_tokens": 5432558.0,
"step": 3125
},
{
"entropy": 5.866245222091675,
"epoch": 0.24353238669519547,
"grad_norm": 1.1875,
"learning_rate": 0.0004996905806870742,
"loss": 5.7816,
"mean_token_accuracy": 0.14246323853731155,
"num_tokens": 5441449.0,
"step": 3130
},
{
"entropy": 5.867586135864258,
"epoch": 0.24392141606691306,
"grad_norm": 1.015625,
"learning_rate": 0.0004996891259604598,
"loss": 5.7997,
"mean_token_accuracy": 0.14338409453630446,
"num_tokens": 5451142.0,
"step": 3135
},
{
"entropy": 5.896688175201416,
"epoch": 0.24431044543863062,
"grad_norm": 1.0859375,
"learning_rate": 0.0004996876678245455,
"loss": 5.7613,
"mean_token_accuracy": 0.14048081785440444,
"num_tokens": 5459290.0,
"step": 3140
},
{
"entropy": 5.798839139938354,
"epoch": 0.24469947481034818,
"grad_norm": 1.296875,
"learning_rate": 0.0004996862062793536,
"loss": 5.7811,
"mean_token_accuracy": 0.1482220396399498,
"num_tokens": 5467776.0,
"step": 3145
},
{
"entropy": 5.7967747211456295,
"epoch": 0.24508850418206574,
"grad_norm": 1.140625,
"learning_rate": 0.0004996847413249061,
"loss": 5.6617,
"mean_token_accuracy": 0.14994954615831374,
"num_tokens": 5476005.0,
"step": 3150
},
{
"entropy": 5.8860608577728275,
"epoch": 0.24547753355378332,
"grad_norm": 1.1640625,
"learning_rate": 0.0004996832729612252,
"loss": 5.8461,
"mean_token_accuracy": 0.14408416971564292,
"num_tokens": 5484225.0,
"step": 3155
},
{
"entropy": 5.765978288650513,
"epoch": 0.24586656292550088,
"grad_norm": 1.125,
"learning_rate": 0.0004996818011883333,
"loss": 5.7774,
"mean_token_accuracy": 0.14943447411060334,
"num_tokens": 5493111.0,
"step": 3160
},
{
"entropy": 5.831310415267945,
"epoch": 0.24625559229721844,
"grad_norm": 1.2109375,
"learning_rate": 0.0004996803260062527,
"loss": 5.7948,
"mean_token_accuracy": 0.14830601513385772,
"num_tokens": 5501574.0,
"step": 3165
},
{
"entropy": 5.875056219100952,
"epoch": 0.246644621668936,
"grad_norm": 1.2578125,
"learning_rate": 0.0004996788474150057,
"loss": 5.8249,
"mean_token_accuracy": 0.1414250537753105,
"num_tokens": 5511136.0,
"step": 3170
},
{
"entropy": 5.807733631134033,
"epoch": 0.24703365104065356,
"grad_norm": 1.1640625,
"learning_rate": 0.0004996773654146149,
"loss": 5.8168,
"mean_token_accuracy": 0.14713762253522872,
"num_tokens": 5520324.0,
"step": 3175
},
{
"entropy": 5.874153709411621,
"epoch": 0.24742268041237114,
"grad_norm": 1.140625,
"learning_rate": 0.0004996758800051026,
"loss": 5.7661,
"mean_token_accuracy": 0.14694686979055405,
"num_tokens": 5528960.0,
"step": 3180
},
{
"entropy": 5.865899896621704,
"epoch": 0.2478117097840887,
"grad_norm": 1.4140625,
"learning_rate": 0.0004996743911864916,
"loss": 5.926,
"mean_token_accuracy": 0.14135217815637588,
"num_tokens": 5537391.0,
"step": 3185
},
{
"entropy": 5.90128002166748,
"epoch": 0.24820073915580626,
"grad_norm": 1.140625,
"learning_rate": 0.0004996728989588041,
"loss": 5.8662,
"mean_token_accuracy": 0.13981591016054154,
"num_tokens": 5546577.0,
"step": 3190
},
{
"entropy": 5.93365888595581,
"epoch": 0.24858976852752382,
"grad_norm": 1.0859375,
"learning_rate": 0.0004996714033220632,
"loss": 5.8035,
"mean_token_accuracy": 0.1451164186000824,
"num_tokens": 5555247.0,
"step": 3195
},
{
"entropy": 5.79735369682312,
"epoch": 0.2489787978992414,
"grad_norm": 1.2734375,
"learning_rate": 0.0004996699042762911,
"loss": 5.7679,
"mean_token_accuracy": 0.14924910962581633,
"num_tokens": 5563598.0,
"step": 3200
},
{
"entropy": 5.854664468765259,
"epoch": 0.24936782727095896,
"grad_norm": 1.2421875,
"learning_rate": 0.0004996684018215111,
"loss": 5.7983,
"mean_token_accuracy": 0.14165054261684418,
"num_tokens": 5572734.0,
"step": 3205
},
{
"entropy": 5.876973295211792,
"epoch": 0.24975685664267652,
"grad_norm": 1.15625,
"learning_rate": 0.0004996668959577453,
"loss": 5.9106,
"mean_token_accuracy": 0.1385761357843876,
"num_tokens": 5581224.0,
"step": 3210
},
{
"entropy": 5.934681081771851,
"epoch": 0.2501458860143941,
"grad_norm": 1.140625,
"learning_rate": 0.0004996653866850173,
"loss": 5.9043,
"mean_token_accuracy": 0.13491922244429588,
"num_tokens": 5590138.0,
"step": 3215
},
{
"entropy": 5.842910432815552,
"epoch": 0.25053491538611167,
"grad_norm": 1.2578125,
"learning_rate": 0.0004996638740033495,
"loss": 5.837,
"mean_token_accuracy": 0.149862140417099,
"num_tokens": 5598654.0,
"step": 3220
},
{
"entropy": 5.754105043411255,
"epoch": 0.2509239447578292,
"grad_norm": 1.2734375,
"learning_rate": 0.0004996623579127651,
"loss": 5.7791,
"mean_token_accuracy": 0.14800113886594773,
"num_tokens": 5607404.0,
"step": 3225
},
{
"entropy": 5.850812196731567,
"epoch": 0.2513129741295468,
"grad_norm": 1.3046875,
"learning_rate": 0.0004996608384132868,
"loss": 5.8029,
"mean_token_accuracy": 0.13932496458292007,
"num_tokens": 5617133.0,
"step": 3230
},
{
"entropy": 5.841469144821167,
"epoch": 0.25170200350126437,
"grad_norm": 1.1875,
"learning_rate": 0.000499659315504938,
"loss": 5.8294,
"mean_token_accuracy": 0.13994766473770143,
"num_tokens": 5625389.0,
"step": 3235
},
{
"entropy": 5.826369094848633,
"epoch": 0.2520910328729819,
"grad_norm": 1.203125,
"learning_rate": 0.0004996577891877417,
"loss": 5.7015,
"mean_token_accuracy": 0.15945661962032318,
"num_tokens": 5633985.0,
"step": 3240
},
{
"entropy": 5.821769857406617,
"epoch": 0.2524800622446995,
"grad_norm": 1.2890625,
"learning_rate": 0.0004996562594617209,
"loss": 5.8316,
"mean_token_accuracy": 0.13962800428271294,
"num_tokens": 5642524.0,
"step": 3245
},
{
"entropy": 5.852222156524658,
"epoch": 0.252869091616417,
"grad_norm": 1.3046875,
"learning_rate": 0.0004996547263268991,
"loss": 5.7793,
"mean_token_accuracy": 0.1448754347860813,
"num_tokens": 5651788.0,
"step": 3250
},
{
"entropy": 5.821958208084107,
"epoch": 0.2532581209881346,
"grad_norm": 1.15625,
"learning_rate": 0.0004996531897832993,
"loss": 5.8159,
"mean_token_accuracy": 0.1427738018333912,
"num_tokens": 5660757.0,
"step": 3255
},
{
"entropy": 5.984094285964966,
"epoch": 0.2536471503598522,
"grad_norm": 1.1484375,
"learning_rate": 0.000499651649830945,
"loss": 5.9304,
"mean_token_accuracy": 0.14311277642846107,
"num_tokens": 5669760.0,
"step": 3260
},
{
"entropy": 5.813133239746094,
"epoch": 0.2540361797315697,
"grad_norm": 1.1484375,
"learning_rate": 0.0004996501064698593,
"loss": 5.8492,
"mean_token_accuracy": 0.14234110862016677,
"num_tokens": 5678313.0,
"step": 3265
},
{
"entropy": 5.870118856430054,
"epoch": 0.2544252091032873,
"grad_norm": 1.203125,
"learning_rate": 0.000499648559700066,
"loss": 5.7668,
"mean_token_accuracy": 0.15043241605162622,
"num_tokens": 5686942.0,
"step": 3270
},
{
"entropy": 5.792041444778443,
"epoch": 0.25481423847500484,
"grad_norm": 1.1171875,
"learning_rate": 0.0004996470095215884,
"loss": 5.7555,
"mean_token_accuracy": 0.14962123110890388,
"num_tokens": 5695612.0,
"step": 3275
},
{
"entropy": 5.900144004821778,
"epoch": 0.2552032678467224,
"grad_norm": 1.1328125,
"learning_rate": 0.0004996454559344498,
"loss": 5.9529,
"mean_token_accuracy": 0.13228990584611894,
"num_tokens": 5705067.0,
"step": 3280
},
{
"entropy": 5.906079196929932,
"epoch": 0.25559229721844,
"grad_norm": 1.1328125,
"learning_rate": 0.0004996438989386741,
"loss": 5.8355,
"mean_token_accuracy": 0.14319185838103293,
"num_tokens": 5714092.0,
"step": 3285
},
{
"entropy": 5.8403573513031,
"epoch": 0.25598132659015754,
"grad_norm": 1.140625,
"learning_rate": 0.0004996423385342847,
"loss": 5.8028,
"mean_token_accuracy": 0.14620732218027116,
"num_tokens": 5722638.0,
"step": 3290
},
{
"entropy": 5.824834823608398,
"epoch": 0.25637035596187513,
"grad_norm": 1.1484375,
"learning_rate": 0.0004996407747213055,
"loss": 5.804,
"mean_token_accuracy": 0.14224600344896315,
"num_tokens": 5731511.0,
"step": 3295
},
{
"entropy": 5.861731052398682,
"epoch": 0.25675938533359266,
"grad_norm": 1.1171875,
"learning_rate": 0.00049963920749976,
"loss": 5.8202,
"mean_token_accuracy": 0.14186736792325974,
"num_tokens": 5740950.0,
"step": 3300
},
{
"entropy": 5.807591533660888,
"epoch": 0.25714841470531025,
"grad_norm": 1.1953125,
"learning_rate": 0.0004996376368696721,
"loss": 5.7591,
"mean_token_accuracy": 0.14281872063875198,
"num_tokens": 5749163.0,
"step": 3305
},
{
"entropy": 5.8925347328186035,
"epoch": 0.25753744407702783,
"grad_norm": 1.1796875,
"learning_rate": 0.0004996360628310656,
"loss": 5.8173,
"mean_token_accuracy": 0.14276841878890992,
"num_tokens": 5758321.0,
"step": 3310
},
{
"entropy": 5.9321657657623295,
"epoch": 0.25792647344874536,
"grad_norm": 1.1953125,
"learning_rate": 0.0004996344853839644,
"loss": 5.8682,
"mean_token_accuracy": 0.14533354043960572,
"num_tokens": 5767277.0,
"step": 3315
},
{
"entropy": 5.820040512084961,
"epoch": 0.25831550282046295,
"grad_norm": 1.1328125,
"learning_rate": 0.0004996329045283924,
"loss": 5.7605,
"mean_token_accuracy": 0.150101937353611,
"num_tokens": 5775694.0,
"step": 3320
},
{
"entropy": 5.734701347351074,
"epoch": 0.25870453219218054,
"grad_norm": 1.09375,
"learning_rate": 0.0004996313202643737,
"loss": 5.6773,
"mean_token_accuracy": 0.15130480825901033,
"num_tokens": 5783932.0,
"step": 3325
},
{
"entropy": 5.83421835899353,
"epoch": 0.25909356156389807,
"grad_norm": 1.1875,
"learning_rate": 0.0004996297325919321,
"loss": 5.8049,
"mean_token_accuracy": 0.14608783572912215,
"num_tokens": 5792100.0,
"step": 3330
},
{
"entropy": 5.818102645874023,
"epoch": 0.25948259093561565,
"grad_norm": 1.1484375,
"learning_rate": 0.0004996281415110919,
"loss": 5.7919,
"mean_token_accuracy": 0.1446779452264309,
"num_tokens": 5801481.0,
"step": 3335
},
{
"entropy": 5.843531894683838,
"epoch": 0.2598716203073332,
"grad_norm": 1.125,
"learning_rate": 0.0004996265470218773,
"loss": 5.8885,
"mean_token_accuracy": 0.13893020674586296,
"num_tokens": 5810053.0,
"step": 3340
},
{
"entropy": 5.82769284248352,
"epoch": 0.26026064967905077,
"grad_norm": 1.109375,
"learning_rate": 0.0004996249491243122,
"loss": 5.6783,
"mean_token_accuracy": 0.15309639424085617,
"num_tokens": 5818454.0,
"step": 3345
},
{
"entropy": 5.812572193145752,
"epoch": 0.26064967905076836,
"grad_norm": 1.140625,
"learning_rate": 0.0004996233478184211,
"loss": 5.8512,
"mean_token_accuracy": 0.13824255466461183,
"num_tokens": 5827013.0,
"step": 3350
},
{
"entropy": 5.805325746536255,
"epoch": 0.2610387084224859,
"grad_norm": 1.203125,
"learning_rate": 0.0004996217431042282,
"loss": 5.8482,
"mean_token_accuracy": 0.1430810771882534,
"num_tokens": 5835862.0,
"step": 3355
},
{
"entropy": 5.7693298816680905,
"epoch": 0.2614277377942035,
"grad_norm": 1.0546875,
"learning_rate": 0.000499620134981758,
"loss": 5.6191,
"mean_token_accuracy": 0.15031312257051468,
"num_tokens": 5843827.0,
"step": 3360
},
{
"entropy": 5.80864987373352,
"epoch": 0.261816767165921,
"grad_norm": 1.109375,
"learning_rate": 0.0004996185234510346,
"loss": 5.8272,
"mean_token_accuracy": 0.13573512434959412,
"num_tokens": 5852677.0,
"step": 3365
},
{
"entropy": 5.898306369781494,
"epoch": 0.2622057965376386,
"grad_norm": 1.2265625,
"learning_rate": 0.0004996169085120828,
"loss": 5.7732,
"mean_token_accuracy": 0.1503363937139511,
"num_tokens": 5861686.0,
"step": 3370
},
{
"entropy": 5.7120969772338865,
"epoch": 0.2625948259093562,
"grad_norm": 1.109375,
"learning_rate": 0.0004996152901649268,
"loss": 5.7407,
"mean_token_accuracy": 0.14560485854744912,
"num_tokens": 5870690.0,
"step": 3375
},
{
"entropy": 5.79764723777771,
"epoch": 0.2629838552810737,
"grad_norm": 1.15625,
"learning_rate": 0.0004996136684095913,
"loss": 5.8249,
"mean_token_accuracy": 0.14097655266523362,
"num_tokens": 5879804.0,
"step": 3380
},
{
"entropy": 5.94910888671875,
"epoch": 0.2633728846527913,
"grad_norm": 1.3515625,
"learning_rate": 0.0004996120432461009,
"loss": 5.8967,
"mean_token_accuracy": 0.13631573617458342,
"num_tokens": 5888781.0,
"step": 3385
},
{
"entropy": 5.912099456787109,
"epoch": 0.2637619140245088,
"grad_norm": 1.1328125,
"learning_rate": 0.0004996104146744804,
"loss": 5.808,
"mean_token_accuracy": 0.14571621865034104,
"num_tokens": 5897439.0,
"step": 3390
},
{
"entropy": 5.829486560821533,
"epoch": 0.2641509433962264,
"grad_norm": 1.21875,
"learning_rate": 0.0004996087826947541,
"loss": 5.7533,
"mean_token_accuracy": 0.1568281203508377,
"num_tokens": 5905471.0,
"step": 3395
},
{
"entropy": 5.755701017379761,
"epoch": 0.264539972767944,
"grad_norm": 1.25,
"learning_rate": 0.0004996071473069471,
"loss": 5.8004,
"mean_token_accuracy": 0.14211232513189315,
"num_tokens": 5913795.0,
"step": 3400
},
{
"entropy": 5.936715173721313,
"epoch": 0.26492900213966153,
"grad_norm": 1.2421875,
"learning_rate": 0.0004996055085110842,
"loss": 5.8668,
"mean_token_accuracy": 0.1416642837226391,
"num_tokens": 5922119.0,
"step": 3405
},
{
"entropy": 5.782314729690552,
"epoch": 0.2653180315113791,
"grad_norm": 1.2578125,
"learning_rate": 0.0004996038663071902,
"loss": 5.7469,
"mean_token_accuracy": 0.14390047043561935,
"num_tokens": 5930759.0,
"step": 3410
},
{
"entropy": 5.816781759262085,
"epoch": 0.26570706088309665,
"grad_norm": 1.2265625,
"learning_rate": 0.0004996022206952901,
"loss": 5.7809,
"mean_token_accuracy": 0.1507711961865425,
"num_tokens": 5939830.0,
"step": 3415
},
{
"entropy": 5.91773362159729,
"epoch": 0.26609609025481423,
"grad_norm": 1.1875,
"learning_rate": 0.0004996005716754086,
"loss": 5.7921,
"mean_token_accuracy": 0.143372742831707,
"num_tokens": 5947737.0,
"step": 3420
},
{
"entropy": 5.702203607559204,
"epoch": 0.2664851196265318,
"grad_norm": 1.234375,
"learning_rate": 0.000499598919247571,
"loss": 5.7436,
"mean_token_accuracy": 0.1547391414642334,
"num_tokens": 5955905.0,
"step": 3425
},
{
"entropy": 5.761687517166138,
"epoch": 0.26687414899824935,
"grad_norm": 1.265625,
"learning_rate": 0.0004995972634118023,
"loss": 5.7991,
"mean_token_accuracy": 0.14444849416613578,
"num_tokens": 5965223.0,
"step": 3430
},
{
"entropy": 5.886661386489868,
"epoch": 0.26726317836996694,
"grad_norm": 1.1796875,
"learning_rate": 0.0004995956041681277,
"loss": 5.8049,
"mean_token_accuracy": 0.1485450528562069,
"num_tokens": 5973615.0,
"step": 3435
},
{
"entropy": 5.813414812088013,
"epoch": 0.2676522077416845,
"grad_norm": 1.2265625,
"learning_rate": 0.0004995939415165722,
"loss": 5.7458,
"mean_token_accuracy": 0.15244108885526658,
"num_tokens": 5981600.0,
"step": 3440
},
{
"entropy": 5.789648532867432,
"epoch": 0.26804123711340205,
"grad_norm": 1.1875,
"learning_rate": 0.0004995922754571611,
"loss": 5.7446,
"mean_token_accuracy": 0.1445736438035965,
"num_tokens": 5989928.0,
"step": 3445
},
{
"entropy": 5.745592164993286,
"epoch": 0.26843026648511964,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995906059899197,
"loss": 5.8116,
"mean_token_accuracy": 0.14425835460424424,
"num_tokens": 5998704.0,
"step": 3450
},
{
"entropy": 5.887583017349243,
"epoch": 0.26881929585683717,
"grad_norm": 1.1171875,
"learning_rate": 0.0004995889331148733,
"loss": 5.7879,
"mean_token_accuracy": 0.14587609022855758,
"num_tokens": 6007476.0,
"step": 3455
},
{
"entropy": 5.881060028076172,
"epoch": 0.26920832522855476,
"grad_norm": 1.171875,
"learning_rate": 0.0004995872568320474,
"loss": 5.8628,
"mean_token_accuracy": 0.14118837639689447,
"num_tokens": 6016324.0,
"step": 3460
},
{
"entropy": 5.846192836761475,
"epoch": 0.26959735460027234,
"grad_norm": 1.21875,
"learning_rate": 0.0004995855771414673,
"loss": 5.7784,
"mean_token_accuracy": 0.14671637415885924,
"num_tokens": 6024709.0,
"step": 3465
},
{
"entropy": 5.764834785461426,
"epoch": 0.2699863839719899,
"grad_norm": 1.203125,
"learning_rate": 0.0004995838940431585,
"loss": 5.6378,
"mean_token_accuracy": 0.1520429238677025,
"num_tokens": 6033131.0,
"step": 3470
},
{
"entropy": 5.751634168624878,
"epoch": 0.27037541334370746,
"grad_norm": 1.1484375,
"learning_rate": 0.0004995822075371466,
"loss": 5.8405,
"mean_token_accuracy": 0.14594754576683044,
"num_tokens": 6042310.0,
"step": 3475
},
{
"entropy": 5.842454528808593,
"epoch": 0.270764442715425,
"grad_norm": 1.1015625,
"learning_rate": 0.0004995805176234571,
"loss": 5.6754,
"mean_token_accuracy": 0.15385707169771196,
"num_tokens": 6050617.0,
"step": 3480
},
{
"entropy": 5.82150673866272,
"epoch": 0.2711534720871426,
"grad_norm": 1.125,
"learning_rate": 0.0004995788243021158,
"loss": 5.8341,
"mean_token_accuracy": 0.14465887770056723,
"num_tokens": 6060090.0,
"step": 3485
},
{
"entropy": 5.870070219039917,
"epoch": 0.27154250145886016,
"grad_norm": 1.1796875,
"learning_rate": 0.0004995771275731483,
"loss": 5.7816,
"mean_token_accuracy": 0.14922453165054322,
"num_tokens": 6068646.0,
"step": 3490
},
{
"entropy": 5.840321493148804,
"epoch": 0.2719315308305777,
"grad_norm": 1.3359375,
"learning_rate": 0.0004995754274365802,
"loss": 5.8403,
"mean_token_accuracy": 0.14855221211910247,
"num_tokens": 6077896.0,
"step": 3495
},
{
"entropy": 5.796200132369995,
"epoch": 0.2723205602022953,
"grad_norm": 1.15625,
"learning_rate": 0.0004995737238924376,
"loss": 5.7522,
"mean_token_accuracy": 0.14376320838928222,
"num_tokens": 6087189.0,
"step": 3500
},
{
"entropy": 5.823796129226684,
"epoch": 0.2727095895740128,
"grad_norm": 1.2265625,
"learning_rate": 0.0004995720169407461,
"loss": 5.7489,
"mean_token_accuracy": 0.1495093137025833,
"num_tokens": 6095394.0,
"step": 3505
},
{
"entropy": 5.836558055877686,
"epoch": 0.2730986189457304,
"grad_norm": 1.28125,
"learning_rate": 0.0004995703065815317,
"loss": 5.7164,
"mean_token_accuracy": 0.1526440754532814,
"num_tokens": 6104135.0,
"step": 3510
},
{
"entropy": 5.823418998718262,
"epoch": 0.273487648317448,
"grad_norm": 1.28125,
"learning_rate": 0.0004995685928148203,
"loss": 5.8308,
"mean_token_accuracy": 0.1389838382601738,
"num_tokens": 6112160.0,
"step": 3515
},
{
"entropy": 5.857429122924804,
"epoch": 0.2738766776891655,
"grad_norm": 1.203125,
"learning_rate": 0.000499566875640638,
"loss": 5.8379,
"mean_token_accuracy": 0.15000538304448127,
"num_tokens": 6120575.0,
"step": 3520
},
{
"entropy": 5.860440254211426,
"epoch": 0.2742657070608831,
"grad_norm": 1.1015625,
"learning_rate": 0.0004995651550590108,
"loss": 5.8404,
"mean_token_accuracy": 0.1447710335254669,
"num_tokens": 6129367.0,
"step": 3525
},
{
"entropy": 5.855791473388672,
"epoch": 0.2746547364326007,
"grad_norm": 1.2421875,
"learning_rate": 0.0004995634310699647,
"loss": 5.8259,
"mean_token_accuracy": 0.14781430512666702,
"num_tokens": 6137440.0,
"step": 3530
},
{
"entropy": 5.7965374946594235,
"epoch": 0.2750437658043182,
"grad_norm": 1.109375,
"learning_rate": 0.0004995617036735261,
"loss": 5.7402,
"mean_token_accuracy": 0.14770583286881447,
"num_tokens": 6146770.0,
"step": 3535
},
{
"entropy": 5.904029750823975,
"epoch": 0.2754327951760358,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995599728697211,
"loss": 5.8318,
"mean_token_accuracy": 0.14512663930654526,
"num_tokens": 6155994.0,
"step": 3540
},
{
"entropy": 5.800452709197998,
"epoch": 0.27582182454775334,
"grad_norm": 1.2265625,
"learning_rate": 0.0004995582386585759,
"loss": 5.7515,
"mean_token_accuracy": 0.14241246953606607,
"num_tokens": 6163941.0,
"step": 3545
},
{
"entropy": 5.767463302612304,
"epoch": 0.2762108539194709,
"grad_norm": 1.234375,
"learning_rate": 0.0004995565010401167,
"loss": 5.7941,
"mean_token_accuracy": 0.14686818718910216,
"num_tokens": 6172681.0,
"step": 3550
},
{
"entropy": 5.897072124481201,
"epoch": 0.2765998832911885,
"grad_norm": 1.171875,
"learning_rate": 0.0004995547600143702,
"loss": 5.7758,
"mean_token_accuracy": 0.1455358862876892,
"num_tokens": 6181449.0,
"step": 3555
},
{
"entropy": 5.82000322341919,
"epoch": 0.27698891266290604,
"grad_norm": 1.1640625,
"learning_rate": 0.0004995530155813625,
"loss": 5.7555,
"mean_token_accuracy": 0.1465877875685692,
"num_tokens": 6190275.0,
"step": 3560
},
{
"entropy": 5.805966186523437,
"epoch": 0.2773779420346236,
"grad_norm": 1.1484375,
"learning_rate": 0.0004995512677411203,
"loss": 5.7792,
"mean_token_accuracy": 0.14627898782491683,
"num_tokens": 6198521.0,
"step": 3565
},
{
"entropy": 5.8195501327514645,
"epoch": 0.27776697140634116,
"grad_norm": 1.15625,
"learning_rate": 0.0004995495164936698,
"loss": 5.8445,
"mean_token_accuracy": 0.1397809185087681,
"num_tokens": 6207318.0,
"step": 3570
},
{
"entropy": 5.87066617012024,
"epoch": 0.27815600077805874,
"grad_norm": 1.15625,
"learning_rate": 0.0004995477618390381,
"loss": 5.7298,
"mean_token_accuracy": 0.14824186712503434,
"num_tokens": 6216693.0,
"step": 3575
},
{
"entropy": 5.805923700332642,
"epoch": 0.27854503014977633,
"grad_norm": 1.2421875,
"learning_rate": 0.0004995460037772513,
"loss": 5.7919,
"mean_token_accuracy": 0.14640319496393203,
"num_tokens": 6225207.0,
"step": 3580
},
{
"entropy": 5.809096050262451,
"epoch": 0.27893405952149386,
"grad_norm": 1.3515625,
"learning_rate": 0.0004995442423083365,
"loss": 5.7325,
"mean_token_accuracy": 0.15586716383695604,
"num_tokens": 6232653.0,
"step": 3585
},
{
"entropy": 5.748783349990845,
"epoch": 0.27932308889321145,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995424774323201,
"loss": 5.7295,
"mean_token_accuracy": 0.14759937971830367,
"num_tokens": 6241093.0,
"step": 3590
},
{
"entropy": 5.7409566879272464,
"epoch": 0.279712118264929,
"grad_norm": 1.2109375,
"learning_rate": 0.000499540709149229,
"loss": 5.6149,
"mean_token_accuracy": 0.15389250069856644,
"num_tokens": 6249144.0,
"step": 3595
},
{
"entropy": 5.788210344314575,
"epoch": 0.28010114763664656,
"grad_norm": 1.203125,
"learning_rate": 0.0004995389374590901,
"loss": 5.7058,
"mean_token_accuracy": 0.14813510403037072,
"num_tokens": 6257622.0,
"step": 3600
},
{
"entropy": 5.778064393997193,
"epoch": 0.28049017700836415,
"grad_norm": 1.1875,
"learning_rate": 0.0004995371623619301,
"loss": 5.7337,
"mean_token_accuracy": 0.14399215206503868,
"num_tokens": 6266435.0,
"step": 3605
},
{
"entropy": 5.855746650695801,
"epoch": 0.2808792063800817,
"grad_norm": 1.1953125,
"learning_rate": 0.000499535383857776,
"loss": 5.8548,
"mean_token_accuracy": 0.14212341010570526,
"num_tokens": 6275053.0,
"step": 3610
},
{
"entropy": 5.812265682220459,
"epoch": 0.28126823575179927,
"grad_norm": 1.2109375,
"learning_rate": 0.000499533601946655,
"loss": 5.7463,
"mean_token_accuracy": 0.1406642623245716,
"num_tokens": 6283240.0,
"step": 3615
},
{
"entropy": 5.72180495262146,
"epoch": 0.2816572651235168,
"grad_norm": 1.3203125,
"learning_rate": 0.0004995318166285938,
"loss": 5.6995,
"mean_token_accuracy": 0.15216349810361862,
"num_tokens": 6292133.0,
"step": 3620
},
{
"entropy": 5.851174068450928,
"epoch": 0.2820462944952344,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995300279036199,
"loss": 5.8047,
"mean_token_accuracy": 0.14933415353298188,
"num_tokens": 6300954.0,
"step": 3625
},
{
"entropy": 5.751334381103516,
"epoch": 0.28243532386695197,
"grad_norm": 1.234375,
"learning_rate": 0.00049952823577176,
"loss": 5.6909,
"mean_token_accuracy": 0.15321999713778495,
"num_tokens": 6309637.0,
"step": 3630
},
{
"entropy": 5.790732383728027,
"epoch": 0.2828243532386695,
"grad_norm": 1.234375,
"learning_rate": 0.0004995264402330416,
"loss": 5.7623,
"mean_token_accuracy": 0.15102692544460297,
"num_tokens": 6318539.0,
"step": 3635
},
{
"entropy": 5.823702001571656,
"epoch": 0.2832133826103871,
"grad_norm": 1.21875,
"learning_rate": 0.0004995246412874919,
"loss": 5.686,
"mean_token_accuracy": 0.1494807243347168,
"num_tokens": 6327109.0,
"step": 3640
},
{
"entropy": 5.704149532318115,
"epoch": 0.2836024119821047,
"grad_norm": 1.21875,
"learning_rate": 0.000499522838935138,
"loss": 5.6806,
"mean_token_accuracy": 0.1496465563774109,
"num_tokens": 6335555.0,
"step": 3645
},
{
"entropy": 5.860112619400025,
"epoch": 0.2839914413538222,
"grad_norm": 1.15625,
"learning_rate": 0.0004995210331760074,
"loss": 5.8385,
"mean_token_accuracy": 0.1461038865149021,
"num_tokens": 6344716.0,
"step": 3650
},
{
"entropy": 5.746112537384033,
"epoch": 0.2843804707255398,
"grad_norm": 1.2421875,
"learning_rate": 0.0004995192240101275,
"loss": 5.7075,
"mean_token_accuracy": 0.15382865816354752,
"num_tokens": 6353618.0,
"step": 3655
},
{
"entropy": 5.873103380203247,
"epoch": 0.2847695000972573,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995174114375258,
"loss": 5.8181,
"mean_token_accuracy": 0.14162709265947343,
"num_tokens": 6362039.0,
"step": 3660
},
{
"entropy": 5.856787061691284,
"epoch": 0.2851585294689749,
"grad_norm": 1.1796875,
"learning_rate": 0.0004995155954582297,
"loss": 5.7471,
"mean_token_accuracy": 0.14587011486291884,
"num_tokens": 6370331.0,
"step": 3665
},
{
"entropy": 5.742863416671753,
"epoch": 0.2855475588406925,
"grad_norm": 1.2265625,
"learning_rate": 0.0004995137760722668,
"loss": 5.7323,
"mean_token_accuracy": 0.14978418201208116,
"num_tokens": 6378943.0,
"step": 3670
},
{
"entropy": 5.848138999938965,
"epoch": 0.28593658821241,
"grad_norm": 1.203125,
"learning_rate": 0.0004995119532796646,
"loss": 5.7812,
"mean_token_accuracy": 0.13732778877019883,
"num_tokens": 6387745.0,
"step": 3675
},
{
"entropy": 5.648930788040161,
"epoch": 0.2863256175841276,
"grad_norm": 1.203125,
"learning_rate": 0.000499510127080451,
"loss": 5.6492,
"mean_token_accuracy": 0.14844874367117883,
"num_tokens": 6396915.0,
"step": 3680
},
{
"entropy": 5.686594676971436,
"epoch": 0.28671464695584514,
"grad_norm": 1.1796875,
"learning_rate": 0.0004995082974746535,
"loss": 5.6944,
"mean_token_accuracy": 0.15163496807217597,
"num_tokens": 6405453.0,
"step": 3685
},
{
"entropy": 5.84037594795227,
"epoch": 0.28710367632756273,
"grad_norm": 1.2578125,
"learning_rate": 0.0004995064644622999,
"loss": 5.7669,
"mean_token_accuracy": 0.14520054906606675,
"num_tokens": 6413693.0,
"step": 3690
},
{
"entropy": 5.780052042007446,
"epoch": 0.2874927056992803,
"grad_norm": 1.2734375,
"learning_rate": 0.0004995046280434181,
"loss": 5.7341,
"mean_token_accuracy": 0.14460751190781593,
"num_tokens": 6422738.0,
"step": 3695
},
{
"entropy": 5.742298173904419,
"epoch": 0.28788173507099785,
"grad_norm": 1.25,
"learning_rate": 0.0004995027882180358,
"loss": 5.6937,
"mean_token_accuracy": 0.15133106857538223,
"num_tokens": 6431743.0,
"step": 3700
},
{
"entropy": 5.809255313873291,
"epoch": 0.28827076444271543,
"grad_norm": 1.2109375,
"learning_rate": 0.0004995009449861812,
"loss": 5.7476,
"mean_token_accuracy": 0.1464826263487339,
"num_tokens": 6440586.0,
"step": 3705
},
{
"entropy": 5.792600870132446,
"epoch": 0.28865979381443296,
"grad_norm": 1.2890625,
"learning_rate": 0.000499499098347882,
"loss": 5.7945,
"mean_token_accuracy": 0.14538254216313362,
"num_tokens": 6449644.0,
"step": 3710
},
{
"entropy": 5.732555389404297,
"epoch": 0.28904882318615055,
"grad_norm": 1.125,
"learning_rate": 0.0004994972483031662,
"loss": 5.6924,
"mean_token_accuracy": 0.15000784248113633,
"num_tokens": 6458752.0,
"step": 3715
},
{
"entropy": 5.722676849365234,
"epoch": 0.28943785255786814,
"grad_norm": 1.1328125,
"learning_rate": 0.000499495394852062,
"loss": 5.7457,
"mean_token_accuracy": 0.15378984808921814,
"num_tokens": 6468333.0,
"step": 3720
},
{
"entropy": 5.651209449768066,
"epoch": 0.28982688192958567,
"grad_norm": 1.2421875,
"learning_rate": 0.0004994935379945977,
"loss": 5.6043,
"mean_token_accuracy": 0.15003781169652938,
"num_tokens": 6477406.0,
"step": 3725
},
{
"entropy": 5.86032395362854,
"epoch": 0.29021591130130325,
"grad_norm": 1.3671875,
"learning_rate": 0.0004994916777308012,
"loss": 5.768,
"mean_token_accuracy": 0.14514341950416565,
"num_tokens": 6486399.0,
"step": 3730
},
{
"entropy": 5.791876649856567,
"epoch": 0.29060494067302084,
"grad_norm": 1.171875,
"learning_rate": 0.0004994898140607007,
"loss": 5.6616,
"mean_token_accuracy": 0.14688180163502693,
"num_tokens": 6494853.0,
"step": 3735
},
{
"entropy": 5.795904016494751,
"epoch": 0.29099397004473837,
"grad_norm": 1.3125,
"learning_rate": 0.0004994879469843247,
"loss": 5.8281,
"mean_token_accuracy": 0.14508696421980857,
"num_tokens": 6503301.0,
"step": 3740
},
{
"entropy": 5.770627212524414,
"epoch": 0.29138299941645596,
"grad_norm": 1.078125,
"learning_rate": 0.0004994860765017013,
"loss": 5.7042,
"mean_token_accuracy": 0.14785689413547515,
"num_tokens": 6512685.0,
"step": 3745
},
{
"entropy": 5.811524724960327,
"epoch": 0.2917720287881735,
"grad_norm": 1.203125,
"learning_rate": 0.000499484202612859,
"loss": 5.83,
"mean_token_accuracy": 0.13926837593317032,
"num_tokens": 6520673.0,
"step": 3750
},
{
"entropy": 5.8250175476074215,
"epoch": 0.2921610581598911,
"grad_norm": 1.1015625,
"learning_rate": 0.0004994823253178264,
"loss": 5.7345,
"mean_token_accuracy": 0.1433857038617134,
"num_tokens": 6529039.0,
"step": 3755
},
{
"entropy": 5.804865884780884,
"epoch": 0.29255008753160866,
"grad_norm": 1.171875,
"learning_rate": 0.0004994804446166317,
"loss": 5.8056,
"mean_token_accuracy": 0.139020137488842,
"num_tokens": 6537932.0,
"step": 3760
},
{
"entropy": 5.811407566070557,
"epoch": 0.2929391169033262,
"grad_norm": 1.21875,
"learning_rate": 0.0004994785605093035,
"loss": 5.6878,
"mean_token_accuracy": 0.14702240973711014,
"num_tokens": 6546278.0,
"step": 3765
},
{
"entropy": 5.779412078857422,
"epoch": 0.2933281462750438,
"grad_norm": 1.203125,
"learning_rate": 0.0004994766729958705,
"loss": 5.749,
"mean_token_accuracy": 0.15017975717782975,
"num_tokens": 6554449.0,
"step": 3770
},
{
"entropy": 5.7709815979003904,
"epoch": 0.2937171756467613,
"grad_norm": 1.171875,
"learning_rate": 0.0004994747820763612,
"loss": 5.74,
"mean_token_accuracy": 0.14958301335573196,
"num_tokens": 6563272.0,
"step": 3775
},
{
"entropy": 5.8512287616729735,
"epoch": 0.2941062050184789,
"grad_norm": 1.296875,
"learning_rate": 0.0004994728877508046,
"loss": 5.7479,
"mean_token_accuracy": 0.14908050000667572,
"num_tokens": 6571864.0,
"step": 3780
},
{
"entropy": 5.808426761627198,
"epoch": 0.2944952343901965,
"grad_norm": 1.2578125,
"learning_rate": 0.0004994709900192289,
"loss": 5.7548,
"mean_token_accuracy": 0.15123838260769845,
"num_tokens": 6580435.0,
"step": 3785
},
{
"entropy": 5.829617738723755,
"epoch": 0.294884263761914,
"grad_norm": 1.2734375,
"learning_rate": 0.0004994690888816635,
"loss": 5.7405,
"mean_token_accuracy": 0.15302761197090148,
"num_tokens": 6589261.0,
"step": 3790
},
{
"entropy": 5.815215587615967,
"epoch": 0.2952732931336316,
"grad_norm": 1.2109375,
"learning_rate": 0.0004994671843381367,
"loss": 5.833,
"mean_token_accuracy": 0.14754071235656738,
"num_tokens": 6598057.0,
"step": 3795
},
{
"entropy": 5.89307165145874,
"epoch": 0.29566232250534913,
"grad_norm": 1.15625,
"learning_rate": 0.0004994652763886778,
"loss": 5.7819,
"mean_token_accuracy": 0.14495566934347154,
"num_tokens": 6606439.0,
"step": 3800
},
{
"entropy": 5.779307746887207,
"epoch": 0.2960513518770667,
"grad_norm": 1.234375,
"learning_rate": 0.0004994633650333155,
"loss": 5.7972,
"mean_token_accuracy": 0.150536447763443,
"num_tokens": 6615350.0,
"step": 3805
},
{
"entropy": 5.839250755310059,
"epoch": 0.2964403812487843,
"grad_norm": 1.265625,
"learning_rate": 0.0004994614502720792,
"loss": 5.8374,
"mean_token_accuracy": 0.14464310929179192,
"num_tokens": 6624258.0,
"step": 3810
},
{
"entropy": 5.925694417953491,
"epoch": 0.29682941062050183,
"grad_norm": 1.234375,
"learning_rate": 0.0004994595321049974,
"loss": 5.8396,
"mean_token_accuracy": 0.14261462390422822,
"num_tokens": 6632382.0,
"step": 3815
},
{
"entropy": 5.749386548995972,
"epoch": 0.2972184399922194,
"grad_norm": 1.203125,
"learning_rate": 0.0004994576105320994,
"loss": 5.7459,
"mean_token_accuracy": 0.14289859756827356,
"num_tokens": 6640482.0,
"step": 3820
},
{
"entropy": 5.77762246131897,
"epoch": 0.29760746936393695,
"grad_norm": 1.203125,
"learning_rate": 0.0004994556855534146,
"loss": 5.7249,
"mean_token_accuracy": 0.14987960308790207,
"num_tokens": 6648912.0,
"step": 3825
},
{
"entropy": 5.764063549041748,
"epoch": 0.29799649873565454,
"grad_norm": 1.203125,
"learning_rate": 0.0004994537571689719,
"loss": 5.6934,
"mean_token_accuracy": 0.15349327325820922,
"num_tokens": 6656912.0,
"step": 3830
},
{
"entropy": 5.654044771194458,
"epoch": 0.2983855281073721,
"grad_norm": 1.15625,
"learning_rate": 0.0004994518253788007,
"loss": 5.7261,
"mean_token_accuracy": 0.1497397929430008,
"num_tokens": 6665900.0,
"step": 3835
},
{
"entropy": 5.794566822052002,
"epoch": 0.29877455747908965,
"grad_norm": 1.1796875,
"learning_rate": 0.0004994498901829304,
"loss": 5.7605,
"mean_token_accuracy": 0.1491077497601509,
"num_tokens": 6674426.0,
"step": 3840
},
{
"entropy": 5.859363174438476,
"epoch": 0.29916358685080724,
"grad_norm": 1.1953125,
"learning_rate": 0.0004994479515813903,
"loss": 5.7241,
"mean_token_accuracy": 0.15072896480560302,
"num_tokens": 6683566.0,
"step": 3845
},
{
"entropy": 5.8193401336669925,
"epoch": 0.2995526162225248,
"grad_norm": 1.3828125,
"learning_rate": 0.0004994460095742096,
"loss": 5.7437,
"mean_token_accuracy": 0.14816814959049224,
"num_tokens": 6693341.0,
"step": 3850
},
{
"entropy": 5.744719791412353,
"epoch": 0.29994164559424236,
"grad_norm": 1.2265625,
"learning_rate": 0.000499444064161418,
"loss": 5.6457,
"mean_token_accuracy": 0.14331029802560807,
"num_tokens": 6701734.0,
"step": 3855
},
{
"entropy": 5.705294227600097,
"epoch": 0.30033067496595994,
"grad_norm": 1.1171875,
"learning_rate": 0.000499442115343045,
"loss": 5.6967,
"mean_token_accuracy": 0.14783288091421126,
"num_tokens": 6710572.0,
"step": 3860
},
{
"entropy": 5.857030296325684,
"epoch": 0.3007197043376775,
"grad_norm": 1.1796875,
"learning_rate": 0.0004994401631191202,
"loss": 5.7977,
"mean_token_accuracy": 0.14748454242944717,
"num_tokens": 6719355.0,
"step": 3865
},
{
"entropy": 5.939599275588989,
"epoch": 0.30110873370939506,
"grad_norm": 1.1328125,
"learning_rate": 0.0004994382074896731,
"loss": 5.8436,
"mean_token_accuracy": 0.14460212513804435,
"num_tokens": 6729279.0,
"step": 3870
},
{
"entropy": 5.743366622924805,
"epoch": 0.30149776308111265,
"grad_norm": 1.3125,
"learning_rate": 0.0004994362484547335,
"loss": 5.661,
"mean_token_accuracy": 0.1506835326552391,
"num_tokens": 6737318.0,
"step": 3875
},
{
"entropy": 5.726180648803711,
"epoch": 0.3018867924528302,
"grad_norm": 1.1171875,
"learning_rate": 0.0004994342860143309,
"loss": 5.7294,
"mean_token_accuracy": 0.15141772627830505,
"num_tokens": 6746520.0,
"step": 3880
},
{
"entropy": 5.796295690536499,
"epoch": 0.30227582182454776,
"grad_norm": 1.1875,
"learning_rate": 0.0004994323201684953,
"loss": 5.6717,
"mean_token_accuracy": 0.15030458867549895,
"num_tokens": 6755685.0,
"step": 3885
},
{
"entropy": 5.838547277450561,
"epoch": 0.3026648511962653,
"grad_norm": 1.3046875,
"learning_rate": 0.0004994303509172566,
"loss": 5.8235,
"mean_token_accuracy": 0.1489374205470085,
"num_tokens": 6764347.0,
"step": 3890
},
{
"entropy": 5.891355895996094,
"epoch": 0.3030538805679829,
"grad_norm": 1.359375,
"learning_rate": 0.0004994283782606444,
"loss": 5.7928,
"mean_token_accuracy": 0.14623976349830628,
"num_tokens": 6772887.0,
"step": 3895
},
{
"entropy": 5.719379234313965,
"epoch": 0.30344290993970047,
"grad_norm": 1.2578125,
"learning_rate": 0.0004994264021986888,
"loss": 5.752,
"mean_token_accuracy": 0.14479378163814544,
"num_tokens": 6780860.0,
"step": 3900
},
{
"entropy": 5.743838214874268,
"epoch": 0.303831939311418,
"grad_norm": 1.2421875,
"learning_rate": 0.0004994244227314197,
"loss": 5.7788,
"mean_token_accuracy": 0.14853150248527527,
"num_tokens": 6789491.0,
"step": 3905
},
{
"entropy": 5.849668788909912,
"epoch": 0.3042209686831356,
"grad_norm": 1.3203125,
"learning_rate": 0.0004994224398588672,
"loss": 5.6878,
"mean_token_accuracy": 0.15083892196416854,
"num_tokens": 6797128.0,
"step": 3910
},
{
"entropy": 5.765138626098633,
"epoch": 0.3046099980548531,
"grad_norm": 1.3046875,
"learning_rate": 0.0004994204535810615,
"loss": 5.7392,
"mean_token_accuracy": 0.14893354028463363,
"num_tokens": 6805235.0,
"step": 3915
},
{
"entropy": 5.7339215755462645,
"epoch": 0.3049990274265707,
"grad_norm": 1.234375,
"learning_rate": 0.0004994184638980326,
"loss": 5.6542,
"mean_token_accuracy": 0.14677734673023224,
"num_tokens": 6813863.0,
"step": 3920
},
{
"entropy": 5.850627326965332,
"epoch": 0.3053880567982883,
"grad_norm": 1.1953125,
"learning_rate": 0.0004994164708098107,
"loss": 5.7091,
"mean_token_accuracy": 0.1484633207321167,
"num_tokens": 6822015.0,
"step": 3925
},
{
"entropy": 5.8042628288269045,
"epoch": 0.3057770861700058,
"grad_norm": 1.1953125,
"learning_rate": 0.000499414474316426,
"loss": 5.776,
"mean_token_accuracy": 0.14575532376766204,
"num_tokens": 6830598.0,
"step": 3930
},
{
"entropy": 5.816047525405883,
"epoch": 0.3061661155417234,
"grad_norm": 1.2421875,
"learning_rate": 0.0004994124744179088,
"loss": 5.7568,
"mean_token_accuracy": 0.15651062354445458,
"num_tokens": 6839129.0,
"step": 3935
},
{
"entropy": 5.819494342803955,
"epoch": 0.306555144913441,
"grad_norm": 1.25,
"learning_rate": 0.0004994104711142896,
"loss": 5.7294,
"mean_token_accuracy": 0.14562334567308427,
"num_tokens": 6848199.0,
"step": 3940
},
{
"entropy": 5.744944715499878,
"epoch": 0.3069441742851585,
"grad_norm": 1.21875,
"learning_rate": 0.0004994084644055986,
"loss": 5.7293,
"mean_token_accuracy": 0.1494791552424431,
"num_tokens": 6857340.0,
"step": 3945
},
{
"entropy": 5.801846694946289,
"epoch": 0.3073332036568761,
"grad_norm": 1.2265625,
"learning_rate": 0.0004994064542918664,
"loss": 5.7679,
"mean_token_accuracy": 0.14427911713719369,
"num_tokens": 6865830.0,
"step": 3950
},
{
"entropy": 5.841561651229858,
"epoch": 0.30772223302859364,
"grad_norm": 1.1171875,
"learning_rate": 0.0004994044407731235,
"loss": 5.8153,
"mean_token_accuracy": 0.14207547903060913,
"num_tokens": 6874318.0,
"step": 3955
},
{
"entropy": 5.854608154296875,
"epoch": 0.3081112624003112,
"grad_norm": 1.2578125,
"learning_rate": 0.0004994024238494002,
"loss": 5.8195,
"mean_token_accuracy": 0.1442083813250065,
"num_tokens": 6882008.0,
"step": 3960
},
{
"entropy": 5.7925008773803714,
"epoch": 0.3085002917720288,
"grad_norm": 1.171875,
"learning_rate": 0.0004994004035207274,
"loss": 5.6894,
"mean_token_accuracy": 0.1514485001564026,
"num_tokens": 6890411.0,
"step": 3965
},
{
"entropy": 5.758844566345215,
"epoch": 0.30888932114374634,
"grad_norm": 1.171875,
"learning_rate": 0.0004993983797871356,
"loss": 5.7275,
"mean_token_accuracy": 0.14202559366822243,
"num_tokens": 6899201.0,
"step": 3970
},
{
"entropy": 5.741217756271363,
"epoch": 0.30927835051546393,
"grad_norm": 1.3125,
"learning_rate": 0.0004993963526486555,
"loss": 5.7072,
"mean_token_accuracy": 0.14819234013557434,
"num_tokens": 6907470.0,
"step": 3975
},
{
"entropy": 5.758135032653809,
"epoch": 0.30966737988718146,
"grad_norm": 1.15625,
"learning_rate": 0.000499394322105318,
"loss": 5.7705,
"mean_token_accuracy": 0.14505221620202063,
"num_tokens": 6916542.0,
"step": 3980
},
{
"entropy": 5.811226224899292,
"epoch": 0.31005640925889905,
"grad_norm": 1.1171875,
"learning_rate": 0.0004993922881571538,
"loss": 5.7622,
"mean_token_accuracy": 0.14597265869379045,
"num_tokens": 6925974.0,
"step": 3985
},
{
"entropy": 5.864097452163696,
"epoch": 0.31044543863061663,
"grad_norm": 1.203125,
"learning_rate": 0.0004993902508041939,
"loss": 5.7823,
"mean_token_accuracy": 0.14232797771692277,
"num_tokens": 6934987.0,
"step": 3990
},
{
"entropy": 5.724343395233154,
"epoch": 0.31083446800233416,
"grad_norm": 1.2734375,
"learning_rate": 0.000499388210046469,
"loss": 5.6578,
"mean_token_accuracy": 0.1503308668732643,
"num_tokens": 6944497.0,
"step": 3995
},
{
"entropy": 5.767210245132446,
"epoch": 0.31122349737405175,
"grad_norm": 1.296875,
"learning_rate": 0.0004993861658840102,
"loss": 5.8084,
"mean_token_accuracy": 0.14419659674167634,
"num_tokens": 6953394.0,
"step": 4000
},
{
"entropy": 5.857591390609741,
"epoch": 0.3116125267457693,
"grad_norm": 1.3359375,
"learning_rate": 0.0004993841183168484,
"loss": 5.72,
"mean_token_accuracy": 0.14840124249458314,
"num_tokens": 6961715.0,
"step": 4005
},
{
"entropy": 5.778973197937011,
"epoch": 0.31200155611748687,
"grad_norm": 1.203125,
"learning_rate": 0.0004993820673450148,
"loss": 5.711,
"mean_token_accuracy": 0.15171929597854614,
"num_tokens": 6970041.0,
"step": 4010
},
{
"entropy": 5.807648229598999,
"epoch": 0.31239058548920445,
"grad_norm": 1.1796875,
"learning_rate": 0.0004993800129685404,
"loss": 5.8432,
"mean_token_accuracy": 0.13994109630584717,
"num_tokens": 6979522.0,
"step": 4015
},
{
"entropy": 5.856877374649048,
"epoch": 0.312779614860922,
"grad_norm": 1.2421875,
"learning_rate": 0.0004993779551874565,
"loss": 5.8043,
"mean_token_accuracy": 0.14071302264928817,
"num_tokens": 6988470.0,
"step": 4020
},
{
"entropy": 5.85621976852417,
"epoch": 0.31316864423263957,
"grad_norm": 1.2734375,
"learning_rate": 0.0004993758940017943,
"loss": 5.8328,
"mean_token_accuracy": 0.1494374841451645,
"num_tokens": 6996696.0,
"step": 4025
},
{
"entropy": 5.837846803665161,
"epoch": 0.31355767360435716,
"grad_norm": 1.171875,
"learning_rate": 0.000499373829411585,
"loss": 5.6987,
"mean_token_accuracy": 0.14920781552791595,
"num_tokens": 7005297.0,
"step": 4030
},
{
"entropy": 5.746081399917602,
"epoch": 0.3139467029760747,
"grad_norm": 1.3046875,
"learning_rate": 0.00049937176141686,
"loss": 5.706,
"mean_token_accuracy": 0.14789552241563797,
"num_tokens": 7013569.0,
"step": 4035
},
{
"entropy": 5.712790489196777,
"epoch": 0.3143357323477923,
"grad_norm": 1.2578125,
"learning_rate": 0.0004993696900176506,
"loss": 5.6654,
"mean_token_accuracy": 0.15430878922343255,
"num_tokens": 7021449.0,
"step": 4040
},
{
"entropy": 5.807843160629273,
"epoch": 0.3147247617195098,
"grad_norm": 1.390625,
"learning_rate": 0.0004993676152139883,
"loss": 5.7744,
"mean_token_accuracy": 0.14702282547950746,
"num_tokens": 7029663.0,
"step": 4045
},
{
"entropy": 5.8004063129425045,
"epoch": 0.3151137910912274,
"grad_norm": 1.1953125,
"learning_rate": 0.0004993655370059046,
"loss": 5.7596,
"mean_token_accuracy": 0.14937672913074493,
"num_tokens": 7039038.0,
"step": 4050
},
{
"entropy": 5.813193845748901,
"epoch": 0.315502820462945,
"grad_norm": 1.2109375,
"learning_rate": 0.0004993634553934309,
"loss": 5.7187,
"mean_token_accuracy": 0.14714134261012077,
"num_tokens": 7047595.0,
"step": 4055
},
{
"entropy": 5.806483888626099,
"epoch": 0.3158918498346625,
"grad_norm": 1.25,
"learning_rate": 0.0004993613703765989,
"loss": 5.7476,
"mean_token_accuracy": 0.1446899317204952,
"num_tokens": 7055711.0,
"step": 4060
},
{
"entropy": 5.83050012588501,
"epoch": 0.3162808792063801,
"grad_norm": 1.1484375,
"learning_rate": 0.0004993592819554402,
"loss": 5.7053,
"mean_token_accuracy": 0.15050461292266845,
"num_tokens": 7064100.0,
"step": 4065
},
{
"entropy": 5.730781698226929,
"epoch": 0.3166699085780976,
"grad_norm": 1.21875,
"learning_rate": 0.0004993571901299866,
"loss": 5.6671,
"mean_token_accuracy": 0.15151382014155387,
"num_tokens": 7073040.0,
"step": 4070
},
{
"entropy": 5.802879333496094,
"epoch": 0.3170589379498152,
"grad_norm": 1.40625,
"learning_rate": 0.0004993550949002697,
"loss": 5.7897,
"mean_token_accuracy": 0.14686385542154312,
"num_tokens": 7081513.0,
"step": 4075
},
{
"entropy": 5.71605954170227,
"epoch": 0.3174479673215328,
"grad_norm": 1.28125,
"learning_rate": 0.0004993529962663213,
"loss": 5.6664,
"mean_token_accuracy": 0.1578037440776825,
"num_tokens": 7090704.0,
"step": 4080
},
{
"entropy": 5.719445323944091,
"epoch": 0.31783699669325033,
"grad_norm": 1.109375,
"learning_rate": 0.0004993508942281732,
"loss": 5.8339,
"mean_token_accuracy": 0.14239503517746926,
"num_tokens": 7099692.0,
"step": 4085
},
{
"entropy": 5.829551744461059,
"epoch": 0.3182260260649679,
"grad_norm": 1.28125,
"learning_rate": 0.0004993487887858575,
"loss": 5.6674,
"mean_token_accuracy": 0.14845634177327155,
"num_tokens": 7108021.0,
"step": 4090
},
{
"entropy": 5.787135601043701,
"epoch": 0.31861505543668545,
"grad_norm": 1.3046875,
"learning_rate": 0.000499346679939406,
"loss": 5.7383,
"mean_token_accuracy": 0.15348986834287642,
"num_tokens": 7116689.0,
"step": 4095
},
{
"entropy": 5.830695724487304,
"epoch": 0.31900408480840303,
"grad_norm": 1.375,
"learning_rate": 0.0004993445676888507,
"loss": 5.8181,
"mean_token_accuracy": 0.14692653194069863,
"num_tokens": 7125453.0,
"step": 4100
},
{
"entropy": 5.901071310043335,
"epoch": 0.3193931141801206,
"grad_norm": 1.234375,
"learning_rate": 0.0004993424520342236,
"loss": 5.8614,
"mean_token_accuracy": 0.14383067488670348,
"num_tokens": 7133692.0,
"step": 4105
},
{
"entropy": 5.799852418899536,
"epoch": 0.31978214355183815,
"grad_norm": 1.21875,
"learning_rate": 0.0004993403329755569,
"loss": 5.6846,
"mean_token_accuracy": 0.15570786744356155,
"num_tokens": 7142362.0,
"step": 4110
},
{
"entropy": 5.69540696144104,
"epoch": 0.32017117292355574,
"grad_norm": 1.265625,
"learning_rate": 0.0004993382105128828,
"loss": 5.694,
"mean_token_accuracy": 0.1470162481069565,
"num_tokens": 7151020.0,
"step": 4115
},
{
"entropy": 5.802663040161133,
"epoch": 0.32056020229527327,
"grad_norm": 1.2890625,
"learning_rate": 0.0004993360846462333,
"loss": 5.6156,
"mean_token_accuracy": 0.15607071816921234,
"num_tokens": 7159453.0,
"step": 4120
},
{
"entropy": 5.836108446121216,
"epoch": 0.32094923166699085,
"grad_norm": 1.2578125,
"learning_rate": 0.0004993339553756408,
"loss": 5.8734,
"mean_token_accuracy": 0.14251873642206192,
"num_tokens": 7168758.0,
"step": 4125
},
{
"entropy": 5.747575998306274,
"epoch": 0.32133826103870844,
"grad_norm": 1.328125,
"learning_rate": 0.0004993318227011378,
"loss": 5.6809,
"mean_token_accuracy": 0.14836385846138,
"num_tokens": 7177835.0,
"step": 4130
},
{
"entropy": 5.791856718063355,
"epoch": 0.32172729041042597,
"grad_norm": 1.28125,
"learning_rate": 0.0004993296866227562,
"loss": 5.7434,
"mean_token_accuracy": 0.15285915583372117,
"num_tokens": 7186424.0,
"step": 4135
},
{
"entropy": 5.785421514511109,
"epoch": 0.32211631978214356,
"grad_norm": 1.2109375,
"learning_rate": 0.0004993275471405288,
"loss": 5.7097,
"mean_token_accuracy": 0.15487945079803467,
"num_tokens": 7194800.0,
"step": 4140
},
{
"entropy": 5.753833484649658,
"epoch": 0.32250534915386114,
"grad_norm": 1.203125,
"learning_rate": 0.0004993254042544879,
"loss": 5.624,
"mean_token_accuracy": 0.15332144722342492,
"num_tokens": 7203820.0,
"step": 4145
},
{
"entropy": 5.73719220161438,
"epoch": 0.3228943785255787,
"grad_norm": 1.25,
"learning_rate": 0.000499323257964666,
"loss": 5.6277,
"mean_token_accuracy": 0.1526389017701149,
"num_tokens": 7211793.0,
"step": 4150
},
{
"entropy": 5.769924783706665,
"epoch": 0.32328340789729626,
"grad_norm": 1.171875,
"learning_rate": 0.0004993211082710957,
"loss": 5.6852,
"mean_token_accuracy": 0.15136036276817322,
"num_tokens": 7220471.0,
"step": 4155
},
{
"entropy": 5.725868844985962,
"epoch": 0.3236724372690138,
"grad_norm": 1.265625,
"learning_rate": 0.0004993189551738097,
"loss": 5.7308,
"mean_token_accuracy": 0.14761384800076485,
"num_tokens": 7228788.0,
"step": 4160
},
{
"entropy": 5.8348915576934814,
"epoch": 0.3240614666407314,
"grad_norm": 1.3203125,
"learning_rate": 0.0004993167986728405,
"loss": 5.8991,
"mean_token_accuracy": 0.14883753657341003,
"num_tokens": 7237707.0,
"step": 4165
},
{
"entropy": 5.892117071151733,
"epoch": 0.32445049601244896,
"grad_norm": 1.1875,
"learning_rate": 0.000499314638768221,
"loss": 5.6602,
"mean_token_accuracy": 0.15464966297149657,
"num_tokens": 7246296.0,
"step": 4170
},
{
"entropy": 5.67684326171875,
"epoch": 0.3248395253841665,
"grad_norm": 1.2265625,
"learning_rate": 0.0004993124754599839,
"loss": 5.5873,
"mean_token_accuracy": 0.1556680306792259,
"num_tokens": 7255076.0,
"step": 4175
},
{
"entropy": 5.574007749557495,
"epoch": 0.3252285547558841,
"grad_norm": 1.3515625,
"learning_rate": 0.0004993103087481619,
"loss": 5.6898,
"mean_token_accuracy": 0.14951695650815963,
"num_tokens": 7263169.0,
"step": 4180
},
{
"entropy": 5.827068758010864,
"epoch": 0.3256175841276016,
"grad_norm": 1.171875,
"learning_rate": 0.0004993081386327881,
"loss": 5.7499,
"mean_token_accuracy": 0.15402725636959075,
"num_tokens": 7271748.0,
"step": 4185
},
{
"entropy": 5.725684070587159,
"epoch": 0.3260066134993192,
"grad_norm": 1.1875,
"learning_rate": 0.0004993059651138953,
"loss": 5.5602,
"mean_token_accuracy": 0.1556816130876541,
"num_tokens": 7280291.0,
"step": 4190
},
{
"entropy": 5.69296875,
"epoch": 0.3263956428710368,
"grad_norm": 1.2265625,
"learning_rate": 0.0004993037881915165,
"loss": 5.7556,
"mean_token_accuracy": 0.14534951150417327,
"num_tokens": 7290307.0,
"step": 4195
},
{
"entropy": 5.911472511291504,
"epoch": 0.3267846722427543,
"grad_norm": 1.2734375,
"learning_rate": 0.0004993016078656847,
"loss": 5.8196,
"mean_token_accuracy": 0.14084672108292579,
"num_tokens": 7297942.0,
"step": 4200
},
{
"entropy": 5.713421821594238,
"epoch": 0.3271737016144719,
"grad_norm": 1.2109375,
"learning_rate": 0.000499299424136433,
"loss": 5.703,
"mean_token_accuracy": 0.14439374804496766,
"num_tokens": 7307378.0,
"step": 4205
},
{
"entropy": 5.755586624145508,
"epoch": 0.32756273098618943,
"grad_norm": 1.2890625,
"learning_rate": 0.0004992972370037946,
"loss": 5.6635,
"mean_token_accuracy": 0.1554426446557045,
"num_tokens": 7315985.0,
"step": 4210
},
{
"entropy": 5.809132528305054,
"epoch": 0.327951760357907,
"grad_norm": 1.2578125,
"learning_rate": 0.0004992950464678026,
"loss": 5.7924,
"mean_token_accuracy": 0.14466845989227295,
"num_tokens": 7324142.0,
"step": 4215
},
{
"entropy": 5.739095306396484,
"epoch": 0.3283407897296246,
"grad_norm": 1.234375,
"learning_rate": 0.0004992928525284903,
"loss": 5.6415,
"mean_token_accuracy": 0.14974627569317817,
"num_tokens": 7333012.0,
"step": 4220
},
{
"entropy": 5.764504671096802,
"epoch": 0.32872981910134214,
"grad_norm": 1.2421875,
"learning_rate": 0.000499290655185891,
"loss": 5.6733,
"mean_token_accuracy": 0.1509619578719139,
"num_tokens": 7341838.0,
"step": 4225
},
{
"entropy": 5.677153444290161,
"epoch": 0.3291188484730597,
"grad_norm": 1.25,
"learning_rate": 0.000499288454440038,
"loss": 5.6118,
"mean_token_accuracy": 0.16084043234586715,
"num_tokens": 7349986.0,
"step": 4230
},
{
"entropy": 5.832826709747314,
"epoch": 0.3295078778447773,
"grad_norm": 1.234375,
"learning_rate": 0.0004992862502909645,
"loss": 5.8509,
"mean_token_accuracy": 0.14144516214728356,
"num_tokens": 7359428.0,
"step": 4235
},
{
"entropy": 5.873200845718384,
"epoch": 0.32989690721649484,
"grad_norm": 1.21875,
"learning_rate": 0.0004992840427387043,
"loss": 5.7791,
"mean_token_accuracy": 0.14769574701786042,
"num_tokens": 7368524.0,
"step": 4240
},
{
"entropy": 5.753816413879394,
"epoch": 0.3302859365882124,
"grad_norm": 1.09375,
"learning_rate": 0.0004992818317832908,
"loss": 5.6531,
"mean_token_accuracy": 0.1480708360671997,
"num_tokens": 7377979.0,
"step": 4245
},
{
"entropy": 5.716938257217407,
"epoch": 0.33067496595992996,
"grad_norm": 1.2421875,
"learning_rate": 0.0004992796174247574,
"loss": 5.5792,
"mean_token_accuracy": 0.15270080417394638,
"num_tokens": 7386283.0,
"step": 4250
},
{
"entropy": 5.703174495697022,
"epoch": 0.33106399533164754,
"grad_norm": 1.203125,
"learning_rate": 0.0004992773996631378,
"loss": 5.7083,
"mean_token_accuracy": 0.14178377091884614,
"num_tokens": 7395409.0,
"step": 4255
},
{
"entropy": 5.793183040618897,
"epoch": 0.33145302470336513,
"grad_norm": 1.2734375,
"learning_rate": 0.0004992751784984656,
"loss": 5.7763,
"mean_token_accuracy": 0.14899417757987976,
"num_tokens": 7403389.0,
"step": 4260
},
{
"entropy": 5.7782896041870115,
"epoch": 0.33184205407508266,
"grad_norm": 1.2109375,
"learning_rate": 0.0004992729539307745,
"loss": 5.703,
"mean_token_accuracy": 0.15201039761304855,
"num_tokens": 7411506.0,
"step": 4265
},
{
"entropy": 5.812991285324097,
"epoch": 0.33223108344680025,
"grad_norm": 1.25,
"learning_rate": 0.0004992707259600984,
"loss": 5.7846,
"mean_token_accuracy": 0.14998362809419633,
"num_tokens": 7420219.0,
"step": 4270
},
{
"entropy": 5.757145166397095,
"epoch": 0.3326201128185178,
"grad_norm": 1.25,
"learning_rate": 0.0004992684945864709,
"loss": 5.7129,
"mean_token_accuracy": 0.15293968468904495,
"num_tokens": 7428442.0,
"step": 4275
},
{
"entropy": 5.798875713348389,
"epoch": 0.33300914219023536,
"grad_norm": 1.2109375,
"learning_rate": 0.0004992662598099261,
"loss": 5.6653,
"mean_token_accuracy": 0.1510924369096756,
"num_tokens": 7436364.0,
"step": 4280
},
{
"entropy": 5.772172117233277,
"epoch": 0.33339817156195295,
"grad_norm": 1.2578125,
"learning_rate": 0.0004992640216304975,
"loss": 5.7325,
"mean_token_accuracy": 0.14351431503891945,
"num_tokens": 7444122.0,
"step": 4285
},
{
"entropy": 5.835605764389038,
"epoch": 0.3337872009336705,
"grad_norm": 1.25,
"learning_rate": 0.0004992617800482196,
"loss": 5.7413,
"mean_token_accuracy": 0.14694980010390282,
"num_tokens": 7454122.0,
"step": 4290
},
{
"entropy": 5.806734895706176,
"epoch": 0.33417623030538807,
"grad_norm": 1.328125,
"learning_rate": 0.000499259535063126,
"loss": 5.752,
"mean_token_accuracy": 0.15015026181936264,
"num_tokens": 7463057.0,
"step": 4295
},
{
"entropy": 5.819530391693116,
"epoch": 0.3345652596771056,
"grad_norm": 1.1796875,
"learning_rate": 0.000499257286675251,
"loss": 5.7053,
"mean_token_accuracy": 0.14335729479789733,
"num_tokens": 7471675.0,
"step": 4300
},
{
"entropy": 5.699312400817871,
"epoch": 0.3349542890488232,
"grad_norm": 1.1953125,
"learning_rate": 0.0004992550348846285,
"loss": 5.6546,
"mean_token_accuracy": 0.1525387153029442,
"num_tokens": 7479870.0,
"step": 4305
},
{
"entropy": 5.7911989212036135,
"epoch": 0.33534331842054077,
"grad_norm": 1.1953125,
"learning_rate": 0.0004992527796912928,
"loss": 5.7359,
"mean_token_accuracy": 0.14847930446267127,
"num_tokens": 7489830.0,
"step": 4310
},
{
"entropy": 5.775819587707519,
"epoch": 0.3357323477922583,
"grad_norm": 1.265625,
"learning_rate": 0.0004992505210952782,
"loss": 5.6581,
"mean_token_accuracy": 0.1594860151410103,
"num_tokens": 7497852.0,
"step": 4315
},
{
"entropy": 5.789813709259033,
"epoch": 0.3361213771639759,
"grad_norm": 1.2734375,
"learning_rate": 0.0004992482590966188,
"loss": 5.8037,
"mean_token_accuracy": 0.14984895661473274,
"num_tokens": 7506419.0,
"step": 4320
},
{
"entropy": 5.7952008724212645,
"epoch": 0.3365104065356934,
"grad_norm": 1.1796875,
"learning_rate": 0.0004992459936953489,
"loss": 5.6975,
"mean_token_accuracy": 0.15465806424617767,
"num_tokens": 7514757.0,
"step": 4325
},
{
"entropy": 5.809590005874634,
"epoch": 0.336899435907411,
"grad_norm": 1.2265625,
"learning_rate": 0.0004992437248915032,
"loss": 5.7543,
"mean_token_accuracy": 0.14698707759380342,
"num_tokens": 7523912.0,
"step": 4330
},
{
"entropy": 5.772178649902344,
"epoch": 0.3372884652791286,
"grad_norm": 1.1875,
"learning_rate": 0.0004992414526851157,
"loss": 5.6248,
"mean_token_accuracy": 0.15759740620851517,
"num_tokens": 7532401.0,
"step": 4335
},
{
"entropy": 5.6291059970855715,
"epoch": 0.3376774946508461,
"grad_norm": 1.421875,
"learning_rate": 0.0004992391770762212,
"loss": 5.599,
"mean_token_accuracy": 0.15522923022508622,
"num_tokens": 7541257.0,
"step": 4340
},
{
"entropy": 5.672086715698242,
"epoch": 0.3380665240225637,
"grad_norm": 1.3046875,
"learning_rate": 0.000499236898064854,
"loss": 5.5396,
"mean_token_accuracy": 0.1525227814912796,
"num_tokens": 7549812.0,
"step": 4345
},
{
"entropy": 5.688179683685303,
"epoch": 0.3384555533942813,
"grad_norm": 1.2265625,
"learning_rate": 0.0004992346156510488,
"loss": 5.6406,
"mean_token_accuracy": 0.15223049223423005,
"num_tokens": 7559319.0,
"step": 4350
},
{
"entropy": 5.756983423233033,
"epoch": 0.3388445827659988,
"grad_norm": 1.1796875,
"learning_rate": 0.0004992323298348403,
"loss": 5.7759,
"mean_token_accuracy": 0.14724590629339218,
"num_tokens": 7567900.0,
"step": 4355
},
{
"entropy": 5.881202983856201,
"epoch": 0.3392336121377164,
"grad_norm": 1.2421875,
"learning_rate": 0.000499230040616263,
"loss": 5.7154,
"mean_token_accuracy": 0.1452577978372574,
"num_tokens": 7576163.0,
"step": 4360
},
{
"entropy": 5.70105996131897,
"epoch": 0.33962264150943394,
"grad_norm": 1.234375,
"learning_rate": 0.0004992277479953518,
"loss": 5.6286,
"mean_token_accuracy": 0.15342977792024612,
"num_tokens": 7584221.0,
"step": 4365
},
{
"entropy": 5.741499710083008,
"epoch": 0.34001167088115153,
"grad_norm": 1.2734375,
"learning_rate": 0.0004992254519721414,
"loss": 5.6279,
"mean_token_accuracy": 0.1542896419763565,
"num_tokens": 7593569.0,
"step": 4370
},
{
"entropy": 5.776559448242187,
"epoch": 0.3404007002528691,
"grad_norm": 1.2421875,
"learning_rate": 0.0004992231525466666,
"loss": 5.6975,
"mean_token_accuracy": 0.15335093662142754,
"num_tokens": 7602666.0,
"step": 4375
},
{
"entropy": 5.710270786285401,
"epoch": 0.34078972962458665,
"grad_norm": 1.2890625,
"learning_rate": 0.0004992208497189624,
"loss": 5.7656,
"mean_token_accuracy": 0.14594510644674302,
"num_tokens": 7611874.0,
"step": 4380
},
{
"entropy": 5.758926343917847,
"epoch": 0.34117875899630423,
"grad_norm": 1.265625,
"learning_rate": 0.0004992185434890637,
"loss": 5.7198,
"mean_token_accuracy": 0.15153981149196624,
"num_tokens": 7620385.0,
"step": 4385
},
{
"entropy": 5.837249088287353,
"epoch": 0.34156778836802176,
"grad_norm": 1.2421875,
"learning_rate": 0.0004992162338570055,
"loss": 5.7949,
"mean_token_accuracy": 0.13906663209199904,
"num_tokens": 7628786.0,
"step": 4390
},
{
"entropy": 5.7165384769439695,
"epoch": 0.34195681773973935,
"grad_norm": 1.1796875,
"learning_rate": 0.0004992139208228227,
"loss": 5.5799,
"mean_token_accuracy": 0.1546400859951973,
"num_tokens": 7637389.0,
"step": 4395
},
{
"entropy": 5.71855788230896,
"epoch": 0.34234584711145694,
"grad_norm": 1.515625,
"learning_rate": 0.0004992116043865506,
"loss": 5.7634,
"mean_token_accuracy": 0.14998725801706314,
"num_tokens": 7645793.0,
"step": 4400
},
{
"entropy": 5.859033393859863,
"epoch": 0.34273487648317447,
"grad_norm": 1.2890625,
"learning_rate": 0.0004992092845482244,
"loss": 5.6981,
"mean_token_accuracy": 0.15337317287921906,
"num_tokens": 7653951.0,
"step": 4405
},
{
"entropy": 5.665503597259521,
"epoch": 0.34312390585489205,
"grad_norm": 1.1640625,
"learning_rate": 0.0004992069613078791,
"loss": 5.5882,
"mean_token_accuracy": 0.1616547703742981,
"num_tokens": 7662753.0,
"step": 4410
},
{
"entropy": 5.646042823791504,
"epoch": 0.3435129352266096,
"grad_norm": 1.3046875,
"learning_rate": 0.0004992046346655499,
"loss": 5.5503,
"mean_token_accuracy": 0.15094086453318595,
"num_tokens": 7671832.0,
"step": 4415
},
{
"entropy": 5.803126287460327,
"epoch": 0.34390196459832717,
"grad_norm": 1.21875,
"learning_rate": 0.0004992023046212723,
"loss": 5.7209,
"mean_token_accuracy": 0.14602495953440667,
"num_tokens": 7680969.0,
"step": 4420
},
{
"entropy": 5.8474115371704105,
"epoch": 0.34429099397004476,
"grad_norm": 1.28125,
"learning_rate": 0.0004991999711750816,
"loss": 5.7295,
"mean_token_accuracy": 0.14345005601644517,
"num_tokens": 7689277.0,
"step": 4425
},
{
"entropy": 5.678358888626098,
"epoch": 0.3446800233417623,
"grad_norm": 1.296875,
"learning_rate": 0.0004991976343270133,
"loss": 5.6502,
"mean_token_accuracy": 0.15776083916425704,
"num_tokens": 7697373.0,
"step": 4430
},
{
"entropy": 5.839732694625854,
"epoch": 0.3450690527134799,
"grad_norm": 1.296875,
"learning_rate": 0.0004991952940771026,
"loss": 5.73,
"mean_token_accuracy": 0.1477728880941868,
"num_tokens": 7705767.0,
"step": 4435
},
{
"entropy": 5.745546770095825,
"epoch": 0.34545808208519746,
"grad_norm": 1.34375,
"learning_rate": 0.0004991929504253852,
"loss": 5.5992,
"mean_token_accuracy": 0.1563803017139435,
"num_tokens": 7713746.0,
"step": 4440
},
{
"entropy": 5.654825639724732,
"epoch": 0.345847111456915,
"grad_norm": 1.328125,
"learning_rate": 0.0004991906033718966,
"loss": 5.7396,
"mean_token_accuracy": 0.14519762098789216,
"num_tokens": 7721829.0,
"step": 4445
},
{
"entropy": 5.703803396224975,
"epoch": 0.3462361408286326,
"grad_norm": 1.21875,
"learning_rate": 0.0004991882529166724,
"loss": 5.6408,
"mean_token_accuracy": 0.15357706546783448,
"num_tokens": 7730479.0,
"step": 4450
},
{
"entropy": 5.735348558425903,
"epoch": 0.3466251702003501,
"grad_norm": 1.21875,
"learning_rate": 0.0004991858990597483,
"loss": 5.5983,
"mean_token_accuracy": 0.1547751769423485,
"num_tokens": 7738659.0,
"step": 4455
},
{
"entropy": 5.813489246368408,
"epoch": 0.3470141995720677,
"grad_norm": 1.2890625,
"learning_rate": 0.0004991835418011601,
"loss": 5.8591,
"mean_token_accuracy": 0.14898139089345933,
"num_tokens": 7747597.0,
"step": 4460
},
{
"entropy": 5.801498508453369,
"epoch": 0.3474032289437853,
"grad_norm": 1.25,
"learning_rate": 0.0004991811811409434,
"loss": 5.7076,
"mean_token_accuracy": 0.14893003180623055,
"num_tokens": 7756666.0,
"step": 4465
},
{
"entropy": 5.805731916427613,
"epoch": 0.3477922583155028,
"grad_norm": 1.2109375,
"learning_rate": 0.0004991788170791341,
"loss": 5.7394,
"mean_token_accuracy": 0.14709567725658418,
"num_tokens": 7765621.0,
"step": 4470
},
{
"entropy": 5.706645917892456,
"epoch": 0.3481812876872204,
"grad_norm": 1.234375,
"learning_rate": 0.0004991764496157682,
"loss": 5.633,
"mean_token_accuracy": 0.149008846282959,
"num_tokens": 7774137.0,
"step": 4475
},
{
"entropy": 5.792159605026245,
"epoch": 0.34857031705893793,
"grad_norm": 1.2265625,
"learning_rate": 0.0004991740787508814,
"loss": 5.7491,
"mean_token_accuracy": 0.14444359689950942,
"num_tokens": 7783144.0,
"step": 4480
},
{
"entropy": 5.792681503295898,
"epoch": 0.3489593464306555,
"grad_norm": 1.28125,
"learning_rate": 0.0004991717044845097,
"loss": 5.7591,
"mean_token_accuracy": 0.14241152629256248,
"num_tokens": 7791530.0,
"step": 4485
},
{
"entropy": 5.733056831359863,
"epoch": 0.3493483758023731,
"grad_norm": 1.2265625,
"learning_rate": 0.0004991693268166892,
"loss": 5.6294,
"mean_token_accuracy": 0.15588642954826354,
"num_tokens": 7800869.0,
"step": 4490
},
{
"entropy": 5.743151617050171,
"epoch": 0.34973740517409063,
"grad_norm": 1.2578125,
"learning_rate": 0.0004991669457474559,
"loss": 5.702,
"mean_token_accuracy": 0.15250983089208603,
"num_tokens": 7810201.0,
"step": 4495
},
{
"entropy": 5.70795955657959,
"epoch": 0.3501264345458082,
"grad_norm": 1.1796875,
"learning_rate": 0.0004991645612768461,
"loss": 5.6051,
"mean_token_accuracy": 0.15941296368837357,
"num_tokens": 7818529.0,
"step": 4500
},
{
"entropy": 5.727574253082276,
"epoch": 0.35051546391752575,
"grad_norm": 1.2421875,
"learning_rate": 0.0004991621734048958,
"loss": 5.6513,
"mean_token_accuracy": 0.15623073428869247,
"num_tokens": 7827254.0,
"step": 4505
},
{
"entropy": 5.767280435562133,
"epoch": 0.35090449328924334,
"grad_norm": 1.2109375,
"learning_rate": 0.0004991597821316415,
"loss": 5.6719,
"mean_token_accuracy": 0.15514668226242065,
"num_tokens": 7836437.0,
"step": 4510
},
{
"entropy": 5.724820709228515,
"epoch": 0.3512935226609609,
"grad_norm": 1.1875,
"learning_rate": 0.0004991573874571192,
"loss": 5.6718,
"mean_token_accuracy": 0.1533803641796112,
"num_tokens": 7844939.0,
"step": 4515
},
{
"entropy": 5.74892292022705,
"epoch": 0.35168255203267845,
"grad_norm": 1.25,
"learning_rate": 0.0004991549893813653,
"loss": 5.6687,
"mean_token_accuracy": 0.15008964389562607,
"num_tokens": 7852889.0,
"step": 4520
},
{
"entropy": 5.7785228252410885,
"epoch": 0.35207158140439604,
"grad_norm": 1.28125,
"learning_rate": 0.0004991525879044162,
"loss": 5.7899,
"mean_token_accuracy": 0.14683696180582045,
"num_tokens": 7861867.0,
"step": 4525
},
{
"entropy": 5.77210807800293,
"epoch": 0.35246061077611357,
"grad_norm": 1.328125,
"learning_rate": 0.0004991501830263084,
"loss": 5.6071,
"mean_token_accuracy": 0.15673087388277054,
"num_tokens": 7869343.0,
"step": 4530
},
{
"entropy": 5.753970432281494,
"epoch": 0.35284964014783116,
"grad_norm": 1.3125,
"learning_rate": 0.0004991477747470783,
"loss": 5.636,
"mean_token_accuracy": 0.15080263912677766,
"num_tokens": 7877142.0,
"step": 4535
},
{
"entropy": 5.708729314804077,
"epoch": 0.35323866951954874,
"grad_norm": 1.375,
"learning_rate": 0.0004991453630667625,
"loss": 5.6686,
"mean_token_accuracy": 0.15797902941703795,
"num_tokens": 7885183.0,
"step": 4540
},
{
"entropy": 5.585329294204712,
"epoch": 0.3536276988912663,
"grad_norm": 1.3828125,
"learning_rate": 0.0004991429479853976,
"loss": 5.4989,
"mean_token_accuracy": 0.16130374521017074,
"num_tokens": 7893848.0,
"step": 4545
},
{
"entropy": 5.697960329055786,
"epoch": 0.35401672826298386,
"grad_norm": 1.2578125,
"learning_rate": 0.0004991405295030202,
"loss": 5.6698,
"mean_token_accuracy": 0.15179314315319062,
"num_tokens": 7902438.0,
"step": 4550
},
{
"entropy": 5.731406307220459,
"epoch": 0.35440575763470145,
"grad_norm": 1.4375,
"learning_rate": 0.0004991381076196671,
"loss": 5.6484,
"mean_token_accuracy": 0.15274685472249985,
"num_tokens": 7910951.0,
"step": 4555
},
{
"entropy": 5.7294269561767575,
"epoch": 0.354794787006419,
"grad_norm": 1.328125,
"learning_rate": 0.0004991356823353748,
"loss": 5.7549,
"mean_token_accuracy": 0.1446766048669815,
"num_tokens": 7920375.0,
"step": 4560
},
{
"entropy": 5.696258449554444,
"epoch": 0.35518381637813656,
"grad_norm": 1.3203125,
"learning_rate": 0.0004991332536501804,
"loss": 5.6084,
"mean_token_accuracy": 0.159688700735569,
"num_tokens": 7928656.0,
"step": 4565
},
{
"entropy": 5.8622143268585205,
"epoch": 0.3555728457498541,
"grad_norm": 1.296875,
"learning_rate": 0.0004991308215641205,
"loss": 5.8611,
"mean_token_accuracy": 0.14252166226506233,
"num_tokens": 7936929.0,
"step": 4570
},
{
"entropy": 5.791495895385742,
"epoch": 0.3559618751215717,
"grad_norm": 1.2421875,
"learning_rate": 0.0004991283860772323,
"loss": 5.6697,
"mean_token_accuracy": 0.14830510020256044,
"num_tokens": 7945592.0,
"step": 4575
},
{
"entropy": 5.7066380977630615,
"epoch": 0.35635090449328927,
"grad_norm": 1.34375,
"learning_rate": 0.0004991259471895525,
"loss": 5.6207,
"mean_token_accuracy": 0.16197174191474914,
"num_tokens": 7953656.0,
"step": 4580
},
{
"entropy": 5.781188344955444,
"epoch": 0.3567399338650068,
"grad_norm": 1.3046875,
"learning_rate": 0.0004991235049011182,
"loss": 5.6767,
"mean_token_accuracy": 0.15540962666273117,
"num_tokens": 7962038.0,
"step": 4585
},
{
"entropy": 5.787206315994263,
"epoch": 0.3571289632367244,
"grad_norm": 1.28125,
"learning_rate": 0.0004991210592119663,
"loss": 5.7694,
"mean_token_accuracy": 0.14897529482841493,
"num_tokens": 7970338.0,
"step": 4590
},
{
"entropy": 5.7750184535980225,
"epoch": 0.3575179926084419,
"grad_norm": 1.3125,
"learning_rate": 0.0004991186101221342,
"loss": 5.6861,
"mean_token_accuracy": 0.15258906185626983,
"num_tokens": 7979173.0,
"step": 4595
},
{
"entropy": 5.662876081466675,
"epoch": 0.3579070219801595,
"grad_norm": 1.4609375,
"learning_rate": 0.000499116157631659,
"loss": 5.5678,
"mean_token_accuracy": 0.1568956859409809,
"num_tokens": 7987245.0,
"step": 4600
},
{
"entropy": 5.838749551773072,
"epoch": 0.3582960513518771,
"grad_norm": 1.4453125,
"learning_rate": 0.0004991137017405777,
"loss": 5.7822,
"mean_token_accuracy": 0.1373494178056717,
"num_tokens": 7995551.0,
"step": 4605
},
{
"entropy": 5.741954660415649,
"epoch": 0.3586850807235946,
"grad_norm": 1.265625,
"learning_rate": 0.0004991112424489277,
"loss": 5.5894,
"mean_token_accuracy": 0.1502602607011795,
"num_tokens": 8004069.0,
"step": 4610
},
{
"entropy": 5.668931388854981,
"epoch": 0.3590741100953122,
"grad_norm": 1.3046875,
"learning_rate": 0.0004991087797567462,
"loss": 5.6494,
"mean_token_accuracy": 0.15510962158441544,
"num_tokens": 8012537.0,
"step": 4615
},
{
"entropy": 5.768225383758545,
"epoch": 0.35946313946702974,
"grad_norm": 1.25,
"learning_rate": 0.0004991063136640709,
"loss": 5.6506,
"mean_token_accuracy": 0.15651883333921432,
"num_tokens": 8021387.0,
"step": 4620
},
{
"entropy": 5.744030857086182,
"epoch": 0.3598521688387473,
"grad_norm": 1.34375,
"learning_rate": 0.0004991038441709388,
"loss": 5.6207,
"mean_token_accuracy": 0.15271022394299508,
"num_tokens": 8030261.0,
"step": 4625
},
{
"entropy": 5.757571983337402,
"epoch": 0.3602411982104649,
"grad_norm": 1.265625,
"learning_rate": 0.0004991013712773877,
"loss": 5.6527,
"mean_token_accuracy": 0.15131479799747466,
"num_tokens": 8038161.0,
"step": 4630
},
{
"entropy": 5.704322004318238,
"epoch": 0.36063022758218244,
"grad_norm": 1.3359375,
"learning_rate": 0.0004990988949834549,
"loss": 5.7469,
"mean_token_accuracy": 0.15158456489443778,
"num_tokens": 8046340.0,
"step": 4635
},
{
"entropy": 5.742067337036133,
"epoch": 0.3610192569539,
"grad_norm": 1.3203125,
"learning_rate": 0.000499096415289178,
"loss": 5.6773,
"mean_token_accuracy": 0.15533811300992967,
"num_tokens": 8054997.0,
"step": 4640
},
{
"entropy": 5.707707309722901,
"epoch": 0.3614082863256176,
"grad_norm": 1.171875,
"learning_rate": 0.0004990939321945948,
"loss": 5.6061,
"mean_token_accuracy": 0.16247581839561462,
"num_tokens": 8063686.0,
"step": 4645
},
{
"entropy": 5.7515209197998045,
"epoch": 0.36179731569733514,
"grad_norm": 1.234375,
"learning_rate": 0.0004990914456997427,
"loss": 5.7188,
"mean_token_accuracy": 0.14975331276655196,
"num_tokens": 8072999.0,
"step": 4650
},
{
"entropy": 5.686860656738281,
"epoch": 0.36218634506905273,
"grad_norm": 1.28125,
"learning_rate": 0.0004990889558046598,
"loss": 5.5856,
"mean_token_accuracy": 0.1535652443766594,
"num_tokens": 8081596.0,
"step": 4655
},
{
"entropy": 5.735697031021118,
"epoch": 0.36257537444077026,
"grad_norm": 1.2578125,
"learning_rate": 0.0004990864625093836,
"loss": 5.8266,
"mean_token_accuracy": 0.14313812404870987,
"num_tokens": 8090948.0,
"step": 4660
},
{
"entropy": 5.772059965133667,
"epoch": 0.36296440381248785,
"grad_norm": 1.3046875,
"learning_rate": 0.0004990839658139519,
"loss": 5.8067,
"mean_token_accuracy": 0.14405996352434158,
"num_tokens": 8099445.0,
"step": 4665
},
{
"entropy": 5.783945560455322,
"epoch": 0.36335343318420543,
"grad_norm": 1.2265625,
"learning_rate": 0.0004990814657184028,
"loss": 5.6526,
"mean_token_accuracy": 0.14939153492450713,
"num_tokens": 8108119.0,
"step": 4670
},
{
"entropy": 5.717726993560791,
"epoch": 0.36374246255592296,
"grad_norm": 1.203125,
"learning_rate": 0.0004990789622227741,
"loss": 5.6631,
"mean_token_accuracy": 0.15249117463827133,
"num_tokens": 8117060.0,
"step": 4675
},
{
"entropy": 5.716911125183105,
"epoch": 0.36413149192764055,
"grad_norm": 1.6875,
"learning_rate": 0.0004990764553271038,
"loss": 5.6576,
"mean_token_accuracy": 0.15026922672986984,
"num_tokens": 8126229.0,
"step": 4680
},
{
"entropy": 5.766642808914185,
"epoch": 0.3645205212993581,
"grad_norm": 1.2890625,
"learning_rate": 0.0004990739450314299,
"loss": 5.6014,
"mean_token_accuracy": 0.16554867178201677,
"num_tokens": 8134694.0,
"step": 4685
},
{
"entropy": 5.680392742156982,
"epoch": 0.36490955067107567,
"grad_norm": 1.2421875,
"learning_rate": 0.0004990714313357906,
"loss": 5.6781,
"mean_token_accuracy": 0.1550322487950325,
"num_tokens": 8143329.0,
"step": 4690
},
{
"entropy": 5.740098524093628,
"epoch": 0.36529858004279325,
"grad_norm": 1.2578125,
"learning_rate": 0.000499068914240224,
"loss": 5.6661,
"mean_token_accuracy": 0.1539440505206585,
"num_tokens": 8151432.0,
"step": 4695
},
{
"entropy": 5.751394510269165,
"epoch": 0.3656876094145108,
"grad_norm": 1.28125,
"learning_rate": 0.0004990663937447682,
"loss": 5.6257,
"mean_token_accuracy": 0.14900294989347457,
"num_tokens": 8159677.0,
"step": 4700
},
{
"entropy": 5.672762489318847,
"epoch": 0.36607663878622837,
"grad_norm": 1.265625,
"learning_rate": 0.0004990638698494615,
"loss": 5.7057,
"mean_token_accuracy": 0.15114860534667968,
"num_tokens": 8168710.0,
"step": 4705
},
{
"entropy": 5.734380531311035,
"epoch": 0.3664656681579459,
"grad_norm": 1.1953125,
"learning_rate": 0.0004990613425543423,
"loss": 5.6783,
"mean_token_accuracy": 0.15022775977849961,
"num_tokens": 8177501.0,
"step": 4710
},
{
"entropy": 5.835424184799194,
"epoch": 0.3668546975296635,
"grad_norm": 1.296875,
"learning_rate": 0.0004990588118594487,
"loss": 5.7708,
"mean_token_accuracy": 0.14951381012797355,
"num_tokens": 8185791.0,
"step": 4715
},
{
"entropy": 5.801257944107055,
"epoch": 0.3672437269013811,
"grad_norm": 1.3671875,
"learning_rate": 0.0004990562777648194,
"loss": 5.7882,
"mean_token_accuracy": 0.14626498967409135,
"num_tokens": 8195020.0,
"step": 4720
},
{
"entropy": 5.712733125686645,
"epoch": 0.3676327562730986,
"grad_norm": 1.28125,
"learning_rate": 0.0004990537402704928,
"loss": 5.652,
"mean_token_accuracy": 0.1529953584074974,
"num_tokens": 8203540.0,
"step": 4725
},
{
"entropy": 5.784476709365845,
"epoch": 0.3680217856448162,
"grad_norm": 1.1953125,
"learning_rate": 0.0004990511993765071,
"loss": 5.6471,
"mean_token_accuracy": 0.14924908876419068,
"num_tokens": 8211985.0,
"step": 4730
},
{
"entropy": 5.748035717010498,
"epoch": 0.3684108150165337,
"grad_norm": 1.25,
"learning_rate": 0.0004990486550829011,
"loss": 5.7379,
"mean_token_accuracy": 0.15286693423986436,
"num_tokens": 8220289.0,
"step": 4735
},
{
"entropy": 5.825424718856811,
"epoch": 0.3687998443882513,
"grad_norm": 1.2109375,
"learning_rate": 0.0004990461073897134,
"loss": 5.7497,
"mean_token_accuracy": 0.14440721794962882,
"num_tokens": 8229652.0,
"step": 4740
},
{
"entropy": 5.832679271697998,
"epoch": 0.3691888737599689,
"grad_norm": 1.28125,
"learning_rate": 0.0004990435562969827,
"loss": 5.7509,
"mean_token_accuracy": 0.14374158829450606,
"num_tokens": 8237728.0,
"step": 4745
},
{
"entropy": 5.732454919815064,
"epoch": 0.3695779031316864,
"grad_norm": 1.2734375,
"learning_rate": 0.0004990410018047475,
"loss": 5.6361,
"mean_token_accuracy": 0.15370055437088012,
"num_tokens": 8246393.0,
"step": 4750
},
{
"entropy": 5.723031377792358,
"epoch": 0.369966932503404,
"grad_norm": 1.1953125,
"learning_rate": 0.0004990384439130467,
"loss": 5.6098,
"mean_token_accuracy": 0.1546899065375328,
"num_tokens": 8256736.0,
"step": 4755
},
{
"entropy": 5.770855712890625,
"epoch": 0.3703559618751216,
"grad_norm": 1.1953125,
"learning_rate": 0.0004990358826219192,
"loss": 5.6885,
"mean_token_accuracy": 0.15330916792154312,
"num_tokens": 8265126.0,
"step": 4760
},
{
"entropy": 5.6247711181640625,
"epoch": 0.37074499124683913,
"grad_norm": 1.2890625,
"learning_rate": 0.0004990333179314038,
"loss": 5.5857,
"mean_token_accuracy": 0.1569363385438919,
"num_tokens": 8273136.0,
"step": 4765
},
{
"entropy": 5.641842555999756,
"epoch": 0.3711340206185567,
"grad_norm": 1.265625,
"learning_rate": 0.0004990307498415393,
"loss": 5.5334,
"mean_token_accuracy": 0.15607051327824592,
"num_tokens": 8281697.0,
"step": 4770
},
{
"entropy": 5.676371383666992,
"epoch": 0.37152304999027425,
"grad_norm": 1.2734375,
"learning_rate": 0.0004990281783523648,
"loss": 5.6734,
"mean_token_accuracy": 0.15302693992853164,
"num_tokens": 8290765.0,
"step": 4775
},
{
"entropy": 5.817877292633057,
"epoch": 0.37191207936199183,
"grad_norm": 1.2734375,
"learning_rate": 0.0004990256034639192,
"loss": 5.7627,
"mean_token_accuracy": 0.14589882269501686,
"num_tokens": 8299875.0,
"step": 4780
},
{
"entropy": 5.781397914886474,
"epoch": 0.3723011087337094,
"grad_norm": 1.375,
"learning_rate": 0.0004990230251762418,
"loss": 5.6234,
"mean_token_accuracy": 0.15602398663759232,
"num_tokens": 8308515.0,
"step": 4785
},
{
"entropy": 5.635280561447144,
"epoch": 0.37269013810542695,
"grad_norm": 1.125,
"learning_rate": 0.0004990204434893713,
"loss": 5.5632,
"mean_token_accuracy": 0.16311416923999786,
"num_tokens": 8317260.0,
"step": 4790
},
{
"entropy": 5.789914894104004,
"epoch": 0.37307916747714454,
"grad_norm": 1.2265625,
"learning_rate": 0.0004990178584033474,
"loss": 5.7111,
"mean_token_accuracy": 0.14300042688846587,
"num_tokens": 8325887.0,
"step": 4795
},
{
"entropy": 5.82746148109436,
"epoch": 0.37346819684886207,
"grad_norm": 1.25,
"learning_rate": 0.0004990152699182089,
"loss": 5.7261,
"mean_token_accuracy": 0.13842646032571793,
"num_tokens": 8333974.0,
"step": 4800
},
{
"entropy": 5.683282423019409,
"epoch": 0.37385722622057965,
"grad_norm": 1.34375,
"learning_rate": 0.0004990126780339953,
"loss": 5.6969,
"mean_token_accuracy": 0.1456607311964035,
"num_tokens": 8343199.0,
"step": 4805
},
{
"entropy": 5.660903835296631,
"epoch": 0.37424625559229724,
"grad_norm": 1.21875,
"learning_rate": 0.0004990100827507459,
"loss": 5.4878,
"mean_token_accuracy": 0.15968211442232133,
"num_tokens": 8351202.0,
"step": 4810
},
{
"entropy": 5.794419288635254,
"epoch": 0.37463528496401477,
"grad_norm": 1.203125,
"learning_rate": 0.0004990074840684999,
"loss": 5.8265,
"mean_token_accuracy": 0.14525216594338416,
"num_tokens": 8360011.0,
"step": 4815
},
{
"entropy": 5.72889552116394,
"epoch": 0.37502431433573236,
"grad_norm": 1.3515625,
"learning_rate": 0.0004990048819872969,
"loss": 5.6967,
"mean_token_accuracy": 0.15121547728776932,
"num_tokens": 8367874.0,
"step": 4820
},
{
"entropy": 5.736692285537719,
"epoch": 0.3754133437074499,
"grad_norm": 1.328125,
"learning_rate": 0.0004990022765071765,
"loss": 5.6471,
"mean_token_accuracy": 0.15181145966053008,
"num_tokens": 8376708.0,
"step": 4825
},
{
"entropy": 5.776809597015381,
"epoch": 0.3758023730791675,
"grad_norm": 1.328125,
"learning_rate": 0.000498999667628178,
"loss": 5.6923,
"mean_token_accuracy": 0.15238475576043128,
"num_tokens": 8385467.0,
"step": 4830
},
{
"entropy": 5.693451023101806,
"epoch": 0.37619140245088506,
"grad_norm": 1.265625,
"learning_rate": 0.0004989970553503411,
"loss": 5.6671,
"mean_token_accuracy": 0.15169030725955962,
"num_tokens": 8393574.0,
"step": 4835
},
{
"entropy": 5.698660659790039,
"epoch": 0.3765804318226026,
"grad_norm": 1.2109375,
"learning_rate": 0.0004989944396737054,
"loss": 5.7057,
"mean_token_accuracy": 0.15399083346128464,
"num_tokens": 8402857.0,
"step": 4840
},
{
"entropy": 5.71474986076355,
"epoch": 0.3769694611943202,
"grad_norm": 1.28125,
"learning_rate": 0.0004989918205983106,
"loss": 5.6966,
"mean_token_accuracy": 0.16057430803775788,
"num_tokens": 8411728.0,
"step": 4845
},
{
"entropy": 5.776951026916504,
"epoch": 0.37735849056603776,
"grad_norm": 1.28125,
"learning_rate": 0.0004989891981241964,
"loss": 5.6816,
"mean_token_accuracy": 0.15508509129285813,
"num_tokens": 8420307.0,
"step": 4850
},
{
"entropy": 5.795963382720947,
"epoch": 0.3777475199377553,
"grad_norm": 1.2890625,
"learning_rate": 0.0004989865722514027,
"loss": 5.6859,
"mean_token_accuracy": 0.14701005667448044,
"num_tokens": 8429442.0,
"step": 4855
},
{
"entropy": 5.692721891403198,
"epoch": 0.3781365493094729,
"grad_norm": 1.203125,
"learning_rate": 0.0004989839429799692,
"loss": 5.5925,
"mean_token_accuracy": 0.15444754511117936,
"num_tokens": 8437945.0,
"step": 4860
},
{
"entropy": 5.69090576171875,
"epoch": 0.3785255786811904,
"grad_norm": 1.28125,
"learning_rate": 0.000498981310309936,
"loss": 5.5799,
"mean_token_accuracy": 0.1519486203789711,
"num_tokens": 8445743.0,
"step": 4865
},
{
"entropy": 5.673541116714477,
"epoch": 0.378914608052908,
"grad_norm": 1.28125,
"learning_rate": 0.0004989786742413428,
"loss": 5.6679,
"mean_token_accuracy": 0.14914161562919617,
"num_tokens": 8454091.0,
"step": 4870
},
{
"entropy": 5.828792095184326,
"epoch": 0.3793036374246256,
"grad_norm": 1.1953125,
"learning_rate": 0.0004989760347742298,
"loss": 5.6642,
"mean_token_accuracy": 0.148113676905632,
"num_tokens": 8461992.0,
"step": 4875
},
{
"entropy": 5.695930051803589,
"epoch": 0.3796926667963431,
"grad_norm": 1.2109375,
"learning_rate": 0.0004989733919086369,
"loss": 5.608,
"mean_token_accuracy": 0.1540228471159935,
"num_tokens": 8470730.0,
"step": 4880
},
{
"entropy": 5.694664525985718,
"epoch": 0.3800816961680607,
"grad_norm": 1.21875,
"learning_rate": 0.0004989707456446043,
"loss": 5.6546,
"mean_token_accuracy": 0.15131904631853105,
"num_tokens": 8479947.0,
"step": 4885
},
{
"entropy": 5.857856941223145,
"epoch": 0.38047072553977823,
"grad_norm": 1.2890625,
"learning_rate": 0.0004989680959821721,
"loss": 5.7356,
"mean_token_accuracy": 0.15022482126951217,
"num_tokens": 8488237.0,
"step": 4890
},
{
"entropy": 5.756908416748047,
"epoch": 0.3808597549114958,
"grad_norm": 1.203125,
"learning_rate": 0.0004989654429213805,
"loss": 5.5988,
"mean_token_accuracy": 0.15564934015274048,
"num_tokens": 8497146.0,
"step": 4895
},
{
"entropy": 5.723071098327637,
"epoch": 0.3812487842832134,
"grad_norm": 1.203125,
"learning_rate": 0.0004989627864622699,
"loss": 5.6833,
"mean_token_accuracy": 0.15712068229913712,
"num_tokens": 8505736.0,
"step": 4900
},
{
"entropy": 5.77219820022583,
"epoch": 0.38163781365493094,
"grad_norm": 1.234375,
"learning_rate": 0.0004989601266048804,
"loss": 5.6944,
"mean_token_accuracy": 0.15084800571203233,
"num_tokens": 8515368.0,
"step": 4905
},
{
"entropy": 5.703309774398804,
"epoch": 0.3820268430266485,
"grad_norm": 1.28125,
"learning_rate": 0.0004989574633492525,
"loss": 5.6671,
"mean_token_accuracy": 0.15129629224538804,
"num_tokens": 8524141.0,
"step": 4910
},
{
"entropy": 5.736749649047852,
"epoch": 0.38241587239836605,
"grad_norm": 1.21875,
"learning_rate": 0.0004989547966954266,
"loss": 5.5902,
"mean_token_accuracy": 0.15632274895906448,
"num_tokens": 8533116.0,
"step": 4915
},
{
"entropy": 5.701038837432861,
"epoch": 0.38280490177008364,
"grad_norm": 1.3046875,
"learning_rate": 0.000498952126643443,
"loss": 5.7171,
"mean_token_accuracy": 0.1558266080915928,
"num_tokens": 8541919.0,
"step": 4920
},
{
"entropy": 5.668884658813477,
"epoch": 0.3831939311418012,
"grad_norm": 1.234375,
"learning_rate": 0.0004989494531933424,
"loss": 5.6009,
"mean_token_accuracy": 0.15845879167318344,
"num_tokens": 8550372.0,
"step": 4925
},
{
"entropy": 5.705226564407349,
"epoch": 0.38358296051351876,
"grad_norm": 1.25,
"learning_rate": 0.0004989467763451652,
"loss": 5.6912,
"mean_token_accuracy": 0.15215400755405425,
"num_tokens": 8559246.0,
"step": 4930
},
{
"entropy": 5.691767168045044,
"epoch": 0.38397198988523634,
"grad_norm": 1.3046875,
"learning_rate": 0.0004989440960989523,
"loss": 5.4685,
"mean_token_accuracy": 0.16003949642181398,
"num_tokens": 8567005.0,
"step": 4935
},
{
"entropy": 5.635836219787597,
"epoch": 0.3843610192569539,
"grad_norm": 1.2109375,
"learning_rate": 0.000498941412454744,
"loss": 5.6521,
"mean_token_accuracy": 0.1453227147459984,
"num_tokens": 8575399.0,
"step": 4940
},
{
"entropy": 5.811139011383057,
"epoch": 0.38475004862867146,
"grad_norm": 1.265625,
"learning_rate": 0.0004989387254125813,
"loss": 5.7291,
"mean_token_accuracy": 0.14650810956954957,
"num_tokens": 8583994.0,
"step": 4945
},
{
"entropy": 5.760225105285644,
"epoch": 0.38513907800038905,
"grad_norm": 1.21875,
"learning_rate": 0.0004989360349725049,
"loss": 5.6496,
"mean_token_accuracy": 0.15658905506134033,
"num_tokens": 8593446.0,
"step": 4950
},
{
"entropy": 5.70222282409668,
"epoch": 0.3855281073721066,
"grad_norm": 1.28125,
"learning_rate": 0.0004989333411345555,
"loss": 5.6596,
"mean_token_accuracy": 0.15538214892148972,
"num_tokens": 8602821.0,
"step": 4955
},
{
"entropy": 5.706765222549438,
"epoch": 0.38591713674382416,
"grad_norm": 1.2890625,
"learning_rate": 0.0004989306438987742,
"loss": 5.7363,
"mean_token_accuracy": 0.15210612267255783,
"num_tokens": 8611831.0,
"step": 4960
},
{
"entropy": 5.772955226898193,
"epoch": 0.38630616611554175,
"grad_norm": 1.34375,
"learning_rate": 0.0004989279432652018,
"loss": 5.6422,
"mean_token_accuracy": 0.1529601663351059,
"num_tokens": 8620986.0,
"step": 4965
},
{
"entropy": 5.727062749862671,
"epoch": 0.3866951954872593,
"grad_norm": 1.28125,
"learning_rate": 0.0004989252392338791,
"loss": 5.5982,
"mean_token_accuracy": 0.15300055742263793,
"num_tokens": 8629822.0,
"step": 4970
},
{
"entropy": 5.673508405685425,
"epoch": 0.38708422485897687,
"grad_norm": 1.2890625,
"learning_rate": 0.0004989225318048475,
"loss": 5.6862,
"mean_token_accuracy": 0.1478674292564392,
"num_tokens": 8637679.0,
"step": 4975
},
{
"entropy": 5.793036079406738,
"epoch": 0.3874732542306944,
"grad_norm": 1.609375,
"learning_rate": 0.0004989198209781478,
"loss": 5.721,
"mean_token_accuracy": 0.14822040498256683,
"num_tokens": 8646705.0,
"step": 4980
},
{
"entropy": 5.799608898162842,
"epoch": 0.387862283602412,
"grad_norm": 1.234375,
"learning_rate": 0.0004989171067538211,
"loss": 5.6281,
"mean_token_accuracy": 0.15128099098801612,
"num_tokens": 8655599.0,
"step": 4985
},
{
"entropy": 5.635348701477051,
"epoch": 0.38825131297412957,
"grad_norm": 1.1796875,
"learning_rate": 0.000498914389131909,
"loss": 5.6514,
"mean_token_accuracy": 0.15804774016141893,
"num_tokens": 8665025.0,
"step": 4990
},
{
"entropy": 5.719934034347534,
"epoch": 0.3886403423458471,
"grad_norm": 1.4296875,
"learning_rate": 0.0004989116681124523,
"loss": 5.5337,
"mean_token_accuracy": 0.15749720931053163,
"num_tokens": 8672994.0,
"step": 4995
},
{
"entropy": 5.669281339645385,
"epoch": 0.3890293717175647,
"grad_norm": 1.2578125,
"learning_rate": 0.0004989089436954924,
"loss": 5.6883,
"mean_token_accuracy": 0.15234919488430024,
"num_tokens": 8682457.0,
"step": 5000
},
{
"entropy": 5.705449628829956,
"epoch": 0.3894184010892822,
"grad_norm": 1.28125,
"learning_rate": 0.0004989062158810706,
"loss": 5.662,
"mean_token_accuracy": 0.15314388871192933,
"num_tokens": 8690888.0,
"step": 5005
},
{
"entropy": 5.873299598693848,
"epoch": 0.3898074304609998,
"grad_norm": 1.3125,
"learning_rate": 0.0004989034846692284,
"loss": 5.7437,
"mean_token_accuracy": 0.15064525082707406,
"num_tokens": 8699632.0,
"step": 5010
},
{
"entropy": 5.6710282325744625,
"epoch": 0.3901964598327174,
"grad_norm": 1.3515625,
"learning_rate": 0.0004989007500600073,
"loss": 5.5879,
"mean_token_accuracy": 0.1571871817111969,
"num_tokens": 8707955.0,
"step": 5015
},
{
"entropy": 5.7133081436157225,
"epoch": 0.3905854892044349,
"grad_norm": 1.3984375,
"learning_rate": 0.0004988980120534486,
"loss": 5.737,
"mean_token_accuracy": 0.15538298040628434,
"num_tokens": 8716103.0,
"step": 5020
},
{
"entropy": 5.751881408691406,
"epoch": 0.3909745185761525,
"grad_norm": 1.3046875,
"learning_rate": 0.000498895270649594,
"loss": 5.5882,
"mean_token_accuracy": 0.16275588870048524,
"num_tokens": 8724499.0,
"step": 5025
},
{
"entropy": 5.674628114700317,
"epoch": 0.39136354794787004,
"grad_norm": 1.296875,
"learning_rate": 0.000498892525848485,
"loss": 5.6015,
"mean_token_accuracy": 0.15894443094730376,
"num_tokens": 8732829.0,
"step": 5030
},
{
"entropy": 5.611494064331055,
"epoch": 0.3917525773195876,
"grad_norm": 1.2734375,
"learning_rate": 0.0004988897776501633,
"loss": 5.465,
"mean_token_accuracy": 0.15986961871385574,
"num_tokens": 8741617.0,
"step": 5035
},
{
"entropy": 5.659196472167968,
"epoch": 0.3921416066913052,
"grad_norm": 1.1875,
"learning_rate": 0.0004988870260546705,
"loss": 5.467,
"mean_token_accuracy": 0.16652076989412307,
"num_tokens": 8750146.0,
"step": 5040
},
{
"entropy": 5.657342576980591,
"epoch": 0.39253063606302274,
"grad_norm": 1.2578125,
"learning_rate": 0.0004988842710620486,
"loss": 5.6448,
"mean_token_accuracy": 0.15352269858121873,
"num_tokens": 8758744.0,
"step": 5045
},
{
"entropy": 5.6410760402679445,
"epoch": 0.39291966543474033,
"grad_norm": 1.2265625,
"learning_rate": 0.0004988815126723391,
"loss": 5.6622,
"mean_token_accuracy": 0.15248211920261384,
"num_tokens": 8768219.0,
"step": 5050
},
{
"entropy": 5.785637426376343,
"epoch": 0.3933086948064579,
"grad_norm": 1.2421875,
"learning_rate": 0.0004988787508855841,
"loss": 5.6576,
"mean_token_accuracy": 0.1519287884235382,
"num_tokens": 8777047.0,
"step": 5055
},
{
"entropy": 5.642466020584107,
"epoch": 0.39369772417817545,
"grad_norm": 1.2734375,
"learning_rate": 0.0004988759857018253,
"loss": 5.5433,
"mean_token_accuracy": 0.15469427406787872,
"num_tokens": 8785918.0,
"step": 5060
},
{
"entropy": 5.631013011932373,
"epoch": 0.39408675354989303,
"grad_norm": 1.3046875,
"learning_rate": 0.0004988732171211048,
"loss": 5.6233,
"mean_token_accuracy": 0.14678166359663009,
"num_tokens": 8794253.0,
"step": 5065
},
{
"entropy": 5.76476469039917,
"epoch": 0.39447578292161056,
"grad_norm": 1.2734375,
"learning_rate": 0.0004988704451434644,
"loss": 5.6719,
"mean_token_accuracy": 0.16016739159822463,
"num_tokens": 8802352.0,
"step": 5070
},
{
"entropy": 5.78267993927002,
"epoch": 0.39486481229332815,
"grad_norm": 1.359375,
"learning_rate": 0.0004988676697689465,
"loss": 5.6242,
"mean_token_accuracy": 0.15009063333272935,
"num_tokens": 8810956.0,
"step": 5075
},
{
"entropy": 5.654299974441528,
"epoch": 0.39525384166504574,
"grad_norm": 1.2265625,
"learning_rate": 0.000498864890997593,
"loss": 5.5622,
"mean_token_accuracy": 0.1525967687368393,
"num_tokens": 8819062.0,
"step": 5080
},
{
"entropy": 5.7077337265014645,
"epoch": 0.39564287103676327,
"grad_norm": 1.3671875,
"learning_rate": 0.0004988621088294461,
"loss": 5.6572,
"mean_token_accuracy": 0.1502836376428604,
"num_tokens": 8827470.0,
"step": 5085
},
{
"entropy": 5.721915864944458,
"epoch": 0.39603190040848085,
"grad_norm": 1.3671875,
"learning_rate": 0.000498859323264548,
"loss": 5.6916,
"mean_token_accuracy": 0.15031601786613463,
"num_tokens": 8837003.0,
"step": 5090
},
{
"entropy": 5.713486862182617,
"epoch": 0.3964209297801984,
"grad_norm": 1.3203125,
"learning_rate": 0.000498856534302941,
"loss": 5.697,
"mean_token_accuracy": 0.14879803881049156,
"num_tokens": 8846605.0,
"step": 5095
},
{
"entropy": 5.79709038734436,
"epoch": 0.39680995915191597,
"grad_norm": 1.3046875,
"learning_rate": 0.0004988537419446673,
"loss": 5.7335,
"mean_token_accuracy": 0.14815959110856056,
"num_tokens": 8855232.0,
"step": 5100
},
{
"entropy": 5.755407381057739,
"epoch": 0.39719898852363356,
"grad_norm": 1.2734375,
"learning_rate": 0.0004988509461897694,
"loss": 5.6102,
"mean_token_accuracy": 0.16033030301332474,
"num_tokens": 8864176.0,
"step": 5105
},
{
"entropy": 5.733327960968017,
"epoch": 0.3975880178953511,
"grad_norm": 1.21875,
"learning_rate": 0.0004988481470382897,
"loss": 5.6897,
"mean_token_accuracy": 0.156675386428833,
"num_tokens": 8872671.0,
"step": 5110
},
{
"entropy": 5.610649251937867,
"epoch": 0.3979770472670687,
"grad_norm": 1.3203125,
"learning_rate": 0.0004988453444902708,
"loss": 5.6034,
"mean_token_accuracy": 0.1590520143508911,
"num_tokens": 8881316.0,
"step": 5115
},
{
"entropy": 5.760883426666259,
"epoch": 0.3983660766387862,
"grad_norm": 1.375,
"learning_rate": 0.0004988425385457549,
"loss": 5.719,
"mean_token_accuracy": 0.15436383709311485,
"num_tokens": 8890114.0,
"step": 5120
},
{
"entropy": 5.7600020408630375,
"epoch": 0.3987551060105038,
"grad_norm": 1.6171875,
"learning_rate": 0.0004988397292047848,
"loss": 5.6282,
"mean_token_accuracy": 0.15803250372409822,
"num_tokens": 8899598.0,
"step": 5125
},
{
"entropy": 5.609093189239502,
"epoch": 0.3991441353822214,
"grad_norm": 1.359375,
"learning_rate": 0.0004988369164674032,
"loss": 5.5068,
"mean_token_accuracy": 0.15966605246067048,
"num_tokens": 8908244.0,
"step": 5130
},
{
"entropy": 5.688562393188477,
"epoch": 0.3995331647539389,
"grad_norm": 1.3125,
"learning_rate": 0.0004988341003336526,
"loss": 5.5515,
"mean_token_accuracy": 0.1559025228023529,
"num_tokens": 8916280.0,
"step": 5135
},
{
"entropy": 5.735493183135986,
"epoch": 0.3999221941256565,
"grad_norm": 1.34375,
"learning_rate": 0.0004988312808035757,
"loss": 5.5901,
"mean_token_accuracy": 0.15177929475903512,
"num_tokens": 8923947.0,
"step": 5140
},
{
"entropy": 5.653040266036987,
"epoch": 0.400311223497374,
"grad_norm": 1.4296875,
"learning_rate": 0.0004988284578772155,
"loss": 5.6619,
"mean_token_accuracy": 0.14781947880983354,
"num_tokens": 8933374.0,
"step": 5145
},
{
"entropy": 5.672594928741455,
"epoch": 0.4007002528690916,
"grad_norm": 1.328125,
"learning_rate": 0.0004988256315546146,
"loss": 5.5607,
"mean_token_accuracy": 0.15781172960996628,
"num_tokens": 8941757.0,
"step": 5150
},
{
"entropy": 5.663328552246094,
"epoch": 0.4010892822408092,
"grad_norm": 1.265625,
"learning_rate": 0.0004988228018358161,
"loss": 5.4872,
"mean_token_accuracy": 0.15782520771026612,
"num_tokens": 8950128.0,
"step": 5155
},
{
"entropy": 5.73198447227478,
"epoch": 0.40147831161252673,
"grad_norm": 1.3828125,
"learning_rate": 0.0004988199687208628,
"loss": 5.6454,
"mean_token_accuracy": 0.14845688492059708,
"num_tokens": 8958939.0,
"step": 5160
},
{
"entropy": 5.774505949020385,
"epoch": 0.4018673409842443,
"grad_norm": 1.171875,
"learning_rate": 0.0004988171322097977,
"loss": 5.604,
"mean_token_accuracy": 0.15679994523525237,
"num_tokens": 8967519.0,
"step": 5165
},
{
"entropy": 5.595438528060913,
"epoch": 0.4022563703559619,
"grad_norm": 1.3125,
"learning_rate": 0.0004988142923026638,
"loss": 5.4646,
"mean_token_accuracy": 0.1620745465159416,
"num_tokens": 8976215.0,
"step": 5170
},
{
"entropy": 5.698001861572266,
"epoch": 0.40264539972767943,
"grad_norm": 1.359375,
"learning_rate": 0.0004988114489995044,
"loss": 5.7052,
"mean_token_accuracy": 0.14649326354265213,
"num_tokens": 8984060.0,
"step": 5175
},
{
"entropy": 5.712637948989868,
"epoch": 0.403034429099397,
"grad_norm": 1.28125,
"learning_rate": 0.0004988086023003624,
"loss": 5.6301,
"mean_token_accuracy": 0.15002061128616334,
"num_tokens": 8992301.0,
"step": 5180
},
{
"entropy": 5.742618560791016,
"epoch": 0.40342345847111455,
"grad_norm": 1.453125,
"learning_rate": 0.0004988057522052811,
"loss": 5.6659,
"mean_token_accuracy": 0.15351343005895615,
"num_tokens": 9000517.0,
"step": 5185
},
{
"entropy": 5.68753137588501,
"epoch": 0.40381248784283214,
"grad_norm": 1.4296875,
"learning_rate": 0.0004988028987143037,
"loss": 5.6106,
"mean_token_accuracy": 0.15389739722013474,
"num_tokens": 9008826.0,
"step": 5190
},
{
"entropy": 5.725468111038208,
"epoch": 0.4042015172145497,
"grad_norm": 1.2734375,
"learning_rate": 0.0004988000418274736,
"loss": 5.6164,
"mean_token_accuracy": 0.14825106114149095,
"num_tokens": 9017952.0,
"step": 5195
},
{
"entropy": 5.672607660293579,
"epoch": 0.40459054658626725,
"grad_norm": 1.234375,
"learning_rate": 0.0004987971815448341,
"loss": 5.6115,
"mean_token_accuracy": 0.15911526530981063,
"num_tokens": 9026688.0,
"step": 5200
},
{
"entropy": 5.678609228134155,
"epoch": 0.40497957595798484,
"grad_norm": 1.4296875,
"learning_rate": 0.0004987943178664285,
"loss": 5.5947,
"mean_token_accuracy": 0.1578623317182064,
"num_tokens": 9035761.0,
"step": 5205
},
{
"entropy": 5.737362957000732,
"epoch": 0.40536860532970237,
"grad_norm": 1.2890625,
"learning_rate": 0.0004987914507923004,
"loss": 5.7061,
"mean_token_accuracy": 0.1476090058684349,
"num_tokens": 9044510.0,
"step": 5210
},
{
"entropy": 5.624804878234864,
"epoch": 0.40575763470141996,
"grad_norm": 1.328125,
"learning_rate": 0.0004987885803224931,
"loss": 5.5507,
"mean_token_accuracy": 0.1544179081916809,
"num_tokens": 9053031.0,
"step": 5215
},
{
"entropy": 5.6066936492919925,
"epoch": 0.40614666407313754,
"grad_norm": 1.421875,
"learning_rate": 0.0004987857064570505,
"loss": 5.5451,
"mean_token_accuracy": 0.16021619886159896,
"num_tokens": 9061580.0,
"step": 5220
},
{
"entropy": 5.718929815292358,
"epoch": 0.4065356934448551,
"grad_norm": 1.2734375,
"learning_rate": 0.0004987828291960158,
"loss": 5.6634,
"mean_token_accuracy": 0.1563795655965805,
"num_tokens": 9069741.0,
"step": 5225
},
{
"entropy": 5.811468648910522,
"epoch": 0.40692472281657266,
"grad_norm": 1.25,
"learning_rate": 0.000498779948539433,
"loss": 5.6813,
"mean_token_accuracy": 0.143922408670187,
"num_tokens": 9079214.0,
"step": 5230
},
{
"entropy": 5.773811149597168,
"epoch": 0.4073137521882902,
"grad_norm": 1.1875,
"learning_rate": 0.0004987770644873455,
"loss": 5.6583,
"mean_token_accuracy": 0.15696950107812882,
"num_tokens": 9088201.0,
"step": 5235
},
{
"entropy": 5.716661548614502,
"epoch": 0.4077027815600078,
"grad_norm": 1.3359375,
"learning_rate": 0.0004987741770397974,
"loss": 5.6668,
"mean_token_accuracy": 0.14920853078365326,
"num_tokens": 9096829.0,
"step": 5240
},
{
"entropy": 5.703339910507202,
"epoch": 0.40809181093172536,
"grad_norm": 1.34375,
"learning_rate": 0.0004987712861968323,
"loss": 5.6269,
"mean_token_accuracy": 0.15427666306495666,
"num_tokens": 9105515.0,
"step": 5245
},
{
"entropy": 5.777084398269653,
"epoch": 0.4084808403034429,
"grad_norm": 1.4921875,
"learning_rate": 0.000498768391958494,
"loss": 5.6073,
"mean_token_accuracy": 0.15668865889310837,
"num_tokens": 9113614.0,
"step": 5250
},
{
"entropy": 5.712219905853272,
"epoch": 0.4088698696751605,
"grad_norm": 1.2734375,
"learning_rate": 0.0004987654943248266,
"loss": 5.697,
"mean_token_accuracy": 0.14341746270656586,
"num_tokens": 9122337.0,
"step": 5255
},
{
"entropy": 5.630028343200683,
"epoch": 0.40925889904687807,
"grad_norm": 1.421875,
"learning_rate": 0.0004987625932958739,
"loss": 5.5779,
"mean_token_accuracy": 0.15674022287130357,
"num_tokens": 9130417.0,
"step": 5260
},
{
"entropy": 5.7025354385375975,
"epoch": 0.4096479284185956,
"grad_norm": 1.2265625,
"learning_rate": 0.0004987596888716801,
"loss": 5.6483,
"mean_token_accuracy": 0.14859899282455444,
"num_tokens": 9139317.0,
"step": 5265
},
{
"entropy": 5.726134777069092,
"epoch": 0.4100369577903132,
"grad_norm": 1.3125,
"learning_rate": 0.0004987567810522892,
"loss": 5.626,
"mean_token_accuracy": 0.15348759293556213,
"num_tokens": 9147808.0,
"step": 5270
},
{
"entropy": 5.818262100219727,
"epoch": 0.4104259871620307,
"grad_norm": 1.1953125,
"learning_rate": 0.0004987538698377451,
"loss": 5.7377,
"mean_token_accuracy": 0.14077338203787804,
"num_tokens": 9157117.0,
"step": 5275
},
{
"entropy": 5.736328840255737,
"epoch": 0.4108150165337483,
"grad_norm": 1.25,
"learning_rate": 0.0004987509552280924,
"loss": 5.573,
"mean_token_accuracy": 0.15244077891111374,
"num_tokens": 9165297.0,
"step": 5280
},
{
"entropy": 5.708140563964844,
"epoch": 0.4112040459054659,
"grad_norm": 1.2578125,
"learning_rate": 0.000498748037223375,
"loss": 5.7137,
"mean_token_accuracy": 0.151723912358284,
"num_tokens": 9172945.0,
"step": 5285
},
{
"entropy": 5.745821762084961,
"epoch": 0.4115930752771834,
"grad_norm": 1.3359375,
"learning_rate": 0.0004987451158236372,
"loss": 5.6428,
"mean_token_accuracy": 0.15701709389686586,
"num_tokens": 9181445.0,
"step": 5290
},
{
"entropy": 5.605129194259644,
"epoch": 0.411982104648901,
"grad_norm": 1.34375,
"learning_rate": 0.0004987421910289234,
"loss": 5.4712,
"mean_token_accuracy": 0.1588175266981125,
"num_tokens": 9189535.0,
"step": 5295
},
{
"entropy": 5.649341869354248,
"epoch": 0.41237113402061853,
"grad_norm": 1.3203125,
"learning_rate": 0.0004987392628392781,
"loss": 5.6881,
"mean_token_accuracy": 0.15033083707094191,
"num_tokens": 9198328.0,
"step": 5300
},
{
"entropy": 5.740281772613526,
"epoch": 0.4127601633923361,
"grad_norm": 1.3359375,
"learning_rate": 0.0004987363312547456,
"loss": 5.6035,
"mean_token_accuracy": 0.1550357922911644,
"num_tokens": 9206840.0,
"step": 5305
},
{
"entropy": 5.686477708816528,
"epoch": 0.4131491927640537,
"grad_norm": 1.375,
"learning_rate": 0.0004987333962753703,
"loss": 5.5073,
"mean_token_accuracy": 0.1557457096874714,
"num_tokens": 9215155.0,
"step": 5310
},
{
"entropy": 5.689324522018433,
"epoch": 0.41353822213577124,
"grad_norm": 1.3125,
"learning_rate": 0.0004987304579011967,
"loss": 5.6741,
"mean_token_accuracy": 0.1526474580168724,
"num_tokens": 9224426.0,
"step": 5315
},
{
"entropy": 5.768082618713379,
"epoch": 0.4139272515074888,
"grad_norm": 1.421875,
"learning_rate": 0.0004987275161322697,
"loss": 5.6794,
"mean_token_accuracy": 0.1533222734928131,
"num_tokens": 9233785.0,
"step": 5320
},
{
"entropy": 5.695648050308227,
"epoch": 0.41431628087920636,
"grad_norm": 1.28125,
"learning_rate": 0.0004987245709686337,
"loss": 5.6307,
"mean_token_accuracy": 0.15449224412441254,
"num_tokens": 9242168.0,
"step": 5325
},
{
"entropy": 5.718257284164428,
"epoch": 0.41470531025092394,
"grad_norm": 1.25,
"learning_rate": 0.0004987216224103334,
"loss": 5.6645,
"mean_token_accuracy": 0.15255628675222396,
"num_tokens": 9250862.0,
"step": 5330
},
{
"entropy": 5.7047186374664305,
"epoch": 0.41509433962264153,
"grad_norm": 1.265625,
"learning_rate": 0.0004987186704574136,
"loss": 5.6741,
"mean_token_accuracy": 0.14798310920596122,
"num_tokens": 9259957.0,
"step": 5335
},
{
"entropy": 5.61541223526001,
"epoch": 0.41548336899435906,
"grad_norm": 1.3203125,
"learning_rate": 0.0004987157151099189,
"loss": 5.5546,
"mean_token_accuracy": 0.15545115619897842,
"num_tokens": 9268590.0,
"step": 5340
},
{
"entropy": 5.702762413024902,
"epoch": 0.41587239836607665,
"grad_norm": 1.3125,
"learning_rate": 0.0004987127563678945,
"loss": 5.6005,
"mean_token_accuracy": 0.15641995817422866,
"num_tokens": 9276872.0,
"step": 5345
},
{
"entropy": 5.679139614105225,
"epoch": 0.4162614277377942,
"grad_norm": 1.296875,
"learning_rate": 0.0004987097942313852,
"loss": 5.5116,
"mean_token_accuracy": 0.15718710869550706,
"num_tokens": 9284556.0,
"step": 5350
},
{
"entropy": 5.651728963851928,
"epoch": 0.41665045710951176,
"grad_norm": 1.28125,
"learning_rate": 0.0004987068287004355,
"loss": 5.6732,
"mean_token_accuracy": 0.15081616044044494,
"num_tokens": 9293315.0,
"step": 5355
},
{
"entropy": 5.773790979385376,
"epoch": 0.41703948648122935,
"grad_norm": 1.3046875,
"learning_rate": 0.0004987038597750909,
"loss": 5.6363,
"mean_token_accuracy": 0.15579553544521332,
"num_tokens": 9302923.0,
"step": 5360
},
{
"entropy": 5.722340250015259,
"epoch": 0.4174285158529469,
"grad_norm": 1.4140625,
"learning_rate": 0.0004987008874553964,
"loss": 5.5691,
"mean_token_accuracy": 0.1573861852288246,
"num_tokens": 9311388.0,
"step": 5365
},
{
"entropy": 5.6082155227661135,
"epoch": 0.41781754522466447,
"grad_norm": 1.3671875,
"learning_rate": 0.0004986979117413969,
"loss": 5.5166,
"mean_token_accuracy": 0.15783468931913375,
"num_tokens": 9319880.0,
"step": 5370
},
{
"entropy": 5.66514778137207,
"epoch": 0.41820657459638205,
"grad_norm": 2.390625,
"learning_rate": 0.0004986949326331376,
"loss": 5.6584,
"mean_token_accuracy": 0.15248090997338296,
"num_tokens": 9328374.0,
"step": 5375
},
{
"entropy": 5.7879310131073,
"epoch": 0.4185956039680996,
"grad_norm": 1.3984375,
"learning_rate": 0.0004986919501306638,
"loss": 5.6027,
"mean_token_accuracy": 0.16203720420598983,
"num_tokens": 9336428.0,
"step": 5380
},
{
"entropy": 5.629948520660401,
"epoch": 0.41898463333981717,
"grad_norm": 1.1640625,
"learning_rate": 0.0004986889642340207,
"loss": 5.7067,
"mean_token_accuracy": 0.15284340232610702,
"num_tokens": 9345794.0,
"step": 5385
},
{
"entropy": 5.776071500778198,
"epoch": 0.4193736627115347,
"grad_norm": 1.28125,
"learning_rate": 0.0004986859749432536,
"loss": 5.6636,
"mean_token_accuracy": 0.1524375021457672,
"num_tokens": 9354724.0,
"step": 5390
},
{
"entropy": 5.768964719772339,
"epoch": 0.4197626920832523,
"grad_norm": 1.328125,
"learning_rate": 0.0004986829822584078,
"loss": 5.6802,
"mean_token_accuracy": 0.1479766398668289,
"num_tokens": 9364008.0,
"step": 5395
},
{
"entropy": 5.72349443435669,
"epoch": 0.4201517214549699,
"grad_norm": 1.3125,
"learning_rate": 0.0004986799861795289,
"loss": 5.6363,
"mean_token_accuracy": 0.16576656699180603,
"num_tokens": 9372409.0,
"step": 5400
},
{
"entropy": 5.697003746032715,
"epoch": 0.4205407508266874,
"grad_norm": 1.3984375,
"learning_rate": 0.0004986769867066622,
"loss": 5.579,
"mean_token_accuracy": 0.15202543288469314,
"num_tokens": 9381172.0,
"step": 5405
},
{
"entropy": 5.68998646736145,
"epoch": 0.420929780198405,
"grad_norm": 1.484375,
"learning_rate": 0.0004986739838398532,
"loss": 5.6024,
"mean_token_accuracy": 0.16151912212371827,
"num_tokens": 9389245.0,
"step": 5410
},
{
"entropy": 5.710152196884155,
"epoch": 0.4213188095701225,
"grad_norm": 1.390625,
"learning_rate": 0.0004986709775791475,
"loss": 5.6409,
"mean_token_accuracy": 0.15243250578641893,
"num_tokens": 9397954.0,
"step": 5415
},
{
"entropy": 5.68855242729187,
"epoch": 0.4217078389418401,
"grad_norm": 1.265625,
"learning_rate": 0.0004986679679245907,
"loss": 5.7307,
"mean_token_accuracy": 0.14909764230251313,
"num_tokens": 9406986.0,
"step": 5420
},
{
"entropy": 5.755280351638794,
"epoch": 0.4220968683135577,
"grad_norm": 1.3125,
"learning_rate": 0.0004986649548762286,
"loss": 5.6857,
"mean_token_accuracy": 0.15256578773260115,
"num_tokens": 9415163.0,
"step": 5425
},
{
"entropy": 5.672216081619263,
"epoch": 0.4224858976852752,
"grad_norm": 1.234375,
"learning_rate": 0.0004986619384341066,
"loss": 5.5171,
"mean_token_accuracy": 0.1674740955233574,
"num_tokens": 9423422.0,
"step": 5430
},
{
"entropy": 5.641525936126709,
"epoch": 0.4228749270569928,
"grad_norm": 1.2578125,
"learning_rate": 0.0004986589185982708,
"loss": 5.554,
"mean_token_accuracy": 0.1703364595770836,
"num_tokens": 9431349.0,
"step": 5435
},
{
"entropy": 5.704486656188965,
"epoch": 0.42326395642871034,
"grad_norm": 1.5,
"learning_rate": 0.0004986558953687671,
"loss": 5.6504,
"mean_token_accuracy": 0.1514353260397911,
"num_tokens": 9439715.0,
"step": 5440
},
{
"entropy": 5.736121320724488,
"epoch": 0.42365298580042793,
"grad_norm": 1.2421875,
"learning_rate": 0.0004986528687456409,
"loss": 5.6528,
"mean_token_accuracy": 0.15465957820415496,
"num_tokens": 9448216.0,
"step": 5445
},
{
"entropy": 5.739035606384277,
"epoch": 0.4240420151721455,
"grad_norm": 1.3203125,
"learning_rate": 0.0004986498387289384,
"loss": 5.5811,
"mean_token_accuracy": 0.1586304396390915,
"num_tokens": 9456346.0,
"step": 5450
},
{
"entropy": 5.70108847618103,
"epoch": 0.42443104454386305,
"grad_norm": 1.2890625,
"learning_rate": 0.0004986468053187058,
"loss": 5.6537,
"mean_token_accuracy": 0.1538468062877655,
"num_tokens": 9465476.0,
"step": 5455
},
{
"entropy": 5.770843505859375,
"epoch": 0.42482007391558063,
"grad_norm": 1.21875,
"learning_rate": 0.0004986437685149887,
"loss": 5.7147,
"mean_token_accuracy": 0.1504819832742214,
"num_tokens": 9474582.0,
"step": 5460
},
{
"entropy": 5.699989891052246,
"epoch": 0.4252091032872982,
"grad_norm": 1.265625,
"learning_rate": 0.0004986407283178334,
"loss": 5.5785,
"mean_token_accuracy": 0.14940586686134338,
"num_tokens": 9482801.0,
"step": 5465
},
{
"entropy": 5.649980115890503,
"epoch": 0.42559813265901575,
"grad_norm": 1.3828125,
"learning_rate": 0.0004986376847272861,
"loss": 5.6356,
"mean_token_accuracy": 0.15340728610754012,
"num_tokens": 9490894.0,
"step": 5470
},
{
"entropy": 5.674148035049439,
"epoch": 0.42598716203073334,
"grad_norm": 1.28125,
"learning_rate": 0.0004986346377433929,
"loss": 5.5886,
"mean_token_accuracy": 0.155898617208004,
"num_tokens": 9499414.0,
"step": 5475
},
{
"entropy": 5.6370621681213375,
"epoch": 0.42637619140245087,
"grad_norm": 1.2734375,
"learning_rate": 0.0004986315873661999,
"loss": 5.5502,
"mean_token_accuracy": 0.15451737493276596,
"num_tokens": 9508945.0,
"step": 5480
},
{
"entropy": 5.727960109710693,
"epoch": 0.42676522077416845,
"grad_norm": 1.2890625,
"learning_rate": 0.0004986285335957536,
"loss": 5.6277,
"mean_token_accuracy": 0.1591019555926323,
"num_tokens": 9517833.0,
"step": 5485
},
{
"entropy": 5.782824993133545,
"epoch": 0.42715425014588604,
"grad_norm": 1.328125,
"learning_rate": 0.0004986254764321002,
"loss": 5.768,
"mean_token_accuracy": 0.14558715224266053,
"num_tokens": 9526551.0,
"step": 5490
},
{
"entropy": 5.6884478569030765,
"epoch": 0.42754327951760357,
"grad_norm": 1.1953125,
"learning_rate": 0.0004986224158752861,
"loss": 5.5169,
"mean_token_accuracy": 0.15997313857078552,
"num_tokens": 9535224.0,
"step": 5495
},
{
"entropy": 5.723999786376953,
"epoch": 0.42793230888932116,
"grad_norm": 1.2734375,
"learning_rate": 0.0004986193519253578,
"loss": 5.647,
"mean_token_accuracy": 0.14827475771307946,
"num_tokens": 9544466.0,
"step": 5500
},
{
"entropy": 5.652610635757446,
"epoch": 0.4283213382610387,
"grad_norm": 1.234375,
"learning_rate": 0.0004986162845823618,
"loss": 5.6416,
"mean_token_accuracy": 0.1531407952308655,
"num_tokens": 9553520.0,
"step": 5505
},
{
"entropy": 5.6986065864562985,
"epoch": 0.4287103676327563,
"grad_norm": 1.3203125,
"learning_rate": 0.0004986132138463446,
"loss": 5.5536,
"mean_token_accuracy": 0.1587995931506157,
"num_tokens": 9562053.0,
"step": 5510
},
{
"entropy": 5.650413608551025,
"epoch": 0.42909939700447386,
"grad_norm": 1.3125,
"learning_rate": 0.0004986101397173528,
"loss": 5.5361,
"mean_token_accuracy": 0.15939041525125502,
"num_tokens": 9570632.0,
"step": 5515
},
{
"entropy": 5.637784433364868,
"epoch": 0.4294884263761914,
"grad_norm": 1.28125,
"learning_rate": 0.000498607062195433,
"loss": 5.5628,
"mean_token_accuracy": 0.15918782651424407,
"num_tokens": 9578739.0,
"step": 5520
},
{
"entropy": 5.681663131713867,
"epoch": 0.429877455747909,
"grad_norm": 1.2109375,
"learning_rate": 0.000498603981280632,
"loss": 5.5821,
"mean_token_accuracy": 0.15625160336494445,
"num_tokens": 9587314.0,
"step": 5525
},
{
"entropy": 5.723372554779052,
"epoch": 0.4302664851196265,
"grad_norm": 1.40625,
"learning_rate": 0.0004986008969729964,
"loss": 5.6419,
"mean_token_accuracy": 0.15364105701446534,
"num_tokens": 9595954.0,
"step": 5530
},
{
"entropy": 5.693819379806518,
"epoch": 0.4306555144913441,
"grad_norm": 1.359375,
"learning_rate": 0.0004985978092725731,
"loss": 5.6581,
"mean_token_accuracy": 0.1521173059940338,
"num_tokens": 9604767.0,
"step": 5535
},
{
"entropy": 5.6503571510314945,
"epoch": 0.4310445438630617,
"grad_norm": 1.34375,
"learning_rate": 0.000498594718179409,
"loss": 5.5238,
"mean_token_accuracy": 0.15622634440660477,
"num_tokens": 9613173.0,
"step": 5540
},
{
"entropy": 5.711286640167236,
"epoch": 0.4314335732347792,
"grad_norm": 1.296875,
"learning_rate": 0.0004985916236935508,
"loss": 5.6142,
"mean_token_accuracy": 0.15553787499666213,
"num_tokens": 9622777.0,
"step": 5545
},
{
"entropy": 5.608004999160767,
"epoch": 0.4318226026064968,
"grad_norm": 1.359375,
"learning_rate": 0.0004985885258150458,
"loss": 5.548,
"mean_token_accuracy": 0.15261236429214478,
"num_tokens": 9631019.0,
"step": 5550
},
{
"entropy": 5.66903657913208,
"epoch": 0.43221163197821433,
"grad_norm": 1.1953125,
"learning_rate": 0.0004985854245439408,
"loss": 5.6201,
"mean_token_accuracy": 0.1510221004486084,
"num_tokens": 9639797.0,
"step": 5555
},
{
"entropy": 5.675737190246582,
"epoch": 0.4326006613499319,
"grad_norm": 1.3515625,
"learning_rate": 0.0004985823198802827,
"loss": 5.5886,
"mean_token_accuracy": 0.16301481425762177,
"num_tokens": 9648393.0,
"step": 5560
},
{
"entropy": 5.710528373718262,
"epoch": 0.4329896907216495,
"grad_norm": 1.4375,
"learning_rate": 0.0004985792118241188,
"loss": 5.5958,
"mean_token_accuracy": 0.15752308517694474,
"num_tokens": 9657260.0,
"step": 5565
},
{
"entropy": 5.668179178237915,
"epoch": 0.43337872009336703,
"grad_norm": 1.3359375,
"learning_rate": 0.0004985761003754961,
"loss": 5.6327,
"mean_token_accuracy": 0.16131462305784225,
"num_tokens": 9665883.0,
"step": 5570
},
{
"entropy": 5.726443815231323,
"epoch": 0.4337677494650846,
"grad_norm": 1.4140625,
"learning_rate": 0.0004985729855344622,
"loss": 5.6628,
"mean_token_accuracy": 0.15568624585866928,
"num_tokens": 9674100.0,
"step": 5575
},
{
"entropy": 5.669579696655274,
"epoch": 0.4341567788368022,
"grad_norm": 1.4296875,
"learning_rate": 0.000498569867301064,
"loss": 5.6411,
"mean_token_accuracy": 0.14948973059654236,
"num_tokens": 9683236.0,
"step": 5580
},
{
"entropy": 5.671548175811767,
"epoch": 0.43454580820851973,
"grad_norm": 1.3671875,
"learning_rate": 0.0004985667456753489,
"loss": 5.6118,
"mean_token_accuracy": 0.15591788440942764,
"num_tokens": 9692076.0,
"step": 5585
},
{
"entropy": 5.749252414703369,
"epoch": 0.4349348375802373,
"grad_norm": 1.1953125,
"learning_rate": 0.0004985636206573642,
"loss": 5.6574,
"mean_token_accuracy": 0.1567201316356659,
"num_tokens": 9700266.0,
"step": 5590
},
{
"entropy": 5.6495452404022215,
"epoch": 0.43532386695195485,
"grad_norm": 1.2265625,
"learning_rate": 0.0004985604922471575,
"loss": 5.5804,
"mean_token_accuracy": 0.15612577348947526,
"num_tokens": 9708643.0,
"step": 5595
},
{
"entropy": 5.722015714645385,
"epoch": 0.43571289632367244,
"grad_norm": 1.265625,
"learning_rate": 0.0004985573604447761,
"loss": 5.6391,
"mean_token_accuracy": 0.15270705446600913,
"num_tokens": 9717459.0,
"step": 5600
},
{
"entropy": 5.683666324615478,
"epoch": 0.43610192569539,
"grad_norm": 1.1875,
"learning_rate": 0.0004985542252502676,
"loss": 5.556,
"mean_token_accuracy": 0.15867960900068284,
"num_tokens": 9726251.0,
"step": 5605
},
{
"entropy": 5.572760534286499,
"epoch": 0.43649095506710756,
"grad_norm": 1.28125,
"learning_rate": 0.0004985510866636796,
"loss": 5.5414,
"mean_token_accuracy": 0.1563876047730446,
"num_tokens": 9735327.0,
"step": 5610
},
{
"entropy": 5.710997104644775,
"epoch": 0.43687998443882514,
"grad_norm": 1.2734375,
"learning_rate": 0.0004985479446850596,
"loss": 5.6939,
"mean_token_accuracy": 0.14747919738292695,
"num_tokens": 9743642.0,
"step": 5615
},
{
"entropy": 5.745656728744507,
"epoch": 0.4372690138105427,
"grad_norm": 1.2109375,
"learning_rate": 0.0004985447993144554,
"loss": 5.5575,
"mean_token_accuracy": 0.1631772004067898,
"num_tokens": 9752235.0,
"step": 5620
},
{
"entropy": 5.710186576843261,
"epoch": 0.43765804318226026,
"grad_norm": 1.21875,
"learning_rate": 0.0004985416505519147,
"loss": 5.6486,
"mean_token_accuracy": 0.14850047677755357,
"num_tokens": 9761012.0,
"step": 5625
},
{
"entropy": 5.664464712142944,
"epoch": 0.43804707255397785,
"grad_norm": 1.265625,
"learning_rate": 0.0004985384983974853,
"loss": 5.6143,
"mean_token_accuracy": 0.157231392711401,
"num_tokens": 9769810.0,
"step": 5630
},
{
"entropy": 5.700027561187744,
"epoch": 0.4384361019256954,
"grad_norm": 1.359375,
"learning_rate": 0.0004985353428512148,
"loss": 5.5438,
"mean_token_accuracy": 0.15658937096595765,
"num_tokens": 9778186.0,
"step": 5635
},
{
"entropy": 5.659540843963623,
"epoch": 0.43882513129741296,
"grad_norm": 1.2421875,
"learning_rate": 0.0004985321839131514,
"loss": 5.6229,
"mean_token_accuracy": 0.1591310068964958,
"num_tokens": 9786456.0,
"step": 5640
},
{
"entropy": 5.67944016456604,
"epoch": 0.4392141606691305,
"grad_norm": 1.2890625,
"learning_rate": 0.0004985290215833428,
"loss": 5.6157,
"mean_token_accuracy": 0.152775377035141,
"num_tokens": 9794613.0,
"step": 5645
},
{
"entropy": 5.751613807678223,
"epoch": 0.4396031900408481,
"grad_norm": 1.2734375,
"learning_rate": 0.0004985258558618372,
"loss": 5.5591,
"mean_token_accuracy": 0.15995817482471467,
"num_tokens": 9803388.0,
"step": 5650
},
{
"entropy": 5.620654487609864,
"epoch": 0.43999221941256567,
"grad_norm": 1.3359375,
"learning_rate": 0.0004985226867486825,
"loss": 5.6052,
"mean_token_accuracy": 0.16028854846954346,
"num_tokens": 9812450.0,
"step": 5655
},
{
"entropy": 5.6909432888031,
"epoch": 0.4403812487842832,
"grad_norm": 1.28125,
"learning_rate": 0.0004985195142439267,
"loss": 5.68,
"mean_token_accuracy": 0.15284086763858795,
"num_tokens": 9821377.0,
"step": 5660
},
{
"entropy": 5.7234701156616214,
"epoch": 0.4407702781560008,
"grad_norm": 1.4140625,
"learning_rate": 0.0004985163383476181,
"loss": 5.5778,
"mean_token_accuracy": 0.15479062795639037,
"num_tokens": 9829761.0,
"step": 5665
},
{
"entropy": 5.706999444961548,
"epoch": 0.44115930752771837,
"grad_norm": 1.359375,
"learning_rate": 0.0004985131590598048,
"loss": 5.6653,
"mean_token_accuracy": 0.14726217687129975,
"num_tokens": 9838921.0,
"step": 5670
},
{
"entropy": 5.646905469894409,
"epoch": 0.4415483368994359,
"grad_norm": 1.3125,
"learning_rate": 0.0004985099763805352,
"loss": 5.5007,
"mean_token_accuracy": 0.1659899964928627,
"num_tokens": 9846822.0,
"step": 5675
},
{
"entropy": 5.7456502437591555,
"epoch": 0.4419373662711535,
"grad_norm": 1.40625,
"learning_rate": 0.0004985067903098574,
"loss": 5.7295,
"mean_token_accuracy": 0.15629381388425828,
"num_tokens": 9855951.0,
"step": 5680
},
{
"entropy": 5.7572588443756105,
"epoch": 0.442326395642871,
"grad_norm": 1.28125,
"learning_rate": 0.0004985036008478197,
"loss": 5.6582,
"mean_token_accuracy": 0.15795501098036765,
"num_tokens": 9864875.0,
"step": 5685
},
{
"entropy": 5.738973951339721,
"epoch": 0.4427154250145886,
"grad_norm": 1.3359375,
"learning_rate": 0.0004985004079944707,
"loss": 5.6286,
"mean_token_accuracy": 0.1554968997836113,
"num_tokens": 9873785.0,
"step": 5690
},
{
"entropy": 5.714623546600341,
"epoch": 0.4431044543863062,
"grad_norm": 1.53125,
"learning_rate": 0.0004984972117498587,
"loss": 5.6291,
"mean_token_accuracy": 0.14927410408854486,
"num_tokens": 9883214.0,
"step": 5695
},
{
"entropy": 5.672214412689209,
"epoch": 0.4434934837580237,
"grad_norm": 1.546875,
"learning_rate": 0.0004984940121140323,
"loss": 5.6088,
"mean_token_accuracy": 0.15693314075469972,
"num_tokens": 9891346.0,
"step": 5700
},
{
"entropy": 5.637992000579834,
"epoch": 0.4438825131297413,
"grad_norm": 1.3515625,
"learning_rate": 0.00049849080908704,
"loss": 5.531,
"mean_token_accuracy": 0.15485147386789322,
"num_tokens": 9900646.0,
"step": 5705
},
{
"entropy": 5.71306209564209,
"epoch": 0.44427154250145884,
"grad_norm": 1.3515625,
"learning_rate": 0.0004984876026689302,
"loss": 5.6701,
"mean_token_accuracy": 0.15194630101323128,
"num_tokens": 9910851.0,
"step": 5710
},
{
"entropy": 5.784929990768433,
"epoch": 0.4446605718731764,
"grad_norm": 1.3359375,
"learning_rate": 0.000498484392859752,
"loss": 5.685,
"mean_token_accuracy": 0.15186055302619933,
"num_tokens": 9919919.0,
"step": 5715
},
{
"entropy": 5.767201137542725,
"epoch": 0.445049601244894,
"grad_norm": 1.40625,
"learning_rate": 0.0004984811796595538,
"loss": 5.6054,
"mean_token_accuracy": 0.15849266946315765,
"num_tokens": 9928831.0,
"step": 5720
},
{
"entropy": 5.662395191192627,
"epoch": 0.44543863061661154,
"grad_norm": 1.265625,
"learning_rate": 0.0004984779630683843,
"loss": 5.5571,
"mean_token_accuracy": 0.16009855270385742,
"num_tokens": 9936840.0,
"step": 5725
},
{
"entropy": 5.672893428802491,
"epoch": 0.44582765998832913,
"grad_norm": 1.203125,
"learning_rate": 0.0004984747430862924,
"loss": 5.647,
"mean_token_accuracy": 0.1535024493932724,
"num_tokens": 9945845.0,
"step": 5730
},
{
"entropy": 5.713797903060913,
"epoch": 0.44621668936004666,
"grad_norm": 1.328125,
"learning_rate": 0.0004984715197133271,
"loss": 5.6304,
"mean_token_accuracy": 0.1542983204126358,
"num_tokens": 9955176.0,
"step": 5735
},
{
"entropy": 5.6174845695495605,
"epoch": 0.44660571873176425,
"grad_norm": 1.34375,
"learning_rate": 0.0004984682929495371,
"loss": 5.5239,
"mean_token_accuracy": 0.16356904953718185,
"num_tokens": 9963182.0,
"step": 5740
},
{
"entropy": 5.703261232376098,
"epoch": 0.44699474810348183,
"grad_norm": 1.28125,
"learning_rate": 0.0004984650627949715,
"loss": 5.6546,
"mean_token_accuracy": 0.1533096879720688,
"num_tokens": 9971239.0,
"step": 5745
},
{
"entropy": 5.666077423095703,
"epoch": 0.44738377747519936,
"grad_norm": 1.25,
"learning_rate": 0.0004984618292496792,
"loss": 5.609,
"mean_token_accuracy": 0.1545335054397583,
"num_tokens": 9980285.0,
"step": 5750
},
{
"entropy": 5.693202304840088,
"epoch": 0.44777280684691695,
"grad_norm": 1.3515625,
"learning_rate": 0.0004984585923137093,
"loss": 5.6373,
"mean_token_accuracy": 0.15373781323432922,
"num_tokens": 9988922.0,
"step": 5755
},
{
"entropy": 5.741955804824829,
"epoch": 0.4481618362186345,
"grad_norm": 1.2734375,
"learning_rate": 0.000498455351987111,
"loss": 5.706,
"mean_token_accuracy": 0.14707285165786743,
"num_tokens": 9998538.0,
"step": 5760
},
{
"entropy": 5.788418865203857,
"epoch": 0.44855086559035207,
"grad_norm": 1.1953125,
"learning_rate": 0.0004984521082699333,
"loss": 5.6135,
"mean_token_accuracy": 0.15476753562688828,
"num_tokens": 10006646.0,
"step": 5765
},
{
"entropy": 5.661280012130737,
"epoch": 0.44893989496206965,
"grad_norm": 1.328125,
"learning_rate": 0.0004984488611622256,
"loss": 5.6027,
"mean_token_accuracy": 0.15705500692129135,
"num_tokens": 10016511.0,
"step": 5770
},
{
"entropy": 5.636836957931519,
"epoch": 0.4493289243337872,
"grad_norm": 1.2109375,
"learning_rate": 0.000498445610664037,
"loss": 5.4999,
"mean_token_accuracy": 0.1614679366350174,
"num_tokens": 10025223.0,
"step": 5775
},
{
"entropy": 5.649578857421875,
"epoch": 0.44971795370550477,
"grad_norm": 1.265625,
"learning_rate": 0.000498442356775417,
"loss": 5.5849,
"mean_token_accuracy": 0.15652598887681962,
"num_tokens": 10033678.0,
"step": 5780
},
{
"entropy": 5.66576738357544,
"epoch": 0.45010698307722236,
"grad_norm": 1.3203125,
"learning_rate": 0.0004984390994964148,
"loss": 5.4934,
"mean_token_accuracy": 0.15820170938968658,
"num_tokens": 10042028.0,
"step": 5785
},
{
"entropy": 5.672802352905274,
"epoch": 0.4504960124489399,
"grad_norm": 1.234375,
"learning_rate": 0.00049843583882708,
"loss": 5.6915,
"mean_token_accuracy": 0.1554969623684883,
"num_tokens": 10050758.0,
"step": 5790
},
{
"entropy": 5.641775178909302,
"epoch": 0.4508850418206575,
"grad_norm": 1.265625,
"learning_rate": 0.000498432574767462,
"loss": 5.4427,
"mean_token_accuracy": 0.16750287264585495,
"num_tokens": 10058688.0,
"step": 5795
},
{
"entropy": 5.644252109527588,
"epoch": 0.451274071192375,
"grad_norm": 1.234375,
"learning_rate": 0.0004984293073176103,
"loss": 5.5453,
"mean_token_accuracy": 0.1645413100719452,
"num_tokens": 10067302.0,
"step": 5800
},
{
"entropy": 5.5666821002960205,
"epoch": 0.4516631005640926,
"grad_norm": 1.21875,
"learning_rate": 0.0004984260364775744,
"loss": 5.5331,
"mean_token_accuracy": 0.15917521715164185,
"num_tokens": 10076424.0,
"step": 5805
},
{
"entropy": 5.724156904220581,
"epoch": 0.4520521299358102,
"grad_norm": 1.203125,
"learning_rate": 0.000498422762247404,
"loss": 5.6703,
"mean_token_accuracy": 0.14797478914260864,
"num_tokens": 10086307.0,
"step": 5810
},
{
"entropy": 5.696759462356567,
"epoch": 0.4524411593075277,
"grad_norm": 1.265625,
"learning_rate": 0.0004984194846271489,
"loss": 5.5395,
"mean_token_accuracy": 0.1550739273428917,
"num_tokens": 10094954.0,
"step": 5815
},
{
"entropy": 5.609128522872925,
"epoch": 0.4528301886792453,
"grad_norm": 1.2890625,
"learning_rate": 0.0004984162036168586,
"loss": 5.628,
"mean_token_accuracy": 0.15431981831789016,
"num_tokens": 10104401.0,
"step": 5820
},
{
"entropy": 5.638042354583741,
"epoch": 0.4532192180509628,
"grad_norm": 1.2890625,
"learning_rate": 0.0004984129192165831,
"loss": 5.625,
"mean_token_accuracy": 0.16010936647653579,
"num_tokens": 10112596.0,
"step": 5825
},
{
"entropy": 5.729681921005249,
"epoch": 0.4536082474226804,
"grad_norm": 1.3203125,
"learning_rate": 0.0004984096314263722,
"loss": 5.6688,
"mean_token_accuracy": 0.1558495357632637,
"num_tokens": 10121311.0,
"step": 5830
},
{
"entropy": 5.574494218826294,
"epoch": 0.453997276794398,
"grad_norm": 1.2421875,
"learning_rate": 0.0004984063402462757,
"loss": 5.468,
"mean_token_accuracy": 0.16243041604757308,
"num_tokens": 10130010.0,
"step": 5835
},
{
"entropy": 5.605675840377808,
"epoch": 0.45438630616611553,
"grad_norm": 1.2734375,
"learning_rate": 0.0004984030456763435,
"loss": 5.5912,
"mean_token_accuracy": 0.1590662494301796,
"num_tokens": 10138473.0,
"step": 5840
},
{
"entropy": 5.8279444694519045,
"epoch": 0.4547753355378331,
"grad_norm": 1.2890625,
"learning_rate": 0.0004983997477166257,
"loss": 5.651,
"mean_token_accuracy": 0.15664980113506316,
"num_tokens": 10146843.0,
"step": 5845
},
{
"entropy": 5.584151268005371,
"epoch": 0.45516436490955064,
"grad_norm": 1.2890625,
"learning_rate": 0.0004983964463671723,
"loss": 5.5015,
"mean_token_accuracy": 0.16206508874893188,
"num_tokens": 10155319.0,
"step": 5850
},
{
"entropy": 5.641605281829834,
"epoch": 0.45555339428126823,
"grad_norm": 1.375,
"learning_rate": 0.0004983931416280334,
"loss": 5.6853,
"mean_token_accuracy": 0.14777326062321663,
"num_tokens": 10164308.0,
"step": 5855
},
{
"entropy": 5.776509571075439,
"epoch": 0.4559424236529858,
"grad_norm": 1.296875,
"learning_rate": 0.0004983898334992591,
"loss": 5.7025,
"mean_token_accuracy": 0.1513962298631668,
"num_tokens": 10173173.0,
"step": 5860
},
{
"entropy": 5.691646337509155,
"epoch": 0.45633145302470335,
"grad_norm": 1.3984375,
"learning_rate": 0.0004983865219808998,
"loss": 5.6123,
"mean_token_accuracy": 0.15464477241039276,
"num_tokens": 10181376.0,
"step": 5865
},
{
"entropy": 5.724706697463989,
"epoch": 0.45672048239642093,
"grad_norm": 1.3046875,
"learning_rate": 0.0004983832070730055,
"loss": 5.6959,
"mean_token_accuracy": 0.1563864156603813,
"num_tokens": 10189701.0,
"step": 5870
},
{
"entropy": 5.710652160644531,
"epoch": 0.4571095117681385,
"grad_norm": 1.3828125,
"learning_rate": 0.0004983798887756265,
"loss": 5.5836,
"mean_token_accuracy": 0.1592947706580162,
"num_tokens": 10198721.0,
"step": 5875
},
{
"entropy": 5.672290182113647,
"epoch": 0.45749854113985605,
"grad_norm": 1.359375,
"learning_rate": 0.0004983765670888133,
"loss": 5.4761,
"mean_token_accuracy": 0.16269083470106124,
"num_tokens": 10206428.0,
"step": 5880
},
{
"entropy": 5.562413501739502,
"epoch": 0.45788757051157364,
"grad_norm": 1.296875,
"learning_rate": 0.0004983732420126163,
"loss": 5.6116,
"mean_token_accuracy": 0.15439745485782624,
"num_tokens": 10214941.0,
"step": 5885
},
{
"entropy": 5.67099027633667,
"epoch": 0.45827659988329117,
"grad_norm": 1.28125,
"learning_rate": 0.0004983699135470858,
"loss": 5.6174,
"mean_token_accuracy": 0.16162062734365462,
"num_tokens": 10223491.0,
"step": 5890
},
{
"entropy": 5.720311975479126,
"epoch": 0.45866562925500876,
"grad_norm": 1.3671875,
"learning_rate": 0.0004983665816922723,
"loss": 5.5396,
"mean_token_accuracy": 0.15808571577072145,
"num_tokens": 10231820.0,
"step": 5895
},
{
"entropy": 5.61470627784729,
"epoch": 0.45905465862672634,
"grad_norm": 1.265625,
"learning_rate": 0.0004983632464482267,
"loss": 5.536,
"mean_token_accuracy": 0.16108897626399993,
"num_tokens": 10239781.0,
"step": 5900
},
{
"entropy": 5.635873746871948,
"epoch": 0.4594436879984439,
"grad_norm": 1.328125,
"learning_rate": 0.0004983599078149991,
"loss": 5.5609,
"mean_token_accuracy": 0.16366778314113617,
"num_tokens": 10248093.0,
"step": 5905
},
{
"entropy": 5.69731912612915,
"epoch": 0.45983271737016146,
"grad_norm": 1.3046875,
"learning_rate": 0.0004983565657926405,
"loss": 5.5878,
"mean_token_accuracy": 0.1563509926199913,
"num_tokens": 10256370.0,
"step": 5910
},
{
"entropy": 5.619994688034057,
"epoch": 0.460221746741879,
"grad_norm": 1.25,
"learning_rate": 0.0004983532203812017,
"loss": 5.5593,
"mean_token_accuracy": 0.1569221630692482,
"num_tokens": 10264924.0,
"step": 5915
},
{
"entropy": 5.630159044265747,
"epoch": 0.4606107761135966,
"grad_norm": 1.3984375,
"learning_rate": 0.0004983498715807331,
"loss": 5.5033,
"mean_token_accuracy": 0.160485377907753,
"num_tokens": 10273488.0,
"step": 5920
},
{
"entropy": 5.672831010818482,
"epoch": 0.46099980548531416,
"grad_norm": 1.3125,
"learning_rate": 0.0004983465193912857,
"loss": 5.5644,
"mean_token_accuracy": 0.1572013482451439,
"num_tokens": 10281534.0,
"step": 5925
},
{
"entropy": 5.719956016540527,
"epoch": 0.4613888348570317,
"grad_norm": 1.3359375,
"learning_rate": 0.0004983431638129104,
"loss": 5.6069,
"mean_token_accuracy": 0.15728743895888328,
"num_tokens": 10289613.0,
"step": 5930
},
{
"entropy": 5.74925742149353,
"epoch": 0.4617778642287493,
"grad_norm": 1.375,
"learning_rate": 0.0004983398048456581,
"loss": 5.6668,
"mean_token_accuracy": 0.15779462456703186,
"num_tokens": 10299027.0,
"step": 5935
},
{
"entropy": 5.748346519470215,
"epoch": 0.4621668936004668,
"grad_norm": 1.296875,
"learning_rate": 0.0004983364424895796,
"loss": 5.6219,
"mean_token_accuracy": 0.15128087997436523,
"num_tokens": 10308727.0,
"step": 5940
},
{
"entropy": 5.716321325302124,
"epoch": 0.4625559229721844,
"grad_norm": 1.28125,
"learning_rate": 0.0004983330767447262,
"loss": 5.6393,
"mean_token_accuracy": 0.15531712099909784,
"num_tokens": 10318129.0,
"step": 5945
},
{
"entropy": 5.6274834156036375,
"epoch": 0.462944952343902,
"grad_norm": 1.3125,
"learning_rate": 0.0004983297076111489,
"loss": 5.494,
"mean_token_accuracy": 0.1664715051651001,
"num_tokens": 10326504.0,
"step": 5950
},
{
"entropy": 5.549721384048462,
"epoch": 0.4633339817156195,
"grad_norm": 1.34375,
"learning_rate": 0.0004983263350888987,
"loss": 5.5596,
"mean_token_accuracy": 0.16194145381450653,
"num_tokens": 10334585.0,
"step": 5955
},
{
"entropy": 5.6667708396911625,
"epoch": 0.4637230110873371,
"grad_norm": 1.3359375,
"learning_rate": 0.0004983229591780268,
"loss": 5.5495,
"mean_token_accuracy": 0.1623869687318802,
"num_tokens": 10343328.0,
"step": 5960
},
{
"entropy": 5.665079545974732,
"epoch": 0.46411204045905463,
"grad_norm": 1.265625,
"learning_rate": 0.0004983195798785844,
"loss": 5.5816,
"mean_token_accuracy": 0.15681301951408386,
"num_tokens": 10352289.0,
"step": 5965
},
{
"entropy": 5.705914878845215,
"epoch": 0.4645010698307722,
"grad_norm": 1.3984375,
"learning_rate": 0.0004983161971906228,
"loss": 5.6951,
"mean_token_accuracy": 0.14757215976715088,
"num_tokens": 10360847.0,
"step": 5970
},
{
"entropy": 5.761966180801392,
"epoch": 0.4648900992024898,
"grad_norm": 1.375,
"learning_rate": 0.0004983128111141935,
"loss": 5.6165,
"mean_token_accuracy": 0.1592383563518524,
"num_tokens": 10368911.0,
"step": 5975
},
{
"entropy": 5.662771272659302,
"epoch": 0.46527912857420733,
"grad_norm": 1.28125,
"learning_rate": 0.0004983094216493475,
"loss": 5.5573,
"mean_token_accuracy": 0.16440646350383759,
"num_tokens": 10377257.0,
"step": 5980
},
{
"entropy": 5.601254081726074,
"epoch": 0.4656681579459249,
"grad_norm": 1.3671875,
"learning_rate": 0.0004983060287961367,
"loss": 5.6192,
"mean_token_accuracy": 0.15791454762220383,
"num_tokens": 10386167.0,
"step": 5985
},
{
"entropy": 5.633698558807373,
"epoch": 0.4660571873176425,
"grad_norm": 1.203125,
"learning_rate": 0.0004983026325546123,
"loss": 5.5035,
"mean_token_accuracy": 0.1562596693634987,
"num_tokens": 10395802.0,
"step": 5990
},
{
"entropy": 5.68686261177063,
"epoch": 0.46644621668936004,
"grad_norm": 1.4921875,
"learning_rate": 0.0004982992329248257,
"loss": 5.6341,
"mean_token_accuracy": 0.15112658590078354,
"num_tokens": 10404836.0,
"step": 5995
},
{
"entropy": 5.764874982833862,
"epoch": 0.4668352460610776,
"grad_norm": 1.2734375,
"learning_rate": 0.0004982958299068289,
"loss": 5.623,
"mean_token_accuracy": 0.15592485070228576,
"num_tokens": 10413394.0,
"step": 6000
},
{
"epoch": 0.4668352460610776,
"eval_entropy": 5.559448653855384,
"eval_loss": 5.644718647003174,
"eval_mean_token_accuracy": 0.16176202593584607,
"eval_num_tokens": 10413394.0,
"eval_runtime": 28.4474,
"eval_samples_per_second": 1460.874,
"eval_steps_per_second": 182.618,
"step": 6000
},
{
"entropy": 5.599856758117676,
"epoch": 0.46722427543279516,
"grad_norm": 1.390625,
"learning_rate": 0.000498292423500673,
"loss": 5.5164,
"mean_token_accuracy": 0.16224406957626342,
"num_tokens": 10421916.0,
"step": 6005
},
{
"entropy": 5.646891021728516,
"epoch": 0.46761330480451274,
"grad_norm": 1.3203125,
"learning_rate": 0.0004982890137064102,
"loss": 5.582,
"mean_token_accuracy": 0.15907793641090393,
"num_tokens": 10430703.0,
"step": 6010
},
{
"entropy": 5.743211698532105,
"epoch": 0.46800233417623033,
"grad_norm": 1.3203125,
"learning_rate": 0.000498285600524092,
"loss": 5.6429,
"mean_token_accuracy": 0.1553155668079853,
"num_tokens": 10439523.0,
"step": 6015
},
{
"entropy": 5.683924865722656,
"epoch": 0.46839136354794786,
"grad_norm": 1.5390625,
"learning_rate": 0.0004982821839537701,
"loss": 5.5435,
"mean_token_accuracy": 0.1604115754365921,
"num_tokens": 10447777.0,
"step": 6020
},
{
"entropy": 5.6141105651855465,
"epoch": 0.46878039291966545,
"grad_norm": 1.3203125,
"learning_rate": 0.0004982787639954966,
"loss": 5.5246,
"mean_token_accuracy": 0.1618039131164551,
"num_tokens": 10456105.0,
"step": 6025
},
{
"entropy": 5.640907192230225,
"epoch": 0.469169422291383,
"grad_norm": 1.3359375,
"learning_rate": 0.0004982753406493232,
"loss": 5.5704,
"mean_token_accuracy": 0.159077899903059,
"num_tokens": 10464590.0,
"step": 6030
},
{
"entropy": 5.687194967269898,
"epoch": 0.46955845166310056,
"grad_norm": 1.5078125,
"learning_rate": 0.0004982719139153018,
"loss": 5.5938,
"mean_token_accuracy": 0.1523827828466892,
"num_tokens": 10472702.0,
"step": 6035
},
{
"entropy": 5.57777214050293,
"epoch": 0.46994748103481815,
"grad_norm": 1.3125,
"learning_rate": 0.0004982684837934845,
"loss": 5.5136,
"mean_token_accuracy": 0.1578451305627823,
"num_tokens": 10480682.0,
"step": 6040
},
{
"entropy": 5.688637924194336,
"epoch": 0.4703365104065357,
"grad_norm": 1.3359375,
"learning_rate": 0.0004982650502839234,
"loss": 5.6146,
"mean_token_accuracy": 0.15147078782320023,
"num_tokens": 10488873.0,
"step": 6045
},
{
"entropy": 5.66636176109314,
"epoch": 0.47072553977825327,
"grad_norm": 1.2265625,
"learning_rate": 0.0004982616133866705,
"loss": 5.5789,
"mean_token_accuracy": 0.16179264783859254,
"num_tokens": 10497077.0,
"step": 6050
},
{
"entropy": 5.681707859039307,
"epoch": 0.4711145691499708,
"grad_norm": 1.2734375,
"learning_rate": 0.0004982581731017779,
"loss": 5.5575,
"mean_token_accuracy": 0.15877941399812698,
"num_tokens": 10506072.0,
"step": 6055
},
{
"entropy": 5.718855381011963,
"epoch": 0.4715035985216884,
"grad_norm": 1.34375,
"learning_rate": 0.0004982547294292979,
"loss": 5.6207,
"mean_token_accuracy": 0.15153614282608033,
"num_tokens": 10515175.0,
"step": 6060
},
{
"entropy": 5.605925559997559,
"epoch": 0.47189262789340597,
"grad_norm": 1.3515625,
"learning_rate": 0.0004982512823692828,
"loss": 5.508,
"mean_token_accuracy": 0.15940281450748445,
"num_tokens": 10524800.0,
"step": 6065
},
{
"entropy": 5.652846336364746,
"epoch": 0.4722816572651235,
"grad_norm": 1.40625,
"learning_rate": 0.0004982478319217848,
"loss": 5.7054,
"mean_token_accuracy": 0.14966497719287872,
"num_tokens": 10534608.0,
"step": 6070
},
{
"entropy": 5.745728874206543,
"epoch": 0.4726706866368411,
"grad_norm": 1.2421875,
"learning_rate": 0.0004982443780868562,
"loss": 5.5948,
"mean_token_accuracy": 0.15881826132535934,
"num_tokens": 10542992.0,
"step": 6075
},
{
"entropy": 5.662547779083252,
"epoch": 0.4730597160085587,
"grad_norm": 1.3515625,
"learning_rate": 0.0004982409208645496,
"loss": 5.6235,
"mean_token_accuracy": 0.15793444067239762,
"num_tokens": 10551682.0,
"step": 6080
},
{
"entropy": 5.607632875442505,
"epoch": 0.4734487453802762,
"grad_norm": 1.25,
"learning_rate": 0.0004982374602549173,
"loss": 5.55,
"mean_token_accuracy": 0.16171603202819823,
"num_tokens": 10560556.0,
"step": 6085
},
{
"entropy": 5.732918691635132,
"epoch": 0.4738377747519938,
"grad_norm": 1.359375,
"learning_rate": 0.0004982339962580119,
"loss": 5.7323,
"mean_token_accuracy": 0.14882105439901352,
"num_tokens": 10569361.0,
"step": 6090
},
{
"entropy": 5.668002557754517,
"epoch": 0.4742268041237113,
"grad_norm": 1.2421875,
"learning_rate": 0.0004982305288738859,
"loss": 5.5426,
"mean_token_accuracy": 0.16289373785257338,
"num_tokens": 10577997.0,
"step": 6095
},
{
"entropy": 5.701682186126709,
"epoch": 0.4746158334954289,
"grad_norm": 1.265625,
"learning_rate": 0.0004982270581025919,
"loss": 5.6444,
"mean_token_accuracy": 0.1589728429913521,
"num_tokens": 10587005.0,
"step": 6100
},
{
"entropy": 5.65606369972229,
"epoch": 0.4750048628671465,
"grad_norm": 1.375,
"learning_rate": 0.0004982235839441826,
"loss": 5.5047,
"mean_token_accuracy": 0.17128463685512543,
"num_tokens": 10595196.0,
"step": 6105
},
{
"entropy": 5.691293668746948,
"epoch": 0.475393892238864,
"grad_norm": 1.359375,
"learning_rate": 0.0004982201063987108,
"loss": 5.6487,
"mean_token_accuracy": 0.14815771952271461,
"num_tokens": 10603796.0,
"step": 6110
},
{
"entropy": 5.697172737121582,
"epoch": 0.4757829216105816,
"grad_norm": 1.3359375,
"learning_rate": 0.0004982166254662292,
"loss": 5.6324,
"mean_token_accuracy": 0.15333464592695237,
"num_tokens": 10612895.0,
"step": 6115
},
{
"entropy": 5.72194128036499,
"epoch": 0.47617195098229914,
"grad_norm": 1.3359375,
"learning_rate": 0.0004982131411467904,
"loss": 5.6968,
"mean_token_accuracy": 0.1535396084189415,
"num_tokens": 10621310.0,
"step": 6120
},
{
"entropy": 5.626172780990601,
"epoch": 0.4765609803540167,
"grad_norm": 1.3828125,
"learning_rate": 0.0004982096534404476,
"loss": 5.5128,
"mean_token_accuracy": 0.16079071760177613,
"num_tokens": 10629598.0,
"step": 6125
},
{
"entropy": 5.72747836112976,
"epoch": 0.4769500097257343,
"grad_norm": 1.359375,
"learning_rate": 0.0004982061623472535,
"loss": 5.5331,
"mean_token_accuracy": 0.15735719203948975,
"num_tokens": 10638218.0,
"step": 6130
},
{
"entropy": 5.687162113189697,
"epoch": 0.47733903909745184,
"grad_norm": 1.34375,
"learning_rate": 0.0004982026678672612,
"loss": 5.6234,
"mean_token_accuracy": 0.1520923927426338,
"num_tokens": 10647215.0,
"step": 6135
},
{
"entropy": 5.688553428649902,
"epoch": 0.47772806846916943,
"grad_norm": 1.28125,
"learning_rate": 0.0004981991700005238,
"loss": 5.7478,
"mean_token_accuracy": 0.14633624255657196,
"num_tokens": 10655755.0,
"step": 6140
},
{
"entropy": 5.761098909378052,
"epoch": 0.47811709784088696,
"grad_norm": 1.359375,
"learning_rate": 0.000498195668747094,
"loss": 5.6224,
"mean_token_accuracy": 0.1543148413300514,
"num_tokens": 10663969.0,
"step": 6145
},
{
"entropy": 5.714224195480346,
"epoch": 0.47850612721260455,
"grad_norm": 1.3046875,
"learning_rate": 0.0004981921641070254,
"loss": 5.493,
"mean_token_accuracy": 0.16152573823928834,
"num_tokens": 10672048.0,
"step": 6150
},
{
"entropy": 5.627324819564819,
"epoch": 0.47889515658432213,
"grad_norm": 1.2421875,
"learning_rate": 0.0004981886560803708,
"loss": 5.6021,
"mean_token_accuracy": 0.15429380685091018,
"num_tokens": 10681802.0,
"step": 6155
},
{
"entropy": 5.68464241027832,
"epoch": 0.47928418595603967,
"grad_norm": 1.453125,
"learning_rate": 0.0004981851446671838,
"loss": 5.6538,
"mean_token_accuracy": 0.14972650855779648,
"num_tokens": 10690618.0,
"step": 6160
},
{
"entropy": 5.689493703842163,
"epoch": 0.47967321532775725,
"grad_norm": 1.3515625,
"learning_rate": 0.0004981816298675173,
"loss": 5.5716,
"mean_token_accuracy": 0.15978924930095673,
"num_tokens": 10699080.0,
"step": 6165
},
{
"entropy": 5.633434629440307,
"epoch": 0.4800622446994748,
"grad_norm": 1.203125,
"learning_rate": 0.0004981781116814248,
"loss": 5.5734,
"mean_token_accuracy": 0.15396522134542465,
"num_tokens": 10708939.0,
"step": 6170
},
{
"entropy": 5.723195362091064,
"epoch": 0.48045127407119237,
"grad_norm": 1.3515625,
"learning_rate": 0.0004981745901089596,
"loss": 5.4795,
"mean_token_accuracy": 0.15833590775728226,
"num_tokens": 10717356.0,
"step": 6175
},
{
"entropy": 5.667737150192261,
"epoch": 0.48084030344290996,
"grad_norm": 1.3828125,
"learning_rate": 0.0004981710651501753,
"loss": 5.568,
"mean_token_accuracy": 0.15206077918410302,
"num_tokens": 10725616.0,
"step": 6180
},
{
"entropy": 5.615799808502198,
"epoch": 0.4812293328146275,
"grad_norm": 1.3671875,
"learning_rate": 0.0004981675368051254,
"loss": 5.5753,
"mean_token_accuracy": 0.1609847441315651,
"num_tokens": 10734337.0,
"step": 6185
},
{
"entropy": 5.684136199951172,
"epoch": 0.4816183621863451,
"grad_norm": 1.3125,
"learning_rate": 0.0004981640050738633,
"loss": 5.6006,
"mean_token_accuracy": 0.15555059164762497,
"num_tokens": 10742720.0,
"step": 6190
},
{
"entropy": 5.7327721118927,
"epoch": 0.48200739155806266,
"grad_norm": 1.4453125,
"learning_rate": 0.0004981604699564426,
"loss": 5.6446,
"mean_token_accuracy": 0.14744160026311875,
"num_tokens": 10751809.0,
"step": 6195
},
{
"entropy": 5.6392982006073,
"epoch": 0.4823964209297802,
"grad_norm": 1.234375,
"learning_rate": 0.0004981569314529169,
"loss": 5.5001,
"mean_token_accuracy": 0.15971516519784928,
"num_tokens": 10759879.0,
"step": 6200
},
{
"entropy": 5.5582897663116455,
"epoch": 0.4827854503014978,
"grad_norm": 1.390625,
"learning_rate": 0.00049815338956334,
"loss": 5.5642,
"mean_token_accuracy": 0.15791321396827698,
"num_tokens": 10769309.0,
"step": 6205
},
{
"entropy": 5.654816770553589,
"epoch": 0.4831744796732153,
"grad_norm": 1.3515625,
"learning_rate": 0.0004981498442877656,
"loss": 5.4911,
"mean_token_accuracy": 0.16367221474647523,
"num_tokens": 10777676.0,
"step": 6210
},
{
"entropy": 5.650180530548096,
"epoch": 0.4835635090449329,
"grad_norm": 1.4140625,
"learning_rate": 0.0004981462956262474,
"loss": 5.708,
"mean_token_accuracy": 0.15045704692602158,
"num_tokens": 10786278.0,
"step": 6215
},
{
"entropy": 5.742503547668457,
"epoch": 0.4839525384166505,
"grad_norm": 1.21875,
"learning_rate": 0.0004981427435788396,
"loss": 5.6291,
"mean_token_accuracy": 0.15221197307109832,
"num_tokens": 10795323.0,
"step": 6220
},
{
"entropy": 5.7140473365783695,
"epoch": 0.484341567788368,
"grad_norm": 1.3515625,
"learning_rate": 0.0004981391881455957,
"loss": 5.5261,
"mean_token_accuracy": 0.15894377529621123,
"num_tokens": 10803978.0,
"step": 6225
},
{
"entropy": 5.671517276763916,
"epoch": 0.4847305971600856,
"grad_norm": 1.3046875,
"learning_rate": 0.0004981356293265696,
"loss": 5.6268,
"mean_token_accuracy": 0.15697673261165618,
"num_tokens": 10812488.0,
"step": 6230
},
{
"entropy": 5.6791136264801025,
"epoch": 0.4851196265318031,
"grad_norm": 1.3046875,
"learning_rate": 0.0004981320671218157,
"loss": 5.5952,
"mean_token_accuracy": 0.1559137649834156,
"num_tokens": 10821076.0,
"step": 6235
},
{
"entropy": 5.59618444442749,
"epoch": 0.4855086559035207,
"grad_norm": 1.3046875,
"learning_rate": 0.0004981285015313877,
"loss": 5.424,
"mean_token_accuracy": 0.17230252772569657,
"num_tokens": 10828634.0,
"step": 6240
},
{
"entropy": 5.599424219131469,
"epoch": 0.4858976852752383,
"grad_norm": 1.5546875,
"learning_rate": 0.0004981249325553399,
"loss": 5.5609,
"mean_token_accuracy": 0.15971072167158126,
"num_tokens": 10837481.0,
"step": 6245
},
{
"entropy": 5.683236837387085,
"epoch": 0.48628671464695583,
"grad_norm": 1.328125,
"learning_rate": 0.0004981213601937264,
"loss": 5.6434,
"mean_token_accuracy": 0.15290929526090621,
"num_tokens": 10846729.0,
"step": 6250
},
{
"entropy": 5.744317626953125,
"epoch": 0.4866757440186734,
"grad_norm": 1.390625,
"learning_rate": 0.0004981177844466013,
"loss": 5.616,
"mean_token_accuracy": 0.15153464525938035,
"num_tokens": 10855344.0,
"step": 6255
},
{
"entropy": 5.702961158752442,
"epoch": 0.48706477339039095,
"grad_norm": 1.5,
"learning_rate": 0.0004981142053140192,
"loss": 5.6496,
"mean_token_accuracy": 0.15403816998004913,
"num_tokens": 10863934.0,
"step": 6260
},
{
"entropy": 5.659459257125855,
"epoch": 0.48745380276210853,
"grad_norm": 1.3984375,
"learning_rate": 0.0004981106227960339,
"loss": 5.6108,
"mean_token_accuracy": 0.15299373418092727,
"num_tokens": 10872031.0,
"step": 6265
},
{
"entropy": 5.730347967147827,
"epoch": 0.4878428321338261,
"grad_norm": 1.3203125,
"learning_rate": 0.0004981070368927001,
"loss": 5.6902,
"mean_token_accuracy": 0.15396978259086608,
"num_tokens": 10881385.0,
"step": 6270
},
{
"entropy": 5.695536041259766,
"epoch": 0.48823186150554365,
"grad_norm": 1.421875,
"learning_rate": 0.000498103447604072,
"loss": 5.5999,
"mean_token_accuracy": 0.16020937711000444,
"num_tokens": 10890483.0,
"step": 6275
},
{
"entropy": 5.704893159866333,
"epoch": 0.48862089087726124,
"grad_norm": 1.3515625,
"learning_rate": 0.0004980998549302044,
"loss": 5.6332,
"mean_token_accuracy": 0.16258720457553863,
"num_tokens": 10898338.0,
"step": 6280
},
{
"entropy": 5.659977054595947,
"epoch": 0.4890099202489788,
"grad_norm": 1.4453125,
"learning_rate": 0.0004980962588711516,
"loss": 5.6093,
"mean_token_accuracy": 0.1559084713459015,
"num_tokens": 10908087.0,
"step": 6285
},
{
"entropy": 5.747127103805542,
"epoch": 0.48939894962069636,
"grad_norm": 1.328125,
"learning_rate": 0.000498092659426968,
"loss": 5.6047,
"mean_token_accuracy": 0.14977360516786575,
"num_tokens": 10916704.0,
"step": 6290
},
{
"entropy": 5.733406352996826,
"epoch": 0.48978797899241394,
"grad_norm": 1.6328125,
"learning_rate": 0.0004980890565977085,
"loss": 5.5708,
"mean_token_accuracy": 0.15654229521751403,
"num_tokens": 10925186.0,
"step": 6295
},
{
"entropy": 5.670359992980957,
"epoch": 0.4901770083641315,
"grad_norm": 1.3671875,
"learning_rate": 0.0004980854503834276,
"loss": 5.6237,
"mean_token_accuracy": 0.15868111401796342,
"num_tokens": 10934247.0,
"step": 6300
},
{
"entropy": 5.730028200149536,
"epoch": 0.49056603773584906,
"grad_norm": 1.3125,
"learning_rate": 0.0004980818407841802,
"loss": 5.6388,
"mean_token_accuracy": 0.15077922344207764,
"num_tokens": 10944260.0,
"step": 6305
},
{
"entropy": 5.684900522232056,
"epoch": 0.49095506710756665,
"grad_norm": 1.3046875,
"learning_rate": 0.0004980782278000207,
"loss": 5.6024,
"mean_token_accuracy": 0.15438488870859146,
"num_tokens": 10954065.0,
"step": 6310
},
{
"entropy": 5.69667501449585,
"epoch": 0.4913440964792842,
"grad_norm": 1.296875,
"learning_rate": 0.0004980746114310043,
"loss": 5.6701,
"mean_token_accuracy": 0.15619819164276122,
"num_tokens": 10962918.0,
"step": 6315
},
{
"entropy": 5.599684524536133,
"epoch": 0.49173312585100176,
"grad_norm": 1.328125,
"learning_rate": 0.0004980709916771858,
"loss": 5.5242,
"mean_token_accuracy": 0.1607260599732399,
"num_tokens": 10972356.0,
"step": 6320
},
{
"entropy": 5.636107015609741,
"epoch": 0.4921221552227193,
"grad_norm": 1.453125,
"learning_rate": 0.0004980673685386198,
"loss": 5.5757,
"mean_token_accuracy": 0.15274077281355858,
"num_tokens": 10980984.0,
"step": 6325
},
{
"entropy": 5.631813192367554,
"epoch": 0.4925111845944369,
"grad_norm": 1.3046875,
"learning_rate": 0.0004980637420153618,
"loss": 5.5111,
"mean_token_accuracy": 0.15772687792778015,
"num_tokens": 10989809.0,
"step": 6330
},
{
"entropy": 5.665310287475586,
"epoch": 0.49290021396615447,
"grad_norm": 1.3359375,
"learning_rate": 0.0004980601121074664,
"loss": 5.5641,
"mean_token_accuracy": 0.1530244916677475,
"num_tokens": 10998824.0,
"step": 6335
},
{
"entropy": 5.738433790206909,
"epoch": 0.493289243337872,
"grad_norm": 1.3203125,
"learning_rate": 0.0004980564788149889,
"loss": 5.6617,
"mean_token_accuracy": 0.15882298350334167,
"num_tokens": 11006755.0,
"step": 6340
},
{
"entropy": 5.645573234558105,
"epoch": 0.4936782727095896,
"grad_norm": 1.3203125,
"learning_rate": 0.0004980528421379844,
"loss": 5.5346,
"mean_token_accuracy": 0.16477559357881547,
"num_tokens": 11015337.0,
"step": 6345
},
{
"entropy": 5.5610456466674805,
"epoch": 0.4940673020813071,
"grad_norm": 1.3671875,
"learning_rate": 0.000498049202076508,
"loss": 5.4638,
"mean_token_accuracy": 0.16363136917352678,
"num_tokens": 11024186.0,
"step": 6350
},
{
"entropy": 5.689836311340332,
"epoch": 0.4944563314530247,
"grad_norm": 1.2890625,
"learning_rate": 0.0004980455586306149,
"loss": 5.586,
"mean_token_accuracy": 0.16271042674779893,
"num_tokens": 11032504.0,
"step": 6355
},
{
"entropy": 5.724547481536865,
"epoch": 0.4948453608247423,
"grad_norm": 1.4375,
"learning_rate": 0.0004980419118003605,
"loss": 5.5451,
"mean_token_accuracy": 0.1571075886487961,
"num_tokens": 11042252.0,
"step": 6360
},
{
"entropy": 5.6988561153411865,
"epoch": 0.4952343901964598,
"grad_norm": 1.34375,
"learning_rate": 0.0004980382615858001,
"loss": 5.6027,
"mean_token_accuracy": 0.15843562185764312,
"num_tokens": 11051361.0,
"step": 6365
},
{
"entropy": 5.635060262680054,
"epoch": 0.4956234195681774,
"grad_norm": 1.328125,
"learning_rate": 0.0004980346079869892,
"loss": 5.5843,
"mean_token_accuracy": 0.1544535830616951,
"num_tokens": 11060822.0,
"step": 6370
},
{
"entropy": 5.700907468795776,
"epoch": 0.49601244893989493,
"grad_norm": 1.53125,
"learning_rate": 0.000498030951003983,
"loss": 5.6455,
"mean_token_accuracy": 0.1547166809439659,
"num_tokens": 11069528.0,
"step": 6375
},
{
"entropy": 5.679643297195435,
"epoch": 0.4964014783116125,
"grad_norm": 1.265625,
"learning_rate": 0.0004980272906368371,
"loss": 5.4827,
"mean_token_accuracy": 0.16679324954748154,
"num_tokens": 11077917.0,
"step": 6380
},
{
"entropy": 5.59128475189209,
"epoch": 0.4967905076833301,
"grad_norm": 1.203125,
"learning_rate": 0.0004980236268856071,
"loss": 5.5546,
"mean_token_accuracy": 0.1547350376844406,
"num_tokens": 11085938.0,
"step": 6385
},
{
"entropy": 5.609622240066528,
"epoch": 0.49717953705504764,
"grad_norm": 1.234375,
"learning_rate": 0.0004980199597503487,
"loss": 5.6147,
"mean_token_accuracy": 0.15192969441413878,
"num_tokens": 11094898.0,
"step": 6390
},
{
"entropy": 5.693767881393432,
"epoch": 0.4975685664267652,
"grad_norm": 1.390625,
"learning_rate": 0.0004980162892311171,
"loss": 5.4737,
"mean_token_accuracy": 0.16259513646364213,
"num_tokens": 11103038.0,
"step": 6395
},
{
"entropy": 5.697658061981201,
"epoch": 0.4979575957984828,
"grad_norm": 1.3515625,
"learning_rate": 0.0004980126153279684,
"loss": 5.5723,
"mean_token_accuracy": 0.15827525407075882,
"num_tokens": 11111965.0,
"step": 6400
},
{
"entropy": 5.605089139938355,
"epoch": 0.49834662517020034,
"grad_norm": 1.25,
"learning_rate": 0.0004980089380409583,
"loss": 5.5947,
"mean_token_accuracy": 0.15535541325807573,
"num_tokens": 11121482.0,
"step": 6405
},
{
"entropy": 5.672932577133179,
"epoch": 0.4987356545419179,
"grad_norm": 1.3046875,
"learning_rate": 0.0004980052573701424,
"loss": 5.5853,
"mean_token_accuracy": 0.15607178062200547,
"num_tokens": 11129742.0,
"step": 6410
},
{
"entropy": 5.675456905364991,
"epoch": 0.49912468391363546,
"grad_norm": 1.1953125,
"learning_rate": 0.0004980015733155767,
"loss": 5.5873,
"mean_token_accuracy": 0.15734535753726958,
"num_tokens": 11138388.0,
"step": 6415
},
{
"entropy": 5.520279121398926,
"epoch": 0.49951371328535304,
"grad_norm": 1.375,
"learning_rate": 0.0004979978858773171,
"loss": 5.3289,
"mean_token_accuracy": 0.17224133461713792,
"num_tokens": 11146967.0,
"step": 6420
},
{
"entropy": 5.645619964599609,
"epoch": 0.49990274265707063,
"grad_norm": 1.3125,
"learning_rate": 0.0004979941950554195,
"loss": 5.6735,
"mean_token_accuracy": 0.15287676751613616,
"num_tokens": 11155888.0,
"step": 6425
},
{
"entropy": 5.717220449447632,
"epoch": 0.5002917720287882,
"grad_norm": 1.3359375,
"learning_rate": 0.0004979905008499399,
"loss": 5.5328,
"mean_token_accuracy": 0.15672664046287538,
"num_tokens": 11164358.0,
"step": 6430
},
{
"entropy": 5.59271731376648,
"epoch": 0.5006808014005057,
"grad_norm": 1.265625,
"learning_rate": 0.0004979868032609344,
"loss": 5.3922,
"mean_token_accuracy": 0.17046331167221068,
"num_tokens": 11172416.0,
"step": 6435
},
{
"entropy": 5.661533260345459,
"epoch": 0.5010698307722233,
"grad_norm": 1.3203125,
"learning_rate": 0.0004979831022884591,
"loss": 5.5715,
"mean_token_accuracy": 0.15518891513347627,
"num_tokens": 11181159.0,
"step": 6440
},
{
"entropy": 5.6787347316741945,
"epoch": 0.5014588601439409,
"grad_norm": 1.375,
"learning_rate": 0.0004979793979325701,
"loss": 5.6135,
"mean_token_accuracy": 0.15603988468647004,
"num_tokens": 11189725.0,
"step": 6445
},
{
"entropy": 5.678800773620606,
"epoch": 0.5018478895156584,
"grad_norm": 1.34375,
"learning_rate": 0.0004979756901933236,
"loss": 5.5999,
"mean_token_accuracy": 0.15560702234506607,
"num_tokens": 11197795.0,
"step": 6450
},
{
"entropy": 5.674616813659668,
"epoch": 0.502236918887376,
"grad_norm": 1.296875,
"learning_rate": 0.000497971979070776,
"loss": 5.5438,
"mean_token_accuracy": 0.16058342829346656,
"num_tokens": 11205352.0,
"step": 6455
},
{
"entropy": 5.674797487258911,
"epoch": 0.5026259482590936,
"grad_norm": 1.375,
"learning_rate": 0.0004979682645649834,
"loss": 5.6084,
"mean_token_accuracy": 0.1550489269196987,
"num_tokens": 11214142.0,
"step": 6460
},
{
"entropy": 5.61780571937561,
"epoch": 0.5030149776308112,
"grad_norm": 1.234375,
"learning_rate": 0.0004979645466760025,
"loss": 5.4781,
"mean_token_accuracy": 0.16321058422327042,
"num_tokens": 11222565.0,
"step": 6465
},
{
"entropy": 5.588930559158325,
"epoch": 0.5034040070025287,
"grad_norm": 1.2421875,
"learning_rate": 0.0004979608254038892,
"loss": 5.5811,
"mean_token_accuracy": 0.15546856224536895,
"num_tokens": 11231829.0,
"step": 6470
},
{
"entropy": 5.624651479721069,
"epoch": 0.5037930363742462,
"grad_norm": 1.984375,
"learning_rate": 0.0004979571007487003,
"loss": 5.5923,
"mean_token_accuracy": 0.15631648153066635,
"num_tokens": 11240302.0,
"step": 6475
},
{
"entropy": 5.791405725479126,
"epoch": 0.5041820657459638,
"grad_norm": 1.4609375,
"learning_rate": 0.0004979533727104924,
"loss": 5.6838,
"mean_token_accuracy": 0.1518307164311409,
"num_tokens": 11248610.0,
"step": 6480
},
{
"entropy": 5.69047703742981,
"epoch": 0.5045710951176814,
"grad_norm": 1.28125,
"learning_rate": 0.000497949641289322,
"loss": 5.5964,
"mean_token_accuracy": 0.15891549587249756,
"num_tokens": 11257441.0,
"step": 6485
},
{
"entropy": 5.549295377731323,
"epoch": 0.504960124489399,
"grad_norm": 1.328125,
"learning_rate": 0.0004979459064852456,
"loss": 5.4659,
"mean_token_accuracy": 0.15760838985443115,
"num_tokens": 11265915.0,
"step": 6490
},
{
"entropy": 5.648113203048706,
"epoch": 0.5053491538611166,
"grad_norm": 1.3359375,
"learning_rate": 0.0004979421682983197,
"loss": 5.5975,
"mean_token_accuracy": 0.15131368562579156,
"num_tokens": 11274165.0,
"step": 6495
},
{
"entropy": 5.706796312332154,
"epoch": 0.505738183232834,
"grad_norm": 1.3125,
"learning_rate": 0.0004979384267286015,
"loss": 5.5461,
"mean_token_accuracy": 0.16159669756889344,
"num_tokens": 11283316.0,
"step": 6500
},
{
"entropy": 5.690013027191162,
"epoch": 0.5061272126045516,
"grad_norm": 1.359375,
"learning_rate": 0.0004979346817761475,
"loss": 5.6692,
"mean_token_accuracy": 0.15432394593954085,
"num_tokens": 11292289.0,
"step": 6505
},
{
"entropy": 5.678025627136231,
"epoch": 0.5065162419762692,
"grad_norm": 1.2265625,
"learning_rate": 0.0004979309334410144,
"loss": 5.5717,
"mean_token_accuracy": 0.15459866374731063,
"num_tokens": 11301192.0,
"step": 6510
},
{
"entropy": 5.6778205871582035,
"epoch": 0.5069052713479868,
"grad_norm": 1.3359375,
"learning_rate": 0.0004979271817232594,
"loss": 5.5882,
"mean_token_accuracy": 0.1566533237695694,
"num_tokens": 11309906.0,
"step": 6515
},
{
"entropy": 5.721369457244873,
"epoch": 0.5072943007197044,
"grad_norm": 1.3515625,
"learning_rate": 0.0004979234266229391,
"loss": 5.5822,
"mean_token_accuracy": 0.15548757910728456,
"num_tokens": 11318227.0,
"step": 6520
},
{
"entropy": 5.576367330551148,
"epoch": 0.5076833300914219,
"grad_norm": 1.3203125,
"learning_rate": 0.0004979196681401106,
"loss": 5.5998,
"mean_token_accuracy": 0.1588978312909603,
"num_tokens": 11327524.0,
"step": 6525
},
{
"entropy": 5.630653429031372,
"epoch": 0.5080723594631394,
"grad_norm": 1.3671875,
"learning_rate": 0.000497915906274831,
"loss": 5.5438,
"mean_token_accuracy": 0.161087529361248,
"num_tokens": 11336214.0,
"step": 6530
},
{
"entropy": 5.631156921386719,
"epoch": 0.508461388834857,
"grad_norm": 1.359375,
"learning_rate": 0.0004979121410271574,
"loss": 5.3896,
"mean_token_accuracy": 0.16864126175642014,
"num_tokens": 11344551.0,
"step": 6535
},
{
"entropy": 5.530792999267578,
"epoch": 0.5088504182065746,
"grad_norm": 1.3125,
"learning_rate": 0.0004979083723971468,
"loss": 5.46,
"mean_token_accuracy": 0.16636885404586793,
"num_tokens": 11353180.0,
"step": 6540
},
{
"entropy": 5.495325994491577,
"epoch": 0.5092394475782922,
"grad_norm": 1.21875,
"learning_rate": 0.0004979046003848564,
"loss": 5.4368,
"mean_token_accuracy": 0.16852892339229583,
"num_tokens": 11361343.0,
"step": 6545
},
{
"entropy": 5.625004386901855,
"epoch": 0.5096284769500097,
"grad_norm": 1.3125,
"learning_rate": 0.0004979008249903435,
"loss": 5.5466,
"mean_token_accuracy": 0.16107016056776047,
"num_tokens": 11369915.0,
"step": 6550
},
{
"entropy": 5.6815948486328125,
"epoch": 0.5100175063217273,
"grad_norm": 1.2265625,
"learning_rate": 0.0004978970462136655,
"loss": 5.564,
"mean_token_accuracy": 0.15614417046308518,
"num_tokens": 11379813.0,
"step": 6555
},
{
"entropy": 5.628446245193482,
"epoch": 0.5104065356934449,
"grad_norm": 1.2421875,
"learning_rate": 0.0004978932640548794,
"loss": 5.5171,
"mean_token_accuracy": 0.15718891769647597,
"num_tokens": 11388029.0,
"step": 6560
},
{
"entropy": 5.600995826721191,
"epoch": 0.5107955650651624,
"grad_norm": 1.265625,
"learning_rate": 0.0004978894785140429,
"loss": 5.458,
"mean_token_accuracy": 0.15973847061395646,
"num_tokens": 11395852.0,
"step": 6565
},
{
"entropy": 5.605973625183106,
"epoch": 0.51118459443688,
"grad_norm": 1.21875,
"learning_rate": 0.0004978856895912132,
"loss": 5.5467,
"mean_token_accuracy": 0.1593152642250061,
"num_tokens": 11404756.0,
"step": 6570
},
{
"entropy": 5.763776159286499,
"epoch": 0.5115736238085975,
"grad_norm": 1.453125,
"learning_rate": 0.0004978818972864481,
"loss": 5.7037,
"mean_token_accuracy": 0.149703748524189,
"num_tokens": 11413301.0,
"step": 6575
},
{
"entropy": 5.687377214431763,
"epoch": 0.5119626531803151,
"grad_norm": 1.21875,
"learning_rate": 0.0004978781015998048,
"loss": 5.4517,
"mean_token_accuracy": 0.16738782972097396,
"num_tokens": 11421034.0,
"step": 6580
},
{
"entropy": 5.586408901214599,
"epoch": 0.5123516825520327,
"grad_norm": 1.3671875,
"learning_rate": 0.0004978743025313413,
"loss": 5.4916,
"mean_token_accuracy": 0.15781426280736924,
"num_tokens": 11429066.0,
"step": 6585
},
{
"entropy": 5.5836893081665036,
"epoch": 0.5127407119237503,
"grad_norm": 1.2734375,
"learning_rate": 0.0004978705000811148,
"loss": 5.5184,
"mean_token_accuracy": 0.16265126764774324,
"num_tokens": 11438109.0,
"step": 6590
},
{
"entropy": 5.682431221008301,
"epoch": 0.5131297412954678,
"grad_norm": 1.3125,
"learning_rate": 0.0004978666942491832,
"loss": 5.5468,
"mean_token_accuracy": 0.16171859800815583,
"num_tokens": 11446787.0,
"step": 6595
},
{
"entropy": 5.576941347122192,
"epoch": 0.5135187706671853,
"grad_norm": 1.265625,
"learning_rate": 0.0004978628850356043,
"loss": 5.4978,
"mean_token_accuracy": 0.15480518341064453,
"num_tokens": 11456262.0,
"step": 6600
},
{
"entropy": 5.6838137149810795,
"epoch": 0.5139078000389029,
"grad_norm": 1.3046875,
"learning_rate": 0.0004978590724404358,
"loss": 5.4963,
"mean_token_accuracy": 0.16990127712488173,
"num_tokens": 11464297.0,
"step": 6605
},
{
"entropy": 5.693605375289917,
"epoch": 0.5142968294106205,
"grad_norm": 1.2734375,
"learning_rate": 0.0004978552564637356,
"loss": 5.5981,
"mean_token_accuracy": 0.15441921055316926,
"num_tokens": 11473519.0,
"step": 6610
},
{
"entropy": 5.644426012039185,
"epoch": 0.5146858587823381,
"grad_norm": 1.3203125,
"learning_rate": 0.0004978514371055616,
"loss": 5.5747,
"mean_token_accuracy": 0.15011529326438905,
"num_tokens": 11482249.0,
"step": 6615
},
{
"entropy": 5.589239454269409,
"epoch": 0.5150748881540557,
"grad_norm": 1.3515625,
"learning_rate": 0.0004978476143659718,
"loss": 5.5288,
"mean_token_accuracy": 0.1568063020706177,
"num_tokens": 11490687.0,
"step": 6620
},
{
"entropy": 5.607043504714966,
"epoch": 0.5154639175257731,
"grad_norm": 1.265625,
"learning_rate": 0.0004978437882450241,
"loss": 5.5485,
"mean_token_accuracy": 0.16212338656187059,
"num_tokens": 11500225.0,
"step": 6625
},
{
"entropy": 5.6719512939453125,
"epoch": 0.5158529468974907,
"grad_norm": 1.28125,
"learning_rate": 0.0004978399587427766,
"loss": 5.4822,
"mean_token_accuracy": 0.16089026927947997,
"num_tokens": 11508116.0,
"step": 6630
},
{
"entropy": 5.567082118988037,
"epoch": 0.5162419762692083,
"grad_norm": 1.25,
"learning_rate": 0.0004978361258592874,
"loss": 5.5642,
"mean_token_accuracy": 0.15507243424654008,
"num_tokens": 11516525.0,
"step": 6635
},
{
"entropy": 5.6446949481964115,
"epoch": 0.5166310056409259,
"grad_norm": 1.265625,
"learning_rate": 0.0004978322895946147,
"loss": 5.538,
"mean_token_accuracy": 0.16238362938165665,
"num_tokens": 11525434.0,
"step": 6640
},
{
"entropy": 5.695188665390015,
"epoch": 0.5170200350126435,
"grad_norm": 1.15625,
"learning_rate": 0.0004978284499488167,
"loss": 5.5602,
"mean_token_accuracy": 0.15848546028137206,
"num_tokens": 11534318.0,
"step": 6645
},
{
"entropy": 5.600885820388794,
"epoch": 0.5174090643843611,
"grad_norm": 1.2890625,
"learning_rate": 0.0004978246069219516,
"loss": 5.5403,
"mean_token_accuracy": 0.16719124466180801,
"num_tokens": 11542777.0,
"step": 6650
},
{
"entropy": 5.561204528808593,
"epoch": 0.5177980937560785,
"grad_norm": 1.296875,
"learning_rate": 0.0004978207605140777,
"loss": 5.5148,
"mean_token_accuracy": 0.16363105028867722,
"num_tokens": 11550888.0,
"step": 6655
},
{
"entropy": 5.622227907180786,
"epoch": 0.5181871231277961,
"grad_norm": 1.359375,
"learning_rate": 0.0004978169107252534,
"loss": 5.5435,
"mean_token_accuracy": 0.15494584143161774,
"num_tokens": 11560047.0,
"step": 6660
},
{
"entropy": 5.755712890625,
"epoch": 0.5185761524995137,
"grad_norm": 1.4140625,
"learning_rate": 0.0004978130575555373,
"loss": 5.5661,
"mean_token_accuracy": 0.1614314630627632,
"num_tokens": 11568862.0,
"step": 6665
},
{
"entropy": 5.568341636657715,
"epoch": 0.5189651818712313,
"grad_norm": 1.3515625,
"learning_rate": 0.0004978092010049877,
"loss": 5.5043,
"mean_token_accuracy": 0.163470259308815,
"num_tokens": 11577509.0,
"step": 6670
},
{
"entropy": 5.6859883785247805,
"epoch": 0.5193542112429489,
"grad_norm": 1.3828125,
"learning_rate": 0.000497805341073663,
"loss": 5.6282,
"mean_token_accuracy": 0.15651989430189134,
"num_tokens": 11585902.0,
"step": 6675
},
{
"entropy": 5.674084663391113,
"epoch": 0.5197432406146664,
"grad_norm": 1.3125,
"learning_rate": 0.0004978014777616219,
"loss": 5.6123,
"mean_token_accuracy": 0.16017613857984542,
"num_tokens": 11594895.0,
"step": 6680
},
{
"entropy": 5.586768913269043,
"epoch": 0.520132269986384,
"grad_norm": 1.2890625,
"learning_rate": 0.0004977976110689229,
"loss": 5.4369,
"mean_token_accuracy": 0.162335567176342,
"num_tokens": 11604080.0,
"step": 6685
},
{
"entropy": 5.687888431549072,
"epoch": 0.5205212993581015,
"grad_norm": 1.171875,
"learning_rate": 0.000497793740995625,
"loss": 5.5551,
"mean_token_accuracy": 0.15847532749176024,
"num_tokens": 11613370.0,
"step": 6690
},
{
"entropy": 5.589132499694824,
"epoch": 0.5209103287298191,
"grad_norm": 1.3046875,
"learning_rate": 0.0004977898675417866,
"loss": 5.5413,
"mean_token_accuracy": 0.15930339246988295,
"num_tokens": 11621913.0,
"step": 6695
},
{
"entropy": 5.677670526504516,
"epoch": 0.5212993581015367,
"grad_norm": 1.34375,
"learning_rate": 0.0004977859907074664,
"loss": 5.6869,
"mean_token_accuracy": 0.1528049200773239,
"num_tokens": 11630393.0,
"step": 6700
},
{
"entropy": 5.732822036743164,
"epoch": 0.5216883874732542,
"grad_norm": 1.4453125,
"learning_rate": 0.0004977821104927236,
"loss": 5.6297,
"mean_token_accuracy": 0.1573626160621643,
"num_tokens": 11639038.0,
"step": 6705
},
{
"entropy": 5.6175659656524655,
"epoch": 0.5220774168449718,
"grad_norm": 1.296875,
"learning_rate": 0.0004977782268976167,
"loss": 5.5012,
"mean_token_accuracy": 0.15832498222589492,
"num_tokens": 11647355.0,
"step": 6710
},
{
"entropy": 5.581278133392334,
"epoch": 0.5224664462166894,
"grad_norm": 1.359375,
"learning_rate": 0.0004977743399222048,
"loss": 5.5111,
"mean_token_accuracy": 0.15422431975603104,
"num_tokens": 11655899.0,
"step": 6715
},
{
"entropy": 5.753375005722046,
"epoch": 0.522855475588407,
"grad_norm": 1.296875,
"learning_rate": 0.0004977704495665471,
"loss": 5.6935,
"mean_token_accuracy": 0.14948423206806183,
"num_tokens": 11664602.0,
"step": 6720
},
{
"entropy": 5.686633586883545,
"epoch": 0.5232445049601245,
"grad_norm": 1.3125,
"learning_rate": 0.0004977665558307023,
"loss": 5.5188,
"mean_token_accuracy": 0.1614977553486824,
"num_tokens": 11673011.0,
"step": 6725
},
{
"entropy": 5.728595113754272,
"epoch": 0.523633534331842,
"grad_norm": 1.3984375,
"learning_rate": 0.0004977626587147295,
"loss": 5.6987,
"mean_token_accuracy": 0.14548852294683456,
"num_tokens": 11681989.0,
"step": 6730
},
{
"entropy": 5.722722291946411,
"epoch": 0.5240225637035596,
"grad_norm": 1.3046875,
"learning_rate": 0.000497758758218688,
"loss": 5.6269,
"mean_token_accuracy": 0.15139962285757064,
"num_tokens": 11690502.0,
"step": 6735
},
{
"entropy": 5.672935247421265,
"epoch": 0.5244115930752772,
"grad_norm": 1.390625,
"learning_rate": 0.0004977548543426368,
"loss": 5.6226,
"mean_token_accuracy": 0.1551753543317318,
"num_tokens": 11699594.0,
"step": 6740
},
{
"entropy": 5.587326717376709,
"epoch": 0.5248006224469948,
"grad_norm": 1.3984375,
"learning_rate": 0.0004977509470866353,
"loss": 5.4916,
"mean_token_accuracy": 0.16007392406463622,
"num_tokens": 11708009.0,
"step": 6745
},
{
"entropy": 5.707208347320557,
"epoch": 0.5251896518187124,
"grad_norm": 1.46875,
"learning_rate": 0.0004977470364507427,
"loss": 5.6656,
"mean_token_accuracy": 0.1489517107605934,
"num_tokens": 11716592.0,
"step": 6750
},
{
"entropy": 5.694457864761352,
"epoch": 0.5255786811904298,
"grad_norm": 1.3125,
"learning_rate": 0.0004977431224350184,
"loss": 5.6656,
"mean_token_accuracy": 0.1458994671702385,
"num_tokens": 11725894.0,
"step": 6755
},
{
"entropy": 5.768098592758179,
"epoch": 0.5259677105621474,
"grad_norm": 1.421875,
"learning_rate": 0.0004977392050395217,
"loss": 5.5362,
"mean_token_accuracy": 0.1602727875113487,
"num_tokens": 11734141.0,
"step": 6760
},
{
"entropy": 5.642729377746582,
"epoch": 0.526356739933865,
"grad_norm": 1.4296875,
"learning_rate": 0.0004977352842643121,
"loss": 5.6457,
"mean_token_accuracy": 0.15595187842845917,
"num_tokens": 11742539.0,
"step": 6765
},
{
"entropy": 5.648681259155273,
"epoch": 0.5267457693055826,
"grad_norm": 1.3125,
"learning_rate": 0.000497731360109449,
"loss": 5.5973,
"mean_token_accuracy": 0.15659012347459794,
"num_tokens": 11751649.0,
"step": 6770
},
{
"entropy": 5.729363012313843,
"epoch": 0.5271347986773002,
"grad_norm": 1.4453125,
"learning_rate": 0.0004977274325749922,
"loss": 5.6011,
"mean_token_accuracy": 0.1551893211901188,
"num_tokens": 11760376.0,
"step": 6775
},
{
"entropy": 5.703770875930786,
"epoch": 0.5275238280490177,
"grad_norm": 1.3125,
"learning_rate": 0.0004977235016610011,
"loss": 5.564,
"mean_token_accuracy": 0.15711267292499542,
"num_tokens": 11768644.0,
"step": 6780
},
{
"entropy": 5.734229660034179,
"epoch": 0.5279128574207352,
"grad_norm": 1.4375,
"learning_rate": 0.0004977195673675353,
"loss": 5.6425,
"mean_token_accuracy": 0.15375020503997802,
"num_tokens": 11777282.0,
"step": 6785
},
{
"entropy": 5.625796604156494,
"epoch": 0.5283018867924528,
"grad_norm": 1.390625,
"learning_rate": 0.0004977156296946545,
"loss": 5.5393,
"mean_token_accuracy": 0.15840379446744918,
"num_tokens": 11786108.0,
"step": 6790
},
{
"entropy": 5.676083612442016,
"epoch": 0.5286909161641704,
"grad_norm": 1.3671875,
"learning_rate": 0.0004977116886424187,
"loss": 5.5956,
"mean_token_accuracy": 0.15348794162273408,
"num_tokens": 11795151.0,
"step": 6795
},
{
"entropy": 5.786767816543579,
"epoch": 0.529079945535888,
"grad_norm": 1.3984375,
"learning_rate": 0.0004977077442108873,
"loss": 5.5445,
"mean_token_accuracy": 0.16012217849493027,
"num_tokens": 11803971.0,
"step": 6800
},
{
"entropy": 5.579844236373901,
"epoch": 0.5294689749076055,
"grad_norm": 1.4765625,
"learning_rate": 0.0004977037964001204,
"loss": 5.6101,
"mean_token_accuracy": 0.1626015529036522,
"num_tokens": 11812483.0,
"step": 6805
},
{
"entropy": 5.598951911926269,
"epoch": 0.5298580042793231,
"grad_norm": 1.3359375,
"learning_rate": 0.000497699845210178,
"loss": 5.4882,
"mean_token_accuracy": 0.15942364782094956,
"num_tokens": 11821144.0,
"step": 6810
},
{
"entropy": 5.649045038223266,
"epoch": 0.5302470336510406,
"grad_norm": 1.359375,
"learning_rate": 0.0004976958906411197,
"loss": 5.4502,
"mean_token_accuracy": 0.16786729842424392,
"num_tokens": 11829298.0,
"step": 6815
},
{
"entropy": 5.6356611251831055,
"epoch": 0.5306360630227582,
"grad_norm": 1.34375,
"learning_rate": 0.0004976919326930059,
"loss": 5.5413,
"mean_token_accuracy": 0.1632298156619072,
"num_tokens": 11837558.0,
"step": 6820
},
{
"entropy": 5.538313484191894,
"epoch": 0.5310250923944758,
"grad_norm": 1.3046875,
"learning_rate": 0.0004976879713658964,
"loss": 5.4329,
"mean_token_accuracy": 0.16372002512216569,
"num_tokens": 11845770.0,
"step": 6825
},
{
"entropy": 5.641631031036377,
"epoch": 0.5314141217661933,
"grad_norm": 1.3359375,
"learning_rate": 0.0004976840066598514,
"loss": 5.6338,
"mean_token_accuracy": 0.14802222698926926,
"num_tokens": 11854351.0,
"step": 6830
},
{
"entropy": 5.793056392669678,
"epoch": 0.5318031511379109,
"grad_norm": 1.3515625,
"learning_rate": 0.0004976800385749309,
"loss": 5.6301,
"mean_token_accuracy": 0.16096321791410445,
"num_tokens": 11862610.0,
"step": 6835
},
{
"entropy": 5.6363152980804445,
"epoch": 0.5321921805096285,
"grad_norm": 1.34375,
"learning_rate": 0.0004976760671111954,
"loss": 5.5878,
"mean_token_accuracy": 0.16149788051843644,
"num_tokens": 11871078.0,
"step": 6840
},
{
"entropy": 5.602367925643921,
"epoch": 0.532581209881346,
"grad_norm": 1.2734375,
"learning_rate": 0.000497672092268705,
"loss": 5.4558,
"mean_token_accuracy": 0.16823557317256926,
"num_tokens": 11879303.0,
"step": 6845
},
{
"entropy": 5.697409915924072,
"epoch": 0.5329702392530636,
"grad_norm": 1.484375,
"learning_rate": 0.00049766811404752,
"loss": 5.5198,
"mean_token_accuracy": 0.15866248458623886,
"num_tokens": 11887855.0,
"step": 6850
},
{
"entropy": 5.669441270828247,
"epoch": 0.5333592686247812,
"grad_norm": 1.234375,
"learning_rate": 0.0004976641324477008,
"loss": 5.4896,
"mean_token_accuracy": 0.1634063646197319,
"num_tokens": 11896262.0,
"step": 6855
},
{
"entropy": 5.4838920593261715,
"epoch": 0.5337482979964987,
"grad_norm": 1.375,
"learning_rate": 0.0004976601474693077,
"loss": 5.4028,
"mean_token_accuracy": 0.16620713621377944,
"num_tokens": 11905140.0,
"step": 6860
},
{
"entropy": 5.534974670410156,
"epoch": 0.5341373273682163,
"grad_norm": 1.4375,
"learning_rate": 0.0004976561591124014,
"loss": 5.4434,
"mean_token_accuracy": 0.1693867936730385,
"num_tokens": 11913177.0,
"step": 6865
},
{
"entropy": 5.501511096954346,
"epoch": 0.5345263567399339,
"grad_norm": 1.359375,
"learning_rate": 0.0004976521673770421,
"loss": 5.4746,
"mean_token_accuracy": 0.16013596653938295,
"num_tokens": 11921955.0,
"step": 6870
},
{
"entropy": 5.614723873138428,
"epoch": 0.5349153861116515,
"grad_norm": 1.328125,
"learning_rate": 0.0004976481722632907,
"loss": 5.484,
"mean_token_accuracy": 0.15625718086957932,
"num_tokens": 11930976.0,
"step": 6875
},
{
"entropy": 5.621336030960083,
"epoch": 0.535304415483369,
"grad_norm": 1.2421875,
"learning_rate": 0.0004976441737712076,
"loss": 5.4153,
"mean_token_accuracy": 0.16089983880519867,
"num_tokens": 11939708.0,
"step": 6880
},
{
"entropy": 5.668586921691895,
"epoch": 0.5356934448550865,
"grad_norm": 1.3984375,
"learning_rate": 0.0004976401719008536,
"loss": 5.6059,
"mean_token_accuracy": 0.15665263086557388,
"num_tokens": 11949176.0,
"step": 6885
},
{
"entropy": 5.609954023361206,
"epoch": 0.5360824742268041,
"grad_norm": 1.2421875,
"learning_rate": 0.0004976361666522893,
"loss": 5.4534,
"mean_token_accuracy": 0.16610209494829178,
"num_tokens": 11958089.0,
"step": 6890
},
{
"entropy": 5.6360095024108885,
"epoch": 0.5364715035985217,
"grad_norm": 1.75,
"learning_rate": 0.0004976321580255755,
"loss": 5.5369,
"mean_token_accuracy": 0.16299730837345122,
"num_tokens": 11966719.0,
"step": 6895
},
{
"entropy": 5.68487663269043,
"epoch": 0.5368605329702393,
"grad_norm": 1.28125,
"learning_rate": 0.0004976281460207731,
"loss": 5.6002,
"mean_token_accuracy": 0.15535397827625275,
"num_tokens": 11975959.0,
"step": 6900
},
{
"entropy": 5.674017238616943,
"epoch": 0.5372495623419569,
"grad_norm": 1.5234375,
"learning_rate": 0.000497624130637943,
"loss": 5.5641,
"mean_token_accuracy": 0.16273371428251265,
"num_tokens": 11984282.0,
"step": 6905
},
{
"entropy": 5.644144487380982,
"epoch": 0.5376385917136743,
"grad_norm": 1.34375,
"learning_rate": 0.000497620111877146,
"loss": 5.5637,
"mean_token_accuracy": 0.15435383319854737,
"num_tokens": 11993289.0,
"step": 6910
},
{
"entropy": 5.60618839263916,
"epoch": 0.5380276210853919,
"grad_norm": 1.375,
"learning_rate": 0.0004976160897384431,
"loss": 5.4969,
"mean_token_accuracy": 0.16079047173261643,
"num_tokens": 12002425.0,
"step": 6915
},
{
"entropy": 5.638632774353027,
"epoch": 0.5384166504571095,
"grad_norm": 1.296875,
"learning_rate": 0.0004976120642218955,
"loss": 5.5134,
"mean_token_accuracy": 0.15918543487787246,
"num_tokens": 12010435.0,
"step": 6920
},
{
"entropy": 5.5793486595153805,
"epoch": 0.5388056798288271,
"grad_norm": 1.4296875,
"learning_rate": 0.000497608035327564,
"loss": 5.5623,
"mean_token_accuracy": 0.15495380908250808,
"num_tokens": 12018768.0,
"step": 6925
},
{
"entropy": 5.678703308105469,
"epoch": 0.5391947092005447,
"grad_norm": 1.3046875,
"learning_rate": 0.00049760400305551,
"loss": 5.5672,
"mean_token_accuracy": 0.1580612525343895,
"num_tokens": 12027617.0,
"step": 6930
},
{
"entropy": 5.695169067382812,
"epoch": 0.5395837385722622,
"grad_norm": 1.359375,
"learning_rate": 0.0004975999674057944,
"loss": 5.5489,
"mean_token_accuracy": 0.15605789721012114,
"num_tokens": 12036024.0,
"step": 6935
},
{
"entropy": 5.723021030426025,
"epoch": 0.5399727679439797,
"grad_norm": 1.296875,
"learning_rate": 0.0004975959283784787,
"loss": 5.5789,
"mean_token_accuracy": 0.1569458082318306,
"num_tokens": 12044206.0,
"step": 6940
},
{
"entropy": 5.619761753082275,
"epoch": 0.5403617973156973,
"grad_norm": 1.1796875,
"learning_rate": 0.0004975918859736241,
"loss": 5.4611,
"mean_token_accuracy": 0.16328767985105513,
"num_tokens": 12052294.0,
"step": 6945
},
{
"entropy": 5.593639135360718,
"epoch": 0.5407508266874149,
"grad_norm": 1.3203125,
"learning_rate": 0.0004975878401912919,
"loss": 5.5733,
"mean_token_accuracy": 0.15376802980899812,
"num_tokens": 12060446.0,
"step": 6950
},
{
"entropy": 5.663234519958496,
"epoch": 0.5411398560591325,
"grad_norm": 1.3359375,
"learning_rate": 0.0004975837910315436,
"loss": 5.6616,
"mean_token_accuracy": 0.15635811388492585,
"num_tokens": 12069267.0,
"step": 6955
},
{
"entropy": 5.709695672988891,
"epoch": 0.54152888543085,
"grad_norm": 1.2734375,
"learning_rate": 0.0004975797384944405,
"loss": 5.5824,
"mean_token_accuracy": 0.15533999651670455,
"num_tokens": 12077808.0,
"step": 6960
},
{
"entropy": 5.638394355773926,
"epoch": 0.5419179148025676,
"grad_norm": 1.3359375,
"learning_rate": 0.000497575682580044,
"loss": 5.5542,
"mean_token_accuracy": 0.1539350613951683,
"num_tokens": 12086893.0,
"step": 6965
},
{
"entropy": 5.666961669921875,
"epoch": 0.5423069441742852,
"grad_norm": 1.28125,
"learning_rate": 0.000497571623288416,
"loss": 5.4399,
"mean_token_accuracy": 0.1644754961133003,
"num_tokens": 12095462.0,
"step": 6970
},
{
"entropy": 5.6487678527832035,
"epoch": 0.5426959735460027,
"grad_norm": 1.4140625,
"learning_rate": 0.0004975675606196177,
"loss": 5.5295,
"mean_token_accuracy": 0.15933847576379775,
"num_tokens": 12103477.0,
"step": 6975
},
{
"entropy": 5.671709299087524,
"epoch": 0.5430850029177203,
"grad_norm": 1.46875,
"learning_rate": 0.000497563494573711,
"loss": 5.6699,
"mean_token_accuracy": 0.15767599493265153,
"num_tokens": 12112752.0,
"step": 6980
},
{
"entropy": 5.7197895526885985,
"epoch": 0.5434740322894378,
"grad_norm": 1.3984375,
"learning_rate": 0.0004975594251507575,
"loss": 5.5767,
"mean_token_accuracy": 0.1488715760409832,
"num_tokens": 12121883.0,
"step": 6985
},
{
"entropy": 5.684212684631348,
"epoch": 0.5438630616611554,
"grad_norm": 1.3515625,
"learning_rate": 0.000497555352350819,
"loss": 5.5251,
"mean_token_accuracy": 0.15814283341169358,
"num_tokens": 12130316.0,
"step": 6990
},
{
"entropy": 5.640691900253296,
"epoch": 0.544252091032873,
"grad_norm": 1.265625,
"learning_rate": 0.0004975512761739572,
"loss": 5.5032,
"mean_token_accuracy": 0.15524298548698426,
"num_tokens": 12138856.0,
"step": 6995
},
{
"entropy": 5.592985916137695,
"epoch": 0.5446411204045906,
"grad_norm": 1.390625,
"learning_rate": 0.000497547196620234,
"loss": 5.5785,
"mean_token_accuracy": 0.15525238662958146,
"num_tokens": 12147933.0,
"step": 7000
},
{
"entropy": 5.633612012863159,
"epoch": 0.5450301497763081,
"grad_norm": 1.3046875,
"learning_rate": 0.0004975431136897114,
"loss": 5.4554,
"mean_token_accuracy": 0.1621299922466278,
"num_tokens": 12156529.0,
"step": 7005
},
{
"entropy": 5.597944164276123,
"epoch": 0.5454191791480256,
"grad_norm": 1.296875,
"learning_rate": 0.0004975390273824512,
"loss": 5.4113,
"mean_token_accuracy": 0.16376460194587708,
"num_tokens": 12165233.0,
"step": 7010
},
{
"entropy": 5.611815452575684,
"epoch": 0.5458082085197432,
"grad_norm": 1.3203125,
"learning_rate": 0.0004975349376985155,
"loss": 5.6011,
"mean_token_accuracy": 0.15549773424863816,
"num_tokens": 12173260.0,
"step": 7015
},
{
"entropy": 5.673900985717774,
"epoch": 0.5461972378914608,
"grad_norm": 1.328125,
"learning_rate": 0.0004975308446379663,
"loss": 5.6101,
"mean_token_accuracy": 0.15461681336164473,
"num_tokens": 12181676.0,
"step": 7020
},
{
"entropy": 5.6847456932067875,
"epoch": 0.5465862672631784,
"grad_norm": 1.40625,
"learning_rate": 0.0004975267482008657,
"loss": 5.5254,
"mean_token_accuracy": 0.1594758614897728,
"num_tokens": 12189485.0,
"step": 7025
},
{
"entropy": 5.6035644054412845,
"epoch": 0.546975296634896,
"grad_norm": 1.3046875,
"learning_rate": 0.000497522648387276,
"loss": 5.4527,
"mean_token_accuracy": 0.16365523785352706,
"num_tokens": 12198429.0,
"step": 7030
},
{
"entropy": 5.577117395401001,
"epoch": 0.5473643260066134,
"grad_norm": 1.40625,
"learning_rate": 0.0004975185451972592,
"loss": 5.572,
"mean_token_accuracy": 0.16115963011980056,
"num_tokens": 12207404.0,
"step": 7035
},
{
"entropy": 5.701930236816406,
"epoch": 0.547753355378331,
"grad_norm": 1.2421875,
"learning_rate": 0.0004975144386308776,
"loss": 5.5479,
"mean_token_accuracy": 0.15822896361351013,
"num_tokens": 12216301.0,
"step": 7040
},
{
"entropy": 5.591483783721924,
"epoch": 0.5481423847500486,
"grad_norm": 1.3359375,
"learning_rate": 0.0004975103286881936,
"loss": 5.5384,
"mean_token_accuracy": 0.16383027136325837,
"num_tokens": 12224873.0,
"step": 7045
},
{
"entropy": 5.612608337402344,
"epoch": 0.5485314141217662,
"grad_norm": 1.2890625,
"learning_rate": 0.0004975062153692696,
"loss": 5.5158,
"mean_token_accuracy": 0.1623031973838806,
"num_tokens": 12233439.0,
"step": 7050
},
{
"entropy": 5.694883489608765,
"epoch": 0.5489204434934838,
"grad_norm": 1.390625,
"learning_rate": 0.0004975020986741678,
"loss": 5.5703,
"mean_token_accuracy": 0.15239009335637094,
"num_tokens": 12242235.0,
"step": 7055
},
{
"entropy": 5.609505271911621,
"epoch": 0.5493094728652014,
"grad_norm": 1.4296875,
"learning_rate": 0.0004974979786029509,
"loss": 5.5242,
"mean_token_accuracy": 0.16340847909450532,
"num_tokens": 12251295.0,
"step": 7060
},
{
"entropy": 5.638507509231568,
"epoch": 0.5496985022369189,
"grad_norm": 1.34375,
"learning_rate": 0.0004974938551556814,
"loss": 5.4621,
"mean_token_accuracy": 0.1659865766763687,
"num_tokens": 12260130.0,
"step": 7065
},
{
"entropy": 5.6084636688232425,
"epoch": 0.5500875316086364,
"grad_norm": 1.265625,
"learning_rate": 0.0004974897283324217,
"loss": 5.5148,
"mean_token_accuracy": 0.160197813808918,
"num_tokens": 12269542.0,
"step": 7070
},
{
"entropy": 5.6162344455719,
"epoch": 0.550476560980354,
"grad_norm": 1.3515625,
"learning_rate": 0.0004974855981332343,
"loss": 5.6004,
"mean_token_accuracy": 0.16120688617229462,
"num_tokens": 12278174.0,
"step": 7075
},
{
"entropy": 5.673370409011841,
"epoch": 0.5508655903520716,
"grad_norm": 1.3203125,
"learning_rate": 0.0004974814645581823,
"loss": 5.6678,
"mean_token_accuracy": 0.15251821428537368,
"num_tokens": 12287651.0,
"step": 7080
},
{
"entropy": 5.763124084472656,
"epoch": 0.5512546197237892,
"grad_norm": 1.3515625,
"learning_rate": 0.0004974773276073282,
"loss": 5.6438,
"mean_token_accuracy": 0.15593429803848266,
"num_tokens": 12296009.0,
"step": 7085
},
{
"entropy": 5.612685346603394,
"epoch": 0.5516436490955067,
"grad_norm": 1.390625,
"learning_rate": 0.0004974731872807347,
"loss": 5.5443,
"mean_token_accuracy": 0.15328624844551086,
"num_tokens": 12305406.0,
"step": 7090
},
{
"entropy": 5.6309099197387695,
"epoch": 0.5520326784672243,
"grad_norm": 1.296875,
"learning_rate": 0.0004974690435784647,
"loss": 5.5797,
"mean_token_accuracy": 0.15415759533643722,
"num_tokens": 12314169.0,
"step": 7095
},
{
"entropy": 5.598780250549316,
"epoch": 0.5524217078389418,
"grad_norm": 1.3984375,
"learning_rate": 0.0004974648965005811,
"loss": 5.4733,
"mean_token_accuracy": 0.16661957502365113,
"num_tokens": 12323019.0,
"step": 7100
},
{
"entropy": 5.621094560623169,
"epoch": 0.5528107372106594,
"grad_norm": 1.5390625,
"learning_rate": 0.0004974607460471466,
"loss": 5.5827,
"mean_token_accuracy": 0.1506951481103897,
"num_tokens": 12331491.0,
"step": 7105
},
{
"entropy": 5.62510232925415,
"epoch": 0.553199766582377,
"grad_norm": 1.40625,
"learning_rate": 0.0004974565922182246,
"loss": 5.5438,
"mean_token_accuracy": 0.15989115089178085,
"num_tokens": 12339647.0,
"step": 7110
},
{
"entropy": 5.607163286209106,
"epoch": 0.5535887959540945,
"grad_norm": 1.484375,
"learning_rate": 0.0004974524350138777,
"loss": 5.522,
"mean_token_accuracy": 0.15979181230068207,
"num_tokens": 12348469.0,
"step": 7115
},
{
"entropy": 5.6572285175323485,
"epoch": 0.5539778253258121,
"grad_norm": 1.40625,
"learning_rate": 0.0004974482744341693,
"loss": 5.4974,
"mean_token_accuracy": 0.16333761662244797,
"num_tokens": 12357168.0,
"step": 7120
},
{
"entropy": 5.534380054473877,
"epoch": 0.5543668546975297,
"grad_norm": 1.3828125,
"learning_rate": 0.0004974441104791624,
"loss": 5.4967,
"mean_token_accuracy": 0.1589392438530922,
"num_tokens": 12365750.0,
"step": 7125
},
{
"entropy": 5.601346969604492,
"epoch": 0.5547558840692473,
"grad_norm": 1.515625,
"learning_rate": 0.0004974399431489201,
"loss": 5.5427,
"mean_token_accuracy": 0.15742712914943696,
"num_tokens": 12374086.0,
"step": 7130
},
{
"entropy": 5.660343980789184,
"epoch": 0.5551449134409648,
"grad_norm": 1.3828125,
"learning_rate": 0.0004974357724435057,
"loss": 5.4835,
"mean_token_accuracy": 0.16328005641698837,
"num_tokens": 12381997.0,
"step": 7135
},
{
"entropy": 5.676285028457642,
"epoch": 0.5555339428126823,
"grad_norm": 1.3515625,
"learning_rate": 0.0004974315983629825,
"loss": 5.5817,
"mean_token_accuracy": 0.1614387571811676,
"num_tokens": 12391083.0,
"step": 7140
},
{
"entropy": 5.644300699234009,
"epoch": 0.5559229721843999,
"grad_norm": 1.3984375,
"learning_rate": 0.0004974274209074139,
"loss": 5.497,
"mean_token_accuracy": 0.16053244918584825,
"num_tokens": 12400016.0,
"step": 7145
},
{
"entropy": 5.698569917678833,
"epoch": 0.5563120015561175,
"grad_norm": 1.3828125,
"learning_rate": 0.0004974232400768632,
"loss": 5.6068,
"mean_token_accuracy": 0.15869893729686738,
"num_tokens": 12409255.0,
"step": 7150
},
{
"entropy": 5.660106754302978,
"epoch": 0.5567010309278351,
"grad_norm": 1.2890625,
"learning_rate": 0.0004974190558713939,
"loss": 5.4848,
"mean_token_accuracy": 0.16400493532419205,
"num_tokens": 12417765.0,
"step": 7155
},
{
"entropy": 5.702695846557617,
"epoch": 0.5570900602995527,
"grad_norm": 1.3203125,
"learning_rate": 0.0004974148682910694,
"loss": 5.7475,
"mean_token_accuracy": 0.1424033060669899,
"num_tokens": 12427588.0,
"step": 7160
},
{
"entropy": 5.648605871200561,
"epoch": 0.5574790896712701,
"grad_norm": 1.3671875,
"learning_rate": 0.0004974106773359533,
"loss": 5.4138,
"mean_token_accuracy": 0.16430372297763823,
"num_tokens": 12435773.0,
"step": 7165
},
{
"entropy": 5.619985103607178,
"epoch": 0.5578681190429877,
"grad_norm": 1.7421875,
"learning_rate": 0.0004974064830061091,
"loss": 5.5464,
"mean_token_accuracy": 0.16402772665023804,
"num_tokens": 12443837.0,
"step": 7170
},
{
"entropy": 5.6071559429168705,
"epoch": 0.5582571484147053,
"grad_norm": 1.375,
"learning_rate": 0.0004974022853016006,
"loss": 5.5454,
"mean_token_accuracy": 0.16198388189077378,
"num_tokens": 12452945.0,
"step": 7175
},
{
"entropy": 5.632401609420777,
"epoch": 0.5586461777864229,
"grad_norm": 1.6171875,
"learning_rate": 0.0004973980842224913,
"loss": 5.475,
"mean_token_accuracy": 0.16739387661218644,
"num_tokens": 12461008.0,
"step": 7180
},
{
"entropy": 5.5655022144317625,
"epoch": 0.5590352071581405,
"grad_norm": 1.3984375,
"learning_rate": 0.0004973938797688452,
"loss": 5.4734,
"mean_token_accuracy": 0.156940957903862,
"num_tokens": 12469314.0,
"step": 7185
},
{
"entropy": 5.636973476409912,
"epoch": 0.559424236529858,
"grad_norm": 1.5625,
"learning_rate": 0.0004973896719407259,
"loss": 5.4887,
"mean_token_accuracy": 0.1571099802851677,
"num_tokens": 12477540.0,
"step": 7190
},
{
"entropy": 5.62240891456604,
"epoch": 0.5598132659015755,
"grad_norm": 1.4296875,
"learning_rate": 0.0004973854607381972,
"loss": 5.5421,
"mean_token_accuracy": 0.16325449496507644,
"num_tokens": 12486894.0,
"step": 7195
},
{
"entropy": 5.655526065826416,
"epoch": 0.5602022952732931,
"grad_norm": 1.375,
"learning_rate": 0.0004973812461613232,
"loss": 5.5413,
"mean_token_accuracy": 0.15660593509674073,
"num_tokens": 12496213.0,
"step": 7200
},
{
"entropy": 5.592194223403931,
"epoch": 0.5605913246450107,
"grad_norm": 1.328125,
"learning_rate": 0.0004973770282101677,
"loss": 5.5315,
"mean_token_accuracy": 0.15898202806711198,
"num_tokens": 12504160.0,
"step": 7205
},
{
"entropy": 5.54472541809082,
"epoch": 0.5609803540167283,
"grad_norm": 1.4921875,
"learning_rate": 0.0004973728068847947,
"loss": 5.474,
"mean_token_accuracy": 0.16442665830254555,
"num_tokens": 12511915.0,
"step": 7210
},
{
"entropy": 5.639721298217774,
"epoch": 0.5613693833884458,
"grad_norm": 1.328125,
"learning_rate": 0.0004973685821852684,
"loss": 5.5125,
"mean_token_accuracy": 0.159575916826725,
"num_tokens": 12520400.0,
"step": 7215
},
{
"entropy": 5.580363988876343,
"epoch": 0.5617584127601634,
"grad_norm": 1.2734375,
"learning_rate": 0.0004973643541116528,
"loss": 5.4226,
"mean_token_accuracy": 0.168043652176857,
"num_tokens": 12528724.0,
"step": 7220
},
{
"entropy": 5.648554515838623,
"epoch": 0.562147442131881,
"grad_norm": 1.3203125,
"learning_rate": 0.000497360122664012,
"loss": 5.6009,
"mean_token_accuracy": 0.15417485386133195,
"num_tokens": 12537378.0,
"step": 7225
},
{
"entropy": 5.626233673095703,
"epoch": 0.5625364715035985,
"grad_norm": 1.234375,
"learning_rate": 0.0004973558878424104,
"loss": 5.5328,
"mean_token_accuracy": 0.16310097873210908,
"num_tokens": 12546080.0,
"step": 7230
},
{
"entropy": 5.6941893100738525,
"epoch": 0.5629255008753161,
"grad_norm": 1.2734375,
"learning_rate": 0.0004973516496469119,
"loss": 5.5547,
"mean_token_accuracy": 0.16019777953624725,
"num_tokens": 12554526.0,
"step": 7235
},
{
"entropy": 5.63044319152832,
"epoch": 0.5633145302470336,
"grad_norm": 1.5390625,
"learning_rate": 0.0004973474080775811,
"loss": 5.5093,
"mean_token_accuracy": 0.16128407865762712,
"num_tokens": 12563018.0,
"step": 7240
},
{
"entropy": 5.627581405639648,
"epoch": 0.5637035596187512,
"grad_norm": 1.3984375,
"learning_rate": 0.0004973431631344824,
"loss": 5.567,
"mean_token_accuracy": 0.1591254025697708,
"num_tokens": 12571611.0,
"step": 7245
},
{
"entropy": 5.698124742507934,
"epoch": 0.5640925889904688,
"grad_norm": 1.2421875,
"learning_rate": 0.00049733891481768,
"loss": 5.635,
"mean_token_accuracy": 0.15900451242923735,
"num_tokens": 12580168.0,
"step": 7250
},
{
"entropy": 5.620501375198364,
"epoch": 0.5644816183621864,
"grad_norm": 1.3203125,
"learning_rate": 0.0004973346631272384,
"loss": 5.5396,
"mean_token_accuracy": 0.1586569592356682,
"num_tokens": 12589843.0,
"step": 7255
},
{
"entropy": 5.712000942230224,
"epoch": 0.5648706477339039,
"grad_norm": 1.3515625,
"learning_rate": 0.0004973304080632222,
"loss": 5.5776,
"mean_token_accuracy": 0.1545659400522709,
"num_tokens": 12598219.0,
"step": 7260
},
{
"entropy": 5.625898599624634,
"epoch": 0.5652596771056215,
"grad_norm": 1.359375,
"learning_rate": 0.000497326149625696,
"loss": 5.5644,
"mean_token_accuracy": 0.16191482096910476,
"num_tokens": 12606665.0,
"step": 7265
},
{
"entropy": 5.556368732452393,
"epoch": 0.565648706477339,
"grad_norm": 1.5625,
"learning_rate": 0.0004973218878147244,
"loss": 5.4893,
"mean_token_accuracy": 0.16165162175893782,
"num_tokens": 12615062.0,
"step": 7270
},
{
"entropy": 5.701360082626342,
"epoch": 0.5660377358490566,
"grad_norm": 1.3125,
"learning_rate": 0.0004973176226303719,
"loss": 5.5805,
"mean_token_accuracy": 0.1605806604027748,
"num_tokens": 12623923.0,
"step": 7275
},
{
"entropy": 5.665620994567871,
"epoch": 0.5664267652207742,
"grad_norm": 1.4765625,
"learning_rate": 0.0004973133540727033,
"loss": 5.4939,
"mean_token_accuracy": 0.15362900421023368,
"num_tokens": 12632579.0,
"step": 7280
},
{
"entropy": 5.6012444496154785,
"epoch": 0.5668157945924918,
"grad_norm": 1.484375,
"learning_rate": 0.0004973090821417835,
"loss": 5.4818,
"mean_token_accuracy": 0.161869415640831,
"num_tokens": 12640847.0,
"step": 7285
},
{
"entropy": 5.6269035816192625,
"epoch": 0.5672048239642093,
"grad_norm": 1.3828125,
"learning_rate": 0.0004973048068376772,
"loss": 5.4605,
"mean_token_accuracy": 0.1663483962416649,
"num_tokens": 12649020.0,
"step": 7290
},
{
"entropy": 5.498252439498901,
"epoch": 0.5675938533359268,
"grad_norm": 1.25,
"learning_rate": 0.0004973005281604492,
"loss": 5.3791,
"mean_token_accuracy": 0.16371892839670182,
"num_tokens": 12657569.0,
"step": 7295
},
{
"entropy": 5.70664758682251,
"epoch": 0.5679828827076444,
"grad_norm": 1.3984375,
"learning_rate": 0.0004972962461101646,
"loss": 5.6503,
"mean_token_accuracy": 0.14907950535416603,
"num_tokens": 12666681.0,
"step": 7300
},
{
"entropy": 5.640994834899902,
"epoch": 0.568371912079362,
"grad_norm": 1.2890625,
"learning_rate": 0.0004972919606868883,
"loss": 5.4688,
"mean_token_accuracy": 0.1601715177297592,
"num_tokens": 12675210.0,
"step": 7305
},
{
"entropy": 5.625789308547974,
"epoch": 0.5687609414510796,
"grad_norm": 1.3515625,
"learning_rate": 0.0004972876718906852,
"loss": 5.5133,
"mean_token_accuracy": 0.1565352126955986,
"num_tokens": 12684019.0,
"step": 7310
},
{
"entropy": 5.622615385055542,
"epoch": 0.5691499708227972,
"grad_norm": 1.359375,
"learning_rate": 0.0004972833797216206,
"loss": 5.5633,
"mean_token_accuracy": 0.14711394608020784,
"num_tokens": 12692891.0,
"step": 7315
},
{
"entropy": 5.657730054855347,
"epoch": 0.5695390001945146,
"grad_norm": 1.640625,
"learning_rate": 0.0004972790841797595,
"loss": 5.4749,
"mean_token_accuracy": 0.16254037916660308,
"num_tokens": 12700606.0,
"step": 7320
},
{
"entropy": 5.584020566940308,
"epoch": 0.5699280295662322,
"grad_norm": 1.546875,
"learning_rate": 0.000497274785265167,
"loss": 5.5761,
"mean_token_accuracy": 0.15465729534626008,
"num_tokens": 12709116.0,
"step": 7325
},
{
"entropy": 5.620603036880493,
"epoch": 0.5703170589379498,
"grad_norm": 1.578125,
"learning_rate": 0.0004972704829779086,
"loss": 5.515,
"mean_token_accuracy": 0.16086004823446273,
"num_tokens": 12717484.0,
"step": 7330
},
{
"entropy": 5.5484014511108395,
"epoch": 0.5707060883096674,
"grad_norm": 1.3828125,
"learning_rate": 0.0004972661773180492,
"loss": 5.4495,
"mean_token_accuracy": 0.1614287480711937,
"num_tokens": 12726216.0,
"step": 7335
},
{
"entropy": 5.596465110778809,
"epoch": 0.571095117681385,
"grad_norm": 1.65625,
"learning_rate": 0.0004972618682856545,
"loss": 5.446,
"mean_token_accuracy": 0.1665715456008911,
"num_tokens": 12735312.0,
"step": 7340
},
{
"entropy": 5.606229066848755,
"epoch": 0.5714841470531025,
"grad_norm": 1.234375,
"learning_rate": 0.0004972575558807896,
"loss": 5.5775,
"mean_token_accuracy": 0.15633748471736908,
"num_tokens": 12744641.0,
"step": 7345
},
{
"entropy": 5.665216493606567,
"epoch": 0.57187317642482,
"grad_norm": 1.3125,
"learning_rate": 0.0004972532401035201,
"loss": 5.5346,
"mean_token_accuracy": 0.15907908231019974,
"num_tokens": 12753951.0,
"step": 7350
},
{
"entropy": 5.723617362976074,
"epoch": 0.5722622057965376,
"grad_norm": 1.4296875,
"learning_rate": 0.0004972489209539114,
"loss": 5.5512,
"mean_token_accuracy": 0.16019677892327308,
"num_tokens": 12762571.0,
"step": 7355
},
{
"entropy": 5.712904691696167,
"epoch": 0.5726512351682552,
"grad_norm": 1.2109375,
"learning_rate": 0.0004972445984320292,
"loss": 5.6205,
"mean_token_accuracy": 0.15869905799627304,
"num_tokens": 12771275.0,
"step": 7360
},
{
"entropy": 5.674981260299683,
"epoch": 0.5730402645399728,
"grad_norm": 1.3203125,
"learning_rate": 0.0004972402725379388,
"loss": 5.5153,
"mean_token_accuracy": 0.1596535786986351,
"num_tokens": 12780488.0,
"step": 7365
},
{
"entropy": 5.6578387260437015,
"epoch": 0.5734292939116903,
"grad_norm": 1.34375,
"learning_rate": 0.000497235943271706,
"loss": 5.5456,
"mean_token_accuracy": 0.1624777302145958,
"num_tokens": 12788588.0,
"step": 7370
},
{
"entropy": 5.560195541381836,
"epoch": 0.5738183232834079,
"grad_norm": 1.4140625,
"learning_rate": 0.0004972316106333966,
"loss": 5.4871,
"mean_token_accuracy": 0.1583039477467537,
"num_tokens": 12797010.0,
"step": 7375
},
{
"entropy": 5.672476291656494,
"epoch": 0.5742073526551255,
"grad_norm": 1.2578125,
"learning_rate": 0.0004972272746230761,
"loss": 5.5737,
"mean_token_accuracy": 0.16159822195768356,
"num_tokens": 12805430.0,
"step": 7380
},
{
"entropy": 5.699739456176758,
"epoch": 0.574596382026843,
"grad_norm": 1.3984375,
"learning_rate": 0.0004972229352408104,
"loss": 5.5415,
"mean_token_accuracy": 0.16303423792123795,
"num_tokens": 12813912.0,
"step": 7385
},
{
"entropy": 5.688510894775391,
"epoch": 0.5749854113985606,
"grad_norm": 1.2890625,
"learning_rate": 0.0004972185924866655,
"loss": 5.5546,
"mean_token_accuracy": 0.15873103514313697,
"num_tokens": 12822421.0,
"step": 7390
},
{
"entropy": 5.554236936569214,
"epoch": 0.5753744407702781,
"grad_norm": 1.3671875,
"learning_rate": 0.0004972142463607071,
"loss": 5.4408,
"mean_token_accuracy": 0.16305190920829774,
"num_tokens": 12830670.0,
"step": 7395
},
{
"entropy": 5.625152826309204,
"epoch": 0.5757634701419957,
"grad_norm": 1.3046875,
"learning_rate": 0.0004972098968630012,
"loss": 5.5553,
"mean_token_accuracy": 0.16401876807212828,
"num_tokens": 12839887.0,
"step": 7400
},
{
"entropy": 5.5732255458831785,
"epoch": 0.5761524995137133,
"grad_norm": 1.2578125,
"learning_rate": 0.0004972055439936137,
"loss": 5.4636,
"mean_token_accuracy": 0.16273102313280105,
"num_tokens": 12848028.0,
"step": 7405
},
{
"entropy": 5.571136522293091,
"epoch": 0.5765415288854309,
"grad_norm": 1.2109375,
"learning_rate": 0.0004972011877526109,
"loss": 5.4718,
"mean_token_accuracy": 0.1594846174120903,
"num_tokens": 12857248.0,
"step": 7410
},
{
"entropy": 5.621489238739014,
"epoch": 0.5769305582571485,
"grad_norm": 1.2890625,
"learning_rate": 0.0004971968281400587,
"loss": 5.4828,
"mean_token_accuracy": 0.1662975862622261,
"num_tokens": 12866352.0,
"step": 7415
},
{
"entropy": 5.666937637329101,
"epoch": 0.5773195876288659,
"grad_norm": 1.671875,
"learning_rate": 0.0004971924651560233,
"loss": 5.5766,
"mean_token_accuracy": 0.15306324139237404,
"num_tokens": 12874548.0,
"step": 7420
},
{
"entropy": 5.623528480529785,
"epoch": 0.5777086170005835,
"grad_norm": 1.609375,
"learning_rate": 0.0004971880988005709,
"loss": 5.3968,
"mean_token_accuracy": 0.16885466426610946,
"num_tokens": 12883172.0,
"step": 7425
},
{
"entropy": 5.517974090576172,
"epoch": 0.5780976463723011,
"grad_norm": 1.40625,
"learning_rate": 0.0004971837290737677,
"loss": 5.48,
"mean_token_accuracy": 0.16351478695869445,
"num_tokens": 12891776.0,
"step": 7430
},
{
"entropy": 5.5739844799041744,
"epoch": 0.5784866757440187,
"grad_norm": 1.3515625,
"learning_rate": 0.0004971793559756801,
"loss": 5.4198,
"mean_token_accuracy": 0.16615208461880684,
"num_tokens": 12900530.0,
"step": 7435
},
{
"entropy": 5.5704282283782955,
"epoch": 0.5788757051157363,
"grad_norm": 1.3671875,
"learning_rate": 0.0004971749795063744,
"loss": 5.4675,
"mean_token_accuracy": 0.16340652704238892,
"num_tokens": 12909260.0,
"step": 7440
},
{
"entropy": 5.615681982040405,
"epoch": 0.5792647344874537,
"grad_norm": 1.328125,
"learning_rate": 0.000497170599665917,
"loss": 5.4631,
"mean_token_accuracy": 0.15883395224809646,
"num_tokens": 12918143.0,
"step": 7445
},
{
"entropy": 5.6724207401275635,
"epoch": 0.5796537638591713,
"grad_norm": 1.421875,
"learning_rate": 0.0004971662164543743,
"loss": 5.5346,
"mean_token_accuracy": 0.16386547535657883,
"num_tokens": 12926361.0,
"step": 7450
},
{
"entropy": 5.593789339065552,
"epoch": 0.5800427932308889,
"grad_norm": 1.53125,
"learning_rate": 0.0004971618298718131,
"loss": 5.4645,
"mean_token_accuracy": 0.16232849061489105,
"num_tokens": 12935080.0,
"step": 7455
},
{
"entropy": 5.644500350952148,
"epoch": 0.5804318226026065,
"grad_norm": 1.4453125,
"learning_rate": 0.0004971574399182995,
"loss": 5.6323,
"mean_token_accuracy": 0.15592513233423233,
"num_tokens": 12944078.0,
"step": 7460
},
{
"entropy": 5.635997152328491,
"epoch": 0.5808208519743241,
"grad_norm": 1.6015625,
"learning_rate": 0.0004971530465939005,
"loss": 5.548,
"mean_token_accuracy": 0.1559380941092968,
"num_tokens": 12952800.0,
"step": 7465
},
{
"entropy": 5.724119472503662,
"epoch": 0.5812098813460417,
"grad_norm": 1.515625,
"learning_rate": 0.0004971486498986825,
"loss": 5.6344,
"mean_token_accuracy": 0.15321501046419145,
"num_tokens": 12962402.0,
"step": 7470
},
{
"entropy": 5.621135282516479,
"epoch": 0.5815989107177592,
"grad_norm": 1.296875,
"learning_rate": 0.0004971442498327124,
"loss": 5.4026,
"mean_token_accuracy": 0.16943953484296798,
"num_tokens": 12971116.0,
"step": 7475
},
{
"entropy": 5.5255170345306395,
"epoch": 0.5819879400894767,
"grad_norm": 1.4453125,
"learning_rate": 0.0004971398463960568,
"loss": 5.5058,
"mean_token_accuracy": 0.1556493379175663,
"num_tokens": 12979570.0,
"step": 7480
},
{
"entropy": 5.673506450653076,
"epoch": 0.5823769694611943,
"grad_norm": 1.578125,
"learning_rate": 0.0004971354395887827,
"loss": 5.5064,
"mean_token_accuracy": 0.16239574402570725,
"num_tokens": 12987942.0,
"step": 7485
},
{
"entropy": 5.678384733200073,
"epoch": 0.5827659988329119,
"grad_norm": 1.6328125,
"learning_rate": 0.0004971310294109569,
"loss": 5.5726,
"mean_token_accuracy": 0.15900402516126633,
"num_tokens": 12996499.0,
"step": 7490
},
{
"entropy": 5.596940183639527,
"epoch": 0.5831550282046295,
"grad_norm": 1.2734375,
"learning_rate": 0.0004971266158626461,
"loss": 5.5215,
"mean_token_accuracy": 0.16408492773771285,
"num_tokens": 13005622.0,
"step": 7495
},
{
"entropy": 5.666322374343872,
"epoch": 0.583544057576347,
"grad_norm": 1.3984375,
"learning_rate": 0.0004971221989439177,
"loss": 5.5131,
"mean_token_accuracy": 0.1555515393614769,
"num_tokens": 13014417.0,
"step": 7500
},
{
"entropy": 5.591904401779175,
"epoch": 0.5839330869480646,
"grad_norm": 1.7734375,
"learning_rate": 0.0004971177786548384,
"loss": 5.4505,
"mean_token_accuracy": 0.1593570254743099,
"num_tokens": 13022887.0,
"step": 7505
},
{
"entropy": 5.598121070861817,
"epoch": 0.5843221163197821,
"grad_norm": 1.3203125,
"learning_rate": 0.0004971133549954753,
"loss": 5.5523,
"mean_token_accuracy": 0.15993799567222594,
"num_tokens": 13031676.0,
"step": 7510
},
{
"entropy": 5.591425514221191,
"epoch": 0.5847111456914997,
"grad_norm": 1.40625,
"learning_rate": 0.0004971089279658954,
"loss": 5.5058,
"mean_token_accuracy": 0.1619194507598877,
"num_tokens": 13040489.0,
"step": 7515
},
{
"entropy": 5.681172895431518,
"epoch": 0.5851001750632173,
"grad_norm": 1.3515625,
"learning_rate": 0.0004971044975661663,
"loss": 5.4316,
"mean_token_accuracy": 0.16690255403518678,
"num_tokens": 13048280.0,
"step": 7520
},
{
"entropy": 5.5702001571655275,
"epoch": 0.5854892044349348,
"grad_norm": 1.484375,
"learning_rate": 0.0004971000637963549,
"loss": 5.4192,
"mean_token_accuracy": 0.1744627207517624,
"num_tokens": 13056471.0,
"step": 7525
},
{
"entropy": 5.584231662750244,
"epoch": 0.5858782338066524,
"grad_norm": 1.421875,
"learning_rate": 0.0004970956266565285,
"loss": 5.6039,
"mean_token_accuracy": 0.15952491909265518,
"num_tokens": 13065289.0,
"step": 7530
},
{
"entropy": 5.666153907775879,
"epoch": 0.58626726317837,
"grad_norm": 1.703125,
"learning_rate": 0.0004970911861467544,
"loss": 5.6199,
"mean_token_accuracy": 0.15906012058258057,
"num_tokens": 13073648.0,
"step": 7535
},
{
"entropy": 5.713760423660278,
"epoch": 0.5866562925500876,
"grad_norm": 1.4140625,
"learning_rate": 0.0004970867422671002,
"loss": 5.6328,
"mean_token_accuracy": 0.15964424088597298,
"num_tokens": 13082205.0,
"step": 7540
},
{
"entropy": 5.688720226287842,
"epoch": 0.5870453219218051,
"grad_norm": 1.640625,
"learning_rate": 0.000497082295017633,
"loss": 5.5039,
"mean_token_accuracy": 0.15762317776679993,
"num_tokens": 13090970.0,
"step": 7545
},
{
"entropy": 5.660140466690064,
"epoch": 0.5874343512935226,
"grad_norm": 1.640625,
"learning_rate": 0.0004970778443984206,
"loss": 5.408,
"mean_token_accuracy": 0.16850501745939256,
"num_tokens": 13098290.0,
"step": 7550
},
{
"entropy": 5.521188640594483,
"epoch": 0.5878233806652402,
"grad_norm": 1.2890625,
"learning_rate": 0.0004970733904095303,
"loss": 5.3654,
"mean_token_accuracy": 0.1694828599691391,
"num_tokens": 13106971.0,
"step": 7555
},
{
"entropy": 5.6553733348846436,
"epoch": 0.5882124100369578,
"grad_norm": 1.3515625,
"learning_rate": 0.0004970689330510298,
"loss": 5.6533,
"mean_token_accuracy": 0.15376500338315963,
"num_tokens": 13115742.0,
"step": 7560
},
{
"entropy": 5.676582717895508,
"epoch": 0.5886014394086754,
"grad_norm": 1.5625,
"learning_rate": 0.0004970644723229868,
"loss": 5.6128,
"mean_token_accuracy": 0.15956298857927323,
"num_tokens": 13124192.0,
"step": 7565
},
{
"entropy": 5.625477743148804,
"epoch": 0.588990468780393,
"grad_norm": 1.375,
"learning_rate": 0.0004970600082254687,
"loss": 5.4197,
"mean_token_accuracy": 0.16239960491657257,
"num_tokens": 13133510.0,
"step": 7570
},
{
"entropy": 5.592658853530883,
"epoch": 0.5893794981521104,
"grad_norm": 1.546875,
"learning_rate": 0.0004970555407585436,
"loss": 5.5552,
"mean_token_accuracy": 0.1599623069167137,
"num_tokens": 13141704.0,
"step": 7575
},
{
"entropy": 5.518377590179443,
"epoch": 0.589768527523828,
"grad_norm": 1.5625,
"learning_rate": 0.000497051069922279,
"loss": 5.4366,
"mean_token_accuracy": 0.15510185062885284,
"num_tokens": 13150559.0,
"step": 7580
},
{
"entropy": 5.581053924560547,
"epoch": 0.5901575568955456,
"grad_norm": 1.5078125,
"learning_rate": 0.0004970465957167429,
"loss": 5.4834,
"mean_token_accuracy": 0.15990304946899414,
"num_tokens": 13159428.0,
"step": 7585
},
{
"entropy": 5.644467401504516,
"epoch": 0.5905465862672632,
"grad_norm": 1.5390625,
"learning_rate": 0.000497042118142003,
"loss": 5.6244,
"mean_token_accuracy": 0.15349241942167283,
"num_tokens": 13168299.0,
"step": 7590
},
{
"entropy": 5.6267036437988285,
"epoch": 0.5909356156389808,
"grad_norm": 1.359375,
"learning_rate": 0.0004970376371981275,
"loss": 5.4908,
"mean_token_accuracy": 0.15986540913581848,
"num_tokens": 13176906.0,
"step": 7595
},
{
"entropy": 5.735187244415283,
"epoch": 0.5913246450106983,
"grad_norm": 1.390625,
"learning_rate": 0.0004970331528851842,
"loss": 5.5883,
"mean_token_accuracy": 0.15484750866889954,
"num_tokens": 13186180.0,
"step": 7600
},
{
"entropy": 5.550314044952392,
"epoch": 0.5917136743824158,
"grad_norm": 1.4453125,
"learning_rate": 0.0004970286652032412,
"loss": 5.4165,
"mean_token_accuracy": 0.16556940227746964,
"num_tokens": 13195111.0,
"step": 7605
},
{
"entropy": 5.586171960830688,
"epoch": 0.5921027037541334,
"grad_norm": 1.3984375,
"learning_rate": 0.0004970241741523667,
"loss": 5.4881,
"mean_token_accuracy": 0.15955300033092498,
"num_tokens": 13204170.0,
"step": 7610
},
{
"entropy": 5.677660846710205,
"epoch": 0.592491733125851,
"grad_norm": 1.546875,
"learning_rate": 0.0004970196797326286,
"loss": 5.5105,
"mean_token_accuracy": 0.15856559723615646,
"num_tokens": 13213479.0,
"step": 7615
},
{
"entropy": 5.639448738098144,
"epoch": 0.5928807624975686,
"grad_norm": 1.3359375,
"learning_rate": 0.0004970151819440955,
"loss": 5.5509,
"mean_token_accuracy": 0.15828660875558853,
"num_tokens": 13222182.0,
"step": 7620
},
{
"entropy": 5.531005382537842,
"epoch": 0.5932697918692861,
"grad_norm": 1.2578125,
"learning_rate": 0.0004970106807868351,
"loss": 5.4032,
"mean_token_accuracy": 0.16099072992801666,
"num_tokens": 13230681.0,
"step": 7625
},
{
"entropy": 5.700342130661011,
"epoch": 0.5936588212410037,
"grad_norm": 1.375,
"learning_rate": 0.000497006176260916,
"loss": 5.5912,
"mean_token_accuracy": 0.1595593973994255,
"num_tokens": 13239254.0,
"step": 7630
},
{
"entropy": 5.617882537841797,
"epoch": 0.5940478506127213,
"grad_norm": 1.390625,
"learning_rate": 0.0004970016683664068,
"loss": 5.4469,
"mean_token_accuracy": 0.16579967588186265,
"num_tokens": 13248317.0,
"step": 7635
},
{
"entropy": 5.654610681533813,
"epoch": 0.5944368799844388,
"grad_norm": 1.921875,
"learning_rate": 0.0004969971571033754,
"loss": 5.5053,
"mean_token_accuracy": 0.15919456630945206,
"num_tokens": 13256977.0,
"step": 7640
},
{
"entropy": 5.615067386627198,
"epoch": 0.5948259093561564,
"grad_norm": 1.5,
"learning_rate": 0.0004969926424718906,
"loss": 5.5841,
"mean_token_accuracy": 0.15947894304990767,
"num_tokens": 13266012.0,
"step": 7645
},
{
"entropy": 5.707496690750122,
"epoch": 0.5952149387278739,
"grad_norm": 1.3984375,
"learning_rate": 0.0004969881244720207,
"loss": 5.6046,
"mean_token_accuracy": 0.1607809454202652,
"num_tokens": 13275248.0,
"step": 7650
},
{
"entropy": 5.637995338439941,
"epoch": 0.5956039680995915,
"grad_norm": 1.390625,
"learning_rate": 0.0004969836031038343,
"loss": 5.4403,
"mean_token_accuracy": 0.1559646725654602,
"num_tokens": 13284235.0,
"step": 7655
},
{
"entropy": 5.573863458633423,
"epoch": 0.5959929974713091,
"grad_norm": 1.390625,
"learning_rate": 0.0004969790783674002,
"loss": 5.5246,
"mean_token_accuracy": 0.1523687422275543,
"num_tokens": 13292423.0,
"step": 7660
},
{
"entropy": 5.6371039867401125,
"epoch": 0.5963820268430267,
"grad_norm": 1.328125,
"learning_rate": 0.0004969745502627868,
"loss": 5.5628,
"mean_token_accuracy": 0.15199742317199708,
"num_tokens": 13300936.0,
"step": 7665
},
{
"entropy": 5.552597761154175,
"epoch": 0.5967710562147442,
"grad_norm": 1.3125,
"learning_rate": 0.0004969700187900629,
"loss": 5.3773,
"mean_token_accuracy": 0.17030118703842162,
"num_tokens": 13308881.0,
"step": 7670
},
{
"entropy": 5.61635012626648,
"epoch": 0.5971600855864618,
"grad_norm": 1.375,
"learning_rate": 0.0004969654839492973,
"loss": 5.5448,
"mean_token_accuracy": 0.15784391164779663,
"num_tokens": 13317864.0,
"step": 7675
},
{
"entropy": 5.657650375366211,
"epoch": 0.5975491149581793,
"grad_norm": 1.4453125,
"learning_rate": 0.0004969609457405588,
"loss": 5.5087,
"mean_token_accuracy": 0.15694525986909866,
"num_tokens": 13326990.0,
"step": 7680
},
{
"entropy": 5.748386859893799,
"epoch": 0.5979381443298969,
"grad_norm": 1.453125,
"learning_rate": 0.0004969564041639163,
"loss": 5.6993,
"mean_token_accuracy": 0.14893480986356736,
"num_tokens": 13336437.0,
"step": 7685
},
{
"entropy": 5.663937950134278,
"epoch": 0.5983271737016145,
"grad_norm": 1.3828125,
"learning_rate": 0.0004969518592194386,
"loss": 5.5151,
"mean_token_accuracy": 0.15797433406114578,
"num_tokens": 13345368.0,
"step": 7690
},
{
"entropy": 5.5918773174285885,
"epoch": 0.5987162030733321,
"grad_norm": 1.2734375,
"learning_rate": 0.0004969473109071946,
"loss": 5.5545,
"mean_token_accuracy": 0.1600046530365944,
"num_tokens": 13354171.0,
"step": 7695
},
{
"entropy": 5.682364416122437,
"epoch": 0.5991052324450497,
"grad_norm": 1.3359375,
"learning_rate": 0.0004969427592272535,
"loss": 5.5552,
"mean_token_accuracy": 0.15920861437916756,
"num_tokens": 13362912.0,
"step": 7700
},
{
"entropy": 5.603416681289673,
"epoch": 0.5994942618167671,
"grad_norm": 1.3984375,
"learning_rate": 0.0004969382041796843,
"loss": 5.4395,
"mean_token_accuracy": 0.1599783182144165,
"num_tokens": 13370913.0,
"step": 7705
},
{
"entropy": 5.660623693466187,
"epoch": 0.5998832911884847,
"grad_norm": 1.953125,
"learning_rate": 0.000496933645764556,
"loss": 5.6038,
"mean_token_accuracy": 0.1545683339238167,
"num_tokens": 13379557.0,
"step": 7710
},
{
"entropy": 5.658495330810547,
"epoch": 0.6002723205602023,
"grad_norm": 1.4140625,
"learning_rate": 0.0004969290839819381,
"loss": 5.511,
"mean_token_accuracy": 0.1654706969857216,
"num_tokens": 13388129.0,
"step": 7715
},
{
"entropy": 5.644501495361328,
"epoch": 0.6006613499319199,
"grad_norm": 1.5078125,
"learning_rate": 0.0004969245188318994,
"loss": 5.6286,
"mean_token_accuracy": 0.15689315497875214,
"num_tokens": 13396713.0,
"step": 7720
},
{
"entropy": 5.6918860912323,
"epoch": 0.6010503793036375,
"grad_norm": 1.3828125,
"learning_rate": 0.0004969199503145093,
"loss": 5.5562,
"mean_token_accuracy": 0.16171080321073533,
"num_tokens": 13406171.0,
"step": 7725
},
{
"entropy": 5.5995087146759035,
"epoch": 0.601439408675355,
"grad_norm": 1.3828125,
"learning_rate": 0.0004969153784298374,
"loss": 5.4815,
"mean_token_accuracy": 0.1628172367811203,
"num_tokens": 13415107.0,
"step": 7730
},
{
"entropy": 5.590442943572998,
"epoch": 0.6018284380470725,
"grad_norm": 1.546875,
"learning_rate": 0.0004969108031779527,
"loss": 5.5996,
"mean_token_accuracy": 0.16061357855796815,
"num_tokens": 13423533.0,
"step": 7735
},
{
"entropy": 5.716766357421875,
"epoch": 0.6022174674187901,
"grad_norm": 1.5390625,
"learning_rate": 0.0004969062245589247,
"loss": 5.565,
"mean_token_accuracy": 0.15467922687530516,
"num_tokens": 13432798.0,
"step": 7740
},
{
"entropy": 5.691170167922974,
"epoch": 0.6026064967905077,
"grad_norm": 1.453125,
"learning_rate": 0.0004969016425728231,
"loss": 5.5097,
"mean_token_accuracy": 0.16404221951961517,
"num_tokens": 13441123.0,
"step": 7745
},
{
"entropy": 5.564320659637451,
"epoch": 0.6029955261622253,
"grad_norm": 1.390625,
"learning_rate": 0.0004968970572197172,
"loss": 5.4399,
"mean_token_accuracy": 0.16656853556632994,
"num_tokens": 13449548.0,
"step": 7750
},
{
"entropy": 5.631894779205322,
"epoch": 0.6033845555339428,
"grad_norm": 1.46875,
"learning_rate": 0.0004968924684996765,
"loss": 5.5268,
"mean_token_accuracy": 0.15824869126081467,
"num_tokens": 13458022.0,
"step": 7755
},
{
"entropy": 5.609321880340576,
"epoch": 0.6037735849056604,
"grad_norm": 1.453125,
"learning_rate": 0.000496887876412771,
"loss": 5.4797,
"mean_token_accuracy": 0.16207483112812043,
"num_tokens": 13466871.0,
"step": 7760
},
{
"entropy": 5.600290250778198,
"epoch": 0.6041626142773779,
"grad_norm": 1.3671875,
"learning_rate": 0.0004968832809590701,
"loss": 5.5171,
"mean_token_accuracy": 0.16046020835638047,
"num_tokens": 13475659.0,
"step": 7765
},
{
"entropy": 5.656421041488647,
"epoch": 0.6045516436490955,
"grad_norm": 1.453125,
"learning_rate": 0.0004968786821386435,
"loss": 5.5303,
"mean_token_accuracy": 0.16244256794452666,
"num_tokens": 13484146.0,
"step": 7770
},
{
"entropy": 5.684045696258545,
"epoch": 0.6049406730208131,
"grad_norm": 1.2734375,
"learning_rate": 0.0004968740799515611,
"loss": 5.5367,
"mean_token_accuracy": 0.16123472899198532,
"num_tokens": 13492831.0,
"step": 7775
},
{
"entropy": 5.642293262481689,
"epoch": 0.6053297023925306,
"grad_norm": 1.4296875,
"learning_rate": 0.0004968694743978926,
"loss": 5.503,
"mean_token_accuracy": 0.16224339455366135,
"num_tokens": 13501640.0,
"step": 7780
},
{
"entropy": 5.707996892929077,
"epoch": 0.6057187317642482,
"grad_norm": 1.3359375,
"learning_rate": 0.0004968648654777081,
"loss": 5.5145,
"mean_token_accuracy": 0.16158525943756102,
"num_tokens": 13509816.0,
"step": 7785
},
{
"entropy": 5.663367700576782,
"epoch": 0.6061077611359658,
"grad_norm": 1.453125,
"learning_rate": 0.0004968602531910773,
"loss": 5.5868,
"mean_token_accuracy": 0.15522609949111937,
"num_tokens": 13518384.0,
"step": 7790
},
{
"entropy": 5.551813411712646,
"epoch": 0.6064967905076833,
"grad_norm": 1.4453125,
"learning_rate": 0.0004968556375380704,
"loss": 5.4464,
"mean_token_accuracy": 0.1610630139708519,
"num_tokens": 13527115.0,
"step": 7795
},
{
"entropy": 5.6546814918518065,
"epoch": 0.6068858198794009,
"grad_norm": 1.359375,
"learning_rate": 0.0004968510185187571,
"loss": 5.6641,
"mean_token_accuracy": 0.1552654519677162,
"num_tokens": 13535743.0,
"step": 7800
},
{
"entropy": 5.596662521362305,
"epoch": 0.6072748492511184,
"grad_norm": 1.421875,
"learning_rate": 0.000496846396133208,
"loss": 5.4717,
"mean_token_accuracy": 0.16270544081926347,
"num_tokens": 13544167.0,
"step": 7805
},
{
"entropy": 5.643411493301391,
"epoch": 0.607663878622836,
"grad_norm": 1.3828125,
"learning_rate": 0.0004968417703814928,
"loss": 5.5246,
"mean_token_accuracy": 0.15955984592437744,
"num_tokens": 13552291.0,
"step": 7810
},
{
"entropy": 5.669795370101928,
"epoch": 0.6080529079945536,
"grad_norm": 1.421875,
"learning_rate": 0.0004968371412636818,
"loss": 5.5821,
"mean_token_accuracy": 0.15759380161762238,
"num_tokens": 13561185.0,
"step": 7815
},
{
"entropy": 5.650271654129028,
"epoch": 0.6084419373662712,
"grad_norm": 1.3671875,
"learning_rate": 0.0004968325087798453,
"loss": 5.4608,
"mean_token_accuracy": 0.1675198793411255,
"num_tokens": 13569815.0,
"step": 7820
},
{
"entropy": 5.66109619140625,
"epoch": 0.6088309667379888,
"grad_norm": 1.3671875,
"learning_rate": 0.0004968278729300536,
"loss": 5.5835,
"mean_token_accuracy": 0.15778862088918685,
"num_tokens": 13578882.0,
"step": 7825
},
{
"entropy": 5.557735729217529,
"epoch": 0.6092199961097062,
"grad_norm": 1.546875,
"learning_rate": 0.0004968232337143769,
"loss": 5.4403,
"mean_token_accuracy": 0.16673890501260757,
"num_tokens": 13587479.0,
"step": 7830
},
{
"entropy": 5.47802152633667,
"epoch": 0.6096090254814238,
"grad_norm": 1.3125,
"learning_rate": 0.0004968185911328858,
"loss": 5.3486,
"mean_token_accuracy": 0.16249027252197265,
"num_tokens": 13596049.0,
"step": 7835
},
{
"entropy": 5.684981775283814,
"epoch": 0.6099980548531414,
"grad_norm": 1.2265625,
"learning_rate": 0.0004968139451856506,
"loss": 5.6045,
"mean_token_accuracy": 0.1551737293601036,
"num_tokens": 13604766.0,
"step": 7840
},
{
"entropy": 5.684131145477295,
"epoch": 0.610387084224859,
"grad_norm": 1.2890625,
"learning_rate": 0.0004968092958727419,
"loss": 5.5887,
"mean_token_accuracy": 0.1608073055744171,
"num_tokens": 13614051.0,
"step": 7845
},
{
"entropy": 5.571271324157715,
"epoch": 0.6107761135965766,
"grad_norm": 1.3046875,
"learning_rate": 0.00049680464319423,
"loss": 5.5338,
"mean_token_accuracy": 0.15778470188379287,
"num_tokens": 13623100.0,
"step": 7850
},
{
"entropy": 5.699359178543091,
"epoch": 0.6111651429682942,
"grad_norm": 1.34375,
"learning_rate": 0.0004967999871501858,
"loss": 5.552,
"mean_token_accuracy": 0.15810873508453369,
"num_tokens": 13631732.0,
"step": 7855
},
{
"entropy": 5.61888165473938,
"epoch": 0.6115541723400116,
"grad_norm": 1.703125,
"learning_rate": 0.0004967953277406798,
"loss": 5.5358,
"mean_token_accuracy": 0.16011350452899933,
"num_tokens": 13640355.0,
"step": 7860
},
{
"entropy": 5.630750751495361,
"epoch": 0.6119432017117292,
"grad_norm": 1.5703125,
"learning_rate": 0.0004967906649657828,
"loss": 5.6121,
"mean_token_accuracy": 0.16256681680679322,
"num_tokens": 13649108.0,
"step": 7865
},
{
"entropy": 5.613716268539429,
"epoch": 0.6123322310834468,
"grad_norm": 1.46875,
"learning_rate": 0.0004967859988255655,
"loss": 5.4381,
"mean_token_accuracy": 0.17376051247119903,
"num_tokens": 13656765.0,
"step": 7870
},
{
"entropy": 5.616294431686401,
"epoch": 0.6127212604551644,
"grad_norm": 1.5390625,
"learning_rate": 0.0004967813293200985,
"loss": 5.529,
"mean_token_accuracy": 0.15748461037874223,
"num_tokens": 13664692.0,
"step": 7875
},
{
"entropy": 5.500170755386352,
"epoch": 0.613110289826882,
"grad_norm": 1.234375,
"learning_rate": 0.0004967766564494529,
"loss": 5.3894,
"mean_token_accuracy": 0.16902236491441727,
"num_tokens": 13672913.0,
"step": 7880
},
{
"entropy": 5.559022665023804,
"epoch": 0.6134993191985995,
"grad_norm": 1.359375,
"learning_rate": 0.0004967719802136996,
"loss": 5.3854,
"mean_token_accuracy": 0.16822486221790314,
"num_tokens": 13682427.0,
"step": 7885
},
{
"entropy": 5.612292194366455,
"epoch": 0.613888348570317,
"grad_norm": 1.390625,
"learning_rate": 0.0004967673006129094,
"loss": 5.4823,
"mean_token_accuracy": 0.16599115133285522,
"num_tokens": 13690815.0,
"step": 7890
},
{
"entropy": 5.672644567489624,
"epoch": 0.6142773779420346,
"grad_norm": 1.3671875,
"learning_rate": 0.0004967626176471536,
"loss": 5.6092,
"mean_token_accuracy": 0.15415968373417854,
"num_tokens": 13699522.0,
"step": 7895
},
{
"entropy": 5.705391597747803,
"epoch": 0.6146664073137522,
"grad_norm": 1.3671875,
"learning_rate": 0.0004967579313165028,
"loss": 5.618,
"mean_token_accuracy": 0.1559215635061264,
"num_tokens": 13708075.0,
"step": 7900
},
{
"entropy": 5.673476839065552,
"epoch": 0.6150554366854698,
"grad_norm": 1.2578125,
"learning_rate": 0.0004967532416210284,
"loss": 5.4947,
"mean_token_accuracy": 0.16200094670057297,
"num_tokens": 13716397.0,
"step": 7905
},
{
"entropy": 5.5525562286376955,
"epoch": 0.6154444660571873,
"grad_norm": 1.296875,
"learning_rate": 0.0004967485485608016,
"loss": 5.5068,
"mean_token_accuracy": 0.16395258158445358,
"num_tokens": 13724724.0,
"step": 7910
},
{
"entropy": 5.668342161178589,
"epoch": 0.6158334954289049,
"grad_norm": 1.296875,
"learning_rate": 0.0004967438521358934,
"loss": 5.4794,
"mean_token_accuracy": 0.16554345041513444,
"num_tokens": 13733389.0,
"step": 7915
},
{
"entropy": 5.5953020572662355,
"epoch": 0.6162225248006225,
"grad_norm": 1.4453125,
"learning_rate": 0.0004967391523463754,
"loss": 5.4385,
"mean_token_accuracy": 0.1632681056857109,
"num_tokens": 13742569.0,
"step": 7920
},
{
"entropy": 5.581040382385254,
"epoch": 0.61661155417234,
"grad_norm": 1.5078125,
"learning_rate": 0.0004967344491923185,
"loss": 5.4168,
"mean_token_accuracy": 0.16416201442480088,
"num_tokens": 13750975.0,
"step": 7925
},
{
"entropy": 5.57597918510437,
"epoch": 0.6170005835440576,
"grad_norm": 1.390625,
"learning_rate": 0.0004967297426737943,
"loss": 5.4778,
"mean_token_accuracy": 0.16318628638982774,
"num_tokens": 13758782.0,
"step": 7930
},
{
"entropy": 5.630909013748169,
"epoch": 0.6173896129157751,
"grad_norm": 1.4296875,
"learning_rate": 0.0004967250327908742,
"loss": 5.5922,
"mean_token_accuracy": 0.15122650414705277,
"num_tokens": 13767321.0,
"step": 7935
},
{
"entropy": 5.693921947479248,
"epoch": 0.6177786422874927,
"grad_norm": 1.421875,
"learning_rate": 0.0004967203195436297,
"loss": 5.5725,
"mean_token_accuracy": 0.16585950404405594,
"num_tokens": 13775992.0,
"step": 7940
},
{
"entropy": 5.578035116195679,
"epoch": 0.6181676716592103,
"grad_norm": 1.359375,
"learning_rate": 0.0004967156029321322,
"loss": 5.4309,
"mean_token_accuracy": 0.16884675174951552,
"num_tokens": 13784358.0,
"step": 7945
},
{
"entropy": 5.484552240371704,
"epoch": 0.6185567010309279,
"grad_norm": 1.4296875,
"learning_rate": 0.0004967108829564532,
"loss": 5.4268,
"mean_token_accuracy": 0.16732152700424194,
"num_tokens": 13792834.0,
"step": 7950
},
{
"entropy": 5.632082462310791,
"epoch": 0.6189457304026454,
"grad_norm": 1.296875,
"learning_rate": 0.0004967061596166646,
"loss": 5.5165,
"mean_token_accuracy": 0.15893340855836868,
"num_tokens": 13801414.0,
"step": 7955
},
{
"entropy": 5.6532261848449705,
"epoch": 0.6193347597743629,
"grad_norm": 1.3515625,
"learning_rate": 0.0004967014329128378,
"loss": 5.5581,
"mean_token_accuracy": 0.16025267094373702,
"num_tokens": 13810459.0,
"step": 7960
},
{
"entropy": 5.592121505737305,
"epoch": 0.6197237891460805,
"grad_norm": 1.484375,
"learning_rate": 0.0004966967028450448,
"loss": 5.3791,
"mean_token_accuracy": 0.16667962819337845,
"num_tokens": 13818460.0,
"step": 7965
},
{
"entropy": 5.554238891601562,
"epoch": 0.6201128185177981,
"grad_norm": 1.34375,
"learning_rate": 0.000496691969413357,
"loss": 5.507,
"mean_token_accuracy": 0.16117742657661438,
"num_tokens": 13827693.0,
"step": 7970
},
{
"entropy": 5.683591508865357,
"epoch": 0.6205018478895157,
"grad_norm": 1.4296875,
"learning_rate": 0.0004966872326178466,
"loss": 5.5158,
"mean_token_accuracy": 0.15253090113401413,
"num_tokens": 13836506.0,
"step": 7975
},
{
"entropy": 5.642145490646362,
"epoch": 0.6208908772612333,
"grad_norm": 1.453125,
"learning_rate": 0.0004966824924585851,
"loss": 5.5238,
"mean_token_accuracy": 0.15704460814595222,
"num_tokens": 13844977.0,
"step": 7980
},
{
"entropy": 5.580069446563721,
"epoch": 0.6212799066329507,
"grad_norm": 1.3515625,
"learning_rate": 0.0004966777489356448,
"loss": 5.5077,
"mean_token_accuracy": 0.15980817675590514,
"num_tokens": 13854514.0,
"step": 7985
},
{
"entropy": 5.645097970962524,
"epoch": 0.6216689360046683,
"grad_norm": 1.3125,
"learning_rate": 0.0004966730020490975,
"loss": 5.5072,
"mean_token_accuracy": 0.1550505816936493,
"num_tokens": 13863037.0,
"step": 7990
},
{
"entropy": 5.599818134307862,
"epoch": 0.6220579653763859,
"grad_norm": 1.4296875,
"learning_rate": 0.000496668251799015,
"loss": 5.4687,
"mean_token_accuracy": 0.1692013517022133,
"num_tokens": 13871720.0,
"step": 7995
},
{
"entropy": 5.636774635314941,
"epoch": 0.6224469947481035,
"grad_norm": 1.5546875,
"learning_rate": 0.0004966634981854699,
"loss": 5.5026,
"mean_token_accuracy": 0.16675081104040146,
"num_tokens": 13880214.0,
"step": 8000
},
{
"entropy": 5.616530132293701,
"epoch": 0.6228360241198211,
"grad_norm": 1.3125,
"learning_rate": 0.0004966587412085339,
"loss": 5.5975,
"mean_token_accuracy": 0.152876765280962,
"num_tokens": 13888784.0,
"step": 8005
},
{
"entropy": 5.650445365905762,
"epoch": 0.6232250534915386,
"grad_norm": 1.4296875,
"learning_rate": 0.0004966539808682793,
"loss": 5.5021,
"mean_token_accuracy": 0.16107800453901291,
"num_tokens": 13897466.0,
"step": 8010
},
{
"entropy": 5.589649438858032,
"epoch": 0.6236140828632561,
"grad_norm": 1.46875,
"learning_rate": 0.0004966492171647783,
"loss": 5.5146,
"mean_token_accuracy": 0.15655134320259095,
"num_tokens": 13906556.0,
"step": 8015
},
{
"entropy": 5.555747985839844,
"epoch": 0.6240031122349737,
"grad_norm": 1.4140625,
"learning_rate": 0.0004966444500981032,
"loss": 5.4576,
"mean_token_accuracy": 0.16158139556646348,
"num_tokens": 13915473.0,
"step": 8020
},
{
"entropy": 5.653251791000367,
"epoch": 0.6243921416066913,
"grad_norm": 1.5546875,
"learning_rate": 0.0004966396796683265,
"loss": 5.6261,
"mean_token_accuracy": 0.15274745523929595,
"num_tokens": 13924775.0,
"step": 8025
},
{
"entropy": 5.692790603637695,
"epoch": 0.6247811709784089,
"grad_norm": 1.421875,
"learning_rate": 0.0004966349058755204,
"loss": 5.5036,
"mean_token_accuracy": 0.15476525872945784,
"num_tokens": 13933992.0,
"step": 8030
},
{
"entropy": 5.731003522872925,
"epoch": 0.6251702003501264,
"grad_norm": 1.5078125,
"learning_rate": 0.0004966301287197573,
"loss": 5.6728,
"mean_token_accuracy": 0.15809391736984252,
"num_tokens": 13942877.0,
"step": 8035
},
{
"entropy": 5.636298751831054,
"epoch": 0.625559229721844,
"grad_norm": 1.2734375,
"learning_rate": 0.0004966253482011098,
"loss": 5.5205,
"mean_token_accuracy": 0.16148761957883834,
"num_tokens": 13952003.0,
"step": 8040
},
{
"entropy": 5.6766040325164795,
"epoch": 0.6259482590935616,
"grad_norm": 1.4609375,
"learning_rate": 0.0004966205643196503,
"loss": 5.4583,
"mean_token_accuracy": 0.16635134518146516,
"num_tokens": 13959801.0,
"step": 8045
},
{
"entropy": 5.51854133605957,
"epoch": 0.6263372884652791,
"grad_norm": 1.4375,
"learning_rate": 0.0004966157770754516,
"loss": 5.4561,
"mean_token_accuracy": 0.15555119663476943,
"num_tokens": 13968535.0,
"step": 8050
},
{
"entropy": 5.647353887557983,
"epoch": 0.6267263178369967,
"grad_norm": 1.4765625,
"learning_rate": 0.000496610986468586,
"loss": 5.445,
"mean_token_accuracy": 0.16241587996482848,
"num_tokens": 13977079.0,
"step": 8055
},
{
"entropy": 5.602263879776001,
"epoch": 0.6271153472087143,
"grad_norm": 1.3515625,
"learning_rate": 0.0004966061924991267,
"loss": 5.4639,
"mean_token_accuracy": 0.17081388980150222,
"num_tokens": 13985118.0,
"step": 8060
},
{
"entropy": 5.552741384506225,
"epoch": 0.6275043765804318,
"grad_norm": 1.3203125,
"learning_rate": 0.000496601395167146,
"loss": 5.4125,
"mean_token_accuracy": 0.16479296535253524,
"num_tokens": 13994061.0,
"step": 8065
},
{
"entropy": 5.61691837310791,
"epoch": 0.6278934059521494,
"grad_norm": 1.2578125,
"learning_rate": 0.0004965965944727168,
"loss": 5.5592,
"mean_token_accuracy": 0.1568474255502224,
"num_tokens": 14002879.0,
"step": 8070
},
{
"entropy": 5.667020177841186,
"epoch": 0.628282435323867,
"grad_norm": 1.5234375,
"learning_rate": 0.0004965917904159121,
"loss": 5.5355,
"mean_token_accuracy": 0.1621012195944786,
"num_tokens": 14011570.0,
"step": 8075
},
{
"entropy": 5.573873233795166,
"epoch": 0.6286714646955845,
"grad_norm": 1.3046875,
"learning_rate": 0.0004965869829968046,
"loss": 5.3767,
"mean_token_accuracy": 0.16462417393922807,
"num_tokens": 14019282.0,
"step": 8080
},
{
"entropy": 5.547157669067383,
"epoch": 0.6290604940673021,
"grad_norm": 1.6015625,
"learning_rate": 0.0004965821722154674,
"loss": 5.3898,
"mean_token_accuracy": 0.1729328453540802,
"num_tokens": 14027774.0,
"step": 8085
},
{
"entropy": 5.598388719558716,
"epoch": 0.6294495234390196,
"grad_norm": 1.421875,
"learning_rate": 0.0004965773580719734,
"loss": 5.4058,
"mean_token_accuracy": 0.1658223569393158,
"num_tokens": 14036754.0,
"step": 8090
},
{
"entropy": 5.665834665298462,
"epoch": 0.6298385528107372,
"grad_norm": 1.328125,
"learning_rate": 0.0004965725405663957,
"loss": 5.5791,
"mean_token_accuracy": 0.16007334589958191,
"num_tokens": 14045714.0,
"step": 8095
},
{
"entropy": 5.676879072189331,
"epoch": 0.6302275821824548,
"grad_norm": 2.078125,
"learning_rate": 0.0004965677196988073,
"loss": 5.5926,
"mean_token_accuracy": 0.1579957962036133,
"num_tokens": 14054973.0,
"step": 8100
},
{
"entropy": 5.616937971115112,
"epoch": 0.6306166115541724,
"grad_norm": 1.40625,
"learning_rate": 0.0004965628954692815,
"loss": 5.4947,
"mean_token_accuracy": 0.1623809590935707,
"num_tokens": 14064037.0,
"step": 8105
},
{
"entropy": 5.661908102035523,
"epoch": 0.63100564092589,
"grad_norm": 1.484375,
"learning_rate": 0.0004965580678778913,
"loss": 5.5264,
"mean_token_accuracy": 0.16121605634689332,
"num_tokens": 14072269.0,
"step": 8110
},
{
"entropy": 5.621046781539917,
"epoch": 0.6313946702976074,
"grad_norm": 1.484375,
"learning_rate": 0.0004965532369247102,
"loss": 5.4633,
"mean_token_accuracy": 0.16086421832442283,
"num_tokens": 14080595.0,
"step": 8115
},
{
"entropy": 5.58659930229187,
"epoch": 0.631783699669325,
"grad_norm": 1.40625,
"learning_rate": 0.0004965484026098111,
"loss": 5.4495,
"mean_token_accuracy": 0.1654338777065277,
"num_tokens": 14089159.0,
"step": 8120
},
{
"entropy": 5.630824947357178,
"epoch": 0.6321727290410426,
"grad_norm": 1.484375,
"learning_rate": 0.0004965435649332679,
"loss": 5.5381,
"mean_token_accuracy": 0.15698456019163132,
"num_tokens": 14098192.0,
"step": 8125
},
{
"entropy": 5.657534599304199,
"epoch": 0.6325617584127602,
"grad_norm": 1.4765625,
"learning_rate": 0.0004965387238951536,
"loss": 5.36,
"mean_token_accuracy": 0.17074259370565414,
"num_tokens": 14106552.0,
"step": 8130
},
{
"entropy": 5.592873573303223,
"epoch": 0.6329507877844778,
"grad_norm": 2.859375,
"learning_rate": 0.0004965338794955418,
"loss": 5.4319,
"mean_token_accuracy": 0.16148714870214462,
"num_tokens": 14114783.0,
"step": 8135
},
{
"entropy": 5.535675430297852,
"epoch": 0.6333398171561953,
"grad_norm": 1.375,
"learning_rate": 0.0004965290317345061,
"loss": 5.4973,
"mean_token_accuracy": 0.15594300478696824,
"num_tokens": 14124182.0,
"step": 8140
},
{
"entropy": 5.678386974334717,
"epoch": 0.6337288465279128,
"grad_norm": 1.265625,
"learning_rate": 0.0004965241806121198,
"loss": 5.5245,
"mean_token_accuracy": 0.15432342439889907,
"num_tokens": 14133037.0,
"step": 8145
},
{
"entropy": 5.651481246948242,
"epoch": 0.6341178758996304,
"grad_norm": 1.46875,
"learning_rate": 0.0004965193261284567,
"loss": 5.4997,
"mean_token_accuracy": 0.16438781023025512,
"num_tokens": 14141677.0,
"step": 8150
},
{
"entropy": 5.569592905044556,
"epoch": 0.634506905271348,
"grad_norm": 1.453125,
"learning_rate": 0.0004965144682835904,
"loss": 5.4629,
"mean_token_accuracy": 0.17072515040636063,
"num_tokens": 14149980.0,
"step": 8155
},
{
"entropy": 5.563594961166382,
"epoch": 0.6348959346430656,
"grad_norm": 1.4296875,
"learning_rate": 0.0004965096070775946,
"loss": 5.5003,
"mean_token_accuracy": 0.16639333367347717,
"num_tokens": 14158298.0,
"step": 8160
},
{
"entropy": 5.627389335632325,
"epoch": 0.6352849640147831,
"grad_norm": 1.3359375,
"learning_rate": 0.0004965047425105431,
"loss": 5.4598,
"mean_token_accuracy": 0.16781965643167496,
"num_tokens": 14166321.0,
"step": 8165
},
{
"entropy": 5.5292116641998295,
"epoch": 0.6356739933865007,
"grad_norm": 1.3671875,
"learning_rate": 0.0004964998745825097,
"loss": 5.4246,
"mean_token_accuracy": 0.17231572419404984,
"num_tokens": 14174619.0,
"step": 8170
},
{
"entropy": 5.566997861862182,
"epoch": 0.6360630227582182,
"grad_norm": 1.4453125,
"learning_rate": 0.0004964950032935682,
"loss": 5.4403,
"mean_token_accuracy": 0.16089098602533342,
"num_tokens": 14183548.0,
"step": 8175
},
{
"entropy": 5.698858404159546,
"epoch": 0.6364520521299358,
"grad_norm": 1.546875,
"learning_rate": 0.0004964901286437927,
"loss": 5.6397,
"mean_token_accuracy": 0.1611291542649269,
"num_tokens": 14192306.0,
"step": 8180
},
{
"entropy": 5.5540143013000485,
"epoch": 0.6368410815016534,
"grad_norm": 1.46875,
"learning_rate": 0.0004964852506332568,
"loss": 5.3126,
"mean_token_accuracy": 0.1775052949786186,
"num_tokens": 14200280.0,
"step": 8185
},
{
"entropy": 5.570341730117798,
"epoch": 0.6372301108733709,
"grad_norm": 1.484375,
"learning_rate": 0.000496480369262035,
"loss": 5.5486,
"mean_token_accuracy": 0.16719427704811096,
"num_tokens": 14208484.0,
"step": 8190
},
{
"entropy": 5.606416893005371,
"epoch": 0.6376191402450885,
"grad_norm": 1.46875,
"learning_rate": 0.000496475484530201,
"loss": 5.5412,
"mean_token_accuracy": 0.16160168945789338,
"num_tokens": 14217368.0,
"step": 8195
},
{
"entropy": 5.693037462234497,
"epoch": 0.6380081696168061,
"grad_norm": 1.421875,
"learning_rate": 0.0004964705964378292,
"loss": 5.5571,
"mean_token_accuracy": 0.15757941454648972,
"num_tokens": 14226663.0,
"step": 8200
},
{
"entropy": 5.59523377418518,
"epoch": 0.6383971989885237,
"grad_norm": 1.4765625,
"learning_rate": 0.0004964657049849934,
"loss": 5.4228,
"mean_token_accuracy": 0.15858400166034697,
"num_tokens": 14235153.0,
"step": 8205
},
{
"entropy": 5.599985122680664,
"epoch": 0.6387862283602412,
"grad_norm": 1.546875,
"learning_rate": 0.0004964608101717681,
"loss": 5.5548,
"mean_token_accuracy": 0.15804918855428696,
"num_tokens": 14244245.0,
"step": 8210
},
{
"entropy": 5.63315052986145,
"epoch": 0.6391752577319587,
"grad_norm": 1.53125,
"learning_rate": 0.0004964559119982275,
"loss": 5.4708,
"mean_token_accuracy": 0.16142986565828324,
"num_tokens": 14252666.0,
"step": 8215
},
{
"entropy": 5.637704515457154,
"epoch": 0.6395642871036763,
"grad_norm": 1.3671875,
"learning_rate": 0.000496451010464446,
"loss": 5.548,
"mean_token_accuracy": 0.15910727083683013,
"num_tokens": 14262232.0,
"step": 8220
},
{
"entropy": 5.6048393726348875,
"epoch": 0.6399533164753939,
"grad_norm": 1.6875,
"learning_rate": 0.0004964461055704978,
"loss": 5.4765,
"mean_token_accuracy": 0.16455696076154708,
"num_tokens": 14270496.0,
"step": 8225
},
{
"entropy": 5.528129291534424,
"epoch": 0.6403423458471115,
"grad_norm": 1.5546875,
"learning_rate": 0.0004964411973164574,
"loss": 5.3994,
"mean_token_accuracy": 0.17100196778774263,
"num_tokens": 14278597.0,
"step": 8230
},
{
"entropy": 5.5415791988372805,
"epoch": 0.6407313752188291,
"grad_norm": 1.4453125,
"learning_rate": 0.0004964362857023993,
"loss": 5.4861,
"mean_token_accuracy": 0.16359479427337648,
"num_tokens": 14287444.0,
"step": 8235
},
{
"entropy": 5.563477563858032,
"epoch": 0.6411204045905465,
"grad_norm": 1.3984375,
"learning_rate": 0.000496431370728398,
"loss": 5.3847,
"mean_token_accuracy": 0.16639602482318877,
"num_tokens": 14296041.0,
"step": 8240
},
{
"entropy": 5.57078709602356,
"epoch": 0.6415094339622641,
"grad_norm": 1.34375,
"learning_rate": 0.0004964264523945281,
"loss": 5.4103,
"mean_token_accuracy": 0.1668490380048752,
"num_tokens": 14304700.0,
"step": 8245
},
{
"entropy": 5.613706636428833,
"epoch": 0.6418984633339817,
"grad_norm": 1.3671875,
"learning_rate": 0.0004964215307008643,
"loss": 5.5295,
"mean_token_accuracy": 0.16124773621559144,
"num_tokens": 14312873.0,
"step": 8250
},
{
"entropy": 5.674438238143921,
"epoch": 0.6422874927056993,
"grad_norm": 1.359375,
"learning_rate": 0.0004964166056474811,
"loss": 5.5317,
"mean_token_accuracy": 0.15775930359959603,
"num_tokens": 14321697.0,
"step": 8255
},
{
"entropy": 5.587344217300415,
"epoch": 0.6426765220774169,
"grad_norm": 1.4765625,
"learning_rate": 0.0004964116772344534,
"loss": 5.527,
"mean_token_accuracy": 0.1574459046125412,
"num_tokens": 14330074.0,
"step": 8260
},
{
"entropy": 5.696241664886474,
"epoch": 0.6430655514491345,
"grad_norm": 1.4765625,
"learning_rate": 0.0004964067454618559,
"loss": 5.5967,
"mean_token_accuracy": 0.15248970463871955,
"num_tokens": 14339485.0,
"step": 8265
},
{
"entropy": 5.717200422286988,
"epoch": 0.6434545808208519,
"grad_norm": 1.4296875,
"learning_rate": 0.0004964018103297634,
"loss": 5.5406,
"mean_token_accuracy": 0.15757163912057875,
"num_tokens": 14348182.0,
"step": 8270
},
{
"entropy": 5.728037929534912,
"epoch": 0.6438436101925695,
"grad_norm": 1.3046875,
"learning_rate": 0.0004963968718382509,
"loss": 5.6075,
"mean_token_accuracy": 0.155861759185791,
"num_tokens": 14357202.0,
"step": 8275
},
{
"entropy": 5.627114486694336,
"epoch": 0.6442326395642871,
"grad_norm": 1.40625,
"learning_rate": 0.0004963919299873931,
"loss": 5.5137,
"mean_token_accuracy": 0.15722453445196152,
"num_tokens": 14366001.0,
"step": 8280
},
{
"entropy": 5.695006942749023,
"epoch": 0.6446216689360047,
"grad_norm": 1.65625,
"learning_rate": 0.0004963869847772653,
"loss": 5.5558,
"mean_token_accuracy": 0.1576986774802208,
"num_tokens": 14374894.0,
"step": 8285
},
{
"entropy": 5.590862274169922,
"epoch": 0.6450106983077223,
"grad_norm": 1.7734375,
"learning_rate": 0.0004963820362079423,
"loss": 5.4925,
"mean_token_accuracy": 0.16458533555269242,
"num_tokens": 14383396.0,
"step": 8290
},
{
"entropy": 5.581786012649536,
"epoch": 0.6453997276794398,
"grad_norm": 1.546875,
"learning_rate": 0.0004963770842794994,
"loss": 5.4504,
"mean_token_accuracy": 0.1657285675406456,
"num_tokens": 14392514.0,
"step": 8295
},
{
"entropy": 5.629509305953979,
"epoch": 0.6457887570511573,
"grad_norm": 1.484375,
"learning_rate": 0.0004963721289920115,
"loss": 5.4895,
"mean_token_accuracy": 0.1577771633863449,
"num_tokens": 14401916.0,
"step": 8300
},
{
"entropy": 5.642601203918457,
"epoch": 0.6461777864228749,
"grad_norm": 1.671875,
"learning_rate": 0.0004963671703455538,
"loss": 5.5519,
"mean_token_accuracy": 0.15847557485103608,
"num_tokens": 14410476.0,
"step": 8305
},
{
"entropy": 5.65356411933899,
"epoch": 0.6465668157945925,
"grad_norm": 1.578125,
"learning_rate": 0.0004963622083402018,
"loss": 5.5281,
"mean_token_accuracy": 0.15930469781160356,
"num_tokens": 14418437.0,
"step": 8310
},
{
"entropy": 5.576390409469605,
"epoch": 0.6469558451663101,
"grad_norm": 1.515625,
"learning_rate": 0.0004963572429760305,
"loss": 5.4747,
"mean_token_accuracy": 0.16562929451465608,
"num_tokens": 14426978.0,
"step": 8315
},
{
"entropy": 5.662410306930542,
"epoch": 0.6473448745380276,
"grad_norm": 1.5234375,
"learning_rate": 0.0004963522742531155,
"loss": 5.5256,
"mean_token_accuracy": 0.15617482513189315,
"num_tokens": 14435043.0,
"step": 8320
},
{
"entropy": 5.5775915622711185,
"epoch": 0.6477339039097452,
"grad_norm": 1.515625,
"learning_rate": 0.000496347302171532,
"loss": 5.4221,
"mean_token_accuracy": 0.1707099497318268,
"num_tokens": 14443397.0,
"step": 8325
},
{
"entropy": 5.630001449584961,
"epoch": 0.6481229332814628,
"grad_norm": 1.5,
"learning_rate": 0.0004963423267313554,
"loss": 5.5111,
"mean_token_accuracy": 0.16315706968307495,
"num_tokens": 14452536.0,
"step": 8330
},
{
"entropy": 5.678388071060181,
"epoch": 0.6485119626531803,
"grad_norm": 2.28125,
"learning_rate": 0.0004963373479326614,
"loss": 5.5626,
"mean_token_accuracy": 0.152607698738575,
"num_tokens": 14461901.0,
"step": 8335
},
{
"entropy": 5.605925178527832,
"epoch": 0.6489009920248979,
"grad_norm": 1.6484375,
"learning_rate": 0.0004963323657755255,
"loss": 5.4965,
"mean_token_accuracy": 0.16920969188213347,
"num_tokens": 14470547.0,
"step": 8340
},
{
"entropy": 5.545820569992065,
"epoch": 0.6492900213966154,
"grad_norm": 1.5078125,
"learning_rate": 0.0004963273802600231,
"loss": 5.3666,
"mean_token_accuracy": 0.16293006539344787,
"num_tokens": 14478439.0,
"step": 8345
},
{
"entropy": 5.640049695968628,
"epoch": 0.649679050768333,
"grad_norm": 1.53125,
"learning_rate": 0.00049632239138623,
"loss": 5.4395,
"mean_token_accuracy": 0.1675925999879837,
"num_tokens": 14486621.0,
"step": 8350
},
{
"entropy": 5.583245944976807,
"epoch": 0.6500680801400506,
"grad_norm": 1.484375,
"learning_rate": 0.0004963173991542219,
"loss": 5.4247,
"mean_token_accuracy": 0.16209669709205626,
"num_tokens": 14495313.0,
"step": 8355
},
{
"entropy": 5.61328010559082,
"epoch": 0.6504571095117682,
"grad_norm": 1.5625,
"learning_rate": 0.0004963124035640746,
"loss": 5.4962,
"mean_token_accuracy": 0.16555400639772416,
"num_tokens": 14503647.0,
"step": 8360
},
{
"entropy": 5.612566041946411,
"epoch": 0.6508461388834857,
"grad_norm": 1.796875,
"learning_rate": 0.0004963074046158637,
"loss": 5.4302,
"mean_token_accuracy": 0.16509283930063248,
"num_tokens": 14512350.0,
"step": 8365
},
{
"entropy": 5.679213905334473,
"epoch": 0.6512351682552032,
"grad_norm": 1.5,
"learning_rate": 0.0004963024023096652,
"loss": 5.5734,
"mean_token_accuracy": 0.15210946649312973,
"num_tokens": 14521801.0,
"step": 8370
},
{
"entropy": 5.560119771957398,
"epoch": 0.6516241976269208,
"grad_norm": 1.59375,
"learning_rate": 0.0004962973966455551,
"loss": 5.4078,
"mean_token_accuracy": 0.16019269973039627,
"num_tokens": 14530045.0,
"step": 8375
},
{
"entropy": 5.55653567314148,
"epoch": 0.6520132269986384,
"grad_norm": 1.90625,
"learning_rate": 0.0004962923876236092,
"loss": 5.5038,
"mean_token_accuracy": 0.16818015426397323,
"num_tokens": 14538944.0,
"step": 8380
},
{
"entropy": 5.6275276184082035,
"epoch": 0.652402256370356,
"grad_norm": 1.5,
"learning_rate": 0.0004962873752439035,
"loss": 5.5462,
"mean_token_accuracy": 0.15992224514484404,
"num_tokens": 14548180.0,
"step": 8385
},
{
"entropy": 5.65324182510376,
"epoch": 0.6527912857420736,
"grad_norm": 1.6015625,
"learning_rate": 0.0004962823595065141,
"loss": 5.5374,
"mean_token_accuracy": 0.15571261197328568,
"num_tokens": 14556907.0,
"step": 8390
},
{
"entropy": 5.607539129257202,
"epoch": 0.653180315113791,
"grad_norm": 1.5078125,
"learning_rate": 0.0004962773404115172,
"loss": 5.5153,
"mean_token_accuracy": 0.15769898295402526,
"num_tokens": 14565317.0,
"step": 8395
},
{
"entropy": 5.683702993392944,
"epoch": 0.6535693444855086,
"grad_norm": 1.546875,
"learning_rate": 0.0004962723179589886,
"loss": 5.5783,
"mean_token_accuracy": 0.16089919656515123,
"num_tokens": 14574485.0,
"step": 8400
},
{
"entropy": 5.707424640655518,
"epoch": 0.6539583738572262,
"grad_norm": 1.640625,
"learning_rate": 0.000496267292149005,
"loss": 5.4845,
"mean_token_accuracy": 0.16174585819244386,
"num_tokens": 14584002.0,
"step": 8405
},
{
"entropy": 5.633489513397217,
"epoch": 0.6543474032289438,
"grad_norm": 1.5703125,
"learning_rate": 0.0004962622629816423,
"loss": 5.4311,
"mean_token_accuracy": 0.16070465072989465,
"num_tokens": 14592033.0,
"step": 8410
},
{
"entropy": 5.594094085693359,
"epoch": 0.6547364326006614,
"grad_norm": 1.6640625,
"learning_rate": 0.000496257230456977,
"loss": 5.5511,
"mean_token_accuracy": 0.15814293622970582,
"num_tokens": 14600084.0,
"step": 8415
},
{
"entropy": 5.609566974639892,
"epoch": 0.6551254619723789,
"grad_norm": 1.71875,
"learning_rate": 0.0004962521945750855,
"loss": 5.4655,
"mean_token_accuracy": 0.17209602296352386,
"num_tokens": 14608380.0,
"step": 8420
},
{
"entropy": 5.62038254737854,
"epoch": 0.6555144913440965,
"grad_norm": 1.5234375,
"learning_rate": 0.000496247155336044,
"loss": 5.5372,
"mean_token_accuracy": 0.16135943531990052,
"num_tokens": 14616864.0,
"step": 8425
},
{
"entropy": 5.643423366546631,
"epoch": 0.655903520715814,
"grad_norm": 1.828125,
"learning_rate": 0.0004962421127399291,
"loss": 5.5848,
"mean_token_accuracy": 0.15594003945589066,
"num_tokens": 14627054.0,
"step": 8430
},
{
"entropy": 5.681075525283814,
"epoch": 0.6562925500875316,
"grad_norm": 1.8125,
"learning_rate": 0.0004962370667868172,
"loss": 5.4622,
"mean_token_accuracy": 0.16358790993690492,
"num_tokens": 14634985.0,
"step": 8435
},
{
"entropy": 5.67454514503479,
"epoch": 0.6566815794592492,
"grad_norm": 1.9453125,
"learning_rate": 0.0004962320174767851,
"loss": 5.5275,
"mean_token_accuracy": 0.16311112195253372,
"num_tokens": 14644135.0,
"step": 8440
},
{
"entropy": 5.603046178817749,
"epoch": 0.6570706088309667,
"grad_norm": 1.6328125,
"learning_rate": 0.000496226964809909,
"loss": 5.475,
"mean_token_accuracy": 0.1671380341053009,
"num_tokens": 14652997.0,
"step": 8445
},
{
"entropy": 5.582294082641601,
"epoch": 0.6574596382026843,
"grad_norm": 1.515625,
"learning_rate": 0.000496221908786266,
"loss": 5.5694,
"mean_token_accuracy": 0.15573946237564087,
"num_tokens": 14661961.0,
"step": 8450
},
{
"entropy": 5.72095365524292,
"epoch": 0.6578486675744019,
"grad_norm": 1.4921875,
"learning_rate": 0.0004962168494059327,
"loss": 5.6857,
"mean_token_accuracy": 0.14969259947538377,
"num_tokens": 14671407.0,
"step": 8455
},
{
"entropy": 5.648622035980225,
"epoch": 0.6582376969461194,
"grad_norm": 3.46875,
"learning_rate": 0.0004962117866689857,
"loss": 5.5337,
"mean_token_accuracy": 0.16302797496318816,
"num_tokens": 14680015.0,
"step": 8460
},
{
"entropy": 5.558050012588501,
"epoch": 0.658626726317837,
"grad_norm": 1.65625,
"learning_rate": 0.000496206720575502,
"loss": 5.3794,
"mean_token_accuracy": 0.16196016669273378,
"num_tokens": 14688444.0,
"step": 8465
},
{
"entropy": 5.565975618362427,
"epoch": 0.6590157556895546,
"grad_norm": 1.6328125,
"learning_rate": 0.0004962016511255584,
"loss": 5.5212,
"mean_token_accuracy": 0.15961693376302719,
"num_tokens": 14697246.0,
"step": 8470
},
{
"entropy": 5.590129041671753,
"epoch": 0.6594047850612721,
"grad_norm": 1.9609375,
"learning_rate": 0.0004961965783192318,
"loss": 5.3933,
"mean_token_accuracy": 0.16685593873262405,
"num_tokens": 14706066.0,
"step": 8475
},
{
"entropy": 5.638283777236938,
"epoch": 0.6597938144329897,
"grad_norm": 1.3515625,
"learning_rate": 0.0004961915021565992,
"loss": 5.5079,
"mean_token_accuracy": 0.1568120762705803,
"num_tokens": 14714327.0,
"step": 8480
},
{
"entropy": 5.570411491394043,
"epoch": 0.6601828438047073,
"grad_norm": 1.5,
"learning_rate": 0.0004961864226377377,
"loss": 5.382,
"mean_token_accuracy": 0.16485304087400438,
"num_tokens": 14723053.0,
"step": 8485
},
{
"entropy": 5.544371938705444,
"epoch": 0.6605718731764249,
"grad_norm": 1.484375,
"learning_rate": 0.0004961813397627241,
"loss": 5.3785,
"mean_token_accuracy": 0.17082611471414566,
"num_tokens": 14731825.0,
"step": 8490
},
{
"entropy": 5.629836750030518,
"epoch": 0.6609609025481424,
"grad_norm": 1.609375,
"learning_rate": 0.0004961762535316358,
"loss": 5.5762,
"mean_token_accuracy": 0.156722342222929,
"num_tokens": 14740751.0,
"step": 8495
},
{
"entropy": 5.5798173427581785,
"epoch": 0.6613499319198599,
"grad_norm": 1.6953125,
"learning_rate": 0.0004961711639445499,
"loss": 5.4425,
"mean_token_accuracy": 0.16466536670923232,
"num_tokens": 14748994.0,
"step": 8500
},
{
"entropy": 5.582650995254516,
"epoch": 0.6617389612915775,
"grad_norm": 2.21875,
"learning_rate": 0.0004961660710015435,
"loss": 5.4294,
"mean_token_accuracy": 0.1654239133000374,
"num_tokens": 14757388.0,
"step": 8505
},
{
"entropy": 5.707845401763916,
"epoch": 0.6621279906632951,
"grad_norm": 1.5859375,
"learning_rate": 0.0004961609747026943,
"loss": 5.6107,
"mean_token_accuracy": 0.15208702832460402,
"num_tokens": 14766654.0,
"step": 8510
},
{
"entropy": 5.628918075561524,
"epoch": 0.6625170200350127,
"grad_norm": 1.4140625,
"learning_rate": 0.0004961558750480791,
"loss": 5.5065,
"mean_token_accuracy": 0.16062942296266555,
"num_tokens": 14775561.0,
"step": 8515
},
{
"entropy": 5.590156745910645,
"epoch": 0.6629060494067303,
"grad_norm": 1.59375,
"learning_rate": 0.0004961507720377756,
"loss": 5.5583,
"mean_token_accuracy": 0.15312558114528657,
"num_tokens": 14783596.0,
"step": 8520
},
{
"entropy": 5.673126602172852,
"epoch": 0.6632950787784477,
"grad_norm": 1.8984375,
"learning_rate": 0.0004961456656718611,
"loss": 5.5673,
"mean_token_accuracy": 0.1590380698442459,
"num_tokens": 14791932.0,
"step": 8525
},
{
"entropy": 5.685076332092285,
"epoch": 0.6636841081501653,
"grad_norm": 1.453125,
"learning_rate": 0.000496140555950413,
"loss": 5.6037,
"mean_token_accuracy": 0.15631160587072374,
"num_tokens": 14801261.0,
"step": 8530
},
{
"entropy": 5.622698163986206,
"epoch": 0.6640731375218829,
"grad_norm": 1.4921875,
"learning_rate": 0.0004961354428735091,
"loss": 5.4777,
"mean_token_accuracy": 0.1577353447675705,
"num_tokens": 14809788.0,
"step": 8535
},
{
"entropy": 5.542088317871094,
"epoch": 0.6644621668936005,
"grad_norm": 1.40625,
"learning_rate": 0.0004961303264412267,
"loss": 5.4653,
"mean_token_accuracy": 0.15726249366998674,
"num_tokens": 14818324.0,
"step": 8540
},
{
"entropy": 5.527442979812622,
"epoch": 0.6648511962653181,
"grad_norm": 1.8984375,
"learning_rate": 0.0004961252066536437,
"loss": 5.4235,
"mean_token_accuracy": 0.16347662657499312,
"num_tokens": 14827020.0,
"step": 8545
},
{
"entropy": 5.569663619995117,
"epoch": 0.6652402256370356,
"grad_norm": 1.6796875,
"learning_rate": 0.0004961200835108375,
"loss": 5.5391,
"mean_token_accuracy": 0.15555160492658615,
"num_tokens": 14835522.0,
"step": 8550
},
{
"entropy": 5.627895498275757,
"epoch": 0.6656292550087531,
"grad_norm": 1.9453125,
"learning_rate": 0.000496114957012886,
"loss": 5.493,
"mean_token_accuracy": 0.16153236776590346,
"num_tokens": 14844676.0,
"step": 8555
},
{
"entropy": 5.699510955810547,
"epoch": 0.6660182843804707,
"grad_norm": 1.6328125,
"learning_rate": 0.0004961098271598671,
"loss": 5.5413,
"mean_token_accuracy": 0.1609079509973526,
"num_tokens": 14853996.0,
"step": 8560
},
{
"entropy": 5.619197607040405,
"epoch": 0.6664073137521883,
"grad_norm": 1.671875,
"learning_rate": 0.0004961046939518585,
"loss": 5.5239,
"mean_token_accuracy": 0.15910777151584626,
"num_tokens": 14862981.0,
"step": 8565
},
{
"entropy": 5.658803033828735,
"epoch": 0.6667963431239059,
"grad_norm": 1.4921875,
"learning_rate": 0.0004960995573889379,
"loss": 5.5612,
"mean_token_accuracy": 0.1559648483991623,
"num_tokens": 14872378.0,
"step": 8570
},
{
"entropy": 5.589079093933106,
"epoch": 0.6671853724956234,
"grad_norm": 1.5078125,
"learning_rate": 0.0004960944174711836,
"loss": 5.4968,
"mean_token_accuracy": 0.15561144798994064,
"num_tokens": 14881662.0,
"step": 8575
},
{
"entropy": 5.621028661727905,
"epoch": 0.667574401867341,
"grad_norm": 1.9921875,
"learning_rate": 0.0004960892741986734,
"loss": 5.3817,
"mean_token_accuracy": 0.16623928993940354,
"num_tokens": 14890211.0,
"step": 8580
},
{
"entropy": 5.671985101699829,
"epoch": 0.6679634312390585,
"grad_norm": 1.4140625,
"learning_rate": 0.0004960841275714853,
"loss": 5.6131,
"mean_token_accuracy": 0.15232166945934295,
"num_tokens": 14899865.0,
"step": 8585
},
{
"entropy": 5.65290093421936,
"epoch": 0.6683524606107761,
"grad_norm": 1.5,
"learning_rate": 0.0004960789775896975,
"loss": 5.5242,
"mean_token_accuracy": 0.15458524227142334,
"num_tokens": 14908334.0,
"step": 8590
},
{
"entropy": 5.5436254978179935,
"epoch": 0.6687414899824937,
"grad_norm": 1.75,
"learning_rate": 0.0004960738242533881,
"loss": 5.4829,
"mean_token_accuracy": 0.16041945219039916,
"num_tokens": 14916477.0,
"step": 8595
},
{
"entropy": 5.554329109191895,
"epoch": 0.6691305193542112,
"grad_norm": 1.6796875,
"learning_rate": 0.0004960686675626353,
"loss": 5.4019,
"mean_token_accuracy": 0.16701223701238632,
"num_tokens": 14925223.0,
"step": 8600
},
{
"entropy": 5.687564706802368,
"epoch": 0.6695195487259288,
"grad_norm": 2.046875,
"learning_rate": 0.0004960635075175173,
"loss": 5.5495,
"mean_token_accuracy": 0.16739532649517058,
"num_tokens": 14934427.0,
"step": 8605
},
{
"entropy": 5.636126184463501,
"epoch": 0.6699085780976464,
"grad_norm": 1.515625,
"learning_rate": 0.0004960583441181124,
"loss": 5.4747,
"mean_token_accuracy": 0.16085093319416047,
"num_tokens": 14943175.0,
"step": 8610
},
{
"entropy": 5.587858009338379,
"epoch": 0.670297607469364,
"grad_norm": 1.5078125,
"learning_rate": 0.0004960531773644992,
"loss": 5.5039,
"mean_token_accuracy": 0.16135278195142747,
"num_tokens": 14951933.0,
"step": 8615
},
{
"entropy": 5.554653596878052,
"epoch": 0.6706866368410815,
"grad_norm": 3.734375,
"learning_rate": 0.0004960480072567557,
"loss": 5.491,
"mean_token_accuracy": 0.16200556010007858,
"num_tokens": 14960735.0,
"step": 8620
},
{
"entropy": 5.607791566848755,
"epoch": 0.671075666212799,
"grad_norm": 1.65625,
"learning_rate": 0.0004960428337949604,
"loss": 5.5836,
"mean_token_accuracy": 0.15506957173347474,
"num_tokens": 14970326.0,
"step": 8625
},
{
"entropy": 5.645353841781616,
"epoch": 0.6714646955845166,
"grad_norm": 1.6875,
"learning_rate": 0.0004960376569791921,
"loss": 5.4494,
"mean_token_accuracy": 0.1644549399614334,
"num_tokens": 14979822.0,
"step": 8630
},
{
"entropy": 5.733426570892334,
"epoch": 0.6718537249562342,
"grad_norm": 1.6640625,
"learning_rate": 0.0004960324768095291,
"loss": 5.5556,
"mean_token_accuracy": 0.15823704600334168,
"num_tokens": 14989350.0,
"step": 8635
},
{
"entropy": 5.657193660736084,
"epoch": 0.6722427543279518,
"grad_norm": 1.96875,
"learning_rate": 0.0004960272932860502,
"loss": 5.5569,
"mean_token_accuracy": 0.15302964970469474,
"num_tokens": 14998763.0,
"step": 8640
},
{
"entropy": 5.610429859161377,
"epoch": 0.6726317836996694,
"grad_norm": 1.8203125,
"learning_rate": 0.0004960221064088338,
"loss": 5.4387,
"mean_token_accuracy": 0.16410010904073716,
"num_tokens": 15006497.0,
"step": 8645
},
{
"entropy": 5.521879577636719,
"epoch": 0.6730208130713868,
"grad_norm": 2.140625,
"learning_rate": 0.0004960169161779588,
"loss": 5.4088,
"mean_token_accuracy": 0.16455425322055817,
"num_tokens": 15014397.0,
"step": 8650
},
{
"entropy": 5.5825025081634525,
"epoch": 0.6734098424431044,
"grad_norm": 1.4609375,
"learning_rate": 0.0004960117225935038,
"loss": 5.434,
"mean_token_accuracy": 0.1634689003229141,
"num_tokens": 15022726.0,
"step": 8655
},
{
"entropy": 5.689628839492798,
"epoch": 0.673798871814822,
"grad_norm": 1.40625,
"learning_rate": 0.0004960065256555477,
"loss": 5.6392,
"mean_token_accuracy": 0.15156934410333633,
"num_tokens": 15032317.0,
"step": 8660
},
{
"entropy": 5.632172536849976,
"epoch": 0.6741879011865396,
"grad_norm": 1.5390625,
"learning_rate": 0.0004960013253641695,
"loss": 5.5093,
"mean_token_accuracy": 0.16222840100526809,
"num_tokens": 15041091.0,
"step": 8665
},
{
"entropy": 5.696352577209472,
"epoch": 0.6745769305582572,
"grad_norm": 1.4921875,
"learning_rate": 0.0004959961217194477,
"loss": 5.6481,
"mean_token_accuracy": 0.15019654110074043,
"num_tokens": 15049797.0,
"step": 8670
},
{
"entropy": 5.562292814254761,
"epoch": 0.6749659599299748,
"grad_norm": 1.5078125,
"learning_rate": 0.0004959909147214615,
"loss": 5.3326,
"mean_token_accuracy": 0.17687424272298813,
"num_tokens": 15057736.0,
"step": 8675
},
{
"entropy": 5.586552238464355,
"epoch": 0.6753549893016922,
"grad_norm": 1.453125,
"learning_rate": 0.0004959857043702902,
"loss": 5.5146,
"mean_token_accuracy": 0.16430850476026534,
"num_tokens": 15066072.0,
"step": 8680
},
{
"entropy": 5.605910587310791,
"epoch": 0.6757440186734098,
"grad_norm": 1.3984375,
"learning_rate": 0.0004959804906660124,
"loss": 5.4266,
"mean_token_accuracy": 0.1668688103556633,
"num_tokens": 15073918.0,
"step": 8685
},
{
"entropy": 5.665558671951294,
"epoch": 0.6761330480451274,
"grad_norm": 1.4921875,
"learning_rate": 0.0004959752736087073,
"loss": 5.5073,
"mean_token_accuracy": 0.16089159101247788,
"num_tokens": 15082937.0,
"step": 8690
},
{
"entropy": 5.609713792800903,
"epoch": 0.676522077416845,
"grad_norm": 1.65625,
"learning_rate": 0.0004959700531984543,
"loss": 5.4734,
"mean_token_accuracy": 0.1653521776199341,
"num_tokens": 15091218.0,
"step": 8695
},
{
"entropy": 5.616780757904053,
"epoch": 0.6769111067885626,
"grad_norm": 1.5390625,
"learning_rate": 0.0004959648294353324,
"loss": 5.4071,
"mean_token_accuracy": 0.16858331859111786,
"num_tokens": 15099640.0,
"step": 8700
},
{
"entropy": 5.62099781036377,
"epoch": 0.6773001361602801,
"grad_norm": 1.375,
"learning_rate": 0.0004959596023194208,
"loss": 5.4814,
"mean_token_accuracy": 0.1604107677936554,
"num_tokens": 15108710.0,
"step": 8705
},
{
"entropy": 5.589712762832642,
"epoch": 0.6776891655319977,
"grad_norm": 1.328125,
"learning_rate": 0.000495954371850799,
"loss": 5.4417,
"mean_token_accuracy": 0.16216772943735122,
"num_tokens": 15117074.0,
"step": 8710
},
{
"entropy": 5.635924339294434,
"epoch": 0.6780781949037152,
"grad_norm": 1.453125,
"learning_rate": 0.0004959491380295463,
"loss": 5.4247,
"mean_token_accuracy": 0.1658407837152481,
"num_tokens": 15124714.0,
"step": 8715
},
{
"entropy": 5.545988988876343,
"epoch": 0.6784672242754328,
"grad_norm": 1.40625,
"learning_rate": 0.0004959439008557422,
"loss": 5.448,
"mean_token_accuracy": 0.16205866634845734,
"num_tokens": 15134177.0,
"step": 8720
},
{
"entropy": 5.591541147232055,
"epoch": 0.6788562536471504,
"grad_norm": 1.890625,
"learning_rate": 0.000495938660329466,
"loss": 5.4609,
"mean_token_accuracy": 0.16577730029821397,
"num_tokens": 15142659.0,
"step": 8725
},
{
"entropy": 5.62673921585083,
"epoch": 0.6792452830188679,
"grad_norm": 1.625,
"learning_rate": 0.0004959334164507973,
"loss": 5.6093,
"mean_token_accuracy": 0.15286325365304948,
"num_tokens": 15151423.0,
"step": 8730
},
{
"entropy": 5.624324989318848,
"epoch": 0.6796343123905855,
"grad_norm": 1.421875,
"learning_rate": 0.0004959281692198155,
"loss": 5.4109,
"mean_token_accuracy": 0.16259230971336364,
"num_tokens": 15159986.0,
"step": 8735
},
{
"entropy": 5.607788467407227,
"epoch": 0.6800233417623031,
"grad_norm": 1.421875,
"learning_rate": 0.0004959229186366007,
"loss": 5.4614,
"mean_token_accuracy": 0.16272899210453035,
"num_tokens": 15168183.0,
"step": 8740
},
{
"entropy": 5.509155893325806,
"epoch": 0.6804123711340206,
"grad_norm": 1.359375,
"learning_rate": 0.000495917664701232,
"loss": 5.3957,
"mean_token_accuracy": 0.1645374119281769,
"num_tokens": 15176476.0,
"step": 8745
},
{
"entropy": 5.751757669448852,
"epoch": 0.6808014005057382,
"grad_norm": 1.3671875,
"learning_rate": 0.0004959124074137894,
"loss": 5.6686,
"mean_token_accuracy": 0.15058834254741668,
"num_tokens": 15186873.0,
"step": 8750
},
{
"entropy": 5.654232454299927,
"epoch": 0.6811904298774557,
"grad_norm": 1.375,
"learning_rate": 0.0004959071467743526,
"loss": 5.4605,
"mean_token_accuracy": 0.1574256755411625,
"num_tokens": 15194965.0,
"step": 8755
},
{
"entropy": 5.511550617218018,
"epoch": 0.6815794592491733,
"grad_norm": 1.515625,
"learning_rate": 0.0004959018827830016,
"loss": 5.3325,
"mean_token_accuracy": 0.16597196459770203,
"num_tokens": 15204028.0,
"step": 8760
},
{
"entropy": 5.483450841903687,
"epoch": 0.6819684886208909,
"grad_norm": 1.5859375,
"learning_rate": 0.000495896615439816,
"loss": 5.3448,
"mean_token_accuracy": 0.17626579105854034,
"num_tokens": 15212011.0,
"step": 8765
},
{
"entropy": 5.540477132797241,
"epoch": 0.6823575179926085,
"grad_norm": 1.703125,
"learning_rate": 0.0004958913447448759,
"loss": 5.4426,
"mean_token_accuracy": 0.1627766102552414,
"num_tokens": 15220088.0,
"step": 8770
},
{
"entropy": 5.6379650115966795,
"epoch": 0.682746547364326,
"grad_norm": 1.5390625,
"learning_rate": 0.0004958860706982613,
"loss": 5.3944,
"mean_token_accuracy": 0.16646525710821153,
"num_tokens": 15228676.0,
"step": 8775
},
{
"entropy": 5.5093952178955075,
"epoch": 0.6831355767360435,
"grad_norm": 1.5390625,
"learning_rate": 0.000495880793300052,
"loss": 5.4235,
"mean_token_accuracy": 0.168090882897377,
"num_tokens": 15237392.0,
"step": 8780
},
{
"entropy": 5.555091094970703,
"epoch": 0.6835246061077611,
"grad_norm": 1.6875,
"learning_rate": 0.0004958755125503284,
"loss": 5.563,
"mean_token_accuracy": 0.1629531815648079,
"num_tokens": 15246738.0,
"step": 8785
},
{
"entropy": 5.70695013999939,
"epoch": 0.6839136354794787,
"grad_norm": 1.421875,
"learning_rate": 0.0004958702284491703,
"loss": 5.5492,
"mean_token_accuracy": 0.1600048288702965,
"num_tokens": 15255154.0,
"step": 8790
},
{
"entropy": 5.617724895477295,
"epoch": 0.6843026648511963,
"grad_norm": 1.53125,
"learning_rate": 0.0004958649409966581,
"loss": 5.4238,
"mean_token_accuracy": 0.1639481157064438,
"num_tokens": 15264178.0,
"step": 8795
},
{
"entropy": 5.6335736274719235,
"epoch": 0.6846916942229139,
"grad_norm": 1.625,
"learning_rate": 0.000495859650192872,
"loss": 5.5289,
"mean_token_accuracy": 0.1640607163310051,
"num_tokens": 15272591.0,
"step": 8800
},
{
"entropy": 5.627588701248169,
"epoch": 0.6850807235946313,
"grad_norm": 1.3828125,
"learning_rate": 0.0004958543560378922,
"loss": 5.4459,
"mean_token_accuracy": 0.16031597703695297,
"num_tokens": 15281280.0,
"step": 8805
},
{
"entropy": 5.577515888214111,
"epoch": 0.6854697529663489,
"grad_norm": 1.5703125,
"learning_rate": 0.0004958490585317991,
"loss": 5.3933,
"mean_token_accuracy": 0.169253808259964,
"num_tokens": 15290639.0,
"step": 8810
},
{
"entropy": 5.539572143554688,
"epoch": 0.6858587823380665,
"grad_norm": 1.546875,
"learning_rate": 0.000495843757674673,
"loss": 5.3904,
"mean_token_accuracy": 0.15841607749462128,
"num_tokens": 15298877.0,
"step": 8815
},
{
"entropy": 5.627851152420044,
"epoch": 0.6862478117097841,
"grad_norm": 1.40625,
"learning_rate": 0.0004958384534665945,
"loss": 5.5185,
"mean_token_accuracy": 0.15833221822977067,
"num_tokens": 15307710.0,
"step": 8820
},
{
"entropy": 5.643237590789795,
"epoch": 0.6866368410815017,
"grad_norm": 1.5859375,
"learning_rate": 0.0004958331459076438,
"loss": 5.5354,
"mean_token_accuracy": 0.16657649874687194,
"num_tokens": 15315749.0,
"step": 8825
},
{
"entropy": 5.666751956939697,
"epoch": 0.6870258704532192,
"grad_norm": 1.5625,
"learning_rate": 0.0004958278349979018,
"loss": 5.4937,
"mean_token_accuracy": 0.15831152200698853,
"num_tokens": 15324161.0,
"step": 8830
},
{
"entropy": 5.525657415390015,
"epoch": 0.6874148998249368,
"grad_norm": 1.65625,
"learning_rate": 0.0004958225207374488,
"loss": 5.3865,
"mean_token_accuracy": 0.16515809148550034,
"num_tokens": 15333414.0,
"step": 8835
},
{
"entropy": 5.619464302062989,
"epoch": 0.6878039291966543,
"grad_norm": 1.484375,
"learning_rate": 0.0004958172031263655,
"loss": 5.4721,
"mean_token_accuracy": 0.1637744888663292,
"num_tokens": 15342369.0,
"step": 8840
},
{
"entropy": 5.668105411529541,
"epoch": 0.6881929585683719,
"grad_norm": 1.5234375,
"learning_rate": 0.0004958118821647326,
"loss": 5.5448,
"mean_token_accuracy": 0.154964642226696,
"num_tokens": 15351109.0,
"step": 8845
},
{
"entropy": 5.5900016784667965,
"epoch": 0.6885819879400895,
"grad_norm": 1.609375,
"learning_rate": 0.0004958065578526308,
"loss": 5.4351,
"mean_token_accuracy": 0.16864016205072402,
"num_tokens": 15359837.0,
"step": 8850
},
{
"entropy": 5.547193765640259,
"epoch": 0.688971017311807,
"grad_norm": 1.9921875,
"learning_rate": 0.000495801230190141,
"loss": 5.4663,
"mean_token_accuracy": 0.1670744426548481,
"num_tokens": 15368776.0,
"step": 8855
},
{
"entropy": 5.571122741699218,
"epoch": 0.6893600466835246,
"grad_norm": 1.5703125,
"learning_rate": 0.0004957958991773441,
"loss": 5.4472,
"mean_token_accuracy": 0.16593606919050216,
"num_tokens": 15378127.0,
"step": 8860
},
{
"entropy": 5.618199396133423,
"epoch": 0.6897490760552422,
"grad_norm": 1.53125,
"learning_rate": 0.0004957905648143206,
"loss": 5.4145,
"mean_token_accuracy": 0.1654287099838257,
"num_tokens": 15386580.0,
"step": 8865
},
{
"entropy": 5.626070880889893,
"epoch": 0.6901381054269597,
"grad_norm": 1.4765625,
"learning_rate": 0.0004957852271011519,
"loss": 5.5675,
"mean_token_accuracy": 0.1599985420703888,
"num_tokens": 15395973.0,
"step": 8870
},
{
"entropy": 5.6116798400878904,
"epoch": 0.6905271347986773,
"grad_norm": 1.5,
"learning_rate": 0.0004957798860379187,
"loss": 5.4506,
"mean_token_accuracy": 0.1576478213071823,
"num_tokens": 15404738.0,
"step": 8875
},
{
"entropy": 5.624153327941895,
"epoch": 0.6909161641703949,
"grad_norm": 1.484375,
"learning_rate": 0.0004957745416247022,
"loss": 5.5947,
"mean_token_accuracy": 0.1643390730023384,
"num_tokens": 15413530.0,
"step": 8880
},
{
"entropy": 5.61382155418396,
"epoch": 0.6913051935421124,
"grad_norm": 1.375,
"learning_rate": 0.0004957691938615833,
"loss": 5.5804,
"mean_token_accuracy": 0.15752760097384452,
"num_tokens": 15423268.0,
"step": 8885
},
{
"entropy": 5.573393630981445,
"epoch": 0.69169422291383,
"grad_norm": 1.53125,
"learning_rate": 0.0004957638427486434,
"loss": 5.3878,
"mean_token_accuracy": 0.1690160557627678,
"num_tokens": 15431690.0,
"step": 8890
},
{
"entropy": 5.602618646621704,
"epoch": 0.6920832522855476,
"grad_norm": 1.421875,
"learning_rate": 0.0004957584882859636,
"loss": 5.5484,
"mean_token_accuracy": 0.15811869204044343,
"num_tokens": 15440110.0,
"step": 8895
},
{
"entropy": 5.714527559280396,
"epoch": 0.6924722816572652,
"grad_norm": 1.6875,
"learning_rate": 0.0004957531304736251,
"loss": 5.5609,
"mean_token_accuracy": 0.15900706499814987,
"num_tokens": 15449022.0,
"step": 8900
},
{
"entropy": 5.74059796333313,
"epoch": 0.6928613110289827,
"grad_norm": 1.3828125,
"learning_rate": 0.0004957477693117091,
"loss": 5.6081,
"mean_token_accuracy": 0.1521860897541046,
"num_tokens": 15457826.0,
"step": 8905
},
{
"entropy": 5.633170747756958,
"epoch": 0.6932503404007002,
"grad_norm": 1.4453125,
"learning_rate": 0.0004957424048002971,
"loss": 5.4866,
"mean_token_accuracy": 0.16168588250875474,
"num_tokens": 15466631.0,
"step": 8910
},
{
"entropy": 5.528276968002319,
"epoch": 0.6936393697724178,
"grad_norm": 1.296875,
"learning_rate": 0.0004957370369394706,
"loss": 5.3796,
"mean_token_accuracy": 0.16295055896043778,
"num_tokens": 15474666.0,
"step": 8915
},
{
"entropy": 5.515926742553711,
"epoch": 0.6940283991441354,
"grad_norm": 1.625,
"learning_rate": 0.0004957316657293107,
"loss": 5.3883,
"mean_token_accuracy": 0.16150261461734772,
"num_tokens": 15483576.0,
"step": 8920
},
{
"entropy": 5.744505786895752,
"epoch": 0.694417428515853,
"grad_norm": 1.5390625,
"learning_rate": 0.0004957262911698992,
"loss": 5.5505,
"mean_token_accuracy": 0.15730631202459336,
"num_tokens": 15491313.0,
"step": 8925
},
{
"entropy": 5.61945481300354,
"epoch": 0.6948064578875706,
"grad_norm": 1.3671875,
"learning_rate": 0.0004957209132613175,
"loss": 5.5039,
"mean_token_accuracy": 0.16225907653570176,
"num_tokens": 15500638.0,
"step": 8930
},
{
"entropy": 5.5722874164581295,
"epoch": 0.695195487259288,
"grad_norm": 1.4375,
"learning_rate": 0.0004957155320036473,
"loss": 5.4996,
"mean_token_accuracy": 0.16195370107889176,
"num_tokens": 15509170.0,
"step": 8935
},
{
"entropy": 5.737703943252564,
"epoch": 0.6955845166310056,
"grad_norm": 1.3828125,
"learning_rate": 0.0004957101473969702,
"loss": 5.5868,
"mean_token_accuracy": 0.1541694298386574,
"num_tokens": 15518108.0,
"step": 8940
},
{
"entropy": 5.608725214004517,
"epoch": 0.6959735460027232,
"grad_norm": 1.5,
"learning_rate": 0.000495704759441368,
"loss": 5.4399,
"mean_token_accuracy": 0.16826948374509812,
"num_tokens": 15526558.0,
"step": 8945
},
{
"entropy": 5.567080926895142,
"epoch": 0.6963625753744408,
"grad_norm": 1.4609375,
"learning_rate": 0.0004956993681369221,
"loss": 5.4086,
"mean_token_accuracy": 0.16608458757400513,
"num_tokens": 15535685.0,
"step": 8950
},
{
"entropy": 5.598057079315185,
"epoch": 0.6967516047461584,
"grad_norm": 1.5390625,
"learning_rate": 0.0004956939734837148,
"loss": 5.4573,
"mean_token_accuracy": 0.16753346621990203,
"num_tokens": 15544072.0,
"step": 8955
},
{
"entropy": 5.616986417770386,
"epoch": 0.6971406341178759,
"grad_norm": 1.546875,
"learning_rate": 0.0004956885754818277,
"loss": 5.5587,
"mean_token_accuracy": 0.1520525261759758,
"num_tokens": 15553303.0,
"step": 8960
},
{
"entropy": 5.633440065383911,
"epoch": 0.6975296634895934,
"grad_norm": 1.359375,
"learning_rate": 0.0004956831741313427,
"loss": 5.4995,
"mean_token_accuracy": 0.15973107665777206,
"num_tokens": 15561942.0,
"step": 8965
},
{
"entropy": 5.623577308654785,
"epoch": 0.697918692861311,
"grad_norm": 1.5,
"learning_rate": 0.0004956777694323418,
"loss": 5.3534,
"mean_token_accuracy": 0.172841776907444,
"num_tokens": 15569988.0,
"step": 8970
},
{
"entropy": 5.570699214935303,
"epoch": 0.6983077222330286,
"grad_norm": 1.703125,
"learning_rate": 0.000495672361384907,
"loss": 5.5355,
"mean_token_accuracy": 0.16330803483724593,
"num_tokens": 15579816.0,
"step": 8975
},
{
"entropy": 5.595700073242187,
"epoch": 0.6986967516047462,
"grad_norm": 2.03125,
"learning_rate": 0.0004956669499891202,
"loss": 5.4168,
"mean_token_accuracy": 0.1699569582939148,
"num_tokens": 15587843.0,
"step": 8980
},
{
"entropy": 5.651184034347534,
"epoch": 0.6990857809764637,
"grad_norm": 1.5859375,
"learning_rate": 0.0004956615352450639,
"loss": 5.4735,
"mean_token_accuracy": 0.16514448672533036,
"num_tokens": 15596798.0,
"step": 8985
},
{
"entropy": 5.618335151672364,
"epoch": 0.6994748103481813,
"grad_norm": 1.4609375,
"learning_rate": 0.0004956561171528198,
"loss": 5.5535,
"mean_token_accuracy": 0.16553656309843062,
"num_tokens": 15605360.0,
"step": 8990
},
{
"entropy": 5.550785064697266,
"epoch": 0.6998638397198989,
"grad_norm": 1.546875,
"learning_rate": 0.0004956506957124704,
"loss": 5.4225,
"mean_token_accuracy": 0.170002281665802,
"num_tokens": 15613557.0,
"step": 8995
},
{
"entropy": 5.597484922409057,
"epoch": 0.7002528690916164,
"grad_norm": 1.3984375,
"learning_rate": 0.000495645270924098,
"loss": 5.4867,
"mean_token_accuracy": 0.16351661831140518,
"num_tokens": 15622144.0,
"step": 9000
},
{
"epoch": 0.7002528690916164,
"eval_entropy": 5.496048769615841,
"eval_loss": 5.52293062210083,
"eval_mean_token_accuracy": 0.16872901462226447,
"eval_num_tokens": 15622144.0,
"eval_runtime": 28.4802,
"eval_samples_per_second": 1459.192,
"eval_steps_per_second": 182.408,
"step": 9000
},
{
"entropy": 5.584130096435547,
"epoch": 0.700641898463334,
"grad_norm": 1.3671875,
"learning_rate": 0.0004956398427877847,
"loss": 5.4332,
"mean_token_accuracy": 0.16233085095882416,
"num_tokens": 15631119.0,
"step": 9005
},
{
"entropy": 5.512149953842163,
"epoch": 0.7010309278350515,
"grad_norm": 1.6015625,
"learning_rate": 0.000495634411303613,
"loss": 5.3482,
"mean_token_accuracy": 0.17366744726896285,
"num_tokens": 15639969.0,
"step": 9010
},
{
"entropy": 5.547135066986084,
"epoch": 0.7014199572067691,
"grad_norm": 1.515625,
"learning_rate": 0.0004956289764716654,
"loss": 5.4802,
"mean_token_accuracy": 0.16370593160390853,
"num_tokens": 15648522.0,
"step": 9015
},
{
"entropy": 5.535307693481445,
"epoch": 0.7018089865784867,
"grad_norm": 1.375,
"learning_rate": 0.0004956235382920241,
"loss": 5.4256,
"mean_token_accuracy": 0.1641954869031906,
"num_tokens": 15656834.0,
"step": 9020
},
{
"entropy": 5.663244962692261,
"epoch": 0.7021980159502043,
"grad_norm": 1.453125,
"learning_rate": 0.0004956180967647717,
"loss": 5.5942,
"mean_token_accuracy": 0.15337878167629243,
"num_tokens": 15665066.0,
"step": 9025
},
{
"entropy": 5.668092441558838,
"epoch": 0.7025870453219218,
"grad_norm": 1.46875,
"learning_rate": 0.0004956126518899911,
"loss": 5.4986,
"mean_token_accuracy": 0.15815163403749466,
"num_tokens": 15673733.0,
"step": 9030
},
{
"entropy": 5.699274063110352,
"epoch": 0.7029760746936393,
"grad_norm": 1.484375,
"learning_rate": 0.0004956072036677644,
"loss": 5.522,
"mean_token_accuracy": 0.1604725942015648,
"num_tokens": 15682212.0,
"step": 9035
},
{
"entropy": 5.586855792999268,
"epoch": 0.7033651040653569,
"grad_norm": 1.546875,
"learning_rate": 0.0004956017520981746,
"loss": 5.5274,
"mean_token_accuracy": 0.15395476371049882,
"num_tokens": 15690518.0,
"step": 9040
},
{
"entropy": 5.6907836437225345,
"epoch": 0.7037541334370745,
"grad_norm": 1.359375,
"learning_rate": 0.0004955962971813044,
"loss": 5.5798,
"mean_token_accuracy": 0.15354745984077453,
"num_tokens": 15699474.0,
"step": 9045
},
{
"entropy": 5.7091151714324955,
"epoch": 0.7041431628087921,
"grad_norm": 1.515625,
"learning_rate": 0.0004955908389172364,
"loss": 5.5728,
"mean_token_accuracy": 0.1551925852894783,
"num_tokens": 15708571.0,
"step": 9050
},
{
"entropy": 5.701828336715698,
"epoch": 0.7045321921805097,
"grad_norm": 1.5234375,
"learning_rate": 0.0004955853773060536,
"loss": 5.5461,
"mean_token_accuracy": 0.16137275099754333,
"num_tokens": 15717307.0,
"step": 9055
},
{
"entropy": 5.5792402744293215,
"epoch": 0.7049212215522271,
"grad_norm": 2.1875,
"learning_rate": 0.0004955799123478388,
"loss": 5.3449,
"mean_token_accuracy": 0.16866725385189058,
"num_tokens": 15725502.0,
"step": 9060
},
{
"entropy": 5.550484132766724,
"epoch": 0.7053102509239447,
"grad_norm": 1.484375,
"learning_rate": 0.0004955744440426748,
"loss": 5.5417,
"mean_token_accuracy": 0.15647795647382737,
"num_tokens": 15734805.0,
"step": 9065
},
{
"entropy": 5.589828538894653,
"epoch": 0.7056992802956623,
"grad_norm": 1.8828125,
"learning_rate": 0.0004955689723906448,
"loss": 5.3993,
"mean_token_accuracy": 0.16252316832542418,
"num_tokens": 15743313.0,
"step": 9070
},
{
"entropy": 5.535020256042481,
"epoch": 0.7060883096673799,
"grad_norm": 1.3515625,
"learning_rate": 0.0004955634973918318,
"loss": 5.3524,
"mean_token_accuracy": 0.16813426911830903,
"num_tokens": 15752552.0,
"step": 9075
},
{
"entropy": 5.607556486129761,
"epoch": 0.7064773390390975,
"grad_norm": 1.453125,
"learning_rate": 0.0004955580190463186,
"loss": 5.4694,
"mean_token_accuracy": 0.17079655826091766,
"num_tokens": 15761404.0,
"step": 9080
},
{
"entropy": 5.621607828140259,
"epoch": 0.7068663684108151,
"grad_norm": 1.40625,
"learning_rate": 0.0004955525373541886,
"loss": 5.5342,
"mean_token_accuracy": 0.16124300956726073,
"num_tokens": 15770605.0,
"step": 9085
},
{
"entropy": 5.559562492370605,
"epoch": 0.7072553977825325,
"grad_norm": 1.5625,
"learning_rate": 0.0004955470523155249,
"loss": 5.4102,
"mean_token_accuracy": 0.1709872752428055,
"num_tokens": 15778047.0,
"step": 9090
},
{
"entropy": 5.588971424102783,
"epoch": 0.7076444271542501,
"grad_norm": 1.328125,
"learning_rate": 0.0004955415639304107,
"loss": 5.4812,
"mean_token_accuracy": 0.1654489055275917,
"num_tokens": 15788304.0,
"step": 9095
},
{
"entropy": 5.640074825286865,
"epoch": 0.7080334565259677,
"grad_norm": 1.46875,
"learning_rate": 0.0004955360721989292,
"loss": 5.4769,
"mean_token_accuracy": 0.161972077190876,
"num_tokens": 15796448.0,
"step": 9100
},
{
"entropy": 5.506970643997192,
"epoch": 0.7084224858976853,
"grad_norm": 1.2890625,
"learning_rate": 0.0004955305771211641,
"loss": 5.4435,
"mean_token_accuracy": 0.16246534883975983,
"num_tokens": 15805072.0,
"step": 9105
},
{
"entropy": 5.53871636390686,
"epoch": 0.7088115152694029,
"grad_norm": 1.34375,
"learning_rate": 0.0004955250786971982,
"loss": 5.4976,
"mean_token_accuracy": 0.16125560104846953,
"num_tokens": 15813918.0,
"step": 9110
},
{
"entropy": 5.749186897277832,
"epoch": 0.7092005446411204,
"grad_norm": 1.5234375,
"learning_rate": 0.0004955195769271154,
"loss": 5.629,
"mean_token_accuracy": 0.159039643406868,
"num_tokens": 15822675.0,
"step": 9115
},
{
"entropy": 5.613381195068359,
"epoch": 0.709589574012838,
"grad_norm": 1.921875,
"learning_rate": 0.0004955140718109991,
"loss": 5.4933,
"mean_token_accuracy": 0.15853687524795532,
"num_tokens": 15831056.0,
"step": 9120
},
{
"entropy": 5.629505681991577,
"epoch": 0.7099786033845555,
"grad_norm": 1.2890625,
"learning_rate": 0.0004955085633489326,
"loss": 5.5691,
"mean_token_accuracy": 0.15488039702177048,
"num_tokens": 15839948.0,
"step": 9125
},
{
"entropy": 5.656857299804687,
"epoch": 0.7103676327562731,
"grad_norm": 1.5546875,
"learning_rate": 0.0004955030515409997,
"loss": 5.4599,
"mean_token_accuracy": 0.16460514813661575,
"num_tokens": 15848738.0,
"step": 9130
},
{
"entropy": 5.6479651927948,
"epoch": 0.7107566621279907,
"grad_norm": 1.3125,
"learning_rate": 0.0004954975363872838,
"loss": 5.5355,
"mean_token_accuracy": 0.1553099572658539,
"num_tokens": 15859073.0,
"step": 9135
},
{
"entropy": 5.577330875396728,
"epoch": 0.7111456914997082,
"grad_norm": 1.4609375,
"learning_rate": 0.0004954920178878689,
"loss": 5.4359,
"mean_token_accuracy": 0.1606438487768173,
"num_tokens": 15868146.0,
"step": 9140
},
{
"entropy": 5.513467645645141,
"epoch": 0.7115347208714258,
"grad_norm": 1.40625,
"learning_rate": 0.0004954864960428385,
"loss": 5.3771,
"mean_token_accuracy": 0.1637046977877617,
"num_tokens": 15876915.0,
"step": 9145
},
{
"entropy": 5.5574743270874025,
"epoch": 0.7119237502431434,
"grad_norm": 1.4453125,
"learning_rate": 0.0004954809708522765,
"loss": 5.4498,
"mean_token_accuracy": 0.16000136882066726,
"num_tokens": 15884947.0,
"step": 9150
},
{
"entropy": 5.585346937179565,
"epoch": 0.712312779614861,
"grad_norm": 1.328125,
"learning_rate": 0.0004954754423162667,
"loss": 5.4753,
"mean_token_accuracy": 0.1583109453320503,
"num_tokens": 15894595.0,
"step": 9155
},
{
"entropy": 5.617086410522461,
"epoch": 0.7127018089865785,
"grad_norm": 1.4765625,
"learning_rate": 0.000495469910434893,
"loss": 5.4684,
"mean_token_accuracy": 0.16696888506412505,
"num_tokens": 15902920.0,
"step": 9160
},
{
"entropy": 5.567520332336426,
"epoch": 0.713090838358296,
"grad_norm": 1.421875,
"learning_rate": 0.0004954643752082392,
"loss": 5.452,
"mean_token_accuracy": 0.1669886142015457,
"num_tokens": 15911414.0,
"step": 9165
},
{
"entropy": 5.6806916236877445,
"epoch": 0.7134798677300136,
"grad_norm": 1.6875,
"learning_rate": 0.0004954588366363896,
"loss": 5.5378,
"mean_token_accuracy": 0.15698813572525977,
"num_tokens": 15919855.0,
"step": 9170
},
{
"entropy": 5.565380716323853,
"epoch": 0.7138688971017312,
"grad_norm": 1.4921875,
"learning_rate": 0.0004954532947194279,
"loss": 5.4646,
"mean_token_accuracy": 0.1613001361489296,
"num_tokens": 15928932.0,
"step": 9175
},
{
"entropy": 5.591390323638916,
"epoch": 0.7142579264734488,
"grad_norm": 1.4765625,
"learning_rate": 0.0004954477494574384,
"loss": 5.5053,
"mean_token_accuracy": 0.1586716115474701,
"num_tokens": 15938266.0,
"step": 9180
},
{
"entropy": 5.720804500579834,
"epoch": 0.7146469558451664,
"grad_norm": 1.3046875,
"learning_rate": 0.0004954422008505052,
"loss": 5.5379,
"mean_token_accuracy": 0.1626137003302574,
"num_tokens": 15947100.0,
"step": 9185
},
{
"entropy": 5.575640153884888,
"epoch": 0.7150359852168838,
"grad_norm": 1.6328125,
"learning_rate": 0.0004954366488987125,
"loss": 5.5316,
"mean_token_accuracy": 0.1536930650472641,
"num_tokens": 15955544.0,
"step": 9190
},
{
"entropy": 5.6070897579193115,
"epoch": 0.7154250145886014,
"grad_norm": 1.4375,
"learning_rate": 0.0004954310936021444,
"loss": 5.5575,
"mean_token_accuracy": 0.16221348494291304,
"num_tokens": 15963372.0,
"step": 9195
},
{
"entropy": 5.674570846557617,
"epoch": 0.715814043960319,
"grad_norm": 1.71875,
"learning_rate": 0.0004954255349608853,
"loss": 5.522,
"mean_token_accuracy": 0.15607647448778153,
"num_tokens": 15972940.0,
"step": 9200
},
{
"entropy": 5.618421745300293,
"epoch": 0.7162030733320366,
"grad_norm": 1.515625,
"learning_rate": 0.0004954199729750198,
"loss": 5.4962,
"mean_token_accuracy": 0.15723588317632675,
"num_tokens": 15982238.0,
"step": 9205
},
{
"entropy": 5.628593873977661,
"epoch": 0.7165921027037542,
"grad_norm": 1.5859375,
"learning_rate": 0.0004954144076446318,
"loss": 5.4974,
"mean_token_accuracy": 0.16220944076776506,
"num_tokens": 15990835.0,
"step": 9210
},
{
"entropy": 5.703175258636475,
"epoch": 0.7169811320754716,
"grad_norm": 1.640625,
"learning_rate": 0.0004954088389698061,
"loss": 5.6135,
"mean_token_accuracy": 0.15768413245677948,
"num_tokens": 16000649.0,
"step": 9215
},
{
"entropy": 5.601278972625733,
"epoch": 0.7173701614471892,
"grad_norm": 1.5,
"learning_rate": 0.000495403266950627,
"loss": 5.514,
"mean_token_accuracy": 0.15895985662937165,
"num_tokens": 16009214.0,
"step": 9220
},
{
"entropy": 5.667197322845459,
"epoch": 0.7177591908189068,
"grad_norm": 1.328125,
"learning_rate": 0.0004953976915871792,
"loss": 5.4894,
"mean_token_accuracy": 0.165646892786026,
"num_tokens": 16018173.0,
"step": 9225
},
{
"entropy": 5.548560762405396,
"epoch": 0.7181482201906244,
"grad_norm": 1.421875,
"learning_rate": 0.0004953921128795472,
"loss": 5.3853,
"mean_token_accuracy": 0.1733367085456848,
"num_tokens": 16026857.0,
"step": 9230
},
{
"entropy": 5.561794137954712,
"epoch": 0.718537249562342,
"grad_norm": 1.34375,
"learning_rate": 0.0004953865308278156,
"loss": 5.547,
"mean_token_accuracy": 0.15863846987485886,
"num_tokens": 16035792.0,
"step": 9235
},
{
"entropy": 5.630701732635498,
"epoch": 0.7189262789340595,
"grad_norm": 1.4296875,
"learning_rate": 0.0004953809454320693,
"loss": 5.4865,
"mean_token_accuracy": 0.1660788431763649,
"num_tokens": 16044874.0,
"step": 9240
},
{
"entropy": 5.62094521522522,
"epoch": 0.7193153083057771,
"grad_norm": 1.6015625,
"learning_rate": 0.0004953753566923929,
"loss": 5.4602,
"mean_token_accuracy": 0.15726660937070847,
"num_tokens": 16053705.0,
"step": 9245
},
{
"entropy": 5.601760959625244,
"epoch": 0.7197043376774946,
"grad_norm": 1.328125,
"learning_rate": 0.0004953697646088712,
"loss": 5.4788,
"mean_token_accuracy": 0.15892313420772552,
"num_tokens": 16062987.0,
"step": 9250
},
{
"entropy": 5.550564193725586,
"epoch": 0.7200933670492122,
"grad_norm": 2.21875,
"learning_rate": 0.0004953641691815891,
"loss": 5.4353,
"mean_token_accuracy": 0.16546119451522828,
"num_tokens": 16071247.0,
"step": 9255
},
{
"entropy": 5.550580978393555,
"epoch": 0.7204823964209298,
"grad_norm": 1.390625,
"learning_rate": 0.0004953585704106315,
"loss": 5.3668,
"mean_token_accuracy": 0.16232201904058458,
"num_tokens": 16080190.0,
"step": 9260
},
{
"entropy": 5.602763891220093,
"epoch": 0.7208714257926473,
"grad_norm": 1.4140625,
"learning_rate": 0.0004953529682960832,
"loss": 5.4764,
"mean_token_accuracy": 0.16436592787504195,
"num_tokens": 16088885.0,
"step": 9265
},
{
"entropy": 5.531141471862793,
"epoch": 0.7212604551643649,
"grad_norm": 1.53125,
"learning_rate": 0.0004953473628380295,
"loss": 5.4239,
"mean_token_accuracy": 0.16692962646484374,
"num_tokens": 16097202.0,
"step": 9270
},
{
"entropy": 5.5650519847869875,
"epoch": 0.7216494845360825,
"grad_norm": 1.5234375,
"learning_rate": 0.0004953417540365553,
"loss": 5.3855,
"mean_token_accuracy": 0.1626739203929901,
"num_tokens": 16105468.0,
"step": 9275
},
{
"entropy": 5.635207080841065,
"epoch": 0.7220385139078,
"grad_norm": 1.4296875,
"learning_rate": 0.0004953361418917455,
"loss": 5.5405,
"mean_token_accuracy": 0.15884630233049393,
"num_tokens": 16114624.0,
"step": 9280
},
{
"entropy": 5.527190065383911,
"epoch": 0.7224275432795176,
"grad_norm": 1.34375,
"learning_rate": 0.0004953305264036856,
"loss": 5.3866,
"mean_token_accuracy": 0.16229167729616165,
"num_tokens": 16123983.0,
"step": 9285
},
{
"entropy": 5.616349601745606,
"epoch": 0.7228165726512352,
"grad_norm": 1.4296875,
"learning_rate": 0.0004953249075724607,
"loss": 5.4912,
"mean_token_accuracy": 0.1632054179906845,
"num_tokens": 16132886.0,
"step": 9290
},
{
"entropy": 5.597035694122314,
"epoch": 0.7232056020229527,
"grad_norm": 1.546875,
"learning_rate": 0.0004953192853981559,
"loss": 5.3493,
"mean_token_accuracy": 0.1766229122877121,
"num_tokens": 16141526.0,
"step": 9295
},
{
"entropy": 5.591595983505249,
"epoch": 0.7235946313946703,
"grad_norm": 1.375,
"learning_rate": 0.0004953136598808566,
"loss": 5.5492,
"mean_token_accuracy": 0.16761816889047623,
"num_tokens": 16149949.0,
"step": 9300
},
{
"entropy": 5.640862035751343,
"epoch": 0.7239836607663879,
"grad_norm": 1.3984375,
"learning_rate": 0.0004953080310206481,
"loss": 5.516,
"mean_token_accuracy": 0.1610817015171051,
"num_tokens": 16158131.0,
"step": 9305
},
{
"entropy": 5.514364194869995,
"epoch": 0.7243726901381055,
"grad_norm": 1.390625,
"learning_rate": 0.0004953023988176162,
"loss": 5.4051,
"mean_token_accuracy": 0.1642155408859253,
"num_tokens": 16167131.0,
"step": 9310
},
{
"entropy": 5.659480857849121,
"epoch": 0.724761719509823,
"grad_norm": 1.4453125,
"learning_rate": 0.0004952967632718458,
"loss": 5.6225,
"mean_token_accuracy": 0.1589721217751503,
"num_tokens": 16176198.0,
"step": 9315
},
{
"entropy": 5.597436046600341,
"epoch": 0.7251507488815405,
"grad_norm": 1.4609375,
"learning_rate": 0.0004952911243834227,
"loss": 5.4814,
"mean_token_accuracy": 0.15860309153795243,
"num_tokens": 16184860.0,
"step": 9320
},
{
"entropy": 5.620567846298218,
"epoch": 0.7255397782532581,
"grad_norm": 1.3046875,
"learning_rate": 0.0004952854821524324,
"loss": 5.4749,
"mean_token_accuracy": 0.16052934527397156,
"num_tokens": 16193126.0,
"step": 9325
},
{
"entropy": 5.564336967468262,
"epoch": 0.7259288076249757,
"grad_norm": 1.4140625,
"learning_rate": 0.0004952798365789606,
"loss": 5.4642,
"mean_token_accuracy": 0.16046443581581116,
"num_tokens": 16201763.0,
"step": 9330
},
{
"entropy": 5.575883960723877,
"epoch": 0.7263178369966933,
"grad_norm": 1.5390625,
"learning_rate": 0.0004952741876630928,
"loss": 5.3998,
"mean_token_accuracy": 0.1679904654622078,
"num_tokens": 16210947.0,
"step": 9335
},
{
"entropy": 5.630392360687256,
"epoch": 0.7267068663684109,
"grad_norm": 1.3671875,
"learning_rate": 0.0004952685354049148,
"loss": 5.4796,
"mean_token_accuracy": 0.16024356633424758,
"num_tokens": 16219772.0,
"step": 9340
},
{
"entropy": 5.623006916046142,
"epoch": 0.7270958957401283,
"grad_norm": 1.4296875,
"learning_rate": 0.0004952628798045124,
"loss": 5.4778,
"mean_token_accuracy": 0.16884386390447617,
"num_tokens": 16227759.0,
"step": 9345
},
{
"entropy": 5.569640684127807,
"epoch": 0.7274849251118459,
"grad_norm": 1.2734375,
"learning_rate": 0.0004952572208619714,
"loss": 5.353,
"mean_token_accuracy": 0.16934995651245116,
"num_tokens": 16236913.0,
"step": 9350
},
{
"entropy": 5.574661064147949,
"epoch": 0.7278739544835635,
"grad_norm": 1.453125,
"learning_rate": 0.0004952515585773778,
"loss": 5.48,
"mean_token_accuracy": 0.16137221753597258,
"num_tokens": 16246190.0,
"step": 9355
},
{
"entropy": 5.5795831203460695,
"epoch": 0.7282629838552811,
"grad_norm": 1.3515625,
"learning_rate": 0.0004952458929508171,
"loss": 5.4429,
"mean_token_accuracy": 0.16195769011974334,
"num_tokens": 16255476.0,
"step": 9360
},
{
"entropy": 5.619848728179932,
"epoch": 0.7286520132269987,
"grad_norm": 1.53125,
"learning_rate": 0.0004952402239823757,
"loss": 5.4997,
"mean_token_accuracy": 0.16256965696811676,
"num_tokens": 16264701.0,
"step": 9365
},
{
"entropy": 5.478322172164917,
"epoch": 0.7290410425987162,
"grad_norm": 1.3125,
"learning_rate": 0.0004952345516721393,
"loss": 5.312,
"mean_token_accuracy": 0.17474743723869324,
"num_tokens": 16272999.0,
"step": 9370
},
{
"entropy": 5.641229629516602,
"epoch": 0.7294300719704337,
"grad_norm": 1.53125,
"learning_rate": 0.0004952288760201942,
"loss": 5.5986,
"mean_token_accuracy": 0.16387001499533654,
"num_tokens": 16282537.0,
"step": 9375
},
{
"entropy": 5.638582706451416,
"epoch": 0.7298191013421513,
"grad_norm": 1.5546875,
"learning_rate": 0.0004952231970266265,
"loss": 5.4497,
"mean_token_accuracy": 0.17014080584049224,
"num_tokens": 16291155.0,
"step": 9380
},
{
"entropy": 5.666637420654297,
"epoch": 0.7302081307138689,
"grad_norm": 1.390625,
"learning_rate": 0.0004952175146915223,
"loss": 5.5231,
"mean_token_accuracy": 0.15771302729845046,
"num_tokens": 16300466.0,
"step": 9385
},
{
"entropy": 5.609297752380371,
"epoch": 0.7305971600855865,
"grad_norm": 1.4609375,
"learning_rate": 0.0004952118290149679,
"loss": 5.4115,
"mean_token_accuracy": 0.16585402488708495,
"num_tokens": 16309250.0,
"step": 9390
},
{
"entropy": 5.643940162658692,
"epoch": 0.730986189457304,
"grad_norm": 1.4296875,
"learning_rate": 0.0004952061399970492,
"loss": 5.5282,
"mean_token_accuracy": 0.15753922909498214,
"num_tokens": 16318056.0,
"step": 9395
},
{
"entropy": 5.524111223220825,
"epoch": 0.7313752188290216,
"grad_norm": 1.609375,
"learning_rate": 0.000495200447637853,
"loss": 5.3884,
"mean_token_accuracy": 0.16298533380031585,
"num_tokens": 16326455.0,
"step": 9400
},
{
"entropy": 5.5443085670471195,
"epoch": 0.7317642482007392,
"grad_norm": 1.609375,
"learning_rate": 0.0004951947519374655,
"loss": 5.3595,
"mean_token_accuracy": 0.16749800890684127,
"num_tokens": 16334584.0,
"step": 9405
},
{
"entropy": 5.618832159042358,
"epoch": 0.7321532775724567,
"grad_norm": 1.5234375,
"learning_rate": 0.0004951890528959731,
"loss": 5.4111,
"mean_token_accuracy": 0.17092057168483735,
"num_tokens": 16342361.0,
"step": 9410
},
{
"entropy": 5.688623046875,
"epoch": 0.7325423069441743,
"grad_norm": 1.671875,
"learning_rate": 0.0004951833505134623,
"loss": 5.5519,
"mean_token_accuracy": 0.16083619147539138,
"num_tokens": 16350414.0,
"step": 9415
},
{
"entropy": 5.5569733619689945,
"epoch": 0.7329313363158918,
"grad_norm": 1.359375,
"learning_rate": 0.0004951776447900196,
"loss": 5.3729,
"mean_token_accuracy": 0.17199201881885529,
"num_tokens": 16359266.0,
"step": 9420
},
{
"entropy": 5.4728546142578125,
"epoch": 0.7333203656876094,
"grad_norm": 1.5,
"learning_rate": 0.0004951719357257317,
"loss": 5.3716,
"mean_token_accuracy": 0.1669355571269989,
"num_tokens": 16367558.0,
"step": 9425
},
{
"entropy": 5.425278615951538,
"epoch": 0.733709395059327,
"grad_norm": 1.609375,
"learning_rate": 0.000495166223320685,
"loss": 5.3499,
"mean_token_accuracy": 0.17242926806211473,
"num_tokens": 16375690.0,
"step": 9430
},
{
"entropy": 5.575134372711181,
"epoch": 0.7340984244310446,
"grad_norm": 1.3828125,
"learning_rate": 0.0004951605075749662,
"loss": 5.4733,
"mean_token_accuracy": 0.16204415559768676,
"num_tokens": 16384157.0,
"step": 9435
},
{
"entropy": 5.592302656173706,
"epoch": 0.7344874538027621,
"grad_norm": 1.421875,
"learning_rate": 0.0004951547884886623,
"loss": 5.5091,
"mean_token_accuracy": 0.16609383076429368,
"num_tokens": 16392153.0,
"step": 9440
},
{
"entropy": 5.476838254928589,
"epoch": 0.7348764831744796,
"grad_norm": 1.5390625,
"learning_rate": 0.0004951490660618598,
"loss": 5.254,
"mean_token_accuracy": 0.1805071696639061,
"num_tokens": 16400132.0,
"step": 9445
},
{
"entropy": 5.518449020385742,
"epoch": 0.7352655125461972,
"grad_norm": 1.984375,
"learning_rate": 0.0004951433402946457,
"loss": 5.441,
"mean_token_accuracy": 0.1731431618332863,
"num_tokens": 16408297.0,
"step": 9450
},
{
"entropy": 5.529580307006836,
"epoch": 0.7356545419179148,
"grad_norm": 1.3984375,
"learning_rate": 0.0004951376111871068,
"loss": 5.4958,
"mean_token_accuracy": 0.1599218189716339,
"num_tokens": 16417977.0,
"step": 9455
},
{
"entropy": 5.632377815246582,
"epoch": 0.7360435712896324,
"grad_norm": 1.609375,
"learning_rate": 0.0004951318787393299,
"loss": 5.3952,
"mean_token_accuracy": 0.16501280218362807,
"num_tokens": 16427156.0,
"step": 9460
},
{
"entropy": 5.665159082412719,
"epoch": 0.73643260066135,
"grad_norm": 1.5859375,
"learning_rate": 0.0004951261429514023,
"loss": 5.5766,
"mean_token_accuracy": 0.1560535579919815,
"num_tokens": 16435845.0,
"step": 9465
},
{
"entropy": 5.592835998535156,
"epoch": 0.7368216300330674,
"grad_norm": 1.6015625,
"learning_rate": 0.0004951204038234106,
"loss": 5.5481,
"mean_token_accuracy": 0.16239631026983262,
"num_tokens": 16445876.0,
"step": 9470
},
{
"entropy": 5.579823780059814,
"epoch": 0.737210659404785,
"grad_norm": 1.4375,
"learning_rate": 0.0004951146613554424,
"loss": 5.486,
"mean_token_accuracy": 0.16736538857221603,
"num_tokens": 16454688.0,
"step": 9475
},
{
"entropy": 5.630280685424805,
"epoch": 0.7375996887765026,
"grad_norm": 1.7109375,
"learning_rate": 0.0004951089155475843,
"loss": 5.544,
"mean_token_accuracy": 0.16136215925216674,
"num_tokens": 16463932.0,
"step": 9480
},
{
"entropy": 5.643390369415283,
"epoch": 0.7379887181482202,
"grad_norm": 1.4375,
"learning_rate": 0.000495103166399924,
"loss": 5.4849,
"mean_token_accuracy": 0.16349284648895263,
"num_tokens": 16472627.0,
"step": 9485
},
{
"entropy": 5.635018539428711,
"epoch": 0.7383777475199378,
"grad_norm": 1.734375,
"learning_rate": 0.0004950974139125484,
"loss": 5.4949,
"mean_token_accuracy": 0.16311829388141633,
"num_tokens": 16480819.0,
"step": 9490
},
{
"entropy": 5.55206708908081,
"epoch": 0.7387667768916554,
"grad_norm": 1.5234375,
"learning_rate": 0.0004950916580855448,
"loss": 5.473,
"mean_token_accuracy": 0.1609806925058365,
"num_tokens": 16489055.0,
"step": 9495
},
{
"entropy": 5.563097381591797,
"epoch": 0.7391558062633728,
"grad_norm": 1.6015625,
"learning_rate": 0.0004950858989190007,
"loss": 5.4691,
"mean_token_accuracy": 0.17230552434921265,
"num_tokens": 16497375.0,
"step": 9500
},
{
"entropy": 5.496043252944946,
"epoch": 0.7395448356350904,
"grad_norm": 1.390625,
"learning_rate": 0.0004950801364130032,
"loss": 5.2937,
"mean_token_accuracy": 0.17340207993984222,
"num_tokens": 16505183.0,
"step": 9505
},
{
"entropy": 5.591700601577759,
"epoch": 0.739933865006808,
"grad_norm": 1.484375,
"learning_rate": 0.0004950743705676401,
"loss": 5.5896,
"mean_token_accuracy": 0.1553812712430954,
"num_tokens": 16514018.0,
"step": 9510
},
{
"entropy": 5.648381280899048,
"epoch": 0.7403228943785256,
"grad_norm": 1.3359375,
"learning_rate": 0.0004950686013829987,
"loss": 5.4714,
"mean_token_accuracy": 0.1652623936533928,
"num_tokens": 16522954.0,
"step": 9515
},
{
"entropy": 5.6629143238067625,
"epoch": 0.7407119237502432,
"grad_norm": 1.359375,
"learning_rate": 0.0004950628288591665,
"loss": 5.5069,
"mean_token_accuracy": 0.15993356853723525,
"num_tokens": 16530845.0,
"step": 9520
},
{
"entropy": 5.547266674041748,
"epoch": 0.7411009531219607,
"grad_norm": 1.4609375,
"learning_rate": 0.0004950570529962311,
"loss": 5.4749,
"mean_token_accuracy": 0.16346780955791473,
"num_tokens": 16540464.0,
"step": 9525
},
{
"entropy": 5.483546257019043,
"epoch": 0.7414899824936783,
"grad_norm": 1.4375,
"learning_rate": 0.0004950512737942803,
"loss": 5.3877,
"mean_token_accuracy": 0.17326026707887648,
"num_tokens": 16549485.0,
"step": 9530
},
{
"entropy": 5.642919969558716,
"epoch": 0.7418790118653958,
"grad_norm": 1.46875,
"learning_rate": 0.0004950454912534015,
"loss": 5.5267,
"mean_token_accuracy": 0.16447333842515946,
"num_tokens": 16557854.0,
"step": 9535
},
{
"entropy": 5.615914058685303,
"epoch": 0.7422680412371134,
"grad_norm": 1.5703125,
"learning_rate": 0.0004950397053736827,
"loss": 5.553,
"mean_token_accuracy": 0.16307123601436616,
"num_tokens": 16565975.0,
"step": 9540
},
{
"entropy": 5.5966729640960695,
"epoch": 0.742657070608831,
"grad_norm": 1.4375,
"learning_rate": 0.0004950339161552117,
"loss": 5.515,
"mean_token_accuracy": 0.16534047722816467,
"num_tokens": 16575038.0,
"step": 9545
},
{
"entropy": 5.566877698898315,
"epoch": 0.7430460999805485,
"grad_norm": 1.359375,
"learning_rate": 0.0004950281235980761,
"loss": 5.3809,
"mean_token_accuracy": 0.16896103471517562,
"num_tokens": 16584292.0,
"step": 9550
},
{
"entropy": 5.630538368225098,
"epoch": 0.7434351293522661,
"grad_norm": 1.3671875,
"learning_rate": 0.000495022327702364,
"loss": 5.4694,
"mean_token_accuracy": 0.16563740819692613,
"num_tokens": 16592331.0,
"step": 9555
},
{
"entropy": 5.5774084568023685,
"epoch": 0.7438241587239837,
"grad_norm": 1.5859375,
"learning_rate": 0.0004950165284681631,
"loss": 5.4052,
"mean_token_accuracy": 0.16738104373216628,
"num_tokens": 16601845.0,
"step": 9560
},
{
"entropy": 5.592267656326294,
"epoch": 0.7442131880957013,
"grad_norm": 1.3515625,
"learning_rate": 0.0004950107258955618,
"loss": 5.5124,
"mean_token_accuracy": 0.161766354739666,
"num_tokens": 16610438.0,
"step": 9565
},
{
"entropy": 5.527006816864014,
"epoch": 0.7446022174674188,
"grad_norm": 1.4765625,
"learning_rate": 0.0004950049199846479,
"loss": 5.4044,
"mean_token_accuracy": 0.16695664525032045,
"num_tokens": 16618892.0,
"step": 9570
},
{
"entropy": 5.622400331497192,
"epoch": 0.7449912468391363,
"grad_norm": 1.515625,
"learning_rate": 0.0004949991107355095,
"loss": 5.4686,
"mean_token_accuracy": 0.16732008904218673,
"num_tokens": 16627702.0,
"step": 9575
},
{
"entropy": 5.568833112716675,
"epoch": 0.7453802762108539,
"grad_norm": 1.5546875,
"learning_rate": 0.0004949932981482347,
"loss": 5.3646,
"mean_token_accuracy": 0.17611705958843232,
"num_tokens": 16635653.0,
"step": 9580
},
{
"entropy": 5.582194185256958,
"epoch": 0.7457693055825715,
"grad_norm": 1.421875,
"learning_rate": 0.0004949874822229118,
"loss": 5.5247,
"mean_token_accuracy": 0.16280439794063567,
"num_tokens": 16643898.0,
"step": 9585
},
{
"entropy": 5.557568740844727,
"epoch": 0.7461583349542891,
"grad_norm": 1.5,
"learning_rate": 0.0004949816629596288,
"loss": 5.38,
"mean_token_accuracy": 0.16781843900680543,
"num_tokens": 16653126.0,
"step": 9590
},
{
"entropy": 5.611994028091431,
"epoch": 0.7465473643260067,
"grad_norm": 1.5,
"learning_rate": 0.0004949758403584746,
"loss": 5.4992,
"mean_token_accuracy": 0.16199871003627778,
"num_tokens": 16661561.0,
"step": 9595
},
{
"entropy": 5.572059297561646,
"epoch": 0.7469363936977241,
"grad_norm": 1.4921875,
"learning_rate": 0.0004949700144195368,
"loss": 5.461,
"mean_token_accuracy": 0.16721679419279098,
"num_tokens": 16669657.0,
"step": 9600
},
{
"entropy": 5.567546606063843,
"epoch": 0.7473254230694417,
"grad_norm": 1.6796875,
"learning_rate": 0.0004949641851429043,
"loss": 5.4521,
"mean_token_accuracy": 0.16164853125810624,
"num_tokens": 16678486.0,
"step": 9605
},
{
"entropy": 5.603635597229004,
"epoch": 0.7477144524411593,
"grad_norm": 1.5546875,
"learning_rate": 0.0004949583525286654,
"loss": 5.4249,
"mean_token_accuracy": 0.15870596021413802,
"num_tokens": 16686638.0,
"step": 9610
},
{
"entropy": 5.561826896667481,
"epoch": 0.7481034818128769,
"grad_norm": 1.3515625,
"learning_rate": 0.0004949525165769085,
"loss": 5.3962,
"mean_token_accuracy": 0.16577211171388626,
"num_tokens": 16694393.0,
"step": 9615
},
{
"entropy": 5.565818643569946,
"epoch": 0.7484925111845945,
"grad_norm": 1.484375,
"learning_rate": 0.0004949466772877224,
"loss": 5.4298,
"mean_token_accuracy": 0.17146286964416504,
"num_tokens": 16702613.0,
"step": 9620
},
{
"entropy": 5.5888903617858885,
"epoch": 0.748881540556312,
"grad_norm": 1.6640625,
"learning_rate": 0.0004949408346611955,
"loss": 5.3801,
"mean_token_accuracy": 0.16653349101543427,
"num_tokens": 16711210.0,
"step": 9625
},
{
"entropy": 5.5719380378723145,
"epoch": 0.7492705699280295,
"grad_norm": 1.359375,
"learning_rate": 0.0004949349886974165,
"loss": 5.4341,
"mean_token_accuracy": 0.1705416738986969,
"num_tokens": 16719124.0,
"step": 9630
},
{
"entropy": 5.585111665725708,
"epoch": 0.7496595992997471,
"grad_norm": 1.359375,
"learning_rate": 0.0004949291393964741,
"loss": 5.418,
"mean_token_accuracy": 0.1670316129922867,
"num_tokens": 16727240.0,
"step": 9635
},
{
"entropy": 5.59084186553955,
"epoch": 0.7500486286714647,
"grad_norm": 1.65625,
"learning_rate": 0.000494923286758457,
"loss": 5.5381,
"mean_token_accuracy": 0.162394617497921,
"num_tokens": 16736524.0,
"step": 9640
},
{
"entropy": 5.703877592086792,
"epoch": 0.7504376580431823,
"grad_norm": 1.4765625,
"learning_rate": 0.0004949174307834541,
"loss": 5.6694,
"mean_token_accuracy": 0.1475190818309784,
"num_tokens": 16745798.0,
"step": 9645
},
{
"entropy": 5.604979372024536,
"epoch": 0.7508266874148998,
"grad_norm": 2.140625,
"learning_rate": 0.0004949115714715543,
"loss": 5.4218,
"mean_token_accuracy": 0.16380434036254882,
"num_tokens": 16754263.0,
"step": 9650
},
{
"entropy": 5.515176439285279,
"epoch": 0.7512157167866174,
"grad_norm": 1.75,
"learning_rate": 0.0004949057088228465,
"loss": 5.3057,
"mean_token_accuracy": 0.17124868631362916,
"num_tokens": 16762610.0,
"step": 9655
},
{
"entropy": 5.615438222885132,
"epoch": 0.751604746158335,
"grad_norm": 1.5390625,
"learning_rate": 0.0004948998428374194,
"loss": 5.5149,
"mean_token_accuracy": 0.16087360233068465,
"num_tokens": 16771436.0,
"step": 9660
},
{
"entropy": 5.693601465225219,
"epoch": 0.7519937755300525,
"grad_norm": 2.171875,
"learning_rate": 0.0004948939735153622,
"loss": 5.5587,
"mean_token_accuracy": 0.16020183712244035,
"num_tokens": 16779647.0,
"step": 9665
},
{
"entropy": 5.682334852218628,
"epoch": 0.7523828049017701,
"grad_norm": 1.65625,
"learning_rate": 0.0004948881008567641,
"loss": 5.5112,
"mean_token_accuracy": 0.1604753240942955,
"num_tokens": 16788116.0,
"step": 9670
},
{
"entropy": 5.541039323806762,
"epoch": 0.7527718342734876,
"grad_norm": 1.5703125,
"learning_rate": 0.0004948822248617139,
"loss": 5.4307,
"mean_token_accuracy": 0.16998641937971115,
"num_tokens": 16796518.0,
"step": 9675
},
{
"entropy": 5.599405193328858,
"epoch": 0.7531608636452052,
"grad_norm": 1.7109375,
"learning_rate": 0.000494876345530301,
"loss": 5.4262,
"mean_token_accuracy": 0.163827808201313,
"num_tokens": 16805511.0,
"step": 9680
},
{
"entropy": 5.608861494064331,
"epoch": 0.7535498930169228,
"grad_norm": 1.53125,
"learning_rate": 0.0004948704628626145,
"loss": 5.4156,
"mean_token_accuracy": 0.16347003877162933,
"num_tokens": 16813173.0,
"step": 9685
},
{
"entropy": 5.582597398757935,
"epoch": 0.7539389223886404,
"grad_norm": 1.4765625,
"learning_rate": 0.0004948645768587437,
"loss": 5.5205,
"mean_token_accuracy": 0.15378826707601548,
"num_tokens": 16822193.0,
"step": 9690
},
{
"entropy": 5.494058084487915,
"epoch": 0.7543279517603579,
"grad_norm": 1.6953125,
"learning_rate": 0.0004948586875187778,
"loss": 5.2565,
"mean_token_accuracy": 0.1758536785840988,
"num_tokens": 16830421.0,
"step": 9695
},
{
"entropy": 5.540645027160645,
"epoch": 0.7547169811320755,
"grad_norm": 1.4140625,
"learning_rate": 0.0004948527948428064,
"loss": 5.396,
"mean_token_accuracy": 0.1691470354795456,
"num_tokens": 16838988.0,
"step": 9700
},
{
"entropy": 5.532936096191406,
"epoch": 0.755106010503793,
"grad_norm": 1.515625,
"learning_rate": 0.0004948468988309187,
"loss": 5.4798,
"mean_token_accuracy": 0.16092120558023454,
"num_tokens": 16847980.0,
"step": 9705
},
{
"entropy": 5.546801519393921,
"epoch": 0.7554950398755106,
"grad_norm": 2.0625,
"learning_rate": 0.0004948409994832043,
"loss": 5.4005,
"mean_token_accuracy": 0.16306585520505906,
"num_tokens": 16857263.0,
"step": 9710
},
{
"entropy": 5.63371696472168,
"epoch": 0.7558840692472282,
"grad_norm": 1.484375,
"learning_rate": 0.0004948350967997526,
"loss": 5.3766,
"mean_token_accuracy": 0.16783807724714278,
"num_tokens": 16865314.0,
"step": 9715
},
{
"entropy": 5.595693683624267,
"epoch": 0.7562730986189458,
"grad_norm": 1.6953125,
"learning_rate": 0.0004948291907806532,
"loss": 5.4907,
"mean_token_accuracy": 0.16305321604013442,
"num_tokens": 16875359.0,
"step": 9720
},
{
"entropy": 5.627140188217163,
"epoch": 0.7566621279906633,
"grad_norm": 1.46875,
"learning_rate": 0.0004948232814259957,
"loss": 5.5845,
"mean_token_accuracy": 0.15356298983097078,
"num_tokens": 16885279.0,
"step": 9725
},
{
"entropy": 5.726843452453613,
"epoch": 0.7570511573623808,
"grad_norm": 1.5625,
"learning_rate": 0.0004948173687358699,
"loss": 5.5353,
"mean_token_accuracy": 0.15876051783561707,
"num_tokens": 16894463.0,
"step": 9730
},
{
"entropy": 5.651642799377441,
"epoch": 0.7574401867340984,
"grad_norm": 1.4453125,
"learning_rate": 0.0004948114527103652,
"loss": 5.4537,
"mean_token_accuracy": 0.15732816755771636,
"num_tokens": 16903378.0,
"step": 9735
},
{
"entropy": 5.538081312179566,
"epoch": 0.757829216105816,
"grad_norm": 1.7421875,
"learning_rate": 0.0004948055333495717,
"loss": 5.4974,
"mean_token_accuracy": 0.16314080357551575,
"num_tokens": 16912039.0,
"step": 9740
},
{
"entropy": 5.588148403167724,
"epoch": 0.7582182454775336,
"grad_norm": 1.578125,
"learning_rate": 0.0004947996106535791,
"loss": 5.4425,
"mean_token_accuracy": 0.15965240448713303,
"num_tokens": 16920516.0,
"step": 9745
},
{
"entropy": 5.673912191390992,
"epoch": 0.7586072748492512,
"grad_norm": 1.5390625,
"learning_rate": 0.0004947936846224773,
"loss": 5.4551,
"mean_token_accuracy": 0.16163322031497956,
"num_tokens": 16929131.0,
"step": 9750
},
{
"entropy": 5.549356412887573,
"epoch": 0.7589963042209686,
"grad_norm": 1.5625,
"learning_rate": 0.0004947877552563562,
"loss": 5.4778,
"mean_token_accuracy": 0.1686248555779457,
"num_tokens": 16937352.0,
"step": 9755
},
{
"entropy": 5.635425758361817,
"epoch": 0.7593853335926862,
"grad_norm": 1.4375,
"learning_rate": 0.0004947818225553056,
"loss": 5.5642,
"mean_token_accuracy": 0.16105495393276215,
"num_tokens": 16946439.0,
"step": 9760
},
{
"entropy": 5.674735689163208,
"epoch": 0.7597743629644038,
"grad_norm": 1.40625,
"learning_rate": 0.0004947758865194156,
"loss": 5.4521,
"mean_token_accuracy": 0.16383536159992218,
"num_tokens": 16955402.0,
"step": 9765
},
{
"entropy": 5.442025089263916,
"epoch": 0.7601633923361214,
"grad_norm": 1.34375,
"learning_rate": 0.0004947699471487766,
"loss": 5.3709,
"mean_token_accuracy": 0.17045130282640458,
"num_tokens": 16964299.0,
"step": 9770
},
{
"entropy": 5.503045511245728,
"epoch": 0.760552421707839,
"grad_norm": 1.3828125,
"learning_rate": 0.0004947640044434782,
"loss": 5.4329,
"mean_token_accuracy": 0.16265159249305725,
"num_tokens": 16973483.0,
"step": 9775
},
{
"entropy": 5.630168056488037,
"epoch": 0.7609414510795565,
"grad_norm": 1.2734375,
"learning_rate": 0.0004947580584036109,
"loss": 5.4821,
"mean_token_accuracy": 0.16721660643815994,
"num_tokens": 16982234.0,
"step": 9780
},
{
"entropy": 5.592389631271362,
"epoch": 0.761330480451274,
"grad_norm": 1.40625,
"learning_rate": 0.0004947521090292649,
"loss": 5.4358,
"mean_token_accuracy": 0.16668277680873872,
"num_tokens": 16990669.0,
"step": 9785
},
{
"entropy": 5.663802719116211,
"epoch": 0.7617195098229916,
"grad_norm": 1.4765625,
"learning_rate": 0.0004947461563205304,
"loss": 5.5076,
"mean_token_accuracy": 0.16735657155513764,
"num_tokens": 16999998.0,
"step": 9790
},
{
"entropy": 5.632854843139649,
"epoch": 0.7621085391947092,
"grad_norm": 1.375,
"learning_rate": 0.0004947402002774977,
"loss": 5.4926,
"mean_token_accuracy": 0.16238462924957275,
"num_tokens": 17008518.0,
"step": 9795
},
{
"entropy": 5.528278112411499,
"epoch": 0.7624975685664268,
"grad_norm": 1.421875,
"learning_rate": 0.0004947342409002572,
"loss": 5.4374,
"mean_token_accuracy": 0.16266196966171265,
"num_tokens": 17017182.0,
"step": 9800
},
{
"entropy": 5.557402515411377,
"epoch": 0.7628865979381443,
"grad_norm": 1.5625,
"learning_rate": 0.0004947282781888994,
"loss": 5.4557,
"mean_token_accuracy": 0.16173066347837448,
"num_tokens": 17026186.0,
"step": 9805
},
{
"entropy": 5.506473207473755,
"epoch": 0.7632756273098619,
"grad_norm": 1.46875,
"learning_rate": 0.0004947223121435147,
"loss": 5.3237,
"mean_token_accuracy": 0.17344443947076799,
"num_tokens": 17034295.0,
"step": 9810
},
{
"entropy": 5.489818096160889,
"epoch": 0.7636646566815795,
"grad_norm": 1.5703125,
"learning_rate": 0.0004947163427641936,
"loss": 5.4103,
"mean_token_accuracy": 0.16541531831026077,
"num_tokens": 17043195.0,
"step": 9815
},
{
"entropy": 5.497310924530029,
"epoch": 0.764053686053297,
"grad_norm": 1.609375,
"learning_rate": 0.0004947103700510268,
"loss": 5.3431,
"mean_token_accuracy": 0.1667629897594452,
"num_tokens": 17051903.0,
"step": 9820
},
{
"entropy": 5.521335697174072,
"epoch": 0.7644427154250146,
"grad_norm": 1.4921875,
"learning_rate": 0.0004947043940041047,
"loss": 5.4212,
"mean_token_accuracy": 0.17430951148271562,
"num_tokens": 17060495.0,
"step": 9825
},
{
"entropy": 5.6016762256622314,
"epoch": 0.7648317447967321,
"grad_norm": 1.4140625,
"learning_rate": 0.0004946984146235183,
"loss": 5.4716,
"mean_token_accuracy": 0.16526757106184958,
"num_tokens": 17069254.0,
"step": 9830
},
{
"entropy": 5.67843599319458,
"epoch": 0.7652207741684497,
"grad_norm": 1.5078125,
"learning_rate": 0.0004946924319093579,
"loss": 5.4434,
"mean_token_accuracy": 0.16862938553094864,
"num_tokens": 17077323.0,
"step": 9835
},
{
"entropy": 5.5361096382141115,
"epoch": 0.7656098035401673,
"grad_norm": 2.453125,
"learning_rate": 0.0004946864458617148,
"loss": 5.3127,
"mean_token_accuracy": 0.1744935244321823,
"num_tokens": 17085377.0,
"step": 9840
},
{
"entropy": 5.485551643371582,
"epoch": 0.7659988329118849,
"grad_norm": 1.359375,
"learning_rate": 0.0004946804564806793,
"loss": 5.3999,
"mean_token_accuracy": 0.16610120385885238,
"num_tokens": 17094288.0,
"step": 9845
},
{
"entropy": 5.5387038230896,
"epoch": 0.7663878622836025,
"grad_norm": 1.484375,
"learning_rate": 0.0004946744637663427,
"loss": 5.3222,
"mean_token_accuracy": 0.17849676460027694,
"num_tokens": 17101572.0,
"step": 9850
},
{
"entropy": 5.558818721771241,
"epoch": 0.7667768916553199,
"grad_norm": 1.4375,
"learning_rate": 0.0004946684677187956,
"loss": 5.4698,
"mean_token_accuracy": 0.1644863784313202,
"num_tokens": 17110151.0,
"step": 9855
},
{
"entropy": 5.568019008636474,
"epoch": 0.7671659210270375,
"grad_norm": 1.5390625,
"learning_rate": 0.0004946624683381292,
"loss": 5.4458,
"mean_token_accuracy": 0.1656898006796837,
"num_tokens": 17118172.0,
"step": 9860
},
{
"entropy": 5.522030210494995,
"epoch": 0.7675549503987551,
"grad_norm": 1.3828125,
"learning_rate": 0.0004946564656244345,
"loss": 5.3519,
"mean_token_accuracy": 0.1725288525223732,
"num_tokens": 17126855.0,
"step": 9865
},
{
"entropy": 5.594412517547608,
"epoch": 0.7679439797704727,
"grad_norm": 1.7265625,
"learning_rate": 0.0004946504595778026,
"loss": 5.5248,
"mean_token_accuracy": 0.16505391001701356,
"num_tokens": 17135737.0,
"step": 9870
},
{
"entropy": 5.6575945854187015,
"epoch": 0.7683330091421903,
"grad_norm": 1.4453125,
"learning_rate": 0.0004946444501983246,
"loss": 5.4604,
"mean_token_accuracy": 0.1610216826200485,
"num_tokens": 17144521.0,
"step": 9875
},
{
"entropy": 5.658867597579956,
"epoch": 0.7687220385139077,
"grad_norm": 1.5625,
"learning_rate": 0.0004946384374860916,
"loss": 5.564,
"mean_token_accuracy": 0.16371750980615615,
"num_tokens": 17153534.0,
"step": 9880
},
{
"entropy": 5.528557062149048,
"epoch": 0.7691110678856253,
"grad_norm": 1.4140625,
"learning_rate": 0.0004946324214411949,
"loss": 5.4116,
"mean_token_accuracy": 0.16632574498653413,
"num_tokens": 17162600.0,
"step": 9885
},
{
"entropy": 5.580212259292603,
"epoch": 0.7695000972573429,
"grad_norm": 1.40625,
"learning_rate": 0.0004946264020637259,
"loss": 5.4723,
"mean_token_accuracy": 0.15897754430770875,
"num_tokens": 17171373.0,
"step": 9890
},
{
"entropy": 5.6670910835266115,
"epoch": 0.7698891266290605,
"grad_norm": 1.6328125,
"learning_rate": 0.0004946203793537757,
"loss": 5.5038,
"mean_token_accuracy": 0.16297393292188644,
"num_tokens": 17180090.0,
"step": 9895
},
{
"entropy": 5.637380361557007,
"epoch": 0.7702781560007781,
"grad_norm": 1.46875,
"learning_rate": 0.0004946143533114358,
"loss": 5.4195,
"mean_token_accuracy": 0.1694469153881073,
"num_tokens": 17189592.0,
"step": 9900
},
{
"entropy": 5.529821920394897,
"epoch": 0.7706671853724957,
"grad_norm": 1.5703125,
"learning_rate": 0.0004946083239367976,
"loss": 5.3527,
"mean_token_accuracy": 0.17120934575796126,
"num_tokens": 17198287.0,
"step": 9905
},
{
"entropy": 5.552817964553833,
"epoch": 0.7710562147442132,
"grad_norm": 1.4765625,
"learning_rate": 0.0004946022912299527,
"loss": 5.4739,
"mean_token_accuracy": 0.16421546936035156,
"num_tokens": 17206349.0,
"step": 9910
},
{
"entropy": 5.644651126861572,
"epoch": 0.7714452441159307,
"grad_norm": 1.5625,
"learning_rate": 0.0004945962551909926,
"loss": 5.5718,
"mean_token_accuracy": 0.1579301953315735,
"num_tokens": 17215408.0,
"step": 9915
},
{
"entropy": 5.672359752655029,
"epoch": 0.7718342734876483,
"grad_norm": 1.9453125,
"learning_rate": 0.0004945902158200089,
"loss": 5.4996,
"mean_token_accuracy": 0.1619244024157524,
"num_tokens": 17224342.0,
"step": 9920
},
{
"entropy": 5.565824508666992,
"epoch": 0.7722233028593659,
"grad_norm": 1.375,
"learning_rate": 0.0004945841731170931,
"loss": 5.3772,
"mean_token_accuracy": 0.1610265702009201,
"num_tokens": 17232532.0,
"step": 9925
},
{
"entropy": 5.523751640319825,
"epoch": 0.7726123322310835,
"grad_norm": 1.4375,
"learning_rate": 0.0004945781270823369,
"loss": 5.3826,
"mean_token_accuracy": 0.16825056672096253,
"num_tokens": 17240786.0,
"step": 9930
},
{
"entropy": 5.574452877044678,
"epoch": 0.773001361602801,
"grad_norm": 1.640625,
"learning_rate": 0.0004945720777158323,
"loss": 5.3584,
"mean_token_accuracy": 0.1710540920495987,
"num_tokens": 17248515.0,
"step": 9935
},
{
"entropy": 5.602618217468262,
"epoch": 0.7733903909745186,
"grad_norm": 1.484375,
"learning_rate": 0.0004945660250176708,
"loss": 5.4352,
"mean_token_accuracy": 0.17003979086875914,
"num_tokens": 17257098.0,
"step": 9940
},
{
"entropy": 5.543260478973389,
"epoch": 0.7737794203462361,
"grad_norm": 1.3984375,
"learning_rate": 0.0004945599689879443,
"loss": 5.4403,
"mean_token_accuracy": 0.15870731920003892,
"num_tokens": 17266851.0,
"step": 9945
},
{
"entropy": 5.54620246887207,
"epoch": 0.7741684497179537,
"grad_norm": 1.625,
"learning_rate": 0.0004945539096267448,
"loss": 5.38,
"mean_token_accuracy": 0.15749988406896592,
"num_tokens": 17275568.0,
"step": 9950
},
{
"entropy": 5.502654361724853,
"epoch": 0.7745574790896713,
"grad_norm": 1.453125,
"learning_rate": 0.0004945478469341642,
"loss": 5.3494,
"mean_token_accuracy": 0.16825371235609055,
"num_tokens": 17284528.0,
"step": 9955
},
{
"entropy": 5.629582452774048,
"epoch": 0.7749465084613888,
"grad_norm": 1.484375,
"learning_rate": 0.0004945417809102944,
"loss": 5.5123,
"mean_token_accuracy": 0.16047662049531936,
"num_tokens": 17293973.0,
"step": 9960
},
{
"entropy": 5.54505467414856,
"epoch": 0.7753355378331064,
"grad_norm": 1.3984375,
"learning_rate": 0.0004945357115552275,
"loss": 5.3619,
"mean_token_accuracy": 0.16990180015563966,
"num_tokens": 17302321.0,
"step": 9965
},
{
"entropy": 5.563962125778199,
"epoch": 0.775724567204824,
"grad_norm": 1.484375,
"learning_rate": 0.0004945296388690557,
"loss": 5.5068,
"mean_token_accuracy": 0.16015054732561113,
"num_tokens": 17311226.0,
"step": 9970
},
{
"entropy": 5.615965557098389,
"epoch": 0.7761135965765416,
"grad_norm": 1.4765625,
"learning_rate": 0.000494523562851871,
"loss": 5.472,
"mean_token_accuracy": 0.1580027550458908,
"num_tokens": 17319818.0,
"step": 9975
},
{
"entropy": 5.665783786773682,
"epoch": 0.7765026259482591,
"grad_norm": 1.5078125,
"learning_rate": 0.0004945174835037655,
"loss": 5.5344,
"mean_token_accuracy": 0.15653909295797347,
"num_tokens": 17329195.0,
"step": 9980
},
{
"entropy": 5.643244791030884,
"epoch": 0.7768916553199766,
"grad_norm": 1.375,
"learning_rate": 0.0004945114008248319,
"loss": 5.579,
"mean_token_accuracy": 0.16743383705615997,
"num_tokens": 17337689.0,
"step": 9985
},
{
"entropy": 5.602228450775146,
"epoch": 0.7772806846916942,
"grad_norm": 1.78125,
"learning_rate": 0.0004945053148151619,
"loss": 5.3313,
"mean_token_accuracy": 0.17215876877307892,
"num_tokens": 17345467.0,
"step": 9990
},
{
"entropy": 5.555410099029541,
"epoch": 0.7776697140634118,
"grad_norm": 1.453125,
"learning_rate": 0.0004944992254748482,
"loss": 5.4759,
"mean_token_accuracy": 0.16185110360383986,
"num_tokens": 17353651.0,
"step": 9995
},
{
"entropy": 5.623938083648682,
"epoch": 0.7780587434351294,
"grad_norm": 1.46875,
"learning_rate": 0.0004944931328039832,
"loss": 5.5335,
"mean_token_accuracy": 0.15981249064207076,
"num_tokens": 17362777.0,
"step": 10000
},
{
"entropy": 5.706428670883179,
"epoch": 0.778447772806847,
"grad_norm": 1.359375,
"learning_rate": 0.0004944870368026592,
"loss": 5.4747,
"mean_token_accuracy": 0.17055122256278993,
"num_tokens": 17371562.0,
"step": 10005
},
{
"entropy": 5.6338499069213865,
"epoch": 0.7788368021785644,
"grad_norm": 1.53125,
"learning_rate": 0.0004944809374709689,
"loss": 5.4789,
"mean_token_accuracy": 0.1562877118587494,
"num_tokens": 17381185.0,
"step": 10010
},
{
"entropy": 5.602717685699463,
"epoch": 0.779225831550282,
"grad_norm": 1.421875,
"learning_rate": 0.0004944748348090045,
"loss": 5.4388,
"mean_token_accuracy": 0.17197284549474717,
"num_tokens": 17390658.0,
"step": 10015
},
{
"entropy": 5.559042930603027,
"epoch": 0.7796148609219996,
"grad_norm": 1.5546875,
"learning_rate": 0.0004944687288168589,
"loss": 5.3866,
"mean_token_accuracy": 0.16711320579051972,
"num_tokens": 17399968.0,
"step": 10020
},
{
"entropy": 5.624416923522949,
"epoch": 0.7800038902937172,
"grad_norm": 1.453125,
"learning_rate": 0.0004944626194946246,
"loss": 5.5111,
"mean_token_accuracy": 0.16354575157165527,
"num_tokens": 17408727.0,
"step": 10025
},
{
"entropy": 5.645158195495606,
"epoch": 0.7803929196654348,
"grad_norm": 1.7890625,
"learning_rate": 0.0004944565068423945,
"loss": 5.5146,
"mean_token_accuracy": 0.16532395631074906,
"num_tokens": 17417517.0,
"step": 10030
},
{
"entropy": 5.61456708908081,
"epoch": 0.7807819490371523,
"grad_norm": 1.375,
"learning_rate": 0.0004944503908602612,
"loss": 5.5103,
"mean_token_accuracy": 0.16158866435289382,
"num_tokens": 17427035.0,
"step": 10035
},
{
"entropy": 5.66776065826416,
"epoch": 0.7811709784088698,
"grad_norm": 1.4765625,
"learning_rate": 0.0004944442715483174,
"loss": 5.3956,
"mean_token_accuracy": 0.166395965218544,
"num_tokens": 17435585.0,
"step": 10040
},
{
"entropy": 5.5760262966156,
"epoch": 0.7815600077805874,
"grad_norm": 1.5859375,
"learning_rate": 0.0004944381489066561,
"loss": 5.4276,
"mean_token_accuracy": 0.1671623021364212,
"num_tokens": 17444317.0,
"step": 10045
},
{
"entropy": 5.6087377071380615,
"epoch": 0.781949037152305,
"grad_norm": 2.03125,
"learning_rate": 0.0004944320229353702,
"loss": 5.6346,
"mean_token_accuracy": 0.1621250942349434,
"num_tokens": 17453585.0,
"step": 10050
},
{
"entropy": 5.649258661270141,
"epoch": 0.7823380665240226,
"grad_norm": 1.421875,
"learning_rate": 0.0004944258936345526,
"loss": 5.4098,
"mean_token_accuracy": 0.16680939346551896,
"num_tokens": 17462233.0,
"step": 10055
},
{
"entropy": 5.530995512008667,
"epoch": 0.7827270958957401,
"grad_norm": 1.515625,
"learning_rate": 0.0004944197610042963,
"loss": 5.3421,
"mean_token_accuracy": 0.17281670197844506,
"num_tokens": 17470566.0,
"step": 10060
},
{
"entropy": 5.504527044296265,
"epoch": 0.7831161252674577,
"grad_norm": 1.78125,
"learning_rate": 0.0004944136250446944,
"loss": 5.4191,
"mean_token_accuracy": 0.16703671663999559,
"num_tokens": 17479267.0,
"step": 10065
},
{
"entropy": 5.4788202285766605,
"epoch": 0.7835051546391752,
"grad_norm": 1.484375,
"learning_rate": 0.0004944074857558399,
"loss": 5.3361,
"mean_token_accuracy": 0.17151730060577391,
"num_tokens": 17488060.0,
"step": 10070
},
{
"entropy": 5.669717836380005,
"epoch": 0.7838941840108928,
"grad_norm": 1.421875,
"learning_rate": 0.0004944013431378261,
"loss": 5.573,
"mean_token_accuracy": 0.16319650560617446,
"num_tokens": 17497240.0,
"step": 10075
},
{
"entropy": 5.656308269500732,
"epoch": 0.7842832133826104,
"grad_norm": 1.390625,
"learning_rate": 0.0004943951971907461,
"loss": 5.5319,
"mean_token_accuracy": 0.16159944534301757,
"num_tokens": 17506017.0,
"step": 10080
},
{
"entropy": 5.597034072875976,
"epoch": 0.7846722427543279,
"grad_norm": 1.6328125,
"learning_rate": 0.0004943890479146933,
"loss": 5.4782,
"mean_token_accuracy": 0.1599705621600151,
"num_tokens": 17514764.0,
"step": 10085
},
{
"entropy": 5.498212575912476,
"epoch": 0.7850612721260455,
"grad_norm": 1.546875,
"learning_rate": 0.0004943828953097607,
"loss": 5.4479,
"mean_token_accuracy": 0.16137347146868705,
"num_tokens": 17524183.0,
"step": 10090
},
{
"entropy": 5.617017459869385,
"epoch": 0.7854503014977631,
"grad_norm": 1.3359375,
"learning_rate": 0.000494376739376042,
"loss": 5.3896,
"mean_token_accuracy": 0.16983293145895004,
"num_tokens": 17533426.0,
"step": 10095
},
{
"entropy": 5.596925497055054,
"epoch": 0.7858393308694807,
"grad_norm": 1.3984375,
"learning_rate": 0.0004943705801136304,
"loss": 5.351,
"mean_token_accuracy": 0.17040693908929824,
"num_tokens": 17541966.0,
"step": 10100
},
{
"entropy": 5.553137636184692,
"epoch": 0.7862283602411982,
"grad_norm": 1.5625,
"learning_rate": 0.0004943644175226193,
"loss": 5.4439,
"mean_token_accuracy": 0.16552093625068665,
"num_tokens": 17551157.0,
"step": 10105
},
{
"entropy": 5.5377716541290285,
"epoch": 0.7866173896129158,
"grad_norm": 1.4453125,
"learning_rate": 0.0004943582516031025,
"loss": 5.3515,
"mean_token_accuracy": 0.17493999153375625,
"num_tokens": 17559999.0,
"step": 10110
},
{
"entropy": 5.5717082023620605,
"epoch": 0.7870064189846333,
"grad_norm": 1.3515625,
"learning_rate": 0.0004943520823551732,
"loss": 5.3978,
"mean_token_accuracy": 0.16706651002168654,
"num_tokens": 17568873.0,
"step": 10115
},
{
"entropy": 5.56819977760315,
"epoch": 0.7873954483563509,
"grad_norm": 1.71875,
"learning_rate": 0.0004943459097789252,
"loss": 5.4791,
"mean_token_accuracy": 0.17377860993146896,
"num_tokens": 17577807.0,
"step": 10120
},
{
"entropy": 5.599589490890503,
"epoch": 0.7877844777280685,
"grad_norm": 1.3203125,
"learning_rate": 0.0004943397338744523,
"loss": 5.5085,
"mean_token_accuracy": 0.15993668138980865,
"num_tokens": 17586646.0,
"step": 10125
},
{
"entropy": 5.670113754272461,
"epoch": 0.7881735070997861,
"grad_norm": 1.5546875,
"learning_rate": 0.000494333554641848,
"loss": 5.5505,
"mean_token_accuracy": 0.16283230036497115,
"num_tokens": 17595458.0,
"step": 10130
},
{
"entropy": 5.602777719497681,
"epoch": 0.7885625364715037,
"grad_norm": 1.5625,
"learning_rate": 0.000494327372081206,
"loss": 5.476,
"mean_token_accuracy": 0.16561120003461838,
"num_tokens": 17603997.0,
"step": 10135
},
{
"entropy": 5.605063390731812,
"epoch": 0.7889515658432211,
"grad_norm": 1.59375,
"learning_rate": 0.0004943211861926204,
"loss": 5.4778,
"mean_token_accuracy": 0.16220617294311523,
"num_tokens": 17612347.0,
"step": 10140
},
{
"entropy": 5.501496028900147,
"epoch": 0.7893405952149387,
"grad_norm": 1.4609375,
"learning_rate": 0.0004943149969761848,
"loss": 5.3621,
"mean_token_accuracy": 0.17086334824562072,
"num_tokens": 17620618.0,
"step": 10145
},
{
"entropy": 5.524677419662476,
"epoch": 0.7897296245866563,
"grad_norm": 1.515625,
"learning_rate": 0.0004943088044319932,
"loss": 5.3599,
"mean_token_accuracy": 0.16739994734525682,
"num_tokens": 17629164.0,
"step": 10150
},
{
"entropy": 5.666185903549194,
"epoch": 0.7901186539583739,
"grad_norm": 1.46875,
"learning_rate": 0.0004943026085601395,
"loss": 5.5386,
"mean_token_accuracy": 0.1631959304213524,
"num_tokens": 17638454.0,
"step": 10155
},
{
"entropy": 5.621808481216431,
"epoch": 0.7905076833300915,
"grad_norm": 1.453125,
"learning_rate": 0.0004942964093607178,
"loss": 5.4521,
"mean_token_accuracy": 0.1612175151705742,
"num_tokens": 17647099.0,
"step": 10160
},
{
"entropy": 5.648972654342652,
"epoch": 0.790896712701809,
"grad_norm": 1.8359375,
"learning_rate": 0.0004942902068338222,
"loss": 5.4357,
"mean_token_accuracy": 0.16804789006710052,
"num_tokens": 17655214.0,
"step": 10165
},
{
"entropy": 5.55198483467102,
"epoch": 0.7912857420735265,
"grad_norm": 1.3984375,
"learning_rate": 0.0004942840009795466,
"loss": 5.3993,
"mean_token_accuracy": 0.16623064428567885,
"num_tokens": 17663342.0,
"step": 10170
},
{
"entropy": 5.716285037994385,
"epoch": 0.7916747714452441,
"grad_norm": 1.625,
"learning_rate": 0.0004942777917979855,
"loss": 5.587,
"mean_token_accuracy": 0.1541963428258896,
"num_tokens": 17671725.0,
"step": 10175
},
{
"entropy": 5.591437530517578,
"epoch": 0.7920638008169617,
"grad_norm": 1.5234375,
"learning_rate": 0.0004942715792892328,
"loss": 5.4913,
"mean_token_accuracy": 0.1559672825038433,
"num_tokens": 17680627.0,
"step": 10180
},
{
"entropy": 5.6027037620544435,
"epoch": 0.7924528301886793,
"grad_norm": 1.703125,
"learning_rate": 0.000494265363453383,
"loss": 5.4676,
"mean_token_accuracy": 0.1708559960126877,
"num_tokens": 17688392.0,
"step": 10185
},
{
"entropy": 5.49579496383667,
"epoch": 0.7928418595603968,
"grad_norm": 1.484375,
"learning_rate": 0.0004942591442905302,
"loss": 5.4129,
"mean_token_accuracy": 0.17170892059803008,
"num_tokens": 17697546.0,
"step": 10190
},
{
"entropy": 5.550096130371093,
"epoch": 0.7932308889321144,
"grad_norm": 1.375,
"learning_rate": 0.0004942529218007689,
"loss": 5.3801,
"mean_token_accuracy": 0.16477303802967072,
"num_tokens": 17705555.0,
"step": 10195
},
{
"entropy": 5.601612281799317,
"epoch": 0.7936199183038319,
"grad_norm": 1.6953125,
"learning_rate": 0.0004942466959841936,
"loss": 5.5442,
"mean_token_accuracy": 0.15382677614688872,
"num_tokens": 17715652.0,
"step": 10200
},
{
"entropy": 5.524223327636719,
"epoch": 0.7940089476755495,
"grad_norm": 1.453125,
"learning_rate": 0.0004942404668408985,
"loss": 5.2832,
"mean_token_accuracy": 0.16528073996305465,
"num_tokens": 17724111.0,
"step": 10205
},
{
"entropy": 5.486041593551636,
"epoch": 0.7943979770472671,
"grad_norm": 1.4375,
"learning_rate": 0.0004942342343709783,
"loss": 5.2823,
"mean_token_accuracy": 0.1720765382051468,
"num_tokens": 17732732.0,
"step": 10210
},
{
"entropy": 5.520828676223755,
"epoch": 0.7947870064189846,
"grad_norm": 1.5703125,
"learning_rate": 0.0004942279985745275,
"loss": 5.3954,
"mean_token_accuracy": 0.16788703352212905,
"num_tokens": 17741338.0,
"step": 10215
},
{
"entropy": 5.635388040542603,
"epoch": 0.7951760357907022,
"grad_norm": 1.7421875,
"learning_rate": 0.0004942217594516409,
"loss": 5.6126,
"mean_token_accuracy": 0.15470884889364242,
"num_tokens": 17750651.0,
"step": 10220
},
{
"entropy": 5.620717716217041,
"epoch": 0.7955650651624198,
"grad_norm": 1.65625,
"learning_rate": 0.000494215517002413,
"loss": 5.4072,
"mean_token_accuracy": 0.17064217776060103,
"num_tokens": 17759052.0,
"step": 10225
},
{
"entropy": 5.641384410858154,
"epoch": 0.7959540945341373,
"grad_norm": 1.5546875,
"learning_rate": 0.0004942092712269384,
"loss": 5.4751,
"mean_token_accuracy": 0.15961465537548064,
"num_tokens": 17767246.0,
"step": 10230
},
{
"entropy": 5.646351623535156,
"epoch": 0.7963431239058549,
"grad_norm": 1.421875,
"learning_rate": 0.0004942030221253122,
"loss": 5.4976,
"mean_token_accuracy": 0.16838526874780654,
"num_tokens": 17777022.0,
"step": 10235
},
{
"entropy": 5.606373596191406,
"epoch": 0.7967321532775724,
"grad_norm": 2.1875,
"learning_rate": 0.0004941967696976289,
"loss": 5.4566,
"mean_token_accuracy": 0.1601052239537239,
"num_tokens": 17785586.0,
"step": 10240
},
{
"entropy": 5.533231353759765,
"epoch": 0.79712118264929,
"grad_norm": 1.5859375,
"learning_rate": 0.0004941905139439835,
"loss": 5.4623,
"mean_token_accuracy": 0.16345107704401016,
"num_tokens": 17794320.0,
"step": 10245
},
{
"entropy": 5.573796367645263,
"epoch": 0.7975102120210076,
"grad_norm": 1.4296875,
"learning_rate": 0.0004941842548644712,
"loss": 5.4749,
"mean_token_accuracy": 0.16987491250038148,
"num_tokens": 17803384.0,
"step": 10250
},
{
"entropy": 5.634557676315308,
"epoch": 0.7978992413927252,
"grad_norm": 1.4921875,
"learning_rate": 0.0004941779924591864,
"loss": 5.4317,
"mean_token_accuracy": 0.16256911307573318,
"num_tokens": 17811955.0,
"step": 10255
},
{
"entropy": 5.593855953216552,
"epoch": 0.7982882707644428,
"grad_norm": 1.5078125,
"learning_rate": 0.0004941717267282244,
"loss": 5.4865,
"mean_token_accuracy": 0.16269293576478958,
"num_tokens": 17820582.0,
"step": 10260
},
{
"entropy": 5.598372220993042,
"epoch": 0.7986773001361602,
"grad_norm": 1.625,
"learning_rate": 0.0004941654576716806,
"loss": 5.3988,
"mean_token_accuracy": 0.17172585427761078,
"num_tokens": 17828465.0,
"step": 10265
},
{
"entropy": 5.55808391571045,
"epoch": 0.7990663295078778,
"grad_norm": 1.7421875,
"learning_rate": 0.0004941591852896495,
"loss": 5.4228,
"mean_token_accuracy": 0.16660724580287933,
"num_tokens": 17836931.0,
"step": 10270
},
{
"entropy": 5.600241613388062,
"epoch": 0.7994553588795954,
"grad_norm": 1.5625,
"learning_rate": 0.0004941529095822268,
"loss": 5.4895,
"mean_token_accuracy": 0.16436177343130112,
"num_tokens": 17845192.0,
"step": 10275
},
{
"entropy": 5.605954694747925,
"epoch": 0.799844388251313,
"grad_norm": 1.8515625,
"learning_rate": 0.0004941466305495074,
"loss": 5.4446,
"mean_token_accuracy": 0.17005664259195327,
"num_tokens": 17854121.0,
"step": 10280
},
{
"entropy": 5.592868423461914,
"epoch": 0.8002334176230306,
"grad_norm": 1.3359375,
"learning_rate": 0.0004941403481915867,
"loss": 5.4549,
"mean_token_accuracy": 0.16366417109966278,
"num_tokens": 17862931.0,
"step": 10285
},
{
"entropy": 5.624537801742553,
"epoch": 0.800622446994748,
"grad_norm": 1.4609375,
"learning_rate": 0.0004941340625085601,
"loss": 5.4687,
"mean_token_accuracy": 0.15939135998487472,
"num_tokens": 17871909.0,
"step": 10290
},
{
"entropy": 5.557803964614868,
"epoch": 0.8010114763664656,
"grad_norm": 1.4609375,
"learning_rate": 0.0004941277735005228,
"loss": 5.393,
"mean_token_accuracy": 0.17381084114313125,
"num_tokens": 17880487.0,
"step": 10295
},
{
"entropy": 5.588583517074585,
"epoch": 0.8014005057381832,
"grad_norm": 1.5390625,
"learning_rate": 0.0004941214811675702,
"loss": 5.4542,
"mean_token_accuracy": 0.16852321177721025,
"num_tokens": 17888712.0,
"step": 10300
},
{
"entropy": 5.642118215560913,
"epoch": 0.8017895351099008,
"grad_norm": 2.609375,
"learning_rate": 0.0004941151855097982,
"loss": 5.4903,
"mean_token_accuracy": 0.15546952784061432,
"num_tokens": 17898163.0,
"step": 10305
},
{
"entropy": 5.535411024093628,
"epoch": 0.8021785644816184,
"grad_norm": 1.53125,
"learning_rate": 0.0004941088865273018,
"loss": 5.3703,
"mean_token_accuracy": 0.16942618489265443,
"num_tokens": 17906849.0,
"step": 10310
},
{
"entropy": 5.608208322525025,
"epoch": 0.802567593853336,
"grad_norm": 1.3828125,
"learning_rate": 0.0004941025842201769,
"loss": 5.4008,
"mean_token_accuracy": 0.16982601284980775,
"num_tokens": 17915695.0,
"step": 10315
},
{
"entropy": 5.596428537368775,
"epoch": 0.8029566232250535,
"grad_norm": 1.34375,
"learning_rate": 0.0004940962785885189,
"loss": 5.5122,
"mean_token_accuracy": 0.1608186975121498,
"num_tokens": 17924706.0,
"step": 10320
},
{
"entropy": 5.562576389312744,
"epoch": 0.803345652596771,
"grad_norm": 1.4609375,
"learning_rate": 0.0004940899696324237,
"loss": 5.4711,
"mean_token_accuracy": 0.16752206534147263,
"num_tokens": 17934061.0,
"step": 10325
},
{
"entropy": 5.546580028533936,
"epoch": 0.8037346819684886,
"grad_norm": 1.484375,
"learning_rate": 0.0004940836573519868,
"loss": 5.3595,
"mean_token_accuracy": 0.16760505586862565,
"num_tokens": 17942580.0,
"step": 10330
},
{
"entropy": 5.539015054702759,
"epoch": 0.8041237113402062,
"grad_norm": 1.609375,
"learning_rate": 0.0004940773417473043,
"loss": 5.2718,
"mean_token_accuracy": 0.17465481162071228,
"num_tokens": 17951171.0,
"step": 10335
},
{
"entropy": 5.505323362350464,
"epoch": 0.8045127407119238,
"grad_norm": 1.5078125,
"learning_rate": 0.0004940710228184717,
"loss": 5.3372,
"mean_token_accuracy": 0.17467240542173385,
"num_tokens": 17959674.0,
"step": 10340
},
{
"entropy": 5.5616072654724125,
"epoch": 0.8049017700836413,
"grad_norm": 1.359375,
"learning_rate": 0.000494064700565585,
"loss": 5.3916,
"mean_token_accuracy": 0.17132804691791534,
"num_tokens": 17969036.0,
"step": 10345
},
{
"entropy": 5.532428979873657,
"epoch": 0.8052907994553589,
"grad_norm": 1.4921875,
"learning_rate": 0.0004940583749887403,
"loss": 5.4045,
"mean_token_accuracy": 0.17045033425092698,
"num_tokens": 17977406.0,
"step": 10350
},
{
"entropy": 5.526391220092774,
"epoch": 0.8056798288270764,
"grad_norm": 1.46875,
"learning_rate": 0.0004940520460880333,
"loss": 5.3813,
"mean_token_accuracy": 0.16534534841775894,
"num_tokens": 17985981.0,
"step": 10355
},
{
"entropy": 5.650390529632569,
"epoch": 0.806068858198794,
"grad_norm": 1.609375,
"learning_rate": 0.0004940457138635601,
"loss": 5.5773,
"mean_token_accuracy": 0.15537587255239488,
"num_tokens": 17994246.0,
"step": 10360
},
{
"entropy": 5.547157096862793,
"epoch": 0.8064578875705116,
"grad_norm": 1.7265625,
"learning_rate": 0.0004940393783154169,
"loss": 5.4117,
"mean_token_accuracy": 0.16677334606647493,
"num_tokens": 18002444.0,
"step": 10365
},
{
"entropy": 5.520352935791015,
"epoch": 0.8068469169422291,
"grad_norm": 1.4921875,
"learning_rate": 0.0004940330394436999,
"loss": 5.3228,
"mean_token_accuracy": 0.17117541283369064,
"num_tokens": 18011076.0,
"step": 10370
},
{
"entropy": 5.6307567119598385,
"epoch": 0.8072359463139467,
"grad_norm": 1.546875,
"learning_rate": 0.000494026697248505,
"loss": 5.6128,
"mean_token_accuracy": 0.15513427555561066,
"num_tokens": 18020232.0,
"step": 10375
},
{
"entropy": 5.632945775985718,
"epoch": 0.8076249756856643,
"grad_norm": 1.6171875,
"learning_rate": 0.0004940203517299287,
"loss": 5.4423,
"mean_token_accuracy": 0.16628613770008088,
"num_tokens": 18029055.0,
"step": 10380
},
{
"entropy": 5.6604228019714355,
"epoch": 0.8080140050573819,
"grad_norm": 1.6015625,
"learning_rate": 0.000494014002888067,
"loss": 5.5832,
"mean_token_accuracy": 0.15375707671046257,
"num_tokens": 18037827.0,
"step": 10385
},
{
"entropy": 5.532300758361816,
"epoch": 0.8084030344290994,
"grad_norm": 1.5078125,
"learning_rate": 0.0004940076507230166,
"loss": 5.4075,
"mean_token_accuracy": 0.16032442599534988,
"num_tokens": 18047017.0,
"step": 10390
},
{
"entropy": 5.572431898117065,
"epoch": 0.8087920638008169,
"grad_norm": 1.8203125,
"learning_rate": 0.0004940012952348735,
"loss": 5.4952,
"mean_token_accuracy": 0.1637907072901726,
"num_tokens": 18056256.0,
"step": 10395
},
{
"entropy": 5.571317577362061,
"epoch": 0.8091810931725345,
"grad_norm": 1.375,
"learning_rate": 0.0004939949364237345,
"loss": 5.2766,
"mean_token_accuracy": 0.1846555769443512,
"num_tokens": 18064127.0,
"step": 10400
},
{
"entropy": 5.525552558898926,
"epoch": 0.8095701225442521,
"grad_norm": 1.5390625,
"learning_rate": 0.0004939885742896958,
"loss": 5.4217,
"mean_token_accuracy": 0.16987547874450684,
"num_tokens": 18072766.0,
"step": 10405
},
{
"entropy": 5.533914470672608,
"epoch": 0.8099591519159697,
"grad_norm": 1.546875,
"learning_rate": 0.000493982208832854,
"loss": 5.389,
"mean_token_accuracy": 0.16176797598600387,
"num_tokens": 18080685.0,
"step": 10410
},
{
"entropy": 5.615296936035156,
"epoch": 0.8103481812876873,
"grad_norm": 1.46875,
"learning_rate": 0.0004939758400533058,
"loss": 5.4916,
"mean_token_accuracy": 0.16295187026262284,
"num_tokens": 18090026.0,
"step": 10415
},
{
"entropy": 5.584811973571777,
"epoch": 0.8107372106594047,
"grad_norm": 1.453125,
"learning_rate": 0.0004939694679511478,
"loss": 5.3816,
"mean_token_accuracy": 0.1665487602353096,
"num_tokens": 18098638.0,
"step": 10420
},
{
"entropy": 5.580897521972656,
"epoch": 0.8111262400311223,
"grad_norm": 1.40625,
"learning_rate": 0.0004939630925264765,
"loss": 5.4018,
"mean_token_accuracy": 0.16661616712808608,
"num_tokens": 18106844.0,
"step": 10425
},
{
"entropy": 5.543839836120606,
"epoch": 0.8115152694028399,
"grad_norm": 1.4375,
"learning_rate": 0.000493956713779389,
"loss": 5.4096,
"mean_token_accuracy": 0.16410439163446428,
"num_tokens": 18114758.0,
"step": 10430
},
{
"entropy": 5.501433897018432,
"epoch": 0.8119042987745575,
"grad_norm": 1.3984375,
"learning_rate": 0.0004939503317099817,
"loss": 5.375,
"mean_token_accuracy": 0.16939013153314592,
"num_tokens": 18122839.0,
"step": 10435
},
{
"entropy": 5.585040616989136,
"epoch": 0.8122933281462751,
"grad_norm": 2.078125,
"learning_rate": 0.0004939439463183517,
"loss": 5.4855,
"mean_token_accuracy": 0.16006513983011245,
"num_tokens": 18131709.0,
"step": 10440
},
{
"entropy": 5.590785646438599,
"epoch": 0.8126823575179926,
"grad_norm": 1.4765625,
"learning_rate": 0.0004939375576045958,
"loss": 5.4507,
"mean_token_accuracy": 0.16072610169649124,
"num_tokens": 18140334.0,
"step": 10445
},
{
"entropy": 5.535165596008301,
"epoch": 0.8130713868897101,
"grad_norm": 1.59375,
"learning_rate": 0.0004939311655688109,
"loss": 5.4314,
"mean_token_accuracy": 0.16793013066053392,
"num_tokens": 18148648.0,
"step": 10450
},
{
"entropy": 5.538791751861572,
"epoch": 0.8134604162614277,
"grad_norm": 1.421875,
"learning_rate": 0.0004939247702110941,
"loss": 5.4273,
"mean_token_accuracy": 0.16139496266841888,
"num_tokens": 18156891.0,
"step": 10455
},
{
"entropy": 5.537261009216309,
"epoch": 0.8138494456331453,
"grad_norm": 1.3046875,
"learning_rate": 0.0004939183715315423,
"loss": 5.4021,
"mean_token_accuracy": 0.167157644033432,
"num_tokens": 18166512.0,
"step": 10460
},
{
"entropy": 5.581291580200196,
"epoch": 0.8142384750048629,
"grad_norm": 1.328125,
"learning_rate": 0.0004939119695302526,
"loss": 5.3555,
"mean_token_accuracy": 0.1694805070757866,
"num_tokens": 18175064.0,
"step": 10465
},
{
"entropy": 5.59117169380188,
"epoch": 0.8146275043765804,
"grad_norm": 1.6015625,
"learning_rate": 0.0004939055642073224,
"loss": 5.4883,
"mean_token_accuracy": 0.16789814084768295,
"num_tokens": 18184251.0,
"step": 10470
},
{
"entropy": 5.533836698532104,
"epoch": 0.815016533748298,
"grad_norm": 1.4921875,
"learning_rate": 0.0004938991555628484,
"loss": 5.3344,
"mean_token_accuracy": 0.1767840102314949,
"num_tokens": 18193274.0,
"step": 10475
},
{
"entropy": 5.535302639007568,
"epoch": 0.8154055631200156,
"grad_norm": 1.40625,
"learning_rate": 0.0004938927435969283,
"loss": 5.3778,
"mean_token_accuracy": 0.17561944872140883,
"num_tokens": 18201878.0,
"step": 10480
},
{
"entropy": 5.502153730392456,
"epoch": 0.8157945924917331,
"grad_norm": 1.5,
"learning_rate": 0.0004938863283096592,
"loss": 5.345,
"mean_token_accuracy": 0.17128555178642274,
"num_tokens": 18210343.0,
"step": 10485
},
{
"entropy": 5.612079429626465,
"epoch": 0.8161836218634507,
"grad_norm": 1.5546875,
"learning_rate": 0.0004938799097011384,
"loss": 5.4758,
"mean_token_accuracy": 0.17280255556106566,
"num_tokens": 18218599.0,
"step": 10490
},
{
"entropy": 5.538069152832032,
"epoch": 0.8165726512351682,
"grad_norm": 1.40625,
"learning_rate": 0.0004938734877714634,
"loss": 5.3758,
"mean_token_accuracy": 0.1752694681286812,
"num_tokens": 18226384.0,
"step": 10495
},
{
"entropy": 5.481068897247314,
"epoch": 0.8169616806068858,
"grad_norm": 1.5546875,
"learning_rate": 0.0004938670625207317,
"loss": 5.3619,
"mean_token_accuracy": 0.1663648247718811,
"num_tokens": 18234894.0,
"step": 10500
},
{
"entropy": 5.564583492279053,
"epoch": 0.8173507099786034,
"grad_norm": 1.4765625,
"learning_rate": 0.0004938606339490406,
"loss": 5.4119,
"mean_token_accuracy": 0.16760359108448028,
"num_tokens": 18243768.0,
"step": 10505
},
{
"entropy": 5.598694324493408,
"epoch": 0.817739739350321,
"grad_norm": 1.53125,
"learning_rate": 0.0004938542020564877,
"loss": 5.4365,
"mean_token_accuracy": 0.1723689153790474,
"num_tokens": 18252364.0,
"step": 10510
},
{
"entropy": 5.534125804901123,
"epoch": 0.8181287687220385,
"grad_norm": 1.59375,
"learning_rate": 0.0004938477668431706,
"loss": 5.3896,
"mean_token_accuracy": 0.1713106393814087,
"num_tokens": 18260997.0,
"step": 10515
},
{
"entropy": 5.676814079284668,
"epoch": 0.8185177980937561,
"grad_norm": 1.578125,
"learning_rate": 0.0004938413283091871,
"loss": 5.592,
"mean_token_accuracy": 0.15618581473827362,
"num_tokens": 18270171.0,
"step": 10520
},
{
"entropy": 5.628856182098389,
"epoch": 0.8189068274654736,
"grad_norm": 1.40625,
"learning_rate": 0.0004938348864546347,
"loss": 5.43,
"mean_token_accuracy": 0.16960666179656983,
"num_tokens": 18278772.0,
"step": 10525
},
{
"entropy": 5.429003572463989,
"epoch": 0.8192958568371912,
"grad_norm": 1.65625,
"learning_rate": 0.0004938284412796111,
"loss": 5.2631,
"mean_token_accuracy": 0.17318774163722991,
"num_tokens": 18287305.0,
"step": 10530
},
{
"entropy": 5.520912504196167,
"epoch": 0.8196848862089088,
"grad_norm": 1.4609375,
"learning_rate": 0.0004938219927842144,
"loss": 5.4826,
"mean_token_accuracy": 0.15914302319288254,
"num_tokens": 18296532.0,
"step": 10535
},
{
"entropy": 5.559760522842407,
"epoch": 0.8200739155806264,
"grad_norm": 1.375,
"learning_rate": 0.0004938155409685422,
"loss": 5.3533,
"mean_token_accuracy": 0.17692378908395767,
"num_tokens": 18304612.0,
"step": 10540
},
{
"entropy": 5.572201156616211,
"epoch": 0.820462944952344,
"grad_norm": 1.5234375,
"learning_rate": 0.0004938090858326923,
"loss": 5.4245,
"mean_token_accuracy": 0.1682295471429825,
"num_tokens": 18312970.0,
"step": 10545
},
{
"entropy": 5.616934204101563,
"epoch": 0.8208519743240614,
"grad_norm": 1.4765625,
"learning_rate": 0.000493802627376763,
"loss": 5.4276,
"mean_token_accuracy": 0.16691444516181947,
"num_tokens": 18321073.0,
"step": 10550
},
{
"entropy": 5.575044441223144,
"epoch": 0.821241003695779,
"grad_norm": 1.71875,
"learning_rate": 0.0004937961656008518,
"loss": 5.4188,
"mean_token_accuracy": 0.16600096374750137,
"num_tokens": 18329960.0,
"step": 10555
},
{
"entropy": 5.521937656402588,
"epoch": 0.8216300330674966,
"grad_norm": 1.4296875,
"learning_rate": 0.0004937897005050573,
"loss": 5.3948,
"mean_token_accuracy": 0.1701318606734276,
"num_tokens": 18337935.0,
"step": 10560
},
{
"entropy": 5.545421028137207,
"epoch": 0.8220190624392142,
"grad_norm": 1.53125,
"learning_rate": 0.0004937832320894772,
"loss": 5.3868,
"mean_token_accuracy": 0.16694458872079848,
"num_tokens": 18347445.0,
"step": 10565
},
{
"entropy": 5.560770082473755,
"epoch": 0.8224080918109318,
"grad_norm": 1.84375,
"learning_rate": 0.0004937767603542098,
"loss": 5.3754,
"mean_token_accuracy": 0.16941318958997725,
"num_tokens": 18355817.0,
"step": 10570
},
{
"entropy": 5.620953845977783,
"epoch": 0.8227971211826492,
"grad_norm": 1.34375,
"learning_rate": 0.0004937702852993534,
"loss": 5.3748,
"mean_token_accuracy": 0.17274976819753646,
"num_tokens": 18363478.0,
"step": 10575
},
{
"entropy": 5.548452854156494,
"epoch": 0.8231861505543668,
"grad_norm": 1.4140625,
"learning_rate": 0.000493763806925006,
"loss": 5.3751,
"mean_token_accuracy": 0.16753287017345428,
"num_tokens": 18371788.0,
"step": 10580
},
{
"entropy": 5.468597459793091,
"epoch": 0.8235751799260844,
"grad_norm": 1.484375,
"learning_rate": 0.0004937573252312661,
"loss": 5.3883,
"mean_token_accuracy": 0.16964965760707856,
"num_tokens": 18380361.0,
"step": 10585
},
{
"entropy": 5.5768290042877195,
"epoch": 0.823964209297802,
"grad_norm": 1.4375,
"learning_rate": 0.000493750840218232,
"loss": 5.455,
"mean_token_accuracy": 0.17311280518770217,
"num_tokens": 18389396.0,
"step": 10590
},
{
"entropy": 5.583901214599609,
"epoch": 0.8243532386695196,
"grad_norm": 1.4140625,
"learning_rate": 0.0004937443518860021,
"loss": 5.5305,
"mean_token_accuracy": 0.1546028196811676,
"num_tokens": 18398517.0,
"step": 10595
},
{
"entropy": 5.654685926437378,
"epoch": 0.8247422680412371,
"grad_norm": 1.53125,
"learning_rate": 0.0004937378602346747,
"loss": 5.4548,
"mean_token_accuracy": 0.16782184839248657,
"num_tokens": 18406620.0,
"step": 10600
},
{
"entropy": 5.589144134521485,
"epoch": 0.8251312974129547,
"grad_norm": 1.3671875,
"learning_rate": 0.0004937313652643485,
"loss": 5.4916,
"mean_token_accuracy": 0.16066399812698365,
"num_tokens": 18414849.0,
"step": 10605
},
{
"entropy": 5.536501550674439,
"epoch": 0.8255203267846722,
"grad_norm": 1.421875,
"learning_rate": 0.000493724866975122,
"loss": 5.4219,
"mean_token_accuracy": 0.16284872740507125,
"num_tokens": 18423675.0,
"step": 10610
},
{
"entropy": 5.605426549911499,
"epoch": 0.8259093561563898,
"grad_norm": 1.53125,
"learning_rate": 0.0004937183653670937,
"loss": 5.4872,
"mean_token_accuracy": 0.16344206929206848,
"num_tokens": 18432848.0,
"step": 10615
},
{
"entropy": 5.614923477172852,
"epoch": 0.8262983855281074,
"grad_norm": 1.4296875,
"learning_rate": 0.0004937118604403623,
"loss": 5.5242,
"mean_token_accuracy": 0.16344038695096968,
"num_tokens": 18441210.0,
"step": 10620
},
{
"entropy": 5.620850515365601,
"epoch": 0.8266874148998249,
"grad_norm": 1.4375,
"learning_rate": 0.0004937053521950266,
"loss": 5.4392,
"mean_token_accuracy": 0.16228336989879608,
"num_tokens": 18450084.0,
"step": 10625
},
{
"entropy": 5.4885618686676025,
"epoch": 0.8270764442715425,
"grad_norm": 1.4453125,
"learning_rate": 0.0004936988406311854,
"loss": 5.3129,
"mean_token_accuracy": 0.1663394585251808,
"num_tokens": 18458329.0,
"step": 10630
},
{
"entropy": 5.5116783618927006,
"epoch": 0.8274654736432601,
"grad_norm": 1.4609375,
"learning_rate": 0.0004936923257489373,
"loss": 5.4387,
"mean_token_accuracy": 0.16123657375574113,
"num_tokens": 18467518.0,
"step": 10635
},
{
"entropy": 5.570949697494507,
"epoch": 0.8278545030149776,
"grad_norm": 1.4765625,
"learning_rate": 0.0004936858075483811,
"loss": 5.3113,
"mean_token_accuracy": 0.1803199365735054,
"num_tokens": 18476051.0,
"step": 10640
},
{
"entropy": 5.551233148574829,
"epoch": 0.8282435323866952,
"grad_norm": 1.625,
"learning_rate": 0.000493679286029616,
"loss": 5.4194,
"mean_token_accuracy": 0.17045304626226426,
"num_tokens": 18484492.0,
"step": 10645
},
{
"entropy": 5.5319945335388185,
"epoch": 0.8286325617584127,
"grad_norm": 1.4609375,
"learning_rate": 0.0004936727611927407,
"loss": 5.473,
"mean_token_accuracy": 0.15831886380910873,
"num_tokens": 18493759.0,
"step": 10650
},
{
"entropy": 5.590476083755493,
"epoch": 0.8290215911301303,
"grad_norm": 1.453125,
"learning_rate": 0.0004936662330378546,
"loss": 5.3368,
"mean_token_accuracy": 0.1734246402978897,
"num_tokens": 18501750.0,
"step": 10655
},
{
"entropy": 5.475524234771728,
"epoch": 0.8294106205018479,
"grad_norm": 1.59375,
"learning_rate": 0.0004936597015650561,
"loss": 5.3553,
"mean_token_accuracy": 0.17020751237869264,
"num_tokens": 18511003.0,
"step": 10660
},
{
"entropy": 5.489647436141968,
"epoch": 0.8297996498735655,
"grad_norm": 1.3515625,
"learning_rate": 0.0004936531667744448,
"loss": 5.4099,
"mean_token_accuracy": 0.17030000388622285,
"num_tokens": 18519544.0,
"step": 10665
},
{
"entropy": 5.677573251724243,
"epoch": 0.8301886792452831,
"grad_norm": 1.4453125,
"learning_rate": 0.0004936466286661197,
"loss": 5.4954,
"mean_token_accuracy": 0.16336029171943664,
"num_tokens": 18528766.0,
"step": 10670
},
{
"entropy": 5.584993124008179,
"epoch": 0.8305777086170005,
"grad_norm": 1.609375,
"learning_rate": 0.00049364008724018,
"loss": 5.4935,
"mean_token_accuracy": 0.16371748298406602,
"num_tokens": 18538243.0,
"step": 10675
},
{
"entropy": 5.560536050796509,
"epoch": 0.8309667379887181,
"grad_norm": 1.5,
"learning_rate": 0.000493633542496725,
"loss": 5.4957,
"mean_token_accuracy": 0.17018121778964995,
"num_tokens": 18547028.0,
"step": 10680
},
{
"entropy": 5.586135339736939,
"epoch": 0.8313557673604357,
"grad_norm": 1.265625,
"learning_rate": 0.0004936269944358539,
"loss": 5.5188,
"mean_token_accuracy": 0.1603980079293251,
"num_tokens": 18555821.0,
"step": 10685
},
{
"entropy": 5.549597215652466,
"epoch": 0.8317447967321533,
"grad_norm": 1.5390625,
"learning_rate": 0.0004936204430576664,
"loss": 5.4773,
"mean_token_accuracy": 0.1603648066520691,
"num_tokens": 18564213.0,
"step": 10690
},
{
"entropy": 5.612131357192993,
"epoch": 0.8321338261038709,
"grad_norm": 1.5234375,
"learning_rate": 0.0004936138883622614,
"loss": 5.4448,
"mean_token_accuracy": 0.1611863285303116,
"num_tokens": 18573132.0,
"step": 10695
},
{
"entropy": 5.5748532772064205,
"epoch": 0.8325228554755884,
"grad_norm": 1.3515625,
"learning_rate": 0.0004936073303497387,
"loss": 5.3533,
"mean_token_accuracy": 0.1693910300731659,
"num_tokens": 18581131.0,
"step": 10700
},
{
"entropy": 5.509807825088501,
"epoch": 0.8329118848473059,
"grad_norm": 1.609375,
"learning_rate": 0.0004936007690201976,
"loss": 5.4532,
"mean_token_accuracy": 0.16321152448654175,
"num_tokens": 18589602.0,
"step": 10705
},
{
"entropy": 5.549233436584473,
"epoch": 0.8333009142190235,
"grad_norm": 1.4609375,
"learning_rate": 0.000493594204373738,
"loss": 5.4288,
"mean_token_accuracy": 0.1674068585038185,
"num_tokens": 18598263.0,
"step": 10710
},
{
"entropy": 5.5804527759552,
"epoch": 0.8336899435907411,
"grad_norm": 1.53125,
"learning_rate": 0.0004935876364104591,
"loss": 5.3227,
"mean_token_accuracy": 0.17426640689373016,
"num_tokens": 18606432.0,
"step": 10715
},
{
"entropy": 5.53414306640625,
"epoch": 0.8340789729624587,
"grad_norm": 1.484375,
"learning_rate": 0.0004935810651304608,
"loss": 5.4677,
"mean_token_accuracy": 0.1617758348584175,
"num_tokens": 18614769.0,
"step": 10720
},
{
"entropy": 5.564225721359253,
"epoch": 0.8344680023341763,
"grad_norm": 1.8125,
"learning_rate": 0.0004935744905338427,
"loss": 5.4331,
"mean_token_accuracy": 0.1664901629090309,
"num_tokens": 18623505.0,
"step": 10725
},
{
"entropy": 5.601116275787353,
"epoch": 0.8348570317058938,
"grad_norm": 1.578125,
"learning_rate": 0.0004935679126207046,
"loss": 5.3964,
"mean_token_accuracy": 0.17452556937932967,
"num_tokens": 18632072.0,
"step": 10730
},
{
"entropy": 5.630527400970459,
"epoch": 0.8352460610776113,
"grad_norm": 1.3984375,
"learning_rate": 0.0004935613313911463,
"loss": 5.4819,
"mean_token_accuracy": 0.1619068369269371,
"num_tokens": 18640439.0,
"step": 10735
},
{
"entropy": 5.531963634490967,
"epoch": 0.8356350904493289,
"grad_norm": 1.4765625,
"learning_rate": 0.0004935547468452678,
"loss": 5.4606,
"mean_token_accuracy": 0.1599298372864723,
"num_tokens": 18649554.0,
"step": 10740
},
{
"entropy": 5.604838275909424,
"epoch": 0.8360241198210465,
"grad_norm": 1.4921875,
"learning_rate": 0.0004935481589831688,
"loss": 5.3385,
"mean_token_accuracy": 0.16614857465028762,
"num_tokens": 18657918.0,
"step": 10745
},
{
"entropy": 5.610438251495362,
"epoch": 0.8364131491927641,
"grad_norm": 1.5,
"learning_rate": 0.0004935415678049492,
"loss": 5.4564,
"mean_token_accuracy": 0.16079498082399368,
"num_tokens": 18666735.0,
"step": 10750
},
{
"entropy": 5.547011137008667,
"epoch": 0.8368021785644816,
"grad_norm": 1.796875,
"learning_rate": 0.0004935349733107094,
"loss": 5.3454,
"mean_token_accuracy": 0.16375958770513535,
"num_tokens": 18674977.0,
"step": 10755
},
{
"entropy": 5.575332736968994,
"epoch": 0.8371912079361992,
"grad_norm": 1.59375,
"learning_rate": 0.000493528375500549,
"loss": 5.47,
"mean_token_accuracy": 0.16258184611797333,
"num_tokens": 18683624.0,
"step": 10760
},
{
"entropy": 5.513408184051514,
"epoch": 0.8375802373079168,
"grad_norm": 1.9609375,
"learning_rate": 0.0004935217743745685,
"loss": 5.3801,
"mean_token_accuracy": 0.16637008190155028,
"num_tokens": 18692183.0,
"step": 10765
},
{
"entropy": 5.62416090965271,
"epoch": 0.8379692666796343,
"grad_norm": 1.6328125,
"learning_rate": 0.0004935151699328677,
"loss": 5.4675,
"mean_token_accuracy": 0.1567910671234131,
"num_tokens": 18700989.0,
"step": 10770
},
{
"entropy": 5.59164080619812,
"epoch": 0.8383582960513519,
"grad_norm": 1.515625,
"learning_rate": 0.0004935085621755471,
"loss": 5.3554,
"mean_token_accuracy": 0.17235667109489441,
"num_tokens": 18709126.0,
"step": 10775
},
{
"entropy": 5.612299680709839,
"epoch": 0.8387473254230694,
"grad_norm": 1.6484375,
"learning_rate": 0.000493501951102707,
"loss": 5.4464,
"mean_token_accuracy": 0.1676034525036812,
"num_tokens": 18717378.0,
"step": 10780
},
{
"entropy": 5.666617584228516,
"epoch": 0.839136354794787,
"grad_norm": 1.625,
"learning_rate": 0.0004934953367144474,
"loss": 5.5048,
"mean_token_accuracy": 0.15813286304473878,
"num_tokens": 18725694.0,
"step": 10785
},
{
"entropy": 5.540688705444336,
"epoch": 0.8395253841665046,
"grad_norm": 1.90625,
"learning_rate": 0.0004934887190108688,
"loss": 5.3891,
"mean_token_accuracy": 0.1703401178121567,
"num_tokens": 18734737.0,
"step": 10790
},
{
"entropy": 5.686959600448608,
"epoch": 0.8399144135382222,
"grad_norm": 1.546875,
"learning_rate": 0.0004934820979920719,
"loss": 5.6315,
"mean_token_accuracy": 0.15653401017189025,
"num_tokens": 18743895.0,
"step": 10795
},
{
"entropy": 5.6683997631073,
"epoch": 0.8403034429099397,
"grad_norm": 1.6875,
"learning_rate": 0.0004934754736581567,
"loss": 5.4905,
"mean_token_accuracy": 0.16242460310459136,
"num_tokens": 18753105.0,
"step": 10800
},
{
"entropy": 5.5665730953216555,
"epoch": 0.8406924722816572,
"grad_norm": 1.578125,
"learning_rate": 0.000493468846009224,
"loss": 5.3397,
"mean_token_accuracy": 0.1671126589179039,
"num_tokens": 18761593.0,
"step": 10805
},
{
"entropy": 5.61871075630188,
"epoch": 0.8410815016533748,
"grad_norm": 1.5,
"learning_rate": 0.0004934622150453742,
"loss": 5.3932,
"mean_token_accuracy": 0.17331528961658477,
"num_tokens": 18770105.0,
"step": 10810
},
{
"entropy": 5.5453849792480465,
"epoch": 0.8414705310250924,
"grad_norm": 1.4453125,
"learning_rate": 0.000493455580766708,
"loss": 5.4428,
"mean_token_accuracy": 0.1649451285600662,
"num_tokens": 18778429.0,
"step": 10815
},
{
"entropy": 5.63263783454895,
"epoch": 0.84185956039681,
"grad_norm": 2.265625,
"learning_rate": 0.0004934489431733262,
"loss": 5.4915,
"mean_token_accuracy": 0.1641908973455429,
"num_tokens": 18787072.0,
"step": 10820
},
{
"entropy": 5.556106042861939,
"epoch": 0.8422485897685276,
"grad_norm": 1.3984375,
"learning_rate": 0.0004934423022653293,
"loss": 5.3499,
"mean_token_accuracy": 0.1757698379456997,
"num_tokens": 18795628.0,
"step": 10825
},
{
"entropy": 5.561394596099854,
"epoch": 0.842637619140245,
"grad_norm": 1.6171875,
"learning_rate": 0.0004934356580428182,
"loss": 5.4416,
"mean_token_accuracy": 0.1657291278243065,
"num_tokens": 18804313.0,
"step": 10830
},
{
"entropy": 5.625190877914429,
"epoch": 0.8430266485119626,
"grad_norm": 1.46875,
"learning_rate": 0.0004934290105058937,
"loss": 5.4647,
"mean_token_accuracy": 0.16012297570705414,
"num_tokens": 18813170.0,
"step": 10835
},
{
"entropy": 5.589764499664307,
"epoch": 0.8434156778836802,
"grad_norm": 1.6171875,
"learning_rate": 0.0004934223596546565,
"loss": 5.3883,
"mean_token_accuracy": 0.16826024502515793,
"num_tokens": 18823009.0,
"step": 10840
},
{
"entropy": 5.556996011734009,
"epoch": 0.8438047072553978,
"grad_norm": 1.4296875,
"learning_rate": 0.0004934157054892077,
"loss": 5.4694,
"mean_token_accuracy": 0.16876722872257233,
"num_tokens": 18831272.0,
"step": 10845
},
{
"entropy": 5.554804992675781,
"epoch": 0.8441937366271154,
"grad_norm": 1.390625,
"learning_rate": 0.0004934090480096482,
"loss": 5.4438,
"mean_token_accuracy": 0.16085582226514816,
"num_tokens": 18839481.0,
"step": 10850
},
{
"entropy": 5.566276407241821,
"epoch": 0.8445827659988329,
"grad_norm": 1.578125,
"learning_rate": 0.0004934023872160791,
"loss": 5.4318,
"mean_token_accuracy": 0.16860787868499755,
"num_tokens": 18848586.0,
"step": 10855
},
{
"entropy": 5.570894002914429,
"epoch": 0.8449717953705504,
"grad_norm": 1.5,
"learning_rate": 0.0004933957231086014,
"loss": 5.3174,
"mean_token_accuracy": 0.17001835405826568,
"num_tokens": 18856948.0,
"step": 10860
},
{
"entropy": 5.606099796295166,
"epoch": 0.845360824742268,
"grad_norm": 1.4765625,
"learning_rate": 0.0004933890556873161,
"loss": 5.3896,
"mean_token_accuracy": 0.1649198979139328,
"num_tokens": 18864741.0,
"step": 10865
},
{
"entropy": 5.58132529258728,
"epoch": 0.8457498541139856,
"grad_norm": 1.4296875,
"learning_rate": 0.0004933823849523246,
"loss": 5.4677,
"mean_token_accuracy": 0.16213586181402206,
"num_tokens": 18873373.0,
"step": 10870
},
{
"entropy": 5.61713399887085,
"epoch": 0.8461388834857032,
"grad_norm": 1.4140625,
"learning_rate": 0.0004933757109037279,
"loss": 5.3303,
"mean_token_accuracy": 0.17016200125217437,
"num_tokens": 18881590.0,
"step": 10875
},
{
"entropy": 5.572556591033935,
"epoch": 0.8465279128574207,
"grad_norm": 1.3671875,
"learning_rate": 0.0004933690335416274,
"loss": 5.4305,
"mean_token_accuracy": 0.1637813627719879,
"num_tokens": 18889838.0,
"step": 10880
},
{
"entropy": 5.552700185775757,
"epoch": 0.8469169422291383,
"grad_norm": 1.5,
"learning_rate": 0.0004933623528661245,
"loss": 5.3441,
"mean_token_accuracy": 0.17247612923383712,
"num_tokens": 18898577.0,
"step": 10885
},
{
"entropy": 5.6202739715576175,
"epoch": 0.8473059716008559,
"grad_norm": 1.5546875,
"learning_rate": 0.0004933556688773203,
"loss": 5.4885,
"mean_token_accuracy": 0.16694238036870956,
"num_tokens": 18907309.0,
"step": 10890
},
{
"entropy": 5.621315288543701,
"epoch": 0.8476950009725734,
"grad_norm": 1.5078125,
"learning_rate": 0.0004933489815753165,
"loss": 5.4106,
"mean_token_accuracy": 0.16841107606887817,
"num_tokens": 18915956.0,
"step": 10895
},
{
"entropy": 5.52905044555664,
"epoch": 0.848084030344291,
"grad_norm": 1.546875,
"learning_rate": 0.0004933422909602143,
"loss": 5.509,
"mean_token_accuracy": 0.1620262160897255,
"num_tokens": 18924603.0,
"step": 10900
},
{
"entropy": 5.549146223068237,
"epoch": 0.8484730597160085,
"grad_norm": 1.421875,
"learning_rate": 0.0004933355970321155,
"loss": 5.4007,
"mean_token_accuracy": 0.17655430734157562,
"num_tokens": 18933231.0,
"step": 10905
},
{
"entropy": 5.68997106552124,
"epoch": 0.8488620890877261,
"grad_norm": 1.4140625,
"learning_rate": 0.0004933288997911215,
"loss": 5.5174,
"mean_token_accuracy": 0.1586891695857048,
"num_tokens": 18942172.0,
"step": 10910
},
{
"entropy": 5.596334505081177,
"epoch": 0.8492511184594437,
"grad_norm": 1.40625,
"learning_rate": 0.0004933221992373338,
"loss": 5.4538,
"mean_token_accuracy": 0.16567957848310472,
"num_tokens": 18951440.0,
"step": 10915
},
{
"entropy": 5.5552136421203615,
"epoch": 0.8496401478311613,
"grad_norm": 1.5390625,
"learning_rate": 0.0004933154953708544,
"loss": 5.4197,
"mean_token_accuracy": 0.16126616001129152,
"num_tokens": 18959797.0,
"step": 10920
},
{
"entropy": 5.599853754043579,
"epoch": 0.8500291772028788,
"grad_norm": 1.421875,
"learning_rate": 0.0004933087881917848,
"loss": 5.4249,
"mean_token_accuracy": 0.16775873452425002,
"num_tokens": 18968811.0,
"step": 10925
},
{
"entropy": 5.6504920482635494,
"epoch": 0.8504182065745964,
"grad_norm": 1.484375,
"learning_rate": 0.0004933020777002268,
"loss": 5.5465,
"mean_token_accuracy": 0.15841249078512193,
"num_tokens": 18977467.0,
"step": 10930
},
{
"entropy": 5.6737282276153564,
"epoch": 0.8508072359463139,
"grad_norm": 1.328125,
"learning_rate": 0.0004932953638962823,
"loss": 5.4403,
"mean_token_accuracy": 0.1651856020092964,
"num_tokens": 18985760.0,
"step": 10935
},
{
"entropy": 5.699455785751343,
"epoch": 0.8511962653180315,
"grad_norm": 1.6015625,
"learning_rate": 0.000493288646780053,
"loss": 5.4834,
"mean_token_accuracy": 0.15546912103891372,
"num_tokens": 18993812.0,
"step": 10940
},
{
"entropy": 5.575416231155396,
"epoch": 0.8515852946897491,
"grad_norm": 1.5078125,
"learning_rate": 0.0004932819263516409,
"loss": 5.4917,
"mean_token_accuracy": 0.1625030368566513,
"num_tokens": 19003056.0,
"step": 10945
},
{
"entropy": 5.675415563583374,
"epoch": 0.8519743240614667,
"grad_norm": 1.265625,
"learning_rate": 0.0004932752026111481,
"loss": 5.4705,
"mean_token_accuracy": 0.1690106511116028,
"num_tokens": 19011533.0,
"step": 10950
},
{
"entropy": 5.6119842529296875,
"epoch": 0.8523633534331843,
"grad_norm": 1.4375,
"learning_rate": 0.0004932684755586765,
"loss": 5.42,
"mean_token_accuracy": 0.1668616071343422,
"num_tokens": 19020773.0,
"step": 10955
},
{
"entropy": 5.564594173431397,
"epoch": 0.8527523828049017,
"grad_norm": 1.3984375,
"learning_rate": 0.0004932617451943282,
"loss": 5.4341,
"mean_token_accuracy": 0.1613341137766838,
"num_tokens": 19029809.0,
"step": 10960
},
{
"entropy": 5.583635759353638,
"epoch": 0.8531414121766193,
"grad_norm": 1.484375,
"learning_rate": 0.0004932550115182053,
"loss": 5.3734,
"mean_token_accuracy": 0.1697031795978546,
"num_tokens": 19038875.0,
"step": 10965
},
{
"entropy": 5.671226453781128,
"epoch": 0.8535304415483369,
"grad_norm": 1.6015625,
"learning_rate": 0.00049324827453041,
"loss": 5.4619,
"mean_token_accuracy": 0.17031318098306655,
"num_tokens": 19047273.0,
"step": 10970
},
{
"entropy": 5.5258331298828125,
"epoch": 0.8539194709200545,
"grad_norm": 1.328125,
"learning_rate": 0.0004932415342310446,
"loss": 5.3956,
"mean_token_accuracy": 0.16772737354040146,
"num_tokens": 19056309.0,
"step": 10975
},
{
"entropy": 5.553267145156861,
"epoch": 0.8543085002917721,
"grad_norm": 1.3359375,
"learning_rate": 0.0004932347906202111,
"loss": 5.3658,
"mean_token_accuracy": 0.16715893745422364,
"num_tokens": 19064487.0,
"step": 10980
},
{
"entropy": 5.586594200134277,
"epoch": 0.8546975296634896,
"grad_norm": 1.6796875,
"learning_rate": 0.000493228043698012,
"loss": 5.5889,
"mean_token_accuracy": 0.16258976012468337,
"num_tokens": 19073431.0,
"step": 10985
},
{
"entropy": 5.582021570205688,
"epoch": 0.8550865590352071,
"grad_norm": 1.4296875,
"learning_rate": 0.0004932212934645498,
"loss": 5.4556,
"mean_token_accuracy": 0.16721367686986924,
"num_tokens": 19081648.0,
"step": 10990
},
{
"entropy": 5.525068902969361,
"epoch": 0.8554755884069247,
"grad_norm": 1.359375,
"learning_rate": 0.0004932145399199268,
"loss": 5.3542,
"mean_token_accuracy": 0.1711691588163376,
"num_tokens": 19090581.0,
"step": 10995
},
{
"entropy": 5.61999740600586,
"epoch": 0.8558646177786423,
"grad_norm": 1.453125,
"learning_rate": 0.0004932077830642455,
"loss": 5.4745,
"mean_token_accuracy": 0.16335834115743636,
"num_tokens": 19098924.0,
"step": 11000
},
{
"entropy": 5.644947862625122,
"epoch": 0.8562536471503599,
"grad_norm": 1.5390625,
"learning_rate": 0.0004932010228976084,
"loss": 5.4515,
"mean_token_accuracy": 0.1678395614027977,
"num_tokens": 19108267.0,
"step": 11005
},
{
"entropy": 5.682941675186157,
"epoch": 0.8566426765220774,
"grad_norm": 1.59375,
"learning_rate": 0.000493194259420118,
"loss": 5.474,
"mean_token_accuracy": 0.1619163230061531,
"num_tokens": 19117158.0,
"step": 11010
},
{
"entropy": 5.562949085235596,
"epoch": 0.857031705893795,
"grad_norm": 1.4140625,
"learning_rate": 0.000493187492631877,
"loss": 5.4514,
"mean_token_accuracy": 0.1655110687017441,
"num_tokens": 19126013.0,
"step": 11015
},
{
"entropy": 5.472146654129029,
"epoch": 0.8574207352655125,
"grad_norm": 1.4375,
"learning_rate": 0.0004931807225329882,
"loss": 5.3822,
"mean_token_accuracy": 0.16488017737865449,
"num_tokens": 19134655.0,
"step": 11020
},
{
"entropy": 5.53136248588562,
"epoch": 0.8578097646372301,
"grad_norm": 1.5625,
"learning_rate": 0.0004931739491235541,
"loss": 5.2834,
"mean_token_accuracy": 0.16555664390325547,
"num_tokens": 19143311.0,
"step": 11025
},
{
"entropy": 5.59962477684021,
"epoch": 0.8581987940089477,
"grad_norm": 1.5390625,
"learning_rate": 0.0004931671724036777,
"loss": 5.4432,
"mean_token_accuracy": 0.17099899649620057,
"num_tokens": 19152422.0,
"step": 11030
},
{
"entropy": 5.610012149810791,
"epoch": 0.8585878233806652,
"grad_norm": 1.3125,
"learning_rate": 0.0004931603923734616,
"loss": 5.5176,
"mean_token_accuracy": 0.1600009486079216,
"num_tokens": 19161510.0,
"step": 11035
},
{
"entropy": 5.564943170547485,
"epoch": 0.8589768527523828,
"grad_norm": 2.203125,
"learning_rate": 0.0004931536090330088,
"loss": 5.3544,
"mean_token_accuracy": 0.16602486968040467,
"num_tokens": 19170097.0,
"step": 11040
},
{
"entropy": 5.5572069644927975,
"epoch": 0.8593658821241004,
"grad_norm": 1.3828125,
"learning_rate": 0.0004931468223824222,
"loss": 5.4032,
"mean_token_accuracy": 0.17011643052101136,
"num_tokens": 19179131.0,
"step": 11045
},
{
"entropy": 5.516173696517944,
"epoch": 0.859754911495818,
"grad_norm": 1.421875,
"learning_rate": 0.0004931400324218048,
"loss": 5.3104,
"mean_token_accuracy": 0.1758366346359253,
"num_tokens": 19187289.0,
"step": 11050
},
{
"entropy": 5.546682739257813,
"epoch": 0.8601439408675355,
"grad_norm": 1.3515625,
"learning_rate": 0.0004931332391512597,
"loss": 5.4245,
"mean_token_accuracy": 0.16874566525220872,
"num_tokens": 19195746.0,
"step": 11055
},
{
"entropy": 5.655080127716064,
"epoch": 0.860532970239253,
"grad_norm": 1.359375,
"learning_rate": 0.0004931264425708897,
"loss": 5.4413,
"mean_token_accuracy": 0.16570912301540375,
"num_tokens": 19204683.0,
"step": 11060
},
{
"entropy": 5.5210959911346436,
"epoch": 0.8609219996109706,
"grad_norm": 1.6640625,
"learning_rate": 0.0004931196426807983,
"loss": 5.3469,
"mean_token_accuracy": 0.161997252702713,
"num_tokens": 19213405.0,
"step": 11065
},
{
"entropy": 5.59285044670105,
"epoch": 0.8613110289826882,
"grad_norm": 1.75,
"learning_rate": 0.0004931128394810884,
"loss": 5.4458,
"mean_token_accuracy": 0.1710154190659523,
"num_tokens": 19222717.0,
"step": 11070
},
{
"entropy": 5.631794214248657,
"epoch": 0.8617000583544058,
"grad_norm": 1.40625,
"learning_rate": 0.0004931060329718634,
"loss": 5.4567,
"mean_token_accuracy": 0.16193218156695366,
"num_tokens": 19230688.0,
"step": 11075
},
{
"entropy": 5.588335084915161,
"epoch": 0.8620890877261234,
"grad_norm": 1.578125,
"learning_rate": 0.0004930992231532265,
"loss": 5.5275,
"mean_token_accuracy": 0.15564640313386918,
"num_tokens": 19239192.0,
"step": 11080
},
{
"entropy": 5.626792526245117,
"epoch": 0.8624781170978408,
"grad_norm": 1.5625,
"learning_rate": 0.000493092410025281,
"loss": 5.5153,
"mean_token_accuracy": 0.15964918583631516,
"num_tokens": 19247903.0,
"step": 11085
},
{
"entropy": 5.606396007537842,
"epoch": 0.8628671464695584,
"grad_norm": 1.390625,
"learning_rate": 0.0004930855935881302,
"loss": 5.4354,
"mean_token_accuracy": 0.16549526304006576,
"num_tokens": 19256127.0,
"step": 11090
},
{
"entropy": 5.5886890411376955,
"epoch": 0.863256175841276,
"grad_norm": 1.7421875,
"learning_rate": 0.0004930787738418777,
"loss": 5.3995,
"mean_token_accuracy": 0.169436477124691,
"num_tokens": 19264742.0,
"step": 11095
},
{
"entropy": 5.527159881591797,
"epoch": 0.8636452052129936,
"grad_norm": 1.375,
"learning_rate": 0.0004930719507866269,
"loss": 5.3727,
"mean_token_accuracy": 0.16563803404569627,
"num_tokens": 19273618.0,
"step": 11100
},
{
"entropy": 5.600240278244018,
"epoch": 0.8640342345847112,
"grad_norm": 1.40625,
"learning_rate": 0.0004930651244224814,
"loss": 5.4219,
"mean_token_accuracy": 0.17024289220571517,
"num_tokens": 19281792.0,
"step": 11105
},
{
"entropy": 5.496180438995362,
"epoch": 0.8644232639564287,
"grad_norm": 1.625,
"learning_rate": 0.0004930582947495448,
"loss": 5.3852,
"mean_token_accuracy": 0.16692871898412703,
"num_tokens": 19289738.0,
"step": 11110
},
{
"entropy": 5.615656518936158,
"epoch": 0.8648122933281462,
"grad_norm": 2.0,
"learning_rate": 0.0004930514617679206,
"loss": 5.3839,
"mean_token_accuracy": 0.1686216786503792,
"num_tokens": 19298711.0,
"step": 11115
},
{
"entropy": 5.685328626632691,
"epoch": 0.8652013226998638,
"grad_norm": 1.484375,
"learning_rate": 0.0004930446254777125,
"loss": 5.4913,
"mean_token_accuracy": 0.16433748751878738,
"num_tokens": 19307435.0,
"step": 11120
},
{
"entropy": 5.538598823547363,
"epoch": 0.8655903520715814,
"grad_norm": 1.5546875,
"learning_rate": 0.0004930377858790242,
"loss": 5.3596,
"mean_token_accuracy": 0.16777653396129608,
"num_tokens": 19315327.0,
"step": 11125
},
{
"entropy": 5.532667636871338,
"epoch": 0.865979381443299,
"grad_norm": 2.03125,
"learning_rate": 0.0004930309429719595,
"loss": 5.3183,
"mean_token_accuracy": 0.17217909991741182,
"num_tokens": 19323261.0,
"step": 11130
},
{
"entropy": 5.463712978363037,
"epoch": 0.8663684108150166,
"grad_norm": 1.484375,
"learning_rate": 0.0004930240967566224,
"loss": 5.3019,
"mean_token_accuracy": 0.16938008815050126,
"num_tokens": 19332297.0,
"step": 11135
},
{
"entropy": 5.497597551345825,
"epoch": 0.8667574401867341,
"grad_norm": 1.3984375,
"learning_rate": 0.0004930172472331167,
"loss": 5.3095,
"mean_token_accuracy": 0.17312744557857512,
"num_tokens": 19340848.0,
"step": 11140
},
{
"entropy": 5.491792011260986,
"epoch": 0.8671464695584516,
"grad_norm": 1.5546875,
"learning_rate": 0.0004930103944015463,
"loss": 5.3774,
"mean_token_accuracy": 0.17115949243307113,
"num_tokens": 19349072.0,
"step": 11145
},
{
"entropy": 5.619730997085571,
"epoch": 0.8675354989301692,
"grad_norm": 1.65625,
"learning_rate": 0.0004930035382620149,
"loss": 5.4234,
"mean_token_accuracy": 0.16752508133649827,
"num_tokens": 19357723.0,
"step": 11150
},
{
"entropy": 5.5437096118927,
"epoch": 0.8679245283018868,
"grad_norm": 1.53125,
"learning_rate": 0.000492996678814627,
"loss": 5.3466,
"mean_token_accuracy": 0.17316702455282212,
"num_tokens": 19365925.0,
"step": 11155
},
{
"entropy": 5.5340173721313475,
"epoch": 0.8683135576736044,
"grad_norm": 1.5078125,
"learning_rate": 0.0004929898160594865,
"loss": 5.3943,
"mean_token_accuracy": 0.17101194709539413,
"num_tokens": 19374190.0,
"step": 11160
},
{
"entropy": 5.523618936538696,
"epoch": 0.8687025870453219,
"grad_norm": 1.4296875,
"learning_rate": 0.0004929829499966974,
"loss": 5.4004,
"mean_token_accuracy": 0.1685847282409668,
"num_tokens": 19382375.0,
"step": 11165
},
{
"entropy": 5.642296648025512,
"epoch": 0.8690916164170395,
"grad_norm": 1.4140625,
"learning_rate": 0.0004929760806263641,
"loss": 5.4571,
"mean_token_accuracy": 0.1682697132229805,
"num_tokens": 19390191.0,
"step": 11170
},
{
"entropy": 5.535978174209594,
"epoch": 0.8694806457887571,
"grad_norm": 1.40625,
"learning_rate": 0.0004929692079485906,
"loss": 5.2604,
"mean_token_accuracy": 0.1755853533744812,
"num_tokens": 19399401.0,
"step": 11175
},
{
"entropy": 5.490648174285889,
"epoch": 0.8698696751604746,
"grad_norm": 1.3515625,
"learning_rate": 0.0004929623319634814,
"loss": 5.3516,
"mean_token_accuracy": 0.17433520257472992,
"num_tokens": 19407956.0,
"step": 11180
},
{
"entropy": 5.560776090621948,
"epoch": 0.8702587045321922,
"grad_norm": 1.4765625,
"learning_rate": 0.0004929554526711407,
"loss": 5.5159,
"mean_token_accuracy": 0.1625481054186821,
"num_tokens": 19416432.0,
"step": 11185
},
{
"entropy": 5.53424391746521,
"epoch": 0.8706477339039097,
"grad_norm": 1.4140625,
"learning_rate": 0.0004929485700716729,
"loss": 5.3581,
"mean_token_accuracy": 0.17236267030239105,
"num_tokens": 19425208.0,
"step": 11190
},
{
"entropy": 5.638381767272949,
"epoch": 0.8710367632756273,
"grad_norm": 1.546875,
"learning_rate": 0.0004929416841651824,
"loss": 5.5035,
"mean_token_accuracy": 0.1660827562212944,
"num_tokens": 19434169.0,
"step": 11195
},
{
"entropy": 5.557585287094116,
"epoch": 0.8714257926473449,
"grad_norm": 1.53125,
"learning_rate": 0.0004929347949517739,
"loss": 5.2829,
"mean_token_accuracy": 0.17812299728393555,
"num_tokens": 19443484.0,
"step": 11200
},
{
"entropy": 5.512750053405762,
"epoch": 0.8718148220190625,
"grad_norm": 1.5390625,
"learning_rate": 0.0004929279024315516,
"loss": 5.4249,
"mean_token_accuracy": 0.1689809814095497,
"num_tokens": 19452193.0,
"step": 11205
},
{
"entropy": 5.690864896774292,
"epoch": 0.87220385139078,
"grad_norm": 1.703125,
"learning_rate": 0.0004929210066046204,
"loss": 5.5427,
"mean_token_accuracy": 0.15889561772346497,
"num_tokens": 19460684.0,
"step": 11210
},
{
"entropy": 5.573667192459107,
"epoch": 0.8725928807624975,
"grad_norm": 1.46875,
"learning_rate": 0.0004929141074710847,
"loss": 5.3649,
"mean_token_accuracy": 0.17416849881410598,
"num_tokens": 19469206.0,
"step": 11215
},
{
"entropy": 5.50807204246521,
"epoch": 0.8729819101342151,
"grad_norm": 1.9296875,
"learning_rate": 0.0004929072050310491,
"loss": 5.4212,
"mean_token_accuracy": 0.1704845279455185,
"num_tokens": 19477514.0,
"step": 11220
},
{
"entropy": 5.556146144866943,
"epoch": 0.8733709395059327,
"grad_norm": 1.78125,
"learning_rate": 0.0004929002992846188,
"loss": 5.4844,
"mean_token_accuracy": 0.16183665692806243,
"num_tokens": 19486792.0,
"step": 11225
},
{
"entropy": 5.597028732299805,
"epoch": 0.8737599688776503,
"grad_norm": 1.609375,
"learning_rate": 0.0004928933902318981,
"loss": 5.4356,
"mean_token_accuracy": 0.17462601214647294,
"num_tokens": 19495708.0,
"step": 11230
},
{
"entropy": 5.658380556106567,
"epoch": 0.8741489982493679,
"grad_norm": 1.4296875,
"learning_rate": 0.000492886477872992,
"loss": 5.5828,
"mean_token_accuracy": 0.15301429033279418,
"num_tokens": 19505063.0,
"step": 11235
},
{
"entropy": 5.648887681961059,
"epoch": 0.8745380276210853,
"grad_norm": 1.625,
"learning_rate": 0.0004928795622080054,
"loss": 5.4971,
"mean_token_accuracy": 0.16162820905447006,
"num_tokens": 19514641.0,
"step": 11240
},
{
"entropy": 5.583265590667724,
"epoch": 0.8749270569928029,
"grad_norm": 1.5,
"learning_rate": 0.0004928726432370434,
"loss": 5.3864,
"mean_token_accuracy": 0.1669035166501999,
"num_tokens": 19523136.0,
"step": 11245
},
{
"entropy": 5.519823598861694,
"epoch": 0.8753160863645205,
"grad_norm": 1.390625,
"learning_rate": 0.0004928657209602107,
"loss": 5.2883,
"mean_token_accuracy": 0.1751377359032631,
"num_tokens": 19532258.0,
"step": 11250
},
{
"entropy": 5.580462884902954,
"epoch": 0.8757051157362381,
"grad_norm": 1.53125,
"learning_rate": 0.0004928587953776125,
"loss": 5.5305,
"mean_token_accuracy": 0.16641346961259842,
"num_tokens": 19541235.0,
"step": 11255
},
{
"entropy": 5.605775976181031,
"epoch": 0.8760941451079557,
"grad_norm": 1.6328125,
"learning_rate": 0.0004928518664893538,
"loss": 5.4458,
"mean_token_accuracy": 0.16409534588456154,
"num_tokens": 19550259.0,
"step": 11260
},
{
"entropy": 5.615903568267822,
"epoch": 0.8764831744796732,
"grad_norm": 1.5234375,
"learning_rate": 0.0004928449342955397,
"loss": 5.4358,
"mean_token_accuracy": 0.16389891356229783,
"num_tokens": 19558500.0,
"step": 11265
},
{
"entropy": 5.5283490180969235,
"epoch": 0.8768722038513908,
"grad_norm": 1.4765625,
"learning_rate": 0.0004928379987962756,
"loss": 5.3741,
"mean_token_accuracy": 0.16884355247020721,
"num_tokens": 19566562.0,
"step": 11270
},
{
"entropy": 5.515049266815185,
"epoch": 0.8772612332231083,
"grad_norm": 1.4921875,
"learning_rate": 0.0004928310599916666,
"loss": 5.3853,
"mean_token_accuracy": 0.16551622450351716,
"num_tokens": 19575219.0,
"step": 11275
},
{
"entropy": 5.4597554206848145,
"epoch": 0.8776502625948259,
"grad_norm": 1.453125,
"learning_rate": 0.0004928241178818178,
"loss": 5.3257,
"mean_token_accuracy": 0.1707369640469551,
"num_tokens": 19584311.0,
"step": 11280
},
{
"entropy": 5.578729295730591,
"epoch": 0.8780392919665435,
"grad_norm": 1.75,
"learning_rate": 0.0004928171724668349,
"loss": 5.4742,
"mean_token_accuracy": 0.15891241580247878,
"num_tokens": 19593802.0,
"step": 11285
},
{
"entropy": 5.596161842346191,
"epoch": 0.878428321338261,
"grad_norm": 1.3515625,
"learning_rate": 0.0004928102237468229,
"loss": 5.4382,
"mean_token_accuracy": 0.16021957099437714,
"num_tokens": 19603046.0,
"step": 11290
},
{
"entropy": 5.477987575531006,
"epoch": 0.8788173507099786,
"grad_norm": 1.5234375,
"learning_rate": 0.0004928032717218876,
"loss": 5.327,
"mean_token_accuracy": 0.17128750383853913,
"num_tokens": 19611609.0,
"step": 11295
},
{
"entropy": 5.535358715057373,
"epoch": 0.8792063800816962,
"grad_norm": 1.453125,
"learning_rate": 0.0004927963163921343,
"loss": 5.3174,
"mean_token_accuracy": 0.1724611461162567,
"num_tokens": 19619380.0,
"step": 11300
},
{
"entropy": 5.660423040390015,
"epoch": 0.8795954094534137,
"grad_norm": 1.46875,
"learning_rate": 0.0004927893577576685,
"loss": 5.5158,
"mean_token_accuracy": 0.16152099370956421,
"num_tokens": 19628336.0,
"step": 11305
},
{
"entropy": 5.550154733657837,
"epoch": 0.8799844388251313,
"grad_norm": 1.625,
"learning_rate": 0.0004927823958185959,
"loss": 5.4772,
"mean_token_accuracy": 0.1703892767429352,
"num_tokens": 19637888.0,
"step": 11310
},
{
"entropy": 5.52217116355896,
"epoch": 0.8803734681968488,
"grad_norm": 1.6015625,
"learning_rate": 0.000492775430575022,
"loss": 5.3769,
"mean_token_accuracy": 0.1711402118206024,
"num_tokens": 19646123.0,
"step": 11315
},
{
"entropy": 5.553801441192627,
"epoch": 0.8807624975685664,
"grad_norm": 1.4609375,
"learning_rate": 0.0004927684620270527,
"loss": 5.3806,
"mean_token_accuracy": 0.1713252618908882,
"num_tokens": 19655264.0,
"step": 11320
},
{
"entropy": 5.659976005554199,
"epoch": 0.881151526940284,
"grad_norm": 1.546875,
"learning_rate": 0.0004927614901747935,
"loss": 5.5008,
"mean_token_accuracy": 0.15829492807388307,
"num_tokens": 19663594.0,
"step": 11325
},
{
"entropy": 5.603869247436523,
"epoch": 0.8815405563120016,
"grad_norm": 1.625,
"learning_rate": 0.0004927545150183503,
"loss": 5.4514,
"mean_token_accuracy": 0.16312796175479888,
"num_tokens": 19671515.0,
"step": 11330
},
{
"entropy": 5.527267026901245,
"epoch": 0.8819295856837192,
"grad_norm": 1.359375,
"learning_rate": 0.000492747536557829,
"loss": 5.3052,
"mean_token_accuracy": 0.17422009855508805,
"num_tokens": 19680288.0,
"step": 11335
},
{
"entropy": 5.521861791610718,
"epoch": 0.8823186150554367,
"grad_norm": 1.5625,
"learning_rate": 0.0004927405547933353,
"loss": 5.3426,
"mean_token_accuracy": 0.1709321469068527,
"num_tokens": 19688717.0,
"step": 11340
},
{
"entropy": 5.479914283752441,
"epoch": 0.8827076444271542,
"grad_norm": 1.4765625,
"learning_rate": 0.0004927335697249753,
"loss": 5.2918,
"mean_token_accuracy": 0.17452473938465118,
"num_tokens": 19697412.0,
"step": 11345
},
{
"entropy": 5.550742864608765,
"epoch": 0.8830966737988718,
"grad_norm": 1.4921875,
"learning_rate": 0.0004927265813528549,
"loss": 5.4509,
"mean_token_accuracy": 0.16693398207426072,
"num_tokens": 19706127.0,
"step": 11350
},
{
"entropy": 5.629002046585083,
"epoch": 0.8834857031705894,
"grad_norm": 1.6015625,
"learning_rate": 0.0004927195896770804,
"loss": 5.5093,
"mean_token_accuracy": 0.16149643212556838,
"num_tokens": 19715178.0,
"step": 11355
},
{
"entropy": 5.60448145866394,
"epoch": 0.883874732542307,
"grad_norm": 1.421875,
"learning_rate": 0.0004927125946977574,
"loss": 5.3897,
"mean_token_accuracy": 0.17134506851434708,
"num_tokens": 19723814.0,
"step": 11360
},
{
"entropy": 5.643859004974365,
"epoch": 0.8842637619140246,
"grad_norm": 1.3984375,
"learning_rate": 0.0004927055964149923,
"loss": 5.5034,
"mean_token_accuracy": 0.1638002246618271,
"num_tokens": 19732153.0,
"step": 11365
},
{
"entropy": 5.613669395446777,
"epoch": 0.884652791285742,
"grad_norm": 1.6796875,
"learning_rate": 0.0004926985948288914,
"loss": 5.4246,
"mean_token_accuracy": 0.16479934006929398,
"num_tokens": 19740251.0,
"step": 11370
},
{
"entropy": 5.511256217956543,
"epoch": 0.8850418206574596,
"grad_norm": 1.8203125,
"learning_rate": 0.0004926915899395608,
"loss": 5.353,
"mean_token_accuracy": 0.17248303145170213,
"num_tokens": 19748695.0,
"step": 11375
},
{
"entropy": 5.576343297958374,
"epoch": 0.8854308500291772,
"grad_norm": 1.5546875,
"learning_rate": 0.0004926845817471068,
"loss": 5.3806,
"mean_token_accuracy": 0.16375323235988617,
"num_tokens": 19757674.0,
"step": 11380
},
{
"entropy": 5.499237489700318,
"epoch": 0.8858198794008948,
"grad_norm": 1.4375,
"learning_rate": 0.0004926775702516358,
"loss": 5.2499,
"mean_token_accuracy": 0.17762889266014098,
"num_tokens": 19765555.0,
"step": 11385
},
{
"entropy": 5.475513696670532,
"epoch": 0.8862089087726124,
"grad_norm": 1.5546875,
"learning_rate": 0.0004926705554532541,
"loss": 5.3908,
"mean_token_accuracy": 0.17034557610750198,
"num_tokens": 19773986.0,
"step": 11390
},
{
"entropy": 5.606078386306763,
"epoch": 0.8865979381443299,
"grad_norm": 1.4765625,
"learning_rate": 0.0004926635373520682,
"loss": 5.4257,
"mean_token_accuracy": 0.16838602870702743,
"num_tokens": 19782308.0,
"step": 11395
},
{
"entropy": 5.572033357620239,
"epoch": 0.8869869675160474,
"grad_norm": 1.4765625,
"learning_rate": 0.0004926565159481845,
"loss": 5.386,
"mean_token_accuracy": 0.16937547773122788,
"num_tokens": 19790447.0,
"step": 11400
},
{
"entropy": 5.5389289379119875,
"epoch": 0.887375996887765,
"grad_norm": 1.6328125,
"learning_rate": 0.0004926494912417097,
"loss": 5.4891,
"mean_token_accuracy": 0.16308147758245467,
"num_tokens": 19798889.0,
"step": 11405
},
{
"entropy": 5.58053297996521,
"epoch": 0.8877650262594826,
"grad_norm": 1.46875,
"learning_rate": 0.0004926424632327503,
"loss": 5.3088,
"mean_token_accuracy": 0.1733681246638298,
"num_tokens": 19807192.0,
"step": 11410
},
{
"entropy": 5.593471479415894,
"epoch": 0.8881540556312002,
"grad_norm": 1.28125,
"learning_rate": 0.0004926354319214129,
"loss": 5.4429,
"mean_token_accuracy": 0.16237304955720902,
"num_tokens": 19815864.0,
"step": 11415
},
{
"entropy": 5.547385263442993,
"epoch": 0.8885430850029177,
"grad_norm": 1.609375,
"learning_rate": 0.0004926283973078041,
"loss": 5.3716,
"mean_token_accuracy": 0.16968866735696791,
"num_tokens": 19823218.0,
"step": 11420
},
{
"entropy": 5.5402172088623045,
"epoch": 0.8889321143746353,
"grad_norm": 1.390625,
"learning_rate": 0.0004926213593920309,
"loss": 5.425,
"mean_token_accuracy": 0.1676907166838646,
"num_tokens": 19832098.0,
"step": 11425
},
{
"entropy": 5.532503938674926,
"epoch": 0.8893211437463528,
"grad_norm": 2.671875,
"learning_rate": 0.0004926143181742,
"loss": 5.3452,
"mean_token_accuracy": 0.17280984669923782,
"num_tokens": 19840180.0,
"step": 11430
},
{
"entropy": 5.56445689201355,
"epoch": 0.8897101731180704,
"grad_norm": 1.4609375,
"learning_rate": 0.0004926072736544181,
"loss": 5.413,
"mean_token_accuracy": 0.16488739401102065,
"num_tokens": 19849016.0,
"step": 11435
},
{
"entropy": 5.504498052597046,
"epoch": 0.890099202489788,
"grad_norm": 1.53125,
"learning_rate": 0.0004926002258327922,
"loss": 5.3337,
"mean_token_accuracy": 0.17296406626701355,
"num_tokens": 19858044.0,
"step": 11440
},
{
"entropy": 5.46937198638916,
"epoch": 0.8904882318615055,
"grad_norm": 1.328125,
"learning_rate": 0.0004925931747094292,
"loss": 5.295,
"mean_token_accuracy": 0.17614005804061889,
"num_tokens": 19867557.0,
"step": 11445
},
{
"entropy": 5.565935277938843,
"epoch": 0.8908772612332231,
"grad_norm": 1.5859375,
"learning_rate": 0.0004925861202844361,
"loss": 5.399,
"mean_token_accuracy": 0.1677923858165741,
"num_tokens": 19876009.0,
"step": 11450
},
{
"entropy": 5.625434064865113,
"epoch": 0.8912662906049407,
"grad_norm": 1.71875,
"learning_rate": 0.00049257906255792,
"loss": 5.482,
"mean_token_accuracy": 0.16082603186368943,
"num_tokens": 19885085.0,
"step": 11455
},
{
"entropy": 5.692309951782226,
"epoch": 0.8916553199766583,
"grad_norm": 1.5390625,
"learning_rate": 0.000492572001529988,
"loss": 5.4152,
"mean_token_accuracy": 0.16631953418254852,
"num_tokens": 19893877.0,
"step": 11460
},
{
"entropy": 5.6170957565307615,
"epoch": 0.8920443493483758,
"grad_norm": 1.3125,
"learning_rate": 0.0004925649372007469,
"loss": 5.5506,
"mean_token_accuracy": 0.16721371412277222,
"num_tokens": 19902480.0,
"step": 11465
},
{
"entropy": 5.542704296112061,
"epoch": 0.8924333787200933,
"grad_norm": 1.421875,
"learning_rate": 0.0004925578695703045,
"loss": 5.3204,
"mean_token_accuracy": 0.17218605130910875,
"num_tokens": 19910981.0,
"step": 11470
},
{
"entropy": 5.575353384017944,
"epoch": 0.8928224080918109,
"grad_norm": 1.484375,
"learning_rate": 0.0004925507986387676,
"loss": 5.4467,
"mean_token_accuracy": 0.1668962210416794,
"num_tokens": 19920055.0,
"step": 11475
},
{
"entropy": 5.636821985244751,
"epoch": 0.8932114374635285,
"grad_norm": 1.6640625,
"learning_rate": 0.0004925437244062436,
"loss": 5.5014,
"mean_token_accuracy": 0.16508774608373641,
"num_tokens": 19928010.0,
"step": 11480
},
{
"entropy": 5.612282609939575,
"epoch": 0.8936004668352461,
"grad_norm": 1.7265625,
"learning_rate": 0.0004925366468728397,
"loss": 5.375,
"mean_token_accuracy": 0.1714618131518364,
"num_tokens": 19935992.0,
"step": 11485
},
{
"entropy": 5.556436681747437,
"epoch": 0.8939894962069637,
"grad_norm": 1.5,
"learning_rate": 0.0004925295660386635,
"loss": 5.4872,
"mean_token_accuracy": 0.16400733441114426,
"num_tokens": 19944522.0,
"step": 11490
},
{
"entropy": 5.657855606079101,
"epoch": 0.8943785255786811,
"grad_norm": 1.390625,
"learning_rate": 0.0004925224819038224,
"loss": 5.4437,
"mean_token_accuracy": 0.16268703192472458,
"num_tokens": 19952991.0,
"step": 11495
},
{
"entropy": 5.57559757232666,
"epoch": 0.8947675549503987,
"grad_norm": 1.4375,
"learning_rate": 0.0004925153944684239,
"loss": 5.4747,
"mean_token_accuracy": 0.16336518079042434,
"num_tokens": 19962301.0,
"step": 11500
},
{
"entropy": 5.654898309707642,
"epoch": 0.8951565843221163,
"grad_norm": 1.6953125,
"learning_rate": 0.0004925083037325754,
"loss": 5.5359,
"mean_token_accuracy": 0.15567568987607955,
"num_tokens": 19971159.0,
"step": 11505
},
{
"entropy": 5.636246681213379,
"epoch": 0.8955456136938339,
"grad_norm": 1.375,
"learning_rate": 0.0004925012096963847,
"loss": 5.3966,
"mean_token_accuracy": 0.16252862811088561,
"num_tokens": 19979608.0,
"step": 11510
},
{
"entropy": 5.595708894729614,
"epoch": 0.8959346430655515,
"grad_norm": 1.6484375,
"learning_rate": 0.0004924941123599593,
"loss": 5.3889,
"mean_token_accuracy": 0.16272395998239517,
"num_tokens": 19988348.0,
"step": 11515
},
{
"entropy": 5.518790435791016,
"epoch": 0.896323672437269,
"grad_norm": 2.203125,
"learning_rate": 0.0004924870117234069,
"loss": 5.3813,
"mean_token_accuracy": 0.16586881130933762,
"num_tokens": 19996970.0,
"step": 11520
},
{
"entropy": 5.6056602001190186,
"epoch": 0.8967127018089865,
"grad_norm": 1.3828125,
"learning_rate": 0.0004924799077868353,
"loss": 5.518,
"mean_token_accuracy": 0.1701822578907013,
"num_tokens": 20005297.0,
"step": 11525
},
{
"entropy": 5.597276830673218,
"epoch": 0.8971017311807041,
"grad_norm": 1.3515625,
"learning_rate": 0.0004924728005503522,
"loss": 5.4559,
"mean_token_accuracy": 0.1568764790892601,
"num_tokens": 20013971.0,
"step": 11530
},
{
"entropy": 5.610063457489014,
"epoch": 0.8974907605524217,
"grad_norm": 1.3671875,
"learning_rate": 0.0004924656900140655,
"loss": 5.4146,
"mean_token_accuracy": 0.16589949578046798,
"num_tokens": 20022536.0,
"step": 11535
},
{
"entropy": 5.539964199066162,
"epoch": 0.8978797899241393,
"grad_norm": 1.265625,
"learning_rate": 0.0004924585761780831,
"loss": 5.332,
"mean_token_accuracy": 0.16694836765527726,
"num_tokens": 20031676.0,
"step": 11540
},
{
"entropy": 5.597091960906982,
"epoch": 0.8982688192958569,
"grad_norm": 1.4921875,
"learning_rate": 0.000492451459042513,
"loss": 5.396,
"mean_token_accuracy": 0.16850428879261017,
"num_tokens": 20039783.0,
"step": 11545
},
{
"entropy": 5.53537425994873,
"epoch": 0.8986578486675744,
"grad_norm": 1.5,
"learning_rate": 0.000492444338607463,
"loss": 5.4568,
"mean_token_accuracy": 0.16167483776807784,
"num_tokens": 20047859.0,
"step": 11550
},
{
"entropy": 5.61722583770752,
"epoch": 0.899046878039292,
"grad_norm": 1.4140625,
"learning_rate": 0.0004924372148730413,
"loss": 5.4939,
"mean_token_accuracy": 0.1566051334142685,
"num_tokens": 20056711.0,
"step": 11555
},
{
"entropy": 5.5410792350769045,
"epoch": 0.8994359074110095,
"grad_norm": 1.3515625,
"learning_rate": 0.000492430087839356,
"loss": 5.3345,
"mean_token_accuracy": 0.1677985593676567,
"num_tokens": 20065715.0,
"step": 11560
},
{
"entropy": 5.5740954875946045,
"epoch": 0.8998249367827271,
"grad_norm": 1.4765625,
"learning_rate": 0.0004924229575065152,
"loss": 5.4394,
"mean_token_accuracy": 0.16821805238723755,
"num_tokens": 20073815.0,
"step": 11565
},
{
"entropy": 5.612536334991455,
"epoch": 0.9002139661544447,
"grad_norm": 1.4453125,
"learning_rate": 0.000492415823874627,
"loss": 5.4172,
"mean_token_accuracy": 0.16439640522003174,
"num_tokens": 20082331.0,
"step": 11570
},
{
"entropy": 5.5884815692901615,
"epoch": 0.9006029955261622,
"grad_norm": 1.5,
"learning_rate": 0.0004924086869437998,
"loss": 5.4857,
"mean_token_accuracy": 0.1639646589756012,
"num_tokens": 20091095.0,
"step": 11575
},
{
"entropy": 5.583862066268921,
"epoch": 0.9009920248978798,
"grad_norm": 1.4296875,
"learning_rate": 0.0004924015467141417,
"loss": 5.4048,
"mean_token_accuracy": 0.1721714124083519,
"num_tokens": 20100111.0,
"step": 11580
},
{
"entropy": 5.634499263763428,
"epoch": 0.9013810542695974,
"grad_norm": 1.5859375,
"learning_rate": 0.0004923944031857613,
"loss": 5.4747,
"mean_token_accuracy": 0.17119355350732804,
"num_tokens": 20108542.0,
"step": 11585
},
{
"entropy": 5.540798568725586,
"epoch": 0.901770083641315,
"grad_norm": 1.46875,
"learning_rate": 0.0004923872563587668,
"loss": 5.3858,
"mean_token_accuracy": 0.17029852867126466,
"num_tokens": 20117831.0,
"step": 11590
},
{
"entropy": 5.5578783512115475,
"epoch": 0.9021591130130325,
"grad_norm": 1.3671875,
"learning_rate": 0.0004923801062332666,
"loss": 5.3541,
"mean_token_accuracy": 0.16690099239349365,
"num_tokens": 20127322.0,
"step": 11595
},
{
"entropy": 5.62836766242981,
"epoch": 0.90254814238475,
"grad_norm": 1.3984375,
"learning_rate": 0.0004923729528093694,
"loss": 5.4257,
"mean_token_accuracy": 0.16922255456447602,
"num_tokens": 20135772.0,
"step": 11600
},
{
"entropy": 5.589234209060669,
"epoch": 0.9029371717564676,
"grad_norm": 1.5078125,
"learning_rate": 0.0004923657960871836,
"loss": 5.4238,
"mean_token_accuracy": 0.17161959856748582,
"num_tokens": 20144110.0,
"step": 11605
},
{
"entropy": 5.5908387184143065,
"epoch": 0.9033262011281852,
"grad_norm": 1.453125,
"learning_rate": 0.0004923586360668178,
"loss": 5.5314,
"mean_token_accuracy": 0.16080180257558824,
"num_tokens": 20153391.0,
"step": 11610
},
{
"entropy": 5.488399410247803,
"epoch": 0.9037152304999028,
"grad_norm": 1.5234375,
"learning_rate": 0.0004923514727483807,
"loss": 5.3518,
"mean_token_accuracy": 0.17050424665212632,
"num_tokens": 20161877.0,
"step": 11615
},
{
"entropy": 5.45561637878418,
"epoch": 0.9041042598716204,
"grad_norm": 1.5703125,
"learning_rate": 0.000492344306131981,
"loss": 5.3213,
"mean_token_accuracy": 0.17042506337165833,
"num_tokens": 20169922.0,
"step": 11620
},
{
"entropy": 5.466183853149414,
"epoch": 0.9044932892433378,
"grad_norm": 1.3359375,
"learning_rate": 0.0004923371362177272,
"loss": 5.3535,
"mean_token_accuracy": 0.16962634325027465,
"num_tokens": 20177780.0,
"step": 11625
},
{
"entropy": 5.558832311630249,
"epoch": 0.9048823186150554,
"grad_norm": 1.4140625,
"learning_rate": 0.0004923299630057284,
"loss": 5.3618,
"mean_token_accuracy": 0.1693778559565544,
"num_tokens": 20186303.0,
"step": 11630
},
{
"entropy": 5.484474754333496,
"epoch": 0.905271347986773,
"grad_norm": 1.4765625,
"learning_rate": 0.0004923227864960934,
"loss": 5.3436,
"mean_token_accuracy": 0.1737839788198471,
"num_tokens": 20194042.0,
"step": 11635
},
{
"entropy": 5.429728555679321,
"epoch": 0.9056603773584906,
"grad_norm": 1.796875,
"learning_rate": 0.000492315606688931,
"loss": 5.3524,
"mean_token_accuracy": 0.16970919370651244,
"num_tokens": 20202929.0,
"step": 11640
},
{
"entropy": 5.542688322067261,
"epoch": 0.9060494067302082,
"grad_norm": 1.453125,
"learning_rate": 0.0004923084235843501,
"loss": 5.3994,
"mean_token_accuracy": 0.16830789297819138,
"num_tokens": 20210864.0,
"step": 11645
},
{
"entropy": 5.619127178192139,
"epoch": 0.9064384361019256,
"grad_norm": 1.9375,
"learning_rate": 0.0004923012371824598,
"loss": 5.4096,
"mean_token_accuracy": 0.16993769407272338,
"num_tokens": 20219390.0,
"step": 11650
},
{
"entropy": 5.51544713973999,
"epoch": 0.9068274654736432,
"grad_norm": 1.5546875,
"learning_rate": 0.000492294047483369,
"loss": 5.3352,
"mean_token_accuracy": 0.17380872666835784,
"num_tokens": 20227241.0,
"step": 11655
},
{
"entropy": 5.497108030319214,
"epoch": 0.9072164948453608,
"grad_norm": 1.5390625,
"learning_rate": 0.0004922868544871869,
"loss": 5.5019,
"mean_token_accuracy": 0.16477687805891036,
"num_tokens": 20236001.0,
"step": 11660
},
{
"entropy": 5.661060237884522,
"epoch": 0.9076055242170784,
"grad_norm": 1.5390625,
"learning_rate": 0.0004922796581940227,
"loss": 5.4026,
"mean_token_accuracy": 0.166934534907341,
"num_tokens": 20244316.0,
"step": 11665
},
{
"entropy": 5.536293363571167,
"epoch": 0.907994553588796,
"grad_norm": 1.484375,
"learning_rate": 0.0004922724586039855,
"loss": 5.3503,
"mean_token_accuracy": 0.1758762553334236,
"num_tokens": 20252693.0,
"step": 11670
},
{
"entropy": 5.491916370391846,
"epoch": 0.9083835829605135,
"grad_norm": 1.828125,
"learning_rate": 0.0004922652557171846,
"loss": 5.4219,
"mean_token_accuracy": 0.16736511141061783,
"num_tokens": 20262252.0,
"step": 11675
},
{
"entropy": 5.526864671707154,
"epoch": 0.9087726123322311,
"grad_norm": 1.484375,
"learning_rate": 0.0004922580495337292,
"loss": 5.2747,
"mean_token_accuracy": 0.17781864255666732,
"num_tokens": 20270755.0,
"step": 11680
},
{
"entropy": 5.525045871734619,
"epoch": 0.9091616417039486,
"grad_norm": 1.4375,
"learning_rate": 0.0004922508400537288,
"loss": 5.3499,
"mean_token_accuracy": 0.16931665539741517,
"num_tokens": 20278739.0,
"step": 11685
},
{
"entropy": 5.5669698238372805,
"epoch": 0.9095506710756662,
"grad_norm": 1.3671875,
"learning_rate": 0.0004922436272772926,
"loss": 5.4908,
"mean_token_accuracy": 0.15875268131494522,
"num_tokens": 20288160.0,
"step": 11690
},
{
"entropy": 5.551499748229981,
"epoch": 0.9099397004473838,
"grad_norm": 1.6796875,
"learning_rate": 0.0004922364112045301,
"loss": 5.4334,
"mean_token_accuracy": 0.16487108469009398,
"num_tokens": 20296730.0,
"step": 11695
},
{
"entropy": 5.515936851501465,
"epoch": 0.9103287298191013,
"grad_norm": 1.4296875,
"learning_rate": 0.000492229191835551,
"loss": 5.3751,
"mean_token_accuracy": 0.16235080659389495,
"num_tokens": 20305941.0,
"step": 11700
},
{
"entropy": 5.529587936401367,
"epoch": 0.9107177591908189,
"grad_norm": 2.1875,
"learning_rate": 0.0004922219691704645,
"loss": 5.3846,
"mean_token_accuracy": 0.1715839296579361,
"num_tokens": 20314081.0,
"step": 11705
},
{
"entropy": 5.610342073440552,
"epoch": 0.9111067885625365,
"grad_norm": 1.4765625,
"learning_rate": 0.0004922147432093805,
"loss": 5.4341,
"mean_token_accuracy": 0.16086156964302062,
"num_tokens": 20323004.0,
"step": 11710
},
{
"entropy": 5.559319114685058,
"epoch": 0.911495817934254,
"grad_norm": 1.8828125,
"learning_rate": 0.0004922075139524083,
"loss": 5.3605,
"mean_token_accuracy": 0.16922397166490555,
"num_tokens": 20331122.0,
"step": 11715
},
{
"entropy": 5.502468490600586,
"epoch": 0.9118848473059716,
"grad_norm": 1.4375,
"learning_rate": 0.000492200281399658,
"loss": 5.425,
"mean_token_accuracy": 0.1607287809252739,
"num_tokens": 20339602.0,
"step": 11720
},
{
"entropy": 5.541914367675782,
"epoch": 0.9122738766776891,
"grad_norm": 1.4140625,
"learning_rate": 0.000492193045551239,
"loss": 5.3133,
"mean_token_accuracy": 0.16714433431625367,
"num_tokens": 20348431.0,
"step": 11725
},
{
"entropy": 5.469029664993286,
"epoch": 0.9126629060494067,
"grad_norm": 1.40625,
"learning_rate": 0.0004921858064072612,
"loss": 5.3583,
"mean_token_accuracy": 0.16788104325532913,
"num_tokens": 20357235.0,
"step": 11730
},
{
"entropy": 5.557778263092041,
"epoch": 0.9130519354211243,
"grad_norm": 1.53125,
"learning_rate": 0.0004921785639678347,
"loss": 5.3089,
"mean_token_accuracy": 0.1702603742480278,
"num_tokens": 20366169.0,
"step": 11735
},
{
"entropy": 5.580132293701172,
"epoch": 0.9134409647928419,
"grad_norm": 1.5234375,
"learning_rate": 0.000492171318233069,
"loss": 5.3956,
"mean_token_accuracy": 0.16502324044704436,
"num_tokens": 20375213.0,
"step": 11740
},
{
"entropy": 5.501100635528564,
"epoch": 0.9138299941645595,
"grad_norm": 1.375,
"learning_rate": 0.0004921640692030742,
"loss": 5.3957,
"mean_token_accuracy": 0.17093413323163986,
"num_tokens": 20383992.0,
"step": 11745
},
{
"entropy": 5.539239454269409,
"epoch": 0.914219023536277,
"grad_norm": 1.375,
"learning_rate": 0.0004921568168779603,
"loss": 5.3631,
"mean_token_accuracy": 0.1754248708486557,
"num_tokens": 20392318.0,
"step": 11750
},
{
"entropy": 5.664598751068115,
"epoch": 0.9146080529079945,
"grad_norm": 1.5234375,
"learning_rate": 0.0004921495612578374,
"loss": 5.5079,
"mean_token_accuracy": 0.16295591592788697,
"num_tokens": 20401556.0,
"step": 11755
},
{
"entropy": 5.5183642387390135,
"epoch": 0.9149970822797121,
"grad_norm": 1.5859375,
"learning_rate": 0.0004921423023428156,
"loss": 5.3778,
"mean_token_accuracy": 0.163390851020813,
"num_tokens": 20410480.0,
"step": 11760
},
{
"entropy": 5.490876150131226,
"epoch": 0.9153861116514297,
"grad_norm": 1.453125,
"learning_rate": 0.0004921350401330049,
"loss": 5.339,
"mean_token_accuracy": 0.16899747252464295,
"num_tokens": 20419748.0,
"step": 11765
},
{
"entropy": 5.57486310005188,
"epoch": 0.9157751410231473,
"grad_norm": 1.6015625,
"learning_rate": 0.0004921277746285155,
"loss": 5.4046,
"mean_token_accuracy": 0.1624474048614502,
"num_tokens": 20429552.0,
"step": 11770
},
{
"entropy": 5.694101572036743,
"epoch": 0.9161641703948649,
"grad_norm": 1.3671875,
"learning_rate": 0.0004921205058294579,
"loss": 5.4704,
"mean_token_accuracy": 0.16239598095417024,
"num_tokens": 20438476.0,
"step": 11775
},
{
"entropy": 5.508808708190918,
"epoch": 0.9165531997665823,
"grad_norm": 1.5234375,
"learning_rate": 0.000492113233735942,
"loss": 5.2657,
"mean_token_accuracy": 0.17543971985578538,
"num_tokens": 20447035.0,
"step": 11780
},
{
"entropy": 5.542420816421509,
"epoch": 0.9169422291382999,
"grad_norm": 1.6640625,
"learning_rate": 0.0004921059583480785,
"loss": 5.4246,
"mean_token_accuracy": 0.16850287169218064,
"num_tokens": 20456200.0,
"step": 11785
},
{
"entropy": 5.567418813705444,
"epoch": 0.9173312585100175,
"grad_norm": 1.3515625,
"learning_rate": 0.0004920986796659775,
"loss": 5.4295,
"mean_token_accuracy": 0.17314960211515426,
"num_tokens": 20465444.0,
"step": 11790
},
{
"entropy": 5.523631477355957,
"epoch": 0.9177202878817351,
"grad_norm": 1.4140625,
"learning_rate": 0.0004920913976897498,
"loss": 5.3068,
"mean_token_accuracy": 0.17249808013439177,
"num_tokens": 20473851.0,
"step": 11795
},
{
"entropy": 5.550854825973511,
"epoch": 0.9181093172534527,
"grad_norm": 1.265625,
"learning_rate": 0.0004920841124195055,
"loss": 5.4061,
"mean_token_accuracy": 0.16749586164951324,
"num_tokens": 20482232.0,
"step": 11800
},
{
"entropy": 5.479307842254639,
"epoch": 0.9184983466251702,
"grad_norm": 1.34375,
"learning_rate": 0.0004920768238553554,
"loss": 5.2966,
"mean_token_accuracy": 0.18034131079912186,
"num_tokens": 20490498.0,
"step": 11805
},
{
"entropy": 5.478506565093994,
"epoch": 0.9188873759968877,
"grad_norm": 1.5,
"learning_rate": 0.0004920695319974099,
"loss": 5.3633,
"mean_token_accuracy": 0.16815510243177414,
"num_tokens": 20499125.0,
"step": 11810
},
{
"entropy": 5.590223217010498,
"epoch": 0.9192764053686053,
"grad_norm": 1.359375,
"learning_rate": 0.0004920622368457798,
"loss": 5.5452,
"mean_token_accuracy": 0.15663281828165054,
"num_tokens": 20507665.0,
"step": 11815
},
{
"entropy": 5.620478248596191,
"epoch": 0.9196654347403229,
"grad_norm": 1.5,
"learning_rate": 0.0004920549384005759,
"loss": 5.4366,
"mean_token_accuracy": 0.16730313748121262,
"num_tokens": 20516509.0,
"step": 11820
},
{
"entropy": 5.6098487854003904,
"epoch": 0.9200544641120405,
"grad_norm": 1.4921875,
"learning_rate": 0.0004920476366619086,
"loss": 5.4763,
"mean_token_accuracy": 0.16809720396995545,
"num_tokens": 20524830.0,
"step": 11825
},
{
"entropy": 5.527750015258789,
"epoch": 0.920443493483758,
"grad_norm": 1.4375,
"learning_rate": 0.000492040331629889,
"loss": 5.3625,
"mean_token_accuracy": 0.16703199446201325,
"num_tokens": 20533746.0,
"step": 11830
},
{
"entropy": 5.542729473114013,
"epoch": 0.9208325228554756,
"grad_norm": 1.296875,
"learning_rate": 0.0004920330233046277,
"loss": 5.3331,
"mean_token_accuracy": 0.17348472625017167,
"num_tokens": 20542350.0,
"step": 11835
},
{
"entropy": 5.575383043289184,
"epoch": 0.9212215522271932,
"grad_norm": 1.6875,
"learning_rate": 0.0004920257116862359,
"loss": 5.474,
"mean_token_accuracy": 0.16687478721141816,
"num_tokens": 20551670.0,
"step": 11840
},
{
"entropy": 5.589216423034668,
"epoch": 0.9216105815989107,
"grad_norm": 1.3984375,
"learning_rate": 0.0004920183967748241,
"loss": 5.4,
"mean_token_accuracy": 0.1685417965054512,
"num_tokens": 20560692.0,
"step": 11845
},
{
"entropy": 5.578690719604492,
"epoch": 0.9219996109706283,
"grad_norm": 1.546875,
"learning_rate": 0.0004920110785705037,
"loss": 5.351,
"mean_token_accuracy": 0.16806455105543136,
"num_tokens": 20569262.0,
"step": 11850
},
{
"entropy": 5.501679229736328,
"epoch": 0.9223886403423458,
"grad_norm": 1.4921875,
"learning_rate": 0.0004920037570733857,
"loss": 5.3656,
"mean_token_accuracy": 0.17025428265333176,
"num_tokens": 20577850.0,
"step": 11855
},
{
"entropy": 5.53700590133667,
"epoch": 0.9227776697140634,
"grad_norm": 1.3671875,
"learning_rate": 0.0004919964322835809,
"loss": 5.4376,
"mean_token_accuracy": 0.1631557360291481,
"num_tokens": 20587021.0,
"step": 11860
},
{
"entropy": 5.590654373168945,
"epoch": 0.923166699085781,
"grad_norm": 1.40625,
"learning_rate": 0.0004919891042012006,
"loss": 5.3728,
"mean_token_accuracy": 0.1707693710923195,
"num_tokens": 20594631.0,
"step": 11865
},
{
"entropy": 5.496949577331543,
"epoch": 0.9235557284574986,
"grad_norm": 1.46875,
"learning_rate": 0.0004919817728263562,
"loss": 5.2909,
"mean_token_accuracy": 0.1699821799993515,
"num_tokens": 20602765.0,
"step": 11870
},
{
"entropy": 5.575145959854126,
"epoch": 0.9239447578292161,
"grad_norm": 1.5078125,
"learning_rate": 0.0004919744381591586,
"loss": 5.433,
"mean_token_accuracy": 0.17425196319818498,
"num_tokens": 20611350.0,
"step": 11875
},
{
"entropy": 5.557479476928711,
"epoch": 0.9243337872009336,
"grad_norm": 1.5,
"learning_rate": 0.0004919671001997193,
"loss": 5.344,
"mean_token_accuracy": 0.17579306066036224,
"num_tokens": 20620201.0,
"step": 11880
},
{
"entropy": 5.577688121795655,
"epoch": 0.9247228165726512,
"grad_norm": 1.6015625,
"learning_rate": 0.0004919597589481497,
"loss": 5.4324,
"mean_token_accuracy": 0.16765122562646867,
"num_tokens": 20627870.0,
"step": 11885
},
{
"entropy": 5.540508365631103,
"epoch": 0.9251118459443688,
"grad_norm": 1.8203125,
"learning_rate": 0.000491952414404561,
"loss": 5.3966,
"mean_token_accuracy": 0.1689246952533722,
"num_tokens": 20635894.0,
"step": 11890
},
{
"entropy": 5.61571774482727,
"epoch": 0.9255008753160864,
"grad_norm": 1.4375,
"learning_rate": 0.0004919450665690646,
"loss": 5.4535,
"mean_token_accuracy": 0.17070710957050322,
"num_tokens": 20644091.0,
"step": 11895
},
{
"entropy": 5.614666843414307,
"epoch": 0.925889904687804,
"grad_norm": 1.4140625,
"learning_rate": 0.0004919377154417724,
"loss": 5.3161,
"mean_token_accuracy": 0.17163473516702651,
"num_tokens": 20651994.0,
"step": 11900
},
{
"entropy": 5.4973626136779785,
"epoch": 0.9262789340595214,
"grad_norm": 1.484375,
"learning_rate": 0.0004919303610227954,
"loss": 5.3427,
"mean_token_accuracy": 0.16905196607112885,
"num_tokens": 20660192.0,
"step": 11905
},
{
"entropy": 5.626149225234985,
"epoch": 0.926667963431239,
"grad_norm": 1.5234375,
"learning_rate": 0.0004919230033122457,
"loss": 5.4056,
"mean_token_accuracy": 0.1687226414680481,
"num_tokens": 20668275.0,
"step": 11910
},
{
"entropy": 5.482329082489014,
"epoch": 0.9270569928029566,
"grad_norm": 1.3984375,
"learning_rate": 0.0004919156423102345,
"loss": 5.3826,
"mean_token_accuracy": 0.16945904791355132,
"num_tokens": 20676936.0,
"step": 11915
},
{
"entropy": 5.5744280338287355,
"epoch": 0.9274460221746742,
"grad_norm": 1.3515625,
"learning_rate": 0.0004919082780168736,
"loss": 5.5024,
"mean_token_accuracy": 0.1619183152914047,
"num_tokens": 20685600.0,
"step": 11920
},
{
"entropy": 5.571272230148315,
"epoch": 0.9278350515463918,
"grad_norm": 1.546875,
"learning_rate": 0.0004919009104322751,
"loss": 5.4194,
"mean_token_accuracy": 0.16548635065555573,
"num_tokens": 20693714.0,
"step": 11925
},
{
"entropy": 5.5382568359375,
"epoch": 0.9282240809181093,
"grad_norm": 1.625,
"learning_rate": 0.0004918935395565503,
"loss": 5.4041,
"mean_token_accuracy": 0.1636177897453308,
"num_tokens": 20702529.0,
"step": 11930
},
{
"entropy": 5.537384748458862,
"epoch": 0.9286131102898268,
"grad_norm": 1.3671875,
"learning_rate": 0.0004918861653898113,
"loss": 5.3346,
"mean_token_accuracy": 0.16773627400398256,
"num_tokens": 20711775.0,
"step": 11935
},
{
"entropy": 5.599783563613892,
"epoch": 0.9290021396615444,
"grad_norm": 1.515625,
"learning_rate": 0.0004918787879321701,
"loss": 5.3819,
"mean_token_accuracy": 0.17063708007335662,
"num_tokens": 20720653.0,
"step": 11940
},
{
"entropy": 5.522376585006714,
"epoch": 0.929391169033262,
"grad_norm": 1.4609375,
"learning_rate": 0.0004918714071837384,
"loss": 5.3895,
"mean_token_accuracy": 0.1673469364643097,
"num_tokens": 20729208.0,
"step": 11945
},
{
"entropy": 5.610297393798828,
"epoch": 0.9297801984049796,
"grad_norm": 1.65625,
"learning_rate": 0.0004918640231446282,
"loss": 5.4512,
"mean_token_accuracy": 0.16779119819402694,
"num_tokens": 20738670.0,
"step": 11950
},
{
"entropy": 5.6242156505584715,
"epoch": 0.9301692277766972,
"grad_norm": 1.7734375,
"learning_rate": 0.0004918566358149517,
"loss": 5.5074,
"mean_token_accuracy": 0.16253920048475265,
"num_tokens": 20748315.0,
"step": 11955
},
{
"entropy": 5.6387773036956785,
"epoch": 0.9305582571484147,
"grad_norm": 1.3984375,
"learning_rate": 0.000491849245194821,
"loss": 5.5657,
"mean_token_accuracy": 0.16133267283439637,
"num_tokens": 20757623.0,
"step": 11960
},
{
"entropy": 5.634545612335205,
"epoch": 0.9309472865201323,
"grad_norm": 1.4453125,
"learning_rate": 0.0004918418512843479,
"loss": 5.3923,
"mean_token_accuracy": 0.16616931408643723,
"num_tokens": 20765817.0,
"step": 11965
},
{
"entropy": 5.511015701293945,
"epoch": 0.9313363158918498,
"grad_norm": 1.53125,
"learning_rate": 0.0004918344540836451,
"loss": 5.2564,
"mean_token_accuracy": 0.17636050879955292,
"num_tokens": 20773931.0,
"step": 11970
},
{
"entropy": 5.595106077194214,
"epoch": 0.9317253452635674,
"grad_norm": 1.5390625,
"learning_rate": 0.0004918270535928244,
"loss": 5.4069,
"mean_token_accuracy": 0.16532163172960282,
"num_tokens": 20782652.0,
"step": 11975
},
{
"entropy": 5.491355609893799,
"epoch": 0.932114374635285,
"grad_norm": 1.3828125,
"learning_rate": 0.0004918196498119984,
"loss": 5.3049,
"mean_token_accuracy": 0.17544931769371033,
"num_tokens": 20791293.0,
"step": 11980
},
{
"entropy": 5.514186239242553,
"epoch": 0.9325034040070025,
"grad_norm": 1.4609375,
"learning_rate": 0.0004918122427412793,
"loss": 5.4302,
"mean_token_accuracy": 0.16274045556783676,
"num_tokens": 20800317.0,
"step": 11985
},
{
"entropy": 5.584352254867554,
"epoch": 0.9328924333787201,
"grad_norm": 1.3671875,
"learning_rate": 0.0004918048323807795,
"loss": 5.3986,
"mean_token_accuracy": 0.17177387177944184,
"num_tokens": 20809231.0,
"step": 11990
},
{
"entropy": 5.607217788696289,
"epoch": 0.9332814627504377,
"grad_norm": 1.4296875,
"learning_rate": 0.0004917974187306114,
"loss": 5.322,
"mean_token_accuracy": 0.1658833995461464,
"num_tokens": 20818327.0,
"step": 11995
},
{
"entropy": 5.578121280670166,
"epoch": 0.9336704921221552,
"grad_norm": 1.4375,
"learning_rate": 0.0004917900017908875,
"loss": 5.4827,
"mean_token_accuracy": 0.16153437048196792,
"num_tokens": 20826995.0,
"step": 12000
},
{
"epoch": 0.9336704921221552,
"eval_entropy": 5.388003500937498,
"eval_loss": 5.445855617523193,
"eval_mean_token_accuracy": 0.17358772557110483,
"eval_num_tokens": 20826995.0,
"eval_runtime": 28.4412,
"eval_samples_per_second": 1461.19,
"eval_steps_per_second": 182.658,
"step": 12000
},
{
"entropy": 5.44256477355957,
"epoch": 0.9340595214938728,
"grad_norm": 1.5234375,
"learning_rate": 0.0004917825815617205,
"loss": 5.1973,
"mean_token_accuracy": 0.18006435185670852,
"num_tokens": 20835641.0,
"step": 12005
},
{
"entropy": 5.585927867889405,
"epoch": 0.9344485508655903,
"grad_norm": 1.5703125,
"learning_rate": 0.0004917751580432229,
"loss": 5.3558,
"mean_token_accuracy": 0.167583367228508,
"num_tokens": 20844728.0,
"step": 12010
},
{
"entropy": 5.514683628082276,
"epoch": 0.9348375802373079,
"grad_norm": 1.4296875,
"learning_rate": 0.0004917677312355072,
"loss": 5.3194,
"mean_token_accuracy": 0.17395581305027008,
"num_tokens": 20853013.0,
"step": 12015
},
{
"entropy": 5.601926612854004,
"epoch": 0.9352266096090255,
"grad_norm": 1.5625,
"learning_rate": 0.0004917603011386863,
"loss": 5.4143,
"mean_token_accuracy": 0.16894597858190535,
"num_tokens": 20861592.0,
"step": 12020
},
{
"entropy": 5.533649015426636,
"epoch": 0.9356156389807431,
"grad_norm": 1.4765625,
"learning_rate": 0.0004917528677528727,
"loss": 5.3721,
"mean_token_accuracy": 0.17113135308027266,
"num_tokens": 20869645.0,
"step": 12025
},
{
"entropy": 5.5597740650177006,
"epoch": 0.9360046683524607,
"grad_norm": 1.546875,
"learning_rate": 0.0004917454310781795,
"loss": 5.4124,
"mean_token_accuracy": 0.1685989484190941,
"num_tokens": 20878154.0,
"step": 12030
},
{
"entropy": 5.578198862075806,
"epoch": 0.9363936977241781,
"grad_norm": 1.546875,
"learning_rate": 0.0004917379911147193,
"loss": 5.3555,
"mean_token_accuracy": 0.1777196228504181,
"num_tokens": 20886260.0,
"step": 12035
},
{
"entropy": 5.535090684890747,
"epoch": 0.9367827270958957,
"grad_norm": 1.5546875,
"learning_rate": 0.0004917305478626049,
"loss": 5.3239,
"mean_token_accuracy": 0.17040987089276313,
"num_tokens": 20895688.0,
"step": 12040
},
{
"entropy": 5.5670891284942625,
"epoch": 0.9371717564676133,
"grad_norm": 1.4921875,
"learning_rate": 0.0004917231013219495,
"loss": 5.4416,
"mean_token_accuracy": 0.16440101116895675,
"num_tokens": 20903904.0,
"step": 12045
},
{
"entropy": 5.601820993423462,
"epoch": 0.9375607858393309,
"grad_norm": 1.359375,
"learning_rate": 0.000491715651492866,
"loss": 5.4587,
"mean_token_accuracy": 0.16410596370697023,
"num_tokens": 20913411.0,
"step": 12050
},
{
"entropy": 5.594565439224243,
"epoch": 0.9379498152110485,
"grad_norm": 1.46875,
"learning_rate": 0.0004917081983754675,
"loss": 5.404,
"mean_token_accuracy": 0.16168863624334334,
"num_tokens": 20922088.0,
"step": 12055
},
{
"entropy": 5.4826037883758545,
"epoch": 0.938338844582766,
"grad_norm": 1.5546875,
"learning_rate": 0.0004917007419698669,
"loss": 5.3958,
"mean_token_accuracy": 0.16772531494498252,
"num_tokens": 20930879.0,
"step": 12060
},
{
"entropy": 5.551362752914429,
"epoch": 0.9387278739544835,
"grad_norm": 1.3671875,
"learning_rate": 0.0004916932822761776,
"loss": 5.3513,
"mean_token_accuracy": 0.1729399546980858,
"num_tokens": 20939092.0,
"step": 12065
},
{
"entropy": 5.527021694183349,
"epoch": 0.9391169033262011,
"grad_norm": 1.75,
"learning_rate": 0.0004916858192945126,
"loss": 5.4036,
"mean_token_accuracy": 0.1687800630927086,
"num_tokens": 20947599.0,
"step": 12070
},
{
"entropy": 5.582270336151123,
"epoch": 0.9395059326979187,
"grad_norm": 1.46875,
"learning_rate": 0.0004916783530249852,
"loss": 5.4509,
"mean_token_accuracy": 0.16832178384065627,
"num_tokens": 20955725.0,
"step": 12075
},
{
"entropy": 5.503492927551269,
"epoch": 0.9398949620696363,
"grad_norm": 1.4140625,
"learning_rate": 0.0004916708834677086,
"loss": 5.283,
"mean_token_accuracy": 0.17304554879665374,
"num_tokens": 20965040.0,
"step": 12080
},
{
"entropy": 5.61143307685852,
"epoch": 0.9402839914413538,
"grad_norm": 1.4140625,
"learning_rate": 0.0004916634106227962,
"loss": 5.432,
"mean_token_accuracy": 0.16256042420864106,
"num_tokens": 20974204.0,
"step": 12085
},
{
"entropy": 5.621157455444336,
"epoch": 0.9406730208130714,
"grad_norm": 1.640625,
"learning_rate": 0.0004916559344903614,
"loss": 5.4062,
"mean_token_accuracy": 0.16993506103754044,
"num_tokens": 20982109.0,
"step": 12090
},
{
"entropy": 5.516245412826538,
"epoch": 0.941062050184789,
"grad_norm": 1.484375,
"learning_rate": 0.0004916484550705176,
"loss": 5.4397,
"mean_token_accuracy": 0.1644568085670471,
"num_tokens": 20990375.0,
"step": 12095
},
{
"entropy": 5.527275609970093,
"epoch": 0.9414510795565065,
"grad_norm": 1.7265625,
"learning_rate": 0.0004916409723633785,
"loss": 5.4395,
"mean_token_accuracy": 0.16648600846529008,
"num_tokens": 20998535.0,
"step": 12100
},
{
"entropy": 5.479147624969483,
"epoch": 0.9418401089282241,
"grad_norm": 1.640625,
"learning_rate": 0.0004916334863690573,
"loss": 5.2937,
"mean_token_accuracy": 0.1718555822968483,
"num_tokens": 21006597.0,
"step": 12105
},
{
"entropy": 5.516942644119263,
"epoch": 0.9422291382999416,
"grad_norm": 1.7109375,
"learning_rate": 0.0004916259970876678,
"loss": 5.3777,
"mean_token_accuracy": 0.17228891104459762,
"num_tokens": 21015498.0,
"step": 12110
},
{
"entropy": 5.622916603088379,
"epoch": 0.9426181676716592,
"grad_norm": 1.8203125,
"learning_rate": 0.0004916185045193237,
"loss": 5.4073,
"mean_token_accuracy": 0.16307393610477447,
"num_tokens": 21024090.0,
"step": 12115
},
{
"entropy": 5.652024269104004,
"epoch": 0.9430071970433768,
"grad_norm": 1.59375,
"learning_rate": 0.0004916110086641384,
"loss": 5.4296,
"mean_token_accuracy": 0.1620110884308815,
"num_tokens": 21032928.0,
"step": 12120
},
{
"entropy": 5.633784532546997,
"epoch": 0.9433962264150944,
"grad_norm": 1.6796875,
"learning_rate": 0.0004916035095222259,
"loss": 5.4832,
"mean_token_accuracy": 0.16601784080266951,
"num_tokens": 21041467.0,
"step": 12125
},
{
"entropy": 5.525217723846436,
"epoch": 0.9437852557868119,
"grad_norm": 1.4921875,
"learning_rate": 0.0004915960070936999,
"loss": 5.413,
"mean_token_accuracy": 0.17504813224077226,
"num_tokens": 21049325.0,
"step": 12130
},
{
"entropy": 5.597278642654419,
"epoch": 0.9441742851585294,
"grad_norm": 1.8046875,
"learning_rate": 0.0004915885013786742,
"loss": 5.463,
"mean_token_accuracy": 0.16030641943216323,
"num_tokens": 21057911.0,
"step": 12135
},
{
"entropy": 5.639433288574219,
"epoch": 0.944563314530247,
"grad_norm": 1.5546875,
"learning_rate": 0.0004915809923772628,
"loss": 5.4652,
"mean_token_accuracy": 0.15780694037675858,
"num_tokens": 21066974.0,
"step": 12140
},
{
"entropy": 5.57930326461792,
"epoch": 0.9449523439019646,
"grad_norm": 1.5703125,
"learning_rate": 0.0004915734800895796,
"loss": 5.3738,
"mean_token_accuracy": 0.16594722718000413,
"num_tokens": 21075591.0,
"step": 12145
},
{
"entropy": 5.547514152526856,
"epoch": 0.9453413732736822,
"grad_norm": 1.6015625,
"learning_rate": 0.0004915659645157383,
"loss": 5.4325,
"mean_token_accuracy": 0.16641419380903244,
"num_tokens": 21084496.0,
"step": 12150
},
{
"entropy": 5.559930515289307,
"epoch": 0.9457304026453998,
"grad_norm": 1.3671875,
"learning_rate": 0.0004915584456558535,
"loss": 5.327,
"mean_token_accuracy": 0.1706374853849411,
"num_tokens": 21092811.0,
"step": 12155
},
{
"entropy": 5.554985237121582,
"epoch": 0.9461194320171173,
"grad_norm": 1.828125,
"learning_rate": 0.0004915509235100388,
"loss": 5.3706,
"mean_token_accuracy": 0.1755172312259674,
"num_tokens": 21101449.0,
"step": 12160
},
{
"entropy": 5.658511829376221,
"epoch": 0.9465084613888348,
"grad_norm": 1.4921875,
"learning_rate": 0.0004915433980784086,
"loss": 5.4903,
"mean_token_accuracy": 0.1588090181350708,
"num_tokens": 21109476.0,
"step": 12165
},
{
"entropy": 5.559300708770752,
"epoch": 0.9468974907605524,
"grad_norm": 1.5625,
"learning_rate": 0.0004915358693610769,
"loss": 5.4089,
"mean_token_accuracy": 0.16485532820224763,
"num_tokens": 21118431.0,
"step": 12170
},
{
"entropy": 5.491687250137329,
"epoch": 0.94728652013227,
"grad_norm": 1.5234375,
"learning_rate": 0.0004915283373581581,
"loss": 5.3505,
"mean_token_accuracy": 0.16730640530586244,
"num_tokens": 21127390.0,
"step": 12175
},
{
"entropy": 5.615506315231324,
"epoch": 0.9476755495039876,
"grad_norm": 1.4140625,
"learning_rate": 0.0004915208020697664,
"loss": 5.4768,
"mean_token_accuracy": 0.16488441675901414,
"num_tokens": 21136323.0,
"step": 12180
},
{
"entropy": 5.530043601989746,
"epoch": 0.9480645788757052,
"grad_norm": 1.4609375,
"learning_rate": 0.0004915132634960162,
"loss": 5.4156,
"mean_token_accuracy": 0.17036765515804292,
"num_tokens": 21145228.0,
"step": 12185
},
{
"entropy": 5.5894242286682125,
"epoch": 0.9484536082474226,
"grad_norm": 1.3984375,
"learning_rate": 0.0004915057216370218,
"loss": 5.3128,
"mean_token_accuracy": 0.17234140187501906,
"num_tokens": 21153288.0,
"step": 12190
},
{
"entropy": 5.554346179962158,
"epoch": 0.9488426376191402,
"grad_norm": 1.5,
"learning_rate": 0.0004914981764928977,
"loss": 5.3784,
"mean_token_accuracy": 0.17709745466709137,
"num_tokens": 21161802.0,
"step": 12195
},
{
"entropy": 5.5001016616821286,
"epoch": 0.9492316669908578,
"grad_norm": 1.6875,
"learning_rate": 0.0004914906280637584,
"loss": 5.3102,
"mean_token_accuracy": 0.17752815634012223,
"num_tokens": 21170018.0,
"step": 12200
},
{
"entropy": 5.641617250442505,
"epoch": 0.9496206963625754,
"grad_norm": 1.390625,
"learning_rate": 0.0004914830763497183,
"loss": 5.5303,
"mean_token_accuracy": 0.15591267943382264,
"num_tokens": 21179128.0,
"step": 12205
},
{
"entropy": 5.62851300239563,
"epoch": 0.950009725734293,
"grad_norm": 1.5625,
"learning_rate": 0.0004914755213508922,
"loss": 5.3513,
"mean_token_accuracy": 0.17078163027763366,
"num_tokens": 21188138.0,
"step": 12210
},
{
"entropy": 5.589785194396972,
"epoch": 0.9503987551060105,
"grad_norm": 1.4765625,
"learning_rate": 0.0004914679630673945,
"loss": 5.4201,
"mean_token_accuracy": 0.1664300560951233,
"num_tokens": 21196465.0,
"step": 12215
},
{
"entropy": 5.497233819961548,
"epoch": 0.950787784477728,
"grad_norm": 1.5234375,
"learning_rate": 0.0004914604014993401,
"loss": 5.3496,
"mean_token_accuracy": 0.16689626425504683,
"num_tokens": 21205309.0,
"step": 12220
},
{
"entropy": 5.503593921661377,
"epoch": 0.9511768138494456,
"grad_norm": 1.5390625,
"learning_rate": 0.0004914528366468436,
"loss": 5.3018,
"mean_token_accuracy": 0.17624219954013826,
"num_tokens": 21214216.0,
"step": 12225
},
{
"entropy": 5.516157102584839,
"epoch": 0.9515658432211632,
"grad_norm": 1.421875,
"learning_rate": 0.0004914452685100199,
"loss": 5.3294,
"mean_token_accuracy": 0.17359803915023803,
"num_tokens": 21222246.0,
"step": 12230
},
{
"entropy": 5.561765098571778,
"epoch": 0.9519548725928808,
"grad_norm": 1.515625,
"learning_rate": 0.0004914376970889836,
"loss": 5.3972,
"mean_token_accuracy": 0.1665797770023346,
"num_tokens": 21230696.0,
"step": 12235
},
{
"entropy": 5.59852614402771,
"epoch": 0.9523439019645983,
"grad_norm": 1.515625,
"learning_rate": 0.0004914301223838497,
"loss": 5.5024,
"mean_token_accuracy": 0.1625322848558426,
"num_tokens": 21239909.0,
"step": 12240
},
{
"entropy": 5.513423013687134,
"epoch": 0.9527329313363159,
"grad_norm": 1.484375,
"learning_rate": 0.0004914225443947334,
"loss": 5.3579,
"mean_token_accuracy": 0.1661682590842247,
"num_tokens": 21248124.0,
"step": 12245
},
{
"entropy": 5.6989874839782715,
"epoch": 0.9531219607080335,
"grad_norm": 1.3203125,
"learning_rate": 0.0004914149631217494,
"loss": 5.5398,
"mean_token_accuracy": 0.15586884468793868,
"num_tokens": 21257042.0,
"step": 12250
},
{
"entropy": 5.656883668899536,
"epoch": 0.953510990079751,
"grad_norm": 1.203125,
"learning_rate": 0.0004914073785650127,
"loss": 5.4641,
"mean_token_accuracy": 0.16630377620458603,
"num_tokens": 21265627.0,
"step": 12255
},
{
"entropy": 5.542170810699463,
"epoch": 0.9539000194514686,
"grad_norm": 1.3984375,
"learning_rate": 0.0004913997907246385,
"loss": 5.3805,
"mean_token_accuracy": 0.16810978800058365,
"num_tokens": 21273688.0,
"step": 12260
},
{
"entropy": 5.508345413208008,
"epoch": 0.9542890488231861,
"grad_norm": 1.28125,
"learning_rate": 0.000491392199600742,
"loss": 5.3747,
"mean_token_accuracy": 0.17054288685321808,
"num_tokens": 21283432.0,
"step": 12265
},
{
"entropy": 5.628151369094849,
"epoch": 0.9546780781949037,
"grad_norm": 1.46875,
"learning_rate": 0.0004913846051934382,
"loss": 5.4193,
"mean_token_accuracy": 0.16427808552980422,
"num_tokens": 21292003.0,
"step": 12270
},
{
"entropy": 5.5416093349456785,
"epoch": 0.9550671075666213,
"grad_norm": 1.484375,
"learning_rate": 0.0004913770075028425,
"loss": 5.3215,
"mean_token_accuracy": 0.1750449761748314,
"num_tokens": 21299914.0,
"step": 12275
},
{
"entropy": 5.540078353881836,
"epoch": 0.9554561369383389,
"grad_norm": 1.484375,
"learning_rate": 0.0004913694065290701,
"loss": 5.5363,
"mean_token_accuracy": 0.15762787610292434,
"num_tokens": 21309398.0,
"step": 12280
},
{
"entropy": 5.553359460830689,
"epoch": 0.9558451663100564,
"grad_norm": 1.5859375,
"learning_rate": 0.0004913618022722363,
"loss": 5.3742,
"mean_token_accuracy": 0.1718411311507225,
"num_tokens": 21317828.0,
"step": 12285
},
{
"entropy": 5.637666940689087,
"epoch": 0.9562341956817739,
"grad_norm": 1.515625,
"learning_rate": 0.0004913541947324566,
"loss": 5.4912,
"mean_token_accuracy": 0.16552940756082535,
"num_tokens": 21326266.0,
"step": 12290
},
{
"entropy": 5.602405786514282,
"epoch": 0.9566232250534915,
"grad_norm": 2.015625,
"learning_rate": 0.0004913465839098463,
"loss": 5.4081,
"mean_token_accuracy": 0.1617061033844948,
"num_tokens": 21335476.0,
"step": 12295
},
{
"entropy": 5.579249238967895,
"epoch": 0.9570122544252091,
"grad_norm": 1.34375,
"learning_rate": 0.0004913389698045209,
"loss": 5.3521,
"mean_token_accuracy": 0.17059026062488555,
"num_tokens": 21344045.0,
"step": 12300
},
{
"entropy": 5.5715968132019045,
"epoch": 0.9574012837969267,
"grad_norm": 1.53125,
"learning_rate": 0.000491331352416596,
"loss": 5.3857,
"mean_token_accuracy": 0.1672879621386528,
"num_tokens": 21352309.0,
"step": 12305
},
{
"entropy": 5.543367862701416,
"epoch": 0.9577903131686443,
"grad_norm": 1.4296875,
"learning_rate": 0.0004913237317461872,
"loss": 5.4259,
"mean_token_accuracy": 0.16890395283699036,
"num_tokens": 21362164.0,
"step": 12310
},
{
"entropy": 5.632788753509521,
"epoch": 0.9581793425403617,
"grad_norm": 1.4921875,
"learning_rate": 0.00049131610779341,
"loss": 5.4221,
"mean_token_accuracy": 0.16740877777338029,
"num_tokens": 21372817.0,
"step": 12315
},
{
"entropy": 5.551085567474365,
"epoch": 0.9585683719120793,
"grad_norm": 1.484375,
"learning_rate": 0.0004913084805583803,
"loss": 5.3829,
"mean_token_accuracy": 0.16717528104782103,
"num_tokens": 21381035.0,
"step": 12320
},
{
"entropy": 5.516797971725464,
"epoch": 0.9589574012837969,
"grad_norm": 1.359375,
"learning_rate": 0.0004913008500412136,
"loss": 5.3469,
"mean_token_accuracy": 0.17566467225551605,
"num_tokens": 21390074.0,
"step": 12325
},
{
"entropy": 5.588978242874146,
"epoch": 0.9593464306555145,
"grad_norm": 1.5234375,
"learning_rate": 0.0004912932162420259,
"loss": 5.4025,
"mean_token_accuracy": 0.16604723185300826,
"num_tokens": 21398726.0,
"step": 12330
},
{
"entropy": 5.579054546356201,
"epoch": 0.9597354600272321,
"grad_norm": 1.4453125,
"learning_rate": 0.0004912855791609327,
"loss": 5.3758,
"mean_token_accuracy": 0.16327784806489945,
"num_tokens": 21407225.0,
"step": 12335
},
{
"entropy": 5.4908506870269775,
"epoch": 0.9601244893989496,
"grad_norm": 1.4140625,
"learning_rate": 0.0004912779387980502,
"loss": 5.3901,
"mean_token_accuracy": 0.16156468391418458,
"num_tokens": 21416746.0,
"step": 12340
},
{
"entropy": 5.5407885074615475,
"epoch": 0.9605135187706672,
"grad_norm": 1.5703125,
"learning_rate": 0.0004912702951534942,
"loss": 5.4574,
"mean_token_accuracy": 0.15704269856214523,
"num_tokens": 21425621.0,
"step": 12345
},
{
"entropy": 5.561798906326294,
"epoch": 0.9609025481423847,
"grad_norm": 1.484375,
"learning_rate": 0.0004912626482273809,
"loss": 5.335,
"mean_token_accuracy": 0.17911162823438645,
"num_tokens": 21433674.0,
"step": 12350
},
{
"entropy": 5.577276563644409,
"epoch": 0.9612915775141023,
"grad_norm": 2.078125,
"learning_rate": 0.0004912549980198258,
"loss": 5.4178,
"mean_token_accuracy": 0.16573524475097656,
"num_tokens": 21442285.0,
"step": 12355
},
{
"entropy": 5.624950551986695,
"epoch": 0.9616806068858199,
"grad_norm": 1.765625,
"learning_rate": 0.0004912473445309455,
"loss": 5.382,
"mean_token_accuracy": 0.17169068604707718,
"num_tokens": 21450345.0,
"step": 12360
},
{
"entropy": 5.4715653419494625,
"epoch": 0.9620696362575375,
"grad_norm": 1.71875,
"learning_rate": 0.000491239687760856,
"loss": 5.2868,
"mean_token_accuracy": 0.1779909610748291,
"num_tokens": 21458618.0,
"step": 12365
},
{
"entropy": 5.475194072723388,
"epoch": 0.962458665629255,
"grad_norm": 1.4921875,
"learning_rate": 0.0004912320277096732,
"loss": 5.3258,
"mean_token_accuracy": 0.16934404969215394,
"num_tokens": 21467410.0,
"step": 12370
},
{
"entropy": 5.530296754837036,
"epoch": 0.9628476950009726,
"grad_norm": 1.4140625,
"learning_rate": 0.0004912243643775137,
"loss": 5.3804,
"mean_token_accuracy": 0.16468485593795776,
"num_tokens": 21475454.0,
"step": 12375
},
{
"entropy": 5.53042163848877,
"epoch": 0.9632367243726901,
"grad_norm": 1.53125,
"learning_rate": 0.0004912166977644936,
"loss": 5.3115,
"mean_token_accuracy": 0.17639981657266618,
"num_tokens": 21483431.0,
"step": 12380
},
{
"entropy": 5.562231969833374,
"epoch": 0.9636257537444077,
"grad_norm": 1.7109375,
"learning_rate": 0.0004912090278707293,
"loss": 5.371,
"mean_token_accuracy": 0.16846155971288682,
"num_tokens": 21491199.0,
"step": 12385
},
{
"entropy": 5.551068687438965,
"epoch": 0.9640147831161253,
"grad_norm": 1.3984375,
"learning_rate": 0.000491201354696337,
"loss": 5.4612,
"mean_token_accuracy": 0.16482184827327728,
"num_tokens": 21500339.0,
"step": 12390
},
{
"entropy": 5.578508949279785,
"epoch": 0.9644038124878428,
"grad_norm": 1.4453125,
"learning_rate": 0.0004911936782414334,
"loss": 5.3923,
"mean_token_accuracy": 0.165883569419384,
"num_tokens": 21508945.0,
"step": 12395
},
{
"entropy": 5.609786558151245,
"epoch": 0.9647928418595604,
"grad_norm": 1.4140625,
"learning_rate": 0.0004911859985061348,
"loss": 5.3756,
"mean_token_accuracy": 0.16790519058704376,
"num_tokens": 21517649.0,
"step": 12400
},
{
"entropy": 5.560817432403565,
"epoch": 0.965181871231278,
"grad_norm": 1.515625,
"learning_rate": 0.0004911783154905577,
"loss": 5.3751,
"mean_token_accuracy": 0.1683609142899513,
"num_tokens": 21526650.0,
"step": 12405
},
{
"entropy": 5.586350631713867,
"epoch": 0.9655709006029956,
"grad_norm": 1.421875,
"learning_rate": 0.0004911706291948188,
"loss": 5.3799,
"mean_token_accuracy": 0.17076589167118073,
"num_tokens": 21535401.0,
"step": 12410
},
{
"entropy": 5.6253735542297365,
"epoch": 0.9659599299747131,
"grad_norm": 1.3984375,
"learning_rate": 0.0004911629396190348,
"loss": 5.4136,
"mean_token_accuracy": 0.16528507322072983,
"num_tokens": 21543973.0,
"step": 12415
},
{
"entropy": 5.52022967338562,
"epoch": 0.9663489593464306,
"grad_norm": 1.515625,
"learning_rate": 0.0004911552467633221,
"loss": 5.3473,
"mean_token_accuracy": 0.16995420902967454,
"num_tokens": 21552875.0,
"step": 12420
},
{
"entropy": 5.431509065628052,
"epoch": 0.9667379887181482,
"grad_norm": 1.421875,
"learning_rate": 0.0004911475506277976,
"loss": 5.279,
"mean_token_accuracy": 0.17634952068328857,
"num_tokens": 21561469.0,
"step": 12425
},
{
"entropy": 5.5322596549987795,
"epoch": 0.9671270180898658,
"grad_norm": 1.453125,
"learning_rate": 0.000491139851212578,
"loss": 5.3693,
"mean_token_accuracy": 0.1743447095155716,
"num_tokens": 21569523.0,
"step": 12430
},
{
"entropy": 5.490969467163086,
"epoch": 0.9675160474615834,
"grad_norm": 1.53125,
"learning_rate": 0.0004911321485177802,
"loss": 5.3068,
"mean_token_accuracy": 0.17414761185646058,
"num_tokens": 21577700.0,
"step": 12435
},
{
"entropy": 5.58392858505249,
"epoch": 0.967905076833301,
"grad_norm": 1.375,
"learning_rate": 0.0004911244425435212,
"loss": 5.3863,
"mean_token_accuracy": 0.17134580463171006,
"num_tokens": 21586233.0,
"step": 12440
},
{
"entropy": 5.5466711044311525,
"epoch": 0.9682941062050184,
"grad_norm": 2.25,
"learning_rate": 0.0004911167332899176,
"loss": 5.4219,
"mean_token_accuracy": 0.17210243493318558,
"num_tokens": 21595330.0,
"step": 12445
},
{
"entropy": 5.532320356369018,
"epoch": 0.968683135576736,
"grad_norm": 1.7578125,
"learning_rate": 0.0004911090207570867,
"loss": 5.3474,
"mean_token_accuracy": 0.17149314284324646,
"num_tokens": 21604522.0,
"step": 12450
},
{
"entropy": 5.58540153503418,
"epoch": 0.9690721649484536,
"grad_norm": 1.5390625,
"learning_rate": 0.0004911013049451453,
"loss": 5.3348,
"mean_token_accuracy": 0.16969534903764724,
"num_tokens": 21613599.0,
"step": 12455
},
{
"entropy": 5.531045198440552,
"epoch": 0.9694611943201712,
"grad_norm": 1.3984375,
"learning_rate": 0.0004910935858542106,
"loss": 5.421,
"mean_token_accuracy": 0.1644749939441681,
"num_tokens": 21622587.0,
"step": 12460
},
{
"entropy": 5.5519630908966064,
"epoch": 0.9698502236918888,
"grad_norm": 1.5078125,
"learning_rate": 0.0004910858634843997,
"loss": 5.4035,
"mean_token_accuracy": 0.1654059812426567,
"num_tokens": 21630782.0,
"step": 12465
},
{
"entropy": 5.554431581497193,
"epoch": 0.9702392530636063,
"grad_norm": 1.3359375,
"learning_rate": 0.0004910781378358297,
"loss": 5.3007,
"mean_token_accuracy": 0.17476201206445693,
"num_tokens": 21639354.0,
"step": 12470
},
{
"entropy": 5.46932897567749,
"epoch": 0.9706282824353238,
"grad_norm": 1.6796875,
"learning_rate": 0.0004910704089086178,
"loss": 5.4476,
"mean_token_accuracy": 0.16485905647277832,
"num_tokens": 21648292.0,
"step": 12475
},
{
"entropy": 5.596227788925171,
"epoch": 0.9710173118070414,
"grad_norm": 1.4453125,
"learning_rate": 0.0004910626767028815,
"loss": 5.4065,
"mean_token_accuracy": 0.16999571919441223,
"num_tokens": 21657382.0,
"step": 12480
},
{
"entropy": 5.588405752182007,
"epoch": 0.971406341178759,
"grad_norm": 1.484375,
"learning_rate": 0.0004910549412187379,
"loss": 5.3672,
"mean_token_accuracy": 0.16503708213567733,
"num_tokens": 21666327.0,
"step": 12485
},
{
"entropy": 5.575157308578492,
"epoch": 0.9717953705504766,
"grad_norm": 1.5625,
"learning_rate": 0.0004910472024563045,
"loss": 5.4165,
"mean_token_accuracy": 0.17350658029317856,
"num_tokens": 21674882.0,
"step": 12490
},
{
"entropy": 5.6440962791442875,
"epoch": 0.9721843999221941,
"grad_norm": 1.5390625,
"learning_rate": 0.0004910394604156987,
"loss": 5.4818,
"mean_token_accuracy": 0.16394657045602798,
"num_tokens": 21683255.0,
"step": 12495
},
{
"entropy": 5.62670750617981,
"epoch": 0.9725734292939117,
"grad_norm": 1.5078125,
"learning_rate": 0.0004910317150970379,
"loss": 5.3456,
"mean_token_accuracy": 0.17043299376964569,
"num_tokens": 21692274.0,
"step": 12500
},
{
"entropy": 5.439621496200561,
"epoch": 0.9729624586656292,
"grad_norm": 1.5859375,
"learning_rate": 0.0004910239665004397,
"loss": 5.2848,
"mean_token_accuracy": 0.17927485853433608,
"num_tokens": 21700767.0,
"step": 12505
},
{
"entropy": 5.526528263092041,
"epoch": 0.9733514880373468,
"grad_norm": 1.4609375,
"learning_rate": 0.0004910162146260216,
"loss": 5.4341,
"mean_token_accuracy": 0.16639893651008605,
"num_tokens": 21709430.0,
"step": 12510
},
{
"entropy": 5.52956256866455,
"epoch": 0.9737405174090644,
"grad_norm": 1.609375,
"learning_rate": 0.0004910084594739013,
"loss": 5.3422,
"mean_token_accuracy": 0.17064064294099807,
"num_tokens": 21717978.0,
"step": 12515
},
{
"entropy": 5.42146315574646,
"epoch": 0.9741295467807819,
"grad_norm": 1.59375,
"learning_rate": 0.0004910007010441964,
"loss": 5.2039,
"mean_token_accuracy": 0.18186760395765306,
"num_tokens": 21726608.0,
"step": 12520
},
{
"entropy": 5.535458374023437,
"epoch": 0.9745185761524995,
"grad_norm": 1.5859375,
"learning_rate": 0.0004909929393370248,
"loss": 5.3757,
"mean_token_accuracy": 0.169576233625412,
"num_tokens": 21735402.0,
"step": 12525
},
{
"entropy": 5.538657903671265,
"epoch": 0.9749076055242171,
"grad_norm": 1.6171875,
"learning_rate": 0.0004909851743525041,
"loss": 5.362,
"mean_token_accuracy": 0.170218725502491,
"num_tokens": 21744620.0,
"step": 12530
},
{
"entropy": 5.560051107406617,
"epoch": 0.9752966348959347,
"grad_norm": 1.40625,
"learning_rate": 0.000490977406090752,
"loss": 5.3958,
"mean_token_accuracy": 0.16788250654935838,
"num_tokens": 21753270.0,
"step": 12535
},
{
"entropy": 5.654540109634399,
"epoch": 0.9756856642676522,
"grad_norm": 1.78125,
"learning_rate": 0.0004909696345518867,
"loss": 5.4239,
"mean_token_accuracy": 0.16545404493808746,
"num_tokens": 21761477.0,
"step": 12540
},
{
"entropy": 5.465372085571289,
"epoch": 0.9760746936393697,
"grad_norm": 1.6875,
"learning_rate": 0.0004909618597360258,
"loss": 5.3426,
"mean_token_accuracy": 0.1710445001721382,
"num_tokens": 21769925.0,
"step": 12545
},
{
"entropy": 5.5323145389556885,
"epoch": 0.9764637230110873,
"grad_norm": 1.5390625,
"learning_rate": 0.0004909540816432876,
"loss": 5.4147,
"mean_token_accuracy": 0.17307539731264115,
"num_tokens": 21778850.0,
"step": 12550
},
{
"entropy": 5.599014472961426,
"epoch": 0.9768527523828049,
"grad_norm": 1.3828125,
"learning_rate": 0.0004909463002737897,
"loss": 5.4578,
"mean_token_accuracy": 0.16602482572197913,
"num_tokens": 21787408.0,
"step": 12555
},
{
"entropy": 5.633021306991577,
"epoch": 0.9772417817545225,
"grad_norm": 1.6171875,
"learning_rate": 0.0004909385156276506,
"loss": 5.4026,
"mean_token_accuracy": 0.17237799018621444,
"num_tokens": 21795967.0,
"step": 12560
},
{
"entropy": 5.518686676025391,
"epoch": 0.9776308111262401,
"grad_norm": 1.4140625,
"learning_rate": 0.0004909307277049881,
"loss": 5.3573,
"mean_token_accuracy": 0.16549931913614274,
"num_tokens": 21804472.0,
"step": 12565
},
{
"entropy": 5.460463142395019,
"epoch": 0.9780198404979576,
"grad_norm": 1.328125,
"learning_rate": 0.0004909229365059205,
"loss": 5.344,
"mean_token_accuracy": 0.1692412778735161,
"num_tokens": 21813233.0,
"step": 12570
},
{
"entropy": 5.489893674850464,
"epoch": 0.9784088698696751,
"grad_norm": 1.5,
"learning_rate": 0.0004909151420305661,
"loss": 5.2328,
"mean_token_accuracy": 0.18162205666303635,
"num_tokens": 21821413.0,
"step": 12575
},
{
"entropy": 5.494278621673584,
"epoch": 0.9787978992413927,
"grad_norm": 1.4375,
"learning_rate": 0.000490907344279043,
"loss": 5.3276,
"mean_token_accuracy": 0.1738600954413414,
"num_tokens": 21829222.0,
"step": 12580
},
{
"entropy": 5.498348617553711,
"epoch": 0.9791869286131103,
"grad_norm": 1.40625,
"learning_rate": 0.0004908995432514698,
"loss": 5.357,
"mean_token_accuracy": 0.1704433500766754,
"num_tokens": 21837033.0,
"step": 12585
},
{
"entropy": 5.608533430099487,
"epoch": 0.9795759579848279,
"grad_norm": 1.4453125,
"learning_rate": 0.0004908917389479645,
"loss": 5.4112,
"mean_token_accuracy": 0.16187066733837127,
"num_tokens": 21845464.0,
"step": 12590
},
{
"entropy": 5.488953876495361,
"epoch": 0.9799649873565455,
"grad_norm": 1.46875,
"learning_rate": 0.0004908839313686456,
"loss": 5.3437,
"mean_token_accuracy": 0.17201852202415466,
"num_tokens": 21853497.0,
"step": 12595
},
{
"entropy": 5.5987184047698975,
"epoch": 0.980354016728263,
"grad_norm": 1.375,
"learning_rate": 0.0004908761205136319,
"loss": 5.4216,
"mean_token_accuracy": 0.1672752842307091,
"num_tokens": 21861710.0,
"step": 12600
},
{
"entropy": 5.602752923965454,
"epoch": 0.9807430460999805,
"grad_norm": 1.5859375,
"learning_rate": 0.0004908683063830414,
"loss": 5.3813,
"mean_token_accuracy": 0.16177596747875214,
"num_tokens": 21870472.0,
"step": 12605
},
{
"entropy": 5.602488660812378,
"epoch": 0.9811320754716981,
"grad_norm": 1.453125,
"learning_rate": 0.0004908604889769932,
"loss": 5.4327,
"mean_token_accuracy": 0.1645247995853424,
"num_tokens": 21878287.0,
"step": 12610
},
{
"entropy": 5.639327526092529,
"epoch": 0.9815211048434157,
"grad_norm": 1.359375,
"learning_rate": 0.0004908526682956054,
"loss": 5.4823,
"mean_token_accuracy": 0.16139356791973114,
"num_tokens": 21887587.0,
"step": 12615
},
{
"entropy": 5.5384681224823,
"epoch": 0.9819101342151333,
"grad_norm": 1.4921875,
"learning_rate": 0.0004908448443389972,
"loss": 5.3295,
"mean_token_accuracy": 0.16925830990076066,
"num_tokens": 21895923.0,
"step": 12620
},
{
"entropy": 5.5761942863464355,
"epoch": 0.9822991635868508,
"grad_norm": 1.578125,
"learning_rate": 0.0004908370171072869,
"loss": 5.3548,
"mean_token_accuracy": 0.1748336911201477,
"num_tokens": 21904439.0,
"step": 12625
},
{
"entropy": 5.532333850860596,
"epoch": 0.9826881929585684,
"grad_norm": 1.5625,
"learning_rate": 0.0004908291866005933,
"loss": 5.3123,
"mean_token_accuracy": 0.1754220023751259,
"num_tokens": 21912473.0,
"step": 12630
},
{
"entropy": 5.497559642791748,
"epoch": 0.9830772223302859,
"grad_norm": 2.109375,
"learning_rate": 0.0004908213528190355,
"loss": 5.3909,
"mean_token_accuracy": 0.16665016785264014,
"num_tokens": 21921631.0,
"step": 12635
},
{
"entropy": 5.478603982925415,
"epoch": 0.9834662517020035,
"grad_norm": 1.921875,
"learning_rate": 0.0004908135157627321,
"loss": 5.3025,
"mean_token_accuracy": 0.1735884353518486,
"num_tokens": 21929984.0,
"step": 12640
},
{
"entropy": 5.47756519317627,
"epoch": 0.9838552810737211,
"grad_norm": 1.46875,
"learning_rate": 0.0004908056754318022,
"loss": 5.2545,
"mean_token_accuracy": 0.1734400436282158,
"num_tokens": 21937349.0,
"step": 12645
},
{
"entropy": 5.495678520202636,
"epoch": 0.9842443104454386,
"grad_norm": 1.484375,
"learning_rate": 0.0004907978318263646,
"loss": 5.3983,
"mean_token_accuracy": 0.16898857802152634,
"num_tokens": 21946176.0,
"step": 12650
},
{
"entropy": 5.547983980178833,
"epoch": 0.9846333398171562,
"grad_norm": 1.5625,
"learning_rate": 0.0004907899849465383,
"loss": 5.3466,
"mean_token_accuracy": 0.1739278793334961,
"num_tokens": 21954645.0,
"step": 12655
},
{
"entropy": 5.566146564483643,
"epoch": 0.9850223691888738,
"grad_norm": 1.421875,
"learning_rate": 0.0004907821347924424,
"loss": 5.4061,
"mean_token_accuracy": 0.16499786227941513,
"num_tokens": 21963290.0,
"step": 12660
},
{
"entropy": 5.590229082107544,
"epoch": 0.9854113985605913,
"grad_norm": 1.484375,
"learning_rate": 0.0004907742813641963,
"loss": 5.3803,
"mean_token_accuracy": 0.16901493370532988,
"num_tokens": 21971005.0,
"step": 12665
},
{
"entropy": 5.506345939636231,
"epoch": 0.9858004279323089,
"grad_norm": 1.7578125,
"learning_rate": 0.0004907664246619187,
"loss": 5.318,
"mean_token_accuracy": 0.17287847995758057,
"num_tokens": 21980067.0,
"step": 12670
},
{
"entropy": 5.535951900482178,
"epoch": 0.9861894573040264,
"grad_norm": 1.578125,
"learning_rate": 0.0004907585646857293,
"loss": 5.3441,
"mean_token_accuracy": 0.16887053102254868,
"num_tokens": 21988511.0,
"step": 12675
},
{
"entropy": 5.521044683456421,
"epoch": 0.986578486675744,
"grad_norm": 1.5546875,
"learning_rate": 0.0004907507014357467,
"loss": 5.34,
"mean_token_accuracy": 0.16689002960920335,
"num_tokens": 21997074.0,
"step": 12680
},
{
"entropy": 5.555815696716309,
"epoch": 0.9869675160474616,
"grad_norm": 1.9296875,
"learning_rate": 0.0004907428349120909,
"loss": 5.4665,
"mean_token_accuracy": 0.1642643094062805,
"num_tokens": 22005412.0,
"step": 12685
},
{
"entropy": 5.512627267837525,
"epoch": 0.9873565454191792,
"grad_norm": 1.484375,
"learning_rate": 0.0004907349651148809,
"loss": 5.2672,
"mean_token_accuracy": 0.17630641758441926,
"num_tokens": 22013588.0,
"step": 12690
},
{
"entropy": 5.540982818603515,
"epoch": 0.9877455747908968,
"grad_norm": 1.3203125,
"learning_rate": 0.0004907270920442361,
"loss": 5.4038,
"mean_token_accuracy": 0.1709127902984619,
"num_tokens": 22021669.0,
"step": 12695
},
{
"entropy": 5.507408332824707,
"epoch": 0.9881346041626142,
"grad_norm": 1.453125,
"learning_rate": 0.0004907192157002762,
"loss": 5.2788,
"mean_token_accuracy": 0.1766637980937958,
"num_tokens": 22030295.0,
"step": 12700
},
{
"entropy": 5.558818006515503,
"epoch": 0.9885236335343318,
"grad_norm": 1.671875,
"learning_rate": 0.0004907113360831204,
"loss": 5.4359,
"mean_token_accuracy": 0.1616995304822922,
"num_tokens": 22038924.0,
"step": 12705
},
{
"entropy": 5.555681467056274,
"epoch": 0.9889126629060494,
"grad_norm": 1.5234375,
"learning_rate": 0.0004907034531928886,
"loss": 5.3437,
"mean_token_accuracy": 0.1774219810962677,
"num_tokens": 22047586.0,
"step": 12710
},
{
"entropy": 5.5058817863464355,
"epoch": 0.989301692277767,
"grad_norm": 1.8203125,
"learning_rate": 0.0004906955670297001,
"loss": 5.3141,
"mean_token_accuracy": 0.16815177500247955,
"num_tokens": 22055695.0,
"step": 12715
},
{
"entropy": 5.634102725982666,
"epoch": 0.9896907216494846,
"grad_norm": 1.6953125,
"learning_rate": 0.0004906876775936746,
"loss": 5.4947,
"mean_token_accuracy": 0.16482122838497162,
"num_tokens": 22064472.0,
"step": 12720
},
{
"entropy": 5.593327903747559,
"epoch": 0.990079751021202,
"grad_norm": 1.3359375,
"learning_rate": 0.0004906797848849321,
"loss": 5.3991,
"mean_token_accuracy": 0.16168297231197357,
"num_tokens": 22072726.0,
"step": 12725
},
{
"entropy": 5.542585945129394,
"epoch": 0.9904687803929196,
"grad_norm": 1.421875,
"learning_rate": 0.000490671888903592,
"loss": 5.3039,
"mean_token_accuracy": 0.1760962650179863,
"num_tokens": 22081074.0,
"step": 12730
},
{
"entropy": 5.494793558120728,
"epoch": 0.9908578097646372,
"grad_norm": 1.5234375,
"learning_rate": 0.0004906639896497744,
"loss": 5.2924,
"mean_token_accuracy": 0.17551180273294448,
"num_tokens": 22089924.0,
"step": 12735
},
{
"entropy": 5.545717668533325,
"epoch": 0.9912468391363548,
"grad_norm": 1.640625,
"learning_rate": 0.0004906560871235988,
"loss": 5.3033,
"mean_token_accuracy": 0.17040894627571107,
"num_tokens": 22099088.0,
"step": 12740
},
{
"entropy": 5.597740554809571,
"epoch": 0.9916358685080724,
"grad_norm": 1.7109375,
"learning_rate": 0.0004906481813251854,
"loss": 5.4783,
"mean_token_accuracy": 0.16306995898485183,
"num_tokens": 22108344.0,
"step": 12745
},
{
"entropy": 5.564219808578491,
"epoch": 0.9920248978797899,
"grad_norm": 1.4140625,
"learning_rate": 0.0004906402722546542,
"loss": 5.3566,
"mean_token_accuracy": 0.16615731865167618,
"num_tokens": 22116476.0,
"step": 12750
},
{
"entropy": 5.611138486862183,
"epoch": 0.9924139272515075,
"grad_norm": 1.5546875,
"learning_rate": 0.000490632359912125,
"loss": 5.4735,
"mean_token_accuracy": 0.1599627271294594,
"num_tokens": 22125445.0,
"step": 12755
},
{
"entropy": 5.612223339080811,
"epoch": 0.992802956623225,
"grad_norm": 1.4765625,
"learning_rate": 0.000490624444297718,
"loss": 5.5115,
"mean_token_accuracy": 0.15771945863962172,
"num_tokens": 22134886.0,
"step": 12760
},
{
"entropy": 5.515939521789551,
"epoch": 0.9931919859949426,
"grad_norm": 1.484375,
"learning_rate": 0.0004906165254115533,
"loss": 5.3309,
"mean_token_accuracy": 0.1733183041214943,
"num_tokens": 22144521.0,
"step": 12765
},
{
"entropy": 5.500012922286987,
"epoch": 0.9935810153666602,
"grad_norm": 1.6484375,
"learning_rate": 0.000490608603253751,
"loss": 5.3418,
"mean_token_accuracy": 0.1769414559006691,
"num_tokens": 22152754.0,
"step": 12770
},
{
"entropy": 5.591070699691772,
"epoch": 0.9939700447383778,
"grad_norm": 1.765625,
"learning_rate": 0.0004906006778244312,
"loss": 5.3434,
"mean_token_accuracy": 0.1685001879930496,
"num_tokens": 22161711.0,
"step": 12775
},
{
"entropy": 5.608580303192139,
"epoch": 0.9943590741100953,
"grad_norm": 1.59375,
"learning_rate": 0.0004905927491237145,
"loss": 5.4692,
"mean_token_accuracy": 0.16658519208431244,
"num_tokens": 22169762.0,
"step": 12780
},
{
"entropy": 5.4660426616668705,
"epoch": 0.9947481034818129,
"grad_norm": 1.4609375,
"learning_rate": 0.0004905848171517208,
"loss": 5.3108,
"mean_token_accuracy": 0.173878276348114,
"num_tokens": 22178415.0,
"step": 12785
},
{
"entropy": 5.412874507904053,
"epoch": 0.9951371328535304,
"grad_norm": 1.65625,
"learning_rate": 0.0004905768819085706,
"loss": 5.2655,
"mean_token_accuracy": 0.17446559369564058,
"num_tokens": 22187643.0,
"step": 12790
},
{
"entropy": 5.489374399185181,
"epoch": 0.995526162225248,
"grad_norm": 1.5234375,
"learning_rate": 0.0004905689433943846,
"loss": 5.2934,
"mean_token_accuracy": 0.17443826347589492,
"num_tokens": 22196355.0,
"step": 12795
},
{
"entropy": 5.640457391738892,
"epoch": 0.9959151915969656,
"grad_norm": 1.7890625,
"learning_rate": 0.0004905610016092828,
"loss": 5.3993,
"mean_token_accuracy": 0.16902930289506912,
"num_tokens": 22204648.0,
"step": 12800
},
{
"entropy": 5.539623880386353,
"epoch": 0.9963042209686831,
"grad_norm": 1.6015625,
"learning_rate": 0.0004905530565533859,
"loss": 5.3875,
"mean_token_accuracy": 0.16953061074018477,
"num_tokens": 22212811.0,
"step": 12805
},
{
"entropy": 5.485774564743042,
"epoch": 0.9966932503404007,
"grad_norm": 1.40625,
"learning_rate": 0.0004905451082268146,
"loss": 5.3426,
"mean_token_accuracy": 0.1691968783736229,
"num_tokens": 22220611.0,
"step": 12810
},
{
"entropy": 5.641964864730835,
"epoch": 0.9970822797121183,
"grad_norm": 1.6328125,
"learning_rate": 0.0004905371566296891,
"loss": 5.3741,
"mean_token_accuracy": 0.16540755480527877,
"num_tokens": 22229606.0,
"step": 12815
},
{
"entropy": 5.624663305282593,
"epoch": 0.9974713090838359,
"grad_norm": 1.3984375,
"learning_rate": 0.0004905292017621305,
"loss": 5.3701,
"mean_token_accuracy": 0.17140647917985916,
"num_tokens": 22238157.0,
"step": 12820
},
{
"entropy": 5.516221189498902,
"epoch": 0.9978603384555534,
"grad_norm": 1.4765625,
"learning_rate": 0.0004905212436242593,
"loss": 5.3797,
"mean_token_accuracy": 0.16921704709529878,
"num_tokens": 22246696.0,
"step": 12825
},
{
"entropy": 5.5207586765289305,
"epoch": 0.9982493678272709,
"grad_norm": 1.4296875,
"learning_rate": 0.0004905132822161962,
"loss": 5.4261,
"mean_token_accuracy": 0.16652178019285202,
"num_tokens": 22255028.0,
"step": 12830
},
{
"entropy": 5.688052225112915,
"epoch": 0.9986383971989885,
"grad_norm": 1.7734375,
"learning_rate": 0.0004905053175380621,
"loss": 5.4463,
"mean_token_accuracy": 0.16639384031295776,
"num_tokens": 22263198.0,
"step": 12835
},
{
"entropy": 5.667515611648559,
"epoch": 0.9990274265707061,
"grad_norm": 1.546875,
"learning_rate": 0.0004904973495899778,
"loss": 5.4711,
"mean_token_accuracy": 0.16980278640985488,
"num_tokens": 22273780.0,
"step": 12840
},
{
"entropy": 5.650799417495728,
"epoch": 0.9994164559424237,
"grad_norm": 1.3984375,
"learning_rate": 0.0004904893783720642,
"loss": 5.4837,
"mean_token_accuracy": 0.16519640684127807,
"num_tokens": 22281545.0,
"step": 12845
},
{
"entropy": 5.516597843170166,
"epoch": 0.9998054853141413,
"grad_norm": 1.625,
"learning_rate": 0.0004904814038844424,
"loss": 5.3928,
"mean_token_accuracy": 0.16057446599006653,
"num_tokens": 22290426.0,
"step": 12850
},
{
"entropy": 5.5570358700222435,
"epoch": 1.000155611748687,
"grad_norm": 1.375,
"learning_rate": 0.0004904734261272332,
"loss": 5.4261,
"mean_token_accuracy": 0.17388065821594662,
"num_tokens": 22297475.0,
"step": 12855
},
{
"entropy": 5.523546838760376,
"epoch": 1.0005446411204046,
"grad_norm": 1.5390625,
"learning_rate": 0.0004904654451005576,
"loss": 5.1548,
"mean_token_accuracy": 0.17881681472063066,
"num_tokens": 22305784.0,
"step": 12860
},
{
"entropy": 5.522774362564087,
"epoch": 1.0009336704921221,
"grad_norm": 1.390625,
"learning_rate": 0.0004904574608045369,
"loss": 5.2653,
"mean_token_accuracy": 0.17851061075925828,
"num_tokens": 22313951.0,
"step": 12865
},
{
"entropy": 5.617976284027099,
"epoch": 1.0013226998638398,
"grad_norm": 1.5,
"learning_rate": 0.0004904494732392923,
"loss": 5.3555,
"mean_token_accuracy": 0.1691703036427498,
"num_tokens": 22322509.0,
"step": 12870
},
{
"entropy": 5.49655294418335,
"epoch": 1.0017117292355573,
"grad_norm": 1.4609375,
"learning_rate": 0.0004904414824049448,
"loss": 5.3098,
"mean_token_accuracy": 0.16939163208007812,
"num_tokens": 22331475.0,
"step": 12875
},
{
"entropy": 5.512731599807739,
"epoch": 1.0021007586072748,
"grad_norm": 1.375,
"learning_rate": 0.0004904334883016156,
"loss": 5.2492,
"mean_token_accuracy": 0.17484806329011918,
"num_tokens": 22341114.0,
"step": 12880
},
{
"entropy": 5.595742559432983,
"epoch": 1.0024897879789925,
"grad_norm": 1.484375,
"learning_rate": 0.0004904254909294261,
"loss": 5.311,
"mean_token_accuracy": 0.1778619334101677,
"num_tokens": 22349199.0,
"step": 12885
},
{
"entropy": 5.500297355651855,
"epoch": 1.00287881735071,
"grad_norm": 1.3984375,
"learning_rate": 0.0004904174902884978,
"loss": 5.2892,
"mean_token_accuracy": 0.1734541654586792,
"num_tokens": 22358485.0,
"step": 12890
},
{
"entropy": 5.619526529312134,
"epoch": 1.0032678467224276,
"grad_norm": 1.46875,
"learning_rate": 0.0004904094863789519,
"loss": 5.3379,
"mean_token_accuracy": 0.16528905034065247,
"num_tokens": 22366936.0,
"step": 12895
},
{
"entropy": 5.610384607315064,
"epoch": 1.0036568760941451,
"grad_norm": 1.3671875,
"learning_rate": 0.00049040147920091,
"loss": 5.3366,
"mean_token_accuracy": 0.1698949158191681,
"num_tokens": 22376007.0,
"step": 12900
},
{
"entropy": 5.471351909637451,
"epoch": 1.0040459054658626,
"grad_norm": 1.6171875,
"learning_rate": 0.0004903934687544933,
"loss": 5.2509,
"mean_token_accuracy": 0.1787009432911873,
"num_tokens": 22384747.0,
"step": 12905
},
{
"entropy": 5.54491024017334,
"epoch": 1.0044349348375803,
"grad_norm": 1.53125,
"learning_rate": 0.0004903854550398237,
"loss": 5.2684,
"mean_token_accuracy": 0.17942501455545426,
"num_tokens": 22393730.0,
"step": 12910
},
{
"entropy": 5.588310432434082,
"epoch": 1.0048239642092978,
"grad_norm": 1.359375,
"learning_rate": 0.0004903774380570226,
"loss": 5.292,
"mean_token_accuracy": 0.16754848062992095,
"num_tokens": 22402121.0,
"step": 12915
},
{
"entropy": 5.5205357551574705,
"epoch": 1.0052129935810155,
"grad_norm": 1.3515625,
"learning_rate": 0.0004903694178062117,
"loss": 5.3043,
"mean_token_accuracy": 0.1711421236395836,
"num_tokens": 22410943.0,
"step": 12920
},
{
"entropy": 5.588519191741943,
"epoch": 1.005602022952733,
"grad_norm": 1.359375,
"learning_rate": 0.0004903613942875126,
"loss": 5.3836,
"mean_token_accuracy": 0.1663561701774597,
"num_tokens": 22420137.0,
"step": 12925
},
{
"entropy": 5.5643699169158936,
"epoch": 1.0059910523244504,
"grad_norm": 1.4609375,
"learning_rate": 0.0004903533675010472,
"loss": 5.3033,
"mean_token_accuracy": 0.16773653626441956,
"num_tokens": 22429031.0,
"step": 12930
},
{
"entropy": 5.482028484344482,
"epoch": 1.006380081696168,
"grad_norm": 1.5078125,
"learning_rate": 0.0004903453374469373,
"loss": 5.3412,
"mean_token_accuracy": 0.16637110114097595,
"num_tokens": 22438735.0,
"step": 12935
},
{
"entropy": 5.6026373386383055,
"epoch": 1.0067691110678856,
"grad_norm": 1.421875,
"learning_rate": 0.0004903373041253045,
"loss": 5.3505,
"mean_token_accuracy": 0.16359059512615204,
"num_tokens": 22447374.0,
"step": 12940
},
{
"entropy": 5.613511085510254,
"epoch": 1.0071581404396033,
"grad_norm": 1.34375,
"learning_rate": 0.0004903292675362709,
"loss": 5.2708,
"mean_token_accuracy": 0.17284512370824814,
"num_tokens": 22455542.0,
"step": 12945
},
{
"entropy": 5.469234037399292,
"epoch": 1.0075471698113208,
"grad_norm": 1.6484375,
"learning_rate": 0.0004903212276799584,
"loss": 5.3202,
"mean_token_accuracy": 0.16955188363790513,
"num_tokens": 22464591.0,
"step": 12950
},
{
"entropy": 5.545535087585449,
"epoch": 1.0079361991830382,
"grad_norm": 1.53125,
"learning_rate": 0.0004903131845564889,
"loss": 5.2601,
"mean_token_accuracy": 0.18278864175081252,
"num_tokens": 22472315.0,
"step": 12955
},
{
"entropy": 5.6099896907806395,
"epoch": 1.008325228554756,
"grad_norm": 1.53125,
"learning_rate": 0.0004903051381659847,
"loss": 5.3979,
"mean_token_accuracy": 0.17157152146100998,
"num_tokens": 22480662.0,
"step": 12960
},
{
"entropy": 5.456760358810425,
"epoch": 1.0087142579264734,
"grad_norm": 1.5859375,
"learning_rate": 0.0004902970885085677,
"loss": 5.2675,
"mean_token_accuracy": 0.17337485104799272,
"num_tokens": 22489600.0,
"step": 12965
},
{
"entropy": 5.579549646377563,
"epoch": 1.009103287298191,
"grad_norm": 1.421875,
"learning_rate": 0.00049028903558436,
"loss": 5.3412,
"mean_token_accuracy": 0.169442754983902,
"num_tokens": 22498114.0,
"step": 12970
},
{
"entropy": 5.542692804336548,
"epoch": 1.0094923166699086,
"grad_norm": 1.3984375,
"learning_rate": 0.0004902809793934838,
"loss": 5.1924,
"mean_token_accuracy": 0.17911877781152724,
"num_tokens": 22506349.0,
"step": 12975
},
{
"entropy": 5.5219934463500975,
"epoch": 1.009881346041626,
"grad_norm": 1.484375,
"learning_rate": 0.0004902729199360615,
"loss": 5.287,
"mean_token_accuracy": 0.17722095400094987,
"num_tokens": 22514878.0,
"step": 12980
},
{
"entropy": 5.490213394165039,
"epoch": 1.0102703754133437,
"grad_norm": 1.5078125,
"learning_rate": 0.0004902648572122153,
"loss": 5.3091,
"mean_token_accuracy": 0.16282469183206558,
"num_tokens": 22522992.0,
"step": 12985
},
{
"entropy": 5.588901567459106,
"epoch": 1.0106594047850612,
"grad_norm": 1.359375,
"learning_rate": 0.0004902567912220674,
"loss": 5.3481,
"mean_token_accuracy": 0.16807745695114135,
"num_tokens": 22531407.0,
"step": 12990
},
{
"entropy": 5.4717206954956055,
"epoch": 1.011048434156779,
"grad_norm": 1.5625,
"learning_rate": 0.0004902487219657404,
"loss": 5.2332,
"mean_token_accuracy": 0.1733588382601738,
"num_tokens": 22540255.0,
"step": 12995
},
{
"entropy": 5.4836445331573485,
"epoch": 1.0114374635284964,
"grad_norm": 1.5078125,
"learning_rate": 0.0004902406494433566,
"loss": 5.2944,
"mean_token_accuracy": 0.17397915124893187,
"num_tokens": 22549139.0,
"step": 13000
},
{
"entropy": 5.5719012260437015,
"epoch": 1.0118264929002139,
"grad_norm": 1.4453125,
"learning_rate": 0.0004902325736550386,
"loss": 5.2815,
"mean_token_accuracy": 0.17646536380052566,
"num_tokens": 22557746.0,
"step": 13005
},
{
"entropy": 5.534259557723999,
"epoch": 1.0122155222719316,
"grad_norm": 1.59375,
"learning_rate": 0.0004902244946009088,
"loss": 5.268,
"mean_token_accuracy": 0.17062594890594482,
"num_tokens": 22566695.0,
"step": 13010
},
{
"entropy": 5.474474096298218,
"epoch": 1.012604551643649,
"grad_norm": 1.65625,
"learning_rate": 0.0004902164122810899,
"loss": 5.2858,
"mean_token_accuracy": 0.170113243162632,
"num_tokens": 22575196.0,
"step": 13015
},
{
"entropy": 5.5639995574951175,
"epoch": 1.0129935810153667,
"grad_norm": 1.4609375,
"learning_rate": 0.0004902083266957045,
"loss": 5.2949,
"mean_token_accuracy": 0.17444577813148499,
"num_tokens": 22583520.0,
"step": 13020
},
{
"entropy": 5.6080474853515625,
"epoch": 1.0133826103870842,
"grad_norm": 1.6328125,
"learning_rate": 0.0004902002378448753,
"loss": 5.3375,
"mean_token_accuracy": 0.16806702613830565,
"num_tokens": 22591896.0,
"step": 13025
},
{
"entropy": 5.588902854919434,
"epoch": 1.0137716397588017,
"grad_norm": 1.578125,
"learning_rate": 0.000490192145728725,
"loss": 5.2748,
"mean_token_accuracy": 0.17871918380260468,
"num_tokens": 22600097.0,
"step": 13030
},
{
"entropy": 5.5454301834106445,
"epoch": 1.0141606691305194,
"grad_norm": 1.7109375,
"learning_rate": 0.0004901840503473764,
"loss": 5.2085,
"mean_token_accuracy": 0.1683547243475914,
"num_tokens": 22607956.0,
"step": 13035
},
{
"entropy": 5.479225730895996,
"epoch": 1.0145496985022369,
"grad_norm": 2.046875,
"learning_rate": 0.0004901759517009522,
"loss": 5.2889,
"mean_token_accuracy": 0.16536511480808258,
"num_tokens": 22616549.0,
"step": 13040
},
{
"entropy": 5.496964693069458,
"epoch": 1.0149387278739546,
"grad_norm": 1.6875,
"learning_rate": 0.0004901678497895755,
"loss": 5.2013,
"mean_token_accuracy": 0.17258040755987167,
"num_tokens": 22625138.0,
"step": 13045
},
{
"entropy": 5.556217241287231,
"epoch": 1.015327757245672,
"grad_norm": 1.4921875,
"learning_rate": 0.0004901597446133692,
"loss": 5.3101,
"mean_token_accuracy": 0.16471708714962005,
"num_tokens": 22633808.0,
"step": 13050
},
{
"entropy": 5.531499910354614,
"epoch": 1.0157167866173895,
"grad_norm": 1.5703125,
"learning_rate": 0.0004901516361724564,
"loss": 5.2722,
"mean_token_accuracy": 0.17534152120351792,
"num_tokens": 22642517.0,
"step": 13055
},
{
"entropy": 5.576869916915894,
"epoch": 1.0161058159891072,
"grad_norm": 1.3984375,
"learning_rate": 0.0004901435244669597,
"loss": 5.3269,
"mean_token_accuracy": 0.165169657766819,
"num_tokens": 22651822.0,
"step": 13060
},
{
"entropy": 5.525007009506226,
"epoch": 1.0164948453608247,
"grad_norm": 2.0625,
"learning_rate": 0.0004901354094970025,
"loss": 5.3087,
"mean_token_accuracy": 0.17057413160800933,
"num_tokens": 22660763.0,
"step": 13065
},
{
"entropy": 5.479302597045899,
"epoch": 1.0168838747325424,
"grad_norm": 1.390625,
"learning_rate": 0.0004901272912627081,
"loss": 5.2851,
"mean_token_accuracy": 0.17264565229415893,
"num_tokens": 22669449.0,
"step": 13070
},
{
"entropy": 5.55150990486145,
"epoch": 1.0172729041042599,
"grad_norm": 1.609375,
"learning_rate": 0.0004901191697641992,
"loss": 5.3316,
"mean_token_accuracy": 0.17265421003103257,
"num_tokens": 22678212.0,
"step": 13075
},
{
"entropy": 5.522483396530151,
"epoch": 1.0176619334759773,
"grad_norm": 1.5078125,
"learning_rate": 0.0004901110450015994,
"loss": 5.2543,
"mean_token_accuracy": 0.17973925173282623,
"num_tokens": 22686509.0,
"step": 13080
},
{
"entropy": 5.512483596801758,
"epoch": 1.018050962847695,
"grad_norm": 1.3984375,
"learning_rate": 0.0004901029169750319,
"loss": 5.2879,
"mean_token_accuracy": 0.1782244548201561,
"num_tokens": 22695473.0,
"step": 13085
},
{
"entropy": 5.538054943084717,
"epoch": 1.0184399922194125,
"grad_norm": 1.625,
"learning_rate": 0.0004900947856846201,
"loss": 5.3616,
"mean_token_accuracy": 0.1674347475171089,
"num_tokens": 22704567.0,
"step": 13090
},
{
"entropy": 5.519725656509399,
"epoch": 1.0188290215911302,
"grad_norm": 1.484375,
"learning_rate": 0.000490086651130487,
"loss": 5.2387,
"mean_token_accuracy": 0.1735985353589058,
"num_tokens": 22713981.0,
"step": 13095
},
{
"entropy": 5.375979089736939,
"epoch": 1.0192180509628477,
"grad_norm": 1.59375,
"learning_rate": 0.0004900785133127566,
"loss": 5.1693,
"mean_token_accuracy": 0.18233491629362106,
"num_tokens": 22722855.0,
"step": 13100
},
{
"entropy": 5.418504619598389,
"epoch": 1.0196070803345652,
"grad_norm": 1.703125,
"learning_rate": 0.000490070372231552,
"loss": 5.3064,
"mean_token_accuracy": 0.16758803129196168,
"num_tokens": 22732454.0,
"step": 13105
},
{
"entropy": 5.552613830566406,
"epoch": 1.0199961097062828,
"grad_norm": 1.4609375,
"learning_rate": 0.0004900622278869968,
"loss": 5.1598,
"mean_token_accuracy": 0.1850112795829773,
"num_tokens": 22741331.0,
"step": 13110
},
{
"entropy": 5.550606918334961,
"epoch": 1.0203851390780003,
"grad_norm": 1.578125,
"learning_rate": 0.0004900540802792146,
"loss": 5.3448,
"mean_token_accuracy": 0.1711778849363327,
"num_tokens": 22749983.0,
"step": 13115
},
{
"entropy": 5.471428108215332,
"epoch": 1.020774168449718,
"grad_norm": 1.5703125,
"learning_rate": 0.000490045929408329,
"loss": 5.2867,
"mean_token_accuracy": 0.17198589891195298,
"num_tokens": 22759112.0,
"step": 13120
},
{
"entropy": 5.528674173355102,
"epoch": 1.0211631978214355,
"grad_norm": 1.6171875,
"learning_rate": 0.0004900377752744637,
"loss": 5.3349,
"mean_token_accuracy": 0.17381939440965652,
"num_tokens": 22768456.0,
"step": 13125
},
{
"entropy": 5.553075313568115,
"epoch": 1.021552227193153,
"grad_norm": 1.40625,
"learning_rate": 0.0004900296178777426,
"loss": 5.2569,
"mean_token_accuracy": 0.17494437098503113,
"num_tokens": 22777450.0,
"step": 13130
},
{
"entropy": 5.549312019348145,
"epoch": 1.0219412565648707,
"grad_norm": 1.53125,
"learning_rate": 0.000490021457218289,
"loss": 5.2871,
"mean_token_accuracy": 0.1765150785446167,
"num_tokens": 22785704.0,
"step": 13135
},
{
"entropy": 5.4410844326019285,
"epoch": 1.0223302859365881,
"grad_norm": 1.375,
"learning_rate": 0.0004900132932962272,
"loss": 5.2897,
"mean_token_accuracy": 0.16746250540018082,
"num_tokens": 22794649.0,
"step": 13140
},
{
"entropy": 5.557854461669922,
"epoch": 1.0227193153083058,
"grad_norm": 1.328125,
"learning_rate": 0.000490005126111681,
"loss": 5.3962,
"mean_token_accuracy": 0.1683148980140686,
"num_tokens": 22803501.0,
"step": 13145
},
{
"entropy": 5.642955684661866,
"epoch": 1.0231083446800233,
"grad_norm": 1.375,
"learning_rate": 0.000489996955664774,
"loss": 5.3063,
"mean_token_accuracy": 0.1695007413625717,
"num_tokens": 22811779.0,
"step": 13150
},
{
"entropy": 5.494333171844483,
"epoch": 1.023497374051741,
"grad_norm": 1.34375,
"learning_rate": 0.0004899887819556306,
"loss": 5.3183,
"mean_token_accuracy": 0.17430364489555358,
"num_tokens": 22821108.0,
"step": 13155
},
{
"entropy": 5.571894025802612,
"epoch": 1.0238864034234585,
"grad_norm": 1.40625,
"learning_rate": 0.0004899806049843745,
"loss": 5.3357,
"mean_token_accuracy": 0.16800168603658677,
"num_tokens": 22829369.0,
"step": 13160
},
{
"entropy": 5.553596067428589,
"epoch": 1.024275432795176,
"grad_norm": 1.34375,
"learning_rate": 0.0004899724247511299,
"loss": 5.3092,
"mean_token_accuracy": 0.16919184625148773,
"num_tokens": 22838441.0,
"step": 13165
},
{
"entropy": 5.547909545898437,
"epoch": 1.0246644621668937,
"grad_norm": 1.3515625,
"learning_rate": 0.000489964241256021,
"loss": 5.2574,
"mean_token_accuracy": 0.17296576201915742,
"num_tokens": 22847587.0,
"step": 13170
},
{
"entropy": 5.444735097885132,
"epoch": 1.0250534915386111,
"grad_norm": 1.4453125,
"learning_rate": 0.0004899560544991718,
"loss": 5.2533,
"mean_token_accuracy": 0.17598360478878022,
"num_tokens": 22856051.0,
"step": 13175
},
{
"entropy": 5.548771619796753,
"epoch": 1.0254425209103288,
"grad_norm": 1.46875,
"learning_rate": 0.0004899478644807068,
"loss": 5.3261,
"mean_token_accuracy": 0.16842278242111205,
"num_tokens": 22864822.0,
"step": 13180
},
{
"entropy": 5.570658206939697,
"epoch": 1.0258315502820463,
"grad_norm": 1.6171875,
"learning_rate": 0.0004899396712007498,
"loss": 5.2971,
"mean_token_accuracy": 0.1770306870341301,
"num_tokens": 22873199.0,
"step": 13185
},
{
"entropy": 5.525741386413574,
"epoch": 1.0262205796537638,
"grad_norm": 1.6640625,
"learning_rate": 0.0004899314746594256,
"loss": 5.3487,
"mean_token_accuracy": 0.16684436053037643,
"num_tokens": 22881184.0,
"step": 13190
},
{
"entropy": 5.528432941436767,
"epoch": 1.0266096090254815,
"grad_norm": 1.5390625,
"learning_rate": 0.0004899232748568584,
"loss": 5.2539,
"mean_token_accuracy": 0.17741697430610656,
"num_tokens": 22890087.0,
"step": 13195
},
{
"entropy": 5.549570322036743,
"epoch": 1.026998638397199,
"grad_norm": 1.4296875,
"learning_rate": 0.0004899150717931724,
"loss": 5.2594,
"mean_token_accuracy": 0.1733081355690956,
"num_tokens": 22899013.0,
"step": 13200
},
{
"entropy": 5.545243263244629,
"epoch": 1.0273876677689167,
"grad_norm": 1.84375,
"learning_rate": 0.0004899068654684924,
"loss": 5.4348,
"mean_token_accuracy": 0.16527665704488753,
"num_tokens": 22908740.0,
"step": 13205
},
{
"entropy": 5.597586393356323,
"epoch": 1.0277766971406341,
"grad_norm": 1.390625,
"learning_rate": 0.0004898986558829428,
"loss": 5.3524,
"mean_token_accuracy": 0.1712162524461746,
"num_tokens": 22917502.0,
"step": 13210
},
{
"entropy": 5.535340023040772,
"epoch": 1.0281657265123516,
"grad_norm": 1.4765625,
"learning_rate": 0.0004898904430366479,
"loss": 5.2642,
"mean_token_accuracy": 0.17161000967025758,
"num_tokens": 22927076.0,
"step": 13215
},
{
"entropy": 5.568803071975708,
"epoch": 1.0285547558840693,
"grad_norm": 1.4296875,
"learning_rate": 0.0004898822269297328,
"loss": 5.3295,
"mean_token_accuracy": 0.16263166218996047,
"num_tokens": 22936111.0,
"step": 13220
},
{
"entropy": 5.486574792861939,
"epoch": 1.0289437852557868,
"grad_norm": 1.40625,
"learning_rate": 0.0004898740075623218,
"loss": 5.1947,
"mean_token_accuracy": 0.18024656176567078,
"num_tokens": 22944752.0,
"step": 13225
},
{
"entropy": 5.578030776977539,
"epoch": 1.0293328146275045,
"grad_norm": 1.515625,
"learning_rate": 0.0004898657849345399,
"loss": 5.4195,
"mean_token_accuracy": 0.1684816874563694,
"num_tokens": 22952971.0,
"step": 13230
},
{
"entropy": 5.5485940933227536,
"epoch": 1.029721843999222,
"grad_norm": 1.4609375,
"learning_rate": 0.0004898575590465116,
"loss": 5.3393,
"mean_token_accuracy": 0.17579842060804368,
"num_tokens": 22961257.0,
"step": 13235
},
{
"entropy": 5.530694389343262,
"epoch": 1.0301108733709394,
"grad_norm": 1.953125,
"learning_rate": 0.0004898493298983619,
"loss": 5.3779,
"mean_token_accuracy": 0.16456894129514693,
"num_tokens": 22970659.0,
"step": 13240
},
{
"entropy": 5.556435823440552,
"epoch": 1.0304999027426571,
"grad_norm": 1.40625,
"learning_rate": 0.0004898410974902155,
"loss": 5.3202,
"mean_token_accuracy": 0.17372994422912597,
"num_tokens": 22978830.0,
"step": 13245
},
{
"entropy": 5.553006172180176,
"epoch": 1.0308889321143746,
"grad_norm": 1.421875,
"learning_rate": 0.0004898328618221974,
"loss": 5.2989,
"mean_token_accuracy": 0.18095583021640776,
"num_tokens": 22987100.0,
"step": 13250
},
{
"entropy": 5.524930858612061,
"epoch": 1.0312779614860923,
"grad_norm": 1.9453125,
"learning_rate": 0.0004898246228944327,
"loss": 5.305,
"mean_token_accuracy": 0.17208175659179686,
"num_tokens": 22995749.0,
"step": 13255
},
{
"entropy": 5.609223222732544,
"epoch": 1.0316669908578098,
"grad_norm": 1.90625,
"learning_rate": 0.0004898163807070461,
"loss": 5.3733,
"mean_token_accuracy": 0.17638735324144364,
"num_tokens": 23004410.0,
"step": 13260
},
{
"entropy": 5.527045154571534,
"epoch": 1.0320560202295272,
"grad_norm": 1.40625,
"learning_rate": 0.0004898081352601629,
"loss": 5.2404,
"mean_token_accuracy": 0.17105171829462051,
"num_tokens": 23012935.0,
"step": 13265
},
{
"entropy": 5.468330812454224,
"epoch": 1.032445049601245,
"grad_norm": 1.515625,
"learning_rate": 0.0004897998865539082,
"loss": 5.2455,
"mean_token_accuracy": 0.16925933063030243,
"num_tokens": 23021769.0,
"step": 13270
},
{
"entropy": 5.485386705398559,
"epoch": 1.0328340789729624,
"grad_norm": 1.3046875,
"learning_rate": 0.0004897916345884069,
"loss": 5.2459,
"mean_token_accuracy": 0.17402863800525664,
"num_tokens": 23030915.0,
"step": 13275
},
{
"entropy": 5.50831241607666,
"epoch": 1.0332231083446801,
"grad_norm": 1.6875,
"learning_rate": 0.0004897833793637847,
"loss": 5.3564,
"mean_token_accuracy": 0.17065636366605758,
"num_tokens": 23039422.0,
"step": 13280
},
{
"entropy": 5.57260479927063,
"epoch": 1.0336121377163976,
"grad_norm": 1.5,
"learning_rate": 0.0004897751208801665,
"loss": 5.4079,
"mean_token_accuracy": 0.16120281517505647,
"num_tokens": 23048485.0,
"step": 13285
},
{
"entropy": 5.524514198303223,
"epoch": 1.034001167088115,
"grad_norm": 1.546875,
"learning_rate": 0.0004897668591376777,
"loss": 5.2735,
"mean_token_accuracy": 0.17662156969308854,
"num_tokens": 23057506.0,
"step": 13290
},
{
"entropy": 5.454878807067871,
"epoch": 1.0343901964598328,
"grad_norm": 1.4375,
"learning_rate": 0.0004897585941364436,
"loss": 5.1278,
"mean_token_accuracy": 0.18146211802959442,
"num_tokens": 23065430.0,
"step": 13295
},
{
"entropy": 5.4088164329528805,
"epoch": 1.0347792258315502,
"grad_norm": 1.359375,
"learning_rate": 0.0004897503258765896,
"loss": 5.2497,
"mean_token_accuracy": 0.16961822509765626,
"num_tokens": 23074533.0,
"step": 13300
},
{
"entropy": 5.541276741027832,
"epoch": 1.035168255203268,
"grad_norm": 1.515625,
"learning_rate": 0.0004897420543582413,
"loss": 5.2566,
"mean_token_accuracy": 0.17172229290008545,
"num_tokens": 23083020.0,
"step": 13305
},
{
"entropy": 5.519902229309082,
"epoch": 1.0355572845749854,
"grad_norm": 1.546875,
"learning_rate": 0.000489733779581524,
"loss": 5.3161,
"mean_token_accuracy": 0.1741691052913666,
"num_tokens": 23091992.0,
"step": 13310
},
{
"entropy": 5.464567232131958,
"epoch": 1.035946313946703,
"grad_norm": 1.65625,
"learning_rate": 0.0004897255015465635,
"loss": 5.2657,
"mean_token_accuracy": 0.17678949534893035,
"num_tokens": 23100411.0,
"step": 13315
},
{
"entropy": 5.443428802490234,
"epoch": 1.0363353433184206,
"grad_norm": 1.6328125,
"learning_rate": 0.0004897172202534853,
"loss": 5.3628,
"mean_token_accuracy": 0.168155275285244,
"num_tokens": 23108867.0,
"step": 13320
},
{
"entropy": 5.495881700515747,
"epoch": 1.036724372690138,
"grad_norm": 1.546875,
"learning_rate": 0.000489708935702415,
"loss": 5.1993,
"mean_token_accuracy": 0.16957461833953857,
"num_tokens": 23116692.0,
"step": 13325
},
{
"entropy": 5.547291994094849,
"epoch": 1.0371134020618558,
"grad_norm": 1.4296875,
"learning_rate": 0.0004897006478934784,
"loss": 5.2843,
"mean_token_accuracy": 0.17300619930028915,
"num_tokens": 23125138.0,
"step": 13330
},
{
"entropy": 5.4647290229797365,
"epoch": 1.0375024314335732,
"grad_norm": 1.421875,
"learning_rate": 0.0004896923568268011,
"loss": 5.291,
"mean_token_accuracy": 0.16938004195690154,
"num_tokens": 23133263.0,
"step": 13335
},
{
"entropy": 5.546141147613525,
"epoch": 1.0378914608052907,
"grad_norm": 1.6484375,
"learning_rate": 0.000489684062502509,
"loss": 5.291,
"mean_token_accuracy": 0.17217222303152085,
"num_tokens": 23141984.0,
"step": 13340
},
{
"entropy": 5.504475259780884,
"epoch": 1.0382804901770084,
"grad_norm": 1.5234375,
"learning_rate": 0.0004896757649207281,
"loss": 5.2484,
"mean_token_accuracy": 0.1749482810497284,
"num_tokens": 23151598.0,
"step": 13345
},
{
"entropy": 5.542143249511719,
"epoch": 1.0386695195487259,
"grad_norm": 1.34375,
"learning_rate": 0.000489667464081584,
"loss": 5.3794,
"mean_token_accuracy": 0.1688281401991844,
"num_tokens": 23159737.0,
"step": 13350
},
{
"entropy": 5.480085706710815,
"epoch": 1.0390585489204436,
"grad_norm": 1.40625,
"learning_rate": 0.0004896591599852029,
"loss": 5.2364,
"mean_token_accuracy": 0.17880214899778366,
"num_tokens": 23168852.0,
"step": 13355
},
{
"entropy": 5.567393636703491,
"epoch": 1.039447578292161,
"grad_norm": 1.828125,
"learning_rate": 0.0004896508526317107,
"loss": 5.3324,
"mean_token_accuracy": 0.1715226024389267,
"num_tokens": 23178227.0,
"step": 13360
},
{
"entropy": 5.480564165115356,
"epoch": 1.0398366076638785,
"grad_norm": 1.546875,
"learning_rate": 0.0004896425420212334,
"loss": 5.2334,
"mean_token_accuracy": 0.1764785349369049,
"num_tokens": 23187286.0,
"step": 13365
},
{
"entropy": 5.561172866821289,
"epoch": 1.0402256370355962,
"grad_norm": 1.4375,
"learning_rate": 0.0004896342281538973,
"loss": 5.2958,
"mean_token_accuracy": 0.18206935226917267,
"num_tokens": 23196163.0,
"step": 13370
},
{
"entropy": 5.565270471572876,
"epoch": 1.0406146664073137,
"grad_norm": 2.75,
"learning_rate": 0.0004896259110298283,
"loss": 5.247,
"mean_token_accuracy": 0.17623820453882216,
"num_tokens": 23203742.0,
"step": 13375
},
{
"entropy": 5.576069641113281,
"epoch": 1.0410036957790314,
"grad_norm": 1.46875,
"learning_rate": 0.0004896175906491528,
"loss": 5.4118,
"mean_token_accuracy": 0.170791158080101,
"num_tokens": 23212860.0,
"step": 13380
},
{
"entropy": 5.533156967163086,
"epoch": 1.0413927251507489,
"grad_norm": 1.46875,
"learning_rate": 0.0004896092670119968,
"loss": 5.2695,
"mean_token_accuracy": 0.168504199385643,
"num_tokens": 23222558.0,
"step": 13385
},
{
"entropy": 5.556425094604492,
"epoch": 1.0417817545224664,
"grad_norm": 1.6875,
"learning_rate": 0.0004896009401184869,
"loss": 5.3188,
"mean_token_accuracy": 0.17318859249353408,
"num_tokens": 23231413.0,
"step": 13390
},
{
"entropy": 5.59720516204834,
"epoch": 1.042170783894184,
"grad_norm": 1.5703125,
"learning_rate": 0.0004895926099687493,
"loss": 5.2852,
"mean_token_accuracy": 0.17516269236803056,
"num_tokens": 23240783.0,
"step": 13395
},
{
"entropy": 5.519211864471435,
"epoch": 1.0425598132659015,
"grad_norm": 1.4140625,
"learning_rate": 0.0004895842765629104,
"loss": 5.3771,
"mean_token_accuracy": 0.16749323308467864,
"num_tokens": 23249125.0,
"step": 13400
},
{
"entropy": 5.500641202926635,
"epoch": 1.0429488426376192,
"grad_norm": 1.3671875,
"learning_rate": 0.0004895759399010966,
"loss": 5.2315,
"mean_token_accuracy": 0.17279189229011535,
"num_tokens": 23257793.0,
"step": 13405
},
{
"entropy": 5.478333377838135,
"epoch": 1.0433378720093367,
"grad_norm": 1.4921875,
"learning_rate": 0.0004895675999834345,
"loss": 5.2134,
"mean_token_accuracy": 0.17972014248371124,
"num_tokens": 23266361.0,
"step": 13410
},
{
"entropy": 5.46014437675476,
"epoch": 1.0437269013810542,
"grad_norm": 1.9375,
"learning_rate": 0.0004895592568100505,
"loss": 5.2015,
"mean_token_accuracy": 0.17767742425203323,
"num_tokens": 23274914.0,
"step": 13415
},
{
"entropy": 5.484378004074097,
"epoch": 1.0441159307527719,
"grad_norm": 1.5234375,
"learning_rate": 0.0004895509103810714,
"loss": 5.273,
"mean_token_accuracy": 0.17297763973474503,
"num_tokens": 23283067.0,
"step": 13420
},
{
"entropy": 5.529915189743042,
"epoch": 1.0445049601244893,
"grad_norm": 1.4453125,
"learning_rate": 0.0004895425606966237,
"loss": 5.2813,
"mean_token_accuracy": 0.16556593775749207,
"num_tokens": 23291114.0,
"step": 13425
},
{
"entropy": 5.438701438903808,
"epoch": 1.044893989496207,
"grad_norm": 1.3046875,
"learning_rate": 0.000489534207756834,
"loss": 5.1566,
"mean_token_accuracy": 0.18234228044748307,
"num_tokens": 23300525.0,
"step": 13430
},
{
"entropy": 5.476650285720825,
"epoch": 1.0452830188679245,
"grad_norm": 1.4921875,
"learning_rate": 0.0004895258515618293,
"loss": 5.2417,
"mean_token_accuracy": 0.17851203978061675,
"num_tokens": 23308984.0,
"step": 13435
},
{
"entropy": 5.519491863250733,
"epoch": 1.045672048239642,
"grad_norm": 2.03125,
"learning_rate": 0.0004895174921117362,
"loss": 5.3512,
"mean_token_accuracy": 0.16742511093616486,
"num_tokens": 23318137.0,
"step": 13440
},
{
"entropy": 5.626071977615356,
"epoch": 1.0460610776113597,
"grad_norm": 1.421875,
"learning_rate": 0.0004895091294066816,
"loss": 5.4069,
"mean_token_accuracy": 0.1664462596178055,
"num_tokens": 23326276.0,
"step": 13445
},
{
"entropy": 5.562966680526733,
"epoch": 1.0464501069830772,
"grad_norm": 1.4375,
"learning_rate": 0.0004895007634467924,
"loss": 5.2888,
"mean_token_accuracy": 0.17338868528604506,
"num_tokens": 23334578.0,
"step": 13450
},
{
"entropy": 5.467001962661743,
"epoch": 1.0468391363547949,
"grad_norm": 1.3671875,
"learning_rate": 0.0004894923942321955,
"loss": 5.3221,
"mean_token_accuracy": 0.1677706092596054,
"num_tokens": 23344173.0,
"step": 13455
},
{
"entropy": 5.491952705383301,
"epoch": 1.0472281657265123,
"grad_norm": 1.4921875,
"learning_rate": 0.0004894840217630179,
"loss": 5.1781,
"mean_token_accuracy": 0.17806885540485382,
"num_tokens": 23353098.0,
"step": 13460
},
{
"entropy": 5.572282505035401,
"epoch": 1.0476171950982298,
"grad_norm": 1.390625,
"learning_rate": 0.0004894756460393868,
"loss": 5.3245,
"mean_token_accuracy": 0.1694008782505989,
"num_tokens": 23362364.0,
"step": 13465
},
{
"entropy": 5.548322963714599,
"epoch": 1.0480062244699475,
"grad_norm": 1.3203125,
"learning_rate": 0.000489467267061429,
"loss": 5.3417,
"mean_token_accuracy": 0.1688351735472679,
"num_tokens": 23371903.0,
"step": 13470
},
{
"entropy": 5.52583589553833,
"epoch": 1.048395253841665,
"grad_norm": 1.3671875,
"learning_rate": 0.0004894588848292718,
"loss": 5.2557,
"mean_token_accuracy": 0.18037861138582229,
"num_tokens": 23381711.0,
"step": 13475
},
{
"entropy": 5.495605516433716,
"epoch": 1.0487842832133827,
"grad_norm": 1.453125,
"learning_rate": 0.0004894504993430425,
"loss": 5.219,
"mean_token_accuracy": 0.17501617670059205,
"num_tokens": 23389812.0,
"step": 13480
},
{
"entropy": 5.51205792427063,
"epoch": 1.0491733125851002,
"grad_norm": 1.4921875,
"learning_rate": 0.000489442110602868,
"loss": 5.2795,
"mean_token_accuracy": 0.17062579244375228,
"num_tokens": 23399231.0,
"step": 13485
},
{
"entropy": 5.486600875854492,
"epoch": 1.0495623419568176,
"grad_norm": 1.5,
"learning_rate": 0.0004894337186088759,
"loss": 5.2378,
"mean_token_accuracy": 0.16807817220687865,
"num_tokens": 23407764.0,
"step": 13490
},
{
"entropy": 5.512649393081665,
"epoch": 1.0499513713285353,
"grad_norm": 1.421875,
"learning_rate": 0.0004894253233611934,
"loss": 5.1985,
"mean_token_accuracy": 0.17123304754495622,
"num_tokens": 23416368.0,
"step": 13495
},
{
"entropy": 5.5942949771881105,
"epoch": 1.0503404007002528,
"grad_norm": 1.6953125,
"learning_rate": 0.000489416924859948,
"loss": 5.4472,
"mean_token_accuracy": 0.16766640692949294,
"num_tokens": 23425415.0,
"step": 13500
},
{
"entropy": 5.4984533309936525,
"epoch": 1.0507294300719705,
"grad_norm": 1.453125,
"learning_rate": 0.000489408523105267,
"loss": 5.2443,
"mean_token_accuracy": 0.17002047300338746,
"num_tokens": 23433435.0,
"step": 13505
},
{
"entropy": 5.5616655349731445,
"epoch": 1.051118459443688,
"grad_norm": 1.4609375,
"learning_rate": 0.0004894001180972779,
"loss": 5.3129,
"mean_token_accuracy": 0.1687181130051613,
"num_tokens": 23442002.0,
"step": 13510
},
{
"entropy": 5.421151113510132,
"epoch": 1.0515074888154055,
"grad_norm": 1.3046875,
"learning_rate": 0.0004893917098361082,
"loss": 5.1016,
"mean_token_accuracy": 0.17431665509939193,
"num_tokens": 23450437.0,
"step": 13515
},
{
"entropy": 5.3939250946044925,
"epoch": 1.0518965181871232,
"grad_norm": 1.390625,
"learning_rate": 0.0004893832983218856,
"loss": 5.2015,
"mean_token_accuracy": 0.18134456276893615,
"num_tokens": 23458755.0,
"step": 13520
},
{
"entropy": 5.469194555282593,
"epoch": 1.0522855475588406,
"grad_norm": 1.375,
"learning_rate": 0.0004893748835547377,
"loss": 5.3228,
"mean_token_accuracy": 0.17383601516485214,
"num_tokens": 23467138.0,
"step": 13525
},
{
"entropy": 5.461789560317993,
"epoch": 1.0526745769305583,
"grad_norm": 1.390625,
"learning_rate": 0.0004893664655347921,
"loss": 5.1855,
"mean_token_accuracy": 0.18599656522274016,
"num_tokens": 23475494.0,
"step": 13530
},
{
"entropy": 5.423098468780518,
"epoch": 1.0530636063022758,
"grad_norm": 1.4140625,
"learning_rate": 0.0004893580442621767,
"loss": 5.1245,
"mean_token_accuracy": 0.18259056955575942,
"num_tokens": 23484215.0,
"step": 13535
},
{
"entropy": 5.38731894493103,
"epoch": 1.0534526356739935,
"grad_norm": 1.5625,
"learning_rate": 0.000489349619737019,
"loss": 5.2327,
"mean_token_accuracy": 0.1701631173491478,
"num_tokens": 23492604.0,
"step": 13540
},
{
"entropy": 5.6060703754425045,
"epoch": 1.053841665045711,
"grad_norm": 1.4921875,
"learning_rate": 0.000489341191959447,
"loss": 5.4775,
"mean_token_accuracy": 0.16311267167329788,
"num_tokens": 23501817.0,
"step": 13545
},
{
"entropy": 5.674867439270019,
"epoch": 1.0542306944174284,
"grad_norm": 1.6640625,
"learning_rate": 0.0004893327609295887,
"loss": 5.3426,
"mean_token_accuracy": 0.17258263975381852,
"num_tokens": 23509996.0,
"step": 13550
},
{
"entropy": 5.4278984546661375,
"epoch": 1.0546197237891461,
"grad_norm": 1.9921875,
"learning_rate": 0.0004893243266475719,
"loss": 5.102,
"mean_token_accuracy": 0.1872847184538841,
"num_tokens": 23518316.0,
"step": 13555
},
{
"entropy": 5.363415908813477,
"epoch": 1.0550087531608636,
"grad_norm": 1.734375,
"learning_rate": 0.0004893158891135245,
"loss": 5.3373,
"mean_token_accuracy": 0.1713738903403282,
"num_tokens": 23526851.0,
"step": 13560
},
{
"entropy": 5.562817478179932,
"epoch": 1.055397782532581,
"grad_norm": 1.4765625,
"learning_rate": 0.0004893074483275746,
"loss": 5.1991,
"mean_token_accuracy": 0.1810261145234108,
"num_tokens": 23534757.0,
"step": 13565
},
{
"entropy": 5.489916658401489,
"epoch": 1.0557868119042988,
"grad_norm": 1.359375,
"learning_rate": 0.0004892990042898503,
"loss": 5.2811,
"mean_token_accuracy": 0.16816927790641784,
"num_tokens": 23544102.0,
"step": 13570
},
{
"entropy": 5.450853300094605,
"epoch": 1.0561758412760163,
"grad_norm": 1.671875,
"learning_rate": 0.0004892905570004798,
"loss": 5.3325,
"mean_token_accuracy": 0.16643284410238265,
"num_tokens": 23552663.0,
"step": 13575
},
{
"entropy": 5.45705623626709,
"epoch": 1.056564870647734,
"grad_norm": 1.4453125,
"learning_rate": 0.000489282106459591,
"loss": 5.2202,
"mean_token_accuracy": 0.1761070415377617,
"num_tokens": 23561144.0,
"step": 13580
},
{
"entropy": 5.475066709518432,
"epoch": 1.0569539000194514,
"grad_norm": 1.375,
"learning_rate": 0.0004892736526673124,
"loss": 5.1921,
"mean_token_accuracy": 0.1789240226149559,
"num_tokens": 23569833.0,
"step": 13585
},
{
"entropy": 5.513002824783325,
"epoch": 1.0573429293911691,
"grad_norm": 1.5,
"learning_rate": 0.0004892651956237721,
"loss": 5.2696,
"mean_token_accuracy": 0.1695745050907135,
"num_tokens": 23578643.0,
"step": 13590
},
{
"entropy": 5.526211166381836,
"epoch": 1.0577319587628866,
"grad_norm": 1.578125,
"learning_rate": 0.0004892567353290986,
"loss": 5.3303,
"mean_token_accuracy": 0.16901452243328094,
"num_tokens": 23587324.0,
"step": 13595
},
{
"entropy": 5.484643411636353,
"epoch": 1.058120988134604,
"grad_norm": 1.5078125,
"learning_rate": 0.0004892482717834201,
"loss": 5.2859,
"mean_token_accuracy": 0.17125508487224578,
"num_tokens": 23595670.0,
"step": 13600
},
{
"entropy": 5.501117610931397,
"epoch": 1.0585100175063218,
"grad_norm": 1.6015625,
"learning_rate": 0.0004892398049868651,
"loss": 5.1955,
"mean_token_accuracy": 0.18598539382219315,
"num_tokens": 23603833.0,
"step": 13605
},
{
"entropy": 5.489117765426636,
"epoch": 1.0588990468780393,
"grad_norm": 1.609375,
"learning_rate": 0.000489231334939562,
"loss": 5.2803,
"mean_token_accuracy": 0.170607028901577,
"num_tokens": 23612815.0,
"step": 13610
},
{
"entropy": 5.495545959472656,
"epoch": 1.059288076249757,
"grad_norm": 1.4140625,
"learning_rate": 0.0004892228616416395,
"loss": 5.2759,
"mean_token_accuracy": 0.17046092450618744,
"num_tokens": 23621178.0,
"step": 13615
},
{
"entropy": 5.521439266204834,
"epoch": 1.0596771056214744,
"grad_norm": 1.6015625,
"learning_rate": 0.0004892143850932259,
"loss": 5.4818,
"mean_token_accuracy": 0.1657577119767666,
"num_tokens": 23630681.0,
"step": 13620
},
{
"entropy": 5.606350326538086,
"epoch": 1.060066134993192,
"grad_norm": 1.359375,
"learning_rate": 0.00048920590529445,
"loss": 5.2601,
"mean_token_accuracy": 0.1809553548693657,
"num_tokens": 23639374.0,
"step": 13625
},
{
"entropy": 5.511284446716308,
"epoch": 1.0604551643649096,
"grad_norm": 1.328125,
"learning_rate": 0.0004891974222454406,
"loss": 5.2775,
"mean_token_accuracy": 0.17681968212127686,
"num_tokens": 23648217.0,
"step": 13630
},
{
"entropy": 5.525805997848511,
"epoch": 1.060844193736627,
"grad_norm": 1.3671875,
"learning_rate": 0.0004891889359463261,
"loss": 5.2448,
"mean_token_accuracy": 0.1823773980140686,
"num_tokens": 23656688.0,
"step": 13635
},
{
"entropy": 5.478025293350219,
"epoch": 1.0612332231083448,
"grad_norm": 1.328125,
"learning_rate": 0.0004891804463972354,
"loss": 5.3423,
"mean_token_accuracy": 0.17352458238601684,
"num_tokens": 23666646.0,
"step": 13640
},
{
"entropy": 5.465211963653564,
"epoch": 1.0616222524800623,
"grad_norm": 1.46875,
"learning_rate": 0.0004891719535982974,
"loss": 5.2215,
"mean_token_accuracy": 0.18674075454473496,
"num_tokens": 23675278.0,
"step": 13645
},
{
"entropy": 5.568284606933593,
"epoch": 1.0620112818517797,
"grad_norm": 1.4296875,
"learning_rate": 0.0004891634575496408,
"loss": 5.3292,
"mean_token_accuracy": 0.16905170828104019,
"num_tokens": 23684263.0,
"step": 13650
},
{
"entropy": 5.520307779312134,
"epoch": 1.0624003112234974,
"grad_norm": 1.5546875,
"learning_rate": 0.0004891549582513946,
"loss": 5.1674,
"mean_token_accuracy": 0.18085059076547622,
"num_tokens": 23692249.0,
"step": 13655
},
{
"entropy": 5.528056287765503,
"epoch": 1.062789340595215,
"grad_norm": 1.4765625,
"learning_rate": 0.000489146455703688,
"loss": 5.3893,
"mean_token_accuracy": 0.1735594689846039,
"num_tokens": 23701082.0,
"step": 13660
},
{
"entropy": 5.488478803634644,
"epoch": 1.0631783699669326,
"grad_norm": 1.4375,
"learning_rate": 0.0004891379499066495,
"loss": 5.339,
"mean_token_accuracy": 0.16487124264240266,
"num_tokens": 23710277.0,
"step": 13665
},
{
"entropy": 5.5258571147918705,
"epoch": 1.06356739933865,
"grad_norm": 1.484375,
"learning_rate": 0.0004891294408604087,
"loss": 5.3009,
"mean_token_accuracy": 0.17213804572820662,
"num_tokens": 23719131.0,
"step": 13670
},
{
"entropy": 5.435294198989868,
"epoch": 1.0639564287103676,
"grad_norm": 1.40625,
"learning_rate": 0.0004891209285650942,
"loss": 5.2157,
"mean_token_accuracy": 0.17662305384874344,
"num_tokens": 23727674.0,
"step": 13675
},
{
"entropy": 5.5362263202667235,
"epoch": 1.0643454580820852,
"grad_norm": 1.578125,
"learning_rate": 0.0004891124130208355,
"loss": 5.3673,
"mean_token_accuracy": 0.16604161858558655,
"num_tokens": 23736181.0,
"step": 13680
},
{
"entropy": 5.456675100326538,
"epoch": 1.0647344874538027,
"grad_norm": 1.46875,
"learning_rate": 0.0004891038942277618,
"loss": 5.2362,
"mean_token_accuracy": 0.1761413961648941,
"num_tokens": 23744552.0,
"step": 13685
},
{
"entropy": 5.585657119750977,
"epoch": 1.0651235168255204,
"grad_norm": 1.5,
"learning_rate": 0.0004890953721860022,
"loss": 5.3797,
"mean_token_accuracy": 0.16632058024406432,
"num_tokens": 23753755.0,
"step": 13690
},
{
"entropy": 5.528018474578857,
"epoch": 1.065512546197238,
"grad_norm": 1.484375,
"learning_rate": 0.0004890868468956862,
"loss": 5.2732,
"mean_token_accuracy": 0.17564847469329833,
"num_tokens": 23761759.0,
"step": 13695
},
{
"entropy": 5.455029535293579,
"epoch": 1.0659015755689554,
"grad_norm": 1.6171875,
"learning_rate": 0.000489078318356943,
"loss": 5.2832,
"mean_token_accuracy": 0.16916959285736083,
"num_tokens": 23769952.0,
"step": 13700
},
{
"entropy": 5.455484914779663,
"epoch": 1.066290604940673,
"grad_norm": 1.7109375,
"learning_rate": 0.0004890697865699021,
"loss": 5.296,
"mean_token_accuracy": 0.1771170452237129,
"num_tokens": 23778045.0,
"step": 13705
},
{
"entropy": 5.527831268310547,
"epoch": 1.0666796343123905,
"grad_norm": 1.53125,
"learning_rate": 0.0004890612515346929,
"loss": 5.2693,
"mean_token_accuracy": 0.17209134697914125,
"num_tokens": 23787477.0,
"step": 13710
},
{
"entropy": 5.52645320892334,
"epoch": 1.0670686636841082,
"grad_norm": 1.375,
"learning_rate": 0.0004890527132514448,
"loss": 5.2298,
"mean_token_accuracy": 0.18076589256525039,
"num_tokens": 23795905.0,
"step": 13715
},
{
"entropy": 5.537902879714966,
"epoch": 1.0674576930558257,
"grad_norm": 1.453125,
"learning_rate": 0.0004890441717202876,
"loss": 5.3202,
"mean_token_accuracy": 0.17314850389957429,
"num_tokens": 23804339.0,
"step": 13720
},
{
"entropy": 5.508216476440429,
"epoch": 1.0678467224275432,
"grad_norm": 1.5703125,
"learning_rate": 0.0004890356269413507,
"loss": 5.3149,
"mean_token_accuracy": 0.17237518727779388,
"num_tokens": 23813032.0,
"step": 13725
},
{
"entropy": 5.469225978851318,
"epoch": 1.068235751799261,
"grad_norm": 1.5625,
"learning_rate": 0.000489027078914764,
"loss": 5.2067,
"mean_token_accuracy": 0.1862444743514061,
"num_tokens": 23822047.0,
"step": 13730
},
{
"entropy": 5.376841926574707,
"epoch": 1.0686247811709784,
"grad_norm": 1.546875,
"learning_rate": 0.0004890185276406569,
"loss": 5.1837,
"mean_token_accuracy": 0.17995652109384536,
"num_tokens": 23831220.0,
"step": 13735
},
{
"entropy": 5.509959125518799,
"epoch": 1.069013810542696,
"grad_norm": 1.53125,
"learning_rate": 0.0004890099731191592,
"loss": 5.3625,
"mean_token_accuracy": 0.16882993131875992,
"num_tokens": 23840118.0,
"step": 13740
},
{
"entropy": 5.51298885345459,
"epoch": 1.0694028399144135,
"grad_norm": 1.640625,
"learning_rate": 0.000489001415350401,
"loss": 5.2921,
"mean_token_accuracy": 0.17207494974136353,
"num_tokens": 23848826.0,
"step": 13745
},
{
"entropy": 5.581535530090332,
"epoch": 1.069791869286131,
"grad_norm": 1.5234375,
"learning_rate": 0.0004889928543345118,
"loss": 5.426,
"mean_token_accuracy": 0.1689763769507408,
"num_tokens": 23857462.0,
"step": 13750
},
{
"entropy": 5.515957069396973,
"epoch": 1.0701808986578487,
"grad_norm": 1.4296875,
"learning_rate": 0.0004889842900716217,
"loss": 5.2581,
"mean_token_accuracy": 0.1731693923473358,
"num_tokens": 23866842.0,
"step": 13755
},
{
"entropy": 5.507188034057617,
"epoch": 1.0705699280295662,
"grad_norm": 1.5703125,
"learning_rate": 0.0004889757225618606,
"loss": 5.3104,
"mean_token_accuracy": 0.16708216518163682,
"num_tokens": 23875079.0,
"step": 13760
},
{
"entropy": 5.5463803768157955,
"epoch": 1.0709589574012839,
"grad_norm": 1.84375,
"learning_rate": 0.0004889671518053584,
"loss": 5.2548,
"mean_token_accuracy": 0.17044838666915893,
"num_tokens": 23883963.0,
"step": 13765
},
{
"entropy": 5.4997642040252686,
"epoch": 1.0713479867730014,
"grad_norm": 1.71875,
"learning_rate": 0.0004889585778022453,
"loss": 5.239,
"mean_token_accuracy": 0.18146473914384842,
"num_tokens": 23892709.0,
"step": 13770
},
{
"entropy": 5.492747068405151,
"epoch": 1.0717370161447188,
"grad_norm": 1.8046875,
"learning_rate": 0.0004889500005526514,
"loss": 5.3804,
"mean_token_accuracy": 0.17092076316475868,
"num_tokens": 23901124.0,
"step": 13775
},
{
"entropy": 5.535728645324707,
"epoch": 1.0721260455164365,
"grad_norm": 1.3515625,
"learning_rate": 0.0004889414200567067,
"loss": 5.3293,
"mean_token_accuracy": 0.16633498817682266,
"num_tokens": 23909442.0,
"step": 13780
},
{
"entropy": 5.512922954559326,
"epoch": 1.072515074888154,
"grad_norm": 1.546875,
"learning_rate": 0.0004889328363145415,
"loss": 5.2777,
"mean_token_accuracy": 0.17441274374723434,
"num_tokens": 23918143.0,
"step": 13785
},
{
"entropy": 5.489599895477295,
"epoch": 1.0729041042598717,
"grad_norm": 1.6328125,
"learning_rate": 0.0004889242493262859,
"loss": 5.245,
"mean_token_accuracy": 0.1780176654458046,
"num_tokens": 23926432.0,
"step": 13790
},
{
"entropy": 5.57047758102417,
"epoch": 1.0732931336315892,
"grad_norm": 1.6640625,
"learning_rate": 0.0004889156590920704,
"loss": 5.3727,
"mean_token_accuracy": 0.16337321549654008,
"num_tokens": 23935362.0,
"step": 13795
},
{
"entropy": 5.458642387390137,
"epoch": 1.0736821630033067,
"grad_norm": 1.375,
"learning_rate": 0.0004889070656120253,
"loss": 5.1366,
"mean_token_accuracy": 0.17875975072383882,
"num_tokens": 23943926.0,
"step": 13800
},
{
"entropy": 5.469856405258179,
"epoch": 1.0740711923750244,
"grad_norm": 1.484375,
"learning_rate": 0.0004888984688862809,
"loss": 5.2823,
"mean_token_accuracy": 0.175020931661129,
"num_tokens": 23952513.0,
"step": 13805
},
{
"entropy": 5.4628509998321535,
"epoch": 1.0744602217467418,
"grad_norm": 1.6484375,
"learning_rate": 0.0004888898689149677,
"loss": 5.3335,
"mean_token_accuracy": 0.1650994449853897,
"num_tokens": 23961529.0,
"step": 13810
},
{
"entropy": 5.636935758590698,
"epoch": 1.0748492511184595,
"grad_norm": 1.3828125,
"learning_rate": 0.0004888812656982162,
"loss": 5.3822,
"mean_token_accuracy": 0.16842030137777328,
"num_tokens": 23971156.0,
"step": 13815
},
{
"entropy": 5.572997665405273,
"epoch": 1.075238280490177,
"grad_norm": 1.8046875,
"learning_rate": 0.0004888726592361569,
"loss": 5.2832,
"mean_token_accuracy": 0.17064432203769683,
"num_tokens": 23979676.0,
"step": 13820
},
{
"entropy": 5.519537258148193,
"epoch": 1.0756273098618945,
"grad_norm": 1.515625,
"learning_rate": 0.0004888640495289204,
"loss": 5.2279,
"mean_token_accuracy": 0.1808910682797432,
"num_tokens": 23987764.0,
"step": 13825
},
{
"entropy": 5.549085712432861,
"epoch": 1.0760163392336122,
"grad_norm": 1.546875,
"learning_rate": 0.0004888554365766374,
"loss": 5.2696,
"mean_token_accuracy": 0.16803651452064514,
"num_tokens": 23995844.0,
"step": 13830
},
{
"entropy": 5.552345895767212,
"epoch": 1.0764053686053296,
"grad_norm": 1.6953125,
"learning_rate": 0.0004888468203794385,
"loss": 5.3576,
"mean_token_accuracy": 0.16544483453035355,
"num_tokens": 24003824.0,
"step": 13835
},
{
"entropy": 5.463160610198974,
"epoch": 1.0767943979770473,
"grad_norm": 1.5546875,
"learning_rate": 0.0004888382009374545,
"loss": 5.292,
"mean_token_accuracy": 0.1725937694311142,
"num_tokens": 24012471.0,
"step": 13840
},
{
"entropy": 5.525017404556275,
"epoch": 1.0771834273487648,
"grad_norm": 1.578125,
"learning_rate": 0.0004888295782508161,
"loss": 5.2662,
"mean_token_accuracy": 0.17510892897844316,
"num_tokens": 24021344.0,
"step": 13845
},
{
"entropy": 5.486898756027221,
"epoch": 1.0775724567204823,
"grad_norm": 1.59375,
"learning_rate": 0.0004888209523196542,
"loss": 5.2607,
"mean_token_accuracy": 0.17639965415000916,
"num_tokens": 24029598.0,
"step": 13850
},
{
"entropy": 5.484881019592285,
"epoch": 1.0779614860922,
"grad_norm": 1.40625,
"learning_rate": 0.0004888123231440997,
"loss": 5.2767,
"mean_token_accuracy": 0.1789987400174141,
"num_tokens": 24038097.0,
"step": 13855
},
{
"entropy": 5.533191394805908,
"epoch": 1.0783505154639175,
"grad_norm": 1.59375,
"learning_rate": 0.0004888036907242834,
"loss": 5.3323,
"mean_token_accuracy": 0.17413052171468735,
"num_tokens": 24046812.0,
"step": 13860
},
{
"entropy": 5.528208303451538,
"epoch": 1.0787395448356352,
"grad_norm": 1.5390625,
"learning_rate": 0.0004887950550603366,
"loss": 5.2836,
"mean_token_accuracy": 0.17413816899061202,
"num_tokens": 24054908.0,
"step": 13865
},
{
"entropy": 5.452695608139038,
"epoch": 1.0791285742073526,
"grad_norm": 1.4453125,
"learning_rate": 0.0004887864161523901,
"loss": 5.2676,
"mean_token_accuracy": 0.17835528701543807,
"num_tokens": 24063695.0,
"step": 13870
},
{
"entropy": 5.503851222991943,
"epoch": 1.0795176035790701,
"grad_norm": 1.40625,
"learning_rate": 0.0004887777740005749,
"loss": 5.2661,
"mean_token_accuracy": 0.18128465861082077,
"num_tokens": 24072481.0,
"step": 13875
},
{
"entropy": 5.448667240142822,
"epoch": 1.0799066329507878,
"grad_norm": 1.4921875,
"learning_rate": 0.0004887691286050224,
"loss": 5.2707,
"mean_token_accuracy": 0.17877298444509507,
"num_tokens": 24080751.0,
"step": 13880
},
{
"entropy": 5.48421049118042,
"epoch": 1.0802956623225053,
"grad_norm": 1.4453125,
"learning_rate": 0.0004887604799658635,
"loss": 5.2654,
"mean_token_accuracy": 0.1737658679485321,
"num_tokens": 24088618.0,
"step": 13885
},
{
"entropy": 5.5620828628540036,
"epoch": 1.080684691694223,
"grad_norm": 1.5234375,
"learning_rate": 0.0004887518280832295,
"loss": 5.345,
"mean_token_accuracy": 0.17011184096336365,
"num_tokens": 24096754.0,
"step": 13890
},
{
"entropy": 5.532328653335571,
"epoch": 1.0810737210659405,
"grad_norm": 1.7421875,
"learning_rate": 0.0004887431729572519,
"loss": 5.3002,
"mean_token_accuracy": 0.1793048232793808,
"num_tokens": 24104793.0,
"step": 13895
},
{
"entropy": 5.667744255065918,
"epoch": 1.081462750437658,
"grad_norm": 1.734375,
"learning_rate": 0.0004887345145880617,
"loss": 5.4321,
"mean_token_accuracy": 0.15813654214143752,
"num_tokens": 24113816.0,
"step": 13900
},
{
"entropy": 5.493576860427856,
"epoch": 1.0818517798093756,
"grad_norm": 1.75,
"learning_rate": 0.0004887258529757904,
"loss": 5.2002,
"mean_token_accuracy": 0.17426275163888932,
"num_tokens": 24123002.0,
"step": 13905
},
{
"entropy": 5.499223804473877,
"epoch": 1.082240809181093,
"grad_norm": 1.609375,
"learning_rate": 0.0004887171881205696,
"loss": 5.2648,
"mean_token_accuracy": 0.17826527506113052,
"num_tokens": 24130841.0,
"step": 13910
},
{
"entropy": 5.498661088943481,
"epoch": 1.0826298385528108,
"grad_norm": 1.671875,
"learning_rate": 0.0004887085200225306,
"loss": 5.3304,
"mean_token_accuracy": 0.16763283759355546,
"num_tokens": 24139236.0,
"step": 13915
},
{
"entropy": 5.502839183807373,
"epoch": 1.0830188679245283,
"grad_norm": 1.6953125,
"learning_rate": 0.0004886998486818049,
"loss": 5.1958,
"mean_token_accuracy": 0.17567423582077027,
"num_tokens": 24147824.0,
"step": 13920
},
{
"entropy": 5.5200048923492435,
"epoch": 1.083407897296246,
"grad_norm": 1.7265625,
"learning_rate": 0.0004886911740985242,
"loss": 5.3113,
"mean_token_accuracy": 0.1778162971138954,
"num_tokens": 24156555.0,
"step": 13925
},
{
"entropy": 5.562920188903808,
"epoch": 1.0837969266679635,
"grad_norm": 1.75,
"learning_rate": 0.00048868249627282,
"loss": 5.2392,
"mean_token_accuracy": 0.17716726660728455,
"num_tokens": 24164424.0,
"step": 13930
},
{
"entropy": 5.556947088241577,
"epoch": 1.084185956039681,
"grad_norm": 1.421875,
"learning_rate": 0.000488673815204824,
"loss": 5.2657,
"mean_token_accuracy": 0.17522095143795013,
"num_tokens": 24173325.0,
"step": 13935
},
{
"entropy": 5.570267677307129,
"epoch": 1.0845749854113986,
"grad_norm": 1.46875,
"learning_rate": 0.0004886651308946681,
"loss": 5.4047,
"mean_token_accuracy": 0.16763739436864852,
"num_tokens": 24181781.0,
"step": 13940
},
{
"entropy": 5.538307142257691,
"epoch": 1.084964014783116,
"grad_norm": 1.484375,
"learning_rate": 0.0004886564433424839,
"loss": 5.2259,
"mean_token_accuracy": 0.17270767837762832,
"num_tokens": 24190065.0,
"step": 13945
},
{
"entropy": 5.530714750289917,
"epoch": 1.0853530441548336,
"grad_norm": 1.453125,
"learning_rate": 0.0004886477525484032,
"loss": 5.3773,
"mean_token_accuracy": 0.15824755132198334,
"num_tokens": 24198814.0,
"step": 13950
},
{
"entropy": 5.504873752593994,
"epoch": 1.0857420735265513,
"grad_norm": 1.4609375,
"learning_rate": 0.0004886390585125579,
"loss": 5.2598,
"mean_token_accuracy": 0.17002679109573365,
"num_tokens": 24208008.0,
"step": 13955
},
{
"entropy": 5.570418977737427,
"epoch": 1.0861311028982688,
"grad_norm": 1.5078125,
"learning_rate": 0.0004886303612350799,
"loss": 5.2475,
"mean_token_accuracy": 0.17582174241542817,
"num_tokens": 24216098.0,
"step": 13960
},
{
"entropy": 5.388692474365234,
"epoch": 1.0865201322699864,
"grad_norm": 1.4609375,
"learning_rate": 0.0004886216607161013,
"loss": 5.1886,
"mean_token_accuracy": 0.17689920961856842,
"num_tokens": 24224943.0,
"step": 13965
},
{
"entropy": 5.472116184234619,
"epoch": 1.086909161641704,
"grad_norm": 1.5546875,
"learning_rate": 0.0004886129569557538,
"loss": 5.2458,
"mean_token_accuracy": 0.16619395166635514,
"num_tokens": 24232950.0,
"step": 13970
},
{
"entropy": 5.589103507995605,
"epoch": 1.0872981910134216,
"grad_norm": 1.5,
"learning_rate": 0.0004886042499541699,
"loss": 5.3923,
"mean_token_accuracy": 0.16164568513631822,
"num_tokens": 24242355.0,
"step": 13975
},
{
"entropy": 5.543732023239135,
"epoch": 1.087687220385139,
"grad_norm": 1.34375,
"learning_rate": 0.0004885955397114813,
"loss": 5.2482,
"mean_token_accuracy": 0.17452059984207152,
"num_tokens": 24251247.0,
"step": 13980
},
{
"entropy": 5.498383712768555,
"epoch": 1.0880762497568566,
"grad_norm": 1.46875,
"learning_rate": 0.0004885868262278205,
"loss": 5.3242,
"mean_token_accuracy": 0.1711634576320648,
"num_tokens": 24260281.0,
"step": 13985
},
{
"entropy": 5.607320308685303,
"epoch": 1.0884652791285743,
"grad_norm": 1.4765625,
"learning_rate": 0.0004885781095033195,
"loss": 5.3465,
"mean_token_accuracy": 0.16992434710264206,
"num_tokens": 24268474.0,
"step": 13990
},
{
"entropy": 5.569406509399414,
"epoch": 1.0888543085002917,
"grad_norm": 1.359375,
"learning_rate": 0.0004885693895381108,
"loss": 5.3184,
"mean_token_accuracy": 0.17732724398374558,
"num_tokens": 24276897.0,
"step": 13995
},
{
"entropy": 5.526185989379883,
"epoch": 1.0892433378720092,
"grad_norm": 1.4140625,
"learning_rate": 0.0004885606663323263,
"loss": 5.2956,
"mean_token_accuracy": 0.17122695297002793,
"num_tokens": 24285892.0,
"step": 14000
},
{
"entropy": 5.494509553909301,
"epoch": 1.089632367243727,
"grad_norm": 1.6171875,
"learning_rate": 0.0004885519398860987,
"loss": 5.3126,
"mean_token_accuracy": 0.17743243128061295,
"num_tokens": 24294141.0,
"step": 14005
},
{
"entropy": 5.455658960342407,
"epoch": 1.0900213966154444,
"grad_norm": 1.5234375,
"learning_rate": 0.0004885432101995604,
"loss": 5.2563,
"mean_token_accuracy": 0.17039165049791336,
"num_tokens": 24302803.0,
"step": 14010
},
{
"entropy": 5.64307746887207,
"epoch": 1.090410425987162,
"grad_norm": 1.4765625,
"learning_rate": 0.0004885344772728436,
"loss": 5.4248,
"mean_token_accuracy": 0.16275346875190735,
"num_tokens": 24311755.0,
"step": 14015
},
{
"entropy": 5.515815353393554,
"epoch": 1.0907994553588796,
"grad_norm": 1.625,
"learning_rate": 0.0004885257411060812,
"loss": 5.242,
"mean_token_accuracy": 0.18066604137420655,
"num_tokens": 24320913.0,
"step": 14020
},
{
"entropy": 5.573009300231933,
"epoch": 1.0911884847305973,
"grad_norm": 1.4609375,
"learning_rate": 0.0004885170016994053,
"loss": 5.429,
"mean_token_accuracy": 0.16419671177864076,
"num_tokens": 24331112.0,
"step": 14025
},
{
"entropy": 5.47002010345459,
"epoch": 1.0915775141023147,
"grad_norm": 1.3203125,
"learning_rate": 0.0004885082590529489,
"loss": 5.2034,
"mean_token_accuracy": 0.16966800689697265,
"num_tokens": 24339286.0,
"step": 14030
},
{
"entropy": 5.489774703979492,
"epoch": 1.0919665434740322,
"grad_norm": 1.5625,
"learning_rate": 0.0004884995131668445,
"loss": 5.2234,
"mean_token_accuracy": 0.17345633655786513,
"num_tokens": 24347787.0,
"step": 14035
},
{
"entropy": 5.512749528884887,
"epoch": 1.09235557284575,
"grad_norm": 1.3984375,
"learning_rate": 0.0004884907640412248,
"loss": 5.206,
"mean_token_accuracy": 0.18087660074234008,
"num_tokens": 24356340.0,
"step": 14040
},
{
"entropy": 5.493124723434448,
"epoch": 1.0927446022174674,
"grad_norm": 1.3984375,
"learning_rate": 0.0004884820116762225,
"loss": 5.2968,
"mean_token_accuracy": 0.16501840054988862,
"num_tokens": 24365182.0,
"step": 14045
},
{
"entropy": 5.5643104076385494,
"epoch": 1.093133631589185,
"grad_norm": 1.4921875,
"learning_rate": 0.0004884732560719706,
"loss": 5.3258,
"mean_token_accuracy": 0.170979143679142,
"num_tokens": 24373455.0,
"step": 14050
},
{
"entropy": 5.576919460296631,
"epoch": 1.0935226609609026,
"grad_norm": 1.421875,
"learning_rate": 0.0004884644972286017,
"loss": 5.4021,
"mean_token_accuracy": 0.1658269241452217,
"num_tokens": 24382433.0,
"step": 14055
},
{
"entropy": 5.466411495208741,
"epoch": 1.09391169033262,
"grad_norm": 1.515625,
"learning_rate": 0.0004884557351462488,
"loss": 5.2123,
"mean_token_accuracy": 0.1760855197906494,
"num_tokens": 24390971.0,
"step": 14060
},
{
"entropy": 5.540451145172119,
"epoch": 1.0943007197043377,
"grad_norm": 1.9765625,
"learning_rate": 0.0004884469698250449,
"loss": 5.268,
"mean_token_accuracy": 0.1665873035788536,
"num_tokens": 24399508.0,
"step": 14065
},
{
"entropy": 5.513807106018066,
"epoch": 1.0946897490760552,
"grad_norm": 1.2734375,
"learning_rate": 0.000488438201265123,
"loss": 5.2397,
"mean_token_accuracy": 0.17556947767734526,
"num_tokens": 24408424.0,
"step": 14070
},
{
"entropy": 5.439089298248291,
"epoch": 1.095078778447773,
"grad_norm": 1.4921875,
"learning_rate": 0.0004884294294666161,
"loss": 5.3338,
"mean_token_accuracy": 0.16726643294095994,
"num_tokens": 24416918.0,
"step": 14075
},
{
"entropy": 5.498077535629273,
"epoch": 1.0954678078194904,
"grad_norm": 1.4296875,
"learning_rate": 0.0004884206544296573,
"loss": 5.1981,
"mean_token_accuracy": 0.1824410378932953,
"num_tokens": 24425779.0,
"step": 14080
},
{
"entropy": 5.4063379764556885,
"epoch": 1.0958568371912079,
"grad_norm": 1.484375,
"learning_rate": 0.0004884118761543797,
"loss": 5.216,
"mean_token_accuracy": 0.17712197154760362,
"num_tokens": 24434567.0,
"step": 14085
},
{
"entropy": 5.448072719573974,
"epoch": 1.0962458665629256,
"grad_norm": 1.6953125,
"learning_rate": 0.0004884030946409167,
"loss": 5.2988,
"mean_token_accuracy": 0.1740243747830391,
"num_tokens": 24442980.0,
"step": 14090
},
{
"entropy": 5.515756893157959,
"epoch": 1.096634895934643,
"grad_norm": 1.8203125,
"learning_rate": 0.0004883943098894013,
"loss": 5.2276,
"mean_token_accuracy": 0.17545544505119323,
"num_tokens": 24452273.0,
"step": 14095
},
{
"entropy": 5.566474723815918,
"epoch": 1.0970239253063607,
"grad_norm": 1.484375,
"learning_rate": 0.000488385521899967,
"loss": 5.327,
"mean_token_accuracy": 0.17111365646123886,
"num_tokens": 24461854.0,
"step": 14100
},
{
"entropy": 5.545776987075806,
"epoch": 1.0974129546780782,
"grad_norm": 1.3984375,
"learning_rate": 0.000488376730672747,
"loss": 5.382,
"mean_token_accuracy": 0.1663053661584854,
"num_tokens": 24470468.0,
"step": 14105
},
{
"entropy": 5.511515283584595,
"epoch": 1.0978019840497957,
"grad_norm": 1.4453125,
"learning_rate": 0.0004883679362078746,
"loss": 5.2336,
"mean_token_accuracy": 0.17532713562250138,
"num_tokens": 24479282.0,
"step": 14110
},
{
"entropy": 5.59149580001831,
"epoch": 1.0981910134215134,
"grad_norm": 1.4375,
"learning_rate": 0.0004883591385054836,
"loss": 5.3124,
"mean_token_accuracy": 0.17655971199274062,
"num_tokens": 24487331.0,
"step": 14115
},
{
"entropy": 5.49587459564209,
"epoch": 1.0985800427932308,
"grad_norm": 1.421875,
"learning_rate": 0.0004883503375657072,
"loss": 5.2278,
"mean_token_accuracy": 0.17757638692855834,
"num_tokens": 24496101.0,
"step": 14120
},
{
"entropy": 5.564512252807617,
"epoch": 1.0989690721649485,
"grad_norm": 1.515625,
"learning_rate": 0.0004883415333886789,
"loss": 5.3144,
"mean_token_accuracy": 0.16900820136070252,
"num_tokens": 24504321.0,
"step": 14125
},
{
"entropy": 5.527364253997803,
"epoch": 1.099358101536666,
"grad_norm": 1.3984375,
"learning_rate": 0.0004883327259745325,
"loss": 5.2132,
"mean_token_accuracy": 0.18230594992637633,
"num_tokens": 24511887.0,
"step": 14130
},
{
"entropy": 5.446292209625244,
"epoch": 1.0997471309083835,
"grad_norm": 1.59375,
"learning_rate": 0.0004883239153234015,
"loss": 5.2343,
"mean_token_accuracy": 0.1736101821064949,
"num_tokens": 24521188.0,
"step": 14135
},
{
"entropy": 5.53908143043518,
"epoch": 1.1001361602801012,
"grad_norm": 1.3515625,
"learning_rate": 0.0004883151014354197,
"loss": 5.2132,
"mean_token_accuracy": 0.17559333592653276,
"num_tokens": 24530656.0,
"step": 14140
},
{
"entropy": 5.483546781539917,
"epoch": 1.1005251896518187,
"grad_norm": 1.3671875,
"learning_rate": 0.0004883062843107207,
"loss": 5.2299,
"mean_token_accuracy": 0.17139920890331267,
"num_tokens": 24539438.0,
"step": 14145
},
{
"entropy": 5.498910617828369,
"epoch": 1.1009142190235364,
"grad_norm": 1.4609375,
"learning_rate": 0.0004882974639494383,
"loss": 5.3033,
"mean_token_accuracy": 0.17399274706840515,
"num_tokens": 24548005.0,
"step": 14150
},
{
"entropy": 5.566946887969971,
"epoch": 1.1013032483952538,
"grad_norm": 1.46875,
"learning_rate": 0.0004882886403517065,
"loss": 5.3681,
"mean_token_accuracy": 0.1682498037815094,
"num_tokens": 24556507.0,
"step": 14155
},
{
"entropy": 5.5137049674987795,
"epoch": 1.1016922777669713,
"grad_norm": 1.578125,
"learning_rate": 0.0004882798135176589,
"loss": 5.3057,
"mean_token_accuracy": 0.17206979393959046,
"num_tokens": 24565228.0,
"step": 14160
},
{
"entropy": 5.4789231300354,
"epoch": 1.102081307138689,
"grad_norm": 1.421875,
"learning_rate": 0.00048827098344742973,
"loss": 5.2407,
"mean_token_accuracy": 0.17383838891983033,
"num_tokens": 24573977.0,
"step": 14165
},
{
"entropy": 5.458100080490112,
"epoch": 1.1024703365104065,
"grad_norm": 1.390625,
"learning_rate": 0.0004882621501411528,
"loss": 5.1939,
"mean_token_accuracy": 0.1821801632642746,
"num_tokens": 24582897.0,
"step": 14170
},
{
"entropy": 5.490749979019165,
"epoch": 1.1028593658821242,
"grad_norm": 1.6328125,
"learning_rate": 0.0004882533135989622,
"loss": 5.1999,
"mean_token_accuracy": 0.17521614581346512,
"num_tokens": 24591132.0,
"step": 14175
},
{
"entropy": 5.466962289810181,
"epoch": 1.1032483952538417,
"grad_norm": 2.0,
"learning_rate": 0.000488244473820992,
"loss": 5.2294,
"mean_token_accuracy": 0.17761001884937286,
"num_tokens": 24600111.0,
"step": 14180
},
{
"entropy": 5.443285846710205,
"epoch": 1.1036374246255591,
"grad_norm": 1.375,
"learning_rate": 0.00048823563080737634,
"loss": 5.2862,
"mean_token_accuracy": 0.17004667669534684,
"num_tokens": 24609229.0,
"step": 14185
},
{
"entropy": 5.501825761795044,
"epoch": 1.1040264539972768,
"grad_norm": 1.4921875,
"learning_rate": 0.0004882267845582493,
"loss": 5.2083,
"mean_token_accuracy": 0.17707748860120773,
"num_tokens": 24618012.0,
"step": 14190
},
{
"entropy": 5.542854928970337,
"epoch": 1.1044154833689943,
"grad_norm": 1.6015625,
"learning_rate": 0.00048821793507374526,
"loss": 5.2696,
"mean_token_accuracy": 0.1741737350821495,
"num_tokens": 24626801.0,
"step": 14195
},
{
"entropy": 5.569772338867187,
"epoch": 1.104804512740712,
"grad_norm": 1.5390625,
"learning_rate": 0.0004882090823539984,
"loss": 5.3253,
"mean_token_accuracy": 0.17464749217033387,
"num_tokens": 24635365.0,
"step": 14200
},
{
"entropy": 5.489601039886475,
"epoch": 1.1051935421124295,
"grad_norm": 1.3828125,
"learning_rate": 0.0004882002263991431,
"loss": 5.2556,
"mean_token_accuracy": 0.17316529005765915,
"num_tokens": 24643745.0,
"step": 14205
},
{
"entropy": 5.41388430595398,
"epoch": 1.105582571484147,
"grad_norm": 1.4765625,
"learning_rate": 0.00048819136720931364,
"loss": 5.1873,
"mean_token_accuracy": 0.17632879167795182,
"num_tokens": 24652760.0,
"step": 14210
},
{
"entropy": 5.49701418876648,
"epoch": 1.1059716008558647,
"grad_norm": 1.5234375,
"learning_rate": 0.00048818250478464457,
"loss": 5.2879,
"mean_token_accuracy": 0.17305073738098145,
"num_tokens": 24661326.0,
"step": 14215
},
{
"entropy": 5.551826047897339,
"epoch": 1.1063606302275821,
"grad_norm": 1.3125,
"learning_rate": 0.0004881736391252703,
"loss": 5.178,
"mean_token_accuracy": 0.1862391099333763,
"num_tokens": 24669611.0,
"step": 14220
},
{
"entropy": 5.520254325866699,
"epoch": 1.1067496595992998,
"grad_norm": 2.046875,
"learning_rate": 0.0004881647702313253,
"loss": 5.3132,
"mean_token_accuracy": 0.16749733984470366,
"num_tokens": 24677780.0,
"step": 14225
},
{
"entropy": 5.429117727279663,
"epoch": 1.1071386889710173,
"grad_norm": 1.3515625,
"learning_rate": 0.00048815589810294427,
"loss": 5.1826,
"mean_token_accuracy": 0.1751769483089447,
"num_tokens": 24685807.0,
"step": 14230
},
{
"entropy": 5.4855146408081055,
"epoch": 1.1075277183427348,
"grad_norm": 1.6328125,
"learning_rate": 0.00048814702274026174,
"loss": 5.2601,
"mean_token_accuracy": 0.16906141936779023,
"num_tokens": 24694383.0,
"step": 14235
},
{
"entropy": 5.464105606079102,
"epoch": 1.1079167477144525,
"grad_norm": 1.578125,
"learning_rate": 0.0004881381441434124,
"loss": 5.188,
"mean_token_accuracy": 0.18194652944803238,
"num_tokens": 24702325.0,
"step": 14240
},
{
"entropy": 5.561114072799683,
"epoch": 1.10830577708617,
"grad_norm": 1.3359375,
"learning_rate": 0.000488129262312531,
"loss": 5.2532,
"mean_token_accuracy": 0.1720443457365036,
"num_tokens": 24710725.0,
"step": 14245
},
{
"entropy": 5.460937070846557,
"epoch": 1.1086948064578876,
"grad_norm": 1.5234375,
"learning_rate": 0.00048812037724775217,
"loss": 5.2786,
"mean_token_accuracy": 0.1711227923631668,
"num_tokens": 24720230.0,
"step": 14250
},
{
"entropy": 5.501880311965943,
"epoch": 1.1090838358296051,
"grad_norm": 1.453125,
"learning_rate": 0.0004881114889492109,
"loss": 5.2371,
"mean_token_accuracy": 0.1753535360097885,
"num_tokens": 24728896.0,
"step": 14255
},
{
"entropy": 5.560100173950195,
"epoch": 1.1094728652013226,
"grad_norm": 1.375,
"learning_rate": 0.00048810259741704197,
"loss": 5.3088,
"mean_token_accuracy": 0.17286834567785264,
"num_tokens": 24737731.0,
"step": 14260
},
{
"entropy": 5.489499187469482,
"epoch": 1.1098618945730403,
"grad_norm": 1.421875,
"learning_rate": 0.0004880937026513803,
"loss": 5.1875,
"mean_token_accuracy": 0.18093744218349456,
"num_tokens": 24746335.0,
"step": 14265
},
{
"entropy": 5.476787281036377,
"epoch": 1.1102509239447578,
"grad_norm": 1.4296875,
"learning_rate": 0.0004880848046523609,
"loss": 5.2122,
"mean_token_accuracy": 0.18025351762771608,
"num_tokens": 24755917.0,
"step": 14270
},
{
"entropy": 5.56396975517273,
"epoch": 1.1106399533164755,
"grad_norm": 1.375,
"learning_rate": 0.00048807590342011875,
"loss": 5.3483,
"mean_token_accuracy": 0.16797933876514434,
"num_tokens": 24764713.0,
"step": 14275
},
{
"entropy": 5.616701889038086,
"epoch": 1.111028982688193,
"grad_norm": 1.3359375,
"learning_rate": 0.00048806699895478895,
"loss": 5.3653,
"mean_token_accuracy": 0.17085302323102952,
"num_tokens": 24773464.0,
"step": 14280
},
{
"entropy": 5.492700242996216,
"epoch": 1.1114180120599104,
"grad_norm": 1.375,
"learning_rate": 0.0004880580912565065,
"loss": 5.2838,
"mean_token_accuracy": 0.17509262263774872,
"num_tokens": 24781437.0,
"step": 14285
},
{
"entropy": 5.409321451187134,
"epoch": 1.1118070414316281,
"grad_norm": 1.3515625,
"learning_rate": 0.0004880491803254067,
"loss": 5.1033,
"mean_token_accuracy": 0.18359559625387192,
"num_tokens": 24789505.0,
"step": 14290
},
{
"entropy": 5.552230453491211,
"epoch": 1.1121960708033456,
"grad_norm": 1.3515625,
"learning_rate": 0.0004880402661616246,
"loss": 5.345,
"mean_token_accuracy": 0.17013064920902252,
"num_tokens": 24798492.0,
"step": 14295
},
{
"entropy": 5.51050181388855,
"epoch": 1.1125851001750633,
"grad_norm": 1.4375,
"learning_rate": 0.0004880313487652956,
"loss": 5.3048,
"mean_token_accuracy": 0.16945937126874924,
"num_tokens": 24807472.0,
"step": 14300
},
{
"entropy": 5.59943208694458,
"epoch": 1.1129741295467808,
"grad_norm": 1.375,
"learning_rate": 0.00048802242813655503,
"loss": 5.3054,
"mean_token_accuracy": 0.17116051465272902,
"num_tokens": 24815838.0,
"step": 14305
},
{
"entropy": 5.451162433624267,
"epoch": 1.1133631589184985,
"grad_norm": 1.6015625,
"learning_rate": 0.000488013504275538,
"loss": 5.1964,
"mean_token_accuracy": 0.18074142187833786,
"num_tokens": 24823953.0,
"step": 14310
},
{
"entropy": 5.424050760269165,
"epoch": 1.113752188290216,
"grad_norm": 1.3671875,
"learning_rate": 0.0004880045771823802,
"loss": 5.1235,
"mean_token_accuracy": 0.1825163871049881,
"num_tokens": 24832414.0,
"step": 14315
},
{
"entropy": 5.4545470714569095,
"epoch": 1.1141412176619334,
"grad_norm": 1.375,
"learning_rate": 0.00048799564685721695,
"loss": 5.2501,
"mean_token_accuracy": 0.1822354808449745,
"num_tokens": 24840503.0,
"step": 14320
},
{
"entropy": 5.5194086074829105,
"epoch": 1.1145302470336511,
"grad_norm": 1.453125,
"learning_rate": 0.0004879867133001837,
"loss": 5.3888,
"mean_token_accuracy": 0.16101891696453094,
"num_tokens": 24849272.0,
"step": 14325
},
{
"entropy": 5.544814777374268,
"epoch": 1.1149192764053686,
"grad_norm": 1.546875,
"learning_rate": 0.0004879777765114162,
"loss": 5.3474,
"mean_token_accuracy": 0.17115128487348558,
"num_tokens": 24858565.0,
"step": 14330
},
{
"entropy": 5.585868549346924,
"epoch": 1.115308305777086,
"grad_norm": 1.4375,
"learning_rate": 0.00048796883649104996,
"loss": 5.2763,
"mean_token_accuracy": 0.1752402141690254,
"num_tokens": 24867811.0,
"step": 14335
},
{
"entropy": 5.512491226196289,
"epoch": 1.1156973351488038,
"grad_norm": 1.265625,
"learning_rate": 0.0004879598932392206,
"loss": 5.3187,
"mean_token_accuracy": 0.16691262722015382,
"num_tokens": 24876776.0,
"step": 14340
},
{
"entropy": 5.408519840240478,
"epoch": 1.1160863645205212,
"grad_norm": 1.46875,
"learning_rate": 0.00048795094675606364,
"loss": 5.2523,
"mean_token_accuracy": 0.16862001717090608,
"num_tokens": 24885030.0,
"step": 14345
},
{
"entropy": 5.562605381011963,
"epoch": 1.116475393892239,
"grad_norm": 1.359375,
"learning_rate": 0.0004879419970417152,
"loss": 5.3881,
"mean_token_accuracy": 0.1631487026810646,
"num_tokens": 24894336.0,
"step": 14350
},
{
"entropy": 5.586774253845215,
"epoch": 1.1168644232639564,
"grad_norm": 1.3125,
"learning_rate": 0.00048793304409631077,
"loss": 5.3363,
"mean_token_accuracy": 0.1736133798956871,
"num_tokens": 24903107.0,
"step": 14355
},
{
"entropy": 5.6495466232299805,
"epoch": 1.117253452635674,
"grad_norm": 1.3828125,
"learning_rate": 0.0004879240879199863,
"loss": 5.4387,
"mean_token_accuracy": 0.16647580415010452,
"num_tokens": 24912727.0,
"step": 14360
},
{
"entropy": 5.459299039840698,
"epoch": 1.1176424820073916,
"grad_norm": 1.515625,
"learning_rate": 0.00048791512851287786,
"loss": 5.1895,
"mean_token_accuracy": 0.17333534806966783,
"num_tokens": 24921534.0,
"step": 14365
},
{
"entropy": 5.4738912105560305,
"epoch": 1.118031511379109,
"grad_norm": 1.578125,
"learning_rate": 0.00048790616587512107,
"loss": 5.2708,
"mean_token_accuracy": 0.1715287908911705,
"num_tokens": 24930093.0,
"step": 14370
},
{
"entropy": 5.536205768585205,
"epoch": 1.1184205407508268,
"grad_norm": 1.3671875,
"learning_rate": 0.0004878972000068521,
"loss": 5.368,
"mean_token_accuracy": 0.17202307283878326,
"num_tokens": 24939230.0,
"step": 14375
},
{
"entropy": 5.606374883651734,
"epoch": 1.1188095701225442,
"grad_norm": 1.4140625,
"learning_rate": 0.00048788823090820707,
"loss": 5.3971,
"mean_token_accuracy": 0.17488905787467957,
"num_tokens": 24947595.0,
"step": 14380
},
{
"entropy": 5.6173121452331545,
"epoch": 1.1191985994942617,
"grad_norm": 1.3046875,
"learning_rate": 0.00048787925857932194,
"loss": 5.364,
"mean_token_accuracy": 0.17087926268577575,
"num_tokens": 24957099.0,
"step": 14385
},
{
"entropy": 5.468348217010498,
"epoch": 1.1195876288659794,
"grad_norm": 1.4765625,
"learning_rate": 0.00048787028302033287,
"loss": 5.229,
"mean_token_accuracy": 0.1756865292787552,
"num_tokens": 24965701.0,
"step": 14390
},
{
"entropy": 5.524595069885254,
"epoch": 1.1199766582376969,
"grad_norm": 1.359375,
"learning_rate": 0.00048786130423137606,
"loss": 5.3592,
"mean_token_accuracy": 0.1627870738506317,
"num_tokens": 24974025.0,
"step": 14395
},
{
"entropy": 5.623825216293335,
"epoch": 1.1203656876094146,
"grad_norm": 1.3671875,
"learning_rate": 0.0004878523222125879,
"loss": 5.4011,
"mean_token_accuracy": 0.1706815853714943,
"num_tokens": 24982930.0,
"step": 14400
},
{
"entropy": 5.584575843811035,
"epoch": 1.120754716981132,
"grad_norm": 1.5234375,
"learning_rate": 0.0004878433369641044,
"loss": 5.2743,
"mean_token_accuracy": 0.17862582802772523,
"num_tokens": 24991332.0,
"step": 14405
},
{
"entropy": 5.4755340099334715,
"epoch": 1.1211437463528497,
"grad_norm": 1.4296875,
"learning_rate": 0.0004878343484860621,
"loss": 5.2657,
"mean_token_accuracy": 0.17420647740364076,
"num_tokens": 25000130.0,
"step": 14410
},
{
"entropy": 5.469361066818237,
"epoch": 1.1215327757245672,
"grad_norm": 1.7734375,
"learning_rate": 0.0004878253567785972,
"loss": 5.2748,
"mean_token_accuracy": 0.17610540986061096,
"num_tokens": 25008423.0,
"step": 14415
},
{
"entropy": 5.5332142353057865,
"epoch": 1.1219218050962847,
"grad_norm": 1.3515625,
"learning_rate": 0.00048781636184184644,
"loss": 5.3629,
"mean_token_accuracy": 0.1674705982208252,
"num_tokens": 25017399.0,
"step": 14420
},
{
"entropy": 5.606417083740235,
"epoch": 1.1223108344680024,
"grad_norm": 1.3984375,
"learning_rate": 0.000487807363675946,
"loss": 5.3286,
"mean_token_accuracy": 0.17869464308023453,
"num_tokens": 25025957.0,
"step": 14425
},
{
"entropy": 5.561326169967652,
"epoch": 1.1226998638397199,
"grad_norm": 1.4453125,
"learning_rate": 0.0004877983622810326,
"loss": 5.2301,
"mean_token_accuracy": 0.18196647316217424,
"num_tokens": 25034246.0,
"step": 14430
},
{
"entropy": 5.431968450546265,
"epoch": 1.1230888932114376,
"grad_norm": 1.375,
"learning_rate": 0.0004877893576572427,
"loss": 5.2368,
"mean_token_accuracy": 0.17758679389953613,
"num_tokens": 25042461.0,
"step": 14435
},
{
"entropy": 5.451863193511963,
"epoch": 1.123477922583155,
"grad_norm": 1.3671875,
"learning_rate": 0.000487780349804713,
"loss": 5.2232,
"mean_token_accuracy": 0.17890723347663878,
"num_tokens": 25051291.0,
"step": 14440
},
{
"entropy": 5.526486492156982,
"epoch": 1.1238669519548725,
"grad_norm": 1.40625,
"learning_rate": 0.0004877713387235802,
"loss": 5.3482,
"mean_token_accuracy": 0.17070892155170442,
"num_tokens": 25060538.0,
"step": 14445
},
{
"entropy": 5.572833061218262,
"epoch": 1.1242559813265902,
"grad_norm": 1.6328125,
"learning_rate": 0.000487762324413981,
"loss": 5.3146,
"mean_token_accuracy": 0.16665484458208085,
"num_tokens": 25068965.0,
"step": 14450
},
{
"entropy": 5.531497430801392,
"epoch": 1.1246450106983077,
"grad_norm": 1.4921875,
"learning_rate": 0.00048775330687605213,
"loss": 5.3006,
"mean_token_accuracy": 0.16858672946691514,
"num_tokens": 25077021.0,
"step": 14455
},
{
"entropy": 5.529527425765991,
"epoch": 1.1250340400700254,
"grad_norm": 1.6953125,
"learning_rate": 0.0004877442861099305,
"loss": 5.3053,
"mean_token_accuracy": 0.17757799625396728,
"num_tokens": 25086009.0,
"step": 14460
},
{
"entropy": 5.429346370697021,
"epoch": 1.1254230694417429,
"grad_norm": 1.3671875,
"learning_rate": 0.0004877352621157529,
"loss": 5.204,
"mean_token_accuracy": 0.18223759829998015,
"num_tokens": 25094745.0,
"step": 14465
},
{
"entropy": 5.503374528884888,
"epoch": 1.1258120988134603,
"grad_norm": 1.4375,
"learning_rate": 0.00048772623489365635,
"loss": 5.263,
"mean_token_accuracy": 0.17386261373758316,
"num_tokens": 25103087.0,
"step": 14470
},
{
"entropy": 5.540647506713867,
"epoch": 1.126201128185178,
"grad_norm": 1.484375,
"learning_rate": 0.0004877172044437777,
"loss": 5.279,
"mean_token_accuracy": 0.1717000797390938,
"num_tokens": 25111822.0,
"step": 14475
},
{
"entropy": 5.48570818901062,
"epoch": 1.1265901575568955,
"grad_norm": 1.46875,
"learning_rate": 0.00048770817076625416,
"loss": 5.2562,
"mean_token_accuracy": 0.17591685503721238,
"num_tokens": 25119975.0,
"step": 14480
},
{
"entropy": 5.509499216079712,
"epoch": 1.126979186928613,
"grad_norm": 1.71875,
"learning_rate": 0.00048769913386122253,
"loss": 5.344,
"mean_token_accuracy": 0.16708275377750398,
"num_tokens": 25129031.0,
"step": 14485
},
{
"entropy": 5.553398847579956,
"epoch": 1.1273682163003307,
"grad_norm": 1.4453125,
"learning_rate": 0.0004876900937288202,
"loss": 5.2579,
"mean_token_accuracy": 0.17342377305030823,
"num_tokens": 25138230.0,
"step": 14490
},
{
"entropy": 5.5680934429168705,
"epoch": 1.1277572456720482,
"grad_norm": 1.359375,
"learning_rate": 0.00048768105036918426,
"loss": 5.2668,
"mean_token_accuracy": 0.17579276263713836,
"num_tokens": 25147120.0,
"step": 14495
},
{
"entropy": 5.5095714092254635,
"epoch": 1.1281462750437659,
"grad_norm": 1.46875,
"learning_rate": 0.00048767200378245187,
"loss": 5.2762,
"mean_token_accuracy": 0.16822680532932283,
"num_tokens": 25155623.0,
"step": 14500
},
{
"entropy": 5.416744041442871,
"epoch": 1.1285353044154833,
"grad_norm": 1.4140625,
"learning_rate": 0.00048766295396876025,
"loss": 5.1717,
"mean_token_accuracy": 0.1830092415213585,
"num_tokens": 25163867.0,
"step": 14505
},
{
"entropy": 5.495766830444336,
"epoch": 1.128924333787201,
"grad_norm": 1.6328125,
"learning_rate": 0.00048765390092824683,
"loss": 5.2948,
"mean_token_accuracy": 0.17490708976984023,
"num_tokens": 25172838.0,
"step": 14510
},
{
"entropy": 5.519143152236938,
"epoch": 1.1293133631589185,
"grad_norm": 1.3046875,
"learning_rate": 0.000487644844661049,
"loss": 5.2325,
"mean_token_accuracy": 0.17986900210380555,
"num_tokens": 25181168.0,
"step": 14515
},
{
"entropy": 5.478940725326538,
"epoch": 1.129702392530636,
"grad_norm": 1.34375,
"learning_rate": 0.000487635785167304,
"loss": 5.2914,
"mean_token_accuracy": 0.178208564221859,
"num_tokens": 25190115.0,
"step": 14520
},
{
"entropy": 5.512725448608398,
"epoch": 1.1300914219023537,
"grad_norm": 1.3671875,
"learning_rate": 0.00048762672244714953,
"loss": 5.3209,
"mean_token_accuracy": 0.17323659509420394,
"num_tokens": 25199594.0,
"step": 14525
},
{
"entropy": 5.542869186401367,
"epoch": 1.1304804512740712,
"grad_norm": 1.421875,
"learning_rate": 0.0004876176565007229,
"loss": 5.2567,
"mean_token_accuracy": 0.16444095969200134,
"num_tokens": 25208060.0,
"step": 14530
},
{
"entropy": 5.486799335479736,
"epoch": 1.1308694806457888,
"grad_norm": 1.375,
"learning_rate": 0.00048760858732816174,
"loss": 5.221,
"mean_token_accuracy": 0.17471545338630676,
"num_tokens": 25216257.0,
"step": 14535
},
{
"entropy": 5.4936473846435545,
"epoch": 1.1312585100175063,
"grad_norm": 1.5546875,
"learning_rate": 0.0004875995149296037,
"loss": 5.2443,
"mean_token_accuracy": 0.17619386017322541,
"num_tokens": 25225032.0,
"step": 14540
},
{
"entropy": 5.537398147583008,
"epoch": 1.1316475393892238,
"grad_norm": 1.375,
"learning_rate": 0.0004875904393051864,
"loss": 5.2867,
"mean_token_accuracy": 0.17638191431760789,
"num_tokens": 25233624.0,
"step": 14545
},
{
"entropy": 5.398117160797119,
"epoch": 1.1320365687609415,
"grad_norm": 1.359375,
"learning_rate": 0.0004875813604550476,
"loss": 5.2489,
"mean_token_accuracy": 0.17609538733959199,
"num_tokens": 25242132.0,
"step": 14550
},
{
"entropy": 5.51240758895874,
"epoch": 1.132425598132659,
"grad_norm": 1.46875,
"learning_rate": 0.00048757227837932494,
"loss": 5.26,
"mean_token_accuracy": 0.17577965408563614,
"num_tokens": 25250923.0,
"step": 14555
},
{
"entropy": 5.5694276809692385,
"epoch": 1.1328146275043767,
"grad_norm": 1.3671875,
"learning_rate": 0.0004875631930781563,
"loss": 5.2554,
"mean_token_accuracy": 0.17414026856422424,
"num_tokens": 25259783.0,
"step": 14560
},
{
"entropy": 5.585868692398071,
"epoch": 1.1332036568760941,
"grad_norm": 1.2578125,
"learning_rate": 0.00048755410455167967,
"loss": 5.4448,
"mean_token_accuracy": 0.167725133895874,
"num_tokens": 25268801.0,
"step": 14565
},
{
"entropy": 5.50393238067627,
"epoch": 1.1335926862478116,
"grad_norm": 1.4921875,
"learning_rate": 0.0004875450128000326,
"loss": 5.2666,
"mean_token_accuracy": 0.183109250664711,
"num_tokens": 25277226.0,
"step": 14570
},
{
"entropy": 5.515140533447266,
"epoch": 1.1339817156195293,
"grad_norm": 1.3828125,
"learning_rate": 0.0004875359178233534,
"loss": 5.3105,
"mean_token_accuracy": 0.16551288962364197,
"num_tokens": 25285887.0,
"step": 14575
},
{
"entropy": 5.4384214878082275,
"epoch": 1.1343707449912468,
"grad_norm": 1.5,
"learning_rate": 0.00048752681962177985,
"loss": 5.1727,
"mean_token_accuracy": 0.176611091196537,
"num_tokens": 25294025.0,
"step": 14580
},
{
"entropy": 5.498254823684692,
"epoch": 1.1347597743629645,
"grad_norm": 1.53125,
"learning_rate": 0.00048751771819545013,
"loss": 5.3815,
"mean_token_accuracy": 0.16712383478879927,
"num_tokens": 25303016.0,
"step": 14585
},
{
"entropy": 5.483353137969971,
"epoch": 1.135148803734682,
"grad_norm": 1.3515625,
"learning_rate": 0.00048750861354450236,
"loss": 5.1755,
"mean_token_accuracy": 0.17676083147525787,
"num_tokens": 25311193.0,
"step": 14590
},
{
"entropy": 5.481668424606323,
"epoch": 1.1355378331063994,
"grad_norm": 1.484375,
"learning_rate": 0.0004874995056690746,
"loss": 5.2231,
"mean_token_accuracy": 0.17191832065582274,
"num_tokens": 25319380.0,
"step": 14595
},
{
"entropy": 5.490535306930542,
"epoch": 1.1359268624781171,
"grad_norm": 1.3671875,
"learning_rate": 0.000487490394569305,
"loss": 5.2526,
"mean_token_accuracy": 0.17922306209802627,
"num_tokens": 25327854.0,
"step": 14600
},
{
"entropy": 5.504375219345093,
"epoch": 1.1363158918498346,
"grad_norm": 1.5078125,
"learning_rate": 0.0004874812802453319,
"loss": 5.2983,
"mean_token_accuracy": 0.1733245149254799,
"num_tokens": 25335912.0,
"step": 14605
},
{
"entropy": 5.475161933898926,
"epoch": 1.1367049212215523,
"grad_norm": 1.5078125,
"learning_rate": 0.0004874721626972936,
"loss": 5.3156,
"mean_token_accuracy": 0.1783476710319519,
"num_tokens": 25344104.0,
"step": 14610
},
{
"entropy": 5.400818490982056,
"epoch": 1.1370939505932698,
"grad_norm": 1.59375,
"learning_rate": 0.0004874630419253284,
"loss": 5.0836,
"mean_token_accuracy": 0.18518089950084687,
"num_tokens": 25352583.0,
"step": 14615
},
{
"entropy": 5.446536064147949,
"epoch": 1.1374829799649873,
"grad_norm": 1.4140625,
"learning_rate": 0.00048745391792957474,
"loss": 5.2056,
"mean_token_accuracy": 0.17710380554199218,
"num_tokens": 25361035.0,
"step": 14620
},
{
"entropy": 5.457904720306397,
"epoch": 1.137872009336705,
"grad_norm": 1.5625,
"learning_rate": 0.00048744479071017097,
"loss": 5.2455,
"mean_token_accuracy": 0.17462990283966065,
"num_tokens": 25369511.0,
"step": 14625
},
{
"entropy": 5.516271924972534,
"epoch": 1.1382610387084224,
"grad_norm": 1.34375,
"learning_rate": 0.0004874356602672556,
"loss": 5.2416,
"mean_token_accuracy": 0.17254792749881745,
"num_tokens": 25378023.0,
"step": 14630
},
{
"entropy": 5.463342237472534,
"epoch": 1.1386500680801401,
"grad_norm": 1.25,
"learning_rate": 0.0004874265266009673,
"loss": 5.2694,
"mean_token_accuracy": 0.1757393255829811,
"num_tokens": 25386791.0,
"step": 14635
},
{
"entropy": 5.533389043807984,
"epoch": 1.1390390974518576,
"grad_norm": 1.3203125,
"learning_rate": 0.0004874173897114445,
"loss": 5.3223,
"mean_token_accuracy": 0.16988997608423234,
"num_tokens": 25395401.0,
"step": 14640
},
{
"entropy": 5.491459751129151,
"epoch": 1.1394281268235753,
"grad_norm": 1.28125,
"learning_rate": 0.00048740824959882603,
"loss": 5.2634,
"mean_token_accuracy": 0.1747543618083,
"num_tokens": 25404193.0,
"step": 14645
},
{
"entropy": 5.577925682067871,
"epoch": 1.1398171561952928,
"grad_norm": 1.40625,
"learning_rate": 0.0004873991062632504,
"loss": 5.3606,
"mean_token_accuracy": 0.16573098450899124,
"num_tokens": 25413073.0,
"step": 14650
},
{
"entropy": 5.54101333618164,
"epoch": 1.1402061855670103,
"grad_norm": 1.4375,
"learning_rate": 0.00048738995970485635,
"loss": 5.2393,
"mean_token_accuracy": 0.17702944129705428,
"num_tokens": 25422064.0,
"step": 14655
},
{
"entropy": 5.470462942123413,
"epoch": 1.140595214938728,
"grad_norm": 1.5078125,
"learning_rate": 0.0004873808099237827,
"loss": 5.2194,
"mean_token_accuracy": 0.17407362312078475,
"num_tokens": 25430711.0,
"step": 14660
},
{
"entropy": 5.521389198303223,
"epoch": 1.1409842443104454,
"grad_norm": 1.3515625,
"learning_rate": 0.0004873716569201684,
"loss": 5.3322,
"mean_token_accuracy": 0.173028427362442,
"num_tokens": 25439527.0,
"step": 14665
},
{
"entropy": 5.567311000823975,
"epoch": 1.141373273682163,
"grad_norm": 1.5234375,
"learning_rate": 0.00048736250069415213,
"loss": 5.31,
"mean_token_accuracy": 0.1651947319507599,
"num_tokens": 25448633.0,
"step": 14670
},
{
"entropy": 5.539625215530395,
"epoch": 1.1417623030538806,
"grad_norm": 1.4765625,
"learning_rate": 0.0004873533412458729,
"loss": 5.2738,
"mean_token_accuracy": 0.17126673460006714,
"num_tokens": 25457657.0,
"step": 14675
},
{
"entropy": 5.5466142177581785,
"epoch": 1.142151332425598,
"grad_norm": 1.2890625,
"learning_rate": 0.00048734417857546986,
"loss": 5.3373,
"mean_token_accuracy": 0.16673405170440675,
"num_tokens": 25466698.0,
"step": 14680
},
{
"entropy": 5.5340875625610355,
"epoch": 1.1425403617973158,
"grad_norm": 1.359375,
"learning_rate": 0.0004873350126830818,
"loss": 5.2765,
"mean_token_accuracy": 0.17524281591176988,
"num_tokens": 25474921.0,
"step": 14685
},
{
"entropy": 5.479874897003174,
"epoch": 1.1429293911690332,
"grad_norm": 1.3984375,
"learning_rate": 0.0004873258435688479,
"loss": 5.1833,
"mean_token_accuracy": 0.17880246192216873,
"num_tokens": 25483553.0,
"step": 14690
},
{
"entropy": 5.515859460830688,
"epoch": 1.143318420540751,
"grad_norm": 1.3671875,
"learning_rate": 0.0004873166712329073,
"loss": 5.2825,
"mean_token_accuracy": 0.17519325911998748,
"num_tokens": 25492408.0,
"step": 14695
},
{
"entropy": 5.4956684589385985,
"epoch": 1.1437074499124684,
"grad_norm": 1.421875,
"learning_rate": 0.00048730749567539914,
"loss": 5.3005,
"mean_token_accuracy": 0.1683206781744957,
"num_tokens": 25501404.0,
"step": 14700
},
{
"entropy": 5.611879777908325,
"epoch": 1.144096479284186,
"grad_norm": 1.3984375,
"learning_rate": 0.00048729831689646257,
"loss": 5.2936,
"mean_token_accuracy": 0.16889838874340057,
"num_tokens": 25510176.0,
"step": 14705
},
{
"entropy": 5.487307929992676,
"epoch": 1.1444855086559036,
"grad_norm": 1.28125,
"learning_rate": 0.00048728913489623705,
"loss": 5.2102,
"mean_token_accuracy": 0.1775286689400673,
"num_tokens": 25518809.0,
"step": 14710
},
{
"entropy": 5.484960317611694,
"epoch": 1.144874538027621,
"grad_norm": 1.359375,
"learning_rate": 0.0004872799496748618,
"loss": 5.3154,
"mean_token_accuracy": 0.17022545337677003,
"num_tokens": 25527415.0,
"step": 14715
},
{
"entropy": 5.48862657546997,
"epoch": 1.1452635673993385,
"grad_norm": 1.5625,
"learning_rate": 0.0004872707612324761,
"loss": 5.245,
"mean_token_accuracy": 0.1742952361702919,
"num_tokens": 25535618.0,
"step": 14720
},
{
"entropy": 5.548863315582276,
"epoch": 1.1456525967710562,
"grad_norm": 1.453125,
"learning_rate": 0.0004872615695692196,
"loss": 5.2524,
"mean_token_accuracy": 0.17555700838565827,
"num_tokens": 25544228.0,
"step": 14725
},
{
"entropy": 5.556531143188477,
"epoch": 1.1460416261427737,
"grad_norm": 1.4140625,
"learning_rate": 0.0004872523746852315,
"loss": 5.2981,
"mean_token_accuracy": 0.17266268730163575,
"num_tokens": 25553557.0,
"step": 14730
},
{
"entropy": 5.496634674072266,
"epoch": 1.1464306555144914,
"grad_norm": 1.359375,
"learning_rate": 0.00048724317658065146,
"loss": 5.2571,
"mean_token_accuracy": 0.1716156467795372,
"num_tokens": 25562018.0,
"step": 14735
},
{
"entropy": 5.527238750457764,
"epoch": 1.146819684886209,
"grad_norm": 1.6171875,
"learning_rate": 0.00048723397525561916,
"loss": 5.2724,
"mean_token_accuracy": 0.18034477680921554,
"num_tokens": 25569382.0,
"step": 14740
},
{
"entropy": 5.406917524337769,
"epoch": 1.1472087142579266,
"grad_norm": 1.3203125,
"learning_rate": 0.00048722477071027394,
"loss": 5.2377,
"mean_token_accuracy": 0.17280066460371019,
"num_tokens": 25578172.0,
"step": 14745
},
{
"entropy": 5.453845977783203,
"epoch": 1.147597743629644,
"grad_norm": 1.375,
"learning_rate": 0.00048721556294475574,
"loss": 5.2862,
"mean_token_accuracy": 0.1699090212583542,
"num_tokens": 25587572.0,
"step": 14750
},
{
"entropy": 5.53148627281189,
"epoch": 1.1479867730013615,
"grad_norm": 1.46875,
"learning_rate": 0.00048720635195920403,
"loss": 5.3199,
"mean_token_accuracy": 0.17257970720529556,
"num_tokens": 25596609.0,
"step": 14755
},
{
"entropy": 5.53697657585144,
"epoch": 1.1483758023730792,
"grad_norm": 1.484375,
"learning_rate": 0.0004871971377537588,
"loss": 5.3306,
"mean_token_accuracy": 0.16578828990459443,
"num_tokens": 25605707.0,
"step": 14760
},
{
"entropy": 5.486789798736572,
"epoch": 1.1487648317447967,
"grad_norm": 1.390625,
"learning_rate": 0.0004871879203285597,
"loss": 5.2704,
"mean_token_accuracy": 0.17287899404764176,
"num_tokens": 25614218.0,
"step": 14765
},
{
"entropy": 5.4688270568847654,
"epoch": 1.1491538611165142,
"grad_norm": 1.375,
"learning_rate": 0.00048717869968374655,
"loss": 5.197,
"mean_token_accuracy": 0.17571456283330916,
"num_tokens": 25622613.0,
"step": 14770
},
{
"entropy": 5.648395347595215,
"epoch": 1.1495428904882319,
"grad_norm": 1.359375,
"learning_rate": 0.00048716947581945954,
"loss": 5.3596,
"mean_token_accuracy": 0.16967739313840866,
"num_tokens": 25631396.0,
"step": 14775
},
{
"entropy": 5.520706272125244,
"epoch": 1.1499319198599494,
"grad_norm": 1.296875,
"learning_rate": 0.0004871602487358383,
"loss": 5.2455,
"mean_token_accuracy": 0.17188442051410674,
"num_tokens": 25640870.0,
"step": 14780
},
{
"entropy": 5.474168586730957,
"epoch": 1.150320949231667,
"grad_norm": 1.4296875,
"learning_rate": 0.000487151018433023,
"loss": 5.3012,
"mean_token_accuracy": 0.16997490376234053,
"num_tokens": 25649395.0,
"step": 14785
},
{
"entropy": 5.545903253555298,
"epoch": 1.1507099786033845,
"grad_norm": 1.453125,
"learning_rate": 0.00048714178491115367,
"loss": 5.429,
"mean_token_accuracy": 0.16178262531757354,
"num_tokens": 25659087.0,
"step": 14790
},
{
"entropy": 5.591632127761841,
"epoch": 1.1510990079751022,
"grad_norm": 1.4296875,
"learning_rate": 0.00048713254817037046,
"loss": 5.3282,
"mean_token_accuracy": 0.1745515376329422,
"num_tokens": 25667847.0,
"step": 14795
},
{
"entropy": 5.527452373504639,
"epoch": 1.1514880373468197,
"grad_norm": 1.4140625,
"learning_rate": 0.0004871233082108135,
"loss": 5.2784,
"mean_token_accuracy": 0.17815037965774536,
"num_tokens": 25676786.0,
"step": 14800
},
{
"entropy": 5.531932258605957,
"epoch": 1.1518770667185372,
"grad_norm": 1.453125,
"learning_rate": 0.0004871140650326228,
"loss": 5.3214,
"mean_token_accuracy": 0.16794054657220842,
"num_tokens": 25685223.0,
"step": 14805
},
{
"entropy": 5.515975284576416,
"epoch": 1.1522660960902549,
"grad_norm": 1.328125,
"learning_rate": 0.0004871048186359389,
"loss": 5.2759,
"mean_token_accuracy": 0.17498894929885864,
"num_tokens": 25694243.0,
"step": 14810
},
{
"entropy": 5.5161628246307375,
"epoch": 1.1526551254619724,
"grad_norm": 1.5,
"learning_rate": 0.000487095569020902,
"loss": 5.1648,
"mean_token_accuracy": 0.17979977875947953,
"num_tokens": 25702735.0,
"step": 14815
},
{
"entropy": 5.452590417861939,
"epoch": 1.1530441548336898,
"grad_norm": 1.4609375,
"learning_rate": 0.0004870863161876524,
"loss": 5.2292,
"mean_token_accuracy": 0.1791177973151207,
"num_tokens": 25711577.0,
"step": 14820
},
{
"entropy": 5.470571660995484,
"epoch": 1.1534331842054075,
"grad_norm": 1.5390625,
"learning_rate": 0.0004870770601363305,
"loss": 5.1648,
"mean_token_accuracy": 0.18687797337770462,
"num_tokens": 25719927.0,
"step": 14825
},
{
"entropy": 5.481204175949097,
"epoch": 1.153822213577125,
"grad_norm": 1.3984375,
"learning_rate": 0.00048706780086707675,
"loss": 5.1957,
"mean_token_accuracy": 0.1778558611869812,
"num_tokens": 25728144.0,
"step": 14830
},
{
"entropy": 5.428620767593384,
"epoch": 1.1542112429488427,
"grad_norm": 1.359375,
"learning_rate": 0.0004870585383800317,
"loss": 5.1908,
"mean_token_accuracy": 0.181229430437088,
"num_tokens": 25736736.0,
"step": 14835
},
{
"entropy": 5.534958553314209,
"epoch": 1.1546002723205602,
"grad_norm": 1.4921875,
"learning_rate": 0.00048704927267533585,
"loss": 5.3702,
"mean_token_accuracy": 0.17278939187526704,
"num_tokens": 25745031.0,
"step": 14840
},
{
"entropy": 5.607956981658935,
"epoch": 1.1549893016922779,
"grad_norm": 1.3125,
"learning_rate": 0.00048704000375312975,
"loss": 5.3363,
"mean_token_accuracy": 0.1760665774345398,
"num_tokens": 25754265.0,
"step": 14845
},
{
"entropy": 5.612948560714722,
"epoch": 1.1553783310639953,
"grad_norm": 1.421875,
"learning_rate": 0.00048703073161355414,
"loss": 5.349,
"mean_token_accuracy": 0.1639382630586624,
"num_tokens": 25763084.0,
"step": 14850
},
{
"entropy": 5.533888149261474,
"epoch": 1.1557673604357128,
"grad_norm": 1.359375,
"learning_rate": 0.0004870214562567497,
"loss": 5.3302,
"mean_token_accuracy": 0.1670328602194786,
"num_tokens": 25771626.0,
"step": 14855
},
{
"entropy": 5.493502283096314,
"epoch": 1.1561563898074305,
"grad_norm": 1.6171875,
"learning_rate": 0.000487012177682857,
"loss": 5.2755,
"mean_token_accuracy": 0.17252386808395387,
"num_tokens": 25780326.0,
"step": 14860
},
{
"entropy": 5.594791650772095,
"epoch": 1.156545419179148,
"grad_norm": 1.3203125,
"learning_rate": 0.0004870028958920171,
"loss": 5.402,
"mean_token_accuracy": 0.167504246532917,
"num_tokens": 25789318.0,
"step": 14865
},
{
"entropy": 5.564109945297242,
"epoch": 1.1569344485508655,
"grad_norm": 1.28125,
"learning_rate": 0.0004869936108843706,
"loss": 5.3484,
"mean_token_accuracy": 0.17456323206424712,
"num_tokens": 25798025.0,
"step": 14870
},
{
"entropy": 5.51595664024353,
"epoch": 1.1573234779225832,
"grad_norm": 1.6875,
"learning_rate": 0.00048698432266005854,
"loss": 5.2502,
"mean_token_accuracy": 0.17536690086126328,
"num_tokens": 25806669.0,
"step": 14875
},
{
"entropy": 5.527758026123047,
"epoch": 1.1577125072943006,
"grad_norm": 1.3046875,
"learning_rate": 0.0004869750312192217,
"loss": 5.2691,
"mean_token_accuracy": 0.17074106335639955,
"num_tokens": 25815938.0,
"step": 14880
},
{
"entropy": 5.489625597000122,
"epoch": 1.1581015366660183,
"grad_norm": 1.3359375,
"learning_rate": 0.00048696573656200123,
"loss": 5.2009,
"mean_token_accuracy": 0.17507342249155045,
"num_tokens": 25824293.0,
"step": 14885
},
{
"entropy": 5.508816957473755,
"epoch": 1.1584905660377358,
"grad_norm": 1.5703125,
"learning_rate": 0.00048695643868853806,
"loss": 5.3134,
"mean_token_accuracy": 0.1757759466767311,
"num_tokens": 25833081.0,
"step": 14890
},
{
"entropy": 5.550866889953613,
"epoch": 1.1588795954094535,
"grad_norm": 1.4140625,
"learning_rate": 0.0004869471375989733,
"loss": 5.3383,
"mean_token_accuracy": 0.17036498337984085,
"num_tokens": 25841344.0,
"step": 14895
},
{
"entropy": 5.535708093643189,
"epoch": 1.159268624781171,
"grad_norm": 1.46875,
"learning_rate": 0.0004869378332934481,
"loss": 5.3306,
"mean_token_accuracy": 0.17351298928260803,
"num_tokens": 25850617.0,
"step": 14900
},
{
"entropy": 5.508704710006714,
"epoch": 1.1596576541528885,
"grad_norm": 1.4296875,
"learning_rate": 0.00048692852577210356,
"loss": 5.2869,
"mean_token_accuracy": 0.17655283957719803,
"num_tokens": 25858569.0,
"step": 14905
},
{
"entropy": 5.450353336334229,
"epoch": 1.1600466835246062,
"grad_norm": 1.5546875,
"learning_rate": 0.000486919215035081,
"loss": 5.2682,
"mean_token_accuracy": 0.1785864233970642,
"num_tokens": 25866892.0,
"step": 14910
},
{
"entropy": 5.533081769943237,
"epoch": 1.1604357128963236,
"grad_norm": 1.46875,
"learning_rate": 0.0004869099010825217,
"loss": 5.3381,
"mean_token_accuracy": 0.1690782204270363,
"num_tokens": 25875661.0,
"step": 14915
},
{
"entropy": 5.424652624130249,
"epoch": 1.1608247422680413,
"grad_norm": 1.3359375,
"learning_rate": 0.00048690058391456684,
"loss": 5.156,
"mean_token_accuracy": 0.18416557610034942,
"num_tokens": 25884951.0,
"step": 14920
},
{
"entropy": 5.580033445358277,
"epoch": 1.1612137716397588,
"grad_norm": 1.359375,
"learning_rate": 0.0004868912635313579,
"loss": 5.3957,
"mean_token_accuracy": 0.16869698762893676,
"num_tokens": 25893652.0,
"step": 14925
},
{
"entropy": 5.557562160491943,
"epoch": 1.1616028010114763,
"grad_norm": 1.46875,
"learning_rate": 0.0004868819399330364,
"loss": 5.236,
"mean_token_accuracy": 0.17636475712060928,
"num_tokens": 25902375.0,
"step": 14930
},
{
"entropy": 5.529547643661499,
"epoch": 1.161991830383194,
"grad_norm": 1.3203125,
"learning_rate": 0.0004868726131197436,
"loss": 5.2235,
"mean_token_accuracy": 0.18093867897987365,
"num_tokens": 25911322.0,
"step": 14935
},
{
"entropy": 5.528238582611084,
"epoch": 1.1623808597549115,
"grad_norm": 1.328125,
"learning_rate": 0.0004868632830916212,
"loss": 5.3131,
"mean_token_accuracy": 0.17147083729505538,
"num_tokens": 25920444.0,
"step": 14940
},
{
"entropy": 5.53430061340332,
"epoch": 1.1627698891266292,
"grad_norm": 1.5546875,
"learning_rate": 0.0004868539498488106,
"loss": 5.319,
"mean_token_accuracy": 0.17443039417266845,
"num_tokens": 25928986.0,
"step": 14945
},
{
"entropy": 5.552328777313233,
"epoch": 1.1631589184983466,
"grad_norm": 1.4765625,
"learning_rate": 0.0004868446133914536,
"loss": 5.321,
"mean_token_accuracy": 0.16807695776224135,
"num_tokens": 25938209.0,
"step": 14950
},
{
"entropy": 5.595097446441651,
"epoch": 1.163547947870064,
"grad_norm": 1.546875,
"learning_rate": 0.00048683527371969185,
"loss": 5.347,
"mean_token_accuracy": 0.16814862340688705,
"num_tokens": 25946909.0,
"step": 14955
},
{
"entropy": 5.547474098205567,
"epoch": 1.1639369772417818,
"grad_norm": 1.390625,
"learning_rate": 0.00048682593083366685,
"loss": 5.3748,
"mean_token_accuracy": 0.17345093190670013,
"num_tokens": 25956154.0,
"step": 14960
},
{
"entropy": 5.48573055267334,
"epoch": 1.1643260066134993,
"grad_norm": 1.359375,
"learning_rate": 0.00048681658473352055,
"loss": 5.26,
"mean_token_accuracy": 0.17706416100263594,
"num_tokens": 25964478.0,
"step": 14965
},
{
"entropy": 5.484834337234497,
"epoch": 1.164715035985217,
"grad_norm": 1.5234375,
"learning_rate": 0.0004868072354193947,
"loss": 5.2666,
"mean_token_accuracy": 0.17319488227367402,
"num_tokens": 25973162.0,
"step": 14970
},
{
"entropy": 5.539928007125854,
"epoch": 1.1651040653569344,
"grad_norm": 1.3359375,
"learning_rate": 0.0004867978828914312,
"loss": 5.2377,
"mean_token_accuracy": 0.1758410304784775,
"num_tokens": 25982790.0,
"step": 14975
},
{
"entropy": 5.506482267379761,
"epoch": 1.165493094728652,
"grad_norm": 1.8046875,
"learning_rate": 0.0004867885271497719,
"loss": 5.17,
"mean_token_accuracy": 0.17919344305992127,
"num_tokens": 25992111.0,
"step": 14980
},
{
"entropy": 5.541373586654663,
"epoch": 1.1658821241003696,
"grad_norm": 1.5078125,
"learning_rate": 0.0004867791681945588,
"loss": 5.3173,
"mean_token_accuracy": 0.16922234147787094,
"num_tokens": 26000803.0,
"step": 14985
},
{
"entropy": 5.555414295196533,
"epoch": 1.166271153472087,
"grad_norm": 1.3984375,
"learning_rate": 0.00048676980602593395,
"loss": 5.4362,
"mean_token_accuracy": 0.1632263496518135,
"num_tokens": 26010152.0,
"step": 14990
},
{
"entropy": 5.571560096740723,
"epoch": 1.1666601828438048,
"grad_norm": 1.734375,
"learning_rate": 0.00048676044064403936,
"loss": 5.3137,
"mean_token_accuracy": 0.1627359539270401,
"num_tokens": 26019183.0,
"step": 14995
},
{
"entropy": 5.549491500854492,
"epoch": 1.1670492122155223,
"grad_norm": 1.6015625,
"learning_rate": 0.0004867510720490171,
"loss": 5.253,
"mean_token_accuracy": 0.17882109433412552,
"num_tokens": 26027459.0,
"step": 15000
},
{
"epoch": 1.1670492122155223,
"eval_entropy": 5.343993307651523,
"eval_loss": 5.385531902313232,
"eval_mean_token_accuracy": 0.17835605981848468,
"eval_num_tokens": 26027459.0,
"eval_runtime": 28.4605,
"eval_samples_per_second": 1460.199,
"eval_steps_per_second": 182.534,
"step": 15000
},
{
"entropy": 5.505486154556275,
"epoch": 1.1674382415872397,
"grad_norm": 1.453125,
"learning_rate": 0.0004867417002410094,
"loss": 5.3225,
"mean_token_accuracy": 0.17250902950763702,
"num_tokens": 26036421.0,
"step": 15005
},
{
"entropy": 5.508649921417236,
"epoch": 1.1678272709589574,
"grad_norm": 1.3984375,
"learning_rate": 0.00048673232522015845,
"loss": 5.3073,
"mean_token_accuracy": 0.17687088400125503,
"num_tokens": 26044971.0,
"step": 15010
},
{
"entropy": 5.499291133880615,
"epoch": 1.168216300330675,
"grad_norm": 1.3828125,
"learning_rate": 0.0004867229469866064,
"loss": 5.2597,
"mean_token_accuracy": 0.17006338387727737,
"num_tokens": 26053597.0,
"step": 15015
},
{
"entropy": 5.5724945068359375,
"epoch": 1.1686053297023926,
"grad_norm": 1.5703125,
"learning_rate": 0.0004867135655404956,
"loss": 5.3237,
"mean_token_accuracy": 0.17078772634267808,
"num_tokens": 26061928.0,
"step": 15020
},
{
"entropy": 5.517803907394409,
"epoch": 1.16899435907411,
"grad_norm": 1.4765625,
"learning_rate": 0.00048670418088196844,
"loss": 5.261,
"mean_token_accuracy": 0.17745352536439896,
"num_tokens": 26070917.0,
"step": 15025
},
{
"entropy": 5.454018068313599,
"epoch": 1.1693833884458276,
"grad_norm": 1.5625,
"learning_rate": 0.0004866947930111674,
"loss": 5.1855,
"mean_token_accuracy": 0.18048908710479736,
"num_tokens": 26079556.0,
"step": 15030
},
{
"entropy": 5.491762113571167,
"epoch": 1.1697724178175453,
"grad_norm": 1.71875,
"learning_rate": 0.00048668540192823467,
"loss": 5.319,
"mean_token_accuracy": 0.17351290732622146,
"num_tokens": 26087963.0,
"step": 15035
},
{
"entropy": 5.508210229873657,
"epoch": 1.1701614471892627,
"grad_norm": 1.4140625,
"learning_rate": 0.000486676007633313,
"loss": 5.239,
"mean_token_accuracy": 0.17787270694971086,
"num_tokens": 26096208.0,
"step": 15040
},
{
"entropy": 5.504089784622193,
"epoch": 1.1705504765609804,
"grad_norm": 1.53125,
"learning_rate": 0.0004866666101265448,
"loss": 5.2531,
"mean_token_accuracy": 0.17728083282709123,
"num_tokens": 26104961.0,
"step": 15045
},
{
"entropy": 5.5123138427734375,
"epoch": 1.170939505932698,
"grad_norm": 1.34375,
"learning_rate": 0.00048665720940807274,
"loss": 5.2872,
"mean_token_accuracy": 0.17374863773584365,
"num_tokens": 26113889.0,
"step": 15050
},
{
"entropy": 5.47006049156189,
"epoch": 1.1713285353044154,
"grad_norm": 1.5,
"learning_rate": 0.00048664780547803935,
"loss": 5.2429,
"mean_token_accuracy": 0.17934939712285997,
"num_tokens": 26122139.0,
"step": 15055
},
{
"entropy": 5.570874643325806,
"epoch": 1.171717564676133,
"grad_norm": 1.3984375,
"learning_rate": 0.0004866383983365873,
"loss": 5.2883,
"mean_token_accuracy": 0.18369991928339005,
"num_tokens": 26130817.0,
"step": 15060
},
{
"entropy": 5.529329299926758,
"epoch": 1.1721065940478506,
"grad_norm": 1.5234375,
"learning_rate": 0.00048662898798385956,
"loss": 5.2945,
"mean_token_accuracy": 0.17200957238674164,
"num_tokens": 26140035.0,
"step": 15065
},
{
"entropy": 5.568940782546997,
"epoch": 1.1724956234195683,
"grad_norm": 1.5703125,
"learning_rate": 0.00048661957441999875,
"loss": 5.3693,
"mean_token_accuracy": 0.17299638837575912,
"num_tokens": 26149575.0,
"step": 15070
},
{
"entropy": 5.549425220489502,
"epoch": 1.1728846527912857,
"grad_norm": 1.390625,
"learning_rate": 0.00048661015764514765,
"loss": 5.3,
"mean_token_accuracy": 0.17698389291763306,
"num_tokens": 26158743.0,
"step": 15075
},
{
"entropy": 5.512171936035156,
"epoch": 1.1732736821630034,
"grad_norm": 1.40625,
"learning_rate": 0.00048660073765944927,
"loss": 5.2965,
"mean_token_accuracy": 0.17440622597932814,
"num_tokens": 26167380.0,
"step": 15080
},
{
"entropy": 5.432060766220093,
"epoch": 1.173662711534721,
"grad_norm": 1.421875,
"learning_rate": 0.0004865913144630465,
"loss": 5.2284,
"mean_token_accuracy": 0.17474821209907532,
"num_tokens": 26175613.0,
"step": 15085
},
{
"entropy": 5.5436242580413815,
"epoch": 1.1740517409064384,
"grad_norm": 1.34375,
"learning_rate": 0.00048658188805608227,
"loss": 5.3448,
"mean_token_accuracy": 0.17022832483053207,
"num_tokens": 26184347.0,
"step": 15090
},
{
"entropy": 5.49397382736206,
"epoch": 1.174440770278156,
"grad_norm": 1.359375,
"learning_rate": 0.0004865724584386998,
"loss": 5.3047,
"mean_token_accuracy": 0.17209259569644927,
"num_tokens": 26193513.0,
"step": 15095
},
{
"entropy": 5.545153188705444,
"epoch": 1.1748297996498736,
"grad_norm": 1.6015625,
"learning_rate": 0.0004865630256110418,
"loss": 5.2763,
"mean_token_accuracy": 0.16896928250789642,
"num_tokens": 26202790.0,
"step": 15100
},
{
"entropy": 5.495885372161865,
"epoch": 1.175218829021591,
"grad_norm": 1.546875,
"learning_rate": 0.00048655358957325174,
"loss": 5.2316,
"mean_token_accuracy": 0.17473772317171096,
"num_tokens": 26211032.0,
"step": 15105
},
{
"entropy": 5.428192234039306,
"epoch": 1.1756078583933087,
"grad_norm": 1.421875,
"learning_rate": 0.00048654415032547277,
"loss": 5.1797,
"mean_token_accuracy": 0.17604877501726152,
"num_tokens": 26219963.0,
"step": 15110
},
{
"entropy": 5.550877809524536,
"epoch": 1.1759968877650262,
"grad_norm": 1.5703125,
"learning_rate": 0.00048653470786784794,
"loss": 5.2433,
"mean_token_accuracy": 0.17054082304239274,
"num_tokens": 26228164.0,
"step": 15115
},
{
"entropy": 5.501662302017212,
"epoch": 1.176385917136744,
"grad_norm": 1.40625,
"learning_rate": 0.0004865252622005206,
"loss": 5.2454,
"mean_token_accuracy": 0.1808508187532425,
"num_tokens": 26236294.0,
"step": 15120
},
{
"entropy": 5.416070222854614,
"epoch": 1.1767749465084614,
"grad_norm": 1.53125,
"learning_rate": 0.00048651581332363405,
"loss": 5.2087,
"mean_token_accuracy": 0.17768478989601136,
"num_tokens": 26244955.0,
"step": 15125
},
{
"entropy": 5.523351240158081,
"epoch": 1.177163975880179,
"grad_norm": 1.5078125,
"learning_rate": 0.00048650636123733176,
"loss": 5.3077,
"mean_token_accuracy": 0.17069950699806213,
"num_tokens": 26253221.0,
"step": 15130
},
{
"entropy": 5.560183048248291,
"epoch": 1.1775530052518965,
"grad_norm": 1.2890625,
"learning_rate": 0.0004864969059417571,
"loss": 5.3806,
"mean_token_accuracy": 0.1650077536702156,
"num_tokens": 26262544.0,
"step": 15135
},
{
"entropy": 5.55550627708435,
"epoch": 1.177942034623614,
"grad_norm": 1.4140625,
"learning_rate": 0.0004864874474370534,
"loss": 5.2679,
"mean_token_accuracy": 0.17493995726108552,
"num_tokens": 26271864.0,
"step": 15140
},
{
"entropy": 5.543304347991944,
"epoch": 1.1783310639953317,
"grad_norm": 1.5234375,
"learning_rate": 0.00048647798572336445,
"loss": 5.3098,
"mean_token_accuracy": 0.17515021115541457,
"num_tokens": 26279713.0,
"step": 15145
},
{
"entropy": 5.475018787384033,
"epoch": 1.1787200933670492,
"grad_norm": 1.40625,
"learning_rate": 0.00048646852080083355,
"loss": 5.1448,
"mean_token_accuracy": 0.18069939464330673,
"num_tokens": 26288654.0,
"step": 15150
},
{
"entropy": 5.482875013351441,
"epoch": 1.1791091227387667,
"grad_norm": 1.640625,
"learning_rate": 0.0004864590526696045,
"loss": 5.3347,
"mean_token_accuracy": 0.16853394359350204,
"num_tokens": 26297007.0,
"step": 15155
},
{
"entropy": 5.487427234649658,
"epoch": 1.1794981521104844,
"grad_norm": 1.4375,
"learning_rate": 0.00048644958132982094,
"loss": 5.2558,
"mean_token_accuracy": 0.1802915945649147,
"num_tokens": 26305601.0,
"step": 15160
},
{
"entropy": 5.51662049293518,
"epoch": 1.1798871814822018,
"grad_norm": 1.4765625,
"learning_rate": 0.00048644010678162644,
"loss": 5.285,
"mean_token_accuracy": 0.18299965113401412,
"num_tokens": 26313455.0,
"step": 15165
},
{
"entropy": 5.509361934661865,
"epoch": 1.1802762108539195,
"grad_norm": 1.328125,
"learning_rate": 0.0004864306290251649,
"loss": 5.3318,
"mean_token_accuracy": 0.172724649310112,
"num_tokens": 26322450.0,
"step": 15170
},
{
"entropy": 5.550538444519043,
"epoch": 1.180665240225637,
"grad_norm": 1.390625,
"learning_rate": 0.00048642114806058014,
"loss": 5.3165,
"mean_token_accuracy": 0.16448683887720109,
"num_tokens": 26331301.0,
"step": 15175
},
{
"entropy": 5.6680913925170895,
"epoch": 1.1810542695973547,
"grad_norm": 1.390625,
"learning_rate": 0.0004864116638880159,
"loss": 5.4072,
"mean_token_accuracy": 0.17031198740005493,
"num_tokens": 26339937.0,
"step": 15180
},
{
"entropy": 5.570975589752197,
"epoch": 1.1814432989690722,
"grad_norm": 1.3046875,
"learning_rate": 0.0004864021765076162,
"loss": 5.2674,
"mean_token_accuracy": 0.1754144087433815,
"num_tokens": 26348541.0,
"step": 15185
},
{
"entropy": 5.40344500541687,
"epoch": 1.1818323283407897,
"grad_norm": 1.390625,
"learning_rate": 0.00048639268591952494,
"loss": 5.2174,
"mean_token_accuracy": 0.17627357095479965,
"num_tokens": 26356621.0,
"step": 15190
},
{
"entropy": 5.52975640296936,
"epoch": 1.1822213577125074,
"grad_norm": 1.234375,
"learning_rate": 0.00048638319212388614,
"loss": 5.3279,
"mean_token_accuracy": 0.17215086221694947,
"num_tokens": 26366112.0,
"step": 15195
},
{
"entropy": 5.581024980545044,
"epoch": 1.1826103870842248,
"grad_norm": 1.328125,
"learning_rate": 0.0004863736951208438,
"loss": 5.3225,
"mean_token_accuracy": 0.17638045847415923,
"num_tokens": 26374768.0,
"step": 15200
},
{
"entropy": 5.550275993347168,
"epoch": 1.1829994164559423,
"grad_norm": 1.2734375,
"learning_rate": 0.00048636419491054217,
"loss": 5.2941,
"mean_token_accuracy": 0.17490982711315156,
"num_tokens": 26383097.0,
"step": 15205
},
{
"entropy": 5.5006516456604,
"epoch": 1.18338844582766,
"grad_norm": 1.4375,
"learning_rate": 0.0004863546914931252,
"loss": 5.2702,
"mean_token_accuracy": 0.1742387518286705,
"num_tokens": 26391361.0,
"step": 15210
},
{
"entropy": 5.521454906463623,
"epoch": 1.1837774751993775,
"grad_norm": 1.515625,
"learning_rate": 0.0004863451848687373,
"loss": 5.2238,
"mean_token_accuracy": 0.18027711510658265,
"num_tokens": 26400818.0,
"step": 15215
},
{
"entropy": 5.531339359283447,
"epoch": 1.1841665045710952,
"grad_norm": 1.3671875,
"learning_rate": 0.00048633567503752253,
"loss": 5.2781,
"mean_token_accuracy": 0.1759803846478462,
"num_tokens": 26409650.0,
"step": 15220
},
{
"entropy": 5.449646615982056,
"epoch": 1.1845555339428127,
"grad_norm": 1.59375,
"learning_rate": 0.0004863261619996253,
"loss": 5.1846,
"mean_token_accuracy": 0.1811449259519577,
"num_tokens": 26418237.0,
"step": 15225
},
{
"entropy": 5.4022862911224365,
"epoch": 1.1849445633145304,
"grad_norm": 1.2890625,
"learning_rate": 0.0004863166457551899,
"loss": 5.1252,
"mean_token_accuracy": 0.19037967175245285,
"num_tokens": 26426366.0,
"step": 15230
},
{
"entropy": 5.374770402908325,
"epoch": 1.1853335926862478,
"grad_norm": 1.2890625,
"learning_rate": 0.0004863071263043608,
"loss": 5.2241,
"mean_token_accuracy": 0.1722566530108452,
"num_tokens": 26435603.0,
"step": 15235
},
{
"entropy": 5.529952478408814,
"epoch": 1.1857226220579653,
"grad_norm": 1.421875,
"learning_rate": 0.0004862976036472823,
"loss": 5.3581,
"mean_token_accuracy": 0.1680940419435501,
"num_tokens": 26444230.0,
"step": 15240
},
{
"entropy": 5.517985773086548,
"epoch": 1.186111651429683,
"grad_norm": 1.359375,
"learning_rate": 0.00048628807778409907,
"loss": 5.2194,
"mean_token_accuracy": 0.17059637010097503,
"num_tokens": 26452779.0,
"step": 15245
},
{
"entropy": 5.499024677276611,
"epoch": 1.1865006808014005,
"grad_norm": 1.3203125,
"learning_rate": 0.0004862785487149555,
"loss": 5.3557,
"mean_token_accuracy": 0.1689263641834259,
"num_tokens": 26461977.0,
"step": 15250
},
{
"entropy": 5.505593967437744,
"epoch": 1.186889710173118,
"grad_norm": 1.6328125,
"learning_rate": 0.0004862690164399963,
"loss": 5.1614,
"mean_token_accuracy": 0.17805588394403457,
"num_tokens": 26470182.0,
"step": 15255
},
{
"entropy": 5.526981163024902,
"epoch": 1.1872787395448356,
"grad_norm": 1.4375,
"learning_rate": 0.00048625948095936593,
"loss": 5.3788,
"mean_token_accuracy": 0.16746178418397903,
"num_tokens": 26479445.0,
"step": 15260
},
{
"entropy": 5.500918674468994,
"epoch": 1.1876677689165531,
"grad_norm": 1.3125,
"learning_rate": 0.00048624994227320923,
"loss": 5.2275,
"mean_token_accuracy": 0.17573239505290986,
"num_tokens": 26488085.0,
"step": 15265
},
{
"entropy": 5.640781307220459,
"epoch": 1.1880567982882708,
"grad_norm": 1.359375,
"learning_rate": 0.00048624040038167094,
"loss": 5.3946,
"mean_token_accuracy": 0.1723005637526512,
"num_tokens": 26496849.0,
"step": 15270
},
{
"entropy": 5.491225814819336,
"epoch": 1.1884458276599883,
"grad_norm": 1.296875,
"learning_rate": 0.00048623085528489584,
"loss": 5.2667,
"mean_token_accuracy": 0.17982023060321808,
"num_tokens": 26505412.0,
"step": 15275
},
{
"entropy": 5.443025255203247,
"epoch": 1.188834857031706,
"grad_norm": 1.3359375,
"learning_rate": 0.00048622130698302863,
"loss": 5.2326,
"mean_token_accuracy": 0.17415424883365632,
"num_tokens": 26513564.0,
"step": 15280
},
{
"entropy": 5.436628818511963,
"epoch": 1.1892238864034235,
"grad_norm": 1.3671875,
"learning_rate": 0.00048621175547621426,
"loss": 5.2306,
"mean_token_accuracy": 0.17475161105394363,
"num_tokens": 26522230.0,
"step": 15285
},
{
"entropy": 5.458022022247315,
"epoch": 1.189612915775141,
"grad_norm": 1.3125,
"learning_rate": 0.0004862022007645978,
"loss": 5.2401,
"mean_token_accuracy": 0.1740517407655716,
"num_tokens": 26531719.0,
"step": 15290
},
{
"entropy": 5.46057825088501,
"epoch": 1.1900019451468586,
"grad_norm": 1.21875,
"learning_rate": 0.00048619264284832403,
"loss": 5.1967,
"mean_token_accuracy": 0.1912194475531578,
"num_tokens": 26540352.0,
"step": 15295
},
{
"entropy": 5.540399408340454,
"epoch": 1.1903909745185761,
"grad_norm": 1.328125,
"learning_rate": 0.00048618308172753804,
"loss": 5.1781,
"mean_token_accuracy": 0.18599122613668442,
"num_tokens": 26548252.0,
"step": 15300
},
{
"entropy": 5.54229965209961,
"epoch": 1.1907800038902936,
"grad_norm": 1.59375,
"learning_rate": 0.0004861735174023849,
"loss": 5.2762,
"mean_token_accuracy": 0.17638776004314421,
"num_tokens": 26557267.0,
"step": 15305
},
{
"entropy": 5.5406331539154055,
"epoch": 1.1911690332620113,
"grad_norm": 1.359375,
"learning_rate": 0.00048616394987300985,
"loss": 5.3679,
"mean_token_accuracy": 0.1719802737236023,
"num_tokens": 26566221.0,
"step": 15310
},
{
"entropy": 5.497641372680664,
"epoch": 1.1915580626337288,
"grad_norm": 1.3359375,
"learning_rate": 0.0004861543791395579,
"loss": 5.3777,
"mean_token_accuracy": 0.1763498917222023,
"num_tokens": 26574826.0,
"step": 15315
},
{
"entropy": 5.527216863632202,
"epoch": 1.1919470920054465,
"grad_norm": 1.3046875,
"learning_rate": 0.0004861448052021743,
"loss": 5.3389,
"mean_token_accuracy": 0.1643924131989479,
"num_tokens": 26583442.0,
"step": 15320
},
{
"entropy": 5.575404262542724,
"epoch": 1.192336121377164,
"grad_norm": 1.40625,
"learning_rate": 0.0004861352280610044,
"loss": 5.3027,
"mean_token_accuracy": 0.17529321759939193,
"num_tokens": 26592106.0,
"step": 15325
},
{
"entropy": 5.479348087310791,
"epoch": 1.1927251507488816,
"grad_norm": 1.4140625,
"learning_rate": 0.00048612564771619346,
"loss": 5.161,
"mean_token_accuracy": 0.17972079962491988,
"num_tokens": 26601275.0,
"step": 15330
},
{
"entropy": 5.399018144607544,
"epoch": 1.193114180120599,
"grad_norm": 1.203125,
"learning_rate": 0.00048611606416788686,
"loss": 5.1236,
"mean_token_accuracy": 0.1844784289598465,
"num_tokens": 26610179.0,
"step": 15335
},
{
"entropy": 5.481526327133179,
"epoch": 1.1935032094923166,
"grad_norm": 1.375,
"learning_rate": 0.00048610647741622996,
"loss": 5.3131,
"mean_token_accuracy": 0.17379384785890578,
"num_tokens": 26619463.0,
"step": 15340
},
{
"entropy": 5.472293472290039,
"epoch": 1.1938922388640343,
"grad_norm": 1.4609375,
"learning_rate": 0.0004860968874613683,
"loss": 5.1402,
"mean_token_accuracy": 0.18848013132810593,
"num_tokens": 26627597.0,
"step": 15345
},
{
"entropy": 5.47904896736145,
"epoch": 1.1942812682357518,
"grad_norm": 1.3515625,
"learning_rate": 0.0004860872943034474,
"loss": 5.2556,
"mean_token_accuracy": 0.18038507848978041,
"num_tokens": 26636180.0,
"step": 15350
},
{
"entropy": 5.434398937225342,
"epoch": 1.1946702976074695,
"grad_norm": 1.484375,
"learning_rate": 0.0004860776979426128,
"loss": 5.1752,
"mean_token_accuracy": 0.1820618912577629,
"num_tokens": 26644803.0,
"step": 15355
},
{
"entropy": 5.416516971588135,
"epoch": 1.195059326979187,
"grad_norm": 1.375,
"learning_rate": 0.0004860680983790101,
"loss": 5.2214,
"mean_token_accuracy": 0.1702832743525505,
"num_tokens": 26653619.0,
"step": 15360
},
{
"entropy": 5.506034660339355,
"epoch": 1.1954483563509044,
"grad_norm": 1.2734375,
"learning_rate": 0.0004860584956127849,
"loss": 5.2399,
"mean_token_accuracy": 0.16921795904636383,
"num_tokens": 26662291.0,
"step": 15365
},
{
"entropy": 5.491010427474976,
"epoch": 1.195837385722622,
"grad_norm": 1.296875,
"learning_rate": 0.00048604888964408306,
"loss": 5.1986,
"mean_token_accuracy": 0.18535471260547637,
"num_tokens": 26670592.0,
"step": 15370
},
{
"entropy": 5.4652605056762695,
"epoch": 1.1962264150943396,
"grad_norm": 1.453125,
"learning_rate": 0.0004860392804730502,
"loss": 5.2734,
"mean_token_accuracy": 0.17707352191209794,
"num_tokens": 26679816.0,
"step": 15375
},
{
"entropy": 5.518105840682983,
"epoch": 1.1966154444660573,
"grad_norm": 1.4140625,
"learning_rate": 0.00048602966809983204,
"loss": 5.2393,
"mean_token_accuracy": 0.182095468044281,
"num_tokens": 26688185.0,
"step": 15380
},
{
"entropy": 5.514083290100098,
"epoch": 1.1970044738377748,
"grad_norm": 1.46875,
"learning_rate": 0.0004860200525245746,
"loss": 5.3066,
"mean_token_accuracy": 0.1808842182159424,
"num_tokens": 26697157.0,
"step": 15385
},
{
"entropy": 5.4472421169281,
"epoch": 1.1973935032094922,
"grad_norm": 1.359375,
"learning_rate": 0.0004860104337474239,
"loss": 5.248,
"mean_token_accuracy": 0.16783505380153657,
"num_tokens": 26705868.0,
"step": 15390
},
{
"entropy": 5.543714904785157,
"epoch": 1.19778253258121,
"grad_norm": 1.4140625,
"learning_rate": 0.00048600081176852555,
"loss": 5.3134,
"mean_token_accuracy": 0.17632490396499634,
"num_tokens": 26714364.0,
"step": 15395
},
{
"entropy": 5.525758981704712,
"epoch": 1.1981715619529274,
"grad_norm": 1.3984375,
"learning_rate": 0.00048599118658802575,
"loss": 5.2808,
"mean_token_accuracy": 0.17054822593927382,
"num_tokens": 26722866.0,
"step": 15400
},
{
"entropy": 5.542753410339356,
"epoch": 1.198560591324645,
"grad_norm": 1.34375,
"learning_rate": 0.0004859815582060706,
"loss": 5.2112,
"mean_token_accuracy": 0.17796418964862823,
"num_tokens": 26731305.0,
"step": 15405
},
{
"entropy": 5.525659894943237,
"epoch": 1.1989496206963626,
"grad_norm": 1.390625,
"learning_rate": 0.0004859719266228061,
"loss": 5.2612,
"mean_token_accuracy": 0.17567186504602433,
"num_tokens": 26740807.0,
"step": 15410
},
{
"entropy": 5.483808898925782,
"epoch": 1.19933865006808,
"grad_norm": 1.6640625,
"learning_rate": 0.0004859622918383784,
"loss": 5.2398,
"mean_token_accuracy": 0.17919955551624298,
"num_tokens": 26749748.0,
"step": 15415
},
{
"entropy": 5.537015390396118,
"epoch": 1.1997276794397977,
"grad_norm": 1.3515625,
"learning_rate": 0.0004859526538529337,
"loss": 5.2994,
"mean_token_accuracy": 0.17403259873390198,
"num_tokens": 26758597.0,
"step": 15420
},
{
"entropy": 5.506263399124146,
"epoch": 1.2001167088115152,
"grad_norm": 1.390625,
"learning_rate": 0.0004859430126666182,
"loss": 5.335,
"mean_token_accuracy": 0.17321491688489915,
"num_tokens": 26766772.0,
"step": 15425
},
{
"entropy": 5.3521260738372805,
"epoch": 1.200505738183233,
"grad_norm": 1.3203125,
"learning_rate": 0.00048593336827957824,
"loss": 5.0842,
"mean_token_accuracy": 0.19030144065618515,
"num_tokens": 26775229.0,
"step": 15430
},
{
"entropy": 5.404987955093384,
"epoch": 1.2008947675549504,
"grad_norm": 1.28125,
"learning_rate": 0.00048592372069196024,
"loss": 5.2477,
"mean_token_accuracy": 0.17235234379768372,
"num_tokens": 26784188.0,
"step": 15435
},
{
"entropy": 5.39737639427185,
"epoch": 1.2012837969266679,
"grad_norm": 1.4375,
"learning_rate": 0.0004859140699039104,
"loss": 5.1683,
"mean_token_accuracy": 0.18072133809328078,
"num_tokens": 26792687.0,
"step": 15440
},
{
"entropy": 5.438218641281128,
"epoch": 1.2016728262983856,
"grad_norm": 1.4296875,
"learning_rate": 0.00048590441591557526,
"loss": 5.2364,
"mean_token_accuracy": 0.17849221229553222,
"num_tokens": 26801931.0,
"step": 15445
},
{
"entropy": 5.505065441131592,
"epoch": 1.202061855670103,
"grad_norm": 1.671875,
"learning_rate": 0.00048589475872710134,
"loss": 5.4476,
"mean_token_accuracy": 0.17276598885655403,
"num_tokens": 26810689.0,
"step": 15450
},
{
"entropy": 5.5509138107299805,
"epoch": 1.2024508850418207,
"grad_norm": 1.5390625,
"learning_rate": 0.0004858850983386351,
"loss": 5.2543,
"mean_token_accuracy": 0.17251985818147658,
"num_tokens": 26819038.0,
"step": 15455
},
{
"entropy": 5.482952213287353,
"epoch": 1.2028399144135382,
"grad_norm": 1.2890625,
"learning_rate": 0.0004858754347503231,
"loss": 5.168,
"mean_token_accuracy": 0.1780230164527893,
"num_tokens": 26827443.0,
"step": 15460
},
{
"entropy": 5.424577140808106,
"epoch": 1.203228943785256,
"grad_norm": 1.3828125,
"learning_rate": 0.00048586576796231216,
"loss": 5.1843,
"mean_token_accuracy": 0.18295662850141525,
"num_tokens": 26836306.0,
"step": 15465
},
{
"entropy": 5.4828393936157225,
"epoch": 1.2036179731569734,
"grad_norm": 1.34375,
"learning_rate": 0.0004858560979747487,
"loss": 5.2853,
"mean_token_accuracy": 0.16759757846593856,
"num_tokens": 26845043.0,
"step": 15470
},
{
"entropy": 5.51875672340393,
"epoch": 1.2040070025286909,
"grad_norm": 1.3046875,
"learning_rate": 0.00048584642478777967,
"loss": 5.2176,
"mean_token_accuracy": 0.1779843732714653,
"num_tokens": 26853978.0,
"step": 15475
},
{
"entropy": 5.464112997055054,
"epoch": 1.2043960319004086,
"grad_norm": 1.28125,
"learning_rate": 0.0004858367484015517,
"loss": 5.1418,
"mean_token_accuracy": 0.1793970361351967,
"num_tokens": 26862487.0,
"step": 15480
},
{
"entropy": 5.452538061141968,
"epoch": 1.204785061272126,
"grad_norm": 1.3984375,
"learning_rate": 0.00048582706881621166,
"loss": 5.3087,
"mean_token_accuracy": 0.17768737971782683,
"num_tokens": 26871137.0,
"step": 15485
},
{
"entropy": 5.475749444961548,
"epoch": 1.2051740906438435,
"grad_norm": 1.40625,
"learning_rate": 0.0004858173860319063,
"loss": 5.1906,
"mean_token_accuracy": 0.17435334771871566,
"num_tokens": 26880091.0,
"step": 15490
},
{
"entropy": 5.468170690536499,
"epoch": 1.2055631200155612,
"grad_norm": 1.421875,
"learning_rate": 0.00048580770004878277,
"loss": 5.248,
"mean_token_accuracy": 0.17480643689632416,
"num_tokens": 26888777.0,
"step": 15495
},
{
"entropy": 5.483546781539917,
"epoch": 1.2059521493872787,
"grad_norm": 1.5546875,
"learning_rate": 0.0004857980108669879,
"loss": 5.1864,
"mean_token_accuracy": 0.17777623981237411,
"num_tokens": 26897689.0,
"step": 15500
},
{
"entropy": 5.537374830245971,
"epoch": 1.2063411787589964,
"grad_norm": 1.4921875,
"learning_rate": 0.00048578831848666875,
"loss": 5.2429,
"mean_token_accuracy": 0.17582704722881318,
"num_tokens": 26906209.0,
"step": 15505
},
{
"entropy": 5.5790770053863525,
"epoch": 1.2067302081307139,
"grad_norm": 1.2890625,
"learning_rate": 0.00048577862290797235,
"loss": 5.4158,
"mean_token_accuracy": 0.16453992575407028,
"num_tokens": 26916340.0,
"step": 15510
},
{
"entropy": 5.511990022659302,
"epoch": 1.2071192375024316,
"grad_norm": 1.3515625,
"learning_rate": 0.00048576892413104586,
"loss": 5.277,
"mean_token_accuracy": 0.17492361217737198,
"num_tokens": 26924482.0,
"step": 15515
},
{
"entropy": 5.43505449295044,
"epoch": 1.207508266874149,
"grad_norm": 1.4140625,
"learning_rate": 0.0004857592221560364,
"loss": 5.209,
"mean_token_accuracy": 0.17647359967231752,
"num_tokens": 26932844.0,
"step": 15520
},
{
"entropy": 5.410753059387207,
"epoch": 1.2078972962458665,
"grad_norm": 1.2890625,
"learning_rate": 0.0004857495169830912,
"loss": 5.1136,
"mean_token_accuracy": 0.1828247383236885,
"num_tokens": 26940916.0,
"step": 15525
},
{
"entropy": 5.541863298416137,
"epoch": 1.2082863256175842,
"grad_norm": 1.3671875,
"learning_rate": 0.0004857398086123575,
"loss": 5.2514,
"mean_token_accuracy": 0.17455164194107056,
"num_tokens": 26949182.0,
"step": 15530
},
{
"entropy": 5.4823707103729244,
"epoch": 1.2086753549893017,
"grad_norm": 1.390625,
"learning_rate": 0.0004857300970439827,
"loss": 5.2274,
"mean_token_accuracy": 0.17845567762851716,
"num_tokens": 26957531.0,
"step": 15535
},
{
"entropy": 5.511475992202759,
"epoch": 1.2090643843610192,
"grad_norm": 1.546875,
"learning_rate": 0.00048572038227811404,
"loss": 5.3029,
"mean_token_accuracy": 0.17839886099100113,
"num_tokens": 26965430.0,
"step": 15540
},
{
"entropy": 5.535074663162232,
"epoch": 1.2094534137327368,
"grad_norm": 1.3828125,
"learning_rate": 0.000485710664314899,
"loss": 5.3327,
"mean_token_accuracy": 0.17270613163709642,
"num_tokens": 26974132.0,
"step": 15545
},
{
"entropy": 5.48595027923584,
"epoch": 1.2098424431044543,
"grad_norm": 1.3984375,
"learning_rate": 0.000485700943154485,
"loss": 5.2194,
"mean_token_accuracy": 0.18303572684526442,
"num_tokens": 26982277.0,
"step": 15550
},
{
"entropy": 5.412470388412475,
"epoch": 1.210231472476172,
"grad_norm": 1.2890625,
"learning_rate": 0.0004856912187970195,
"loss": 5.1891,
"mean_token_accuracy": 0.1742159217596054,
"num_tokens": 26991827.0,
"step": 15555
},
{
"entropy": 5.551828336715698,
"epoch": 1.2106205018478895,
"grad_norm": 1.421875,
"learning_rate": 0.0004856814912426502,
"loss": 5.3397,
"mean_token_accuracy": 0.16540759950876235,
"num_tokens": 27000697.0,
"step": 15560
},
{
"entropy": 5.4759745597839355,
"epoch": 1.2110095312196072,
"grad_norm": 1.3984375,
"learning_rate": 0.0004856717604915245,
"loss": 5.2747,
"mean_token_accuracy": 0.17751561254262924,
"num_tokens": 27009461.0,
"step": 15565
},
{
"entropy": 5.442897462844849,
"epoch": 1.2113985605913247,
"grad_norm": 1.3046875,
"learning_rate": 0.0004856620265437902,
"loss": 5.1991,
"mean_token_accuracy": 0.17782714813947678,
"num_tokens": 27017970.0,
"step": 15570
},
{
"entropy": 5.460359668731689,
"epoch": 1.2117875899630421,
"grad_norm": 1.5546875,
"learning_rate": 0.000485652289399595,
"loss": 5.2819,
"mean_token_accuracy": 0.17499244064092637,
"num_tokens": 27026439.0,
"step": 15575
},
{
"entropy": 5.433102321624756,
"epoch": 1.2121766193347598,
"grad_norm": 1.4609375,
"learning_rate": 0.00048564254905908655,
"loss": 5.2492,
"mean_token_accuracy": 0.17063169777393342,
"num_tokens": 27034985.0,
"step": 15580
},
{
"entropy": 5.537007188796997,
"epoch": 1.2125656487064773,
"grad_norm": 1.4765625,
"learning_rate": 0.00048563280552241266,
"loss": 5.3667,
"mean_token_accuracy": 0.17174585908651352,
"num_tokens": 27044171.0,
"step": 15585
},
{
"entropy": 5.572177124023438,
"epoch": 1.2129546780781948,
"grad_norm": 1.359375,
"learning_rate": 0.0004856230587897212,
"loss": 5.3152,
"mean_token_accuracy": 0.17625476270914078,
"num_tokens": 27053219.0,
"step": 15590
},
{
"entropy": 5.475028705596924,
"epoch": 1.2133437074499125,
"grad_norm": 1.3515625,
"learning_rate": 0.0004856133088611602,
"loss": 5.1846,
"mean_token_accuracy": 0.18433427661657334,
"num_tokens": 27062012.0,
"step": 15595
},
{
"entropy": 5.473410034179688,
"epoch": 1.21373273682163,
"grad_norm": 1.4140625,
"learning_rate": 0.0004856035557368773,
"loss": 5.28,
"mean_token_accuracy": 0.16721234619617462,
"num_tokens": 27070854.0,
"step": 15600
},
{
"entropy": 5.553583383560181,
"epoch": 1.2141217661933477,
"grad_norm": 1.4140625,
"learning_rate": 0.00048559379941702074,
"loss": 5.3124,
"mean_token_accuracy": 0.17317847311496734,
"num_tokens": 27079295.0,
"step": 15605
},
{
"entropy": 5.497786045074463,
"epoch": 1.2145107955650651,
"grad_norm": 1.375,
"learning_rate": 0.00048558403990173844,
"loss": 5.2067,
"mean_token_accuracy": 0.17837853133678436,
"num_tokens": 27087909.0,
"step": 15610
},
{
"entropy": 5.423837566375733,
"epoch": 1.2148998249367828,
"grad_norm": 1.3828125,
"learning_rate": 0.00048557427719117855,
"loss": 5.2419,
"mean_token_accuracy": 0.17956048548221587,
"num_tokens": 27096461.0,
"step": 15615
},
{
"entropy": 5.511550760269165,
"epoch": 1.2152888543085003,
"grad_norm": 1.3359375,
"learning_rate": 0.0004855645112854891,
"loss": 5.3761,
"mean_token_accuracy": 0.17158395648002625,
"num_tokens": 27104846.0,
"step": 15620
},
{
"entropy": 5.546880769729614,
"epoch": 1.2156778836802178,
"grad_norm": 1.375,
"learning_rate": 0.0004855547421848184,
"loss": 5.1679,
"mean_token_accuracy": 0.18537740260362626,
"num_tokens": 27112623.0,
"step": 15625
},
{
"entropy": 5.439598798751831,
"epoch": 1.2160669130519355,
"grad_norm": 1.390625,
"learning_rate": 0.00048554496988931456,
"loss": 5.2014,
"mean_token_accuracy": 0.18307663649320602,
"num_tokens": 27120752.0,
"step": 15630
},
{
"entropy": 5.499944257736206,
"epoch": 1.216455942423653,
"grad_norm": 1.3984375,
"learning_rate": 0.00048553519439912597,
"loss": 5.3724,
"mean_token_accuracy": 0.168205526471138,
"num_tokens": 27129583.0,
"step": 15635
},
{
"entropy": 5.550511360168457,
"epoch": 1.2168449717953704,
"grad_norm": 1.3515625,
"learning_rate": 0.0004855254157144009,
"loss": 5.2922,
"mean_token_accuracy": 0.17158283442258834,
"num_tokens": 27137807.0,
"step": 15640
},
{
"entropy": 5.436446952819824,
"epoch": 1.2172340011670881,
"grad_norm": 1.3828125,
"learning_rate": 0.0004855156338352877,
"loss": 5.1372,
"mean_token_accuracy": 0.18327006846666336,
"num_tokens": 27146246.0,
"step": 15645
},
{
"entropy": 5.443410921096802,
"epoch": 1.2176230305388056,
"grad_norm": 1.59375,
"learning_rate": 0.00048550584876193493,
"loss": 5.2233,
"mean_token_accuracy": 0.17513495087623596,
"num_tokens": 27154811.0,
"step": 15650
},
{
"entropy": 5.483706426620484,
"epoch": 1.2180120599105233,
"grad_norm": 1.453125,
"learning_rate": 0.00048549606049449085,
"loss": 5.2265,
"mean_token_accuracy": 0.1862750008702278,
"num_tokens": 27162849.0,
"step": 15655
},
{
"entropy": 5.470354604721069,
"epoch": 1.2184010892822408,
"grad_norm": 1.421875,
"learning_rate": 0.0004854862690331041,
"loss": 5.3031,
"mean_token_accuracy": 0.17516927570104598,
"num_tokens": 27171268.0,
"step": 15660
},
{
"entropy": 5.531012630462646,
"epoch": 1.2187901186539585,
"grad_norm": 1.3515625,
"learning_rate": 0.00048547647437792327,
"loss": 5.2487,
"mean_token_accuracy": 0.17604827582836152,
"num_tokens": 27179571.0,
"step": 15665
},
{
"entropy": 5.475275182723999,
"epoch": 1.219179148025676,
"grad_norm": 1.453125,
"learning_rate": 0.000485466676529097,
"loss": 5.2397,
"mean_token_accuracy": 0.17888182848691941,
"num_tokens": 27188441.0,
"step": 15670
},
{
"entropy": 5.478651857376098,
"epoch": 1.2195681773973934,
"grad_norm": 1.5390625,
"learning_rate": 0.00048545687548677373,
"loss": 5.2406,
"mean_token_accuracy": 0.17476353645324708,
"num_tokens": 27196960.0,
"step": 15675
},
{
"entropy": 5.487743902206421,
"epoch": 1.2199572067691111,
"grad_norm": 1.3671875,
"learning_rate": 0.0004854470712511025,
"loss": 5.2402,
"mean_token_accuracy": 0.17835523933172226,
"num_tokens": 27205129.0,
"step": 15680
},
{
"entropy": 5.4481260776519775,
"epoch": 1.2203462361408286,
"grad_norm": 1.3359375,
"learning_rate": 0.00048543726382223193,
"loss": 5.1846,
"mean_token_accuracy": 0.18032802641391754,
"num_tokens": 27214213.0,
"step": 15685
},
{
"entropy": 5.450518226623535,
"epoch": 1.220735265512546,
"grad_norm": 1.4609375,
"learning_rate": 0.00048542745320031075,
"loss": 5.2766,
"mean_token_accuracy": 0.16967780143022537,
"num_tokens": 27222447.0,
"step": 15690
},
{
"entropy": 5.508639764785767,
"epoch": 1.2211242948842638,
"grad_norm": 1.3515625,
"learning_rate": 0.00048541763938548795,
"loss": 5.2319,
"mean_token_accuracy": 0.17223200500011443,
"num_tokens": 27230872.0,
"step": 15695
},
{
"entropy": 5.465868234634399,
"epoch": 1.2215133242559812,
"grad_norm": 1.328125,
"learning_rate": 0.00048540782237791244,
"loss": 5.2799,
"mean_token_accuracy": 0.17547931671142578,
"num_tokens": 27239171.0,
"step": 15700
},
{
"entropy": 5.424468183517456,
"epoch": 1.221902353627699,
"grad_norm": 1.375,
"learning_rate": 0.00048539800217773293,
"loss": 5.2162,
"mean_token_accuracy": 0.17269158065319062,
"num_tokens": 27247530.0,
"step": 15705
},
{
"entropy": 5.511728000640869,
"epoch": 1.2222913829994164,
"grad_norm": 1.640625,
"learning_rate": 0.0004853881787850988,
"loss": 5.2837,
"mean_token_accuracy": 0.17648686915636064,
"num_tokens": 27255579.0,
"step": 15710
},
{
"entropy": 5.425483655929566,
"epoch": 1.2226804123711341,
"grad_norm": 1.515625,
"learning_rate": 0.00048537835220015886,
"loss": 5.2355,
"mean_token_accuracy": 0.17767584025859834,
"num_tokens": 27264209.0,
"step": 15715
},
{
"entropy": 5.506767272949219,
"epoch": 1.2230694417428516,
"grad_norm": 1.5234375,
"learning_rate": 0.0004853685224230623,
"loss": 5.3054,
"mean_token_accuracy": 0.16528232246637345,
"num_tokens": 27272424.0,
"step": 15720
},
{
"entropy": 5.457148122787475,
"epoch": 1.223458471114569,
"grad_norm": 1.3359375,
"learning_rate": 0.00048535868945395825,
"loss": 5.1065,
"mean_token_accuracy": 0.18542055338621138,
"num_tokens": 27281265.0,
"step": 15725
},
{
"entropy": 5.549820041656494,
"epoch": 1.2238475004862868,
"grad_norm": 1.3046875,
"learning_rate": 0.00048534885329299586,
"loss": 5.3693,
"mean_token_accuracy": 0.17770871222019197,
"num_tokens": 27290026.0,
"step": 15730
},
{
"entropy": 5.505022144317627,
"epoch": 1.2242365298580042,
"grad_norm": 1.578125,
"learning_rate": 0.0004853390139403245,
"loss": 5.3273,
"mean_token_accuracy": 0.17424038499593736,
"num_tokens": 27298597.0,
"step": 15735
},
{
"entropy": 5.492482662200928,
"epoch": 1.224625559229722,
"grad_norm": 1.5546875,
"learning_rate": 0.00048532917139609334,
"loss": 5.2945,
"mean_token_accuracy": 0.17144012898206712,
"num_tokens": 27306763.0,
"step": 15740
},
{
"entropy": 5.4816591262817385,
"epoch": 1.2250145886014394,
"grad_norm": 1.3828125,
"learning_rate": 0.0004853193256604518,
"loss": 5.2789,
"mean_token_accuracy": 0.175824536383152,
"num_tokens": 27315782.0,
"step": 15745
},
{
"entropy": 5.597652959823608,
"epoch": 1.2254036179731569,
"grad_norm": 1.4375,
"learning_rate": 0.00048530947673354924,
"loss": 5.3469,
"mean_token_accuracy": 0.16758460476994513,
"num_tokens": 27324487.0,
"step": 15750
},
{
"entropy": 5.453849363327026,
"epoch": 1.2257926473448746,
"grad_norm": 1.40625,
"learning_rate": 0.0004852996246155351,
"loss": 5.2779,
"mean_token_accuracy": 0.1686175212264061,
"num_tokens": 27333099.0,
"step": 15755
},
{
"entropy": 5.445325469970703,
"epoch": 1.226181676716592,
"grad_norm": 1.609375,
"learning_rate": 0.00048528976930655896,
"loss": 5.2651,
"mean_token_accuracy": 0.17441341429948806,
"num_tokens": 27341697.0,
"step": 15760
},
{
"entropy": 5.486058330535888,
"epoch": 1.2265707060883098,
"grad_norm": 1.2890625,
"learning_rate": 0.00048527991080677015,
"loss": 5.2598,
"mean_token_accuracy": 0.17641414552927018,
"num_tokens": 27349811.0,
"step": 15765
},
{
"entropy": 5.465488004684448,
"epoch": 1.2269597354600272,
"grad_norm": 1.3828125,
"learning_rate": 0.00048527004911631843,
"loss": 5.2648,
"mean_token_accuracy": 0.17553373873233796,
"num_tokens": 27358257.0,
"step": 15770
},
{
"entropy": 5.477497148513794,
"epoch": 1.2273487648317447,
"grad_norm": 1.4765625,
"learning_rate": 0.0004852601842353534,
"loss": 5.224,
"mean_token_accuracy": 0.17824947237968444,
"num_tokens": 27366993.0,
"step": 15775
},
{
"entropy": 5.495562791824341,
"epoch": 1.2277377942034624,
"grad_norm": 1.3359375,
"learning_rate": 0.00048525031616402476,
"loss": 5.2871,
"mean_token_accuracy": 0.1762702763080597,
"num_tokens": 27375780.0,
"step": 15780
},
{
"entropy": 5.504449272155762,
"epoch": 1.2281268235751799,
"grad_norm": 1.34375,
"learning_rate": 0.00048524044490248227,
"loss": 5.3167,
"mean_token_accuracy": 0.1752270057797432,
"num_tokens": 27384641.0,
"step": 15785
},
{
"entropy": 5.5637085914611815,
"epoch": 1.2285158529468976,
"grad_norm": 1.3984375,
"learning_rate": 0.00048523057045087557,
"loss": 5.2776,
"mean_token_accuracy": 0.17950163930654525,
"num_tokens": 27392990.0,
"step": 15790
},
{
"entropy": 5.536189794540405,
"epoch": 1.228904882318615,
"grad_norm": 1.3671875,
"learning_rate": 0.00048522069280935466,
"loss": 5.433,
"mean_token_accuracy": 0.16787081062793732,
"num_tokens": 27401012.0,
"step": 15795
},
{
"entropy": 5.444540119171142,
"epoch": 1.2292939116903325,
"grad_norm": 1.3203125,
"learning_rate": 0.0004852108119780693,
"loss": 5.2453,
"mean_token_accuracy": 0.1739180013537407,
"num_tokens": 27409758.0,
"step": 15800
},
{
"entropy": 5.528168058395385,
"epoch": 1.2296829410620502,
"grad_norm": 1.296875,
"learning_rate": 0.0004852009279571694,
"loss": 5.2378,
"mean_token_accuracy": 0.18022283911705017,
"num_tokens": 27417592.0,
"step": 15805
},
{
"entropy": 5.439705562591553,
"epoch": 1.2300719704337677,
"grad_norm": 1.359375,
"learning_rate": 0.000485191040746805,
"loss": 5.2197,
"mean_token_accuracy": 0.17247380912303925,
"num_tokens": 27426822.0,
"step": 15810
},
{
"entropy": 5.40670108795166,
"epoch": 1.2304609998054854,
"grad_norm": 1.3125,
"learning_rate": 0.0004851811503471262,
"loss": 5.1903,
"mean_token_accuracy": 0.18721838295459747,
"num_tokens": 27435446.0,
"step": 15815
},
{
"entropy": 5.489194774627686,
"epoch": 1.2308500291772029,
"grad_norm": 1.484375,
"learning_rate": 0.00048517125675828294,
"loss": 5.2025,
"mean_token_accuracy": 0.17326698899269105,
"num_tokens": 27443156.0,
"step": 15820
},
{
"entropy": 5.523782348632812,
"epoch": 1.2312390585489204,
"grad_norm": 1.375,
"learning_rate": 0.00048516135998042536,
"loss": 5.322,
"mean_token_accuracy": 0.17499844804406167,
"num_tokens": 27451500.0,
"step": 15825
},
{
"entropy": 5.506570100784302,
"epoch": 1.231628087920638,
"grad_norm": 1.3984375,
"learning_rate": 0.0004851514600137037,
"loss": 5.3085,
"mean_token_accuracy": 0.18177199810743333,
"num_tokens": 27460237.0,
"step": 15830
},
{
"entropy": 5.516687488555908,
"epoch": 1.2320171172923555,
"grad_norm": 1.3359375,
"learning_rate": 0.00048514155685826807,
"loss": 5.2557,
"mean_token_accuracy": 0.1834619089961052,
"num_tokens": 27468434.0,
"step": 15835
},
{
"entropy": 5.557322978973389,
"epoch": 1.2324061466640732,
"grad_norm": 1.390625,
"learning_rate": 0.0004851316505142688,
"loss": 5.2884,
"mean_token_accuracy": 0.17500267326831817,
"num_tokens": 27477667.0,
"step": 15840
},
{
"entropy": 5.513675022125244,
"epoch": 1.2327951760357907,
"grad_norm": 1.6953125,
"learning_rate": 0.00048512174098185615,
"loss": 5.2379,
"mean_token_accuracy": 0.17005163431167603,
"num_tokens": 27486365.0,
"step": 15845
},
{
"entropy": 5.426891088485718,
"epoch": 1.2331842054075082,
"grad_norm": 1.3125,
"learning_rate": 0.00048511182826118055,
"loss": 5.2135,
"mean_token_accuracy": 0.18548982441425324,
"num_tokens": 27495310.0,
"step": 15850
},
{
"entropy": 5.417548084259034,
"epoch": 1.2335732347792259,
"grad_norm": 1.421875,
"learning_rate": 0.00048510191235239246,
"loss": 5.1822,
"mean_token_accuracy": 0.18007411658763886,
"num_tokens": 27504175.0,
"step": 15855
},
{
"entropy": 5.56289849281311,
"epoch": 1.2339622641509433,
"grad_norm": 1.4375,
"learning_rate": 0.00048509199325564217,
"loss": 5.2461,
"mean_token_accuracy": 0.17590783834457396,
"num_tokens": 27512042.0,
"step": 15860
},
{
"entropy": 5.524714612960816,
"epoch": 1.234351293522661,
"grad_norm": 1.328125,
"learning_rate": 0.0004850820709710803,
"loss": 5.329,
"mean_token_accuracy": 0.1797504872083664,
"num_tokens": 27520721.0,
"step": 15865
},
{
"entropy": 5.378135919570923,
"epoch": 1.2347403228943785,
"grad_norm": 1.46875,
"learning_rate": 0.0004850721454988574,
"loss": 5.2042,
"mean_token_accuracy": 0.1747194856405258,
"num_tokens": 27529431.0,
"step": 15870
},
{
"entropy": 5.396539497375488,
"epoch": 1.235129352266096,
"grad_norm": 1.3359375,
"learning_rate": 0.00048506221683912405,
"loss": 5.1649,
"mean_token_accuracy": 0.19042879194021226,
"num_tokens": 27537380.0,
"step": 15875
},
{
"entropy": 5.443312740325927,
"epoch": 1.2355183816378137,
"grad_norm": 1.1796875,
"learning_rate": 0.0004850522849920309,
"loss": 5.1782,
"mean_token_accuracy": 0.17227473706007004,
"num_tokens": 27547487.0,
"step": 15880
},
{
"entropy": 5.5449117660522464,
"epoch": 1.2359074110095312,
"grad_norm": 1.328125,
"learning_rate": 0.00048504234995772863,
"loss": 5.2643,
"mean_token_accuracy": 0.18243306875228882,
"num_tokens": 27556813.0,
"step": 15885
},
{
"entropy": 5.530151224136352,
"epoch": 1.2362964403812489,
"grad_norm": 1.265625,
"learning_rate": 0.0004850324117363681,
"loss": 5.366,
"mean_token_accuracy": 0.1678698778152466,
"num_tokens": 27566602.0,
"step": 15890
},
{
"entropy": 5.487677049636841,
"epoch": 1.2366854697529663,
"grad_norm": 1.875,
"learning_rate": 0.00048502247032809997,
"loss": 5.2815,
"mean_token_accuracy": 0.17698195576667786,
"num_tokens": 27574577.0,
"step": 15895
},
{
"entropy": 5.613036203384399,
"epoch": 1.237074499124684,
"grad_norm": 1.390625,
"learning_rate": 0.0004850125257330751,
"loss": 5.4438,
"mean_token_accuracy": 0.16410594135522844,
"num_tokens": 27582702.0,
"step": 15900
},
{
"entropy": 5.467191982269287,
"epoch": 1.2374635284964015,
"grad_norm": 1.71875,
"learning_rate": 0.00048500257795144446,
"loss": 5.3154,
"mean_token_accuracy": 0.17378822714090347,
"num_tokens": 27591457.0,
"step": 15905
},
{
"entropy": 5.496062231063843,
"epoch": 1.237852557868119,
"grad_norm": 1.5546875,
"learning_rate": 0.000484992626983359,
"loss": 5.1868,
"mean_token_accuracy": 0.1804353564977646,
"num_tokens": 27600643.0,
"step": 15910
},
{
"entropy": 5.460226964950562,
"epoch": 1.2382415872398367,
"grad_norm": 1.40625,
"learning_rate": 0.0004849826728289696,
"loss": 5.1772,
"mean_token_accuracy": 0.1787505030632019,
"num_tokens": 27608438.0,
"step": 15915
},
{
"entropy": 5.437861633300781,
"epoch": 1.2386306166115542,
"grad_norm": 1.3984375,
"learning_rate": 0.00048497271548842737,
"loss": 5.2969,
"mean_token_accuracy": 0.17473477274179458,
"num_tokens": 27617149.0,
"step": 15920
},
{
"entropy": 5.376610946655274,
"epoch": 1.2390196459832716,
"grad_norm": 1.3359375,
"learning_rate": 0.0004849627549618834,
"loss": 5.213,
"mean_token_accuracy": 0.18426057696342468,
"num_tokens": 27625188.0,
"step": 15925
},
{
"entropy": 5.452475929260254,
"epoch": 1.2394086753549893,
"grad_norm": 1.328125,
"learning_rate": 0.00048495279124948886,
"loss": 5.3005,
"mean_token_accuracy": 0.17987428456544877,
"num_tokens": 27633865.0,
"step": 15930
},
{
"entropy": 5.50133376121521,
"epoch": 1.2397977047267068,
"grad_norm": 1.53125,
"learning_rate": 0.0004849428243513948,
"loss": 5.2654,
"mean_token_accuracy": 0.1721073016524315,
"num_tokens": 27642528.0,
"step": 15935
},
{
"entropy": 5.530778455734253,
"epoch": 1.2401867340984245,
"grad_norm": 1.421875,
"learning_rate": 0.00048493285426775255,
"loss": 5.362,
"mean_token_accuracy": 0.16647080183029175,
"num_tokens": 27651291.0,
"step": 15940
},
{
"entropy": 5.595407962799072,
"epoch": 1.240575763470142,
"grad_norm": 1.40625,
"learning_rate": 0.0004849228809987135,
"loss": 5.3696,
"mean_token_accuracy": 0.1729394167661667,
"num_tokens": 27660725.0,
"step": 15945
},
{
"entropy": 5.534488391876221,
"epoch": 1.2409647928418597,
"grad_norm": 1.453125,
"learning_rate": 0.0004849129045444288,
"loss": 5.1946,
"mean_token_accuracy": 0.17993429005146028,
"num_tokens": 27669282.0,
"step": 15950
},
{
"entropy": 5.414973640441895,
"epoch": 1.2413538222135772,
"grad_norm": 1.3671875,
"learning_rate": 0.0004849029249050498,
"loss": 5.1986,
"mean_token_accuracy": 0.1776224911212921,
"num_tokens": 27677987.0,
"step": 15955
},
{
"entropy": 5.366016817092896,
"epoch": 1.2417428515852946,
"grad_norm": 1.4921875,
"learning_rate": 0.00048489294208072805,
"loss": 5.1789,
"mean_token_accuracy": 0.1801241770386696,
"num_tokens": 27686409.0,
"step": 15960
},
{
"entropy": 5.443279027938843,
"epoch": 1.2421318809570123,
"grad_norm": 1.4296875,
"learning_rate": 0.00048488295607161495,
"loss": 5.2179,
"mean_token_accuracy": 0.1784661203622818,
"num_tokens": 27695485.0,
"step": 15965
},
{
"entropy": 5.397273969650269,
"epoch": 1.2425209103287298,
"grad_norm": 1.3671875,
"learning_rate": 0.0004848729668778621,
"loss": 5.1015,
"mean_token_accuracy": 0.189507357776165,
"num_tokens": 27703962.0,
"step": 15970
},
{
"entropy": 5.458210372924805,
"epoch": 1.2429099397004473,
"grad_norm": 1.515625,
"learning_rate": 0.0004848629744996211,
"loss": 5.2527,
"mean_token_accuracy": 0.1757992535829544,
"num_tokens": 27713632.0,
"step": 15975
},
{
"entropy": 5.470901775360107,
"epoch": 1.243298969072165,
"grad_norm": 1.453125,
"learning_rate": 0.0004848529789370434,
"loss": 5.291,
"mean_token_accuracy": 0.17782314270734786,
"num_tokens": 27722890.0,
"step": 15980
},
{
"entropy": 5.491668605804444,
"epoch": 1.2436879984438824,
"grad_norm": 1.484375,
"learning_rate": 0.0004848429801902808,
"loss": 5.2186,
"mean_token_accuracy": 0.18407932817935943,
"num_tokens": 27731325.0,
"step": 15985
},
{
"entropy": 5.486194705963134,
"epoch": 1.2440770278156001,
"grad_norm": 1.4296875,
"learning_rate": 0.00048483297825948485,
"loss": 5.3156,
"mean_token_accuracy": 0.1758503422141075,
"num_tokens": 27739600.0,
"step": 15990
},
{
"entropy": 5.543510961532593,
"epoch": 1.2444660571873176,
"grad_norm": 1.359375,
"learning_rate": 0.00048482297314480756,
"loss": 5.3006,
"mean_token_accuracy": 0.17465368360280992,
"num_tokens": 27747860.0,
"step": 15995
},
{
"entropy": 5.472729444503784,
"epoch": 1.2448550865590353,
"grad_norm": 1.4609375,
"learning_rate": 0.0004848129648464006,
"loss": 5.215,
"mean_token_accuracy": 0.17891848534345628,
"num_tokens": 27757141.0,
"step": 16000
},
{
"entropy": 5.5583357334136965,
"epoch": 1.2452441159307528,
"grad_norm": 1.375,
"learning_rate": 0.0004848029533644159,
"loss": 5.3673,
"mean_token_accuracy": 0.1748943418264389,
"num_tokens": 27766832.0,
"step": 16005
},
{
"entropy": 5.498703193664551,
"epoch": 1.2456331453024703,
"grad_norm": 1.3203125,
"learning_rate": 0.0004847929386990052,
"loss": 5.2558,
"mean_token_accuracy": 0.17267411798238755,
"num_tokens": 27775487.0,
"step": 16010
},
{
"entropy": 5.47706241607666,
"epoch": 1.246022174674188,
"grad_norm": 1.3828125,
"learning_rate": 0.00048478292085032065,
"loss": 5.216,
"mean_token_accuracy": 0.17603672295808792,
"num_tokens": 27783601.0,
"step": 16015
},
{
"entropy": 5.512782859802246,
"epoch": 1.2464112040459054,
"grad_norm": 1.484375,
"learning_rate": 0.0004847728998185142,
"loss": 5.3106,
"mean_token_accuracy": 0.17121509462594986,
"num_tokens": 27792931.0,
"step": 16020
},
{
"entropy": 5.550661039352417,
"epoch": 1.246800233417623,
"grad_norm": 1.53125,
"learning_rate": 0.00048476287560373786,
"loss": 5.2667,
"mean_token_accuracy": 0.1779284343123436,
"num_tokens": 27801388.0,
"step": 16025
},
{
"entropy": 5.504043531417847,
"epoch": 1.2471892627893406,
"grad_norm": 1.4375,
"learning_rate": 0.00048475284820614375,
"loss": 5.2115,
"mean_token_accuracy": 0.17613635063171387,
"num_tokens": 27810047.0,
"step": 16030
},
{
"entropy": 5.4678081512451175,
"epoch": 1.247578292161058,
"grad_norm": 1.453125,
"learning_rate": 0.00048474281762588407,
"loss": 5.242,
"mean_token_accuracy": 0.17732588797807694,
"num_tokens": 27818800.0,
"step": 16035
},
{
"entropy": 5.455697250366211,
"epoch": 1.2479673215327758,
"grad_norm": 1.296875,
"learning_rate": 0.0004847327838631109,
"loss": 5.2117,
"mean_token_accuracy": 0.174435555934906,
"num_tokens": 27827623.0,
"step": 16040
},
{
"entropy": 5.443018198013306,
"epoch": 1.2483563509044933,
"grad_norm": 1.296875,
"learning_rate": 0.0004847227469179766,
"loss": 5.1686,
"mean_token_accuracy": 0.18914233893156052,
"num_tokens": 27836491.0,
"step": 16045
},
{
"entropy": 5.479505634307861,
"epoch": 1.248745380276211,
"grad_norm": 1.4453125,
"learning_rate": 0.0004847127067906334,
"loss": 5.2416,
"mean_token_accuracy": 0.18159117102622985,
"num_tokens": 27845563.0,
"step": 16050
},
{
"entropy": 5.450436687469482,
"epoch": 1.2491344096479284,
"grad_norm": 1.3984375,
"learning_rate": 0.00048470266348123365,
"loss": 5.1873,
"mean_token_accuracy": 0.17724606096744538,
"num_tokens": 27854263.0,
"step": 16055
},
{
"entropy": 5.496408081054687,
"epoch": 1.249523439019646,
"grad_norm": 1.25,
"learning_rate": 0.0004846926169899298,
"loss": 5.2376,
"mean_token_accuracy": 0.17651015073060988,
"num_tokens": 27862868.0,
"step": 16060
},
{
"entropy": 5.539421033859253,
"epoch": 1.2499124683913636,
"grad_norm": 1.3125,
"learning_rate": 0.00048468256731687426,
"loss": 5.3467,
"mean_token_accuracy": 0.17136863619089127,
"num_tokens": 27872053.0,
"step": 16065
},
{
"entropy": 5.432773733139038,
"epoch": 1.250301497763081,
"grad_norm": 1.9921875,
"learning_rate": 0.0004846725144622194,
"loss": 5.1444,
"mean_token_accuracy": 0.1862142100930214,
"num_tokens": 27880953.0,
"step": 16070
},
{
"entropy": 5.479116058349609,
"epoch": 1.2506905271347986,
"grad_norm": 1.390625,
"learning_rate": 0.000484662458426118,
"loss": 5.246,
"mean_token_accuracy": 0.17731681019067763,
"num_tokens": 27890102.0,
"step": 16075
},
{
"entropy": 5.5705382347106935,
"epoch": 1.2510795565065163,
"grad_norm": 1.4296875,
"learning_rate": 0.00048465239920872247,
"loss": 5.3323,
"mean_token_accuracy": 0.1745040386915207,
"num_tokens": 27899305.0,
"step": 16080
},
{
"entropy": 5.541355133056641,
"epoch": 1.2514685858782337,
"grad_norm": 1.4921875,
"learning_rate": 0.00048464233681018545,
"loss": 5.2602,
"mean_token_accuracy": 0.17806057780981063,
"num_tokens": 27907476.0,
"step": 16085
},
{
"entropy": 5.514520311355591,
"epoch": 1.2518576152499514,
"grad_norm": 1.296875,
"learning_rate": 0.0004846322712306596,
"loss": 5.3317,
"mean_token_accuracy": 0.1794234037399292,
"num_tokens": 27915353.0,
"step": 16090
},
{
"entropy": 5.4693365573883055,
"epoch": 1.252246644621669,
"grad_norm": 1.3828125,
"learning_rate": 0.00048462220247029783,
"loss": 5.2471,
"mean_token_accuracy": 0.17789728194475174,
"num_tokens": 27923980.0,
"step": 16095
},
{
"entropy": 5.483224391937256,
"epoch": 1.2526356739933866,
"grad_norm": 1.484375,
"learning_rate": 0.00048461213052925265,
"loss": 5.336,
"mean_token_accuracy": 0.17547824680805207,
"num_tokens": 27932760.0,
"step": 16100
},
{
"entropy": 5.456972265243531,
"epoch": 1.253024703365104,
"grad_norm": 1.4140625,
"learning_rate": 0.0004846020554076771,
"loss": 5.2057,
"mean_token_accuracy": 0.17643631547689437,
"num_tokens": 27941328.0,
"step": 16105
},
{
"entropy": 5.568940877914429,
"epoch": 1.2534137327368216,
"grad_norm": 1.9375,
"learning_rate": 0.0004845919771057239,
"loss": 5.3852,
"mean_token_accuracy": 0.17011766284704208,
"num_tokens": 27949597.0,
"step": 16110
},
{
"entropy": 5.58374056816101,
"epoch": 1.2538027621085392,
"grad_norm": 1.234375,
"learning_rate": 0.0004845818956235462,
"loss": 5.2651,
"mean_token_accuracy": 0.17929119020700454,
"num_tokens": 27958798.0,
"step": 16115
},
{
"entropy": 5.536112880706787,
"epoch": 1.2541917914802567,
"grad_norm": 1.4453125,
"learning_rate": 0.00048457181096129664,
"loss": 5.2257,
"mean_token_accuracy": 0.17642829567193985,
"num_tokens": 27967582.0,
"step": 16120
},
{
"entropy": 5.475820922851563,
"epoch": 1.2545808208519742,
"grad_norm": 1.71875,
"learning_rate": 0.0004845617231191285,
"loss": 5.1887,
"mean_token_accuracy": 0.17645180225372314,
"num_tokens": 27975959.0,
"step": 16125
},
{
"entropy": 5.461424064636231,
"epoch": 1.254969850223692,
"grad_norm": 1.4296875,
"learning_rate": 0.0004845516320971948,
"loss": 5.2058,
"mean_token_accuracy": 0.18109354823827745,
"num_tokens": 27983980.0,
"step": 16130
},
{
"entropy": 5.459164190292358,
"epoch": 1.2553588795954094,
"grad_norm": 1.4296875,
"learning_rate": 0.0004845415378956486,
"loss": 5.1188,
"mean_token_accuracy": 0.17931146323680877,
"num_tokens": 27992563.0,
"step": 16135
},
{
"entropy": 5.451525497436523,
"epoch": 1.255747908967127,
"grad_norm": 1.2890625,
"learning_rate": 0.000484531440514643,
"loss": 5.1188,
"mean_token_accuracy": 0.1892002835869789,
"num_tokens": 28001457.0,
"step": 16140
},
{
"entropy": 5.51419620513916,
"epoch": 1.2561369383388445,
"grad_norm": 1.3515625,
"learning_rate": 0.00048452133995433136,
"loss": 5.2929,
"mean_token_accuracy": 0.17462045103311538,
"num_tokens": 28009507.0,
"step": 16145
},
{
"entropy": 5.399370384216309,
"epoch": 1.2565259677105622,
"grad_norm": 1.3046875,
"learning_rate": 0.0004845112362148668,
"loss": 5.2315,
"mean_token_accuracy": 0.16929426789283752,
"num_tokens": 28017858.0,
"step": 16150
},
{
"entropy": 5.509197854995728,
"epoch": 1.2569149970822797,
"grad_norm": 1.3125,
"learning_rate": 0.0004845011292964028,
"loss": 5.3089,
"mean_token_accuracy": 0.1709074407815933,
"num_tokens": 28026832.0,
"step": 16155
},
{
"entropy": 5.545967435836792,
"epoch": 1.2573040264539972,
"grad_norm": 1.375,
"learning_rate": 0.00048449101919909265,
"loss": 5.1987,
"mean_token_accuracy": 0.1815027803182602,
"num_tokens": 28034546.0,
"step": 16160
},
{
"entropy": 5.4364176273345945,
"epoch": 1.257693055825715,
"grad_norm": 1.265625,
"learning_rate": 0.00048448090592308955,
"loss": 5.2566,
"mean_token_accuracy": 0.1737620487809181,
"num_tokens": 28043400.0,
"step": 16165
},
{
"entropy": 5.4688023090362545,
"epoch": 1.2580820851974324,
"grad_norm": 1.8203125,
"learning_rate": 0.0004844707894685473,
"loss": 5.2252,
"mean_token_accuracy": 0.18468010574579238,
"num_tokens": 28052764.0,
"step": 16170
},
{
"entropy": 5.533858442306519,
"epoch": 1.2584711145691498,
"grad_norm": 1.2109375,
"learning_rate": 0.0004844606698356192,
"loss": 5.2908,
"mean_token_accuracy": 0.1714635819196701,
"num_tokens": 28061859.0,
"step": 16175
},
{
"entropy": 5.494021701812744,
"epoch": 1.2588601439408675,
"grad_norm": 1.21875,
"learning_rate": 0.0004844505470244588,
"loss": 5.1752,
"mean_token_accuracy": 0.1828700065612793,
"num_tokens": 28070935.0,
"step": 16180
},
{
"entropy": 5.480620193481445,
"epoch": 1.2592491733125852,
"grad_norm": 1.421875,
"learning_rate": 0.0004844404210352197,
"loss": 5.2474,
"mean_token_accuracy": 0.17727855145931243,
"num_tokens": 28079864.0,
"step": 16185
},
{
"entropy": 5.417865514755249,
"epoch": 1.2596382026843027,
"grad_norm": 1.515625,
"learning_rate": 0.00048443029186805554,
"loss": 5.1225,
"mean_token_accuracy": 0.1779842495918274,
"num_tokens": 28088938.0,
"step": 16190
},
{
"entropy": 5.476406621932983,
"epoch": 1.2600272320560202,
"grad_norm": 1.40625,
"learning_rate": 0.0004844201595231201,
"loss": 5.2406,
"mean_token_accuracy": 0.17104055732488632,
"num_tokens": 28097213.0,
"step": 16195
},
{
"entropy": 5.4360919952392575,
"epoch": 1.2604162614277379,
"grad_norm": 1.5078125,
"learning_rate": 0.00048441002400056706,
"loss": 5.2689,
"mean_token_accuracy": 0.17366572469472885,
"num_tokens": 28105187.0,
"step": 16200
},
{
"entropy": 5.469094181060791,
"epoch": 1.2608052907994554,
"grad_norm": 1.4296875,
"learning_rate": 0.0004843998853005502,
"loss": 5.1973,
"mean_token_accuracy": 0.18125773668289186,
"num_tokens": 28113238.0,
"step": 16205
},
{
"entropy": 5.386022520065308,
"epoch": 1.2611943201711728,
"grad_norm": 1.515625,
"learning_rate": 0.0004843897434232233,
"loss": 5.1373,
"mean_token_accuracy": 0.1829356163740158,
"num_tokens": 28121502.0,
"step": 16210
},
{
"entropy": 5.439625406265259,
"epoch": 1.2615833495428905,
"grad_norm": 1.390625,
"learning_rate": 0.00048437959836874047,
"loss": 5.2427,
"mean_token_accuracy": 0.1784916937351227,
"num_tokens": 28130269.0,
"step": 16215
},
{
"entropy": 5.524720764160156,
"epoch": 1.261972378914608,
"grad_norm": 1.40625,
"learning_rate": 0.00048436945013725544,
"loss": 5.3939,
"mean_token_accuracy": 0.16763487607240676,
"num_tokens": 28139482.0,
"step": 16220
},
{
"entropy": 5.530150318145752,
"epoch": 1.2623614082863255,
"grad_norm": 1.3203125,
"learning_rate": 0.00048435929872892226,
"loss": 5.3322,
"mean_token_accuracy": 0.17418678253889083,
"num_tokens": 28148443.0,
"step": 16225
},
{
"entropy": 5.543543720245362,
"epoch": 1.2627504376580432,
"grad_norm": 1.4765625,
"learning_rate": 0.0004843491441438949,
"loss": 5.1813,
"mean_token_accuracy": 0.18123750388622284,
"num_tokens": 28156807.0,
"step": 16230
},
{
"entropy": 5.463288831710815,
"epoch": 1.2631394670297609,
"grad_norm": 1.34375,
"learning_rate": 0.00048433898638232755,
"loss": 5.2496,
"mean_token_accuracy": 0.17886511236429214,
"num_tokens": 28165019.0,
"step": 16235
},
{
"entropy": 5.46819167137146,
"epoch": 1.2635284964014784,
"grad_norm": 1.5234375,
"learning_rate": 0.0004843288254443742,
"loss": 5.2569,
"mean_token_accuracy": 0.17380767017602922,
"num_tokens": 28173505.0,
"step": 16240
},
{
"entropy": 5.594399309158325,
"epoch": 1.2639175257731958,
"grad_norm": 1.5390625,
"learning_rate": 0.0004843186613301892,
"loss": 5.3221,
"mean_token_accuracy": 0.17378030866384506,
"num_tokens": 28182524.0,
"step": 16245
},
{
"entropy": 5.563673639297486,
"epoch": 1.2643065551449135,
"grad_norm": 1.4609375,
"learning_rate": 0.0004843084940399266,
"loss": 5.3627,
"mean_token_accuracy": 0.17066486552357674,
"num_tokens": 28191093.0,
"step": 16250
},
{
"entropy": 5.476001596450805,
"epoch": 1.264695584516631,
"grad_norm": 1.4140625,
"learning_rate": 0.0004842983235737408,
"loss": 5.2351,
"mean_token_accuracy": 0.17515968084335326,
"num_tokens": 28199092.0,
"step": 16255
},
{
"entropy": 5.547818279266357,
"epoch": 1.2650846138883485,
"grad_norm": 1.484375,
"learning_rate": 0.0004842881499317861,
"loss": 5.3329,
"mean_token_accuracy": 0.17457364350557328,
"num_tokens": 28207341.0,
"step": 16260
},
{
"entropy": 5.537169313430786,
"epoch": 1.2654736432600662,
"grad_norm": 1.3828125,
"learning_rate": 0.0004842779731142168,
"loss": 5.2511,
"mean_token_accuracy": 0.17711718380451202,
"num_tokens": 28216370.0,
"step": 16265
},
{
"entropy": 5.51004958152771,
"epoch": 1.2658626726317836,
"grad_norm": 1.3828125,
"learning_rate": 0.00048426779312118735,
"loss": 5.2883,
"mean_token_accuracy": 0.176120425760746,
"num_tokens": 28224554.0,
"step": 16270
},
{
"entropy": 5.521767330169678,
"epoch": 1.2662517020035013,
"grad_norm": 1.375,
"learning_rate": 0.0004842576099528522,
"loss": 5.2889,
"mean_token_accuracy": 0.17439346462488176,
"num_tokens": 28232672.0,
"step": 16275
},
{
"entropy": 5.401370573043823,
"epoch": 1.2666407313752188,
"grad_norm": 1.4296875,
"learning_rate": 0.0004842474236093659,
"loss": 5.1243,
"mean_token_accuracy": 0.18079132437705994,
"num_tokens": 28240730.0,
"step": 16280
},
{
"entropy": 5.442571115493775,
"epoch": 1.2670297607469365,
"grad_norm": 1.53125,
"learning_rate": 0.00048423723409088306,
"loss": 5.2461,
"mean_token_accuracy": 0.175859697163105,
"num_tokens": 28248989.0,
"step": 16285
},
{
"entropy": 5.5483057498931885,
"epoch": 1.267418790118654,
"grad_norm": 1.53125,
"learning_rate": 0.0004842270413975582,
"loss": 5.3286,
"mean_token_accuracy": 0.1679416909813881,
"num_tokens": 28256900.0,
"step": 16290
},
{
"entropy": 5.53696608543396,
"epoch": 1.2678078194903715,
"grad_norm": 1.3828125,
"learning_rate": 0.000484216845529546,
"loss": 5.2735,
"mean_token_accuracy": 0.17081423550844194,
"num_tokens": 28265832.0,
"step": 16295
},
{
"entropy": 5.432358837127685,
"epoch": 1.2681968488620892,
"grad_norm": 1.4375,
"learning_rate": 0.00048420664648700113,
"loss": 5.1558,
"mean_token_accuracy": 0.1770220011472702,
"num_tokens": 28274661.0,
"step": 16300
},
{
"entropy": 5.530181789398194,
"epoch": 1.2685858782338066,
"grad_norm": 1.5234375,
"learning_rate": 0.0004841964442700784,
"loss": 5.2334,
"mean_token_accuracy": 0.17457151561975479,
"num_tokens": 28283303.0,
"step": 16305
},
{
"entropy": 5.454696369171143,
"epoch": 1.2689749076055241,
"grad_norm": 1.453125,
"learning_rate": 0.00048418623887893264,
"loss": 5.1119,
"mean_token_accuracy": 0.17928371727466583,
"num_tokens": 28291660.0,
"step": 16310
},
{
"entropy": 5.490466165542602,
"epoch": 1.2693639369772418,
"grad_norm": 1.5546875,
"learning_rate": 0.00048417603031371867,
"loss": 5.2951,
"mean_token_accuracy": 0.17176648527383803,
"num_tokens": 28301314.0,
"step": 16315
},
{
"entropy": 5.522611045837403,
"epoch": 1.2697529663489593,
"grad_norm": 1.3203125,
"learning_rate": 0.0004841658185745913,
"loss": 5.2304,
"mean_token_accuracy": 0.16735271215438843,
"num_tokens": 28310044.0,
"step": 16320
},
{
"entropy": 5.634258031845093,
"epoch": 1.270141995720677,
"grad_norm": 1.4375,
"learning_rate": 0.00048415560366170564,
"loss": 5.349,
"mean_token_accuracy": 0.180294768512249,
"num_tokens": 28319773.0,
"step": 16325
},
{
"entropy": 5.469909286499023,
"epoch": 1.2705310250923945,
"grad_norm": 1.2890625,
"learning_rate": 0.0004841453855752165,
"loss": 5.1167,
"mean_token_accuracy": 0.18387712985277177,
"num_tokens": 28328070.0,
"step": 16330
},
{
"entropy": 5.459448146820068,
"epoch": 1.2709200544641122,
"grad_norm": 1.328125,
"learning_rate": 0.0004841351643152791,
"loss": 5.2382,
"mean_token_accuracy": 0.17865411639213563,
"num_tokens": 28337636.0,
"step": 16335
},
{
"entropy": 5.373522758483887,
"epoch": 1.2713090838358296,
"grad_norm": 1.2421875,
"learning_rate": 0.0004841249398820485,
"loss": 5.2326,
"mean_token_accuracy": 0.17584374099969863,
"num_tokens": 28346609.0,
"step": 16340
},
{
"entropy": 5.447516870498657,
"epoch": 1.271698113207547,
"grad_norm": 1.296875,
"learning_rate": 0.0004841147122756797,
"loss": 5.2479,
"mean_token_accuracy": 0.17630080431699752,
"num_tokens": 28355395.0,
"step": 16345
},
{
"entropy": 5.423162746429443,
"epoch": 1.2720871425792648,
"grad_norm": 1.3125,
"learning_rate": 0.000484104481496328,
"loss": 5.353,
"mean_token_accuracy": 0.17391128093004227,
"num_tokens": 28364447.0,
"step": 16350
},
{
"entropy": 5.510781574249267,
"epoch": 1.2724761719509823,
"grad_norm": 1.25,
"learning_rate": 0.0004840942475441486,
"loss": 5.2639,
"mean_token_accuracy": 0.17910945415496826,
"num_tokens": 28372872.0,
"step": 16355
},
{
"entropy": 5.5165708541870115,
"epoch": 1.2728652013226998,
"grad_norm": 1.3671875,
"learning_rate": 0.0004840840104192969,
"loss": 5.1576,
"mean_token_accuracy": 0.1780828982591629,
"num_tokens": 28380840.0,
"step": 16360
},
{
"entropy": 5.421405029296875,
"epoch": 1.2732542306944175,
"grad_norm": 1.2890625,
"learning_rate": 0.000484073770121928,
"loss": 5.1797,
"mean_token_accuracy": 0.1737140029668808,
"num_tokens": 28390417.0,
"step": 16365
},
{
"entropy": 5.501765775680542,
"epoch": 1.273643260066135,
"grad_norm": 1.453125,
"learning_rate": 0.0004840635266521975,
"loss": 5.2436,
"mean_token_accuracy": 0.1747473046183586,
"num_tokens": 28400101.0,
"step": 16370
},
{
"entropy": 5.40831413269043,
"epoch": 1.2740322894378526,
"grad_norm": 1.4375,
"learning_rate": 0.0004840532800102607,
"loss": 5.1624,
"mean_token_accuracy": 0.1840745121240616,
"num_tokens": 28408336.0,
"step": 16375
},
{
"entropy": 5.374412250518799,
"epoch": 1.27442131880957,
"grad_norm": 1.3515625,
"learning_rate": 0.00048404303019627314,
"loss": 5.19,
"mean_token_accuracy": 0.17816560119390487,
"num_tokens": 28416985.0,
"step": 16380
},
{
"entropy": 5.473758220672607,
"epoch": 1.2748103481812878,
"grad_norm": 1.3828125,
"learning_rate": 0.00048403277721039036,
"loss": 5.34,
"mean_token_accuracy": 0.16575801372528076,
"num_tokens": 28425543.0,
"step": 16385
},
{
"entropy": 5.551471281051636,
"epoch": 1.2751993775530053,
"grad_norm": 1.4453125,
"learning_rate": 0.0004840225210527679,
"loss": 5.2784,
"mean_token_accuracy": 0.172513510286808,
"num_tokens": 28435151.0,
"step": 16390
},
{
"entropy": 5.513803625106812,
"epoch": 1.2755884069247228,
"grad_norm": 1.3203125,
"learning_rate": 0.0004840122617235613,
"loss": 5.2922,
"mean_token_accuracy": 0.17031923681497574,
"num_tokens": 28444535.0,
"step": 16395
},
{
"entropy": 5.5126196384429935,
"epoch": 1.2759774362964404,
"grad_norm": 1.390625,
"learning_rate": 0.0004840019992229263,
"loss": 5.2123,
"mean_token_accuracy": 0.1758396416902542,
"num_tokens": 28452852.0,
"step": 16400
},
{
"entropy": 5.4684813022613525,
"epoch": 1.276366465668158,
"grad_norm": 1.3515625,
"learning_rate": 0.00048399173355101867,
"loss": 5.2593,
"mean_token_accuracy": 0.1736247271299362,
"num_tokens": 28462573.0,
"step": 16405
},
{
"entropy": 5.546539735794068,
"epoch": 1.2767554950398754,
"grad_norm": 1.40625,
"learning_rate": 0.00048398146470799417,
"loss": 5.3175,
"mean_token_accuracy": 0.16955233961343766,
"num_tokens": 28471714.0,
"step": 16410
},
{
"entropy": 5.455294179916382,
"epoch": 1.277144524411593,
"grad_norm": 1.3203125,
"learning_rate": 0.00048397119269400846,
"loss": 5.2054,
"mean_token_accuracy": 0.1762496441602707,
"num_tokens": 28479989.0,
"step": 16415
},
{
"entropy": 5.430337858200073,
"epoch": 1.2775335537833106,
"grad_norm": 1.4296875,
"learning_rate": 0.00048396091750921766,
"loss": 5.2493,
"mean_token_accuracy": 0.17211588770151137,
"num_tokens": 28488707.0,
"step": 16420
},
{
"entropy": 5.539992427825927,
"epoch": 1.2779225831550283,
"grad_norm": 1.3125,
"learning_rate": 0.0004839506391537774,
"loss": 5.3893,
"mean_token_accuracy": 0.17205370962619781,
"num_tokens": 28497228.0,
"step": 16425
},
{
"entropy": 5.550241136550904,
"epoch": 1.2783116125267457,
"grad_norm": 1.3359375,
"learning_rate": 0.0004839403576278438,
"loss": 5.2401,
"mean_token_accuracy": 0.1817205771803856,
"num_tokens": 28505604.0,
"step": 16430
},
{
"entropy": 5.4601161003112795,
"epoch": 1.2787006418984634,
"grad_norm": 1.453125,
"learning_rate": 0.0004839300729315729,
"loss": 5.3057,
"mean_token_accuracy": 0.17057207077741623,
"num_tokens": 28514798.0,
"step": 16435
},
{
"entropy": 5.556891345977784,
"epoch": 1.279089671270181,
"grad_norm": 1.4921875,
"learning_rate": 0.0004839197850651206,
"loss": 5.2997,
"mean_token_accuracy": 0.1786057710647583,
"num_tokens": 28523883.0,
"step": 16440
},
{
"entropy": 5.510235738754273,
"epoch": 1.2794787006418984,
"grad_norm": 1.3046875,
"learning_rate": 0.00048390949402864317,
"loss": 5.2861,
"mean_token_accuracy": 0.17379218637943267,
"num_tokens": 28532290.0,
"step": 16445
},
{
"entropy": 5.419999074935913,
"epoch": 1.279867730013616,
"grad_norm": 1.5546875,
"learning_rate": 0.00048389919982229666,
"loss": 5.1932,
"mean_token_accuracy": 0.17638996988534927,
"num_tokens": 28540775.0,
"step": 16450
},
{
"entropy": 5.5101734638214115,
"epoch": 1.2802567593853336,
"grad_norm": 1.4140625,
"learning_rate": 0.00048388890244623723,
"loss": 5.2856,
"mean_token_accuracy": 0.17323748171329498,
"num_tokens": 28549517.0,
"step": 16455
},
{
"entropy": 5.475038480758667,
"epoch": 1.280645788757051,
"grad_norm": 1.2734375,
"learning_rate": 0.0004838786019006213,
"loss": 5.2549,
"mean_token_accuracy": 0.18170392215251924,
"num_tokens": 28557708.0,
"step": 16460
},
{
"entropy": 5.5590160369873045,
"epoch": 1.2810348181287687,
"grad_norm": 1.265625,
"learning_rate": 0.00048386829818560493,
"loss": 5.2787,
"mean_token_accuracy": 0.17825947999954223,
"num_tokens": 28566912.0,
"step": 16465
},
{
"entropy": 5.468572187423706,
"epoch": 1.2814238475004862,
"grad_norm": 1.2421875,
"learning_rate": 0.00048385799130134464,
"loss": 5.2977,
"mean_token_accuracy": 0.17290488481521607,
"num_tokens": 28577104.0,
"step": 16470
},
{
"entropy": 5.4020110130310055,
"epoch": 1.281812876872204,
"grad_norm": 1.359375,
"learning_rate": 0.0004838476812479968,
"loss": 5.2712,
"mean_token_accuracy": 0.1771841451525688,
"num_tokens": 28585984.0,
"step": 16475
},
{
"entropy": 5.542328596115112,
"epoch": 1.2822019062439214,
"grad_norm": 1.5625,
"learning_rate": 0.00048383736802571774,
"loss": 5.2853,
"mean_token_accuracy": 0.17197678834199906,
"num_tokens": 28594945.0,
"step": 16480
},
{
"entropy": 5.637636327743531,
"epoch": 1.282590935615639,
"grad_norm": 1.46875,
"learning_rate": 0.000483827051634664,
"loss": 5.3305,
"mean_token_accuracy": 0.1713242083787918,
"num_tokens": 28603546.0,
"step": 16485
},
{
"entropy": 5.517670488357544,
"epoch": 1.2829799649873566,
"grad_norm": 1.4296875,
"learning_rate": 0.00048381673207499224,
"loss": 5.2591,
"mean_token_accuracy": 0.17759563028812408,
"num_tokens": 28612057.0,
"step": 16490
},
{
"entropy": 5.424947738647461,
"epoch": 1.283368994359074,
"grad_norm": 1.4453125,
"learning_rate": 0.0004838064093468588,
"loss": 5.2017,
"mean_token_accuracy": 0.177443490922451,
"num_tokens": 28620945.0,
"step": 16495
},
{
"entropy": 5.382672882080078,
"epoch": 1.2837580237307917,
"grad_norm": 1.2734375,
"learning_rate": 0.0004837960834504206,
"loss": 5.1292,
"mean_token_accuracy": 0.1877993956208229,
"num_tokens": 28629028.0,
"step": 16500
},
{
"entropy": 5.424057579040527,
"epoch": 1.2841470531025092,
"grad_norm": 1.1484375,
"learning_rate": 0.0004837857543858341,
"loss": 5.1773,
"mean_token_accuracy": 0.17858725786209106,
"num_tokens": 28637533.0,
"step": 16505
},
{
"entropy": 5.518388175964356,
"epoch": 1.2845360824742267,
"grad_norm": 1.3046875,
"learning_rate": 0.0004837754221532561,
"loss": 5.3457,
"mean_token_accuracy": 0.17425785213708878,
"num_tokens": 28646906.0,
"step": 16510
},
{
"entropy": 5.4876491069793705,
"epoch": 1.2849251118459444,
"grad_norm": 1.328125,
"learning_rate": 0.00048376508675284334,
"loss": 5.2071,
"mean_token_accuracy": 0.1816145345568657,
"num_tokens": 28655597.0,
"step": 16515
},
{
"entropy": 5.506335735321045,
"epoch": 1.2853141412176619,
"grad_norm": 1.4375,
"learning_rate": 0.00048375474818475274,
"loss": 5.3487,
"mean_token_accuracy": 0.16967411190271378,
"num_tokens": 28664806.0,
"step": 16520
},
{
"entropy": 5.450713872909546,
"epoch": 1.2857031705893796,
"grad_norm": 1.4453125,
"learning_rate": 0.00048374440644914104,
"loss": 5.1899,
"mean_token_accuracy": 0.1852163165807724,
"num_tokens": 28673610.0,
"step": 16525
},
{
"entropy": 5.45979266166687,
"epoch": 1.286092199961097,
"grad_norm": 1.6796875,
"learning_rate": 0.00048373406154616523,
"loss": 5.2316,
"mean_token_accuracy": 0.17208587527275085,
"num_tokens": 28681726.0,
"step": 16530
},
{
"entropy": 5.582917308807373,
"epoch": 1.2864812293328147,
"grad_norm": 2.390625,
"learning_rate": 0.00048372371347598226,
"loss": 5.4105,
"mean_token_accuracy": 0.16327884942293167,
"num_tokens": 28691014.0,
"step": 16535
},
{
"entropy": 5.567583656311035,
"epoch": 1.2868702587045322,
"grad_norm": 1.296875,
"learning_rate": 0.00048371336223874923,
"loss": 5.2598,
"mean_token_accuracy": 0.1747429773211479,
"num_tokens": 28699304.0,
"step": 16540
},
{
"entropy": 5.526841831207276,
"epoch": 1.2872592880762497,
"grad_norm": 1.3046875,
"learning_rate": 0.000483703007834623,
"loss": 5.1875,
"mean_token_accuracy": 0.1813199669122696,
"num_tokens": 28707950.0,
"step": 16545
},
{
"entropy": 5.403838968276977,
"epoch": 1.2876483174479674,
"grad_norm": 1.4609375,
"learning_rate": 0.0004836926502637609,
"loss": 5.2066,
"mean_token_accuracy": 0.17755566090345382,
"num_tokens": 28716678.0,
"step": 16550
},
{
"entropy": 5.450593423843384,
"epoch": 1.2880373468196848,
"grad_norm": 1.2421875,
"learning_rate": 0.00048368228952632005,
"loss": 5.2314,
"mean_token_accuracy": 0.18036616146564483,
"num_tokens": 28725658.0,
"step": 16555
},
{
"entropy": 5.5394350528717045,
"epoch": 1.2884263761914023,
"grad_norm": 1.40625,
"learning_rate": 0.00048367192562245756,
"loss": 5.2625,
"mean_token_accuracy": 0.17962267100811005,
"num_tokens": 28733859.0,
"step": 16560
},
{
"entropy": 5.355400419235229,
"epoch": 1.28881540556312,
"grad_norm": 1.3046875,
"learning_rate": 0.00048366155855233067,
"loss": 5.151,
"mean_token_accuracy": 0.1870662033557892,
"num_tokens": 28741941.0,
"step": 16565
},
{
"entropy": 5.380025625228882,
"epoch": 1.2892044349348377,
"grad_norm": 1.3203125,
"learning_rate": 0.0004836511883160968,
"loss": 5.098,
"mean_token_accuracy": 0.1813839539885521,
"num_tokens": 28750296.0,
"step": 16570
},
{
"entropy": 5.4191608905792235,
"epoch": 1.2895934643065552,
"grad_norm": 1.390625,
"learning_rate": 0.0004836408149139133,
"loss": 5.0805,
"mean_token_accuracy": 0.1857111483812332,
"num_tokens": 28758359.0,
"step": 16575
},
{
"entropy": 5.477891206741333,
"epoch": 1.2899824936782727,
"grad_norm": 1.4453125,
"learning_rate": 0.00048363043834593743,
"loss": 5.2795,
"mean_token_accuracy": 0.17737163454294205,
"num_tokens": 28766944.0,
"step": 16580
},
{
"entropy": 5.472108697891235,
"epoch": 1.2903715230499904,
"grad_norm": 1.4921875,
"learning_rate": 0.0004836200586123268,
"loss": 5.3042,
"mean_token_accuracy": 0.17624610364437104,
"num_tokens": 28775897.0,
"step": 16585
},
{
"entropy": 5.4618124008178714,
"epoch": 1.2907605524217078,
"grad_norm": 1.2421875,
"learning_rate": 0.00048360967571323875,
"loss": 5.2069,
"mean_token_accuracy": 0.17975049018859862,
"num_tokens": 28784509.0,
"step": 16590
},
{
"entropy": 5.376451206207276,
"epoch": 1.2911495817934253,
"grad_norm": 1.265625,
"learning_rate": 0.00048359928964883094,
"loss": 5.0763,
"mean_token_accuracy": 0.18987792432308198,
"num_tokens": 28793347.0,
"step": 16595
},
{
"entropy": 5.449303150177002,
"epoch": 1.291538611165143,
"grad_norm": 1.3828125,
"learning_rate": 0.000483588900419261,
"loss": 5.1703,
"mean_token_accuracy": 0.1835750386118889,
"num_tokens": 28801100.0,
"step": 16600
},
{
"entropy": 5.418455314636231,
"epoch": 1.2919276405368605,
"grad_norm": 1.3984375,
"learning_rate": 0.0004835785080246864,
"loss": 5.1733,
"mean_token_accuracy": 0.18339648991823196,
"num_tokens": 28809508.0,
"step": 16605
},
{
"entropy": 5.407320833206176,
"epoch": 1.292316669908578,
"grad_norm": 1.5390625,
"learning_rate": 0.000483568112465265,
"loss": 5.2613,
"mean_token_accuracy": 0.17024484425783157,
"num_tokens": 28819263.0,
"step": 16610
},
{
"entropy": 5.570907831192017,
"epoch": 1.2927056992802957,
"grad_norm": 1.5625,
"learning_rate": 0.00048355771374115436,
"loss": 5.338,
"mean_token_accuracy": 0.16404026001691818,
"num_tokens": 28827316.0,
"step": 16615
},
{
"entropy": 5.575836133956909,
"epoch": 1.2930947286520134,
"grad_norm": 1.421875,
"learning_rate": 0.0004835473118525125,
"loss": 5.3484,
"mean_token_accuracy": 0.17342509031295777,
"num_tokens": 28836272.0,
"step": 16620
},
{
"entropy": 5.456055736541748,
"epoch": 1.2934837580237308,
"grad_norm": 1.3203125,
"learning_rate": 0.0004835369067994971,
"loss": 5.2352,
"mean_token_accuracy": 0.1743704691529274,
"num_tokens": 28845180.0,
"step": 16625
},
{
"entropy": 5.431114435195923,
"epoch": 1.2938727873954483,
"grad_norm": 1.390625,
"learning_rate": 0.000483526498582266,
"loss": 5.1884,
"mean_token_accuracy": 0.17326849699020386,
"num_tokens": 28853903.0,
"step": 16630
},
{
"entropy": 5.439738845825195,
"epoch": 1.294261816767166,
"grad_norm": 1.21875,
"learning_rate": 0.00048351608720097715,
"loss": 5.1893,
"mean_token_accuracy": 0.18295179605484008,
"num_tokens": 28863071.0,
"step": 16635
},
{
"entropy": 5.4979939460754395,
"epoch": 1.2946508461388835,
"grad_norm": 1.3984375,
"learning_rate": 0.00048350567265578867,
"loss": 5.29,
"mean_token_accuracy": 0.16931591480970382,
"num_tokens": 28871620.0,
"step": 16640
},
{
"entropy": 5.588835191726685,
"epoch": 1.295039875510601,
"grad_norm": 1.34375,
"learning_rate": 0.0004834952549468584,
"loss": 5.3224,
"mean_token_accuracy": 0.16981561481952667,
"num_tokens": 28879940.0,
"step": 16645
},
{
"entropy": 5.5503458976745605,
"epoch": 1.2954289048823187,
"grad_norm": 1.2109375,
"learning_rate": 0.0004834848340743446,
"loss": 5.3451,
"mean_token_accuracy": 0.1675911843776703,
"num_tokens": 28889012.0,
"step": 16650
},
{
"entropy": 5.528504371643066,
"epoch": 1.2958179342540361,
"grad_norm": 1.5625,
"learning_rate": 0.0004834744100384052,
"loss": 5.2108,
"mean_token_accuracy": 0.18337976783514023,
"num_tokens": 28897312.0,
"step": 16655
},
{
"entropy": 5.480485582351685,
"epoch": 1.2962069636257538,
"grad_norm": 1.3046875,
"learning_rate": 0.0004834639828391984,
"loss": 5.1756,
"mean_token_accuracy": 0.18273263573646545,
"num_tokens": 28905977.0,
"step": 16660
},
{
"entropy": 5.432545614242554,
"epoch": 1.2965959929974713,
"grad_norm": 1.34375,
"learning_rate": 0.00048345355247688256,
"loss": 5.1871,
"mean_token_accuracy": 0.18038800209760666,
"num_tokens": 28913979.0,
"step": 16665
},
{
"entropy": 5.449227523803711,
"epoch": 1.296985022369189,
"grad_norm": 1.4609375,
"learning_rate": 0.0004834431189516158,
"loss": 5.2121,
"mean_token_accuracy": 0.1908937469124794,
"num_tokens": 28922090.0,
"step": 16670
},
{
"entropy": 5.501261377334595,
"epoch": 1.2973740517409065,
"grad_norm": 1.4609375,
"learning_rate": 0.0004834326822635565,
"loss": 5.3686,
"mean_token_accuracy": 0.16585621982812881,
"num_tokens": 28930816.0,
"step": 16675
},
{
"entropy": 5.559801197052002,
"epoch": 1.297763081112624,
"grad_norm": 1.4375,
"learning_rate": 0.00048342224241286296,
"loss": 5.2916,
"mean_token_accuracy": 0.16808870285749436,
"num_tokens": 28939125.0,
"step": 16680
},
{
"entropy": 5.4852031707763675,
"epoch": 1.2981521104843416,
"grad_norm": 1.28125,
"learning_rate": 0.0004834117993996937,
"loss": 5.1954,
"mean_token_accuracy": 0.18622385561466218,
"num_tokens": 28947783.0,
"step": 16685
},
{
"entropy": 5.578096723556518,
"epoch": 1.2985411398560591,
"grad_norm": 1.234375,
"learning_rate": 0.0004834013532242071,
"loss": 5.3244,
"mean_token_accuracy": 0.17459237426519394,
"num_tokens": 28957305.0,
"step": 16690
},
{
"entropy": 5.5729897022247314,
"epoch": 1.2989301692277766,
"grad_norm": 1.2421875,
"learning_rate": 0.0004833909038865616,
"loss": 5.2813,
"mean_token_accuracy": 0.15963828712701797,
"num_tokens": 28965757.0,
"step": 16695
},
{
"entropy": 5.496206951141358,
"epoch": 1.2993191985994943,
"grad_norm": 1.3125,
"learning_rate": 0.0004833804513869159,
"loss": 5.2704,
"mean_token_accuracy": 0.17117171138525009,
"num_tokens": 28974846.0,
"step": 16700
},
{
"entropy": 5.389321279525757,
"epoch": 1.2997082279712118,
"grad_norm": 1.265625,
"learning_rate": 0.0004833699957254284,
"loss": 5.111,
"mean_token_accuracy": 0.17951308637857438,
"num_tokens": 28984060.0,
"step": 16705
},
{
"entropy": 5.459994888305664,
"epoch": 1.3000972573429295,
"grad_norm": 1.5,
"learning_rate": 0.000483359536902258,
"loss": 5.1843,
"mean_token_accuracy": 0.17581637352705,
"num_tokens": 28992705.0,
"step": 16710
},
{
"entropy": 5.500532245635986,
"epoch": 1.300486286714647,
"grad_norm": 1.515625,
"learning_rate": 0.0004833490749175632,
"loss": 5.2852,
"mean_token_accuracy": 0.17449826449155809,
"num_tokens": 29001306.0,
"step": 16715
},
{
"entropy": 5.46809754371643,
"epoch": 1.3008753160863646,
"grad_norm": 1.359375,
"learning_rate": 0.00048333860977150286,
"loss": 5.3003,
"mean_token_accuracy": 0.17776818871498107,
"num_tokens": 29010371.0,
"step": 16720
},
{
"entropy": 5.530137968063355,
"epoch": 1.3012643454580821,
"grad_norm": 1.2734375,
"learning_rate": 0.00048332814146423566,
"loss": 5.2677,
"mean_token_accuracy": 0.17504500597715378,
"num_tokens": 29019940.0,
"step": 16725
},
{
"entropy": 5.583278036117553,
"epoch": 1.3016533748297996,
"grad_norm": 1.390625,
"learning_rate": 0.0004833176699959206,
"loss": 5.2792,
"mean_token_accuracy": 0.17342123687267302,
"num_tokens": 29027644.0,
"step": 16730
},
{
"entropy": 5.451085948944092,
"epoch": 1.3020424042015173,
"grad_norm": 1.3203125,
"learning_rate": 0.00048330719536671633,
"loss": 5.2067,
"mean_token_accuracy": 0.18024676144123078,
"num_tokens": 29035166.0,
"step": 16735
},
{
"entropy": 5.395693397521972,
"epoch": 1.3024314335732348,
"grad_norm": 1.4375,
"learning_rate": 0.000483296717576782,
"loss": 5.1815,
"mean_token_accuracy": 0.1790855422616005,
"num_tokens": 29044539.0,
"step": 16740
},
{
"entropy": 5.52463812828064,
"epoch": 1.3028204629449522,
"grad_norm": 1.3125,
"learning_rate": 0.0004832862366262765,
"loss": 5.2404,
"mean_token_accuracy": 0.18767423778772355,
"num_tokens": 29052849.0,
"step": 16745
},
{
"entropy": 5.472813987731934,
"epoch": 1.30320949231667,
"grad_norm": 1.3203125,
"learning_rate": 0.00048327575251535886,
"loss": 5.2439,
"mean_token_accuracy": 0.17264259606599808,
"num_tokens": 29061881.0,
"step": 16750
},
{
"entropy": 5.577336931228638,
"epoch": 1.3035985216883874,
"grad_norm": 1.265625,
"learning_rate": 0.0004832652652441883,
"loss": 5.2969,
"mean_token_accuracy": 0.16959179937839508,
"num_tokens": 29070460.0,
"step": 16755
},
{
"entropy": 5.557647705078125,
"epoch": 1.303987551060105,
"grad_norm": 1.28125,
"learning_rate": 0.00048325477481292375,
"loss": 5.3116,
"mean_token_accuracy": 0.16884099692106247,
"num_tokens": 29079061.0,
"step": 16760
},
{
"entropy": 5.475124073028565,
"epoch": 1.3043765804318226,
"grad_norm": 1.3125,
"learning_rate": 0.0004832442812217244,
"loss": 5.2214,
"mean_token_accuracy": 0.17832874208688737,
"num_tokens": 29087525.0,
"step": 16765
},
{
"entropy": 5.473687934875488,
"epoch": 1.3047656098035403,
"grad_norm": 1.28125,
"learning_rate": 0.0004832337844707496,
"loss": 5.1618,
"mean_token_accuracy": 0.1824201300740242,
"num_tokens": 29096206.0,
"step": 16770
},
{
"entropy": 5.517829084396363,
"epoch": 1.3051546391752578,
"grad_norm": 1.5,
"learning_rate": 0.00048322328456015855,
"loss": 5.3688,
"mean_token_accuracy": 0.1709981992840767,
"num_tokens": 29105025.0,
"step": 16775
},
{
"entropy": 5.4974733829498295,
"epoch": 1.3055436685469752,
"grad_norm": 1.3359375,
"learning_rate": 0.00048321278149011053,
"loss": 5.3236,
"mean_token_accuracy": 0.1700569808483124,
"num_tokens": 29113468.0,
"step": 16780
},
{
"entropy": 5.488374662399292,
"epoch": 1.305932697918693,
"grad_norm": 1.3203125,
"learning_rate": 0.00048320227526076504,
"loss": 5.2442,
"mean_token_accuracy": 0.17641721665859222,
"num_tokens": 29122904.0,
"step": 16785
},
{
"entropy": 5.531284761428833,
"epoch": 1.3063217272904104,
"grad_norm": 1.3046875,
"learning_rate": 0.0004831917658722814,
"loss": 5.2309,
"mean_token_accuracy": 0.1841050699353218,
"num_tokens": 29132408.0,
"step": 16790
},
{
"entropy": 5.547504520416259,
"epoch": 1.3067107566621279,
"grad_norm": 1.3046875,
"learning_rate": 0.00048318125332481903,
"loss": 5.3717,
"mean_token_accuracy": 0.1684241771697998,
"num_tokens": 29141840.0,
"step": 16795
},
{
"entropy": 5.631039667129516,
"epoch": 1.3070997860338456,
"grad_norm": 1.3984375,
"learning_rate": 0.00048317073761853764,
"loss": 5.3246,
"mean_token_accuracy": 0.17543092966079712,
"num_tokens": 29150759.0,
"step": 16800
},
{
"entropy": 5.477938604354859,
"epoch": 1.307488815405563,
"grad_norm": 1.3515625,
"learning_rate": 0.0004831602187535965,
"loss": 5.1482,
"mean_token_accuracy": 0.18028225898742675,
"num_tokens": 29159489.0,
"step": 16805
},
{
"entropy": 5.462970781326294,
"epoch": 1.3078778447772808,
"grad_norm": 1.296875,
"learning_rate": 0.0004831496967301554,
"loss": 5.1699,
"mean_token_accuracy": 0.18005609065294265,
"num_tokens": 29168160.0,
"step": 16810
},
{
"entropy": 5.524637889862061,
"epoch": 1.3082668741489982,
"grad_norm": 1.3046875,
"learning_rate": 0.00048313917154837386,
"loss": 5.2609,
"mean_token_accuracy": 0.17554370760917665,
"num_tokens": 29176534.0,
"step": 16815
},
{
"entropy": 5.41055212020874,
"epoch": 1.308655903520716,
"grad_norm": 1.3515625,
"learning_rate": 0.0004831286432084118,
"loss": 5.1483,
"mean_token_accuracy": 0.1828785553574562,
"num_tokens": 29185461.0,
"step": 16820
},
{
"entropy": 5.5248425006866455,
"epoch": 1.3090449328924334,
"grad_norm": 1.34375,
"learning_rate": 0.0004831181117104289,
"loss": 5.298,
"mean_token_accuracy": 0.1726389080286026,
"num_tokens": 29194218.0,
"step": 16825
},
{
"entropy": 5.472246217727661,
"epoch": 1.3094339622641509,
"grad_norm": 1.3203125,
"learning_rate": 0.00048310757705458476,
"loss": 5.2496,
"mean_token_accuracy": 0.1761614888906479,
"num_tokens": 29203720.0,
"step": 16830
},
{
"entropy": 5.529952335357666,
"epoch": 1.3098229916358686,
"grad_norm": 1.546875,
"learning_rate": 0.00048309703924103944,
"loss": 5.3283,
"mean_token_accuracy": 0.17252070903778077,
"num_tokens": 29212588.0,
"step": 16835
},
{
"entropy": 5.573881196975708,
"epoch": 1.310212021007586,
"grad_norm": 1.4765625,
"learning_rate": 0.00048308649826995283,
"loss": 5.3094,
"mean_token_accuracy": 0.17612760066986083,
"num_tokens": 29220718.0,
"step": 16840
},
{
"entropy": 5.515702819824218,
"epoch": 1.3106010503793035,
"grad_norm": 1.421875,
"learning_rate": 0.00048307595414148475,
"loss": 5.1825,
"mean_token_accuracy": 0.18570471405982972,
"num_tokens": 29229386.0,
"step": 16845
},
{
"entropy": 5.45784854888916,
"epoch": 1.3109900797510212,
"grad_norm": 1.6796875,
"learning_rate": 0.0004830654068557952,
"loss": 5.2474,
"mean_token_accuracy": 0.17849715799093246,
"num_tokens": 29238390.0,
"step": 16850
},
{
"entropy": 5.502755546569825,
"epoch": 1.3113791091227387,
"grad_norm": 1.34375,
"learning_rate": 0.0004830548564130444,
"loss": 5.3183,
"mean_token_accuracy": 0.17546208202838898,
"num_tokens": 29246502.0,
"step": 16855
},
{
"entropy": 5.487176847457886,
"epoch": 1.3117681384944564,
"grad_norm": 1.6484375,
"learning_rate": 0.00048304430281339216,
"loss": 5.2517,
"mean_token_accuracy": 0.17074074447155,
"num_tokens": 29254954.0,
"step": 16860
},
{
"entropy": 5.522469997406006,
"epoch": 1.3121571678661739,
"grad_norm": 1.2578125,
"learning_rate": 0.0004830337460569989,
"loss": 5.2142,
"mean_token_accuracy": 0.18119794875383377,
"num_tokens": 29263294.0,
"step": 16865
},
{
"entropy": 5.430172443389893,
"epoch": 1.3125461972378916,
"grad_norm": 1.25,
"learning_rate": 0.0004830231861440246,
"loss": 5.1918,
"mean_token_accuracy": 0.1767362102866173,
"num_tokens": 29271737.0,
"step": 16870
},
{
"entropy": 5.509420442581177,
"epoch": 1.312935226609609,
"grad_norm": 1.28125,
"learning_rate": 0.0004830126230746295,
"loss": 5.3367,
"mean_token_accuracy": 0.1693131923675537,
"num_tokens": 29279473.0,
"step": 16875
},
{
"entropy": 5.4937409400939945,
"epoch": 1.3133242559813265,
"grad_norm": 1.2734375,
"learning_rate": 0.00048300205684897405,
"loss": 5.2371,
"mean_token_accuracy": 0.1878308191895485,
"num_tokens": 29287650.0,
"step": 16880
},
{
"entropy": 5.475452947616577,
"epoch": 1.3137132853530442,
"grad_norm": 1.1640625,
"learning_rate": 0.0004829914874672184,
"loss": 5.2748,
"mean_token_accuracy": 0.17647088021039964,
"num_tokens": 29296914.0,
"step": 16885
},
{
"entropy": 5.525088882446289,
"epoch": 1.3141023147247617,
"grad_norm": 1.3359375,
"learning_rate": 0.00048298091492952297,
"loss": 5.2755,
"mean_token_accuracy": 0.17729541063308715,
"num_tokens": 29305409.0,
"step": 16890
},
{
"entropy": 5.547475957870484,
"epoch": 1.3144913440964792,
"grad_norm": 1.265625,
"learning_rate": 0.0004829703392360482,
"loss": 5.2906,
"mean_token_accuracy": 0.17043836116790773,
"num_tokens": 29314333.0,
"step": 16895
},
{
"entropy": 5.458041954040527,
"epoch": 1.3148803734681969,
"grad_norm": 1.328125,
"learning_rate": 0.00048295976038695455,
"loss": 5.144,
"mean_token_accuracy": 0.18503309190273284,
"num_tokens": 29323764.0,
"step": 16900
},
{
"entropy": 5.447067642211914,
"epoch": 1.3152694028399143,
"grad_norm": 1.484375,
"learning_rate": 0.0004829491783824025,
"loss": 5.1986,
"mean_token_accuracy": 0.18337195813655854,
"num_tokens": 29331734.0,
"step": 16905
},
{
"entropy": 5.364851999282837,
"epoch": 1.315658432211632,
"grad_norm": 1.4921875,
"learning_rate": 0.00048293859322255276,
"loss": 5.1471,
"mean_token_accuracy": 0.18833026587963103,
"num_tokens": 29339791.0,
"step": 16910
},
{
"entropy": 5.44777774810791,
"epoch": 1.3160474615833495,
"grad_norm": 1.25,
"learning_rate": 0.0004829280049075657,
"loss": 5.2712,
"mean_token_accuracy": 0.17197880297899246,
"num_tokens": 29348548.0,
"step": 16915
},
{
"entropy": 5.531647062301635,
"epoch": 1.3164364909550672,
"grad_norm": 1.3984375,
"learning_rate": 0.00048291741343760216,
"loss": 5.198,
"mean_token_accuracy": 0.17299035787582398,
"num_tokens": 29357151.0,
"step": 16920
},
{
"entropy": 5.525174760818482,
"epoch": 1.3168255203267847,
"grad_norm": 1.4140625,
"learning_rate": 0.0004829068188128229,
"loss": 5.1907,
"mean_token_accuracy": 0.18366375863552092,
"num_tokens": 29365643.0,
"step": 16925
},
{
"entropy": 5.447732543945312,
"epoch": 1.3172145496985022,
"grad_norm": 1.453125,
"learning_rate": 0.0004828962210333885,
"loss": 5.2883,
"mean_token_accuracy": 0.1729740783572197,
"num_tokens": 29374215.0,
"step": 16930
},
{
"entropy": 5.491642665863037,
"epoch": 1.3176035790702199,
"grad_norm": 1.25,
"learning_rate": 0.0004828856200994598,
"loss": 5.1909,
"mean_token_accuracy": 0.1799288272857666,
"num_tokens": 29382586.0,
"step": 16935
},
{
"entropy": 5.393301010131836,
"epoch": 1.3179926084419373,
"grad_norm": 1.3984375,
"learning_rate": 0.0004828750160111978,
"loss": 5.238,
"mean_token_accuracy": 0.1726415276527405,
"num_tokens": 29391922.0,
"step": 16940
},
{
"entropy": 5.473742294311523,
"epoch": 1.3183816378136548,
"grad_norm": 1.328125,
"learning_rate": 0.00048286440876876325,
"loss": 5.2035,
"mean_token_accuracy": 0.17527247071266175,
"num_tokens": 29400408.0,
"step": 16945
},
{
"entropy": 5.463558006286621,
"epoch": 1.3187706671853725,
"grad_norm": 1.453125,
"learning_rate": 0.00048285379837231714,
"loss": 5.1291,
"mean_token_accuracy": 0.19060914665460588,
"num_tokens": 29408130.0,
"step": 16950
},
{
"entropy": 5.497085952758789,
"epoch": 1.31915969655709,
"grad_norm": 1.625,
"learning_rate": 0.0004828431848220205,
"loss": 5.2189,
"mean_token_accuracy": 0.17894755005836488,
"num_tokens": 29417446.0,
"step": 16955
},
{
"entropy": 5.496921873092651,
"epoch": 1.3195487259288077,
"grad_norm": 1.5234375,
"learning_rate": 0.0004828325681180343,
"loss": 5.3049,
"mean_token_accuracy": 0.17422318309545518,
"num_tokens": 29426023.0,
"step": 16960
},
{
"entropy": 5.518601751327514,
"epoch": 1.3199377553005252,
"grad_norm": 1.265625,
"learning_rate": 0.0004828219482605197,
"loss": 5.2167,
"mean_token_accuracy": 0.1839369311928749,
"num_tokens": 29434737.0,
"step": 16965
},
{
"entropy": 5.405993127822876,
"epoch": 1.3203267846722428,
"grad_norm": 1.484375,
"learning_rate": 0.00048281132524963786,
"loss": 5.2431,
"mean_token_accuracy": 0.170933099091053,
"num_tokens": 29443926.0,
"step": 16970
},
{
"entropy": 5.472154998779297,
"epoch": 1.3207158140439603,
"grad_norm": 1.46875,
"learning_rate": 0.0004828006990855499,
"loss": 5.2196,
"mean_token_accuracy": 0.1806778609752655,
"num_tokens": 29452495.0,
"step": 16975
},
{
"entropy": 5.4757812976837155,
"epoch": 1.3211048434156778,
"grad_norm": 1.2734375,
"learning_rate": 0.00048279006976841704,
"loss": 5.1778,
"mean_token_accuracy": 0.17714895009994508,
"num_tokens": 29460661.0,
"step": 16980
},
{
"entropy": 5.467296314239502,
"epoch": 1.3214938727873955,
"grad_norm": 1.4921875,
"learning_rate": 0.0004827794372984007,
"loss": 5.1791,
"mean_token_accuracy": 0.18186292797327042,
"num_tokens": 29469155.0,
"step": 16985
},
{
"entropy": 5.455309343338013,
"epoch": 1.321882902159113,
"grad_norm": 1.234375,
"learning_rate": 0.000482768801675662,
"loss": 5.2909,
"mean_token_accuracy": 0.18031759858131408,
"num_tokens": 29478220.0,
"step": 16990
},
{
"entropy": 5.469020414352417,
"epoch": 1.3222719315308304,
"grad_norm": 1.609375,
"learning_rate": 0.0004827581629003625,
"loss": 5.2544,
"mean_token_accuracy": 0.17651599794626235,
"num_tokens": 29486336.0,
"step": 16995
},
{
"entropy": 5.531178092956543,
"epoch": 1.3226609609025481,
"grad_norm": 1.453125,
"learning_rate": 0.00048274752097266356,
"loss": 5.3434,
"mean_token_accuracy": 0.17201607823371887,
"num_tokens": 29495150.0,
"step": 17000
},
{
"entropy": 5.506674718856812,
"epoch": 1.3230499902742658,
"grad_norm": 1.34375,
"learning_rate": 0.0004827368758927266,
"loss": 5.2367,
"mean_token_accuracy": 0.17920218259096146,
"num_tokens": 29503508.0,
"step": 17005
},
{
"entropy": 5.479684066772461,
"epoch": 1.3234390196459833,
"grad_norm": 1.3203125,
"learning_rate": 0.0004827262276607132,
"loss": 5.2407,
"mean_token_accuracy": 0.17378330379724502,
"num_tokens": 29513038.0,
"step": 17010
},
{
"entropy": 5.452485704421997,
"epoch": 1.3238280490177008,
"grad_norm": 1.3046875,
"learning_rate": 0.000482715576276785,
"loss": 5.1666,
"mean_token_accuracy": 0.18325186520814896,
"num_tokens": 29521344.0,
"step": 17015
},
{
"entropy": 5.51010799407959,
"epoch": 1.3242170783894185,
"grad_norm": 1.2265625,
"learning_rate": 0.0004827049217411035,
"loss": 5.2967,
"mean_token_accuracy": 0.1695142060518265,
"num_tokens": 29530109.0,
"step": 17020
},
{
"entropy": 5.529137706756591,
"epoch": 1.324606107761136,
"grad_norm": 1.2734375,
"learning_rate": 0.00048269426405383043,
"loss": 5.2289,
"mean_token_accuracy": 0.16018726527690888,
"num_tokens": 29539114.0,
"step": 17025
},
{
"entropy": 5.5423665046691895,
"epoch": 1.3249951371328534,
"grad_norm": 1.296875,
"learning_rate": 0.00048268360321512745,
"loss": 5.2785,
"mean_token_accuracy": 0.17455030232667923,
"num_tokens": 29548746.0,
"step": 17030
},
{
"entropy": 5.507274627685547,
"epoch": 1.3253841665045711,
"grad_norm": 1.328125,
"learning_rate": 0.0004826729392251564,
"loss": 5.3341,
"mean_token_accuracy": 0.17177271097898483,
"num_tokens": 29557681.0,
"step": 17035
},
{
"entropy": 5.533541107177735,
"epoch": 1.3257731958762886,
"grad_norm": 1.515625,
"learning_rate": 0.000482662272084079,
"loss": 5.28,
"mean_token_accuracy": 0.1755232259631157,
"num_tokens": 29566151.0,
"step": 17040
},
{
"entropy": 5.482423257827759,
"epoch": 1.326162225248006,
"grad_norm": 1.3671875,
"learning_rate": 0.0004826516017920571,
"loss": 5.0905,
"mean_token_accuracy": 0.19454223066568374,
"num_tokens": 29574853.0,
"step": 17045
},
{
"entropy": 5.41596531867981,
"epoch": 1.3265512546197238,
"grad_norm": 1.5703125,
"learning_rate": 0.0004826409283492528,
"loss": 5.206,
"mean_token_accuracy": 0.17888752669095992,
"num_tokens": 29583319.0,
"step": 17050
},
{
"entropy": 5.495956087112427,
"epoch": 1.3269402839914415,
"grad_norm": 1.390625,
"learning_rate": 0.00048263025175582783,
"loss": 5.3125,
"mean_token_accuracy": 0.17151685208082199,
"num_tokens": 29591949.0,
"step": 17055
},
{
"entropy": 5.560805988311768,
"epoch": 1.327329313363159,
"grad_norm": 1.5,
"learning_rate": 0.0004826195720119442,
"loss": 5.3109,
"mean_token_accuracy": 0.16976340115070343,
"num_tokens": 29600293.0,
"step": 17060
},
{
"entropy": 5.54003872871399,
"epoch": 1.3277183427348764,
"grad_norm": 1.421875,
"learning_rate": 0.0004826088891177641,
"loss": 5.3233,
"mean_token_accuracy": 0.17604486346244813,
"num_tokens": 29608602.0,
"step": 17065
},
{
"entropy": 5.453752708435059,
"epoch": 1.3281073721065941,
"grad_norm": 1.375,
"learning_rate": 0.00048259820307344954,
"loss": 5.2766,
"mean_token_accuracy": 0.1759918823838234,
"num_tokens": 29617464.0,
"step": 17070
},
{
"entropy": 5.48290786743164,
"epoch": 1.3284964014783116,
"grad_norm": 1.7734375,
"learning_rate": 0.00048258751387916267,
"loss": 5.1938,
"mean_token_accuracy": 0.18529756516218185,
"num_tokens": 29626297.0,
"step": 17075
},
{
"entropy": 5.4328789710998535,
"epoch": 1.328885430850029,
"grad_norm": 1.578125,
"learning_rate": 0.00048257682153506564,
"loss": 5.2243,
"mean_token_accuracy": 0.17499957382678985,
"num_tokens": 29635085.0,
"step": 17080
},
{
"entropy": 5.509983491897583,
"epoch": 1.3292744602217468,
"grad_norm": 1.3984375,
"learning_rate": 0.0004825661260413208,
"loss": 5.2006,
"mean_token_accuracy": 0.17917946875095367,
"num_tokens": 29643528.0,
"step": 17085
},
{
"entropy": 5.470966720581055,
"epoch": 1.3296634895934643,
"grad_norm": 1.75,
"learning_rate": 0.00048255542739809035,
"loss": 5.2415,
"mean_token_accuracy": 0.17621973752975464,
"num_tokens": 29651883.0,
"step": 17090
},
{
"entropy": 5.422865629196167,
"epoch": 1.330052518965182,
"grad_norm": 1.3125,
"learning_rate": 0.00048254472560553665,
"loss": 5.2515,
"mean_token_accuracy": 0.1758228987455368,
"num_tokens": 29661092.0,
"step": 17095
},
{
"entropy": 5.567375946044922,
"epoch": 1.3304415483368994,
"grad_norm": 1.328125,
"learning_rate": 0.00048253402066382207,
"loss": 5.2779,
"mean_token_accuracy": 0.1792393982410431,
"num_tokens": 29670285.0,
"step": 17100
},
{
"entropy": 5.5675395965576175,
"epoch": 1.3308305777086171,
"grad_norm": 1.4609375,
"learning_rate": 0.0004825233125731091,
"loss": 5.3445,
"mean_token_accuracy": 0.17455863058567048,
"num_tokens": 29679249.0,
"step": 17105
},
{
"entropy": 5.484007263183594,
"epoch": 1.3312196070803346,
"grad_norm": 1.4609375,
"learning_rate": 0.00048251260133356014,
"loss": 5.2958,
"mean_token_accuracy": 0.1721057265996933,
"num_tokens": 29687978.0,
"step": 17110
},
{
"entropy": 5.509602689743042,
"epoch": 1.331608636452052,
"grad_norm": 1.296875,
"learning_rate": 0.00048250188694533774,
"loss": 5.3039,
"mean_token_accuracy": 0.176420596241951,
"num_tokens": 29695972.0,
"step": 17115
},
{
"entropy": 5.492380905151367,
"epoch": 1.3319976658237698,
"grad_norm": 1.328125,
"learning_rate": 0.0004824911694086044,
"loss": 5.1582,
"mean_token_accuracy": 0.1750987023115158,
"num_tokens": 29704997.0,
"step": 17120
},
{
"entropy": 5.601944208145142,
"epoch": 1.3323866951954872,
"grad_norm": 1.296875,
"learning_rate": 0.000482480448723523,
"loss": 5.3951,
"mean_token_accuracy": 0.174538516998291,
"num_tokens": 29713957.0,
"step": 17125
},
{
"entropy": 5.492581176757812,
"epoch": 1.3327757245672047,
"grad_norm": 1.421875,
"learning_rate": 0.00048246972489025586,
"loss": 5.2683,
"mean_token_accuracy": 0.17820209860801697,
"num_tokens": 29721989.0,
"step": 17130
},
{
"entropy": 5.447675037384033,
"epoch": 1.3331647539389224,
"grad_norm": 1.46875,
"learning_rate": 0.00048245899790896597,
"loss": 5.2001,
"mean_token_accuracy": 0.18251659274101256,
"num_tokens": 29730032.0,
"step": 17135
},
{
"entropy": 5.455309867858887,
"epoch": 1.33355378331064,
"grad_norm": 1.6015625,
"learning_rate": 0.0004824482677798159,
"loss": 5.209,
"mean_token_accuracy": 0.177140474319458,
"num_tokens": 29738545.0,
"step": 17140
},
{
"entropy": 5.534008502960205,
"epoch": 1.3339428126823576,
"grad_norm": 1.3046875,
"learning_rate": 0.00048243753450296863,
"loss": 5.2481,
"mean_token_accuracy": 0.17813731133937835,
"num_tokens": 29747371.0,
"step": 17145
},
{
"entropy": 5.4993507862091064,
"epoch": 1.334331842054075,
"grad_norm": 1.3046875,
"learning_rate": 0.00048242679807858693,
"loss": 5.1761,
"mean_token_accuracy": 0.1823880136013031,
"num_tokens": 29756565.0,
"step": 17150
},
{
"entropy": 5.455775499343872,
"epoch": 1.3347208714257928,
"grad_norm": 1.5703125,
"learning_rate": 0.00048241605850683365,
"loss": 5.1844,
"mean_token_accuracy": 0.18443227112293242,
"num_tokens": 29765846.0,
"step": 17155
},
{
"entropy": 5.425571537017822,
"epoch": 1.3351099007975102,
"grad_norm": 1.3203125,
"learning_rate": 0.00048240531578787197,
"loss": 5.2104,
"mean_token_accuracy": 0.1823340430855751,
"num_tokens": 29774222.0,
"step": 17160
},
{
"entropy": 5.419958257675171,
"epoch": 1.3354989301692277,
"grad_norm": 1.4765625,
"learning_rate": 0.0004823945699218647,
"loss": 5.1196,
"mean_token_accuracy": 0.1917722389101982,
"num_tokens": 29782366.0,
"step": 17165
},
{
"entropy": 5.529707241058349,
"epoch": 1.3358879595409454,
"grad_norm": 1.625,
"learning_rate": 0.0004823838209089749,
"loss": 5.3201,
"mean_token_accuracy": 0.17108533382415772,
"num_tokens": 29792147.0,
"step": 17170
},
{
"entropy": 5.48813214302063,
"epoch": 1.3362769889126629,
"grad_norm": 1.5234375,
"learning_rate": 0.00048237306874936565,
"loss": 5.242,
"mean_token_accuracy": 0.17615937292575837,
"num_tokens": 29801325.0,
"step": 17175
},
{
"entropy": 5.4469012260437015,
"epoch": 1.3366660182843804,
"grad_norm": 1.703125,
"learning_rate": 0.0004823623134432001,
"loss": 5.1821,
"mean_token_accuracy": 0.18040625602006913,
"num_tokens": 29809353.0,
"step": 17180
},
{
"entropy": 5.469843626022339,
"epoch": 1.337055047656098,
"grad_norm": 1.3984375,
"learning_rate": 0.00048235155499064166,
"loss": 5.2465,
"mean_token_accuracy": 0.1800548404455185,
"num_tokens": 29817746.0,
"step": 17185
},
{
"entropy": 5.489180850982666,
"epoch": 1.3374440770278155,
"grad_norm": 1.703125,
"learning_rate": 0.00048234079339185335,
"loss": 5.2582,
"mean_token_accuracy": 0.17191974818706512,
"num_tokens": 29826468.0,
"step": 17190
},
{
"entropy": 5.519423341751098,
"epoch": 1.3378331063995332,
"grad_norm": 1.34375,
"learning_rate": 0.00048233002864699856,
"loss": 5.3372,
"mean_token_accuracy": 0.16889057010412217,
"num_tokens": 29835051.0,
"step": 17195
},
{
"entropy": 5.480764722824096,
"epoch": 1.3382221357712507,
"grad_norm": 1.359375,
"learning_rate": 0.0004823192607562405,
"loss": 5.2196,
"mean_token_accuracy": 0.17624942809343339,
"num_tokens": 29843514.0,
"step": 17200
},
{
"entropy": 5.501816511154175,
"epoch": 1.3386111651429684,
"grad_norm": 1.7890625,
"learning_rate": 0.00048230848971974265,
"loss": 5.1551,
"mean_token_accuracy": 0.1773585245013237,
"num_tokens": 29851861.0,
"step": 17205
},
{
"entropy": 5.433729887008667,
"epoch": 1.3390001945146859,
"grad_norm": 1.34375,
"learning_rate": 0.0004822977155376684,
"loss": 5.1521,
"mean_token_accuracy": 0.18054487854242324,
"num_tokens": 29860639.0,
"step": 17210
},
{
"entropy": 5.438904619216919,
"epoch": 1.3393892238864034,
"grad_norm": 1.4375,
"learning_rate": 0.0004822869382101814,
"loss": 5.3722,
"mean_token_accuracy": 0.16856206059455872,
"num_tokens": 29869931.0,
"step": 17215
},
{
"entropy": 5.511276483535767,
"epoch": 1.339778253258121,
"grad_norm": 1.421875,
"learning_rate": 0.0004822761577374449,
"loss": 5.271,
"mean_token_accuracy": 0.17683886140584945,
"num_tokens": 29878933.0,
"step": 17220
},
{
"entropy": 5.514138698577881,
"epoch": 1.3401672826298385,
"grad_norm": 1.2734375,
"learning_rate": 0.0004822653741196227,
"loss": 5.2485,
"mean_token_accuracy": 0.17719458937644958,
"num_tokens": 29888031.0,
"step": 17225
},
{
"entropy": 5.462238740921021,
"epoch": 1.340556312001556,
"grad_norm": 1.3046875,
"learning_rate": 0.0004822545873568783,
"loss": 5.1866,
"mean_token_accuracy": 0.17841969430446625,
"num_tokens": 29896792.0,
"step": 17230
},
{
"entropy": 5.450891542434692,
"epoch": 1.3409453413732737,
"grad_norm": 1.3515625,
"learning_rate": 0.00048224379744937545,
"loss": 5.192,
"mean_token_accuracy": 0.17688935846090317,
"num_tokens": 29905185.0,
"step": 17235
},
{
"entropy": 5.472045183181763,
"epoch": 1.3413343707449912,
"grad_norm": 1.3515625,
"learning_rate": 0.00048223300439727783,
"loss": 5.3136,
"mean_token_accuracy": 0.16861119717359543,
"num_tokens": 29913289.0,
"step": 17240
},
{
"entropy": 5.442542505264282,
"epoch": 1.3417234001167089,
"grad_norm": 1.2265625,
"learning_rate": 0.00048222220820074926,
"loss": 5.2646,
"mean_token_accuracy": 0.17920224219560624,
"num_tokens": 29922112.0,
"step": 17245
},
{
"entropy": 5.528877401351929,
"epoch": 1.3421124294884264,
"grad_norm": 1.453125,
"learning_rate": 0.00048221140885995346,
"loss": 5.2524,
"mean_token_accuracy": 0.17331501841545105,
"num_tokens": 29930944.0,
"step": 17250
},
{
"entropy": 5.549095249176025,
"epoch": 1.342501458860144,
"grad_norm": 1.390625,
"learning_rate": 0.0004822006063750543,
"loss": 5.3584,
"mean_token_accuracy": 0.17036155313253404,
"num_tokens": 29938576.0,
"step": 17255
},
{
"entropy": 5.448603391647339,
"epoch": 1.3428904882318615,
"grad_norm": 1.3828125,
"learning_rate": 0.00048218980074621575,
"loss": 5.2236,
"mean_token_accuracy": 0.17743732482194902,
"num_tokens": 29946771.0,
"step": 17260
},
{
"entropy": 5.579141473770141,
"epoch": 1.343279517603579,
"grad_norm": 1.3203125,
"learning_rate": 0.00048217899197360183,
"loss": 5.2562,
"mean_token_accuracy": 0.17793361842632294,
"num_tokens": 29955098.0,
"step": 17265
},
{
"entropy": 5.464924955368042,
"epoch": 1.3436685469752967,
"grad_norm": 1.3515625,
"learning_rate": 0.0004821681800573764,
"loss": 5.2572,
"mean_token_accuracy": 0.17426925748586655,
"num_tokens": 29964538.0,
"step": 17270
},
{
"entropy": 5.451232242584228,
"epoch": 1.3440575763470142,
"grad_norm": 1.546875,
"learning_rate": 0.0004821573649977036,
"loss": 5.2063,
"mean_token_accuracy": 0.1761238917708397,
"num_tokens": 29973965.0,
"step": 17275
},
{
"entropy": 5.441684627532959,
"epoch": 1.3444466057187316,
"grad_norm": 1.3984375,
"learning_rate": 0.00048214654679474753,
"loss": 5.122,
"mean_token_accuracy": 0.18359608203172684,
"num_tokens": 29982742.0,
"step": 17280
},
{
"entropy": 5.406542730331421,
"epoch": 1.3448356350904493,
"grad_norm": 1.421875,
"learning_rate": 0.00048213572544867224,
"loss": 5.188,
"mean_token_accuracy": 0.17772355824708938,
"num_tokens": 29991846.0,
"step": 17285
},
{
"entropy": 5.5150475025177,
"epoch": 1.3452246644621668,
"grad_norm": 1.4921875,
"learning_rate": 0.00048212490095964213,
"loss": 5.1376,
"mean_token_accuracy": 0.1873519465327263,
"num_tokens": 29999784.0,
"step": 17290
},
{
"entropy": 5.4866142749786375,
"epoch": 1.3456136938338845,
"grad_norm": 1.53125,
"learning_rate": 0.0004821140733278212,
"loss": 5.2896,
"mean_token_accuracy": 0.1761855497956276,
"num_tokens": 30008139.0,
"step": 17295
},
{
"entropy": 5.485325193405151,
"epoch": 1.346002723205602,
"grad_norm": 1.7421875,
"learning_rate": 0.0004821032425533739,
"loss": 5.2889,
"mean_token_accuracy": 0.173797370493412,
"num_tokens": 30016891.0,
"step": 17300
},
{
"entropy": 5.498318719863891,
"epoch": 1.3463917525773197,
"grad_norm": 1.5,
"learning_rate": 0.0004820924086364646,
"loss": 5.2158,
"mean_token_accuracy": 0.17879442870616913,
"num_tokens": 30025472.0,
"step": 17305
},
{
"entropy": 5.560962200164795,
"epoch": 1.3467807819490372,
"grad_norm": 1.3203125,
"learning_rate": 0.00048208157157725756,
"loss": 5.242,
"mean_token_accuracy": 0.1773715242743492,
"num_tokens": 30034088.0,
"step": 17310
},
{
"entropy": 5.4021834373474125,
"epoch": 1.3471698113207546,
"grad_norm": 1.3671875,
"learning_rate": 0.00048207073137591726,
"loss": 5.1651,
"mean_token_accuracy": 0.17579952329397203,
"num_tokens": 30042651.0,
"step": 17315
},
{
"entropy": 5.476802730560303,
"epoch": 1.3475588406924723,
"grad_norm": 1.6484375,
"learning_rate": 0.00048205988803260824,
"loss": 5.1592,
"mean_token_accuracy": 0.18015269041061402,
"num_tokens": 30050898.0,
"step": 17320
},
{
"entropy": 5.5731285572052,
"epoch": 1.3479478700641898,
"grad_norm": 1.5,
"learning_rate": 0.00048204904154749496,
"loss": 5.3257,
"mean_token_accuracy": 0.17252847254276277,
"num_tokens": 30059357.0,
"step": 17325
},
{
"entropy": 5.5236536979675295,
"epoch": 1.3483368994359073,
"grad_norm": 1.3984375,
"learning_rate": 0.00048203819192074206,
"loss": 5.2636,
"mean_token_accuracy": 0.17482992708683015,
"num_tokens": 30068137.0,
"step": 17330
},
{
"entropy": 5.504386234283447,
"epoch": 1.348725928807625,
"grad_norm": 1.34375,
"learning_rate": 0.00048202733915251407,
"loss": 5.2934,
"mean_token_accuracy": 0.1741149455308914,
"num_tokens": 30077139.0,
"step": 17335
},
{
"entropy": 5.488800001144409,
"epoch": 1.3491149581793425,
"grad_norm": 1.40625,
"learning_rate": 0.00048201648324297573,
"loss": 5.2703,
"mean_token_accuracy": 0.18121775537729262,
"num_tokens": 30085267.0,
"step": 17340
},
{
"entropy": 5.456932640075683,
"epoch": 1.3495039875510602,
"grad_norm": 1.3125,
"learning_rate": 0.00048200562419229185,
"loss": 5.1912,
"mean_token_accuracy": 0.18366157859563828,
"num_tokens": 30093804.0,
"step": 17345
},
{
"entropy": 5.515213918685913,
"epoch": 1.3498930169227776,
"grad_norm": 1.3515625,
"learning_rate": 0.000481994762000627,
"loss": 5.1938,
"mean_token_accuracy": 0.1855141043663025,
"num_tokens": 30102653.0,
"step": 17350
},
{
"entropy": 5.377200746536255,
"epoch": 1.3502820462944953,
"grad_norm": 1.4375,
"learning_rate": 0.00048198389666814616,
"loss": 5.1497,
"mean_token_accuracy": 0.18063022047281266,
"num_tokens": 30111978.0,
"step": 17355
},
{
"entropy": 5.499823427200317,
"epoch": 1.3506710756662128,
"grad_norm": 1.453125,
"learning_rate": 0.00048197302819501416,
"loss": 5.3878,
"mean_token_accuracy": 0.1690291240811348,
"num_tokens": 30120387.0,
"step": 17360
},
{
"entropy": 5.521423768997193,
"epoch": 1.3510601050379303,
"grad_norm": 1.53125,
"learning_rate": 0.00048196215658139586,
"loss": 5.2473,
"mean_token_accuracy": 0.17864008396863937,
"num_tokens": 30129069.0,
"step": 17365
},
{
"entropy": 5.454082584381103,
"epoch": 1.351449134409648,
"grad_norm": 1.390625,
"learning_rate": 0.0004819512818274562,
"loss": 5.2013,
"mean_token_accuracy": 0.17336247563362123,
"num_tokens": 30138077.0,
"step": 17370
},
{
"entropy": 5.439135408401489,
"epoch": 1.3518381637813655,
"grad_norm": 1.3359375,
"learning_rate": 0.0004819404039333603,
"loss": 5.1774,
"mean_token_accuracy": 0.18369375318288803,
"num_tokens": 30146189.0,
"step": 17375
},
{
"entropy": 5.493515968322754,
"epoch": 1.352227193153083,
"grad_norm": 1.5390625,
"learning_rate": 0.0004819295228992731,
"loss": 5.2912,
"mean_token_accuracy": 0.17566606998443604,
"num_tokens": 30155664.0,
"step": 17380
},
{
"entropy": 5.484637355804443,
"epoch": 1.3526162225248006,
"grad_norm": 1.3984375,
"learning_rate": 0.00048191863872535984,
"loss": 5.2337,
"mean_token_accuracy": 0.1763281151652336,
"num_tokens": 30164701.0,
"step": 17385
},
{
"entropy": 5.4817366123199465,
"epoch": 1.3530052518965183,
"grad_norm": 1.484375,
"learning_rate": 0.0004819077514117855,
"loss": 5.285,
"mean_token_accuracy": 0.17144161462783813,
"num_tokens": 30173916.0,
"step": 17390
},
{
"entropy": 5.494414520263672,
"epoch": 1.3533942812682358,
"grad_norm": 1.3828125,
"learning_rate": 0.00048189686095871545,
"loss": 5.2052,
"mean_token_accuracy": 0.18014294356107713,
"num_tokens": 30182803.0,
"step": 17395
},
{
"entropy": 5.478781223297119,
"epoch": 1.3537833106399533,
"grad_norm": 1.671875,
"learning_rate": 0.00048188596736631475,
"loss": 5.2345,
"mean_token_accuracy": 0.18244491666555404,
"num_tokens": 30191589.0,
"step": 17400
},
{
"entropy": 5.483405447006225,
"epoch": 1.354172340011671,
"grad_norm": 1.4375,
"learning_rate": 0.00048187507063474885,
"loss": 5.3144,
"mean_token_accuracy": 0.1792867064476013,
"num_tokens": 30200170.0,
"step": 17405
},
{
"entropy": 5.525790166854859,
"epoch": 1.3545613693833884,
"grad_norm": 1.34375,
"learning_rate": 0.00048186417076418294,
"loss": 5.1992,
"mean_token_accuracy": 0.17972753942012787,
"num_tokens": 30208683.0,
"step": 17410
},
{
"entropy": 5.444584131240845,
"epoch": 1.354950398755106,
"grad_norm": 1.4765625,
"learning_rate": 0.00048185326775478256,
"loss": 5.2415,
"mean_token_accuracy": 0.1678399696946144,
"num_tokens": 30217141.0,
"step": 17415
},
{
"entropy": 5.477710342407226,
"epoch": 1.3553394281268236,
"grad_norm": 1.296875,
"learning_rate": 0.00048184236160671306,
"loss": 5.2487,
"mean_token_accuracy": 0.16956150084733962,
"num_tokens": 30226759.0,
"step": 17420
},
{
"entropy": 5.5595215320587155,
"epoch": 1.355728457498541,
"grad_norm": 1.640625,
"learning_rate": 0.00048183145232013995,
"loss": 5.3193,
"mean_token_accuracy": 0.17258228361606598,
"num_tokens": 30235945.0,
"step": 17425
},
{
"entropy": 5.559804248809814,
"epoch": 1.3561174868702586,
"grad_norm": 2.953125,
"learning_rate": 0.00048182053989522883,
"loss": 5.2788,
"mean_token_accuracy": 0.1710512787103653,
"num_tokens": 30244912.0,
"step": 17430
},
{
"entropy": 5.442434787750244,
"epoch": 1.3565065162419763,
"grad_norm": 1.34375,
"learning_rate": 0.00048180962433214515,
"loss": 5.219,
"mean_token_accuracy": 0.17777471393346786,
"num_tokens": 30253807.0,
"step": 17435
},
{
"entropy": 5.483846426010132,
"epoch": 1.356895545613694,
"grad_norm": 1.3203125,
"learning_rate": 0.00048179870563105453,
"loss": 5.3149,
"mean_token_accuracy": 0.1783726453781128,
"num_tokens": 30262380.0,
"step": 17440
},
{
"entropy": 5.596456384658813,
"epoch": 1.3572845749854114,
"grad_norm": 1.296875,
"learning_rate": 0.0004817877837921228,
"loss": 5.2502,
"mean_token_accuracy": 0.17519735395908356,
"num_tokens": 30271374.0,
"step": 17445
},
{
"entropy": 5.490361452102661,
"epoch": 1.357673604357129,
"grad_norm": 1.2890625,
"learning_rate": 0.0004817768588155155,
"loss": 5.2853,
"mean_token_accuracy": 0.17867863476276397,
"num_tokens": 30280037.0,
"step": 17450
},
{
"entropy": 5.367529296875,
"epoch": 1.3580626337288466,
"grad_norm": 1.734375,
"learning_rate": 0.00048176593070139865,
"loss": 5.0812,
"mean_token_accuracy": 0.19717075526714326,
"num_tokens": 30288335.0,
"step": 17455
},
{
"entropy": 5.400042009353638,
"epoch": 1.358451663100564,
"grad_norm": 1.34375,
"learning_rate": 0.00048175499944993767,
"loss": 5.2056,
"mean_token_accuracy": 0.17974575757980346,
"num_tokens": 30297109.0,
"step": 17460
},
{
"entropy": 5.534235048294067,
"epoch": 1.3588406924722816,
"grad_norm": 1.390625,
"learning_rate": 0.00048174406506129884,
"loss": 5.2034,
"mean_token_accuracy": 0.17888144999742508,
"num_tokens": 30305594.0,
"step": 17465
},
{
"entropy": 5.453529644012451,
"epoch": 1.3592297218439993,
"grad_norm": 1.390625,
"learning_rate": 0.00048173312753564787,
"loss": 5.1003,
"mean_token_accuracy": 0.19087499976158143,
"num_tokens": 30313106.0,
"step": 17470
},
{
"entropy": 5.464592456817627,
"epoch": 1.3596187512157167,
"grad_norm": 1.3046875,
"learning_rate": 0.0004817221868731506,
"loss": 5.337,
"mean_token_accuracy": 0.16995429545640944,
"num_tokens": 30322194.0,
"step": 17475
},
{
"entropy": 5.4159761428833,
"epoch": 1.3600077805874344,
"grad_norm": 1.59375,
"learning_rate": 0.00048171124307397334,
"loss": 5.1521,
"mean_token_accuracy": 0.1823340490460396,
"num_tokens": 30330247.0,
"step": 17480
},
{
"entropy": 5.499040699005127,
"epoch": 1.360396809959152,
"grad_norm": 1.453125,
"learning_rate": 0.0004817002961382819,
"loss": 5.2818,
"mean_token_accuracy": 0.17848298698663712,
"num_tokens": 30338738.0,
"step": 17485
},
{
"entropy": 5.4582672119140625,
"epoch": 1.3607858393308696,
"grad_norm": 1.3359375,
"learning_rate": 0.00048168934606624255,
"loss": 5.2446,
"mean_token_accuracy": 0.170152747631073,
"num_tokens": 30347729.0,
"step": 17490
},
{
"entropy": 5.505961894989014,
"epoch": 1.361174868702587,
"grad_norm": 1.4921875,
"learning_rate": 0.00048167839285802116,
"loss": 5.2381,
"mean_token_accuracy": 0.1757768601179123,
"num_tokens": 30356408.0,
"step": 17495
},
{
"entropy": 5.467833137512207,
"epoch": 1.3615638980743046,
"grad_norm": 1.515625,
"learning_rate": 0.0004816674365137843,
"loss": 5.1995,
"mean_token_accuracy": 0.17317010909318925,
"num_tokens": 30364910.0,
"step": 17500
},
{
"entropy": 5.454586219787598,
"epoch": 1.3619529274460223,
"grad_norm": 1.3203125,
"learning_rate": 0.000481656477033698,
"loss": 5.2365,
"mean_token_accuracy": 0.17724293023347854,
"num_tokens": 30373882.0,
"step": 17505
},
{
"entropy": 5.5559628963470455,
"epoch": 1.3623419568177397,
"grad_norm": 1.3046875,
"learning_rate": 0.0004816455144179286,
"loss": 5.2985,
"mean_token_accuracy": 0.16873742789030075,
"num_tokens": 30382884.0,
"step": 17510
},
{
"entropy": 5.489894390106201,
"epoch": 1.3627309861894572,
"grad_norm": 1.359375,
"learning_rate": 0.0004816345486666424,
"loss": 5.193,
"mean_token_accuracy": 0.18445000648498536,
"num_tokens": 30391798.0,
"step": 17515
},
{
"entropy": 5.481246471405029,
"epoch": 1.363120015561175,
"grad_norm": 1.4921875,
"learning_rate": 0.0004816235797800058,
"loss": 5.2011,
"mean_token_accuracy": 0.18085924685001373,
"num_tokens": 30400194.0,
"step": 17520
},
{
"entropy": 5.470969820022583,
"epoch": 1.3635090449328924,
"grad_norm": 1.4765625,
"learning_rate": 0.0004816126077581852,
"loss": 5.1296,
"mean_token_accuracy": 0.18465941548347473,
"num_tokens": 30408653.0,
"step": 17525
},
{
"entropy": 5.412633180618286,
"epoch": 1.36389807430461,
"grad_norm": 1.2734375,
"learning_rate": 0.00048160163260134724,
"loss": 5.2828,
"mean_token_accuracy": 0.17281537652015685,
"num_tokens": 30417467.0,
"step": 17530
},
{
"entropy": 5.4725724220275875,
"epoch": 1.3642871036763276,
"grad_norm": 1.7890625,
"learning_rate": 0.0004815906543096583,
"loss": 5.2383,
"mean_token_accuracy": 0.1726375177502632,
"num_tokens": 30425993.0,
"step": 17535
},
{
"entropy": 5.514776039123535,
"epoch": 1.3646761330480452,
"grad_norm": 1.359375,
"learning_rate": 0.000481579672883285,
"loss": 5.2226,
"mean_token_accuracy": 0.1777011290192604,
"num_tokens": 30434809.0,
"step": 17540
},
{
"entropy": 5.482051849365234,
"epoch": 1.3650651624197627,
"grad_norm": 1.375,
"learning_rate": 0.00048156868832239396,
"loss": 5.241,
"mean_token_accuracy": 0.17695044428110124,
"num_tokens": 30443536.0,
"step": 17545
},
{
"entropy": 5.411913108825684,
"epoch": 1.3654541917914802,
"grad_norm": 1.3515625,
"learning_rate": 0.0004815577006271519,
"loss": 5.2165,
"mean_token_accuracy": 0.17960001528263092,
"num_tokens": 30452163.0,
"step": 17550
},
{
"entropy": 5.430967807769775,
"epoch": 1.365843221163198,
"grad_norm": 1.3984375,
"learning_rate": 0.00048154670979772555,
"loss": 5.2089,
"mean_token_accuracy": 0.18010239452123641,
"num_tokens": 30461234.0,
"step": 17555
},
{
"entropy": 5.606772136688233,
"epoch": 1.3662322505349154,
"grad_norm": 1.2890625,
"learning_rate": 0.0004815357158342815,
"loss": 5.3664,
"mean_token_accuracy": 0.16491302996873855,
"num_tokens": 30470438.0,
"step": 17560
},
{
"entropy": 5.5209925174713135,
"epoch": 1.3666212799066328,
"grad_norm": 1.3125,
"learning_rate": 0.0004815247187369868,
"loss": 5.1846,
"mean_token_accuracy": 0.1815535008907318,
"num_tokens": 30479454.0,
"step": 17565
},
{
"entropy": 5.540090036392212,
"epoch": 1.3670103092783505,
"grad_norm": 1.546875,
"learning_rate": 0.00048151371850600814,
"loss": 5.2561,
"mean_token_accuracy": 0.17614753991365434,
"num_tokens": 30487968.0,
"step": 17570
},
{
"entropy": 5.475705623626709,
"epoch": 1.367399338650068,
"grad_norm": 1.3203125,
"learning_rate": 0.00048150271514151255,
"loss": 5.1847,
"mean_token_accuracy": 0.18580191135406493,
"num_tokens": 30495712.0,
"step": 17575
},
{
"entropy": 5.462652730941772,
"epoch": 1.3677883680217857,
"grad_norm": 1.2890625,
"learning_rate": 0.00048149170864366693,
"loss": 5.3035,
"mean_token_accuracy": 0.17307011485099794,
"num_tokens": 30505008.0,
"step": 17580
},
{
"entropy": 5.494186544418335,
"epoch": 1.3681773973935032,
"grad_norm": 1.2734375,
"learning_rate": 0.00048148069901263836,
"loss": 5.1908,
"mean_token_accuracy": 0.17936362624168395,
"num_tokens": 30514496.0,
"step": 17585
},
{
"entropy": 5.484045171737671,
"epoch": 1.368566426765221,
"grad_norm": 1.2890625,
"learning_rate": 0.00048146968624859375,
"loss": 5.1702,
"mean_token_accuracy": 0.1841189444065094,
"num_tokens": 30522942.0,
"step": 17590
},
{
"entropy": 5.5148717880249025,
"epoch": 1.3689554561369384,
"grad_norm": 1.3984375,
"learning_rate": 0.0004814586703517003,
"loss": 5.3464,
"mean_token_accuracy": 0.17623562812805177,
"num_tokens": 30532124.0,
"step": 17595
},
{
"entropy": 5.569475412368774,
"epoch": 1.3693444855086558,
"grad_norm": 1.515625,
"learning_rate": 0.0004814476513221251,
"loss": 5.4567,
"mean_token_accuracy": 0.16458929181098939,
"num_tokens": 30541063.0,
"step": 17600
},
{
"entropy": 5.572985982894897,
"epoch": 1.3697335148803735,
"grad_norm": 1.4453125,
"learning_rate": 0.00048143662916003545,
"loss": 5.1618,
"mean_token_accuracy": 0.17925930470228196,
"num_tokens": 30549062.0,
"step": 17605
},
{
"entropy": 5.532514953613282,
"epoch": 1.370122544252091,
"grad_norm": 1.375,
"learning_rate": 0.0004814256038655985,
"loss": 5.2603,
"mean_token_accuracy": 0.17622988671064377,
"num_tokens": 30557211.0,
"step": 17610
},
{
"entropy": 5.509684276580811,
"epoch": 1.3705115736238085,
"grad_norm": 1.40625,
"learning_rate": 0.0004814145754389816,
"loss": 5.3351,
"mean_token_accuracy": 0.17111367583274842,
"num_tokens": 30566603.0,
"step": 17615
},
{
"entropy": 5.4712201118469235,
"epoch": 1.3709006029955262,
"grad_norm": 1.8984375,
"learning_rate": 0.00048140354388035204,
"loss": 5.1889,
"mean_token_accuracy": 0.17791188061237334,
"num_tokens": 30574903.0,
"step": 17620
},
{
"entropy": 5.537505626678467,
"epoch": 1.3712896323672437,
"grad_norm": 1.28125,
"learning_rate": 0.0004813925091898772,
"loss": 5.3015,
"mean_token_accuracy": 0.1691759556531906,
"num_tokens": 30584925.0,
"step": 17625
},
{
"entropy": 5.548365736007691,
"epoch": 1.3716786617389614,
"grad_norm": 1.5,
"learning_rate": 0.0004813814713677246,
"loss": 5.344,
"mean_token_accuracy": 0.17372958064079286,
"num_tokens": 30593376.0,
"step": 17630
},
{
"entropy": 5.518748188018799,
"epoch": 1.3720676911106788,
"grad_norm": 1.2890625,
"learning_rate": 0.0004813704304140616,
"loss": 5.2584,
"mean_token_accuracy": 0.1792948365211487,
"num_tokens": 30602306.0,
"step": 17635
},
{
"entropy": 5.478524875640869,
"epoch": 1.3724567204823965,
"grad_norm": 1.21875,
"learning_rate": 0.0004813593863290559,
"loss": 5.1941,
"mean_token_accuracy": 0.1794302135705948,
"num_tokens": 30611340.0,
"step": 17640
},
{
"entropy": 5.51245002746582,
"epoch": 1.372845749854114,
"grad_norm": 1.546875,
"learning_rate": 0.0004813483391128748,
"loss": 5.28,
"mean_token_accuracy": 0.1792408272624016,
"num_tokens": 30619507.0,
"step": 17645
},
{
"entropy": 5.526970481872558,
"epoch": 1.3732347792258315,
"grad_norm": 1.4375,
"learning_rate": 0.0004813372887656862,
"loss": 5.3168,
"mean_token_accuracy": 0.17348881512880326,
"num_tokens": 30629897.0,
"step": 17650
},
{
"entropy": 5.536590242385865,
"epoch": 1.3736238085975492,
"grad_norm": 1.25,
"learning_rate": 0.0004813262352876576,
"loss": 5.229,
"mean_token_accuracy": 0.18029115349054337,
"num_tokens": 30638517.0,
"step": 17655
},
{
"entropy": 5.531946182250977,
"epoch": 1.3740128379692667,
"grad_norm": 1.296875,
"learning_rate": 0.00048131517867895684,
"loss": 5.2794,
"mean_token_accuracy": 0.18195407092571259,
"num_tokens": 30646816.0,
"step": 17660
},
{
"entropy": 5.4948890209198,
"epoch": 1.3744018673409841,
"grad_norm": 1.34375,
"learning_rate": 0.00048130411893975155,
"loss": 5.2457,
"mean_token_accuracy": 0.18316302299499512,
"num_tokens": 30655199.0,
"step": 17665
},
{
"entropy": 5.425690507888794,
"epoch": 1.3747908967127018,
"grad_norm": 1.5,
"learning_rate": 0.0004812930560702097,
"loss": 5.1159,
"mean_token_accuracy": 0.1851021647453308,
"num_tokens": 30663562.0,
"step": 17670
},
{
"entropy": 5.53632698059082,
"epoch": 1.3751799260844193,
"grad_norm": 1.2578125,
"learning_rate": 0.00048128199007049907,
"loss": 5.3114,
"mean_token_accuracy": 0.17654617577791215,
"num_tokens": 30672611.0,
"step": 17675
},
{
"entropy": 5.447826862335205,
"epoch": 1.375568955456137,
"grad_norm": 1.2734375,
"learning_rate": 0.00048127092094078756,
"loss": 5.1992,
"mean_token_accuracy": 0.18219852298498154,
"num_tokens": 30680766.0,
"step": 17680
},
{
"entropy": 5.427951335906982,
"epoch": 1.3759579848278545,
"grad_norm": 1.28125,
"learning_rate": 0.00048125984868124317,
"loss": 5.0699,
"mean_token_accuracy": 0.18820186108350753,
"num_tokens": 30689192.0,
"step": 17685
},
{
"entropy": 5.470542144775391,
"epoch": 1.3763470141995722,
"grad_norm": 1.3671875,
"learning_rate": 0.0004812487732920338,
"loss": 5.2128,
"mean_token_accuracy": 0.17582817524671554,
"num_tokens": 30697889.0,
"step": 17690
},
{
"entropy": 5.505899715423584,
"epoch": 1.3767360435712896,
"grad_norm": 1.375,
"learning_rate": 0.0004812376947733277,
"loss": 5.266,
"mean_token_accuracy": 0.17976069450378418,
"num_tokens": 30706285.0,
"step": 17695
},
{
"entropy": 5.479380941390991,
"epoch": 1.3771250729430071,
"grad_norm": 1.375,
"learning_rate": 0.00048122661312529263,
"loss": 5.2206,
"mean_token_accuracy": 0.17799070626497268,
"num_tokens": 30715159.0,
"step": 17700
},
{
"entropy": 5.4012833595275875,
"epoch": 1.3775141023147248,
"grad_norm": 1.1484375,
"learning_rate": 0.0004812155283480971,
"loss": 5.1174,
"mean_token_accuracy": 0.18203524351119996,
"num_tokens": 30723133.0,
"step": 17705
},
{
"entropy": 5.512424755096435,
"epoch": 1.3779031316864423,
"grad_norm": 1.3671875,
"learning_rate": 0.0004812044404419091,
"loss": 5.3152,
"mean_token_accuracy": 0.17294375002384185,
"num_tokens": 30732272.0,
"step": 17710
},
{
"entropy": 5.458614110946655,
"epoch": 1.3782921610581598,
"grad_norm": 1.7265625,
"learning_rate": 0.000481193349406897,
"loss": 5.154,
"mean_token_accuracy": 0.18055310994386672,
"num_tokens": 30740439.0,
"step": 17715
},
{
"entropy": 5.441726446151733,
"epoch": 1.3786811904298775,
"grad_norm": 1.2890625,
"learning_rate": 0.000481182255243229,
"loss": 5.2636,
"mean_token_accuracy": 0.1760513022542,
"num_tokens": 30749722.0,
"step": 17720
},
{
"entropy": 5.577563142776489,
"epoch": 1.379070219801595,
"grad_norm": 1.375,
"learning_rate": 0.00048117115795107335,
"loss": 5.4542,
"mean_token_accuracy": 0.16481081247329712,
"num_tokens": 30759261.0,
"step": 17725
},
{
"entropy": 5.608131790161133,
"epoch": 1.3794592491733126,
"grad_norm": 1.34375,
"learning_rate": 0.0004811600575305987,
"loss": 5.2747,
"mean_token_accuracy": 0.17702706158161163,
"num_tokens": 30769133.0,
"step": 17730
},
{
"entropy": 5.494538831710815,
"epoch": 1.3798482785450301,
"grad_norm": 1.3125,
"learning_rate": 0.0004811489539819731,
"loss": 5.2055,
"mean_token_accuracy": 0.1806598871946335,
"num_tokens": 30777879.0,
"step": 17735
},
{
"entropy": 5.485691118240356,
"epoch": 1.3802373079167478,
"grad_norm": 1.265625,
"learning_rate": 0.00048113784730536544,
"loss": 5.3133,
"mean_token_accuracy": 0.17931223809719085,
"num_tokens": 30786307.0,
"step": 17740
},
{
"entropy": 5.53962664604187,
"epoch": 1.3806263372884653,
"grad_norm": 1.3046875,
"learning_rate": 0.00048112673750094396,
"loss": 5.3271,
"mean_token_accuracy": 0.1764896109700203,
"num_tokens": 30796153.0,
"step": 17745
},
{
"entropy": 5.483430290222168,
"epoch": 1.3810153666601828,
"grad_norm": 1.296875,
"learning_rate": 0.0004811156245688773,
"loss": 5.0985,
"mean_token_accuracy": 0.18633727580308915,
"num_tokens": 30805441.0,
"step": 17750
},
{
"entropy": 5.4438379287719725,
"epoch": 1.3814043960319005,
"grad_norm": 1.1796875,
"learning_rate": 0.0004811045085093342,
"loss": 5.2645,
"mean_token_accuracy": 0.16739901751279831,
"num_tokens": 30814898.0,
"step": 17755
},
{
"entropy": 5.662993621826172,
"epoch": 1.381793425403618,
"grad_norm": 1.3671875,
"learning_rate": 0.0004810933893224831,
"loss": 5.4258,
"mean_token_accuracy": 0.16295039653778076,
"num_tokens": 30823995.0,
"step": 17760
},
{
"entropy": 5.533854389190674,
"epoch": 1.3821824547753354,
"grad_norm": 1.28125,
"learning_rate": 0.00048108226700849287,
"loss": 5.2686,
"mean_token_accuracy": 0.17513501942157744,
"num_tokens": 30832963.0,
"step": 17765
},
{
"entropy": 5.482215213775635,
"epoch": 1.382571484147053,
"grad_norm": 1.28125,
"learning_rate": 0.0004810711415675323,
"loss": 5.26,
"mean_token_accuracy": 0.1700100377202034,
"num_tokens": 30841559.0,
"step": 17770
},
{
"entropy": 5.530559396743774,
"epoch": 1.3829605135187706,
"grad_norm": 1.25,
"learning_rate": 0.0004810600129997702,
"loss": 5.3181,
"mean_token_accuracy": 0.17674199789762496,
"num_tokens": 30850481.0,
"step": 17775
},
{
"entropy": 5.534937524795533,
"epoch": 1.3833495428904883,
"grad_norm": 1.3203125,
"learning_rate": 0.00048104888130537534,
"loss": 5.1868,
"mean_token_accuracy": 0.1816599428653717,
"num_tokens": 30859632.0,
"step": 17780
},
{
"entropy": 5.526521062850952,
"epoch": 1.3837385722622058,
"grad_norm": 1.375,
"learning_rate": 0.00048103774648451664,
"loss": 5.238,
"mean_token_accuracy": 0.17586234211921692,
"num_tokens": 30867909.0,
"step": 17785
},
{
"entropy": 5.508820867538452,
"epoch": 1.3841276016339235,
"grad_norm": 1.375,
"learning_rate": 0.00048102660853736314,
"loss": 5.2469,
"mean_token_accuracy": 0.18207636922597886,
"num_tokens": 30876339.0,
"step": 17790
},
{
"entropy": 5.511918544769287,
"epoch": 1.384516631005641,
"grad_norm": 1.34375,
"learning_rate": 0.0004810154674640837,
"loss": 5.2338,
"mean_token_accuracy": 0.17675154507160187,
"num_tokens": 30884998.0,
"step": 17795
},
{
"entropy": 5.4847723007202145,
"epoch": 1.3849056603773584,
"grad_norm": 1.3984375,
"learning_rate": 0.00048100432326484744,
"loss": 5.2553,
"mean_token_accuracy": 0.1717436358332634,
"num_tokens": 30893554.0,
"step": 17800
},
{
"entropy": 5.454303789138794,
"epoch": 1.385294689749076,
"grad_norm": 1.4765625,
"learning_rate": 0.0004809931759398235,
"loss": 5.2959,
"mean_token_accuracy": 0.17158586531877518,
"num_tokens": 30901954.0,
"step": 17805
},
{
"entropy": 5.520076179504395,
"epoch": 1.3856837191207936,
"grad_norm": 1.328125,
"learning_rate": 0.00048098202548918094,
"loss": 5.219,
"mean_token_accuracy": 0.17881811559200286,
"num_tokens": 30911145.0,
"step": 17810
},
{
"entropy": 5.425348329544067,
"epoch": 1.386072748492511,
"grad_norm": 1.53125,
"learning_rate": 0.00048097087191308914,
"loss": 5.1145,
"mean_token_accuracy": 0.1815677285194397,
"num_tokens": 30918924.0,
"step": 17815
},
{
"entropy": 5.470867156982422,
"epoch": 1.3864617778642288,
"grad_norm": 1.3359375,
"learning_rate": 0.0004809597152117171,
"loss": 5.2895,
"mean_token_accuracy": 0.17505019158124924,
"num_tokens": 30927620.0,
"step": 17820
},
{
"entropy": 5.471066665649414,
"epoch": 1.3868508072359464,
"grad_norm": 1.34375,
"learning_rate": 0.0004809485553852342,
"loss": 5.1773,
"mean_token_accuracy": 0.17874298095703126,
"num_tokens": 30936140.0,
"step": 17825
},
{
"entropy": 5.559423589706421,
"epoch": 1.387239836607664,
"grad_norm": 1.3984375,
"learning_rate": 0.0004809373924338098,
"loss": 5.3627,
"mean_token_accuracy": 0.17417063117027282,
"num_tokens": 30944450.0,
"step": 17830
},
{
"entropy": 5.429990530014038,
"epoch": 1.3876288659793814,
"grad_norm": 1.2734375,
"learning_rate": 0.00048092622635761316,
"loss": 5.2012,
"mean_token_accuracy": 0.17550955712795258,
"num_tokens": 30953536.0,
"step": 17835
},
{
"entropy": 5.519266605377197,
"epoch": 1.388017895351099,
"grad_norm": 1.2890625,
"learning_rate": 0.00048091505715681395,
"loss": 5.2255,
"mean_token_accuracy": 0.17561615854501725,
"num_tokens": 30962556.0,
"step": 17840
},
{
"entropy": 5.408575391769409,
"epoch": 1.3884069247228166,
"grad_norm": 1.3671875,
"learning_rate": 0.0004809038848315814,
"loss": 5.1597,
"mean_token_accuracy": 0.18756389617919922,
"num_tokens": 30970476.0,
"step": 17845
},
{
"entropy": 5.489425420761108,
"epoch": 1.388795954094534,
"grad_norm": 1.3359375,
"learning_rate": 0.0004808927093820851,
"loss": 5.1937,
"mean_token_accuracy": 0.17492384910583497,
"num_tokens": 30978945.0,
"step": 17850
},
{
"entropy": 5.4314511775970455,
"epoch": 1.3891849834662517,
"grad_norm": 1.359375,
"learning_rate": 0.0004808815308084947,
"loss": 5.1721,
"mean_token_accuracy": 0.1748127207159996,
"num_tokens": 30988135.0,
"step": 17855
},
{
"entropy": 5.546903228759765,
"epoch": 1.3895740128379692,
"grad_norm": 1.34375,
"learning_rate": 0.0004808703491109798,
"loss": 5.2689,
"mean_token_accuracy": 0.17492063343524933,
"num_tokens": 30996408.0,
"step": 17860
},
{
"entropy": 5.449305486679077,
"epoch": 1.3899630422096867,
"grad_norm": 1.3359375,
"learning_rate": 0.0004808591642897099,
"loss": 5.2721,
"mean_token_accuracy": 0.1772267922759056,
"num_tokens": 31004156.0,
"step": 17865
},
{
"entropy": 5.4502420902252195,
"epoch": 1.3903520715814044,
"grad_norm": 1.3671875,
"learning_rate": 0.000480847976344855,
"loss": 5.2074,
"mean_token_accuracy": 0.1809771478176117,
"num_tokens": 31013518.0,
"step": 17870
},
{
"entropy": 5.435634279251099,
"epoch": 1.390741100953122,
"grad_norm": 1.6171875,
"learning_rate": 0.00048083678527658465,
"loss": 5.0981,
"mean_token_accuracy": 0.18312658816576005,
"num_tokens": 31022116.0,
"step": 17875
},
{
"entropy": 5.47791109085083,
"epoch": 1.3911301303248396,
"grad_norm": 1.3984375,
"learning_rate": 0.0004808255910850687,
"loss": 5.2557,
"mean_token_accuracy": 0.18032569885253907,
"num_tokens": 31030320.0,
"step": 17880
},
{
"entropy": 5.494035959243774,
"epoch": 1.391519159696557,
"grad_norm": 1.3359375,
"learning_rate": 0.0004808143937704769,
"loss": 5.2276,
"mean_token_accuracy": 0.1806335911154747,
"num_tokens": 31038410.0,
"step": 17885
},
{
"entropy": 5.414658451080323,
"epoch": 1.3919081890682747,
"grad_norm": 1.359375,
"learning_rate": 0.00048080319333297937,
"loss": 5.1695,
"mean_token_accuracy": 0.1831390842795372,
"num_tokens": 31047719.0,
"step": 17890
},
{
"entropy": 5.448948526382447,
"epoch": 1.3922972184399922,
"grad_norm": 1.4140625,
"learning_rate": 0.00048079198977274597,
"loss": 5.2661,
"mean_token_accuracy": 0.1796051248908043,
"num_tokens": 31057536.0,
"step": 17895
},
{
"entropy": 5.554400777816772,
"epoch": 1.3926862478117097,
"grad_norm": 1.421875,
"learning_rate": 0.00048078078308994666,
"loss": 5.2474,
"mean_token_accuracy": 0.1825242221355438,
"num_tokens": 31066975.0,
"step": 17900
},
{
"entropy": 5.478024673461914,
"epoch": 1.3930752771834274,
"grad_norm": 1.53125,
"learning_rate": 0.0004807695732847515,
"loss": 5.214,
"mean_token_accuracy": 0.18381236344575883,
"num_tokens": 31075573.0,
"step": 17905
},
{
"entropy": 5.398452615737915,
"epoch": 1.3934643065551449,
"grad_norm": 1.359375,
"learning_rate": 0.00048075836035733053,
"loss": 5.1577,
"mean_token_accuracy": 0.18735102713108062,
"num_tokens": 31084486.0,
"step": 17910
},
{
"entropy": 5.42413363456726,
"epoch": 1.3938533359268626,
"grad_norm": 1.3046875,
"learning_rate": 0.000480747144307854,
"loss": 5.1813,
"mean_token_accuracy": 0.1842433750629425,
"num_tokens": 31093045.0,
"step": 17915
},
{
"entropy": 5.465947866439819,
"epoch": 1.39424236529858,
"grad_norm": 1.3984375,
"learning_rate": 0.00048073592513649203,
"loss": 5.2375,
"mean_token_accuracy": 0.18174562007188796,
"num_tokens": 31102024.0,
"step": 17920
},
{
"entropy": 5.4516518115997314,
"epoch": 1.3946313946702977,
"grad_norm": 1.328125,
"learning_rate": 0.0004807247028434148,
"loss": 5.3028,
"mean_token_accuracy": 0.17244891673326493,
"num_tokens": 31110656.0,
"step": 17925
},
{
"entropy": 5.487002515792847,
"epoch": 1.3950204240420152,
"grad_norm": 1.3828125,
"learning_rate": 0.0004807134774287927,
"loss": 5.1894,
"mean_token_accuracy": 0.1856229692697525,
"num_tokens": 31119199.0,
"step": 17930
},
{
"entropy": 5.433686685562134,
"epoch": 1.3954094534137327,
"grad_norm": 1.3359375,
"learning_rate": 0.00048070224889279603,
"loss": 5.1808,
"mean_token_accuracy": 0.18199242800474166,
"num_tokens": 31127301.0,
"step": 17935
},
{
"entropy": 5.4784486293792725,
"epoch": 1.3957984827854504,
"grad_norm": 1.390625,
"learning_rate": 0.00048069101723559505,
"loss": 5.274,
"mean_token_accuracy": 0.1810097336769104,
"num_tokens": 31136714.0,
"step": 17940
},
{
"entropy": 5.52238392829895,
"epoch": 1.3961875121571679,
"grad_norm": 2.34375,
"learning_rate": 0.0004806797824573603,
"loss": 5.2422,
"mean_token_accuracy": 0.17201750725507736,
"num_tokens": 31145663.0,
"step": 17945
},
{
"entropy": 5.402653646469116,
"epoch": 1.3965765415288853,
"grad_norm": 1.3203125,
"learning_rate": 0.0004806685445582624,
"loss": 4.995,
"mean_token_accuracy": 0.19295692145824433,
"num_tokens": 31154335.0,
"step": 17950
},
{
"entropy": 5.384617185592651,
"epoch": 1.396965570900603,
"grad_norm": 1.6328125,
"learning_rate": 0.00048065730353847143,
"loss": 5.2282,
"mean_token_accuracy": 0.18029399514198302,
"num_tokens": 31163683.0,
"step": 17955
},
{
"entropy": 5.453492116928101,
"epoch": 1.3973546002723205,
"grad_norm": 1.4140625,
"learning_rate": 0.00048064605939815837,
"loss": 5.2972,
"mean_token_accuracy": 0.17821234315633774,
"num_tokens": 31172361.0,
"step": 17960
},
{
"entropy": 5.503365898132325,
"epoch": 1.3977436296440382,
"grad_norm": 1.40625,
"learning_rate": 0.0004806348121374936,
"loss": 5.1418,
"mean_token_accuracy": 0.18665060997009278,
"num_tokens": 31180572.0,
"step": 17965
},
{
"entropy": 5.399412393569946,
"epoch": 1.3981326590157557,
"grad_norm": 1.3046875,
"learning_rate": 0.0004806235617566479,
"loss": 5.1509,
"mean_token_accuracy": 0.18249404430389404,
"num_tokens": 31188751.0,
"step": 17970
},
{
"entropy": 5.514432764053344,
"epoch": 1.3985216883874734,
"grad_norm": 1.4296875,
"learning_rate": 0.000480612308255792,
"loss": 5.3559,
"mean_token_accuracy": 0.16781715154647828,
"num_tokens": 31197762.0,
"step": 17975
},
{
"entropy": 5.55035433769226,
"epoch": 1.3989107177591908,
"grad_norm": 1.5234375,
"learning_rate": 0.00048060105163509647,
"loss": 5.2554,
"mean_token_accuracy": 0.17506884336471557,
"num_tokens": 31207203.0,
"step": 17980
},
{
"entropy": 5.530920314788818,
"epoch": 1.3992997471309083,
"grad_norm": 1.328125,
"learning_rate": 0.0004805897918947323,
"loss": 5.2581,
"mean_token_accuracy": 0.17933039367198944,
"num_tokens": 31215711.0,
"step": 17985
},
{
"entropy": 5.461055040359497,
"epoch": 1.399688776502626,
"grad_norm": 1.34375,
"learning_rate": 0.0004805785290348702,
"loss": 5.1835,
"mean_token_accuracy": 0.18045685142278672,
"num_tokens": 31224564.0,
"step": 17990
},
{
"entropy": 5.410236406326294,
"epoch": 1.4000778058743435,
"grad_norm": 1.3828125,
"learning_rate": 0.00048056726305568124,
"loss": 5.1798,
"mean_token_accuracy": 0.17926315367221832,
"num_tokens": 31233252.0,
"step": 17995
},
{
"entropy": 5.4720165729522705,
"epoch": 1.400466835246061,
"grad_norm": 1.515625,
"learning_rate": 0.00048055599395733617,
"loss": 5.2631,
"mean_token_accuracy": 0.18022310584783555,
"num_tokens": 31242539.0,
"step": 18000
},
{
"epoch": 1.400466835246061,
"eval_entropy": 5.350850989201301,
"eval_loss": 5.329644680023193,
"eval_mean_token_accuracy": 0.18264124202358253,
"eval_num_tokens": 31242539.0,
"eval_runtime": 28.4214,
"eval_samples_per_second": 1462.207,
"eval_steps_per_second": 182.785,
"step": 18000
},
{
"entropy": 5.5263731479644775,
"epoch": 1.4008558646177787,
"grad_norm": 1.28125,
"learning_rate": 0.00048054472174000615,
"loss": 5.2491,
"mean_token_accuracy": 0.1797153353691101,
"num_tokens": 31250770.0,
"step": 18005
},
{
"entropy": 5.442011404037475,
"epoch": 1.4012448939894961,
"grad_norm": 1.4609375,
"learning_rate": 0.00048053344640386207,
"loss": 5.1811,
"mean_token_accuracy": 0.19132875949144362,
"num_tokens": 31259507.0,
"step": 18010
},
{
"entropy": 5.428150177001953,
"epoch": 1.4016339233612138,
"grad_norm": 1.34375,
"learning_rate": 0.00048052216794907505,
"loss": 5.2792,
"mean_token_accuracy": 0.17548789978027343,
"num_tokens": 31268106.0,
"step": 18015
},
{
"entropy": 5.411325979232788,
"epoch": 1.4020229527329313,
"grad_norm": 1.2578125,
"learning_rate": 0.00048051088637581624,
"loss": 5.1757,
"mean_token_accuracy": 0.18286990523338317,
"num_tokens": 31276495.0,
"step": 18020
},
{
"entropy": 5.5340807914733885,
"epoch": 1.402411982104649,
"grad_norm": 1.265625,
"learning_rate": 0.000480499601684257,
"loss": 5.2669,
"mean_token_accuracy": 0.1725315347313881,
"num_tokens": 31284962.0,
"step": 18025
},
{
"entropy": 5.524370765686035,
"epoch": 1.4028010114763665,
"grad_norm": 1.5078125,
"learning_rate": 0.0004804883138745682,
"loss": 5.3105,
"mean_token_accuracy": 0.16837209612131118,
"num_tokens": 31294497.0,
"step": 18030
},
{
"entropy": 5.459423494338989,
"epoch": 1.403190040848084,
"grad_norm": 1.5,
"learning_rate": 0.0004804770229469214,
"loss": 5.2081,
"mean_token_accuracy": 0.18599114418029786,
"num_tokens": 31302607.0,
"step": 18035
},
{
"entropy": 5.572231721878052,
"epoch": 1.4035790702198017,
"grad_norm": 1.5,
"learning_rate": 0.0004804657289014878,
"loss": 5.2849,
"mean_token_accuracy": 0.18076523244380951,
"num_tokens": 31311989.0,
"step": 18040
},
{
"entropy": 5.5667151927948,
"epoch": 1.4039680995915191,
"grad_norm": 1.34375,
"learning_rate": 0.00048045443173843884,
"loss": 5.1935,
"mean_token_accuracy": 0.18314482867717743,
"num_tokens": 31320681.0,
"step": 18045
},
{
"entropy": 5.461316013336182,
"epoch": 1.4043571289632366,
"grad_norm": 1.4453125,
"learning_rate": 0.00048044313145794587,
"loss": 5.2217,
"mean_token_accuracy": 0.17935324758291243,
"num_tokens": 31328985.0,
"step": 18050
},
{
"entropy": 5.441216897964478,
"epoch": 1.4047461583349543,
"grad_norm": 1.796875,
"learning_rate": 0.00048043182806018034,
"loss": 5.168,
"mean_token_accuracy": 0.17946912050247193,
"num_tokens": 31337486.0,
"step": 18055
},
{
"entropy": 5.513202476501465,
"epoch": 1.4051351877066718,
"grad_norm": 1.2890625,
"learning_rate": 0.00048042052154531384,
"loss": 5.2895,
"mean_token_accuracy": 0.18216563761234283,
"num_tokens": 31345831.0,
"step": 18060
},
{
"entropy": 5.444756031036377,
"epoch": 1.4055242170783895,
"grad_norm": 1.328125,
"learning_rate": 0.0004804092119135179,
"loss": 5.1829,
"mean_token_accuracy": 0.18152471631765366,
"num_tokens": 31354791.0,
"step": 18065
},
{
"entropy": 5.4355779647827145,
"epoch": 1.405913246450107,
"grad_norm": 1.59375,
"learning_rate": 0.0004803978991649641,
"loss": 5.1455,
"mean_token_accuracy": 0.18362685292959213,
"num_tokens": 31362652.0,
"step": 18070
},
{
"entropy": 5.447424030303955,
"epoch": 1.4063022758218247,
"grad_norm": 1.4375,
"learning_rate": 0.00048038658329982404,
"loss": 5.2166,
"mean_token_accuracy": 0.18235095143318175,
"num_tokens": 31371439.0,
"step": 18075
},
{
"entropy": 5.505274057388306,
"epoch": 1.4066913051935421,
"grad_norm": 1.21875,
"learning_rate": 0.0004803752643182695,
"loss": 5.2453,
"mean_token_accuracy": 0.17296168357133865,
"num_tokens": 31380039.0,
"step": 18080
},
{
"entropy": 5.495355939865112,
"epoch": 1.4070803345652596,
"grad_norm": 1.3828125,
"learning_rate": 0.0004803639422204723,
"loss": 5.3636,
"mean_token_accuracy": 0.16720153838396073,
"num_tokens": 31389318.0,
"step": 18085
},
{
"entropy": 5.506799221038818,
"epoch": 1.4074693639369773,
"grad_norm": 1.3515625,
"learning_rate": 0.0004803526170066041,
"loss": 5.2271,
"mean_token_accuracy": 0.1766585811972618,
"num_tokens": 31398442.0,
"step": 18090
},
{
"entropy": 5.4893897533416744,
"epoch": 1.4078583933086948,
"grad_norm": 1.265625,
"learning_rate": 0.00048034128867683674,
"loss": 5.2249,
"mean_token_accuracy": 0.1818626493215561,
"num_tokens": 31406566.0,
"step": 18095
},
{
"entropy": 5.455459213256836,
"epoch": 1.4082474226804123,
"grad_norm": 1.4609375,
"learning_rate": 0.0004803299572313422,
"loss": 5.286,
"mean_token_accuracy": 0.17086722552776337,
"num_tokens": 31415207.0,
"step": 18100
},
{
"entropy": 5.6051431655883786,
"epoch": 1.40863645205213,
"grad_norm": 1.390625,
"learning_rate": 0.0004803186226702924,
"loss": 5.2975,
"mean_token_accuracy": 0.16654933542013167,
"num_tokens": 31424175.0,
"step": 18105
},
{
"entropy": 5.583214330673218,
"epoch": 1.4090254814238474,
"grad_norm": 1.375,
"learning_rate": 0.0004803072849938592,
"loss": 5.3164,
"mean_token_accuracy": 0.16744719296693802,
"num_tokens": 31434022.0,
"step": 18110
},
{
"entropy": 5.514408349990845,
"epoch": 1.4094145107955651,
"grad_norm": 1.3671875,
"learning_rate": 0.0004802959442022149,
"loss": 5.1879,
"mean_token_accuracy": 0.1815322920680046,
"num_tokens": 31442838.0,
"step": 18115
},
{
"entropy": 5.438424921035766,
"epoch": 1.4098035401672826,
"grad_norm": 1.3359375,
"learning_rate": 0.00048028460029553126,
"loss": 5.1658,
"mean_token_accuracy": 0.17856270968914031,
"num_tokens": 31451482.0,
"step": 18120
},
{
"entropy": 5.453842449188232,
"epoch": 1.4101925695390003,
"grad_norm": 1.421875,
"learning_rate": 0.00048027325327398065,
"loss": 5.2327,
"mean_token_accuracy": 0.17675680965185164,
"num_tokens": 31460234.0,
"step": 18125
},
{
"entropy": 5.466915607452393,
"epoch": 1.4105815989107178,
"grad_norm": 1.3984375,
"learning_rate": 0.0004802619031377351,
"loss": 5.1987,
"mean_token_accuracy": 0.1833869308233261,
"num_tokens": 31470466.0,
"step": 18130
},
{
"entropy": 5.472537803649902,
"epoch": 1.4109706282824352,
"grad_norm": 1.4375,
"learning_rate": 0.00048025054988696684,
"loss": 5.3072,
"mean_token_accuracy": 0.17066388875246047,
"num_tokens": 31480901.0,
"step": 18135
},
{
"entropy": 5.497697114944458,
"epoch": 1.411359657654153,
"grad_norm": 1.296875,
"learning_rate": 0.00048023919352184827,
"loss": 5.2109,
"mean_token_accuracy": 0.17782883942127228,
"num_tokens": 31490329.0,
"step": 18140
},
{
"entropy": 5.466535997390747,
"epoch": 1.4117486870258704,
"grad_norm": 1.3203125,
"learning_rate": 0.00048022783404255156,
"loss": 5.239,
"mean_token_accuracy": 0.1762927070260048,
"num_tokens": 31499519.0,
"step": 18145
},
{
"entropy": 5.462879085540772,
"epoch": 1.412137716397588,
"grad_norm": 1.484375,
"learning_rate": 0.0004802164714492491,
"loss": 5.2882,
"mean_token_accuracy": 0.1755024805665016,
"num_tokens": 31507899.0,
"step": 18150
},
{
"entropy": 5.57371072769165,
"epoch": 1.4125267457693056,
"grad_norm": 1.4609375,
"learning_rate": 0.00048020510574211335,
"loss": 5.4357,
"mean_token_accuracy": 0.16321652978658677,
"num_tokens": 31517861.0,
"step": 18155
},
{
"entropy": 5.576320171356201,
"epoch": 1.412915775141023,
"grad_norm": 1.5546875,
"learning_rate": 0.00048019373692131674,
"loss": 5.3164,
"mean_token_accuracy": 0.1713208481669426,
"num_tokens": 31527273.0,
"step": 18160
},
{
"entropy": 5.521735191345215,
"epoch": 1.4133048045127408,
"grad_norm": 1.578125,
"learning_rate": 0.00048018236498703176,
"loss": 5.2374,
"mean_token_accuracy": 0.17349209934473037,
"num_tokens": 31536221.0,
"step": 18165
},
{
"entropy": 5.45868558883667,
"epoch": 1.4136938338844582,
"grad_norm": 1.421875,
"learning_rate": 0.00048017098993943097,
"loss": 5.1764,
"mean_token_accuracy": 0.18448155373334885,
"num_tokens": 31544329.0,
"step": 18170
},
{
"entropy": 5.553943681716919,
"epoch": 1.414082863256176,
"grad_norm": 1.4140625,
"learning_rate": 0.000480159611778687,
"loss": 5.2706,
"mean_token_accuracy": 0.17889992147684097,
"num_tokens": 31552323.0,
"step": 18175
},
{
"entropy": 5.501322507858276,
"epoch": 1.4144718926278934,
"grad_norm": 1.359375,
"learning_rate": 0.00048014823050497243,
"loss": 5.2225,
"mean_token_accuracy": 0.1761839672923088,
"num_tokens": 31560432.0,
"step": 18180
},
{
"entropy": 5.388775587081909,
"epoch": 1.4148609219996109,
"grad_norm": 1.4765625,
"learning_rate": 0.00048013684611846,
"loss": 5.1894,
"mean_token_accuracy": 0.18051880449056626,
"num_tokens": 31569294.0,
"step": 18185
},
{
"entropy": 5.468929195404053,
"epoch": 1.4152499513713286,
"grad_norm": 1.4296875,
"learning_rate": 0.00048012545861932245,
"loss": 5.2144,
"mean_token_accuracy": 0.17976803928613663,
"num_tokens": 31577860.0,
"step": 18190
},
{
"entropy": 5.471890115737915,
"epoch": 1.415638980743046,
"grad_norm": 1.40625,
"learning_rate": 0.0004801140680077325,
"loss": 5.1432,
"mean_token_accuracy": 0.18126462996006013,
"num_tokens": 31586034.0,
"step": 18195
},
{
"entropy": 5.419580793380737,
"epoch": 1.4160280101147635,
"grad_norm": 1.390625,
"learning_rate": 0.0004801026742838631,
"loss": 5.2013,
"mean_token_accuracy": 0.17756079733371735,
"num_tokens": 31594911.0,
"step": 18200
},
{
"entropy": 5.498726892471313,
"epoch": 1.4164170394864812,
"grad_norm": 1.3671875,
"learning_rate": 0.0004800912774478871,
"loss": 5.279,
"mean_token_accuracy": 0.17289074808359145,
"num_tokens": 31603477.0,
"step": 18205
},
{
"entropy": 5.594529008865356,
"epoch": 1.416806068858199,
"grad_norm": 1.3671875,
"learning_rate": 0.0004800798774999773,
"loss": 5.2746,
"mean_token_accuracy": 0.1770025908946991,
"num_tokens": 31612288.0,
"step": 18210
},
{
"entropy": 5.5031050682067875,
"epoch": 1.4171950982299164,
"grad_norm": 1.296875,
"learning_rate": 0.00048006847444030686,
"loss": 5.1737,
"mean_token_accuracy": 0.18476022481918336,
"num_tokens": 31621580.0,
"step": 18215
},
{
"entropy": 5.40883584022522,
"epoch": 1.4175841276016339,
"grad_norm": 1.296875,
"learning_rate": 0.0004800570682690487,
"loss": 5.1892,
"mean_token_accuracy": 0.17169617861509323,
"num_tokens": 31629860.0,
"step": 18220
},
{
"entropy": 5.516142177581787,
"epoch": 1.4179731569733516,
"grad_norm": 1.34375,
"learning_rate": 0.0004800456589863759,
"loss": 5.2592,
"mean_token_accuracy": 0.1711919814348221,
"num_tokens": 31639012.0,
"step": 18225
},
{
"entropy": 5.4786614894866945,
"epoch": 1.418362186345069,
"grad_norm": 1.296875,
"learning_rate": 0.0004800342465924616,
"loss": 5.2831,
"mean_token_accuracy": 0.17760680317878724,
"num_tokens": 31648675.0,
"step": 18230
},
{
"entropy": 5.49333930015564,
"epoch": 1.4187512157167865,
"grad_norm": 1.359375,
"learning_rate": 0.000480022831087479,
"loss": 5.2114,
"mean_token_accuracy": 0.18882330507040024,
"num_tokens": 31656570.0,
"step": 18235
},
{
"entropy": 5.417568731307983,
"epoch": 1.4191402450885042,
"grad_norm": 1.2890625,
"learning_rate": 0.0004800114124716012,
"loss": 5.1774,
"mean_token_accuracy": 0.17982569187879563,
"num_tokens": 31665636.0,
"step": 18240
},
{
"entropy": 5.537606811523437,
"epoch": 1.4195292744602217,
"grad_norm": 1.3515625,
"learning_rate": 0.0004799999907450015,
"loss": 5.2892,
"mean_token_accuracy": 0.17782238572835923,
"num_tokens": 31673638.0,
"step": 18245
},
{
"entropy": 5.521145963668824,
"epoch": 1.4199183038319392,
"grad_norm": 1.5546875,
"learning_rate": 0.0004799885659078533,
"loss": 5.2546,
"mean_token_accuracy": 0.1782358855009079,
"num_tokens": 31681886.0,
"step": 18250
},
{
"entropy": 5.58081955909729,
"epoch": 1.4203073332036569,
"grad_norm": 1.5234375,
"learning_rate": 0.0004799771379603299,
"loss": 5.3971,
"mean_token_accuracy": 0.17115249037742614,
"num_tokens": 31690349.0,
"step": 18255
},
{
"entropy": 5.454118156433106,
"epoch": 1.4206963625753746,
"grad_norm": 1.359375,
"learning_rate": 0.0004799657069026046,
"loss": 5.2351,
"mean_token_accuracy": 0.17414960265159607,
"num_tokens": 31699183.0,
"step": 18260
},
{
"entropy": 5.479208517074585,
"epoch": 1.421085391947092,
"grad_norm": 1.4140625,
"learning_rate": 0.00047995427273485097,
"loss": 5.2241,
"mean_token_accuracy": 0.18138944804668428,
"num_tokens": 31707759.0,
"step": 18265
},
{
"entropy": 5.59560751914978,
"epoch": 1.4214744213188095,
"grad_norm": 1.4296875,
"learning_rate": 0.00047994283545724247,
"loss": 5.3637,
"mean_token_accuracy": 0.16737689077854156,
"num_tokens": 31716383.0,
"step": 18270
},
{
"entropy": 5.518065786361694,
"epoch": 1.4218634506905272,
"grad_norm": 1.609375,
"learning_rate": 0.00047993139506995273,
"loss": 5.2528,
"mean_token_accuracy": 0.17404465079307557,
"num_tokens": 31724617.0,
"step": 18275
},
{
"entropy": 5.464353322982788,
"epoch": 1.4222524800622447,
"grad_norm": 1.484375,
"learning_rate": 0.0004799199515731551,
"loss": 5.19,
"mean_token_accuracy": 0.18391357064247132,
"num_tokens": 31732027.0,
"step": 18280
},
{
"entropy": 5.381789064407348,
"epoch": 1.4226415094339622,
"grad_norm": 1.296875,
"learning_rate": 0.00047990850496702346,
"loss": 5.1561,
"mean_token_accuracy": 0.18425126373767853,
"num_tokens": 31740707.0,
"step": 18285
},
{
"entropy": 5.44275016784668,
"epoch": 1.4230305388056799,
"grad_norm": 1.28125,
"learning_rate": 0.0004798970552517314,
"loss": 5.1848,
"mean_token_accuracy": 0.1795347288250923,
"num_tokens": 31748864.0,
"step": 18290
},
{
"entropy": 5.569283866882325,
"epoch": 1.4234195681773973,
"grad_norm": 1.2109375,
"learning_rate": 0.00047988560242745264,
"loss": 5.3908,
"mean_token_accuracy": 0.16576953679323198,
"num_tokens": 31758356.0,
"step": 18295
},
{
"entropy": 5.548240089416504,
"epoch": 1.423808597549115,
"grad_norm": 1.484375,
"learning_rate": 0.000479874146494361,
"loss": 5.2434,
"mean_token_accuracy": 0.18585043996572495,
"num_tokens": 31766911.0,
"step": 18300
},
{
"entropy": 5.523188591003418,
"epoch": 1.4241976269208325,
"grad_norm": 1.359375,
"learning_rate": 0.0004798626874526302,
"loss": 5.2271,
"mean_token_accuracy": 0.1728651523590088,
"num_tokens": 31775551.0,
"step": 18305
},
{
"entropy": 5.508284044265747,
"epoch": 1.4245866562925502,
"grad_norm": 1.3515625,
"learning_rate": 0.00047985122530243426,
"loss": 5.3802,
"mean_token_accuracy": 0.1662404179573059,
"num_tokens": 31784064.0,
"step": 18310
},
{
"entropy": 5.600048637390136,
"epoch": 1.4249756856642677,
"grad_norm": 1.3359375,
"learning_rate": 0.000479839760043947,
"loss": 5.2718,
"mean_token_accuracy": 0.17287858277559282,
"num_tokens": 31792574.0,
"step": 18315
},
{
"entropy": 5.480391311645508,
"epoch": 1.4253647150359852,
"grad_norm": 1.890625,
"learning_rate": 0.00047982829167734245,
"loss": 5.0886,
"mean_token_accuracy": 0.18848509192466736,
"num_tokens": 31800331.0,
"step": 18320
},
{
"entropy": 5.402872228622437,
"epoch": 1.4257537444077029,
"grad_norm": 1.3984375,
"learning_rate": 0.00047981682020279456,
"loss": 5.1853,
"mean_token_accuracy": 0.17700561583042146,
"num_tokens": 31808474.0,
"step": 18325
},
{
"entropy": 5.536686372756958,
"epoch": 1.4261427737794203,
"grad_norm": 1.375,
"learning_rate": 0.0004798053456204775,
"loss": 5.2786,
"mean_token_accuracy": 0.17116958051919937,
"num_tokens": 31817026.0,
"step": 18330
},
{
"entropy": 5.441331386566162,
"epoch": 1.4265318031511378,
"grad_norm": 1.3515625,
"learning_rate": 0.0004797938679305651,
"loss": 5.1215,
"mean_token_accuracy": 0.17952772229909897,
"num_tokens": 31825096.0,
"step": 18335
},
{
"entropy": 5.44946026802063,
"epoch": 1.4269208325228555,
"grad_norm": 1.1953125,
"learning_rate": 0.00047978238713323193,
"loss": 5.2624,
"mean_token_accuracy": 0.17737486958503723,
"num_tokens": 31833650.0,
"step": 18340
},
{
"entropy": 5.4915625095367435,
"epoch": 1.427309861894573,
"grad_norm": 1.359375,
"learning_rate": 0.00047977090322865183,
"loss": 5.1914,
"mean_token_accuracy": 0.1824164569377899,
"num_tokens": 31841803.0,
"step": 18345
},
{
"entropy": 5.543830823898316,
"epoch": 1.4276988912662907,
"grad_norm": 1.5546875,
"learning_rate": 0.0004797594162169993,
"loss": 5.2558,
"mean_token_accuracy": 0.17973877489566803,
"num_tokens": 31850121.0,
"step": 18350
},
{
"entropy": 5.4819482326507565,
"epoch": 1.4280879206380082,
"grad_norm": 1.4140625,
"learning_rate": 0.0004797479260984485,
"loss": 5.2168,
"mean_token_accuracy": 0.1790147453546524,
"num_tokens": 31858585.0,
"step": 18355
},
{
"entropy": 5.429919910430908,
"epoch": 1.4284769500097259,
"grad_norm": 1.375,
"learning_rate": 0.00047973643287317386,
"loss": 5.2035,
"mean_token_accuracy": 0.17699279338121415,
"num_tokens": 31866199.0,
"step": 18360
},
{
"entropy": 5.46229739189148,
"epoch": 1.4288659793814433,
"grad_norm": 1.3046875,
"learning_rate": 0.00047972493654134963,
"loss": 5.2324,
"mean_token_accuracy": 0.17713208198547364,
"num_tokens": 31875423.0,
"step": 18365
},
{
"entropy": 5.460847282409668,
"epoch": 1.4292550087531608,
"grad_norm": 1.4765625,
"learning_rate": 0.00047971343710315043,
"loss": 5.0972,
"mean_token_accuracy": 0.18757133483886718,
"num_tokens": 31883110.0,
"step": 18370
},
{
"entropy": 5.427517366409302,
"epoch": 1.4296440381248785,
"grad_norm": 1.2578125,
"learning_rate": 0.0004797019345587506,
"loss": 5.2325,
"mean_token_accuracy": 0.17970472127199172,
"num_tokens": 31891588.0,
"step": 18375
},
{
"entropy": 5.420027256011963,
"epoch": 1.430033067496596,
"grad_norm": 1.28125,
"learning_rate": 0.0004796904289083248,
"loss": 5.1793,
"mean_token_accuracy": 0.1820973977446556,
"num_tokens": 31900671.0,
"step": 18380
},
{
"entropy": 5.505449867248535,
"epoch": 1.4304220968683135,
"grad_norm": 1.609375,
"learning_rate": 0.0004796789201520474,
"loss": 5.2495,
"mean_token_accuracy": 0.17633761316537858,
"num_tokens": 31909188.0,
"step": 18385
},
{
"entropy": 5.475505638122558,
"epoch": 1.4308111262400312,
"grad_norm": 1.3671875,
"learning_rate": 0.00047966740829009333,
"loss": 5.1678,
"mean_token_accuracy": 0.1832387551665306,
"num_tokens": 31917607.0,
"step": 18390
},
{
"entropy": 5.501669931411743,
"epoch": 1.4312001556117486,
"grad_norm": 1.3984375,
"learning_rate": 0.000479655893322637,
"loss": 5.2505,
"mean_token_accuracy": 0.17494168281555175,
"num_tokens": 31926510.0,
"step": 18395
},
{
"entropy": 5.528379726409912,
"epoch": 1.4315891849834663,
"grad_norm": 1.265625,
"learning_rate": 0.0004796443752498532,
"loss": 5.3524,
"mean_token_accuracy": 0.1656708225607872,
"num_tokens": 31935550.0,
"step": 18400
},
{
"entropy": 5.613227891921997,
"epoch": 1.4319782143551838,
"grad_norm": 1.328125,
"learning_rate": 0.0004796328540719169,
"loss": 5.3974,
"mean_token_accuracy": 0.16702781468629838,
"num_tokens": 31944499.0,
"step": 18405
},
{
"entropy": 5.535029125213623,
"epoch": 1.4323672437269015,
"grad_norm": 1.34375,
"learning_rate": 0.0004796213297890026,
"loss": 5.1245,
"mean_token_accuracy": 0.19094879031181336,
"num_tokens": 31952622.0,
"step": 18410
},
{
"entropy": 5.4266517162323,
"epoch": 1.432756273098619,
"grad_norm": 1.3046875,
"learning_rate": 0.0004796098024012853,
"loss": 5.1885,
"mean_token_accuracy": 0.1793039008975029,
"num_tokens": 31961606.0,
"step": 18415
},
{
"entropy": 5.4624498844146725,
"epoch": 1.4331453024703364,
"grad_norm": 1.2421875,
"learning_rate": 0.00047959827190894,
"loss": 5.3004,
"mean_token_accuracy": 0.1734811007976532,
"num_tokens": 31970312.0,
"step": 18420
},
{
"entropy": 5.5558093070983885,
"epoch": 1.4335343318420541,
"grad_norm": 1.421875,
"learning_rate": 0.00047958673831214157,
"loss": 5.2538,
"mean_token_accuracy": 0.17742112874984742,
"num_tokens": 31978718.0,
"step": 18425
},
{
"entropy": 5.583144092559815,
"epoch": 1.4339233612137716,
"grad_norm": 1.296875,
"learning_rate": 0.00047957520161106496,
"loss": 5.2838,
"mean_token_accuracy": 0.17255945801734923,
"num_tokens": 31987451.0,
"step": 18430
},
{
"entropy": 5.448249483108521,
"epoch": 1.434312390585489,
"grad_norm": 1.609375,
"learning_rate": 0.0004795636618058853,
"loss": 5.0599,
"mean_token_accuracy": 0.19537626057863236,
"num_tokens": 31994977.0,
"step": 18435
},
{
"entropy": 5.373802995681762,
"epoch": 1.4347014199572068,
"grad_norm": 1.34375,
"learning_rate": 0.0004795521188967777,
"loss": 5.1524,
"mean_token_accuracy": 0.18869252800941466,
"num_tokens": 32003804.0,
"step": 18440
},
{
"entropy": 5.56097264289856,
"epoch": 1.4350904493289243,
"grad_norm": 1.2890625,
"learning_rate": 0.0004795405728839172,
"loss": 5.2986,
"mean_token_accuracy": 0.16838204860687256,
"num_tokens": 32012090.0,
"step": 18445
},
{
"entropy": 5.4632055282592775,
"epoch": 1.435479478700642,
"grad_norm": 1.6640625,
"learning_rate": 0.0004795290237674792,
"loss": 5.2199,
"mean_token_accuracy": 0.18055543154478074,
"num_tokens": 32019664.0,
"step": 18450
},
{
"entropy": 5.497677898406982,
"epoch": 1.4358685080723594,
"grad_norm": 1.3125,
"learning_rate": 0.00047951747154763866,
"loss": 5.3017,
"mean_token_accuracy": 0.17322807908058166,
"num_tokens": 32028457.0,
"step": 18455
},
{
"entropy": 5.464205551147461,
"epoch": 1.4362575374440771,
"grad_norm": 1.71875,
"learning_rate": 0.00047950591622457106,
"loss": 5.1153,
"mean_token_accuracy": 0.18159251809120178,
"num_tokens": 32036730.0,
"step": 18460
},
{
"entropy": 5.514876031875611,
"epoch": 1.4366465668157946,
"grad_norm": 1.4140625,
"learning_rate": 0.00047949435779845174,
"loss": 5.3168,
"mean_token_accuracy": 0.1727965295314789,
"num_tokens": 32045657.0,
"step": 18465
},
{
"entropy": 5.44603705406189,
"epoch": 1.437035596187512,
"grad_norm": 1.25,
"learning_rate": 0.00047948279626945596,
"loss": 5.2049,
"mean_token_accuracy": 0.17871636971831323,
"num_tokens": 32053973.0,
"step": 18470
},
{
"entropy": 5.5791268825531,
"epoch": 1.4374246255592298,
"grad_norm": 1.3359375,
"learning_rate": 0.00047947123163775924,
"loss": 5.3411,
"mean_token_accuracy": 0.1693403020501137,
"num_tokens": 32062833.0,
"step": 18475
},
{
"entropy": 5.450551843643188,
"epoch": 1.4378136549309473,
"grad_norm": 1.3515625,
"learning_rate": 0.000479459663903537,
"loss": 5.1922,
"mean_token_accuracy": 0.18252055794000627,
"num_tokens": 32071578.0,
"step": 18480
},
{
"entropy": 5.434541797637939,
"epoch": 1.4382026843026647,
"grad_norm": 1.2734375,
"learning_rate": 0.0004794480930669649,
"loss": 5.1302,
"mean_token_accuracy": 0.18050495386123658,
"num_tokens": 32079847.0,
"step": 18485
},
{
"entropy": 5.468673419952393,
"epoch": 1.4385917136743824,
"grad_norm": 1.4609375,
"learning_rate": 0.0004794365191282183,
"loss": 5.1935,
"mean_token_accuracy": 0.17572144120931626,
"num_tokens": 32089751.0,
"step": 18490
},
{
"entropy": 5.5339319705963135,
"epoch": 1.4389807430461,
"grad_norm": 1.5078125,
"learning_rate": 0.00047942494208747297,
"loss": 5.3466,
"mean_token_accuracy": 0.1754387304186821,
"num_tokens": 32097791.0,
"step": 18495
},
{
"entropy": 5.49284257888794,
"epoch": 1.4393697724178176,
"grad_norm": 1.2734375,
"learning_rate": 0.0004794133619449045,
"loss": 5.1558,
"mean_token_accuracy": 0.18228802382946013,
"num_tokens": 32106417.0,
"step": 18500
},
{
"entropy": 5.448126602172851,
"epoch": 1.439758801789535,
"grad_norm": 1.3046875,
"learning_rate": 0.0004794017787006886,
"loss": 5.2457,
"mean_token_accuracy": 0.1746419295668602,
"num_tokens": 32115035.0,
"step": 18505
},
{
"entropy": 5.433640003204346,
"epoch": 1.4401478311612528,
"grad_norm": 1.328125,
"learning_rate": 0.000479390192355001,
"loss": 5.2165,
"mean_token_accuracy": 0.17342013865709305,
"num_tokens": 32123704.0,
"step": 18510
},
{
"entropy": 5.593865299224854,
"epoch": 1.4405368605329703,
"grad_norm": 1.375,
"learning_rate": 0.0004793786029080176,
"loss": 5.3081,
"mean_token_accuracy": 0.17159412205219268,
"num_tokens": 32132672.0,
"step": 18515
},
{
"entropy": 5.412581300735473,
"epoch": 1.4409258899046877,
"grad_norm": 1.3671875,
"learning_rate": 0.0004793670103599143,
"loss": 5.1891,
"mean_token_accuracy": 0.1784740060567856,
"num_tokens": 32142135.0,
"step": 18520
},
{
"entropy": 5.443901443481446,
"epoch": 1.4413149192764054,
"grad_norm": 1.34375,
"learning_rate": 0.00047935541471086677,
"loss": 5.2897,
"mean_token_accuracy": 0.16665616184473037,
"num_tokens": 32151261.0,
"step": 18525
},
{
"entropy": 5.471156406402588,
"epoch": 1.441703948648123,
"grad_norm": 1.2890625,
"learning_rate": 0.0004793438159610511,
"loss": 5.1728,
"mean_token_accuracy": 0.1797388091683388,
"num_tokens": 32159454.0,
"step": 18530
},
{
"entropy": 5.580642032623291,
"epoch": 1.4420929780198404,
"grad_norm": 1.40625,
"learning_rate": 0.00047933221411064334,
"loss": 5.2783,
"mean_token_accuracy": 0.1684955030679703,
"num_tokens": 32168706.0,
"step": 18535
},
{
"entropy": 5.602070426940918,
"epoch": 1.442482007391558,
"grad_norm": 1.4921875,
"learning_rate": 0.0004793206091598194,
"loss": 5.3592,
"mean_token_accuracy": 0.1691383183002472,
"num_tokens": 32177892.0,
"step": 18540
},
{
"entropy": 5.483515214920044,
"epoch": 1.4428710367632755,
"grad_norm": 1.3125,
"learning_rate": 0.0004793090011087554,
"loss": 5.2141,
"mean_token_accuracy": 0.18537631183862685,
"num_tokens": 32186081.0,
"step": 18545
},
{
"entropy": 5.477320384979248,
"epoch": 1.4432600661349932,
"grad_norm": 1.265625,
"learning_rate": 0.00047929738995762755,
"loss": 5.1997,
"mean_token_accuracy": 0.18172577619552613,
"num_tokens": 32193778.0,
"step": 18550
},
{
"entropy": 5.368476533889771,
"epoch": 1.4436490955067107,
"grad_norm": 1.328125,
"learning_rate": 0.000479285775706612,
"loss": 5.166,
"mean_token_accuracy": 0.18344126641750336,
"num_tokens": 32202773.0,
"step": 18555
},
{
"entropy": 5.464862871170044,
"epoch": 1.4440381248784284,
"grad_norm": 1.2890625,
"learning_rate": 0.00047927415835588496,
"loss": 5.1998,
"mean_token_accuracy": 0.18280504047870635,
"num_tokens": 32212105.0,
"step": 18560
},
{
"entropy": 5.415600538253784,
"epoch": 1.444427154250146,
"grad_norm": 1.3203125,
"learning_rate": 0.00047926253790562265,
"loss": 5.076,
"mean_token_accuracy": 0.18748060315847398,
"num_tokens": 32220550.0,
"step": 18565
},
{
"entropy": 5.401068544387817,
"epoch": 1.4448161836218634,
"grad_norm": 1.453125,
"learning_rate": 0.00047925091435600147,
"loss": 5.0916,
"mean_token_accuracy": 0.18292773365974427,
"num_tokens": 32228562.0,
"step": 18570
},
{
"entropy": 5.466281318664551,
"epoch": 1.445205212993581,
"grad_norm": 1.2421875,
"learning_rate": 0.00047923928770719776,
"loss": 5.2598,
"mean_token_accuracy": 0.17952028661966324,
"num_tokens": 32237172.0,
"step": 18575
},
{
"entropy": 5.460274076461792,
"epoch": 1.4455942423652985,
"grad_norm": 1.3828125,
"learning_rate": 0.00047922765795938797,
"loss": 5.229,
"mean_token_accuracy": 0.18011214584112167,
"num_tokens": 32246211.0,
"step": 18580
},
{
"entropy": 5.399421358108521,
"epoch": 1.445983271737016,
"grad_norm": 1.609375,
"learning_rate": 0.0004792160251127485,
"loss": 5.1385,
"mean_token_accuracy": 0.1861582189798355,
"num_tokens": 32255366.0,
"step": 18585
},
{
"entropy": 5.514032888412475,
"epoch": 1.4463723011087337,
"grad_norm": 1.3203125,
"learning_rate": 0.00047920438916745586,
"loss": 5.3354,
"mean_token_accuracy": 0.16853050887584686,
"num_tokens": 32264342.0,
"step": 18590
},
{
"entropy": 5.51638126373291,
"epoch": 1.4467613304804512,
"grad_norm": 1.34375,
"learning_rate": 0.0004791927501236866,
"loss": 5.2772,
"mean_token_accuracy": 0.17963633686304092,
"num_tokens": 32273184.0,
"step": 18595
},
{
"entropy": 5.548255968093872,
"epoch": 1.4471503598521689,
"grad_norm": 1.296875,
"learning_rate": 0.00047918110798161754,
"loss": 5.2857,
"mean_token_accuracy": 0.1705787032842636,
"num_tokens": 32282303.0,
"step": 18600
},
{
"entropy": 5.510072803497314,
"epoch": 1.4475393892238864,
"grad_norm": 1.515625,
"learning_rate": 0.00047916946274142503,
"loss": 5.1781,
"mean_token_accuracy": 0.18537161499261856,
"num_tokens": 32291118.0,
"step": 18605
},
{
"entropy": 5.507492637634277,
"epoch": 1.447928418595604,
"grad_norm": 1.3515625,
"learning_rate": 0.00047915781440328593,
"loss": 5.2385,
"mean_token_accuracy": 0.16987878531217576,
"num_tokens": 32299746.0,
"step": 18610
},
{
"entropy": 5.432093000411987,
"epoch": 1.4483174479673215,
"grad_norm": 1.2890625,
"learning_rate": 0.0004791461629673769,
"loss": 5.2258,
"mean_token_accuracy": 0.18358027786016465,
"num_tokens": 32308515.0,
"step": 18615
},
{
"entropy": 5.538900089263916,
"epoch": 1.448706477339039,
"grad_norm": 1.2734375,
"learning_rate": 0.0004791345084338748,
"loss": 5.367,
"mean_token_accuracy": 0.17313355803489686,
"num_tokens": 32317607.0,
"step": 18620
},
{
"entropy": 5.564659833908081,
"epoch": 1.4490955067107567,
"grad_norm": 1.359375,
"learning_rate": 0.0004791228508029565,
"loss": 5.255,
"mean_token_accuracy": 0.17707549333572387,
"num_tokens": 32325822.0,
"step": 18625
},
{
"entropy": 5.52716760635376,
"epoch": 1.4494845360824742,
"grad_norm": 1.1640625,
"learning_rate": 0.00047911119007479873,
"loss": 5.3362,
"mean_token_accuracy": 0.1719816282391548,
"num_tokens": 32336297.0,
"step": 18630
},
{
"entropy": 5.496382761001587,
"epoch": 1.4498735654541917,
"grad_norm": 1.484375,
"learning_rate": 0.00047909952624957866,
"loss": 5.2099,
"mean_token_accuracy": 0.17675570249557496,
"num_tokens": 32344306.0,
"step": 18635
},
{
"entropy": 5.526102209091187,
"epoch": 1.4502625948259094,
"grad_norm": 1.3125,
"learning_rate": 0.000479087859327473,
"loss": 5.3372,
"mean_token_accuracy": 0.17576269656419755,
"num_tokens": 32353668.0,
"step": 18640
},
{
"entropy": 5.500024127960205,
"epoch": 1.450651624197627,
"grad_norm": 1.359375,
"learning_rate": 0.000479076189308659,
"loss": 5.1966,
"mean_token_accuracy": 0.17442311942577363,
"num_tokens": 32361563.0,
"step": 18645
},
{
"entropy": 5.562808513641357,
"epoch": 1.4510406535693445,
"grad_norm": 1.3125,
"learning_rate": 0.00047906451619331364,
"loss": 5.3309,
"mean_token_accuracy": 0.17551316022872926,
"num_tokens": 32369612.0,
"step": 18650
},
{
"entropy": 5.442113637924194,
"epoch": 1.451429682941062,
"grad_norm": 1.3125,
"learning_rate": 0.00047905283998161404,
"loss": 5.1341,
"mean_token_accuracy": 0.18217557072639465,
"num_tokens": 32379013.0,
"step": 18655
},
{
"entropy": 5.401201629638672,
"epoch": 1.4518187123127797,
"grad_norm": 1.46875,
"learning_rate": 0.00047904116067373743,
"loss": 5.2042,
"mean_token_accuracy": 0.17736102342605592,
"num_tokens": 32387933.0,
"step": 18660
},
{
"entropy": 5.484335470199585,
"epoch": 1.4522077416844972,
"grad_norm": 1.296875,
"learning_rate": 0.0004790294782698609,
"loss": 5.2784,
"mean_token_accuracy": 0.17783260345458984,
"num_tokens": 32395669.0,
"step": 18665
},
{
"entropy": 5.403977632522583,
"epoch": 1.4525967710562147,
"grad_norm": 1.3046875,
"learning_rate": 0.0004790177927701618,
"loss": 5.1197,
"mean_token_accuracy": 0.18963489234447478,
"num_tokens": 32403676.0,
"step": 18670
},
{
"entropy": 5.458328151702881,
"epoch": 1.4529858004279324,
"grad_norm": 1.4296875,
"learning_rate": 0.0004790061041748174,
"loss": 5.2037,
"mean_token_accuracy": 0.18194677978754042,
"num_tokens": 32412089.0,
"step": 18675
},
{
"entropy": 5.511987686157227,
"epoch": 1.4533748297996498,
"grad_norm": 1.5078125,
"learning_rate": 0.0004789944124840051,
"loss": 5.1776,
"mean_token_accuracy": 0.18360118865966796,
"num_tokens": 32420357.0,
"step": 18680
},
{
"entropy": 5.536622619628906,
"epoch": 1.4537638591713673,
"grad_norm": 1.296875,
"learning_rate": 0.0004789827176979022,
"loss": 5.2546,
"mean_token_accuracy": 0.1797065556049347,
"num_tokens": 32429118.0,
"step": 18685
},
{
"entropy": 5.520533895492553,
"epoch": 1.454152888543085,
"grad_norm": 1.265625,
"learning_rate": 0.0004789710198166864,
"loss": 5.1774,
"mean_token_accuracy": 0.17354135662317277,
"num_tokens": 32437266.0,
"step": 18690
},
{
"entropy": 5.483531284332275,
"epoch": 1.4545419179148027,
"grad_norm": 1.3203125,
"learning_rate": 0.00047895931884053497,
"loss": 5.2801,
"mean_token_accuracy": 0.17534692734479904,
"num_tokens": 32446014.0,
"step": 18695
},
{
"entropy": 5.448425960540772,
"epoch": 1.4549309472865202,
"grad_norm": 1.3828125,
"learning_rate": 0.00047894761476962547,
"loss": 5.2779,
"mean_token_accuracy": 0.17118306010961531,
"num_tokens": 32454591.0,
"step": 18700
},
{
"entropy": 5.4775416374206545,
"epoch": 1.4553199766582376,
"grad_norm": 1.234375,
"learning_rate": 0.00047893590760413545,
"loss": 5.2316,
"mean_token_accuracy": 0.17925910353660585,
"num_tokens": 32462748.0,
"step": 18705
},
{
"entropy": 5.4649430274963375,
"epoch": 1.4557090060299553,
"grad_norm": 1.328125,
"learning_rate": 0.00047892419734424276,
"loss": 5.1994,
"mean_token_accuracy": 0.1781282439827919,
"num_tokens": 32471792.0,
"step": 18710
},
{
"entropy": 5.494879484176636,
"epoch": 1.4560980354016728,
"grad_norm": 1.2265625,
"learning_rate": 0.00047891248399012495,
"loss": 5.2957,
"mean_token_accuracy": 0.1818397805094719,
"num_tokens": 32480804.0,
"step": 18715
},
{
"entropy": 5.57960958480835,
"epoch": 1.4564870647733903,
"grad_norm": 1.2578125,
"learning_rate": 0.0004789007675419597,
"loss": 5.194,
"mean_token_accuracy": 0.178276626765728,
"num_tokens": 32489591.0,
"step": 18720
},
{
"entropy": 5.470126295089722,
"epoch": 1.456876094145108,
"grad_norm": 2.65625,
"learning_rate": 0.00047888904799992486,
"loss": 5.2356,
"mean_token_accuracy": 0.17744988799095154,
"num_tokens": 32498164.0,
"step": 18725
},
{
"entropy": 5.390956878662109,
"epoch": 1.4572651235168255,
"grad_norm": 1.3125,
"learning_rate": 0.00047887732536419826,
"loss": 5.0426,
"mean_token_accuracy": 0.18851525485515594,
"num_tokens": 32505909.0,
"step": 18730
},
{
"entropy": 5.411091756820679,
"epoch": 1.4576541528885432,
"grad_norm": 1.3984375,
"learning_rate": 0.0004788655996349577,
"loss": 5.1841,
"mean_token_accuracy": 0.17994549572467805,
"num_tokens": 32513990.0,
"step": 18735
},
{
"entropy": 5.420747470855713,
"epoch": 1.4580431822602606,
"grad_norm": 1.3359375,
"learning_rate": 0.00047885387081238125,
"loss": 5.2125,
"mean_token_accuracy": 0.18109757751226424,
"num_tokens": 32522932.0,
"step": 18740
},
{
"entropy": 5.474479341506958,
"epoch": 1.4584322116319783,
"grad_norm": 1.4609375,
"learning_rate": 0.0004788421388966467,
"loss": 5.3118,
"mean_token_accuracy": 0.177246156334877,
"num_tokens": 32530953.0,
"step": 18745
},
{
"entropy": 5.480226516723633,
"epoch": 1.4588212410036958,
"grad_norm": 1.34375,
"learning_rate": 0.00047883040388793207,
"loss": 5.1468,
"mean_token_accuracy": 0.17467701733112334,
"num_tokens": 32539812.0,
"step": 18750
},
{
"entropy": 5.438571119308472,
"epoch": 1.4592102703754133,
"grad_norm": 1.234375,
"learning_rate": 0.00047881866578641563,
"loss": 5.1473,
"mean_token_accuracy": 0.1777130052447319,
"num_tokens": 32548425.0,
"step": 18755
},
{
"entropy": 5.434152555465698,
"epoch": 1.459599299747131,
"grad_norm": 1.359375,
"learning_rate": 0.0004788069245922753,
"loss": 5.2105,
"mean_token_accuracy": 0.1789073407649994,
"num_tokens": 32557619.0,
"step": 18760
},
{
"entropy": 5.479773998260498,
"epoch": 1.4599883291188485,
"grad_norm": 1.3515625,
"learning_rate": 0.0004787951803056893,
"loss": 5.2367,
"mean_token_accuracy": 0.1725791111588478,
"num_tokens": 32565602.0,
"step": 18765
},
{
"entropy": 5.484281969070435,
"epoch": 1.460377358490566,
"grad_norm": 1.3203125,
"learning_rate": 0.0004787834329268358,
"loss": 5.2409,
"mean_token_accuracy": 0.17615429162979127,
"num_tokens": 32573691.0,
"step": 18770
},
{
"entropy": 5.495927047729492,
"epoch": 1.4607663878622836,
"grad_norm": 1.2734375,
"learning_rate": 0.000478771682455893,
"loss": 5.321,
"mean_token_accuracy": 0.1695410579442978,
"num_tokens": 32582642.0,
"step": 18775
},
{
"entropy": 5.5170002460479735,
"epoch": 1.461155417234001,
"grad_norm": 1.25,
"learning_rate": 0.0004787599288930393,
"loss": 5.2558,
"mean_token_accuracy": 0.17524343878030776,
"num_tokens": 32591328.0,
"step": 18780
},
{
"entropy": 5.486884832382202,
"epoch": 1.4615444466057188,
"grad_norm": 1.3515625,
"learning_rate": 0.000478748172238453,
"loss": 5.1828,
"mean_token_accuracy": 0.17761124074459075,
"num_tokens": 32599286.0,
"step": 18785
},
{
"entropy": 5.544167804718017,
"epoch": 1.4619334759774363,
"grad_norm": 1.234375,
"learning_rate": 0.0004787364124923125,
"loss": 5.3507,
"mean_token_accuracy": 0.16819806545972824,
"num_tokens": 32608156.0,
"step": 18790
},
{
"entropy": 5.461387491226196,
"epoch": 1.462322505349154,
"grad_norm": 1.328125,
"learning_rate": 0.00047872464965479625,
"loss": 5.1464,
"mean_token_accuracy": 0.18480401635169982,
"num_tokens": 32616134.0,
"step": 18795
},
{
"entropy": 5.441110849380493,
"epoch": 1.4627115347208715,
"grad_norm": 1.3984375,
"learning_rate": 0.0004787128837260826,
"loss": 5.2157,
"mean_token_accuracy": 0.17601969093084335,
"num_tokens": 32624711.0,
"step": 18800
},
{
"entropy": 5.48026328086853,
"epoch": 1.463100564092589,
"grad_norm": 1.234375,
"learning_rate": 0.0004787011147063503,
"loss": 5.2206,
"mean_token_accuracy": 0.18145304322242736,
"num_tokens": 32633049.0,
"step": 18805
},
{
"entropy": 5.472019863128662,
"epoch": 1.4634895934643066,
"grad_norm": 1.4453125,
"learning_rate": 0.0004786893425957777,
"loss": 5.1664,
"mean_token_accuracy": 0.17998918294906616,
"num_tokens": 32641173.0,
"step": 18810
},
{
"entropy": 5.45564374923706,
"epoch": 1.463878622836024,
"grad_norm": 1.3125,
"learning_rate": 0.0004786775673945436,
"loss": 5.1643,
"mean_token_accuracy": 0.18290238082408905,
"num_tokens": 32650275.0,
"step": 18815
},
{
"entropy": 5.428669404983521,
"epoch": 1.4642676522077416,
"grad_norm": 1.296875,
"learning_rate": 0.00047866578910282656,
"loss": 5.18,
"mean_token_accuracy": 0.18925225883722305,
"num_tokens": 32658675.0,
"step": 18820
},
{
"entropy": 5.444432020187378,
"epoch": 1.4646566815794593,
"grad_norm": 1.3984375,
"learning_rate": 0.00047865400772080535,
"loss": 5.1829,
"mean_token_accuracy": 0.17841393500566483,
"num_tokens": 32666643.0,
"step": 18825
},
{
"entropy": 5.459620141983033,
"epoch": 1.4650457109511767,
"grad_norm": 1.3203125,
"learning_rate": 0.00047864222324865875,
"loss": 5.09,
"mean_token_accuracy": 0.18572174608707429,
"num_tokens": 32674791.0,
"step": 18830
},
{
"entropy": 5.450570964813233,
"epoch": 1.4654347403228944,
"grad_norm": 1.25,
"learning_rate": 0.0004786304356865655,
"loss": 5.1803,
"mean_token_accuracy": 0.18987230509519576,
"num_tokens": 32682790.0,
"step": 18835
},
{
"entropy": 5.476630544662475,
"epoch": 1.465823769694612,
"grad_norm": 1.3359375,
"learning_rate": 0.00047861864503470457,
"loss": 5.3196,
"mean_token_accuracy": 0.172784686088562,
"num_tokens": 32692701.0,
"step": 18840
},
{
"entropy": 5.529924201965332,
"epoch": 1.4662127990663296,
"grad_norm": 1.3515625,
"learning_rate": 0.0004786068512932547,
"loss": 5.2503,
"mean_token_accuracy": 0.17849311232566833,
"num_tokens": 32701297.0,
"step": 18845
},
{
"entropy": 5.508241748809814,
"epoch": 1.466601828438047,
"grad_norm": 1.390625,
"learning_rate": 0.000478595054462395,
"loss": 5.1598,
"mean_token_accuracy": 0.18130504935979844,
"num_tokens": 32710188.0,
"step": 18850
},
{
"entropy": 5.42124834060669,
"epoch": 1.4669908578097646,
"grad_norm": 1.265625,
"learning_rate": 0.00047858325454230437,
"loss": 5.2217,
"mean_token_accuracy": 0.1808610126376152,
"num_tokens": 32719255.0,
"step": 18855
},
{
"entropy": 5.479483509063721,
"epoch": 1.4673798871814823,
"grad_norm": 1.359375,
"learning_rate": 0.0004785714515331619,
"loss": 5.27,
"mean_token_accuracy": 0.17980635315179824,
"num_tokens": 32728133.0,
"step": 18860
},
{
"entropy": 5.534544038772583,
"epoch": 1.4677689165531997,
"grad_norm": 1.3359375,
"learning_rate": 0.00047855964543514666,
"loss": 5.262,
"mean_token_accuracy": 0.17740251868963242,
"num_tokens": 32736333.0,
"step": 18865
},
{
"entropy": 5.3996328830719,
"epoch": 1.4681579459249172,
"grad_norm": 1.3046875,
"learning_rate": 0.00047854783624843786,
"loss": 5.1665,
"mean_token_accuracy": 0.18552245050668717,
"num_tokens": 32744954.0,
"step": 18870
},
{
"entropy": 5.396755743026733,
"epoch": 1.468546975296635,
"grad_norm": 1.359375,
"learning_rate": 0.00047853602397321453,
"loss": 5.2458,
"mean_token_accuracy": 0.18212308287620543,
"num_tokens": 32753720.0,
"step": 18875
},
{
"entropy": 5.522083806991577,
"epoch": 1.4689360046683524,
"grad_norm": 1.296875,
"learning_rate": 0.00047852420860965605,
"loss": 5.1272,
"mean_token_accuracy": 0.1841589704155922,
"num_tokens": 32762903.0,
"step": 18880
},
{
"entropy": 5.576237392425537,
"epoch": 1.46932503404007,
"grad_norm": 1.3828125,
"learning_rate": 0.00047851239015794166,
"loss": 5.3113,
"mean_token_accuracy": 0.17154305726289748,
"num_tokens": 32771367.0,
"step": 18885
},
{
"entropy": 5.482736396789551,
"epoch": 1.4697140634117876,
"grad_norm": 1.5703125,
"learning_rate": 0.00047850056861825066,
"loss": 5.2397,
"mean_token_accuracy": 0.17780001908540727,
"num_tokens": 32779782.0,
"step": 18890
},
{
"entropy": 5.4111613750457765,
"epoch": 1.4701030927835053,
"grad_norm": 1.375,
"learning_rate": 0.00047848874399076245,
"loss": 5.118,
"mean_token_accuracy": 0.17996083199977875,
"num_tokens": 32788157.0,
"step": 18895
},
{
"entropy": 5.397430038452148,
"epoch": 1.4704921221552227,
"grad_norm": 1.34375,
"learning_rate": 0.0004784769162756563,
"loss": 5.1038,
"mean_token_accuracy": 0.18671779334545135,
"num_tokens": 32796590.0,
"step": 18900
},
{
"entropy": 5.531782150268555,
"epoch": 1.4708811515269402,
"grad_norm": 1.390625,
"learning_rate": 0.000478465085473112,
"loss": 5.3649,
"mean_token_accuracy": 0.1690208226442337,
"num_tokens": 32806297.0,
"step": 18905
},
{
"entropy": 5.512090110778809,
"epoch": 1.471270180898658,
"grad_norm": 1.6015625,
"learning_rate": 0.0004784532515833088,
"loss": 5.196,
"mean_token_accuracy": 0.1851867228746414,
"num_tokens": 32815370.0,
"step": 18910
},
{
"entropy": 5.4117820262908936,
"epoch": 1.4716592102703754,
"grad_norm": 1.3515625,
"learning_rate": 0.00047844141460642636,
"loss": 5.2196,
"mean_token_accuracy": 0.1765821933746338,
"num_tokens": 32824678.0,
"step": 18915
},
{
"entropy": 5.5388978004455565,
"epoch": 1.4720482396420929,
"grad_norm": 1.328125,
"learning_rate": 0.00047842957454264425,
"loss": 5.2919,
"mean_token_accuracy": 0.17475738674402236,
"num_tokens": 32834759.0,
"step": 18920
},
{
"entropy": 5.558327293395996,
"epoch": 1.4724372690138106,
"grad_norm": 1.40625,
"learning_rate": 0.00047841773139214213,
"loss": 5.2462,
"mean_token_accuracy": 0.17976084649562835,
"num_tokens": 32843152.0,
"step": 18925
},
{
"entropy": 5.573939609527588,
"epoch": 1.472826298385528,
"grad_norm": 1.328125,
"learning_rate": 0.0004784058851550997,
"loss": 5.4354,
"mean_token_accuracy": 0.16532717347145082,
"num_tokens": 32852702.0,
"step": 18930
},
{
"entropy": 5.479413843154907,
"epoch": 1.4732153277572457,
"grad_norm": 1.46875,
"learning_rate": 0.0004783940358316967,
"loss": 5.1146,
"mean_token_accuracy": 0.18592068403959275,
"num_tokens": 32860201.0,
"step": 18935
},
{
"entropy": 5.404597234725952,
"epoch": 1.4736043571289632,
"grad_norm": 1.3515625,
"learning_rate": 0.00047838218342211296,
"loss": 5.0865,
"mean_token_accuracy": 0.19167012125253677,
"num_tokens": 32868731.0,
"step": 18940
},
{
"entropy": 5.463802480697632,
"epoch": 1.473993386500681,
"grad_norm": 1.234375,
"learning_rate": 0.00047837032792652837,
"loss": 5.2982,
"mean_token_accuracy": 0.17795735746622085,
"num_tokens": 32876960.0,
"step": 18945
},
{
"entropy": 5.521774482727051,
"epoch": 1.4743824158723984,
"grad_norm": 1.40625,
"learning_rate": 0.0004783584693451226,
"loss": 5.2469,
"mean_token_accuracy": 0.1817639574408531,
"num_tokens": 32886446.0,
"step": 18950
},
{
"entropy": 5.542544746398926,
"epoch": 1.4747714452441159,
"grad_norm": 1.4453125,
"learning_rate": 0.0004783466076780759,
"loss": 5.311,
"mean_token_accuracy": 0.1694379508495331,
"num_tokens": 32895141.0,
"step": 18955
},
{
"entropy": 5.542437410354614,
"epoch": 1.4751604746158336,
"grad_norm": 1.265625,
"learning_rate": 0.0004783347429255679,
"loss": 5.2254,
"mean_token_accuracy": 0.1778141140937805,
"num_tokens": 32904191.0,
"step": 18960
},
{
"entropy": 5.5346107006073,
"epoch": 1.475549503987551,
"grad_norm": 1.328125,
"learning_rate": 0.000478322875087779,
"loss": 5.2055,
"mean_token_accuracy": 0.18154967129230498,
"num_tokens": 32912805.0,
"step": 18965
},
{
"entropy": 5.458024501800537,
"epoch": 1.4759385333592685,
"grad_norm": 1.3125,
"learning_rate": 0.00047831100416488906,
"loss": 5.1961,
"mean_token_accuracy": 0.17444189488887787,
"num_tokens": 32921275.0,
"step": 18970
},
{
"entropy": 5.493920707702637,
"epoch": 1.4763275627309862,
"grad_norm": 1.390625,
"learning_rate": 0.00047829913015707816,
"loss": 5.2281,
"mean_token_accuracy": 0.18344388008117676,
"num_tokens": 32929472.0,
"step": 18975
},
{
"entropy": 5.508865308761597,
"epoch": 1.4767165921027037,
"grad_norm": 1.390625,
"learning_rate": 0.00047828725306452657,
"loss": 5.2466,
"mean_token_accuracy": 0.1758577197790146,
"num_tokens": 32937697.0,
"step": 18980
},
{
"entropy": 5.496637630462646,
"epoch": 1.4771056214744214,
"grad_norm": 1.2421875,
"learning_rate": 0.00047827537288741453,
"loss": 5.2091,
"mean_token_accuracy": 0.18022481501102447,
"num_tokens": 32946516.0,
"step": 18985
},
{
"entropy": 5.431010770797729,
"epoch": 1.4774946508461388,
"grad_norm": 1.34375,
"learning_rate": 0.0004782634896259222,
"loss": 5.1034,
"mean_token_accuracy": 0.1849052846431732,
"num_tokens": 32954841.0,
"step": 18990
},
{
"entropy": 5.459078168869018,
"epoch": 1.4778836802178565,
"grad_norm": 1.265625,
"learning_rate": 0.00047825160328023,
"loss": 5.2682,
"mean_token_accuracy": 0.17717995643615722,
"num_tokens": 32963678.0,
"step": 18995
},
{
"entropy": 5.366038084030151,
"epoch": 1.478272709589574,
"grad_norm": 1.5078125,
"learning_rate": 0.0004782397138505181,
"loss": 5.0689,
"mean_token_accuracy": 0.18955635726451875,
"num_tokens": 32973163.0,
"step": 19000
},
{
"entropy": 5.509649181365967,
"epoch": 1.4786617389612915,
"grad_norm": 1.40625,
"learning_rate": 0.00047822782133696715,
"loss": 5.2757,
"mean_token_accuracy": 0.17284945100545884,
"num_tokens": 32982473.0,
"step": 19005
},
{
"entropy": 5.459305095672607,
"epoch": 1.4790507683330092,
"grad_norm": 1.2109375,
"learning_rate": 0.0004782159257397574,
"loss": 5.1117,
"mean_token_accuracy": 0.19406988471746445,
"num_tokens": 32990328.0,
"step": 19010
},
{
"entropy": 5.36344051361084,
"epoch": 1.4794397977047267,
"grad_norm": 1.296875,
"learning_rate": 0.00047820402705906953,
"loss": 5.1858,
"mean_token_accuracy": 0.17730076014995574,
"num_tokens": 32998432.0,
"step": 19015
},
{
"entropy": 5.493593168258667,
"epoch": 1.4798288270764441,
"grad_norm": 1.2890625,
"learning_rate": 0.00047819212529508394,
"loss": 5.2708,
"mean_token_accuracy": 0.17800803035497664,
"num_tokens": 33007017.0,
"step": 19020
},
{
"entropy": 5.538372325897217,
"epoch": 1.4802178564481618,
"grad_norm": 1.4453125,
"learning_rate": 0.0004781802204479812,
"loss": 5.1864,
"mean_token_accuracy": 0.188335083425045,
"num_tokens": 33015212.0,
"step": 19025
},
{
"entropy": 5.448433351516724,
"epoch": 1.4806068858198795,
"grad_norm": 1.4296875,
"learning_rate": 0.0004781683125179421,
"loss": 5.224,
"mean_token_accuracy": 0.17419015765190124,
"num_tokens": 33023555.0,
"step": 19030
},
{
"entropy": 5.4041119575500485,
"epoch": 1.480995915191597,
"grad_norm": 1.2421875,
"learning_rate": 0.0004781564015051472,
"loss": 5.2053,
"mean_token_accuracy": 0.1750833198428154,
"num_tokens": 33033048.0,
"step": 19035
},
{
"entropy": 5.4126099109649655,
"epoch": 1.4813849445633145,
"grad_norm": 1.28125,
"learning_rate": 0.0004781444874097772,
"loss": 5.0892,
"mean_token_accuracy": 0.18323202580213546,
"num_tokens": 33041553.0,
"step": 19040
},
{
"entropy": 5.417594051361084,
"epoch": 1.4817739739350322,
"grad_norm": 1.3359375,
"learning_rate": 0.00047813257023201307,
"loss": 5.2107,
"mean_token_accuracy": 0.18073199838399887,
"num_tokens": 33050864.0,
"step": 19045
},
{
"entropy": 5.392450332641602,
"epoch": 1.4821630033067497,
"grad_norm": 1.3046875,
"learning_rate": 0.0004781206499720354,
"loss": 5.0867,
"mean_token_accuracy": 0.19068018198013306,
"num_tokens": 33059700.0,
"step": 19050
},
{
"entropy": 5.3810193061828615,
"epoch": 1.4825520326784671,
"grad_norm": 1.453125,
"learning_rate": 0.00047810872663002523,
"loss": 5.0641,
"mean_token_accuracy": 0.18580039590597153,
"num_tokens": 33067784.0,
"step": 19055
},
{
"entropy": 5.4524160861969,
"epoch": 1.4829410620501848,
"grad_norm": 1.265625,
"learning_rate": 0.00047809680020616333,
"loss": 5.2284,
"mean_token_accuracy": 0.1768863618373871,
"num_tokens": 33077174.0,
"step": 19060
},
{
"entropy": 5.508147859573365,
"epoch": 1.4833300914219023,
"grad_norm": 1.3515625,
"learning_rate": 0.00047808487070063083,
"loss": 5.2448,
"mean_token_accuracy": 0.18085899353027343,
"num_tokens": 33085492.0,
"step": 19065
},
{
"entropy": 5.486947870254516,
"epoch": 1.4837191207936198,
"grad_norm": 1.2421875,
"learning_rate": 0.0004780729381136086,
"loss": 5.2143,
"mean_token_accuracy": 0.1870437502861023,
"num_tokens": 33094388.0,
"step": 19070
},
{
"entropy": 5.377500820159912,
"epoch": 1.4841081501653375,
"grad_norm": 1.3828125,
"learning_rate": 0.0004780610024452778,
"loss": 5.0437,
"mean_token_accuracy": 0.1885310649871826,
"num_tokens": 33101996.0,
"step": 19075
},
{
"entropy": 5.43360333442688,
"epoch": 1.4844971795370552,
"grad_norm": 1.2734375,
"learning_rate": 0.00047804906369581954,
"loss": 5.2673,
"mean_token_accuracy": 0.17870389968156813,
"num_tokens": 33111139.0,
"step": 19080
},
{
"entropy": 5.486876964569092,
"epoch": 1.4848862089087727,
"grad_norm": 1.2890625,
"learning_rate": 0.0004780371218654148,
"loss": 5.1112,
"mean_token_accuracy": 0.17735509276390077,
"num_tokens": 33119159.0,
"step": 19085
},
{
"entropy": 5.545796966552734,
"epoch": 1.4852752382804901,
"grad_norm": 1.234375,
"learning_rate": 0.00047802517695424496,
"loss": 5.2716,
"mean_token_accuracy": 0.1789771258831024,
"num_tokens": 33128317.0,
"step": 19090
},
{
"entropy": 5.4514398097991945,
"epoch": 1.4856642676522078,
"grad_norm": 1.359375,
"learning_rate": 0.0004780132289624913,
"loss": 5.1926,
"mean_token_accuracy": 0.18862663060426713,
"num_tokens": 33136936.0,
"step": 19095
},
{
"entropy": 5.535688495635986,
"epoch": 1.4860532970239253,
"grad_norm": 1.3359375,
"learning_rate": 0.0004780012778903349,
"loss": 5.2474,
"mean_token_accuracy": 0.1827515482902527,
"num_tokens": 33145059.0,
"step": 19100
},
{
"entropy": 5.416590547561645,
"epoch": 1.4864423263956428,
"grad_norm": 1.3046875,
"learning_rate": 0.00047798932373795724,
"loss": 5.1303,
"mean_token_accuracy": 0.18182187974452974,
"num_tokens": 33153683.0,
"step": 19105
},
{
"entropy": 5.58031587600708,
"epoch": 1.4868313557673605,
"grad_norm": 1.453125,
"learning_rate": 0.00047797736650553977,
"loss": 5.2976,
"mean_token_accuracy": 0.17467335164546965,
"num_tokens": 33163179.0,
"step": 19110
},
{
"entropy": 5.459546852111816,
"epoch": 1.487220385139078,
"grad_norm": 1.484375,
"learning_rate": 0.00047796540619326366,
"loss": 5.0839,
"mean_token_accuracy": 0.18810902833938598,
"num_tokens": 33172029.0,
"step": 19115
},
{
"entropy": 5.523521566390992,
"epoch": 1.4876094145107956,
"grad_norm": 1.4375,
"learning_rate": 0.0004779534428013107,
"loss": 5.2801,
"mean_token_accuracy": 0.180377858877182,
"num_tokens": 33181168.0,
"step": 19120
},
{
"entropy": 5.51525616645813,
"epoch": 1.4879984438825131,
"grad_norm": 1.328125,
"learning_rate": 0.00047794147632986223,
"loss": 5.2937,
"mean_token_accuracy": 0.17230410724878312,
"num_tokens": 33191320.0,
"step": 19125
},
{
"entropy": 5.400260353088379,
"epoch": 1.4883874732542308,
"grad_norm": 1.296875,
"learning_rate": 0.0004779295067790999,
"loss": 5.1699,
"mean_token_accuracy": 0.18297987878322602,
"num_tokens": 33199625.0,
"step": 19130
},
{
"entropy": 5.456357955932617,
"epoch": 1.4887765026259483,
"grad_norm": 1.484375,
"learning_rate": 0.0004779175341492053,
"loss": 5.1886,
"mean_token_accuracy": 0.18856837898492812,
"num_tokens": 33208145.0,
"step": 19135
},
{
"entropy": 5.5095789432525635,
"epoch": 1.4891655319976658,
"grad_norm": 1.578125,
"learning_rate": 0.0004779055584403601,
"loss": 5.1957,
"mean_token_accuracy": 0.18154570758342742,
"num_tokens": 33216441.0,
"step": 19140
},
{
"entropy": 5.515572500228882,
"epoch": 1.4895545613693835,
"grad_norm": 1.34375,
"learning_rate": 0.000477893579652746,
"loss": 5.2074,
"mean_token_accuracy": 0.17709636241197585,
"num_tokens": 33225612.0,
"step": 19145
},
{
"entropy": 5.451858186721802,
"epoch": 1.489943590741101,
"grad_norm": 1.328125,
"learning_rate": 0.00047788159778654475,
"loss": 5.1786,
"mean_token_accuracy": 0.17737296223640442,
"num_tokens": 33234410.0,
"step": 19150
},
{
"entropy": 5.483284854888916,
"epoch": 1.4903326201128184,
"grad_norm": 1.328125,
"learning_rate": 0.00047786961284193813,
"loss": 5.1187,
"mean_token_accuracy": 0.18336522579193115,
"num_tokens": 33242838.0,
"step": 19155
},
{
"entropy": 5.433384943008423,
"epoch": 1.4907216494845361,
"grad_norm": 1.3359375,
"learning_rate": 0.0004778576248191081,
"loss": 5.2627,
"mean_token_accuracy": 0.182778562605381,
"num_tokens": 33251266.0,
"step": 19160
},
{
"entropy": 5.4901885986328125,
"epoch": 1.4911106788562536,
"grad_norm": 1.359375,
"learning_rate": 0.0004778456337182365,
"loss": 5.1744,
"mean_token_accuracy": 0.1808495119214058,
"num_tokens": 33259644.0,
"step": 19165
},
{
"entropy": 5.493185043334961,
"epoch": 1.4914997082279713,
"grad_norm": 1.28125,
"learning_rate": 0.0004778336395395052,
"loss": 5.1597,
"mean_token_accuracy": 0.1830964595079422,
"num_tokens": 33267547.0,
"step": 19170
},
{
"entropy": 5.4217133045196535,
"epoch": 1.4918887375996888,
"grad_norm": 1.3515625,
"learning_rate": 0.00047782164228309636,
"loss": 5.2099,
"mean_token_accuracy": 0.18030260652303695,
"num_tokens": 33276808.0,
"step": 19175
},
{
"entropy": 5.48171648979187,
"epoch": 1.4922777669714065,
"grad_norm": 1.3125,
"learning_rate": 0.00047780964194919193,
"loss": 5.2409,
"mean_token_accuracy": 0.18135538548231125,
"num_tokens": 33285569.0,
"step": 19180
},
{
"entropy": 5.504447650909424,
"epoch": 1.492666796343124,
"grad_norm": 1.3203125,
"learning_rate": 0.00047779763853797387,
"loss": 5.2439,
"mean_token_accuracy": 0.18040698766708374,
"num_tokens": 33295214.0,
"step": 19185
},
{
"entropy": 5.440892171859741,
"epoch": 1.4930558257148414,
"grad_norm": 1.484375,
"learning_rate": 0.0004777856320496245,
"loss": 5.15,
"mean_token_accuracy": 0.18482630848884582,
"num_tokens": 33304140.0,
"step": 19190
},
{
"entropy": 5.442900943756103,
"epoch": 1.493444855086559,
"grad_norm": 1.40625,
"learning_rate": 0.000477773622484326,
"loss": 5.2626,
"mean_token_accuracy": 0.17975836545228957,
"num_tokens": 33312879.0,
"step": 19195
},
{
"entropy": 5.4715611934661865,
"epoch": 1.4938338844582766,
"grad_norm": 1.6328125,
"learning_rate": 0.0004777616098422604,
"loss": 5.1919,
"mean_token_accuracy": 0.18639179393649102,
"num_tokens": 33320769.0,
"step": 19200
},
{
"entropy": 5.3871983051300045,
"epoch": 1.494222913829994,
"grad_norm": 1.34375,
"learning_rate": 0.00047774959412361014,
"loss": 5.095,
"mean_token_accuracy": 0.19059139341115952,
"num_tokens": 33328911.0,
"step": 19205
},
{
"entropy": 5.465117597579956,
"epoch": 1.4946119432017118,
"grad_norm": 1.359375,
"learning_rate": 0.0004777375753285575,
"loss": 5.1486,
"mean_token_accuracy": 0.18504270911216736,
"num_tokens": 33337607.0,
"step": 19210
},
{
"entropy": 5.480438756942749,
"epoch": 1.4950009725734292,
"grad_norm": 1.25,
"learning_rate": 0.00047772555345728486,
"loss": 5.2197,
"mean_token_accuracy": 0.179573892056942,
"num_tokens": 33346663.0,
"step": 19215
},
{
"entropy": 5.596265172958374,
"epoch": 1.495390001945147,
"grad_norm": 1.25,
"learning_rate": 0.0004777135285099746,
"loss": 5.2593,
"mean_token_accuracy": 0.17067298144102097,
"num_tokens": 33355501.0,
"step": 19220
},
{
"entropy": 5.487182188034057,
"epoch": 1.4957790313168644,
"grad_norm": 1.3046875,
"learning_rate": 0.0004777015004868092,
"loss": 5.1043,
"mean_token_accuracy": 0.1746610015630722,
"num_tokens": 33363497.0,
"step": 19225
},
{
"entropy": 5.419445896148682,
"epoch": 1.496168060688582,
"grad_norm": 1.4140625,
"learning_rate": 0.0004776894693879712,
"loss": 5.0841,
"mean_token_accuracy": 0.1901463285088539,
"num_tokens": 33371349.0,
"step": 19230
},
{
"entropy": 5.398255395889282,
"epoch": 1.4965570900602996,
"grad_norm": 1.5078125,
"learning_rate": 0.0004776774352136431,
"loss": 5.0528,
"mean_token_accuracy": 0.1882214516401291,
"num_tokens": 33379889.0,
"step": 19235
},
{
"entropy": 5.443554067611695,
"epoch": 1.496946119432017,
"grad_norm": 1.2578125,
"learning_rate": 0.00047766539796400756,
"loss": 5.2208,
"mean_token_accuracy": 0.18137498199939728,
"num_tokens": 33388452.0,
"step": 19240
},
{
"entropy": 5.41297345161438,
"epoch": 1.4973351488037348,
"grad_norm": 1.28125,
"learning_rate": 0.0004776533576392471,
"loss": 5.1588,
"mean_token_accuracy": 0.18347925543785096,
"num_tokens": 33397598.0,
"step": 19245
},
{
"entropy": 5.5165736198425295,
"epoch": 1.4977241781754522,
"grad_norm": 1.2109375,
"learning_rate": 0.0004776413142395445,
"loss": 5.2065,
"mean_token_accuracy": 0.18012795150279998,
"num_tokens": 33406509.0,
"step": 19250
},
{
"entropy": 5.421728944778442,
"epoch": 1.4981132075471697,
"grad_norm": 1.375,
"learning_rate": 0.00047762926776508244,
"loss": 5.205,
"mean_token_accuracy": 0.1787506654858589,
"num_tokens": 33415129.0,
"step": 19255
},
{
"entropy": 5.357886552810669,
"epoch": 1.4985022369188874,
"grad_norm": 1.2734375,
"learning_rate": 0.00047761721821604387,
"loss": 5.0561,
"mean_token_accuracy": 0.18412531167268753,
"num_tokens": 33423588.0,
"step": 19260
},
{
"entropy": 5.488271760940552,
"epoch": 1.4988912662906049,
"grad_norm": 1.3125,
"learning_rate": 0.0004776051655926115,
"loss": 5.2344,
"mean_token_accuracy": 0.17699860483407975,
"num_tokens": 33431598.0,
"step": 19265
},
{
"entropy": 5.579805898666382,
"epoch": 1.4992802956623226,
"grad_norm": 1.296875,
"learning_rate": 0.00047759310989496813,
"loss": 5.3382,
"mean_token_accuracy": 0.17470152378082277,
"num_tokens": 33441139.0,
"step": 19270
},
{
"entropy": 5.507847309112549,
"epoch": 1.49966932503404,
"grad_norm": 1.28125,
"learning_rate": 0.0004775810511232969,
"loss": 5.1634,
"mean_token_accuracy": 0.18191005289554596,
"num_tokens": 33449558.0,
"step": 19275
},
{
"entropy": 5.511995315551758,
"epoch": 1.5000583544057577,
"grad_norm": 1.4453125,
"learning_rate": 0.00047756898927778056,
"loss": 5.2262,
"mean_token_accuracy": 0.17960501164197923,
"num_tokens": 33457429.0,
"step": 19280
},
{
"entropy": 5.393494129180908,
"epoch": 1.5004473837774752,
"grad_norm": 1.390625,
"learning_rate": 0.00047755692435860227,
"loss": 5.105,
"mean_token_accuracy": 0.19161136895418168,
"num_tokens": 33465781.0,
"step": 19285
},
{
"entropy": 5.480853796005249,
"epoch": 1.5008364131491927,
"grad_norm": 1.34375,
"learning_rate": 0.000477544856365945,
"loss": 5.1682,
"mean_token_accuracy": 0.18393547534942628,
"num_tokens": 33473865.0,
"step": 19290
},
{
"entropy": 5.463537931442261,
"epoch": 1.5012254425209104,
"grad_norm": 1.484375,
"learning_rate": 0.00047753278529999205,
"loss": 5.2154,
"mean_token_accuracy": 0.17896395772695542,
"num_tokens": 33482497.0,
"step": 19295
},
{
"entropy": 5.456485033035278,
"epoch": 1.5016144718926279,
"grad_norm": 1.3359375,
"learning_rate": 0.00047752071116092637,
"loss": 5.238,
"mean_token_accuracy": 0.17785248309373855,
"num_tokens": 33490933.0,
"step": 19300
},
{
"entropy": 5.456659936904908,
"epoch": 1.5020035012643453,
"grad_norm": 1.4765625,
"learning_rate": 0.0004775086339489312,
"loss": 5.2303,
"mean_token_accuracy": 0.17924463748931885,
"num_tokens": 33500192.0,
"step": 19305
},
{
"entropy": 5.498013830184936,
"epoch": 1.502392530636063,
"grad_norm": 1.375,
"learning_rate": 0.0004774965536641899,
"loss": 5.1979,
"mean_token_accuracy": 0.1808093473315239,
"num_tokens": 33508543.0,
"step": 19310
},
{
"entropy": 5.460071754455567,
"epoch": 1.5027815600077807,
"grad_norm": 1.2265625,
"learning_rate": 0.00047748447030688575,
"loss": 5.2227,
"mean_token_accuracy": 0.17895960211753845,
"num_tokens": 33517310.0,
"step": 19315
},
{
"entropy": 5.479748153686524,
"epoch": 1.503170589379498,
"grad_norm": 1.28125,
"learning_rate": 0.00047747238387720194,
"loss": 5.2826,
"mean_token_accuracy": 0.17462820559740067,
"num_tokens": 33526274.0,
"step": 19320
},
{
"entropy": 5.553435659408569,
"epoch": 1.5035596187512157,
"grad_norm": 1.609375,
"learning_rate": 0.000477460294375322,
"loss": 5.2688,
"mean_token_accuracy": 0.17671048939228057,
"num_tokens": 33534438.0,
"step": 19325
},
{
"entropy": 5.496205615997314,
"epoch": 1.5039486481229334,
"grad_norm": 1.2578125,
"learning_rate": 0.00047744820180142935,
"loss": 5.1654,
"mean_token_accuracy": 0.1769416719675064,
"num_tokens": 33542943.0,
"step": 19330
},
{
"entropy": 5.449843025207519,
"epoch": 1.5043376774946509,
"grad_norm": 1.4765625,
"learning_rate": 0.00047743610615570746,
"loss": 5.1895,
"mean_token_accuracy": 0.1820890188217163,
"num_tokens": 33550567.0,
"step": 19335
},
{
"entropy": 5.515642929077148,
"epoch": 1.5047267068663683,
"grad_norm": 1.46875,
"learning_rate": 0.00047742400743833993,
"loss": 5.3014,
"mean_token_accuracy": 0.17504193484783173,
"num_tokens": 33559851.0,
"step": 19340
},
{
"entropy": 5.571846866607666,
"epoch": 1.505115736238086,
"grad_norm": 1.359375,
"learning_rate": 0.0004774119056495102,
"loss": 5.2247,
"mean_token_accuracy": 0.17265723496675492,
"num_tokens": 33568645.0,
"step": 19345
},
{
"entropy": 5.386165904998779,
"epoch": 1.5055047656098035,
"grad_norm": 1.4375,
"learning_rate": 0.00047739980078940206,
"loss": 5.1908,
"mean_token_accuracy": 0.18712951987981796,
"num_tokens": 33577331.0,
"step": 19350
},
{
"entropy": 5.361925506591797,
"epoch": 1.505893794981521,
"grad_norm": 1.3046875,
"learning_rate": 0.00047738769285819894,
"loss": 5.0304,
"mean_token_accuracy": 0.18944639563560486,
"num_tokens": 33586196.0,
"step": 19355
},
{
"entropy": 5.465072917938232,
"epoch": 1.5062828243532387,
"grad_norm": 1.2421875,
"learning_rate": 0.0004773755818560849,
"loss": 5.2443,
"mean_token_accuracy": 0.17697518020868303,
"num_tokens": 33595200.0,
"step": 19360
},
{
"entropy": 5.496227979660034,
"epoch": 1.5066718537249564,
"grad_norm": 1.3828125,
"learning_rate": 0.0004773634677832434,
"loss": 5.1424,
"mean_token_accuracy": 0.18970729857683183,
"num_tokens": 33604130.0,
"step": 19365
},
{
"entropy": 5.462098407745361,
"epoch": 1.5070608830966739,
"grad_norm": 1.2421875,
"learning_rate": 0.0004773513506398584,
"loss": 5.3189,
"mean_token_accuracy": 0.16969507336616516,
"num_tokens": 33613254.0,
"step": 19370
},
{
"entropy": 5.482469463348389,
"epoch": 1.5074499124683913,
"grad_norm": 1.3046875,
"learning_rate": 0.0004773392304261137,
"loss": 5.2054,
"mean_token_accuracy": 0.17997311502695085,
"num_tokens": 33621395.0,
"step": 19375
},
{
"entropy": 5.482410621643067,
"epoch": 1.507838941840109,
"grad_norm": 1.3515625,
"learning_rate": 0.0004773271071421933,
"loss": 5.1398,
"mean_token_accuracy": 0.1783592864871025,
"num_tokens": 33630293.0,
"step": 19380
},
{
"entropy": 5.494434404373169,
"epoch": 1.5082279712118265,
"grad_norm": 1.390625,
"learning_rate": 0.00047731498078828105,
"loss": 5.2398,
"mean_token_accuracy": 0.18042422086000443,
"num_tokens": 33638224.0,
"step": 19385
},
{
"entropy": 5.544911813735962,
"epoch": 1.508617000583544,
"grad_norm": 1.3515625,
"learning_rate": 0.000477302851364561,
"loss": 5.3125,
"mean_token_accuracy": 0.16991392523050308,
"num_tokens": 33646974.0,
"step": 19390
},
{
"entropy": 5.56158037185669,
"epoch": 1.5090060299552617,
"grad_norm": 1.4296875,
"learning_rate": 0.00047729071887121717,
"loss": 5.2707,
"mean_token_accuracy": 0.17525714486837388,
"num_tokens": 33656171.0,
"step": 19395
},
{
"entropy": 5.463377857208252,
"epoch": 1.5093950593269791,
"grad_norm": 1.4765625,
"learning_rate": 0.0004772785833084337,
"loss": 5.2628,
"mean_token_accuracy": 0.1726651072502136,
"num_tokens": 33664605.0,
"step": 19400
},
{
"entropy": 5.518970155715943,
"epoch": 1.5097840886986966,
"grad_norm": 1.625,
"learning_rate": 0.0004772664446763946,
"loss": 5.2479,
"mean_token_accuracy": 0.17498343288898469,
"num_tokens": 33673128.0,
"step": 19405
},
{
"entropy": 5.426829099655151,
"epoch": 1.5101731180704143,
"grad_norm": 1.2578125,
"learning_rate": 0.0004772543029752842,
"loss": 5.1657,
"mean_token_accuracy": 0.1868521273136139,
"num_tokens": 33681358.0,
"step": 19410
},
{
"entropy": 5.390666437149048,
"epoch": 1.510562147442132,
"grad_norm": 1.5703125,
"learning_rate": 0.00047724215820528666,
"loss": 5.0721,
"mean_token_accuracy": 0.1924533039331436,
"num_tokens": 33690282.0,
"step": 19415
},
{
"entropy": 5.394773197174072,
"epoch": 1.5109511768138495,
"grad_norm": 1.390625,
"learning_rate": 0.0004772300103665863,
"loss": 5.1246,
"mean_token_accuracy": 0.18384106755256652,
"num_tokens": 33698294.0,
"step": 19420
},
{
"entropy": 5.39921498298645,
"epoch": 1.511340206185567,
"grad_norm": 1.3359375,
"learning_rate": 0.00047721785945936733,
"loss": 5.0947,
"mean_token_accuracy": 0.19088248014450074,
"num_tokens": 33706552.0,
"step": 19425
},
{
"entropy": 5.464116716384888,
"epoch": 1.5117292355572847,
"grad_norm": 1.2421875,
"learning_rate": 0.0004772057054838143,
"loss": 5.1758,
"mean_token_accuracy": 0.1816762238740921,
"num_tokens": 33714704.0,
"step": 19430
},
{
"entropy": 5.518450403213501,
"epoch": 1.5121182649290021,
"grad_norm": 1.2578125,
"learning_rate": 0.00047719354844011146,
"loss": 5.2291,
"mean_token_accuracy": 0.18014201074838637,
"num_tokens": 33723823.0,
"step": 19435
},
{
"entropy": 5.546505403518677,
"epoch": 1.5125072943007196,
"grad_norm": 1.25,
"learning_rate": 0.0004771813883284434,
"loss": 5.2921,
"mean_token_accuracy": 0.1720948949456215,
"num_tokens": 33732616.0,
"step": 19440
},
{
"entropy": 5.4377992153167725,
"epoch": 1.5128963236724373,
"grad_norm": 1.3828125,
"learning_rate": 0.00047716922514899455,
"loss": 5.1294,
"mean_token_accuracy": 0.18666136711835862,
"num_tokens": 33741542.0,
"step": 19445
},
{
"entropy": 5.457616567611694,
"epoch": 1.5132853530441548,
"grad_norm": 1.3671875,
"learning_rate": 0.00047715705890194953,
"loss": 5.1871,
"mean_token_accuracy": 0.1861388474702835,
"num_tokens": 33750651.0,
"step": 19450
},
{
"entropy": 5.410335636138916,
"epoch": 1.5136743824158723,
"grad_norm": 1.2890625,
"learning_rate": 0.00047714488958749285,
"loss": 5.2371,
"mean_token_accuracy": 0.17786485701799393,
"num_tokens": 33760741.0,
"step": 19455
},
{
"entropy": 5.567200231552124,
"epoch": 1.51406341178759,
"grad_norm": 1.3671875,
"learning_rate": 0.00047713271720580924,
"loss": 5.2474,
"mean_token_accuracy": 0.17900880426168442,
"num_tokens": 33769541.0,
"step": 19460
},
{
"entropy": 5.477507400512695,
"epoch": 1.5144524411593077,
"grad_norm": 1.296875,
"learning_rate": 0.0004771205417570834,
"loss": 5.2476,
"mean_token_accuracy": 0.1848368912935257,
"num_tokens": 33778684.0,
"step": 19465
},
{
"entropy": 5.492230224609375,
"epoch": 1.5148414705310251,
"grad_norm": 1.421875,
"learning_rate": 0.00047710836324150004,
"loss": 5.24,
"mean_token_accuracy": 0.17677652537822724,
"num_tokens": 33787782.0,
"step": 19470
},
{
"entropy": 5.504099178314209,
"epoch": 1.5152304999027426,
"grad_norm": 1.3359375,
"learning_rate": 0.000477096181659244,
"loss": 5.1753,
"mean_token_accuracy": 0.1842043250799179,
"num_tokens": 33796194.0,
"step": 19475
},
{
"entropy": 5.483596515655518,
"epoch": 1.5156195292744603,
"grad_norm": 1.3515625,
"learning_rate": 0.0004770839970105,
"loss": 5.1872,
"mean_token_accuracy": 0.17996893525123597,
"num_tokens": 33804615.0,
"step": 19480
},
{
"entropy": 5.5140767097473145,
"epoch": 1.5160085586461778,
"grad_norm": 1.25,
"learning_rate": 0.00047707180929545295,
"loss": 5.2636,
"mean_token_accuracy": 0.17915041297674178,
"num_tokens": 33812937.0,
"step": 19485
},
{
"entropy": 5.48929009437561,
"epoch": 1.5163975880178953,
"grad_norm": 1.3203125,
"learning_rate": 0.00047705961851428786,
"loss": 5.1449,
"mean_token_accuracy": 0.18312469124794006,
"num_tokens": 33821454.0,
"step": 19490
},
{
"entropy": 5.522294807434082,
"epoch": 1.516786617389613,
"grad_norm": 1.1875,
"learning_rate": 0.00047704742466718973,
"loss": 5.2463,
"mean_token_accuracy": 0.1774074137210846,
"num_tokens": 33829736.0,
"step": 19495
},
{
"entropy": 5.498462343215943,
"epoch": 1.5171756467613304,
"grad_norm": 1.3828125,
"learning_rate": 0.00047703522775434354,
"loss": 5.2317,
"mean_token_accuracy": 0.1784259021282196,
"num_tokens": 33838403.0,
"step": 19500
},
{
"entropy": 5.485769462585449,
"epoch": 1.517564676133048,
"grad_norm": 1.328125,
"learning_rate": 0.00047702302777593425,
"loss": 5.2105,
"mean_token_accuracy": 0.18380846083164215,
"num_tokens": 33847149.0,
"step": 19505
},
{
"entropy": 5.495974493026734,
"epoch": 1.5179537055047656,
"grad_norm": 1.40625,
"learning_rate": 0.00047701082473214715,
"loss": 5.1671,
"mean_token_accuracy": 0.17903087437152862,
"num_tokens": 33855924.0,
"step": 19510
},
{
"entropy": 5.4521249294281,
"epoch": 1.5183427348764833,
"grad_norm": 1.2890625,
"learning_rate": 0.00047699861862316725,
"loss": 5.1845,
"mean_token_accuracy": 0.18303153961896895,
"num_tokens": 33864314.0,
"step": 19515
},
{
"entropy": 5.5172327041625975,
"epoch": 1.5187317642482008,
"grad_norm": 1.296875,
"learning_rate": 0.0004769864094491798,
"loss": 5.1342,
"mean_token_accuracy": 0.1855878695845604,
"num_tokens": 33873468.0,
"step": 19520
},
{
"entropy": 5.481070947647095,
"epoch": 1.5191207936199183,
"grad_norm": 1.3203125,
"learning_rate": 0.0004769741972103702,
"loss": 5.1984,
"mean_token_accuracy": 0.1751307800412178,
"num_tokens": 33881627.0,
"step": 19525
},
{
"entropy": 5.431173276901245,
"epoch": 1.519509822991636,
"grad_norm": 1.2265625,
"learning_rate": 0.00047696198190692353,
"loss": 5.1933,
"mean_token_accuracy": 0.17997549772262572,
"num_tokens": 33889839.0,
"step": 19530
},
{
"entropy": 5.454691219329834,
"epoch": 1.5198988523633534,
"grad_norm": 1.390625,
"learning_rate": 0.0004769497635390253,
"loss": 5.1298,
"mean_token_accuracy": 0.181427963078022,
"num_tokens": 33898370.0,
"step": 19535
},
{
"entropy": 5.530297708511353,
"epoch": 1.520287881735071,
"grad_norm": 1.328125,
"learning_rate": 0.0004769375421068608,
"loss": 5.2423,
"mean_token_accuracy": 0.17953067272901535,
"num_tokens": 33907419.0,
"step": 19540
},
{
"entropy": 5.457008409500122,
"epoch": 1.5206769111067886,
"grad_norm": 1.421875,
"learning_rate": 0.00047692531761061555,
"loss": 5.1983,
"mean_token_accuracy": 0.17364510297775268,
"num_tokens": 33915957.0,
"step": 19545
},
{
"entropy": 5.464373302459717,
"epoch": 1.521065940478506,
"grad_norm": 1.296875,
"learning_rate": 0.000476913090050475,
"loss": 5.1645,
"mean_token_accuracy": 0.18563216775655747,
"num_tokens": 33924012.0,
"step": 19550
},
{
"entropy": 5.434740447998047,
"epoch": 1.5214549698502235,
"grad_norm": 1.46875,
"learning_rate": 0.00047690085942662464,
"loss": 5.2511,
"mean_token_accuracy": 0.17466012835502626,
"num_tokens": 33932652.0,
"step": 19555
},
{
"entropy": 5.550287437438965,
"epoch": 1.5218439992219412,
"grad_norm": 1.40625,
"learning_rate": 0.00047688862573925015,
"loss": 5.1692,
"mean_token_accuracy": 0.18138314187526702,
"num_tokens": 33941208.0,
"step": 19560
},
{
"entropy": 5.445321750640869,
"epoch": 1.522233028593659,
"grad_norm": 1.2109375,
"learning_rate": 0.00047687638898853707,
"loss": 5.1502,
"mean_token_accuracy": 0.18243453800678253,
"num_tokens": 33950435.0,
"step": 19565
},
{
"entropy": 5.3997721672058105,
"epoch": 1.5226220579653764,
"grad_norm": 1.3046875,
"learning_rate": 0.0004768641491746711,
"loss": 5.1693,
"mean_token_accuracy": 0.1808338612318039,
"num_tokens": 33959659.0,
"step": 19570
},
{
"entropy": 5.441751146316529,
"epoch": 1.523011087337094,
"grad_norm": 1.2890625,
"learning_rate": 0.000476851906297838,
"loss": 5.1672,
"mean_token_accuracy": 0.17784252464771272,
"num_tokens": 33969105.0,
"step": 19575
},
{
"entropy": 5.478368711471558,
"epoch": 1.5234001167088116,
"grad_norm": 1.28125,
"learning_rate": 0.00047683966035822346,
"loss": 5.2683,
"mean_token_accuracy": 0.17877189218997955,
"num_tokens": 33977314.0,
"step": 19580
},
{
"entropy": 5.450025844573974,
"epoch": 1.523789146080529,
"grad_norm": 1.375,
"learning_rate": 0.00047682741135601336,
"loss": 5.2028,
"mean_token_accuracy": 0.18269501477479935,
"num_tokens": 33985696.0,
"step": 19585
},
{
"entropy": 5.3442751407623295,
"epoch": 1.5241781754522465,
"grad_norm": 1.296875,
"learning_rate": 0.00047681515929139356,
"loss": 4.9578,
"mean_token_accuracy": 0.19645140767097474,
"num_tokens": 33994539.0,
"step": 19590
},
{
"entropy": 5.412262201309204,
"epoch": 1.5245672048239642,
"grad_norm": 1.3203125,
"learning_rate": 0.00047680290416454995,
"loss": 5.2359,
"mean_token_accuracy": 0.17501673102378845,
"num_tokens": 34003101.0,
"step": 19595
},
{
"entropy": 5.54208197593689,
"epoch": 1.524956234195682,
"grad_norm": 1.2578125,
"learning_rate": 0.0004767906459756684,
"loss": 5.208,
"mean_token_accuracy": 0.17722005546092987,
"num_tokens": 34011344.0,
"step": 19600
},
{
"entropy": 5.4815764904022215,
"epoch": 1.5253452635673992,
"grad_norm": 1.3359375,
"learning_rate": 0.00047677838472493504,
"loss": 5.2089,
"mean_token_accuracy": 0.1827727511525154,
"num_tokens": 34019628.0,
"step": 19605
},
{
"entropy": 5.4544227600097654,
"epoch": 1.5257342929391169,
"grad_norm": 1.2265625,
"learning_rate": 0.0004767661204125358,
"loss": 5.1686,
"mean_token_accuracy": 0.18208509534597397,
"num_tokens": 34027709.0,
"step": 19610
},
{
"entropy": 5.4490618228912355,
"epoch": 1.5261233223108346,
"grad_norm": 1.4921875,
"learning_rate": 0.0004767538530386569,
"loss": 5.248,
"mean_token_accuracy": 0.17692126333713531,
"num_tokens": 34036412.0,
"step": 19615
},
{
"entropy": 5.444081544876099,
"epoch": 1.526512351682552,
"grad_norm": 1.4375,
"learning_rate": 0.00047674158260348437,
"loss": 5.1616,
"mean_token_accuracy": 0.1847056195139885,
"num_tokens": 34044842.0,
"step": 19620
},
{
"entropy": 5.406767272949219,
"epoch": 1.5269013810542695,
"grad_norm": 1.296875,
"learning_rate": 0.00047672930910720436,
"loss": 5.1213,
"mean_token_accuracy": 0.18297962546348573,
"num_tokens": 34053286.0,
"step": 19625
},
{
"entropy": 5.423502254486084,
"epoch": 1.5272904104259872,
"grad_norm": 1.2890625,
"learning_rate": 0.00047671703255000326,
"loss": 5.1654,
"mean_token_accuracy": 0.18301084488630295,
"num_tokens": 34062059.0,
"step": 19630
},
{
"entropy": 5.500806188583374,
"epoch": 1.5276794397977047,
"grad_norm": 1.3203125,
"learning_rate": 0.0004767047529320673,
"loss": 5.225,
"mean_token_accuracy": 0.17521772533655167,
"num_tokens": 34070800.0,
"step": 19635
},
{
"entropy": 5.486517095565796,
"epoch": 1.5280684691694222,
"grad_norm": 1.5546875,
"learning_rate": 0.00047669247025358257,
"loss": 5.28,
"mean_token_accuracy": 0.17450067400932312,
"num_tokens": 34079935.0,
"step": 19640
},
{
"entropy": 5.426252222061157,
"epoch": 1.5284574985411399,
"grad_norm": 1.265625,
"learning_rate": 0.00047668018451473584,
"loss": 5.1294,
"mean_token_accuracy": 0.18027275502681733,
"num_tokens": 34088614.0,
"step": 19645
},
{
"entropy": 5.4861650466918945,
"epoch": 1.5288465279128576,
"grad_norm": 1.3125,
"learning_rate": 0.0004766678957157132,
"loss": 5.1695,
"mean_token_accuracy": 0.18520078361034392,
"num_tokens": 34096899.0,
"step": 19650
},
{
"entropy": 5.498898315429687,
"epoch": 1.5292355572845748,
"grad_norm": 1.2890625,
"learning_rate": 0.0004766556038567013,
"loss": 5.2853,
"mean_token_accuracy": 0.1748550772666931,
"num_tokens": 34105936.0,
"step": 19655
},
{
"entropy": 5.44925856590271,
"epoch": 1.5296245866562925,
"grad_norm": 1.3671875,
"learning_rate": 0.0004766433089378865,
"loss": 5.1134,
"mean_token_accuracy": 0.18217934668064117,
"num_tokens": 34113675.0,
"step": 19660
},
{
"entropy": 5.437675809860229,
"epoch": 1.5300136160280102,
"grad_norm": 1.328125,
"learning_rate": 0.00047663101095945544,
"loss": 5.0417,
"mean_token_accuracy": 0.1928710386157036,
"num_tokens": 34121944.0,
"step": 19665
},
{
"entropy": 5.3499672412872314,
"epoch": 1.5304026453997277,
"grad_norm": 1.296875,
"learning_rate": 0.00047661870992159476,
"loss": 5.1546,
"mean_token_accuracy": 0.1867653787136078,
"num_tokens": 34130403.0,
"step": 19670
},
{
"entropy": 5.476577043533325,
"epoch": 1.5307916747714452,
"grad_norm": 1.5703125,
"learning_rate": 0.00047660640582449106,
"loss": 5.2835,
"mean_token_accuracy": 0.1842742756009102,
"num_tokens": 34139853.0,
"step": 19675
},
{
"entropy": 5.61764817237854,
"epoch": 1.5311807041431629,
"grad_norm": 1.4375,
"learning_rate": 0.00047659409866833104,
"loss": 5.3053,
"mean_token_accuracy": 0.18074336946010588,
"num_tokens": 34147833.0,
"step": 19680
},
{
"entropy": 5.498538589477539,
"epoch": 1.5315697335148803,
"grad_norm": 1.2421875,
"learning_rate": 0.0004765817884533014,
"loss": 5.1976,
"mean_token_accuracy": 0.18689271062612534,
"num_tokens": 34156248.0,
"step": 19685
},
{
"entropy": 5.346911430358887,
"epoch": 1.5319587628865978,
"grad_norm": 1.34375,
"learning_rate": 0.000476569475179589,
"loss": 5.043,
"mean_token_accuracy": 0.18949762880802154,
"num_tokens": 34164523.0,
"step": 19690
},
{
"entropy": 5.479613447189331,
"epoch": 1.5323477922583155,
"grad_norm": 1.296875,
"learning_rate": 0.00047655715884738074,
"loss": 5.3472,
"mean_token_accuracy": 0.17629763334989548,
"num_tokens": 34174084.0,
"step": 19695
},
{
"entropy": 5.525538158416748,
"epoch": 1.5327368216300332,
"grad_norm": 1.2109375,
"learning_rate": 0.0004765448394568632,
"loss": 5.2173,
"mean_token_accuracy": 0.17957034856081008,
"num_tokens": 34182551.0,
"step": 19700
},
{
"entropy": 5.418088054656982,
"epoch": 1.5331258510017505,
"grad_norm": 1.2578125,
"learning_rate": 0.0004765325170082237,
"loss": 5.0651,
"mean_token_accuracy": 0.18832858204841613,
"num_tokens": 34190899.0,
"step": 19705
},
{
"entropy": 5.522061109542847,
"epoch": 1.5335148803734682,
"grad_norm": 1.4921875,
"learning_rate": 0.000476520191501649,
"loss": 5.3083,
"mean_token_accuracy": 0.177359838783741,
"num_tokens": 34200394.0,
"step": 19710
},
{
"entropy": 5.611400032043457,
"epoch": 1.5339039097451859,
"grad_norm": 1.296875,
"learning_rate": 0.00047650786293732607,
"loss": 5.2874,
"mean_token_accuracy": 0.17331336587667465,
"num_tokens": 34209773.0,
"step": 19715
},
{
"entropy": 5.511234283447266,
"epoch": 1.5342929391169033,
"grad_norm": 1.328125,
"learning_rate": 0.0004764955313154421,
"loss": 5.2064,
"mean_token_accuracy": 0.17431368678808212,
"num_tokens": 34218487.0,
"step": 19720
},
{
"entropy": 5.487458896636963,
"epoch": 1.5346819684886208,
"grad_norm": 1.25,
"learning_rate": 0.00047648319663618415,
"loss": 5.2548,
"mean_token_accuracy": 0.1804940178990364,
"num_tokens": 34227309.0,
"step": 19725
},
{
"entropy": 5.503789329528809,
"epoch": 1.5350709978603385,
"grad_norm": 1.296875,
"learning_rate": 0.00047647085889973936,
"loss": 5.2114,
"mean_token_accuracy": 0.17855969667434693,
"num_tokens": 34235877.0,
"step": 19730
},
{
"entropy": 5.46956729888916,
"epoch": 1.535460027232056,
"grad_norm": 1.3671875,
"learning_rate": 0.00047645851810629503,
"loss": 5.1683,
"mean_token_accuracy": 0.1814999908208847,
"num_tokens": 34244073.0,
"step": 19735
},
{
"entropy": 5.431026744842529,
"epoch": 1.5358490566037735,
"grad_norm": 1.265625,
"learning_rate": 0.00047644617425603825,
"loss": 5.1868,
"mean_token_accuracy": 0.1871108666062355,
"num_tokens": 34252255.0,
"step": 19740
},
{
"entropy": 5.431720304489136,
"epoch": 1.5362380859754912,
"grad_norm": 1.3046875,
"learning_rate": 0.0004764338273491565,
"loss": 5.1739,
"mean_token_accuracy": 0.18503494411706925,
"num_tokens": 34261063.0,
"step": 19745
},
{
"entropy": 5.4985613346099855,
"epoch": 1.5366271153472089,
"grad_norm": 1.5,
"learning_rate": 0.00047642147738583695,
"loss": 5.2282,
"mean_token_accuracy": 0.18080779612064363,
"num_tokens": 34269072.0,
"step": 19750
},
{
"entropy": 5.572714757919312,
"epoch": 1.5370161447189261,
"grad_norm": 1.3671875,
"learning_rate": 0.0004764091243662671,
"loss": 5.2334,
"mean_token_accuracy": 0.1733746498823166,
"num_tokens": 34277845.0,
"step": 19755
},
{
"entropy": 5.364095258712768,
"epoch": 1.5374051740906438,
"grad_norm": 1.3515625,
"learning_rate": 0.00047639676829063437,
"loss": 5.045,
"mean_token_accuracy": 0.18852402567863463,
"num_tokens": 34285831.0,
"step": 19760
},
{
"entropy": 5.504438877105713,
"epoch": 1.5377942034623615,
"grad_norm": 1.3046875,
"learning_rate": 0.00047638440915912623,
"loss": 5.2508,
"mean_token_accuracy": 0.17240538448095322,
"num_tokens": 34294095.0,
"step": 19765
},
{
"entropy": 5.547203922271729,
"epoch": 1.538183232834079,
"grad_norm": 1.2890625,
"learning_rate": 0.0004763720469719303,
"loss": 5.1954,
"mean_token_accuracy": 0.18026113361120225,
"num_tokens": 34301570.0,
"step": 19770
},
{
"entropy": 5.495599031448364,
"epoch": 1.5385722622057965,
"grad_norm": 1.2734375,
"learning_rate": 0.000476359681729234,
"loss": 5.2356,
"mean_token_accuracy": 0.17696039229631425,
"num_tokens": 34310119.0,
"step": 19775
},
{
"entropy": 5.480938148498535,
"epoch": 1.5389612915775142,
"grad_norm": 1.7734375,
"learning_rate": 0.000476347313431225,
"loss": 5.1883,
"mean_token_accuracy": 0.1851821169257164,
"num_tokens": 34319622.0,
"step": 19780
},
{
"entropy": 5.452160167694092,
"epoch": 1.5393503209492316,
"grad_norm": 1.1796875,
"learning_rate": 0.00047633494207809096,
"loss": 5.1393,
"mean_token_accuracy": 0.18909958004951477,
"num_tokens": 34328376.0,
"step": 19785
},
{
"entropy": 5.44116439819336,
"epoch": 1.539739350320949,
"grad_norm": 1.2734375,
"learning_rate": 0.00047632256767001977,
"loss": 5.2084,
"mean_token_accuracy": 0.1765326291322708,
"num_tokens": 34337430.0,
"step": 19790
},
{
"entropy": 5.490219402313232,
"epoch": 1.5401283796926668,
"grad_norm": 1.28125,
"learning_rate": 0.000476310190207199,
"loss": 5.2132,
"mean_token_accuracy": 0.17990840077400208,
"num_tokens": 34345639.0,
"step": 19795
},
{
"entropy": 5.506849002838135,
"epoch": 1.5405174090643845,
"grad_norm": 1.390625,
"learning_rate": 0.00047629780968981653,
"loss": 5.2122,
"mean_token_accuracy": 0.18238580226898193,
"num_tokens": 34354083.0,
"step": 19800
},
{
"entropy": 5.418828344345092,
"epoch": 1.540906438436102,
"grad_norm": 1.2890625,
"learning_rate": 0.00047628542611806007,
"loss": 5.2057,
"mean_token_accuracy": 0.17785896956920624,
"num_tokens": 34363882.0,
"step": 19805
},
{
"entropy": 5.435290765762329,
"epoch": 1.5412954678078195,
"grad_norm": 1.46875,
"learning_rate": 0.00047627303949211773,
"loss": 5.1217,
"mean_token_accuracy": 0.1828346937894821,
"num_tokens": 34372487.0,
"step": 19810
},
{
"entropy": 5.444420289993286,
"epoch": 1.5416844971795371,
"grad_norm": 1.4375,
"learning_rate": 0.0004762606498121774,
"loss": 5.1576,
"mean_token_accuracy": 0.18511340916156768,
"num_tokens": 34380729.0,
"step": 19815
},
{
"entropy": 5.4918725967407225,
"epoch": 1.5420735265512546,
"grad_norm": 1.3984375,
"learning_rate": 0.000476248257078427,
"loss": 5.2117,
"mean_token_accuracy": 0.1794438421726227,
"num_tokens": 34390121.0,
"step": 19820
},
{
"entropy": 5.479753303527832,
"epoch": 1.542462555922972,
"grad_norm": 1.375,
"learning_rate": 0.0004762358612910547,
"loss": 5.1712,
"mean_token_accuracy": 0.1830163836479187,
"num_tokens": 34398460.0,
"step": 19825
},
{
"entropy": 5.409863662719727,
"epoch": 1.5428515852946898,
"grad_norm": 1.34375,
"learning_rate": 0.0004762234624502484,
"loss": 5.1799,
"mean_token_accuracy": 0.17674736827611923,
"num_tokens": 34407406.0,
"step": 19830
},
{
"entropy": 5.405714082717895,
"epoch": 1.5432406146664073,
"grad_norm": 1.3671875,
"learning_rate": 0.00047621106055619644,
"loss": 5.1475,
"mean_token_accuracy": 0.18271561861038207,
"num_tokens": 34416588.0,
"step": 19835
},
{
"entropy": 5.507746934890747,
"epoch": 1.5436296440381247,
"grad_norm": 1.25,
"learning_rate": 0.00047619865560908687,
"loss": 5.2173,
"mean_token_accuracy": 0.17487202882766723,
"num_tokens": 34425266.0,
"step": 19840
},
{
"entropy": 5.483136749267578,
"epoch": 1.5440186734098424,
"grad_norm": 1.3359375,
"learning_rate": 0.0004761862476091079,
"loss": 5.1389,
"mean_token_accuracy": 0.1795143261551857,
"num_tokens": 34433790.0,
"step": 19845
},
{
"entropy": 5.531909418106079,
"epoch": 1.5444077027815601,
"grad_norm": 1.4375,
"learning_rate": 0.00047617383655644785,
"loss": 5.2876,
"mean_token_accuracy": 0.17520427703857422,
"num_tokens": 34442733.0,
"step": 19850
},
{
"entropy": 5.565989542007446,
"epoch": 1.5447967321532776,
"grad_norm": 1.328125,
"learning_rate": 0.0004761614224512951,
"loss": 5.1963,
"mean_token_accuracy": 0.17827538698911666,
"num_tokens": 34451756.0,
"step": 19855
},
{
"entropy": 5.432512331008911,
"epoch": 1.545185761524995,
"grad_norm": 1.53125,
"learning_rate": 0.0004761490052938379,
"loss": 5.2104,
"mean_token_accuracy": 0.18320125043392183,
"num_tokens": 34460003.0,
"step": 19860
},
{
"entropy": 5.474145603179932,
"epoch": 1.5455747908967128,
"grad_norm": 1.28125,
"learning_rate": 0.0004761365850842646,
"loss": 5.2008,
"mean_token_accuracy": 0.18178107887506484,
"num_tokens": 34468485.0,
"step": 19865
},
{
"entropy": 5.495116233825684,
"epoch": 1.5459638202684303,
"grad_norm": 1.3359375,
"learning_rate": 0.0004761241618227639,
"loss": 5.1354,
"mean_token_accuracy": 0.184324748814106,
"num_tokens": 34477221.0,
"step": 19870
},
{
"entropy": 5.487471008300782,
"epoch": 1.5463528496401477,
"grad_norm": 1.25,
"learning_rate": 0.00047611173550952414,
"loss": 5.2695,
"mean_token_accuracy": 0.1747969314455986,
"num_tokens": 34486339.0,
"step": 19875
},
{
"entropy": 5.4889143943786625,
"epoch": 1.5467418790118654,
"grad_norm": 1.34375,
"learning_rate": 0.00047609930614473387,
"loss": 5.1477,
"mean_token_accuracy": 0.18432500660419465,
"num_tokens": 34494595.0,
"step": 19880
},
{
"entropy": 5.402968835830689,
"epoch": 1.547130908383583,
"grad_norm": 1.359375,
"learning_rate": 0.00047608687372858175,
"loss": 5.1042,
"mean_token_accuracy": 0.18374691009521485,
"num_tokens": 34502702.0,
"step": 19885
},
{
"entropy": 5.471234607696533,
"epoch": 1.5475199377553004,
"grad_norm": 1.328125,
"learning_rate": 0.00047607443826125633,
"loss": 5.2517,
"mean_token_accuracy": 0.18215447068214416,
"num_tokens": 34510828.0,
"step": 19890
},
{
"entropy": 5.5496598243713375,
"epoch": 1.547908967127018,
"grad_norm": 1.34375,
"learning_rate": 0.00047606199974294637,
"loss": 5.3267,
"mean_token_accuracy": 0.17488835752010345,
"num_tokens": 34520288.0,
"step": 19895
},
{
"entropy": 5.540404415130615,
"epoch": 1.5482979964987358,
"grad_norm": 1.3359375,
"learning_rate": 0.0004760495581738406,
"loss": 5.1778,
"mean_token_accuracy": 0.18626682013273238,
"num_tokens": 34528178.0,
"step": 19900
},
{
"entropy": 5.515796661376953,
"epoch": 1.5486870258704533,
"grad_norm": 1.421875,
"learning_rate": 0.0004760371135541278,
"loss": 5.2237,
"mean_token_accuracy": 0.17197165340185167,
"num_tokens": 34536915.0,
"step": 19905
},
{
"entropy": 5.492049074172973,
"epoch": 1.5490760552421707,
"grad_norm": 1.203125,
"learning_rate": 0.0004760246658839967,
"loss": 5.1954,
"mean_token_accuracy": 0.17590635120868683,
"num_tokens": 34545009.0,
"step": 19910
},
{
"entropy": 5.505061864852905,
"epoch": 1.5494650846138884,
"grad_norm": 1.3515625,
"learning_rate": 0.0004760122151636364,
"loss": 5.2785,
"mean_token_accuracy": 0.18025541603565215,
"num_tokens": 34553936.0,
"step": 19915
},
{
"entropy": 5.549693870544433,
"epoch": 1.549854113985606,
"grad_norm": 1.34375,
"learning_rate": 0.0004759997613932356,
"loss": 5.1699,
"mean_token_accuracy": 0.1813696250319481,
"num_tokens": 34563068.0,
"step": 19920
},
{
"entropy": 5.542169284820557,
"epoch": 1.5502431433573234,
"grad_norm": 1.234375,
"learning_rate": 0.00047598730457298335,
"loss": 5.2894,
"mean_token_accuracy": 0.17407681941986083,
"num_tokens": 34571787.0,
"step": 19925
},
{
"entropy": 5.535120296478271,
"epoch": 1.550632172729041,
"grad_norm": 1.2734375,
"learning_rate": 0.00047597484470306866,
"loss": 5.1868,
"mean_token_accuracy": 0.18009826689958572,
"num_tokens": 34580375.0,
"step": 19930
},
{
"entropy": 5.503318452835083,
"epoch": 1.5510212021007586,
"grad_norm": 1.2734375,
"learning_rate": 0.0004759623817836806,
"loss": 5.245,
"mean_token_accuracy": 0.18353112339973449,
"num_tokens": 34588762.0,
"step": 19935
},
{
"entropy": 5.447995662689209,
"epoch": 1.551410231472476,
"grad_norm": 1.3203125,
"learning_rate": 0.0004759499158150082,
"loss": 5.1248,
"mean_token_accuracy": 0.1830548956990242,
"num_tokens": 34596986.0,
"step": 19940
},
{
"entropy": 5.54951286315918,
"epoch": 1.5517992608441937,
"grad_norm": 1.4375,
"learning_rate": 0.00047593744679724076,
"loss": 5.2702,
"mean_token_accuracy": 0.17655257731676102,
"num_tokens": 34605445.0,
"step": 19945
},
{
"entropy": 5.446385192871094,
"epoch": 1.5521882902159114,
"grad_norm": 1.3046875,
"learning_rate": 0.00047592497473056733,
"loss": 5.24,
"mean_token_accuracy": 0.1844542443752289,
"num_tokens": 34614793.0,
"step": 19950
},
{
"entropy": 5.584630346298217,
"epoch": 1.552577319587629,
"grad_norm": 1.3828125,
"learning_rate": 0.00047591249961517724,
"loss": 5.3185,
"mean_token_accuracy": 0.17114103883504866,
"num_tokens": 34623790.0,
"step": 19955
},
{
"entropy": 5.517696809768677,
"epoch": 1.5529663489593464,
"grad_norm": 1.546875,
"learning_rate": 0.0004759000214512598,
"loss": 5.1859,
"mean_token_accuracy": 0.1818420946598053,
"num_tokens": 34632387.0,
"step": 19960
},
{
"entropy": 5.397317361831665,
"epoch": 1.553355378331064,
"grad_norm": 1.484375,
"learning_rate": 0.0004758875402390042,
"loss": 5.1678,
"mean_token_accuracy": 0.19219065010547637,
"num_tokens": 34640097.0,
"step": 19965
},
{
"entropy": 5.458669185638428,
"epoch": 1.5537444077027815,
"grad_norm": 1.2890625,
"learning_rate": 0.00047587505597859996,
"loss": 5.1831,
"mean_token_accuracy": 0.17667574435472488,
"num_tokens": 34649525.0,
"step": 19970
},
{
"entropy": 5.44020528793335,
"epoch": 1.554133437074499,
"grad_norm": 1.3125,
"learning_rate": 0.00047586256867023646,
"loss": 5.1297,
"mean_token_accuracy": 0.1852404221892357,
"num_tokens": 34658467.0,
"step": 19975
},
{
"entropy": 5.577917671203613,
"epoch": 1.5545224664462167,
"grad_norm": 1.375,
"learning_rate": 0.0004758500783141032,
"loss": 5.2773,
"mean_token_accuracy": 0.17768087536096572,
"num_tokens": 34666926.0,
"step": 19980
},
{
"entropy": 5.526213502883911,
"epoch": 1.5549114958179344,
"grad_norm": 1.6015625,
"learning_rate": 0.0004758375849103897,
"loss": 5.2087,
"mean_token_accuracy": 0.18167522102594375,
"num_tokens": 34675023.0,
"step": 19985
},
{
"entropy": 5.419299173355102,
"epoch": 1.5553005251896517,
"grad_norm": 1.5625,
"learning_rate": 0.0004758250884592855,
"loss": 5.1438,
"mean_token_accuracy": 0.18262318074703215,
"num_tokens": 34683191.0,
"step": 19990
},
{
"entropy": 5.514609670639038,
"epoch": 1.5556895545613694,
"grad_norm": 1.5,
"learning_rate": 0.00047581258896098024,
"loss": 5.1846,
"mean_token_accuracy": 0.18850539922714232,
"num_tokens": 34691899.0,
"step": 19995
},
{
"entropy": 5.509262943267823,
"epoch": 1.556078583933087,
"grad_norm": 1.484375,
"learning_rate": 0.0004758000864156636,
"loss": 5.2475,
"mean_token_accuracy": 0.17835673689842224,
"num_tokens": 34700942.0,
"step": 20000
},
{
"entropy": 5.5044395446777346,
"epoch": 1.5564676133048045,
"grad_norm": 1.3515625,
"learning_rate": 0.00047578758082352527,
"loss": 5.2879,
"mean_token_accuracy": 0.1785033419728279,
"num_tokens": 34710780.0,
"step": 20005
},
{
"entropy": 5.49509072303772,
"epoch": 1.556856642676522,
"grad_norm": 1.453125,
"learning_rate": 0.00047577507218475487,
"loss": 5.2164,
"mean_token_accuracy": 0.17685188353061676,
"num_tokens": 34719332.0,
"step": 20010
},
{
"entropy": 5.545003652572632,
"epoch": 1.5572456720482397,
"grad_norm": 1.3359375,
"learning_rate": 0.00047576256049954236,
"loss": 5.2716,
"mean_token_accuracy": 0.16867067515850068,
"num_tokens": 34727890.0,
"step": 20015
},
{
"entropy": 5.507272338867187,
"epoch": 1.5576347014199572,
"grad_norm": 1.25,
"learning_rate": 0.0004757500457680776,
"loss": 5.2147,
"mean_token_accuracy": 0.18060846477746964,
"num_tokens": 34736942.0,
"step": 20020
},
{
"entropy": 5.455156087875366,
"epoch": 1.5580237307916747,
"grad_norm": 1.4453125,
"learning_rate": 0.0004757375279905504,
"loss": 5.0807,
"mean_token_accuracy": 0.18964427560567856,
"num_tokens": 34745612.0,
"step": 20025
},
{
"entropy": 5.459772968292237,
"epoch": 1.5584127601633924,
"grad_norm": 1.5078125,
"learning_rate": 0.00047572500716715075,
"loss": 5.1761,
"mean_token_accuracy": 0.17480820119380952,
"num_tokens": 34754276.0,
"step": 20030
},
{
"entropy": 5.408022832870484,
"epoch": 1.55880178953511,
"grad_norm": 1.390625,
"learning_rate": 0.00047571248329806855,
"loss": 5.0851,
"mean_token_accuracy": 0.19091185331344604,
"num_tokens": 34762042.0,
"step": 20035
},
{
"entropy": 5.4226601123809814,
"epoch": 1.5591908189068273,
"grad_norm": 1.34375,
"learning_rate": 0.00047569995638349383,
"loss": 5.1381,
"mean_token_accuracy": 0.18298070281744003,
"num_tokens": 34770172.0,
"step": 20040
},
{
"entropy": 5.468042612075806,
"epoch": 1.559579848278545,
"grad_norm": 1.296875,
"learning_rate": 0.0004756874264236168,
"loss": 5.1465,
"mean_token_accuracy": 0.17935450673103331,
"num_tokens": 34778647.0,
"step": 20045
},
{
"entropy": 5.456257677078247,
"epoch": 1.5599688776502627,
"grad_norm": 1.28125,
"learning_rate": 0.00047567489341862753,
"loss": 5.1715,
"mean_token_accuracy": 0.18207741528749466,
"num_tokens": 34787409.0,
"step": 20050
},
{
"entropy": 5.528086948394775,
"epoch": 1.5603579070219802,
"grad_norm": 1.34375,
"learning_rate": 0.00047566235736871607,
"loss": 5.26,
"mean_token_accuracy": 0.17863278985023498,
"num_tokens": 34795634.0,
"step": 20055
},
{
"entropy": 5.430089521408081,
"epoch": 1.5607469363936977,
"grad_norm": 1.3125,
"learning_rate": 0.00047564981827407277,
"loss": 5.1169,
"mean_token_accuracy": 0.18615238815546037,
"num_tokens": 34803803.0,
"step": 20060
},
{
"entropy": 5.479111433029175,
"epoch": 1.5611359657654154,
"grad_norm": 1.2578125,
"learning_rate": 0.00047563727613488785,
"loss": 5.1208,
"mean_token_accuracy": 0.18263283669948577,
"num_tokens": 34813202.0,
"step": 20065
},
{
"entropy": 5.456806564331055,
"epoch": 1.5615249951371328,
"grad_norm": 1.421875,
"learning_rate": 0.00047562473095135154,
"loss": 5.2443,
"mean_token_accuracy": 0.17681720703840256,
"num_tokens": 34821717.0,
"step": 20070
},
{
"entropy": 5.437485980987549,
"epoch": 1.5619140245088503,
"grad_norm": 1.359375,
"learning_rate": 0.0004756121827236544,
"loss": 5.1429,
"mean_token_accuracy": 0.18623988777399064,
"num_tokens": 34830366.0,
"step": 20075
},
{
"entropy": 5.46750659942627,
"epoch": 1.562303053880568,
"grad_norm": 1.296875,
"learning_rate": 0.0004755996314519866,
"loss": 5.2125,
"mean_token_accuracy": 0.18663814812898635,
"num_tokens": 34838734.0,
"step": 20080
},
{
"entropy": 5.441515922546387,
"epoch": 1.5626920832522857,
"grad_norm": 1.328125,
"learning_rate": 0.0004755870771365387,
"loss": 5.1099,
"mean_token_accuracy": 0.18490248173475266,
"num_tokens": 34846873.0,
"step": 20085
},
{
"entropy": 5.49475884437561,
"epoch": 1.563081112624003,
"grad_norm": 1.234375,
"learning_rate": 0.00047557451977750113,
"loss": 5.1646,
"mean_token_accuracy": 0.18140379935503007,
"num_tokens": 34855542.0,
"step": 20090
},
{
"entropy": 5.445983028411865,
"epoch": 1.5634701419957207,
"grad_norm": 1.3359375,
"learning_rate": 0.0004755619593750645,
"loss": 5.132,
"mean_token_accuracy": 0.18272922784090043,
"num_tokens": 34864656.0,
"step": 20095
},
{
"entropy": 5.4873534679412845,
"epoch": 1.5638591713674383,
"grad_norm": 1.578125,
"learning_rate": 0.0004755493959294194,
"loss": 5.2385,
"mean_token_accuracy": 0.17879534065723418,
"num_tokens": 34873891.0,
"step": 20100
},
{
"entropy": 5.546848249435425,
"epoch": 1.5642482007391558,
"grad_norm": 1.421875,
"learning_rate": 0.0004755368294407564,
"loss": 5.2312,
"mean_token_accuracy": 0.17930146902799607,
"num_tokens": 34883278.0,
"step": 20105
},
{
"entropy": 5.41421914100647,
"epoch": 1.5646372301108733,
"grad_norm": 1.2890625,
"learning_rate": 0.0004755242599092662,
"loss": 5.1279,
"mean_token_accuracy": 0.17887418419122697,
"num_tokens": 34892323.0,
"step": 20110
},
{
"entropy": 5.465075826644897,
"epoch": 1.565026259482591,
"grad_norm": 1.3125,
"learning_rate": 0.00047551168733513956,
"loss": 5.1851,
"mean_token_accuracy": 0.17728228271007537,
"num_tokens": 34901774.0,
"step": 20115
},
{
"entropy": 5.545860385894775,
"epoch": 1.5654152888543085,
"grad_norm": 1.34375,
"learning_rate": 0.00047549911171856717,
"loss": 5.1976,
"mean_token_accuracy": 0.1806068405508995,
"num_tokens": 34911082.0,
"step": 20120
},
{
"entropy": 5.490971231460572,
"epoch": 1.565804318226026,
"grad_norm": 1.359375,
"learning_rate": 0.0004754865330597398,
"loss": 5.2061,
"mean_token_accuracy": 0.18051420599222184,
"num_tokens": 34919631.0,
"step": 20125
},
{
"entropy": 5.535692453384399,
"epoch": 1.5661933475977436,
"grad_norm": 1.4296875,
"learning_rate": 0.00047547395135884854,
"loss": 5.2087,
"mean_token_accuracy": 0.1791385143995285,
"num_tokens": 34928258.0,
"step": 20130
},
{
"entropy": 5.481483840942383,
"epoch": 1.5665823769694613,
"grad_norm": 1.9140625,
"learning_rate": 0.0004754613666160841,
"loss": 5.1922,
"mean_token_accuracy": 0.18388463705778121,
"num_tokens": 34936590.0,
"step": 20135
},
{
"entropy": 5.462180948257446,
"epoch": 1.5669714063411786,
"grad_norm": 1.3125,
"learning_rate": 0.00047544877883163753,
"loss": 5.2088,
"mean_token_accuracy": 0.17439429759979247,
"num_tokens": 34945468.0,
"step": 20140
},
{
"entropy": 5.412143993377685,
"epoch": 1.5673604357128963,
"grad_norm": 1.8203125,
"learning_rate": 0.00047543618800569975,
"loss": 5.1265,
"mean_token_accuracy": 0.18731385320425034,
"num_tokens": 34954005.0,
"step": 20145
},
{
"entropy": 5.364945936203003,
"epoch": 1.567749465084614,
"grad_norm": 1.28125,
"learning_rate": 0.00047542359413846184,
"loss": 5.1444,
"mean_token_accuracy": 0.18193342238664628,
"num_tokens": 34962852.0,
"step": 20150
},
{
"entropy": 5.479076814651489,
"epoch": 1.5681384944563315,
"grad_norm": 1.375,
"learning_rate": 0.0004754109972301149,
"loss": 5.2003,
"mean_token_accuracy": 0.17850263118743898,
"num_tokens": 34971718.0,
"step": 20155
},
{
"entropy": 5.496933317184448,
"epoch": 1.568527523828049,
"grad_norm": 1.3046875,
"learning_rate": 0.00047539839728085007,
"loss": 5.1171,
"mean_token_accuracy": 0.1883447512984276,
"num_tokens": 34980155.0,
"step": 20160
},
{
"entropy": 5.515892601013183,
"epoch": 1.5689165531997666,
"grad_norm": 1.34375,
"learning_rate": 0.0004753857942908585,
"loss": 5.3715,
"mean_token_accuracy": 0.16563240736722945,
"num_tokens": 34989971.0,
"step": 20165
},
{
"entropy": 5.439229297637939,
"epoch": 1.5693055825714841,
"grad_norm": 1.34375,
"learning_rate": 0.0004753731882603315,
"loss": 5.1607,
"mean_token_accuracy": 0.17715786248445511,
"num_tokens": 34998760.0,
"step": 20170
},
{
"entropy": 5.479458665847778,
"epoch": 1.5696946119432016,
"grad_norm": 1.578125,
"learning_rate": 0.00047536057918946026,
"loss": 5.2129,
"mean_token_accuracy": 0.181034417450428,
"num_tokens": 35008020.0,
"step": 20175
},
{
"entropy": 5.388949680328369,
"epoch": 1.5700836413149193,
"grad_norm": 1.515625,
"learning_rate": 0.0004753479670784361,
"loss": 5.1018,
"mean_token_accuracy": 0.18547747284173965,
"num_tokens": 35016357.0,
"step": 20180
},
{
"entropy": 5.439433670043945,
"epoch": 1.570472670686637,
"grad_norm": 1.3984375,
"learning_rate": 0.0004753353519274505,
"loss": 5.2026,
"mean_token_accuracy": 0.18218655735254288,
"num_tokens": 35025312.0,
"step": 20185
},
{
"entropy": 5.425490427017212,
"epoch": 1.5708617000583545,
"grad_norm": 1.3125,
"learning_rate": 0.0004753227337366948,
"loss": 5.244,
"mean_token_accuracy": 0.1861625462770462,
"num_tokens": 35033781.0,
"step": 20190
},
{
"entropy": 5.528507804870605,
"epoch": 1.571250729430072,
"grad_norm": 1.4609375,
"learning_rate": 0.00047531011250636046,
"loss": 5.2653,
"mean_token_accuracy": 0.17623920142650604,
"num_tokens": 35042884.0,
"step": 20195
},
{
"entropy": 5.52542724609375,
"epoch": 1.5716397588017896,
"grad_norm": 1.359375,
"learning_rate": 0.00047529748823663896,
"loss": 5.1287,
"mean_token_accuracy": 0.1856717973947525,
"num_tokens": 35051789.0,
"step": 20200
},
{
"entropy": 5.483914804458618,
"epoch": 1.572028788173507,
"grad_norm": 1.328125,
"learning_rate": 0.0004752848609277219,
"loss": 5.2065,
"mean_token_accuracy": 0.18556610643863677,
"num_tokens": 35059958.0,
"step": 20205
},
{
"entropy": 5.504895973205566,
"epoch": 1.5724178175452246,
"grad_norm": 1.4765625,
"learning_rate": 0.00047527223057980086,
"loss": 5.1815,
"mean_token_accuracy": 0.17927256971597672,
"num_tokens": 35068384.0,
"step": 20210
},
{
"entropy": 5.541245460510254,
"epoch": 1.5728068469169423,
"grad_norm": 1.4609375,
"learning_rate": 0.00047525959719306736,
"loss": 5.2638,
"mean_token_accuracy": 0.17057959586381913,
"num_tokens": 35076660.0,
"step": 20215
},
{
"entropy": 5.4924084663391115,
"epoch": 1.5731958762886598,
"grad_norm": 1.4765625,
"learning_rate": 0.0004752469607677134,
"loss": 5.1652,
"mean_token_accuracy": 0.178454253077507,
"num_tokens": 35085527.0,
"step": 20220
},
{
"entropy": 5.4322062015533445,
"epoch": 1.5735849056603772,
"grad_norm": 1.2890625,
"learning_rate": 0.0004752343213039305,
"loss": 5.1585,
"mean_token_accuracy": 0.17887477427721024,
"num_tokens": 35094066.0,
"step": 20225
},
{
"entropy": 5.5089866638183596,
"epoch": 1.573973935032095,
"grad_norm": 1.390625,
"learning_rate": 0.0004752216788019104,
"loss": 5.3163,
"mean_token_accuracy": 0.16887042671442032,
"num_tokens": 35103219.0,
"step": 20230
},
{
"entropy": 5.527264547348023,
"epoch": 1.5743629644038126,
"grad_norm": 1.390625,
"learning_rate": 0.0004752090332618451,
"loss": 5.2206,
"mean_token_accuracy": 0.17967237383127213,
"num_tokens": 35111336.0,
"step": 20235
},
{
"entropy": 5.483721399307251,
"epoch": 1.57475199377553,
"grad_norm": 1.296875,
"learning_rate": 0.0004751963846839263,
"loss": 5.1584,
"mean_token_accuracy": 0.18572721481323243,
"num_tokens": 35119758.0,
"step": 20240
},
{
"entropy": 5.38640456199646,
"epoch": 1.5751410231472476,
"grad_norm": 1.7421875,
"learning_rate": 0.00047518373306834605,
"loss": 5.0832,
"mean_token_accuracy": 0.18867708444595338,
"num_tokens": 35128535.0,
"step": 20245
},
{
"entropy": 5.4226783275604244,
"epoch": 1.5755300525189653,
"grad_norm": 1.421875,
"learning_rate": 0.00047517107841529626,
"loss": 5.2642,
"mean_token_accuracy": 0.17584407925605774,
"num_tokens": 35137443.0,
"step": 20250
},
{
"entropy": 5.431370878219605,
"epoch": 1.5759190818906827,
"grad_norm": 1.3046875,
"learning_rate": 0.000475158420724969,
"loss": 5.0463,
"mean_token_accuracy": 0.18866675347089767,
"num_tokens": 35145801.0,
"step": 20255
},
{
"entropy": 5.540943908691406,
"epoch": 1.5763081112624002,
"grad_norm": 1.375,
"learning_rate": 0.00047514575999755627,
"loss": 5.2942,
"mean_token_accuracy": 0.17408110797405243,
"num_tokens": 35154661.0,
"step": 20260
},
{
"entropy": 5.511713886260987,
"epoch": 1.576697140634118,
"grad_norm": 1.3984375,
"learning_rate": 0.00047513309623325024,
"loss": 5.2793,
"mean_token_accuracy": 0.17403359711170197,
"num_tokens": 35163762.0,
"step": 20265
},
{
"entropy": 5.441919994354248,
"epoch": 1.5770861700058354,
"grad_norm": 1.5078125,
"learning_rate": 0.0004751204294322429,
"loss": 5.1797,
"mean_token_accuracy": 0.1780450239777565,
"num_tokens": 35172059.0,
"step": 20270
},
{
"entropy": 5.472014665603638,
"epoch": 1.5774751993775529,
"grad_norm": 1.5078125,
"learning_rate": 0.00047510775959472675,
"loss": 5.2504,
"mean_token_accuracy": 0.17407365143299103,
"num_tokens": 35179805.0,
"step": 20275
},
{
"entropy": 5.455626392364502,
"epoch": 1.5778642287492706,
"grad_norm": 1.4921875,
"learning_rate": 0.0004750950867208937,
"loss": 5.2072,
"mean_token_accuracy": 0.1857330769300461,
"num_tokens": 35188136.0,
"step": 20280
},
{
"entropy": 5.592495155334473,
"epoch": 1.5782532581209883,
"grad_norm": 1.3203125,
"learning_rate": 0.0004750824108109362,
"loss": 5.2933,
"mean_token_accuracy": 0.17318070828914642,
"num_tokens": 35196577.0,
"step": 20285
},
{
"entropy": 5.416881084442139,
"epoch": 1.5786422874927057,
"grad_norm": 1.203125,
"learning_rate": 0.0004750697318650466,
"loss": 5.1981,
"mean_token_accuracy": 0.17965558916330338,
"num_tokens": 35205223.0,
"step": 20290
},
{
"entropy": 5.510413932800293,
"epoch": 1.5790313168644232,
"grad_norm": 1.2890625,
"learning_rate": 0.0004750570498834173,
"loss": 5.2692,
"mean_token_accuracy": 0.17673759013414383,
"num_tokens": 35213776.0,
"step": 20295
},
{
"entropy": 5.4544912815094,
"epoch": 1.579420346236141,
"grad_norm": 1.296875,
"learning_rate": 0.0004750443648662407,
"loss": 5.1789,
"mean_token_accuracy": 0.18731918185949326,
"num_tokens": 35222596.0,
"step": 20300
},
{
"entropy": 5.553009176254273,
"epoch": 1.5798093756078584,
"grad_norm": 1.3671875,
"learning_rate": 0.00047503167681370924,
"loss": 5.3616,
"mean_token_accuracy": 0.16760940849781036,
"num_tokens": 35232402.0,
"step": 20305
},
{
"entropy": 5.453909683227539,
"epoch": 1.5801984049795759,
"grad_norm": 1.390625,
"learning_rate": 0.0004750189857260154,
"loss": 5.1,
"mean_token_accuracy": 0.19228098243474961,
"num_tokens": 35240651.0,
"step": 20310
},
{
"entropy": 5.410676622390747,
"epoch": 1.5805874343512936,
"grad_norm": 1.5078125,
"learning_rate": 0.0004750062916033519,
"loss": 5.13,
"mean_token_accuracy": 0.18499166667461395,
"num_tokens": 35249101.0,
"step": 20315
},
{
"entropy": 5.456141519546509,
"epoch": 1.580976463723011,
"grad_norm": 1.359375,
"learning_rate": 0.0004749935944459113,
"loss": 5.2747,
"mean_token_accuracy": 0.173062002658844,
"num_tokens": 35257909.0,
"step": 20320
},
{
"entropy": 5.538648986816407,
"epoch": 1.5813654930947285,
"grad_norm": 1.3203125,
"learning_rate": 0.0004749808942538862,
"loss": 5.3066,
"mean_token_accuracy": 0.17200930565595626,
"num_tokens": 35267128.0,
"step": 20325
},
{
"entropy": 5.515222454071045,
"epoch": 1.5817545224664462,
"grad_norm": 1.328125,
"learning_rate": 0.0004749681910274693,
"loss": 5.1942,
"mean_token_accuracy": 0.1811247080564499,
"num_tokens": 35275751.0,
"step": 20330
},
{
"entropy": 5.457746934890747,
"epoch": 1.582143551838164,
"grad_norm": 1.328125,
"learning_rate": 0.00047495548476685334,
"loss": 5.1146,
"mean_token_accuracy": 0.18918879479169845,
"num_tokens": 35285359.0,
"step": 20335
},
{
"entropy": 5.3944993019104,
"epoch": 1.5825325812098814,
"grad_norm": 1.484375,
"learning_rate": 0.00047494277547223125,
"loss": 5.114,
"mean_token_accuracy": 0.1809425249695778,
"num_tokens": 35293691.0,
"step": 20340
},
{
"entropy": 5.427465391159058,
"epoch": 1.5829216105815989,
"grad_norm": 1.2578125,
"learning_rate": 0.00047493006314379573,
"loss": 5.1423,
"mean_token_accuracy": 0.18757483810186387,
"num_tokens": 35302751.0,
"step": 20345
},
{
"entropy": 5.494105577468872,
"epoch": 1.5833106399533166,
"grad_norm": 1.375,
"learning_rate": 0.00047491734778173976,
"loss": 5.2123,
"mean_token_accuracy": 0.17558159977197646,
"num_tokens": 35311849.0,
"step": 20350
},
{
"entropy": 5.402540111541748,
"epoch": 1.583699669325034,
"grad_norm": 1.453125,
"learning_rate": 0.00047490462938625617,
"loss": 5.1598,
"mean_token_accuracy": 0.18622606098651887,
"num_tokens": 35320248.0,
"step": 20355
},
{
"entropy": 5.487895250320435,
"epoch": 1.5840886986967515,
"grad_norm": 1.2421875,
"learning_rate": 0.00047489190795753806,
"loss": 5.1401,
"mean_token_accuracy": 0.1911189526319504,
"num_tokens": 35328565.0,
"step": 20360
},
{
"entropy": 5.429814243316651,
"epoch": 1.5844777280684692,
"grad_norm": 1.34375,
"learning_rate": 0.0004748791834957784,
"loss": 5.1606,
"mean_token_accuracy": 0.1863364428281784,
"num_tokens": 35337828.0,
"step": 20365
},
{
"entropy": 5.470037126541138,
"epoch": 1.5848667574401867,
"grad_norm": 1.28125,
"learning_rate": 0.00047486645600117037,
"loss": 5.2448,
"mean_token_accuracy": 0.1784466713666916,
"num_tokens": 35347107.0,
"step": 20370
},
{
"entropy": 5.512237119674682,
"epoch": 1.5852557868119042,
"grad_norm": 1.3359375,
"learning_rate": 0.0004748537254739068,
"loss": 5.179,
"mean_token_accuracy": 0.18304122388362884,
"num_tokens": 35355925.0,
"step": 20375
},
{
"entropy": 5.44460506439209,
"epoch": 1.5856448161836219,
"grad_norm": 1.375,
"learning_rate": 0.0004748409919141812,
"loss": 5.1413,
"mean_token_accuracy": 0.18456193506717683,
"num_tokens": 35364319.0,
"step": 20380
},
{
"entropy": 5.4104071140289305,
"epoch": 1.5860338455553395,
"grad_norm": 1.328125,
"learning_rate": 0.0004748282553221865,
"loss": 5.1015,
"mean_token_accuracy": 0.1901659831404686,
"num_tokens": 35372358.0,
"step": 20385
},
{
"entropy": 5.497802495956421,
"epoch": 1.586422874927057,
"grad_norm": 1.3828125,
"learning_rate": 0.0004748155156981162,
"loss": 5.3238,
"mean_token_accuracy": 0.168743734061718,
"num_tokens": 35381301.0,
"step": 20390
},
{
"entropy": 5.4645380020141605,
"epoch": 1.5868119042987745,
"grad_norm": 1.421875,
"learning_rate": 0.00047480277304216346,
"loss": 5.1385,
"mean_token_accuracy": 0.1789548933506012,
"num_tokens": 35389778.0,
"step": 20395
},
{
"entropy": 5.408751773834228,
"epoch": 1.5872009336704922,
"grad_norm": 1.3125,
"learning_rate": 0.00047479002735452164,
"loss": 5.1073,
"mean_token_accuracy": 0.18414198011159896,
"num_tokens": 35397926.0,
"step": 20400
},
{
"entropy": 5.4239739894866945,
"epoch": 1.5875899630422097,
"grad_norm": 1.296875,
"learning_rate": 0.00047477727863538415,
"loss": 5.149,
"mean_token_accuracy": 0.18654552549123765,
"num_tokens": 35406462.0,
"step": 20405
},
{
"entropy": 5.495453214645385,
"epoch": 1.5879789924139271,
"grad_norm": 1.328125,
"learning_rate": 0.00047476452688494444,
"loss": 5.1577,
"mean_token_accuracy": 0.18202903121709824,
"num_tokens": 35414989.0,
"step": 20410
},
{
"entropy": 5.457301902770996,
"epoch": 1.5883680217856448,
"grad_norm": 1.34375,
"learning_rate": 0.000474751772103396,
"loss": 5.1523,
"mean_token_accuracy": 0.1885913297533989,
"num_tokens": 35423738.0,
"step": 20415
},
{
"entropy": 5.492164659500122,
"epoch": 1.5887570511573625,
"grad_norm": 1.3515625,
"learning_rate": 0.0004747390142909323,
"loss": 5.2033,
"mean_token_accuracy": 0.17635703086853027,
"num_tokens": 35432377.0,
"step": 20420
},
{
"entropy": 5.41399245262146,
"epoch": 1.5891460805290798,
"grad_norm": 1.296875,
"learning_rate": 0.00047472625344774713,
"loss": 5.1752,
"mean_token_accuracy": 0.18544546365737916,
"num_tokens": 35441188.0,
"step": 20425
},
{
"entropy": 5.438808822631836,
"epoch": 1.5895351099007975,
"grad_norm": 1.453125,
"learning_rate": 0.00047471348957403374,
"loss": 5.2557,
"mean_token_accuracy": 0.17948213666677476,
"num_tokens": 35449715.0,
"step": 20430
},
{
"entropy": 5.454863548278809,
"epoch": 1.5899241392725152,
"grad_norm": 1.34375,
"learning_rate": 0.0004747007226699862,
"loss": 5.1931,
"mean_token_accuracy": 0.1849524959921837,
"num_tokens": 35458420.0,
"step": 20435
},
{
"entropy": 5.465144348144531,
"epoch": 1.5903131686442327,
"grad_norm": 1.4609375,
"learning_rate": 0.00047468795273579803,
"loss": 5.1006,
"mean_token_accuracy": 0.19094710052013397,
"num_tokens": 35467072.0,
"step": 20440
},
{
"entropy": 5.471920299530029,
"epoch": 1.5907021980159501,
"grad_norm": 1.3203125,
"learning_rate": 0.0004746751797716629,
"loss": 5.1772,
"mean_token_accuracy": 0.18365492522716523,
"num_tokens": 35475539.0,
"step": 20445
},
{
"entropy": 5.495706987380982,
"epoch": 1.5910912273876678,
"grad_norm": 1.53125,
"learning_rate": 0.0004746624037777748,
"loss": 5.1997,
"mean_token_accuracy": 0.18149741888046264,
"num_tokens": 35484260.0,
"step": 20450
},
{
"entropy": 5.415353107452392,
"epoch": 1.5914802567593853,
"grad_norm": 1.375,
"learning_rate": 0.00047464962475432754,
"loss": 5.1159,
"mean_token_accuracy": 0.18603166788816453,
"num_tokens": 35492539.0,
"step": 20455
},
{
"entropy": 5.497933721542358,
"epoch": 1.5918692861311028,
"grad_norm": 1.34375,
"learning_rate": 0.000474636842701515,
"loss": 5.2893,
"mean_token_accuracy": 0.17149089574813842,
"num_tokens": 35502008.0,
"step": 20460
},
{
"entropy": 5.465149354934693,
"epoch": 1.5922583155028205,
"grad_norm": 1.484375,
"learning_rate": 0.0004746240576195311,
"loss": 5.1233,
"mean_token_accuracy": 0.1890583336353302,
"num_tokens": 35510677.0,
"step": 20465
},
{
"entropy": 5.435738182067871,
"epoch": 1.5926473448745382,
"grad_norm": 1.453125,
"learning_rate": 0.00047461126950856987,
"loss": 5.1708,
"mean_token_accuracy": 0.18259909898042678,
"num_tokens": 35519368.0,
"step": 20470
},
{
"entropy": 5.5418288230896,
"epoch": 1.5930363742462554,
"grad_norm": 1.5390625,
"learning_rate": 0.0004745984783688253,
"loss": 5.3106,
"mean_token_accuracy": 0.1746356949210167,
"num_tokens": 35527952.0,
"step": 20475
},
{
"entropy": 5.5789844512939455,
"epoch": 1.5934254036179731,
"grad_norm": 1.421875,
"learning_rate": 0.00047458568420049153,
"loss": 5.2345,
"mean_token_accuracy": 0.1773173391819,
"num_tokens": 35537806.0,
"step": 20480
},
{
"entropy": 5.429643726348877,
"epoch": 1.5938144329896908,
"grad_norm": 1.375,
"learning_rate": 0.00047457288700376274,
"loss": 5.0493,
"mean_token_accuracy": 0.1828259587287903,
"num_tokens": 35546135.0,
"step": 20485
},
{
"entropy": 5.332148456573487,
"epoch": 1.5942034623614083,
"grad_norm": 1.296875,
"learning_rate": 0.00047456008677883304,
"loss": 5.151,
"mean_token_accuracy": 0.18037886321544647,
"num_tokens": 35555065.0,
"step": 20490
},
{
"entropy": 5.447528123855591,
"epoch": 1.5945924917331258,
"grad_norm": 1.375,
"learning_rate": 0.0004745472835258966,
"loss": 5.2539,
"mean_token_accuracy": 0.17747115939855576,
"num_tokens": 35564222.0,
"step": 20495
},
{
"entropy": 5.530115222930908,
"epoch": 1.5949815211048435,
"grad_norm": 1.421875,
"learning_rate": 0.00047453447724514773,
"loss": 5.2131,
"mean_token_accuracy": 0.1767485111951828,
"num_tokens": 35573021.0,
"step": 20500
},
{
"entropy": 5.499778366088867,
"epoch": 1.595370550476561,
"grad_norm": 1.390625,
"learning_rate": 0.0004745216679367808,
"loss": 5.2654,
"mean_token_accuracy": 0.17927251011133194,
"num_tokens": 35581105.0,
"step": 20505
},
{
"entropy": 5.534879398345947,
"epoch": 1.5957595798482784,
"grad_norm": 1.3515625,
"learning_rate": 0.0004745088556009901,
"loss": 5.2848,
"mean_token_accuracy": 0.17313258796930314,
"num_tokens": 35590169.0,
"step": 20510
},
{
"entropy": 5.509119081497192,
"epoch": 1.5961486092199961,
"grad_norm": 1.359375,
"learning_rate": 0.0004744960402379701,
"loss": 5.1735,
"mean_token_accuracy": 0.19020876437425613,
"num_tokens": 35598760.0,
"step": 20515
},
{
"entropy": 5.531984186172485,
"epoch": 1.5965376385917138,
"grad_norm": 1.390625,
"learning_rate": 0.00047448322184791525,
"loss": 5.2018,
"mean_token_accuracy": 0.18199270069599152,
"num_tokens": 35607014.0,
"step": 20520
},
{
"entropy": 5.511300802230835,
"epoch": 1.596926667963431,
"grad_norm": 1.2421875,
"learning_rate": 0.00047447040043101994,
"loss": 5.213,
"mean_token_accuracy": 0.17538028508424758,
"num_tokens": 35615319.0,
"step": 20525
},
{
"entropy": 5.4404603958129885,
"epoch": 1.5973156973351488,
"grad_norm": 1.2578125,
"learning_rate": 0.00047445757598747886,
"loss": 5.215,
"mean_token_accuracy": 0.18172764033079147,
"num_tokens": 35623836.0,
"step": 20530
},
{
"entropy": 5.421029853820801,
"epoch": 1.5977047267068665,
"grad_norm": 1.328125,
"learning_rate": 0.0004744447485174864,
"loss": 5.0859,
"mean_token_accuracy": 0.18272554874420166,
"num_tokens": 35632601.0,
"step": 20535
},
{
"entropy": 5.571485471725464,
"epoch": 1.598093756078584,
"grad_norm": 1.7578125,
"learning_rate": 0.00047443191802123746,
"loss": 5.291,
"mean_token_accuracy": 0.17192058265209198,
"num_tokens": 35642035.0,
"step": 20540
},
{
"entropy": 5.481582975387573,
"epoch": 1.5984827854503014,
"grad_norm": 2.03125,
"learning_rate": 0.00047441908449892664,
"loss": 5.1718,
"mean_token_accuracy": 0.1844406709074974,
"num_tokens": 35650454.0,
"step": 20545
},
{
"entropy": 5.499776601791382,
"epoch": 1.5988718148220191,
"grad_norm": 1.3984375,
"learning_rate": 0.00047440624795074855,
"loss": 5.2438,
"mean_token_accuracy": 0.18200285136699676,
"num_tokens": 35658945.0,
"step": 20550
},
{
"entropy": 5.4507087707519535,
"epoch": 1.5992608441937366,
"grad_norm": 1.40625,
"learning_rate": 0.00047439340837689804,
"loss": 5.2161,
"mean_token_accuracy": 0.18007699772715569,
"num_tokens": 35667193.0,
"step": 20555
},
{
"entropy": 5.406033706665039,
"epoch": 1.599649873565454,
"grad_norm": 1.3203125,
"learning_rate": 0.00047438056577756986,
"loss": 5.0829,
"mean_token_accuracy": 0.1861460790038109,
"num_tokens": 35676100.0,
"step": 20560
},
{
"entropy": 5.486457681655883,
"epoch": 1.6000389029371718,
"grad_norm": 1.234375,
"learning_rate": 0.00047436772015295903,
"loss": 5.1941,
"mean_token_accuracy": 0.17660576105117798,
"num_tokens": 35684352.0,
"step": 20565
},
{
"entropy": 5.492393493652344,
"epoch": 1.6004279323088895,
"grad_norm": 1.3046875,
"learning_rate": 0.00047435487150326036,
"loss": 5.1623,
"mean_token_accuracy": 0.18603489249944688,
"num_tokens": 35693044.0,
"step": 20570
},
{
"entropy": 5.397309875488281,
"epoch": 1.6008169616806067,
"grad_norm": 1.5234375,
"learning_rate": 0.0004743420198286688,
"loss": 5.1314,
"mean_token_accuracy": 0.19199467450380325,
"num_tokens": 35701172.0,
"step": 20575
},
{
"entropy": 5.503251695632935,
"epoch": 1.6012059910523244,
"grad_norm": 1.3046875,
"learning_rate": 0.00047432916512937936,
"loss": 5.2305,
"mean_token_accuracy": 0.1765425756573677,
"num_tokens": 35709905.0,
"step": 20580
},
{
"entropy": 5.477742338180542,
"epoch": 1.6015950204240421,
"grad_norm": 1.3046875,
"learning_rate": 0.0004743163074055871,
"loss": 5.2006,
"mean_token_accuracy": 0.17887855619192122,
"num_tokens": 35718404.0,
"step": 20585
},
{
"entropy": 5.5118170261383055,
"epoch": 1.6019840497957596,
"grad_norm": 1.46875,
"learning_rate": 0.0004743034466574871,
"loss": 5.2077,
"mean_token_accuracy": 0.18155071884393692,
"num_tokens": 35726475.0,
"step": 20590
},
{
"entropy": 5.483558225631714,
"epoch": 1.602373079167477,
"grad_norm": 1.3125,
"learning_rate": 0.0004742905828852746,
"loss": 5.2375,
"mean_token_accuracy": 0.17774428129196168,
"num_tokens": 35734819.0,
"step": 20595
},
{
"entropy": 5.391334199905396,
"epoch": 1.6027621085391948,
"grad_norm": 1.328125,
"learning_rate": 0.0004742777160891447,
"loss": 5.1184,
"mean_token_accuracy": 0.180104860663414,
"num_tokens": 35743098.0,
"step": 20600
},
{
"entropy": 5.4968794822692875,
"epoch": 1.6031511379109122,
"grad_norm": 1.296875,
"learning_rate": 0.0004742648462692926,
"loss": 5.2376,
"mean_token_accuracy": 0.18164463490247726,
"num_tokens": 35752502.0,
"step": 20605
},
{
"entropy": 5.520245361328125,
"epoch": 1.6035401672826297,
"grad_norm": 1.8828125,
"learning_rate": 0.00047425197342591363,
"loss": 5.1637,
"mean_token_accuracy": 0.1903032824397087,
"num_tokens": 35761293.0,
"step": 20610
},
{
"entropy": 5.521714305877685,
"epoch": 1.6039291966543474,
"grad_norm": 1.359375,
"learning_rate": 0.0004742390975592031,
"loss": 5.2884,
"mean_token_accuracy": 0.16920629143714905,
"num_tokens": 35771031.0,
"step": 20615
},
{
"entropy": 5.53647780418396,
"epoch": 1.604318226026065,
"grad_norm": 1.4453125,
"learning_rate": 0.00047422621866935645,
"loss": 5.1769,
"mean_token_accuracy": 0.18148970007896423,
"num_tokens": 35778894.0,
"step": 20620
},
{
"entropy": 5.540125179290771,
"epoch": 1.6047072553977826,
"grad_norm": 1.28125,
"learning_rate": 0.000474213336756569,
"loss": 5.2409,
"mean_token_accuracy": 0.17824349105358123,
"num_tokens": 35787159.0,
"step": 20625
},
{
"entropy": 5.441607427597046,
"epoch": 1.6050962847695,
"grad_norm": 1.25,
"learning_rate": 0.0004742004518210362,
"loss": 5.1748,
"mean_token_accuracy": 0.18812182545661926,
"num_tokens": 35795858.0,
"step": 20630
},
{
"entropy": 5.442809057235718,
"epoch": 1.6054853141412178,
"grad_norm": 1.3828125,
"learning_rate": 0.0004741875638629536,
"loss": 5.1681,
"mean_token_accuracy": 0.18200849890708923,
"num_tokens": 35804754.0,
"step": 20635
},
{
"entropy": 5.4924053192138675,
"epoch": 1.6058743435129352,
"grad_norm": 1.2421875,
"learning_rate": 0.0004741746728825168,
"loss": 5.2749,
"mean_token_accuracy": 0.17502398937940597,
"num_tokens": 35813622.0,
"step": 20640
},
{
"entropy": 5.4498106956481935,
"epoch": 1.6062633728846527,
"grad_norm": 1.5,
"learning_rate": 0.0004741617788799213,
"loss": 5.1468,
"mean_token_accuracy": 0.18627086132764817,
"num_tokens": 35821345.0,
"step": 20645
},
{
"entropy": 5.447965860366821,
"epoch": 1.6066524022563704,
"grad_norm": 1.4765625,
"learning_rate": 0.00047414888185536285,
"loss": 5.1908,
"mean_token_accuracy": 0.18537099063396453,
"num_tokens": 35830058.0,
"step": 20650
},
{
"entropy": 5.514035367965699,
"epoch": 1.6070414316280879,
"grad_norm": 1.2734375,
"learning_rate": 0.0004741359818090371,
"loss": 5.2133,
"mean_token_accuracy": 0.18435004502534866,
"num_tokens": 35838951.0,
"step": 20655
},
{
"entropy": 5.478178548812866,
"epoch": 1.6074304609998054,
"grad_norm": 1.6640625,
"learning_rate": 0.00047412307874113976,
"loss": 5.17,
"mean_token_accuracy": 0.18680742681026458,
"num_tokens": 35847245.0,
"step": 20660
},
{
"entropy": 5.526635360717774,
"epoch": 1.607819490371523,
"grad_norm": 1.328125,
"learning_rate": 0.0004741101726518667,
"loss": 5.2741,
"mean_token_accuracy": 0.1773046910762787,
"num_tokens": 35856037.0,
"step": 20665
},
{
"entropy": 5.47281322479248,
"epoch": 1.6082085197432407,
"grad_norm": 1.25,
"learning_rate": 0.0004740972635414136,
"loss": 5.1179,
"mean_token_accuracy": 0.18888673335313796,
"num_tokens": 35864881.0,
"step": 20670
},
{
"entropy": 5.544754266738892,
"epoch": 1.6085975491149582,
"grad_norm": 1.4453125,
"learning_rate": 0.0004740843514099765,
"loss": 5.2439,
"mean_token_accuracy": 0.17636827975511551,
"num_tokens": 35872941.0,
"step": 20675
},
{
"entropy": 5.4163319110870365,
"epoch": 1.6089865784866757,
"grad_norm": 1.328125,
"learning_rate": 0.0004740714362577512,
"loss": 5.1935,
"mean_token_accuracy": 0.17455083280801773,
"num_tokens": 35882068.0,
"step": 20680
},
{
"entropy": 5.47118444442749,
"epoch": 1.6093756078583934,
"grad_norm": 1.2734375,
"learning_rate": 0.00047405851808493364,
"loss": 5.1476,
"mean_token_accuracy": 0.17911248207092284,
"num_tokens": 35890306.0,
"step": 20685
},
{
"entropy": 5.483102607727051,
"epoch": 1.6097646372301109,
"grad_norm": 1.3828125,
"learning_rate": 0.00047404559689172006,
"loss": 5.1973,
"mean_token_accuracy": 0.19302754998207092,
"num_tokens": 35899311.0,
"step": 20690
},
{
"entropy": 5.5089061737060545,
"epoch": 1.6101536666018283,
"grad_norm": 1.25,
"learning_rate": 0.00047403267267830617,
"loss": 5.2473,
"mean_token_accuracy": 0.174527083337307,
"num_tokens": 35908599.0,
"step": 20695
},
{
"entropy": 5.539671182632446,
"epoch": 1.610542695973546,
"grad_norm": 1.34375,
"learning_rate": 0.00047401974544488844,
"loss": 5.2188,
"mean_token_accuracy": 0.17592242062091829,
"num_tokens": 35917318.0,
"step": 20700
},
{
"entropy": 5.481278562545777,
"epoch": 1.6109317253452635,
"grad_norm": 1.328125,
"learning_rate": 0.0004740068151916628,
"loss": 5.1904,
"mean_token_accuracy": 0.18462580144405366,
"num_tokens": 35926179.0,
"step": 20705
},
{
"entropy": 5.376132249832153,
"epoch": 1.611320754716981,
"grad_norm": 1.3203125,
"learning_rate": 0.0004739938819188255,
"loss": 5.0441,
"mean_token_accuracy": 0.19148256480693818,
"num_tokens": 35934155.0,
"step": 20710
},
{
"entropy": 5.391366338729858,
"epoch": 1.6117097840886987,
"grad_norm": 1.421875,
"learning_rate": 0.0004739809456265727,
"loss": 5.1208,
"mean_token_accuracy": 0.18791704177856444,
"num_tokens": 35942301.0,
"step": 20715
},
{
"entropy": 5.401929092407227,
"epoch": 1.6120988134604164,
"grad_norm": 1.28125,
"learning_rate": 0.0004739680063151008,
"loss": 5.1109,
"mean_token_accuracy": 0.18798888921737672,
"num_tokens": 35951005.0,
"step": 20720
},
{
"entropy": 5.482685375213623,
"epoch": 1.6124878428321339,
"grad_norm": 1.296875,
"learning_rate": 0.0004739550639846061,
"loss": 5.2181,
"mean_token_accuracy": 0.18445932269096374,
"num_tokens": 35959425.0,
"step": 20725
},
{
"entropy": 5.464898204803466,
"epoch": 1.6128768722038513,
"grad_norm": 1.578125,
"learning_rate": 0.00047394211863528496,
"loss": 5.1692,
"mean_token_accuracy": 0.182822348177433,
"num_tokens": 35967803.0,
"step": 20730
},
{
"entropy": 5.409885406494141,
"epoch": 1.613265901575569,
"grad_norm": 1.3828125,
"learning_rate": 0.0004739291702673338,
"loss": 5.291,
"mean_token_accuracy": 0.17299067974090576,
"num_tokens": 35977313.0,
"step": 20735
},
{
"entropy": 5.588252353668213,
"epoch": 1.6136549309472865,
"grad_norm": 1.21875,
"learning_rate": 0.0004739162188809492,
"loss": 5.2555,
"mean_token_accuracy": 0.17984988540410995,
"num_tokens": 35986404.0,
"step": 20740
},
{
"entropy": 5.515131282806396,
"epoch": 1.614043960319004,
"grad_norm": 1.2421875,
"learning_rate": 0.00047390326447632747,
"loss": 5.2485,
"mean_token_accuracy": 0.1791035994887352,
"num_tokens": 35995865.0,
"step": 20745
},
{
"entropy": 5.43668646812439,
"epoch": 1.6144329896907217,
"grad_norm": 1.3203125,
"learning_rate": 0.0004738903070536654,
"loss": 5.121,
"mean_token_accuracy": 0.18234838992357255,
"num_tokens": 36005098.0,
"step": 20750
},
{
"entropy": 5.410497236251831,
"epoch": 1.6148220190624392,
"grad_norm": 1.2890625,
"learning_rate": 0.0004738773466131594,
"loss": 5.151,
"mean_token_accuracy": 0.18768104761838914,
"num_tokens": 36013642.0,
"step": 20755
},
{
"entropy": 5.505680561065674,
"epoch": 1.6152110484341566,
"grad_norm": 1.5,
"learning_rate": 0.0004738643831550063,
"loss": 5.2962,
"mean_token_accuracy": 0.17138197422027587,
"num_tokens": 36022565.0,
"step": 20760
},
{
"entropy": 5.511611366271973,
"epoch": 1.6156000778058743,
"grad_norm": 1.34375,
"learning_rate": 0.0004738514166794026,
"loss": 5.2466,
"mean_token_accuracy": 0.17470160275697708,
"num_tokens": 36031406.0,
"step": 20765
},
{
"entropy": 5.53081169128418,
"epoch": 1.615989107177592,
"grad_norm": 1.546875,
"learning_rate": 0.00047383844718654525,
"loss": 5.2339,
"mean_token_accuracy": 0.1813293993473053,
"num_tokens": 36040282.0,
"step": 20770
},
{
"entropy": 5.560623025894165,
"epoch": 1.6163781365493095,
"grad_norm": 1.40625,
"learning_rate": 0.0004738254746766309,
"loss": 5.3193,
"mean_token_accuracy": 0.18225802034139632,
"num_tokens": 36049647.0,
"step": 20775
},
{
"entropy": 5.400055265426635,
"epoch": 1.616767165921027,
"grad_norm": 1.390625,
"learning_rate": 0.0004738124991498565,
"loss": 5.1183,
"mean_token_accuracy": 0.18474107682704927,
"num_tokens": 36057992.0,
"step": 20780
},
{
"entropy": 5.4260776996612545,
"epoch": 1.6171561952927447,
"grad_norm": 1.4609375,
"learning_rate": 0.00047379952060641866,
"loss": 5.16,
"mean_token_accuracy": 0.18336678445339202,
"num_tokens": 36066145.0,
"step": 20785
},
{
"entropy": 5.446443176269531,
"epoch": 1.6175452246644622,
"grad_norm": 1.40625,
"learning_rate": 0.00047378653904651475,
"loss": 5.1684,
"mean_token_accuracy": 0.18403954952955245,
"num_tokens": 36074596.0,
"step": 20790
},
{
"entropy": 5.507423734664917,
"epoch": 1.6179342540361796,
"grad_norm": 1.2734375,
"learning_rate": 0.00047377355447034136,
"loss": 5.092,
"mean_token_accuracy": 0.19746127277612685,
"num_tokens": 36083499.0,
"step": 20795
},
{
"entropy": 5.468140554428101,
"epoch": 1.6183232834078973,
"grad_norm": 1.28125,
"learning_rate": 0.0004737605668780958,
"loss": 5.2178,
"mean_token_accuracy": 0.17951821982860566,
"num_tokens": 36092293.0,
"step": 20800
},
{
"entropy": 5.420831823348999,
"epoch": 1.618712312779615,
"grad_norm": 1.3046875,
"learning_rate": 0.00047374757626997494,
"loss": 5.1733,
"mean_token_accuracy": 0.17748800069093704,
"num_tokens": 36100926.0,
"step": 20805
},
{
"entropy": 5.5344829082489015,
"epoch": 1.6191013421513323,
"grad_norm": 1.265625,
"learning_rate": 0.0004737345826461759,
"loss": 5.2349,
"mean_token_accuracy": 0.18200028836727142,
"num_tokens": 36109831.0,
"step": 20810
},
{
"entropy": 5.553755521774292,
"epoch": 1.61949037152305,
"grad_norm": 1.2265625,
"learning_rate": 0.0004737215860068959,
"loss": 5.3114,
"mean_token_accuracy": 0.1768397346138954,
"num_tokens": 36118759.0,
"step": 20815
},
{
"entropy": 5.5058125972747805,
"epoch": 1.6198794008947677,
"grad_norm": 1.46875,
"learning_rate": 0.00047370858635233223,
"loss": 5.3182,
"mean_token_accuracy": 0.1724585473537445,
"num_tokens": 36127854.0,
"step": 20820
},
{
"entropy": 5.501207637786865,
"epoch": 1.6202684302664851,
"grad_norm": 1.21875,
"learning_rate": 0.00047369558368268194,
"loss": 5.2312,
"mean_token_accuracy": 0.17959168702363967,
"num_tokens": 36137686.0,
"step": 20825
},
{
"entropy": 5.543732213973999,
"epoch": 1.6206574596382026,
"grad_norm": 1.3203125,
"learning_rate": 0.0004736825779981424,
"loss": 5.2174,
"mean_token_accuracy": 0.17839380949735642,
"num_tokens": 36146352.0,
"step": 20830
},
{
"entropy": 5.454100275039673,
"epoch": 1.6210464890099203,
"grad_norm": 1.2890625,
"learning_rate": 0.0004736695692989111,
"loss": 5.1619,
"mean_token_accuracy": 0.18554824590682983,
"num_tokens": 36156106.0,
"step": 20835
},
{
"entropy": 5.392924976348877,
"epoch": 1.6214355183816378,
"grad_norm": 1.25,
"learning_rate": 0.0004736565575851852,
"loss": 5.0311,
"mean_token_accuracy": 0.18951328992843627,
"num_tokens": 36164169.0,
"step": 20840
},
{
"entropy": 5.472887277603149,
"epoch": 1.6218245477533553,
"grad_norm": 1.4140625,
"learning_rate": 0.0004736435428571622,
"loss": 5.2234,
"mean_token_accuracy": 0.17599323242902756,
"num_tokens": 36173368.0,
"step": 20845
},
{
"entropy": 5.508453512191773,
"epoch": 1.622213577125073,
"grad_norm": 1.3359375,
"learning_rate": 0.0004736305251150397,
"loss": 5.2018,
"mean_token_accuracy": 0.18134894520044326,
"num_tokens": 36182405.0,
"step": 20850
},
{
"entropy": 5.516885614395141,
"epoch": 1.6226026064967907,
"grad_norm": 1.3125,
"learning_rate": 0.0004736175043590151,
"loss": 5.2442,
"mean_token_accuracy": 0.1803520515561104,
"num_tokens": 36191683.0,
"step": 20855
},
{
"entropy": 5.483318424224853,
"epoch": 1.622991635868508,
"grad_norm": 1.203125,
"learning_rate": 0.000473604480589286,
"loss": 5.101,
"mean_token_accuracy": 0.18624744117259978,
"num_tokens": 36200173.0,
"step": 20860
},
{
"entropy": 5.346344661712647,
"epoch": 1.6233806652402256,
"grad_norm": 1.328125,
"learning_rate": 0.00047359145380605007,
"loss": 5.1483,
"mean_token_accuracy": 0.18465072214603423,
"num_tokens": 36209057.0,
"step": 20865
},
{
"entropy": 5.431147336959839,
"epoch": 1.6237696946119433,
"grad_norm": 1.296875,
"learning_rate": 0.0004735784240095049,
"loss": 5.1758,
"mean_token_accuracy": 0.18200361281633376,
"num_tokens": 36217645.0,
"step": 20870
},
{
"entropy": 5.568696355819702,
"epoch": 1.6241587239836608,
"grad_norm": 1.2890625,
"learning_rate": 0.00047356539119984813,
"loss": 5.2484,
"mean_token_accuracy": 0.1758081555366516,
"num_tokens": 36226282.0,
"step": 20875
},
{
"entropy": 5.49404559135437,
"epoch": 1.6245477533553783,
"grad_norm": 1.4921875,
"learning_rate": 0.0004735523553772777,
"loss": 5.2327,
"mean_token_accuracy": 0.18078527748584747,
"num_tokens": 36235322.0,
"step": 20880
},
{
"entropy": 5.448576736450195,
"epoch": 1.624936782727096,
"grad_norm": 1.2734375,
"learning_rate": 0.0004735393165419912,
"loss": 5.1726,
"mean_token_accuracy": 0.18625034689903258,
"num_tokens": 36244212.0,
"step": 20885
},
{
"entropy": 5.427348279953003,
"epoch": 1.6253258120988134,
"grad_norm": 1.3046875,
"learning_rate": 0.00047352627469418666,
"loss": 5.1475,
"mean_token_accuracy": 0.1872599869966507,
"num_tokens": 36252837.0,
"step": 20890
},
{
"entropy": 5.512896394729614,
"epoch": 1.625714841470531,
"grad_norm": 1.7890625,
"learning_rate": 0.0004735132298340619,
"loss": 5.2208,
"mean_token_accuracy": 0.17607235610485078,
"num_tokens": 36261492.0,
"step": 20895
},
{
"entropy": 5.5167747974395756,
"epoch": 1.6261038708422486,
"grad_norm": 1.2421875,
"learning_rate": 0.0004735001819618148,
"loss": 5.183,
"mean_token_accuracy": 0.1804351508617401,
"num_tokens": 36270195.0,
"step": 20900
},
{
"entropy": 5.495071983337402,
"epoch": 1.6264929002139663,
"grad_norm": 1.484375,
"learning_rate": 0.0004734871310776434,
"loss": 5.1222,
"mean_token_accuracy": 0.1921781688928604,
"num_tokens": 36278546.0,
"step": 20905
},
{
"entropy": 5.472602081298828,
"epoch": 1.6268819295856836,
"grad_norm": 1.375,
"learning_rate": 0.0004734740771817457,
"loss": 5.2686,
"mean_token_accuracy": 0.17154050171375274,
"num_tokens": 36287433.0,
"step": 20910
},
{
"entropy": 5.392034196853638,
"epoch": 1.6272709589574013,
"grad_norm": 1.2578125,
"learning_rate": 0.0004734610202743198,
"loss": 5.1134,
"mean_token_accuracy": 0.17898679971694947,
"num_tokens": 36296213.0,
"step": 20915
},
{
"entropy": 5.4305887699127195,
"epoch": 1.627659988329119,
"grad_norm": 1.25,
"learning_rate": 0.0004734479603555638,
"loss": 5.0751,
"mean_token_accuracy": 0.19643169939517974,
"num_tokens": 36303989.0,
"step": 20920
},
{
"entropy": 5.5976804256439205,
"epoch": 1.6280490177008364,
"grad_norm": 1.5390625,
"learning_rate": 0.00047343489742567593,
"loss": 5.3937,
"mean_token_accuracy": 0.16939037591218947,
"num_tokens": 36312939.0,
"step": 20925
},
{
"entropy": 5.53128752708435,
"epoch": 1.628438047072554,
"grad_norm": 1.3046875,
"learning_rate": 0.00047342183148485424,
"loss": 5.1514,
"mean_token_accuracy": 0.1816410943865776,
"num_tokens": 36322130.0,
"step": 20930
},
{
"entropy": 5.387099981307983,
"epoch": 1.6288270764442716,
"grad_norm": 1.3203125,
"learning_rate": 0.00047340876253329706,
"loss": 5.1133,
"mean_token_accuracy": 0.18367586880922318,
"num_tokens": 36330376.0,
"step": 20935
},
{
"entropy": 5.407538604736328,
"epoch": 1.629216105815989,
"grad_norm": 1.3515625,
"learning_rate": 0.00047339569057120275,
"loss": 5.1374,
"mean_token_accuracy": 0.18430205434560776,
"num_tokens": 36339614.0,
"step": 20940
},
{
"entropy": 5.5296672821044925,
"epoch": 1.6296051351877066,
"grad_norm": 1.2421875,
"learning_rate": 0.00047338261559876966,
"loss": 5.2363,
"mean_token_accuracy": 0.17719132006168364,
"num_tokens": 36349561.0,
"step": 20945
},
{
"entropy": 5.57050051689148,
"epoch": 1.6299941645594243,
"grad_norm": 1.2421875,
"learning_rate": 0.00047336953761619604,
"loss": 5.2877,
"mean_token_accuracy": 0.17643799632787704,
"num_tokens": 36358277.0,
"step": 20950
},
{
"entropy": 5.53431921005249,
"epoch": 1.630383193931142,
"grad_norm": 1.3203125,
"learning_rate": 0.00047335645662368046,
"loss": 5.2284,
"mean_token_accuracy": 0.1848193511366844,
"num_tokens": 36366736.0,
"step": 20955
},
{
"entropy": 5.482513475418091,
"epoch": 1.6307722233028592,
"grad_norm": 1.21875,
"learning_rate": 0.0004733433726214214,
"loss": 5.1828,
"mean_token_accuracy": 0.18691345453262329,
"num_tokens": 36374802.0,
"step": 20960
},
{
"entropy": 5.479587602615356,
"epoch": 1.631161252674577,
"grad_norm": 1.484375,
"learning_rate": 0.00047333028560961733,
"loss": 5.251,
"mean_token_accuracy": 0.1780051827430725,
"num_tokens": 36384195.0,
"step": 20965
},
{
"entropy": 5.48459529876709,
"epoch": 1.6315502820462946,
"grad_norm": 1.375,
"learning_rate": 0.00047331719558846687,
"loss": 5.2197,
"mean_token_accuracy": 0.1756053775548935,
"num_tokens": 36393001.0,
"step": 20970
},
{
"entropy": 5.468611764907837,
"epoch": 1.631939311418012,
"grad_norm": 1.3359375,
"learning_rate": 0.00047330410255816863,
"loss": 5.1672,
"mean_token_accuracy": 0.17389518469572068,
"num_tokens": 36401674.0,
"step": 20975
},
{
"entropy": 5.443812894821167,
"epoch": 1.6323283407897295,
"grad_norm": 1.34375,
"learning_rate": 0.00047329100651892123,
"loss": 5.1467,
"mean_token_accuracy": 0.19463392496109008,
"num_tokens": 36409817.0,
"step": 20980
},
{
"entropy": 5.4859498023986815,
"epoch": 1.6327173701614472,
"grad_norm": 1.25,
"learning_rate": 0.0004732779074709234,
"loss": 5.0829,
"mean_token_accuracy": 0.18936517536640168,
"num_tokens": 36417541.0,
"step": 20985
},
{
"entropy": 5.432406616210938,
"epoch": 1.6331063995331647,
"grad_norm": 1.3203125,
"learning_rate": 0.000473264805414374,
"loss": 5.2222,
"mean_token_accuracy": 0.17607683837413787,
"num_tokens": 36426613.0,
"step": 20990
},
{
"entropy": 5.464840412139893,
"epoch": 1.6334954289048822,
"grad_norm": 1.2421875,
"learning_rate": 0.00047325170034947167,
"loss": 5.2438,
"mean_token_accuracy": 0.17849491834640502,
"num_tokens": 36436052.0,
"step": 20995
},
{
"entropy": 5.497308540344238,
"epoch": 1.6338844582766,
"grad_norm": 1.28125,
"learning_rate": 0.00047323859227641537,
"loss": 5.1218,
"mean_token_accuracy": 0.18366954177618028,
"num_tokens": 36444386.0,
"step": 21000
},
{
"epoch": 1.6338844582766,
"eval_entropy": 5.3745178121689765,
"eval_loss": 5.277838706970215,
"eval_mean_token_accuracy": 0.18617092999302504,
"eval_num_tokens": 36444386.0,
"eval_runtime": 28.5705,
"eval_samples_per_second": 1454.576,
"eval_steps_per_second": 181.831,
"step": 21000
},
{
"entropy": 5.528669738769532,
"epoch": 1.6342734876483176,
"grad_norm": 1.265625,
"learning_rate": 0.00047322548119540397,
"loss": 5.1759,
"mean_token_accuracy": 0.18001073598861694,
"num_tokens": 36452759.0,
"step": 21005
},
{
"entropy": 5.486782455444336,
"epoch": 1.634662517020035,
"grad_norm": 1.25,
"learning_rate": 0.00047321236710663636,
"loss": 5.1319,
"mean_token_accuracy": 0.1882358357310295,
"num_tokens": 36460581.0,
"step": 21010
},
{
"entropy": 5.456148958206176,
"epoch": 1.6350515463917525,
"grad_norm": 1.2578125,
"learning_rate": 0.00047319925001031165,
"loss": 5.1734,
"mean_token_accuracy": 0.18629803210496904,
"num_tokens": 36468995.0,
"step": 21015
},
{
"entropy": 5.562962341308594,
"epoch": 1.6354405757634702,
"grad_norm": 1.296875,
"learning_rate": 0.0004731861299066287,
"loss": 5.2639,
"mean_token_accuracy": 0.18103989511728286,
"num_tokens": 36477901.0,
"step": 21020
},
{
"entropy": 5.468941497802734,
"epoch": 1.6358296051351877,
"grad_norm": 1.3125,
"learning_rate": 0.0004731730067957867,
"loss": 5.2361,
"mean_token_accuracy": 0.18166091293096542,
"num_tokens": 36486500.0,
"step": 21025
},
{
"entropy": 5.4481635093688965,
"epoch": 1.6362186345069052,
"grad_norm": 1.3125,
"learning_rate": 0.00047315988067798476,
"loss": 5.1607,
"mean_token_accuracy": 0.18342582434415816,
"num_tokens": 36495247.0,
"step": 21030
},
{
"entropy": 5.481537675857544,
"epoch": 1.6366076638786229,
"grad_norm": 1.484375,
"learning_rate": 0.000473146751553422,
"loss": 5.1267,
"mean_token_accuracy": 0.1927894026041031,
"num_tokens": 36503633.0,
"step": 21035
},
{
"entropy": 5.4976880073547365,
"epoch": 1.6369966932503404,
"grad_norm": 1.25,
"learning_rate": 0.0004731336194222978,
"loss": 5.2199,
"mean_token_accuracy": 0.18330923467874527,
"num_tokens": 36512138.0,
"step": 21040
},
{
"entropy": 5.531950330734253,
"epoch": 1.6373857226220578,
"grad_norm": 1.3828125,
"learning_rate": 0.00047312048428481114,
"loss": 5.2083,
"mean_token_accuracy": 0.18679561614990234,
"num_tokens": 36521029.0,
"step": 21045
},
{
"entropy": 5.433400869369507,
"epoch": 1.6377747519937755,
"grad_norm": 1.6015625,
"learning_rate": 0.00047310734614116153,
"loss": 5.1203,
"mean_token_accuracy": 0.183465313911438,
"num_tokens": 36530658.0,
"step": 21050
},
{
"entropy": 5.424539995193482,
"epoch": 1.6381637813654932,
"grad_norm": 1.2890625,
"learning_rate": 0.0004730942049915483,
"loss": 5.1118,
"mean_token_accuracy": 0.18296203762292862,
"num_tokens": 36539037.0,
"step": 21055
},
{
"entropy": 5.444966888427734,
"epoch": 1.6385528107372107,
"grad_norm": 1.2734375,
"learning_rate": 0.0004730810608361707,
"loss": 5.1931,
"mean_token_accuracy": 0.18480487614870073,
"num_tokens": 36547863.0,
"step": 21060
},
{
"entropy": 5.512889719009399,
"epoch": 1.6389418401089282,
"grad_norm": 1.28125,
"learning_rate": 0.00047306791367522833,
"loss": 5.2096,
"mean_token_accuracy": 0.18151307553052903,
"num_tokens": 36555896.0,
"step": 21065
},
{
"entropy": 5.4272222995758055,
"epoch": 1.6393308694806459,
"grad_norm": 1.2734375,
"learning_rate": 0.0004730547635089206,
"loss": 5.1294,
"mean_token_accuracy": 0.1929125115275383,
"num_tokens": 36564088.0,
"step": 21070
},
{
"entropy": 5.4738341808319095,
"epoch": 1.6397198988523634,
"grad_norm": 1.3515625,
"learning_rate": 0.00047304161033744714,
"loss": 5.106,
"mean_token_accuracy": 0.18501498997211457,
"num_tokens": 36572490.0,
"step": 21075
},
{
"entropy": 5.49489459991455,
"epoch": 1.6401089282240808,
"grad_norm": 1.46875,
"learning_rate": 0.0004730284541610075,
"loss": 5.1832,
"mean_token_accuracy": 0.17720876783132553,
"num_tokens": 36580834.0,
"step": 21080
},
{
"entropy": 5.401579427719116,
"epoch": 1.6404979575957985,
"grad_norm": 1.2734375,
"learning_rate": 0.0004730152949798012,
"loss": 5.1608,
"mean_token_accuracy": 0.19064083993434905,
"num_tokens": 36589420.0,
"step": 21085
},
{
"entropy": 5.4306535720825195,
"epoch": 1.640886986967516,
"grad_norm": 1.4296875,
"learning_rate": 0.00047300213279402787,
"loss": 5.1772,
"mean_token_accuracy": 0.18251401484012603,
"num_tokens": 36598419.0,
"step": 21090
},
{
"entropy": 5.483335733413696,
"epoch": 1.6412760163392335,
"grad_norm": 1.2578125,
"learning_rate": 0.00047298896760388745,
"loss": 5.1956,
"mean_token_accuracy": 0.18290065973997116,
"num_tokens": 36607367.0,
"step": 21095
},
{
"entropy": 5.514923620223999,
"epoch": 1.6416650457109512,
"grad_norm": 1.234375,
"learning_rate": 0.0004729757994095796,
"loss": 5.2617,
"mean_token_accuracy": 0.17232670187950133,
"num_tokens": 36616197.0,
"step": 21100
},
{
"entropy": 5.508531856536865,
"epoch": 1.6420540750826689,
"grad_norm": 1.3671875,
"learning_rate": 0.00047296262821130405,
"loss": 5.301,
"mean_token_accuracy": 0.17552568316459655,
"num_tokens": 36625452.0,
"step": 21105
},
{
"entropy": 5.4955769062042235,
"epoch": 1.6424431044543863,
"grad_norm": 1.1796875,
"learning_rate": 0.00047294945400926065,
"loss": 5.2249,
"mean_token_accuracy": 0.1770986795425415,
"num_tokens": 36634356.0,
"step": 21110
},
{
"entropy": 5.471290922164917,
"epoch": 1.6428321338261038,
"grad_norm": 1.328125,
"learning_rate": 0.0004729362768036494,
"loss": 5.2041,
"mean_token_accuracy": 0.17991159707307816,
"num_tokens": 36642548.0,
"step": 21115
},
{
"entropy": 5.422236108779908,
"epoch": 1.6432211631978215,
"grad_norm": 1.3203125,
"learning_rate": 0.00047292309659467024,
"loss": 5.0922,
"mean_token_accuracy": 0.19454638063907623,
"num_tokens": 36650548.0,
"step": 21120
},
{
"entropy": 5.3576140880584715,
"epoch": 1.643610192569539,
"grad_norm": 1.125,
"learning_rate": 0.0004729099133825231,
"loss": 5.1347,
"mean_token_accuracy": 0.18739009648561478,
"num_tokens": 36659322.0,
"step": 21125
},
{
"entropy": 5.427200889587402,
"epoch": 1.6439992219412565,
"grad_norm": 1.2734375,
"learning_rate": 0.000472896727167408,
"loss": 5.1098,
"mean_token_accuracy": 0.19002711325883864,
"num_tokens": 36667699.0,
"step": 21130
},
{
"entropy": 5.527372074127197,
"epoch": 1.6443882513129742,
"grad_norm": 1.2109375,
"learning_rate": 0.00047288353794952505,
"loss": 5.2528,
"mean_token_accuracy": 0.1773348405957222,
"num_tokens": 36677842.0,
"step": 21135
},
{
"entropy": 5.397771549224854,
"epoch": 1.6447772806846916,
"grad_norm": 1.203125,
"learning_rate": 0.0004728703457290744,
"loss": 5.0639,
"mean_token_accuracy": 0.19210756719112396,
"num_tokens": 36686488.0,
"step": 21140
},
{
"entropy": 5.43499608039856,
"epoch": 1.6451663100564091,
"grad_norm": 1.546875,
"learning_rate": 0.0004728571505062562,
"loss": 5.2201,
"mean_token_accuracy": 0.18548770397901534,
"num_tokens": 36694955.0,
"step": 21145
},
{
"entropy": 5.383376169204712,
"epoch": 1.6455553394281268,
"grad_norm": 1.2265625,
"learning_rate": 0.0004728439522812707,
"loss": 5.1102,
"mean_token_accuracy": 0.18933332711458206,
"num_tokens": 36703481.0,
"step": 21150
},
{
"entropy": 5.5120659351348875,
"epoch": 1.6459443687998445,
"grad_norm": 1.390625,
"learning_rate": 0.00047283075105431806,
"loss": 5.3263,
"mean_token_accuracy": 0.17586686164140702,
"num_tokens": 36711812.0,
"step": 21155
},
{
"entropy": 5.502885198593139,
"epoch": 1.646333398171562,
"grad_norm": 1.2109375,
"learning_rate": 0.0004728175468255987,
"loss": 5.1976,
"mean_token_accuracy": 0.18580035120248795,
"num_tokens": 36720496.0,
"step": 21160
},
{
"entropy": 5.414668369293213,
"epoch": 1.6467224275432795,
"grad_norm": 1.40625,
"learning_rate": 0.00047280433959531287,
"loss": 5.0525,
"mean_token_accuracy": 0.1890591025352478,
"num_tokens": 36728959.0,
"step": 21165
},
{
"entropy": 5.347526121139526,
"epoch": 1.6471114569149972,
"grad_norm": 1.21875,
"learning_rate": 0.000472791129363661,
"loss": 5.158,
"mean_token_accuracy": 0.18552952706813813,
"num_tokens": 36737492.0,
"step": 21170
},
{
"entropy": 5.472883510589599,
"epoch": 1.6475004862867146,
"grad_norm": 1.2578125,
"learning_rate": 0.0004727779161308436,
"loss": 5.1303,
"mean_token_accuracy": 0.18681171983480455,
"num_tokens": 36745852.0,
"step": 21175
},
{
"entropy": 5.462583589553833,
"epoch": 1.6478895156584321,
"grad_norm": 1.671875,
"learning_rate": 0.0004727646998970612,
"loss": 5.1893,
"mean_token_accuracy": 0.181314180791378,
"num_tokens": 36753897.0,
"step": 21180
},
{
"entropy": 5.437054252624511,
"epoch": 1.6482785450301498,
"grad_norm": 1.2578125,
"learning_rate": 0.00047275148066251417,
"loss": 5.1223,
"mean_token_accuracy": 0.18211720138788223,
"num_tokens": 36762737.0,
"step": 21185
},
{
"entropy": 5.536819887161255,
"epoch": 1.6486675744018673,
"grad_norm": 1.3203125,
"learning_rate": 0.0004727382584274032,
"loss": 5.2568,
"mean_token_accuracy": 0.1780978888273239,
"num_tokens": 36770742.0,
"step": 21190
},
{
"entropy": 5.5391552448272705,
"epoch": 1.6490566037735848,
"grad_norm": 1.3125,
"learning_rate": 0.00047272503319192887,
"loss": 5.3027,
"mean_token_accuracy": 0.17244922965765,
"num_tokens": 36779420.0,
"step": 21195
},
{
"entropy": 5.413461494445801,
"epoch": 1.6494456331453025,
"grad_norm": 1.4609375,
"learning_rate": 0.0004727118049562919,
"loss": 5.1008,
"mean_token_accuracy": 0.18950988352298737,
"num_tokens": 36787888.0,
"step": 21200
},
{
"entropy": 5.369880962371826,
"epoch": 1.6498346625170202,
"grad_norm": 1.28125,
"learning_rate": 0.000472698573720693,
"loss": 5.041,
"mean_token_accuracy": 0.19358342438936232,
"num_tokens": 36797131.0,
"step": 21205
},
{
"entropy": 5.413011598587036,
"epoch": 1.6502236918887376,
"grad_norm": 1.3828125,
"learning_rate": 0.0004726853394853329,
"loss": 5.2341,
"mean_token_accuracy": 0.17686241269111633,
"num_tokens": 36805429.0,
"step": 21210
},
{
"entropy": 5.478509092330933,
"epoch": 1.650612721260455,
"grad_norm": 1.3359375,
"learning_rate": 0.00047267210225041234,
"loss": 5.265,
"mean_token_accuracy": 0.17884287238121033,
"num_tokens": 36814204.0,
"step": 21215
},
{
"entropy": 5.555078363418579,
"epoch": 1.6510017506321728,
"grad_norm": 1.5859375,
"learning_rate": 0.00047265886201613234,
"loss": 5.2252,
"mean_token_accuracy": 0.18186666518449784,
"num_tokens": 36823229.0,
"step": 21220
},
{
"entropy": 5.533970975875855,
"epoch": 1.6513907800038903,
"grad_norm": 1.2890625,
"learning_rate": 0.00047264561878269365,
"loss": 5.2944,
"mean_token_accuracy": 0.17468467950820923,
"num_tokens": 36832252.0,
"step": 21225
},
{
"entropy": 5.474828386306763,
"epoch": 1.6517798093756078,
"grad_norm": 1.328125,
"learning_rate": 0.0004726323725502973,
"loss": 5.1725,
"mean_token_accuracy": 0.18032560348510743,
"num_tokens": 36841456.0,
"step": 21230
},
{
"entropy": 5.501571750640869,
"epoch": 1.6521688387473255,
"grad_norm": 1.3046875,
"learning_rate": 0.0004726191233191443,
"loss": 5.1603,
"mean_token_accuracy": 0.18912065625190735,
"num_tokens": 36849717.0,
"step": 21235
},
{
"entropy": 5.483205032348633,
"epoch": 1.6525578681190431,
"grad_norm": 1.28125,
"learning_rate": 0.0004726058710894357,
"loss": 5.213,
"mean_token_accuracy": 0.17605281472206116,
"num_tokens": 36858222.0,
"step": 21240
},
{
"entropy": 5.3973784923553465,
"epoch": 1.6529468974907604,
"grad_norm": 1.2890625,
"learning_rate": 0.0004725926158613724,
"loss": 5.2266,
"mean_token_accuracy": 0.1770833119750023,
"num_tokens": 36866899.0,
"step": 21245
},
{
"entropy": 5.490845584869385,
"epoch": 1.653335926862478,
"grad_norm": 1.46875,
"learning_rate": 0.0004725793576351557,
"loss": 5.1746,
"mean_token_accuracy": 0.19120905548334122,
"num_tokens": 36876124.0,
"step": 21250
},
{
"entropy": 5.525161457061768,
"epoch": 1.6537249562341958,
"grad_norm": 1.234375,
"learning_rate": 0.0004725660964109867,
"loss": 5.2485,
"mean_token_accuracy": 0.17969964444637299,
"num_tokens": 36884689.0,
"step": 21255
},
{
"entropy": 5.497931385040284,
"epoch": 1.6541139856059133,
"grad_norm": 1.328125,
"learning_rate": 0.00047255283218906673,
"loss": 5.1746,
"mean_token_accuracy": 0.18193556517362594,
"num_tokens": 36893073.0,
"step": 21260
},
{
"entropy": 5.479152059555053,
"epoch": 1.6545030149776307,
"grad_norm": 1.28125,
"learning_rate": 0.000472539564969597,
"loss": 5.2253,
"mean_token_accuracy": 0.1756857842206955,
"num_tokens": 36902428.0,
"step": 21265
},
{
"entropy": 5.4898333072662355,
"epoch": 1.6548920443493484,
"grad_norm": 1.21875,
"learning_rate": 0.00047252629475277863,
"loss": 5.2269,
"mean_token_accuracy": 0.18409541100263596,
"num_tokens": 36910297.0,
"step": 21270
},
{
"entropy": 5.4531206607818605,
"epoch": 1.655281073721066,
"grad_norm": 1.328125,
"learning_rate": 0.0004725130215388132,
"loss": 5.1572,
"mean_token_accuracy": 0.18274469524621964,
"num_tokens": 36919115.0,
"step": 21275
},
{
"entropy": 5.509743499755859,
"epoch": 1.6556701030927834,
"grad_norm": 1.859375,
"learning_rate": 0.0004724997453279021,
"loss": 5.2027,
"mean_token_accuracy": 0.1817948117852211,
"num_tokens": 36928419.0,
"step": 21280
},
{
"entropy": 5.528812599182129,
"epoch": 1.656059132464501,
"grad_norm": 1.2265625,
"learning_rate": 0.0004724864661202467,
"loss": 5.1481,
"mean_token_accuracy": 0.18658121377229692,
"num_tokens": 36936511.0,
"step": 21285
},
{
"entropy": 5.48697338104248,
"epoch": 1.6564481618362188,
"grad_norm": 1.2890625,
"learning_rate": 0.00047247318391604846,
"loss": 5.2116,
"mean_token_accuracy": 0.18273700922727584,
"num_tokens": 36945316.0,
"step": 21290
},
{
"entropy": 5.464405155181884,
"epoch": 1.656837191207936,
"grad_norm": 1.328125,
"learning_rate": 0.00047245989871550897,
"loss": 5.2437,
"mean_token_accuracy": 0.17317323982715607,
"num_tokens": 36954140.0,
"step": 21295
},
{
"entropy": 5.511450099945068,
"epoch": 1.6572262205796537,
"grad_norm": 1.28125,
"learning_rate": 0.0004724466105188299,
"loss": 5.1787,
"mean_token_accuracy": 0.18265851885080336,
"num_tokens": 36962852.0,
"step": 21300
},
{
"entropy": 5.5928566455841064,
"epoch": 1.6576152499513714,
"grad_norm": 1.2890625,
"learning_rate": 0.00047243331932621263,
"loss": 5.2243,
"mean_token_accuracy": 0.18260930180549623,
"num_tokens": 36971617.0,
"step": 21305
},
{
"entropy": 5.453424978256225,
"epoch": 1.658004279323089,
"grad_norm": 1.421875,
"learning_rate": 0.0004724200251378591,
"loss": 5.2288,
"mean_token_accuracy": 0.18045469671487807,
"num_tokens": 36981078.0,
"step": 21310
},
{
"entropy": 5.466329193115234,
"epoch": 1.6583933086948064,
"grad_norm": 1.2578125,
"learning_rate": 0.0004724067279539709,
"loss": 5.1268,
"mean_token_accuracy": 0.17876289337873458,
"num_tokens": 36989860.0,
"step": 21315
},
{
"entropy": 5.459926414489746,
"epoch": 1.658782338066524,
"grad_norm": 1.2421875,
"learning_rate": 0.00047239342777474975,
"loss": 5.1606,
"mean_token_accuracy": 0.186983859539032,
"num_tokens": 36998037.0,
"step": 21320
},
{
"entropy": 5.472283554077149,
"epoch": 1.6591713674382416,
"grad_norm": 1.2734375,
"learning_rate": 0.00047238012460039765,
"loss": 5.1894,
"mean_token_accuracy": 0.1812639579176903,
"num_tokens": 37006375.0,
"step": 21325
},
{
"entropy": 5.476419305801391,
"epoch": 1.659560396809959,
"grad_norm": 1.3125,
"learning_rate": 0.0004723668184311162,
"loss": 5.2505,
"mean_token_accuracy": 0.17863859087228776,
"num_tokens": 37014650.0,
"step": 21330
},
{
"entropy": 5.5464410305023195,
"epoch": 1.6599494261816767,
"grad_norm": 1.5,
"learning_rate": 0.0004723535092671074,
"loss": 5.211,
"mean_token_accuracy": 0.1769264057278633,
"num_tokens": 37023147.0,
"step": 21335
},
{
"entropy": 5.534593868255615,
"epoch": 1.6603384555533944,
"grad_norm": 1.390625,
"learning_rate": 0.00047234019710857335,
"loss": 5.2293,
"mean_token_accuracy": 0.1810394823551178,
"num_tokens": 37031461.0,
"step": 21340
},
{
"entropy": 5.535591888427734,
"epoch": 1.6607274849251117,
"grad_norm": 1.2109375,
"learning_rate": 0.0004723268819557158,
"loss": 5.2449,
"mean_token_accuracy": 0.18641917854547502,
"num_tokens": 37039924.0,
"step": 21345
},
{
"entropy": 5.417038440704346,
"epoch": 1.6611165142968294,
"grad_norm": 1.2734375,
"learning_rate": 0.00047231356380873687,
"loss": 5.1665,
"mean_token_accuracy": 0.18110019862651824,
"num_tokens": 37048631.0,
"step": 21350
},
{
"entropy": 5.464333343505859,
"epoch": 1.661505543668547,
"grad_norm": 1.3046875,
"learning_rate": 0.0004723002426678388,
"loss": 5.1569,
"mean_token_accuracy": 0.18926072120666504,
"num_tokens": 37057018.0,
"step": 21355
},
{
"entropy": 5.49429931640625,
"epoch": 1.6618945730402646,
"grad_norm": 1.421875,
"learning_rate": 0.0004722869185332235,
"loss": 5.1842,
"mean_token_accuracy": 0.18258886337280272,
"num_tokens": 37065762.0,
"step": 21360
},
{
"entropy": 5.428005504608154,
"epoch": 1.662283602411982,
"grad_norm": 1.34375,
"learning_rate": 0.00047227359140509324,
"loss": 5.1846,
"mean_token_accuracy": 0.18040224760770798,
"num_tokens": 37073836.0,
"step": 21365
},
{
"entropy": 5.431950044631958,
"epoch": 1.6626726317836997,
"grad_norm": 1.3828125,
"learning_rate": 0.0004722602612836501,
"loss": 5.2434,
"mean_token_accuracy": 0.17611737102270125,
"num_tokens": 37082788.0,
"step": 21370
},
{
"entropy": 5.580137109756469,
"epoch": 1.6630616611554172,
"grad_norm": 1.328125,
"learning_rate": 0.00047224692816909665,
"loss": 5.2482,
"mean_token_accuracy": 0.17717309147119523,
"num_tokens": 37091228.0,
"step": 21375
},
{
"entropy": 5.540875959396362,
"epoch": 1.6634506905271347,
"grad_norm": 1.234375,
"learning_rate": 0.0004722335920616349,
"loss": 5.1715,
"mean_token_accuracy": 0.18301521390676498,
"num_tokens": 37099819.0,
"step": 21380
},
{
"entropy": 5.4199143409729,
"epoch": 1.6638397198988524,
"grad_norm": 1.1875,
"learning_rate": 0.00047222025296146745,
"loss": 5.2082,
"mean_token_accuracy": 0.174732007086277,
"num_tokens": 37108129.0,
"step": 21385
},
{
"entropy": 5.398650360107422,
"epoch": 1.66422874927057,
"grad_norm": 1.21875,
"learning_rate": 0.00047220691086879643,
"loss": 5.1098,
"mean_token_accuracy": 0.18977808505296706,
"num_tokens": 37116093.0,
"step": 21390
},
{
"entropy": 5.459658145904541,
"epoch": 1.6646177786422873,
"grad_norm": 1.3125,
"learning_rate": 0.0004721935657838245,
"loss": 5.162,
"mean_token_accuracy": 0.1835104078054428,
"num_tokens": 37124098.0,
"step": 21395
},
{
"entropy": 5.520260620117187,
"epoch": 1.665006808014005,
"grad_norm": 1.3359375,
"learning_rate": 0.000472180217706754,
"loss": 5.2278,
"mean_token_accuracy": 0.17799590528011322,
"num_tokens": 37132608.0,
"step": 21400
},
{
"entropy": 5.496925735473633,
"epoch": 1.6653958373857227,
"grad_norm": 1.359375,
"learning_rate": 0.0004721668666377876,
"loss": 5.2154,
"mean_token_accuracy": 0.18403584659099578,
"num_tokens": 37141365.0,
"step": 21405
},
{
"entropy": 5.424926519393921,
"epoch": 1.6657848667574402,
"grad_norm": 1.3359375,
"learning_rate": 0.00047215351257712783,
"loss": 5.1331,
"mean_token_accuracy": 0.18554792702198028,
"num_tokens": 37150146.0,
"step": 21410
},
{
"entropy": 5.5633574485778805,
"epoch": 1.6661738961291577,
"grad_norm": 1.6328125,
"learning_rate": 0.00047214015552497735,
"loss": 5.2954,
"mean_token_accuracy": 0.1747785896062851,
"num_tokens": 37158887.0,
"step": 21415
},
{
"entropy": 5.522117662429809,
"epoch": 1.6665629255008754,
"grad_norm": 1.375,
"learning_rate": 0.00047212679548153867,
"loss": 5.1386,
"mean_token_accuracy": 0.18266212791204453,
"num_tokens": 37167902.0,
"step": 21420
},
{
"entropy": 5.514734506607056,
"epoch": 1.6669519548725928,
"grad_norm": 1.421875,
"learning_rate": 0.00047211343244701475,
"loss": 5.2609,
"mean_token_accuracy": 0.18035067915916442,
"num_tokens": 37175853.0,
"step": 21425
},
{
"entropy": 5.453936767578125,
"epoch": 1.6673409842443103,
"grad_norm": 1.3671875,
"learning_rate": 0.0004721000664216081,
"loss": 5.1573,
"mean_token_accuracy": 0.18276971727609634,
"num_tokens": 37184036.0,
"step": 21430
},
{
"entropy": 5.502601099014282,
"epoch": 1.667730013616028,
"grad_norm": 1.3046875,
"learning_rate": 0.0004720866974055219,
"loss": 5.211,
"mean_token_accuracy": 0.18155357986688614,
"num_tokens": 37193277.0,
"step": 21435
},
{
"entropy": 5.522041988372803,
"epoch": 1.6681190429877457,
"grad_norm": 1.359375,
"learning_rate": 0.0004720733253989585,
"loss": 5.1667,
"mean_token_accuracy": 0.1853174790740013,
"num_tokens": 37201925.0,
"step": 21440
},
{
"entropy": 5.516654205322266,
"epoch": 1.6685080723594632,
"grad_norm": 1.3828125,
"learning_rate": 0.00047205995040212114,
"loss": 5.2661,
"mean_token_accuracy": 0.1726203069090843,
"num_tokens": 37210552.0,
"step": 21445
},
{
"entropy": 5.479701042175293,
"epoch": 1.6688971017311807,
"grad_norm": 1.359375,
"learning_rate": 0.0004720465724152127,
"loss": 5.2174,
"mean_token_accuracy": 0.18304990530014037,
"num_tokens": 37219001.0,
"step": 21450
},
{
"entropy": 5.460734558105469,
"epoch": 1.6692861311028984,
"grad_norm": 1.34375,
"learning_rate": 0.00047203319143843613,
"loss": 5.1423,
"mean_token_accuracy": 0.19142136573791504,
"num_tokens": 37227635.0,
"step": 21455
},
{
"entropy": 5.450155019760132,
"epoch": 1.6696751604746158,
"grad_norm": 1.53125,
"learning_rate": 0.0004720198074719946,
"loss": 5.1661,
"mean_token_accuracy": 0.18147356659173966,
"num_tokens": 37236872.0,
"step": 21460
},
{
"entropy": 5.5014739513397215,
"epoch": 1.6700641898463333,
"grad_norm": 1.4453125,
"learning_rate": 0.00047200642051609094,
"loss": 5.2326,
"mean_token_accuracy": 0.17663762271404265,
"num_tokens": 37245026.0,
"step": 21465
},
{
"entropy": 5.486216354370117,
"epoch": 1.670453219218051,
"grad_norm": 1.25,
"learning_rate": 0.0004719930305709285,
"loss": 5.1991,
"mean_token_accuracy": 0.17639574855566026,
"num_tokens": 37253295.0,
"step": 21470
},
{
"entropy": 5.4627148628234865,
"epoch": 1.6708422485897685,
"grad_norm": 1.421875,
"learning_rate": 0.00047197963763671033,
"loss": 5.1733,
"mean_token_accuracy": 0.1859034702181816,
"num_tokens": 37262785.0,
"step": 21475
},
{
"entropy": 5.422159099578858,
"epoch": 1.671231277961486,
"grad_norm": 1.3515625,
"learning_rate": 0.0004719662417136397,
"loss": 5.2357,
"mean_token_accuracy": 0.18522778451442717,
"num_tokens": 37271937.0,
"step": 21480
},
{
"entropy": 5.465244913101197,
"epoch": 1.6716203073332037,
"grad_norm": 1.4375,
"learning_rate": 0.00047195284280191987,
"loss": 5.1511,
"mean_token_accuracy": 0.1886195495724678,
"num_tokens": 37280861.0,
"step": 21485
},
{
"entropy": 5.482504749298096,
"epoch": 1.6720093367049214,
"grad_norm": 1.3515625,
"learning_rate": 0.0004719394409017541,
"loss": 5.1771,
"mean_token_accuracy": 0.18508583009243013,
"num_tokens": 37289235.0,
"step": 21490
},
{
"entropy": 5.446719980239868,
"epoch": 1.6723983660766388,
"grad_norm": 1.3046875,
"learning_rate": 0.00047192603601334585,
"loss": 5.1889,
"mean_token_accuracy": 0.1792226403951645,
"num_tokens": 37297778.0,
"step": 21495
},
{
"entropy": 5.452008390426636,
"epoch": 1.6727873954483563,
"grad_norm": 1.2890625,
"learning_rate": 0.00047191262813689835,
"loss": 5.1925,
"mean_token_accuracy": 0.1710060179233551,
"num_tokens": 37306960.0,
"step": 21500
},
{
"entropy": 5.499750852584839,
"epoch": 1.673176424820074,
"grad_norm": 1.34375,
"learning_rate": 0.0004718992172726152,
"loss": 5.2287,
"mean_token_accuracy": 0.17869676202535628,
"num_tokens": 37316050.0,
"step": 21505
},
{
"entropy": 5.421911334991455,
"epoch": 1.6735654541917915,
"grad_norm": 1.484375,
"learning_rate": 0.00047188580342069983,
"loss": 5.1747,
"mean_token_accuracy": 0.1850631579756737,
"num_tokens": 37325058.0,
"step": 21510
},
{
"entropy": 5.500029039382935,
"epoch": 1.673954483563509,
"grad_norm": 1.3046875,
"learning_rate": 0.0004718723865813557,
"loss": 5.269,
"mean_token_accuracy": 0.17668198496103288,
"num_tokens": 37333512.0,
"step": 21515
},
{
"entropy": 5.450409412384033,
"epoch": 1.6743435129352267,
"grad_norm": 1.3203125,
"learning_rate": 0.0004718589667547865,
"loss": 5.1832,
"mean_token_accuracy": 0.18660251647233964,
"num_tokens": 37341695.0,
"step": 21520
},
{
"entropy": 5.551853179931641,
"epoch": 1.6747325423069441,
"grad_norm": 1.28125,
"learning_rate": 0.0004718455439411958,
"loss": 5.315,
"mean_token_accuracy": 0.16997454315423965,
"num_tokens": 37350917.0,
"step": 21525
},
{
"entropy": 5.570763063430786,
"epoch": 1.6751215716786616,
"grad_norm": 1.2890625,
"learning_rate": 0.0004718321181407873,
"loss": 5.3156,
"mean_token_accuracy": 0.16932897120714188,
"num_tokens": 37360206.0,
"step": 21530
},
{
"entropy": 5.549673366546631,
"epoch": 1.6755106010503793,
"grad_norm": 1.171875,
"learning_rate": 0.0004718186893537647,
"loss": 5.2798,
"mean_token_accuracy": 0.17510711997747422,
"num_tokens": 37369378.0,
"step": 21535
},
{
"entropy": 5.467506027221679,
"epoch": 1.675899630422097,
"grad_norm": 1.390625,
"learning_rate": 0.0004718052575803318,
"loss": 5.1584,
"mean_token_accuracy": 0.19133659303188325,
"num_tokens": 37377744.0,
"step": 21540
},
{
"entropy": 5.473029565811157,
"epoch": 1.6762886597938145,
"grad_norm": 1.375,
"learning_rate": 0.0004717918228206923,
"loss": 5.2009,
"mean_token_accuracy": 0.17576997876167297,
"num_tokens": 37387097.0,
"step": 21545
},
{
"entropy": 5.5223987102508545,
"epoch": 1.676677689165532,
"grad_norm": 1.4375,
"learning_rate": 0.0004717783850750501,
"loss": 5.2668,
"mean_token_accuracy": 0.17804792821407317,
"num_tokens": 37395551.0,
"step": 21550
},
{
"entropy": 5.4536683559417725,
"epoch": 1.6770667185372496,
"grad_norm": 1.2890625,
"learning_rate": 0.0004717649443436091,
"loss": 5.017,
"mean_token_accuracy": 0.19075393825769424,
"num_tokens": 37403876.0,
"step": 21555
},
{
"entropy": 5.42834358215332,
"epoch": 1.6774557479089671,
"grad_norm": 1.203125,
"learning_rate": 0.00047175150062657336,
"loss": 5.1551,
"mean_token_accuracy": 0.18577537983655928,
"num_tokens": 37412658.0,
"step": 21560
},
{
"entropy": 5.424991512298584,
"epoch": 1.6778447772806846,
"grad_norm": 1.375,
"learning_rate": 0.00047173805392414664,
"loss": 5.1504,
"mean_token_accuracy": 0.18152452409267425,
"num_tokens": 37420790.0,
"step": 21565
},
{
"entropy": 5.445191287994385,
"epoch": 1.6782338066524023,
"grad_norm": 1.234375,
"learning_rate": 0.0004717246042365332,
"loss": 5.2106,
"mean_token_accuracy": 0.18707268089056014,
"num_tokens": 37428866.0,
"step": 21570
},
{
"entropy": 5.445303153991699,
"epoch": 1.6786228360241198,
"grad_norm": 1.28125,
"learning_rate": 0.00047171115156393695,
"loss": 5.1472,
"mean_token_accuracy": 0.18674639612436295,
"num_tokens": 37437636.0,
"step": 21575
},
{
"entropy": 5.460844421386719,
"epoch": 1.6790118653958372,
"grad_norm": 1.3359375,
"learning_rate": 0.00047169769590656207,
"loss": 5.1958,
"mean_token_accuracy": 0.18597369343042375,
"num_tokens": 37446455.0,
"step": 21580
},
{
"entropy": 5.4874711513519285,
"epoch": 1.679400894767555,
"grad_norm": 1.2734375,
"learning_rate": 0.00047168423726461273,
"loss": 5.2785,
"mean_token_accuracy": 0.17528842389583588,
"num_tokens": 37454997.0,
"step": 21585
},
{
"entropy": 5.439086961746216,
"epoch": 1.6797899241392726,
"grad_norm": 1.1953125,
"learning_rate": 0.0004716707756382931,
"loss": 5.1032,
"mean_token_accuracy": 0.18924276083707808,
"num_tokens": 37463701.0,
"step": 21590
},
{
"entropy": 5.482520914077758,
"epoch": 1.6801789535109901,
"grad_norm": 1.1796875,
"learning_rate": 0.00047165731102780757,
"loss": 5.2377,
"mean_token_accuracy": 0.17546220421791076,
"num_tokens": 37472460.0,
"step": 21595
},
{
"entropy": 5.506062984466553,
"epoch": 1.6805679828827076,
"grad_norm": 1.359375,
"learning_rate": 0.00047164384343336037,
"loss": 5.137,
"mean_token_accuracy": 0.187108314037323,
"num_tokens": 37481114.0,
"step": 21600
},
{
"entropy": 5.487678575515747,
"epoch": 1.6809570122544253,
"grad_norm": 1.2734375,
"learning_rate": 0.00047163037285515583,
"loss": 5.2309,
"mean_token_accuracy": 0.17664194256067275,
"num_tokens": 37489593.0,
"step": 21605
},
{
"entropy": 5.52338490486145,
"epoch": 1.6813460416261428,
"grad_norm": 1.3984375,
"learning_rate": 0.0004716168992933982,
"loss": 5.2931,
"mean_token_accuracy": 0.17980174273252486,
"num_tokens": 37498044.0,
"step": 21610
},
{
"entropy": 5.576248550415039,
"epoch": 1.6817350709978602,
"grad_norm": 1.34375,
"learning_rate": 0.00047160342274829234,
"loss": 5.1909,
"mean_token_accuracy": 0.1783790573477745,
"num_tokens": 37507339.0,
"step": 21615
},
{
"entropy": 5.402055072784424,
"epoch": 1.682124100369578,
"grad_norm": 1.21875,
"learning_rate": 0.00047158994322004223,
"loss": 5.0629,
"mean_token_accuracy": 0.18599337488412857,
"num_tokens": 37515919.0,
"step": 21620
},
{
"entropy": 5.41980881690979,
"epoch": 1.6825131297412956,
"grad_norm": 1.28125,
"learning_rate": 0.0004715764607088527,
"loss": 5.0759,
"mean_token_accuracy": 0.19855934232473374,
"num_tokens": 37524990.0,
"step": 21625
},
{
"entropy": 5.357426691055298,
"epoch": 1.6829021591130129,
"grad_norm": 1.328125,
"learning_rate": 0.0004715629752149283,
"loss": 5.2021,
"mean_token_accuracy": 0.1801751062273979,
"num_tokens": 37534125.0,
"step": 21630
},
{
"entropy": 5.4377974510192875,
"epoch": 1.6832911884847306,
"grad_norm": 1.28125,
"learning_rate": 0.00047154948673847356,
"loss": 5.1043,
"mean_token_accuracy": 0.18635933846235275,
"num_tokens": 37541715.0,
"step": 21635
},
{
"entropy": 5.571857595443726,
"epoch": 1.6836802178564483,
"grad_norm": 1.3828125,
"learning_rate": 0.0004715359952796933,
"loss": 5.2806,
"mean_token_accuracy": 0.18334741443395614,
"num_tokens": 37550097.0,
"step": 21640
},
{
"entropy": 5.412969875335693,
"epoch": 1.6840692472281658,
"grad_norm": 1.203125,
"learning_rate": 0.00047152250083879203,
"loss": 5.1432,
"mean_token_accuracy": 0.18714241534471512,
"num_tokens": 37558950.0,
"step": 21645
},
{
"entropy": 5.49203405380249,
"epoch": 1.6844582765998832,
"grad_norm": 1.4453125,
"learning_rate": 0.00047150900341597464,
"loss": 5.1754,
"mean_token_accuracy": 0.1835342451930046,
"num_tokens": 37567737.0,
"step": 21650
},
{
"entropy": 5.499365282058716,
"epoch": 1.684847305971601,
"grad_norm": 1.25,
"learning_rate": 0.0004714955030114459,
"loss": 5.2154,
"mean_token_accuracy": 0.1802396446466446,
"num_tokens": 37576649.0,
"step": 21655
},
{
"entropy": 5.454767417907715,
"epoch": 1.6852363353433184,
"grad_norm": 1.4140625,
"learning_rate": 0.00047148199962541065,
"loss": 5.1615,
"mean_token_accuracy": 0.19093205779790878,
"num_tokens": 37584455.0,
"step": 21660
},
{
"entropy": 5.448482084274292,
"epoch": 1.6856253647150359,
"grad_norm": 1.234375,
"learning_rate": 0.0004714684932580738,
"loss": 5.2535,
"mean_token_accuracy": 0.17322952300310135,
"num_tokens": 37593653.0,
"step": 21665
},
{
"entropy": 5.497285079956055,
"epoch": 1.6860143940867536,
"grad_norm": 1.2578125,
"learning_rate": 0.0004714549839096403,
"loss": 5.2078,
"mean_token_accuracy": 0.1763451039791107,
"num_tokens": 37603212.0,
"step": 21670
},
{
"entropy": 5.505492496490478,
"epoch": 1.6864034234584713,
"grad_norm": 1.2890625,
"learning_rate": 0.00047144147158031507,
"loss": 5.16,
"mean_token_accuracy": 0.18592147082090377,
"num_tokens": 37611871.0,
"step": 21675
},
{
"entropy": 5.5368345260620115,
"epoch": 1.6867924528301885,
"grad_norm": 1.375,
"learning_rate": 0.0004714279562703032,
"loss": 5.3555,
"mean_token_accuracy": 0.1708686903119087,
"num_tokens": 37621410.0,
"step": 21680
},
{
"entropy": 5.5193798542022705,
"epoch": 1.6871814822019062,
"grad_norm": 1.328125,
"learning_rate": 0.0004714144379798098,
"loss": 5.1446,
"mean_token_accuracy": 0.18192583620548247,
"num_tokens": 37629525.0,
"step": 21685
},
{
"entropy": 5.536234951019287,
"epoch": 1.687570511573624,
"grad_norm": 1.25,
"learning_rate": 0.00047140091670903986,
"loss": 5.1884,
"mean_token_accuracy": 0.18255068063735963,
"num_tokens": 37638183.0,
"step": 21690
},
{
"entropy": 5.47870192527771,
"epoch": 1.6879595409453414,
"grad_norm": 1.4140625,
"learning_rate": 0.00047138739245819857,
"loss": 5.1943,
"mean_token_accuracy": 0.18142457902431489,
"num_tokens": 37646884.0,
"step": 21695
},
{
"entropy": 5.527023363113403,
"epoch": 1.6883485703170589,
"grad_norm": 1.25,
"learning_rate": 0.00047137386522749124,
"loss": 5.2518,
"mean_token_accuracy": 0.17820024937391282,
"num_tokens": 37655482.0,
"step": 21700
},
{
"entropy": 5.456340265274048,
"epoch": 1.6887375996887766,
"grad_norm": 1.2421875,
"learning_rate": 0.0004713603350171231,
"loss": 5.0603,
"mean_token_accuracy": 0.18941994458436967,
"num_tokens": 37664056.0,
"step": 21705
},
{
"entropy": 5.526046276092529,
"epoch": 1.689126629060494,
"grad_norm": 1.28125,
"learning_rate": 0.00047134680182729926,
"loss": 5.3715,
"mean_token_accuracy": 0.1740104839205742,
"num_tokens": 37673198.0,
"step": 21710
},
{
"entropy": 5.479557704925537,
"epoch": 1.6895156584322115,
"grad_norm": 1.3203125,
"learning_rate": 0.0004713332656582254,
"loss": 5.1866,
"mean_token_accuracy": 0.179257732629776,
"num_tokens": 37682660.0,
"step": 21715
},
{
"entropy": 5.45224404335022,
"epoch": 1.6899046878039292,
"grad_norm": 1.34375,
"learning_rate": 0.0004713197265101066,
"loss": 5.1245,
"mean_token_accuracy": 0.1894549012184143,
"num_tokens": 37691232.0,
"step": 21720
},
{
"entropy": 5.4656774520874025,
"epoch": 1.690293717175647,
"grad_norm": 1.3359375,
"learning_rate": 0.00047130618438314856,
"loss": 5.091,
"mean_token_accuracy": 0.18957409262657166,
"num_tokens": 37699734.0,
"step": 21725
},
{
"entropy": 5.509268569946289,
"epoch": 1.6906827465473642,
"grad_norm": 1.3515625,
"learning_rate": 0.0004712926392775565,
"loss": 5.2136,
"mean_token_accuracy": 0.18614676892757415,
"num_tokens": 37708529.0,
"step": 21730
},
{
"entropy": 5.437744808197022,
"epoch": 1.6910717759190819,
"grad_norm": 1.203125,
"learning_rate": 0.0004712790911935362,
"loss": 5.0695,
"mean_token_accuracy": 0.19235442578792572,
"num_tokens": 37717197.0,
"step": 21735
},
{
"entropy": 5.42674503326416,
"epoch": 1.6914608052907996,
"grad_norm": 1.25,
"learning_rate": 0.000471265540131293,
"loss": 5.231,
"mean_token_accuracy": 0.17683700770139693,
"num_tokens": 37726276.0,
"step": 21740
},
{
"entropy": 5.56557822227478,
"epoch": 1.691849834662517,
"grad_norm": 1.28125,
"learning_rate": 0.00047125198609103267,
"loss": 5.2611,
"mean_token_accuracy": 0.17319420278072356,
"num_tokens": 37735016.0,
"step": 21745
},
{
"entropy": 5.5916131973266605,
"epoch": 1.6922388640342345,
"grad_norm": 1.3515625,
"learning_rate": 0.0004712384290729607,
"loss": 5.2227,
"mean_token_accuracy": 0.18264103233814238,
"num_tokens": 37744332.0,
"step": 21750
},
{
"entropy": 5.567017126083374,
"epoch": 1.6926278934059522,
"grad_norm": 1.3046875,
"learning_rate": 0.000471224869077283,
"loss": 5.264,
"mean_token_accuracy": 0.17130552381277084,
"num_tokens": 37752805.0,
"step": 21755
},
{
"entropy": 5.511889505386352,
"epoch": 1.6930169227776697,
"grad_norm": 1.3046875,
"learning_rate": 0.00047121130610420527,
"loss": 5.1866,
"mean_token_accuracy": 0.18206255584955217,
"num_tokens": 37760979.0,
"step": 21760
},
{
"entropy": 5.421501302719117,
"epoch": 1.6934059521493872,
"grad_norm": 1.328125,
"learning_rate": 0.00047119774015393323,
"loss": 5.112,
"mean_token_accuracy": 0.18570806086063385,
"num_tokens": 37769096.0,
"step": 21765
},
{
"entropy": 5.42561616897583,
"epoch": 1.6937949815211049,
"grad_norm": 1.3359375,
"learning_rate": 0.00047118417122667285,
"loss": 5.1201,
"mean_token_accuracy": 0.18631493002176286,
"num_tokens": 37776998.0,
"step": 21770
},
{
"entropy": 5.459209871292114,
"epoch": 1.6941840108928226,
"grad_norm": 1.2578125,
"learning_rate": 0.0004711705993226298,
"loss": 5.2616,
"mean_token_accuracy": 0.1790543705224991,
"num_tokens": 37785547.0,
"step": 21775
},
{
"entropy": 5.48904857635498,
"epoch": 1.6945730402645398,
"grad_norm": 1.2890625,
"learning_rate": 0.0004711570244420102,
"loss": 5.2281,
"mean_token_accuracy": 0.18304537683725358,
"num_tokens": 37793659.0,
"step": 21780
},
{
"entropy": 5.556977987289429,
"epoch": 1.6949620696362575,
"grad_norm": 1.2890625,
"learning_rate": 0.0004711434465850199,
"loss": 5.129,
"mean_token_accuracy": 0.1895242840051651,
"num_tokens": 37802282.0,
"step": 21785
},
{
"entropy": 5.4802467823028564,
"epoch": 1.6953510990079752,
"grad_norm": 1.34375,
"learning_rate": 0.0004711298657518651,
"loss": 5.2029,
"mean_token_accuracy": 0.18438080698251724,
"num_tokens": 37810692.0,
"step": 21790
},
{
"entropy": 5.452144193649292,
"epoch": 1.6957401283796927,
"grad_norm": 1.28125,
"learning_rate": 0.0004711162819427518,
"loss": 5.1523,
"mean_token_accuracy": 0.1874224066734314,
"num_tokens": 37819264.0,
"step": 21795
},
{
"entropy": 5.5173835277557375,
"epoch": 1.6961291577514102,
"grad_norm": 1.40625,
"learning_rate": 0.000471102695157886,
"loss": 5.1793,
"mean_token_accuracy": 0.1844692498445511,
"num_tokens": 37827650.0,
"step": 21800
},
{
"entropy": 5.403632164001465,
"epoch": 1.6965181871231279,
"grad_norm": 1.328125,
"learning_rate": 0.0004710891053974739,
"loss": 5.1367,
"mean_token_accuracy": 0.18615172058343887,
"num_tokens": 37835683.0,
"step": 21805
},
{
"entropy": 5.437741756439209,
"epoch": 1.6969072164948453,
"grad_norm": 1.25,
"learning_rate": 0.0004710755126617217,
"loss": 5.1562,
"mean_token_accuracy": 0.18022779673337935,
"num_tokens": 37844334.0,
"step": 21810
},
{
"entropy": 5.408273363113404,
"epoch": 1.6972962458665628,
"grad_norm": 1.328125,
"learning_rate": 0.0004710619169508358,
"loss": 5.1167,
"mean_token_accuracy": 0.1818087086081505,
"num_tokens": 37853609.0,
"step": 21815
},
{
"entropy": 5.48780460357666,
"epoch": 1.6976852752382805,
"grad_norm": 1.25,
"learning_rate": 0.0004710483182650223,
"loss": 5.1849,
"mean_token_accuracy": 0.1785520628094673,
"num_tokens": 37862817.0,
"step": 21820
},
{
"entropy": 5.432931995391845,
"epoch": 1.6980743046099982,
"grad_norm": 1.359375,
"learning_rate": 0.00047103471660448767,
"loss": 5.1208,
"mean_token_accuracy": 0.18961375653743745,
"num_tokens": 37871630.0,
"step": 21825
},
{
"entropy": 5.383476877212525,
"epoch": 1.6984633339817157,
"grad_norm": 1.234375,
"learning_rate": 0.00047102111196943813,
"loss": 5.1378,
"mean_token_accuracy": 0.18788239359855652,
"num_tokens": 37881098.0,
"step": 21830
},
{
"entropy": 5.484206819534302,
"epoch": 1.6988523633534331,
"grad_norm": 1.3125,
"learning_rate": 0.00047100750436008035,
"loss": 5.1504,
"mean_token_accuracy": 0.18563647270202638,
"num_tokens": 37889760.0,
"step": 21835
},
{
"entropy": 5.582745027542114,
"epoch": 1.6992413927251508,
"grad_norm": 1.34375,
"learning_rate": 0.00047099389377662054,
"loss": 5.2536,
"mean_token_accuracy": 0.1785595014691353,
"num_tokens": 37898417.0,
"step": 21840
},
{
"entropy": 5.488845634460449,
"epoch": 1.6996304220968683,
"grad_norm": 1.3515625,
"learning_rate": 0.0004709802802192654,
"loss": 5.1856,
"mean_token_accuracy": 0.18901499956846238,
"num_tokens": 37907117.0,
"step": 21845
},
{
"entropy": 5.452686977386475,
"epoch": 1.7000194514685858,
"grad_norm": 1.2578125,
"learning_rate": 0.00047096666368822153,
"loss": 5.1054,
"mean_token_accuracy": 0.18972180038690567,
"num_tokens": 37915781.0,
"step": 21850
},
{
"entropy": 5.481147718429566,
"epoch": 1.7004084808403035,
"grad_norm": 1.296875,
"learning_rate": 0.00047095304418369536,
"loss": 5.2192,
"mean_token_accuracy": 0.1790919244289398,
"num_tokens": 37924770.0,
"step": 21855
},
{
"entropy": 5.474031734466553,
"epoch": 1.700797510212021,
"grad_norm": 1.2578125,
"learning_rate": 0.0004709394217058936,
"loss": 5.2128,
"mean_token_accuracy": 0.17771313786506654,
"num_tokens": 37933512.0,
"step": 21860
},
{
"entropy": 5.478064727783203,
"epoch": 1.7011865395837384,
"grad_norm": 1.2890625,
"learning_rate": 0.0004709257962550231,
"loss": 5.0432,
"mean_token_accuracy": 0.18830222338438035,
"num_tokens": 37942439.0,
"step": 21865
},
{
"entropy": 5.508541059494019,
"epoch": 1.7015755689554561,
"grad_norm": 1.234375,
"learning_rate": 0.00047091216783129035,
"loss": 5.2535,
"mean_token_accuracy": 0.17767124772071838,
"num_tokens": 37951388.0,
"step": 21870
},
{
"entropy": 5.499156904220581,
"epoch": 1.7019645983271738,
"grad_norm": 1.2890625,
"learning_rate": 0.0004708985364349024,
"loss": 5.2278,
"mean_token_accuracy": 0.18199572712183,
"num_tokens": 37960372.0,
"step": 21875
},
{
"entropy": 5.560420036315918,
"epoch": 1.7023536276988913,
"grad_norm": 1.4765625,
"learning_rate": 0.00047088490206606586,
"loss": 5.3252,
"mean_token_accuracy": 0.16874147057533265,
"num_tokens": 37969472.0,
"step": 21880
},
{
"entropy": 5.451031494140625,
"epoch": 1.7027426570706088,
"grad_norm": 1.3671875,
"learning_rate": 0.00047087126472498785,
"loss": 5.0597,
"mean_token_accuracy": 0.19225776493549346,
"num_tokens": 37977422.0,
"step": 21885
},
{
"entropy": 5.396897268295288,
"epoch": 1.7031316864423265,
"grad_norm": 1.3359375,
"learning_rate": 0.000470857624411875,
"loss": 5.0249,
"mean_token_accuracy": 0.1890472114086151,
"num_tokens": 37985861.0,
"step": 21890
},
{
"entropy": 5.492931652069092,
"epoch": 1.703520715814044,
"grad_norm": 1.453125,
"learning_rate": 0.00047084398112693456,
"loss": 5.1738,
"mean_token_accuracy": 0.18054302483797074,
"num_tokens": 37994535.0,
"step": 21895
},
{
"entropy": 5.459228372573852,
"epoch": 1.7039097451857614,
"grad_norm": 1.3125,
"learning_rate": 0.0004708303348703734,
"loss": 5.1874,
"mean_token_accuracy": 0.17980311810970306,
"num_tokens": 38003351.0,
"step": 21900
},
{
"entropy": 5.468518543243408,
"epoch": 1.7042987745574791,
"grad_norm": 1.5234375,
"learning_rate": 0.0004708166856423986,
"loss": 5.1751,
"mean_token_accuracy": 0.1801972582936287,
"num_tokens": 38012210.0,
"step": 21905
},
{
"entropy": 5.5348419666290285,
"epoch": 1.7046878039291966,
"grad_norm": 1.28125,
"learning_rate": 0.00047080303344321727,
"loss": 5.1983,
"mean_token_accuracy": 0.18600852340459822,
"num_tokens": 38020548.0,
"step": 21910
},
{
"entropy": 5.50296721458435,
"epoch": 1.705076833300914,
"grad_norm": 1.359375,
"learning_rate": 0.00047078937827303653,
"loss": 5.1574,
"mean_token_accuracy": 0.17908090949058533,
"num_tokens": 38029451.0,
"step": 21915
},
{
"entropy": 5.507396650314331,
"epoch": 1.7054658626726318,
"grad_norm": 1.3203125,
"learning_rate": 0.0004707757201320636,
"loss": 5.1872,
"mean_token_accuracy": 0.1779931366443634,
"num_tokens": 38037821.0,
"step": 21920
},
{
"entropy": 5.468212747573853,
"epoch": 1.7058548920443495,
"grad_norm": 1.34375,
"learning_rate": 0.00047076205902050577,
"loss": 5.2451,
"mean_token_accuracy": 0.17384670525789261,
"num_tokens": 38046188.0,
"step": 21925
},
{
"entropy": 5.48951358795166,
"epoch": 1.706243921416067,
"grad_norm": 1.2421875,
"learning_rate": 0.00047074839493857024,
"loss": 5.2448,
"mean_token_accuracy": 0.17903341203927994,
"num_tokens": 38054821.0,
"step": 21930
},
{
"entropy": 5.5162371635437015,
"epoch": 1.7066329507877844,
"grad_norm": 1.1953125,
"learning_rate": 0.0004707347278864644,
"loss": 5.1368,
"mean_token_accuracy": 0.18613288849592208,
"num_tokens": 38063057.0,
"step": 21935
},
{
"entropy": 5.5428966045379635,
"epoch": 1.7070219801595021,
"grad_norm": 1.1953125,
"learning_rate": 0.00047072105786439563,
"loss": 5.3323,
"mean_token_accuracy": 0.17659984529018402,
"num_tokens": 38071694.0,
"step": 21940
},
{
"entropy": 5.49590482711792,
"epoch": 1.7074110095312196,
"grad_norm": 1.2421875,
"learning_rate": 0.00047070738487257137,
"loss": 5.1401,
"mean_token_accuracy": 0.18106452524662017,
"num_tokens": 38080965.0,
"step": 21945
},
{
"entropy": 5.4778368949890135,
"epoch": 1.707800038902937,
"grad_norm": 1.5390625,
"learning_rate": 0.00047069370891119895,
"loss": 5.1505,
"mean_token_accuracy": 0.18181752413511276,
"num_tokens": 38089786.0,
"step": 21950
},
{
"entropy": 5.484994697570801,
"epoch": 1.7081890682746548,
"grad_norm": 1.4765625,
"learning_rate": 0.000470680029980486,
"loss": 5.1717,
"mean_token_accuracy": 0.1887707769870758,
"num_tokens": 38097994.0,
"step": 21955
},
{
"entropy": 5.461494445800781,
"epoch": 1.7085780976463723,
"grad_norm": 1.25,
"learning_rate": 0.00047066634808064006,
"loss": 5.2357,
"mean_token_accuracy": 0.18059082329273224,
"num_tokens": 38106910.0,
"step": 21960
},
{
"entropy": 5.492050266265869,
"epoch": 1.7089671270180897,
"grad_norm": 1.4921875,
"learning_rate": 0.00047065266321186873,
"loss": 5.1314,
"mean_token_accuracy": 0.18940888792276384,
"num_tokens": 38115162.0,
"step": 21965
},
{
"entropy": 5.5154944896698,
"epoch": 1.7093561563898074,
"grad_norm": 1.2734375,
"learning_rate": 0.0004706389753743797,
"loss": 5.2083,
"mean_token_accuracy": 0.18512068390846254,
"num_tokens": 38123776.0,
"step": 21970
},
{
"entropy": 5.501916837692261,
"epoch": 1.7097451857615251,
"grad_norm": 1.234375,
"learning_rate": 0.0004706252845683805,
"loss": 5.3003,
"mean_token_accuracy": 0.179806949198246,
"num_tokens": 38132591.0,
"step": 21975
},
{
"entropy": 5.46964282989502,
"epoch": 1.7101342151332426,
"grad_norm": 1.546875,
"learning_rate": 0.00047061159079407903,
"loss": 5.1445,
"mean_token_accuracy": 0.1893348887562752,
"num_tokens": 38141092.0,
"step": 21980
},
{
"entropy": 5.4742332935333256,
"epoch": 1.71052324450496,
"grad_norm": 1.296875,
"learning_rate": 0.000470597894051683,
"loss": 5.1087,
"mean_token_accuracy": 0.1865133300423622,
"num_tokens": 38149315.0,
"step": 21985
},
{
"entropy": 5.403580665588379,
"epoch": 1.7109122738766778,
"grad_norm": 1.328125,
"learning_rate": 0.0004705841943414003,
"loss": 5.0723,
"mean_token_accuracy": 0.18359042555093766,
"num_tokens": 38158208.0,
"step": 21990
},
{
"entropy": 5.543454551696778,
"epoch": 1.7113013032483952,
"grad_norm": 1.3046875,
"learning_rate": 0.00047057049166343876,
"loss": 5.2694,
"mean_token_accuracy": 0.1762729302048683,
"num_tokens": 38166339.0,
"step": 21995
},
{
"entropy": 5.470950889587402,
"epoch": 1.7116903326201127,
"grad_norm": 1.375,
"learning_rate": 0.00047055678601800623,
"loss": 5.1984,
"mean_token_accuracy": 0.18115722388029099,
"num_tokens": 38174813.0,
"step": 22000
},
{
"entropy": 5.434200811386108,
"epoch": 1.7120793619918304,
"grad_norm": 1.21875,
"learning_rate": 0.00047054307740531076,
"loss": 5.0759,
"mean_token_accuracy": 0.18827767670154572,
"num_tokens": 38183440.0,
"step": 22005
},
{
"entropy": 5.407111597061157,
"epoch": 1.712468391363548,
"grad_norm": 1.796875,
"learning_rate": 0.00047052936582556035,
"loss": 5.1475,
"mean_token_accuracy": 0.18075976073741912,
"num_tokens": 38192510.0,
"step": 22010
},
{
"entropy": 5.456093883514404,
"epoch": 1.7128574207352654,
"grad_norm": 1.265625,
"learning_rate": 0.00047051565127896307,
"loss": 5.1308,
"mean_token_accuracy": 0.18713924735784532,
"num_tokens": 38200854.0,
"step": 22015
},
{
"entropy": 5.489348268508911,
"epoch": 1.713246450106983,
"grad_norm": 1.53125,
"learning_rate": 0.00047050193376572686,
"loss": 5.1977,
"mean_token_accuracy": 0.17768681198358535,
"num_tokens": 38209632.0,
"step": 22020
},
{
"entropy": 5.430175113677978,
"epoch": 1.7136354794787008,
"grad_norm": 1.265625,
"learning_rate": 0.00047048821328606,
"loss": 5.1042,
"mean_token_accuracy": 0.18659493327140808,
"num_tokens": 38218657.0,
"step": 22025
},
{
"entropy": 5.509564304351807,
"epoch": 1.7140245088504182,
"grad_norm": 1.1796875,
"learning_rate": 0.0004704744898401708,
"loss": 5.1837,
"mean_token_accuracy": 0.18010811358690262,
"num_tokens": 38227507.0,
"step": 22030
},
{
"entropy": 5.497655630111694,
"epoch": 1.7144135382221357,
"grad_norm": 1.328125,
"learning_rate": 0.0004704607634282672,
"loss": 5.1545,
"mean_token_accuracy": 0.1801443263888359,
"num_tokens": 38236822.0,
"step": 22035
},
{
"entropy": 5.363424158096313,
"epoch": 1.7148025675938534,
"grad_norm": 1.265625,
"learning_rate": 0.00047044703405055765,
"loss": 5.0378,
"mean_token_accuracy": 0.19286258816719054,
"num_tokens": 38245144.0,
"step": 22040
},
{
"entropy": 5.410093784332275,
"epoch": 1.7151915969655709,
"grad_norm": 1.28125,
"learning_rate": 0.00047043330170725046,
"loss": 5.1446,
"mean_token_accuracy": 0.1825016438961029,
"num_tokens": 38254363.0,
"step": 22045
},
{
"entropy": 5.406072473526001,
"epoch": 1.7155806263372884,
"grad_norm": 1.28125,
"learning_rate": 0.00047041956639855406,
"loss": 5.1506,
"mean_token_accuracy": 0.18412292152643203,
"num_tokens": 38263117.0,
"step": 22050
},
{
"entropy": 5.442934942245484,
"epoch": 1.715969655709006,
"grad_norm": 1.2578125,
"learning_rate": 0.0004704058281246766,
"loss": 5.1459,
"mean_token_accuracy": 0.18146743029356002,
"num_tokens": 38271217.0,
"step": 22055
},
{
"entropy": 5.560351610183716,
"epoch": 1.7163586850807238,
"grad_norm": 1.296875,
"learning_rate": 0.0004703920868858268,
"loss": 5.2944,
"mean_token_accuracy": 0.17736971080303193,
"num_tokens": 38279789.0,
"step": 22060
},
{
"entropy": 5.487414455413818,
"epoch": 1.716747714452441,
"grad_norm": 1.2421875,
"learning_rate": 0.00047037834268221315,
"loss": 5.0983,
"mean_token_accuracy": 0.18638417720794678,
"num_tokens": 38288845.0,
"step": 22065
},
{
"entropy": 5.461179876327515,
"epoch": 1.7171367438241587,
"grad_norm": 1.3984375,
"learning_rate": 0.0004703645955140441,
"loss": 5.1521,
"mean_token_accuracy": 0.18562852144241332,
"num_tokens": 38297237.0,
"step": 22070
},
{
"entropy": 5.535586595535278,
"epoch": 1.7175257731958764,
"grad_norm": 1.671875,
"learning_rate": 0.00047035084538152815,
"loss": 5.2867,
"mean_token_accuracy": 0.17631856352090836,
"num_tokens": 38306582.0,
"step": 22075
},
{
"entropy": 5.492889356613159,
"epoch": 1.7179148025675939,
"grad_norm": 1.2265625,
"learning_rate": 0.0004703370922848742,
"loss": 5.088,
"mean_token_accuracy": 0.19182030111551285,
"num_tokens": 38315406.0,
"step": 22080
},
{
"entropy": 5.385633850097657,
"epoch": 1.7183038319393114,
"grad_norm": 1.40625,
"learning_rate": 0.00047032333622429074,
"loss": 5.0737,
"mean_token_accuracy": 0.1865725800395012,
"num_tokens": 38324271.0,
"step": 22085
},
{
"entropy": 5.4675578594207765,
"epoch": 1.718692861311029,
"grad_norm": 1.28125,
"learning_rate": 0.00047030957719998656,
"loss": 5.1864,
"mean_token_accuracy": 0.18055996745824815,
"num_tokens": 38332831.0,
"step": 22090
},
{
"entropy": 5.45624418258667,
"epoch": 1.7190818906827465,
"grad_norm": 1.28125,
"learning_rate": 0.0004702958152121704,
"loss": 5.0811,
"mean_token_accuracy": 0.1836458832025528,
"num_tokens": 38341263.0,
"step": 22095
},
{
"entropy": 5.50359787940979,
"epoch": 1.719470920054464,
"grad_norm": 1.3125,
"learning_rate": 0.0004702820502610511,
"loss": 5.2817,
"mean_token_accuracy": 0.1755241185426712,
"num_tokens": 38349890.0,
"step": 22100
},
{
"entropy": 5.379726934432983,
"epoch": 1.7198599494261817,
"grad_norm": 1.2265625,
"learning_rate": 0.0004702682823468375,
"loss": 5.0697,
"mean_token_accuracy": 0.18643116801977158,
"num_tokens": 38358071.0,
"step": 22105
},
{
"entropy": 5.51623911857605,
"epoch": 1.7202489787978994,
"grad_norm": 1.21875,
"learning_rate": 0.00047025451146973844,
"loss": 5.258,
"mean_token_accuracy": 0.1749507248401642,
"num_tokens": 38366859.0,
"step": 22110
},
{
"entropy": 5.63382396697998,
"epoch": 1.7206380081696167,
"grad_norm": 1.4375,
"learning_rate": 0.00047024073762996305,
"loss": 5.3902,
"mean_token_accuracy": 0.16557009220123292,
"num_tokens": 38375897.0,
"step": 22115
},
{
"entropy": 5.532764434814453,
"epoch": 1.7210270375413343,
"grad_norm": 1.21875,
"learning_rate": 0.0004702269608277202,
"loss": 5.1786,
"mean_token_accuracy": 0.1866125464439392,
"num_tokens": 38384700.0,
"step": 22120
},
{
"entropy": 5.479254817962646,
"epoch": 1.721416066913052,
"grad_norm": 1.3046875,
"learning_rate": 0.0004702131810632189,
"loss": 5.2039,
"mean_token_accuracy": 0.18158965259790422,
"num_tokens": 38393212.0,
"step": 22125
},
{
"entropy": 5.438112497329712,
"epoch": 1.7218050962847695,
"grad_norm": 1.2265625,
"learning_rate": 0.00047019939833666837,
"loss": 5.1248,
"mean_token_accuracy": 0.18704920411109924,
"num_tokens": 38401572.0,
"step": 22130
},
{
"entropy": 5.451372861862183,
"epoch": 1.722194125656487,
"grad_norm": 1.390625,
"learning_rate": 0.0004701856126482776,
"loss": 5.1686,
"mean_token_accuracy": 0.18047335743904114,
"num_tokens": 38410669.0,
"step": 22135
},
{
"entropy": 5.439099597930908,
"epoch": 1.7225831550282047,
"grad_norm": 1.375,
"learning_rate": 0.0004701718239982559,
"loss": 5.1779,
"mean_token_accuracy": 0.1813839480280876,
"num_tokens": 38419038.0,
"step": 22140
},
{
"entropy": 5.4189269065856935,
"epoch": 1.7229721843999222,
"grad_norm": 1.328125,
"learning_rate": 0.00047015803238681234,
"loss": 5.0914,
"mean_token_accuracy": 0.19410210847854614,
"num_tokens": 38427314.0,
"step": 22145
},
{
"entropy": 5.444206428527832,
"epoch": 1.7233612137716396,
"grad_norm": 1.2890625,
"learning_rate": 0.0004701442378141563,
"loss": 5.0886,
"mean_token_accuracy": 0.18488903045654298,
"num_tokens": 38435373.0,
"step": 22150
},
{
"entropy": 5.4263427734375,
"epoch": 1.7237502431433573,
"grad_norm": 1.21875,
"learning_rate": 0.000470130440280497,
"loss": 5.1363,
"mean_token_accuracy": 0.1891674965620041,
"num_tokens": 38444448.0,
"step": 22155
},
{
"entropy": 5.4646138668060305,
"epoch": 1.724139272515075,
"grad_norm": 1.1875,
"learning_rate": 0.0004701166397860439,
"loss": 5.0608,
"mean_token_accuracy": 0.1896888643503189,
"num_tokens": 38453576.0,
"step": 22160
},
{
"entropy": 5.469957447052002,
"epoch": 1.7245283018867923,
"grad_norm": 1.3046875,
"learning_rate": 0.0004701028363310064,
"loss": 5.141,
"mean_token_accuracy": 0.18905406892299653,
"num_tokens": 38462848.0,
"step": 22165
},
{
"entropy": 5.383284235000611,
"epoch": 1.72491733125851,
"grad_norm": 1.34375,
"learning_rate": 0.00047008902991559385,
"loss": 5.0852,
"mean_token_accuracy": 0.18901194930076598,
"num_tokens": 38470953.0,
"step": 22170
},
{
"entropy": 5.4624855518341064,
"epoch": 1.7253063606302277,
"grad_norm": 1.1875,
"learning_rate": 0.0004700752205400158,
"loss": 5.2505,
"mean_token_accuracy": 0.1754434123635292,
"num_tokens": 38479835.0,
"step": 22175
},
{
"entropy": 5.503275585174561,
"epoch": 1.7256953900019452,
"grad_norm": 1.5,
"learning_rate": 0.00047006140820448174,
"loss": 5.1525,
"mean_token_accuracy": 0.17973658591508865,
"num_tokens": 38488342.0,
"step": 22180
},
{
"entropy": 5.495552206039429,
"epoch": 1.7260844193736626,
"grad_norm": 1.2109375,
"learning_rate": 0.00047004759290920136,
"loss": 5.1872,
"mean_token_accuracy": 0.1793127626180649,
"num_tokens": 38496716.0,
"step": 22185
},
{
"entropy": 5.49908127784729,
"epoch": 1.7264734487453803,
"grad_norm": 1.265625,
"learning_rate": 0.0004700337746543841,
"loss": 5.2071,
"mean_token_accuracy": 0.17958493828773497,
"num_tokens": 38506615.0,
"step": 22190
},
{
"entropy": 5.378666067123413,
"epoch": 1.7268624781170978,
"grad_norm": 1.3515625,
"learning_rate": 0.0004700199534402398,
"loss": 5.0086,
"mean_token_accuracy": 0.1907874435186386,
"num_tokens": 38515936.0,
"step": 22195
},
{
"entropy": 5.376315927505493,
"epoch": 1.7272515074888153,
"grad_norm": 1.3203125,
"learning_rate": 0.0004700061292669781,
"loss": 5.1553,
"mean_token_accuracy": 0.18106213063001633,
"num_tokens": 38524829.0,
"step": 22200
},
{
"entropy": 5.551873874664307,
"epoch": 1.727640536860533,
"grad_norm": 1.2421875,
"learning_rate": 0.0004699923021348088,
"loss": 5.2936,
"mean_token_accuracy": 0.16981442272663116,
"num_tokens": 38533686.0,
"step": 22205
},
{
"entropy": 5.548052072525024,
"epoch": 1.7280295662322507,
"grad_norm": 1.2265625,
"learning_rate": 0.00046997847204394166,
"loss": 5.1834,
"mean_token_accuracy": 0.18329640328884125,
"num_tokens": 38542449.0,
"step": 22210
},
{
"entropy": 5.425648736953735,
"epoch": 1.728418595603968,
"grad_norm": 1.2890625,
"learning_rate": 0.00046996463899458653,
"loss": 5.1474,
"mean_token_accuracy": 0.18340075761079788,
"num_tokens": 38550888.0,
"step": 22215
},
{
"entropy": 5.430046558380127,
"epoch": 1.7288076249756856,
"grad_norm": 1.46875,
"learning_rate": 0.0004699508029869533,
"loss": 5.1861,
"mean_token_accuracy": 0.18463295102119445,
"num_tokens": 38559366.0,
"step": 22220
},
{
"entropy": 5.500632333755493,
"epoch": 1.7291966543474033,
"grad_norm": 1.28125,
"learning_rate": 0.00046993696402125205,
"loss": 5.1922,
"mean_token_accuracy": 0.1893218770623207,
"num_tokens": 38567080.0,
"step": 22225
},
{
"entropy": 5.448725461959839,
"epoch": 1.7295856837191208,
"grad_norm": 1.2890625,
"learning_rate": 0.0004699231220976925,
"loss": 5.186,
"mean_token_accuracy": 0.18618176877498627,
"num_tokens": 38575520.0,
"step": 22230
},
{
"entropy": 5.509118556976318,
"epoch": 1.7299747130908383,
"grad_norm": 1.2890625,
"learning_rate": 0.0004699092772164849,
"loss": 5.2631,
"mean_token_accuracy": 0.16927947252988815,
"num_tokens": 38583974.0,
"step": 22235
},
{
"entropy": 5.421317195892334,
"epoch": 1.730363742462556,
"grad_norm": 1.328125,
"learning_rate": 0.0004698954293778392,
"loss": 5.1702,
"mean_token_accuracy": 0.18597484827041627,
"num_tokens": 38592677.0,
"step": 22240
},
{
"entropy": 5.46505069732666,
"epoch": 1.7307527718342735,
"grad_norm": 1.390625,
"learning_rate": 0.00046988157858196555,
"loss": 5.0062,
"mean_token_accuracy": 0.19476415812969208,
"num_tokens": 38601342.0,
"step": 22245
},
{
"entropy": 5.497976541519165,
"epoch": 1.731141801205991,
"grad_norm": 1.3125,
"learning_rate": 0.00046986772482907426,
"loss": 5.2943,
"mean_token_accuracy": 0.1689124211668968,
"num_tokens": 38610895.0,
"step": 22250
},
{
"entropy": 5.5042956352233885,
"epoch": 1.7315308305777086,
"grad_norm": 1.375,
"learning_rate": 0.0004698538681193754,
"loss": 5.2483,
"mean_token_accuracy": 0.1772924154996872,
"num_tokens": 38619059.0,
"step": 22255
},
{
"entropy": 5.535574102401734,
"epoch": 1.7319198599494263,
"grad_norm": 1.328125,
"learning_rate": 0.00046984000845307907,
"loss": 5.1947,
"mean_token_accuracy": 0.18294396251440048,
"num_tokens": 38628084.0,
"step": 22260
},
{
"entropy": 5.429641675949097,
"epoch": 1.7323088893211438,
"grad_norm": 1.328125,
"learning_rate": 0.00046982614583039584,
"loss": 5.1577,
"mean_token_accuracy": 0.18668740540742873,
"num_tokens": 38636205.0,
"step": 22265
},
{
"entropy": 5.38273057937622,
"epoch": 1.7326979186928613,
"grad_norm": 1.375,
"learning_rate": 0.0004698122802515359,
"loss": 5.1452,
"mean_token_accuracy": 0.17684746086597442,
"num_tokens": 38644583.0,
"step": 22270
},
{
"entropy": 5.440549755096436,
"epoch": 1.733086948064579,
"grad_norm": 1.3125,
"learning_rate": 0.0004697984117167097,
"loss": 5.1255,
"mean_token_accuracy": 0.1873730316758156,
"num_tokens": 38653517.0,
"step": 22275
},
{
"entropy": 5.437548112869263,
"epoch": 1.7334759774362964,
"grad_norm": 1.3828125,
"learning_rate": 0.00046978454022612767,
"loss": 5.1883,
"mean_token_accuracy": 0.18019161969423295,
"num_tokens": 38661926.0,
"step": 22280
},
{
"entropy": 5.490012121200562,
"epoch": 1.733865006808014,
"grad_norm": 1.3203125,
"learning_rate": 0.00046977066578000025,
"loss": 5.2804,
"mean_token_accuracy": 0.1795118570327759,
"num_tokens": 38671567.0,
"step": 22285
},
{
"entropy": 5.489447116851807,
"epoch": 1.7342540361797316,
"grad_norm": 1.8515625,
"learning_rate": 0.00046975678837853806,
"loss": 5.1571,
"mean_token_accuracy": 0.18748637437820434,
"num_tokens": 38680439.0,
"step": 22290
},
{
"entropy": 5.509334516525269,
"epoch": 1.734643065551449,
"grad_norm": 1.2734375,
"learning_rate": 0.00046974290802195156,
"loss": 5.2201,
"mean_token_accuracy": 0.18281150311231614,
"num_tokens": 38689168.0,
"step": 22295
},
{
"entropy": 5.525952291488648,
"epoch": 1.7350320949231666,
"grad_norm": 1.3203125,
"learning_rate": 0.0004697290247104513,
"loss": 5.138,
"mean_token_accuracy": 0.18853412717580795,
"num_tokens": 38697592.0,
"step": 22300
},
{
"entropy": 5.422291326522827,
"epoch": 1.7354211242948843,
"grad_norm": 1.34375,
"learning_rate": 0.00046971513844424814,
"loss": 5.186,
"mean_token_accuracy": 0.17944524586200714,
"num_tokens": 38705561.0,
"step": 22305
},
{
"entropy": 5.382885980606079,
"epoch": 1.735810153666602,
"grad_norm": 1.296875,
"learning_rate": 0.00046970124922355265,
"loss": 5.1694,
"mean_token_accuracy": 0.18152492195367814,
"num_tokens": 38714694.0,
"step": 22310
},
{
"entropy": 5.43862133026123,
"epoch": 1.7361991830383194,
"grad_norm": 1.2421875,
"learning_rate": 0.0004696873570485756,
"loss": 5.1343,
"mean_token_accuracy": 0.18580865412950515,
"num_tokens": 38722797.0,
"step": 22315
},
{
"entropy": 5.481307506561279,
"epoch": 1.736588212410037,
"grad_norm": 1.296875,
"learning_rate": 0.0004696734619195278,
"loss": 5.2189,
"mean_token_accuracy": 0.181018403172493,
"num_tokens": 38732076.0,
"step": 22320
},
{
"entropy": 5.53885235786438,
"epoch": 1.7369772417817546,
"grad_norm": 1.3125,
"learning_rate": 0.00046965956383662,
"loss": 5.2166,
"mean_token_accuracy": 0.18667361736297608,
"num_tokens": 38740992.0,
"step": 22325
},
{
"entropy": 5.4700523853302006,
"epoch": 1.737366271153472,
"grad_norm": 1.40625,
"learning_rate": 0.0004696456628000632,
"loss": 5.1772,
"mean_token_accuracy": 0.18716241121292115,
"num_tokens": 38749266.0,
"step": 22330
},
{
"entropy": 5.487962007522583,
"epoch": 1.7377553005251896,
"grad_norm": 1.390625,
"learning_rate": 0.00046963175881006825,
"loss": 5.2716,
"mean_token_accuracy": 0.18032833337783813,
"num_tokens": 38757983.0,
"step": 22335
},
{
"entropy": 5.489951848983765,
"epoch": 1.7381443298969073,
"grad_norm": 1.3203125,
"learning_rate": 0.0004696178518668462,
"loss": 5.0934,
"mean_token_accuracy": 0.19742371439933776,
"num_tokens": 38766258.0,
"step": 22340
},
{
"entropy": 5.472571516036988,
"epoch": 1.7385333592686247,
"grad_norm": 1.3671875,
"learning_rate": 0.00046960394197060804,
"loss": 5.2297,
"mean_token_accuracy": 0.1812346786260605,
"num_tokens": 38775105.0,
"step": 22345
},
{
"entropy": 5.497124814987183,
"epoch": 1.7389223886403422,
"grad_norm": 1.390625,
"learning_rate": 0.00046959002912156473,
"loss": 5.2218,
"mean_token_accuracy": 0.18146286010742188,
"num_tokens": 38783415.0,
"step": 22350
},
{
"entropy": 5.467630338668823,
"epoch": 1.73931141801206,
"grad_norm": 1.3515625,
"learning_rate": 0.0004695761133199275,
"loss": 5.2208,
"mean_token_accuracy": 0.1822282060980797,
"num_tokens": 38791703.0,
"step": 22355
},
{
"entropy": 5.454380512237549,
"epoch": 1.7397004473837776,
"grad_norm": 1.28125,
"learning_rate": 0.0004695621945659074,
"loss": 5.2371,
"mean_token_accuracy": 0.17642873525619507,
"num_tokens": 38800823.0,
"step": 22360
},
{
"entropy": 5.511862087249756,
"epoch": 1.740089476755495,
"grad_norm": 1.1484375,
"learning_rate": 0.0004695482728597157,
"loss": 5.1995,
"mean_token_accuracy": 0.17799396812915802,
"num_tokens": 38810607.0,
"step": 22365
},
{
"entropy": 5.450649213790894,
"epoch": 1.7404785061272126,
"grad_norm": 1.3984375,
"learning_rate": 0.00046953434820156363,
"loss": 5.1488,
"mean_token_accuracy": 0.1768909737467766,
"num_tokens": 38819288.0,
"step": 22370
},
{
"entropy": 5.422649717330932,
"epoch": 1.7408675354989303,
"grad_norm": 1.3984375,
"learning_rate": 0.0004695204205916624,
"loss": 5.1044,
"mean_token_accuracy": 0.18822149634361268,
"num_tokens": 38827791.0,
"step": 22375
},
{
"entropy": 5.476151323318481,
"epoch": 1.7412565648706477,
"grad_norm": 1.3515625,
"learning_rate": 0.0004695064900302235,
"loss": 5.1562,
"mean_token_accuracy": 0.18575465828180313,
"num_tokens": 38836338.0,
"step": 22380
},
{
"entropy": 5.521825981140137,
"epoch": 1.7416455942423652,
"grad_norm": 1.359375,
"learning_rate": 0.0004694925565174581,
"loss": 5.1047,
"mean_token_accuracy": 0.1829013481736183,
"num_tokens": 38844768.0,
"step": 22385
},
{
"entropy": 5.5273419380187985,
"epoch": 1.742034623614083,
"grad_norm": 1.46875,
"learning_rate": 0.00046947862005357777,
"loss": 5.2643,
"mean_token_accuracy": 0.17570252120494842,
"num_tokens": 38854022.0,
"step": 22390
},
{
"entropy": 5.440276384353638,
"epoch": 1.7424236529858004,
"grad_norm": 1.3125,
"learning_rate": 0.0004694646806387939,
"loss": 5.1221,
"mean_token_accuracy": 0.1885112300515175,
"num_tokens": 38862035.0,
"step": 22395
},
{
"entropy": 5.470210266113281,
"epoch": 1.7428126823575179,
"grad_norm": 1.4140625,
"learning_rate": 0.0004694507382733181,
"loss": 5.1724,
"mean_token_accuracy": 0.18895844966173173,
"num_tokens": 38870762.0,
"step": 22400
},
{
"entropy": 5.469910335540772,
"epoch": 1.7432017117292355,
"grad_norm": 1.3984375,
"learning_rate": 0.0004694367929573618,
"loss": 5.1372,
"mean_token_accuracy": 0.18954809308052062,
"num_tokens": 38879791.0,
"step": 22405
},
{
"entropy": 5.534672546386719,
"epoch": 1.7435907411009532,
"grad_norm": 1.2890625,
"learning_rate": 0.0004694228446911367,
"loss": 5.2769,
"mean_token_accuracy": 0.1763258919119835,
"num_tokens": 38889926.0,
"step": 22410
},
{
"entropy": 5.496361875534058,
"epoch": 1.7439797704726707,
"grad_norm": 1.28125,
"learning_rate": 0.0004694088934748542,
"loss": 5.1744,
"mean_token_accuracy": 0.18221628218889235,
"num_tokens": 38898428.0,
"step": 22415
},
{
"entropy": 5.418698072433472,
"epoch": 1.7443687998443882,
"grad_norm": 1.3203125,
"learning_rate": 0.0004693949393087263,
"loss": 5.2042,
"mean_token_accuracy": 0.17764114439487458,
"num_tokens": 38906800.0,
"step": 22420
},
{
"entropy": 5.446313667297363,
"epoch": 1.744757829216106,
"grad_norm": 1.2109375,
"learning_rate": 0.0004693809821929647,
"loss": 5.1568,
"mean_token_accuracy": 0.18023986667394637,
"num_tokens": 38915947.0,
"step": 22425
},
{
"entropy": 5.581137800216675,
"epoch": 1.7451468585878234,
"grad_norm": 1.34375,
"learning_rate": 0.000469367022127781,
"loss": 5.2197,
"mean_token_accuracy": 0.17630225867033006,
"num_tokens": 38924895.0,
"step": 22430
},
{
"entropy": 5.513008642196655,
"epoch": 1.7455358879595408,
"grad_norm": 1.3203125,
"learning_rate": 0.00046935305911338703,
"loss": 5.2205,
"mean_token_accuracy": 0.16947292983531953,
"num_tokens": 38933393.0,
"step": 22435
},
{
"entropy": 5.439327383041382,
"epoch": 1.7459249173312585,
"grad_norm": 1.2265625,
"learning_rate": 0.0004693390931499948,
"loss": 5.2036,
"mean_token_accuracy": 0.18419903218746186,
"num_tokens": 38942219.0,
"step": 22440
},
{
"entropy": 5.472254037857056,
"epoch": 1.7463139467029762,
"grad_norm": 1.375,
"learning_rate": 0.0004693251242378162,
"loss": 5.1478,
"mean_token_accuracy": 0.17509762644767762,
"num_tokens": 38950938.0,
"step": 22445
},
{
"entropy": 5.448265314102173,
"epoch": 1.7467029760746935,
"grad_norm": 1.25,
"learning_rate": 0.00046931115237706304,
"loss": 5.1572,
"mean_token_accuracy": 0.1862674981355667,
"num_tokens": 38959805.0,
"step": 22450
},
{
"entropy": 5.4496852397918705,
"epoch": 1.7470920054464112,
"grad_norm": 1.1953125,
"learning_rate": 0.0004692971775679475,
"loss": 5.0675,
"mean_token_accuracy": 0.19268402755260466,
"num_tokens": 38968308.0,
"step": 22455
},
{
"entropy": 5.582467174530029,
"epoch": 1.7474810348181289,
"grad_norm": 1.2578125,
"learning_rate": 0.00046928319981068154,
"loss": 5.238,
"mean_token_accuracy": 0.17960563600063323,
"num_tokens": 38976409.0,
"step": 22460
},
{
"entropy": 5.424221611022949,
"epoch": 1.7478700641898464,
"grad_norm": 1.859375,
"learning_rate": 0.0004692692191054773,
"loss": 5.1557,
"mean_token_accuracy": 0.1855572283267975,
"num_tokens": 38985193.0,
"step": 22465
},
{
"entropy": 5.448609066009522,
"epoch": 1.7482590935615638,
"grad_norm": 1.25,
"learning_rate": 0.0004692552354525468,
"loss": 5.1387,
"mean_token_accuracy": 0.18431031852960586,
"num_tokens": 38994141.0,
"step": 22470
},
{
"entropy": 5.497061252593994,
"epoch": 1.7486481229332815,
"grad_norm": 1.3671875,
"learning_rate": 0.0004692412488521023,
"loss": 5.3035,
"mean_token_accuracy": 0.17529143542051315,
"num_tokens": 39002953.0,
"step": 22475
},
{
"entropy": 5.525261068344117,
"epoch": 1.749037152304999,
"grad_norm": 1.390625,
"learning_rate": 0.000469227259304356,
"loss": 5.2027,
"mean_token_accuracy": 0.1877537712454796,
"num_tokens": 39010672.0,
"step": 22480
},
{
"entropy": 5.445794296264649,
"epoch": 1.7494261816767165,
"grad_norm": 1.328125,
"learning_rate": 0.00046921326680952023,
"loss": 5.2263,
"mean_token_accuracy": 0.17683114409446715,
"num_tokens": 39019677.0,
"step": 22485
},
{
"entropy": 5.476195907592773,
"epoch": 1.7498152110484342,
"grad_norm": 1.25,
"learning_rate": 0.0004691992713678072,
"loss": 5.1795,
"mean_token_accuracy": 0.18174509704113007,
"num_tokens": 39028165.0,
"step": 22490
},
{
"entropy": 5.4098548412323,
"epoch": 1.7502042404201519,
"grad_norm": 1.3125,
"learning_rate": 0.0004691852729794293,
"loss": 5.1113,
"mean_token_accuracy": 0.183260016143322,
"num_tokens": 39037537.0,
"step": 22495
},
{
"entropy": 5.457123851776123,
"epoch": 1.7505932697918691,
"grad_norm": 1.234375,
"learning_rate": 0.0004691712716445991,
"loss": 5.128,
"mean_token_accuracy": 0.18350170850753783,
"num_tokens": 39045861.0,
"step": 22500
},
{
"entropy": 5.492616605758667,
"epoch": 1.7509822991635868,
"grad_norm": 1.2890625,
"learning_rate": 0.0004691572673635288,
"loss": 5.1724,
"mean_token_accuracy": 0.1820408895611763,
"num_tokens": 39054526.0,
"step": 22505
},
{
"entropy": 5.482195949554443,
"epoch": 1.7513713285353045,
"grad_norm": 1.2578125,
"learning_rate": 0.000469143260136431,
"loss": 5.1717,
"mean_token_accuracy": 0.1777298390865326,
"num_tokens": 39063296.0,
"step": 22510
},
{
"entropy": 5.465510654449463,
"epoch": 1.751760357907022,
"grad_norm": 2.75,
"learning_rate": 0.0004691292499635183,
"loss": 5.089,
"mean_token_accuracy": 0.18384735137224198,
"num_tokens": 39071570.0,
"step": 22515
},
{
"entropy": 5.447725439071656,
"epoch": 1.7521493872787395,
"grad_norm": 1.2734375,
"learning_rate": 0.0004691152368450032,
"loss": 5.1922,
"mean_token_accuracy": 0.1873163565993309,
"num_tokens": 39080798.0,
"step": 22520
},
{
"entropy": 5.456830835342407,
"epoch": 1.7525384166504572,
"grad_norm": 1.34375,
"learning_rate": 0.00046910122078109835,
"loss": 5.1794,
"mean_token_accuracy": 0.1851043298840523,
"num_tokens": 39089572.0,
"step": 22525
},
{
"entropy": 5.577934455871582,
"epoch": 1.7529274460221747,
"grad_norm": 1.3203125,
"learning_rate": 0.0004690872017720163,
"loss": 5.2744,
"mean_token_accuracy": 0.1779394656419754,
"num_tokens": 39098391.0,
"step": 22530
},
{
"entropy": 5.485655307769775,
"epoch": 1.7533164753938921,
"grad_norm": 1.3046875,
"learning_rate": 0.00046907317981797006,
"loss": 5.2171,
"mean_token_accuracy": 0.17790737748146057,
"num_tokens": 39106892.0,
"step": 22535
},
{
"entropy": 5.4796693325042725,
"epoch": 1.7537055047656098,
"grad_norm": 1.46875,
"learning_rate": 0.00046905915491917213,
"loss": 5.1559,
"mean_token_accuracy": 0.18388474285602568,
"num_tokens": 39115635.0,
"step": 22540
},
{
"entropy": 5.530629110336304,
"epoch": 1.7540945341373275,
"grad_norm": 1.234375,
"learning_rate": 0.0004690451270758354,
"loss": 5.1668,
"mean_token_accuracy": 0.17807382494211196,
"num_tokens": 39123665.0,
"step": 22545
},
{
"entropy": 5.546247386932373,
"epoch": 1.7544835635090448,
"grad_norm": 1.2265625,
"learning_rate": 0.00046903109628817276,
"loss": 5.2232,
"mean_token_accuracy": 0.17503586411476135,
"num_tokens": 39132727.0,
"step": 22550
},
{
"entropy": 5.4609537601470945,
"epoch": 1.7548725928807625,
"grad_norm": 1.3046875,
"learning_rate": 0.00046901706255639703,
"loss": 5.2015,
"mean_token_accuracy": 0.17819113582372664,
"num_tokens": 39140814.0,
"step": 22555
},
{
"entropy": 5.524260759353638,
"epoch": 1.7552616222524802,
"grad_norm": 1.3125,
"learning_rate": 0.0004690030258807212,
"loss": 5.2671,
"mean_token_accuracy": 0.17636601626873016,
"num_tokens": 39149877.0,
"step": 22560
},
{
"entropy": 5.465193414688111,
"epoch": 1.7556506516241976,
"grad_norm": 1.296875,
"learning_rate": 0.00046898898626135827,
"loss": 5.1982,
"mean_token_accuracy": 0.1805619105696678,
"num_tokens": 39158698.0,
"step": 22565
},
{
"entropy": 5.430248975753784,
"epoch": 1.7560396809959151,
"grad_norm": 1.3359375,
"learning_rate": 0.0004689749436985211,
"loss": 5.1061,
"mean_token_accuracy": 0.1895295962691307,
"num_tokens": 39167546.0,
"step": 22570
},
{
"entropy": 5.504935455322266,
"epoch": 1.7564287103676328,
"grad_norm": 1.40625,
"learning_rate": 0.00046896089819242304,
"loss": 5.1701,
"mean_token_accuracy": 0.17628379613161088,
"num_tokens": 39176547.0,
"step": 22575
},
{
"entropy": 5.560612297058105,
"epoch": 1.7568177397393503,
"grad_norm": 1.3359375,
"learning_rate": 0.0004689468497432771,
"loss": 5.1762,
"mean_token_accuracy": 0.18397220671176912,
"num_tokens": 39185273.0,
"step": 22580
},
{
"entropy": 5.516317844390869,
"epoch": 1.7572067691110678,
"grad_norm": 1.3984375,
"learning_rate": 0.0004689327983512963,
"loss": 5.152,
"mean_token_accuracy": 0.18340541869401933,
"num_tokens": 39194204.0,
"step": 22585
},
{
"entropy": 5.453921985626221,
"epoch": 1.7575957984827855,
"grad_norm": 1.4296875,
"learning_rate": 0.00046891874401669404,
"loss": 5.1039,
"mean_token_accuracy": 0.18791799545288085,
"num_tokens": 39202951.0,
"step": 22590
},
{
"entropy": 5.369445085525513,
"epoch": 1.7579848278545032,
"grad_norm": 1.3203125,
"learning_rate": 0.0004689046867396834,
"loss": 5.1516,
"mean_token_accuracy": 0.18200442045927048,
"num_tokens": 39211508.0,
"step": 22595
},
{
"entropy": 5.524729013442993,
"epoch": 1.7583738572262204,
"grad_norm": 1.25,
"learning_rate": 0.0004688906265204779,
"loss": 5.1997,
"mean_token_accuracy": 0.17682316303253173,
"num_tokens": 39219804.0,
"step": 22600
},
{
"entropy": 5.563323211669922,
"epoch": 1.7587628865979381,
"grad_norm": 1.390625,
"learning_rate": 0.0004688765633592907,
"loss": 5.2422,
"mean_token_accuracy": 0.17577288299798965,
"num_tokens": 39228204.0,
"step": 22605
},
{
"entropy": 5.471670484542846,
"epoch": 1.7591519159696558,
"grad_norm": 1.5859375,
"learning_rate": 0.0004688624972563352,
"loss": 5.1546,
"mean_token_accuracy": 0.17827369421720504,
"num_tokens": 39237003.0,
"step": 22610
},
{
"entropy": 5.396750783920288,
"epoch": 1.7595409453413733,
"grad_norm": 1.4375,
"learning_rate": 0.0004688484282118249,
"loss": 5.134,
"mean_token_accuracy": 0.17877383679151534,
"num_tokens": 39245636.0,
"step": 22615
},
{
"entropy": 5.40052342414856,
"epoch": 1.7599299747130908,
"grad_norm": 1.265625,
"learning_rate": 0.0004688343562259732,
"loss": 4.9863,
"mean_token_accuracy": 0.19137980192899703,
"num_tokens": 39254288.0,
"step": 22620
},
{
"entropy": 5.5003986835479735,
"epoch": 1.7603190040848085,
"grad_norm": 1.3046875,
"learning_rate": 0.0004688202812989937,
"loss": 5.2089,
"mean_token_accuracy": 0.18283996284008025,
"num_tokens": 39263217.0,
"step": 22625
},
{
"entropy": 5.404484367370605,
"epoch": 1.760708033456526,
"grad_norm": 1.328125,
"learning_rate": 0.0004688062034311,
"loss": 5.1637,
"mean_token_accuracy": 0.18608333319425582,
"num_tokens": 39271240.0,
"step": 22630
},
{
"entropy": 5.4020905017852785,
"epoch": 1.7610970628282434,
"grad_norm": 1.359375,
"learning_rate": 0.00046879212262250546,
"loss": 5.0993,
"mean_token_accuracy": 0.19059553891420364,
"num_tokens": 39279665.0,
"step": 22635
},
{
"entropy": 5.466123342514038,
"epoch": 1.761486092199961,
"grad_norm": 1.2890625,
"learning_rate": 0.00046877803887342406,
"loss": 5.2848,
"mean_token_accuracy": 0.1789517104625702,
"num_tokens": 39287975.0,
"step": 22640
},
{
"entropy": 5.544944620132446,
"epoch": 1.7618751215716788,
"grad_norm": 1.4375,
"learning_rate": 0.0004687639521840693,
"loss": 5.24,
"mean_token_accuracy": 0.1780037373304367,
"num_tokens": 39296541.0,
"step": 22645
},
{
"entropy": 5.516239881515503,
"epoch": 1.7622641509433963,
"grad_norm": 1.3046875,
"learning_rate": 0.00046874986255465495,
"loss": 5.1054,
"mean_token_accuracy": 0.18752430826425553,
"num_tokens": 39304710.0,
"step": 22650
},
{
"entropy": 5.431145858764649,
"epoch": 1.7626531803151138,
"grad_norm": 1.3828125,
"learning_rate": 0.00046873576998539485,
"loss": 5.0845,
"mean_token_accuracy": 0.18629807531833648,
"num_tokens": 39313236.0,
"step": 22655
},
{
"entropy": 5.375265502929688,
"epoch": 1.7630422096868315,
"grad_norm": 1.2265625,
"learning_rate": 0.0004687216744765028,
"loss": 5.0045,
"mean_token_accuracy": 0.19502213150262832,
"num_tokens": 39322656.0,
"step": 22660
},
{
"entropy": 5.437173509597779,
"epoch": 1.763431239058549,
"grad_norm": 1.2734375,
"learning_rate": 0.0004687075760281927,
"loss": 5.1022,
"mean_token_accuracy": 0.19160324484109878,
"num_tokens": 39331074.0,
"step": 22665
},
{
"entropy": 5.433528470993042,
"epoch": 1.7638202684302664,
"grad_norm": 1.3671875,
"learning_rate": 0.0004686934746406784,
"loss": 5.1582,
"mean_token_accuracy": 0.1809625968337059,
"num_tokens": 39339450.0,
"step": 22670
},
{
"entropy": 5.529172611236572,
"epoch": 1.764209297801984,
"grad_norm": 1.375,
"learning_rate": 0.00046867937031417397,
"loss": 5.2359,
"mean_token_accuracy": 0.18689853698015213,
"num_tokens": 39347270.0,
"step": 22675
},
{
"entropy": 5.480555820465088,
"epoch": 1.7645983271737016,
"grad_norm": 1.3125,
"learning_rate": 0.0004686652630488933,
"loss": 5.161,
"mean_token_accuracy": 0.18236614316701888,
"num_tokens": 39355853.0,
"step": 22680
},
{
"entropy": 5.384286308288575,
"epoch": 1.764987356545419,
"grad_norm": 1.296875,
"learning_rate": 0.00046865115284505063,
"loss": 5.0699,
"mean_token_accuracy": 0.19774107486009598,
"num_tokens": 39364160.0,
"step": 22685
},
{
"entropy": 5.449788188934326,
"epoch": 1.7653763859171367,
"grad_norm": 1.4609375,
"learning_rate": 0.00046863703970285986,
"loss": 5.1468,
"mean_token_accuracy": 0.19034121930599213,
"num_tokens": 39372504.0,
"step": 22690
},
{
"entropy": 5.472116088867187,
"epoch": 1.7657654152888544,
"grad_norm": 1.265625,
"learning_rate": 0.0004686229236225352,
"loss": 5.1528,
"mean_token_accuracy": 0.18396700769662858,
"num_tokens": 39380883.0,
"step": 22695
},
{
"entropy": 5.570156908035278,
"epoch": 1.766154444660572,
"grad_norm": 1.28125,
"learning_rate": 0.0004686088046042909,
"loss": 5.235,
"mean_token_accuracy": 0.17422347366809846,
"num_tokens": 39389943.0,
"step": 22700
},
{
"entropy": 5.425736045837402,
"epoch": 1.7665434740322894,
"grad_norm": 1.2421875,
"learning_rate": 0.00046859468264834114,
"loss": 5.1619,
"mean_token_accuracy": 0.18831947296857834,
"num_tokens": 39398919.0,
"step": 22705
},
{
"entropy": 5.48894419670105,
"epoch": 1.766932503404007,
"grad_norm": 1.3203125,
"learning_rate": 0.00046858055775490017,
"loss": 5.234,
"mean_token_accuracy": 0.18076644241809844,
"num_tokens": 39407547.0,
"step": 22710
},
{
"entropy": 5.474356985092163,
"epoch": 1.7673215327757246,
"grad_norm": 1.375,
"learning_rate": 0.0004685664299241825,
"loss": 5.0577,
"mean_token_accuracy": 0.18891118168830873,
"num_tokens": 39416264.0,
"step": 22715
},
{
"entropy": 5.399944067001343,
"epoch": 1.767710562147442,
"grad_norm": 1.25,
"learning_rate": 0.0004685522991564022,
"loss": 5.1063,
"mean_token_accuracy": 0.18270018696784973,
"num_tokens": 39424104.0,
"step": 22720
},
{
"entropy": 5.489658784866333,
"epoch": 1.7680995915191597,
"grad_norm": 1.28125,
"learning_rate": 0.0004685381654517738,
"loss": 5.2011,
"mean_token_accuracy": 0.1806568458676338,
"num_tokens": 39432443.0,
"step": 22725
},
{
"entropy": 5.435421180725098,
"epoch": 1.7684886208908772,
"grad_norm": 1.3828125,
"learning_rate": 0.0004685240288105119,
"loss": 5.1402,
"mean_token_accuracy": 0.1829176977276802,
"num_tokens": 39441620.0,
"step": 22730
},
{
"entropy": 5.435894727706909,
"epoch": 1.7688776502625947,
"grad_norm": 1.3203125,
"learning_rate": 0.00046850988923283085,
"loss": 5.1162,
"mean_token_accuracy": 0.18494036048650742,
"num_tokens": 39449854.0,
"step": 22735
},
{
"entropy": 5.464275789260864,
"epoch": 1.7692666796343124,
"grad_norm": 1.3671875,
"learning_rate": 0.00046849574671894523,
"loss": 5.1917,
"mean_token_accuracy": 0.18091578930616378,
"num_tokens": 39458496.0,
"step": 22740
},
{
"entropy": 5.536469984054565,
"epoch": 1.76965570900603,
"grad_norm": 1.28125,
"learning_rate": 0.00046848160126906956,
"loss": 5.218,
"mean_token_accuracy": 0.18141041100025176,
"num_tokens": 39466545.0,
"step": 22745
},
{
"entropy": 5.491134834289551,
"epoch": 1.7700447383777476,
"grad_norm": 1.296875,
"learning_rate": 0.0004684674528834186,
"loss": 5.2034,
"mean_token_accuracy": 0.17925085872411728,
"num_tokens": 39475771.0,
"step": 22750
},
{
"entropy": 5.4805052280426025,
"epoch": 1.770433767749465,
"grad_norm": 1.4609375,
"learning_rate": 0.00046845330156220703,
"loss": 5.2074,
"mean_token_accuracy": 0.17984407693147658,
"num_tokens": 39484244.0,
"step": 22755
},
{
"entropy": 5.562279891967774,
"epoch": 1.7708227971211827,
"grad_norm": 1.828125,
"learning_rate": 0.0004684391473056495,
"loss": 5.2381,
"mean_token_accuracy": 0.17516525238752365,
"num_tokens": 39493138.0,
"step": 22760
},
{
"entropy": 5.562649917602539,
"epoch": 1.7712118264929002,
"grad_norm": 1.2890625,
"learning_rate": 0.00046842499011396076,
"loss": 5.203,
"mean_token_accuracy": 0.17877228260040284,
"num_tokens": 39502065.0,
"step": 22765
},
{
"entropy": 5.480378675460815,
"epoch": 1.7716008558646177,
"grad_norm": 1.296875,
"learning_rate": 0.00046841082998735575,
"loss": 5.1608,
"mean_token_accuracy": 0.1889510601758957,
"num_tokens": 39510095.0,
"step": 22770
},
{
"entropy": 5.428599834442139,
"epoch": 1.7719898852363354,
"grad_norm": 1.265625,
"learning_rate": 0.00046839666692604916,
"loss": 5.2213,
"mean_token_accuracy": 0.18181411176919937,
"num_tokens": 39518104.0,
"step": 22775
},
{
"entropy": 5.523396396636963,
"epoch": 1.7723789146080529,
"grad_norm": 1.2578125,
"learning_rate": 0.000468382500930256,
"loss": 5.2059,
"mean_token_accuracy": 0.17685447186231612,
"num_tokens": 39526768.0,
"step": 22780
},
{
"entropy": 5.4961020946502686,
"epoch": 1.7727679439797703,
"grad_norm": 1.28125,
"learning_rate": 0.00046836833200019116,
"loss": 5.1387,
"mean_token_accuracy": 0.18078558146953583,
"num_tokens": 39535847.0,
"step": 22785
},
{
"entropy": 5.525657987594604,
"epoch": 1.773156973351488,
"grad_norm": 1.3046875,
"learning_rate": 0.0004683541601360697,
"loss": 5.1987,
"mean_token_accuracy": 0.18961230665445328,
"num_tokens": 39544364.0,
"step": 22790
},
{
"entropy": 5.4946812152862545,
"epoch": 1.7735460027232057,
"grad_norm": 1.2265625,
"learning_rate": 0.00046833998533810653,
"loss": 5.2137,
"mean_token_accuracy": 0.17819977849721907,
"num_tokens": 39552733.0,
"step": 22795
},
{
"entropy": 5.508381462097168,
"epoch": 1.7739350320949232,
"grad_norm": 1.296875,
"learning_rate": 0.0004683258076065169,
"loss": 5.1759,
"mean_token_accuracy": 0.17987517267465591,
"num_tokens": 39561580.0,
"step": 22800
},
{
"entropy": 5.407007646560669,
"epoch": 1.7743240614666407,
"grad_norm": 1.2265625,
"learning_rate": 0.00046831162694151586,
"loss": 5.1367,
"mean_token_accuracy": 0.18430044054985045,
"num_tokens": 39570283.0,
"step": 22805
},
{
"entropy": 5.5113321304321286,
"epoch": 1.7747130908383584,
"grad_norm": 1.3125,
"learning_rate": 0.00046829744334331855,
"loss": 5.1196,
"mean_token_accuracy": 0.18668840676546097,
"num_tokens": 39578835.0,
"step": 22810
},
{
"entropy": 5.451277732849121,
"epoch": 1.7751021202100759,
"grad_norm": 1.265625,
"learning_rate": 0.00046828325681214013,
"loss": 5.187,
"mean_token_accuracy": 0.1855984792113304,
"num_tokens": 39587053.0,
"step": 22815
},
{
"entropy": 5.472503280639648,
"epoch": 1.7754911495817933,
"grad_norm": 1.3359375,
"learning_rate": 0.000468269067348196,
"loss": 5.2854,
"mean_token_accuracy": 0.1653962567448616,
"num_tokens": 39595799.0,
"step": 22820
},
{
"entropy": 5.527693176269532,
"epoch": 1.775880178953511,
"grad_norm": 1.2265625,
"learning_rate": 0.0004682548749517014,
"loss": 5.1206,
"mean_token_accuracy": 0.18749001175165175,
"num_tokens": 39604248.0,
"step": 22825
},
{
"entropy": 5.420598936080933,
"epoch": 1.7762692083252287,
"grad_norm": 1.2734375,
"learning_rate": 0.00046824067962287163,
"loss": 5.1329,
"mean_token_accuracy": 0.19047351479530333,
"num_tokens": 39612690.0,
"step": 22830
},
{
"entropy": 5.467026805877685,
"epoch": 1.776658237696946,
"grad_norm": 1.2890625,
"learning_rate": 0.0004682264813619221,
"loss": 5.1724,
"mean_token_accuracy": 0.17975070774555207,
"num_tokens": 39621784.0,
"step": 22835
},
{
"entropy": 5.494018983840943,
"epoch": 1.7770472670686637,
"grad_norm": 1.328125,
"learning_rate": 0.00046821228016906836,
"loss": 5.1011,
"mean_token_accuracy": 0.1851718991994858,
"num_tokens": 39630455.0,
"step": 22840
},
{
"entropy": 5.41602783203125,
"epoch": 1.7774362964403814,
"grad_norm": 1.2578125,
"learning_rate": 0.0004681980760445257,
"loss": 5.1147,
"mean_token_accuracy": 0.18482033908367157,
"num_tokens": 39639017.0,
"step": 22845
},
{
"entropy": 5.436076498031616,
"epoch": 1.7778253258120988,
"grad_norm": 1.28125,
"learning_rate": 0.0004681838689885098,
"loss": 5.0528,
"mean_token_accuracy": 0.18649808168411255,
"num_tokens": 39648083.0,
"step": 22850
},
{
"entropy": 5.3794517993927,
"epoch": 1.7782143551838163,
"grad_norm": 1.2421875,
"learning_rate": 0.0004681696590012362,
"loss": 5.1528,
"mean_token_accuracy": 0.18833263516426085,
"num_tokens": 39656887.0,
"step": 22855
},
{
"entropy": 5.434454488754272,
"epoch": 1.778603384555534,
"grad_norm": 1.28125,
"learning_rate": 0.00046815544608292043,
"loss": 5.1838,
"mean_token_accuracy": 0.18591940104961396,
"num_tokens": 39665658.0,
"step": 22860
},
{
"entropy": 5.456992769241333,
"epoch": 1.7789924139272515,
"grad_norm": 1.34375,
"learning_rate": 0.0004681412302337782,
"loss": 5.1554,
"mean_token_accuracy": 0.1857403412461281,
"num_tokens": 39673423.0,
"step": 22865
},
{
"entropy": 5.4903497219085695,
"epoch": 1.779381443298969,
"grad_norm": 1.765625,
"learning_rate": 0.0004681270114540252,
"loss": 5.1781,
"mean_token_accuracy": 0.18412014544010163,
"num_tokens": 39682382.0,
"step": 22870
},
{
"entropy": 5.48302116394043,
"epoch": 1.7797704726706867,
"grad_norm": 1.3046875,
"learning_rate": 0.0004681127897438772,
"loss": 5.2308,
"mean_token_accuracy": 0.18164049834012985,
"num_tokens": 39691089.0,
"step": 22875
},
{
"entropy": 5.518176603317261,
"epoch": 1.7801595020424044,
"grad_norm": 1.3125,
"learning_rate": 0.00046809856510355007,
"loss": 5.2914,
"mean_token_accuracy": 0.1750357374548912,
"num_tokens": 39700888.0,
"step": 22880
},
{
"entropy": 5.548483085632324,
"epoch": 1.7805485314141216,
"grad_norm": 1.2890625,
"learning_rate": 0.0004680843375332595,
"loss": 5.187,
"mean_token_accuracy": 0.18636061549186705,
"num_tokens": 39708515.0,
"step": 22885
},
{
"entropy": 5.3951116561889645,
"epoch": 1.7809375607858393,
"grad_norm": 1.2265625,
"learning_rate": 0.00046807010703322143,
"loss": 5.0662,
"mean_token_accuracy": 0.1868024855852127,
"num_tokens": 39716790.0,
"step": 22890
},
{
"entropy": 5.494457101821899,
"epoch": 1.781326590157557,
"grad_norm": 1.28125,
"learning_rate": 0.0004680558736036518,
"loss": 5.1425,
"mean_token_accuracy": 0.18425453305244446,
"num_tokens": 39726292.0,
"step": 22895
},
{
"entropy": 5.426535129547119,
"epoch": 1.7817156195292745,
"grad_norm": 1.3125,
"learning_rate": 0.0004680416372447666,
"loss": 5.1467,
"mean_token_accuracy": 0.1849789336323738,
"num_tokens": 39735222.0,
"step": 22900
},
{
"entropy": 5.4760654926300045,
"epoch": 1.782104648900992,
"grad_norm": 1.25,
"learning_rate": 0.00046802739795678177,
"loss": 5.1967,
"mean_token_accuracy": 0.179933562874794,
"num_tokens": 39744619.0,
"step": 22905
},
{
"entropy": 5.505257034301758,
"epoch": 1.7824936782727097,
"grad_norm": 1.3515625,
"learning_rate": 0.00046801315573991346,
"loss": 5.19,
"mean_token_accuracy": 0.18137858659029008,
"num_tokens": 39752394.0,
"step": 22910
},
{
"entropy": 5.416035461425781,
"epoch": 1.7828827076444271,
"grad_norm": 1.359375,
"learning_rate": 0.00046799891059437764,
"loss": 5.0801,
"mean_token_accuracy": 0.18927078545093537,
"num_tokens": 39760529.0,
"step": 22915
},
{
"entropy": 5.486957836151123,
"epoch": 1.7832717370161446,
"grad_norm": 1.265625,
"learning_rate": 0.00046798466252039056,
"loss": 5.2309,
"mean_token_accuracy": 0.18162210285663605,
"num_tokens": 39768231.0,
"step": 22920
},
{
"entropy": 5.543147993087769,
"epoch": 1.7836607663878623,
"grad_norm": 1.2734375,
"learning_rate": 0.00046797041151816845,
"loss": 5.3027,
"mean_token_accuracy": 0.1780250146985054,
"num_tokens": 39776773.0,
"step": 22925
},
{
"entropy": 5.5221508026123045,
"epoch": 1.78404979575958,
"grad_norm": 1.609375,
"learning_rate": 0.00046795615758792747,
"loss": 5.1502,
"mean_token_accuracy": 0.1803600937128067,
"num_tokens": 39785248.0,
"step": 22930
},
{
"entropy": 5.446562242507935,
"epoch": 1.7844388251312973,
"grad_norm": 1.328125,
"learning_rate": 0.0004679419007298839,
"loss": 5.1383,
"mean_token_accuracy": 0.18397189825773239,
"num_tokens": 39794794.0,
"step": 22935
},
{
"entropy": 5.47264723777771,
"epoch": 1.784827854503015,
"grad_norm": 1.21875,
"learning_rate": 0.0004679276409442541,
"loss": 5.1444,
"mean_token_accuracy": 0.1756580263376236,
"num_tokens": 39803662.0,
"step": 22940
},
{
"entropy": 5.513913249969482,
"epoch": 1.7852168838747327,
"grad_norm": 1.328125,
"learning_rate": 0.0004679133782312544,
"loss": 5.16,
"mean_token_accuracy": 0.1823689267039299,
"num_tokens": 39812189.0,
"step": 22945
},
{
"entropy": 5.499375247955323,
"epoch": 1.7856059132464501,
"grad_norm": 1.25,
"learning_rate": 0.0004678991125911013,
"loss": 5.2002,
"mean_token_accuracy": 0.18524016588926315,
"num_tokens": 39820831.0,
"step": 22950
},
{
"entropy": 5.399232196807861,
"epoch": 1.7859949426181676,
"grad_norm": 1.1875,
"learning_rate": 0.0004678848440240111,
"loss": 5.0381,
"mean_token_accuracy": 0.19027311056852342,
"num_tokens": 39829380.0,
"step": 22955
},
{
"entropy": 5.417461967468261,
"epoch": 1.7863839719898853,
"grad_norm": 1.2421875,
"learning_rate": 0.0004678705725302005,
"loss": 5.187,
"mean_token_accuracy": 0.18635341376066208,
"num_tokens": 39838243.0,
"step": 22960
},
{
"entropy": 5.502604007720947,
"epoch": 1.7867730013616028,
"grad_norm": 1.25,
"learning_rate": 0.0004678562981098859,
"loss": 5.1505,
"mean_token_accuracy": 0.1806425005197525,
"num_tokens": 39846885.0,
"step": 22965
},
{
"entropy": 5.473308849334717,
"epoch": 1.7871620307333203,
"grad_norm": 1.3515625,
"learning_rate": 0.00046784202076328394,
"loss": 5.1172,
"mean_token_accuracy": 0.18801402151584626,
"num_tokens": 39855337.0,
"step": 22970
},
{
"entropy": 5.411801958084107,
"epoch": 1.787551060105038,
"grad_norm": 1.3515625,
"learning_rate": 0.00046782774049061124,
"loss": 5.1778,
"mean_token_accuracy": 0.18863185048103331,
"num_tokens": 39864606.0,
"step": 22975
},
{
"entropy": 5.539475297927856,
"epoch": 1.7879400894767556,
"grad_norm": 1.2265625,
"learning_rate": 0.0004678134572920845,
"loss": 5.1675,
"mean_token_accuracy": 0.1811738759279251,
"num_tokens": 39872621.0,
"step": 22980
},
{
"entropy": 5.4153773307800295,
"epoch": 1.788329118848473,
"grad_norm": 1.2265625,
"learning_rate": 0.0004677991711679204,
"loss": 5.1445,
"mean_token_accuracy": 0.18738404661417007,
"num_tokens": 39880525.0,
"step": 22985
},
{
"entropy": 5.436581468582153,
"epoch": 1.7887181482201906,
"grad_norm": 1.359375,
"learning_rate": 0.00046778488211833585,
"loss": 5.0809,
"mean_token_accuracy": 0.18787101060152053,
"num_tokens": 39889541.0,
"step": 22990
},
{
"entropy": 5.467618560791015,
"epoch": 1.7891071775919083,
"grad_norm": 1.2109375,
"learning_rate": 0.0004677705901435475,
"loss": 5.1354,
"mean_token_accuracy": 0.18369927108287812,
"num_tokens": 39897682.0,
"step": 22995
},
{
"entropy": 5.467347478866577,
"epoch": 1.7894962069636258,
"grad_norm": 1.2734375,
"learning_rate": 0.0004677562952437723,
"loss": 5.1629,
"mean_token_accuracy": 0.1793891966342926,
"num_tokens": 39906656.0,
"step": 23000
},
{
"entropy": 5.481303644180298,
"epoch": 1.7898852363353432,
"grad_norm": 1.2578125,
"learning_rate": 0.00046774199741922705,
"loss": 5.2258,
"mean_token_accuracy": 0.1815507560968399,
"num_tokens": 39915202.0,
"step": 23005
},
{
"entropy": 5.434485626220703,
"epoch": 1.790274265707061,
"grad_norm": 1.359375,
"learning_rate": 0.00046772769667012884,
"loss": 5.1053,
"mean_token_accuracy": 0.1826663002371788,
"num_tokens": 39923510.0,
"step": 23010
},
{
"entropy": 5.390435743331909,
"epoch": 1.7906632950787784,
"grad_norm": 1.2265625,
"learning_rate": 0.0004677133929966946,
"loss": 5.1322,
"mean_token_accuracy": 0.19109075218439103,
"num_tokens": 39932468.0,
"step": 23015
},
{
"entropy": 5.513824367523194,
"epoch": 1.791052324450496,
"grad_norm": 1.2578125,
"learning_rate": 0.00046769908639914134,
"loss": 5.2302,
"mean_token_accuracy": 0.18118311017751693,
"num_tokens": 39942758.0,
"step": 23020
},
{
"entropy": 5.556228733062744,
"epoch": 1.7914413538222136,
"grad_norm": 1.4921875,
"learning_rate": 0.0004676847768776861,
"loss": 5.2084,
"mean_token_accuracy": 0.18083118498325348,
"num_tokens": 39950829.0,
"step": 23025
},
{
"entropy": 5.415746736526489,
"epoch": 1.7918303831939313,
"grad_norm": 1.1796875,
"learning_rate": 0.0004676704644325462,
"loss": 5.2062,
"mean_token_accuracy": 0.18568203151226043,
"num_tokens": 39960204.0,
"step": 23030
},
{
"entropy": 5.431189775466919,
"epoch": 1.7922194125656488,
"grad_norm": 1.28125,
"learning_rate": 0.0004676561490639385,
"loss": 5.1235,
"mean_token_accuracy": 0.18627456575632095,
"num_tokens": 39968513.0,
"step": 23035
},
{
"entropy": 5.459836530685425,
"epoch": 1.7926084419373662,
"grad_norm": 1.65625,
"learning_rate": 0.0004676418307720805,
"loss": 5.1841,
"mean_token_accuracy": 0.1816483646631241,
"num_tokens": 39977181.0,
"step": 23040
},
{
"entropy": 5.369750118255615,
"epoch": 1.792997471309084,
"grad_norm": 1.1640625,
"learning_rate": 0.0004676275095571892,
"loss": 4.9925,
"mean_token_accuracy": 0.19489712566137313,
"num_tokens": 39986760.0,
"step": 23045
},
{
"entropy": 5.441999340057373,
"epoch": 1.7933865006808014,
"grad_norm": 1.3359375,
"learning_rate": 0.00046761318541948215,
"loss": 5.2146,
"mean_token_accuracy": 0.17421716898679734,
"num_tokens": 39995203.0,
"step": 23050
},
{
"entropy": 5.434117984771729,
"epoch": 1.7937755300525189,
"grad_norm": 1.203125,
"learning_rate": 0.0004675988583591766,
"loss": 5.102,
"mean_token_accuracy": 0.19703855216503144,
"num_tokens": 40003526.0,
"step": 23055
},
{
"entropy": 5.476336288452148,
"epoch": 1.7941645594242366,
"grad_norm": 1.1953125,
"learning_rate": 0.00046758452837648997,
"loss": 5.1699,
"mean_token_accuracy": 0.18086313009262084,
"num_tokens": 40012036.0,
"step": 23060
},
{
"entropy": 5.423497867584229,
"epoch": 1.794553588795954,
"grad_norm": 1.609375,
"learning_rate": 0.0004675701954716395,
"loss": 5.1841,
"mean_token_accuracy": 0.18324873596429825,
"num_tokens": 40020237.0,
"step": 23065
},
{
"entropy": 5.374324226379395,
"epoch": 1.7949426181676715,
"grad_norm": 1.21875,
"learning_rate": 0.00046755585964484286,
"loss": 5.059,
"mean_token_accuracy": 0.1920418083667755,
"num_tokens": 40028749.0,
"step": 23070
},
{
"entropy": 5.403493928909302,
"epoch": 1.7953316475393892,
"grad_norm": 1.234375,
"learning_rate": 0.0004675415208963177,
"loss": 5.0399,
"mean_token_accuracy": 0.19200357794761658,
"num_tokens": 40036799.0,
"step": 23075
},
{
"entropy": 5.435749578475952,
"epoch": 1.795720676911107,
"grad_norm": 1.328125,
"learning_rate": 0.00046752717922628125,
"loss": 5.1727,
"mean_token_accuracy": 0.17864285111427308,
"num_tokens": 40045416.0,
"step": 23080
},
{
"entropy": 5.503822994232178,
"epoch": 1.7961097062828244,
"grad_norm": 1.265625,
"learning_rate": 0.0004675128346349514,
"loss": 5.2153,
"mean_token_accuracy": 0.1828645020723343,
"num_tokens": 40054128.0,
"step": 23085
},
{
"entropy": 5.5446703910827635,
"epoch": 1.7964987356545419,
"grad_norm": 1.265625,
"learning_rate": 0.00046749848712254554,
"loss": 5.2037,
"mean_token_accuracy": 0.18557826280593873,
"num_tokens": 40062765.0,
"step": 23090
},
{
"entropy": 5.413590812683106,
"epoch": 1.7968877650262596,
"grad_norm": 1.296875,
"learning_rate": 0.00046748413668928164,
"loss": 5.1395,
"mean_token_accuracy": 0.18596210330724716,
"num_tokens": 40071190.0,
"step": 23095
},
{
"entropy": 5.489024448394775,
"epoch": 1.797276794397977,
"grad_norm": 1.2578125,
"learning_rate": 0.0004674697833353774,
"loss": 5.1698,
"mean_token_accuracy": 0.18406279534101486,
"num_tokens": 40080552.0,
"step": 23100
},
{
"entropy": 5.489054203033447,
"epoch": 1.7976658237696945,
"grad_norm": 1.1875,
"learning_rate": 0.00046745542706105045,
"loss": 5.1802,
"mean_token_accuracy": 0.188940192759037,
"num_tokens": 40089407.0,
"step": 23105
},
{
"entropy": 5.605822515487671,
"epoch": 1.7980548531414122,
"grad_norm": 1.3203125,
"learning_rate": 0.00046744106786651875,
"loss": 5.3752,
"mean_token_accuracy": 0.1744626209139824,
"num_tokens": 40097946.0,
"step": 23110
},
{
"entropy": 5.455317735671997,
"epoch": 1.7984438825131297,
"grad_norm": 1.21875,
"learning_rate": 0.0004674267057520001,
"loss": 5.11,
"mean_token_accuracy": 0.1942792922258377,
"num_tokens": 40105901.0,
"step": 23115
},
{
"entropy": 5.353527212142945,
"epoch": 1.7988329118848472,
"grad_norm": 1.28125,
"learning_rate": 0.0004674123407177125,
"loss": 5.0378,
"mean_token_accuracy": 0.19014345705509186,
"num_tokens": 40114481.0,
"step": 23120
},
{
"entropy": 5.434337997436524,
"epoch": 1.7992219412565649,
"grad_norm": 1.2421875,
"learning_rate": 0.00046739797276387394,
"loss": 5.0828,
"mean_token_accuracy": 0.19213710278272628,
"num_tokens": 40123086.0,
"step": 23125
},
{
"entropy": 5.460673999786377,
"epoch": 1.7996109706282826,
"grad_norm": 1.21875,
"learning_rate": 0.00046738360189070235,
"loss": 5.0918,
"mean_token_accuracy": 0.1873073622584343,
"num_tokens": 40131497.0,
"step": 23130
},
{
"entropy": 5.384670829772949,
"epoch": 1.8,
"grad_norm": 1.3984375,
"learning_rate": 0.0004673692280984157,
"loss": 5.1237,
"mean_token_accuracy": 0.1879059210419655,
"num_tokens": 40139632.0,
"step": 23135
},
{
"entropy": 5.402921199798584,
"epoch": 1.8003890293717175,
"grad_norm": 1.1953125,
"learning_rate": 0.0004673548513872324,
"loss": 5.1239,
"mean_token_accuracy": 0.18642526865005493,
"num_tokens": 40148312.0,
"step": 23140
},
{
"entropy": 5.519021320343017,
"epoch": 1.8007780587434352,
"grad_norm": 1.3515625,
"learning_rate": 0.00046734047175737026,
"loss": 5.1781,
"mean_token_accuracy": 0.1818983569741249,
"num_tokens": 40156750.0,
"step": 23145
},
{
"entropy": 5.416266870498657,
"epoch": 1.8011670881151527,
"grad_norm": 1.46875,
"learning_rate": 0.00046732608920904754,
"loss": 5.1512,
"mean_token_accuracy": 0.18879878371953965,
"num_tokens": 40165334.0,
"step": 23150
},
{
"entropy": 5.451744174957275,
"epoch": 1.8015561174868702,
"grad_norm": 1.265625,
"learning_rate": 0.0004673117037424827,
"loss": 5.1472,
"mean_token_accuracy": 0.18193834871053696,
"num_tokens": 40174217.0,
"step": 23155
},
{
"entropy": 5.465801239013672,
"epoch": 1.8019451468585879,
"grad_norm": 1.296875,
"learning_rate": 0.00046729731535789375,
"loss": 5.1094,
"mean_token_accuracy": 0.19122948348522187,
"num_tokens": 40182889.0,
"step": 23160
},
{
"entropy": 5.488010501861572,
"epoch": 1.8023341762303053,
"grad_norm": 1.2734375,
"learning_rate": 0.00046728292405549913,
"loss": 5.165,
"mean_token_accuracy": 0.18758666664361953,
"num_tokens": 40191428.0,
"step": 23165
},
{
"entropy": 5.4420435428619385,
"epoch": 1.8027232056020228,
"grad_norm": 1.2890625,
"learning_rate": 0.0004672685298355172,
"loss": 5.1216,
"mean_token_accuracy": 0.19135793447494506,
"num_tokens": 40200204.0,
"step": 23170
},
{
"entropy": 5.4017333984375,
"epoch": 1.8031122349737405,
"grad_norm": 1.1953125,
"learning_rate": 0.0004672541326981664,
"loss": 5.0235,
"mean_token_accuracy": 0.19930849075317383,
"num_tokens": 40208326.0,
"step": 23175
},
{
"entropy": 5.393974781036377,
"epoch": 1.8035012643454582,
"grad_norm": 1.2734375,
"learning_rate": 0.000467239732643665,
"loss": 5.1541,
"mean_token_accuracy": 0.18477540761232375,
"num_tokens": 40217300.0,
"step": 23180
},
{
"entropy": 5.490010738372803,
"epoch": 1.8038902937171757,
"grad_norm": 1.234375,
"learning_rate": 0.00046722532967223183,
"loss": 5.2656,
"mean_token_accuracy": 0.183006389439106,
"num_tokens": 40226695.0,
"step": 23185
},
{
"entropy": 5.425993633270264,
"epoch": 1.8042793230888932,
"grad_norm": 1.1953125,
"learning_rate": 0.0004672109237840851,
"loss": 5.129,
"mean_token_accuracy": 0.1887577086687088,
"num_tokens": 40235286.0,
"step": 23190
},
{
"entropy": 5.375521039962768,
"epoch": 1.8046683524606109,
"grad_norm": 1.4296875,
"learning_rate": 0.00046719651497944355,
"loss": 5.098,
"mean_token_accuracy": 0.1850908488035202,
"num_tokens": 40244065.0,
"step": 23195
},
{
"entropy": 5.555627107620239,
"epoch": 1.8050573818323283,
"grad_norm": 1.3984375,
"learning_rate": 0.0004671821032585259,
"loss": 5.2935,
"mean_token_accuracy": 0.1716819614171982,
"num_tokens": 40253058.0,
"step": 23200
},
{
"entropy": 5.56196928024292,
"epoch": 1.8054464112040458,
"grad_norm": 1.3203125,
"learning_rate": 0.0004671676886215506,
"loss": 5.1937,
"mean_token_accuracy": 0.1800489529967308,
"num_tokens": 40261797.0,
"step": 23205
},
{
"entropy": 5.4071674823760985,
"epoch": 1.8058354405757635,
"grad_norm": 1.34375,
"learning_rate": 0.0004671532710687365,
"loss": 5.1279,
"mean_token_accuracy": 0.19304683953523635,
"num_tokens": 40270003.0,
"step": 23210
},
{
"entropy": 5.439709663391113,
"epoch": 1.806224469947481,
"grad_norm": 1.2109375,
"learning_rate": 0.0004671388506003024,
"loss": 5.1511,
"mean_token_accuracy": 0.1898994639515877,
"num_tokens": 40278241.0,
"step": 23215
},
{
"entropy": 5.447816467285156,
"epoch": 1.8066134993191985,
"grad_norm": 1.3203125,
"learning_rate": 0.0004671244272164671,
"loss": 5.2139,
"mean_token_accuracy": 0.17662492245435715,
"num_tokens": 40286316.0,
"step": 23220
},
{
"entropy": 5.461765480041504,
"epoch": 1.8070025286909162,
"grad_norm": 1.21875,
"learning_rate": 0.00046711000091744935,
"loss": 5.1708,
"mean_token_accuracy": 0.18385355472564696,
"num_tokens": 40295378.0,
"step": 23225
},
{
"entropy": 5.517857074737549,
"epoch": 1.8073915580626339,
"grad_norm": 1.2734375,
"learning_rate": 0.0004670955717034681,
"loss": 5.2015,
"mean_token_accuracy": 0.17984024733304976,
"num_tokens": 40305379.0,
"step": 23230
},
{
"entropy": 5.507182312011719,
"epoch": 1.8077805874343513,
"grad_norm": 1.25,
"learning_rate": 0.00046708113957474233,
"loss": 5.216,
"mean_token_accuracy": 0.1837383031845093,
"num_tokens": 40314174.0,
"step": 23235
},
{
"entropy": 5.532891368865966,
"epoch": 1.8081696168060688,
"grad_norm": 1.3203125,
"learning_rate": 0.000467066704531491,
"loss": 5.195,
"mean_token_accuracy": 0.1879311814904213,
"num_tokens": 40323708.0,
"step": 23240
},
{
"entropy": 5.452646732330322,
"epoch": 1.8085586461777865,
"grad_norm": 1.203125,
"learning_rate": 0.0004670522665739332,
"loss": 5.1146,
"mean_token_accuracy": 0.18440792411565782,
"num_tokens": 40333664.0,
"step": 23245
},
{
"entropy": 5.491839456558227,
"epoch": 1.808947675549504,
"grad_norm": 1.3046875,
"learning_rate": 0.0004670378257022878,
"loss": 5.1645,
"mean_token_accuracy": 0.18548935055732726,
"num_tokens": 40342037.0,
"step": 23250
},
{
"entropy": 5.506096410751343,
"epoch": 1.8093367049212215,
"grad_norm": 1.171875,
"learning_rate": 0.00046702338191677414,
"loss": 5.0992,
"mean_token_accuracy": 0.19460695534944533,
"num_tokens": 40350472.0,
"step": 23255
},
{
"entropy": 5.428826808929443,
"epoch": 1.8097257342929391,
"grad_norm": 1.234375,
"learning_rate": 0.0004670089352176113,
"loss": 5.1599,
"mean_token_accuracy": 0.1843449965119362,
"num_tokens": 40358829.0,
"step": 23260
},
{
"entropy": 5.431121826171875,
"epoch": 1.8101147636646568,
"grad_norm": 1.171875,
"learning_rate": 0.00046699448560501847,
"loss": 5.1599,
"mean_token_accuracy": 0.18335520178079606,
"num_tokens": 40367414.0,
"step": 23265
},
{
"entropy": 5.520883512496948,
"epoch": 1.810503793036374,
"grad_norm": 1.328125,
"learning_rate": 0.0004669800330792149,
"loss": 5.2269,
"mean_token_accuracy": 0.1764501929283142,
"num_tokens": 40375969.0,
"step": 23270
},
{
"entropy": 5.513030481338501,
"epoch": 1.8108928224080918,
"grad_norm": 1.1953125,
"learning_rate": 0.00046696557764041994,
"loss": 5.1753,
"mean_token_accuracy": 0.18240612894296646,
"num_tokens": 40384200.0,
"step": 23275
},
{
"entropy": 5.536885404586792,
"epoch": 1.8112818517798095,
"grad_norm": 1.375,
"learning_rate": 0.0004669511192888528,
"loss": 5.2682,
"mean_token_accuracy": 0.1782982349395752,
"num_tokens": 40392891.0,
"step": 23280
},
{
"entropy": 5.538742113113403,
"epoch": 1.811670881151527,
"grad_norm": 1.1875,
"learning_rate": 0.00046693665802473294,
"loss": 5.2236,
"mean_token_accuracy": 0.1825158029794693,
"num_tokens": 40402009.0,
"step": 23285
},
{
"entropy": 5.479896974563599,
"epoch": 1.8120599105232444,
"grad_norm": 1.3828125,
"learning_rate": 0.00046692219384827986,
"loss": 5.1855,
"mean_token_accuracy": 0.18070918768644334,
"num_tokens": 40410756.0,
"step": 23290
},
{
"entropy": 5.536929655075073,
"epoch": 1.8124489398949621,
"grad_norm": 1.2265625,
"learning_rate": 0.0004669077267597129,
"loss": 5.2321,
"mean_token_accuracy": 0.1807504951953888,
"num_tokens": 40420087.0,
"step": 23295
},
{
"entropy": 5.452242088317871,
"epoch": 1.8128379692666796,
"grad_norm": 1.34375,
"learning_rate": 0.00046689325675925174,
"loss": 5.1019,
"mean_token_accuracy": 0.19031475335359574,
"num_tokens": 40428741.0,
"step": 23300
},
{
"entropy": 5.556022787094117,
"epoch": 1.813226998638397,
"grad_norm": 1.1796875,
"learning_rate": 0.00046687878384711574,
"loss": 5.3039,
"mean_token_accuracy": 0.17355628907680512,
"num_tokens": 40438128.0,
"step": 23305
},
{
"entropy": 5.512592887878418,
"epoch": 1.8136160280101148,
"grad_norm": 1.234375,
"learning_rate": 0.00046686430802352476,
"loss": 5.2439,
"mean_token_accuracy": 0.17933424562215805,
"num_tokens": 40446990.0,
"step": 23310
},
{
"entropy": 5.452840566635132,
"epoch": 1.8140050573818325,
"grad_norm": 1.2578125,
"learning_rate": 0.0004668498292886982,
"loss": 5.1422,
"mean_token_accuracy": 0.18773091286420823,
"num_tokens": 40454627.0,
"step": 23315
},
{
"entropy": 5.466392564773559,
"epoch": 1.8143940867535497,
"grad_norm": 1.265625,
"learning_rate": 0.00046683534764285577,
"loss": 5.1609,
"mean_token_accuracy": 0.1873893991112709,
"num_tokens": 40463321.0,
"step": 23320
},
{
"entropy": 5.414951467514038,
"epoch": 1.8147831161252674,
"grad_norm": 1.2578125,
"learning_rate": 0.00046682086308621725,
"loss": 4.9968,
"mean_token_accuracy": 0.19436359852552415,
"num_tokens": 40472156.0,
"step": 23325
},
{
"entropy": 5.436511373519897,
"epoch": 1.8151721454969851,
"grad_norm": 1.21875,
"learning_rate": 0.0004668063756190026,
"loss": 5.1654,
"mean_token_accuracy": 0.18081745654344558,
"num_tokens": 40480938.0,
"step": 23330
},
{
"entropy": 5.381306743621826,
"epoch": 1.8155611748687026,
"grad_norm": 1.21875,
"learning_rate": 0.00046679188524143136,
"loss": 5.0988,
"mean_token_accuracy": 0.18636801093816757,
"num_tokens": 40489740.0,
"step": 23335
},
{
"entropy": 5.481018829345703,
"epoch": 1.81595020424042,
"grad_norm": 1.21875,
"learning_rate": 0.0004667773919537235,
"loss": 5.1094,
"mean_token_accuracy": 0.19009560644626616,
"num_tokens": 40498420.0,
"step": 23340
},
{
"entropy": 5.38794469833374,
"epoch": 1.8163392336121378,
"grad_norm": 1.3203125,
"learning_rate": 0.00046676289575609914,
"loss": 5.0157,
"mean_token_accuracy": 0.1954392284154892,
"num_tokens": 40506634.0,
"step": 23345
},
{
"entropy": 5.50755352973938,
"epoch": 1.8167282629838553,
"grad_norm": 1.1796875,
"learning_rate": 0.00046674839664877796,
"loss": 5.2214,
"mean_token_accuracy": 0.182529915869236,
"num_tokens": 40515310.0,
"step": 23350
},
{
"entropy": 5.486479759216309,
"epoch": 1.8171172923555727,
"grad_norm": 1.28125,
"learning_rate": 0.0004667338946319801,
"loss": 5.0845,
"mean_token_accuracy": 0.19326406717300415,
"num_tokens": 40523739.0,
"step": 23355
},
{
"entropy": 5.466891765594482,
"epoch": 1.8175063217272904,
"grad_norm": 1.21875,
"learning_rate": 0.0004667193897059255,
"loss": 5.2611,
"mean_token_accuracy": 0.17791733145713806,
"num_tokens": 40533070.0,
"step": 23360
},
{
"entropy": 5.521513605117798,
"epoch": 1.8178953510990081,
"grad_norm": 1.2265625,
"learning_rate": 0.00046670488187083436,
"loss": 5.1377,
"mean_token_accuracy": 0.18730199187994004,
"num_tokens": 40541975.0,
"step": 23365
},
{
"entropy": 5.551066493988037,
"epoch": 1.8182843804707254,
"grad_norm": 1.2890625,
"learning_rate": 0.0004666903711269267,
"loss": 5.2463,
"mean_token_accuracy": 0.1827528715133667,
"num_tokens": 40550896.0,
"step": 23370
},
{
"entropy": 5.442790222167969,
"epoch": 1.818673409842443,
"grad_norm": 1.1796875,
"learning_rate": 0.0004666758574744228,
"loss": 5.2295,
"mean_token_accuracy": 0.17820956856012343,
"num_tokens": 40559719.0,
"step": 23375
},
{
"entropy": 5.507573080062866,
"epoch": 1.8190624392141608,
"grad_norm": 1.1875,
"learning_rate": 0.0004666613409135429,
"loss": 5.226,
"mean_token_accuracy": 0.17964120656251908,
"num_tokens": 40568448.0,
"step": 23380
},
{
"entropy": 5.6080334186553955,
"epoch": 1.8194514685858783,
"grad_norm": 1.1640625,
"learning_rate": 0.0004666468214445072,
"loss": 5.2262,
"mean_token_accuracy": 0.17512208372354507,
"num_tokens": 40576443.0,
"step": 23385
},
{
"entropy": 5.401840734481811,
"epoch": 1.8198404979575957,
"grad_norm": 1.2109375,
"learning_rate": 0.00046663229906753595,
"loss": 4.9988,
"mean_token_accuracy": 0.19805439114570617,
"num_tokens": 40584440.0,
"step": 23390
},
{
"entropy": 5.417028903961182,
"epoch": 1.8202295273293134,
"grad_norm": 1.1640625,
"learning_rate": 0.00046661777378284965,
"loss": 5.2856,
"mean_token_accuracy": 0.18258226066827773,
"num_tokens": 40593696.0,
"step": 23395
},
{
"entropy": 5.458006906509399,
"epoch": 1.820618556701031,
"grad_norm": 1.3046875,
"learning_rate": 0.0004666032455906685,
"loss": 5.0848,
"mean_token_accuracy": 0.1933286726474762,
"num_tokens": 40601368.0,
"step": 23400
},
{
"entropy": 5.529492330551148,
"epoch": 1.8210075860727484,
"grad_norm": 1.3203125,
"learning_rate": 0.00046658871449121325,
"loss": 5.1821,
"mean_token_accuracy": 0.18526964336633683,
"num_tokens": 40609143.0,
"step": 23405
},
{
"entropy": 5.466282749176026,
"epoch": 1.821396615444466,
"grad_norm": 1.2734375,
"learning_rate": 0.0004665741804847041,
"loss": 5.1847,
"mean_token_accuracy": 0.18623853027820586,
"num_tokens": 40617602.0,
"step": 23410
},
{
"entropy": 5.393481111526489,
"epoch": 1.8217856448161838,
"grad_norm": 1.34375,
"learning_rate": 0.00046655964357136164,
"loss": 5.0525,
"mean_token_accuracy": 0.1929493546485901,
"num_tokens": 40626412.0,
"step": 23415
},
{
"entropy": 5.422512435913086,
"epoch": 1.822174674187901,
"grad_norm": 1.1328125,
"learning_rate": 0.00046654510375140657,
"loss": 5.1121,
"mean_token_accuracy": 0.18927900940179826,
"num_tokens": 40635095.0,
"step": 23420
},
{
"entropy": 5.470872783660889,
"epoch": 1.8225637035596187,
"grad_norm": 1.2109375,
"learning_rate": 0.0004665305610250594,
"loss": 5.15,
"mean_token_accuracy": 0.18870654702186584,
"num_tokens": 40643421.0,
"step": 23425
},
{
"entropy": 5.4639084815979,
"epoch": 1.8229527329313364,
"grad_norm": 1.1484375,
"learning_rate": 0.0004665160153925408,
"loss": 5.1879,
"mean_token_accuracy": 0.18596282005310058,
"num_tokens": 40652180.0,
"step": 23430
},
{
"entropy": 5.5223548412323,
"epoch": 1.823341762303054,
"grad_norm": 1.28125,
"learning_rate": 0.00046650146685407154,
"loss": 5.2257,
"mean_token_accuracy": 0.18098650574684144,
"num_tokens": 40660398.0,
"step": 23435
},
{
"entropy": 5.491229057312012,
"epoch": 1.8237307916747714,
"grad_norm": 1.1640625,
"learning_rate": 0.00046648691540987226,
"loss": 5.2485,
"mean_token_accuracy": 0.17661017626523973,
"num_tokens": 40668827.0,
"step": 23440
},
{
"entropy": 5.504744625091552,
"epoch": 1.824119821046489,
"grad_norm": 1.3515625,
"learning_rate": 0.00046647236106016387,
"loss": 5.1407,
"mean_token_accuracy": 0.19118944108486174,
"num_tokens": 40676920.0,
"step": 23445
},
{
"entropy": 5.441109609603882,
"epoch": 1.8245088504182065,
"grad_norm": 1.2890625,
"learning_rate": 0.0004664578038051672,
"loss": 5.1103,
"mean_token_accuracy": 0.19149552434682846,
"num_tokens": 40685115.0,
"step": 23450
},
{
"entropy": 5.434766387939453,
"epoch": 1.824897879789924,
"grad_norm": 1.421875,
"learning_rate": 0.000466443243645103,
"loss": 5.1412,
"mean_token_accuracy": 0.18753363192081451,
"num_tokens": 40693870.0,
"step": 23455
},
{
"entropy": 5.488427209854126,
"epoch": 1.8252869091616417,
"grad_norm": 1.1953125,
"learning_rate": 0.0004664286805801923,
"loss": 5.1228,
"mean_token_accuracy": 0.18068734407424927,
"num_tokens": 40703031.0,
"step": 23460
},
{
"entropy": 5.3913809299469,
"epoch": 1.8256759385333594,
"grad_norm": 1.2734375,
"learning_rate": 0.0004664141146106562,
"loss": 5.077,
"mean_token_accuracy": 0.19457968473434448,
"num_tokens": 40711690.0,
"step": 23465
},
{
"entropy": 5.40255708694458,
"epoch": 1.8260649679050769,
"grad_norm": 1.265625,
"learning_rate": 0.00046639954573671547,
"loss": 5.1746,
"mean_token_accuracy": 0.18295167684555053,
"num_tokens": 40720086.0,
"step": 23470
},
{
"entropy": 5.542586755752564,
"epoch": 1.8264539972767944,
"grad_norm": 1.390625,
"learning_rate": 0.00046638497395859127,
"loss": 5.2165,
"mean_token_accuracy": 0.1817614421248436,
"num_tokens": 40728117.0,
"step": 23475
},
{
"entropy": 5.5636992931365965,
"epoch": 1.826843026648512,
"grad_norm": 1.234375,
"learning_rate": 0.0004663703992765047,
"loss": 5.2144,
"mean_token_accuracy": 0.1896081194281578,
"num_tokens": 40736761.0,
"step": 23480
},
{
"entropy": 5.390636730194092,
"epoch": 1.8272320560202295,
"grad_norm": 1.21875,
"learning_rate": 0.00046635582169067693,
"loss": 5.1484,
"mean_token_accuracy": 0.18095557540655136,
"num_tokens": 40745291.0,
"step": 23485
},
{
"entropy": 5.54840989112854,
"epoch": 1.827621085391947,
"grad_norm": 1.1171875,
"learning_rate": 0.00046634124120132915,
"loss": 5.1743,
"mean_token_accuracy": 0.18733388036489487,
"num_tokens": 40754308.0,
"step": 23490
},
{
"entropy": 5.448008871078491,
"epoch": 1.8280101147636647,
"grad_norm": 1.2265625,
"learning_rate": 0.0004663266578086826,
"loss": 5.0633,
"mean_token_accuracy": 0.18662054985761642,
"num_tokens": 40763046.0,
"step": 23495
},
{
"entropy": 5.3517876148223875,
"epoch": 1.8283991441353822,
"grad_norm": 1.2421875,
"learning_rate": 0.0004663120715129585,
"loss": 5.0999,
"mean_token_accuracy": 0.17912623137235642,
"num_tokens": 40770912.0,
"step": 23500
},
{
"entropy": 5.509221696853638,
"epoch": 1.8287881735070997,
"grad_norm": 1.4453125,
"learning_rate": 0.0004662974823143783,
"loss": 5.1952,
"mean_token_accuracy": 0.17274018228054047,
"num_tokens": 40779748.0,
"step": 23505
},
{
"entropy": 5.510226583480835,
"epoch": 1.8291772028788174,
"grad_norm": 1.2265625,
"learning_rate": 0.0004662828902131632,
"loss": 5.2014,
"mean_token_accuracy": 0.17924265563488007,
"num_tokens": 40787732.0,
"step": 23510
},
{
"entropy": 5.4629274845123295,
"epoch": 1.829566232250535,
"grad_norm": 1.2578125,
"learning_rate": 0.0004662682952095348,
"loss": 5.0771,
"mean_token_accuracy": 0.18834544122219085,
"num_tokens": 40796521.0,
"step": 23515
},
{
"entropy": 5.492439460754395,
"epoch": 1.8299552616222525,
"grad_norm": 1.21875,
"learning_rate": 0.00046625369730371436,
"loss": 5.2406,
"mean_token_accuracy": 0.18148494213819505,
"num_tokens": 40805479.0,
"step": 23520
},
{
"entropy": 5.435658073425293,
"epoch": 1.83034429099397,
"grad_norm": 1.3671875,
"learning_rate": 0.0004662390964959235,
"loss": 5.0558,
"mean_token_accuracy": 0.18398656249046325,
"num_tokens": 40813647.0,
"step": 23525
},
{
"entropy": 5.359564590454101,
"epoch": 1.8307333203656877,
"grad_norm": 1.3515625,
"learning_rate": 0.00046622449278638375,
"loss": 5.0687,
"mean_token_accuracy": 0.18652674555778503,
"num_tokens": 40821753.0,
"step": 23530
},
{
"entropy": 5.410502195358276,
"epoch": 1.8311223497374052,
"grad_norm": 1.265625,
"learning_rate": 0.0004662098861753167,
"loss": 5.1861,
"mean_token_accuracy": 0.18628668487071992,
"num_tokens": 40830391.0,
"step": 23535
},
{
"entropy": 5.462909984588623,
"epoch": 1.8315113791091227,
"grad_norm": 1.265625,
"learning_rate": 0.00046619527666294394,
"loss": 5.143,
"mean_token_accuracy": 0.19373972862958908,
"num_tokens": 40839372.0,
"step": 23540
},
{
"entropy": 5.537566900253296,
"epoch": 1.8319004084808403,
"grad_norm": 1.3359375,
"learning_rate": 0.0004661806642494872,
"loss": 5.2435,
"mean_token_accuracy": 0.18024476021528243,
"num_tokens": 40847945.0,
"step": 23545
},
{
"entropy": 5.5658525943756105,
"epoch": 1.8322894378525578,
"grad_norm": 1.390625,
"learning_rate": 0.0004661660489351681,
"loss": 5.2876,
"mean_token_accuracy": 0.17911046445369722,
"num_tokens": 40857600.0,
"step": 23550
},
{
"entropy": 5.469484472274781,
"epoch": 1.8326784672242753,
"grad_norm": 1.21875,
"learning_rate": 0.0004661514307202086,
"loss": 5.092,
"mean_token_accuracy": 0.19017273485660552,
"num_tokens": 40866672.0,
"step": 23555
},
{
"entropy": 5.475192070007324,
"epoch": 1.833067496595993,
"grad_norm": 1.2578125,
"learning_rate": 0.00046613680960483036,
"loss": 5.1373,
"mean_token_accuracy": 0.1809640794992447,
"num_tokens": 40875240.0,
"step": 23560
},
{
"entropy": 5.429525518417359,
"epoch": 1.8334565259677107,
"grad_norm": 1.2265625,
"learning_rate": 0.0004661221855892552,
"loss": 5.1073,
"mean_token_accuracy": 0.18319796472787858,
"num_tokens": 40883731.0,
"step": 23565
},
{
"entropy": 5.401902532577514,
"epoch": 1.8338455553394282,
"grad_norm": 1.3828125,
"learning_rate": 0.00046610755867370506,
"loss": 5.0728,
"mean_token_accuracy": 0.192316272854805,
"num_tokens": 40892572.0,
"step": 23570
},
{
"entropy": 5.4698010921478275,
"epoch": 1.8342345847111456,
"grad_norm": 1.328125,
"learning_rate": 0.000466092928858402,
"loss": 5.17,
"mean_token_accuracy": 0.19086933583021165,
"num_tokens": 40901603.0,
"step": 23575
},
{
"entropy": 5.477512788772583,
"epoch": 1.8346236140828633,
"grad_norm": 1.3671875,
"learning_rate": 0.00046607829614356787,
"loss": 5.1499,
"mean_token_accuracy": 0.18670800626277922,
"num_tokens": 40910502.0,
"step": 23580
},
{
"entropy": 5.453986072540284,
"epoch": 1.8350126434545808,
"grad_norm": 1.25,
"learning_rate": 0.0004660636605294247,
"loss": 5.1014,
"mean_token_accuracy": 0.19035519659519196,
"num_tokens": 40919858.0,
"step": 23585
},
{
"entropy": 5.469553518295288,
"epoch": 1.8354016728262983,
"grad_norm": 1.265625,
"learning_rate": 0.0004660490220161946,
"loss": 5.1508,
"mean_token_accuracy": 0.19002943634986877,
"num_tokens": 40928795.0,
"step": 23590
},
{
"entropy": 5.511152458190918,
"epoch": 1.835790702198016,
"grad_norm": 1.234375,
"learning_rate": 0.00046603438060409966,
"loss": 5.1567,
"mean_token_accuracy": 0.18648817986249924,
"num_tokens": 40937240.0,
"step": 23595
},
{
"entropy": 5.468125724792481,
"epoch": 1.8361797315697335,
"grad_norm": 1.234375,
"learning_rate": 0.000466019736293362,
"loss": 5.158,
"mean_token_accuracy": 0.18931260854005813,
"num_tokens": 40945974.0,
"step": 23600
},
{
"entropy": 5.412787437438965,
"epoch": 1.836568760941451,
"grad_norm": 1.2578125,
"learning_rate": 0.00046600508908420396,
"loss": 5.0608,
"mean_token_accuracy": 0.1990172192454338,
"num_tokens": 40953553.0,
"step": 23605
},
{
"entropy": 5.432899713516235,
"epoch": 1.8369577903131686,
"grad_norm": 1.3359375,
"learning_rate": 0.00046599043897684766,
"loss": 5.1089,
"mean_token_accuracy": 0.19648993164300918,
"num_tokens": 40961287.0,
"step": 23610
},
{
"entropy": 5.396137762069702,
"epoch": 1.8373468196848863,
"grad_norm": 1.390625,
"learning_rate": 0.0004659757859715155,
"loss": 5.0607,
"mean_token_accuracy": 0.188524828851223,
"num_tokens": 40970266.0,
"step": 23615
},
{
"entropy": 5.464326524734497,
"epoch": 1.8377358490566038,
"grad_norm": 1.3125,
"learning_rate": 0.00046596113006842975,
"loss": 5.1201,
"mean_token_accuracy": 0.19566244781017303,
"num_tokens": 40978303.0,
"step": 23620
},
{
"entropy": 5.538270950317383,
"epoch": 1.8381248784283213,
"grad_norm": 1.2109375,
"learning_rate": 0.0004659464712678128,
"loss": 5.1717,
"mean_token_accuracy": 0.18946965634822846,
"num_tokens": 40986360.0,
"step": 23625
},
{
"entropy": 5.453439331054687,
"epoch": 1.838513907800039,
"grad_norm": 1.234375,
"learning_rate": 0.0004659318095698871,
"loss": 5.2158,
"mean_token_accuracy": 0.18057546019554138,
"num_tokens": 40995323.0,
"step": 23630
},
{
"entropy": 5.484476900100708,
"epoch": 1.8389029371717565,
"grad_norm": 1.453125,
"learning_rate": 0.000465917144974875,
"loss": 5.1085,
"mean_token_accuracy": 0.18589985221624375,
"num_tokens": 41004032.0,
"step": 23635
},
{
"entropy": 5.4534858703613285,
"epoch": 1.839291966543474,
"grad_norm": 1.2265625,
"learning_rate": 0.0004659024774829992,
"loss": 5.1491,
"mean_token_accuracy": 0.1860458567738533,
"num_tokens": 41011992.0,
"step": 23640
},
{
"entropy": 5.454087114334106,
"epoch": 1.8396809959151916,
"grad_norm": 1.328125,
"learning_rate": 0.000465887807094482,
"loss": 5.1859,
"mean_token_accuracy": 0.18303187638521196,
"num_tokens": 41020252.0,
"step": 23645
},
{
"entropy": 5.461905288696289,
"epoch": 1.8400700252869093,
"grad_norm": 1.328125,
"learning_rate": 0.00046587313380954635,
"loss": 5.1085,
"mean_token_accuracy": 0.18792423009872436,
"num_tokens": 41028858.0,
"step": 23650
},
{
"entropy": 5.460704326629639,
"epoch": 1.8404590546586266,
"grad_norm": 1.3203125,
"learning_rate": 0.00046585845762841453,
"loss": 5.0777,
"mean_token_accuracy": 0.1933815985918045,
"num_tokens": 41037539.0,
"step": 23655
},
{
"entropy": 5.424747514724731,
"epoch": 1.8408480840303443,
"grad_norm": 1.2890625,
"learning_rate": 0.0004658437785513095,
"loss": 5.1655,
"mean_token_accuracy": 0.18635925203561782,
"num_tokens": 41045809.0,
"step": 23660
},
{
"entropy": 5.403650093078613,
"epoch": 1.841237113402062,
"grad_norm": 1.234375,
"learning_rate": 0.0004658290965784539,
"loss": 5.0892,
"mean_token_accuracy": 0.1865114688873291,
"num_tokens": 41054675.0,
"step": 23665
},
{
"entropy": 5.488287734985351,
"epoch": 1.8416261427737795,
"grad_norm": 1.2890625,
"learning_rate": 0.0004658144117100704,
"loss": 5.242,
"mean_token_accuracy": 0.18071712851524352,
"num_tokens": 41063493.0,
"step": 23670
},
{
"entropy": 5.467473363876342,
"epoch": 1.842015172145497,
"grad_norm": 1.2734375,
"learning_rate": 0.00046579972394638204,
"loss": 5.1785,
"mean_token_accuracy": 0.18211568295955657,
"num_tokens": 41072985.0,
"step": 23675
},
{
"entropy": 5.460685205459595,
"epoch": 1.8424042015172146,
"grad_norm": 1.2421875,
"learning_rate": 0.00046578503328761146,
"loss": 5.1477,
"mean_token_accuracy": 0.18426069021224975,
"num_tokens": 41080926.0,
"step": 23680
},
{
"entropy": 5.3876872062683105,
"epoch": 1.842793230888932,
"grad_norm": 1.28125,
"learning_rate": 0.00046577033973398173,
"loss": 5.1016,
"mean_token_accuracy": 0.18949470669031143,
"num_tokens": 41090251.0,
"step": 23685
},
{
"entropy": 5.380768251419068,
"epoch": 1.8431822602606496,
"grad_norm": 1.296875,
"learning_rate": 0.0004657556432857157,
"loss": 5.0638,
"mean_token_accuracy": 0.1865130364894867,
"num_tokens": 41098681.0,
"step": 23690
},
{
"entropy": 5.514657688140869,
"epoch": 1.8435712896323673,
"grad_norm": 1.25,
"learning_rate": 0.0004657409439430364,
"loss": 5.2064,
"mean_token_accuracy": 0.18349990248680115,
"num_tokens": 41107399.0,
"step": 23695
},
{
"entropy": 5.514560699462891,
"epoch": 1.843960319004085,
"grad_norm": 1.2734375,
"learning_rate": 0.0004657262417061669,
"loss": 5.1646,
"mean_token_accuracy": 0.18160766065120698,
"num_tokens": 41116476.0,
"step": 23700
},
{
"entropy": 5.434439086914063,
"epoch": 1.8443493483758022,
"grad_norm": 1.3984375,
"learning_rate": 0.0004657115365753302,
"loss": 5.0794,
"mean_token_accuracy": 0.18742818534374237,
"num_tokens": 41125191.0,
"step": 23705
},
{
"entropy": 5.406622409820557,
"epoch": 1.84473837774752,
"grad_norm": 1.3046875,
"learning_rate": 0.00046569682855074953,
"loss": 5.0728,
"mean_token_accuracy": 0.19411438405513765,
"num_tokens": 41133811.0,
"step": 23710
},
{
"entropy": 5.431077766418457,
"epoch": 1.8451274071192376,
"grad_norm": 1.3359375,
"learning_rate": 0.00046568211763264796,
"loss": 5.2068,
"mean_token_accuracy": 0.1821148157119751,
"num_tokens": 41143093.0,
"step": 23715
},
{
"entropy": 5.5269660472869875,
"epoch": 1.845516436490955,
"grad_norm": 1.390625,
"learning_rate": 0.0004656674038212488,
"loss": 5.2576,
"mean_token_accuracy": 0.18294116407632827,
"num_tokens": 41152106.0,
"step": 23720
},
{
"entropy": 5.472079610824585,
"epoch": 1.8459054658626726,
"grad_norm": 1.2578125,
"learning_rate": 0.00046565268711677525,
"loss": 5.1154,
"mean_token_accuracy": 0.1846821203827858,
"num_tokens": 41161100.0,
"step": 23725
},
{
"entropy": 5.428303670883179,
"epoch": 1.8462944952343903,
"grad_norm": 1.2421875,
"learning_rate": 0.00046563796751945065,
"loss": 5.1693,
"mean_token_accuracy": 0.18427515476942063,
"num_tokens": 41170339.0,
"step": 23730
},
{
"entropy": 5.479092264175415,
"epoch": 1.8466835246061077,
"grad_norm": 1.28125,
"learning_rate": 0.00046562324502949834,
"loss": 5.1528,
"mean_token_accuracy": 0.18135832995176315,
"num_tokens": 41178821.0,
"step": 23735
},
{
"entropy": 5.486088466644287,
"epoch": 1.8470725539778252,
"grad_norm": 1.4453125,
"learning_rate": 0.0004656085196471416,
"loss": 5.1797,
"mean_token_accuracy": 0.18353923708200454,
"num_tokens": 41187578.0,
"step": 23740
},
{
"entropy": 5.343141317367554,
"epoch": 1.847461583349543,
"grad_norm": 1.296875,
"learning_rate": 0.00046559379137260404,
"loss": 5.0483,
"mean_token_accuracy": 0.19183846861124038,
"num_tokens": 41196799.0,
"step": 23745
},
{
"entropy": 5.47886290550232,
"epoch": 1.8478506127212606,
"grad_norm": 1.171875,
"learning_rate": 0.000465579060206109,
"loss": 5.2121,
"mean_token_accuracy": 0.17870354056358337,
"num_tokens": 41206300.0,
"step": 23750
},
{
"entropy": 5.5449700355529785,
"epoch": 1.8482396420929779,
"grad_norm": 1.2421875,
"learning_rate": 0.00046556432614788015,
"loss": 5.194,
"mean_token_accuracy": 0.18632852137088776,
"num_tokens": 41214377.0,
"step": 23755
},
{
"entropy": 5.447195911407471,
"epoch": 1.8486286714646956,
"grad_norm": 1.1875,
"learning_rate": 0.0004655495891981409,
"loss": 5.1039,
"mean_token_accuracy": 0.18826203048229218,
"num_tokens": 41223303.0,
"step": 23760
},
{
"entropy": 5.478807783126831,
"epoch": 1.8490177008364133,
"grad_norm": 1.15625,
"learning_rate": 0.000465534849357115,
"loss": 5.2095,
"mean_token_accuracy": 0.1831169381737709,
"num_tokens": 41232323.0,
"step": 23765
},
{
"entropy": 5.485122203826904,
"epoch": 1.8494067302081307,
"grad_norm": 1.203125,
"learning_rate": 0.00046552010662502595,
"loss": 5.2048,
"mean_token_accuracy": 0.1848752588033676,
"num_tokens": 41241605.0,
"step": 23770
},
{
"entropy": 5.513813495635986,
"epoch": 1.8497957595798482,
"grad_norm": 1.296875,
"learning_rate": 0.0004655053610020976,
"loss": 5.276,
"mean_token_accuracy": 0.17496470659971236,
"num_tokens": 41250604.0,
"step": 23775
},
{
"entropy": 5.45437970161438,
"epoch": 1.850184788951566,
"grad_norm": 1.328125,
"learning_rate": 0.0004654906124885535,
"loss": 5.0527,
"mean_token_accuracy": 0.19050905257463455,
"num_tokens": 41258640.0,
"step": 23780
},
{
"entropy": 5.482372856140136,
"epoch": 1.8505738183232834,
"grad_norm": 1.125,
"learning_rate": 0.0004654758610846176,
"loss": 5.2768,
"mean_token_accuracy": 0.1822562262415886,
"num_tokens": 41268104.0,
"step": 23785
},
{
"entropy": 5.511211299896241,
"epoch": 1.8509628476950009,
"grad_norm": 1.2890625,
"learning_rate": 0.0004654611067905137,
"loss": 5.2324,
"mean_token_accuracy": 0.1830660507082939,
"num_tokens": 41276276.0,
"step": 23790
},
{
"entropy": 5.425739049911499,
"epoch": 1.8513518770667186,
"grad_norm": 1.1875,
"learning_rate": 0.00046544634960646563,
"loss": 5.0724,
"mean_token_accuracy": 0.19270382970571517,
"num_tokens": 41284464.0,
"step": 23795
},
{
"entropy": 5.451232528686523,
"epoch": 1.8517409064384363,
"grad_norm": 1.3046875,
"learning_rate": 0.0004654315895326974,
"loss": 5.0771,
"mean_token_accuracy": 0.18426578342914582,
"num_tokens": 41293108.0,
"step": 23800
},
{
"entropy": 5.454205179214478,
"epoch": 1.8521299358101535,
"grad_norm": 1.375,
"learning_rate": 0.0004654168265694328,
"loss": 5.12,
"mean_token_accuracy": 0.18528238832950591,
"num_tokens": 41301830.0,
"step": 23805
},
{
"entropy": 5.523759412765503,
"epoch": 1.8525189651818712,
"grad_norm": 1.3046875,
"learning_rate": 0.000465402060716896,
"loss": 5.1749,
"mean_token_accuracy": 0.1857190653681755,
"num_tokens": 41310487.0,
"step": 23810
},
{
"entropy": 5.5197385311126705,
"epoch": 1.852907994553589,
"grad_norm": 1.2734375,
"learning_rate": 0.000465387291975311,
"loss": 5.2507,
"mean_token_accuracy": 0.18191703408956528,
"num_tokens": 41319730.0,
"step": 23815
},
{
"entropy": 5.44227294921875,
"epoch": 1.8532970239253064,
"grad_norm": 1.3515625,
"learning_rate": 0.00046537252034490185,
"loss": 5.1348,
"mean_token_accuracy": 0.18759854137897491,
"num_tokens": 41328914.0,
"step": 23820
},
{
"entropy": 5.3977173328399655,
"epoch": 1.8536860532970239,
"grad_norm": 1.1953125,
"learning_rate": 0.00046535774582589275,
"loss": 5.1774,
"mean_token_accuracy": 0.1810375362634659,
"num_tokens": 41337060.0,
"step": 23825
},
{
"entropy": 5.441968059539795,
"epoch": 1.8540750826687415,
"grad_norm": 1.1796875,
"learning_rate": 0.00046534296841850776,
"loss": 5.0979,
"mean_token_accuracy": 0.19232777804136275,
"num_tokens": 41344966.0,
"step": 23830
},
{
"entropy": 5.407000494003296,
"epoch": 1.854464112040459,
"grad_norm": 1.234375,
"learning_rate": 0.00046532818812297124,
"loss": 5.0047,
"mean_token_accuracy": 0.19768527299165725,
"num_tokens": 41353678.0,
"step": 23835
},
{
"entropy": 5.53778600692749,
"epoch": 1.8548531414121765,
"grad_norm": 1.46875,
"learning_rate": 0.0004653134049395074,
"loss": 5.2998,
"mean_token_accuracy": 0.18442942947149277,
"num_tokens": 41362782.0,
"step": 23840
},
{
"entropy": 5.42816276550293,
"epoch": 1.8552421707838942,
"grad_norm": 1.2734375,
"learning_rate": 0.0004652986188683406,
"loss": 5.0996,
"mean_token_accuracy": 0.1909518375992775,
"num_tokens": 41370668.0,
"step": 23845
},
{
"entropy": 5.44040093421936,
"epoch": 1.855631200155612,
"grad_norm": 1.3515625,
"learning_rate": 0.00046528382990969504,
"loss": 5.1255,
"mean_token_accuracy": 0.18699666112661362,
"num_tokens": 41378945.0,
"step": 23850
},
{
"entropy": 5.507497787475586,
"epoch": 1.8560202295273294,
"grad_norm": 1.203125,
"learning_rate": 0.0004652690380637953,
"loss": 5.1562,
"mean_token_accuracy": 0.18164692521095277,
"num_tokens": 41387579.0,
"step": 23855
},
{
"entropy": 5.472086668014526,
"epoch": 1.8564092588990468,
"grad_norm": 1.5078125,
"learning_rate": 0.0004652542433308657,
"loss": 5.1764,
"mean_token_accuracy": 0.1848464533686638,
"num_tokens": 41396472.0,
"step": 23860
},
{
"entropy": 5.513326978683471,
"epoch": 1.8567982882707645,
"grad_norm": 1.3671875,
"learning_rate": 0.0004652394457111309,
"loss": 5.2283,
"mean_token_accuracy": 0.17720112651586534,
"num_tokens": 41404599.0,
"step": 23865
},
{
"entropy": 5.586637163162232,
"epoch": 1.857187317642482,
"grad_norm": 1.328125,
"learning_rate": 0.00046522464520481517,
"loss": 5.2323,
"mean_token_accuracy": 0.17648339569568633,
"num_tokens": 41412799.0,
"step": 23870
},
{
"entropy": 5.441289472579956,
"epoch": 1.8575763470141995,
"grad_norm": 1.3125,
"learning_rate": 0.00046520984181214333,
"loss": 5.0679,
"mean_token_accuracy": 0.1937624141573906,
"num_tokens": 41421193.0,
"step": 23875
},
{
"entropy": 5.411344575881958,
"epoch": 1.8579653763859172,
"grad_norm": 1.296875,
"learning_rate": 0.0004651950355333398,
"loss": 5.1043,
"mean_token_accuracy": 0.1841892957687378,
"num_tokens": 41430201.0,
"step": 23880
},
{
"entropy": 5.331236171722412,
"epoch": 1.8583544057576347,
"grad_norm": 1.2890625,
"learning_rate": 0.0004651802263686294,
"loss": 5.09,
"mean_token_accuracy": 0.1862233102321625,
"num_tokens": 41439122.0,
"step": 23885
},
{
"entropy": 5.448552560806275,
"epoch": 1.8587434351293521,
"grad_norm": 1.28125,
"learning_rate": 0.0004651654143182367,
"loss": 5.1376,
"mean_token_accuracy": 0.1802106276154518,
"num_tokens": 41448553.0,
"step": 23890
},
{
"entropy": 5.42213888168335,
"epoch": 1.8591324645010698,
"grad_norm": 1.1953125,
"learning_rate": 0.0004651505993823866,
"loss": 5.0873,
"mean_token_accuracy": 0.18781908899545668,
"num_tokens": 41457098.0,
"step": 23895
},
{
"entropy": 5.454419565200806,
"epoch": 1.8595214938727875,
"grad_norm": 1.2265625,
"learning_rate": 0.00046513578156130383,
"loss": 5.1601,
"mean_token_accuracy": 0.1825694814324379,
"num_tokens": 41465714.0,
"step": 23900
},
{
"entropy": 5.518798685073852,
"epoch": 1.859910523244505,
"grad_norm": 1.1875,
"learning_rate": 0.0004651209608552131,
"loss": 5.1669,
"mean_token_accuracy": 0.18522556722164155,
"num_tokens": 41474418.0,
"step": 23905
},
{
"entropy": 5.421759605407715,
"epoch": 1.8602995526162225,
"grad_norm": 1.2265625,
"learning_rate": 0.00046510613726433945,
"loss": 5.0649,
"mean_token_accuracy": 0.1904325321316719,
"num_tokens": 41482430.0,
"step": 23910
},
{
"entropy": 5.511632966995239,
"epoch": 1.8606885819879402,
"grad_norm": 1.265625,
"learning_rate": 0.0004650913107889078,
"loss": 5.2241,
"mean_token_accuracy": 0.18104615956544876,
"num_tokens": 41490759.0,
"step": 23915
},
{
"entropy": 5.343016862869263,
"epoch": 1.8610776113596577,
"grad_norm": 1.1796875,
"learning_rate": 0.000465076481429143,
"loss": 5.0625,
"mean_token_accuracy": 0.19390745759010314,
"num_tokens": 41499660.0,
"step": 23920
},
{
"entropy": 5.40338625907898,
"epoch": 1.8614666407313751,
"grad_norm": 1.2109375,
"learning_rate": 0.0004650616491852701,
"loss": 5.0988,
"mean_token_accuracy": 0.19200483113527297,
"num_tokens": 41507515.0,
"step": 23925
},
{
"entropy": 5.49579873085022,
"epoch": 1.8618556701030928,
"grad_norm": 1.3046875,
"learning_rate": 0.00046504681405751426,
"loss": 5.169,
"mean_token_accuracy": 0.18332203328609467,
"num_tokens": 41515859.0,
"step": 23930
},
{
"entropy": 5.483397912979126,
"epoch": 1.8622446994748103,
"grad_norm": 1.796875,
"learning_rate": 0.00046503197604610047,
"loss": 5.1996,
"mean_token_accuracy": 0.18741641640663148,
"num_tokens": 41524776.0,
"step": 23935
},
{
"entropy": 5.48962812423706,
"epoch": 1.8626337288465278,
"grad_norm": 1.25,
"learning_rate": 0.00046501713515125393,
"loss": 5.0987,
"mean_token_accuracy": 0.19188895523548127,
"num_tokens": 41532854.0,
"step": 23940
},
{
"entropy": 5.507185649871826,
"epoch": 1.8630227582182455,
"grad_norm": 1.21875,
"learning_rate": 0.0004650022913731998,
"loss": 5.132,
"mean_token_accuracy": 0.19055043905973434,
"num_tokens": 41542038.0,
"step": 23945
},
{
"entropy": 5.466739273071289,
"epoch": 1.8634117875899632,
"grad_norm": 1.2421875,
"learning_rate": 0.00046498744471216335,
"loss": 5.1228,
"mean_token_accuracy": 0.18627745658159256,
"num_tokens": 41550428.0,
"step": 23950
},
{
"entropy": 5.403680944442749,
"epoch": 1.8638008169616807,
"grad_norm": 1.3203125,
"learning_rate": 0.00046497259516836974,
"loss": 5.0879,
"mean_token_accuracy": 0.18716151863336564,
"num_tokens": 41559289.0,
"step": 23955
},
{
"entropy": 5.4214073657989506,
"epoch": 1.8641898463333981,
"grad_norm": 1.2109375,
"learning_rate": 0.00046495774274204446,
"loss": 5.092,
"mean_token_accuracy": 0.1917103871703148,
"num_tokens": 41567901.0,
"step": 23960
},
{
"entropy": 5.522829484939575,
"epoch": 1.8645788757051158,
"grad_norm": 1.3125,
"learning_rate": 0.0004649428874334127,
"loss": 5.2272,
"mean_token_accuracy": 0.1788163363933563,
"num_tokens": 41577589.0,
"step": 23965
},
{
"entropy": 5.534354400634766,
"epoch": 1.8649679050768333,
"grad_norm": 1.2421875,
"learning_rate": 0.0004649280292427,
"loss": 5.229,
"mean_token_accuracy": 0.18105229437351228,
"num_tokens": 41586319.0,
"step": 23970
},
{
"entropy": 5.533240175247192,
"epoch": 1.8653569344485508,
"grad_norm": 1.390625,
"learning_rate": 0.0004649131681701318,
"loss": 5.1939,
"mean_token_accuracy": 0.18565918505191803,
"num_tokens": 41594316.0,
"step": 23975
},
{
"entropy": 5.446474170684814,
"epoch": 1.8657459638202685,
"grad_norm": 1.34375,
"learning_rate": 0.00046489830421593347,
"loss": 5.1326,
"mean_token_accuracy": 0.1875303491950035,
"num_tokens": 41603221.0,
"step": 23980
},
{
"entropy": 5.441981077194214,
"epoch": 1.866134993191986,
"grad_norm": 1.1953125,
"learning_rate": 0.0004648834373803307,
"loss": 5.1129,
"mean_token_accuracy": 0.18431846648454667,
"num_tokens": 41612082.0,
"step": 23985
},
{
"entropy": 5.462725639343262,
"epoch": 1.8665240225637034,
"grad_norm": 1.203125,
"learning_rate": 0.00046486856766354893,
"loss": 5.1053,
"mean_token_accuracy": 0.1929277554154396,
"num_tokens": 41619762.0,
"step": 23990
},
{
"entropy": 5.395091247558594,
"epoch": 1.8669130519354211,
"grad_norm": 1.2890625,
"learning_rate": 0.00046485369506581387,
"loss": 5.1173,
"mean_token_accuracy": 0.18664432615041732,
"num_tokens": 41627968.0,
"step": 23995
},
{
"entropy": 5.550791168212891,
"epoch": 1.8673020813071388,
"grad_norm": 1.2578125,
"learning_rate": 0.00046483881958735124,
"loss": 5.2176,
"mean_token_accuracy": 0.17915906757116318,
"num_tokens": 41636841.0,
"step": 24000
},
{
"epoch": 1.8673020813071388,
"eval_entropy": 5.380492646838749,
"eval_loss": 5.230442047119141,
"eval_mean_token_accuracy": 0.19026380606547816,
"eval_num_tokens": 41636841.0,
"eval_runtime": 28.6082,
"eval_samples_per_second": 1452.661,
"eval_steps_per_second": 181.591,
"step": 24000
},
{
"entropy": 5.5266862392425535,
"epoch": 1.8676911106788563,
"grad_norm": 1.2578125,
"learning_rate": 0.00046482394122838663,
"loss": 5.1357,
"mean_token_accuracy": 0.1859994649887085,
"num_tokens": 41645352.0,
"step": 24005
},
{
"entropy": 5.450476932525635,
"epoch": 1.8680801400505738,
"grad_norm": 1.3125,
"learning_rate": 0.00046480905998914587,
"loss": 5.0425,
"mean_token_accuracy": 0.19373636245727538,
"num_tokens": 41654296.0,
"step": 24010
},
{
"entropy": 5.39591703414917,
"epoch": 1.8684691694222915,
"grad_norm": 1.3046875,
"learning_rate": 0.0004647941758698547,
"loss": 5.0863,
"mean_token_accuracy": 0.1860190749168396,
"num_tokens": 41662008.0,
"step": 24015
},
{
"entropy": 5.4795468807220455,
"epoch": 1.868858198794009,
"grad_norm": 1.2421875,
"learning_rate": 0.000464779288870739,
"loss": 5.26,
"mean_token_accuracy": 0.1803176909685135,
"num_tokens": 41671765.0,
"step": 24020
},
{
"entropy": 5.495187091827392,
"epoch": 1.8692472281657264,
"grad_norm": 1.296875,
"learning_rate": 0.00046476439899202464,
"loss": 5.241,
"mean_token_accuracy": 0.17707473039627075,
"num_tokens": 41681035.0,
"step": 24025
},
{
"entropy": 5.456947278976441,
"epoch": 1.8696362575374441,
"grad_norm": 1.265625,
"learning_rate": 0.00046474950623393756,
"loss": 5.1194,
"mean_token_accuracy": 0.18560980707407,
"num_tokens": 41689974.0,
"step": 24030
},
{
"entropy": 5.4655067920684814,
"epoch": 1.8700252869091616,
"grad_norm": 1.15625,
"learning_rate": 0.0004647346105967038,
"loss": 5.1418,
"mean_token_accuracy": 0.18478066772222518,
"num_tokens": 41698560.0,
"step": 24035
},
{
"entropy": 5.455021619796753,
"epoch": 1.870414316280879,
"grad_norm": 1.265625,
"learning_rate": 0.0004647197120805493,
"loss": 5.1244,
"mean_token_accuracy": 0.18826833069324495,
"num_tokens": 41706741.0,
"step": 24040
},
{
"entropy": 5.413682270050049,
"epoch": 1.8708033456525968,
"grad_norm": 1.171875,
"learning_rate": 0.00046470481068570013,
"loss": 5.1116,
"mean_token_accuracy": 0.18616115003824235,
"num_tokens": 41715685.0,
"step": 24045
},
{
"entropy": 5.4495823860168455,
"epoch": 1.8711923750243145,
"grad_norm": 1.2265625,
"learning_rate": 0.0004646899064123824,
"loss": 5.2055,
"mean_token_accuracy": 0.18264019042253493,
"num_tokens": 41724123.0,
"step": 24050
},
{
"entropy": 5.497165107727051,
"epoch": 1.871581404396032,
"grad_norm": 1.234375,
"learning_rate": 0.0004646749992608223,
"loss": 5.151,
"mean_token_accuracy": 0.18590733408927917,
"num_tokens": 41732604.0,
"step": 24055
},
{
"entropy": 5.355326414108276,
"epoch": 1.8719704337677494,
"grad_norm": 1.28125,
"learning_rate": 0.0004646600892312459,
"loss": 5.1068,
"mean_token_accuracy": 0.18693995326757432,
"num_tokens": 41740444.0,
"step": 24060
},
{
"entropy": 5.416489315032959,
"epoch": 1.872359463139467,
"grad_norm": 1.3359375,
"learning_rate": 0.0004646451763238796,
"loss": 5.0855,
"mean_token_accuracy": 0.18208515048027038,
"num_tokens": 41748800.0,
"step": 24065
},
{
"entropy": 5.422815942764283,
"epoch": 1.8727484925111846,
"grad_norm": 1.15625,
"learning_rate": 0.0004646302605389496,
"loss": 5.1295,
"mean_token_accuracy": 0.18266837298870087,
"num_tokens": 41757402.0,
"step": 24070
},
{
"entropy": 5.441775846481323,
"epoch": 1.873137521882902,
"grad_norm": 1.21875,
"learning_rate": 0.0004646153418766822,
"loss": 5.1262,
"mean_token_accuracy": 0.18915594071149827,
"num_tokens": 41766604.0,
"step": 24075
},
{
"entropy": 5.535004997253418,
"epoch": 1.8735265512546198,
"grad_norm": 1.3359375,
"learning_rate": 0.00046460042033730377,
"loss": 5.3147,
"mean_token_accuracy": 0.1752936527132988,
"num_tokens": 41775450.0,
"step": 24080
},
{
"entropy": 5.5326714515686035,
"epoch": 1.8739155806263375,
"grad_norm": 1.21875,
"learning_rate": 0.0004645854959210408,
"loss": 5.2726,
"mean_token_accuracy": 0.1808071792125702,
"num_tokens": 41784355.0,
"step": 24085
},
{
"entropy": 5.471151542663574,
"epoch": 1.8743046099980547,
"grad_norm": 1.3046875,
"learning_rate": 0.00046457056862811956,
"loss": 5.1161,
"mean_token_accuracy": 0.18049731105566025,
"num_tokens": 41793441.0,
"step": 24090
},
{
"entropy": 5.474300336837769,
"epoch": 1.8746936393697724,
"grad_norm": 1.25,
"learning_rate": 0.0004645556384587668,
"loss": 5.0899,
"mean_token_accuracy": 0.1900794431567192,
"num_tokens": 41802407.0,
"step": 24095
},
{
"entropy": 5.482835960388184,
"epoch": 1.87508266874149,
"grad_norm": 1.2265625,
"learning_rate": 0.0004645407054132089,
"loss": 5.1431,
"mean_token_accuracy": 0.18311664015054702,
"num_tokens": 41810362.0,
"step": 24100
},
{
"entropy": 5.4221290111541744,
"epoch": 1.8754716981132076,
"grad_norm": 1.2421875,
"learning_rate": 0.0004645257694916725,
"loss": 5.2444,
"mean_token_accuracy": 0.1821636825799942,
"num_tokens": 41819332.0,
"step": 24105
},
{
"entropy": 5.446872663497925,
"epoch": 1.875860727484925,
"grad_norm": 1.296875,
"learning_rate": 0.0004645108306943842,
"loss": 5.0976,
"mean_token_accuracy": 0.19056933522224426,
"num_tokens": 41828048.0,
"step": 24110
},
{
"entropy": 5.42320146560669,
"epoch": 1.8762497568566427,
"grad_norm": 1.1484375,
"learning_rate": 0.0004644958890215707,
"loss": 5.0786,
"mean_token_accuracy": 0.18683300763368607,
"num_tokens": 41836583.0,
"step": 24115
},
{
"entropy": 5.4503031253814695,
"epoch": 1.8766387862283602,
"grad_norm": 1.265625,
"learning_rate": 0.0004644809444734586,
"loss": 5.1403,
"mean_token_accuracy": 0.18270149528980256,
"num_tokens": 41845454.0,
"step": 24120
},
{
"entropy": 5.480255508422852,
"epoch": 1.8770278156000777,
"grad_norm": 1.296875,
"learning_rate": 0.00046446599705027487,
"loss": 5.1182,
"mean_token_accuracy": 0.18268312364816666,
"num_tokens": 41854481.0,
"step": 24125
},
{
"entropy": 5.487434673309326,
"epoch": 1.8774168449717954,
"grad_norm": 1.2265625,
"learning_rate": 0.00046445104675224607,
"loss": 5.1835,
"mean_token_accuracy": 0.183938130736351,
"num_tokens": 41863015.0,
"step": 24130
},
{
"entropy": 5.491235446929932,
"epoch": 1.877805874343513,
"grad_norm": 1.3203125,
"learning_rate": 0.0004644360935795993,
"loss": 5.1583,
"mean_token_accuracy": 0.1808243975043297,
"num_tokens": 41871703.0,
"step": 24135
},
{
"entropy": 5.449118280410767,
"epoch": 1.8781949037152303,
"grad_norm": 1.2734375,
"learning_rate": 0.00046442113753256126,
"loss": 5.1005,
"mean_token_accuracy": 0.1816903308033943,
"num_tokens": 41880136.0,
"step": 24140
},
{
"entropy": 5.448924493789673,
"epoch": 1.878583933086948,
"grad_norm": 1.28125,
"learning_rate": 0.00046440617861135905,
"loss": 5.2369,
"mean_token_accuracy": 0.1787792518734932,
"num_tokens": 41889065.0,
"step": 24145
},
{
"entropy": 5.448483324050903,
"epoch": 1.8789729624586657,
"grad_norm": 1.09375,
"learning_rate": 0.0004643912168162194,
"loss": 5.0705,
"mean_token_accuracy": 0.1882781967520714,
"num_tokens": 41898160.0,
"step": 24150
},
{
"entropy": 5.488494491577148,
"epoch": 1.8793619918303832,
"grad_norm": 1.203125,
"learning_rate": 0.0004643762521473696,
"loss": 5.1413,
"mean_token_accuracy": 0.18804794400930405,
"num_tokens": 41907037.0,
"step": 24155
},
{
"entropy": 5.499371433258057,
"epoch": 1.8797510212021007,
"grad_norm": 1.1796875,
"learning_rate": 0.0004643612846050366,
"loss": 5.2147,
"mean_token_accuracy": 0.17527129054069518,
"num_tokens": 41915176.0,
"step": 24160
},
{
"entropy": 5.512415170669556,
"epoch": 1.8801400505738184,
"grad_norm": 1.1875,
"learning_rate": 0.00046434631418944744,
"loss": 5.2122,
"mean_token_accuracy": 0.18202699422836305,
"num_tokens": 41923586.0,
"step": 24165
},
{
"entropy": 5.511921453475952,
"epoch": 1.8805290799455359,
"grad_norm": 1.4296875,
"learning_rate": 0.0004643313409008294,
"loss": 5.266,
"mean_token_accuracy": 0.1721154823899269,
"num_tokens": 41932803.0,
"step": 24170
},
{
"entropy": 5.485407114028931,
"epoch": 1.8809181093172533,
"grad_norm": 1.2265625,
"learning_rate": 0.00046431636473940956,
"loss": 5.1712,
"mean_token_accuracy": 0.18699372559785843,
"num_tokens": 41941737.0,
"step": 24175
},
{
"entropy": 5.48391489982605,
"epoch": 1.881307138688971,
"grad_norm": 1.2578125,
"learning_rate": 0.0004643013857054152,
"loss": 5.0941,
"mean_token_accuracy": 0.18542088866233825,
"num_tokens": 41950099.0,
"step": 24180
},
{
"entropy": 5.45158576965332,
"epoch": 1.8816961680606887,
"grad_norm": 1.21875,
"learning_rate": 0.00046428640379907367,
"loss": 5.1516,
"mean_token_accuracy": 0.18314019441604615,
"num_tokens": 41959091.0,
"step": 24185
},
{
"entropy": 5.485082626342773,
"epoch": 1.882085197432406,
"grad_norm": 1.265625,
"learning_rate": 0.00046427141902061225,
"loss": 5.0865,
"mean_token_accuracy": 0.1891992837190628,
"num_tokens": 41968462.0,
"step": 24190
},
{
"entropy": 5.461593055725098,
"epoch": 1.8824742268041237,
"grad_norm": 1.25,
"learning_rate": 0.0004642564313702582,
"loss": 5.1609,
"mean_token_accuracy": 0.18333583623170852,
"num_tokens": 41976514.0,
"step": 24195
},
{
"entropy": 5.3711991786956785,
"epoch": 1.8828632561758414,
"grad_norm": 1.203125,
"learning_rate": 0.00046424144084823916,
"loss": 5.0572,
"mean_token_accuracy": 0.18507618010044097,
"num_tokens": 41985583.0,
"step": 24200
},
{
"entropy": 5.393287515640258,
"epoch": 1.8832522855475589,
"grad_norm": 1.2421875,
"learning_rate": 0.0004642264474547824,
"loss": 5.0754,
"mean_token_accuracy": 0.1862674370408058,
"num_tokens": 41993684.0,
"step": 24205
},
{
"entropy": 5.422995138168335,
"epoch": 1.8836413149192763,
"grad_norm": 1.140625,
"learning_rate": 0.00046421145119011556,
"loss": 5.0246,
"mean_token_accuracy": 0.1907213494181633,
"num_tokens": 42002239.0,
"step": 24210
},
{
"entropy": 5.340552234649659,
"epoch": 1.884030344290994,
"grad_norm": 1.1875,
"learning_rate": 0.000464196452054466,
"loss": 5.0278,
"mean_token_accuracy": 0.1945103958249092,
"num_tokens": 42010886.0,
"step": 24215
},
{
"entropy": 5.441726779937744,
"epoch": 1.8844193736627115,
"grad_norm": 1.2578125,
"learning_rate": 0.0004641814500480615,
"loss": 5.1988,
"mean_token_accuracy": 0.17802906185388565,
"num_tokens": 42019703.0,
"step": 24220
},
{
"entropy": 5.540903568267822,
"epoch": 1.884808403034429,
"grad_norm": 1.2109375,
"learning_rate": 0.0004641664451711296,
"loss": 5.2442,
"mean_token_accuracy": 0.18060047924518585,
"num_tokens": 42028467.0,
"step": 24225
},
{
"entropy": 5.462961435317993,
"epoch": 1.8851974324061467,
"grad_norm": 1.21875,
"learning_rate": 0.00046415143742389793,
"loss": 5.1124,
"mean_token_accuracy": 0.18888040035963058,
"num_tokens": 42037220.0,
"step": 24230
},
{
"entropy": 5.480625820159912,
"epoch": 1.8855864617778644,
"grad_norm": 1.3125,
"learning_rate": 0.0004641364268065943,
"loss": 5.2162,
"mean_token_accuracy": 0.1797845646739006,
"num_tokens": 42046034.0,
"step": 24235
},
{
"entropy": 5.4537468433380125,
"epoch": 1.8859754911495816,
"grad_norm": 1.328125,
"learning_rate": 0.00046412141331944644,
"loss": 5.1045,
"mean_token_accuracy": 0.1865515887737274,
"num_tokens": 42054659.0,
"step": 24240
},
{
"entropy": 5.49623441696167,
"epoch": 1.8863645205212993,
"grad_norm": 1.1796875,
"learning_rate": 0.00046410639696268206,
"loss": 5.1771,
"mean_token_accuracy": 0.18167802691459656,
"num_tokens": 42063130.0,
"step": 24245
},
{
"entropy": 5.506428575515747,
"epoch": 1.886753549893017,
"grad_norm": 1.359375,
"learning_rate": 0.0004640913777365292,
"loss": 5.1947,
"mean_token_accuracy": 0.17898126542568207,
"num_tokens": 42071162.0,
"step": 24250
},
{
"entropy": 5.4653017044067385,
"epoch": 1.8871425792647345,
"grad_norm": 1.2421875,
"learning_rate": 0.00046407635564121565,
"loss": 5.1908,
"mean_token_accuracy": 0.18648219108581543,
"num_tokens": 42079948.0,
"step": 24255
},
{
"entropy": 5.4793616771698,
"epoch": 1.887531608636452,
"grad_norm": 1.34375,
"learning_rate": 0.00046406133067696936,
"loss": 5.1788,
"mean_token_accuracy": 0.1828402191400528,
"num_tokens": 42089010.0,
"step": 24260
},
{
"entropy": 5.539972543716431,
"epoch": 1.8879206380081697,
"grad_norm": 1.28125,
"learning_rate": 0.0004640463028440182,
"loss": 5.175,
"mean_token_accuracy": 0.17774557769298555,
"num_tokens": 42097096.0,
"step": 24265
},
{
"entropy": 5.3504071712493895,
"epoch": 1.8883096673798871,
"grad_norm": 1.296875,
"learning_rate": 0.0004640312721425904,
"loss": 5.0427,
"mean_token_accuracy": 0.19138125628232955,
"num_tokens": 42105870.0,
"step": 24270
},
{
"entropy": 5.399279975891114,
"epoch": 1.8886986967516046,
"grad_norm": 1.2890625,
"learning_rate": 0.0004640162385729139,
"loss": 5.0891,
"mean_token_accuracy": 0.19263002127408982,
"num_tokens": 42114246.0,
"step": 24275
},
{
"entropy": 5.429887962341309,
"epoch": 1.8890877261233223,
"grad_norm": 1.1875,
"learning_rate": 0.0004640012021352168,
"loss": 5.0685,
"mean_token_accuracy": 0.1853076249361038,
"num_tokens": 42122163.0,
"step": 24280
},
{
"entropy": 5.455728530883789,
"epoch": 1.88947675549504,
"grad_norm": 1.2734375,
"learning_rate": 0.0004639861628297273,
"loss": 5.1376,
"mean_token_accuracy": 0.1869522973895073,
"num_tokens": 42130255.0,
"step": 24285
},
{
"entropy": 5.514939880371093,
"epoch": 1.8898657848667575,
"grad_norm": 1.6640625,
"learning_rate": 0.00046397112065667354,
"loss": 5.1811,
"mean_token_accuracy": 0.1795892223715782,
"num_tokens": 42138615.0,
"step": 24290
},
{
"entropy": 5.413795852661133,
"epoch": 1.890254814238475,
"grad_norm": 1.25,
"learning_rate": 0.00046395607561628387,
"loss": 5.0459,
"mean_token_accuracy": 0.1937818080186844,
"num_tokens": 42146502.0,
"step": 24295
},
{
"entropy": 5.432741117477417,
"epoch": 1.8906438436101927,
"grad_norm": 1.171875,
"learning_rate": 0.00046394102770878643,
"loss": 5.1551,
"mean_token_accuracy": 0.18316398113965987,
"num_tokens": 42155548.0,
"step": 24300
},
{
"entropy": 5.3302037715911865,
"epoch": 1.8910328729819101,
"grad_norm": 1.3125,
"learning_rate": 0.00046392597693440974,
"loss": 4.9489,
"mean_token_accuracy": 0.20085753351449967,
"num_tokens": 42163813.0,
"step": 24305
},
{
"entropy": 5.495096683502197,
"epoch": 1.8914219023536276,
"grad_norm": 1.2421875,
"learning_rate": 0.0004639109232933819,
"loss": 5.1986,
"mean_token_accuracy": 0.1790920078754425,
"num_tokens": 42172702.0,
"step": 24310
},
{
"entropy": 5.514695119857788,
"epoch": 1.8918109317253453,
"grad_norm": 1.296875,
"learning_rate": 0.0004638958667859316,
"loss": 5.2212,
"mean_token_accuracy": 0.18217707723379134,
"num_tokens": 42180776.0,
"step": 24315
},
{
"entropy": 5.49624195098877,
"epoch": 1.8921999610970628,
"grad_norm": 1.171875,
"learning_rate": 0.0004638808074122872,
"loss": 5.1621,
"mean_token_accuracy": 0.1908087506890297,
"num_tokens": 42189695.0,
"step": 24320
},
{
"entropy": 5.376805114746094,
"epoch": 1.8925889904687803,
"grad_norm": 1.2109375,
"learning_rate": 0.0004638657451726771,
"loss": 5.1279,
"mean_token_accuracy": 0.18282254040241241,
"num_tokens": 42197884.0,
"step": 24325
},
{
"entropy": 5.494823408126831,
"epoch": 1.892978019840498,
"grad_norm": 1.2734375,
"learning_rate": 0.00046385068006732995,
"loss": 5.2617,
"mean_token_accuracy": 0.1761353686451912,
"num_tokens": 42206800.0,
"step": 24330
},
{
"entropy": 5.5054925918579105,
"epoch": 1.8933670492122157,
"grad_norm": 1.171875,
"learning_rate": 0.00046383561209647437,
"loss": 5.1279,
"mean_token_accuracy": 0.1979553744196892,
"num_tokens": 42216091.0,
"step": 24335
},
{
"entropy": 5.475465106964111,
"epoch": 1.8937560785839331,
"grad_norm": 1.203125,
"learning_rate": 0.00046382054126033884,
"loss": 5.1287,
"mean_token_accuracy": 0.18983456641435623,
"num_tokens": 42224675.0,
"step": 24340
},
{
"entropy": 5.470264053344726,
"epoch": 1.8941451079556506,
"grad_norm": 1.2734375,
"learning_rate": 0.0004638054675591523,
"loss": 5.1531,
"mean_token_accuracy": 0.18400678187608718,
"num_tokens": 42232964.0,
"step": 24345
},
{
"entropy": 5.462781620025635,
"epoch": 1.8945341373273683,
"grad_norm": 1.21875,
"learning_rate": 0.0004637903909931432,
"loss": 5.1919,
"mean_token_accuracy": 0.17613836675882338,
"num_tokens": 42241932.0,
"step": 24350
},
{
"entropy": 5.412767696380615,
"epoch": 1.8949231666990858,
"grad_norm": 1.1953125,
"learning_rate": 0.0004637753115625404,
"loss": 4.9686,
"mean_token_accuracy": 0.19227485209703446,
"num_tokens": 42250146.0,
"step": 24355
},
{
"entropy": 5.456176233291626,
"epoch": 1.8953121960708033,
"grad_norm": 1.265625,
"learning_rate": 0.0004637602292675726,
"loss": 5.2365,
"mean_token_accuracy": 0.17850709706544876,
"num_tokens": 42259183.0,
"step": 24360
},
{
"entropy": 5.455179071426391,
"epoch": 1.895701225442521,
"grad_norm": 1.1953125,
"learning_rate": 0.0004637451441084689,
"loss": 5.2485,
"mean_token_accuracy": 0.17562604546546937,
"num_tokens": 42268436.0,
"step": 24365
},
{
"entropy": 5.551352071762085,
"epoch": 1.8960902548142384,
"grad_norm": 1.203125,
"learning_rate": 0.0004637300560854581,
"loss": 5.1947,
"mean_token_accuracy": 0.18590783178806305,
"num_tokens": 42277146.0,
"step": 24370
},
{
"entropy": 5.558286809921265,
"epoch": 1.896479284185956,
"grad_norm": 1.1796875,
"learning_rate": 0.000463714965198769,
"loss": 5.1508,
"mean_token_accuracy": 0.1794161766767502,
"num_tokens": 42286571.0,
"step": 24375
},
{
"entropy": 5.42723913192749,
"epoch": 1.8968683135576736,
"grad_norm": 1.203125,
"learning_rate": 0.0004636998714486307,
"loss": 5.0851,
"mean_token_accuracy": 0.19385833889245987,
"num_tokens": 42295415.0,
"step": 24380
},
{
"entropy": 5.4739855289459225,
"epoch": 1.8972573429293913,
"grad_norm": 1.25,
"learning_rate": 0.00046368477483527224,
"loss": 5.1722,
"mean_token_accuracy": 0.1810181975364685,
"num_tokens": 42305105.0,
"step": 24385
},
{
"entropy": 5.481757926940918,
"epoch": 1.8976463723011088,
"grad_norm": 1.2578125,
"learning_rate": 0.0004636696753589226,
"loss": 5.0366,
"mean_token_accuracy": 0.1917433187365532,
"num_tokens": 42313034.0,
"step": 24390
},
{
"entropy": 5.405845308303833,
"epoch": 1.8980354016728263,
"grad_norm": 1.234375,
"learning_rate": 0.0004636545730198109,
"loss": 5.136,
"mean_token_accuracy": 0.18503344506025315,
"num_tokens": 42321249.0,
"step": 24395
},
{
"entropy": 5.420350980758667,
"epoch": 1.898424431044544,
"grad_norm": 1.2890625,
"learning_rate": 0.00046363946781816643,
"loss": 5.1489,
"mean_token_accuracy": 0.1881787061691284,
"num_tokens": 42329519.0,
"step": 24400
},
{
"entropy": 5.529286289215088,
"epoch": 1.8988134604162614,
"grad_norm": 1.203125,
"learning_rate": 0.00046362435975421816,
"loss": 5.191,
"mean_token_accuracy": 0.18424092680215837,
"num_tokens": 42338318.0,
"step": 24405
},
{
"entropy": 5.417074966430664,
"epoch": 1.899202489787979,
"grad_norm": 1.3203125,
"learning_rate": 0.00046360924882819554,
"loss": 5.1298,
"mean_token_accuracy": 0.18776854127645493,
"num_tokens": 42346038.0,
"step": 24410
},
{
"entropy": 5.466696119308471,
"epoch": 1.8995915191596966,
"grad_norm": 1.1875,
"learning_rate": 0.0004635941350403277,
"loss": 5.1104,
"mean_token_accuracy": 0.19031398743391037,
"num_tokens": 42356280.0,
"step": 24415
},
{
"entropy": 5.445505619049072,
"epoch": 1.899980548531414,
"grad_norm": 1.640625,
"learning_rate": 0.0004635790183908442,
"loss": 5.0651,
"mean_token_accuracy": 0.1950129747390747,
"num_tokens": 42364716.0,
"step": 24420
},
{
"entropy": 5.425743818283081,
"epoch": 1.9003695779031315,
"grad_norm": 1.171875,
"learning_rate": 0.00046356389887997415,
"loss": 5.1956,
"mean_token_accuracy": 0.1796469733119011,
"num_tokens": 42373137.0,
"step": 24425
},
{
"entropy": 5.40011944770813,
"epoch": 1.9007586072748492,
"grad_norm": 1.21875,
"learning_rate": 0.00046354877650794707,
"loss": 5.0912,
"mean_token_accuracy": 0.18302094787359238,
"num_tokens": 42382054.0,
"step": 24430
},
{
"entropy": 5.481983041763305,
"epoch": 1.901147636646567,
"grad_norm": 1.2578125,
"learning_rate": 0.00046353365127499235,
"loss": 5.1081,
"mean_token_accuracy": 0.17981300204992295,
"num_tokens": 42391228.0,
"step": 24435
},
{
"entropy": 5.4944939613342285,
"epoch": 1.9015366660182844,
"grad_norm": 1.2265625,
"learning_rate": 0.0004635185231813396,
"loss": 5.0988,
"mean_token_accuracy": 0.1865064412355423,
"num_tokens": 42400178.0,
"step": 24440
},
{
"entropy": 5.420658588409424,
"epoch": 1.901925695390002,
"grad_norm": 1.1796875,
"learning_rate": 0.0004635033922272183,
"loss": 5.1117,
"mean_token_accuracy": 0.19379601627588272,
"num_tokens": 42408515.0,
"step": 24445
},
{
"entropy": 5.510571908950806,
"epoch": 1.9023147247617196,
"grad_norm": 1.296875,
"learning_rate": 0.00046348825841285813,
"loss": 5.1811,
"mean_token_accuracy": 0.1778416246175766,
"num_tokens": 42417291.0,
"step": 24450
},
{
"entropy": 5.583145618438721,
"epoch": 1.902703754133437,
"grad_norm": 1.1953125,
"learning_rate": 0.0004634731217384886,
"loss": 5.326,
"mean_token_accuracy": 0.16752185225486754,
"num_tokens": 42426371.0,
"step": 24455
},
{
"entropy": 5.569092416763306,
"epoch": 1.9030927835051545,
"grad_norm": 1.21875,
"learning_rate": 0.0004634579822043394,
"loss": 5.2723,
"mean_token_accuracy": 0.18250429183244704,
"num_tokens": 42434767.0,
"step": 24460
},
{
"entropy": 5.4466503143310545,
"epoch": 1.9034818128768722,
"grad_norm": 1.21875,
"learning_rate": 0.00046344283981064035,
"loss": 5.1719,
"mean_token_accuracy": 0.1882934659719467,
"num_tokens": 42443618.0,
"step": 24465
},
{
"entropy": 5.4528656005859375,
"epoch": 1.90387084224859,
"grad_norm": 1.25,
"learning_rate": 0.00046342769455762114,
"loss": 5.1294,
"mean_token_accuracy": 0.1855500340461731,
"num_tokens": 42453134.0,
"step": 24470
},
{
"entropy": 5.504497766494751,
"epoch": 1.9042598716203072,
"grad_norm": 1.21875,
"learning_rate": 0.0004634125464455116,
"loss": 5.1507,
"mean_token_accuracy": 0.18050836622714997,
"num_tokens": 42462037.0,
"step": 24475
},
{
"entropy": 5.4474996566772464,
"epoch": 1.9046489009920249,
"grad_norm": 1.09375,
"learning_rate": 0.00046339739547454146,
"loss": 5.0777,
"mean_token_accuracy": 0.192548730969429,
"num_tokens": 42471318.0,
"step": 24480
},
{
"entropy": 5.360402393341064,
"epoch": 1.9050379303637426,
"grad_norm": 1.3828125,
"learning_rate": 0.00046338224164494074,
"loss": 5.1561,
"mean_token_accuracy": 0.18694016337394714,
"num_tokens": 42478851.0,
"step": 24485
},
{
"entropy": 5.3954911708831785,
"epoch": 1.90542695973546,
"grad_norm": 1.1796875,
"learning_rate": 0.00046336708495693933,
"loss": 5.1003,
"mean_token_accuracy": 0.19183557033538817,
"num_tokens": 42488406.0,
"step": 24490
},
{
"entropy": 5.4864085674285885,
"epoch": 1.9058159891071775,
"grad_norm": 1.46875,
"learning_rate": 0.00046335192541076725,
"loss": 5.0276,
"mean_token_accuracy": 0.19632097482681274,
"num_tokens": 42496001.0,
"step": 24495
},
{
"entropy": 5.430177211761475,
"epoch": 1.9062050184788952,
"grad_norm": 1.2109375,
"learning_rate": 0.0004633367630066545,
"loss": 5.1895,
"mean_token_accuracy": 0.17867903858423234,
"num_tokens": 42504808.0,
"step": 24500
},
{
"entropy": 5.433420038223266,
"epoch": 1.9065940478506127,
"grad_norm": 1.3125,
"learning_rate": 0.00046332159774483116,
"loss": 5.1074,
"mean_token_accuracy": 0.19030864387750626,
"num_tokens": 42512885.0,
"step": 24505
},
{
"entropy": 5.447889995574951,
"epoch": 1.9069830772223302,
"grad_norm": 1.125,
"learning_rate": 0.0004633064296255273,
"loss": 5.0947,
"mean_token_accuracy": 0.1861974447965622,
"num_tokens": 42521481.0,
"step": 24510
},
{
"entropy": 5.48263258934021,
"epoch": 1.9073721065940479,
"grad_norm": 1.1875,
"learning_rate": 0.00046329125864897307,
"loss": 5.1385,
"mean_token_accuracy": 0.18121411502361298,
"num_tokens": 42529784.0,
"step": 24515
},
{
"entropy": 5.426755332946778,
"epoch": 1.9077611359657656,
"grad_norm": 1.2421875,
"learning_rate": 0.0004632760848153987,
"loss": 5.0192,
"mean_token_accuracy": 0.19041645675897598,
"num_tokens": 42538802.0,
"step": 24520
},
{
"entropy": 5.392244148254394,
"epoch": 1.9081501653374828,
"grad_norm": 1.28125,
"learning_rate": 0.0004632609081250345,
"loss": 5.0574,
"mean_token_accuracy": 0.19062934517860414,
"num_tokens": 42547699.0,
"step": 24525
},
{
"entropy": 5.393301486968994,
"epoch": 1.9085391947092005,
"grad_norm": 1.2421875,
"learning_rate": 0.00046324572857811054,
"loss": 5.1296,
"mean_token_accuracy": 0.18558546751737595,
"num_tokens": 42556583.0,
"step": 24530
},
{
"entropy": 5.384571361541748,
"epoch": 1.9089282240809182,
"grad_norm": 1.1796875,
"learning_rate": 0.0004632305461748573,
"loss": 5.0177,
"mean_token_accuracy": 0.19932078719139099,
"num_tokens": 42565025.0,
"step": 24535
},
{
"entropy": 5.423727178573609,
"epoch": 1.9093172534526357,
"grad_norm": 1.3203125,
"learning_rate": 0.00046321536091550517,
"loss": 5.142,
"mean_token_accuracy": 0.18057762533426286,
"num_tokens": 42573798.0,
"step": 24540
},
{
"entropy": 5.446083974838257,
"epoch": 1.9097062828243532,
"grad_norm": 1.2578125,
"learning_rate": 0.0004632001728002845,
"loss": 5.1086,
"mean_token_accuracy": 0.18416004925966262,
"num_tokens": 42582002.0,
"step": 24545
},
{
"entropy": 5.589301681518554,
"epoch": 1.9100953121960709,
"grad_norm": 1.328125,
"learning_rate": 0.0004631849818294257,
"loss": 5.1405,
"mean_token_accuracy": 0.18021992295980455,
"num_tokens": 42591387.0,
"step": 24550
},
{
"entropy": 5.497700452804565,
"epoch": 1.9104843415677883,
"grad_norm": 1.2890625,
"learning_rate": 0.00046316978800315934,
"loss": 5.231,
"mean_token_accuracy": 0.1809960275888443,
"num_tokens": 42599769.0,
"step": 24555
},
{
"entropy": 5.34881911277771,
"epoch": 1.9108733709395058,
"grad_norm": 1.1640625,
"learning_rate": 0.000463154591321716,
"loss": 5.0277,
"mean_token_accuracy": 0.1919092983007431,
"num_tokens": 42608279.0,
"step": 24560
},
{
"entropy": 5.423420381546021,
"epoch": 1.9112624003112235,
"grad_norm": 1.1953125,
"learning_rate": 0.00046313939178532624,
"loss": 5.1158,
"mean_token_accuracy": 0.1857924073934555,
"num_tokens": 42616652.0,
"step": 24565
},
{
"entropy": 5.380179357528687,
"epoch": 1.9116514296829412,
"grad_norm": 1.1875,
"learning_rate": 0.0004631241893942206,
"loss": 5.0808,
"mean_token_accuracy": 0.18766250014305114,
"num_tokens": 42625629.0,
"step": 24570
},
{
"entropy": 5.442630004882813,
"epoch": 1.9120404590546585,
"grad_norm": 1.203125,
"learning_rate": 0.00046310898414862983,
"loss": 5.1462,
"mean_token_accuracy": 0.19131480902433395,
"num_tokens": 42634159.0,
"step": 24575
},
{
"entropy": 5.560131168365478,
"epoch": 1.9124294884263762,
"grad_norm": 1.203125,
"learning_rate": 0.0004630937760487847,
"loss": 5.2494,
"mean_token_accuracy": 0.17558962255716323,
"num_tokens": 42642880.0,
"step": 24580
},
{
"entropy": 5.495311832427978,
"epoch": 1.9128185177980939,
"grad_norm": 1.2734375,
"learning_rate": 0.0004630785650949158,
"loss": 5.1768,
"mean_token_accuracy": 0.18522849380970002,
"num_tokens": 42651481.0,
"step": 24585
},
{
"entropy": 5.446254014968872,
"epoch": 1.9132075471698113,
"grad_norm": 1.2578125,
"learning_rate": 0.0004630633512872541,
"loss": 5.1475,
"mean_token_accuracy": 0.19237289279699327,
"num_tokens": 42660131.0,
"step": 24590
},
{
"entropy": 5.429976272583008,
"epoch": 1.9135965765415288,
"grad_norm": 1.1953125,
"learning_rate": 0.00046304813462603035,
"loss": 5.142,
"mean_token_accuracy": 0.19099409878253937,
"num_tokens": 42669094.0,
"step": 24595
},
{
"entropy": 5.478194856643677,
"epoch": 1.9139856059132465,
"grad_norm": 1.296875,
"learning_rate": 0.0004630329151114754,
"loss": 5.1169,
"mean_token_accuracy": 0.19230376780033112,
"num_tokens": 42677792.0,
"step": 24600
},
{
"entropy": 5.479537582397461,
"epoch": 1.914374635284964,
"grad_norm": 1.1796875,
"learning_rate": 0.00046301769274382034,
"loss": 5.1542,
"mean_token_accuracy": 0.19036847800016404,
"num_tokens": 42686397.0,
"step": 24605
},
{
"entropy": 5.454549646377563,
"epoch": 1.9147636646566815,
"grad_norm": 1.25,
"learning_rate": 0.0004630024675232961,
"loss": 5.0916,
"mean_token_accuracy": 0.18972334861755372,
"num_tokens": 42695832.0,
"step": 24610
},
{
"entropy": 5.469930601119995,
"epoch": 1.9151526940283992,
"grad_norm": 1.390625,
"learning_rate": 0.00046298723945013354,
"loss": 5.1451,
"mean_token_accuracy": 0.18490809500217437,
"num_tokens": 42704378.0,
"step": 24615
},
{
"entropy": 5.452401351928711,
"epoch": 1.9155417234001169,
"grad_norm": 1.2109375,
"learning_rate": 0.0004629720085245639,
"loss": 5.1078,
"mean_token_accuracy": 0.18363269716501235,
"num_tokens": 42713926.0,
"step": 24620
},
{
"entropy": 5.4834692001342775,
"epoch": 1.9159307527718341,
"grad_norm": 1.21875,
"learning_rate": 0.0004629567747468182,
"loss": 5.0692,
"mean_token_accuracy": 0.19204634577035903,
"num_tokens": 42722779.0,
"step": 24625
},
{
"entropy": 5.385450744628907,
"epoch": 1.9163197821435518,
"grad_norm": 1.1953125,
"learning_rate": 0.0004629415381171276,
"loss": 5.0499,
"mean_token_accuracy": 0.18571332693099976,
"num_tokens": 42731460.0,
"step": 24630
},
{
"entropy": 5.438055324554443,
"epoch": 1.9167088115152695,
"grad_norm": 1.171875,
"learning_rate": 0.00046292629863572325,
"loss": 5.1494,
"mean_token_accuracy": 0.18549105077981948,
"num_tokens": 42739733.0,
"step": 24635
},
{
"entropy": 5.5339795589447025,
"epoch": 1.917097840886987,
"grad_norm": 1.28125,
"learning_rate": 0.0004629110563028365,
"loss": 5.1587,
"mean_token_accuracy": 0.18147716224193572,
"num_tokens": 42748330.0,
"step": 24640
},
{
"entropy": 5.432466793060303,
"epoch": 1.9174868702587045,
"grad_norm": 1.1953125,
"learning_rate": 0.0004628958111186985,
"loss": 5.1644,
"mean_token_accuracy": 0.18176979273557664,
"num_tokens": 42757423.0,
"step": 24645
},
{
"entropy": 5.422976541519165,
"epoch": 1.9178758996304222,
"grad_norm": 1.5625,
"learning_rate": 0.0004628805630835407,
"loss": 5.1849,
"mean_token_accuracy": 0.17496306002140044,
"num_tokens": 42766213.0,
"step": 24650
},
{
"entropy": 5.5416652202606205,
"epoch": 1.9182649290021396,
"grad_norm": 1.25,
"learning_rate": 0.0004628653121975944,
"loss": 5.1672,
"mean_token_accuracy": 0.1883589044213295,
"num_tokens": 42774037.0,
"step": 24655
},
{
"entropy": 5.47532958984375,
"epoch": 1.918653958373857,
"grad_norm": 1.2890625,
"learning_rate": 0.000462850058461091,
"loss": 5.2034,
"mean_token_accuracy": 0.18091268390417098,
"num_tokens": 42782806.0,
"step": 24660
},
{
"entropy": 5.411141777038575,
"epoch": 1.9190429877455748,
"grad_norm": 1.3046875,
"learning_rate": 0.0004628348018742619,
"loss": 5.0374,
"mean_token_accuracy": 0.18692378997802733,
"num_tokens": 42791790.0,
"step": 24665
},
{
"entropy": 5.5027320861816404,
"epoch": 1.9194320171172925,
"grad_norm": 1.2265625,
"learning_rate": 0.0004628195424373387,
"loss": 5.2654,
"mean_token_accuracy": 0.17513974457979203,
"num_tokens": 42799966.0,
"step": 24670
},
{
"entropy": 5.475761890411377,
"epoch": 1.91982104648901,
"grad_norm": 1.2109375,
"learning_rate": 0.00046280428015055286,
"loss": 5.124,
"mean_token_accuracy": 0.18184951543807984,
"num_tokens": 42808022.0,
"step": 24675
},
{
"entropy": 5.504780340194702,
"epoch": 1.9202100758607274,
"grad_norm": 1.296875,
"learning_rate": 0.00046278901501413606,
"loss": 5.0461,
"mean_token_accuracy": 0.19297143071889877,
"num_tokens": 42816191.0,
"step": 24680
},
{
"entropy": 5.454769515991211,
"epoch": 1.9205991052324451,
"grad_norm": 1.21875,
"learning_rate": 0.00046277374702831983,
"loss": 5.1506,
"mean_token_accuracy": 0.18265170305967332,
"num_tokens": 42824840.0,
"step": 24685
},
{
"entropy": 5.381754636764526,
"epoch": 1.9209881346041626,
"grad_norm": 1.265625,
"learning_rate": 0.00046275847619333576,
"loss": 5.129,
"mean_token_accuracy": 0.18569497615098954,
"num_tokens": 42833788.0,
"step": 24690
},
{
"entropy": 5.488091850280762,
"epoch": 1.92137716397588,
"grad_norm": 1.1875,
"learning_rate": 0.00046274320250941576,
"loss": 5.1552,
"mean_token_accuracy": 0.18658255636692048,
"num_tokens": 42842666.0,
"step": 24695
},
{
"entropy": 5.54749321937561,
"epoch": 1.9217661933475978,
"grad_norm": 1.28125,
"learning_rate": 0.00046272792597679146,
"loss": 5.219,
"mean_token_accuracy": 0.1752565994858742,
"num_tokens": 42850725.0,
"step": 24700
},
{
"entropy": 5.4631763935089115,
"epoch": 1.9221552227193153,
"grad_norm": 1.2890625,
"learning_rate": 0.00046271264659569474,
"loss": 5.1408,
"mean_token_accuracy": 0.18136709332466125,
"num_tokens": 42859732.0,
"step": 24705
},
{
"entropy": 5.443387222290039,
"epoch": 1.9225442520910327,
"grad_norm": 1.2421875,
"learning_rate": 0.0004626973643663573,
"loss": 5.1424,
"mean_token_accuracy": 0.18769567757844924,
"num_tokens": 42868858.0,
"step": 24710
},
{
"entropy": 5.5055207252502445,
"epoch": 1.9229332814627504,
"grad_norm": 1.3203125,
"learning_rate": 0.0004626820792890112,
"loss": 5.16,
"mean_token_accuracy": 0.1817028343677521,
"num_tokens": 42877483.0,
"step": 24715
},
{
"entropy": 5.411924409866333,
"epoch": 1.9233223108344681,
"grad_norm": 1.21875,
"learning_rate": 0.0004626667913638882,
"loss": 5.0321,
"mean_token_accuracy": 0.1955586552619934,
"num_tokens": 42885156.0,
"step": 24720
},
{
"entropy": 5.459235620498657,
"epoch": 1.9237113402061856,
"grad_norm": 1.203125,
"learning_rate": 0.0004626515005912203,
"loss": 5.2006,
"mean_token_accuracy": 0.17961460947990418,
"num_tokens": 42893599.0,
"step": 24725
},
{
"entropy": 5.4849334239959715,
"epoch": 1.924100369577903,
"grad_norm": 1.1640625,
"learning_rate": 0.0004626362069712397,
"loss": 5.0834,
"mean_token_accuracy": 0.19526495933532714,
"num_tokens": 42902861.0,
"step": 24730
},
{
"entropy": 5.474493169784546,
"epoch": 1.9244893989496208,
"grad_norm": 1.1875,
"learning_rate": 0.0004626209105041782,
"loss": 5.1343,
"mean_token_accuracy": 0.18466322869062424,
"num_tokens": 42911246.0,
"step": 24735
},
{
"entropy": 5.448348522186279,
"epoch": 1.9248784283213383,
"grad_norm": 1.265625,
"learning_rate": 0.000462605611190268,
"loss": 5.2116,
"mean_token_accuracy": 0.18912754207849503,
"num_tokens": 42919526.0,
"step": 24740
},
{
"entropy": 5.45012321472168,
"epoch": 1.9252674576930557,
"grad_norm": 1.3125,
"learning_rate": 0.00046259030902974133,
"loss": 5.0697,
"mean_token_accuracy": 0.1895577609539032,
"num_tokens": 42927473.0,
"step": 24745
},
{
"entropy": 5.368224859237671,
"epoch": 1.9256564870647734,
"grad_norm": 1.21875,
"learning_rate": 0.0004625750040228302,
"loss": 5.1023,
"mean_token_accuracy": 0.189781554043293,
"num_tokens": 42936108.0,
"step": 24750
},
{
"entropy": 5.3298890590667725,
"epoch": 1.926045516436491,
"grad_norm": 1.4765625,
"learning_rate": 0.00046255969616976704,
"loss": 5.0315,
"mean_token_accuracy": 0.19715736359357833,
"num_tokens": 42944147.0,
"step": 24755
},
{
"entropy": 5.435338497161865,
"epoch": 1.9264345458082084,
"grad_norm": 1.2734375,
"learning_rate": 0.000462544385470784,
"loss": 5.2208,
"mean_token_accuracy": 0.18188493996858596,
"num_tokens": 42952674.0,
"step": 24760
},
{
"entropy": 5.449994659423828,
"epoch": 1.926823575179926,
"grad_norm": 1.1796875,
"learning_rate": 0.0004625290719261134,
"loss": 5.0885,
"mean_token_accuracy": 0.1870378151535988,
"num_tokens": 42960907.0,
"step": 24765
},
{
"entropy": 5.431129121780396,
"epoch": 1.9272126045516438,
"grad_norm": 1.328125,
"learning_rate": 0.0004625137555359876,
"loss": 5.0769,
"mean_token_accuracy": 0.18921552896499633,
"num_tokens": 42968875.0,
"step": 24770
},
{
"entropy": 5.433496189117432,
"epoch": 1.9276016339233613,
"grad_norm": 1.3359375,
"learning_rate": 0.00046249843630063905,
"loss": 5.1183,
"mean_token_accuracy": 0.19008222073316575,
"num_tokens": 42977062.0,
"step": 24775
},
{
"entropy": 5.429621982574463,
"epoch": 1.9279906632950787,
"grad_norm": 1.3125,
"learning_rate": 0.0004624831142203001,
"loss": 5.0858,
"mean_token_accuracy": 0.18923879116773606,
"num_tokens": 42985346.0,
"step": 24780
},
{
"entropy": 5.396388196945191,
"epoch": 1.9283796926667964,
"grad_norm": 1.34375,
"learning_rate": 0.00046246778929520346,
"loss": 5.1314,
"mean_token_accuracy": 0.17807983458042145,
"num_tokens": 42993529.0,
"step": 24785
},
{
"entropy": 5.488701629638672,
"epoch": 1.928768722038514,
"grad_norm": 1.375,
"learning_rate": 0.0004624524615255814,
"loss": 5.1492,
"mean_token_accuracy": 0.18723775893449784,
"num_tokens": 43002254.0,
"step": 24790
},
{
"entropy": 5.463557577133178,
"epoch": 1.9291577514102314,
"grad_norm": 1.2890625,
"learning_rate": 0.00046243713091166655,
"loss": 5.1231,
"mean_token_accuracy": 0.18992913663387298,
"num_tokens": 43011130.0,
"step": 24795
},
{
"entropy": 5.448117685317993,
"epoch": 1.929546780781949,
"grad_norm": 1.28125,
"learning_rate": 0.0004624217974536916,
"loss": 5.0857,
"mean_token_accuracy": 0.19374331682920456,
"num_tokens": 43019185.0,
"step": 24800
},
{
"entropy": 5.527491712570191,
"epoch": 1.9299358101536666,
"grad_norm": 1.359375,
"learning_rate": 0.00046240646115188925,
"loss": 5.2952,
"mean_token_accuracy": 0.17685521245002747,
"num_tokens": 43028817.0,
"step": 24805
},
{
"entropy": 5.467464542388916,
"epoch": 1.930324839525384,
"grad_norm": 1.2890625,
"learning_rate": 0.0004623911220064921,
"loss": 5.1035,
"mean_token_accuracy": 0.19130326360464095,
"num_tokens": 43038205.0,
"step": 24810
},
{
"entropy": 5.421319103240966,
"epoch": 1.9307138688971017,
"grad_norm": 1.2265625,
"learning_rate": 0.00046237578001773297,
"loss": 5.1252,
"mean_token_accuracy": 0.18758097887039185,
"num_tokens": 43046844.0,
"step": 24815
},
{
"entropy": 5.439845943450928,
"epoch": 1.9311028982688194,
"grad_norm": 1.2109375,
"learning_rate": 0.00046236043518584454,
"loss": 5.2173,
"mean_token_accuracy": 0.18335138261318207,
"num_tokens": 43055928.0,
"step": 24820
},
{
"entropy": 5.530338191986084,
"epoch": 1.931491927640537,
"grad_norm": 1.328125,
"learning_rate": 0.0004623450875110597,
"loss": 5.1508,
"mean_token_accuracy": 0.1825666293501854,
"num_tokens": 43065371.0,
"step": 24825
},
{
"entropy": 5.496459341049194,
"epoch": 1.9318809570122544,
"grad_norm": 1.4140625,
"learning_rate": 0.00046232973699361147,
"loss": 5.0696,
"mean_token_accuracy": 0.1883788526058197,
"num_tokens": 43073486.0,
"step": 24830
},
{
"entropy": 5.421124124526978,
"epoch": 1.932269986383972,
"grad_norm": 1.171875,
"learning_rate": 0.0004623143836337326,
"loss": 5.1641,
"mean_token_accuracy": 0.18632274568080903,
"num_tokens": 43083028.0,
"step": 24835
},
{
"entropy": 5.404304885864258,
"epoch": 1.9326590157556895,
"grad_norm": 1.3359375,
"learning_rate": 0.00046229902743165607,
"loss": 5.1165,
"mean_token_accuracy": 0.1852840706706047,
"num_tokens": 43091134.0,
"step": 24840
},
{
"entropy": 5.509053754806518,
"epoch": 1.933048045127407,
"grad_norm": 1.203125,
"learning_rate": 0.0004622836683876149,
"loss": 5.1893,
"mean_token_accuracy": 0.1847757637500763,
"num_tokens": 43099849.0,
"step": 24845
},
{
"entropy": 5.43804178237915,
"epoch": 1.9334370744991247,
"grad_norm": 1.1328125,
"learning_rate": 0.0004622683065018422,
"loss": 5.1064,
"mean_token_accuracy": 0.182219760119915,
"num_tokens": 43108311.0,
"step": 24850
},
{
"entropy": 5.349687004089356,
"epoch": 1.9338261038708422,
"grad_norm": 1.234375,
"learning_rate": 0.00046225294177457105,
"loss": 4.9785,
"mean_token_accuracy": 0.19626577198505402,
"num_tokens": 43116179.0,
"step": 24855
},
{
"entropy": 5.35234317779541,
"epoch": 1.9342151332425597,
"grad_norm": 1.140625,
"learning_rate": 0.00046223757420603445,
"loss": 5.0605,
"mean_token_accuracy": 0.19256825596094132,
"num_tokens": 43125728.0,
"step": 24860
},
{
"entropy": 5.392927360534668,
"epoch": 1.9346041626142774,
"grad_norm": 1.1640625,
"learning_rate": 0.0004622222037964658,
"loss": 5.017,
"mean_token_accuracy": 0.18860645592212677,
"num_tokens": 43134512.0,
"step": 24865
},
{
"entropy": 5.411875581741333,
"epoch": 1.934993191985995,
"grad_norm": 1.265625,
"learning_rate": 0.00046220683054609815,
"loss": 5.094,
"mean_token_accuracy": 0.18921117782592772,
"num_tokens": 43144831.0,
"step": 24870
},
{
"entropy": 5.44965295791626,
"epoch": 1.9353822213577125,
"grad_norm": 1.375,
"learning_rate": 0.00046219145445516483,
"loss": 5.1564,
"mean_token_accuracy": 0.1858713760972023,
"num_tokens": 43153614.0,
"step": 24875
},
{
"entropy": 5.479537105560302,
"epoch": 1.93577125072943,
"grad_norm": 1.21875,
"learning_rate": 0.00046217607552389905,
"loss": 5.166,
"mean_token_accuracy": 0.18676602989435195,
"num_tokens": 43162004.0,
"step": 24880
},
{
"entropy": 5.441852569580078,
"epoch": 1.9361602801011477,
"grad_norm": 1.234375,
"learning_rate": 0.00046216069375253435,
"loss": 5.073,
"mean_token_accuracy": 0.1955839365720749,
"num_tokens": 43170255.0,
"step": 24885
},
{
"entropy": 5.384929180145264,
"epoch": 1.9365493094728652,
"grad_norm": 1.234375,
"learning_rate": 0.000462145309141304,
"loss": 5.1513,
"mean_token_accuracy": 0.18250832259654998,
"num_tokens": 43179036.0,
"step": 24890
},
{
"entropy": 5.462961483001709,
"epoch": 1.9369383388445827,
"grad_norm": 1.203125,
"learning_rate": 0.0004621299216904414,
"loss": 5.1423,
"mean_token_accuracy": 0.1936418354511261,
"num_tokens": 43187207.0,
"step": 24895
},
{
"entropy": 5.458221578598023,
"epoch": 1.9373273682163004,
"grad_norm": 1.21875,
"learning_rate": 0.00046211453140018006,
"loss": 5.148,
"mean_token_accuracy": 0.17727017551660537,
"num_tokens": 43195600.0,
"step": 24900
},
{
"entropy": 5.4709385395050045,
"epoch": 1.937716397588018,
"grad_norm": 1.2265625,
"learning_rate": 0.0004620991382707537,
"loss": 5.1646,
"mean_token_accuracy": 0.19386756122112275,
"num_tokens": 43204069.0,
"step": 24905
},
{
"entropy": 5.443561649322509,
"epoch": 1.9381054269597353,
"grad_norm": 1.234375,
"learning_rate": 0.00046208374230239556,
"loss": 5.1965,
"mean_token_accuracy": 0.1774524062871933,
"num_tokens": 43212998.0,
"step": 24910
},
{
"entropy": 5.503031301498413,
"epoch": 1.938494456331453,
"grad_norm": 1.1875,
"learning_rate": 0.0004620683434953394,
"loss": 5.1673,
"mean_token_accuracy": 0.1845482274889946,
"num_tokens": 43222411.0,
"step": 24915
},
{
"entropy": 5.477515697479248,
"epoch": 1.9388834857031707,
"grad_norm": 1.265625,
"learning_rate": 0.00046205294184981896,
"loss": 5.1239,
"mean_token_accuracy": 0.182538440823555,
"num_tokens": 43231265.0,
"step": 24920
},
{
"entropy": 5.481511068344116,
"epoch": 1.9392725150748882,
"grad_norm": 1.1796875,
"learning_rate": 0.00046203753736606787,
"loss": 5.1192,
"mean_token_accuracy": 0.18315459340810775,
"num_tokens": 43240609.0,
"step": 24925
},
{
"entropy": 5.4378235816955565,
"epoch": 1.9396615444466057,
"grad_norm": 1.1796875,
"learning_rate": 0.0004620221300443197,
"loss": 5.1262,
"mean_token_accuracy": 0.19143047034740449,
"num_tokens": 43249381.0,
"step": 24930
},
{
"entropy": 5.424568843841553,
"epoch": 1.9400505738183234,
"grad_norm": 1.3203125,
"learning_rate": 0.0004620067198848086,
"loss": 5.0967,
"mean_token_accuracy": 0.18610389530658722,
"num_tokens": 43257653.0,
"step": 24935
},
{
"entropy": 5.493094825744629,
"epoch": 1.9404396031900408,
"grad_norm": 1.2734375,
"learning_rate": 0.00046199130688776805,
"loss": 5.2168,
"mean_token_accuracy": 0.18286954164505004,
"num_tokens": 43267111.0,
"step": 24940
},
{
"entropy": 5.416477394104004,
"epoch": 1.9408286325617583,
"grad_norm": 1.21875,
"learning_rate": 0.00046197589105343204,
"loss": 5.0735,
"mean_token_accuracy": 0.18869625478982927,
"num_tokens": 43276207.0,
"step": 24945
},
{
"entropy": 5.430193853378296,
"epoch": 1.941217661933476,
"grad_norm": 1.1875,
"learning_rate": 0.0004619604723820345,
"loss": 5.1241,
"mean_token_accuracy": 0.1902042269706726,
"num_tokens": 43285031.0,
"step": 24950
},
{
"entropy": 5.469347095489502,
"epoch": 1.9416066913051937,
"grad_norm": 1.296875,
"learning_rate": 0.0004619450508738094,
"loss": 5.1541,
"mean_token_accuracy": 0.18689170926809312,
"num_tokens": 43292802.0,
"step": 24955
},
{
"entropy": 5.488390207290649,
"epoch": 1.941995720676911,
"grad_norm": 1.15625,
"learning_rate": 0.00046192962652899056,
"loss": 5.1162,
"mean_token_accuracy": 0.18956592679023743,
"num_tokens": 43302349.0,
"step": 24960
},
{
"entropy": 5.4162756443023685,
"epoch": 1.9423847500486286,
"grad_norm": 1.2265625,
"learning_rate": 0.00046191419934781236,
"loss": 5.0791,
"mean_token_accuracy": 0.18549565374851226,
"num_tokens": 43311455.0,
"step": 24965
},
{
"entropy": 5.445357084274292,
"epoch": 1.9427737794203463,
"grad_norm": 1.3125,
"learning_rate": 0.0004618987693305086,
"loss": 5.1162,
"mean_token_accuracy": 0.18692314773797988,
"num_tokens": 43319924.0,
"step": 24970
},
{
"entropy": 5.480496835708618,
"epoch": 1.9431628087920638,
"grad_norm": 1.2265625,
"learning_rate": 0.0004618833364773135,
"loss": 5.2574,
"mean_token_accuracy": 0.1843041479587555,
"num_tokens": 43328772.0,
"step": 24975
},
{
"entropy": 5.4377185821533205,
"epoch": 1.9435518381637813,
"grad_norm": 1.3515625,
"learning_rate": 0.00046186790078846127,
"loss": 5.1378,
"mean_token_accuracy": 0.18812571316957474,
"num_tokens": 43338862.0,
"step": 24980
},
{
"entropy": 5.500201082229614,
"epoch": 1.943940867535499,
"grad_norm": 1.1875,
"learning_rate": 0.00046185246226418603,
"loss": 5.1527,
"mean_token_accuracy": 0.18519557118415833,
"num_tokens": 43347292.0,
"step": 24985
},
{
"entropy": 5.414530515670776,
"epoch": 1.9443298969072165,
"grad_norm": 1.4375,
"learning_rate": 0.00046183702090472206,
"loss": 5.0846,
"mean_token_accuracy": 0.18616401255130768,
"num_tokens": 43356676.0,
"step": 24990
},
{
"entropy": 5.520038795471192,
"epoch": 1.944718926278934,
"grad_norm": 1.296875,
"learning_rate": 0.0004618215767103037,
"loss": 5.217,
"mean_token_accuracy": 0.17961248904466628,
"num_tokens": 43364746.0,
"step": 24995
},
{
"entropy": 5.448811388015747,
"epoch": 1.9451079556506516,
"grad_norm": 1.2421875,
"learning_rate": 0.0004618061296811653,
"loss": 5.0582,
"mean_token_accuracy": 0.186905200779438,
"num_tokens": 43373541.0,
"step": 25000
},
{
"entropy": 5.4221173286437985,
"epoch": 1.9454969850223693,
"grad_norm": 1.40625,
"learning_rate": 0.00046179067981754124,
"loss": 5.0812,
"mean_token_accuracy": 0.18685564249753953,
"num_tokens": 43382524.0,
"step": 25005
},
{
"entropy": 5.398396444320679,
"epoch": 1.9458860143940866,
"grad_norm": 1.296875,
"learning_rate": 0.00046177522711966584,
"loss": 5.1117,
"mean_token_accuracy": 0.18727776408195496,
"num_tokens": 43391875.0,
"step": 25010
},
{
"entropy": 5.480439949035644,
"epoch": 1.9462750437658043,
"grad_norm": 1.21875,
"learning_rate": 0.00046175977158777377,
"loss": 5.2104,
"mean_token_accuracy": 0.17521731555461884,
"num_tokens": 43399942.0,
"step": 25015
},
{
"entropy": 5.489329528808594,
"epoch": 1.946664073137522,
"grad_norm": 1.21875,
"learning_rate": 0.0004617443132220993,
"loss": 5.184,
"mean_token_accuracy": 0.18130216002464294,
"num_tokens": 43409371.0,
"step": 25020
},
{
"entropy": 5.498819732666016,
"epoch": 1.9470531025092395,
"grad_norm": 1.21875,
"learning_rate": 0.00046172885202287717,
"loss": 5.1535,
"mean_token_accuracy": 0.18855275511741637,
"num_tokens": 43418181.0,
"step": 25025
},
{
"entropy": 5.44780158996582,
"epoch": 1.947442131880957,
"grad_norm": 1.265625,
"learning_rate": 0.00046171338799034194,
"loss": 5.098,
"mean_token_accuracy": 0.19004820734262468,
"num_tokens": 43426004.0,
"step": 25030
},
{
"entropy": 5.4022666931152346,
"epoch": 1.9478311612526746,
"grad_norm": 1.2890625,
"learning_rate": 0.0004616979211247282,
"loss": 5.0153,
"mean_token_accuracy": 0.1880813479423523,
"num_tokens": 43433732.0,
"step": 25035
},
{
"entropy": 5.421090745925904,
"epoch": 1.9482201906243921,
"grad_norm": 1.1328125,
"learning_rate": 0.00046168245142627065,
"loss": 5.1616,
"mean_token_accuracy": 0.1835631623864174,
"num_tokens": 43442374.0,
"step": 25040
},
{
"entropy": 5.4902623176574705,
"epoch": 1.9486092199961096,
"grad_norm": 1.28125,
"learning_rate": 0.0004616669788952041,
"loss": 5.1708,
"mean_token_accuracy": 0.18792939186096191,
"num_tokens": 43451335.0,
"step": 25045
},
{
"entropy": 5.526312732696534,
"epoch": 1.9489982493678273,
"grad_norm": 1.171875,
"learning_rate": 0.00046165150353176315,
"loss": 5.1934,
"mean_token_accuracy": 0.18102587014436722,
"num_tokens": 43459520.0,
"step": 25050
},
{
"entropy": 5.413086366653443,
"epoch": 1.949387278739545,
"grad_norm": 1.453125,
"learning_rate": 0.0004616360253361828,
"loss": 5.0901,
"mean_token_accuracy": 0.1872740864753723,
"num_tokens": 43467695.0,
"step": 25055
},
{
"entropy": 5.386177110671997,
"epoch": 1.9497763081112622,
"grad_norm": 1.171875,
"learning_rate": 0.00046162054430869777,
"loss": 5.1368,
"mean_token_accuracy": 0.1941215753555298,
"num_tokens": 43476161.0,
"step": 25060
},
{
"entropy": 5.427265071868897,
"epoch": 1.95016533748298,
"grad_norm": 1.1640625,
"learning_rate": 0.000461605060449543,
"loss": 5.0975,
"mean_token_accuracy": 0.17978012561798096,
"num_tokens": 43485106.0,
"step": 25065
},
{
"entropy": 5.534923028945923,
"epoch": 1.9505543668546976,
"grad_norm": 1.25,
"learning_rate": 0.00046158957375895353,
"loss": 5.196,
"mean_token_accuracy": 0.17410032600164413,
"num_tokens": 43494232.0,
"step": 25070
},
{
"entropy": 5.516915512084961,
"epoch": 1.950943396226415,
"grad_norm": 1.2421875,
"learning_rate": 0.0004615740842371643,
"loss": 5.0811,
"mean_token_accuracy": 0.19290326833724974,
"num_tokens": 43502556.0,
"step": 25075
},
{
"entropy": 5.405913639068603,
"epoch": 1.9513324255981326,
"grad_norm": 1.2890625,
"learning_rate": 0.00046155859188441023,
"loss": 5.0058,
"mean_token_accuracy": 0.19662971198558807,
"num_tokens": 43511594.0,
"step": 25080
},
{
"entropy": 5.355210590362549,
"epoch": 1.9517214549698503,
"grad_norm": 1.171875,
"learning_rate": 0.0004615430967009265,
"loss": 5.1753,
"mean_token_accuracy": 0.18568242937326432,
"num_tokens": 43520532.0,
"step": 25085
},
{
"entropy": 5.438977003097534,
"epoch": 1.9521104843415678,
"grad_norm": 1.1953125,
"learning_rate": 0.00046152759868694815,
"loss": 5.18,
"mean_token_accuracy": 0.18547088503837586,
"num_tokens": 43529286.0,
"step": 25090
},
{
"entropy": 5.491412544250489,
"epoch": 1.9524995137132852,
"grad_norm": 1.1875,
"learning_rate": 0.0004615120978427104,
"loss": 5.1335,
"mean_token_accuracy": 0.18252035826444626,
"num_tokens": 43537983.0,
"step": 25095
},
{
"entropy": 5.451194000244141,
"epoch": 1.952888543085003,
"grad_norm": 1.1640625,
"learning_rate": 0.0004614965941684485,
"loss": 5.0814,
"mean_token_accuracy": 0.1929868280887604,
"num_tokens": 43546550.0,
"step": 25100
},
{
"entropy": 5.478314304351807,
"epoch": 1.9532775724567206,
"grad_norm": 1.2734375,
"learning_rate": 0.0004614810876643975,
"loss": 5.1753,
"mean_token_accuracy": 0.1878936305642128,
"num_tokens": 43555006.0,
"step": 25105
},
{
"entropy": 5.497987413406372,
"epoch": 1.953666601828438,
"grad_norm": 1.2734375,
"learning_rate": 0.00046146557833079286,
"loss": 5.22,
"mean_token_accuracy": 0.18419184237718583,
"num_tokens": 43563925.0,
"step": 25110
},
{
"entropy": 5.5130088329315186,
"epoch": 1.9540556312001556,
"grad_norm": 1.265625,
"learning_rate": 0.0004614500661678698,
"loss": 5.1446,
"mean_token_accuracy": 0.18960401117801667,
"num_tokens": 43572269.0,
"step": 25115
},
{
"entropy": 5.474818181991577,
"epoch": 1.9544446605718733,
"grad_norm": 1.171875,
"learning_rate": 0.0004614345511758639,
"loss": 5.1559,
"mean_token_accuracy": 0.18697709441184998,
"num_tokens": 43579908.0,
"step": 25120
},
{
"entropy": 5.389086389541626,
"epoch": 1.9548336899435907,
"grad_norm": 1.21875,
"learning_rate": 0.00046141903335501034,
"loss": 5.1215,
"mean_token_accuracy": 0.1834001824259758,
"num_tokens": 43589328.0,
"step": 25125
},
{
"entropy": 5.417955684661865,
"epoch": 1.9552227193153082,
"grad_norm": 1.265625,
"learning_rate": 0.0004614035127055447,
"loss": 5.1455,
"mean_token_accuracy": 0.18459923863410949,
"num_tokens": 43597840.0,
"step": 25130
},
{
"entropy": 5.435986518859863,
"epoch": 1.955611748687026,
"grad_norm": 1.234375,
"learning_rate": 0.0004613879892277024,
"loss": 5.0967,
"mean_token_accuracy": 0.19275453984737395,
"num_tokens": 43606496.0,
"step": 25135
},
{
"entropy": 5.465708494186401,
"epoch": 1.9560007780587434,
"grad_norm": 1.2890625,
"learning_rate": 0.000461372462921719,
"loss": 5.1128,
"mean_token_accuracy": 0.185288442671299,
"num_tokens": 43614411.0,
"step": 25140
},
{
"entropy": 5.35589451789856,
"epoch": 1.9563898074304609,
"grad_norm": 1.25,
"learning_rate": 0.0004613569337878302,
"loss": 5.0454,
"mean_token_accuracy": 0.19121771901845933,
"num_tokens": 43622842.0,
"step": 25145
},
{
"entropy": 5.469338607788086,
"epoch": 1.9567788368021786,
"grad_norm": 1.28125,
"learning_rate": 0.0004613414018262715,
"loss": 5.1669,
"mean_token_accuracy": 0.1766262874007225,
"num_tokens": 43631535.0,
"step": 25150
},
{
"entropy": 5.523100090026856,
"epoch": 1.9571678661738963,
"grad_norm": 1.2578125,
"learning_rate": 0.0004613258670372786,
"loss": 5.1484,
"mean_token_accuracy": 0.18719781786203385,
"num_tokens": 43640197.0,
"step": 25155
},
{
"entropy": 5.400858354568482,
"epoch": 1.9575568955456137,
"grad_norm": 1.1484375,
"learning_rate": 0.0004613103294210873,
"loss": 5.0648,
"mean_token_accuracy": 0.19230582416057587,
"num_tokens": 43648685.0,
"step": 25160
},
{
"entropy": 5.36841516494751,
"epoch": 1.9579459249173312,
"grad_norm": 1.296875,
"learning_rate": 0.00046129478897793323,
"loss": 5.1041,
"mean_token_accuracy": 0.19057226479053496,
"num_tokens": 43657526.0,
"step": 25165
},
{
"entropy": 5.493056917190552,
"epoch": 1.958334954289049,
"grad_norm": 1.1484375,
"learning_rate": 0.00046127924570805236,
"loss": 5.1254,
"mean_token_accuracy": 0.1918218567967415,
"num_tokens": 43666119.0,
"step": 25170
},
{
"entropy": 5.520423364639282,
"epoch": 1.9587239836607664,
"grad_norm": 1.1953125,
"learning_rate": 0.0004612636996116803,
"loss": 5.128,
"mean_token_accuracy": 0.17722194343805314,
"num_tokens": 43674634.0,
"step": 25175
},
{
"entropy": 5.330378150939941,
"epoch": 1.9591130130324839,
"grad_norm": 1.21875,
"learning_rate": 0.0004612481506890532,
"loss": 5.0382,
"mean_token_accuracy": 0.19518170058727263,
"num_tokens": 43683329.0,
"step": 25180
},
{
"entropy": 5.41314206123352,
"epoch": 1.9595020424042016,
"grad_norm": 1.2734375,
"learning_rate": 0.00046123259894040677,
"loss": 5.0846,
"mean_token_accuracy": 0.18784303367137908,
"num_tokens": 43692598.0,
"step": 25185
},
{
"entropy": 5.397613859176635,
"epoch": 1.959891071775919,
"grad_norm": 1.40625,
"learning_rate": 0.000461217044365977,
"loss": 5.0639,
"mean_token_accuracy": 0.1877152994275093,
"num_tokens": 43702260.0,
"step": 25190
},
{
"entropy": 5.517280912399292,
"epoch": 1.9602801011476365,
"grad_norm": 1.203125,
"learning_rate": 0.0004612014869660002,
"loss": 5.1559,
"mean_token_accuracy": 0.1864241451025009,
"num_tokens": 43710003.0,
"step": 25195
},
{
"entropy": 5.471633672714233,
"epoch": 1.9606691305193542,
"grad_norm": 1.4140625,
"learning_rate": 0.00046118592674071197,
"loss": 5.1112,
"mean_token_accuracy": 0.19072562456130981,
"num_tokens": 43718687.0,
"step": 25200
},
{
"entropy": 5.352226400375367,
"epoch": 1.961058159891072,
"grad_norm": 1.2890625,
"learning_rate": 0.0004611703636903488,
"loss": 5.0076,
"mean_token_accuracy": 0.2013494849205017,
"num_tokens": 43727051.0,
"step": 25205
},
{
"entropy": 5.389390325546264,
"epoch": 1.9614471892627894,
"grad_norm": 1.3046875,
"learning_rate": 0.0004611547978151466,
"loss": 5.0564,
"mean_token_accuracy": 0.1958160400390625,
"num_tokens": 43735572.0,
"step": 25210
},
{
"entropy": 5.435591125488282,
"epoch": 1.9618362186345069,
"grad_norm": 1.4375,
"learning_rate": 0.00046113922911534167,
"loss": 5.1175,
"mean_token_accuracy": 0.1872321382164955,
"num_tokens": 43744286.0,
"step": 25215
},
{
"entropy": 5.451939535140991,
"epoch": 1.9622252480062246,
"grad_norm": 1.359375,
"learning_rate": 0.0004611236575911702,
"loss": 5.2256,
"mean_token_accuracy": 0.18280572742223739,
"num_tokens": 43754042.0,
"step": 25220
},
{
"entropy": 5.4101978778839115,
"epoch": 1.962614277377942,
"grad_norm": 1.21875,
"learning_rate": 0.00046110808324286844,
"loss": 5.0037,
"mean_token_accuracy": 0.19491268545389176,
"num_tokens": 43762031.0,
"step": 25225
},
{
"entropy": 5.45263032913208,
"epoch": 1.9630033067496595,
"grad_norm": 1.375,
"learning_rate": 0.00046109250607067275,
"loss": 5.15,
"mean_token_accuracy": 0.18939634114503862,
"num_tokens": 43770546.0,
"step": 25230
},
{
"entropy": 5.440660858154297,
"epoch": 1.9633923361213772,
"grad_norm": 1.1875,
"learning_rate": 0.0004610769260748196,
"loss": 5.1277,
"mean_token_accuracy": 0.18779551088809968,
"num_tokens": 43779918.0,
"step": 25235
},
{
"entropy": 5.47425332069397,
"epoch": 1.9637813654930947,
"grad_norm": 1.21875,
"learning_rate": 0.0004610613432555451,
"loss": 5.1311,
"mean_token_accuracy": 0.1867818519473076,
"num_tokens": 43788425.0,
"step": 25240
},
{
"entropy": 5.451683378219604,
"epoch": 1.9641703948648122,
"grad_norm": 1.2421875,
"learning_rate": 0.00046104575761308597,
"loss": 5.1839,
"mean_token_accuracy": 0.17876069992780685,
"num_tokens": 43797080.0,
"step": 25245
},
{
"entropy": 5.463306188583374,
"epoch": 1.9645594242365298,
"grad_norm": 1.2421875,
"learning_rate": 0.0004610301691476786,
"loss": 5.1258,
"mean_token_accuracy": 0.19060919433832169,
"num_tokens": 43806026.0,
"step": 25250
},
{
"entropy": 5.519296598434448,
"epoch": 1.9649484536082475,
"grad_norm": 1.28125,
"learning_rate": 0.0004610145778595594,
"loss": 5.1368,
"mean_token_accuracy": 0.1911190465092659,
"num_tokens": 43814333.0,
"step": 25255
},
{
"entropy": 5.381476593017578,
"epoch": 1.965337482979965,
"grad_norm": 1.203125,
"learning_rate": 0.0004609989837489651,
"loss": 5.0758,
"mean_token_accuracy": 0.19303134381771087,
"num_tokens": 43823235.0,
"step": 25260
},
{
"entropy": 5.481320333480835,
"epoch": 1.9657265123516825,
"grad_norm": 1.3203125,
"learning_rate": 0.00046098338681613234,
"loss": 5.1549,
"mean_token_accuracy": 0.18497256487607955,
"num_tokens": 43832257.0,
"step": 25265
},
{
"entropy": 5.500158643722534,
"epoch": 1.9661155417234002,
"grad_norm": 1.2890625,
"learning_rate": 0.0004609677870612976,
"loss": 5.0734,
"mean_token_accuracy": 0.1960882678627968,
"num_tokens": 43840359.0,
"step": 25270
},
{
"entropy": 5.384835338592529,
"epoch": 1.9665045710951177,
"grad_norm": 1.2578125,
"learning_rate": 0.0004609521844846978,
"loss": 5.195,
"mean_token_accuracy": 0.18151499927043915,
"num_tokens": 43849374.0,
"step": 25275
},
{
"entropy": 5.4381814956665036,
"epoch": 1.9668936004668351,
"grad_norm": 1.234375,
"learning_rate": 0.0004609365790865695,
"loss": 5.1669,
"mean_token_accuracy": 0.18197781443595887,
"num_tokens": 43857861.0,
"step": 25280
},
{
"entropy": 5.5036993503570555,
"epoch": 1.9672826298385528,
"grad_norm": 1.171875,
"learning_rate": 0.00046092097086714956,
"loss": 5.1842,
"mean_token_accuracy": 0.1843009188771248,
"num_tokens": 43865964.0,
"step": 25285
},
{
"entropy": 5.405485200881958,
"epoch": 1.9676716592102705,
"grad_norm": 1.28125,
"learning_rate": 0.00046090535982667486,
"loss": 5.0809,
"mean_token_accuracy": 0.2000619053840637,
"num_tokens": 43874434.0,
"step": 25290
},
{
"entropy": 5.432703828811645,
"epoch": 1.9680606885819878,
"grad_norm": 1.1640625,
"learning_rate": 0.00046088974596538216,
"loss": 5.1547,
"mean_token_accuracy": 0.18643044233322142,
"num_tokens": 43882691.0,
"step": 25295
},
{
"entropy": 5.539751815795898,
"epoch": 1.9684497179537055,
"grad_norm": 1.1875,
"learning_rate": 0.0004608741292835085,
"loss": 5.1456,
"mean_token_accuracy": 0.18488708585500718,
"num_tokens": 43890589.0,
"step": 25300
},
{
"entropy": 5.4820140361785885,
"epoch": 1.9688387473254232,
"grad_norm": 1.1484375,
"learning_rate": 0.0004608585097812907,
"loss": 5.15,
"mean_token_accuracy": 0.1914763405919075,
"num_tokens": 43898908.0,
"step": 25305
},
{
"entropy": 5.475679779052735,
"epoch": 1.9692277766971407,
"grad_norm": 1.2265625,
"learning_rate": 0.0004608428874589659,
"loss": 5.1729,
"mean_token_accuracy": 0.18248163312673568,
"num_tokens": 43907640.0,
"step": 25310
},
{
"entropy": 5.442950487136841,
"epoch": 1.9696168060688581,
"grad_norm": 1.2578125,
"learning_rate": 0.0004608272623167711,
"loss": 5.0229,
"mean_token_accuracy": 0.19743569195270538,
"num_tokens": 43915757.0,
"step": 25315
},
{
"entropy": 5.512614011764526,
"epoch": 1.9700058354405758,
"grad_norm": 1.4140625,
"learning_rate": 0.00046081163435494335,
"loss": 5.1951,
"mean_token_accuracy": 0.18031853139400483,
"num_tokens": 43924910.0,
"step": 25320
},
{
"entropy": 5.4823578834533695,
"epoch": 1.9703948648122933,
"grad_norm": 1.3125,
"learning_rate": 0.0004607960035737198,
"loss": 5.149,
"mean_token_accuracy": 0.1917443737387657,
"num_tokens": 43933122.0,
"step": 25325
},
{
"entropy": 5.359778976440429,
"epoch": 1.9707838941840108,
"grad_norm": 1.3359375,
"learning_rate": 0.0004607803699733376,
"loss": 5.1102,
"mean_token_accuracy": 0.18960886001586913,
"num_tokens": 43941996.0,
"step": 25330
},
{
"entropy": 5.445741939544678,
"epoch": 1.9711729235557285,
"grad_norm": 1.2421875,
"learning_rate": 0.000460764733554034,
"loss": 5.0606,
"mean_token_accuracy": 0.19529969543218612,
"num_tokens": 43950637.0,
"step": 25335
},
{
"entropy": 5.496492052078247,
"epoch": 1.9715619529274462,
"grad_norm": 1.25,
"learning_rate": 0.00046074909431604623,
"loss": 5.1138,
"mean_token_accuracy": 0.18993473649024964,
"num_tokens": 43959252.0,
"step": 25340
},
{
"entropy": 5.390342950820923,
"epoch": 1.9719509822991634,
"grad_norm": 1.1484375,
"learning_rate": 0.0004607334522596116,
"loss": 5.0954,
"mean_token_accuracy": 0.18358451128005981,
"num_tokens": 43968391.0,
"step": 25345
},
{
"entropy": 5.44939546585083,
"epoch": 1.9723400116708811,
"grad_norm": 1.2734375,
"learning_rate": 0.0004607178073849675,
"loss": 5.0463,
"mean_token_accuracy": 0.19665595889091492,
"num_tokens": 43977066.0,
"step": 25350
},
{
"entropy": 5.506793785095215,
"epoch": 1.9727290410425988,
"grad_norm": 1.3046875,
"learning_rate": 0.0004607021596923512,
"loss": 5.108,
"mean_token_accuracy": 0.19686611443758012,
"num_tokens": 43985072.0,
"step": 25355
},
{
"entropy": 5.5475757122039795,
"epoch": 1.9731180704143163,
"grad_norm": 1.234375,
"learning_rate": 0.0004606865091820003,
"loss": 5.3055,
"mean_token_accuracy": 0.1810056284070015,
"num_tokens": 43993321.0,
"step": 25360
},
{
"entropy": 5.373313093185425,
"epoch": 1.9735070997860338,
"grad_norm": 1.171875,
"learning_rate": 0.0004606708558541521,
"loss": 4.9856,
"mean_token_accuracy": 0.2050961047410965,
"num_tokens": 44002476.0,
"step": 25365
},
{
"entropy": 5.470714950561524,
"epoch": 1.9738961291577515,
"grad_norm": 1.296875,
"learning_rate": 0.0004606551997090442,
"loss": 5.1945,
"mean_token_accuracy": 0.1834375247359276,
"num_tokens": 44011790.0,
"step": 25370
},
{
"entropy": 5.433232164382934,
"epoch": 1.974285158529469,
"grad_norm": 1.3046875,
"learning_rate": 0.0004606395407469141,
"loss": 5.0843,
"mean_token_accuracy": 0.18769994080066682,
"num_tokens": 44021086.0,
"step": 25375
},
{
"entropy": 5.422499084472657,
"epoch": 1.9746741879011864,
"grad_norm": 1.1953125,
"learning_rate": 0.0004606238789679995,
"loss": 5.0545,
"mean_token_accuracy": 0.19469659328460692,
"num_tokens": 44029789.0,
"step": 25380
},
{
"entropy": 5.411042022705078,
"epoch": 1.9750632172729041,
"grad_norm": 1.21875,
"learning_rate": 0.0004606082143725381,
"loss": 5.0905,
"mean_token_accuracy": 0.18292534202337266,
"num_tokens": 44039508.0,
"step": 25385
},
{
"entropy": 5.370553398132325,
"epoch": 1.9754522466446218,
"grad_norm": 1.3125,
"learning_rate": 0.0004605925469607673,
"loss": 5.0832,
"mean_token_accuracy": 0.18990588635206224,
"num_tokens": 44048464.0,
"step": 25390
},
{
"entropy": 5.5631050109863285,
"epoch": 1.975841276016339,
"grad_norm": 1.1328125,
"learning_rate": 0.00046057687673292506,
"loss": 5.1856,
"mean_token_accuracy": 0.18350721150636673,
"num_tokens": 44057613.0,
"step": 25395
},
{
"entropy": 5.415027666091919,
"epoch": 1.9762303053880568,
"grad_norm": 1.328125,
"learning_rate": 0.00046056120368924907,
"loss": 4.9872,
"mean_token_accuracy": 0.1952361837029457,
"num_tokens": 44066334.0,
"step": 25400
},
{
"entropy": 5.44974799156189,
"epoch": 1.9766193347597745,
"grad_norm": 1.390625,
"learning_rate": 0.0004605455278299772,
"loss": 5.2443,
"mean_token_accuracy": 0.1830928608775139,
"num_tokens": 44076355.0,
"step": 25405
},
{
"entropy": 5.491162300109863,
"epoch": 1.977008364131492,
"grad_norm": 1.21875,
"learning_rate": 0.0004605298491553472,
"loss": 5.1714,
"mean_token_accuracy": 0.1792429804801941,
"num_tokens": 44084445.0,
"step": 25410
},
{
"entropy": 5.488689279556274,
"epoch": 1.9773973935032094,
"grad_norm": 1.1796875,
"learning_rate": 0.0004605141676655971,
"loss": 5.1127,
"mean_token_accuracy": 0.18875147998332978,
"num_tokens": 44093711.0,
"step": 25415
},
{
"entropy": 5.433429479598999,
"epoch": 1.9777864228749271,
"grad_norm": 1.171875,
"learning_rate": 0.00046049848336096485,
"loss": 5.0927,
"mean_token_accuracy": 0.18281544595956803,
"num_tokens": 44102647.0,
"step": 25420
},
{
"entropy": 5.3878984451293945,
"epoch": 1.9781754522466446,
"grad_norm": 1.1953125,
"learning_rate": 0.0004604827962416883,
"loss": 5.0329,
"mean_token_accuracy": 0.19317934513092042,
"num_tokens": 44110661.0,
"step": 25425
},
{
"entropy": 5.508700180053711,
"epoch": 1.978564481618362,
"grad_norm": 1.2890625,
"learning_rate": 0.0004604671063080055,
"loss": 5.2792,
"mean_token_accuracy": 0.17330573946237565,
"num_tokens": 44119441.0,
"step": 25430
},
{
"entropy": 5.433810186386109,
"epoch": 1.9789535109900798,
"grad_norm": 1.21875,
"learning_rate": 0.0004604514135601546,
"loss": 5.0626,
"mean_token_accuracy": 0.19045995622873307,
"num_tokens": 44127774.0,
"step": 25435
},
{
"entropy": 5.4455413818359375,
"epoch": 1.9793425403617975,
"grad_norm": 1.21875,
"learning_rate": 0.0004604357179983736,
"loss": 5.2971,
"mean_token_accuracy": 0.1733509123325348,
"num_tokens": 44137075.0,
"step": 25440
},
{
"entropy": 5.3704736709594725,
"epoch": 1.9797315697335147,
"grad_norm": 1.1328125,
"learning_rate": 0.0004604200196229009,
"loss": 5.0158,
"mean_token_accuracy": 0.19197784811258317,
"num_tokens": 44145647.0,
"step": 25445
},
{
"entropy": 5.3886284828186035,
"epoch": 1.9801205991052324,
"grad_norm": 1.2890625,
"learning_rate": 0.0004604043184339744,
"loss": 4.9887,
"mean_token_accuracy": 0.1958225041627884,
"num_tokens": 44154267.0,
"step": 25450
},
{
"entropy": 5.430800485610962,
"epoch": 1.9805096284769501,
"grad_norm": 1.1875,
"learning_rate": 0.0004603886144318325,
"loss": 5.1541,
"mean_token_accuracy": 0.18356830924749373,
"num_tokens": 44162532.0,
"step": 25455
},
{
"entropy": 5.479406118392944,
"epoch": 1.9808986578486676,
"grad_norm": 1.2734375,
"learning_rate": 0.00046037290761671346,
"loss": 5.13,
"mean_token_accuracy": 0.19030331671237946,
"num_tokens": 44171218.0,
"step": 25460
},
{
"entropy": 5.421629858016968,
"epoch": 1.981287687220385,
"grad_norm": 1.203125,
"learning_rate": 0.0004603571979888556,
"loss": 5.1807,
"mean_token_accuracy": 0.18650459349155427,
"num_tokens": 44180189.0,
"step": 25465
},
{
"entropy": 5.431524801254272,
"epoch": 1.9816767165921028,
"grad_norm": 1.2421875,
"learning_rate": 0.0004603414855484973,
"loss": 5.0657,
"mean_token_accuracy": 0.1902753919363022,
"num_tokens": 44189048.0,
"step": 25470
},
{
"entropy": 5.424501371383667,
"epoch": 1.9820657459638202,
"grad_norm": 1.2265625,
"learning_rate": 0.000460325770295877,
"loss": 5.1159,
"mean_token_accuracy": 0.1858877032995224,
"num_tokens": 44197995.0,
"step": 25475
},
{
"entropy": 5.517265796661377,
"epoch": 1.9824547753355377,
"grad_norm": 1.203125,
"learning_rate": 0.00046031005223123297,
"loss": 5.2409,
"mean_token_accuracy": 0.17799139767885208,
"num_tokens": 44207042.0,
"step": 25480
},
{
"entropy": 5.4231315612792965,
"epoch": 1.9828438047072554,
"grad_norm": 1.3515625,
"learning_rate": 0.000460294331354804,
"loss": 5.0265,
"mean_token_accuracy": 0.19838292747735978,
"num_tokens": 44214678.0,
"step": 25485
},
{
"entropy": 5.410763597488403,
"epoch": 1.983232834078973,
"grad_norm": 1.1484375,
"learning_rate": 0.0004602786076668283,
"loss": 5.0587,
"mean_token_accuracy": 0.18839234113693237,
"num_tokens": 44223752.0,
"step": 25490
},
{
"entropy": 5.476414918899536,
"epoch": 1.9836218634506906,
"grad_norm": 1.2578125,
"learning_rate": 0.00046026288116754477,
"loss": 5.1499,
"mean_token_accuracy": 0.18430302441120147,
"num_tokens": 44232109.0,
"step": 25495
},
{
"entropy": 5.517906522750854,
"epoch": 1.984010892822408,
"grad_norm": 1.25,
"learning_rate": 0.0004602471518571919,
"loss": 5.2429,
"mean_token_accuracy": 0.1768329322338104,
"num_tokens": 44239957.0,
"step": 25500
},
{
"entropy": 5.4962372303009035,
"epoch": 1.9843999221941258,
"grad_norm": 1.2734375,
"learning_rate": 0.0004602314197360083,
"loss": 5.121,
"mean_token_accuracy": 0.18918487429618835,
"num_tokens": 44248582.0,
"step": 25505
},
{
"entropy": 5.48524284362793,
"epoch": 1.9847889515658432,
"grad_norm": 1.1875,
"learning_rate": 0.0004602156848042328,
"loss": 5.1109,
"mean_token_accuracy": 0.18720681965351105,
"num_tokens": 44256711.0,
"step": 25510
},
{
"entropy": 5.4499176979064945,
"epoch": 1.9851779809375607,
"grad_norm": 1.3046875,
"learning_rate": 0.000460199947062104,
"loss": 5.1022,
"mean_token_accuracy": 0.19037640243768691,
"num_tokens": 44265140.0,
"step": 25515
},
{
"entropy": 5.506365013122559,
"epoch": 1.9855670103092784,
"grad_norm": 1.5234375,
"learning_rate": 0.00046018420650986074,
"loss": 5.1081,
"mean_token_accuracy": 0.18395187258720397,
"num_tokens": 44273560.0,
"step": 25520
},
{
"entropy": 5.359471702575684,
"epoch": 1.9859560396809959,
"grad_norm": 1.328125,
"learning_rate": 0.000460168463147742,
"loss": 5.0214,
"mean_token_accuracy": 0.19556907564401627,
"num_tokens": 44282155.0,
"step": 25525
},
{
"entropy": 5.412130880355835,
"epoch": 1.9863450690527134,
"grad_norm": 1.1640625,
"learning_rate": 0.0004601527169759865,
"loss": 5.0302,
"mean_token_accuracy": 0.19116953313350676,
"num_tokens": 44291237.0,
"step": 25530
},
{
"entropy": 5.389124345779419,
"epoch": 1.986734098424431,
"grad_norm": 1.140625,
"learning_rate": 0.0004601369679948333,
"loss": 5.0742,
"mean_token_accuracy": 0.19194547832012177,
"num_tokens": 44299886.0,
"step": 25535
},
{
"entropy": 5.439286518096924,
"epoch": 1.9871231277961487,
"grad_norm": 1.2578125,
"learning_rate": 0.00046012121620452127,
"loss": 5.2182,
"mean_token_accuracy": 0.18720661401748656,
"num_tokens": 44308247.0,
"step": 25540
},
{
"entropy": 5.505471277236938,
"epoch": 1.9875121571678662,
"grad_norm": 1.171875,
"learning_rate": 0.0004601054616052893,
"loss": 5.0761,
"mean_token_accuracy": 0.18957599848508835,
"num_tokens": 44316301.0,
"step": 25545
},
{
"entropy": 5.54315071105957,
"epoch": 1.9879011865395837,
"grad_norm": 1.1953125,
"learning_rate": 0.00046008970419737674,
"loss": 5.2126,
"mean_token_accuracy": 0.17113337516784669,
"num_tokens": 44324758.0,
"step": 25550
},
{
"entropy": 5.503973531723022,
"epoch": 1.9882902159113014,
"grad_norm": 1.3125,
"learning_rate": 0.0004600739439810225,
"loss": 5.2183,
"mean_token_accuracy": 0.1754635363817215,
"num_tokens": 44333139.0,
"step": 25555
},
{
"entropy": 5.532423734664917,
"epoch": 1.9886792452830189,
"grad_norm": 1.265625,
"learning_rate": 0.00046005818095646564,
"loss": 5.1616,
"mean_token_accuracy": 0.18649605065584182,
"num_tokens": 44341992.0,
"step": 25560
},
{
"entropy": 5.4218133926391605,
"epoch": 1.9890682746547363,
"grad_norm": 1.2734375,
"learning_rate": 0.00046004241512394544,
"loss": 5.1299,
"mean_token_accuracy": 0.18494678735733033,
"num_tokens": 44350947.0,
"step": 25565
},
{
"entropy": 5.424895143508911,
"epoch": 1.989457304026454,
"grad_norm": 1.2265625,
"learning_rate": 0.0004600266464837012,
"loss": 5.0706,
"mean_token_accuracy": 0.19498218595981598,
"num_tokens": 44358934.0,
"step": 25570
},
{
"entropy": 5.412136125564575,
"epoch": 1.9898463333981715,
"grad_norm": 1.171875,
"learning_rate": 0.0004600108750359721,
"loss": 5.035,
"mean_token_accuracy": 0.19213857352733613,
"num_tokens": 44367117.0,
"step": 25575
},
{
"entropy": 5.39286847114563,
"epoch": 1.990235362769889,
"grad_norm": 1.140625,
"learning_rate": 0.00045999510078099736,
"loss": 5.1001,
"mean_token_accuracy": 0.1803663566708565,
"num_tokens": 44375591.0,
"step": 25580
},
{
"entropy": 5.392205619812012,
"epoch": 1.9906243921416067,
"grad_norm": 1.203125,
"learning_rate": 0.00045997932371901645,
"loss": 5.0087,
"mean_token_accuracy": 0.19347520172595978,
"num_tokens": 44384602.0,
"step": 25585
},
{
"entropy": 5.357974100112915,
"epoch": 1.9910134215133244,
"grad_norm": 1.25,
"learning_rate": 0.0004599635438502687,
"loss": 5.0048,
"mean_token_accuracy": 0.1982121527194977,
"num_tokens": 44393451.0,
"step": 25590
},
{
"entropy": 5.415236520767212,
"epoch": 1.9914024508850419,
"grad_norm": 1.171875,
"learning_rate": 0.00045994776117499363,
"loss": 5.0412,
"mean_token_accuracy": 0.19221121072769165,
"num_tokens": 44401638.0,
"step": 25595
},
{
"entropy": 5.4471080780029295,
"epoch": 1.9917914802567593,
"grad_norm": 1.234375,
"learning_rate": 0.00045993197569343063,
"loss": 5.0799,
"mean_token_accuracy": 0.1857247158885002,
"num_tokens": 44410337.0,
"step": 25600
},
{
"entropy": 5.44191575050354,
"epoch": 1.992180509628477,
"grad_norm": 1.2421875,
"learning_rate": 0.00045991618740581926,
"loss": 5.1348,
"mean_token_accuracy": 0.18859644532203673,
"num_tokens": 44418178.0,
"step": 25605
},
{
"entropy": 5.4825092315673825,
"epoch": 1.9925695390001945,
"grad_norm": 1.2109375,
"learning_rate": 0.0004599003963123991,
"loss": 5.1655,
"mean_token_accuracy": 0.17812655866146088,
"num_tokens": 44427056.0,
"step": 25610
},
{
"entropy": 5.527002668380737,
"epoch": 1.992958568371912,
"grad_norm": 1.203125,
"learning_rate": 0.00045988460241340966,
"loss": 5.1052,
"mean_token_accuracy": 0.1891911432147026,
"num_tokens": 44434687.0,
"step": 25615
},
{
"entropy": 5.426431560516358,
"epoch": 1.9933475977436297,
"grad_norm": 1.265625,
"learning_rate": 0.00045986880570909075,
"loss": 5.0853,
"mean_token_accuracy": 0.19251642227172852,
"num_tokens": 44442763.0,
"step": 25620
},
{
"entropy": 5.302097034454346,
"epoch": 1.9937366271153472,
"grad_norm": 1.203125,
"learning_rate": 0.00045985300619968186,
"loss": 4.9971,
"mean_token_accuracy": 0.19307748675346376,
"num_tokens": 44451850.0,
"step": 25625
},
{
"entropy": 5.344841337203979,
"epoch": 1.9941256564870646,
"grad_norm": 1.1875,
"learning_rate": 0.00045983720388542286,
"loss": 5.0317,
"mean_token_accuracy": 0.19620566964149475,
"num_tokens": 44459915.0,
"step": 25630
},
{
"entropy": 5.335512781143189,
"epoch": 1.9945146858587823,
"grad_norm": 1.171875,
"learning_rate": 0.0004598213987665535,
"loss": 5.1088,
"mean_token_accuracy": 0.18710825741291046,
"num_tokens": 44469252.0,
"step": 25635
},
{
"entropy": 5.537695980072021,
"epoch": 1.9949037152305,
"grad_norm": 1.1953125,
"learning_rate": 0.00045980559084331354,
"loss": 5.1978,
"mean_token_accuracy": 0.18232716172933577,
"num_tokens": 44477748.0,
"step": 25640
},
{
"entropy": 5.439034366607666,
"epoch": 1.9952927446022175,
"grad_norm": 1.1015625,
"learning_rate": 0.000459789780115943,
"loss": 5.0972,
"mean_token_accuracy": 0.18603037297725677,
"num_tokens": 44485796.0,
"step": 25645
},
{
"entropy": 5.363985443115235,
"epoch": 1.995681773973935,
"grad_norm": 1.2578125,
"learning_rate": 0.00045977396658468156,
"loss": 5.1167,
"mean_token_accuracy": 0.18398183733224868,
"num_tokens": 44494604.0,
"step": 25650
},
{
"entropy": 5.3774957180023195,
"epoch": 1.9960708033456527,
"grad_norm": 1.15625,
"learning_rate": 0.0004597581502497693,
"loss": 5.0954,
"mean_token_accuracy": 0.18464464992284774,
"num_tokens": 44503728.0,
"step": 25655
},
{
"entropy": 5.46725492477417,
"epoch": 1.9964598327173702,
"grad_norm": 1.1328125,
"learning_rate": 0.0004597423311114462,
"loss": 5.0732,
"mean_token_accuracy": 0.19545128792524338,
"num_tokens": 44512201.0,
"step": 25660
},
{
"entropy": 5.493855571746826,
"epoch": 1.9968488620890876,
"grad_norm": 1.1875,
"learning_rate": 0.0004597265091699522,
"loss": 5.1178,
"mean_token_accuracy": 0.18901610374450684,
"num_tokens": 44520122.0,
"step": 25665
},
{
"entropy": 5.373078966140747,
"epoch": 1.9972378914608053,
"grad_norm": 1.2578125,
"learning_rate": 0.0004597106844255276,
"loss": 5.0875,
"mean_token_accuracy": 0.19146127849817277,
"num_tokens": 44528928.0,
"step": 25670
},
{
"entropy": 5.48609561920166,
"epoch": 1.9976269208325228,
"grad_norm": 1.203125,
"learning_rate": 0.00045969485687841227,
"loss": 5.2461,
"mean_token_accuracy": 0.18020720034837723,
"num_tokens": 44537330.0,
"step": 25675
},
{
"entropy": 5.50549840927124,
"epoch": 1.9980159502042403,
"grad_norm": 1.2890625,
"learning_rate": 0.00045967902652884645,
"loss": 5.1043,
"mean_token_accuracy": 0.18896862268447875,
"num_tokens": 44545748.0,
"step": 25680
},
{
"entropy": 5.465701961517334,
"epoch": 1.998404979575958,
"grad_norm": 1.2578125,
"learning_rate": 0.0004596631933770704,
"loss": 5.2182,
"mean_token_accuracy": 0.18674880713224412,
"num_tokens": 44554562.0,
"step": 25685
},
{
"entropy": 5.440627384185791,
"epoch": 1.9987940089476757,
"grad_norm": 1.2109375,
"learning_rate": 0.00045964735742332427,
"loss": 5.0667,
"mean_token_accuracy": 0.189968740940094,
"num_tokens": 44563544.0,
"step": 25690
},
{
"entropy": 5.4541370391845705,
"epoch": 1.9991830383193931,
"grad_norm": 1.2109375,
"learning_rate": 0.0004596315186678484,
"loss": 5.1188,
"mean_token_accuracy": 0.1874745026230812,
"num_tokens": 44571179.0,
"step": 25695
},
{
"entropy": 5.420654773712158,
"epoch": 1.9995720676911106,
"grad_norm": 1.2265625,
"learning_rate": 0.00045961567711088307,
"loss": 5.1589,
"mean_token_accuracy": 0.18598103076219558,
"num_tokens": 44580237.0,
"step": 25700
},
{
"entropy": 5.4172276020050045,
"epoch": 1.9999610970628283,
"grad_norm": 1.171875,
"learning_rate": 0.00045959983275266873,
"loss": 5.1123,
"mean_token_accuracy": 0.18862324208021164,
"num_tokens": 44588362.0,
"step": 25705
},
{
"entropy": 5.421308517456055,
"epoch": 2.000311223497374,
"grad_norm": 1.1953125,
"learning_rate": 0.00045958398559344573,
"loss": 5.033,
"mean_token_accuracy": 0.19984576437208387,
"num_tokens": 44596037.0,
"step": 25710
},
{
"entropy": 5.46260437965393,
"epoch": 2.0007002528690916,
"grad_norm": 1.2578125,
"learning_rate": 0.00045956813563345454,
"loss": 5.0812,
"mean_token_accuracy": 0.19407282024621964,
"num_tokens": 44604913.0,
"step": 25715
},
{
"entropy": 5.510783576965332,
"epoch": 2.0010892822408093,
"grad_norm": 1.2109375,
"learning_rate": 0.0004595522828729357,
"loss": 5.127,
"mean_token_accuracy": 0.18896977305412294,
"num_tokens": 44613523.0,
"step": 25720
},
{
"entropy": 5.381552791595459,
"epoch": 2.0014783116125265,
"grad_norm": 1.2265625,
"learning_rate": 0.0004595364273121296,
"loss": 4.9153,
"mean_token_accuracy": 0.19704417884349823,
"num_tokens": 44622259.0,
"step": 25725
},
{
"entropy": 5.351221990585327,
"epoch": 2.0018673409842442,
"grad_norm": 1.234375,
"learning_rate": 0.0004595205689512771,
"loss": 4.9784,
"mean_token_accuracy": 0.19724734574556352,
"num_tokens": 44630793.0,
"step": 25730
},
{
"entropy": 5.454925060272217,
"epoch": 2.002256370355962,
"grad_norm": 1.2890625,
"learning_rate": 0.00045950470779061855,
"loss": 5.0341,
"mean_token_accuracy": 0.19047658741474152,
"num_tokens": 44638986.0,
"step": 25735
},
{
"entropy": 5.471593952178955,
"epoch": 2.0026453997276796,
"grad_norm": 1.296875,
"learning_rate": 0.00045948884383039475,
"loss": 5.0793,
"mean_token_accuracy": 0.1854041561484337,
"num_tokens": 44647491.0,
"step": 25740
},
{
"entropy": 5.359787368774414,
"epoch": 2.003034429099397,
"grad_norm": 1.296875,
"learning_rate": 0.00045947297707084637,
"loss": 4.9835,
"mean_token_accuracy": 0.19416986852884294,
"num_tokens": 44655431.0,
"step": 25745
},
{
"entropy": 5.386890029907226,
"epoch": 2.0034234584711146,
"grad_norm": 1.1328125,
"learning_rate": 0.0004594571075122142,
"loss": 5.0224,
"mean_token_accuracy": 0.19539991468191148,
"num_tokens": 44664398.0,
"step": 25750
},
{
"entropy": 5.458368396759033,
"epoch": 2.0038124878428323,
"grad_norm": 1.1953125,
"learning_rate": 0.00045944123515473905,
"loss": 5.0062,
"mean_token_accuracy": 0.19371364414691924,
"num_tokens": 44673372.0,
"step": 25755
},
{
"entropy": 5.349647903442383,
"epoch": 2.0042015172145495,
"grad_norm": 1.2109375,
"learning_rate": 0.00045942535999866175,
"loss": 4.9436,
"mean_token_accuracy": 0.1981011673808098,
"num_tokens": 44681736.0,
"step": 25760
},
{
"entropy": 5.385314035415649,
"epoch": 2.0045905465862672,
"grad_norm": 1.4609375,
"learning_rate": 0.0004594094820442231,
"loss": 5.0796,
"mean_token_accuracy": 0.189360573887825,
"num_tokens": 44691858.0,
"step": 25765
},
{
"entropy": 5.511190605163574,
"epoch": 2.004979575957985,
"grad_norm": 1.421875,
"learning_rate": 0.000459393601291664,
"loss": 5.1287,
"mean_token_accuracy": 0.18726930320262908,
"num_tokens": 44701002.0,
"step": 25770
},
{
"entropy": 5.40196681022644,
"epoch": 2.005368605329702,
"grad_norm": 1.1875,
"learning_rate": 0.00045937771774122563,
"loss": 5.0016,
"mean_token_accuracy": 0.1971822753548622,
"num_tokens": 44709158.0,
"step": 25775
},
{
"entropy": 5.4094174861907955,
"epoch": 2.00575763470142,
"grad_norm": 1.2421875,
"learning_rate": 0.0004593618313931488,
"loss": 5.0197,
"mean_token_accuracy": 0.19358438700437547,
"num_tokens": 44717495.0,
"step": 25780
},
{
"entropy": 5.408371639251709,
"epoch": 2.0061466640731376,
"grad_norm": 1.2734375,
"learning_rate": 0.00045934594224767463,
"loss": 5.0056,
"mean_token_accuracy": 0.19387351870536804,
"num_tokens": 44726040.0,
"step": 25785
},
{
"entropy": 5.395246362686157,
"epoch": 2.0065356934448553,
"grad_norm": 1.25,
"learning_rate": 0.00045933005030504424,
"loss": 5.0648,
"mean_token_accuracy": 0.18496117293834685,
"num_tokens": 44735098.0,
"step": 25790
},
{
"entropy": 5.418350553512573,
"epoch": 2.0069247228165725,
"grad_norm": 1.21875,
"learning_rate": 0.00045931415556549863,
"loss": 5.0285,
"mean_token_accuracy": 0.1921205297112465,
"num_tokens": 44743764.0,
"step": 25795
},
{
"entropy": 5.423763847351074,
"epoch": 2.0073137521882902,
"grad_norm": 1.2109375,
"learning_rate": 0.0004592982580292792,
"loss": 4.9633,
"mean_token_accuracy": 0.1936950296163559,
"num_tokens": 44751554.0,
"step": 25800
},
{
"entropy": 5.491714811325073,
"epoch": 2.007702781560008,
"grad_norm": 1.15625,
"learning_rate": 0.00045928235769662697,
"loss": 5.1369,
"mean_token_accuracy": 0.18151630312204362,
"num_tokens": 44760158.0,
"step": 25805
},
{
"entropy": 5.384233379364014,
"epoch": 2.008091810931725,
"grad_norm": 1.140625,
"learning_rate": 0.00045926645456778327,
"loss": 5.012,
"mean_token_accuracy": 0.19640197604894638,
"num_tokens": 44769209.0,
"step": 25810
},
{
"entropy": 5.396884202957153,
"epoch": 2.008480840303443,
"grad_norm": 1.2734375,
"learning_rate": 0.00045925054864298946,
"loss": 5.0525,
"mean_token_accuracy": 0.19377089589834212,
"num_tokens": 44777991.0,
"step": 25815
},
{
"entropy": 5.4572313785552975,
"epoch": 2.0088698696751606,
"grad_norm": 1.1640625,
"learning_rate": 0.00045923463992248684,
"loss": 5.0664,
"mean_token_accuracy": 0.18628352731466294,
"num_tokens": 44786492.0,
"step": 25820
},
{
"entropy": 5.449353933334351,
"epoch": 2.009258899046878,
"grad_norm": 1.171875,
"learning_rate": 0.00045921872840651675,
"loss": 5.1258,
"mean_token_accuracy": 0.188339501619339,
"num_tokens": 44795021.0,
"step": 25825
},
{
"entropy": 5.424725532531738,
"epoch": 2.0096479284185955,
"grad_norm": 1.1875,
"learning_rate": 0.00045920281409532064,
"loss": 4.9959,
"mean_token_accuracy": 0.1935458779335022,
"num_tokens": 44803267.0,
"step": 25830
},
{
"entropy": 5.472720289230347,
"epoch": 2.010036957790313,
"grad_norm": 1.296875,
"learning_rate": 0.0004591868969891401,
"loss": 5.1146,
"mean_token_accuracy": 0.18647825121879577,
"num_tokens": 44811954.0,
"step": 25835
},
{
"entropy": 5.406618118286133,
"epoch": 2.010425987162031,
"grad_norm": 1.265625,
"learning_rate": 0.0004591709770882165,
"loss": 4.948,
"mean_token_accuracy": 0.1979189246892929,
"num_tokens": 44820748.0,
"step": 25840
},
{
"entropy": 5.424556732177734,
"epoch": 2.010815016533748,
"grad_norm": 1.3125,
"learning_rate": 0.0004591550543927915,
"loss": 5.1599,
"mean_token_accuracy": 0.18526611477136612,
"num_tokens": 44829400.0,
"step": 25845
},
{
"entropy": 5.474016380310059,
"epoch": 2.011204045905466,
"grad_norm": 1.296875,
"learning_rate": 0.0004591391289031067,
"loss": 5.0657,
"mean_token_accuracy": 0.1941610261797905,
"num_tokens": 44838663.0,
"step": 25850
},
{
"entropy": 5.418667936325074,
"epoch": 2.0115930752771836,
"grad_norm": 1.2578125,
"learning_rate": 0.0004591232006194036,
"loss": 4.9601,
"mean_token_accuracy": 0.19734057188034057,
"num_tokens": 44847365.0,
"step": 25855
},
{
"entropy": 5.437780237197876,
"epoch": 2.011982104648901,
"grad_norm": 1.2421875,
"learning_rate": 0.00045910726954192404,
"loss": 5.0534,
"mean_token_accuracy": 0.19181837439537047,
"num_tokens": 44856093.0,
"step": 25860
},
{
"entropy": 5.380312919616699,
"epoch": 2.0123711340206185,
"grad_norm": 1.1875,
"learning_rate": 0.0004590913356709097,
"loss": 5.0192,
"mean_token_accuracy": 0.19159596115350724,
"num_tokens": 44865116.0,
"step": 25865
},
{
"entropy": 5.415362691879272,
"epoch": 2.012760163392336,
"grad_norm": 1.203125,
"learning_rate": 0.00045907539900660237,
"loss": 5.0871,
"mean_token_accuracy": 0.18402304053306578,
"num_tokens": 44874037.0,
"step": 25870
},
{
"entropy": 5.3707544803619385,
"epoch": 2.013149192764054,
"grad_norm": 1.3359375,
"learning_rate": 0.0004590594595492438,
"loss": 4.9168,
"mean_token_accuracy": 0.19865640997886658,
"num_tokens": 44882603.0,
"step": 25875
},
{
"entropy": 5.41123857498169,
"epoch": 2.013538222135771,
"grad_norm": 1.15625,
"learning_rate": 0.00045904351729907593,
"loss": 4.9732,
"mean_token_accuracy": 0.19583404213190078,
"num_tokens": 44890645.0,
"step": 25880
},
{
"entropy": 5.441631221771241,
"epoch": 2.013927251507489,
"grad_norm": 1.3046875,
"learning_rate": 0.00045902757225634066,
"loss": 5.0894,
"mean_token_accuracy": 0.19437866657972336,
"num_tokens": 44898972.0,
"step": 25885
},
{
"entropy": 5.371956157684326,
"epoch": 2.0143162808792066,
"grad_norm": 1.2578125,
"learning_rate": 0.0004590116244212799,
"loss": 5.0833,
"mean_token_accuracy": 0.19374625086784364,
"num_tokens": 44907427.0,
"step": 25890
},
{
"entropy": 5.485247468948364,
"epoch": 2.014705310250924,
"grad_norm": 1.25,
"learning_rate": 0.0004589956737941355,
"loss": 5.127,
"mean_token_accuracy": 0.191416372358799,
"num_tokens": 44916465.0,
"step": 25895
},
{
"entropy": 5.45973801612854,
"epoch": 2.0150943396226415,
"grad_norm": 1.1484375,
"learning_rate": 0.0004589797203751497,
"loss": 5.0138,
"mean_token_accuracy": 0.1982505977153778,
"num_tokens": 44925102.0,
"step": 25900
},
{
"entropy": 5.347501802444458,
"epoch": 2.015483368994359,
"grad_norm": 1.265625,
"learning_rate": 0.0004589637641645645,
"loss": 4.9967,
"mean_token_accuracy": 0.19548143148422242,
"num_tokens": 44933061.0,
"step": 25905
},
{
"entropy": 5.3559760570526125,
"epoch": 2.0158723983660765,
"grad_norm": 1.1953125,
"learning_rate": 0.00045894780516262193,
"loss": 5.0354,
"mean_token_accuracy": 0.19443740099668502,
"num_tokens": 44942342.0,
"step": 25910
},
{
"entropy": 5.466866493225098,
"epoch": 2.016261427737794,
"grad_norm": 1.234375,
"learning_rate": 0.0004589318433695642,
"loss": 5.0322,
"mean_token_accuracy": 0.19949530810117722,
"num_tokens": 44951163.0,
"step": 25915
},
{
"entropy": 5.368049097061157,
"epoch": 2.016650457109512,
"grad_norm": 1.203125,
"learning_rate": 0.0004589158787856336,
"loss": 5.0257,
"mean_token_accuracy": 0.19454297721385955,
"num_tokens": 44960208.0,
"step": 25920
},
{
"entropy": 5.382708978652954,
"epoch": 2.0170394864812295,
"grad_norm": 1.2734375,
"learning_rate": 0.0004588999114110721,
"loss": 4.9065,
"mean_token_accuracy": 0.1986604943871498,
"num_tokens": 44969051.0,
"step": 25925
},
{
"entropy": 5.382196950912475,
"epoch": 2.017428515852947,
"grad_norm": 1.3046875,
"learning_rate": 0.0004588839412461223,
"loss": 4.9693,
"mean_token_accuracy": 0.20577432215213776,
"num_tokens": 44977980.0,
"step": 25930
},
{
"entropy": 5.367998123168945,
"epoch": 2.0178175452246645,
"grad_norm": 1.234375,
"learning_rate": 0.0004588679682910264,
"loss": 5.024,
"mean_token_accuracy": 0.1836980476975441,
"num_tokens": 44986520.0,
"step": 25935
},
{
"entropy": 5.406614685058594,
"epoch": 2.018206574596382,
"grad_norm": 1.3828125,
"learning_rate": 0.0004588519925460266,
"loss": 5.0478,
"mean_token_accuracy": 0.19249131828546523,
"num_tokens": 44995011.0,
"step": 25940
},
{
"entropy": 5.3217706203460695,
"epoch": 2.0185956039680995,
"grad_norm": 1.1953125,
"learning_rate": 0.0004588360140113655,
"loss": 5.0255,
"mean_token_accuracy": 0.19762341380119325,
"num_tokens": 45004611.0,
"step": 25945
},
{
"entropy": 5.484057426452637,
"epoch": 2.018984633339817,
"grad_norm": 1.265625,
"learning_rate": 0.0004588200326872855,
"loss": 5.0625,
"mean_token_accuracy": 0.1855209141969681,
"num_tokens": 45013832.0,
"step": 25950
},
{
"entropy": 5.450709056854248,
"epoch": 2.019373662711535,
"grad_norm": 1.1640625,
"learning_rate": 0.0004588040485740291,
"loss": 4.9977,
"mean_token_accuracy": 0.19138199090957642,
"num_tokens": 45022751.0,
"step": 25955
},
{
"entropy": 5.465739631652832,
"epoch": 2.019762692083252,
"grad_norm": 1.453125,
"learning_rate": 0.0004587880616718387,
"loss": 5.0727,
"mean_token_accuracy": 0.1880890741944313,
"num_tokens": 45030826.0,
"step": 25960
},
{
"entropy": 5.417150211334229,
"epoch": 2.02015172145497,
"grad_norm": 1.34375,
"learning_rate": 0.0004587720719809572,
"loss": 5.0511,
"mean_token_accuracy": 0.19175425171852112,
"num_tokens": 45039625.0,
"step": 25965
},
{
"entropy": 5.368811082839966,
"epoch": 2.0205407508266875,
"grad_norm": 1.1875,
"learning_rate": 0.0004587560795016269,
"loss": 5.0153,
"mean_token_accuracy": 0.1974886417388916,
"num_tokens": 45048229.0,
"step": 25970
},
{
"entropy": 5.439561080932617,
"epoch": 2.020929780198405,
"grad_norm": 1.296875,
"learning_rate": 0.0004587400842340905,
"loss": 5.1166,
"mean_token_accuracy": 0.18204376846551895,
"num_tokens": 45057414.0,
"step": 25975
},
{
"entropy": 5.348490762710571,
"epoch": 2.0213188095701224,
"grad_norm": 1.2890625,
"learning_rate": 0.00045872408617859083,
"loss": 4.9493,
"mean_token_accuracy": 0.19199012070894242,
"num_tokens": 45065785.0,
"step": 25980
},
{
"entropy": 5.368834733963013,
"epoch": 2.02170783894184,
"grad_norm": 1.2109375,
"learning_rate": 0.00045870808533537066,
"loss": 4.9777,
"mean_token_accuracy": 0.19553280621767044,
"num_tokens": 45074896.0,
"step": 25985
},
{
"entropy": 5.351745653152466,
"epoch": 2.022096868313558,
"grad_norm": 1.1640625,
"learning_rate": 0.00045869208170467256,
"loss": 5.0091,
"mean_token_accuracy": 0.18995742946863176,
"num_tokens": 45083554.0,
"step": 25990
},
{
"entropy": 5.4361546516418455,
"epoch": 2.022485897685275,
"grad_norm": 1.171875,
"learning_rate": 0.0004586760752867396,
"loss": 5.0229,
"mean_token_accuracy": 0.19032378643751144,
"num_tokens": 45092204.0,
"step": 25995
},
{
"entropy": 5.389403438568115,
"epoch": 2.022874927056993,
"grad_norm": 1.21875,
"learning_rate": 0.00045866006608181456,
"loss": 5.058,
"mean_token_accuracy": 0.18302899599075317,
"num_tokens": 45101665.0,
"step": 26000
},
{
"entropy": 5.3970427989959715,
"epoch": 2.0232639564287105,
"grad_norm": 1.1171875,
"learning_rate": 0.0004586440540901403,
"loss": 5.1069,
"mean_token_accuracy": 0.18317549973726271,
"num_tokens": 45111093.0,
"step": 26005
},
{
"entropy": 5.418169069290161,
"epoch": 2.0236529858004277,
"grad_norm": 1.2890625,
"learning_rate": 0.00045862803931195976,
"loss": 5.0016,
"mean_token_accuracy": 0.19877195507287979,
"num_tokens": 45118826.0,
"step": 26010
},
{
"entropy": 5.43197922706604,
"epoch": 2.0240420151721454,
"grad_norm": 1.25,
"learning_rate": 0.0004586120217475161,
"loss": 5.0669,
"mean_token_accuracy": 0.19353321492671965,
"num_tokens": 45128265.0,
"step": 26015
},
{
"entropy": 5.467695331573486,
"epoch": 2.024431044543863,
"grad_norm": 1.25,
"learning_rate": 0.0004585960013970522,
"loss": 5.1265,
"mean_token_accuracy": 0.180475415289402,
"num_tokens": 45137922.0,
"step": 26020
},
{
"entropy": 5.335978078842163,
"epoch": 2.024820073915581,
"grad_norm": 1.171875,
"learning_rate": 0.0004585799782608112,
"loss": 4.9257,
"mean_token_accuracy": 0.20844435691833496,
"num_tokens": 45146242.0,
"step": 26025
},
{
"entropy": 5.451327276229859,
"epoch": 2.025209103287298,
"grad_norm": 1.2890625,
"learning_rate": 0.00045856395233903624,
"loss": 5.0845,
"mean_token_accuracy": 0.1871362417936325,
"num_tokens": 45154897.0,
"step": 26030
},
{
"entropy": 5.447779703140259,
"epoch": 2.025598132659016,
"grad_norm": 1.2265625,
"learning_rate": 0.0004585479236319705,
"loss": 5.0497,
"mean_token_accuracy": 0.19219166040420532,
"num_tokens": 45164786.0,
"step": 26035
},
{
"entropy": 5.438527345657349,
"epoch": 2.0259871620307335,
"grad_norm": 1.2265625,
"learning_rate": 0.00045853189213985714,
"loss": 5.0777,
"mean_token_accuracy": 0.19099787771701812,
"num_tokens": 45173652.0,
"step": 26040
},
{
"entropy": 5.439251375198364,
"epoch": 2.0263761914024507,
"grad_norm": 1.265625,
"learning_rate": 0.00045851585786293943,
"loss": 4.9481,
"mean_token_accuracy": 0.19813117235898972,
"num_tokens": 45182399.0,
"step": 26045
},
{
"entropy": 5.42302188873291,
"epoch": 2.0267652207741684,
"grad_norm": 1.1484375,
"learning_rate": 0.00045849982080146067,
"loss": 5.0458,
"mean_token_accuracy": 0.18592471480369568,
"num_tokens": 45191587.0,
"step": 26050
},
{
"entropy": 5.358816242218017,
"epoch": 2.027154250145886,
"grad_norm": 1.3046875,
"learning_rate": 0.0004584837809556642,
"loss": 4.9973,
"mean_token_accuracy": 0.19537313729524614,
"num_tokens": 45200032.0,
"step": 26055
},
{
"entropy": 5.388509273529053,
"epoch": 2.0275432795176034,
"grad_norm": 1.140625,
"learning_rate": 0.00045846773832579346,
"loss": 5.0536,
"mean_token_accuracy": 0.19128959774971008,
"num_tokens": 45209205.0,
"step": 26060
},
{
"entropy": 5.4480650424957275,
"epoch": 2.027932308889321,
"grad_norm": 1.25,
"learning_rate": 0.00045845169291209176,
"loss": 5.0296,
"mean_token_accuracy": 0.1956133648753166,
"num_tokens": 45217603.0,
"step": 26065
},
{
"entropy": 5.361388397216797,
"epoch": 2.0283213382610388,
"grad_norm": 1.2421875,
"learning_rate": 0.00045843564471480263,
"loss": 4.9654,
"mean_token_accuracy": 0.19228676855564117,
"num_tokens": 45225971.0,
"step": 26070
},
{
"entropy": 5.438847064971924,
"epoch": 2.0287103676327565,
"grad_norm": 1.2421875,
"learning_rate": 0.0004584195937341695,
"loss": 5.0641,
"mean_token_accuracy": 0.18811849802732467,
"num_tokens": 45234494.0,
"step": 26075
},
{
"entropy": 5.375124216079712,
"epoch": 2.0290993970044737,
"grad_norm": 1.2578125,
"learning_rate": 0.00045840353997043606,
"loss": 4.8865,
"mean_token_accuracy": 0.20367511212825776,
"num_tokens": 45242685.0,
"step": 26080
},
{
"entropy": 5.364949178695679,
"epoch": 2.0294884263761914,
"grad_norm": 1.1640625,
"learning_rate": 0.0004583874834238458,
"loss": 4.9546,
"mean_token_accuracy": 0.19468216150999068,
"num_tokens": 45252282.0,
"step": 26085
},
{
"entropy": 5.407217931747437,
"epoch": 2.029877455747909,
"grad_norm": 1.234375,
"learning_rate": 0.0004583714240946423,
"loss": 5.1253,
"mean_token_accuracy": 0.183768068253994,
"num_tokens": 45261390.0,
"step": 26090
},
{
"entropy": 5.529230642318725,
"epoch": 2.0302664851196264,
"grad_norm": 1.2265625,
"learning_rate": 0.00045835536198306936,
"loss": 5.1574,
"mean_token_accuracy": 0.1857831209897995,
"num_tokens": 45270244.0,
"step": 26095
},
{
"entropy": 5.421908569335938,
"epoch": 2.030655514491344,
"grad_norm": 1.203125,
"learning_rate": 0.00045833929708937067,
"loss": 5.0613,
"mean_token_accuracy": 0.18150174468755723,
"num_tokens": 45279404.0,
"step": 26100
},
{
"entropy": 5.381596660614013,
"epoch": 2.0310445438630618,
"grad_norm": 1.1953125,
"learning_rate": 0.0004583232294137899,
"loss": 5.0127,
"mean_token_accuracy": 0.20008201897144318,
"num_tokens": 45288064.0,
"step": 26105
},
{
"entropy": 5.404865455627442,
"epoch": 2.031433573234779,
"grad_norm": 1.203125,
"learning_rate": 0.0004583071589565709,
"loss": 5.0434,
"mean_token_accuracy": 0.19093966186046601,
"num_tokens": 45296528.0,
"step": 26110
},
{
"entropy": 5.381143999099732,
"epoch": 2.0318226026064967,
"grad_norm": 1.1796875,
"learning_rate": 0.0004582910857179576,
"loss": 4.9446,
"mean_token_accuracy": 0.20075131803750992,
"num_tokens": 45305524.0,
"step": 26115
},
{
"entropy": 5.470190143585205,
"epoch": 2.0322116319782144,
"grad_norm": 1.1640625,
"learning_rate": 0.0004582750096981938,
"loss": 5.1707,
"mean_token_accuracy": 0.18088085651397706,
"num_tokens": 45314386.0,
"step": 26120
},
{
"entropy": 5.4435337543487545,
"epoch": 2.032600661349932,
"grad_norm": 1.2734375,
"learning_rate": 0.0004582589308975234,
"loss": 5.0619,
"mean_token_accuracy": 0.19031144827604293,
"num_tokens": 45322901.0,
"step": 26125
},
{
"entropy": 5.37007212638855,
"epoch": 2.0329896907216494,
"grad_norm": 1.25,
"learning_rate": 0.00045824284931619044,
"loss": 4.988,
"mean_token_accuracy": 0.18776696920394897,
"num_tokens": 45331509.0,
"step": 26130
},
{
"entropy": 5.395872974395752,
"epoch": 2.033378720093367,
"grad_norm": 1.1796875,
"learning_rate": 0.00045822676495443893,
"loss": 5.0586,
"mean_token_accuracy": 0.1902666598558426,
"num_tokens": 45340356.0,
"step": 26135
},
{
"entropy": 5.460249567031861,
"epoch": 2.0337677494650848,
"grad_norm": 1.2421875,
"learning_rate": 0.00045821067781251284,
"loss": 5.0814,
"mean_token_accuracy": 0.19231048971414566,
"num_tokens": 45349890.0,
"step": 26140
},
{
"entropy": 5.404625463485718,
"epoch": 2.034156778836802,
"grad_norm": 1.21875,
"learning_rate": 0.00045819458789065633,
"loss": 5.0394,
"mean_token_accuracy": 0.19535226076841355,
"num_tokens": 45359249.0,
"step": 26145
},
{
"entropy": 5.394500780105591,
"epoch": 2.0345458082085197,
"grad_norm": 1.296875,
"learning_rate": 0.0004581784951891135,
"loss": 5.0141,
"mean_token_accuracy": 0.2017541766166687,
"num_tokens": 45367832.0,
"step": 26150
},
{
"entropy": 5.417349863052368,
"epoch": 2.0349348375802374,
"grad_norm": 1.3125,
"learning_rate": 0.0004581623997081286,
"loss": 5.0146,
"mean_token_accuracy": 0.19365923702716828,
"num_tokens": 45376316.0,
"step": 26155
},
{
"entropy": 5.444663000106812,
"epoch": 2.0353238669519547,
"grad_norm": 1.421875,
"learning_rate": 0.0004581463014479459,
"loss": 5.0903,
"mean_token_accuracy": 0.1849350243806839,
"num_tokens": 45385801.0,
"step": 26160
},
{
"entropy": 5.409417247772216,
"epoch": 2.0357128963236724,
"grad_norm": 1.34375,
"learning_rate": 0.0004581302004088095,
"loss": 5.0491,
"mean_token_accuracy": 0.1977722927927971,
"num_tokens": 45394669.0,
"step": 26165
},
{
"entropy": 5.3515464782714846,
"epoch": 2.03610192569539,
"grad_norm": 1.2890625,
"learning_rate": 0.0004581140965909638,
"loss": 4.9985,
"mean_token_accuracy": 0.19251398742198944,
"num_tokens": 45402896.0,
"step": 26170
},
{
"entropy": 5.383649826049805,
"epoch": 2.0364909550671078,
"grad_norm": 1.25,
"learning_rate": 0.0004580979899946531,
"loss": 5.0339,
"mean_token_accuracy": 0.18717775642871856,
"num_tokens": 45411047.0,
"step": 26175
},
{
"entropy": 5.489533996582031,
"epoch": 2.036879984438825,
"grad_norm": 1.203125,
"learning_rate": 0.0004580818806201219,
"loss": 5.1517,
"mean_token_accuracy": 0.18341357707977296,
"num_tokens": 45420661.0,
"step": 26180
},
{
"entropy": 5.419586610794068,
"epoch": 2.0372690138105427,
"grad_norm": 1.171875,
"learning_rate": 0.00045806576846761453,
"loss": 5.0018,
"mean_token_accuracy": 0.19526728093624116,
"num_tokens": 45429199.0,
"step": 26185
},
{
"entropy": 5.399383449554444,
"epoch": 2.0376580431822604,
"grad_norm": 1.234375,
"learning_rate": 0.00045804965353737556,
"loss": 4.9974,
"mean_token_accuracy": 0.19586683362722396,
"num_tokens": 45437504.0,
"step": 26190
},
{
"entropy": 5.35016360282898,
"epoch": 2.0380470725539777,
"grad_norm": 1.1171875,
"learning_rate": 0.0004580335358296494,
"loss": 4.9313,
"mean_token_accuracy": 0.19858157485723496,
"num_tokens": 45445696.0,
"step": 26195
},
{
"entropy": 5.386020708084106,
"epoch": 2.0384361019256954,
"grad_norm": 1.203125,
"learning_rate": 0.00045801741534468065,
"loss": 5.0566,
"mean_token_accuracy": 0.19132564812898636,
"num_tokens": 45455058.0,
"step": 26200
},
{
"entropy": 5.5379386901855465,
"epoch": 2.038825131297413,
"grad_norm": 1.3515625,
"learning_rate": 0.0004580012920827139,
"loss": 5.1523,
"mean_token_accuracy": 0.1912221446633339,
"num_tokens": 45464193.0,
"step": 26205
},
{
"entropy": 5.3309485912323,
"epoch": 2.0392141606691303,
"grad_norm": 1.1953125,
"learning_rate": 0.0004579851660439939,
"loss": 4.8894,
"mean_token_accuracy": 0.20297409743070602,
"num_tokens": 45471922.0,
"step": 26210
},
{
"entropy": 5.4203649997711185,
"epoch": 2.039603190040848,
"grad_norm": 1.203125,
"learning_rate": 0.00045796903722876523,
"loss": 5.0878,
"mean_token_accuracy": 0.18505747765302658,
"num_tokens": 45480181.0,
"step": 26215
},
{
"entropy": 5.504444551467896,
"epoch": 2.0399922194125657,
"grad_norm": 1.2421875,
"learning_rate": 0.0004579529056372726,
"loss": 5.1121,
"mean_token_accuracy": 0.18536008447408675,
"num_tokens": 45488970.0,
"step": 26220
},
{
"entropy": 5.489070320129395,
"epoch": 2.0403812487842834,
"grad_norm": 1.2265625,
"learning_rate": 0.0004579367712697609,
"loss": 5.0216,
"mean_token_accuracy": 0.19251990616321563,
"num_tokens": 45497066.0,
"step": 26225
},
{
"entropy": 5.318470239639282,
"epoch": 2.0407702781560006,
"grad_norm": 1.2578125,
"learning_rate": 0.00045792063412647475,
"loss": 4.9868,
"mean_token_accuracy": 0.1896705821156502,
"num_tokens": 45506399.0,
"step": 26230
},
{
"entropy": 5.380315589904785,
"epoch": 2.0411593075277183,
"grad_norm": 1.3203125,
"learning_rate": 0.00045790449420765925,
"loss": 5.0329,
"mean_token_accuracy": 0.18642533123493193,
"num_tokens": 45516625.0,
"step": 26235
},
{
"entropy": 5.50053653717041,
"epoch": 2.041548336899436,
"grad_norm": 1.21875,
"learning_rate": 0.00045788835151355914,
"loss": 5.136,
"mean_token_accuracy": 0.1838379755616188,
"num_tokens": 45525539.0,
"step": 26240
},
{
"entropy": 5.477184104919433,
"epoch": 2.0419373662711533,
"grad_norm": 1.28125,
"learning_rate": 0.00045787220604441933,
"loss": 5.0641,
"mean_token_accuracy": 0.19023065268993378,
"num_tokens": 45535388.0,
"step": 26245
},
{
"entropy": 5.449324607849121,
"epoch": 2.042326395642871,
"grad_norm": 1.234375,
"learning_rate": 0.00045785605780048497,
"loss": 5.0896,
"mean_token_accuracy": 0.1879400923848152,
"num_tokens": 45543729.0,
"step": 26250
},
{
"entropy": 5.4420207977294925,
"epoch": 2.0427154250145887,
"grad_norm": 1.15625,
"learning_rate": 0.00045783990678200086,
"loss": 5.0748,
"mean_token_accuracy": 0.19113170653581618,
"num_tokens": 45551887.0,
"step": 26255
},
{
"entropy": 5.513482093811035,
"epoch": 2.043104454386306,
"grad_norm": 1.3046875,
"learning_rate": 0.00045782375298921227,
"loss": 5.155,
"mean_token_accuracy": 0.1835791662335396,
"num_tokens": 45560267.0,
"step": 26260
},
{
"entropy": 5.456582307815552,
"epoch": 2.0434934837580236,
"grad_norm": 1.1328125,
"learning_rate": 0.0004578075964223642,
"loss": 5.0483,
"mean_token_accuracy": 0.18581804931163787,
"num_tokens": 45569459.0,
"step": 26265
},
{
"entropy": 5.498728084564209,
"epoch": 2.0438825131297413,
"grad_norm": 1.2109375,
"learning_rate": 0.0004577914370817018,
"loss": 5.018,
"mean_token_accuracy": 0.1909094125032425,
"num_tokens": 45577713.0,
"step": 26270
},
{
"entropy": 5.364718198776245,
"epoch": 2.044271542501459,
"grad_norm": 1.203125,
"learning_rate": 0.00045777527496747034,
"loss": 4.9591,
"mean_token_accuracy": 0.19274633675813674,
"num_tokens": 45586521.0,
"step": 26275
},
{
"entropy": 5.4050311088562015,
"epoch": 2.0446605718731763,
"grad_norm": 1.2421875,
"learning_rate": 0.00045775911007991493,
"loss": 5.0348,
"mean_token_accuracy": 0.1895280510187149,
"num_tokens": 45595210.0,
"step": 26280
},
{
"entropy": 5.413984155654907,
"epoch": 2.045049601244894,
"grad_norm": 1.21875,
"learning_rate": 0.00045774294241928093,
"loss": 5.0793,
"mean_token_accuracy": 0.19449229538440704,
"num_tokens": 45603472.0,
"step": 26285
},
{
"entropy": 5.410886764526367,
"epoch": 2.0454386306166117,
"grad_norm": 1.1875,
"learning_rate": 0.0004577267719858137,
"loss": 5.1011,
"mean_token_accuracy": 0.1893333986401558,
"num_tokens": 45612149.0,
"step": 26290
},
{
"entropy": 5.512052583694458,
"epoch": 2.045827659988329,
"grad_norm": 1.2109375,
"learning_rate": 0.00045771059877975853,
"loss": 5.1349,
"mean_token_accuracy": 0.1856628254055977,
"num_tokens": 45619903.0,
"step": 26295
},
{
"entropy": 5.448427200317383,
"epoch": 2.0462166893600466,
"grad_norm": 1.25,
"learning_rate": 0.0004576944228013608,
"loss": 5.0451,
"mean_token_accuracy": 0.19478957504034042,
"num_tokens": 45628012.0,
"step": 26300
},
{
"entropy": 5.4193802833557125,
"epoch": 2.0466057187317643,
"grad_norm": 1.2578125,
"learning_rate": 0.000457678244050866,
"loss": 5.0733,
"mean_token_accuracy": 0.18700272142887114,
"num_tokens": 45636587.0,
"step": 26305
},
{
"entropy": 5.437486553192139,
"epoch": 2.046994748103482,
"grad_norm": 1.234375,
"learning_rate": 0.0004576620625285196,
"loss": 5.0184,
"mean_token_accuracy": 0.18769490867853164,
"num_tokens": 45645189.0,
"step": 26310
},
{
"entropy": 5.471664190292358,
"epoch": 2.0473837774751993,
"grad_norm": 1.2421875,
"learning_rate": 0.00045764587823456717,
"loss": 5.1134,
"mean_token_accuracy": 0.1862294554710388,
"num_tokens": 45654059.0,
"step": 26315
},
{
"entropy": 5.411434555053711,
"epoch": 2.047772806846917,
"grad_norm": 1.1953125,
"learning_rate": 0.00045762969116925424,
"loss": 4.9554,
"mean_token_accuracy": 0.20261223018169403,
"num_tokens": 45662125.0,
"step": 26320
},
{
"entropy": 5.43969612121582,
"epoch": 2.0481618362186347,
"grad_norm": 1.171875,
"learning_rate": 0.00045761350133282643,
"loss": 5.0425,
"mean_token_accuracy": 0.19617673009634018,
"num_tokens": 45670068.0,
"step": 26325
},
{
"entropy": 5.4207923412323,
"epoch": 2.048550865590352,
"grad_norm": 1.3046875,
"learning_rate": 0.00045759730872552937,
"loss": 4.92,
"mean_token_accuracy": 0.2021739065647125,
"num_tokens": 45678717.0,
"step": 26330
},
{
"entropy": 5.392726182937622,
"epoch": 2.0489398949620696,
"grad_norm": 1.1875,
"learning_rate": 0.0004575811133476088,
"loss": 5.0194,
"mean_token_accuracy": 0.19141270965337753,
"num_tokens": 45686882.0,
"step": 26335
},
{
"entropy": 5.327445125579834,
"epoch": 2.0493289243337873,
"grad_norm": 1.2109375,
"learning_rate": 0.00045756491519931047,
"loss": 4.955,
"mean_token_accuracy": 0.19678519517183304,
"num_tokens": 45695460.0,
"step": 26340
},
{
"entropy": 5.507504844665528,
"epoch": 2.0497179537055046,
"grad_norm": 1.2890625,
"learning_rate": 0.0004575487142808801,
"loss": 5.0983,
"mean_token_accuracy": 0.1843729078769684,
"num_tokens": 45703287.0,
"step": 26345
},
{
"entropy": 5.505461120605469,
"epoch": 2.0501069830772223,
"grad_norm": 1.1796875,
"learning_rate": 0.0004575325105925636,
"loss": 5.1414,
"mean_token_accuracy": 0.17672090232372284,
"num_tokens": 45712830.0,
"step": 26350
},
{
"entropy": 5.353002977371216,
"epoch": 2.05049601244894,
"grad_norm": 1.3125,
"learning_rate": 0.00045751630413460665,
"loss": 5.089,
"mean_token_accuracy": 0.19246399402618408,
"num_tokens": 45720701.0,
"step": 26355
},
{
"entropy": 5.39636926651001,
"epoch": 2.0508850418206577,
"grad_norm": 1.15625,
"learning_rate": 0.0004575000949072554,
"loss": 4.9897,
"mean_token_accuracy": 0.19478224068880082,
"num_tokens": 45728663.0,
"step": 26360
},
{
"entropy": 5.4227899551391605,
"epoch": 2.051274071192375,
"grad_norm": 1.265625,
"learning_rate": 0.0004574838829107557,
"loss": 5.0343,
"mean_token_accuracy": 0.1888278603553772,
"num_tokens": 45737661.0,
"step": 26365
},
{
"entropy": 5.304185295104981,
"epoch": 2.0516631005640926,
"grad_norm": 1.28125,
"learning_rate": 0.0004574676681453535,
"loss": 4.9898,
"mean_token_accuracy": 0.19670014679431916,
"num_tokens": 45746343.0,
"step": 26370
},
{
"entropy": 5.325126361846924,
"epoch": 2.0520521299358103,
"grad_norm": 1.2421875,
"learning_rate": 0.00045745145061129485,
"loss": 5.0312,
"mean_token_accuracy": 0.19176389127969742,
"num_tokens": 45755025.0,
"step": 26375
},
{
"entropy": 5.428109407424927,
"epoch": 2.0524411593075276,
"grad_norm": 1.1484375,
"learning_rate": 0.00045743523030882584,
"loss": 5.0828,
"mean_token_accuracy": 0.1929038032889366,
"num_tokens": 45763107.0,
"step": 26380
},
{
"entropy": 5.3779298782348635,
"epoch": 2.0528301886792453,
"grad_norm": 1.140625,
"learning_rate": 0.0004574190072381926,
"loss": 4.9754,
"mean_token_accuracy": 0.19898145496845246,
"num_tokens": 45771754.0,
"step": 26385
},
{
"entropy": 5.4276305675506595,
"epoch": 2.053219218050963,
"grad_norm": 1.1875,
"learning_rate": 0.0004574027813996413,
"loss": 5.1521,
"mean_token_accuracy": 0.18219714760780334,
"num_tokens": 45779282.0,
"step": 26390
},
{
"entropy": 5.506859493255615,
"epoch": 2.05360824742268,
"grad_norm": 1.2734375,
"learning_rate": 0.0004573865527934181,
"loss": 5.1107,
"mean_token_accuracy": 0.188125841319561,
"num_tokens": 45788002.0,
"step": 26395
},
{
"entropy": 5.519529342651367,
"epoch": 2.053997276794398,
"grad_norm": 1.140625,
"learning_rate": 0.0004573703214197692,
"loss": 5.1035,
"mean_token_accuracy": 0.1825848326086998,
"num_tokens": 45796563.0,
"step": 26400
},
{
"entropy": 5.386622762680053,
"epoch": 2.0543863061661156,
"grad_norm": 1.2421875,
"learning_rate": 0.00045735408727894095,
"loss": 4.9954,
"mean_token_accuracy": 0.1879150614142418,
"num_tokens": 45806311.0,
"step": 26405
},
{
"entropy": 5.426680994033814,
"epoch": 2.0547753355378333,
"grad_norm": 1.328125,
"learning_rate": 0.00045733785037117977,
"loss": 5.0057,
"mean_token_accuracy": 0.19833437353372574,
"num_tokens": 45814007.0,
"step": 26410
},
{
"entropy": 5.437084341049195,
"epoch": 2.0551643649095506,
"grad_norm": 1.2421875,
"learning_rate": 0.0004573216106967319,
"loss": 5.0432,
"mean_token_accuracy": 0.18644810616970062,
"num_tokens": 45822492.0,
"step": 26415
},
{
"entropy": 5.338999271392822,
"epoch": 2.0555533942812683,
"grad_norm": 1.25,
"learning_rate": 0.00045730536825584365,
"loss": 4.9764,
"mean_token_accuracy": 0.1982593536376953,
"num_tokens": 45830853.0,
"step": 26420
},
{
"entropy": 5.46483678817749,
"epoch": 2.055942423652986,
"grad_norm": 1.1640625,
"learning_rate": 0.00045728912304876176,
"loss": 5.0787,
"mean_token_accuracy": 0.18382885158061982,
"num_tokens": 45839948.0,
"step": 26425
},
{
"entropy": 5.532828426361084,
"epoch": 2.056331453024703,
"grad_norm": 1.1796875,
"learning_rate": 0.0004572728750757326,
"loss": 5.1684,
"mean_token_accuracy": 0.17548505663871766,
"num_tokens": 45848264.0,
"step": 26430
},
{
"entropy": 5.336362695693969,
"epoch": 2.056720482396421,
"grad_norm": 1.1875,
"learning_rate": 0.0004572566243370025,
"loss": 4.9393,
"mean_token_accuracy": 0.19766717851161958,
"num_tokens": 45856523.0,
"step": 26435
},
{
"entropy": 5.368370914459229,
"epoch": 2.0571095117681386,
"grad_norm": 1.2421875,
"learning_rate": 0.0004572403708328183,
"loss": 5.0488,
"mean_token_accuracy": 0.19112208485603333,
"num_tokens": 45864736.0,
"step": 26440
},
{
"entropy": 5.387862300872802,
"epoch": 2.057498541139856,
"grad_norm": 1.234375,
"learning_rate": 0.0004572241145634266,
"loss": 5.0442,
"mean_token_accuracy": 0.187595197558403,
"num_tokens": 45873979.0,
"step": 26445
},
{
"entropy": 5.3853226661682125,
"epoch": 2.0578875705115736,
"grad_norm": 1.2578125,
"learning_rate": 0.000457207855529074,
"loss": 5.0416,
"mean_token_accuracy": 0.19554167836904526,
"num_tokens": 45882545.0,
"step": 26450
},
{
"entropy": 5.4254437446594235,
"epoch": 2.0582765998832913,
"grad_norm": 1.203125,
"learning_rate": 0.00045719159373000713,
"loss": 5.112,
"mean_token_accuracy": 0.18386237025260926,
"num_tokens": 45890830.0,
"step": 26455
},
{
"entropy": 5.524672937393189,
"epoch": 2.058665629255009,
"grad_norm": 1.203125,
"learning_rate": 0.0004571753291664729,
"loss": 5.0458,
"mean_token_accuracy": 0.18822207152843476,
"num_tokens": 45899457.0,
"step": 26460
},
{
"entropy": 5.357991743087768,
"epoch": 2.059054658626726,
"grad_norm": 1.359375,
"learning_rate": 0.0004571590618387179,
"loss": 5.0578,
"mean_token_accuracy": 0.1917414888739586,
"num_tokens": 45907998.0,
"step": 26465
},
{
"entropy": 5.368137788772583,
"epoch": 2.059443687998444,
"grad_norm": 1.234375,
"learning_rate": 0.0004571427917469892,
"loss": 4.965,
"mean_token_accuracy": 0.19362906515598297,
"num_tokens": 45916102.0,
"step": 26470
},
{
"entropy": 5.353817510604858,
"epoch": 2.0598327173701616,
"grad_norm": 1.171875,
"learning_rate": 0.00045712651889153345,
"loss": 5.024,
"mean_token_accuracy": 0.19396157264709474,
"num_tokens": 45924347.0,
"step": 26475
},
{
"entropy": 5.422517490386963,
"epoch": 2.060221746741879,
"grad_norm": 1.171875,
"learning_rate": 0.00045711024327259764,
"loss": 5.0357,
"mean_token_accuracy": 0.19892602860927583,
"num_tokens": 45932702.0,
"step": 26480
},
{
"entropy": 5.33369631767273,
"epoch": 2.0606107761135966,
"grad_norm": 1.3671875,
"learning_rate": 0.00045709396489042884,
"loss": 4.9853,
"mean_token_accuracy": 0.19209445118904114,
"num_tokens": 45941235.0,
"step": 26485
},
{
"entropy": 5.4426658153533936,
"epoch": 2.0609998054853143,
"grad_norm": 1.1875,
"learning_rate": 0.00045707768374527385,
"loss": 5.0017,
"mean_token_accuracy": 0.19857096970081328,
"num_tokens": 45949582.0,
"step": 26490
},
{
"entropy": 5.448131561279297,
"epoch": 2.0613888348570315,
"grad_norm": 1.421875,
"learning_rate": 0.0004570613998373799,
"loss": 5.0593,
"mean_token_accuracy": 0.18770783692598342,
"num_tokens": 45957920.0,
"step": 26495
},
{
"entropy": 5.388140249252319,
"epoch": 2.061777864228749,
"grad_norm": 1.328125,
"learning_rate": 0.00045704511316699395,
"loss": 5.1079,
"mean_token_accuracy": 0.19046034663915634,
"num_tokens": 45966302.0,
"step": 26500
},
{
"entropy": 5.437421083450317,
"epoch": 2.062166893600467,
"grad_norm": 1.2109375,
"learning_rate": 0.00045702882373436317,
"loss": 5.1327,
"mean_token_accuracy": 0.1886591747403145,
"num_tokens": 45975481.0,
"step": 26505
},
{
"entropy": 5.5411149024963375,
"epoch": 2.0625559229721846,
"grad_norm": 1.09375,
"learning_rate": 0.0004570125315397347,
"loss": 5.137,
"mean_token_accuracy": 0.18596181273460388,
"num_tokens": 45984466.0,
"step": 26510
},
{
"entropy": 5.3551208019256595,
"epoch": 2.062944952343902,
"grad_norm": 1.2734375,
"learning_rate": 0.0004569962365833558,
"loss": 4.9614,
"mean_token_accuracy": 0.19354475885629654,
"num_tokens": 45992862.0,
"step": 26515
},
{
"entropy": 5.386298036575317,
"epoch": 2.0633339817156195,
"grad_norm": 1.28125,
"learning_rate": 0.00045697993886547374,
"loss": 5.055,
"mean_token_accuracy": 0.18653280586004256,
"num_tokens": 46001211.0,
"step": 26520
},
{
"entropy": 5.471065616607666,
"epoch": 2.0637230110873372,
"grad_norm": 1.1640625,
"learning_rate": 0.00045696363838633566,
"loss": 5.082,
"mean_token_accuracy": 0.1817440867424011,
"num_tokens": 46009574.0,
"step": 26525
},
{
"entropy": 5.4172827243804935,
"epoch": 2.0641120404590545,
"grad_norm": 1.1875,
"learning_rate": 0.00045694733514618904,
"loss": 4.9872,
"mean_token_accuracy": 0.1934663861989975,
"num_tokens": 46017686.0,
"step": 26530
},
{
"entropy": 5.4009908676147464,
"epoch": 2.064501069830772,
"grad_norm": 1.140625,
"learning_rate": 0.0004569310291452812,
"loss": 5.0444,
"mean_token_accuracy": 0.1874256655573845,
"num_tokens": 46026842.0,
"step": 26535
},
{
"entropy": 5.381682920455932,
"epoch": 2.06489009920249,
"grad_norm": 1.1796875,
"learning_rate": 0.0004569147203838595,
"loss": 5.006,
"mean_token_accuracy": 0.19104905128479005,
"num_tokens": 46036308.0,
"step": 26540
},
{
"entropy": 5.392024803161621,
"epoch": 2.065279128574207,
"grad_norm": 1.1875,
"learning_rate": 0.00045689840886217157,
"loss": 5.0305,
"mean_token_accuracy": 0.1912926286458969,
"num_tokens": 46045424.0,
"step": 26545
},
{
"entropy": 5.40010929107666,
"epoch": 2.065668157945925,
"grad_norm": 1.203125,
"learning_rate": 0.00045688209458046475,
"loss": 5.0121,
"mean_token_accuracy": 0.19032019525766372,
"num_tokens": 46054386.0,
"step": 26550
},
{
"entropy": 5.37185435295105,
"epoch": 2.0660571873176425,
"grad_norm": 1.2890625,
"learning_rate": 0.00045686577753898663,
"loss": 4.9633,
"mean_token_accuracy": 0.19615142196416854,
"num_tokens": 46063617.0,
"step": 26555
},
{
"entropy": 5.4097206592559814,
"epoch": 2.0664462166893602,
"grad_norm": 1.203125,
"learning_rate": 0.00045684945773798483,
"loss": 5.1467,
"mean_token_accuracy": 0.18350289463996888,
"num_tokens": 46072915.0,
"step": 26560
},
{
"entropy": 5.408411836624145,
"epoch": 2.0668352460610775,
"grad_norm": 1.28125,
"learning_rate": 0.000456833135177707,
"loss": 5.1669,
"mean_token_accuracy": 0.18664602637290956,
"num_tokens": 46081890.0,
"step": 26565
},
{
"entropy": 5.49239068031311,
"epoch": 2.067224275432795,
"grad_norm": 1.2421875,
"learning_rate": 0.0004568168098584007,
"loss": 5.1323,
"mean_token_accuracy": 0.18312088698148726,
"num_tokens": 46090445.0,
"step": 26570
},
{
"entropy": 5.524904108047485,
"epoch": 2.067613304804513,
"grad_norm": 1.109375,
"learning_rate": 0.0004568004817803137,
"loss": 5.1224,
"mean_token_accuracy": 0.18683040589094163,
"num_tokens": 46099866.0,
"step": 26575
},
{
"entropy": 5.382289075851441,
"epoch": 2.06800233417623,
"grad_norm": 1.21875,
"learning_rate": 0.0004567841509436937,
"loss": 4.9868,
"mean_token_accuracy": 0.19858779311180114,
"num_tokens": 46108036.0,
"step": 26580
},
{
"entropy": 5.370401668548584,
"epoch": 2.068391363547948,
"grad_norm": 1.2109375,
"learning_rate": 0.0004567678173487887,
"loss": 4.9471,
"mean_token_accuracy": 0.20068297535181046,
"num_tokens": 46116087.0,
"step": 26585
},
{
"entropy": 5.386041164398193,
"epoch": 2.0687803929196655,
"grad_norm": 1.140625,
"learning_rate": 0.0004567514809958462,
"loss": 5.019,
"mean_token_accuracy": 0.20330306589603425,
"num_tokens": 46124934.0,
"step": 26590
},
{
"entropy": 5.4602302551269535,
"epoch": 2.069169422291383,
"grad_norm": 1.296875,
"learning_rate": 0.0004567351418851144,
"loss": 5.0651,
"mean_token_accuracy": 0.18913166224956512,
"num_tokens": 46133691.0,
"step": 26595
},
{
"entropy": 5.478541517257691,
"epoch": 2.0695584516631005,
"grad_norm": 1.1875,
"learning_rate": 0.00045671880001684113,
"loss": 5.0914,
"mean_token_accuracy": 0.18538061827421187,
"num_tokens": 46141933.0,
"step": 26600
},
{
"entropy": 5.355129098892212,
"epoch": 2.069947481034818,
"grad_norm": 1.203125,
"learning_rate": 0.00045670245539127413,
"loss": 4.9842,
"mean_token_accuracy": 0.1955270066857338,
"num_tokens": 46150656.0,
"step": 26605
},
{
"entropy": 5.350622034072876,
"epoch": 2.070336510406536,
"grad_norm": 1.1640625,
"learning_rate": 0.00045668610800866173,
"loss": 5.0127,
"mean_token_accuracy": 0.19243651181459426,
"num_tokens": 46160353.0,
"step": 26610
},
{
"entropy": 5.464599847793579,
"epoch": 2.070725539778253,
"grad_norm": 1.171875,
"learning_rate": 0.00045666975786925177,
"loss": 5.0413,
"mean_token_accuracy": 0.19571170657873155,
"num_tokens": 46168810.0,
"step": 26615
},
{
"entropy": 5.392941999435425,
"epoch": 2.071114569149971,
"grad_norm": 1.1953125,
"learning_rate": 0.0004566534049732923,
"loss": 5.0235,
"mean_token_accuracy": 0.1957779124379158,
"num_tokens": 46177593.0,
"step": 26620
},
{
"entropy": 5.370887565612793,
"epoch": 2.0715035985216885,
"grad_norm": 1.2734375,
"learning_rate": 0.00045663704932103166,
"loss": 5.0752,
"mean_token_accuracy": 0.19125280380249024,
"num_tokens": 46186027.0,
"step": 26625
},
{
"entropy": 5.428931856155396,
"epoch": 2.071892627893406,
"grad_norm": 1.1953125,
"learning_rate": 0.00045662069091271785,
"loss": 5.1186,
"mean_token_accuracy": 0.18589888662099838,
"num_tokens": 46194705.0,
"step": 26630
},
{
"entropy": 5.444761419296265,
"epoch": 2.0722816572651235,
"grad_norm": 1.1484375,
"learning_rate": 0.00045660432974859924,
"loss": 4.9788,
"mean_token_accuracy": 0.1986072316765785,
"num_tokens": 46203498.0,
"step": 26635
},
{
"entropy": 5.435950851440429,
"epoch": 2.072670686636841,
"grad_norm": 1.2265625,
"learning_rate": 0.00045658796582892383,
"loss": 5.0308,
"mean_token_accuracy": 0.19666505008935928,
"num_tokens": 46211918.0,
"step": 26640
},
{
"entropy": 5.465548324584961,
"epoch": 2.073059716008559,
"grad_norm": 1.1484375,
"learning_rate": 0.00045657159915394013,
"loss": 5.1414,
"mean_token_accuracy": 0.18419665694236756,
"num_tokens": 46220689.0,
"step": 26645
},
{
"entropy": 5.439324235916137,
"epoch": 2.073448745380276,
"grad_norm": 1.203125,
"learning_rate": 0.0004565552297238964,
"loss": 5.0933,
"mean_token_accuracy": 0.18456518799066543,
"num_tokens": 46229645.0,
"step": 26650
},
{
"entropy": 5.476610803604126,
"epoch": 2.073837774751994,
"grad_norm": 1.2890625,
"learning_rate": 0.000456538857539041,
"loss": 5.053,
"mean_token_accuracy": 0.1839945137500763,
"num_tokens": 46237691.0,
"step": 26655
},
{
"entropy": 5.442871809005737,
"epoch": 2.0742268041237115,
"grad_norm": 1.28125,
"learning_rate": 0.00045652248259962254,
"loss": 5.0325,
"mean_token_accuracy": 0.19456465691328048,
"num_tokens": 46245756.0,
"step": 26660
},
{
"entropy": 5.497630262374878,
"epoch": 2.0746158334954288,
"grad_norm": 1.1875,
"learning_rate": 0.0004565061049058892,
"loss": 5.1206,
"mean_token_accuracy": 0.18257547169923782,
"num_tokens": 46255233.0,
"step": 26665
},
{
"entropy": 5.490150260925293,
"epoch": 2.0750048628671465,
"grad_norm": 1.265625,
"learning_rate": 0.00045648972445808963,
"loss": 5.0929,
"mean_token_accuracy": 0.1819661632180214,
"num_tokens": 46263569.0,
"step": 26670
},
{
"entropy": 5.341439867019654,
"epoch": 2.075393892238864,
"grad_norm": 1.2109375,
"learning_rate": 0.00045647334125647235,
"loss": 4.9602,
"mean_token_accuracy": 0.19963158667087555,
"num_tokens": 46273010.0,
"step": 26675
},
{
"entropy": 5.401032495498657,
"epoch": 2.0757829216105814,
"grad_norm": 1.1015625,
"learning_rate": 0.000456456955301286,
"loss": 5.0492,
"mean_token_accuracy": 0.19649419337511062,
"num_tokens": 46281566.0,
"step": 26680
},
{
"entropy": 5.305159187316894,
"epoch": 2.076171950982299,
"grad_norm": 1.15625,
"learning_rate": 0.0004564405665927791,
"loss": 4.9061,
"mean_token_accuracy": 0.19944127798080444,
"num_tokens": 46290267.0,
"step": 26685
},
{
"entropy": 5.371257972717285,
"epoch": 2.076560980354017,
"grad_norm": 1.2734375,
"learning_rate": 0.00045642417513120043,
"loss": 4.9497,
"mean_token_accuracy": 0.2021263062953949,
"num_tokens": 46298694.0,
"step": 26690
},
{
"entropy": 5.381849861145019,
"epoch": 2.076950009725734,
"grad_norm": 1.2265625,
"learning_rate": 0.00045640778091679876,
"loss": 4.9052,
"mean_token_accuracy": 0.19964803457260133,
"num_tokens": 46307358.0,
"step": 26695
},
{
"entropy": 5.373528289794922,
"epoch": 2.0773390390974518,
"grad_norm": 1.1640625,
"learning_rate": 0.0004563913839498226,
"loss": 4.9724,
"mean_token_accuracy": 0.19706337451934813,
"num_tokens": 46316351.0,
"step": 26700
},
{
"entropy": 5.365335845947266,
"epoch": 2.0777280684691695,
"grad_norm": 1.1328125,
"learning_rate": 0.000456374984230521,
"loss": 5.0384,
"mean_token_accuracy": 0.19235157817602158,
"num_tokens": 46325591.0,
"step": 26705
},
{
"entropy": 5.455436372756958,
"epoch": 2.078117097840887,
"grad_norm": 1.2578125,
"learning_rate": 0.0004563585817591427,
"loss": 5.0249,
"mean_token_accuracy": 0.19098697304725648,
"num_tokens": 46334595.0,
"step": 26710
},
{
"entropy": 5.4872783660888675,
"epoch": 2.0785061272126044,
"grad_norm": 1.1640625,
"learning_rate": 0.0004563421765359365,
"loss": 5.1143,
"mean_token_accuracy": 0.19037314653396606,
"num_tokens": 46343587.0,
"step": 26715
},
{
"entropy": 5.500644016265869,
"epoch": 2.078895156584322,
"grad_norm": 1.1875,
"learning_rate": 0.00045632576856115156,
"loss": 5.0698,
"mean_token_accuracy": 0.19242760986089708,
"num_tokens": 46351900.0,
"step": 26720
},
{
"entropy": 5.429645109176636,
"epoch": 2.07928418595604,
"grad_norm": 1.125,
"learning_rate": 0.00045630935783503657,
"loss": 5.0712,
"mean_token_accuracy": 0.1838282063603401,
"num_tokens": 46359854.0,
"step": 26725
},
{
"entropy": 5.494559478759766,
"epoch": 2.079673215327757,
"grad_norm": 1.1953125,
"learning_rate": 0.0004562929443578407,
"loss": 5.166,
"mean_token_accuracy": 0.1871547132730484,
"num_tokens": 46368930.0,
"step": 26730
},
{
"entropy": 5.38897933959961,
"epoch": 2.0800622446994748,
"grad_norm": 1.1796875,
"learning_rate": 0.0004562765281298129,
"loss": 4.9531,
"mean_token_accuracy": 0.1908261999487877,
"num_tokens": 46377522.0,
"step": 26735
},
{
"entropy": 5.388074016571045,
"epoch": 2.0804512740711925,
"grad_norm": 1.2421875,
"learning_rate": 0.0004562601091512024,
"loss": 5.0618,
"mean_token_accuracy": 0.18359524458646775,
"num_tokens": 46386368.0,
"step": 26740
},
{
"entropy": 5.423078918457032,
"epoch": 2.08084030344291,
"grad_norm": 1.21875,
"learning_rate": 0.0004562436874222582,
"loss": 5.0228,
"mean_token_accuracy": 0.18908309787511826,
"num_tokens": 46395363.0,
"step": 26745
},
{
"entropy": 5.406333780288696,
"epoch": 2.0812293328146274,
"grad_norm": 1.2421875,
"learning_rate": 0.00045622726294322955,
"loss": 5.0851,
"mean_token_accuracy": 0.1890594929456711,
"num_tokens": 46403998.0,
"step": 26750
},
{
"entropy": 5.316444826126099,
"epoch": 2.081618362186345,
"grad_norm": 1.2734375,
"learning_rate": 0.00045621083571436563,
"loss": 4.8617,
"mean_token_accuracy": 0.20850645005702972,
"num_tokens": 46412138.0,
"step": 26755
},
{
"entropy": 5.3882434368133545,
"epoch": 2.082007391558063,
"grad_norm": 1.328125,
"learning_rate": 0.0004561944057359157,
"loss": 5.0432,
"mean_token_accuracy": 0.1977139815688133,
"num_tokens": 46420761.0,
"step": 26760
},
{
"entropy": 5.364417982101441,
"epoch": 2.08239642092978,
"grad_norm": 1.3203125,
"learning_rate": 0.0004561779730081291,
"loss": 5.0177,
"mean_token_accuracy": 0.1934445396065712,
"num_tokens": 46428938.0,
"step": 26765
},
{
"entropy": 5.414071941375733,
"epoch": 2.0827854503014978,
"grad_norm": 1.234375,
"learning_rate": 0.0004561615375312551,
"loss": 4.9937,
"mean_token_accuracy": 0.1987615168094635,
"num_tokens": 46436552.0,
"step": 26770
},
{
"entropy": 5.311163377761841,
"epoch": 2.0831744796732155,
"grad_norm": 1.1875,
"learning_rate": 0.00045614509930554304,
"loss": 4.9525,
"mean_token_accuracy": 0.19467213600873948,
"num_tokens": 46445223.0,
"step": 26775
},
{
"entropy": 5.404401588439941,
"epoch": 2.0835635090449327,
"grad_norm": 1.2890625,
"learning_rate": 0.00045612865833124253,
"loss": 5.079,
"mean_token_accuracy": 0.19310957342386245,
"num_tokens": 46453232.0,
"step": 26780
},
{
"entropy": 5.298688316345215,
"epoch": 2.0839525384166504,
"grad_norm": 1.109375,
"learning_rate": 0.0004561122146086029,
"loss": 4.9047,
"mean_token_accuracy": 0.20235710591077805,
"num_tokens": 46462562.0,
"step": 26785
},
{
"entropy": 5.424392032623291,
"epoch": 2.084341567788368,
"grad_norm": 1.2421875,
"learning_rate": 0.0004560957681378737,
"loss": 5.0718,
"mean_token_accuracy": 0.18561520874500276,
"num_tokens": 46470599.0,
"step": 26790
},
{
"entropy": 5.441938686370849,
"epoch": 2.084730597160086,
"grad_norm": 1.28125,
"learning_rate": 0.00045607931891930445,
"loss": 5.0419,
"mean_token_accuracy": 0.19102299064397812,
"num_tokens": 46478707.0,
"step": 26795
},
{
"entropy": 5.36987419128418,
"epoch": 2.085119626531803,
"grad_norm": 1.15625,
"learning_rate": 0.0004560628669531447,
"loss": 5.0131,
"mean_token_accuracy": 0.20059251487255098,
"num_tokens": 46487044.0,
"step": 26800
},
{
"entropy": 5.441597175598145,
"epoch": 2.0855086559035207,
"grad_norm": 1.2578125,
"learning_rate": 0.00045604641223964416,
"loss": 5.0366,
"mean_token_accuracy": 0.18717601895332336,
"num_tokens": 46495278.0,
"step": 26805
},
{
"entropy": 5.358327388763428,
"epoch": 2.0858976852752384,
"grad_norm": 1.234375,
"learning_rate": 0.00045602995477905247,
"loss": 5.0314,
"mean_token_accuracy": 0.19974675327539443,
"num_tokens": 46503545.0,
"step": 26810
},
{
"entropy": 5.389119815826416,
"epoch": 2.0862867146469557,
"grad_norm": 1.21875,
"learning_rate": 0.0004560134945716194,
"loss": 5.1115,
"mean_token_accuracy": 0.19523144364356995,
"num_tokens": 46513058.0,
"step": 26815
},
{
"entropy": 5.452762699127197,
"epoch": 2.0866757440186734,
"grad_norm": 1.3515625,
"learning_rate": 0.00045599703161759464,
"loss": 4.9997,
"mean_token_accuracy": 0.19506117403507234,
"num_tokens": 46520651.0,
"step": 26820
},
{
"entropy": 5.379821014404297,
"epoch": 2.087064773390391,
"grad_norm": 1.25,
"learning_rate": 0.00045598056591722805,
"loss": 4.9657,
"mean_token_accuracy": 0.1929590582847595,
"num_tokens": 46528899.0,
"step": 26825
},
{
"entropy": 5.4270049095153805,
"epoch": 2.0874538027621083,
"grad_norm": 1.2265625,
"learning_rate": 0.00045596409747076936,
"loss": 5.1856,
"mean_token_accuracy": 0.18012941330671312,
"num_tokens": 46537921.0,
"step": 26830
},
{
"entropy": 5.433773469924927,
"epoch": 2.087842832133826,
"grad_norm": 1.1640625,
"learning_rate": 0.0004559476262784686,
"loss": 5.0228,
"mean_token_accuracy": 0.19161346405744553,
"num_tokens": 46547432.0,
"step": 26835
},
{
"entropy": 5.4108131408691404,
"epoch": 2.0882318615055437,
"grad_norm": 1.203125,
"learning_rate": 0.0004559311523405755,
"loss": 5.0291,
"mean_token_accuracy": 0.19551636576652526,
"num_tokens": 46555406.0,
"step": 26840
},
{
"entropy": 5.457485675811768,
"epoch": 2.0886208908772614,
"grad_norm": 1.203125,
"learning_rate": 0.0004559146756573402,
"loss": 5.0768,
"mean_token_accuracy": 0.18892700970172882,
"num_tokens": 46564428.0,
"step": 26845
},
{
"entropy": 5.4394666194915775,
"epoch": 2.0890099202489787,
"grad_norm": 1.28125,
"learning_rate": 0.00045589819622901274,
"loss": 4.9922,
"mean_token_accuracy": 0.1958747923374176,
"num_tokens": 46573222.0,
"step": 26850
},
{
"entropy": 5.366905689239502,
"epoch": 2.0893989496206964,
"grad_norm": 1.2265625,
"learning_rate": 0.000455881714055843,
"loss": 4.9836,
"mean_token_accuracy": 0.19679927527904512,
"num_tokens": 46581951.0,
"step": 26855
},
{
"entropy": 5.445606517791748,
"epoch": 2.089787978992414,
"grad_norm": 1.109375,
"learning_rate": 0.00045586522913808114,
"loss": 5.1318,
"mean_token_accuracy": 0.1903458297252655,
"num_tokens": 46590658.0,
"step": 26860
},
{
"entropy": 5.436423921585083,
"epoch": 2.0901770083641313,
"grad_norm": 1.1640625,
"learning_rate": 0.0004558487414759773,
"loss": 4.966,
"mean_token_accuracy": 0.19730983078479766,
"num_tokens": 46599068.0,
"step": 26865
},
{
"entropy": 5.36162486076355,
"epoch": 2.090566037735849,
"grad_norm": 1.265625,
"learning_rate": 0.00045583225106978175,
"loss": 5.0335,
"mean_token_accuracy": 0.19394029229879378,
"num_tokens": 46608024.0,
"step": 26870
},
{
"entropy": 5.359584140777588,
"epoch": 2.0909550671075667,
"grad_norm": 1.1484375,
"learning_rate": 0.0004558157579197446,
"loss": 4.9736,
"mean_token_accuracy": 0.19705972373485564,
"num_tokens": 46616558.0,
"step": 26875
},
{
"entropy": 5.528281164169312,
"epoch": 2.091344096479284,
"grad_norm": 1.21875,
"learning_rate": 0.00045579926202611603,
"loss": 5.1875,
"mean_token_accuracy": 0.18382683247327805,
"num_tokens": 46624943.0,
"step": 26880
},
{
"entropy": 5.426905822753906,
"epoch": 2.0917331258510017,
"grad_norm": 1.140625,
"learning_rate": 0.0004557827633891465,
"loss": 5.0395,
"mean_token_accuracy": 0.1860797092318535,
"num_tokens": 46633753.0,
"step": 26885
},
{
"entropy": 5.431225824356079,
"epoch": 2.0921221552227194,
"grad_norm": 1.109375,
"learning_rate": 0.0004557662620090863,
"loss": 5.0634,
"mean_token_accuracy": 0.19505238384008408,
"num_tokens": 46642210.0,
"step": 26890
},
{
"entropy": 5.392735147476197,
"epoch": 2.092511184594437,
"grad_norm": 1.2890625,
"learning_rate": 0.00045574975788618564,
"loss": 5.0074,
"mean_token_accuracy": 0.19501732736825944,
"num_tokens": 46650327.0,
"step": 26895
},
{
"entropy": 5.313232040405273,
"epoch": 2.0929002139661543,
"grad_norm": 1.21875,
"learning_rate": 0.0004557332510206953,
"loss": 4.9385,
"mean_token_accuracy": 0.19272660762071608,
"num_tokens": 46659453.0,
"step": 26900
},
{
"entropy": 5.433003520965576,
"epoch": 2.093289243337872,
"grad_norm": 1.1875,
"learning_rate": 0.0004557167414128654,
"loss": 5.0056,
"mean_token_accuracy": 0.19829933643341063,
"num_tokens": 46667378.0,
"step": 26905
},
{
"entropy": 5.490343856811523,
"epoch": 2.0936782727095897,
"grad_norm": 1.2421875,
"learning_rate": 0.0004557002290629467,
"loss": 5.1895,
"mean_token_accuracy": 0.17928837686777116,
"num_tokens": 46675949.0,
"step": 26910
},
{
"entropy": 5.535121917724609,
"epoch": 2.094067302081307,
"grad_norm": 1.1328125,
"learning_rate": 0.00045568371397118954,
"loss": 5.1941,
"mean_token_accuracy": 0.18699836432933808,
"num_tokens": 46684808.0,
"step": 26915
},
{
"entropy": 5.40729660987854,
"epoch": 2.0944563314530247,
"grad_norm": 1.1796875,
"learning_rate": 0.0004556671961378446,
"loss": 5.0221,
"mean_token_accuracy": 0.19141003787517546,
"num_tokens": 46693209.0,
"step": 26920
},
{
"entropy": 5.36139063835144,
"epoch": 2.0948453608247424,
"grad_norm": 1.203125,
"learning_rate": 0.00045565067556316264,
"loss": 4.9969,
"mean_token_accuracy": 0.1984749048948288,
"num_tokens": 46702405.0,
"step": 26925
},
{
"entropy": 5.345081615447998,
"epoch": 2.0952343901964596,
"grad_norm": 1.1953125,
"learning_rate": 0.0004556341522473941,
"loss": 5.0207,
"mean_token_accuracy": 0.1929626151919365,
"num_tokens": 46711568.0,
"step": 26930
},
{
"entropy": 5.339298057556152,
"epoch": 2.0956234195681773,
"grad_norm": 1.1796875,
"learning_rate": 0.0004556176261907899,
"loss": 5.0499,
"mean_token_accuracy": 0.19528461694717408,
"num_tokens": 46719886.0,
"step": 26935
},
{
"entropy": 5.326263046264648,
"epoch": 2.096012448939895,
"grad_norm": 1.1640625,
"learning_rate": 0.0004556010973936006,
"loss": 4.881,
"mean_token_accuracy": 0.2002449467778206,
"num_tokens": 46728293.0,
"step": 26940
},
{
"entropy": 5.443757200241089,
"epoch": 2.0964014783116127,
"grad_norm": 1.203125,
"learning_rate": 0.0004555845658560772,
"loss": 5.0423,
"mean_token_accuracy": 0.18999491333961488,
"num_tokens": 46736730.0,
"step": 26945
},
{
"entropy": 5.433019018173217,
"epoch": 2.09679050768333,
"grad_norm": 1.1796875,
"learning_rate": 0.00045556803157847036,
"loss": 5.0969,
"mean_token_accuracy": 0.17930440604686737,
"num_tokens": 46745563.0,
"step": 26950
},
{
"entropy": 5.427082157135009,
"epoch": 2.0971795370550477,
"grad_norm": 1.140625,
"learning_rate": 0.00045555149456103113,
"loss": 5.0549,
"mean_token_accuracy": 0.19308394193649292,
"num_tokens": 46754285.0,
"step": 26955
},
{
"entropy": 5.422067546844483,
"epoch": 2.0975685664267654,
"grad_norm": 1.1484375,
"learning_rate": 0.0004555349548040102,
"loss": 5.0327,
"mean_token_accuracy": 0.1990979790687561,
"num_tokens": 46763114.0,
"step": 26960
},
{
"entropy": 5.410259199142456,
"epoch": 2.0979575957984826,
"grad_norm": 1.171875,
"learning_rate": 0.0004555184123076589,
"loss": 5.0285,
"mean_token_accuracy": 0.19594316482543944,
"num_tokens": 46771150.0,
"step": 26965
},
{
"entropy": 5.351689863204956,
"epoch": 2.0983466251702003,
"grad_norm": 1.234375,
"learning_rate": 0.00045550186707222785,
"loss": 4.9245,
"mean_token_accuracy": 0.20719084441661834,
"num_tokens": 46779955.0,
"step": 26970
},
{
"entropy": 5.40891695022583,
"epoch": 2.098735654541918,
"grad_norm": 1.2421875,
"learning_rate": 0.0004554853190979683,
"loss": 5.0733,
"mean_token_accuracy": 0.18659788370132446,
"num_tokens": 46788769.0,
"step": 26975
},
{
"entropy": 5.482321071624756,
"epoch": 2.0991246839136353,
"grad_norm": 1.6640625,
"learning_rate": 0.00045546876838513134,
"loss": 5.1317,
"mean_token_accuracy": 0.1859864577651024,
"num_tokens": 46797649.0,
"step": 26980
},
{
"entropy": 5.408661651611328,
"epoch": 2.099513713285353,
"grad_norm": 1.171875,
"learning_rate": 0.00045545221493396805,
"loss": 4.9716,
"mean_token_accuracy": 0.1966961666941643,
"num_tokens": 46806140.0,
"step": 26985
},
{
"entropy": 5.382923269271851,
"epoch": 2.0999027426570707,
"grad_norm": 1.1484375,
"learning_rate": 0.00045543565874472963,
"loss": 4.9412,
"mean_token_accuracy": 0.2030116155743599,
"num_tokens": 46815476.0,
"step": 26990
},
{
"entropy": 5.404881954193115,
"epoch": 2.1002917720287884,
"grad_norm": 1.2265625,
"learning_rate": 0.00045541909981766725,
"loss": 5.0788,
"mean_token_accuracy": 0.18919163644313813,
"num_tokens": 46824171.0,
"step": 26995
},
{
"entropy": 5.400956630706787,
"epoch": 2.1006808014005056,
"grad_norm": 1.1953125,
"learning_rate": 0.0004554025381530322,
"loss": 4.9268,
"mean_token_accuracy": 0.20240044891834258,
"num_tokens": 46832474.0,
"step": 27000
},
{
"epoch": 2.1006808014005056,
"eval_entropy": 5.2443842735510815,
"eval_loss": 5.188738822937012,
"eval_mean_token_accuracy": 0.19393767530925005,
"eval_num_tokens": 46832474.0,
"eval_runtime": 28.7782,
"eval_samples_per_second": 1444.078,
"eval_steps_per_second": 180.518,
"step": 27000
},
{
"entropy": 5.3701338291168215,
"epoch": 2.1010698307722233,
"grad_norm": 1.1875,
"learning_rate": 0.0004553859737510758,
"loss": 4.9226,
"mean_token_accuracy": 0.19896375089883805,
"num_tokens": 46840626.0,
"step": 27005
},
{
"entropy": 5.311578321456909,
"epoch": 2.101458860143941,
"grad_norm": 1.265625,
"learning_rate": 0.0004553694066120493,
"loss": 4.9011,
"mean_token_accuracy": 0.20198492407798768,
"num_tokens": 46849626.0,
"step": 27010
},
{
"entropy": 5.444884252548218,
"epoch": 2.1018478895156583,
"grad_norm": 1.1171875,
"learning_rate": 0.00045535283673620426,
"loss": 5.0785,
"mean_token_accuracy": 0.1882991224527359,
"num_tokens": 46858520.0,
"step": 27015
},
{
"entropy": 5.412739229202271,
"epoch": 2.102236918887376,
"grad_norm": 1.171875,
"learning_rate": 0.00045533626412379194,
"loss": 5.0346,
"mean_token_accuracy": 0.19366132020950316,
"num_tokens": 46866532.0,
"step": 27020
},
{
"entropy": 5.424739742279053,
"epoch": 2.1026259482590937,
"grad_norm": 1.1953125,
"learning_rate": 0.0004553196887750638,
"loss": 5.0885,
"mean_token_accuracy": 0.18926024734973906,
"num_tokens": 46875815.0,
"step": 27025
},
{
"entropy": 5.41136679649353,
"epoch": 2.103014977630811,
"grad_norm": 1.171875,
"learning_rate": 0.0004553031106902714,
"loss": 5.0172,
"mean_token_accuracy": 0.18723538219928743,
"num_tokens": 46884708.0,
"step": 27030
},
{
"entropy": 5.402665853500366,
"epoch": 2.1034040070025286,
"grad_norm": 1.09375,
"learning_rate": 0.00045528652986966627,
"loss": 4.9332,
"mean_token_accuracy": 0.20395986884832382,
"num_tokens": 46894089.0,
"step": 27035
},
{
"entropy": 5.510696029663086,
"epoch": 2.1037930363742463,
"grad_norm": 1.234375,
"learning_rate": 0.00045526994631350006,
"loss": 5.1411,
"mean_token_accuracy": 0.1866295874118805,
"num_tokens": 46903318.0,
"step": 27040
},
{
"entropy": 5.362477016448975,
"epoch": 2.104182065745964,
"grad_norm": 1.234375,
"learning_rate": 0.0004552533600220243,
"loss": 4.9536,
"mean_token_accuracy": 0.1979716658592224,
"num_tokens": 46912138.0,
"step": 27045
},
{
"entropy": 5.418417930603027,
"epoch": 2.1045710951176813,
"grad_norm": 1.3671875,
"learning_rate": 0.00045523677099549073,
"loss": 4.9957,
"mean_token_accuracy": 0.19296849519014359,
"num_tokens": 46919544.0,
"step": 27050
},
{
"entropy": 5.420910310745239,
"epoch": 2.104960124489399,
"grad_norm": 1.2265625,
"learning_rate": 0.000455220179234151,
"loss": 5.1251,
"mean_token_accuracy": 0.18568834364414216,
"num_tokens": 46928760.0,
"step": 27055
},
{
"entropy": 5.37098650932312,
"epoch": 2.1053491538611167,
"grad_norm": 1.203125,
"learning_rate": 0.0004552035847382569,
"loss": 5.0448,
"mean_token_accuracy": 0.19538137763738633,
"num_tokens": 46936860.0,
"step": 27060
},
{
"entropy": 5.445346736907959,
"epoch": 2.105738183232834,
"grad_norm": 1.171875,
"learning_rate": 0.00045518698750806024,
"loss": 5.0186,
"mean_token_accuracy": 0.19173202365636827,
"num_tokens": 46945157.0,
"step": 27065
},
{
"entropy": 5.484525585174561,
"epoch": 2.1061272126045516,
"grad_norm": 1.2890625,
"learning_rate": 0.00045517038754381287,
"loss": 5.0538,
"mean_token_accuracy": 0.1877843677997589,
"num_tokens": 46954006.0,
"step": 27070
},
{
"entropy": 5.336861562728882,
"epoch": 2.1065162419762693,
"grad_norm": 1.171875,
"learning_rate": 0.0004551537848457666,
"loss": 4.9865,
"mean_token_accuracy": 0.20204476416110992,
"num_tokens": 46962437.0,
"step": 27075
},
{
"entropy": 5.451944351196289,
"epoch": 2.106905271347987,
"grad_norm": 1.2421875,
"learning_rate": 0.0004551371794141734,
"loss": 5.126,
"mean_token_accuracy": 0.19191298633813858,
"num_tokens": 46972379.0,
"step": 27080
},
{
"entropy": 5.492428350448608,
"epoch": 2.1072943007197042,
"grad_norm": 1.1015625,
"learning_rate": 0.0004551205712492852,
"loss": 5.0779,
"mean_token_accuracy": 0.1879526138305664,
"num_tokens": 46981410.0,
"step": 27085
},
{
"entropy": 5.40231876373291,
"epoch": 2.107683330091422,
"grad_norm": 1.1875,
"learning_rate": 0.0004551039603513541,
"loss": 4.9213,
"mean_token_accuracy": 0.19685385823249818,
"num_tokens": 46989662.0,
"step": 27090
},
{
"entropy": 5.426345109939575,
"epoch": 2.1080723594631396,
"grad_norm": 1.265625,
"learning_rate": 0.00045508734672063204,
"loss": 5.074,
"mean_token_accuracy": 0.18965485095977783,
"num_tokens": 46998726.0,
"step": 27095
},
{
"entropy": 5.451350259780884,
"epoch": 2.108461388834857,
"grad_norm": 1.2265625,
"learning_rate": 0.0004550707303573711,
"loss": 5.0821,
"mean_token_accuracy": 0.1931113436818123,
"num_tokens": 47006980.0,
"step": 27100
},
{
"entropy": 5.378539133071899,
"epoch": 2.1088504182065746,
"grad_norm": 1.2265625,
"learning_rate": 0.00045505411126182347,
"loss": 5.1005,
"mean_token_accuracy": 0.18363668918609619,
"num_tokens": 47015693.0,
"step": 27105
},
{
"entropy": 5.412285470962525,
"epoch": 2.1092394475782923,
"grad_norm": 1.1484375,
"learning_rate": 0.0004550374894342412,
"loss": 5.0056,
"mean_token_accuracy": 0.20311692208051682,
"num_tokens": 47024256.0,
"step": 27110
},
{
"entropy": 5.442031002044677,
"epoch": 2.1096284769500095,
"grad_norm": 1.1640625,
"learning_rate": 0.0004550208648748767,
"loss": 5.0952,
"mean_token_accuracy": 0.18307921588420867,
"num_tokens": 47032962.0,
"step": 27115
},
{
"entropy": 5.4221882820129395,
"epoch": 2.1100175063217272,
"grad_norm": 1.25,
"learning_rate": 0.000455004237583982,
"loss": 5.0644,
"mean_token_accuracy": 0.1888999417424202,
"num_tokens": 47041507.0,
"step": 27120
},
{
"entropy": 5.352731466293335,
"epoch": 2.110406535693445,
"grad_norm": 1.234375,
"learning_rate": 0.0004549876075618096,
"loss": 4.9759,
"mean_token_accuracy": 0.19842923879623414,
"num_tokens": 47050088.0,
"step": 27125
},
{
"entropy": 5.481393051147461,
"epoch": 2.110795565065162,
"grad_norm": 1.25,
"learning_rate": 0.0004549709748086117,
"loss": 5.1536,
"mean_token_accuracy": 0.18580325245857238,
"num_tokens": 47058900.0,
"step": 27130
},
{
"entropy": 5.455089569091797,
"epoch": 2.11118459443688,
"grad_norm": 1.1796875,
"learning_rate": 0.00045495433932464063,
"loss": 5.0261,
"mean_token_accuracy": 0.18857346028089522,
"num_tokens": 47067689.0,
"step": 27135
},
{
"entropy": 5.367141914367676,
"epoch": 2.1115736238085976,
"grad_norm": 1.1015625,
"learning_rate": 0.000454937701110149,
"loss": 4.9791,
"mean_token_accuracy": 0.19628666937351227,
"num_tokens": 47076309.0,
"step": 27140
},
{
"entropy": 5.408430767059326,
"epoch": 2.1119626531803153,
"grad_norm": 1.2578125,
"learning_rate": 0.00045492106016538917,
"loss": 4.9836,
"mean_token_accuracy": 0.20380158275365828,
"num_tokens": 47084462.0,
"step": 27145
},
{
"entropy": 5.420516586303711,
"epoch": 2.1123516825520325,
"grad_norm": 1.15625,
"learning_rate": 0.00045490441649061354,
"loss": 5.0916,
"mean_token_accuracy": 0.19081518203020095,
"num_tokens": 47093586.0,
"step": 27150
},
{
"entropy": 5.398988866806031,
"epoch": 2.1127407119237502,
"grad_norm": 1.3125,
"learning_rate": 0.0004548877700860747,
"loss": 4.9879,
"mean_token_accuracy": 0.1962234139442444,
"num_tokens": 47101296.0,
"step": 27155
},
{
"entropy": 5.407206583023071,
"epoch": 2.113129741295468,
"grad_norm": 1.1953125,
"learning_rate": 0.00045487112095202544,
"loss": 5.0807,
"mean_token_accuracy": 0.19050924032926558,
"num_tokens": 47110033.0,
"step": 27160
},
{
"entropy": 5.371621417999267,
"epoch": 2.113518770667185,
"grad_norm": 1.28125,
"learning_rate": 0.0004548544690887181,
"loss": 5.1178,
"mean_token_accuracy": 0.18248849213123322,
"num_tokens": 47119292.0,
"step": 27165
},
{
"entropy": 5.487767219543457,
"epoch": 2.113907800038903,
"grad_norm": 1.234375,
"learning_rate": 0.0004548378144964054,
"loss": 5.0737,
"mean_token_accuracy": 0.1920868679881096,
"num_tokens": 47128081.0,
"step": 27170
},
{
"entropy": 5.533500480651855,
"epoch": 2.1142968294106206,
"grad_norm": 1.46875,
"learning_rate": 0.00045482115717534024,
"loss": 5.0876,
"mean_token_accuracy": 0.18885562419891358,
"num_tokens": 47136639.0,
"step": 27175
},
{
"entropy": 5.467253303527832,
"epoch": 2.1146858587823383,
"grad_norm": 1.28125,
"learning_rate": 0.0004548044971257752,
"loss": 5.1301,
"mean_token_accuracy": 0.18584033399820327,
"num_tokens": 47145830.0,
"step": 27180
},
{
"entropy": 5.396470165252685,
"epoch": 2.1150748881540555,
"grad_norm": 1.2265625,
"learning_rate": 0.00045478783434796307,
"loss": 5.0626,
"mean_token_accuracy": 0.18549806177616118,
"num_tokens": 47154695.0,
"step": 27185
},
{
"entropy": 5.433965063095092,
"epoch": 2.1154639175257732,
"grad_norm": 1.1796875,
"learning_rate": 0.00045477116884215675,
"loss": 5.0895,
"mean_token_accuracy": 0.1890840858221054,
"num_tokens": 47163818.0,
"step": 27190
},
{
"entropy": 5.428095293045044,
"epoch": 2.115852946897491,
"grad_norm": 1.2421875,
"learning_rate": 0.000454754500608609,
"loss": 4.9794,
"mean_token_accuracy": 0.19849276244640351,
"num_tokens": 47172426.0,
"step": 27195
},
{
"entropy": 5.439114332199097,
"epoch": 2.116241976269208,
"grad_norm": 1.1328125,
"learning_rate": 0.0004547378296475729,
"loss": 5.1755,
"mean_token_accuracy": 0.18009322881698608,
"num_tokens": 47182034.0,
"step": 27200
},
{
"entropy": 5.361409521102905,
"epoch": 2.116631005640926,
"grad_norm": 1.1484375,
"learning_rate": 0.00045472115595930124,
"loss": 5.0471,
"mean_token_accuracy": 0.18783133774995803,
"num_tokens": 47190968.0,
"step": 27205
},
{
"entropy": 5.356281280517578,
"epoch": 2.1170200350126436,
"grad_norm": 1.15625,
"learning_rate": 0.00045470447954404716,
"loss": 4.949,
"mean_token_accuracy": 0.19387365728616715,
"num_tokens": 47199917.0,
"step": 27210
},
{
"entropy": 5.433262300491333,
"epoch": 2.117409064384361,
"grad_norm": 1.40625,
"learning_rate": 0.00045468780040206364,
"loss": 5.0744,
"mean_token_accuracy": 0.18901672065258027,
"num_tokens": 47208467.0,
"step": 27215
},
{
"entropy": 5.353519248962402,
"epoch": 2.1177980937560785,
"grad_norm": 1.1875,
"learning_rate": 0.0004546711185336037,
"loss": 5.0201,
"mean_token_accuracy": 0.19732898473739624,
"num_tokens": 47216784.0,
"step": 27220
},
{
"entropy": 5.442028331756592,
"epoch": 2.1181871231277962,
"grad_norm": 1.203125,
"learning_rate": 0.00045465443393892047,
"loss": 5.1073,
"mean_token_accuracy": 0.19494381844997405,
"num_tokens": 47226215.0,
"step": 27225
},
{
"entropy": 5.434804821014405,
"epoch": 2.118576152499514,
"grad_norm": 1.1796875,
"learning_rate": 0.0004546377466182673,
"loss": 5.0126,
"mean_token_accuracy": 0.1979151412844658,
"num_tokens": 47234952.0,
"step": 27230
},
{
"entropy": 5.484819555282593,
"epoch": 2.118965181871231,
"grad_norm": 1.1796875,
"learning_rate": 0.0004546210565718972,
"loss": 5.0852,
"mean_token_accuracy": 0.18474817872047425,
"num_tokens": 47243897.0,
"step": 27235
},
{
"entropy": 5.3915454864501955,
"epoch": 2.119354211242949,
"grad_norm": 1.1953125,
"learning_rate": 0.00045460436380006337,
"loss": 5.0331,
"mean_token_accuracy": 0.19334942549467088,
"num_tokens": 47252171.0,
"step": 27240
},
{
"entropy": 5.414375734329224,
"epoch": 2.1197432406146666,
"grad_norm": 1.203125,
"learning_rate": 0.0004545876683030192,
"loss": 5.03,
"mean_token_accuracy": 0.1971109017729759,
"num_tokens": 47260494.0,
"step": 27245
},
{
"entropy": 5.505883979797363,
"epoch": 2.120132269986384,
"grad_norm": 1.1796875,
"learning_rate": 0.0004545709700810181,
"loss": 5.191,
"mean_token_accuracy": 0.1849369525909424,
"num_tokens": 47269485.0,
"step": 27250
},
{
"entropy": 5.333215141296387,
"epoch": 2.1205212993581015,
"grad_norm": 1.1875,
"learning_rate": 0.0004545542691343133,
"loss": 4.8785,
"mean_token_accuracy": 0.2028707131743431,
"num_tokens": 47278275.0,
"step": 27255
},
{
"entropy": 5.413893842697144,
"epoch": 2.120910328729819,
"grad_norm": 1.1953125,
"learning_rate": 0.0004545375654631582,
"loss": 4.9926,
"mean_token_accuracy": 0.1939173683524132,
"num_tokens": 47287267.0,
"step": 27260
},
{
"entropy": 5.416305208206177,
"epoch": 2.1212993581015365,
"grad_norm": 1.28125,
"learning_rate": 0.00045452085906780645,
"loss": 5.108,
"mean_token_accuracy": 0.18502960205078126,
"num_tokens": 47295785.0,
"step": 27265
},
{
"entropy": 5.423351669311524,
"epoch": 2.121688387473254,
"grad_norm": 1.1953125,
"learning_rate": 0.00045450414994851123,
"loss": 5.0485,
"mean_token_accuracy": 0.1979637160897255,
"num_tokens": 47303951.0,
"step": 27270
},
{
"entropy": 5.388854598999023,
"epoch": 2.122077416844972,
"grad_norm": 1.2890625,
"learning_rate": 0.00045448743810552636,
"loss": 5.0354,
"mean_token_accuracy": 0.19156427234411239,
"num_tokens": 47312226.0,
"step": 27275
},
{
"entropy": 5.396623992919922,
"epoch": 2.1224664462166896,
"grad_norm": 1.2578125,
"learning_rate": 0.00045447072353910537,
"loss": 5.104,
"mean_token_accuracy": 0.19335343241691588,
"num_tokens": 47320657.0,
"step": 27280
},
{
"entropy": 5.398326349258423,
"epoch": 2.122855475588407,
"grad_norm": 1.1796875,
"learning_rate": 0.0004544540062495016,
"loss": 5.0316,
"mean_token_accuracy": 0.20122999995946883,
"num_tokens": 47329063.0,
"step": 27285
},
{
"entropy": 5.40952959060669,
"epoch": 2.1232445049601245,
"grad_norm": 1.1953125,
"learning_rate": 0.00045443728623696905,
"loss": 4.9976,
"mean_token_accuracy": 0.19026436954736708,
"num_tokens": 47338304.0,
"step": 27290
},
{
"entropy": 5.3901762008667,
"epoch": 2.123633534331842,
"grad_norm": 1.28125,
"learning_rate": 0.00045442056350176123,
"loss": 5.1097,
"mean_token_accuracy": 0.18816337138414382,
"num_tokens": 47347248.0,
"step": 27295
},
{
"entropy": 5.422716856002808,
"epoch": 2.1240225637035595,
"grad_norm": 1.171875,
"learning_rate": 0.000454403838044132,
"loss": 5.0977,
"mean_token_accuracy": 0.1896965757012367,
"num_tokens": 47356586.0,
"step": 27300
},
{
"entropy": 5.48693995475769,
"epoch": 2.124411593075277,
"grad_norm": 1.171875,
"learning_rate": 0.000454387109864335,
"loss": 4.9815,
"mean_token_accuracy": 0.19274987429380416,
"num_tokens": 47365195.0,
"step": 27305
},
{
"entropy": 5.458338975906372,
"epoch": 2.124800622446995,
"grad_norm": 1.1171875,
"learning_rate": 0.00045437037896262425,
"loss": 5.1643,
"mean_token_accuracy": 0.1850208282470703,
"num_tokens": 47374154.0,
"step": 27310
},
{
"entropy": 5.451310110092163,
"epoch": 2.125189651818712,
"grad_norm": 1.1328125,
"learning_rate": 0.0004543536453392534,
"loss": 4.9853,
"mean_token_accuracy": 0.19751841723918914,
"num_tokens": 47383253.0,
"step": 27315
},
{
"entropy": 5.453739213943481,
"epoch": 2.12557868119043,
"grad_norm": 1.1796875,
"learning_rate": 0.00045433690899447643,
"loss": 5.0564,
"mean_token_accuracy": 0.19325630664825438,
"num_tokens": 47391387.0,
"step": 27320
},
{
"entropy": 5.433286666870117,
"epoch": 2.1259677105621475,
"grad_norm": 1.1328125,
"learning_rate": 0.00045432016992854734,
"loss": 5.0727,
"mean_token_accuracy": 0.1916116639971733,
"num_tokens": 47400294.0,
"step": 27325
},
{
"entropy": 5.426382923126221,
"epoch": 2.126356739933865,
"grad_norm": 1.0625,
"learning_rate": 0.0004543034281417201,
"loss": 5.0079,
"mean_token_accuracy": 0.19289129674434663,
"num_tokens": 47409024.0,
"step": 27330
},
{
"entropy": 5.438505983352661,
"epoch": 2.1267457693055825,
"grad_norm": 1.3359375,
"learning_rate": 0.0004542866836342488,
"loss": 4.9875,
"mean_token_accuracy": 0.19781879484653472,
"num_tokens": 47416974.0,
"step": 27335
},
{
"entropy": 5.39802565574646,
"epoch": 2.1271347986773,
"grad_norm": 1.3203125,
"learning_rate": 0.0004542699364063873,
"loss": 5.13,
"mean_token_accuracy": 0.18701911717653275,
"num_tokens": 47425934.0,
"step": 27340
},
{
"entropy": 5.337941646575928,
"epoch": 2.127523828049018,
"grad_norm": 1.15625,
"learning_rate": 0.0004542531864583899,
"loss": 5.0831,
"mean_token_accuracy": 0.18908189088106156,
"num_tokens": 47434764.0,
"step": 27345
},
{
"entropy": 5.5233073234558105,
"epoch": 2.127912857420735,
"grad_norm": 1.171875,
"learning_rate": 0.0004542364337905108,
"loss": 5.111,
"mean_token_accuracy": 0.18030160516500474,
"num_tokens": 47443435.0,
"step": 27350
},
{
"entropy": 5.499994373321533,
"epoch": 2.128301886792453,
"grad_norm": 1.2109375,
"learning_rate": 0.00045421967840300403,
"loss": 5.1629,
"mean_token_accuracy": 0.1872631773352623,
"num_tokens": 47452109.0,
"step": 27355
},
{
"entropy": 5.412526655197143,
"epoch": 2.1286909161641705,
"grad_norm": 1.21875,
"learning_rate": 0.0004542029202961239,
"loss": 4.9783,
"mean_token_accuracy": 0.199757918715477,
"num_tokens": 47460319.0,
"step": 27360
},
{
"entropy": 5.466550731658936,
"epoch": 2.1290799455358878,
"grad_norm": 1.2890625,
"learning_rate": 0.00045418615947012464,
"loss": 5.1539,
"mean_token_accuracy": 0.18268648087978362,
"num_tokens": 47468806.0,
"step": 27365
},
{
"entropy": 5.446540594100952,
"epoch": 2.1294689749076054,
"grad_norm": 1.28125,
"learning_rate": 0.0004541693959252607,
"loss": 5.0701,
"mean_token_accuracy": 0.18990662544965745,
"num_tokens": 47477121.0,
"step": 27370
},
{
"entropy": 5.273397064208984,
"epoch": 2.129858004279323,
"grad_norm": 1.1953125,
"learning_rate": 0.00045415262966178635,
"loss": 4.8916,
"mean_token_accuracy": 0.2019251748919487,
"num_tokens": 47485379.0,
"step": 27375
},
{
"entropy": 5.417995834350586,
"epoch": 2.130247033651041,
"grad_norm": 1.15625,
"learning_rate": 0.0004541358606799559,
"loss": 5.0672,
"mean_token_accuracy": 0.18538389205932618,
"num_tokens": 47493402.0,
"step": 27380
},
{
"entropy": 5.487518310546875,
"epoch": 2.130636063022758,
"grad_norm": 1.4921875,
"learning_rate": 0.000454119088980024,
"loss": 5.0628,
"mean_token_accuracy": 0.19000712186098098,
"num_tokens": 47503148.0,
"step": 27385
},
{
"entropy": 5.384900712966919,
"epoch": 2.131025092394476,
"grad_norm": 1.28125,
"learning_rate": 0.0004541023145622449,
"loss": 4.9881,
"mean_token_accuracy": 0.1931207150220871,
"num_tokens": 47511681.0,
"step": 27390
},
{
"entropy": 5.352813673019409,
"epoch": 2.1314141217661935,
"grad_norm": 1.3203125,
"learning_rate": 0.00045408553742687336,
"loss": 4.9619,
"mean_token_accuracy": 0.20091713964939117,
"num_tokens": 47520240.0,
"step": 27395
},
{
"entropy": 5.412619972229004,
"epoch": 2.1318031511379107,
"grad_norm": 1.15625,
"learning_rate": 0.0004540687575741638,
"loss": 5.0347,
"mean_token_accuracy": 0.1903489887714386,
"num_tokens": 47528553.0,
"step": 27400
},
{
"entropy": 5.42325119972229,
"epoch": 2.1321921805096284,
"grad_norm": 1.734375,
"learning_rate": 0.00045405197500437077,
"loss": 5.0904,
"mean_token_accuracy": 0.18802190124988555,
"num_tokens": 47537735.0,
"step": 27405
},
{
"entropy": 5.362662696838379,
"epoch": 2.132581209881346,
"grad_norm": 1.265625,
"learning_rate": 0.00045403518971774915,
"loss": 4.9441,
"mean_token_accuracy": 0.19960884749889374,
"num_tokens": 47545251.0,
"step": 27410
},
{
"entropy": 5.423771762847901,
"epoch": 2.132970239253064,
"grad_norm": 1.2734375,
"learning_rate": 0.00045401840171455343,
"loss": 5.0565,
"mean_token_accuracy": 0.1871227130293846,
"num_tokens": 47553962.0,
"step": 27415
},
{
"entropy": 5.423448276519776,
"epoch": 2.133359268624781,
"grad_norm": 1.21875,
"learning_rate": 0.0004540016109950384,
"loss": 5.0996,
"mean_token_accuracy": 0.18990655541419982,
"num_tokens": 47562401.0,
"step": 27420
},
{
"entropy": 5.422951555252075,
"epoch": 2.133748297996499,
"grad_norm": 1.2109375,
"learning_rate": 0.0004539848175594589,
"loss": 5.0317,
"mean_token_accuracy": 0.19416000843048095,
"num_tokens": 47570097.0,
"step": 27425
},
{
"entropy": 5.475415658950806,
"epoch": 2.1341373273682165,
"grad_norm": 1.1953125,
"learning_rate": 0.0004539680214080695,
"loss": 5.0814,
"mean_token_accuracy": 0.1903100371360779,
"num_tokens": 47578705.0,
"step": 27430
},
{
"entropy": 5.37512845993042,
"epoch": 2.1345263567399337,
"grad_norm": 1.1875,
"learning_rate": 0.00045395122254112536,
"loss": 5.0731,
"mean_token_accuracy": 0.18882074654102327,
"num_tokens": 47588075.0,
"step": 27435
},
{
"entropy": 5.346720886230469,
"epoch": 2.1349153861116514,
"grad_norm": 1.1953125,
"learning_rate": 0.0004539344209588812,
"loss": 4.9931,
"mean_token_accuracy": 0.19903385490179062,
"num_tokens": 47596906.0,
"step": 27440
},
{
"entropy": 5.4231939792633055,
"epoch": 2.135304415483369,
"grad_norm": 1.1171875,
"learning_rate": 0.00045391761666159204,
"loss": 5.0236,
"mean_token_accuracy": 0.20138135999441148,
"num_tokens": 47605427.0,
"step": 27445
},
{
"entropy": 5.53788914680481,
"epoch": 2.1356934448550864,
"grad_norm": 1.265625,
"learning_rate": 0.00045390080964951294,
"loss": 5.186,
"mean_token_accuracy": 0.1803354024887085,
"num_tokens": 47614249.0,
"step": 27450
},
{
"entropy": 5.372472953796387,
"epoch": 2.136082474226804,
"grad_norm": 1.0859375,
"learning_rate": 0.00045388399992289864,
"loss": 4.9681,
"mean_token_accuracy": 0.19113119095563888,
"num_tokens": 47623200.0,
"step": 27455
},
{
"entropy": 5.446621227264404,
"epoch": 2.136471503598522,
"grad_norm": 1.109375,
"learning_rate": 0.00045386718748200436,
"loss": 5.1017,
"mean_token_accuracy": 0.1875411555171013,
"num_tokens": 47632392.0,
"step": 27460
},
{
"entropy": 5.5249659538269045,
"epoch": 2.136860532970239,
"grad_norm": 1.171875,
"learning_rate": 0.00045385037232708534,
"loss": 5.1688,
"mean_token_accuracy": 0.18353452235460282,
"num_tokens": 47641648.0,
"step": 27465
},
{
"entropy": 5.427525997161865,
"epoch": 2.1372495623419567,
"grad_norm": 1.21875,
"learning_rate": 0.0004538335544583964,
"loss": 5.0242,
"mean_token_accuracy": 0.19735799580812455,
"num_tokens": 47651113.0,
"step": 27470
},
{
"entropy": 5.462687063217163,
"epoch": 2.1376385917136744,
"grad_norm": 1.1875,
"learning_rate": 0.00045381673387619306,
"loss": 5.2084,
"mean_token_accuracy": 0.1848178908228874,
"num_tokens": 47659959.0,
"step": 27475
},
{
"entropy": 5.458264541625977,
"epoch": 2.138027621085392,
"grad_norm": 1.0859375,
"learning_rate": 0.00045379991058073035,
"loss": 5.1133,
"mean_token_accuracy": 0.18951049745082854,
"num_tokens": 47668738.0,
"step": 27480
},
{
"entropy": 5.390614032745361,
"epoch": 2.1384166504571094,
"grad_norm": 1.09375,
"learning_rate": 0.0004537830845722636,
"loss": 4.9917,
"mean_token_accuracy": 0.19768296033143998,
"num_tokens": 47677268.0,
"step": 27485
},
{
"entropy": 5.3781016826629635,
"epoch": 2.138805679828827,
"grad_norm": 1.234375,
"learning_rate": 0.0004537662558510481,
"loss": 4.9604,
"mean_token_accuracy": 0.2018340051174164,
"num_tokens": 47685339.0,
"step": 27490
},
{
"entropy": 5.467798519134521,
"epoch": 2.1391947092005448,
"grad_norm": 1.171875,
"learning_rate": 0.00045374942441733925,
"loss": 5.0525,
"mean_token_accuracy": 0.18897547125816344,
"num_tokens": 47694729.0,
"step": 27495
},
{
"entropy": 5.370080423355103,
"epoch": 2.139583738572262,
"grad_norm": 1.2421875,
"learning_rate": 0.0004537325902713923,
"loss": 5.0359,
"mean_token_accuracy": 0.19038586616516112,
"num_tokens": 47703555.0,
"step": 27500
},
{
"entropy": 5.391144132614135,
"epoch": 2.1399727679439797,
"grad_norm": 1.1171875,
"learning_rate": 0.0004537157534134629,
"loss": 5.091,
"mean_token_accuracy": 0.18459475338459014,
"num_tokens": 47713115.0,
"step": 27505
},
{
"entropy": 5.441892147064209,
"epoch": 2.1403617973156974,
"grad_norm": 1.1875,
"learning_rate": 0.00045369891384380623,
"loss": 5.0974,
"mean_token_accuracy": 0.19319476038217545,
"num_tokens": 47722263.0,
"step": 27510
},
{
"entropy": 5.462020492553711,
"epoch": 2.140750826687415,
"grad_norm": 1.234375,
"learning_rate": 0.0004536820715626781,
"loss": 5.0545,
"mean_token_accuracy": 0.19235535264015197,
"num_tokens": 47730037.0,
"step": 27515
},
{
"entropy": 5.369777488708496,
"epoch": 2.1411398560591324,
"grad_norm": 1.2421875,
"learning_rate": 0.00045366522657033385,
"loss": 4.9974,
"mean_token_accuracy": 0.20412270873785018,
"num_tokens": 47738968.0,
"step": 27520
},
{
"entropy": 5.416019344329834,
"epoch": 2.14152888543085,
"grad_norm": 1.234375,
"learning_rate": 0.00045364837886702924,
"loss": 5.0061,
"mean_token_accuracy": 0.19915127009153366,
"num_tokens": 47747515.0,
"step": 27525
},
{
"entropy": 5.422030448913574,
"epoch": 2.1419179148025678,
"grad_norm": 1.234375,
"learning_rate": 0.0004536315284530198,
"loss": 4.9994,
"mean_token_accuracy": 0.2012669786810875,
"num_tokens": 47756440.0,
"step": 27530
},
{
"entropy": 5.402505779266358,
"epoch": 2.142306944174285,
"grad_norm": 1.0703125,
"learning_rate": 0.0004536146753285612,
"loss": 5.0569,
"mean_token_accuracy": 0.18509171307086944,
"num_tokens": 47765823.0,
"step": 27535
},
{
"entropy": 5.4289562702178955,
"epoch": 2.1426959735460027,
"grad_norm": 1.109375,
"learning_rate": 0.0004535978194939093,
"loss": 5.0336,
"mean_token_accuracy": 0.1928941786289215,
"num_tokens": 47775423.0,
"step": 27540
},
{
"entropy": 5.436025476455688,
"epoch": 2.1430850029177204,
"grad_norm": 1.1171875,
"learning_rate": 0.00045358096094931966,
"loss": 5.0845,
"mean_token_accuracy": 0.18637435436248778,
"num_tokens": 47784276.0,
"step": 27545
},
{
"entropy": 5.419500255584717,
"epoch": 2.1434740322894377,
"grad_norm": 1.203125,
"learning_rate": 0.0004535640996950482,
"loss": 4.9853,
"mean_token_accuracy": 0.19802622348070145,
"num_tokens": 47792608.0,
"step": 27550
},
{
"entropy": 5.375155353546143,
"epoch": 2.1438630616611554,
"grad_norm": 1.171875,
"learning_rate": 0.0004535472357313507,
"loss": 5.082,
"mean_token_accuracy": 0.19032421559095383,
"num_tokens": 47802356.0,
"step": 27555
},
{
"entropy": 5.437775707244873,
"epoch": 2.144252091032873,
"grad_norm": 1.1484375,
"learning_rate": 0.00045353036905848316,
"loss": 5.0404,
"mean_token_accuracy": 0.19040705561637877,
"num_tokens": 47811307.0,
"step": 27560
},
{
"entropy": 5.542190170288086,
"epoch": 2.1446411204045903,
"grad_norm": 1.109375,
"learning_rate": 0.0004535134996767014,
"loss": 5.1904,
"mean_token_accuracy": 0.18149494379758835,
"num_tokens": 47820572.0,
"step": 27565
},
{
"entropy": 5.5153295516967775,
"epoch": 2.145030149776308,
"grad_norm": 1.2265625,
"learning_rate": 0.0004534966275862614,
"loss": 5.123,
"mean_token_accuracy": 0.18893694281578063,
"num_tokens": 47829053.0,
"step": 27570
},
{
"entropy": 5.47025203704834,
"epoch": 2.1454191791480257,
"grad_norm": 1.21875,
"learning_rate": 0.0004534797527874192,
"loss": 5.0461,
"mean_token_accuracy": 0.19064956158399582,
"num_tokens": 47838244.0,
"step": 27575
},
{
"entropy": 5.41400728225708,
"epoch": 2.1458082085197434,
"grad_norm": 1.3125,
"learning_rate": 0.00045346287528043083,
"loss": 4.9874,
"mean_token_accuracy": 0.1956263303756714,
"num_tokens": 47846908.0,
"step": 27580
},
{
"entropy": 5.44817795753479,
"epoch": 2.1461972378914607,
"grad_norm": 1.34375,
"learning_rate": 0.00045344599506555244,
"loss": 5.1003,
"mean_token_accuracy": 0.19207569360733032,
"num_tokens": 47855824.0,
"step": 27585
},
{
"entropy": 5.3649743556976315,
"epoch": 2.1465862672631784,
"grad_norm": 1.1484375,
"learning_rate": 0.00045342911214304,
"loss": 4.9823,
"mean_token_accuracy": 0.19559280723333358,
"num_tokens": 47864641.0,
"step": 27590
},
{
"entropy": 5.441096067428589,
"epoch": 2.146975296634896,
"grad_norm": 1.25,
"learning_rate": 0.0004534122265131498,
"loss": 5.1482,
"mean_token_accuracy": 0.18639719784259795,
"num_tokens": 47873721.0,
"step": 27595
},
{
"entropy": 5.429397106170654,
"epoch": 2.1473643260066133,
"grad_norm": 1.1796875,
"learning_rate": 0.00045339533817613807,
"loss": 4.9616,
"mean_token_accuracy": 0.20429880321025848,
"num_tokens": 47882485.0,
"step": 27600
},
{
"entropy": 5.387918186187744,
"epoch": 2.147753355378331,
"grad_norm": 1.1484375,
"learning_rate": 0.00045337844713226106,
"loss": 4.9434,
"mean_token_accuracy": 0.1943691313266754,
"num_tokens": 47891574.0,
"step": 27605
},
{
"entropy": 5.316628503799438,
"epoch": 2.1481423847500487,
"grad_norm": 1.171875,
"learning_rate": 0.00045336155338177497,
"loss": 4.9298,
"mean_token_accuracy": 0.2003473773598671,
"num_tokens": 47900123.0,
"step": 27610
},
{
"entropy": 5.388540744781494,
"epoch": 2.1485314141217664,
"grad_norm": 1.1328125,
"learning_rate": 0.0004533446569249362,
"loss": 5.0483,
"mean_token_accuracy": 0.19877819269895552,
"num_tokens": 47908342.0,
"step": 27615
},
{
"entropy": 5.402663993835449,
"epoch": 2.1489204434934837,
"grad_norm": 1.171875,
"learning_rate": 0.00045332775776200116,
"loss": 5.0099,
"mean_token_accuracy": 0.1972378358244896,
"num_tokens": 47917365.0,
"step": 27620
},
{
"entropy": 5.335995769500732,
"epoch": 2.1493094728652014,
"grad_norm": 1.1796875,
"learning_rate": 0.00045331085589322626,
"loss": 4.983,
"mean_token_accuracy": 0.19504495412111283,
"num_tokens": 47925839.0,
"step": 27625
},
{
"entropy": 5.38365421295166,
"epoch": 2.149698502236919,
"grad_norm": 1.171875,
"learning_rate": 0.0004532939513188679,
"loss": 4.9182,
"mean_token_accuracy": 0.20267347544431685,
"num_tokens": 47934408.0,
"step": 27630
},
{
"entropy": 5.381110191345215,
"epoch": 2.1500875316086363,
"grad_norm": 1.2421875,
"learning_rate": 0.0004532770440391826,
"loss": 5.0577,
"mean_token_accuracy": 0.18853232711553575,
"num_tokens": 47943486.0,
"step": 27635
},
{
"entropy": 5.420677709579468,
"epoch": 2.150476560980354,
"grad_norm": 1.1328125,
"learning_rate": 0.0004532601340544269,
"loss": 5.105,
"mean_token_accuracy": 0.18818778842687606,
"num_tokens": 47952809.0,
"step": 27640
},
{
"entropy": 5.411874008178711,
"epoch": 2.1508655903520717,
"grad_norm": 1.2265625,
"learning_rate": 0.0004532432213648574,
"loss": 4.9882,
"mean_token_accuracy": 0.1942444697022438,
"num_tokens": 47961104.0,
"step": 27645
},
{
"entropy": 5.37989616394043,
"epoch": 2.151254619723789,
"grad_norm": 1.2421875,
"learning_rate": 0.00045322630597073067,
"loss": 5.0002,
"mean_token_accuracy": 0.19274638891220092,
"num_tokens": 47969442.0,
"step": 27650
},
{
"entropy": 5.348083591461181,
"epoch": 2.1516436490955066,
"grad_norm": 1.1796875,
"learning_rate": 0.00045320938787230355,
"loss": 4.9348,
"mean_token_accuracy": 0.20231230407953263,
"num_tokens": 47978703.0,
"step": 27655
},
{
"entropy": 5.4210813522338865,
"epoch": 2.1520326784672243,
"grad_norm": 1.171875,
"learning_rate": 0.00045319246706983257,
"loss": 5.0814,
"mean_token_accuracy": 0.19261979460716247,
"num_tokens": 47986886.0,
"step": 27660
},
{
"entropy": 5.369460153579712,
"epoch": 2.152421707838942,
"grad_norm": 1.1953125,
"learning_rate": 0.00045317554356357446,
"loss": 4.9687,
"mean_token_accuracy": 0.19729771167039872,
"num_tokens": 47995278.0,
"step": 27665
},
{
"entropy": 5.370333003997803,
"epoch": 2.1528107372106593,
"grad_norm": 1.203125,
"learning_rate": 0.00045315861735378615,
"loss": 5.0294,
"mean_token_accuracy": 0.19204697012901306,
"num_tokens": 48004351.0,
"step": 27670
},
{
"entropy": 5.453907299041748,
"epoch": 2.153199766582377,
"grad_norm": 1.140625,
"learning_rate": 0.00045314168844072435,
"loss": 5.0208,
"mean_token_accuracy": 0.18774835914373397,
"num_tokens": 48013346.0,
"step": 27675
},
{
"entropy": 5.435391855239868,
"epoch": 2.1535887959540947,
"grad_norm": 1.1875,
"learning_rate": 0.00045312475682464604,
"loss": 5.1106,
"mean_token_accuracy": 0.18976333141326904,
"num_tokens": 48023371.0,
"step": 27680
},
{
"entropy": 5.352592611312867,
"epoch": 2.153977825325812,
"grad_norm": 1.2578125,
"learning_rate": 0.00045310782250580794,
"loss": 4.9819,
"mean_token_accuracy": 0.20000998079776763,
"num_tokens": 48032095.0,
"step": 27685
},
{
"entropy": 5.354420280456543,
"epoch": 2.1543668546975296,
"grad_norm": 1.3125,
"learning_rate": 0.0004530908854844672,
"loss": 4.9685,
"mean_token_accuracy": 0.19095195680856705,
"num_tokens": 48040818.0,
"step": 27690
},
{
"entropy": 5.410459995269775,
"epoch": 2.1547558840692473,
"grad_norm": 1.3046875,
"learning_rate": 0.00045307394576088076,
"loss": 4.963,
"mean_token_accuracy": 0.19614006876945494,
"num_tokens": 48049737.0,
"step": 27695
},
{
"entropy": 5.332494688034058,
"epoch": 2.1551449134409646,
"grad_norm": 1.140625,
"learning_rate": 0.0004530570033353056,
"loss": 4.8897,
"mean_token_accuracy": 0.20397840589284896,
"num_tokens": 48057659.0,
"step": 27700
},
{
"entropy": 5.290556144714356,
"epoch": 2.1555339428126823,
"grad_norm": 1.1796875,
"learning_rate": 0.00045304005820799874,
"loss": 4.9023,
"mean_token_accuracy": 0.1949540674686432,
"num_tokens": 48066578.0,
"step": 27705
},
{
"entropy": 5.381374263763428,
"epoch": 2.1559229721844,
"grad_norm": 1.1875,
"learning_rate": 0.0004530231103792175,
"loss": 5.0865,
"mean_token_accuracy": 0.18522865027189256,
"num_tokens": 48076051.0,
"step": 27710
},
{
"entropy": 5.4641717910766605,
"epoch": 2.1563120015561177,
"grad_norm": 1.15625,
"learning_rate": 0.0004530061598492188,
"loss": 5.1156,
"mean_token_accuracy": 0.18224289417266845,
"num_tokens": 48084722.0,
"step": 27715
},
{
"entropy": 5.334061145782471,
"epoch": 2.156701030927835,
"grad_norm": 1.1328125,
"learning_rate": 0.00045298920661826004,
"loss": 4.9085,
"mean_token_accuracy": 0.19866011291742325,
"num_tokens": 48092890.0,
"step": 27720
},
{
"entropy": 5.389804124832153,
"epoch": 2.1570900602995526,
"grad_norm": 1.2109375,
"learning_rate": 0.0004529722506865984,
"loss": 5.0474,
"mean_token_accuracy": 0.19323141723871232,
"num_tokens": 48101146.0,
"step": 27725
},
{
"entropy": 5.425093412399292,
"epoch": 2.1574790896712703,
"grad_norm": 1.171875,
"learning_rate": 0.000452955292054491,
"loss": 5.0445,
"mean_token_accuracy": 0.19154542088508605,
"num_tokens": 48109974.0,
"step": 27730
},
{
"entropy": 5.467369890213012,
"epoch": 2.1578681190429876,
"grad_norm": 1.234375,
"learning_rate": 0.00045293833072219535,
"loss": 5.107,
"mean_token_accuracy": 0.1897028297185898,
"num_tokens": 48118325.0,
"step": 27735
},
{
"entropy": 5.4742847919464115,
"epoch": 2.1582571484147053,
"grad_norm": 1.1171875,
"learning_rate": 0.00045292136668996876,
"loss": 5.1343,
"mean_token_accuracy": 0.18522509336471557,
"num_tokens": 48128255.0,
"step": 27740
},
{
"entropy": 5.400942659378051,
"epoch": 2.158646177786423,
"grad_norm": 1.171875,
"learning_rate": 0.0004529043999580686,
"loss": 4.9633,
"mean_token_accuracy": 0.19742625802755356,
"num_tokens": 48136763.0,
"step": 27745
},
{
"entropy": 5.369121074676514,
"epoch": 2.1590352071581402,
"grad_norm": 1.171875,
"learning_rate": 0.00045288743052675234,
"loss": 4.9957,
"mean_token_accuracy": 0.2007910579442978,
"num_tokens": 48146371.0,
"step": 27750
},
{
"entropy": 5.404933261871338,
"epoch": 2.159424236529858,
"grad_norm": 1.203125,
"learning_rate": 0.00045287045839627744,
"loss": 5.0555,
"mean_token_accuracy": 0.19529910534620284,
"num_tokens": 48155180.0,
"step": 27755
},
{
"entropy": 5.330962657928467,
"epoch": 2.1598132659015756,
"grad_norm": 1.2734375,
"learning_rate": 0.00045285348356690155,
"loss": 5.0044,
"mean_token_accuracy": 0.19535451382398605,
"num_tokens": 48163728.0,
"step": 27760
},
{
"entropy": 5.3382776260375975,
"epoch": 2.1602022952732933,
"grad_norm": 1.1640625,
"learning_rate": 0.000452836506038882,
"loss": 4.995,
"mean_token_accuracy": 0.1908337488770485,
"num_tokens": 48171844.0,
"step": 27765
},
{
"entropy": 5.399021196365356,
"epoch": 2.1605913246450106,
"grad_norm": 1.1796875,
"learning_rate": 0.00045281952581247654,
"loss": 5.1098,
"mean_token_accuracy": 0.19387965500354767,
"num_tokens": 48180617.0,
"step": 27770
},
{
"entropy": 5.379263591766358,
"epoch": 2.1609803540167283,
"grad_norm": 1.265625,
"learning_rate": 0.00045280254288794286,
"loss": 4.9499,
"mean_token_accuracy": 0.199419766664505,
"num_tokens": 48188875.0,
"step": 27775
},
{
"entropy": 5.3297630786895756,
"epoch": 2.161369383388446,
"grad_norm": 1.21875,
"learning_rate": 0.00045278555726553855,
"loss": 4.9274,
"mean_token_accuracy": 0.19676387161016465,
"num_tokens": 48197280.0,
"step": 27780
},
{
"entropy": 5.427419710159302,
"epoch": 2.1617584127601632,
"grad_norm": 1.09375,
"learning_rate": 0.00045276856894552143,
"loss": 5.127,
"mean_token_accuracy": 0.18385698944330214,
"num_tokens": 48206907.0,
"step": 27785
},
{
"entropy": 5.362340211868286,
"epoch": 2.162147442131881,
"grad_norm": 1.2578125,
"learning_rate": 0.0004527515779281492,
"loss": 4.9503,
"mean_token_accuracy": 0.1982266739010811,
"num_tokens": 48215334.0,
"step": 27790
},
{
"entropy": 5.415247297286987,
"epoch": 2.1625364715035986,
"grad_norm": 1.3359375,
"learning_rate": 0.00045273458421367976,
"loss": 5.0576,
"mean_token_accuracy": 0.19488824307918548,
"num_tokens": 48224667.0,
"step": 27795
},
{
"entropy": 5.423513031005859,
"epoch": 2.162925500875316,
"grad_norm": 1.109375,
"learning_rate": 0.0004527175878023708,
"loss": 5.1231,
"mean_token_accuracy": 0.18251290470361708,
"num_tokens": 48233237.0,
"step": 27800
},
{
"entropy": 5.425119209289551,
"epoch": 2.1633145302470336,
"grad_norm": 1.2109375,
"learning_rate": 0.0004527005886944803,
"loss": 5.0055,
"mean_token_accuracy": 0.1942443445324898,
"num_tokens": 48241048.0,
"step": 27805
},
{
"entropy": 5.500494146347046,
"epoch": 2.1637035596187513,
"grad_norm": 1.1484375,
"learning_rate": 0.00045268358689026626,
"loss": 5.1567,
"mean_token_accuracy": 0.18781585097312928,
"num_tokens": 48250013.0,
"step": 27810
},
{
"entropy": 5.4736734390258786,
"epoch": 2.164092588990469,
"grad_norm": 1.21875,
"learning_rate": 0.0004526665823899866,
"loss": 5.0954,
"mean_token_accuracy": 0.19044607728719712,
"num_tokens": 48258566.0,
"step": 27815
},
{
"entropy": 5.443532466888428,
"epoch": 2.164481618362186,
"grad_norm": 1.21875,
"learning_rate": 0.00045264957519389936,
"loss": 4.9804,
"mean_token_accuracy": 0.1933306485414505,
"num_tokens": 48266843.0,
"step": 27820
},
{
"entropy": 5.333857870101928,
"epoch": 2.164870647733904,
"grad_norm": 1.1953125,
"learning_rate": 0.00045263256530226253,
"loss": 4.9691,
"mean_token_accuracy": 0.19478013813495637,
"num_tokens": 48276138.0,
"step": 27825
},
{
"entropy": 5.333880758285522,
"epoch": 2.1652596771056216,
"grad_norm": 1.2890625,
"learning_rate": 0.0004526155527153343,
"loss": 4.896,
"mean_token_accuracy": 0.20267748236656188,
"num_tokens": 48284452.0,
"step": 27830
},
{
"entropy": 5.429748630523681,
"epoch": 2.165648706477339,
"grad_norm": 1.2109375,
"learning_rate": 0.0004525985374333727,
"loss": 5.0592,
"mean_token_accuracy": 0.19107531607151032,
"num_tokens": 48292871.0,
"step": 27835
},
{
"entropy": 5.362192678451538,
"epoch": 2.1660377358490566,
"grad_norm": 1.2109375,
"learning_rate": 0.000452581519456636,
"loss": 5.0343,
"mean_token_accuracy": 0.1863759219646454,
"num_tokens": 48300642.0,
"step": 27840
},
{
"entropy": 5.3818597316741945,
"epoch": 2.1664267652207743,
"grad_norm": 1.1328125,
"learning_rate": 0.00045256449878538243,
"loss": 5.1232,
"mean_token_accuracy": 0.18416507989168168,
"num_tokens": 48309229.0,
"step": 27845
},
{
"entropy": 5.443172931671143,
"epoch": 2.166815794592492,
"grad_norm": 1.1953125,
"learning_rate": 0.00045254747541987017,
"loss": 5.0549,
"mean_token_accuracy": 0.18665554076433183,
"num_tokens": 48317474.0,
"step": 27850
},
{
"entropy": 5.48644061088562,
"epoch": 2.167204823964209,
"grad_norm": 1.3203125,
"learning_rate": 0.0004525304493603576,
"loss": 5.1206,
"mean_token_accuracy": 0.18903460800647737,
"num_tokens": 48325810.0,
"step": 27855
},
{
"entropy": 5.431558132171631,
"epoch": 2.167593853335927,
"grad_norm": 1.1640625,
"learning_rate": 0.00045251342060710295,
"loss": 5.0379,
"mean_token_accuracy": 0.19466957747936248,
"num_tokens": 48334348.0,
"step": 27860
},
{
"entropy": 5.334795045852661,
"epoch": 2.1679828827076446,
"grad_norm": 1.1640625,
"learning_rate": 0.0004524963891603647,
"loss": 4.8957,
"mean_token_accuracy": 0.2011874198913574,
"num_tokens": 48342565.0,
"step": 27865
},
{
"entropy": 5.413707160949707,
"epoch": 2.168371912079362,
"grad_norm": 1.125,
"learning_rate": 0.00045247935502040136,
"loss": 5.1481,
"mean_token_accuracy": 0.18470294624567032,
"num_tokens": 48351398.0,
"step": 27870
},
{
"entropy": 5.403498697280884,
"epoch": 2.1687609414510796,
"grad_norm": 1.15625,
"learning_rate": 0.0004524623181874712,
"loss": 5.0246,
"mean_token_accuracy": 0.1886204108595848,
"num_tokens": 48360275.0,
"step": 27875
},
{
"entropy": 5.355336332321167,
"epoch": 2.1691499708227973,
"grad_norm": 1.1953125,
"learning_rate": 0.0004524452786618329,
"loss": 4.995,
"mean_token_accuracy": 0.1874264270067215,
"num_tokens": 48369516.0,
"step": 27880
},
{
"entropy": 5.3591372013092045,
"epoch": 2.1695390001945145,
"grad_norm": 1.1640625,
"learning_rate": 0.00045242823644374484,
"loss": 4.991,
"mean_token_accuracy": 0.18908893167972565,
"num_tokens": 48378412.0,
"step": 27885
},
{
"entropy": 5.462379598617554,
"epoch": 2.169928029566232,
"grad_norm": 1.2109375,
"learning_rate": 0.0004524111915334658,
"loss": 5.0574,
"mean_token_accuracy": 0.19022310078144072,
"num_tokens": 48386566.0,
"step": 27890
},
{
"entropy": 5.476092576980591,
"epoch": 2.17031705893795,
"grad_norm": 1.15625,
"learning_rate": 0.00045239414393125424,
"loss": 5.0606,
"mean_token_accuracy": 0.1862471103668213,
"num_tokens": 48394727.0,
"step": 27895
},
{
"entropy": 5.478165578842163,
"epoch": 2.170706088309667,
"grad_norm": 1.21875,
"learning_rate": 0.0004523770936373689,
"loss": 5.1073,
"mean_token_accuracy": 0.1884329840540886,
"num_tokens": 48404440.0,
"step": 27900
},
{
"entropy": 5.417226123809814,
"epoch": 2.171095117681385,
"grad_norm": 1.1640625,
"learning_rate": 0.0004523600406520685,
"loss": 4.9721,
"mean_token_accuracy": 0.19655323177576065,
"num_tokens": 48413441.0,
"step": 27905
},
{
"entropy": 5.44138731956482,
"epoch": 2.1714841470531026,
"grad_norm": 1.1875,
"learning_rate": 0.0004523429849756118,
"loss": 5.1165,
"mean_token_accuracy": 0.19126634001731874,
"num_tokens": 48422393.0,
"step": 27910
},
{
"entropy": 5.443744277954101,
"epoch": 2.1718731764248203,
"grad_norm": 1.25,
"learning_rate": 0.0004523259266082576,
"loss": 5.0677,
"mean_token_accuracy": 0.19718971252441406,
"num_tokens": 48431151.0,
"step": 27915
},
{
"entropy": 5.390175151824951,
"epoch": 2.1722622057965375,
"grad_norm": 1.125,
"learning_rate": 0.00045230886555026455,
"loss": 4.9654,
"mean_token_accuracy": 0.20026516914367676,
"num_tokens": 48439453.0,
"step": 27920
},
{
"entropy": 5.447175168991089,
"epoch": 2.172651235168255,
"grad_norm": 1.09375,
"learning_rate": 0.00045229180180189176,
"loss": 5.0629,
"mean_token_accuracy": 0.19184852093458177,
"num_tokens": 48448055.0,
"step": 27925
},
{
"entropy": 5.356282377243042,
"epoch": 2.173040264539973,
"grad_norm": 1.1484375,
"learning_rate": 0.00045227473536339817,
"loss": 4.924,
"mean_token_accuracy": 0.20465720295906067,
"num_tokens": 48456015.0,
"step": 27930
},
{
"entropy": 5.3888898372650145,
"epoch": 2.17342929391169,
"grad_norm": 1.203125,
"learning_rate": 0.0004522576662350425,
"loss": 5.0217,
"mean_token_accuracy": 0.19882518500089646,
"num_tokens": 48464389.0,
"step": 27935
},
{
"entropy": 5.458875036239624,
"epoch": 2.173818323283408,
"grad_norm": 1.21875,
"learning_rate": 0.000452240594417084,
"loss": 5.0097,
"mean_token_accuracy": 0.1894667163491249,
"num_tokens": 48472403.0,
"step": 27940
},
{
"entropy": 5.329954719543457,
"epoch": 2.1742073526551255,
"grad_norm": 1.15625,
"learning_rate": 0.0004522235199097815,
"loss": 5.016,
"mean_token_accuracy": 0.1863328143954277,
"num_tokens": 48480879.0,
"step": 27945
},
{
"entropy": 5.309024953842163,
"epoch": 2.1745963820268432,
"grad_norm": 1.1953125,
"learning_rate": 0.0004522064427133942,
"loss": 4.9874,
"mean_token_accuracy": 0.19317472726106644,
"num_tokens": 48489722.0,
"step": 27950
},
{
"entropy": 5.404091310501099,
"epoch": 2.1749854113985605,
"grad_norm": 1.109375,
"learning_rate": 0.00045218936282818116,
"loss": 5.0371,
"mean_token_accuracy": 0.19619973748922348,
"num_tokens": 48499023.0,
"step": 27955
},
{
"entropy": 5.496057033538818,
"epoch": 2.175374440770278,
"grad_norm": 1.1484375,
"learning_rate": 0.0004521722802544016,
"loss": 5.079,
"mean_token_accuracy": 0.1974037066102028,
"num_tokens": 48508352.0,
"step": 27960
},
{
"entropy": 5.38067946434021,
"epoch": 2.175763470141996,
"grad_norm": 1.1640625,
"learning_rate": 0.00045215519499231465,
"loss": 4.9677,
"mean_token_accuracy": 0.20111655592918395,
"num_tokens": 48517481.0,
"step": 27965
},
{
"entropy": 5.384751796722412,
"epoch": 2.176152499513713,
"grad_norm": 1.2265625,
"learning_rate": 0.00045213810704217963,
"loss": 4.9954,
"mean_token_accuracy": 0.19309509694576263,
"num_tokens": 48525777.0,
"step": 27970
},
{
"entropy": 5.334950113296509,
"epoch": 2.176541528885431,
"grad_norm": 1.34375,
"learning_rate": 0.0004521210164042557,
"loss": 4.9485,
"mean_token_accuracy": 0.19818932712078094,
"num_tokens": 48534297.0,
"step": 27975
},
{
"entropy": 5.40295557975769,
"epoch": 2.1769305582571485,
"grad_norm": 1.171875,
"learning_rate": 0.0004521039230788024,
"loss": 5.0488,
"mean_token_accuracy": 0.19558234214782716,
"num_tokens": 48543425.0,
"step": 27980
},
{
"entropy": 5.349777460098267,
"epoch": 2.177319587628866,
"grad_norm": 1.203125,
"learning_rate": 0.0004520868270660789,
"loss": 4.9763,
"mean_token_accuracy": 0.19175027310848236,
"num_tokens": 48553114.0,
"step": 27985
},
{
"entropy": 5.546117162704467,
"epoch": 2.1777086170005835,
"grad_norm": 1.2109375,
"learning_rate": 0.0004520697283663446,
"loss": 5.0622,
"mean_token_accuracy": 0.196283221244812,
"num_tokens": 48561409.0,
"step": 27990
},
{
"entropy": 5.392153215408325,
"epoch": 2.178097646372301,
"grad_norm": 1.125,
"learning_rate": 0.00045205262697985897,
"loss": 5.0408,
"mean_token_accuracy": 0.18591720163822173,
"num_tokens": 48569782.0,
"step": 27995
},
{
"entropy": 5.432507562637329,
"epoch": 2.1784866757440184,
"grad_norm": 1.1640625,
"learning_rate": 0.0004520355229068816,
"loss": 5.1462,
"mean_token_accuracy": 0.1845673769712448,
"num_tokens": 48579283.0,
"step": 28000
},
{
"entropy": 5.461791133880615,
"epoch": 2.178875705115736,
"grad_norm": 1.1640625,
"learning_rate": 0.00045201841614767203,
"loss": 5.0411,
"mean_token_accuracy": 0.18906245827674867,
"num_tokens": 48587649.0,
"step": 28005
},
{
"entropy": 5.457585382461548,
"epoch": 2.179264734487454,
"grad_norm": 1.2109375,
"learning_rate": 0.00045200130670248974,
"loss": 5.0535,
"mean_token_accuracy": 0.19061661809682845,
"num_tokens": 48596227.0,
"step": 28010
},
{
"entropy": 5.3980574131011965,
"epoch": 2.1796537638591715,
"grad_norm": 1.2109375,
"learning_rate": 0.00045198419457159424,
"loss": 4.9915,
"mean_token_accuracy": 0.18466486632823945,
"num_tokens": 48605364.0,
"step": 28015
},
{
"entropy": 5.421681690216064,
"epoch": 2.180042793230889,
"grad_norm": 1.1640625,
"learning_rate": 0.0004519670797552453,
"loss": 5.093,
"mean_token_accuracy": 0.18561969697475433,
"num_tokens": 48613794.0,
"step": 28020
},
{
"entropy": 5.460006332397461,
"epoch": 2.1804318226026065,
"grad_norm": 1.234375,
"learning_rate": 0.00045194996225370266,
"loss": 5.043,
"mean_token_accuracy": 0.18504524528980254,
"num_tokens": 48622381.0,
"step": 28025
},
{
"entropy": 5.502499628067016,
"epoch": 2.180820851974324,
"grad_norm": 1.25,
"learning_rate": 0.00045193284206722595,
"loss": 5.2,
"mean_token_accuracy": 0.18574041724205018,
"num_tokens": 48631484.0,
"step": 28030
},
{
"entropy": 5.404558897018433,
"epoch": 2.1812098813460414,
"grad_norm": 1.234375,
"learning_rate": 0.0004519157191960749,
"loss": 5.0801,
"mean_token_accuracy": 0.19211936444044114,
"num_tokens": 48641082.0,
"step": 28035
},
{
"entropy": 5.408262729644775,
"epoch": 2.181598910717759,
"grad_norm": 1.234375,
"learning_rate": 0.0004518985936405096,
"loss": 5.0522,
"mean_token_accuracy": 0.18842335045337677,
"num_tokens": 48649974.0,
"step": 28040
},
{
"entropy": 5.464209842681885,
"epoch": 2.181987940089477,
"grad_norm": 1.2578125,
"learning_rate": 0.0004518814654007896,
"loss": 5.0496,
"mean_token_accuracy": 0.1924401640892029,
"num_tokens": 48658633.0,
"step": 28045
},
{
"entropy": 5.407297992706299,
"epoch": 2.1823769694611945,
"grad_norm": 1.1875,
"learning_rate": 0.00045186433447717486,
"loss": 5.0301,
"mean_token_accuracy": 0.19067004770040513,
"num_tokens": 48667313.0,
"step": 28050
},
{
"entropy": 5.460005092620849,
"epoch": 2.182765998832912,
"grad_norm": 1.3359375,
"learning_rate": 0.00045184720086992536,
"loss": 5.1321,
"mean_token_accuracy": 0.18997216373682022,
"num_tokens": 48676664.0,
"step": 28055
},
{
"entropy": 5.420013332366944,
"epoch": 2.1831550282046295,
"grad_norm": 1.28125,
"learning_rate": 0.00045183006457930107,
"loss": 4.9848,
"mean_token_accuracy": 0.19489010721445083,
"num_tokens": 48684770.0,
"step": 28060
},
{
"entropy": 5.349559497833252,
"epoch": 2.183544057576347,
"grad_norm": 1.3125,
"learning_rate": 0.0004518129256055621,
"loss": 4.9662,
"mean_token_accuracy": 0.1951739028096199,
"num_tokens": 48692965.0,
"step": 28065
},
{
"entropy": 5.455432271957397,
"epoch": 2.1839330869480644,
"grad_norm": 1.1796875,
"learning_rate": 0.0004517957839489683,
"loss": 5.0817,
"mean_token_accuracy": 0.19036444127559662,
"num_tokens": 48702273.0,
"step": 28070
},
{
"entropy": 5.402045822143554,
"epoch": 2.184322116319782,
"grad_norm": 1.1875,
"learning_rate": 0.00045177863960977986,
"loss": 5.0157,
"mean_token_accuracy": 0.18129972368478775,
"num_tokens": 48710884.0,
"step": 28075
},
{
"entropy": 5.514720153808594,
"epoch": 2.1847111456915,
"grad_norm": 2.015625,
"learning_rate": 0.000451761492588257,
"loss": 5.1717,
"mean_token_accuracy": 0.17839690744876863,
"num_tokens": 48719673.0,
"step": 28080
},
{
"entropy": 5.365681982040405,
"epoch": 2.185100175063217,
"grad_norm": 1.25,
"learning_rate": 0.00045174434288465986,
"loss": 5.0256,
"mean_token_accuracy": 0.19594370275735856,
"num_tokens": 48728084.0,
"step": 28085
},
{
"entropy": 5.523262977600098,
"epoch": 2.1854892044349348,
"grad_norm": 1.2109375,
"learning_rate": 0.0004517271904992486,
"loss": 5.1362,
"mean_token_accuracy": 0.18390195518732072,
"num_tokens": 48736621.0,
"step": 28090
},
{
"entropy": 5.492107152938843,
"epoch": 2.1858782338066525,
"grad_norm": 1.15625,
"learning_rate": 0.0004517100354322835,
"loss": 5.0556,
"mean_token_accuracy": 0.19665486514568328,
"num_tokens": 48744990.0,
"step": 28095
},
{
"entropy": 5.324941253662109,
"epoch": 2.18626726317837,
"grad_norm": 1.1484375,
"learning_rate": 0.00045169287768402497,
"loss": 5.0662,
"mean_token_accuracy": 0.17747486829757692,
"num_tokens": 48753640.0,
"step": 28100
},
{
"entropy": 5.28617033958435,
"epoch": 2.1866562925500874,
"grad_norm": 1.3984375,
"learning_rate": 0.0004516757172547331,
"loss": 4.9598,
"mean_token_accuracy": 0.19716623723506926,
"num_tokens": 48762836.0,
"step": 28105
},
{
"entropy": 5.498090744018555,
"epoch": 2.187045321921805,
"grad_norm": 1.2109375,
"learning_rate": 0.0004516585541446685,
"loss": 5.0816,
"mean_token_accuracy": 0.1909654349088669,
"num_tokens": 48771158.0,
"step": 28110
},
{
"entropy": 5.428505563735962,
"epoch": 2.187434351293523,
"grad_norm": 1.2578125,
"learning_rate": 0.00045164138835409153,
"loss": 5.0958,
"mean_token_accuracy": 0.18697828501462938,
"num_tokens": 48779631.0,
"step": 28115
},
{
"entropy": 5.4214588642120365,
"epoch": 2.18782338066524,
"grad_norm": 1.2421875,
"learning_rate": 0.00045162421988326266,
"loss": 5.0912,
"mean_token_accuracy": 0.18804224133491515,
"num_tokens": 48788584.0,
"step": 28120
},
{
"entropy": 5.412262201309204,
"epoch": 2.1882124100369578,
"grad_norm": 1.1328125,
"learning_rate": 0.0004516070487324424,
"loss": 4.9844,
"mean_token_accuracy": 0.19471802860498427,
"num_tokens": 48797403.0,
"step": 28125
},
{
"entropy": 5.37298617362976,
"epoch": 2.1886014394086755,
"grad_norm": 1.1484375,
"learning_rate": 0.00045158987490189124,
"loss": 5.0442,
"mean_token_accuracy": 0.19813482016324996,
"num_tokens": 48805448.0,
"step": 28130
},
{
"entropy": 5.433377933502197,
"epoch": 2.1889904687803927,
"grad_norm": 1.1328125,
"learning_rate": 0.0004515726983918697,
"loss": 5.1134,
"mean_token_accuracy": 0.18425017595291138,
"num_tokens": 48814983.0,
"step": 28135
},
{
"entropy": 5.447548198699951,
"epoch": 2.1893794981521104,
"grad_norm": 1.1171875,
"learning_rate": 0.00045155551920263864,
"loss": 5.0718,
"mean_token_accuracy": 0.19170719236135483,
"num_tokens": 48823955.0,
"step": 28140
},
{
"entropy": 5.429609489440918,
"epoch": 2.189768527523828,
"grad_norm": 1.2265625,
"learning_rate": 0.00045153833733445857,
"loss": 5.0807,
"mean_token_accuracy": 0.1894332766532898,
"num_tokens": 48832078.0,
"step": 28145
},
{
"entropy": 5.4771803855896,
"epoch": 2.190157556895546,
"grad_norm": 1.1875,
"learning_rate": 0.0004515211527875903,
"loss": 5.0418,
"mean_token_accuracy": 0.19267219305038452,
"num_tokens": 48840351.0,
"step": 28150
},
{
"entropy": 5.368520832061767,
"epoch": 2.190546586267263,
"grad_norm": 1.1796875,
"learning_rate": 0.0004515039655622943,
"loss": 4.9863,
"mean_token_accuracy": 0.20262031853199006,
"num_tokens": 48848333.0,
"step": 28155
},
{
"entropy": 5.3157045364379885,
"epoch": 2.1909356156389808,
"grad_norm": 1.2578125,
"learning_rate": 0.00045148677565883167,
"loss": 5.0272,
"mean_token_accuracy": 0.18595658987760544,
"num_tokens": 48856806.0,
"step": 28160
},
{
"entropy": 5.481784772872925,
"epoch": 2.1913246450106985,
"grad_norm": 1.2734375,
"learning_rate": 0.0004514695830774631,
"loss": 5.107,
"mean_token_accuracy": 0.19005442708730697,
"num_tokens": 48865848.0,
"step": 28165
},
{
"entropy": 5.491057538986206,
"epoch": 2.1917136743824157,
"grad_norm": 1.171875,
"learning_rate": 0.00045145238781844953,
"loss": 5.111,
"mean_token_accuracy": 0.18252404034137726,
"num_tokens": 48875899.0,
"step": 28170
},
{
"entropy": 5.387235975265503,
"epoch": 2.1921027037541334,
"grad_norm": 1.125,
"learning_rate": 0.00045143518988205184,
"loss": 4.9683,
"mean_token_accuracy": 0.1970604658126831,
"num_tokens": 48884026.0,
"step": 28175
},
{
"entropy": 5.438482570648193,
"epoch": 2.192491733125851,
"grad_norm": 1.1640625,
"learning_rate": 0.00045141798926853094,
"loss": 5.0294,
"mean_token_accuracy": 0.19003171771764754,
"num_tokens": 48892640.0,
"step": 28180
},
{
"entropy": 5.48634295463562,
"epoch": 2.1928807624975684,
"grad_norm": 1.171875,
"learning_rate": 0.0004514007859781478,
"loss": 5.1006,
"mean_token_accuracy": 0.19112081974744796,
"num_tokens": 48901071.0,
"step": 28185
},
{
"entropy": 5.432191324234009,
"epoch": 2.193269791869286,
"grad_norm": 1.171875,
"learning_rate": 0.0004513835800111635,
"loss": 4.9421,
"mean_token_accuracy": 0.1960209846496582,
"num_tokens": 48909034.0,
"step": 28190
},
{
"entropy": 5.447171354293824,
"epoch": 2.1936588212410038,
"grad_norm": 1.40625,
"learning_rate": 0.0004513663713678392,
"loss": 5.1432,
"mean_token_accuracy": 0.18307837694883347,
"num_tokens": 48918399.0,
"step": 28195
},
{
"entropy": 5.45437536239624,
"epoch": 2.1940478506127215,
"grad_norm": 1.09375,
"learning_rate": 0.00045134916004843596,
"loss": 5.0325,
"mean_token_accuracy": 0.1897647798061371,
"num_tokens": 48926767.0,
"step": 28200
},
{
"entropy": 5.429740762710571,
"epoch": 2.1944368799844387,
"grad_norm": 1.234375,
"learning_rate": 0.0004513319460532148,
"loss": 4.9812,
"mean_token_accuracy": 0.19624552875757217,
"num_tokens": 48935666.0,
"step": 28205
},
{
"entropy": 5.346584796905518,
"epoch": 2.1948259093561564,
"grad_norm": 1.1875,
"learning_rate": 0.00045131472938243707,
"loss": 5.0569,
"mean_token_accuracy": 0.1914469540119171,
"num_tokens": 48944461.0,
"step": 28210
},
{
"entropy": 5.327824401855469,
"epoch": 2.195214938727874,
"grad_norm": 1.2578125,
"learning_rate": 0.0004512975100363639,
"loss": 4.9641,
"mean_token_accuracy": 0.19471705406904222,
"num_tokens": 48952368.0,
"step": 28215
},
{
"entropy": 5.2918102741241455,
"epoch": 2.1956039680995914,
"grad_norm": 1.1328125,
"learning_rate": 0.00045128028801525675,
"loss": 4.8483,
"mean_token_accuracy": 0.19947834312915802,
"num_tokens": 48961866.0,
"step": 28220
},
{
"entropy": 5.366620969772339,
"epoch": 2.195992997471309,
"grad_norm": 1.21875,
"learning_rate": 0.00045126306331937674,
"loss": 4.9963,
"mean_token_accuracy": 0.19690313339233398,
"num_tokens": 48970401.0,
"step": 28225
},
{
"entropy": 5.444857215881347,
"epoch": 2.1963820268430267,
"grad_norm": 1.203125,
"learning_rate": 0.0004512458359489853,
"loss": 5.0692,
"mean_token_accuracy": 0.18379541039466857,
"num_tokens": 48979165.0,
"step": 28230
},
{
"entropy": 5.379595851898193,
"epoch": 2.196771056214744,
"grad_norm": 1.203125,
"learning_rate": 0.0004512286059043437,
"loss": 4.9537,
"mean_token_accuracy": 0.20391090363264083,
"num_tokens": 48987700.0,
"step": 28235
},
{
"entropy": 5.372784519195557,
"epoch": 2.1971600855864617,
"grad_norm": 1.1484375,
"learning_rate": 0.00045121137318571364,
"loss": 5.0319,
"mean_token_accuracy": 0.19617507457733155,
"num_tokens": 48996901.0,
"step": 28240
},
{
"entropy": 5.456158781051636,
"epoch": 2.1975491149581794,
"grad_norm": 1.2109375,
"learning_rate": 0.00045119413779335645,
"loss": 5.1311,
"mean_token_accuracy": 0.18842933773994447,
"num_tokens": 49006049.0,
"step": 28245
},
{
"entropy": 5.481533145904541,
"epoch": 2.197938144329897,
"grad_norm": 1.1484375,
"learning_rate": 0.0004511768997275336,
"loss": 5.0838,
"mean_token_accuracy": 0.19189211577177048,
"num_tokens": 49015092.0,
"step": 28250
},
{
"entropy": 5.312004852294922,
"epoch": 2.1983271737016143,
"grad_norm": 1.21875,
"learning_rate": 0.0004511596589885068,
"loss": 5.0421,
"mean_token_accuracy": 0.1915465697646141,
"num_tokens": 49023388.0,
"step": 28255
},
{
"entropy": 5.344288682937622,
"epoch": 2.198716203073332,
"grad_norm": 1.171875,
"learning_rate": 0.0004511424155765375,
"loss": 4.9648,
"mean_token_accuracy": 0.20107341259717942,
"num_tokens": 49031931.0,
"step": 28260
},
{
"entropy": 5.453381490707398,
"epoch": 2.1991052324450497,
"grad_norm": 1.1484375,
"learning_rate": 0.00045112516949188735,
"loss": 5.1254,
"mean_token_accuracy": 0.1908780202269554,
"num_tokens": 49040584.0,
"step": 28265
},
{
"entropy": 5.439366292953491,
"epoch": 2.199494261816767,
"grad_norm": 1.140625,
"learning_rate": 0.0004511079207348182,
"loss": 5.0284,
"mean_token_accuracy": 0.19958664923906327,
"num_tokens": 49049107.0,
"step": 28270
},
{
"entropy": 5.372990989685059,
"epoch": 2.1998832911884847,
"grad_norm": 1.2109375,
"learning_rate": 0.0004510906693055916,
"loss": 5.0084,
"mean_token_accuracy": 0.186807981133461,
"num_tokens": 49058038.0,
"step": 28275
},
{
"entropy": 5.38836178779602,
"epoch": 2.2002723205602024,
"grad_norm": 1.1953125,
"learning_rate": 0.0004510734152044694,
"loss": 4.9692,
"mean_token_accuracy": 0.19882271438837051,
"num_tokens": 49066875.0,
"step": 28280
},
{
"entropy": 5.380369853973389,
"epoch": 2.20066134993192,
"grad_norm": 1.1484375,
"learning_rate": 0.00045105615843171336,
"loss": 5.078,
"mean_token_accuracy": 0.18423424512147904,
"num_tokens": 49076374.0,
"step": 28285
},
{
"entropy": 5.4191876411437985,
"epoch": 2.2010503793036373,
"grad_norm": 1.15625,
"learning_rate": 0.00045103889898758534,
"loss": 5.0206,
"mean_token_accuracy": 0.1880969688296318,
"num_tokens": 49085729.0,
"step": 28290
},
{
"entropy": 5.375594520568848,
"epoch": 2.201439408675355,
"grad_norm": 1.109375,
"learning_rate": 0.0004510216368723472,
"loss": 4.9491,
"mean_token_accuracy": 0.19396336376667023,
"num_tokens": 49093959.0,
"step": 28295
},
{
"entropy": 5.371994161605835,
"epoch": 2.2018284380470727,
"grad_norm": 1.296875,
"learning_rate": 0.00045100437208626086,
"loss": 5.0445,
"mean_token_accuracy": 0.1911723017692566,
"num_tokens": 49102412.0,
"step": 28300
},
{
"entropy": 5.339009952545166,
"epoch": 2.20221746741879,
"grad_norm": 1.21875,
"learning_rate": 0.00045098710462958844,
"loss": 5.0031,
"mean_token_accuracy": 0.19333076626062393,
"num_tokens": 49110655.0,
"step": 28305
},
{
"entropy": 5.411261320114136,
"epoch": 2.2026064967905077,
"grad_norm": 1.34375,
"learning_rate": 0.00045096983450259166,
"loss": 5.0205,
"mean_token_accuracy": 0.1896621748805046,
"num_tokens": 49119117.0,
"step": 28310
},
{
"entropy": 5.394672298431397,
"epoch": 2.2029955261622254,
"grad_norm": 1.1640625,
"learning_rate": 0.00045095256170553285,
"loss": 4.9597,
"mean_token_accuracy": 0.19078228622674942,
"num_tokens": 49127513.0,
"step": 28315
},
{
"entropy": 5.412776374816895,
"epoch": 2.2033845555339426,
"grad_norm": 1.2109375,
"learning_rate": 0.00045093528623867384,
"loss": 4.9945,
"mean_token_accuracy": 0.19283927232027054,
"num_tokens": 49135851.0,
"step": 28320
},
{
"entropy": 5.454043865203857,
"epoch": 2.2037735849056603,
"grad_norm": 1.125,
"learning_rate": 0.00045091800810227706,
"loss": 5.1114,
"mean_token_accuracy": 0.18604275435209275,
"num_tokens": 49144775.0,
"step": 28325
},
{
"entropy": 5.47678771018982,
"epoch": 2.204162614277378,
"grad_norm": 1.2890625,
"learning_rate": 0.0004509007272966044,
"loss": 5.0627,
"mean_token_accuracy": 0.1945940524339676,
"num_tokens": 49152861.0,
"step": 28330
},
{
"entropy": 5.414076042175293,
"epoch": 2.2045516436490953,
"grad_norm": 1.234375,
"learning_rate": 0.0004508834438219182,
"loss": 5.1378,
"mean_token_accuracy": 0.18473929166793823,
"num_tokens": 49161875.0,
"step": 28335
},
{
"entropy": 5.469267082214356,
"epoch": 2.204940673020813,
"grad_norm": 1.15625,
"learning_rate": 0.0004508661576784807,
"loss": 5.1527,
"mean_token_accuracy": 0.1893542155623436,
"num_tokens": 49170277.0,
"step": 28340
},
{
"entropy": 5.378471231460571,
"epoch": 2.2053297023925307,
"grad_norm": 1.15625,
"learning_rate": 0.0004508488688665541,
"loss": 4.9152,
"mean_token_accuracy": 0.2032302960753441,
"num_tokens": 49179078.0,
"step": 28345
},
{
"entropy": 5.399324178695679,
"epoch": 2.2057187317642484,
"grad_norm": 1.1171875,
"learning_rate": 0.0004508315773864009,
"loss": 5.0083,
"mean_token_accuracy": 0.1880996823310852,
"num_tokens": 49187649.0,
"step": 28350
},
{
"entropy": 5.35129132270813,
"epoch": 2.2061077611359656,
"grad_norm": 1.2578125,
"learning_rate": 0.00045081428323828337,
"loss": 4.9429,
"mean_token_accuracy": 0.20895701944828032,
"num_tokens": 49195369.0,
"step": 28355
},
{
"entropy": 5.453681945800781,
"epoch": 2.2064967905076833,
"grad_norm": 1.1875,
"learning_rate": 0.0004507969864224639,
"loss": 5.117,
"mean_token_accuracy": 0.18047391325235368,
"num_tokens": 49203623.0,
"step": 28360
},
{
"entropy": 5.431863307952881,
"epoch": 2.206885819879401,
"grad_norm": 1.21875,
"learning_rate": 0.000450779686939205,
"loss": 5.046,
"mean_token_accuracy": 0.19163624197244644,
"num_tokens": 49212251.0,
"step": 28365
},
{
"entropy": 5.400700426101684,
"epoch": 2.2072748492511183,
"grad_norm": 1.15625,
"learning_rate": 0.00045076238478876916,
"loss": 5.011,
"mean_token_accuracy": 0.19248375445604324,
"num_tokens": 49220580.0,
"step": 28370
},
{
"entropy": 5.446966648101807,
"epoch": 2.207663878622836,
"grad_norm": 1.1015625,
"learning_rate": 0.0004507450799714188,
"loss": 5.0401,
"mean_token_accuracy": 0.1948488935828209,
"num_tokens": 49229011.0,
"step": 28375
},
{
"entropy": 5.409651803970337,
"epoch": 2.2080529079945537,
"grad_norm": 1.1796875,
"learning_rate": 0.00045072777248741664,
"loss": 5.0091,
"mean_token_accuracy": 0.19693334102630616,
"num_tokens": 49237082.0,
"step": 28380
},
{
"entropy": 5.4535871028900145,
"epoch": 2.2084419373662714,
"grad_norm": 1.1328125,
"learning_rate": 0.0004507104623370252,
"loss": 5.1164,
"mean_token_accuracy": 0.1865948721766472,
"num_tokens": 49245768.0,
"step": 28385
},
{
"entropy": 5.406794023513794,
"epoch": 2.2088309667379886,
"grad_norm": 1.171875,
"learning_rate": 0.0004506931495205072,
"loss": 5.0418,
"mean_token_accuracy": 0.1956426739692688,
"num_tokens": 49254932.0,
"step": 28390
},
{
"entropy": 5.375860977172851,
"epoch": 2.2092199961097063,
"grad_norm": 1.1328125,
"learning_rate": 0.0004506758340381253,
"loss": 5.0447,
"mean_token_accuracy": 0.18891033828258513,
"num_tokens": 49263798.0,
"step": 28395
},
{
"entropy": 5.4323498725891115,
"epoch": 2.209609025481424,
"grad_norm": 1.2890625,
"learning_rate": 0.0004506585158901422,
"loss": 4.9258,
"mean_token_accuracy": 0.1967483788728714,
"num_tokens": 49272045.0,
"step": 28400
},
{
"entropy": 5.4898295402526855,
"epoch": 2.2099980548531413,
"grad_norm": 1.1875,
"learning_rate": 0.0004506411950768207,
"loss": 5.1246,
"mean_token_accuracy": 0.18267075419425965,
"num_tokens": 49281562.0,
"step": 28405
},
{
"entropy": 5.302128314971924,
"epoch": 2.210387084224859,
"grad_norm": 1.3046875,
"learning_rate": 0.00045062387159842363,
"loss": 4.9144,
"mean_token_accuracy": 0.20220601558685303,
"num_tokens": 49290113.0,
"step": 28410
},
{
"entropy": 5.381335783004761,
"epoch": 2.2107761135965767,
"grad_norm": 1.1875,
"learning_rate": 0.00045060654545521386,
"loss": 5.0233,
"mean_token_accuracy": 0.19293704330921174,
"num_tokens": 49298210.0,
"step": 28415
},
{
"entropy": 5.439604091644287,
"epoch": 2.211165142968294,
"grad_norm": 1.109375,
"learning_rate": 0.00045058921664745436,
"loss": 5.0597,
"mean_token_accuracy": 0.19024938046932222,
"num_tokens": 49306533.0,
"step": 28420
},
{
"entropy": 5.417627000808716,
"epoch": 2.2115541723400116,
"grad_norm": 1.15625,
"learning_rate": 0.00045057188517540783,
"loss": 5.1012,
"mean_token_accuracy": 0.19111771434545516,
"num_tokens": 49315617.0,
"step": 28425
},
{
"entropy": 5.492405033111572,
"epoch": 2.2119432017117293,
"grad_norm": 1.109375,
"learning_rate": 0.0004505545510393374,
"loss": 4.9985,
"mean_token_accuracy": 0.1932731106877327,
"num_tokens": 49324351.0,
"step": 28430
},
{
"entropy": 5.378728437423706,
"epoch": 2.2123322310834466,
"grad_norm": 1.140625,
"learning_rate": 0.00045053721423950617,
"loss": 4.9876,
"mean_token_accuracy": 0.2002292290329933,
"num_tokens": 49333036.0,
"step": 28435
},
{
"entropy": 5.353306007385254,
"epoch": 2.2127212604551643,
"grad_norm": 1.234375,
"learning_rate": 0.0004505198747761771,
"loss": 4.9781,
"mean_token_accuracy": 0.19263887405395508,
"num_tokens": 49341715.0,
"step": 28440
},
{
"entropy": 5.455445384979248,
"epoch": 2.213110289826882,
"grad_norm": 1.421875,
"learning_rate": 0.0004505025326496132,
"loss": 5.0474,
"mean_token_accuracy": 0.18783219754695893,
"num_tokens": 49350505.0,
"step": 28445
},
{
"entropy": 5.421740531921387,
"epoch": 2.2134993191985997,
"grad_norm": 1.2734375,
"learning_rate": 0.00045048518786007784,
"loss": 5.0767,
"mean_token_accuracy": 0.19024426639080047,
"num_tokens": 49358902.0,
"step": 28450
},
{
"entropy": 5.4778783321380615,
"epoch": 2.213888348570317,
"grad_norm": 1.171875,
"learning_rate": 0.00045046784040783395,
"loss": 5.0945,
"mean_token_accuracy": 0.18827909529209136,
"num_tokens": 49366932.0,
"step": 28455
},
{
"entropy": 5.547447299957275,
"epoch": 2.2142773779420346,
"grad_norm": 1.1796875,
"learning_rate": 0.000450450490293145,
"loss": 5.1999,
"mean_token_accuracy": 0.18296363353729247,
"num_tokens": 49375907.0,
"step": 28460
},
{
"entropy": 5.478766775131225,
"epoch": 2.2146664073137523,
"grad_norm": 1.2578125,
"learning_rate": 0.000450433137516274,
"loss": 5.058,
"mean_token_accuracy": 0.19200606793165206,
"num_tokens": 49383871.0,
"step": 28465
},
{
"entropy": 5.390125322341919,
"epoch": 2.2150554366854696,
"grad_norm": 1.4375,
"learning_rate": 0.0004504157820774844,
"loss": 5.0414,
"mean_token_accuracy": 0.19693129658699035,
"num_tokens": 49392452.0,
"step": 28470
},
{
"entropy": 5.3331615924835205,
"epoch": 2.2154444660571873,
"grad_norm": 1.1640625,
"learning_rate": 0.0004503984239770396,
"loss": 4.9197,
"mean_token_accuracy": 0.1997067853808403,
"num_tokens": 49401698.0,
"step": 28475
},
{
"entropy": 5.425263071060181,
"epoch": 2.215833495428905,
"grad_norm": 1.1875,
"learning_rate": 0.0004503810632152028,
"loss": 5.0765,
"mean_token_accuracy": 0.1882842019200325,
"num_tokens": 49409505.0,
"step": 28480
},
{
"entropy": 5.431936502456665,
"epoch": 2.2162225248006227,
"grad_norm": 1.21875,
"learning_rate": 0.0004503636997922375,
"loss": 5.0906,
"mean_token_accuracy": 0.18762342035770416,
"num_tokens": 49418489.0,
"step": 28485
},
{
"entropy": 5.449176597595215,
"epoch": 2.21661155417234,
"grad_norm": 1.265625,
"learning_rate": 0.0004503463337084072,
"loss": 5.0097,
"mean_token_accuracy": 0.20085590928792954,
"num_tokens": 49426989.0,
"step": 28490
},
{
"entropy": 5.453350162506103,
"epoch": 2.2170005835440576,
"grad_norm": 1.078125,
"learning_rate": 0.0004503289649639754,
"loss": 5.0713,
"mean_token_accuracy": 0.19008762240409852,
"num_tokens": 49436199.0,
"step": 28495
},
{
"entropy": 5.359768295288086,
"epoch": 2.2173896129157753,
"grad_norm": 1.203125,
"learning_rate": 0.0004503115935592056,
"loss": 4.9363,
"mean_token_accuracy": 0.20054423362016677,
"num_tokens": 49444092.0,
"step": 28500
},
{
"entropy": 5.409162425994873,
"epoch": 2.2177786422874926,
"grad_norm": 1.2734375,
"learning_rate": 0.0004502942194943614,
"loss": 5.0736,
"mean_token_accuracy": 0.19296668767929076,
"num_tokens": 49452461.0,
"step": 28505
},
{
"entropy": 5.492364120483399,
"epoch": 2.2181676716592102,
"grad_norm": 1.2109375,
"learning_rate": 0.00045027684276970645,
"loss": 5.0259,
"mean_token_accuracy": 0.1925903305411339,
"num_tokens": 49461972.0,
"step": 28510
},
{
"entropy": 5.4426429271698,
"epoch": 2.218556701030928,
"grad_norm": 1.09375,
"learning_rate": 0.00045025946338550434,
"loss": 5.0323,
"mean_token_accuracy": 0.1941555008292198,
"num_tokens": 49470656.0,
"step": 28515
},
{
"entropy": 5.359527254104615,
"epoch": 2.218945730402645,
"grad_norm": 1.15625,
"learning_rate": 0.0004502420813420189,
"loss": 5.0563,
"mean_token_accuracy": 0.19127824008464814,
"num_tokens": 49479018.0,
"step": 28520
},
{
"entropy": 5.418989944458008,
"epoch": 2.219334759774363,
"grad_norm": 1.140625,
"learning_rate": 0.0004502246966395137,
"loss": 5.0578,
"mean_token_accuracy": 0.194000506401062,
"num_tokens": 49487521.0,
"step": 28525
},
{
"entropy": 5.455978202819824,
"epoch": 2.2197237891460806,
"grad_norm": 1.21875,
"learning_rate": 0.00045020730927825274,
"loss": 5.1045,
"mean_token_accuracy": 0.18716869950294496,
"num_tokens": 49495382.0,
"step": 28530
},
{
"entropy": 5.403925466537475,
"epoch": 2.2201128185177983,
"grad_norm": 1.15625,
"learning_rate": 0.0004501899192584997,
"loss": 4.9987,
"mean_token_accuracy": 0.19890448749065398,
"num_tokens": 49503819.0,
"step": 28535
},
{
"entropy": 5.38745231628418,
"epoch": 2.2205018478895155,
"grad_norm": 1.078125,
"learning_rate": 0.0004501725265805185,
"loss": 5.0641,
"mean_token_accuracy": 0.1917824551463127,
"num_tokens": 49512908.0,
"step": 28540
},
{
"entropy": 5.461819267272949,
"epoch": 2.2208908772612332,
"grad_norm": 1.0703125,
"learning_rate": 0.00045015513124457303,
"loss": 5.0742,
"mean_token_accuracy": 0.1927698254585266,
"num_tokens": 49522462.0,
"step": 28545
},
{
"entropy": 5.4629395484924315,
"epoch": 2.221279906632951,
"grad_norm": 1.1875,
"learning_rate": 0.0004501377332509272,
"loss": 5.0705,
"mean_token_accuracy": 0.19376590251922607,
"num_tokens": 49531089.0,
"step": 28550
},
{
"entropy": 5.444423961639404,
"epoch": 2.221668936004668,
"grad_norm": 1.21875,
"learning_rate": 0.00045012033259984494,
"loss": 4.9962,
"mean_token_accuracy": 0.1948261797428131,
"num_tokens": 49539074.0,
"step": 28555
},
{
"entropy": 5.362420511245728,
"epoch": 2.222057965376386,
"grad_norm": 1.1796875,
"learning_rate": 0.0004501029292915905,
"loss": 5.0564,
"mean_token_accuracy": 0.19520948380231856,
"num_tokens": 49547879.0,
"step": 28560
},
{
"entropy": 5.502680253982544,
"epoch": 2.2224469947481036,
"grad_norm": 1.171875,
"learning_rate": 0.00045008552332642774,
"loss": 5.1262,
"mean_token_accuracy": 0.1951983615756035,
"num_tokens": 49556220.0,
"step": 28565
},
{
"entropy": 5.457561779022217,
"epoch": 2.222836024119821,
"grad_norm": 1.1484375,
"learning_rate": 0.00045006811470462083,
"loss": 5.0126,
"mean_token_accuracy": 0.19352376013994216,
"num_tokens": 49564710.0,
"step": 28570
},
{
"entropy": 5.345428705215454,
"epoch": 2.2232250534915385,
"grad_norm": 1.171875,
"learning_rate": 0.000450050703426434,
"loss": 4.9502,
"mean_token_accuracy": 0.19422867447137832,
"num_tokens": 49572829.0,
"step": 28575
},
{
"entropy": 5.367513847351074,
"epoch": 2.2236140828632562,
"grad_norm": 1.265625,
"learning_rate": 0.0004500332894921313,
"loss": 5.0899,
"mean_token_accuracy": 0.19512893110513688,
"num_tokens": 49580355.0,
"step": 28580
},
{
"entropy": 5.427493906021118,
"epoch": 2.224003112234974,
"grad_norm": 1.15625,
"learning_rate": 0.0004500158729019771,
"loss": 5.0361,
"mean_token_accuracy": 0.19477384984493257,
"num_tokens": 49589086.0,
"step": 28585
},
{
"entropy": 5.372280645370483,
"epoch": 2.224392141606691,
"grad_norm": 1.2265625,
"learning_rate": 0.0004499984536562355,
"loss": 4.9821,
"mean_token_accuracy": 0.1943938747048378,
"num_tokens": 49597434.0,
"step": 28590
},
{
"entropy": 5.455588054656983,
"epoch": 2.224781170978409,
"grad_norm": 1.2734375,
"learning_rate": 0.000449981031755171,
"loss": 5.0402,
"mean_token_accuracy": 0.19604054987430572,
"num_tokens": 49604981.0,
"step": 28595
},
{
"entropy": 5.472573947906494,
"epoch": 2.2251702003501266,
"grad_norm": 1.125,
"learning_rate": 0.00044996360719904777,
"loss": 5.0512,
"mean_token_accuracy": 0.19621344804763793,
"num_tokens": 49614119.0,
"step": 28600
},
{
"entropy": 5.484685277938842,
"epoch": 2.225559229721844,
"grad_norm": 1.1484375,
"learning_rate": 0.0004499461799881303,
"loss": 5.0908,
"mean_token_accuracy": 0.19170414805412292,
"num_tokens": 49622705.0,
"step": 28605
},
{
"entropy": 5.432948970794678,
"epoch": 2.2259482590935615,
"grad_norm": 1.2421875,
"learning_rate": 0.0004499287501226831,
"loss": 5.085,
"mean_token_accuracy": 0.18198685944080353,
"num_tokens": 49632086.0,
"step": 28610
},
{
"entropy": 5.437659168243409,
"epoch": 2.2263372884652792,
"grad_norm": 1.2578125,
"learning_rate": 0.00044991131760297045,
"loss": 5.0783,
"mean_token_accuracy": 0.19741007834672927,
"num_tokens": 49640733.0,
"step": 28615
},
{
"entropy": 5.36816439628601,
"epoch": 2.226726317836997,
"grad_norm": 1.140625,
"learning_rate": 0.00044989388242925693,
"loss": 5.0387,
"mean_token_accuracy": 0.19523588567972183,
"num_tokens": 49649694.0,
"step": 28620
},
{
"entropy": 5.464972400665284,
"epoch": 2.227115347208714,
"grad_norm": 1.2109375,
"learning_rate": 0.0004498764446018073,
"loss": 5.1373,
"mean_token_accuracy": 0.19174990952014923,
"num_tokens": 49657536.0,
"step": 28625
},
{
"entropy": 5.4100339889526365,
"epoch": 2.227504376580432,
"grad_norm": 1.15625,
"learning_rate": 0.0004498590041208857,
"loss": 4.9753,
"mean_token_accuracy": 0.19697984009981157,
"num_tokens": 49666332.0,
"step": 28630
},
{
"entropy": 5.327340698242187,
"epoch": 2.2278934059521496,
"grad_norm": 1.171875,
"learning_rate": 0.0004498415609867572,
"loss": 4.9534,
"mean_token_accuracy": 0.20087965875864028,
"num_tokens": 49675364.0,
"step": 28635
},
{
"entropy": 5.465593671798706,
"epoch": 2.228282435323867,
"grad_norm": 1.078125,
"learning_rate": 0.00044982411519968625,
"loss": 5.1707,
"mean_token_accuracy": 0.18378072679042817,
"num_tokens": 49684178.0,
"step": 28640
},
{
"entropy": 5.497609281539917,
"epoch": 2.2286714646955845,
"grad_norm": 1.171875,
"learning_rate": 0.0004498066667599377,
"loss": 5.0678,
"mean_token_accuracy": 0.18995979726314544,
"num_tokens": 49692747.0,
"step": 28645
},
{
"entropy": 5.358578634262085,
"epoch": 2.2290604940673022,
"grad_norm": 1.21875,
"learning_rate": 0.00044978921566777604,
"loss": 5.0498,
"mean_token_accuracy": 0.19096174091100693,
"num_tokens": 49701534.0,
"step": 28650
},
{
"entropy": 5.4067071914672855,
"epoch": 2.2294495234390195,
"grad_norm": 1.1796875,
"learning_rate": 0.0004497717619234664,
"loss": 5.0586,
"mean_token_accuracy": 0.1915797084569931,
"num_tokens": 49710021.0,
"step": 28655
},
{
"entropy": 5.37641716003418,
"epoch": 2.229838552810737,
"grad_norm": 1.1953125,
"learning_rate": 0.00044975430552727337,
"loss": 4.9676,
"mean_token_accuracy": 0.1949818715453148,
"num_tokens": 49718786.0,
"step": 28660
},
{
"entropy": 5.42541537284851,
"epoch": 2.230227582182455,
"grad_norm": 1.21875,
"learning_rate": 0.0004497368464794619,
"loss": 5.0487,
"mean_token_accuracy": 0.1926829233765602,
"num_tokens": 49726840.0,
"step": 28665
},
{
"entropy": 5.472784900665284,
"epoch": 2.230616611554172,
"grad_norm": 1.15625,
"learning_rate": 0.00044971938478029693,
"loss": 5.1084,
"mean_token_accuracy": 0.18873153030872344,
"num_tokens": 49736130.0,
"step": 28670
},
{
"entropy": 5.406555986404419,
"epoch": 2.23100564092589,
"grad_norm": 1.1015625,
"learning_rate": 0.00044970192043004343,
"loss": 5.0256,
"mean_token_accuracy": 0.1886287122964859,
"num_tokens": 49744810.0,
"step": 28675
},
{
"entropy": 5.4270611763000485,
"epoch": 2.2313946702976075,
"grad_norm": 1.1328125,
"learning_rate": 0.0004496844534289663,
"loss": 5.0481,
"mean_token_accuracy": 0.19720927774906158,
"num_tokens": 49754053.0,
"step": 28680
},
{
"entropy": 5.482103395462036,
"epoch": 2.231783699669325,
"grad_norm": 1.140625,
"learning_rate": 0.00044966698377733064,
"loss": 5.0621,
"mean_token_accuracy": 0.1866968497633934,
"num_tokens": 49763735.0,
"step": 28685
},
{
"entropy": 5.447889089584351,
"epoch": 2.2321727290410425,
"grad_norm": 1.15625,
"learning_rate": 0.0004496495114754015,
"loss": 5.1044,
"mean_token_accuracy": 0.19134055376052855,
"num_tokens": 49772867.0,
"step": 28690
},
{
"entropy": 5.337449598312378,
"epoch": 2.23256175841276,
"grad_norm": 1.1953125,
"learning_rate": 0.00044963203652344404,
"loss": 4.9098,
"mean_token_accuracy": 0.2004231259226799,
"num_tokens": 49781460.0,
"step": 28695
},
{
"entropy": 5.359178495407105,
"epoch": 2.232950787784478,
"grad_norm": 1.34375,
"learning_rate": 0.0004496145589217234,
"loss": 4.9408,
"mean_token_accuracy": 0.19290661066770554,
"num_tokens": 49790249.0,
"step": 28700
},
{
"entropy": 5.437139463424683,
"epoch": 2.233339817156195,
"grad_norm": 1.1875,
"learning_rate": 0.00044959707867050467,
"loss": 5.0002,
"mean_token_accuracy": 0.1987817481160164,
"num_tokens": 49797959.0,
"step": 28705
},
{
"entropy": 5.340733814239502,
"epoch": 2.233728846527913,
"grad_norm": 1.1796875,
"learning_rate": 0.0004495795957700532,
"loss": 4.9404,
"mean_token_accuracy": 0.2024763584136963,
"num_tokens": 49806669.0,
"step": 28710
},
{
"entropy": 5.368253421783447,
"epoch": 2.2341178758996305,
"grad_norm": 1.140625,
"learning_rate": 0.00044956211022063424,
"loss": 5.1679,
"mean_token_accuracy": 0.18785798400640488,
"num_tokens": 49816821.0,
"step": 28715
},
{
"entropy": 5.519353008270263,
"epoch": 2.234506905271348,
"grad_norm": 1.0859375,
"learning_rate": 0.00044954462202251316,
"loss": 5.0555,
"mean_token_accuracy": 0.19579057544469833,
"num_tokens": 49825411.0,
"step": 28720
},
{
"entropy": 5.437824344635009,
"epoch": 2.2348959346430655,
"grad_norm": 1.2109375,
"learning_rate": 0.00044952713117595516,
"loss": 5.0818,
"mean_token_accuracy": 0.1920386806130409,
"num_tokens": 49833496.0,
"step": 28725
},
{
"entropy": 5.335183477401733,
"epoch": 2.235284964014783,
"grad_norm": 1.1953125,
"learning_rate": 0.00044950963768122576,
"loss": 5.0216,
"mean_token_accuracy": 0.1824677914381027,
"num_tokens": 49842935.0,
"step": 28730
},
{
"entropy": 5.406265830993652,
"epoch": 2.235673993386501,
"grad_norm": 1.3984375,
"learning_rate": 0.0004494921415385905,
"loss": 5.0814,
"mean_token_accuracy": 0.188034787774086,
"num_tokens": 49851197.0,
"step": 28735
},
{
"entropy": 5.433552026748657,
"epoch": 2.236063022758218,
"grad_norm": 1.1796875,
"learning_rate": 0.00044947464274831464,
"loss": 4.9823,
"mean_token_accuracy": 0.20005682557821275,
"num_tokens": 49859778.0,
"step": 28740
},
{
"entropy": 5.419425678253174,
"epoch": 2.236452052129936,
"grad_norm": 1.1875,
"learning_rate": 0.0004494571413106637,
"loss": 5.0541,
"mean_token_accuracy": 0.18709381371736528,
"num_tokens": 49868548.0,
"step": 28745
},
{
"entropy": 5.421139812469482,
"epoch": 2.2368410815016535,
"grad_norm": 1.140625,
"learning_rate": 0.00044943963722590344,
"loss": 5.0134,
"mean_token_accuracy": 0.19126642346382142,
"num_tokens": 49877070.0,
"step": 28750
},
{
"entropy": 5.431540298461914,
"epoch": 2.2372301108733708,
"grad_norm": 1.109375,
"learning_rate": 0.00044942213049429917,
"loss": 5.0766,
"mean_token_accuracy": 0.18995630741119385,
"num_tokens": 49885225.0,
"step": 28755
},
{
"entropy": 5.411355876922608,
"epoch": 2.2376191402450885,
"grad_norm": 1.1640625,
"learning_rate": 0.00044940462111611685,
"loss": 5.1641,
"mean_token_accuracy": 0.18878839164972305,
"num_tokens": 49894305.0,
"step": 28760
},
{
"entropy": 5.414623498916626,
"epoch": 2.238008169616806,
"grad_norm": 1.15625,
"learning_rate": 0.00044938710909162195,
"loss": 4.9747,
"mean_token_accuracy": 0.19653355777263642,
"num_tokens": 49902587.0,
"step": 28765
},
{
"entropy": 5.399187994003296,
"epoch": 2.2383971989885234,
"grad_norm": 1.1953125,
"learning_rate": 0.0004493695944210802,
"loss": 4.9193,
"mean_token_accuracy": 0.19730149805545807,
"num_tokens": 49911037.0,
"step": 28770
},
{
"entropy": 5.390562868118286,
"epoch": 2.238786228360241,
"grad_norm": 1.0703125,
"learning_rate": 0.0004493520771047574,
"loss": 5.0686,
"mean_token_accuracy": 0.1962337464094162,
"num_tokens": 49920724.0,
"step": 28775
},
{
"entropy": 5.356308078765869,
"epoch": 2.239175257731959,
"grad_norm": 1.1875,
"learning_rate": 0.00044933455714291944,
"loss": 5.0438,
"mean_token_accuracy": 0.1982683926820755,
"num_tokens": 49929173.0,
"step": 28780
},
{
"entropy": 5.449581289291382,
"epoch": 2.2395642871036765,
"grad_norm": 1.171875,
"learning_rate": 0.00044931703453583195,
"loss": 5.039,
"mean_token_accuracy": 0.18977890461683272,
"num_tokens": 49938213.0,
"step": 28785
},
{
"entropy": 5.405972719192505,
"epoch": 2.2399533164753938,
"grad_norm": 1.203125,
"learning_rate": 0.00044929950928376095,
"loss": 4.9326,
"mean_token_accuracy": 0.20035229176282882,
"num_tokens": 49946493.0,
"step": 28790
},
{
"entropy": 5.36329607963562,
"epoch": 2.2403423458471114,
"grad_norm": 1.1640625,
"learning_rate": 0.0004492819813869723,
"loss": 5.0013,
"mean_token_accuracy": 0.19573189169168473,
"num_tokens": 49954730.0,
"step": 28795
},
{
"entropy": 5.2990320205688475,
"epoch": 2.240731375218829,
"grad_norm": 1.09375,
"learning_rate": 0.00044926445084573206,
"loss": 4.9403,
"mean_token_accuracy": 0.20188199430704118,
"num_tokens": 49962651.0,
"step": 28800
},
{
"entropy": 5.398659324645996,
"epoch": 2.2411204045905464,
"grad_norm": 1.140625,
"learning_rate": 0.000449246917660306,
"loss": 5.0239,
"mean_token_accuracy": 0.19019531458616257,
"num_tokens": 49972560.0,
"step": 28805
},
{
"entropy": 5.442583703994751,
"epoch": 2.241509433962264,
"grad_norm": 1.1640625,
"learning_rate": 0.0004492293818309604,
"loss": 5.0667,
"mean_token_accuracy": 0.19498851597309114,
"num_tokens": 49982292.0,
"step": 28810
},
{
"entropy": 5.472064638137818,
"epoch": 2.241898463333982,
"grad_norm": 1.2109375,
"learning_rate": 0.0004492118433579613,
"loss": 5.1435,
"mean_token_accuracy": 0.18600668460130693,
"num_tokens": 49990395.0,
"step": 28815
},
{
"entropy": 5.480933332443238,
"epoch": 2.2422874927056995,
"grad_norm": 1.203125,
"learning_rate": 0.00044919430224157463,
"loss": 5.0597,
"mean_token_accuracy": 0.19213223457336426,
"num_tokens": 49998944.0,
"step": 28820
},
{
"entropy": 5.39204216003418,
"epoch": 2.2426765220774167,
"grad_norm": 1.1640625,
"learning_rate": 0.00044917675848206684,
"loss": 4.9624,
"mean_token_accuracy": 0.1958131566643715,
"num_tokens": 50007583.0,
"step": 28825
},
{
"entropy": 5.293333625793457,
"epoch": 2.2430655514491344,
"grad_norm": 1.359375,
"learning_rate": 0.00044915921207970387,
"loss": 4.9033,
"mean_token_accuracy": 0.20214929133653642,
"num_tokens": 50015854.0,
"step": 28830
},
{
"entropy": 5.350975513458252,
"epoch": 2.243454580820852,
"grad_norm": 1.1171875,
"learning_rate": 0.00044914166303475206,
"loss": 4.9209,
"mean_token_accuracy": 0.20385685414075852,
"num_tokens": 50024757.0,
"step": 28835
},
{
"entropy": 5.410600328445435,
"epoch": 2.2438436101925694,
"grad_norm": 1.078125,
"learning_rate": 0.00044912411134747764,
"loss": 5.0109,
"mean_token_accuracy": 0.19406585842370988,
"num_tokens": 50034592.0,
"step": 28840
},
{
"entropy": 5.39328966140747,
"epoch": 2.244232639564287,
"grad_norm": 1.1953125,
"learning_rate": 0.00044910655701814705,
"loss": 5.0388,
"mean_token_accuracy": 0.1890689954161644,
"num_tokens": 50043034.0,
"step": 28845
},
{
"entropy": 5.3367002487182615,
"epoch": 2.244621668936005,
"grad_norm": 1.1953125,
"learning_rate": 0.0004490890000470266,
"loss": 5.0172,
"mean_token_accuracy": 0.19488936364650727,
"num_tokens": 50051683.0,
"step": 28850
},
{
"entropy": 5.3876808166503904,
"epoch": 2.245010698307722,
"grad_norm": 1.1640625,
"learning_rate": 0.00044907144043438265,
"loss": 5.0178,
"mean_token_accuracy": 0.18940330892801285,
"num_tokens": 50060257.0,
"step": 28855
},
{
"entropy": 5.31499137878418,
"epoch": 2.2453997276794397,
"grad_norm": 1.265625,
"learning_rate": 0.0004490538781804816,
"loss": 4.9252,
"mean_token_accuracy": 0.20039663314819336,
"num_tokens": 50068188.0,
"step": 28860
},
{
"entropy": 5.410995721817017,
"epoch": 2.2457887570511574,
"grad_norm": 1.2109375,
"learning_rate": 0.00044903631328559,
"loss": 4.9779,
"mean_token_accuracy": 0.1931019201874733,
"num_tokens": 50076188.0,
"step": 28865
},
{
"entropy": 5.448713254928589,
"epoch": 2.246177786422875,
"grad_norm": 1.2109375,
"learning_rate": 0.00044901874574997444,
"loss": 5.008,
"mean_token_accuracy": 0.20308829843997955,
"num_tokens": 50085139.0,
"step": 28870
},
{
"entropy": 5.488223648071289,
"epoch": 2.2465668157945924,
"grad_norm": 1.1640625,
"learning_rate": 0.00044900117557390137,
"loss": 5.1204,
"mean_token_accuracy": 0.1882877990603447,
"num_tokens": 50093050.0,
"step": 28875
},
{
"entropy": 5.386711263656617,
"epoch": 2.24695584516631,
"grad_norm": 1.203125,
"learning_rate": 0.00044898360275763733,
"loss": 5.0687,
"mean_token_accuracy": 0.1938354790210724,
"num_tokens": 50101854.0,
"step": 28880
},
{
"entropy": 5.433473205566406,
"epoch": 2.247344874538028,
"grad_norm": 1.2109375,
"learning_rate": 0.00044896602730144905,
"loss": 5.0933,
"mean_token_accuracy": 0.18615814447402954,
"num_tokens": 50110430.0,
"step": 28885
},
{
"entropy": 5.460976886749267,
"epoch": 2.247733903909745,
"grad_norm": 1.1328125,
"learning_rate": 0.00044894844920560323,
"loss": 5.0181,
"mean_token_accuracy": 0.19567243605852128,
"num_tokens": 50118633.0,
"step": 28890
},
{
"entropy": 5.4637494564056395,
"epoch": 2.2481229332814627,
"grad_norm": 1.15625,
"learning_rate": 0.0004489308684703666,
"loss": 5.093,
"mean_token_accuracy": 0.186974436044693,
"num_tokens": 50129120.0,
"step": 28895
},
{
"entropy": 5.50718502998352,
"epoch": 2.2485119626531804,
"grad_norm": 1.171875,
"learning_rate": 0.0004489132850960059,
"loss": 5.0825,
"mean_token_accuracy": 0.18886901140213014,
"num_tokens": 50138404.0,
"step": 28900
},
{
"entropy": 5.43050479888916,
"epoch": 2.2489009920248977,
"grad_norm": 1.203125,
"learning_rate": 0.0004488956990827878,
"loss": 5.0154,
"mean_token_accuracy": 0.18570856899023055,
"num_tokens": 50146908.0,
"step": 28905
},
{
"entropy": 5.321598863601684,
"epoch": 2.2492900213966154,
"grad_norm": 1.0859375,
"learning_rate": 0.0004488781104309793,
"loss": 4.9507,
"mean_token_accuracy": 0.19691694974899293,
"num_tokens": 50155922.0,
"step": 28910
},
{
"entropy": 5.402777147293091,
"epoch": 2.249679050768333,
"grad_norm": 1.1796875,
"learning_rate": 0.00044886051914084726,
"loss": 5.0655,
"mean_token_accuracy": 0.19346524477005006,
"num_tokens": 50164023.0,
"step": 28915
},
{
"entropy": 5.377311515808105,
"epoch": 2.2500680801400508,
"grad_norm": 1.15625,
"learning_rate": 0.00044884292521265846,
"loss": 4.965,
"mean_token_accuracy": 0.19387730062007905,
"num_tokens": 50172147.0,
"step": 28920
},
{
"entropy": 5.380008792877197,
"epoch": 2.250457109511768,
"grad_norm": 1.1484375,
"learning_rate": 0.0004488253286466801,
"loss": 5.0892,
"mean_token_accuracy": 0.18070694506168367,
"num_tokens": 50180484.0,
"step": 28925
},
{
"entropy": 5.3693122386932375,
"epoch": 2.2508461388834857,
"grad_norm": 1.1640625,
"learning_rate": 0.00044880772944317905,
"loss": 4.9744,
"mean_token_accuracy": 0.18953001052141188,
"num_tokens": 50189176.0,
"step": 28930
},
{
"entropy": 5.448866653442383,
"epoch": 2.2512351682552034,
"grad_norm": 1.1875,
"learning_rate": 0.00044879012760242224,
"loss": 4.9965,
"mean_token_accuracy": 0.2044367164373398,
"num_tokens": 50197674.0,
"step": 28935
},
{
"entropy": 5.463055181503296,
"epoch": 2.2516241976269207,
"grad_norm": 1.21875,
"learning_rate": 0.00044877252312467694,
"loss": 5.0725,
"mean_token_accuracy": 0.18741465955972672,
"num_tokens": 50206681.0,
"step": 28940
},
{
"entropy": 5.486759996414184,
"epoch": 2.2520132269986384,
"grad_norm": 1.125,
"learning_rate": 0.0004487549160102101,
"loss": 5.1117,
"mean_token_accuracy": 0.18628530949354172,
"num_tokens": 50215457.0,
"step": 28945
},
{
"entropy": 5.448297786712646,
"epoch": 2.252402256370356,
"grad_norm": 1.1796875,
"learning_rate": 0.00044873730625928914,
"loss": 4.9911,
"mean_token_accuracy": 0.19212005585432052,
"num_tokens": 50224757.0,
"step": 28950
},
{
"entropy": 5.47625503540039,
"epoch": 2.2527912857420738,
"grad_norm": 1.1015625,
"learning_rate": 0.00044871969387218094,
"loss": 5.0694,
"mean_token_accuracy": 0.19121143519878386,
"num_tokens": 50233570.0,
"step": 28955
},
{
"entropy": 5.424491024017334,
"epoch": 2.253180315113791,
"grad_norm": 1.234375,
"learning_rate": 0.000448702078849153,
"loss": 5.0136,
"mean_token_accuracy": 0.19430207312107087,
"num_tokens": 50241767.0,
"step": 28960
},
{
"entropy": 5.334303522109986,
"epoch": 2.2535693444855087,
"grad_norm": 1.203125,
"learning_rate": 0.00044868446119047234,
"loss": 4.9705,
"mean_token_accuracy": 0.19489261656999587,
"num_tokens": 50250121.0,
"step": 28965
},
{
"entropy": 5.513517379760742,
"epoch": 2.253958373857226,
"grad_norm": 1.125,
"learning_rate": 0.0004486668408964065,
"loss": 5.1097,
"mean_token_accuracy": 0.18693292886018753,
"num_tokens": 50258717.0,
"step": 28970
},
{
"entropy": 5.443153238296508,
"epoch": 2.2543474032289437,
"grad_norm": 1.171875,
"learning_rate": 0.0004486492179672228,
"loss": 5.0776,
"mean_token_accuracy": 0.19376598447561263,
"num_tokens": 50267528.0,
"step": 28975
},
{
"entropy": 5.44549593925476,
"epoch": 2.2547364326006614,
"grad_norm": 1.15625,
"learning_rate": 0.00044863159240318863,
"loss": 5.0601,
"mean_token_accuracy": 0.19213285595178603,
"num_tokens": 50276197.0,
"step": 28980
},
{
"entropy": 5.360124492645264,
"epoch": 2.255125461972379,
"grad_norm": 1.15625,
"learning_rate": 0.0004486139642045714,
"loss": 4.9297,
"mean_token_accuracy": 0.20051412284374237,
"num_tokens": 50284222.0,
"step": 28985
},
{
"entropy": 5.369151592254639,
"epoch": 2.2555144913440963,
"grad_norm": 1.109375,
"learning_rate": 0.0004485963333716385,
"loss": 4.9726,
"mean_token_accuracy": 0.19270563572645188,
"num_tokens": 50293061.0,
"step": 28990
},
{
"entropy": 5.377377223968506,
"epoch": 2.255903520715814,
"grad_norm": 1.1875,
"learning_rate": 0.0004485786999046576,
"loss": 4.9929,
"mean_token_accuracy": 0.1975897043943405,
"num_tokens": 50301601.0,
"step": 28995
},
{
"entropy": 5.371033763885498,
"epoch": 2.2562925500875317,
"grad_norm": 1.15625,
"learning_rate": 0.00044856106380389624,
"loss": 5.0488,
"mean_token_accuracy": 0.19779658317565918,
"num_tokens": 50311595.0,
"step": 29000
},
{
"entropy": 5.3995050430297855,
"epoch": 2.256681579459249,
"grad_norm": 1.171875,
"learning_rate": 0.000448543425069622,
"loss": 5.003,
"mean_token_accuracy": 0.1960317000746727,
"num_tokens": 50320205.0,
"step": 29005
},
{
"entropy": 5.433222532272339,
"epoch": 2.2570706088309667,
"grad_norm": 1.1796875,
"learning_rate": 0.0004485257837021025,
"loss": 4.9854,
"mean_token_accuracy": 0.19838855117559434,
"num_tokens": 50328414.0,
"step": 29010
},
{
"entropy": 5.380955171585083,
"epoch": 2.2574596382026844,
"grad_norm": 1.171875,
"learning_rate": 0.00044850813970160534,
"loss": 5.0232,
"mean_token_accuracy": 0.19880659133195877,
"num_tokens": 50337206.0,
"step": 29015
},
{
"entropy": 5.422238445281982,
"epoch": 2.257848667574402,
"grad_norm": 1.25,
"learning_rate": 0.0004484904930683984,
"loss": 5.0605,
"mean_token_accuracy": 0.190559583902359,
"num_tokens": 50346320.0,
"step": 29020
},
{
"entropy": 5.425434732437134,
"epoch": 2.2582376969461193,
"grad_norm": 1.140625,
"learning_rate": 0.0004484728438027494,
"loss": 5.0288,
"mean_token_accuracy": 0.19288922995328903,
"num_tokens": 50354199.0,
"step": 29025
},
{
"entropy": 5.424587249755859,
"epoch": 2.258626726317837,
"grad_norm": 1.21875,
"learning_rate": 0.0004484551919049261,
"loss": 5.0539,
"mean_token_accuracy": 0.19648435115814208,
"num_tokens": 50363085.0,
"step": 29030
},
{
"entropy": 5.403090906143189,
"epoch": 2.2590157556895547,
"grad_norm": 1.1328125,
"learning_rate": 0.00044843753737519625,
"loss": 4.9963,
"mean_token_accuracy": 0.1921306371688843,
"num_tokens": 50371211.0,
"step": 29035
},
{
"entropy": 5.4104550838470455,
"epoch": 2.259404785061272,
"grad_norm": 1.2578125,
"learning_rate": 0.0004484198802138279,
"loss": 4.9913,
"mean_token_accuracy": 0.1983576864004135,
"num_tokens": 50379426.0,
"step": 29040
},
{
"entropy": 5.403225088119507,
"epoch": 2.2597938144329897,
"grad_norm": 1.25,
"learning_rate": 0.0004484022204210889,
"loss": 5.0628,
"mean_token_accuracy": 0.1954989030957222,
"num_tokens": 50388073.0,
"step": 29045
},
{
"entropy": 5.329072046279907,
"epoch": 2.2601828438047074,
"grad_norm": 1.1640625,
"learning_rate": 0.00044838455799724717,
"loss": 4.9447,
"mean_token_accuracy": 0.19749689549207688,
"num_tokens": 50395943.0,
"step": 29050
},
{
"entropy": 5.393757057189942,
"epoch": 2.260571873176425,
"grad_norm": 1.1484375,
"learning_rate": 0.00044836689294257075,
"loss": 5.0318,
"mean_token_accuracy": 0.19123842418193818,
"num_tokens": 50405218.0,
"step": 29055
},
{
"entropy": 5.352708578109741,
"epoch": 2.2609609025481423,
"grad_norm": 1.125,
"learning_rate": 0.0004483492252573276,
"loss": 4.9684,
"mean_token_accuracy": 0.1951957568526268,
"num_tokens": 50414169.0,
"step": 29060
},
{
"entropy": 5.423509836196899,
"epoch": 2.26134993191986,
"grad_norm": 1.2109375,
"learning_rate": 0.000448331554941786,
"loss": 5.084,
"mean_token_accuracy": 0.18814474791288377,
"num_tokens": 50422541.0,
"step": 29065
},
{
"entropy": 5.38032021522522,
"epoch": 2.2617389612915777,
"grad_norm": 1.2109375,
"learning_rate": 0.00044831388199621385,
"loss": 4.9728,
"mean_token_accuracy": 0.19526656717061996,
"num_tokens": 50431081.0,
"step": 29070
},
{
"entropy": 5.406199741363525,
"epoch": 2.262127990663295,
"grad_norm": 1.25,
"learning_rate": 0.00044829620642087946,
"loss": 5.0596,
"mean_token_accuracy": 0.19210369288921356,
"num_tokens": 50439279.0,
"step": 29075
},
{
"entropy": 5.4037707328796385,
"epoch": 2.2625170200350126,
"grad_norm": 1.1015625,
"learning_rate": 0.0004482785282160509,
"loss": 5.0311,
"mean_token_accuracy": 0.1905087113380432,
"num_tokens": 50447628.0,
"step": 29080
},
{
"entropy": 5.466364479064941,
"epoch": 2.2629060494067303,
"grad_norm": 1.1796875,
"learning_rate": 0.00044826084738199657,
"loss": 5.0694,
"mean_token_accuracy": 0.18789685517549515,
"num_tokens": 50457109.0,
"step": 29085
},
{
"entropy": 5.4476288795471195,
"epoch": 2.2632950787784476,
"grad_norm": 1.1796875,
"learning_rate": 0.00044824316391898464,
"loss": 4.9715,
"mean_token_accuracy": 0.19532388001680373,
"num_tokens": 50466222.0,
"step": 29090
},
{
"entropy": 5.401168918609619,
"epoch": 2.2636841081501653,
"grad_norm": 1.203125,
"learning_rate": 0.00044822547782728334,
"loss": 5.0055,
"mean_token_accuracy": 0.1953868016600609,
"num_tokens": 50475382.0,
"step": 29095
},
{
"entropy": 5.450822448730468,
"epoch": 2.264073137521883,
"grad_norm": 1.1953125,
"learning_rate": 0.0004482077891071612,
"loss": 5.0609,
"mean_token_accuracy": 0.19519524425268173,
"num_tokens": 50483501.0,
"step": 29100
},
{
"entropy": 5.410173082351685,
"epoch": 2.2644621668936002,
"grad_norm": 1.15625,
"learning_rate": 0.00044819009775888655,
"loss": 4.9939,
"mean_token_accuracy": 0.19959497898817063,
"num_tokens": 50492005.0,
"step": 29105
},
{
"entropy": 5.331663656234741,
"epoch": 2.264851196265318,
"grad_norm": 1.1953125,
"learning_rate": 0.00044817240378272784,
"loss": 4.9298,
"mean_token_accuracy": 0.19936015009880065,
"num_tokens": 50500578.0,
"step": 29110
},
{
"entropy": 5.333936738967895,
"epoch": 2.2652402256370356,
"grad_norm": 1.1875,
"learning_rate": 0.00044815470717895345,
"loss": 4.9335,
"mean_token_accuracy": 0.19702517241239548,
"num_tokens": 50509285.0,
"step": 29115
},
{
"entropy": 5.311067152023315,
"epoch": 2.2656292550087533,
"grad_norm": 1.171875,
"learning_rate": 0.0004481370079478321,
"loss": 4.9757,
"mean_token_accuracy": 0.19642349183559418,
"num_tokens": 50517519.0,
"step": 29120
},
{
"entropy": 5.345245885848999,
"epoch": 2.2660182843804706,
"grad_norm": 1.234375,
"learning_rate": 0.0004481193060896322,
"loss": 4.9858,
"mean_token_accuracy": 0.19470110386610032,
"num_tokens": 50525843.0,
"step": 29125
},
{
"entropy": 5.438086223602295,
"epoch": 2.2664073137521883,
"grad_norm": 1.2265625,
"learning_rate": 0.0004481016016046223,
"loss": 5.0776,
"mean_token_accuracy": 0.18842608481645584,
"num_tokens": 50535638.0,
"step": 29130
},
{
"entropy": 5.455880546569825,
"epoch": 2.266796343123906,
"grad_norm": 1.2421875,
"learning_rate": 0.0004480838944930712,
"loss": 5.0801,
"mean_token_accuracy": 0.18753704577684402,
"num_tokens": 50544327.0,
"step": 29135
},
{
"entropy": 5.419277477264404,
"epoch": 2.2671853724956232,
"grad_norm": 1.1171875,
"learning_rate": 0.0004480661847552474,
"loss": 5.0247,
"mean_token_accuracy": 0.19337700307369232,
"num_tokens": 50552276.0,
"step": 29140
},
{
"entropy": 5.356444406509399,
"epoch": 2.267574401867341,
"grad_norm": 1.1484375,
"learning_rate": 0.0004480484723914198,
"loss": 4.945,
"mean_token_accuracy": 0.20106955170631408,
"num_tokens": 50561247.0,
"step": 29145
},
{
"entropy": 5.438007068634033,
"epoch": 2.2679634312390586,
"grad_norm": 1.2265625,
"learning_rate": 0.0004480307574018571,
"loss": 5.0194,
"mean_token_accuracy": 0.19230543524026872,
"num_tokens": 50569401.0,
"step": 29150
},
{
"entropy": 5.394376659393311,
"epoch": 2.2683524606107763,
"grad_norm": 1.2734375,
"learning_rate": 0.000448013039786828,
"loss": 4.9785,
"mean_token_accuracy": 0.19916591048240662,
"num_tokens": 50577346.0,
"step": 29155
},
{
"entropy": 5.35985631942749,
"epoch": 2.2687414899824936,
"grad_norm": 1.1484375,
"learning_rate": 0.00044799531954660133,
"loss": 5.0073,
"mean_token_accuracy": 0.19526350647211074,
"num_tokens": 50586370.0,
"step": 29160
},
{
"entropy": 5.372613191604614,
"epoch": 2.2691305193542113,
"grad_norm": 1.328125,
"learning_rate": 0.0004479775966814461,
"loss": 4.9388,
"mean_token_accuracy": 0.19573659598827362,
"num_tokens": 50595326.0,
"step": 29165
},
{
"entropy": 5.436210870742798,
"epoch": 2.269519548725929,
"grad_norm": 1.1953125,
"learning_rate": 0.00044795987119163115,
"loss": 5.041,
"mean_token_accuracy": 0.19597284942865373,
"num_tokens": 50603513.0,
"step": 29170
},
{
"entropy": 5.393761682510376,
"epoch": 2.2699085780976462,
"grad_norm": 1.1875,
"learning_rate": 0.0004479421430774255,
"loss": 4.997,
"mean_token_accuracy": 0.1924804463982582,
"num_tokens": 50612416.0,
"step": 29175
},
{
"entropy": 5.391035509109497,
"epoch": 2.270297607469364,
"grad_norm": 1.2265625,
"learning_rate": 0.0004479244123390981,
"loss": 4.9999,
"mean_token_accuracy": 0.20514147728681564,
"num_tokens": 50620480.0,
"step": 29180
},
{
"entropy": 5.273274564743042,
"epoch": 2.2706866368410816,
"grad_norm": 1.3203125,
"learning_rate": 0.00044790667897691796,
"loss": 4.9174,
"mean_token_accuracy": 0.20355746001005173,
"num_tokens": 50629044.0,
"step": 29185
},
{
"entropy": 5.485718584060669,
"epoch": 2.271075666212799,
"grad_norm": 1.2109375,
"learning_rate": 0.00044788894299115415,
"loss": 5.1236,
"mean_token_accuracy": 0.18348329067230223,
"num_tokens": 50638610.0,
"step": 29190
},
{
"entropy": 5.356621646881104,
"epoch": 2.2714646955845166,
"grad_norm": 1.109375,
"learning_rate": 0.0004478712043820758,
"loss": 4.9996,
"mean_token_accuracy": 0.19027577042579652,
"num_tokens": 50647337.0,
"step": 29195
},
{
"entropy": 5.3972070693969725,
"epoch": 2.2718537249562343,
"grad_norm": 1.2109375,
"learning_rate": 0.0004478534631499521,
"loss": 5.0398,
"mean_token_accuracy": 0.19863011240959166,
"num_tokens": 50654641.0,
"step": 29200
},
{
"entropy": 5.351204824447632,
"epoch": 2.2722427543279515,
"grad_norm": 1.125,
"learning_rate": 0.00044783571929505223,
"loss": 5.0612,
"mean_token_accuracy": 0.1829943209886551,
"num_tokens": 50663726.0,
"step": 29205
},
{
"entropy": 5.455354404449463,
"epoch": 2.2726317836996692,
"grad_norm": 1.125,
"learning_rate": 0.0004478179728176454,
"loss": 5.1045,
"mean_token_accuracy": 0.19573165029287337,
"num_tokens": 50672376.0,
"step": 29210
},
{
"entropy": 5.413188314437866,
"epoch": 2.273020813071387,
"grad_norm": 1.140625,
"learning_rate": 0.0004478002237180009,
"loss": 5.0647,
"mean_token_accuracy": 0.1902701735496521,
"num_tokens": 50680990.0,
"step": 29215
},
{
"entropy": 5.494778203964233,
"epoch": 2.2734098424431046,
"grad_norm": 1.1015625,
"learning_rate": 0.000447782471996388,
"loss": 5.1192,
"mean_token_accuracy": 0.18420612663030625,
"num_tokens": 50690180.0,
"step": 29220
},
{
"entropy": 5.4502105712890625,
"epoch": 2.273798871814822,
"grad_norm": 1.203125,
"learning_rate": 0.0004477647176530762,
"loss": 5.025,
"mean_token_accuracy": 0.19688266068696975,
"num_tokens": 50699094.0,
"step": 29225
},
{
"entropy": 5.424303674697876,
"epoch": 2.2741879011865396,
"grad_norm": 1.1796875,
"learning_rate": 0.0004477469606883347,
"loss": 5.0227,
"mean_token_accuracy": 0.18561350852251052,
"num_tokens": 50708312.0,
"step": 29230
},
{
"entropy": 5.34693489074707,
"epoch": 2.2745769305582573,
"grad_norm": 1.0859375,
"learning_rate": 0.0004477292011024331,
"loss": 4.9779,
"mean_token_accuracy": 0.20134482979774476,
"num_tokens": 50717092.0,
"step": 29235
},
{
"entropy": 5.384979248046875,
"epoch": 2.2749659599299745,
"grad_norm": 1.125,
"learning_rate": 0.00044771143889564075,
"loss": 4.9782,
"mean_token_accuracy": 0.19886967092752456,
"num_tokens": 50725641.0,
"step": 29240
},
{
"entropy": 5.343654537200928,
"epoch": 2.275354989301692,
"grad_norm": 1.125,
"learning_rate": 0.00044769367406822727,
"loss": 4.9866,
"mean_token_accuracy": 0.19394454807043077,
"num_tokens": 50734082.0,
"step": 29245
},
{
"entropy": 5.432721424102783,
"epoch": 2.27574401867341,
"grad_norm": 1.21875,
"learning_rate": 0.0004476759066204621,
"loss": 5.0979,
"mean_token_accuracy": 0.18387970626354216,
"num_tokens": 50743242.0,
"step": 29250
},
{
"entropy": 5.452132940292358,
"epoch": 2.2761330480451276,
"grad_norm": 1.140625,
"learning_rate": 0.0004476581365526149,
"loss": 4.9638,
"mean_token_accuracy": 0.19675700068473817,
"num_tokens": 50751693.0,
"step": 29255
},
{
"entropy": 5.372200441360474,
"epoch": 2.276522077416845,
"grad_norm": 1.3203125,
"learning_rate": 0.0004476403638649553,
"loss": 5.0295,
"mean_token_accuracy": 0.1893368422985077,
"num_tokens": 50760031.0,
"step": 29260
},
{
"entropy": 5.332626152038574,
"epoch": 2.2769111067885626,
"grad_norm": 1.1875,
"learning_rate": 0.00044762258855775294,
"loss": 5.0268,
"mean_token_accuracy": 0.1967645689845085,
"num_tokens": 50768236.0,
"step": 29265
},
{
"entropy": 5.4261644840240475,
"epoch": 2.2773001361602803,
"grad_norm": 1.1015625,
"learning_rate": 0.00044760481063127754,
"loss": 5.0204,
"mean_token_accuracy": 0.1951639711856842,
"num_tokens": 50777055.0,
"step": 29270
},
{
"entropy": 5.3938765048980715,
"epoch": 2.2776891655319975,
"grad_norm": 1.234375,
"learning_rate": 0.000447587030085799,
"loss": 5.0499,
"mean_token_accuracy": 0.19254744797945023,
"num_tokens": 50785574.0,
"step": 29275
},
{
"entropy": 5.360202264785767,
"epoch": 2.278078194903715,
"grad_norm": 1.140625,
"learning_rate": 0.00044756924692158684,
"loss": 5.0706,
"mean_token_accuracy": 0.19510678201913834,
"num_tokens": 50794889.0,
"step": 29280
},
{
"entropy": 5.396400737762451,
"epoch": 2.278467224275433,
"grad_norm": 1.1796875,
"learning_rate": 0.0004475514611389111,
"loss": 5.0715,
"mean_token_accuracy": 0.1864430218935013,
"num_tokens": 50804823.0,
"step": 29285
},
{
"entropy": 5.4496666431427006,
"epoch": 2.2788562536471506,
"grad_norm": 1.078125,
"learning_rate": 0.0004475336727380415,
"loss": 4.9121,
"mean_token_accuracy": 0.20357360690832138,
"num_tokens": 50813233.0,
"step": 29290
},
{
"entropy": 5.362728071212769,
"epoch": 2.279245283018868,
"grad_norm": 1.1953125,
"learning_rate": 0.0004475158817192481,
"loss": 4.9997,
"mean_token_accuracy": 0.1945340856909752,
"num_tokens": 50821925.0,
"step": 29295
},
{
"entropy": 5.39490156173706,
"epoch": 2.2796343123905856,
"grad_norm": 1.1875,
"learning_rate": 0.00044749808808280077,
"loss": 5.064,
"mean_token_accuracy": 0.1936425417661667,
"num_tokens": 50831337.0,
"step": 29300
},
{
"entropy": 5.386767435073852,
"epoch": 2.280023341762303,
"grad_norm": 1.1484375,
"learning_rate": 0.00044748029182896956,
"loss": 4.9968,
"mean_token_accuracy": 0.19356952756643295,
"num_tokens": 50840493.0,
"step": 29305
},
{
"entropy": 5.472566413879394,
"epoch": 2.2804123711340205,
"grad_norm": 1.28125,
"learning_rate": 0.0004474624929580243,
"loss": 5.1247,
"mean_token_accuracy": 0.188526251912117,
"num_tokens": 50848843.0,
"step": 29310
},
{
"entropy": 5.450723505020141,
"epoch": 2.280801400505738,
"grad_norm": 1.2109375,
"learning_rate": 0.0004474446914702354,
"loss": 5.0194,
"mean_token_accuracy": 0.1902531459927559,
"num_tokens": 50857882.0,
"step": 29315
},
{
"entropy": 5.464679193496704,
"epoch": 2.281190429877456,
"grad_norm": 1.203125,
"learning_rate": 0.0004474268873658727,
"loss": 5.1591,
"mean_token_accuracy": 0.18380038291215897,
"num_tokens": 50866058.0,
"step": 29320
},
{
"entropy": 5.375986576080322,
"epoch": 2.281579459249173,
"grad_norm": 1.1875,
"learning_rate": 0.0004474090806452064,
"loss": 5.04,
"mean_token_accuracy": 0.1951441138982773,
"num_tokens": 50874175.0,
"step": 29325
},
{
"entropy": 5.376010942459106,
"epoch": 2.281968488620891,
"grad_norm": 1.0546875,
"learning_rate": 0.00044739127130850675,
"loss": 5.0092,
"mean_token_accuracy": 0.19152737706899642,
"num_tokens": 50883753.0,
"step": 29330
},
{
"entropy": 5.422561740875244,
"epoch": 2.2823575179926086,
"grad_norm": 1.1484375,
"learning_rate": 0.00044737345935604397,
"loss": 5.071,
"mean_token_accuracy": 0.19087888896465302,
"num_tokens": 50891962.0,
"step": 29335
},
{
"entropy": 5.444908142089844,
"epoch": 2.282746547364326,
"grad_norm": 1.140625,
"learning_rate": 0.0004473556447880883,
"loss": 4.9855,
"mean_token_accuracy": 0.19870771020650863,
"num_tokens": 50900405.0,
"step": 29340
},
{
"entropy": 5.386417722702026,
"epoch": 2.2831355767360435,
"grad_norm": 1.203125,
"learning_rate": 0.00044733782760490997,
"loss": 5.0744,
"mean_token_accuracy": 0.19026557803153993,
"num_tokens": 50908850.0,
"step": 29345
},
{
"entropy": 5.38972430229187,
"epoch": 2.283524606107761,
"grad_norm": 1.078125,
"learning_rate": 0.0004473200078067795,
"loss": 5.1168,
"mean_token_accuracy": 0.18593920320272445,
"num_tokens": 50918545.0,
"step": 29350
},
{
"entropy": 5.426756906509399,
"epoch": 2.283913635479479,
"grad_norm": 1.15625,
"learning_rate": 0.00044730218539396717,
"loss": 5.0117,
"mean_token_accuracy": 0.20131250470876694,
"num_tokens": 50926664.0,
"step": 29355
},
{
"entropy": 5.406728315353393,
"epoch": 2.284302664851196,
"grad_norm": 1.1796875,
"learning_rate": 0.0004472843603667434,
"loss": 5.1045,
"mean_token_accuracy": 0.17812848538160325,
"num_tokens": 50935846.0,
"step": 29360
},
{
"entropy": 5.3945821762084964,
"epoch": 2.284691694222914,
"grad_norm": 1.140625,
"learning_rate": 0.00044726653272537866,
"loss": 5.027,
"mean_token_accuracy": 0.19640743732452393,
"num_tokens": 50944289.0,
"step": 29365
},
{
"entropy": 5.403178262710571,
"epoch": 2.2850807235946315,
"grad_norm": 1.1796875,
"learning_rate": 0.0004472487024701435,
"loss": 5.0252,
"mean_token_accuracy": 0.1937307521700859,
"num_tokens": 50952949.0,
"step": 29370
},
{
"entropy": 5.494167280197144,
"epoch": 2.285469752966349,
"grad_norm": 1.1875,
"learning_rate": 0.0004472308696013085,
"loss": 5.1062,
"mean_token_accuracy": 0.18653718382120132,
"num_tokens": 50961957.0,
"step": 29375
},
{
"entropy": 5.470838356018066,
"epoch": 2.2858587823380665,
"grad_norm": 1.2109375,
"learning_rate": 0.0004472130341191441,
"loss": 5.0335,
"mean_token_accuracy": 0.19076593965291977,
"num_tokens": 50970463.0,
"step": 29380
},
{
"entropy": 5.439066219329834,
"epoch": 2.286247811709784,
"grad_norm": 1.2265625,
"learning_rate": 0.0004471951960239211,
"loss": 5.0406,
"mean_token_accuracy": 0.1910923272371292,
"num_tokens": 50979350.0,
"step": 29385
},
{
"entropy": 5.42767014503479,
"epoch": 2.286636841081502,
"grad_norm": 1.171875,
"learning_rate": 0.00044717735531591,
"loss": 5.0854,
"mean_token_accuracy": 0.18982186466455458,
"num_tokens": 50988048.0,
"step": 29390
},
{
"entropy": 5.42773027420044,
"epoch": 2.287025870453219,
"grad_norm": 1.2578125,
"learning_rate": 0.00044715951199538156,
"loss": 5.0419,
"mean_token_accuracy": 0.19250741302967073,
"num_tokens": 50996714.0,
"step": 29395
},
{
"entropy": 5.455298376083374,
"epoch": 2.287414899824937,
"grad_norm": 1.171875,
"learning_rate": 0.00044714166606260657,
"loss": 5.0008,
"mean_token_accuracy": 0.1947459176182747,
"num_tokens": 51005557.0,
"step": 29400
},
{
"entropy": 5.432126855850219,
"epoch": 2.2878039291966545,
"grad_norm": 1.265625,
"learning_rate": 0.0004471238175178559,
"loss": 4.9832,
"mean_token_accuracy": 0.19245392829179764,
"num_tokens": 51014024.0,
"step": 29405
},
{
"entropy": 5.30548882484436,
"epoch": 2.288192958568372,
"grad_norm": 1.203125,
"learning_rate": 0.0004471059663614002,
"loss": 4.9067,
"mean_token_accuracy": 0.19526171833276748,
"num_tokens": 51022211.0,
"step": 29410
},
{
"entropy": 5.4010560512542725,
"epoch": 2.2885819879400895,
"grad_norm": 1.1953125,
"learning_rate": 0.0004470881125935103,
"loss": 5.1136,
"mean_token_accuracy": 0.1951492115855217,
"num_tokens": 51030459.0,
"step": 29415
},
{
"entropy": 5.471914291381836,
"epoch": 2.288971017311807,
"grad_norm": 1.2109375,
"learning_rate": 0.00044707025621445735,
"loss": 5.0975,
"mean_token_accuracy": 0.1875719428062439,
"num_tokens": 51038439.0,
"step": 29420
},
{
"entropy": 5.39096097946167,
"epoch": 2.2893600466835244,
"grad_norm": 1.1953125,
"learning_rate": 0.00044705239722451194,
"loss": 4.9662,
"mean_token_accuracy": 0.19921017438173294,
"num_tokens": 51047698.0,
"step": 29425
},
{
"entropy": 5.3665632724761965,
"epoch": 2.289749076055242,
"grad_norm": 1.25,
"learning_rate": 0.00044703453562394544,
"loss": 4.9977,
"mean_token_accuracy": 0.19637516587972642,
"num_tokens": 51056211.0,
"step": 29430
},
{
"entropy": 5.410918283462524,
"epoch": 2.29013810542696,
"grad_norm": 1.25,
"learning_rate": 0.0004470166714130286,
"loss": 5.0063,
"mean_token_accuracy": 0.19521842002868653,
"num_tokens": 51064321.0,
"step": 29435
},
{
"entropy": 5.441994476318359,
"epoch": 2.290527134798677,
"grad_norm": 1.21875,
"learning_rate": 0.00044699880459203264,
"loss": 5.003,
"mean_token_accuracy": 0.19385396242141723,
"num_tokens": 51072537.0,
"step": 29440
},
{
"entropy": 5.39630618095398,
"epoch": 2.290916164170395,
"grad_norm": 1.203125,
"learning_rate": 0.00044698093516122844,
"loss": 4.9927,
"mean_token_accuracy": 0.19747344404459,
"num_tokens": 51080873.0,
"step": 29445
},
{
"entropy": 5.369301128387451,
"epoch": 2.2913051935421125,
"grad_norm": 1.203125,
"learning_rate": 0.0004469630631208874,
"loss": 5.0886,
"mean_token_accuracy": 0.19065219014883042,
"num_tokens": 51089462.0,
"step": 29450
},
{
"entropy": 5.385624980926513,
"epoch": 2.29169422291383,
"grad_norm": 1.1015625,
"learning_rate": 0.0004469451884712805,
"loss": 5.0327,
"mean_token_accuracy": 0.18896263241767883,
"num_tokens": 51098918.0,
"step": 29455
},
{
"entropy": 5.449255800247192,
"epoch": 2.2920832522855474,
"grad_norm": 1.1953125,
"learning_rate": 0.0004469273112126791,
"loss": 5.1105,
"mean_token_accuracy": 0.19002699851989746,
"num_tokens": 51107483.0,
"step": 29460
},
{
"entropy": 5.487997007369995,
"epoch": 2.292472281657265,
"grad_norm": 1.1328125,
"learning_rate": 0.00044690943134535445,
"loss": 5.0909,
"mean_token_accuracy": 0.1889622449874878,
"num_tokens": 51116590.0,
"step": 29465
},
{
"entropy": 5.328696870803833,
"epoch": 2.292861311028983,
"grad_norm": 1.203125,
"learning_rate": 0.0004468915488695777,
"loss": 4.9198,
"mean_token_accuracy": 0.2001431718468666,
"num_tokens": 51125296.0,
"step": 29470
},
{
"entropy": 5.36249098777771,
"epoch": 2.2932503404007,
"grad_norm": 1.265625,
"learning_rate": 0.00044687366378562036,
"loss": 5.0008,
"mean_token_accuracy": 0.1929762288928032,
"num_tokens": 51133369.0,
"step": 29475
},
{
"entropy": 5.540782785415649,
"epoch": 2.293639369772418,
"grad_norm": 1.09375,
"learning_rate": 0.00044685577609375373,
"loss": 5.1683,
"mean_token_accuracy": 0.1924312487244606,
"num_tokens": 51142789.0,
"step": 29480
},
{
"entropy": 5.441058111190796,
"epoch": 2.2940283991441355,
"grad_norm": 1.2578125,
"learning_rate": 0.0004468378857942492,
"loss": 5.0176,
"mean_token_accuracy": 0.18828053772449493,
"num_tokens": 51151706.0,
"step": 29485
},
{
"entropy": 5.4564813613891605,
"epoch": 2.294417428515853,
"grad_norm": 1.1953125,
"learning_rate": 0.00044681999288737826,
"loss": 5.0734,
"mean_token_accuracy": 0.1930876851081848,
"num_tokens": 51160924.0,
"step": 29490
},
{
"entropy": 5.439203310012817,
"epoch": 2.2948064578875704,
"grad_norm": 1.2578125,
"learning_rate": 0.00044680209737341244,
"loss": 5.0785,
"mean_token_accuracy": 0.18928737938404083,
"num_tokens": 51168871.0,
"step": 29495
},
{
"entropy": 5.352751636505127,
"epoch": 2.295195487259288,
"grad_norm": 1.1328125,
"learning_rate": 0.0004467841992526233,
"loss": 4.9757,
"mean_token_accuracy": 0.19594309329986573,
"num_tokens": 51177621.0,
"step": 29500
},
{
"entropy": 5.406075572967529,
"epoch": 2.295584516631006,
"grad_norm": 1.1953125,
"learning_rate": 0.00044676629852528226,
"loss": 4.9563,
"mean_token_accuracy": 0.19968607276678085,
"num_tokens": 51186004.0,
"step": 29505
},
{
"entropy": 5.378000545501709,
"epoch": 2.295973546002723,
"grad_norm": 1.1796875,
"learning_rate": 0.00044674839519166104,
"loss": 4.9619,
"mean_token_accuracy": 0.19854554384946824,
"num_tokens": 51194609.0,
"step": 29510
},
{
"entropy": 5.421860599517823,
"epoch": 2.2963625753744408,
"grad_norm": 1.125,
"learning_rate": 0.00044673048925203136,
"loss": 5.0938,
"mean_token_accuracy": 0.19634728282690048,
"num_tokens": 51203928.0,
"step": 29515
},
{
"entropy": 5.393498086929322,
"epoch": 2.2967516047461585,
"grad_norm": 1.265625,
"learning_rate": 0.00044671258070666476,
"loss": 5.0079,
"mean_token_accuracy": 0.1956377625465393,
"num_tokens": 51212762.0,
"step": 29520
},
{
"entropy": 5.462045955657959,
"epoch": 2.2971406341178757,
"grad_norm": 1.09375,
"learning_rate": 0.0004466946695558331,
"loss": 5.1198,
"mean_token_accuracy": 0.1844208538532257,
"num_tokens": 51221064.0,
"step": 29525
},
{
"entropy": 5.377310466766358,
"epoch": 2.2975296634895934,
"grad_norm": 1.1796875,
"learning_rate": 0.00044667675579980817,
"loss": 5.0026,
"mean_token_accuracy": 0.19178557246923447,
"num_tokens": 51229633.0,
"step": 29530
},
{
"entropy": 5.42229905128479,
"epoch": 2.297918692861311,
"grad_norm": 1.21875,
"learning_rate": 0.0004466588394388616,
"loss": 5.069,
"mean_token_accuracy": 0.19170313328504562,
"num_tokens": 51239051.0,
"step": 29535
},
{
"entropy": 5.425269842147827,
"epoch": 2.2983077222330284,
"grad_norm": 1.1328125,
"learning_rate": 0.0004466409204732654,
"loss": 5.0089,
"mean_token_accuracy": 0.19264118522405624,
"num_tokens": 51247703.0,
"step": 29540
},
{
"entropy": 5.4040679931640625,
"epoch": 2.298696751604746,
"grad_norm": 1.0234375,
"learning_rate": 0.00044662299890329144,
"loss": 4.9502,
"mean_token_accuracy": 0.20201728194952012,
"num_tokens": 51256394.0,
"step": 29545
},
{
"entropy": 5.415617609024048,
"epoch": 2.2990857809764638,
"grad_norm": 1.125,
"learning_rate": 0.0004466050747292116,
"loss": 5.041,
"mean_token_accuracy": 0.19226809740066528,
"num_tokens": 51264181.0,
"step": 29550
},
{
"entropy": 5.348475122451783,
"epoch": 2.2994748103481815,
"grad_norm": 1.2578125,
"learning_rate": 0.000446587147951298,
"loss": 4.9511,
"mean_token_accuracy": 0.1978834643959999,
"num_tokens": 51272758.0,
"step": 29555
},
{
"entropy": 5.437347507476806,
"epoch": 2.2998638397198987,
"grad_norm": 1.21875,
"learning_rate": 0.0004465692185698224,
"loss": 5.0605,
"mean_token_accuracy": 0.1903357043862343,
"num_tokens": 51281681.0,
"step": 29560
},
{
"entropy": 5.413667011260986,
"epoch": 2.3002528690916164,
"grad_norm": 1.1875,
"learning_rate": 0.00044655128658505717,
"loss": 5.0461,
"mean_token_accuracy": 0.19575890600681306,
"num_tokens": 51290060.0,
"step": 29565
},
{
"entropy": 5.426086330413819,
"epoch": 2.300641898463334,
"grad_norm": 1.1796875,
"learning_rate": 0.0004465333519972741,
"loss": 4.9673,
"mean_token_accuracy": 0.194631427526474,
"num_tokens": 51298262.0,
"step": 29570
},
{
"entropy": 5.3567338466644285,
"epoch": 2.3010309278350514,
"grad_norm": 1.2109375,
"learning_rate": 0.0004465154148067454,
"loss": 4.9032,
"mean_token_accuracy": 0.20273461788892747,
"num_tokens": 51306436.0,
"step": 29575
},
{
"entropy": 5.34570345878601,
"epoch": 2.301419957206769,
"grad_norm": 1.25,
"learning_rate": 0.00044649747501374336,
"loss": 4.9881,
"mean_token_accuracy": 0.18986021131277084,
"num_tokens": 51315132.0,
"step": 29580
},
{
"entropy": 5.338670492172241,
"epoch": 2.3018089865784868,
"grad_norm": 1.140625,
"learning_rate": 0.0004464795326185401,
"loss": 4.9616,
"mean_token_accuracy": 0.1970387652516365,
"num_tokens": 51324189.0,
"step": 29585
},
{
"entropy": 5.346889781951904,
"epoch": 2.3021980159502045,
"grad_norm": 1.1015625,
"learning_rate": 0.0004464615876214078,
"loss": 4.9711,
"mean_token_accuracy": 0.1992281898856163,
"num_tokens": 51332680.0,
"step": 29590
},
{
"entropy": 5.444274473190307,
"epoch": 2.3025870453219217,
"grad_norm": 1.125,
"learning_rate": 0.0004464436400226188,
"loss": 5.0522,
"mean_token_accuracy": 0.1943073570728302,
"num_tokens": 51342036.0,
"step": 29595
},
{
"entropy": 5.377940940856933,
"epoch": 2.3029760746936394,
"grad_norm": 1.09375,
"learning_rate": 0.0004464256898224455,
"loss": 4.9877,
"mean_token_accuracy": 0.18870593458414078,
"num_tokens": 51350987.0,
"step": 29600
},
{
"entropy": 5.399097204208374,
"epoch": 2.303365104065357,
"grad_norm": 1.140625,
"learning_rate": 0.0004464077370211602,
"loss": 4.9922,
"mean_token_accuracy": 0.19698799401521683,
"num_tokens": 51359787.0,
"step": 29605
},
{
"entropy": 5.390316295623779,
"epoch": 2.3037541334370744,
"grad_norm": 1.296875,
"learning_rate": 0.00044638978161903533,
"loss": 5.0862,
"mean_token_accuracy": 0.1884043887257576,
"num_tokens": 51368329.0,
"step": 29610
},
{
"entropy": 5.4342413425445555,
"epoch": 2.304143162808792,
"grad_norm": 1.1953125,
"learning_rate": 0.0004463718236163433,
"loss": 5.0807,
"mean_token_accuracy": 0.18552881777286528,
"num_tokens": 51377104.0,
"step": 29615
},
{
"entropy": 5.426706266403198,
"epoch": 2.3045321921805098,
"grad_norm": 1.234375,
"learning_rate": 0.00044635386301335666,
"loss": 5.0765,
"mean_token_accuracy": 0.19031668603420257,
"num_tokens": 51385210.0,
"step": 29620
},
{
"entropy": 5.4167670726776125,
"epoch": 2.304921221552227,
"grad_norm": 1.234375,
"learning_rate": 0.0004463358998103478,
"loss": 5.031,
"mean_token_accuracy": 0.18849214315414428,
"num_tokens": 51393492.0,
"step": 29625
},
{
"entropy": 5.329414129257202,
"epoch": 2.3053102509239447,
"grad_norm": 1.1484375,
"learning_rate": 0.0004463179340075894,
"loss": 4.8805,
"mean_token_accuracy": 0.2047551766037941,
"num_tokens": 51401953.0,
"step": 29630
},
{
"entropy": 5.3827299118042,
"epoch": 2.3056992802956624,
"grad_norm": 1.109375,
"learning_rate": 0.0004462999656053541,
"loss": 5.0844,
"mean_token_accuracy": 0.19132220298051833,
"num_tokens": 51410874.0,
"step": 29635
},
{
"entropy": 5.401923179626465,
"epoch": 2.3060883096673797,
"grad_norm": 1.171875,
"learning_rate": 0.00044628199460391445,
"loss": 4.9496,
"mean_token_accuracy": 0.2004828780889511,
"num_tokens": 51419189.0,
"step": 29640
},
{
"entropy": 5.435768938064575,
"epoch": 2.3064773390390974,
"grad_norm": 1.09375,
"learning_rate": 0.00044626402100354307,
"loss": 5.0361,
"mean_token_accuracy": 0.1945285201072693,
"num_tokens": 51427970.0,
"step": 29645
},
{
"entropy": 5.446695137023926,
"epoch": 2.306866368410815,
"grad_norm": 1.171875,
"learning_rate": 0.0004462460448045129,
"loss": 5.0341,
"mean_token_accuracy": 0.19012540578842163,
"num_tokens": 51436069.0,
"step": 29650
},
{
"entropy": 5.402632761001587,
"epoch": 2.3072553977825327,
"grad_norm": 1.171875,
"learning_rate": 0.00044622806600709645,
"loss": 5.0482,
"mean_token_accuracy": 0.19313860535621644,
"num_tokens": 51444424.0,
"step": 29655
},
{
"entropy": 5.399807453155518,
"epoch": 2.30764442715425,
"grad_norm": 1.2890625,
"learning_rate": 0.0004462100846115667,
"loss": 5.0239,
"mean_token_accuracy": 0.19515331983566284,
"num_tokens": 51453095.0,
"step": 29660
},
{
"entropy": 5.4320969581604,
"epoch": 2.3080334565259677,
"grad_norm": 1.140625,
"learning_rate": 0.0004461921006181964,
"loss": 4.9814,
"mean_token_accuracy": 0.1966902196407318,
"num_tokens": 51461525.0,
"step": 29665
},
{
"entropy": 5.393899583816529,
"epoch": 2.3084224858976854,
"grad_norm": 1.25,
"learning_rate": 0.0004461741140272584,
"loss": 4.9728,
"mean_token_accuracy": 0.19807831346988677,
"num_tokens": 51469918.0,
"step": 29670
},
{
"entropy": 5.39286060333252,
"epoch": 2.3088115152694026,
"grad_norm": 1.203125,
"learning_rate": 0.0004461561248390257,
"loss": 5.0788,
"mean_token_accuracy": 0.19683972597122193,
"num_tokens": 51478747.0,
"step": 29675
},
{
"entropy": 5.3901220798492435,
"epoch": 2.3092005446411203,
"grad_norm": 1.15625,
"learning_rate": 0.0004461381330537713,
"loss": 5.041,
"mean_token_accuracy": 0.18595386445522308,
"num_tokens": 51487730.0,
"step": 29680
},
{
"entropy": 5.437414026260376,
"epoch": 2.309589574012838,
"grad_norm": 1.203125,
"learning_rate": 0.000446120138671768,
"loss": 5.0058,
"mean_token_accuracy": 0.19734702557325362,
"num_tokens": 51495672.0,
"step": 29685
},
{
"entropy": 5.452589225769043,
"epoch": 2.3099786033845557,
"grad_norm": 1.3125,
"learning_rate": 0.00044610214169328913,
"loss": 4.9938,
"mean_token_accuracy": 0.19299622476100922,
"num_tokens": 51503377.0,
"step": 29690
},
{
"entropy": 5.314637470245361,
"epoch": 2.310367632756273,
"grad_norm": 1.125,
"learning_rate": 0.0004460841421186075,
"loss": 4.9581,
"mean_token_accuracy": 0.20031320303678513,
"num_tokens": 51511932.0,
"step": 29695
},
{
"entropy": 5.436145353317261,
"epoch": 2.3107566621279907,
"grad_norm": 1.1640625,
"learning_rate": 0.0004460661399479963,
"loss": 5.0428,
"mean_token_accuracy": 0.18969437181949617,
"num_tokens": 51520565.0,
"step": 29700
},
{
"entropy": 5.381060409545898,
"epoch": 2.3111456914997084,
"grad_norm": 1.1484375,
"learning_rate": 0.00044604813518172876,
"loss": 4.9336,
"mean_token_accuracy": 0.19723676294088363,
"num_tokens": 51529778.0,
"step": 29705
},
{
"entropy": 5.4216564178466795,
"epoch": 2.3115347208714256,
"grad_norm": 1.140625,
"learning_rate": 0.00044603012782007796,
"loss": 5.0664,
"mean_token_accuracy": 0.19430797547101974,
"num_tokens": 51539394.0,
"step": 29710
},
{
"entropy": 5.389931869506836,
"epoch": 2.3119237502431433,
"grad_norm": 1.2109375,
"learning_rate": 0.0004460121178633172,
"loss": 4.9781,
"mean_token_accuracy": 0.19556443989276887,
"num_tokens": 51548314.0,
"step": 29715
},
{
"entropy": 5.314131259918213,
"epoch": 2.312312779614861,
"grad_norm": 1.234375,
"learning_rate": 0.00044599410531171986,
"loss": 4.9069,
"mean_token_accuracy": 0.20719375908374787,
"num_tokens": 51556828.0,
"step": 29720
},
{
"entropy": 5.385971450805664,
"epoch": 2.3127018089865787,
"grad_norm": 1.140625,
"learning_rate": 0.000445976090165559,
"loss": 5.0453,
"mean_token_accuracy": 0.1930396780371666,
"num_tokens": 51565031.0,
"step": 29725
},
{
"entropy": 5.494488286972046,
"epoch": 2.313090838358296,
"grad_norm": 1.171875,
"learning_rate": 0.0004459580724251082,
"loss": 5.1455,
"mean_token_accuracy": 0.18493392765522004,
"num_tokens": 51574218.0,
"step": 29730
},
{
"entropy": 5.373050832748413,
"epoch": 2.3134798677300137,
"grad_norm": 1.234375,
"learning_rate": 0.00044594005209064064,
"loss": 5.0041,
"mean_token_accuracy": 0.19608528763055802,
"num_tokens": 51583229.0,
"step": 29735
},
{
"entropy": 5.369667482376099,
"epoch": 2.313868897101731,
"grad_norm": 1.1640625,
"learning_rate": 0.00044592202916243003,
"loss": 4.9738,
"mean_token_accuracy": 0.19279537945985795,
"num_tokens": 51591969.0,
"step": 29740
},
{
"entropy": 5.44868311882019,
"epoch": 2.3142579264734486,
"grad_norm": 1.1875,
"learning_rate": 0.0004459040036407495,
"loss": 5.0166,
"mean_token_accuracy": 0.19021652787923812,
"num_tokens": 51600840.0,
"step": 29745
},
{
"entropy": 5.318496131896973,
"epoch": 2.3146469558451663,
"grad_norm": 1.265625,
"learning_rate": 0.0004458859755258729,
"loss": 4.8465,
"mean_token_accuracy": 0.20776220858097078,
"num_tokens": 51608750.0,
"step": 29750
},
{
"entropy": 5.3829797267913815,
"epoch": 2.315035985216884,
"grad_norm": 1.234375,
"learning_rate": 0.00044586794481807357,
"loss": 5.0503,
"mean_token_accuracy": 0.19519027024507524,
"num_tokens": 51617079.0,
"step": 29755
},
{
"entropy": 5.36235408782959,
"epoch": 2.3154250145886013,
"grad_norm": 1.125,
"learning_rate": 0.00044584991151762506,
"loss": 5.0122,
"mean_token_accuracy": 0.19658900797367096,
"num_tokens": 51625310.0,
"step": 29760
},
{
"entropy": 5.4265709400177,
"epoch": 2.315814043960319,
"grad_norm": 1.1875,
"learning_rate": 0.0004458318756248011,
"loss": 5.008,
"mean_token_accuracy": 0.190154267847538,
"num_tokens": 51634071.0,
"step": 29765
},
{
"entropy": 5.402804327011109,
"epoch": 2.3162030733320367,
"grad_norm": 1.1484375,
"learning_rate": 0.00044581383713987547,
"loss": 4.9778,
"mean_token_accuracy": 0.1948614701628685,
"num_tokens": 51642761.0,
"step": 29770
},
{
"entropy": 5.388738918304443,
"epoch": 2.316592102703754,
"grad_norm": 1.1171875,
"learning_rate": 0.0004457957960631216,
"loss": 4.9862,
"mean_token_accuracy": 0.1998862400650978,
"num_tokens": 51652160.0,
"step": 29775
},
{
"entropy": 5.3109557151794435,
"epoch": 2.3169811320754716,
"grad_norm": 1.1015625,
"learning_rate": 0.0004457777523948134,
"loss": 4.951,
"mean_token_accuracy": 0.1967950403690338,
"num_tokens": 51661345.0,
"step": 29780
},
{
"entropy": 5.3921033382415775,
"epoch": 2.3173701614471893,
"grad_norm": 1.1328125,
"learning_rate": 0.0004457597061352247,
"loss": 5.0005,
"mean_token_accuracy": 0.2004665181040764,
"num_tokens": 51669855.0,
"step": 29785
},
{
"entropy": 5.454489612579346,
"epoch": 2.317759190818907,
"grad_norm": 1.1328125,
"learning_rate": 0.0004457416572846291,
"loss": 5.1162,
"mean_token_accuracy": 0.1926496684551239,
"num_tokens": 51679272.0,
"step": 29790
},
{
"entropy": 5.418266248703003,
"epoch": 2.3181482201906243,
"grad_norm": 1.171875,
"learning_rate": 0.0004457236058433008,
"loss": 5.019,
"mean_token_accuracy": 0.18848942071199418,
"num_tokens": 51688383.0,
"step": 29795
},
{
"entropy": 5.443320417404175,
"epoch": 2.318537249562342,
"grad_norm": 1.171875,
"learning_rate": 0.00044570555181151333,
"loss": 5.0502,
"mean_token_accuracy": 0.19525537341833116,
"num_tokens": 51696996.0,
"step": 29800
},
{
"entropy": 5.333801174163819,
"epoch": 2.3189262789340597,
"grad_norm": 1.1953125,
"learning_rate": 0.000445687495189541,
"loss": 5.069,
"mean_token_accuracy": 0.19109150767326355,
"num_tokens": 51705830.0,
"step": 29805
},
{
"entropy": 5.420248556137085,
"epoch": 2.319315308305777,
"grad_norm": 1.171875,
"learning_rate": 0.00044566943597765745,
"loss": 4.9968,
"mean_token_accuracy": 0.19402042627334595,
"num_tokens": 51715357.0,
"step": 29810
},
{
"entropy": 5.4275881290435795,
"epoch": 2.3197043376774946,
"grad_norm": 1.0625,
"learning_rate": 0.00044565137417613694,
"loss": 5.0616,
"mean_token_accuracy": 0.1973115846514702,
"num_tokens": 51725342.0,
"step": 29815
},
{
"entropy": 5.451069641113281,
"epoch": 2.3200933670492123,
"grad_norm": 1.2109375,
"learning_rate": 0.0004456333097852534,
"loss": 5.0129,
"mean_token_accuracy": 0.19398652464151384,
"num_tokens": 51733788.0,
"step": 29820
},
{
"entropy": 5.419092988967895,
"epoch": 2.32048239642093,
"grad_norm": 1.171875,
"learning_rate": 0.00044561524280528104,
"loss": 5.0575,
"mean_token_accuracy": 0.19708173274993895,
"num_tokens": 51742713.0,
"step": 29825
},
{
"entropy": 5.482743978500366,
"epoch": 2.3208714257926473,
"grad_norm": 1.203125,
"learning_rate": 0.00044559717323649383,
"loss": 5.1347,
"mean_token_accuracy": 0.1921016290783882,
"num_tokens": 51751482.0,
"step": 29830
},
{
"entropy": 5.351164388656616,
"epoch": 2.321260455164365,
"grad_norm": 1.1953125,
"learning_rate": 0.0004455791010791662,
"loss": 4.8876,
"mean_token_accuracy": 0.20511779338121414,
"num_tokens": 51760217.0,
"step": 29835
},
{
"entropy": 5.38601541519165,
"epoch": 2.3216494845360827,
"grad_norm": 1.2109375,
"learning_rate": 0.0004455610263335721,
"loss": 5.0382,
"mean_token_accuracy": 0.1862327814102173,
"num_tokens": 51767945.0,
"step": 29840
},
{
"entropy": 5.381389522552491,
"epoch": 2.3220385139078,
"grad_norm": 1.140625,
"learning_rate": 0.0004455429489999859,
"loss": 5.0705,
"mean_token_accuracy": 0.18623176962137222,
"num_tokens": 51777318.0,
"step": 29845
},
{
"entropy": 5.407787799835205,
"epoch": 2.3224275432795176,
"grad_norm": 1.2109375,
"learning_rate": 0.00044552486907868194,
"loss": 5.0123,
"mean_token_accuracy": 0.19180071502923965,
"num_tokens": 51786571.0,
"step": 29850
},
{
"entropy": 5.522048664093018,
"epoch": 2.3228165726512353,
"grad_norm": 1.203125,
"learning_rate": 0.00044550678656993454,
"loss": 5.0913,
"mean_token_accuracy": 0.19304397255182265,
"num_tokens": 51794872.0,
"step": 29855
},
{
"entropy": 5.454934978485108,
"epoch": 2.3232056020229526,
"grad_norm": 1.2734375,
"learning_rate": 0.000445488701474018,
"loss": 5.0534,
"mean_token_accuracy": 0.18867406398057937,
"num_tokens": 51803111.0,
"step": 29860
},
{
"entropy": 5.33352952003479,
"epoch": 2.3235946313946703,
"grad_norm": 1.2421875,
"learning_rate": 0.0004454706137912067,
"loss": 4.9355,
"mean_token_accuracy": 0.20143842250108718,
"num_tokens": 51811574.0,
"step": 29865
},
{
"entropy": 5.3391612529754635,
"epoch": 2.323983660766388,
"grad_norm": 1.15625,
"learning_rate": 0.0004454525235217753,
"loss": 4.9191,
"mean_token_accuracy": 0.19525717049837113,
"num_tokens": 51820120.0,
"step": 29870
},
{
"entropy": 5.425647926330567,
"epoch": 2.324372690138105,
"grad_norm": 1.1484375,
"learning_rate": 0.00044543443066599807,
"loss": 5.1128,
"mean_token_accuracy": 0.1909673109650612,
"num_tokens": 51828293.0,
"step": 29875
},
{
"entropy": 5.418616390228271,
"epoch": 2.324761719509823,
"grad_norm": 1.1953125,
"learning_rate": 0.0004454163352241498,
"loss": 4.9703,
"mean_token_accuracy": 0.18912673890590667,
"num_tokens": 51836595.0,
"step": 29880
},
{
"entropy": 5.4308970928192135,
"epoch": 2.3251507488815406,
"grad_norm": 1.1953125,
"learning_rate": 0.00044539823719650463,
"loss": 5.0756,
"mean_token_accuracy": 0.1870182514190674,
"num_tokens": 51845415.0,
"step": 29885
},
{
"entropy": 5.421315097808838,
"epoch": 2.3255397782532583,
"grad_norm": 1.140625,
"learning_rate": 0.0004453801365833376,
"loss": 5.0182,
"mean_token_accuracy": 0.19176635444164275,
"num_tokens": 51854091.0,
"step": 29890
},
{
"entropy": 5.3781249046325685,
"epoch": 2.3259288076249756,
"grad_norm": 1.1484375,
"learning_rate": 0.00044536203338492317,
"loss": 5.0048,
"mean_token_accuracy": 0.2007279470562935,
"num_tokens": 51862767.0,
"step": 29895
},
{
"entropy": 5.3524072647094725,
"epoch": 2.3263178369966933,
"grad_norm": 1.1484375,
"learning_rate": 0.00044534392760153596,
"loss": 4.901,
"mean_token_accuracy": 0.20232968479394914,
"num_tokens": 51871593.0,
"step": 29900
},
{
"entropy": 5.409956789016723,
"epoch": 2.326706866368411,
"grad_norm": 1.2265625,
"learning_rate": 0.0004453258192334508,
"loss": 5.0316,
"mean_token_accuracy": 0.19366694688796998,
"num_tokens": 51880775.0,
"step": 29905
},
{
"entropy": 5.3567369937896725,
"epoch": 2.327095895740128,
"grad_norm": 1.171875,
"learning_rate": 0.0004453077082809425,
"loss": 5.0176,
"mean_token_accuracy": 0.19089481085538865,
"num_tokens": 51889663.0,
"step": 29910
},
{
"entropy": 5.421521329879761,
"epoch": 2.327484925111846,
"grad_norm": 1.25,
"learning_rate": 0.00044528959474428575,
"loss": 5.053,
"mean_token_accuracy": 0.19303103983402253,
"num_tokens": 51898565.0,
"step": 29915
},
{
"entropy": 5.40078067779541,
"epoch": 2.3278739544835636,
"grad_norm": 1.109375,
"learning_rate": 0.0004452714786237555,
"loss": 5.0121,
"mean_token_accuracy": 0.19658200740814208,
"num_tokens": 51906828.0,
"step": 29920
},
{
"entropy": 5.346303129196167,
"epoch": 2.3282629838552813,
"grad_norm": 1.2265625,
"learning_rate": 0.0004452533599196265,
"loss": 4.9537,
"mean_token_accuracy": 0.19605199992656708,
"num_tokens": 51914305.0,
"step": 29925
},
{
"entropy": 5.405530881881714,
"epoch": 2.3286520132269986,
"grad_norm": 1.1015625,
"learning_rate": 0.00044523523863217374,
"loss": 5.0531,
"mean_token_accuracy": 0.19550808519124985,
"num_tokens": 51923544.0,
"step": 29930
},
{
"entropy": 5.408782863616944,
"epoch": 2.3290410425987162,
"grad_norm": 1.125,
"learning_rate": 0.0004452171147616723,
"loss": 4.9925,
"mean_token_accuracy": 0.19663666188716888,
"num_tokens": 51932198.0,
"step": 29935
},
{
"entropy": 5.299583053588867,
"epoch": 2.329430071970434,
"grad_norm": 1.171875,
"learning_rate": 0.000445198988308397,
"loss": 4.942,
"mean_token_accuracy": 0.20136999487876892,
"num_tokens": 51940291.0,
"step": 29940
},
{
"entropy": 5.299046993255615,
"epoch": 2.329819101342151,
"grad_norm": 1.1640625,
"learning_rate": 0.00044518085927262293,
"loss": 4.8959,
"mean_token_accuracy": 0.2035728305578232,
"num_tokens": 51948899.0,
"step": 29945
},
{
"entropy": 5.3596902847290036,
"epoch": 2.330208130713869,
"grad_norm": 1.15625,
"learning_rate": 0.0004451627276546252,
"loss": 4.9552,
"mean_token_accuracy": 0.19617270976305007,
"num_tokens": 51957726.0,
"step": 29950
},
{
"entropy": 5.417377519607544,
"epoch": 2.3305971600855866,
"grad_norm": 1.203125,
"learning_rate": 0.000445144593454679,
"loss": 4.9863,
"mean_token_accuracy": 0.2010478749871254,
"num_tokens": 51965922.0,
"step": 29955
},
{
"entropy": 5.385968971252441,
"epoch": 2.330986189457304,
"grad_norm": 1.21875,
"learning_rate": 0.0004451264566730593,
"loss": 4.9415,
"mean_token_accuracy": 0.1963234305381775,
"num_tokens": 51974096.0,
"step": 29960
},
{
"entropy": 5.3744340419769285,
"epoch": 2.3313752188290215,
"grad_norm": 1.203125,
"learning_rate": 0.00044510831731004146,
"loss": 5.0126,
"mean_token_accuracy": 0.18748579621315004,
"num_tokens": 51982954.0,
"step": 29965
},
{
"entropy": 5.354373979568481,
"epoch": 2.3317642482007392,
"grad_norm": 1.15625,
"learning_rate": 0.0004450901753659007,
"loss": 4.9843,
"mean_token_accuracy": 0.200490240752697,
"num_tokens": 51991738.0,
"step": 29970
},
{
"entropy": 5.388850498199463,
"epoch": 2.3321532775724565,
"grad_norm": 1.1484375,
"learning_rate": 0.00044507203084091215,
"loss": 4.9768,
"mean_token_accuracy": 0.19275224208831787,
"num_tokens": 52000227.0,
"step": 29975
},
{
"entropy": 5.456930446624756,
"epoch": 2.332542306944174,
"grad_norm": 1.1484375,
"learning_rate": 0.0004450538837353513,
"loss": 5.1237,
"mean_token_accuracy": 0.18070202320814133,
"num_tokens": 52009336.0,
"step": 29980
},
{
"entropy": 5.372079181671142,
"epoch": 2.332931336315892,
"grad_norm": 1.1875,
"learning_rate": 0.00044503573404949343,
"loss": 5.0403,
"mean_token_accuracy": 0.19498705267906188,
"num_tokens": 52017850.0,
"step": 29985
},
{
"entropy": 5.424704456329346,
"epoch": 2.3333203656876096,
"grad_norm": 1.1875,
"learning_rate": 0.0004450175817836139,
"loss": 5.0404,
"mean_token_accuracy": 0.19173584431409835,
"num_tokens": 52027672.0,
"step": 29990
},
{
"entropy": 5.425837564468384,
"epoch": 2.333709395059327,
"grad_norm": 1.1484375,
"learning_rate": 0.00044499942693798823,
"loss": 5.039,
"mean_token_accuracy": 0.18783184438943862,
"num_tokens": 52036134.0,
"step": 29995
},
{
"entropy": 5.361058187484741,
"epoch": 2.3340984244310445,
"grad_norm": 1.2265625,
"learning_rate": 0.0004449812695128918,
"loss": 5.0259,
"mean_token_accuracy": 0.19410353004932404,
"num_tokens": 52044719.0,
"step": 30000
},
{
"epoch": 2.3340984244310445,
"eval_entropy": 5.223434420246936,
"eval_loss": 5.145181655883789,
"eval_mean_token_accuracy": 0.19766220122833913,
"eval_num_tokens": 52044719.0,
"eval_runtime": 28.4379,
"eval_samples_per_second": 1461.359,
"eval_steps_per_second": 182.679,
"step": 30000
},
{
"entropy": 5.418763303756714,
"epoch": 2.3344874538027622,
"grad_norm": 1.1171875,
"learning_rate": 0.00044496310950860015,
"loss": 5.0636,
"mean_token_accuracy": 0.18894778341054916,
"num_tokens": 52053238.0,
"step": 30005
},
{
"entropy": 5.481644821166992,
"epoch": 2.3348764831744795,
"grad_norm": 1.125,
"learning_rate": 0.00044494494692538886,
"loss": 5.1047,
"mean_token_accuracy": 0.1908062294125557,
"num_tokens": 52062258.0,
"step": 30010
},
{
"entropy": 5.459772682189941,
"epoch": 2.335265512546197,
"grad_norm": 1.1953125,
"learning_rate": 0.00044492678176353347,
"loss": 5.0621,
"mean_token_accuracy": 0.1861102133989334,
"num_tokens": 52070527.0,
"step": 30015
},
{
"entropy": 5.4163800239562985,
"epoch": 2.335654541917915,
"grad_norm": 1.109375,
"learning_rate": 0.00044490861402330967,
"loss": 5.1004,
"mean_token_accuracy": 0.19243659675121308,
"num_tokens": 52079827.0,
"step": 30020
},
{
"entropy": 5.408106184005737,
"epoch": 2.3360435712896326,
"grad_norm": 1.140625,
"learning_rate": 0.0004448904437049931,
"loss": 5.0286,
"mean_token_accuracy": 0.19900045692920684,
"num_tokens": 52088963.0,
"step": 30025
},
{
"entropy": 5.405945062637329,
"epoch": 2.33643260066135,
"grad_norm": 1.171875,
"learning_rate": 0.0004448722708088594,
"loss": 4.9875,
"mean_token_accuracy": 0.19641234427690507,
"num_tokens": 52096885.0,
"step": 30030
},
{
"entropy": 5.454981136322021,
"epoch": 2.3368216300330675,
"grad_norm": 1.1484375,
"learning_rate": 0.0004448540953351844,
"loss": 5.0097,
"mean_token_accuracy": 0.1949462205171585,
"num_tokens": 52105530.0,
"step": 30035
},
{
"entropy": 5.305704069137573,
"epoch": 2.3372106594047852,
"grad_norm": 1.078125,
"learning_rate": 0.0004448359172842439,
"loss": 4.9372,
"mean_token_accuracy": 0.20406438410282135,
"num_tokens": 52114233.0,
"step": 30040
},
{
"entropy": 5.417793560028076,
"epoch": 2.3375996887765025,
"grad_norm": 1.1953125,
"learning_rate": 0.00044481773665631355,
"loss": 5.0381,
"mean_token_accuracy": 0.19169072210788726,
"num_tokens": 52123561.0,
"step": 30045
},
{
"entropy": 5.364863681793213,
"epoch": 2.33798871814822,
"grad_norm": 1.2421875,
"learning_rate": 0.0004447995534516695,
"loss": 4.9345,
"mean_token_accuracy": 0.2017069175839424,
"num_tokens": 52132329.0,
"step": 30050
},
{
"entropy": 5.381529998779297,
"epoch": 2.338377747519938,
"grad_norm": 1.1796875,
"learning_rate": 0.00044478136767058733,
"loss": 5.0111,
"mean_token_accuracy": 0.19679865688085557,
"num_tokens": 52141019.0,
"step": 30055
},
{
"entropy": 5.377155923843384,
"epoch": 2.338766776891655,
"grad_norm": 1.203125,
"learning_rate": 0.0004447631793133432,
"loss": 5.075,
"mean_token_accuracy": 0.19437997937202453,
"num_tokens": 52149865.0,
"step": 30060
},
{
"entropy": 5.446461963653564,
"epoch": 2.339155806263373,
"grad_norm": 1.15625,
"learning_rate": 0.0004447449883802131,
"loss": 5.0489,
"mean_token_accuracy": 0.1927816554903984,
"num_tokens": 52158991.0,
"step": 30065
},
{
"entropy": 5.309474754333496,
"epoch": 2.3395448356350905,
"grad_norm": 1.15625,
"learning_rate": 0.00044472679487147295,
"loss": 4.9343,
"mean_token_accuracy": 0.20084628313779831,
"num_tokens": 52167141.0,
"step": 30070
},
{
"entropy": 5.3660133361816404,
"epoch": 2.339933865006808,
"grad_norm": 1.2890625,
"learning_rate": 0.00044470859878739877,
"loss": 4.9692,
"mean_token_accuracy": 0.19755050539970398,
"num_tokens": 52175483.0,
"step": 30075
},
{
"entropy": 5.461671781539917,
"epoch": 2.3403228943785255,
"grad_norm": 1.1875,
"learning_rate": 0.00044469040012826676,
"loss": 4.9636,
"mean_token_accuracy": 0.19719404131174087,
"num_tokens": 52184290.0,
"step": 30080
},
{
"entropy": 5.393988513946534,
"epoch": 2.340711923750243,
"grad_norm": 1.1484375,
"learning_rate": 0.00044467219889435304,
"loss": 4.9402,
"mean_token_accuracy": 0.19660028368234633,
"num_tokens": 52193747.0,
"step": 30085
},
{
"entropy": 5.324088048934937,
"epoch": 2.341100953121961,
"grad_norm": 1.2421875,
"learning_rate": 0.0004446539950859337,
"loss": 5.0441,
"mean_token_accuracy": 0.193026565015316,
"num_tokens": 52202744.0,
"step": 30090
},
{
"entropy": 5.376123237609863,
"epoch": 2.341489982493678,
"grad_norm": 1.265625,
"learning_rate": 0.00044463578870328506,
"loss": 4.9934,
"mean_token_accuracy": 0.19938113391399384,
"num_tokens": 52211257.0,
"step": 30095
},
{
"entropy": 5.451220941543579,
"epoch": 2.341879011865396,
"grad_norm": 1.2734375,
"learning_rate": 0.0004446175797466834,
"loss": 5.0201,
"mean_token_accuracy": 0.19250795394182205,
"num_tokens": 52219797.0,
"step": 30100
},
{
"entropy": 5.477438974380493,
"epoch": 2.3422680412371135,
"grad_norm": 1.1328125,
"learning_rate": 0.00044459936821640485,
"loss": 5.1172,
"mean_token_accuracy": 0.18738680332899094,
"num_tokens": 52228157.0,
"step": 30105
},
{
"entropy": 5.402554368972778,
"epoch": 2.3426570706088308,
"grad_norm": 1.3046875,
"learning_rate": 0.0004445811541127258,
"loss": 5.0539,
"mean_token_accuracy": 0.19839270114898683,
"num_tokens": 52237136.0,
"step": 30110
},
{
"entropy": 5.407093620300293,
"epoch": 2.3430460999805485,
"grad_norm": 1.171875,
"learning_rate": 0.00044456293743592274,
"loss": 5.035,
"mean_token_accuracy": 0.19214742183685302,
"num_tokens": 52245966.0,
"step": 30115
},
{
"entropy": 5.41645073890686,
"epoch": 2.343435129352266,
"grad_norm": 1.15625,
"learning_rate": 0.00044454471818627196,
"loss": 5.0305,
"mean_token_accuracy": 0.18672140836715698,
"num_tokens": 52254782.0,
"step": 30120
},
{
"entropy": 5.469600343704224,
"epoch": 2.343824158723984,
"grad_norm": 1.203125,
"learning_rate": 0.00044452649636404995,
"loss": 5.0948,
"mean_token_accuracy": 0.18767904490232468,
"num_tokens": 52264132.0,
"step": 30125
},
{
"entropy": 5.3829512119293215,
"epoch": 2.344213188095701,
"grad_norm": 1.1328125,
"learning_rate": 0.0004445082719695332,
"loss": 4.9228,
"mean_token_accuracy": 0.2010898321866989,
"num_tokens": 52272763.0,
"step": 30130
},
{
"entropy": 5.460457897186279,
"epoch": 2.344602217467419,
"grad_norm": 1.15625,
"learning_rate": 0.00044449004500299815,
"loss": 5.0924,
"mean_token_accuracy": 0.18683323115110398,
"num_tokens": 52281505.0,
"step": 30135
},
{
"entropy": 5.365544605255127,
"epoch": 2.3449912468391365,
"grad_norm": 1.0859375,
"learning_rate": 0.00044447181546472146,
"loss": 4.9057,
"mean_token_accuracy": 0.20397514402866362,
"num_tokens": 52289559.0,
"step": 30140
},
{
"entropy": 5.3468909740448,
"epoch": 2.3453802762108538,
"grad_norm": 1.1171875,
"learning_rate": 0.00044445358335497975,
"loss": 5.0061,
"mean_token_accuracy": 0.19992850869894027,
"num_tokens": 52298318.0,
"step": 30145
},
{
"entropy": 5.330973529815674,
"epoch": 2.3457693055825715,
"grad_norm": 1.2734375,
"learning_rate": 0.0004444353486740496,
"loss": 4.9804,
"mean_token_accuracy": 0.1970817968249321,
"num_tokens": 52307908.0,
"step": 30150
},
{
"entropy": 5.433225917816162,
"epoch": 2.346158334954289,
"grad_norm": 1.140625,
"learning_rate": 0.0004444171114222078,
"loss": 5.0111,
"mean_token_accuracy": 0.20118941813707353,
"num_tokens": 52315879.0,
"step": 30155
},
{
"entropy": 5.357790851593018,
"epoch": 2.346547364326007,
"grad_norm": 1.1953125,
"learning_rate": 0.00044439887159973096,
"loss": 5.0233,
"mean_token_accuracy": 0.1917622447013855,
"num_tokens": 52324747.0,
"step": 30160
},
{
"entropy": 5.4173808097839355,
"epoch": 2.346936393697724,
"grad_norm": 1.1640625,
"learning_rate": 0.0004443806292068958,
"loss": 5.0143,
"mean_token_accuracy": 0.19427144527435303,
"num_tokens": 52333655.0,
"step": 30165
},
{
"entropy": 5.332532691955566,
"epoch": 2.347325423069442,
"grad_norm": 1.2265625,
"learning_rate": 0.0004443623842439792,
"loss": 5.021,
"mean_token_accuracy": 0.19633896350860597,
"num_tokens": 52342111.0,
"step": 30170
},
{
"entropy": 5.399201250076294,
"epoch": 2.347714452441159,
"grad_norm": 1.1796875,
"learning_rate": 0.000444344136711258,
"loss": 4.9931,
"mean_token_accuracy": 0.20263464450836183,
"num_tokens": 52351390.0,
"step": 30175
},
{
"entropy": 5.437429189682007,
"epoch": 2.3481034818128768,
"grad_norm": 1.3046875,
"learning_rate": 0.00044432588660900905,
"loss": 5.0557,
"mean_token_accuracy": 0.19430024027824402,
"num_tokens": 52361602.0,
"step": 30180
},
{
"entropy": 5.42653489112854,
"epoch": 2.3484925111845945,
"grad_norm": 1.1875,
"learning_rate": 0.0004443076339375093,
"loss": 5.0413,
"mean_token_accuracy": 0.19979116320610046,
"num_tokens": 52370304.0,
"step": 30185
},
{
"entropy": 5.362420225143433,
"epoch": 2.348881540556312,
"grad_norm": 1.21875,
"learning_rate": 0.00044428937869703575,
"loss": 4.8704,
"mean_token_accuracy": 0.2043123260140419,
"num_tokens": 52378437.0,
"step": 30190
},
{
"entropy": 5.382938432693481,
"epoch": 2.3492705699280294,
"grad_norm": 1.15625,
"learning_rate": 0.00044427112088786525,
"loss": 4.9961,
"mean_token_accuracy": 0.20046598166227342,
"num_tokens": 52388413.0,
"step": 30195
},
{
"entropy": 5.317371845245361,
"epoch": 2.349659599299747,
"grad_norm": 1.203125,
"learning_rate": 0.0004442528605102749,
"loss": 4.9562,
"mean_token_accuracy": 0.19907163977622985,
"num_tokens": 52396296.0,
"step": 30200
},
{
"entropy": 5.369873809814453,
"epoch": 2.350048628671465,
"grad_norm": 1.15625,
"learning_rate": 0.0004442345975645418,
"loss": 4.949,
"mean_token_accuracy": 0.20131107419729233,
"num_tokens": 52403967.0,
"step": 30205
},
{
"entropy": 5.343939685821534,
"epoch": 2.350437658043182,
"grad_norm": 1.2265625,
"learning_rate": 0.0004442163320509431,
"loss": 5.0186,
"mean_token_accuracy": 0.2009178638458252,
"num_tokens": 52413107.0,
"step": 30210
},
{
"entropy": 5.417715120315552,
"epoch": 2.3508266874148998,
"grad_norm": 1.140625,
"learning_rate": 0.0004441980639697558,
"loss": 4.9635,
"mean_token_accuracy": 0.20185658037662507,
"num_tokens": 52421029.0,
"step": 30215
},
{
"entropy": 5.419812536239624,
"epoch": 2.3512157167866174,
"grad_norm": 1.078125,
"learning_rate": 0.0004441797933212573,
"loss": 5.0525,
"mean_token_accuracy": 0.1926191881299019,
"num_tokens": 52430538.0,
"step": 30220
},
{
"entropy": 5.46271162033081,
"epoch": 2.351604746158335,
"grad_norm": 1.0703125,
"learning_rate": 0.0004441615201057247,
"loss": 5.0719,
"mean_token_accuracy": 0.18606946766376495,
"num_tokens": 52440013.0,
"step": 30225
},
{
"entropy": 5.463526391983033,
"epoch": 2.3519937755300524,
"grad_norm": 1.28125,
"learning_rate": 0.0004441432443234352,
"loss": 5.177,
"mean_token_accuracy": 0.18553993552923204,
"num_tokens": 52449034.0,
"step": 30230
},
{
"entropy": 5.446694469451904,
"epoch": 2.35238280490177,
"grad_norm": 1.296875,
"learning_rate": 0.00044412496597466626,
"loss": 5.0922,
"mean_token_accuracy": 0.1896051675081253,
"num_tokens": 52457649.0,
"step": 30235
},
{
"entropy": 5.372512006759644,
"epoch": 2.352771834273488,
"grad_norm": 1.1640625,
"learning_rate": 0.0004441066850596951,
"loss": 4.9345,
"mean_token_accuracy": 0.1983540713787079,
"num_tokens": 52465861.0,
"step": 30240
},
{
"entropy": 5.454167222976684,
"epoch": 2.353160863645205,
"grad_norm": 1.09375,
"learning_rate": 0.0004440884015787992,
"loss": 5.08,
"mean_token_accuracy": 0.1928747296333313,
"num_tokens": 52474630.0,
"step": 30245
},
{
"entropy": 5.406492519378662,
"epoch": 2.3535498930169227,
"grad_norm": 1.1796875,
"learning_rate": 0.0004440701155322558,
"loss": 5.1189,
"mean_token_accuracy": 0.18899615854024887,
"num_tokens": 52482759.0,
"step": 30250
},
{
"entropy": 5.425615930557251,
"epoch": 2.3539389223886404,
"grad_norm": 1.2265625,
"learning_rate": 0.0004440518269203427,
"loss": 5.1409,
"mean_token_accuracy": 0.17812509685754777,
"num_tokens": 52491839.0,
"step": 30255
},
{
"entropy": 5.3976709842681885,
"epoch": 2.354327951760358,
"grad_norm": 1.1875,
"learning_rate": 0.00044403353574333715,
"loss": 4.941,
"mean_token_accuracy": 0.1986740544438362,
"num_tokens": 52500688.0,
"step": 30260
},
{
"entropy": 5.372706317901612,
"epoch": 2.3547169811320754,
"grad_norm": 1.125,
"learning_rate": 0.00044401524200151667,
"loss": 5.0465,
"mean_token_accuracy": 0.19133081138134003,
"num_tokens": 52509031.0,
"step": 30265
},
{
"entropy": 5.403821086883545,
"epoch": 2.355106010503793,
"grad_norm": 1.1796875,
"learning_rate": 0.00044399694569515895,
"loss": 4.9993,
"mean_token_accuracy": 0.19440345764160155,
"num_tokens": 52518337.0,
"step": 30270
},
{
"entropy": 5.419117879867554,
"epoch": 2.355495039875511,
"grad_norm": 1.1015625,
"learning_rate": 0.00044397864682454156,
"loss": 5.002,
"mean_token_accuracy": 0.19769097715616227,
"num_tokens": 52527257.0,
"step": 30275
},
{
"entropy": 5.442627000808716,
"epoch": 2.355884069247228,
"grad_norm": 1.1484375,
"learning_rate": 0.0004439603453899421,
"loss": 5.0831,
"mean_token_accuracy": 0.19051087349653245,
"num_tokens": 52536999.0,
"step": 30280
},
{
"entropy": 5.426263904571533,
"epoch": 2.3562730986189457,
"grad_norm": 1.1171875,
"learning_rate": 0.0004439420413916384,
"loss": 5.0755,
"mean_token_accuracy": 0.18667403161525725,
"num_tokens": 52545975.0,
"step": 30285
},
{
"entropy": 5.433545207977295,
"epoch": 2.3566621279906634,
"grad_norm": 1.21875,
"learning_rate": 0.00044392373482990817,
"loss": 5.0295,
"mean_token_accuracy": 0.19322957545518876,
"num_tokens": 52554667.0,
"step": 30290
},
{
"entropy": 5.377437448501587,
"epoch": 2.3570511573623807,
"grad_norm": 1.109375,
"learning_rate": 0.0004439054257050291,
"loss": 5.0235,
"mean_token_accuracy": 0.19814396798610687,
"num_tokens": 52563469.0,
"step": 30295
},
{
"entropy": 5.318478345870972,
"epoch": 2.3574401867340984,
"grad_norm": 1.109375,
"learning_rate": 0.0004438871140172789,
"loss": 4.941,
"mean_token_accuracy": 0.19989730417728424,
"num_tokens": 52572038.0,
"step": 30300
},
{
"entropy": 5.414776706695557,
"epoch": 2.357829216105816,
"grad_norm": 1.2734375,
"learning_rate": 0.0004438687997669357,
"loss": 5.0312,
"mean_token_accuracy": 0.18493329733610153,
"num_tokens": 52579642.0,
"step": 30305
},
{
"entropy": 5.404068470001221,
"epoch": 2.3582182454775333,
"grad_norm": 1.203125,
"learning_rate": 0.00044385048295427724,
"loss": 4.9548,
"mean_token_accuracy": 0.1987263187766075,
"num_tokens": 52587425.0,
"step": 30310
},
{
"entropy": 5.34434666633606,
"epoch": 2.358607274849251,
"grad_norm": 1.25,
"learning_rate": 0.0004438321635795814,
"loss": 4.9856,
"mean_token_accuracy": 0.19478428959846497,
"num_tokens": 52596560.0,
"step": 30315
},
{
"entropy": 5.449916791915894,
"epoch": 2.3589963042209687,
"grad_norm": 1.1640625,
"learning_rate": 0.0004438138416431262,
"loss": 5.0993,
"mean_token_accuracy": 0.1977837160229683,
"num_tokens": 52604977.0,
"step": 30320
},
{
"entropy": 5.417195272445679,
"epoch": 2.3593853335926864,
"grad_norm": 1.1015625,
"learning_rate": 0.00044379551714518966,
"loss": 5.0394,
"mean_token_accuracy": 0.19160117357969284,
"num_tokens": 52614069.0,
"step": 30325
},
{
"entropy": 5.400463342666626,
"epoch": 2.3597743629644037,
"grad_norm": 1.28125,
"learning_rate": 0.00044377719008604984,
"loss": 5.0383,
"mean_token_accuracy": 0.19558971822261811,
"num_tokens": 52623065.0,
"step": 30330
},
{
"entropy": 5.405236625671387,
"epoch": 2.3601633923361214,
"grad_norm": 1.171875,
"learning_rate": 0.0004437588604659848,
"loss": 5.0701,
"mean_token_accuracy": 0.19237641841173173,
"num_tokens": 52632422.0,
"step": 30335
},
{
"entropy": 5.438364791870117,
"epoch": 2.360552421707839,
"grad_norm": 1.1328125,
"learning_rate": 0.0004437405282852726,
"loss": 5.1185,
"mean_token_accuracy": 0.1851376324892044,
"num_tokens": 52641358.0,
"step": 30340
},
{
"entropy": 5.390559959411621,
"epoch": 2.3609414510795563,
"grad_norm": 1.1953125,
"learning_rate": 0.00044372219354419154,
"loss": 4.9803,
"mean_token_accuracy": 0.1964762791991234,
"num_tokens": 52650011.0,
"step": 30345
},
{
"entropy": 5.443810510635376,
"epoch": 2.361330480451274,
"grad_norm": 1.21875,
"learning_rate": 0.0004437038562430197,
"loss": 5.08,
"mean_token_accuracy": 0.191288498044014,
"num_tokens": 52658111.0,
"step": 30350
},
{
"entropy": 5.400187969207764,
"epoch": 2.3617195098229917,
"grad_norm": 1.2109375,
"learning_rate": 0.00044368551638203536,
"loss": 4.9227,
"mean_token_accuracy": 0.20466605871915816,
"num_tokens": 52666181.0,
"step": 30355
},
{
"entropy": 5.355642318725586,
"epoch": 2.3621085391947094,
"grad_norm": 1.1484375,
"learning_rate": 0.0004436671739615168,
"loss": 5.0433,
"mean_token_accuracy": 0.1919921025633812,
"num_tokens": 52675218.0,
"step": 30360
},
{
"entropy": 5.396150350570679,
"epoch": 2.3624975685664267,
"grad_norm": 1.0625,
"learning_rate": 0.00044364882898174235,
"loss": 5.1009,
"mean_token_accuracy": 0.18912100195884704,
"num_tokens": 52684254.0,
"step": 30365
},
{
"entropy": 5.451118040084839,
"epoch": 2.3628865979381444,
"grad_norm": 1.2109375,
"learning_rate": 0.0004436304814429903,
"loss": 5.0242,
"mean_token_accuracy": 0.19635079652071,
"num_tokens": 52693106.0,
"step": 30370
},
{
"entropy": 5.457514429092408,
"epoch": 2.363275627309862,
"grad_norm": 1.1171875,
"learning_rate": 0.0004436121313455391,
"loss": 5.0513,
"mean_token_accuracy": 0.19093235284090043,
"num_tokens": 52702260.0,
"step": 30375
},
{
"entropy": 5.428046417236328,
"epoch": 2.3636646566815793,
"grad_norm": 1.21875,
"learning_rate": 0.0004435937786896673,
"loss": 5.0177,
"mean_token_accuracy": 0.19687827676534653,
"num_tokens": 52710546.0,
"step": 30380
},
{
"entropy": 5.32040638923645,
"epoch": 2.364053686053297,
"grad_norm": 1.1484375,
"learning_rate": 0.00044357542347565323,
"loss": 5.004,
"mean_token_accuracy": 0.19385386854410172,
"num_tokens": 52719197.0,
"step": 30385
},
{
"entropy": 5.492500591278076,
"epoch": 2.3644427154250147,
"grad_norm": 1.21875,
"learning_rate": 0.0004435570657037753,
"loss": 5.1669,
"mean_token_accuracy": 0.18803020417690278,
"num_tokens": 52728242.0,
"step": 30390
},
{
"entropy": 5.3879159450531,
"epoch": 2.364831744796732,
"grad_norm": 1.1484375,
"learning_rate": 0.0004435387053743123,
"loss": 4.9261,
"mean_token_accuracy": 0.1988093748688698,
"num_tokens": 52736943.0,
"step": 30395
},
{
"entropy": 5.293087911605835,
"epoch": 2.3652207741684497,
"grad_norm": 1.21875,
"learning_rate": 0.00044352034248754265,
"loss": 4.9911,
"mean_token_accuracy": 0.195296074450016,
"num_tokens": 52744893.0,
"step": 30400
},
{
"entropy": 5.297296237945557,
"epoch": 2.3656098035401674,
"grad_norm": 1.078125,
"learning_rate": 0.000443501977043745,
"loss": 4.8891,
"mean_token_accuracy": 0.20134067684412002,
"num_tokens": 52753492.0,
"step": 30405
},
{
"entropy": 5.3555761814117435,
"epoch": 2.3659988329118846,
"grad_norm": 1.1640625,
"learning_rate": 0.0004434836090431981,
"loss": 5.0171,
"mean_token_accuracy": 0.1914955899119377,
"num_tokens": 52762598.0,
"step": 30410
},
{
"entropy": 5.344616270065307,
"epoch": 2.3663878622836023,
"grad_norm": 1.1796875,
"learning_rate": 0.0004434652384861806,
"loss": 5.0386,
"mean_token_accuracy": 0.19631507694721223,
"num_tokens": 52770942.0,
"step": 30415
},
{
"entropy": 5.398829126358033,
"epoch": 2.36677689165532,
"grad_norm": 1.15625,
"learning_rate": 0.0004434468653729712,
"loss": 5.0011,
"mean_token_accuracy": 0.19565207809209822,
"num_tokens": 52779237.0,
"step": 30420
},
{
"entropy": 5.431178569793701,
"epoch": 2.3671659210270377,
"grad_norm": 1.1875,
"learning_rate": 0.00044342848970384876,
"loss": 5.0726,
"mean_token_accuracy": 0.1891084909439087,
"num_tokens": 52787721.0,
"step": 30425
},
{
"entropy": 5.4733438968658445,
"epoch": 2.367554950398755,
"grad_norm": 1.2265625,
"learning_rate": 0.00044341011147909206,
"loss": 5.012,
"mean_token_accuracy": 0.18991246819496155,
"num_tokens": 52795765.0,
"step": 30430
},
{
"entropy": 5.35176043510437,
"epoch": 2.3679439797704727,
"grad_norm": 1.1796875,
"learning_rate": 0.00044339173069897996,
"loss": 4.9492,
"mean_token_accuracy": 0.20344800055027007,
"num_tokens": 52804104.0,
"step": 30435
},
{
"entropy": 5.280908489227295,
"epoch": 2.3683330091421904,
"grad_norm": 1.15625,
"learning_rate": 0.00044337334736379143,
"loss": 4.9404,
"mean_token_accuracy": 0.2006893053650856,
"num_tokens": 52812817.0,
"step": 30440
},
{
"entropy": 5.395576286315918,
"epoch": 2.3687220385139076,
"grad_norm": 1.2734375,
"learning_rate": 0.0004433549614738053,
"loss": 4.989,
"mean_token_accuracy": 0.19184469878673555,
"num_tokens": 52821924.0,
"step": 30445
},
{
"entropy": 5.416038846969604,
"epoch": 2.3691110678856253,
"grad_norm": 1.1328125,
"learning_rate": 0.00044333657302930056,
"loss": 4.971,
"mean_token_accuracy": 0.19782205075025558,
"num_tokens": 52830943.0,
"step": 30450
},
{
"entropy": 5.368327903747558,
"epoch": 2.369500097257343,
"grad_norm": 1.1171875,
"learning_rate": 0.0004433181820305564,
"loss": 5.0825,
"mean_token_accuracy": 0.193613862991333,
"num_tokens": 52839697.0,
"step": 30455
},
{
"entropy": 5.405035161972046,
"epoch": 2.3698891266290607,
"grad_norm": 1.09375,
"learning_rate": 0.00044329978847785156,
"loss": 5.0472,
"mean_token_accuracy": 0.19381865561008454,
"num_tokens": 52848713.0,
"step": 30460
},
{
"entropy": 5.485594654083252,
"epoch": 2.370278156000778,
"grad_norm": 1.1953125,
"learning_rate": 0.0004432813923714654,
"loss": 5.1064,
"mean_token_accuracy": 0.18633773773908616,
"num_tokens": 52856852.0,
"step": 30465
},
{
"entropy": 5.332221221923828,
"epoch": 2.3706671853724957,
"grad_norm": 1.234375,
"learning_rate": 0.00044326299371167695,
"loss": 4.9418,
"mean_token_accuracy": 0.19961559325456618,
"num_tokens": 52865235.0,
"step": 30470
},
{
"entropy": 5.345868301391602,
"epoch": 2.3710562147442134,
"grad_norm": 1.1796875,
"learning_rate": 0.00044324459249876536,
"loss": 4.9639,
"mean_token_accuracy": 0.1942094936966896,
"num_tokens": 52873454.0,
"step": 30475
},
{
"entropy": 5.363625144958496,
"epoch": 2.3714452441159306,
"grad_norm": 1.1953125,
"learning_rate": 0.0004432261887330099,
"loss": 4.9931,
"mean_token_accuracy": 0.2030204102396965,
"num_tokens": 52882551.0,
"step": 30480
},
{
"entropy": 5.4559978485107425,
"epoch": 2.3718342734876483,
"grad_norm": 1.1875,
"learning_rate": 0.0004432077824146898,
"loss": 5.0656,
"mean_token_accuracy": 0.19294535219669343,
"num_tokens": 52891145.0,
"step": 30485
},
{
"entropy": 5.404257535934448,
"epoch": 2.372223302859366,
"grad_norm": 1.140625,
"learning_rate": 0.0004431893735440843,
"loss": 5.0038,
"mean_token_accuracy": 0.1868406742811203,
"num_tokens": 52899486.0,
"step": 30490
},
{
"entropy": 5.36927981376648,
"epoch": 2.3726123322310833,
"grad_norm": 1.0859375,
"learning_rate": 0.0004431709621214727,
"loss": 5.004,
"mean_token_accuracy": 0.19514624327421187,
"num_tokens": 52907896.0,
"step": 30495
},
{
"entropy": 5.3995888233184814,
"epoch": 2.373001361602801,
"grad_norm": 1.140625,
"learning_rate": 0.00044315254814713455,
"loss": 5.0056,
"mean_token_accuracy": 0.1963059514760971,
"num_tokens": 52916489.0,
"step": 30500
},
{
"entropy": 5.426941919326782,
"epoch": 2.3733903909745186,
"grad_norm": 1.171875,
"learning_rate": 0.00044313413162134894,
"loss": 5.0322,
"mean_token_accuracy": 0.18984858989715575,
"num_tokens": 52924559.0,
"step": 30505
},
{
"entropy": 5.412492561340332,
"epoch": 2.373779420346236,
"grad_norm": 1.1796875,
"learning_rate": 0.0004431157125443958,
"loss": 5.0591,
"mean_token_accuracy": 0.19584806114435196,
"num_tokens": 52934064.0,
"step": 30510
},
{
"entropy": 5.433523941040039,
"epoch": 2.3741684497179536,
"grad_norm": 1.2109375,
"learning_rate": 0.000443097290916554,
"loss": 5.0317,
"mean_token_accuracy": 0.19418727308511735,
"num_tokens": 52943283.0,
"step": 30515
},
{
"entropy": 5.33743953704834,
"epoch": 2.3745574790896713,
"grad_norm": 1.203125,
"learning_rate": 0.0004430788667381035,
"loss": 4.9027,
"mean_token_accuracy": 0.19801723659038545,
"num_tokens": 52951694.0,
"step": 30520
},
{
"entropy": 5.354623556137085,
"epoch": 2.374946508461389,
"grad_norm": 1.1796875,
"learning_rate": 0.00044306044000932374,
"loss": 5.0239,
"mean_token_accuracy": 0.1904174119234085,
"num_tokens": 52959850.0,
"step": 30525
},
{
"entropy": 5.5140190601348875,
"epoch": 2.3753355378331062,
"grad_norm": 1.171875,
"learning_rate": 0.0004430420107304943,
"loss": 5.1959,
"mean_token_accuracy": 0.19013487547636032,
"num_tokens": 52969378.0,
"step": 30530
},
{
"entropy": 5.473598337173462,
"epoch": 2.375724567204824,
"grad_norm": 1.2265625,
"learning_rate": 0.00044302357890189475,
"loss": 5.0367,
"mean_token_accuracy": 0.19712282121181487,
"num_tokens": 52977178.0,
"step": 30535
},
{
"entropy": 5.458655595779419,
"epoch": 2.3761135965765416,
"grad_norm": 1.25,
"learning_rate": 0.0004430051445238049,
"loss": 5.054,
"mean_token_accuracy": 0.19487334042787552,
"num_tokens": 52986035.0,
"step": 30540
},
{
"entropy": 5.334892463684082,
"epoch": 2.376502625948259,
"grad_norm": 1.2109375,
"learning_rate": 0.00044298670759650426,
"loss": 5.0785,
"mean_token_accuracy": 0.1933472365140915,
"num_tokens": 52995399.0,
"step": 30545
},
{
"entropy": 5.415270042419434,
"epoch": 2.3768916553199766,
"grad_norm": 1.1640625,
"learning_rate": 0.0004429682681202728,
"loss": 5.0095,
"mean_token_accuracy": 0.19903945475816726,
"num_tokens": 53004500.0,
"step": 30550
},
{
"entropy": 5.4921379566192625,
"epoch": 2.3772806846916943,
"grad_norm": 1.1953125,
"learning_rate": 0.00044294982609539027,
"loss": 5.1186,
"mean_token_accuracy": 0.19133528470993041,
"num_tokens": 53014161.0,
"step": 30555
},
{
"entropy": 5.327301692962647,
"epoch": 2.377669714063412,
"grad_norm": 1.203125,
"learning_rate": 0.0004429313815221363,
"loss": 4.8797,
"mean_token_accuracy": 0.20123362988233567,
"num_tokens": 53022560.0,
"step": 30560
},
{
"entropy": 5.389039659500122,
"epoch": 2.3780587434351292,
"grad_norm": 1.1171875,
"learning_rate": 0.00044291293440079107,
"loss": 5.0635,
"mean_token_accuracy": 0.1923644632101059,
"num_tokens": 53031194.0,
"step": 30565
},
{
"entropy": 5.43643627166748,
"epoch": 2.378447772806847,
"grad_norm": 1.15625,
"learning_rate": 0.0004428944847316342,
"loss": 5.0815,
"mean_token_accuracy": 0.19247312992811202,
"num_tokens": 53039512.0,
"step": 30570
},
{
"entropy": 5.449588203430176,
"epoch": 2.3788368021785646,
"grad_norm": 1.2265625,
"learning_rate": 0.0004428760325149458,
"loss": 5.0413,
"mean_token_accuracy": 0.19694886356592178,
"num_tokens": 53048579.0,
"step": 30575
},
{
"entropy": 5.4938396453857425,
"epoch": 2.379225831550282,
"grad_norm": 1.1640625,
"learning_rate": 0.00044285757775100584,
"loss": 5.1674,
"mean_token_accuracy": 0.18698979914188385,
"num_tokens": 53057770.0,
"step": 30580
},
{
"entropy": 5.4218543529510494,
"epoch": 2.3796148609219996,
"grad_norm": 1.109375,
"learning_rate": 0.00044283912044009436,
"loss": 5.0312,
"mean_token_accuracy": 0.19643487334251403,
"num_tokens": 53067127.0,
"step": 30585
},
{
"entropy": 5.447482061386109,
"epoch": 2.3800038902937173,
"grad_norm": 1.1171875,
"learning_rate": 0.00044282066058249123,
"loss": 5.018,
"mean_token_accuracy": 0.19424306750297546,
"num_tokens": 53076351.0,
"step": 30590
},
{
"entropy": 5.421877908706665,
"epoch": 2.380392919665435,
"grad_norm": 1.1328125,
"learning_rate": 0.0004428021981784768,
"loss": 5.0482,
"mean_token_accuracy": 0.1920485317707062,
"num_tokens": 53085472.0,
"step": 30595
},
{
"entropy": 5.431625127792358,
"epoch": 2.3807819490371522,
"grad_norm": 1.171875,
"learning_rate": 0.00044278373322833106,
"loss": 5.0,
"mean_token_accuracy": 0.194564525783062,
"num_tokens": 53094181.0,
"step": 30600
},
{
"entropy": 5.424614906311035,
"epoch": 2.38117097840887,
"grad_norm": 1.203125,
"learning_rate": 0.00044276526573233416,
"loss": 5.0702,
"mean_token_accuracy": 0.18509909957647325,
"num_tokens": 53103421.0,
"step": 30605
},
{
"entropy": 5.418405771255493,
"epoch": 2.381560007780587,
"grad_norm": 1.2109375,
"learning_rate": 0.0004427467956907664,
"loss": 4.9871,
"mean_token_accuracy": 0.1968007892370224,
"num_tokens": 53112058.0,
"step": 30610
},
{
"entropy": 5.423847293853759,
"epoch": 2.381949037152305,
"grad_norm": 1.296875,
"learning_rate": 0.00044272832310390814,
"loss": 5.0752,
"mean_token_accuracy": 0.19400326013565064,
"num_tokens": 53119755.0,
"step": 30615
},
{
"entropy": 5.316181802749634,
"epoch": 2.3823380665240226,
"grad_norm": 1.1796875,
"learning_rate": 0.0004427098479720394,
"loss": 4.9616,
"mean_token_accuracy": 0.20256635248661042,
"num_tokens": 53128529.0,
"step": 30620
},
{
"entropy": 5.36008734703064,
"epoch": 2.3827270958957403,
"grad_norm": 1.1796875,
"learning_rate": 0.00044269137029544073,
"loss": 4.9895,
"mean_token_accuracy": 0.1950661286711693,
"num_tokens": 53137594.0,
"step": 30625
},
{
"entropy": 5.5124729633331295,
"epoch": 2.3831161252674575,
"grad_norm": 1.25,
"learning_rate": 0.0004426728900743924,
"loss": 5.0461,
"mean_token_accuracy": 0.1874262273311615,
"num_tokens": 53146521.0,
"step": 30630
},
{
"entropy": 5.451292943954468,
"epoch": 2.3835051546391752,
"grad_norm": 1.2109375,
"learning_rate": 0.00044265440730917484,
"loss": 5.0093,
"mean_token_accuracy": 0.1992732748389244,
"num_tokens": 53154832.0,
"step": 30635
},
{
"entropy": 5.4052387237548825,
"epoch": 2.383894184010893,
"grad_norm": 1.109375,
"learning_rate": 0.00044263592200006845,
"loss": 5.0788,
"mean_token_accuracy": 0.18611396998167037,
"num_tokens": 53163889.0,
"step": 30640
},
{
"entropy": 5.394327926635742,
"epoch": 2.38428321338261,
"grad_norm": 1.203125,
"learning_rate": 0.00044261743414735383,
"loss": 5.0389,
"mean_token_accuracy": 0.19424591809511185,
"num_tokens": 53172688.0,
"step": 30645
},
{
"entropy": 5.454587793350219,
"epoch": 2.384672242754328,
"grad_norm": 1.1640625,
"learning_rate": 0.0004425989437513114,
"loss": 5.0111,
"mean_token_accuracy": 0.19329170435667037,
"num_tokens": 53180742.0,
"step": 30650
},
{
"entropy": 5.329313039779663,
"epoch": 2.3850612721260456,
"grad_norm": 1.1484375,
"learning_rate": 0.0004425804508122218,
"loss": 4.9884,
"mean_token_accuracy": 0.20226458758115767,
"num_tokens": 53188716.0,
"step": 30655
},
{
"entropy": 5.43035044670105,
"epoch": 2.3854503014977633,
"grad_norm": 1.0859375,
"learning_rate": 0.00044256195533036566,
"loss": 5.1309,
"mean_token_accuracy": 0.18732646703720093,
"num_tokens": 53197420.0,
"step": 30660
},
{
"entropy": 5.409579467773438,
"epoch": 2.3858393308694805,
"grad_norm": 1.140625,
"learning_rate": 0.00044254345730602345,
"loss": 5.0342,
"mean_token_accuracy": 0.19419767260551452,
"num_tokens": 53205927.0,
"step": 30665
},
{
"entropy": 5.426610040664673,
"epoch": 2.386228360241198,
"grad_norm": 1.171875,
"learning_rate": 0.0004425249567394759,
"loss": 4.9958,
"mean_token_accuracy": 0.19732051491737365,
"num_tokens": 53214793.0,
"step": 30670
},
{
"entropy": 5.371940755844117,
"epoch": 2.386617389612916,
"grad_norm": 1.1484375,
"learning_rate": 0.00044250645363100386,
"loss": 4.9937,
"mean_token_accuracy": 0.1965232864022255,
"num_tokens": 53223429.0,
"step": 30675
},
{
"entropy": 5.37785325050354,
"epoch": 2.387006418984633,
"grad_norm": 1.1796875,
"learning_rate": 0.00044248794798088805,
"loss": 4.8916,
"mean_token_accuracy": 0.20787483155727388,
"num_tokens": 53231697.0,
"step": 30680
},
{
"entropy": 5.443516492843628,
"epoch": 2.387395448356351,
"grad_norm": 1.2265625,
"learning_rate": 0.0004424694397894091,
"loss": 5.0247,
"mean_token_accuracy": 0.19835929125547408,
"num_tokens": 53239318.0,
"step": 30685
},
{
"entropy": 5.442487907409668,
"epoch": 2.3877844777280686,
"grad_norm": 1.1328125,
"learning_rate": 0.00044245092905684794,
"loss": 5.0974,
"mean_token_accuracy": 0.1890202760696411,
"num_tokens": 53248079.0,
"step": 30690
},
{
"entropy": 5.414025926589966,
"epoch": 2.3881735070997863,
"grad_norm": 1.1953125,
"learning_rate": 0.00044243241578348553,
"loss": 5.0589,
"mean_token_accuracy": 0.1939913108944893,
"num_tokens": 53256856.0,
"step": 30695
},
{
"entropy": 5.481858158111573,
"epoch": 2.3885625364715035,
"grad_norm": 1.125,
"learning_rate": 0.0004424138999696027,
"loss": 5.0998,
"mean_token_accuracy": 0.18905478119850158,
"num_tokens": 53265810.0,
"step": 30700
},
{
"entropy": 5.490751886367798,
"epoch": 2.388951565843221,
"grad_norm": 1.203125,
"learning_rate": 0.0004423953816154804,
"loss": 5.0677,
"mean_token_accuracy": 0.19156312495470046,
"num_tokens": 53274485.0,
"step": 30705
},
{
"entropy": 5.395273923873901,
"epoch": 2.389340595214939,
"grad_norm": 1.2890625,
"learning_rate": 0.00044237686072139967,
"loss": 4.9477,
"mean_token_accuracy": 0.19312392622232438,
"num_tokens": 53282322.0,
"step": 30710
},
{
"entropy": 5.441404914855957,
"epoch": 2.389729624586656,
"grad_norm": 1.15625,
"learning_rate": 0.0004423583372876414,
"loss": 5.0875,
"mean_token_accuracy": 0.18860950022935868,
"num_tokens": 53291868.0,
"step": 30715
},
{
"entropy": 5.361319255828858,
"epoch": 2.390118653958374,
"grad_norm": 1.2109375,
"learning_rate": 0.00044233981131448677,
"loss": 4.9749,
"mean_token_accuracy": 0.20542532950639725,
"num_tokens": 53300654.0,
"step": 30720
},
{
"entropy": 5.408745384216308,
"epoch": 2.3905076833300916,
"grad_norm": 1.1640625,
"learning_rate": 0.00044232128280221683,
"loss": 4.8602,
"mean_token_accuracy": 0.20927826911211014,
"num_tokens": 53309178.0,
"step": 30725
},
{
"entropy": 5.363996362686157,
"epoch": 2.390896712701809,
"grad_norm": 1.140625,
"learning_rate": 0.0004423027517511128,
"loss": 5.063,
"mean_token_accuracy": 0.19236669987440108,
"num_tokens": 53317536.0,
"step": 30730
},
{
"entropy": 5.366774415969848,
"epoch": 2.3912857420735265,
"grad_norm": 1.234375,
"learning_rate": 0.00044228421816145573,
"loss": 5.018,
"mean_token_accuracy": 0.19066746830940245,
"num_tokens": 53325942.0,
"step": 30735
},
{
"entropy": 5.409568023681641,
"epoch": 2.391674771445244,
"grad_norm": 1.1171875,
"learning_rate": 0.00044226568203352694,
"loss": 5.0052,
"mean_token_accuracy": 0.19398888647556306,
"num_tokens": 53335124.0,
"step": 30740
},
{
"entropy": 5.428287553787231,
"epoch": 2.3920638008169615,
"grad_norm": 1.1640625,
"learning_rate": 0.00044224714336760766,
"loss": 5.0919,
"mean_token_accuracy": 0.19102391749620437,
"num_tokens": 53344222.0,
"step": 30745
},
{
"entropy": 5.397597789764404,
"epoch": 2.392452830188679,
"grad_norm": 1.1484375,
"learning_rate": 0.0004422286021639792,
"loss": 5.0031,
"mean_token_accuracy": 0.19413872808218002,
"num_tokens": 53352639.0,
"step": 30750
},
{
"entropy": 5.4450608253479,
"epoch": 2.392841859560397,
"grad_norm": 1.1796875,
"learning_rate": 0.0004422100584229228,
"loss": 5.014,
"mean_token_accuracy": 0.20079839378595352,
"num_tokens": 53361357.0,
"step": 30755
},
{
"entropy": 5.425060510635376,
"epoch": 2.3932308889321146,
"grad_norm": 1.28125,
"learning_rate": 0.00044219151214472,
"loss": 5.0367,
"mean_token_accuracy": 0.19571194648742676,
"num_tokens": 53369680.0,
"step": 30760
},
{
"entropy": 5.406001853942871,
"epoch": 2.393619918303832,
"grad_norm": 1.265625,
"learning_rate": 0.0004421729633296521,
"loss": 5.0402,
"mean_token_accuracy": 0.19584219306707382,
"num_tokens": 53378619.0,
"step": 30765
},
{
"entropy": 5.440612745285034,
"epoch": 2.3940089476755495,
"grad_norm": 1.140625,
"learning_rate": 0.00044215441197800054,
"loss": 5.0196,
"mean_token_accuracy": 0.1989392250776291,
"num_tokens": 53387630.0,
"step": 30770
},
{
"entropy": 5.377399206161499,
"epoch": 2.394397977047267,
"grad_norm": 1.1015625,
"learning_rate": 0.00044213585809004685,
"loss": 4.9993,
"mean_token_accuracy": 0.1922181576490402,
"num_tokens": 53396696.0,
"step": 30775
},
{
"entropy": 5.418631458282471,
"epoch": 2.3947870064189845,
"grad_norm": 1.2265625,
"learning_rate": 0.0004421173016660725,
"loss": 5.0227,
"mean_token_accuracy": 0.19250572025775908,
"num_tokens": 53405097.0,
"step": 30780
},
{
"entropy": 5.363653039932251,
"epoch": 2.395176035790702,
"grad_norm": 1.125,
"learning_rate": 0.0004420987427063592,
"loss": 4.9741,
"mean_token_accuracy": 0.19682681411504746,
"num_tokens": 53413670.0,
"step": 30785
},
{
"entropy": 5.384137296676636,
"epoch": 2.39556506516242,
"grad_norm": 1.203125,
"learning_rate": 0.00044208018121118833,
"loss": 5.0779,
"mean_token_accuracy": 0.19030825048685074,
"num_tokens": 53422370.0,
"step": 30790
},
{
"entropy": 5.465094995498657,
"epoch": 2.3959540945341375,
"grad_norm": 1.1953125,
"learning_rate": 0.00044206161718084164,
"loss": 5.1167,
"mean_token_accuracy": 0.18224213272333145,
"num_tokens": 53431607.0,
"step": 30795
},
{
"entropy": 5.412611198425293,
"epoch": 2.396343123905855,
"grad_norm": 1.3984375,
"learning_rate": 0.0004420430506156009,
"loss": 4.9123,
"mean_token_accuracy": 0.20767647176980972,
"num_tokens": 53440042.0,
"step": 30800
},
{
"entropy": 5.319740200042725,
"epoch": 2.3967321532775725,
"grad_norm": 1.21875,
"learning_rate": 0.00044202448151574764,
"loss": 5.0048,
"mean_token_accuracy": 0.20308858454227446,
"num_tokens": 53448780.0,
"step": 30805
},
{
"entropy": 5.424555921554566,
"epoch": 2.39712118264929,
"grad_norm": 1.109375,
"learning_rate": 0.0004420059098815638,
"loss": 5.1114,
"mean_token_accuracy": 0.18620938062667847,
"num_tokens": 53457598.0,
"step": 30810
},
{
"entropy": 5.488473510742187,
"epoch": 2.3975102120210074,
"grad_norm": 1.1640625,
"learning_rate": 0.0004419873357133311,
"loss": 5.1112,
"mean_token_accuracy": 0.19560483396053313,
"num_tokens": 53466387.0,
"step": 30815
},
{
"entropy": 5.482522773742676,
"epoch": 2.397899241392725,
"grad_norm": 1.234375,
"learning_rate": 0.0004419687590113313,
"loss": 5.0423,
"mean_token_accuracy": 0.19537197798490524,
"num_tokens": 53475032.0,
"step": 30820
},
{
"entropy": 5.451695919036865,
"epoch": 2.398288270764443,
"grad_norm": 1.1953125,
"learning_rate": 0.00044195017977584637,
"loss": 5.0388,
"mean_token_accuracy": 0.1998867690563202,
"num_tokens": 53483142.0,
"step": 30825
},
{
"entropy": 5.43352518081665,
"epoch": 2.39867730013616,
"grad_norm": 1.1796875,
"learning_rate": 0.00044193159800715823,
"loss": 5.1214,
"mean_token_accuracy": 0.19339792281389237,
"num_tokens": 53492820.0,
"step": 30830
},
{
"entropy": 5.451276445388794,
"epoch": 2.399066329507878,
"grad_norm": 1.203125,
"learning_rate": 0.00044191301370554874,
"loss": 5.0523,
"mean_token_accuracy": 0.18964807242155074,
"num_tokens": 53502018.0,
"step": 30835
},
{
"entropy": 5.424482774734497,
"epoch": 2.3994553588795955,
"grad_norm": 1.1796875,
"learning_rate": 0.00044189442687129994,
"loss": 4.9522,
"mean_token_accuracy": 0.19632142782211304,
"num_tokens": 53510287.0,
"step": 30840
},
{
"entropy": 5.386946153640747,
"epoch": 2.3998443882513127,
"grad_norm": 1.1640625,
"learning_rate": 0.0004418758375046939,
"loss": 5.0082,
"mean_token_accuracy": 0.1914263039827347,
"num_tokens": 53519042.0,
"step": 30845
},
{
"entropy": 5.458552408218384,
"epoch": 2.4002334176230304,
"grad_norm": 1.1796875,
"learning_rate": 0.00044185724560601267,
"loss": 5.0201,
"mean_token_accuracy": 0.1927003726363182,
"num_tokens": 53527678.0,
"step": 30850
},
{
"entropy": 5.4738438606262205,
"epoch": 2.400622446994748,
"grad_norm": 1.109375,
"learning_rate": 0.0004418386511755382,
"loss": 5.0508,
"mean_token_accuracy": 0.19198777973651887,
"num_tokens": 53536371.0,
"step": 30855
},
{
"entropy": 5.387752676010132,
"epoch": 2.401011476366466,
"grad_norm": 1.1328125,
"learning_rate": 0.0004418200542135528,
"loss": 5.0749,
"mean_token_accuracy": 0.1982365921139717,
"num_tokens": 53545534.0,
"step": 30860
},
{
"entropy": 5.40975546836853,
"epoch": 2.401400505738183,
"grad_norm": 1.1328125,
"learning_rate": 0.0004418014547203386,
"loss": 4.9769,
"mean_token_accuracy": 0.19642316699028015,
"num_tokens": 53554904.0,
"step": 30865
},
{
"entropy": 5.48582615852356,
"epoch": 2.401789535109901,
"grad_norm": 1.171875,
"learning_rate": 0.0004417828526961778,
"loss": 5.0195,
"mean_token_accuracy": 0.19466073662042618,
"num_tokens": 53563359.0,
"step": 30870
},
{
"entropy": 5.381623792648315,
"epoch": 2.4021785644816185,
"grad_norm": 1.3984375,
"learning_rate": 0.00044176424814135266,
"loss": 5.147,
"mean_token_accuracy": 0.1881447583436966,
"num_tokens": 53573428.0,
"step": 30875
},
{
"entropy": 5.444944667816162,
"epoch": 2.4025675938533357,
"grad_norm": 1.15625,
"learning_rate": 0.0004417456410561455,
"loss": 5.0926,
"mean_token_accuracy": 0.18804797232151033,
"num_tokens": 53581719.0,
"step": 30880
},
{
"entropy": 5.517395401000977,
"epoch": 2.4029566232250534,
"grad_norm": 1.1640625,
"learning_rate": 0.0004417270314408387,
"loss": 5.1561,
"mean_token_accuracy": 0.18775928020477295,
"num_tokens": 53589715.0,
"step": 30885
},
{
"entropy": 5.431297874450683,
"epoch": 2.403345652596771,
"grad_norm": 1.125,
"learning_rate": 0.00044170841929571454,
"loss": 5.0236,
"mean_token_accuracy": 0.1950223296880722,
"num_tokens": 53598273.0,
"step": 30890
},
{
"entropy": 5.418065309524536,
"epoch": 2.403734681968489,
"grad_norm": 1.1171875,
"learning_rate": 0.00044168980462105543,
"loss": 5.051,
"mean_token_accuracy": 0.19082193821668625,
"num_tokens": 53607824.0,
"step": 30895
},
{
"entropy": 5.43564805984497,
"epoch": 2.404123711340206,
"grad_norm": 1.109375,
"learning_rate": 0.0004416711874171439,
"loss": 4.9661,
"mean_token_accuracy": 0.19981446117162704,
"num_tokens": 53616734.0,
"step": 30900
},
{
"entropy": 5.340733242034912,
"epoch": 2.404512740711924,
"grad_norm": 1.3046875,
"learning_rate": 0.0004416525676842624,
"loss": 5.0136,
"mean_token_accuracy": 0.20162587463855744,
"num_tokens": 53625877.0,
"step": 30905
},
{
"entropy": 5.393693923950195,
"epoch": 2.4049017700836415,
"grad_norm": 1.140625,
"learning_rate": 0.0004416339454226933,
"loss": 5.0711,
"mean_token_accuracy": 0.1929358258843422,
"num_tokens": 53634872.0,
"step": 30910
},
{
"entropy": 5.400026321411133,
"epoch": 2.4052907994553587,
"grad_norm": 1.25,
"learning_rate": 0.0004416153206327194,
"loss": 5.0094,
"mean_token_accuracy": 0.19994690418243408,
"num_tokens": 53643916.0,
"step": 30915
},
{
"entropy": 5.4065131664276125,
"epoch": 2.4056798288270764,
"grad_norm": 1.15625,
"learning_rate": 0.00044159669331462326,
"loss": 5.0415,
"mean_token_accuracy": 0.1896221563220024,
"num_tokens": 53652496.0,
"step": 30920
},
{
"entropy": 5.343953943252563,
"epoch": 2.406068858198794,
"grad_norm": 1.1484375,
"learning_rate": 0.00044157806346868737,
"loss": 5.014,
"mean_token_accuracy": 0.19502445310354233,
"num_tokens": 53661191.0,
"step": 30925
},
{
"entropy": 5.4239434719085695,
"epoch": 2.406457887570512,
"grad_norm": 1.234375,
"learning_rate": 0.00044155943109519454,
"loss": 5.0249,
"mean_token_accuracy": 0.1900385931134224,
"num_tokens": 53669520.0,
"step": 30930
},
{
"entropy": 5.437687110900879,
"epoch": 2.406846916942229,
"grad_norm": 1.125,
"learning_rate": 0.0004415407961944274,
"loss": 5.0511,
"mean_token_accuracy": 0.19101658165454866,
"num_tokens": 53678398.0,
"step": 30935
},
{
"entropy": 5.4347230911254885,
"epoch": 2.4072359463139468,
"grad_norm": 1.1328125,
"learning_rate": 0.00044152215876666883,
"loss": 5.0655,
"mean_token_accuracy": 0.19613282531499862,
"num_tokens": 53687870.0,
"step": 30940
},
{
"entropy": 5.4615904808044435,
"epoch": 2.407624975685664,
"grad_norm": 1.1484375,
"learning_rate": 0.0004415035188122016,
"loss": 5.0362,
"mean_token_accuracy": 0.18978424817323686,
"num_tokens": 53697335.0,
"step": 30945
},
{
"entropy": 5.281361150741577,
"epoch": 2.4080140050573817,
"grad_norm": 1.1640625,
"learning_rate": 0.00044148487633130837,
"loss": 4.9041,
"mean_token_accuracy": 0.20375325828790664,
"num_tokens": 53705457.0,
"step": 30950
},
{
"entropy": 5.283529472351074,
"epoch": 2.4084030344290994,
"grad_norm": 1.1171875,
"learning_rate": 0.00044146623132427213,
"loss": 4.8316,
"mean_token_accuracy": 0.2058969959616661,
"num_tokens": 53714092.0,
"step": 30955
},
{
"entropy": 5.393737554550171,
"epoch": 2.408792063800817,
"grad_norm": 1.1875,
"learning_rate": 0.00044144758379137584,
"loss": 5.0297,
"mean_token_accuracy": 0.19410151988267899,
"num_tokens": 53722972.0,
"step": 30960
},
{
"entropy": 5.39993839263916,
"epoch": 2.4091810931725344,
"grad_norm": 1.1875,
"learning_rate": 0.00044142893373290236,
"loss": 4.9711,
"mean_token_accuracy": 0.20181001722812653,
"num_tokens": 53730842.0,
"step": 30965
},
{
"entropy": 5.439574193954468,
"epoch": 2.409570122544252,
"grad_norm": 1.234375,
"learning_rate": 0.0004414102811491348,
"loss": 5.0581,
"mean_token_accuracy": 0.18835478127002717,
"num_tokens": 53740241.0,
"step": 30970
},
{
"entropy": 5.365944719314575,
"epoch": 2.4099591519159698,
"grad_norm": 1.1015625,
"learning_rate": 0.00044139162604035597,
"loss": 4.9869,
"mean_token_accuracy": 0.1912885367870331,
"num_tokens": 53749653.0,
"step": 30975
},
{
"entropy": 5.388735389709472,
"epoch": 2.410348181287687,
"grad_norm": 1.296875,
"learning_rate": 0.00044137296840684917,
"loss": 4.9828,
"mean_token_accuracy": 0.20338206589221955,
"num_tokens": 53758161.0,
"step": 30980
},
{
"entropy": 5.396969556808472,
"epoch": 2.4107372106594047,
"grad_norm": 1.1171875,
"learning_rate": 0.0004413543082488973,
"loss": 4.8914,
"mean_token_accuracy": 0.22004808336496354,
"num_tokens": 53766345.0,
"step": 30985
},
{
"entropy": 5.387019109725952,
"epoch": 2.4111262400311224,
"grad_norm": 1.1875,
"learning_rate": 0.0004413356455667836,
"loss": 4.9578,
"mean_token_accuracy": 0.2043931543827057,
"num_tokens": 53774725.0,
"step": 30990
},
{
"entropy": 5.3289635181427,
"epoch": 2.41151526940284,
"grad_norm": 1.140625,
"learning_rate": 0.0004413169803607913,
"loss": 4.9805,
"mean_token_accuracy": 0.19591590017080307,
"num_tokens": 53783386.0,
"step": 30995
},
{
"entropy": 5.427493143081665,
"epoch": 2.4119042987745574,
"grad_norm": 1.28125,
"learning_rate": 0.00044129831263120344,
"loss": 4.9814,
"mean_token_accuracy": 0.19367842376232147,
"num_tokens": 53791167.0,
"step": 31000
},
{
"entropy": 5.4133790016174315,
"epoch": 2.412293328146275,
"grad_norm": 1.171875,
"learning_rate": 0.0004412796423783034,
"loss": 5.0157,
"mean_token_accuracy": 0.19186872988939285,
"num_tokens": 53800227.0,
"step": 31005
},
{
"entropy": 5.395814514160156,
"epoch": 2.4126823575179928,
"grad_norm": 1.1640625,
"learning_rate": 0.0004412609696023745,
"loss": 5.0235,
"mean_token_accuracy": 0.1948474496603012,
"num_tokens": 53808591.0,
"step": 31010
},
{
"entropy": 5.464764595031738,
"epoch": 2.41307138688971,
"grad_norm": 1.171875,
"learning_rate": 0.0004412422943037,
"loss": 5.0944,
"mean_token_accuracy": 0.1929880529642105,
"num_tokens": 53817738.0,
"step": 31015
},
{
"entropy": 5.453347206115723,
"epoch": 2.4134604162614277,
"grad_norm": 1.046875,
"learning_rate": 0.00044122361648256327,
"loss": 5.061,
"mean_token_accuracy": 0.19630954563617706,
"num_tokens": 53826919.0,
"step": 31020
},
{
"entropy": 5.411454868316651,
"epoch": 2.4138494456331454,
"grad_norm": 1.234375,
"learning_rate": 0.00044120493613924766,
"loss": 4.9553,
"mean_token_accuracy": 0.20158345103263856,
"num_tokens": 53835415.0,
"step": 31025
},
{
"entropy": 5.380985116958618,
"epoch": 2.414238475004863,
"grad_norm": 1.1484375,
"learning_rate": 0.00044118625327403677,
"loss": 5.0796,
"mean_token_accuracy": 0.19394372552633285,
"num_tokens": 53844992.0,
"step": 31030
},
{
"entropy": 5.43061203956604,
"epoch": 2.4146275043765804,
"grad_norm": 1.2421875,
"learning_rate": 0.000441167567887214,
"loss": 5.0194,
"mean_token_accuracy": 0.19021786898374557,
"num_tokens": 53853864.0,
"step": 31035
},
{
"entropy": 5.469346332550049,
"epoch": 2.415016533748298,
"grad_norm": 1.1796875,
"learning_rate": 0.0004411488799790629,
"loss": 5.023,
"mean_token_accuracy": 0.1988400936126709,
"num_tokens": 53863021.0,
"step": 31040
},
{
"entropy": 5.450225877761841,
"epoch": 2.4154055631200158,
"grad_norm": 1.1171875,
"learning_rate": 0.00044113018954986693,
"loss": 5.067,
"mean_token_accuracy": 0.18261824250221254,
"num_tokens": 53873259.0,
"step": 31045
},
{
"entropy": 5.372161960601806,
"epoch": 2.415794592491733,
"grad_norm": 1.125,
"learning_rate": 0.0004411114965999098,
"loss": 4.9775,
"mean_token_accuracy": 0.1993924304842949,
"num_tokens": 53881861.0,
"step": 31050
},
{
"entropy": 5.40552248954773,
"epoch": 2.4161836218634507,
"grad_norm": 1.1875,
"learning_rate": 0.000441092801129475,
"loss": 5.0641,
"mean_token_accuracy": 0.18950241953134536,
"num_tokens": 53890852.0,
"step": 31055
},
{
"entropy": 5.3632200241088865,
"epoch": 2.4165726512351684,
"grad_norm": 1.1640625,
"learning_rate": 0.00044107410313884643,
"loss": 4.9338,
"mean_token_accuracy": 0.19829141497612,
"num_tokens": 53899452.0,
"step": 31060
},
{
"entropy": 5.444210004806519,
"epoch": 2.4169616806068857,
"grad_norm": 1.171875,
"learning_rate": 0.00044105540262830763,
"loss": 5.1228,
"mean_token_accuracy": 0.1890322148799896,
"num_tokens": 53908458.0,
"step": 31065
},
{
"entropy": 5.441821908950805,
"epoch": 2.4173507099786034,
"grad_norm": 1.125,
"learning_rate": 0.0004410366995981424,
"loss": 5.0543,
"mean_token_accuracy": 0.1921500414609909,
"num_tokens": 53917998.0,
"step": 31070
},
{
"entropy": 5.481869316101074,
"epoch": 2.417739739350321,
"grad_norm": 1.171875,
"learning_rate": 0.00044101799404863457,
"loss": 5.1124,
"mean_token_accuracy": 0.1879383772611618,
"num_tokens": 53926320.0,
"step": 31075
},
{
"entropy": 5.430712604522705,
"epoch": 2.4181287687220383,
"grad_norm": 1.171875,
"learning_rate": 0.0004409992859800679,
"loss": 5.0169,
"mean_token_accuracy": 0.18876795172691346,
"num_tokens": 53934723.0,
"step": 31080
},
{
"entropy": 5.4456737518310545,
"epoch": 2.418517798093756,
"grad_norm": 1.1953125,
"learning_rate": 0.0004409805753927263,
"loss": 5.1008,
"mean_token_accuracy": 0.19010978192090988,
"num_tokens": 53943125.0,
"step": 31085
},
{
"entropy": 5.45714111328125,
"epoch": 2.4189068274654737,
"grad_norm": 1.2109375,
"learning_rate": 0.0004409618622868936,
"loss": 5.0625,
"mean_token_accuracy": 0.1885081484913826,
"num_tokens": 53951781.0,
"step": 31090
},
{
"entropy": 5.479147672653198,
"epoch": 2.4192958568371914,
"grad_norm": 1.3515625,
"learning_rate": 0.00044094314666285385,
"loss": 5.0251,
"mean_token_accuracy": 0.19547722041606902,
"num_tokens": 53960556.0,
"step": 31095
},
{
"entropy": 5.339799165725708,
"epoch": 2.4196848862089086,
"grad_norm": 1.15625,
"learning_rate": 0.00044092442852089095,
"loss": 4.9153,
"mean_token_accuracy": 0.20224347710609436,
"num_tokens": 53969075.0,
"step": 31100
},
{
"entropy": 5.496554374694824,
"epoch": 2.4200739155806263,
"grad_norm": 1.3125,
"learning_rate": 0.0004409057078612889,
"loss": 5.2146,
"mean_token_accuracy": 0.18050424456596376,
"num_tokens": 53978203.0,
"step": 31105
},
{
"entropy": 5.488768196105957,
"epoch": 2.420462944952344,
"grad_norm": 1.25,
"learning_rate": 0.00044088698468433194,
"loss": 5.0112,
"mean_token_accuracy": 0.19432411044836045,
"num_tokens": 53986935.0,
"step": 31110
},
{
"entropy": 5.398905229568482,
"epoch": 2.4208519743240613,
"grad_norm": 1.2265625,
"learning_rate": 0.00044086825899030383,
"loss": 5.0332,
"mean_token_accuracy": 0.18574984073638917,
"num_tokens": 53996167.0,
"step": 31115
},
{
"entropy": 5.353693675994873,
"epoch": 2.421241003695779,
"grad_norm": 1.109375,
"learning_rate": 0.000440849530779489,
"loss": 5.0429,
"mean_token_accuracy": 0.19634633809328078,
"num_tokens": 54004722.0,
"step": 31120
},
{
"entropy": 5.382027339935303,
"epoch": 2.4216300330674967,
"grad_norm": 1.1640625,
"learning_rate": 0.0004408308000521715,
"loss": 4.9646,
"mean_token_accuracy": 0.20433289110660552,
"num_tokens": 54012660.0,
"step": 31125
},
{
"entropy": 5.479435396194458,
"epoch": 2.4220190624392144,
"grad_norm": 1.21875,
"learning_rate": 0.00044081206680863556,
"loss": 5.0706,
"mean_token_accuracy": 0.1906100481748581,
"num_tokens": 54021517.0,
"step": 31130
},
{
"entropy": 5.429105377197265,
"epoch": 2.4224080918109316,
"grad_norm": 1.2421875,
"learning_rate": 0.00044079333104916554,
"loss": 5.0239,
"mean_token_accuracy": 0.1974774032831192,
"num_tokens": 54030081.0,
"step": 31135
},
{
"entropy": 5.402469253540039,
"epoch": 2.4227971211826493,
"grad_norm": 1.203125,
"learning_rate": 0.0004407745927740454,
"loss": 4.9562,
"mean_token_accuracy": 0.20426964312791823,
"num_tokens": 54038214.0,
"step": 31140
},
{
"entropy": 5.319804096221924,
"epoch": 2.423186150554367,
"grad_norm": 1.1875,
"learning_rate": 0.0004407558519835598,
"loss": 4.9076,
"mean_token_accuracy": 0.19537126570940017,
"num_tokens": 54046813.0,
"step": 31145
},
{
"entropy": 5.3739540576934814,
"epoch": 2.4235751799260843,
"grad_norm": 1.1875,
"learning_rate": 0.00044073710867799295,
"loss": 5.0264,
"mean_token_accuracy": 0.19652935564517976,
"num_tokens": 54056095.0,
"step": 31150
},
{
"entropy": 5.356573057174683,
"epoch": 2.423964209297802,
"grad_norm": 1.296875,
"learning_rate": 0.0004407183628576293,
"loss": 4.9369,
"mean_token_accuracy": 0.20396465063095093,
"num_tokens": 54065173.0,
"step": 31155
},
{
"entropy": 5.469637870788574,
"epoch": 2.4243532386695197,
"grad_norm": 1.1015625,
"learning_rate": 0.0004406996145227532,
"loss": 5.1541,
"mean_token_accuracy": 0.1828441858291626,
"num_tokens": 54073858.0,
"step": 31160
},
{
"entropy": 5.487519979476929,
"epoch": 2.424742268041237,
"grad_norm": 1.109375,
"learning_rate": 0.0004406808636736492,
"loss": 5.0365,
"mean_token_accuracy": 0.1917970135807991,
"num_tokens": 54082129.0,
"step": 31165
},
{
"entropy": 5.425129699707031,
"epoch": 2.4251312974129546,
"grad_norm": 1.15625,
"learning_rate": 0.00044066211031060183,
"loss": 4.9583,
"mean_token_accuracy": 0.1943225994706154,
"num_tokens": 54090360.0,
"step": 31170
},
{
"entropy": 5.422593498229981,
"epoch": 2.4255203267846723,
"grad_norm": 1.1796875,
"learning_rate": 0.0004406433544338956,
"loss": 5.0303,
"mean_token_accuracy": 0.19573379158973694,
"num_tokens": 54098309.0,
"step": 31175
},
{
"entropy": 5.4258056640625,
"epoch": 2.4259093561563896,
"grad_norm": 1.1171875,
"learning_rate": 0.0004406245960438151,
"loss": 5.0096,
"mean_token_accuracy": 0.20394102185964585,
"num_tokens": 54106505.0,
"step": 31180
},
{
"entropy": 5.490012502670288,
"epoch": 2.4262983855281073,
"grad_norm": 1.140625,
"learning_rate": 0.000440605835140645,
"loss": 5.2013,
"mean_token_accuracy": 0.18369706124067306,
"num_tokens": 54115791.0,
"step": 31185
},
{
"entropy": 5.410346412658692,
"epoch": 2.426687414899825,
"grad_norm": 1.2109375,
"learning_rate": 0.0004405870717246699,
"loss": 4.9378,
"mean_token_accuracy": 0.1967812955379486,
"num_tokens": 54124187.0,
"step": 31190
},
{
"entropy": 5.43877215385437,
"epoch": 2.4270764442715427,
"grad_norm": 1.09375,
"learning_rate": 0.00044056830579617464,
"loss": 5.072,
"mean_token_accuracy": 0.19305126667022704,
"num_tokens": 54133566.0,
"step": 31195
},
{
"entropy": 5.439438676834106,
"epoch": 2.42746547364326,
"grad_norm": 1.203125,
"learning_rate": 0.00044054953735544376,
"loss": 4.9652,
"mean_token_accuracy": 0.1951311245560646,
"num_tokens": 54141698.0,
"step": 31200
},
{
"entropy": 5.466128778457642,
"epoch": 2.4278545030149776,
"grad_norm": 1.15625,
"learning_rate": 0.0004405307664027622,
"loss": 5.1074,
"mean_token_accuracy": 0.18902733623981477,
"num_tokens": 54150094.0,
"step": 31205
},
{
"entropy": 5.405302953720093,
"epoch": 2.4282435323866953,
"grad_norm": 1.1640625,
"learning_rate": 0.0004405119929384147,
"loss": 4.9791,
"mean_token_accuracy": 0.20001201033592225,
"num_tokens": 54158770.0,
"step": 31210
},
{
"entropy": 5.372152996063233,
"epoch": 2.4286325617584126,
"grad_norm": 1.2265625,
"learning_rate": 0.0004404932169626862,
"loss": 4.9665,
"mean_token_accuracy": 0.1956900328397751,
"num_tokens": 54166912.0,
"step": 31215
},
{
"entropy": 5.4162764072418215,
"epoch": 2.4290215911301303,
"grad_norm": 1.2109375,
"learning_rate": 0.0004404744384758615,
"loss": 5.0253,
"mean_token_accuracy": 0.19210139513015748,
"num_tokens": 54176027.0,
"step": 31220
},
{
"entropy": 5.455837917327881,
"epoch": 2.429410620501848,
"grad_norm": 1.171875,
"learning_rate": 0.0004404556574782256,
"loss": 4.9866,
"mean_token_accuracy": 0.20092392712831497,
"num_tokens": 54184116.0,
"step": 31225
},
{
"entropy": 5.363991546630859,
"epoch": 2.4297996498735657,
"grad_norm": 1.203125,
"learning_rate": 0.00044043687397006336,
"loss": 4.965,
"mean_token_accuracy": 0.20002925992012024,
"num_tokens": 54193043.0,
"step": 31230
},
{
"entropy": 5.364168119430542,
"epoch": 2.430188679245283,
"grad_norm": 1.1171875,
"learning_rate": 0.00044041808795166,
"loss": 5.0418,
"mean_token_accuracy": 0.19186788350343703,
"num_tokens": 54201953.0,
"step": 31235
},
{
"entropy": 5.43768572807312,
"epoch": 2.4305777086170006,
"grad_norm": 1.140625,
"learning_rate": 0.0004403992994233004,
"loss": 5.0351,
"mean_token_accuracy": 0.1989586979150772,
"num_tokens": 54210316.0,
"step": 31240
},
{
"entropy": 5.459669160842895,
"epoch": 2.4309667379887183,
"grad_norm": 1.2109375,
"learning_rate": 0.00044038050838526974,
"loss": 4.9638,
"mean_token_accuracy": 0.1976586565375328,
"num_tokens": 54218795.0,
"step": 31245
},
{
"entropy": 5.394702577590943,
"epoch": 2.4313557673604356,
"grad_norm": 1.1484375,
"learning_rate": 0.000440361714837853,
"loss": 5.0067,
"mean_token_accuracy": 0.18828006088733673,
"num_tokens": 54227455.0,
"step": 31250
},
{
"entropy": 5.352814674377441,
"epoch": 2.4317447967321533,
"grad_norm": 1.1171875,
"learning_rate": 0.0004403429187813355,
"loss": 5.0059,
"mean_token_accuracy": 0.19510615915060042,
"num_tokens": 54236124.0,
"step": 31255
},
{
"entropy": 5.379930591583252,
"epoch": 2.432133826103871,
"grad_norm": 1.328125,
"learning_rate": 0.0004403241202160024,
"loss": 4.9682,
"mean_token_accuracy": 0.1957891672849655,
"num_tokens": 54244638.0,
"step": 31260
},
{
"entropy": 5.40061616897583,
"epoch": 2.432522855475588,
"grad_norm": 1.1640625,
"learning_rate": 0.0004403053191421388,
"loss": 5.0039,
"mean_token_accuracy": 0.1957416281104088,
"num_tokens": 54253678.0,
"step": 31265
},
{
"entropy": 5.493869066238403,
"epoch": 2.432911884847306,
"grad_norm": 1.125,
"learning_rate": 0.0004402865155600302,
"loss": 5.1724,
"mean_token_accuracy": 0.19079241901636124,
"num_tokens": 54262414.0,
"step": 31270
},
{
"entropy": 5.326379680633545,
"epoch": 2.4333009142190236,
"grad_norm": 1.1171875,
"learning_rate": 0.00044026770946996183,
"loss": 4.8997,
"mean_token_accuracy": 0.20885610282421113,
"num_tokens": 54270597.0,
"step": 31275
},
{
"entropy": 5.346474313735962,
"epoch": 2.433689943590741,
"grad_norm": 1.1953125,
"learning_rate": 0.00044024890087221896,
"loss": 5.0139,
"mean_token_accuracy": 0.19746981263160707,
"num_tokens": 54279432.0,
"step": 31280
},
{
"entropy": 5.376286792755127,
"epoch": 2.4340789729624586,
"grad_norm": 1.1953125,
"learning_rate": 0.00044023008976708705,
"loss": 4.9169,
"mean_token_accuracy": 0.20057870596647262,
"num_tokens": 54287578.0,
"step": 31285
},
{
"entropy": 5.448392295837403,
"epoch": 2.4344680023341763,
"grad_norm": 1.1953125,
"learning_rate": 0.0004402112761548515,
"loss": 5.1189,
"mean_token_accuracy": 0.18612556010484696,
"num_tokens": 54296119.0,
"step": 31290
},
{
"entropy": 5.375394010543824,
"epoch": 2.434857031705894,
"grad_norm": 1.140625,
"learning_rate": 0.00044019246003579776,
"loss": 4.9043,
"mean_token_accuracy": 0.20132029354572295,
"num_tokens": 54304363.0,
"step": 31295
},
{
"entropy": 5.466589736938476,
"epoch": 2.435246061077611,
"grad_norm": 1.1953125,
"learning_rate": 0.0004401736414102115,
"loss": 5.0673,
"mean_token_accuracy": 0.19508639127016067,
"num_tokens": 54313672.0,
"step": 31300
},
{
"entropy": 5.45587477684021,
"epoch": 2.435635090449329,
"grad_norm": 1.234375,
"learning_rate": 0.000440154820278378,
"loss": 5.0315,
"mean_token_accuracy": 0.19967650771141052,
"num_tokens": 54322163.0,
"step": 31305
},
{
"entropy": 5.392179012298584,
"epoch": 2.4360241198210466,
"grad_norm": 1.1640625,
"learning_rate": 0.0004401359966405831,
"loss": 5.0055,
"mean_token_accuracy": 0.19965829700231552,
"num_tokens": 54331176.0,
"step": 31310
},
{
"entropy": 5.356971597671508,
"epoch": 2.436413149192764,
"grad_norm": 1.1796875,
"learning_rate": 0.00044011717049711216,
"loss": 5.0234,
"mean_token_accuracy": 0.19425858557224274,
"num_tokens": 54340404.0,
"step": 31315
},
{
"entropy": 5.427972316741943,
"epoch": 2.4368021785644816,
"grad_norm": 1.1171875,
"learning_rate": 0.00044009834184825103,
"loss": 4.963,
"mean_token_accuracy": 0.19791922718286514,
"num_tokens": 54349704.0,
"step": 31320
},
{
"entropy": 5.452508401870728,
"epoch": 2.4371912079361993,
"grad_norm": 1.2109375,
"learning_rate": 0.0004400795106942853,
"loss": 5.0641,
"mean_token_accuracy": 0.19491473883390426,
"num_tokens": 54358869.0,
"step": 31325
},
{
"entropy": 5.377355623245239,
"epoch": 2.437580237307917,
"grad_norm": 1.2109375,
"learning_rate": 0.00044006067703550083,
"loss": 4.9354,
"mean_token_accuracy": 0.20147132724523545,
"num_tokens": 54367918.0,
"step": 31330
},
{
"entropy": 5.372575807571411,
"epoch": 2.437969266679634,
"grad_norm": 1.21875,
"learning_rate": 0.0004400418408721833,
"loss": 5.0008,
"mean_token_accuracy": 0.1981264755129814,
"num_tokens": 54375798.0,
"step": 31335
},
{
"entropy": 5.4394513130187985,
"epoch": 2.438358296051352,
"grad_norm": 1.109375,
"learning_rate": 0.00044002300220461843,
"loss": 4.9661,
"mean_token_accuracy": 0.1978133961558342,
"num_tokens": 54384230.0,
"step": 31340
},
{
"entropy": 5.362436008453369,
"epoch": 2.4387473254230696,
"grad_norm": 1.15625,
"learning_rate": 0.0004400041610330922,
"loss": 5.0154,
"mean_token_accuracy": 0.1938861072063446,
"num_tokens": 54392444.0,
"step": 31345
},
{
"entropy": 5.405610609054565,
"epoch": 2.439136354794787,
"grad_norm": 1.1484375,
"learning_rate": 0.0004399853173578905,
"loss": 5.0171,
"mean_token_accuracy": 0.1949130743741989,
"num_tokens": 54400788.0,
"step": 31350
},
{
"entropy": 5.415535926818848,
"epoch": 2.4395253841665046,
"grad_norm": 1.0859375,
"learning_rate": 0.00043996647117929916,
"loss": 5.0434,
"mean_token_accuracy": 0.19495703428983688,
"num_tokens": 54409749.0,
"step": 31355
},
{
"entropy": 5.526915979385376,
"epoch": 2.4399144135382222,
"grad_norm": 1.09375,
"learning_rate": 0.0004399476224976043,
"loss": 5.1744,
"mean_token_accuracy": 0.186597740650177,
"num_tokens": 54419677.0,
"step": 31360
},
{
"entropy": 5.529601192474365,
"epoch": 2.44030344290994,
"grad_norm": 1.1953125,
"learning_rate": 0.00043992877131309165,
"loss": 5.1606,
"mean_token_accuracy": 0.19093016237020494,
"num_tokens": 54428821.0,
"step": 31365
},
{
"entropy": 5.443464994430542,
"epoch": 2.440692472281657,
"grad_norm": 1.2421875,
"learning_rate": 0.0004399099176260475,
"loss": 5.0683,
"mean_token_accuracy": 0.19344780147075652,
"num_tokens": 54437549.0,
"step": 31370
},
{
"entropy": 5.3834327220916744,
"epoch": 2.441081501653375,
"grad_norm": 1.1640625,
"learning_rate": 0.0004398910614367579,
"loss": 4.9217,
"mean_token_accuracy": 0.2021382063627243,
"num_tokens": 54446247.0,
"step": 31375
},
{
"entropy": 5.429372978210449,
"epoch": 2.441470531025092,
"grad_norm": 1.125,
"learning_rate": 0.00043987220274550876,
"loss": 5.0413,
"mean_token_accuracy": 0.1881820112466812,
"num_tokens": 54455191.0,
"step": 31380
},
{
"entropy": 5.4211362361907955,
"epoch": 2.44185956039681,
"grad_norm": 1.234375,
"learning_rate": 0.00043985334155258643,
"loss": 5.0398,
"mean_token_accuracy": 0.19728320986032485,
"num_tokens": 54463094.0,
"step": 31385
},
{
"entropy": 5.445676183700561,
"epoch": 2.4422485897685275,
"grad_norm": 1.203125,
"learning_rate": 0.000439834477858277,
"loss": 4.9711,
"mean_token_accuracy": 0.19550594091415405,
"num_tokens": 54471314.0,
"step": 31390
},
{
"entropy": 5.441308164596558,
"epoch": 2.4426376191402452,
"grad_norm": 1.25,
"learning_rate": 0.00043981561166286676,
"loss": 5.0998,
"mean_token_accuracy": 0.1882629230618477,
"num_tokens": 54480283.0,
"step": 31395
},
{
"entropy": 5.406192302703857,
"epoch": 2.4430266485119625,
"grad_norm": 1.1640625,
"learning_rate": 0.000439796742966642,
"loss": 4.9945,
"mean_token_accuracy": 0.19359051883220674,
"num_tokens": 54488588.0,
"step": 31400
},
{
"entropy": 5.436214447021484,
"epoch": 2.44341567788368,
"grad_norm": 1.171875,
"learning_rate": 0.00043977787176988884,
"loss": 4.9824,
"mean_token_accuracy": 0.2007366180419922,
"num_tokens": 54497532.0,
"step": 31405
},
{
"entropy": 5.5001793384552,
"epoch": 2.443804707255398,
"grad_norm": 1.2734375,
"learning_rate": 0.0004397589980728938,
"loss": 5.0812,
"mean_token_accuracy": 0.1921469509601593,
"num_tokens": 54506152.0,
"step": 31410
},
{
"entropy": 5.421291399002075,
"epoch": 2.444193736627115,
"grad_norm": 1.1484375,
"learning_rate": 0.00043974012187594324,
"loss": 5.0335,
"mean_token_accuracy": 0.1939214885234833,
"num_tokens": 54515674.0,
"step": 31415
},
{
"entropy": 5.2948326587677,
"epoch": 2.444582765998833,
"grad_norm": 1.2265625,
"learning_rate": 0.0004397212431793235,
"loss": 4.8394,
"mean_token_accuracy": 0.20641729980707169,
"num_tokens": 54523399.0,
"step": 31420
},
{
"entropy": 5.2834690570831295,
"epoch": 2.4449717953705505,
"grad_norm": 1.171875,
"learning_rate": 0.00043970236198332107,
"loss": 4.9776,
"mean_token_accuracy": 0.20009081512689592,
"num_tokens": 54532128.0,
"step": 31425
},
{
"entropy": 5.416804552078247,
"epoch": 2.4453608247422682,
"grad_norm": 1.1953125,
"learning_rate": 0.00043968347828822246,
"loss": 4.956,
"mean_token_accuracy": 0.1924523189663887,
"num_tokens": 54540474.0,
"step": 31430
},
{
"entropy": 5.425650882720947,
"epoch": 2.4457498541139855,
"grad_norm": 1.140625,
"learning_rate": 0.0004396645920943142,
"loss": 4.9537,
"mean_token_accuracy": 0.1967518597841263,
"num_tokens": 54549534.0,
"step": 31435
},
{
"entropy": 5.399157762527466,
"epoch": 2.446138883485703,
"grad_norm": 1.125,
"learning_rate": 0.0004396457034018828,
"loss": 5.0029,
"mean_token_accuracy": 0.1959057256579399,
"num_tokens": 54558071.0,
"step": 31440
},
{
"entropy": 5.450203371047974,
"epoch": 2.446527912857421,
"grad_norm": 1.125,
"learning_rate": 0.000439626812211215,
"loss": 5.075,
"mean_token_accuracy": 0.19242481589317323,
"num_tokens": 54565814.0,
"step": 31445
},
{
"entropy": 5.432679271697998,
"epoch": 2.446916942229138,
"grad_norm": 1.125,
"learning_rate": 0.00043960791852259735,
"loss": 5.0263,
"mean_token_accuracy": 0.18384938240051268,
"num_tokens": 54574911.0,
"step": 31450
},
{
"entropy": 5.372217798233033,
"epoch": 2.447305971600856,
"grad_norm": 1.203125,
"learning_rate": 0.0004395890223363165,
"loss": 5.0062,
"mean_token_accuracy": 0.19198755621910096,
"num_tokens": 54584129.0,
"step": 31455
},
{
"entropy": 5.395292139053344,
"epoch": 2.4476950009725735,
"grad_norm": 1.2109375,
"learning_rate": 0.00043957012365265915,
"loss": 4.9703,
"mean_token_accuracy": 0.19602918326854707,
"num_tokens": 54593203.0,
"step": 31460
},
{
"entropy": 5.415132904052735,
"epoch": 2.4480840303442912,
"grad_norm": 1.1875,
"learning_rate": 0.00043955122247191214,
"loss": 5.1034,
"mean_token_accuracy": 0.19607316255569457,
"num_tokens": 54601436.0,
"step": 31465
},
{
"entropy": 5.385945177078247,
"epoch": 2.4484730597160085,
"grad_norm": 1.140625,
"learning_rate": 0.0004395323187943623,
"loss": 5.0398,
"mean_token_accuracy": 0.1924893543124199,
"num_tokens": 54610550.0,
"step": 31470
},
{
"entropy": 5.398789358139038,
"epoch": 2.448862089087726,
"grad_norm": 1.1640625,
"learning_rate": 0.0004395134126202964,
"loss": 4.9482,
"mean_token_accuracy": 0.19702083021402358,
"num_tokens": 54619176.0,
"step": 31475
},
{
"entropy": 5.386159372329712,
"epoch": 2.449251118459444,
"grad_norm": 1.3671875,
"learning_rate": 0.0004394945039500012,
"loss": 4.9946,
"mean_token_accuracy": 0.19556522965431214,
"num_tokens": 54627259.0,
"step": 31480
},
{
"entropy": 5.379903507232666,
"epoch": 2.449640147831161,
"grad_norm": 1.2421875,
"learning_rate": 0.00043947559278376385,
"loss": 5.0046,
"mean_token_accuracy": 0.1868068605661392,
"num_tokens": 54635892.0,
"step": 31485
},
{
"entropy": 5.4704570293426515,
"epoch": 2.450029177202879,
"grad_norm": 1.0703125,
"learning_rate": 0.00043945667912187117,
"loss": 5.074,
"mean_token_accuracy": 0.1872391387820244,
"num_tokens": 54645360.0,
"step": 31490
},
{
"entropy": 5.417306423187256,
"epoch": 2.4504182065745965,
"grad_norm": 1.15625,
"learning_rate": 0.0004394377629646101,
"loss": 4.9957,
"mean_token_accuracy": 0.19780805855989456,
"num_tokens": 54654968.0,
"step": 31495
},
{
"entropy": 5.341229963302612,
"epoch": 2.4508072359463138,
"grad_norm": 1.125,
"learning_rate": 0.00043941884431226763,
"loss": 4.9119,
"mean_token_accuracy": 0.20868354588747023,
"num_tokens": 54663347.0,
"step": 31500
},
{
"entropy": 5.452194929122925,
"epoch": 2.4511962653180315,
"grad_norm": 1.1484375,
"learning_rate": 0.000439399923165131,
"loss": 5.0724,
"mean_token_accuracy": 0.19170394092798232,
"num_tokens": 54671744.0,
"step": 31505
},
{
"entropy": 5.410960626602173,
"epoch": 2.451585294689749,
"grad_norm": 1.21875,
"learning_rate": 0.0004393809995234872,
"loss": 4.9775,
"mean_token_accuracy": 0.19728672355413437,
"num_tokens": 54680098.0,
"step": 31510
},
{
"entropy": 5.411456108093262,
"epoch": 2.4519743240614664,
"grad_norm": 1.0703125,
"learning_rate": 0.0004393620733876233,
"loss": 5.0772,
"mean_token_accuracy": 0.19867285192012787,
"num_tokens": 54689513.0,
"step": 31515
},
{
"entropy": 5.444696235656738,
"epoch": 2.452363353433184,
"grad_norm": 1.1328125,
"learning_rate": 0.0004393431447578267,
"loss": 5.0367,
"mean_token_accuracy": 0.20275148749351501,
"num_tokens": 54698079.0,
"step": 31520
},
{
"entropy": 5.429082250595092,
"epoch": 2.452752382804902,
"grad_norm": 1.1640625,
"learning_rate": 0.00043932421363438427,
"loss": 4.9603,
"mean_token_accuracy": 0.20186777114868165,
"num_tokens": 54706956.0,
"step": 31525
},
{
"entropy": 5.288338041305542,
"epoch": 2.4531414121766195,
"grad_norm": 1.1796875,
"learning_rate": 0.0004393052800175835,
"loss": 5.0339,
"mean_token_accuracy": 0.19311471581459044,
"num_tokens": 54716131.0,
"step": 31530
},
{
"entropy": 5.373870325088501,
"epoch": 2.4535304415483368,
"grad_norm": 1.1171875,
"learning_rate": 0.00043928634390771166,
"loss": 4.954,
"mean_token_accuracy": 0.19832768887281418,
"num_tokens": 54725080.0,
"step": 31535
},
{
"entropy": 5.430013513565063,
"epoch": 2.4539194709200545,
"grad_norm": 1.1953125,
"learning_rate": 0.00043926740530505603,
"loss": 4.9868,
"mean_token_accuracy": 0.1958334594964981,
"num_tokens": 54733273.0,
"step": 31540
},
{
"entropy": 5.425298166275025,
"epoch": 2.454308500291772,
"grad_norm": 1.09375,
"learning_rate": 0.000439248464209904,
"loss": 5.0402,
"mean_token_accuracy": 0.1899419143795967,
"num_tokens": 54742359.0,
"step": 31545
},
{
"entropy": 5.42931981086731,
"epoch": 2.4546975296634894,
"grad_norm": 1.2265625,
"learning_rate": 0.000439229520622543,
"loss": 5.0404,
"mean_token_accuracy": 0.18734922558069228,
"num_tokens": 54750360.0,
"step": 31550
},
{
"entropy": 5.392021942138672,
"epoch": 2.455086559035207,
"grad_norm": 1.2421875,
"learning_rate": 0.0004392105745432603,
"loss": 4.9837,
"mean_token_accuracy": 0.19874288141727448,
"num_tokens": 54758663.0,
"step": 31555
},
{
"entropy": 5.392559576034546,
"epoch": 2.455475588406925,
"grad_norm": 1.0078125,
"learning_rate": 0.0004391916259723436,
"loss": 4.9805,
"mean_token_accuracy": 0.2016999140381813,
"num_tokens": 54767578.0,
"step": 31560
},
{
"entropy": 5.473572635650635,
"epoch": 2.4558646177786425,
"grad_norm": 1.2265625,
"learning_rate": 0.00043917267491008023,
"loss": 5.1496,
"mean_token_accuracy": 0.18724444061517714,
"num_tokens": 54776651.0,
"step": 31565
},
{
"entropy": 5.432928848266601,
"epoch": 2.4562536471503598,
"grad_norm": 1.2421875,
"learning_rate": 0.0004391537213567579,
"loss": 5.0561,
"mean_token_accuracy": 0.18541578948497772,
"num_tokens": 54784865.0,
"step": 31570
},
{
"entropy": 5.344668006896972,
"epoch": 2.4566426765220775,
"grad_norm": 1.1484375,
"learning_rate": 0.0004391347653126641,
"loss": 4.8923,
"mean_token_accuracy": 0.19960398972034454,
"num_tokens": 54794367.0,
"step": 31575
},
{
"entropy": 5.305246019363404,
"epoch": 2.457031705893795,
"grad_norm": 1.2265625,
"learning_rate": 0.00043911580677808646,
"loss": 4.9057,
"mean_token_accuracy": 0.20029204040765763,
"num_tokens": 54802606.0,
"step": 31580
},
{
"entropy": 5.387216281890869,
"epoch": 2.4574207352655124,
"grad_norm": 1.171875,
"learning_rate": 0.00043909684575331264,
"loss": 4.952,
"mean_token_accuracy": 0.203133924305439,
"num_tokens": 54812207.0,
"step": 31585
},
{
"entropy": 5.428878402709961,
"epoch": 2.45780976463723,
"grad_norm": 1.25,
"learning_rate": 0.0004390778822386304,
"loss": 4.9956,
"mean_token_accuracy": 0.20123641937971115,
"num_tokens": 54821047.0,
"step": 31590
},
{
"entropy": 5.510456323623657,
"epoch": 2.458198794008948,
"grad_norm": 1.109375,
"learning_rate": 0.00043905891623432754,
"loss": 5.1451,
"mean_token_accuracy": 0.1864195227622986,
"num_tokens": 54829849.0,
"step": 31595
},
{
"entropy": 5.391123580932617,
"epoch": 2.458587823380665,
"grad_norm": 1.2109375,
"learning_rate": 0.00043903994774069165,
"loss": 5.0954,
"mean_token_accuracy": 0.188053460419178,
"num_tokens": 54838690.0,
"step": 31600
},
{
"entropy": 5.437462329864502,
"epoch": 2.4589768527523828,
"grad_norm": 1.15625,
"learning_rate": 0.0004390209767580107,
"loss": 5.0307,
"mean_token_accuracy": 0.19463216960430146,
"num_tokens": 54847795.0,
"step": 31605
},
{
"entropy": 5.4592711448669435,
"epoch": 2.4593658821241005,
"grad_norm": 1.078125,
"learning_rate": 0.0004390020032865725,
"loss": 4.9514,
"mean_token_accuracy": 0.20548547059297562,
"num_tokens": 54856676.0,
"step": 31610
},
{
"entropy": 5.390367221832276,
"epoch": 2.4597549114958177,
"grad_norm": 1.1953125,
"learning_rate": 0.0004389830273266649,
"loss": 4.9823,
"mean_token_accuracy": 0.19824273586273194,
"num_tokens": 54865177.0,
"step": 31615
},
{
"entropy": 5.35674557685852,
"epoch": 2.4601439408675354,
"grad_norm": 1.109375,
"learning_rate": 0.00043896404887857596,
"loss": 4.9507,
"mean_token_accuracy": 0.1900181069970131,
"num_tokens": 54872921.0,
"step": 31620
},
{
"entropy": 5.3780323505401615,
"epoch": 2.460532970239253,
"grad_norm": 1.2109375,
"learning_rate": 0.0004389450679425935,
"loss": 5.0865,
"mean_token_accuracy": 0.1900602549314499,
"num_tokens": 54882045.0,
"step": 31625
},
{
"entropy": 5.49856915473938,
"epoch": 2.460921999610971,
"grad_norm": 1.15625,
"learning_rate": 0.0004389260845190055,
"loss": 5.0366,
"mean_token_accuracy": 0.1943578079342842,
"num_tokens": 54890647.0,
"step": 31630
},
{
"entropy": 5.400425767898559,
"epoch": 2.461311028982688,
"grad_norm": 1.140625,
"learning_rate": 0.00043890709860810014,
"loss": 5.0238,
"mean_token_accuracy": 0.19285185188055037,
"num_tokens": 54898958.0,
"step": 31635
},
{
"entropy": 5.386109113693237,
"epoch": 2.4617000583544058,
"grad_norm": 1.109375,
"learning_rate": 0.00043888811021016545,
"loss": 5.0685,
"mean_token_accuracy": 0.18876637518405914,
"num_tokens": 54907329.0,
"step": 31640
},
{
"entropy": 5.401598644256592,
"epoch": 2.4620890877261234,
"grad_norm": 1.0859375,
"learning_rate": 0.00043886911932548953,
"loss": 5.0569,
"mean_token_accuracy": 0.20338728427886962,
"num_tokens": 54916093.0,
"step": 31645
},
{
"entropy": 5.472186517715454,
"epoch": 2.4624781170978407,
"grad_norm": 1.140625,
"learning_rate": 0.0004388501259543605,
"loss": 5.0589,
"mean_token_accuracy": 0.18994611650705337,
"num_tokens": 54925030.0,
"step": 31650
},
{
"entropy": 5.4434614181518555,
"epoch": 2.4628671464695584,
"grad_norm": 1.203125,
"learning_rate": 0.0004388311300970667,
"loss": 4.9921,
"mean_token_accuracy": 0.1909564346075058,
"num_tokens": 54933719.0,
"step": 31655
},
{
"entropy": 5.419138097763062,
"epoch": 2.463256175841276,
"grad_norm": 1.203125,
"learning_rate": 0.0004388121317538962,
"loss": 5.0991,
"mean_token_accuracy": 0.1892107382416725,
"num_tokens": 54941533.0,
"step": 31660
},
{
"entropy": 5.341114139556884,
"epoch": 2.463645205212994,
"grad_norm": 1.2109375,
"learning_rate": 0.0004387931309251374,
"loss": 4.9574,
"mean_token_accuracy": 0.2051786243915558,
"num_tokens": 54949819.0,
"step": 31665
},
{
"entropy": 5.404318809509277,
"epoch": 2.464034234584711,
"grad_norm": 1.1328125,
"learning_rate": 0.0004387741276110785,
"loss": 5.0634,
"mean_token_accuracy": 0.19188826084136962,
"num_tokens": 54959199.0,
"step": 31670
},
{
"entropy": 5.460726356506347,
"epoch": 2.4644232639564287,
"grad_norm": 1.1875,
"learning_rate": 0.00043875512181200784,
"loss": 5.075,
"mean_token_accuracy": 0.19334174394607545,
"num_tokens": 54967742.0,
"step": 31675
},
{
"entropy": 5.4955236434936525,
"epoch": 2.4648122933281464,
"grad_norm": 1.1953125,
"learning_rate": 0.0004387361135282139,
"loss": 5.1493,
"mean_token_accuracy": 0.18444453775882722,
"num_tokens": 54976419.0,
"step": 31680
},
{
"entropy": 5.4501996517181395,
"epoch": 2.4652013226998637,
"grad_norm": 1.1875,
"learning_rate": 0.00043871710275998507,
"loss": 5.0073,
"mean_token_accuracy": 0.19629710614681245,
"num_tokens": 54984975.0,
"step": 31685
},
{
"entropy": 5.44846773147583,
"epoch": 2.4655903520715814,
"grad_norm": 1.15625,
"learning_rate": 0.0004386980895076097,
"loss": 5.0417,
"mean_token_accuracy": 0.19153044521808624,
"num_tokens": 54993746.0,
"step": 31690
},
{
"entropy": 5.413451194763184,
"epoch": 2.465979381443299,
"grad_norm": 1.140625,
"learning_rate": 0.00043867907377137646,
"loss": 4.9173,
"mean_token_accuracy": 0.2067538395524025,
"num_tokens": 55002130.0,
"step": 31695
},
{
"entropy": 5.3680178165435795,
"epoch": 2.4663684108150163,
"grad_norm": 1.171875,
"learning_rate": 0.00043866005555157376,
"loss": 5.0709,
"mean_token_accuracy": 0.19386010617017746,
"num_tokens": 55010790.0,
"step": 31700
},
{
"entropy": 5.4195287227630615,
"epoch": 2.466757440186734,
"grad_norm": 1.15625,
"learning_rate": 0.0004386410348484903,
"loss": 5.0081,
"mean_token_accuracy": 0.1948359876871109,
"num_tokens": 55019542.0,
"step": 31705
},
{
"entropy": 5.325864648818969,
"epoch": 2.4671464695584517,
"grad_norm": 1.1640625,
"learning_rate": 0.0004386220116624145,
"loss": 4.8675,
"mean_token_accuracy": 0.2030348613858223,
"num_tokens": 55029230.0,
"step": 31710
},
{
"entropy": 5.352613353729248,
"epoch": 2.467535498930169,
"grad_norm": 1.0859375,
"learning_rate": 0.00043860298599363506,
"loss": 4.9841,
"mean_token_accuracy": 0.196756049990654,
"num_tokens": 55037371.0,
"step": 31715
},
{
"entropy": 5.324502658843994,
"epoch": 2.4679245283018867,
"grad_norm": 1.140625,
"learning_rate": 0.0004385839578424408,
"loss": 4.9824,
"mean_token_accuracy": 0.19824841469526291,
"num_tokens": 55046022.0,
"step": 31720
},
{
"entropy": 5.409523296356201,
"epoch": 2.4683135576736044,
"grad_norm": 1.265625,
"learning_rate": 0.00043856492720912037,
"loss": 4.962,
"mean_token_accuracy": 0.20505266934633254,
"num_tokens": 55054713.0,
"step": 31725
},
{
"entropy": 5.2610764503479,
"epoch": 2.468702587045322,
"grad_norm": 1.09375,
"learning_rate": 0.0004385458940939624,
"loss": 4.9442,
"mean_token_accuracy": 0.20973241031169892,
"num_tokens": 55064317.0,
"step": 31730
},
{
"entropy": 5.357292890548706,
"epoch": 2.4690916164170393,
"grad_norm": 1.1015625,
"learning_rate": 0.0004385268584972559,
"loss": 5.0134,
"mean_token_accuracy": 0.20058398246765136,
"num_tokens": 55072700.0,
"step": 31735
},
{
"entropy": 5.472076559066773,
"epoch": 2.469480645788757,
"grad_norm": 1.21875,
"learning_rate": 0.0004385078204192896,
"loss": 5.1068,
"mean_token_accuracy": 0.1919834941625595,
"num_tokens": 55081794.0,
"step": 31740
},
{
"entropy": 5.513136386871338,
"epoch": 2.4698696751604747,
"grad_norm": 1.109375,
"learning_rate": 0.0004384887798603523,
"loss": 5.1075,
"mean_token_accuracy": 0.19148558229207993,
"num_tokens": 55090665.0,
"step": 31745
},
{
"entropy": 5.439836597442627,
"epoch": 2.470258704532192,
"grad_norm": 1.140625,
"learning_rate": 0.000438469736820733,
"loss": 5.0092,
"mean_token_accuracy": 0.1961147055029869,
"num_tokens": 55099306.0,
"step": 31750
},
{
"entropy": 5.416819095611572,
"epoch": 2.4706477339039097,
"grad_norm": 1.125,
"learning_rate": 0.00043845069130072067,
"loss": 5.0827,
"mean_token_accuracy": 0.1913134440779686,
"num_tokens": 55108420.0,
"step": 31755
},
{
"entropy": 5.477166748046875,
"epoch": 2.4710367632756274,
"grad_norm": 1.203125,
"learning_rate": 0.0004384316433006043,
"loss": 5.0027,
"mean_token_accuracy": 0.19205942004919052,
"num_tokens": 55116629.0,
"step": 31760
},
{
"entropy": 5.393901252746582,
"epoch": 2.471425792647345,
"grad_norm": 1.1328125,
"learning_rate": 0.00043841259282067276,
"loss": 5.0274,
"mean_token_accuracy": 0.19324393421411515,
"num_tokens": 55125469.0,
"step": 31765
},
{
"entropy": 5.397736883163452,
"epoch": 2.4718148220190623,
"grad_norm": 1.1953125,
"learning_rate": 0.00043839353986121533,
"loss": 5.0277,
"mean_token_accuracy": 0.19089193642139435,
"num_tokens": 55134194.0,
"step": 31770
},
{
"entropy": 5.473677730560302,
"epoch": 2.47220385139078,
"grad_norm": 1.140625,
"learning_rate": 0.0004383744844225209,
"loss": 5.0695,
"mean_token_accuracy": 0.18959053605794907,
"num_tokens": 55142931.0,
"step": 31775
},
{
"entropy": 5.4274650573730465,
"epoch": 2.4725928807624977,
"grad_norm": 1.171875,
"learning_rate": 0.00043835542650487875,
"loss": 5.0565,
"mean_token_accuracy": 0.19448353499174117,
"num_tokens": 55152331.0,
"step": 31780
},
{
"entropy": 5.371088647842408,
"epoch": 2.472981910134215,
"grad_norm": 1.3125,
"learning_rate": 0.0004383363661085781,
"loss": 5.0192,
"mean_token_accuracy": 0.1962620958685875,
"num_tokens": 55160860.0,
"step": 31785
},
{
"entropy": 5.429840326309204,
"epoch": 2.4733709395059327,
"grad_norm": 1.1328125,
"learning_rate": 0.0004383173032339079,
"loss": 5.1012,
"mean_token_accuracy": 0.1875933140516281,
"num_tokens": 55169891.0,
"step": 31790
},
{
"entropy": 5.362275838851929,
"epoch": 2.4737599688776504,
"grad_norm": 1.0859375,
"learning_rate": 0.0004382982378811577,
"loss": 4.9995,
"mean_token_accuracy": 0.19984019845724105,
"num_tokens": 55178283.0,
"step": 31795
},
{
"entropy": 5.469861030578613,
"epoch": 2.474148998249368,
"grad_norm": 1.1953125,
"learning_rate": 0.0004382791700506166,
"loss": 5.0633,
"mean_token_accuracy": 0.18660385459661483,
"num_tokens": 55186683.0,
"step": 31800
},
{
"entropy": 5.357827091217041,
"epoch": 2.4745380276210853,
"grad_norm": 1.2265625,
"learning_rate": 0.000438260099742574,
"loss": 4.9045,
"mean_token_accuracy": 0.2043865904211998,
"num_tokens": 55194758.0,
"step": 31805
},
{
"entropy": 5.335516309738159,
"epoch": 2.474927056992803,
"grad_norm": 1.1640625,
"learning_rate": 0.0004382410269573192,
"loss": 4.9655,
"mean_token_accuracy": 0.20361442416906356,
"num_tokens": 55203171.0,
"step": 31810
},
{
"entropy": 5.443462324142456,
"epoch": 2.4753160863645203,
"grad_norm": 1.21875,
"learning_rate": 0.00043822195169514167,
"loss": 5.0185,
"mean_token_accuracy": 0.18922071903944016,
"num_tokens": 55210942.0,
"step": 31815
},
{
"entropy": 5.418969678878784,
"epoch": 2.475705115736238,
"grad_norm": 1.140625,
"learning_rate": 0.00043820287395633086,
"loss": 5.0964,
"mean_token_accuracy": 0.18942733407020568,
"num_tokens": 55219937.0,
"step": 31820
},
{
"entropy": 5.465828704833984,
"epoch": 2.4760941451079557,
"grad_norm": 1.109375,
"learning_rate": 0.0004381837937411761,
"loss": 5.0759,
"mean_token_accuracy": 0.1958286300301552,
"num_tokens": 55229461.0,
"step": 31825
},
{
"entropy": 5.35172929763794,
"epoch": 2.4764831744796734,
"grad_norm": 1.2265625,
"learning_rate": 0.00043816471104996706,
"loss": 4.9257,
"mean_token_accuracy": 0.19760338366031646,
"num_tokens": 55237910.0,
"step": 31830
},
{
"entropy": 5.358775234222412,
"epoch": 2.4768722038513906,
"grad_norm": 1.125,
"learning_rate": 0.0004381456258829933,
"loss": 5.0004,
"mean_token_accuracy": 0.19409747719764708,
"num_tokens": 55246131.0,
"step": 31835
},
{
"entropy": 5.392410326004028,
"epoch": 2.4772612332231083,
"grad_norm": 1.1875,
"learning_rate": 0.00043812653824054426,
"loss": 5.0147,
"mean_token_accuracy": 0.19725086241960527,
"num_tokens": 55254677.0,
"step": 31840
},
{
"entropy": 5.400393295288086,
"epoch": 2.477650262594826,
"grad_norm": 1.21875,
"learning_rate": 0.0004381074481229097,
"loss": 5.0072,
"mean_token_accuracy": 0.1921542152762413,
"num_tokens": 55263496.0,
"step": 31845
},
{
"entropy": 5.360985136032104,
"epoch": 2.4780392919665433,
"grad_norm": 1.140625,
"learning_rate": 0.0004380883555303791,
"loss": 4.9324,
"mean_token_accuracy": 0.20014408826828003,
"num_tokens": 55272614.0,
"step": 31850
},
{
"entropy": 5.372060537338257,
"epoch": 2.478428321338261,
"grad_norm": 1.171875,
"learning_rate": 0.0004380692604632424,
"loss": 4.9718,
"mean_token_accuracy": 0.19297547787427902,
"num_tokens": 55281595.0,
"step": 31855
},
{
"entropy": 5.515956974029541,
"epoch": 2.4788173507099787,
"grad_norm": 1.078125,
"learning_rate": 0.00043805016292178923,
"loss": 5.1061,
"mean_token_accuracy": 0.19527381360530854,
"num_tokens": 55291089.0,
"step": 31860
},
{
"entropy": 5.366569519042969,
"epoch": 2.4792063800816964,
"grad_norm": 1.140625,
"learning_rate": 0.0004380310629063094,
"loss": 4.8802,
"mean_token_accuracy": 0.20865502208471298,
"num_tokens": 55299505.0,
"step": 31865
},
{
"entropy": 5.43313307762146,
"epoch": 2.4795954094534136,
"grad_norm": 1.2578125,
"learning_rate": 0.0004380119604170925,
"loss": 5.0699,
"mean_token_accuracy": 0.19181161224842072,
"num_tokens": 55307383.0,
"step": 31870
},
{
"entropy": 5.464498805999756,
"epoch": 2.4799844388251313,
"grad_norm": 1.2109375,
"learning_rate": 0.00043799285545442876,
"loss": 5.0777,
"mean_token_accuracy": 0.185017953813076,
"num_tokens": 55316312.0,
"step": 31875
},
{
"entropy": 5.397231912612915,
"epoch": 2.480373468196849,
"grad_norm": 1.1015625,
"learning_rate": 0.0004379737480186078,
"loss": 5.102,
"mean_token_accuracy": 0.19390355199575424,
"num_tokens": 55325818.0,
"step": 31880
},
{
"entropy": 5.3838049411773685,
"epoch": 2.4807624975685663,
"grad_norm": 1.046875,
"learning_rate": 0.00043795463810991956,
"loss": 5.0596,
"mean_token_accuracy": 0.18493707925081254,
"num_tokens": 55334641.0,
"step": 31885
},
{
"entropy": 5.474783563613892,
"epoch": 2.481151526940284,
"grad_norm": 1.1796875,
"learning_rate": 0.0004379355257286541,
"loss": 5.0276,
"mean_token_accuracy": 0.192593814432621,
"num_tokens": 55343109.0,
"step": 31890
},
{
"entropy": 5.373204517364502,
"epoch": 2.4815405563120017,
"grad_norm": 1.140625,
"learning_rate": 0.00043791641087510136,
"loss": 4.9776,
"mean_token_accuracy": 0.2059226557612419,
"num_tokens": 55351832.0,
"step": 31895
},
{
"entropy": 5.411711931228638,
"epoch": 2.4819295856837194,
"grad_norm": 1.2421875,
"learning_rate": 0.0004378972935495514,
"loss": 5.0625,
"mean_token_accuracy": 0.19590418338775634,
"num_tokens": 55361688.0,
"step": 31900
},
{
"entropy": 5.421454572677613,
"epoch": 2.4823186150554366,
"grad_norm": 1.1953125,
"learning_rate": 0.0004378781737522943,
"loss": 5.0235,
"mean_token_accuracy": 0.1881646990776062,
"num_tokens": 55370572.0,
"step": 31905
},
{
"entropy": 5.424241161346435,
"epoch": 2.4827076444271543,
"grad_norm": 1.21875,
"learning_rate": 0.00043785905148362007,
"loss": 4.9974,
"mean_token_accuracy": 0.2002405896782875,
"num_tokens": 55379134.0,
"step": 31910
},
{
"entropy": 5.37305097579956,
"epoch": 2.483096673798872,
"grad_norm": 1.171875,
"learning_rate": 0.00043783992674381903,
"loss": 4.9564,
"mean_token_accuracy": 0.20215173065662384,
"num_tokens": 55387312.0,
"step": 31915
},
{
"entropy": 5.2777087688446045,
"epoch": 2.4834857031705893,
"grad_norm": 1.1953125,
"learning_rate": 0.00043782079953318126,
"loss": 4.8836,
"mean_token_accuracy": 0.2041994348168373,
"num_tokens": 55396208.0,
"step": 31920
},
{
"entropy": 5.385955905914306,
"epoch": 2.483874732542307,
"grad_norm": 1.09375,
"learning_rate": 0.0004378016698519971,
"loss": 5.0172,
"mean_token_accuracy": 0.19913000017404556,
"num_tokens": 55404142.0,
"step": 31925
},
{
"entropy": 5.3742852210998535,
"epoch": 2.4842637619140246,
"grad_norm": 1.2109375,
"learning_rate": 0.00043778253770055666,
"loss": 4.9264,
"mean_token_accuracy": 0.20353603065013887,
"num_tokens": 55412227.0,
"step": 31930
},
{
"entropy": 5.342798662185669,
"epoch": 2.484652791285742,
"grad_norm": 1.15625,
"learning_rate": 0.00043776340307915033,
"loss": 4.9405,
"mean_token_accuracy": 0.19796893149614334,
"num_tokens": 55420566.0,
"step": 31935
},
{
"entropy": 5.38083963394165,
"epoch": 2.4850418206574596,
"grad_norm": 1.21875,
"learning_rate": 0.0004377442659880684,
"loss": 4.9209,
"mean_token_accuracy": 0.2090641051530838,
"num_tokens": 55429456.0,
"step": 31940
},
{
"entropy": 5.327810335159302,
"epoch": 2.4854308500291773,
"grad_norm": 1.25,
"learning_rate": 0.0004377251264276013,
"loss": 4.9318,
"mean_token_accuracy": 0.20317727327346802,
"num_tokens": 55437607.0,
"step": 31945
},
{
"entropy": 5.312427997589111,
"epoch": 2.4858198794008945,
"grad_norm": 1.09375,
"learning_rate": 0.00043770598439803936,
"loss": 4.9491,
"mean_token_accuracy": 0.20227609127759932,
"num_tokens": 55446654.0,
"step": 31950
},
{
"entropy": 5.394081115722656,
"epoch": 2.4862089087726122,
"grad_norm": 1.1875,
"learning_rate": 0.00043768683989967304,
"loss": 5.0271,
"mean_token_accuracy": 0.19802693873643876,
"num_tokens": 55454963.0,
"step": 31955
},
{
"entropy": 5.375313425064087,
"epoch": 2.48659793814433,
"grad_norm": 1.15625,
"learning_rate": 0.00043766769293279294,
"loss": 4.9715,
"mean_token_accuracy": 0.1918281078338623,
"num_tokens": 55463259.0,
"step": 31960
},
{
"entropy": 5.315908765792846,
"epoch": 2.4869869675160476,
"grad_norm": 1.140625,
"learning_rate": 0.00043764854349768957,
"loss": 4.9653,
"mean_token_accuracy": 0.19214270859956742,
"num_tokens": 55472390.0,
"step": 31965
},
{
"entropy": 5.430684614181518,
"epoch": 2.487375996887765,
"grad_norm": 1.265625,
"learning_rate": 0.00043762939159465333,
"loss": 5.059,
"mean_token_accuracy": 0.18985690474510192,
"num_tokens": 55480821.0,
"step": 31970
},
{
"entropy": 5.476782655715942,
"epoch": 2.4877650262594826,
"grad_norm": 1.140625,
"learning_rate": 0.00043761023722397495,
"loss": 5.0258,
"mean_token_accuracy": 0.19679305106401443,
"num_tokens": 55489270.0,
"step": 31975
},
{
"entropy": 5.298780632019043,
"epoch": 2.4881540556312003,
"grad_norm": 1.1796875,
"learning_rate": 0.000437591080385945,
"loss": 4.9678,
"mean_token_accuracy": 0.20382864624261857,
"num_tokens": 55497811.0,
"step": 31980
},
{
"entropy": 5.340275287628174,
"epoch": 2.4885430850029175,
"grad_norm": 1.203125,
"learning_rate": 0.0004375719210808543,
"loss": 4.9206,
"mean_token_accuracy": 0.19528032541275026,
"num_tokens": 55507068.0,
"step": 31985
},
{
"entropy": 5.375517272949219,
"epoch": 2.4889321143746352,
"grad_norm": 1.2421875,
"learning_rate": 0.0004375527593089934,
"loss": 4.9117,
"mean_token_accuracy": 0.2025772288441658,
"num_tokens": 55515922.0,
"step": 31990
},
{
"entropy": 5.3581703186035154,
"epoch": 2.489321143746353,
"grad_norm": 1.078125,
"learning_rate": 0.0004375335950706531,
"loss": 4.9727,
"mean_token_accuracy": 0.19381050318479537,
"num_tokens": 55524839.0,
"step": 31995
},
{
"entropy": 5.223787307739258,
"epoch": 2.4897101731180706,
"grad_norm": 1.109375,
"learning_rate": 0.0004375144283661242,
"loss": 4.8675,
"mean_token_accuracy": 0.20274682939052582,
"num_tokens": 55534426.0,
"step": 32000
},
{
"entropy": 5.370130443572998,
"epoch": 2.490099202489788,
"grad_norm": 1.1171875,
"learning_rate": 0.0004374952591956975,
"loss": 5.0059,
"mean_token_accuracy": 0.19730344116687776,
"num_tokens": 55542773.0,
"step": 32005
},
{
"entropy": 5.438336944580078,
"epoch": 2.4904882318615056,
"grad_norm": 1.140625,
"learning_rate": 0.00043747608755966396,
"loss": 4.9817,
"mean_token_accuracy": 0.1988343045115471,
"num_tokens": 55551582.0,
"step": 32010
},
{
"entropy": 5.477785587310791,
"epoch": 2.4908772612332233,
"grad_norm": 1.15625,
"learning_rate": 0.0004374569134583143,
"loss": 5.1239,
"mean_token_accuracy": 0.18770601898431777,
"num_tokens": 55561067.0,
"step": 32015
},
{
"entropy": 5.37761287689209,
"epoch": 2.4912662906049405,
"grad_norm": 1.203125,
"learning_rate": 0.0004374377368919396,
"loss": 4.9664,
"mean_token_accuracy": 0.20275555402040482,
"num_tokens": 55569677.0,
"step": 32020
},
{
"entropy": 5.468303108215332,
"epoch": 2.4916553199766582,
"grad_norm": 1.125,
"learning_rate": 0.00043741855786083085,
"loss": 5.1617,
"mean_token_accuracy": 0.18644483536481857,
"num_tokens": 55578391.0,
"step": 32025
},
{
"entropy": 5.466739273071289,
"epoch": 2.492044349348376,
"grad_norm": 1.109375,
"learning_rate": 0.00043739937636527894,
"loss": 5.0601,
"mean_token_accuracy": 0.19299477338790894,
"num_tokens": 55587074.0,
"step": 32030
},
{
"entropy": 5.441026020050049,
"epoch": 2.492433378720093,
"grad_norm": 1.1640625,
"learning_rate": 0.00043738019240557494,
"loss": 4.9932,
"mean_token_accuracy": 0.1920644149184227,
"num_tokens": 55596944.0,
"step": 32035
},
{
"entropy": 5.427092552185059,
"epoch": 2.492822408091811,
"grad_norm": 1.1640625,
"learning_rate": 0.00043736100598201,
"loss": 4.9841,
"mean_token_accuracy": 0.1986925184726715,
"num_tokens": 55605763.0,
"step": 32040
},
{
"entropy": 5.339112091064453,
"epoch": 2.4932114374635286,
"grad_norm": 1.078125,
"learning_rate": 0.0004373418170948752,
"loss": 5.0401,
"mean_token_accuracy": 0.18951776176691054,
"num_tokens": 55614693.0,
"step": 32045
},
{
"entropy": 5.5140156745910645,
"epoch": 2.493600466835246,
"grad_norm": 1.109375,
"learning_rate": 0.0004373226257444617,
"loss": 5.1827,
"mean_token_accuracy": 0.18380513340234755,
"num_tokens": 55623520.0,
"step": 32050
},
{
"entropy": 5.417255783081055,
"epoch": 2.4939894962069635,
"grad_norm": 1.234375,
"learning_rate": 0.0004373034319310608,
"loss": 4.9728,
"mean_token_accuracy": 0.2006630852818489,
"num_tokens": 55631818.0,
"step": 32055
},
{
"entropy": 5.4602076530456545,
"epoch": 2.4943785255786812,
"grad_norm": 1.25,
"learning_rate": 0.00043728423565496367,
"loss": 5.1028,
"mean_token_accuracy": 0.19003146439790725,
"num_tokens": 55641388.0,
"step": 32060
},
{
"entropy": 5.3405262470245365,
"epoch": 2.494767554950399,
"grad_norm": 1.0390625,
"learning_rate": 0.0004372650369164615,
"loss": 5.006,
"mean_token_accuracy": 0.20108869522809983,
"num_tokens": 55650374.0,
"step": 32065
},
{
"entropy": 5.41640305519104,
"epoch": 2.495156584322116,
"grad_norm": 1.265625,
"learning_rate": 0.00043724583571584565,
"loss": 5.0287,
"mean_token_accuracy": 0.19598036110401154,
"num_tokens": 55658598.0,
"step": 32070
},
{
"entropy": 5.4510054111480715,
"epoch": 2.495545613693834,
"grad_norm": 1.171875,
"learning_rate": 0.00043722663205340753,
"loss": 5.0724,
"mean_token_accuracy": 0.1806057408452034,
"num_tokens": 55666954.0,
"step": 32075
},
{
"entropy": 5.4412600040435795,
"epoch": 2.4959346430655516,
"grad_norm": 1.1328125,
"learning_rate": 0.0004372074259294384,
"loss": 4.9835,
"mean_token_accuracy": 0.20118986517190934,
"num_tokens": 55675451.0,
"step": 32080
},
{
"entropy": 5.414380073547363,
"epoch": 2.496323672437269,
"grad_norm": 1.1640625,
"learning_rate": 0.0004371882173442299,
"loss": 5.1101,
"mean_token_accuracy": 0.19092480540275575,
"num_tokens": 55683778.0,
"step": 32085
},
{
"entropy": 5.308280086517334,
"epoch": 2.4967127018089865,
"grad_norm": 1.1328125,
"learning_rate": 0.00043716900629807323,
"loss": 4.9639,
"mean_token_accuracy": 0.2042096585035324,
"num_tokens": 55692440.0,
"step": 32090
},
{
"entropy": 5.391364240646363,
"epoch": 2.497101731180704,
"grad_norm": 1.21875,
"learning_rate": 0.00043714979279126006,
"loss": 4.9765,
"mean_token_accuracy": 0.19986994862556456,
"num_tokens": 55700648.0,
"step": 32095
},
{
"entropy": 5.398708391189575,
"epoch": 2.497490760552422,
"grad_norm": 1.1484375,
"learning_rate": 0.0004371305768240818,
"loss": 4.956,
"mean_token_accuracy": 0.2019503816962242,
"num_tokens": 55709515.0,
"step": 32100
},
{
"entropy": 5.391159915924073,
"epoch": 2.497879789924139,
"grad_norm": 1.1953125,
"learning_rate": 0.0004371113583968302,
"loss": 5.0679,
"mean_token_accuracy": 0.196664722263813,
"num_tokens": 55717876.0,
"step": 32105
},
{
"entropy": 5.397810077667236,
"epoch": 2.498268819295857,
"grad_norm": 1.1171875,
"learning_rate": 0.0004370921375097967,
"loss": 4.9978,
"mean_token_accuracy": 0.19241620302200318,
"num_tokens": 55726330.0,
"step": 32110
},
{
"entropy": 5.440371990203857,
"epoch": 2.4986578486675746,
"grad_norm": 1.078125,
"learning_rate": 0.00043707291416327307,
"loss": 5.0576,
"mean_token_accuracy": 0.19379918575286864,
"num_tokens": 55736102.0,
"step": 32115
},
{
"entropy": 5.469717073440552,
"epoch": 2.499046878039292,
"grad_norm": 1.296875,
"learning_rate": 0.0004370536883575509,
"loss": 5.0858,
"mean_token_accuracy": 0.19848588705062867,
"num_tokens": 55744022.0,
"step": 32120
},
{
"entropy": 5.382108926773071,
"epoch": 2.4994359074110095,
"grad_norm": 1.1484375,
"learning_rate": 0.0004370344600929219,
"loss": 5.0201,
"mean_token_accuracy": 0.19545325487852097,
"num_tokens": 55752613.0,
"step": 32125
},
{
"entropy": 5.37735276222229,
"epoch": 2.499824936782727,
"grad_norm": 1.0703125,
"learning_rate": 0.0004370152293696779,
"loss": 4.9957,
"mean_token_accuracy": 0.20103242248296738,
"num_tokens": 55761402.0,
"step": 32130
},
{
"entropy": 5.416461372375489,
"epoch": 2.500213966154445,
"grad_norm": 1.15625,
"learning_rate": 0.0004369959961881107,
"loss": 4.9034,
"mean_token_accuracy": 0.19852776676416398,
"num_tokens": 55769630.0,
"step": 32135
},
{
"entropy": 5.372434139251709,
"epoch": 2.500602995526162,
"grad_norm": 1.171875,
"learning_rate": 0.000436976760548512,
"loss": 4.9992,
"mean_token_accuracy": 0.20116361677646638,
"num_tokens": 55777928.0,
"step": 32140
},
{
"entropy": 5.399435567855835,
"epoch": 2.50099202489788,
"grad_norm": 1.140625,
"learning_rate": 0.00043695752245117393,
"loss": 5.0049,
"mean_token_accuracy": 0.19648951143026352,
"num_tokens": 55786585.0,
"step": 32145
},
{
"entropy": 5.382568597793579,
"epoch": 2.501381054269597,
"grad_norm": 1.0703125,
"learning_rate": 0.0004369382818963882,
"loss": 4.9119,
"mean_token_accuracy": 0.20592911839485167,
"num_tokens": 55795565.0,
"step": 32150
},
{
"entropy": 5.370478296279908,
"epoch": 2.501770083641315,
"grad_norm": 1.125,
"learning_rate": 0.0004369190388844467,
"loss": 4.9958,
"mean_token_accuracy": 0.19118421226739885,
"num_tokens": 55804211.0,
"step": 32155
},
{
"entropy": 5.335606813430786,
"epoch": 2.5021591130130325,
"grad_norm": 1.140625,
"learning_rate": 0.00043689979341564154,
"loss": 5.0047,
"mean_token_accuracy": 0.19293981343507766,
"num_tokens": 55812604.0,
"step": 32160
},
{
"entropy": 5.387471103668213,
"epoch": 2.50254814238475,
"grad_norm": 1.1953125,
"learning_rate": 0.0004368805454902648,
"loss": 4.9855,
"mean_token_accuracy": 0.19416254609823227,
"num_tokens": 55821293.0,
"step": 32165
},
{
"entropy": 5.39742078781128,
"epoch": 2.5029371717564675,
"grad_norm": 1.15625,
"learning_rate": 0.00043686129510860826,
"loss": 4.9292,
"mean_token_accuracy": 0.19681094884872435,
"num_tokens": 55830423.0,
"step": 32170
},
{
"entropy": 5.434660720825195,
"epoch": 2.503326201128185,
"grad_norm": 1.1796875,
"learning_rate": 0.00043684204227096435,
"loss": 5.0309,
"mean_token_accuracy": 0.18779256343841552,
"num_tokens": 55838889.0,
"step": 32175
},
{
"entropy": 5.403591823577881,
"epoch": 2.503715230499903,
"grad_norm": 1.1875,
"learning_rate": 0.000436822786977625,
"loss": 5.0213,
"mean_token_accuracy": 0.19747687131166458,
"num_tokens": 55846670.0,
"step": 32180
},
{
"entropy": 5.4328642845153805,
"epoch": 2.50410425987162,
"grad_norm": 1.15625,
"learning_rate": 0.00043680352922888244,
"loss": 5.0455,
"mean_token_accuracy": 0.19460490047931672,
"num_tokens": 55855341.0,
"step": 32185
},
{
"entropy": 5.454333686828614,
"epoch": 2.504493289243338,
"grad_norm": 1.15625,
"learning_rate": 0.0004367842690250288,
"loss": 4.9966,
"mean_token_accuracy": 0.193300062417984,
"num_tokens": 55863491.0,
"step": 32190
},
{
"entropy": 5.3293314456939695,
"epoch": 2.5048823186150555,
"grad_norm": 1.203125,
"learning_rate": 0.0004367650063663565,
"loss": 4.9247,
"mean_token_accuracy": 0.20173680186271667,
"num_tokens": 55872346.0,
"step": 32195
},
{
"entropy": 5.3065488815307615,
"epoch": 2.505271347986773,
"grad_norm": 1.2734375,
"learning_rate": 0.0004367457412531576,
"loss": 4.9312,
"mean_token_accuracy": 0.2024470329284668,
"num_tokens": 55880672.0,
"step": 32200
},
{
"entropy": 5.470913124084473,
"epoch": 2.5056603773584905,
"grad_norm": 1.25,
"learning_rate": 0.0004367264736857245,
"loss": 5.0548,
"mean_token_accuracy": 0.1957331195473671,
"num_tokens": 55888938.0,
"step": 32205
},
{
"entropy": 5.404807090759277,
"epoch": 2.506049406730208,
"grad_norm": 1.078125,
"learning_rate": 0.0004367072036643497,
"loss": 4.9264,
"mean_token_accuracy": 0.20200915336608888,
"num_tokens": 55897522.0,
"step": 32210
},
{
"entropy": 5.389359664916992,
"epoch": 2.506438436101926,
"grad_norm": 1.2578125,
"learning_rate": 0.00043668793118932536,
"loss": 4.975,
"mean_token_accuracy": 0.1948966920375824,
"num_tokens": 55905425.0,
"step": 32215
},
{
"entropy": 5.356124687194824,
"epoch": 2.506827465473643,
"grad_norm": 1.1640625,
"learning_rate": 0.00043666865626094405,
"loss": 4.9913,
"mean_token_accuracy": 0.19769603312015532,
"num_tokens": 55913990.0,
"step": 32220
},
{
"entropy": 5.5398290157318115,
"epoch": 2.507216494845361,
"grad_norm": 1.1484375,
"learning_rate": 0.00043664937887949825,
"loss": 5.157,
"mean_token_accuracy": 0.18768719136714934,
"num_tokens": 55922899.0,
"step": 32225
},
{
"entropy": 5.43485918045044,
"epoch": 2.5076055242170785,
"grad_norm": 1.15625,
"learning_rate": 0.0004366300990452803,
"loss": 4.9839,
"mean_token_accuracy": 0.1956053227186203,
"num_tokens": 55930935.0,
"step": 32230
},
{
"entropy": 5.433703947067261,
"epoch": 2.507994553588796,
"grad_norm": 1.1796875,
"learning_rate": 0.00043661081675858295,
"loss": 5.0383,
"mean_token_accuracy": 0.19628583788871765,
"num_tokens": 55939258.0,
"step": 32235
},
{
"entropy": 5.374581670761108,
"epoch": 2.5083835829605134,
"grad_norm": 1.1171875,
"learning_rate": 0.00043659153201969865,
"loss": 5.044,
"mean_token_accuracy": 0.19572957009077072,
"num_tokens": 55947672.0,
"step": 32240
},
{
"entropy": 5.386348152160645,
"epoch": 2.508772612332231,
"grad_norm": 1.15625,
"learning_rate": 0.0004365722448289201,
"loss": 5.0314,
"mean_token_accuracy": 0.1968951165676117,
"num_tokens": 55956251.0,
"step": 32245
},
{
"entropy": 5.335434865951538,
"epoch": 2.5091616417039484,
"grad_norm": 1.125,
"learning_rate": 0.0004365529551865399,
"loss": 4.8701,
"mean_token_accuracy": 0.2046285793185234,
"num_tokens": 55965038.0,
"step": 32250
},
{
"entropy": 5.446961975097656,
"epoch": 2.509550671075666,
"grad_norm": 1.1953125,
"learning_rate": 0.00043653366309285066,
"loss": 5.0646,
"mean_token_accuracy": 0.18491360992193223,
"num_tokens": 55973140.0,
"step": 32255
},
{
"entropy": 5.389738464355469,
"epoch": 2.509939700447384,
"grad_norm": 1.1484375,
"learning_rate": 0.0004365143685481452,
"loss": 5.0044,
"mean_token_accuracy": 0.19442484378814698,
"num_tokens": 55981097.0,
"step": 32260
},
{
"entropy": 5.343953275680542,
"epoch": 2.5103287298191015,
"grad_norm": 1.15625,
"learning_rate": 0.0004364950715527164,
"loss": 4.9036,
"mean_token_accuracy": 0.20392945408821106,
"num_tokens": 55990077.0,
"step": 32265
},
{
"entropy": 5.363574028015137,
"epoch": 2.5107177591908187,
"grad_norm": 1.125,
"learning_rate": 0.0004364757721068568,
"loss": 5.0265,
"mean_token_accuracy": 0.20098851919174193,
"num_tokens": 55999289.0,
"step": 32270
},
{
"entropy": 5.418304395675659,
"epoch": 2.5111067885625364,
"grad_norm": 1.171875,
"learning_rate": 0.00043645647021085945,
"loss": 4.9274,
"mean_token_accuracy": 0.20525295287370682,
"num_tokens": 56007736.0,
"step": 32275
},
{
"entropy": 5.390245580673218,
"epoch": 2.511495817934254,
"grad_norm": 1.1953125,
"learning_rate": 0.00043643716586501706,
"loss": 4.9744,
"mean_token_accuracy": 0.19886955618858337,
"num_tokens": 56016623.0,
"step": 32280
},
{
"entropy": 5.425648498535156,
"epoch": 2.5118848473059714,
"grad_norm": 1.1875,
"learning_rate": 0.00043641785906962276,
"loss": 4.9927,
"mean_token_accuracy": 0.2006028711795807,
"num_tokens": 56024536.0,
"step": 32285
},
{
"entropy": 5.361474275588989,
"epoch": 2.512273876677689,
"grad_norm": 1.140625,
"learning_rate": 0.0004363985498249693,
"loss": 5.0418,
"mean_token_accuracy": 0.19517133384943008,
"num_tokens": 56033618.0,
"step": 32290
},
{
"entropy": 5.421626615524292,
"epoch": 2.512662906049407,
"grad_norm": 1.2265625,
"learning_rate": 0.00043637923813134974,
"loss": 5.0846,
"mean_token_accuracy": 0.19119500666856765,
"num_tokens": 56042836.0,
"step": 32295
},
{
"entropy": 5.430089521408081,
"epoch": 2.5130519354211245,
"grad_norm": 1.1015625,
"learning_rate": 0.00043635992398905713,
"loss": 4.9915,
"mean_token_accuracy": 0.1890509843826294,
"num_tokens": 56051296.0,
"step": 32300
},
{
"entropy": 5.385789012908935,
"epoch": 2.5134409647928417,
"grad_norm": 1.1484375,
"learning_rate": 0.0004363406073983844,
"loss": 4.9637,
"mean_token_accuracy": 0.20308204889297485,
"num_tokens": 56060093.0,
"step": 32305
},
{
"entropy": 5.435589838027954,
"epoch": 2.5138299941645594,
"grad_norm": 1.15625,
"learning_rate": 0.00043632128835962485,
"loss": 4.9696,
"mean_token_accuracy": 0.19668910652399063,
"num_tokens": 56068441.0,
"step": 32310
},
{
"entropy": 5.3645265102386475,
"epoch": 2.514219023536277,
"grad_norm": 1.0625,
"learning_rate": 0.00043630196687307156,
"loss": 4.9032,
"mean_token_accuracy": 0.20028816014528275,
"num_tokens": 56076592.0,
"step": 32315
},
{
"entropy": 5.310757970809936,
"epoch": 2.5146080529079944,
"grad_norm": 1.203125,
"learning_rate": 0.0004362826429390176,
"loss": 4.9069,
"mean_token_accuracy": 0.20428854376077651,
"num_tokens": 56085299.0,
"step": 32320
},
{
"entropy": 5.39163613319397,
"epoch": 2.514997082279712,
"grad_norm": 1.1640625,
"learning_rate": 0.00043626331655775624,
"loss": 4.9539,
"mean_token_accuracy": 0.2032100260257721,
"num_tokens": 56093891.0,
"step": 32325
},
{
"entropy": 5.387237071990967,
"epoch": 2.51538611165143,
"grad_norm": 1.1875,
"learning_rate": 0.00043624398772958075,
"loss": 5.0595,
"mean_token_accuracy": 0.19667782485485077,
"num_tokens": 56102767.0,
"step": 32330
},
{
"entropy": 5.384063673019409,
"epoch": 2.5157751410231475,
"grad_norm": 1.171875,
"learning_rate": 0.0004362246564547844,
"loss": 4.9697,
"mean_token_accuracy": 0.2003084734082222,
"num_tokens": 56110861.0,
"step": 32335
},
{
"entropy": 5.464279842376709,
"epoch": 2.5161641703948647,
"grad_norm": 1.109375,
"learning_rate": 0.00043620532273366044,
"loss": 5.081,
"mean_token_accuracy": 0.19337862282991408,
"num_tokens": 56119842.0,
"step": 32340
},
{
"entropy": 5.491277647018433,
"epoch": 2.5165531997665824,
"grad_norm": 1.203125,
"learning_rate": 0.0004361859865665024,
"loss": 5.0876,
"mean_token_accuracy": 0.1899813234806061,
"num_tokens": 56128246.0,
"step": 32345
},
{
"entropy": 5.4309587478637695,
"epoch": 2.5169422291382997,
"grad_norm": 1.0703125,
"learning_rate": 0.00043616664795360346,
"loss": 5.0338,
"mean_token_accuracy": 0.1972397133708,
"num_tokens": 56137320.0,
"step": 32350
},
{
"entropy": 5.367820787429809,
"epoch": 2.5173312585100174,
"grad_norm": 1.140625,
"learning_rate": 0.00043614730689525716,
"loss": 4.9732,
"mean_token_accuracy": 0.19634073674678804,
"num_tokens": 56145739.0,
"step": 32355
},
{
"entropy": 5.390258264541626,
"epoch": 2.517720287881735,
"grad_norm": 1.234375,
"learning_rate": 0.00043612796339175707,
"loss": 5.001,
"mean_token_accuracy": 0.1985723227262497,
"num_tokens": 56154526.0,
"step": 32360
},
{
"entropy": 5.526586246490479,
"epoch": 2.5181093172534528,
"grad_norm": 1.1484375,
"learning_rate": 0.00043610861744339653,
"loss": 5.157,
"mean_token_accuracy": 0.18484565019607543,
"num_tokens": 56163209.0,
"step": 32365
},
{
"entropy": 5.429590272903442,
"epoch": 2.5184983466251705,
"grad_norm": 1.1171875,
"learning_rate": 0.0004360892690504692,
"loss": 4.9824,
"mean_token_accuracy": 0.20689349621534348,
"num_tokens": 56171541.0,
"step": 32370
},
{
"entropy": 5.3439678192138675,
"epoch": 2.5188873759968877,
"grad_norm": 1.1953125,
"learning_rate": 0.0004360699182132685,
"loss": 4.9859,
"mean_token_accuracy": 0.19798265993595124,
"num_tokens": 56180309.0,
"step": 32375
},
{
"entropy": 5.4654004096984865,
"epoch": 2.5192764053686054,
"grad_norm": 1.140625,
"learning_rate": 0.00043605056493208825,
"loss": 5.0914,
"mean_token_accuracy": 0.19965959191322327,
"num_tokens": 56188916.0,
"step": 32380
},
{
"entropy": 5.394084787368774,
"epoch": 2.5196654347403227,
"grad_norm": 1.1640625,
"learning_rate": 0.000436031209207222,
"loss": 4.8754,
"mean_token_accuracy": 0.20240339934825896,
"num_tokens": 56197358.0,
"step": 32385
},
{
"entropy": 5.3156641006469725,
"epoch": 2.5200544641120404,
"grad_norm": 1.1875,
"learning_rate": 0.00043601185103896346,
"loss": 5.0245,
"mean_token_accuracy": 0.19320577681064605,
"num_tokens": 56206060.0,
"step": 32390
},
{
"entropy": 5.27640061378479,
"epoch": 2.520443493483758,
"grad_norm": 1.25,
"learning_rate": 0.00043599249042760636,
"loss": 4.9459,
"mean_token_accuracy": 0.19057336449623108,
"num_tokens": 56214539.0,
"step": 32395
},
{
"entropy": 5.332379579544067,
"epoch": 2.5208325228554758,
"grad_norm": 1.2421875,
"learning_rate": 0.00043597312737344446,
"loss": 4.8455,
"mean_token_accuracy": 0.205069437623024,
"num_tokens": 56222386.0,
"step": 32400
},
{
"entropy": 5.339838457107544,
"epoch": 2.521221552227193,
"grad_norm": 1.09375,
"learning_rate": 0.00043595376187677157,
"loss": 4.9333,
"mean_token_accuracy": 0.19663689732551576,
"num_tokens": 56231036.0,
"step": 32405
},
{
"entropy": 5.356459999084473,
"epoch": 2.5216105815989107,
"grad_norm": 1.1953125,
"learning_rate": 0.00043593439393788147,
"loss": 5.0081,
"mean_token_accuracy": 0.19810594767332076,
"num_tokens": 56239494.0,
"step": 32410
},
{
"entropy": 5.431342744827271,
"epoch": 2.5219996109706284,
"grad_norm": 1.2265625,
"learning_rate": 0.0004359150235570682,
"loss": 5.0302,
"mean_token_accuracy": 0.19545965790748596,
"num_tokens": 56248075.0,
"step": 32415
},
{
"entropy": 5.4104784488677975,
"epoch": 2.5223886403423457,
"grad_norm": 1.1328125,
"learning_rate": 0.0004358956507346255,
"loss": 5.0457,
"mean_token_accuracy": 0.19441032856702806,
"num_tokens": 56256630.0,
"step": 32420
},
{
"entropy": 5.319768857955933,
"epoch": 2.5227776697140634,
"grad_norm": 1.203125,
"learning_rate": 0.0004358762754708474,
"loss": 4.8649,
"mean_token_accuracy": 0.20580192804336547,
"num_tokens": 56264922.0,
"step": 32425
},
{
"entropy": 5.401272964477539,
"epoch": 2.523166699085781,
"grad_norm": 1.2109375,
"learning_rate": 0.00043585689776602795,
"loss": 5.1103,
"mean_token_accuracy": 0.1897198438644409,
"num_tokens": 56273996.0,
"step": 32430
},
{
"entropy": 5.4865294933319095,
"epoch": 2.5235557284574988,
"grad_norm": 1.140625,
"learning_rate": 0.00043583751762046104,
"loss": 5.0728,
"mean_token_accuracy": 0.19219736158847808,
"num_tokens": 56283583.0,
"step": 32435
},
{
"entropy": 5.4571349143981935,
"epoch": 2.523944757829216,
"grad_norm": 1.1328125,
"learning_rate": 0.0004358181350344408,
"loss": 5.0103,
"mean_token_accuracy": 0.19597954899072648,
"num_tokens": 56292197.0,
"step": 32440
},
{
"entropy": 5.407770681381225,
"epoch": 2.5243337872009337,
"grad_norm": 1.078125,
"learning_rate": 0.0004357987500082613,
"loss": 5.0532,
"mean_token_accuracy": 0.18912947922945023,
"num_tokens": 56301177.0,
"step": 32445
},
{
"entropy": 5.432667684555054,
"epoch": 2.524722816572651,
"grad_norm": 1.1015625,
"learning_rate": 0.00043577936254221675,
"loss": 4.9913,
"mean_token_accuracy": 0.19305782169103622,
"num_tokens": 56310024.0,
"step": 32450
},
{
"entropy": 5.428409671783447,
"epoch": 2.5251118459443687,
"grad_norm": 1.1328125,
"learning_rate": 0.0004357599726366013,
"loss": 5.0196,
"mean_token_accuracy": 0.19170882403850556,
"num_tokens": 56318190.0,
"step": 32455
},
{
"entropy": 5.293249940872192,
"epoch": 2.5255008753160864,
"grad_norm": 1.125,
"learning_rate": 0.0004357405802917091,
"loss": 4.8673,
"mean_token_accuracy": 0.20901996940374373,
"num_tokens": 56326443.0,
"step": 32460
},
{
"entropy": 5.294808769226075,
"epoch": 2.525889904687804,
"grad_norm": 1.203125,
"learning_rate": 0.0004357211855078345,
"loss": 4.9709,
"mean_token_accuracy": 0.1986512914299965,
"num_tokens": 56335263.0,
"step": 32465
},
{
"entropy": 5.419492721557617,
"epoch": 2.5262789340595218,
"grad_norm": 1.2109375,
"learning_rate": 0.00043570178828527157,
"loss": 5.0246,
"mean_token_accuracy": 0.19746648222208024,
"num_tokens": 56343202.0,
"step": 32470
},
{
"entropy": 5.400504493713379,
"epoch": 2.526667963431239,
"grad_norm": 1.1953125,
"learning_rate": 0.0004356823886243149,
"loss": 4.9127,
"mean_token_accuracy": 0.1954809308052063,
"num_tokens": 56352150.0,
"step": 32475
},
{
"entropy": 5.28996467590332,
"epoch": 2.5270569928029567,
"grad_norm": 1.2109375,
"learning_rate": 0.00043566298652525875,
"loss": 4.8784,
"mean_token_accuracy": 0.2124801442027092,
"num_tokens": 56360460.0,
"step": 32480
},
{
"entropy": 5.315297269821167,
"epoch": 2.527446022174674,
"grad_norm": 1.1171875,
"learning_rate": 0.00043564358198839746,
"loss": 5.0569,
"mean_token_accuracy": 0.1971816748380661,
"num_tokens": 56369889.0,
"step": 32485
},
{
"entropy": 5.414597415924073,
"epoch": 2.5278350515463917,
"grad_norm": 1.15625,
"learning_rate": 0.0004356241750140256,
"loss": 4.9012,
"mean_token_accuracy": 0.1969568908214569,
"num_tokens": 56378500.0,
"step": 32490
},
{
"entropy": 5.469532918930054,
"epoch": 2.5282240809181094,
"grad_norm": 1.125,
"learning_rate": 0.00043560476560243743,
"loss": 5.0618,
"mean_token_accuracy": 0.1905737742781639,
"num_tokens": 56387390.0,
"step": 32495
},
{
"entropy": 5.4575244903564455,
"epoch": 2.528613110289827,
"grad_norm": 1.125,
"learning_rate": 0.0004355853537539276,
"loss": 5.038,
"mean_token_accuracy": 0.19808294326066972,
"num_tokens": 56395782.0,
"step": 32500
},
{
"entropy": 5.399492597579956,
"epoch": 2.5290021396615443,
"grad_norm": 1.125,
"learning_rate": 0.0004355659394687906,
"loss": 4.9422,
"mean_token_accuracy": 0.2043975681066513,
"num_tokens": 56405023.0,
"step": 32505
},
{
"entropy": 5.446301651000977,
"epoch": 2.529391169033262,
"grad_norm": 1.1328125,
"learning_rate": 0.0004355465227473211,
"loss": 5.0691,
"mean_token_accuracy": 0.19323596805334092,
"num_tokens": 56413669.0,
"step": 32510
},
{
"entropy": 5.422313022613525,
"epoch": 2.5297801984049797,
"grad_norm": 1.1328125,
"learning_rate": 0.0004355271035898136,
"loss": 5.0169,
"mean_token_accuracy": 0.19778741002082825,
"num_tokens": 56422286.0,
"step": 32515
},
{
"entropy": 5.482103443145752,
"epoch": 2.530169227776697,
"grad_norm": 1.2421875,
"learning_rate": 0.0004355076819965628,
"loss": 5.0544,
"mean_token_accuracy": 0.20013925731182097,
"num_tokens": 56430891.0,
"step": 32520
},
{
"entropy": 5.38812780380249,
"epoch": 2.5305582571484146,
"grad_norm": 1.15625,
"learning_rate": 0.00043548825796786353,
"loss": 5.0191,
"mean_token_accuracy": 0.19865642935037614,
"num_tokens": 56439231.0,
"step": 32525
},
{
"entropy": 5.306616544723511,
"epoch": 2.5309472865201323,
"grad_norm": 1.171875,
"learning_rate": 0.00043546883150401023,
"loss": 4.7887,
"mean_token_accuracy": 0.21773111075162888,
"num_tokens": 56447508.0,
"step": 32530
},
{
"entropy": 5.341956329345703,
"epoch": 2.53133631589185,
"grad_norm": 1.125,
"learning_rate": 0.00043544940260529787,
"loss": 4.9634,
"mean_token_accuracy": 0.20265888422727585,
"num_tokens": 56456049.0,
"step": 32535
},
{
"entropy": 5.355829334259033,
"epoch": 2.5317253452635673,
"grad_norm": 1.2578125,
"learning_rate": 0.0004354299712720213,
"loss": 5.0198,
"mean_token_accuracy": 0.20201081782579422,
"num_tokens": 56464775.0,
"step": 32540
},
{
"entropy": 5.40965633392334,
"epoch": 2.532114374635285,
"grad_norm": 1.140625,
"learning_rate": 0.0004354105375044752,
"loss": 4.9862,
"mean_token_accuracy": 0.19741586744785308,
"num_tokens": 56473835.0,
"step": 32545
},
{
"entropy": 5.427690601348877,
"epoch": 2.5325034040070027,
"grad_norm": 1.0703125,
"learning_rate": 0.00043539110130295445,
"loss": 5.0044,
"mean_token_accuracy": 0.19642794132232666,
"num_tokens": 56482488.0,
"step": 32550
},
{
"entropy": 5.339759111404419,
"epoch": 2.53289243337872,
"grad_norm": 1.0625,
"learning_rate": 0.00043537166266775405,
"loss": 4.9535,
"mean_token_accuracy": 0.19785019010305405,
"num_tokens": 56491928.0,
"step": 32555
},
{
"entropy": 5.297445964813233,
"epoch": 2.5332814627504376,
"grad_norm": 1.2578125,
"learning_rate": 0.000435352221599169,
"loss": 4.8969,
"mean_token_accuracy": 0.20106651782989501,
"num_tokens": 56500247.0,
"step": 32560
},
{
"entropy": 5.408609771728516,
"epoch": 2.5336704921221553,
"grad_norm": 1.1875,
"learning_rate": 0.0004353327780974941,
"loss": 5.0393,
"mean_token_accuracy": 0.19395507127046585,
"num_tokens": 56509507.0,
"step": 32565
},
{
"entropy": 5.448973941802978,
"epoch": 2.534059521493873,
"grad_norm": 1.078125,
"learning_rate": 0.0004353133321630246,
"loss": 5.0471,
"mean_token_accuracy": 0.19190725684165955,
"num_tokens": 56517895.0,
"step": 32570
},
{
"entropy": 5.355793190002442,
"epoch": 2.5344485508655903,
"grad_norm": 1.1171875,
"learning_rate": 0.0004352938837960554,
"loss": 4.941,
"mean_token_accuracy": 0.20079725831747056,
"num_tokens": 56526894.0,
"step": 32575
},
{
"entropy": 5.416588544845581,
"epoch": 2.534837580237308,
"grad_norm": 1.1640625,
"learning_rate": 0.00043527443299688166,
"loss": 5.0188,
"mean_token_accuracy": 0.19484439939260484,
"num_tokens": 56535970.0,
"step": 32580
},
{
"entropy": 5.460320329666137,
"epoch": 2.5352266096090252,
"grad_norm": 1.140625,
"learning_rate": 0.00043525497976579843,
"loss": 5.0027,
"mean_token_accuracy": 0.19569645076990128,
"num_tokens": 56544385.0,
"step": 32585
},
{
"entropy": 5.338799476623535,
"epoch": 2.535615638980743,
"grad_norm": 1.21875,
"learning_rate": 0.000435235524103101,
"loss": 4.9802,
"mean_token_accuracy": 0.19435409158468248,
"num_tokens": 56552645.0,
"step": 32590
},
{
"entropy": 5.501217842102051,
"epoch": 2.5360046683524606,
"grad_norm": 1.1484375,
"learning_rate": 0.0004352160660090846,
"loss": 5.0842,
"mean_token_accuracy": 0.1889079689979553,
"num_tokens": 56562223.0,
"step": 32595
},
{
"entropy": 5.410815191268921,
"epoch": 2.5363936977241783,
"grad_norm": 1.2265625,
"learning_rate": 0.0004351966054840443,
"loss": 4.955,
"mean_token_accuracy": 0.19765260964632034,
"num_tokens": 56571015.0,
"step": 32600
},
{
"entropy": 5.3445109844207765,
"epoch": 2.5367827270958956,
"grad_norm": 1.1328125,
"learning_rate": 0.00043517714252827556,
"loss": 4.9046,
"mean_token_accuracy": 0.20604282468557358,
"num_tokens": 56579566.0,
"step": 32605
},
{
"entropy": 5.441760778427124,
"epoch": 2.5371717564676133,
"grad_norm": 1.1171875,
"learning_rate": 0.0004351576771420737,
"loss": 5.0286,
"mean_token_accuracy": 0.19846716970205308,
"num_tokens": 56588231.0,
"step": 32610
},
{
"entropy": 5.383497047424316,
"epoch": 2.537560785839331,
"grad_norm": 1.2265625,
"learning_rate": 0.0004351382093257339,
"loss": 5.0125,
"mean_token_accuracy": 0.19605728834867478,
"num_tokens": 56596581.0,
"step": 32615
},
{
"entropy": 5.34217939376831,
"epoch": 2.5379498152110482,
"grad_norm": 1.1328125,
"learning_rate": 0.0004351187390795517,
"loss": 4.9179,
"mean_token_accuracy": 0.2058378577232361,
"num_tokens": 56605440.0,
"step": 32620
},
{
"entropy": 5.410478782653809,
"epoch": 2.538338844582766,
"grad_norm": 1.2578125,
"learning_rate": 0.00043509926640382244,
"loss": 5.0884,
"mean_token_accuracy": 0.19782164245843886,
"num_tokens": 56614819.0,
"step": 32625
},
{
"entropy": 5.363060045242309,
"epoch": 2.5387278739544836,
"grad_norm": 1.203125,
"learning_rate": 0.0004350797912988417,
"loss": 5.0403,
"mean_token_accuracy": 0.19826929718255998,
"num_tokens": 56623372.0,
"step": 32630
},
{
"entropy": 5.323605012893677,
"epoch": 2.5391169033262013,
"grad_norm": 1.15625,
"learning_rate": 0.0004350603137649049,
"loss": 4.9349,
"mean_token_accuracy": 0.2005373701453209,
"num_tokens": 56631768.0,
"step": 32635
},
{
"entropy": 5.322753381729126,
"epoch": 2.5395059326979186,
"grad_norm": 1.1796875,
"learning_rate": 0.0004350408338023075,
"loss": 4.952,
"mean_token_accuracy": 0.20120840072631835,
"num_tokens": 56640135.0,
"step": 32640
},
{
"entropy": 5.323076772689819,
"epoch": 2.5398949620696363,
"grad_norm": 1.25,
"learning_rate": 0.0004350213514113453,
"loss": 4.8871,
"mean_token_accuracy": 0.199225115776062,
"num_tokens": 56648007.0,
"step": 32645
},
{
"entropy": 5.4193097114562985,
"epoch": 2.540283991441354,
"grad_norm": 1.15625,
"learning_rate": 0.00043500186659231377,
"loss": 5.0592,
"mean_token_accuracy": 0.1947535276412964,
"num_tokens": 56656926.0,
"step": 32650
},
{
"entropy": 5.482250833511353,
"epoch": 2.5406730208130712,
"grad_norm": 1.140625,
"learning_rate": 0.0004349823793455086,
"loss": 5.1036,
"mean_token_accuracy": 0.19122953414916993,
"num_tokens": 56665404.0,
"step": 32655
},
{
"entropy": 5.414553928375244,
"epoch": 2.541062050184789,
"grad_norm": 1.1875,
"learning_rate": 0.00043496288967122547,
"loss": 5.0019,
"mean_token_accuracy": 0.19383166134357452,
"num_tokens": 56673922.0,
"step": 32660
},
{
"entropy": 5.392436408996582,
"epoch": 2.5414510795565066,
"grad_norm": 1.125,
"learning_rate": 0.00043494339756976007,
"loss": 4.9852,
"mean_token_accuracy": 0.19653818160295486,
"num_tokens": 56682062.0,
"step": 32665
},
{
"entropy": 5.438071203231812,
"epoch": 2.5418401089282243,
"grad_norm": 1.125,
"learning_rate": 0.0004349239030414082,
"loss": 5.0954,
"mean_token_accuracy": 0.19040025621652604,
"num_tokens": 56690571.0,
"step": 32670
},
{
"entropy": 5.413377809524536,
"epoch": 2.5422291382999416,
"grad_norm": 1.140625,
"learning_rate": 0.00043490440608646557,
"loss": 4.9961,
"mean_token_accuracy": 0.20147713124752045,
"num_tokens": 56699599.0,
"step": 32675
},
{
"entropy": 5.401550436019898,
"epoch": 2.5426181676716593,
"grad_norm": 1.109375,
"learning_rate": 0.00043488490670522817,
"loss": 4.9422,
"mean_token_accuracy": 0.20499475300312042,
"num_tokens": 56708120.0,
"step": 32680
},
{
"entropy": 5.376525449752807,
"epoch": 2.5430071970433765,
"grad_norm": 1.15625,
"learning_rate": 0.0004348654048979918,
"loss": 4.956,
"mean_token_accuracy": 0.19767683744430542,
"num_tokens": 56716339.0,
"step": 32685
},
{
"entropy": 5.324510145187378,
"epoch": 2.543396226415094,
"grad_norm": 1.21875,
"learning_rate": 0.0004348459006650523,
"loss": 4.878,
"mean_token_accuracy": 0.21489011794328688,
"num_tokens": 56724157.0,
"step": 32690
},
{
"entropy": 5.348539924621582,
"epoch": 2.543785255786812,
"grad_norm": 1.1796875,
"learning_rate": 0.00043482639400670576,
"loss": 5.0452,
"mean_token_accuracy": 0.19752895683050156,
"num_tokens": 56733075.0,
"step": 32695
},
{
"entropy": 5.317219877243042,
"epoch": 2.5441742851585296,
"grad_norm": 1.140625,
"learning_rate": 0.000434806884923248,
"loss": 4.9188,
"mean_token_accuracy": 0.20399024188518525,
"num_tokens": 56742184.0,
"step": 32700
},
{
"entropy": 5.360914182662964,
"epoch": 2.5445633145302473,
"grad_norm": 1.2109375,
"learning_rate": 0.0004347873734149752,
"loss": 4.904,
"mean_token_accuracy": 0.20166399478912353,
"num_tokens": 56750559.0,
"step": 32705
},
{
"entropy": 5.378832721710205,
"epoch": 2.5449523439019646,
"grad_norm": 1.1328125,
"learning_rate": 0.00043476785948218325,
"loss": 5.0647,
"mean_token_accuracy": 0.18976323753595353,
"num_tokens": 56760031.0,
"step": 32710
},
{
"entropy": 5.377664470672608,
"epoch": 2.5453413732736823,
"grad_norm": 1.1328125,
"learning_rate": 0.00043474834312516835,
"loss": 5.0229,
"mean_token_accuracy": 0.19264144748449324,
"num_tokens": 56768496.0,
"step": 32715
},
{
"entropy": 5.4445360660552975,
"epoch": 2.5457304026453995,
"grad_norm": 1.203125,
"learning_rate": 0.0004347288243442266,
"loss": 5.0219,
"mean_token_accuracy": 0.19857438206672667,
"num_tokens": 56776876.0,
"step": 32720
},
{
"entropy": 5.397977113723755,
"epoch": 2.546119432017117,
"grad_norm": 1.1640625,
"learning_rate": 0.0004347093031396543,
"loss": 4.9729,
"mean_token_accuracy": 0.20500152856111525,
"num_tokens": 56785661.0,
"step": 32725
},
{
"entropy": 5.358748197555542,
"epoch": 2.546508461388835,
"grad_norm": 1.1328125,
"learning_rate": 0.0004346897795117474,
"loss": 4.9643,
"mean_token_accuracy": 0.19860556572675706,
"num_tokens": 56794818.0,
"step": 32730
},
{
"entropy": 5.348541021347046,
"epoch": 2.5468974907605526,
"grad_norm": 1.1875,
"learning_rate": 0.0004346702534608023,
"loss": 5.0081,
"mean_token_accuracy": 0.19369932413101196,
"num_tokens": 56804528.0,
"step": 32735
},
{
"entropy": 5.3800272941589355,
"epoch": 2.54728652013227,
"grad_norm": 1.25,
"learning_rate": 0.0004346507249871153,
"loss": 4.9912,
"mean_token_accuracy": 0.20032689720392227,
"num_tokens": 56812766.0,
"step": 32740
},
{
"entropy": 5.39268159866333,
"epoch": 2.5476755495039876,
"grad_norm": 1.109375,
"learning_rate": 0.0004346311940909826,
"loss": 4.9438,
"mean_token_accuracy": 0.1987973928451538,
"num_tokens": 56821108.0,
"step": 32745
},
{
"entropy": 5.447809886932373,
"epoch": 2.5480645788757053,
"grad_norm": 1.1328125,
"learning_rate": 0.00043461166077270056,
"loss": 5.0507,
"mean_token_accuracy": 0.19227732419967652,
"num_tokens": 56829060.0,
"step": 32750
},
{
"entropy": 5.426973676681518,
"epoch": 2.5484536082474225,
"grad_norm": 1.2421875,
"learning_rate": 0.00043459212503256566,
"loss": 5.0262,
"mean_token_accuracy": 0.19717164635658263,
"num_tokens": 56837440.0,
"step": 32755
},
{
"entropy": 5.3656737327575685,
"epoch": 2.54884263761914,
"grad_norm": 1.1640625,
"learning_rate": 0.0004345725868708743,
"loss": 4.999,
"mean_token_accuracy": 0.19778794199228286,
"num_tokens": 56845485.0,
"step": 32760
},
{
"entropy": 5.373947048187256,
"epoch": 2.549231666990858,
"grad_norm": 1.3046875,
"learning_rate": 0.00043455304628792294,
"loss": 4.9733,
"mean_token_accuracy": 0.20393747836351395,
"num_tokens": 56854498.0,
"step": 32765
},
{
"entropy": 5.350716495513916,
"epoch": 2.5496206963625756,
"grad_norm": 1.125,
"learning_rate": 0.000434533503284008,
"loss": 4.9774,
"mean_token_accuracy": 0.20300679802894592,
"num_tokens": 56862910.0,
"step": 32770
},
{
"entropy": 5.362820196151733,
"epoch": 2.550009725734293,
"grad_norm": 1.140625,
"learning_rate": 0.0004345139578594261,
"loss": 4.9943,
"mean_token_accuracy": 0.1931072324514389,
"num_tokens": 56872235.0,
"step": 32775
},
{
"entropy": 5.386838054656982,
"epoch": 2.5503987551060106,
"grad_norm": 1.1171875,
"learning_rate": 0.0004344944100144738,
"loss": 4.9958,
"mean_token_accuracy": 0.1943257912993431,
"num_tokens": 56881506.0,
"step": 32780
},
{
"entropy": 5.387039089202881,
"epoch": 2.550787784477728,
"grad_norm": 1.1796875,
"learning_rate": 0.00043447485974944765,
"loss": 4.973,
"mean_token_accuracy": 0.20046062767505646,
"num_tokens": 56890218.0,
"step": 32785
},
{
"entropy": 5.404049634933472,
"epoch": 2.5511768138494455,
"grad_norm": 1.2109375,
"learning_rate": 0.00043445530706464437,
"loss": 4.9793,
"mean_token_accuracy": 0.20020410865545274,
"num_tokens": 56898037.0,
"step": 32790
},
{
"entropy": 5.338355159759521,
"epoch": 2.551565843221163,
"grad_norm": 1.0859375,
"learning_rate": 0.0004344357519603606,
"loss": 4.8869,
"mean_token_accuracy": 0.20264949798583984,
"num_tokens": 56906892.0,
"step": 32795
},
{
"entropy": 5.320281219482422,
"epoch": 2.551954872592881,
"grad_norm": 1.09375,
"learning_rate": 0.0004344161944368931,
"loss": 4.8001,
"mean_token_accuracy": 0.20936599224805832,
"num_tokens": 56915286.0,
"step": 32800
},
{
"entropy": 5.305531215667725,
"epoch": 2.5523439019645986,
"grad_norm": 1.234375,
"learning_rate": 0.0004343966344945385,
"loss": 4.9461,
"mean_token_accuracy": 0.19897326081991196,
"num_tokens": 56923670.0,
"step": 32805
},
{
"entropy": 5.444967746734619,
"epoch": 2.552732931336316,
"grad_norm": 1.1953125,
"learning_rate": 0.00043437707213359375,
"loss": 5.0939,
"mean_token_accuracy": 0.1886790007352829,
"num_tokens": 56932092.0,
"step": 32810
},
{
"entropy": 5.428129577636719,
"epoch": 2.5531219607080335,
"grad_norm": 1.21875,
"learning_rate": 0.00043435750735435554,
"loss": 5.0578,
"mean_token_accuracy": 0.1985599473118782,
"num_tokens": 56940938.0,
"step": 32815
},
{
"entropy": 5.440364980697632,
"epoch": 2.553510990079751,
"grad_norm": 1.2109375,
"learning_rate": 0.00043433794015712085,
"loss": 5.0032,
"mean_token_accuracy": 0.19599149525165557,
"num_tokens": 56950001.0,
"step": 32820
},
{
"entropy": 5.466781044006348,
"epoch": 2.5539000194514685,
"grad_norm": 1.2109375,
"learning_rate": 0.0004343183705421865,
"loss": 5.078,
"mean_token_accuracy": 0.1921714037656784,
"num_tokens": 56958898.0,
"step": 32825
},
{
"entropy": 5.433738708496094,
"epoch": 2.554289048823186,
"grad_norm": 1.1640625,
"learning_rate": 0.0004342987985098495,
"loss": 4.9683,
"mean_token_accuracy": 0.20671307146549225,
"num_tokens": 56967586.0,
"step": 32830
},
{
"entropy": 5.288120317459106,
"epoch": 2.554678078194904,
"grad_norm": 1.125,
"learning_rate": 0.00043427922406040676,
"loss": 4.8984,
"mean_token_accuracy": 0.19685294032096862,
"num_tokens": 56975781.0,
"step": 32835
},
{
"entropy": 5.453498029708863,
"epoch": 2.555067107566621,
"grad_norm": 1.28125,
"learning_rate": 0.00043425964719415525,
"loss": 5.034,
"mean_token_accuracy": 0.198574934899807,
"num_tokens": 56984230.0,
"step": 32840
},
{
"entropy": 5.387336587905883,
"epoch": 2.555456136938339,
"grad_norm": 1.171875,
"learning_rate": 0.00043424006791139213,
"loss": 4.9655,
"mean_token_accuracy": 0.19895107597112655,
"num_tokens": 56992100.0,
"step": 32845
},
{
"entropy": 5.392412376403809,
"epoch": 2.5558451663100565,
"grad_norm": 1.125,
"learning_rate": 0.00043422048621241443,
"loss": 5.0634,
"mean_token_accuracy": 0.19841053634881972,
"num_tokens": 57000407.0,
"step": 32850
},
{
"entropy": 5.452418804168701,
"epoch": 2.556234195681774,
"grad_norm": 1.2265625,
"learning_rate": 0.00043420090209751933,
"loss": 5.0501,
"mean_token_accuracy": 0.2006923735141754,
"num_tokens": 57008781.0,
"step": 32855
},
{
"entropy": 5.340987825393677,
"epoch": 2.5566232250534915,
"grad_norm": 1.2421875,
"learning_rate": 0.0004341813155670039,
"loss": 4.9361,
"mean_token_accuracy": 0.20685492902994157,
"num_tokens": 57017568.0,
"step": 32860
},
{
"entropy": 5.342080450057983,
"epoch": 2.557012254425209,
"grad_norm": 1.1953125,
"learning_rate": 0.0004341617266211654,
"loss": 4.86,
"mean_token_accuracy": 0.2100420966744423,
"num_tokens": 57025674.0,
"step": 32865
},
{
"entropy": 5.364832353591919,
"epoch": 2.557401283796927,
"grad_norm": 1.203125,
"learning_rate": 0.000434142135260301,
"loss": 4.9724,
"mean_token_accuracy": 0.1984519273042679,
"num_tokens": 57033657.0,
"step": 32870
},
{
"entropy": 5.432851076126099,
"epoch": 2.557790313168644,
"grad_norm": 1.171875,
"learning_rate": 0.000434122541484708,
"loss": 5.0772,
"mean_token_accuracy": 0.19555626362562178,
"num_tokens": 57043057.0,
"step": 32875
},
{
"entropy": 5.442611217498779,
"epoch": 2.558179342540362,
"grad_norm": 1.140625,
"learning_rate": 0.0004341029452946837,
"loss": 4.9863,
"mean_token_accuracy": 0.19016913920640946,
"num_tokens": 57051721.0,
"step": 32880
},
{
"entropy": 5.437685251235962,
"epoch": 2.558568371912079,
"grad_norm": 1.1796875,
"learning_rate": 0.0004340833466905254,
"loss": 5.0048,
"mean_token_accuracy": 0.19890847504138948,
"num_tokens": 57060223.0,
"step": 32885
},
{
"entropy": 5.401111650466919,
"epoch": 2.558957401283797,
"grad_norm": 1.1875,
"learning_rate": 0.00043406374567253055,
"loss": 4.9838,
"mean_token_accuracy": 0.20205372124910354,
"num_tokens": 57068408.0,
"step": 32890
},
{
"entropy": 5.404002332687378,
"epoch": 2.5593464306555145,
"grad_norm": 1.125,
"learning_rate": 0.0004340441422409965,
"loss": 5.0569,
"mean_token_accuracy": 0.18950616866350173,
"num_tokens": 57076784.0,
"step": 32895
},
{
"entropy": 5.45456748008728,
"epoch": 2.559735460027232,
"grad_norm": 1.140625,
"learning_rate": 0.0004340245363962209,
"loss": 5.0265,
"mean_token_accuracy": 0.19318908005952834,
"num_tokens": 57084745.0,
"step": 32900
},
{
"entropy": 5.352643966674805,
"epoch": 2.56012448939895,
"grad_norm": 1.1484375,
"learning_rate": 0.00043400492813850083,
"loss": 4.9749,
"mean_token_accuracy": 0.19884245693683625,
"num_tokens": 57093395.0,
"step": 32905
},
{
"entropy": 5.327489852905273,
"epoch": 2.560513518770667,
"grad_norm": 1.1328125,
"learning_rate": 0.00043398531746813426,
"loss": 4.9379,
"mean_token_accuracy": 0.19418791681528091,
"num_tokens": 57101665.0,
"step": 32910
},
{
"entropy": 5.265433740615845,
"epoch": 2.560902548142385,
"grad_norm": 1.1796875,
"learning_rate": 0.00043396570438541845,
"loss": 4.8873,
"mean_token_accuracy": 0.19647327512502671,
"num_tokens": 57110328.0,
"step": 32915
},
{
"entropy": 5.3937829494476315,
"epoch": 2.561291577514102,
"grad_norm": 1.1328125,
"learning_rate": 0.0004339460888906512,
"loss": 5.0355,
"mean_token_accuracy": 0.19490766674280166,
"num_tokens": 57118834.0,
"step": 32920
},
{
"entropy": 5.515558576583862,
"epoch": 2.5616806068858198,
"grad_norm": 1.1875,
"learning_rate": 0.0004339264709841299,
"loss": 5.1056,
"mean_token_accuracy": 0.18464373350143432,
"num_tokens": 57127672.0,
"step": 32925
},
{
"entropy": 5.349443244934082,
"epoch": 2.5620696362575375,
"grad_norm": 1.1796875,
"learning_rate": 0.00043390685066615244,
"loss": 4.9299,
"mean_token_accuracy": 0.2027969941496849,
"num_tokens": 57136209.0,
"step": 32930
},
{
"entropy": 5.383748340606689,
"epoch": 2.562458665629255,
"grad_norm": 1.3046875,
"learning_rate": 0.0004338872279370164,
"loss": 4.9702,
"mean_token_accuracy": 0.20087292641401291,
"num_tokens": 57144427.0,
"step": 32935
},
{
"entropy": 5.3785535335540775,
"epoch": 2.5628476950009724,
"grad_norm": 1.2265625,
"learning_rate": 0.0004338676027970196,
"loss": 5.1222,
"mean_token_accuracy": 0.18389095216989518,
"num_tokens": 57152860.0,
"step": 32940
},
{
"entropy": 5.466862726211548,
"epoch": 2.56323672437269,
"grad_norm": 1.1328125,
"learning_rate": 0.00043384797524645977,
"loss": 5.0028,
"mean_token_accuracy": 0.19488507509231567,
"num_tokens": 57162397.0,
"step": 32945
},
{
"entropy": 5.41713809967041,
"epoch": 2.563625753744408,
"grad_norm": 1.1328125,
"learning_rate": 0.0004338283452856348,
"loss": 4.9598,
"mean_token_accuracy": 0.20472395569086074,
"num_tokens": 57171178.0,
"step": 32950
},
{
"entropy": 5.410451507568359,
"epoch": 2.564014783116125,
"grad_norm": 1.1640625,
"learning_rate": 0.0004338087129148425,
"loss": 4.9631,
"mean_token_accuracy": 0.19792287200689315,
"num_tokens": 57178715.0,
"step": 32955
},
{
"entropy": 5.489461851119995,
"epoch": 2.5644038124878428,
"grad_norm": 1.2109375,
"learning_rate": 0.00043378907813438066,
"loss": 5.0525,
"mean_token_accuracy": 0.18811921030282974,
"num_tokens": 57187239.0,
"step": 32960
},
{
"entropy": 5.413202857971191,
"epoch": 2.5647928418595605,
"grad_norm": 1.1484375,
"learning_rate": 0.00043376944094454734,
"loss": 4.9757,
"mean_token_accuracy": 0.19294198751449584,
"num_tokens": 57195655.0,
"step": 32965
},
{
"entropy": 5.378011417388916,
"epoch": 2.565181871231278,
"grad_norm": 1.171875,
"learning_rate": 0.00043374980134564044,
"loss": 5.0412,
"mean_token_accuracy": 0.1912928506731987,
"num_tokens": 57205026.0,
"step": 32970
},
{
"entropy": 5.359329175949097,
"epoch": 2.5655709006029954,
"grad_norm": 1.171875,
"learning_rate": 0.00043373015933795804,
"loss": 4.9791,
"mean_token_accuracy": 0.19996938854455948,
"num_tokens": 57213344.0,
"step": 32975
},
{
"entropy": 5.407596635818481,
"epoch": 2.565959929974713,
"grad_norm": 1.171875,
"learning_rate": 0.0004337105149217981,
"loss": 4.9964,
"mean_token_accuracy": 0.19756337404251098,
"num_tokens": 57222174.0,
"step": 32980
},
{
"entropy": 5.339840602874756,
"epoch": 2.566348959346431,
"grad_norm": 1.1484375,
"learning_rate": 0.00043369086809745875,
"loss": 4.9765,
"mean_token_accuracy": 0.20119301974773407,
"num_tokens": 57231099.0,
"step": 32985
},
{
"entropy": 5.407732439041138,
"epoch": 2.566737988718148,
"grad_norm": 1.1875,
"learning_rate": 0.00043367121886523795,
"loss": 5.0139,
"mean_token_accuracy": 0.18738529533147813,
"num_tokens": 57239143.0,
"step": 32990
},
{
"entropy": 5.36846513748169,
"epoch": 2.5671270180898658,
"grad_norm": 1.1171875,
"learning_rate": 0.000433651567225434,
"loss": 5.0074,
"mean_token_accuracy": 0.20045491307973862,
"num_tokens": 57247971.0,
"step": 32995
},
{
"entropy": 5.37918062210083,
"epoch": 2.5675160474615835,
"grad_norm": 1.0703125,
"learning_rate": 0.0004336319131783451,
"loss": 4.9768,
"mean_token_accuracy": 0.20251345038414,
"num_tokens": 57256257.0,
"step": 33000
},
{
"epoch": 2.5675160474615835,
"eval_entropy": 5.225242014729828,
"eval_loss": 5.107059955596924,
"eval_mean_token_accuracy": 0.20114823337554702,
"eval_num_tokens": 57256257.0,
"eval_runtime": 28.7714,
"eval_samples_per_second": 1444.423,
"eval_steps_per_second": 180.562,
"step": 33000
},
{
"entropy": 5.413814687728882,
"epoch": 2.567905076833301,
"grad_norm": 1.1796875,
"learning_rate": 0.00043361225672426933,
"loss": 4.9923,
"mean_token_accuracy": 0.19678923338651658,
"num_tokens": 57264729.0,
"step": 33005
},
{
"entropy": 5.4247291564941404,
"epoch": 2.5682941062050184,
"grad_norm": 1.171875,
"learning_rate": 0.0004335925978635051,
"loss": 5.0558,
"mean_token_accuracy": 0.19453096389770508,
"num_tokens": 57273370.0,
"step": 33010
},
{
"entropy": 5.395574617385864,
"epoch": 2.568683135576736,
"grad_norm": 1.1875,
"learning_rate": 0.00043357293659635057,
"loss": 5.0148,
"mean_token_accuracy": 0.20081795006990433,
"num_tokens": 57282466.0,
"step": 33015
},
{
"entropy": 5.368965578079224,
"epoch": 2.5690721649484534,
"grad_norm": 1.109375,
"learning_rate": 0.0004335532729231041,
"loss": 4.981,
"mean_token_accuracy": 0.19570138901472092,
"num_tokens": 57291015.0,
"step": 33020
},
{
"entropy": 5.431451797485352,
"epoch": 2.569461194320171,
"grad_norm": 1.078125,
"learning_rate": 0.00043353360684406415,
"loss": 5.0581,
"mean_token_accuracy": 0.18931750059127808,
"num_tokens": 57300941.0,
"step": 33025
},
{
"entropy": 5.458180999755859,
"epoch": 2.5698502236918888,
"grad_norm": 1.2734375,
"learning_rate": 0.000433513938359529,
"loss": 5.0361,
"mean_token_accuracy": 0.1933378830552101,
"num_tokens": 57310412.0,
"step": 33030
},
{
"entropy": 5.491437196731567,
"epoch": 2.5702392530636065,
"grad_norm": 1.1796875,
"learning_rate": 0.0004334942674697971,
"loss": 5.1068,
"mean_token_accuracy": 0.19497440457344056,
"num_tokens": 57319262.0,
"step": 33035
},
{
"entropy": 5.387307929992676,
"epoch": 2.5706282824353237,
"grad_norm": 1.1015625,
"learning_rate": 0.00043347459417516696,
"loss": 5.0219,
"mean_token_accuracy": 0.1937669724225998,
"num_tokens": 57327279.0,
"step": 33040
},
{
"entropy": 5.3643852233886715,
"epoch": 2.5710173118070414,
"grad_norm": 1.1875,
"learning_rate": 0.0004334549184759371,
"loss": 4.8888,
"mean_token_accuracy": 0.20984860211610795,
"num_tokens": 57335498.0,
"step": 33045
},
{
"entropy": 5.391560173034668,
"epoch": 2.571406341178759,
"grad_norm": 1.109375,
"learning_rate": 0.0004334352403724062,
"loss": 5.0766,
"mean_token_accuracy": 0.19173777252435684,
"num_tokens": 57345134.0,
"step": 33050
},
{
"entropy": 5.455765199661255,
"epoch": 2.5717953705504764,
"grad_norm": 1.1484375,
"learning_rate": 0.00043341555986487254,
"loss": 5.0762,
"mean_token_accuracy": 0.19486733824014663,
"num_tokens": 57353451.0,
"step": 33055
},
{
"entropy": 5.424337434768677,
"epoch": 2.572184399922194,
"grad_norm": 1.1015625,
"learning_rate": 0.0004333958769536349,
"loss": 5.0069,
"mean_token_accuracy": 0.19521381258964537,
"num_tokens": 57362990.0,
"step": 33060
},
{
"entropy": 5.38012661933899,
"epoch": 2.5725734292939118,
"grad_norm": 1.140625,
"learning_rate": 0.0004333761916389921,
"loss": 4.9773,
"mean_token_accuracy": 0.20276968777179719,
"num_tokens": 57371572.0,
"step": 33065
},
{
"entropy": 5.313905858993531,
"epoch": 2.5729624586656294,
"grad_norm": 1.1953125,
"learning_rate": 0.0004333565039212425,
"loss": 4.9155,
"mean_token_accuracy": 0.19919805526733397,
"num_tokens": 57380558.0,
"step": 33070
},
{
"entropy": 5.33050856590271,
"epoch": 2.5733514880373467,
"grad_norm": 1.1328125,
"learning_rate": 0.0004333368138006851,
"loss": 4.8613,
"mean_token_accuracy": 0.20112494379281998,
"num_tokens": 57389636.0,
"step": 33075
},
{
"entropy": 5.369415426254273,
"epoch": 2.5737405174090644,
"grad_norm": 1.265625,
"learning_rate": 0.0004333171212776185,
"loss": 4.9145,
"mean_token_accuracy": 0.20189293324947358,
"num_tokens": 57397546.0,
"step": 33080
},
{
"entropy": 5.4264226913452145,
"epoch": 2.574129546780782,
"grad_norm": 1.2109375,
"learning_rate": 0.0004332974263523416,
"loss": 5.1077,
"mean_token_accuracy": 0.19806709587574006,
"num_tokens": 57406981.0,
"step": 33085
},
{
"entropy": 5.462457370758057,
"epoch": 2.5745185761524993,
"grad_norm": 1.1953125,
"learning_rate": 0.00043327772902515327,
"loss": 5.0484,
"mean_token_accuracy": 0.19725337475538254,
"num_tokens": 57416016.0,
"step": 33090
},
{
"entropy": 5.4115729331970215,
"epoch": 2.574907605524217,
"grad_norm": 1.1328125,
"learning_rate": 0.0004332580292963523,
"loss": 5.0417,
"mean_token_accuracy": 0.19376862794160843,
"num_tokens": 57425086.0,
"step": 33095
},
{
"entropy": 5.413253831863403,
"epoch": 2.5752966348959347,
"grad_norm": 1.1171875,
"learning_rate": 0.0004332383271662376,
"loss": 5.0351,
"mean_token_accuracy": 0.19673244804143905,
"num_tokens": 57433982.0,
"step": 33100
},
{
"entropy": 5.392880487442016,
"epoch": 2.5756856642676524,
"grad_norm": 1.1640625,
"learning_rate": 0.00043321862263510816,
"loss": 4.8738,
"mean_token_accuracy": 0.20307066887617112,
"num_tokens": 57442922.0,
"step": 33105
},
{
"entropy": 5.421650362014771,
"epoch": 2.5760746936393697,
"grad_norm": 1.1484375,
"learning_rate": 0.0004331989157032629,
"loss": 5.0623,
"mean_token_accuracy": 0.1904524713754654,
"num_tokens": 57452373.0,
"step": 33110
},
{
"entropy": 5.3493452072143555,
"epoch": 2.5764637230110874,
"grad_norm": 1.15625,
"learning_rate": 0.00043317920637100097,
"loss": 4.9726,
"mean_token_accuracy": 0.20032243877649308,
"num_tokens": 57460741.0,
"step": 33115
},
{
"entropy": 5.314668989181518,
"epoch": 2.5768527523828046,
"grad_norm": 1.140625,
"learning_rate": 0.0004331594946386213,
"loss": 4.9618,
"mean_token_accuracy": 0.20291125774383545,
"num_tokens": 57469488.0,
"step": 33120
},
{
"entropy": 5.396224880218506,
"epoch": 2.5772417817545223,
"grad_norm": 1.125,
"learning_rate": 0.00043313978050642303,
"loss": 5.0236,
"mean_token_accuracy": 0.1925004705786705,
"num_tokens": 57478560.0,
"step": 33125
},
{
"entropy": 5.366699075698852,
"epoch": 2.57763081112624,
"grad_norm": 1.1640625,
"learning_rate": 0.0004331200639747053,
"loss": 4.9139,
"mean_token_accuracy": 0.20285016745328904,
"num_tokens": 57486670.0,
"step": 33130
},
{
"entropy": 5.405358362197876,
"epoch": 2.5780198404979577,
"grad_norm": 1.171875,
"learning_rate": 0.0004331003450437674,
"loss": 5.0293,
"mean_token_accuracy": 0.19352518767118454,
"num_tokens": 57495676.0,
"step": 33135
},
{
"entropy": 5.360350704193115,
"epoch": 2.5784088698696754,
"grad_norm": 1.140625,
"learning_rate": 0.0004330806237139083,
"loss": 4.9182,
"mean_token_accuracy": 0.20335044264793395,
"num_tokens": 57504422.0,
"step": 33140
},
{
"entropy": 5.352314424514771,
"epoch": 2.5787978992413927,
"grad_norm": 1.1640625,
"learning_rate": 0.0004330608999854273,
"loss": 4.9414,
"mean_token_accuracy": 0.19750514328479768,
"num_tokens": 57514555.0,
"step": 33145
},
{
"entropy": 5.305916357040405,
"epoch": 2.5791869286131104,
"grad_norm": 1.1328125,
"learning_rate": 0.0004330411738586238,
"loss": 4.8386,
"mean_token_accuracy": 0.20582491010427476,
"num_tokens": 57523088.0,
"step": 33150
},
{
"entropy": 5.314565753936767,
"epoch": 2.5795759579848276,
"grad_norm": 1.3359375,
"learning_rate": 0.000433021445333797,
"loss": 4.9598,
"mean_token_accuracy": 0.19909641444683074,
"num_tokens": 57530890.0,
"step": 33155
},
{
"entropy": 5.3788117408752445,
"epoch": 2.5799649873565453,
"grad_norm": 1.1328125,
"learning_rate": 0.00043300171441124633,
"loss": 5.0124,
"mean_token_accuracy": 0.19969138354063035,
"num_tokens": 57539834.0,
"step": 33160
},
{
"entropy": 5.354266166687012,
"epoch": 2.580354016728263,
"grad_norm": 1.1484375,
"learning_rate": 0.0004329819810912711,
"loss": 4.9791,
"mean_token_accuracy": 0.19698383361101152,
"num_tokens": 57548962.0,
"step": 33165
},
{
"entropy": 5.332692718505859,
"epoch": 2.5807430460999807,
"grad_norm": 1.1640625,
"learning_rate": 0.00043296224537417075,
"loss": 4.8862,
"mean_token_accuracy": 0.21002040505409242,
"num_tokens": 57557460.0,
"step": 33170
},
{
"entropy": 5.353478670120239,
"epoch": 2.581132075471698,
"grad_norm": 1.1875,
"learning_rate": 0.00043294250726024473,
"loss": 4.8462,
"mean_token_accuracy": 0.20843254327774047,
"num_tokens": 57566053.0,
"step": 33175
},
{
"entropy": 5.329200506210327,
"epoch": 2.5815211048434157,
"grad_norm": 1.140625,
"learning_rate": 0.0004329227667497926,
"loss": 4.9446,
"mean_token_accuracy": 0.19803692847490312,
"num_tokens": 57575268.0,
"step": 33180
},
{
"entropy": 5.304578065872192,
"epoch": 2.5819101342151334,
"grad_norm": 1.1328125,
"learning_rate": 0.00043290302384311373,
"loss": 4.9211,
"mean_token_accuracy": 0.20540099292993547,
"num_tokens": 57583518.0,
"step": 33185
},
{
"entropy": 5.304705095291138,
"epoch": 2.5822991635868506,
"grad_norm": 1.0703125,
"learning_rate": 0.00043288327854050794,
"loss": 4.9048,
"mean_token_accuracy": 0.20250073373317717,
"num_tokens": 57592300.0,
"step": 33190
},
{
"entropy": 5.400116443634033,
"epoch": 2.5826881929585683,
"grad_norm": 1.1953125,
"learning_rate": 0.00043286353084227467,
"loss": 5.0696,
"mean_token_accuracy": 0.19330461472272872,
"num_tokens": 57600694.0,
"step": 33195
},
{
"entropy": 5.418210506439209,
"epoch": 2.583077222330286,
"grad_norm": 1.1953125,
"learning_rate": 0.00043284378074871354,
"loss": 5.0819,
"mean_token_accuracy": 0.19335220605134965,
"num_tokens": 57609213.0,
"step": 33200
},
{
"entropy": 5.3627111434936525,
"epoch": 2.5834662517020037,
"grad_norm": 1.140625,
"learning_rate": 0.0004328240282601243,
"loss": 4.9673,
"mean_token_accuracy": 0.1970252960920334,
"num_tokens": 57617466.0,
"step": 33205
},
{
"entropy": 5.3151157855987545,
"epoch": 2.583855281073721,
"grad_norm": 1.109375,
"learning_rate": 0.0004328042733768066,
"loss": 4.9886,
"mean_token_accuracy": 0.19520671516656876,
"num_tokens": 57626620.0,
"step": 33210
},
{
"entropy": 5.491671371459961,
"epoch": 2.5842443104454387,
"grad_norm": 1.2265625,
"learning_rate": 0.00043278451609906027,
"loss": 5.0433,
"mean_token_accuracy": 0.19643065929412842,
"num_tokens": 57635230.0,
"step": 33215
},
{
"entropy": 5.407395267486573,
"epoch": 2.584633339817156,
"grad_norm": 1.109375,
"learning_rate": 0.00043276475642718503,
"loss": 5.0164,
"mean_token_accuracy": 0.19349130541086196,
"num_tokens": 57644444.0,
"step": 33220
},
{
"entropy": 5.435800695419312,
"epoch": 2.5850223691888736,
"grad_norm": 1.171875,
"learning_rate": 0.0004327449943614808,
"loss": 5.0449,
"mean_token_accuracy": 0.19325482100248337,
"num_tokens": 57653282.0,
"step": 33225
},
{
"entropy": 5.406891775131226,
"epoch": 2.5854113985605913,
"grad_norm": 1.1640625,
"learning_rate": 0.00043272522990224727,
"loss": 5.0086,
"mean_token_accuracy": 0.19932658821344376,
"num_tokens": 57661153.0,
"step": 33230
},
{
"entropy": 5.417339038848877,
"epoch": 2.585800427932309,
"grad_norm": 1.1875,
"learning_rate": 0.0004327054630497844,
"loss": 5.07,
"mean_token_accuracy": 0.18848597705364228,
"num_tokens": 57669613.0,
"step": 33235
},
{
"entropy": 5.410283136367798,
"epoch": 2.5861894573040267,
"grad_norm": 1.15625,
"learning_rate": 0.00043268569380439223,
"loss": 5.0032,
"mean_token_accuracy": 0.19211409091949463,
"num_tokens": 57678174.0,
"step": 33240
},
{
"entropy": 5.367795515060425,
"epoch": 2.586578486675744,
"grad_norm": 1.203125,
"learning_rate": 0.0004326659221663705,
"loss": 5.0202,
"mean_token_accuracy": 0.20239814817905427,
"num_tokens": 57687117.0,
"step": 33245
},
{
"entropy": 5.435872602462768,
"epoch": 2.5869675160474617,
"grad_norm": 1.1328125,
"learning_rate": 0.0004326461481360194,
"loss": 5.0582,
"mean_token_accuracy": 0.19274805784225463,
"num_tokens": 57695073.0,
"step": 33250
},
{
"entropy": 5.3038006782531735,
"epoch": 2.587356545419179,
"grad_norm": 1.1171875,
"learning_rate": 0.00043262637171363906,
"loss": 4.864,
"mean_token_accuracy": 0.20748745203018187,
"num_tokens": 57703856.0,
"step": 33255
},
{
"entropy": 5.348478031158447,
"epoch": 2.5877455747908966,
"grad_norm": 1.2265625,
"learning_rate": 0.00043260659289952926,
"loss": 4.8734,
"mean_token_accuracy": 0.20475658029317856,
"num_tokens": 57712072.0,
"step": 33260
},
{
"entropy": 5.363431644439697,
"epoch": 2.5881346041626143,
"grad_norm": 1.109375,
"learning_rate": 0.00043258681169399034,
"loss": 4.9949,
"mean_token_accuracy": 0.1994979441165924,
"num_tokens": 57721203.0,
"step": 33265
},
{
"entropy": 5.446130037307739,
"epoch": 2.588523633534332,
"grad_norm": 1.125,
"learning_rate": 0.00043256702809732234,
"loss": 5.1156,
"mean_token_accuracy": 0.18319649547338485,
"num_tokens": 57730591.0,
"step": 33270
},
{
"entropy": 5.431209754943848,
"epoch": 2.5889126629060493,
"grad_norm": 1.171875,
"learning_rate": 0.0004325472421098255,
"loss": 4.9862,
"mean_token_accuracy": 0.20028135031461716,
"num_tokens": 57739390.0,
"step": 33275
},
{
"entropy": 5.364736700057984,
"epoch": 2.589301692277767,
"grad_norm": 1.0625,
"learning_rate": 0.00043252745373180006,
"loss": 4.9378,
"mean_token_accuracy": 0.19527646899223328,
"num_tokens": 57748008.0,
"step": 33280
},
{
"entropy": 5.491778087615967,
"epoch": 2.5896907216494847,
"grad_norm": 1.1953125,
"learning_rate": 0.0004325076629635462,
"loss": 5.2218,
"mean_token_accuracy": 0.17947924733161927,
"num_tokens": 57757471.0,
"step": 33285
},
{
"entropy": 5.401350831985473,
"epoch": 2.590079751021202,
"grad_norm": 1.125,
"learning_rate": 0.00043248786980536424,
"loss": 5.0029,
"mean_token_accuracy": 0.1967273473739624,
"num_tokens": 57766534.0,
"step": 33290
},
{
"entropy": 5.345935344696045,
"epoch": 2.5904687803929196,
"grad_norm": 1.1484375,
"learning_rate": 0.0004324680742575545,
"loss": 4.8953,
"mean_token_accuracy": 0.20851390063762665,
"num_tokens": 57775011.0,
"step": 33295
},
{
"entropy": 5.3977484703063965,
"epoch": 2.5908578097646373,
"grad_norm": 1.2109375,
"learning_rate": 0.00043244827632041744,
"loss": 5.0336,
"mean_token_accuracy": 0.19835421741008757,
"num_tokens": 57783606.0,
"step": 33300
},
{
"entropy": 5.400182771682739,
"epoch": 2.591246839136355,
"grad_norm": 1.1171875,
"learning_rate": 0.0004324284759942534,
"loss": 4.9326,
"mean_token_accuracy": 0.20325964093208312,
"num_tokens": 57792170.0,
"step": 33305
},
{
"entropy": 5.286184310913086,
"epoch": 2.5916358685080723,
"grad_norm": 1.1015625,
"learning_rate": 0.0004324086732793627,
"loss": 4.8855,
"mean_token_accuracy": 0.20280107259750366,
"num_tokens": 57801379.0,
"step": 33310
},
{
"entropy": 5.3384490489959715,
"epoch": 2.59202489787979,
"grad_norm": 1.1484375,
"learning_rate": 0.00043238886817604605,
"loss": 4.9639,
"mean_token_accuracy": 0.20065830945968627,
"num_tokens": 57810135.0,
"step": 33315
},
{
"entropy": 5.338615369796753,
"epoch": 2.5924139272515077,
"grad_norm": 1.1484375,
"learning_rate": 0.0004323690606846039,
"loss": 4.914,
"mean_token_accuracy": 0.19939966946840287,
"num_tokens": 57818314.0,
"step": 33320
},
{
"entropy": 5.358572483062744,
"epoch": 2.592802956623225,
"grad_norm": 1.09375,
"learning_rate": 0.00043234925080533657,
"loss": 4.9464,
"mean_token_accuracy": 0.1990666553378105,
"num_tokens": 57826883.0,
"step": 33325
},
{
"entropy": 5.355516672134399,
"epoch": 2.5931919859949426,
"grad_norm": 1.09375,
"learning_rate": 0.0004323294385385448,
"loss": 4.8993,
"mean_token_accuracy": 0.19940508753061295,
"num_tokens": 57835215.0,
"step": 33330
},
{
"entropy": 5.323538827896118,
"epoch": 2.5935810153666603,
"grad_norm": 1.2265625,
"learning_rate": 0.0004323096238845293,
"loss": 4.9941,
"mean_token_accuracy": 0.19791705012321473,
"num_tokens": 57844002.0,
"step": 33335
},
{
"entropy": 5.403586101531983,
"epoch": 2.593970044738378,
"grad_norm": 1.1015625,
"learning_rate": 0.0004322898068435906,
"loss": 5.032,
"mean_token_accuracy": 0.19159453362226486,
"num_tokens": 57852453.0,
"step": 33340
},
{
"entropy": 5.3783244609832765,
"epoch": 2.5943590741100953,
"grad_norm": 1.140625,
"learning_rate": 0.0004322699874160294,
"loss": 4.918,
"mean_token_accuracy": 0.1978710949420929,
"num_tokens": 57860807.0,
"step": 33345
},
{
"entropy": 5.380287170410156,
"epoch": 2.594748103481813,
"grad_norm": 1.125,
"learning_rate": 0.00043225016560214654,
"loss": 4.9441,
"mean_token_accuracy": 0.19851536452770233,
"num_tokens": 57869768.0,
"step": 33350
},
{
"entropy": 5.436203908920288,
"epoch": 2.59513713285353,
"grad_norm": 1.171875,
"learning_rate": 0.00043223034140224266,
"loss": 4.9888,
"mean_token_accuracy": 0.1956920713186264,
"num_tokens": 57878089.0,
"step": 33355
},
{
"entropy": 5.407066535949707,
"epoch": 2.595526162225248,
"grad_norm": 1.09375,
"learning_rate": 0.0004322105148166187,
"loss": 5.0088,
"mean_token_accuracy": 0.19682322889566423,
"num_tokens": 57886468.0,
"step": 33360
},
{
"entropy": 5.425498676300049,
"epoch": 2.5959151915969656,
"grad_norm": 1.1328125,
"learning_rate": 0.00043219068584557526,
"loss": 5.0582,
"mean_token_accuracy": 0.1881077229976654,
"num_tokens": 57895993.0,
"step": 33365
},
{
"entropy": 5.302031803131103,
"epoch": 2.5963042209686833,
"grad_norm": 1.2734375,
"learning_rate": 0.0004321708544894134,
"loss": 4.9102,
"mean_token_accuracy": 0.2070611983537674,
"num_tokens": 57904464.0,
"step": 33370
},
{
"entropy": 5.336132526397705,
"epoch": 2.5966932503404005,
"grad_norm": 1.1640625,
"learning_rate": 0.00043215102074843403,
"loss": 5.0377,
"mean_token_accuracy": 0.1914057031273842,
"num_tokens": 57912711.0,
"step": 33375
},
{
"entropy": 5.358402490615845,
"epoch": 2.5970822797121182,
"grad_norm": 1.1328125,
"learning_rate": 0.00043213118462293796,
"loss": 4.9883,
"mean_token_accuracy": 0.1957697793841362,
"num_tokens": 57920926.0,
"step": 33380
},
{
"entropy": 5.377789688110352,
"epoch": 2.597471309083836,
"grad_norm": 1.1328125,
"learning_rate": 0.0004321113461132264,
"loss": 4.923,
"mean_token_accuracy": 0.2050103187561035,
"num_tokens": 57930346.0,
"step": 33385
},
{
"entropy": 5.384866571426391,
"epoch": 2.597860338455553,
"grad_norm": 1.1328125,
"learning_rate": 0.00043209150521960016,
"loss": 5.0201,
"mean_token_accuracy": 0.20044273883104324,
"num_tokens": 57938578.0,
"step": 33390
},
{
"entropy": 5.453577899932862,
"epoch": 2.598249367827271,
"grad_norm": 1.171875,
"learning_rate": 0.00043207166194236037,
"loss": 5.1144,
"mean_token_accuracy": 0.18646508008241652,
"num_tokens": 57947505.0,
"step": 33395
},
{
"entropy": 5.482055187225342,
"epoch": 2.5986383971989886,
"grad_norm": 1.1796875,
"learning_rate": 0.0004320518162818082,
"loss": 4.939,
"mean_token_accuracy": 0.19564956575632095,
"num_tokens": 57955806.0,
"step": 33400
},
{
"entropy": 5.4250589370727536,
"epoch": 2.5990274265707063,
"grad_norm": 1.2265625,
"learning_rate": 0.0004320319682382445,
"loss": 5.1483,
"mean_token_accuracy": 0.18234062492847442,
"num_tokens": 57964275.0,
"step": 33405
},
{
"entropy": 5.434121942520141,
"epoch": 2.5994164559424235,
"grad_norm": 1.140625,
"learning_rate": 0.00043201211781197075,
"loss": 5.0409,
"mean_token_accuracy": 0.19781838804483415,
"num_tokens": 57973616.0,
"step": 33410
},
{
"entropy": 5.450970888137817,
"epoch": 2.5998054853141412,
"grad_norm": 1.21875,
"learning_rate": 0.00043199226500328805,
"loss": 5.1049,
"mean_token_accuracy": 0.1951995775103569,
"num_tokens": 57982809.0,
"step": 33415
},
{
"entropy": 5.414273405075074,
"epoch": 2.600194514685859,
"grad_norm": 1.1171875,
"learning_rate": 0.0004319724098124975,
"loss": 4.9125,
"mean_token_accuracy": 0.2019151344895363,
"num_tokens": 57991239.0,
"step": 33420
},
{
"entropy": 5.362340831756592,
"epoch": 2.600583544057576,
"grad_norm": 1.203125,
"learning_rate": 0.00043195255223990055,
"loss": 4.9696,
"mean_token_accuracy": 0.20104119628667833,
"num_tokens": 57999213.0,
"step": 33425
},
{
"entropy": 5.36564269065857,
"epoch": 2.600972573429294,
"grad_norm": 1.2109375,
"learning_rate": 0.0004319326922857984,
"loss": 5.0106,
"mean_token_accuracy": 0.19516161382198333,
"num_tokens": 58008289.0,
"step": 33430
},
{
"entropy": 5.361428165435791,
"epoch": 2.6013616028010116,
"grad_norm": 1.1640625,
"learning_rate": 0.0004319128299504925,
"loss": 4.9513,
"mean_token_accuracy": 0.20214540958404542,
"num_tokens": 58017495.0,
"step": 33435
},
{
"entropy": 5.430932569503784,
"epoch": 2.6017506321727293,
"grad_norm": 1.1796875,
"learning_rate": 0.00043189296523428407,
"loss": 5.0268,
"mean_token_accuracy": 0.20148614346981047,
"num_tokens": 58026368.0,
"step": 33440
},
{
"entropy": 5.447061967849732,
"epoch": 2.6021396615444465,
"grad_norm": 1.25,
"learning_rate": 0.00043187309813747464,
"loss": 5.0713,
"mean_token_accuracy": 0.19386893659830093,
"num_tokens": 58035086.0,
"step": 33445
},
{
"entropy": 5.34666953086853,
"epoch": 2.6025286909161642,
"grad_norm": 1.1640625,
"learning_rate": 0.00043185322866036565,
"loss": 4.976,
"mean_token_accuracy": 0.19845239222049713,
"num_tokens": 58044050.0,
"step": 33450
},
{
"entropy": 5.373878765106201,
"epoch": 2.6029177202878815,
"grad_norm": 1.1640625,
"learning_rate": 0.00043183335680325866,
"loss": 4.9453,
"mean_token_accuracy": 0.19822389185428618,
"num_tokens": 58052257.0,
"step": 33455
},
{
"entropy": 5.495786714553833,
"epoch": 2.603306749659599,
"grad_norm": 1.15625,
"learning_rate": 0.00043181348256645497,
"loss": 5.1083,
"mean_token_accuracy": 0.1913090705871582,
"num_tokens": 58060742.0,
"step": 33460
},
{
"entropy": 5.390940570831299,
"epoch": 2.603695779031317,
"grad_norm": 1.109375,
"learning_rate": 0.00043179360595025637,
"loss": 4.985,
"mean_token_accuracy": 0.18620100170373916,
"num_tokens": 58069697.0,
"step": 33465
},
{
"entropy": 5.38796215057373,
"epoch": 2.6040848084030346,
"grad_norm": 1.203125,
"learning_rate": 0.0004317737269549643,
"loss": 4.9387,
"mean_token_accuracy": 0.20443542748689653,
"num_tokens": 58077875.0,
"step": 33470
},
{
"entropy": 5.444569206237793,
"epoch": 2.604473837774752,
"grad_norm": 1.15625,
"learning_rate": 0.0004317538455808805,
"loss": 5.0667,
"mean_token_accuracy": 0.2035176157951355,
"num_tokens": 58086500.0,
"step": 33475
},
{
"entropy": 5.317563009262085,
"epoch": 2.6048628671464695,
"grad_norm": 1.078125,
"learning_rate": 0.0004317339618283065,
"loss": 4.9782,
"mean_token_accuracy": 0.20005602091550828,
"num_tokens": 58095851.0,
"step": 33480
},
{
"entropy": 5.404316806793213,
"epoch": 2.6052518965181872,
"grad_norm": 1.109375,
"learning_rate": 0.0004317140756975442,
"loss": 4.9898,
"mean_token_accuracy": 0.19976191222667694,
"num_tokens": 58104462.0,
"step": 33485
},
{
"entropy": 5.462735033035278,
"epoch": 2.6056409258899045,
"grad_norm": 1.1484375,
"learning_rate": 0.0004316941871888951,
"loss": 5.0517,
"mean_token_accuracy": 0.19242407381534576,
"num_tokens": 58112698.0,
"step": 33490
},
{
"entropy": 5.483326816558838,
"epoch": 2.606029955261622,
"grad_norm": 1.1640625,
"learning_rate": 0.00043167429630266134,
"loss": 5.038,
"mean_token_accuracy": 0.19808955490589142,
"num_tokens": 58121807.0,
"step": 33495
},
{
"entropy": 5.320720052719116,
"epoch": 2.60641898463334,
"grad_norm": 1.15625,
"learning_rate": 0.0004316544030391444,
"loss": 4.9491,
"mean_token_accuracy": 0.2017153114080429,
"num_tokens": 58129824.0,
"step": 33500
},
{
"entropy": 5.434066486358643,
"epoch": 2.6068080140050576,
"grad_norm": 1.1484375,
"learning_rate": 0.0004316345073986461,
"loss": 4.9816,
"mean_token_accuracy": 0.2034386456012726,
"num_tokens": 58138083.0,
"step": 33505
},
{
"entropy": 5.4078453540802,
"epoch": 2.607197043376775,
"grad_norm": 1.2265625,
"learning_rate": 0.0004316146093814686,
"loss": 4.9596,
"mean_token_accuracy": 0.20940833538770676,
"num_tokens": 58146631.0,
"step": 33510
},
{
"entropy": 5.407180452346802,
"epoch": 2.6075860727484925,
"grad_norm": 1.1875,
"learning_rate": 0.0004315947089879137,
"loss": 4.9712,
"mean_token_accuracy": 0.2028502568602562,
"num_tokens": 58154867.0,
"step": 33515
},
{
"entropy": 5.400879716873169,
"epoch": 2.60797510212021,
"grad_norm": 1.203125,
"learning_rate": 0.00043157480621828327,
"loss": 5.0245,
"mean_token_accuracy": 0.19606868475675582,
"num_tokens": 58163887.0,
"step": 33520
},
{
"entropy": 5.268083000183106,
"epoch": 2.6083641314919275,
"grad_norm": 1.140625,
"learning_rate": 0.00043155490107287935,
"loss": 4.8678,
"mean_token_accuracy": 0.20641232430934905,
"num_tokens": 58172731.0,
"step": 33525
},
{
"entropy": 5.272877883911133,
"epoch": 2.608753160863645,
"grad_norm": 1.1328125,
"learning_rate": 0.0004315349935520041,
"loss": 4.942,
"mean_token_accuracy": 0.2051867887377739,
"num_tokens": 58181619.0,
"step": 33530
},
{
"entropy": 5.373648023605346,
"epoch": 2.609142190235363,
"grad_norm": 1.1484375,
"learning_rate": 0.0004315150836559594,
"loss": 5.0311,
"mean_token_accuracy": 0.19761501699686052,
"num_tokens": 58190560.0,
"step": 33535
},
{
"entropy": 5.441530418395996,
"epoch": 2.6095312196070806,
"grad_norm": 1.28125,
"learning_rate": 0.0004314951713850474,
"loss": 5.0089,
"mean_token_accuracy": 0.19229307621717454,
"num_tokens": 58199212.0,
"step": 33540
},
{
"entropy": 5.425258159637451,
"epoch": 2.609920248978798,
"grad_norm": 1.15625,
"learning_rate": 0.00043147525673957026,
"loss": 4.9845,
"mean_token_accuracy": 0.19686296880245208,
"num_tokens": 58207704.0,
"step": 33545
},
{
"entropy": 5.367642974853515,
"epoch": 2.6103092783505155,
"grad_norm": 1.0859375,
"learning_rate": 0.00043145533971983025,
"loss": 5.0492,
"mean_token_accuracy": 0.1920822188258171,
"num_tokens": 58217238.0,
"step": 33550
},
{
"entropy": 5.449360513687134,
"epoch": 2.6106983077222328,
"grad_norm": 1.1640625,
"learning_rate": 0.00043143542032612935,
"loss": 5.0274,
"mean_token_accuracy": 0.20017631500959396,
"num_tokens": 58226732.0,
"step": 33555
},
{
"entropy": 5.36535611152649,
"epoch": 2.6110873370939505,
"grad_norm": 1.1796875,
"learning_rate": 0.0004314154985587701,
"loss": 4.9919,
"mean_token_accuracy": 0.20248396843671798,
"num_tokens": 58234602.0,
"step": 33560
},
{
"entropy": 5.351151371002198,
"epoch": 2.611476366465668,
"grad_norm": 1.1015625,
"learning_rate": 0.00043139557441805457,
"loss": 5.0405,
"mean_token_accuracy": 0.1909555420279503,
"num_tokens": 58242557.0,
"step": 33565
},
{
"entropy": 5.391464948654175,
"epoch": 2.611865395837386,
"grad_norm": 1.28125,
"learning_rate": 0.00043137564790428503,
"loss": 5.0353,
"mean_token_accuracy": 0.20138774961233138,
"num_tokens": 58251805.0,
"step": 33570
},
{
"entropy": 5.348659992218018,
"epoch": 2.6122544252091036,
"grad_norm": 0.984375,
"learning_rate": 0.00043135571901776397,
"loss": 4.9638,
"mean_token_accuracy": 0.19846826195716857,
"num_tokens": 58261241.0,
"step": 33575
},
{
"entropy": 5.382275581359863,
"epoch": 2.612643454580821,
"grad_norm": 1.2109375,
"learning_rate": 0.0004313357877587937,
"loss": 4.9973,
"mean_token_accuracy": 0.20166804790496826,
"num_tokens": 58269965.0,
"step": 33580
},
{
"entropy": 5.3865598201751705,
"epoch": 2.6130324839525385,
"grad_norm": 1.1953125,
"learning_rate": 0.0004313158541276768,
"loss": 4.9723,
"mean_token_accuracy": 0.20207246541976928,
"num_tokens": 58278420.0,
"step": 33585
},
{
"entropy": 5.338783216476441,
"epoch": 2.6134215133242558,
"grad_norm": 1.1015625,
"learning_rate": 0.0004312959181247156,
"loss": 4.9262,
"mean_token_accuracy": 0.2015075668692589,
"num_tokens": 58287384.0,
"step": 33590
},
{
"entropy": 5.291149282455445,
"epoch": 2.6138105426959735,
"grad_norm": 1.15625,
"learning_rate": 0.0004312759797502126,
"loss": 4.9306,
"mean_token_accuracy": 0.19975651651620865,
"num_tokens": 58295312.0,
"step": 33595
},
{
"entropy": 5.357451438903809,
"epoch": 2.614199572067691,
"grad_norm": 1.1796875,
"learning_rate": 0.00043125603900447026,
"loss": 4.9649,
"mean_token_accuracy": 0.20000729858875274,
"num_tokens": 58303387.0,
"step": 33600
},
{
"entropy": 5.385416889190674,
"epoch": 2.614588601439409,
"grad_norm": 1.1484375,
"learning_rate": 0.0004312360958877913,
"loss": 4.9468,
"mean_token_accuracy": 0.20525642931461335,
"num_tokens": 58312368.0,
"step": 33605
},
{
"entropy": 5.305874252319336,
"epoch": 2.614977630811126,
"grad_norm": 1.2109375,
"learning_rate": 0.0004312161504004782,
"loss": 4.9441,
"mean_token_accuracy": 0.1985933244228363,
"num_tokens": 58320639.0,
"step": 33610
},
{
"entropy": 5.264783668518066,
"epoch": 2.615366660182844,
"grad_norm": 1.1484375,
"learning_rate": 0.00043119620254283375,
"loss": 4.8839,
"mean_token_accuracy": 0.19962702691555023,
"num_tokens": 58329180.0,
"step": 33615
},
{
"entropy": 5.394754123687744,
"epoch": 2.6157556895545615,
"grad_norm": 1.1640625,
"learning_rate": 0.00043117625231516054,
"loss": 4.9193,
"mean_token_accuracy": 0.20725204199552535,
"num_tokens": 58337837.0,
"step": 33620
},
{
"entropy": 5.412404537200928,
"epoch": 2.6161447189262788,
"grad_norm": 1.15625,
"learning_rate": 0.0004311562997177612,
"loss": 4.9101,
"mean_token_accuracy": 0.2074065238237381,
"num_tokens": 58347000.0,
"step": 33625
},
{
"entropy": 5.265352869033814,
"epoch": 2.6165337482979965,
"grad_norm": 1.1015625,
"learning_rate": 0.0004311363447509386,
"loss": 4.9333,
"mean_token_accuracy": 0.20111688524484633,
"num_tokens": 58355895.0,
"step": 33630
},
{
"entropy": 5.328054332733155,
"epoch": 2.616922777669714,
"grad_norm": 1.1171875,
"learning_rate": 0.0004311163874149955,
"loss": 4.9818,
"mean_token_accuracy": 0.1935916304588318,
"num_tokens": 58364653.0,
"step": 33635
},
{
"entropy": 5.369314670562744,
"epoch": 2.617311807041432,
"grad_norm": 1.078125,
"learning_rate": 0.00043109642771023464,
"loss": 4.8715,
"mean_token_accuracy": 0.2120027795433998,
"num_tokens": 58374157.0,
"step": 33640
},
{
"entropy": 5.442177724838257,
"epoch": 2.617700836413149,
"grad_norm": 1.25,
"learning_rate": 0.0004310764656369591,
"loss": 5.0114,
"mean_token_accuracy": 0.19741845726966858,
"num_tokens": 58382870.0,
"step": 33645
},
{
"entropy": 5.402697324752808,
"epoch": 2.618089865784867,
"grad_norm": 1.1640625,
"learning_rate": 0.0004310565011954715,
"loss": 4.9164,
"mean_token_accuracy": 0.20557236224412917,
"num_tokens": 58391016.0,
"step": 33650
},
{
"entropy": 5.422146892547607,
"epoch": 2.618478895156584,
"grad_norm": 1.1328125,
"learning_rate": 0.0004310365343860748,
"loss": 5.0164,
"mean_token_accuracy": 0.20110046863555908,
"num_tokens": 58399595.0,
"step": 33655
},
{
"entropy": 5.495392179489135,
"epoch": 2.6188679245283017,
"grad_norm": 1.203125,
"learning_rate": 0.00043101656520907225,
"loss": 5.1276,
"mean_token_accuracy": 0.18900589346885682,
"num_tokens": 58409071.0,
"step": 33660
},
{
"entropy": 5.420030879974365,
"epoch": 2.6192569539000194,
"grad_norm": 1.109375,
"learning_rate": 0.0004309965936647665,
"loss": 5.0536,
"mean_token_accuracy": 0.19295436441898345,
"num_tokens": 58418313.0,
"step": 33665
},
{
"entropy": 5.420562505722046,
"epoch": 2.619645983271737,
"grad_norm": 1.1640625,
"learning_rate": 0.0004309766197534608,
"loss": 4.9988,
"mean_token_accuracy": 0.19350678771734237,
"num_tokens": 58426263.0,
"step": 33670
},
{
"entropy": 5.397078895568848,
"epoch": 2.620035012643455,
"grad_norm": 1.203125,
"learning_rate": 0.00043095664347545816,
"loss": 5.0055,
"mean_token_accuracy": 0.19350493997335433,
"num_tokens": 58435449.0,
"step": 33675
},
{
"entropy": 5.4131121158599855,
"epoch": 2.620424042015172,
"grad_norm": 1.109375,
"learning_rate": 0.0004309366648310616,
"loss": 5.039,
"mean_token_accuracy": 0.19788872599601745,
"num_tokens": 58444015.0,
"step": 33680
},
{
"entropy": 5.328211927413941,
"epoch": 2.62081307138689,
"grad_norm": 1.171875,
"learning_rate": 0.00043091668382057443,
"loss": 4.9427,
"mean_token_accuracy": 0.19611652195453644,
"num_tokens": 58452826.0,
"step": 33685
},
{
"entropy": 5.412720251083374,
"epoch": 2.621202100758607,
"grad_norm": 1.15625,
"learning_rate": 0.00043089670044429973,
"loss": 5.0704,
"mean_token_accuracy": 0.1993011489510536,
"num_tokens": 58462175.0,
"step": 33690
},
{
"entropy": 5.2831415176391605,
"epoch": 2.6215911301303247,
"grad_norm": 1.1640625,
"learning_rate": 0.00043087671470254076,
"loss": 4.8619,
"mean_token_accuracy": 0.20176911652088164,
"num_tokens": 58470714.0,
"step": 33695
},
{
"entropy": 5.285301208496094,
"epoch": 2.6219801595020424,
"grad_norm": 1.1875,
"learning_rate": 0.00043085672659560077,
"loss": 4.8748,
"mean_token_accuracy": 0.20314591079950334,
"num_tokens": 58478839.0,
"step": 33700
},
{
"entropy": 5.391962003707886,
"epoch": 2.62236918887376,
"grad_norm": 1.140625,
"learning_rate": 0.00043083673612378295,
"loss": 5.0539,
"mean_token_accuracy": 0.19382858127355576,
"num_tokens": 58488184.0,
"step": 33705
},
{
"entropy": 5.4472403049469,
"epoch": 2.6227582182454774,
"grad_norm": 1.2265625,
"learning_rate": 0.00043081674328739066,
"loss": 5.055,
"mean_token_accuracy": 0.19025808721780776,
"num_tokens": 58497202.0,
"step": 33710
},
{
"entropy": 5.368722581863404,
"epoch": 2.623147247617195,
"grad_norm": 1.1328125,
"learning_rate": 0.00043079674808672744,
"loss": 4.8864,
"mean_token_accuracy": 0.20194543302059173,
"num_tokens": 58505885.0,
"step": 33715
},
{
"entropy": 5.364418888092041,
"epoch": 2.623536276988913,
"grad_norm": 1.1640625,
"learning_rate": 0.0004307767505220964,
"loss": 4.8886,
"mean_token_accuracy": 0.20877785682678224,
"num_tokens": 58513807.0,
"step": 33720
},
{
"entropy": 5.259344053268433,
"epoch": 2.62392530636063,
"grad_norm": 1.1953125,
"learning_rate": 0.0004307567505938012,
"loss": 4.8896,
"mean_token_accuracy": 0.2084610104560852,
"num_tokens": 58522426.0,
"step": 33725
},
{
"entropy": 5.316966390609741,
"epoch": 2.6243143357323477,
"grad_norm": 1.1953125,
"learning_rate": 0.0004307367483021452,
"loss": 4.971,
"mean_token_accuracy": 0.19935321658849717,
"num_tokens": 58531038.0,
"step": 33730
},
{
"entropy": 5.392615222930909,
"epoch": 2.6247033651040654,
"grad_norm": 1.140625,
"learning_rate": 0.000430716743647432,
"loss": 4.9696,
"mean_token_accuracy": 0.20287786424160004,
"num_tokens": 58539373.0,
"step": 33735
},
{
"entropy": 5.304162693023682,
"epoch": 2.625092394475783,
"grad_norm": 1.234375,
"learning_rate": 0.000430696736629965,
"loss": 4.848,
"mean_token_accuracy": 0.20108741670846939,
"num_tokens": 58547295.0,
"step": 33740
},
{
"entropy": 5.385747814178467,
"epoch": 2.6254814238475004,
"grad_norm": 1.0859375,
"learning_rate": 0.0004306767272500478,
"loss": 5.0385,
"mean_token_accuracy": 0.1988581657409668,
"num_tokens": 58555614.0,
"step": 33745
},
{
"entropy": 5.371101379394531,
"epoch": 2.625870453219218,
"grad_norm": 1.1953125,
"learning_rate": 0.00043065671550798415,
"loss": 4.9573,
"mean_token_accuracy": 0.1950088396668434,
"num_tokens": 58564444.0,
"step": 33750
},
{
"entropy": 5.356553030014038,
"epoch": 2.626259482590936,
"grad_norm": 1.1328125,
"learning_rate": 0.00043063670140407753,
"loss": 4.9221,
"mean_token_accuracy": 0.19957908540964125,
"num_tokens": 58573446.0,
"step": 33755
},
{
"entropy": 5.4460368156433105,
"epoch": 2.626648511962653,
"grad_norm": 1.0859375,
"learning_rate": 0.0004306166849386317,
"loss": 4.9662,
"mean_token_accuracy": 0.19512048363685608,
"num_tokens": 58582065.0,
"step": 33760
},
{
"entropy": 5.286070871353149,
"epoch": 2.6270375413343707,
"grad_norm": 1.234375,
"learning_rate": 0.00043059666611195037,
"loss": 4.8648,
"mean_token_accuracy": 0.2067467451095581,
"num_tokens": 58590222.0,
"step": 33765
},
{
"entropy": 5.37785530090332,
"epoch": 2.6274265707060884,
"grad_norm": 1.1640625,
"learning_rate": 0.0004305766449243372,
"loss": 4.9653,
"mean_token_accuracy": 0.1987467661499977,
"num_tokens": 58598745.0,
"step": 33770
},
{
"entropy": 5.415403127670288,
"epoch": 2.627815600077806,
"grad_norm": 1.1484375,
"learning_rate": 0.0004305566213760962,
"loss": 4.9598,
"mean_token_accuracy": 0.2010659620165825,
"num_tokens": 58607199.0,
"step": 33775
},
{
"entropy": 5.411853265762329,
"epoch": 2.6282046294495234,
"grad_norm": 1.0859375,
"learning_rate": 0.00043053659546753094,
"loss": 5.0748,
"mean_token_accuracy": 0.1880352020263672,
"num_tokens": 58616593.0,
"step": 33780
},
{
"entropy": 5.390313053131104,
"epoch": 2.628593658821241,
"grad_norm": 1.1875,
"learning_rate": 0.0004305165671989455,
"loss": 4.9864,
"mean_token_accuracy": 0.1959020674228668,
"num_tokens": 58626165.0,
"step": 33785
},
{
"entropy": 5.340438365936279,
"epoch": 2.6289826881929583,
"grad_norm": 1.125,
"learning_rate": 0.0004304965365706437,
"loss": 4.9505,
"mean_token_accuracy": 0.19808007031679153,
"num_tokens": 58634392.0,
"step": 33790
},
{
"entropy": 5.339203262329102,
"epoch": 2.629371717564676,
"grad_norm": 1.2265625,
"learning_rate": 0.0004304765035829294,
"loss": 5.0612,
"mean_token_accuracy": 0.19623716324567794,
"num_tokens": 58644584.0,
"step": 33795
},
{
"entropy": 5.432407188415527,
"epoch": 2.6297607469363937,
"grad_norm": 1.1953125,
"learning_rate": 0.00043045646823610664,
"loss": 5.0914,
"mean_token_accuracy": 0.1944478213787079,
"num_tokens": 58653601.0,
"step": 33800
},
{
"entropy": 5.409682035446167,
"epoch": 2.6301497763081114,
"grad_norm": 1.2109375,
"learning_rate": 0.00043043643053047935,
"loss": 4.9547,
"mean_token_accuracy": 0.20303696691989898,
"num_tokens": 58661947.0,
"step": 33805
},
{
"entropy": 5.412146854400635,
"epoch": 2.6305388056798287,
"grad_norm": 1.125,
"learning_rate": 0.0004304163904663517,
"loss": 5.0985,
"mean_token_accuracy": 0.18883245438337326,
"num_tokens": 58670537.0,
"step": 33810
},
{
"entropy": 5.375216341018676,
"epoch": 2.6309278350515464,
"grad_norm": 1.171875,
"learning_rate": 0.00043039634804402767,
"loss": 4.9179,
"mean_token_accuracy": 0.20188799649477004,
"num_tokens": 58679491.0,
"step": 33815
},
{
"entropy": 5.359619379043579,
"epoch": 2.631316864423264,
"grad_norm": 1.1484375,
"learning_rate": 0.0004303763032638114,
"loss": 4.9458,
"mean_token_accuracy": 0.20124406963586808,
"num_tokens": 58689078.0,
"step": 33820
},
{
"entropy": 5.346489763259887,
"epoch": 2.6317058937949813,
"grad_norm": 1.1875,
"learning_rate": 0.0004303562561260071,
"loss": 4.9345,
"mean_token_accuracy": 0.2009949043393135,
"num_tokens": 58697113.0,
"step": 33825
},
{
"entropy": 5.398408365249634,
"epoch": 2.632094923166699,
"grad_norm": 1.125,
"learning_rate": 0.00043033620663091883,
"loss": 5.0123,
"mean_token_accuracy": 0.19807095676660538,
"num_tokens": 58705368.0,
"step": 33830
},
{
"entropy": 5.347299528121948,
"epoch": 2.6324839525384167,
"grad_norm": 1.1953125,
"learning_rate": 0.0004303161547788509,
"loss": 4.9623,
"mean_token_accuracy": 0.2005300059914589,
"num_tokens": 58713828.0,
"step": 33835
},
{
"entropy": 5.3324816703796385,
"epoch": 2.6328729819101344,
"grad_norm": 1.1796875,
"learning_rate": 0.0004302961005701074,
"loss": 4.9292,
"mean_token_accuracy": 0.1988653466105461,
"num_tokens": 58721896.0,
"step": 33840
},
{
"entropy": 5.466010904312133,
"epoch": 2.6332620112818517,
"grad_norm": 1.140625,
"learning_rate": 0.00043027604400499295,
"loss": 5.0104,
"mean_token_accuracy": 0.1985572025179863,
"num_tokens": 58729861.0,
"step": 33845
},
{
"entropy": 5.370575618743897,
"epoch": 2.6336510406535694,
"grad_norm": 1.140625,
"learning_rate": 0.00043025598508381155,
"loss": 4.9074,
"mean_token_accuracy": 0.21031697392463683,
"num_tokens": 58738023.0,
"step": 33850
},
{
"entropy": 5.328470468521118,
"epoch": 2.634040070025287,
"grad_norm": 1.203125,
"learning_rate": 0.0004302359238068677,
"loss": 4.9954,
"mean_token_accuracy": 0.19577166587114334,
"num_tokens": 58746678.0,
"step": 33855
},
{
"entropy": 5.310218381881714,
"epoch": 2.6344290993970043,
"grad_norm": 1.171875,
"learning_rate": 0.00043021586017446585,
"loss": 4.8731,
"mean_token_accuracy": 0.2083798587322235,
"num_tokens": 58754746.0,
"step": 33860
},
{
"entropy": 5.336911725997925,
"epoch": 2.634818128768722,
"grad_norm": 1.2265625,
"learning_rate": 0.00043019579418691027,
"loss": 4.9679,
"mean_token_accuracy": 0.19931928366422652,
"num_tokens": 58762972.0,
"step": 33865
},
{
"entropy": 5.398266410827636,
"epoch": 2.6352071581404397,
"grad_norm": 1.0703125,
"learning_rate": 0.0004301757258445056,
"loss": 5.0155,
"mean_token_accuracy": 0.19271832406520845,
"num_tokens": 58772529.0,
"step": 33870
},
{
"entropy": 5.321041297912598,
"epoch": 2.6355961875121574,
"grad_norm": 1.0703125,
"learning_rate": 0.0004301556551475563,
"loss": 4.8931,
"mean_token_accuracy": 0.206895911693573,
"num_tokens": 58781239.0,
"step": 33875
},
{
"entropy": 5.386790609359741,
"epoch": 2.6359852168838747,
"grad_norm": 1.1484375,
"learning_rate": 0.0004301355820963669,
"loss": 4.9493,
"mean_token_accuracy": 0.2011219471693039,
"num_tokens": 58789876.0,
"step": 33880
},
{
"entropy": 5.38179497718811,
"epoch": 2.6363742462555924,
"grad_norm": 1.1796875,
"learning_rate": 0.0004301155066912419,
"loss": 5.0133,
"mean_token_accuracy": 0.20095726251602172,
"num_tokens": 58798383.0,
"step": 33885
},
{
"entropy": 5.3700066089630125,
"epoch": 2.6367632756273096,
"grad_norm": 1.1953125,
"learning_rate": 0.000430095428932486,
"loss": 5.0093,
"mean_token_accuracy": 0.19604776054620743,
"num_tokens": 58806804.0,
"step": 33890
},
{
"entropy": 5.400948143005371,
"epoch": 2.6371523049990273,
"grad_norm": 1.203125,
"learning_rate": 0.00043007534882040385,
"loss": 4.9935,
"mean_token_accuracy": 0.19742311537265778,
"num_tokens": 58815755.0,
"step": 33895
},
{
"entropy": 5.419873762130737,
"epoch": 2.637541334370745,
"grad_norm": 1.1953125,
"learning_rate": 0.0004300552663553001,
"loss": 4.9914,
"mean_token_accuracy": 0.20688812136650087,
"num_tokens": 58824547.0,
"step": 33900
},
{
"entropy": 5.369836711883545,
"epoch": 2.6379303637424627,
"grad_norm": 1.28125,
"learning_rate": 0.0004300351815374795,
"loss": 5.0072,
"mean_token_accuracy": 0.19931228905916215,
"num_tokens": 58832471.0,
"step": 33905
},
{
"entropy": 5.341547966003418,
"epoch": 2.63831939311418,
"grad_norm": 1.2421875,
"learning_rate": 0.0004300150943672467,
"loss": 5.0829,
"mean_token_accuracy": 0.19942234307527543,
"num_tokens": 58841367.0,
"step": 33910
},
{
"entropy": 5.388499546051025,
"epoch": 2.6387084224858977,
"grad_norm": 1.140625,
"learning_rate": 0.0004299950048449067,
"loss": 4.9807,
"mean_token_accuracy": 0.19883813709020615,
"num_tokens": 58849946.0,
"step": 33915
},
{
"entropy": 5.457522773742676,
"epoch": 2.6390974518576154,
"grad_norm": 1.1171875,
"learning_rate": 0.0004299749129707641,
"loss": 5.0547,
"mean_token_accuracy": 0.1964985638856888,
"num_tokens": 58858288.0,
"step": 33920
},
{
"entropy": 5.435612201690674,
"epoch": 2.6394864812293326,
"grad_norm": 1.125,
"learning_rate": 0.0004299548187451239,
"loss": 5.0339,
"mean_token_accuracy": 0.1905030280351639,
"num_tokens": 58866968.0,
"step": 33925
},
{
"entropy": 5.409523153305054,
"epoch": 2.6398755106010503,
"grad_norm": 1.15625,
"learning_rate": 0.00042993472216829097,
"loss": 4.9266,
"mean_token_accuracy": 0.20145703107118607,
"num_tokens": 58875635.0,
"step": 33930
},
{
"entropy": 5.381389904022217,
"epoch": 2.640264539972768,
"grad_norm": 1.1640625,
"learning_rate": 0.00042991462324057025,
"loss": 4.9762,
"mean_token_accuracy": 0.2029273509979248,
"num_tokens": 58884080.0,
"step": 33935
},
{
"entropy": 5.238629484176636,
"epoch": 2.6406535693444857,
"grad_norm": 1.1484375,
"learning_rate": 0.0004298945219622667,
"loss": 4.8754,
"mean_token_accuracy": 0.20865669548511506,
"num_tokens": 58891770.0,
"step": 33940
},
{
"entropy": 5.334838724136352,
"epoch": 2.641042598716203,
"grad_norm": 1.1328125,
"learning_rate": 0.00042987441833368525,
"loss": 5.01,
"mean_token_accuracy": 0.19921975284814836,
"num_tokens": 58900446.0,
"step": 33945
},
{
"entropy": 5.439420175552368,
"epoch": 2.6414316280879206,
"grad_norm": 1.109375,
"learning_rate": 0.00042985431235513104,
"loss": 4.9926,
"mean_token_accuracy": 0.1968791589140892,
"num_tokens": 58909423.0,
"step": 33950
},
{
"entropy": 5.449236583709717,
"epoch": 2.6418206574596383,
"grad_norm": 1.203125,
"learning_rate": 0.00042983420402690917,
"loss": 5.0499,
"mean_token_accuracy": 0.19054039865732192,
"num_tokens": 58918175.0,
"step": 33955
},
{
"entropy": 5.343872213363648,
"epoch": 2.6422096868313556,
"grad_norm": 1.09375,
"learning_rate": 0.00042981409334932457,
"loss": 4.9573,
"mean_token_accuracy": 0.19938016086816787,
"num_tokens": 58926837.0,
"step": 33960
},
{
"entropy": 5.421875762939453,
"epoch": 2.6425987162030733,
"grad_norm": 1.1484375,
"learning_rate": 0.0004297939803226826,
"loss": 5.0211,
"mean_token_accuracy": 0.19759977757930755,
"num_tokens": 58934994.0,
"step": 33965
},
{
"entropy": 5.2958104610443115,
"epoch": 2.642987745574791,
"grad_norm": 1.1875,
"learning_rate": 0.0004297738649472884,
"loss": 4.9504,
"mean_token_accuracy": 0.19949800819158553,
"num_tokens": 58943937.0,
"step": 33970
},
{
"entropy": 5.375646591186523,
"epoch": 2.6433767749465087,
"grad_norm": 1.1484375,
"learning_rate": 0.00042975374722344713,
"loss": 5.0083,
"mean_token_accuracy": 0.1908338874578476,
"num_tokens": 58952360.0,
"step": 33975
},
{
"entropy": 5.363486623764038,
"epoch": 2.643765804318226,
"grad_norm": 1.3046875,
"learning_rate": 0.00042973362715146397,
"loss": 4.9696,
"mean_token_accuracy": 0.20372772812843323,
"num_tokens": 58961846.0,
"step": 33980
},
{
"entropy": 5.443544578552246,
"epoch": 2.6441548336899436,
"grad_norm": 1.125,
"learning_rate": 0.0004297135047316444,
"loss": 5.0161,
"mean_token_accuracy": 0.19347030073404312,
"num_tokens": 58970215.0,
"step": 33985
},
{
"entropy": 5.326972198486328,
"epoch": 2.644543863061661,
"grad_norm": 1.1015625,
"learning_rate": 0.0004296933799642936,
"loss": 4.8945,
"mean_token_accuracy": 0.19867499619722367,
"num_tokens": 58978623.0,
"step": 33990
},
{
"entropy": 5.38586802482605,
"epoch": 2.6449328924333786,
"grad_norm": 1.1015625,
"learning_rate": 0.000429673252849717,
"loss": 4.9569,
"mean_token_accuracy": 0.2069807007908821,
"num_tokens": 58986616.0,
"step": 33995
},
{
"entropy": 5.369820690155029,
"epoch": 2.6453219218050963,
"grad_norm": 1.0625,
"learning_rate": 0.00042965312338822005,
"loss": 5.0237,
"mean_token_accuracy": 0.1951487958431244,
"num_tokens": 58996121.0,
"step": 34000
},
{
"entropy": 5.3093428134918215,
"epoch": 2.645710951176814,
"grad_norm": 1.2421875,
"learning_rate": 0.000429632991580108,
"loss": 4.9157,
"mean_token_accuracy": 0.20189906805753707,
"num_tokens": 59004272.0,
"step": 34005
},
{
"entropy": 5.322339344024658,
"epoch": 2.6460999805485317,
"grad_norm": 1.21875,
"learning_rate": 0.0004296128574256864,
"loss": 4.9876,
"mean_token_accuracy": 0.19918779730796815,
"num_tokens": 59012513.0,
"step": 34010
},
{
"entropy": 5.3901525974273685,
"epoch": 2.646489009920249,
"grad_norm": 1.09375,
"learning_rate": 0.00042959272092526086,
"loss": 4.9575,
"mean_token_accuracy": 0.1992514669895172,
"num_tokens": 59021071.0,
"step": 34015
},
{
"entropy": 5.449054336547851,
"epoch": 2.6468780392919666,
"grad_norm": 1.21875,
"learning_rate": 0.00042957258207913687,
"loss": 5.0055,
"mean_token_accuracy": 0.19276181608438492,
"num_tokens": 59030154.0,
"step": 34020
},
{
"entropy": 5.382087850570679,
"epoch": 2.647267068663684,
"grad_norm": 1.2265625,
"learning_rate": 0.00042955244088761985,
"loss": 5.0367,
"mean_token_accuracy": 0.19534399658441542,
"num_tokens": 59038962.0,
"step": 34025
},
{
"entropy": 5.360858201980591,
"epoch": 2.6476560980354016,
"grad_norm": 1.1640625,
"learning_rate": 0.0004295322973510156,
"loss": 4.9474,
"mean_token_accuracy": 0.1984208732843399,
"num_tokens": 59046856.0,
"step": 34030
},
{
"entropy": 5.403586339950562,
"epoch": 2.6480451274071193,
"grad_norm": 1.15625,
"learning_rate": 0.0004295121514696297,
"loss": 5.0008,
"mean_token_accuracy": 0.1961250826716423,
"num_tokens": 59055124.0,
"step": 34035
},
{
"entropy": 5.407391691207886,
"epoch": 2.648434156778837,
"grad_norm": 1.1796875,
"learning_rate": 0.00042949200324376784,
"loss": 5.0447,
"mean_token_accuracy": 0.19331638514995575,
"num_tokens": 59064104.0,
"step": 34040
},
{
"entropy": 5.322826862335205,
"epoch": 2.6488231861505542,
"grad_norm": 1.1796875,
"learning_rate": 0.0004294718526737357,
"loss": 4.9151,
"mean_token_accuracy": 0.20747000128030776,
"num_tokens": 59071991.0,
"step": 34045
},
{
"entropy": 5.331176900863648,
"epoch": 2.649212215522272,
"grad_norm": 1.1640625,
"learning_rate": 0.0004294516997598391,
"loss": 4.9594,
"mean_token_accuracy": 0.21118363589048386,
"num_tokens": 59080519.0,
"step": 34050
},
{
"entropy": 5.352009677886963,
"epoch": 2.6496012448939896,
"grad_norm": 1.15625,
"learning_rate": 0.0004294315445023838,
"loss": 4.9748,
"mean_token_accuracy": 0.19531098008155823,
"num_tokens": 59089555.0,
"step": 34055
},
{
"entropy": 5.4087567806243895,
"epoch": 2.649990274265707,
"grad_norm": 1.0703125,
"learning_rate": 0.00042941138690167556,
"loss": 4.9653,
"mean_token_accuracy": 0.195447239279747,
"num_tokens": 59098287.0,
"step": 34060
},
{
"entropy": 5.304724788665771,
"epoch": 2.6503793036374246,
"grad_norm": 1.140625,
"learning_rate": 0.0004293912269580204,
"loss": 4.9497,
"mean_token_accuracy": 0.20810438990592955,
"num_tokens": 59106463.0,
"step": 34065
},
{
"entropy": 5.443411016464234,
"epoch": 2.6507683330091423,
"grad_norm": 1.09375,
"learning_rate": 0.000429371064671724,
"loss": 5.0232,
"mean_token_accuracy": 0.19603666812181472,
"num_tokens": 59115324.0,
"step": 34070
},
{
"entropy": 5.352826690673828,
"epoch": 2.65115736238086,
"grad_norm": 1.1015625,
"learning_rate": 0.00042935090004309247,
"loss": 4.9221,
"mean_token_accuracy": 0.20554738491773605,
"num_tokens": 59123438.0,
"step": 34075
},
{
"entropy": 5.444900560379028,
"epoch": 2.6515463917525772,
"grad_norm": 1.171875,
"learning_rate": 0.00042933073307243165,
"loss": 4.9705,
"mean_token_accuracy": 0.19962027221918105,
"num_tokens": 59131436.0,
"step": 34080
},
{
"entropy": 5.356242513656616,
"epoch": 2.651935421124295,
"grad_norm": 1.0546875,
"learning_rate": 0.00042931056376004767,
"loss": 5.0306,
"mean_token_accuracy": 0.20063393115997313,
"num_tokens": 59139981.0,
"step": 34085
},
{
"entropy": 5.35341067314148,
"epoch": 2.652324450496012,
"grad_norm": 1.0859375,
"learning_rate": 0.0004292903921062465,
"loss": 4.9508,
"mean_token_accuracy": 0.20287465304136276,
"num_tokens": 59148833.0,
"step": 34090
},
{
"entropy": 5.39759783744812,
"epoch": 2.65271347986773,
"grad_norm": 1.15625,
"learning_rate": 0.00042927021811133416,
"loss": 5.0181,
"mean_token_accuracy": 0.18732453584671022,
"num_tokens": 59157597.0,
"step": 34095
},
{
"entropy": 5.412077140808106,
"epoch": 2.6531025092394476,
"grad_norm": 1.171875,
"learning_rate": 0.0004292500417756167,
"loss": 4.9417,
"mean_token_accuracy": 0.19840147346258163,
"num_tokens": 59166286.0,
"step": 34100
},
{
"entropy": 5.4304920673370365,
"epoch": 2.6534915386111653,
"grad_norm": 1.078125,
"learning_rate": 0.00042922986309940054,
"loss": 4.9777,
"mean_token_accuracy": 0.2007758140563965,
"num_tokens": 59174019.0,
"step": 34105
},
{
"entropy": 5.368457078933716,
"epoch": 2.653880567982883,
"grad_norm": 1.0859375,
"learning_rate": 0.00042920968208299165,
"loss": 4.9787,
"mean_token_accuracy": 0.19855939596891403,
"num_tokens": 59183885.0,
"step": 34110
},
{
"entropy": 5.375678491592407,
"epoch": 2.6542695973546,
"grad_norm": 1.1484375,
"learning_rate": 0.0004291894987266963,
"loss": 4.8709,
"mean_token_accuracy": 0.2022365391254425,
"num_tokens": 59192196.0,
"step": 34115
},
{
"entropy": 5.377045917510986,
"epoch": 2.654658626726318,
"grad_norm": 1.171875,
"learning_rate": 0.00042916931303082064,
"loss": 4.9672,
"mean_token_accuracy": 0.19909878820180893,
"num_tokens": 59200269.0,
"step": 34120
},
{
"entropy": 5.409608983993531,
"epoch": 2.655047656098035,
"grad_norm": 1.234375,
"learning_rate": 0.00042914912499567113,
"loss": 5.013,
"mean_token_accuracy": 0.19263674318790436,
"num_tokens": 59208690.0,
"step": 34125
},
{
"entropy": 5.42937707901001,
"epoch": 2.655436685469753,
"grad_norm": 1.1875,
"learning_rate": 0.00042912893462155395,
"loss": 4.9966,
"mean_token_accuracy": 0.1995888277888298,
"num_tokens": 59217222.0,
"step": 34130
},
{
"entropy": 5.408893966674805,
"epoch": 2.6558257148414706,
"grad_norm": 1.1953125,
"learning_rate": 0.00042910874190877545,
"loss": 5.0139,
"mean_token_accuracy": 0.19425088763237,
"num_tokens": 59226161.0,
"step": 34135
},
{
"entropy": 5.424232816696167,
"epoch": 2.6562147442131883,
"grad_norm": 1.1015625,
"learning_rate": 0.0004290885468576422,
"loss": 4.9736,
"mean_token_accuracy": 0.19455759227275848,
"num_tokens": 59234239.0,
"step": 34140
},
{
"entropy": 5.341923618316651,
"epoch": 2.6566037735849055,
"grad_norm": 1.0859375,
"learning_rate": 0.0004290683494684604,
"loss": 4.8945,
"mean_token_accuracy": 0.20466382503509523,
"num_tokens": 59243390.0,
"step": 34145
},
{
"entropy": 5.3401671886444095,
"epoch": 2.656992802956623,
"grad_norm": 1.09375,
"learning_rate": 0.0004290481497415367,
"loss": 4.9959,
"mean_token_accuracy": 0.2013798713684082,
"num_tokens": 59252854.0,
"step": 34150
},
{
"entropy": 5.283523893356323,
"epoch": 2.657381832328341,
"grad_norm": 1.1796875,
"learning_rate": 0.0004290279476771775,
"loss": 4.941,
"mean_token_accuracy": 0.2010742887854576,
"num_tokens": 59261505.0,
"step": 34155
},
{
"entropy": 5.390388917922974,
"epoch": 2.657770861700058,
"grad_norm": 1.265625,
"learning_rate": 0.0004290077432756894,
"loss": 4.9453,
"mean_token_accuracy": 0.1980362981557846,
"num_tokens": 59269209.0,
"step": 34160
},
{
"entropy": 5.388629341125489,
"epoch": 2.658159891071776,
"grad_norm": 1.1015625,
"learning_rate": 0.0004289875365373788,
"loss": 4.9782,
"mean_token_accuracy": 0.1909873217344284,
"num_tokens": 59277951.0,
"step": 34165
},
{
"entropy": 5.255499410629272,
"epoch": 2.6585489204434936,
"grad_norm": 1.1484375,
"learning_rate": 0.00042896732746255256,
"loss": 4.8574,
"mean_token_accuracy": 0.20869599431753158,
"num_tokens": 59286266.0,
"step": 34170
},
{
"entropy": 5.35825834274292,
"epoch": 2.6589379498152113,
"grad_norm": 1.15625,
"learning_rate": 0.00042894711605151714,
"loss": 4.9968,
"mean_token_accuracy": 0.2000477448105812,
"num_tokens": 59294633.0,
"step": 34175
},
{
"entropy": 5.412497901916504,
"epoch": 2.6593269791869285,
"grad_norm": 1.140625,
"learning_rate": 0.00042892690230457924,
"loss": 4.9362,
"mean_token_accuracy": 0.21323633342981338,
"num_tokens": 59303526.0,
"step": 34180
},
{
"entropy": 5.3982268333435055,
"epoch": 2.659716008558646,
"grad_norm": 1.15625,
"learning_rate": 0.00042890668622204566,
"loss": 4.9193,
"mean_token_accuracy": 0.20515376925468445,
"num_tokens": 59311921.0,
"step": 34185
},
{
"entropy": 5.44091100692749,
"epoch": 2.660105037930364,
"grad_norm": 1.1171875,
"learning_rate": 0.000428886467804223,
"loss": 5.1137,
"mean_token_accuracy": 0.19864630848169326,
"num_tokens": 59320750.0,
"step": 34190
},
{
"entropy": 5.328501605987549,
"epoch": 2.660494067302081,
"grad_norm": 1.0546875,
"learning_rate": 0.00042886624705141825,
"loss": 4.9101,
"mean_token_accuracy": 0.19891910552978515,
"num_tokens": 59330036.0,
"step": 34195
},
{
"entropy": 5.408054637908935,
"epoch": 2.660883096673799,
"grad_norm": 1.1171875,
"learning_rate": 0.00042884602396393796,
"loss": 5.0638,
"mean_token_accuracy": 0.19057366698980333,
"num_tokens": 59339022.0,
"step": 34200
},
{
"entropy": 5.372069311141968,
"epoch": 2.6612721260455166,
"grad_norm": 1.046875,
"learning_rate": 0.0004288257985420892,
"loss": 4.8901,
"mean_token_accuracy": 0.20684991031885147,
"num_tokens": 59347599.0,
"step": 34205
},
{
"entropy": 5.465782642364502,
"epoch": 2.6616611554172342,
"grad_norm": 1.1328125,
"learning_rate": 0.0004288055707861788,
"loss": 5.0279,
"mean_token_accuracy": 0.19743961840867996,
"num_tokens": 59356453.0,
"step": 34210
},
{
"entropy": 5.355468797683716,
"epoch": 2.6620501847889515,
"grad_norm": 1.140625,
"learning_rate": 0.00042878534069651364,
"loss": 4.9745,
"mean_token_accuracy": 0.2011051207780838,
"num_tokens": 59364617.0,
"step": 34215
},
{
"entropy": 5.373475217819214,
"epoch": 2.662439214160669,
"grad_norm": 1.109375,
"learning_rate": 0.0004287651082734007,
"loss": 5.0296,
"mean_token_accuracy": 0.19224614202976226,
"num_tokens": 59374144.0,
"step": 34220
},
{
"entropy": 5.418906593322754,
"epoch": 2.6628282435323865,
"grad_norm": 1.1171875,
"learning_rate": 0.000428744873517147,
"loss": 5.0576,
"mean_token_accuracy": 0.19127493351697922,
"num_tokens": 59382572.0,
"step": 34225
},
{
"entropy": 5.457189226150513,
"epoch": 2.663217272904104,
"grad_norm": 1.0859375,
"learning_rate": 0.0004287246364280596,
"loss": 5.0674,
"mean_token_accuracy": 0.1901233658194542,
"num_tokens": 59391582.0,
"step": 34230
},
{
"entropy": 5.376083421707153,
"epoch": 2.663606302275822,
"grad_norm": 1.0390625,
"learning_rate": 0.0004287043970064455,
"loss": 4.9607,
"mean_token_accuracy": 0.2063121095299721,
"num_tokens": 59400760.0,
"step": 34235
},
{
"entropy": 5.445486927032471,
"epoch": 2.6639953316475395,
"grad_norm": 1.15625,
"learning_rate": 0.0004286841552526118,
"loss": 5.1056,
"mean_token_accuracy": 0.1899155631661415,
"num_tokens": 59409427.0,
"step": 34240
},
{
"entropy": 5.340504169464111,
"epoch": 2.664384361019257,
"grad_norm": 1.109375,
"learning_rate": 0.00042866391116686567,
"loss": 4.9555,
"mean_token_accuracy": 0.19601063430309296,
"num_tokens": 59417538.0,
"step": 34245
},
{
"entropy": 5.41779351234436,
"epoch": 2.6647733903909745,
"grad_norm": 1.09375,
"learning_rate": 0.0004286436647495142,
"loss": 4.958,
"mean_token_accuracy": 0.1980714499950409,
"num_tokens": 59426499.0,
"step": 34250
},
{
"entropy": 5.451911973953247,
"epoch": 2.665162419762692,
"grad_norm": 1.203125,
"learning_rate": 0.00042862341600086477,
"loss": 5.0352,
"mean_token_accuracy": 0.19086260497570037,
"num_tokens": 59434921.0,
"step": 34255
},
{
"entropy": 5.302086257934571,
"epoch": 2.6655514491344094,
"grad_norm": 1.15625,
"learning_rate": 0.00042860316492122447,
"loss": 4.8198,
"mean_token_accuracy": 0.2057104989886284,
"num_tokens": 59443930.0,
"step": 34260
},
{
"entropy": 5.3693090915679935,
"epoch": 2.665940478506127,
"grad_norm": 1.109375,
"learning_rate": 0.0004285829115109006,
"loss": 4.94,
"mean_token_accuracy": 0.20375465452671052,
"num_tokens": 59453335.0,
"step": 34265
},
{
"entropy": 5.3513213157653805,
"epoch": 2.666329507877845,
"grad_norm": 1.1015625,
"learning_rate": 0.0004285626557702005,
"loss": 5.0126,
"mean_token_accuracy": 0.1961280584335327,
"num_tokens": 59461937.0,
"step": 34270
},
{
"entropy": 5.390325689315796,
"epoch": 2.6667185372495625,
"grad_norm": 1.09375,
"learning_rate": 0.0004285423976994316,
"loss": 4.9367,
"mean_token_accuracy": 0.20017177760601043,
"num_tokens": 59470858.0,
"step": 34275
},
{
"entropy": 5.356062650680542,
"epoch": 2.66710756662128,
"grad_norm": 1.1796875,
"learning_rate": 0.00042852213729890117,
"loss": 4.9872,
"mean_token_accuracy": 0.19355384707450868,
"num_tokens": 59478902.0,
"step": 34280
},
{
"entropy": 5.323371505737304,
"epoch": 2.6674965959929975,
"grad_norm": 1.1796875,
"learning_rate": 0.0004285018745689166,
"loss": 4.8994,
"mean_token_accuracy": 0.208248108625412,
"num_tokens": 59487281.0,
"step": 34285
},
{
"entropy": 5.373340797424317,
"epoch": 2.667885625364715,
"grad_norm": 1.140625,
"learning_rate": 0.0004284816095097855,
"loss": 4.9467,
"mean_token_accuracy": 0.20183555036783218,
"num_tokens": 59496304.0,
"step": 34290
},
{
"entropy": 5.2766930103302006,
"epoch": 2.6682746547364324,
"grad_norm": 1.1640625,
"learning_rate": 0.0004284613421218152,
"loss": 4.8792,
"mean_token_accuracy": 0.20856694877147675,
"num_tokens": 59504577.0,
"step": 34295
},
{
"entropy": 5.322265863418579,
"epoch": 2.66866368410815,
"grad_norm": 1.0703125,
"learning_rate": 0.00042844107240531324,
"loss": 4.9542,
"mean_token_accuracy": 0.19931574761867524,
"num_tokens": 59513468.0,
"step": 34300
},
{
"entropy": 5.433460235595703,
"epoch": 2.669052713479868,
"grad_norm": 1.1171875,
"learning_rate": 0.0004284208003605873,
"loss": 4.9974,
"mean_token_accuracy": 0.19192649126052858,
"num_tokens": 59522516.0,
"step": 34305
},
{
"entropy": 5.386816215515137,
"epoch": 2.6694417428515855,
"grad_norm": 1.1484375,
"learning_rate": 0.000428400525987945,
"loss": 4.9183,
"mean_token_accuracy": 0.19824607372283937,
"num_tokens": 59531434.0,
"step": 34310
},
{
"entropy": 5.371961879730224,
"epoch": 2.669830772223303,
"grad_norm": 1.125,
"learning_rate": 0.00042838024928769375,
"loss": 4.9636,
"mean_token_accuracy": 0.20968609303236008,
"num_tokens": 59539967.0,
"step": 34315
},
{
"entropy": 5.43619179725647,
"epoch": 2.6702198015950205,
"grad_norm": 1.0546875,
"learning_rate": 0.00042835997026014145,
"loss": 5.1166,
"mean_token_accuracy": 0.19195984899997712,
"num_tokens": 59549558.0,
"step": 34320
},
{
"entropy": 5.356045913696289,
"epoch": 2.6706088309667377,
"grad_norm": 1.171875,
"learning_rate": 0.0004283396889055957,
"loss": 4.933,
"mean_token_accuracy": 0.2073730155825615,
"num_tokens": 59557520.0,
"step": 34325
},
{
"entropy": 5.493088579177856,
"epoch": 2.6709978603384554,
"grad_norm": 1.1796875,
"learning_rate": 0.0004283194052243641,
"loss": 5.0684,
"mean_token_accuracy": 0.1961228907108307,
"num_tokens": 59565753.0,
"step": 34330
},
{
"entropy": 5.442750453948975,
"epoch": 2.671386889710173,
"grad_norm": 1.0859375,
"learning_rate": 0.00042829911921675456,
"loss": 5.0625,
"mean_token_accuracy": 0.1939133957028389,
"num_tokens": 59574522.0,
"step": 34335
},
{
"entropy": 5.319617414474488,
"epoch": 2.671775919081891,
"grad_norm": 1.234375,
"learning_rate": 0.000428278830883075,
"loss": 4.9437,
"mean_token_accuracy": 0.19830779880285263,
"num_tokens": 59583733.0,
"step": 34340
},
{
"entropy": 5.412617206573486,
"epoch": 2.6721649484536085,
"grad_norm": 1.1015625,
"learning_rate": 0.00042825854022363307,
"loss": 5.0962,
"mean_token_accuracy": 0.19548834413290023,
"num_tokens": 59593009.0,
"step": 34345
},
{
"entropy": 5.378947830200195,
"epoch": 2.6725539778253258,
"grad_norm": 1.265625,
"learning_rate": 0.00042823824723873676,
"loss": 4.9759,
"mean_token_accuracy": 0.20451827794313432,
"num_tokens": 59601770.0,
"step": 34350
},
{
"entropy": 5.391450071334839,
"epoch": 2.6729430071970435,
"grad_norm": 1.1328125,
"learning_rate": 0.00042821795192869407,
"loss": 4.9186,
"mean_token_accuracy": 0.20611869990825654,
"num_tokens": 59610397.0,
"step": 34355
},
{
"entropy": 5.388518857955932,
"epoch": 2.6733320365687607,
"grad_norm": 1.1640625,
"learning_rate": 0.0004281976542938127,
"loss": 4.9942,
"mean_token_accuracy": 0.19945466816425322,
"num_tokens": 59618864.0,
"step": 34360
},
{
"entropy": 5.323984146118164,
"epoch": 2.6737210659404784,
"grad_norm": 1.1875,
"learning_rate": 0.00042817735433440076,
"loss": 4.9607,
"mean_token_accuracy": 0.19761952459812165,
"num_tokens": 59627469.0,
"step": 34365
},
{
"entropy": 5.3097536087036135,
"epoch": 2.674110095312196,
"grad_norm": 1.078125,
"learning_rate": 0.0004281570520507663,
"loss": 4.9508,
"mean_token_accuracy": 0.20419375896453856,
"num_tokens": 59636125.0,
"step": 34370
},
{
"entropy": 5.3795582294464115,
"epoch": 2.674499124683914,
"grad_norm": 1.0859375,
"learning_rate": 0.00042813674744321737,
"loss": 4.9187,
"mean_token_accuracy": 0.20228943675756456,
"num_tokens": 59644586.0,
"step": 34375
},
{
"entropy": 5.39575080871582,
"epoch": 2.674888154055631,
"grad_norm": 1.125,
"learning_rate": 0.000428116440512062,
"loss": 4.963,
"mean_token_accuracy": 0.19803930670022965,
"num_tokens": 59653644.0,
"step": 34380
},
{
"entropy": 5.328214073181153,
"epoch": 2.6752771834273488,
"grad_norm": 1.140625,
"learning_rate": 0.0004280961312576084,
"loss": 5.0037,
"mean_token_accuracy": 0.19198238402605056,
"num_tokens": 59662270.0,
"step": 34385
},
{
"entropy": 5.377955484390259,
"epoch": 2.6756662127990665,
"grad_norm": 1.0859375,
"learning_rate": 0.0004280758196801646,
"loss": 4.9337,
"mean_token_accuracy": 0.20776260942220687,
"num_tokens": 59670544.0,
"step": 34390
},
{
"entropy": 5.4088798522949215,
"epoch": 2.6760552421707837,
"grad_norm": 1.140625,
"learning_rate": 0.00042805550578003894,
"loss": 5.0462,
"mean_token_accuracy": 0.2006412371993065,
"num_tokens": 59679985.0,
"step": 34395
},
{
"entropy": 5.393606519699096,
"epoch": 2.6764442715425014,
"grad_norm": 1.1015625,
"learning_rate": 0.0004280351895575396,
"loss": 5.0259,
"mean_token_accuracy": 0.18971271812915802,
"num_tokens": 59689831.0,
"step": 34400
},
{
"entropy": 5.390142440795898,
"epoch": 2.676833300914219,
"grad_norm": 1.2421875,
"learning_rate": 0.0004280148710129748,
"loss": 5.0348,
"mean_token_accuracy": 0.19521320909261702,
"num_tokens": 59697400.0,
"step": 34405
},
{
"entropy": 5.37974181175232,
"epoch": 2.677222330285937,
"grad_norm": 1.171875,
"learning_rate": 0.00042799455014665296,
"loss": 4.9412,
"mean_token_accuracy": 0.20023636221885682,
"num_tokens": 59706137.0,
"step": 34410
},
{
"entropy": 5.394614601135254,
"epoch": 2.677611359657654,
"grad_norm": 1.140625,
"learning_rate": 0.00042797422695888226,
"loss": 5.0165,
"mean_token_accuracy": 0.19154416024684906,
"num_tokens": 59715454.0,
"step": 34415
},
{
"entropy": 5.373456764221191,
"epoch": 2.6780003890293718,
"grad_norm": 1.1640625,
"learning_rate": 0.0004279539014499712,
"loss": 4.9053,
"mean_token_accuracy": 0.2093779370188713,
"num_tokens": 59723801.0,
"step": 34420
},
{
"entropy": 5.369338846206665,
"epoch": 2.678389418401089,
"grad_norm": 1.1484375,
"learning_rate": 0.0004279335736202281,
"loss": 4.9991,
"mean_token_accuracy": 0.20417073965072632,
"num_tokens": 59732899.0,
"step": 34425
},
{
"entropy": 5.384247541427612,
"epoch": 2.6787784477728067,
"grad_norm": 1.109375,
"learning_rate": 0.0004279132434699615,
"loss": 5.0412,
"mean_token_accuracy": 0.19799069613218306,
"num_tokens": 59741693.0,
"step": 34430
},
{
"entropy": 5.311388254165649,
"epoch": 2.6791674771445244,
"grad_norm": 1.1328125,
"learning_rate": 0.0004278929109994798,
"loss": 4.8701,
"mean_token_accuracy": 0.20726193636655807,
"num_tokens": 59749583.0,
"step": 34435
},
{
"entropy": 5.40360426902771,
"epoch": 2.679556506516242,
"grad_norm": 1.140625,
"learning_rate": 0.00042787257620909144,
"loss": 5.0637,
"mean_token_accuracy": 0.1942752107977867,
"num_tokens": 59758638.0,
"step": 34440
},
{
"entropy": 5.3614482402801515,
"epoch": 2.67994553588796,
"grad_norm": 1.1015625,
"learning_rate": 0.00042785223909910515,
"loss": 4.9037,
"mean_token_accuracy": 0.20381806343793868,
"num_tokens": 59767746.0,
"step": 34445
},
{
"entropy": 5.408695936203003,
"epoch": 2.680334565259677,
"grad_norm": 1.0703125,
"learning_rate": 0.0004278318996698294,
"loss": 4.9896,
"mean_token_accuracy": 0.19565177708864212,
"num_tokens": 59776426.0,
"step": 34450
},
{
"entropy": 5.333408212661743,
"epoch": 2.6807235946313948,
"grad_norm": 1.1953125,
"learning_rate": 0.0004278115579215728,
"loss": 4.9873,
"mean_token_accuracy": 0.19890154600143434,
"num_tokens": 59785032.0,
"step": 34455
},
{
"entropy": 5.3828386783599855,
"epoch": 2.681112624003112,
"grad_norm": 1.09375,
"learning_rate": 0.0004277912138546441,
"loss": 5.024,
"mean_token_accuracy": 0.19332427978515626,
"num_tokens": 59794510.0,
"step": 34460
},
{
"entropy": 5.403111124038697,
"epoch": 2.6815016533748297,
"grad_norm": 1.1484375,
"learning_rate": 0.0004277708674693519,
"loss": 4.9379,
"mean_token_accuracy": 0.20095993727445602,
"num_tokens": 59802889.0,
"step": 34465
},
{
"entropy": 5.362936496734619,
"epoch": 2.6818906827465474,
"grad_norm": 1.2109375,
"learning_rate": 0.00042775051876600483,
"loss": 4.9228,
"mean_token_accuracy": 0.20018546730279924,
"num_tokens": 59811940.0,
"step": 34470
},
{
"entropy": 5.344327688217163,
"epoch": 2.682279712118265,
"grad_norm": 1.1875,
"learning_rate": 0.0004277301677449119,
"loss": 4.9743,
"mean_token_accuracy": 0.20301877558231354,
"num_tokens": 59820465.0,
"step": 34475
},
{
"entropy": 5.449883127212525,
"epoch": 2.6826687414899824,
"grad_norm": 1.1953125,
"learning_rate": 0.0004277098144063818,
"loss": 5.0645,
"mean_token_accuracy": 0.1929970309138298,
"num_tokens": 59829611.0,
"step": 34480
},
{
"entropy": 5.436542510986328,
"epoch": 2.6830577708617,
"grad_norm": 1.140625,
"learning_rate": 0.00042768945875072326,
"loss": 5.0049,
"mean_token_accuracy": 0.19675894528627397,
"num_tokens": 59839073.0,
"step": 34485
},
{
"entropy": 5.440522861480713,
"epoch": 2.6834468002334178,
"grad_norm": 1.15625,
"learning_rate": 0.0004276691007782451,
"loss": 5.0703,
"mean_token_accuracy": 0.18557532727718354,
"num_tokens": 59847653.0,
"step": 34490
},
{
"entropy": 5.38441801071167,
"epoch": 2.683835829605135,
"grad_norm": 1.234375,
"learning_rate": 0.0004276487404892565,
"loss": 5.0028,
"mean_token_accuracy": 0.19308709651231765,
"num_tokens": 59855534.0,
"step": 34495
},
{
"entropy": 5.370562171936035,
"epoch": 2.6842248589768527,
"grad_norm": 1.3671875,
"learning_rate": 0.00042762837788406615,
"loss": 4.9474,
"mean_token_accuracy": 0.19599810391664504,
"num_tokens": 59864862.0,
"step": 34500
},
{
"entropy": 5.379722213745117,
"epoch": 2.6846138883485704,
"grad_norm": 1.140625,
"learning_rate": 0.0004276080129629831,
"loss": 4.978,
"mean_token_accuracy": 0.1987994894385338,
"num_tokens": 59873100.0,
"step": 34505
},
{
"entropy": 5.390812063217163,
"epoch": 2.685002917720288,
"grad_norm": 1.140625,
"learning_rate": 0.00042758764572631644,
"loss": 4.9523,
"mean_token_accuracy": 0.19754843711853026,
"num_tokens": 59881500.0,
"step": 34510
},
{
"entropy": 5.36690354347229,
"epoch": 2.6853919470920053,
"grad_norm": 1.0625,
"learning_rate": 0.00042756727617437504,
"loss": 4.9551,
"mean_token_accuracy": 0.20342129468917847,
"num_tokens": 59890168.0,
"step": 34515
},
{
"entropy": 5.390420007705688,
"epoch": 2.685780976463723,
"grad_norm": 1.1796875,
"learning_rate": 0.00042754690430746805,
"loss": 4.9923,
"mean_token_accuracy": 0.19185806810855865,
"num_tokens": 59898805.0,
"step": 34520
},
{
"entropy": 5.4083569049835205,
"epoch": 2.6861700058354403,
"grad_norm": 1.0703125,
"learning_rate": 0.0004275265301259046,
"loss": 5.0286,
"mean_token_accuracy": 0.19178288280963898,
"num_tokens": 59907012.0,
"step": 34525
},
{
"entropy": 5.387717914581299,
"epoch": 2.686559035207158,
"grad_norm": 1.140625,
"learning_rate": 0.00042750615362999395,
"loss": 4.9678,
"mean_token_accuracy": 0.20536677539348602,
"num_tokens": 59915117.0,
"step": 34530
},
{
"entropy": 5.401671981811523,
"epoch": 2.6869480645788757,
"grad_norm": 1.1171875,
"learning_rate": 0.00042748577482004495,
"loss": 4.996,
"mean_token_accuracy": 0.19705521762371064,
"num_tokens": 59923625.0,
"step": 34535
},
{
"entropy": 5.423038291931152,
"epoch": 2.6873370939505934,
"grad_norm": 1.1171875,
"learning_rate": 0.00042746539369636715,
"loss": 4.9979,
"mean_token_accuracy": 0.1981267124414444,
"num_tokens": 59932456.0,
"step": 34540
},
{
"entropy": 5.3538423538208,
"epoch": 2.687726123322311,
"grad_norm": 1.09375,
"learning_rate": 0.00042744501025926966,
"loss": 4.9561,
"mean_token_accuracy": 0.19685874581336976,
"num_tokens": 59941210.0,
"step": 34545
},
{
"entropy": 5.467728471755981,
"epoch": 2.6881151526940283,
"grad_norm": 1.1796875,
"learning_rate": 0.0004274246245090618,
"loss": 5.0491,
"mean_token_accuracy": 0.188378968834877,
"num_tokens": 59949646.0,
"step": 34550
},
{
"entropy": 5.3248964786529545,
"epoch": 2.688504182065746,
"grad_norm": 1.09375,
"learning_rate": 0.0004274042364460529,
"loss": 4.8538,
"mean_token_accuracy": 0.2057757705450058,
"num_tokens": 59958263.0,
"step": 34555
},
{
"entropy": 5.3741625308990475,
"epoch": 2.6888932114374633,
"grad_norm": 1.2109375,
"learning_rate": 0.00042738384607055214,
"loss": 5.0543,
"mean_token_accuracy": 0.19641852974891663,
"num_tokens": 59967222.0,
"step": 34560
},
{
"entropy": 5.379954147338867,
"epoch": 2.689282240809181,
"grad_norm": 1.21875,
"learning_rate": 0.00042736345338286917,
"loss": 4.9311,
"mean_token_accuracy": 0.20341241955757142,
"num_tokens": 59974898.0,
"step": 34565
},
{
"entropy": 5.363115024566651,
"epoch": 2.6896712701808987,
"grad_norm": 1.109375,
"learning_rate": 0.0004273430583833133,
"loss": 4.9075,
"mean_token_accuracy": 0.20405565053224564,
"num_tokens": 59983593.0,
"step": 34570
},
{
"entropy": 5.35976996421814,
"epoch": 2.6900602995526164,
"grad_norm": 1.2265625,
"learning_rate": 0.000427322661072194,
"loss": 4.9282,
"mean_token_accuracy": 0.20593021512031556,
"num_tokens": 59991360.0,
"step": 34575
},
{
"entropy": 5.401122379302978,
"epoch": 2.6904493289243336,
"grad_norm": 1.1328125,
"learning_rate": 0.0004273022614498208,
"loss": 4.9813,
"mean_token_accuracy": 0.20183444768190384,
"num_tokens": 59999123.0,
"step": 34580
},
{
"entropy": 5.315407085418701,
"epoch": 2.6908383582960513,
"grad_norm": 1.125,
"learning_rate": 0.0004272818595165031,
"loss": 4.8628,
"mean_token_accuracy": 0.20884652882814408,
"num_tokens": 60007666.0,
"step": 34585
},
{
"entropy": 5.406532907485962,
"epoch": 2.691227387667769,
"grad_norm": 1.171875,
"learning_rate": 0.0004272614552725506,
"loss": 5.0781,
"mean_token_accuracy": 0.1869439125061035,
"num_tokens": 60016813.0,
"step": 34590
},
{
"entropy": 5.4521606922149655,
"epoch": 2.6916164170394863,
"grad_norm": 1.1171875,
"learning_rate": 0.00042724104871827293,
"loss": 4.977,
"mean_token_accuracy": 0.19915189892053603,
"num_tokens": 60025243.0,
"step": 34595
},
{
"entropy": 5.410744905471802,
"epoch": 2.692005446411204,
"grad_norm": 1.15625,
"learning_rate": 0.0004272206398539795,
"loss": 5.0839,
"mean_token_accuracy": 0.18814264237880707,
"num_tokens": 60033705.0,
"step": 34600
},
{
"entropy": 5.440247678756714,
"epoch": 2.6923944757829217,
"grad_norm": 1.140625,
"learning_rate": 0.00042720022867998026,
"loss": 4.9705,
"mean_token_accuracy": 0.20509123802185059,
"num_tokens": 60042073.0,
"step": 34605
},
{
"entropy": 5.459591484069824,
"epoch": 2.6927835051546394,
"grad_norm": 1.1640625,
"learning_rate": 0.0004271798151965848,
"loss": 5.04,
"mean_token_accuracy": 0.19130787998437881,
"num_tokens": 60050286.0,
"step": 34610
},
{
"entropy": 5.264109897613525,
"epoch": 2.6931725345263566,
"grad_norm": 1.2109375,
"learning_rate": 0.0004271593994041029,
"loss": 4.8319,
"mean_token_accuracy": 0.20633379071950914,
"num_tokens": 60057812.0,
"step": 34615
},
{
"entropy": 5.268955373764038,
"epoch": 2.6935615638980743,
"grad_norm": 1.109375,
"learning_rate": 0.0004271389813028443,
"loss": 4.8724,
"mean_token_accuracy": 0.20606954991817475,
"num_tokens": 60066636.0,
"step": 34620
},
{
"entropy": 5.315273761749268,
"epoch": 2.693950593269792,
"grad_norm": 1.1171875,
"learning_rate": 0.0004271185608931187,
"loss": 4.9507,
"mean_token_accuracy": 0.19987229257822037,
"num_tokens": 60075605.0,
"step": 34625
},
{
"entropy": 5.379639053344727,
"epoch": 2.6943396226415093,
"grad_norm": 1.140625,
"learning_rate": 0.00042709813817523617,
"loss": 4.8817,
"mean_token_accuracy": 0.20651884377002716,
"num_tokens": 60083947.0,
"step": 34630
},
{
"entropy": 5.3060229301452635,
"epoch": 2.694728652013227,
"grad_norm": 1.1484375,
"learning_rate": 0.00042707771314950645,
"loss": 4.9103,
"mean_token_accuracy": 0.206938473880291,
"num_tokens": 60092518.0,
"step": 34635
},
{
"entropy": 5.364006614685058,
"epoch": 2.6951176813849447,
"grad_norm": 1.2109375,
"learning_rate": 0.00042705728581623944,
"loss": 4.9379,
"mean_token_accuracy": 0.20119450539350509,
"num_tokens": 60100829.0,
"step": 34640
},
{
"entropy": 5.4405200481414795,
"epoch": 2.6955067107566624,
"grad_norm": 1.15625,
"learning_rate": 0.0004270368561757452,
"loss": 4.9943,
"mean_token_accuracy": 0.20098990947008133,
"num_tokens": 60109423.0,
"step": 34645
},
{
"entropy": 5.271455192565918,
"epoch": 2.6958957401283796,
"grad_norm": 1.1328125,
"learning_rate": 0.0004270164242283336,
"loss": 4.8611,
"mean_token_accuracy": 0.20585769265890122,
"num_tokens": 60117938.0,
"step": 34650
},
{
"entropy": 5.347994136810303,
"epoch": 2.6962847695000973,
"grad_norm": 1.0,
"learning_rate": 0.0004269959899743148,
"loss": 4.978,
"mean_token_accuracy": 0.2034232184290886,
"num_tokens": 60126411.0,
"step": 34655
},
{
"entropy": 5.394872093200684,
"epoch": 2.6966737988718146,
"grad_norm": 1.1953125,
"learning_rate": 0.0004269755534139987,
"loss": 5.02,
"mean_token_accuracy": 0.19162299036979674,
"num_tokens": 60134811.0,
"step": 34660
},
{
"entropy": 5.364149951934815,
"epoch": 2.6970628282435323,
"grad_norm": 1.0859375,
"learning_rate": 0.00042695511454769557,
"loss": 4.9369,
"mean_token_accuracy": 0.1961675390601158,
"num_tokens": 60143387.0,
"step": 34665
},
{
"entropy": 5.387380504608155,
"epoch": 2.69745185761525,
"grad_norm": 1.0546875,
"learning_rate": 0.00042693467337571534,
"loss": 4.9793,
"mean_token_accuracy": 0.19509874135255814,
"num_tokens": 60152729.0,
"step": 34670
},
{
"entropy": 5.303729057312012,
"epoch": 2.6978408869869677,
"grad_norm": 1.1328125,
"learning_rate": 0.0004269142298983684,
"loss": 4.9349,
"mean_token_accuracy": 0.19943539202213287,
"num_tokens": 60160927.0,
"step": 34675
},
{
"entropy": 5.3441205501556395,
"epoch": 2.698229916358685,
"grad_norm": 1.1640625,
"learning_rate": 0.00042689378411596467,
"loss": 4.9199,
"mean_token_accuracy": 0.20570038408041,
"num_tokens": 60169252.0,
"step": 34680
},
{
"entropy": 5.344624090194702,
"epoch": 2.6986189457304026,
"grad_norm": 1.0859375,
"learning_rate": 0.0004268733360288146,
"loss": 4.9627,
"mean_token_accuracy": 0.19987168312072753,
"num_tokens": 60178511.0,
"step": 34685
},
{
"entropy": 5.331116533279419,
"epoch": 2.6990079751021203,
"grad_norm": 1.1484375,
"learning_rate": 0.00042685288563722835,
"loss": 4.942,
"mean_token_accuracy": 0.1975827395915985,
"num_tokens": 60187619.0,
"step": 34690
},
{
"entropy": 5.466305589675903,
"epoch": 2.6993970044738376,
"grad_norm": 1.109375,
"learning_rate": 0.0004268324329415163,
"loss": 5.1041,
"mean_token_accuracy": 0.18991145938634874,
"num_tokens": 60196176.0,
"step": 34695
},
{
"entropy": 5.391061782836914,
"epoch": 2.6997860338455553,
"grad_norm": 1.234375,
"learning_rate": 0.0004268119779419887,
"loss": 5.0091,
"mean_token_accuracy": 0.19594821631908416,
"num_tokens": 60204960.0,
"step": 34700
},
{
"entropy": 5.337936735153198,
"epoch": 2.700175063217273,
"grad_norm": 1.1328125,
"learning_rate": 0.00042679152063895603,
"loss": 4.9139,
"mean_token_accuracy": 0.19859689474105835,
"num_tokens": 60212974.0,
"step": 34705
},
{
"entropy": 5.35681185722351,
"epoch": 2.7005640925889907,
"grad_norm": 1.1328125,
"learning_rate": 0.00042677106103272867,
"loss": 4.9596,
"mean_token_accuracy": 0.19527654498815536,
"num_tokens": 60221789.0,
"step": 34710
},
{
"entropy": 5.32783317565918,
"epoch": 2.700953121960708,
"grad_norm": 1.171875,
"learning_rate": 0.000426750599123617,
"loss": 4.9984,
"mean_token_accuracy": 0.19666681587696075,
"num_tokens": 60230349.0,
"step": 34715
},
{
"entropy": 5.357149744033814,
"epoch": 2.7013421513324256,
"grad_norm": 1.1484375,
"learning_rate": 0.00042673013491193145,
"loss": 4.935,
"mean_token_accuracy": 0.20340894609689714,
"num_tokens": 60238711.0,
"step": 34720
},
{
"entropy": 5.382628297805786,
"epoch": 2.7017311807041433,
"grad_norm": 1.125,
"learning_rate": 0.00042670966839798263,
"loss": 4.9544,
"mean_token_accuracy": 0.19915827959775925,
"num_tokens": 60247210.0,
"step": 34725
},
{
"entropy": 5.442790079116821,
"epoch": 2.7021202100758606,
"grad_norm": 1.0234375,
"learning_rate": 0.0004266891995820811,
"loss": 4.9923,
"mean_token_accuracy": 0.19936205297708512,
"num_tokens": 60255916.0,
"step": 34730
},
{
"entropy": 5.368322086334229,
"epoch": 2.7025092394475783,
"grad_norm": 1.1875,
"learning_rate": 0.00042666872846453734,
"loss": 4.9516,
"mean_token_accuracy": 0.20203399956226348,
"num_tokens": 60264138.0,
"step": 34735
},
{
"entropy": 5.387244319915771,
"epoch": 2.702898268819296,
"grad_norm": 1.09375,
"learning_rate": 0.00042664825504566206,
"loss": 5.0091,
"mean_token_accuracy": 0.19110169559717177,
"num_tokens": 60272918.0,
"step": 34740
},
{
"entropy": 5.289311838150025,
"epoch": 2.7032872981910137,
"grad_norm": 1.2109375,
"learning_rate": 0.000426627779325766,
"loss": 4.74,
"mean_token_accuracy": 0.21823370456695557,
"num_tokens": 60281328.0,
"step": 34745
},
{
"entropy": 5.3037574768066404,
"epoch": 2.703676327562731,
"grad_norm": 1.1015625,
"learning_rate": 0.0004266073013051595,
"loss": 5.0083,
"mean_token_accuracy": 0.19463356882333754,
"num_tokens": 60290005.0,
"step": 34750
},
{
"entropy": 5.330426216125488,
"epoch": 2.7040653569344486,
"grad_norm": 1.0625,
"learning_rate": 0.0004265868209841537,
"loss": 4.8751,
"mean_token_accuracy": 0.20159582495689393,
"num_tokens": 60298225.0,
"step": 34755
},
{
"entropy": 5.38794207572937,
"epoch": 2.704454386306166,
"grad_norm": 1.125,
"learning_rate": 0.0004265663383630591,
"loss": 4.9713,
"mean_token_accuracy": 0.1949460744857788,
"num_tokens": 60306700.0,
"step": 34760
},
{
"entropy": 5.348529529571533,
"epoch": 2.7048434156778836,
"grad_norm": 1.1953125,
"learning_rate": 0.00042654585344218657,
"loss": 4.9588,
"mean_token_accuracy": 0.2038094073534012,
"num_tokens": 60314405.0,
"step": 34765
},
{
"entropy": 5.332219839096069,
"epoch": 2.7052324450496013,
"grad_norm": 1.171875,
"learning_rate": 0.0004265253662218469,
"loss": 4.8999,
"mean_token_accuracy": 0.20289279669523239,
"num_tokens": 60323159.0,
"step": 34770
},
{
"entropy": 5.434286499023438,
"epoch": 2.705621474421319,
"grad_norm": 1.1171875,
"learning_rate": 0.00042650487670235093,
"loss": 4.9973,
"mean_token_accuracy": 0.19924337714910506,
"num_tokens": 60331669.0,
"step": 34775
},
{
"entropy": 5.335219860076904,
"epoch": 2.7060105037930366,
"grad_norm": 1.109375,
"learning_rate": 0.0004264843848840097,
"loss": 4.9788,
"mean_token_accuracy": 0.19983745217323304,
"num_tokens": 60340841.0,
"step": 34780
},
{
"entropy": 5.277787113189698,
"epoch": 2.706399533164754,
"grad_norm": 1.1015625,
"learning_rate": 0.000426463890767134,
"loss": 4.8735,
"mean_token_accuracy": 0.2056006297469139,
"num_tokens": 60349263.0,
"step": 34785
},
{
"entropy": 5.418739891052246,
"epoch": 2.7067885625364716,
"grad_norm": 1.140625,
"learning_rate": 0.0004264433943520349,
"loss": 5.0355,
"mean_token_accuracy": 0.19776599407196044,
"num_tokens": 60358214.0,
"step": 34790
},
{
"entropy": 5.351519584655762,
"epoch": 2.707177591908189,
"grad_norm": 1.140625,
"learning_rate": 0.00042642289563902326,
"loss": 4.9577,
"mean_token_accuracy": 0.20484983175992966,
"num_tokens": 60367392.0,
"step": 34795
},
{
"entropy": 5.31849422454834,
"epoch": 2.7075666212799065,
"grad_norm": 1.171875,
"learning_rate": 0.00042640239462841023,
"loss": 4.9537,
"mean_token_accuracy": 0.19649308621883393,
"num_tokens": 60376223.0,
"step": 34800
},
{
"entropy": 5.444887161254883,
"epoch": 2.7079556506516242,
"grad_norm": 1.15625,
"learning_rate": 0.00042638189132050675,
"loss": 5.0825,
"mean_token_accuracy": 0.1880333974957466,
"num_tokens": 60385102.0,
"step": 34805
},
{
"entropy": 5.421322250366211,
"epoch": 2.708344680023342,
"grad_norm": 1.1640625,
"learning_rate": 0.00042636138571562415,
"loss": 4.9575,
"mean_token_accuracy": 0.19545463472604752,
"num_tokens": 60393115.0,
"step": 34810
},
{
"entropy": 5.372217082977295,
"epoch": 2.708733709395059,
"grad_norm": 1.078125,
"learning_rate": 0.00042634087781407337,
"loss": 5.0728,
"mean_token_accuracy": 0.1922438159584999,
"num_tokens": 60402185.0,
"step": 34815
},
{
"entropy": 5.487900733947754,
"epoch": 2.709122738766777,
"grad_norm": 1.0625,
"learning_rate": 0.00042632036761616564,
"loss": 4.9765,
"mean_token_accuracy": 0.19941693991422654,
"num_tokens": 60410420.0,
"step": 34820
},
{
"entropy": 5.374901628494262,
"epoch": 2.7095117681384946,
"grad_norm": 1.09375,
"learning_rate": 0.00042629985512221224,
"loss": 4.9285,
"mean_token_accuracy": 0.20184245258569716,
"num_tokens": 60419300.0,
"step": 34825
},
{
"entropy": 5.381605911254883,
"epoch": 2.709900797510212,
"grad_norm": 2.265625,
"learning_rate": 0.0004262793403325243,
"loss": 5.014,
"mean_token_accuracy": 0.20415671318769454,
"num_tokens": 60428108.0,
"step": 34830
},
{
"entropy": 5.385757398605347,
"epoch": 2.7102898268819295,
"grad_norm": 1.15625,
"learning_rate": 0.00042625882324741316,
"loss": 4.9648,
"mean_token_accuracy": 0.1951258510351181,
"num_tokens": 60436829.0,
"step": 34835
},
{
"entropy": 5.428536128997803,
"epoch": 2.7106788562536472,
"grad_norm": 1.1171875,
"learning_rate": 0.0004262383038671902,
"loss": 4.966,
"mean_token_accuracy": 0.20022047460079193,
"num_tokens": 60445681.0,
"step": 34840
},
{
"entropy": 5.432674264907837,
"epoch": 2.711067885625365,
"grad_norm": 1.1328125,
"learning_rate": 0.0004262177821921666,
"loss": 5.014,
"mean_token_accuracy": 0.20290272533893586,
"num_tokens": 60454263.0,
"step": 34845
},
{
"entropy": 5.438174676895142,
"epoch": 2.711456914997082,
"grad_norm": 1.0703125,
"learning_rate": 0.00042619725822265394,
"loss": 5.074,
"mean_token_accuracy": 0.1946658968925476,
"num_tokens": 60463569.0,
"step": 34850
},
{
"entropy": 5.355553483963012,
"epoch": 2.7118459443688,
"grad_norm": 1.15625,
"learning_rate": 0.00042617673195896345,
"loss": 4.8993,
"mean_token_accuracy": 0.20493161380290986,
"num_tokens": 60471458.0,
"step": 34855
},
{
"entropy": 5.424509811401367,
"epoch": 2.712234973740517,
"grad_norm": 1.1796875,
"learning_rate": 0.00042615620340140674,
"loss": 5.0456,
"mean_token_accuracy": 0.19631729125976563,
"num_tokens": 60480581.0,
"step": 34860
},
{
"entropy": 5.385473918914795,
"epoch": 2.712624003112235,
"grad_norm": 1.125,
"learning_rate": 0.00042613567255029525,
"loss": 5.0149,
"mean_token_accuracy": 0.1993692323565483,
"num_tokens": 60488879.0,
"step": 34865
},
{
"entropy": 5.346762037277221,
"epoch": 2.7130130324839525,
"grad_norm": 1.078125,
"learning_rate": 0.00042611513940594037,
"loss": 4.9636,
"mean_token_accuracy": 0.20714747607707978,
"num_tokens": 60497294.0,
"step": 34870
},
{
"entropy": 5.34515495300293,
"epoch": 2.7134020618556702,
"grad_norm": 1.1015625,
"learning_rate": 0.0004260946039686539,
"loss": 4.9063,
"mean_token_accuracy": 0.20757717043161392,
"num_tokens": 60506449.0,
"step": 34875
},
{
"entropy": 5.403919649124146,
"epoch": 2.713791091227388,
"grad_norm": 1.109375,
"learning_rate": 0.00042607406623874726,
"loss": 4.9837,
"mean_token_accuracy": 0.1975916624069214,
"num_tokens": 60515318.0,
"step": 34880
},
{
"entropy": 5.357729053497314,
"epoch": 2.714180120599105,
"grad_norm": 1.21875,
"learning_rate": 0.0004260535262165322,
"loss": 5.0624,
"mean_token_accuracy": 0.19917599409818648,
"num_tokens": 60525425.0,
"step": 34885
},
{
"entropy": 5.383405303955078,
"epoch": 2.714569149970823,
"grad_norm": 1.109375,
"learning_rate": 0.00042603298390232015,
"loss": 4.9906,
"mean_token_accuracy": 0.19140629321336747,
"num_tokens": 60535028.0,
"step": 34890
},
{
"entropy": 5.3716638565063475,
"epoch": 2.71495817934254,
"grad_norm": 1.21875,
"learning_rate": 0.00042601243929642305,
"loss": 4.9255,
"mean_token_accuracy": 0.20799052268266677,
"num_tokens": 60543076.0,
"step": 34895
},
{
"entropy": 5.346485996246338,
"epoch": 2.715347208714258,
"grad_norm": 1.15625,
"learning_rate": 0.00042599189239915253,
"loss": 4.9707,
"mean_token_accuracy": 0.20157477110624314,
"num_tokens": 60551697.0,
"step": 34900
},
{
"entropy": 5.29774956703186,
"epoch": 2.7157362380859755,
"grad_norm": 1.1328125,
"learning_rate": 0.0004259713432108204,
"loss": 4.9317,
"mean_token_accuracy": 0.1928666889667511,
"num_tokens": 60559910.0,
"step": 34905
},
{
"entropy": 5.457463264465332,
"epoch": 2.7161252674576932,
"grad_norm": 1.09375,
"learning_rate": 0.0004259507917317384,
"loss": 5.0712,
"mean_token_accuracy": 0.1898985907435417,
"num_tokens": 60568717.0,
"step": 34910
},
{
"entropy": 5.450325155258179,
"epoch": 2.7165142968294105,
"grad_norm": 1.21875,
"learning_rate": 0.00042593023796221843,
"loss": 4.9865,
"mean_token_accuracy": 0.1966839998960495,
"num_tokens": 60576707.0,
"step": 34915
},
{
"entropy": 5.404114484786987,
"epoch": 2.716903326201128,
"grad_norm": 1.2109375,
"learning_rate": 0.0004259096819025723,
"loss": 4.94,
"mean_token_accuracy": 0.2007000580430031,
"num_tokens": 60585097.0,
"step": 34920
},
{
"entropy": 5.343565988540649,
"epoch": 2.717292355572846,
"grad_norm": 1.1015625,
"learning_rate": 0.00042588912355311196,
"loss": 4.9719,
"mean_token_accuracy": 0.204275181889534,
"num_tokens": 60594026.0,
"step": 34925
},
{
"entropy": 5.380764389038086,
"epoch": 2.717681384944563,
"grad_norm": 1.1953125,
"learning_rate": 0.00042586856291414925,
"loss": 4.9326,
"mean_token_accuracy": 0.20288337767124176,
"num_tokens": 60602281.0,
"step": 34930
},
{
"entropy": 5.356401491165161,
"epoch": 2.718070414316281,
"grad_norm": 1.15625,
"learning_rate": 0.00042584799998599633,
"loss": 4.9292,
"mean_token_accuracy": 0.20539550632238388,
"num_tokens": 60610329.0,
"step": 34935
},
{
"entropy": 5.3719861030578615,
"epoch": 2.7184594436879985,
"grad_norm": 1.1484375,
"learning_rate": 0.0004258274347689651,
"loss": 5.0239,
"mean_token_accuracy": 0.19869040101766586,
"num_tokens": 60618251.0,
"step": 34940
},
{
"entropy": 5.438964223861694,
"epoch": 2.718848473059716,
"grad_norm": 1.1015625,
"learning_rate": 0.00042580686726336766,
"loss": 4.9706,
"mean_token_accuracy": 0.19448422342538835,
"num_tokens": 60626479.0,
"step": 34945
},
{
"entropy": 5.364186382293701,
"epoch": 2.7192375024314335,
"grad_norm": 1.140625,
"learning_rate": 0.00042578629746951597,
"loss": 4.9546,
"mean_token_accuracy": 0.20262847393751143,
"num_tokens": 60635375.0,
"step": 34950
},
{
"entropy": 5.406803178787231,
"epoch": 2.719626531803151,
"grad_norm": 1.109375,
"learning_rate": 0.0004257657253877222,
"loss": 4.9999,
"mean_token_accuracy": 0.19876051247119902,
"num_tokens": 60644136.0,
"step": 34955
},
{
"entropy": 5.4829504013061525,
"epoch": 2.720015561174869,
"grad_norm": 1.171875,
"learning_rate": 0.00042574515101829856,
"loss": 5.0735,
"mean_token_accuracy": 0.20226812213659287,
"num_tokens": 60653258.0,
"step": 34960
},
{
"entropy": 5.410881996154785,
"epoch": 2.720404590546586,
"grad_norm": 1.0859375,
"learning_rate": 0.00042572457436155717,
"loss": 4.9712,
"mean_token_accuracy": 0.20164205580949784,
"num_tokens": 60662320.0,
"step": 34965
},
{
"entropy": 5.326263952255249,
"epoch": 2.720793619918304,
"grad_norm": 1.1640625,
"learning_rate": 0.00042570399541781023,
"loss": 4.9697,
"mean_token_accuracy": 0.201089708507061,
"num_tokens": 60671669.0,
"step": 34970
},
{
"entropy": 5.406627368927002,
"epoch": 2.7211826492900215,
"grad_norm": 1.15625,
"learning_rate": 0.00042568341418737016,
"loss": 5.0906,
"mean_token_accuracy": 0.1946942076086998,
"num_tokens": 60680391.0,
"step": 34975
},
{
"entropy": 5.431188583374023,
"epoch": 2.721571678661739,
"grad_norm": 1.109375,
"learning_rate": 0.000425662830670549,
"loss": 5.0248,
"mean_token_accuracy": 0.1957213744521141,
"num_tokens": 60690150.0,
"step": 34980
},
{
"entropy": 5.377703332901001,
"epoch": 2.7219607080334565,
"grad_norm": 1.1796875,
"learning_rate": 0.00042564224486765925,
"loss": 4.889,
"mean_token_accuracy": 0.2073738768696785,
"num_tokens": 60698950.0,
"step": 34985
},
{
"entropy": 5.45033278465271,
"epoch": 2.722349737405174,
"grad_norm": 1.1640625,
"learning_rate": 0.0004256216567790131,
"loss": 5.0116,
"mean_token_accuracy": 0.19431646168231964,
"num_tokens": 60707859.0,
"step": 34990
},
{
"entropy": 5.382950735092163,
"epoch": 2.7227387667768914,
"grad_norm": 1.140625,
"learning_rate": 0.0004256010664049232,
"loss": 4.9849,
"mean_token_accuracy": 0.2028467059135437,
"num_tokens": 60716621.0,
"step": 34995
},
{
"entropy": 5.408921146392823,
"epoch": 2.723127796148609,
"grad_norm": 1.1484375,
"learning_rate": 0.0004255804737457017,
"loss": 5.103,
"mean_token_accuracy": 0.1877564549446106,
"num_tokens": 60725695.0,
"step": 35000
},
{
"entropy": 5.422921514511108,
"epoch": 2.723516825520327,
"grad_norm": 1.265625,
"learning_rate": 0.00042555987880166127,
"loss": 4.9485,
"mean_token_accuracy": 0.20472778975963593,
"num_tokens": 60733978.0,
"step": 35005
},
{
"entropy": 5.3629485130310055,
"epoch": 2.7239058548920445,
"grad_norm": 1.125,
"learning_rate": 0.0004255392815731142,
"loss": 4.9754,
"mean_token_accuracy": 0.2001110777258873,
"num_tokens": 60742391.0,
"step": 35010
},
{
"entropy": 5.370002317428589,
"epoch": 2.7242948842637618,
"grad_norm": 1.25,
"learning_rate": 0.00042551868206037324,
"loss": 4.9285,
"mean_token_accuracy": 0.20952879637479782,
"num_tokens": 60749808.0,
"step": 35015
},
{
"entropy": 5.396552515029907,
"epoch": 2.7246839136354795,
"grad_norm": 1.140625,
"learning_rate": 0.00042549808026375084,
"loss": 5.0798,
"mean_token_accuracy": 0.19521878361701966,
"num_tokens": 60759902.0,
"step": 35020
},
{
"entropy": 5.387737131118774,
"epoch": 2.725072943007197,
"grad_norm": 1.0859375,
"learning_rate": 0.00042547747618355966,
"loss": 4.9967,
"mean_token_accuracy": 0.2008301720023155,
"num_tokens": 60768542.0,
"step": 35025
},
{
"entropy": 5.3652698516845705,
"epoch": 2.7254619723789144,
"grad_norm": 1.09375,
"learning_rate": 0.0004254568698201122,
"loss": 4.9516,
"mean_token_accuracy": 0.20900079160928725,
"num_tokens": 60777077.0,
"step": 35030
},
{
"entropy": 5.31120285987854,
"epoch": 2.725851001750632,
"grad_norm": 1.1484375,
"learning_rate": 0.00042543626117372133,
"loss": 4.8898,
"mean_token_accuracy": 0.20063648521900176,
"num_tokens": 60786520.0,
"step": 35035
},
{
"entropy": 5.432752370834351,
"epoch": 2.72624003112235,
"grad_norm": 1.1875,
"learning_rate": 0.00042541565024469945,
"loss": 5.0141,
"mean_token_accuracy": 0.20687125325202943,
"num_tokens": 60795270.0,
"step": 35040
},
{
"entropy": 5.407832479476928,
"epoch": 2.7266290604940675,
"grad_norm": 1.0234375,
"learning_rate": 0.00042539503703335963,
"loss": 4.9854,
"mean_token_accuracy": 0.19778105318546296,
"num_tokens": 60804047.0,
"step": 35045
},
{
"entropy": 5.334122276306152,
"epoch": 2.7270180898657848,
"grad_norm": 1.171875,
"learning_rate": 0.00042537442154001455,
"loss": 4.9335,
"mean_token_accuracy": 0.19598948806524277,
"num_tokens": 60812376.0,
"step": 35050
},
{
"entropy": 5.4614075183868405,
"epoch": 2.7274071192375025,
"grad_norm": 1.15625,
"learning_rate": 0.00042535380376497684,
"loss": 5.1207,
"mean_token_accuracy": 0.18710460513830185,
"num_tokens": 60822075.0,
"step": 35055
},
{
"entropy": 5.464821147918701,
"epoch": 2.72779614860922,
"grad_norm": 1.140625,
"learning_rate": 0.0004253331837085595,
"loss": 5.0168,
"mean_token_accuracy": 0.20203171521425248,
"num_tokens": 60830729.0,
"step": 35060
},
{
"entropy": 5.361655187606812,
"epoch": 2.7281851779809374,
"grad_norm": 1.0703125,
"learning_rate": 0.00042531256137107545,
"loss": 4.8786,
"mean_token_accuracy": 0.20346354693174362,
"num_tokens": 60840429.0,
"step": 35065
},
{
"entropy": 5.319899082183838,
"epoch": 2.728574207352655,
"grad_norm": 1.1484375,
"learning_rate": 0.0004252919367528375,
"loss": 4.8481,
"mean_token_accuracy": 0.2026260733604431,
"num_tokens": 60848967.0,
"step": 35070
},
{
"entropy": 5.323038816452026,
"epoch": 2.728963236724373,
"grad_norm": 1.234375,
"learning_rate": 0.00042527130985415857,
"loss": 4.9227,
"mean_token_accuracy": 0.2029882475733757,
"num_tokens": 60856718.0,
"step": 35075
},
{
"entropy": 5.359774780273438,
"epoch": 2.7293522660960905,
"grad_norm": 1.1484375,
"learning_rate": 0.0004252506806753517,
"loss": 4.8866,
"mean_token_accuracy": 0.20467945635318757,
"num_tokens": 60865338.0,
"step": 35080
},
{
"entropy": 5.354181814193725,
"epoch": 2.7297412954678077,
"grad_norm": 1.2109375,
"learning_rate": 0.00042523004921673,
"loss": 4.9887,
"mean_token_accuracy": 0.2039518415927887,
"num_tokens": 60873887.0,
"step": 35085
},
{
"entropy": 5.42711763381958,
"epoch": 2.7301303248395254,
"grad_norm": 1.140625,
"learning_rate": 0.0004252094154786063,
"loss": 5.0381,
"mean_token_accuracy": 0.1949532464146614,
"num_tokens": 60882755.0,
"step": 35090
},
{
"entropy": 5.3572205066680905,
"epoch": 2.7305193542112427,
"grad_norm": 1.2265625,
"learning_rate": 0.0004251887794612939,
"loss": 4.8564,
"mean_token_accuracy": 0.21123257130384446,
"num_tokens": 60891191.0,
"step": 35095
},
{
"entropy": 5.406901264190674,
"epoch": 2.7309083835829604,
"grad_norm": 1.1171875,
"learning_rate": 0.0004251681411651057,
"loss": 5.0568,
"mean_token_accuracy": 0.19802723377943038,
"num_tokens": 60899634.0,
"step": 35100
},
{
"entropy": 5.405670499801635,
"epoch": 2.731297412954678,
"grad_norm": 1.0703125,
"learning_rate": 0.00042514750059035504,
"loss": 5.0364,
"mean_token_accuracy": 0.20344208627939225,
"num_tokens": 60908468.0,
"step": 35105
},
{
"entropy": 5.386397409439087,
"epoch": 2.731686442326396,
"grad_norm": 1.2109375,
"learning_rate": 0.0004251268577373551,
"loss": 4.9838,
"mean_token_accuracy": 0.1937482088804245,
"num_tokens": 60917102.0,
"step": 35110
},
{
"entropy": 5.46617751121521,
"epoch": 2.732075471698113,
"grad_norm": 1.1875,
"learning_rate": 0.000425106212606419,
"loss": 5.0562,
"mean_token_accuracy": 0.20040431767702102,
"num_tokens": 60926410.0,
"step": 35115
},
{
"entropy": 5.415679788589477,
"epoch": 2.7324645010698307,
"grad_norm": 1.140625,
"learning_rate": 0.00042508556519786004,
"loss": 4.9103,
"mean_token_accuracy": 0.20673118978738786,
"num_tokens": 60935068.0,
"step": 35120
},
{
"entropy": 5.3934855461120605,
"epoch": 2.7328535304415484,
"grad_norm": 1.140625,
"learning_rate": 0.0004250649155119915,
"loss": 4.9579,
"mean_token_accuracy": 0.20045288354158403,
"num_tokens": 60943507.0,
"step": 35125
},
{
"entropy": 5.338783502578735,
"epoch": 2.7332425598132657,
"grad_norm": 1.1328125,
"learning_rate": 0.00042504426354912666,
"loss": 4.9275,
"mean_token_accuracy": 0.2019277662038803,
"num_tokens": 60952175.0,
"step": 35130
},
{
"entropy": 5.29727840423584,
"epoch": 2.7336315891849834,
"grad_norm": 1.125,
"learning_rate": 0.00042502360930957904,
"loss": 4.95,
"mean_token_accuracy": 0.2023328110575676,
"num_tokens": 60962087.0,
"step": 35135
},
{
"entropy": 5.3801963329315186,
"epoch": 2.734020618556701,
"grad_norm": 1.1171875,
"learning_rate": 0.00042500295279366196,
"loss": 4.9254,
"mean_token_accuracy": 0.20954489558935166,
"num_tokens": 60970142.0,
"step": 35140
},
{
"entropy": 5.392442512512207,
"epoch": 2.734409647928419,
"grad_norm": 1.1015625,
"learning_rate": 0.00042498229400168874,
"loss": 5.0196,
"mean_token_accuracy": 0.19313295185565948,
"num_tokens": 60979498.0,
"step": 35145
},
{
"entropy": 5.375092840194702,
"epoch": 2.734798677300136,
"grad_norm": 1.1171875,
"learning_rate": 0.000424961632933973,
"loss": 4.9945,
"mean_token_accuracy": 0.19961830824613572,
"num_tokens": 60988382.0,
"step": 35150
},
{
"entropy": 5.411002969741821,
"epoch": 2.7351877066718537,
"grad_norm": 1.1953125,
"learning_rate": 0.0004249409695908281,
"loss": 5.0592,
"mean_token_accuracy": 0.19502754062414168,
"num_tokens": 60998191.0,
"step": 35155
},
{
"entropy": 5.436344146728516,
"epoch": 2.7355767360435714,
"grad_norm": 1.125,
"learning_rate": 0.0004249203039725677,
"loss": 5.004,
"mean_token_accuracy": 0.1966912031173706,
"num_tokens": 61006417.0,
"step": 35160
},
{
"entropy": 5.336159896850586,
"epoch": 2.7359657654152887,
"grad_norm": 1.1328125,
"learning_rate": 0.00042489963607950527,
"loss": 4.8488,
"mean_token_accuracy": 0.21572496891021728,
"num_tokens": 61014562.0,
"step": 35165
},
{
"entropy": 5.32479681968689,
"epoch": 2.7363547947870064,
"grad_norm": 1.2578125,
"learning_rate": 0.00042487896591195454,
"loss": 4.9239,
"mean_token_accuracy": 0.20034560114145278,
"num_tokens": 61022139.0,
"step": 35170
},
{
"entropy": 5.377214670181274,
"epoch": 2.736743824158724,
"grad_norm": 1.0546875,
"learning_rate": 0.00042485829347022893,
"loss": 5.115,
"mean_token_accuracy": 0.19396832585334778,
"num_tokens": 61031099.0,
"step": 35175
},
{
"entropy": 5.521640110015869,
"epoch": 2.737132853530442,
"grad_norm": 1.2109375,
"learning_rate": 0.00042483761875464226,
"loss": 5.0491,
"mean_token_accuracy": 0.1974119022488594,
"num_tokens": 61039136.0,
"step": 35180
},
{
"entropy": 5.382097816467285,
"epoch": 2.737521882902159,
"grad_norm": 1.140625,
"learning_rate": 0.00042481694176550825,
"loss": 4.9295,
"mean_token_accuracy": 0.20427945852279664,
"num_tokens": 61047177.0,
"step": 35185
},
{
"entropy": 5.350960397720337,
"epoch": 2.7379109122738767,
"grad_norm": 1.109375,
"learning_rate": 0.00042479626250314066,
"loss": 4.9175,
"mean_token_accuracy": 0.1989891216158867,
"num_tokens": 61055383.0,
"step": 35190
},
{
"entropy": 5.3613255500793455,
"epoch": 2.738299941645594,
"grad_norm": 1.0625,
"learning_rate": 0.00042477558096785316,
"loss": 4.9297,
"mean_token_accuracy": 0.20729342997074127,
"num_tokens": 61063831.0,
"step": 35195
},
{
"entropy": 5.445357418060302,
"epoch": 2.7386889710173117,
"grad_norm": 1.140625,
"learning_rate": 0.00042475489715995956,
"loss": 5.0419,
"mean_token_accuracy": 0.19432148337364197,
"num_tokens": 61072328.0,
"step": 35200
},
{
"entropy": 5.337676620483398,
"epoch": 2.7390780003890294,
"grad_norm": 1.0703125,
"learning_rate": 0.00042473421107977385,
"loss": 4.8904,
"mean_token_accuracy": 0.20327156633138657,
"num_tokens": 61081191.0,
"step": 35205
},
{
"entropy": 5.409759140014648,
"epoch": 2.739467029760747,
"grad_norm": 1.171875,
"learning_rate": 0.00042471352272760974,
"loss": 4.9725,
"mean_token_accuracy": 0.20484423488378525,
"num_tokens": 61089314.0,
"step": 35210
},
{
"entropy": 5.323824167251587,
"epoch": 2.7398560591324648,
"grad_norm": 1.2265625,
"learning_rate": 0.0004246928321037813,
"loss": 4.9161,
"mean_token_accuracy": 0.20522205233573915,
"num_tokens": 61098322.0,
"step": 35215
},
{
"entropy": 5.489756393432617,
"epoch": 2.740245088504182,
"grad_norm": 1.1640625,
"learning_rate": 0.0004246721392086023,
"loss": 5.0989,
"mean_token_accuracy": 0.18871491104364396,
"num_tokens": 61106682.0,
"step": 35220
},
{
"entropy": 5.398154926300049,
"epoch": 2.7406341178758997,
"grad_norm": 1.078125,
"learning_rate": 0.00042465144404238686,
"loss": 4.9855,
"mean_token_accuracy": 0.1971716359257698,
"num_tokens": 61115765.0,
"step": 35225
},
{
"entropy": 5.314597797393799,
"epoch": 2.741023147247617,
"grad_norm": 1.0859375,
"learning_rate": 0.00042463074660544897,
"loss": 4.8682,
"mean_token_accuracy": 0.20525064766407014,
"num_tokens": 61124464.0,
"step": 35230
},
{
"entropy": 5.427773904800415,
"epoch": 2.7414121766193347,
"grad_norm": 1.109375,
"learning_rate": 0.0004246100468981026,
"loss": 5.0751,
"mean_token_accuracy": 0.19600068032741547,
"num_tokens": 61133386.0,
"step": 35235
},
{
"entropy": 5.4985072135925295,
"epoch": 2.7418012059910524,
"grad_norm": 1.1640625,
"learning_rate": 0.000424589344920662,
"loss": 5.0919,
"mean_token_accuracy": 0.18596834540367127,
"num_tokens": 61141873.0,
"step": 35240
},
{
"entropy": 5.4353104591369625,
"epoch": 2.74219023536277,
"grad_norm": 1.15625,
"learning_rate": 0.0004245686406734411,
"loss": 4.9744,
"mean_token_accuracy": 0.19829301536083221,
"num_tokens": 61150113.0,
"step": 35245
},
{
"entropy": 5.300794076919556,
"epoch": 2.7425792647344873,
"grad_norm": 1.203125,
"learning_rate": 0.0004245479341567541,
"loss": 4.8662,
"mean_token_accuracy": 0.21083554476499558,
"num_tokens": 61158941.0,
"step": 35250
},
{
"entropy": 5.33780689239502,
"epoch": 2.742968294106205,
"grad_norm": 1.25,
"learning_rate": 0.0004245272253709154,
"loss": 4.9647,
"mean_token_accuracy": 0.20341936200857164,
"num_tokens": 61167978.0,
"step": 35255
},
{
"entropy": 5.419666528701782,
"epoch": 2.7433573234779227,
"grad_norm": 1.140625,
"learning_rate": 0.0004245065143162389,
"loss": 5.066,
"mean_token_accuracy": 0.1935967430472374,
"num_tokens": 61176581.0,
"step": 35260
},
{
"entropy": 5.5086503505706785,
"epoch": 2.74374635284964,
"grad_norm": 1.1328125,
"learning_rate": 0.00042448580099303904,
"loss": 5.1208,
"mean_token_accuracy": 0.18689976036548614,
"num_tokens": 61186072.0,
"step": 35265
},
{
"entropy": 5.475858354568482,
"epoch": 2.7441353822213577,
"grad_norm": 1.1875,
"learning_rate": 0.00042446508540163017,
"loss": 4.9972,
"mean_token_accuracy": 0.19220044314861298,
"num_tokens": 61194632.0,
"step": 35270
},
{
"entropy": 5.321110582351684,
"epoch": 2.7445244115930754,
"grad_norm": 1.1875,
"learning_rate": 0.0004244443675423264,
"loss": 4.922,
"mean_token_accuracy": 0.20376257449388505,
"num_tokens": 61203705.0,
"step": 35275
},
{
"entropy": 5.347429084777832,
"epoch": 2.744913440964793,
"grad_norm": 1.171875,
"learning_rate": 0.00042442364741544227,
"loss": 4.9115,
"mean_token_accuracy": 0.20028651505708694,
"num_tokens": 61212565.0,
"step": 35280
},
{
"entropy": 5.393892908096314,
"epoch": 2.7453024703365103,
"grad_norm": 1.1640625,
"learning_rate": 0.00042440292502129214,
"loss": 4.9548,
"mean_token_accuracy": 0.19777675420045854,
"num_tokens": 61221092.0,
"step": 35285
},
{
"entropy": 5.376577615737915,
"epoch": 2.745691499708228,
"grad_norm": 1.203125,
"learning_rate": 0.0004243822003601904,
"loss": 4.9978,
"mean_token_accuracy": 0.19573669284582138,
"num_tokens": 61229880.0,
"step": 35290
},
{
"entropy": 5.350202512741089,
"epoch": 2.7460805290799453,
"grad_norm": 1.1640625,
"learning_rate": 0.0004243614734324515,
"loss": 4.9571,
"mean_token_accuracy": 0.19926372319459915,
"num_tokens": 61238890.0,
"step": 35295
},
{
"entropy": 5.379403400421142,
"epoch": 2.746469558451663,
"grad_norm": 1.1015625,
"learning_rate": 0.0004243407442383901,
"loss": 4.9593,
"mean_token_accuracy": 0.19335587471723556,
"num_tokens": 61248260.0,
"step": 35300
},
{
"entropy": 5.436090707778931,
"epoch": 2.7468585878233807,
"grad_norm": 1.0859375,
"learning_rate": 0.00042432001277832045,
"loss": 4.9549,
"mean_token_accuracy": 0.19740568697452546,
"num_tokens": 61256345.0,
"step": 35305
},
{
"entropy": 5.415718841552734,
"epoch": 2.7472476171950984,
"grad_norm": 1.15625,
"learning_rate": 0.0004242992790525573,
"loss": 4.9586,
"mean_token_accuracy": 0.20259884148836135,
"num_tokens": 61264952.0,
"step": 35310
},
{
"entropy": 5.369949007034302,
"epoch": 2.747636646566816,
"grad_norm": 1.078125,
"learning_rate": 0.0004242785430614154,
"loss": 5.0086,
"mean_token_accuracy": 0.1960822507739067,
"num_tokens": 61273596.0,
"step": 35315
},
{
"entropy": 5.365375280380249,
"epoch": 2.7480256759385333,
"grad_norm": 1.140625,
"learning_rate": 0.00042425780480520906,
"loss": 4.9274,
"mean_token_accuracy": 0.2019275575876236,
"num_tokens": 61281799.0,
"step": 35320
},
{
"entropy": 5.39530119895935,
"epoch": 2.748414705310251,
"grad_norm": 1.203125,
"learning_rate": 0.00042423706428425305,
"loss": 4.9137,
"mean_token_accuracy": 0.19874417185783386,
"num_tokens": 61290295.0,
"step": 35325
},
{
"entropy": 5.323211240768432,
"epoch": 2.7488037346819683,
"grad_norm": 1.046875,
"learning_rate": 0.0004242163214988622,
"loss": 4.9703,
"mean_token_accuracy": 0.20296016335487366,
"num_tokens": 61298745.0,
"step": 35330
},
{
"entropy": 5.461699628829956,
"epoch": 2.749192764053686,
"grad_norm": 1.4296875,
"learning_rate": 0.0004241955764493512,
"loss": 5.0647,
"mean_token_accuracy": 0.18952107727527617,
"num_tokens": 61307472.0,
"step": 35335
},
{
"entropy": 5.441533041000366,
"epoch": 2.7495817934254037,
"grad_norm": 1.0390625,
"learning_rate": 0.00042417482913603477,
"loss": 5.0722,
"mean_token_accuracy": 0.18939783573150634,
"num_tokens": 61317633.0,
"step": 35340
},
{
"entropy": 5.419112730026245,
"epoch": 2.7499708227971214,
"grad_norm": 1.0390625,
"learning_rate": 0.00042415407955922774,
"loss": 4.985,
"mean_token_accuracy": 0.2015675500035286,
"num_tokens": 61326836.0,
"step": 35345
},
{
"entropy": 5.429885196685791,
"epoch": 2.7503598521688386,
"grad_norm": 1.15625,
"learning_rate": 0.00042413332771924496,
"loss": 5.0189,
"mean_token_accuracy": 0.19724085479974746,
"num_tokens": 61335817.0,
"step": 35350
},
{
"entropy": 5.464182043075562,
"epoch": 2.7507488815405563,
"grad_norm": 1.125,
"learning_rate": 0.0004241125736164013,
"loss": 5.1472,
"mean_token_accuracy": 0.19115206748247146,
"num_tokens": 61345030.0,
"step": 35355
},
{
"entropy": 5.419407939910888,
"epoch": 2.751137910912274,
"grad_norm": 1.1640625,
"learning_rate": 0.0004240918172510117,
"loss": 4.9942,
"mean_token_accuracy": 0.19440263509750366,
"num_tokens": 61353061.0,
"step": 35360
},
{
"entropy": 5.484201669692993,
"epoch": 2.7515269402839913,
"grad_norm": 1.171875,
"learning_rate": 0.000424071058623391,
"loss": 5.1122,
"mean_token_accuracy": 0.1927821159362793,
"num_tokens": 61361357.0,
"step": 35365
},
{
"entropy": 5.464963054656982,
"epoch": 2.751915969655709,
"grad_norm": 1.15625,
"learning_rate": 0.0004240502977338543,
"loss": 5.0703,
"mean_token_accuracy": 0.1877596288919449,
"num_tokens": 61369731.0,
"step": 35370
},
{
"entropy": 5.393389749526977,
"epoch": 2.7523049990274266,
"grad_norm": 1.125,
"learning_rate": 0.0004240295345827166,
"loss": 4.9729,
"mean_token_accuracy": 0.20434136986732482,
"num_tokens": 61378212.0,
"step": 35375
},
{
"entropy": 5.3417524814605715,
"epoch": 2.7526940283991443,
"grad_norm": 1.15625,
"learning_rate": 0.0004240087691702929,
"loss": 4.9388,
"mean_token_accuracy": 0.19773186296224593,
"num_tokens": 61386743.0,
"step": 35380
},
{
"entropy": 5.416187429428101,
"epoch": 2.7530830577708616,
"grad_norm": 1.09375,
"learning_rate": 0.0004239880014968983,
"loss": 4.9626,
"mean_token_accuracy": 0.1989794045686722,
"num_tokens": 61394513.0,
"step": 35385
},
{
"entropy": 5.441179847717285,
"epoch": 2.7534720871425793,
"grad_norm": 1.140625,
"learning_rate": 0.00042396723156284786,
"loss": 4.9638,
"mean_token_accuracy": 0.19554123729467393,
"num_tokens": 61403999.0,
"step": 35390
},
{
"entropy": 5.386093473434448,
"epoch": 2.753861116514297,
"grad_norm": 1.0390625,
"learning_rate": 0.0004239464593684568,
"loss": 4.9304,
"mean_token_accuracy": 0.20308475196361542,
"num_tokens": 61413363.0,
"step": 35395
},
{
"entropy": 5.317185163497925,
"epoch": 2.7542501458860142,
"grad_norm": 1.1328125,
"learning_rate": 0.00042392568491404043,
"loss": 4.8727,
"mean_token_accuracy": 0.2070518434047699,
"num_tokens": 61421749.0,
"step": 35400
},
{
"entropy": 5.401377010345459,
"epoch": 2.754639175257732,
"grad_norm": 1.09375,
"learning_rate": 0.00042390490819991367,
"loss": 5.0384,
"mean_token_accuracy": 0.19877706915140153,
"num_tokens": 61430422.0,
"step": 35405
},
{
"entropy": 5.418408346176148,
"epoch": 2.7550282046294496,
"grad_norm": 1.1171875,
"learning_rate": 0.000423884129226392,
"loss": 4.9821,
"mean_token_accuracy": 0.20056185275316238,
"num_tokens": 61439402.0,
"step": 35410
},
{
"entropy": 5.426454019546509,
"epoch": 2.7554172340011673,
"grad_norm": 1.0625,
"learning_rate": 0.0004238633479937906,
"loss": 5.0584,
"mean_token_accuracy": 0.19726598262786865,
"num_tokens": 61448791.0,
"step": 35415
},
{
"entropy": 5.3473835468292235,
"epoch": 2.7558062633728846,
"grad_norm": 1.1171875,
"learning_rate": 0.0004238425645024249,
"loss": 4.8879,
"mean_token_accuracy": 0.1935310661792755,
"num_tokens": 61457181.0,
"step": 35420
},
{
"entropy": 5.4761615753173825,
"epoch": 2.7561952927446023,
"grad_norm": 1.1328125,
"learning_rate": 0.0004238217787526102,
"loss": 5.0647,
"mean_token_accuracy": 0.19254227429628373,
"num_tokens": 61465525.0,
"step": 35425
},
{
"entropy": 5.37877926826477,
"epoch": 2.7565843221163195,
"grad_norm": 1.1171875,
"learning_rate": 0.0004238009907446618,
"loss": 5.0649,
"mean_token_accuracy": 0.19574262648820878,
"num_tokens": 61474805.0,
"step": 35430
},
{
"entropy": 5.345131206512451,
"epoch": 2.7569733514880372,
"grad_norm": 1.1328125,
"learning_rate": 0.00042378020047889527,
"loss": 4.8638,
"mean_token_accuracy": 0.21062728762626648,
"num_tokens": 61484147.0,
"step": 35435
},
{
"entropy": 5.338674116134643,
"epoch": 2.757362380859755,
"grad_norm": 1.0703125,
"learning_rate": 0.00042375940795562594,
"loss": 4.8527,
"mean_token_accuracy": 0.2058672696352005,
"num_tokens": 61492396.0,
"step": 35440
},
{
"entropy": 5.307626247406006,
"epoch": 2.7577514102314726,
"grad_norm": 1.0859375,
"learning_rate": 0.00042373861317516944,
"loss": 4.9401,
"mean_token_accuracy": 0.1950557366013527,
"num_tokens": 61500941.0,
"step": 35445
},
{
"entropy": 5.403898000717163,
"epoch": 2.75814043960319,
"grad_norm": 1.125,
"learning_rate": 0.0004237178161378412,
"loss": 4.9698,
"mean_token_accuracy": 0.20358236879110336,
"num_tokens": 61510245.0,
"step": 35450
},
{
"entropy": 5.328627252578736,
"epoch": 2.7585294689749076,
"grad_norm": 1.1640625,
"learning_rate": 0.0004236970168439568,
"loss": 4.9118,
"mean_token_accuracy": 0.19908031970262527,
"num_tokens": 61519070.0,
"step": 35455
},
{
"entropy": 5.281628799438477,
"epoch": 2.7589184983466253,
"grad_norm": 1.1015625,
"learning_rate": 0.00042367621529383186,
"loss": 4.8422,
"mean_token_accuracy": 0.21207236647605895,
"num_tokens": 61526931.0,
"step": 35460
},
{
"entropy": 5.490721368789673,
"epoch": 2.7593075277183425,
"grad_norm": 1.125,
"learning_rate": 0.00042365541148778205,
"loss": 5.0685,
"mean_token_accuracy": 0.19526457339525222,
"num_tokens": 61534645.0,
"step": 35465
},
{
"entropy": 5.372731447219849,
"epoch": 2.7596965570900602,
"grad_norm": 1.2109375,
"learning_rate": 0.00042363460542612285,
"loss": 4.9027,
"mean_token_accuracy": 0.20172665417194366,
"num_tokens": 61542770.0,
"step": 35470
},
{
"entropy": 5.337182569503784,
"epoch": 2.760085586461778,
"grad_norm": 1.2265625,
"learning_rate": 0.0004236137971091702,
"loss": 4.982,
"mean_token_accuracy": 0.20445164889097214,
"num_tokens": 61551059.0,
"step": 35475
},
{
"entropy": 5.36499662399292,
"epoch": 2.7604746158334956,
"grad_norm": 1.109375,
"learning_rate": 0.00042359298653723963,
"loss": 4.8399,
"mean_token_accuracy": 0.20569880306720734,
"num_tokens": 61559384.0,
"step": 35480
},
{
"entropy": 5.31025013923645,
"epoch": 2.760863645205213,
"grad_norm": 1.1171875,
"learning_rate": 0.0004235721737106471,
"loss": 4.8965,
"mean_token_accuracy": 0.20264946222305297,
"num_tokens": 61568335.0,
"step": 35485
},
{
"entropy": 5.36141939163208,
"epoch": 2.7612526745769306,
"grad_norm": 1.140625,
"learning_rate": 0.0004235513586297082,
"loss": 4.9158,
"mean_token_accuracy": 0.19997848719358444,
"num_tokens": 61577481.0,
"step": 35490
},
{
"entropy": 5.366316604614258,
"epoch": 2.7616417039486483,
"grad_norm": 1.09375,
"learning_rate": 0.00042353054129473894,
"loss": 4.9598,
"mean_token_accuracy": 0.1976238504052162,
"num_tokens": 61585921.0,
"step": 35495
},
{
"entropy": 5.335967588424682,
"epoch": 2.7620307333203655,
"grad_norm": 1.109375,
"learning_rate": 0.0004235097217060552,
"loss": 4.928,
"mean_token_accuracy": 0.20122514814138412,
"num_tokens": 61594548.0,
"step": 35500
},
{
"entropy": 5.383836698532105,
"epoch": 2.7624197626920832,
"grad_norm": 1.1796875,
"learning_rate": 0.0004234888998639727,
"loss": 4.989,
"mean_token_accuracy": 0.2102173998951912,
"num_tokens": 61603165.0,
"step": 35505
},
{
"entropy": 5.3815693855285645,
"epoch": 2.762808792063801,
"grad_norm": 1.1328125,
"learning_rate": 0.0004234680757688076,
"loss": 4.866,
"mean_token_accuracy": 0.20518524646759034,
"num_tokens": 61611920.0,
"step": 35510
},
{
"entropy": 5.387668514251709,
"epoch": 2.7631978214355186,
"grad_norm": 1.203125,
"learning_rate": 0.00042344724942087564,
"loss": 4.976,
"mean_token_accuracy": 0.20233292728662491,
"num_tokens": 61620553.0,
"step": 35515
},
{
"entropy": 5.376456356048584,
"epoch": 2.763586850807236,
"grad_norm": 1.1640625,
"learning_rate": 0.000423426420820493,
"loss": 4.9631,
"mean_token_accuracy": 0.20021985620260238,
"num_tokens": 61629319.0,
"step": 35520
},
{
"entropy": 5.315109443664551,
"epoch": 2.7639758801789536,
"grad_norm": 1.09375,
"learning_rate": 0.00042340558996797564,
"loss": 4.8892,
"mean_token_accuracy": 0.20272863656282425,
"num_tokens": 61638475.0,
"step": 35525
},
{
"entropy": 5.343790054321289,
"epoch": 2.764364909550671,
"grad_norm": 1.1328125,
"learning_rate": 0.00042338475686363964,
"loss": 4.9673,
"mean_token_accuracy": 0.2042631909251213,
"num_tokens": 61647345.0,
"step": 35530
},
{
"entropy": 5.456981134414673,
"epoch": 2.7647539389223885,
"grad_norm": 1.0859375,
"learning_rate": 0.0004233639215078012,
"loss": 5.0115,
"mean_token_accuracy": 0.19999634027481078,
"num_tokens": 61655871.0,
"step": 35535
},
{
"entropy": 5.462874126434326,
"epoch": 2.765142968294106,
"grad_norm": 1.1015625,
"learning_rate": 0.00042334308390077637,
"loss": 4.995,
"mean_token_accuracy": 0.20313987880945206,
"num_tokens": 61664429.0,
"step": 35540
},
{
"entropy": 5.368949937820434,
"epoch": 2.765531997665824,
"grad_norm": 1.09375,
"learning_rate": 0.0004233222440428814,
"loss": 4.915,
"mean_token_accuracy": 0.20746819972991942,
"num_tokens": 61671980.0,
"step": 35545
},
{
"entropy": 5.336424064636231,
"epoch": 2.765921027037541,
"grad_norm": 1.203125,
"learning_rate": 0.0004233014019344324,
"loss": 4.8743,
"mean_token_accuracy": 0.20979664027690886,
"num_tokens": 61680140.0,
"step": 35550
},
{
"entropy": 5.329474830627442,
"epoch": 2.766310056409259,
"grad_norm": 1.140625,
"learning_rate": 0.0004232805575757457,
"loss": 4.8982,
"mean_token_accuracy": 0.20394217371940612,
"num_tokens": 61688863.0,
"step": 35555
},
{
"entropy": 5.400298070907593,
"epoch": 2.7666990857809766,
"grad_norm": 1.140625,
"learning_rate": 0.0004232597109671375,
"loss": 4.9682,
"mean_token_accuracy": 0.20032827705144882,
"num_tokens": 61697494.0,
"step": 35560
},
{
"entropy": 5.3413981914520265,
"epoch": 2.767088115152694,
"grad_norm": 1.1484375,
"learning_rate": 0.0004232388621089242,
"loss": 4.9739,
"mean_token_accuracy": 0.20093736797571182,
"num_tokens": 61706456.0,
"step": 35565
},
{
"entropy": 5.462663269042968,
"epoch": 2.7674771445244115,
"grad_norm": 1.140625,
"learning_rate": 0.00042321801100142216,
"loss": 5.0609,
"mean_token_accuracy": 0.19452243000268937,
"num_tokens": 61715123.0,
"step": 35570
},
{
"entropy": 5.415610933303833,
"epoch": 2.767866173896129,
"grad_norm": 1.1796875,
"learning_rate": 0.00042319715764494765,
"loss": 4.9085,
"mean_token_accuracy": 0.19967283457517623,
"num_tokens": 61724129.0,
"step": 35575
},
{
"entropy": 5.334870862960815,
"epoch": 2.768255203267847,
"grad_norm": 1.1796875,
"learning_rate": 0.00042317630203981714,
"loss": 5.0316,
"mean_token_accuracy": 0.19839723408222198,
"num_tokens": 61732646.0,
"step": 35580
},
{
"entropy": 5.416912317276001,
"epoch": 2.768644232639564,
"grad_norm": 1.125,
"learning_rate": 0.00042315544418634714,
"loss": 4.9667,
"mean_token_accuracy": 0.19532251209020615,
"num_tokens": 61741511.0,
"step": 35585
},
{
"entropy": 5.440603446960449,
"epoch": 2.769033262011282,
"grad_norm": 1.109375,
"learning_rate": 0.00042313458408485414,
"loss": 4.9941,
"mean_token_accuracy": 0.20095448791980744,
"num_tokens": 61749703.0,
"step": 35590
},
{
"entropy": 5.373387718200684,
"epoch": 2.7694222913829996,
"grad_norm": 1.109375,
"learning_rate": 0.00042311372173565456,
"loss": 4.9182,
"mean_token_accuracy": 0.20611383020877838,
"num_tokens": 61758943.0,
"step": 35595
},
{
"entropy": 5.367106246948242,
"epoch": 2.769811320754717,
"grad_norm": 1.1953125,
"learning_rate": 0.000423092857139065,
"loss": 4.9299,
"mean_token_accuracy": 0.20111970454454423,
"num_tokens": 61767120.0,
"step": 35600
},
{
"entropy": 5.378551387786866,
"epoch": 2.7702003501264345,
"grad_norm": 1.21875,
"learning_rate": 0.000423071990295402,
"loss": 4.9353,
"mean_token_accuracy": 0.20005976855754853,
"num_tokens": 61774760.0,
"step": 35605
},
{
"entropy": 5.325633764266968,
"epoch": 2.770589379498152,
"grad_norm": 1.1484375,
"learning_rate": 0.0004230511212049822,
"loss": 4.9412,
"mean_token_accuracy": 0.20574485510587692,
"num_tokens": 61783792.0,
"step": 35610
},
{
"entropy": 5.408705425262451,
"epoch": 2.77097840886987,
"grad_norm": 1.1484375,
"learning_rate": 0.0004230302498681224,
"loss": 5.0379,
"mean_token_accuracy": 0.1960559830069542,
"num_tokens": 61791991.0,
"step": 35615
},
{
"entropy": 5.408001852035523,
"epoch": 2.771367438241587,
"grad_norm": 1.09375,
"learning_rate": 0.0004230093762851392,
"loss": 4.9452,
"mean_token_accuracy": 0.20775496810674668,
"num_tokens": 61801813.0,
"step": 35620
},
{
"entropy": 5.354648303985596,
"epoch": 2.771756467613305,
"grad_norm": 1.1015625,
"learning_rate": 0.0004229885004563491,
"loss": 4.8775,
"mean_token_accuracy": 0.21010547876358032,
"num_tokens": 61810140.0,
"step": 35625
},
{
"entropy": 5.2795275211334225,
"epoch": 2.772145496985022,
"grad_norm": 1.203125,
"learning_rate": 0.0004229676223820692,
"loss": 4.7705,
"mean_token_accuracy": 0.21120137274265288,
"num_tokens": 61818168.0,
"step": 35630
},
{
"entropy": 5.296066045761108,
"epoch": 2.77253452635674,
"grad_norm": 1.1328125,
"learning_rate": 0.00042294674206261616,
"loss": 4.9046,
"mean_token_accuracy": 0.20227013230323793,
"num_tokens": 61826640.0,
"step": 35635
},
{
"entropy": 5.284491491317749,
"epoch": 2.7729235557284575,
"grad_norm": 1.2421875,
"learning_rate": 0.0004229258594983067,
"loss": 4.998,
"mean_token_accuracy": 0.20229514986276625,
"num_tokens": 61834787.0,
"step": 35640
},
{
"entropy": 5.3971727848052975,
"epoch": 2.773312585100175,
"grad_norm": 1.15625,
"learning_rate": 0.0004229049746894578,
"loss": 4.9793,
"mean_token_accuracy": 0.20435227900743486,
"num_tokens": 61842847.0,
"step": 35645
},
{
"entropy": 5.533141946792602,
"epoch": 2.773701614471893,
"grad_norm": 1.171875,
"learning_rate": 0.0004228840876363864,
"loss": 5.1356,
"mean_token_accuracy": 0.19535896927118301,
"num_tokens": 61851786.0,
"step": 35650
},
{
"entropy": 5.374950361251831,
"epoch": 2.77409064384361,
"grad_norm": 1.15625,
"learning_rate": 0.0004228631983394093,
"loss": 4.9461,
"mean_token_accuracy": 0.21153436303138734,
"num_tokens": 61859917.0,
"step": 35655
},
{
"entropy": 5.373160791397095,
"epoch": 2.774479673215328,
"grad_norm": 1.109375,
"learning_rate": 0.0004228423067988434,
"loss": 4.9572,
"mean_token_accuracy": 0.19733852446079253,
"num_tokens": 61868489.0,
"step": 35660
},
{
"entropy": 5.400880765914917,
"epoch": 2.774868702587045,
"grad_norm": 1.1640625,
"learning_rate": 0.00042282141301500597,
"loss": 5.0065,
"mean_token_accuracy": 0.1996640831232071,
"num_tokens": 61876896.0,
"step": 35665
},
{
"entropy": 5.4187816143035885,
"epoch": 2.775257731958763,
"grad_norm": 1.078125,
"learning_rate": 0.0004228005169882138,
"loss": 4.9951,
"mean_token_accuracy": 0.1983704686164856,
"num_tokens": 61886110.0,
"step": 35670
},
{
"entropy": 5.369893550872803,
"epoch": 2.7756467613304805,
"grad_norm": 1.1953125,
"learning_rate": 0.00042277961871878413,
"loss": 4.9921,
"mean_token_accuracy": 0.19732103496789932,
"num_tokens": 61894121.0,
"step": 35675
},
{
"entropy": 5.408855962753296,
"epoch": 2.776035790702198,
"grad_norm": 1.15625,
"learning_rate": 0.0004227587182070338,
"loss": 4.9535,
"mean_token_accuracy": 0.20409446805715561,
"num_tokens": 61903125.0,
"step": 35680
},
{
"entropy": 5.436468029022217,
"epoch": 2.7764248200739154,
"grad_norm": 1.0546875,
"learning_rate": 0.0004227378154532802,
"loss": 5.0449,
"mean_token_accuracy": 0.18957674950361253,
"num_tokens": 61912368.0,
"step": 35685
},
{
"entropy": 5.391947460174561,
"epoch": 2.776813849445633,
"grad_norm": 1.0703125,
"learning_rate": 0.0004227169104578404,
"loss": 4.9544,
"mean_token_accuracy": 0.20451094061136246,
"num_tokens": 61921044.0,
"step": 35690
},
{
"entropy": 5.318208074569702,
"epoch": 2.777202878817351,
"grad_norm": 1.140625,
"learning_rate": 0.00042269600322103164,
"loss": 4.9393,
"mean_token_accuracy": 0.19535464197397232,
"num_tokens": 61928706.0,
"step": 35695
},
{
"entropy": 5.346081495285034,
"epoch": 2.777591908189068,
"grad_norm": 1.171875,
"learning_rate": 0.000422675093743171,
"loss": 4.9601,
"mean_token_accuracy": 0.19464902579784393,
"num_tokens": 61936403.0,
"step": 35700
},
{
"entropy": 5.3589637756347654,
"epoch": 2.777980937560786,
"grad_norm": 1.078125,
"learning_rate": 0.00042265418202457603,
"loss": 4.8871,
"mean_token_accuracy": 0.20945197194814683,
"num_tokens": 61944970.0,
"step": 35705
},
{
"entropy": 5.345932960510254,
"epoch": 2.7783699669325035,
"grad_norm": 1.125,
"learning_rate": 0.0004226332680655637,
"loss": 4.9227,
"mean_token_accuracy": 0.2015525832772255,
"num_tokens": 61953305.0,
"step": 35710
},
{
"entropy": 5.346392107009888,
"epoch": 2.778758996304221,
"grad_norm": 1.1015625,
"learning_rate": 0.0004226123518664516,
"loss": 4.9283,
"mean_token_accuracy": 0.20176543146371842,
"num_tokens": 61961098.0,
"step": 35715
},
{
"entropy": 5.385269021987915,
"epoch": 2.7791480256759384,
"grad_norm": 1.125,
"learning_rate": 0.0004225914334275569,
"loss": 4.942,
"mean_token_accuracy": 0.19839888215065002,
"num_tokens": 61970862.0,
"step": 35720
},
{
"entropy": 5.3258466720581055,
"epoch": 2.779537055047656,
"grad_norm": 1.1484375,
"learning_rate": 0.0004225705127491972,
"loss": 4.8549,
"mean_token_accuracy": 0.20808338224887848,
"num_tokens": 61978967.0,
"step": 35725
},
{
"entropy": 5.381014347076416,
"epoch": 2.7799260844193734,
"grad_norm": 1.203125,
"learning_rate": 0.0004225495898316899,
"loss": 4.9527,
"mean_token_accuracy": 0.20078279674053193,
"num_tokens": 61987251.0,
"step": 35730
},
{
"entropy": 5.410920238494873,
"epoch": 2.780315113791091,
"grad_norm": 1.1171875,
"learning_rate": 0.00042252866467535233,
"loss": 4.983,
"mean_token_accuracy": 0.2016053557395935,
"num_tokens": 61995203.0,
"step": 35735
},
{
"entropy": 5.368065309524536,
"epoch": 2.780704143162809,
"grad_norm": 1.125,
"learning_rate": 0.00042250773728050214,
"loss": 5.0629,
"mean_token_accuracy": 0.1950654312968254,
"num_tokens": 62004156.0,
"step": 35740
},
{
"entropy": 5.337486362457275,
"epoch": 2.7810931725345265,
"grad_norm": 1.1484375,
"learning_rate": 0.0004224868076474568,
"loss": 4.8767,
"mean_token_accuracy": 0.200043386220932,
"num_tokens": 62012919.0,
"step": 35745
},
{
"entropy": 5.333290004730225,
"epoch": 2.781482201906244,
"grad_norm": 1.1328125,
"learning_rate": 0.00042246587577653394,
"loss": 4.9753,
"mean_token_accuracy": 0.19514933228492737,
"num_tokens": 62022622.0,
"step": 35750
},
{
"entropy": 5.404968118667602,
"epoch": 2.7818712312779614,
"grad_norm": 1.15625,
"learning_rate": 0.0004224449416680511,
"loss": 5.0412,
"mean_token_accuracy": 0.1928999423980713,
"num_tokens": 62030747.0,
"step": 35755
},
{
"entropy": 5.4228067874908445,
"epoch": 2.782260260649679,
"grad_norm": 1.140625,
"learning_rate": 0.00042242400532232593,
"loss": 4.9816,
"mean_token_accuracy": 0.201634918153286,
"num_tokens": 62039722.0,
"step": 35760
},
{
"entropy": 5.349869155883789,
"epoch": 2.7826492900213964,
"grad_norm": 1.1875,
"learning_rate": 0.00042240306673967614,
"loss": 4.9653,
"mean_token_accuracy": 0.20043555796146392,
"num_tokens": 62047907.0,
"step": 35765
},
{
"entropy": 5.341720962524414,
"epoch": 2.783038319393114,
"grad_norm": 1.125,
"learning_rate": 0.00042238212592041945,
"loss": 5.012,
"mean_token_accuracy": 0.19695937484502793,
"num_tokens": 62056917.0,
"step": 35770
},
{
"entropy": 5.358563852310181,
"epoch": 2.7834273487648318,
"grad_norm": 1.15625,
"learning_rate": 0.00042236118286487364,
"loss": 4.8936,
"mean_token_accuracy": 0.20683083385229112,
"num_tokens": 62065396.0,
"step": 35775
},
{
"entropy": 5.332380628585815,
"epoch": 2.7838163781365495,
"grad_norm": 1.09375,
"learning_rate": 0.00042234023757335633,
"loss": 4.9876,
"mean_token_accuracy": 0.19964022189378738,
"num_tokens": 62074202.0,
"step": 35780
},
{
"entropy": 5.304440307617187,
"epoch": 2.7842054075082667,
"grad_norm": 1.1015625,
"learning_rate": 0.00042231929004618547,
"loss": 4.8072,
"mean_token_accuracy": 0.21160324960947036,
"num_tokens": 62082444.0,
"step": 35785
},
{
"entropy": 5.27491021156311,
"epoch": 2.7845944368799844,
"grad_norm": 1.0703125,
"learning_rate": 0.0004222983402836789,
"loss": 4.8236,
"mean_token_accuracy": 0.21052322834730147,
"num_tokens": 62090959.0,
"step": 35790
},
{
"entropy": 5.390896940231324,
"epoch": 2.784983466251702,
"grad_norm": 1.1640625,
"learning_rate": 0.00042227738828615435,
"loss": 5.0151,
"mean_token_accuracy": 0.2026684984564781,
"num_tokens": 62099007.0,
"step": 35795
},
{
"entropy": 5.4437665939331055,
"epoch": 2.7853724956234194,
"grad_norm": 1.0390625,
"learning_rate": 0.00042225643405392993,
"loss": 4.9884,
"mean_token_accuracy": 0.20288634449243545,
"num_tokens": 62107754.0,
"step": 35800
},
{
"entropy": 5.456705379486084,
"epoch": 2.785761524995137,
"grad_norm": 1.25,
"learning_rate": 0.00042223547758732356,
"loss": 5.0598,
"mean_token_accuracy": 0.19531172662973403,
"num_tokens": 62117183.0,
"step": 35805
},
{
"entropy": 5.403119897842407,
"epoch": 2.7861505543668548,
"grad_norm": 1.1875,
"learning_rate": 0.00042221451888665307,
"loss": 5.0096,
"mean_token_accuracy": 0.19551265835762024,
"num_tokens": 62125713.0,
"step": 35810
},
{
"entropy": 5.40948486328125,
"epoch": 2.7865395837385725,
"grad_norm": 1.078125,
"learning_rate": 0.00042219355795223657,
"loss": 4.9553,
"mean_token_accuracy": 0.20462547540664672,
"num_tokens": 62134361.0,
"step": 35815
},
{
"entropy": 5.339956188201905,
"epoch": 2.7869286131102897,
"grad_norm": 1.140625,
"learning_rate": 0.00042217259478439216,
"loss": 4.9441,
"mean_token_accuracy": 0.2061563551425934,
"num_tokens": 62142912.0,
"step": 35820
},
{
"entropy": 5.382092142105103,
"epoch": 2.7873176424820074,
"grad_norm": 1.171875,
"learning_rate": 0.0004221516293834379,
"loss": 4.9626,
"mean_token_accuracy": 0.20627699196338653,
"num_tokens": 62150873.0,
"step": 35825
},
{
"entropy": 5.368696403503418,
"epoch": 2.787706671853725,
"grad_norm": 1.1953125,
"learning_rate": 0.00042213066174969177,
"loss": 5.0314,
"mean_token_accuracy": 0.18966059386730194,
"num_tokens": 62159734.0,
"step": 35830
},
{
"entropy": 5.386071395874024,
"epoch": 2.7880957012254424,
"grad_norm": 1.15625,
"learning_rate": 0.00042210969188347217,
"loss": 4.9323,
"mean_token_accuracy": 0.21106959879398346,
"num_tokens": 62168319.0,
"step": 35835
},
{
"entropy": 5.433932828903198,
"epoch": 2.78848473059716,
"grad_norm": 1.15625,
"learning_rate": 0.0004220887197850971,
"loss": 4.9961,
"mean_token_accuracy": 0.19384128600358963,
"num_tokens": 62177176.0,
"step": 35840
},
{
"entropy": 5.416434049606323,
"epoch": 2.7888737599688778,
"grad_norm": 1.140625,
"learning_rate": 0.00042206774545488476,
"loss": 4.9848,
"mean_token_accuracy": 0.19898433238267899,
"num_tokens": 62185488.0,
"step": 35845
},
{
"entropy": 5.451373434066772,
"epoch": 2.7892627893405955,
"grad_norm": 1.15625,
"learning_rate": 0.0004220467688931535,
"loss": 5.0387,
"mean_token_accuracy": 0.20304933190345764,
"num_tokens": 62193707.0,
"step": 35850
},
{
"entropy": 5.395894336700439,
"epoch": 2.7896518187123127,
"grad_norm": 1.1171875,
"learning_rate": 0.0004220257901002216,
"loss": 4.9499,
"mean_token_accuracy": 0.19926830381155014,
"num_tokens": 62201820.0,
"step": 35855
},
{
"entropy": 5.473869943618775,
"epoch": 2.7900408480840304,
"grad_norm": 1.21875,
"learning_rate": 0.0004220048090764073,
"loss": 5.0984,
"mean_token_accuracy": 0.19504852443933487,
"num_tokens": 62210239.0,
"step": 35860
},
{
"entropy": 5.44324803352356,
"epoch": 2.7904298774557477,
"grad_norm": 1.125,
"learning_rate": 0.00042198382582202905,
"loss": 5.0189,
"mean_token_accuracy": 0.1998055800795555,
"num_tokens": 62218818.0,
"step": 35865
},
{
"entropy": 5.396937274932862,
"epoch": 2.7908189068274654,
"grad_norm": 1.0546875,
"learning_rate": 0.0004219628403374052,
"loss": 5.0284,
"mean_token_accuracy": 0.20015837997198105,
"num_tokens": 62227091.0,
"step": 35870
},
{
"entropy": 5.303743934631347,
"epoch": 2.791207936199183,
"grad_norm": 1.0859375,
"learning_rate": 0.0004219418526228541,
"loss": 4.9864,
"mean_token_accuracy": 0.19633195400238038,
"num_tokens": 62235838.0,
"step": 35875
},
{
"entropy": 5.41057939529419,
"epoch": 2.7915969655709008,
"grad_norm": 1.1640625,
"learning_rate": 0.0004219208626786943,
"loss": 4.9343,
"mean_token_accuracy": 0.20225551426410676,
"num_tokens": 62244081.0,
"step": 35880
},
{
"entropy": 5.37317304611206,
"epoch": 2.791985994942618,
"grad_norm": 1.1171875,
"learning_rate": 0.0004218998705052443,
"loss": 5.0387,
"mean_token_accuracy": 0.1921651378273964,
"num_tokens": 62253187.0,
"step": 35885
},
{
"entropy": 5.362657260894776,
"epoch": 2.7923750243143357,
"grad_norm": 1.2421875,
"learning_rate": 0.00042187887610282255,
"loss": 5.0024,
"mean_token_accuracy": 0.20515951216220857,
"num_tokens": 62261004.0,
"step": 35890
},
{
"entropy": 5.431461381912231,
"epoch": 2.7927640536860534,
"grad_norm": 1.1328125,
"learning_rate": 0.0004218578794717476,
"loss": 4.9953,
"mean_token_accuracy": 0.20168450027704238,
"num_tokens": 62270196.0,
"step": 35895
},
{
"entropy": 5.332183885574341,
"epoch": 2.7931530830577707,
"grad_norm": 1.1328125,
"learning_rate": 0.00042183688061233813,
"loss": 4.9382,
"mean_token_accuracy": 0.1985442414879799,
"num_tokens": 62278637.0,
"step": 35900
},
{
"entropy": 5.287631845474243,
"epoch": 2.7935421124294884,
"grad_norm": 1.125,
"learning_rate": 0.00042181587952491267,
"loss": 4.923,
"mean_token_accuracy": 0.20275683850049972,
"num_tokens": 62287678.0,
"step": 35905
},
{
"entropy": 5.3567403793334964,
"epoch": 2.793931141801206,
"grad_norm": 1.09375,
"learning_rate": 0.00042179487620978997,
"loss": 4.9885,
"mean_token_accuracy": 0.20701873153448105,
"num_tokens": 62296123.0,
"step": 35910
},
{
"entropy": 5.397895336151123,
"epoch": 2.7943201711729238,
"grad_norm": 1.2734375,
"learning_rate": 0.0004217738706672886,
"loss": 4.9659,
"mean_token_accuracy": 0.19987784326076508,
"num_tokens": 62304677.0,
"step": 35915
},
{
"entropy": 5.431461429595947,
"epoch": 2.794709200544641,
"grad_norm": 1.1484375,
"learning_rate": 0.00042175286289772746,
"loss": 4.9787,
"mean_token_accuracy": 0.20081232488155365,
"num_tokens": 62313944.0,
"step": 35920
},
{
"entropy": 5.354380798339844,
"epoch": 2.7950982299163587,
"grad_norm": 1.1328125,
"learning_rate": 0.0004217318529014251,
"loss": 4.9589,
"mean_token_accuracy": 0.19173699468374253,
"num_tokens": 62323053.0,
"step": 35925
},
{
"entropy": 5.405733680725097,
"epoch": 2.7954872592880764,
"grad_norm": 1.1171875,
"learning_rate": 0.0004217108406787005,
"loss": 5.025,
"mean_token_accuracy": 0.19425627142190932,
"num_tokens": 62332642.0,
"step": 35930
},
{
"entropy": 5.4298171043396,
"epoch": 2.7958762886597937,
"grad_norm": 1.109375,
"learning_rate": 0.0004216898262298724,
"loss": 5.0193,
"mean_token_accuracy": 0.19440154433250428,
"num_tokens": 62341700.0,
"step": 35935
},
{
"entropy": 5.435423374176025,
"epoch": 2.7962653180315113,
"grad_norm": 1.1015625,
"learning_rate": 0.0004216688095552596,
"loss": 4.9806,
"mean_token_accuracy": 0.19441543966531755,
"num_tokens": 62350828.0,
"step": 35940
},
{
"entropy": 5.294579601287841,
"epoch": 2.796654347403229,
"grad_norm": 1.109375,
"learning_rate": 0.0004216477906551811,
"loss": 4.8847,
"mean_token_accuracy": 0.20516541749238967,
"num_tokens": 62359494.0,
"step": 35945
},
{
"entropy": 5.31225357055664,
"epoch": 2.7970433767749467,
"grad_norm": 1.09375,
"learning_rate": 0.00042162676952995585,
"loss": 4.9149,
"mean_token_accuracy": 0.20603366792201996,
"num_tokens": 62368272.0,
"step": 35950
},
{
"entropy": 5.277890729904175,
"epoch": 2.797432406146664,
"grad_norm": 1.0234375,
"learning_rate": 0.00042160574617990267,
"loss": 4.9439,
"mean_token_accuracy": 0.20141870081424712,
"num_tokens": 62376937.0,
"step": 35955
},
{
"entropy": 5.409234714508057,
"epoch": 2.7978214355183817,
"grad_norm": 1.1484375,
"learning_rate": 0.00042158472060534066,
"loss": 5.0232,
"mean_token_accuracy": 0.19266002327203752,
"num_tokens": 62385765.0,
"step": 35960
},
{
"entropy": 5.353356218338012,
"epoch": 2.798210464890099,
"grad_norm": 1.1875,
"learning_rate": 0.00042156369280658886,
"loss": 4.8681,
"mean_token_accuracy": 0.20790167152881622,
"num_tokens": 62393640.0,
"step": 35965
},
{
"entropy": 5.326437616348267,
"epoch": 2.7985994942618166,
"grad_norm": 1.1953125,
"learning_rate": 0.0004215426627839662,
"loss": 4.9028,
"mean_token_accuracy": 0.20326767712831498,
"num_tokens": 62402138.0,
"step": 35970
},
{
"entropy": 5.350489282608033,
"epoch": 2.7989885236335343,
"grad_norm": 1.2109375,
"learning_rate": 0.00042152163053779196,
"loss": 5.015,
"mean_token_accuracy": 0.1896110087633133,
"num_tokens": 62410257.0,
"step": 35975
},
{
"entropy": 5.4010961055755615,
"epoch": 2.799377553005252,
"grad_norm": 1.1328125,
"learning_rate": 0.0004215005960683852,
"loss": 5.0177,
"mean_token_accuracy": 0.20254910439252855,
"num_tokens": 62418409.0,
"step": 35980
},
{
"entropy": 5.341051340103149,
"epoch": 2.7997665823769697,
"grad_norm": 1.09375,
"learning_rate": 0.0004214795593760651,
"loss": 4.9231,
"mean_token_accuracy": 0.20879304856061937,
"num_tokens": 62426921.0,
"step": 35985
},
{
"entropy": 5.37565279006958,
"epoch": 2.800155611748687,
"grad_norm": 1.0859375,
"learning_rate": 0.0004214585204611508,
"loss": 5.0376,
"mean_token_accuracy": 0.1927580177783966,
"num_tokens": 62435293.0,
"step": 35990
},
{
"entropy": 5.41786561012268,
"epoch": 2.8005446411204047,
"grad_norm": 1.125,
"learning_rate": 0.00042143747932396153,
"loss": 5.0094,
"mean_token_accuracy": 0.19439303129911423,
"num_tokens": 62443678.0,
"step": 35995
},
{
"entropy": 5.4135498046875,
"epoch": 2.800933670492122,
"grad_norm": 1.125,
"learning_rate": 0.0004214164359648166,
"loss": 5.0138,
"mean_token_accuracy": 0.19614969342947006,
"num_tokens": 62452092.0,
"step": 36000
},
{
"epoch": 2.800933670492122,
"eval_entropy": 5.242157841095911,
"eval_loss": 5.072832107543945,
"eval_mean_token_accuracy": 0.20369743779803606,
"eval_num_tokens": 62452092.0,
"eval_runtime": 28.4648,
"eval_samples_per_second": 1459.98,
"eval_steps_per_second": 182.506,
"step": 36000
},
{
"entropy": 5.496697807312012,
"epoch": 2.8013226998638396,
"grad_norm": 1.140625,
"learning_rate": 0.00042139539038403535,
"loss": 5.0364,
"mean_token_accuracy": 0.19904019236564635,
"num_tokens": 62460584.0,
"step": 36005
},
{
"entropy": 5.3883216381073,
"epoch": 2.8017117292355573,
"grad_norm": 1.203125,
"learning_rate": 0.000421374342581937,
"loss": 5.0312,
"mean_token_accuracy": 0.19158420115709304,
"num_tokens": 62468615.0,
"step": 36010
},
{
"entropy": 5.404989433288574,
"epoch": 2.802100758607275,
"grad_norm": 1.09375,
"learning_rate": 0.00042135329255884105,
"loss": 5.1179,
"mean_token_accuracy": 0.19171320348978044,
"num_tokens": 62477630.0,
"step": 36015
},
{
"entropy": 5.367208051681518,
"epoch": 2.8024897879789923,
"grad_norm": 1.09375,
"learning_rate": 0.0004213322403150668,
"loss": 4.8979,
"mean_token_accuracy": 0.20310165584087372,
"num_tokens": 62486385.0,
"step": 36020
},
{
"entropy": 5.344372510910034,
"epoch": 2.80287881735071,
"grad_norm": 1.1640625,
"learning_rate": 0.0004213111858509337,
"loss": 4.8285,
"mean_token_accuracy": 0.2146202802658081,
"num_tokens": 62494502.0,
"step": 36025
},
{
"entropy": 5.316223764419556,
"epoch": 2.8032678467224277,
"grad_norm": 1.1171875,
"learning_rate": 0.0004212901291667612,
"loss": 4.8784,
"mean_token_accuracy": 0.21158030778169631,
"num_tokens": 62503365.0,
"step": 36030
},
{
"entropy": 5.348690414428711,
"epoch": 2.803656876094145,
"grad_norm": 1.125,
"learning_rate": 0.00042126907026286887,
"loss": 4.9606,
"mean_token_accuracy": 0.1969559222459793,
"num_tokens": 62511932.0,
"step": 36035
},
{
"entropy": 5.325362777709961,
"epoch": 2.8040459054658626,
"grad_norm": 1.140625,
"learning_rate": 0.00042124800913957624,
"loss": 4.8943,
"mean_token_accuracy": 0.20597973018884658,
"num_tokens": 62520478.0,
"step": 36040
},
{
"entropy": 5.269071292877197,
"epoch": 2.8044349348375803,
"grad_norm": 1.140625,
"learning_rate": 0.0004212269457972028,
"loss": 4.8238,
"mean_token_accuracy": 0.20605671256780625,
"num_tokens": 62529514.0,
"step": 36045
},
{
"entropy": 5.405153274536133,
"epoch": 2.804823964209298,
"grad_norm": 1.171875,
"learning_rate": 0.0004212058802360682,
"loss": 5.0836,
"mean_token_accuracy": 0.19601190835237503,
"num_tokens": 62538735.0,
"step": 36050
},
{
"entropy": 5.384910440444946,
"epoch": 2.8052129935810153,
"grad_norm": 1.109375,
"learning_rate": 0.0004211848124564922,
"loss": 4.9606,
"mean_token_accuracy": 0.19250165075063705,
"num_tokens": 62548440.0,
"step": 36055
},
{
"entropy": 5.380704021453857,
"epoch": 2.805602022952733,
"grad_norm": 1.21875,
"learning_rate": 0.0004211637424587942,
"loss": 5.0529,
"mean_token_accuracy": 0.19883662909269334,
"num_tokens": 62556611.0,
"step": 36060
},
{
"entropy": 5.31823959350586,
"epoch": 2.8059910523244502,
"grad_norm": 1.5234375,
"learning_rate": 0.0004211426702432941,
"loss": 4.8409,
"mean_token_accuracy": 0.21831856667995453,
"num_tokens": 62565672.0,
"step": 36065
},
{
"entropy": 5.3300010681152346,
"epoch": 2.806380081696168,
"grad_norm": 1.1328125,
"learning_rate": 0.0004211215958103116,
"loss": 4.8759,
"mean_token_accuracy": 0.20394042432308196,
"num_tokens": 62574037.0,
"step": 36070
},
{
"entropy": 5.325292587280273,
"epoch": 2.8067691110678856,
"grad_norm": 1.1796875,
"learning_rate": 0.00042110051916016645,
"loss": 4.9747,
"mean_token_accuracy": 0.20170585215091705,
"num_tokens": 62582210.0,
"step": 36075
},
{
"entropy": 5.33481183052063,
"epoch": 2.8071581404396033,
"grad_norm": 1.2265625,
"learning_rate": 0.0004210794402931785,
"loss": 4.9106,
"mean_token_accuracy": 0.20568906962871553,
"num_tokens": 62591442.0,
"step": 36080
},
{
"entropy": 5.382985925674438,
"epoch": 2.807547169811321,
"grad_norm": 1.09375,
"learning_rate": 0.0004210583592096675,
"loss": 5.0256,
"mean_token_accuracy": 0.1973895937204361,
"num_tokens": 62599520.0,
"step": 36085
},
{
"entropy": 5.38798041343689,
"epoch": 2.8079361991830383,
"grad_norm": 1.1328125,
"learning_rate": 0.0004210372759099534,
"loss": 4.9608,
"mean_token_accuracy": 0.2040404498577118,
"num_tokens": 62606663.0,
"step": 36090
},
{
"entropy": 5.342358636856079,
"epoch": 2.808325228554756,
"grad_norm": 1.0546875,
"learning_rate": 0.000421016190394356,
"loss": 4.9692,
"mean_token_accuracy": 0.19702014476060867,
"num_tokens": 62615056.0,
"step": 36095
},
{
"entropy": 5.416167306900024,
"epoch": 2.8087142579264732,
"grad_norm": 1.1015625,
"learning_rate": 0.00042099510266319545,
"loss": 5.0174,
"mean_token_accuracy": 0.1966432511806488,
"num_tokens": 62623627.0,
"step": 36100
},
{
"entropy": 5.433665037155151,
"epoch": 2.809103287298191,
"grad_norm": 1.15625,
"learning_rate": 0.0004209740127167915,
"loss": 5.0456,
"mean_token_accuracy": 0.19751810133457184,
"num_tokens": 62632980.0,
"step": 36105
},
{
"entropy": 5.389589595794678,
"epoch": 2.8094923166699086,
"grad_norm": 1.0859375,
"learning_rate": 0.0004209529205554643,
"loss": 4.8443,
"mean_token_accuracy": 0.20525031089782714,
"num_tokens": 62641259.0,
"step": 36110
},
{
"entropy": 5.3763734817504885,
"epoch": 2.8098813460416263,
"grad_norm": 1.203125,
"learning_rate": 0.0004209318261795339,
"loss": 5.0505,
"mean_token_accuracy": 0.19455087333917617,
"num_tokens": 62649540.0,
"step": 36115
},
{
"entropy": 5.389378452301026,
"epoch": 2.8102703754133436,
"grad_norm": 1.1484375,
"learning_rate": 0.0004209107295893202,
"loss": 4.9663,
"mean_token_accuracy": 0.20133348554372787,
"num_tokens": 62657496.0,
"step": 36120
},
{
"entropy": 5.3157624244689945,
"epoch": 2.8106594047850613,
"grad_norm": 1.1640625,
"learning_rate": 0.00042088963078514344,
"loss": 4.8625,
"mean_token_accuracy": 0.2132271096110344,
"num_tokens": 62665800.0,
"step": 36125
},
{
"entropy": 5.435967016220093,
"epoch": 2.811048434156779,
"grad_norm": 1.03125,
"learning_rate": 0.0004208685297673238,
"loss": 5.0693,
"mean_token_accuracy": 0.19239041805267335,
"num_tokens": 62675061.0,
"step": 36130
},
{
"entropy": 5.293759965896607,
"epoch": 2.811437463528496,
"grad_norm": 1.1015625,
"learning_rate": 0.0004208474265361813,
"loss": 4.8091,
"mean_token_accuracy": 0.21316652595996857,
"num_tokens": 62683889.0,
"step": 36135
},
{
"entropy": 5.283986759185791,
"epoch": 2.811826492900214,
"grad_norm": 1.109375,
"learning_rate": 0.00042082632109203627,
"loss": 4.909,
"mean_token_accuracy": 0.20220324397087097,
"num_tokens": 62692711.0,
"step": 36140
},
{
"entropy": 5.389346790313721,
"epoch": 2.8122155222719316,
"grad_norm": 1.1875,
"learning_rate": 0.000420805213435209,
"loss": 4.9522,
"mean_token_accuracy": 0.2059206560254097,
"num_tokens": 62701048.0,
"step": 36145
},
{
"entropy": 5.448433542251587,
"epoch": 2.8126045516436493,
"grad_norm": 1.0859375,
"learning_rate": 0.0004207841035660196,
"loss": 5.0408,
"mean_token_accuracy": 0.1933677986264229,
"num_tokens": 62710440.0,
"step": 36150
},
{
"entropy": 5.42046160697937,
"epoch": 2.8129935810153666,
"grad_norm": 1.0703125,
"learning_rate": 0.0004207629914847885,
"loss": 5.0149,
"mean_token_accuracy": 0.19544921964406967,
"num_tokens": 62719853.0,
"step": 36155
},
{
"entropy": 5.3226179599761965,
"epoch": 2.8133826103870843,
"grad_norm": 1.1328125,
"learning_rate": 0.000420741877191836,
"loss": 5.0057,
"mean_token_accuracy": 0.19301511496305465,
"num_tokens": 62729784.0,
"step": 36160
},
{
"entropy": 5.393991994857788,
"epoch": 2.8137716397588015,
"grad_norm": 1.171875,
"learning_rate": 0.0004207207606874825,
"loss": 4.9231,
"mean_token_accuracy": 0.2092340350151062,
"num_tokens": 62738414.0,
"step": 36165
},
{
"entropy": 5.374071884155273,
"epoch": 2.814160669130519,
"grad_norm": 1.140625,
"learning_rate": 0.0004206996419720484,
"loss": 4.8982,
"mean_token_accuracy": 0.2062147945165634,
"num_tokens": 62746878.0,
"step": 36170
},
{
"entropy": 5.405999851226807,
"epoch": 2.814549698502237,
"grad_norm": 1.125,
"learning_rate": 0.0004206785210458541,
"loss": 5.0265,
"mean_token_accuracy": 0.19150407165288924,
"num_tokens": 62756060.0,
"step": 36175
},
{
"entropy": 5.391122961044312,
"epoch": 2.8149387278739546,
"grad_norm": 1.1328125,
"learning_rate": 0.0004206573979092202,
"loss": 4.9174,
"mean_token_accuracy": 0.20795087665319442,
"num_tokens": 62764864.0,
"step": 36180
},
{
"entropy": 5.355766344070434,
"epoch": 2.8153277572456723,
"grad_norm": 1.140625,
"learning_rate": 0.00042063627256246706,
"loss": 4.8736,
"mean_token_accuracy": 0.20389473885297776,
"num_tokens": 62772920.0,
"step": 36185
},
{
"entropy": 5.274503755569458,
"epoch": 2.8157167866173896,
"grad_norm": 1.203125,
"learning_rate": 0.0004206151450059153,
"loss": 4.8488,
"mean_token_accuracy": 0.21296661347150803,
"num_tokens": 62781099.0,
"step": 36190
},
{
"entropy": 5.457506227493286,
"epoch": 2.8161058159891073,
"grad_norm": 1.15625,
"learning_rate": 0.00042059401523988546,
"loss": 5.064,
"mean_token_accuracy": 0.18596413284540175,
"num_tokens": 62789656.0,
"step": 36195
},
{
"entropy": 5.400265789031982,
"epoch": 2.8164948453608245,
"grad_norm": 1.1640625,
"learning_rate": 0.0004205728832646982,
"loss": 5.0507,
"mean_token_accuracy": 0.19939118176698684,
"num_tokens": 62798402.0,
"step": 36200
},
{
"entropy": 5.363863849639893,
"epoch": 2.816883874732542,
"grad_norm": 1.0703125,
"learning_rate": 0.00042055174908067414,
"loss": 4.9809,
"mean_token_accuracy": 0.20128044039011,
"num_tokens": 62807260.0,
"step": 36205
},
{
"entropy": 5.341031932830811,
"epoch": 2.81727290410426,
"grad_norm": 1.140625,
"learning_rate": 0.00042053061268813397,
"loss": 4.8372,
"mean_token_accuracy": 0.2058132842183113,
"num_tokens": 62816240.0,
"step": 36210
},
{
"entropy": 5.3960240364074705,
"epoch": 2.8176619334759776,
"grad_norm": 1.1328125,
"learning_rate": 0.00042050947408739836,
"loss": 4.9405,
"mean_token_accuracy": 0.2010473757982254,
"num_tokens": 62824630.0,
"step": 36215
},
{
"entropy": 5.3254822254180905,
"epoch": 2.818050962847695,
"grad_norm": 1.2890625,
"learning_rate": 0.0004204883332787881,
"loss": 5.0618,
"mean_token_accuracy": 0.20548894107341767,
"num_tokens": 62833193.0,
"step": 36220
},
{
"entropy": 5.31356291770935,
"epoch": 2.8184399922194125,
"grad_norm": 1.171875,
"learning_rate": 0.00042046719026262396,
"loss": 4.8894,
"mean_token_accuracy": 0.21217816770076753,
"num_tokens": 62841424.0,
"step": 36225
},
{
"entropy": 5.41585111618042,
"epoch": 2.8188290215911302,
"grad_norm": 1.171875,
"learning_rate": 0.00042044604503922674,
"loss": 4.9363,
"mean_token_accuracy": 0.1983306348323822,
"num_tokens": 62849388.0,
"step": 36230
},
{
"entropy": 5.338037204742432,
"epoch": 2.8192180509628475,
"grad_norm": 1.109375,
"learning_rate": 0.0004204248976089173,
"loss": 4.8866,
"mean_token_accuracy": 0.20652048140764237,
"num_tokens": 62857859.0,
"step": 36235
},
{
"entropy": 5.328308868408203,
"epoch": 2.819607080334565,
"grad_norm": 1.1484375,
"learning_rate": 0.0004204037479720165,
"loss": 4.9056,
"mean_token_accuracy": 0.20538002103567124,
"num_tokens": 62866558.0,
"step": 36240
},
{
"entropy": 5.277690982818603,
"epoch": 2.819996109706283,
"grad_norm": 1.1328125,
"learning_rate": 0.00042038259612884514,
"loss": 4.8276,
"mean_token_accuracy": 0.2052981361746788,
"num_tokens": 62875663.0,
"step": 36245
},
{
"entropy": 5.3378981590271,
"epoch": 2.8203851390780006,
"grad_norm": 1.1328125,
"learning_rate": 0.00042036144207972445,
"loss": 4.9197,
"mean_token_accuracy": 0.20683815330266953,
"num_tokens": 62884581.0,
"step": 36250
},
{
"entropy": 5.3449948787689205,
"epoch": 2.820774168449718,
"grad_norm": 1.1953125,
"learning_rate": 0.0004203402858249752,
"loss": 4.948,
"mean_token_accuracy": 0.20225100368261337,
"num_tokens": 62892710.0,
"step": 36255
},
{
"entropy": 5.332772445678711,
"epoch": 2.8211631978214355,
"grad_norm": 1.140625,
"learning_rate": 0.0004203191273649184,
"loss": 4.9154,
"mean_token_accuracy": 0.20894486904144288,
"num_tokens": 62901933.0,
"step": 36260
},
{
"entropy": 5.369071435928345,
"epoch": 2.8215522271931532,
"grad_norm": 1.15625,
"learning_rate": 0.00042029796669987513,
"loss": 4.9155,
"mean_token_accuracy": 0.19685767441987992,
"num_tokens": 62910155.0,
"step": 36265
},
{
"entropy": 5.372627067565918,
"epoch": 2.8219412565648705,
"grad_norm": 1.0390625,
"learning_rate": 0.0004202768038301665,
"loss": 4.9867,
"mean_token_accuracy": 0.18932642340660094,
"num_tokens": 62919645.0,
"step": 36270
},
{
"entropy": 5.499980783462524,
"epoch": 2.822330285936588,
"grad_norm": 0.9921875,
"learning_rate": 0.00042025563875611367,
"loss": 5.0542,
"mean_token_accuracy": 0.1899677485227585,
"num_tokens": 62928824.0,
"step": 36275
},
{
"entropy": 5.345960712432861,
"epoch": 2.822719315308306,
"grad_norm": 1.078125,
"learning_rate": 0.0004202344714780376,
"loss": 4.8816,
"mean_token_accuracy": 0.21019442677497863,
"num_tokens": 62936497.0,
"step": 36280
},
{
"entropy": 5.303362226486206,
"epoch": 2.8231083446800236,
"grad_norm": 1.15625,
"learning_rate": 0.00042021330199625966,
"loss": 4.9828,
"mean_token_accuracy": 0.19979316741228104,
"num_tokens": 62944245.0,
"step": 36285
},
{
"entropy": 5.327833223342895,
"epoch": 2.823497374051741,
"grad_norm": 1.0859375,
"learning_rate": 0.00042019213031110105,
"loss": 4.998,
"mean_token_accuracy": 0.20076138973236085,
"num_tokens": 62952980.0,
"step": 36290
},
{
"entropy": 5.433194160461426,
"epoch": 2.8238864034234585,
"grad_norm": 1.125,
"learning_rate": 0.0004201709564228829,
"loss": 5.002,
"mean_token_accuracy": 0.2008898824453354,
"num_tokens": 62962082.0,
"step": 36295
},
{
"entropy": 5.4257337093353275,
"epoch": 2.824275432795176,
"grad_norm": 1.1796875,
"learning_rate": 0.00042014978033192655,
"loss": 5.0736,
"mean_token_accuracy": 0.19556913375854493,
"num_tokens": 62971033.0,
"step": 36300
},
{
"entropy": 5.462235689163208,
"epoch": 2.8246644621668935,
"grad_norm": 1.1796875,
"learning_rate": 0.00042012860203855337,
"loss": 4.972,
"mean_token_accuracy": 0.1959919810295105,
"num_tokens": 62979646.0,
"step": 36305
},
{
"entropy": 5.324029731750488,
"epoch": 2.825053491538611,
"grad_norm": 1.2109375,
"learning_rate": 0.00042010742154308453,
"loss": 4.9748,
"mean_token_accuracy": 0.1997225433588028,
"num_tokens": 62988690.0,
"step": 36310
},
{
"entropy": 5.405141687393188,
"epoch": 2.825442520910329,
"grad_norm": 1.171875,
"learning_rate": 0.00042008623884584167,
"loss": 5.0008,
"mean_token_accuracy": 0.19777657687664033,
"num_tokens": 62997186.0,
"step": 36315
},
{
"entropy": 5.315159511566162,
"epoch": 2.825831550282046,
"grad_norm": 1.0625,
"learning_rate": 0.00042006505394714597,
"loss": 4.873,
"mean_token_accuracy": 0.20464374274015426,
"num_tokens": 63006449.0,
"step": 36320
},
{
"entropy": 5.295733785629272,
"epoch": 2.826220579653764,
"grad_norm": 1.078125,
"learning_rate": 0.00042004386684731896,
"loss": 4.9023,
"mean_token_accuracy": 0.20723885148763657,
"num_tokens": 63015862.0,
"step": 36325
},
{
"entropy": 5.341760492324829,
"epoch": 2.8266096090254815,
"grad_norm": 1.0390625,
"learning_rate": 0.00042002267754668216,
"loss": 4.9824,
"mean_token_accuracy": 0.20097555518150328,
"num_tokens": 63024919.0,
"step": 36330
},
{
"entropy": 5.38703031539917,
"epoch": 2.826998638397199,
"grad_norm": 1.328125,
"learning_rate": 0.000420001486045557,
"loss": 4.9366,
"mean_token_accuracy": 0.20237749218940734,
"num_tokens": 63033513.0,
"step": 36335
},
{
"entropy": 5.381186008453369,
"epoch": 2.8273876677689165,
"grad_norm": 1.1015625,
"learning_rate": 0.0004199802923442652,
"loss": 5.1449,
"mean_token_accuracy": 0.19312918037176133,
"num_tokens": 63043094.0,
"step": 36340
},
{
"entropy": 5.309092426300049,
"epoch": 2.827776697140634,
"grad_norm": 1.171875,
"learning_rate": 0.0004199590964431282,
"loss": 4.8342,
"mean_token_accuracy": 0.21462522596120834,
"num_tokens": 63050714.0,
"step": 36345
},
{
"entropy": 5.349132966995239,
"epoch": 2.828165726512352,
"grad_norm": 1.25,
"learning_rate": 0.0004199378983424676,
"loss": 4.9312,
"mean_token_accuracy": 0.19960952699184417,
"num_tokens": 63059381.0,
"step": 36350
},
{
"entropy": 5.348543977737426,
"epoch": 2.828554755884069,
"grad_norm": 1.0859375,
"learning_rate": 0.00041991669804260505,
"loss": 4.977,
"mean_token_accuracy": 0.1991954565048218,
"num_tokens": 63067597.0,
"step": 36355
},
{
"entropy": 5.281967878341675,
"epoch": 2.828943785255787,
"grad_norm": 1.0703125,
"learning_rate": 0.0004198954955438623,
"loss": 4.8083,
"mean_token_accuracy": 0.21379784494638443,
"num_tokens": 63075680.0,
"step": 36360
},
{
"entropy": 5.321336698532105,
"epoch": 2.8293328146275045,
"grad_norm": 1.2578125,
"learning_rate": 0.000419874290846561,
"loss": 5.0145,
"mean_token_accuracy": 0.200300632417202,
"num_tokens": 63084067.0,
"step": 36365
},
{
"entropy": 5.405312633514404,
"epoch": 2.8297218439992218,
"grad_norm": 1.1171875,
"learning_rate": 0.00041985308395102303,
"loss": 4.992,
"mean_token_accuracy": 0.19831511229276658,
"num_tokens": 63093694.0,
"step": 36370
},
{
"entropy": 5.395055103302002,
"epoch": 2.8301108733709395,
"grad_norm": 1.09375,
"learning_rate": 0.00041983187485756997,
"loss": 4.8561,
"mean_token_accuracy": 0.210378934442997,
"num_tokens": 63102496.0,
"step": 36375
},
{
"entropy": 5.408418083190918,
"epoch": 2.830499902742657,
"grad_norm": 1.109375,
"learning_rate": 0.00041981066356652373,
"loss": 5.0118,
"mean_token_accuracy": 0.1994267612695694,
"num_tokens": 63111246.0,
"step": 36380
},
{
"entropy": 5.384354829788208,
"epoch": 2.830888932114375,
"grad_norm": 1.125,
"learning_rate": 0.00041978945007820626,
"loss": 4.9599,
"mean_token_accuracy": 0.2086955189704895,
"num_tokens": 63119953.0,
"step": 36385
},
{
"entropy": 5.433270835876465,
"epoch": 2.831277961486092,
"grad_norm": 1.1796875,
"learning_rate": 0.00041976823439293925,
"loss": 5.0581,
"mean_token_accuracy": 0.1994537368416786,
"num_tokens": 63128904.0,
"step": 36390
},
{
"entropy": 5.394209527969361,
"epoch": 2.83166699085781,
"grad_norm": 1.15625,
"learning_rate": 0.0004197470165110447,
"loss": 4.9959,
"mean_token_accuracy": 0.19778508096933364,
"num_tokens": 63137049.0,
"step": 36395
},
{
"entropy": 5.299397325515747,
"epoch": 2.832056020229527,
"grad_norm": 1.1875,
"learning_rate": 0.0004197257964328446,
"loss": 4.9488,
"mean_token_accuracy": 0.20084109902381897,
"num_tokens": 63145772.0,
"step": 36400
},
{
"entropy": 5.364439392089844,
"epoch": 2.8324450496012448,
"grad_norm": 1.125,
"learning_rate": 0.0004197045741586609,
"loss": 4.9906,
"mean_token_accuracy": 0.19804690331220626,
"num_tokens": 63154913.0,
"step": 36405
},
{
"entropy": 5.323664331436158,
"epoch": 2.8328340789729625,
"grad_norm": 1.1875,
"learning_rate": 0.0004196833496888156,
"loss": 4.9398,
"mean_token_accuracy": 0.20362005084753038,
"num_tokens": 63163671.0,
"step": 36410
},
{
"entropy": 5.357585763931274,
"epoch": 2.83322310834468,
"grad_norm": 1.1328125,
"learning_rate": 0.0004196621230236308,
"loss": 5.012,
"mean_token_accuracy": 0.19546100199222566,
"num_tokens": 63172276.0,
"step": 36415
},
{
"entropy": 5.4623754024505615,
"epoch": 2.833612137716398,
"grad_norm": 1.15625,
"learning_rate": 0.00041964089416342845,
"loss": 5.0531,
"mean_token_accuracy": 0.19725640267133712,
"num_tokens": 63180987.0,
"step": 36420
},
{
"entropy": 5.435922765731812,
"epoch": 2.834001167088115,
"grad_norm": 1.15625,
"learning_rate": 0.0004196196631085308,
"loss": 4.974,
"mean_token_accuracy": 0.20923116505146028,
"num_tokens": 63189668.0,
"step": 36425
},
{
"entropy": 5.3322512149810795,
"epoch": 2.834390196459833,
"grad_norm": 1.0,
"learning_rate": 0.00041959842985925987,
"loss": 4.9005,
"mean_token_accuracy": 0.20383508503437042,
"num_tokens": 63198757.0,
"step": 36430
},
{
"entropy": 5.380774879455567,
"epoch": 2.83477922583155,
"grad_norm": 1.1953125,
"learning_rate": 0.000419577194415938,
"loss": 5.0011,
"mean_token_accuracy": 0.1961287572979927,
"num_tokens": 63207695.0,
"step": 36435
},
{
"entropy": 5.424510335922241,
"epoch": 2.8351682552032678,
"grad_norm": 1.1171875,
"learning_rate": 0.00041955595677888735,
"loss": 5.0684,
"mean_token_accuracy": 0.20011100471019744,
"num_tokens": 63216789.0,
"step": 36440
},
{
"entropy": 5.35416464805603,
"epoch": 2.8355572845749855,
"grad_norm": 1.1796875,
"learning_rate": 0.0004195347169484301,
"loss": 4.9065,
"mean_token_accuracy": 0.2031462997198105,
"num_tokens": 63225359.0,
"step": 36445
},
{
"entropy": 5.432998132705689,
"epoch": 2.835946313946703,
"grad_norm": 1.265625,
"learning_rate": 0.0004195134749248886,
"loss": 5.092,
"mean_token_accuracy": 0.1896144613623619,
"num_tokens": 63234405.0,
"step": 36450
},
{
"entropy": 5.383672666549683,
"epoch": 2.8363353433184204,
"grad_norm": 1.140625,
"learning_rate": 0.0004194922307085851,
"loss": 4.9191,
"mean_token_accuracy": 0.21182100772857665,
"num_tokens": 63243558.0,
"step": 36455
},
{
"entropy": 5.386033964157105,
"epoch": 2.836724372690138,
"grad_norm": 1.09375,
"learning_rate": 0.0004194709842998419,
"loss": 4.9423,
"mean_token_accuracy": 0.2044267013669014,
"num_tokens": 63251997.0,
"step": 36460
},
{
"entropy": 5.344236707687378,
"epoch": 2.837113402061856,
"grad_norm": 1.1875,
"learning_rate": 0.00041944973569898157,
"loss": 4.8906,
"mean_token_accuracy": 0.21019524931907654,
"num_tokens": 63260439.0,
"step": 36465
},
{
"entropy": 5.356781482696533,
"epoch": 2.837502431433573,
"grad_norm": 1.125,
"learning_rate": 0.0004194284849063265,
"loss": 4.8964,
"mean_token_accuracy": 0.2081655889749527,
"num_tokens": 63268613.0,
"step": 36470
},
{
"entropy": 5.395363998413086,
"epoch": 2.8378914608052908,
"grad_norm": 1.0859375,
"learning_rate": 0.0004194072319221989,
"loss": 4.9785,
"mean_token_accuracy": 0.19652318805456162,
"num_tokens": 63277255.0,
"step": 36475
},
{
"entropy": 5.352589416503906,
"epoch": 2.8382804901770085,
"grad_norm": 1.109375,
"learning_rate": 0.0004193859767469214,
"loss": 4.97,
"mean_token_accuracy": 0.204716856777668,
"num_tokens": 63285596.0,
"step": 36480
},
{
"entropy": 5.340853834152222,
"epoch": 2.838669519548726,
"grad_norm": 1.09375,
"learning_rate": 0.00041936471938081667,
"loss": 4.8867,
"mean_token_accuracy": 0.2045819118618965,
"num_tokens": 63293752.0,
"step": 36485
},
{
"entropy": 5.391874170303344,
"epoch": 2.8390585489204434,
"grad_norm": 1.046875,
"learning_rate": 0.00041934345982420695,
"loss": 4.9603,
"mean_token_accuracy": 0.19740456342697144,
"num_tokens": 63302766.0,
"step": 36490
},
{
"entropy": 5.403186988830567,
"epoch": 2.839447578292161,
"grad_norm": 1.109375,
"learning_rate": 0.000419322198077415,
"loss": 4.9709,
"mean_token_accuracy": 0.19703096598386766,
"num_tokens": 63311166.0,
"step": 36495
},
{
"entropy": 5.385082244873047,
"epoch": 2.8398366076638784,
"grad_norm": 1.109375,
"learning_rate": 0.00041930093414076344,
"loss": 4.9496,
"mean_token_accuracy": 0.2042883813381195,
"num_tokens": 63319355.0,
"step": 36500
},
{
"entropy": 5.37895393371582,
"epoch": 2.840225637035596,
"grad_norm": 1.203125,
"learning_rate": 0.00041927966801457486,
"loss": 5.0189,
"mean_token_accuracy": 0.1918247252702713,
"num_tokens": 63328548.0,
"step": 36505
},
{
"entropy": 5.425289964675903,
"epoch": 2.8406146664073137,
"grad_norm": 1.125,
"learning_rate": 0.000419258399699172,
"loss": 5.0382,
"mean_token_accuracy": 0.1940491035580635,
"num_tokens": 63337743.0,
"step": 36510
},
{
"entropy": 5.4288877010345455,
"epoch": 2.8410036957790314,
"grad_norm": 1.15625,
"learning_rate": 0.0004192371291948775,
"loss": 4.9188,
"mean_token_accuracy": 0.20229528248310089,
"num_tokens": 63346064.0,
"step": 36515
},
{
"entropy": 5.364779138565064,
"epoch": 2.841392725150749,
"grad_norm": 1.0703125,
"learning_rate": 0.00041921585650201413,
"loss": 4.9189,
"mean_token_accuracy": 0.20063506960868835,
"num_tokens": 63354957.0,
"step": 36520
},
{
"entropy": 5.313026189804077,
"epoch": 2.8417817545224664,
"grad_norm": 1.171875,
"learning_rate": 0.0004191945816209047,
"loss": 4.9281,
"mean_token_accuracy": 0.19714562594890594,
"num_tokens": 63363918.0,
"step": 36525
},
{
"entropy": 5.408584117889404,
"epoch": 2.842170783894184,
"grad_norm": 1.1875,
"learning_rate": 0.00041917330455187195,
"loss": 5.0166,
"mean_token_accuracy": 0.1956108495593071,
"num_tokens": 63372540.0,
"step": 36530
},
{
"entropy": 5.51461443901062,
"epoch": 2.8425598132659013,
"grad_norm": 1.171875,
"learning_rate": 0.00041915202529523894,
"loss": 5.0626,
"mean_token_accuracy": 0.19178158193826675,
"num_tokens": 63381215.0,
"step": 36535
},
{
"entropy": 5.365229940414428,
"epoch": 2.842948842637619,
"grad_norm": 1.15625,
"learning_rate": 0.0004191307438513283,
"loss": 4.944,
"mean_token_accuracy": 0.20474245697259902,
"num_tokens": 63390738.0,
"step": 36540
},
{
"entropy": 5.385931158065796,
"epoch": 2.8433378720093367,
"grad_norm": 1.2421875,
"learning_rate": 0.000419109460220463,
"loss": 5.046,
"mean_token_accuracy": 0.19268206506967545,
"num_tokens": 63398836.0,
"step": 36545
},
{
"entropy": 5.371402406692505,
"epoch": 2.8437269013810544,
"grad_norm": 1.140625,
"learning_rate": 0.00041908817440296605,
"loss": 4.8815,
"mean_token_accuracy": 0.2026103064417839,
"num_tokens": 63407211.0,
"step": 36550
},
{
"entropy": 5.37645206451416,
"epoch": 2.8441159307527717,
"grad_norm": 1.15625,
"learning_rate": 0.00041906688639916035,
"loss": 4.998,
"mean_token_accuracy": 0.19659543186426162,
"num_tokens": 63415415.0,
"step": 36555
},
{
"entropy": 5.2360570430755615,
"epoch": 2.8445049601244894,
"grad_norm": 1.15625,
"learning_rate": 0.0004190455962093689,
"loss": 4.8027,
"mean_token_accuracy": 0.21116988062858583,
"num_tokens": 63422907.0,
"step": 36560
},
{
"entropy": 5.283784580230713,
"epoch": 2.844893989496207,
"grad_norm": 1.109375,
"learning_rate": 0.00041902430383391494,
"loss": 4.8602,
"mean_token_accuracy": 0.20309886187314988,
"num_tokens": 63431348.0,
"step": 36565
},
{
"entropy": 5.396503925323486,
"epoch": 2.8452830188679243,
"grad_norm": 1.0859375,
"learning_rate": 0.0004190030092731214,
"loss": 4.9539,
"mean_token_accuracy": 0.20607977658510207,
"num_tokens": 63440189.0,
"step": 36570
},
{
"entropy": 5.371004915237426,
"epoch": 2.845672048239642,
"grad_norm": 1.140625,
"learning_rate": 0.0004189817125273113,
"loss": 5.0381,
"mean_token_accuracy": 0.1977330908179283,
"num_tokens": 63449082.0,
"step": 36575
},
{
"entropy": 5.395055866241455,
"epoch": 2.8460610776113597,
"grad_norm": 1.15625,
"learning_rate": 0.00041896041359680797,
"loss": 4.9995,
"mean_token_accuracy": 0.19630941301584243,
"num_tokens": 63458204.0,
"step": 36580
},
{
"entropy": 5.381702995300293,
"epoch": 2.8464501069830774,
"grad_norm": 1.15625,
"learning_rate": 0.00041893911248193437,
"loss": 4.8829,
"mean_token_accuracy": 0.20658014714717865,
"num_tokens": 63466623.0,
"step": 36585
},
{
"entropy": 5.3220518112182615,
"epoch": 2.8468391363547947,
"grad_norm": 1.09375,
"learning_rate": 0.000418917809183014,
"loss": 4.9644,
"mean_token_accuracy": 0.20216426402330398,
"num_tokens": 63475903.0,
"step": 36590
},
{
"entropy": 5.390537881851197,
"epoch": 2.8472281657265124,
"grad_norm": 1.140625,
"learning_rate": 0.00041889650370036986,
"loss": 4.9915,
"mean_token_accuracy": 0.19922919273376466,
"num_tokens": 63484413.0,
"step": 36595
},
{
"entropy": 5.3438502788543705,
"epoch": 2.84761719509823,
"grad_norm": 1.109375,
"learning_rate": 0.0004188751960343253,
"loss": 4.9751,
"mean_token_accuracy": 0.1981559693813324,
"num_tokens": 63494059.0,
"step": 36600
},
{
"entropy": 5.336892795562744,
"epoch": 2.8480062244699473,
"grad_norm": 1.1875,
"learning_rate": 0.0004188538861852037,
"loss": 4.8638,
"mean_token_accuracy": 0.202815642952919,
"num_tokens": 63502673.0,
"step": 36605
},
{
"entropy": 5.384774303436279,
"epoch": 2.848395253841665,
"grad_norm": 1.15625,
"learning_rate": 0.0004188325741533283,
"loss": 4.9595,
"mean_token_accuracy": 0.20292356759309768,
"num_tokens": 63511006.0,
"step": 36610
},
{
"entropy": 5.3831274032592775,
"epoch": 2.8487842832133827,
"grad_norm": 1.1171875,
"learning_rate": 0.0004188112599390225,
"loss": 4.9974,
"mean_token_accuracy": 0.20599197447299958,
"num_tokens": 63519381.0,
"step": 36615
},
{
"entropy": 5.342766809463501,
"epoch": 2.8491733125851004,
"grad_norm": 1.078125,
"learning_rate": 0.0004187899435426098,
"loss": 4.9521,
"mean_token_accuracy": 0.20446196049451829,
"num_tokens": 63528111.0,
"step": 36620
},
{
"entropy": 5.382662963867188,
"epoch": 2.8495623419568177,
"grad_norm": 1.109375,
"learning_rate": 0.00041876862496441347,
"loss": 4.9329,
"mean_token_accuracy": 0.20565242320299149,
"num_tokens": 63537028.0,
"step": 36625
},
{
"entropy": 5.369632625579834,
"epoch": 2.8499513713285354,
"grad_norm": 1.171875,
"learning_rate": 0.00041874730420475716,
"loss": 4.8973,
"mean_token_accuracy": 0.19838838279247284,
"num_tokens": 63545666.0,
"step": 36630
},
{
"entropy": 5.294160175323486,
"epoch": 2.8503404007002526,
"grad_norm": 1.15625,
"learning_rate": 0.00041872598126396434,
"loss": 4.9323,
"mean_token_accuracy": 0.20309770554304124,
"num_tokens": 63554122.0,
"step": 36635
},
{
"entropy": 5.368007040023803,
"epoch": 2.8507294300719703,
"grad_norm": 1.125,
"learning_rate": 0.00041870465614235843,
"loss": 4.9514,
"mean_token_accuracy": 0.20323843955993653,
"num_tokens": 63563108.0,
"step": 36640
},
{
"entropy": 5.396540021896362,
"epoch": 2.851118459443688,
"grad_norm": 0.99609375,
"learning_rate": 0.00041868332884026317,
"loss": 4.9753,
"mean_token_accuracy": 0.19610431641340256,
"num_tokens": 63572854.0,
"step": 36645
},
{
"entropy": 5.40368423461914,
"epoch": 2.8515074888154057,
"grad_norm": 1.21875,
"learning_rate": 0.0004186619993580021,
"loss": 4.9726,
"mean_token_accuracy": 0.1962792843580246,
"num_tokens": 63580900.0,
"step": 36650
},
{
"entropy": 5.331592178344726,
"epoch": 2.851896518187123,
"grad_norm": 1.1328125,
"learning_rate": 0.00041864066769589875,
"loss": 4.878,
"mean_token_accuracy": 0.20724220275878907,
"num_tokens": 63590093.0,
"step": 36655
},
{
"entropy": 5.33964171409607,
"epoch": 2.8522855475588407,
"grad_norm": 1.0859375,
"learning_rate": 0.00041861933385427697,
"loss": 5.0331,
"mean_token_accuracy": 0.2010623410344124,
"num_tokens": 63599519.0,
"step": 36660
},
{
"entropy": 5.345333909988403,
"epoch": 2.8526745769305584,
"grad_norm": 1.21875,
"learning_rate": 0.0004185979978334604,
"loss": 5.0186,
"mean_token_accuracy": 0.1982279196381569,
"num_tokens": 63608088.0,
"step": 36665
},
{
"entropy": 5.504365301132202,
"epoch": 2.8530636063022756,
"grad_norm": 1.1328125,
"learning_rate": 0.0004185766596337727,
"loss": 4.9986,
"mean_token_accuracy": 0.20079575926065446,
"num_tokens": 63617247.0,
"step": 36670
},
{
"entropy": 5.412511348724365,
"epoch": 2.8534526356739933,
"grad_norm": 1.078125,
"learning_rate": 0.00041855531925553773,
"loss": 5.0043,
"mean_token_accuracy": 0.19889775514602662,
"num_tokens": 63626218.0,
"step": 36675
},
{
"entropy": 5.360298681259155,
"epoch": 2.853841665045711,
"grad_norm": 1.1015625,
"learning_rate": 0.0004185339766990794,
"loss": 4.923,
"mean_token_accuracy": 0.20260151475667953,
"num_tokens": 63634667.0,
"step": 36680
},
{
"entropy": 5.308692789077758,
"epoch": 2.8542306944174287,
"grad_norm": 1.125,
"learning_rate": 0.0004185126319647213,
"loss": 4.9043,
"mean_token_accuracy": 0.20701882988214493,
"num_tokens": 63643506.0,
"step": 36685
},
{
"entropy": 5.2904644966125485,
"epoch": 2.854619723789146,
"grad_norm": 1.2109375,
"learning_rate": 0.0004184912850527875,
"loss": 4.8505,
"mean_token_accuracy": 0.20915521085262298,
"num_tokens": 63651883.0,
"step": 36690
},
{
"entropy": 5.439735269546508,
"epoch": 2.8550087531608637,
"grad_norm": 1.109375,
"learning_rate": 0.0004184699359636018,
"loss": 4.9991,
"mean_token_accuracy": 0.19749546945095062,
"num_tokens": 63660829.0,
"step": 36695
},
{
"entropy": 5.406318330764771,
"epoch": 2.8553977825325814,
"grad_norm": 1.09375,
"learning_rate": 0.0004184485846974882,
"loss": 4.9412,
"mean_token_accuracy": 0.20332974195480347,
"num_tokens": 63669730.0,
"step": 36700
},
{
"entropy": 5.349156379699707,
"epoch": 2.8557868119042986,
"grad_norm": 1.0859375,
"learning_rate": 0.0004184272312547706,
"loss": 4.9381,
"mean_token_accuracy": 0.19928880631923676,
"num_tokens": 63678921.0,
"step": 36705
},
{
"entropy": 5.400165843963623,
"epoch": 2.8561758412760163,
"grad_norm": 1.1015625,
"learning_rate": 0.00041840587563577315,
"loss": 5.0595,
"mean_token_accuracy": 0.19327778667211531,
"num_tokens": 63687636.0,
"step": 36710
},
{
"entropy": 5.3527202129364015,
"epoch": 2.856564870647734,
"grad_norm": 1.1484375,
"learning_rate": 0.0004183845178408197,
"loss": 4.9667,
"mean_token_accuracy": 0.19559735357761382,
"num_tokens": 63695701.0,
"step": 36715
},
{
"entropy": 5.349438858032227,
"epoch": 2.8569539000194517,
"grad_norm": 1.125,
"learning_rate": 0.00041836315787023456,
"loss": 4.9661,
"mean_token_accuracy": 0.19702850580215453,
"num_tokens": 63704904.0,
"step": 36720
},
{
"entropy": 5.353082466125488,
"epoch": 2.857342929391169,
"grad_norm": 1.0703125,
"learning_rate": 0.00041834179572434153,
"loss": 4.9387,
"mean_token_accuracy": 0.2028216078877449,
"num_tokens": 63714250.0,
"step": 36725
},
{
"entropy": 5.388898324966431,
"epoch": 2.8577319587628867,
"grad_norm": 1.0859375,
"learning_rate": 0.00041832043140346495,
"loss": 4.9909,
"mean_token_accuracy": 0.1988374561071396,
"num_tokens": 63723472.0,
"step": 36730
},
{
"entropy": 5.321527290344238,
"epoch": 2.858120988134604,
"grad_norm": 1.1171875,
"learning_rate": 0.0004182990649079289,
"loss": 4.775,
"mean_token_accuracy": 0.20948495119810104,
"num_tokens": 63731510.0,
"step": 36735
},
{
"entropy": 5.470141363143921,
"epoch": 2.8585100175063216,
"grad_norm": 1.109375,
"learning_rate": 0.0004182776962380577,
"loss": 5.0767,
"mean_token_accuracy": 0.19028838574886323,
"num_tokens": 63739809.0,
"step": 36740
},
{
"entropy": 5.342509508132935,
"epoch": 2.8588990468780393,
"grad_norm": 1.171875,
"learning_rate": 0.00041825632539417546,
"loss": 4.9156,
"mean_token_accuracy": 0.20867860764265062,
"num_tokens": 63748387.0,
"step": 36745
},
{
"entropy": 5.463844966888428,
"epoch": 2.859288076249757,
"grad_norm": 1.265625,
"learning_rate": 0.0004182349523766065,
"loss": 5.0251,
"mean_token_accuracy": 0.1968454509973526,
"num_tokens": 63756119.0,
"step": 36750
},
{
"entropy": 5.334530687332153,
"epoch": 2.8596771056214743,
"grad_norm": 1.140625,
"learning_rate": 0.00041821357718567514,
"loss": 4.9643,
"mean_token_accuracy": 0.20700517743825914,
"num_tokens": 63764797.0,
"step": 36755
},
{
"entropy": 5.304919958114624,
"epoch": 2.860066134993192,
"grad_norm": 1.1640625,
"learning_rate": 0.0004181921998217057,
"loss": 4.8493,
"mean_token_accuracy": 0.20566495805978774,
"num_tokens": 63773114.0,
"step": 36760
},
{
"entropy": 5.426658821105957,
"epoch": 2.8604551643649097,
"grad_norm": 1.1953125,
"learning_rate": 0.0004181708202850225,
"loss": 5.0572,
"mean_token_accuracy": 0.19351145029067993,
"num_tokens": 63781345.0,
"step": 36765
},
{
"entropy": 5.391635704040527,
"epoch": 2.860844193736627,
"grad_norm": 1.1640625,
"learning_rate": 0.00041814943857595,
"loss": 4.9518,
"mean_token_accuracy": 0.20353857874870301,
"num_tokens": 63789666.0,
"step": 36770
},
{
"entropy": 5.355706214904785,
"epoch": 2.8612332231083446,
"grad_norm": 1.15625,
"learning_rate": 0.0004181280546948127,
"loss": 5.0393,
"mean_token_accuracy": 0.19338743686676024,
"num_tokens": 63798121.0,
"step": 36775
},
{
"entropy": 5.343008947372437,
"epoch": 2.8616222524800623,
"grad_norm": 1.1328125,
"learning_rate": 0.0004181066686419349,
"loss": 4.8143,
"mean_token_accuracy": 0.2126834660768509,
"num_tokens": 63806443.0,
"step": 36780
},
{
"entropy": 5.313502168655395,
"epoch": 2.86201128185178,
"grad_norm": 1.0859375,
"learning_rate": 0.00041808528041764115,
"loss": 4.9546,
"mean_token_accuracy": 0.19782498627901077,
"num_tokens": 63815068.0,
"step": 36785
},
{
"entropy": 5.381885099411011,
"epoch": 2.8624003112234973,
"grad_norm": 1.140625,
"learning_rate": 0.0004180638900222561,
"loss": 4.9601,
"mean_token_accuracy": 0.20091420263051987,
"num_tokens": 63823518.0,
"step": 36790
},
{
"entropy": 5.43495545387268,
"epoch": 2.862789340595215,
"grad_norm": 1.171875,
"learning_rate": 0.0004180424974561042,
"loss": 5.0831,
"mean_token_accuracy": 0.19239984601736068,
"num_tokens": 63832435.0,
"step": 36795
},
{
"entropy": 5.420851993560791,
"epoch": 2.8631783699669326,
"grad_norm": 1.1171875,
"learning_rate": 0.00041802110271951,
"loss": 5.0204,
"mean_token_accuracy": 0.1944720223546028,
"num_tokens": 63841384.0,
"step": 36800
},
{
"entropy": 5.371727371215821,
"epoch": 2.86356739933865,
"grad_norm": 1.2109375,
"learning_rate": 0.0004179997058127983,
"loss": 4.883,
"mean_token_accuracy": 0.20526780039072037,
"num_tokens": 63850563.0,
"step": 36805
},
{
"entropy": 5.33814435005188,
"epoch": 2.8639564287103676,
"grad_norm": 1.1171875,
"learning_rate": 0.0004179783067362936,
"loss": 4.977,
"mean_token_accuracy": 0.19931438863277434,
"num_tokens": 63858657.0,
"step": 36810
},
{
"entropy": 5.428667688369751,
"epoch": 2.8643454580820853,
"grad_norm": 1.0703125,
"learning_rate": 0.0004179569054903207,
"loss": 5.0687,
"mean_token_accuracy": 0.1969722628593445,
"num_tokens": 63866970.0,
"step": 36815
},
{
"entropy": 5.314129829406738,
"epoch": 2.864734487453803,
"grad_norm": 1.1875,
"learning_rate": 0.00041793550207520436,
"loss": 4.8936,
"mean_token_accuracy": 0.2107781559228897,
"num_tokens": 63874875.0,
"step": 36820
},
{
"entropy": 5.33577332496643,
"epoch": 2.8651235168255202,
"grad_norm": 1.109375,
"learning_rate": 0.0004179140964912692,
"loss": 4.9864,
"mean_token_accuracy": 0.19681049585342408,
"num_tokens": 63883479.0,
"step": 36825
},
{
"entropy": 5.3256010055542,
"epoch": 2.865512546197238,
"grad_norm": 1.1640625,
"learning_rate": 0.0004178926887388401,
"loss": 4.9269,
"mean_token_accuracy": 0.20112994015216829,
"num_tokens": 63891700.0,
"step": 36830
},
{
"entropy": 5.3524291038513185,
"epoch": 2.865901575568955,
"grad_norm": 1.09375,
"learning_rate": 0.00041787127881824193,
"loss": 4.976,
"mean_token_accuracy": 0.19227503538131713,
"num_tokens": 63900516.0,
"step": 36835
},
{
"entropy": 5.362793636322022,
"epoch": 2.866290604940673,
"grad_norm": 1.1640625,
"learning_rate": 0.00041784986672979945,
"loss": 4.874,
"mean_token_accuracy": 0.2180183544754982,
"num_tokens": 63908290.0,
"step": 36840
},
{
"entropy": 5.39371280670166,
"epoch": 2.8666796343123906,
"grad_norm": 1.1484375,
"learning_rate": 0.00041782845247383767,
"loss": 5.0409,
"mean_token_accuracy": 0.19186218231916427,
"num_tokens": 63917019.0,
"step": 36845
},
{
"entropy": 5.324879217147827,
"epoch": 2.8670686636841083,
"grad_norm": 1.03125,
"learning_rate": 0.00041780703605068145,
"loss": 4.8686,
"mean_token_accuracy": 0.2088683843612671,
"num_tokens": 63925155.0,
"step": 36850
},
{
"entropy": 5.411106157302856,
"epoch": 2.867457693055826,
"grad_norm": 1.1953125,
"learning_rate": 0.0004177856174606558,
"loss": 5.001,
"mean_token_accuracy": 0.1985299125313759,
"num_tokens": 63932931.0,
"step": 36855
},
{
"entropy": 5.398127460479737,
"epoch": 2.8678467224275432,
"grad_norm": 1.046875,
"learning_rate": 0.0004177641967040856,
"loss": 4.9972,
"mean_token_accuracy": 0.19696823209524156,
"num_tokens": 63942368.0,
"step": 36860
},
{
"entropy": 5.393574237823486,
"epoch": 2.868235751799261,
"grad_norm": 1.21875,
"learning_rate": 0.00041774277378129595,
"loss": 4.9384,
"mean_token_accuracy": 0.20630613714456558,
"num_tokens": 63950739.0,
"step": 36865
},
{
"entropy": 5.323387575149536,
"epoch": 2.868624781170978,
"grad_norm": 1.125,
"learning_rate": 0.00041772134869261186,
"loss": 4.9082,
"mean_token_accuracy": 0.20754269063472747,
"num_tokens": 63959735.0,
"step": 36870
},
{
"entropy": 5.36847767829895,
"epoch": 2.869013810542696,
"grad_norm": 1.140625,
"learning_rate": 0.0004176999214383585,
"loss": 4.9492,
"mean_token_accuracy": 0.20143691897392274,
"num_tokens": 63968771.0,
"step": 36875
},
{
"entropy": 5.307683992385864,
"epoch": 2.8694028399144136,
"grad_norm": 1.1015625,
"learning_rate": 0.00041767849201886103,
"loss": 4.8887,
"mean_token_accuracy": 0.21188566833734512,
"num_tokens": 63977595.0,
"step": 36880
},
{
"entropy": 5.334543466567993,
"epoch": 2.8697918692861313,
"grad_norm": 1.2265625,
"learning_rate": 0.0004176570604344445,
"loss": 4.9169,
"mean_token_accuracy": 0.20184899121522903,
"num_tokens": 63985676.0,
"step": 36885
},
{
"entropy": 5.3966046333312985,
"epoch": 2.8701808986578485,
"grad_norm": 1.0859375,
"learning_rate": 0.00041763562668543415,
"loss": 5.0589,
"mean_token_accuracy": 0.1926816761493683,
"num_tokens": 63994134.0,
"step": 36890
},
{
"entropy": 5.406799697875977,
"epoch": 2.8705699280295662,
"grad_norm": 1.140625,
"learning_rate": 0.0004176141907721552,
"loss": 5.0723,
"mean_token_accuracy": 0.20241940021514893,
"num_tokens": 64002605.0,
"step": 36895
},
{
"entropy": 5.314457511901855,
"epoch": 2.870958957401284,
"grad_norm": 1.09375,
"learning_rate": 0.0004175927526949329,
"loss": 4.9887,
"mean_token_accuracy": 0.19916872829198837,
"num_tokens": 64011232.0,
"step": 36900
},
{
"entropy": 5.300276803970337,
"epoch": 2.871347986773001,
"grad_norm": 1.15625,
"learning_rate": 0.0004175713124540925,
"loss": 4.8941,
"mean_token_accuracy": 0.20504969209432602,
"num_tokens": 64019696.0,
"step": 36905
},
{
"entropy": 5.447099018096924,
"epoch": 2.871737016144719,
"grad_norm": 1.1796875,
"learning_rate": 0.00041754987004995935,
"loss": 4.9705,
"mean_token_accuracy": 0.20089681446552277,
"num_tokens": 64028716.0,
"step": 36910
},
{
"entropy": 5.358922529220581,
"epoch": 2.8721260455164366,
"grad_norm": 1.1328125,
"learning_rate": 0.00041752842548285887,
"loss": 4.9403,
"mean_token_accuracy": 0.20492362678050996,
"num_tokens": 64036915.0,
"step": 36915
},
{
"entropy": 5.311629819869995,
"epoch": 2.8725150748881543,
"grad_norm": 1.1171875,
"learning_rate": 0.0004175069787531163,
"loss": 4.9571,
"mean_token_accuracy": 0.20049223601818084,
"num_tokens": 64045857.0,
"step": 36920
},
{
"entropy": 5.387873935699463,
"epoch": 2.8729041042598715,
"grad_norm": 1.171875,
"learning_rate": 0.00041748552986105726,
"loss": 4.985,
"mean_token_accuracy": 0.20138221234083176,
"num_tokens": 64054958.0,
"step": 36925
},
{
"entropy": 5.352913904190063,
"epoch": 2.8732931336315892,
"grad_norm": 1.109375,
"learning_rate": 0.000417464078807007,
"loss": 4.9696,
"mean_token_accuracy": 0.20042803287506103,
"num_tokens": 64063745.0,
"step": 36930
},
{
"entropy": 5.430801963806152,
"epoch": 2.8736821630033065,
"grad_norm": 1.1015625,
"learning_rate": 0.0004174426255912912,
"loss": 4.9585,
"mean_token_accuracy": 0.2006607860326767,
"num_tokens": 64072496.0,
"step": 36935
},
{
"entropy": 5.389697456359864,
"epoch": 2.874071192375024,
"grad_norm": 1.171875,
"learning_rate": 0.0004174211702142352,
"loss": 4.9464,
"mean_token_accuracy": 0.2033034607768059,
"num_tokens": 64081112.0,
"step": 36940
},
{
"entropy": 5.2960090160369875,
"epoch": 2.874460221746742,
"grad_norm": 1.15625,
"learning_rate": 0.00041739971267616466,
"loss": 4.828,
"mean_token_accuracy": 0.20785453915596008,
"num_tokens": 64089346.0,
"step": 36945
},
{
"entropy": 5.3986693859100345,
"epoch": 2.8748492511184596,
"grad_norm": 1.1015625,
"learning_rate": 0.0004173782529774051,
"loss": 5.0084,
"mean_token_accuracy": 0.20253023356199265,
"num_tokens": 64097590.0,
"step": 36950
},
{
"entropy": 5.349428415298462,
"epoch": 2.8752382804901773,
"grad_norm": 1.125,
"learning_rate": 0.00041735679111828223,
"loss": 4.9208,
"mean_token_accuracy": 0.2026242882013321,
"num_tokens": 64105870.0,
"step": 36955
},
{
"entropy": 5.407027816772461,
"epoch": 2.8756273098618945,
"grad_norm": 1.0625,
"learning_rate": 0.00041733532709912157,
"loss": 5.0104,
"mean_token_accuracy": 0.19676846414804458,
"num_tokens": 64114963.0,
"step": 36960
},
{
"entropy": 5.449996042251587,
"epoch": 2.876016339233612,
"grad_norm": 1.1953125,
"learning_rate": 0.00041731386092024893,
"loss": 5.0792,
"mean_token_accuracy": 0.18951668292284013,
"num_tokens": 64123543.0,
"step": 36965
},
{
"entropy": 5.415232229232788,
"epoch": 2.8764053686053295,
"grad_norm": 1.1640625,
"learning_rate": 0.00041729239258198996,
"loss": 5.0138,
"mean_token_accuracy": 0.19758569896221162,
"num_tokens": 64131962.0,
"step": 36970
},
{
"entropy": 5.379133939743042,
"epoch": 2.876794397977047,
"grad_norm": 1.1484375,
"learning_rate": 0.00041727092208467036,
"loss": 4.9872,
"mean_token_accuracy": 0.20500266551971436,
"num_tokens": 64140292.0,
"step": 36975
},
{
"entropy": 5.381147336959839,
"epoch": 2.877183427348765,
"grad_norm": 1.15625,
"learning_rate": 0.00041724944942861603,
"loss": 4.9161,
"mean_token_accuracy": 0.20454721599817277,
"num_tokens": 64148936.0,
"step": 36980
},
{
"entropy": 5.366397094726563,
"epoch": 2.8775724567204826,
"grad_norm": 1.1796875,
"learning_rate": 0.00041722797461415267,
"loss": 4.9969,
"mean_token_accuracy": 0.20423411726951599,
"num_tokens": 64157801.0,
"step": 36985
},
{
"entropy": 5.407845115661621,
"epoch": 2.8779614860922,
"grad_norm": 1.171875,
"learning_rate": 0.0004172064976416062,
"loss": 5.0012,
"mean_token_accuracy": 0.19781197011470794,
"num_tokens": 64166049.0,
"step": 36990
},
{
"entropy": 5.400692319869995,
"epoch": 2.8783505154639175,
"grad_norm": 1.140625,
"learning_rate": 0.0004171850185113024,
"loss": 5.053,
"mean_token_accuracy": 0.1931341826915741,
"num_tokens": 64174663.0,
"step": 36995
},
{
"entropy": 5.437733364105225,
"epoch": 2.878739544835635,
"grad_norm": 1.0625,
"learning_rate": 0.00041716353722356735,
"loss": 5.0611,
"mean_token_accuracy": 0.19034309834241867,
"num_tokens": 64183683.0,
"step": 37000
},
{
"entropy": 5.454071378707885,
"epoch": 2.8791285742073525,
"grad_norm": 1.1875,
"learning_rate": 0.0004171420537787269,
"loss": 5.0095,
"mean_token_accuracy": 0.19799187630414963,
"num_tokens": 64192808.0,
"step": 37005
},
{
"entropy": 5.381619310379028,
"epoch": 2.87951760357907,
"grad_norm": 1.09375,
"learning_rate": 0.00041712056817710697,
"loss": 4.9185,
"mean_token_accuracy": 0.2021889090538025,
"num_tokens": 64201703.0,
"step": 37010
},
{
"entropy": 5.334100532531738,
"epoch": 2.879906632950788,
"grad_norm": 1.1484375,
"learning_rate": 0.0004170990804190337,
"loss": 4.9868,
"mean_token_accuracy": 0.1993370071053505,
"num_tokens": 64210343.0,
"step": 37015
},
{
"entropy": 5.443491697311401,
"epoch": 2.8802956623225056,
"grad_norm": 1.09375,
"learning_rate": 0.00041707759050483304,
"loss": 5.0232,
"mean_token_accuracy": 0.1982554391026497,
"num_tokens": 64218871.0,
"step": 37020
},
{
"entropy": 5.328158330917359,
"epoch": 2.880684691694223,
"grad_norm": 1.140625,
"learning_rate": 0.000417056098434831,
"loss": 4.8653,
"mean_token_accuracy": 0.21353079229593278,
"num_tokens": 64226300.0,
"step": 37025
},
{
"entropy": 5.327289295196533,
"epoch": 2.8810737210659405,
"grad_norm": 1.1171875,
"learning_rate": 0.0004170346042093538,
"loss": 4.9296,
"mean_token_accuracy": 0.20347051024436952,
"num_tokens": 64235042.0,
"step": 37030
},
{
"entropy": 5.330820465087891,
"epoch": 2.881462750437658,
"grad_norm": 1.1328125,
"learning_rate": 0.0004170131078287276,
"loss": 4.8825,
"mean_token_accuracy": 0.20671766996383667,
"num_tokens": 64242942.0,
"step": 37035
},
{
"entropy": 5.395991563796997,
"epoch": 2.8818517798093755,
"grad_norm": 1.140625,
"learning_rate": 0.0004169916092932785,
"loss": 5.0229,
"mean_token_accuracy": 0.1933741256594658,
"num_tokens": 64251187.0,
"step": 37040
},
{
"entropy": 5.41240668296814,
"epoch": 2.882240809181093,
"grad_norm": 1.1328125,
"learning_rate": 0.0004169701086033327,
"loss": 5.0533,
"mean_token_accuracy": 0.1966106727719307,
"num_tokens": 64260025.0,
"step": 37045
},
{
"entropy": 5.349978399276734,
"epoch": 2.882629838552811,
"grad_norm": 1.2109375,
"learning_rate": 0.00041694860575921654,
"loss": 5.0354,
"mean_token_accuracy": 0.1986776649951935,
"num_tokens": 64269940.0,
"step": 37050
},
{
"entropy": 5.399356412887573,
"epoch": 2.8830188679245285,
"grad_norm": 1.109375,
"learning_rate": 0.00041692710076125615,
"loss": 4.9947,
"mean_token_accuracy": 0.1967592567205429,
"num_tokens": 64279054.0,
"step": 37055
},
{
"entropy": 5.374951553344727,
"epoch": 2.883407897296246,
"grad_norm": 1.15625,
"learning_rate": 0.000416905593609778,
"loss": 5.0109,
"mean_token_accuracy": 0.19949739277362824,
"num_tokens": 64287332.0,
"step": 37060
},
{
"entropy": 5.384362506866455,
"epoch": 2.8837969266679635,
"grad_norm": 1.1484375,
"learning_rate": 0.00041688408430510827,
"loss": 4.9479,
"mean_token_accuracy": 0.20140158981084824,
"num_tokens": 64295889.0,
"step": 37065
},
{
"entropy": 5.391523218154907,
"epoch": 2.8841859560396808,
"grad_norm": 1.0390625,
"learning_rate": 0.0004168625728475734,
"loss": 4.942,
"mean_token_accuracy": 0.20196360051631929,
"num_tokens": 64305138.0,
"step": 37070
},
{
"entropy": 5.3203715801239015,
"epoch": 2.8845749854113985,
"grad_norm": 1.1875,
"learning_rate": 0.00041684105923749977,
"loss": 4.984,
"mean_token_accuracy": 0.20258364975452423,
"num_tokens": 64314041.0,
"step": 37075
},
{
"entropy": 5.483639287948608,
"epoch": 2.884964014783116,
"grad_norm": 1.1171875,
"learning_rate": 0.0004168195434752139,
"loss": 5.0538,
"mean_token_accuracy": 0.19434479326009751,
"num_tokens": 64323686.0,
"step": 37080
},
{
"entropy": 5.393478965759277,
"epoch": 2.885353044154834,
"grad_norm": 1.109375,
"learning_rate": 0.00041679802556104207,
"loss": 4.9645,
"mean_token_accuracy": 0.20160310268402098,
"num_tokens": 64332395.0,
"step": 37085
},
{
"entropy": 5.361710071563721,
"epoch": 2.885742073526551,
"grad_norm": 1.1796875,
"learning_rate": 0.00041677650549531097,
"loss": 4.9636,
"mean_token_accuracy": 0.20981577038764954,
"num_tokens": 64340577.0,
"step": 37090
},
{
"entropy": 5.292429828643799,
"epoch": 2.886131102898269,
"grad_norm": 1.15625,
"learning_rate": 0.00041675498327834706,
"loss": 4.9483,
"mean_token_accuracy": 0.19760295897722244,
"num_tokens": 64348903.0,
"step": 37095
},
{
"entropy": 5.4251944065094,
"epoch": 2.8865201322699865,
"grad_norm": 1.03125,
"learning_rate": 0.00041673345891047686,
"loss": 5.0657,
"mean_token_accuracy": 0.18725039362907409,
"num_tokens": 64357725.0,
"step": 37100
},
{
"entropy": 5.4748570919036865,
"epoch": 2.8869091616417037,
"grad_norm": 1.078125,
"learning_rate": 0.0004167119323920271,
"loss": 5.0467,
"mean_token_accuracy": 0.19451011270284652,
"num_tokens": 64366871.0,
"step": 37105
},
{
"entropy": 5.399796438217163,
"epoch": 2.8872981910134214,
"grad_norm": 1.203125,
"learning_rate": 0.0004166904037233243,
"loss": 4.9677,
"mean_token_accuracy": 0.1962062954902649,
"num_tokens": 64375155.0,
"step": 37110
},
{
"entropy": 5.333475494384766,
"epoch": 2.887687220385139,
"grad_norm": 1.1328125,
"learning_rate": 0.00041666887290469506,
"loss": 4.9203,
"mean_token_accuracy": 0.20722077339887618,
"num_tokens": 64383956.0,
"step": 37115
},
{
"entropy": 5.432944679260254,
"epoch": 2.888076249756857,
"grad_norm": 1.203125,
"learning_rate": 0.0004166473399364663,
"loss": 5.0125,
"mean_token_accuracy": 0.195708030462265,
"num_tokens": 64392816.0,
"step": 37120
},
{
"entropy": 5.399767351150513,
"epoch": 2.888465279128574,
"grad_norm": 1.109375,
"learning_rate": 0.00041662580481896446,
"loss": 4.9462,
"mean_token_accuracy": 0.20797515362501146,
"num_tokens": 64401676.0,
"step": 37125
},
{
"entropy": 5.452234172821045,
"epoch": 2.888854308500292,
"grad_norm": 1.1171875,
"learning_rate": 0.0004166042675525165,
"loss": 5.1248,
"mean_token_accuracy": 0.19088877737522125,
"num_tokens": 64410248.0,
"step": 37130
},
{
"entropy": 5.400062370300293,
"epoch": 2.8892433378720095,
"grad_norm": 1.0703125,
"learning_rate": 0.00041658272813744924,
"loss": 4.9557,
"mean_token_accuracy": 0.2012479141354561,
"num_tokens": 64419023.0,
"step": 37135
},
{
"entropy": 5.378878545761109,
"epoch": 2.8896323672437267,
"grad_norm": 1.09375,
"learning_rate": 0.0004165611865740894,
"loss": 4.8658,
"mean_token_accuracy": 0.19989986419677735,
"num_tokens": 64427775.0,
"step": 37140
},
{
"entropy": 5.306016969680786,
"epoch": 2.8900213966154444,
"grad_norm": 1.1953125,
"learning_rate": 0.0004165396428627638,
"loss": 4.9344,
"mean_token_accuracy": 0.20216196030378342,
"num_tokens": 64436113.0,
"step": 37145
},
{
"entropy": 5.355347347259522,
"epoch": 2.890410425987162,
"grad_norm": 1.1953125,
"learning_rate": 0.00041651809700379947,
"loss": 4.9902,
"mean_token_accuracy": 0.20539370328187942,
"num_tokens": 64444325.0,
"step": 37150
},
{
"entropy": 5.349817371368408,
"epoch": 2.89079945535888,
"grad_norm": 1.0859375,
"learning_rate": 0.00041649654899752326,
"loss": 4.9136,
"mean_token_accuracy": 0.2041795626282692,
"num_tokens": 64452560.0,
"step": 37155
},
{
"entropy": 5.365509462356568,
"epoch": 2.891188484730597,
"grad_norm": 1.109375,
"learning_rate": 0.0004164749988442621,
"loss": 4.9154,
"mean_token_accuracy": 0.207687346637249,
"num_tokens": 64460983.0,
"step": 37160
},
{
"entropy": 5.377222728729248,
"epoch": 2.891577514102315,
"grad_norm": 1.0390625,
"learning_rate": 0.000416453446544343,
"loss": 4.9889,
"mean_token_accuracy": 0.2022017776966095,
"num_tokens": 64470103.0,
"step": 37165
},
{
"entropy": 5.431510877609253,
"epoch": 2.891966543474032,
"grad_norm": 1.140625,
"learning_rate": 0.0004164318920980931,
"loss": 4.9193,
"mean_token_accuracy": 0.20355570167303086,
"num_tokens": 64478642.0,
"step": 37170
},
{
"entropy": 5.339621067047119,
"epoch": 2.8923555728457497,
"grad_norm": 1.0703125,
"learning_rate": 0.0004164103355058393,
"loss": 4.9239,
"mean_token_accuracy": 0.20127612054347993,
"num_tokens": 64487625.0,
"step": 37175
},
{
"entropy": 5.368389844894409,
"epoch": 2.8927446022174674,
"grad_norm": 1.2265625,
"learning_rate": 0.0004163887767679087,
"loss": 4.9375,
"mean_token_accuracy": 0.2036495491862297,
"num_tokens": 64497400.0,
"step": 37180
},
{
"entropy": 5.479900884628296,
"epoch": 2.893133631589185,
"grad_norm": 1.125,
"learning_rate": 0.0004163672158846285,
"loss": 5.0174,
"mean_token_accuracy": 0.1972857341170311,
"num_tokens": 64506119.0,
"step": 37185
},
{
"entropy": 5.386583423614502,
"epoch": 2.8935226609609024,
"grad_norm": 1.125,
"learning_rate": 0.00041634565285632573,
"loss": 4.8544,
"mean_token_accuracy": 0.19973734617233277,
"num_tokens": 64514372.0,
"step": 37190
},
{
"entropy": 5.376695680618286,
"epoch": 2.89391169033262,
"grad_norm": 1.15625,
"learning_rate": 0.00041632408768332776,
"loss": 4.9187,
"mean_token_accuracy": 0.2035576283931732,
"num_tokens": 64522877.0,
"step": 37195
},
{
"entropy": 5.281811857223511,
"epoch": 2.8943007197043378,
"grad_norm": 1.1015625,
"learning_rate": 0.00041630252036596165,
"loss": 4.7772,
"mean_token_accuracy": 0.21734653860330583,
"num_tokens": 64531647.0,
"step": 37200
},
{
"entropy": 5.300336647033691,
"epoch": 2.894689749076055,
"grad_norm": 1.15625,
"learning_rate": 0.0004162809509045547,
"loss": 4.914,
"mean_token_accuracy": 0.20186670422554015,
"num_tokens": 64540323.0,
"step": 37205
},
{
"entropy": 5.4226710319519045,
"epoch": 2.8950787784477727,
"grad_norm": 1.2578125,
"learning_rate": 0.00041625937929943424,
"loss": 5.0374,
"mean_token_accuracy": 0.19797711074352264,
"num_tokens": 64548955.0,
"step": 37210
},
{
"entropy": 5.43925199508667,
"epoch": 2.8954678078194904,
"grad_norm": 1.203125,
"learning_rate": 0.00041623780555092747,
"loss": 4.9954,
"mean_token_accuracy": 0.19738141298294068,
"num_tokens": 64557744.0,
"step": 37215
},
{
"entropy": 5.303907108306885,
"epoch": 2.895856837191208,
"grad_norm": 1.1953125,
"learning_rate": 0.0004162162296593618,
"loss": 4.8366,
"mean_token_accuracy": 0.2032587245106697,
"num_tokens": 64566119.0,
"step": 37220
},
{
"entropy": 5.337768316268921,
"epoch": 2.8962458665629254,
"grad_norm": 1.0625,
"learning_rate": 0.00041619465162506466,
"loss": 4.9553,
"mean_token_accuracy": 0.20147458612918853,
"num_tokens": 64574995.0,
"step": 37225
},
{
"entropy": 5.389168071746826,
"epoch": 2.896634895934643,
"grad_norm": 1.1796875,
"learning_rate": 0.0004161730714483633,
"loss": 5.0635,
"mean_token_accuracy": 0.19549149721860887,
"num_tokens": 64583667.0,
"step": 37230
},
{
"entropy": 5.396248531341553,
"epoch": 2.8970239253063608,
"grad_norm": 1.1640625,
"learning_rate": 0.0004161514891295854,
"loss": 4.9065,
"mean_token_accuracy": 0.2094361111521721,
"num_tokens": 64591857.0,
"step": 37235
},
{
"entropy": 5.353471326828003,
"epoch": 2.897412954678078,
"grad_norm": 1.171875,
"learning_rate": 0.00041612990466905825,
"loss": 4.9879,
"mean_token_accuracy": 0.20113601982593537,
"num_tokens": 64600635.0,
"step": 37240
},
{
"entropy": 5.36184868812561,
"epoch": 2.8978019840497957,
"grad_norm": 1.1875,
"learning_rate": 0.00041610831806710954,
"loss": 4.9487,
"mean_token_accuracy": 0.1943442106246948,
"num_tokens": 64609141.0,
"step": 37245
},
{
"entropy": 5.405912160873413,
"epoch": 2.8981910134215134,
"grad_norm": 1.125,
"learning_rate": 0.00041608672932406666,
"loss": 4.9652,
"mean_token_accuracy": 0.20004018843173982,
"num_tokens": 64617804.0,
"step": 37250
},
{
"entropy": 5.290182781219483,
"epoch": 2.898580042793231,
"grad_norm": 1.1484375,
"learning_rate": 0.00041606513844025716,
"loss": 4.8179,
"mean_token_accuracy": 0.2151850402355194,
"num_tokens": 64626119.0,
"step": 37255
},
{
"entropy": 5.330122804641723,
"epoch": 2.8989690721649484,
"grad_norm": 1.2421875,
"learning_rate": 0.0004160435454160087,
"loss": 4.9225,
"mean_token_accuracy": 0.19963030368089676,
"num_tokens": 64634483.0,
"step": 37260
},
{
"entropy": 5.30983567237854,
"epoch": 2.899358101536666,
"grad_norm": 1.125,
"learning_rate": 0.000416021950251649,
"loss": 4.9822,
"mean_token_accuracy": 0.19851722121238707,
"num_tokens": 64642500.0,
"step": 37265
},
{
"entropy": 5.323421764373779,
"epoch": 2.8997471309083833,
"grad_norm": 1.1484375,
"learning_rate": 0.0004160003529475057,
"loss": 4.9654,
"mean_token_accuracy": 0.19566881656646729,
"num_tokens": 64651808.0,
"step": 37270
},
{
"entropy": 5.393684577941895,
"epoch": 2.900136160280101,
"grad_norm": 1.2578125,
"learning_rate": 0.0004159787535039064,
"loss": 4.968,
"mean_token_accuracy": 0.20235880166292192,
"num_tokens": 64660502.0,
"step": 37275
},
{
"entropy": 5.371540689468384,
"epoch": 2.9005251896518187,
"grad_norm": 1.15625,
"learning_rate": 0.0004159571519211789,
"loss": 5.0329,
"mean_token_accuracy": 0.20524853616952896,
"num_tokens": 64669156.0,
"step": 37280
},
{
"entropy": 5.408015489578247,
"epoch": 2.9009142190235364,
"grad_norm": 1.140625,
"learning_rate": 0.000415935548199651,
"loss": 4.9956,
"mean_token_accuracy": 0.19675534963607788,
"num_tokens": 64678321.0,
"step": 37285
},
{
"entropy": 5.419590711593628,
"epoch": 2.901303248395254,
"grad_norm": 1.140625,
"learning_rate": 0.0004159139423396504,
"loss": 4.9658,
"mean_token_accuracy": 0.19978420734405516,
"num_tokens": 64686768.0,
"step": 37290
},
{
"entropy": 5.469217348098755,
"epoch": 2.9016922777669714,
"grad_norm": 1.140625,
"learning_rate": 0.0004158923343415051,
"loss": 5.0537,
"mean_token_accuracy": 0.19891429394483567,
"num_tokens": 64695357.0,
"step": 37295
},
{
"entropy": 5.304123783111573,
"epoch": 2.902081307138689,
"grad_norm": 1.140625,
"learning_rate": 0.0004158707242055429,
"loss": 4.9783,
"mean_token_accuracy": 0.1969512552022934,
"num_tokens": 64703912.0,
"step": 37300
},
{
"entropy": 5.298651885986328,
"epoch": 2.9024703365104063,
"grad_norm": 1.09375,
"learning_rate": 0.00041584911193209167,
"loss": 4.9079,
"mean_token_accuracy": 0.20512390434741973,
"num_tokens": 64713088.0,
"step": 37305
},
{
"entropy": 5.4175924301147464,
"epoch": 2.902859365882124,
"grad_norm": 1.1484375,
"learning_rate": 0.0004158274975214794,
"loss": 4.9834,
"mean_token_accuracy": 0.19537829160690307,
"num_tokens": 64721950.0,
"step": 37310
},
{
"entropy": 5.417685699462891,
"epoch": 2.9032483952538417,
"grad_norm": 1.1015625,
"learning_rate": 0.00041580588097403384,
"loss": 4.9506,
"mean_token_accuracy": 0.19385679960250854,
"num_tokens": 64731032.0,
"step": 37315
},
{
"entropy": 5.363985395431518,
"epoch": 2.9036374246255594,
"grad_norm": 1.1328125,
"learning_rate": 0.00041578426229008325,
"loss": 4.9844,
"mean_token_accuracy": 0.1970355600118637,
"num_tokens": 64739676.0,
"step": 37320
},
{
"entropy": 5.35716609954834,
"epoch": 2.9040264539972767,
"grad_norm": 1.171875,
"learning_rate": 0.00041576264146995557,
"loss": 4.9436,
"mean_token_accuracy": 0.20389612764120102,
"num_tokens": 64748827.0,
"step": 37325
},
{
"entropy": 5.319880867004395,
"epoch": 2.9044154833689944,
"grad_norm": 1.09375,
"learning_rate": 0.00041574101851397883,
"loss": 4.8651,
"mean_token_accuracy": 0.20533792525529862,
"num_tokens": 64757990.0,
"step": 37330
},
{
"entropy": 5.344013357162476,
"epoch": 2.904804512740712,
"grad_norm": 1.0703125,
"learning_rate": 0.0004157193934224811,
"loss": 5.0291,
"mean_token_accuracy": 0.19846984297037124,
"num_tokens": 64767351.0,
"step": 37335
},
{
"entropy": 5.476811170578003,
"epoch": 2.9051935421124293,
"grad_norm": 1.0625,
"learning_rate": 0.0004156977661957906,
"loss": 5.0251,
"mean_token_accuracy": 0.1997022420167923,
"num_tokens": 64775294.0,
"step": 37340
},
{
"entropy": 5.415498971939087,
"epoch": 2.905582571484147,
"grad_norm": 1.1484375,
"learning_rate": 0.0004156761368342355,
"loss": 4.9988,
"mean_token_accuracy": 0.2063598930835724,
"num_tokens": 64784933.0,
"step": 37345
},
{
"entropy": 5.387592744827271,
"epoch": 2.9059716008558647,
"grad_norm": 1.0859375,
"learning_rate": 0.00041565450533814384,
"loss": 4.9291,
"mean_token_accuracy": 0.20324084907770157,
"num_tokens": 64794137.0,
"step": 37350
},
{
"entropy": 5.374163675308227,
"epoch": 2.9063606302275824,
"grad_norm": 1.1484375,
"learning_rate": 0.00041563287170784396,
"loss": 4.951,
"mean_token_accuracy": 0.20166610032320023,
"num_tokens": 64803100.0,
"step": 37355
},
{
"entropy": 5.288591384887695,
"epoch": 2.9067496595992997,
"grad_norm": 1.1328125,
"learning_rate": 0.0004156112359436641,
"loss": 4.8659,
"mean_token_accuracy": 0.21121285259723663,
"num_tokens": 64811980.0,
"step": 37360
},
{
"entropy": 5.319044351577759,
"epoch": 2.9071386889710173,
"grad_norm": 1.1015625,
"learning_rate": 0.00041558959804593255,
"loss": 4.934,
"mean_token_accuracy": 0.2019159123301506,
"num_tokens": 64820201.0,
"step": 37365
},
{
"entropy": 5.340664339065552,
"epoch": 2.9075277183427346,
"grad_norm": 1.1328125,
"learning_rate": 0.00041556795801497766,
"loss": 4.9026,
"mean_token_accuracy": 0.2104795217514038,
"num_tokens": 64829054.0,
"step": 37370
},
{
"entropy": 5.467510795593261,
"epoch": 2.9079167477144523,
"grad_norm": 1.171875,
"learning_rate": 0.0004155463158511277,
"loss": 5.1027,
"mean_token_accuracy": 0.19545851051807403,
"num_tokens": 64838704.0,
"step": 37375
},
{
"entropy": 5.340311813354492,
"epoch": 2.90830577708617,
"grad_norm": 1.0390625,
"learning_rate": 0.00041552467155471105,
"loss": 4.7783,
"mean_token_accuracy": 0.2125468835234642,
"num_tokens": 64847508.0,
"step": 37380
},
{
"entropy": 5.348222064971924,
"epoch": 2.9086948064578877,
"grad_norm": 1.1796875,
"learning_rate": 0.0004155030251260563,
"loss": 4.8979,
"mean_token_accuracy": 0.20774298310279846,
"num_tokens": 64856112.0,
"step": 37385
},
{
"entropy": 5.292542791366577,
"epoch": 2.9090838358296054,
"grad_norm": 1.140625,
"learning_rate": 0.00041548137656549167,
"loss": 4.8534,
"mean_token_accuracy": 0.20734062045812607,
"num_tokens": 64864807.0,
"step": 37390
},
{
"entropy": 5.357112121582031,
"epoch": 2.9094728652013226,
"grad_norm": 1.171875,
"learning_rate": 0.0004154597258733457,
"loss": 4.9232,
"mean_token_accuracy": 0.20104329586029052,
"num_tokens": 64872744.0,
"step": 37395
},
{
"entropy": 5.335861444473267,
"epoch": 2.9098618945730403,
"grad_norm": 1.125,
"learning_rate": 0.0004154380730499472,
"loss": 4.9143,
"mean_token_accuracy": 0.21156683415174485,
"num_tokens": 64882581.0,
"step": 37400
},
{
"entropy": 5.340922927856445,
"epoch": 2.9102509239447576,
"grad_norm": 1.1328125,
"learning_rate": 0.00041541641809562425,
"loss": 4.8449,
"mean_token_accuracy": 0.20912200808525086,
"num_tokens": 64890935.0,
"step": 37405
},
{
"entropy": 5.4223652362823485,
"epoch": 2.9106399533164753,
"grad_norm": 1.1796875,
"learning_rate": 0.0004153947610107057,
"loss": 5.0511,
"mean_token_accuracy": 0.19548511654138565,
"num_tokens": 64900132.0,
"step": 37410
},
{
"entropy": 5.386390829086304,
"epoch": 2.911028982688193,
"grad_norm": 1.1015625,
"learning_rate": 0.00041537310179552017,
"loss": 4.9754,
"mean_token_accuracy": 0.195708566904068,
"num_tokens": 64908733.0,
"step": 37415
},
{
"entropy": 5.393733072280884,
"epoch": 2.9114180120599107,
"grad_norm": 1.2265625,
"learning_rate": 0.0004153514404503962,
"loss": 4.9581,
"mean_token_accuracy": 0.20353571325540543,
"num_tokens": 64916824.0,
"step": 37420
},
{
"entropy": 5.423798656463623,
"epoch": 2.911807041431628,
"grad_norm": 1.1328125,
"learning_rate": 0.0004153297769756625,
"loss": 4.9701,
"mean_token_accuracy": 0.2000584214925766,
"num_tokens": 64926342.0,
"step": 37425
},
{
"entropy": 5.423081350326538,
"epoch": 2.9121960708033456,
"grad_norm": 1.1328125,
"learning_rate": 0.0004153081113716478,
"loss": 4.9844,
"mean_token_accuracy": 0.20184855461120604,
"num_tokens": 64935123.0,
"step": 37430
},
{
"entropy": 5.363427066802979,
"epoch": 2.9125851001750633,
"grad_norm": 1.1484375,
"learning_rate": 0.00041528644363868087,
"loss": 4.9932,
"mean_token_accuracy": 0.19337051063776017,
"num_tokens": 64944046.0,
"step": 37435
},
{
"entropy": 5.489654541015625,
"epoch": 2.9129741295467806,
"grad_norm": 1.1328125,
"learning_rate": 0.0004152647737770904,
"loss": 5.0543,
"mean_token_accuracy": 0.1885812595486641,
"num_tokens": 64952897.0,
"step": 37440
},
{
"entropy": 5.439988517761231,
"epoch": 2.9133631589184983,
"grad_norm": 1.109375,
"learning_rate": 0.0004152431017872053,
"loss": 5.0055,
"mean_token_accuracy": 0.19353672862052917,
"num_tokens": 64961432.0,
"step": 37445
},
{
"entropy": 5.429376077651978,
"epoch": 2.913752188290216,
"grad_norm": 1.1015625,
"learning_rate": 0.00041522142766935426,
"loss": 5.0656,
"mean_token_accuracy": 0.19510917067527772,
"num_tokens": 64970298.0,
"step": 37450
},
{
"entropy": 5.427340078353882,
"epoch": 2.9141412176619337,
"grad_norm": 1.125,
"learning_rate": 0.00041519975142386627,
"loss": 5.013,
"mean_token_accuracy": 0.1947298228740692,
"num_tokens": 64978735.0,
"step": 37455
},
{
"entropy": 5.375114059448242,
"epoch": 2.914530247033651,
"grad_norm": 1.1953125,
"learning_rate": 0.0004151780730510702,
"loss": 4.967,
"mean_token_accuracy": 0.19820231944322586,
"num_tokens": 64987222.0,
"step": 37460
},
{
"entropy": 5.269347333908081,
"epoch": 2.9149192764053686,
"grad_norm": 1.1015625,
"learning_rate": 0.00041515639255129504,
"loss": 4.8746,
"mean_token_accuracy": 0.20782892853021623,
"num_tokens": 64995857.0,
"step": 37465
},
{
"entropy": 5.338833045959473,
"epoch": 2.9153083057770863,
"grad_norm": 1.1015625,
"learning_rate": 0.0004151347099248697,
"loss": 4.8945,
"mean_token_accuracy": 0.20555528104305268,
"num_tokens": 65005583.0,
"step": 37470
},
{
"entropy": 5.395391893386841,
"epoch": 2.9156973351488036,
"grad_norm": 1.109375,
"learning_rate": 0.0004151130251721231,
"loss": 4.9406,
"mean_token_accuracy": 0.2025502473115921,
"num_tokens": 65013533.0,
"step": 37475
},
{
"entropy": 5.373561573028565,
"epoch": 2.9160863645205213,
"grad_norm": 1.125,
"learning_rate": 0.00041509133829338454,
"loss": 4.9175,
"mean_token_accuracy": 0.21041665524244307,
"num_tokens": 65022674.0,
"step": 37480
},
{
"entropy": 5.351035308837891,
"epoch": 2.916475393892239,
"grad_norm": 1.1328125,
"learning_rate": 0.0004150696492889827,
"loss": 4.8813,
"mean_token_accuracy": 0.20601247102022172,
"num_tokens": 65030914.0,
"step": 37485
},
{
"entropy": 5.329110956192016,
"epoch": 2.9168644232639567,
"grad_norm": 1.203125,
"learning_rate": 0.00041504795815924697,
"loss": 4.9871,
"mean_token_accuracy": 0.201705265045166,
"num_tokens": 65040036.0,
"step": 37490
},
{
"entropy": 5.401362800598145,
"epoch": 2.917253452635674,
"grad_norm": 1.15625,
"learning_rate": 0.00041502626490450635,
"loss": 4.9247,
"mean_token_accuracy": 0.20747202038764953,
"num_tokens": 65048558.0,
"step": 37495
},
{
"entropy": 5.310954666137695,
"epoch": 2.9176424820073916,
"grad_norm": 1.140625,
"learning_rate": 0.0004150045695250901,
"loss": 4.929,
"mean_token_accuracy": 0.21007044166326522,
"num_tokens": 65057158.0,
"step": 37500
},
{
"entropy": 5.380912017822266,
"epoch": 2.918031511379109,
"grad_norm": 1.15625,
"learning_rate": 0.0004149828720213272,
"loss": 5.0138,
"mean_token_accuracy": 0.1999897003173828,
"num_tokens": 65065845.0,
"step": 37505
},
{
"entropy": 5.399272298812866,
"epoch": 2.9184205407508266,
"grad_norm": 1.1484375,
"learning_rate": 0.0004149611723935472,
"loss": 4.9385,
"mean_token_accuracy": 0.20354021191596985,
"num_tokens": 65075182.0,
"step": 37510
},
{
"entropy": 5.39171953201294,
"epoch": 2.9188095701225443,
"grad_norm": 1.09375,
"learning_rate": 0.0004149394706420791,
"loss": 4.9671,
"mean_token_accuracy": 0.20318426340818405,
"num_tokens": 65084616.0,
"step": 37515
},
{
"entropy": 5.274928712844849,
"epoch": 2.919198599494262,
"grad_norm": 1.1484375,
"learning_rate": 0.00041491776676725223,
"loss": 4.8318,
"mean_token_accuracy": 0.21738772839307785,
"num_tokens": 65092683.0,
"step": 37520
},
{
"entropy": 5.339082479476929,
"epoch": 2.9195876288659792,
"grad_norm": 1.109375,
"learning_rate": 0.0004148960607693961,
"loss": 4.8791,
"mean_token_accuracy": 0.20388251692056655,
"num_tokens": 65100445.0,
"step": 37525
},
{
"entropy": 5.386516761779785,
"epoch": 2.919976658237697,
"grad_norm": 1.1171875,
"learning_rate": 0.00041487435264883974,
"loss": 4.9609,
"mean_token_accuracy": 0.2012045592069626,
"num_tokens": 65109512.0,
"step": 37530
},
{
"entropy": 5.35376205444336,
"epoch": 2.9203656876094146,
"grad_norm": 1.125,
"learning_rate": 0.0004148526424059128,
"loss": 4.9486,
"mean_token_accuracy": 0.20072949975728988,
"num_tokens": 65117889.0,
"step": 37535
},
{
"entropy": 5.360037088394165,
"epoch": 2.920754716981132,
"grad_norm": 1.1484375,
"learning_rate": 0.0004148309300409446,
"loss": 4.9845,
"mean_token_accuracy": 0.20024109333753587,
"num_tokens": 65126226.0,
"step": 37540
},
{
"entropy": 5.326682043075562,
"epoch": 2.9211437463528496,
"grad_norm": 1.1171875,
"learning_rate": 0.0004148092155542646,
"loss": 4.9369,
"mean_token_accuracy": 0.20324024111032485,
"num_tokens": 65134474.0,
"step": 37545
},
{
"entropy": 5.414184093475342,
"epoch": 2.9215327757245673,
"grad_norm": 1.1640625,
"learning_rate": 0.0004147874989462023,
"loss": 5.0279,
"mean_token_accuracy": 0.19510591626167298,
"num_tokens": 65143068.0,
"step": 37550
},
{
"entropy": 5.38086838722229,
"epoch": 2.921921805096285,
"grad_norm": 1.1328125,
"learning_rate": 0.0004147657802170871,
"loss": 4.9225,
"mean_token_accuracy": 0.2069569244980812,
"num_tokens": 65151865.0,
"step": 37555
},
{
"entropy": 5.323944139480591,
"epoch": 2.922310834468002,
"grad_norm": 1.125,
"learning_rate": 0.00041474405936724873,
"loss": 4.9207,
"mean_token_accuracy": 0.19961315393447876,
"num_tokens": 65160684.0,
"step": 37560
},
{
"entropy": 5.41795506477356,
"epoch": 2.92269986383972,
"grad_norm": 1.1796875,
"learning_rate": 0.0004147223363970166,
"loss": 4.9697,
"mean_token_accuracy": 0.19758064597845076,
"num_tokens": 65169084.0,
"step": 37565
},
{
"entropy": 5.295176935195923,
"epoch": 2.9230888932114376,
"grad_norm": 1.078125,
"learning_rate": 0.0004147006113067205,
"loss": 4.8239,
"mean_token_accuracy": 0.21040179431438447,
"num_tokens": 65178428.0,
"step": 37570
},
{
"entropy": 5.295871829986572,
"epoch": 2.923477922583155,
"grad_norm": 1.1015625,
"learning_rate": 0.0004146788840966901,
"loss": 4.9103,
"mean_token_accuracy": 0.20014121979475022,
"num_tokens": 65187490.0,
"step": 37575
},
{
"entropy": 5.386913251876831,
"epoch": 2.9238669519548726,
"grad_norm": 1.09375,
"learning_rate": 0.0004146571547672548,
"loss": 4.9688,
"mean_token_accuracy": 0.202760311961174,
"num_tokens": 65195987.0,
"step": 37580
},
{
"entropy": 5.297890758514404,
"epoch": 2.9242559813265903,
"grad_norm": 1.046875,
"learning_rate": 0.00041463542331874443,
"loss": 4.8988,
"mean_token_accuracy": 0.20495434552431108,
"num_tokens": 65204466.0,
"step": 37585
},
{
"entropy": 5.344933938980103,
"epoch": 2.924645010698308,
"grad_norm": 1.203125,
"learning_rate": 0.00041461368975148876,
"loss": 4.888,
"mean_token_accuracy": 0.20569198876619338,
"num_tokens": 65213023.0,
"step": 37590
},
{
"entropy": 5.4099774837493895,
"epoch": 2.925034040070025,
"grad_norm": 1.21875,
"learning_rate": 0.00041459195406581763,
"loss": 5.0786,
"mean_token_accuracy": 0.19362051486968995,
"num_tokens": 65221580.0,
"step": 37595
},
{
"entropy": 5.2840578079223635,
"epoch": 2.925423069441743,
"grad_norm": 1.109375,
"learning_rate": 0.0004145702162620608,
"loss": 4.9301,
"mean_token_accuracy": 0.2018754079937935,
"num_tokens": 65230529.0,
"step": 37600
},
{
"entropy": 5.343974208831787,
"epoch": 2.92581209881346,
"grad_norm": 1.140625,
"learning_rate": 0.00041454847634054805,
"loss": 4.9469,
"mean_token_accuracy": 0.20127518028020858,
"num_tokens": 65239338.0,
"step": 37605
},
{
"entropy": 5.365229511260987,
"epoch": 2.926201128185178,
"grad_norm": 1.1484375,
"learning_rate": 0.00041452673430160923,
"loss": 4.8816,
"mean_token_accuracy": 0.20884469598531724,
"num_tokens": 65248523.0,
"step": 37610
},
{
"entropy": 5.387389230728149,
"epoch": 2.9265901575568956,
"grad_norm": 1.078125,
"learning_rate": 0.0004145049901455744,
"loss": 4.9963,
"mean_token_accuracy": 0.19820436835289001,
"num_tokens": 65257740.0,
"step": 37615
},
{
"entropy": 5.377244329452514,
"epoch": 2.9269791869286133,
"grad_norm": 1.078125,
"learning_rate": 0.00041448324387277337,
"loss": 4.8814,
"mean_token_accuracy": 0.20877327173948287,
"num_tokens": 65266728.0,
"step": 37620
},
{
"entropy": 5.386267280578613,
"epoch": 2.927368216300331,
"grad_norm": 1.1796875,
"learning_rate": 0.00041446149548353606,
"loss": 5.0434,
"mean_token_accuracy": 0.19404161125421523,
"num_tokens": 65275264.0,
"step": 37625
},
{
"entropy": 5.39141583442688,
"epoch": 2.927757245672048,
"grad_norm": 1.1015625,
"learning_rate": 0.0004144397449781926,
"loss": 5.0385,
"mean_token_accuracy": 0.19300076216459275,
"num_tokens": 65284247.0,
"step": 37630
},
{
"entropy": 5.362431383132934,
"epoch": 2.928146275043766,
"grad_norm": 1.1484375,
"learning_rate": 0.0004144179923570729,
"loss": 4.9097,
"mean_token_accuracy": 0.20379756838083268,
"num_tokens": 65293255.0,
"step": 37635
},
{
"entropy": 5.381832599639893,
"epoch": 2.928535304415483,
"grad_norm": 1.1328125,
"learning_rate": 0.0004143962376205071,
"loss": 4.9719,
"mean_token_accuracy": 0.20261037796735765,
"num_tokens": 65301945.0,
"step": 37640
},
{
"entropy": 5.365680074691772,
"epoch": 2.928924333787201,
"grad_norm": 1.171875,
"learning_rate": 0.00041437448076882526,
"loss": 4.9167,
"mean_token_accuracy": 0.21031944304704667,
"num_tokens": 65310521.0,
"step": 37645
},
{
"entropy": 5.339953088760376,
"epoch": 2.9293133631589185,
"grad_norm": 1.1484375,
"learning_rate": 0.00041435272180235757,
"loss": 4.9251,
"mean_token_accuracy": 0.20113795548677443,
"num_tokens": 65318626.0,
"step": 37650
},
{
"entropy": 5.397060823440552,
"epoch": 2.9297023925306362,
"grad_norm": 1.1796875,
"learning_rate": 0.000414330960721434,
"loss": 4.9632,
"mean_token_accuracy": 0.19620810002088546,
"num_tokens": 65326098.0,
"step": 37655
},
{
"entropy": 5.389641666412354,
"epoch": 2.9300914219023535,
"grad_norm": 1.1640625,
"learning_rate": 0.00041430919752638497,
"loss": 5.0374,
"mean_token_accuracy": 0.1936261847615242,
"num_tokens": 65334705.0,
"step": 37660
},
{
"entropy": 5.390426588058472,
"epoch": 2.930480451274071,
"grad_norm": 1.0859375,
"learning_rate": 0.0004142874322175406,
"loss": 4.9032,
"mean_token_accuracy": 0.20770372599363326,
"num_tokens": 65343965.0,
"step": 37665
},
{
"entropy": 5.426338815689087,
"epoch": 2.930869480645789,
"grad_norm": 1.1796875,
"learning_rate": 0.00041426566479523116,
"loss": 4.9148,
"mean_token_accuracy": 0.2017579436302185,
"num_tokens": 65351467.0,
"step": 37670
},
{
"entropy": 5.301477766036987,
"epoch": 2.931258510017506,
"grad_norm": 1.203125,
"learning_rate": 0.00041424389525978683,
"loss": 4.9116,
"mean_token_accuracy": 0.20588507652282714,
"num_tokens": 65359820.0,
"step": 37675
},
{
"entropy": 5.290318202972412,
"epoch": 2.931647539389224,
"grad_norm": 1.1171875,
"learning_rate": 0.0004142221236115381,
"loss": 4.8501,
"mean_token_accuracy": 0.20666824728250505,
"num_tokens": 65368363.0,
"step": 37680
},
{
"entropy": 5.396524715423584,
"epoch": 2.9320365687609415,
"grad_norm": 1.109375,
"learning_rate": 0.0004142003498508152,
"loss": 4.9765,
"mean_token_accuracy": 0.20754232108592988,
"num_tokens": 65376771.0,
"step": 37685
},
{
"entropy": 5.416061449050903,
"epoch": 2.9324255981326592,
"grad_norm": 1.1640625,
"learning_rate": 0.0004141785739779486,
"loss": 5.0037,
"mean_token_accuracy": 0.20277312099933625,
"num_tokens": 65385254.0,
"step": 37690
},
{
"entropy": 5.466414070129394,
"epoch": 2.9328146275043765,
"grad_norm": 1.125,
"learning_rate": 0.00041415679599326853,
"loss": 4.9706,
"mean_token_accuracy": 0.19490021616220474,
"num_tokens": 65393276.0,
"step": 37695
},
{
"entropy": 5.275504159927368,
"epoch": 2.933203656876094,
"grad_norm": 1.234375,
"learning_rate": 0.00041413501589710567,
"loss": 4.8359,
"mean_token_accuracy": 0.20631514638662338,
"num_tokens": 65401745.0,
"step": 37700
},
{
"entropy": 5.388788080215454,
"epoch": 2.9335926862478114,
"grad_norm": 1.125,
"learning_rate": 0.0004141132336897904,
"loss": 5.0841,
"mean_token_accuracy": 0.19875578433275223,
"num_tokens": 65409982.0,
"step": 37705
},
{
"entropy": 5.390400457382202,
"epoch": 2.933981715619529,
"grad_norm": 1.09375,
"learning_rate": 0.0004140914493716533,
"loss": 4.9394,
"mean_token_accuracy": 0.20913472920656204,
"num_tokens": 65419617.0,
"step": 37710
},
{
"entropy": 5.379942607879639,
"epoch": 2.934370744991247,
"grad_norm": 1.0859375,
"learning_rate": 0.0004140696629430248,
"loss": 4.9535,
"mean_token_accuracy": 0.20148940235376359,
"num_tokens": 65428230.0,
"step": 37715
},
{
"entropy": 5.387977409362793,
"epoch": 2.9347597743629645,
"grad_norm": 1.171875,
"learning_rate": 0.00041404787440423534,
"loss": 4.9825,
"mean_token_accuracy": 0.20371298640966415,
"num_tokens": 65437126.0,
"step": 37720
},
{
"entropy": 5.397473287582398,
"epoch": 2.9351488037346822,
"grad_norm": 1.046875,
"learning_rate": 0.00041402608375561595,
"loss": 4.9838,
"mean_token_accuracy": 0.19834314584732055,
"num_tokens": 65445910.0,
"step": 37725
},
{
"entropy": 5.364032459259033,
"epoch": 2.9355378331063995,
"grad_norm": 1.140625,
"learning_rate": 0.00041400429099749687,
"loss": 5.0148,
"mean_token_accuracy": 0.20013068318367006,
"num_tokens": 65454371.0,
"step": 37730
},
{
"entropy": 5.391096925735473,
"epoch": 2.935926862478117,
"grad_norm": 1.1796875,
"learning_rate": 0.000413982496130209,
"loss": 4.9856,
"mean_token_accuracy": 0.19619592726230622,
"num_tokens": 65463207.0,
"step": 37735
},
{
"entropy": 5.331643581390381,
"epoch": 2.9363158918498344,
"grad_norm": 1.1484375,
"learning_rate": 0.00041396069915408294,
"loss": 4.9416,
"mean_token_accuracy": 0.2038038358092308,
"num_tokens": 65471703.0,
"step": 37740
},
{
"entropy": 5.313036918640137,
"epoch": 2.936704921221552,
"grad_norm": 1.1171875,
"learning_rate": 0.00041393890006944945,
"loss": 4.8761,
"mean_token_accuracy": 0.20930017828941344,
"num_tokens": 65480516.0,
"step": 37745
},
{
"entropy": 5.293054246902466,
"epoch": 2.93709395059327,
"grad_norm": 1.09375,
"learning_rate": 0.0004139170988766393,
"loss": 4.9294,
"mean_token_accuracy": 0.20443944931030272,
"num_tokens": 65489233.0,
"step": 37750
},
{
"entropy": 5.321640062332153,
"epoch": 2.9374829799649875,
"grad_norm": 1.1796875,
"learning_rate": 0.0004138952955759833,
"loss": 4.8586,
"mean_token_accuracy": 0.2048437088727951,
"num_tokens": 65497827.0,
"step": 37755
},
{
"entropy": 5.328530025482178,
"epoch": 2.937872009336705,
"grad_norm": 1.1875,
"learning_rate": 0.00041387349016781225,
"loss": 4.9866,
"mean_token_accuracy": 0.20304617136716843,
"num_tokens": 65505629.0,
"step": 37760
},
{
"entropy": 5.4190394401550295,
"epoch": 2.9382610387084225,
"grad_norm": 1.1171875,
"learning_rate": 0.000413851682652457,
"loss": 5.057,
"mean_token_accuracy": 0.197891765832901,
"num_tokens": 65514097.0,
"step": 37765
},
{
"entropy": 5.4248169422149655,
"epoch": 2.93865006808014,
"grad_norm": 1.1484375,
"learning_rate": 0.0004138298730302485,
"loss": 5.0354,
"mean_token_accuracy": 0.19569046646356583,
"num_tokens": 65522868.0,
"step": 37770
},
{
"entropy": 5.381247901916504,
"epoch": 2.9390390974518574,
"grad_norm": 1.234375,
"learning_rate": 0.0004138080613015176,
"loss": 4.9156,
"mean_token_accuracy": 0.2008703514933586,
"num_tokens": 65531433.0,
"step": 37775
},
{
"entropy": 5.387717390060425,
"epoch": 2.939428126823575,
"grad_norm": 1.0390625,
"learning_rate": 0.00041378624746659536,
"loss": 4.9692,
"mean_token_accuracy": 0.20051268339157105,
"num_tokens": 65541113.0,
"step": 37780
},
{
"entropy": 5.386761093139649,
"epoch": 2.939817156195293,
"grad_norm": 1.1484375,
"learning_rate": 0.00041376443152581265,
"loss": 4.9418,
"mean_token_accuracy": 0.2012167125940323,
"num_tokens": 65550103.0,
"step": 37785
},
{
"entropy": 5.357759284973144,
"epoch": 2.9402061855670105,
"grad_norm": 1.1875,
"learning_rate": 0.00041374261347950064,
"loss": 4.9599,
"mean_token_accuracy": 0.2061675578355789,
"num_tokens": 65558618.0,
"step": 37790
},
{
"entropy": 5.3916003704071045,
"epoch": 2.9405952149387278,
"grad_norm": 1.0703125,
"learning_rate": 0.0004137207933279903,
"loss": 4.9363,
"mean_token_accuracy": 0.2008431524038315,
"num_tokens": 65568025.0,
"step": 37795
},
{
"entropy": 5.338155794143677,
"epoch": 2.9409842443104455,
"grad_norm": 1.1640625,
"learning_rate": 0.00041369897107161266,
"loss": 4.963,
"mean_token_accuracy": 0.20262217968702317,
"num_tokens": 65576360.0,
"step": 37800
},
{
"entropy": 5.360418462753296,
"epoch": 2.941373273682163,
"grad_norm": 1.09375,
"learning_rate": 0.00041367714671069897,
"loss": 4.9656,
"mean_token_accuracy": 0.20181121081113815,
"num_tokens": 65585764.0,
"step": 37805
},
{
"entropy": 5.428329706192017,
"epoch": 2.9417623030538804,
"grad_norm": 1.0859375,
"learning_rate": 0.00041365532024558024,
"loss": 4.9956,
"mean_token_accuracy": 0.20076480507850647,
"num_tokens": 65594093.0,
"step": 37810
},
{
"entropy": 5.41986780166626,
"epoch": 2.942151332425598,
"grad_norm": 1.15625,
"learning_rate": 0.0004136334916765877,
"loss": 4.93,
"mean_token_accuracy": 0.202096027135849,
"num_tokens": 65602503.0,
"step": 37815
},
{
"entropy": 5.365942525863647,
"epoch": 2.942540361797316,
"grad_norm": 1.1328125,
"learning_rate": 0.00041361166100405264,
"loss": 4.909,
"mean_token_accuracy": 0.2046512708067894,
"num_tokens": 65611107.0,
"step": 37820
},
{
"entropy": 5.37239441871643,
"epoch": 2.9429293911690335,
"grad_norm": 1.1015625,
"learning_rate": 0.0004135898282283062,
"loss": 5.0311,
"mean_token_accuracy": 0.19952771663665772,
"num_tokens": 65620008.0,
"step": 37825
},
{
"entropy": 5.3321802616119385,
"epoch": 2.9433184205407508,
"grad_norm": 1.109375,
"learning_rate": 0.0004135679933496797,
"loss": 4.9434,
"mean_token_accuracy": 0.19970779567956926,
"num_tokens": 65629206.0,
"step": 37830
},
{
"entropy": 5.386870622634888,
"epoch": 2.9437074499124685,
"grad_norm": 1.1484375,
"learning_rate": 0.0004135461563685045,
"loss": 4.9919,
"mean_token_accuracy": 0.2044909954071045,
"num_tokens": 65637403.0,
"step": 37835
},
{
"entropy": 5.395250368118286,
"epoch": 2.9440964792841857,
"grad_norm": 1.0546875,
"learning_rate": 0.00041352431728511194,
"loss": 4.8278,
"mean_token_accuracy": 0.2167973816394806,
"num_tokens": 65646123.0,
"step": 37840
},
{
"entropy": 5.430347728729248,
"epoch": 2.9444855086559034,
"grad_norm": 1.0625,
"learning_rate": 0.0004135024760998333,
"loss": 4.9613,
"mean_token_accuracy": 0.19529460072517396,
"num_tokens": 65655019.0,
"step": 37845
},
{
"entropy": 5.394823360443115,
"epoch": 2.944874538027621,
"grad_norm": 1.046875,
"learning_rate": 0.00041348063281299995,
"loss": 5.0278,
"mean_token_accuracy": 0.20284398943185805,
"num_tokens": 65663721.0,
"step": 37850
},
{
"entropy": 5.343653440475464,
"epoch": 2.945263567399339,
"grad_norm": 1.1953125,
"learning_rate": 0.00041345878742494346,
"loss": 4.8083,
"mean_token_accuracy": 0.21191250383853913,
"num_tokens": 65671546.0,
"step": 37855
},
{
"entropy": 5.367030811309815,
"epoch": 2.945652596771056,
"grad_norm": 1.1328125,
"learning_rate": 0.00041343693993599535,
"loss": 4.9732,
"mean_token_accuracy": 0.1999453142285347,
"num_tokens": 65680630.0,
"step": 37860
},
{
"entropy": 5.382861757278443,
"epoch": 2.9460416261427738,
"grad_norm": 1.2109375,
"learning_rate": 0.0004134150903464869,
"loss": 5.0071,
"mean_token_accuracy": 0.19370317608118057,
"num_tokens": 65688579.0,
"step": 37865
},
{
"entropy": 5.361818075180054,
"epoch": 2.9464306555144915,
"grad_norm": 1.15625,
"learning_rate": 0.0004133932386567498,
"loss": 4.888,
"mean_token_accuracy": 0.19652958810329438,
"num_tokens": 65696531.0,
"step": 37870
},
{
"entropy": 5.312861776351928,
"epoch": 2.9468196848862087,
"grad_norm": 1.15625,
"learning_rate": 0.0004133713848671156,
"loss": 4.8549,
"mean_token_accuracy": 0.208931565284729,
"num_tokens": 65705271.0,
"step": 37875
},
{
"entropy": 5.279078245162964,
"epoch": 2.9472087142579264,
"grad_norm": 1.1484375,
"learning_rate": 0.0004133495289779159,
"loss": 4.954,
"mean_token_accuracy": 0.19804306626319884,
"num_tokens": 65713638.0,
"step": 37880
},
{
"entropy": 5.391410875320434,
"epoch": 2.947597743629644,
"grad_norm": 1.078125,
"learning_rate": 0.0004133276709894823,
"loss": 5.0216,
"mean_token_accuracy": 0.20135777145624162,
"num_tokens": 65722339.0,
"step": 37885
},
{
"entropy": 5.482567405700683,
"epoch": 2.947986773001362,
"grad_norm": 1.1484375,
"learning_rate": 0.0004133058109021464,
"loss": 5.1089,
"mean_token_accuracy": 0.19586635529994964,
"num_tokens": 65730969.0,
"step": 37890
},
{
"entropy": 5.484099721908569,
"epoch": 2.948375802373079,
"grad_norm": 1.1328125,
"learning_rate": 0.00041328394871624003,
"loss": 4.9963,
"mean_token_accuracy": 0.19770125597715377,
"num_tokens": 65739196.0,
"step": 37895
},
{
"entropy": 5.443966722488403,
"epoch": 2.9487648317447968,
"grad_norm": 1.15625,
"learning_rate": 0.0004132620844320948,
"loss": 5.0676,
"mean_token_accuracy": 0.18928190767765046,
"num_tokens": 65748032.0,
"step": 37900
},
{
"entropy": 5.3763673305511475,
"epoch": 2.9491538611165145,
"grad_norm": 1.1328125,
"learning_rate": 0.0004132402180500425,
"loss": 4.9665,
"mean_token_accuracy": 0.1958635851740837,
"num_tokens": 65756149.0,
"step": 37905
},
{
"entropy": 5.346277809143066,
"epoch": 2.9495428904882317,
"grad_norm": 1.1015625,
"learning_rate": 0.0004132183495704149,
"loss": 4.901,
"mean_token_accuracy": 0.20701911598443984,
"num_tokens": 65765275.0,
"step": 37910
},
{
"entropy": 5.390711784362793,
"epoch": 2.9499319198599494,
"grad_norm": 1.109375,
"learning_rate": 0.0004131964789935439,
"loss": 4.9276,
"mean_token_accuracy": 0.20138952285051345,
"num_tokens": 65773517.0,
"step": 37915
},
{
"entropy": 5.361279916763306,
"epoch": 2.950320949231667,
"grad_norm": 1.0859375,
"learning_rate": 0.0004131746063197612,
"loss": 5.0251,
"mean_token_accuracy": 0.19626958966255187,
"num_tokens": 65782728.0,
"step": 37920
},
{
"entropy": 5.3929366111755375,
"epoch": 2.950709978603385,
"grad_norm": 1.1171875,
"learning_rate": 0.0004131527315493989,
"loss": 4.9535,
"mean_token_accuracy": 0.20005957931280136,
"num_tokens": 65791460.0,
"step": 37925
},
{
"entropy": 5.44710898399353,
"epoch": 2.951099007975102,
"grad_norm": 1.15625,
"learning_rate": 0.00041313085468278873,
"loss": 4.9582,
"mean_token_accuracy": 0.20158697068691253,
"num_tokens": 65799760.0,
"step": 37930
},
{
"entropy": 5.404420804977417,
"epoch": 2.9514880373468197,
"grad_norm": 1.125,
"learning_rate": 0.0004131089757202627,
"loss": 5.0317,
"mean_token_accuracy": 0.1968708500266075,
"num_tokens": 65808675.0,
"step": 37935
},
{
"entropy": 5.416034698486328,
"epoch": 2.951877066718537,
"grad_norm": 1.140625,
"learning_rate": 0.00041308709466215276,
"loss": 5.0126,
"mean_token_accuracy": 0.20078667551279067,
"num_tokens": 65817372.0,
"step": 37940
},
{
"entropy": 5.316894245147705,
"epoch": 2.9522660960902547,
"grad_norm": 1.1328125,
"learning_rate": 0.000413065211508791,
"loss": 4.9847,
"mean_token_accuracy": 0.19923557788133622,
"num_tokens": 65825899.0,
"step": 37945
},
{
"entropy": 5.343360328674317,
"epoch": 2.9526551254619724,
"grad_norm": 1.1640625,
"learning_rate": 0.00041304332626050937,
"loss": 4.9151,
"mean_token_accuracy": 0.20738191455602645,
"num_tokens": 65834357.0,
"step": 37950
},
{
"entropy": 5.305930137634277,
"epoch": 2.95304415483369,
"grad_norm": 1.1484375,
"learning_rate": 0.00041302143891764,
"loss": 4.8562,
"mean_token_accuracy": 0.21408461332321166,
"num_tokens": 65842869.0,
"step": 37955
},
{
"entropy": 5.280531549453736,
"epoch": 2.9534331842054073,
"grad_norm": 1.1171875,
"learning_rate": 0.000412999549480515,
"loss": 4.8317,
"mean_token_accuracy": 0.20469579249620437,
"num_tokens": 65851378.0,
"step": 37960
},
{
"entropy": 5.349099063873291,
"epoch": 2.953822213577125,
"grad_norm": 1.109375,
"learning_rate": 0.0004129776579494665,
"loss": 4.884,
"mean_token_accuracy": 0.20679627358913422,
"num_tokens": 65860209.0,
"step": 37965
},
{
"entropy": 5.337625741958618,
"epoch": 2.9542112429488427,
"grad_norm": 1.2265625,
"learning_rate": 0.0004129557643248265,
"loss": 5.022,
"mean_token_accuracy": 0.19709988832473754,
"num_tokens": 65868313.0,
"step": 37970
},
{
"entropy": 5.340727758407593,
"epoch": 2.95460027232056,
"grad_norm": 1.421875,
"learning_rate": 0.0004129338686069276,
"loss": 4.8683,
"mean_token_accuracy": 0.20918378680944444,
"num_tokens": 65876049.0,
"step": 37975
},
{
"entropy": 5.402218866348266,
"epoch": 2.9549893016922777,
"grad_norm": 1.1953125,
"learning_rate": 0.0004129119707961016,
"loss": 4.987,
"mean_token_accuracy": 0.20075734853744506,
"num_tokens": 65884042.0,
"step": 37980
},
{
"entropy": 5.355855417251587,
"epoch": 2.9553783310639954,
"grad_norm": 1.1484375,
"learning_rate": 0.000412890070892681,
"loss": 4.9824,
"mean_token_accuracy": 0.2013458639383316,
"num_tokens": 65892303.0,
"step": 37985
},
{
"entropy": 5.362926292419433,
"epoch": 2.955767360435713,
"grad_norm": 1.1640625,
"learning_rate": 0.000412868168896998,
"loss": 4.9776,
"mean_token_accuracy": 0.1947074294090271,
"num_tokens": 65900515.0,
"step": 37990
},
{
"entropy": 5.338269901275635,
"epoch": 2.9561563898074303,
"grad_norm": 1.15625,
"learning_rate": 0.0004128462648093851,
"loss": 4.9371,
"mean_token_accuracy": 0.19888475090265273,
"num_tokens": 65908609.0,
"step": 37995
},
{
"entropy": 5.41190185546875,
"epoch": 2.956545419179148,
"grad_norm": 1.2109375,
"learning_rate": 0.0004128243586301745,
"loss": 4.9035,
"mean_token_accuracy": 0.20389135032892228,
"num_tokens": 65917803.0,
"step": 38000
},
{
"entropy": 5.358080530166626,
"epoch": 2.9569344485508657,
"grad_norm": 1.1171875,
"learning_rate": 0.0004128024503596986,
"loss": 4.8813,
"mean_token_accuracy": 0.2061939135193825,
"num_tokens": 65926269.0,
"step": 38005
},
{
"entropy": 5.307503604888916,
"epoch": 2.957323477922583,
"grad_norm": 1.1484375,
"learning_rate": 0.00041278053999828986,
"loss": 4.8808,
"mean_token_accuracy": 0.2057558298110962,
"num_tokens": 65934826.0,
"step": 38010
},
{
"entropy": 5.376512241363526,
"epoch": 2.9577125072943007,
"grad_norm": 1.140625,
"learning_rate": 0.0004127586275462806,
"loss": 4.95,
"mean_token_accuracy": 0.2016778513789177,
"num_tokens": 65943609.0,
"step": 38015
},
{
"entropy": 5.25891432762146,
"epoch": 2.9581015366660184,
"grad_norm": 1.078125,
"learning_rate": 0.00041273671300400363,
"loss": 4.8412,
"mean_token_accuracy": 0.2051338016986847,
"num_tokens": 65952244.0,
"step": 38020
},
{
"entropy": 5.2514149188995365,
"epoch": 2.958490566037736,
"grad_norm": 1.0703125,
"learning_rate": 0.00041271479637179116,
"loss": 4.8831,
"mean_token_accuracy": 0.20609053820371628,
"num_tokens": 65960915.0,
"step": 38025
},
{
"entropy": 5.314189434051514,
"epoch": 2.9588795954094533,
"grad_norm": 1.0625,
"learning_rate": 0.0004126928776499759,
"loss": 4.8658,
"mean_token_accuracy": 0.20735610723495485,
"num_tokens": 65969375.0,
"step": 38030
},
{
"entropy": 5.409398126602173,
"epoch": 2.959268624781171,
"grad_norm": 1.0859375,
"learning_rate": 0.0004126709568388903,
"loss": 4.9383,
"mean_token_accuracy": 0.205841127038002,
"num_tokens": 65978724.0,
"step": 38035
},
{
"entropy": 5.397347354888916,
"epoch": 2.9596576541528883,
"grad_norm": 1.171875,
"learning_rate": 0.0004126490339388672,
"loss": 5.0035,
"mean_token_accuracy": 0.19663366675376892,
"num_tokens": 65987255.0,
"step": 38040
},
{
"entropy": 5.419967365264893,
"epoch": 2.960046683524606,
"grad_norm": 1.109375,
"learning_rate": 0.000412627108950239,
"loss": 5.078,
"mean_token_accuracy": 0.19764647036790847,
"num_tokens": 65996193.0,
"step": 38045
},
{
"entropy": 5.442963314056397,
"epoch": 2.9604357128963237,
"grad_norm": 1.0234375,
"learning_rate": 0.0004126051818733385,
"loss": 5.0503,
"mean_token_accuracy": 0.2008456513285637,
"num_tokens": 66005081.0,
"step": 38050
},
{
"entropy": 5.405065870285034,
"epoch": 2.9608247422680414,
"grad_norm": 1.078125,
"learning_rate": 0.0004125832527084984,
"loss": 5.0239,
"mean_token_accuracy": 0.19613294154405594,
"num_tokens": 66014389.0,
"step": 38055
},
{
"entropy": 5.453430414199829,
"epoch": 2.961213771639759,
"grad_norm": 1.25,
"learning_rate": 0.00041256132145605143,
"loss": 5.0457,
"mean_token_accuracy": 0.19435992538928987,
"num_tokens": 66022486.0,
"step": 38060
},
{
"entropy": 5.383773756027222,
"epoch": 2.9616028010114763,
"grad_norm": 1.1171875,
"learning_rate": 0.0004125393881163304,
"loss": 4.9247,
"mean_token_accuracy": 0.1971763089299202,
"num_tokens": 66031058.0,
"step": 38065
},
{
"entropy": 5.332604932785034,
"epoch": 2.961991830383194,
"grad_norm": 1.1484375,
"learning_rate": 0.00041251745268966797,
"loss": 4.8475,
"mean_token_accuracy": 0.20473856180906297,
"num_tokens": 66038705.0,
"step": 38070
},
{
"entropy": 5.381705188751221,
"epoch": 2.9623808597549113,
"grad_norm": 1.1953125,
"learning_rate": 0.0004124955151763971,
"loss": 4.9335,
"mean_token_accuracy": 0.2037108600139618,
"num_tokens": 66047231.0,
"step": 38075
},
{
"entropy": 5.353786849975586,
"epoch": 2.962769889126629,
"grad_norm": 1.1328125,
"learning_rate": 0.0004124735755768506,
"loss": 4.9717,
"mean_token_accuracy": 0.19683888852596282,
"num_tokens": 66055536.0,
"step": 38080
},
{
"entropy": 5.394478464126587,
"epoch": 2.9631589184983467,
"grad_norm": 1.109375,
"learning_rate": 0.0004124516338913615,
"loss": 5.01,
"mean_token_accuracy": 0.19394494444131852,
"num_tokens": 66065215.0,
"step": 38085
},
{
"entropy": 5.425701761245728,
"epoch": 2.9635479478700644,
"grad_norm": 1.078125,
"learning_rate": 0.0004124296901202626,
"loss": 5.0112,
"mean_token_accuracy": 0.20239698886871338,
"num_tokens": 66074455.0,
"step": 38090
},
{
"entropy": 5.4518656730651855,
"epoch": 2.9639369772417816,
"grad_norm": 1.171875,
"learning_rate": 0.00041240774426388685,
"loss": 4.9569,
"mean_token_accuracy": 0.19702935963869095,
"num_tokens": 66082793.0,
"step": 38095
},
{
"entropy": 5.348243951797485,
"epoch": 2.9643260066134993,
"grad_norm": 1.1640625,
"learning_rate": 0.0004123857963225673,
"loss": 4.9146,
"mean_token_accuracy": 0.20479051619768143,
"num_tokens": 66091503.0,
"step": 38100
},
{
"entropy": 5.335634326934814,
"epoch": 2.964715035985217,
"grad_norm": 1.15625,
"learning_rate": 0.000412363846296637,
"loss": 4.9844,
"mean_token_accuracy": 0.20402684509754182,
"num_tokens": 66099210.0,
"step": 38105
},
{
"entropy": 5.286110877990723,
"epoch": 2.9651040653569343,
"grad_norm": 1.1484375,
"learning_rate": 0.000412341894186429,
"loss": 4.9444,
"mean_token_accuracy": 0.2032478556036949,
"num_tokens": 66107338.0,
"step": 38110
},
{
"entropy": 5.376686429977417,
"epoch": 2.965493094728652,
"grad_norm": 1.109375,
"learning_rate": 0.0004123199399922763,
"loss": 4.9761,
"mean_token_accuracy": 0.19714278727769852,
"num_tokens": 66115962.0,
"step": 38115
},
{
"entropy": 5.331450033187866,
"epoch": 2.9658821241003697,
"grad_norm": 1.2109375,
"learning_rate": 0.00041229798371451203,
"loss": 4.9085,
"mean_token_accuracy": 0.20169205069541932,
"num_tokens": 66123849.0,
"step": 38120
},
{
"entropy": 5.396948528289795,
"epoch": 2.9662711534720874,
"grad_norm": 1.1875,
"learning_rate": 0.0004122760253534695,
"loss": 4.9767,
"mean_token_accuracy": 0.19719480574131013,
"num_tokens": 66132791.0,
"step": 38125
},
{
"entropy": 5.430639410018921,
"epoch": 2.9666601828438046,
"grad_norm": 1.1015625,
"learning_rate": 0.0004122540649094817,
"loss": 5.0536,
"mean_token_accuracy": 0.20083200484514235,
"num_tokens": 66141434.0,
"step": 38130
},
{
"entropy": 5.3525067329406735,
"epoch": 2.9670492122155223,
"grad_norm": 1.09375,
"learning_rate": 0.00041223210238288196,
"loss": 4.9505,
"mean_token_accuracy": 0.2024303138256073,
"num_tokens": 66149941.0,
"step": 38135
},
{
"entropy": 5.437225866317749,
"epoch": 2.9674382415872396,
"grad_norm": 1.0546875,
"learning_rate": 0.0004122101377740035,
"loss": 4.9938,
"mean_token_accuracy": 0.19837080538272858,
"num_tokens": 66159411.0,
"step": 38140
},
{
"entropy": 5.393365716934204,
"epoch": 2.9678272709589573,
"grad_norm": 1.1640625,
"learning_rate": 0.0004121881710831796,
"loss": 4.9092,
"mean_token_accuracy": 0.207408344745636,
"num_tokens": 66168504.0,
"step": 38145
},
{
"entropy": 5.41329927444458,
"epoch": 2.968216300330675,
"grad_norm": 1.140625,
"learning_rate": 0.0004121662023107435,
"loss": 4.9735,
"mean_token_accuracy": 0.2063927620649338,
"num_tokens": 66176777.0,
"step": 38150
},
{
"entropy": 5.397536182403565,
"epoch": 2.9686053297023927,
"grad_norm": 1.1484375,
"learning_rate": 0.0004121442314570286,
"loss": 4.9131,
"mean_token_accuracy": 0.2021958574652672,
"num_tokens": 66185028.0,
"step": 38155
},
{
"entropy": 5.3881669521331785,
"epoch": 2.9689943590741104,
"grad_norm": 1.1953125,
"learning_rate": 0.00041212225852236834,
"loss": 4.9206,
"mean_token_accuracy": 0.20725196599960327,
"num_tokens": 66193139.0,
"step": 38160
},
{
"entropy": 5.389472341537475,
"epoch": 2.9693833884458276,
"grad_norm": 1.140625,
"learning_rate": 0.0004121002835070961,
"loss": 5.0061,
"mean_token_accuracy": 0.18938835263252257,
"num_tokens": 66202196.0,
"step": 38165
},
{
"entropy": 5.4182610511779785,
"epoch": 2.9697724178175453,
"grad_norm": 1.109375,
"learning_rate": 0.0004120783064115452,
"loss": 4.9524,
"mean_token_accuracy": 0.19817203134298325,
"num_tokens": 66209889.0,
"step": 38170
},
{
"entropy": 5.337880325317383,
"epoch": 2.9701614471892626,
"grad_norm": 1.109375,
"learning_rate": 0.0004120563272360492,
"loss": 4.9281,
"mean_token_accuracy": 0.19813189059495925,
"num_tokens": 66218889.0,
"step": 38175
},
{
"entropy": 5.3923955917358395,
"epoch": 2.9705504765609803,
"grad_norm": 1.234375,
"learning_rate": 0.0004120343459809416,
"loss": 5.0335,
"mean_token_accuracy": 0.19475739747285842,
"num_tokens": 66227293.0,
"step": 38180
},
{
"entropy": 5.445002031326294,
"epoch": 2.970939505932698,
"grad_norm": 1.21875,
"learning_rate": 0.0004120123626465559,
"loss": 4.9783,
"mean_token_accuracy": 0.20320293605327605,
"num_tokens": 66235322.0,
"step": 38185
},
{
"entropy": 5.399246501922607,
"epoch": 2.9713285353044157,
"grad_norm": 1.2109375,
"learning_rate": 0.00041199037723322566,
"loss": 5.0041,
"mean_token_accuracy": 0.19496151208877563,
"num_tokens": 66244776.0,
"step": 38190
},
{
"entropy": 5.326519918441773,
"epoch": 2.971717564676133,
"grad_norm": 1.109375,
"learning_rate": 0.00041196838974128446,
"loss": 4.9544,
"mean_token_accuracy": 0.1959936022758484,
"num_tokens": 66254058.0,
"step": 38195
},
{
"entropy": 5.412625455856324,
"epoch": 2.9721065940478506,
"grad_norm": 1.1171875,
"learning_rate": 0.000411946400171066,
"loss": 5.0433,
"mean_token_accuracy": 0.20058872550725937,
"num_tokens": 66262816.0,
"step": 38200
},
{
"entropy": 5.503356313705444,
"epoch": 2.9724956234195683,
"grad_norm": 1.09375,
"learning_rate": 0.00041192440852290385,
"loss": 5.0432,
"mean_token_accuracy": 0.19369950145483017,
"num_tokens": 66271808.0,
"step": 38205
},
{
"entropy": 5.402292728424072,
"epoch": 2.9728846527912856,
"grad_norm": 1.1328125,
"learning_rate": 0.0004119024147971318,
"loss": 4.9567,
"mean_token_accuracy": 0.1967776596546173,
"num_tokens": 66280737.0,
"step": 38210
},
{
"entropy": 5.293628168106079,
"epoch": 2.9732736821630033,
"grad_norm": 1.0703125,
"learning_rate": 0.00041188041899408345,
"loss": 4.9351,
"mean_token_accuracy": 0.20252836644649505,
"num_tokens": 66289970.0,
"step": 38215
},
{
"entropy": 5.435785531997681,
"epoch": 2.973662711534721,
"grad_norm": 1.171875,
"learning_rate": 0.0004118584211140926,
"loss": 5.0108,
"mean_token_accuracy": 0.19848366379737853,
"num_tokens": 66297917.0,
"step": 38220
},
{
"entropy": 5.375291395187378,
"epoch": 2.9740517409064386,
"grad_norm": 1.1328125,
"learning_rate": 0.00041183642115749316,
"loss": 4.9378,
"mean_token_accuracy": 0.20438310801982879,
"num_tokens": 66306094.0,
"step": 38225
},
{
"entropy": 5.35624680519104,
"epoch": 2.974440770278156,
"grad_norm": 1.0546875,
"learning_rate": 0.00041181441912461873,
"loss": 4.9166,
"mean_token_accuracy": 0.20022811889648437,
"num_tokens": 66315002.0,
"step": 38230
},
{
"entropy": 5.357925891876221,
"epoch": 2.9748297996498736,
"grad_norm": 1.1328125,
"learning_rate": 0.0004117924150158032,
"loss": 4.9201,
"mean_token_accuracy": 0.20063001066446304,
"num_tokens": 66322720.0,
"step": 38235
},
{
"entropy": 5.313100051879883,
"epoch": 2.9752188290215913,
"grad_norm": 1.0703125,
"learning_rate": 0.00041177040883138064,
"loss": 4.8727,
"mean_token_accuracy": 0.2103765204548836,
"num_tokens": 66331478.0,
"step": 38240
},
{
"entropy": 5.443608713150025,
"epoch": 2.9756078583933085,
"grad_norm": 1.171875,
"learning_rate": 0.00041174840057168474,
"loss": 5.0211,
"mean_token_accuracy": 0.1977916806936264,
"num_tokens": 66339683.0,
"step": 38245
},
{
"entropy": 5.409101486206055,
"epoch": 2.9759968877650262,
"grad_norm": 1.2109375,
"learning_rate": 0.0004117263902370495,
"loss": 4.9734,
"mean_token_accuracy": 0.19708535820245743,
"num_tokens": 66347944.0,
"step": 38250
},
{
"entropy": 5.412063980102539,
"epoch": 2.976385917136744,
"grad_norm": 1.1640625,
"learning_rate": 0.00041170437782780896,
"loss": 5.0619,
"mean_token_accuracy": 0.19884467422962188,
"num_tokens": 66356947.0,
"step": 38255
},
{
"entropy": 5.3431321144104,
"epoch": 2.9767749465084616,
"grad_norm": 1.046875,
"learning_rate": 0.000411682363344297,
"loss": 4.824,
"mean_token_accuracy": 0.20706185400485994,
"num_tokens": 66365843.0,
"step": 38260
},
{
"entropy": 5.442998838424683,
"epoch": 2.977163975880179,
"grad_norm": 1.2265625,
"learning_rate": 0.00041166034678684777,
"loss": 5.0765,
"mean_token_accuracy": 0.18775401413440704,
"num_tokens": 66375305.0,
"step": 38265
},
{
"entropy": 5.404040098190308,
"epoch": 2.9775530052518966,
"grad_norm": 1.1875,
"learning_rate": 0.0004116383281557953,
"loss": 4.9199,
"mean_token_accuracy": 0.20447848737239838,
"num_tokens": 66383758.0,
"step": 38270
},
{
"entropy": 5.302385520935059,
"epoch": 2.977942034623614,
"grad_norm": 1.09375,
"learning_rate": 0.00041161630745147374,
"loss": 4.9415,
"mean_token_accuracy": 0.2046975940465927,
"num_tokens": 66393538.0,
"step": 38275
},
{
"entropy": 5.415553760528565,
"epoch": 2.9783310639953315,
"grad_norm": 1.1484375,
"learning_rate": 0.0004115942846742171,
"loss": 4.9878,
"mean_token_accuracy": 0.19805275946855544,
"num_tokens": 66402395.0,
"step": 38280
},
{
"entropy": 5.40104455947876,
"epoch": 2.9787200933670492,
"grad_norm": 1.140625,
"learning_rate": 0.0004115722598243596,
"loss": 4.8964,
"mean_token_accuracy": 0.20020996183156967,
"num_tokens": 66410671.0,
"step": 38285
},
{
"entropy": 5.4165552139282225,
"epoch": 2.979109122738767,
"grad_norm": 1.171875,
"learning_rate": 0.00041155023290223537,
"loss": 4.9941,
"mean_token_accuracy": 0.20175594091415405,
"num_tokens": 66419370.0,
"step": 38290
},
{
"entropy": 5.286021900177002,
"epoch": 2.979498152110484,
"grad_norm": 1.1796875,
"learning_rate": 0.0004115282039081788,
"loss": 4.9292,
"mean_token_accuracy": 0.20300638526678086,
"num_tokens": 66427816.0,
"step": 38295
},
{
"entropy": 5.355514240264893,
"epoch": 2.979887181482202,
"grad_norm": 1.1328125,
"learning_rate": 0.00041150617284252405,
"loss": 4.9358,
"mean_token_accuracy": 0.2051052838563919,
"num_tokens": 66436371.0,
"step": 38300
},
{
"entropy": 5.462689590454102,
"epoch": 2.9802762108539196,
"grad_norm": 1.046875,
"learning_rate": 0.0004114841397056053,
"loss": 4.9975,
"mean_token_accuracy": 0.20318372845649718,
"num_tokens": 66445158.0,
"step": 38305
},
{
"entropy": 5.425387811660767,
"epoch": 2.980665240225637,
"grad_norm": 1.203125,
"learning_rate": 0.00041146210449775704,
"loss": 4.9648,
"mean_token_accuracy": 0.20529809594154358,
"num_tokens": 66454133.0,
"step": 38310
},
{
"entropy": 5.310114526748658,
"epoch": 2.9810542695973545,
"grad_norm": 1.1484375,
"learning_rate": 0.0004114400672193136,
"loss": 4.9761,
"mean_token_accuracy": 0.2012653633952141,
"num_tokens": 66462698.0,
"step": 38315
},
{
"entropy": 5.407210206985473,
"epoch": 2.9814432989690722,
"grad_norm": 1.140625,
"learning_rate": 0.00041141802787060923,
"loss": 4.9668,
"mean_token_accuracy": 0.20530688762664795,
"num_tokens": 66473145.0,
"step": 38320
},
{
"entropy": 5.44717116355896,
"epoch": 2.98183232834079,
"grad_norm": 1.09375,
"learning_rate": 0.0004113959864519784,
"loss": 4.9614,
"mean_token_accuracy": 0.198038512468338,
"num_tokens": 66482481.0,
"step": 38325
},
{
"entropy": 5.354867601394654,
"epoch": 2.982221357712507,
"grad_norm": 1.109375,
"learning_rate": 0.0004113739429637556,
"loss": 4.9438,
"mean_token_accuracy": 0.2153770998120308,
"num_tokens": 66491338.0,
"step": 38330
},
{
"entropy": 5.362190389633179,
"epoch": 2.982610387084225,
"grad_norm": 1.09375,
"learning_rate": 0.0004113518974062753,
"loss": 5.0429,
"mean_token_accuracy": 0.20234884172677994,
"num_tokens": 66500517.0,
"step": 38335
},
{
"entropy": 5.408883190155029,
"epoch": 2.9829994164559426,
"grad_norm": 1.109375,
"learning_rate": 0.000411329849779872,
"loss": 4.9202,
"mean_token_accuracy": 0.2062375381588936,
"num_tokens": 66509431.0,
"step": 38340
},
{
"entropy": 5.375468778610229,
"epoch": 2.98338844582766,
"grad_norm": 1.1640625,
"learning_rate": 0.00041130780008488015,
"loss": 4.9422,
"mean_token_accuracy": 0.20858137905597687,
"num_tokens": 66518111.0,
"step": 38345
},
{
"entropy": 5.3632570743560795,
"epoch": 2.9837774751993775,
"grad_norm": 1.1640625,
"learning_rate": 0.0004112857483216344,
"loss": 4.8964,
"mean_token_accuracy": 0.20067645013332366,
"num_tokens": 66527325.0,
"step": 38350
},
{
"entropy": 5.371960306167603,
"epoch": 2.9841665045710952,
"grad_norm": 1.1015625,
"learning_rate": 0.00041126369449046935,
"loss": 4.9008,
"mean_token_accuracy": 0.20264987647533417,
"num_tokens": 66536542.0,
"step": 38355
},
{
"entropy": 5.415199422836304,
"epoch": 2.984555533942813,
"grad_norm": 1.1640625,
"learning_rate": 0.00041124163859171967,
"loss": 4.9534,
"mean_token_accuracy": 0.1968763843178749,
"num_tokens": 66544724.0,
"step": 38360
},
{
"entropy": 5.409219217300415,
"epoch": 2.98494456331453,
"grad_norm": 1.2265625,
"learning_rate": 0.0004112195806257199,
"loss": 5.0354,
"mean_token_accuracy": 0.19687448740005492,
"num_tokens": 66553679.0,
"step": 38365
},
{
"entropy": 5.307811307907104,
"epoch": 2.985333592686248,
"grad_norm": 1.15625,
"learning_rate": 0.0004111975205928049,
"loss": 4.8851,
"mean_token_accuracy": 0.19986024498939514,
"num_tokens": 66562593.0,
"step": 38370
},
{
"entropy": 5.3876689910888675,
"epoch": 2.985722622057965,
"grad_norm": 1.171875,
"learning_rate": 0.00041117545849330924,
"loss": 4.9198,
"mean_token_accuracy": 0.20852190405130386,
"num_tokens": 66570947.0,
"step": 38375
},
{
"entropy": 5.332684803009033,
"epoch": 2.986111651429683,
"grad_norm": 1.0625,
"learning_rate": 0.00041115339432756776,
"loss": 4.8324,
"mean_token_accuracy": 0.21178413182497025,
"num_tokens": 66579733.0,
"step": 38380
},
{
"entropy": 5.362506961822509,
"epoch": 2.9865006808014005,
"grad_norm": 1.078125,
"learning_rate": 0.0004111313280959152,
"loss": 4.9372,
"mean_token_accuracy": 0.2013031467795372,
"num_tokens": 66589252.0,
"step": 38385
},
{
"entropy": 5.343757629394531,
"epoch": 2.986889710173118,
"grad_norm": 1.1015625,
"learning_rate": 0.00041110925979868647,
"loss": 4.9159,
"mean_token_accuracy": 0.21294088661670685,
"num_tokens": 66597817.0,
"step": 38390
},
{
"entropy": 5.33729887008667,
"epoch": 2.9872787395448355,
"grad_norm": 1.1953125,
"learning_rate": 0.0004110871894362163,
"loss": 4.9048,
"mean_token_accuracy": 0.2080773890018463,
"num_tokens": 66606154.0,
"step": 38395
},
{
"entropy": 5.325871849060059,
"epoch": 2.987667768916553,
"grad_norm": 1.1171875,
"learning_rate": 0.00041106511700883975,
"loss": 4.9285,
"mean_token_accuracy": 0.20890228152275087,
"num_tokens": 66614799.0,
"step": 38400
},
{
"entropy": 5.373120403289795,
"epoch": 2.988056798288271,
"grad_norm": 1.2109375,
"learning_rate": 0.00041104304251689147,
"loss": 4.8988,
"mean_token_accuracy": 0.20577867329120636,
"num_tokens": 66623250.0,
"step": 38405
},
{
"entropy": 5.283082962036133,
"epoch": 2.988445827659988,
"grad_norm": 1.15625,
"learning_rate": 0.00041102096596070666,
"loss": 4.8262,
"mean_token_accuracy": 0.2111327514052391,
"num_tokens": 66631948.0,
"step": 38410
},
{
"entropy": 5.284381008148193,
"epoch": 2.988834857031706,
"grad_norm": 1.0625,
"learning_rate": 0.00041099888734062013,
"loss": 4.8849,
"mean_token_accuracy": 0.2039794385433197,
"num_tokens": 66639864.0,
"step": 38415
},
{
"entropy": 5.356776189804077,
"epoch": 2.9892238864034235,
"grad_norm": 1.2265625,
"learning_rate": 0.000410976806656967,
"loss": 4.898,
"mean_token_accuracy": 0.20133571326732635,
"num_tokens": 66647758.0,
"step": 38420
},
{
"entropy": 5.381281518936158,
"epoch": 2.989612915775141,
"grad_norm": 1.21875,
"learning_rate": 0.0004109547239100822,
"loss": 4.9151,
"mean_token_accuracy": 0.21392828077077866,
"num_tokens": 66655490.0,
"step": 38425
},
{
"entropy": 5.259660339355468,
"epoch": 2.9900019451468585,
"grad_norm": 1.1875,
"learning_rate": 0.0004109326391003009,
"loss": 4.9055,
"mean_token_accuracy": 0.20990592539310454,
"num_tokens": 66664264.0,
"step": 38430
},
{
"entropy": 5.307831573486328,
"epoch": 2.990390974518576,
"grad_norm": 1.1796875,
"learning_rate": 0.00041091055222795814,
"loss": 4.8568,
"mean_token_accuracy": 0.20090347528457642,
"num_tokens": 66672595.0,
"step": 38435
},
{
"entropy": 5.40856671333313,
"epoch": 2.990780003890294,
"grad_norm": 1.1484375,
"learning_rate": 0.0004108884632933891,
"loss": 4.9445,
"mean_token_accuracy": 0.20128121823072434,
"num_tokens": 66680494.0,
"step": 38440
},
{
"entropy": 5.442004251480102,
"epoch": 2.991169033262011,
"grad_norm": 1.0859375,
"learning_rate": 0.00041086637229692893,
"loss": 5.0357,
"mean_token_accuracy": 0.19295066148042678,
"num_tokens": 66689462.0,
"step": 38445
},
{
"entropy": 5.375440645217895,
"epoch": 2.991558062633729,
"grad_norm": 1.1953125,
"learning_rate": 0.00041084427923891275,
"loss": 4.9332,
"mean_token_accuracy": 0.20488304197788237,
"num_tokens": 66697123.0,
"step": 38450
},
{
"entropy": 5.392136430740356,
"epoch": 2.9919470920054465,
"grad_norm": 1.1171875,
"learning_rate": 0.00041082218411967586,
"loss": 5.0514,
"mean_token_accuracy": 0.18936477452516556,
"num_tokens": 66705889.0,
"step": 38455
},
{
"entropy": 5.393692541122436,
"epoch": 2.992336121377164,
"grad_norm": 1.1796875,
"learning_rate": 0.00041080008693955355,
"loss": 4.9468,
"mean_token_accuracy": 0.20885615646839142,
"num_tokens": 66713832.0,
"step": 38460
},
{
"entropy": 5.390092611312866,
"epoch": 2.9927251507488815,
"grad_norm": 1.171875,
"learning_rate": 0.0004107779876988811,
"loss": 4.9191,
"mean_token_accuracy": 0.2093328654766083,
"num_tokens": 66722594.0,
"step": 38465
},
{
"entropy": 5.382728433609008,
"epoch": 2.993114180120599,
"grad_norm": 1.1328125,
"learning_rate": 0.00041075588639799375,
"loss": 4.8674,
"mean_token_accuracy": 0.20376219749450683,
"num_tokens": 66731125.0,
"step": 38470
},
{
"entropy": 5.348121261596679,
"epoch": 2.9935032094923164,
"grad_norm": 1.1328125,
"learning_rate": 0.0004107337830372269,
"loss": 5.071,
"mean_token_accuracy": 0.20052508413791656,
"num_tokens": 66739234.0,
"step": 38475
},
{
"entropy": 5.371851682662964,
"epoch": 2.993892238864034,
"grad_norm": 1.1796875,
"learning_rate": 0.000410711677616916,
"loss": 4.9533,
"mean_token_accuracy": 0.1963425725698471,
"num_tokens": 66747630.0,
"step": 38480
},
{
"entropy": 5.4359416484832765,
"epoch": 2.994281268235752,
"grad_norm": 1.2265625,
"learning_rate": 0.0004106895701373963,
"loss": 4.9676,
"mean_token_accuracy": 0.20338501483201982,
"num_tokens": 66755545.0,
"step": 38485
},
{
"entropy": 5.392308759689331,
"epoch": 2.9946702976074695,
"grad_norm": 1.1953125,
"learning_rate": 0.00041066746059900336,
"loss": 4.9607,
"mean_token_accuracy": 0.2045695349574089,
"num_tokens": 66764336.0,
"step": 38490
},
{
"entropy": 5.390614652633667,
"epoch": 2.995059326979187,
"grad_norm": 1.15625,
"learning_rate": 0.0004106453490020727,
"loss": 4.9691,
"mean_token_accuracy": 0.2070741131901741,
"num_tokens": 66773045.0,
"step": 38495
},
{
"entropy": 5.379932832717896,
"epoch": 2.9954483563509045,
"grad_norm": 1.1640625,
"learning_rate": 0.00041062323534693973,
"loss": 4.9012,
"mean_token_accuracy": 0.20910641998052598,
"num_tokens": 66781228.0,
"step": 38500
},
{
"entropy": 5.472181177139282,
"epoch": 2.995837385722622,
"grad_norm": 1.1640625,
"learning_rate": 0.00041060111963394004,
"loss": 5.0317,
"mean_token_accuracy": 0.20062291175127028,
"num_tokens": 66789829.0,
"step": 38505
},
{
"entropy": 5.3886044979095455,
"epoch": 2.9962264150943394,
"grad_norm": 1.140625,
"learning_rate": 0.00041057900186340917,
"loss": 4.8958,
"mean_token_accuracy": 0.20587784349918364,
"num_tokens": 66798023.0,
"step": 38510
},
{
"entropy": 5.3275487422943115,
"epoch": 2.996615444466057,
"grad_norm": 1.15625,
"learning_rate": 0.00041055688203568274,
"loss": 4.9125,
"mean_token_accuracy": 0.20619778484106063,
"num_tokens": 66806536.0,
"step": 38515
},
{
"entropy": 5.342609024047851,
"epoch": 2.997004473837775,
"grad_norm": 1.1328125,
"learning_rate": 0.0004105347601510964,
"loss": 4.8717,
"mean_token_accuracy": 0.20333769023418427,
"num_tokens": 66815698.0,
"step": 38520
},
{
"entropy": 5.370044946670532,
"epoch": 2.9973935032094925,
"grad_norm": 1.09375,
"learning_rate": 0.0004105126362099859,
"loss": 4.9176,
"mean_token_accuracy": 0.2072613313794136,
"num_tokens": 66824358.0,
"step": 38525
},
{
"entropy": 5.349159288406372,
"epoch": 2.9977825325812097,
"grad_norm": 1.1640625,
"learning_rate": 0.0004104905102126867,
"loss": 4.8933,
"mean_token_accuracy": 0.20782238245010376,
"num_tokens": 66832895.0,
"step": 38530
},
{
"entropy": 5.341231155395508,
"epoch": 2.9981715619529274,
"grad_norm": 1.1015625,
"learning_rate": 0.0004104683821595347,
"loss": 4.8651,
"mean_token_accuracy": 0.2037097305059433,
"num_tokens": 66842289.0,
"step": 38535
},
{
"entropy": 5.359250879287719,
"epoch": 2.998560591324645,
"grad_norm": 1.140625,
"learning_rate": 0.00041044625205086566,
"loss": 4.9173,
"mean_token_accuracy": 0.20928233563899995,
"num_tokens": 66850656.0,
"step": 38540
},
{
"entropy": 5.314585733413696,
"epoch": 2.9989496206963624,
"grad_norm": 1.1171875,
"learning_rate": 0.00041042411988701535,
"loss": 4.8274,
"mean_token_accuracy": 0.20613961815834045,
"num_tokens": 66859518.0,
"step": 38545
},
{
"entropy": 5.307775259017944,
"epoch": 2.99933865006808,
"grad_norm": 1.1015625,
"learning_rate": 0.00041040198566831944,
"loss": 4.9367,
"mean_token_accuracy": 0.20262207984924316,
"num_tokens": 66868431.0,
"step": 38550
},
{
"entropy": 5.3857897281646725,
"epoch": 2.999727679439798,
"grad_norm": 1.125,
"learning_rate": 0.0004103798493951141,
"loss": 4.9396,
"mean_token_accuracy": 0.20116014033555984,
"num_tokens": 66877255.0,
"step": 38555
},
{
"entropy": 5.409631835089789,
"epoch": 3.0000778058743434,
"grad_norm": 1.140625,
"learning_rate": 0.00041035771106773483,
"loss": 4.8708,
"mean_token_accuracy": 0.20738539761967129,
"num_tokens": 66884881.0,
"step": 38560
},
{
"entropy": 5.371629858016968,
"epoch": 3.000466835246061,
"grad_norm": 1.1328125,
"learning_rate": 0.0004103355706865179,
"loss": 4.8855,
"mean_token_accuracy": 0.2131451591849327,
"num_tokens": 66893369.0,
"step": 38565
},
{
"entropy": 5.376195287704467,
"epoch": 3.0008558646177788,
"grad_norm": 1.1328125,
"learning_rate": 0.000410313428251799,
"loss": 4.8508,
"mean_token_accuracy": 0.20677294284105302,
"num_tokens": 66900994.0,
"step": 38570
},
{
"entropy": 5.313718271255493,
"epoch": 3.001244893989496,
"grad_norm": 1.09375,
"learning_rate": 0.00041029128376391424,
"loss": 4.8936,
"mean_token_accuracy": 0.2079121947288513,
"num_tokens": 66909906.0,
"step": 38575
},
{
"entropy": 5.351029586791992,
"epoch": 3.0016339233612137,
"grad_norm": 1.1484375,
"learning_rate": 0.00041026913722319954,
"loss": 4.8539,
"mean_token_accuracy": 0.2122810199856758,
"num_tokens": 66918712.0,
"step": 38580
},
{
"entropy": 5.435798263549804,
"epoch": 3.0020229527329314,
"grad_norm": 1.1015625,
"learning_rate": 0.000410246988629991,
"loss": 4.8635,
"mean_token_accuracy": 0.20826564133167266,
"num_tokens": 66927462.0,
"step": 38585
},
{
"entropy": 5.297920799255371,
"epoch": 3.002411982104649,
"grad_norm": 1.171875,
"learning_rate": 0.00041022483798462466,
"loss": 4.7872,
"mean_token_accuracy": 0.21642928719520568,
"num_tokens": 66935920.0,
"step": 38590
},
{
"entropy": 5.3110490322113035,
"epoch": 3.0028010114763664,
"grad_norm": 1.140625,
"learning_rate": 0.0004102026852874367,
"loss": 4.8484,
"mean_token_accuracy": 0.21492189168930054,
"num_tokens": 66944595.0,
"step": 38595
},
{
"entropy": 5.423013353347779,
"epoch": 3.003190040848084,
"grad_norm": 1.078125,
"learning_rate": 0.00041018053053876316,
"loss": 5.0451,
"mean_token_accuracy": 0.20462241023778915,
"num_tokens": 66954025.0,
"step": 38600
},
{
"entropy": 5.407014846801758,
"epoch": 3.0035790702198017,
"grad_norm": 1.140625,
"learning_rate": 0.0004101583737389402,
"loss": 4.8387,
"mean_token_accuracy": 0.21155964732170104,
"num_tokens": 66963143.0,
"step": 38605
},
{
"entropy": 5.403164339065552,
"epoch": 3.003968099591519,
"grad_norm": 1.109375,
"learning_rate": 0.00041013621488830406,
"loss": 4.9473,
"mean_token_accuracy": 0.20335627645254134,
"num_tokens": 66972619.0,
"step": 38610
},
{
"entropy": 5.290521144866943,
"epoch": 3.0043571289632367,
"grad_norm": 1.09375,
"learning_rate": 0.00041011405398719096,
"loss": 4.8025,
"mean_token_accuracy": 0.21760838627815246,
"num_tokens": 66980749.0,
"step": 38615
},
{
"entropy": 5.376144075393677,
"epoch": 3.0047461583349544,
"grad_norm": 1.1328125,
"learning_rate": 0.00041009189103593716,
"loss": 4.864,
"mean_token_accuracy": 0.20319731235504152,
"num_tokens": 66989656.0,
"step": 38620
},
{
"entropy": 5.35672698020935,
"epoch": 3.0051351877066717,
"grad_norm": 1.109375,
"learning_rate": 0.0004100697260348789,
"loss": 4.846,
"mean_token_accuracy": 0.21243641525506973,
"num_tokens": 66998308.0,
"step": 38625
},
{
"entropy": 5.387416028976441,
"epoch": 3.0055242170783893,
"grad_norm": 1.0390625,
"learning_rate": 0.00041004755898435254,
"loss": 4.9042,
"mean_token_accuracy": 0.2012210488319397,
"num_tokens": 67007596.0,
"step": 38630
},
{
"entropy": 5.294346761703491,
"epoch": 3.005913246450107,
"grad_norm": 1.09375,
"learning_rate": 0.0004100253898846945,
"loss": 4.784,
"mean_token_accuracy": 0.21138084381818772,
"num_tokens": 67016137.0,
"step": 38635
},
{
"entropy": 5.410755395889282,
"epoch": 3.0063022758218247,
"grad_norm": 1.1328125,
"learning_rate": 0.000410003218736241,
"loss": 4.9862,
"mean_token_accuracy": 0.2084052622318268,
"num_tokens": 67024839.0,
"step": 38640
},
{
"entropy": 5.389471626281738,
"epoch": 3.006691305193542,
"grad_norm": 1.1640625,
"learning_rate": 0.00040998104553932856,
"loss": 4.8629,
"mean_token_accuracy": 0.20004348903894426,
"num_tokens": 67033572.0,
"step": 38645
},
{
"entropy": 5.4100316047668455,
"epoch": 3.0070803345652597,
"grad_norm": 1.1640625,
"learning_rate": 0.0004099588702942936,
"loss": 4.8707,
"mean_token_accuracy": 0.2084184169769287,
"num_tokens": 67042355.0,
"step": 38650
},
{
"entropy": 5.283771944046021,
"epoch": 3.0074693639369774,
"grad_norm": 1.1328125,
"learning_rate": 0.00040993669300147257,
"loss": 4.7895,
"mean_token_accuracy": 0.20945192873477936,
"num_tokens": 67050418.0,
"step": 38655
},
{
"entropy": 5.32660059928894,
"epoch": 3.0078583933086946,
"grad_norm": 1.0859375,
"learning_rate": 0.00040991451366120205,
"loss": 4.9519,
"mean_token_accuracy": 0.19270940870046616,
"num_tokens": 67059846.0,
"step": 38660
},
{
"entropy": 5.440450239181518,
"epoch": 3.0082474226804123,
"grad_norm": 1.109375,
"learning_rate": 0.0004098923322738185,
"loss": 4.9236,
"mean_token_accuracy": 0.20375099331140517,
"num_tokens": 67068680.0,
"step": 38665
},
{
"entropy": 5.328177642822266,
"epoch": 3.00863645205213,
"grad_norm": 1.0078125,
"learning_rate": 0.00040987014883965843,
"loss": 4.8411,
"mean_token_accuracy": 0.20709384530782698,
"num_tokens": 67077607.0,
"step": 38670
},
{
"entropy": 5.321854066848755,
"epoch": 3.0090254814238473,
"grad_norm": 1.0859375,
"learning_rate": 0.00040984796335905867,
"loss": 4.8799,
"mean_token_accuracy": 0.2080298349261284,
"num_tokens": 67086553.0,
"step": 38675
},
{
"entropy": 5.428297424316407,
"epoch": 3.009414510795565,
"grad_norm": 1.1328125,
"learning_rate": 0.0004098257758323556,
"loss": 4.9146,
"mean_token_accuracy": 0.2056966692209244,
"num_tokens": 67095543.0,
"step": 38680
},
{
"entropy": 5.3603187084198,
"epoch": 3.0098035401672827,
"grad_norm": 1.1328125,
"learning_rate": 0.0004098035862598859,
"loss": 4.9633,
"mean_token_accuracy": 0.20198530703783035,
"num_tokens": 67103831.0,
"step": 38685
},
{
"entropy": 5.353617715835571,
"epoch": 3.0101925695390004,
"grad_norm": 1.1171875,
"learning_rate": 0.0004097813946419865,
"loss": 4.8554,
"mean_token_accuracy": 0.20775722563266755,
"num_tokens": 67112289.0,
"step": 38690
},
{
"entropy": 5.337837553024292,
"epoch": 3.0105815989107176,
"grad_norm": 1.0859375,
"learning_rate": 0.0004097592009789939,
"loss": 4.9124,
"mean_token_accuracy": 0.21032709181308745,
"num_tokens": 67120376.0,
"step": 38695
},
{
"entropy": 5.409401607513428,
"epoch": 3.0109706282824353,
"grad_norm": 1.1328125,
"learning_rate": 0.00040973700527124494,
"loss": 4.955,
"mean_token_accuracy": 0.201490318775177,
"num_tokens": 67128412.0,
"step": 38700
},
{
"entropy": 5.301716327667236,
"epoch": 3.011359657654153,
"grad_norm": 1.1640625,
"learning_rate": 0.00040971480751907633,
"loss": 4.7568,
"mean_token_accuracy": 0.20584432929754257,
"num_tokens": 67136212.0,
"step": 38705
},
{
"entropy": 5.325664615631103,
"epoch": 3.0117486870258703,
"grad_norm": 1.171875,
"learning_rate": 0.00040969260772282494,
"loss": 4.9437,
"mean_token_accuracy": 0.2031140595674515,
"num_tokens": 67145206.0,
"step": 38710
},
{
"entropy": 5.30687198638916,
"epoch": 3.012137716397588,
"grad_norm": 1.0859375,
"learning_rate": 0.0004096704058828277,
"loss": 4.824,
"mean_token_accuracy": 0.20737795233726503,
"num_tokens": 67153760.0,
"step": 38715
},
{
"entropy": 5.407768869400025,
"epoch": 3.0125267457693057,
"grad_norm": 1.1484375,
"learning_rate": 0.00040964820199942135,
"loss": 4.9231,
"mean_token_accuracy": 0.2054056704044342,
"num_tokens": 67162574.0,
"step": 38720
},
{
"entropy": 5.396566534042359,
"epoch": 3.012915775141023,
"grad_norm": 1.1171875,
"learning_rate": 0.0004096259960729428,
"loss": 4.8972,
"mean_token_accuracy": 0.20496667176485062,
"num_tokens": 67171329.0,
"step": 38725
},
{
"entropy": 5.382814598083496,
"epoch": 3.0133048045127406,
"grad_norm": 1.1171875,
"learning_rate": 0.00040960378810372906,
"loss": 4.8394,
"mean_token_accuracy": 0.20607417821884155,
"num_tokens": 67180243.0,
"step": 38730
},
{
"entropy": 5.228844404220581,
"epoch": 3.0136938338844583,
"grad_norm": 1.171875,
"learning_rate": 0.0004095815780921171,
"loss": 4.7274,
"mean_token_accuracy": 0.21841067224740982,
"num_tokens": 67189610.0,
"step": 38735
},
{
"entropy": 5.362099885940552,
"epoch": 3.014082863256176,
"grad_norm": 1.1484375,
"learning_rate": 0.0004095593660384439,
"loss": 4.9426,
"mean_token_accuracy": 0.1998063862323761,
"num_tokens": 67199084.0,
"step": 38740
},
{
"entropy": 5.3749449253082275,
"epoch": 3.0144718926278933,
"grad_norm": 1.09375,
"learning_rate": 0.0004095371519430465,
"loss": 4.8633,
"mean_token_accuracy": 0.20558678209781647,
"num_tokens": 67207705.0,
"step": 38745
},
{
"entropy": 5.399401569366455,
"epoch": 3.014860921999611,
"grad_norm": 1.078125,
"learning_rate": 0.00040951493580626195,
"loss": 4.8791,
"mean_token_accuracy": 0.20847342014312745,
"num_tokens": 67215576.0,
"step": 38750
},
{
"entropy": 5.314389848709107,
"epoch": 3.0152499513713287,
"grad_norm": 1.2265625,
"learning_rate": 0.0004094927176284273,
"loss": 4.793,
"mean_token_accuracy": 0.20512417405843736,
"num_tokens": 67223700.0,
"step": 38755
},
{
"entropy": 5.322641468048095,
"epoch": 3.015638980743046,
"grad_norm": 1.15625,
"learning_rate": 0.00040947049740987977,
"loss": 4.8718,
"mean_token_accuracy": 0.21142702400684357,
"num_tokens": 67231878.0,
"step": 38760
},
{
"entropy": 5.352596378326416,
"epoch": 3.0160280101147636,
"grad_norm": 1.203125,
"learning_rate": 0.0004094482751509565,
"loss": 4.8324,
"mean_token_accuracy": 0.206750850379467,
"num_tokens": 67240174.0,
"step": 38765
},
{
"entropy": 5.382400608062744,
"epoch": 3.0164170394864813,
"grad_norm": 1.171875,
"learning_rate": 0.0004094260508519947,
"loss": 4.9231,
"mean_token_accuracy": 0.20973684042692184,
"num_tokens": 67248617.0,
"step": 38770
},
{
"entropy": 5.461048030853272,
"epoch": 3.0168060688581986,
"grad_norm": 1.1875,
"learning_rate": 0.00040940382451333144,
"loss": 5.0122,
"mean_token_accuracy": 0.1997057780623436,
"num_tokens": 67258581.0,
"step": 38775
},
{
"entropy": 5.511263465881347,
"epoch": 3.0171950982299163,
"grad_norm": 1.140625,
"learning_rate": 0.00040938159613530405,
"loss": 4.9448,
"mean_token_accuracy": 0.21168652027845383,
"num_tokens": 67267854.0,
"step": 38780
},
{
"entropy": 5.391778755187988,
"epoch": 3.017584127601634,
"grad_norm": 1.1171875,
"learning_rate": 0.0004093593657182499,
"loss": 4.8626,
"mean_token_accuracy": 0.20464949011802674,
"num_tokens": 67277391.0,
"step": 38785
},
{
"entropy": 5.327175617218018,
"epoch": 3.0179731569733517,
"grad_norm": 1.15625,
"learning_rate": 0.0004093371332625062,
"loss": 4.8645,
"mean_token_accuracy": 0.2114735335111618,
"num_tokens": 67285460.0,
"step": 38790
},
{
"entropy": 5.383656120300293,
"epoch": 3.018362186345069,
"grad_norm": 1.1640625,
"learning_rate": 0.0004093148987684103,
"loss": 4.8854,
"mean_token_accuracy": 0.20634294301271439,
"num_tokens": 67294023.0,
"step": 38795
},
{
"entropy": 5.322823572158813,
"epoch": 3.0187512157167866,
"grad_norm": 1.15625,
"learning_rate": 0.00040929266223629966,
"loss": 4.7939,
"mean_token_accuracy": 0.207029826939106,
"num_tokens": 67302053.0,
"step": 38800
},
{
"entropy": 5.327833557128907,
"epoch": 3.0191402450885043,
"grad_norm": 1.1484375,
"learning_rate": 0.00040927042366651164,
"loss": 4.9682,
"mean_token_accuracy": 0.20061895996332169,
"num_tokens": 67310478.0,
"step": 38805
},
{
"entropy": 5.335454654693604,
"epoch": 3.0195292744602216,
"grad_norm": 1.1484375,
"learning_rate": 0.00040924818305938354,
"loss": 4.8291,
"mean_token_accuracy": 0.2098989099264145,
"num_tokens": 67318096.0,
"step": 38810
},
{
"entropy": 5.369532489776612,
"epoch": 3.0199183038319393,
"grad_norm": 1.140625,
"learning_rate": 0.00040922594041525303,
"loss": 4.9016,
"mean_token_accuracy": 0.20274136066436768,
"num_tokens": 67326760.0,
"step": 38815
},
{
"entropy": 5.305325222015381,
"epoch": 3.020307333203657,
"grad_norm": 1.0859375,
"learning_rate": 0.0004092036957344574,
"loss": 4.8269,
"mean_token_accuracy": 0.20876094102859497,
"num_tokens": 67335982.0,
"step": 38820
},
{
"entropy": 5.309072589874267,
"epoch": 3.0206963625753747,
"grad_norm": 1.1953125,
"learning_rate": 0.00040918144901733443,
"loss": 4.8757,
"mean_token_accuracy": 0.20364058911800384,
"num_tokens": 67344666.0,
"step": 38825
},
{
"entropy": 5.375777769088745,
"epoch": 3.021085391947092,
"grad_norm": 1.1796875,
"learning_rate": 0.0004091592002642215,
"loss": 4.9244,
"mean_token_accuracy": 0.20489163994789122,
"num_tokens": 67352607.0,
"step": 38830
},
{
"entropy": 5.363179779052734,
"epoch": 3.0214744213188096,
"grad_norm": 1.15625,
"learning_rate": 0.0004091369494754562,
"loss": 4.9179,
"mean_token_accuracy": 0.20898292660713197,
"num_tokens": 67361097.0,
"step": 38835
},
{
"entropy": 5.274556970596313,
"epoch": 3.0218634506905273,
"grad_norm": 1.125,
"learning_rate": 0.0004091146966513763,
"loss": 4.854,
"mean_token_accuracy": 0.20321758091449738,
"num_tokens": 67370229.0,
"step": 38840
},
{
"entropy": 5.353457450866699,
"epoch": 3.0222524800622446,
"grad_norm": 1.109375,
"learning_rate": 0.00040909244179231926,
"loss": 4.8706,
"mean_token_accuracy": 0.20899474769830703,
"num_tokens": 67379226.0,
"step": 38845
},
{
"entropy": 5.338396167755127,
"epoch": 3.0226415094339623,
"grad_norm": 1.109375,
"learning_rate": 0.0004090701848986229,
"loss": 4.7967,
"mean_token_accuracy": 0.21891996562480925,
"num_tokens": 67388048.0,
"step": 38850
},
{
"entropy": 5.32727837562561,
"epoch": 3.02303053880568,
"grad_norm": 1.0625,
"learning_rate": 0.0004090479259706247,
"loss": 4.7231,
"mean_token_accuracy": 0.21628516763448716,
"num_tokens": 67396545.0,
"step": 38855
},
{
"entropy": 5.273797130584716,
"epoch": 3.023419568177397,
"grad_norm": 1.1328125,
"learning_rate": 0.0004090256650086628,
"loss": 4.8039,
"mean_token_accuracy": 0.2126876264810562,
"num_tokens": 67405128.0,
"step": 38860
},
{
"entropy": 5.316504001617432,
"epoch": 3.023808597549115,
"grad_norm": 1.109375,
"learning_rate": 0.00040900340201307475,
"loss": 4.9381,
"mean_token_accuracy": 0.20751468241214752,
"num_tokens": 67414231.0,
"step": 38865
},
{
"entropy": 5.322649526596069,
"epoch": 3.0241976269208326,
"grad_norm": 1.09375,
"learning_rate": 0.00040898113698419823,
"loss": 4.887,
"mean_token_accuracy": 0.2098349317908287,
"num_tokens": 67423023.0,
"step": 38870
},
{
"entropy": 5.375913333892822,
"epoch": 3.0245866562925503,
"grad_norm": 1.2734375,
"learning_rate": 0.0004089588699223713,
"loss": 4.9264,
"mean_token_accuracy": 0.1995796039700508,
"num_tokens": 67431377.0,
"step": 38875
},
{
"entropy": 5.411909675598144,
"epoch": 3.0249756856642676,
"grad_norm": 1.109375,
"learning_rate": 0.00040893660082793167,
"loss": 4.9533,
"mean_token_accuracy": 0.2059389293193817,
"num_tokens": 67439888.0,
"step": 38880
},
{
"entropy": 5.406026363372803,
"epoch": 3.0253647150359853,
"grad_norm": 1.1171875,
"learning_rate": 0.00040891432970121736,
"loss": 4.8977,
"mean_token_accuracy": 0.19846780896186828,
"num_tokens": 67448174.0,
"step": 38885
},
{
"entropy": 5.31670446395874,
"epoch": 3.025753744407703,
"grad_norm": 1.1953125,
"learning_rate": 0.00040889205654256615,
"loss": 4.9081,
"mean_token_accuracy": 0.19883451610803604,
"num_tokens": 67456562.0,
"step": 38890
},
{
"entropy": 5.3855993270874025,
"epoch": 3.02614277377942,
"grad_norm": 1.1953125,
"learning_rate": 0.00040886978135231625,
"loss": 4.9269,
"mean_token_accuracy": 0.20295477509498597,
"num_tokens": 67465518.0,
"step": 38895
},
{
"entropy": 5.3777679920196535,
"epoch": 3.026531803151138,
"grad_norm": 1.203125,
"learning_rate": 0.00040884750413080535,
"loss": 4.9046,
"mean_token_accuracy": 0.20385487675666808,
"num_tokens": 67474988.0,
"step": 38900
},
{
"entropy": 5.256654596328735,
"epoch": 3.0269208325228556,
"grad_norm": 1.1796875,
"learning_rate": 0.00040882522487837176,
"loss": 4.75,
"mean_token_accuracy": 0.21682214587926865,
"num_tokens": 67484097.0,
"step": 38905
},
{
"entropy": 5.3677184104919435,
"epoch": 3.027309861894573,
"grad_norm": 1.09375,
"learning_rate": 0.00040880294359535327,
"loss": 4.8304,
"mean_token_accuracy": 0.2044965907931328,
"num_tokens": 67493348.0,
"step": 38910
},
{
"entropy": 5.33874020576477,
"epoch": 3.0276988912662905,
"grad_norm": 1.171875,
"learning_rate": 0.00040878066028208804,
"loss": 4.8202,
"mean_token_accuracy": 0.21519086062908171,
"num_tokens": 67501586.0,
"step": 38915
},
{
"entropy": 5.407989645004273,
"epoch": 3.0280879206380082,
"grad_norm": 1.140625,
"learning_rate": 0.00040875837493891434,
"loss": 5.0045,
"mean_token_accuracy": 0.20518122017383575,
"num_tokens": 67510416.0,
"step": 38920
},
{
"entropy": 5.316352891921997,
"epoch": 3.028476950009726,
"grad_norm": 1.1328125,
"learning_rate": 0.0004087360875661701,
"loss": 4.7639,
"mean_token_accuracy": 0.21642113029956817,
"num_tokens": 67518974.0,
"step": 38925
},
{
"entropy": 5.265423536300659,
"epoch": 3.028865979381443,
"grad_norm": 1.1953125,
"learning_rate": 0.00040871379816419376,
"loss": 4.8767,
"mean_token_accuracy": 0.2039298117160797,
"num_tokens": 67528194.0,
"step": 38930
},
{
"entropy": 5.3963480472564695,
"epoch": 3.029255008753161,
"grad_norm": 1.171875,
"learning_rate": 0.0004086915067333232,
"loss": 4.9078,
"mean_token_accuracy": 0.2063104823231697,
"num_tokens": 67536884.0,
"step": 38935
},
{
"entropy": 5.389633321762085,
"epoch": 3.0296440381248786,
"grad_norm": 1.2109375,
"learning_rate": 0.0004086692132738968,
"loss": 4.8769,
"mean_token_accuracy": 0.2061626985669136,
"num_tokens": 67544969.0,
"step": 38940
},
{
"entropy": 5.465931177139282,
"epoch": 3.030033067496596,
"grad_norm": 1.0859375,
"learning_rate": 0.000408646917786253,
"loss": 5.08,
"mean_token_accuracy": 0.19114660024642943,
"num_tokens": 67555681.0,
"step": 38945
},
{
"entropy": 5.397300434112549,
"epoch": 3.0304220968683135,
"grad_norm": 1.140625,
"learning_rate": 0.0004086246202707298,
"loss": 4.8417,
"mean_token_accuracy": 0.21330460011959076,
"num_tokens": 67564346.0,
"step": 38950
},
{
"entropy": 5.381330490112305,
"epoch": 3.0308111262400312,
"grad_norm": 1.359375,
"learning_rate": 0.00040860232072766577,
"loss": 4.9359,
"mean_token_accuracy": 0.19992727488279344,
"num_tokens": 67573497.0,
"step": 38955
},
{
"entropy": 5.383692455291748,
"epoch": 3.0312001556117485,
"grad_norm": 1.15625,
"learning_rate": 0.0004085800191573991,
"loss": 4.8274,
"mean_token_accuracy": 0.21115343123674393,
"num_tokens": 67581842.0,
"step": 38960
},
{
"entropy": 5.409601068496704,
"epoch": 3.031589184983466,
"grad_norm": 1.234375,
"learning_rate": 0.0004085577155602683,
"loss": 4.9317,
"mean_token_accuracy": 0.20223153829574586,
"num_tokens": 67590763.0,
"step": 38965
},
{
"entropy": 5.359137105941772,
"epoch": 3.031978214355184,
"grad_norm": 1.203125,
"learning_rate": 0.00040853540993661175,
"loss": 4.9963,
"mean_token_accuracy": 0.19467896819114686,
"num_tokens": 67599232.0,
"step": 38970
},
{
"entropy": 5.378431367874145,
"epoch": 3.0323672437269016,
"grad_norm": 1.0625,
"learning_rate": 0.00040851310228676787,
"loss": 4.8766,
"mean_token_accuracy": 0.2102770909667015,
"num_tokens": 67608314.0,
"step": 38975
},
{
"entropy": 5.4215248107910154,
"epoch": 3.032756273098619,
"grad_norm": 1.1015625,
"learning_rate": 0.0004084907926110752,
"loss": 4.8031,
"mean_token_accuracy": 0.21465802788734437,
"num_tokens": 67616902.0,
"step": 38980
},
{
"entropy": 5.355353927612304,
"epoch": 3.0331453024703365,
"grad_norm": 1.1953125,
"learning_rate": 0.0004084684809098722,
"loss": 4.9015,
"mean_token_accuracy": 0.21188381910324097,
"num_tokens": 67625163.0,
"step": 38985
},
{
"entropy": 5.306963634490967,
"epoch": 3.0335343318420542,
"grad_norm": 1.171875,
"learning_rate": 0.00040844616718349743,
"loss": 4.8057,
"mean_token_accuracy": 0.21722989976406099,
"num_tokens": 67632997.0,
"step": 38990
},
{
"entropy": 5.377382278442383,
"epoch": 3.0339233612137715,
"grad_norm": 1.1484375,
"learning_rate": 0.00040842385143228946,
"loss": 4.8137,
"mean_token_accuracy": 0.21369080990552902,
"num_tokens": 67640813.0,
"step": 38995
},
{
"entropy": 5.320043516159058,
"epoch": 3.034312390585489,
"grad_norm": 1.09375,
"learning_rate": 0.00040840153365658693,
"loss": 4.8018,
"mean_token_accuracy": 0.22020691335201265,
"num_tokens": 67649701.0,
"step": 39000
},
{
"epoch": 3.034312390585489,
"eval_entropy": 5.114409923278104,
"eval_loss": 5.043065547943115,
"eval_mean_token_accuracy": 0.20751321915684123,
"eval_num_tokens": 67649701.0,
"eval_runtime": 28.6428,
"eval_samples_per_second": 1450.908,
"eval_steps_per_second": 181.372,
"step": 39000
}
],
"logging_steps": 5,
"max_steps": 128520,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.1840491159552e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}