Files
eus-latn-100mb-100mb_seed3407/checkpoint-24000/trainer_state.json
ModelHub XC 7a2c0e50cf 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/eus-latn-100mb-100mb_seed3407
Source: Original Platform
2026-07-30 02:23:21 +08:00

48123 lines
1.3 MiB

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.1193924408336278,
"eval_steps": 3000,
"global_step": 24000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.692046070098877,
"epoch": 0.0004415400918403391,
"grad_norm": 15.5625,
"learning_rate": 2e-06,
"loss": 10.7987,
"mean_token_accuracy": 0.0,
"num_tokens": 9390.0,
"step": 5
},
{
"entropy": 10.69192419052124,
"epoch": 0.0008830801836806782,
"grad_norm": 14.4375,
"learning_rate": 4.5e-06,
"loss": 10.7211,
"mean_token_accuracy": 0.0002551274374127388,
"num_tokens": 18671.0,
"step": 10
},
{
"entropy": 10.69034719467163,
"epoch": 0.0013246202755210173,
"grad_norm": 10.1875,
"learning_rate": 7e-06,
"loss": 10.4504,
"mean_token_accuracy": 0.04107050695456564,
"num_tokens": 27614.0,
"step": 15
},
{
"entropy": 10.65851650238037,
"epoch": 0.0017661603673613563,
"grad_norm": 6.09375,
"learning_rate": 9.5e-06,
"loss": 10.1437,
"mean_token_accuracy": 0.05260300412774086,
"num_tokens": 37850.0,
"step": 20
},
{
"entropy": 10.480317497253418,
"epoch": 0.0022077004592016957,
"grad_norm": 4.21875,
"learning_rate": 1.2e-05,
"loss": 9.7713,
"mean_token_accuracy": 0.06779314689338208,
"num_tokens": 47166.0,
"step": 25
},
{
"entropy": 10.35213108062744,
"epoch": 0.0026492405510420347,
"grad_norm": 2.921875,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.6925,
"mean_token_accuracy": 0.0573563989251852,
"num_tokens": 55500.0,
"step": 30
},
{
"entropy": 10.413340187072754,
"epoch": 0.0030907806428823736,
"grad_norm": 2.734375,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.676,
"mean_token_accuracy": 0.05297967046499252,
"num_tokens": 63851.0,
"step": 35
},
{
"entropy": 10.392519474029541,
"epoch": 0.0035323207347227126,
"grad_norm": 2.65625,
"learning_rate": 1.95e-05,
"loss": 9.5804,
"mean_token_accuracy": 0.06258798092603683,
"num_tokens": 73697.0,
"step": 40
},
{
"entropy": 10.351652717590332,
"epoch": 0.003973860826563052,
"grad_norm": 2.734375,
"learning_rate": 2.2e-05,
"loss": 9.5487,
"mean_token_accuracy": 0.06010213047266007,
"num_tokens": 83000.0,
"step": 45
},
{
"entropy": 10.341690158843994,
"epoch": 0.004415400918403391,
"grad_norm": 2.5,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5288,
"mean_token_accuracy": 0.06254246681928635,
"num_tokens": 92982.0,
"step": 50
},
{
"entropy": 10.24167251586914,
"epoch": 0.00485694101024373,
"grad_norm": 2.5625,
"learning_rate": 2.7e-05,
"loss": 9.4211,
"mean_token_accuracy": 0.06874397993087769,
"num_tokens": 101455.0,
"step": 55
},
{
"entropy": 10.19759111404419,
"epoch": 0.005298481102084069,
"grad_norm": 2.125,
"learning_rate": 2.95e-05,
"loss": 9.3764,
"mean_token_accuracy": 0.07629412487149238,
"num_tokens": 110782.0,
"step": 60
},
{
"entropy": 10.167214965820312,
"epoch": 0.005740021193924408,
"grad_norm": 2.046875,
"learning_rate": 3.2e-05,
"loss": 9.2641,
"mean_token_accuracy": 0.07399890869855881,
"num_tokens": 119241.0,
"step": 65
},
{
"entropy": 10.210993480682372,
"epoch": 0.006181561285764747,
"grad_norm": 2.140625,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.2782,
"mean_token_accuracy": 0.07282476425170899,
"num_tokens": 127903.0,
"step": 70
},
{
"entropy": 10.159809684753418,
"epoch": 0.006623101377605086,
"grad_norm": 1.734375,
"learning_rate": 3.7e-05,
"loss": 9.2258,
"mean_token_accuracy": 0.07543315626680851,
"num_tokens": 137370.0,
"step": 75
},
{
"entropy": 10.111583232879639,
"epoch": 0.007064641469445425,
"grad_norm": 1.8828125,
"learning_rate": 3.95e-05,
"loss": 9.0774,
"mean_token_accuracy": 0.08292015641927719,
"num_tokens": 146582.0,
"step": 80
},
{
"entropy": 10.07847490310669,
"epoch": 0.007506181561285765,
"grad_norm": 1.9375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.0108,
"mean_token_accuracy": 0.07970988750457764,
"num_tokens": 154933.0,
"step": 85
},
{
"entropy": 10.015530204772949,
"epoch": 0.007947721653126103,
"grad_norm": 1.6171875,
"learning_rate": 4.45e-05,
"loss": 8.9747,
"mean_token_accuracy": 0.07985232844948768,
"num_tokens": 165157.0,
"step": 90
},
{
"entropy": 10.035838222503662,
"epoch": 0.008389261744966443,
"grad_norm": 1.640625,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.8768,
"mean_token_accuracy": 0.07754012271761894,
"num_tokens": 174958.0,
"step": 95
},
{
"entropy": 9.947721004486084,
"epoch": 0.008830801836806783,
"grad_norm": 1.671875,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.7872,
"mean_token_accuracy": 0.0828177772462368,
"num_tokens": 184256.0,
"step": 100
},
{
"entropy": 9.94132833480835,
"epoch": 0.009272341928647121,
"grad_norm": 1.5625,
"learning_rate": 5.2e-05,
"loss": 8.6971,
"mean_token_accuracy": 0.07942965477705002,
"num_tokens": 192894.0,
"step": 105
},
{
"entropy": 9.842441368103028,
"epoch": 0.00971388202048746,
"grad_norm": 1.7109375,
"learning_rate": 5.45e-05,
"loss": 8.6172,
"mean_token_accuracy": 0.08055685237050056,
"num_tokens": 202675.0,
"step": 110
},
{
"entropy": 9.828944206237793,
"epoch": 0.010155422112327799,
"grad_norm": 1.484375,
"learning_rate": 5.7e-05,
"loss": 8.5621,
"mean_token_accuracy": 0.07997862100601197,
"num_tokens": 212261.0,
"step": 115
},
{
"entropy": 9.671414470672607,
"epoch": 0.010596962204168139,
"grad_norm": 1.546875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.5494,
"mean_token_accuracy": 0.07975570932030678,
"num_tokens": 222329.0,
"step": 120
},
{
"entropy": 9.579044532775878,
"epoch": 0.011038502296008477,
"grad_norm": 1.6953125,
"learning_rate": 6.2e-05,
"loss": 8.392,
"mean_token_accuracy": 0.07828540578484536,
"num_tokens": 231247.0,
"step": 125
},
{
"entropy": 9.464293384552002,
"epoch": 0.011480042387848817,
"grad_norm": 1.578125,
"learning_rate": 6.450000000000001e-05,
"loss": 8.2789,
"mean_token_accuracy": 0.08522977083921432,
"num_tokens": 239978.0,
"step": 130
},
{
"entropy": 9.329948711395264,
"epoch": 0.011921582479689156,
"grad_norm": 1.1484375,
"learning_rate": 6.7e-05,
"loss": 8.243,
"mean_token_accuracy": 0.08045366927981376,
"num_tokens": 249735.0,
"step": 135
},
{
"entropy": 9.195873355865478,
"epoch": 0.012363122571529495,
"grad_norm": 1.546875,
"learning_rate": 6.950000000000001e-05,
"loss": 8.1804,
"mean_token_accuracy": 0.07878185361623764,
"num_tokens": 259369.0,
"step": 140
},
{
"entropy": 9.076773929595948,
"epoch": 0.012804662663369834,
"grad_norm": 1.265625,
"learning_rate": 7.2e-05,
"loss": 8.165,
"mean_token_accuracy": 0.07605967372655868,
"num_tokens": 268645.0,
"step": 145
},
{
"entropy": 8.913009357452392,
"epoch": 0.013246202755210172,
"grad_norm": 1.7421875,
"learning_rate": 7.45e-05,
"loss": 7.992,
"mean_token_accuracy": 0.08179110959172249,
"num_tokens": 276667.0,
"step": 150
},
{
"entropy": 8.75396728515625,
"epoch": 0.013687742847050512,
"grad_norm": 1.40625,
"learning_rate": 7.7e-05,
"loss": 7.9969,
"mean_token_accuracy": 0.08649424239993095,
"num_tokens": 286017.0,
"step": 155
},
{
"entropy": 8.627446365356445,
"epoch": 0.01412928293889085,
"grad_norm": 1.1171875,
"learning_rate": 7.950000000000001e-05,
"loss": 7.9781,
"mean_token_accuracy": 0.08121571242809296,
"num_tokens": 295631.0,
"step": 160
},
{
"entropy": 8.693611431121827,
"epoch": 0.01457082303073119,
"grad_norm": 1.2421875,
"learning_rate": 8.2e-05,
"loss": 7.9589,
"mean_token_accuracy": 0.08223926201462746,
"num_tokens": 304704.0,
"step": 165
},
{
"entropy": 8.534437942504884,
"epoch": 0.01501236312257153,
"grad_norm": 1.4375,
"learning_rate": 8.450000000000001e-05,
"loss": 7.9731,
"mean_token_accuracy": 0.08499160557985305,
"num_tokens": 314195.0,
"step": 170
},
{
"entropy": 8.449780178070068,
"epoch": 0.015453903214411868,
"grad_norm": 1.1015625,
"learning_rate": 8.7e-05,
"loss": 7.9605,
"mean_token_accuracy": 0.08167596161365509,
"num_tokens": 323379.0,
"step": 175
},
{
"entropy": 8.427653789520264,
"epoch": 0.015895443306252206,
"grad_norm": 1.0859375,
"learning_rate": 8.95e-05,
"loss": 7.864,
"mean_token_accuracy": 0.08790193870663643,
"num_tokens": 332322.0,
"step": 180
},
{
"entropy": 8.308454895019532,
"epoch": 0.016336983398092548,
"grad_norm": 0.9921875,
"learning_rate": 9.2e-05,
"loss": 7.8241,
"mean_token_accuracy": 0.0907207302749157,
"num_tokens": 341735.0,
"step": 185
},
{
"entropy": 8.393166542053223,
"epoch": 0.016778523489932886,
"grad_norm": 1.21875,
"learning_rate": 9.45e-05,
"loss": 7.9195,
"mean_token_accuracy": 0.08468585535883903,
"num_tokens": 351209.0,
"step": 190
},
{
"entropy": 8.27011661529541,
"epoch": 0.017220063581773224,
"grad_norm": 1.3515625,
"learning_rate": 9.7e-05,
"loss": 7.8614,
"mean_token_accuracy": 0.08361415192484856,
"num_tokens": 360467.0,
"step": 195
},
{
"entropy": 8.242918300628663,
"epoch": 0.017661603673613566,
"grad_norm": 1.078125,
"learning_rate": 9.95e-05,
"loss": 7.8241,
"mean_token_accuracy": 0.0869070716202259,
"num_tokens": 370361.0,
"step": 200
},
{
"entropy": 8.279992771148681,
"epoch": 0.018103143765453904,
"grad_norm": 1.4453125,
"learning_rate": 0.000102,
"loss": 7.8877,
"mean_token_accuracy": 0.07924672663211822,
"num_tokens": 380366.0,
"step": 205
},
{
"entropy": 8.198458003997803,
"epoch": 0.018544683857294242,
"grad_norm": 1.375,
"learning_rate": 0.00010449999999999999,
"loss": 7.7928,
"mean_token_accuracy": 0.08724351823329926,
"num_tokens": 390690.0,
"step": 210
},
{
"entropy": 8.174153900146484,
"epoch": 0.01898622394913458,
"grad_norm": 1.21875,
"learning_rate": 0.000107,
"loss": 7.8526,
"mean_token_accuracy": 0.0823112078011036,
"num_tokens": 400722.0,
"step": 215
},
{
"entropy": 8.113383865356445,
"epoch": 0.01942776404097492,
"grad_norm": 1.4453125,
"learning_rate": 0.0001095,
"loss": 7.733,
"mean_token_accuracy": 0.08983569592237473,
"num_tokens": 410223.0,
"step": 220
},
{
"entropy": 8.137540912628173,
"epoch": 0.01986930413281526,
"grad_norm": 1.3125,
"learning_rate": 0.000112,
"loss": 7.7948,
"mean_token_accuracy": 0.0847058854997158,
"num_tokens": 420214.0,
"step": 225
},
{
"entropy": 8.165675449371339,
"epoch": 0.020310844224655598,
"grad_norm": 1.1328125,
"learning_rate": 0.0001145,
"loss": 7.7491,
"mean_token_accuracy": 0.08784600198268891,
"num_tokens": 429407.0,
"step": 230
},
{
"entropy": 8.056314134597779,
"epoch": 0.02075238431649594,
"grad_norm": 1.1484375,
"learning_rate": 0.00011700000000000001,
"loss": 7.7019,
"mean_token_accuracy": 0.08565770387649536,
"num_tokens": 438403.0,
"step": 235
},
{
"entropy": 8.126753520965575,
"epoch": 0.021193924408336277,
"grad_norm": 1.203125,
"learning_rate": 0.00011949999999999999,
"loss": 7.7374,
"mean_token_accuracy": 0.09219109117984772,
"num_tokens": 447466.0,
"step": 240
},
{
"entropy": 8.062481260299682,
"epoch": 0.021635464500176615,
"grad_norm": 1.15625,
"learning_rate": 0.000122,
"loss": 7.8271,
"mean_token_accuracy": 0.0802032507956028,
"num_tokens": 457141.0,
"step": 245
},
{
"entropy": 8.097463226318359,
"epoch": 0.022077004592016954,
"grad_norm": 1.1484375,
"learning_rate": 0.0001245,
"loss": 7.698,
"mean_token_accuracy": 0.0921065405011177,
"num_tokens": 465708.0,
"step": 250
},
{
"entropy": 8.170325756072998,
"epoch": 0.022518544683857295,
"grad_norm": 1.4375,
"learning_rate": 0.000127,
"loss": 7.7169,
"mean_token_accuracy": 0.0848769947886467,
"num_tokens": 475369.0,
"step": 255
},
{
"entropy": 7.963189935684204,
"epoch": 0.022960084775697633,
"grad_norm": 1.296875,
"learning_rate": 0.0001295,
"loss": 7.6855,
"mean_token_accuracy": 0.08922288343310356,
"num_tokens": 484249.0,
"step": 260
},
{
"entropy": 8.03909511566162,
"epoch": 0.02340162486753797,
"grad_norm": 1.2578125,
"learning_rate": 0.000132,
"loss": 7.7881,
"mean_token_accuracy": 0.08452328145503998,
"num_tokens": 493303.0,
"step": 265
},
{
"entropy": 8.062015914916993,
"epoch": 0.023843164959378313,
"grad_norm": 1.5703125,
"learning_rate": 0.00013450000000000002,
"loss": 7.758,
"mean_token_accuracy": 0.09125194177031518,
"num_tokens": 501503.0,
"step": 270
},
{
"entropy": 8.085032892227172,
"epoch": 0.02428470505121865,
"grad_norm": 1.2734375,
"learning_rate": 0.00013700000000000002,
"loss": 7.6942,
"mean_token_accuracy": 0.09186801388859749,
"num_tokens": 509661.0,
"step": 275
},
{
"entropy": 8.047321224212647,
"epoch": 0.02472624514305899,
"grad_norm": 1.1328125,
"learning_rate": 0.0001395,
"loss": 7.6684,
"mean_token_accuracy": 0.09005074873566628,
"num_tokens": 519464.0,
"step": 280
},
{
"entropy": 8.028418731689452,
"epoch": 0.025167785234899327,
"grad_norm": 1.359375,
"learning_rate": 0.00014199999999999998,
"loss": 7.6342,
"mean_token_accuracy": 0.09150514975190163,
"num_tokens": 527968.0,
"step": 285
},
{
"entropy": 8.062326526641845,
"epoch": 0.02560932532673967,
"grad_norm": 1.3359375,
"learning_rate": 0.0001445,
"loss": 7.6649,
"mean_token_accuracy": 0.09316564500331878,
"num_tokens": 537234.0,
"step": 290
},
{
"entropy": 7.969491100311279,
"epoch": 0.026050865418580007,
"grad_norm": 1.328125,
"learning_rate": 0.000147,
"loss": 7.6521,
"mean_token_accuracy": 0.09308369681239129,
"num_tokens": 546398.0,
"step": 295
},
{
"entropy": 8.048774671554565,
"epoch": 0.026492405510420345,
"grad_norm": 1.1953125,
"learning_rate": 0.0001495,
"loss": 7.6327,
"mean_token_accuracy": 0.09298400059342385,
"num_tokens": 555362.0,
"step": 300
},
{
"entropy": 7.990510559082031,
"epoch": 0.026933945602260687,
"grad_norm": 1.1953125,
"learning_rate": 0.000152,
"loss": 7.6861,
"mean_token_accuracy": 0.08575507774949073,
"num_tokens": 564575.0,
"step": 305
},
{
"entropy": 8.113833093643189,
"epoch": 0.027375485694101025,
"grad_norm": 1.2890625,
"learning_rate": 0.00015450000000000001,
"loss": 7.7137,
"mean_token_accuracy": 0.08935339227318764,
"num_tokens": 573915.0,
"step": 310
},
{
"entropy": 7.953329849243164,
"epoch": 0.027817025785941363,
"grad_norm": 1.265625,
"learning_rate": 0.000157,
"loss": 7.6052,
"mean_token_accuracy": 0.08935642167925835,
"num_tokens": 583216.0,
"step": 315
},
{
"entropy": 7.974963426589966,
"epoch": 0.0282585658777817,
"grad_norm": 1.328125,
"learning_rate": 0.0001595,
"loss": 7.6365,
"mean_token_accuracy": 0.09493646398186684,
"num_tokens": 591955.0,
"step": 320
},
{
"entropy": 7.945090007781983,
"epoch": 0.028700105969622042,
"grad_norm": 1.203125,
"learning_rate": 0.000162,
"loss": 7.6372,
"mean_token_accuracy": 0.09564759358763694,
"num_tokens": 600999.0,
"step": 325
},
{
"entropy": 7.945532560348511,
"epoch": 0.02914164606146238,
"grad_norm": 1.078125,
"learning_rate": 0.00016450000000000001,
"loss": 7.5347,
"mean_token_accuracy": 0.09901952669024468,
"num_tokens": 609478.0,
"step": 330
},
{
"entropy": 7.826081418991089,
"epoch": 0.02958318615330272,
"grad_norm": 1.3125,
"learning_rate": 0.00016700000000000002,
"loss": 7.6044,
"mean_token_accuracy": 0.09094477742910385,
"num_tokens": 618348.0,
"step": 335
},
{
"entropy": 8.00728144645691,
"epoch": 0.03002472624514306,
"grad_norm": 1.1015625,
"learning_rate": 0.00016950000000000003,
"loss": 7.651,
"mean_token_accuracy": 0.08828822076320648,
"num_tokens": 628548.0,
"step": 340
},
{
"entropy": 7.951943874359131,
"epoch": 0.0304662663369834,
"grad_norm": 1.1875,
"learning_rate": 0.00017199999999999998,
"loss": 7.5861,
"mean_token_accuracy": 0.09196597188711167,
"num_tokens": 637489.0,
"step": 345
},
{
"entropy": 7.842890119552612,
"epoch": 0.030907806428823736,
"grad_norm": 1.171875,
"learning_rate": 0.00017449999999999999,
"loss": 7.5698,
"mean_token_accuracy": 0.08872186839580536,
"num_tokens": 646715.0,
"step": 350
},
{
"entropy": 7.839594936370849,
"epoch": 0.031349346520664075,
"grad_norm": 1.203125,
"learning_rate": 0.000177,
"loss": 7.5673,
"mean_token_accuracy": 0.09486312419176102,
"num_tokens": 656858.0,
"step": 355
},
{
"entropy": 7.985370254516601,
"epoch": 0.03179088661250441,
"grad_norm": 1.1953125,
"learning_rate": 0.0001795,
"loss": 7.5492,
"mean_token_accuracy": 0.09201375618577004,
"num_tokens": 665968.0,
"step": 360
},
{
"entropy": 7.856255674362183,
"epoch": 0.03223242670434476,
"grad_norm": 1.5078125,
"learning_rate": 0.000182,
"loss": 7.5346,
"mean_token_accuracy": 0.0938662439584732,
"num_tokens": 674295.0,
"step": 365
},
{
"entropy": 7.819755506515503,
"epoch": 0.032673966796185096,
"grad_norm": 1.1640625,
"learning_rate": 0.0001845,
"loss": 7.4683,
"mean_token_accuracy": 0.0921003058552742,
"num_tokens": 683559.0,
"step": 370
},
{
"entropy": 7.767789649963379,
"epoch": 0.033115506888025434,
"grad_norm": 1.5078125,
"learning_rate": 0.000187,
"loss": 7.4958,
"mean_token_accuracy": 0.09682972505688667,
"num_tokens": 692402.0,
"step": 375
},
{
"entropy": 7.937490701675415,
"epoch": 0.03355704697986577,
"grad_norm": 1.2421875,
"learning_rate": 0.0001895,
"loss": 7.61,
"mean_token_accuracy": 0.08481517881155014,
"num_tokens": 702052.0,
"step": 380
},
{
"entropy": 7.88536114692688,
"epoch": 0.03399858707170611,
"grad_norm": 1.1171875,
"learning_rate": 0.000192,
"loss": 7.5255,
"mean_token_accuracy": 0.09476071372628211,
"num_tokens": 711926.0,
"step": 385
},
{
"entropy": 7.827258634567261,
"epoch": 0.03444012716354645,
"grad_norm": 1.0546875,
"learning_rate": 0.0001945,
"loss": 7.4746,
"mean_token_accuracy": 0.09309235811233521,
"num_tokens": 720948.0,
"step": 390
},
{
"entropy": 7.764995431900024,
"epoch": 0.034881667255386786,
"grad_norm": 1.2265625,
"learning_rate": 0.00019700000000000002,
"loss": 7.5254,
"mean_token_accuracy": 0.09631742537021637,
"num_tokens": 729611.0,
"step": 395
},
{
"entropy": 7.932223796844482,
"epoch": 0.03532320734722713,
"grad_norm": 1.25,
"learning_rate": 0.00019950000000000002,
"loss": 7.4985,
"mean_token_accuracy": 0.08739121779799461,
"num_tokens": 738433.0,
"step": 400
},
{
"entropy": 7.759926271438599,
"epoch": 0.03576474743906747,
"grad_norm": 1.3046875,
"learning_rate": 0.000202,
"loss": 7.5344,
"mean_token_accuracy": 0.09274654388427735,
"num_tokens": 747310.0,
"step": 405
},
{
"entropy": 7.756983041763306,
"epoch": 0.03620628753090781,
"grad_norm": 1.296875,
"learning_rate": 0.00020449999999999998,
"loss": 7.5047,
"mean_token_accuracy": 0.09618922770023346,
"num_tokens": 756362.0,
"step": 410
},
{
"entropy": 7.847079801559448,
"epoch": 0.036647827622748146,
"grad_norm": 1.15625,
"learning_rate": 0.000207,
"loss": 7.4946,
"mean_token_accuracy": 0.09153542071580886,
"num_tokens": 764978.0,
"step": 415
},
{
"entropy": 7.769409275054931,
"epoch": 0.037089367714588484,
"grad_norm": 1.1875,
"learning_rate": 0.0002095,
"loss": 7.4616,
"mean_token_accuracy": 0.09671959578990937,
"num_tokens": 774058.0,
"step": 420
},
{
"entropy": 7.735736560821533,
"epoch": 0.03753090780642882,
"grad_norm": 1.2578125,
"learning_rate": 0.000212,
"loss": 7.4465,
"mean_token_accuracy": 0.09103933200240136,
"num_tokens": 783332.0,
"step": 425
},
{
"entropy": 7.767506504058838,
"epoch": 0.03797244789826916,
"grad_norm": 1.0625,
"learning_rate": 0.0002145,
"loss": 7.5161,
"mean_token_accuracy": 0.09249499961733817,
"num_tokens": 792481.0,
"step": 430
},
{
"entropy": 7.697516012191772,
"epoch": 0.038413987990109505,
"grad_norm": 1.1796875,
"learning_rate": 0.00021700000000000002,
"loss": 7.4117,
"mean_token_accuracy": 0.09788367450237274,
"num_tokens": 801396.0,
"step": 435
},
{
"entropy": 7.726156330108642,
"epoch": 0.03885552808194984,
"grad_norm": 1.140625,
"learning_rate": 0.0002195,
"loss": 7.4781,
"mean_token_accuracy": 0.09258785918354988,
"num_tokens": 809903.0,
"step": 440
},
{
"entropy": 7.754117822647094,
"epoch": 0.03929706817379018,
"grad_norm": 1.1328125,
"learning_rate": 0.000222,
"loss": 7.4228,
"mean_token_accuracy": 0.10010684058070182,
"num_tokens": 819144.0,
"step": 445
},
{
"entropy": 7.638237190246582,
"epoch": 0.03973860826563052,
"grad_norm": 1.2109375,
"learning_rate": 0.0002245,
"loss": 7.4501,
"mean_token_accuracy": 0.09609700441360473,
"num_tokens": 828881.0,
"step": 450
},
{
"entropy": 7.699933958053589,
"epoch": 0.04018014835747086,
"grad_norm": 1.1015625,
"learning_rate": 0.00022700000000000002,
"loss": 7.3763,
"mean_token_accuracy": 0.09211291894316673,
"num_tokens": 837588.0,
"step": 455
},
{
"entropy": 7.64010763168335,
"epoch": 0.040621688449311195,
"grad_norm": 1.0859375,
"learning_rate": 0.00022950000000000002,
"loss": 7.3807,
"mean_token_accuracy": 0.09671871289610863,
"num_tokens": 847002.0,
"step": 460
},
{
"entropy": 7.623350667953491,
"epoch": 0.041063228541151534,
"grad_norm": 1.2890625,
"learning_rate": 0.00023200000000000003,
"loss": 7.3849,
"mean_token_accuracy": 0.0986923448741436,
"num_tokens": 855791.0,
"step": 465
},
{
"entropy": 7.721793460845947,
"epoch": 0.04150476863299188,
"grad_norm": 1.2578125,
"learning_rate": 0.00023449999999999998,
"loss": 7.4131,
"mean_token_accuracy": 0.09923509359359742,
"num_tokens": 865392.0,
"step": 470
},
{
"entropy": 7.608292579650879,
"epoch": 0.04194630872483222,
"grad_norm": 1.1875,
"learning_rate": 0.000237,
"loss": 7.478,
"mean_token_accuracy": 0.09382415115833283,
"num_tokens": 874807.0,
"step": 475
},
{
"entropy": 7.754652500152588,
"epoch": 0.042387848816672555,
"grad_norm": 1.203125,
"learning_rate": 0.0002395,
"loss": 7.4339,
"mean_token_accuracy": 0.09926938116550446,
"num_tokens": 883928.0,
"step": 480
},
{
"entropy": 7.652652740478516,
"epoch": 0.04282938890851289,
"grad_norm": 1.1640625,
"learning_rate": 0.000242,
"loss": 7.3376,
"mean_token_accuracy": 0.09957752376794815,
"num_tokens": 893047.0,
"step": 485
},
{
"entropy": 7.5953545570373535,
"epoch": 0.04327092900035323,
"grad_norm": 1.21875,
"learning_rate": 0.0002445,
"loss": 7.3515,
"mean_token_accuracy": 0.10079265013337135,
"num_tokens": 901645.0,
"step": 490
},
{
"entropy": 7.616002416610717,
"epoch": 0.04371246909219357,
"grad_norm": 1.1875,
"learning_rate": 0.000247,
"loss": 7.3691,
"mean_token_accuracy": 0.09735967218875885,
"num_tokens": 911169.0,
"step": 495
},
{
"entropy": 7.688420724868775,
"epoch": 0.04415400918403391,
"grad_norm": 1.21875,
"learning_rate": 0.0002495,
"loss": 7.3811,
"mean_token_accuracy": 0.0928712822496891,
"num_tokens": 921382.0,
"step": 500
},
{
"entropy": 7.501060581207275,
"epoch": 0.04459554927587425,
"grad_norm": 1.15625,
"learning_rate": 0.000252,
"loss": 7.3012,
"mean_token_accuracy": 0.09976874813437461,
"num_tokens": 930409.0,
"step": 505
},
{
"entropy": 7.606061887741089,
"epoch": 0.04503708936771459,
"grad_norm": 1.2109375,
"learning_rate": 0.0002545,
"loss": 7.283,
"mean_token_accuracy": 0.10316867306828499,
"num_tokens": 939049.0,
"step": 510
},
{
"entropy": 7.589950037002564,
"epoch": 0.04547862945955493,
"grad_norm": 1.203125,
"learning_rate": 0.000257,
"loss": 7.2954,
"mean_token_accuracy": 0.10237202495336532,
"num_tokens": 947575.0,
"step": 515
},
{
"entropy": 7.631234502792358,
"epoch": 0.045920169551395267,
"grad_norm": 1.1796875,
"learning_rate": 0.0002595,
"loss": 7.4624,
"mean_token_accuracy": 0.09285921081900597,
"num_tokens": 957848.0,
"step": 520
},
{
"entropy": 7.598208427429199,
"epoch": 0.046361709643235605,
"grad_norm": 1.1796875,
"learning_rate": 0.000262,
"loss": 7.2919,
"mean_token_accuracy": 0.10156237781047821,
"num_tokens": 966521.0,
"step": 525
},
{
"entropy": 7.606314086914063,
"epoch": 0.04680324973507594,
"grad_norm": 1.2734375,
"learning_rate": 0.00026450000000000003,
"loss": 7.3541,
"mean_token_accuracy": 0.10115546062588691,
"num_tokens": 975827.0,
"step": 530
},
{
"entropy": 7.526746702194214,
"epoch": 0.04724478982691628,
"grad_norm": 1.2109375,
"learning_rate": 0.00026700000000000004,
"loss": 7.2985,
"mean_token_accuracy": 0.10082201957702637,
"num_tokens": 985292.0,
"step": 535
},
{
"entropy": 7.502959203720093,
"epoch": 0.047686329918756626,
"grad_norm": 1.28125,
"learning_rate": 0.00026950000000000005,
"loss": 7.2896,
"mean_token_accuracy": 0.10343632996082305,
"num_tokens": 994791.0,
"step": 540
},
{
"entropy": 7.516558980941772,
"epoch": 0.048127870010596964,
"grad_norm": 1.1875,
"learning_rate": 0.00027200000000000005,
"loss": 7.2553,
"mean_token_accuracy": 0.10770378857851029,
"num_tokens": 1003700.0,
"step": 545
},
{
"entropy": 7.503448867797852,
"epoch": 0.0485694101024373,
"grad_norm": 1.1171875,
"learning_rate": 0.0002745,
"loss": 7.2947,
"mean_token_accuracy": 0.10270922258496284,
"num_tokens": 1012682.0,
"step": 550
},
{
"entropy": 7.590410900115967,
"epoch": 0.04901095019427764,
"grad_norm": 1.25,
"learning_rate": 0.000277,
"loss": 7.3023,
"mean_token_accuracy": 0.10066464468836785,
"num_tokens": 1021018.0,
"step": 555
},
{
"entropy": 7.514344882965088,
"epoch": 0.04945249028611798,
"grad_norm": 1.3203125,
"learning_rate": 0.0002795,
"loss": 7.1687,
"mean_token_accuracy": 0.10436531826853752,
"num_tokens": 1029744.0,
"step": 560
},
{
"entropy": 7.328309202194214,
"epoch": 0.049894030377958316,
"grad_norm": 1.265625,
"learning_rate": 0.00028199999999999997,
"loss": 7.2636,
"mean_token_accuracy": 0.11038385182619095,
"num_tokens": 1038805.0,
"step": 565
},
{
"entropy": 7.525923824310302,
"epoch": 0.050335570469798654,
"grad_norm": 1.359375,
"learning_rate": 0.0002845,
"loss": 7.3197,
"mean_token_accuracy": 0.10082013010978699,
"num_tokens": 1047656.0,
"step": 570
},
{
"entropy": 7.603262233734131,
"epoch": 0.050777110561639,
"grad_norm": 1.25,
"learning_rate": 0.000287,
"loss": 7.3119,
"mean_token_accuracy": 0.10330245941877365,
"num_tokens": 1056598.0,
"step": 575
},
{
"entropy": 7.506361103057861,
"epoch": 0.05121865065347934,
"grad_norm": 1.1953125,
"learning_rate": 0.0002895,
"loss": 7.3105,
"mean_token_accuracy": 0.10376007333397866,
"num_tokens": 1065226.0,
"step": 580
},
{
"entropy": 7.43021969795227,
"epoch": 0.051660190745319676,
"grad_norm": 1.296875,
"learning_rate": 0.000292,
"loss": 7.2312,
"mean_token_accuracy": 0.10194071978330613,
"num_tokens": 1074661.0,
"step": 585
},
{
"entropy": 7.51248574256897,
"epoch": 0.052101730837160014,
"grad_norm": 1.2109375,
"learning_rate": 0.0002945,
"loss": 7.3225,
"mean_token_accuracy": 0.10019931197166443,
"num_tokens": 1083921.0,
"step": 590
},
{
"entropy": 7.486316394805908,
"epoch": 0.05254327092900035,
"grad_norm": 1.1484375,
"learning_rate": 0.000297,
"loss": 7.2137,
"mean_token_accuracy": 0.10983922332525253,
"num_tokens": 1093399.0,
"step": 595
},
{
"entropy": 7.439640522003174,
"epoch": 0.05298481102084069,
"grad_norm": 1.296875,
"learning_rate": 0.0002995,
"loss": 7.2835,
"mean_token_accuracy": 0.10640830993652343,
"num_tokens": 1104065.0,
"step": 600
},
{
"entropy": 7.37196102142334,
"epoch": 0.05342635111268103,
"grad_norm": 1.3359375,
"learning_rate": 0.000302,
"loss": 7.1855,
"mean_token_accuracy": 0.10447794273495674,
"num_tokens": 1112995.0,
"step": 605
},
{
"entropy": 7.374333763122559,
"epoch": 0.05386789120452137,
"grad_norm": 1.1640625,
"learning_rate": 0.0003045,
"loss": 7.219,
"mean_token_accuracy": 0.10373939201235771,
"num_tokens": 1121637.0,
"step": 610
},
{
"entropy": 7.4547041893005375,
"epoch": 0.05430943129636171,
"grad_norm": 1.2578125,
"learning_rate": 0.000307,
"loss": 7.163,
"mean_token_accuracy": 0.10560059025883675,
"num_tokens": 1131166.0,
"step": 615
},
{
"entropy": 7.4077800750732425,
"epoch": 0.05475097138820205,
"grad_norm": 1.15625,
"learning_rate": 0.0003095,
"loss": 7.1546,
"mean_token_accuracy": 0.11212797611951827,
"num_tokens": 1140888.0,
"step": 620
},
{
"entropy": 7.458501863479614,
"epoch": 0.05519251148004239,
"grad_norm": 1.1328125,
"learning_rate": 0.000312,
"loss": 7.3313,
"mean_token_accuracy": 0.10084073692560196,
"num_tokens": 1150278.0,
"step": 625
},
{
"entropy": 7.399151372909546,
"epoch": 0.055634051571882726,
"grad_norm": 1.3984375,
"learning_rate": 0.0003145,
"loss": 7.2699,
"mean_token_accuracy": 0.10444999486207962,
"num_tokens": 1159348.0,
"step": 630
},
{
"entropy": 7.549579715728759,
"epoch": 0.056075591663723064,
"grad_norm": 1.1640625,
"learning_rate": 0.000317,
"loss": 7.2841,
"mean_token_accuracy": 0.1042952410876751,
"num_tokens": 1168883.0,
"step": 635
},
{
"entropy": 7.408907222747803,
"epoch": 0.0565171317555634,
"grad_norm": 1.1953125,
"learning_rate": 0.0003195,
"loss": 7.1845,
"mean_token_accuracy": 0.10902434810996056,
"num_tokens": 1178572.0,
"step": 640
},
{
"entropy": 7.410972738265992,
"epoch": 0.05695867184740375,
"grad_norm": 1.140625,
"learning_rate": 0.000322,
"loss": 7.2662,
"mean_token_accuracy": 0.10295297279953956,
"num_tokens": 1188909.0,
"step": 645
},
{
"entropy": 7.352515697479248,
"epoch": 0.057400211939244085,
"grad_norm": 1.1640625,
"learning_rate": 0.00032450000000000003,
"loss": 7.1696,
"mean_token_accuracy": 0.10579917058348656,
"num_tokens": 1197705.0,
"step": 650
},
{
"entropy": 7.353521823883057,
"epoch": 0.05784175203108442,
"grad_norm": 1.28125,
"learning_rate": 0.00032700000000000003,
"loss": 7.0136,
"mean_token_accuracy": 0.11067867055535316,
"num_tokens": 1206351.0,
"step": 655
},
{
"entropy": 7.337934875488282,
"epoch": 0.05828329212292476,
"grad_norm": 1.46875,
"learning_rate": 0.00032950000000000004,
"loss": 7.1286,
"mean_token_accuracy": 0.1017768256366253,
"num_tokens": 1214984.0,
"step": 660
},
{
"entropy": 7.323618602752686,
"epoch": 0.0587248322147651,
"grad_norm": 1.1484375,
"learning_rate": 0.00033200000000000005,
"loss": 7.22,
"mean_token_accuracy": 0.0986666016280651,
"num_tokens": 1224485.0,
"step": 665
},
{
"entropy": 7.373797750473022,
"epoch": 0.05916637230660544,
"grad_norm": 1.21875,
"learning_rate": 0.00033450000000000005,
"loss": 7.2399,
"mean_token_accuracy": 0.10024571865797043,
"num_tokens": 1233560.0,
"step": 670
},
{
"entropy": 7.387822151184082,
"epoch": 0.05960791239844578,
"grad_norm": 1.4609375,
"learning_rate": 0.000337,
"loss": 7.1624,
"mean_token_accuracy": 0.10045728534460067,
"num_tokens": 1242628.0,
"step": 675
},
{
"entropy": 7.265125274658203,
"epoch": 0.06004945249028612,
"grad_norm": 1.109375,
"learning_rate": 0.0003395,
"loss": 7.0658,
"mean_token_accuracy": 0.1067326933145523,
"num_tokens": 1251004.0,
"step": 680
},
{
"entropy": 7.378535032272339,
"epoch": 0.06049099258212646,
"grad_norm": 1.0390625,
"learning_rate": 0.000342,
"loss": 7.2571,
"mean_token_accuracy": 0.10440935268998146,
"num_tokens": 1260344.0,
"step": 685
},
{
"entropy": 7.322955751419068,
"epoch": 0.0609325326739668,
"grad_norm": 1.0625,
"learning_rate": 0.00034449999999999997,
"loss": 7.1572,
"mean_token_accuracy": 0.10920507833361626,
"num_tokens": 1269988.0,
"step": 690
},
{
"entropy": 7.2962963581085205,
"epoch": 0.061374072765807135,
"grad_norm": 1.125,
"learning_rate": 0.000347,
"loss": 7.1193,
"mean_token_accuracy": 0.11102982461452485,
"num_tokens": 1280912.0,
"step": 695
},
{
"entropy": 7.252480220794678,
"epoch": 0.06181561285764747,
"grad_norm": 1.09375,
"learning_rate": 0.0003495,
"loss": 7.134,
"mean_token_accuracy": 0.10760174319148064,
"num_tokens": 1289684.0,
"step": 700
},
{
"entropy": 7.354262113571167,
"epoch": 0.06225715294948781,
"grad_norm": 1.1484375,
"learning_rate": 0.000352,
"loss": 7.1721,
"mean_token_accuracy": 0.10398160740733146,
"num_tokens": 1298853.0,
"step": 705
},
{
"entropy": 7.227016019821167,
"epoch": 0.06269869304132815,
"grad_norm": 1.0703125,
"learning_rate": 0.0003545,
"loss": 7.1271,
"mean_token_accuracy": 0.1127957746386528,
"num_tokens": 1309112.0,
"step": 710
},
{
"entropy": 7.324345111846924,
"epoch": 0.0631402331331685,
"grad_norm": 1.3359375,
"learning_rate": 0.000357,
"loss": 7.1092,
"mean_token_accuracy": 0.1057639792561531,
"num_tokens": 1319064.0,
"step": 715
},
{
"entropy": 7.188746166229248,
"epoch": 0.06358177322500883,
"grad_norm": 1.1171875,
"learning_rate": 0.0003595,
"loss": 7.0766,
"mean_token_accuracy": 0.11342449262738227,
"num_tokens": 1327889.0,
"step": 720
},
{
"entropy": 7.324895286560059,
"epoch": 0.06402331331684917,
"grad_norm": 1.3203125,
"learning_rate": 0.000362,
"loss": 7.1054,
"mean_token_accuracy": 0.10539671033620834,
"num_tokens": 1337241.0,
"step": 725
},
{
"entropy": 7.222482204437256,
"epoch": 0.06446485340868952,
"grad_norm": 1.1796875,
"learning_rate": 0.0003645,
"loss": 7.1636,
"mean_token_accuracy": 0.10495321676135064,
"num_tokens": 1346527.0,
"step": 730
},
{
"entropy": 7.305452728271485,
"epoch": 0.06490639350052985,
"grad_norm": 1.1484375,
"learning_rate": 0.000367,
"loss": 7.1429,
"mean_token_accuracy": 0.10441825911402702,
"num_tokens": 1355677.0,
"step": 735
},
{
"entropy": 7.290005493164062,
"epoch": 0.06534793359237019,
"grad_norm": 1.078125,
"learning_rate": 0.0003695,
"loss": 7.1298,
"mean_token_accuracy": 0.10936881825327874,
"num_tokens": 1364874.0,
"step": 740
},
{
"entropy": 7.279782056808472,
"epoch": 0.06578947368421052,
"grad_norm": 1.1640625,
"learning_rate": 0.000372,
"loss": 7.0692,
"mean_token_accuracy": 0.11476822644472122,
"num_tokens": 1373717.0,
"step": 745
},
{
"entropy": 7.331944179534912,
"epoch": 0.06623101377605087,
"grad_norm": 1.0546875,
"learning_rate": 0.0003745,
"loss": 7.0294,
"mean_token_accuracy": 0.11214973554015159,
"num_tokens": 1382767.0,
"step": 750
},
{
"entropy": 7.091894626617432,
"epoch": 0.0666725538678912,
"grad_norm": 1.359375,
"learning_rate": 0.000377,
"loss": 7.0713,
"mean_token_accuracy": 0.11100590229034424,
"num_tokens": 1391190.0,
"step": 755
},
{
"entropy": 7.175401639938355,
"epoch": 0.06711409395973154,
"grad_norm": 1.1015625,
"learning_rate": 0.0003795,
"loss": 7.0763,
"mean_token_accuracy": 0.10921204090118408,
"num_tokens": 1400722.0,
"step": 760
},
{
"entropy": 7.318567132949829,
"epoch": 0.06755563405157189,
"grad_norm": 1.1875,
"learning_rate": 0.000382,
"loss": 7.0907,
"mean_token_accuracy": 0.10661459416151046,
"num_tokens": 1409328.0,
"step": 765
},
{
"entropy": 7.106989192962646,
"epoch": 0.06799717414341222,
"grad_norm": 1.2421875,
"learning_rate": 0.0003845,
"loss": 6.967,
"mean_token_accuracy": 0.10996146872639656,
"num_tokens": 1418504.0,
"step": 770
},
{
"entropy": 7.248307847976685,
"epoch": 0.06843871423525257,
"grad_norm": 1.171875,
"learning_rate": 0.00038700000000000003,
"loss": 7.1104,
"mean_token_accuracy": 0.10902469977736473,
"num_tokens": 1427690.0,
"step": 775
},
{
"entropy": 7.239201641082763,
"epoch": 0.0688802543270929,
"grad_norm": 1.1015625,
"learning_rate": 0.00038950000000000003,
"loss": 7.091,
"mean_token_accuracy": 0.11118610724806785,
"num_tokens": 1436798.0,
"step": 780
},
{
"entropy": 7.1204283237457275,
"epoch": 0.06932179441893324,
"grad_norm": 1.109375,
"learning_rate": 0.00039200000000000004,
"loss": 7.0933,
"mean_token_accuracy": 0.10568799898028373,
"num_tokens": 1446357.0,
"step": 785
},
{
"entropy": 7.168965148925781,
"epoch": 0.06976333451077357,
"grad_norm": 1.0078125,
"learning_rate": 0.00039450000000000005,
"loss": 7.0073,
"mean_token_accuracy": 0.11038993671536446,
"num_tokens": 1455998.0,
"step": 790
},
{
"entropy": 7.229979085922241,
"epoch": 0.07020487460261392,
"grad_norm": 1.0546875,
"learning_rate": 0.00039700000000000005,
"loss": 7.0599,
"mean_token_accuracy": 0.10410151407122611,
"num_tokens": 1465237.0,
"step": 795
},
{
"entropy": 7.097687721252441,
"epoch": 0.07064641469445426,
"grad_norm": 1.2265625,
"learning_rate": 0.0003995,
"loss": 7.024,
"mean_token_accuracy": 0.11839348077774048,
"num_tokens": 1474363.0,
"step": 800
},
{
"entropy": 7.138771963119507,
"epoch": 0.0710879547862946,
"grad_norm": 1.46875,
"learning_rate": 0.000402,
"loss": 7.0872,
"mean_token_accuracy": 0.1139365516602993,
"num_tokens": 1483379.0,
"step": 805
},
{
"entropy": 7.267211008071899,
"epoch": 0.07152949487813494,
"grad_norm": 1.1015625,
"learning_rate": 0.0004045,
"loss": 7.0619,
"mean_token_accuracy": 0.10780827179551125,
"num_tokens": 1492507.0,
"step": 810
},
{
"entropy": 7.073677682876587,
"epoch": 0.07197103496997527,
"grad_norm": 1.2421875,
"learning_rate": 0.00040699999999999997,
"loss": 6.9431,
"mean_token_accuracy": 0.11598889455199242,
"num_tokens": 1500888.0,
"step": 815
},
{
"entropy": 7.079563140869141,
"epoch": 0.07241257506181561,
"grad_norm": 1.015625,
"learning_rate": 0.0004095,
"loss": 6.9983,
"mean_token_accuracy": 0.11227924451231956,
"num_tokens": 1510310.0,
"step": 820
},
{
"entropy": 7.121931362152099,
"epoch": 0.07285411515365595,
"grad_norm": 1.1484375,
"learning_rate": 0.000412,
"loss": 6.9855,
"mean_token_accuracy": 0.11764683723449706,
"num_tokens": 1519427.0,
"step": 825
},
{
"entropy": 7.14368166923523,
"epoch": 0.07329565524549629,
"grad_norm": 1.21875,
"learning_rate": 0.0004145,
"loss": 7.0087,
"mean_token_accuracy": 0.10792600363492966,
"num_tokens": 1529456.0,
"step": 830
},
{
"entropy": 7.080411815643311,
"epoch": 0.07373719533733664,
"grad_norm": 1.140625,
"learning_rate": 0.000417,
"loss": 6.9375,
"mean_token_accuracy": 0.11380904093384743,
"num_tokens": 1537695.0,
"step": 835
},
{
"entropy": 7.071755599975586,
"epoch": 0.07417873542917697,
"grad_norm": 1.1015625,
"learning_rate": 0.0004195,
"loss": 7.0784,
"mean_token_accuracy": 0.11253369823098183,
"num_tokens": 1547511.0,
"step": 840
},
{
"entropy": 7.204211902618408,
"epoch": 0.07462027552101731,
"grad_norm": 1.1015625,
"learning_rate": 0.000422,
"loss": 7.0709,
"mean_token_accuracy": 0.11463971808552742,
"num_tokens": 1557035.0,
"step": 845
},
{
"entropy": 7.083140897750854,
"epoch": 0.07506181561285764,
"grad_norm": 1.0,
"learning_rate": 0.0004245,
"loss": 7.0065,
"mean_token_accuracy": 0.11546228975057601,
"num_tokens": 1566773.0,
"step": 850
},
{
"entropy": 7.061517763137817,
"epoch": 0.07550335570469799,
"grad_norm": 1.140625,
"learning_rate": 0.000427,
"loss": 7.0081,
"mean_token_accuracy": 0.10918990075588227,
"num_tokens": 1576873.0,
"step": 855
},
{
"entropy": 7.128572607040406,
"epoch": 0.07594489579653832,
"grad_norm": 1.1171875,
"learning_rate": 0.0004295,
"loss": 7.0375,
"mean_token_accuracy": 0.10865660831332206,
"num_tokens": 1586170.0,
"step": 860
},
{
"entropy": 7.218125915527343,
"epoch": 0.07638643588837866,
"grad_norm": 1.265625,
"learning_rate": 0.000432,
"loss": 7.0778,
"mean_token_accuracy": 0.11018856391310691,
"num_tokens": 1596054.0,
"step": 865
},
{
"entropy": 7.02945466041565,
"epoch": 0.07682797598021901,
"grad_norm": 1.1875,
"learning_rate": 0.0004345,
"loss": 6.9583,
"mean_token_accuracy": 0.11728574708104134,
"num_tokens": 1604544.0,
"step": 870
},
{
"entropy": 7.105824756622314,
"epoch": 0.07726951607205934,
"grad_norm": 1.234375,
"learning_rate": 0.000437,
"loss": 6.9789,
"mean_token_accuracy": 0.1162014789879322,
"num_tokens": 1614580.0,
"step": 875
},
{
"entropy": 7.058492374420166,
"epoch": 0.07771105616389969,
"grad_norm": 1.0703125,
"learning_rate": 0.0004395,
"loss": 7.0641,
"mean_token_accuracy": 0.11256316900253296,
"num_tokens": 1624701.0,
"step": 880
},
{
"entropy": 7.0211296558380125,
"epoch": 0.07815259625574002,
"grad_norm": 1.046875,
"learning_rate": 0.000442,
"loss": 6.9931,
"mean_token_accuracy": 0.11021944805979729,
"num_tokens": 1634085.0,
"step": 885
},
{
"entropy": 7.09322075843811,
"epoch": 0.07859413634758036,
"grad_norm": 1.0703125,
"learning_rate": 0.0004445,
"loss": 6.9645,
"mean_token_accuracy": 0.1174542985856533,
"num_tokens": 1643190.0,
"step": 890
},
{
"entropy": 6.966829776763916,
"epoch": 0.0790356764394207,
"grad_norm": 1.125,
"learning_rate": 0.000447,
"loss": 7.006,
"mean_token_accuracy": 0.11372746750712395,
"num_tokens": 1652705.0,
"step": 895
},
{
"entropy": 7.127198505401611,
"epoch": 0.07947721653126104,
"grad_norm": 1.09375,
"learning_rate": 0.00044950000000000003,
"loss": 6.977,
"mean_token_accuracy": 0.10978531762957573,
"num_tokens": 1662210.0,
"step": 900
},
{
"entropy": 7.1131603717803955,
"epoch": 0.07991875662310138,
"grad_norm": 1.03125,
"learning_rate": 0.00045200000000000004,
"loss": 7.0268,
"mean_token_accuracy": 0.10922672674059868,
"num_tokens": 1671893.0,
"step": 905
},
{
"entropy": 7.049384355545044,
"epoch": 0.08036029671494171,
"grad_norm": 1.1328125,
"learning_rate": 0.00045450000000000004,
"loss": 6.9779,
"mean_token_accuracy": 0.11501859724521638,
"num_tokens": 1681217.0,
"step": 910
},
{
"entropy": 7.015186929702759,
"epoch": 0.08080183680678206,
"grad_norm": 1.1328125,
"learning_rate": 0.00045700000000000005,
"loss": 6.988,
"mean_token_accuracy": 0.1133071318268776,
"num_tokens": 1690447.0,
"step": 915
},
{
"entropy": 7.087394189834595,
"epoch": 0.08124337689862239,
"grad_norm": 1.0625,
"learning_rate": 0.00045950000000000006,
"loss": 7.0741,
"mean_token_accuracy": 0.10595951378345489,
"num_tokens": 1700355.0,
"step": 920
},
{
"entropy": 7.045471048355102,
"epoch": 0.08168491699046274,
"grad_norm": 1.015625,
"learning_rate": 0.000462,
"loss": 6.9851,
"mean_token_accuracy": 0.10544866621494293,
"num_tokens": 1709449.0,
"step": 925
},
{
"entropy": 7.048018169403076,
"epoch": 0.08212645708230307,
"grad_norm": 1.15625,
"learning_rate": 0.0004645,
"loss": 7.0167,
"mean_token_accuracy": 0.105999456346035,
"num_tokens": 1718838.0,
"step": 930
},
{
"entropy": 6.981620121002197,
"epoch": 0.08256799717414341,
"grad_norm": 1.0859375,
"learning_rate": 0.000467,
"loss": 6.9721,
"mean_token_accuracy": 0.11307689547538757,
"num_tokens": 1728594.0,
"step": 935
},
{
"entropy": 7.088650274276733,
"epoch": 0.08300953726598376,
"grad_norm": 0.94921875,
"learning_rate": 0.0004695,
"loss": 7.0148,
"mean_token_accuracy": 0.11065684705972671,
"num_tokens": 1738814.0,
"step": 940
},
{
"entropy": 7.006063842773438,
"epoch": 0.08345107735782409,
"grad_norm": 1.140625,
"learning_rate": 0.000472,
"loss": 6.9401,
"mean_token_accuracy": 0.11795193180441857,
"num_tokens": 1747644.0,
"step": 945
},
{
"entropy": 7.048807621002197,
"epoch": 0.08389261744966443,
"grad_norm": 1.25,
"learning_rate": 0.0004745,
"loss": 6.9822,
"mean_token_accuracy": 0.11285707354545593,
"num_tokens": 1757489.0,
"step": 950
},
{
"entropy": 6.994456195831299,
"epoch": 0.08433415754150476,
"grad_norm": 1.0234375,
"learning_rate": 0.000477,
"loss": 6.8881,
"mean_token_accuracy": 0.12073725908994674,
"num_tokens": 1767546.0,
"step": 955
},
{
"entropy": 6.929489183425903,
"epoch": 0.08477569763334511,
"grad_norm": 1.5,
"learning_rate": 0.0004795,
"loss": 6.9528,
"mean_token_accuracy": 0.10833125934004784,
"num_tokens": 1776035.0,
"step": 960
},
{
"entropy": 7.031561088562012,
"epoch": 0.08521723772518544,
"grad_norm": 0.8984375,
"learning_rate": 0.000482,
"loss": 7.0163,
"mean_token_accuracy": 0.10963534265756607,
"num_tokens": 1786161.0,
"step": 965
},
{
"entropy": 7.13347601890564,
"epoch": 0.08565877781702579,
"grad_norm": 1.1015625,
"learning_rate": 0.0004845,
"loss": 7.0758,
"mean_token_accuracy": 0.10902466773986816,
"num_tokens": 1796093.0,
"step": 970
},
{
"entropy": 6.994558525085449,
"epoch": 0.08610031790886613,
"grad_norm": 1.0234375,
"learning_rate": 0.000487,
"loss": 6.9267,
"mean_token_accuracy": 0.10800953432917595,
"num_tokens": 1805574.0,
"step": 975
},
{
"entropy": 7.005662727355957,
"epoch": 0.08654185800070646,
"grad_norm": 1.1015625,
"learning_rate": 0.0004895,
"loss": 6.9528,
"mean_token_accuracy": 0.11506856232881546,
"num_tokens": 1815175.0,
"step": 980
},
{
"entropy": 6.939174652099609,
"epoch": 0.08698339809254681,
"grad_norm": 1.1328125,
"learning_rate": 0.000492,
"loss": 6.8892,
"mean_token_accuracy": 0.11544275358319282,
"num_tokens": 1824683.0,
"step": 985
},
{
"entropy": 6.9920509338378904,
"epoch": 0.08742493818438714,
"grad_norm": 1.1796875,
"learning_rate": 0.0004945,
"loss": 6.8652,
"mean_token_accuracy": 0.1142121821641922,
"num_tokens": 1833174.0,
"step": 990
},
{
"entropy": 6.92423644065857,
"epoch": 0.08786647827622748,
"grad_norm": 1.1953125,
"learning_rate": 0.000497,
"loss": 6.9598,
"mean_token_accuracy": 0.11292968466877937,
"num_tokens": 1842409.0,
"step": 995
},
{
"entropy": 6.785798788070679,
"epoch": 0.08830801836806781,
"grad_norm": 1.0859375,
"learning_rate": 0.0004995,
"loss": 6.8616,
"mean_token_accuracy": 0.11990160048007965,
"num_tokens": 1851441.0,
"step": 1000
},
{
"entropy": 7.146481227874756,
"epoch": 0.08874955845990816,
"grad_norm": 1.125,
"learning_rate": 0.000499999998589561,
"loss": 6.9982,
"mean_token_accuracy": 0.11039657667279243,
"num_tokens": 1861188.0,
"step": 1005
},
{
"entropy": 6.901903963088989,
"epoch": 0.0891910985517485,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999999928596523,
"loss": 6.9301,
"mean_token_accuracy": 0.11363181099295616,
"num_tokens": 1870284.0,
"step": 1010
},
{
"entropy": 6.84821515083313,
"epoch": 0.08963263864358884,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999999827221219,
"loss": 6.8983,
"mean_token_accuracy": 0.12304212301969528,
"num_tokens": 1879744.0,
"step": 1015
},
{
"entropy": 6.960662460327148,
"epoch": 0.09007417873542918,
"grad_norm": 1.0,
"learning_rate": 0.0004999999681769696,
"loss": 6.8983,
"mean_token_accuracy": 0.11716285720467567,
"num_tokens": 1889241.0,
"step": 1020
},
{
"entropy": 6.971296596527099,
"epoch": 0.09051571882726951,
"grad_norm": 1.1015625,
"learning_rate": 0.000499999949224196,
"loss": 6.9084,
"mean_token_accuracy": 0.1200313277542591,
"num_tokens": 1898247.0,
"step": 1025
},
{
"entropy": 6.955649042129517,
"epoch": 0.09095725891910986,
"grad_norm": 1.046875,
"learning_rate": 0.0004999999258638013,
"loss": 6.8611,
"mean_token_accuracy": 0.11644072383642197,
"num_tokens": 1907559.0,
"step": 1030
},
{
"entropy": 6.793795824050903,
"epoch": 0.09139879901095019,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999998980957861,
"loss": 6.8669,
"mean_token_accuracy": 0.12169807255268097,
"num_tokens": 1917072.0,
"step": 1035
},
{
"entropy": 6.9457625389099125,
"epoch": 0.09184033910279053,
"grad_norm": 1.03125,
"learning_rate": 0.0004999998659201508,
"loss": 6.8238,
"mean_token_accuracy": 0.1175873689353466,
"num_tokens": 1926597.0,
"step": 1040
},
{
"entropy": 6.854114770889282,
"epoch": 0.09228187919463088,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999998293368961,
"loss": 6.8766,
"mean_token_accuracy": 0.11491318792104721,
"num_tokens": 1935978.0,
"step": 1045
},
{
"entropy": 6.869282388687134,
"epoch": 0.09272341928647121,
"grad_norm": 1.0625,
"learning_rate": 0.0004999997883460227,
"loss": 6.8304,
"mean_token_accuracy": 0.11738137528300285,
"num_tokens": 1944424.0,
"step": 1050
},
{
"entropy": 6.931444597244263,
"epoch": 0.09316495937831155,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999997429475314,
"loss": 6.7926,
"mean_token_accuracy": 0.1264521062374115,
"num_tokens": 1953844.0,
"step": 1055
},
{
"entropy": 6.838017129898072,
"epoch": 0.09360649947015189,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999996931414232,
"loss": 6.8929,
"mean_token_accuracy": 0.12035574093461036,
"num_tokens": 1963974.0,
"step": 1060
},
{
"entropy": 6.908746671676636,
"epoch": 0.09404803956199223,
"grad_norm": 1.078125,
"learning_rate": 0.0004999996389276988,
"loss": 6.8573,
"mean_token_accuracy": 0.12281356453895569,
"num_tokens": 1973466.0,
"step": 1065
},
{
"entropy": 6.815357208251953,
"epoch": 0.09448957965383256,
"grad_norm": 1.09375,
"learning_rate": 0.0004999995803063596,
"loss": 6.8649,
"mean_token_accuracy": 0.11969125345349312,
"num_tokens": 1983478.0,
"step": 1070
},
{
"entropy": 6.947906064987182,
"epoch": 0.0949311197456729,
"grad_norm": 1.09375,
"learning_rate": 0.0004999995172774065,
"loss": 6.9373,
"mean_token_accuracy": 0.11548090726137161,
"num_tokens": 1992775.0,
"step": 1075
},
{
"entropy": 6.954066181182862,
"epoch": 0.09537265983751325,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999994498408408,
"loss": 6.9065,
"mean_token_accuracy": 0.11163463667035103,
"num_tokens": 2002526.0,
"step": 1080
},
{
"entropy": 6.880347061157226,
"epoch": 0.09581419992935358,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999993779966639,
"loss": 6.9226,
"mean_token_accuracy": 0.11343899965286255,
"num_tokens": 2012476.0,
"step": 1085
},
{
"entropy": 6.772713136672974,
"epoch": 0.09625574002119393,
"grad_norm": 1.171875,
"learning_rate": 0.0004999993017448771,
"loss": 6.7619,
"mean_token_accuracy": 0.1315491996705532,
"num_tokens": 2021252.0,
"step": 1090
},
{
"entropy": 6.972479009628296,
"epoch": 0.09669728011303426,
"grad_norm": 1.046875,
"learning_rate": 0.0004999992210854821,
"loss": 6.9025,
"mean_token_accuracy": 0.1197818472981453,
"num_tokens": 2031438.0,
"step": 1095
},
{
"entropy": 6.9433167457580565,
"epoch": 0.0971388202048746,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999991360184801,
"loss": 6.9497,
"mean_token_accuracy": 0.11331594586372376,
"num_tokens": 2041319.0,
"step": 1100
},
{
"entropy": 6.875679302215576,
"epoch": 0.09758036029671494,
"grad_norm": 0.921875,
"learning_rate": 0.0004999990465438731,
"loss": 6.9417,
"mean_token_accuracy": 0.11621764153242112,
"num_tokens": 2052060.0,
"step": 1105
},
{
"entropy": 6.868831157684326,
"epoch": 0.09802190038855528,
"grad_norm": 1.078125,
"learning_rate": 0.0004999989526616628,
"loss": 6.8207,
"mean_token_accuracy": 0.12271343320608138,
"num_tokens": 2061331.0,
"step": 1110
},
{
"entropy": 6.84274697303772,
"epoch": 0.09846344048039563,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999988543718509,
"loss": 6.8327,
"mean_token_accuracy": 0.1182619109749794,
"num_tokens": 2070006.0,
"step": 1115
},
{
"entropy": 6.921954727172851,
"epoch": 0.09890498057223596,
"grad_norm": 1.125,
"learning_rate": 0.0004999987516744394,
"loss": 6.7824,
"mean_token_accuracy": 0.12447450086474418,
"num_tokens": 2079089.0,
"step": 1120
},
{
"entropy": 6.797588872909546,
"epoch": 0.0993465206640763,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999986445694303,
"loss": 6.778,
"mean_token_accuracy": 0.118412546813488,
"num_tokens": 2087237.0,
"step": 1125
},
{
"entropy": 6.792767906188965,
"epoch": 0.09978806075591663,
"grad_norm": 1.125,
"learning_rate": 0.0004999985330568258,
"loss": 6.7448,
"mean_token_accuracy": 0.12214136868715286,
"num_tokens": 2096598.0,
"step": 1130
},
{
"entropy": 6.833769607543945,
"epoch": 0.10022960084775698,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999984171366278,
"loss": 6.8458,
"mean_token_accuracy": 0.11508344933390617,
"num_tokens": 2106106.0,
"step": 1135
},
{
"entropy": 6.860817527770996,
"epoch": 0.10067114093959731,
"grad_norm": 1.0234375,
"learning_rate": 0.000499998296808839,
"loss": 6.8066,
"mean_token_accuracy": 0.11775731146335602,
"num_tokens": 2115478.0,
"step": 1140
},
{
"entropy": 6.8433990478515625,
"epoch": 0.10111268103143765,
"grad_norm": 1.28125,
"learning_rate": 0.0004999981720734615,
"loss": 6.8429,
"mean_token_accuracy": 0.11517784297466278,
"num_tokens": 2124439.0,
"step": 1145
},
{
"entropy": 6.893320178985595,
"epoch": 0.101554221123278,
"grad_norm": 1.140625,
"learning_rate": 0.0004999980429304977,
"loss": 6.861,
"mean_token_accuracy": 0.11661542877554894,
"num_tokens": 2133718.0,
"step": 1150
},
{
"entropy": 6.720952081680298,
"epoch": 0.10199576121511833,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999979093799502,
"loss": 6.7669,
"mean_token_accuracy": 0.1219759725034237,
"num_tokens": 2142978.0,
"step": 1155
},
{
"entropy": 6.826765871047973,
"epoch": 0.10243730130695868,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999977714218217,
"loss": 6.8287,
"mean_token_accuracy": 0.11483320519328118,
"num_tokens": 2152250.0,
"step": 1160
},
{
"entropy": 6.841332817077637,
"epoch": 0.102878841398799,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999976290561147,
"loss": 6.8186,
"mean_token_accuracy": 0.11421233564615249,
"num_tokens": 2161620.0,
"step": 1165
},
{
"entropy": 6.8951427936553955,
"epoch": 0.10332038149063935,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999974822828322,
"loss": 6.8321,
"mean_token_accuracy": 0.11468955874443054,
"num_tokens": 2170856.0,
"step": 1170
},
{
"entropy": 6.783407306671142,
"epoch": 0.10376192158247968,
"grad_norm": 1.0078125,
"learning_rate": 0.000499997331101977,
"loss": 6.8226,
"mean_token_accuracy": 0.1140426091849804,
"num_tokens": 2180926.0,
"step": 1175
},
{
"entropy": 6.841979598999023,
"epoch": 0.10420346167432003,
"grad_norm": 1.03125,
"learning_rate": 0.000499997175513552,
"loss": 6.7918,
"mean_token_accuracy": 0.11650402471423149,
"num_tokens": 2190248.0,
"step": 1180
},
{
"entropy": 6.812575197219848,
"epoch": 0.10464500176616037,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999970155175603,
"loss": 6.8152,
"mean_token_accuracy": 0.12006641253829002,
"num_tokens": 2199833.0,
"step": 1185
},
{
"entropy": 6.79837212562561,
"epoch": 0.1050865418580007,
"grad_norm": 1.0390625,
"learning_rate": 0.000499996851114005,
"loss": 6.7952,
"mean_token_accuracy": 0.12233175113797187,
"num_tokens": 2208240.0,
"step": 1190
},
{
"entropy": 6.796438360214234,
"epoch": 0.10552808194984105,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999966823028894,
"loss": 6.8365,
"mean_token_accuracy": 0.11369045302271844,
"num_tokens": 2218758.0,
"step": 1195
},
{
"entropy": 6.935247182846069,
"epoch": 0.10596962204168138,
"grad_norm": 0.9921875,
"learning_rate": 0.0004999965090842168,
"loss": 6.8302,
"mean_token_accuracy": 0.12288962900638581,
"num_tokens": 2228443.0,
"step": 1200
},
{
"entropy": 6.712041759490967,
"epoch": 0.10641116213352173,
"grad_norm": 1.140625,
"learning_rate": 0.0004999963314579905,
"loss": 6.6787,
"mean_token_accuracy": 0.13284276723861693,
"num_tokens": 2236787.0,
"step": 1205
},
{
"entropy": 6.800426197052002,
"epoch": 0.10685270222536206,
"grad_norm": 1.046875,
"learning_rate": 0.0004999961494242139,
"loss": 6.8593,
"mean_token_accuracy": 0.11500039100646972,
"num_tokens": 2247089.0,
"step": 1210
},
{
"entropy": 6.786765146255493,
"epoch": 0.1072942423172024,
"grad_norm": 1.078125,
"learning_rate": 0.0004999959629828908,
"loss": 6.7664,
"mean_token_accuracy": 0.11581304892897606,
"num_tokens": 2256045.0,
"step": 1215
},
{
"entropy": 6.886348628997803,
"epoch": 0.10773578240904275,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999957721340248,
"loss": 6.8384,
"mean_token_accuracy": 0.12041957154870034,
"num_tokens": 2265835.0,
"step": 1220
},
{
"entropy": 6.722246551513672,
"epoch": 0.10817732250088308,
"grad_norm": 1.2421875,
"learning_rate": 0.0004999955768776195,
"loss": 6.7786,
"mean_token_accuracy": 0.12380016893148423,
"num_tokens": 2275318.0,
"step": 1225
},
{
"entropy": 6.808089828491211,
"epoch": 0.10861886259272342,
"grad_norm": 1.109375,
"learning_rate": 0.0004999953772136788,
"loss": 6.7658,
"mean_token_accuracy": 0.12278728261590004,
"num_tokens": 2284821.0,
"step": 1230
},
{
"entropy": 6.8324737548828125,
"epoch": 0.10906040268456375,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999951731422068,
"loss": 6.7482,
"mean_token_accuracy": 0.11858468577265739,
"num_tokens": 2294013.0,
"step": 1235
},
{
"entropy": 6.786966562271118,
"epoch": 0.1095019427764041,
"grad_norm": 1.109375,
"learning_rate": 0.0004999949646632072,
"loss": 6.73,
"mean_token_accuracy": 0.12245445623993874,
"num_tokens": 2302727.0,
"step": 1240
},
{
"entropy": 6.705034589767456,
"epoch": 0.10994348286824443,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999947517766842,
"loss": 6.7649,
"mean_token_accuracy": 0.12241661176085472,
"num_tokens": 2312032.0,
"step": 1245
},
{
"entropy": 6.982846593856811,
"epoch": 0.11038502296008477,
"grad_norm": 1.09375,
"learning_rate": 0.000499994534482642,
"loss": 6.8443,
"mean_token_accuracy": 0.11787378117442131,
"num_tokens": 2321839.0,
"step": 1250
},
{
"entropy": 6.719681882858277,
"epoch": 0.11082656305192512,
"grad_norm": 0.94921875,
"learning_rate": 0.0004999943127810847,
"loss": 6.8137,
"mean_token_accuracy": 0.11633599549531937,
"num_tokens": 2331255.0,
"step": 1255
},
{
"entropy": 6.744579744338989,
"epoch": 0.11126810314376545,
"grad_norm": 1.0625,
"learning_rate": 0.0004999940866720169,
"loss": 6.6363,
"mean_token_accuracy": 0.13151753917336464,
"num_tokens": 2340038.0,
"step": 1260
},
{
"entropy": 6.680500268936157,
"epoch": 0.1117096432356058,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999938561554429,
"loss": 6.7486,
"mean_token_accuracy": 0.1244722306728363,
"num_tokens": 2348901.0,
"step": 1265
},
{
"entropy": 6.772228145599366,
"epoch": 0.11215118332744613,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999936212313672,
"loss": 6.827,
"mean_token_accuracy": 0.11700050979852676,
"num_tokens": 2358842.0,
"step": 1270
},
{
"entropy": 6.788944578170776,
"epoch": 0.11259272341928647,
"grad_norm": 1.109375,
"learning_rate": 0.0004999933818997943,
"loss": 6.7218,
"mean_token_accuracy": 0.1224422350525856,
"num_tokens": 2368650.0,
"step": 1275
},
{
"entropy": 6.765577077865601,
"epoch": 0.1130342635111268,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999931381607292,
"loss": 6.7811,
"mean_token_accuracy": 0.12511691078543663,
"num_tokens": 2377916.0,
"step": 1280
},
{
"entropy": 6.782421112060547,
"epoch": 0.11347580360296715,
"grad_norm": 1.09375,
"learning_rate": 0.0004999928900141764,
"loss": 6.7279,
"mean_token_accuracy": 0.12245306149125099,
"num_tokens": 2387507.0,
"step": 1285
},
{
"entropy": 6.7623984813690186,
"epoch": 0.1139173436948075,
"grad_norm": 1.1328125,
"learning_rate": 0.000499992637460141,
"loss": 6.7762,
"mean_token_accuracy": 0.1228838860988617,
"num_tokens": 2396148.0,
"step": 1290
},
{
"entropy": 6.7144958019256595,
"epoch": 0.11435888378664782,
"grad_norm": 1.015625,
"learning_rate": 0.0004999923804986275,
"loss": 6.6356,
"mean_token_accuracy": 0.12269090339541436,
"num_tokens": 2404891.0,
"step": 1295
},
{
"entropy": 6.786207437515259,
"epoch": 0.11480042387848817,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999921191296415,
"loss": 6.6766,
"mean_token_accuracy": 0.12154053971171379,
"num_tokens": 2414406.0,
"step": 1300
},
{
"entropy": 6.703838205337524,
"epoch": 0.1152419639703285,
"grad_norm": 1.046875,
"learning_rate": 0.0004999918533531877,
"loss": 6.7829,
"mean_token_accuracy": 0.12308658063411712,
"num_tokens": 2424363.0,
"step": 1305
},
{
"entropy": 6.811527252197266,
"epoch": 0.11568350406216885,
"grad_norm": 1.0625,
"learning_rate": 0.0004999915831692714,
"loss": 6.7213,
"mean_token_accuracy": 0.12458684146404267,
"num_tokens": 2433753.0,
"step": 1310
},
{
"entropy": 6.642784214019775,
"epoch": 0.11612504415400918,
"grad_norm": 1.125,
"learning_rate": 0.0004999913085778981,
"loss": 6.7353,
"mean_token_accuracy": 0.1179688699543476,
"num_tokens": 2443275.0,
"step": 1315
},
{
"entropy": 6.845086908340454,
"epoch": 0.11656658424584952,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999910295790729,
"loss": 6.7522,
"mean_token_accuracy": 0.116317979991436,
"num_tokens": 2452510.0,
"step": 1320
},
{
"entropy": 6.789072132110595,
"epoch": 0.11700812433768987,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999907461728014,
"loss": 6.8496,
"mean_token_accuracy": 0.1186776876449585,
"num_tokens": 2462742.0,
"step": 1325
},
{
"entropy": 6.73516001701355,
"epoch": 0.1174496644295302,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999904583590893,
"loss": 6.7087,
"mean_token_accuracy": 0.11719698682427407,
"num_tokens": 2471409.0,
"step": 1330
},
{
"entropy": 6.80999174118042,
"epoch": 0.11789120452137054,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999901661379418,
"loss": 6.66,
"mean_token_accuracy": 0.12834221944212915,
"num_tokens": 2481011.0,
"step": 1335
},
{
"entropy": 6.656212949752808,
"epoch": 0.11833274461321087,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999898695093652,
"loss": 6.7655,
"mean_token_accuracy": 0.1210456795990467,
"num_tokens": 2490664.0,
"step": 1340
},
{
"entropy": 6.774575805664062,
"epoch": 0.11877428470505122,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999895684733648,
"loss": 6.6871,
"mean_token_accuracy": 0.12933790683746338,
"num_tokens": 2499799.0,
"step": 1345
},
{
"entropy": 6.75890417098999,
"epoch": 0.11921582479689156,
"grad_norm": 1.5703125,
"learning_rate": 0.0004999892630299467,
"loss": 6.6744,
"mean_token_accuracy": 0.12494029551744461,
"num_tokens": 2508780.0,
"step": 1350
},
{
"entropy": 6.714679288864136,
"epoch": 0.1196573648887319,
"grad_norm": 1.078125,
"learning_rate": 0.0004999889531791171,
"loss": 6.6833,
"mean_token_accuracy": 0.12272755652666092,
"num_tokens": 2517741.0,
"step": 1355
},
{
"entropy": 6.662789583206177,
"epoch": 0.12009890498057224,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999886389208817,
"loss": 6.7716,
"mean_token_accuracy": 0.12046518027782441,
"num_tokens": 2528742.0,
"step": 1360
},
{
"entropy": 6.69284987449646,
"epoch": 0.12054044507241257,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999883202552468,
"loss": 6.7043,
"mean_token_accuracy": 0.12755436450242996,
"num_tokens": 2538609.0,
"step": 1365
},
{
"entropy": 6.828431463241577,
"epoch": 0.12098198516425292,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999879971822189,
"loss": 6.684,
"mean_token_accuracy": 0.11924384832382202,
"num_tokens": 2547772.0,
"step": 1370
},
{
"entropy": 6.571238899230957,
"epoch": 0.12142352525609325,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999876697018038,
"loss": 6.6582,
"mean_token_accuracy": 0.12748303934931754,
"num_tokens": 2556114.0,
"step": 1375
},
{
"entropy": 6.8254400253295895,
"epoch": 0.1218650653479336,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999873378140085,
"loss": 6.7179,
"mean_token_accuracy": 0.1250918261706829,
"num_tokens": 2566814.0,
"step": 1380
},
{
"entropy": 6.614608812332153,
"epoch": 0.12230660543977394,
"grad_norm": 1.1875,
"learning_rate": 0.0004999870015188389,
"loss": 6.6667,
"mean_token_accuracy": 0.12528225034475327,
"num_tokens": 2576030.0,
"step": 1385
},
{
"entropy": 6.711950302124023,
"epoch": 0.12274814553161427,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999866608163021,
"loss": 6.689,
"mean_token_accuracy": 0.12896783277392387,
"num_tokens": 2585756.0,
"step": 1390
},
{
"entropy": 6.719356441497803,
"epoch": 0.12318968562345461,
"grad_norm": 1.09375,
"learning_rate": 0.0004999863157064045,
"loss": 6.7433,
"mean_token_accuracy": 0.12513794749975204,
"num_tokens": 2595676.0,
"step": 1395
},
{
"entropy": 6.758820867538452,
"epoch": 0.12363122571529495,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999859661891529,
"loss": 6.7445,
"mean_token_accuracy": 0.12377320975065231,
"num_tokens": 2606197.0,
"step": 1400
},
{
"entropy": 6.740264415740967,
"epoch": 0.12407276580713529,
"grad_norm": 1.21875,
"learning_rate": 0.0004999856122645543,
"loss": 6.6646,
"mean_token_accuracy": 0.12415967881679535,
"num_tokens": 2615311.0,
"step": 1405
},
{
"entropy": 6.632203722000122,
"epoch": 0.12451430589897562,
"grad_norm": 1.15625,
"learning_rate": 0.0004999852539326154,
"loss": 6.5799,
"mean_token_accuracy": 0.1287233628332615,
"num_tokens": 2624074.0,
"step": 1410
},
{
"entropy": 6.623841571807861,
"epoch": 0.12495584599081597,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999848911933434,
"loss": 6.7141,
"mean_token_accuracy": 0.13292624652385712,
"num_tokens": 2633877.0,
"step": 1415
},
{
"entropy": 6.68168888092041,
"epoch": 0.1253973860826563,
"grad_norm": 0.921875,
"learning_rate": 0.0004999845240467453,
"loss": 6.6526,
"mean_token_accuracy": 0.12299527004361152,
"num_tokens": 2643330.0,
"step": 1420
},
{
"entropy": 6.702590560913086,
"epoch": 0.12583892617449666,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999841524928282,
"loss": 6.6348,
"mean_token_accuracy": 0.12881363406777382,
"num_tokens": 2652070.0,
"step": 1425
},
{
"entropy": 6.6873023986816404,
"epoch": 0.126280466266337,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999837765315997,
"loss": 6.6718,
"mean_token_accuracy": 0.12390449419617652,
"num_tokens": 2660546.0,
"step": 1430
},
{
"entropy": 6.522921085357666,
"epoch": 0.12672200635817732,
"grad_norm": 0.93359375,
"learning_rate": 0.0004999833961630669,
"loss": 6.5631,
"mean_token_accuracy": 0.13146114349365234,
"num_tokens": 2669938.0,
"step": 1435
},
{
"entropy": 6.8073399543762205,
"epoch": 0.12716354645001765,
"grad_norm": 0.94140625,
"learning_rate": 0.0004999830113872374,
"loss": 6.6919,
"mean_token_accuracy": 0.12384787425398827,
"num_tokens": 2679814.0,
"step": 1440
},
{
"entropy": 6.547947025299072,
"epoch": 0.127605086541858,
"grad_norm": 1.09375,
"learning_rate": 0.0004999826222041186,
"loss": 6.6066,
"mean_token_accuracy": 0.1329873576760292,
"num_tokens": 2688733.0,
"step": 1445
},
{
"entropy": 6.649660348892212,
"epoch": 0.12804662663369834,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999822286137182,
"loss": 6.5858,
"mean_token_accuracy": 0.1287431985139847,
"num_tokens": 2697744.0,
"step": 1450
},
{
"entropy": 6.6083179950714115,
"epoch": 0.12848816672553867,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999818306160439,
"loss": 6.5587,
"mean_token_accuracy": 0.13241407200694083,
"num_tokens": 2707037.0,
"step": 1455
},
{
"entropy": 6.707999324798584,
"epoch": 0.12892970681737903,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999814282111034,
"loss": 6.7159,
"mean_token_accuracy": 0.12165460363030434,
"num_tokens": 2717345.0,
"step": 1460
},
{
"entropy": 6.706764125823975,
"epoch": 0.12937124690921936,
"grad_norm": 1.09375,
"learning_rate": 0.0004999810213989047,
"loss": 6.6771,
"mean_token_accuracy": 0.11996371075510978,
"num_tokens": 2726892.0,
"step": 1465
},
{
"entropy": 6.606377267837525,
"epoch": 0.1298127870010597,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999806101794558,
"loss": 6.6282,
"mean_token_accuracy": 0.12699908390641212,
"num_tokens": 2736479.0,
"step": 1470
},
{
"entropy": 6.772217559814453,
"epoch": 0.13025432709290002,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999801945527648,
"loss": 6.6764,
"mean_token_accuracy": 0.12172863110899926,
"num_tokens": 2745998.0,
"step": 1475
},
{
"entropy": 6.60609245300293,
"epoch": 0.13069586718474038,
"grad_norm": 1.03125,
"learning_rate": 0.0004999797745188395,
"loss": 6.6578,
"mean_token_accuracy": 0.12872695848345755,
"num_tokens": 2754346.0,
"step": 1480
},
{
"entropy": 6.701602792739868,
"epoch": 0.13113740727658071,
"grad_norm": 1.078125,
"learning_rate": 0.0004999793500776886,
"loss": 6.6094,
"mean_token_accuracy": 0.13089651241898537,
"num_tokens": 2763391.0,
"step": 1485
},
{
"entropy": 6.633615016937256,
"epoch": 0.13157894736842105,
"grad_norm": 1.109375,
"learning_rate": 0.0004999789212293201,
"loss": 6.669,
"mean_token_accuracy": 0.12867793068289757,
"num_tokens": 2772764.0,
"step": 1490
},
{
"entropy": 6.7330268859863285,
"epoch": 0.1320204874602614,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999784879737423,
"loss": 6.7564,
"mean_token_accuracy": 0.1226215623319149,
"num_tokens": 2782312.0,
"step": 1495
},
{
"entropy": 6.67516393661499,
"epoch": 0.13246202755210174,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999780503109642,
"loss": 6.6484,
"mean_token_accuracy": 0.12383122742176056,
"num_tokens": 2791159.0,
"step": 1500
},
{
"entropy": 6.610153341293335,
"epoch": 0.13290356764394207,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999776082409939,
"loss": 6.4972,
"mean_token_accuracy": 0.13475448414683341,
"num_tokens": 2799319.0,
"step": 1505
},
{
"entropy": 6.595534706115723,
"epoch": 0.1333451077357824,
"grad_norm": 1.09375,
"learning_rate": 0.0004999771617638401,
"loss": 6.6108,
"mean_token_accuracy": 0.1235594168305397,
"num_tokens": 2807401.0,
"step": 1510
},
{
"entropy": 6.707736253738403,
"epoch": 0.13378664782762276,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999767108795118,
"loss": 6.661,
"mean_token_accuracy": 0.1273370273411274,
"num_tokens": 2817734.0,
"step": 1515
},
{
"entropy": 6.612422895431519,
"epoch": 0.1342281879194631,
"grad_norm": 1.1015625,
"learning_rate": 0.0004999762555880176,
"loss": 6.6679,
"mean_token_accuracy": 0.12645771428942681,
"num_tokens": 2828235.0,
"step": 1520
},
{
"entropy": 6.702644395828247,
"epoch": 0.13466972801130342,
"grad_norm": 1.0625,
"learning_rate": 0.0004999757958893666,
"loss": 6.6872,
"mean_token_accuracy": 0.12617624551057816,
"num_tokens": 2837453.0,
"step": 1525
},
{
"entropy": 6.566971969604492,
"epoch": 0.13511126810314378,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999753317835677,
"loss": 6.6608,
"mean_token_accuracy": 0.12031328305602074,
"num_tokens": 2847055.0,
"step": 1530
},
{
"entropy": 6.747590446472168,
"epoch": 0.1355528081949841,
"grad_norm": 1.046875,
"learning_rate": 0.0004999748632706299,
"loss": 6.6333,
"mean_token_accuracy": 0.12874888330698014,
"num_tokens": 2857101.0,
"step": 1535
},
{
"entropy": 6.58017520904541,
"epoch": 0.13599434828682444,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999743903505626,
"loss": 6.5493,
"mean_token_accuracy": 0.12921440675854684,
"num_tokens": 2866685.0,
"step": 1540
},
{
"entropy": 6.686506080627441,
"epoch": 0.13643588837866477,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999739130233749,
"loss": 6.6483,
"mean_token_accuracy": 0.12603347525000572,
"num_tokens": 2876022.0,
"step": 1545
},
{
"entropy": 6.676938915252686,
"epoch": 0.13687742847050513,
"grad_norm": 0.91796875,
"learning_rate": 0.0004999734312890761,
"loss": 6.5654,
"mean_token_accuracy": 0.1277615949511528,
"num_tokens": 2885560.0,
"step": 1550
},
{
"entropy": 6.552069282531738,
"epoch": 0.13731896856234546,
"grad_norm": 0.94921875,
"learning_rate": 0.0004999729451476757,
"loss": 6.6064,
"mean_token_accuracy": 0.1283570185303688,
"num_tokens": 2894686.0,
"step": 1555
},
{
"entropy": 6.67106065750122,
"epoch": 0.1377605086541858,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999724545991835,
"loss": 6.6135,
"mean_token_accuracy": 0.13272278234362603,
"num_tokens": 2904390.0,
"step": 1560
},
{
"entropy": 6.641124057769775,
"epoch": 0.13820204874602615,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999719596436086,
"loss": 6.6751,
"mean_token_accuracy": 0.12594080567359925,
"num_tokens": 2913311.0,
"step": 1565
},
{
"entropy": 6.69909701347351,
"epoch": 0.13864358883786648,
"grad_norm": 1.0,
"learning_rate": 0.0004999714602809611,
"loss": 6.5549,
"mean_token_accuracy": 0.13006579801440238,
"num_tokens": 2923196.0,
"step": 1570
},
{
"entropy": 6.554364538192749,
"epoch": 0.1390851289297068,
"grad_norm": 1.1484375,
"learning_rate": 0.0004999709565112506,
"loss": 6.6195,
"mean_token_accuracy": 0.12607380226254464,
"num_tokens": 2932813.0,
"step": 1575
},
{
"entropy": 6.618018245697021,
"epoch": 0.13952666902154715,
"grad_norm": 0.97265625,
"learning_rate": 0.000499970448334487,
"loss": 6.5517,
"mean_token_accuracy": 0.1182281494140625,
"num_tokens": 2942694.0,
"step": 1580
},
{
"entropy": 6.567258405685425,
"epoch": 0.1399682091133875,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999699357506803,
"loss": 6.4833,
"mean_token_accuracy": 0.13758974224328996,
"num_tokens": 2950932.0,
"step": 1585
},
{
"entropy": 6.665033578872681,
"epoch": 0.14040974920522784,
"grad_norm": 1.0625,
"learning_rate": 0.0004999694187598406,
"loss": 6.5959,
"mean_token_accuracy": 0.13096074685454367,
"num_tokens": 2960102.0,
"step": 1590
},
{
"entropy": 6.5607537746429445,
"epoch": 0.14085128929706817,
"grad_norm": 1.515625,
"learning_rate": 0.0004999688973619777,
"loss": 6.5666,
"mean_token_accuracy": 0.12616149932146073,
"num_tokens": 2969968.0,
"step": 1595
},
{
"entropy": 6.565665245056152,
"epoch": 0.14129282938890853,
"grad_norm": 0.9296875,
"learning_rate": 0.0004999683715571022,
"loss": 6.5376,
"mean_token_accuracy": 0.13295454159379005,
"num_tokens": 2978880.0,
"step": 1600
},
{
"entropy": 6.6195861339569095,
"epoch": 0.14173436948074886,
"grad_norm": 0.9296875,
"learning_rate": 0.0004999678413452242,
"loss": 6.5692,
"mean_token_accuracy": 0.1263133704662323,
"num_tokens": 2988369.0,
"step": 1605
},
{
"entropy": 6.635553073883057,
"epoch": 0.1421759095725892,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999673067263542,
"loss": 6.6144,
"mean_token_accuracy": 0.12454515546560288,
"num_tokens": 2997070.0,
"step": 1610
},
{
"entropy": 6.616920137405396,
"epoch": 0.14261744966442952,
"grad_norm": 1.0,
"learning_rate": 0.0004999667677005026,
"loss": 6.5553,
"mean_token_accuracy": 0.13325243517756463,
"num_tokens": 3006547.0,
"step": 1615
},
{
"entropy": 6.574477910995483,
"epoch": 0.14305898975626988,
"grad_norm": 0.96875,
"learning_rate": 0.0004999662242676799,
"loss": 6.5792,
"mean_token_accuracy": 0.12996308133006096,
"num_tokens": 3015821.0,
"step": 1620
},
{
"entropy": 6.618298435211182,
"epoch": 0.1435005298481102,
"grad_norm": 1.015625,
"learning_rate": 0.0004999656764278968,
"loss": 6.5491,
"mean_token_accuracy": 0.13459995537996292,
"num_tokens": 3024750.0,
"step": 1625
},
{
"entropy": 6.57071361541748,
"epoch": 0.14394206993995054,
"grad_norm": 1.078125,
"learning_rate": 0.0004999651241811642,
"loss": 6.5191,
"mean_token_accuracy": 0.13164762035012245,
"num_tokens": 3033345.0,
"step": 1630
},
{
"entropy": 6.575192975997925,
"epoch": 0.1443836100317909,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999645675274925,
"loss": 6.4902,
"mean_token_accuracy": 0.13214875981211663,
"num_tokens": 3042060.0,
"step": 1635
},
{
"entropy": 6.564555883407593,
"epoch": 0.14482515012363123,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999640064668931,
"loss": 6.6404,
"mean_token_accuracy": 0.12763455510139465,
"num_tokens": 3052490.0,
"step": 1640
},
{
"entropy": 6.715090990066528,
"epoch": 0.14526669021547156,
"grad_norm": 1.078125,
"learning_rate": 0.0004999634409993766,
"loss": 6.6155,
"mean_token_accuracy": 0.12552304938435555,
"num_tokens": 3061934.0,
"step": 1645
},
{
"entropy": 6.513729286193848,
"epoch": 0.1457082303073119,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999628711249544,
"loss": 6.5198,
"mean_token_accuracy": 0.13856697753071784,
"num_tokens": 3070890.0,
"step": 1650
},
{
"entropy": 6.682709264755249,
"epoch": 0.14614977039915225,
"grad_norm": 0.98828125,
"learning_rate": 0.0004999622968436373,
"loss": 6.5315,
"mean_token_accuracy": 0.128802065551281,
"num_tokens": 3079933.0,
"step": 1655
},
{
"entropy": 6.47434253692627,
"epoch": 0.14659131049099258,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999617181554369,
"loss": 6.6016,
"mean_token_accuracy": 0.13180896043777465,
"num_tokens": 3089910.0,
"step": 1660
},
{
"entropy": 6.710703754425049,
"epoch": 0.1470328505828329,
"grad_norm": 1.2265625,
"learning_rate": 0.0004999611350603643,
"loss": 6.5781,
"mean_token_accuracy": 0.13360659033060074,
"num_tokens": 3098676.0,
"step": 1665
},
{
"entropy": 6.531248569488525,
"epoch": 0.14747439067467327,
"grad_norm": 0.9765625,
"learning_rate": 0.000499960547558431,
"loss": 6.69,
"mean_token_accuracy": 0.12630268037319184,
"num_tokens": 3109055.0,
"step": 1670
},
{
"entropy": 6.600419187545777,
"epoch": 0.1479159307665136,
"grad_norm": 1.09375,
"learning_rate": 0.0004999599556496486,
"loss": 6.5276,
"mean_token_accuracy": 0.13437643125653267,
"num_tokens": 3117517.0,
"step": 1675
},
{
"entropy": 6.542807102203369,
"epoch": 0.14835747085835393,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999593593340286,
"loss": 6.5288,
"mean_token_accuracy": 0.13295082822442056,
"num_tokens": 3126606.0,
"step": 1680
},
{
"entropy": 6.650139379501343,
"epoch": 0.14879901095019427,
"grad_norm": 1.0,
"learning_rate": 0.0004999587586115826,
"loss": 6.551,
"mean_token_accuracy": 0.13533952906727792,
"num_tokens": 3135444.0,
"step": 1685
},
{
"entropy": 6.524611854553223,
"epoch": 0.14924055104203462,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999581534823226,
"loss": 6.4885,
"mean_token_accuracy": 0.13537175804376603,
"num_tokens": 3144967.0,
"step": 1690
},
{
"entropy": 6.606992101669311,
"epoch": 0.14968209113387496,
"grad_norm": 1.046875,
"learning_rate": 0.0004999575439462601,
"loss": 6.5042,
"mean_token_accuracy": 0.1286872260272503,
"num_tokens": 3153898.0,
"step": 1695
},
{
"entropy": 6.504314661026001,
"epoch": 0.1501236312257153,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999569300034075,
"loss": 6.5644,
"mean_token_accuracy": 0.12845081239938735,
"num_tokens": 3162341.0,
"step": 1700
},
{
"entropy": 6.507896661758423,
"epoch": 0.15056517131755565,
"grad_norm": 1.09375,
"learning_rate": 0.0004999563116537764,
"loss": 6.3613,
"mean_token_accuracy": 0.14074554145336152,
"num_tokens": 3171420.0,
"step": 1705
},
{
"entropy": 6.5167927742004395,
"epoch": 0.15100671140939598,
"grad_norm": 1.015625,
"learning_rate": 0.0004999556888973792,
"loss": 6.4165,
"mean_token_accuracy": 0.12971381321549416,
"num_tokens": 3180221.0,
"step": 1710
},
{
"entropy": 6.600985956192017,
"epoch": 0.1514482515012363,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999550617342279,
"loss": 6.5615,
"mean_token_accuracy": 0.12731998935341834,
"num_tokens": 3189156.0,
"step": 1715
},
{
"entropy": 6.536636877059936,
"epoch": 0.15188979159307664,
"grad_norm": 1.03125,
"learning_rate": 0.000499954430164335,
"loss": 6.4905,
"mean_token_accuracy": 0.1309817299246788,
"num_tokens": 3199870.0,
"step": 1720
},
{
"entropy": 6.541285371780395,
"epoch": 0.152331331684917,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999537941877127,
"loss": 6.4727,
"mean_token_accuracy": 0.13528374806046486,
"num_tokens": 3208815.0,
"step": 1725
},
{
"entropy": 6.487531661987305,
"epoch": 0.15277287177675733,
"grad_norm": 0.984375,
"learning_rate": 0.0004999531538043735,
"loss": 6.5498,
"mean_token_accuracy": 0.12755031064152716,
"num_tokens": 3218692.0,
"step": 1730
},
{
"entropy": 6.591389942169189,
"epoch": 0.15321441186859766,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999525090143298,
"loss": 6.5177,
"mean_token_accuracy": 0.13854537010192872,
"num_tokens": 3227604.0,
"step": 1735
},
{
"entropy": 6.57657470703125,
"epoch": 0.15365595196043802,
"grad_norm": 1.03125,
"learning_rate": 0.0004999518598175946,
"loss": 6.5291,
"mean_token_accuracy": 0.13887950852513314,
"num_tokens": 3237912.0,
"step": 1740
},
{
"entropy": 6.481386184692383,
"epoch": 0.15409749205227835,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999512062141805,
"loss": 6.3914,
"mean_token_accuracy": 0.1368810623884201,
"num_tokens": 3246003.0,
"step": 1745
},
{
"entropy": 6.51813645362854,
"epoch": 0.15453903214411868,
"grad_norm": 0.9140625,
"learning_rate": 0.0004999505482040999,
"loss": 6.5332,
"mean_token_accuracy": 0.13183941319584846,
"num_tokens": 3256363.0,
"step": 1750
},
{
"entropy": 6.553296089172363,
"epoch": 0.154980572235959,
"grad_norm": 1.046875,
"learning_rate": 0.0004999498857873662,
"loss": 6.5312,
"mean_token_accuracy": 0.1321260340511799,
"num_tokens": 3265822.0,
"step": 1755
},
{
"entropy": 6.417472457885742,
"epoch": 0.15542211232779937,
"grad_norm": 1.078125,
"learning_rate": 0.0004999492189639921,
"loss": 6.424,
"mean_token_accuracy": 0.13568418473005295,
"num_tokens": 3274614.0,
"step": 1760
},
{
"entropy": 6.586168956756592,
"epoch": 0.1558636524196397,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999485477339907,
"loss": 6.5175,
"mean_token_accuracy": 0.12809595912694932,
"num_tokens": 3283800.0,
"step": 1765
},
{
"entropy": 6.485697317123413,
"epoch": 0.15630519251148003,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999478720973753,
"loss": 6.4297,
"mean_token_accuracy": 0.13804005309939385,
"num_tokens": 3293221.0,
"step": 1770
},
{
"entropy": 6.522076082229614,
"epoch": 0.1567467326033204,
"grad_norm": 0.97265625,
"learning_rate": 0.000499947192054159,
"loss": 6.5876,
"mean_token_accuracy": 0.12661009952425956,
"num_tokens": 3302852.0,
"step": 1775
},
{
"entropy": 6.621862745285034,
"epoch": 0.15718827269516072,
"grad_norm": 1.1171875,
"learning_rate": 0.000499946507604355,
"loss": 6.4486,
"mean_token_accuracy": 0.1398267850279808,
"num_tokens": 3311752.0,
"step": 1780
},
{
"entropy": 6.4172522068023685,
"epoch": 0.15762981278700106,
"grad_norm": 1.09375,
"learning_rate": 0.000499945818747977,
"loss": 6.5267,
"mean_token_accuracy": 0.13450878411531447,
"num_tokens": 3321339.0,
"step": 1785
},
{
"entropy": 6.623373413085938,
"epoch": 0.1580713528788414,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999451254850383,
"loss": 6.5377,
"mean_token_accuracy": 0.13095242530107498,
"num_tokens": 3330269.0,
"step": 1790
},
{
"entropy": 6.57389874458313,
"epoch": 0.15851289297068175,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999444278155525,
"loss": 6.4619,
"mean_token_accuracy": 0.13360615670681,
"num_tokens": 3340770.0,
"step": 1795
},
{
"entropy": 6.484994888305664,
"epoch": 0.15895443306252208,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999437257395333,
"loss": 6.5612,
"mean_token_accuracy": 0.1361308626830578,
"num_tokens": 3349976.0,
"step": 1800
},
{
"entropy": 6.629813623428345,
"epoch": 0.1593959731543624,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999430192569944,
"loss": 6.5942,
"mean_token_accuracy": 0.126756651699543,
"num_tokens": 3359764.0,
"step": 1805
},
{
"entropy": 6.493142127990723,
"epoch": 0.15983751324620277,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999423083679498,
"loss": 6.4589,
"mean_token_accuracy": 0.1307877480983734,
"num_tokens": 3369939.0,
"step": 1810
},
{
"entropy": 6.5387725830078125,
"epoch": 0.1602790533380431,
"grad_norm": 1.0234375,
"learning_rate": 0.0004999415930724133,
"loss": 6.6238,
"mean_token_accuracy": 0.12685370370745658,
"num_tokens": 3381326.0,
"step": 1815
},
{
"entropy": 6.630081462860107,
"epoch": 0.16072059342988343,
"grad_norm": 0.9453125,
"learning_rate": 0.0004999408733703988,
"loss": 6.5692,
"mean_token_accuracy": 0.12697295919060708,
"num_tokens": 3391016.0,
"step": 1820
},
{
"entropy": 6.515750217437744,
"epoch": 0.16116213352172376,
"grad_norm": 1.015625,
"learning_rate": 0.0004999401492619207,
"loss": 6.3301,
"mean_token_accuracy": 0.1411547876894474,
"num_tokens": 3400294.0,
"step": 1825
},
{
"entropy": 6.519891738891602,
"epoch": 0.16160367361356412,
"grad_norm": 1.0390625,
"learning_rate": 0.0004999394207469928,
"loss": 6.5452,
"mean_token_accuracy": 0.12329790964722634,
"num_tokens": 3409685.0,
"step": 1830
},
{
"entropy": 6.627039623260498,
"epoch": 0.16204521370540445,
"grad_norm": 1.125,
"learning_rate": 0.0004999386878256297,
"loss": 6.4467,
"mean_token_accuracy": 0.12930482253432274,
"num_tokens": 3418946.0,
"step": 1835
},
{
"entropy": 6.345337200164795,
"epoch": 0.16248675379724478,
"grad_norm": 1.0859375,
"learning_rate": 0.0004999379504978457,
"loss": 6.4523,
"mean_token_accuracy": 0.1312091715633869,
"num_tokens": 3428245.0,
"step": 1840
},
{
"entropy": 6.535007095336914,
"epoch": 0.16292829388908514,
"grad_norm": 1.0625,
"learning_rate": 0.000499937208763655,
"loss": 6.4627,
"mean_token_accuracy": 0.13302566036581992,
"num_tokens": 3437580.0,
"step": 1845
},
{
"entropy": 6.5879792213439945,
"epoch": 0.16336983398092547,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999364626230724,
"loss": 6.4411,
"mean_token_accuracy": 0.1374020665884018,
"num_tokens": 3446393.0,
"step": 1850
},
{
"entropy": 6.394599485397339,
"epoch": 0.1638113740727658,
"grad_norm": 0.98046875,
"learning_rate": 0.0004999357120761124,
"loss": 6.5361,
"mean_token_accuracy": 0.13167317807674409,
"num_tokens": 3455956.0,
"step": 1855
},
{
"entropy": 6.6326652526855465,
"epoch": 0.16425291416460613,
"grad_norm": 1.046875,
"learning_rate": 0.0004999349571227898,
"loss": 6.5281,
"mean_token_accuracy": 0.13483646959066392,
"num_tokens": 3465722.0,
"step": 1860
},
{
"entropy": 6.507793617248535,
"epoch": 0.1646944542564465,
"grad_norm": 1.0625,
"learning_rate": 0.0004999341977631193,
"loss": 6.5072,
"mean_token_accuracy": 0.12958121970295905,
"num_tokens": 3475467.0,
"step": 1865
},
{
"entropy": 6.5095072269439695,
"epoch": 0.16513599434828682,
"grad_norm": 1.015625,
"learning_rate": 0.0004999334339971157,
"loss": 6.3989,
"mean_token_accuracy": 0.13358662649989128,
"num_tokens": 3484931.0,
"step": 1870
},
{
"entropy": 6.522356176376343,
"epoch": 0.16557753444012716,
"grad_norm": 1.0,
"learning_rate": 0.0004999326658247942,
"loss": 6.5123,
"mean_token_accuracy": 0.13453342840075494,
"num_tokens": 3494001.0,
"step": 1875
},
{
"entropy": 6.49297513961792,
"epoch": 0.16601907453196751,
"grad_norm": 1.140625,
"learning_rate": 0.0004999318932461696,
"loss": 6.4281,
"mean_token_accuracy": 0.1413221076130867,
"num_tokens": 3503021.0,
"step": 1880
},
{
"entropy": 6.447078704833984,
"epoch": 0.16646061462380785,
"grad_norm": 1.375,
"learning_rate": 0.0004999311162612571,
"loss": 6.4761,
"mean_token_accuracy": 0.13532513231039048,
"num_tokens": 3513005.0,
"step": 1885
},
{
"entropy": 6.60153341293335,
"epoch": 0.16690215471564818,
"grad_norm": 1.03125,
"learning_rate": 0.000499930334870072,
"loss": 6.5511,
"mean_token_accuracy": 0.13551064282655717,
"num_tokens": 3523219.0,
"step": 1890
},
{
"entropy": 6.511942768096924,
"epoch": 0.1673436948074885,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999295490726296,
"loss": 6.5013,
"mean_token_accuracy": 0.130006618052721,
"num_tokens": 3532917.0,
"step": 1895
},
{
"entropy": 6.566938781738282,
"epoch": 0.16778523489932887,
"grad_norm": 1.1171875,
"learning_rate": 0.0004999287588689453,
"loss": 6.496,
"mean_token_accuracy": 0.1396396428346634,
"num_tokens": 3542845.0,
"step": 1900
},
{
"entropy": 6.521204996109009,
"epoch": 0.1682267749911692,
"grad_norm": 1.078125,
"learning_rate": 0.0004999279642590344,
"loss": 6.5214,
"mean_token_accuracy": 0.13577667698264123,
"num_tokens": 3552126.0,
"step": 1905
},
{
"entropy": 6.5692566394805905,
"epoch": 0.16866831508300953,
"grad_norm": 1.1796875,
"learning_rate": 0.0004999271652429127,
"loss": 6.5265,
"mean_token_accuracy": 0.127306517213583,
"num_tokens": 3561254.0,
"step": 1910
},
{
"entropy": 6.499909734725952,
"epoch": 0.1691098551748499,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999263618205958,
"loss": 6.3733,
"mean_token_accuracy": 0.14404519647359848,
"num_tokens": 3569781.0,
"step": 1915
},
{
"entropy": 6.53024697303772,
"epoch": 0.16955139526669022,
"grad_norm": 1.171875,
"learning_rate": 0.0004999255539920993,
"loss": 6.4874,
"mean_token_accuracy": 0.13062172681093215,
"num_tokens": 3579664.0,
"step": 1920
},
{
"entropy": 6.532351350784301,
"epoch": 0.16999293535853055,
"grad_norm": 1.0625,
"learning_rate": 0.0004999247417574391,
"loss": 6.526,
"mean_token_accuracy": 0.13393994346261023,
"num_tokens": 3588671.0,
"step": 1925
},
{
"entropy": 6.538648414611816,
"epoch": 0.17043447545037088,
"grad_norm": 1.03125,
"learning_rate": 0.0004999239251166312,
"loss": 6.4128,
"mean_token_accuracy": 0.14050136953592302,
"num_tokens": 3597656.0,
"step": 1930
},
{
"entropy": 6.45431957244873,
"epoch": 0.17087601554221124,
"grad_norm": 1.015625,
"learning_rate": 0.0004999231040696914,
"loss": 6.4342,
"mean_token_accuracy": 0.14062088206410409,
"num_tokens": 3608017.0,
"step": 1935
},
{
"entropy": 6.46071605682373,
"epoch": 0.17131755563405157,
"grad_norm": 1.046875,
"learning_rate": 0.0004999222786166361,
"loss": 6.5009,
"mean_token_accuracy": 0.13390257805585862,
"num_tokens": 3618189.0,
"step": 1940
},
{
"entropy": 6.564482021331787,
"epoch": 0.1717590957258919,
"grad_norm": 1.2109375,
"learning_rate": 0.0004999214487574812,
"loss": 6.463,
"mean_token_accuracy": 0.13240221589803697,
"num_tokens": 3627211.0,
"step": 1945
},
{
"entropy": 6.480297803878784,
"epoch": 0.17220063581773226,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999206144922431,
"loss": 6.4038,
"mean_token_accuracy": 0.13147775381803511,
"num_tokens": 3636781.0,
"step": 1950
},
{
"entropy": 6.488903188705445,
"epoch": 0.1726421759095726,
"grad_norm": 1.125,
"learning_rate": 0.000499919775820938,
"loss": 6.4913,
"mean_token_accuracy": 0.14189594313502313,
"num_tokens": 3644891.0,
"step": 1955
},
{
"entropy": 6.561635589599609,
"epoch": 0.17308371600141292,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999189327435825,
"loss": 6.5195,
"mean_token_accuracy": 0.13184107840061188,
"num_tokens": 3655477.0,
"step": 1960
},
{
"entropy": 6.517252016067505,
"epoch": 0.17352525609325326,
"grad_norm": 1.03125,
"learning_rate": 0.0004999180852601929,
"loss": 6.5422,
"mean_token_accuracy": 0.13338224366307258,
"num_tokens": 3664542.0,
"step": 1965
},
{
"entropy": 6.498584127426147,
"epoch": 0.17396679618509361,
"grad_norm": 1.2421875,
"learning_rate": 0.000499917233370786,
"loss": 6.4452,
"mean_token_accuracy": 0.12930241152644156,
"num_tokens": 3673806.0,
"step": 1970
},
{
"entropy": 6.516369295120239,
"epoch": 0.17440833627693395,
"grad_norm": 1.0625,
"learning_rate": 0.0004999163770753784,
"loss": 6.4487,
"mean_token_accuracy": 0.13249206990003587,
"num_tokens": 3683238.0,
"step": 1975
},
{
"entropy": 6.473311996459961,
"epoch": 0.17484987636877428,
"grad_norm": 1.28125,
"learning_rate": 0.0004999155163739869,
"loss": 6.4228,
"mean_token_accuracy": 0.13501294553279877,
"num_tokens": 3692161.0,
"step": 1980
},
{
"entropy": 6.512854528427124,
"epoch": 0.17529141646061464,
"grad_norm": 1.1328125,
"learning_rate": 0.0004999146512666284,
"loss": 6.4675,
"mean_token_accuracy": 0.13027839213609696,
"num_tokens": 3701431.0,
"step": 1985
},
{
"entropy": 6.468549728393555,
"epoch": 0.17573295655245497,
"grad_norm": 0.95703125,
"learning_rate": 0.0004999137817533197,
"loss": 6.419,
"mean_token_accuracy": 0.14170578867197037,
"num_tokens": 3710963.0,
"step": 1990
},
{
"entropy": 6.4296314239501955,
"epoch": 0.1761744966442953,
"grad_norm": 1.15625,
"learning_rate": 0.0004999129078340779,
"loss": 6.4214,
"mean_token_accuracy": 0.13799419105052949,
"num_tokens": 3720177.0,
"step": 1995
},
{
"entropy": 6.4377001285552975,
"epoch": 0.17661603673613563,
"grad_norm": 1.140625,
"learning_rate": 0.0004999120295089202,
"loss": 6.3718,
"mean_token_accuracy": 0.14307373464107515,
"num_tokens": 3728123.0,
"step": 2000
},
{
"entropy": 6.573485851287842,
"epoch": 0.177057576827976,
"grad_norm": 1.0078125,
"learning_rate": 0.0004999111467778639,
"loss": 6.509,
"mean_token_accuracy": 0.13284810408949851,
"num_tokens": 3736869.0,
"step": 2005
},
{
"entropy": 6.46274700164795,
"epoch": 0.17749911691981632,
"grad_norm": 1.2265625,
"learning_rate": 0.000499910259640926,
"loss": 6.3788,
"mean_token_accuracy": 0.13863728046417237,
"num_tokens": 3745830.0,
"step": 2010
},
{
"entropy": 6.421447610855102,
"epoch": 0.17794065701165665,
"grad_norm": 1.0625,
"learning_rate": 0.000499909368098124,
"loss": 6.4166,
"mean_token_accuracy": 0.13812872543931007,
"num_tokens": 3755019.0,
"step": 2015
},
{
"entropy": 6.508076333999634,
"epoch": 0.178382197103497,
"grad_norm": 1.0625,
"learning_rate": 0.0004999084721494754,
"loss": 6.3968,
"mean_token_accuracy": 0.1333928920328617,
"num_tokens": 3764814.0,
"step": 2020
},
{
"entropy": 6.345089483261108,
"epoch": 0.17882373719533734,
"grad_norm": 1.109375,
"learning_rate": 0.0004999075717949978,
"loss": 6.3581,
"mean_token_accuracy": 0.14092704504728318,
"num_tokens": 3774258.0,
"step": 2025
},
{
"entropy": 6.421577262878418,
"epoch": 0.17926527728717767,
"grad_norm": 0.99609375,
"learning_rate": 0.0004999066670347089,
"loss": 6.3978,
"mean_token_accuracy": 0.13964474871754645,
"num_tokens": 3783961.0,
"step": 2030
},
{
"entropy": 6.40748291015625,
"epoch": 0.179706817379018,
"grad_norm": 1.0546875,
"learning_rate": 0.0004999057578686261,
"loss": 6.363,
"mean_token_accuracy": 0.13734552562236785,
"num_tokens": 3792417.0,
"step": 2035
},
{
"entropy": 6.495989513397217,
"epoch": 0.18014835747085836,
"grad_norm": 1.1640625,
"learning_rate": 0.0004999048442967675,
"loss": 6.3557,
"mean_token_accuracy": 0.13433733358979225,
"num_tokens": 3801479.0,
"step": 2040
},
{
"entropy": 6.37765908241272,
"epoch": 0.1805898975626987,
"grad_norm": 1.015625,
"learning_rate": 0.0004999039263191508,
"loss": 6.4254,
"mean_token_accuracy": 0.13214251399040222,
"num_tokens": 3810799.0,
"step": 2045
},
{
"entropy": 6.491030645370484,
"epoch": 0.18103143765453902,
"grad_norm": 1.0625,
"learning_rate": 0.0004999030039357943,
"loss": 6.462,
"mean_token_accuracy": 0.13567366376519202,
"num_tokens": 3820966.0,
"step": 2050
},
{
"entropy": 6.463741731643677,
"epoch": 0.18147297774637938,
"grad_norm": 1.125,
"learning_rate": 0.0004999020771467158,
"loss": 6.4423,
"mean_token_accuracy": 0.1354211077094078,
"num_tokens": 3829247.0,
"step": 2055
},
{
"entropy": 6.572631978988648,
"epoch": 0.1819145178382197,
"grad_norm": 1.0625,
"learning_rate": 0.0004999011459519335,
"loss": 6.3891,
"mean_token_accuracy": 0.1375864826142788,
"num_tokens": 3838114.0,
"step": 2060
},
{
"entropy": 6.325645637512207,
"epoch": 0.18235605793006004,
"grad_norm": 1.0703125,
"learning_rate": 0.0004999002103514655,
"loss": 6.4586,
"mean_token_accuracy": 0.13582065477967262,
"num_tokens": 3848075.0,
"step": 2065
},
{
"entropy": 6.570796966552734,
"epoch": 0.18279759802190038,
"grad_norm": 1.109375,
"learning_rate": 0.0004998992703453304,
"loss": 6.4987,
"mean_token_accuracy": 0.13409382104873657,
"num_tokens": 3857934.0,
"step": 2070
},
{
"entropy": 6.490766811370849,
"epoch": 0.18323913811374073,
"grad_norm": 1.109375,
"learning_rate": 0.0004998983259335466,
"loss": 6.3433,
"mean_token_accuracy": 0.14234771504998206,
"num_tokens": 3866707.0,
"step": 2075
},
{
"entropy": 6.456926107406616,
"epoch": 0.18368067820558107,
"grad_norm": 1.1796875,
"learning_rate": 0.0004998973771161324,
"loss": 6.4192,
"mean_token_accuracy": 0.13825157508254052,
"num_tokens": 3875233.0,
"step": 2080
},
{
"entropy": 6.485457134246826,
"epoch": 0.1841222182974214,
"grad_norm": 1.0859375,
"learning_rate": 0.0004998964238931065,
"loss": 6.4138,
"mean_token_accuracy": 0.13973441645503043,
"num_tokens": 3885173.0,
"step": 2085
},
{
"entropy": 6.477391719818115,
"epoch": 0.18456375838926176,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998954662644876,
"loss": 6.3774,
"mean_token_accuracy": 0.13736600577831268,
"num_tokens": 3894198.0,
"step": 2090
},
{
"entropy": 6.421681976318359,
"epoch": 0.1850052984811021,
"grad_norm": 1.1484375,
"learning_rate": 0.0004998945042302943,
"loss": 6.373,
"mean_token_accuracy": 0.13609152138233185,
"num_tokens": 3904076.0,
"step": 2095
},
{
"entropy": 6.480407571792602,
"epoch": 0.18544683857294242,
"grad_norm": 1.15625,
"learning_rate": 0.0004998935377905457,
"loss": 6.4802,
"mean_token_accuracy": 0.1311386428773403,
"num_tokens": 3913204.0,
"step": 2100
},
{
"entropy": 6.535258817672729,
"epoch": 0.18588837866478275,
"grad_norm": 1.0625,
"learning_rate": 0.0004998925669452605,
"loss": 6.4323,
"mean_token_accuracy": 0.13564323037862777,
"num_tokens": 3922148.0,
"step": 2105
},
{
"entropy": 6.398992824554443,
"epoch": 0.1863299187566231,
"grad_norm": 1.015625,
"learning_rate": 0.0004998915916944579,
"loss": 6.4129,
"mean_token_accuracy": 0.13676537424325944,
"num_tokens": 3931333.0,
"step": 2110
},
{
"entropy": 6.4503209590911865,
"epoch": 0.18677145884846344,
"grad_norm": 1.140625,
"learning_rate": 0.0004998906120381568,
"loss": 6.374,
"mean_token_accuracy": 0.14027760475873946,
"num_tokens": 3941061.0,
"step": 2115
},
{
"entropy": 6.508623027801514,
"epoch": 0.18721299894030377,
"grad_norm": 1.1796875,
"learning_rate": 0.0004998896279763766,
"loss": 6.4722,
"mean_token_accuracy": 0.13354425132274628,
"num_tokens": 3950075.0,
"step": 2120
},
{
"entropy": 6.476150178909302,
"epoch": 0.18765453903214413,
"grad_norm": 1.09375,
"learning_rate": 0.0004998886395091365,
"loss": 6.3316,
"mean_token_accuracy": 0.13695699274539946,
"num_tokens": 3958885.0,
"step": 2125
},
{
"entropy": 6.3462131977081295,
"epoch": 0.18809607912398446,
"grad_norm": 1.15625,
"learning_rate": 0.0004998876466364559,
"loss": 6.4256,
"mean_token_accuracy": 0.13821618929505347,
"num_tokens": 3968218.0,
"step": 2130
},
{
"entropy": 6.443255281448364,
"epoch": 0.1885376192158248,
"grad_norm": 1.1875,
"learning_rate": 0.0004998866493583541,
"loss": 6.3606,
"mean_token_accuracy": 0.1383839502930641,
"num_tokens": 3977435.0,
"step": 2135
},
{
"entropy": 6.356647872924805,
"epoch": 0.18897915930766512,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998856476748509,
"loss": 6.3498,
"mean_token_accuracy": 0.1412102162837982,
"num_tokens": 3986608.0,
"step": 2140
},
{
"entropy": 6.431683588027954,
"epoch": 0.18942069939950548,
"grad_norm": 1.125,
"learning_rate": 0.0004998846415859656,
"loss": 6.3585,
"mean_token_accuracy": 0.14042109996080399,
"num_tokens": 3996087.0,
"step": 2145
},
{
"entropy": 6.444839954376221,
"epoch": 0.1898622394913458,
"grad_norm": 1.171875,
"learning_rate": 0.0004998836310917182,
"loss": 6.4002,
"mean_token_accuracy": 0.13422135785222053,
"num_tokens": 4006257.0,
"step": 2150
},
{
"entropy": 6.52928204536438,
"epoch": 0.19030377958318614,
"grad_norm": 1.0625,
"learning_rate": 0.0004998826161921282,
"loss": 6.4156,
"mean_token_accuracy": 0.1421043999493122,
"num_tokens": 4015904.0,
"step": 2155
},
{
"entropy": 6.383703994750976,
"epoch": 0.1907453196750265,
"grad_norm": 1.03125,
"learning_rate": 0.0004998815968872157,
"loss": 6.4115,
"mean_token_accuracy": 0.13542449548840524,
"num_tokens": 4025417.0,
"step": 2160
},
{
"entropy": 6.363600587844848,
"epoch": 0.19118685976686683,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998805731770007,
"loss": 6.2801,
"mean_token_accuracy": 0.15531659871339798,
"num_tokens": 4035181.0,
"step": 2165
},
{
"entropy": 6.47420859336853,
"epoch": 0.19162839985870717,
"grad_norm": 1.03125,
"learning_rate": 0.000499879545061503,
"loss": 6.4466,
"mean_token_accuracy": 0.13034741580486298,
"num_tokens": 4045112.0,
"step": 2170
},
{
"entropy": 6.513006162643433,
"epoch": 0.1920699399505475,
"grad_norm": 1.078125,
"learning_rate": 0.0004998785125407432,
"loss": 6.5509,
"mean_token_accuracy": 0.12224270775914192,
"num_tokens": 4054566.0,
"step": 2175
},
{
"entropy": 6.533349084854126,
"epoch": 0.19251148004238786,
"grad_norm": 1.09375,
"learning_rate": 0.000499877475614741,
"loss": 6.3601,
"mean_token_accuracy": 0.1362767845392227,
"num_tokens": 4063960.0,
"step": 2180
},
{
"entropy": 6.30982141494751,
"epoch": 0.1929530201342282,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998764342835169,
"loss": 6.3077,
"mean_token_accuracy": 0.14436172991991042,
"num_tokens": 4072620.0,
"step": 2185
},
{
"entropy": 6.325711584091186,
"epoch": 0.19339456022606852,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998753885470915,
"loss": 6.2856,
"mean_token_accuracy": 0.1410072512924671,
"num_tokens": 4081590.0,
"step": 2190
},
{
"entropy": 6.443258333206177,
"epoch": 0.19383610031790888,
"grad_norm": 1.1796875,
"learning_rate": 0.0004998743384054851,
"loss": 6.4024,
"mean_token_accuracy": 0.14100263118743897,
"num_tokens": 4090758.0,
"step": 2195
},
{
"entropy": 6.343490505218506,
"epoch": 0.1942776404097492,
"grad_norm": 1.078125,
"learning_rate": 0.0004998732838587183,
"loss": 6.2339,
"mean_token_accuracy": 0.14560552909970284,
"num_tokens": 4099281.0,
"step": 2200
},
{
"entropy": 6.428974056243897,
"epoch": 0.19471918050158954,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998722249068118,
"loss": 6.3508,
"mean_token_accuracy": 0.13685052916407586,
"num_tokens": 4108953.0,
"step": 2205
},
{
"entropy": 6.399385118484497,
"epoch": 0.19516072059342987,
"grad_norm": 1.03125,
"learning_rate": 0.0004998711615497863,
"loss": 6.453,
"mean_token_accuracy": 0.13157615587115287,
"num_tokens": 4118799.0,
"step": 2210
},
{
"entropy": 6.466229009628296,
"epoch": 0.19560226068527023,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998700937876626,
"loss": 6.4178,
"mean_token_accuracy": 0.13792671710252763,
"num_tokens": 4127862.0,
"step": 2215
},
{
"entropy": 6.433918428421021,
"epoch": 0.19604380077711056,
"grad_norm": 1.078125,
"learning_rate": 0.0004998690216204615,
"loss": 6.4809,
"mean_token_accuracy": 0.12709898576140405,
"num_tokens": 4139029.0,
"step": 2220
},
{
"entropy": 6.472035026550293,
"epoch": 0.1964853408689509,
"grad_norm": 1.1484375,
"learning_rate": 0.0004998679450482043,
"loss": 6.3062,
"mean_token_accuracy": 0.14617246389389038,
"num_tokens": 4148257.0,
"step": 2225
},
{
"entropy": 6.365042209625244,
"epoch": 0.19692688096079125,
"grad_norm": 1.0546875,
"learning_rate": 0.000499866864070912,
"loss": 6.2528,
"mean_token_accuracy": 0.13704810217022895,
"num_tokens": 4157626.0,
"step": 2230
},
{
"entropy": 6.411515808105468,
"epoch": 0.19736842105263158,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998657786886056,
"loss": 6.4857,
"mean_token_accuracy": 0.13319113329052926,
"num_tokens": 4166804.0,
"step": 2235
},
{
"entropy": 6.512064790725708,
"epoch": 0.1978099611444719,
"grad_norm": 1.109375,
"learning_rate": 0.0004998646889013066,
"loss": 6.3594,
"mean_token_accuracy": 0.1408704087138176,
"num_tokens": 4175701.0,
"step": 2240
},
{
"entropy": 6.454934692382812,
"epoch": 0.19825150123631224,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998635947090362,
"loss": 6.4385,
"mean_token_accuracy": 0.13829853162169456,
"num_tokens": 4184711.0,
"step": 2245
},
{
"entropy": 6.43667516708374,
"epoch": 0.1986930413281526,
"grad_norm": 1.3046875,
"learning_rate": 0.0004998624961118158,
"loss": 6.4075,
"mean_token_accuracy": 0.1378791533410549,
"num_tokens": 4193931.0,
"step": 2250
},
{
"entropy": 6.431211376190186,
"epoch": 0.19913458141999293,
"grad_norm": 1.15625,
"learning_rate": 0.000499861393109667,
"loss": 6.2785,
"mean_token_accuracy": 0.1496691472828388,
"num_tokens": 4203000.0,
"step": 2255
},
{
"entropy": 6.271931219100952,
"epoch": 0.19957612151183327,
"grad_norm": 1.109375,
"learning_rate": 0.0004998602857026114,
"loss": 6.3027,
"mean_token_accuracy": 0.14634378403425216,
"num_tokens": 4211977.0,
"step": 2260
},
{
"entropy": 6.447495746612549,
"epoch": 0.20001766160367362,
"grad_norm": 1.125,
"learning_rate": 0.0004998591738906708,
"loss": 6.3856,
"mean_token_accuracy": 0.14466411918401717,
"num_tokens": 4220375.0,
"step": 2265
},
{
"entropy": 6.450564670562744,
"epoch": 0.20045920169551396,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998580576738668,
"loss": 6.3736,
"mean_token_accuracy": 0.13617569133639335,
"num_tokens": 4230506.0,
"step": 2270
},
{
"entropy": 6.417342710494995,
"epoch": 0.2009007417873543,
"grad_norm": 1.1484375,
"learning_rate": 0.0004998569370522213,
"loss": 6.3418,
"mean_token_accuracy": 0.1376570299267769,
"num_tokens": 4240235.0,
"step": 2275
},
{
"entropy": 6.406169795989991,
"epoch": 0.20134228187919462,
"grad_norm": 1.046875,
"learning_rate": 0.0004998558120257563,
"loss": 6.3963,
"mean_token_accuracy": 0.1375265248119831,
"num_tokens": 4249775.0,
"step": 2280
},
{
"entropy": 6.394922590255737,
"epoch": 0.20178382197103498,
"grad_norm": 1.203125,
"learning_rate": 0.0004998546825944938,
"loss": 6.3459,
"mean_token_accuracy": 0.13671498522162437,
"num_tokens": 4258523.0,
"step": 2285
},
{
"entropy": 6.455841398239135,
"epoch": 0.2022253620628753,
"grad_norm": 1.3125,
"learning_rate": 0.000499853548758456,
"loss": 6.348,
"mean_token_accuracy": 0.13951429352164268,
"num_tokens": 4267683.0,
"step": 2290
},
{
"entropy": 6.456370782852173,
"epoch": 0.20266690215471564,
"grad_norm": 1.4296875,
"learning_rate": 0.000499852410517665,
"loss": 6.4251,
"mean_token_accuracy": 0.13333277478814126,
"num_tokens": 4276903.0,
"step": 2295
},
{
"entropy": 6.424126148223877,
"epoch": 0.203108442246556,
"grad_norm": 1.4296875,
"learning_rate": 0.0004998512678721431,
"loss": 6.3582,
"mean_token_accuracy": 0.13599715530872344,
"num_tokens": 4287257.0,
"step": 2300
},
{
"entropy": 6.428092765808105,
"epoch": 0.20354998233839633,
"grad_norm": 1.15625,
"learning_rate": 0.000499850120821913,
"loss": 6.3942,
"mean_token_accuracy": 0.1357932858169079,
"num_tokens": 4297345.0,
"step": 2305
},
{
"entropy": 6.505991411209107,
"epoch": 0.20399152243023666,
"grad_norm": 1.1953125,
"learning_rate": 0.0004998489693669967,
"loss": 6.3373,
"mean_token_accuracy": 0.1377499908208847,
"num_tokens": 4306533.0,
"step": 2310
},
{
"entropy": 6.375578260421753,
"epoch": 0.204433062522077,
"grad_norm": 1.171875,
"learning_rate": 0.000499847813507417,
"loss": 6.404,
"mean_token_accuracy": 0.1373721919953823,
"num_tokens": 4316338.0,
"step": 2315
},
{
"entropy": 6.3910376071929935,
"epoch": 0.20487460261391735,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998466532431966,
"loss": 6.3591,
"mean_token_accuracy": 0.13833511546254157,
"num_tokens": 4326585.0,
"step": 2320
},
{
"entropy": 6.526772165298462,
"epoch": 0.20531614270575768,
"grad_norm": 1.1328125,
"learning_rate": 0.0004998454885743581,
"loss": 6.4797,
"mean_token_accuracy": 0.13367427811026572,
"num_tokens": 4336490.0,
"step": 2325
},
{
"entropy": 6.390794658660889,
"epoch": 0.205757682797598,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998443195009242,
"loss": 6.3557,
"mean_token_accuracy": 0.13690442964434624,
"num_tokens": 4346264.0,
"step": 2330
},
{
"entropy": 6.416228103637695,
"epoch": 0.20619922288943837,
"grad_norm": 1.2265625,
"learning_rate": 0.0004998431460229182,
"loss": 6.3522,
"mean_token_accuracy": 0.14161566868424416,
"num_tokens": 4355102.0,
"step": 2335
},
{
"entropy": 6.50619740486145,
"epoch": 0.2066407629812787,
"grad_norm": 1.265625,
"learning_rate": 0.0004998419681403627,
"loss": 6.5122,
"mean_token_accuracy": 0.13018345609307289,
"num_tokens": 4365569.0,
"step": 2340
},
{
"entropy": 6.376383638381958,
"epoch": 0.20708230307311903,
"grad_norm": 1.03125,
"learning_rate": 0.0004998407858532809,
"loss": 6.3474,
"mean_token_accuracy": 0.14445040747523308,
"num_tokens": 4375437.0,
"step": 2345
},
{
"entropy": 6.404212570190429,
"epoch": 0.20752384316495937,
"grad_norm": 1.1875,
"learning_rate": 0.000499839599161696,
"loss": 6.342,
"mean_token_accuracy": 0.14488178491592407,
"num_tokens": 4384420.0,
"step": 2350
},
{
"entropy": 6.3863624095916744,
"epoch": 0.20796538325679972,
"grad_norm": 1.1640625,
"learning_rate": 0.0004998384080656314,
"loss": 6.3048,
"mean_token_accuracy": 0.14010295867919922,
"num_tokens": 4393730.0,
"step": 2355
},
{
"entropy": 6.41755633354187,
"epoch": 0.20840692334864006,
"grad_norm": 1.109375,
"learning_rate": 0.00049983721256511,
"loss": 6.2839,
"mean_token_accuracy": 0.14398279786109924,
"num_tokens": 4402731.0,
"step": 2360
},
{
"entropy": 6.356699991226196,
"epoch": 0.2088484634404804,
"grad_norm": 1.140625,
"learning_rate": 0.0004998360126601556,
"loss": 6.3451,
"mean_token_accuracy": 0.13590056598186492,
"num_tokens": 4411606.0,
"step": 2365
},
{
"entropy": 6.3600341320037845,
"epoch": 0.20929000353232075,
"grad_norm": 1.140625,
"learning_rate": 0.0004998348083507916,
"loss": 6.4137,
"mean_token_accuracy": 0.14537313282489778,
"num_tokens": 4421685.0,
"step": 2370
},
{
"entropy": 6.469741773605347,
"epoch": 0.20973154362416108,
"grad_norm": 1.109375,
"learning_rate": 0.0004998335996370416,
"loss": 6.3762,
"mean_token_accuracy": 0.14291262701153756,
"num_tokens": 4431765.0,
"step": 2375
},
{
"entropy": 6.3404137134552006,
"epoch": 0.2101730837160014,
"grad_norm": 1.078125,
"learning_rate": 0.0004998323865189291,
"loss": 6.3491,
"mean_token_accuracy": 0.13587618842720986,
"num_tokens": 4441191.0,
"step": 2380
},
{
"entropy": 6.441226148605347,
"epoch": 0.21061462380784174,
"grad_norm": 1.1875,
"learning_rate": 0.0004998311689964781,
"loss": 6.4262,
"mean_token_accuracy": 0.13476165607571602,
"num_tokens": 4450156.0,
"step": 2385
},
{
"entropy": 6.482025623321533,
"epoch": 0.2110561638996821,
"grad_norm": 1.234375,
"learning_rate": 0.0004998299470697125,
"loss": 6.4254,
"mean_token_accuracy": 0.13929163217544555,
"num_tokens": 4459466.0,
"step": 2390
},
{
"entropy": 6.4643927097320555,
"epoch": 0.21149770399152243,
"grad_norm": 1.078125,
"learning_rate": 0.0004998287207386559,
"loss": 6.4186,
"mean_token_accuracy": 0.13592114597558974,
"num_tokens": 4468539.0,
"step": 2395
},
{
"entropy": 6.458880662918091,
"epoch": 0.21193924408336276,
"grad_norm": 1.2265625,
"learning_rate": 0.0004998274900033326,
"loss": 6.3128,
"mean_token_accuracy": 0.1451781891286373,
"num_tokens": 4477579.0,
"step": 2400
},
{
"entropy": 6.237515068054199,
"epoch": 0.21238078417520312,
"grad_norm": 1.2109375,
"learning_rate": 0.0004998262548637667,
"loss": 6.2987,
"mean_token_accuracy": 0.15145175904035568,
"num_tokens": 4486800.0,
"step": 2405
},
{
"entropy": 6.3636726379394535,
"epoch": 0.21282232426704345,
"grad_norm": 1.25,
"learning_rate": 0.0004998250153199822,
"loss": 6.2466,
"mean_token_accuracy": 0.14414403662085534,
"num_tokens": 4495985.0,
"step": 2410
},
{
"entropy": 6.3901232242584225,
"epoch": 0.21326386435888378,
"grad_norm": 1.1015625,
"learning_rate": 0.0004998237713720036,
"loss": 6.4023,
"mean_token_accuracy": 0.13772075325250627,
"num_tokens": 4504944.0,
"step": 2415
},
{
"entropy": 6.378066778182983,
"epoch": 0.2137054044507241,
"grad_norm": 1.015625,
"learning_rate": 0.0004998225230198552,
"loss": 6.2988,
"mean_token_accuracy": 0.14631899818778038,
"num_tokens": 4515402.0,
"step": 2420
},
{
"entropy": 6.370953845977783,
"epoch": 0.21414694454256447,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998212702635614,
"loss": 6.3772,
"mean_token_accuracy": 0.13616864681243895,
"num_tokens": 4525009.0,
"step": 2425
},
{
"entropy": 6.461081838607788,
"epoch": 0.2145884846344048,
"grad_norm": 1.484375,
"learning_rate": 0.0004998200131031469,
"loss": 6.4151,
"mean_token_accuracy": 0.1347133368253708,
"num_tokens": 4534460.0,
"step": 2430
},
{
"entropy": 6.410534858703613,
"epoch": 0.21503002472624513,
"grad_norm": 1.0546875,
"learning_rate": 0.0004998187515386361,
"loss": 6.2343,
"mean_token_accuracy": 0.15018296167254447,
"num_tokens": 4543748.0,
"step": 2435
},
{
"entropy": 6.339591979980469,
"epoch": 0.2154715648180855,
"grad_norm": 1.109375,
"learning_rate": 0.0004998174855700538,
"loss": 6.3688,
"mean_token_accuracy": 0.1432553306221962,
"num_tokens": 4552722.0,
"step": 2440
},
{
"entropy": 6.41485447883606,
"epoch": 0.21591310490992582,
"grad_norm": 1.2890625,
"learning_rate": 0.0004998162151974248,
"loss": 6.2185,
"mean_token_accuracy": 0.14427638724446296,
"num_tokens": 4561607.0,
"step": 2445
},
{
"entropy": 6.3874904155731205,
"epoch": 0.21635464500176615,
"grad_norm": 0.984375,
"learning_rate": 0.000499814940420774,
"loss": 6.4909,
"mean_token_accuracy": 0.12949233055114745,
"num_tokens": 4572524.0,
"step": 2450
},
{
"entropy": 6.417895221710205,
"epoch": 0.21679618509360649,
"grad_norm": 1.0390625,
"learning_rate": 0.0004998136612401266,
"loss": 6.3014,
"mean_token_accuracy": 0.14473507031798363,
"num_tokens": 4581601.0,
"step": 2455
},
{
"entropy": 6.422118234634399,
"epoch": 0.21723772518544684,
"grad_norm": 1.1953125,
"learning_rate": 0.0004998123776555071,
"loss": 6.3707,
"mean_token_accuracy": 0.13594872877001762,
"num_tokens": 4591795.0,
"step": 2460
},
{
"entropy": 6.37589282989502,
"epoch": 0.21767926527728718,
"grad_norm": 1.203125,
"learning_rate": 0.0004998110896669412,
"loss": 6.3263,
"mean_token_accuracy": 0.14324304163455964,
"num_tokens": 4600745.0,
"step": 2465
},
{
"entropy": 6.44620714187622,
"epoch": 0.2181208053691275,
"grad_norm": 1.0703125,
"learning_rate": 0.0004998097972744539,
"loss": 6.3737,
"mean_token_accuracy": 0.13417462706565858,
"num_tokens": 4610490.0,
"step": 2470
},
{
"entropy": 6.308990859985352,
"epoch": 0.21856234546096787,
"grad_norm": 1.078125,
"learning_rate": 0.0004998085004780705,
"loss": 6.3033,
"mean_token_accuracy": 0.14380738139152527,
"num_tokens": 4619511.0,
"step": 2475
},
{
"entropy": 6.418844270706177,
"epoch": 0.2190038855528082,
"grad_norm": 1.21875,
"learning_rate": 0.0004998071992778164,
"loss": 6.3332,
"mean_token_accuracy": 0.1404774770140648,
"num_tokens": 4628186.0,
"step": 2480
},
{
"entropy": 6.4331684589385985,
"epoch": 0.21944542564464853,
"grad_norm": 1.1015625,
"learning_rate": 0.000499805893673717,
"loss": 6.3698,
"mean_token_accuracy": 0.13764599412679673,
"num_tokens": 4637431.0,
"step": 2485
},
{
"entropy": 6.297756719589233,
"epoch": 0.21988696573648886,
"grad_norm": 1.1171875,
"learning_rate": 0.0004998045836657982,
"loss": 6.2293,
"mean_token_accuracy": 0.14262612611055375,
"num_tokens": 4646627.0,
"step": 2490
},
{
"entropy": 6.3736780166625975,
"epoch": 0.22032850582832922,
"grad_norm": 1.2109375,
"learning_rate": 0.0004998032692540853,
"loss": 6.3126,
"mean_token_accuracy": 0.14131407141685487,
"num_tokens": 4656095.0,
"step": 2495
},
{
"entropy": 6.4055116176605225,
"epoch": 0.22077004592016955,
"grad_norm": 1.15625,
"learning_rate": 0.0004998019504386044,
"loss": 6.3932,
"mean_token_accuracy": 0.1364021860063076,
"num_tokens": 4665807.0,
"step": 2500
},
{
"entropy": 6.426360702514648,
"epoch": 0.22121158601200988,
"grad_norm": 1.2421875,
"learning_rate": 0.0004998006272193809,
"loss": 6.3543,
"mean_token_accuracy": 0.13680973649024963,
"num_tokens": 4674459.0,
"step": 2505
},
{
"entropy": 6.394381141662597,
"epoch": 0.22165312610385024,
"grad_norm": 1.0625,
"learning_rate": 0.0004997992995964412,
"loss": 6.4516,
"mean_token_accuracy": 0.13281818181276323,
"num_tokens": 4684063.0,
"step": 2510
},
{
"entropy": 6.355847644805908,
"epoch": 0.22209466619569057,
"grad_norm": 1.25,
"learning_rate": 0.0004997979675698109,
"loss": 6.3149,
"mean_token_accuracy": 0.1413261540234089,
"num_tokens": 4692807.0,
"step": 2515
},
{
"entropy": 6.509682703018188,
"epoch": 0.2225362062875309,
"grad_norm": 1.125,
"learning_rate": 0.0004997966311395164,
"loss": 6.2561,
"mean_token_accuracy": 0.14682135581970215,
"num_tokens": 4701100.0,
"step": 2520
},
{
"entropy": 6.257225751876831,
"epoch": 0.22297774637937123,
"grad_norm": 1.1328125,
"learning_rate": 0.0004997952903055836,
"loss": 6.313,
"mean_token_accuracy": 0.13383381441235542,
"num_tokens": 4710697.0,
"step": 2525
},
{
"entropy": 6.414626836776733,
"epoch": 0.2234192864712116,
"grad_norm": 1.21875,
"learning_rate": 0.000499793945068039,
"loss": 6.2857,
"mean_token_accuracy": 0.14284081608057023,
"num_tokens": 4718745.0,
"step": 2530
},
{
"entropy": 6.376047897338867,
"epoch": 0.22386082656305192,
"grad_norm": 1.109375,
"learning_rate": 0.0004997925954269088,
"loss": 6.2546,
"mean_token_accuracy": 0.1423765517771244,
"num_tokens": 4728056.0,
"step": 2535
},
{
"entropy": 6.395099210739136,
"epoch": 0.22430236665489225,
"grad_norm": 1.03125,
"learning_rate": 0.0004997912413822196,
"loss": 6.4015,
"mean_token_accuracy": 0.13739172071218492,
"num_tokens": 4737605.0,
"step": 2540
},
{
"entropy": 6.362033176422119,
"epoch": 0.2247439067467326,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997898829339979,
"loss": 6.2078,
"mean_token_accuracy": 0.1501716986298561,
"num_tokens": 4746168.0,
"step": 2545
},
{
"entropy": 6.374505853652954,
"epoch": 0.22518544683857294,
"grad_norm": 1.171875,
"learning_rate": 0.00049978852008227,
"loss": 6.303,
"mean_token_accuracy": 0.14293254241347314,
"num_tokens": 4755072.0,
"step": 2550
},
{
"entropy": 6.365287399291992,
"epoch": 0.22562698693041328,
"grad_norm": 1.09375,
"learning_rate": 0.000499787152827063,
"loss": 6.3115,
"mean_token_accuracy": 0.14703276976943017,
"num_tokens": 4764580.0,
"step": 2555
},
{
"entropy": 6.290199661254883,
"epoch": 0.2260685270222536,
"grad_norm": 1.1875,
"learning_rate": 0.0004997857811684035,
"loss": 6.311,
"mean_token_accuracy": 0.14540447145700455,
"num_tokens": 4774135.0,
"step": 2560
},
{
"entropy": 6.446982669830322,
"epoch": 0.22651006711409397,
"grad_norm": 1.171875,
"learning_rate": 0.0004997844051063183,
"loss": 6.4022,
"mean_token_accuracy": 0.13750494867563248,
"num_tokens": 4784733.0,
"step": 2565
},
{
"entropy": 6.385699224472046,
"epoch": 0.2269516072059343,
"grad_norm": 1.046875,
"learning_rate": 0.0004997830246408346,
"loss": 6.3325,
"mean_token_accuracy": 0.14618165343999862,
"num_tokens": 4795327.0,
"step": 2570
},
{
"entropy": 6.268747615814209,
"epoch": 0.22739314729777463,
"grad_norm": 1.109375,
"learning_rate": 0.0004997816397719791,
"loss": 6.2983,
"mean_token_accuracy": 0.14008190780878066,
"num_tokens": 4804314.0,
"step": 2575
},
{
"entropy": 6.464039659500122,
"epoch": 0.227834687389615,
"grad_norm": 1.109375,
"learning_rate": 0.0004997802504997792,
"loss": 6.3878,
"mean_token_accuracy": 0.135692573338747,
"num_tokens": 4813637.0,
"step": 2580
},
{
"entropy": 6.395627689361572,
"epoch": 0.22827622748145532,
"grad_norm": 1.1484375,
"learning_rate": 0.0004997788568242621,
"loss": 6.279,
"mean_token_accuracy": 0.14184108525514602,
"num_tokens": 4823094.0,
"step": 2585
},
{
"entropy": 6.306736660003662,
"epoch": 0.22871776757329565,
"grad_norm": 1.0078125,
"learning_rate": 0.000499777458745455,
"loss": 6.206,
"mean_token_accuracy": 0.14509037733078003,
"num_tokens": 4833199.0,
"step": 2590
},
{
"entropy": 6.366773796081543,
"epoch": 0.22915930766513598,
"grad_norm": 1.2265625,
"learning_rate": 0.0004997760562633853,
"loss": 6.3026,
"mean_token_accuracy": 0.13990220725536345,
"num_tokens": 4842970.0,
"step": 2595
},
{
"entropy": 6.40316481590271,
"epoch": 0.22960084775697634,
"grad_norm": 1.109375,
"learning_rate": 0.0004997746493780804,
"loss": 6.3996,
"mean_token_accuracy": 0.13560035228729247,
"num_tokens": 4852043.0,
"step": 2600
},
{
"entropy": 6.3404639720916744,
"epoch": 0.23004238784881667,
"grad_norm": 1.3359375,
"learning_rate": 0.000499773238089568,
"loss": 6.2733,
"mean_token_accuracy": 0.1323003001511097,
"num_tokens": 4862232.0,
"step": 2605
},
{
"entropy": 6.368188381195068,
"epoch": 0.230483927940657,
"grad_norm": 1.2265625,
"learning_rate": 0.0004997718223978758,
"loss": 6.2331,
"mean_token_accuracy": 0.141592987626791,
"num_tokens": 4871186.0,
"step": 2610
},
{
"entropy": 6.359707069396973,
"epoch": 0.23092546803249736,
"grad_norm": 1.140625,
"learning_rate": 0.0004997704023030315,
"loss": 6.3149,
"mean_token_accuracy": 0.1497406058013439,
"num_tokens": 4879974.0,
"step": 2615
},
{
"entropy": 6.361460208892822,
"epoch": 0.2313670081243377,
"grad_norm": 1.109375,
"learning_rate": 0.0004997689778050627,
"loss": 6.3786,
"mean_token_accuracy": 0.13907945528626442,
"num_tokens": 4890300.0,
"step": 2620
},
{
"entropy": 6.382821655273437,
"epoch": 0.23180854821617802,
"grad_norm": 1.0859375,
"learning_rate": 0.0004997675489039975,
"loss": 6.3479,
"mean_token_accuracy": 0.1409486159682274,
"num_tokens": 4900428.0,
"step": 2625
},
{
"entropy": 6.362385368347168,
"epoch": 0.23225008830801835,
"grad_norm": 1.109375,
"learning_rate": 0.0004997661155998638,
"loss": 6.3464,
"mean_token_accuracy": 0.14176245480775834,
"num_tokens": 4910092.0,
"step": 2630
},
{
"entropy": 6.404236078262329,
"epoch": 0.2326916283998587,
"grad_norm": 1.15625,
"learning_rate": 0.0004997646778926898,
"loss": 6.3387,
"mean_token_accuracy": 0.1374544769525528,
"num_tokens": 4919593.0,
"step": 2635
},
{
"entropy": 6.340755891799927,
"epoch": 0.23313316849169904,
"grad_norm": 1.15625,
"learning_rate": 0.0004997632357825035,
"loss": 6.3179,
"mean_token_accuracy": 0.13816252574324608,
"num_tokens": 4929098.0,
"step": 2640
},
{
"entropy": 6.456451320648194,
"epoch": 0.23357470858353938,
"grad_norm": 1.1796875,
"learning_rate": 0.0004997617892693333,
"loss": 6.35,
"mean_token_accuracy": 0.14228551536798478,
"num_tokens": 4938265.0,
"step": 2645
},
{
"entropy": 6.420327758789062,
"epoch": 0.23401624867537973,
"grad_norm": 1.1328125,
"learning_rate": 0.0004997603383532075,
"loss": 6.3003,
"mean_token_accuracy": 0.14199153259396552,
"num_tokens": 4946694.0,
"step": 2650
},
{
"entropy": 6.29103798866272,
"epoch": 0.23445778876722007,
"grad_norm": 1.3515625,
"learning_rate": 0.0004997588830341545,
"loss": 6.3152,
"mean_token_accuracy": 0.14269881397485734,
"num_tokens": 4955296.0,
"step": 2655
},
{
"entropy": 6.337425231933594,
"epoch": 0.2348993288590604,
"grad_norm": 1.125,
"learning_rate": 0.0004997574233122028,
"loss": 6.3015,
"mean_token_accuracy": 0.147652330994606,
"num_tokens": 4964409.0,
"step": 2660
},
{
"entropy": 6.348830032348633,
"epoch": 0.23534086895090076,
"grad_norm": 1.078125,
"learning_rate": 0.0004997559591873809,
"loss": 6.2893,
"mean_token_accuracy": 0.14996645748615264,
"num_tokens": 4973449.0,
"step": 2665
},
{
"entropy": 6.3320433616638185,
"epoch": 0.2357824090427411,
"grad_norm": 1.1953125,
"learning_rate": 0.0004997544906597178,
"loss": 6.2838,
"mean_token_accuracy": 0.14481322914361955,
"num_tokens": 4983057.0,
"step": 2670
},
{
"entropy": 6.325637483596802,
"epoch": 0.23622394913458142,
"grad_norm": 1.5078125,
"learning_rate": 0.0004997530177292418,
"loss": 6.3494,
"mean_token_accuracy": 0.13466070592403412,
"num_tokens": 4991950.0,
"step": 2675
},
{
"entropy": 6.43730731010437,
"epoch": 0.23666548922642175,
"grad_norm": 1.0703125,
"learning_rate": 0.0004997515403959823,
"loss": 6.2955,
"mean_token_accuracy": 0.14283260256052016,
"num_tokens": 5001042.0,
"step": 2680
},
{
"entropy": 6.396935892105103,
"epoch": 0.2371070293182621,
"grad_norm": 1.4140625,
"learning_rate": 0.0004997500586599677,
"loss": 6.2485,
"mean_token_accuracy": 0.14456894770264625,
"num_tokens": 5009827.0,
"step": 2685
},
{
"entropy": 6.2672782897949215,
"epoch": 0.23754856941010244,
"grad_norm": 1.1328125,
"learning_rate": 0.0004997485725212274,
"loss": 6.2885,
"mean_token_accuracy": 0.14449408054351806,
"num_tokens": 5018708.0,
"step": 2690
},
{
"entropy": 6.272865295410156,
"epoch": 0.23799010950194277,
"grad_norm": 1.1640625,
"learning_rate": 0.0004997470819797903,
"loss": 6.1679,
"mean_token_accuracy": 0.1527360998094082,
"num_tokens": 5027522.0,
"step": 2695
},
{
"entropy": 6.284482479095459,
"epoch": 0.23843164959378313,
"grad_norm": 1.2109375,
"learning_rate": 0.0004997455870356857,
"loss": 6.2987,
"mean_token_accuracy": 0.1458326295018196,
"num_tokens": 5035755.0,
"step": 2700
},
{
"entropy": 6.35535831451416,
"epoch": 0.23887318968562346,
"grad_norm": 1.1875,
"learning_rate": 0.0004997440876889429,
"loss": 6.2588,
"mean_token_accuracy": 0.14414956122636796,
"num_tokens": 5045289.0,
"step": 2705
},
{
"entropy": 6.262376403808593,
"epoch": 0.2393147297774638,
"grad_norm": 1.0546875,
"learning_rate": 0.0004997425839395913,
"loss": 6.2788,
"mean_token_accuracy": 0.14706139862537385,
"num_tokens": 5053774.0,
"step": 2710
},
{
"entropy": 6.403537845611572,
"epoch": 0.23975626986930412,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997410757876602,
"loss": 6.3583,
"mean_token_accuracy": 0.1355147533118725,
"num_tokens": 5062911.0,
"step": 2715
},
{
"entropy": 6.373221158981323,
"epoch": 0.24019780996114448,
"grad_norm": 1.125,
"learning_rate": 0.0004997395632331793,
"loss": 6.223,
"mean_token_accuracy": 0.1466083750128746,
"num_tokens": 5072107.0,
"step": 2720
},
{
"entropy": 6.251181316375733,
"epoch": 0.2406393500529848,
"grad_norm": 1.3359375,
"learning_rate": 0.0004997380462761781,
"loss": 6.181,
"mean_token_accuracy": 0.1502533346414566,
"num_tokens": 5080588.0,
"step": 2725
},
{
"entropy": 6.353159761428833,
"epoch": 0.24108089014482514,
"grad_norm": 1.1875,
"learning_rate": 0.0004997365249166864,
"loss": 6.3864,
"mean_token_accuracy": 0.14094797894358635,
"num_tokens": 5090262.0,
"step": 2730
},
{
"entropy": 6.381338834762573,
"epoch": 0.2415224302366655,
"grad_norm": 1.1875,
"learning_rate": 0.0004997349991547342,
"loss": 6.2962,
"mean_token_accuracy": 0.14725386276841163,
"num_tokens": 5099285.0,
"step": 2735
},
{
"entropy": 6.368382978439331,
"epoch": 0.24196397032850583,
"grad_norm": 1.1328125,
"learning_rate": 0.0004997334689903509,
"loss": 6.3307,
"mean_token_accuracy": 0.14288511276245117,
"num_tokens": 5109115.0,
"step": 2740
},
{
"entropy": 6.4272418975830075,
"epoch": 0.24240551042034617,
"grad_norm": 1.3203125,
"learning_rate": 0.0004997319344235668,
"loss": 6.3721,
"mean_token_accuracy": 0.1368812806904316,
"num_tokens": 5117977.0,
"step": 2745
},
{
"entropy": 6.413669633865356,
"epoch": 0.2428470505121865,
"grad_norm": 1.234375,
"learning_rate": 0.000499730395454412,
"loss": 6.3185,
"mean_token_accuracy": 0.14243241772055626,
"num_tokens": 5127457.0,
"step": 2750
},
{
"entropy": 6.2972547054290775,
"epoch": 0.24328859060402686,
"grad_norm": 1.2265625,
"learning_rate": 0.0004997288520829166,
"loss": 6.3606,
"mean_token_accuracy": 0.13738505616784097,
"num_tokens": 5137310.0,
"step": 2755
},
{
"entropy": 6.390837097167969,
"epoch": 0.2437301306958672,
"grad_norm": 1.203125,
"learning_rate": 0.0004997273043091107,
"loss": 6.2857,
"mean_token_accuracy": 0.1405642569065094,
"num_tokens": 5146963.0,
"step": 2760
},
{
"entropy": 6.359052276611328,
"epoch": 0.24417167078770752,
"grad_norm": 1.2734375,
"learning_rate": 0.0004997257521330248,
"loss": 6.2501,
"mean_token_accuracy": 0.14132534712553024,
"num_tokens": 5155521.0,
"step": 2765
},
{
"entropy": 6.37628755569458,
"epoch": 0.24461321087954788,
"grad_norm": 1.2734375,
"learning_rate": 0.0004997241955546892,
"loss": 6.2586,
"mean_token_accuracy": 0.13957886546850204,
"num_tokens": 5165182.0,
"step": 2770
},
{
"entropy": 6.32409896850586,
"epoch": 0.2450547509713882,
"grad_norm": 1.1171875,
"learning_rate": 0.0004997226345741343,
"loss": 6.2833,
"mean_token_accuracy": 0.13664216697216033,
"num_tokens": 5175511.0,
"step": 2775
},
{
"entropy": 6.361440944671631,
"epoch": 0.24549629106322854,
"grad_norm": 1.265625,
"learning_rate": 0.000499721069191391,
"loss": 6.2283,
"mean_token_accuracy": 0.14851997345685958,
"num_tokens": 5184772.0,
"step": 2780
},
{
"entropy": 6.256292247772217,
"epoch": 0.24593783115506887,
"grad_norm": 1.140625,
"learning_rate": 0.0004997194994064896,
"loss": 6.3103,
"mean_token_accuracy": 0.14024864211678506,
"num_tokens": 5195136.0,
"step": 2785
},
{
"entropy": 6.3915492534637455,
"epoch": 0.24637937124690923,
"grad_norm": 1.2109375,
"learning_rate": 0.000499717925219461,
"loss": 6.249,
"mean_token_accuracy": 0.14889259859919549,
"num_tokens": 5203163.0,
"step": 2790
},
{
"entropy": 6.315735578536987,
"epoch": 0.24682091133874956,
"grad_norm": 1.1953125,
"learning_rate": 0.0004997163466303362,
"loss": 6.3376,
"mean_token_accuracy": 0.13842562362551689,
"num_tokens": 5213233.0,
"step": 2795
},
{
"entropy": 6.385308742523193,
"epoch": 0.2472624514305899,
"grad_norm": 1.09375,
"learning_rate": 0.000499714763639146,
"loss": 6.2659,
"mean_token_accuracy": 0.1395539350807667,
"num_tokens": 5222940.0,
"step": 2800
},
{
"entropy": 6.331099176406861,
"epoch": 0.24770399152243025,
"grad_norm": 1.328125,
"learning_rate": 0.0004997131762459211,
"loss": 6.2917,
"mean_token_accuracy": 0.13852713331580163,
"num_tokens": 5232263.0,
"step": 2805
},
{
"entropy": 6.337193584442138,
"epoch": 0.24814553161427058,
"grad_norm": 1.3359375,
"learning_rate": 0.0004997115844506932,
"loss": 6.2739,
"mean_token_accuracy": 0.13856021910905839,
"num_tokens": 5241536.0,
"step": 2810
},
{
"entropy": 6.376536083221436,
"epoch": 0.2485870717061109,
"grad_norm": 1.2421875,
"learning_rate": 0.0004997099882534929,
"loss": 6.2841,
"mean_token_accuracy": 0.13798881992697715,
"num_tokens": 5250702.0,
"step": 2815
},
{
"entropy": 6.387785339355469,
"epoch": 0.24902861179795124,
"grad_norm": 1.078125,
"learning_rate": 0.0004997083876543519,
"loss": 6.2968,
"mean_token_accuracy": 0.1387106366455555,
"num_tokens": 5259811.0,
"step": 2820
},
{
"entropy": 6.46270055770874,
"epoch": 0.2494701518897916,
"grad_norm": 1.09375,
"learning_rate": 0.0004997067826533014,
"loss": 6.3787,
"mean_token_accuracy": 0.13431487306952478,
"num_tokens": 5270518.0,
"step": 2825
},
{
"entropy": 6.343976306915283,
"epoch": 0.24991169198163193,
"grad_norm": 1.5234375,
"learning_rate": 0.0004997051732503726,
"loss": 6.2692,
"mean_token_accuracy": 0.14104484394192696,
"num_tokens": 5279538.0,
"step": 2830
},
{
"entropy": 6.288498306274414,
"epoch": 0.25035323207347226,
"grad_norm": 1.3515625,
"learning_rate": 0.0004997035594455975,
"loss": 6.2935,
"mean_token_accuracy": 0.13851248025894164,
"num_tokens": 5289633.0,
"step": 2835
},
{
"entropy": 6.403953742980957,
"epoch": 0.2507947721653126,
"grad_norm": 1.2578125,
"learning_rate": 0.0004997019412390074,
"loss": 6.3908,
"mean_token_accuracy": 0.14274223148822784,
"num_tokens": 5299148.0,
"step": 2840
},
{
"entropy": 6.318170356750488,
"epoch": 0.2512363122571529,
"grad_norm": 1.2109375,
"learning_rate": 0.000499700318630634,
"loss": 6.2601,
"mean_token_accuracy": 0.14186998903751374,
"num_tokens": 5309090.0,
"step": 2845
},
{
"entropy": 6.378513526916504,
"epoch": 0.2516778523489933,
"grad_norm": 1.28125,
"learning_rate": 0.0004996986916205092,
"loss": 6.3497,
"mean_token_accuracy": 0.13793296962976456,
"num_tokens": 5318798.0,
"step": 2850
},
{
"entropy": 6.330926847457886,
"epoch": 0.25211939244083365,
"grad_norm": 1.203125,
"learning_rate": 0.0004996970602086648,
"loss": 6.2201,
"mean_token_accuracy": 0.14618514329195023,
"num_tokens": 5327915.0,
"step": 2855
},
{
"entropy": 6.227778148651123,
"epoch": 0.252560932532674,
"grad_norm": 1.2265625,
"learning_rate": 0.0004996954243951327,
"loss": 6.2396,
"mean_token_accuracy": 0.15025153011083603,
"num_tokens": 5336970.0,
"step": 2860
},
{
"entropy": 6.362396907806397,
"epoch": 0.2530024726245143,
"grad_norm": 1.265625,
"learning_rate": 0.0004996937841799451,
"loss": 6.2156,
"mean_token_accuracy": 0.14974839985370636,
"num_tokens": 5345167.0,
"step": 2865
},
{
"entropy": 6.2248279571533205,
"epoch": 0.25344401271635464,
"grad_norm": 1.375,
"learning_rate": 0.0004996921395631342,
"loss": 6.1855,
"mean_token_accuracy": 0.14353529885411262,
"num_tokens": 5353399.0,
"step": 2870
},
{
"entropy": 6.3493123054504395,
"epoch": 0.25388555280819497,
"grad_norm": 1.2421875,
"learning_rate": 0.000499690490544732,
"loss": 6.2894,
"mean_token_accuracy": 0.14165428131818772,
"num_tokens": 5363224.0,
"step": 2875
},
{
"entropy": 6.406820631027221,
"epoch": 0.2543270929000353,
"grad_norm": 1.1796875,
"learning_rate": 0.0004996888371247707,
"loss": 6.3181,
"mean_token_accuracy": 0.14098790735006334,
"num_tokens": 5372274.0,
"step": 2880
},
{
"entropy": 6.34662184715271,
"epoch": 0.2547686329918757,
"grad_norm": 1.171875,
"learning_rate": 0.000499687179303283,
"loss": 6.2874,
"mean_token_accuracy": 0.14797318130731582,
"num_tokens": 5380240.0,
"step": 2885
},
{
"entropy": 6.25228362083435,
"epoch": 0.255210173083716,
"grad_norm": 1.171875,
"learning_rate": 0.0004996855170803012,
"loss": 6.1607,
"mean_token_accuracy": 0.15010163933038712,
"num_tokens": 5389390.0,
"step": 2890
},
{
"entropy": 6.337203788757324,
"epoch": 0.25565171317555635,
"grad_norm": 1.1875,
"learning_rate": 0.0004996838504558581,
"loss": 6.3114,
"mean_token_accuracy": 0.14117275848984717,
"num_tokens": 5399425.0,
"step": 2895
},
{
"entropy": 6.378282165527343,
"epoch": 0.2560932532673967,
"grad_norm": 1.2734375,
"learning_rate": 0.000499682179429986,
"loss": 6.3199,
"mean_token_accuracy": 0.14286198765039443,
"num_tokens": 5408717.0,
"step": 2900
},
{
"entropy": 6.319883155822754,
"epoch": 0.256534793359237,
"grad_norm": 1.1171875,
"learning_rate": 0.0004996805040027178,
"loss": 6.2533,
"mean_token_accuracy": 0.13577283322811126,
"num_tokens": 5418475.0,
"step": 2905
},
{
"entropy": 6.353005409240723,
"epoch": 0.25697633345107734,
"grad_norm": 1.171875,
"learning_rate": 0.0004996788241740863,
"loss": 6.3058,
"mean_token_accuracy": 0.14230425655841827,
"num_tokens": 5428403.0,
"step": 2910
},
{
"entropy": 6.345854663848877,
"epoch": 0.2574178735429177,
"grad_norm": 1.203125,
"learning_rate": 0.0004996771399441243,
"loss": 6.3449,
"mean_token_accuracy": 0.13902240470051766,
"num_tokens": 5437347.0,
"step": 2915
},
{
"entropy": 6.451116418838501,
"epoch": 0.25785941363475806,
"grad_norm": 1.1796875,
"learning_rate": 0.0004996754513128652,
"loss": 6.2456,
"mean_token_accuracy": 0.14855796918272973,
"num_tokens": 5446804.0,
"step": 2920
},
{
"entropy": 6.2477256774902346,
"epoch": 0.2583009537265984,
"grad_norm": 1.234375,
"learning_rate": 0.0004996737582803416,
"loss": 6.2091,
"mean_token_accuracy": 0.1402647577226162,
"num_tokens": 5455888.0,
"step": 2925
},
{
"entropy": 6.36528582572937,
"epoch": 0.2587424938184387,
"grad_norm": 1.2421875,
"learning_rate": 0.0004996720608465868,
"loss": 6.1781,
"mean_token_accuracy": 0.14944826811552048,
"num_tokens": 5463977.0,
"step": 2930
},
{
"entropy": 6.307216548919678,
"epoch": 0.25918403391027905,
"grad_norm": 1.640625,
"learning_rate": 0.0004996703590116342,
"loss": 6.3079,
"mean_token_accuracy": 0.14276890456676483,
"num_tokens": 5473780.0,
"step": 2935
},
{
"entropy": 6.31512484550476,
"epoch": 0.2596255740021194,
"grad_norm": 1.359375,
"learning_rate": 0.0004996686527755171,
"loss": 6.1977,
"mean_token_accuracy": 0.1501262977719307,
"num_tokens": 5482151.0,
"step": 2940
},
{
"entropy": 6.3214874267578125,
"epoch": 0.2600671140939597,
"grad_norm": 1.2734375,
"learning_rate": 0.0004996669421382687,
"loss": 6.2257,
"mean_token_accuracy": 0.1505381152033806,
"num_tokens": 5491103.0,
"step": 2945
},
{
"entropy": 6.25068473815918,
"epoch": 0.26050865418580005,
"grad_norm": 1.7578125,
"learning_rate": 0.0004996652270999228,
"loss": 6.2349,
"mean_token_accuracy": 0.15028091371059418,
"num_tokens": 5500367.0,
"step": 2950
},
{
"entropy": 6.329337501525879,
"epoch": 0.26095019427764043,
"grad_norm": 1.28125,
"learning_rate": 0.0004996635076605128,
"loss": 6.2539,
"mean_token_accuracy": 0.15224550366401673,
"num_tokens": 5509631.0,
"step": 2955
},
{
"entropy": 6.459008836746216,
"epoch": 0.26139173436948077,
"grad_norm": 1.625,
"learning_rate": 0.0004996617838200725,
"loss": 6.289,
"mean_token_accuracy": 0.1362527571618557,
"num_tokens": 5518635.0,
"step": 2960
},
{
"entropy": 6.2465019702911375,
"epoch": 0.2618332744613211,
"grad_norm": 1.421875,
"learning_rate": 0.0004996600555786357,
"loss": 6.2431,
"mean_token_accuracy": 0.14100067913532258,
"num_tokens": 5527696.0,
"step": 2965
},
{
"entropy": 6.315958070755005,
"epoch": 0.26227481455316143,
"grad_norm": 1.25,
"learning_rate": 0.0004996583229362362,
"loss": 6.2046,
"mean_token_accuracy": 0.14614154621958733,
"num_tokens": 5536632.0,
"step": 2970
},
{
"entropy": 6.385778141021729,
"epoch": 0.26271635464500176,
"grad_norm": 1.3828125,
"learning_rate": 0.0004996565858929078,
"loss": 6.2772,
"mean_token_accuracy": 0.14362908750772477,
"num_tokens": 5545825.0,
"step": 2975
},
{
"entropy": 6.284611654281616,
"epoch": 0.2631578947368421,
"grad_norm": 1.1640625,
"learning_rate": 0.0004996548444486847,
"loss": 6.166,
"mean_token_accuracy": 0.14970893263816834,
"num_tokens": 5555158.0,
"step": 2980
},
{
"entropy": 6.209372615814209,
"epoch": 0.2635994348286824,
"grad_norm": 1.2421875,
"learning_rate": 0.0004996530986036008,
"loss": 6.0922,
"mean_token_accuracy": 0.15141627043485642,
"num_tokens": 5564218.0,
"step": 2985
},
{
"entropy": 6.198943185806274,
"epoch": 0.2640409749205228,
"grad_norm": 1.2421875,
"learning_rate": 0.0004996513483576907,
"loss": 6.2522,
"mean_token_accuracy": 0.14398482963442802,
"num_tokens": 5572760.0,
"step": 2990
},
{
"entropy": 6.441630268096924,
"epoch": 0.26448251501236314,
"grad_norm": 2.015625,
"learning_rate": 0.0004996495937109884,
"loss": 6.3173,
"mean_token_accuracy": 0.14210836142301558,
"num_tokens": 5581660.0,
"step": 2995
},
{
"entropy": 6.330695295333863,
"epoch": 0.26492405510420347,
"grad_norm": 1.2578125,
"learning_rate": 0.0004996478346635283,
"loss": 6.2178,
"mean_token_accuracy": 0.14186472147703172,
"num_tokens": 5590664.0,
"step": 3000
},
{
"epoch": 0.26492405510420347,
"eval_entropy": 6.125705798268993,
"eval_loss": 6.292537212371826,
"eval_mean_token_accuracy": 0.14802020881356648,
"eval_num_tokens": 5590664.0,
"eval_runtime": 26.6031,
"eval_samples_per_second": 1327.479,
"eval_steps_per_second": 165.958,
"step": 3000
},
{
"entropy": 6.237614250183105,
"epoch": 0.2653655951960438,
"grad_norm": 1.4921875,
"learning_rate": 0.0004996460712153448,
"loss": 6.1001,
"mean_token_accuracy": 0.15663176029920578,
"num_tokens": 5598727.0,
"step": 3005
},
{
"entropy": 6.179663801193238,
"epoch": 0.26580713528788413,
"grad_norm": 1.5234375,
"learning_rate": 0.0004996443033664726,
"loss": 6.2871,
"mean_token_accuracy": 0.14380988031625747,
"num_tokens": 5608549.0,
"step": 3010
},
{
"entropy": 6.340897512435913,
"epoch": 0.26624867537972446,
"grad_norm": 1.375,
"learning_rate": 0.0004996425311169463,
"loss": 6.2245,
"mean_token_accuracy": 0.15150296986103057,
"num_tokens": 5617628.0,
"step": 3015
},
{
"entropy": 6.377718782424926,
"epoch": 0.2666902154715648,
"grad_norm": 1.2421875,
"learning_rate": 0.0004996407544668005,
"loss": 6.2818,
"mean_token_accuracy": 0.13613456413149833,
"num_tokens": 5627182.0,
"step": 3020
},
{
"entropy": 6.350316286087036,
"epoch": 0.2671317555634052,
"grad_norm": 1.46875,
"learning_rate": 0.0004996389734160701,
"loss": 6.3055,
"mean_token_accuracy": 0.13961158990859984,
"num_tokens": 5636413.0,
"step": 3025
},
{
"entropy": 6.370533466339111,
"epoch": 0.2675732956552455,
"grad_norm": 1.1796875,
"learning_rate": 0.00049963718796479,
"loss": 6.2542,
"mean_token_accuracy": 0.14205907806754112,
"num_tokens": 5646025.0,
"step": 3030
},
{
"entropy": 6.296344900131226,
"epoch": 0.26801483574708584,
"grad_norm": 1.1171875,
"learning_rate": 0.0004996353981129952,
"loss": 6.2607,
"mean_token_accuracy": 0.1442931205034256,
"num_tokens": 5656577.0,
"step": 3035
},
{
"entropy": 6.4285656929016115,
"epoch": 0.2684563758389262,
"grad_norm": 1.203125,
"learning_rate": 0.0004996336038607206,
"loss": 6.2455,
"mean_token_accuracy": 0.14679916203022003,
"num_tokens": 5665163.0,
"step": 3040
},
{
"entropy": 6.330079984664917,
"epoch": 0.2688979159307665,
"grad_norm": 1.3828125,
"learning_rate": 0.0004996318052080015,
"loss": 6.2566,
"mean_token_accuracy": 0.14481926709413528,
"num_tokens": 5675196.0,
"step": 3045
},
{
"entropy": 6.34555835723877,
"epoch": 0.26933945602260684,
"grad_norm": 1.4375,
"learning_rate": 0.0004996300021548731,
"loss": 6.197,
"mean_token_accuracy": 0.1455060735344887,
"num_tokens": 5684361.0,
"step": 3050
},
{
"entropy": 6.260120964050293,
"epoch": 0.26978099611444717,
"grad_norm": 1.1796875,
"learning_rate": 0.0004996281947013707,
"loss": 6.1798,
"mean_token_accuracy": 0.15278830826282502,
"num_tokens": 5694187.0,
"step": 3055
},
{
"entropy": 6.297383594512939,
"epoch": 0.27022253620628756,
"grad_norm": 1.2578125,
"learning_rate": 0.0004996263828475298,
"loss": 6.2398,
"mean_token_accuracy": 0.14067175090312958,
"num_tokens": 5702858.0,
"step": 3060
},
{
"entropy": 6.256354093551636,
"epoch": 0.2706640762981279,
"grad_norm": 1.1796875,
"learning_rate": 0.0004996245665933857,
"loss": 6.1588,
"mean_token_accuracy": 0.15283851474523544,
"num_tokens": 5712727.0,
"step": 3065
},
{
"entropy": 6.318592643737793,
"epoch": 0.2711056163899682,
"grad_norm": 1.3515625,
"learning_rate": 0.0004996227459389741,
"loss": 6.2727,
"mean_token_accuracy": 0.14474223479628562,
"num_tokens": 5722904.0,
"step": 3070
},
{
"entropy": 6.408034229278565,
"epoch": 0.27154715648180855,
"grad_norm": 1.1875,
"learning_rate": 0.0004996209208843307,
"loss": 6.3752,
"mean_token_accuracy": 0.14424618259072303,
"num_tokens": 5732228.0,
"step": 3075
},
{
"entropy": 6.349897289276123,
"epoch": 0.2719886965736489,
"grad_norm": 1.03125,
"learning_rate": 0.0004996190914294912,
"loss": 6.2983,
"mean_token_accuracy": 0.14683646857738494,
"num_tokens": 5743548.0,
"step": 3080
},
{
"entropy": 6.293585872650146,
"epoch": 0.2724302366654892,
"grad_norm": 1.2578125,
"learning_rate": 0.0004996172575744914,
"loss": 6.3202,
"mean_token_accuracy": 0.13539790511131286,
"num_tokens": 5754112.0,
"step": 3085
},
{
"entropy": 6.393399858474732,
"epoch": 0.27287177675732954,
"grad_norm": 1.109375,
"learning_rate": 0.0004996154193193673,
"loss": 6.1409,
"mean_token_accuracy": 0.15001579597592354,
"num_tokens": 5763377.0,
"step": 3090
},
{
"entropy": 6.1732752323150635,
"epoch": 0.27331331684916993,
"grad_norm": 1.2109375,
"learning_rate": 0.0004996135766641549,
"loss": 6.108,
"mean_token_accuracy": 0.14798013716936112,
"num_tokens": 5772000.0,
"step": 3095
},
{
"entropy": 6.311184072494507,
"epoch": 0.27375485694101026,
"grad_norm": 1.203125,
"learning_rate": 0.0004996117296088903,
"loss": 6.2394,
"mean_token_accuracy": 0.1420420527458191,
"num_tokens": 5782192.0,
"step": 3100
},
{
"entropy": 6.404490375518799,
"epoch": 0.2741963970328506,
"grad_norm": 1.2265625,
"learning_rate": 0.0004996098781536095,
"loss": 6.2906,
"mean_token_accuracy": 0.1430370345711708,
"num_tokens": 5791163.0,
"step": 3105
},
{
"entropy": 6.3008567810058596,
"epoch": 0.2746379371246909,
"grad_norm": 1.203125,
"learning_rate": 0.0004996080222983492,
"loss": 6.2862,
"mean_token_accuracy": 0.13813944384455681,
"num_tokens": 5801815.0,
"step": 3110
},
{
"entropy": 6.412563610076904,
"epoch": 0.27507947721653125,
"grad_norm": 1.203125,
"learning_rate": 0.0004996061620431453,
"loss": 6.3053,
"mean_token_accuracy": 0.1372584030032158,
"num_tokens": 5811545.0,
"step": 3115
},
{
"entropy": 6.312923192977905,
"epoch": 0.2755210173083716,
"grad_norm": 1.0859375,
"learning_rate": 0.0004996042973880344,
"loss": 6.3151,
"mean_token_accuracy": 0.1433285042643547,
"num_tokens": 5820285.0,
"step": 3120
},
{
"entropy": 6.318920564651489,
"epoch": 0.2759625574002119,
"grad_norm": 1.1640625,
"learning_rate": 0.0004996024283330532,
"loss": 6.1485,
"mean_token_accuracy": 0.14611285403370858,
"num_tokens": 5829284.0,
"step": 3125
},
{
"entropy": 6.29420223236084,
"epoch": 0.2764040974920523,
"grad_norm": 1.0859375,
"learning_rate": 0.000499600554878238,
"loss": 6.3298,
"mean_token_accuracy": 0.13846347481012344,
"num_tokens": 5838973.0,
"step": 3130
},
{
"entropy": 6.27738995552063,
"epoch": 0.27684563758389263,
"grad_norm": 1.328125,
"learning_rate": 0.0004995986770236258,
"loss": 6.1795,
"mean_token_accuracy": 0.14896027445793153,
"num_tokens": 5847434.0,
"step": 3135
},
{
"entropy": 6.298033714294434,
"epoch": 0.27728717767573297,
"grad_norm": 1.1640625,
"learning_rate": 0.0004995967947692533,
"loss": 6.1943,
"mean_token_accuracy": 0.14507781639695166,
"num_tokens": 5856464.0,
"step": 3140
},
{
"entropy": 6.335427713394165,
"epoch": 0.2777287177675733,
"grad_norm": 1.2265625,
"learning_rate": 0.0004995949081151571,
"loss": 6.2722,
"mean_token_accuracy": 0.14494210481643677,
"num_tokens": 5865892.0,
"step": 3145
},
{
"entropy": 6.315033102035523,
"epoch": 0.2781702578594136,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995930170613746,
"loss": 6.237,
"mean_token_accuracy": 0.14656798988580705,
"num_tokens": 5874606.0,
"step": 3150
},
{
"entropy": 6.306213092803955,
"epoch": 0.27861179795125396,
"grad_norm": 1.1328125,
"learning_rate": 0.0004995911216079425,
"loss": 6.2319,
"mean_token_accuracy": 0.14783644378185273,
"num_tokens": 5883853.0,
"step": 3155
},
{
"entropy": 6.385525226593018,
"epoch": 0.2790533380430943,
"grad_norm": 1.2734375,
"learning_rate": 0.0004995892217548981,
"loss": 6.2583,
"mean_token_accuracy": 0.14387187659740447,
"num_tokens": 5892841.0,
"step": 3160
},
{
"entropy": 6.3458394527435305,
"epoch": 0.2794948781349347,
"grad_norm": 1.359375,
"learning_rate": 0.0004995873175022786,
"loss": 6.2353,
"mean_token_accuracy": 0.1464378446340561,
"num_tokens": 5901966.0,
"step": 3165
},
{
"entropy": 6.269200468063355,
"epoch": 0.279936418226775,
"grad_norm": 1.15625,
"learning_rate": 0.0004995854088501213,
"loss": 6.1382,
"mean_token_accuracy": 0.1440639741718769,
"num_tokens": 5910003.0,
"step": 3170
},
{
"entropy": 6.240004587173462,
"epoch": 0.28037795831861534,
"grad_norm": 1.3203125,
"learning_rate": 0.0004995834957984634,
"loss": 6.291,
"mean_token_accuracy": 0.1417745180428028,
"num_tokens": 5920307.0,
"step": 3175
},
{
"entropy": 6.307330751419068,
"epoch": 0.28081949841045567,
"grad_norm": 1.3515625,
"learning_rate": 0.0004995815783473428,
"loss": 6.1405,
"mean_token_accuracy": 0.14922185912728309,
"num_tokens": 5929875.0,
"step": 3180
},
{
"entropy": 6.276836585998535,
"epoch": 0.281261038502296,
"grad_norm": 1.3671875,
"learning_rate": 0.0004995796564967967,
"loss": 6.1274,
"mean_token_accuracy": 0.14101065844297409,
"num_tokens": 5938570.0,
"step": 3185
},
{
"entropy": 6.234568166732788,
"epoch": 0.28170257859413633,
"grad_norm": 1.28125,
"learning_rate": 0.0004995777302468628,
"loss": 6.2715,
"mean_token_accuracy": 0.1487502433359623,
"num_tokens": 5947693.0,
"step": 3190
},
{
"entropy": 6.2986798763275145,
"epoch": 0.28214411868597666,
"grad_norm": 1.359375,
"learning_rate": 0.0004995757995975789,
"loss": 6.3549,
"mean_token_accuracy": 0.14176566973328592,
"num_tokens": 5957377.0,
"step": 3195
},
{
"entropy": 6.414698123931885,
"epoch": 0.28258565877781705,
"grad_norm": 1.3984375,
"learning_rate": 0.0004995738645489828,
"loss": 6.2702,
"mean_token_accuracy": 0.14696883633732796,
"num_tokens": 5966443.0,
"step": 3200
},
{
"entropy": 6.282436943054199,
"epoch": 0.2830271988696574,
"grad_norm": 1.484375,
"learning_rate": 0.0004995719251011124,
"loss": 6.1681,
"mean_token_accuracy": 0.14562456011772157,
"num_tokens": 5975027.0,
"step": 3205
},
{
"entropy": 6.329652166366577,
"epoch": 0.2834687389614977,
"grad_norm": 1.2734375,
"learning_rate": 0.0004995699812540058,
"loss": 6.2486,
"mean_token_accuracy": 0.148249339312315,
"num_tokens": 5983722.0,
"step": 3210
},
{
"entropy": 6.231355476379394,
"epoch": 0.28391027905333804,
"grad_norm": 1.15625,
"learning_rate": 0.000499568033007701,
"loss": 6.2674,
"mean_token_accuracy": 0.1401293992996216,
"num_tokens": 5993358.0,
"step": 3215
},
{
"entropy": 6.362948560714722,
"epoch": 0.2843518191451784,
"grad_norm": 1.265625,
"learning_rate": 0.0004995660803622361,
"loss": 6.2067,
"mean_token_accuracy": 0.15058139562606812,
"num_tokens": 6002743.0,
"step": 3220
},
{
"entropy": 6.4410686016082765,
"epoch": 0.2847933592370187,
"grad_norm": 1.265625,
"learning_rate": 0.0004995641233176494,
"loss": 6.3638,
"mean_token_accuracy": 0.13944116085767747,
"num_tokens": 6013727.0,
"step": 3225
},
{
"entropy": 6.373442220687866,
"epoch": 0.28523489932885904,
"grad_norm": 1.25,
"learning_rate": 0.0004995621618739792,
"loss": 6.2881,
"mean_token_accuracy": 0.1439940005540848,
"num_tokens": 6023397.0,
"step": 3230
},
{
"entropy": 6.350295162200927,
"epoch": 0.2856764394206994,
"grad_norm": 1.2109375,
"learning_rate": 0.000499560196031264,
"loss": 6.1873,
"mean_token_accuracy": 0.14995670616626738,
"num_tokens": 6032453.0,
"step": 3235
},
{
"entropy": 6.175947523117065,
"epoch": 0.28611797951253976,
"grad_norm": 1.2578125,
"learning_rate": 0.0004995582257895423,
"loss": 6.1641,
"mean_token_accuracy": 0.13984985798597335,
"num_tokens": 6042441.0,
"step": 3240
},
{
"entropy": 6.310670042037964,
"epoch": 0.2865595196043801,
"grad_norm": 1.359375,
"learning_rate": 0.0004995562511488528,
"loss": 6.1649,
"mean_token_accuracy": 0.1534782238304615,
"num_tokens": 6050881.0,
"step": 3245
},
{
"entropy": 6.252470016479492,
"epoch": 0.2870010596962204,
"grad_norm": 1.2890625,
"learning_rate": 0.0004995542721092337,
"loss": 6.2226,
"mean_token_accuracy": 0.1445020094513893,
"num_tokens": 6060804.0,
"step": 3250
},
{
"entropy": 6.373200368881226,
"epoch": 0.28744259978806075,
"grad_norm": 1.2890625,
"learning_rate": 0.0004995522886707244,
"loss": 6.3284,
"mean_token_accuracy": 0.14050979763269425,
"num_tokens": 6070774.0,
"step": 3255
},
{
"entropy": 6.413953495025635,
"epoch": 0.2878841398799011,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995503008333634,
"loss": 6.2875,
"mean_token_accuracy": 0.1406187132000923,
"num_tokens": 6080158.0,
"step": 3260
},
{
"entropy": 6.315617513656616,
"epoch": 0.2883256799717414,
"grad_norm": 1.2421875,
"learning_rate": 0.0004995483085971897,
"loss": 6.1952,
"mean_token_accuracy": 0.1474509745836258,
"num_tokens": 6089183.0,
"step": 3265
},
{
"entropy": 6.305659580230713,
"epoch": 0.2887672200635818,
"grad_norm": 1.2734375,
"learning_rate": 0.0004995463119622424,
"loss": 6.294,
"mean_token_accuracy": 0.14213767349720002,
"num_tokens": 6098536.0,
"step": 3270
},
{
"entropy": 6.171843099594116,
"epoch": 0.28920876015542213,
"grad_norm": 1.140625,
"learning_rate": 0.0004995443109285604,
"loss": 6.051,
"mean_token_accuracy": 0.16226806342601777,
"num_tokens": 6107745.0,
"step": 3275
},
{
"entropy": 6.261803674697876,
"epoch": 0.28965030024726246,
"grad_norm": 1.1484375,
"learning_rate": 0.0004995423054961832,
"loss": 6.247,
"mean_token_accuracy": 0.152182936668396,
"num_tokens": 6117512.0,
"step": 3280
},
{
"entropy": 6.266145706176758,
"epoch": 0.2900918403391028,
"grad_norm": 1.25,
"learning_rate": 0.00049954029566515,
"loss": 6.2528,
"mean_token_accuracy": 0.15064032524824142,
"num_tokens": 6126030.0,
"step": 3285
},
{
"entropy": 6.380165672302246,
"epoch": 0.2905333804309431,
"grad_norm": 1.28125,
"learning_rate": 0.0004995382814355,
"loss": 6.2915,
"mean_token_accuracy": 0.1421806663274765,
"num_tokens": 6134888.0,
"step": 3290
},
{
"entropy": 6.435223770141602,
"epoch": 0.29097492052278345,
"grad_norm": 1.3125,
"learning_rate": 0.0004995362628072728,
"loss": 6.2507,
"mean_token_accuracy": 0.15030645132064818,
"num_tokens": 6144274.0,
"step": 3295
},
{
"entropy": 6.207036447525025,
"epoch": 0.2914164606146238,
"grad_norm": 1.28125,
"learning_rate": 0.0004995342397805078,
"loss": 6.2525,
"mean_token_accuracy": 0.14731749445199965,
"num_tokens": 6153406.0,
"step": 3300
},
{
"entropy": 6.286630725860595,
"epoch": 0.29185800070646417,
"grad_norm": 1.3125,
"learning_rate": 0.0004995322123552448,
"loss": 6.1763,
"mean_token_accuracy": 0.14860426858067513,
"num_tokens": 6162743.0,
"step": 3305
},
{
"entropy": 6.315083646774292,
"epoch": 0.2922995407983045,
"grad_norm": 1.484375,
"learning_rate": 0.0004995301805315235,
"loss": 6.1518,
"mean_token_accuracy": 0.14915710389614106,
"num_tokens": 6171997.0,
"step": 3310
},
{
"entropy": 6.227348041534424,
"epoch": 0.29274108089014483,
"grad_norm": 1.3515625,
"learning_rate": 0.0004995281443093837,
"loss": 6.1821,
"mean_token_accuracy": 0.14849540442228318,
"num_tokens": 6181275.0,
"step": 3315
},
{
"entropy": 6.332483291625977,
"epoch": 0.29318262098198516,
"grad_norm": 1.3203125,
"learning_rate": 0.0004995261036888652,
"loss": 6.2705,
"mean_token_accuracy": 0.14153582453727723,
"num_tokens": 6191640.0,
"step": 3320
},
{
"entropy": 6.383525228500366,
"epoch": 0.2936241610738255,
"grad_norm": 1.28125,
"learning_rate": 0.0004995240586700081,
"loss": 6.2574,
"mean_token_accuracy": 0.14164062663912774,
"num_tokens": 6201508.0,
"step": 3325
},
{
"entropy": 6.233497428894043,
"epoch": 0.2940657011656658,
"grad_norm": 1.25,
"learning_rate": 0.0004995220092528522,
"loss": 6.139,
"mean_token_accuracy": 0.15600898191332818,
"num_tokens": 6209902.0,
"step": 3330
},
{
"entropy": 6.386223220825196,
"epoch": 0.29450724125750616,
"grad_norm": 1.234375,
"learning_rate": 0.000499519955437438,
"loss": 6.2886,
"mean_token_accuracy": 0.13724534064531327,
"num_tokens": 6219760.0,
"step": 3335
},
{
"entropy": 6.308050680160522,
"epoch": 0.29494878134934654,
"grad_norm": 1.2890625,
"learning_rate": 0.0004995178972238054,
"loss": 6.2712,
"mean_token_accuracy": 0.140892493724823,
"num_tokens": 6228721.0,
"step": 3340
},
{
"entropy": 6.249277830123901,
"epoch": 0.2953903214411869,
"grad_norm": 1.3046875,
"learning_rate": 0.000499515834611995,
"loss": 6.0912,
"mean_token_accuracy": 0.15884328559041022,
"num_tokens": 6237070.0,
"step": 3345
},
{
"entropy": 6.2829673290252686,
"epoch": 0.2958318615330272,
"grad_norm": 1.3359375,
"learning_rate": 0.0004995137676020472,
"loss": 6.2342,
"mean_token_accuracy": 0.14056732952594758,
"num_tokens": 6245659.0,
"step": 3350
},
{
"entropy": 6.2845625400543215,
"epoch": 0.29627340162486754,
"grad_norm": 1.21875,
"learning_rate": 0.0004995116961940023,
"loss": 6.211,
"mean_token_accuracy": 0.15007902830839157,
"num_tokens": 6255175.0,
"step": 3355
},
{
"entropy": 6.2821348190307615,
"epoch": 0.29671494171670787,
"grad_norm": 1.1953125,
"learning_rate": 0.0004995096203879009,
"loss": 6.2275,
"mean_token_accuracy": 0.13889190107583999,
"num_tokens": 6264962.0,
"step": 3360
},
{
"entropy": 6.295028495788574,
"epoch": 0.2971564818085482,
"grad_norm": 1.484375,
"learning_rate": 0.0004995075401837837,
"loss": 6.1385,
"mean_token_accuracy": 0.15292445346713066,
"num_tokens": 6273411.0,
"step": 3365
},
{
"entropy": 6.216491222381592,
"epoch": 0.29759802190038853,
"grad_norm": 1.34375,
"learning_rate": 0.0004995054555816915,
"loss": 6.1184,
"mean_token_accuracy": 0.15340590327978135,
"num_tokens": 6282618.0,
"step": 3370
},
{
"entropy": 6.16982479095459,
"epoch": 0.2980395619922289,
"grad_norm": 1.171875,
"learning_rate": 0.0004995033665816651,
"loss": 6.107,
"mean_token_accuracy": 0.15143536180257797,
"num_tokens": 6292008.0,
"step": 3375
},
{
"entropy": 6.202243089675903,
"epoch": 0.29848110208406925,
"grad_norm": 1.2421875,
"learning_rate": 0.0004995012731837454,
"loss": 6.085,
"mean_token_accuracy": 0.1523757502436638,
"num_tokens": 6301079.0,
"step": 3380
},
{
"entropy": 6.280016565322876,
"epoch": 0.2989226421759096,
"grad_norm": 1.328125,
"learning_rate": 0.0004994991753879736,
"loss": 6.2433,
"mean_token_accuracy": 0.14038580283522606,
"num_tokens": 6310543.0,
"step": 3385
},
{
"entropy": 6.310758495330811,
"epoch": 0.2993641822677499,
"grad_norm": 1.3828125,
"learning_rate": 0.0004994970731943904,
"loss": 6.201,
"mean_token_accuracy": 0.14722133427858353,
"num_tokens": 6320037.0,
"step": 3390
},
{
"entropy": 6.285776853561401,
"epoch": 0.29980572235959024,
"grad_norm": 1.484375,
"learning_rate": 0.0004994949666030374,
"loss": 6.2149,
"mean_token_accuracy": 0.14747923761606216,
"num_tokens": 6328948.0,
"step": 3395
},
{
"entropy": 6.212871885299682,
"epoch": 0.3002472624514306,
"grad_norm": 1.34375,
"learning_rate": 0.0004994928556139557,
"loss": 6.093,
"mean_token_accuracy": 0.15421175062656403,
"num_tokens": 6337449.0,
"step": 3400
},
{
"entropy": 6.196883726119995,
"epoch": 0.3006888025432709,
"grad_norm": 1.375,
"learning_rate": 0.0004994907402271865,
"loss": 6.1322,
"mean_token_accuracy": 0.15156666040420533,
"num_tokens": 6346130.0,
"step": 3405
},
{
"entropy": 6.221924304962158,
"epoch": 0.3011303426351113,
"grad_norm": 1.328125,
"learning_rate": 0.0004994886204427715,
"loss": 6.1765,
"mean_token_accuracy": 0.15341567099094391,
"num_tokens": 6354973.0,
"step": 3410
},
{
"entropy": 6.323950290679932,
"epoch": 0.3015718827269516,
"grad_norm": 1.3984375,
"learning_rate": 0.0004994864962607519,
"loss": 6.2308,
"mean_token_accuracy": 0.1454234704375267,
"num_tokens": 6364107.0,
"step": 3415
},
{
"entropy": 6.2969788074493405,
"epoch": 0.30201342281879195,
"grad_norm": 1.4765625,
"learning_rate": 0.0004994843676811697,
"loss": 6.199,
"mean_token_accuracy": 0.1469217300415039,
"num_tokens": 6372859.0,
"step": 3420
},
{
"entropy": 6.2598062515258786,
"epoch": 0.3024549629106323,
"grad_norm": 1.3515625,
"learning_rate": 0.0004994822347040664,
"loss": 6.0796,
"mean_token_accuracy": 0.15675319582223893,
"num_tokens": 6381818.0,
"step": 3425
},
{
"entropy": 6.2870680809021,
"epoch": 0.3028965030024726,
"grad_norm": 1.3203125,
"learning_rate": 0.0004994800973294837,
"loss": 6.2419,
"mean_token_accuracy": 0.1480972073972225,
"num_tokens": 6391460.0,
"step": 3430
},
{
"entropy": 6.335415649414062,
"epoch": 0.30333804309431295,
"grad_norm": 1.3125,
"learning_rate": 0.0004994779555574636,
"loss": 6.2516,
"mean_token_accuracy": 0.14857821315526962,
"num_tokens": 6401461.0,
"step": 3435
},
{
"entropy": 6.295047855377197,
"epoch": 0.3037795831861533,
"grad_norm": 1.515625,
"learning_rate": 0.000499475809388048,
"loss": 6.1387,
"mean_token_accuracy": 0.14693403244018555,
"num_tokens": 6410435.0,
"step": 3440
},
{
"entropy": 6.2984706401824955,
"epoch": 0.30422112327799367,
"grad_norm": 1.28125,
"learning_rate": 0.000499473658821279,
"loss": 6.352,
"mean_token_accuracy": 0.13787579387426377,
"num_tokens": 6420710.0,
"step": 3445
},
{
"entropy": 6.374636268615722,
"epoch": 0.304662663369834,
"grad_norm": 1.28125,
"learning_rate": 0.0004994715038571986,
"loss": 6.1802,
"mean_token_accuracy": 0.14614371061325074,
"num_tokens": 6429882.0,
"step": 3450
},
{
"entropy": 6.22500171661377,
"epoch": 0.30510420346167433,
"grad_norm": 1.265625,
"learning_rate": 0.0004994693444958493,
"loss": 6.1599,
"mean_token_accuracy": 0.1555553011596203,
"num_tokens": 6439183.0,
"step": 3455
},
{
"entropy": 6.33427243232727,
"epoch": 0.30554574355351466,
"grad_norm": 1.7578125,
"learning_rate": 0.000499467180737273,
"loss": 6.3324,
"mean_token_accuracy": 0.14285074174404144,
"num_tokens": 6448460.0,
"step": 3460
},
{
"entropy": 6.340069055557251,
"epoch": 0.305987283645355,
"grad_norm": 1.3359375,
"learning_rate": 0.0004994650125815124,
"loss": 6.2093,
"mean_token_accuracy": 0.14827462136745453,
"num_tokens": 6457687.0,
"step": 3465
},
{
"entropy": 6.230474996566772,
"epoch": 0.3064288237371953,
"grad_norm": 1.4609375,
"learning_rate": 0.0004994628400286097,
"loss": 6.1509,
"mean_token_accuracy": 0.14839715510606766,
"num_tokens": 6467057.0,
"step": 3470
},
{
"entropy": 6.220822429656982,
"epoch": 0.30687036382903565,
"grad_norm": 1.3203125,
"learning_rate": 0.0004994606630786078,
"loss": 6.2087,
"mean_token_accuracy": 0.1455997943878174,
"num_tokens": 6477484.0,
"step": 3475
},
{
"entropy": 6.366261005401611,
"epoch": 0.30731190392087604,
"grad_norm": 1.2890625,
"learning_rate": 0.0004994584817315492,
"loss": 6.2814,
"mean_token_accuracy": 0.14490586519241333,
"num_tokens": 6488381.0,
"step": 3480
},
{
"entropy": 6.3309496402740475,
"epoch": 0.30775344401271637,
"grad_norm": 1.375,
"learning_rate": 0.0004994562959874765,
"loss": 6.1799,
"mean_token_accuracy": 0.14776056110858918,
"num_tokens": 6498279.0,
"step": 3485
},
{
"entropy": 6.247140789031983,
"epoch": 0.3081949841045567,
"grad_norm": 1.46875,
"learning_rate": 0.0004994541058464326,
"loss": 6.1835,
"mean_token_accuracy": 0.14511879906058311,
"num_tokens": 6508008.0,
"step": 3490
},
{
"entropy": 6.368619108200074,
"epoch": 0.30863652419639703,
"grad_norm": 1.4453125,
"learning_rate": 0.0004994519113084605,
"loss": 6.2442,
"mean_token_accuracy": 0.14024475663900376,
"num_tokens": 6517263.0,
"step": 3495
},
{
"entropy": 6.38942060470581,
"epoch": 0.30907806428823736,
"grad_norm": 1.3984375,
"learning_rate": 0.0004994497123736029,
"loss": 6.3158,
"mean_token_accuracy": 0.13759939074516297,
"num_tokens": 6527682.0,
"step": 3500
},
{
"entropy": 6.29895167350769,
"epoch": 0.3095196043800777,
"grad_norm": 1.4140625,
"learning_rate": 0.0004994475090419034,
"loss": 6.1809,
"mean_token_accuracy": 0.14446886107325554,
"num_tokens": 6537143.0,
"step": 3505
},
{
"entropy": 6.31071515083313,
"epoch": 0.309961144471918,
"grad_norm": 1.3515625,
"learning_rate": 0.0004994453013134047,
"loss": 6.1863,
"mean_token_accuracy": 0.1450910188257694,
"num_tokens": 6546561.0,
"step": 3510
},
{
"entropy": 6.23366641998291,
"epoch": 0.3104026845637584,
"grad_norm": 1.3359375,
"learning_rate": 0.0004994430891881502,
"loss": 6.1911,
"mean_token_accuracy": 0.14489428102970123,
"num_tokens": 6555806.0,
"step": 3515
},
{
"entropy": 6.293187618255615,
"epoch": 0.31084422465559874,
"grad_norm": 1.3125,
"learning_rate": 0.0004994408726661832,
"loss": 6.2141,
"mean_token_accuracy": 0.1494822882115841,
"num_tokens": 6564836.0,
"step": 3520
},
{
"entropy": 6.278930139541626,
"epoch": 0.3112857647474391,
"grad_norm": 1.1640625,
"learning_rate": 0.0004994386517475472,
"loss": 6.2068,
"mean_token_accuracy": 0.1408160336315632,
"num_tokens": 6574997.0,
"step": 3525
},
{
"entropy": 6.318894767761231,
"epoch": 0.3117273048392794,
"grad_norm": 1.2890625,
"learning_rate": 0.0004994364264322856,
"loss": 6.2252,
"mean_token_accuracy": 0.14185250252485276,
"num_tokens": 6584589.0,
"step": 3530
},
{
"entropy": 6.292446851730347,
"epoch": 0.31216884493111974,
"grad_norm": 1.28125,
"learning_rate": 0.0004994341967204421,
"loss": 6.1669,
"mean_token_accuracy": 0.15242523699998856,
"num_tokens": 6592898.0,
"step": 3535
},
{
"entropy": 6.3396844387054445,
"epoch": 0.31261038502296007,
"grad_norm": 1.2734375,
"learning_rate": 0.0004994319626120603,
"loss": 6.1949,
"mean_token_accuracy": 0.15440042167901993,
"num_tokens": 6602454.0,
"step": 3540
},
{
"entropy": 6.231834363937378,
"epoch": 0.3130519251148004,
"grad_norm": 1.4609375,
"learning_rate": 0.0004994297241071841,
"loss": 6.1852,
"mean_token_accuracy": 0.1523444212973118,
"num_tokens": 6612454.0,
"step": 3545
},
{
"entropy": 6.299538946151733,
"epoch": 0.3134934652066408,
"grad_norm": 1.3203125,
"learning_rate": 0.000499427481205857,
"loss": 6.1802,
"mean_token_accuracy": 0.1479717329144478,
"num_tokens": 6621286.0,
"step": 3550
},
{
"entropy": 6.264144992828369,
"epoch": 0.3139350052984811,
"grad_norm": 1.34375,
"learning_rate": 0.0004994252339081234,
"loss": 6.1195,
"mean_token_accuracy": 0.14949584379792213,
"num_tokens": 6629684.0,
"step": 3555
},
{
"entropy": 6.2147904396057125,
"epoch": 0.31437654539032145,
"grad_norm": 1.3046875,
"learning_rate": 0.000499422982214027,
"loss": 6.2063,
"mean_token_accuracy": 0.15209176391363144,
"num_tokens": 6638836.0,
"step": 3560
},
{
"entropy": 6.2978600025177,
"epoch": 0.3148180854821618,
"grad_norm": 1.6484375,
"learning_rate": 0.0004994207261236121,
"loss": 6.1618,
"mean_token_accuracy": 0.14471966549754142,
"num_tokens": 6647337.0,
"step": 3565
},
{
"entropy": 6.1957439422607425,
"epoch": 0.3152596255740021,
"grad_norm": 1.265625,
"learning_rate": 0.0004994184656369227,
"loss": 6.1509,
"mean_token_accuracy": 0.14381661489605904,
"num_tokens": 6657246.0,
"step": 3570
},
{
"entropy": 6.334473371505737,
"epoch": 0.31570116566584244,
"grad_norm": 1.078125,
"learning_rate": 0.0004994162007540033,
"loss": 6.2969,
"mean_token_accuracy": 0.13743397295475007,
"num_tokens": 6667981.0,
"step": 3575
},
{
"entropy": 6.342165803909301,
"epoch": 0.3161427057576828,
"grad_norm": 1.25,
"learning_rate": 0.0004994139314748981,
"loss": 6.14,
"mean_token_accuracy": 0.15782761424779893,
"num_tokens": 6677462.0,
"step": 3580
},
{
"entropy": 6.14517126083374,
"epoch": 0.31658424584952316,
"grad_norm": 1.1875,
"learning_rate": 0.0004994116577996517,
"loss": 6.1806,
"mean_token_accuracy": 0.14892098158597947,
"num_tokens": 6687225.0,
"step": 3585
},
{
"entropy": 6.278700685501098,
"epoch": 0.3170257859413635,
"grad_norm": 1.2578125,
"learning_rate": 0.0004994093797283084,
"loss": 6.2461,
"mean_token_accuracy": 0.14409312158823012,
"num_tokens": 6696345.0,
"step": 3590
},
{
"entropy": 6.365807723999024,
"epoch": 0.3174673260332038,
"grad_norm": 1.390625,
"learning_rate": 0.0004994070972609132,
"loss": 6.2278,
"mean_token_accuracy": 0.1436710849404335,
"num_tokens": 6706207.0,
"step": 3595
},
{
"entropy": 6.277693223953247,
"epoch": 0.31790886612504415,
"grad_norm": 1.2890625,
"learning_rate": 0.0004994048103975103,
"loss": 6.141,
"mean_token_accuracy": 0.14587350636720658,
"num_tokens": 6714430.0,
"step": 3600
},
{
"entropy": 6.256088304519653,
"epoch": 0.3183504062168845,
"grad_norm": 1.1953125,
"learning_rate": 0.000499402519138145,
"loss": 6.165,
"mean_token_accuracy": 0.15041644424200057,
"num_tokens": 6724139.0,
"step": 3605
},
{
"entropy": 6.239550638198852,
"epoch": 0.3187919463087248,
"grad_norm": 1.1796875,
"learning_rate": 0.0004994002234828619,
"loss": 6.2016,
"mean_token_accuracy": 0.1462198480963707,
"num_tokens": 6733525.0,
"step": 3610
},
{
"entropy": 6.281878137588501,
"epoch": 0.31923348640056515,
"grad_norm": 1.3046875,
"learning_rate": 0.000499397923431706,
"loss": 6.3159,
"mean_token_accuracy": 0.1457715466618538,
"num_tokens": 6743738.0,
"step": 3615
},
{
"entropy": 6.400450372695923,
"epoch": 0.31967502649240553,
"grad_norm": 1.578125,
"learning_rate": 0.0004993956189847226,
"loss": 6.1568,
"mean_token_accuracy": 0.15204840898513794,
"num_tokens": 6752900.0,
"step": 3620
},
{
"entropy": 6.209289264678955,
"epoch": 0.32011656658424587,
"grad_norm": 1.546875,
"learning_rate": 0.0004993933101419565,
"loss": 6.1341,
"mean_token_accuracy": 0.15580240935087203,
"num_tokens": 6761776.0,
"step": 3625
},
{
"entropy": 6.293803882598877,
"epoch": 0.3205581066760862,
"grad_norm": 1.296875,
"learning_rate": 0.0004993909969034531,
"loss": 6.2924,
"mean_token_accuracy": 0.1407908871769905,
"num_tokens": 6771543.0,
"step": 3630
},
{
"entropy": 6.315399408340454,
"epoch": 0.3209996467679265,
"grad_norm": 1.4375,
"learning_rate": 0.0004993886792692576,
"loss": 6.1578,
"mean_token_accuracy": 0.14261920005083084,
"num_tokens": 6780010.0,
"step": 3635
},
{
"entropy": 6.289389181137085,
"epoch": 0.32144118685976686,
"grad_norm": 1.328125,
"learning_rate": 0.0004993863572394156,
"loss": 6.241,
"mean_token_accuracy": 0.14563653171062468,
"num_tokens": 6788830.0,
"step": 3640
},
{
"entropy": 6.26135663986206,
"epoch": 0.3218827269516072,
"grad_norm": 1.21875,
"learning_rate": 0.0004993840308139724,
"loss": 6.2059,
"mean_token_accuracy": 0.14630922228097915,
"num_tokens": 6799121.0,
"step": 3645
},
{
"entropy": 6.330420780181885,
"epoch": 0.3223242670434475,
"grad_norm": 1.28125,
"learning_rate": 0.0004993816999929738,
"loss": 6.1656,
"mean_token_accuracy": 0.1479571595788002,
"num_tokens": 6808519.0,
"step": 3650
},
{
"entropy": 6.250893688201904,
"epoch": 0.3227658071352879,
"grad_norm": 1.2265625,
"learning_rate": 0.0004993793647764651,
"loss": 6.1855,
"mean_token_accuracy": 0.15019199550151824,
"num_tokens": 6817583.0,
"step": 3655
},
{
"entropy": 6.281541872024536,
"epoch": 0.32320734722712824,
"grad_norm": 1.171875,
"learning_rate": 0.0004993770251644923,
"loss": 6.1776,
"mean_token_accuracy": 0.14661791399121285,
"num_tokens": 6827732.0,
"step": 3660
},
{
"entropy": 6.200496053695678,
"epoch": 0.32364888731896857,
"grad_norm": 1.25,
"learning_rate": 0.0004993746811571013,
"loss": 6.1516,
"mean_token_accuracy": 0.1507879838347435,
"num_tokens": 6836903.0,
"step": 3665
},
{
"entropy": 6.15623197555542,
"epoch": 0.3240904274108089,
"grad_norm": 1.3359375,
"learning_rate": 0.0004993723327543379,
"loss": 6.1458,
"mean_token_accuracy": 0.15642194598913192,
"num_tokens": 6845684.0,
"step": 3670
},
{
"entropy": 6.226500606536865,
"epoch": 0.32453196750264923,
"grad_norm": 1.3046875,
"learning_rate": 0.000499369979956248,
"loss": 6.1508,
"mean_token_accuracy": 0.1459520123898983,
"num_tokens": 6854650.0,
"step": 3675
},
{
"entropy": 6.29415922164917,
"epoch": 0.32497350759448956,
"grad_norm": 1.2734375,
"learning_rate": 0.0004993676227628779,
"loss": 6.148,
"mean_token_accuracy": 0.14504464268684386,
"num_tokens": 6864340.0,
"step": 3680
},
{
"entropy": 6.306327772140503,
"epoch": 0.3254150476863299,
"grad_norm": 1.609375,
"learning_rate": 0.0004993652611742736,
"loss": 6.1858,
"mean_token_accuracy": 0.15019768550992013,
"num_tokens": 6873244.0,
"step": 3685
},
{
"entropy": 6.112890195846558,
"epoch": 0.3258565877781703,
"grad_norm": 1.203125,
"learning_rate": 0.0004993628951904815,
"loss": 6.0704,
"mean_token_accuracy": 0.1555016480386257,
"num_tokens": 6882392.0,
"step": 3690
},
{
"entropy": 6.28070034980774,
"epoch": 0.3262981278700106,
"grad_norm": 1.3203125,
"learning_rate": 0.0004993605248115479,
"loss": 6.2963,
"mean_token_accuracy": 0.14003317803144455,
"num_tokens": 6891515.0,
"step": 3695
},
{
"entropy": 6.373077821731568,
"epoch": 0.32673966796185094,
"grad_norm": 1.5078125,
"learning_rate": 0.0004993581500375191,
"loss": 6.173,
"mean_token_accuracy": 0.14526692926883697,
"num_tokens": 6900104.0,
"step": 3700
},
{
"entropy": 6.296589422225952,
"epoch": 0.3271812080536913,
"grad_norm": 2.0625,
"learning_rate": 0.0004993557708684417,
"loss": 6.2939,
"mean_token_accuracy": 0.13876401036977767,
"num_tokens": 6910443.0,
"step": 3705
},
{
"entropy": 6.245956897735596,
"epoch": 0.3276227481455316,
"grad_norm": 1.2734375,
"learning_rate": 0.0004993533873043625,
"loss": 6.1438,
"mean_token_accuracy": 0.1444818288087845,
"num_tokens": 6919882.0,
"step": 3710
},
{
"entropy": 6.338452863693237,
"epoch": 0.32806428823737194,
"grad_norm": 1.4296875,
"learning_rate": 0.000499350999345328,
"loss": 6.2593,
"mean_token_accuracy": 0.13912570625543594,
"num_tokens": 6929757.0,
"step": 3715
},
{
"entropy": 6.288271760940551,
"epoch": 0.32850582832921227,
"grad_norm": 1.2578125,
"learning_rate": 0.000499348606991385,
"loss": 6.2531,
"mean_token_accuracy": 0.13713812530040742,
"num_tokens": 6938578.0,
"step": 3720
},
{
"entropy": 6.316042470932007,
"epoch": 0.32894736842105265,
"grad_norm": 1.171875,
"learning_rate": 0.0004993462102425805,
"loss": 6.1391,
"mean_token_accuracy": 0.14824429005384446,
"num_tokens": 6947920.0,
"step": 3725
},
{
"entropy": 6.1937977313995365,
"epoch": 0.329388908512893,
"grad_norm": 1.234375,
"learning_rate": 0.0004993438090989612,
"loss": 6.0803,
"mean_token_accuracy": 0.1511243000626564,
"num_tokens": 6957291.0,
"step": 3730
},
{
"entropy": 6.253715133666992,
"epoch": 0.3298304486047333,
"grad_norm": 1.3984375,
"learning_rate": 0.0004993414035605743,
"loss": 6.1485,
"mean_token_accuracy": 0.15854721516370773,
"num_tokens": 6966504.0,
"step": 3735
},
{
"entropy": 6.280976629257202,
"epoch": 0.33027198869657365,
"grad_norm": 1.390625,
"learning_rate": 0.0004993389936274669,
"loss": 6.1878,
"mean_token_accuracy": 0.1520113728940487,
"num_tokens": 6976234.0,
"step": 3740
},
{
"entropy": 6.250279951095581,
"epoch": 0.330713528788414,
"grad_norm": 1.3203125,
"learning_rate": 0.0004993365792996862,
"loss": 6.2406,
"mean_token_accuracy": 0.14429223239421846,
"num_tokens": 6986372.0,
"step": 3745
},
{
"entropy": 6.307081604003907,
"epoch": 0.3311550688802543,
"grad_norm": 1.296875,
"learning_rate": 0.0004993341605772795,
"loss": 6.1238,
"mean_token_accuracy": 0.15334457531571388,
"num_tokens": 6995553.0,
"step": 3750
},
{
"entropy": 6.191009140014648,
"epoch": 0.33159660897209464,
"grad_norm": 1.578125,
"learning_rate": 0.0004993317374602941,
"loss": 6.0382,
"mean_token_accuracy": 0.15769377201795579,
"num_tokens": 7005675.0,
"step": 3755
},
{
"entropy": 6.14142336845398,
"epoch": 0.33203814906393503,
"grad_norm": 1.375,
"learning_rate": 0.0004993293099487777,
"loss": 6.1723,
"mean_token_accuracy": 0.1418219581246376,
"num_tokens": 7014953.0,
"step": 3760
},
{
"entropy": 6.301387357711792,
"epoch": 0.33247968915577536,
"grad_norm": 1.2265625,
"learning_rate": 0.0004993268780427776,
"loss": 6.197,
"mean_token_accuracy": 0.15199018269777298,
"num_tokens": 7025075.0,
"step": 3765
},
{
"entropy": 6.2432451248168945,
"epoch": 0.3329212292476157,
"grad_norm": 1.6796875,
"learning_rate": 0.0004993244417423416,
"loss": 6.1866,
"mean_token_accuracy": 0.14759992957115173,
"num_tokens": 7034286.0,
"step": 3770
},
{
"entropy": 6.276465892791748,
"epoch": 0.333362769339456,
"grad_norm": 1.296875,
"learning_rate": 0.0004993220010475174,
"loss": 6.2286,
"mean_token_accuracy": 0.1462813802063465,
"num_tokens": 7043957.0,
"step": 3775
},
{
"entropy": 6.321380186080932,
"epoch": 0.33380430943129635,
"grad_norm": 1.203125,
"learning_rate": 0.0004993195559583526,
"loss": 6.1348,
"mean_token_accuracy": 0.1504329338669777,
"num_tokens": 7053170.0,
"step": 3780
},
{
"entropy": 6.1749907493591305,
"epoch": 0.3342458495231367,
"grad_norm": 1.265625,
"learning_rate": 0.0004993171064748954,
"loss": 6.1522,
"mean_token_accuracy": 0.14876105189323424,
"num_tokens": 7062469.0,
"step": 3785
},
{
"entropy": 6.1947144031524655,
"epoch": 0.334687389614977,
"grad_norm": 1.3359375,
"learning_rate": 0.0004993146525971937,
"loss": 6.1273,
"mean_token_accuracy": 0.1507238492369652,
"num_tokens": 7071463.0,
"step": 3790
},
{
"entropy": 6.411292028427124,
"epoch": 0.3351289297068174,
"grad_norm": 1.2421875,
"learning_rate": 0.0004993121943252955,
"loss": 6.2072,
"mean_token_accuracy": 0.14429879561066628,
"num_tokens": 7081574.0,
"step": 3795
},
{
"entropy": 6.190117692947387,
"epoch": 0.33557046979865773,
"grad_norm": 1.328125,
"learning_rate": 0.0004993097316592489,
"loss": 6.1422,
"mean_token_accuracy": 0.1508495032787323,
"num_tokens": 7090835.0,
"step": 3800
},
{
"entropy": 6.117297267913818,
"epoch": 0.33601200989049806,
"grad_norm": 1.734375,
"learning_rate": 0.0004993072645991023,
"loss": 6.0815,
"mean_token_accuracy": 0.1401878349483013,
"num_tokens": 7100521.0,
"step": 3805
},
{
"entropy": 6.263327598571777,
"epoch": 0.3364535499823384,
"grad_norm": 1.40625,
"learning_rate": 0.000499304793144904,
"loss": 6.153,
"mean_token_accuracy": 0.15199762284755708,
"num_tokens": 7109011.0,
"step": 3810
},
{
"entropy": 6.273023176193237,
"epoch": 0.3368950900741787,
"grad_norm": 1.28125,
"learning_rate": 0.0004993023172967022,
"loss": 6.1882,
"mean_token_accuracy": 0.13951589912176132,
"num_tokens": 7119128.0,
"step": 3815
},
{
"entropy": 6.324663877487183,
"epoch": 0.33733663016601906,
"grad_norm": 1.3984375,
"learning_rate": 0.0004992998370545458,
"loss": 6.254,
"mean_token_accuracy": 0.1373855710029602,
"num_tokens": 7128313.0,
"step": 3820
},
{
"entropy": 6.305013370513916,
"epoch": 0.3377781702578594,
"grad_norm": 1.2421875,
"learning_rate": 0.0004992973524184831,
"loss": 6.2009,
"mean_token_accuracy": 0.14602725803852082,
"num_tokens": 7137567.0,
"step": 3825
},
{
"entropy": 6.249309396743774,
"epoch": 0.3382197103496998,
"grad_norm": 1.3125,
"learning_rate": 0.0004992948633885627,
"loss": 6.1709,
"mean_token_accuracy": 0.15077222734689713,
"num_tokens": 7147254.0,
"step": 3830
},
{
"entropy": 6.1801636695861815,
"epoch": 0.3386612504415401,
"grad_norm": 1.1796875,
"learning_rate": 0.0004992923699648335,
"loss": 6.115,
"mean_token_accuracy": 0.14965742975473403,
"num_tokens": 7156215.0,
"step": 3835
},
{
"entropy": 6.356573963165284,
"epoch": 0.33910279053338044,
"grad_norm": 1.4140625,
"learning_rate": 0.0004992898721473445,
"loss": 6.1772,
"mean_token_accuracy": 0.14581147357821464,
"num_tokens": 7165653.0,
"step": 3840
},
{
"entropy": 6.171209383010864,
"epoch": 0.33954433062522077,
"grad_norm": 1.359375,
"learning_rate": 0.0004992873699361444,
"loss": 6.0745,
"mean_token_accuracy": 0.14739914536476134,
"num_tokens": 7174797.0,
"step": 3845
},
{
"entropy": 6.224230861663818,
"epoch": 0.3399858707170611,
"grad_norm": 1.6015625,
"learning_rate": 0.0004992848633312822,
"loss": 6.1114,
"mean_token_accuracy": 0.15535301566123963,
"num_tokens": 7184040.0,
"step": 3850
},
{
"entropy": 6.294191217422485,
"epoch": 0.34042741080890143,
"grad_norm": 1.4921875,
"learning_rate": 0.0004992823523328071,
"loss": 6.0608,
"mean_token_accuracy": 0.15379656255245208,
"num_tokens": 7193533.0,
"step": 3855
},
{
"entropy": 6.183957767486572,
"epoch": 0.34086895090074176,
"grad_norm": 1.5703125,
"learning_rate": 0.0004992798369407684,
"loss": 6.1687,
"mean_token_accuracy": 0.1520672157406807,
"num_tokens": 7203355.0,
"step": 3860
},
{
"entropy": 6.271494150161743,
"epoch": 0.34131049099258215,
"grad_norm": 1.9375,
"learning_rate": 0.0004992773171552152,
"loss": 6.1249,
"mean_token_accuracy": 0.1494740977883339,
"num_tokens": 7212569.0,
"step": 3865
},
{
"entropy": 6.210461950302124,
"epoch": 0.3417520310844225,
"grad_norm": 1.4140625,
"learning_rate": 0.0004992747929761968,
"loss": 6.1419,
"mean_token_accuracy": 0.15112009570002555,
"num_tokens": 7221886.0,
"step": 3870
},
{
"entropy": 6.223880386352539,
"epoch": 0.3421935711762628,
"grad_norm": 1.328125,
"learning_rate": 0.0004992722644037628,
"loss": 6.2028,
"mean_token_accuracy": 0.14669590443372726,
"num_tokens": 7232065.0,
"step": 3875
},
{
"entropy": 6.258075428009033,
"epoch": 0.34263511126810314,
"grad_norm": 1.2421875,
"learning_rate": 0.0004992697314379628,
"loss": 6.1439,
"mean_token_accuracy": 0.14625586122274398,
"num_tokens": 7242287.0,
"step": 3880
},
{
"entropy": 6.217844772338867,
"epoch": 0.3430766513599435,
"grad_norm": 1.390625,
"learning_rate": 0.0004992671940788462,
"loss": 6.1326,
"mean_token_accuracy": 0.14522299468517302,
"num_tokens": 7250638.0,
"step": 3885
},
{
"entropy": 6.199563884735108,
"epoch": 0.3435181914517838,
"grad_norm": 1.3359375,
"learning_rate": 0.0004992646523264628,
"loss": 6.1238,
"mean_token_accuracy": 0.15116736590862273,
"num_tokens": 7259526.0,
"step": 3890
},
{
"entropy": 6.25900559425354,
"epoch": 0.34395973154362414,
"grad_norm": 1.359375,
"learning_rate": 0.0004992621061808625,
"loss": 6.1216,
"mean_token_accuracy": 0.1581985518336296,
"num_tokens": 7269260.0,
"step": 3895
},
{
"entropy": 6.257178878784179,
"epoch": 0.3444012716354645,
"grad_norm": 1.7578125,
"learning_rate": 0.000499259555642095,
"loss": 6.1278,
"mean_token_accuracy": 0.1471450299024582,
"num_tokens": 7279061.0,
"step": 3900
},
{
"entropy": 6.255412244796753,
"epoch": 0.34484281172730485,
"grad_norm": 1.453125,
"learning_rate": 0.0004992570007102104,
"loss": 6.1315,
"mean_token_accuracy": 0.1531999722123146,
"num_tokens": 7289721.0,
"step": 3905
},
{
"entropy": 6.344775438308716,
"epoch": 0.3452843518191452,
"grad_norm": 1.3828125,
"learning_rate": 0.0004992544413852587,
"loss": 6.2762,
"mean_token_accuracy": 0.14250053465366364,
"num_tokens": 7299836.0,
"step": 3910
},
{
"entropy": 6.264148616790772,
"epoch": 0.3457258919109855,
"grad_norm": 1.421875,
"learning_rate": 0.00049925187766729,
"loss": 6.2837,
"mean_token_accuracy": 0.14403201416134834,
"num_tokens": 7309306.0,
"step": 3915
},
{
"entropy": 6.2656416416168215,
"epoch": 0.34616743200282585,
"grad_norm": 1.34375,
"learning_rate": 0.0004992493095563545,
"loss": 6.1734,
"mean_token_accuracy": 0.1555798202753067,
"num_tokens": 7318486.0,
"step": 3920
},
{
"entropy": 6.212107849121094,
"epoch": 0.3466089720946662,
"grad_norm": 1.46875,
"learning_rate": 0.0004992467370525026,
"loss": 6.1484,
"mean_token_accuracy": 0.14943969249725342,
"num_tokens": 7327764.0,
"step": 3925
},
{
"entropy": 6.288184976577758,
"epoch": 0.3470505121865065,
"grad_norm": 1.4921875,
"learning_rate": 0.0004992441601557848,
"loss": 6.2374,
"mean_token_accuracy": 0.1469939887523651,
"num_tokens": 7337118.0,
"step": 3930
},
{
"entropy": 6.226384830474854,
"epoch": 0.3474920522783469,
"grad_norm": 1.3984375,
"learning_rate": 0.0004992415788662514,
"loss": 6.1395,
"mean_token_accuracy": 0.15226749777793885,
"num_tokens": 7345973.0,
"step": 3935
},
{
"entropy": 6.269987630844116,
"epoch": 0.34793359237018723,
"grad_norm": 1.2578125,
"learning_rate": 0.0004992389931839529,
"loss": 6.1567,
"mean_token_accuracy": 0.14694736152887344,
"num_tokens": 7355776.0,
"step": 3940
},
{
"entropy": 6.228302812576294,
"epoch": 0.34837513246202756,
"grad_norm": 1.328125,
"learning_rate": 0.0004992364031089401,
"loss": 6.1744,
"mean_token_accuracy": 0.15075116157531737,
"num_tokens": 7364820.0,
"step": 3945
},
{
"entropy": 6.300107622146607,
"epoch": 0.3488166725538679,
"grad_norm": 1.2578125,
"learning_rate": 0.0004992338086412636,
"loss": 6.1812,
"mean_token_accuracy": 0.14802317172288895,
"num_tokens": 7373881.0,
"step": 3950
},
{
"entropy": 6.2126740455627445,
"epoch": 0.3492582126457082,
"grad_norm": 1.4375,
"learning_rate": 0.0004992312097809744,
"loss": 6.1403,
"mean_token_accuracy": 0.15314085334539412,
"num_tokens": 7383095.0,
"step": 3955
},
{
"entropy": 6.218991088867187,
"epoch": 0.34969975273754855,
"grad_norm": 1.3671875,
"learning_rate": 0.0004992286065281234,
"loss": 6.1802,
"mean_token_accuracy": 0.1452938474714756,
"num_tokens": 7392702.0,
"step": 3960
},
{
"entropy": 6.283171558380127,
"epoch": 0.3501412928293889,
"grad_norm": 1.5,
"learning_rate": 0.0004992259988827614,
"loss": 6.3207,
"mean_token_accuracy": 0.14126615449786187,
"num_tokens": 7402560.0,
"step": 3965
},
{
"entropy": 6.350764322280884,
"epoch": 0.35058283292122927,
"grad_norm": 1.4765625,
"learning_rate": 0.0004992233868449397,
"loss": 6.103,
"mean_token_accuracy": 0.15924863666296005,
"num_tokens": 7412375.0,
"step": 3970
},
{
"entropy": 6.316436672210694,
"epoch": 0.3510243730130696,
"grad_norm": 1.890625,
"learning_rate": 0.0004992207704147093,
"loss": 6.1616,
"mean_token_accuracy": 0.14135508239269257,
"num_tokens": 7420734.0,
"step": 3975
},
{
"entropy": 6.153539371490479,
"epoch": 0.35146591310490993,
"grad_norm": 1.3515625,
"learning_rate": 0.0004992181495921216,
"loss": 6.1609,
"mean_token_accuracy": 0.15113684087991713,
"num_tokens": 7430156.0,
"step": 3980
},
{
"entropy": 6.280019330978393,
"epoch": 0.35190745319675026,
"grad_norm": 1.65625,
"learning_rate": 0.0004992155243772277,
"loss": 6.139,
"mean_token_accuracy": 0.15385181754827498,
"num_tokens": 7439189.0,
"step": 3985
},
{
"entropy": 6.287850189208984,
"epoch": 0.3523489932885906,
"grad_norm": 1.3984375,
"learning_rate": 0.0004992128947700795,
"loss": 6.1788,
"mean_token_accuracy": 0.14511018246412277,
"num_tokens": 7448768.0,
"step": 3990
},
{
"entropy": 6.22083477973938,
"epoch": 0.3527905333804309,
"grad_norm": 1.609375,
"learning_rate": 0.000499210260770728,
"loss": 6.1243,
"mean_token_accuracy": 0.15062997192144395,
"num_tokens": 7458468.0,
"step": 3995
},
{
"entropy": 6.228656339645386,
"epoch": 0.35323207347227126,
"grad_norm": 1.9765625,
"learning_rate": 0.000499207622379225,
"loss": 6.2126,
"mean_token_accuracy": 0.1429911307990551,
"num_tokens": 7467351.0,
"step": 4000
},
{
"entropy": 6.292384910583496,
"epoch": 0.35367361356411164,
"grad_norm": 1.75,
"learning_rate": 0.0004992049795956222,
"loss": 6.1705,
"mean_token_accuracy": 0.14206876754760742,
"num_tokens": 7477116.0,
"step": 4005
},
{
"entropy": 6.26902494430542,
"epoch": 0.354115153655952,
"grad_norm": 1.5625,
"learning_rate": 0.0004992023324199715,
"loss": 6.1079,
"mean_token_accuracy": 0.1501702331006527,
"num_tokens": 7485216.0,
"step": 4010
},
{
"entropy": 6.2245752811431885,
"epoch": 0.3545566937477923,
"grad_norm": 1.6328125,
"learning_rate": 0.0004991996808523245,
"loss": 6.2427,
"mean_token_accuracy": 0.14149800166487694,
"num_tokens": 7495084.0,
"step": 4015
},
{
"entropy": 6.3255280494689945,
"epoch": 0.35499823383963264,
"grad_norm": 1.625,
"learning_rate": 0.0004991970248927332,
"loss": 6.2509,
"mean_token_accuracy": 0.14352200627326966,
"num_tokens": 7503219.0,
"step": 4020
},
{
"entropy": 6.284476709365845,
"epoch": 0.35543977393147297,
"grad_norm": 1.3671875,
"learning_rate": 0.0004991943645412498,
"loss": 6.0345,
"mean_token_accuracy": 0.1627778947353363,
"num_tokens": 7511961.0,
"step": 4025
},
{
"entropy": 6.1485429286956785,
"epoch": 0.3558813140233133,
"grad_norm": 1.6875,
"learning_rate": 0.0004991916997979263,
"loss": 6.1654,
"mean_token_accuracy": 0.14940103366971016,
"num_tokens": 7521927.0,
"step": 4030
},
{
"entropy": 6.13094744682312,
"epoch": 0.35632285411515363,
"grad_norm": 1.921875,
"learning_rate": 0.0004991890306628149,
"loss": 6.0939,
"mean_token_accuracy": 0.15506702959537505,
"num_tokens": 7531093.0,
"step": 4035
},
{
"entropy": 6.243637800216675,
"epoch": 0.356764394206994,
"grad_norm": 1.4296875,
"learning_rate": 0.0004991863571359678,
"loss": 6.0711,
"mean_token_accuracy": 0.15308146178722382,
"num_tokens": 7539813.0,
"step": 4040
},
{
"entropy": 6.321143770217896,
"epoch": 0.35720593429883435,
"grad_norm": 1.78125,
"learning_rate": 0.0004991836792174376,
"loss": 6.2364,
"mean_token_accuracy": 0.1433838851749897,
"num_tokens": 7548954.0,
"step": 4045
},
{
"entropy": 6.192954874038696,
"epoch": 0.3576474743906747,
"grad_norm": 1.59375,
"learning_rate": 0.0004991809969072765,
"loss": 6.11,
"mean_token_accuracy": 0.14762938171625137,
"num_tokens": 7558275.0,
"step": 4050
},
{
"entropy": 6.174587869644165,
"epoch": 0.358089014482515,
"grad_norm": 1.6015625,
"learning_rate": 0.0004991783102055371,
"loss": 6.1449,
"mean_token_accuracy": 0.15545178204774857,
"num_tokens": 7567870.0,
"step": 4055
},
{
"entropy": 6.297899484634399,
"epoch": 0.35853055457435534,
"grad_norm": 1.4921875,
"learning_rate": 0.0004991756191122723,
"loss": 6.0934,
"mean_token_accuracy": 0.1541736677289009,
"num_tokens": 7577485.0,
"step": 4060
},
{
"entropy": 6.299658966064453,
"epoch": 0.3589720946661957,
"grad_norm": 1.609375,
"learning_rate": 0.0004991729236275346,
"loss": 6.138,
"mean_token_accuracy": 0.14600877314805985,
"num_tokens": 7587398.0,
"step": 4065
},
{
"entropy": 6.189863204956055,
"epoch": 0.359413634758036,
"grad_norm": 1.5625,
"learning_rate": 0.0004991702237513768,
"loss": 6.1578,
"mean_token_accuracy": 0.14482004195451736,
"num_tokens": 7596310.0,
"step": 4070
},
{
"entropy": 6.276207828521729,
"epoch": 0.3598551748498764,
"grad_norm": 1.3828125,
"learning_rate": 0.0004991675194838517,
"loss": 6.1762,
"mean_token_accuracy": 0.14214570224285125,
"num_tokens": 7606971.0,
"step": 4075
},
{
"entropy": 6.229099607467651,
"epoch": 0.3602967149417167,
"grad_norm": 1.484375,
"learning_rate": 0.0004991648108250125,
"loss": 6.1613,
"mean_token_accuracy": 0.1436733439564705,
"num_tokens": 7616636.0,
"step": 4080
},
{
"entropy": 6.272100257873535,
"epoch": 0.36073825503355705,
"grad_norm": 3.125,
"learning_rate": 0.000499162097774912,
"loss": 6.1936,
"mean_token_accuracy": 0.14892185628414153,
"num_tokens": 7625128.0,
"step": 4085
},
{
"entropy": 6.300772094726563,
"epoch": 0.3611797951253974,
"grad_norm": 1.4453125,
"learning_rate": 0.0004991593803336037,
"loss": 6.1048,
"mean_token_accuracy": 0.15312197506427766,
"num_tokens": 7634224.0,
"step": 4090
},
{
"entropy": 6.205416059494018,
"epoch": 0.3616213352172377,
"grad_norm": 1.4140625,
"learning_rate": 0.0004991566585011405,
"loss": 6.0989,
"mean_token_accuracy": 0.15441585183143616,
"num_tokens": 7643392.0,
"step": 4095
},
{
"entropy": 6.1346405982971195,
"epoch": 0.36206287530907805,
"grad_norm": 1.4921875,
"learning_rate": 0.0004991539322775758,
"loss": 6.1058,
"mean_token_accuracy": 0.15174489617347717,
"num_tokens": 7652491.0,
"step": 4100
},
{
"entropy": 6.368760204315185,
"epoch": 0.3625044154009184,
"grad_norm": 1.59375,
"learning_rate": 0.0004991512016629632,
"loss": 6.3038,
"mean_token_accuracy": 0.13078175261616706,
"num_tokens": 7663192.0,
"step": 4105
},
{
"entropy": 6.315375518798828,
"epoch": 0.36294595549275877,
"grad_norm": 1.5546875,
"learning_rate": 0.0004991484666573558,
"loss": 6.1522,
"mean_token_accuracy": 0.14904795587062836,
"num_tokens": 7672801.0,
"step": 4110
},
{
"entropy": 6.252296113967896,
"epoch": 0.3633874955845991,
"grad_norm": 1.8828125,
"learning_rate": 0.0004991457272608077,
"loss": 6.1542,
"mean_token_accuracy": 0.14702531695365906,
"num_tokens": 7683013.0,
"step": 4115
},
{
"entropy": 6.297828722000122,
"epoch": 0.3638290356764394,
"grad_norm": 2.015625,
"learning_rate": 0.0004991429834733721,
"loss": 6.1931,
"mean_token_accuracy": 0.14496390148997307,
"num_tokens": 7692760.0,
"step": 4120
},
{
"entropy": 6.298480558395386,
"epoch": 0.36427057576827976,
"grad_norm": 1.6640625,
"learning_rate": 0.000499140235295103,
"loss": 6.1446,
"mean_token_accuracy": 0.14857310950756072,
"num_tokens": 7702005.0,
"step": 4125
},
{
"entropy": 6.211084604263306,
"epoch": 0.3647121158601201,
"grad_norm": 1.8359375,
"learning_rate": 0.0004991374827260542,
"loss": 6.1843,
"mean_token_accuracy": 0.1434581458568573,
"num_tokens": 7711604.0,
"step": 4130
},
{
"entropy": 6.183524751663208,
"epoch": 0.3651536559519604,
"grad_norm": 1.8359375,
"learning_rate": 0.0004991347257662795,
"loss": 6.071,
"mean_token_accuracy": 0.14973973408341407,
"num_tokens": 7720434.0,
"step": 4135
},
{
"entropy": 6.288224840164185,
"epoch": 0.36559519604380075,
"grad_norm": 1.40625,
"learning_rate": 0.000499131964415833,
"loss": 6.1418,
"mean_token_accuracy": 0.15498689860105513,
"num_tokens": 7730733.0,
"step": 4140
},
{
"entropy": 6.203797483444214,
"epoch": 0.36603673613564114,
"grad_norm": 1.421875,
"learning_rate": 0.0004991291986747689,
"loss": 6.2046,
"mean_token_accuracy": 0.14789941981434823,
"num_tokens": 7740394.0,
"step": 4145
},
{
"entropy": 6.29754409790039,
"epoch": 0.36647827622748147,
"grad_norm": 1.7421875,
"learning_rate": 0.0004991264285431412,
"loss": 6.1513,
"mean_token_accuracy": 0.1500290587544441,
"num_tokens": 7748919.0,
"step": 4150
},
{
"entropy": 6.3295409202575685,
"epoch": 0.3669198163193218,
"grad_norm": 1.5546875,
"learning_rate": 0.0004991236540210041,
"loss": 6.1714,
"mean_token_accuracy": 0.1469644583761692,
"num_tokens": 7758591.0,
"step": 4155
},
{
"entropy": 6.285003566741944,
"epoch": 0.36736135641116213,
"grad_norm": 1.5234375,
"learning_rate": 0.0004991208751084122,
"loss": 6.2316,
"mean_token_accuracy": 0.13881740272045134,
"num_tokens": 7768269.0,
"step": 4160
},
{
"entropy": 6.3394371509552006,
"epoch": 0.36780289650300246,
"grad_norm": 1.7109375,
"learning_rate": 0.0004991180918054199,
"loss": 6.2465,
"mean_token_accuracy": 0.13873956948518754,
"num_tokens": 7776980.0,
"step": 4165
},
{
"entropy": 6.301831388473511,
"epoch": 0.3682444365948428,
"grad_norm": 1.46875,
"learning_rate": 0.0004991153041120815,
"loss": 6.153,
"mean_token_accuracy": 0.14983465075492858,
"num_tokens": 7786664.0,
"step": 4170
},
{
"entropy": 6.168996095657349,
"epoch": 0.3686859766866831,
"grad_norm": 1.40625,
"learning_rate": 0.0004991125120284519,
"loss": 6.0133,
"mean_token_accuracy": 0.15708141028881073,
"num_tokens": 7794981.0,
"step": 4175
},
{
"entropy": 6.173023843765259,
"epoch": 0.3691275167785235,
"grad_norm": 1.4921875,
"learning_rate": 0.0004991097155545856,
"loss": 6.0913,
"mean_token_accuracy": 0.14929922968149184,
"num_tokens": 7804850.0,
"step": 4180
},
{
"entropy": 6.1990776538848875,
"epoch": 0.36956905687036384,
"grad_norm": 1.40625,
"learning_rate": 0.0004991069146905374,
"loss": 6.1201,
"mean_token_accuracy": 0.1546562761068344,
"num_tokens": 7814117.0,
"step": 4185
},
{
"entropy": 6.218803024291992,
"epoch": 0.3700105969622042,
"grad_norm": 1.296875,
"learning_rate": 0.0004991041094363621,
"loss": 6.1467,
"mean_token_accuracy": 0.1517006754875183,
"num_tokens": 7823384.0,
"step": 4190
},
{
"entropy": 6.262414836883545,
"epoch": 0.3704521370540445,
"grad_norm": 1.34375,
"learning_rate": 0.0004991012997921149,
"loss": 6.1422,
"mean_token_accuracy": 0.15224702507257462,
"num_tokens": 7834072.0,
"step": 4195
},
{
"entropy": 6.276657199859619,
"epoch": 0.37089367714588484,
"grad_norm": 1.703125,
"learning_rate": 0.0004990984857578506,
"loss": 6.1365,
"mean_token_accuracy": 0.14929545894265175,
"num_tokens": 7843334.0,
"step": 4200
},
{
"entropy": 6.120020055770874,
"epoch": 0.37133521723772517,
"grad_norm": 4.125,
"learning_rate": 0.0004990956673336245,
"loss": 6.0645,
"mean_token_accuracy": 0.15058329552412034,
"num_tokens": 7853187.0,
"step": 4205
},
{
"entropy": 6.233019495010376,
"epoch": 0.3717767573295655,
"grad_norm": 1.46875,
"learning_rate": 0.0004990928445194917,
"loss": 6.1478,
"mean_token_accuracy": 0.15026503801345825,
"num_tokens": 7862262.0,
"step": 4210
},
{
"entropy": 6.240013313293457,
"epoch": 0.3722182974214059,
"grad_norm": 1.34375,
"learning_rate": 0.0004990900173155074,
"loss": 6.0835,
"mean_token_accuracy": 0.1559366464614868,
"num_tokens": 7870725.0,
"step": 4215
},
{
"entropy": 6.1844745635986325,
"epoch": 0.3726598375132462,
"grad_norm": 1.4921875,
"learning_rate": 0.0004990871857217273,
"loss": 6.0175,
"mean_token_accuracy": 0.156622314453125,
"num_tokens": 7879492.0,
"step": 4220
},
{
"entropy": 6.186220645904541,
"epoch": 0.37310137760508655,
"grad_norm": 1.7421875,
"learning_rate": 0.0004990843497382066,
"loss": 6.1199,
"mean_token_accuracy": 0.15137410163879395,
"num_tokens": 7888710.0,
"step": 4225
},
{
"entropy": 6.2027770519256595,
"epoch": 0.3735429176969269,
"grad_norm": 1.90625,
"learning_rate": 0.0004990815093650009,
"loss": 6.1373,
"mean_token_accuracy": 0.15678878873586655,
"num_tokens": 7898313.0,
"step": 4230
},
{
"entropy": 6.225341176986694,
"epoch": 0.3739844577887672,
"grad_norm": 1.5234375,
"learning_rate": 0.0004990786646021659,
"loss": 6.1545,
"mean_token_accuracy": 0.15106336325407027,
"num_tokens": 7906726.0,
"step": 4235
},
{
"entropy": 6.251669549942017,
"epoch": 0.37442599788060754,
"grad_norm": 1.5078125,
"learning_rate": 0.0004990758154497573,
"loss": 6.0697,
"mean_token_accuracy": 0.1596512719988823,
"num_tokens": 7915554.0,
"step": 4240
},
{
"entropy": 6.321279048919678,
"epoch": 0.3748675379724479,
"grad_norm": 1.40625,
"learning_rate": 0.0004990729619078309,
"loss": 6.1919,
"mean_token_accuracy": 0.1491725593805313,
"num_tokens": 7924732.0,
"step": 4245
},
{
"entropy": 6.317298793792725,
"epoch": 0.37530907806428826,
"grad_norm": 1.40625,
"learning_rate": 0.0004990701039764427,
"loss": 6.1122,
"mean_token_accuracy": 0.15492920577526093,
"num_tokens": 7933808.0,
"step": 4250
},
{
"entropy": 6.2203545570373535,
"epoch": 0.3757506181561286,
"grad_norm": 1.6328125,
"learning_rate": 0.0004990672416556485,
"loss": 6.0878,
"mean_token_accuracy": 0.15237104147672653,
"num_tokens": 7942558.0,
"step": 4255
},
{
"entropy": 6.167264366149903,
"epoch": 0.3761921582479689,
"grad_norm": 1.5703125,
"learning_rate": 0.0004990643749455045,
"loss": 6.1847,
"mean_token_accuracy": 0.14426907226443292,
"num_tokens": 7951951.0,
"step": 4260
},
{
"entropy": 6.262331008911133,
"epoch": 0.37663369833980925,
"grad_norm": 1.6015625,
"learning_rate": 0.0004990615038460667,
"loss": 6.0762,
"mean_token_accuracy": 0.15311131328344346,
"num_tokens": 7960543.0,
"step": 4265
},
{
"entropy": 6.225819635391235,
"epoch": 0.3770752384316496,
"grad_norm": 1.765625,
"learning_rate": 0.0004990586283573916,
"loss": 6.0691,
"mean_token_accuracy": 0.14869122356176376,
"num_tokens": 7970273.0,
"step": 4270
},
{
"entropy": 6.235108423233032,
"epoch": 0.3775167785234899,
"grad_norm": 1.8671875,
"learning_rate": 0.0004990557484795355,
"loss": 6.1568,
"mean_token_accuracy": 0.14895667880773544,
"num_tokens": 7978888.0,
"step": 4275
},
{
"entropy": 6.253112888336181,
"epoch": 0.37795831861533025,
"grad_norm": 1.40625,
"learning_rate": 0.0004990528642125545,
"loss": 6.1542,
"mean_token_accuracy": 0.14458952248096466,
"num_tokens": 7988843.0,
"step": 4280
},
{
"entropy": 6.303048610687256,
"epoch": 0.37839985870717063,
"grad_norm": 1.8984375,
"learning_rate": 0.0004990499755565055,
"loss": 6.1415,
"mean_token_accuracy": 0.15063393414020537,
"num_tokens": 7998403.0,
"step": 4285
},
{
"entropy": 6.212564897537232,
"epoch": 0.37884139879901096,
"grad_norm": 1.75,
"learning_rate": 0.0004990470825114448,
"loss": 6.1823,
"mean_token_accuracy": 0.14829795211553573,
"num_tokens": 8007493.0,
"step": 4290
},
{
"entropy": 6.183409309387207,
"epoch": 0.3792829388908513,
"grad_norm": 1.453125,
"learning_rate": 0.0004990441850774292,
"loss": 6.1306,
"mean_token_accuracy": 0.15667677968740462,
"num_tokens": 8016399.0,
"step": 4295
},
{
"entropy": 6.299896287918091,
"epoch": 0.3797244789826916,
"grad_norm": 2.21875,
"learning_rate": 0.0004990412832545155,
"loss": 6.1374,
"mean_token_accuracy": 0.14585245102643968,
"num_tokens": 8025891.0,
"step": 4300
},
{
"entropy": 6.230182123184204,
"epoch": 0.38016601907453196,
"grad_norm": 1.875,
"learning_rate": 0.0004990383770427603,
"loss": 6.067,
"mean_token_accuracy": 0.1459854580461979,
"num_tokens": 8034733.0,
"step": 4305
},
{
"entropy": 6.226004886627197,
"epoch": 0.3806075591663723,
"grad_norm": 4.03125,
"learning_rate": 0.0004990354664422209,
"loss": 6.1477,
"mean_token_accuracy": 0.1523943141102791,
"num_tokens": 8044443.0,
"step": 4310
},
{
"entropy": 6.189437389373779,
"epoch": 0.3810490992582126,
"grad_norm": 1.625,
"learning_rate": 0.0004990325514529541,
"loss": 6.116,
"mean_token_accuracy": 0.15985741317272187,
"num_tokens": 8053920.0,
"step": 4315
},
{
"entropy": 6.259650993347168,
"epoch": 0.381490639350053,
"grad_norm": 1.6953125,
"learning_rate": 0.0004990296320750169,
"loss": 6.1096,
"mean_token_accuracy": 0.1530056282877922,
"num_tokens": 8063455.0,
"step": 4320
},
{
"entropy": 6.243551778793335,
"epoch": 0.38193217944189334,
"grad_norm": 2.453125,
"learning_rate": 0.0004990267083084667,
"loss": 6.1845,
"mean_token_accuracy": 0.14791684821248055,
"num_tokens": 8073353.0,
"step": 4325
},
{
"entropy": 6.274292850494385,
"epoch": 0.38237371953373367,
"grad_norm": 1.6953125,
"learning_rate": 0.0004990237801533607,
"loss": 6.2066,
"mean_token_accuracy": 0.15257567763328553,
"num_tokens": 8082164.0,
"step": 4330
},
{
"entropy": 6.287510538101197,
"epoch": 0.382815259625574,
"grad_norm": 1.96875,
"learning_rate": 0.0004990208476097562,
"loss": 6.1886,
"mean_token_accuracy": 0.1459839954972267,
"num_tokens": 8090790.0,
"step": 4335
},
{
"entropy": 6.418135309219361,
"epoch": 0.38325679971741433,
"grad_norm": 1.6015625,
"learning_rate": 0.0004990179106777109,
"loss": 6.2336,
"mean_token_accuracy": 0.14242262542247772,
"num_tokens": 8100412.0,
"step": 4340
},
{
"entropy": 6.273163890838623,
"epoch": 0.38369833980925466,
"grad_norm": 1.6171875,
"learning_rate": 0.0004990149693572819,
"loss": 6.2018,
"mean_token_accuracy": 0.14505023881793022,
"num_tokens": 8110002.0,
"step": 4345
},
{
"entropy": 6.2056801319122314,
"epoch": 0.384139879901095,
"grad_norm": 1.6953125,
"learning_rate": 0.0004990120236485271,
"loss": 6.099,
"mean_token_accuracy": 0.15307314246892928,
"num_tokens": 8118898.0,
"step": 4350
},
{
"entropy": 6.196920156478882,
"epoch": 0.3845814199929354,
"grad_norm": 1.828125,
"learning_rate": 0.0004990090735515043,
"loss": 6.1459,
"mean_token_accuracy": 0.1457451120018959,
"num_tokens": 8128207.0,
"step": 4355
},
{
"entropy": 6.205824518203736,
"epoch": 0.3850229600847757,
"grad_norm": 1.7421875,
"learning_rate": 0.000499006119066271,
"loss": 6.1487,
"mean_token_accuracy": 0.1461340069770813,
"num_tokens": 8137317.0,
"step": 4360
},
{
"entropy": 6.264606618881226,
"epoch": 0.38546450017661604,
"grad_norm": 1.4296875,
"learning_rate": 0.0004990031601928854,
"loss": 6.1663,
"mean_token_accuracy": 0.1496730253100395,
"num_tokens": 8146519.0,
"step": 4365
},
{
"entropy": 6.180057716369629,
"epoch": 0.3859060402684564,
"grad_norm": 1.796875,
"learning_rate": 0.0004990001969314051,
"loss": 6.2049,
"mean_token_accuracy": 0.1440427668392658,
"num_tokens": 8155916.0,
"step": 4370
},
{
"entropy": 6.339586400985718,
"epoch": 0.3863475803602967,
"grad_norm": 1.765625,
"learning_rate": 0.0004989972292818884,
"loss": 6.2029,
"mean_token_accuracy": 0.14926931411027908,
"num_tokens": 8165251.0,
"step": 4375
},
{
"entropy": 6.304240703582764,
"epoch": 0.38678912045213704,
"grad_norm": 1.734375,
"learning_rate": 0.0004989942572443934,
"loss": 6.1867,
"mean_token_accuracy": 0.1430036559700966,
"num_tokens": 8174761.0,
"step": 4380
},
{
"entropy": 6.2764472484588625,
"epoch": 0.38723066054397737,
"grad_norm": 1.8203125,
"learning_rate": 0.0004989912808189784,
"loss": 6.1522,
"mean_token_accuracy": 0.15029871091246605,
"num_tokens": 8182980.0,
"step": 4385
},
{
"entropy": 6.334861803054809,
"epoch": 0.38767220063581775,
"grad_norm": 1.40625,
"learning_rate": 0.0004989883000057013,
"loss": 6.1787,
"mean_token_accuracy": 0.14282853454351424,
"num_tokens": 8193306.0,
"step": 4390
},
{
"entropy": 6.217415761947632,
"epoch": 0.3881137407276581,
"grad_norm": 1.515625,
"learning_rate": 0.000498985314804621,
"loss": 6.068,
"mean_token_accuracy": 0.15467920452356337,
"num_tokens": 8203446.0,
"step": 4395
},
{
"entropy": 6.20694055557251,
"epoch": 0.3885552808194984,
"grad_norm": 1.6796875,
"learning_rate": 0.0004989823252157958,
"loss": 6.1278,
"mean_token_accuracy": 0.147111739218235,
"num_tokens": 8212414.0,
"step": 4400
},
{
"entropy": 6.193415260314941,
"epoch": 0.38899682091133875,
"grad_norm": 2.15625,
"learning_rate": 0.0004989793312392841,
"loss": 6.0397,
"mean_token_accuracy": 0.15125779658555985,
"num_tokens": 8221509.0,
"step": 4405
},
{
"entropy": 6.265850067138672,
"epoch": 0.3894383610031791,
"grad_norm": 1.5390625,
"learning_rate": 0.0004989763328751448,
"loss": 6.1512,
"mean_token_accuracy": 0.15394337922334672,
"num_tokens": 8230017.0,
"step": 4410
},
{
"entropy": 6.226738405227661,
"epoch": 0.3898799010950194,
"grad_norm": 1.6484375,
"learning_rate": 0.0004989733301234365,
"loss": 6.1199,
"mean_token_accuracy": 0.15255994945764542,
"num_tokens": 8238853.0,
"step": 4415
},
{
"entropy": 6.279262447357178,
"epoch": 0.39032144118685974,
"grad_norm": 1.6640625,
"learning_rate": 0.000498970322984218,
"loss": 6.1839,
"mean_token_accuracy": 0.14515341222286224,
"num_tokens": 8248112.0,
"step": 4420
},
{
"entropy": 6.294642305374145,
"epoch": 0.39076298127870013,
"grad_norm": 2.28125,
"learning_rate": 0.0004989673114575483,
"loss": 6.1343,
"mean_token_accuracy": 0.14913589581847192,
"num_tokens": 8257166.0,
"step": 4425
},
{
"entropy": 6.163078498840332,
"epoch": 0.39120452137054046,
"grad_norm": 2.25,
"learning_rate": 0.0004989642955434863,
"loss": 6.1596,
"mean_token_accuracy": 0.14764805734157563,
"num_tokens": 8266229.0,
"step": 4430
},
{
"entropy": 6.260275363922119,
"epoch": 0.3916460614623808,
"grad_norm": 1.3828125,
"learning_rate": 0.0004989612752420912,
"loss": 6.1085,
"mean_token_accuracy": 0.14915528297424316,
"num_tokens": 8275102.0,
"step": 4435
},
{
"entropy": 6.19262204170227,
"epoch": 0.3920876015542211,
"grad_norm": 1.6171875,
"learning_rate": 0.000498958250553422,
"loss": 6.0353,
"mean_token_accuracy": 0.15324682742357254,
"num_tokens": 8283847.0,
"step": 4440
},
{
"entropy": 6.227700424194336,
"epoch": 0.39252914164606145,
"grad_norm": 2.140625,
"learning_rate": 0.0004989552214775381,
"loss": 6.1766,
"mean_token_accuracy": 0.144762846827507,
"num_tokens": 8292622.0,
"step": 4445
},
{
"entropy": 6.3205742835998535,
"epoch": 0.3929706817379018,
"grad_norm": 1.5859375,
"learning_rate": 0.0004989521880144988,
"loss": 6.0763,
"mean_token_accuracy": 0.1604698970913887,
"num_tokens": 8301026.0,
"step": 4450
},
{
"entropy": 6.306861019134521,
"epoch": 0.3934122218297421,
"grad_norm": 1.578125,
"learning_rate": 0.0004989491501643635,
"loss": 6.3392,
"mean_token_accuracy": 0.13891248479485513,
"num_tokens": 8310977.0,
"step": 4455
},
{
"entropy": 6.242893123626709,
"epoch": 0.3938537619215825,
"grad_norm": 2.015625,
"learning_rate": 0.0004989461079271916,
"loss": 6.1061,
"mean_token_accuracy": 0.153610959649086,
"num_tokens": 8319391.0,
"step": 4460
},
{
"entropy": 6.266516590118409,
"epoch": 0.39429530201342283,
"grad_norm": 1.5703125,
"learning_rate": 0.0004989430613030429,
"loss": 6.0661,
"mean_token_accuracy": 0.15280731469392778,
"num_tokens": 8328639.0,
"step": 4465
},
{
"entropy": 6.233418989181518,
"epoch": 0.39473684210526316,
"grad_norm": 1.8203125,
"learning_rate": 0.000498940010291977,
"loss": 6.1681,
"mean_token_accuracy": 0.1455265462398529,
"num_tokens": 8338190.0,
"step": 4470
},
{
"entropy": 6.24021577835083,
"epoch": 0.3951783821971035,
"grad_norm": 2.734375,
"learning_rate": 0.0004989369548940536,
"loss": 6.1149,
"mean_token_accuracy": 0.14980215281248094,
"num_tokens": 8346874.0,
"step": 4475
},
{
"entropy": 6.238305997848511,
"epoch": 0.3956199222889438,
"grad_norm": 1.7109375,
"learning_rate": 0.0004989338951093327,
"loss": 6.0917,
"mean_token_accuracy": 0.15748346149921416,
"num_tokens": 8356446.0,
"step": 4480
},
{
"entropy": 6.260767602920533,
"epoch": 0.39606146238078416,
"grad_norm": 2.171875,
"learning_rate": 0.0004989308309378741,
"loss": 6.1065,
"mean_token_accuracy": 0.15552318841218948,
"num_tokens": 8365694.0,
"step": 4485
},
{
"entropy": 6.261749219894409,
"epoch": 0.3965030024726245,
"grad_norm": 1.6484375,
"learning_rate": 0.0004989277623797379,
"loss": 6.1529,
"mean_token_accuracy": 0.14739976376295089,
"num_tokens": 8374282.0,
"step": 4490
},
{
"entropy": 6.177736425399781,
"epoch": 0.3969445425644649,
"grad_norm": 1.6484375,
"learning_rate": 0.0004989246894349841,
"loss": 6.1265,
"mean_token_accuracy": 0.15178793370723725,
"num_tokens": 8383315.0,
"step": 4495
},
{
"entropy": 6.239930438995361,
"epoch": 0.3973860826563052,
"grad_norm": 2.265625,
"learning_rate": 0.0004989216121036732,
"loss": 6.0836,
"mean_token_accuracy": 0.15232260078191756,
"num_tokens": 8392263.0,
"step": 4500
},
{
"entropy": 6.2768608093261715,
"epoch": 0.39782762274814554,
"grad_norm": 1.6171875,
"learning_rate": 0.0004989185303858651,
"loss": 6.1353,
"mean_token_accuracy": 0.1466260112822056,
"num_tokens": 8400734.0,
"step": 4505
},
{
"entropy": 6.238184452056885,
"epoch": 0.39826916283998587,
"grad_norm": 2.046875,
"learning_rate": 0.0004989154442816203,
"loss": 6.1551,
"mean_token_accuracy": 0.14806681126356125,
"num_tokens": 8410635.0,
"step": 4510
},
{
"entropy": 6.2955420970916744,
"epoch": 0.3987107029318262,
"grad_norm": 1.859375,
"learning_rate": 0.0004989123537909994,
"loss": 6.1333,
"mean_token_accuracy": 0.15284045189619064,
"num_tokens": 8420111.0,
"step": 4515
},
{
"entropy": 6.221891450881958,
"epoch": 0.39915224302366653,
"grad_norm": 1.71875,
"learning_rate": 0.0004989092589140629,
"loss": 6.0963,
"mean_token_accuracy": 0.1426243230700493,
"num_tokens": 8429459.0,
"step": 4520
},
{
"entropy": 6.260979318618775,
"epoch": 0.39959378311550686,
"grad_norm": 1.5859375,
"learning_rate": 0.0004989061596508712,
"loss": 6.102,
"mean_token_accuracy": 0.15004376024007798,
"num_tokens": 8438083.0,
"step": 4525
},
{
"entropy": 6.165115070343018,
"epoch": 0.40003532320734725,
"grad_norm": 1.7890625,
"learning_rate": 0.0004989030560014853,
"loss": 6.1361,
"mean_token_accuracy": 0.15093458965420722,
"num_tokens": 8447713.0,
"step": 4530
},
{
"entropy": 6.242450094223022,
"epoch": 0.4004768632991876,
"grad_norm": 1.4765625,
"learning_rate": 0.0004988999479659657,
"loss": 6.1097,
"mean_token_accuracy": 0.15013383626937865,
"num_tokens": 8457394.0,
"step": 4535
},
{
"entropy": 6.2484495639801025,
"epoch": 0.4009184033910279,
"grad_norm": 1.5703125,
"learning_rate": 0.0004988968355443737,
"loss": 6.067,
"mean_token_accuracy": 0.1564113289117813,
"num_tokens": 8467333.0,
"step": 4540
},
{
"entropy": 6.130180597305298,
"epoch": 0.40135994348286824,
"grad_norm": 1.6015625,
"learning_rate": 0.0004988937187367699,
"loss": 6.1609,
"mean_token_accuracy": 0.14751122146844864,
"num_tokens": 8477530.0,
"step": 4545
},
{
"entropy": 6.293128538131714,
"epoch": 0.4018014835747086,
"grad_norm": 1.4453125,
"learning_rate": 0.0004988905975432154,
"loss": 6.2429,
"mean_token_accuracy": 0.14654314517974854,
"num_tokens": 8486861.0,
"step": 4550
},
{
"entropy": 6.31817512512207,
"epoch": 0.4022430236665489,
"grad_norm": 1.390625,
"learning_rate": 0.0004988874719637715,
"loss": 6.0701,
"mean_token_accuracy": 0.15331597551703452,
"num_tokens": 8496541.0,
"step": 4555
},
{
"entropy": 6.139620399475097,
"epoch": 0.40268456375838924,
"grad_norm": 1.7734375,
"learning_rate": 0.0004988843419984994,
"loss": 6.1423,
"mean_token_accuracy": 0.147700135409832,
"num_tokens": 8505667.0,
"step": 4560
},
{
"entropy": 6.309397125244141,
"epoch": 0.4031261038502296,
"grad_norm": 1.65625,
"learning_rate": 0.0004988812076474604,
"loss": 6.1109,
"mean_token_accuracy": 0.15095604285597802,
"num_tokens": 8515133.0,
"step": 4565
},
{
"entropy": 6.331642770767212,
"epoch": 0.40356764394206995,
"grad_norm": 1.578125,
"learning_rate": 0.0004988780689107158,
"loss": 6.099,
"mean_token_accuracy": 0.1547642931342125,
"num_tokens": 8524797.0,
"step": 4570
},
{
"entropy": 6.155235958099365,
"epoch": 0.4040091840339103,
"grad_norm": 1.8125,
"learning_rate": 0.0004988749257883271,
"loss": 6.1163,
"mean_token_accuracy": 0.1479724317789078,
"num_tokens": 8534667.0,
"step": 4575
},
{
"entropy": 6.191133165359497,
"epoch": 0.4044507241257506,
"grad_norm": 1.4296875,
"learning_rate": 0.000498871778280356,
"loss": 6.1141,
"mean_token_accuracy": 0.15516297817230223,
"num_tokens": 8543874.0,
"step": 4580
},
{
"entropy": 6.1999842643737795,
"epoch": 0.40489226421759095,
"grad_norm": 2.0,
"learning_rate": 0.0004988686263868641,
"loss": 6.1129,
"mean_token_accuracy": 0.14598144590854645,
"num_tokens": 8553620.0,
"step": 4585
},
{
"entropy": 6.319142484664917,
"epoch": 0.4053338043094313,
"grad_norm": 1.4765625,
"learning_rate": 0.0004988654701079131,
"loss": 6.1853,
"mean_token_accuracy": 0.14762324318289757,
"num_tokens": 8563857.0,
"step": 4590
},
{
"entropy": 6.312997579574585,
"epoch": 0.4057753444012716,
"grad_norm": 1.6484375,
"learning_rate": 0.0004988623094435649,
"loss": 6.1642,
"mean_token_accuracy": 0.13997963890433313,
"num_tokens": 8572677.0,
"step": 4595
},
{
"entropy": 6.116331768035889,
"epoch": 0.406216884493112,
"grad_norm": 1.9921875,
"learning_rate": 0.0004988591443938813,
"loss": 6.1003,
"mean_token_accuracy": 0.15262969210743904,
"num_tokens": 8581907.0,
"step": 4600
},
{
"entropy": 6.220039224624633,
"epoch": 0.4066584245849523,
"grad_norm": 1.59375,
"learning_rate": 0.0004988559749589244,
"loss": 6.1454,
"mean_token_accuracy": 0.14895498976111413,
"num_tokens": 8591701.0,
"step": 4605
},
{
"entropy": 6.287181425094604,
"epoch": 0.40709996467679266,
"grad_norm": 1.953125,
"learning_rate": 0.0004988528011387563,
"loss": 6.167,
"mean_token_accuracy": 0.15494169369339944,
"num_tokens": 8601054.0,
"step": 4610
},
{
"entropy": 6.205023622512817,
"epoch": 0.407541504768633,
"grad_norm": 1.4140625,
"learning_rate": 0.0004988496229334392,
"loss": 6.0806,
"mean_token_accuracy": 0.15186309069395065,
"num_tokens": 8610346.0,
"step": 4615
},
{
"entropy": 6.23344054222107,
"epoch": 0.4079830448604733,
"grad_norm": 1.4765625,
"learning_rate": 0.0004988464403430352,
"loss": 6.0837,
"mean_token_accuracy": 0.15217070728540422,
"num_tokens": 8620823.0,
"step": 4620
},
{
"entropy": 6.270275688171386,
"epoch": 0.40842458495231365,
"grad_norm": 1.546875,
"learning_rate": 0.0004988432533676067,
"loss": 6.2275,
"mean_token_accuracy": 0.14184264317154885,
"num_tokens": 8630184.0,
"step": 4625
},
{
"entropy": 6.302144241333008,
"epoch": 0.408866125044154,
"grad_norm": 1.65625,
"learning_rate": 0.0004988400620072163,
"loss": 6.2212,
"mean_token_accuracy": 0.1352216251194477,
"num_tokens": 8640064.0,
"step": 4630
},
{
"entropy": 6.338855314254761,
"epoch": 0.40930766513599437,
"grad_norm": 1.4921875,
"learning_rate": 0.0004988368662619263,
"loss": 6.1382,
"mean_token_accuracy": 0.14780254140496255,
"num_tokens": 8650503.0,
"step": 4635
},
{
"entropy": 6.308487844467163,
"epoch": 0.4097492052278347,
"grad_norm": 1.6171875,
"learning_rate": 0.0004988336661317994,
"loss": 6.1487,
"mean_token_accuracy": 0.1496379256248474,
"num_tokens": 8659125.0,
"step": 4640
},
{
"entropy": 6.24177737236023,
"epoch": 0.41019074531967503,
"grad_norm": 1.34375,
"learning_rate": 0.0004988304616168984,
"loss": 6.1595,
"mean_token_accuracy": 0.15009454786777496,
"num_tokens": 8668193.0,
"step": 4645
},
{
"entropy": 6.259683895111084,
"epoch": 0.41063228541151536,
"grad_norm": 1.4375,
"learning_rate": 0.0004988272527172858,
"loss": 6.1284,
"mean_token_accuracy": 0.14531345665454865,
"num_tokens": 8677515.0,
"step": 4650
},
{
"entropy": 6.2487578868865965,
"epoch": 0.4110738255033557,
"grad_norm": 1.5234375,
"learning_rate": 0.0004988240394330246,
"loss": 6.1509,
"mean_token_accuracy": 0.14197378158569335,
"num_tokens": 8687549.0,
"step": 4655
},
{
"entropy": 6.216428947448731,
"epoch": 0.411515365595196,
"grad_norm": 1.4609375,
"learning_rate": 0.0004988208217641778,
"loss": 6.1462,
"mean_token_accuracy": 0.15048618465662003,
"num_tokens": 8697371.0,
"step": 4660
},
{
"entropy": 6.271879529953003,
"epoch": 0.41195690568703636,
"grad_norm": 1.625,
"learning_rate": 0.0004988175997108086,
"loss": 6.1572,
"mean_token_accuracy": 0.14906407445669173,
"num_tokens": 8707193.0,
"step": 4665
},
{
"entropy": 6.241507244110108,
"epoch": 0.41239844577887674,
"grad_norm": 1.6640625,
"learning_rate": 0.0004988143732729797,
"loss": 6.1306,
"mean_token_accuracy": 0.1517687276005745,
"num_tokens": 8716052.0,
"step": 4670
},
{
"entropy": 6.193820285797119,
"epoch": 0.4128399858707171,
"grad_norm": 1.5,
"learning_rate": 0.0004988111424507546,
"loss": 6.1083,
"mean_token_accuracy": 0.15722774118185043,
"num_tokens": 8726140.0,
"step": 4675
},
{
"entropy": 6.198861217498779,
"epoch": 0.4132815259625574,
"grad_norm": 1.4609375,
"learning_rate": 0.0004988079072441964,
"loss": 6.0886,
"mean_token_accuracy": 0.16114656776189804,
"num_tokens": 8735299.0,
"step": 4680
},
{
"entropy": 6.275176668167115,
"epoch": 0.41372306605439774,
"grad_norm": 1.8203125,
"learning_rate": 0.0004988046676533687,
"loss": 6.1618,
"mean_token_accuracy": 0.14906339049339296,
"num_tokens": 8744686.0,
"step": 4685
},
{
"entropy": 6.259121036529541,
"epoch": 0.41416460614623807,
"grad_norm": 1.75,
"learning_rate": 0.0004988014236783347,
"loss": 6.1494,
"mean_token_accuracy": 0.15465974658727646,
"num_tokens": 8754942.0,
"step": 4690
},
{
"entropy": 6.326023912429809,
"epoch": 0.4146061462380784,
"grad_norm": 1.5390625,
"learning_rate": 0.0004987981753191582,
"loss": 6.1409,
"mean_token_accuracy": 0.14824373871088029,
"num_tokens": 8764054.0,
"step": 4695
},
{
"entropy": 6.13715353012085,
"epoch": 0.41504768632991873,
"grad_norm": 1.6953125,
"learning_rate": 0.0004987949225759027,
"loss": 6.0228,
"mean_token_accuracy": 0.15374697595834733,
"num_tokens": 8773050.0,
"step": 4700
},
{
"entropy": 6.222603893280029,
"epoch": 0.4154892264217591,
"grad_norm": 1.6328125,
"learning_rate": 0.0004987916654486321,
"loss": 6.1314,
"mean_token_accuracy": 0.14893667995929719,
"num_tokens": 8782476.0,
"step": 4705
},
{
"entropy": 6.285632705688476,
"epoch": 0.41593076651359945,
"grad_norm": 1.453125,
"learning_rate": 0.0004987884039374099,
"loss": 6.209,
"mean_token_accuracy": 0.14228173792362214,
"num_tokens": 8791147.0,
"step": 4710
},
{
"entropy": 6.412950849533081,
"epoch": 0.4163723066054398,
"grad_norm": 1.546875,
"learning_rate": 0.0004987851380423001,
"loss": 6.2029,
"mean_token_accuracy": 0.14925967529416084,
"num_tokens": 8801151.0,
"step": 4715
},
{
"entropy": 6.243388557434082,
"epoch": 0.4168138466972801,
"grad_norm": 1.59375,
"learning_rate": 0.0004987818677633668,
"loss": 6.1428,
"mean_token_accuracy": 0.14483709558844565,
"num_tokens": 8809587.0,
"step": 4720
},
{
"entropy": 6.118964433670044,
"epoch": 0.41725538678912044,
"grad_norm": 1.9921875,
"learning_rate": 0.000498778593100674,
"loss": 6.0157,
"mean_token_accuracy": 0.15019246488809584,
"num_tokens": 8818168.0,
"step": 4725
},
{
"entropy": 6.184421253204346,
"epoch": 0.4176969268809608,
"grad_norm": 1.765625,
"learning_rate": 0.0004987753140542857,
"loss": 6.0773,
"mean_token_accuracy": 0.15195630490779877,
"num_tokens": 8827477.0,
"step": 4730
},
{
"entropy": 6.219823694229126,
"epoch": 0.4181384669728011,
"grad_norm": 1.9609375,
"learning_rate": 0.0004987720306242664,
"loss": 6.075,
"mean_token_accuracy": 0.15527386367321014,
"num_tokens": 8837067.0,
"step": 4735
},
{
"entropy": 6.181506729125976,
"epoch": 0.4185800070646415,
"grad_norm": 2.34375,
"learning_rate": 0.0004987687428106803,
"loss": 6.1618,
"mean_token_accuracy": 0.15378424376249314,
"num_tokens": 8845790.0,
"step": 4740
},
{
"entropy": 6.227482891082763,
"epoch": 0.4190215471564818,
"grad_norm": 2.0625,
"learning_rate": 0.0004987654506135917,
"loss": 6.1095,
"mean_token_accuracy": 0.15375100672245026,
"num_tokens": 8855242.0,
"step": 4745
},
{
"entropy": 6.376747179031372,
"epoch": 0.41946308724832215,
"grad_norm": 1.75,
"learning_rate": 0.0004987621540330652,
"loss": 6.1442,
"mean_token_accuracy": 0.1527914009988308,
"num_tokens": 8864459.0,
"step": 4750
},
{
"entropy": 6.280859184265137,
"epoch": 0.4199046273401625,
"grad_norm": 1.703125,
"learning_rate": 0.0004987588530691653,
"loss": 6.2056,
"mean_token_accuracy": 0.147312493622303,
"num_tokens": 8875028.0,
"step": 4755
},
{
"entropy": 6.171601629257202,
"epoch": 0.4203461674320028,
"grad_norm": 1.9921875,
"learning_rate": 0.0004987555477219569,
"loss": 6.0686,
"mean_token_accuracy": 0.1505084216594696,
"num_tokens": 8883857.0,
"step": 4760
},
{
"entropy": 6.242595100402832,
"epoch": 0.42078770752384315,
"grad_norm": 1.640625,
"learning_rate": 0.0004987522379915045,
"loss": 6.0426,
"mean_token_accuracy": 0.15613523721694947,
"num_tokens": 8893499.0,
"step": 4765
},
{
"entropy": 6.229691648483277,
"epoch": 0.4212292476156835,
"grad_norm": 1.8359375,
"learning_rate": 0.000498748923877873,
"loss": 6.0557,
"mean_token_accuracy": 0.15882878750562668,
"num_tokens": 8903368.0,
"step": 4770
},
{
"entropy": 6.212651014328003,
"epoch": 0.42167078770752386,
"grad_norm": 5.5,
"learning_rate": 0.0004987456053811273,
"loss": 6.1755,
"mean_token_accuracy": 0.14916257932782173,
"num_tokens": 8912701.0,
"step": 4775
},
{
"entropy": 6.215025615692139,
"epoch": 0.4221123277993642,
"grad_norm": 1.59375,
"learning_rate": 0.0004987422825013325,
"loss": 6.1222,
"mean_token_accuracy": 0.14846726655960082,
"num_tokens": 8921962.0,
"step": 4780
},
{
"entropy": 6.263440942764282,
"epoch": 0.4225538678912045,
"grad_norm": 1.7421875,
"learning_rate": 0.0004987389552385536,
"loss": 6.1159,
"mean_token_accuracy": 0.14788118600845337,
"num_tokens": 8931923.0,
"step": 4785
},
{
"entropy": 6.222282361984253,
"epoch": 0.42299540798304486,
"grad_norm": 1.5859375,
"learning_rate": 0.0004987356235928558,
"loss": 6.1408,
"mean_token_accuracy": 0.1438957691192627,
"num_tokens": 8940403.0,
"step": 4790
},
{
"entropy": 6.247937631607056,
"epoch": 0.4234369480748852,
"grad_norm": 1.4609375,
"learning_rate": 0.0004987322875643044,
"loss": 6.0725,
"mean_token_accuracy": 0.1556072860956192,
"num_tokens": 8949377.0,
"step": 4795
},
{
"entropy": 6.289243221282959,
"epoch": 0.4238784881667255,
"grad_norm": 1.8671875,
"learning_rate": 0.0004987289471529647,
"loss": 6.2231,
"mean_token_accuracy": 0.14357297345995904,
"num_tokens": 8958719.0,
"step": 4800
},
{
"entropy": 6.263422870635987,
"epoch": 0.42432002825856585,
"grad_norm": 1.7109375,
"learning_rate": 0.0004987256023589022,
"loss": 6.18,
"mean_token_accuracy": 0.1407242827117443,
"num_tokens": 8968226.0,
"step": 4805
},
{
"entropy": 6.298874139785767,
"epoch": 0.42476156835040624,
"grad_norm": 1.609375,
"learning_rate": 0.0004987222531821824,
"loss": 6.1177,
"mean_token_accuracy": 0.15129526555538178,
"num_tokens": 8976670.0,
"step": 4810
},
{
"entropy": 6.174004793167114,
"epoch": 0.42520310844224657,
"grad_norm": 1.6171875,
"learning_rate": 0.0004987188996228709,
"loss": 6.0665,
"mean_token_accuracy": 0.1531901016831398,
"num_tokens": 8986185.0,
"step": 4815
},
{
"entropy": 6.158194541931152,
"epoch": 0.4256446485340869,
"grad_norm": 2.3125,
"learning_rate": 0.0004987155416810334,
"loss": 6.0544,
"mean_token_accuracy": 0.15613151341676712,
"num_tokens": 8995124.0,
"step": 4820
},
{
"entropy": 6.2976361274719235,
"epoch": 0.42608618862592723,
"grad_norm": 1.7578125,
"learning_rate": 0.0004987121793567356,
"loss": 6.1548,
"mean_token_accuracy": 0.14807211086153985,
"num_tokens": 9004380.0,
"step": 4825
},
{
"entropy": 6.3067573547363285,
"epoch": 0.42652772871776756,
"grad_norm": 1.8203125,
"learning_rate": 0.0004987088126500436,
"loss": 6.0737,
"mean_token_accuracy": 0.15086135640740395,
"num_tokens": 9013791.0,
"step": 4830
},
{
"entropy": 6.224890661239624,
"epoch": 0.4269692688096079,
"grad_norm": 1.6640625,
"learning_rate": 0.000498705441561023,
"loss": 6.0936,
"mean_token_accuracy": 0.15923204869031907,
"num_tokens": 9023076.0,
"step": 4835
},
{
"entropy": 6.32174015045166,
"epoch": 0.4274108089014482,
"grad_norm": 1.609375,
"learning_rate": 0.0004987020660897401,
"loss": 6.212,
"mean_token_accuracy": 0.14178509786725044,
"num_tokens": 9032720.0,
"step": 4840
},
{
"entropy": 6.264952182769775,
"epoch": 0.4278523489932886,
"grad_norm": 1.984375,
"learning_rate": 0.000498698686236261,
"loss": 6.1792,
"mean_token_accuracy": 0.14186724573373793,
"num_tokens": 9042652.0,
"step": 4845
},
{
"entropy": 6.329478549957275,
"epoch": 0.42829388908512894,
"grad_norm": 1.3828125,
"learning_rate": 0.0004986953020006519,
"loss": 6.2139,
"mean_token_accuracy": 0.1418928436934948,
"num_tokens": 9052172.0,
"step": 4850
},
{
"entropy": 6.253849077224731,
"epoch": 0.4287354291769693,
"grad_norm": 1.4296875,
"learning_rate": 0.0004986919133829788,
"loss": 6.0903,
"mean_token_accuracy": 0.15230478197336197,
"num_tokens": 9061798.0,
"step": 4855
},
{
"entropy": 6.191249799728394,
"epoch": 0.4291769692688096,
"grad_norm": 1.578125,
"learning_rate": 0.0004986885203833086,
"loss": 6.0329,
"mean_token_accuracy": 0.15033992528915405,
"num_tokens": 9070429.0,
"step": 4860
},
{
"entropy": 6.241788244247436,
"epoch": 0.42961850936064994,
"grad_norm": 1.625,
"learning_rate": 0.0004986851230017075,
"loss": 6.15,
"mean_token_accuracy": 0.1566887989640236,
"num_tokens": 9080200.0,
"step": 4865
},
{
"entropy": 6.225221776962281,
"epoch": 0.43006004945249027,
"grad_norm": 1.640625,
"learning_rate": 0.0004986817212382419,
"loss": 6.1323,
"mean_token_accuracy": 0.15193428695201874,
"num_tokens": 9089555.0,
"step": 4870
},
{
"entropy": 6.228102540969848,
"epoch": 0.4305015895443306,
"grad_norm": 1.6015625,
"learning_rate": 0.0004986783150929786,
"loss": 6.1154,
"mean_token_accuracy": 0.1448261022567749,
"num_tokens": 9099091.0,
"step": 4875
},
{
"entropy": 6.290770101547241,
"epoch": 0.430943129636171,
"grad_norm": 3.0,
"learning_rate": 0.0004986749045659845,
"loss": 6.1914,
"mean_token_accuracy": 0.14237287789583206,
"num_tokens": 9109008.0,
"step": 4880
},
{
"entropy": 6.272695302963257,
"epoch": 0.4313846697280113,
"grad_norm": 2.640625,
"learning_rate": 0.0004986714896573261,
"loss": 6.0514,
"mean_token_accuracy": 0.15114877596497536,
"num_tokens": 9117882.0,
"step": 4885
},
{
"entropy": 6.255866146087646,
"epoch": 0.43182620981985165,
"grad_norm": 1.890625,
"learning_rate": 0.0004986680703670704,
"loss": 6.2037,
"mean_token_accuracy": 0.14644545465707778,
"num_tokens": 9126860.0,
"step": 4890
},
{
"entropy": 6.22585277557373,
"epoch": 0.432267749911692,
"grad_norm": 2.09375,
"learning_rate": 0.0004986646466952845,
"loss": 6.0799,
"mean_token_accuracy": 0.1504547193646431,
"num_tokens": 9135819.0,
"step": 4895
},
{
"entropy": 6.196601390838623,
"epoch": 0.4327092900035323,
"grad_norm": 1.4921875,
"learning_rate": 0.0004986612186420353,
"loss": 6.0686,
"mean_token_accuracy": 0.15574911236763,
"num_tokens": 9145302.0,
"step": 4900
},
{
"entropy": 6.1801060199737545,
"epoch": 0.43315083009537264,
"grad_norm": 1.5078125,
"learning_rate": 0.0004986577862073901,
"loss": 6.1494,
"mean_token_accuracy": 0.1479417622089386,
"num_tokens": 9154667.0,
"step": 4905
},
{
"entropy": 6.350726795196533,
"epoch": 0.43359237018721297,
"grad_norm": 2.03125,
"learning_rate": 0.0004986543493914159,
"loss": 6.1896,
"mean_token_accuracy": 0.14393721222877504,
"num_tokens": 9164562.0,
"step": 4910
},
{
"entropy": 6.298789834976196,
"epoch": 0.43403391027905336,
"grad_norm": 2.015625,
"learning_rate": 0.0004986509081941805,
"loss": 6.2075,
"mean_token_accuracy": 0.14493397623300552,
"num_tokens": 9174872.0,
"step": 4915
},
{
"entropy": 6.208137512207031,
"epoch": 0.4344754503708937,
"grad_norm": 1.8046875,
"learning_rate": 0.0004986474626157507,
"loss": 5.9565,
"mean_token_accuracy": 0.16489630788564683,
"num_tokens": 9184322.0,
"step": 4920
},
{
"entropy": 6.1365772724151615,
"epoch": 0.434916990462734,
"grad_norm": 1.765625,
"learning_rate": 0.0004986440126561945,
"loss": 6.0811,
"mean_token_accuracy": 0.15020886659622193,
"num_tokens": 9194450.0,
"step": 4925
},
{
"entropy": 6.255832719802856,
"epoch": 0.43535853055457435,
"grad_norm": 1.5859375,
"learning_rate": 0.0004986405583155792,
"loss": 6.1312,
"mean_token_accuracy": 0.14965093955397607,
"num_tokens": 9203658.0,
"step": 4930
},
{
"entropy": 6.263164854049682,
"epoch": 0.4358000706464147,
"grad_norm": 1.78125,
"learning_rate": 0.0004986370995939725,
"loss": 6.1128,
"mean_token_accuracy": 0.15106411650776863,
"num_tokens": 9213609.0,
"step": 4935
},
{
"entropy": 6.167392778396606,
"epoch": 0.436241610738255,
"grad_norm": 2.140625,
"learning_rate": 0.0004986336364914423,
"loss": 6.1306,
"mean_token_accuracy": 0.14291212037205697,
"num_tokens": 9222704.0,
"step": 4940
},
{
"entropy": 6.223126554489136,
"epoch": 0.43668315083009535,
"grad_norm": 1.7109375,
"learning_rate": 0.0004986301690080564,
"loss": 6.1143,
"mean_token_accuracy": 0.14555411264300347,
"num_tokens": 9231599.0,
"step": 4945
},
{
"entropy": 6.2706419944763185,
"epoch": 0.43712469092193573,
"grad_norm": 1.9296875,
"learning_rate": 0.0004986266971438826,
"loss": 6.181,
"mean_token_accuracy": 0.14692962616682054,
"num_tokens": 9241886.0,
"step": 4950
},
{
"entropy": 6.284374094009399,
"epoch": 0.43756623101377606,
"grad_norm": 1.8671875,
"learning_rate": 0.000498623220898989,
"loss": 6.1704,
"mean_token_accuracy": 0.1431273728609085,
"num_tokens": 9251085.0,
"step": 4955
},
{
"entropy": 6.301024627685547,
"epoch": 0.4380077711056164,
"grad_norm": 2.453125,
"learning_rate": 0.0004986197402734436,
"loss": 6.1277,
"mean_token_accuracy": 0.14820317775011063,
"num_tokens": 9259601.0,
"step": 4960
},
{
"entropy": 6.234680032730102,
"epoch": 0.4384493111974567,
"grad_norm": 1.796875,
"learning_rate": 0.0004986162552673148,
"loss": 6.1537,
"mean_token_accuracy": 0.14889020547270776,
"num_tokens": 9268935.0,
"step": 4965
},
{
"entropy": 6.237508726119995,
"epoch": 0.43889085128929706,
"grad_norm": 1.7421875,
"learning_rate": 0.0004986127658806706,
"loss": 6.1582,
"mean_token_accuracy": 0.14848763048648833,
"num_tokens": 9277647.0,
"step": 4970
},
{
"entropy": 6.322979831695557,
"epoch": 0.4393323913811374,
"grad_norm": 1.4765625,
"learning_rate": 0.0004986092721135796,
"loss": 6.1039,
"mean_token_accuracy": 0.14526121839880943,
"num_tokens": 9286610.0,
"step": 4975
},
{
"entropy": 6.267163896560669,
"epoch": 0.4397739314729777,
"grad_norm": 2.03125,
"learning_rate": 0.0004986057739661101,
"loss": 6.1928,
"mean_token_accuracy": 0.14434696733951569,
"num_tokens": 9295946.0,
"step": 4980
},
{
"entropy": 6.189084196090699,
"epoch": 0.4402154715648181,
"grad_norm": 2.0625,
"learning_rate": 0.0004986022714383307,
"loss": 6.0794,
"mean_token_accuracy": 0.14832867309451103,
"num_tokens": 9304903.0,
"step": 4985
},
{
"entropy": 6.181007719039917,
"epoch": 0.44065701165665844,
"grad_norm": 2.046875,
"learning_rate": 0.0004985987645303099,
"loss": 5.9935,
"mean_token_accuracy": 0.15543172061443328,
"num_tokens": 9313606.0,
"step": 4990
},
{
"entropy": 6.209528255462646,
"epoch": 0.44109855174849877,
"grad_norm": 3.34375,
"learning_rate": 0.0004985952532421164,
"loss": 6.1194,
"mean_token_accuracy": 0.14723614528775214,
"num_tokens": 9322815.0,
"step": 4995
},
{
"entropy": 6.267077779769897,
"epoch": 0.4415400918403391,
"grad_norm": 1.671875,
"learning_rate": 0.0004985917375738193,
"loss": 6.0501,
"mean_token_accuracy": 0.15317185521125792,
"num_tokens": 9332630.0,
"step": 5000
},
{
"entropy": 6.1830284118652346,
"epoch": 0.44198163193217943,
"grad_norm": 2.125,
"learning_rate": 0.0004985882175254871,
"loss": 6.0728,
"mean_token_accuracy": 0.1479358345270157,
"num_tokens": 9342216.0,
"step": 5005
},
{
"entropy": 6.253107023239136,
"epoch": 0.44242317202401976,
"grad_norm": 1.6328125,
"learning_rate": 0.0004985846930971887,
"loss": 6.1306,
"mean_token_accuracy": 0.14670003801584244,
"num_tokens": 9352295.0,
"step": 5010
},
{
"entropy": 6.196054363250733,
"epoch": 0.4428647121158601,
"grad_norm": 3.296875,
"learning_rate": 0.0004985811642889937,
"loss": 6.1163,
"mean_token_accuracy": 0.15125398561358452,
"num_tokens": 9361462.0,
"step": 5015
},
{
"entropy": 6.217277193069458,
"epoch": 0.4433062522077005,
"grad_norm": 2.078125,
"learning_rate": 0.0004985776311009705,
"loss": 6.0557,
"mean_token_accuracy": 0.1495061472058296,
"num_tokens": 9370379.0,
"step": 5020
},
{
"entropy": 6.280245161056518,
"epoch": 0.4437477922995408,
"grad_norm": 1.875,
"learning_rate": 0.0004985740935331888,
"loss": 6.104,
"mean_token_accuracy": 0.1499072551727295,
"num_tokens": 9379255.0,
"step": 5025
},
{
"entropy": 6.239386558532715,
"epoch": 0.44418933239138114,
"grad_norm": 2.515625,
"learning_rate": 0.0004985705515857177,
"loss": 6.0894,
"mean_token_accuracy": 0.14710333198308945,
"num_tokens": 9389313.0,
"step": 5030
},
{
"entropy": 6.1093944072723385,
"epoch": 0.4446308724832215,
"grad_norm": 1.6171875,
"learning_rate": 0.0004985670052586268,
"loss": 5.8779,
"mean_token_accuracy": 0.164057657122612,
"num_tokens": 9397778.0,
"step": 5035
},
{
"entropy": 6.189831209182739,
"epoch": 0.4450724125750618,
"grad_norm": 2.1875,
"learning_rate": 0.0004985634545519853,
"loss": 6.1612,
"mean_token_accuracy": 0.14539453983306885,
"num_tokens": 9407831.0,
"step": 5040
},
{
"entropy": 6.185821962356568,
"epoch": 0.44551395266690214,
"grad_norm": 2.578125,
"learning_rate": 0.0004985598994658629,
"loss": 6.0563,
"mean_token_accuracy": 0.15882879197597505,
"num_tokens": 9418458.0,
"step": 5045
},
{
"entropy": 6.106141138076782,
"epoch": 0.44595549275874247,
"grad_norm": 1.796875,
"learning_rate": 0.0004985563400003291,
"loss": 5.9568,
"mean_token_accuracy": 0.1698301136493683,
"num_tokens": 9426911.0,
"step": 5050
},
{
"entropy": 6.171579790115357,
"epoch": 0.44639703285058285,
"grad_norm": 1.9609375,
"learning_rate": 0.0004985527761554539,
"loss": 6.1417,
"mean_token_accuracy": 0.15014532953500748,
"num_tokens": 9435896.0,
"step": 5055
},
{
"entropy": 6.312262725830078,
"epoch": 0.4468385729424232,
"grad_norm": 1.9921875,
"learning_rate": 0.000498549207931307,
"loss": 6.1632,
"mean_token_accuracy": 0.1472449332475662,
"num_tokens": 9445272.0,
"step": 5060
},
{
"entropy": 6.271624374389648,
"epoch": 0.4472801130342635,
"grad_norm": 1.953125,
"learning_rate": 0.0004985456353279581,
"loss": 6.1043,
"mean_token_accuracy": 0.14438070952892304,
"num_tokens": 9455377.0,
"step": 5065
},
{
"entropy": 6.281310558319092,
"epoch": 0.44772165312610385,
"grad_norm": 1.703125,
"learning_rate": 0.0004985420583454774,
"loss": 6.1346,
"mean_token_accuracy": 0.14844611436128616,
"num_tokens": 9464918.0,
"step": 5070
},
{
"entropy": 6.201527786254883,
"epoch": 0.4481631932179442,
"grad_norm": 3.078125,
"learning_rate": 0.0004985384769839349,
"loss": 6.1456,
"mean_token_accuracy": 0.14419942125678062,
"num_tokens": 9473322.0,
"step": 5075
},
{
"entropy": 6.247434282302857,
"epoch": 0.4486047333097845,
"grad_norm": 1.484375,
"learning_rate": 0.0004985348912434008,
"loss": 6.0519,
"mean_token_accuracy": 0.15433547049760818,
"num_tokens": 9482255.0,
"step": 5080
},
{
"entropy": 6.251237630844116,
"epoch": 0.44904627340162484,
"grad_norm": 1.9765625,
"learning_rate": 0.0004985313011239452,
"loss": 6.0841,
"mean_token_accuracy": 0.15366279035806657,
"num_tokens": 9491709.0,
"step": 5085
},
{
"entropy": 6.1778288841247555,
"epoch": 0.4494878134934652,
"grad_norm": 2.046875,
"learning_rate": 0.0004985277066256388,
"loss": 6.0674,
"mean_token_accuracy": 0.15499321296811103,
"num_tokens": 9500594.0,
"step": 5090
},
{
"entropy": 6.247628450393677,
"epoch": 0.44992935358530556,
"grad_norm": 2.109375,
"learning_rate": 0.0004985241077485515,
"loss": 6.0831,
"mean_token_accuracy": 0.15359071865677834,
"num_tokens": 9509088.0,
"step": 5095
},
{
"entropy": 6.241946458816528,
"epoch": 0.4503708936771459,
"grad_norm": 1.7578125,
"learning_rate": 0.0004985205044927541,
"loss": 6.0756,
"mean_token_accuracy": 0.15193637013435363,
"num_tokens": 9517776.0,
"step": 5100
},
{
"entropy": 6.238159942626953,
"epoch": 0.4508124337689862,
"grad_norm": 2.34375,
"learning_rate": 0.0004985168968583173,
"loss": 6.1324,
"mean_token_accuracy": 0.1565396472811699,
"num_tokens": 9527080.0,
"step": 5105
},
{
"entropy": 6.247459888458252,
"epoch": 0.45125397386082655,
"grad_norm": 1.90625,
"learning_rate": 0.0004985132848453114,
"loss": 5.984,
"mean_token_accuracy": 0.16275231391191483,
"num_tokens": 9536358.0,
"step": 5110
},
{
"entropy": 6.1648458480834964,
"epoch": 0.4516955139526669,
"grad_norm": 1.6484375,
"learning_rate": 0.0004985096684538075,
"loss": 6.0744,
"mean_token_accuracy": 0.15135849714279176,
"num_tokens": 9545528.0,
"step": 5115
},
{
"entropy": 6.193127775192261,
"epoch": 0.4521370540445072,
"grad_norm": 1.8125,
"learning_rate": 0.0004985060476838763,
"loss": 6.1043,
"mean_token_accuracy": 0.15256332159042357,
"num_tokens": 9554433.0,
"step": 5120
},
{
"entropy": 6.167931699752808,
"epoch": 0.4525785941363476,
"grad_norm": 2.671875,
"learning_rate": 0.0004985024225355887,
"loss": 6.0743,
"mean_token_accuracy": 0.1511543370783329,
"num_tokens": 9563932.0,
"step": 5125
},
{
"entropy": 6.279501581192017,
"epoch": 0.45302013422818793,
"grad_norm": 1.640625,
"learning_rate": 0.0004984987930090158,
"loss": 6.0467,
"mean_token_accuracy": 0.15174941271543502,
"num_tokens": 9572829.0,
"step": 5130
},
{
"entropy": 6.188870096206665,
"epoch": 0.45346167432002826,
"grad_norm": 1.953125,
"learning_rate": 0.0004984951591042285,
"loss": 6.0999,
"mean_token_accuracy": 0.1528202399611473,
"num_tokens": 9583597.0,
"step": 5135
},
{
"entropy": 6.229509115219116,
"epoch": 0.4539032144118686,
"grad_norm": 1.953125,
"learning_rate": 0.0004984915208212983,
"loss": 6.173,
"mean_token_accuracy": 0.14248777478933333,
"num_tokens": 9593114.0,
"step": 5140
},
{
"entropy": 6.253240156173706,
"epoch": 0.4543447545037089,
"grad_norm": 1.484375,
"learning_rate": 0.0004984878781602964,
"loss": 6.0652,
"mean_token_accuracy": 0.14318513125181198,
"num_tokens": 9601454.0,
"step": 5145
},
{
"entropy": 6.231389141082763,
"epoch": 0.45478629459554926,
"grad_norm": 1.828125,
"learning_rate": 0.0004984842311212939,
"loss": 6.1212,
"mean_token_accuracy": 0.1526548221707344,
"num_tokens": 9611994.0,
"step": 5150
},
{
"entropy": 6.281379318237304,
"epoch": 0.4552278346873896,
"grad_norm": 1.921875,
"learning_rate": 0.0004984805797043625,
"loss": 6.0759,
"mean_token_accuracy": 0.15249461084604263,
"num_tokens": 9621318.0,
"step": 5155
},
{
"entropy": 6.2479390621185305,
"epoch": 0.45566937477923,
"grad_norm": 2.296875,
"learning_rate": 0.0004984769239095736,
"loss": 6.0896,
"mean_token_accuracy": 0.1520428791642189,
"num_tokens": 9630270.0,
"step": 5160
},
{
"entropy": 6.206319427490234,
"epoch": 0.4561109148710703,
"grad_norm": 1.828125,
"learning_rate": 0.0004984732637369989,
"loss": 6.1025,
"mean_token_accuracy": 0.14820861220359802,
"num_tokens": 9640391.0,
"step": 5165
},
{
"entropy": 6.210742044448852,
"epoch": 0.45655245496291064,
"grad_norm": 2.078125,
"learning_rate": 0.0004984695991867099,
"loss": 6.1233,
"mean_token_accuracy": 0.14745756462216378,
"num_tokens": 9648827.0,
"step": 5170
},
{
"entropy": 6.217724370956421,
"epoch": 0.45699399505475097,
"grad_norm": 2.09375,
"learning_rate": 0.0004984659302587788,
"loss": 6.0595,
"mean_token_accuracy": 0.14851401671767234,
"num_tokens": 9657940.0,
"step": 5175
},
{
"entropy": 6.192732238769532,
"epoch": 0.4574355351465913,
"grad_norm": 1.8828125,
"learning_rate": 0.000498462256953277,
"loss": 6.1821,
"mean_token_accuracy": 0.1421465255320072,
"num_tokens": 9668296.0,
"step": 5180
},
{
"entropy": 6.304067993164063,
"epoch": 0.45787707523843163,
"grad_norm": 1.8671875,
"learning_rate": 0.0004984585792702767,
"loss": 6.1234,
"mean_token_accuracy": 0.1482522204518318,
"num_tokens": 9677914.0,
"step": 5185
},
{
"entropy": 6.297015857696533,
"epoch": 0.45831861533027196,
"grad_norm": 2.28125,
"learning_rate": 0.0004984548972098501,
"loss": 6.2678,
"mean_token_accuracy": 0.14042736887931823,
"num_tokens": 9687339.0,
"step": 5190
},
{
"entropy": 6.20817379951477,
"epoch": 0.45876015542211235,
"grad_norm": 2.0,
"learning_rate": 0.000498451210772069,
"loss": 6.033,
"mean_token_accuracy": 0.15873085483908653,
"num_tokens": 9696889.0,
"step": 5195
},
{
"entropy": 6.204896116256714,
"epoch": 0.4592016955139527,
"grad_norm": 2.09375,
"learning_rate": 0.0004984475199570058,
"loss": 6.0156,
"mean_token_accuracy": 0.15423081889748574,
"num_tokens": 9705498.0,
"step": 5200
},
{
"entropy": 6.214762735366821,
"epoch": 0.459643235605793,
"grad_norm": 3.453125,
"learning_rate": 0.0004984438247647329,
"loss": 6.0735,
"mean_token_accuracy": 0.1508117400109768,
"num_tokens": 9713936.0,
"step": 5205
},
{
"entropy": 6.2286858558654785,
"epoch": 0.46008477569763334,
"grad_norm": 2.40625,
"learning_rate": 0.0004984401251953223,
"loss": 6.1494,
"mean_token_accuracy": 0.14881213307380675,
"num_tokens": 9723924.0,
"step": 5210
},
{
"entropy": 6.294112968444824,
"epoch": 0.4605263157894737,
"grad_norm": 2.0,
"learning_rate": 0.0004984364212488469,
"loss": 6.1745,
"mean_token_accuracy": 0.14484737291932107,
"num_tokens": 9733427.0,
"step": 5215
},
{
"entropy": 6.196189069747925,
"epoch": 0.460967855881314,
"grad_norm": 1.7578125,
"learning_rate": 0.0004984327129253789,
"loss": 5.979,
"mean_token_accuracy": 0.15575796514749526,
"num_tokens": 9742054.0,
"step": 5220
},
{
"entropy": 6.181635046005249,
"epoch": 0.46140939597315433,
"grad_norm": 1.640625,
"learning_rate": 0.0004984290002249914,
"loss": 6.1526,
"mean_token_accuracy": 0.14558340460062028,
"num_tokens": 9752447.0,
"step": 5225
},
{
"entropy": 6.295547008514404,
"epoch": 0.4618509360649947,
"grad_norm": 1.8046875,
"learning_rate": 0.0004984252831477567,
"loss": 5.9775,
"mean_token_accuracy": 0.15951746702194214,
"num_tokens": 9760878.0,
"step": 5230
},
{
"entropy": 6.106395292282104,
"epoch": 0.46229247615683505,
"grad_norm": 2.03125,
"learning_rate": 0.0004984215616937477,
"loss": 6.0652,
"mean_token_accuracy": 0.15369922667741776,
"num_tokens": 9770200.0,
"step": 5235
},
{
"entropy": 6.263768005371094,
"epoch": 0.4627340162486754,
"grad_norm": 1.7578125,
"learning_rate": 0.0004984178358630374,
"loss": 6.1482,
"mean_token_accuracy": 0.15308323130011559,
"num_tokens": 9780303.0,
"step": 5240
},
{
"entropy": 6.2224345207214355,
"epoch": 0.4631755563405157,
"grad_norm": 1.8671875,
"learning_rate": 0.0004984141056556989,
"loss": 6.0545,
"mean_token_accuracy": 0.1574157178401947,
"num_tokens": 9790248.0,
"step": 5245
},
{
"entropy": 6.233914422988891,
"epoch": 0.46361709643235605,
"grad_norm": 1.8671875,
"learning_rate": 0.0004984103710718051,
"loss": 6.1571,
"mean_token_accuracy": 0.14006953686475754,
"num_tokens": 9799345.0,
"step": 5250
},
{
"entropy": 6.21716718673706,
"epoch": 0.4640586365241964,
"grad_norm": 1.765625,
"learning_rate": 0.000498406632111429,
"loss": 6.0248,
"mean_token_accuracy": 0.15384083166718482,
"num_tokens": 9808561.0,
"step": 5255
},
{
"entropy": 6.176944255828857,
"epoch": 0.4645001766160367,
"grad_norm": 1.4609375,
"learning_rate": 0.0004984028887746443,
"loss": 6.075,
"mean_token_accuracy": 0.15321042835712434,
"num_tokens": 9818324.0,
"step": 5260
},
{
"entropy": 6.11839337348938,
"epoch": 0.4649417167078771,
"grad_norm": 2.328125,
"learning_rate": 0.0004983991410615239,
"loss": 6.0642,
"mean_token_accuracy": 0.15897032916545867,
"num_tokens": 9827935.0,
"step": 5265
},
{
"entropy": 6.192565965652466,
"epoch": 0.4653832567997174,
"grad_norm": 1.796875,
"learning_rate": 0.0004983953889721414,
"loss": 6.0708,
"mean_token_accuracy": 0.14985240399837493,
"num_tokens": 9837118.0,
"step": 5270
},
{
"entropy": 6.283035516738892,
"epoch": 0.46582479689155776,
"grad_norm": 1.6953125,
"learning_rate": 0.0004983916325065703,
"loss": 6.1452,
"mean_token_accuracy": 0.14742159396409987,
"num_tokens": 9846197.0,
"step": 5275
},
{
"entropy": 6.218610715866089,
"epoch": 0.4662663369833981,
"grad_norm": 3.234375,
"learning_rate": 0.0004983878716648842,
"loss": 6.207,
"mean_token_accuracy": 0.138255525380373,
"num_tokens": 9856120.0,
"step": 5280
},
{
"entropy": 6.236172008514404,
"epoch": 0.4667078770752384,
"grad_norm": 1.8515625,
"learning_rate": 0.0004983841064471567,
"loss": 6.1443,
"mean_token_accuracy": 0.15334289371967316,
"num_tokens": 9865599.0,
"step": 5285
},
{
"entropy": 6.220607471466065,
"epoch": 0.46714941716707875,
"grad_norm": 1.609375,
"learning_rate": 0.0004983803368534617,
"loss": 6.0731,
"mean_token_accuracy": 0.14917169362306595,
"num_tokens": 9876471.0,
"step": 5290
},
{
"entropy": 6.272904968261718,
"epoch": 0.4675909572589191,
"grad_norm": 2.046875,
"learning_rate": 0.0004983765628838728,
"loss": 6.1206,
"mean_token_accuracy": 0.14877381771802903,
"num_tokens": 9887680.0,
"step": 5295
},
{
"entropy": 6.372138261795044,
"epoch": 0.46803249735075947,
"grad_norm": 1.625,
"learning_rate": 0.0004983727845384641,
"loss": 6.1891,
"mean_token_accuracy": 0.14280365407466888,
"num_tokens": 9897366.0,
"step": 5300
},
{
"entropy": 6.224646997451782,
"epoch": 0.4684740374425998,
"grad_norm": 1.640625,
"learning_rate": 0.0004983690018173096,
"loss": 6.1643,
"mean_token_accuracy": 0.14118458405137063,
"num_tokens": 9907437.0,
"step": 5305
},
{
"entropy": 6.168851518630982,
"epoch": 0.46891557753444013,
"grad_norm": 1.7421875,
"learning_rate": 0.0004983652147204834,
"loss": 5.9414,
"mean_token_accuracy": 0.15954260528087616,
"num_tokens": 9915766.0,
"step": 5310
},
{
"entropy": 6.174386072158813,
"epoch": 0.46935711762628046,
"grad_norm": 1.7421875,
"learning_rate": 0.0004983614232480598,
"loss": 6.1676,
"mean_token_accuracy": 0.14472133666276932,
"num_tokens": 9925389.0,
"step": 5315
},
{
"entropy": 6.242318105697632,
"epoch": 0.4697986577181208,
"grad_norm": 2.015625,
"learning_rate": 0.0004983576274001127,
"loss": 6.2095,
"mean_token_accuracy": 0.14636736437678338,
"num_tokens": 9935798.0,
"step": 5320
},
{
"entropy": 6.27483172416687,
"epoch": 0.4702401978099611,
"grad_norm": 1.6953125,
"learning_rate": 0.000498353827176717,
"loss": 6.0797,
"mean_token_accuracy": 0.15635642111301423,
"num_tokens": 9945579.0,
"step": 5325
},
{
"entropy": 6.2160468101501465,
"epoch": 0.4706817379018015,
"grad_norm": 2.015625,
"learning_rate": 0.0004983500225779466,
"loss": 6.0771,
"mean_token_accuracy": 0.15257431268692018,
"num_tokens": 9955248.0,
"step": 5330
},
{
"entropy": 6.233940362930298,
"epoch": 0.47112327799364184,
"grad_norm": 1.640625,
"learning_rate": 0.0004983462136038764,
"loss": 6.0821,
"mean_token_accuracy": 0.1569819375872612,
"num_tokens": 9965078.0,
"step": 5335
},
{
"entropy": 6.246978759765625,
"epoch": 0.4715648180854822,
"grad_norm": 2.125,
"learning_rate": 0.0004983424002545809,
"loss": 6.0492,
"mean_token_accuracy": 0.15982300341129302,
"num_tokens": 9973932.0,
"step": 5340
},
{
"entropy": 6.262096881866455,
"epoch": 0.4720063581773225,
"grad_norm": 1.546875,
"learning_rate": 0.0004983385825301348,
"loss": 6.1096,
"mean_token_accuracy": 0.14472333192825318,
"num_tokens": 9983315.0,
"step": 5345
},
{
"entropy": 6.222039794921875,
"epoch": 0.47244789826916284,
"grad_norm": 1.7109375,
"learning_rate": 0.0004983347604306129,
"loss": 6.0561,
"mean_token_accuracy": 0.15030533075332642,
"num_tokens": 9992987.0,
"step": 5350
},
{
"entropy": 6.092016220092773,
"epoch": 0.47288943836100317,
"grad_norm": 1.9453125,
"learning_rate": 0.0004983309339560899,
"loss": 6.126,
"mean_token_accuracy": 0.14506357684731483,
"num_tokens": 10002268.0,
"step": 5355
},
{
"entropy": 6.288043355941772,
"epoch": 0.4733309784528435,
"grad_norm": 1.9140625,
"learning_rate": 0.0004983271031066412,
"loss": 6.1245,
"mean_token_accuracy": 0.14628779739141465,
"num_tokens": 10011772.0,
"step": 5360
},
{
"entropy": 6.274447917938232,
"epoch": 0.4737725185446839,
"grad_norm": 1.5703125,
"learning_rate": 0.0004983232678823414,
"loss": 6.1144,
"mean_token_accuracy": 0.1535882532596588,
"num_tokens": 10021069.0,
"step": 5365
},
{
"entropy": 6.13931097984314,
"epoch": 0.4742140586365242,
"grad_norm": 1.6796875,
"learning_rate": 0.0004983194282832657,
"loss": 6.0469,
"mean_token_accuracy": 0.15460294410586356,
"num_tokens": 10029706.0,
"step": 5370
},
{
"entropy": 6.123434686660767,
"epoch": 0.47465559872836455,
"grad_norm": 1.5234375,
"learning_rate": 0.0004983155843094895,
"loss": 6.0094,
"mean_token_accuracy": 0.1568350613117218,
"num_tokens": 10039633.0,
"step": 5375
},
{
"entropy": 6.263561010360718,
"epoch": 0.4750971388202049,
"grad_norm": 1.734375,
"learning_rate": 0.0004983117359610881,
"loss": 6.0676,
"mean_token_accuracy": 0.15199101269245147,
"num_tokens": 10048675.0,
"step": 5380
},
{
"entropy": 6.28706202507019,
"epoch": 0.4755386789120452,
"grad_norm": 2.296875,
"learning_rate": 0.0004983078832381367,
"loss": 6.0521,
"mean_token_accuracy": 0.15566769391298294,
"num_tokens": 10057447.0,
"step": 5385
},
{
"entropy": 6.180134248733521,
"epoch": 0.47598021900388554,
"grad_norm": 1.6328125,
"learning_rate": 0.0004983040261407109,
"loss": 6.1343,
"mean_token_accuracy": 0.1476961798965931,
"num_tokens": 10067020.0,
"step": 5390
},
{
"entropy": 6.287719488143921,
"epoch": 0.47642175909572587,
"grad_norm": 1.6640625,
"learning_rate": 0.0004983001646688863,
"loss": 6.1531,
"mean_token_accuracy": 0.14605475217103958,
"num_tokens": 10076466.0,
"step": 5395
},
{
"entropy": 6.220081901550293,
"epoch": 0.47686329918756626,
"grad_norm": 4.5625,
"learning_rate": 0.0004982962988227383,
"loss": 6.0358,
"mean_token_accuracy": 0.151186566054821,
"num_tokens": 10085384.0,
"step": 5400
},
{
"entropy": 6.175395393371582,
"epoch": 0.4773048392794066,
"grad_norm": 1.75,
"learning_rate": 0.000498292428602343,
"loss": 6.1598,
"mean_token_accuracy": 0.1484358288347721,
"num_tokens": 10094015.0,
"step": 5405
},
{
"entropy": 6.251093626022339,
"epoch": 0.4777463793712469,
"grad_norm": 1.9296875,
"learning_rate": 0.0004982885540077758,
"loss": 6.0493,
"mean_token_accuracy": 0.15062117725610732,
"num_tokens": 10103107.0,
"step": 5410
},
{
"entropy": 6.205082178115845,
"epoch": 0.47818791946308725,
"grad_norm": 1.8984375,
"learning_rate": 0.0004982846750391129,
"loss": 5.9784,
"mean_token_accuracy": 0.15971413403749465,
"num_tokens": 10112408.0,
"step": 5415
},
{
"entropy": 6.162239980697632,
"epoch": 0.4786294595549276,
"grad_norm": 1.640625,
"learning_rate": 0.0004982807916964303,
"loss": 6.0535,
"mean_token_accuracy": 0.1549421191215515,
"num_tokens": 10121605.0,
"step": 5420
},
{
"entropy": 6.155058526992798,
"epoch": 0.4790709996467679,
"grad_norm": 1.8359375,
"learning_rate": 0.000498276903979804,
"loss": 6.034,
"mean_token_accuracy": 0.15531475991010665,
"num_tokens": 10130484.0,
"step": 5425
},
{
"entropy": 6.175060844421386,
"epoch": 0.47951253973860825,
"grad_norm": 1.8515625,
"learning_rate": 0.00049827301188931,
"loss": 6.0245,
"mean_token_accuracy": 0.15743746012449264,
"num_tokens": 10140002.0,
"step": 5430
},
{
"entropy": 6.31604700088501,
"epoch": 0.47995407983044863,
"grad_norm": 1.7890625,
"learning_rate": 0.0004982691154250247,
"loss": 6.1765,
"mean_token_accuracy": 0.14907011836767198,
"num_tokens": 10150287.0,
"step": 5435
},
{
"entropy": 6.230531549453735,
"epoch": 0.48039561992228896,
"grad_norm": 1.671875,
"learning_rate": 0.0004982652145870245,
"loss": 6.0174,
"mean_token_accuracy": 0.15797854363918304,
"num_tokens": 10160615.0,
"step": 5440
},
{
"entropy": 6.179948806762695,
"epoch": 0.4808371600141293,
"grad_norm": 1.6953125,
"learning_rate": 0.0004982613093753856,
"loss": 6.0705,
"mean_token_accuracy": 0.14943629652261733,
"num_tokens": 10170271.0,
"step": 5445
},
{
"entropy": 6.231583595275879,
"epoch": 0.4812787001059696,
"grad_norm": 1.71875,
"learning_rate": 0.0004982573997901847,
"loss": 6.056,
"mean_token_accuracy": 0.15738898664712905,
"num_tokens": 10179663.0,
"step": 5450
},
{
"entropy": 6.289588546752929,
"epoch": 0.48172024019780996,
"grad_norm": 2.234375,
"learning_rate": 0.0004982534858314982,
"loss": 6.1228,
"mean_token_accuracy": 0.14590489864349365,
"num_tokens": 10188608.0,
"step": 5455
},
{
"entropy": 6.254216098785401,
"epoch": 0.4821617802896503,
"grad_norm": 2.078125,
"learning_rate": 0.0004982495674994031,
"loss": 6.0859,
"mean_token_accuracy": 0.1491940975189209,
"num_tokens": 10198462.0,
"step": 5460
},
{
"entropy": 6.120104646682739,
"epoch": 0.4826033203814906,
"grad_norm": 1.7578125,
"learning_rate": 0.0004982456447939758,
"loss": 6.0338,
"mean_token_accuracy": 0.15759821385145187,
"num_tokens": 10208362.0,
"step": 5465
},
{
"entropy": 6.200664806365967,
"epoch": 0.483044860473331,
"grad_norm": 1.625,
"learning_rate": 0.0004982417177152933,
"loss": 6.0675,
"mean_token_accuracy": 0.1542600154876709,
"num_tokens": 10217915.0,
"step": 5470
},
{
"entropy": 6.256381845474243,
"epoch": 0.48348640056517134,
"grad_norm": 1.7890625,
"learning_rate": 0.0004982377862634325,
"loss": 6.1251,
"mean_token_accuracy": 0.14791901409626007,
"num_tokens": 10226913.0,
"step": 5475
},
{
"entropy": 6.213307809829712,
"epoch": 0.48392794065701167,
"grad_norm": 1.875,
"learning_rate": 0.0004982338504384705,
"loss": 6.0808,
"mean_token_accuracy": 0.14749183356761933,
"num_tokens": 10236516.0,
"step": 5480
},
{
"entropy": 6.281264781951904,
"epoch": 0.484369480748852,
"grad_norm": 2.0625,
"learning_rate": 0.0004982299102404843,
"loss": 6.0938,
"mean_token_accuracy": 0.15255813151597977,
"num_tokens": 10245492.0,
"step": 5485
},
{
"entropy": 6.161162233352661,
"epoch": 0.48481102084069233,
"grad_norm": 1.765625,
"learning_rate": 0.000498225965669551,
"loss": 5.9864,
"mean_token_accuracy": 0.1673749029636383,
"num_tokens": 10254094.0,
"step": 5490
},
{
"entropy": 6.163426876068115,
"epoch": 0.48525256093253266,
"grad_norm": 1.6796875,
"learning_rate": 0.0004982220167257482,
"loss": 6.025,
"mean_token_accuracy": 0.15340587124228477,
"num_tokens": 10263645.0,
"step": 5495
},
{
"entropy": 6.130688619613648,
"epoch": 0.485694101024373,
"grad_norm": 1.75,
"learning_rate": 0.0004982180634091529,
"loss": 5.9811,
"mean_token_accuracy": 0.1652866408228874,
"num_tokens": 10273416.0,
"step": 5500
},
{
"entropy": 6.197805738449096,
"epoch": 0.4861356411162134,
"grad_norm": 1.3125,
"learning_rate": 0.0004982141057198427,
"loss": 6.088,
"mean_token_accuracy": 0.15661069452762605,
"num_tokens": 10283194.0,
"step": 5505
},
{
"entropy": 6.230135869979859,
"epoch": 0.4865771812080537,
"grad_norm": 1.828125,
"learning_rate": 0.0004982101436578952,
"loss": 6.0745,
"mean_token_accuracy": 0.15319612324237825,
"num_tokens": 10292188.0,
"step": 5510
},
{
"entropy": 6.199646711349487,
"epoch": 0.48701872129989404,
"grad_norm": 1.75,
"learning_rate": 0.0004982061772233878,
"loss": 6.0012,
"mean_token_accuracy": 0.16849624663591384,
"num_tokens": 10301539.0,
"step": 5515
},
{
"entropy": 6.155360364913941,
"epoch": 0.4874602613917344,
"grad_norm": 1.671875,
"learning_rate": 0.0004982022064163984,
"loss": 6.0182,
"mean_token_accuracy": 0.1558818131685257,
"num_tokens": 10310379.0,
"step": 5520
},
{
"entropy": 6.2828093528747555,
"epoch": 0.4879018014835747,
"grad_norm": 2.5625,
"learning_rate": 0.0004981982312370047,
"loss": 6.1951,
"mean_token_accuracy": 0.14344881922006608,
"num_tokens": 10320622.0,
"step": 5525
},
{
"entropy": 6.2398645877838135,
"epoch": 0.48834334157541504,
"grad_norm": 1.5,
"learning_rate": 0.0004981942516852847,
"loss": 6.0523,
"mean_token_accuracy": 0.1519939720630646,
"num_tokens": 10330525.0,
"step": 5530
},
{
"entropy": 6.178468704223633,
"epoch": 0.48878488166725537,
"grad_norm": 1.78125,
"learning_rate": 0.0004981902677613161,
"loss": 6.0634,
"mean_token_accuracy": 0.1571633905172348,
"num_tokens": 10340288.0,
"step": 5535
},
{
"entropy": 6.321018171310425,
"epoch": 0.48922642175909575,
"grad_norm": 1.484375,
"learning_rate": 0.0004981862794651771,
"loss": 6.1756,
"mean_token_accuracy": 0.14611549079418182,
"num_tokens": 10349836.0,
"step": 5540
},
{
"entropy": 6.298594951629639,
"epoch": 0.4896679618509361,
"grad_norm": 1.5390625,
"learning_rate": 0.0004981822867969459,
"loss": 6.0876,
"mean_token_accuracy": 0.15010807365179063,
"num_tokens": 10359481.0,
"step": 5545
},
{
"entropy": 6.17570424079895,
"epoch": 0.4901095019427764,
"grad_norm": 1.8203125,
"learning_rate": 0.0004981782897567006,
"loss": 6.0731,
"mean_token_accuracy": 0.15269545316696168,
"num_tokens": 10369837.0,
"step": 5550
},
{
"entropy": 6.232746553421021,
"epoch": 0.49055104203461675,
"grad_norm": 1.3984375,
"learning_rate": 0.0004981742883445195,
"loss": 6.0222,
"mean_token_accuracy": 0.15387771874666215,
"num_tokens": 10379276.0,
"step": 5555
},
{
"entropy": 6.2836329460144045,
"epoch": 0.4909925821264571,
"grad_norm": 1.5859375,
"learning_rate": 0.000498170282560481,
"loss": 6.1657,
"mean_token_accuracy": 0.14680661410093307,
"num_tokens": 10388878.0,
"step": 5560
},
{
"entropy": 6.268063640594482,
"epoch": 0.4914341222182974,
"grad_norm": 2.21875,
"learning_rate": 0.0004981662724046637,
"loss": 6.1498,
"mean_token_accuracy": 0.14900615811347961,
"num_tokens": 10399148.0,
"step": 5565
},
{
"entropy": 6.17643632888794,
"epoch": 0.49187566231013774,
"grad_norm": 1.65625,
"learning_rate": 0.000498162257877146,
"loss": 6.0708,
"mean_token_accuracy": 0.15419022738933563,
"num_tokens": 10409002.0,
"step": 5570
},
{
"entropy": 6.202827405929566,
"epoch": 0.4923172024019781,
"grad_norm": 2.28125,
"learning_rate": 0.0004981582389780065,
"loss": 6.1264,
"mean_token_accuracy": 0.14688992947340013,
"num_tokens": 10418083.0,
"step": 5575
},
{
"entropy": 6.325224685668945,
"epoch": 0.49275874249381846,
"grad_norm": 1.5,
"learning_rate": 0.0004981542157073241,
"loss": 6.1325,
"mean_token_accuracy": 0.1459851548075676,
"num_tokens": 10428134.0,
"step": 5580
},
{
"entropy": 6.244769668579101,
"epoch": 0.4932002825856588,
"grad_norm": 2.015625,
"learning_rate": 0.0004981501880651775,
"loss": 6.1025,
"mean_token_accuracy": 0.14910912066698073,
"num_tokens": 10437436.0,
"step": 5585
},
{
"entropy": 6.241864013671875,
"epoch": 0.4936418226774991,
"grad_norm": 2.25,
"learning_rate": 0.0004981461560516457,
"loss": 6.0608,
"mean_token_accuracy": 0.1482058048248291,
"num_tokens": 10446176.0,
"step": 5590
},
{
"entropy": 6.2926859855651855,
"epoch": 0.49408336276933945,
"grad_norm": 1.8515625,
"learning_rate": 0.0004981421196668075,
"loss": 6.2225,
"mean_token_accuracy": 0.1453863188624382,
"num_tokens": 10455953.0,
"step": 5595
},
{
"entropy": 6.237603664398193,
"epoch": 0.4945249028611798,
"grad_norm": 1.484375,
"learning_rate": 0.0004981380789107422,
"loss": 6.0531,
"mean_token_accuracy": 0.152923521399498,
"num_tokens": 10465129.0,
"step": 5600
},
{
"entropy": 6.152634859085083,
"epoch": 0.4949664429530201,
"grad_norm": 1.8359375,
"learning_rate": 0.0004981340337835287,
"loss": 6.0626,
"mean_token_accuracy": 0.15646580308675767,
"num_tokens": 10474376.0,
"step": 5605
},
{
"entropy": 6.27559905052185,
"epoch": 0.4954079830448605,
"grad_norm": 1.9921875,
"learning_rate": 0.0004981299842852464,
"loss": 6.127,
"mean_token_accuracy": 0.15202730447053908,
"num_tokens": 10484849.0,
"step": 5610
},
{
"entropy": 6.164656114578247,
"epoch": 0.49584952313670083,
"grad_norm": 1.765625,
"learning_rate": 0.0004981259304159747,
"loss": 5.9974,
"mean_token_accuracy": 0.16477532535791398,
"num_tokens": 10493950.0,
"step": 5615
},
{
"entropy": 6.120241928100586,
"epoch": 0.49629106322854116,
"grad_norm": 2.625,
"learning_rate": 0.0004981218721757929,
"loss": 5.9823,
"mean_token_accuracy": 0.16299533545970918,
"num_tokens": 10502890.0,
"step": 5620
},
{
"entropy": 6.169768047332764,
"epoch": 0.4967326033203815,
"grad_norm": 1.7578125,
"learning_rate": 0.0004981178095647805,
"loss": 5.9726,
"mean_token_accuracy": 0.15252360329031944,
"num_tokens": 10511702.0,
"step": 5625
},
{
"entropy": 6.239253520965576,
"epoch": 0.4971741434122218,
"grad_norm": 1.703125,
"learning_rate": 0.0004981137425830171,
"loss": 6.0442,
"mean_token_accuracy": 0.1530621826648712,
"num_tokens": 10520212.0,
"step": 5630
},
{
"entropy": 6.224827003479004,
"epoch": 0.49761568350406216,
"grad_norm": 2.078125,
"learning_rate": 0.0004981096712305825,
"loss": 6.0788,
"mean_token_accuracy": 0.15880460888147355,
"num_tokens": 10529652.0,
"step": 5635
},
{
"entropy": 6.2657328128814695,
"epoch": 0.4980572235959025,
"grad_norm": 1.8203125,
"learning_rate": 0.0004981055955075561,
"loss": 6.1398,
"mean_token_accuracy": 0.14761028215289115,
"num_tokens": 10537980.0,
"step": 5640
},
{
"entropy": 6.235979509353638,
"epoch": 0.4984987636877429,
"grad_norm": 1.953125,
"learning_rate": 0.0004981015154140181,
"loss": 6.01,
"mean_token_accuracy": 0.1574429005384445,
"num_tokens": 10546854.0,
"step": 5645
},
{
"entropy": 6.17179799079895,
"epoch": 0.4989403037795832,
"grad_norm": 1.9375,
"learning_rate": 0.0004980974309500483,
"loss": 6.0232,
"mean_token_accuracy": 0.15442994236946106,
"num_tokens": 10555691.0,
"step": 5650
},
{
"entropy": 6.178042984008789,
"epoch": 0.49938184387142354,
"grad_norm": 1.9453125,
"learning_rate": 0.0004980933421157267,
"loss": 6.1029,
"mean_token_accuracy": 0.1499166801571846,
"num_tokens": 10564750.0,
"step": 5655
},
{
"entropy": 6.26821002960205,
"epoch": 0.49982338396326387,
"grad_norm": 2.203125,
"learning_rate": 0.0004980892489111334,
"loss": 6.1341,
"mean_token_accuracy": 0.15029960572719575,
"num_tokens": 10573515.0,
"step": 5660
},
{
"entropy": 6.175892972946167,
"epoch": 0.5002649240551043,
"grad_norm": 1.6015625,
"learning_rate": 0.0004980851513363486,
"loss": 6.0086,
"mean_token_accuracy": 0.15723771452903748,
"num_tokens": 10582730.0,
"step": 5665
},
{
"entropy": 6.070863533020019,
"epoch": 0.5007064641469445,
"grad_norm": 1.8984375,
"learning_rate": 0.0004980810493914526,
"loss": 5.9176,
"mean_token_accuracy": 0.17001818120479584,
"num_tokens": 10591267.0,
"step": 5670
},
{
"entropy": 6.2038191795349125,
"epoch": 0.5011480042387849,
"grad_norm": 2.375,
"learning_rate": 0.0004980769430765256,
"loss": 6.0305,
"mean_token_accuracy": 0.1541754946112633,
"num_tokens": 10599776.0,
"step": 5675
},
{
"entropy": 6.175134658813477,
"epoch": 0.5015895443306252,
"grad_norm": 2.484375,
"learning_rate": 0.0004980728323916484,
"loss": 6.0343,
"mean_token_accuracy": 0.14554973393678666,
"num_tokens": 10609670.0,
"step": 5680
},
{
"entropy": 6.148836851119995,
"epoch": 0.5020310844224656,
"grad_norm": 1.7734375,
"learning_rate": 0.0004980687173369009,
"loss": 5.9921,
"mean_token_accuracy": 0.1531945288181305,
"num_tokens": 10619032.0,
"step": 5685
},
{
"entropy": 6.200354480743409,
"epoch": 0.5024726245143059,
"grad_norm": 2.75,
"learning_rate": 0.0004980645979123644,
"loss": 6.0675,
"mean_token_accuracy": 0.15187735557556153,
"num_tokens": 10628851.0,
"step": 5690
},
{
"entropy": 6.234457206726074,
"epoch": 0.5029141646061462,
"grad_norm": 1.9375,
"learning_rate": 0.0004980604741181192,
"loss": 6.0212,
"mean_token_accuracy": 0.15740241408348082,
"num_tokens": 10638335.0,
"step": 5695
},
{
"entropy": 6.225916147232056,
"epoch": 0.5033557046979866,
"grad_norm": 2.125,
"learning_rate": 0.0004980563459542461,
"loss": 6.1203,
"mean_token_accuracy": 0.1536049425601959,
"num_tokens": 10648450.0,
"step": 5700
},
{
"entropy": 6.271219968795776,
"epoch": 0.5037972447898269,
"grad_norm": 1.640625,
"learning_rate": 0.0004980522134208261,
"loss": 6.1492,
"mean_token_accuracy": 0.146041289716959,
"num_tokens": 10658700.0,
"step": 5705
},
{
"entropy": 6.291195201873779,
"epoch": 0.5042387848816673,
"grad_norm": 1.84375,
"learning_rate": 0.0004980480765179401,
"loss": 6.1487,
"mean_token_accuracy": 0.14889888167381288,
"num_tokens": 10667952.0,
"step": 5710
},
{
"entropy": 6.102896404266358,
"epoch": 0.5046803249735076,
"grad_norm": 2.9375,
"learning_rate": 0.0004980439352456692,
"loss": 5.9948,
"mean_token_accuracy": 0.1518148198723793,
"num_tokens": 10677228.0,
"step": 5715
},
{
"entropy": 6.179556941986084,
"epoch": 0.505121865065348,
"grad_norm": 2.21875,
"learning_rate": 0.0004980397896040944,
"loss": 6.0536,
"mean_token_accuracy": 0.1556122913956642,
"num_tokens": 10686183.0,
"step": 5720
},
{
"entropy": 6.3303307056427,
"epoch": 0.5055634051571882,
"grad_norm": 2.484375,
"learning_rate": 0.0004980356395932969,
"loss": 6.0907,
"mean_token_accuracy": 0.1538555309176445,
"num_tokens": 10695293.0,
"step": 5725
},
{
"entropy": 6.229521656036377,
"epoch": 0.5060049452490286,
"grad_norm": 1.7734375,
"learning_rate": 0.0004980314852133581,
"loss": 6.0481,
"mean_token_accuracy": 0.15595095455646515,
"num_tokens": 10704853.0,
"step": 5730
},
{
"entropy": 6.178576850891114,
"epoch": 0.506446485340869,
"grad_norm": 2.234375,
"learning_rate": 0.0004980273264643594,
"loss": 6.0573,
"mean_token_accuracy": 0.14866793304681777,
"num_tokens": 10714307.0,
"step": 5735
},
{
"entropy": 6.105400037765503,
"epoch": 0.5068880254327093,
"grad_norm": 1.890625,
"learning_rate": 0.0004980231633463822,
"loss": 5.9431,
"mean_token_accuracy": 0.15429134145379067,
"num_tokens": 10723513.0,
"step": 5740
},
{
"entropy": 6.182111120223999,
"epoch": 0.5073295655245497,
"grad_norm": 2.46875,
"learning_rate": 0.0004980189958595081,
"loss": 6.1135,
"mean_token_accuracy": 0.14779711961746217,
"num_tokens": 10732809.0,
"step": 5745
},
{
"entropy": 6.219801568984986,
"epoch": 0.5077711056163899,
"grad_norm": 2.0,
"learning_rate": 0.0004980148240038186,
"loss": 6.1188,
"mean_token_accuracy": 0.1531921371817589,
"num_tokens": 10742960.0,
"step": 5750
},
{
"entropy": 6.291525602340698,
"epoch": 0.5082126457082303,
"grad_norm": 1.9921875,
"learning_rate": 0.0004980106477793957,
"loss": 6.163,
"mean_token_accuracy": 0.1517067790031433,
"num_tokens": 10752835.0,
"step": 5755
},
{
"entropy": 6.241646194458008,
"epoch": 0.5086541858000706,
"grad_norm": 1.6484375,
"learning_rate": 0.0004980064671863209,
"loss": 6.0603,
"mean_token_accuracy": 0.15527053624391557,
"num_tokens": 10762139.0,
"step": 5760
},
{
"entropy": 6.215019416809082,
"epoch": 0.509095725891911,
"grad_norm": 1.6953125,
"learning_rate": 0.0004980022822246763,
"loss": 6.1307,
"mean_token_accuracy": 0.1484266459941864,
"num_tokens": 10771961.0,
"step": 5765
},
{
"entropy": 6.309531927108765,
"epoch": 0.5095372659837514,
"grad_norm": 1.6328125,
"learning_rate": 0.0004979980928945439,
"loss": 6.1903,
"mean_token_accuracy": 0.1406489558517933,
"num_tokens": 10780163.0,
"step": 5770
},
{
"entropy": 6.264658117294312,
"epoch": 0.5099788060755917,
"grad_norm": 3.03125,
"learning_rate": 0.0004979938991960056,
"loss": 6.1436,
"mean_token_accuracy": 0.14712898582220077,
"num_tokens": 10788339.0,
"step": 5775
},
{
"entropy": 6.287960481643677,
"epoch": 0.510420346167432,
"grad_norm": 1.8359375,
"learning_rate": 0.0004979897011291436,
"loss": 6.1436,
"mean_token_accuracy": 0.1394449144601822,
"num_tokens": 10797315.0,
"step": 5780
},
{
"entropy": 6.310721778869629,
"epoch": 0.5108618862592723,
"grad_norm": 1.6171875,
"learning_rate": 0.0004979854986940402,
"loss": 6.0521,
"mean_token_accuracy": 0.1499259203672409,
"num_tokens": 10806864.0,
"step": 5785
},
{
"entropy": 6.211594343185425,
"epoch": 0.5113034263511127,
"grad_norm": 2.296875,
"learning_rate": 0.0004979812918907777,
"loss": 6.0803,
"mean_token_accuracy": 0.149106565117836,
"num_tokens": 10816417.0,
"step": 5790
},
{
"entropy": 6.235892724990845,
"epoch": 0.511744966442953,
"grad_norm": 1.5,
"learning_rate": 0.0004979770807194385,
"loss": 6.1297,
"mean_token_accuracy": 0.1502230428159237,
"num_tokens": 10825692.0,
"step": 5795
},
{
"entropy": 6.17337121963501,
"epoch": 0.5121865065347934,
"grad_norm": 2.359375,
"learning_rate": 0.0004979728651801051,
"loss": 6.1258,
"mean_token_accuracy": 0.15180813670158386,
"num_tokens": 10834652.0,
"step": 5800
},
{
"entropy": 6.238249397277832,
"epoch": 0.5126280466266337,
"grad_norm": 3.0,
"learning_rate": 0.0004979686452728602,
"loss": 6.1223,
"mean_token_accuracy": 0.1498955324292183,
"num_tokens": 10844491.0,
"step": 5805
},
{
"entropy": 6.253004026412964,
"epoch": 0.513069586718474,
"grad_norm": 3.390625,
"learning_rate": 0.0004979644209977863,
"loss": 6.0567,
"mean_token_accuracy": 0.15736870020627974,
"num_tokens": 10853948.0,
"step": 5810
},
{
"entropy": 6.219189548492432,
"epoch": 0.5135111268103144,
"grad_norm": 2.4375,
"learning_rate": 0.0004979601923549661,
"loss": 6.0507,
"mean_token_accuracy": 0.15809340327978133,
"num_tokens": 10861745.0,
"step": 5815
},
{
"entropy": 6.255096530914306,
"epoch": 0.5139526669021547,
"grad_norm": 2.6875,
"learning_rate": 0.0004979559593444826,
"loss": 6.1591,
"mean_token_accuracy": 0.15061620324850084,
"num_tokens": 10871239.0,
"step": 5820
},
{
"entropy": 6.206992340087891,
"epoch": 0.5143942069939951,
"grad_norm": 1.8046875,
"learning_rate": 0.0004979517219664187,
"loss": 6.0095,
"mean_token_accuracy": 0.15605255961418152,
"num_tokens": 10880883.0,
"step": 5825
},
{
"entropy": 6.200674915313721,
"epoch": 0.5148357470858353,
"grad_norm": 1.7578125,
"learning_rate": 0.0004979474802208572,
"loss": 6.0706,
"mean_token_accuracy": 0.1538535013794899,
"num_tokens": 10890002.0,
"step": 5830
},
{
"entropy": 6.1436597347259525,
"epoch": 0.5152772871776757,
"grad_norm": 1.765625,
"learning_rate": 0.0004979432341078816,
"loss": 5.9781,
"mean_token_accuracy": 0.15378640592098236,
"num_tokens": 10898299.0,
"step": 5835
},
{
"entropy": 6.246534204483032,
"epoch": 0.5157188272695161,
"grad_norm": 2.171875,
"learning_rate": 0.0004979389836275746,
"loss": 6.1891,
"mean_token_accuracy": 0.14030280113220214,
"num_tokens": 10907918.0,
"step": 5840
},
{
"entropy": 6.283355760574341,
"epoch": 0.5161603673613564,
"grad_norm": 2.484375,
"learning_rate": 0.0004979347287800198,
"loss": 6.0666,
"mean_token_accuracy": 0.15159436464309692,
"num_tokens": 10917318.0,
"step": 5845
},
{
"entropy": 6.239576005935669,
"epoch": 0.5166019074531968,
"grad_norm": 1.9140625,
"learning_rate": 0.0004979304695653005,
"loss": 6.0368,
"mean_token_accuracy": 0.14758304730057717,
"num_tokens": 10926338.0,
"step": 5850
},
{
"entropy": 6.180262565612793,
"epoch": 0.5170434475450371,
"grad_norm": 2.09375,
"learning_rate": 0.0004979262059835001,
"loss": 6.0567,
"mean_token_accuracy": 0.1544695608317852,
"num_tokens": 10935244.0,
"step": 5855
},
{
"entropy": 6.227532386779785,
"epoch": 0.5174849876368774,
"grad_norm": 1.734375,
"learning_rate": 0.0004979219380347021,
"loss": 6.0895,
"mean_token_accuracy": 0.15278323590755463,
"num_tokens": 10943764.0,
"step": 5860
},
{
"entropy": 6.217388772964478,
"epoch": 0.5179265277287177,
"grad_norm": 1.6015625,
"learning_rate": 0.0004979176657189901,
"loss": 6.0614,
"mean_token_accuracy": 0.15153294652700425,
"num_tokens": 10952580.0,
"step": 5865
},
{
"entropy": 6.184233570098877,
"epoch": 0.5183680678205581,
"grad_norm": 2.109375,
"learning_rate": 0.0004979133890364477,
"loss": 6.0912,
"mean_token_accuracy": 0.15725700706243514,
"num_tokens": 10961745.0,
"step": 5870
},
{
"entropy": 6.132976865768432,
"epoch": 0.5188096079123985,
"grad_norm": 1.6953125,
"learning_rate": 0.000497909107987159,
"loss": 6.0044,
"mean_token_accuracy": 0.14987772107124328,
"num_tokens": 10971018.0,
"step": 5875
},
{
"entropy": 6.245497131347657,
"epoch": 0.5192511480042388,
"grad_norm": 1.5625,
"learning_rate": 0.0004979048225712074,
"loss": 6.0635,
"mean_token_accuracy": 0.1502876304090023,
"num_tokens": 10980070.0,
"step": 5880
},
{
"entropy": 6.2374574661254885,
"epoch": 0.5196926880960792,
"grad_norm": 2.125,
"learning_rate": 0.0004979005327886772,
"loss": 6.0151,
"mean_token_accuracy": 0.15238675773143767,
"num_tokens": 10989090.0,
"step": 5885
},
{
"entropy": 6.192137956619263,
"epoch": 0.5201342281879194,
"grad_norm": 2.546875,
"learning_rate": 0.0004978962386396525,
"loss": 6.0671,
"mean_token_accuracy": 0.15695874094963075,
"num_tokens": 10998652.0,
"step": 5890
},
{
"entropy": 6.124173307418824,
"epoch": 0.5205757682797598,
"grad_norm": 1.765625,
"learning_rate": 0.0004978919401242171,
"loss": 5.9867,
"mean_token_accuracy": 0.15875377953052522,
"num_tokens": 11006323.0,
"step": 5895
},
{
"entropy": 6.016487741470337,
"epoch": 0.5210173083716001,
"grad_norm": 1.90625,
"learning_rate": 0.0004978876372424553,
"loss": 5.9289,
"mean_token_accuracy": 0.16370188891887666,
"num_tokens": 11015054.0,
"step": 5900
},
{
"entropy": 6.187124967575073,
"epoch": 0.5214588484634405,
"grad_norm": 1.875,
"learning_rate": 0.0004978833299944515,
"loss": 6.0942,
"mean_token_accuracy": 0.14643116071820259,
"num_tokens": 11025787.0,
"step": 5905
},
{
"entropy": 6.38083028793335,
"epoch": 0.5219003885552809,
"grad_norm": 1.8515625,
"learning_rate": 0.0004978790183802901,
"loss": 6.2004,
"mean_token_accuracy": 0.1463787078857422,
"num_tokens": 11036091.0,
"step": 5910
},
{
"entropy": 6.241087150573731,
"epoch": 0.5223419286471211,
"grad_norm": 1.8984375,
"learning_rate": 0.0004978747024000554,
"loss": 6.1841,
"mean_token_accuracy": 0.13922761231660843,
"num_tokens": 11046442.0,
"step": 5915
},
{
"entropy": 6.289608478546143,
"epoch": 0.5227834687389615,
"grad_norm": 1.6328125,
"learning_rate": 0.0004978703820538321,
"loss": 6.1859,
"mean_token_accuracy": 0.14226099327206612,
"num_tokens": 11056907.0,
"step": 5920
},
{
"entropy": 6.275417995452881,
"epoch": 0.5232250088308018,
"grad_norm": 3.640625,
"learning_rate": 0.0004978660573417048,
"loss": 6.0243,
"mean_token_accuracy": 0.15696371644735335,
"num_tokens": 11065298.0,
"step": 5925
},
{
"entropy": 6.223781394958496,
"epoch": 0.5236665489226422,
"grad_norm": 2.359375,
"learning_rate": 0.000497861728263758,
"loss": 6.0378,
"mean_token_accuracy": 0.15642370134592057,
"num_tokens": 11074509.0,
"step": 5930
},
{
"entropy": 6.137613821029663,
"epoch": 0.5241080890144825,
"grad_norm": 2.28125,
"learning_rate": 0.0004978573948200769,
"loss": 6.0634,
"mean_token_accuracy": 0.15504582077264786,
"num_tokens": 11082433.0,
"step": 5935
},
{
"entropy": 6.159803628921509,
"epoch": 0.5245496291063229,
"grad_norm": 2.0,
"learning_rate": 0.0004978530570107461,
"loss": 6.0445,
"mean_token_accuracy": 0.15370505750179292,
"num_tokens": 11090838.0,
"step": 5940
},
{
"entropy": 6.244238471984863,
"epoch": 0.5249911691981632,
"grad_norm": 2.0,
"learning_rate": 0.0004978487148358506,
"loss": 6.0384,
"mean_token_accuracy": 0.1582946076989174,
"num_tokens": 11100048.0,
"step": 5945
},
{
"entropy": 6.176552677154541,
"epoch": 0.5254327092900035,
"grad_norm": 1.984375,
"learning_rate": 0.0004978443682954756,
"loss": 6.0653,
"mean_token_accuracy": 0.1521560877561569,
"num_tokens": 11109871.0,
"step": 5950
},
{
"entropy": 6.178084754943848,
"epoch": 0.5258742493818439,
"grad_norm": 2.21875,
"learning_rate": 0.0004978400173897061,
"loss": 6.0575,
"mean_token_accuracy": 0.14851836115121841,
"num_tokens": 11119450.0,
"step": 5955
},
{
"entropy": 6.225746393203735,
"epoch": 0.5263157894736842,
"grad_norm": 2.25,
"learning_rate": 0.0004978356621186275,
"loss": 5.9822,
"mean_token_accuracy": 0.16357790529727936,
"num_tokens": 11128321.0,
"step": 5960
},
{
"entropy": 6.185709714889526,
"epoch": 0.5267573295655246,
"grad_norm": 2.28125,
"learning_rate": 0.0004978313024823249,
"loss": 6.0541,
"mean_token_accuracy": 0.15418425425887108,
"num_tokens": 11138657.0,
"step": 5965
},
{
"entropy": 6.152607488632202,
"epoch": 0.5271988696573648,
"grad_norm": 2.09375,
"learning_rate": 0.0004978269384808839,
"loss": 6.049,
"mean_token_accuracy": 0.15706575363874437,
"num_tokens": 11147704.0,
"step": 5970
},
{
"entropy": 6.214599370956421,
"epoch": 0.5276404097492052,
"grad_norm": 2.453125,
"learning_rate": 0.0004978225701143898,
"loss": 6.1374,
"mean_token_accuracy": 0.14667211771011351,
"num_tokens": 11156979.0,
"step": 5975
},
{
"entropy": 6.2628809928894045,
"epoch": 0.5280819498410456,
"grad_norm": 2.15625,
"learning_rate": 0.0004978181973829284,
"loss": 6.0121,
"mean_token_accuracy": 0.15455354899168014,
"num_tokens": 11165539.0,
"step": 5980
},
{
"entropy": 6.253372669219971,
"epoch": 0.5285234899328859,
"grad_norm": 2.703125,
"learning_rate": 0.0004978138202865851,
"loss": 6.1024,
"mean_token_accuracy": 0.14563342407345772,
"num_tokens": 11175911.0,
"step": 5985
},
{
"entropy": 6.145098304748535,
"epoch": 0.5289650300247263,
"grad_norm": 1.8671875,
"learning_rate": 0.0004978094388254459,
"loss": 6.1126,
"mean_token_accuracy": 0.15134625881910324,
"num_tokens": 11185365.0,
"step": 5990
},
{
"entropy": 6.199877214431763,
"epoch": 0.5294065701165666,
"grad_norm": 1.90625,
"learning_rate": 0.0004978050529995965,
"loss": 6.0203,
"mean_token_accuracy": 0.15819834619760514,
"num_tokens": 11195318.0,
"step": 5995
},
{
"entropy": 6.259531831741333,
"epoch": 0.5298481102084069,
"grad_norm": 1.921875,
"learning_rate": 0.0004978006628091228,
"loss": 6.124,
"mean_token_accuracy": 0.15193520560860635,
"num_tokens": 11205246.0,
"step": 6000
},
{
"epoch": 0.5298481102084069,
"eval_entropy": 6.072632251968471,
"eval_loss": 6.105443477630615,
"eval_mean_token_accuracy": 0.15762448798056106,
"eval_num_tokens": 11205246.0,
"eval_runtime": 26.2122,
"eval_samples_per_second": 1347.271,
"eval_steps_per_second": 168.433,
"step": 6000
},
{
"entropy": 6.221136379241943,
"epoch": 0.5302896503002472,
"grad_norm": 3.34375,
"learning_rate": 0.0004977962682541108,
"loss": 6.0844,
"mean_token_accuracy": 0.14883435368537903,
"num_tokens": 11215183.0,
"step": 6005
},
{
"entropy": 6.219206190109253,
"epoch": 0.5307311903920876,
"grad_norm": 1.875,
"learning_rate": 0.0004977918693346467,
"loss": 6.0399,
"mean_token_accuracy": 0.15056363940238954,
"num_tokens": 11224127.0,
"step": 6010
},
{
"entropy": 6.2305787086486815,
"epoch": 0.531172730483928,
"grad_norm": 1.828125,
"learning_rate": 0.0004977874660508165,
"loss": 6.0903,
"mean_token_accuracy": 0.15893068611621858,
"num_tokens": 11233014.0,
"step": 6015
},
{
"entropy": 6.2588090896606445,
"epoch": 0.5316142705757683,
"grad_norm": 2.109375,
"learning_rate": 0.0004977830584027065,
"loss": 6.083,
"mean_token_accuracy": 0.15423338562250138,
"num_tokens": 11242251.0,
"step": 6020
},
{
"entropy": 6.2501606941223145,
"epoch": 0.5320558106676087,
"grad_norm": 2.5,
"learning_rate": 0.0004977786463904033,
"loss": 6.1309,
"mean_token_accuracy": 0.15289058089256286,
"num_tokens": 11251947.0,
"step": 6025
},
{
"entropy": 6.194758558273316,
"epoch": 0.5324973507594489,
"grad_norm": 2.046875,
"learning_rate": 0.0004977742300139929,
"loss": 6.136,
"mean_token_accuracy": 0.15161363184452056,
"num_tokens": 11261125.0,
"step": 6030
},
{
"entropy": 6.236899757385254,
"epoch": 0.5329388908512893,
"grad_norm": 2.59375,
"learning_rate": 0.0004977698092735621,
"loss": 6.0582,
"mean_token_accuracy": 0.15455631986260415,
"num_tokens": 11270334.0,
"step": 6035
},
{
"entropy": 6.179041385650635,
"epoch": 0.5333804309431296,
"grad_norm": 1.7890625,
"learning_rate": 0.0004977653841691975,
"loss": 6.0322,
"mean_token_accuracy": 0.15208539068698884,
"num_tokens": 11280497.0,
"step": 6040
},
{
"entropy": 6.218136930465699,
"epoch": 0.53382197103497,
"grad_norm": 1.828125,
"learning_rate": 0.0004977609547009857,
"loss": 5.9771,
"mean_token_accuracy": 0.15844970792531968,
"num_tokens": 11288636.0,
"step": 6045
},
{
"entropy": 6.245617341995239,
"epoch": 0.5342635111268104,
"grad_norm": 2.203125,
"learning_rate": 0.0004977565208690134,
"loss": 6.1018,
"mean_token_accuracy": 0.1520757868885994,
"num_tokens": 11297519.0,
"step": 6050
},
{
"entropy": 6.245824909210205,
"epoch": 0.5347050512186506,
"grad_norm": 1.6484375,
"learning_rate": 0.0004977520826733677,
"loss": 6.066,
"mean_token_accuracy": 0.15709497183561325,
"num_tokens": 11306280.0,
"step": 6055
},
{
"entropy": 6.236036396026611,
"epoch": 0.535146591310491,
"grad_norm": 2.046875,
"learning_rate": 0.0004977476401141353,
"loss": 6.0554,
"mean_token_accuracy": 0.1493854656815529,
"num_tokens": 11315366.0,
"step": 6060
},
{
"entropy": 6.173353767395019,
"epoch": 0.5355881314023313,
"grad_norm": 2.484375,
"learning_rate": 0.0004977431931914032,
"loss": 6.0739,
"mean_token_accuracy": 0.14963485300540924,
"num_tokens": 11324664.0,
"step": 6065
},
{
"entropy": 6.2184101104736325,
"epoch": 0.5360296714941717,
"grad_norm": 2.203125,
"learning_rate": 0.0004977387419052586,
"loss": 6.0594,
"mean_token_accuracy": 0.14554163068532944,
"num_tokens": 11334118.0,
"step": 6070
},
{
"entropy": 6.306727123260498,
"epoch": 0.536471211586012,
"grad_norm": 2.25,
"learning_rate": 0.000497734286255789,
"loss": 6.1534,
"mean_token_accuracy": 0.14518513083457946,
"num_tokens": 11342684.0,
"step": 6075
},
{
"entropy": 6.220088005065918,
"epoch": 0.5369127516778524,
"grad_norm": 1.96875,
"learning_rate": 0.0004977298262430813,
"loss": 6.0866,
"mean_token_accuracy": 0.15716351717710494,
"num_tokens": 11351298.0,
"step": 6080
},
{
"entropy": 6.250485229492187,
"epoch": 0.5373542917696927,
"grad_norm": 2.015625,
"learning_rate": 0.0004977253618672229,
"loss": 6.0406,
"mean_token_accuracy": 0.15668216794729234,
"num_tokens": 11360264.0,
"step": 6085
},
{
"entropy": 6.207029247283936,
"epoch": 0.537795831861533,
"grad_norm": 3.46875,
"learning_rate": 0.0004977208931283013,
"loss": 6.0102,
"mean_token_accuracy": 0.15628669857978822,
"num_tokens": 11369815.0,
"step": 6090
},
{
"entropy": 6.236184930801391,
"epoch": 0.5382373719533734,
"grad_norm": 2.3125,
"learning_rate": 0.0004977164200264042,
"loss": 6.0925,
"mean_token_accuracy": 0.14922692477703095,
"num_tokens": 11379131.0,
"step": 6095
},
{
"entropy": 6.219870615005493,
"epoch": 0.5386789120452137,
"grad_norm": 1.8125,
"learning_rate": 0.0004977119425616191,
"loss": 5.985,
"mean_token_accuracy": 0.1577737271785736,
"num_tokens": 11387692.0,
"step": 6100
},
{
"entropy": 6.217037391662598,
"epoch": 0.5391204521370541,
"grad_norm": 2.109375,
"learning_rate": 0.0004977074607340336,
"loss": 6.0477,
"mean_token_accuracy": 0.1549394980072975,
"num_tokens": 11396278.0,
"step": 6105
},
{
"entropy": 6.16995267868042,
"epoch": 0.5395619922288943,
"grad_norm": 2.28125,
"learning_rate": 0.0004977029745437357,
"loss": 5.9917,
"mean_token_accuracy": 0.1600234627723694,
"num_tokens": 11404790.0,
"step": 6110
},
{
"entropy": 6.192595767974853,
"epoch": 0.5400035323207347,
"grad_norm": 3.265625,
"learning_rate": 0.000497698483990813,
"loss": 6.0543,
"mean_token_accuracy": 0.14963596761226655,
"num_tokens": 11414614.0,
"step": 6115
},
{
"entropy": 6.211039113998413,
"epoch": 0.5404450724125751,
"grad_norm": 6.09375,
"learning_rate": 0.0004976939890753539,
"loss": 6.1049,
"mean_token_accuracy": 0.14544194787740708,
"num_tokens": 11423696.0,
"step": 6120
},
{
"entropy": 6.149191761016846,
"epoch": 0.5408866125044154,
"grad_norm": 3.078125,
"learning_rate": 0.000497689489797446,
"loss": 6.0452,
"mean_token_accuracy": 0.15861246436834336,
"num_tokens": 11432669.0,
"step": 6125
},
{
"entropy": 6.166212034225464,
"epoch": 0.5413281525962558,
"grad_norm": 2.390625,
"learning_rate": 0.0004976849861571778,
"loss": 6.0826,
"mean_token_accuracy": 0.1487231358885765,
"num_tokens": 11442132.0,
"step": 6130
},
{
"entropy": 6.241407299041748,
"epoch": 0.541769692688096,
"grad_norm": 2.296875,
"learning_rate": 0.0004976804781546373,
"loss": 6.0527,
"mean_token_accuracy": 0.14581861943006516,
"num_tokens": 11451821.0,
"step": 6135
},
{
"entropy": 6.252784061431885,
"epoch": 0.5422112327799364,
"grad_norm": 2.546875,
"learning_rate": 0.0004976759657899129,
"loss": 6.0389,
"mean_token_accuracy": 0.15604016929864883,
"num_tokens": 11460242.0,
"step": 6140
},
{
"entropy": 6.11449785232544,
"epoch": 0.5426527728717767,
"grad_norm": 2.140625,
"learning_rate": 0.000497671449063093,
"loss": 6.0737,
"mean_token_accuracy": 0.15422818958759307,
"num_tokens": 11469588.0,
"step": 6145
},
{
"entropy": 6.202958011627198,
"epoch": 0.5430943129636171,
"grad_norm": 1.9453125,
"learning_rate": 0.000497666927974266,
"loss": 6.1415,
"mean_token_accuracy": 0.1440917208790779,
"num_tokens": 11480401.0,
"step": 6150
},
{
"entropy": 6.303856229782104,
"epoch": 0.5435358530554575,
"grad_norm": 1.953125,
"learning_rate": 0.0004976624025235205,
"loss": 6.0483,
"mean_token_accuracy": 0.15544205233454705,
"num_tokens": 11489117.0,
"step": 6155
},
{
"entropy": 6.240538835525513,
"epoch": 0.5439773931472978,
"grad_norm": 1.9921875,
"learning_rate": 0.0004976578727109453,
"loss": 5.9981,
"mean_token_accuracy": 0.15545659959316255,
"num_tokens": 11497612.0,
"step": 6160
},
{
"entropy": 6.185356140136719,
"epoch": 0.5444189332391381,
"grad_norm": 2.65625,
"learning_rate": 0.0004976533385366289,
"loss": 6.0946,
"mean_token_accuracy": 0.1490752339363098,
"num_tokens": 11507024.0,
"step": 6165
},
{
"entropy": 6.148120260238647,
"epoch": 0.5448604733309784,
"grad_norm": 1.9453125,
"learning_rate": 0.0004976488000006602,
"loss": 6.0407,
"mean_token_accuracy": 0.15611946433782578,
"num_tokens": 11516873.0,
"step": 6170
},
{
"entropy": 6.2696808815002445,
"epoch": 0.5453020134228188,
"grad_norm": 2.109375,
"learning_rate": 0.0004976442571031282,
"loss": 6.1051,
"mean_token_accuracy": 0.158052060008049,
"num_tokens": 11526128.0,
"step": 6175
},
{
"entropy": 6.232856321334839,
"epoch": 0.5457435535146591,
"grad_norm": 2.015625,
"learning_rate": 0.0004976397098441218,
"loss": 6.12,
"mean_token_accuracy": 0.15662789046764375,
"num_tokens": 11535030.0,
"step": 6180
},
{
"entropy": 6.125250816345215,
"epoch": 0.5461850936064995,
"grad_norm": 2.34375,
"learning_rate": 0.0004976351582237301,
"loss": 5.991,
"mean_token_accuracy": 0.15584895610809327,
"num_tokens": 11543113.0,
"step": 6185
},
{
"entropy": 6.217065048217774,
"epoch": 0.5466266336983399,
"grad_norm": 2.296875,
"learning_rate": 0.0004976306022420423,
"loss": 6.0469,
"mean_token_accuracy": 0.15273384153842925,
"num_tokens": 11552744.0,
"step": 6190
},
{
"entropy": 6.246813106536865,
"epoch": 0.5470681737901801,
"grad_norm": 1.96875,
"learning_rate": 0.0004976260418991476,
"loss": 6.0742,
"mean_token_accuracy": 0.15100209563970565,
"num_tokens": 11561274.0,
"step": 6195
},
{
"entropy": 6.235352563858032,
"epoch": 0.5475097138820205,
"grad_norm": 2.90625,
"learning_rate": 0.0004976214771951354,
"loss": 6.0979,
"mean_token_accuracy": 0.15295421630144118,
"num_tokens": 11570485.0,
"step": 6200
},
{
"entropy": 6.219387817382812,
"epoch": 0.5479512539738608,
"grad_norm": 1.9375,
"learning_rate": 0.0004976169081300949,
"loss": 6.0886,
"mean_token_accuracy": 0.14947510063648223,
"num_tokens": 11579380.0,
"step": 6205
},
{
"entropy": 6.178956794738769,
"epoch": 0.5483927940657012,
"grad_norm": 3.8125,
"learning_rate": 0.0004976123347041159,
"loss": 6.0597,
"mean_token_accuracy": 0.15444108843803406,
"num_tokens": 11588686.0,
"step": 6210
},
{
"entropy": 6.140177059173584,
"epoch": 0.5488343341575415,
"grad_norm": 2.765625,
"learning_rate": 0.0004976077569172879,
"loss": 5.9833,
"mean_token_accuracy": 0.15883075296878815,
"num_tokens": 11598547.0,
"step": 6215
},
{
"entropy": 6.1776646137237545,
"epoch": 0.5492758742493818,
"grad_norm": 2.859375,
"learning_rate": 0.0004976031747697006,
"loss": 6.0861,
"mean_token_accuracy": 0.15330686420202255,
"num_tokens": 11608407.0,
"step": 6220
},
{
"entropy": 6.18137674331665,
"epoch": 0.5497174143412222,
"grad_norm": 2.28125,
"learning_rate": 0.0004975985882614435,
"loss": 6.0452,
"mean_token_accuracy": 0.1502505511045456,
"num_tokens": 11618641.0,
"step": 6225
},
{
"entropy": 6.249125671386719,
"epoch": 0.5501589544330625,
"grad_norm": 3.625,
"learning_rate": 0.0004975939973926068,
"loss": 6.0977,
"mean_token_accuracy": 0.14472403898835182,
"num_tokens": 11627082.0,
"step": 6230
},
{
"entropy": 6.176290273666382,
"epoch": 0.5506004945249029,
"grad_norm": 2.546875,
"learning_rate": 0.0004975894021632803,
"loss": 6.0098,
"mean_token_accuracy": 0.1578657031059265,
"num_tokens": 11636045.0,
"step": 6235
},
{
"entropy": 6.196209478378296,
"epoch": 0.5510420346167432,
"grad_norm": 2.515625,
"learning_rate": 0.000497584802573554,
"loss": 6.0775,
"mean_token_accuracy": 0.15153235495090484,
"num_tokens": 11646516.0,
"step": 6240
},
{
"entropy": 6.184172677993774,
"epoch": 0.5514835747085836,
"grad_norm": 2.765625,
"learning_rate": 0.000497580198623518,
"loss": 6.0178,
"mean_token_accuracy": 0.159309720993042,
"num_tokens": 11655512.0,
"step": 6245
},
{
"entropy": 6.219246768951416,
"epoch": 0.5519251148004238,
"grad_norm": 3.59375,
"learning_rate": 0.0004975755903132623,
"loss": 6.1042,
"mean_token_accuracy": 0.1587233141064644,
"num_tokens": 11665641.0,
"step": 6250
},
{
"entropy": 6.249983072280884,
"epoch": 0.5523666548922642,
"grad_norm": 1.96875,
"learning_rate": 0.0004975709776428776,
"loss": 6.0623,
"mean_token_accuracy": 0.14356809556484224,
"num_tokens": 11674585.0,
"step": 6255
},
{
"entropy": 6.228289794921875,
"epoch": 0.5528081949841046,
"grad_norm": 3.28125,
"learning_rate": 0.000497566360612454,
"loss": 5.9479,
"mean_token_accuracy": 0.1648830331861973,
"num_tokens": 11683498.0,
"step": 6260
},
{
"entropy": 6.145007753372193,
"epoch": 0.5532497350759449,
"grad_norm": 4.0,
"learning_rate": 0.000497561739222082,
"loss": 6.0016,
"mean_token_accuracy": 0.16011423319578172,
"num_tokens": 11692663.0,
"step": 6265
},
{
"entropy": 6.150508165359497,
"epoch": 0.5536912751677853,
"grad_norm": 2.421875,
"learning_rate": 0.0004975571134718521,
"loss": 6.1505,
"mean_token_accuracy": 0.14764927104115486,
"num_tokens": 11701906.0,
"step": 6270
},
{
"entropy": 6.235524654388428,
"epoch": 0.5541328152596255,
"grad_norm": 2.234375,
"learning_rate": 0.0004975524833618548,
"loss": 6.0321,
"mean_token_accuracy": 0.1586230754852295,
"num_tokens": 11710932.0,
"step": 6275
},
{
"entropy": 6.186596059799195,
"epoch": 0.5545743553514659,
"grad_norm": 2.921875,
"learning_rate": 0.000497547848892181,
"loss": 6.0478,
"mean_token_accuracy": 0.15520632714033128,
"num_tokens": 11719953.0,
"step": 6280
},
{
"entropy": 6.210802841186523,
"epoch": 0.5550158954433062,
"grad_norm": 2.140625,
"learning_rate": 0.0004975432100629215,
"loss": 5.9519,
"mean_token_accuracy": 0.15992908477783202,
"num_tokens": 11728706.0,
"step": 6285
},
{
"entropy": 6.220610618591309,
"epoch": 0.5554574355351466,
"grad_norm": 3.578125,
"learning_rate": 0.000497538566874167,
"loss": 6.1439,
"mean_token_accuracy": 0.14255456030368804,
"num_tokens": 11738537.0,
"step": 6290
},
{
"entropy": 6.201089715957641,
"epoch": 0.555898975626987,
"grad_norm": 3.53125,
"learning_rate": 0.0004975339193260084,
"loss": 5.9668,
"mean_token_accuracy": 0.1601237177848816,
"num_tokens": 11747503.0,
"step": 6295
},
{
"entropy": 6.213198041915893,
"epoch": 0.5563405157188273,
"grad_norm": 2.0,
"learning_rate": 0.0004975292674185371,
"loss": 6.0626,
"mean_token_accuracy": 0.15619527399539948,
"num_tokens": 11756501.0,
"step": 6300
},
{
"entropy": 6.191322374343872,
"epoch": 0.5567820558106676,
"grad_norm": 2.234375,
"learning_rate": 0.0004975246111518439,
"loss": 6.0361,
"mean_token_accuracy": 0.14940138384699822,
"num_tokens": 11765483.0,
"step": 6305
},
{
"entropy": 6.269068384170533,
"epoch": 0.5572235959025079,
"grad_norm": 1.9765625,
"learning_rate": 0.0004975199505260202,
"loss": 6.1656,
"mean_token_accuracy": 0.13972411677241325,
"num_tokens": 11774941.0,
"step": 6310
},
{
"entropy": 6.2427021026611325,
"epoch": 0.5576651359943483,
"grad_norm": 2.015625,
"learning_rate": 0.0004975152855411571,
"loss": 6.1377,
"mean_token_accuracy": 0.14668529033660888,
"num_tokens": 11785080.0,
"step": 6315
},
{
"entropy": 6.262989568710327,
"epoch": 0.5581066760861886,
"grad_norm": 2.125,
"learning_rate": 0.0004975106161973462,
"loss": 6.0218,
"mean_token_accuracy": 0.15202814787626268,
"num_tokens": 11793933.0,
"step": 6320
},
{
"entropy": 6.200152206420898,
"epoch": 0.558548216178029,
"grad_norm": 2.75,
"learning_rate": 0.000497505942494679,
"loss": 6.0765,
"mean_token_accuracy": 0.15423234254121782,
"num_tokens": 11803592.0,
"step": 6325
},
{
"entropy": 6.144359588623047,
"epoch": 0.5589897562698694,
"grad_norm": 2.609375,
"learning_rate": 0.0004975012644332467,
"loss": 5.9658,
"mean_token_accuracy": 0.16332813650369643,
"num_tokens": 11812397.0,
"step": 6330
},
{
"entropy": 6.213898658752441,
"epoch": 0.5594312963617096,
"grad_norm": 2.109375,
"learning_rate": 0.0004974965820131413,
"loss": 6.0918,
"mean_token_accuracy": 0.15081132724881172,
"num_tokens": 11821734.0,
"step": 6335
},
{
"entropy": 6.154282140731811,
"epoch": 0.55987283645355,
"grad_norm": 3.46875,
"learning_rate": 0.0004974918952344544,
"loss": 5.995,
"mean_token_accuracy": 0.15411488115787506,
"num_tokens": 11832107.0,
"step": 6340
},
{
"entropy": 6.172497034072876,
"epoch": 0.5603143765453903,
"grad_norm": 2.03125,
"learning_rate": 0.0004974872040972777,
"loss": 6.003,
"mean_token_accuracy": 0.15274750143289567,
"num_tokens": 11841983.0,
"step": 6345
},
{
"entropy": 6.1340217113494875,
"epoch": 0.5607559166372307,
"grad_norm": 1.9921875,
"learning_rate": 0.0004974825086017033,
"loss": 5.9912,
"mean_token_accuracy": 0.1592399835586548,
"num_tokens": 11851836.0,
"step": 6350
},
{
"entropy": 6.246949529647827,
"epoch": 0.561197456729071,
"grad_norm": 2.59375,
"learning_rate": 0.000497477808747823,
"loss": 6.0429,
"mean_token_accuracy": 0.15607572942972184,
"num_tokens": 11861109.0,
"step": 6355
},
{
"entropy": 6.239613485336304,
"epoch": 0.5616389968209113,
"grad_norm": 1.59375,
"learning_rate": 0.0004974731045357292,
"loss": 6.1315,
"mean_token_accuracy": 0.14992361664772033,
"num_tokens": 11871015.0,
"step": 6360
},
{
"entropy": 6.148267030715942,
"epoch": 0.5620805369127517,
"grad_norm": 3.78125,
"learning_rate": 0.0004974683959655136,
"loss": 6.0401,
"mean_token_accuracy": 0.15593761950731277,
"num_tokens": 11881306.0,
"step": 6365
},
{
"entropy": 6.214121961593628,
"epoch": 0.562522077004592,
"grad_norm": 1.765625,
"learning_rate": 0.0004974636830372686,
"loss": 5.9581,
"mean_token_accuracy": 0.16205299645662308,
"num_tokens": 11890251.0,
"step": 6370
},
{
"entropy": 6.193024778366089,
"epoch": 0.5629636170964324,
"grad_norm": 1.59375,
"learning_rate": 0.0004974589657510866,
"loss": 6.0825,
"mean_token_accuracy": 0.14803064465522767,
"num_tokens": 11899662.0,
"step": 6375
},
{
"entropy": 6.168805980682373,
"epoch": 0.5634051571882727,
"grad_norm": 1.9375,
"learning_rate": 0.0004974542441070601,
"loss": 6.0345,
"mean_token_accuracy": 0.15523566752672197,
"num_tokens": 11908699.0,
"step": 6380
},
{
"entropy": 6.189884614944458,
"epoch": 0.563846697280113,
"grad_norm": 2.3125,
"learning_rate": 0.0004974495181052814,
"loss": 6.0269,
"mean_token_accuracy": 0.15429562777280809,
"num_tokens": 11916637.0,
"step": 6385
},
{
"entropy": 6.201843118667602,
"epoch": 0.5642882373719533,
"grad_norm": 2.421875,
"learning_rate": 0.0004974447877458433,
"loss": 6.0881,
"mean_token_accuracy": 0.15210264176130295,
"num_tokens": 11926063.0,
"step": 6390
},
{
"entropy": 6.176416444778442,
"epoch": 0.5647297774637937,
"grad_norm": 2.484375,
"learning_rate": 0.0004974400530288381,
"loss": 5.9706,
"mean_token_accuracy": 0.15895548462867737,
"num_tokens": 11934861.0,
"step": 6395
},
{
"entropy": 6.286151695251465,
"epoch": 0.5651713175556341,
"grad_norm": 1.7578125,
"learning_rate": 0.0004974353139543589,
"loss": 6.0918,
"mean_token_accuracy": 0.14939165115356445,
"num_tokens": 11944403.0,
"step": 6400
},
{
"entropy": 6.264640760421753,
"epoch": 0.5656128576474744,
"grad_norm": 1.953125,
"learning_rate": 0.0004974305705224983,
"loss": 6.1495,
"mean_token_accuracy": 0.1527331218123436,
"num_tokens": 11953306.0,
"step": 6405
},
{
"entropy": 6.199301099777221,
"epoch": 0.5660543977393148,
"grad_norm": 1.9375,
"learning_rate": 0.0004974258227333493,
"loss": 6.0376,
"mean_token_accuracy": 0.155905519425869,
"num_tokens": 11962727.0,
"step": 6410
},
{
"entropy": 6.2386260509490965,
"epoch": 0.566495937831155,
"grad_norm": 1.8828125,
"learning_rate": 0.0004974210705870052,
"loss": 6.191,
"mean_token_accuracy": 0.14767182171344756,
"num_tokens": 11972375.0,
"step": 6415
},
{
"entropy": 6.132161664962768,
"epoch": 0.5669374779229954,
"grad_norm": 1.578125,
"learning_rate": 0.0004974163140835586,
"loss": 5.9688,
"mean_token_accuracy": 0.15154811069369317,
"num_tokens": 11981989.0,
"step": 6420
},
{
"entropy": 6.206036567687988,
"epoch": 0.5673790180148357,
"grad_norm": 1.7890625,
"learning_rate": 0.0004974115532231029,
"loss": 6.0272,
"mean_token_accuracy": 0.1478888511657715,
"num_tokens": 11990865.0,
"step": 6425
},
{
"entropy": 6.1785540103912355,
"epoch": 0.5678205581066761,
"grad_norm": 1.4296875,
"learning_rate": 0.0004974067880057315,
"loss": 6.0118,
"mean_token_accuracy": 0.16050802171230316,
"num_tokens": 12000697.0,
"step": 6430
},
{
"entropy": 6.123645830154419,
"epoch": 0.5682620981985165,
"grad_norm": 1.53125,
"learning_rate": 0.0004974020184315375,
"loss": 6.0857,
"mean_token_accuracy": 0.15496583580970763,
"num_tokens": 12010560.0,
"step": 6435
},
{
"entropy": 6.261683130264283,
"epoch": 0.5687036382903567,
"grad_norm": 1.625,
"learning_rate": 0.0004973972445006144,
"loss": 6.123,
"mean_token_accuracy": 0.15426487401127814,
"num_tokens": 12020760.0,
"step": 6440
},
{
"entropy": 6.10278959274292,
"epoch": 0.5691451783821971,
"grad_norm": 1.6015625,
"learning_rate": 0.0004973924662130559,
"loss": 5.9569,
"mean_token_accuracy": 0.1542418286204338,
"num_tokens": 12030467.0,
"step": 6445
},
{
"entropy": 6.166108751296997,
"epoch": 0.5695867184740374,
"grad_norm": 1.7890625,
"learning_rate": 0.0004973876835689554,
"loss": 6.069,
"mean_token_accuracy": 0.156872521340847,
"num_tokens": 12039897.0,
"step": 6450
},
{
"entropy": 6.27096848487854,
"epoch": 0.5700282585658778,
"grad_norm": 4.875,
"learning_rate": 0.0004973828965684066,
"loss": 6.0884,
"mean_token_accuracy": 0.1475502520799637,
"num_tokens": 12048997.0,
"step": 6455
},
{
"entropy": 6.220898103713989,
"epoch": 0.5704697986577181,
"grad_norm": 1.9453125,
"learning_rate": 0.0004973781052115035,
"loss": 5.9901,
"mean_token_accuracy": 0.16035318821668626,
"num_tokens": 12057493.0,
"step": 6460
},
{
"entropy": 6.075660610198975,
"epoch": 0.5709113387495585,
"grad_norm": 2.015625,
"learning_rate": 0.0004973733094983396,
"loss": 6.0659,
"mean_token_accuracy": 0.15576789081096648,
"num_tokens": 12066329.0,
"step": 6465
},
{
"entropy": 6.112877702713012,
"epoch": 0.5713528788413988,
"grad_norm": 2.015625,
"learning_rate": 0.0004973685094290092,
"loss": 6.0907,
"mean_token_accuracy": 0.15044785290956497,
"num_tokens": 12076022.0,
"step": 6470
},
{
"entropy": 6.243810939788818,
"epoch": 0.5717944189332391,
"grad_norm": 1.90625,
"learning_rate": 0.000497363705003606,
"loss": 6.0335,
"mean_token_accuracy": 0.14949652031064034,
"num_tokens": 12085750.0,
"step": 6475
},
{
"entropy": 6.25089545249939,
"epoch": 0.5722359590250795,
"grad_norm": 1.7734375,
"learning_rate": 0.0004973588962222244,
"loss": 6.0547,
"mean_token_accuracy": 0.1555928558111191,
"num_tokens": 12094935.0,
"step": 6480
},
{
"entropy": 6.165074634552002,
"epoch": 0.5726774991169198,
"grad_norm": 2.015625,
"learning_rate": 0.0004973540830849585,
"loss": 5.9943,
"mean_token_accuracy": 0.15322138816118241,
"num_tokens": 12104970.0,
"step": 6485
},
{
"entropy": 6.203184366226196,
"epoch": 0.5731190392087602,
"grad_norm": 2.296875,
"learning_rate": 0.0004973492655919025,
"loss": 6.1188,
"mean_token_accuracy": 0.14760904386639595,
"num_tokens": 12116195.0,
"step": 6490
},
{
"entropy": 6.294361782073975,
"epoch": 0.5735605793006004,
"grad_norm": 2.546875,
"learning_rate": 0.0004973444437431508,
"loss": 6.0475,
"mean_token_accuracy": 0.15356907099485398,
"num_tokens": 12125485.0,
"step": 6495
},
{
"entropy": 6.193444156646729,
"epoch": 0.5740021193924408,
"grad_norm": 1.65625,
"learning_rate": 0.0004973396175387981,
"loss": 6.056,
"mean_token_accuracy": 0.15648747980594635,
"num_tokens": 12135474.0,
"step": 6500
},
{
"entropy": 6.191966485977173,
"epoch": 0.5744436594842812,
"grad_norm": 2.015625,
"learning_rate": 0.0004973347869789385,
"loss": 6.0901,
"mean_token_accuracy": 0.1518266037106514,
"num_tokens": 12144945.0,
"step": 6505
},
{
"entropy": 6.252193546295166,
"epoch": 0.5748851995761215,
"grad_norm": 2.109375,
"learning_rate": 0.0004973299520636671,
"loss": 6.0382,
"mean_token_accuracy": 0.15668775588274003,
"num_tokens": 12154893.0,
"step": 6510
},
{
"entropy": 6.2492657661437985,
"epoch": 0.5753267396679619,
"grad_norm": 2.09375,
"learning_rate": 0.0004973251127930782,
"loss": 6.1126,
"mean_token_accuracy": 0.1518278144299984,
"num_tokens": 12164047.0,
"step": 6515
},
{
"entropy": 6.247848701477051,
"epoch": 0.5757682797598022,
"grad_norm": 1.921875,
"learning_rate": 0.0004973202691672669,
"loss": 6.1037,
"mean_token_accuracy": 0.15016882196068765,
"num_tokens": 12172965.0,
"step": 6520
},
{
"entropy": 6.226498222351074,
"epoch": 0.5762098198516425,
"grad_norm": 2.46875,
"learning_rate": 0.0004973154211863279,
"loss": 6.122,
"mean_token_accuracy": 0.14945205301046371,
"num_tokens": 12183534.0,
"step": 6525
},
{
"entropy": 6.1939177989959715,
"epoch": 0.5766513599434828,
"grad_norm": 1.921875,
"learning_rate": 0.0004973105688503563,
"loss": 6.0807,
"mean_token_accuracy": 0.15398238748311996,
"num_tokens": 12194370.0,
"step": 6530
},
{
"entropy": 6.242078161239624,
"epoch": 0.5770929000353232,
"grad_norm": 4.65625,
"learning_rate": 0.000497305712159447,
"loss": 6.0691,
"mean_token_accuracy": 0.15035768449306489,
"num_tokens": 12203765.0,
"step": 6535
},
{
"entropy": 6.2378651142120365,
"epoch": 0.5775344401271636,
"grad_norm": 2.140625,
"learning_rate": 0.0004973008511136954,
"loss": 6.0373,
"mean_token_accuracy": 0.15557296574115753,
"num_tokens": 12212889.0,
"step": 6540
},
{
"entropy": 6.177788972854614,
"epoch": 0.5779759802190039,
"grad_norm": 1.7578125,
"learning_rate": 0.0004972959857131963,
"loss": 6.1085,
"mean_token_accuracy": 0.14831465035676955,
"num_tokens": 12222055.0,
"step": 6545
},
{
"entropy": 6.297669792175293,
"epoch": 0.5784175203108443,
"grad_norm": 1.9140625,
"learning_rate": 0.0004972911159580454,
"loss": 6.102,
"mean_token_accuracy": 0.14912044182419776,
"num_tokens": 12232092.0,
"step": 6550
},
{
"entropy": 6.292926406860351,
"epoch": 0.5788590604026845,
"grad_norm": 1.84375,
"learning_rate": 0.000497286241848338,
"loss": 6.1226,
"mean_token_accuracy": 0.14944964945316314,
"num_tokens": 12241411.0,
"step": 6555
},
{
"entropy": 6.200898456573486,
"epoch": 0.5793006004945249,
"grad_norm": 2.125,
"learning_rate": 0.0004972813633841696,
"loss": 5.9886,
"mean_token_accuracy": 0.1560185208916664,
"num_tokens": 12249735.0,
"step": 6560
},
{
"entropy": 6.168171453475952,
"epoch": 0.5797421405863652,
"grad_norm": 1.953125,
"learning_rate": 0.0004972764805656355,
"loss": 6.0127,
"mean_token_accuracy": 0.1622329831123352,
"num_tokens": 12259132.0,
"step": 6565
},
{
"entropy": 6.175434255599976,
"epoch": 0.5801836806782056,
"grad_norm": 2.3125,
"learning_rate": 0.0004972715933928318,
"loss": 6.0896,
"mean_token_accuracy": 0.16034998446702958,
"num_tokens": 12269401.0,
"step": 6570
},
{
"entropy": 6.23064079284668,
"epoch": 0.580625220770046,
"grad_norm": 1.984375,
"learning_rate": 0.0004972667018658539,
"loss": 6.109,
"mean_token_accuracy": 0.14848504364490508,
"num_tokens": 12279163.0,
"step": 6575
},
{
"entropy": 6.145978307723999,
"epoch": 0.5810667608618862,
"grad_norm": 2.859375,
"learning_rate": 0.0004972618059847976,
"loss": 6.0028,
"mean_token_accuracy": 0.15803629159927368,
"num_tokens": 12287942.0,
"step": 6580
},
{
"entropy": 6.1623132705688475,
"epoch": 0.5815083009537266,
"grad_norm": 2.125,
"learning_rate": 0.0004972569057497591,
"loss": 5.9963,
"mean_token_accuracy": 0.15548112392425537,
"num_tokens": 12296717.0,
"step": 6585
},
{
"entropy": 6.260863351821899,
"epoch": 0.5819498410455669,
"grad_norm": 2.15625,
"learning_rate": 0.0004972520011608341,
"loss": 5.9805,
"mean_token_accuracy": 0.16117053180933,
"num_tokens": 12305983.0,
"step": 6590
},
{
"entropy": 6.097669696807861,
"epoch": 0.5823913811374073,
"grad_norm": 6.4375,
"learning_rate": 0.0004972470922181189,
"loss": 6.0512,
"mean_token_accuracy": 0.1469077378511429,
"num_tokens": 12315338.0,
"step": 6595
},
{
"entropy": 6.187917041778564,
"epoch": 0.5828329212292476,
"grad_norm": 2.3125,
"learning_rate": 0.0004972421789217094,
"loss": 6.1392,
"mean_token_accuracy": 0.14520934969186783,
"num_tokens": 12324828.0,
"step": 6600
},
{
"entropy": 6.350688695907593,
"epoch": 0.583274461321088,
"grad_norm": 2.234375,
"learning_rate": 0.0004972372612717022,
"loss": 6.0047,
"mean_token_accuracy": 0.16197529584169387,
"num_tokens": 12332844.0,
"step": 6605
},
{
"entropy": 6.276282072067261,
"epoch": 0.5837160014129283,
"grad_norm": 6.65625,
"learning_rate": 0.0004972323392681934,
"loss": 6.031,
"mean_token_accuracy": 0.15629135370254515,
"num_tokens": 12342062.0,
"step": 6610
},
{
"entropy": 6.184615802764893,
"epoch": 0.5841575415047686,
"grad_norm": 3.125,
"learning_rate": 0.0004972274129112794,
"loss": 6.1162,
"mean_token_accuracy": 0.14776388108730315,
"num_tokens": 12352071.0,
"step": 6615
},
{
"entropy": 6.271507930755615,
"epoch": 0.584599081596609,
"grad_norm": 2.640625,
"learning_rate": 0.0004972224822010567,
"loss": 6.1749,
"mean_token_accuracy": 0.1432945176959038,
"num_tokens": 12362025.0,
"step": 6620
},
{
"entropy": 6.242451143264771,
"epoch": 0.5850406216884493,
"grad_norm": 1.6953125,
"learning_rate": 0.0004972175471376222,
"loss": 6.1652,
"mean_token_accuracy": 0.1467423915863037,
"num_tokens": 12371547.0,
"step": 6625
},
{
"entropy": 6.290982723236084,
"epoch": 0.5854821617802897,
"grad_norm": 2.09375,
"learning_rate": 0.0004972126077210722,
"loss": 6.0833,
"mean_token_accuracy": 0.14927616715431213,
"num_tokens": 12381385.0,
"step": 6630
},
{
"entropy": 6.2902881622314455,
"epoch": 0.5859237018721299,
"grad_norm": 2.03125,
"learning_rate": 0.0004972076639515035,
"loss": 6.1217,
"mean_token_accuracy": 0.1538809731602669,
"num_tokens": 12391302.0,
"step": 6635
},
{
"entropy": 6.085922527313232,
"epoch": 0.5863652419639703,
"grad_norm": 1.875,
"learning_rate": 0.0004972027158290131,
"loss": 6.0164,
"mean_token_accuracy": 0.15934976935386658,
"num_tokens": 12400388.0,
"step": 6640
},
{
"entropy": 6.170651435852051,
"epoch": 0.5868067820558107,
"grad_norm": 2.8125,
"learning_rate": 0.000497197763353698,
"loss": 6.0939,
"mean_token_accuracy": 0.14469650983810425,
"num_tokens": 12409695.0,
"step": 6645
},
{
"entropy": 6.278474140167236,
"epoch": 0.587248322147651,
"grad_norm": 1.75,
"learning_rate": 0.000497192806525655,
"loss": 5.9556,
"mean_token_accuracy": 0.16218124628067015,
"num_tokens": 12418728.0,
"step": 6650
},
{
"entropy": 6.220705509185791,
"epoch": 0.5876898622394914,
"grad_norm": 1.7265625,
"learning_rate": 0.0004971878453449811,
"loss": 6.1291,
"mean_token_accuracy": 0.14868279695510864,
"num_tokens": 12428072.0,
"step": 6655
},
{
"entropy": 6.202286434173584,
"epoch": 0.5881314023313317,
"grad_norm": 3.59375,
"learning_rate": 0.000497182879811774,
"loss": 6.0501,
"mean_token_accuracy": 0.15819858834147454,
"num_tokens": 12436624.0,
"step": 6660
},
{
"entropy": 6.177549600601196,
"epoch": 0.588572942423172,
"grad_norm": 2.234375,
"learning_rate": 0.0004971779099261304,
"loss": 6.0603,
"mean_token_accuracy": 0.14843887835741043,
"num_tokens": 12446370.0,
"step": 6665
},
{
"entropy": 6.236004447937011,
"epoch": 0.5890144825150123,
"grad_norm": 2.0,
"learning_rate": 0.000497172935688148,
"loss": 6.1136,
"mean_token_accuracy": 0.15249148458242417,
"num_tokens": 12456705.0,
"step": 6670
},
{
"entropy": 6.248232030868531,
"epoch": 0.5894560226068527,
"grad_norm": 2.8125,
"learning_rate": 0.0004971679570979242,
"loss": 6.1159,
"mean_token_accuracy": 0.1509490966796875,
"num_tokens": 12466150.0,
"step": 6675
},
{
"entropy": 6.2066127300262455,
"epoch": 0.5898975626986931,
"grad_norm": 2.578125,
"learning_rate": 0.0004971629741555565,
"loss": 5.9648,
"mean_token_accuracy": 0.15754401981830596,
"num_tokens": 12475051.0,
"step": 6680
},
{
"entropy": 6.199983835220337,
"epoch": 0.5903391027905334,
"grad_norm": 2.265625,
"learning_rate": 0.0004971579868611423,
"loss": 6.0543,
"mean_token_accuracy": 0.15531396567821504,
"num_tokens": 12485427.0,
"step": 6685
},
{
"entropy": 6.144886445999146,
"epoch": 0.5907806428823738,
"grad_norm": 2.296875,
"learning_rate": 0.0004971529952147797,
"loss": 5.9991,
"mean_token_accuracy": 0.1566150113940239,
"num_tokens": 12494489.0,
"step": 6690
},
{
"entropy": 6.212142562866211,
"epoch": 0.591222182974214,
"grad_norm": 1.7109375,
"learning_rate": 0.000497147999216566,
"loss": 6.0259,
"mean_token_accuracy": 0.15383399724960328,
"num_tokens": 12503656.0,
"step": 6695
},
{
"entropy": 6.257586860656739,
"epoch": 0.5916637230660544,
"grad_norm": 2.421875,
"learning_rate": 0.0004971429988665996,
"loss": 6.0541,
"mean_token_accuracy": 0.14916461184620858,
"num_tokens": 12512940.0,
"step": 6700
},
{
"entropy": 6.21803913116455,
"epoch": 0.5921052631578947,
"grad_norm": 2.0,
"learning_rate": 0.000497137994164978,
"loss": 6.0141,
"mean_token_accuracy": 0.15520734190940857,
"num_tokens": 12523186.0,
"step": 6705
},
{
"entropy": 6.175590991973877,
"epoch": 0.5925468032497351,
"grad_norm": 1.5703125,
"learning_rate": 0.0004971329851117996,
"loss": 6.0537,
"mean_token_accuracy": 0.15011201053857803,
"num_tokens": 12533018.0,
"step": 6710
},
{
"entropy": 6.257619857788086,
"epoch": 0.5929883433415755,
"grad_norm": 2.03125,
"learning_rate": 0.0004971279717071622,
"loss": 6.115,
"mean_token_accuracy": 0.15560168474912645,
"num_tokens": 12542889.0,
"step": 6715
},
{
"entropy": 6.295772314071655,
"epoch": 0.5934298834334157,
"grad_norm": 1.6796875,
"learning_rate": 0.0004971229539511643,
"loss": 6.1275,
"mean_token_accuracy": 0.14035015031695366,
"num_tokens": 12553625.0,
"step": 6720
},
{
"entropy": 6.150123023986817,
"epoch": 0.5938714235252561,
"grad_norm": 1.703125,
"learning_rate": 0.000497117931843904,
"loss": 6.0409,
"mean_token_accuracy": 0.15282395333051682,
"num_tokens": 12563012.0,
"step": 6725
},
{
"entropy": 6.2669105052948,
"epoch": 0.5943129636170964,
"grad_norm": 2.796875,
"learning_rate": 0.0004971129053854797,
"loss": 6.1758,
"mean_token_accuracy": 0.14357056468725204,
"num_tokens": 12572892.0,
"step": 6730
},
{
"entropy": 6.2501020431518555,
"epoch": 0.5947545037089368,
"grad_norm": 2.28125,
"learning_rate": 0.00049710787457599,
"loss": 6.0011,
"mean_token_accuracy": 0.16138584166765213,
"num_tokens": 12581550.0,
"step": 6735
},
{
"entropy": 6.204801893234253,
"epoch": 0.5951960438007771,
"grad_norm": 2.15625,
"learning_rate": 0.0004971028394155332,
"loss": 6.0926,
"mean_token_accuracy": 0.15026257038116456,
"num_tokens": 12590599.0,
"step": 6740
},
{
"entropy": 6.2605963230133055,
"epoch": 0.5956375838926175,
"grad_norm": 3.375,
"learning_rate": 0.0004970977999042082,
"loss": 6.0422,
"mean_token_accuracy": 0.15356017649173737,
"num_tokens": 12599497.0,
"step": 6745
},
{
"entropy": 6.165054607391357,
"epoch": 0.5960791239844578,
"grad_norm": 1.984375,
"learning_rate": 0.0004970927560421137,
"loss": 6.0937,
"mean_token_accuracy": 0.1541163817048073,
"num_tokens": 12608273.0,
"step": 6750
},
{
"entropy": 6.140692090988159,
"epoch": 0.5965206640762981,
"grad_norm": 2.578125,
"learning_rate": 0.0004970877078293483,
"loss": 5.9893,
"mean_token_accuracy": 0.1589522145688534,
"num_tokens": 12617287.0,
"step": 6755
},
{
"entropy": 6.239122676849365,
"epoch": 0.5969622041681385,
"grad_norm": 2.046875,
"learning_rate": 0.0004970826552660111,
"loss": 6.0656,
"mean_token_accuracy": 0.15358479097485542,
"num_tokens": 12626874.0,
"step": 6760
},
{
"entropy": 6.191449689865112,
"epoch": 0.5974037442599788,
"grad_norm": 2.0625,
"learning_rate": 0.0004970775983522009,
"loss": 6.0956,
"mean_token_accuracy": 0.15042449682950973,
"num_tokens": 12635218.0,
"step": 6765
},
{
"entropy": 6.20980019569397,
"epoch": 0.5978452843518192,
"grad_norm": 2.390625,
"learning_rate": 0.0004970725370880168,
"loss": 6.0466,
"mean_token_accuracy": 0.15192867666482926,
"num_tokens": 12644395.0,
"step": 6770
},
{
"entropy": 6.27781343460083,
"epoch": 0.5982868244436594,
"grad_norm": 2.15625,
"learning_rate": 0.0004970674714735581,
"loss": 6.0915,
"mean_token_accuracy": 0.1551320508122444,
"num_tokens": 12654540.0,
"step": 6775
},
{
"entropy": 6.217710781097412,
"epoch": 0.5987283645354998,
"grad_norm": 2.171875,
"learning_rate": 0.0004970624015089239,
"loss": 5.9557,
"mean_token_accuracy": 0.16181351020932197,
"num_tokens": 12663546.0,
"step": 6780
},
{
"entropy": 6.087097930908203,
"epoch": 0.5991699046273402,
"grad_norm": 2.171875,
"learning_rate": 0.0004970573271942135,
"loss": 6.0446,
"mean_token_accuracy": 0.1569458231329918,
"num_tokens": 12672353.0,
"step": 6785
},
{
"entropy": 6.069739484786988,
"epoch": 0.5996114447191805,
"grad_norm": 2.953125,
"learning_rate": 0.0004970522485295265,
"loss": 5.9354,
"mean_token_accuracy": 0.16273632645606995,
"num_tokens": 12680833.0,
"step": 6790
},
{
"entropy": 6.170738983154297,
"epoch": 0.6000529848110209,
"grad_norm": 1.7421875,
"learning_rate": 0.0004970471655149621,
"loss": 5.9042,
"mean_token_accuracy": 0.16110148131847382,
"num_tokens": 12690033.0,
"step": 6795
},
{
"entropy": 6.103061532974243,
"epoch": 0.6004945249028611,
"grad_norm": 2.59375,
"learning_rate": 0.00049704207815062,
"loss": 5.99,
"mean_token_accuracy": 0.1616707846522331,
"num_tokens": 12700127.0,
"step": 6800
},
{
"entropy": 6.221381616592407,
"epoch": 0.6009360649947015,
"grad_norm": 2.015625,
"learning_rate": 0.0004970369864366,
"loss": 6.0294,
"mean_token_accuracy": 0.1497489720582962,
"num_tokens": 12709803.0,
"step": 6805
},
{
"entropy": 6.2039313316345215,
"epoch": 0.6013776050865418,
"grad_norm": 2.09375,
"learning_rate": 0.0004970318903730017,
"loss": 6.0089,
"mean_token_accuracy": 0.15192246660590172,
"num_tokens": 12718876.0,
"step": 6810
},
{
"entropy": 6.282535219192505,
"epoch": 0.6018191451783822,
"grad_norm": 1.8828125,
"learning_rate": 0.0004970267899599249,
"loss": 6.1185,
"mean_token_accuracy": 0.1507984146475792,
"num_tokens": 12728745.0,
"step": 6815
},
{
"entropy": 6.2520589351654055,
"epoch": 0.6022606852702226,
"grad_norm": 2.453125,
"learning_rate": 0.0004970216851974695,
"loss": 6.1066,
"mean_token_accuracy": 0.14358121454715728,
"num_tokens": 12738764.0,
"step": 6820
},
{
"entropy": 6.153601789474488,
"epoch": 0.6027022253620629,
"grad_norm": 2.78125,
"learning_rate": 0.0004970165760857356,
"loss": 6.0483,
"mean_token_accuracy": 0.1471211776137352,
"num_tokens": 12747888.0,
"step": 6825
},
{
"entropy": 6.2664146900177,
"epoch": 0.6031437654539032,
"grad_norm": 2.046875,
"learning_rate": 0.0004970114626248232,
"loss": 6.0709,
"mean_token_accuracy": 0.15116212218999864,
"num_tokens": 12757763.0,
"step": 6830
},
{
"entropy": 6.225366640090942,
"epoch": 0.6035853055457435,
"grad_norm": 1.9140625,
"learning_rate": 0.0004970063448148326,
"loss": 6.108,
"mean_token_accuracy": 0.14670519903302193,
"num_tokens": 12767924.0,
"step": 6835
},
{
"entropy": 6.247302484512329,
"epoch": 0.6040268456375839,
"grad_norm": 2.53125,
"learning_rate": 0.0004970012226558639,
"loss": 6.1148,
"mean_token_accuracy": 0.14938763603568078,
"num_tokens": 12777140.0,
"step": 6840
},
{
"entropy": 6.2420226573944095,
"epoch": 0.6044683857294242,
"grad_norm": 2.125,
"learning_rate": 0.0004969960961480176,
"loss": 6.0861,
"mean_token_accuracy": 0.1501963809132576,
"num_tokens": 12786731.0,
"step": 6845
},
{
"entropy": 6.213519048690796,
"epoch": 0.6049099258212646,
"grad_norm": 2.015625,
"learning_rate": 0.0004969909652913939,
"loss": 6.0218,
"mean_token_accuracy": 0.15606847256422043,
"num_tokens": 12796839.0,
"step": 6850
},
{
"entropy": 6.237181377410889,
"epoch": 0.605351465913105,
"grad_norm": 1.8671875,
"learning_rate": 0.0004969858300860935,
"loss": 6.0995,
"mean_token_accuracy": 0.14979733973741532,
"num_tokens": 12805944.0,
"step": 6855
},
{
"entropy": 6.167507648468018,
"epoch": 0.6057930060049452,
"grad_norm": 2.171875,
"learning_rate": 0.0004969806905322169,
"loss": 6.0561,
"mean_token_accuracy": 0.15602336823940277,
"num_tokens": 12814692.0,
"step": 6860
},
{
"entropy": 6.131442928314209,
"epoch": 0.6062345460967856,
"grad_norm": 2.296875,
"learning_rate": 0.0004969755466298649,
"loss": 6.0132,
"mean_token_accuracy": 0.15122820138931276,
"num_tokens": 12824506.0,
"step": 6865
},
{
"entropy": 6.236468505859375,
"epoch": 0.6066760861886259,
"grad_norm": 1.8125,
"learning_rate": 0.0004969703983791382,
"loss": 6.0776,
"mean_token_accuracy": 0.1508278429508209,
"num_tokens": 12835157.0,
"step": 6870
},
{
"entropy": 6.225825595855713,
"epoch": 0.6071176262804663,
"grad_norm": 1.796875,
"learning_rate": 0.0004969652457801376,
"loss": 5.9857,
"mean_token_accuracy": 0.15083080306649208,
"num_tokens": 12844281.0,
"step": 6875
},
{
"entropy": 6.2883728504180905,
"epoch": 0.6075591663723066,
"grad_norm": 2.15625,
"learning_rate": 0.0004969600888329641,
"loss": 6.0412,
"mean_token_accuracy": 0.1524555817246437,
"num_tokens": 12854486.0,
"step": 6880
},
{
"entropy": 6.211116743087769,
"epoch": 0.608000706464147,
"grad_norm": 2.953125,
"learning_rate": 0.0004969549275377186,
"loss": 6.0277,
"mean_token_accuracy": 0.14935416579246522,
"num_tokens": 12863574.0,
"step": 6885
},
{
"entropy": 6.210080862045288,
"epoch": 0.6084422465559873,
"grad_norm": 2.359375,
"learning_rate": 0.0004969497618945024,
"loss": 5.9959,
"mean_token_accuracy": 0.1540638104081154,
"num_tokens": 12872450.0,
"step": 6890
},
{
"entropy": 6.191243648529053,
"epoch": 0.6088837866478276,
"grad_norm": 3.203125,
"learning_rate": 0.0004969445919034165,
"loss": 5.9611,
"mean_token_accuracy": 0.1621923491358757,
"num_tokens": 12881299.0,
"step": 6895
},
{
"entropy": 6.115060424804687,
"epoch": 0.609325326739668,
"grad_norm": 1.7109375,
"learning_rate": 0.0004969394175645623,
"loss": 5.9291,
"mean_token_accuracy": 0.15979383438825606,
"num_tokens": 12889943.0,
"step": 6900
},
{
"entropy": 6.155762672424316,
"epoch": 0.6097668668315083,
"grad_norm": 1.8359375,
"learning_rate": 0.0004969342388780411,
"loss": 6.0358,
"mean_token_accuracy": 0.1543547108769417,
"num_tokens": 12899497.0,
"step": 6905
},
{
"entropy": 6.21222677230835,
"epoch": 0.6102084069233487,
"grad_norm": 1.8359375,
"learning_rate": 0.0004969290558439546,
"loss": 6.0083,
"mean_token_accuracy": 0.15624455213546753,
"num_tokens": 12908677.0,
"step": 6910
},
{
"entropy": 6.203832674026489,
"epoch": 0.6106499470151889,
"grad_norm": 2.265625,
"learning_rate": 0.0004969238684624038,
"loss": 6.1268,
"mean_token_accuracy": 0.14566057920455933,
"num_tokens": 12918468.0,
"step": 6915
},
{
"entropy": 6.166177558898926,
"epoch": 0.6110914871070293,
"grad_norm": 1.8046875,
"learning_rate": 0.0004969186767334908,
"loss": 6.0247,
"mean_token_accuracy": 0.15501216650009156,
"num_tokens": 12928527.0,
"step": 6920
},
{
"entropy": 6.192750883102417,
"epoch": 0.6115330271988697,
"grad_norm": 2.0625,
"learning_rate": 0.0004969134806573172,
"loss": 5.9829,
"mean_token_accuracy": 0.1576339840888977,
"num_tokens": 12937021.0,
"step": 6925
},
{
"entropy": 6.096978569030762,
"epoch": 0.61197456729071,
"grad_norm": 1.765625,
"learning_rate": 0.0004969082802339846,
"loss": 5.9439,
"mean_token_accuracy": 0.1602706491947174,
"num_tokens": 12945570.0,
"step": 6930
},
{
"entropy": 6.146313714981079,
"epoch": 0.6124161073825504,
"grad_norm": 2.015625,
"learning_rate": 0.000496903075463595,
"loss": 6.0759,
"mean_token_accuracy": 0.15233781188726425,
"num_tokens": 12954594.0,
"step": 6935
},
{
"entropy": 6.1925209045410154,
"epoch": 0.6128576474743906,
"grad_norm": 1.609375,
"learning_rate": 0.0004968978663462504,
"loss": 6.0444,
"mean_token_accuracy": 0.16344080865383148,
"num_tokens": 12963328.0,
"step": 6940
},
{
"entropy": 6.184589910507202,
"epoch": 0.613299187566231,
"grad_norm": 1.8203125,
"learning_rate": 0.0004968926528820529,
"loss": 6.0414,
"mean_token_accuracy": 0.15409351587295533,
"num_tokens": 12972806.0,
"step": 6945
},
{
"entropy": 6.214977741241455,
"epoch": 0.6137407276580713,
"grad_norm": 1.53125,
"learning_rate": 0.0004968874350711044,
"loss": 6.0413,
"mean_token_accuracy": 0.15354430079460143,
"num_tokens": 12981940.0,
"step": 6950
},
{
"entropy": 6.146689558029175,
"epoch": 0.6141822677499117,
"grad_norm": 1.78125,
"learning_rate": 0.0004968822129135072,
"loss": 6.0022,
"mean_token_accuracy": 0.15630166381597518,
"num_tokens": 12990501.0,
"step": 6955
},
{
"entropy": 6.2418646812438965,
"epoch": 0.6146238078417521,
"grad_norm": 1.71875,
"learning_rate": 0.0004968769864093637,
"loss": 6.0442,
"mean_token_accuracy": 0.15087320953607558,
"num_tokens": 12999734.0,
"step": 6960
},
{
"entropy": 6.264814567565918,
"epoch": 0.6150653479335924,
"grad_norm": 2.03125,
"learning_rate": 0.0004968717555587762,
"loss": 6.1179,
"mean_token_accuracy": 0.1479475438594818,
"num_tokens": 13009323.0,
"step": 6965
},
{
"entropy": 6.256582355499267,
"epoch": 0.6155068880254327,
"grad_norm": 2.8125,
"learning_rate": 0.0004968665203618472,
"loss": 6.118,
"mean_token_accuracy": 0.15157626569271088,
"num_tokens": 13018136.0,
"step": 6970
},
{
"entropy": 6.167997980117798,
"epoch": 0.615948428117273,
"grad_norm": 1.921875,
"learning_rate": 0.0004968612808186793,
"loss": 6.0711,
"mean_token_accuracy": 0.1537791147828102,
"num_tokens": 13026494.0,
"step": 6975
},
{
"entropy": 6.140088653564453,
"epoch": 0.6163899682091134,
"grad_norm": 1.7421875,
"learning_rate": 0.0004968560369293751,
"loss": 6.0657,
"mean_token_accuracy": 0.15240042209625243,
"num_tokens": 13036548.0,
"step": 6980
},
{
"entropy": 6.258679151535034,
"epoch": 0.6168315083009537,
"grad_norm": 1.8125,
"learning_rate": 0.0004968507886940372,
"loss": 6.0944,
"mean_token_accuracy": 0.1527463138103485,
"num_tokens": 13045653.0,
"step": 6985
},
{
"entropy": 6.304360866546631,
"epoch": 0.6172730483927941,
"grad_norm": 1.6484375,
"learning_rate": 0.0004968455361127686,
"loss": 6.1532,
"mean_token_accuracy": 0.15307221710681915,
"num_tokens": 13056204.0,
"step": 6990
},
{
"entropy": 6.2066652297973635,
"epoch": 0.6177145884846345,
"grad_norm": 1.5,
"learning_rate": 0.0004968402791856721,
"loss": 6.1142,
"mean_token_accuracy": 0.1567689709365368,
"num_tokens": 13067215.0,
"step": 6995
},
{
"entropy": 6.22037148475647,
"epoch": 0.6181561285764747,
"grad_norm": 1.90625,
"learning_rate": 0.0004968350179128507,
"loss": 6.0603,
"mean_token_accuracy": 0.15270569920539856,
"num_tokens": 13076824.0,
"step": 7000
},
{
"entropy": 6.193442726135254,
"epoch": 0.6185976686683151,
"grad_norm": 1.6875,
"learning_rate": 0.0004968297522944075,
"loss": 6.0174,
"mean_token_accuracy": 0.15545051395893097,
"num_tokens": 13086205.0,
"step": 7005
},
{
"entropy": 6.099516534805298,
"epoch": 0.6190392087601554,
"grad_norm": 2.3125,
"learning_rate": 0.0004968244823304455,
"loss": 5.9611,
"mean_token_accuracy": 0.15705401301383973,
"num_tokens": 13096381.0,
"step": 7010
},
{
"entropy": 6.205773544311524,
"epoch": 0.6194807488519958,
"grad_norm": 2.640625,
"learning_rate": 0.0004968192080210683,
"loss": 6.0129,
"mean_token_accuracy": 0.16113550513982772,
"num_tokens": 13106533.0,
"step": 7015
},
{
"entropy": 6.12206654548645,
"epoch": 0.619922288943836,
"grad_norm": 2.15625,
"learning_rate": 0.0004968139293663787,
"loss": 6.0266,
"mean_token_accuracy": 0.1595764510333538,
"num_tokens": 13116605.0,
"step": 7020
},
{
"entropy": 6.093244457244873,
"epoch": 0.6203638290356764,
"grad_norm": 2.09375,
"learning_rate": 0.0004968086463664806,
"loss": 5.9842,
"mean_token_accuracy": 0.1645537257194519,
"num_tokens": 13125316.0,
"step": 7025
},
{
"entropy": 6.265250492095947,
"epoch": 0.6208053691275168,
"grad_norm": 2.203125,
"learning_rate": 0.000496803359021477,
"loss": 6.1575,
"mean_token_accuracy": 0.1529717206954956,
"num_tokens": 13135595.0,
"step": 7030
},
{
"entropy": 6.212677383422852,
"epoch": 0.6212469092193571,
"grad_norm": 1.578125,
"learning_rate": 0.0004967980673314719,
"loss": 6.0798,
"mean_token_accuracy": 0.14972247779369355,
"num_tokens": 13144395.0,
"step": 7035
},
{
"entropy": 6.135273265838623,
"epoch": 0.6216884493111975,
"grad_norm": 2.03125,
"learning_rate": 0.0004967927712965688,
"loss": 6.0286,
"mean_token_accuracy": 0.15182404965162277,
"num_tokens": 13153906.0,
"step": 7040
},
{
"entropy": 6.1989999294281,
"epoch": 0.6221299894030378,
"grad_norm": 3.140625,
"learning_rate": 0.0004967874709168714,
"loss": 5.9929,
"mean_token_accuracy": 0.15975963473320007,
"num_tokens": 13163840.0,
"step": 7045
},
{
"entropy": 6.160951852798462,
"epoch": 0.6225715294948782,
"grad_norm": 1.7734375,
"learning_rate": 0.0004967821661924837,
"loss": 5.9912,
"mean_token_accuracy": 0.15861564129590988,
"num_tokens": 13173224.0,
"step": 7050
},
{
"entropy": 6.2140748500823975,
"epoch": 0.6230130695867184,
"grad_norm": 2.234375,
"learning_rate": 0.0004967768571235094,
"loss": 6.0213,
"mean_token_accuracy": 0.15119415298104286,
"num_tokens": 13182664.0,
"step": 7055
},
{
"entropy": 6.139879417419434,
"epoch": 0.6234546096785588,
"grad_norm": 1.6640625,
"learning_rate": 0.0004967715437100526,
"loss": 5.9334,
"mean_token_accuracy": 0.15559878945350647,
"num_tokens": 13191076.0,
"step": 7060
},
{
"entropy": 6.238690948486328,
"epoch": 0.6238961497703992,
"grad_norm": 2.03125,
"learning_rate": 0.0004967662259522174,
"loss": 6.1416,
"mean_token_accuracy": 0.14745589941740037,
"num_tokens": 13201075.0,
"step": 7065
},
{
"entropy": 6.198676013946534,
"epoch": 0.6243376898622395,
"grad_norm": 1.5390625,
"learning_rate": 0.000496760903850108,
"loss": 6.0701,
"mean_token_accuracy": 0.15464459657669066,
"num_tokens": 13210602.0,
"step": 7070
},
{
"entropy": 6.221945667266846,
"epoch": 0.6247792299540799,
"grad_norm": 1.71875,
"learning_rate": 0.0004967555774038286,
"loss": 6.037,
"mean_token_accuracy": 0.1527566909790039,
"num_tokens": 13219601.0,
"step": 7075
},
{
"entropy": 6.167340087890625,
"epoch": 0.6252207700459201,
"grad_norm": 1.890625,
"learning_rate": 0.0004967502466134836,
"loss": 6.1025,
"mean_token_accuracy": 0.14824306815862656,
"num_tokens": 13230675.0,
"step": 7080
},
{
"entropy": 6.246257257461548,
"epoch": 0.6256623101377605,
"grad_norm": 2.5,
"learning_rate": 0.0004967449114791773,
"loss": 6.0849,
"mean_token_accuracy": 0.15261531695723535,
"num_tokens": 13240349.0,
"step": 7085
},
{
"entropy": 6.272697830200196,
"epoch": 0.6261038502296008,
"grad_norm": 1.953125,
"learning_rate": 0.0004967395720010143,
"loss": 6.1202,
"mean_token_accuracy": 0.14724196419119834,
"num_tokens": 13249867.0,
"step": 7090
},
{
"entropy": 6.2154772758483885,
"epoch": 0.6265453903214412,
"grad_norm": 2.953125,
"learning_rate": 0.0004967342281790992,
"loss": 6.0531,
"mean_token_accuracy": 0.15856875777244567,
"num_tokens": 13259143.0,
"step": 7095
},
{
"entropy": 6.159865665435791,
"epoch": 0.6269869304132816,
"grad_norm": 6.71875,
"learning_rate": 0.0004967288800135368,
"loss": 5.9901,
"mean_token_accuracy": 0.1546819418668747,
"num_tokens": 13268673.0,
"step": 7100
},
{
"entropy": 6.220469045639038,
"epoch": 0.6274284705051218,
"grad_norm": 1.6328125,
"learning_rate": 0.0004967235275044315,
"loss": 6.0192,
"mean_token_accuracy": 0.15441524162888526,
"num_tokens": 13278035.0,
"step": 7105
},
{
"entropy": 6.266829919815064,
"epoch": 0.6278700105969622,
"grad_norm": 1.828125,
"learning_rate": 0.0004967181706518886,
"loss": 6.1135,
"mean_token_accuracy": 0.1488713502883911,
"num_tokens": 13286950.0,
"step": 7110
},
{
"entropy": 6.115516662597656,
"epoch": 0.6283115506888025,
"grad_norm": 2.796875,
"learning_rate": 0.0004967128094560128,
"loss": 5.9907,
"mean_token_accuracy": 0.1635320097208023,
"num_tokens": 13296425.0,
"step": 7115
},
{
"entropy": 6.243912315368652,
"epoch": 0.6287530907806429,
"grad_norm": 2.015625,
"learning_rate": 0.0004967074439169092,
"loss": 6.1113,
"mean_token_accuracy": 0.14275412932038306,
"num_tokens": 13306094.0,
"step": 7120
},
{
"entropy": 6.2228553771972654,
"epoch": 0.6291946308724832,
"grad_norm": 2.125,
"learning_rate": 0.0004967020740346827,
"loss": 6.05,
"mean_token_accuracy": 0.1568419575691223,
"num_tokens": 13315181.0,
"step": 7125
},
{
"entropy": 6.162428712844848,
"epoch": 0.6296361709643236,
"grad_norm": 2.4375,
"learning_rate": 0.0004966966998094387,
"loss": 5.9656,
"mean_token_accuracy": 0.15805367827415467,
"num_tokens": 13324108.0,
"step": 7130
},
{
"entropy": 6.156050443649292,
"epoch": 0.630077711056164,
"grad_norm": 1.9140625,
"learning_rate": 0.0004966913212412825,
"loss": 6.0323,
"mean_token_accuracy": 0.15374385565519333,
"num_tokens": 13333101.0,
"step": 7135
},
{
"entropy": 6.179844665527344,
"epoch": 0.6305192511480042,
"grad_norm": 1.734375,
"learning_rate": 0.0004966859383303194,
"loss": 5.9586,
"mean_token_accuracy": 0.16109023243188858,
"num_tokens": 13341804.0,
"step": 7140
},
{
"entropy": 6.1235325813293455,
"epoch": 0.6309607912398446,
"grad_norm": 1.8515625,
"learning_rate": 0.0004966805510766549,
"loss": 6.0073,
"mean_token_accuracy": 0.1541972875595093,
"num_tokens": 13350911.0,
"step": 7145
},
{
"entropy": 6.2234206199646,
"epoch": 0.6314023313316849,
"grad_norm": 1.984375,
"learning_rate": 0.0004966751594803944,
"loss": 6.0057,
"mean_token_accuracy": 0.15637123882770537,
"num_tokens": 13360657.0,
"step": 7150
},
{
"entropy": 6.098598146438599,
"epoch": 0.6318438714235253,
"grad_norm": 1.8515625,
"learning_rate": 0.0004966697635416437,
"loss": 5.9476,
"mean_token_accuracy": 0.16033453047275542,
"num_tokens": 13370462.0,
"step": 7155
},
{
"entropy": 6.207261085510254,
"epoch": 0.6322854115153655,
"grad_norm": 1.6171875,
"learning_rate": 0.0004966643632605082,
"loss": 6.0723,
"mean_token_accuracy": 0.15057104974985122,
"num_tokens": 13379446.0,
"step": 7160
},
{
"entropy": 6.190232229232788,
"epoch": 0.6327269516072059,
"grad_norm": 1.7109375,
"learning_rate": 0.000496658958637094,
"loss": 6.0594,
"mean_token_accuracy": 0.1560957133769989,
"num_tokens": 13389238.0,
"step": 7165
},
{
"entropy": 6.161271476745606,
"epoch": 0.6331684916990463,
"grad_norm": 1.8359375,
"learning_rate": 0.000496653549671507,
"loss": 6.0535,
"mean_token_accuracy": 0.158417047560215,
"num_tokens": 13398613.0,
"step": 7170
},
{
"entropy": 6.223568677902222,
"epoch": 0.6336100317908866,
"grad_norm": 1.8046875,
"learning_rate": 0.0004966481363638529,
"loss": 6.0537,
"mean_token_accuracy": 0.15781836062669755,
"num_tokens": 13407600.0,
"step": 7175
},
{
"entropy": 6.083367395401001,
"epoch": 0.634051571882727,
"grad_norm": 1.78125,
"learning_rate": 0.0004966427187142378,
"loss": 5.9372,
"mean_token_accuracy": 0.16657115668058395,
"num_tokens": 13415974.0,
"step": 7180
},
{
"entropy": 6.179879426956177,
"epoch": 0.6344931119745673,
"grad_norm": 1.9296875,
"learning_rate": 0.0004966372967227681,
"loss": 5.9663,
"mean_token_accuracy": 0.16088535636663437,
"num_tokens": 13425628.0,
"step": 7185
},
{
"entropy": 6.104554843902588,
"epoch": 0.6349346520664076,
"grad_norm": 1.7734375,
"learning_rate": 0.0004966318703895496,
"loss": 5.9651,
"mean_token_accuracy": 0.15989047139883042,
"num_tokens": 13435573.0,
"step": 7190
},
{
"entropy": 6.174526977539062,
"epoch": 0.6353761921582479,
"grad_norm": 1.65625,
"learning_rate": 0.0004966264397146888,
"loss": 5.9525,
"mean_token_accuracy": 0.15323926508426666,
"num_tokens": 13443969.0,
"step": 7195
},
{
"entropy": 6.237339973449707,
"epoch": 0.6358177322500883,
"grad_norm": 2.203125,
"learning_rate": 0.0004966210046982921,
"loss": 6.0317,
"mean_token_accuracy": 0.15322933718562126,
"num_tokens": 13452823.0,
"step": 7200
},
{
"entropy": 6.173512315750122,
"epoch": 0.6362592723419287,
"grad_norm": 2.140625,
"learning_rate": 0.0004966155653404661,
"loss": 6.0345,
"mean_token_accuracy": 0.1533308818936348,
"num_tokens": 13461090.0,
"step": 7205
},
{
"entropy": 6.238847970962524,
"epoch": 0.636700812433769,
"grad_norm": 1.9375,
"learning_rate": 0.0004966101216413172,
"loss": 6.0399,
"mean_token_accuracy": 0.14800184667110444,
"num_tokens": 13471425.0,
"step": 7210
},
{
"entropy": 6.24900188446045,
"epoch": 0.6371423525256094,
"grad_norm": 2.5,
"learning_rate": 0.0004966046736009519,
"loss": 6.102,
"mean_token_accuracy": 0.15328046232461928,
"num_tokens": 13479755.0,
"step": 7215
},
{
"entropy": 6.145252418518067,
"epoch": 0.6375838926174496,
"grad_norm": 2.15625,
"learning_rate": 0.0004965992212194772,
"loss": 5.9879,
"mean_token_accuracy": 0.16141076385974884,
"num_tokens": 13488854.0,
"step": 7220
},
{
"entropy": 6.176625680923462,
"epoch": 0.63802543270929,
"grad_norm": 2.203125,
"learning_rate": 0.0004965937644969998,
"loss": 6.0312,
"mean_token_accuracy": 0.1527988314628601,
"num_tokens": 13497987.0,
"step": 7225
},
{
"entropy": 6.167853355407715,
"epoch": 0.6384669728011303,
"grad_norm": 2.171875,
"learning_rate": 0.0004965883034336266,
"loss": 6.0724,
"mean_token_accuracy": 0.15332372784614562,
"num_tokens": 13506960.0,
"step": 7230
},
{
"entropy": 6.188836574554443,
"epoch": 0.6389085128929707,
"grad_norm": 1.6953125,
"learning_rate": 0.0004965828380294645,
"loss": 6.0088,
"mean_token_accuracy": 0.1588570401072502,
"num_tokens": 13515907.0,
"step": 7235
},
{
"entropy": 6.19733247756958,
"epoch": 0.6393500529848111,
"grad_norm": 2.21875,
"learning_rate": 0.0004965773682846207,
"loss": 6.1018,
"mean_token_accuracy": 0.15815342366695403,
"num_tokens": 13524876.0,
"step": 7240
},
{
"entropy": 6.239398574829101,
"epoch": 0.6397915930766513,
"grad_norm": 2.1875,
"learning_rate": 0.0004965718941992021,
"loss": 5.9933,
"mean_token_accuracy": 0.15970173925161363,
"num_tokens": 13532891.0,
"step": 7245
},
{
"entropy": 6.235479259490967,
"epoch": 0.6402331331684917,
"grad_norm": 2.359375,
"learning_rate": 0.0004965664157733162,
"loss": 6.0929,
"mean_token_accuracy": 0.15196404308080674,
"num_tokens": 13542409.0,
"step": 7250
},
{
"entropy": 6.110021781921387,
"epoch": 0.640674673260332,
"grad_norm": 2.0625,
"learning_rate": 0.0004965609330070703,
"loss": 6.0384,
"mean_token_accuracy": 0.15410862118005753,
"num_tokens": 13551947.0,
"step": 7255
},
{
"entropy": 6.18615756034851,
"epoch": 0.6411162133521724,
"grad_norm": 1.5703125,
"learning_rate": 0.0004965554459005717,
"loss": 6.0771,
"mean_token_accuracy": 0.15247684121131896,
"num_tokens": 13560812.0,
"step": 7260
},
{
"entropy": 6.2198789596557615,
"epoch": 0.6415577534440127,
"grad_norm": 1.734375,
"learning_rate": 0.0004965499544539278,
"loss": 6.0743,
"mean_token_accuracy": 0.15167128220200538,
"num_tokens": 13570197.0,
"step": 7265
},
{
"entropy": 6.101568555831909,
"epoch": 0.641999293535853,
"grad_norm": 1.921875,
"learning_rate": 0.0004965444586672463,
"loss": 5.9756,
"mean_token_accuracy": 0.15539582222700118,
"num_tokens": 13579614.0,
"step": 7270
},
{
"entropy": 6.202238512039185,
"epoch": 0.6424408336276934,
"grad_norm": 1.890625,
"learning_rate": 0.000496538958540635,
"loss": 6.0465,
"mean_token_accuracy": 0.15560982376337051,
"num_tokens": 13589511.0,
"step": 7275
},
{
"entropy": 6.208220481872559,
"epoch": 0.6428823737195337,
"grad_norm": 3.671875,
"learning_rate": 0.0004965334540742015,
"loss": 6.0106,
"mean_token_accuracy": 0.1608133688569069,
"num_tokens": 13597718.0,
"step": 7280
},
{
"entropy": 6.158794736862182,
"epoch": 0.6433239138113741,
"grad_norm": 2.96875,
"learning_rate": 0.0004965279452680535,
"loss": 6.0865,
"mean_token_accuracy": 0.15283747911453247,
"num_tokens": 13607599.0,
"step": 7285
},
{
"entropy": 6.276890754699707,
"epoch": 0.6437654539032144,
"grad_norm": 2.046875,
"learning_rate": 0.0004965224321222991,
"loss": 6.1314,
"mean_token_accuracy": 0.1545204684138298,
"num_tokens": 13616513.0,
"step": 7290
},
{
"entropy": 6.200278282165527,
"epoch": 0.6442069939950548,
"grad_norm": 2.90625,
"learning_rate": 0.0004965169146370462,
"loss": 5.9904,
"mean_token_accuracy": 0.15849745124578477,
"num_tokens": 13625505.0,
"step": 7295
},
{
"entropy": 6.182850933074951,
"epoch": 0.644648534086895,
"grad_norm": 2.046875,
"learning_rate": 0.0004965113928124031,
"loss": 6.0756,
"mean_token_accuracy": 0.15372237116098403,
"num_tokens": 13635340.0,
"step": 7300
},
{
"entropy": 6.109626913070679,
"epoch": 0.6450900741787354,
"grad_norm": 2.265625,
"learning_rate": 0.0004965058666484775,
"loss": 6.0078,
"mean_token_accuracy": 0.15201882123947144,
"num_tokens": 13644886.0,
"step": 7305
},
{
"entropy": 6.15017876625061,
"epoch": 0.6455316142705758,
"grad_norm": 2.15625,
"learning_rate": 0.0004965003361453782,
"loss": 6.0276,
"mean_token_accuracy": 0.15886009931564332,
"num_tokens": 13654093.0,
"step": 7310
},
{
"entropy": 6.20392689704895,
"epoch": 0.6459731543624161,
"grad_norm": 1.9296875,
"learning_rate": 0.0004964948013032132,
"loss": 6.0804,
"mean_token_accuracy": 0.1466074138879776,
"num_tokens": 13663095.0,
"step": 7315
},
{
"entropy": 6.269616031646729,
"epoch": 0.6464146944542565,
"grad_norm": 1.90625,
"learning_rate": 0.000496489262122091,
"loss": 6.143,
"mean_token_accuracy": 0.148014035820961,
"num_tokens": 13673624.0,
"step": 7320
},
{
"entropy": 6.282114791870117,
"epoch": 0.6468562345460968,
"grad_norm": 2.15625,
"learning_rate": 0.0004964837186021201,
"loss": 6.0103,
"mean_token_accuracy": 0.1536534234881401,
"num_tokens": 13683145.0,
"step": 7325
},
{
"entropy": 6.128833675384522,
"epoch": 0.6472977746379371,
"grad_norm": 2.34375,
"learning_rate": 0.0004964781707434093,
"loss": 5.994,
"mean_token_accuracy": 0.15334709733724594,
"num_tokens": 13691963.0,
"step": 7330
},
{
"entropy": 6.1130454540252686,
"epoch": 0.6477393147297774,
"grad_norm": 1.8203125,
"learning_rate": 0.0004964726185460669,
"loss": 5.9203,
"mean_token_accuracy": 0.15729135423898696,
"num_tokens": 13700926.0,
"step": 7335
},
{
"entropy": 6.237424993515015,
"epoch": 0.6481808548216178,
"grad_norm": 2.015625,
"learning_rate": 0.0004964670620102019,
"loss": 6.1112,
"mean_token_accuracy": 0.14292953461408614,
"num_tokens": 13709824.0,
"step": 7340
},
{
"entropy": 6.164659690856934,
"epoch": 0.6486223949134582,
"grad_norm": 1.703125,
"learning_rate": 0.0004964615011359231,
"loss": 6.0311,
"mean_token_accuracy": 0.15380015969276428,
"num_tokens": 13718789.0,
"step": 7345
},
{
"entropy": 6.159794521331787,
"epoch": 0.6490639350052985,
"grad_norm": 2.625,
"learning_rate": 0.0004964559359233395,
"loss": 6.0327,
"mean_token_accuracy": 0.15380071178078653,
"num_tokens": 13728180.0,
"step": 7350
},
{
"entropy": 6.16060094833374,
"epoch": 0.6495054750971389,
"grad_norm": 2.59375,
"learning_rate": 0.0004964503663725601,
"loss": 6.1386,
"mean_token_accuracy": 0.14987644106149672,
"num_tokens": 13737819.0,
"step": 7355
},
{
"entropy": 6.268680000305176,
"epoch": 0.6499470151889791,
"grad_norm": 1.828125,
"learning_rate": 0.0004964447924836938,
"loss": 6.0988,
"mean_token_accuracy": 0.15023177042603492,
"num_tokens": 13747519.0,
"step": 7360
},
{
"entropy": 6.2985249042510985,
"epoch": 0.6503885552808195,
"grad_norm": 1.828125,
"learning_rate": 0.0004964392142568501,
"loss": 6.094,
"mean_token_accuracy": 0.14414478316903115,
"num_tokens": 13757821.0,
"step": 7365
},
{
"entropy": 6.04947338104248,
"epoch": 0.6508300953726598,
"grad_norm": 2.765625,
"learning_rate": 0.0004964336316921381,
"loss": 5.9195,
"mean_token_accuracy": 0.15920277088880538,
"num_tokens": 13766560.0,
"step": 7370
},
{
"entropy": 6.1585005760192875,
"epoch": 0.6512716354645002,
"grad_norm": 1.6875,
"learning_rate": 0.0004964280447896672,
"loss": 5.962,
"mean_token_accuracy": 0.1555796004831791,
"num_tokens": 13775560.0,
"step": 7375
},
{
"entropy": 6.175464487075805,
"epoch": 0.6517131755563406,
"grad_norm": 2.125,
"learning_rate": 0.0004964224535495468,
"loss": 6.0342,
"mean_token_accuracy": 0.1482674792408943,
"num_tokens": 13784391.0,
"step": 7380
},
{
"entropy": 6.127026128768921,
"epoch": 0.6521547156481808,
"grad_norm": 1.9296875,
"learning_rate": 0.0004964168579718864,
"loss": 6.0231,
"mean_token_accuracy": 0.15469812899827956,
"num_tokens": 13794008.0,
"step": 7385
},
{
"entropy": 6.201027870178223,
"epoch": 0.6525962557400212,
"grad_norm": 2.40625,
"learning_rate": 0.0004964112580567959,
"loss": 6.0601,
"mean_token_accuracy": 0.14791031777858735,
"num_tokens": 13804321.0,
"step": 7390
},
{
"entropy": 6.25521821975708,
"epoch": 0.6530377958318615,
"grad_norm": 1.796875,
"learning_rate": 0.0004964056538043845,
"loss": 6.0741,
"mean_token_accuracy": 0.15069704353809357,
"num_tokens": 13813492.0,
"step": 7395
},
{
"entropy": 6.206275129318238,
"epoch": 0.6534793359237019,
"grad_norm": 1.84375,
"learning_rate": 0.0004964000452147624,
"loss": 6.0423,
"mean_token_accuracy": 0.15457727909088134,
"num_tokens": 13822471.0,
"step": 7400
},
{
"entropy": 6.151892614364624,
"epoch": 0.6539208760155422,
"grad_norm": 1.625,
"learning_rate": 0.0004963944322880394,
"loss": 6.1031,
"mean_token_accuracy": 0.14857663363218307,
"num_tokens": 13832789.0,
"step": 7405
},
{
"entropy": 6.192709827423096,
"epoch": 0.6543624161073825,
"grad_norm": 2.796875,
"learning_rate": 0.0004963888150243253,
"loss": 6.0634,
"mean_token_accuracy": 0.1518451228737831,
"num_tokens": 13842230.0,
"step": 7410
},
{
"entropy": 6.236910200119018,
"epoch": 0.6548039561992229,
"grad_norm": 1.828125,
"learning_rate": 0.0004963831934237302,
"loss": 5.9893,
"mean_token_accuracy": 0.1569280132651329,
"num_tokens": 13851542.0,
"step": 7415
},
{
"entropy": 6.200952482223511,
"epoch": 0.6552454962910632,
"grad_norm": 2.609375,
"learning_rate": 0.0004963775674863643,
"loss": 6.0211,
"mean_token_accuracy": 0.15067466497421264,
"num_tokens": 13860753.0,
"step": 7420
},
{
"entropy": 6.125022459030151,
"epoch": 0.6556870363829036,
"grad_norm": 2.09375,
"learning_rate": 0.0004963719372123378,
"loss": 6.0103,
"mean_token_accuracy": 0.1566421151161194,
"num_tokens": 13870133.0,
"step": 7425
},
{
"entropy": 6.160869884490967,
"epoch": 0.6561285764747439,
"grad_norm": 2.4375,
"learning_rate": 0.0004963663026017609,
"loss": 6.0807,
"mean_token_accuracy": 0.15429066121578217,
"num_tokens": 13879086.0,
"step": 7430
},
{
"entropy": 6.210341215133667,
"epoch": 0.6565701165665843,
"grad_norm": 1.8046875,
"learning_rate": 0.0004963606636547441,
"loss": 6.0369,
"mean_token_accuracy": 0.15373207926750182,
"num_tokens": 13888706.0,
"step": 7435
},
{
"entropy": 6.169106435775757,
"epoch": 0.6570116566584245,
"grad_norm": 2.15625,
"learning_rate": 0.0004963550203713976,
"loss": 6.0729,
"mean_token_accuracy": 0.15174360275268556,
"num_tokens": 13897455.0,
"step": 7440
},
{
"entropy": 6.200068998336792,
"epoch": 0.6574531967502649,
"grad_norm": 2.484375,
"learning_rate": 0.0004963493727518323,
"loss": 6.0686,
"mean_token_accuracy": 0.15949563831090927,
"num_tokens": 13907697.0,
"step": 7445
},
{
"entropy": 6.150499439239502,
"epoch": 0.6578947368421053,
"grad_norm": 2.0625,
"learning_rate": 0.0004963437207961585,
"loss": 6.0823,
"mean_token_accuracy": 0.15188951194286346,
"num_tokens": 13917124.0,
"step": 7450
},
{
"entropy": 6.219438552856445,
"epoch": 0.6583362769339456,
"grad_norm": 2.59375,
"learning_rate": 0.0004963380645044874,
"loss": 6.0081,
"mean_token_accuracy": 0.1529169574379921,
"num_tokens": 13926434.0,
"step": 7455
},
{
"entropy": 6.155338430404663,
"epoch": 0.658777817025786,
"grad_norm": 2.953125,
"learning_rate": 0.0004963324038769292,
"loss": 5.9663,
"mean_token_accuracy": 0.15937378257513046,
"num_tokens": 13934883.0,
"step": 7460
},
{
"entropy": 6.193954133987427,
"epoch": 0.6592193571176262,
"grad_norm": 2.890625,
"learning_rate": 0.0004963267389135953,
"loss": 6.0847,
"mean_token_accuracy": 0.1530764505267143,
"num_tokens": 13944514.0,
"step": 7465
},
{
"entropy": 6.201335525512695,
"epoch": 0.6596608972094666,
"grad_norm": 2.140625,
"learning_rate": 0.0004963210696145964,
"loss": 5.9884,
"mean_token_accuracy": 0.1515755258500576,
"num_tokens": 13953434.0,
"step": 7470
},
{
"entropy": 6.180365705490113,
"epoch": 0.6601024373013069,
"grad_norm": 2.921875,
"learning_rate": 0.0004963153959800436,
"loss": 6.0165,
"mean_token_accuracy": 0.1623746007680893,
"num_tokens": 13962493.0,
"step": 7475
},
{
"entropy": 6.1569962978363035,
"epoch": 0.6605439773931473,
"grad_norm": 2.640625,
"learning_rate": 0.000496309718010048,
"loss": 6.0601,
"mean_token_accuracy": 0.15363184958696366,
"num_tokens": 13971193.0,
"step": 7480
},
{
"entropy": 6.146395444869995,
"epoch": 0.6609855174849877,
"grad_norm": 6.0625,
"learning_rate": 0.0004963040357047209,
"loss": 6.0695,
"mean_token_accuracy": 0.15360373705625535,
"num_tokens": 13981829.0,
"step": 7485
},
{
"entropy": 6.251808404922485,
"epoch": 0.661427057576828,
"grad_norm": 2.46875,
"learning_rate": 0.0004962983490641737,
"loss": 6.0077,
"mean_token_accuracy": 0.15239822417497634,
"num_tokens": 13990262.0,
"step": 7490
},
{
"entropy": 6.214360237121582,
"epoch": 0.6618685976686683,
"grad_norm": 3.40625,
"learning_rate": 0.0004962926580885177,
"loss": 6.052,
"mean_token_accuracy": 0.15461465418338777,
"num_tokens": 14000100.0,
"step": 7495
},
{
"entropy": 6.171396398544312,
"epoch": 0.6623101377605086,
"grad_norm": 2.140625,
"learning_rate": 0.0004962869627778642,
"loss": 6.0768,
"mean_token_accuracy": 0.1547115571796894,
"num_tokens": 14009330.0,
"step": 7500
},
{
"entropy": 6.157674789428711,
"epoch": 0.662751677852349,
"grad_norm": 2.21875,
"learning_rate": 0.0004962812631323252,
"loss": 6.0428,
"mean_token_accuracy": 0.15067947879433632,
"num_tokens": 14018109.0,
"step": 7505
},
{
"entropy": 6.194535255432129,
"epoch": 0.6631932179441893,
"grad_norm": 4.15625,
"learning_rate": 0.000496275559152012,
"loss": 5.9776,
"mean_token_accuracy": 0.15149088948965073,
"num_tokens": 14027318.0,
"step": 7510
},
{
"entropy": 6.23044638633728,
"epoch": 0.6636347580360297,
"grad_norm": 2.09375,
"learning_rate": 0.0004962698508370365,
"loss": 6.0642,
"mean_token_accuracy": 0.15488168299198152,
"num_tokens": 14037061.0,
"step": 7515
},
{
"entropy": 6.167206764221191,
"epoch": 0.6640762981278701,
"grad_norm": 2.5,
"learning_rate": 0.0004962641381875103,
"loss": 6.046,
"mean_token_accuracy": 0.14700114279985427,
"num_tokens": 14046008.0,
"step": 7520
},
{
"entropy": 6.190823316574097,
"epoch": 0.6645178382197103,
"grad_norm": 1.9765625,
"learning_rate": 0.0004962584212035456,
"loss": 6.0347,
"mean_token_accuracy": 0.14479782730340957,
"num_tokens": 14054535.0,
"step": 7525
},
{
"entropy": 6.246673536300659,
"epoch": 0.6649593783115507,
"grad_norm": 3.28125,
"learning_rate": 0.0004962526998852543,
"loss": 6.0309,
"mean_token_accuracy": 0.15494185984134673,
"num_tokens": 14063680.0,
"step": 7530
},
{
"entropy": 6.224277019500732,
"epoch": 0.665400918403391,
"grad_norm": 1.859375,
"learning_rate": 0.0004962469742327483,
"loss": 6.0658,
"mean_token_accuracy": 0.15635597407817842,
"num_tokens": 14072206.0,
"step": 7535
},
{
"entropy": 6.1906343460083,
"epoch": 0.6658424584952314,
"grad_norm": 2.375,
"learning_rate": 0.00049624124424614,
"loss": 6.0704,
"mean_token_accuracy": 0.15779808908700943,
"num_tokens": 14081943.0,
"step": 7540
},
{
"entropy": 6.227981519699097,
"epoch": 0.6662839985870717,
"grad_norm": 1.8203125,
"learning_rate": 0.0004962355099255415,
"loss": 6.0206,
"mean_token_accuracy": 0.15675265938043595,
"num_tokens": 14091695.0,
"step": 7545
},
{
"entropy": 6.104007530212402,
"epoch": 0.666725538678912,
"grad_norm": 2.625,
"learning_rate": 0.0004962297712710653,
"loss": 5.9565,
"mean_token_accuracy": 0.16455004662275313,
"num_tokens": 14100811.0,
"step": 7550
},
{
"entropy": 6.2424914836883545,
"epoch": 0.6671670787707524,
"grad_norm": 2.765625,
"learning_rate": 0.0004962240282828236,
"loss": 6.1233,
"mean_token_accuracy": 0.14141942113637923,
"num_tokens": 14109818.0,
"step": 7555
},
{
"entropy": 6.216471481323242,
"epoch": 0.6676086188625927,
"grad_norm": 2.109375,
"learning_rate": 0.000496218280960929,
"loss": 6.0572,
"mean_token_accuracy": 0.15262652635574342,
"num_tokens": 14119811.0,
"step": 7560
},
{
"entropy": 6.239268493652344,
"epoch": 0.6680501589544331,
"grad_norm": 2.921875,
"learning_rate": 0.0004962125293054941,
"loss": 6.025,
"mean_token_accuracy": 0.15912486165761947,
"num_tokens": 14128963.0,
"step": 7565
},
{
"entropy": 6.2218653678894045,
"epoch": 0.6684916990462734,
"grad_norm": 2.1875,
"learning_rate": 0.0004962067733166317,
"loss": 6.0639,
"mean_token_accuracy": 0.14333775714039804,
"num_tokens": 14138532.0,
"step": 7570
},
{
"entropy": 6.133137989044189,
"epoch": 0.6689332391381138,
"grad_norm": 10.875,
"learning_rate": 0.0004962010129944542,
"loss": 6.022,
"mean_token_accuracy": 0.15838389694690705,
"num_tokens": 14148107.0,
"step": 7575
},
{
"entropy": 6.217996215820312,
"epoch": 0.669374779229954,
"grad_norm": 1.8203125,
"learning_rate": 0.0004961952483390747,
"loss": 6.0777,
"mean_token_accuracy": 0.14390667974948884,
"num_tokens": 14158823.0,
"step": 7580
},
{
"entropy": 6.213542175292969,
"epoch": 0.6698163193217944,
"grad_norm": 2.453125,
"learning_rate": 0.0004961894793506062,
"loss": 6.0274,
"mean_token_accuracy": 0.15735121071338654,
"num_tokens": 14168147.0,
"step": 7585
},
{
"entropy": 6.191353988647461,
"epoch": 0.6702578594136348,
"grad_norm": 2.609375,
"learning_rate": 0.0004961837060291615,
"loss": 6.0631,
"mean_token_accuracy": 0.15633561462163925,
"num_tokens": 14177123.0,
"step": 7590
},
{
"entropy": 6.1563966274261475,
"epoch": 0.6706993995054751,
"grad_norm": 1.921875,
"learning_rate": 0.0004961779283748538,
"loss": 6.0379,
"mean_token_accuracy": 0.152371346950531,
"num_tokens": 14186614.0,
"step": 7595
},
{
"entropy": 6.20333046913147,
"epoch": 0.6711409395973155,
"grad_norm": 2.609375,
"learning_rate": 0.0004961721463877963,
"loss": 6.0552,
"mean_token_accuracy": 0.1476649187505245,
"num_tokens": 14195310.0,
"step": 7600
},
{
"entropy": 6.227256631851196,
"epoch": 0.6715824796891557,
"grad_norm": 2.84375,
"learning_rate": 0.0004961663600681023,
"loss": 6.024,
"mean_token_accuracy": 0.15250837355852126,
"num_tokens": 14204321.0,
"step": 7605
},
{
"entropy": 6.143589925765991,
"epoch": 0.6720240197809961,
"grad_norm": 2.09375,
"learning_rate": 0.000496160569415885,
"loss": 6.0496,
"mean_token_accuracy": 0.1539103403687477,
"num_tokens": 14213615.0,
"step": 7610
},
{
"entropy": 6.21385612487793,
"epoch": 0.6724655598728364,
"grad_norm": 2.75,
"learning_rate": 0.0004961547744312579,
"loss": 5.9204,
"mean_token_accuracy": 0.16402706652879714,
"num_tokens": 14222715.0,
"step": 7615
},
{
"entropy": 6.237391233444214,
"epoch": 0.6729070999646768,
"grad_norm": 2.0625,
"learning_rate": 0.0004961489751143346,
"loss": 6.058,
"mean_token_accuracy": 0.1577908456325531,
"num_tokens": 14232117.0,
"step": 7620
},
{
"entropy": 6.157371234893799,
"epoch": 0.6733486400565172,
"grad_norm": 3.59375,
"learning_rate": 0.0004961431714652287,
"loss": 5.9363,
"mean_token_accuracy": 0.16300475001335143,
"num_tokens": 14240606.0,
"step": 7625
},
{
"entropy": 6.200923204421997,
"epoch": 0.6737901801483575,
"grad_norm": 1.7734375,
"learning_rate": 0.0004961373634840538,
"loss": 6.0607,
"mean_token_accuracy": 0.14696891009807586,
"num_tokens": 14249844.0,
"step": 7630
},
{
"entropy": 6.180020952224732,
"epoch": 0.6742317202401978,
"grad_norm": 1.765625,
"learning_rate": 0.0004961315511709237,
"loss": 6.0499,
"mean_token_accuracy": 0.158081291615963,
"num_tokens": 14259231.0,
"step": 7635
},
{
"entropy": 6.236937952041626,
"epoch": 0.6746732603320381,
"grad_norm": 1.9375,
"learning_rate": 0.0004961257345259524,
"loss": 6.0816,
"mean_token_accuracy": 0.1563194699585438,
"num_tokens": 14268508.0,
"step": 7640
},
{
"entropy": 6.155371046066284,
"epoch": 0.6751148004238785,
"grad_norm": 2.296875,
"learning_rate": 0.0004961199135492535,
"loss": 5.9805,
"mean_token_accuracy": 0.16023090481758118,
"num_tokens": 14278057.0,
"step": 7645
},
{
"entropy": 6.118306589126587,
"epoch": 0.6755563405157188,
"grad_norm": 1.953125,
"learning_rate": 0.0004961140882409414,
"loss": 6.0529,
"mean_token_accuracy": 0.15492414236068724,
"num_tokens": 14287225.0,
"step": 7650
},
{
"entropy": 6.240869092941284,
"epoch": 0.6759978806075592,
"grad_norm": 1.921875,
"learning_rate": 0.00049610825860113,
"loss": 6.0236,
"mean_token_accuracy": 0.15528398603200913,
"num_tokens": 14296529.0,
"step": 7655
},
{
"entropy": 6.245958948135376,
"epoch": 0.6764394206993996,
"grad_norm": 2.34375,
"learning_rate": 0.0004961024246299336,
"loss": 5.9777,
"mean_token_accuracy": 0.15906981527805328,
"num_tokens": 14305675.0,
"step": 7660
},
{
"entropy": 6.131229877471924,
"epoch": 0.6768809607912398,
"grad_norm": 1.71875,
"learning_rate": 0.0004960965863274665,
"loss": 5.9681,
"mean_token_accuracy": 0.14951292872428895,
"num_tokens": 14313632.0,
"step": 7665
},
{
"entropy": 6.071325588226318,
"epoch": 0.6773225008830802,
"grad_norm": 2.140625,
"learning_rate": 0.000496090743693843,
"loss": 6.0515,
"mean_token_accuracy": 0.1581055074930191,
"num_tokens": 14323353.0,
"step": 7670
},
{
"entropy": 6.252487707138061,
"epoch": 0.6777640409749205,
"grad_norm": 4.59375,
"learning_rate": 0.0004960848967291775,
"loss": 6.0338,
"mean_token_accuracy": 0.15270647183060646,
"num_tokens": 14331953.0,
"step": 7675
},
{
"entropy": 6.303414726257325,
"epoch": 0.6782055810667609,
"grad_norm": 3.328125,
"learning_rate": 0.0004960790454335846,
"loss": 6.0904,
"mean_token_accuracy": 0.1472955822944641,
"num_tokens": 14342456.0,
"step": 7680
},
{
"entropy": 6.174389600753784,
"epoch": 0.6786471211586012,
"grad_norm": 1.703125,
"learning_rate": 0.000496073189807179,
"loss": 5.8712,
"mean_token_accuracy": 0.16455910801887513,
"num_tokens": 14351013.0,
"step": 7685
},
{
"entropy": 6.159072923660278,
"epoch": 0.6790886612504415,
"grad_norm": 4.09375,
"learning_rate": 0.0004960673298500753,
"loss": 6.1372,
"mean_token_accuracy": 0.1494605213403702,
"num_tokens": 14360887.0,
"step": 7690
},
{
"entropy": 6.243593358993531,
"epoch": 0.6795302013422819,
"grad_norm": 2.125,
"learning_rate": 0.0004960614655623883,
"loss": 6.0558,
"mean_token_accuracy": 0.1525572694838047,
"num_tokens": 14370510.0,
"step": 7695
},
{
"entropy": 6.219086408615112,
"epoch": 0.6799717414341222,
"grad_norm": 2.046875,
"learning_rate": 0.000496055596944233,
"loss": 6.0523,
"mean_token_accuracy": 0.15971649289131165,
"num_tokens": 14379315.0,
"step": 7700
},
{
"entropy": 6.224992895126343,
"epoch": 0.6804132815259626,
"grad_norm": 2.6875,
"learning_rate": 0.0004960497239957243,
"loss": 6.0278,
"mean_token_accuracy": 0.15483266711235047,
"num_tokens": 14388537.0,
"step": 7705
},
{
"entropy": 6.255096578598023,
"epoch": 0.6808548216178029,
"grad_norm": 1.828125,
"learning_rate": 0.0004960438467169772,
"loss": 6.0771,
"mean_token_accuracy": 0.15052061378955842,
"num_tokens": 14398347.0,
"step": 7710
},
{
"entropy": 6.2659049987792965,
"epoch": 0.6812963617096433,
"grad_norm": 1.8515625,
"learning_rate": 0.0004960379651081068,
"loss": 5.9995,
"mean_token_accuracy": 0.1563209906220436,
"num_tokens": 14407304.0,
"step": 7715
},
{
"entropy": 6.172527694702149,
"epoch": 0.6817379018014835,
"grad_norm": 2.140625,
"learning_rate": 0.0004960320791692283,
"loss": 6.012,
"mean_token_accuracy": 0.1538145899772644,
"num_tokens": 14416641.0,
"step": 7720
},
{
"entropy": 6.225734663009644,
"epoch": 0.6821794418933239,
"grad_norm": 3.15625,
"learning_rate": 0.0004960261889004572,
"loss": 6.1228,
"mean_token_accuracy": 0.15217306613922119,
"num_tokens": 14426095.0,
"step": 7725
},
{
"entropy": 6.2689765930175785,
"epoch": 0.6826209819851643,
"grad_norm": 3.78125,
"learning_rate": 0.0004960202943019088,
"loss": 6.019,
"mean_token_accuracy": 0.15503756403923036,
"num_tokens": 14434563.0,
"step": 7730
},
{
"entropy": 6.118977451324463,
"epoch": 0.6830625220770046,
"grad_norm": 2.46875,
"learning_rate": 0.0004960143953736984,
"loss": 5.9469,
"mean_token_accuracy": 0.162799833714962,
"num_tokens": 14444319.0,
"step": 7735
},
{
"entropy": 6.1699401378631595,
"epoch": 0.683504062168845,
"grad_norm": 1.90625,
"learning_rate": 0.0004960084921159419,
"loss": 6.0117,
"mean_token_accuracy": 0.15735335201025008,
"num_tokens": 14453381.0,
"step": 7740
},
{
"entropy": 6.077239513397217,
"epoch": 0.6839456022606852,
"grad_norm": 3.703125,
"learning_rate": 0.0004960025845287546,
"loss": 6.0127,
"mean_token_accuracy": 0.1571413978934288,
"num_tokens": 14462660.0,
"step": 7745
},
{
"entropy": 6.122715616226197,
"epoch": 0.6843871423525256,
"grad_norm": 2.125,
"learning_rate": 0.0004959966726122523,
"loss": 5.9396,
"mean_token_accuracy": 0.1614696577191353,
"num_tokens": 14471820.0,
"step": 7750
},
{
"entropy": 6.262823152542114,
"epoch": 0.6848286824443659,
"grad_norm": 2.703125,
"learning_rate": 0.000495990756366551,
"loss": 6.0931,
"mean_token_accuracy": 0.15349064767360687,
"num_tokens": 14481663.0,
"step": 7755
},
{
"entropy": 6.2986386775970455,
"epoch": 0.6852702225362063,
"grad_norm": 2.390625,
"learning_rate": 0.0004959848357917664,
"loss": 6.1068,
"mean_token_accuracy": 0.14945002198219298,
"num_tokens": 14491515.0,
"step": 7760
},
{
"entropy": 6.162067222595215,
"epoch": 0.6857117626280467,
"grad_norm": 3.140625,
"learning_rate": 0.0004959789108880145,
"loss": 5.9387,
"mean_token_accuracy": 0.15316417962312698,
"num_tokens": 14500852.0,
"step": 7765
},
{
"entropy": 6.145100688934326,
"epoch": 0.686153302719887,
"grad_norm": 2.578125,
"learning_rate": 0.0004959729816554115,
"loss": 5.9974,
"mean_token_accuracy": 0.1625947669148445,
"num_tokens": 14509771.0,
"step": 7770
},
{
"entropy": 6.165549850463867,
"epoch": 0.6865948428117273,
"grad_norm": 2.546875,
"learning_rate": 0.0004959670480940734,
"loss": 5.9828,
"mean_token_accuracy": 0.16008143573999406,
"num_tokens": 14519377.0,
"step": 7775
},
{
"entropy": 6.182248115539551,
"epoch": 0.6870363829035676,
"grad_norm": 3.765625,
"learning_rate": 0.0004959611102041165,
"loss": 6.0214,
"mean_token_accuracy": 0.1562317878007889,
"num_tokens": 14528998.0,
"step": 7780
},
{
"entropy": 6.187045478820801,
"epoch": 0.687477922995408,
"grad_norm": 2.25,
"learning_rate": 0.0004959551679856571,
"loss": 6.0704,
"mean_token_accuracy": 0.1578943520784378,
"num_tokens": 14538153.0,
"step": 7785
},
{
"entropy": 6.205445671081543,
"epoch": 0.6879194630872483,
"grad_norm": 2.3125,
"learning_rate": 0.0004959492214388117,
"loss": 5.9983,
"mean_token_accuracy": 0.15714774578809737,
"num_tokens": 14547631.0,
"step": 7790
},
{
"entropy": 6.212453413009643,
"epoch": 0.6883610031790887,
"grad_norm": 3.5625,
"learning_rate": 0.0004959432705636968,
"loss": 5.938,
"mean_token_accuracy": 0.15711806267499923,
"num_tokens": 14557685.0,
"step": 7795
},
{
"entropy": 6.187683820724487,
"epoch": 0.688802543270929,
"grad_norm": 2.21875,
"learning_rate": 0.0004959373153604287,
"loss": 6.0801,
"mean_token_accuracy": 0.15477632135152816,
"num_tokens": 14567360.0,
"step": 7800
},
{
"entropy": 6.106691360473633,
"epoch": 0.6892440833627693,
"grad_norm": 2.171875,
"learning_rate": 0.0004959313558291243,
"loss": 5.9908,
"mean_token_accuracy": 0.15953385531902314,
"num_tokens": 14576916.0,
"step": 7805
},
{
"entropy": 6.156253290176392,
"epoch": 0.6896856234546097,
"grad_norm": 2.671875,
"learning_rate": 0.0004959253919699004,
"loss": 5.9252,
"mean_token_accuracy": 0.16435384154319763,
"num_tokens": 14586716.0,
"step": 7810
},
{
"entropy": 6.230778503417969,
"epoch": 0.69012716354645,
"grad_norm": 2.0625,
"learning_rate": 0.0004959194237828735,
"loss": 5.9814,
"mean_token_accuracy": 0.15456454455852509,
"num_tokens": 14595690.0,
"step": 7815
},
{
"entropy": 6.188361740112304,
"epoch": 0.6905687036382904,
"grad_norm": 2.46875,
"learning_rate": 0.0004959134512681609,
"loss": 6.0332,
"mean_token_accuracy": 0.15250634253025055,
"num_tokens": 14605481.0,
"step": 7820
},
{
"entropy": 6.181294059753418,
"epoch": 0.6910102437301306,
"grad_norm": 1.765625,
"learning_rate": 0.0004959074744258794,
"loss": 6.0903,
"mean_token_accuracy": 0.15014140903949738,
"num_tokens": 14615242.0,
"step": 7825
},
{
"entropy": 6.230496025085449,
"epoch": 0.691451783821971,
"grad_norm": 2.140625,
"learning_rate": 0.0004959014932561461,
"loss": 5.9381,
"mean_token_accuracy": 0.15997153967618943,
"num_tokens": 14624343.0,
"step": 7830
},
{
"entropy": 6.120389366149903,
"epoch": 0.6918933239138114,
"grad_norm": 1.90625,
"learning_rate": 0.0004958955077590782,
"loss": 5.9101,
"mean_token_accuracy": 0.16377195715904236,
"num_tokens": 14633014.0,
"step": 7835
},
{
"entropy": 6.106595802307129,
"epoch": 0.6923348640056517,
"grad_norm": 1.671875,
"learning_rate": 0.0004958895179347929,
"loss": 6.0347,
"mean_token_accuracy": 0.15466284155845642,
"num_tokens": 14642796.0,
"step": 7840
},
{
"entropy": 6.2087477684021,
"epoch": 0.6927764040974921,
"grad_norm": 1.859375,
"learning_rate": 0.0004958835237834075,
"loss": 6.0596,
"mean_token_accuracy": 0.147278793156147,
"num_tokens": 14652388.0,
"step": 7845
},
{
"entropy": 6.244549369812011,
"epoch": 0.6932179441893324,
"grad_norm": 2.46875,
"learning_rate": 0.0004958775253050396,
"loss": 6.009,
"mean_token_accuracy": 0.15765104815363884,
"num_tokens": 14661219.0,
"step": 7850
},
{
"entropy": 6.1913094997406,
"epoch": 0.6936594842811727,
"grad_norm": 2.28125,
"learning_rate": 0.0004958715224998066,
"loss": 6.0441,
"mean_token_accuracy": 0.15406350493431092,
"num_tokens": 14670878.0,
"step": 7855
},
{
"entropy": 6.172409582138061,
"epoch": 0.694101024373013,
"grad_norm": 2.15625,
"learning_rate": 0.0004958655153678261,
"loss": 6.0716,
"mean_token_accuracy": 0.15391165465116502,
"num_tokens": 14680893.0,
"step": 7860
},
{
"entropy": 6.219511985778809,
"epoch": 0.6945425644648534,
"grad_norm": 2.5,
"learning_rate": 0.0004958595039092156,
"loss": 5.9792,
"mean_token_accuracy": 0.15655152648687362,
"num_tokens": 14689249.0,
"step": 7865
},
{
"entropy": 6.182665777206421,
"epoch": 0.6949841045566938,
"grad_norm": 2.265625,
"learning_rate": 0.0004958534881240932,
"loss": 5.9882,
"mean_token_accuracy": 0.1581635668873787,
"num_tokens": 14698724.0,
"step": 7870
},
{
"entropy": 6.14864559173584,
"epoch": 0.6954256446485341,
"grad_norm": 2.5,
"learning_rate": 0.0004958474680125766,
"loss": 5.9603,
"mean_token_accuracy": 0.1531504362821579,
"num_tokens": 14707756.0,
"step": 7875
},
{
"entropy": 6.187934350967407,
"epoch": 0.6958671847403745,
"grad_norm": 1.9140625,
"learning_rate": 0.0004958414435747837,
"loss": 5.9853,
"mean_token_accuracy": 0.15955897867679597,
"num_tokens": 14717416.0,
"step": 7880
},
{
"entropy": 6.1442454814910885,
"epoch": 0.6963087248322147,
"grad_norm": 2.578125,
"learning_rate": 0.0004958354148108324,
"loss": 6.0472,
"mean_token_accuracy": 0.15862099528312684,
"num_tokens": 14727321.0,
"step": 7885
},
{
"entropy": 6.0992106914520265,
"epoch": 0.6967502649240551,
"grad_norm": 2.25,
"learning_rate": 0.000495829381720841,
"loss": 5.9261,
"mean_token_accuracy": 0.1667322650551796,
"num_tokens": 14736298.0,
"step": 7890
},
{
"entropy": 6.207462453842163,
"epoch": 0.6971918050158954,
"grad_norm": 2.046875,
"learning_rate": 0.0004958233443049275,
"loss": 5.9832,
"mean_token_accuracy": 0.14948185682296752,
"num_tokens": 14745893.0,
"step": 7895
},
{
"entropy": 6.241129732131958,
"epoch": 0.6976333451077358,
"grad_norm": 2.359375,
"learning_rate": 0.0004958173025632103,
"loss": 6.0299,
"mean_token_accuracy": 0.14750152826309204,
"num_tokens": 14755277.0,
"step": 7900
},
{
"entropy": 6.215299606323242,
"epoch": 0.6980748851995762,
"grad_norm": 2.0,
"learning_rate": 0.0004958112564958079,
"loss": 6.1356,
"mean_token_accuracy": 0.14761845543980598,
"num_tokens": 14764369.0,
"step": 7905
},
{
"entropy": 6.110063552856445,
"epoch": 0.6985164252914164,
"grad_norm": 1.984375,
"learning_rate": 0.0004958052061028385,
"loss": 5.9721,
"mean_token_accuracy": 0.16243066340684892,
"num_tokens": 14772970.0,
"step": 7910
},
{
"entropy": 6.167850589752197,
"epoch": 0.6989579653832568,
"grad_norm": 1.921875,
"learning_rate": 0.0004957991513844205,
"loss": 6.0378,
"mean_token_accuracy": 0.15475951582193376,
"num_tokens": 14782862.0,
"step": 7915
},
{
"entropy": 6.272579956054687,
"epoch": 0.6993995054750971,
"grad_norm": 1.7421875,
"learning_rate": 0.0004957930923406729,
"loss": 6.0498,
"mean_token_accuracy": 0.1560375764966011,
"num_tokens": 14792042.0,
"step": 7920
},
{
"entropy": 6.2410767555236815,
"epoch": 0.6998410455669375,
"grad_norm": 1.953125,
"learning_rate": 0.0004957870289717142,
"loss": 6.0025,
"mean_token_accuracy": 0.15189553946256637,
"num_tokens": 14801032.0,
"step": 7925
},
{
"entropy": 6.1055858612060545,
"epoch": 0.7002825856587778,
"grad_norm": 2.21875,
"learning_rate": 0.0004957809612776631,
"loss": 5.9942,
"mean_token_accuracy": 0.15394028574228286,
"num_tokens": 14810594.0,
"step": 7930
},
{
"entropy": 6.133386659622192,
"epoch": 0.7007241257506182,
"grad_norm": 2.3125,
"learning_rate": 0.0004957748892586384,
"loss": 6.0889,
"mean_token_accuracy": 0.15561799257993697,
"num_tokens": 14820570.0,
"step": 7935
},
{
"entropy": 6.063908386230469,
"epoch": 0.7011656658424585,
"grad_norm": 2.46875,
"learning_rate": 0.0004957688129147594,
"loss": 5.8994,
"mean_token_accuracy": 0.16970330625772476,
"num_tokens": 14830078.0,
"step": 7940
},
{
"entropy": 6.132439613342285,
"epoch": 0.7016072059342988,
"grad_norm": 1.8984375,
"learning_rate": 0.0004957627322461448,
"loss": 5.9721,
"mean_token_accuracy": 0.15395658761262893,
"num_tokens": 14839974.0,
"step": 7945
},
{
"entropy": 6.20572566986084,
"epoch": 0.7020487460261392,
"grad_norm": 2.28125,
"learning_rate": 0.0004957566472529139,
"loss": 6.0807,
"mean_token_accuracy": 0.1480936288833618,
"num_tokens": 14849551.0,
"step": 7950
},
{
"entropy": 6.222087621688843,
"epoch": 0.7024902861179795,
"grad_norm": 2.171875,
"learning_rate": 0.0004957505579351858,
"loss": 6.007,
"mean_token_accuracy": 0.1552036628127098,
"num_tokens": 14859011.0,
"step": 7955
},
{
"entropy": 6.159627532958984,
"epoch": 0.7029318262098199,
"grad_norm": 2.234375,
"learning_rate": 0.0004957444642930798,
"loss": 5.9619,
"mean_token_accuracy": 0.15881793648004533,
"num_tokens": 14867948.0,
"step": 7960
},
{
"entropy": 6.186864185333252,
"epoch": 0.7033733663016601,
"grad_norm": 1.890625,
"learning_rate": 0.0004957383663267152,
"loss": 6.0275,
"mean_token_accuracy": 0.15494029894471167,
"num_tokens": 14877233.0,
"step": 7965
},
{
"entropy": 6.2205883979797365,
"epoch": 0.7038149063935005,
"grad_norm": 1.8828125,
"learning_rate": 0.0004957322640362118,
"loss": 6.0418,
"mean_token_accuracy": 0.1551240026950836,
"num_tokens": 14887439.0,
"step": 7970
},
{
"entropy": 6.327660989761353,
"epoch": 0.7042564464853409,
"grad_norm": 1.75,
"learning_rate": 0.0004957261574216887,
"loss": 6.1012,
"mean_token_accuracy": 0.15123100578784943,
"num_tokens": 14897064.0,
"step": 7975
},
{
"entropy": 6.2104428768157955,
"epoch": 0.7046979865771812,
"grad_norm": 2.359375,
"learning_rate": 0.0004957200464832656,
"loss": 6.0699,
"mean_token_accuracy": 0.14506227374076844,
"num_tokens": 14907054.0,
"step": 7980
},
{
"entropy": 6.188334894180298,
"epoch": 0.7051395266690216,
"grad_norm": 2.125,
"learning_rate": 0.0004957139312210626,
"loss": 6.0287,
"mean_token_accuracy": 0.15283627659082413,
"num_tokens": 14916969.0,
"step": 7985
},
{
"entropy": 6.236026954650879,
"epoch": 0.7055810667608619,
"grad_norm": 1.984375,
"learning_rate": 0.000495707811635199,
"loss": 6.0549,
"mean_token_accuracy": 0.1538621038198471,
"num_tokens": 14926404.0,
"step": 7990
},
{
"entropy": 6.2148487091064455,
"epoch": 0.7060226068527022,
"grad_norm": 2.21875,
"learning_rate": 0.0004957016877257949,
"loss": 6.0189,
"mean_token_accuracy": 0.15292533934116365,
"num_tokens": 14935693.0,
"step": 7995
},
{
"entropy": 6.207205963134766,
"epoch": 0.7064641469445425,
"grad_norm": 1.9296875,
"learning_rate": 0.0004956955594929704,
"loss": 5.9647,
"mean_token_accuracy": 0.1577726759016514,
"num_tokens": 14945147.0,
"step": 8000
},
{
"entropy": 6.177611207962036,
"epoch": 0.7069056870363829,
"grad_norm": 3.734375,
"learning_rate": 0.0004956894269368454,
"loss": 6.0077,
"mean_token_accuracy": 0.15413163900375365,
"num_tokens": 14954022.0,
"step": 8005
},
{
"entropy": 6.099345397949219,
"epoch": 0.7073472271282233,
"grad_norm": 1.90625,
"learning_rate": 0.0004956832900575399,
"loss": 6.0193,
"mean_token_accuracy": 0.15245394557714462,
"num_tokens": 14962977.0,
"step": 8010
},
{
"entropy": 6.157639408111573,
"epoch": 0.7077887672200636,
"grad_norm": 2.4375,
"learning_rate": 0.0004956771488551742,
"loss": 6.0603,
"mean_token_accuracy": 0.15071365088224412,
"num_tokens": 14973420.0,
"step": 8015
},
{
"entropy": 6.239572954177857,
"epoch": 0.708230307311904,
"grad_norm": 2.8125,
"learning_rate": 0.0004956710033298689,
"loss": 6.0173,
"mean_token_accuracy": 0.15658407807350158,
"num_tokens": 14981762.0,
"step": 8020
},
{
"entropy": 6.302951097488403,
"epoch": 0.7086718474037442,
"grad_norm": 2.328125,
"learning_rate": 0.000495664853481744,
"loss": 6.0903,
"mean_token_accuracy": 0.14736679941415787,
"num_tokens": 14991449.0,
"step": 8025
},
{
"entropy": 6.2615893363952635,
"epoch": 0.7091133874955846,
"grad_norm": 2.0,
"learning_rate": 0.0004956586993109201,
"loss": 6.0125,
"mean_token_accuracy": 0.15616520941257478,
"num_tokens": 15000802.0,
"step": 8030
},
{
"entropy": 6.105866622924805,
"epoch": 0.7095549275874249,
"grad_norm": 2.15625,
"learning_rate": 0.0004956525408175179,
"loss": 6.0313,
"mean_token_accuracy": 0.1552100345492363,
"num_tokens": 15010580.0,
"step": 8035
},
{
"entropy": 6.132424592971802,
"epoch": 0.7099964676792653,
"grad_norm": 1.9140625,
"learning_rate": 0.0004956463780016578,
"loss": 6.0584,
"mean_token_accuracy": 0.14935311377048494,
"num_tokens": 15020059.0,
"step": 8040
},
{
"entropy": 6.241670608520508,
"epoch": 0.7104380077711057,
"grad_norm": 2.140625,
"learning_rate": 0.0004956402108634607,
"loss": 6.0088,
"mean_token_accuracy": 0.1565178796648979,
"num_tokens": 15030268.0,
"step": 8045
},
{
"entropy": 6.200330638885498,
"epoch": 0.7108795478629459,
"grad_norm": 2.046875,
"learning_rate": 0.0004956340394030473,
"loss": 5.9875,
"mean_token_accuracy": 0.15514944046735762,
"num_tokens": 15038865.0,
"step": 8050
},
{
"entropy": 6.282695722579956,
"epoch": 0.7113210879547863,
"grad_norm": 1.9609375,
"learning_rate": 0.0004956278636205386,
"loss": 6.1354,
"mean_token_accuracy": 0.1421603739261627,
"num_tokens": 15048427.0,
"step": 8055
},
{
"entropy": 6.177859306335449,
"epoch": 0.7117626280466266,
"grad_norm": 2.203125,
"learning_rate": 0.0004956216835160556,
"loss": 5.9996,
"mean_token_accuracy": 0.15979120433330535,
"num_tokens": 15057366.0,
"step": 8060
},
{
"entropy": 6.217433261871338,
"epoch": 0.712204168138467,
"grad_norm": 2.015625,
"learning_rate": 0.0004956154990897191,
"loss": 6.0384,
"mean_token_accuracy": 0.15537583380937575,
"num_tokens": 15067098.0,
"step": 8065
},
{
"entropy": 6.192469930648803,
"epoch": 0.7126457082303073,
"grad_norm": 2.5,
"learning_rate": 0.0004956093103416505,
"loss": 6.0311,
"mean_token_accuracy": 0.15546699613332748,
"num_tokens": 15075734.0,
"step": 8070
},
{
"entropy": 6.2102759838104244,
"epoch": 0.7130872483221476,
"grad_norm": 1.953125,
"learning_rate": 0.0004956031172719711,
"loss": 6.073,
"mean_token_accuracy": 0.1536272294819355,
"num_tokens": 15084625.0,
"step": 8075
},
{
"entropy": 6.101073455810547,
"epoch": 0.713528788413988,
"grad_norm": 2.015625,
"learning_rate": 0.0004955969198808021,
"loss": 5.8924,
"mean_token_accuracy": 0.1668921247124672,
"num_tokens": 15093256.0,
"step": 8080
},
{
"entropy": 6.102929306030274,
"epoch": 0.7139703285058283,
"grad_norm": 2.0,
"learning_rate": 0.0004955907181682648,
"loss": 5.9618,
"mean_token_accuracy": 0.16315532177686692,
"num_tokens": 15103175.0,
"step": 8085
},
{
"entropy": 6.144030427932739,
"epoch": 0.7144118685976687,
"grad_norm": 2.296875,
"learning_rate": 0.0004955845121344809,
"loss": 6.0469,
"mean_token_accuracy": 0.1541796073317528,
"num_tokens": 15112789.0,
"step": 8090
},
{
"entropy": 6.204605007171631,
"epoch": 0.714853408689509,
"grad_norm": 2.140625,
"learning_rate": 0.0004955783017795717,
"loss": 6.0605,
"mean_token_accuracy": 0.15732798725366592,
"num_tokens": 15121869.0,
"step": 8095
},
{
"entropy": 6.189707899093628,
"epoch": 0.7152949487813494,
"grad_norm": 2.03125,
"learning_rate": 0.000495572087103659,
"loss": 5.9738,
"mean_token_accuracy": 0.15560177564620972,
"num_tokens": 15131441.0,
"step": 8100
},
{
"entropy": 6.137331628799439,
"epoch": 0.7157364888731896,
"grad_norm": 2.3125,
"learning_rate": 0.0004955658681068647,
"loss": 6.0193,
"mean_token_accuracy": 0.15403990298509598,
"num_tokens": 15140641.0,
"step": 8105
},
{
"entropy": 6.19461874961853,
"epoch": 0.71617802896503,
"grad_norm": 1.765625,
"learning_rate": 0.0004955596447893105,
"loss": 6.0101,
"mean_token_accuracy": 0.15569014549255372,
"num_tokens": 15150073.0,
"step": 8110
},
{
"entropy": 6.098717784881591,
"epoch": 0.7166195690568704,
"grad_norm": 2.125,
"learning_rate": 0.0004955534171511181,
"loss": 5.7712,
"mean_token_accuracy": 0.17266993075609208,
"num_tokens": 15159879.0,
"step": 8115
},
{
"entropy": 6.118933868408203,
"epoch": 0.7170611091487107,
"grad_norm": 1.953125,
"learning_rate": 0.00049554718519241,
"loss": 5.9694,
"mean_token_accuracy": 0.1589986950159073,
"num_tokens": 15168316.0,
"step": 8120
},
{
"entropy": 6.1255974769592285,
"epoch": 0.7175026492405511,
"grad_norm": 3.109375,
"learning_rate": 0.0004955409489133078,
"loss": 6.0004,
"mean_token_accuracy": 0.15388742089271545,
"num_tokens": 15176700.0,
"step": 8125
},
{
"entropy": 6.20945520401001,
"epoch": 0.7179441893323913,
"grad_norm": 2.484375,
"learning_rate": 0.0004955347083139338,
"loss": 6.0261,
"mean_token_accuracy": 0.1599735736846924,
"num_tokens": 15185997.0,
"step": 8130
},
{
"entropy": 6.116842317581177,
"epoch": 0.7183857294242317,
"grad_norm": 2.671875,
"learning_rate": 0.0004955284633944104,
"loss": 6.0101,
"mean_token_accuracy": 0.15412014573812485,
"num_tokens": 15195341.0,
"step": 8135
},
{
"entropy": 6.185818815231324,
"epoch": 0.718827269516072,
"grad_norm": 3.0,
"learning_rate": 0.0004955222141548597,
"loss": 6.0459,
"mean_token_accuracy": 0.15609263628721237,
"num_tokens": 15205501.0,
"step": 8140
},
{
"entropy": 6.136814928054809,
"epoch": 0.7192688096079124,
"grad_norm": 1.96875,
"learning_rate": 0.0004955159605954043,
"loss": 5.9916,
"mean_token_accuracy": 0.15846392139792442,
"num_tokens": 15214778.0,
"step": 8145
},
{
"entropy": 6.288878870010376,
"epoch": 0.7197103496997528,
"grad_norm": 5.03125,
"learning_rate": 0.0004955097027161666,
"loss": 6.0159,
"mean_token_accuracy": 0.1611801378428936,
"num_tokens": 15224201.0,
"step": 8150
},
{
"entropy": 6.287253952026367,
"epoch": 0.7201518897915931,
"grad_norm": 2.921875,
"learning_rate": 0.0004955034405172693,
"loss": 5.9812,
"mean_token_accuracy": 0.16084180772304535,
"num_tokens": 15233472.0,
"step": 8155
},
{
"entropy": 6.245111751556396,
"epoch": 0.7205934298834334,
"grad_norm": 2.21875,
"learning_rate": 0.000495497173998835,
"loss": 6.0336,
"mean_token_accuracy": 0.15393038243055343,
"num_tokens": 15242323.0,
"step": 8160
},
{
"entropy": 6.148213624954224,
"epoch": 0.7210349699752737,
"grad_norm": 2.328125,
"learning_rate": 0.0004954909031609864,
"loss": 6.0538,
"mean_token_accuracy": 0.15215684324502946,
"num_tokens": 15252952.0,
"step": 8165
},
{
"entropy": 6.181010341644287,
"epoch": 0.7214765100671141,
"grad_norm": 2.296875,
"learning_rate": 0.0004954846280038465,
"loss": 6.0217,
"mean_token_accuracy": 0.15112778842449187,
"num_tokens": 15261815.0,
"step": 8170
},
{
"entropy": 6.211622905731201,
"epoch": 0.7219180501589544,
"grad_norm": 1.9921875,
"learning_rate": 0.0004954783485275381,
"loss": 6.0724,
"mean_token_accuracy": 0.1537321016192436,
"num_tokens": 15271026.0,
"step": 8175
},
{
"entropy": 6.138492250442505,
"epoch": 0.7223595902507948,
"grad_norm": 2.5625,
"learning_rate": 0.0004954720647321843,
"loss": 5.9284,
"mean_token_accuracy": 0.16433208882808686,
"num_tokens": 15279795.0,
"step": 8180
},
{
"entropy": 6.1683433055877686,
"epoch": 0.7228011303426352,
"grad_norm": 1.8046875,
"learning_rate": 0.0004954657766179081,
"loss": 6.0374,
"mean_token_accuracy": 0.151440542191267,
"num_tokens": 15289113.0,
"step": 8185
},
{
"entropy": 6.117907285690308,
"epoch": 0.7232426704344754,
"grad_norm": 2.578125,
"learning_rate": 0.0004954594841848327,
"loss": 5.9016,
"mean_token_accuracy": 0.16442391872406006,
"num_tokens": 15298271.0,
"step": 8190
},
{
"entropy": 6.252900695800781,
"epoch": 0.7236842105263158,
"grad_norm": 2.390625,
"learning_rate": 0.0004954531874330814,
"loss": 5.9948,
"mean_token_accuracy": 0.1522049143910408,
"num_tokens": 15307677.0,
"step": 8195
},
{
"entropy": 6.165901708602905,
"epoch": 0.7241257506181561,
"grad_norm": 1.796875,
"learning_rate": 0.0004954468863627774,
"loss": 5.9982,
"mean_token_accuracy": 0.15651184022426606,
"num_tokens": 15316637.0,
"step": 8200
},
{
"entropy": 6.1402503490448,
"epoch": 0.7245672907099965,
"grad_norm": 2.6875,
"learning_rate": 0.0004954405809740445,
"loss": 5.9851,
"mean_token_accuracy": 0.15237015783786773,
"num_tokens": 15325221.0,
"step": 8205
},
{
"entropy": 6.182305383682251,
"epoch": 0.7250088308018368,
"grad_norm": 1.8515625,
"learning_rate": 0.0004954342712670058,
"loss": 6.0363,
"mean_token_accuracy": 0.15432765632867812,
"num_tokens": 15335877.0,
"step": 8210
},
{
"entropy": 6.196657276153564,
"epoch": 0.7254503708936771,
"grad_norm": 2.46875,
"learning_rate": 0.0004954279572417852,
"loss": 6.0317,
"mean_token_accuracy": 0.15272038280963898,
"num_tokens": 15345096.0,
"step": 8215
},
{
"entropy": 6.151156330108643,
"epoch": 0.7258919109855175,
"grad_norm": 1.8515625,
"learning_rate": 0.0004954216388985063,
"loss": 5.8724,
"mean_token_accuracy": 0.16933880299329757,
"num_tokens": 15353785.0,
"step": 8220
},
{
"entropy": 6.138664054870605,
"epoch": 0.7263334510773578,
"grad_norm": 2.8125,
"learning_rate": 0.0004954153162372928,
"loss": 5.9699,
"mean_token_accuracy": 0.15810664743185043,
"num_tokens": 15362761.0,
"step": 8225
},
{
"entropy": 6.1775671482086185,
"epoch": 0.7267749911691982,
"grad_norm": 2.40625,
"learning_rate": 0.0004954089892582686,
"loss": 5.9502,
"mean_token_accuracy": 0.15694193840026854,
"num_tokens": 15371951.0,
"step": 8230
},
{
"entropy": 6.154006862640381,
"epoch": 0.7272165312610385,
"grad_norm": 2.03125,
"learning_rate": 0.0004954026579615577,
"loss": 6.035,
"mean_token_accuracy": 0.15585743859410287,
"num_tokens": 15380277.0,
"step": 8235
},
{
"entropy": 6.1166462898254395,
"epoch": 0.7276580713528789,
"grad_norm": 2.90625,
"learning_rate": 0.0004953963223472841,
"loss": 6.0501,
"mean_token_accuracy": 0.152119879424572,
"num_tokens": 15390951.0,
"step": 8240
},
{
"entropy": 6.230410432815551,
"epoch": 0.7280996114447191,
"grad_norm": 2.53125,
"learning_rate": 0.0004953899824155718,
"loss": 5.9975,
"mean_token_accuracy": 0.1529814049601555,
"num_tokens": 15399394.0,
"step": 8245
},
{
"entropy": 6.199048280715942,
"epoch": 0.7285411515365595,
"grad_norm": 2.078125,
"learning_rate": 0.0004953836381665452,
"loss": 5.9384,
"mean_token_accuracy": 0.16169310212135315,
"num_tokens": 15408644.0,
"step": 8250
},
{
"entropy": 6.229496145248413,
"epoch": 0.7289826916283999,
"grad_norm": 2.75,
"learning_rate": 0.0004953772896003284,
"loss": 6.0229,
"mean_token_accuracy": 0.15219994485378266,
"num_tokens": 15417398.0,
"step": 8255
},
{
"entropy": 6.18380217552185,
"epoch": 0.7294242317202402,
"grad_norm": 2.6875,
"learning_rate": 0.0004953709367170458,
"loss": 6.0979,
"mean_token_accuracy": 0.14707581102848052,
"num_tokens": 15426532.0,
"step": 8260
},
{
"entropy": 6.205737209320068,
"epoch": 0.7298657718120806,
"grad_norm": 2.5,
"learning_rate": 0.000495364579516822,
"loss": 6.087,
"mean_token_accuracy": 0.15145862251520156,
"num_tokens": 15436371.0,
"step": 8265
},
{
"entropy": 6.250464200973511,
"epoch": 0.7303073119039208,
"grad_norm": 1.8203125,
"learning_rate": 0.0004953582179997813,
"loss": 6.1247,
"mean_token_accuracy": 0.14918783605098723,
"num_tokens": 15446600.0,
"step": 8270
},
{
"entropy": 6.218456268310547,
"epoch": 0.7307488519957612,
"grad_norm": 2.515625,
"learning_rate": 0.0004953518521660484,
"loss": 5.9647,
"mean_token_accuracy": 0.1545114502310753,
"num_tokens": 15455547.0,
"step": 8275
},
{
"entropy": 6.165512323379517,
"epoch": 0.7311903920876015,
"grad_norm": 1.7265625,
"learning_rate": 0.0004953454820157481,
"loss": 6.0138,
"mean_token_accuracy": 0.153198678791523,
"num_tokens": 15464543.0,
"step": 8280
},
{
"entropy": 6.280844497680664,
"epoch": 0.7316319321794419,
"grad_norm": 1.8984375,
"learning_rate": 0.0004953391075490051,
"loss": 6.1253,
"mean_token_accuracy": 0.14796603918075563,
"num_tokens": 15473626.0,
"step": 8285
},
{
"entropy": 6.2266065120697025,
"epoch": 0.7320734722712823,
"grad_norm": 2.28125,
"learning_rate": 0.0004953327287659444,
"loss": 6.0639,
"mean_token_accuracy": 0.15035302489995955,
"num_tokens": 15484164.0,
"step": 8290
},
{
"entropy": 6.316344976425171,
"epoch": 0.7325150123631226,
"grad_norm": 3.546875,
"learning_rate": 0.0004953263456666907,
"loss": 6.0694,
"mean_token_accuracy": 0.14661551713943483,
"num_tokens": 15493718.0,
"step": 8295
},
{
"entropy": 6.210640335083008,
"epoch": 0.7329565524549629,
"grad_norm": 2.140625,
"learning_rate": 0.0004953199582513693,
"loss": 5.9896,
"mean_token_accuracy": 0.15981052368879317,
"num_tokens": 15503339.0,
"step": 8300
},
{
"entropy": 6.206534719467163,
"epoch": 0.7333980925468032,
"grad_norm": 2.109375,
"learning_rate": 0.0004953135665201052,
"loss": 5.9813,
"mean_token_accuracy": 0.1627606123685837,
"num_tokens": 15513314.0,
"step": 8305
},
{
"entropy": 6.265380430221557,
"epoch": 0.7338396326386436,
"grad_norm": 2.5,
"learning_rate": 0.0004953071704730237,
"loss": 6.0648,
"mean_token_accuracy": 0.15312278568744658,
"num_tokens": 15522943.0,
"step": 8310
},
{
"entropy": 6.231940984725952,
"epoch": 0.7342811727304839,
"grad_norm": 2.28125,
"learning_rate": 0.0004953007701102499,
"loss": 6.0337,
"mean_token_accuracy": 0.15085222870111464,
"num_tokens": 15531975.0,
"step": 8315
},
{
"entropy": 6.169845247268677,
"epoch": 0.7347227128223243,
"grad_norm": 2.21875,
"learning_rate": 0.0004952943654319094,
"loss": 5.9786,
"mean_token_accuracy": 0.15557436197996138,
"num_tokens": 15541139.0,
"step": 8320
},
{
"entropy": 6.169338655471802,
"epoch": 0.7351642529141647,
"grad_norm": 2.328125,
"learning_rate": 0.0004952879564381276,
"loss": 6.0413,
"mean_token_accuracy": 0.15694883614778518,
"num_tokens": 15550604.0,
"step": 8325
},
{
"entropy": 6.152047348022461,
"epoch": 0.7356057930060049,
"grad_norm": 1.8828125,
"learning_rate": 0.0004952815431290298,
"loss": 5.9537,
"mean_token_accuracy": 0.1595415860414505,
"num_tokens": 15558995.0,
"step": 8330
},
{
"entropy": 6.275175952911377,
"epoch": 0.7360473330978453,
"grad_norm": 2.546875,
"learning_rate": 0.000495275125504742,
"loss": 6.0278,
"mean_token_accuracy": 0.15613498240709306,
"num_tokens": 15568229.0,
"step": 8335
},
{
"entropy": 6.14049506187439,
"epoch": 0.7364888731896856,
"grad_norm": 1.765625,
"learning_rate": 0.0004952687035653899,
"loss": 5.9771,
"mean_token_accuracy": 0.15214631259441375,
"num_tokens": 15577042.0,
"step": 8340
},
{
"entropy": 6.137394666671753,
"epoch": 0.736930413281526,
"grad_norm": 1.8046875,
"learning_rate": 0.0004952622773110989,
"loss": 5.9003,
"mean_token_accuracy": 0.16799579858779906,
"num_tokens": 15585825.0,
"step": 8345
},
{
"entropy": 6.182384014129639,
"epoch": 0.7373719533733663,
"grad_norm": 3.71875,
"learning_rate": 0.0004952558467419953,
"loss": 5.9035,
"mean_token_accuracy": 0.16247234046459197,
"num_tokens": 15595486.0,
"step": 8350
},
{
"entropy": 6.171746444702149,
"epoch": 0.7378134934652066,
"grad_norm": 6.0,
"learning_rate": 0.000495249411858205,
"loss": 5.9618,
"mean_token_accuracy": 0.14454634860157967,
"num_tokens": 15605312.0,
"step": 8355
},
{
"entropy": 6.100625085830688,
"epoch": 0.738255033557047,
"grad_norm": 2.484375,
"learning_rate": 0.0004952429726598538,
"loss": 5.9682,
"mean_token_accuracy": 0.1587691068649292,
"num_tokens": 15615185.0,
"step": 8360
},
{
"entropy": 6.209043741226196,
"epoch": 0.7386965736488873,
"grad_norm": 2.390625,
"learning_rate": 0.0004952365291470682,
"loss": 6.0665,
"mean_token_accuracy": 0.15307985991239548,
"num_tokens": 15625259.0,
"step": 8365
},
{
"entropy": 6.267195034027099,
"epoch": 0.7391381137407277,
"grad_norm": 1.890625,
"learning_rate": 0.0004952300813199742,
"loss": 6.0527,
"mean_token_accuracy": 0.15336710289120675,
"num_tokens": 15635040.0,
"step": 8370
},
{
"entropy": 6.244267320632934,
"epoch": 0.739579653832568,
"grad_norm": 2.171875,
"learning_rate": 0.0004952236291786981,
"loss": 6.0663,
"mean_token_accuracy": 0.15102097690105437,
"num_tokens": 15644996.0,
"step": 8375
},
{
"entropy": 6.1261107444763185,
"epoch": 0.7400211939244083,
"grad_norm": 2.421875,
"learning_rate": 0.0004952171727233665,
"loss": 5.9584,
"mean_token_accuracy": 0.15442091524600982,
"num_tokens": 15654598.0,
"step": 8380
},
{
"entropy": 6.2025392055511475,
"epoch": 0.7404627340162486,
"grad_norm": 3.09375,
"learning_rate": 0.0004952107119541055,
"loss": 5.9911,
"mean_token_accuracy": 0.1527467727661133,
"num_tokens": 15664213.0,
"step": 8385
},
{
"entropy": 6.142297172546387,
"epoch": 0.740904274108089,
"grad_norm": 2.765625,
"learning_rate": 0.0004952042468710421,
"loss": 6.0431,
"mean_token_accuracy": 0.15506284832954406,
"num_tokens": 15673595.0,
"step": 8390
},
{
"entropy": 6.190773963928223,
"epoch": 0.7413458141999294,
"grad_norm": 2.28125,
"learning_rate": 0.0004951977774743027,
"loss": 6.1065,
"mean_token_accuracy": 0.14471191465854644,
"num_tokens": 15682753.0,
"step": 8395
},
{
"entropy": 6.180733728408813,
"epoch": 0.7417873542917697,
"grad_norm": 2.265625,
"learning_rate": 0.0004951913037640139,
"loss": 5.9113,
"mean_token_accuracy": 0.16720414012670518,
"num_tokens": 15691508.0,
"step": 8400
},
{
"entropy": 6.121179008483887,
"epoch": 0.7422288943836101,
"grad_norm": 2.171875,
"learning_rate": 0.0004951848257403029,
"loss": 5.9028,
"mean_token_accuracy": 0.15747786164283753,
"num_tokens": 15701110.0,
"step": 8405
},
{
"entropy": 6.08272123336792,
"epoch": 0.7426704344754503,
"grad_norm": 2.625,
"learning_rate": 0.0004951783434032963,
"loss": 5.8728,
"mean_token_accuracy": 0.164331416785717,
"num_tokens": 15710565.0,
"step": 8410
},
{
"entropy": 6.2023955345153805,
"epoch": 0.7431119745672907,
"grad_norm": 2.234375,
"learning_rate": 0.0004951718567531211,
"loss": 6.0323,
"mean_token_accuracy": 0.15471521392464638,
"num_tokens": 15718364.0,
"step": 8415
},
{
"entropy": 6.212370777130127,
"epoch": 0.743553514659131,
"grad_norm": 2.109375,
"learning_rate": 0.0004951653657899045,
"loss": 6.1132,
"mean_token_accuracy": 0.14646557569503785,
"num_tokens": 15729127.0,
"step": 8420
},
{
"entropy": 6.194227457046509,
"epoch": 0.7439950547509714,
"grad_norm": 2.203125,
"learning_rate": 0.0004951588705137737,
"loss": 6.0708,
"mean_token_accuracy": 0.1511780470609665,
"num_tokens": 15738491.0,
"step": 8425
},
{
"entropy": 6.251719379425049,
"epoch": 0.7444365948428118,
"grad_norm": 2.3125,
"learning_rate": 0.0004951523709248557,
"loss": 5.9506,
"mean_token_accuracy": 0.1640294149518013,
"num_tokens": 15748346.0,
"step": 8430
},
{
"entropy": 6.168902730941772,
"epoch": 0.744878134934652,
"grad_norm": 2.359375,
"learning_rate": 0.000495145867023278,
"loss": 5.9772,
"mean_token_accuracy": 0.16299238950014114,
"num_tokens": 15757242.0,
"step": 8435
},
{
"entropy": 6.272220706939697,
"epoch": 0.7453196750264924,
"grad_norm": 2.515625,
"learning_rate": 0.000495139358809168,
"loss": 6.0206,
"mean_token_accuracy": 0.15597838014364243,
"num_tokens": 15767236.0,
"step": 8440
},
{
"entropy": 6.231273603439331,
"epoch": 0.7457612151183327,
"grad_norm": 2.53125,
"learning_rate": 0.0004951328462826532,
"loss": 6.0656,
"mean_token_accuracy": 0.14785979986190795,
"num_tokens": 15776977.0,
"step": 8445
},
{
"entropy": 6.1693408489227295,
"epoch": 0.7462027552101731,
"grad_norm": 2.828125,
"learning_rate": 0.0004951263294438611,
"loss": 5.9554,
"mean_token_accuracy": 0.15859422236680984,
"num_tokens": 15787333.0,
"step": 8450
},
{
"entropy": 6.130995225906372,
"epoch": 0.7466442953020134,
"grad_norm": 2.421875,
"learning_rate": 0.0004951198082929194,
"loss": 5.8685,
"mean_token_accuracy": 0.16755239814519882,
"num_tokens": 15794773.0,
"step": 8455
},
{
"entropy": 6.08733286857605,
"epoch": 0.7470858353938538,
"grad_norm": 2.765625,
"learning_rate": 0.0004951132828299558,
"loss": 5.9636,
"mean_token_accuracy": 0.16573742181062698,
"num_tokens": 15803803.0,
"step": 8460
},
{
"entropy": 6.172519779205322,
"epoch": 0.7475273754856941,
"grad_norm": 2.046875,
"learning_rate": 0.0004951067530550982,
"loss": 6.0095,
"mean_token_accuracy": 0.15405793190002443,
"num_tokens": 15814021.0,
"step": 8465
},
{
"entropy": 6.209099340438843,
"epoch": 0.7479689155775344,
"grad_norm": 2.171875,
"learning_rate": 0.0004951002189684745,
"loss": 5.9937,
"mean_token_accuracy": 0.15232694447040557,
"num_tokens": 15822974.0,
"step": 8470
},
{
"entropy": 6.133933877944946,
"epoch": 0.7484104556693748,
"grad_norm": 5.0,
"learning_rate": 0.0004950936805702127,
"loss": 5.8909,
"mean_token_accuracy": 0.16856021732091903,
"num_tokens": 15832202.0,
"step": 8475
},
{
"entropy": 6.188068151473999,
"epoch": 0.7488519957612151,
"grad_norm": 2.234375,
"learning_rate": 0.0004950871378604409,
"loss": 6.007,
"mean_token_accuracy": 0.16055386513471603,
"num_tokens": 15841223.0,
"step": 8480
},
{
"entropy": 6.148092460632324,
"epoch": 0.7492935358530555,
"grad_norm": 3.375,
"learning_rate": 0.0004950805908392872,
"loss": 5.9876,
"mean_token_accuracy": 0.15736652314662933,
"num_tokens": 15850260.0,
"step": 8485
},
{
"entropy": 6.113380336761475,
"epoch": 0.7497350759448957,
"grad_norm": 3.609375,
"learning_rate": 0.0004950740395068799,
"loss": 6.0402,
"mean_token_accuracy": 0.15413001626729966,
"num_tokens": 15859780.0,
"step": 8490
},
{
"entropy": 6.19255747795105,
"epoch": 0.7501766160367361,
"grad_norm": 2.25,
"learning_rate": 0.0004950674838633473,
"loss": 5.9852,
"mean_token_accuracy": 0.15405904054641723,
"num_tokens": 15868331.0,
"step": 8495
},
{
"entropy": 6.168982124328613,
"epoch": 0.7506181561285765,
"grad_norm": 2.953125,
"learning_rate": 0.0004950609239088178,
"loss": 6.0518,
"mean_token_accuracy": 0.1502481520175934,
"num_tokens": 15877359.0,
"step": 8500
},
{
"entropy": 6.1584141731262205,
"epoch": 0.7510596962204168,
"grad_norm": 2.90625,
"learning_rate": 0.0004950543596434201,
"loss": 5.9389,
"mean_token_accuracy": 0.1636333480477333,
"num_tokens": 15886976.0,
"step": 8505
},
{
"entropy": 6.078968238830567,
"epoch": 0.7515012363122572,
"grad_norm": 2.140625,
"learning_rate": 0.0004950477910672825,
"loss": 6.0163,
"mean_token_accuracy": 0.15548164248466492,
"num_tokens": 15896139.0,
"step": 8510
},
{
"entropy": 6.216708183288574,
"epoch": 0.7519427764040975,
"grad_norm": 1.7578125,
"learning_rate": 0.000495041218180534,
"loss": 5.9989,
"mean_token_accuracy": 0.16013481318950654,
"num_tokens": 15904672.0,
"step": 8515
},
{
"entropy": 6.133269357681274,
"epoch": 0.7523843164959378,
"grad_norm": 1.921875,
"learning_rate": 0.000495034640983303,
"loss": 5.8667,
"mean_token_accuracy": 0.16843710839748383,
"num_tokens": 15912716.0,
"step": 8520
},
{
"entropy": 6.134620475769043,
"epoch": 0.7528258565877781,
"grad_norm": 5.5,
"learning_rate": 0.0004950280594757186,
"loss": 5.9746,
"mean_token_accuracy": 0.15392025411128998,
"num_tokens": 15921974.0,
"step": 8525
},
{
"entropy": 6.210237741470337,
"epoch": 0.7532673966796185,
"grad_norm": 2.140625,
"learning_rate": 0.0004950214736579097,
"loss": 5.9908,
"mean_token_accuracy": 0.15580060631036757,
"num_tokens": 15930859.0,
"step": 8530
},
{
"entropy": 6.125013971328736,
"epoch": 0.7537089367714589,
"grad_norm": 2.15625,
"learning_rate": 0.0004950148835300051,
"loss": 5.9076,
"mean_token_accuracy": 0.16171641200780867,
"num_tokens": 15940052.0,
"step": 8535
},
{
"entropy": 6.11407995223999,
"epoch": 0.7541504768632992,
"grad_norm": 2.546875,
"learning_rate": 0.0004950082890921341,
"loss": 5.9867,
"mean_token_accuracy": 0.1578494466841221,
"num_tokens": 15948422.0,
"step": 8540
},
{
"entropy": 6.157030868530273,
"epoch": 0.7545920169551396,
"grad_norm": 2.265625,
"learning_rate": 0.0004950016903444261,
"loss": 6.0618,
"mean_token_accuracy": 0.15601774156093598,
"num_tokens": 15957433.0,
"step": 8545
},
{
"entropy": 6.269704675674438,
"epoch": 0.7550335570469798,
"grad_norm": 2.0,
"learning_rate": 0.0004949950872870099,
"loss": 5.988,
"mean_token_accuracy": 0.1615738093852997,
"num_tokens": 15966542.0,
"step": 8550
},
{
"entropy": 6.254258298873902,
"epoch": 0.7554750971388202,
"grad_norm": 2.375,
"learning_rate": 0.000494988479920015,
"loss": 6.1397,
"mean_token_accuracy": 0.1473035305738449,
"num_tokens": 15977067.0,
"step": 8555
},
{
"entropy": 6.227912759780883,
"epoch": 0.7559166372306605,
"grad_norm": 2.25,
"learning_rate": 0.000494981868243571,
"loss": 6.0394,
"mean_token_accuracy": 0.15444127321243287,
"num_tokens": 15986502.0,
"step": 8560
},
{
"entropy": 6.279629898071289,
"epoch": 0.7563581773225009,
"grad_norm": 2.09375,
"learning_rate": 0.0004949752522578073,
"loss": 6.0964,
"mean_token_accuracy": 0.1465997241437435,
"num_tokens": 15996788.0,
"step": 8565
},
{
"entropy": 6.169799137115478,
"epoch": 0.7567997174143413,
"grad_norm": 2.265625,
"learning_rate": 0.0004949686319628535,
"loss": 5.9954,
"mean_token_accuracy": 0.1538490191102028,
"num_tokens": 16007212.0,
"step": 8570
},
{
"entropy": 6.133602476119995,
"epoch": 0.7572412575061815,
"grad_norm": 1.890625,
"learning_rate": 0.0004949620073588394,
"loss": 6.0182,
"mean_token_accuracy": 0.15578313320875167,
"num_tokens": 16017000.0,
"step": 8575
},
{
"entropy": 6.281605195999146,
"epoch": 0.7576827975980219,
"grad_norm": 1.6015625,
"learning_rate": 0.0004949553784458945,
"loss": 6.1126,
"mean_token_accuracy": 0.14807434976100922,
"num_tokens": 16026647.0,
"step": 8580
},
{
"entropy": 6.1851507186889645,
"epoch": 0.7581243376898622,
"grad_norm": 2.09375,
"learning_rate": 0.0004949487452241489,
"loss": 5.844,
"mean_token_accuracy": 0.1705327793955803,
"num_tokens": 16034773.0,
"step": 8585
},
{
"entropy": 6.19845027923584,
"epoch": 0.7585658777817026,
"grad_norm": 1.8125,
"learning_rate": 0.0004949421076937325,
"loss": 5.9807,
"mean_token_accuracy": 0.15956246256828308,
"num_tokens": 16043787.0,
"step": 8590
},
{
"entropy": 6.062042713165283,
"epoch": 0.7590074178735429,
"grad_norm": 11.8125,
"learning_rate": 0.0004949354658547753,
"loss": 5.9444,
"mean_token_accuracy": 0.1681981384754181,
"num_tokens": 16053130.0,
"step": 8595
},
{
"entropy": 6.098703050613404,
"epoch": 0.7594489579653833,
"grad_norm": 2.03125,
"learning_rate": 0.0004949288197074074,
"loss": 6.1009,
"mean_token_accuracy": 0.15323710292577744,
"num_tokens": 16062529.0,
"step": 8600
},
{
"entropy": 6.109501838684082,
"epoch": 0.7598904980572236,
"grad_norm": 2.078125,
"learning_rate": 0.0004949221692517589,
"loss": 5.96,
"mean_token_accuracy": 0.14846655800938607,
"num_tokens": 16071932.0,
"step": 8605
},
{
"entropy": 6.240110111236572,
"epoch": 0.7603320381490639,
"grad_norm": 2.453125,
"learning_rate": 0.0004949155144879602,
"loss": 5.9511,
"mean_token_accuracy": 0.15825047194957734,
"num_tokens": 16081077.0,
"step": 8610
},
{
"entropy": 6.118295192718506,
"epoch": 0.7607735782409043,
"grad_norm": 2.171875,
"learning_rate": 0.0004949088554161417,
"loss": 5.8764,
"mean_token_accuracy": 0.1641096889972687,
"num_tokens": 16089725.0,
"step": 8615
},
{
"entropy": 6.051836967468262,
"epoch": 0.7612151183327446,
"grad_norm": 2.015625,
"learning_rate": 0.0004949021920364339,
"loss": 6.045,
"mean_token_accuracy": 0.1546042039990425,
"num_tokens": 16099362.0,
"step": 8620
},
{
"entropy": 6.206489562988281,
"epoch": 0.761656658424585,
"grad_norm": 2.53125,
"learning_rate": 0.0004948955243489671,
"loss": 6.0685,
"mean_token_accuracy": 0.15602654963731766,
"num_tokens": 16108746.0,
"step": 8625
},
{
"entropy": 6.284847402572632,
"epoch": 0.7620981985164252,
"grad_norm": 2.171875,
"learning_rate": 0.0004948888523538721,
"loss": 6.1846,
"mean_token_accuracy": 0.14481205195188523,
"num_tokens": 16118902.0,
"step": 8630
},
{
"entropy": 6.125094079971314,
"epoch": 0.7625397386082656,
"grad_norm": 1.9453125,
"learning_rate": 0.0004948821760512795,
"loss": 5.9464,
"mean_token_accuracy": 0.15824127048254014,
"num_tokens": 16127781.0,
"step": 8635
},
{
"entropy": 6.186475229263306,
"epoch": 0.762981278700106,
"grad_norm": 2.234375,
"learning_rate": 0.0004948754954413201,
"loss": 5.9137,
"mean_token_accuracy": 0.16810621470212936,
"num_tokens": 16136004.0,
"step": 8640
},
{
"entropy": 6.171486759185791,
"epoch": 0.7634228187919463,
"grad_norm": 3.109375,
"learning_rate": 0.0004948688105241248,
"loss": 5.9864,
"mean_token_accuracy": 0.16084740161895753,
"num_tokens": 16145023.0,
"step": 8645
},
{
"entropy": 6.142913198471069,
"epoch": 0.7638643588837867,
"grad_norm": 6.25,
"learning_rate": 0.0004948621212998246,
"loss": 6.0319,
"mean_token_accuracy": 0.15112509354948997,
"num_tokens": 16154242.0,
"step": 8650
},
{
"entropy": 6.192302179336548,
"epoch": 0.764305898975627,
"grad_norm": 2.9375,
"learning_rate": 0.0004948554277685505,
"loss": 6.013,
"mean_token_accuracy": 0.1505245789885521,
"num_tokens": 16163252.0,
"step": 8655
},
{
"entropy": 6.232281637191773,
"epoch": 0.7647474390674673,
"grad_norm": 3.84375,
"learning_rate": 0.0004948487299304335,
"loss": 5.9173,
"mean_token_accuracy": 0.16507309079170226,
"num_tokens": 16171363.0,
"step": 8660
},
{
"entropy": 6.186713075637817,
"epoch": 0.7651889791593076,
"grad_norm": 6.53125,
"learning_rate": 0.000494842027785605,
"loss": 6.1024,
"mean_token_accuracy": 0.15555563420057297,
"num_tokens": 16181234.0,
"step": 8665
},
{
"entropy": 6.204009485244751,
"epoch": 0.765630519251148,
"grad_norm": 2.0,
"learning_rate": 0.0004948353213341961,
"loss": 6.0111,
"mean_token_accuracy": 0.15684083476662636,
"num_tokens": 16189420.0,
"step": 8670
},
{
"entropy": 6.2717845916748045,
"epoch": 0.7660720593429884,
"grad_norm": 2.703125,
"learning_rate": 0.0004948286105763385,
"loss": 6.1761,
"mean_token_accuracy": 0.14456427991390228,
"num_tokens": 16199202.0,
"step": 8675
},
{
"entropy": 6.234415864944458,
"epoch": 0.7665135994348287,
"grad_norm": 2.28125,
"learning_rate": 0.0004948218955121632,
"loss": 5.9953,
"mean_token_accuracy": 0.1586536779999733,
"num_tokens": 16208481.0,
"step": 8680
},
{
"entropy": 6.1947956562042235,
"epoch": 0.766955139526669,
"grad_norm": 3.578125,
"learning_rate": 0.0004948151761418021,
"loss": 6.0516,
"mean_token_accuracy": 0.15920995250344278,
"num_tokens": 16217282.0,
"step": 8685
},
{
"entropy": 6.214151334762573,
"epoch": 0.7673966796185093,
"grad_norm": 2.5,
"learning_rate": 0.0004948084524653868,
"loss": 5.9577,
"mean_token_accuracy": 0.16501378268003464,
"num_tokens": 16226567.0,
"step": 8690
},
{
"entropy": 6.199850082397461,
"epoch": 0.7678382197103497,
"grad_norm": 2.890625,
"learning_rate": 0.0004948017244830489,
"loss": 6.1424,
"mean_token_accuracy": 0.14520249366760254,
"num_tokens": 16236255.0,
"step": 8695
},
{
"entropy": 6.20784821510315,
"epoch": 0.76827975980219,
"grad_norm": 2.21875,
"learning_rate": 0.0004947949921949201,
"loss": 5.9037,
"mean_token_accuracy": 0.17059655785560607,
"num_tokens": 16244838.0,
"step": 8700
},
{
"entropy": 6.057857513427734,
"epoch": 0.7687212998940304,
"grad_norm": 2.234375,
"learning_rate": 0.0004947882556011325,
"loss": 5.8378,
"mean_token_accuracy": 0.16639560759067534,
"num_tokens": 16254101.0,
"step": 8705
},
{
"entropy": 5.99750018119812,
"epoch": 0.7691628399858708,
"grad_norm": 2.90625,
"learning_rate": 0.000494781514701818,
"loss": 5.9132,
"mean_token_accuracy": 0.16554349213838576,
"num_tokens": 16263496.0,
"step": 8710
},
{
"entropy": 6.181209897994995,
"epoch": 0.769604380077711,
"grad_norm": 2.0625,
"learning_rate": 0.0004947747694971085,
"loss": 6.0067,
"mean_token_accuracy": 0.15718649476766586,
"num_tokens": 16271884.0,
"step": 8715
},
{
"entropy": 6.164455318450928,
"epoch": 0.7700459201695514,
"grad_norm": 2.296875,
"learning_rate": 0.0004947680199871363,
"loss": 5.9177,
"mean_token_accuracy": 0.166747522354126,
"num_tokens": 16281197.0,
"step": 8720
},
{
"entropy": 6.127913951873779,
"epoch": 0.7704874602613917,
"grad_norm": 3.015625,
"learning_rate": 0.0004947612661720336,
"loss": 6.0124,
"mean_token_accuracy": 0.1616952523589134,
"num_tokens": 16289908.0,
"step": 8725
},
{
"entropy": 6.152335500717163,
"epoch": 0.7709290003532321,
"grad_norm": 2.46875,
"learning_rate": 0.0004947545080519327,
"loss": 5.9877,
"mean_token_accuracy": 0.15621994733810424,
"num_tokens": 16299237.0,
"step": 8730
},
{
"entropy": 6.287478113174439,
"epoch": 0.7713705404450724,
"grad_norm": 2.8125,
"learning_rate": 0.000494747745626966,
"loss": 6.0191,
"mean_token_accuracy": 0.15918604731559755,
"num_tokens": 16308175.0,
"step": 8735
},
{
"entropy": 6.178919315338135,
"epoch": 0.7718120805369127,
"grad_norm": 2.71875,
"learning_rate": 0.0004947409788972659,
"loss": 5.9601,
"mean_token_accuracy": 0.1646192342042923,
"num_tokens": 16317121.0,
"step": 8740
},
{
"entropy": 6.140972852706909,
"epoch": 0.7722536206287531,
"grad_norm": 2.28125,
"learning_rate": 0.0004947342078629649,
"loss": 5.9384,
"mean_token_accuracy": 0.16014498323202134,
"num_tokens": 16325764.0,
"step": 8745
},
{
"entropy": 6.144241285324097,
"epoch": 0.7726951607205934,
"grad_norm": 1.7890625,
"learning_rate": 0.0004947274325241959,
"loss": 5.936,
"mean_token_accuracy": 0.1571967288851738,
"num_tokens": 16333823.0,
"step": 8750
},
{
"entropy": 6.1269455909729,
"epoch": 0.7731367008124338,
"grad_norm": 3.53125,
"learning_rate": 0.0004947206528810913,
"loss": 5.9381,
"mean_token_accuracy": 0.16401293277740478,
"num_tokens": 16341918.0,
"step": 8755
},
{
"entropy": 6.091715383529663,
"epoch": 0.7735782409042741,
"grad_norm": 1.9296875,
"learning_rate": 0.0004947138689337843,
"loss": 6.0016,
"mean_token_accuracy": 0.15863162279129028,
"num_tokens": 16351904.0,
"step": 8760
},
{
"entropy": 6.1892224788665775,
"epoch": 0.7740197809961145,
"grad_norm": 3.359375,
"learning_rate": 0.0004947070806824074,
"loss": 6.0067,
"mean_token_accuracy": 0.15773371160030364,
"num_tokens": 16360921.0,
"step": 8765
},
{
"entropy": 6.224908304214478,
"epoch": 0.7744613210879547,
"grad_norm": 4.21875,
"learning_rate": 0.0004947002881270937,
"loss": 6.0339,
"mean_token_accuracy": 0.1500479370355606,
"num_tokens": 16370929.0,
"step": 8770
},
{
"entropy": 6.191905832290649,
"epoch": 0.7749028611797951,
"grad_norm": 2.0625,
"learning_rate": 0.0004946934912679764,
"loss": 6.0201,
"mean_token_accuracy": 0.1589919537305832,
"num_tokens": 16380099.0,
"step": 8775
},
{
"entropy": 6.212633848190308,
"epoch": 0.7753444012716355,
"grad_norm": 3.640625,
"learning_rate": 0.0004946866901051885,
"loss": 6.0483,
"mean_token_accuracy": 0.15650965869426728,
"num_tokens": 16389109.0,
"step": 8780
},
{
"entropy": 6.190409326553345,
"epoch": 0.7757859413634758,
"grad_norm": 1.875,
"learning_rate": 0.0004946798846388634,
"loss": 6.0967,
"mean_token_accuracy": 0.15047696828842164,
"num_tokens": 16398601.0,
"step": 8785
},
{
"entropy": 6.147092676162719,
"epoch": 0.7762274814553162,
"grad_norm": 2.171875,
"learning_rate": 0.0004946730748691342,
"loss": 5.9525,
"mean_token_accuracy": 0.1679944798350334,
"num_tokens": 16406950.0,
"step": 8790
},
{
"entropy": 6.214142847061157,
"epoch": 0.7766690215471564,
"grad_norm": 2.5,
"learning_rate": 0.0004946662607961344,
"loss": 5.9534,
"mean_token_accuracy": 0.16123656928539276,
"num_tokens": 16414680.0,
"step": 8795
},
{
"entropy": 6.197415208816528,
"epoch": 0.7771105616389968,
"grad_norm": 2.75,
"learning_rate": 0.0004946594424199976,
"loss": 6.0265,
"mean_token_accuracy": 0.1588950887322426,
"num_tokens": 16424060.0,
"step": 8800
},
{
"entropy": 6.12212233543396,
"epoch": 0.7775521017308371,
"grad_norm": 18.5,
"learning_rate": 0.0004946526197408571,
"loss": 6.0326,
"mean_token_accuracy": 0.15300369560718535,
"num_tokens": 16433691.0,
"step": 8805
},
{
"entropy": 6.134805727005005,
"epoch": 0.7779936418226775,
"grad_norm": 4.4375,
"learning_rate": 0.0004946457927588467,
"loss": 6.0504,
"mean_token_accuracy": 0.15356888324022294,
"num_tokens": 16443234.0,
"step": 8810
},
{
"entropy": 6.117645978927612,
"epoch": 0.7784351819145179,
"grad_norm": 3.140625,
"learning_rate": 0.0004946389614741002,
"loss": 5.9759,
"mean_token_accuracy": 0.15613539069890975,
"num_tokens": 16452084.0,
"step": 8815
},
{
"entropy": 6.16737117767334,
"epoch": 0.7788767220063582,
"grad_norm": 2.890625,
"learning_rate": 0.0004946321258867513,
"loss": 5.9643,
"mean_token_accuracy": 0.16132914572954177,
"num_tokens": 16460135.0,
"step": 8820
},
{
"entropy": 6.213026332855224,
"epoch": 0.7793182620981985,
"grad_norm": 2.578125,
"learning_rate": 0.000494625285996934,
"loss": 6.093,
"mean_token_accuracy": 0.1526857390999794,
"num_tokens": 16469919.0,
"step": 8825
},
{
"entropy": 6.259012365341187,
"epoch": 0.7797598021900388,
"grad_norm": 2.96875,
"learning_rate": 0.0004946184418047823,
"loss": 5.9994,
"mean_token_accuracy": 0.15334686413407325,
"num_tokens": 16478473.0,
"step": 8830
},
{
"entropy": 6.229764699935913,
"epoch": 0.7802013422818792,
"grad_norm": 2.484375,
"learning_rate": 0.0004946115933104301,
"loss": 6.0208,
"mean_token_accuracy": 0.15497473552823066,
"num_tokens": 16486878.0,
"step": 8835
},
{
"entropy": 6.231283283233642,
"epoch": 0.7806428823737195,
"grad_norm": 2.140625,
"learning_rate": 0.0004946047405140119,
"loss": 6.0594,
"mean_token_accuracy": 0.15498514473438263,
"num_tokens": 16496798.0,
"step": 8840
},
{
"entropy": 6.258311176300049,
"epoch": 0.7810844224655599,
"grad_norm": 2.1875,
"learning_rate": 0.0004945978834156616,
"loss": 5.9831,
"mean_token_accuracy": 0.1629524976015091,
"num_tokens": 16506508.0,
"step": 8845
},
{
"entropy": 6.072232294082641,
"epoch": 0.7815259625574003,
"grad_norm": 2.59375,
"learning_rate": 0.0004945910220155136,
"loss": 5.9576,
"mean_token_accuracy": 0.1621218889951706,
"num_tokens": 16514979.0,
"step": 8850
},
{
"entropy": 6.17908296585083,
"epoch": 0.7819675026492405,
"grad_norm": 4.1875,
"learning_rate": 0.0004945841563137025,
"loss": 6.0063,
"mean_token_accuracy": 0.154913267493248,
"num_tokens": 16524654.0,
"step": 8855
},
{
"entropy": 6.257924222946167,
"epoch": 0.7824090427410809,
"grad_norm": 2.421875,
"learning_rate": 0.0004945772863103626,
"loss": 6.0897,
"mean_token_accuracy": 0.15017425939440726,
"num_tokens": 16534486.0,
"step": 8860
},
{
"entropy": 6.261570596694947,
"epoch": 0.7828505828329212,
"grad_norm": 2.125,
"learning_rate": 0.0004945704120056286,
"loss": 6.0177,
"mean_token_accuracy": 0.16266490668058395,
"num_tokens": 16543718.0,
"step": 8865
},
{
"entropy": 6.117233991622925,
"epoch": 0.7832921229247616,
"grad_norm": 3.484375,
"learning_rate": 0.000494563533399635,
"loss": 5.9634,
"mean_token_accuracy": 0.15218463391065598,
"num_tokens": 16553159.0,
"step": 8870
},
{
"entropy": 6.2105433464050295,
"epoch": 0.7837336630166019,
"grad_norm": 2.328125,
"learning_rate": 0.0004945566504925167,
"loss": 6.0539,
"mean_token_accuracy": 0.15422216653823853,
"num_tokens": 16562398.0,
"step": 8875
},
{
"entropy": 6.276419067382813,
"epoch": 0.7841752031084422,
"grad_norm": 2.25,
"learning_rate": 0.0004945497632844084,
"loss": 5.9933,
"mean_token_accuracy": 0.16456555128097533,
"num_tokens": 16571530.0,
"step": 8880
},
{
"entropy": 6.170430421829224,
"epoch": 0.7846167432002826,
"grad_norm": 2.484375,
"learning_rate": 0.0004945428717754453,
"loss": 5.9927,
"mean_token_accuracy": 0.15764102190732956,
"num_tokens": 16581074.0,
"step": 8885
},
{
"entropy": 6.134314918518067,
"epoch": 0.7850582832921229,
"grad_norm": 4.78125,
"learning_rate": 0.000494535975965762,
"loss": 5.8683,
"mean_token_accuracy": 0.17008696496486664,
"num_tokens": 16589574.0,
"step": 8890
},
{
"entropy": 6.10400881767273,
"epoch": 0.7854998233839633,
"grad_norm": 2.65625,
"learning_rate": 0.0004945290758554939,
"loss": 5.9269,
"mean_token_accuracy": 0.16250946074724198,
"num_tokens": 16599623.0,
"step": 8895
},
{
"entropy": 6.16852765083313,
"epoch": 0.7859413634758036,
"grad_norm": 2.453125,
"learning_rate": 0.000494522171444776,
"loss": 6.0309,
"mean_token_accuracy": 0.14622992724180223,
"num_tokens": 16608559.0,
"step": 8900
},
{
"entropy": 6.219989156723022,
"epoch": 0.786382903567644,
"grad_norm": 2.25,
"learning_rate": 0.0004945152627337437,
"loss": 5.9316,
"mean_token_accuracy": 0.16550691723823546,
"num_tokens": 16617148.0,
"step": 8905
},
{
"entropy": 6.124237823486328,
"epoch": 0.7868244436594842,
"grad_norm": 2.125,
"learning_rate": 0.0004945083497225321,
"loss": 5.9672,
"mean_token_accuracy": 0.1638670802116394,
"num_tokens": 16626405.0,
"step": 8910
},
{
"entropy": 6.194284296035766,
"epoch": 0.7872659837513246,
"grad_norm": 2.09375,
"learning_rate": 0.0004945014324112769,
"loss": 5.9909,
"mean_token_accuracy": 0.1605047181248665,
"num_tokens": 16635116.0,
"step": 8915
},
{
"entropy": 6.155191087722779,
"epoch": 0.787707523843165,
"grad_norm": 1.8203125,
"learning_rate": 0.0004944945108001134,
"loss": 5.9647,
"mean_token_accuracy": 0.15713569819927214,
"num_tokens": 16644381.0,
"step": 8920
},
{
"entropy": 6.194045686721802,
"epoch": 0.7881490639350053,
"grad_norm": 3.28125,
"learning_rate": 0.0004944875848891773,
"loss": 6.0273,
"mean_token_accuracy": 0.15611210465431213,
"num_tokens": 16654275.0,
"step": 8925
},
{
"entropy": 6.248635768890381,
"epoch": 0.7885906040268457,
"grad_norm": 3.03125,
"learning_rate": 0.0004944806546786042,
"loss": 6.0775,
"mean_token_accuracy": 0.15530216097831726,
"num_tokens": 16663484.0,
"step": 8930
},
{
"entropy": 6.167916774749756,
"epoch": 0.7890321441186859,
"grad_norm": 2.796875,
"learning_rate": 0.00049447372016853,
"loss": 6.015,
"mean_token_accuracy": 0.1575445979833603,
"num_tokens": 16672490.0,
"step": 8935
},
{
"entropy": 6.142238140106201,
"epoch": 0.7894736842105263,
"grad_norm": 2.453125,
"learning_rate": 0.0004944667813590904,
"loss": 5.997,
"mean_token_accuracy": 0.15616441369056702,
"num_tokens": 16681242.0,
"step": 8940
},
{
"entropy": 6.176788473129273,
"epoch": 0.7899152243023666,
"grad_norm": 2.3125,
"learning_rate": 0.0004944598382504214,
"loss": 5.9263,
"mean_token_accuracy": 0.16061309725046158,
"num_tokens": 16690359.0,
"step": 8945
},
{
"entropy": 6.186691522598267,
"epoch": 0.790356764394207,
"grad_norm": 2.5,
"learning_rate": 0.0004944528908426589,
"loss": 6.0147,
"mean_token_accuracy": 0.16011423915624617,
"num_tokens": 16700774.0,
"step": 8950
},
{
"entropy": 6.230863285064697,
"epoch": 0.7907983044860474,
"grad_norm": 2.140625,
"learning_rate": 0.0004944459391359391,
"loss": 6.081,
"mean_token_accuracy": 0.1576569065451622,
"num_tokens": 16710513.0,
"step": 8955
},
{
"entropy": 6.200728082656861,
"epoch": 0.7912398445778877,
"grad_norm": 2.6875,
"learning_rate": 0.0004944389831303982,
"loss": 5.9829,
"mean_token_accuracy": 0.16038448214530945,
"num_tokens": 16720785.0,
"step": 8960
},
{
"entropy": 6.229797983169556,
"epoch": 0.791681384669728,
"grad_norm": 2.453125,
"learning_rate": 0.0004944320228261723,
"loss": 5.9785,
"mean_token_accuracy": 0.15734335631132126,
"num_tokens": 16729083.0,
"step": 8965
},
{
"entropy": 6.1684887409210205,
"epoch": 0.7921229247615683,
"grad_norm": 3.375,
"learning_rate": 0.000494425058223398,
"loss": 6.0018,
"mean_token_accuracy": 0.15480220317840576,
"num_tokens": 16738313.0,
"step": 8970
},
{
"entropy": 6.16772427558899,
"epoch": 0.7925644648534087,
"grad_norm": 1.875,
"learning_rate": 0.0004944180893222117,
"loss": 5.9379,
"mean_token_accuracy": 0.16542160883545876,
"num_tokens": 16747191.0,
"step": 8975
},
{
"entropy": 6.121258020401001,
"epoch": 0.793006004945249,
"grad_norm": 1.9453125,
"learning_rate": 0.0004944111161227496,
"loss": 5.9712,
"mean_token_accuracy": 0.16323955059051515,
"num_tokens": 16755921.0,
"step": 8980
},
{
"entropy": 6.232733106613159,
"epoch": 0.7934475450370894,
"grad_norm": 2.8125,
"learning_rate": 0.0004944041386251486,
"loss": 6.1172,
"mean_token_accuracy": 0.15585152059793472,
"num_tokens": 16765394.0,
"step": 8985
},
{
"entropy": 6.168314599990845,
"epoch": 0.7938890851289298,
"grad_norm": 2.234375,
"learning_rate": 0.0004943971568295454,
"loss": 6.0134,
"mean_token_accuracy": 0.1611020252108574,
"num_tokens": 16774824.0,
"step": 8990
},
{
"entropy": 6.227082300186157,
"epoch": 0.79433062522077,
"grad_norm": 10.0625,
"learning_rate": 0.0004943901707360765,
"loss": 6.1348,
"mean_token_accuracy": 0.14640742987394334,
"num_tokens": 16783945.0,
"step": 8995
},
{
"entropy": 6.219871282577515,
"epoch": 0.7947721653126104,
"grad_norm": 2.453125,
"learning_rate": 0.000494383180344879,
"loss": 5.9064,
"mean_token_accuracy": 0.1599573463201523,
"num_tokens": 16792618.0,
"step": 9000
},
{
"epoch": 0.7947721653126104,
"eval_entropy": 5.99483757380856,
"eval_loss": 6.030915260314941,
"eval_mean_token_accuracy": 0.16231492948844936,
"eval_num_tokens": 16792618.0,
"eval_runtime": 26.2471,
"eval_samples_per_second": 1345.48,
"eval_steps_per_second": 168.209,
"step": 9000
},
{
"entropy": 6.1487061977386475,
"epoch": 0.7952137054044507,
"grad_norm": 2.828125,
"learning_rate": 0.0004943761856560898,
"loss": 5.9999,
"mean_token_accuracy": 0.16206828504800797,
"num_tokens": 16801210.0,
"step": 9005
},
{
"entropy": 6.148907089233399,
"epoch": 0.7956552454962911,
"grad_norm": 2.5625,
"learning_rate": 0.000494369186669846,
"loss": 6.0285,
"mean_token_accuracy": 0.15648848563432693,
"num_tokens": 16810371.0,
"step": 9010
},
{
"entropy": 6.1634996891021725,
"epoch": 0.7960967855881314,
"grad_norm": 1.9609375,
"learning_rate": 0.0004943621833862844,
"loss": 5.9493,
"mean_token_accuracy": 0.15873776078224183,
"num_tokens": 16818886.0,
"step": 9015
},
{
"entropy": 6.171688413619995,
"epoch": 0.7965383256799717,
"grad_norm": 2.578125,
"learning_rate": 0.0004943551758055425,
"loss": 6.0028,
"mean_token_accuracy": 0.1585293412208557,
"num_tokens": 16827705.0,
"step": 9020
},
{
"entropy": 6.22738790512085,
"epoch": 0.7969798657718121,
"grad_norm": 4.5625,
"learning_rate": 0.0004943481639277574,
"loss": 5.976,
"mean_token_accuracy": 0.15601675808429719,
"num_tokens": 16836313.0,
"step": 9025
},
{
"entropy": 6.2114660263061525,
"epoch": 0.7974214058636524,
"grad_norm": 3.1875,
"learning_rate": 0.0004943411477530665,
"loss": 6.0517,
"mean_token_accuracy": 0.1506840318441391,
"num_tokens": 16845016.0,
"step": 9030
},
{
"entropy": 6.1980327606201175,
"epoch": 0.7978629459554928,
"grad_norm": 2.03125,
"learning_rate": 0.0004943341272816073,
"loss": 5.9963,
"mean_token_accuracy": 0.15092387199401855,
"num_tokens": 16854025.0,
"step": 9035
},
{
"entropy": 6.143618822097778,
"epoch": 0.7983044860473331,
"grad_norm": 1.6484375,
"learning_rate": 0.0004943271025135173,
"loss": 5.9568,
"mean_token_accuracy": 0.16135982275009156,
"num_tokens": 16862859.0,
"step": 9040
},
{
"entropy": 6.133461236953735,
"epoch": 0.7987460261391734,
"grad_norm": 2.109375,
"learning_rate": 0.0004943200734489341,
"loss": 6.0579,
"mean_token_accuracy": 0.15992478728294374,
"num_tokens": 16872226.0,
"step": 9045
},
{
"entropy": 6.148415422439575,
"epoch": 0.7991875662310137,
"grad_norm": 2.859375,
"learning_rate": 0.0004943130400879953,
"loss": 5.9426,
"mean_token_accuracy": 0.1608792394399643,
"num_tokens": 16881977.0,
"step": 9050
},
{
"entropy": 6.223663425445556,
"epoch": 0.7996291063228541,
"grad_norm": 1.8828125,
"learning_rate": 0.0004943060024308389,
"loss": 6.0484,
"mean_token_accuracy": 0.15178056359291076,
"num_tokens": 16891656.0,
"step": 9055
},
{
"entropy": 6.1729512214660645,
"epoch": 0.8000706464146945,
"grad_norm": 1.6953125,
"learning_rate": 0.0004942989604776026,
"loss": 5.92,
"mean_token_accuracy": 0.16473895758390428,
"num_tokens": 16900944.0,
"step": 9060
},
{
"entropy": 6.021815443038941,
"epoch": 0.8005121865065348,
"grad_norm": 2.140625,
"learning_rate": 0.0004942919142284244,
"loss": 5.93,
"mean_token_accuracy": 0.160130113363266,
"num_tokens": 16910154.0,
"step": 9065
},
{
"entropy": 6.17953085899353,
"epoch": 0.8009537265983752,
"grad_norm": 1.609375,
"learning_rate": 0.0004942848636834423,
"loss": 6.0631,
"mean_token_accuracy": 0.15414892435073851,
"num_tokens": 16919694.0,
"step": 9070
},
{
"entropy": 6.216848421096802,
"epoch": 0.8013952666902154,
"grad_norm": 2.0,
"learning_rate": 0.0004942778088427944,
"loss": 6.0185,
"mean_token_accuracy": 0.1524006649851799,
"num_tokens": 16928530.0,
"step": 9075
},
{
"entropy": 6.224365186691284,
"epoch": 0.8018368067820558,
"grad_norm": 2.03125,
"learning_rate": 0.000494270749706619,
"loss": 6.0459,
"mean_token_accuracy": 0.15229960829019545,
"num_tokens": 16938614.0,
"step": 9080
},
{
"entropy": 6.243349409103393,
"epoch": 0.8022783468738961,
"grad_norm": 1.9609375,
"learning_rate": 0.0004942636862750544,
"loss": 5.9851,
"mean_token_accuracy": 0.15328827649354934,
"num_tokens": 16947655.0,
"step": 9085
},
{
"entropy": 6.207400798797607,
"epoch": 0.8027198869657365,
"grad_norm": 1.890625,
"learning_rate": 0.0004942566185482387,
"loss": 6.0757,
"mean_token_accuracy": 0.1491963893175125,
"num_tokens": 16957101.0,
"step": 9090
},
{
"entropy": 6.150931644439697,
"epoch": 0.8031614270575769,
"grad_norm": 1.953125,
"learning_rate": 0.0004942495465263106,
"loss": 6.0797,
"mean_token_accuracy": 0.1460029661655426,
"num_tokens": 16966421.0,
"step": 9095
},
{
"entropy": 6.29519567489624,
"epoch": 0.8036029671494171,
"grad_norm": 1.984375,
"learning_rate": 0.0004942424702094085,
"loss": 5.9899,
"mean_token_accuracy": 0.16079071760177613,
"num_tokens": 16975656.0,
"step": 9100
},
{
"entropy": 6.22046160697937,
"epoch": 0.8040445072412575,
"grad_norm": 1.59375,
"learning_rate": 0.0004942353895976713,
"loss": 6.0293,
"mean_token_accuracy": 0.15495287179946898,
"num_tokens": 16984409.0,
"step": 9105
},
{
"entropy": 6.073172473907471,
"epoch": 0.8044860473330978,
"grad_norm": 2.109375,
"learning_rate": 0.0004942283046912374,
"loss": 5.9398,
"mean_token_accuracy": 0.15369927138090134,
"num_tokens": 16992728.0,
"step": 9110
},
{
"entropy": 6.12375316619873,
"epoch": 0.8049275874249382,
"grad_norm": 2.5625,
"learning_rate": 0.0004942212154902456,
"loss": 5.8504,
"mean_token_accuracy": 0.16494496762752534,
"num_tokens": 17001616.0,
"step": 9115
},
{
"entropy": 6.1858415603637695,
"epoch": 0.8053691275167785,
"grad_norm": 2.375,
"learning_rate": 0.000494214121994835,
"loss": 6.017,
"mean_token_accuracy": 0.16152730584144592,
"num_tokens": 17010655.0,
"step": 9120
},
{
"entropy": 6.144730281829834,
"epoch": 0.8058106676086189,
"grad_norm": 1.953125,
"learning_rate": 0.0004942070242051444,
"loss": 5.9889,
"mean_token_accuracy": 0.15129996985197067,
"num_tokens": 17019819.0,
"step": 9125
},
{
"entropy": 6.216437578201294,
"epoch": 0.8062522077004592,
"grad_norm": 2.09375,
"learning_rate": 0.0004941999221213129,
"loss": 6.041,
"mean_token_accuracy": 0.15482919663190842,
"num_tokens": 17029218.0,
"step": 9130
},
{
"entropy": 6.237334203720093,
"epoch": 0.8066937477922995,
"grad_norm": 2.125,
"learning_rate": 0.0004941928157434796,
"loss": 5.9356,
"mean_token_accuracy": 0.16022457778453827,
"num_tokens": 17037880.0,
"step": 9135
},
{
"entropy": 6.077278518676758,
"epoch": 0.8071352878841399,
"grad_norm": 2.03125,
"learning_rate": 0.0004941857050717836,
"loss": 6.0212,
"mean_token_accuracy": 0.1571980506181717,
"num_tokens": 17047934.0,
"step": 9140
},
{
"entropy": 6.235128164291382,
"epoch": 0.8075768279759802,
"grad_norm": 1.6015625,
"learning_rate": 0.0004941785901063642,
"loss": 6.0676,
"mean_token_accuracy": 0.15503668040037155,
"num_tokens": 17057258.0,
"step": 9145
},
{
"entropy": 6.221063661575317,
"epoch": 0.8080183680678206,
"grad_norm": 3.109375,
"learning_rate": 0.0004941714708473611,
"loss": 6.0188,
"mean_token_accuracy": 0.15488457530736924,
"num_tokens": 17066387.0,
"step": 9150
},
{
"entropy": 6.122168970108032,
"epoch": 0.8084599081596608,
"grad_norm": 2.453125,
"learning_rate": 0.0004941643472949134,
"loss": 5.9473,
"mean_token_accuracy": 0.1584942102432251,
"num_tokens": 17075952.0,
"step": 9155
},
{
"entropy": 6.139489650726318,
"epoch": 0.8089014482515012,
"grad_norm": 2.171875,
"learning_rate": 0.0004941572194491608,
"loss": 5.8475,
"mean_token_accuracy": 0.17051213532686232,
"num_tokens": 17084209.0,
"step": 9160
},
{
"entropy": 6.084729146957398,
"epoch": 0.8093429883433416,
"grad_norm": 2.65625,
"learning_rate": 0.000494150087310243,
"loss": 6.056,
"mean_token_accuracy": 0.155523382127285,
"num_tokens": 17093395.0,
"step": 9165
},
{
"entropy": 6.222897386550903,
"epoch": 0.8097845284351819,
"grad_norm": 2.34375,
"learning_rate": 0.0004941429508782995,
"loss": 5.9537,
"mean_token_accuracy": 0.15856784731149673,
"num_tokens": 17102646.0,
"step": 9170
},
{
"entropy": 6.190137672424316,
"epoch": 0.8102260685270223,
"grad_norm": 2.15625,
"learning_rate": 0.0004941358101534703,
"loss": 5.9671,
"mean_token_accuracy": 0.15818232893943787,
"num_tokens": 17111530.0,
"step": 9175
},
{
"entropy": 6.081518745422363,
"epoch": 0.8106676086188626,
"grad_norm": 2.140625,
"learning_rate": 0.0004941286651358952,
"loss": 5.9215,
"mean_token_accuracy": 0.16413938850164414,
"num_tokens": 17119659.0,
"step": 9180
},
{
"entropy": 6.034661483764649,
"epoch": 0.8111091487107029,
"grad_norm": 2.0,
"learning_rate": 0.0004941215158257142,
"loss": 5.9342,
"mean_token_accuracy": 0.16041793078184127,
"num_tokens": 17127931.0,
"step": 9185
},
{
"entropy": 6.229415798187256,
"epoch": 0.8115506888025432,
"grad_norm": 1.9453125,
"learning_rate": 0.0004941143622230672,
"loss": 5.957,
"mean_token_accuracy": 0.16308822929859162,
"num_tokens": 17137374.0,
"step": 9190
},
{
"entropy": 6.189091300964355,
"epoch": 0.8119922288943836,
"grad_norm": 2.453125,
"learning_rate": 0.0004941072043280946,
"loss": 6.0386,
"mean_token_accuracy": 0.14483000189065934,
"num_tokens": 17147257.0,
"step": 9195
},
{
"entropy": 6.118412637710572,
"epoch": 0.812433768986224,
"grad_norm": 2.0625,
"learning_rate": 0.0004941000421409365,
"loss": 5.8981,
"mean_token_accuracy": 0.16406946182250975,
"num_tokens": 17156233.0,
"step": 9200
},
{
"entropy": 6.257875967025757,
"epoch": 0.8128753090780643,
"grad_norm": 1.9609375,
"learning_rate": 0.0004940928756617331,
"loss": 6.0903,
"mean_token_accuracy": 0.14774099513888359,
"num_tokens": 17166364.0,
"step": 9205
},
{
"entropy": 6.158308601379394,
"epoch": 0.8133168491699047,
"grad_norm": 1.96875,
"learning_rate": 0.0004940857048906248,
"loss": 6.0021,
"mean_token_accuracy": 0.16273642480373382,
"num_tokens": 17175853.0,
"step": 9210
},
{
"entropy": 6.201669645309448,
"epoch": 0.8137583892617449,
"grad_norm": 2.515625,
"learning_rate": 0.0004940785298277523,
"loss": 6.1003,
"mean_token_accuracy": 0.15356539487838744,
"num_tokens": 17187849.0,
"step": 9215
},
{
"entropy": 6.222421455383301,
"epoch": 0.8141999293535853,
"grad_norm": 2.015625,
"learning_rate": 0.000494071350473256,
"loss": 5.9661,
"mean_token_accuracy": 0.15690547376871108,
"num_tokens": 17196646.0,
"step": 9220
},
{
"entropy": 6.190940523147583,
"epoch": 0.8146414694454256,
"grad_norm": 2.875,
"learning_rate": 0.0004940641668272765,
"loss": 6.087,
"mean_token_accuracy": 0.15185078382492065,
"num_tokens": 17205919.0,
"step": 9225
},
{
"entropy": 6.208985233306885,
"epoch": 0.815083009537266,
"grad_norm": 2.53125,
"learning_rate": 0.0004940569788899544,
"loss": 6.0568,
"mean_token_accuracy": 0.159510999917984,
"num_tokens": 17215085.0,
"step": 9230
},
{
"entropy": 6.201829147338867,
"epoch": 0.8155245496291064,
"grad_norm": 2.078125,
"learning_rate": 0.0004940497866614309,
"loss": 6.0395,
"mean_token_accuracy": 0.15696409791707994,
"num_tokens": 17223633.0,
"step": 9235
},
{
"entropy": 6.211566734313965,
"epoch": 0.8159660897209466,
"grad_norm": 2.1875,
"learning_rate": 0.0004940425901418465,
"loss": 5.9328,
"mean_token_accuracy": 0.1588832825422287,
"num_tokens": 17232915.0,
"step": 9240
},
{
"entropy": 6.152827024459839,
"epoch": 0.816407629812787,
"grad_norm": 2.734375,
"learning_rate": 0.0004940353893313423,
"loss": 6.0651,
"mean_token_accuracy": 0.15153356343507768,
"num_tokens": 17242392.0,
"step": 9245
},
{
"entropy": 6.263103485107422,
"epoch": 0.8168491699046273,
"grad_norm": 3.21875,
"learning_rate": 0.0004940281842300596,
"loss": 6.134,
"mean_token_accuracy": 0.1474553495645523,
"num_tokens": 17252259.0,
"step": 9250
},
{
"entropy": 6.309034442901611,
"epoch": 0.8172907099964677,
"grad_norm": 3.59375,
"learning_rate": 0.0004940209748381392,
"loss": 6.0138,
"mean_token_accuracy": 0.15456279516220092,
"num_tokens": 17261584.0,
"step": 9255
},
{
"entropy": 6.200342226028442,
"epoch": 0.817732250088308,
"grad_norm": 3.375,
"learning_rate": 0.0004940137611557225,
"loss": 5.9659,
"mean_token_accuracy": 0.15744673162698747,
"num_tokens": 17270901.0,
"step": 9260
},
{
"entropy": 6.120326900482178,
"epoch": 0.8181737901801484,
"grad_norm": 2.4375,
"learning_rate": 0.0004940065431829508,
"loss": 6.002,
"mean_token_accuracy": 0.15640898644924164,
"num_tokens": 17280024.0,
"step": 9265
},
{
"entropy": 6.178916978836059,
"epoch": 0.8186153302719887,
"grad_norm": 2.609375,
"learning_rate": 0.0004939993209199654,
"loss": 6.0449,
"mean_token_accuracy": 0.1492045506834984,
"num_tokens": 17290131.0,
"step": 9270
},
{
"entropy": 6.273868227005005,
"epoch": 0.819056870363829,
"grad_norm": 2.734375,
"learning_rate": 0.0004939920943669079,
"loss": 6.0561,
"mean_token_accuracy": 0.1514695778489113,
"num_tokens": 17299453.0,
"step": 9275
},
{
"entropy": 6.203728866577149,
"epoch": 0.8194984104556694,
"grad_norm": 2.015625,
"learning_rate": 0.0004939848635239198,
"loss": 6.0161,
"mean_token_accuracy": 0.15177833586931228,
"num_tokens": 17309344.0,
"step": 9280
},
{
"entropy": 6.142740774154663,
"epoch": 0.8199399505475097,
"grad_norm": 2.25,
"learning_rate": 0.0004939776283911429,
"loss": 5.9515,
"mean_token_accuracy": 0.1652413621544838,
"num_tokens": 17318636.0,
"step": 9285
},
{
"entropy": 6.116071176528931,
"epoch": 0.8203814906393501,
"grad_norm": 4.34375,
"learning_rate": 0.0004939703889687186,
"loss": 6.0011,
"mean_token_accuracy": 0.15755840986967087,
"num_tokens": 17328146.0,
"step": 9290
},
{
"entropy": 6.188868713378906,
"epoch": 0.8208230307311903,
"grad_norm": 2.421875,
"learning_rate": 0.0004939631452567891,
"loss": 6.042,
"mean_token_accuracy": 0.15656861513853074,
"num_tokens": 17338542.0,
"step": 9295
},
{
"entropy": 6.317523241043091,
"epoch": 0.8212645708230307,
"grad_norm": 2.703125,
"learning_rate": 0.000493955897255496,
"loss": 6.0034,
"mean_token_accuracy": 0.16002278327941893,
"num_tokens": 17347577.0,
"step": 9300
},
{
"entropy": 6.152925586700439,
"epoch": 0.8217061109148711,
"grad_norm": 3.28125,
"learning_rate": 0.0004939486449649814,
"loss": 6.0035,
"mean_token_accuracy": 0.15597244054079057,
"num_tokens": 17356554.0,
"step": 9305
},
{
"entropy": 6.082534599304199,
"epoch": 0.8221476510067114,
"grad_norm": 3.5,
"learning_rate": 0.0004939413883853873,
"loss": 6.0342,
"mean_token_accuracy": 0.15275887846946717,
"num_tokens": 17366432.0,
"step": 9310
},
{
"entropy": 6.206737089157104,
"epoch": 0.8225891910985518,
"grad_norm": 2.53125,
"learning_rate": 0.000493934127516856,
"loss": 5.9939,
"mean_token_accuracy": 0.16099046021699906,
"num_tokens": 17376556.0,
"step": 9315
},
{
"entropy": 6.245942735671997,
"epoch": 0.823030731190392,
"grad_norm": 2.53125,
"learning_rate": 0.0004939268623595297,
"loss": 6.041,
"mean_token_accuracy": 0.1543372318148613,
"num_tokens": 17385382.0,
"step": 9320
},
{
"entropy": 6.213073444366455,
"epoch": 0.8234722712822324,
"grad_norm": 3.671875,
"learning_rate": 0.0004939195929135506,
"loss": 5.9202,
"mean_token_accuracy": 0.15655575394630433,
"num_tokens": 17393229.0,
"step": 9325
},
{
"entropy": 6.153160476684571,
"epoch": 0.8239138113740727,
"grad_norm": 5.71875,
"learning_rate": 0.0004939123191790612,
"loss": 5.9295,
"mean_token_accuracy": 0.15139122530817986,
"num_tokens": 17402439.0,
"step": 9330
},
{
"entropy": 6.1857078075408936,
"epoch": 0.8243553514659131,
"grad_norm": 1.875,
"learning_rate": 0.0004939050411562041,
"loss": 6.0608,
"mean_token_accuracy": 0.14784065932035445,
"num_tokens": 17412349.0,
"step": 9335
},
{
"entropy": 6.149607563018799,
"epoch": 0.8247968915577535,
"grad_norm": 3.015625,
"learning_rate": 0.0004938977588451216,
"loss": 5.8446,
"mean_token_accuracy": 0.1727093756198883,
"num_tokens": 17420842.0,
"step": 9340
},
{
"entropy": 6.186956167221069,
"epoch": 0.8252384316495938,
"grad_norm": 3.46875,
"learning_rate": 0.0004938904722459565,
"loss": 5.9166,
"mean_token_accuracy": 0.16909475475549698,
"num_tokens": 17429877.0,
"step": 9345
},
{
"entropy": 6.1899059295654295,
"epoch": 0.8256799717414341,
"grad_norm": 2.265625,
"learning_rate": 0.0004938831813588515,
"loss": 6.0425,
"mean_token_accuracy": 0.14771706387400627,
"num_tokens": 17439508.0,
"step": 9350
},
{
"entropy": 6.132845163345337,
"epoch": 0.8261215118332744,
"grad_norm": 2.828125,
"learning_rate": 0.0004938758861839495,
"loss": 5.9712,
"mean_token_accuracy": 0.15998683869838715,
"num_tokens": 17449004.0,
"step": 9355
},
{
"entropy": 6.136862516403198,
"epoch": 0.8265630519251148,
"grad_norm": 2.96875,
"learning_rate": 0.0004938685867213934,
"loss": 5.9939,
"mean_token_accuracy": 0.1596406415104866,
"num_tokens": 17458462.0,
"step": 9360
},
{
"entropy": 6.209472417831421,
"epoch": 0.8270045920169551,
"grad_norm": 2.953125,
"learning_rate": 0.0004938612829713262,
"loss": 6.0038,
"mean_token_accuracy": 0.1590506836771965,
"num_tokens": 17466808.0,
"step": 9365
},
{
"entropy": 6.204236030578613,
"epoch": 0.8274461321087955,
"grad_norm": 3.875,
"learning_rate": 0.0004938539749338909,
"loss": 6.0569,
"mean_token_accuracy": 0.15345755219459534,
"num_tokens": 17476441.0,
"step": 9370
},
{
"entropy": 6.197632503509522,
"epoch": 0.8278876722006359,
"grad_norm": 2.109375,
"learning_rate": 0.0004938466626092308,
"loss": 5.9712,
"mean_token_accuracy": 0.16514800488948822,
"num_tokens": 17485393.0,
"step": 9375
},
{
"entropy": 6.143286991119385,
"epoch": 0.8283292122924761,
"grad_norm": 2.484375,
"learning_rate": 0.000493839345997489,
"loss": 6.0023,
"mean_token_accuracy": 0.15669391825795173,
"num_tokens": 17494904.0,
"step": 9380
},
{
"entropy": 6.239519548416138,
"epoch": 0.8287707523843165,
"grad_norm": 2.453125,
"learning_rate": 0.0004938320250988087,
"loss": 6.0008,
"mean_token_accuracy": 0.15390121936798096,
"num_tokens": 17505137.0,
"step": 9385
},
{
"entropy": 6.2221802234649655,
"epoch": 0.8292122924761568,
"grad_norm": 1.828125,
"learning_rate": 0.0004938246999133337,
"loss": 6.0471,
"mean_token_accuracy": 0.15576046109199523,
"num_tokens": 17514039.0,
"step": 9390
},
{
"entropy": 6.151000833511352,
"epoch": 0.8296538325679972,
"grad_norm": 2.328125,
"learning_rate": 0.0004938173704412071,
"loss": 5.9326,
"mean_token_accuracy": 0.16171178817749024,
"num_tokens": 17522423.0,
"step": 9395
},
{
"entropy": 6.09819769859314,
"epoch": 0.8300953726598375,
"grad_norm": 2.171875,
"learning_rate": 0.0004938100366825728,
"loss": 5.9198,
"mean_token_accuracy": 0.16011940389871598,
"num_tokens": 17531958.0,
"step": 9400
},
{
"entropy": 6.189981460571289,
"epoch": 0.8305369127516778,
"grad_norm": 2.8125,
"learning_rate": 0.0004938026986375742,
"loss": 5.9841,
"mean_token_accuracy": 0.15482488870620728,
"num_tokens": 17540905.0,
"step": 9405
},
{
"entropy": 6.19126672744751,
"epoch": 0.8309784528435182,
"grad_norm": 2.578125,
"learning_rate": 0.0004937953563063553,
"loss": 6.0203,
"mean_token_accuracy": 0.1546342760324478,
"num_tokens": 17551007.0,
"step": 9410
},
{
"entropy": 6.182310962677002,
"epoch": 0.8314199929353585,
"grad_norm": 2.0625,
"learning_rate": 0.0004937880096890598,
"loss": 5.8448,
"mean_token_accuracy": 0.17532017827033997,
"num_tokens": 17559403.0,
"step": 9415
},
{
"entropy": 6.1655693531036375,
"epoch": 0.8318615330271989,
"grad_norm": 3.09375,
"learning_rate": 0.0004937806587858315,
"loss": 6.0167,
"mean_token_accuracy": 0.15742651373147964,
"num_tokens": 17569191.0,
"step": 9420
},
{
"entropy": 6.2112250328063965,
"epoch": 0.8323030731190392,
"grad_norm": 2.59375,
"learning_rate": 0.0004937733035968147,
"loss": 6.0656,
"mean_token_accuracy": 0.15089496821165085,
"num_tokens": 17578538.0,
"step": 9425
},
{
"entropy": 6.191039800643921,
"epoch": 0.8327446132108796,
"grad_norm": 1.796875,
"learning_rate": 0.0004937659441221531,
"loss": 5.9583,
"mean_token_accuracy": 0.15710290521383286,
"num_tokens": 17587344.0,
"step": 9430
},
{
"entropy": 6.129788255691528,
"epoch": 0.8331861533027198,
"grad_norm": 6.46875,
"learning_rate": 0.0004937585803619912,
"loss": 5.9501,
"mean_token_accuracy": 0.15594619512557983,
"num_tokens": 17596033.0,
"step": 9435
},
{
"entropy": 6.1359399318695065,
"epoch": 0.8336276933945602,
"grad_norm": 2.4375,
"learning_rate": 0.0004937512123164731,
"loss": 5.8821,
"mean_token_accuracy": 0.16800721287727355,
"num_tokens": 17605860.0,
"step": 9440
},
{
"entropy": 6.168475866317749,
"epoch": 0.8340692334864006,
"grad_norm": 2.078125,
"learning_rate": 0.0004937438399857431,
"loss": 6.0075,
"mean_token_accuracy": 0.15393326729536055,
"num_tokens": 17615819.0,
"step": 9445
},
{
"entropy": 6.221032428741455,
"epoch": 0.8345107735782409,
"grad_norm": 2.3125,
"learning_rate": 0.0004937364633699459,
"loss": 6.0022,
"mean_token_accuracy": 0.15670545101165773,
"num_tokens": 17625478.0,
"step": 9450
},
{
"entropy": 6.249571752548218,
"epoch": 0.8349523136700813,
"grad_norm": 2.203125,
"learning_rate": 0.0004937290824692255,
"loss": 5.9695,
"mean_token_accuracy": 0.1606830447912216,
"num_tokens": 17635329.0,
"step": 9455
},
{
"entropy": 6.122990655899048,
"epoch": 0.8353938537619215,
"grad_norm": 2.28125,
"learning_rate": 0.0004937216972837269,
"loss": 5.9896,
"mean_token_accuracy": 0.15530529767274856,
"num_tokens": 17644129.0,
"step": 9460
},
{
"entropy": 6.061185836791992,
"epoch": 0.8358353938537619,
"grad_norm": 1.953125,
"learning_rate": 0.0004937143078135946,
"loss": 5.9314,
"mean_token_accuracy": 0.15823248773813248,
"num_tokens": 17652836.0,
"step": 9465
},
{
"entropy": 6.158979511260986,
"epoch": 0.8362769339456022,
"grad_norm": 2.34375,
"learning_rate": 0.0004937069140589735,
"loss": 5.9225,
"mean_token_accuracy": 0.15838933140039443,
"num_tokens": 17661222.0,
"step": 9470
},
{
"entropy": 6.158643913269043,
"epoch": 0.8367184740374426,
"grad_norm": 2.109375,
"learning_rate": 0.0004936995160200083,
"loss": 5.9018,
"mean_token_accuracy": 0.1641666367650032,
"num_tokens": 17669637.0,
"step": 9475
},
{
"entropy": 6.235646104812622,
"epoch": 0.837160014129283,
"grad_norm": 2.171875,
"learning_rate": 0.0004936921136968439,
"loss": 6.095,
"mean_token_accuracy": 0.14598974213004112,
"num_tokens": 17678589.0,
"step": 9480
},
{
"entropy": 6.2168638706207275,
"epoch": 0.8376015542211233,
"grad_norm": 2.140625,
"learning_rate": 0.0004936847070896254,
"loss": 6.0682,
"mean_token_accuracy": 0.15239321142435075,
"num_tokens": 17689129.0,
"step": 9485
},
{
"entropy": 6.25889778137207,
"epoch": 0.8380430943129636,
"grad_norm": 2.21875,
"learning_rate": 0.0004936772961984979,
"loss": 6.0683,
"mean_token_accuracy": 0.1543731912970543,
"num_tokens": 17698864.0,
"step": 9490
},
{
"entropy": 6.285584306716919,
"epoch": 0.8384846344048039,
"grad_norm": 2.5,
"learning_rate": 0.0004936698810236065,
"loss": 6.1256,
"mean_token_accuracy": 0.1512532114982605,
"num_tokens": 17707900.0,
"step": 9495
},
{
"entropy": 6.204893302917481,
"epoch": 0.8389261744966443,
"grad_norm": 2.109375,
"learning_rate": 0.0004936624615650964,
"loss": 5.9587,
"mean_token_accuracy": 0.1602652743458748,
"num_tokens": 17716983.0,
"step": 9500
},
{
"entropy": 6.175816297531128,
"epoch": 0.8393677145884846,
"grad_norm": 2.046875,
"learning_rate": 0.0004936550378231133,
"loss": 5.9587,
"mean_token_accuracy": 0.1565639093518257,
"num_tokens": 17726503.0,
"step": 9505
},
{
"entropy": 6.179383230209351,
"epoch": 0.839809254680325,
"grad_norm": 1.9375,
"learning_rate": 0.0004936476097978023,
"loss": 6.028,
"mean_token_accuracy": 0.15826905518770218,
"num_tokens": 17735708.0,
"step": 9510
},
{
"entropy": 6.240667009353638,
"epoch": 0.8402507947721654,
"grad_norm": 1.7734375,
"learning_rate": 0.0004936401774893088,
"loss": 5.9649,
"mean_token_accuracy": 0.15852003246545793,
"num_tokens": 17745169.0,
"step": 9515
},
{
"entropy": 6.313706684112549,
"epoch": 0.8406923348640056,
"grad_norm": 2.359375,
"learning_rate": 0.0004936327408977786,
"loss": 6.0931,
"mean_token_accuracy": 0.1494787573814392,
"num_tokens": 17755630.0,
"step": 9520
},
{
"entropy": 6.208659267425537,
"epoch": 0.841133874955846,
"grad_norm": 1.59375,
"learning_rate": 0.0004936253000233574,
"loss": 5.9798,
"mean_token_accuracy": 0.15753645598888397,
"num_tokens": 17764469.0,
"step": 9525
},
{
"entropy": 6.077292346954346,
"epoch": 0.8415754150476863,
"grad_norm": 2.140625,
"learning_rate": 0.0004936178548661909,
"loss": 6.0598,
"mean_token_accuracy": 0.14688302874565123,
"num_tokens": 17774977.0,
"step": 9530
},
{
"entropy": 6.1895252704620365,
"epoch": 0.8420169551395267,
"grad_norm": 2.34375,
"learning_rate": 0.000493610405426425,
"loss": 5.9869,
"mean_token_accuracy": 0.15386689752340316,
"num_tokens": 17784250.0,
"step": 9535
},
{
"entropy": 6.279173707962036,
"epoch": 0.842458495231367,
"grad_norm": 3.96875,
"learning_rate": 0.0004936029517042056,
"loss": 6.0142,
"mean_token_accuracy": 0.16020059138536452,
"num_tokens": 17793858.0,
"step": 9540
},
{
"entropy": 6.260600662231445,
"epoch": 0.8429000353232073,
"grad_norm": 3.0,
"learning_rate": 0.0004935954936996787,
"loss": 6.1267,
"mean_token_accuracy": 0.14553788676857948,
"num_tokens": 17804330.0,
"step": 9545
},
{
"entropy": 6.194586133956909,
"epoch": 0.8433415754150477,
"grad_norm": 2.703125,
"learning_rate": 0.0004935880314129903,
"loss": 5.9747,
"mean_token_accuracy": 0.15996120423078536,
"num_tokens": 17813750.0,
"step": 9550
},
{
"entropy": 6.1037524223327635,
"epoch": 0.843783115506888,
"grad_norm": 2.359375,
"learning_rate": 0.0004935805648442868,
"loss": 5.9635,
"mean_token_accuracy": 0.15821667164564132,
"num_tokens": 17823537.0,
"step": 9555
},
{
"entropy": 6.169758033752442,
"epoch": 0.8442246555987284,
"grad_norm": 2.875,
"learning_rate": 0.0004935730939937143,
"loss": 5.9697,
"mean_token_accuracy": 0.1652148738503456,
"num_tokens": 17833298.0,
"step": 9560
},
{
"entropy": 6.204078483581543,
"epoch": 0.8446661956905687,
"grad_norm": 2.890625,
"learning_rate": 0.0004935656188614192,
"loss": 5.8864,
"mean_token_accuracy": 0.16408828198909758,
"num_tokens": 17842339.0,
"step": 9565
},
{
"entropy": 6.233523750305176,
"epoch": 0.845107735782409,
"grad_norm": 3.359375,
"learning_rate": 0.0004935581394475479,
"loss": 6.0917,
"mean_token_accuracy": 0.1569015219807625,
"num_tokens": 17851827.0,
"step": 9570
},
{
"entropy": 6.102023649215698,
"epoch": 0.8455492758742493,
"grad_norm": 2.4375,
"learning_rate": 0.0004935506557522469,
"loss": 5.9494,
"mean_token_accuracy": 0.16105230301618575,
"num_tokens": 17860788.0,
"step": 9575
},
{
"entropy": 6.20936017036438,
"epoch": 0.8459908159660897,
"grad_norm": 2.515625,
"learning_rate": 0.000493543167775663,
"loss": 5.9362,
"mean_token_accuracy": 0.15667283833026885,
"num_tokens": 17869849.0,
"step": 9580
},
{
"entropy": 6.2253578186035154,
"epoch": 0.8464323560579301,
"grad_norm": 1.9296875,
"learning_rate": 0.0004935356755179426,
"loss": 5.9588,
"mean_token_accuracy": 0.15767260789871215,
"num_tokens": 17879431.0,
"step": 9585
},
{
"entropy": 6.213526010513306,
"epoch": 0.8468738961497704,
"grad_norm": 1.7890625,
"learning_rate": 0.0004935281789792326,
"loss": 6.0748,
"mean_token_accuracy": 0.15099756941199302,
"num_tokens": 17888599.0,
"step": 9590
},
{
"entropy": 6.153097677230835,
"epoch": 0.8473154362416108,
"grad_norm": 2.25,
"learning_rate": 0.0004935206781596799,
"loss": 5.9707,
"mean_token_accuracy": 0.1634772926568985,
"num_tokens": 17898662.0,
"step": 9595
},
{
"entropy": 6.216610956192016,
"epoch": 0.847756976333451,
"grad_norm": 2.25,
"learning_rate": 0.0004935131730594315,
"loss": 5.9991,
"mean_token_accuracy": 0.15880897492170334,
"num_tokens": 17907810.0,
"step": 9600
},
{
"entropy": 6.164839506149292,
"epoch": 0.8481985164252914,
"grad_norm": 1.9609375,
"learning_rate": 0.0004935056636786342,
"loss": 5.9781,
"mean_token_accuracy": 0.15968113988637925,
"num_tokens": 17917611.0,
"step": 9605
},
{
"entropy": 6.138559341430664,
"epoch": 0.8486400565171317,
"grad_norm": 1.9453125,
"learning_rate": 0.0004934981500174353,
"loss": 5.9947,
"mean_token_accuracy": 0.15501207560300828,
"num_tokens": 17926076.0,
"step": 9610
},
{
"entropy": 6.2137932777404785,
"epoch": 0.8490815966089721,
"grad_norm": 1.8203125,
"learning_rate": 0.0004934906320759818,
"loss": 6.0368,
"mean_token_accuracy": 0.15579527318477632,
"num_tokens": 17935521.0,
"step": 9615
},
{
"entropy": 6.280076122283935,
"epoch": 0.8495231367008125,
"grad_norm": 2.046875,
"learning_rate": 0.0004934831098544211,
"loss": 5.9976,
"mean_token_accuracy": 0.1624443180859089,
"num_tokens": 17944849.0,
"step": 9620
},
{
"entropy": 6.205739307403564,
"epoch": 0.8499646767926528,
"grad_norm": 2.3125,
"learning_rate": 0.0004934755833529007,
"loss": 5.9589,
"mean_token_accuracy": 0.15643436163663865,
"num_tokens": 17953988.0,
"step": 9625
},
{
"entropy": 6.068555164337158,
"epoch": 0.8504062168844931,
"grad_norm": 2.15625,
"learning_rate": 0.0004934680525715677,
"loss": 5.9606,
"mean_token_accuracy": 0.16197733879089354,
"num_tokens": 17963319.0,
"step": 9630
},
{
"entropy": 6.0915374755859375,
"epoch": 0.8508477569763334,
"grad_norm": 2.890625,
"learning_rate": 0.0004934605175105698,
"loss": 5.9161,
"mean_token_accuracy": 0.16890619099140167,
"num_tokens": 17972054.0,
"step": 9635
},
{
"entropy": 6.247390985488892,
"epoch": 0.8512892970681738,
"grad_norm": 2.75,
"learning_rate": 0.0004934529781700546,
"loss": 6.0576,
"mean_token_accuracy": 0.15244774222373964,
"num_tokens": 17981630.0,
"step": 9640
},
{
"entropy": 6.215850448608398,
"epoch": 0.8517308371600141,
"grad_norm": 3.015625,
"learning_rate": 0.0004934454345501698,
"loss": 6.0182,
"mean_token_accuracy": 0.15213843584060668,
"num_tokens": 17990987.0,
"step": 9645
},
{
"entropy": 6.027804327011109,
"epoch": 0.8521723772518545,
"grad_norm": 2.359375,
"learning_rate": 0.0004934378866510633,
"loss": 5.9191,
"mean_token_accuracy": 0.16590783149003982,
"num_tokens": 17999284.0,
"step": 9650
},
{
"entropy": 6.108259820938111,
"epoch": 0.8526139173436948,
"grad_norm": 2.625,
"learning_rate": 0.0004934303344728828,
"loss": 5.9446,
"mean_token_accuracy": 0.15707543045282363,
"num_tokens": 18008670.0,
"step": 9655
},
{
"entropy": 6.156556510925293,
"epoch": 0.8530554574355351,
"grad_norm": 3.125,
"learning_rate": 0.0004934227780157761,
"loss": 5.9339,
"mean_token_accuracy": 0.16038557142019272,
"num_tokens": 18018374.0,
"step": 9660
},
{
"entropy": 6.267466640472412,
"epoch": 0.8534969975273755,
"grad_norm": 2.25,
"learning_rate": 0.0004934152172798916,
"loss": 6.0387,
"mean_token_accuracy": 0.15938163846731185,
"num_tokens": 18026943.0,
"step": 9665
},
{
"entropy": 6.20820984840393,
"epoch": 0.8539385376192158,
"grad_norm": 1.8515625,
"learning_rate": 0.0004934076522653772,
"loss": 5.9713,
"mean_token_accuracy": 0.15723704397678376,
"num_tokens": 18036270.0,
"step": 9670
},
{
"entropy": 6.021335649490356,
"epoch": 0.8543800777110562,
"grad_norm": 2.6875,
"learning_rate": 0.000493400082972381,
"loss": 5.9563,
"mean_token_accuracy": 0.15889653712511062,
"num_tokens": 18045611.0,
"step": 9675
},
{
"entropy": 6.086893844604492,
"epoch": 0.8548216178028964,
"grad_norm": 1.953125,
"learning_rate": 0.0004933925094010516,
"loss": 5.9913,
"mean_token_accuracy": 0.155303256213665,
"num_tokens": 18055152.0,
"step": 9680
},
{
"entropy": 6.250145196914673,
"epoch": 0.8552631578947368,
"grad_norm": 2.34375,
"learning_rate": 0.0004933849315515369,
"loss": 5.9902,
"mean_token_accuracy": 0.15396306663751602,
"num_tokens": 18064376.0,
"step": 9685
},
{
"entropy": 6.115861463546753,
"epoch": 0.8557046979865772,
"grad_norm": 2.546875,
"learning_rate": 0.0004933773494239857,
"loss": 5.8967,
"mean_token_accuracy": 0.1690524235367775,
"num_tokens": 18073569.0,
"step": 9690
},
{
"entropy": 6.09835638999939,
"epoch": 0.8561462380784175,
"grad_norm": 2.640625,
"learning_rate": 0.0004933697630185464,
"loss": 5.9739,
"mean_token_accuracy": 0.16236403733491897,
"num_tokens": 18083264.0,
"step": 9695
},
{
"entropy": 6.2189192295074465,
"epoch": 0.8565877781702579,
"grad_norm": 2.734375,
"learning_rate": 0.0004933621723353677,
"loss": 5.9849,
"mean_token_accuracy": 0.15814727321267127,
"num_tokens": 18093151.0,
"step": 9700
},
{
"entropy": 6.182145738601685,
"epoch": 0.8570293182620982,
"grad_norm": 2.015625,
"learning_rate": 0.000493354577374598,
"loss": 5.9152,
"mean_token_accuracy": 0.16911773085594178,
"num_tokens": 18102087.0,
"step": 9705
},
{
"entropy": 6.170217132568359,
"epoch": 0.8574708583539385,
"grad_norm": 2.140625,
"learning_rate": 0.0004933469781363865,
"loss": 6.0296,
"mean_token_accuracy": 0.15744710713624954,
"num_tokens": 18111854.0,
"step": 9710
},
{
"entropy": 6.223062944412232,
"epoch": 0.8579123984457788,
"grad_norm": 2.5625,
"learning_rate": 0.0004933393746208819,
"loss": 6.0406,
"mean_token_accuracy": 0.15364416390657426,
"num_tokens": 18120520.0,
"step": 9715
},
{
"entropy": 6.242568159103394,
"epoch": 0.8583539385376192,
"grad_norm": 2.3125,
"learning_rate": 0.0004933317668282331,
"loss": 6.1025,
"mean_token_accuracy": 0.15123526901006698,
"num_tokens": 18130557.0,
"step": 9720
},
{
"entropy": 6.237083101272583,
"epoch": 0.8587954786294596,
"grad_norm": 2.453125,
"learning_rate": 0.0004933241547585891,
"loss": 5.8969,
"mean_token_accuracy": 0.164296455681324,
"num_tokens": 18139199.0,
"step": 9725
},
{
"entropy": 6.09623908996582,
"epoch": 0.8592370187212999,
"grad_norm": 4.375,
"learning_rate": 0.0004933165384120991,
"loss": 5.9529,
"mean_token_accuracy": 0.16331166326999663,
"num_tokens": 18150039.0,
"step": 9730
},
{
"entropy": 6.105708980560303,
"epoch": 0.8596785588131403,
"grad_norm": 2.546875,
"learning_rate": 0.0004933089177889124,
"loss": 5.9382,
"mean_token_accuracy": 0.15601646453142165,
"num_tokens": 18159451.0,
"step": 9735
},
{
"entropy": 6.203593063354492,
"epoch": 0.8601200989049805,
"grad_norm": 1.953125,
"learning_rate": 0.0004933012928891781,
"loss": 6.0337,
"mean_token_accuracy": 0.14938282072544098,
"num_tokens": 18169896.0,
"step": 9740
},
{
"entropy": 6.135238790512085,
"epoch": 0.8605616389968209,
"grad_norm": 2.09375,
"learning_rate": 0.0004932936637130456,
"loss": 5.9184,
"mean_token_accuracy": 0.16263681799173355,
"num_tokens": 18177764.0,
"step": 9745
},
{
"entropy": 6.162826919555664,
"epoch": 0.8610031790886612,
"grad_norm": 3.125,
"learning_rate": 0.0004932860302606644,
"loss": 5.9842,
"mean_token_accuracy": 0.16079800426959992,
"num_tokens": 18186940.0,
"step": 9750
},
{
"entropy": 6.221426248550415,
"epoch": 0.8614447191805016,
"grad_norm": 1.6796875,
"learning_rate": 0.0004932783925321838,
"loss": 5.8692,
"mean_token_accuracy": 0.16636298596858978,
"num_tokens": 18195374.0,
"step": 9755
},
{
"entropy": 6.083749675750733,
"epoch": 0.861886259272342,
"grad_norm": 2.828125,
"learning_rate": 0.000493270750527754,
"loss": 5.999,
"mean_token_accuracy": 0.15221955329179765,
"num_tokens": 18204779.0,
"step": 9760
},
{
"entropy": 6.137063694000244,
"epoch": 0.8623277993641822,
"grad_norm": 2.25,
"learning_rate": 0.0004932631042475241,
"loss": 5.9265,
"mean_token_accuracy": 0.15914057046175004,
"num_tokens": 18214099.0,
"step": 9765
},
{
"entropy": 6.140520524978638,
"epoch": 0.8627693394560226,
"grad_norm": 2.234375,
"learning_rate": 0.0004932554536916441,
"loss": 6.0082,
"mean_token_accuracy": 0.1553066074848175,
"num_tokens": 18223190.0,
"step": 9770
},
{
"entropy": 6.1959740161895756,
"epoch": 0.8632108795478629,
"grad_norm": 2.859375,
"learning_rate": 0.000493247798860264,
"loss": 5.9899,
"mean_token_accuracy": 0.15831155478954315,
"num_tokens": 18232380.0,
"step": 9775
},
{
"entropy": 6.2308234691619875,
"epoch": 0.8636524196397033,
"grad_norm": 2.765625,
"learning_rate": 0.0004932401397535337,
"loss": 6.0683,
"mean_token_accuracy": 0.15317848771810533,
"num_tokens": 18242621.0,
"step": 9780
},
{
"entropy": 6.256820964813232,
"epoch": 0.8640939597315436,
"grad_norm": 3.6875,
"learning_rate": 0.000493232476371603,
"loss": 6.1026,
"mean_token_accuracy": 0.1491650089621544,
"num_tokens": 18253183.0,
"step": 9785
},
{
"entropy": 6.184752130508423,
"epoch": 0.864535499823384,
"grad_norm": 1.8671875,
"learning_rate": 0.0004932248087146223,
"loss": 5.8868,
"mean_token_accuracy": 0.16101259291172026,
"num_tokens": 18261967.0,
"step": 9790
},
{
"entropy": 6.036564445495605,
"epoch": 0.8649770399152243,
"grad_norm": 2.609375,
"learning_rate": 0.0004932171367827417,
"loss": 5.9752,
"mean_token_accuracy": 0.15483444780111313,
"num_tokens": 18270902.0,
"step": 9795
},
{
"entropy": 6.139100122451782,
"epoch": 0.8654185800070646,
"grad_norm": 2.015625,
"learning_rate": 0.0004932094605761115,
"loss": 6.015,
"mean_token_accuracy": 0.16237684041261674,
"num_tokens": 18279387.0,
"step": 9800
},
{
"entropy": 6.096801376342773,
"epoch": 0.865860120098905,
"grad_norm": 3.34375,
"learning_rate": 0.0004932017800948821,
"loss": 5.8138,
"mean_token_accuracy": 0.16666799336671828,
"num_tokens": 18288363.0,
"step": 9805
},
{
"entropy": 6.281640911102295,
"epoch": 0.8663016601907453,
"grad_norm": 2.296875,
"learning_rate": 0.0004931940953392038,
"loss": 6.1331,
"mean_token_accuracy": 0.14591752961277962,
"num_tokens": 18297398.0,
"step": 9810
},
{
"entropy": 6.330708360671997,
"epoch": 0.8667432002825857,
"grad_norm": 2.234375,
"learning_rate": 0.0004931864063092274,
"loss": 5.9803,
"mean_token_accuracy": 0.15628934502601624,
"num_tokens": 18306230.0,
"step": 9815
},
{
"entropy": 6.192914295196533,
"epoch": 0.8671847403744259,
"grad_norm": 2.0,
"learning_rate": 0.0004931787130051034,
"loss": 6.0858,
"mean_token_accuracy": 0.15765360742807388,
"num_tokens": 18316395.0,
"step": 9820
},
{
"entropy": 6.129390048980713,
"epoch": 0.8676262804662663,
"grad_norm": 3.015625,
"learning_rate": 0.0004931710154269824,
"loss": 5.9997,
"mean_token_accuracy": 0.16461013704538346,
"num_tokens": 18326020.0,
"step": 9825
},
{
"entropy": 6.165465402603149,
"epoch": 0.8680678205581067,
"grad_norm": 2.34375,
"learning_rate": 0.0004931633135750154,
"loss": 6.0003,
"mean_token_accuracy": 0.15785321742296218,
"num_tokens": 18335320.0,
"step": 9830
},
{
"entropy": 6.237389755249024,
"epoch": 0.868509360649947,
"grad_norm": 3.109375,
"learning_rate": 0.0004931556074493531,
"loss": 6.0127,
"mean_token_accuracy": 0.15674501061439514,
"num_tokens": 18345137.0,
"step": 9835
},
{
"entropy": 6.164565658569336,
"epoch": 0.8689509007417874,
"grad_norm": 1.6953125,
"learning_rate": 0.0004931478970501465,
"loss": 6.0149,
"mean_token_accuracy": 0.15781068652868271,
"num_tokens": 18354289.0,
"step": 9840
},
{
"entropy": 6.2489007949829105,
"epoch": 0.8693924408336277,
"grad_norm": 1.6875,
"learning_rate": 0.0004931401823775466,
"loss": 6.1001,
"mean_token_accuracy": 0.14934273287653924,
"num_tokens": 18363701.0,
"step": 9845
},
{
"entropy": 6.278642559051514,
"epoch": 0.869833980925468,
"grad_norm": 2.578125,
"learning_rate": 0.0004931324634317047,
"loss": 5.9879,
"mean_token_accuracy": 0.1524924896657467,
"num_tokens": 18373336.0,
"step": 9850
},
{
"entropy": 6.1871161460876465,
"epoch": 0.8702755210173083,
"grad_norm": 1.9140625,
"learning_rate": 0.0004931247402127719,
"loss": 5.9989,
"mean_token_accuracy": 0.1583039343357086,
"num_tokens": 18383233.0,
"step": 9855
},
{
"entropy": 6.195723628997802,
"epoch": 0.8707170611091487,
"grad_norm": 2.671875,
"learning_rate": 0.0004931170127208995,
"loss": 6.053,
"mean_token_accuracy": 0.15336766093969345,
"num_tokens": 18393214.0,
"step": 9860
},
{
"entropy": 6.170034790039063,
"epoch": 0.8711586012009891,
"grad_norm": 1.75,
"learning_rate": 0.0004931092809562388,
"loss": 5.9226,
"mean_token_accuracy": 0.1571400061249733,
"num_tokens": 18401773.0,
"step": 9865
},
{
"entropy": 6.0718714714050295,
"epoch": 0.8716001412928294,
"grad_norm": 1.625,
"learning_rate": 0.0004931015449189414,
"loss": 5.9757,
"mean_token_accuracy": 0.15442680418491364,
"num_tokens": 18411748.0,
"step": 9870
},
{
"entropy": 6.184693002700806,
"epoch": 0.8720416813846698,
"grad_norm": 5.4375,
"learning_rate": 0.0004930938046091587,
"loss": 6.0299,
"mean_token_accuracy": 0.1559053659439087,
"num_tokens": 18421399.0,
"step": 9875
},
{
"entropy": 6.1877052783966064,
"epoch": 0.87248322147651,
"grad_norm": 1.9375,
"learning_rate": 0.0004930860600270425,
"loss": 6.0218,
"mean_token_accuracy": 0.15311643481254578,
"num_tokens": 18430052.0,
"step": 9880
},
{
"entropy": 6.178013706207276,
"epoch": 0.8729247615683504,
"grad_norm": 2.15625,
"learning_rate": 0.0004930783111727443,
"loss": 5.8764,
"mean_token_accuracy": 0.16182063519954681,
"num_tokens": 18438268.0,
"step": 9885
},
{
"entropy": 6.100135803222656,
"epoch": 0.8733663016601907,
"grad_norm": 2.3125,
"learning_rate": 0.000493070558046416,
"loss": 6.0007,
"mean_token_accuracy": 0.15704500377178193,
"num_tokens": 18446964.0,
"step": 9890
},
{
"entropy": 6.173359727859497,
"epoch": 0.8738078417520311,
"grad_norm": 1.9453125,
"learning_rate": 0.0004930628006482097,
"loss": 5.987,
"mean_token_accuracy": 0.149699180573225,
"num_tokens": 18455701.0,
"step": 9895
},
{
"entropy": 6.163230943679809,
"epoch": 0.8742493818438715,
"grad_norm": 2.6875,
"learning_rate": 0.0004930550389782769,
"loss": 5.9607,
"mean_token_accuracy": 0.1571873053908348,
"num_tokens": 18465635.0,
"step": 9900
},
{
"entropy": 6.1286351680755615,
"epoch": 0.8746909219357117,
"grad_norm": 2.3125,
"learning_rate": 0.0004930472730367701,
"loss": 5.8875,
"mean_token_accuracy": 0.15707520246505738,
"num_tokens": 18474833.0,
"step": 9905
},
{
"entropy": 6.093353366851806,
"epoch": 0.8751324620275521,
"grad_norm": 2.078125,
"learning_rate": 0.0004930395028238412,
"loss": 5.9718,
"mean_token_accuracy": 0.15968486219644545,
"num_tokens": 18482987.0,
"step": 9910
},
{
"entropy": 6.086105155944824,
"epoch": 0.8755740021193924,
"grad_norm": 2.0,
"learning_rate": 0.0004930317283396423,
"loss": 5.8595,
"mean_token_accuracy": 0.16566946357488632,
"num_tokens": 18491274.0,
"step": 9915
},
{
"entropy": 6.124297380447388,
"epoch": 0.8760155422112328,
"grad_norm": 2.171875,
"learning_rate": 0.000493023949584326,
"loss": 6.0197,
"mean_token_accuracy": 0.14976424351334572,
"num_tokens": 18500811.0,
"step": 9920
},
{
"entropy": 6.031559228897095,
"epoch": 0.8764570823030731,
"grad_norm": 2.265625,
"learning_rate": 0.0004930161665580445,
"loss": 5.8088,
"mean_token_accuracy": 0.17823249995708465,
"num_tokens": 18509475.0,
"step": 9925
},
{
"entropy": 6.172056722640991,
"epoch": 0.8768986223949135,
"grad_norm": 2.109375,
"learning_rate": 0.0004930083792609502,
"loss": 5.9584,
"mean_token_accuracy": 0.1539497494697571,
"num_tokens": 18519410.0,
"step": 9930
},
{
"entropy": 5.970502138137817,
"epoch": 0.8773401624867538,
"grad_norm": 1.9296875,
"learning_rate": 0.0004930005876931958,
"loss": 5.8019,
"mean_token_accuracy": 0.17606235444545745,
"num_tokens": 18529194.0,
"step": 9935
},
{
"entropy": 6.162929964065552,
"epoch": 0.8777817025785941,
"grad_norm": 2.09375,
"learning_rate": 0.0004929927918549339,
"loss": 6.0033,
"mean_token_accuracy": 0.15608524531126022,
"num_tokens": 18539166.0,
"step": 9940
},
{
"entropy": 6.209700632095337,
"epoch": 0.8782232426704345,
"grad_norm": 1.78125,
"learning_rate": 0.0004929849917463171,
"loss": 5.95,
"mean_token_accuracy": 0.16139772087335585,
"num_tokens": 18548166.0,
"step": 9945
},
{
"entropy": 6.117978811264038,
"epoch": 0.8786647827622748,
"grad_norm": 2.5625,
"learning_rate": 0.0004929771873674984,
"loss": 5.9491,
"mean_token_accuracy": 0.1622804269194603,
"num_tokens": 18557041.0,
"step": 9950
},
{
"entropy": 6.082592153549195,
"epoch": 0.8791063228541152,
"grad_norm": 1.984375,
"learning_rate": 0.0004929693787186305,
"loss": 5.9845,
"mean_token_accuracy": 0.1522750437259674,
"num_tokens": 18566461.0,
"step": 9955
},
{
"entropy": 6.1452412605285645,
"epoch": 0.8795478629459554,
"grad_norm": 1.9609375,
"learning_rate": 0.0004929615657998664,
"loss": 5.9285,
"mean_token_accuracy": 0.15806070119142532,
"num_tokens": 18576334.0,
"step": 9960
},
{
"entropy": 6.206573724746704,
"epoch": 0.8799894030377958,
"grad_norm": 1.984375,
"learning_rate": 0.0004929537486113593,
"loss": 5.9274,
"mean_token_accuracy": 0.15601984411478043,
"num_tokens": 18584882.0,
"step": 9965
},
{
"entropy": 6.209783267974854,
"epoch": 0.8804309431296362,
"grad_norm": 4.125,
"learning_rate": 0.0004929459271532621,
"loss": 5.9828,
"mean_token_accuracy": 0.16202225536108017,
"num_tokens": 18593669.0,
"step": 9970
},
{
"entropy": 6.1056090831756595,
"epoch": 0.8808724832214765,
"grad_norm": 2.28125,
"learning_rate": 0.0004929381014257282,
"loss": 6.0172,
"mean_token_accuracy": 0.15371005237102509,
"num_tokens": 18603357.0,
"step": 9975
},
{
"entropy": 6.121936893463134,
"epoch": 0.8813140233133169,
"grad_norm": 2.296875,
"learning_rate": 0.0004929302714289107,
"loss": 5.9105,
"mean_token_accuracy": 0.1653357580304146,
"num_tokens": 18611856.0,
"step": 9980
},
{
"entropy": 6.104333591461182,
"epoch": 0.8817555634051572,
"grad_norm": 2.203125,
"learning_rate": 0.0004929224371629634,
"loss": 5.9642,
"mean_token_accuracy": 0.1603557825088501,
"num_tokens": 18620500.0,
"step": 9985
},
{
"entropy": 6.047509622573853,
"epoch": 0.8821971034969975,
"grad_norm": 2.078125,
"learning_rate": 0.0004929145986280394,
"loss": 5.9084,
"mean_token_accuracy": 0.16720178127288818,
"num_tokens": 18628836.0,
"step": 9990
},
{
"entropy": 6.099464797973633,
"epoch": 0.8826386435888378,
"grad_norm": 1.84375,
"learning_rate": 0.0004929067558242922,
"loss": 5.855,
"mean_token_accuracy": 0.1667298525571823,
"num_tokens": 18636831.0,
"step": 9995
},
{
"entropy": 6.1724354267120365,
"epoch": 0.8830801836806782,
"grad_norm": 2.25,
"learning_rate": 0.0004928989087518758,
"loss": 6.0137,
"mean_token_accuracy": 0.15936364680528642,
"num_tokens": 18646327.0,
"step": 10000
},
{
"entropy": 6.143145942687989,
"epoch": 0.8835217237725186,
"grad_norm": 2.03125,
"learning_rate": 0.0004928910574109435,
"loss": 6.0191,
"mean_token_accuracy": 0.16119926273822785,
"num_tokens": 18656125.0,
"step": 10005
},
{
"entropy": 6.178771924972534,
"epoch": 0.8839632638643589,
"grad_norm": 3.5,
"learning_rate": 0.0004928832018016495,
"loss": 6.0154,
"mean_token_accuracy": 0.15727590322494506,
"num_tokens": 18665853.0,
"step": 10010
},
{
"entropy": 6.275112152099609,
"epoch": 0.8844048039561992,
"grad_norm": 2.421875,
"learning_rate": 0.0004928753419241472,
"loss": 6.0675,
"mean_token_accuracy": 0.1556510418653488,
"num_tokens": 18676674.0,
"step": 10015
},
{
"entropy": 6.193856191635132,
"epoch": 0.8848463440480395,
"grad_norm": 1.828125,
"learning_rate": 0.0004928674777785912,
"loss": 5.9195,
"mean_token_accuracy": 0.16534098088741303,
"num_tokens": 18685535.0,
"step": 10020
},
{
"entropy": 6.103977155685425,
"epoch": 0.8852878841398799,
"grad_norm": 2.578125,
"learning_rate": 0.0004928596093651351,
"loss": 5.947,
"mean_token_accuracy": 0.15807052850723266,
"num_tokens": 18694186.0,
"step": 10025
},
{
"entropy": 6.072466421127319,
"epoch": 0.8857294242317202,
"grad_norm": 2.234375,
"learning_rate": 0.000492851736683933,
"loss": 5.9259,
"mean_token_accuracy": 0.16362985521554946,
"num_tokens": 18703061.0,
"step": 10030
},
{
"entropy": 6.162186241149902,
"epoch": 0.8861709643235606,
"grad_norm": 1.984375,
"learning_rate": 0.0004928438597351395,
"loss": 5.8793,
"mean_token_accuracy": 0.1696322128176689,
"num_tokens": 18712466.0,
"step": 10035
},
{
"entropy": 6.187384128570557,
"epoch": 0.886612504415401,
"grad_norm": 4.53125,
"learning_rate": 0.0004928359785189086,
"loss": 5.9941,
"mean_token_accuracy": 0.15585423707962037,
"num_tokens": 18721522.0,
"step": 10040
},
{
"entropy": 6.094083833694458,
"epoch": 0.8870540445072412,
"grad_norm": 1.765625,
"learning_rate": 0.0004928280930353948,
"loss": 5.9331,
"mean_token_accuracy": 0.1572372704744339,
"num_tokens": 18730488.0,
"step": 10045
},
{
"entropy": 6.134708881378174,
"epoch": 0.8874955845990816,
"grad_norm": 1.6875,
"learning_rate": 0.0004928202032847525,
"loss": 5.8499,
"mean_token_accuracy": 0.16398068964481355,
"num_tokens": 18740318.0,
"step": 10050
},
{
"entropy": 6.153920269012451,
"epoch": 0.8879371246909219,
"grad_norm": 2.09375,
"learning_rate": 0.0004928123092671362,
"loss": 5.9643,
"mean_token_accuracy": 0.15614549070596695,
"num_tokens": 18748731.0,
"step": 10055
},
{
"entropy": 6.091465139389038,
"epoch": 0.8883786647827623,
"grad_norm": 1.8515625,
"learning_rate": 0.0004928044109827008,
"loss": 5.894,
"mean_token_accuracy": 0.1666879966855049,
"num_tokens": 18757847.0,
"step": 10060
},
{
"entropy": 6.255213832855224,
"epoch": 0.8888202048746026,
"grad_norm": 2.328125,
"learning_rate": 0.0004927965084316007,
"loss": 6.0186,
"mean_token_accuracy": 0.14774415045976638,
"num_tokens": 18767429.0,
"step": 10065
},
{
"entropy": 6.098184490203858,
"epoch": 0.889261744966443,
"grad_norm": 2.28125,
"learning_rate": 0.000492788601613991,
"loss": 5.918,
"mean_token_accuracy": 0.16276439875364304,
"num_tokens": 18776652.0,
"step": 10070
},
{
"entropy": 6.12569146156311,
"epoch": 0.8897032850582833,
"grad_norm": 2.0625,
"learning_rate": 0.0004927806905300265,
"loss": 5.9672,
"mean_token_accuracy": 0.15752765536308289,
"num_tokens": 18785687.0,
"step": 10075
},
{
"entropy": 6.167108106613159,
"epoch": 0.8901448251501236,
"grad_norm": 1.8046875,
"learning_rate": 0.000492772775179862,
"loss": 5.9868,
"mean_token_accuracy": 0.15778727680444718,
"num_tokens": 18794924.0,
"step": 10080
},
{
"entropy": 6.114221906661987,
"epoch": 0.890586365241964,
"grad_norm": 2.671875,
"learning_rate": 0.0004927648555636528,
"loss": 5.8568,
"mean_token_accuracy": 0.17107161283493041,
"num_tokens": 18803359.0,
"step": 10085
},
{
"entropy": 6.129306507110596,
"epoch": 0.8910279053338043,
"grad_norm": 2.28125,
"learning_rate": 0.0004927569316815539,
"loss": 6.1021,
"mean_token_accuracy": 0.1516886830329895,
"num_tokens": 18813496.0,
"step": 10090
},
{
"entropy": 6.156683492660522,
"epoch": 0.8914694454256447,
"grad_norm": 2.15625,
"learning_rate": 0.0004927490035337205,
"loss": 5.9421,
"mean_token_accuracy": 0.15700186491012574,
"num_tokens": 18823274.0,
"step": 10095
},
{
"entropy": 6.141663837432861,
"epoch": 0.8919109855174849,
"grad_norm": 2.84375,
"learning_rate": 0.000492741071120308,
"loss": 5.9423,
"mean_token_accuracy": 0.1635010778903961,
"num_tokens": 18832436.0,
"step": 10100
},
{
"entropy": 6.226690769195557,
"epoch": 0.8923525256093253,
"grad_norm": 3.59375,
"learning_rate": 0.0004927331344414717,
"loss": 5.9909,
"mean_token_accuracy": 0.16376392394304276,
"num_tokens": 18841923.0,
"step": 10105
},
{
"entropy": 6.172034454345703,
"epoch": 0.8927940657011657,
"grad_norm": 2.125,
"learning_rate": 0.0004927251934973672,
"loss": 6.0402,
"mean_token_accuracy": 0.16067090779542922,
"num_tokens": 18850957.0,
"step": 10110
},
{
"entropy": 6.187482166290283,
"epoch": 0.893235605793006,
"grad_norm": 2.84375,
"learning_rate": 0.0004927172482881499,
"loss": 6.0392,
"mean_token_accuracy": 0.15117765441536904,
"num_tokens": 18859622.0,
"step": 10115
},
{
"entropy": 6.160938310623169,
"epoch": 0.8936771458848464,
"grad_norm": 2.71875,
"learning_rate": 0.0004927092988139755,
"loss": 6.0238,
"mean_token_accuracy": 0.15298343151807786,
"num_tokens": 18868555.0,
"step": 10120
},
{
"entropy": 6.204875230789185,
"epoch": 0.8941186859766866,
"grad_norm": 2.140625,
"learning_rate": 0.0004927013450749999,
"loss": 5.9988,
"mean_token_accuracy": 0.15551467090845109,
"num_tokens": 18877445.0,
"step": 10125
},
{
"entropy": 6.145435476303101,
"epoch": 0.894560226068527,
"grad_norm": 2.515625,
"learning_rate": 0.0004926933870713787,
"loss": 5.8916,
"mean_token_accuracy": 0.15852428525686263,
"num_tokens": 18886386.0,
"step": 10130
},
{
"entropy": 6.1948799133300785,
"epoch": 0.8950017661603673,
"grad_norm": 4.34375,
"learning_rate": 0.0004926854248032678,
"loss": 5.9907,
"mean_token_accuracy": 0.15740079432725906,
"num_tokens": 18895016.0,
"step": 10135
},
{
"entropy": 6.078075265884399,
"epoch": 0.8954433062522077,
"grad_norm": 1.9609375,
"learning_rate": 0.0004926774582708234,
"loss": 5.8806,
"mean_token_accuracy": 0.16388056427240372,
"num_tokens": 18904126.0,
"step": 10140
},
{
"entropy": 6.152683687210083,
"epoch": 0.8958848463440481,
"grad_norm": 2.359375,
"learning_rate": 0.0004926694874742012,
"loss": 5.9341,
"mean_token_accuracy": 0.15752492547035218,
"num_tokens": 18913064.0,
"step": 10145
},
{
"entropy": 6.147999668121338,
"epoch": 0.8963263864358884,
"grad_norm": 2.578125,
"learning_rate": 0.0004926615124135577,
"loss": 6.0222,
"mean_token_accuracy": 0.1524497777223587,
"num_tokens": 18921189.0,
"step": 10150
},
{
"entropy": 6.1421417713165285,
"epoch": 0.8967679265277287,
"grad_norm": 2.34375,
"learning_rate": 0.0004926535330890488,
"loss": 5.9494,
"mean_token_accuracy": 0.16012526005506517,
"num_tokens": 18930818.0,
"step": 10155
},
{
"entropy": 6.246501398086548,
"epoch": 0.897209466619569,
"grad_norm": 2.65625,
"learning_rate": 0.0004926455495008311,
"loss": 5.9774,
"mean_token_accuracy": 0.1523714005947113,
"num_tokens": 18940376.0,
"step": 10160
},
{
"entropy": 6.17475004196167,
"epoch": 0.8976510067114094,
"grad_norm": 2.6875,
"learning_rate": 0.0004926375616490608,
"loss": 5.9875,
"mean_token_accuracy": 0.16220213025808333,
"num_tokens": 18949418.0,
"step": 10165
},
{
"entropy": 6.109435367584228,
"epoch": 0.8980925468032497,
"grad_norm": 2.390625,
"learning_rate": 0.0004926295695338945,
"loss": 5.9556,
"mean_token_accuracy": 0.16157580241560937,
"num_tokens": 18959315.0,
"step": 10170
},
{
"entropy": 6.05972728729248,
"epoch": 0.8985340868950901,
"grad_norm": 2.78125,
"learning_rate": 0.0004926215731554887,
"loss": 5.8659,
"mean_token_accuracy": 0.16682535111904145,
"num_tokens": 18968336.0,
"step": 10175
},
{
"entropy": 6.188048887252807,
"epoch": 0.8989756269869305,
"grad_norm": 2.703125,
"learning_rate": 0.000492613572514,
"loss": 5.9194,
"mean_token_accuracy": 0.16019334346055986,
"num_tokens": 18977123.0,
"step": 10180
},
{
"entropy": 6.193733787536621,
"epoch": 0.8994171670787707,
"grad_norm": 2.03125,
"learning_rate": 0.0004926055676095851,
"loss": 6.0484,
"mean_token_accuracy": 0.15732912123203277,
"num_tokens": 18986150.0,
"step": 10185
},
{
"entropy": 6.277377939224243,
"epoch": 0.8998587071706111,
"grad_norm": 2.078125,
"learning_rate": 0.0004925975584424012,
"loss": 6.0495,
"mean_token_accuracy": 0.15204668790102005,
"num_tokens": 18996010.0,
"step": 10190
},
{
"entropy": 6.214195728302002,
"epoch": 0.9003002472624514,
"grad_norm": 1.90625,
"learning_rate": 0.0004925895450126046,
"loss": 6.0217,
"mean_token_accuracy": 0.14749930948019027,
"num_tokens": 19005100.0,
"step": 10195
},
{
"entropy": 6.112410926818848,
"epoch": 0.9007417873542918,
"grad_norm": 2.625,
"learning_rate": 0.0004925815273203526,
"loss": 5.9341,
"mean_token_accuracy": 0.15984983146190643,
"num_tokens": 19013844.0,
"step": 10200
},
{
"entropy": 6.212291717529297,
"epoch": 0.901183327446132,
"grad_norm": 2.15625,
"learning_rate": 0.0004925735053658022,
"loss": 6.0801,
"mean_token_accuracy": 0.1550981029868126,
"num_tokens": 19024218.0,
"step": 10205
},
{
"entropy": 6.189503288269043,
"epoch": 0.9016248675379724,
"grad_norm": 2.296875,
"learning_rate": 0.0004925654791491106,
"loss": 5.9972,
"mean_token_accuracy": 0.1579407796263695,
"num_tokens": 19034725.0,
"step": 10210
},
{
"entropy": 6.209549617767334,
"epoch": 0.9020664076298128,
"grad_norm": 6.5625,
"learning_rate": 0.0004925574486704351,
"loss": 6.0202,
"mean_token_accuracy": 0.15024372786283494,
"num_tokens": 19044597.0,
"step": 10215
},
{
"entropy": 6.2672497749328615,
"epoch": 0.9025079477216531,
"grad_norm": 2.640625,
"learning_rate": 0.0004925494139299329,
"loss": 6.1439,
"mean_token_accuracy": 0.14623530954122543,
"num_tokens": 19055124.0,
"step": 10220
},
{
"entropy": 6.186583995819092,
"epoch": 0.9029494878134935,
"grad_norm": 2.09375,
"learning_rate": 0.0004925413749277613,
"loss": 5.923,
"mean_token_accuracy": 0.15944349467754365,
"num_tokens": 19064516.0,
"step": 10225
},
{
"entropy": 6.134709692001342,
"epoch": 0.9033910279053338,
"grad_norm": 2.03125,
"learning_rate": 0.0004925333316640779,
"loss": 5.9492,
"mean_token_accuracy": 0.1654559314250946,
"num_tokens": 19072926.0,
"step": 10230
},
{
"entropy": 6.167013454437256,
"epoch": 0.9038325679971742,
"grad_norm": 2.40625,
"learning_rate": 0.0004925252841390403,
"loss": 6.0026,
"mean_token_accuracy": 0.15604564398527146,
"num_tokens": 19082313.0,
"step": 10235
},
{
"entropy": 6.104490518569946,
"epoch": 0.9042741080890144,
"grad_norm": 2.78125,
"learning_rate": 0.0004925172323528061,
"loss": 5.9534,
"mean_token_accuracy": 0.16372546106576918,
"num_tokens": 19091891.0,
"step": 10240
},
{
"entropy": 6.161465215682983,
"epoch": 0.9047156481808548,
"grad_norm": 2.296875,
"learning_rate": 0.000492509176305533,
"loss": 5.9796,
"mean_token_accuracy": 0.15716396272182465,
"num_tokens": 19100311.0,
"step": 10245
},
{
"entropy": 6.159690904617309,
"epoch": 0.9051571882726952,
"grad_norm": 6.65625,
"learning_rate": 0.0004925011159973788,
"loss": 5.9902,
"mean_token_accuracy": 0.15809255391359328,
"num_tokens": 19110463.0,
"step": 10250
},
{
"entropy": 6.243078994750976,
"epoch": 0.9055987283645355,
"grad_norm": 2.0,
"learning_rate": 0.0004924930514285015,
"loss": 5.9782,
"mean_token_accuracy": 0.16367797404527665,
"num_tokens": 19120723.0,
"step": 10255
},
{
"entropy": 6.127175807952881,
"epoch": 0.9060402684563759,
"grad_norm": 2.390625,
"learning_rate": 0.000492484982599059,
"loss": 5.9671,
"mean_token_accuracy": 0.1536429315805435,
"num_tokens": 19130259.0,
"step": 10260
},
{
"entropy": 6.101508283615113,
"epoch": 0.9064818085482161,
"grad_norm": 2.75,
"learning_rate": 0.0004924769095092094,
"loss": 6.0199,
"mean_token_accuracy": 0.15106856673955918,
"num_tokens": 19140256.0,
"step": 10265
},
{
"entropy": 6.1247899532318115,
"epoch": 0.9069233486400565,
"grad_norm": 6.875,
"learning_rate": 0.0004924688321591109,
"loss": 6.0259,
"mean_token_accuracy": 0.16416126638650894,
"num_tokens": 19149165.0,
"step": 10270
},
{
"entropy": 6.149999284744263,
"epoch": 0.9073648887318968,
"grad_norm": 2.125,
"learning_rate": 0.0004924607505489215,
"loss": 5.938,
"mean_token_accuracy": 0.1616960346698761,
"num_tokens": 19159254.0,
"step": 10275
},
{
"entropy": 6.198974180221557,
"epoch": 0.9078064288237372,
"grad_norm": 3.15625,
"learning_rate": 0.0004924526646787998,
"loss": 5.9761,
"mean_token_accuracy": 0.15327415317296983,
"num_tokens": 19168166.0,
"step": 10280
},
{
"entropy": 6.253731775283813,
"epoch": 0.9082479689155776,
"grad_norm": 2.328125,
"learning_rate": 0.000492444574548904,
"loss": 5.9748,
"mean_token_accuracy": 0.15770961791276933,
"num_tokens": 19176887.0,
"step": 10285
},
{
"entropy": 6.1348801612854,
"epoch": 0.9086895090074179,
"grad_norm": 3.03125,
"learning_rate": 0.0004924364801593927,
"loss": 5.8963,
"mean_token_accuracy": 0.16677361726760864,
"num_tokens": 19185510.0,
"step": 10290
},
{
"entropy": 6.072018003463745,
"epoch": 0.9091310490992582,
"grad_norm": 2.3125,
"learning_rate": 0.0004924283815104243,
"loss": 5.9452,
"mean_token_accuracy": 0.1645499736070633,
"num_tokens": 19195459.0,
"step": 10295
},
{
"entropy": 6.17732572555542,
"epoch": 0.9095725891910985,
"grad_norm": 2.84375,
"learning_rate": 0.0004924202786021578,
"loss": 5.9733,
"mean_token_accuracy": 0.15813441202044487,
"num_tokens": 19204590.0,
"step": 10300
},
{
"entropy": 6.1468604564666744,
"epoch": 0.9100141292829389,
"grad_norm": 2.28125,
"learning_rate": 0.0004924121714347515,
"loss": 5.9352,
"mean_token_accuracy": 0.16030677706003188,
"num_tokens": 19213302.0,
"step": 10305
},
{
"entropy": 6.154510164260865,
"epoch": 0.9104556693747792,
"grad_norm": 2.78125,
"learning_rate": 0.0004924040600083644,
"loss": 6.0328,
"mean_token_accuracy": 0.15988088846206666,
"num_tokens": 19223172.0,
"step": 10310
},
{
"entropy": 6.157843685150146,
"epoch": 0.9108972094666196,
"grad_norm": 3.765625,
"learning_rate": 0.0004923959443231554,
"loss": 5.9273,
"mean_token_accuracy": 0.16037092804908754,
"num_tokens": 19232234.0,
"step": 10315
},
{
"entropy": 6.109646129608154,
"epoch": 0.91133874955846,
"grad_norm": 2.40625,
"learning_rate": 0.0004923878243792836,
"loss": 5.9237,
"mean_token_accuracy": 0.16007081419229507,
"num_tokens": 19241070.0,
"step": 10320
},
{
"entropy": 6.183630561828613,
"epoch": 0.9117802896503002,
"grad_norm": 3.8125,
"learning_rate": 0.0004923797001769079,
"loss": 6.0205,
"mean_token_accuracy": 0.16071344614028932,
"num_tokens": 19251094.0,
"step": 10325
},
{
"entropy": 6.253526830673218,
"epoch": 0.9122218297421406,
"grad_norm": 2.25,
"learning_rate": 0.0004923715717161875,
"loss": 6.0942,
"mean_token_accuracy": 0.149643824249506,
"num_tokens": 19260588.0,
"step": 10330
},
{
"entropy": 6.20345253944397,
"epoch": 0.9126633698339809,
"grad_norm": 3.890625,
"learning_rate": 0.0004923634389972817,
"loss": 6.1132,
"mean_token_accuracy": 0.1518103376030922,
"num_tokens": 19270687.0,
"step": 10335
},
{
"entropy": 6.125924301147461,
"epoch": 0.9131049099258213,
"grad_norm": 3.203125,
"learning_rate": 0.0004923553020203497,
"loss": 5.9214,
"mean_token_accuracy": 0.16496748179197313,
"num_tokens": 19278739.0,
"step": 10340
},
{
"entropy": 6.274949359893799,
"epoch": 0.9135464500176615,
"grad_norm": 3.28125,
"learning_rate": 0.0004923471607855511,
"loss": 6.079,
"mean_token_accuracy": 0.1475290298461914,
"num_tokens": 19289184.0,
"step": 10345
},
{
"entropy": 6.172647905349732,
"epoch": 0.9139879901095019,
"grad_norm": 2.53125,
"learning_rate": 0.000492339015293045,
"loss": 5.9253,
"mean_token_accuracy": 0.1709852010011673,
"num_tokens": 19298390.0,
"step": 10350
},
{
"entropy": 6.1103662014007565,
"epoch": 0.9144295302013423,
"grad_norm": 2.328125,
"learning_rate": 0.0004923308655429913,
"loss": 5.8796,
"mean_token_accuracy": 0.16652060598134993,
"num_tokens": 19307227.0,
"step": 10355
},
{
"entropy": 6.186700439453125,
"epoch": 0.9148710702931826,
"grad_norm": 3.609375,
"learning_rate": 0.0004923227115355495,
"loss": 5.9151,
"mean_token_accuracy": 0.16031451821327208,
"num_tokens": 19317701.0,
"step": 10360
},
{
"entropy": 6.237708282470703,
"epoch": 0.915312610385023,
"grad_norm": 2.078125,
"learning_rate": 0.0004923145532708794,
"loss": 6.0386,
"mean_token_accuracy": 0.15701951384544371,
"num_tokens": 19326983.0,
"step": 10365
},
{
"entropy": 6.1817199230194095,
"epoch": 0.9157541504768633,
"grad_norm": 2.875,
"learning_rate": 0.0004923063907491408,
"loss": 6.0357,
"mean_token_accuracy": 0.15873900502920152,
"num_tokens": 19337157.0,
"step": 10370
},
{
"entropy": 6.22085485458374,
"epoch": 0.9161956905687036,
"grad_norm": 3.515625,
"learning_rate": 0.0004922982239704936,
"loss": 6.1169,
"mean_token_accuracy": 0.1537200056016445,
"num_tokens": 19346845.0,
"step": 10375
},
{
"entropy": 6.261074447631836,
"epoch": 0.9166372306605439,
"grad_norm": 2.375,
"learning_rate": 0.0004922900529350978,
"loss": 5.9952,
"mean_token_accuracy": 0.1562838226556778,
"num_tokens": 19356905.0,
"step": 10380
},
{
"entropy": 6.1972246170043945,
"epoch": 0.9170787707523843,
"grad_norm": 3.640625,
"learning_rate": 0.0004922818776431134,
"loss": 5.9898,
"mean_token_accuracy": 0.14969977140426635,
"num_tokens": 19366595.0,
"step": 10385
},
{
"entropy": 6.203570318222046,
"epoch": 0.9175203108442247,
"grad_norm": 4.03125,
"learning_rate": 0.0004922736980947005,
"loss": 6.0471,
"mean_token_accuracy": 0.153046116232872,
"num_tokens": 19377213.0,
"step": 10390
},
{
"entropy": 6.159463167190552,
"epoch": 0.917961850936065,
"grad_norm": 2.984375,
"learning_rate": 0.0004922655142900196,
"loss": 5.9058,
"mean_token_accuracy": 0.1586362361907959,
"num_tokens": 19385510.0,
"step": 10395
},
{
"entropy": 6.146579027175903,
"epoch": 0.9184033910279054,
"grad_norm": 3.03125,
"learning_rate": 0.0004922573262292308,
"loss": 5.92,
"mean_token_accuracy": 0.15831259936094283,
"num_tokens": 19394505.0,
"step": 10400
},
{
"entropy": 6.137448453903199,
"epoch": 0.9188449311197456,
"grad_norm": 2.15625,
"learning_rate": 0.0004922491339124945,
"loss": 5.8215,
"mean_token_accuracy": 0.16563843041658402,
"num_tokens": 19403140.0,
"step": 10405
},
{
"entropy": 6.156073999404907,
"epoch": 0.919286471211586,
"grad_norm": 4.46875,
"learning_rate": 0.0004922409373399713,
"loss": 6.0309,
"mean_token_accuracy": 0.15794083327054978,
"num_tokens": 19412709.0,
"step": 10410
},
{
"entropy": 6.116281747817993,
"epoch": 0.9197280113034263,
"grad_norm": 2.265625,
"learning_rate": 0.0004922327365118216,
"loss": 5.8843,
"mean_token_accuracy": 0.16703105568885804,
"num_tokens": 19422442.0,
"step": 10415
},
{
"entropy": 6.182830286026001,
"epoch": 0.9201695513952667,
"grad_norm": 2.609375,
"learning_rate": 0.0004922245314282062,
"loss": 6.0146,
"mean_token_accuracy": 0.153958822786808,
"num_tokens": 19432153.0,
"step": 10420
},
{
"entropy": 6.1479349613189695,
"epoch": 0.9206110914871071,
"grad_norm": 2.109375,
"learning_rate": 0.0004922163220892858,
"loss": 5.8137,
"mean_token_accuracy": 0.17392293363809586,
"num_tokens": 19440811.0,
"step": 10425
},
{
"entropy": 6.147120332717895,
"epoch": 0.9210526315789473,
"grad_norm": 2.5625,
"learning_rate": 0.000492208108495221,
"loss": 6.0022,
"mean_token_accuracy": 0.15592207610607148,
"num_tokens": 19451330.0,
"step": 10430
},
{
"entropy": 6.087326145172119,
"epoch": 0.9214941716707877,
"grad_norm": 1.9765625,
"learning_rate": 0.000492199890646173,
"loss": 5.8326,
"mean_token_accuracy": 0.17576577216386796,
"num_tokens": 19459689.0,
"step": 10435
},
{
"entropy": 6.145746564865112,
"epoch": 0.921935711762628,
"grad_norm": 2.640625,
"learning_rate": 0.0004921916685423028,
"loss": 5.8991,
"mean_token_accuracy": 0.1628457486629486,
"num_tokens": 19468110.0,
"step": 10440
},
{
"entropy": 6.125204181671142,
"epoch": 0.9223772518544684,
"grad_norm": 2.5625,
"learning_rate": 0.0004921834421837711,
"loss": 5.9677,
"mean_token_accuracy": 0.15853150188922882,
"num_tokens": 19477190.0,
"step": 10445
},
{
"entropy": 6.2207542896270756,
"epoch": 0.9228187919463087,
"grad_norm": 1.9609375,
"learning_rate": 0.0004921752115707394,
"loss": 6.0577,
"mean_token_accuracy": 0.1567036598920822,
"num_tokens": 19485757.0,
"step": 10450
},
{
"entropy": 6.15851674079895,
"epoch": 0.9232603320381491,
"grad_norm": 1.796875,
"learning_rate": 0.0004921669767033688,
"loss": 5.9906,
"mean_token_accuracy": 0.15671765357255935,
"num_tokens": 19494846.0,
"step": 10455
},
{
"entropy": 6.128986549377442,
"epoch": 0.9237018721299894,
"grad_norm": 2.046875,
"learning_rate": 0.0004921587375818207,
"loss": 5.9945,
"mean_token_accuracy": 0.15484389960765838,
"num_tokens": 19504307.0,
"step": 10460
},
{
"entropy": 6.202784824371338,
"epoch": 0.9241434122218297,
"grad_norm": 2.140625,
"learning_rate": 0.0004921504942062564,
"loss": 5.9439,
"mean_token_accuracy": 0.16070850789546967,
"num_tokens": 19512741.0,
"step": 10465
},
{
"entropy": 6.138077068328857,
"epoch": 0.9245849523136701,
"grad_norm": 2.90625,
"learning_rate": 0.0004921422465768374,
"loss": 5.8275,
"mean_token_accuracy": 0.1652836412191391,
"num_tokens": 19521823.0,
"step": 10470
},
{
"entropy": 6.182370710372925,
"epoch": 0.9250264924055104,
"grad_norm": 1.984375,
"learning_rate": 0.0004921339946937253,
"loss": 6.0086,
"mean_token_accuracy": 0.1567856878042221,
"num_tokens": 19531048.0,
"step": 10475
},
{
"entropy": 6.16999626159668,
"epoch": 0.9254680324973508,
"grad_norm": 1.984375,
"learning_rate": 0.0004921257385570818,
"loss": 5.9762,
"mean_token_accuracy": 0.15933252722024918,
"num_tokens": 19539543.0,
"step": 10480
},
{
"entropy": 6.17801342010498,
"epoch": 0.925909572589191,
"grad_norm": 1.8125,
"learning_rate": 0.0004921174781670685,
"loss": 6.0724,
"mean_token_accuracy": 0.1566457763314247,
"num_tokens": 19549242.0,
"step": 10485
},
{
"entropy": 6.182343149185181,
"epoch": 0.9263511126810314,
"grad_norm": 2.8125,
"learning_rate": 0.0004921092135238473,
"loss": 5.978,
"mean_token_accuracy": 0.1537988916039467,
"num_tokens": 19558259.0,
"step": 10490
},
{
"entropy": 6.235371446609497,
"epoch": 0.9267926527728718,
"grad_norm": 2.5,
"learning_rate": 0.00049210094462758,
"loss": 5.969,
"mean_token_accuracy": 0.1574867323040962,
"num_tokens": 19567327.0,
"step": 10495
},
{
"entropy": 6.208875751495361,
"epoch": 0.9272341928647121,
"grad_norm": 2.484375,
"learning_rate": 0.0004920926714784288,
"loss": 5.9901,
"mean_token_accuracy": 0.15162149146199227,
"num_tokens": 19576696.0,
"step": 10500
},
{
"entropy": 6.110769987106323,
"epoch": 0.9276757329565525,
"grad_norm": 3.140625,
"learning_rate": 0.0004920843940765555,
"loss": 5.8694,
"mean_token_accuracy": 0.1658803105354309,
"num_tokens": 19585708.0,
"step": 10505
},
{
"entropy": 6.216844892501831,
"epoch": 0.9281172730483928,
"grad_norm": 2.59375,
"learning_rate": 0.0004920761124221224,
"loss": 6.0516,
"mean_token_accuracy": 0.16040532737970353,
"num_tokens": 19595199.0,
"step": 10510
},
{
"entropy": 6.247623491287231,
"epoch": 0.9285588131402331,
"grad_norm": 1.9453125,
"learning_rate": 0.0004920678265152919,
"loss": 5.9726,
"mean_token_accuracy": 0.1484115317463875,
"num_tokens": 19604781.0,
"step": 10515
},
{
"entropy": 6.136961174011231,
"epoch": 0.9290003532320734,
"grad_norm": 2.640625,
"learning_rate": 0.000492059536356226,
"loss": 5.9251,
"mean_token_accuracy": 0.165871325135231,
"num_tokens": 19614203.0,
"step": 10520
},
{
"entropy": 6.160210037231446,
"epoch": 0.9294418933239138,
"grad_norm": 1.8046875,
"learning_rate": 0.0004920512419450872,
"loss": 5.942,
"mean_token_accuracy": 0.164012211561203,
"num_tokens": 19623664.0,
"step": 10525
},
{
"entropy": 6.231448602676392,
"epoch": 0.9298834334157542,
"grad_norm": 2.6875,
"learning_rate": 0.000492042943282038,
"loss": 5.9415,
"mean_token_accuracy": 0.16538400948047638,
"num_tokens": 19632960.0,
"step": 10530
},
{
"entropy": 6.167015647888183,
"epoch": 0.9303249735075945,
"grad_norm": 7.6875,
"learning_rate": 0.000492034640367241,
"loss": 6.0815,
"mean_token_accuracy": 0.1501421868801117,
"num_tokens": 19643087.0,
"step": 10535
},
{
"entropy": 6.208843135833741,
"epoch": 0.9307665135994349,
"grad_norm": 4.3125,
"learning_rate": 0.000492026333200859,
"loss": 6.0317,
"mean_token_accuracy": 0.15577057898044586,
"num_tokens": 19653015.0,
"step": 10540
},
{
"entropy": 6.283958816528321,
"epoch": 0.9312080536912751,
"grad_norm": 2.640625,
"learning_rate": 0.0004920180217830543,
"loss": 6.0339,
"mean_token_accuracy": 0.1582735762000084,
"num_tokens": 19661569.0,
"step": 10545
},
{
"entropy": 6.165363073348999,
"epoch": 0.9316495937831155,
"grad_norm": 1.9609375,
"learning_rate": 0.00049200970611399,
"loss": 5.8657,
"mean_token_accuracy": 0.16734613180160524,
"num_tokens": 19669559.0,
"step": 10550
},
{
"entropy": 6.069234418869018,
"epoch": 0.9320911338749558,
"grad_norm": 2.015625,
"learning_rate": 0.0004920013861938291,
"loss": 5.8985,
"mean_token_accuracy": 0.17063998579978942,
"num_tokens": 19678766.0,
"step": 10555
},
{
"entropy": 6.0744805335998535,
"epoch": 0.9325326739667962,
"grad_norm": 2.65625,
"learning_rate": 0.0004919930620227345,
"loss": 6.0003,
"mean_token_accuracy": 0.14907775372266768,
"num_tokens": 19688422.0,
"step": 10560
},
{
"entropy": 6.245268869400024,
"epoch": 0.9329742140586366,
"grad_norm": 1.96875,
"learning_rate": 0.0004919847336008692,
"loss": 6.0449,
"mean_token_accuracy": 0.15459591150283813,
"num_tokens": 19697206.0,
"step": 10565
},
{
"entropy": 6.244407606124878,
"epoch": 0.9334157541504768,
"grad_norm": 2.28125,
"learning_rate": 0.0004919764009283963,
"loss": 6.0147,
"mean_token_accuracy": 0.1524761900305748,
"num_tokens": 19706065.0,
"step": 10570
},
{
"entropy": 6.195303821563721,
"epoch": 0.9338572942423172,
"grad_norm": 3.3125,
"learning_rate": 0.0004919680640054792,
"loss": 5.9539,
"mean_token_accuracy": 0.16093820929527283,
"num_tokens": 19715402.0,
"step": 10575
},
{
"entropy": 6.123181867599487,
"epoch": 0.9342988343341575,
"grad_norm": 4.78125,
"learning_rate": 0.000491959722832281,
"loss": 5.8767,
"mean_token_accuracy": 0.163878333568573,
"num_tokens": 19724328.0,
"step": 10580
},
{
"entropy": 6.1337298393249515,
"epoch": 0.9347403744259979,
"grad_norm": 2.75,
"learning_rate": 0.0004919513774089653,
"loss": 5.9852,
"mean_token_accuracy": 0.16320302486419677,
"num_tokens": 19734087.0,
"step": 10585
},
{
"entropy": 6.23244457244873,
"epoch": 0.9351819145178382,
"grad_norm": 5.46875,
"learning_rate": 0.0004919430277356955,
"loss": 5.954,
"mean_token_accuracy": 0.1624945268034935,
"num_tokens": 19743010.0,
"step": 10590
},
{
"entropy": 6.171272087097168,
"epoch": 0.9356234546096786,
"grad_norm": 1.84375,
"learning_rate": 0.0004919346738126351,
"loss": 5.8942,
"mean_token_accuracy": 0.16523865461349488,
"num_tokens": 19752212.0,
"step": 10595
},
{
"entropy": 6.140925598144531,
"epoch": 0.9360649947015189,
"grad_norm": 3.703125,
"learning_rate": 0.0004919263156399478,
"loss": 6.001,
"mean_token_accuracy": 0.1534368947148323,
"num_tokens": 19762496.0,
"step": 10600
},
{
"entropy": 6.125303602218628,
"epoch": 0.9365065347933592,
"grad_norm": 3.234375,
"learning_rate": 0.0004919179532177976,
"loss": 5.9891,
"mean_token_accuracy": 0.15815122723579406,
"num_tokens": 19772665.0,
"step": 10605
},
{
"entropy": 6.085832500457764,
"epoch": 0.9369480748851996,
"grad_norm": 2.421875,
"learning_rate": 0.0004919095865463479,
"loss": 5.8132,
"mean_token_accuracy": 0.16872518658638,
"num_tokens": 19781639.0,
"step": 10610
},
{
"entropy": 6.180194473266601,
"epoch": 0.9373896149770399,
"grad_norm": 2.078125,
"learning_rate": 0.0004919012156257627,
"loss": 5.9251,
"mean_token_accuracy": 0.1565668687224388,
"num_tokens": 19791475.0,
"step": 10615
},
{
"entropy": 6.1829041004180905,
"epoch": 0.9378311550688803,
"grad_norm": 2.109375,
"learning_rate": 0.0004918928404562061,
"loss": 5.928,
"mean_token_accuracy": 0.16138927787542343,
"num_tokens": 19800967.0,
"step": 10620
},
{
"entropy": 6.13254976272583,
"epoch": 0.9382726951607206,
"grad_norm": 3.296875,
"learning_rate": 0.0004918844610378421,
"loss": 6.0474,
"mean_token_accuracy": 0.15431503504514693,
"num_tokens": 19810303.0,
"step": 10625
},
{
"entropy": 6.2258116722106935,
"epoch": 0.9387142352525609,
"grad_norm": 2.53125,
"learning_rate": 0.0004918760773708348,
"loss": 5.964,
"mean_token_accuracy": 0.15566823482513428,
"num_tokens": 19819049.0,
"step": 10630
},
{
"entropy": 6.22969422340393,
"epoch": 0.9391557753444013,
"grad_norm": 2.546875,
"learning_rate": 0.0004918676894553485,
"loss": 6.0081,
"mean_token_accuracy": 0.15517892092466354,
"num_tokens": 19828253.0,
"step": 10635
},
{
"entropy": 6.15832667350769,
"epoch": 0.9395973154362416,
"grad_norm": 2.109375,
"learning_rate": 0.0004918592972915476,
"loss": 5.9792,
"mean_token_accuracy": 0.16171526163816452,
"num_tokens": 19837673.0,
"step": 10640
},
{
"entropy": 6.0932870388031,
"epoch": 0.940038855528082,
"grad_norm": 2.515625,
"learning_rate": 0.0004918509008795963,
"loss": 5.9764,
"mean_token_accuracy": 0.1507473483681679,
"num_tokens": 19846289.0,
"step": 10645
},
{
"entropy": 6.123846578598022,
"epoch": 0.9404803956199222,
"grad_norm": 2.15625,
"learning_rate": 0.0004918425002196594,
"loss": 5.9561,
"mean_token_accuracy": 0.1590390458703041,
"num_tokens": 19855384.0,
"step": 10650
},
{
"entropy": 6.208305549621582,
"epoch": 0.9409219357117626,
"grad_norm": 3.359375,
"learning_rate": 0.000491834095311901,
"loss": 5.8934,
"mean_token_accuracy": 0.16639019250869752,
"num_tokens": 19864688.0,
"step": 10655
},
{
"entropy": 6.155508804321289,
"epoch": 0.941363475803603,
"grad_norm": 3.453125,
"learning_rate": 0.000491825686156486,
"loss": 5.8997,
"mean_token_accuracy": 0.16519621908664703,
"num_tokens": 19873692.0,
"step": 10660
},
{
"entropy": 6.169809436798095,
"epoch": 0.9418050158954433,
"grad_norm": 4.09375,
"learning_rate": 0.0004918172727535792,
"loss": 6.0061,
"mean_token_accuracy": 0.1533743441104889,
"num_tokens": 19882063.0,
"step": 10665
},
{
"entropy": 6.193909072875977,
"epoch": 0.9422465559872837,
"grad_norm": 3.46875,
"learning_rate": 0.0004918088551033454,
"loss": 5.9641,
"mean_token_accuracy": 0.15517878383398057,
"num_tokens": 19891727.0,
"step": 10670
},
{
"entropy": 6.118383312225342,
"epoch": 0.942688096079124,
"grad_norm": 1.828125,
"learning_rate": 0.0004918004332059493,
"loss": 6.0204,
"mean_token_accuracy": 0.16066317707300187,
"num_tokens": 19901851.0,
"step": 10675
},
{
"entropy": 6.214917278289795,
"epoch": 0.9431296361709643,
"grad_norm": 4.71875,
"learning_rate": 0.0004917920070615561,
"loss": 5.96,
"mean_token_accuracy": 0.15558556020259856,
"num_tokens": 19911092.0,
"step": 10680
},
{
"entropy": 6.182092189788818,
"epoch": 0.9435711762628046,
"grad_norm": 5.0625,
"learning_rate": 0.0004917835766703307,
"loss": 5.922,
"mean_token_accuracy": 0.16542033851146698,
"num_tokens": 19920842.0,
"step": 10685
},
{
"entropy": 6.1528369903564455,
"epoch": 0.944012716354645,
"grad_norm": 2.953125,
"learning_rate": 0.0004917751420324384,
"loss": 6.0299,
"mean_token_accuracy": 0.15224217623472214,
"num_tokens": 19930833.0,
"step": 10690
},
{
"entropy": 6.175285959243775,
"epoch": 0.9444542564464854,
"grad_norm": 3.109375,
"learning_rate": 0.0004917667031480444,
"loss": 6.0474,
"mean_token_accuracy": 0.15815142989158631,
"num_tokens": 19940514.0,
"step": 10695
},
{
"entropy": 6.1913979053497314,
"epoch": 0.9448957965383257,
"grad_norm": 1.921875,
"learning_rate": 0.0004917582600173138,
"loss": 5.8831,
"mean_token_accuracy": 0.16070190966129302,
"num_tokens": 19948949.0,
"step": 10700
},
{
"entropy": 6.095789575576783,
"epoch": 0.9453373366301661,
"grad_norm": 2.40625,
"learning_rate": 0.0004917498126404123,
"loss": 5.8587,
"mean_token_accuracy": 0.15952101945877076,
"num_tokens": 19958410.0,
"step": 10705
},
{
"entropy": 6.128338813781738,
"epoch": 0.9457788767220063,
"grad_norm": 3.078125,
"learning_rate": 0.0004917413610175052,
"loss": 5.876,
"mean_token_accuracy": 0.1686732992529869,
"num_tokens": 19968160.0,
"step": 10710
},
{
"entropy": 6.18701024055481,
"epoch": 0.9462204168138467,
"grad_norm": 1.7421875,
"learning_rate": 0.0004917329051487582,
"loss": 6.0241,
"mean_token_accuracy": 0.15233552306890488,
"num_tokens": 19976811.0,
"step": 10715
},
{
"entropy": 6.287598276138306,
"epoch": 0.946661956905687,
"grad_norm": 13.9375,
"learning_rate": 0.0004917244450343368,
"loss": 6.0997,
"mean_token_accuracy": 0.15241969525814056,
"num_tokens": 19986326.0,
"step": 10720
},
{
"entropy": 6.104693222045898,
"epoch": 0.9471034969975274,
"grad_norm": 2.828125,
"learning_rate": 0.0004917159806744067,
"loss": 5.8413,
"mean_token_accuracy": 0.16053713485598564,
"num_tokens": 19996255.0,
"step": 10725
},
{
"entropy": 6.118229389190674,
"epoch": 0.9475450370893678,
"grad_norm": 2.265625,
"learning_rate": 0.0004917075120691338,
"loss": 6.0189,
"mean_token_accuracy": 0.1601894646883011,
"num_tokens": 20004805.0,
"step": 10730
},
{
"entropy": 6.1504762172698975,
"epoch": 0.947986577181208,
"grad_norm": 2.1875,
"learning_rate": 0.0004916990392186841,
"loss": 5.9382,
"mean_token_accuracy": 0.16196830719709396,
"num_tokens": 20014189.0,
"step": 10735
},
{
"entropy": 6.234215831756591,
"epoch": 0.9484281172730484,
"grad_norm": 2.25,
"learning_rate": 0.0004916905621232233,
"loss": 5.9289,
"mean_token_accuracy": 0.16267661601305008,
"num_tokens": 20023261.0,
"step": 10740
},
{
"entropy": 6.108267068862915,
"epoch": 0.9488696573648887,
"grad_norm": 2.828125,
"learning_rate": 0.0004916820807829177,
"loss": 5.8913,
"mean_token_accuracy": 0.16429898738861085,
"num_tokens": 20032433.0,
"step": 10745
},
{
"entropy": 6.097095108032226,
"epoch": 0.9493111974567291,
"grad_norm": 1.9375,
"learning_rate": 0.0004916735951979335,
"loss": 6.0122,
"mean_token_accuracy": 0.1613960638642311,
"num_tokens": 20041455.0,
"step": 10750
},
{
"entropy": 6.155736780166626,
"epoch": 0.9497527375485694,
"grad_norm": 2.296875,
"learning_rate": 0.0004916651053684366,
"loss": 6.0244,
"mean_token_accuracy": 0.15759865641593934,
"num_tokens": 20050088.0,
"step": 10755
},
{
"entropy": 6.155130529403687,
"epoch": 0.9501942776404098,
"grad_norm": 2.75,
"learning_rate": 0.0004916566112945936,
"loss": 5.9845,
"mean_token_accuracy": 0.15779783129692077,
"num_tokens": 20059114.0,
"step": 10760
},
{
"entropy": 6.236398553848266,
"epoch": 0.9506358177322501,
"grad_norm": 2.3125,
"learning_rate": 0.0004916481129765708,
"loss": 5.9911,
"mean_token_accuracy": 0.15340600907802582,
"num_tokens": 20068692.0,
"step": 10765
},
{
"entropy": 6.1456201553344725,
"epoch": 0.9510773578240904,
"grad_norm": 4.5625,
"learning_rate": 0.0004916396104145347,
"loss": 6.0611,
"mean_token_accuracy": 0.15598432049155236,
"num_tokens": 20078380.0,
"step": 10770
},
{
"entropy": 6.059614419937134,
"epoch": 0.9515188979159308,
"grad_norm": 2.484375,
"learning_rate": 0.0004916311036086518,
"loss": 5.8904,
"mean_token_accuracy": 0.17354806512594223,
"num_tokens": 20087849.0,
"step": 10775
},
{
"entropy": 6.1677850723266605,
"epoch": 0.9519604380077711,
"grad_norm": 2.109375,
"learning_rate": 0.0004916225925590889,
"loss": 5.8266,
"mean_token_accuracy": 0.16757511496543884,
"num_tokens": 20097253.0,
"step": 10780
},
{
"entropy": 6.187118577957153,
"epoch": 0.9524019780996115,
"grad_norm": 2.734375,
"learning_rate": 0.0004916140772660124,
"loss": 6.0,
"mean_token_accuracy": 0.16311897486448287,
"num_tokens": 20105931.0,
"step": 10785
},
{
"entropy": 6.141891860961914,
"epoch": 0.9528435181914517,
"grad_norm": 3.03125,
"learning_rate": 0.0004916055577295895,
"loss": 5.9233,
"mean_token_accuracy": 0.16284452974796296,
"num_tokens": 20115546.0,
"step": 10790
},
{
"entropy": 6.178923606872559,
"epoch": 0.9532850582832921,
"grad_norm": 3.03125,
"learning_rate": 0.0004915970339499868,
"loss": 5.9308,
"mean_token_accuracy": 0.16361893117427825,
"num_tokens": 20125009.0,
"step": 10795
},
{
"entropy": 6.040283250808716,
"epoch": 0.9537265983751325,
"grad_norm": 3.046875,
"learning_rate": 0.0004915885059273714,
"loss": 5.909,
"mean_token_accuracy": 0.16422068178653718,
"num_tokens": 20134007.0,
"step": 10800
},
{
"entropy": 6.14313702583313,
"epoch": 0.9541681384669728,
"grad_norm": 2.953125,
"learning_rate": 0.0004915799736619104,
"loss": 5.922,
"mean_token_accuracy": 0.1643960401415825,
"num_tokens": 20142617.0,
"step": 10805
},
{
"entropy": 6.117835760116577,
"epoch": 0.9546096785588132,
"grad_norm": 3.078125,
"learning_rate": 0.000491571437153771,
"loss": 5.9136,
"mean_token_accuracy": 0.16650509983301162,
"num_tokens": 20151732.0,
"step": 10810
},
{
"entropy": 6.179229021072388,
"epoch": 0.9550512186506535,
"grad_norm": 2.609375,
"learning_rate": 0.0004915628964031202,
"loss": 6.0515,
"mean_token_accuracy": 0.15033523887395858,
"num_tokens": 20161733.0,
"step": 10815
},
{
"entropy": 6.180949592590332,
"epoch": 0.9554927587424938,
"grad_norm": 3.15625,
"learning_rate": 0.0004915543514101253,
"loss": 5.9547,
"mean_token_accuracy": 0.15835601836442947,
"num_tokens": 20171022.0,
"step": 10820
},
{
"entropy": 6.183652925491333,
"epoch": 0.9559342988343341,
"grad_norm": 1.9375,
"learning_rate": 0.0004915458021749541,
"loss": 5.9926,
"mean_token_accuracy": 0.15394347608089448,
"num_tokens": 20180809.0,
"step": 10825
},
{
"entropy": 6.15289158821106,
"epoch": 0.9563758389261745,
"grad_norm": 2.65625,
"learning_rate": 0.0004915372486977736,
"loss": 5.8996,
"mean_token_accuracy": 0.16560763716697693,
"num_tokens": 20189614.0,
"step": 10830
},
{
"entropy": 6.160170698165894,
"epoch": 0.9568173790180149,
"grad_norm": 4.40625,
"learning_rate": 0.0004915286909787516,
"loss": 6.0551,
"mean_token_accuracy": 0.14777375608682633,
"num_tokens": 20199136.0,
"step": 10835
},
{
"entropy": 6.173372602462768,
"epoch": 0.9572589191098552,
"grad_norm": 5.6875,
"learning_rate": 0.0004915201290180556,
"loss": 5.9446,
"mean_token_accuracy": 0.16057561188936234,
"num_tokens": 20208768.0,
"step": 10840
},
{
"entropy": 6.106714868545533,
"epoch": 0.9577004592016956,
"grad_norm": 3.84375,
"learning_rate": 0.0004915115628158535,
"loss": 5.9355,
"mean_token_accuracy": 0.16022128760814666,
"num_tokens": 20218109.0,
"step": 10845
},
{
"entropy": 6.202994537353516,
"epoch": 0.9581419992935358,
"grad_norm": 2.953125,
"learning_rate": 0.000491502992372313,
"loss": 5.9354,
"mean_token_accuracy": 0.16158947944641114,
"num_tokens": 20226768.0,
"step": 10850
},
{
"entropy": 6.211356449127197,
"epoch": 0.9585835393853762,
"grad_norm": 2.171875,
"learning_rate": 0.000491494417687602,
"loss": 5.9101,
"mean_token_accuracy": 0.1630925565958023,
"num_tokens": 20236519.0,
"step": 10855
},
{
"entropy": 6.153908157348633,
"epoch": 0.9590250794772165,
"grad_norm": 2.453125,
"learning_rate": 0.0004914858387618886,
"loss": 5.922,
"mean_token_accuracy": 0.16221091151237488,
"num_tokens": 20245611.0,
"step": 10860
},
{
"entropy": 6.0724671363830565,
"epoch": 0.9594666195690569,
"grad_norm": 2.296875,
"learning_rate": 0.0004914772555953406,
"loss": 5.8351,
"mean_token_accuracy": 0.1719083458185196,
"num_tokens": 20255089.0,
"step": 10865
},
{
"entropy": 6.13020658493042,
"epoch": 0.9599081596608973,
"grad_norm": 2.53125,
"learning_rate": 0.0004914686681881264,
"loss": 5.9988,
"mean_token_accuracy": 0.157062304019928,
"num_tokens": 20264794.0,
"step": 10870
},
{
"entropy": 6.127739715576172,
"epoch": 0.9603496997527375,
"grad_norm": 4.4375,
"learning_rate": 0.000491460076540414,
"loss": 5.864,
"mean_token_accuracy": 0.17125632166862487,
"num_tokens": 20274088.0,
"step": 10875
},
{
"entropy": 6.199997329711914,
"epoch": 0.9607912398445779,
"grad_norm": 2.625,
"learning_rate": 0.0004914514806523718,
"loss": 6.0398,
"mean_token_accuracy": 0.1523118495941162,
"num_tokens": 20283837.0,
"step": 10880
},
{
"entropy": 6.204144144058228,
"epoch": 0.9612327799364182,
"grad_norm": 2.359375,
"learning_rate": 0.0004914428805241683,
"loss": 5.9281,
"mean_token_accuracy": 0.15971462726593016,
"num_tokens": 20293287.0,
"step": 10885
},
{
"entropy": 6.070000171661377,
"epoch": 0.9616743200282586,
"grad_norm": 2.328125,
"learning_rate": 0.0004914342761559718,
"loss": 5.9171,
"mean_token_accuracy": 0.15721042901277543,
"num_tokens": 20302262.0,
"step": 10890
},
{
"entropy": 6.170208215713501,
"epoch": 0.9621158601200989,
"grad_norm": 2.25,
"learning_rate": 0.0004914256675479509,
"loss": 5.9994,
"mean_token_accuracy": 0.15572456568479537,
"num_tokens": 20312475.0,
"step": 10895
},
{
"entropy": 6.23331880569458,
"epoch": 0.9625574002119393,
"grad_norm": 2.734375,
"learning_rate": 0.0004914170547002742,
"loss": 6.0297,
"mean_token_accuracy": 0.15053027495741844,
"num_tokens": 20322243.0,
"step": 10900
},
{
"entropy": 6.2365124225616455,
"epoch": 0.9629989403037796,
"grad_norm": 2.53125,
"learning_rate": 0.0004914084376131106,
"loss": 5.9343,
"mean_token_accuracy": 0.16111755073070527,
"num_tokens": 20331299.0,
"step": 10905
},
{
"entropy": 6.094996690750122,
"epoch": 0.9634404803956199,
"grad_norm": 2.09375,
"learning_rate": 0.0004913998162866288,
"loss": 5.835,
"mean_token_accuracy": 0.1692332446575165,
"num_tokens": 20340800.0,
"step": 10910
},
{
"entropy": 6.116983032226562,
"epoch": 0.9638820204874603,
"grad_norm": 2.78125,
"learning_rate": 0.0004913911907209976,
"loss": 5.9328,
"mean_token_accuracy": 0.16268047094345092,
"num_tokens": 20350292.0,
"step": 10915
},
{
"entropy": 6.182284593582153,
"epoch": 0.9643235605793006,
"grad_norm": 3.3125,
"learning_rate": 0.0004913825609163861,
"loss": 6.0206,
"mean_token_accuracy": 0.15402688831090927,
"num_tokens": 20360109.0,
"step": 10920
},
{
"entropy": 6.1093377590179445,
"epoch": 0.964765100671141,
"grad_norm": 1.5625,
"learning_rate": 0.0004913739268729633,
"loss": 5.8404,
"mean_token_accuracy": 0.17180828154087066,
"num_tokens": 20368917.0,
"step": 10925
},
{
"entropy": 6.178535223007202,
"epoch": 0.9652066407629812,
"grad_norm": 3.03125,
"learning_rate": 0.0004913652885908983,
"loss": 6.0324,
"mean_token_accuracy": 0.1522174820303917,
"num_tokens": 20378580.0,
"step": 10930
},
{
"entropy": 6.119336557388306,
"epoch": 0.9656481808548216,
"grad_norm": 2.4375,
"learning_rate": 0.0004913566460703603,
"loss": 5.8828,
"mean_token_accuracy": 0.16234672516584397,
"num_tokens": 20387497.0,
"step": 10935
},
{
"entropy": 6.144427728652954,
"epoch": 0.966089720946662,
"grad_norm": 2.5,
"learning_rate": 0.0004913479993115187,
"loss": 6.027,
"mean_token_accuracy": 0.15449808835983275,
"num_tokens": 20396586.0,
"step": 10940
},
{
"entropy": 6.235413408279419,
"epoch": 0.9665312610385023,
"grad_norm": 2.453125,
"learning_rate": 0.0004913393483145428,
"loss": 6.0828,
"mean_token_accuracy": 0.14955938309431077,
"num_tokens": 20406183.0,
"step": 10945
},
{
"entropy": 6.3583001613616945,
"epoch": 0.9669728011303427,
"grad_norm": 5.1875,
"learning_rate": 0.0004913306930796022,
"loss": 6.0465,
"mean_token_accuracy": 0.1539454810321331,
"num_tokens": 20415716.0,
"step": 10950
},
{
"entropy": 6.1973809719085695,
"epoch": 0.967414341222183,
"grad_norm": 2.09375,
"learning_rate": 0.0004913220336068662,
"loss": 5.9509,
"mean_token_accuracy": 0.1575819581747055,
"num_tokens": 20424715.0,
"step": 10955
},
{
"entropy": 6.124987983703614,
"epoch": 0.9678558813140233,
"grad_norm": 2.859375,
"learning_rate": 0.0004913133698965048,
"loss": 5.9675,
"mean_token_accuracy": 0.16422422081232071,
"num_tokens": 20434686.0,
"step": 10960
},
{
"entropy": 6.170560693740844,
"epoch": 0.9682974214058636,
"grad_norm": 2.359375,
"learning_rate": 0.0004913047019486874,
"loss": 5.9577,
"mean_token_accuracy": 0.16300200372934343,
"num_tokens": 20443619.0,
"step": 10965
},
{
"entropy": 6.100633525848389,
"epoch": 0.968738961497704,
"grad_norm": 2.359375,
"learning_rate": 0.0004912960297635839,
"loss": 5.8854,
"mean_token_accuracy": 0.17055538445711135,
"num_tokens": 20453540.0,
"step": 10970
},
{
"entropy": 6.15794153213501,
"epoch": 0.9691805015895444,
"grad_norm": 2.40625,
"learning_rate": 0.0004912873533413641,
"loss": 5.9833,
"mean_token_accuracy": 0.15741048455238343,
"num_tokens": 20463395.0,
"step": 10975
},
{
"entropy": 6.195424938201905,
"epoch": 0.9696220416813847,
"grad_norm": 2.625,
"learning_rate": 0.0004912786726821982,
"loss": 5.9311,
"mean_token_accuracy": 0.1594565749168396,
"num_tokens": 20472302.0,
"step": 10980
},
{
"entropy": 6.100572538375855,
"epoch": 0.970063581773225,
"grad_norm": 2.875,
"learning_rate": 0.000491269987786256,
"loss": 5.9553,
"mean_token_accuracy": 0.1571328803896904,
"num_tokens": 20482077.0,
"step": 10985
},
{
"entropy": 6.153246355056763,
"epoch": 0.9705051218650653,
"grad_norm": 2.828125,
"learning_rate": 0.0004912612986537078,
"loss": 5.9603,
"mean_token_accuracy": 0.15788106471300126,
"num_tokens": 20492177.0,
"step": 10990
},
{
"entropy": 6.153832530975341,
"epoch": 0.9709466619569057,
"grad_norm": 2.25,
"learning_rate": 0.0004912526052847238,
"loss": 5.991,
"mean_token_accuracy": 0.1655014768242836,
"num_tokens": 20502063.0,
"step": 10995
},
{
"entropy": 6.150082778930664,
"epoch": 0.971388202048746,
"grad_norm": 2.875,
"learning_rate": 0.0004912439076794742,
"loss": 5.9155,
"mean_token_accuracy": 0.1559155449271202,
"num_tokens": 20510631.0,
"step": 11000
},
{
"entropy": 6.1376958847045895,
"epoch": 0.9718297421405864,
"grad_norm": 2.75,
"learning_rate": 0.0004912352058381293,
"loss": 5.963,
"mean_token_accuracy": 0.1556572735309601,
"num_tokens": 20519978.0,
"step": 11005
},
{
"entropy": 6.149244546890259,
"epoch": 0.9722712822324268,
"grad_norm": 4.4375,
"learning_rate": 0.0004912264997608599,
"loss": 5.9333,
"mean_token_accuracy": 0.1648950532078743,
"num_tokens": 20529346.0,
"step": 11010
},
{
"entropy": 6.168312215805054,
"epoch": 0.972712822324267,
"grad_norm": 2.21875,
"learning_rate": 0.0004912177894478364,
"loss": 5.9153,
"mean_token_accuracy": 0.15387111753225327,
"num_tokens": 20537619.0,
"step": 11015
},
{
"entropy": 6.171724414825439,
"epoch": 0.9731543624161074,
"grad_norm": 3.359375,
"learning_rate": 0.0004912090748992291,
"loss": 5.9574,
"mean_token_accuracy": 0.15916813313961028,
"num_tokens": 20547011.0,
"step": 11020
},
{
"entropy": 6.209042167663574,
"epoch": 0.9735959025079477,
"grad_norm": 2.5625,
"learning_rate": 0.0004912003561152092,
"loss": 5.8879,
"mean_token_accuracy": 0.16082506626844406,
"num_tokens": 20556425.0,
"step": 11025
},
{
"entropy": 6.1867574691772464,
"epoch": 0.9740374425997881,
"grad_norm": 2.703125,
"learning_rate": 0.0004911916330959472,
"loss": 5.9023,
"mean_token_accuracy": 0.16454554796218873,
"num_tokens": 20565330.0,
"step": 11030
},
{
"entropy": 6.053458309173584,
"epoch": 0.9744789826916284,
"grad_norm": 3.609375,
"learning_rate": 0.0004911829058416141,
"loss": 6.025,
"mean_token_accuracy": 0.16728620529174804,
"num_tokens": 20575320.0,
"step": 11035
},
{
"entropy": 6.142206048965454,
"epoch": 0.9749205227834687,
"grad_norm": 3.09375,
"learning_rate": 0.0004911741743523808,
"loss": 5.8935,
"mean_token_accuracy": 0.16547857373952865,
"num_tokens": 20585105.0,
"step": 11040
},
{
"entropy": 6.163776493072509,
"epoch": 0.9753620628753091,
"grad_norm": 2.109375,
"learning_rate": 0.0004911654386284184,
"loss": 5.9435,
"mean_token_accuracy": 0.16175372451543807,
"num_tokens": 20593889.0,
"step": 11045
},
{
"entropy": 6.212721681594848,
"epoch": 0.9758036029671494,
"grad_norm": 3.171875,
"learning_rate": 0.000491156698669898,
"loss": 5.9836,
"mean_token_accuracy": 0.16355283409357071,
"num_tokens": 20602322.0,
"step": 11050
},
{
"entropy": 6.251365613937378,
"epoch": 0.9762451430589898,
"grad_norm": 5.15625,
"learning_rate": 0.0004911479544769908,
"loss": 6.0587,
"mean_token_accuracy": 0.15174449011683463,
"num_tokens": 20612077.0,
"step": 11055
},
{
"entropy": 6.246683597564697,
"epoch": 0.9766866831508301,
"grad_norm": 2.84375,
"learning_rate": 0.000491139206049868,
"loss": 6.0008,
"mean_token_accuracy": 0.16174235790967942,
"num_tokens": 20620683.0,
"step": 11060
},
{
"entropy": 6.190662002563476,
"epoch": 0.9771282232426705,
"grad_norm": 3.484375,
"learning_rate": 0.0004911304533887011,
"loss": 6.0528,
"mean_token_accuracy": 0.15299738124012946,
"num_tokens": 20631124.0,
"step": 11065
},
{
"entropy": 6.151117658615112,
"epoch": 0.9775697633345107,
"grad_norm": 2.46875,
"learning_rate": 0.0004911216964936616,
"loss": 5.9034,
"mean_token_accuracy": 0.16105676144361497,
"num_tokens": 20640515.0,
"step": 11070
},
{
"entropy": 6.136082315444947,
"epoch": 0.9780113034263511,
"grad_norm": 2.75,
"learning_rate": 0.0004911129353649211,
"loss": 5.9011,
"mean_token_accuracy": 0.16156955510377885,
"num_tokens": 20649819.0,
"step": 11075
},
{
"entropy": 6.10066180229187,
"epoch": 0.9784528435181915,
"grad_norm": 3.1875,
"learning_rate": 0.000491104170002651,
"loss": 5.9322,
"mean_token_accuracy": 0.16155301481485368,
"num_tokens": 20657831.0,
"step": 11080
},
{
"entropy": 6.23879041671753,
"epoch": 0.9788943836100318,
"grad_norm": 2.390625,
"learning_rate": 0.000491095400407023,
"loss": 6.0553,
"mean_token_accuracy": 0.15726151764392854,
"num_tokens": 20666807.0,
"step": 11085
},
{
"entropy": 6.175461149215698,
"epoch": 0.9793359237018722,
"grad_norm": 2.46875,
"learning_rate": 0.0004910866265782091,
"loss": 5.9023,
"mean_token_accuracy": 0.16254776269197463,
"num_tokens": 20674859.0,
"step": 11090
},
{
"entropy": 6.217956066131592,
"epoch": 0.9797774637937124,
"grad_norm": 2.984375,
"learning_rate": 0.0004910778485163811,
"loss": 5.9781,
"mean_token_accuracy": 0.15955664217472076,
"num_tokens": 20684060.0,
"step": 11095
},
{
"entropy": 6.147432899475097,
"epoch": 0.9802190038855528,
"grad_norm": 3.1875,
"learning_rate": 0.000491069066221711,
"loss": 5.89,
"mean_token_accuracy": 0.16652947366237641,
"num_tokens": 20693446.0,
"step": 11100
},
{
"entropy": 6.17287654876709,
"epoch": 0.9806605439773931,
"grad_norm": 2.125,
"learning_rate": 0.0004910602796943707,
"loss": 6.0376,
"mean_token_accuracy": 0.1570849284529686,
"num_tokens": 20702635.0,
"step": 11105
},
{
"entropy": 6.221656084060669,
"epoch": 0.9811020840692335,
"grad_norm": 1.8828125,
"learning_rate": 0.0004910514889345323,
"loss": 5.9795,
"mean_token_accuracy": 0.15668816938996316,
"num_tokens": 20712256.0,
"step": 11110
},
{
"entropy": 6.154408311843872,
"epoch": 0.9815436241610739,
"grad_norm": 2.15625,
"learning_rate": 0.0004910426939423682,
"loss": 5.9342,
"mean_token_accuracy": 0.15998560190200806,
"num_tokens": 20720175.0,
"step": 11115
},
{
"entropy": 6.1402569770812985,
"epoch": 0.9819851642529142,
"grad_norm": 2.546875,
"learning_rate": 0.0004910338947180506,
"loss": 5.97,
"mean_token_accuracy": 0.16137361973524095,
"num_tokens": 20729849.0,
"step": 11120
},
{
"entropy": 6.170149803161621,
"epoch": 0.9824267043447545,
"grad_norm": 2.265625,
"learning_rate": 0.0004910250912617519,
"loss": 5.8927,
"mean_token_accuracy": 0.166403566300869,
"num_tokens": 20739129.0,
"step": 11125
},
{
"entropy": 6.165357065200806,
"epoch": 0.9828682444365948,
"grad_norm": 2.3125,
"learning_rate": 0.0004910162835736445,
"loss": 5.8664,
"mean_token_accuracy": 0.1691001370549202,
"num_tokens": 20748632.0,
"step": 11130
},
{
"entropy": 6.136884927749634,
"epoch": 0.9833097845284352,
"grad_norm": 3.6875,
"learning_rate": 0.000491007471653901,
"loss": 5.9352,
"mean_token_accuracy": 0.15833742916584015,
"num_tokens": 20758535.0,
"step": 11135
},
{
"entropy": 6.163466310501098,
"epoch": 0.9837513246202755,
"grad_norm": 2.5,
"learning_rate": 0.0004909986555026939,
"loss": 5.9492,
"mean_token_accuracy": 0.16026355922222138,
"num_tokens": 20768982.0,
"step": 11140
},
{
"entropy": 6.201970815658569,
"epoch": 0.9841928647121159,
"grad_norm": 2.265625,
"learning_rate": 0.000490989835120196,
"loss": 6.0234,
"mean_token_accuracy": 0.1587282106280327,
"num_tokens": 20778936.0,
"step": 11145
},
{
"entropy": 6.175016927719116,
"epoch": 0.9846344048039563,
"grad_norm": 2.640625,
"learning_rate": 0.0004909810105065801,
"loss": 6.0188,
"mean_token_accuracy": 0.14915758669376372,
"num_tokens": 20788618.0,
"step": 11150
},
{
"entropy": 6.194535112380981,
"epoch": 0.9850759448957965,
"grad_norm": 2.8125,
"learning_rate": 0.0004909721816620191,
"loss": 5.9766,
"mean_token_accuracy": 0.1632048264145851,
"num_tokens": 20797721.0,
"step": 11155
},
{
"entropy": 6.188171672821045,
"epoch": 0.9855174849876369,
"grad_norm": 5.1875,
"learning_rate": 0.0004909633485866857,
"loss": 5.9588,
"mean_token_accuracy": 0.15849938243627548,
"num_tokens": 20807305.0,
"step": 11160
},
{
"entropy": 6.106394624710083,
"epoch": 0.9859590250794772,
"grad_norm": 3.65625,
"learning_rate": 0.0004909545112807533,
"loss": 5.8962,
"mean_token_accuracy": 0.16447763592004777,
"num_tokens": 20816984.0,
"step": 11165
},
{
"entropy": 6.228212881088257,
"epoch": 0.9864005651713176,
"grad_norm": 2.28125,
"learning_rate": 0.0004909456697443948,
"loss": 6.0461,
"mean_token_accuracy": 0.15160781890153885,
"num_tokens": 20825738.0,
"step": 11170
},
{
"entropy": 6.207767200469971,
"epoch": 0.9868421052631579,
"grad_norm": 2.484375,
"learning_rate": 0.0004909368239777835,
"loss": 6.0042,
"mean_token_accuracy": 0.16312372982501983,
"num_tokens": 20834135.0,
"step": 11175
},
{
"entropy": 6.218275022506714,
"epoch": 0.9872836453549982,
"grad_norm": 2.546875,
"learning_rate": 0.0004909279739810926,
"loss": 6.0637,
"mean_token_accuracy": 0.15115931034088134,
"num_tokens": 20843689.0,
"step": 11180
},
{
"entropy": 6.205175495147705,
"epoch": 0.9877251854468386,
"grad_norm": 2.390625,
"learning_rate": 0.0004909191197544954,
"loss": 5.956,
"mean_token_accuracy": 0.1594684526324272,
"num_tokens": 20851724.0,
"step": 11185
},
{
"entropy": 6.286238956451416,
"epoch": 0.9881667255386789,
"grad_norm": 2.953125,
"learning_rate": 0.0004909102612981655,
"loss": 6.137,
"mean_token_accuracy": 0.14780291318893432,
"num_tokens": 20862325.0,
"step": 11190
},
{
"entropy": 6.197359180450439,
"epoch": 0.9886082656305193,
"grad_norm": 2.109375,
"learning_rate": 0.0004909013986122763,
"loss": 5.9203,
"mean_token_accuracy": 0.16561695635318757,
"num_tokens": 20871046.0,
"step": 11195
},
{
"entropy": 6.196657371520996,
"epoch": 0.9890498057223596,
"grad_norm": 2.25,
"learning_rate": 0.0004908925316970016,
"loss": 5.9636,
"mean_token_accuracy": 0.1534562811255455,
"num_tokens": 20881605.0,
"step": 11200
},
{
"entropy": 6.105321979522705,
"epoch": 0.9894913458142,
"grad_norm": 2.09375,
"learning_rate": 0.000490883660552515,
"loss": 5.896,
"mean_token_accuracy": 0.15435104593634605,
"num_tokens": 20891170.0,
"step": 11205
},
{
"entropy": 6.171255683898925,
"epoch": 0.9899328859060402,
"grad_norm": 2.09375,
"learning_rate": 0.0004908747851789902,
"loss": 5.8969,
"mean_token_accuracy": 0.15193916708230973,
"num_tokens": 20900307.0,
"step": 11210
},
{
"entropy": 6.150565242767334,
"epoch": 0.9903744259978806,
"grad_norm": 4.4375,
"learning_rate": 0.0004908659055766011,
"loss": 6.0667,
"mean_token_accuracy": 0.15406731888651848,
"num_tokens": 20910623.0,
"step": 11215
},
{
"entropy": 6.19320068359375,
"epoch": 0.990815966089721,
"grad_norm": 1.9375,
"learning_rate": 0.0004908570217455218,
"loss": 5.9853,
"mean_token_accuracy": 0.1622211828827858,
"num_tokens": 20919744.0,
"step": 11220
},
{
"entropy": 6.169744205474854,
"epoch": 0.9912575061815613,
"grad_norm": 2.078125,
"learning_rate": 0.0004908481336859262,
"loss": 6.0311,
"mean_token_accuracy": 0.15963393300771714,
"num_tokens": 20928701.0,
"step": 11225
},
{
"entropy": 6.197696876525879,
"epoch": 0.9916990462734017,
"grad_norm": 2.109375,
"learning_rate": 0.0004908392413979884,
"loss": 6.0208,
"mean_token_accuracy": 0.1499055728316307,
"num_tokens": 20937786.0,
"step": 11230
},
{
"entropy": 6.185003471374512,
"epoch": 0.9921405863652419,
"grad_norm": 1.9140625,
"learning_rate": 0.0004908303448818825,
"loss": 5.927,
"mean_token_accuracy": 0.16771714836359025,
"num_tokens": 20947214.0,
"step": 11235
},
{
"entropy": 6.165411806106567,
"epoch": 0.9925821264570823,
"grad_norm": 1.703125,
"learning_rate": 0.000490821444137783,
"loss": 6.0086,
"mean_token_accuracy": 0.16483579874038695,
"num_tokens": 20956041.0,
"step": 11240
},
{
"entropy": 6.2169066905975345,
"epoch": 0.9930236665489226,
"grad_norm": 1.78125,
"learning_rate": 0.0004908125391658641,
"loss": 6.0139,
"mean_token_accuracy": 0.15851792693138123,
"num_tokens": 20966162.0,
"step": 11245
},
{
"entropy": 6.210709047317505,
"epoch": 0.993465206640763,
"grad_norm": 3.0,
"learning_rate": 0.0004908036299663003,
"loss": 5.9955,
"mean_token_accuracy": 0.15642432272434234,
"num_tokens": 20976025.0,
"step": 11250
},
{
"entropy": 6.163964557647705,
"epoch": 0.9939067467326034,
"grad_norm": 1.78125,
"learning_rate": 0.0004907947165392662,
"loss": 6.0138,
"mean_token_accuracy": 0.15552110075950623,
"num_tokens": 20985606.0,
"step": 11255
},
{
"entropy": 6.236195516586304,
"epoch": 0.9943482868244437,
"grad_norm": 2.703125,
"learning_rate": 0.0004907857988849363,
"loss": 5.9995,
"mean_token_accuracy": 0.15854785591363907,
"num_tokens": 20994308.0,
"step": 11260
},
{
"entropy": 6.179389953613281,
"epoch": 0.994789826916284,
"grad_norm": 1.9140625,
"learning_rate": 0.0004907768770034853,
"loss": 5.9255,
"mean_token_accuracy": 0.1621039927005768,
"num_tokens": 21003783.0,
"step": 11265
},
{
"entropy": 6.12695083618164,
"epoch": 0.9952313670081243,
"grad_norm": 2.53125,
"learning_rate": 0.000490767950895088,
"loss": 5.8986,
"mean_token_accuracy": 0.16048405319452286,
"num_tokens": 21012870.0,
"step": 11270
},
{
"entropy": 6.188261556625366,
"epoch": 0.9956729070999647,
"grad_norm": 1.8671875,
"learning_rate": 0.0004907590205599192,
"loss": 5.9858,
"mean_token_accuracy": 0.15400686413049697,
"num_tokens": 21021987.0,
"step": 11275
},
{
"entropy": 6.182192182540893,
"epoch": 0.996114447191805,
"grad_norm": 2.234375,
"learning_rate": 0.000490750085998154,
"loss": 5.9945,
"mean_token_accuracy": 0.1501828536391258,
"num_tokens": 21030977.0,
"step": 11280
},
{
"entropy": 6.171173143386841,
"epoch": 0.9965559872836454,
"grad_norm": 2.453125,
"learning_rate": 0.0004907411472099672,
"loss": 5.9262,
"mean_token_accuracy": 0.15717889815568925,
"num_tokens": 21039259.0,
"step": 11285
},
{
"entropy": 6.198042297363282,
"epoch": 0.9969975273754857,
"grad_norm": 1.7578125,
"learning_rate": 0.0004907322041955341,
"loss": 6.0129,
"mean_token_accuracy": 0.15755403116345407,
"num_tokens": 21049321.0,
"step": 11290
},
{
"entropy": 6.210505628585816,
"epoch": 0.997439067467326,
"grad_norm": 1.8828125,
"learning_rate": 0.0004907232569550298,
"loss": 6.0702,
"mean_token_accuracy": 0.15362470522522925,
"num_tokens": 21059469.0,
"step": 11295
},
{
"entropy": 6.227089548110962,
"epoch": 0.9978806075591664,
"grad_norm": 1.921875,
"learning_rate": 0.0004907143054886297,
"loss": 6.0126,
"mean_token_accuracy": 0.15363296568393708,
"num_tokens": 21068694.0,
"step": 11300
},
{
"entropy": 6.190431213378906,
"epoch": 0.9983221476510067,
"grad_norm": 1.8828125,
"learning_rate": 0.000490705349796509,
"loss": 5.9539,
"mean_token_accuracy": 0.1615270271897316,
"num_tokens": 21077232.0,
"step": 11305
},
{
"entropy": 6.2647298812866214,
"epoch": 0.9987636877428471,
"grad_norm": 2.71875,
"learning_rate": 0.0004906963898788431,
"loss": 5.9511,
"mean_token_accuracy": 0.15812973082065582,
"num_tokens": 21086517.0,
"step": 11310
},
{
"entropy": 6.188113498687744,
"epoch": 0.9992052278346873,
"grad_norm": 1.65625,
"learning_rate": 0.0004906874257358075,
"loss": 6.0254,
"mean_token_accuracy": 0.15824694484472274,
"num_tokens": 21096969.0,
"step": 11315
},
{
"entropy": 6.1362597942352295,
"epoch": 0.9996467679265277,
"grad_norm": 1.890625,
"learning_rate": 0.000490678457367578,
"loss": 5.9195,
"mean_token_accuracy": 0.15861781537532807,
"num_tokens": 21106554.0,
"step": 11320
},
{
"entropy": 6.159111499786377,
"epoch": 1.000088308018368,
"grad_norm": 2.171875,
"learning_rate": 0.0004906694847743302,
"loss": 5.9611,
"mean_token_accuracy": 0.14851028174161912,
"num_tokens": 21114829.0,
"step": 11325
},
{
"entropy": 6.178825521469117,
"epoch": 1.0005298481102085,
"grad_norm": 2.34375,
"learning_rate": 0.0004906605079562399,
"loss": 5.9046,
"mean_token_accuracy": 0.16362736225128174,
"num_tokens": 21123568.0,
"step": 11330
},
{
"entropy": 6.14626178741455,
"epoch": 1.0009713882020488,
"grad_norm": 1.796875,
"learning_rate": 0.0004906515269134827,
"loss": 5.9697,
"mean_token_accuracy": 0.15809808522462845,
"num_tokens": 21132811.0,
"step": 11335
},
{
"entropy": 6.1960564136505125,
"epoch": 1.001412928293889,
"grad_norm": 2.71875,
"learning_rate": 0.0004906425416462349,
"loss": 5.9831,
"mean_token_accuracy": 0.15901165902614595,
"num_tokens": 21141549.0,
"step": 11340
},
{
"entropy": 6.180376672744751,
"epoch": 1.0018544683857293,
"grad_norm": 2.703125,
"learning_rate": 0.0004906335521546723,
"loss": 5.8733,
"mean_token_accuracy": 0.16404039561748504,
"num_tokens": 21150603.0,
"step": 11345
},
{
"entropy": 6.037204027175903,
"epoch": 1.0022960084775698,
"grad_norm": 2.828125,
"learning_rate": 0.0004906245584389712,
"loss": 5.7301,
"mean_token_accuracy": 0.17367298901081085,
"num_tokens": 21159842.0,
"step": 11350
},
{
"entropy": 6.100938749313355,
"epoch": 1.00273754856941,
"grad_norm": 1.953125,
"learning_rate": 0.0004906155604993075,
"loss": 5.88,
"mean_token_accuracy": 0.16524418890476228,
"num_tokens": 21169139.0,
"step": 11355
},
{
"entropy": 6.066159439086914,
"epoch": 1.0031790886612504,
"grad_norm": 1.6484375,
"learning_rate": 0.0004906065583358576,
"loss": 5.84,
"mean_token_accuracy": 0.1686730608344078,
"num_tokens": 21178059.0,
"step": 11360
},
{
"entropy": 6.145680952072143,
"epoch": 1.0036206287530909,
"grad_norm": 2.0625,
"learning_rate": 0.0004905975519487978,
"loss": 5.8711,
"mean_token_accuracy": 0.1590035676956177,
"num_tokens": 21187966.0,
"step": 11365
},
{
"entropy": 6.122244501113892,
"epoch": 1.0040621688449312,
"grad_norm": 2.203125,
"learning_rate": 0.0004905885413383046,
"loss": 5.9029,
"mean_token_accuracy": 0.15751160234212874,
"num_tokens": 21197460.0,
"step": 11370
},
{
"entropy": 6.194774961471557,
"epoch": 1.0045037089367714,
"grad_norm": 2.5,
"learning_rate": 0.0004905795265045546,
"loss": 5.9223,
"mean_token_accuracy": 0.1588710643351078,
"num_tokens": 21206977.0,
"step": 11375
},
{
"entropy": 6.167305612564087,
"epoch": 1.0049452490286117,
"grad_norm": 2.078125,
"learning_rate": 0.0004905705074477242,
"loss": 5.894,
"mean_token_accuracy": 0.15672422349452972,
"num_tokens": 21216046.0,
"step": 11380
},
{
"entropy": 6.152836608886719,
"epoch": 1.0053867891204522,
"grad_norm": 3.1875,
"learning_rate": 0.0004905614841679901,
"loss": 5.9239,
"mean_token_accuracy": 0.16096749901771545,
"num_tokens": 21225612.0,
"step": 11385
},
{
"entropy": 6.161530447006226,
"epoch": 1.0058283292122925,
"grad_norm": 3.046875,
"learning_rate": 0.0004905524566655292,
"loss": 5.8207,
"mean_token_accuracy": 0.16547271534800528,
"num_tokens": 21233641.0,
"step": 11390
},
{
"entropy": 6.098226833343506,
"epoch": 1.0062698693041328,
"grad_norm": 2.015625,
"learning_rate": 0.0004905434249405183,
"loss": 5.8854,
"mean_token_accuracy": 0.1621844634413719,
"num_tokens": 21243444.0,
"step": 11395
},
{
"entropy": 6.120555210113525,
"epoch": 1.0067114093959733,
"grad_norm": 2.828125,
"learning_rate": 0.0004905343889931342,
"loss": 5.8502,
"mean_token_accuracy": 0.165749229490757,
"num_tokens": 21253473.0,
"step": 11400
},
{
"entropy": 6.149003505706787,
"epoch": 1.0071529494878135,
"grad_norm": 1.84375,
"learning_rate": 0.000490525348823554,
"loss": 5.8161,
"mean_token_accuracy": 0.17111374139785768,
"num_tokens": 21262049.0,
"step": 11405
},
{
"entropy": 6.077328443527222,
"epoch": 1.0075944895796538,
"grad_norm": 2.109375,
"learning_rate": 0.0004905163044319549,
"loss": 5.844,
"mean_token_accuracy": 0.1654621720314026,
"num_tokens": 21270909.0,
"step": 11410
},
{
"entropy": 6.0924924373626705,
"epoch": 1.008036029671494,
"grad_norm": 1.859375,
"learning_rate": 0.0004905072558185139,
"loss": 5.96,
"mean_token_accuracy": 0.16080298721790315,
"num_tokens": 21280503.0,
"step": 11415
},
{
"entropy": 6.206440353393555,
"epoch": 1.0084775697633346,
"grad_norm": 2.21875,
"learning_rate": 0.0004904982029834083,
"loss": 5.9408,
"mean_token_accuracy": 0.15856255441904069,
"num_tokens": 21289957.0,
"step": 11420
},
{
"entropy": 6.168761157989502,
"epoch": 1.0089191098551749,
"grad_norm": 1.90625,
"learning_rate": 0.0004904891459268154,
"loss": 5.9147,
"mean_token_accuracy": 0.16312980949878692,
"num_tokens": 21298799.0,
"step": 11425
},
{
"entropy": 6.142473363876343,
"epoch": 1.0093606499470151,
"grad_norm": 1.90625,
"learning_rate": 0.0004904800846489128,
"loss": 5.9237,
"mean_token_accuracy": 0.16007503718137742,
"num_tokens": 21308251.0,
"step": 11430
},
{
"entropy": 6.228172159194946,
"epoch": 1.0098021900388556,
"grad_norm": 1.8828125,
"learning_rate": 0.0004904710191498779,
"loss": 5.9253,
"mean_token_accuracy": 0.1590488575398922,
"num_tokens": 21317705.0,
"step": 11435
},
{
"entropy": 6.123460578918457,
"epoch": 1.010243730130696,
"grad_norm": 2.109375,
"learning_rate": 0.0004904619494298882,
"loss": 5.8961,
"mean_token_accuracy": 0.15378329455852507,
"num_tokens": 21326867.0,
"step": 11440
},
{
"entropy": 6.083705806732178,
"epoch": 1.0106852702225362,
"grad_norm": 1.78125,
"learning_rate": 0.0004904528754891215,
"loss": 5.9202,
"mean_token_accuracy": 0.16182811856269835,
"num_tokens": 21336054.0,
"step": 11445
},
{
"entropy": 6.146324157714844,
"epoch": 1.0111268103143765,
"grad_norm": 2.203125,
"learning_rate": 0.0004904437973277555,
"loss": 5.8456,
"mean_token_accuracy": 0.163377745449543,
"num_tokens": 21344457.0,
"step": 11450
},
{
"entropy": 6.223362064361572,
"epoch": 1.011568350406217,
"grad_norm": 2.265625,
"learning_rate": 0.0004904347149459681,
"loss": 5.9464,
"mean_token_accuracy": 0.1589127942919731,
"num_tokens": 21353639.0,
"step": 11455
},
{
"entropy": 6.0203228950500485,
"epoch": 1.0120098904980572,
"grad_norm": 1.7265625,
"learning_rate": 0.0004904256283439371,
"loss": 5.7389,
"mean_token_accuracy": 0.16461727619171143,
"num_tokens": 21362005.0,
"step": 11460
},
{
"entropy": 6.181979608535767,
"epoch": 1.0124514305898975,
"grad_norm": 2.125,
"learning_rate": 0.0004904165375218405,
"loss": 5.9258,
"mean_token_accuracy": 0.16067483574151992,
"num_tokens": 21371917.0,
"step": 11465
},
{
"entropy": 6.195862674713135,
"epoch": 1.012892970681738,
"grad_norm": 2.484375,
"learning_rate": 0.0004904074424798565,
"loss": 5.9294,
"mean_token_accuracy": 0.1575663924217224,
"num_tokens": 21381500.0,
"step": 11470
},
{
"entropy": 6.109636354446411,
"epoch": 1.0133345107735783,
"grad_norm": 3.28125,
"learning_rate": 0.0004903983432181632,
"loss": 5.7786,
"mean_token_accuracy": 0.16974935233592986,
"num_tokens": 21391280.0,
"step": 11475
},
{
"entropy": 6.1390626430511475,
"epoch": 1.0137760508654186,
"grad_norm": 2.234375,
"learning_rate": 0.0004903892397369388,
"loss": 5.8827,
"mean_token_accuracy": 0.16318077594041824,
"num_tokens": 21400371.0,
"step": 11480
},
{
"entropy": 6.040709543228149,
"epoch": 1.0142175909572588,
"grad_norm": 1.546875,
"learning_rate": 0.0004903801320363618,
"loss": 5.9154,
"mean_token_accuracy": 0.16254518032073975,
"num_tokens": 21410493.0,
"step": 11485
},
{
"entropy": 6.1841107368469235,
"epoch": 1.0146591310490993,
"grad_norm": 2.015625,
"learning_rate": 0.0004903710201166105,
"loss": 6.0059,
"mean_token_accuracy": 0.14969373047351836,
"num_tokens": 21420516.0,
"step": 11490
},
{
"entropy": 6.160703134536743,
"epoch": 1.0151006711409396,
"grad_norm": 2.125,
"learning_rate": 0.0004903619039778634,
"loss": 5.9379,
"mean_token_accuracy": 0.15312522947788237,
"num_tokens": 21429614.0,
"step": 11495
},
{
"entropy": 6.139634656906128,
"epoch": 1.0155422112327799,
"grad_norm": 3.640625,
"learning_rate": 0.000490352783620299,
"loss": 5.8725,
"mean_token_accuracy": 0.16597218960523605,
"num_tokens": 21438595.0,
"step": 11500
},
{
"entropy": 6.1856001853942875,
"epoch": 1.0159837513246204,
"grad_norm": 2.734375,
"learning_rate": 0.0004903436590440961,
"loss": 5.943,
"mean_token_accuracy": 0.15984876304864884,
"num_tokens": 21447708.0,
"step": 11505
},
{
"entropy": 6.118653631210327,
"epoch": 1.0164252914164607,
"grad_norm": 2.3125,
"learning_rate": 0.0004903345302494334,
"loss": 5.8801,
"mean_token_accuracy": 0.16541173309087753,
"num_tokens": 21457210.0,
"step": 11510
},
{
"entropy": 6.10604157447815,
"epoch": 1.016866831508301,
"grad_norm": 3.15625,
"learning_rate": 0.0004903253972364897,
"loss": 5.9058,
"mean_token_accuracy": 0.1567178562283516,
"num_tokens": 21466247.0,
"step": 11515
},
{
"entropy": 6.140804958343506,
"epoch": 1.0173083716001412,
"grad_norm": 2.484375,
"learning_rate": 0.0004903162600054439,
"loss": 5.8465,
"mean_token_accuracy": 0.16732098907232285,
"num_tokens": 21475634.0,
"step": 11520
},
{
"entropy": 6.210485458374023,
"epoch": 1.0177499116919817,
"grad_norm": 3.859375,
"learning_rate": 0.0004903071185564751,
"loss": 5.9706,
"mean_token_accuracy": 0.16069528460502625,
"num_tokens": 21485523.0,
"step": 11525
},
{
"entropy": 6.176110410690308,
"epoch": 1.018191451783822,
"grad_norm": 3.09375,
"learning_rate": 0.0004902979728897623,
"loss": 5.9229,
"mean_token_accuracy": 0.1628538265824318,
"num_tokens": 21494909.0,
"step": 11530
},
{
"entropy": 6.232985877990723,
"epoch": 1.0186329918756623,
"grad_norm": 2.53125,
"learning_rate": 0.0004902888230054846,
"loss": 5.9335,
"mean_token_accuracy": 0.16014256626367568,
"num_tokens": 21504413.0,
"step": 11535
},
{
"entropy": 6.038524580001831,
"epoch": 1.0190745319675028,
"grad_norm": 2.578125,
"learning_rate": 0.0004902796689038213,
"loss": 5.8322,
"mean_token_accuracy": 0.16766792833805083,
"num_tokens": 21514068.0,
"step": 11540
},
{
"entropy": 6.05175371170044,
"epoch": 1.019516072059343,
"grad_norm": 2.640625,
"learning_rate": 0.0004902705105849517,
"loss": 5.8342,
"mean_token_accuracy": 0.16637901216745377,
"num_tokens": 21523536.0,
"step": 11545
},
{
"entropy": 6.1069100856781,
"epoch": 1.0199576121511833,
"grad_norm": 3.3125,
"learning_rate": 0.0004902613480490553,
"loss": 5.9225,
"mean_token_accuracy": 0.15763291269540786,
"num_tokens": 21532554.0,
"step": 11550
},
{
"entropy": 6.074923181533814,
"epoch": 1.0203991522430236,
"grad_norm": 2.625,
"learning_rate": 0.0004902521812963116,
"loss": 5.8157,
"mean_token_accuracy": 0.1645085856318474,
"num_tokens": 21542508.0,
"step": 11555
},
{
"entropy": 6.176312446594238,
"epoch": 1.020840692334864,
"grad_norm": 2.25,
"learning_rate": 0.0004902430103268998,
"loss": 5.8947,
"mean_token_accuracy": 0.15038924068212509,
"num_tokens": 21551954.0,
"step": 11560
},
{
"entropy": 6.166477108001709,
"epoch": 1.0212822324267044,
"grad_norm": 2.625,
"learning_rate": 0.0004902338351410002,
"loss": 5.8399,
"mean_token_accuracy": 0.16616418659687043,
"num_tokens": 21561676.0,
"step": 11565
},
{
"entropy": 6.127134180068969,
"epoch": 1.0217237725185446,
"grad_norm": 2.828125,
"learning_rate": 0.000490224655738792,
"loss": 5.951,
"mean_token_accuracy": 0.15087994933128357,
"num_tokens": 21571916.0,
"step": 11570
},
{
"entropy": 6.14886326789856,
"epoch": 1.0221653126103851,
"grad_norm": 3.671875,
"learning_rate": 0.0004902154721204552,
"loss": 5.9131,
"mean_token_accuracy": 0.16479677855968475,
"num_tokens": 21581892.0,
"step": 11575
},
{
"entropy": 6.11764235496521,
"epoch": 1.0226068527022254,
"grad_norm": 2.734375,
"learning_rate": 0.0004902062842861696,
"loss": 5.8678,
"mean_token_accuracy": 0.1607152447104454,
"num_tokens": 21591390.0,
"step": 11580
},
{
"entropy": 6.188349771499634,
"epoch": 1.0230483927940657,
"grad_norm": 1.875,
"learning_rate": 0.0004901970922361154,
"loss": 5.9386,
"mean_token_accuracy": 0.16408118605613708,
"num_tokens": 21600766.0,
"step": 11585
},
{
"entropy": 6.078598070144653,
"epoch": 1.023489932885906,
"grad_norm": 4.3125,
"learning_rate": 0.0004901878959704726,
"loss": 5.8421,
"mean_token_accuracy": 0.17287974059581757,
"num_tokens": 21609264.0,
"step": 11590
},
{
"entropy": 6.0973701000213625,
"epoch": 1.0239314729777464,
"grad_norm": 1.984375,
"learning_rate": 0.0004901786954894212,
"loss": 5.9446,
"mean_token_accuracy": 0.15232574045658112,
"num_tokens": 21618409.0,
"step": 11595
},
{
"entropy": 6.035982465744018,
"epoch": 1.0243730130695867,
"grad_norm": 1.9453125,
"learning_rate": 0.0004901694907931416,
"loss": 5.832,
"mean_token_accuracy": 0.15747326165437697,
"num_tokens": 21628158.0,
"step": 11600
},
{
"entropy": 6.144132232666015,
"epoch": 1.024814553161427,
"grad_norm": 2.15625,
"learning_rate": 0.000490160281881814,
"loss": 5.9565,
"mean_token_accuracy": 0.15747404098510742,
"num_tokens": 21637859.0,
"step": 11605
},
{
"entropy": 6.175814628601074,
"epoch": 1.0252560932532675,
"grad_norm": 2.125,
"learning_rate": 0.0004901510687556188,
"loss": 5.9626,
"mean_token_accuracy": 0.15530697256326675,
"num_tokens": 21647389.0,
"step": 11610
},
{
"entropy": 6.160067796707153,
"epoch": 1.0256976333451078,
"grad_norm": 1.9140625,
"learning_rate": 0.0004901418514147367,
"loss": 5.9085,
"mean_token_accuracy": 0.15886647254228592,
"num_tokens": 21655857.0,
"step": 11615
},
{
"entropy": 6.135371732711792,
"epoch": 1.026139173436948,
"grad_norm": 2.71875,
"learning_rate": 0.000490132629859348,
"loss": 5.8804,
"mean_token_accuracy": 0.16047793179750441,
"num_tokens": 21666150.0,
"step": 11620
},
{
"entropy": 6.126113939285278,
"epoch": 1.0265807135287883,
"grad_norm": 2.046875,
"learning_rate": 0.0004901234040896334,
"loss": 5.9142,
"mean_token_accuracy": 0.16037900000810623,
"num_tokens": 21675662.0,
"step": 11625
},
{
"entropy": 6.131696796417236,
"epoch": 1.0270222536206288,
"grad_norm": 1.6953125,
"learning_rate": 0.0004901141741057737,
"loss": 5.9439,
"mean_token_accuracy": 0.15393377095460892,
"num_tokens": 21685721.0,
"step": 11630
},
{
"entropy": 6.14261384010315,
"epoch": 1.027463793712469,
"grad_norm": 1.921875,
"learning_rate": 0.0004901049399079495,
"loss": 5.9289,
"mean_token_accuracy": 0.1633034899830818,
"num_tokens": 21694507.0,
"step": 11635
},
{
"entropy": 6.190073299407959,
"epoch": 1.0279053338043094,
"grad_norm": 2.609375,
"learning_rate": 0.0004900957014963421,
"loss": 5.9248,
"mean_token_accuracy": 0.1683407723903656,
"num_tokens": 21704092.0,
"step": 11640
},
{
"entropy": 6.041891956329346,
"epoch": 1.0283468738961499,
"grad_norm": 2.078125,
"learning_rate": 0.0004900864588711321,
"loss": 5.8204,
"mean_token_accuracy": 0.17228213995695113,
"num_tokens": 21713313.0,
"step": 11645
},
{
"entropy": 6.127900075912476,
"epoch": 1.0287884139879901,
"grad_norm": 2.171875,
"learning_rate": 0.0004900772120325008,
"loss": 5.8886,
"mean_token_accuracy": 0.16571588665246964,
"num_tokens": 21721622.0,
"step": 11650
},
{
"entropy": 6.176822328567505,
"epoch": 1.0292299540798304,
"grad_norm": 1.8828125,
"learning_rate": 0.0004900679609806291,
"loss": 5.8588,
"mean_token_accuracy": 0.16276960223913192,
"num_tokens": 21730914.0,
"step": 11655
},
{
"entropy": 6.1248290061950685,
"epoch": 1.0296714941716707,
"grad_norm": 3.125,
"learning_rate": 0.0004900587057156985,
"loss": 5.8422,
"mean_token_accuracy": 0.16380158960819244,
"num_tokens": 21740124.0,
"step": 11660
},
{
"entropy": 6.129165315628052,
"epoch": 1.0301130342635112,
"grad_norm": 1.828125,
"learning_rate": 0.0004900494462378902,
"loss": 5.9253,
"mean_token_accuracy": 0.15836348682641982,
"num_tokens": 21750013.0,
"step": 11665
},
{
"entropy": 6.114324760437012,
"epoch": 1.0305545743553515,
"grad_norm": 1.84375,
"learning_rate": 0.0004900401825473854,
"loss": 5.9157,
"mean_token_accuracy": 0.16552637964487077,
"num_tokens": 21758842.0,
"step": 11670
},
{
"entropy": 6.134641027450561,
"epoch": 1.0309961144471917,
"grad_norm": 3.03125,
"learning_rate": 0.0004900309146443658,
"loss": 5.8191,
"mean_token_accuracy": 0.16753201931715012,
"num_tokens": 21767002.0,
"step": 11675
},
{
"entropy": 6.191877651214599,
"epoch": 1.0314376545390322,
"grad_norm": 1.8203125,
"learning_rate": 0.0004900216425290128,
"loss": 5.945,
"mean_token_accuracy": 0.16492558419704437,
"num_tokens": 21775372.0,
"step": 11680
},
{
"entropy": 6.097876787185669,
"epoch": 1.0318791946308725,
"grad_norm": 2.015625,
"learning_rate": 0.0004900123662015082,
"loss": 5.9526,
"mean_token_accuracy": 0.16184114068746566,
"num_tokens": 21784541.0,
"step": 11685
},
{
"entropy": 6.109315872192383,
"epoch": 1.0323207347227128,
"grad_norm": 1.9375,
"learning_rate": 0.0004900030856620336,
"loss": 5.8433,
"mean_token_accuracy": 0.1718936264514923,
"num_tokens": 21794525.0,
"step": 11690
},
{
"entropy": 6.129613447189331,
"epoch": 1.032762274814553,
"grad_norm": 2.109375,
"learning_rate": 0.0004899938009107708,
"loss": 5.91,
"mean_token_accuracy": 0.16530825048685074,
"num_tokens": 21804469.0,
"step": 11695
},
{
"entropy": 6.0826891422271725,
"epoch": 1.0332038149063936,
"grad_norm": 2.640625,
"learning_rate": 0.0004899845119479019,
"loss": 5.8838,
"mean_token_accuracy": 0.16358606666326522,
"num_tokens": 21813986.0,
"step": 11700
},
{
"entropy": 6.256786441802978,
"epoch": 1.0336453549982338,
"grad_norm": 1.9375,
"learning_rate": 0.0004899752187736085,
"loss": 5.8878,
"mean_token_accuracy": 0.16100156903266907,
"num_tokens": 21824083.0,
"step": 11705
},
{
"entropy": 6.08786563873291,
"epoch": 1.0340868950900741,
"grad_norm": 2.53125,
"learning_rate": 0.0004899659213880728,
"loss": 5.8224,
"mean_token_accuracy": 0.16994674503803253,
"num_tokens": 21833526.0,
"step": 11710
},
{
"entropy": 6.039015579223633,
"epoch": 1.0345284351819146,
"grad_norm": 2.53125,
"learning_rate": 0.0004899566197914771,
"loss": 5.8689,
"mean_token_accuracy": 0.1621565416455269,
"num_tokens": 21842537.0,
"step": 11715
},
{
"entropy": 6.092722034454345,
"epoch": 1.034969975273755,
"grad_norm": 2.59375,
"learning_rate": 0.0004899473139840033,
"loss": 5.8926,
"mean_token_accuracy": 0.161223204433918,
"num_tokens": 21851604.0,
"step": 11720
},
{
"entropy": 6.180898571014405,
"epoch": 1.0354115153655952,
"grad_norm": 3.671875,
"learning_rate": 0.0004899380039658339,
"loss": 5.9609,
"mean_token_accuracy": 0.16184767633676528,
"num_tokens": 21861480.0,
"step": 11725
},
{
"entropy": 6.165530347824097,
"epoch": 1.0358530554574354,
"grad_norm": 1.921875,
"learning_rate": 0.0004899286897371513,
"loss": 5.9175,
"mean_token_accuracy": 0.16264305114746094,
"num_tokens": 21870901.0,
"step": 11730
},
{
"entropy": 6.009296512603759,
"epoch": 1.036294595549276,
"grad_norm": 3.3125,
"learning_rate": 0.000489919371298138,
"loss": 5.8053,
"mean_token_accuracy": 0.17108866423368455,
"num_tokens": 21880491.0,
"step": 11735
},
{
"entropy": 6.069051074981689,
"epoch": 1.0367361356411162,
"grad_norm": 2.375,
"learning_rate": 0.0004899100486489763,
"loss": 5.8921,
"mean_token_accuracy": 0.16493330746889115,
"num_tokens": 21889833.0,
"step": 11740
},
{
"entropy": 6.109303092956543,
"epoch": 1.0371776757329565,
"grad_norm": 2.296875,
"learning_rate": 0.0004899007217898491,
"loss": 5.9083,
"mean_token_accuracy": 0.16330417543649672,
"num_tokens": 21899222.0,
"step": 11745
},
{
"entropy": 6.194285488128662,
"epoch": 1.037619215824797,
"grad_norm": 3.8125,
"learning_rate": 0.0004898913907209389,
"loss": 5.9217,
"mean_token_accuracy": 0.15765299797058105,
"num_tokens": 21908848.0,
"step": 11750
},
{
"entropy": 6.088989019393921,
"epoch": 1.0380607559166373,
"grad_norm": 3.0,
"learning_rate": 0.0004898820554424285,
"loss": 5.8482,
"mean_token_accuracy": 0.15573484301567078,
"num_tokens": 21917867.0,
"step": 11755
},
{
"entropy": 6.121208667755127,
"epoch": 1.0385022960084775,
"grad_norm": 2.09375,
"learning_rate": 0.000489872715954501,
"loss": 5.9275,
"mean_token_accuracy": 0.1548054873943329,
"num_tokens": 21927476.0,
"step": 11760
},
{
"entropy": 6.209314966201783,
"epoch": 1.0389438361003178,
"grad_norm": 2.140625,
"learning_rate": 0.0004898633722573391,
"loss": 6.0023,
"mean_token_accuracy": 0.1529624156653881,
"num_tokens": 21937068.0,
"step": 11765
},
{
"entropy": 6.151378154754639,
"epoch": 1.0393853761921583,
"grad_norm": 1.7578125,
"learning_rate": 0.000489854024351126,
"loss": 5.8661,
"mean_token_accuracy": 0.16285363733768463,
"num_tokens": 21946144.0,
"step": 11770
},
{
"entropy": 6.145745754241943,
"epoch": 1.0398269162839986,
"grad_norm": 2.71875,
"learning_rate": 0.0004898446722360446,
"loss": 5.8333,
"mean_token_accuracy": 0.16169301569461822,
"num_tokens": 21955346.0,
"step": 11775
},
{
"entropy": 6.056465435028076,
"epoch": 1.0402684563758389,
"grad_norm": 1.9375,
"learning_rate": 0.0004898353159122784,
"loss": 5.8975,
"mean_token_accuracy": 0.16327441185712815,
"num_tokens": 21965034.0,
"step": 11780
},
{
"entropy": 6.0989453315734865,
"epoch": 1.0407099964676794,
"grad_norm": 2.4375,
"learning_rate": 0.0004898259553800106,
"loss": 5.8713,
"mean_token_accuracy": 0.160879672318697,
"num_tokens": 21975167.0,
"step": 11785
},
{
"entropy": 6.200954341888428,
"epoch": 1.0411515365595196,
"grad_norm": 1.8359375,
"learning_rate": 0.0004898165906394244,
"loss": 5.8682,
"mean_token_accuracy": 0.16044598072767258,
"num_tokens": 21984372.0,
"step": 11790
},
{
"entropy": 6.08750638961792,
"epoch": 1.04159307665136,
"grad_norm": 2.625,
"learning_rate": 0.0004898072216907033,
"loss": 5.8691,
"mean_token_accuracy": 0.1622785210609436,
"num_tokens": 21993513.0,
"step": 11795
},
{
"entropy": 6.079800605773926,
"epoch": 1.0420346167432002,
"grad_norm": 2.453125,
"learning_rate": 0.0004897978485340311,
"loss": 5.9367,
"mean_token_accuracy": 0.15386107414960862,
"num_tokens": 22002593.0,
"step": 11800
},
{
"entropy": 6.160308408737182,
"epoch": 1.0424761568350407,
"grad_norm": 2.484375,
"learning_rate": 0.000489788471169591,
"loss": 5.9549,
"mean_token_accuracy": 0.15993920117616653,
"num_tokens": 22012296.0,
"step": 11805
},
{
"entropy": 6.185194492340088,
"epoch": 1.042917696926881,
"grad_norm": 3.203125,
"learning_rate": 0.0004897790895975671,
"loss": 6.001,
"mean_token_accuracy": 0.15554822683334352,
"num_tokens": 22021267.0,
"step": 11810
},
{
"entropy": 6.167956209182739,
"epoch": 1.0433592370187212,
"grad_norm": 2.03125,
"learning_rate": 0.0004897697038181428,
"loss": 5.9298,
"mean_token_accuracy": 0.16169673055410386,
"num_tokens": 22030878.0,
"step": 11815
},
{
"entropy": 6.106040668487549,
"epoch": 1.0438007771105617,
"grad_norm": 1.8359375,
"learning_rate": 0.0004897603138315022,
"loss": 5.9149,
"mean_token_accuracy": 0.16466134339570998,
"num_tokens": 22040245.0,
"step": 11820
},
{
"entropy": 6.149067068099976,
"epoch": 1.044242317202402,
"grad_norm": 2.765625,
"learning_rate": 0.0004897509196378293,
"loss": 5.915,
"mean_token_accuracy": 0.16090264320373535,
"num_tokens": 22050169.0,
"step": 11825
},
{
"entropy": 6.19168906211853,
"epoch": 1.0446838572942423,
"grad_norm": 3.90625,
"learning_rate": 0.000489741521237308,
"loss": 5.9416,
"mean_token_accuracy": 0.15919321179389953,
"num_tokens": 22059168.0,
"step": 11830
},
{
"entropy": 6.116783857345581,
"epoch": 1.0451253973860826,
"grad_norm": 2.09375,
"learning_rate": 0.0004897321186301223,
"loss": 5.8883,
"mean_token_accuracy": 0.16120110601186752,
"num_tokens": 22068326.0,
"step": 11835
},
{
"entropy": 6.1353123664855955,
"epoch": 1.045566937477923,
"grad_norm": 1.828125,
"learning_rate": 0.0004897227118164566,
"loss": 5.8827,
"mean_token_accuracy": 0.1669262945652008,
"num_tokens": 22078026.0,
"step": 11840
},
{
"entropy": 6.155642032623291,
"epoch": 1.0460084775697633,
"grad_norm": 2.46875,
"learning_rate": 0.000489713300796495,
"loss": 5.9442,
"mean_token_accuracy": 0.15576336830854415,
"num_tokens": 22088230.0,
"step": 11845
},
{
"entropy": 6.035551118850708,
"epoch": 1.0464500176616036,
"grad_norm": 3.671875,
"learning_rate": 0.0004897038855704221,
"loss": 5.7656,
"mean_token_accuracy": 0.16975640654563903,
"num_tokens": 22096667.0,
"step": 11850
},
{
"entropy": 6.010735416412354,
"epoch": 1.0468915577534441,
"grad_norm": 1.96875,
"learning_rate": 0.0004896944661384222,
"loss": 5.894,
"mean_token_accuracy": 0.16068342328071594,
"num_tokens": 22106871.0,
"step": 11855
},
{
"entropy": 6.158525609970093,
"epoch": 1.0473330978452844,
"grad_norm": 2.03125,
"learning_rate": 0.0004896850425006797,
"loss": 5.833,
"mean_token_accuracy": 0.1620667591691017,
"num_tokens": 22114954.0,
"step": 11860
},
{
"entropy": 6.149813604354859,
"epoch": 1.0477746379371247,
"grad_norm": 2.109375,
"learning_rate": 0.0004896756146573794,
"loss": 5.8733,
"mean_token_accuracy": 0.15750263035297393,
"num_tokens": 22125293.0,
"step": 11865
},
{
"entropy": 6.172176313400269,
"epoch": 1.048216178028965,
"grad_norm": 2.0,
"learning_rate": 0.0004896661826087059,
"loss": 5.9201,
"mean_token_accuracy": 0.15632580369710922,
"num_tokens": 22133731.0,
"step": 11870
},
{
"entropy": 6.0525257110595705,
"epoch": 1.0486577181208054,
"grad_norm": 2.796875,
"learning_rate": 0.0004896567463548439,
"loss": 5.9005,
"mean_token_accuracy": 0.1541312575340271,
"num_tokens": 22143007.0,
"step": 11875
},
{
"entropy": 6.109930372238159,
"epoch": 1.0490992582126457,
"grad_norm": 2.109375,
"learning_rate": 0.0004896473058959783,
"loss": 5.9154,
"mean_token_accuracy": 0.1640370547771454,
"num_tokens": 22152044.0,
"step": 11880
},
{
"entropy": 6.21768856048584,
"epoch": 1.049540798304486,
"grad_norm": 1.9609375,
"learning_rate": 0.0004896378612322942,
"loss": 5.9643,
"mean_token_accuracy": 0.15669383257627487,
"num_tokens": 22161473.0,
"step": 11885
},
{
"entropy": 6.178792238235474,
"epoch": 1.0499823383963265,
"grad_norm": 3.8125,
"learning_rate": 0.0004896284123639763,
"loss": 5.8931,
"mean_token_accuracy": 0.16212100833654403,
"num_tokens": 22171704.0,
"step": 11890
},
{
"entropy": 6.131736898422242,
"epoch": 1.0504238784881668,
"grad_norm": 1.9921875,
"learning_rate": 0.00048961895929121,
"loss": 5.8909,
"mean_token_accuracy": 0.15497680753469467,
"num_tokens": 22180593.0,
"step": 11895
},
{
"entropy": 6.053056907653809,
"epoch": 1.050865418580007,
"grad_norm": 2.203125,
"learning_rate": 0.0004896095020141802,
"loss": 5.8611,
"mean_token_accuracy": 0.16657651364803314,
"num_tokens": 22189552.0,
"step": 11900
},
{
"entropy": 6.138505363464356,
"epoch": 1.0513069586718473,
"grad_norm": 2.15625,
"learning_rate": 0.0004896000405330724,
"loss": 5.8767,
"mean_token_accuracy": 0.15375479012727739,
"num_tokens": 22199314.0,
"step": 11905
},
{
"entropy": 6.051781845092774,
"epoch": 1.0517484987636878,
"grad_norm": 1.96875,
"learning_rate": 0.000489590574848072,
"loss": 5.8421,
"mean_token_accuracy": 0.16942320466041566,
"num_tokens": 22208128.0,
"step": 11910
},
{
"entropy": 6.079268217086792,
"epoch": 1.052190038855528,
"grad_norm": 3.0,
"learning_rate": 0.000489581104959364,
"loss": 5.8278,
"mean_token_accuracy": 0.1636078104376793,
"num_tokens": 22217700.0,
"step": 11915
},
{
"entropy": 6.142178630828857,
"epoch": 1.0526315789473684,
"grad_norm": 2.859375,
"learning_rate": 0.0004895716308671343,
"loss": 5.9051,
"mean_token_accuracy": 0.15817380994558333,
"num_tokens": 22225941.0,
"step": 11920
},
{
"entropy": 6.080567264556885,
"epoch": 1.0530731190392089,
"grad_norm": 2.109375,
"learning_rate": 0.0004895621525715685,
"loss": 5.8709,
"mean_token_accuracy": 0.16067112386226653,
"num_tokens": 22234935.0,
"step": 11925
},
{
"entropy": 6.125448513031006,
"epoch": 1.0535146591310491,
"grad_norm": 2.125,
"learning_rate": 0.0004895526700728521,
"loss": 5.9321,
"mean_token_accuracy": 0.16465427875518798,
"num_tokens": 22244087.0,
"step": 11930
},
{
"entropy": 6.128238677978516,
"epoch": 1.0539561992228894,
"grad_norm": 2.4375,
"learning_rate": 0.0004895431833711708,
"loss": 5.9023,
"mean_token_accuracy": 0.15492714792490006,
"num_tokens": 22254277.0,
"step": 11935
},
{
"entropy": 6.093642473220825,
"epoch": 1.0543977393147297,
"grad_norm": 1.8359375,
"learning_rate": 0.0004895336924667107,
"loss": 5.8489,
"mean_token_accuracy": 0.16954924017190934,
"num_tokens": 22263150.0,
"step": 11940
},
{
"entropy": 6.095634460449219,
"epoch": 1.0548392794065702,
"grad_norm": 3.828125,
"learning_rate": 0.0004895241973596576,
"loss": 5.8605,
"mean_token_accuracy": 0.15977116227149962,
"num_tokens": 22271973.0,
"step": 11945
},
{
"entropy": 6.035005140304565,
"epoch": 1.0552808194984105,
"grad_norm": 12.75,
"learning_rate": 0.0004895146980501973,
"loss": 5.8641,
"mean_token_accuracy": 0.16916161626577378,
"num_tokens": 22280637.0,
"step": 11950
},
{
"entropy": 6.094235420227051,
"epoch": 1.0557223595902507,
"grad_norm": 1.828125,
"learning_rate": 0.0004895051945385163,
"loss": 5.8674,
"mean_token_accuracy": 0.1618257850408554,
"num_tokens": 22290601.0,
"step": 11955
},
{
"entropy": 6.17516827583313,
"epoch": 1.0561638996820912,
"grad_norm": 1.84375,
"learning_rate": 0.0004894956868248004,
"loss": 5.8878,
"mean_token_accuracy": 0.16308270245790482,
"num_tokens": 22300212.0,
"step": 11960
},
{
"entropy": 6.167940998077393,
"epoch": 1.0566054397739315,
"grad_norm": 2.125,
"learning_rate": 0.0004894861749092359,
"loss": 5.8721,
"mean_token_accuracy": 0.16320020258426665,
"num_tokens": 22309171.0,
"step": 11965
},
{
"entropy": 6.057597494125366,
"epoch": 1.0570469798657718,
"grad_norm": 2.171875,
"learning_rate": 0.0004894766587920094,
"loss": 5.9019,
"mean_token_accuracy": 0.17078427225351334,
"num_tokens": 22318457.0,
"step": 11970
},
{
"entropy": 6.149741268157959,
"epoch": 1.057488519957612,
"grad_norm": 2.15625,
"learning_rate": 0.000489467138473307,
"loss": 5.8923,
"mean_token_accuracy": 0.15993408858776093,
"num_tokens": 22327077.0,
"step": 11975
},
{
"entropy": 6.080211448669433,
"epoch": 1.0579300600494526,
"grad_norm": 3.328125,
"learning_rate": 0.0004894576139533154,
"loss": 5.8901,
"mean_token_accuracy": 0.1577647551894188,
"num_tokens": 22336259.0,
"step": 11980
},
{
"entropy": 6.099572038650512,
"epoch": 1.0583716001412928,
"grad_norm": 3.046875,
"learning_rate": 0.000489448085232221,
"loss": 5.8688,
"mean_token_accuracy": 0.17301248610019684,
"num_tokens": 22344978.0,
"step": 11985
},
{
"entropy": 6.098490762710571,
"epoch": 1.058813140233133,
"grad_norm": 1.9453125,
"learning_rate": 0.0004894385523102107,
"loss": 5.8744,
"mean_token_accuracy": 0.16238198131322862,
"num_tokens": 22353950.0,
"step": 11990
},
{
"entropy": 6.118423223495483,
"epoch": 1.0592546803249736,
"grad_norm": 2.3125,
"learning_rate": 0.0004894290151874711,
"loss": 5.8363,
"mean_token_accuracy": 0.16346891224384308,
"num_tokens": 22363100.0,
"step": 11995
},
{
"entropy": 6.047951173782349,
"epoch": 1.0596962204168139,
"grad_norm": 4.6875,
"learning_rate": 0.000489419473864189,
"loss": 5.826,
"mean_token_accuracy": 0.16859456151723862,
"num_tokens": 22371979.0,
"step": 12000
},
{
"epoch": 1.0596962204168139,
"eval_entropy": 5.9104950485791115,
"eval_loss": 5.965954780578613,
"eval_mean_token_accuracy": 0.1666101186941267,
"eval_num_tokens": 22371979.0,
"eval_runtime": 26.1386,
"eval_samples_per_second": 1351.066,
"eval_steps_per_second": 168.907,
"step": 12000
},
{
"entropy": 6.080607128143311,
"epoch": 1.0601377605086542,
"grad_norm": 3.921875,
"learning_rate": 0.0004894099283405515,
"loss": 5.8452,
"mean_token_accuracy": 0.16302275657653809,
"num_tokens": 22380987.0,
"step": 12005
},
{
"entropy": 6.118101167678833,
"epoch": 1.0605793006004944,
"grad_norm": 2.734375,
"learning_rate": 0.0004894003786167452,
"loss": 5.8973,
"mean_token_accuracy": 0.15738590359687804,
"num_tokens": 22389367.0,
"step": 12010
},
{
"entropy": 6.1374822616577145,
"epoch": 1.061020840692335,
"grad_norm": 2.59375,
"learning_rate": 0.0004893908246929576,
"loss": 5.9671,
"mean_token_accuracy": 0.1573053777217865,
"num_tokens": 22399158.0,
"step": 12015
},
{
"entropy": 6.1828516006469725,
"epoch": 1.0614623807841752,
"grad_norm": 3.65625,
"learning_rate": 0.0004893812665693755,
"loss": 5.9338,
"mean_token_accuracy": 0.1581365153193474,
"num_tokens": 22408245.0,
"step": 12020
},
{
"entropy": 6.094166278839111,
"epoch": 1.0619039208760155,
"grad_norm": 3.46875,
"learning_rate": 0.0004893717042461865,
"loss": 5.9248,
"mean_token_accuracy": 0.1614614889025688,
"num_tokens": 22417014.0,
"step": 12025
},
{
"entropy": 6.182637786865234,
"epoch": 1.062345460967856,
"grad_norm": 2.40625,
"learning_rate": 0.0004893621377235777,
"loss": 5.8547,
"mean_token_accuracy": 0.16196434944868088,
"num_tokens": 22426504.0,
"step": 12030
},
{
"entropy": 6.209752607345581,
"epoch": 1.0627870010596963,
"grad_norm": 3.0625,
"learning_rate": 0.0004893525670017364,
"loss": 5.9646,
"mean_token_accuracy": 0.15444523468613625,
"num_tokens": 22435859.0,
"step": 12035
},
{
"entropy": 6.129924535751343,
"epoch": 1.0632285411515365,
"grad_norm": 2.34375,
"learning_rate": 0.0004893429920808503,
"loss": 5.8755,
"mean_token_accuracy": 0.16700086891651153,
"num_tokens": 22445112.0,
"step": 12040
},
{
"entropy": 6.099804401397705,
"epoch": 1.0636700812433768,
"grad_norm": 2.890625,
"learning_rate": 0.000489333412961107,
"loss": 5.9328,
"mean_token_accuracy": 0.15640815123915672,
"num_tokens": 22454602.0,
"step": 12045
},
{
"entropy": 6.228172302246094,
"epoch": 1.0641116213352173,
"grad_norm": 2.0625,
"learning_rate": 0.0004893238296426939,
"loss": 5.9485,
"mean_token_accuracy": 0.153381285071373,
"num_tokens": 22463918.0,
"step": 12050
},
{
"entropy": 6.141571426391602,
"epoch": 1.0645531614270576,
"grad_norm": 3.046875,
"learning_rate": 0.0004893142421257989,
"loss": 5.8497,
"mean_token_accuracy": 0.15828943699598313,
"num_tokens": 22473059.0,
"step": 12055
},
{
"entropy": 6.088652944564819,
"epoch": 1.0649947015188979,
"grad_norm": 2.515625,
"learning_rate": 0.0004893046504106099,
"loss": 5.9055,
"mean_token_accuracy": 0.16051224023103713,
"num_tokens": 22482615.0,
"step": 12060
},
{
"entropy": 6.051146364212036,
"epoch": 1.0654362416107384,
"grad_norm": 2.890625,
"learning_rate": 0.0004892950544973145,
"loss": 5.8159,
"mean_token_accuracy": 0.16776211559772491,
"num_tokens": 22492141.0,
"step": 12065
},
{
"entropy": 6.135915374755859,
"epoch": 1.0658777817025786,
"grad_norm": 2.453125,
"learning_rate": 0.0004892854543861009,
"loss": 5.7998,
"mean_token_accuracy": 0.16765124052762986,
"num_tokens": 22502084.0,
"step": 12070
},
{
"entropy": 6.069457769393921,
"epoch": 1.066319321794419,
"grad_norm": 2.671875,
"learning_rate": 0.0004892758500771572,
"loss": 5.8204,
"mean_token_accuracy": 0.16632680743932723,
"num_tokens": 22510565.0,
"step": 12075
},
{
"entropy": 6.103964853286743,
"epoch": 1.0667608618862592,
"grad_norm": 2.671875,
"learning_rate": 0.0004892662415706714,
"loss": 5.9319,
"mean_token_accuracy": 0.15721865743398666,
"num_tokens": 22520089.0,
"step": 12080
},
{
"entropy": 6.1330756664276125,
"epoch": 1.0672024019780997,
"grad_norm": 3.0625,
"learning_rate": 0.0004892566288668319,
"loss": 5.8497,
"mean_token_accuracy": 0.15916649401187896,
"num_tokens": 22529008.0,
"step": 12085
},
{
"entropy": 6.125491285324097,
"epoch": 1.06764394206994,
"grad_norm": 2.15625,
"learning_rate": 0.0004892470119658267,
"loss": 5.829,
"mean_token_accuracy": 0.16793985217809676,
"num_tokens": 22538040.0,
"step": 12090
},
{
"entropy": 6.095601034164429,
"epoch": 1.0680854821617802,
"grad_norm": 2.21875,
"learning_rate": 0.0004892373908678445,
"loss": 5.9193,
"mean_token_accuracy": 0.16070878356695176,
"num_tokens": 22548786.0,
"step": 12095
},
{
"entropy": 6.115885829925537,
"epoch": 1.0685270222536207,
"grad_norm": 3.46875,
"learning_rate": 0.0004892277655730736,
"loss": 5.8886,
"mean_token_accuracy": 0.1639350488781929,
"num_tokens": 22559841.0,
"step": 12100
},
{
"entropy": 6.1804839134216305,
"epoch": 1.068968562345461,
"grad_norm": 1.890625,
"learning_rate": 0.0004892181360817027,
"loss": 5.8357,
"mean_token_accuracy": 0.1674989491701126,
"num_tokens": 22569338.0,
"step": 12105
},
{
"entropy": 6.107420206069946,
"epoch": 1.0694101024373013,
"grad_norm": 2.40625,
"learning_rate": 0.0004892085023939204,
"loss": 5.8938,
"mean_token_accuracy": 0.15918412059545517,
"num_tokens": 22578184.0,
"step": 12110
},
{
"entropy": 6.156821966171265,
"epoch": 1.0698516425291416,
"grad_norm": 3.21875,
"learning_rate": 0.0004891988645099151,
"loss": 6.0004,
"mean_token_accuracy": 0.1538984566926956,
"num_tokens": 22587007.0,
"step": 12115
},
{
"entropy": 6.19293966293335,
"epoch": 1.070293182620982,
"grad_norm": 3.875,
"learning_rate": 0.0004891892224298761,
"loss": 5.9164,
"mean_token_accuracy": 0.15838483572006226,
"num_tokens": 22596898.0,
"step": 12120
},
{
"entropy": 6.103801918029785,
"epoch": 1.0707347227128223,
"grad_norm": 2.28125,
"learning_rate": 0.000489179576153992,
"loss": 5.834,
"mean_token_accuracy": 0.17112430632114412,
"num_tokens": 22605627.0,
"step": 12125
},
{
"entropy": 6.04658842086792,
"epoch": 1.0711762628046626,
"grad_norm": 2.375,
"learning_rate": 0.0004891699256824518,
"loss": 5.7859,
"mean_token_accuracy": 0.16553682684898377,
"num_tokens": 22615269.0,
"step": 12130
},
{
"entropy": 6.091463899612426,
"epoch": 1.071617802896503,
"grad_norm": 3.21875,
"learning_rate": 0.0004891602710154446,
"loss": 5.8321,
"mean_token_accuracy": 0.1640575036406517,
"num_tokens": 22625048.0,
"step": 12135
},
{
"entropy": 6.117054080963134,
"epoch": 1.0720593429883434,
"grad_norm": 2.453125,
"learning_rate": 0.0004891506121531593,
"loss": 5.8282,
"mean_token_accuracy": 0.16564998775720596,
"num_tokens": 22634146.0,
"step": 12140
},
{
"entropy": 6.096725416183472,
"epoch": 1.0725008830801837,
"grad_norm": 2.375,
"learning_rate": 0.0004891409490957855,
"loss": 5.9203,
"mean_token_accuracy": 0.16227253079414367,
"num_tokens": 22642915.0,
"step": 12145
},
{
"entropy": 6.142024135589599,
"epoch": 1.072942423172024,
"grad_norm": 2.375,
"learning_rate": 0.0004891312818435122,
"loss": 5.8518,
"mean_token_accuracy": 0.16495393812656403,
"num_tokens": 22651546.0,
"step": 12150
},
{
"entropy": 6.158210134506225,
"epoch": 1.0733839632638644,
"grad_norm": 3.484375,
"learning_rate": 0.000489121610396529,
"loss": 5.8669,
"mean_token_accuracy": 0.161962653696537,
"num_tokens": 22660712.0,
"step": 12155
},
{
"entropy": 6.1343601703643795,
"epoch": 1.0738255033557047,
"grad_norm": 3.1875,
"learning_rate": 0.0004891119347550251,
"loss": 5.8403,
"mean_token_accuracy": 0.17121109515428543,
"num_tokens": 22669428.0,
"step": 12160
},
{
"entropy": 6.1205801486969,
"epoch": 1.074267043447545,
"grad_norm": 3.21875,
"learning_rate": 0.0004891022549191902,
"loss": 5.939,
"mean_token_accuracy": 0.15676200836896897,
"num_tokens": 22679126.0,
"step": 12165
},
{
"entropy": 6.004634189605713,
"epoch": 1.0747085835393855,
"grad_norm": 3.046875,
"learning_rate": 0.0004890925708892138,
"loss": 5.8338,
"mean_token_accuracy": 0.17283142507076263,
"num_tokens": 22688640.0,
"step": 12170
},
{
"entropy": 6.105986928939819,
"epoch": 1.0751501236312258,
"grad_norm": 2.34375,
"learning_rate": 0.000489082882665286,
"loss": 5.7974,
"mean_token_accuracy": 0.1690528154373169,
"num_tokens": 22698158.0,
"step": 12175
},
{
"entropy": 6.027491474151612,
"epoch": 1.075591663723066,
"grad_norm": 4.84375,
"learning_rate": 0.000489073190247596,
"loss": 5.7586,
"mean_token_accuracy": 0.17439616620540618,
"num_tokens": 22707649.0,
"step": 12180
},
{
"entropy": 6.152710819244385,
"epoch": 1.0760332038149063,
"grad_norm": 3.3125,
"learning_rate": 0.000489063493636334,
"loss": 5.9535,
"mean_token_accuracy": 0.1597344234585762,
"num_tokens": 22717123.0,
"step": 12185
},
{
"entropy": 6.134236812591553,
"epoch": 1.0764747439067468,
"grad_norm": 2.796875,
"learning_rate": 0.0004890537928316901,
"loss": 5.8836,
"mean_token_accuracy": 0.16312764436006547,
"num_tokens": 22725921.0,
"step": 12190
},
{
"entropy": 6.139239025115967,
"epoch": 1.076916283998587,
"grad_norm": 2.375,
"learning_rate": 0.0004890440878338538,
"loss": 5.9532,
"mean_token_accuracy": 0.1579462394118309,
"num_tokens": 22735798.0,
"step": 12195
},
{
"entropy": 6.158273792266845,
"epoch": 1.0773578240904274,
"grad_norm": 3.625,
"learning_rate": 0.0004890343786430158,
"loss": 5.9491,
"mean_token_accuracy": 0.16170363277196884,
"num_tokens": 22745583.0,
"step": 12200
},
{
"entropy": 6.106134986877441,
"epoch": 1.0777993641822678,
"grad_norm": 7.28125,
"learning_rate": 0.000489024665259366,
"loss": 5.7898,
"mean_token_accuracy": 0.1724538430571556,
"num_tokens": 22754693.0,
"step": 12205
},
{
"entropy": 6.033071994781494,
"epoch": 1.0782409042741081,
"grad_norm": 2.390625,
"learning_rate": 0.0004890149476830947,
"loss": 5.8033,
"mean_token_accuracy": 0.16497764885425567,
"num_tokens": 22763416.0,
"step": 12210
},
{
"entropy": 6.113364839553833,
"epoch": 1.0786824443659484,
"grad_norm": 1.9375,
"learning_rate": 0.0004890052259143924,
"loss": 5.8631,
"mean_token_accuracy": 0.16488125473260878,
"num_tokens": 22772411.0,
"step": 12215
},
{
"entropy": 6.067261457443237,
"epoch": 1.0791239844577887,
"grad_norm": 2.359375,
"learning_rate": 0.0004889954999534493,
"loss": 5.7588,
"mean_token_accuracy": 0.17184129506349563,
"num_tokens": 22780148.0,
"step": 12220
},
{
"entropy": 6.102671337127686,
"epoch": 1.0795655245496292,
"grad_norm": 2.5,
"learning_rate": 0.0004889857698004561,
"loss": 5.8341,
"mean_token_accuracy": 0.16119652688503266,
"num_tokens": 22789453.0,
"step": 12225
},
{
"entropy": 6.128667688369751,
"epoch": 1.0800070646414694,
"grad_norm": 2.875,
"learning_rate": 0.0004889760354556033,
"loss": 5.8819,
"mean_token_accuracy": 0.16766076385974885,
"num_tokens": 22798800.0,
"step": 12230
},
{
"entropy": 6.052564859390259,
"epoch": 1.0804486047333097,
"grad_norm": 2.4375,
"learning_rate": 0.0004889662969190817,
"loss": 5.9291,
"mean_token_accuracy": 0.16521758139133452,
"num_tokens": 22807766.0,
"step": 12235
},
{
"entropy": 6.051133155822754,
"epoch": 1.0808901448251502,
"grad_norm": 4.78125,
"learning_rate": 0.0004889565541910822,
"loss": 5.8315,
"mean_token_accuracy": 0.16230595260858535,
"num_tokens": 22817316.0,
"step": 12240
},
{
"entropy": 6.137350034713745,
"epoch": 1.0813316849169905,
"grad_norm": 4.46875,
"learning_rate": 0.0004889468072717953,
"loss": 5.9045,
"mean_token_accuracy": 0.165514013171196,
"num_tokens": 22827082.0,
"step": 12245
},
{
"entropy": 6.128554439544677,
"epoch": 1.0817732250088308,
"grad_norm": 5.5625,
"learning_rate": 0.0004889370561614122,
"loss": 5.8769,
"mean_token_accuracy": 0.16359879821538925,
"num_tokens": 22836114.0,
"step": 12250
},
{
"entropy": 6.177400398254394,
"epoch": 1.082214765100671,
"grad_norm": 3.546875,
"learning_rate": 0.0004889273008601238,
"loss": 5.9916,
"mean_token_accuracy": 0.157696196436882,
"num_tokens": 22845653.0,
"step": 12255
},
{
"entropy": 6.251736688613891,
"epoch": 1.0826563051925115,
"grad_norm": 2.359375,
"learning_rate": 0.0004889175413681213,
"loss": 5.9185,
"mean_token_accuracy": 0.1644342675805092,
"num_tokens": 22855472.0,
"step": 12260
},
{
"entropy": 6.203494691848755,
"epoch": 1.0830978452843518,
"grad_norm": 1.828125,
"learning_rate": 0.0004889077776855957,
"loss": 5.8483,
"mean_token_accuracy": 0.16433649957180024,
"num_tokens": 22864223.0,
"step": 12265
},
{
"entropy": 6.115927457809448,
"epoch": 1.083539385376192,
"grad_norm": 2.03125,
"learning_rate": 0.0004888980098127385,
"loss": 5.9346,
"mean_token_accuracy": 0.16026950776576995,
"num_tokens": 22872868.0,
"step": 12270
},
{
"entropy": 6.0883471965789795,
"epoch": 1.0839809254680326,
"grad_norm": 3.40625,
"learning_rate": 0.0004888882377497409,
"loss": 5.9358,
"mean_token_accuracy": 0.1603495419025421,
"num_tokens": 22881867.0,
"step": 12275
},
{
"entropy": 6.147613859176635,
"epoch": 1.0844224655598729,
"grad_norm": 2.4375,
"learning_rate": 0.0004888784614967943,
"loss": 5.8723,
"mean_token_accuracy": 0.15580232366919516,
"num_tokens": 22890904.0,
"step": 12280
},
{
"entropy": 6.166345262527466,
"epoch": 1.0848640056517131,
"grad_norm": 2.953125,
"learning_rate": 0.0004888686810540905,
"loss": 5.8127,
"mean_token_accuracy": 0.16828497648239135,
"num_tokens": 22900128.0,
"step": 12285
},
{
"entropy": 6.196285772323608,
"epoch": 1.0853055457435534,
"grad_norm": 3.3125,
"learning_rate": 0.0004888588964218208,
"loss": 5.9102,
"mean_token_accuracy": 0.16316909343004227,
"num_tokens": 22910101.0,
"step": 12290
},
{
"entropy": 6.134654951095581,
"epoch": 1.085747085835394,
"grad_norm": 2.375,
"learning_rate": 0.0004888491076001768,
"loss": 5.8646,
"mean_token_accuracy": 0.16131064891815186,
"num_tokens": 22919372.0,
"step": 12295
},
{
"entropy": 6.078165721893311,
"epoch": 1.0861886259272342,
"grad_norm": 3.453125,
"learning_rate": 0.0004888393145893505,
"loss": 5.877,
"mean_token_accuracy": 0.1595502495765686,
"num_tokens": 22929053.0,
"step": 12300
},
{
"entropy": 6.052017593383789,
"epoch": 1.0866301660190745,
"grad_norm": 2.0625,
"learning_rate": 0.0004888295173895335,
"loss": 5.8303,
"mean_token_accuracy": 0.16762010753154755,
"num_tokens": 22938173.0,
"step": 12305
},
{
"entropy": 6.179817247390747,
"epoch": 1.087071706110915,
"grad_norm": 2.375,
"learning_rate": 0.0004888197160009181,
"loss": 5.9558,
"mean_token_accuracy": 0.16028767675161362,
"num_tokens": 22947076.0,
"step": 12310
},
{
"entropy": 6.142680263519287,
"epoch": 1.0875132462027552,
"grad_norm": 2.4375,
"learning_rate": 0.000488809910423696,
"loss": 5.8627,
"mean_token_accuracy": 0.16803582310676574,
"num_tokens": 22956267.0,
"step": 12315
},
{
"entropy": 6.191233921051025,
"epoch": 1.0879547862945955,
"grad_norm": 1.890625,
"learning_rate": 0.0004888001006580592,
"loss": 5.9805,
"mean_token_accuracy": 0.15289072096347808,
"num_tokens": 22966751.0,
"step": 12320
},
{
"entropy": 6.05118989944458,
"epoch": 1.0883963263864358,
"grad_norm": 2.984375,
"learning_rate": 0.0004887902867042002,
"loss": 5.8738,
"mean_token_accuracy": 0.16539966613054274,
"num_tokens": 22975862.0,
"step": 12325
},
{
"entropy": 6.147016286849976,
"epoch": 1.0888378664782763,
"grad_norm": 2.53125,
"learning_rate": 0.0004887804685623111,
"loss": 5.8385,
"mean_token_accuracy": 0.16454376876354218,
"num_tokens": 22985085.0,
"step": 12330
},
{
"entropy": 6.1836309909820555,
"epoch": 1.0892794065701166,
"grad_norm": 2.40625,
"learning_rate": 0.0004887706462325841,
"loss": 5.957,
"mean_token_accuracy": 0.16077665537595748,
"num_tokens": 22993718.0,
"step": 12335
},
{
"entropy": 6.102176380157471,
"epoch": 1.0897209466619568,
"grad_norm": 1.765625,
"learning_rate": 0.0004887608197152117,
"loss": 5.8086,
"mean_token_accuracy": 0.17308517694473266,
"num_tokens": 23002611.0,
"step": 12340
},
{
"entropy": 6.159591007232666,
"epoch": 1.0901624867537973,
"grad_norm": 1.9921875,
"learning_rate": 0.0004887509890103864,
"loss": 5.9665,
"mean_token_accuracy": 0.15826371312141418,
"num_tokens": 23012333.0,
"step": 12345
},
{
"entropy": 6.226419734954834,
"epoch": 1.0906040268456376,
"grad_norm": 2.375,
"learning_rate": 0.0004887411541183009,
"loss": 5.9074,
"mean_token_accuracy": 0.1619698628783226,
"num_tokens": 23020998.0,
"step": 12350
},
{
"entropy": 6.2231032371521,
"epoch": 1.091045566937478,
"grad_norm": 2.09375,
"learning_rate": 0.0004887313150391477,
"loss": 5.8924,
"mean_token_accuracy": 0.16481442600488663,
"num_tokens": 23029520.0,
"step": 12355
},
{
"entropy": 6.126835346221924,
"epoch": 1.0914871070293182,
"grad_norm": 4.46875,
"learning_rate": 0.0004887214717731196,
"loss": 5.9661,
"mean_token_accuracy": 0.16031284034252166,
"num_tokens": 23039224.0,
"step": 12360
},
{
"entropy": 6.091069555282592,
"epoch": 1.0919286471211587,
"grad_norm": 2.453125,
"learning_rate": 0.0004887116243204094,
"loss": 5.8496,
"mean_token_accuracy": 0.16013236492872238,
"num_tokens": 23047851.0,
"step": 12365
},
{
"entropy": 6.062824153900147,
"epoch": 1.092370187212999,
"grad_norm": 2.34375,
"learning_rate": 0.00048870177268121,
"loss": 5.8577,
"mean_token_accuracy": 0.1618281975388527,
"num_tokens": 23057242.0,
"step": 12370
},
{
"entropy": 6.178926277160644,
"epoch": 1.0928117273048392,
"grad_norm": 3.390625,
"learning_rate": 0.0004886919168557145,
"loss": 5.9878,
"mean_token_accuracy": 0.15644675940275193,
"num_tokens": 23066873.0,
"step": 12375
},
{
"entropy": 6.1980146884918215,
"epoch": 1.0932532673966797,
"grad_norm": 1.671875,
"learning_rate": 0.0004886820568441158,
"loss": 5.9518,
"mean_token_accuracy": 0.15500134378671646,
"num_tokens": 23076448.0,
"step": 12380
},
{
"entropy": 6.141326236724853,
"epoch": 1.09369480748852,
"grad_norm": 2.765625,
"learning_rate": 0.0004886721926466072,
"loss": 5.8604,
"mean_token_accuracy": 0.1670851930975914,
"num_tokens": 23084759.0,
"step": 12385
},
{
"entropy": 6.103963136672974,
"epoch": 1.0941363475803603,
"grad_norm": 2.28125,
"learning_rate": 0.0004886623242633817,
"loss": 5.8191,
"mean_token_accuracy": 0.16416559219360352,
"num_tokens": 23093236.0,
"step": 12390
},
{
"entropy": 6.151148843765259,
"epoch": 1.0945778876722005,
"grad_norm": 3.15625,
"learning_rate": 0.000488652451694633,
"loss": 5.8716,
"mean_token_accuracy": 0.16273578107357026,
"num_tokens": 23101621.0,
"step": 12395
},
{
"entropy": 6.223285436630249,
"epoch": 1.095019427764041,
"grad_norm": 2.34375,
"learning_rate": 0.0004886425749405542,
"loss": 5.9177,
"mean_token_accuracy": 0.15849976986646652,
"num_tokens": 23110882.0,
"step": 12400
},
{
"entropy": 6.218260717391968,
"epoch": 1.0954609678558813,
"grad_norm": 3.515625,
"learning_rate": 0.0004886326940013388,
"loss": 5.9111,
"mean_token_accuracy": 0.16631950438022614,
"num_tokens": 23120669.0,
"step": 12405
},
{
"entropy": 6.084309101104736,
"epoch": 1.0959025079477216,
"grad_norm": 1.890625,
"learning_rate": 0.0004886228088771805,
"loss": 5.8162,
"mean_token_accuracy": 0.16509855836629866,
"num_tokens": 23129524.0,
"step": 12410
},
{
"entropy": 6.032095336914063,
"epoch": 1.096344048039562,
"grad_norm": 7.1875,
"learning_rate": 0.0004886129195682729,
"loss": 5.8632,
"mean_token_accuracy": 0.15952766984701156,
"num_tokens": 23139144.0,
"step": 12415
},
{
"entropy": 6.109521675109863,
"epoch": 1.0967855881314024,
"grad_norm": 3.0,
"learning_rate": 0.0004886030260748096,
"loss": 5.7981,
"mean_token_accuracy": 0.16424379199743272,
"num_tokens": 23148600.0,
"step": 12420
},
{
"entropy": 6.081294870376587,
"epoch": 1.0972271282232426,
"grad_norm": 4.375,
"learning_rate": 0.0004885931283969845,
"loss": 5.7737,
"mean_token_accuracy": 0.17334116995334625,
"num_tokens": 23156831.0,
"step": 12425
},
{
"entropy": 6.13355073928833,
"epoch": 1.097668668315083,
"grad_norm": 2.15625,
"learning_rate": 0.0004885832265349915,
"loss": 5.9656,
"mean_token_accuracy": 0.1543772578239441,
"num_tokens": 23166453.0,
"step": 12430
},
{
"entropy": 6.112336206436157,
"epoch": 1.0981102084069234,
"grad_norm": 3.0625,
"learning_rate": 0.0004885733204890246,
"loss": 5.8319,
"mean_token_accuracy": 0.16210954636335373,
"num_tokens": 23175832.0,
"step": 12435
},
{
"entropy": 6.13703031539917,
"epoch": 1.0985517484987637,
"grad_norm": 4.71875,
"learning_rate": 0.0004885634102592778,
"loss": 5.8581,
"mean_token_accuracy": 0.1654033437371254,
"num_tokens": 23185349.0,
"step": 12440
},
{
"entropy": 6.201751852035523,
"epoch": 1.098993288590604,
"grad_norm": 1.84375,
"learning_rate": 0.0004885534958459454,
"loss": 5.9854,
"mean_token_accuracy": 0.1605930969119072,
"num_tokens": 23195391.0,
"step": 12445
},
{
"entropy": 6.10352258682251,
"epoch": 1.0994348286824445,
"grad_norm": 3.015625,
"learning_rate": 0.0004885435772492213,
"loss": 5.9435,
"mean_token_accuracy": 0.1640683799982071,
"num_tokens": 23204689.0,
"step": 12450
},
{
"entropy": 6.11891770362854,
"epoch": 1.0998763687742847,
"grad_norm": 6.125,
"learning_rate": 0.0004885336544693,
"loss": 5.8789,
"mean_token_accuracy": 0.1628335028886795,
"num_tokens": 23213182.0,
"step": 12455
},
{
"entropy": 6.061840057373047,
"epoch": 1.100317908866125,
"grad_norm": 2.8125,
"learning_rate": 0.0004885237275063758,
"loss": 5.8761,
"mean_token_accuracy": 0.15886288285255432,
"num_tokens": 23222058.0,
"step": 12460
},
{
"entropy": 6.178944540023804,
"epoch": 1.1007594489579653,
"grad_norm": 2.453125,
"learning_rate": 0.0004885137963606433,
"loss": 5.9377,
"mean_token_accuracy": 0.17044368088245393,
"num_tokens": 23231747.0,
"step": 12465
},
{
"entropy": 6.173216772079468,
"epoch": 1.1012009890498058,
"grad_norm": 2.546875,
"learning_rate": 0.0004885038610322969,
"loss": 5.8748,
"mean_token_accuracy": 0.1643244668841362,
"num_tokens": 23240402.0,
"step": 12470
},
{
"entropy": 6.173446798324585,
"epoch": 1.101642529141646,
"grad_norm": 1.921875,
"learning_rate": 0.0004884939215215314,
"loss": 5.9276,
"mean_token_accuracy": 0.16851525455713273,
"num_tokens": 23249344.0,
"step": 12475
},
{
"entropy": 6.138324451446533,
"epoch": 1.1020840692334863,
"grad_norm": 14.5625,
"learning_rate": 0.0004884839778285413,
"loss": 5.9226,
"mean_token_accuracy": 0.15813361704349518,
"num_tokens": 23258157.0,
"step": 12480
},
{
"entropy": 6.1202093124389645,
"epoch": 1.1025256093253268,
"grad_norm": 2.84375,
"learning_rate": 0.0004884740299535216,
"loss": 5.8974,
"mean_token_accuracy": 0.15337367802858354,
"num_tokens": 23267798.0,
"step": 12485
},
{
"entropy": 6.131400632858276,
"epoch": 1.1029671494171671,
"grad_norm": 2.875,
"learning_rate": 0.000488464077896667,
"loss": 5.942,
"mean_token_accuracy": 0.1638056144118309,
"num_tokens": 23276429.0,
"step": 12490
},
{
"entropy": 6.0629075050354,
"epoch": 1.1034086895090074,
"grad_norm": 2.625,
"learning_rate": 0.0004884541216581724,
"loss": 5.8413,
"mean_token_accuracy": 0.1678636983036995,
"num_tokens": 23285878.0,
"step": 12495
},
{
"entropy": 6.0404359817504885,
"epoch": 1.1038502296008477,
"grad_norm": 2.859375,
"learning_rate": 0.000488444161238233,
"loss": 5.8377,
"mean_token_accuracy": 0.16961323022842406,
"num_tokens": 23295683.0,
"step": 12500
},
{
"entropy": 6.179982709884643,
"epoch": 1.1042917696926882,
"grad_norm": 13.25,
"learning_rate": 0.0004884341966370439,
"loss": 5.921,
"mean_token_accuracy": 0.15547953695058822,
"num_tokens": 23305539.0,
"step": 12505
},
{
"entropy": 6.142560625076294,
"epoch": 1.1047333097845284,
"grad_norm": 3.171875,
"learning_rate": 0.0004884242278548003,
"loss": 5.8889,
"mean_token_accuracy": 0.16350685954093933,
"num_tokens": 23314889.0,
"step": 12510
},
{
"entropy": 6.1795081615448,
"epoch": 1.1051748498763687,
"grad_norm": 2.890625,
"learning_rate": 0.0004884142548916975,
"loss": 5.9409,
"mean_token_accuracy": 0.15653281062841415,
"num_tokens": 23324425.0,
"step": 12515
},
{
"entropy": 6.136827373504639,
"epoch": 1.1056163899682092,
"grad_norm": 2.296875,
"learning_rate": 0.0004884042777479308,
"loss": 5.8128,
"mean_token_accuracy": 0.1630527690052986,
"num_tokens": 23332994.0,
"step": 12520
},
{
"entropy": 6.070323133468628,
"epoch": 1.1060579300600495,
"grad_norm": 2.6875,
"learning_rate": 0.0004883942964236957,
"loss": 5.7849,
"mean_token_accuracy": 0.16712369173765182,
"num_tokens": 23342108.0,
"step": 12525
},
{
"entropy": 5.994870567321778,
"epoch": 1.1064994701518898,
"grad_norm": 3.234375,
"learning_rate": 0.0004883843109191877,
"loss": 5.8216,
"mean_token_accuracy": 0.16982484310865403,
"num_tokens": 23351439.0,
"step": 12530
},
{
"entropy": 6.088821840286255,
"epoch": 1.10694101024373,
"grad_norm": 3.28125,
"learning_rate": 0.0004883743212346021,
"loss": 5.9272,
"mean_token_accuracy": 0.15943445414304733,
"num_tokens": 23360591.0,
"step": 12535
},
{
"entropy": 6.183572626113891,
"epoch": 1.1073825503355705,
"grad_norm": 2.296875,
"learning_rate": 0.0004883643273701353,
"loss": 5.8694,
"mean_token_accuracy": 0.1612533912062645,
"num_tokens": 23369854.0,
"step": 12540
},
{
"entropy": 6.147265243530273,
"epoch": 1.1078240904274108,
"grad_norm": 2.40625,
"learning_rate": 0.0004883543293259826,
"loss": 5.9322,
"mean_token_accuracy": 0.15584825426340104,
"num_tokens": 23378071.0,
"step": 12545
},
{
"entropy": 6.120412683486938,
"epoch": 1.108265630519251,
"grad_norm": 2.625,
"learning_rate": 0.0004883443271023397,
"loss": 5.9426,
"mean_token_accuracy": 0.15620587766170502,
"num_tokens": 23387083.0,
"step": 12550
},
{
"entropy": 6.095384025573731,
"epoch": 1.1087071706110916,
"grad_norm": 2.234375,
"learning_rate": 0.000488334320699403,
"loss": 5.7584,
"mean_token_accuracy": 0.16701602786779404,
"num_tokens": 23395008.0,
"step": 12555
},
{
"entropy": 6.149398565292358,
"epoch": 1.1091487107029319,
"grad_norm": 6.03125,
"learning_rate": 0.0004883243101173681,
"loss": 5.8593,
"mean_token_accuracy": 0.16142114698886872,
"num_tokens": 23404193.0,
"step": 12560
},
{
"entropy": 6.066608333587647,
"epoch": 1.1095902507947721,
"grad_norm": 2.421875,
"learning_rate": 0.0004883142953564315,
"loss": 5.8697,
"mean_token_accuracy": 0.163527649641037,
"num_tokens": 23413353.0,
"step": 12565
},
{
"entropy": 6.121576976776123,
"epoch": 1.1100317908866124,
"grad_norm": 2.265625,
"learning_rate": 0.000488304276416789,
"loss": 5.92,
"mean_token_accuracy": 0.16121306866407395,
"num_tokens": 23422797.0,
"step": 12570
},
{
"entropy": 6.214694356918335,
"epoch": 1.110473330978453,
"grad_norm": 2.65625,
"learning_rate": 0.0004882942532986372,
"loss": 5.9972,
"mean_token_accuracy": 0.1653338149189949,
"num_tokens": 23432705.0,
"step": 12575
},
{
"entropy": 6.186184310913086,
"epoch": 1.1109148710702932,
"grad_norm": 2.359375,
"learning_rate": 0.0004882842260021721,
"loss": 5.8625,
"mean_token_accuracy": 0.16767886132001877,
"num_tokens": 23441613.0,
"step": 12580
},
{
"entropy": 6.097024297714233,
"epoch": 1.1113564111621335,
"grad_norm": 2.65625,
"learning_rate": 0.00048827419452759045,
"loss": 5.9283,
"mean_token_accuracy": 0.1584640398621559,
"num_tokens": 23450975.0,
"step": 12585
},
{
"entropy": 6.151046848297119,
"epoch": 1.111797951253974,
"grad_norm": 2.796875,
"learning_rate": 0.00048826415887508857,
"loss": 5.913,
"mean_token_accuracy": 0.15947175025939941,
"num_tokens": 23460646.0,
"step": 12590
},
{
"entropy": 6.302566957473755,
"epoch": 1.1122394913458142,
"grad_norm": 2.09375,
"learning_rate": 0.00048825411904486303,
"loss": 5.9799,
"mean_token_accuracy": 0.14951791614294052,
"num_tokens": 23470454.0,
"step": 12595
},
{
"entropy": 6.169647884368897,
"epoch": 1.1126810314376545,
"grad_norm": 3.3125,
"learning_rate": 0.0004882440750371108,
"loss": 5.8658,
"mean_token_accuracy": 0.16392998099327089,
"num_tokens": 23480013.0,
"step": 12600
},
{
"entropy": 6.162577962875366,
"epoch": 1.1131225715294948,
"grad_norm": 4.3125,
"learning_rate": 0.00048823402685202824,
"loss": 5.8633,
"mean_token_accuracy": 0.16069583743810653,
"num_tokens": 23489485.0,
"step": 12605
},
{
"entropy": 6.099958324432373,
"epoch": 1.1135641116213353,
"grad_norm": 1.9609375,
"learning_rate": 0.0004882239744898124,
"loss": 5.8548,
"mean_token_accuracy": 0.16953572779893875,
"num_tokens": 23498147.0,
"step": 12610
},
{
"entropy": 6.011538696289063,
"epoch": 1.1140056517131756,
"grad_norm": 2.640625,
"learning_rate": 0.0004882139179506602,
"loss": 5.7599,
"mean_token_accuracy": 0.17197319865226746,
"num_tokens": 23506614.0,
"step": 12615
},
{
"entropy": 6.18383641242981,
"epoch": 1.1144471918050158,
"grad_norm": 1.7265625,
"learning_rate": 0.0004882038572347685,
"loss": 6.005,
"mean_token_accuracy": 0.15220504999160767,
"num_tokens": 23514927.0,
"step": 12620
},
{
"entropy": 6.171337604522705,
"epoch": 1.1148887318968563,
"grad_norm": 2.8125,
"learning_rate": 0.00048819379234233464,
"loss": 6.0042,
"mean_token_accuracy": 0.158383746445179,
"num_tokens": 23525298.0,
"step": 12625
},
{
"entropy": 6.275208806991577,
"epoch": 1.1153302719886966,
"grad_norm": 2.09375,
"learning_rate": 0.0004881837232735556,
"loss": 5.9137,
"mean_token_accuracy": 0.16447644382715226,
"num_tokens": 23533995.0,
"step": 12630
},
{
"entropy": 6.092858076095581,
"epoch": 1.1157718120805369,
"grad_norm": 2.046875,
"learning_rate": 0.0004881736500286286,
"loss": 5.8981,
"mean_token_accuracy": 0.16388447880744933,
"num_tokens": 23543900.0,
"step": 12635
},
{
"entropy": 6.099726247787475,
"epoch": 1.1162133521723772,
"grad_norm": 2.015625,
"learning_rate": 0.00048816357260775115,
"loss": 5.9607,
"mean_token_accuracy": 0.16245766580104828,
"num_tokens": 23553790.0,
"step": 12640
},
{
"entropy": 6.13615837097168,
"epoch": 1.1166548922642177,
"grad_norm": 3.109375,
"learning_rate": 0.0004881534910111204,
"loss": 5.9059,
"mean_token_accuracy": 0.16182511746883393,
"num_tokens": 23563473.0,
"step": 12645
},
{
"entropy": 6.224762630462647,
"epoch": 1.117096432356058,
"grad_norm": 2.375,
"learning_rate": 0.00048814340523893406,
"loss": 5.7786,
"mean_token_accuracy": 0.17411296516656877,
"num_tokens": 23572495.0,
"step": 12650
},
{
"entropy": 6.1911406993865965,
"epoch": 1.1175379724478982,
"grad_norm": 1.8125,
"learning_rate": 0.00048813331529138965,
"loss": 5.9688,
"mean_token_accuracy": 0.15303090661764146,
"num_tokens": 23582945.0,
"step": 12655
},
{
"entropy": 6.164945411682129,
"epoch": 1.1179795125397387,
"grad_norm": 2.046875,
"learning_rate": 0.0004881232211686848,
"loss": 5.9777,
"mean_token_accuracy": 0.15283008813858032,
"num_tokens": 23592370.0,
"step": 12660
},
{
"entropy": 6.1535087585449215,
"epoch": 1.118421052631579,
"grad_norm": 2.90625,
"learning_rate": 0.0004881131228710172,
"loss": 5.9136,
"mean_token_accuracy": 0.1566994957625866,
"num_tokens": 23601589.0,
"step": 12665
},
{
"entropy": 6.1772545337677,
"epoch": 1.1188625927234193,
"grad_norm": 2.828125,
"learning_rate": 0.0004881030203985848,
"loss": 5.8676,
"mean_token_accuracy": 0.1600537657737732,
"num_tokens": 23611456.0,
"step": 12670
},
{
"entropy": 6.181549501419068,
"epoch": 1.1193041328152595,
"grad_norm": 2.875,
"learning_rate": 0.00048809291375158544,
"loss": 5.8715,
"mean_token_accuracy": 0.1575395256280899,
"num_tokens": 23620362.0,
"step": 12675
},
{
"entropy": 6.1644128322601315,
"epoch": 1.1197456729071,
"grad_norm": 2.5625,
"learning_rate": 0.00048808280293021703,
"loss": 5.8978,
"mean_token_accuracy": 0.16216638088226318,
"num_tokens": 23629647.0,
"step": 12680
},
{
"entropy": 6.107468461990356,
"epoch": 1.1201872129989403,
"grad_norm": 2.609375,
"learning_rate": 0.00048807268793467774,
"loss": 5.8409,
"mean_token_accuracy": 0.16442370563745498,
"num_tokens": 23639201.0,
"step": 12685
},
{
"entropy": 6.12030987739563,
"epoch": 1.1206287530907806,
"grad_norm": 2.953125,
"learning_rate": 0.00048806256876516565,
"loss": 5.8174,
"mean_token_accuracy": 0.1660241425037384,
"num_tokens": 23648166.0,
"step": 12690
},
{
"entropy": 6.1869550228118895,
"epoch": 1.121070293182621,
"grad_norm": 3.34375,
"learning_rate": 0.00048805244542187906,
"loss": 5.98,
"mean_token_accuracy": 0.15951534807682038,
"num_tokens": 23658478.0,
"step": 12695
},
{
"entropy": 6.196708631515503,
"epoch": 1.1215118332744614,
"grad_norm": 3.6875,
"learning_rate": 0.0004880423179050161,
"loss": 5.8196,
"mean_token_accuracy": 0.1602742537856102,
"num_tokens": 23667934.0,
"step": 12700
},
{
"entropy": 6.194229459762573,
"epoch": 1.1219533733663016,
"grad_norm": 1.9765625,
"learning_rate": 0.0004880321862147755,
"loss": 5.8563,
"mean_token_accuracy": 0.16678051948547362,
"num_tokens": 23676164.0,
"step": 12705
},
{
"entropy": 6.104166698455811,
"epoch": 1.122394913458142,
"grad_norm": 2.046875,
"learning_rate": 0.00048802205035135537,
"loss": 5.9345,
"mean_token_accuracy": 0.15915541648864745,
"num_tokens": 23686223.0,
"step": 12710
},
{
"entropy": 6.084762239456177,
"epoch": 1.1228364535499824,
"grad_norm": 3.59375,
"learning_rate": 0.00048801191031495444,
"loss": 5.9385,
"mean_token_accuracy": 0.15694910734891893,
"num_tokens": 23695043.0,
"step": 12715
},
{
"entropy": 6.167425441741943,
"epoch": 1.1232779936418227,
"grad_norm": 2.59375,
"learning_rate": 0.0004880017661057714,
"loss": 5.9548,
"mean_token_accuracy": 0.15253126323223115,
"num_tokens": 23704248.0,
"step": 12720
},
{
"entropy": 6.215777111053467,
"epoch": 1.123719533733663,
"grad_norm": 2.75,
"learning_rate": 0.0004879916177240049,
"loss": 5.8486,
"mean_token_accuracy": 0.16267381012439727,
"num_tokens": 23713724.0,
"step": 12725
},
{
"entropy": 6.294356632232666,
"epoch": 1.1241610738255035,
"grad_norm": 3.125,
"learning_rate": 0.0004879814651698537,
"loss": 6.0346,
"mean_token_accuracy": 0.14794733375310898,
"num_tokens": 23723039.0,
"step": 12730
},
{
"entropy": 6.1456677436828615,
"epoch": 1.1246026139173437,
"grad_norm": 2.328125,
"learning_rate": 0.00048797130844351673,
"loss": 5.8041,
"mean_token_accuracy": 0.16152513027191162,
"num_tokens": 23732024.0,
"step": 12735
},
{
"entropy": 6.154983758926392,
"epoch": 1.125044154009184,
"grad_norm": 2.1875,
"learning_rate": 0.00048796114754519294,
"loss": 5.9416,
"mean_token_accuracy": 0.16344024538993834,
"num_tokens": 23740739.0,
"step": 12740
},
{
"entropy": 6.123211908340454,
"epoch": 1.1254856941010243,
"grad_norm": 3.125,
"learning_rate": 0.00048795098247508145,
"loss": 5.8786,
"mean_token_accuracy": 0.15742741525173187,
"num_tokens": 23750405.0,
"step": 12745
},
{
"entropy": 6.144118881225586,
"epoch": 1.1259272341928648,
"grad_norm": 2.984375,
"learning_rate": 0.0004879408132333813,
"loss": 5.8678,
"mean_token_accuracy": 0.16217302083969115,
"num_tokens": 23759318.0,
"step": 12750
},
{
"entropy": 6.160543918609619,
"epoch": 1.126368774284705,
"grad_norm": 2.078125,
"learning_rate": 0.00048793063982029166,
"loss": 5.9959,
"mean_token_accuracy": 0.15170934945344924,
"num_tokens": 23769202.0,
"step": 12755
},
{
"entropy": 6.133148145675659,
"epoch": 1.1268103143765453,
"grad_norm": 2.203125,
"learning_rate": 0.000487920462236012,
"loss": 5.8441,
"mean_token_accuracy": 0.16554126143455505,
"num_tokens": 23778478.0,
"step": 12760
},
{
"entropy": 6.167653369903564,
"epoch": 1.1272518544683856,
"grad_norm": 2.296875,
"learning_rate": 0.0004879102804807415,
"loss": 5.9324,
"mean_token_accuracy": 0.1655723124742508,
"num_tokens": 23788044.0,
"step": 12765
},
{
"entropy": 6.1207053661346436,
"epoch": 1.127693394560226,
"grad_norm": 3.625,
"learning_rate": 0.00048790009455467967,
"loss": 5.9074,
"mean_token_accuracy": 0.15762015283107758,
"num_tokens": 23796351.0,
"step": 12770
},
{
"entropy": 6.12035756111145,
"epoch": 1.1281349346520664,
"grad_norm": 2.3125,
"learning_rate": 0.0004878899044580261,
"loss": 5.9099,
"mean_token_accuracy": 0.16183796972036363,
"num_tokens": 23805553.0,
"step": 12775
},
{
"entropy": 6.119408369064331,
"epoch": 1.1285764747439067,
"grad_norm": 3.015625,
"learning_rate": 0.00048787971019098044,
"loss": 5.772,
"mean_token_accuracy": 0.16734058558940887,
"num_tokens": 23813742.0,
"step": 12780
},
{
"entropy": 6.096089649200439,
"epoch": 1.1290180148357472,
"grad_norm": 2.5625,
"learning_rate": 0.0004878695117537423,
"loss": 5.8698,
"mean_token_accuracy": 0.16309196650981903,
"num_tokens": 23822135.0,
"step": 12785
},
{
"entropy": 6.148795318603516,
"epoch": 1.1294595549275874,
"grad_norm": 2.4375,
"learning_rate": 0.0004878593091465114,
"loss": 5.9246,
"mean_token_accuracy": 0.16338893473148347,
"num_tokens": 23832021.0,
"step": 12790
},
{
"entropy": 6.152970027923584,
"epoch": 1.1299010950194277,
"grad_norm": 2.75,
"learning_rate": 0.0004878491023694877,
"loss": 5.8797,
"mean_token_accuracy": 0.16301770210266114,
"num_tokens": 23842432.0,
"step": 12795
},
{
"entropy": 6.17039008140564,
"epoch": 1.1303426351112682,
"grad_norm": 6.59375,
"learning_rate": 0.0004878388914228713,
"loss": 5.9525,
"mean_token_accuracy": 0.1557425945997238,
"num_tokens": 23852172.0,
"step": 12800
},
{
"entropy": 6.0913502216339115,
"epoch": 1.1307841752031085,
"grad_norm": 3.421875,
"learning_rate": 0.0004878286763068619,
"loss": 5.815,
"mean_token_accuracy": 0.17447811514139175,
"num_tokens": 23861178.0,
"step": 12805
},
{
"entropy": 6.155264234542846,
"epoch": 1.1312257152949488,
"grad_norm": 2.65625,
"learning_rate": 0.0004878184570216598,
"loss": 5.9345,
"mean_token_accuracy": 0.15353984832763673,
"num_tokens": 23869998.0,
"step": 12810
},
{
"entropy": 6.173930311203003,
"epoch": 1.131667255386789,
"grad_norm": 3.859375,
"learning_rate": 0.00048780823356746523,
"loss": 5.8542,
"mean_token_accuracy": 0.163069848716259,
"num_tokens": 23880404.0,
"step": 12815
},
{
"entropy": 6.094505453109742,
"epoch": 1.1321087954786295,
"grad_norm": 3.734375,
"learning_rate": 0.0004877980059444784,
"loss": 5.8116,
"mean_token_accuracy": 0.16356674283742906,
"num_tokens": 23889643.0,
"step": 12820
},
{
"entropy": 6.15198450088501,
"epoch": 1.1325503355704698,
"grad_norm": 2.390625,
"learning_rate": 0.0004877877741528996,
"loss": 5.8856,
"mean_token_accuracy": 0.16310336589813232,
"num_tokens": 23899264.0,
"step": 12825
},
{
"entropy": 6.209881258010864,
"epoch": 1.13299187566231,
"grad_norm": 3.515625,
"learning_rate": 0.0004877775381929294,
"loss": 5.9324,
"mean_token_accuracy": 0.15963074415922165,
"num_tokens": 23908685.0,
"step": 12830
},
{
"entropy": 6.14743971824646,
"epoch": 1.1334334157541504,
"grad_norm": 2.75,
"learning_rate": 0.0004877672980647682,
"loss": 5.8983,
"mean_token_accuracy": 0.16176777482032775,
"num_tokens": 23917838.0,
"step": 12835
},
{
"entropy": 6.15907301902771,
"epoch": 1.1338749558459909,
"grad_norm": 3.21875,
"learning_rate": 0.00048775705376861663,
"loss": 5.8897,
"mean_token_accuracy": 0.16470141261816024,
"num_tokens": 23927498.0,
"step": 12840
},
{
"entropy": 6.183665084838867,
"epoch": 1.1343164959378311,
"grad_norm": 3.875,
"learning_rate": 0.0004877468053046753,
"loss": 5.9272,
"mean_token_accuracy": 0.16985414028167725,
"num_tokens": 23936205.0,
"step": 12845
},
{
"entropy": 6.099576854705811,
"epoch": 1.1347580360296714,
"grad_norm": 1.859375,
"learning_rate": 0.00048773655267314516,
"loss": 5.8285,
"mean_token_accuracy": 0.16590992063283921,
"num_tokens": 23945897.0,
"step": 12850
},
{
"entropy": 6.1220887184143065,
"epoch": 1.135199576121512,
"grad_norm": 2.65625,
"learning_rate": 0.0004877262958742268,
"loss": 5.8621,
"mean_token_accuracy": 0.16151627004146576,
"num_tokens": 23954873.0,
"step": 12855
},
{
"entropy": 6.109217357635498,
"epoch": 1.1356411162133522,
"grad_norm": 2.234375,
"learning_rate": 0.00048771603490812144,
"loss": 5.9596,
"mean_token_accuracy": 0.158792844414711,
"num_tokens": 23964631.0,
"step": 12860
},
{
"entropy": 6.1161542415618895,
"epoch": 1.1360826563051925,
"grad_norm": 4.6875,
"learning_rate": 0.0004877057697750299,
"loss": 5.8435,
"mean_token_accuracy": 0.15990230739116668,
"num_tokens": 23973935.0,
"step": 12865
},
{
"entropy": 6.183536529541016,
"epoch": 1.136524196397033,
"grad_norm": 3.140625,
"learning_rate": 0.0004876955004751533,
"loss": 5.966,
"mean_token_accuracy": 0.16028932780027388,
"num_tokens": 23984340.0,
"step": 12870
},
{
"entropy": 6.222923946380615,
"epoch": 1.1369657364888732,
"grad_norm": 3.15625,
"learning_rate": 0.00048768522700869284,
"loss": 6.0266,
"mean_token_accuracy": 0.1570996031165123,
"num_tokens": 23994387.0,
"step": 12875
},
{
"entropy": 6.143067073822022,
"epoch": 1.1374072765807135,
"grad_norm": 2.875,
"learning_rate": 0.00048767494937584964,
"loss": 5.8404,
"mean_token_accuracy": 0.16306250542402267,
"num_tokens": 24003391.0,
"step": 12880
},
{
"entropy": 6.129344463348389,
"epoch": 1.1378488166725538,
"grad_norm": 3.265625,
"learning_rate": 0.00048766466757682527,
"loss": 5.8086,
"mean_token_accuracy": 0.16759908497333526,
"num_tokens": 24013501.0,
"step": 12885
},
{
"entropy": 6.069127798080444,
"epoch": 1.1382903567643943,
"grad_norm": 3.46875,
"learning_rate": 0.0004876543816118209,
"loss": 5.7958,
"mean_token_accuracy": 0.16822932958602904,
"num_tokens": 24022675.0,
"step": 12890
},
{
"entropy": 6.186778879165649,
"epoch": 1.1387318968562345,
"grad_norm": 2.578125,
"learning_rate": 0.00048764409148103815,
"loss": 5.9695,
"mean_token_accuracy": 0.15576943457126619,
"num_tokens": 24032542.0,
"step": 12895
},
{
"entropy": 6.137541341781616,
"epoch": 1.1391734369480748,
"grad_norm": 2.734375,
"learning_rate": 0.0004876337971846787,
"loss": 5.8374,
"mean_token_accuracy": 0.1657298371195793,
"num_tokens": 24041342.0,
"step": 12900
},
{
"entropy": 6.09092960357666,
"epoch": 1.139614977039915,
"grad_norm": 2.328125,
"learning_rate": 0.000487623498722944,
"loss": 5.9004,
"mean_token_accuracy": 0.16448237001895905,
"num_tokens": 24051429.0,
"step": 12905
},
{
"entropy": 6.138212728500366,
"epoch": 1.1400565171317556,
"grad_norm": 4.71875,
"learning_rate": 0.0004876131960960358,
"loss": 5.8872,
"mean_token_accuracy": 0.1662304326891899,
"num_tokens": 24061074.0,
"step": 12910
},
{
"entropy": 6.142291688919068,
"epoch": 1.1404980572235959,
"grad_norm": 2.796875,
"learning_rate": 0.00048760288930415615,
"loss": 5.8849,
"mean_token_accuracy": 0.16029668599367142,
"num_tokens": 24069622.0,
"step": 12915
},
{
"entropy": 6.144371271133423,
"epoch": 1.1409395973154361,
"grad_norm": 3.203125,
"learning_rate": 0.00048759257834750673,
"loss": 5.9017,
"mean_token_accuracy": 0.16326785534620286,
"num_tokens": 24078393.0,
"step": 12920
},
{
"entropy": 6.164349555969238,
"epoch": 1.1413811374072766,
"grad_norm": 3.890625,
"learning_rate": 0.0004875822632262897,
"loss": 5.9,
"mean_token_accuracy": 0.16358201280236245,
"num_tokens": 24089157.0,
"step": 12925
},
{
"entropy": 6.170363235473633,
"epoch": 1.141822677499117,
"grad_norm": 2.46875,
"learning_rate": 0.00048757194394070697,
"loss": 5.8232,
"mean_token_accuracy": 0.16340537071228028,
"num_tokens": 24098022.0,
"step": 12930
},
{
"entropy": 6.030244541168213,
"epoch": 1.1422642175909572,
"grad_norm": 2.109375,
"learning_rate": 0.00048756162049096077,
"loss": 5.8394,
"mean_token_accuracy": 0.1633405104279518,
"num_tokens": 24107629.0,
"step": 12935
},
{
"entropy": 6.112723302841187,
"epoch": 1.1427057576827977,
"grad_norm": 2.203125,
"learning_rate": 0.00048755129287725334,
"loss": 5.8926,
"mean_token_accuracy": 0.1636682391166687,
"num_tokens": 24116903.0,
"step": 12940
},
{
"entropy": 6.102148485183716,
"epoch": 1.143147297774638,
"grad_norm": 2.078125,
"learning_rate": 0.00048754096109978684,
"loss": 5.8239,
"mean_token_accuracy": 0.16100425720214845,
"num_tokens": 24126433.0,
"step": 12945
},
{
"entropy": 6.221063709259033,
"epoch": 1.1435888378664782,
"grad_norm": 4.125,
"learning_rate": 0.0004875306251587639,
"loss": 6.0374,
"mean_token_accuracy": 0.15413205027580262,
"num_tokens": 24136603.0,
"step": 12950
},
{
"entropy": 6.194855356216431,
"epoch": 1.1440303779583185,
"grad_norm": 3.4375,
"learning_rate": 0.0004875202850543869,
"loss": 5.8935,
"mean_token_accuracy": 0.16573748141527175,
"num_tokens": 24145656.0,
"step": 12955
},
{
"entropy": 6.095202112197876,
"epoch": 1.144471918050159,
"grad_norm": 2.015625,
"learning_rate": 0.00048750994078685837,
"loss": 5.9358,
"mean_token_accuracy": 0.15601086169481276,
"num_tokens": 24155044.0,
"step": 12960
},
{
"entropy": 6.085171222686768,
"epoch": 1.1449134581419993,
"grad_norm": 2.6875,
"learning_rate": 0.0004874995923563809,
"loss": 5.8973,
"mean_token_accuracy": 0.16120244562625885,
"num_tokens": 24163987.0,
"step": 12965
},
{
"entropy": 6.136837005615234,
"epoch": 1.1453549982338396,
"grad_norm": 3.53125,
"learning_rate": 0.0004874892397631573,
"loss": 5.8472,
"mean_token_accuracy": 0.16047741323709488,
"num_tokens": 24173542.0,
"step": 12970
},
{
"entropy": 6.093086624145508,
"epoch": 1.1457965383256798,
"grad_norm": 1.890625,
"learning_rate": 0.0004874788830073904,
"loss": 5.8401,
"mean_token_accuracy": 0.15839377641677857,
"num_tokens": 24182785.0,
"step": 12975
},
{
"entropy": 6.100064849853515,
"epoch": 1.1462380784175203,
"grad_norm": 2.125,
"learning_rate": 0.000487468522089283,
"loss": 5.9009,
"mean_token_accuracy": 0.16308726817369462,
"num_tokens": 24193477.0,
"step": 12980
},
{
"entropy": 6.116935348510742,
"epoch": 1.1466796185093606,
"grad_norm": 1.984375,
"learning_rate": 0.00048745815700903806,
"loss": 5.8749,
"mean_token_accuracy": 0.16314334124326707,
"num_tokens": 24202289.0,
"step": 12985
},
{
"entropy": 6.0137475490570065,
"epoch": 1.147121158601201,
"grad_norm": 1.9375,
"learning_rate": 0.00048744778776685865,
"loss": 5.7999,
"mean_token_accuracy": 0.17294200956821443,
"num_tokens": 24212199.0,
"step": 12990
},
{
"entropy": 6.16967921257019,
"epoch": 1.1475626986930414,
"grad_norm": 2.4375,
"learning_rate": 0.00048743741436294794,
"loss": 5.913,
"mean_token_accuracy": 0.16691390722990035,
"num_tokens": 24220984.0,
"step": 12995
},
{
"entropy": 6.139700698852539,
"epoch": 1.1480042387848817,
"grad_norm": 3.8125,
"learning_rate": 0.0004874270367975091,
"loss": 5.883,
"mean_token_accuracy": 0.16363299190998076,
"num_tokens": 24229599.0,
"step": 13000
},
{
"entropy": 6.118462085723877,
"epoch": 1.148445778876722,
"grad_norm": 1.9140625,
"learning_rate": 0.0004874166550707454,
"loss": 5.93,
"mean_token_accuracy": 0.15817446112632752,
"num_tokens": 24238721.0,
"step": 13005
},
{
"entropy": 6.183041906356811,
"epoch": 1.1488873189685624,
"grad_norm": 1.9453125,
"learning_rate": 0.00048740626918286026,
"loss": 5.9212,
"mean_token_accuracy": 0.15708893910050392,
"num_tokens": 24248431.0,
"step": 13010
},
{
"entropy": 6.193394947052002,
"epoch": 1.1493288590604027,
"grad_norm": 2.859375,
"learning_rate": 0.00048739587913405706,
"loss": 5.8764,
"mean_token_accuracy": 0.16208105385303498,
"num_tokens": 24257770.0,
"step": 13015
},
{
"entropy": 6.156811189651489,
"epoch": 1.149770399152243,
"grad_norm": 1.9765625,
"learning_rate": 0.00048738548492453944,
"loss": 5.8704,
"mean_token_accuracy": 0.16122345328330995,
"num_tokens": 24266402.0,
"step": 13020
},
{
"entropy": 6.0974891662597654,
"epoch": 1.1502119392440833,
"grad_norm": 2.3125,
"learning_rate": 0.0004873750865545109,
"loss": 5.8682,
"mean_token_accuracy": 0.16215978413820267,
"num_tokens": 24275164.0,
"step": 13025
},
{
"entropy": 6.144317865371704,
"epoch": 1.1506534793359238,
"grad_norm": 2.78125,
"learning_rate": 0.00048736468402417525,
"loss": 5.9523,
"mean_token_accuracy": 0.15686460584402084,
"num_tokens": 24285650.0,
"step": 13030
},
{
"entropy": 6.154935693740844,
"epoch": 1.151095019427764,
"grad_norm": 2.0,
"learning_rate": 0.00048735427733373617,
"loss": 5.8981,
"mean_token_accuracy": 0.15737394541501998,
"num_tokens": 24294745.0,
"step": 13035
},
{
"entropy": 6.174745750427246,
"epoch": 1.1515365595196043,
"grad_norm": 2.140625,
"learning_rate": 0.00048734386648339767,
"loss": 5.8746,
"mean_token_accuracy": 0.16793839633464813,
"num_tokens": 24303837.0,
"step": 13040
},
{
"entropy": 6.064759969711304,
"epoch": 1.1519780996114446,
"grad_norm": 1.9921875,
"learning_rate": 0.0004873334514733634,
"loss": 5.932,
"mean_token_accuracy": 0.16262244284152985,
"num_tokens": 24313417.0,
"step": 13045
},
{
"entropy": 6.177665185928345,
"epoch": 1.152419639703285,
"grad_norm": 2.0,
"learning_rate": 0.0004873230323038378,
"loss": 5.8673,
"mean_token_accuracy": 0.1655505880713463,
"num_tokens": 24322439.0,
"step": 13050
},
{
"entropy": 6.173502779006958,
"epoch": 1.1528611797951254,
"grad_norm": 2.40625,
"learning_rate": 0.0004873126089750246,
"loss": 5.931,
"mean_token_accuracy": 0.16151737719774245,
"num_tokens": 24332509.0,
"step": 13055
},
{
"entropy": 6.084061908721924,
"epoch": 1.1533027198869656,
"grad_norm": 1.625,
"learning_rate": 0.0004873021814871282,
"loss": 5.9385,
"mean_token_accuracy": 0.15243774354457856,
"num_tokens": 24342252.0,
"step": 13060
},
{
"entropy": 6.172393560409546,
"epoch": 1.1537442599788061,
"grad_norm": 1.953125,
"learning_rate": 0.0004872917498403528,
"loss": 5.9429,
"mean_token_accuracy": 0.16728342473506927,
"num_tokens": 24352459.0,
"step": 13065
},
{
"entropy": 6.1993366241455075,
"epoch": 1.1541858000706464,
"grad_norm": 2.703125,
"learning_rate": 0.0004872813140349028,
"loss": 5.8325,
"mean_token_accuracy": 0.16273785680532454,
"num_tokens": 24361788.0,
"step": 13070
},
{
"entropy": 6.107053184509278,
"epoch": 1.1546273401624867,
"grad_norm": 2.359375,
"learning_rate": 0.0004872708740709825,
"loss": 5.925,
"mean_token_accuracy": 0.1579492062330246,
"num_tokens": 24372117.0,
"step": 13075
},
{
"entropy": 6.0634486198425295,
"epoch": 1.1550688802543272,
"grad_norm": 3.71875,
"learning_rate": 0.00048726042994879656,
"loss": 5.8671,
"mean_token_accuracy": 0.16310511529445648,
"num_tokens": 24380833.0,
"step": 13080
},
{
"entropy": 6.153524017333984,
"epoch": 1.1555104203461675,
"grad_norm": 3.890625,
"learning_rate": 0.00048724998166854944,
"loss": 5.9254,
"mean_token_accuracy": 0.16716205924749375,
"num_tokens": 24390258.0,
"step": 13085
},
{
"entropy": 6.176580429077148,
"epoch": 1.1559519604380077,
"grad_norm": 2.84375,
"learning_rate": 0.000487239529230446,
"loss": 5.9554,
"mean_token_accuracy": 0.1586645856499672,
"num_tokens": 24399359.0,
"step": 13090
},
{
"entropy": 6.120433664321899,
"epoch": 1.156393500529848,
"grad_norm": 2.5625,
"learning_rate": 0.00048722907263469084,
"loss": 5.928,
"mean_token_accuracy": 0.16336547285318376,
"num_tokens": 24408012.0,
"step": 13095
},
{
"entropy": 6.142831659317016,
"epoch": 1.1568350406216885,
"grad_norm": 2.40625,
"learning_rate": 0.0004872186118814889,
"loss": 5.9038,
"mean_token_accuracy": 0.15538060516119004,
"num_tokens": 24416804.0,
"step": 13100
},
{
"entropy": 6.054402017593384,
"epoch": 1.1572765807135288,
"grad_norm": 2.3125,
"learning_rate": 0.00048720814697104497,
"loss": 5.7087,
"mean_token_accuracy": 0.17629504054784775,
"num_tokens": 24425401.0,
"step": 13105
},
{
"entropy": 5.988751316070557,
"epoch": 1.157718120805369,
"grad_norm": 2.125,
"learning_rate": 0.00048719767790356415,
"loss": 5.7838,
"mean_token_accuracy": 0.17033410370349883,
"num_tokens": 24434473.0,
"step": 13110
},
{
"entropy": 6.188123989105224,
"epoch": 1.1581596608972093,
"grad_norm": 2.015625,
"learning_rate": 0.00048718720467925156,
"loss": 6.0036,
"mean_token_accuracy": 0.1489499181509018,
"num_tokens": 24443154.0,
"step": 13115
},
{
"entropy": 6.155460596084595,
"epoch": 1.1586012009890498,
"grad_norm": 1.8671875,
"learning_rate": 0.0004871767272983122,
"loss": 5.8406,
"mean_token_accuracy": 0.1711515560746193,
"num_tokens": 24451308.0,
"step": 13120
},
{
"entropy": 6.092249774932862,
"epoch": 1.1590427410808901,
"grad_norm": 2.15625,
"learning_rate": 0.0004871662457609515,
"loss": 5.8601,
"mean_token_accuracy": 0.16684121116995812,
"num_tokens": 24459997.0,
"step": 13125
},
{
"entropy": 6.121378326416016,
"epoch": 1.1594842811727304,
"grad_norm": 2.078125,
"learning_rate": 0.0004871557600673747,
"loss": 5.8931,
"mean_token_accuracy": 0.15878385305404663,
"num_tokens": 24469448.0,
"step": 13130
},
{
"entropy": 6.119466495513916,
"epoch": 1.1599258212645709,
"grad_norm": 2.15625,
"learning_rate": 0.00048714527021778714,
"loss": 5.863,
"mean_token_accuracy": 0.16701558977365494,
"num_tokens": 24478304.0,
"step": 13135
},
{
"entropy": 6.060800838470459,
"epoch": 1.1603673613564112,
"grad_norm": 2.1875,
"learning_rate": 0.0004871347762123945,
"loss": 5.7674,
"mean_token_accuracy": 0.17496354281902313,
"num_tokens": 24487300.0,
"step": 13140
},
{
"entropy": 6.039560270309448,
"epoch": 1.1608089014482514,
"grad_norm": 2.296875,
"learning_rate": 0.00048712427805140224,
"loss": 5.8391,
"mean_token_accuracy": 0.16794351041316985,
"num_tokens": 24495893.0,
"step": 13145
},
{
"entropy": 6.099201488494873,
"epoch": 1.161250441540092,
"grad_norm": 2.40625,
"learning_rate": 0.0004871137757350159,
"loss": 5.8214,
"mean_token_accuracy": 0.16588428914546965,
"num_tokens": 24504603.0,
"step": 13150
},
{
"entropy": 6.108782720565796,
"epoch": 1.1616919816319322,
"grad_norm": 2.953125,
"learning_rate": 0.00048710326926344153,
"loss": 5.8286,
"mean_token_accuracy": 0.16394665762782096,
"num_tokens": 24513148.0,
"step": 13155
},
{
"entropy": 6.210946130752563,
"epoch": 1.1621335217237725,
"grad_norm": 2.296875,
"learning_rate": 0.00048709275863688455,
"loss": 5.9486,
"mean_token_accuracy": 0.15133224576711654,
"num_tokens": 24524006.0,
"step": 13160
},
{
"entropy": 6.143212556838989,
"epoch": 1.1625750618156128,
"grad_norm": 2.421875,
"learning_rate": 0.00048708224385555116,
"loss": 5.8112,
"mean_token_accuracy": 0.17300854176282882,
"num_tokens": 24532468.0,
"step": 13165
},
{
"entropy": 6.117675065994263,
"epoch": 1.1630166019074533,
"grad_norm": 2.28125,
"learning_rate": 0.0004870717249196472,
"loss": 5.8901,
"mean_token_accuracy": 0.15895298719406128,
"num_tokens": 24540887.0,
"step": 13170
},
{
"entropy": 6.127656888961792,
"epoch": 1.1634581419992935,
"grad_norm": 2.671875,
"learning_rate": 0.0004870612018293788,
"loss": 5.8292,
"mean_token_accuracy": 0.15963590890169144,
"num_tokens": 24550565.0,
"step": 13175
},
{
"entropy": 6.164292573928833,
"epoch": 1.1638996820911338,
"grad_norm": 2.46875,
"learning_rate": 0.000487050674584952,
"loss": 5.8345,
"mean_token_accuracy": 0.16657477468252183,
"num_tokens": 24560283.0,
"step": 13180
},
{
"entropy": 6.085217142105103,
"epoch": 1.164341222182974,
"grad_norm": 2.828125,
"learning_rate": 0.000487040143186573,
"loss": 5.7868,
"mean_token_accuracy": 0.16903859823942186,
"num_tokens": 24569527.0,
"step": 13185
},
{
"entropy": 6.095186805725097,
"epoch": 1.1647827622748146,
"grad_norm": 2.15625,
"learning_rate": 0.00048702960763444833,
"loss": 5.8656,
"mean_token_accuracy": 0.16582123339176177,
"num_tokens": 24578702.0,
"step": 13190
},
{
"entropy": 6.12335786819458,
"epoch": 1.1652243023666549,
"grad_norm": 1.84375,
"learning_rate": 0.0004870190679287842,
"loss": 5.8416,
"mean_token_accuracy": 0.16538846045732497,
"num_tokens": 24588252.0,
"step": 13195
},
{
"entropy": 6.112222290039062,
"epoch": 1.1656658424584951,
"grad_norm": 2.71875,
"learning_rate": 0.0004870085240697871,
"loss": 5.8359,
"mean_token_accuracy": 0.1661168396472931,
"num_tokens": 24596989.0,
"step": 13200
},
{
"entropy": 6.11566653251648,
"epoch": 1.1661073825503356,
"grad_norm": 2.75,
"learning_rate": 0.00048699797605766365,
"loss": 5.9506,
"mean_token_accuracy": 0.15702025592327118,
"num_tokens": 24607051.0,
"step": 13205
},
{
"entropy": 6.198679256439209,
"epoch": 1.166548922642176,
"grad_norm": 2.296875,
"learning_rate": 0.00048698742389262036,
"loss": 5.9453,
"mean_token_accuracy": 0.15136709809303284,
"num_tokens": 24616561.0,
"step": 13210
},
{
"entropy": 6.136082124710083,
"epoch": 1.1669904627340162,
"grad_norm": 3.03125,
"learning_rate": 0.00048697686757486397,
"loss": 5.9016,
"mean_token_accuracy": 0.16254883259534836,
"num_tokens": 24625942.0,
"step": 13215
},
{
"entropy": 6.131124639511109,
"epoch": 1.1674320028258567,
"grad_norm": 3.390625,
"learning_rate": 0.0004869663071046013,
"loss": 5.8833,
"mean_token_accuracy": 0.152358091622591,
"num_tokens": 24635646.0,
"step": 13220
},
{
"entropy": 6.057149076461792,
"epoch": 1.167873542917697,
"grad_norm": 2.71875,
"learning_rate": 0.00048695574248203935,
"loss": 5.8906,
"mean_token_accuracy": 0.1634119614958763,
"num_tokens": 24645147.0,
"step": 13225
},
{
"entropy": 6.126231908798218,
"epoch": 1.1683150830095372,
"grad_norm": 2.8125,
"learning_rate": 0.0004869451737073848,
"loss": 5.8823,
"mean_token_accuracy": 0.1632858231663704,
"num_tokens": 24654796.0,
"step": 13230
},
{
"entropy": 6.11257529258728,
"epoch": 1.1687566231013775,
"grad_norm": 2.484375,
"learning_rate": 0.0004869346007808449,
"loss": 5.8273,
"mean_token_accuracy": 0.1655263900756836,
"num_tokens": 24663765.0,
"step": 13235
},
{
"entropy": 6.1794780731201175,
"epoch": 1.169198163193218,
"grad_norm": 3.25,
"learning_rate": 0.00048692402370262674,
"loss": 5.936,
"mean_token_accuracy": 0.15592946261167526,
"num_tokens": 24673758.0,
"step": 13240
},
{
"entropy": 6.162271451950073,
"epoch": 1.1696397032850583,
"grad_norm": 4.0,
"learning_rate": 0.00048691344247293747,
"loss": 5.8093,
"mean_token_accuracy": 0.1623801752924919,
"num_tokens": 24682751.0,
"step": 13245
},
{
"entropy": 6.119326210021972,
"epoch": 1.1700812433768986,
"grad_norm": 2.890625,
"learning_rate": 0.00048690285709198435,
"loss": 5.9032,
"mean_token_accuracy": 0.16337242126464843,
"num_tokens": 24691375.0,
"step": 13250
},
{
"entropy": 6.088254737854004,
"epoch": 1.1705227834687388,
"grad_norm": 2.53125,
"learning_rate": 0.0004868922675599747,
"loss": 5.8734,
"mean_token_accuracy": 0.1708006292581558,
"num_tokens": 24699852.0,
"step": 13255
},
{
"entropy": 6.01705904006958,
"epoch": 1.1709643235605793,
"grad_norm": 3.0,
"learning_rate": 0.0004868816738771162,
"loss": 5.755,
"mean_token_accuracy": 0.16423008143901824,
"num_tokens": 24708857.0,
"step": 13260
},
{
"entropy": 6.097516250610352,
"epoch": 1.1714058636524196,
"grad_norm": 2.296875,
"learning_rate": 0.0004868710760436161,
"loss": 5.9496,
"mean_token_accuracy": 0.15879180058836936,
"num_tokens": 24718262.0,
"step": 13265
},
{
"entropy": 6.218402624130249,
"epoch": 1.1718474037442599,
"grad_norm": 2.15625,
"learning_rate": 0.00048686047405968217,
"loss": 5.9,
"mean_token_accuracy": 0.16617278456687928,
"num_tokens": 24727458.0,
"step": 13270
},
{
"entropy": 6.252496910095215,
"epoch": 1.1722889438361004,
"grad_norm": 2.484375,
"learning_rate": 0.00048684986792552206,
"loss": 5.974,
"mean_token_accuracy": 0.15579350143671036,
"num_tokens": 24737297.0,
"step": 13275
},
{
"entropy": 6.142344427108765,
"epoch": 1.1727304839279407,
"grad_norm": 4.125,
"learning_rate": 0.00048683925764134346,
"loss": 5.8493,
"mean_token_accuracy": 0.1717861697077751,
"num_tokens": 24746939.0,
"step": 13280
},
{
"entropy": 6.1499552726745605,
"epoch": 1.173172024019781,
"grad_norm": 2.078125,
"learning_rate": 0.0004868286432073543,
"loss": 6.0001,
"mean_token_accuracy": 0.16040579229593277,
"num_tokens": 24756907.0,
"step": 13285
},
{
"entropy": 6.122000885009766,
"epoch": 1.1736135641116214,
"grad_norm": 2.359375,
"learning_rate": 0.00048681802462376253,
"loss": 5.7995,
"mean_token_accuracy": 0.16485823392868043,
"num_tokens": 24765997.0,
"step": 13290
},
{
"entropy": 6.208702802658081,
"epoch": 1.1740551042034617,
"grad_norm": 2.59375,
"learning_rate": 0.00048680740189077605,
"loss": 5.8748,
"mean_token_accuracy": 0.1535380408167839,
"num_tokens": 24775090.0,
"step": 13295
},
{
"entropy": 6.023527193069458,
"epoch": 1.174496644295302,
"grad_norm": 2.4375,
"learning_rate": 0.00048679677500860314,
"loss": 5.8349,
"mean_token_accuracy": 0.15840400755405426,
"num_tokens": 24784709.0,
"step": 13300
},
{
"entropy": 6.107593011856079,
"epoch": 1.1749381843871423,
"grad_norm": 2.640625,
"learning_rate": 0.0004867861439774519,
"loss": 5.8781,
"mean_token_accuracy": 0.16532609909772872,
"num_tokens": 24794473.0,
"step": 13305
},
{
"entropy": 6.209054803848266,
"epoch": 1.1753797244789828,
"grad_norm": 2.765625,
"learning_rate": 0.00048677550879753037,
"loss": 5.9971,
"mean_token_accuracy": 0.1554428368806839,
"num_tokens": 24804718.0,
"step": 13310
},
{
"entropy": 6.20349531173706,
"epoch": 1.175821264570823,
"grad_norm": 3.46875,
"learning_rate": 0.00048676486946904715,
"loss": 5.8866,
"mean_token_accuracy": 0.15654226690530776,
"num_tokens": 24813632.0,
"step": 13315
},
{
"entropy": 6.095090770721436,
"epoch": 1.1762628046626633,
"grad_norm": 2.953125,
"learning_rate": 0.0004867542259922105,
"loss": 5.8093,
"mean_token_accuracy": 0.17145688831806183,
"num_tokens": 24823395.0,
"step": 13320
},
{
"entropy": 6.1567628383636475,
"epoch": 1.1767043447545038,
"grad_norm": 2.578125,
"learning_rate": 0.0004867435783672291,
"loss": 5.9211,
"mean_token_accuracy": 0.15835109055042268,
"num_tokens": 24832869.0,
"step": 13325
},
{
"entropy": 6.190812063217163,
"epoch": 1.177145884846344,
"grad_norm": 2.828125,
"learning_rate": 0.0004867329265943114,
"loss": 5.8735,
"mean_token_accuracy": 0.16313667446374894,
"num_tokens": 24841706.0,
"step": 13330
},
{
"entropy": 6.205429410934448,
"epoch": 1.1775874249381844,
"grad_norm": 2.96875,
"learning_rate": 0.0004867222706736661,
"loss": 5.884,
"mean_token_accuracy": 0.16289175003767015,
"num_tokens": 24851149.0,
"step": 13335
},
{
"entropy": 6.1487870693206785,
"epoch": 1.1780289650300246,
"grad_norm": 2.09375,
"learning_rate": 0.0004867116106055019,
"loss": 5.8517,
"mean_token_accuracy": 0.1666541263461113,
"num_tokens": 24860002.0,
"step": 13340
},
{
"entropy": 6.072990608215332,
"epoch": 1.1784705051218651,
"grad_norm": 3.0,
"learning_rate": 0.00048670094639002766,
"loss": 5.9292,
"mean_token_accuracy": 0.16073703914880752,
"num_tokens": 24869457.0,
"step": 13345
},
{
"entropy": 6.048181247711182,
"epoch": 1.1789120452137054,
"grad_norm": 2.6875,
"learning_rate": 0.0004866902780274523,
"loss": 5.8703,
"mean_token_accuracy": 0.16399503946304322,
"num_tokens": 24879527.0,
"step": 13350
},
{
"entropy": 6.144576787948608,
"epoch": 1.1793535853055457,
"grad_norm": 2.90625,
"learning_rate": 0.0004866796055179847,
"loss": 5.8859,
"mean_token_accuracy": 0.1612555667757988,
"num_tokens": 24889401.0,
"step": 13355
},
{
"entropy": 6.163530492782593,
"epoch": 1.1797951253973862,
"grad_norm": 2.8125,
"learning_rate": 0.0004866689288618342,
"loss": 5.9079,
"mean_token_accuracy": 0.16237395405769348,
"num_tokens": 24897911.0,
"step": 13360
},
{
"entropy": 6.0734354019165036,
"epoch": 1.1802366654892265,
"grad_norm": 1.96875,
"learning_rate": 0.0004866582480592096,
"loss": 5.8554,
"mean_token_accuracy": 0.1715386390686035,
"num_tokens": 24906969.0,
"step": 13365
},
{
"entropy": 6.1687963008880615,
"epoch": 1.1806782055810667,
"grad_norm": 2.171875,
"learning_rate": 0.0004866475631103203,
"loss": 5.8818,
"mean_token_accuracy": 0.1618434950709343,
"num_tokens": 24915713.0,
"step": 13370
},
{
"entropy": 6.218716621398926,
"epoch": 1.181119745672907,
"grad_norm": 2.0625,
"learning_rate": 0.00048663687401537573,
"loss": 5.9161,
"mean_token_accuracy": 0.15710946470499038,
"num_tokens": 24925484.0,
"step": 13375
},
{
"entropy": 6.117330121994018,
"epoch": 1.1815612857647475,
"grad_norm": 3.875,
"learning_rate": 0.00048662618077458507,
"loss": 5.9014,
"mean_token_accuracy": 0.16827405393123626,
"num_tokens": 24934751.0,
"step": 13380
},
{
"entropy": 6.090973138809204,
"epoch": 1.1820028258565878,
"grad_norm": 4.5,
"learning_rate": 0.0004866154833881579,
"loss": 5.9569,
"mean_token_accuracy": 0.15975226163864137,
"num_tokens": 24945059.0,
"step": 13385
},
{
"entropy": 6.141939115524292,
"epoch": 1.182444365948428,
"grad_norm": 2.3125,
"learning_rate": 0.0004866047818563038,
"loss": 5.9086,
"mean_token_accuracy": 0.16349183917045593,
"num_tokens": 24954678.0,
"step": 13390
},
{
"entropy": 6.135137510299683,
"epoch": 1.1828859060402686,
"grad_norm": 2.71875,
"learning_rate": 0.0004865940761792323,
"loss": 5.8989,
"mean_token_accuracy": 0.15451244115829468,
"num_tokens": 24964093.0,
"step": 13395
},
{
"entropy": 6.237664985656738,
"epoch": 1.1833274461321088,
"grad_norm": 2.09375,
"learning_rate": 0.0004865833663571533,
"loss": 5.8407,
"mean_token_accuracy": 0.16761422753334046,
"num_tokens": 24973903.0,
"step": 13400
},
{
"entropy": 6.106436729431152,
"epoch": 1.183768986223949,
"grad_norm": 2.25,
"learning_rate": 0.00048657265239027635,
"loss": 5.8317,
"mean_token_accuracy": 0.16317994594573976,
"num_tokens": 24982458.0,
"step": 13405
},
{
"entropy": 6.058584594726563,
"epoch": 1.1842105263157894,
"grad_norm": 2.90625,
"learning_rate": 0.0004865619342788116,
"loss": 5.9076,
"mean_token_accuracy": 0.15985368341207504,
"num_tokens": 24992233.0,
"step": 13410
},
{
"entropy": 6.154675912857056,
"epoch": 1.1846520664076299,
"grad_norm": 3.578125,
"learning_rate": 0.00048655121202296873,
"loss": 5.8403,
"mean_token_accuracy": 0.16040916591882706,
"num_tokens": 25001855.0,
"step": 13415
},
{
"entropy": 6.124318075180054,
"epoch": 1.1850936064994702,
"grad_norm": 3.921875,
"learning_rate": 0.00048654048562295807,
"loss": 5.7522,
"mean_token_accuracy": 0.1688428193330765,
"num_tokens": 25010950.0,
"step": 13420
},
{
"entropy": 6.121059322357178,
"epoch": 1.1855351465913104,
"grad_norm": 2.640625,
"learning_rate": 0.0004865297550789895,
"loss": 5.9349,
"mean_token_accuracy": 0.15866249203681945,
"num_tokens": 25020816.0,
"step": 13425
},
{
"entropy": 6.174627828598022,
"epoch": 1.185976686683151,
"grad_norm": 2.96875,
"learning_rate": 0.0004865190203912734,
"loss": 5.9557,
"mean_token_accuracy": 0.1616385266184807,
"num_tokens": 25030236.0,
"step": 13430
},
{
"entropy": 6.130628204345703,
"epoch": 1.1864182267749912,
"grad_norm": 2.703125,
"learning_rate": 0.00048650828156001995,
"loss": 5.8439,
"mean_token_accuracy": 0.1595911055803299,
"num_tokens": 25040236.0,
"step": 13435
},
{
"entropy": 6.171045541763306,
"epoch": 1.1868597668668315,
"grad_norm": 3.609375,
"learning_rate": 0.0004864975385854396,
"loss": 5.9783,
"mean_token_accuracy": 0.15739435702562332,
"num_tokens": 25049835.0,
"step": 13440
},
{
"entropy": 6.112024641036987,
"epoch": 1.1873013069586718,
"grad_norm": 2.40625,
"learning_rate": 0.00048648679146774275,
"loss": 5.9004,
"mean_token_accuracy": 0.15641884356737137,
"num_tokens": 25058947.0,
"step": 13445
},
{
"entropy": 6.1274432182312015,
"epoch": 1.1877428470505123,
"grad_norm": 2.09375,
"learning_rate": 0.0004864760402071399,
"loss": 5.8739,
"mean_token_accuracy": 0.16352761685848236,
"num_tokens": 25069128.0,
"step": 13450
},
{
"entropy": 6.144675302505493,
"epoch": 1.1881843871423525,
"grad_norm": 3.234375,
"learning_rate": 0.00048646528480384175,
"loss": 5.9434,
"mean_token_accuracy": 0.15449464470148086,
"num_tokens": 25079717.0,
"step": 13455
},
{
"entropy": 6.111855697631836,
"epoch": 1.1886259272341928,
"grad_norm": 2.296875,
"learning_rate": 0.0004864545252580588,
"loss": 5.8647,
"mean_token_accuracy": 0.16768392026424409,
"num_tokens": 25088656.0,
"step": 13460
},
{
"entropy": 6.113987588882447,
"epoch": 1.1890674673260333,
"grad_norm": 3.78125,
"learning_rate": 0.00048644376157000213,
"loss": 5.8705,
"mean_token_accuracy": 0.15884920805692673,
"num_tokens": 25098066.0,
"step": 13465
},
{
"entropy": 6.115215635299682,
"epoch": 1.1895090074178736,
"grad_norm": 4.78125,
"learning_rate": 0.0004864329937398823,
"loss": 5.9002,
"mean_token_accuracy": 0.16133035868406295,
"num_tokens": 25107530.0,
"step": 13470
},
{
"entropy": 6.1633790016174315,
"epoch": 1.1899505475097139,
"grad_norm": 1.9921875,
"learning_rate": 0.00048642222176791043,
"loss": 5.8508,
"mean_token_accuracy": 0.16020275950431823,
"num_tokens": 25116226.0,
"step": 13475
},
{
"entropy": 6.213159656524658,
"epoch": 1.1903920876015541,
"grad_norm": 2.296875,
"learning_rate": 0.0004864114456542975,
"loss": 5.9993,
"mean_token_accuracy": 0.15417374819517135,
"num_tokens": 25125619.0,
"step": 13480
},
{
"entropy": 6.157901430130005,
"epoch": 1.1908336276933946,
"grad_norm": 2.578125,
"learning_rate": 0.0004864006653992546,
"loss": 5.8518,
"mean_token_accuracy": 0.15914579927921296,
"num_tokens": 25134782.0,
"step": 13485
},
{
"entropy": 6.1407876968383786,
"epoch": 1.191275167785235,
"grad_norm": 2.921875,
"learning_rate": 0.00048638988100299283,
"loss": 5.9008,
"mean_token_accuracy": 0.1690683990716934,
"num_tokens": 25144709.0,
"step": 13490
},
{
"entropy": 6.187879133224487,
"epoch": 1.1917167078770752,
"grad_norm": 1.859375,
"learning_rate": 0.0004863790924657236,
"loss": 5.8032,
"mean_token_accuracy": 0.1650362342596054,
"num_tokens": 25153771.0,
"step": 13495
},
{
"entropy": 6.102207279205322,
"epoch": 1.1921582479689157,
"grad_norm": 2.984375,
"learning_rate": 0.000486368299787658,
"loss": 5.9326,
"mean_token_accuracy": 0.1574912190437317,
"num_tokens": 25163217.0,
"step": 13500
},
{
"entropy": 6.095918846130371,
"epoch": 1.192599788060756,
"grad_norm": 2.4375,
"learning_rate": 0.00048635750296900784,
"loss": 5.9365,
"mean_token_accuracy": 0.15970455408096312,
"num_tokens": 25172762.0,
"step": 13505
},
{
"entropy": 6.136551809310913,
"epoch": 1.1930413281525962,
"grad_norm": 2.328125,
"learning_rate": 0.0004863467020099842,
"loss": 5.8572,
"mean_token_accuracy": 0.16705674827098846,
"num_tokens": 25182349.0,
"step": 13510
},
{
"entropy": 6.226610279083252,
"epoch": 1.1934828682444365,
"grad_norm": 2.65625,
"learning_rate": 0.00048633589691079895,
"loss": 5.9464,
"mean_token_accuracy": 0.1516647607088089,
"num_tokens": 25191971.0,
"step": 13515
},
{
"entropy": 6.08480486869812,
"epoch": 1.193924408336277,
"grad_norm": 2.6875,
"learning_rate": 0.0004863250876716637,
"loss": 5.7111,
"mean_token_accuracy": 0.17364027351140976,
"num_tokens": 25200476.0,
"step": 13520
},
{
"entropy": 6.075552988052368,
"epoch": 1.1943659484281173,
"grad_norm": 3.171875,
"learning_rate": 0.0004863142742927902,
"loss": 5.8253,
"mean_token_accuracy": 0.16806743592023848,
"num_tokens": 25209748.0,
"step": 13525
},
{
"entropy": 6.131186628341675,
"epoch": 1.1948074885199576,
"grad_norm": 4.28125,
"learning_rate": 0.0004863034567743901,
"loss": 5.9014,
"mean_token_accuracy": 0.15827720016241073,
"num_tokens": 25220140.0,
"step": 13530
},
{
"entropy": 6.074198818206787,
"epoch": 1.195249028611798,
"grad_norm": 3.828125,
"learning_rate": 0.0004862926351166756,
"loss": 5.7866,
"mean_token_accuracy": 0.1733180269598961,
"num_tokens": 25228424.0,
"step": 13535
},
{
"entropy": 6.121146869659424,
"epoch": 1.1956905687036383,
"grad_norm": 3.375,
"learning_rate": 0.0004862818093198585,
"loss": 5.9021,
"mean_token_accuracy": 0.16379038095474244,
"num_tokens": 25237448.0,
"step": 13540
},
{
"entropy": 6.106931543350219,
"epoch": 1.1961321087954786,
"grad_norm": 4.53125,
"learning_rate": 0.0004862709793841509,
"loss": 5.7931,
"mean_token_accuracy": 0.16620596647262573,
"num_tokens": 25247124.0,
"step": 13545
},
{
"entropy": 6.0734659194946286,
"epoch": 1.1965736488873189,
"grad_norm": 2.234375,
"learning_rate": 0.00048626014530976495,
"loss": 5.848,
"mean_token_accuracy": 0.165856671333313,
"num_tokens": 25257363.0,
"step": 13550
},
{
"entropy": 6.105982923507691,
"epoch": 1.1970151889791594,
"grad_norm": 3.765625,
"learning_rate": 0.00048624930709691296,
"loss": 5.9285,
"mean_token_accuracy": 0.157583187520504,
"num_tokens": 25266837.0,
"step": 13555
},
{
"entropy": 6.114787006378174,
"epoch": 1.1974567290709996,
"grad_norm": 4.09375,
"learning_rate": 0.00048623846474580716,
"loss": 5.9858,
"mean_token_accuracy": 0.15308154821395875,
"num_tokens": 25275767.0,
"step": 13560
},
{
"entropy": 6.127787637710571,
"epoch": 1.19789826916284,
"grad_norm": 2.890625,
"learning_rate": 0.00048622761825665994,
"loss": 5.9226,
"mean_token_accuracy": 0.1596614822745323,
"num_tokens": 25285212.0,
"step": 13565
},
{
"entropy": 6.081936502456665,
"epoch": 1.1983398092546804,
"grad_norm": 2.609375,
"learning_rate": 0.0004862167676296839,
"loss": 5.819,
"mean_token_accuracy": 0.16384538114070893,
"num_tokens": 25294698.0,
"step": 13570
},
{
"entropy": 6.099255704879761,
"epoch": 1.1987813493465207,
"grad_norm": 2.53125,
"learning_rate": 0.0004862059128650915,
"loss": 5.8807,
"mean_token_accuracy": 0.1681779533624649,
"num_tokens": 25304343.0,
"step": 13575
},
{
"entropy": 6.135133838653564,
"epoch": 1.199222889438361,
"grad_norm": 2.703125,
"learning_rate": 0.00048619505396309525,
"loss": 5.7975,
"mean_token_accuracy": 0.16089823693037034,
"num_tokens": 25312542.0,
"step": 13580
},
{
"entropy": 6.123761367797852,
"epoch": 1.1996644295302012,
"grad_norm": 4.21875,
"learning_rate": 0.0004861841909239081,
"loss": 5.9085,
"mean_token_accuracy": 0.1615436539053917,
"num_tokens": 25322665.0,
"step": 13585
},
{
"entropy": 6.125107097625732,
"epoch": 1.2001059696220417,
"grad_norm": 3.203125,
"learning_rate": 0.00048617332374774276,
"loss": 5.8629,
"mean_token_accuracy": 0.16403960287570954,
"num_tokens": 25332234.0,
"step": 13590
},
{
"entropy": 6.1213541507720945,
"epoch": 1.200547509713882,
"grad_norm": 3.21875,
"learning_rate": 0.00048616245243481216,
"loss": 5.9427,
"mean_token_accuracy": 0.16053162068128585,
"num_tokens": 25341462.0,
"step": 13595
},
{
"entropy": 6.12394347190857,
"epoch": 1.2009890498057223,
"grad_norm": 1.9140625,
"learning_rate": 0.00048615157698532913,
"loss": 5.8864,
"mean_token_accuracy": 0.1628344550728798,
"num_tokens": 25351771.0,
"step": 13600
},
{
"entropy": 6.1803731441497805,
"epoch": 1.2014305898975628,
"grad_norm": 2.359375,
"learning_rate": 0.00048614069739950683,
"loss": 5.856,
"mean_token_accuracy": 0.1613242506980896,
"num_tokens": 25360108.0,
"step": 13605
},
{
"entropy": 6.138595056533814,
"epoch": 1.201872129989403,
"grad_norm": 2.390625,
"learning_rate": 0.0004861298136775583,
"loss": 5.861,
"mean_token_accuracy": 0.16155539751052855,
"num_tokens": 25369635.0,
"step": 13610
},
{
"entropy": 6.050526762008667,
"epoch": 1.2023136700812433,
"grad_norm": 6.53125,
"learning_rate": 0.0004861189258196969,
"loss": 5.8447,
"mean_token_accuracy": 0.1687260463833809,
"num_tokens": 25379623.0,
"step": 13615
},
{
"entropy": 6.132850551605225,
"epoch": 1.2027552101730836,
"grad_norm": 4.21875,
"learning_rate": 0.0004861080338261357,
"loss": 5.926,
"mean_token_accuracy": 0.1580418199300766,
"num_tokens": 25388591.0,
"step": 13620
},
{
"entropy": 6.157472038269043,
"epoch": 1.2031967502649241,
"grad_norm": 2.421875,
"learning_rate": 0.0004860971376970882,
"loss": 5.8278,
"mean_token_accuracy": 0.1704244151711464,
"num_tokens": 25397865.0,
"step": 13625
},
{
"entropy": 6.071918582916259,
"epoch": 1.2036382903567644,
"grad_norm": 2.390625,
"learning_rate": 0.00048608623743276794,
"loss": 5.7705,
"mean_token_accuracy": 0.16876603215932845,
"num_tokens": 25407143.0,
"step": 13630
},
{
"entropy": 6.110278177261352,
"epoch": 1.2040798304486047,
"grad_norm": 2.671875,
"learning_rate": 0.00048607533303338823,
"loss": 5.9113,
"mean_token_accuracy": 0.16444830894470214,
"num_tokens": 25415721.0,
"step": 13635
},
{
"entropy": 6.138487815856934,
"epoch": 1.2045213705404452,
"grad_norm": 2.875,
"learning_rate": 0.00048606442449916284,
"loss": 5.9534,
"mean_token_accuracy": 0.1660207450389862,
"num_tokens": 25425319.0,
"step": 13640
},
{
"entropy": 6.150390720367431,
"epoch": 1.2049629106322854,
"grad_norm": 4.15625,
"learning_rate": 0.00048605351183030537,
"loss": 5.8945,
"mean_token_accuracy": 0.16502275317907333,
"num_tokens": 25435477.0,
"step": 13645
},
{
"entropy": 6.092023324966431,
"epoch": 1.2054044507241257,
"grad_norm": 3.265625,
"learning_rate": 0.0004860425950270296,
"loss": 5.8948,
"mean_token_accuracy": 0.16354770362377166,
"num_tokens": 25445633.0,
"step": 13650
},
{
"entropy": 6.099369049072266,
"epoch": 1.205845990815966,
"grad_norm": 2.265625,
"learning_rate": 0.00048603167408954953,
"loss": 5.8548,
"mean_token_accuracy": 0.1619522228837013,
"num_tokens": 25455228.0,
"step": 13655
},
{
"entropy": 6.127140378952026,
"epoch": 1.2062875309078065,
"grad_norm": 3.0,
"learning_rate": 0.00048602074901807894,
"loss": 5.8535,
"mean_token_accuracy": 0.1637960985302925,
"num_tokens": 25463992.0,
"step": 13660
},
{
"entropy": 6.143215322494507,
"epoch": 1.2067290709996468,
"grad_norm": 6.34375,
"learning_rate": 0.00048600981981283185,
"loss": 5.8148,
"mean_token_accuracy": 0.16737779676914216,
"num_tokens": 25472985.0,
"step": 13665
},
{
"entropy": 6.104969596862793,
"epoch": 1.207170611091487,
"grad_norm": 5.0625,
"learning_rate": 0.0004859988864740225,
"loss": 5.8423,
"mean_token_accuracy": 0.1597076028585434,
"num_tokens": 25482165.0,
"step": 13670
},
{
"entropy": 6.054351091384888,
"epoch": 1.2076121511833275,
"grad_norm": 1.890625,
"learning_rate": 0.0004859879490018649,
"loss": 5.9494,
"mean_token_accuracy": 0.16095939725637437,
"num_tokens": 25490643.0,
"step": 13675
},
{
"entropy": 6.164405298233032,
"epoch": 1.2080536912751678,
"grad_norm": 2.5,
"learning_rate": 0.0004859770073965733,
"loss": 5.8448,
"mean_token_accuracy": 0.1684929072856903,
"num_tokens": 25499954.0,
"step": 13680
},
{
"entropy": 6.177705097198486,
"epoch": 1.208495231367008,
"grad_norm": 2.78125,
"learning_rate": 0.00048596606165836223,
"loss": 5.8795,
"mean_token_accuracy": 0.16326592564582826,
"num_tokens": 25509512.0,
"step": 13685
},
{
"entropy": 6.132805490493775,
"epoch": 1.2089367714588484,
"grad_norm": 2.328125,
"learning_rate": 0.00048595511178744594,
"loss": 5.8257,
"mean_token_accuracy": 0.1642768695950508,
"num_tokens": 25518909.0,
"step": 13690
},
{
"entropy": 6.035837173461914,
"epoch": 1.2093783115506889,
"grad_norm": 2.265625,
"learning_rate": 0.000485944157784039,
"loss": 5.8898,
"mean_token_accuracy": 0.16193051487207413,
"num_tokens": 25528221.0,
"step": 13695
},
{
"entropy": 6.112759351730347,
"epoch": 1.2098198516425291,
"grad_norm": 2.71875,
"learning_rate": 0.000485933199648356,
"loss": 5.8868,
"mean_token_accuracy": 0.15785104036331177,
"num_tokens": 25537428.0,
"step": 13700
},
{
"entropy": 6.193033885955811,
"epoch": 1.2102613917343694,
"grad_norm": 13.25,
"learning_rate": 0.00048592223738061155,
"loss": 5.8879,
"mean_token_accuracy": 0.16130569875240325,
"num_tokens": 25547608.0,
"step": 13705
},
{
"entropy": 6.174786567687988,
"epoch": 1.21070293182621,
"grad_norm": 2.5,
"learning_rate": 0.00048591127098102045,
"loss": 5.9664,
"mean_token_accuracy": 0.1548212632536888,
"num_tokens": 25557482.0,
"step": 13710
},
{
"entropy": 6.11345419883728,
"epoch": 1.2111444719180502,
"grad_norm": 3.46875,
"learning_rate": 0.0004859003004497974,
"loss": 5.822,
"mean_token_accuracy": 0.1660095065832138,
"num_tokens": 25566967.0,
"step": 13715
},
{
"entropy": 6.140512561798095,
"epoch": 1.2115860120098905,
"grad_norm": 2.3125,
"learning_rate": 0.00048588932578715754,
"loss": 5.8289,
"mean_token_accuracy": 0.16757982075214387,
"num_tokens": 25576114.0,
"step": 13720
},
{
"entropy": 6.172637557983398,
"epoch": 1.2120275521017307,
"grad_norm": 2.34375,
"learning_rate": 0.00048587834699331567,
"loss": 6.0444,
"mean_token_accuracy": 0.15106529891490936,
"num_tokens": 25585953.0,
"step": 13725
},
{
"entropy": 6.206463718414307,
"epoch": 1.2124690921935712,
"grad_norm": 2.15625,
"learning_rate": 0.000485867364068487,
"loss": 5.9881,
"mean_token_accuracy": 0.15532583892345428,
"num_tokens": 25595445.0,
"step": 13730
},
{
"entropy": 6.251491212844849,
"epoch": 1.2129106322854115,
"grad_norm": 2.421875,
"learning_rate": 0.00048585637701288646,
"loss": 5.8573,
"mean_token_accuracy": 0.16325814425945281,
"num_tokens": 25605883.0,
"step": 13735
},
{
"entropy": 6.149552059173584,
"epoch": 1.2133521723772518,
"grad_norm": 2.9375,
"learning_rate": 0.0004858453858267295,
"loss": 5.911,
"mean_token_accuracy": 0.1565192684531212,
"num_tokens": 25615653.0,
"step": 13740
},
{
"entropy": 6.03280611038208,
"epoch": 1.2137937124690923,
"grad_norm": 2.03125,
"learning_rate": 0.0004858343905102314,
"loss": 5.8281,
"mean_token_accuracy": 0.1680448457598686,
"num_tokens": 25625043.0,
"step": 13745
},
{
"entropy": 6.113474655151367,
"epoch": 1.2142352525609326,
"grad_norm": 3.0,
"learning_rate": 0.00048582339106360736,
"loss": 5.8639,
"mean_token_accuracy": 0.16792261600494385,
"num_tokens": 25633642.0,
"step": 13750
},
{
"entropy": 6.179423141479492,
"epoch": 1.2146767926527728,
"grad_norm": 2.8125,
"learning_rate": 0.00048581238748707304,
"loss": 5.9251,
"mean_token_accuracy": 0.1591431826353073,
"num_tokens": 25642154.0,
"step": 13755
},
{
"entropy": 6.097006893157959,
"epoch": 1.2151183327446131,
"grad_norm": 2.59375,
"learning_rate": 0.000485801379780844,
"loss": 5.8076,
"mean_token_accuracy": 0.16776145845651627,
"num_tokens": 25650250.0,
"step": 13760
},
{
"entropy": 6.090764951705933,
"epoch": 1.2155598728364536,
"grad_norm": 4.625,
"learning_rate": 0.00048579036794513584,
"loss": 5.8476,
"mean_token_accuracy": 0.16923510432243347,
"num_tokens": 25659789.0,
"step": 13765
},
{
"entropy": 6.068515729904175,
"epoch": 1.216001412928294,
"grad_norm": 3.671875,
"learning_rate": 0.00048577935198016413,
"loss": 5.9024,
"mean_token_accuracy": 0.16171564906835556,
"num_tokens": 25668658.0,
"step": 13770
},
{
"entropy": 6.17858920097351,
"epoch": 1.2164429530201342,
"grad_norm": 3.0625,
"learning_rate": 0.0004857683318861449,
"loss": 5.9099,
"mean_token_accuracy": 0.15890219211578369,
"num_tokens": 25679082.0,
"step": 13775
},
{
"entropy": 6.198918724060059,
"epoch": 1.2168844931119747,
"grad_norm": 3.671875,
"learning_rate": 0.00048575730766329384,
"loss": 5.8791,
"mean_token_accuracy": 0.16028922349214553,
"num_tokens": 25688408.0,
"step": 13780
},
{
"entropy": 6.115861654281616,
"epoch": 1.217326033203815,
"grad_norm": 2.46875,
"learning_rate": 0.00048574627931182704,
"loss": 5.8365,
"mean_token_accuracy": 0.16478847414255143,
"num_tokens": 25697415.0,
"step": 13785
},
{
"entropy": 6.108596897125244,
"epoch": 1.2177675732956552,
"grad_norm": 3.265625,
"learning_rate": 0.00048573524683196047,
"loss": 5.9153,
"mean_token_accuracy": 0.15454248040914537,
"num_tokens": 25706330.0,
"step": 13790
},
{
"entropy": 6.163830947875977,
"epoch": 1.2182091133874955,
"grad_norm": 2.90625,
"learning_rate": 0.0004857242102239102,
"loss": 5.8887,
"mean_token_accuracy": 0.16264807283878327,
"num_tokens": 25716198.0,
"step": 13795
},
{
"entropy": 6.190002918243408,
"epoch": 1.218650653479336,
"grad_norm": 2.9375,
"learning_rate": 0.0004857131694878926,
"loss": 5.89,
"mean_token_accuracy": 0.15574070662260056,
"num_tokens": 25726486.0,
"step": 13800
},
{
"entropy": 6.1381786346435545,
"epoch": 1.2190921935711763,
"grad_norm": 3.296875,
"learning_rate": 0.00048570212462412376,
"loss": 5.8053,
"mean_token_accuracy": 0.16825809925794602,
"num_tokens": 25735559.0,
"step": 13805
},
{
"entropy": 6.139941072463989,
"epoch": 1.2195337336630165,
"grad_norm": 3.21875,
"learning_rate": 0.0004856910756328202,
"loss": 5.8828,
"mean_token_accuracy": 0.1617460161447525,
"num_tokens": 25744781.0,
"step": 13810
},
{
"entropy": 6.096488046646118,
"epoch": 1.219975273754857,
"grad_norm": 5.90625,
"learning_rate": 0.00048568002251419835,
"loss": 5.8412,
"mean_token_accuracy": 0.1673791527748108,
"num_tokens": 25753984.0,
"step": 13815
},
{
"entropy": 6.077772188186645,
"epoch": 1.2204168138466973,
"grad_norm": 2.515625,
"learning_rate": 0.0004856689652684746,
"loss": 5.9207,
"mean_token_accuracy": 0.16131079345941543,
"num_tokens": 25763378.0,
"step": 13820
},
{
"entropy": 6.113293790817261,
"epoch": 1.2208583539385376,
"grad_norm": 2.3125,
"learning_rate": 0.0004856579038958656,
"loss": 5.844,
"mean_token_accuracy": 0.165702685713768,
"num_tokens": 25771907.0,
"step": 13825
},
{
"entropy": 6.154945373535156,
"epoch": 1.2212998940303779,
"grad_norm": 3.40625,
"learning_rate": 0.00048564683839658805,
"loss": 5.9081,
"mean_token_accuracy": 0.1633990228176117,
"num_tokens": 25780464.0,
"step": 13830
},
{
"entropy": 6.164700365066528,
"epoch": 1.2217414341222184,
"grad_norm": 7.15625,
"learning_rate": 0.00048563576877085887,
"loss": 5.8969,
"mean_token_accuracy": 0.16829572021961212,
"num_tokens": 25790300.0,
"step": 13835
},
{
"entropy": 6.157507133483887,
"epoch": 1.2221829742140586,
"grad_norm": 3.4375,
"learning_rate": 0.0004856246950188947,
"loss": 5.8093,
"mean_token_accuracy": 0.1659921184182167,
"num_tokens": 25799103.0,
"step": 13840
},
{
"entropy": 6.124673986434937,
"epoch": 1.222624514305899,
"grad_norm": 2.6875,
"learning_rate": 0.00048561361714091257,
"loss": 5.8906,
"mean_token_accuracy": 0.15993627682328224,
"num_tokens": 25808506.0,
"step": 13845
},
{
"entropy": 6.095012855529785,
"epoch": 1.2230660543977394,
"grad_norm": 2.203125,
"learning_rate": 0.00048560253513712945,
"loss": 5.8616,
"mean_token_accuracy": 0.16253495663404466,
"num_tokens": 25817965.0,
"step": 13850
},
{
"entropy": 6.1050577640533445,
"epoch": 1.2235075944895797,
"grad_norm": 2.53125,
"learning_rate": 0.0004855914490077624,
"loss": 5.8649,
"mean_token_accuracy": 0.16440447866916658,
"num_tokens": 25827874.0,
"step": 13855
},
{
"entropy": 6.257881593704224,
"epoch": 1.22394913458142,
"grad_norm": 3.453125,
"learning_rate": 0.00048558035875302864,
"loss": 5.9555,
"mean_token_accuracy": 0.16679451614618301,
"num_tokens": 25836840.0,
"step": 13860
},
{
"entropy": 6.2015275955200195,
"epoch": 1.2243906746732602,
"grad_norm": 3.328125,
"learning_rate": 0.0004855692643731455,
"loss": 5.8644,
"mean_token_accuracy": 0.1665856122970581,
"num_tokens": 25846344.0,
"step": 13865
},
{
"entropy": 6.10710391998291,
"epoch": 1.2248322147651007,
"grad_norm": 2.734375,
"learning_rate": 0.00048555816586833006,
"loss": 5.8447,
"mean_token_accuracy": 0.1670474410057068,
"num_tokens": 25855336.0,
"step": 13870
},
{
"entropy": 6.176102972030639,
"epoch": 1.225273754856941,
"grad_norm": 3.078125,
"learning_rate": 0.00048554706323880007,
"loss": 5.9075,
"mean_token_accuracy": 0.15813434571027757,
"num_tokens": 25864402.0,
"step": 13875
},
{
"entropy": 6.1160811424255375,
"epoch": 1.2257152949487813,
"grad_norm": 2.671875,
"learning_rate": 0.0004855359564847728,
"loss": 5.8759,
"mean_token_accuracy": 0.16446302384138106,
"num_tokens": 25873326.0,
"step": 13880
},
{
"entropy": 6.137067556381226,
"epoch": 1.2261568350406218,
"grad_norm": 2.984375,
"learning_rate": 0.00048552484560646585,
"loss": 5.9636,
"mean_token_accuracy": 0.15030109733343125,
"num_tokens": 25882521.0,
"step": 13885
},
{
"entropy": 6.123560905456543,
"epoch": 1.226598375132462,
"grad_norm": 5.875,
"learning_rate": 0.00048551373060409694,
"loss": 5.7754,
"mean_token_accuracy": 0.16873205751180648,
"num_tokens": 25891087.0,
"step": 13890
},
{
"entropy": 6.148444747924804,
"epoch": 1.2270399152243023,
"grad_norm": 4.8125,
"learning_rate": 0.00048550261147788375,
"loss": 5.844,
"mean_token_accuracy": 0.16271620392799377,
"num_tokens": 25900757.0,
"step": 13895
},
{
"entropy": 6.1451184272766115,
"epoch": 1.2274814553161426,
"grad_norm": 5.78125,
"learning_rate": 0.00048549148822804415,
"loss": 5.846,
"mean_token_accuracy": 0.16510254442691802,
"num_tokens": 25909801.0,
"step": 13900
},
{
"entropy": 6.212270355224609,
"epoch": 1.227922995407983,
"grad_norm": 2.671875,
"learning_rate": 0.000485480360854796,
"loss": 5.9664,
"mean_token_accuracy": 0.14850743412971495,
"num_tokens": 25919142.0,
"step": 13905
},
{
"entropy": 6.169791269302368,
"epoch": 1.2283645354998234,
"grad_norm": 2.75,
"learning_rate": 0.0004854692293583573,
"loss": 5.8455,
"mean_token_accuracy": 0.1695958212018013,
"num_tokens": 25927560.0,
"step": 13910
},
{
"entropy": 6.145868587493896,
"epoch": 1.2288060755916637,
"grad_norm": 4.5,
"learning_rate": 0.00048545809373894605,
"loss": 5.9438,
"mean_token_accuracy": 0.15950260162353516,
"num_tokens": 25937184.0,
"step": 13915
},
{
"entropy": 6.203847885131836,
"epoch": 1.2292476156835042,
"grad_norm": 9.8125,
"learning_rate": 0.00048544695399678044,
"loss": 5.9888,
"mean_token_accuracy": 0.15235858261585236,
"num_tokens": 25946641.0,
"step": 13920
},
{
"entropy": 6.251913738250733,
"epoch": 1.2296891557753444,
"grad_norm": 4.3125,
"learning_rate": 0.0004854358101320787,
"loss": 6.0138,
"mean_token_accuracy": 0.16012657731771468,
"num_tokens": 25955910.0,
"step": 13925
},
{
"entropy": 6.21167631149292,
"epoch": 1.2301306958671847,
"grad_norm": 2.703125,
"learning_rate": 0.00048542466214505914,
"loss": 5.9062,
"mean_token_accuracy": 0.1681879848241806,
"num_tokens": 25966580.0,
"step": 13930
},
{
"entropy": 6.200042390823365,
"epoch": 1.230572235959025,
"grad_norm": 2.765625,
"learning_rate": 0.00048541351003594015,
"loss": 5.7846,
"mean_token_accuracy": 0.16241865158081054,
"num_tokens": 25975815.0,
"step": 13935
},
{
"entropy": 6.085675954818726,
"epoch": 1.2310137760508655,
"grad_norm": 2.15625,
"learning_rate": 0.0004854023538049401,
"loss": 5.875,
"mean_token_accuracy": 0.1659865990281105,
"num_tokens": 25984784.0,
"step": 13940
},
{
"entropy": 6.0831996440887455,
"epoch": 1.2314553161427058,
"grad_norm": 2.03125,
"learning_rate": 0.00048539119345227774,
"loss": 5.8081,
"mean_token_accuracy": 0.17162715941667556,
"num_tokens": 25994125.0,
"step": 13945
},
{
"entropy": 6.177586460113526,
"epoch": 1.231896856234546,
"grad_norm": 3.921875,
"learning_rate": 0.0004853800289781714,
"loss": 5.8567,
"mean_token_accuracy": 0.16451699584722518,
"num_tokens": 26002876.0,
"step": 13950
},
{
"entropy": 6.111658430099487,
"epoch": 1.2323383963263865,
"grad_norm": 1.953125,
"learning_rate": 0.00048536886038284,
"loss": 5.8673,
"mean_token_accuracy": 0.17018894255161285,
"num_tokens": 26012591.0,
"step": 13955
},
{
"entropy": 6.1842817783355715,
"epoch": 1.2327799364182268,
"grad_norm": 3.25,
"learning_rate": 0.00048535768766650225,
"loss": 5.9896,
"mean_token_accuracy": 0.14767101034522057,
"num_tokens": 26022107.0,
"step": 13960
},
{
"entropy": 6.200846004486084,
"epoch": 1.233221476510067,
"grad_norm": 2.671875,
"learning_rate": 0.000485346510829377,
"loss": 5.9397,
"mean_token_accuracy": 0.16940923780202866,
"num_tokens": 26031035.0,
"step": 13965
},
{
"entropy": 6.122490262985229,
"epoch": 1.2336630166019074,
"grad_norm": 3.4375,
"learning_rate": 0.00048533532987168334,
"loss": 5.7865,
"mean_token_accuracy": 0.17806146740913392,
"num_tokens": 26039980.0,
"step": 13970
},
{
"entropy": 6.159085083007812,
"epoch": 1.2341045566937479,
"grad_norm": 2.515625,
"learning_rate": 0.00048532414479364016,
"loss": 5.9914,
"mean_token_accuracy": 0.15335851311683654,
"num_tokens": 26049389.0,
"step": 13975
},
{
"entropy": 6.101601314544678,
"epoch": 1.2345460967855881,
"grad_norm": 2.875,
"learning_rate": 0.0004853129555954666,
"loss": 5.8612,
"mean_token_accuracy": 0.16532649099826813,
"num_tokens": 26058868.0,
"step": 13980
},
{
"entropy": 6.179310607910156,
"epoch": 1.2349876368774284,
"grad_norm": 2.796875,
"learning_rate": 0.0004853017622773818,
"loss": 5.9011,
"mean_token_accuracy": 0.15754345804452896,
"num_tokens": 26068025.0,
"step": 13985
},
{
"entropy": 6.229262018203736,
"epoch": 1.235429176969269,
"grad_norm": 2.515625,
"learning_rate": 0.0004852905648396051,
"loss": 5.8748,
"mean_token_accuracy": 0.16282918006181718,
"num_tokens": 26076410.0,
"step": 13990
},
{
"entropy": 6.11411452293396,
"epoch": 1.2358707170611092,
"grad_norm": 3.0,
"learning_rate": 0.00048527936328235583,
"loss": 5.8427,
"mean_token_accuracy": 0.16760962307453156,
"num_tokens": 26085624.0,
"step": 13995
},
{
"entropy": 6.111862850189209,
"epoch": 1.2363122571529495,
"grad_norm": 4.09375,
"learning_rate": 0.0004852681576058534,
"loss": 5.9062,
"mean_token_accuracy": 0.1618655800819397,
"num_tokens": 26094898.0,
"step": 14000
},
{
"entropy": 6.107737398147583,
"epoch": 1.2367537972447897,
"grad_norm": 2.3125,
"learning_rate": 0.0004852569478103174,
"loss": 5.885,
"mean_token_accuracy": 0.16324533224105836,
"num_tokens": 26105041.0,
"step": 14005
},
{
"entropy": 6.177951431274414,
"epoch": 1.2371953373366302,
"grad_norm": 2.53125,
"learning_rate": 0.00048524573389596736,
"loss": 5.8634,
"mean_token_accuracy": 0.16687836796045302,
"num_tokens": 26114140.0,
"step": 14010
},
{
"entropy": 6.081378602981568,
"epoch": 1.2376368774284705,
"grad_norm": 2.328125,
"learning_rate": 0.00048523451586302295,
"loss": 5.7275,
"mean_token_accuracy": 0.16994651407003403,
"num_tokens": 26122611.0,
"step": 14015
},
{
"entropy": 6.026006364822388,
"epoch": 1.2380784175203108,
"grad_norm": 2.65625,
"learning_rate": 0.000485223293711704,
"loss": 5.8161,
"mean_token_accuracy": 0.1668297678232193,
"num_tokens": 26131548.0,
"step": 14020
},
{
"entropy": 6.08026237487793,
"epoch": 1.2385199576121513,
"grad_norm": 2.09375,
"learning_rate": 0.00048521206744223024,
"loss": 5.8088,
"mean_token_accuracy": 0.159669229388237,
"num_tokens": 26139806.0,
"step": 14025
},
{
"entropy": 6.27757773399353,
"epoch": 1.2389614977039916,
"grad_norm": 2.234375,
"learning_rate": 0.00048520083705482165,
"loss": 5.943,
"mean_token_accuracy": 0.16186850070953368,
"num_tokens": 26148960.0,
"step": 14030
},
{
"entropy": 6.20587854385376,
"epoch": 1.2394030377958318,
"grad_norm": 3.578125,
"learning_rate": 0.0004851896025496982,
"loss": 5.9421,
"mean_token_accuracy": 0.1617153212428093,
"num_tokens": 26158498.0,
"step": 14035
},
{
"entropy": 6.108002662658691,
"epoch": 1.239844577887672,
"grad_norm": 2.609375,
"learning_rate": 0.00048517836392707994,
"loss": 5.7793,
"mean_token_accuracy": 0.17001076340675353,
"num_tokens": 26167319.0,
"step": 14040
},
{
"entropy": 6.095983648300171,
"epoch": 1.2402861179795126,
"grad_norm": 2.53125,
"learning_rate": 0.00048516712118718713,
"loss": 5.784,
"mean_token_accuracy": 0.1719643145799637,
"num_tokens": 26176059.0,
"step": 14045
},
{
"entropy": 6.1293802738189695,
"epoch": 1.2407276580713529,
"grad_norm": 2.21875,
"learning_rate": 0.0004851558743302399,
"loss": 5.7944,
"mean_token_accuracy": 0.1715379074215889,
"num_tokens": 26185102.0,
"step": 14050
},
{
"entropy": 6.159735631942749,
"epoch": 1.2411691981631932,
"grad_norm": 3.703125,
"learning_rate": 0.0004851446233564586,
"loss": 5.8536,
"mean_token_accuracy": 0.16375011652708055,
"num_tokens": 26194873.0,
"step": 14055
},
{
"entropy": 6.1436145305633545,
"epoch": 1.2416107382550337,
"grad_norm": 2.09375,
"learning_rate": 0.0004851333682660637,
"loss": 5.901,
"mean_token_accuracy": 0.161464723944664,
"num_tokens": 26205362.0,
"step": 14060
},
{
"entropy": 6.070151138305664,
"epoch": 1.242052278346874,
"grad_norm": 2.828125,
"learning_rate": 0.00048512210905927555,
"loss": 5.7775,
"mean_token_accuracy": 0.17018500715494156,
"num_tokens": 26214266.0,
"step": 14065
},
{
"entropy": 6.203881645202637,
"epoch": 1.2424938184387142,
"grad_norm": 2.515625,
"learning_rate": 0.0004851108457363149,
"loss": 5.9516,
"mean_token_accuracy": 0.16002586036920546,
"num_tokens": 26223069.0,
"step": 14070
},
{
"entropy": 6.108728456497192,
"epoch": 1.2429353585305545,
"grad_norm": 2.578125,
"learning_rate": 0.0004850995782974022,
"loss": 5.8679,
"mean_token_accuracy": 0.165135395526886,
"num_tokens": 26232547.0,
"step": 14075
},
{
"entropy": 6.182537651062011,
"epoch": 1.243376898622395,
"grad_norm": 2.140625,
"learning_rate": 0.0004850883067427582,
"loss": 5.8703,
"mean_token_accuracy": 0.15840159058570863,
"num_tokens": 26241014.0,
"step": 14080
},
{
"entropy": 6.062948560714721,
"epoch": 1.2438184387142353,
"grad_norm": 2.515625,
"learning_rate": 0.00048507703107260384,
"loss": 5.8985,
"mean_token_accuracy": 0.16748405992984772,
"num_tokens": 26250784.0,
"step": 14085
},
{
"entropy": 6.114327478408813,
"epoch": 1.2442599788060755,
"grad_norm": 2.671875,
"learning_rate": 0.00048506575128715984,
"loss": 5.8407,
"mean_token_accuracy": 0.16721384078264237,
"num_tokens": 26259769.0,
"step": 14090
},
{
"entropy": 6.222595119476319,
"epoch": 1.244701518897916,
"grad_norm": 2.421875,
"learning_rate": 0.0004850544673866474,
"loss": 5.8662,
"mean_token_accuracy": 0.16513684540987014,
"num_tokens": 26269038.0,
"step": 14095
},
{
"entropy": 6.203722143173218,
"epoch": 1.2451430589897563,
"grad_norm": 2.390625,
"learning_rate": 0.0004850431793712873,
"loss": 5.8469,
"mean_token_accuracy": 0.15795351862907409,
"num_tokens": 26278657.0,
"step": 14100
},
{
"entropy": 6.093338584899902,
"epoch": 1.2455845990815966,
"grad_norm": 2.03125,
"learning_rate": 0.00048503188724130075,
"loss": 5.8683,
"mean_token_accuracy": 0.161135982722044,
"num_tokens": 26287458.0,
"step": 14105
},
{
"entropy": 6.139366626739502,
"epoch": 1.2460261391734369,
"grad_norm": 2.65625,
"learning_rate": 0.000485020590996909,
"loss": 5.8969,
"mean_token_accuracy": 0.1613367035984993,
"num_tokens": 26296324.0,
"step": 14110
},
{
"entropy": 6.1967418670654295,
"epoch": 1.2464676792652774,
"grad_norm": 2.34375,
"learning_rate": 0.00048500929063833334,
"loss": 5.8254,
"mean_token_accuracy": 0.16681212037801743,
"num_tokens": 26304799.0,
"step": 14115
},
{
"entropy": 6.1860345840454105,
"epoch": 1.2469092193571176,
"grad_norm": 2.640625,
"learning_rate": 0.00048499798616579505,
"loss": 5.9486,
"mean_token_accuracy": 0.15916669815778733,
"num_tokens": 26314223.0,
"step": 14120
},
{
"entropy": 6.145554637908935,
"epoch": 1.247350759448958,
"grad_norm": 2.46875,
"learning_rate": 0.00048498667757951574,
"loss": 5.9386,
"mean_token_accuracy": 0.15299508199095727,
"num_tokens": 26323599.0,
"step": 14125
},
{
"entropy": 6.183912372589111,
"epoch": 1.2477922995407984,
"grad_norm": 4.3125,
"learning_rate": 0.0004849753648797168,
"loss": 5.9489,
"mean_token_accuracy": 0.16359923034906387,
"num_tokens": 26331929.0,
"step": 14130
},
{
"entropy": 6.166175317764282,
"epoch": 1.2482338396326387,
"grad_norm": 2.0,
"learning_rate": 0.0004849640480666199,
"loss": 5.8595,
"mean_token_accuracy": 0.16263386458158494,
"num_tokens": 26340929.0,
"step": 14135
},
{
"entropy": 6.205372858047485,
"epoch": 1.248675379724479,
"grad_norm": 2.3125,
"learning_rate": 0.0004849527271404467,
"loss": 5.8359,
"mean_token_accuracy": 0.16180350035429,
"num_tokens": 26350393.0,
"step": 14140
},
{
"entropy": 6.192986059188843,
"epoch": 1.2491169198163192,
"grad_norm": 2.03125,
"learning_rate": 0.00048494140210141897,
"loss": 6.0516,
"mean_token_accuracy": 0.15320550203323363,
"num_tokens": 26360709.0,
"step": 14145
},
{
"entropy": 6.135886478424072,
"epoch": 1.2495584599081597,
"grad_norm": 2.1875,
"learning_rate": 0.00048493007294975855,
"loss": 5.8222,
"mean_token_accuracy": 0.16708850413560866,
"num_tokens": 26369447.0,
"step": 14150
},
{
"entropy": 6.180289077758789,
"epoch": 1.25,
"grad_norm": 2.703125,
"learning_rate": 0.00048491873968568746,
"loss": 5.8145,
"mean_token_accuracy": 0.173640675842762,
"num_tokens": 26379281.0,
"step": 14155
},
{
"entropy": 6.028554010391235,
"epoch": 1.2504415400918403,
"grad_norm": 2.46875,
"learning_rate": 0.0004849074023094276,
"loss": 5.7567,
"mean_token_accuracy": 0.17871274501085282,
"num_tokens": 26387664.0,
"step": 14160
},
{
"entropy": 6.044926881790161,
"epoch": 1.2508830801836806,
"grad_norm": 2.40625,
"learning_rate": 0.00048489606082120106,
"loss": 5.7826,
"mean_token_accuracy": 0.16467014998197554,
"num_tokens": 26397485.0,
"step": 14165
},
{
"entropy": 6.1967607021331785,
"epoch": 1.251324620275521,
"grad_norm": 3.953125,
"learning_rate": 0.0004848847152212301,
"loss": 5.7853,
"mean_token_accuracy": 0.17464729398488998,
"num_tokens": 26406307.0,
"step": 14170
},
{
"entropy": 6.249160671234131,
"epoch": 1.2517661603673613,
"grad_norm": 2.328125,
"learning_rate": 0.000484873365509737,
"loss": 5.9681,
"mean_token_accuracy": 0.15817815214395523,
"num_tokens": 26416155.0,
"step": 14175
},
{
"entropy": 6.163325023651123,
"epoch": 1.2522077004592016,
"grad_norm": 2.5,
"learning_rate": 0.00048486201168694397,
"loss": 5.8555,
"mean_token_accuracy": 0.16459050327539443,
"num_tokens": 26424147.0,
"step": 14180
},
{
"entropy": 6.146246814727784,
"epoch": 1.252649240551042,
"grad_norm": 3.21875,
"learning_rate": 0.00048485065375307353,
"loss": 5.8607,
"mean_token_accuracy": 0.16430633664131164,
"num_tokens": 26433249.0,
"step": 14185
},
{
"entropy": 6.15051851272583,
"epoch": 1.2530907806428824,
"grad_norm": 3.734375,
"learning_rate": 0.00048483929170834805,
"loss": 5.9181,
"mean_token_accuracy": 0.16531587541103362,
"num_tokens": 26442346.0,
"step": 14190
},
{
"entropy": 6.1674140930175785,
"epoch": 1.2535323207347226,
"grad_norm": 2.5625,
"learning_rate": 0.00048482792555299027,
"loss": 5.8626,
"mean_token_accuracy": 0.16580964922904967,
"num_tokens": 26450885.0,
"step": 14195
},
{
"entropy": 6.112153339385986,
"epoch": 1.2539738608265631,
"grad_norm": 2.765625,
"learning_rate": 0.0004848165552872227,
"loss": 5.8936,
"mean_token_accuracy": 0.16759453862905502,
"num_tokens": 26459827.0,
"step": 14200
},
{
"entropy": 6.064711952209473,
"epoch": 1.2544154009184034,
"grad_norm": 2.34375,
"learning_rate": 0.0004848051809112682,
"loss": 5.8798,
"mean_token_accuracy": 0.1637478217482567,
"num_tokens": 26468357.0,
"step": 14205
},
{
"entropy": 6.147997283935547,
"epoch": 1.2548569410102437,
"grad_norm": 2.125,
"learning_rate": 0.00048479380242534955,
"loss": 5.9697,
"mean_token_accuracy": 0.16154599636793138,
"num_tokens": 26477396.0,
"step": 14210
},
{
"entropy": 6.120608711242676,
"epoch": 1.2552984811020842,
"grad_norm": 2.625,
"learning_rate": 0.0004847824198296896,
"loss": 5.9202,
"mean_token_accuracy": 0.1679876044392586,
"num_tokens": 26486468.0,
"step": 14215
},
{
"entropy": 6.220629024505615,
"epoch": 1.2557400211939245,
"grad_norm": 3.4375,
"learning_rate": 0.0004847710331245113,
"loss": 5.8723,
"mean_token_accuracy": 0.1573971390724182,
"num_tokens": 26496157.0,
"step": 14220
},
{
"entropy": 6.150463342666626,
"epoch": 1.2561815612857647,
"grad_norm": 2.46875,
"learning_rate": 0.00048475964231003776,
"loss": 5.7523,
"mean_token_accuracy": 0.17932308465242386,
"num_tokens": 26504573.0,
"step": 14225
},
{
"entropy": 6.047696542739868,
"epoch": 1.256623101377605,
"grad_norm": 2.453125,
"learning_rate": 0.0004847482473864922,
"loss": 5.7464,
"mean_token_accuracy": 0.17491578161716462,
"num_tokens": 26513441.0,
"step": 14230
},
{
"entropy": 6.121747589111328,
"epoch": 1.2570646414694453,
"grad_norm": 2.359375,
"learning_rate": 0.0004847368483540977,
"loss": 5.9493,
"mean_token_accuracy": 0.1572751745581627,
"num_tokens": 26522911.0,
"step": 14235
},
{
"entropy": 6.1046537399292,
"epoch": 1.2575061815612858,
"grad_norm": 2.375,
"learning_rate": 0.00048472544521307765,
"loss": 5.8046,
"mean_token_accuracy": 0.16700615882873535,
"num_tokens": 26531388.0,
"step": 14240
},
{
"entropy": 6.156214952468872,
"epoch": 1.257947721653126,
"grad_norm": 4.03125,
"learning_rate": 0.0004847140379636554,
"loss": 5.8018,
"mean_token_accuracy": 0.1667196720838547,
"num_tokens": 26540500.0,
"step": 14245
},
{
"entropy": 6.115697050094605,
"epoch": 1.2583892617449663,
"grad_norm": 4.03125,
"learning_rate": 0.0004847026266060545,
"loss": 5.8203,
"mean_token_accuracy": 0.16794761568307875,
"num_tokens": 26550041.0,
"step": 14250
},
{
"entropy": 6.104461288452148,
"epoch": 1.2588308018368068,
"grad_norm": 1.875,
"learning_rate": 0.0004846912111404983,
"loss": 5.773,
"mean_token_accuracy": 0.1673601061105728,
"num_tokens": 26559594.0,
"step": 14255
},
{
"entropy": 6.119595861434936,
"epoch": 1.2592723419286471,
"grad_norm": 3.109375,
"learning_rate": 0.00048467979156721055,
"loss": 5.8561,
"mean_token_accuracy": 0.16078553944826127,
"num_tokens": 26569143.0,
"step": 14260
},
{
"entropy": 6.0893219947814945,
"epoch": 1.2597138820204874,
"grad_norm": 2.5625,
"learning_rate": 0.00048466836788641496,
"loss": 5.8499,
"mean_token_accuracy": 0.16977011412382126,
"num_tokens": 26578040.0,
"step": 14265
},
{
"entropy": 6.105670690536499,
"epoch": 1.260155422112328,
"grad_norm": 6.75,
"learning_rate": 0.00048465694009833525,
"loss": 5.8732,
"mean_token_accuracy": 0.1663052961230278,
"num_tokens": 26588283.0,
"step": 14270
},
{
"entropy": 6.185032796859741,
"epoch": 1.2605969622041682,
"grad_norm": 1.96875,
"learning_rate": 0.00048464550820319537,
"loss": 5.9043,
"mean_token_accuracy": 0.15864064246416093,
"num_tokens": 26597815.0,
"step": 14275
},
{
"entropy": 6.136128950119018,
"epoch": 1.2610385022960084,
"grad_norm": 2.0,
"learning_rate": 0.0004846340722012192,
"loss": 5.8844,
"mean_token_accuracy": 0.16193383634090425,
"num_tokens": 26606752.0,
"step": 14280
},
{
"entropy": 6.137882375717163,
"epoch": 1.261480042387849,
"grad_norm": 2.703125,
"learning_rate": 0.0004846226320926308,
"loss": 5.8596,
"mean_token_accuracy": 0.16320177018642426,
"num_tokens": 26615312.0,
"step": 14285
},
{
"entropy": 6.108608150482178,
"epoch": 1.2619215824796892,
"grad_norm": 3.171875,
"learning_rate": 0.0004846111878776542,
"loss": 5.8532,
"mean_token_accuracy": 0.16345514059066774,
"num_tokens": 26624642.0,
"step": 14290
},
{
"entropy": 6.0226655960083,
"epoch": 1.2623631225715295,
"grad_norm": 2.65625,
"learning_rate": 0.0004845997395565137,
"loss": 5.7357,
"mean_token_accuracy": 0.17310073226690292,
"num_tokens": 26633250.0,
"step": 14295
},
{
"entropy": 6.092862606048584,
"epoch": 1.2628046626633698,
"grad_norm": 1.96875,
"learning_rate": 0.0004845882871294335,
"loss": 5.8946,
"mean_token_accuracy": 0.16711120307445526,
"num_tokens": 26642422.0,
"step": 14300
},
{
"entropy": 6.1741279602050785,
"epoch": 1.26324620275521,
"grad_norm": 2.25,
"learning_rate": 0.0004845768305966379,
"loss": 5.9401,
"mean_token_accuracy": 0.16149356961250305,
"num_tokens": 26651978.0,
"step": 14305
},
{
"entropy": 6.140668678283691,
"epoch": 1.2636877428470505,
"grad_norm": 2.4375,
"learning_rate": 0.0004845653699583515,
"loss": 5.9264,
"mean_token_accuracy": 0.15752516388893129,
"num_tokens": 26662075.0,
"step": 14310
},
{
"entropy": 6.100184106826783,
"epoch": 1.2641292829388908,
"grad_norm": 2.640625,
"learning_rate": 0.00048455390521479855,
"loss": 5.8359,
"mean_token_accuracy": 0.1631970524787903,
"num_tokens": 26670813.0,
"step": 14315
},
{
"entropy": 6.12058539390564,
"epoch": 1.264570823030731,
"grad_norm": 3.3125,
"learning_rate": 0.00048454243636620383,
"loss": 5.878,
"mean_token_accuracy": 0.16802359074354173,
"num_tokens": 26679867.0,
"step": 14320
},
{
"entropy": 6.134748268127441,
"epoch": 1.2650123631225716,
"grad_norm": 2.09375,
"learning_rate": 0.000484530963412792,
"loss": 5.9012,
"mean_token_accuracy": 0.15702180117368697,
"num_tokens": 26688523.0,
"step": 14325
},
{
"entropy": 6.177200984954834,
"epoch": 1.2654539032144119,
"grad_norm": 2.5625,
"learning_rate": 0.00048451948635478765,
"loss": 5.9225,
"mean_token_accuracy": 0.16516541540622712,
"num_tokens": 26697922.0,
"step": 14330
},
{
"entropy": 6.197690439224243,
"epoch": 1.2658954433062521,
"grad_norm": 4.78125,
"learning_rate": 0.0004845080051924158,
"loss": 5.8987,
"mean_token_accuracy": 0.15447753965854644,
"num_tokens": 26707058.0,
"step": 14335
},
{
"entropy": 6.1324159622192385,
"epoch": 1.2663369833980926,
"grad_norm": 2.0625,
"learning_rate": 0.0004844965199259013,
"loss": 5.8766,
"mean_token_accuracy": 0.16006785929203032,
"num_tokens": 26715873.0,
"step": 14340
},
{
"entropy": 6.147934246063232,
"epoch": 1.266778523489933,
"grad_norm": 2.8125,
"learning_rate": 0.0004844850305554692,
"loss": 5.8785,
"mean_token_accuracy": 0.16686562895774842,
"num_tokens": 26726253.0,
"step": 14345
},
{
"entropy": 6.189689302444458,
"epoch": 1.2672200635817732,
"grad_norm": 2.15625,
"learning_rate": 0.00048447353708134426,
"loss": 5.8861,
"mean_token_accuracy": 0.16477882564067842,
"num_tokens": 26737077.0,
"step": 14350
},
{
"entropy": 6.153367376327514,
"epoch": 1.2676616036736137,
"grad_norm": 1.9765625,
"learning_rate": 0.000484462039503752,
"loss": 5.9105,
"mean_token_accuracy": 0.16371438056230544,
"num_tokens": 26746603.0,
"step": 14355
},
{
"entropy": 6.0759519100189205,
"epoch": 1.268103143765454,
"grad_norm": 2.203125,
"learning_rate": 0.00048445053782291753,
"loss": 5.8815,
"mean_token_accuracy": 0.162023688852787,
"num_tokens": 26756174.0,
"step": 14360
},
{
"entropy": 6.097843313217163,
"epoch": 1.2685446838572942,
"grad_norm": 3.734375,
"learning_rate": 0.00048443903203906614,
"loss": 5.8853,
"mean_token_accuracy": 0.1657269835472107,
"num_tokens": 26765124.0,
"step": 14365
},
{
"entropy": 6.101298761367798,
"epoch": 1.2689862239491345,
"grad_norm": 2.390625,
"learning_rate": 0.0004844275221524232,
"loss": 5.8522,
"mean_token_accuracy": 0.1724344253540039,
"num_tokens": 26774438.0,
"step": 14370
},
{
"entropy": 6.197255945205688,
"epoch": 1.2694277640409748,
"grad_norm": 2.609375,
"learning_rate": 0.00048441600816321424,
"loss": 5.8857,
"mean_token_accuracy": 0.15596015900373458,
"num_tokens": 26783613.0,
"step": 14375
},
{
"entropy": 6.077794361114502,
"epoch": 1.2698693041328153,
"grad_norm": 2.171875,
"learning_rate": 0.0004844044900716647,
"loss": 5.7364,
"mean_token_accuracy": 0.17312929779291153,
"num_tokens": 26792136.0,
"step": 14380
},
{
"entropy": 5.995059061050415,
"epoch": 1.2703108442246556,
"grad_norm": 3.125,
"learning_rate": 0.0004843929678780004,
"loss": 5.7601,
"mean_token_accuracy": 0.17496670186519622,
"num_tokens": 26801481.0,
"step": 14385
},
{
"entropy": 6.061667394638062,
"epoch": 1.2707523843164958,
"grad_norm": 2.5,
"learning_rate": 0.0004843814415824469,
"loss": 5.8383,
"mean_token_accuracy": 0.16960816234350204,
"num_tokens": 26810503.0,
"step": 14390
},
{
"entropy": 6.17726845741272,
"epoch": 1.2711939244083363,
"grad_norm": 3.171875,
"learning_rate": 0.00048436991118523003,
"loss": 5.8768,
"mean_token_accuracy": 0.1664159491658211,
"num_tokens": 26820007.0,
"step": 14395
},
{
"entropy": 6.183840322494507,
"epoch": 1.2716354645001766,
"grad_norm": 1.953125,
"learning_rate": 0.00048435837668657565,
"loss": 5.7991,
"mean_token_accuracy": 0.1732293337583542,
"num_tokens": 26829088.0,
"step": 14400
},
{
"entropy": 6.129194974899292,
"epoch": 1.272077004592017,
"grad_norm": 2.3125,
"learning_rate": 0.0004843468380867098,
"loss": 5.8966,
"mean_token_accuracy": 0.16514162123203277,
"num_tokens": 26838619.0,
"step": 14405
},
{
"entropy": 6.132748413085937,
"epoch": 1.2725185446838574,
"grad_norm": 2.3125,
"learning_rate": 0.0004843352953858585,
"loss": 5.9294,
"mean_token_accuracy": 0.15763575285673143,
"num_tokens": 26848728.0,
"step": 14410
},
{
"entropy": 6.1520415306091305,
"epoch": 1.2729600847756977,
"grad_norm": 3.03125,
"learning_rate": 0.0004843237485842477,
"loss": 5.8131,
"mean_token_accuracy": 0.17334870994091034,
"num_tokens": 26859293.0,
"step": 14415
},
{
"entropy": 6.1314552307128904,
"epoch": 1.273401624867538,
"grad_norm": 2.828125,
"learning_rate": 0.00048431219768210374,
"loss": 5.8657,
"mean_token_accuracy": 0.1615030735731125,
"num_tokens": 26868818.0,
"step": 14420
},
{
"entropy": 6.170149612426758,
"epoch": 1.2738431649593784,
"grad_norm": 2.625,
"learning_rate": 0.0004843006426796529,
"loss": 5.9686,
"mean_token_accuracy": 0.15632271766662598,
"num_tokens": 26879245.0,
"step": 14425
},
{
"entropy": 6.111551952362061,
"epoch": 1.2742847050512187,
"grad_norm": 2.09375,
"learning_rate": 0.0004842890835771215,
"loss": 5.8461,
"mean_token_accuracy": 0.15920765399932862,
"num_tokens": 26888074.0,
"step": 14430
},
{
"entropy": 6.118341255187988,
"epoch": 1.274726245143059,
"grad_norm": 1.703125,
"learning_rate": 0.000484277520374736,
"loss": 5.8886,
"mean_token_accuracy": 0.15607891380786895,
"num_tokens": 26897324.0,
"step": 14435
},
{
"entropy": 6.257852983474732,
"epoch": 1.2751677852348993,
"grad_norm": 2.5,
"learning_rate": 0.00048426595307272285,
"loss": 5.9946,
"mean_token_accuracy": 0.1537822261452675,
"num_tokens": 26906797.0,
"step": 14440
},
{
"entropy": 6.224507427215576,
"epoch": 1.2756093253267395,
"grad_norm": 1.9453125,
"learning_rate": 0.00048425438167130875,
"loss": 5.9096,
"mean_token_accuracy": 0.16379511207342148,
"num_tokens": 26915737.0,
"step": 14445
},
{
"entropy": 6.080619955062867,
"epoch": 1.27605086541858,
"grad_norm": 2.578125,
"learning_rate": 0.00048424280617072026,
"loss": 5.8592,
"mean_token_accuracy": 0.16368652135133743,
"num_tokens": 26925364.0,
"step": 14450
},
{
"entropy": 6.127726125717163,
"epoch": 1.2764924055104203,
"grad_norm": 2.609375,
"learning_rate": 0.00048423122657118424,
"loss": 5.8387,
"mean_token_accuracy": 0.1685597315430641,
"num_tokens": 26935188.0,
"step": 14455
},
{
"entropy": 6.072376918792725,
"epoch": 1.2769339456022606,
"grad_norm": 4.78125,
"learning_rate": 0.00048421964287292745,
"loss": 5.843,
"mean_token_accuracy": 0.15803807228803635,
"num_tokens": 26944606.0,
"step": 14460
},
{
"entropy": 6.142983722686767,
"epoch": 1.277375485694101,
"grad_norm": 3.34375,
"learning_rate": 0.0004842080550761769,
"loss": 5.9718,
"mean_token_accuracy": 0.15605006814002992,
"num_tokens": 26955147.0,
"step": 14465
},
{
"entropy": 6.165853214263916,
"epoch": 1.2778170257859414,
"grad_norm": 2.328125,
"learning_rate": 0.0004841964631811595,
"loss": 5.8965,
"mean_token_accuracy": 0.16626695543527603,
"num_tokens": 26964243.0,
"step": 14470
},
{
"entropy": 6.209317636489868,
"epoch": 1.2782585658777816,
"grad_norm": 2.4375,
"learning_rate": 0.00048418486718810244,
"loss": 5.8682,
"mean_token_accuracy": 0.1643933415412903,
"num_tokens": 26973284.0,
"step": 14475
},
{
"entropy": 6.184624290466308,
"epoch": 1.2787001059696221,
"grad_norm": 3.15625,
"learning_rate": 0.0004841732670972327,
"loss": 5.9916,
"mean_token_accuracy": 0.15883616656064986,
"num_tokens": 26982757.0,
"step": 14480
},
{
"entropy": 6.193442010879517,
"epoch": 1.2791416460614624,
"grad_norm": 2.203125,
"learning_rate": 0.0004841616629087776,
"loss": 5.9018,
"mean_token_accuracy": 0.15999936312437057,
"num_tokens": 26991784.0,
"step": 14485
},
{
"entropy": 6.151190710067749,
"epoch": 1.2795831861533027,
"grad_norm": 3.25,
"learning_rate": 0.00048415005462296455,
"loss": 5.8902,
"mean_token_accuracy": 0.15290504842996597,
"num_tokens": 27000700.0,
"step": 14490
},
{
"entropy": 6.140058612823486,
"epoch": 1.2800247262451432,
"grad_norm": 1.921875,
"learning_rate": 0.0004841384422400209,
"loss": 5.8794,
"mean_token_accuracy": 0.171645949780941,
"num_tokens": 27010089.0,
"step": 14495
},
{
"entropy": 6.116581869125366,
"epoch": 1.2804662663369835,
"grad_norm": 2.578125,
"learning_rate": 0.0004841268257601741,
"loss": 5.8641,
"mean_token_accuracy": 0.17200329452753066,
"num_tokens": 27018961.0,
"step": 14500
},
{
"entropy": 6.1865123271942135,
"epoch": 1.2809078064288237,
"grad_norm": 2.5625,
"learning_rate": 0.0004841152051836517,
"loss": 5.9238,
"mean_token_accuracy": 0.1587506651878357,
"num_tokens": 27027905.0,
"step": 14505
},
{
"entropy": 6.124426460266113,
"epoch": 1.281349346520664,
"grad_norm": 2.265625,
"learning_rate": 0.00048410358051068135,
"loss": 5.8579,
"mean_token_accuracy": 0.16221634298563004,
"num_tokens": 27036969.0,
"step": 14510
},
{
"entropy": 6.061507511138916,
"epoch": 1.2817908866125043,
"grad_norm": 2.78125,
"learning_rate": 0.0004840919517414908,
"loss": 5.7944,
"mean_token_accuracy": 0.17250969856977463,
"num_tokens": 27046654.0,
"step": 14515
},
{
"entropy": 6.1255275249481205,
"epoch": 1.2822324267043448,
"grad_norm": 2.1875,
"learning_rate": 0.00048408031887630775,
"loss": 5.9196,
"mean_token_accuracy": 0.15730711817741394,
"num_tokens": 27058492.0,
"step": 14520
},
{
"entropy": 6.171198034286499,
"epoch": 1.282673966796185,
"grad_norm": 2.9375,
"learning_rate": 0.0004840686819153604,
"loss": 5.9042,
"mean_token_accuracy": 0.16251834034919738,
"num_tokens": 27068863.0,
"step": 14525
},
{
"entropy": 6.154170560836792,
"epoch": 1.2831155068880253,
"grad_norm": 2.1875,
"learning_rate": 0.0004840570408588762,
"loss": 5.8719,
"mean_token_accuracy": 0.16697724908590317,
"num_tokens": 27078793.0,
"step": 14530
},
{
"entropy": 6.068362855911255,
"epoch": 1.2835570469798658,
"grad_norm": 1.703125,
"learning_rate": 0.0004840453957070836,
"loss": 5.6898,
"mean_token_accuracy": 0.17843896001577378,
"num_tokens": 27087093.0,
"step": 14535
},
{
"entropy": 6.085438966751099,
"epoch": 1.283998587071706,
"grad_norm": 2.296875,
"learning_rate": 0.00048403374646021057,
"loss": 5.8076,
"mean_token_accuracy": 0.16237097680568696,
"num_tokens": 27096601.0,
"step": 14540
},
{
"entropy": 6.082821607589722,
"epoch": 1.2844401271635464,
"grad_norm": 2.65625,
"learning_rate": 0.00048402209311848533,
"loss": 5.8422,
"mean_token_accuracy": 0.16673152148723602,
"num_tokens": 27105041.0,
"step": 14545
},
{
"entropy": 6.135830926895141,
"epoch": 1.2848816672553869,
"grad_norm": 3.15625,
"learning_rate": 0.00048401043568213614,
"loss": 5.8988,
"mean_token_accuracy": 0.1641928881406784,
"num_tokens": 27114252.0,
"step": 14550
},
{
"entropy": 6.090911388397217,
"epoch": 1.2853232073472272,
"grad_norm": 2.109375,
"learning_rate": 0.0004839987741513914,
"loss": 5.8332,
"mean_token_accuracy": 0.16361680030822753,
"num_tokens": 27122480.0,
"step": 14555
},
{
"entropy": 6.131658983230591,
"epoch": 1.2857647474390674,
"grad_norm": 2.09375,
"learning_rate": 0.00048398710852647954,
"loss": 5.8951,
"mean_token_accuracy": 0.16015824377536775,
"num_tokens": 27132322.0,
"step": 14560
},
{
"entropy": 6.032856035232544,
"epoch": 1.286206287530908,
"grad_norm": 1.8046875,
"learning_rate": 0.00048397543880762905,
"loss": 5.7427,
"mean_token_accuracy": 0.1796887770295143,
"num_tokens": 27140782.0,
"step": 14565
},
{
"entropy": 6.018607234954834,
"epoch": 1.2866478276227482,
"grad_norm": 2.375,
"learning_rate": 0.00048396376499506866,
"loss": 5.8039,
"mean_token_accuracy": 0.172633196413517,
"num_tokens": 27150058.0,
"step": 14570
},
{
"entropy": 6.040059804916382,
"epoch": 1.2870893677145885,
"grad_norm": 2.25,
"learning_rate": 0.00048395208708902686,
"loss": 5.8282,
"mean_token_accuracy": 0.16738837957382202,
"num_tokens": 27159574.0,
"step": 14575
},
{
"entropy": 6.1127971649169925,
"epoch": 1.2875309078064288,
"grad_norm": 3.34375,
"learning_rate": 0.00048394040508973257,
"loss": 5.8283,
"mean_token_accuracy": 0.171221923828125,
"num_tokens": 27168025.0,
"step": 14580
},
{
"entropy": 6.03394250869751,
"epoch": 1.287972447898269,
"grad_norm": 2.59375,
"learning_rate": 0.0004839287189974145,
"loss": 5.831,
"mean_token_accuracy": 0.1705557808279991,
"num_tokens": 27177108.0,
"step": 14585
},
{
"entropy": 6.145341300964356,
"epoch": 1.2884139879901095,
"grad_norm": 2.859375,
"learning_rate": 0.00048391702881230177,
"loss": 5.9042,
"mean_token_accuracy": 0.16099646538496018,
"num_tokens": 27187486.0,
"step": 14590
},
{
"entropy": 6.217489385604859,
"epoch": 1.2888555280819498,
"grad_norm": 1.546875,
"learning_rate": 0.0004839053345346232,
"loss": 5.8905,
"mean_token_accuracy": 0.16132012903690338,
"num_tokens": 27195962.0,
"step": 14595
},
{
"entropy": 6.103551435470581,
"epoch": 1.28929706817379,
"grad_norm": 2.625,
"learning_rate": 0.0004838936361646079,
"loss": 5.876,
"mean_token_accuracy": 0.16703880578279495,
"num_tokens": 27206354.0,
"step": 14600
},
{
"entropy": 6.024764680862427,
"epoch": 1.2897386082656306,
"grad_norm": 2.28125,
"learning_rate": 0.0004838819337024852,
"loss": 5.7628,
"mean_token_accuracy": 0.1760987877845764,
"num_tokens": 27215326.0,
"step": 14605
},
{
"entropy": 6.072511053085327,
"epoch": 1.2901801483574709,
"grad_norm": 2.453125,
"learning_rate": 0.00048387022714848406,
"loss": 5.8482,
"mean_token_accuracy": 0.16088065057992934,
"num_tokens": 27224253.0,
"step": 14610
},
{
"entropy": 6.139302396774292,
"epoch": 1.2906216884493111,
"grad_norm": 2.9375,
"learning_rate": 0.000483858516502834,
"loss": 5.8308,
"mean_token_accuracy": 0.1665348932147026,
"num_tokens": 27233007.0,
"step": 14615
},
{
"entropy": 6.134923696517944,
"epoch": 1.2910632285411516,
"grad_norm": 2.78125,
"learning_rate": 0.0004838468017657644,
"loss": 5.8053,
"mean_token_accuracy": 0.1715182915329933,
"num_tokens": 27242127.0,
"step": 14620
},
{
"entropy": 6.101357889175415,
"epoch": 1.291504768632992,
"grad_norm": 2.328125,
"learning_rate": 0.00048383508293750474,
"loss": 5.9304,
"mean_token_accuracy": 0.16075924187898635,
"num_tokens": 27252753.0,
"step": 14625
},
{
"entropy": 6.119095420837402,
"epoch": 1.2919463087248322,
"grad_norm": 2.4375,
"learning_rate": 0.0004838233600182846,
"loss": 5.9197,
"mean_token_accuracy": 0.16098798364400863,
"num_tokens": 27262498.0,
"step": 14630
},
{
"entropy": 6.233774089813233,
"epoch": 1.2923878488166727,
"grad_norm": 3.203125,
"learning_rate": 0.0004838116330083336,
"loss": 5.9211,
"mean_token_accuracy": 0.1550293117761612,
"num_tokens": 27271524.0,
"step": 14635
},
{
"entropy": 6.06533670425415,
"epoch": 1.292829388908513,
"grad_norm": 3.03125,
"learning_rate": 0.0004837999019078814,
"loss": 5.7735,
"mean_token_accuracy": 0.179975463449955,
"num_tokens": 27280649.0,
"step": 14640
},
{
"entropy": 6.079719209671021,
"epoch": 1.2932709290003532,
"grad_norm": 1.6875,
"learning_rate": 0.0004837881667171579,
"loss": 5.8816,
"mean_token_accuracy": 0.16293418183922767,
"num_tokens": 27289593.0,
"step": 14645
},
{
"entropy": 6.10697603225708,
"epoch": 1.2937124690921935,
"grad_norm": 3.8125,
"learning_rate": 0.00048377642743639297,
"loss": 5.8653,
"mean_token_accuracy": 0.16224816143512727,
"num_tokens": 27298070.0,
"step": 14650
},
{
"entropy": 6.112291622161865,
"epoch": 1.2941540091840338,
"grad_norm": 2.734375,
"learning_rate": 0.0004837646840658166,
"loss": 5.817,
"mean_token_accuracy": 0.1708909824490547,
"num_tokens": 27306738.0,
"step": 14655
},
{
"entropy": 6.106364727020264,
"epoch": 1.2945955492758743,
"grad_norm": 13.9375,
"learning_rate": 0.00048375293660565875,
"loss": 5.7821,
"mean_token_accuracy": 0.17206882536411286,
"num_tokens": 27315243.0,
"step": 14660
},
{
"entropy": 6.045690822601318,
"epoch": 1.2950370893677146,
"grad_norm": 2.640625,
"learning_rate": 0.0004837411850561496,
"loss": 5.7951,
"mean_token_accuracy": 0.17230505347251893,
"num_tokens": 27325327.0,
"step": 14665
},
{
"entropy": 6.089082098007202,
"epoch": 1.2954786294595548,
"grad_norm": 4.15625,
"learning_rate": 0.00048372942941751935,
"loss": 5.8043,
"mean_token_accuracy": 0.16932259798049926,
"num_tokens": 27333436.0,
"step": 14670
},
{
"entropy": 6.163468980789185,
"epoch": 1.2959201695513953,
"grad_norm": 3.859375,
"learning_rate": 0.0004837176696899984,
"loss": 5.8946,
"mean_token_accuracy": 0.15493651032447814,
"num_tokens": 27342689.0,
"step": 14675
},
{
"entropy": 6.184423112869263,
"epoch": 1.2963617096432356,
"grad_norm": 2.5,
"learning_rate": 0.00048370590587381684,
"loss": 5.9036,
"mean_token_accuracy": 0.16661220788955688,
"num_tokens": 27352347.0,
"step": 14680
},
{
"entropy": 6.180910348892212,
"epoch": 1.2968032497350759,
"grad_norm": 2.78125,
"learning_rate": 0.00048369413796920535,
"loss": 5.8917,
"mean_token_accuracy": 0.1609325811266899,
"num_tokens": 27362153.0,
"step": 14685
},
{
"entropy": 6.088586807250977,
"epoch": 1.2972447898269164,
"grad_norm": 2.6875,
"learning_rate": 0.0004836823659763944,
"loss": 5.8379,
"mean_token_accuracy": 0.1620209276676178,
"num_tokens": 27371126.0,
"step": 14690
},
{
"entropy": 6.041259050369263,
"epoch": 1.2976863299187567,
"grad_norm": 2.28125,
"learning_rate": 0.00048367058989561457,
"loss": 5.7826,
"mean_token_accuracy": 0.16869217455387114,
"num_tokens": 27380727.0,
"step": 14695
},
{
"entropy": 6.072365570068359,
"epoch": 1.298127870010597,
"grad_norm": 1.8515625,
"learning_rate": 0.0004836588097270966,
"loss": 5.8143,
"mean_token_accuracy": 0.17087250500917434,
"num_tokens": 27389970.0,
"step": 14700
},
{
"entropy": 6.070573568344116,
"epoch": 1.2985694101024374,
"grad_norm": 2.953125,
"learning_rate": 0.00048364702547107113,
"loss": 5.7809,
"mean_token_accuracy": 0.16785792112350464,
"num_tokens": 27399177.0,
"step": 14705
},
{
"entropy": 6.109463453292847,
"epoch": 1.2990109501942777,
"grad_norm": 2.125,
"learning_rate": 0.0004836352371277692,
"loss": 5.8681,
"mean_token_accuracy": 0.1681496560573578,
"num_tokens": 27408776.0,
"step": 14710
},
{
"entropy": 6.163292455673218,
"epoch": 1.299452490286118,
"grad_norm": 3.890625,
"learning_rate": 0.0004836234446974216,
"loss": 5.888,
"mean_token_accuracy": 0.16215358227491378,
"num_tokens": 27418708.0,
"step": 14715
},
{
"entropy": 6.145340156555176,
"epoch": 1.2998940303779583,
"grad_norm": 1.9765625,
"learning_rate": 0.0004836116481802593,
"loss": 5.8349,
"mean_token_accuracy": 0.15989116579294205,
"num_tokens": 27428027.0,
"step": 14720
},
{
"entropy": 6.0494026184082035,
"epoch": 1.3003355704697985,
"grad_norm": 2.90625,
"learning_rate": 0.00048359984757651356,
"loss": 5.8184,
"mean_token_accuracy": 0.168062923848629,
"num_tokens": 27438214.0,
"step": 14725
},
{
"entropy": 6.105874490737915,
"epoch": 1.300777110561639,
"grad_norm": 2.171875,
"learning_rate": 0.00048358804288641536,
"loss": 5.7722,
"mean_token_accuracy": 0.17204080522060394,
"num_tokens": 27447413.0,
"step": 14730
},
{
"entropy": 6.071741724014283,
"epoch": 1.3012186506534793,
"grad_norm": 1.875,
"learning_rate": 0.00048357623411019607,
"loss": 5.8034,
"mean_token_accuracy": 0.17326364368200303,
"num_tokens": 27456316.0,
"step": 14735
},
{
"entropy": 6.0693634986877445,
"epoch": 1.3016601907453196,
"grad_norm": 3.3125,
"learning_rate": 0.000483564421248087,
"loss": 5.8548,
"mean_token_accuracy": 0.16446566432714463,
"num_tokens": 27465346.0,
"step": 14740
},
{
"entropy": 6.0759665966033936,
"epoch": 1.30210173083716,
"grad_norm": 1.9140625,
"learning_rate": 0.00048355260430031947,
"loss": 5.7154,
"mean_token_accuracy": 0.17398118376731872,
"num_tokens": 27473367.0,
"step": 14745
},
{
"entropy": 6.180927848815918,
"epoch": 1.3025432709290004,
"grad_norm": 1.9140625,
"learning_rate": 0.000483540783267125,
"loss": 5.8793,
"mean_token_accuracy": 0.16668969988822938,
"num_tokens": 27482187.0,
"step": 14750
},
{
"entropy": 6.044179821014405,
"epoch": 1.3029848110208406,
"grad_norm": 2.125,
"learning_rate": 0.00048352895814873526,
"loss": 5.8307,
"mean_token_accuracy": 0.16555362790822983,
"num_tokens": 27492406.0,
"step": 14755
},
{
"entropy": 6.1381090641021725,
"epoch": 1.3034263511126811,
"grad_norm": 4.90625,
"learning_rate": 0.0004835171289453818,
"loss": 5.9041,
"mean_token_accuracy": 0.16844140291213988,
"num_tokens": 27501929.0,
"step": 14760
},
{
"entropy": 6.1399494171142575,
"epoch": 1.3038678912045214,
"grad_norm": 3.296875,
"learning_rate": 0.0004835052956572964,
"loss": 5.7552,
"mean_token_accuracy": 0.1800333470106125,
"num_tokens": 27510657.0,
"step": 14765
},
{
"entropy": 6.150950336456299,
"epoch": 1.3043094312963617,
"grad_norm": 2.359375,
"learning_rate": 0.00048349345828471084,
"loss": 5.8814,
"mean_token_accuracy": 0.15844749212265014,
"num_tokens": 27519726.0,
"step": 14770
},
{
"entropy": 6.092508554458618,
"epoch": 1.3047509713882022,
"grad_norm": 2.296875,
"learning_rate": 0.00048348161682785704,
"loss": 5.8137,
"mean_token_accuracy": 0.16911299675703048,
"num_tokens": 27528876.0,
"step": 14775
},
{
"entropy": 6.141333961486817,
"epoch": 1.3051925114800424,
"grad_norm": 2.828125,
"learning_rate": 0.0004834697712869669,
"loss": 5.8581,
"mean_token_accuracy": 0.16234237402677537,
"num_tokens": 27537782.0,
"step": 14780
},
{
"entropy": 6.121736001968384,
"epoch": 1.3056340515718827,
"grad_norm": 2.34375,
"learning_rate": 0.0004834579216622725,
"loss": 5.8897,
"mean_token_accuracy": 0.15997308045625686,
"num_tokens": 27547322.0,
"step": 14785
},
{
"entropy": 6.057508039474487,
"epoch": 1.306075591663723,
"grad_norm": 2.0,
"learning_rate": 0.000483446067954006,
"loss": 5.8321,
"mean_token_accuracy": 0.16432782709598542,
"num_tokens": 27556070.0,
"step": 14790
},
{
"entropy": 6.096183824539184,
"epoch": 1.3065171317555633,
"grad_norm": 2.453125,
"learning_rate": 0.00048343421016239945,
"loss": 5.7287,
"mean_token_accuracy": 0.1731596902012825,
"num_tokens": 27565951.0,
"step": 14795
},
{
"entropy": 6.149411392211914,
"epoch": 1.3069586718474038,
"grad_norm": 2.875,
"learning_rate": 0.0004834223482876854,
"loss": 5.8147,
"mean_token_accuracy": 0.16476430892944335,
"num_tokens": 27575102.0,
"step": 14800
},
{
"entropy": 6.112444591522217,
"epoch": 1.307400211939244,
"grad_norm": 2.21875,
"learning_rate": 0.0004834104823300961,
"loss": 5.897,
"mean_token_accuracy": 0.16114081740379332,
"num_tokens": 27584854.0,
"step": 14805
},
{
"entropy": 6.037489366531372,
"epoch": 1.3078417520310843,
"grad_norm": 1.7734375,
"learning_rate": 0.00048339861228986395,
"loss": 5.8641,
"mean_token_accuracy": 0.1685006335377693,
"num_tokens": 27593403.0,
"step": 14810
},
{
"entropy": 6.143943214416504,
"epoch": 1.3082832921229248,
"grad_norm": 2.015625,
"learning_rate": 0.00048338673816722145,
"loss": 5.913,
"mean_token_accuracy": 0.1651505082845688,
"num_tokens": 27602162.0,
"step": 14815
},
{
"entropy": 6.1351995944976805,
"epoch": 1.308724832214765,
"grad_norm": 2.046875,
"learning_rate": 0.00048337485996240127,
"loss": 5.8971,
"mean_token_accuracy": 0.16223164647817612,
"num_tokens": 27611433.0,
"step": 14820
},
{
"entropy": 6.098017930984497,
"epoch": 1.3091663723066054,
"grad_norm": 1.9765625,
"learning_rate": 0.0004833629776756362,
"loss": 5.7775,
"mean_token_accuracy": 0.16917534321546554,
"num_tokens": 27620443.0,
"step": 14825
},
{
"entropy": 6.133377981185913,
"epoch": 1.3096079123984459,
"grad_norm": 2.953125,
"learning_rate": 0.00048335109130715875,
"loss": 5.8337,
"mean_token_accuracy": 0.1614580422639847,
"num_tokens": 27629507.0,
"step": 14830
},
{
"entropy": 6.099104213714599,
"epoch": 1.3100494524902861,
"grad_norm": 2.8125,
"learning_rate": 0.0004833392008572021,
"loss": 5.8464,
"mean_token_accuracy": 0.16543120592832566,
"num_tokens": 27638355.0,
"step": 14835
},
{
"entropy": 6.133207178115844,
"epoch": 1.3104909925821264,
"grad_norm": 2.296875,
"learning_rate": 0.00048332730632599883,
"loss": 5.8851,
"mean_token_accuracy": 0.1581098571419716,
"num_tokens": 27649074.0,
"step": 14840
},
{
"entropy": 6.135370922088623,
"epoch": 1.310932532673967,
"grad_norm": 2.25,
"learning_rate": 0.0004833154077137821,
"loss": 5.9007,
"mean_token_accuracy": 0.15967036336660384,
"num_tokens": 27658564.0,
"step": 14845
},
{
"entropy": 6.13015661239624,
"epoch": 1.3113740727658072,
"grad_norm": 4.59375,
"learning_rate": 0.00048330350502078515,
"loss": 5.8179,
"mean_token_accuracy": 0.16793240308761598,
"num_tokens": 27667963.0,
"step": 14850
},
{
"entropy": 6.091243886947632,
"epoch": 1.3118156128576475,
"grad_norm": 2.828125,
"learning_rate": 0.00048329159824724087,
"loss": 5.8893,
"mean_token_accuracy": 0.16307069063186647,
"num_tokens": 27677528.0,
"step": 14855
},
{
"entropy": 6.141044616699219,
"epoch": 1.3122571529494877,
"grad_norm": 3.1875,
"learning_rate": 0.00048327968739338275,
"loss": 5.7986,
"mean_token_accuracy": 0.1721947595477104,
"num_tokens": 27687659.0,
"step": 14860
},
{
"entropy": 6.049520444869995,
"epoch": 1.312698693041328,
"grad_norm": 2.671875,
"learning_rate": 0.00048326777245944396,
"loss": 5.7619,
"mean_token_accuracy": 0.1727842539548874,
"num_tokens": 27697222.0,
"step": 14865
},
{
"entropy": 6.118183183670044,
"epoch": 1.3131402331331685,
"grad_norm": 1.8125,
"learning_rate": 0.000483255853445658,
"loss": 5.8343,
"mean_token_accuracy": 0.1621834859251976,
"num_tokens": 27705664.0,
"step": 14870
},
{
"entropy": 6.090791320800781,
"epoch": 1.3135817732250088,
"grad_norm": 2.34375,
"learning_rate": 0.00048324393035225824,
"loss": 5.7686,
"mean_token_accuracy": 0.17112854570150376,
"num_tokens": 27714879.0,
"step": 14875
},
{
"entropy": 6.090616035461426,
"epoch": 1.314023313316849,
"grad_norm": 2.9375,
"learning_rate": 0.0004832320031794783,
"loss": 5.9063,
"mean_token_accuracy": 0.15934463888406752,
"num_tokens": 27724749.0,
"step": 14880
},
{
"entropy": 6.1220927238464355,
"epoch": 1.3144648534086896,
"grad_norm": 8.4375,
"learning_rate": 0.0004832200719275519,
"loss": 5.8492,
"mean_token_accuracy": 0.16810837239027024,
"num_tokens": 27733109.0,
"step": 14885
},
{
"entropy": 5.954726123809815,
"epoch": 1.3149063935005298,
"grad_norm": 2.0,
"learning_rate": 0.0004832081365967128,
"loss": 5.6406,
"mean_token_accuracy": 0.17786082327365876,
"num_tokens": 27742079.0,
"step": 14890
},
{
"entropy": 6.080218076705933,
"epoch": 1.3153479335923701,
"grad_norm": 2.65625,
"learning_rate": 0.00048319619718719455,
"loss": 5.8995,
"mean_token_accuracy": 0.15869901478290557,
"num_tokens": 27750900.0,
"step": 14895
},
{
"entropy": 6.142256021499634,
"epoch": 1.3157894736842106,
"grad_norm": 2.4375,
"learning_rate": 0.00048318425369923133,
"loss": 5.7749,
"mean_token_accuracy": 0.1716325968503952,
"num_tokens": 27760392.0,
"step": 14900
},
{
"entropy": 6.082767915725708,
"epoch": 1.316231013776051,
"grad_norm": 10.625,
"learning_rate": 0.0004831723061330569,
"loss": 5.8279,
"mean_token_accuracy": 0.16682397872209548,
"num_tokens": 27768805.0,
"step": 14905
},
{
"entropy": 6.139829778671265,
"epoch": 1.3166725538678912,
"grad_norm": 2.890625,
"learning_rate": 0.00048316035448890546,
"loss": 5.9302,
"mean_token_accuracy": 0.15849231481552123,
"num_tokens": 27777165.0,
"step": 14910
},
{
"entropy": 6.193636703491211,
"epoch": 1.3171140939597317,
"grad_norm": 1.9921875,
"learning_rate": 0.000483148398767011,
"loss": 5.8617,
"mean_token_accuracy": 0.16692374497652054,
"num_tokens": 27786709.0,
"step": 14915
},
{
"entropy": 6.105738925933838,
"epoch": 1.317555634051572,
"grad_norm": 2.21875,
"learning_rate": 0.00048313643896760776,
"loss": 5.8156,
"mean_token_accuracy": 0.16707513034343718,
"num_tokens": 27795977.0,
"step": 14920
},
{
"entropy": 5.985495328903198,
"epoch": 1.3179971741434122,
"grad_norm": 2.6875,
"learning_rate": 0.00048312447509093017,
"loss": 5.8133,
"mean_token_accuracy": 0.16331840306520462,
"num_tokens": 27804838.0,
"step": 14925
},
{
"entropy": 6.080651092529297,
"epoch": 1.3184387142352525,
"grad_norm": 1.7578125,
"learning_rate": 0.0004831125071372124,
"loss": 5.7898,
"mean_token_accuracy": 0.17360212355852128,
"num_tokens": 27813245.0,
"step": 14930
},
{
"entropy": 6.191033887863159,
"epoch": 1.3188802543270928,
"grad_norm": 2.15625,
"learning_rate": 0.0004831005351066889,
"loss": 5.9278,
"mean_token_accuracy": 0.1587008997797966,
"num_tokens": 27822509.0,
"step": 14935
},
{
"entropy": 6.068882608413697,
"epoch": 1.3193217944189333,
"grad_norm": 1.8046875,
"learning_rate": 0.0004830885589995944,
"loss": 5.7035,
"mean_token_accuracy": 0.17657861709594727,
"num_tokens": 27831140.0,
"step": 14940
},
{
"entropy": 6.138643836975097,
"epoch": 1.3197633345107735,
"grad_norm": 2.3125,
"learning_rate": 0.00048307657881616333,
"loss": 5.8499,
"mean_token_accuracy": 0.16606489568948746,
"num_tokens": 27839537.0,
"step": 14945
},
{
"entropy": 6.109628343582154,
"epoch": 1.3202048746026138,
"grad_norm": 2.125,
"learning_rate": 0.00048306459455663045,
"loss": 5.8107,
"mean_token_accuracy": 0.16881278902292252,
"num_tokens": 27848888.0,
"step": 14950
},
{
"entropy": 6.120524215698242,
"epoch": 1.3206464146944543,
"grad_norm": 2.046875,
"learning_rate": 0.0004830526062212305,
"loss": 5.8721,
"mean_token_accuracy": 0.16518960148096085,
"num_tokens": 27858910.0,
"step": 14955
},
{
"entropy": 6.089692640304565,
"epoch": 1.3210879547862946,
"grad_norm": 1.7734375,
"learning_rate": 0.00048304061381019826,
"loss": 5.7677,
"mean_token_accuracy": 0.17031149715185165,
"num_tokens": 27867967.0,
"step": 14960
},
{
"entropy": 6.092630434036255,
"epoch": 1.3215294948781349,
"grad_norm": 3.34375,
"learning_rate": 0.00048302861732376875,
"loss": 5.8115,
"mean_token_accuracy": 0.1667775481939316,
"num_tokens": 27877317.0,
"step": 14965
},
{
"entropy": 6.199188280105591,
"epoch": 1.3219710349699754,
"grad_norm": 2.140625,
"learning_rate": 0.00048301661676217693,
"loss": 5.8637,
"mean_token_accuracy": 0.16289620399475097,
"num_tokens": 27886400.0,
"step": 14970
},
{
"entropy": 6.0974963188171385,
"epoch": 1.3224125750618156,
"grad_norm": 2.65625,
"learning_rate": 0.0004830046121256579,
"loss": 5.8328,
"mean_token_accuracy": 0.16152075678110123,
"num_tokens": 27895816.0,
"step": 14975
},
{
"entropy": 6.107424640655518,
"epoch": 1.322854115153656,
"grad_norm": 2.3125,
"learning_rate": 0.0004829926034144468,
"loss": 5.8818,
"mean_token_accuracy": 0.16811034083366394,
"num_tokens": 27905614.0,
"step": 14980
},
{
"entropy": 6.13788332939148,
"epoch": 1.3232956552454964,
"grad_norm": 3.25,
"learning_rate": 0.0004829805906287789,
"loss": 5.8802,
"mean_token_accuracy": 0.16269793808460237,
"num_tokens": 27914714.0,
"step": 14985
},
{
"entropy": 6.1333986759185795,
"epoch": 1.3237371953373367,
"grad_norm": 2.796875,
"learning_rate": 0.0004829685737688895,
"loss": 5.8198,
"mean_token_accuracy": 0.17129550129175186,
"num_tokens": 27924821.0,
"step": 14990
},
{
"entropy": 6.190295886993408,
"epoch": 1.324178735429177,
"grad_norm": 2.703125,
"learning_rate": 0.00048295655283501403,
"loss": 5.8926,
"mean_token_accuracy": 0.15920265167951583,
"num_tokens": 27934028.0,
"step": 14995
},
{
"entropy": 6.077135276794434,
"epoch": 1.3246202755210172,
"grad_norm": 1.9921875,
"learning_rate": 0.000482944527827388,
"loss": 5.8223,
"mean_token_accuracy": 0.16229647845029832,
"num_tokens": 27943550.0,
"step": 15000
},
{
"epoch": 1.3246202755210172,
"eval_entropy": 5.889123602442671,
"eval_loss": 5.924129962921143,
"eval_mean_token_accuracy": 0.16966596707345186,
"eval_num_tokens": 27943550.0,
"eval_runtime": 26.3053,
"eval_samples_per_second": 1342.505,
"eval_steps_per_second": 167.837,
"step": 15000
},
{
"entropy": 6.095951843261719,
"epoch": 1.3250618156128575,
"grad_norm": 2.453125,
"learning_rate": 0.0004829324987462469,
"loss": 5.8226,
"mean_token_accuracy": 0.16381940990686417,
"num_tokens": 27952752.0,
"step": 15005
},
{
"entropy": 6.129462814331054,
"epoch": 1.325503355704698,
"grad_norm": 2.25,
"learning_rate": 0.0004829204655918264,
"loss": 5.8825,
"mean_token_accuracy": 0.16063541024923325,
"num_tokens": 27961535.0,
"step": 15010
},
{
"entropy": 6.122554302215576,
"epoch": 1.3259448957965383,
"grad_norm": 2.78125,
"learning_rate": 0.00048290842836436226,
"loss": 5.8392,
"mean_token_accuracy": 0.1680855318903923,
"num_tokens": 27969644.0,
"step": 15015
},
{
"entropy": 6.164657211303711,
"epoch": 1.3263864358883786,
"grad_norm": 1.984375,
"learning_rate": 0.0004828963870640902,
"loss": 5.9699,
"mean_token_accuracy": 0.15246230363845825,
"num_tokens": 27978859.0,
"step": 15020
},
{
"entropy": 6.2173388481140135,
"epoch": 1.326827975980219,
"grad_norm": 2.1875,
"learning_rate": 0.00048288434169124625,
"loss": 5.879,
"mean_token_accuracy": 0.16527478992938996,
"num_tokens": 27988693.0,
"step": 15025
},
{
"entropy": 6.172191143035889,
"epoch": 1.3272695160720593,
"grad_norm": 2.109375,
"learning_rate": 0.0004828722922460662,
"loss": 5.8174,
"mean_token_accuracy": 0.1679329752922058,
"num_tokens": 27998196.0,
"step": 15030
},
{
"entropy": 6.049750089645386,
"epoch": 1.3277110561638996,
"grad_norm": 2.328125,
"learning_rate": 0.00048286023872878614,
"loss": 5.9644,
"mean_token_accuracy": 0.15294583141803741,
"num_tokens": 28008743.0,
"step": 15035
},
{
"entropy": 6.159300470352173,
"epoch": 1.3281525962557401,
"grad_norm": 1.9140625,
"learning_rate": 0.0004828481811396423,
"loss": 5.9168,
"mean_token_accuracy": 0.1563283309340477,
"num_tokens": 28017684.0,
"step": 15040
},
{
"entropy": 6.1062860012054445,
"epoch": 1.3285941363475804,
"grad_norm": 2.5,
"learning_rate": 0.0004828361194788708,
"loss": 5.8998,
"mean_token_accuracy": 0.166116763651371,
"num_tokens": 28027992.0,
"step": 15045
},
{
"entropy": 6.245463514328003,
"epoch": 1.3290356764394207,
"grad_norm": 2.171875,
"learning_rate": 0.00048282405374670785,
"loss": 5.9464,
"mean_token_accuracy": 0.160767562687397,
"num_tokens": 28037457.0,
"step": 15050
},
{
"entropy": 6.13391523361206,
"epoch": 1.3294772165312612,
"grad_norm": 3.03125,
"learning_rate": 0.00048281198394338986,
"loss": 5.9391,
"mean_token_accuracy": 0.16277627646923065,
"num_tokens": 28046881.0,
"step": 15055
},
{
"entropy": 6.071159887313843,
"epoch": 1.3299187566231014,
"grad_norm": 2.1875,
"learning_rate": 0.00048279991006915335,
"loss": 5.7825,
"mean_token_accuracy": 0.16257177591323851,
"num_tokens": 28056932.0,
"step": 15060
},
{
"entropy": 6.120753383636474,
"epoch": 1.3303602967149417,
"grad_norm": 2.53125,
"learning_rate": 0.00048278783212423484,
"loss": 5.9451,
"mean_token_accuracy": 0.1636142835021019,
"num_tokens": 28066843.0,
"step": 15065
},
{
"entropy": 6.108325386047364,
"epoch": 1.330801836806782,
"grad_norm": 2.359375,
"learning_rate": 0.0004827757501088708,
"loss": 5.8554,
"mean_token_accuracy": 0.16379006654024125,
"num_tokens": 28076329.0,
"step": 15070
},
{
"entropy": 6.152166414260864,
"epoch": 1.3312433768986223,
"grad_norm": 2.203125,
"learning_rate": 0.00048276366402329803,
"loss": 5.8993,
"mean_token_accuracy": 0.16465585231781005,
"num_tokens": 28086402.0,
"step": 15075
},
{
"entropy": 6.146426773071289,
"epoch": 1.3316849169904628,
"grad_norm": 3.875,
"learning_rate": 0.0004827515738677532,
"loss": 5.8412,
"mean_token_accuracy": 0.1638173818588257,
"num_tokens": 28095030.0,
"step": 15080
},
{
"entropy": 6.045015144348144,
"epoch": 1.332126457082303,
"grad_norm": 2.453125,
"learning_rate": 0.0004827394796424732,
"loss": 5.8481,
"mean_token_accuracy": 0.1631543904542923,
"num_tokens": 28105138.0,
"step": 15085
},
{
"entropy": 6.091396474838257,
"epoch": 1.3325679971741433,
"grad_norm": 1.9609375,
"learning_rate": 0.00048272738134769503,
"loss": 5.8728,
"mean_token_accuracy": 0.15990833193063736,
"num_tokens": 28114359.0,
"step": 15090
},
{
"entropy": 6.134146070480346,
"epoch": 1.3330095372659838,
"grad_norm": 1.8203125,
"learning_rate": 0.00048271527898365545,
"loss": 5.8449,
"mean_token_accuracy": 0.16874508410692216,
"num_tokens": 28124045.0,
"step": 15095
},
{
"entropy": 6.079765701293946,
"epoch": 1.333451077357824,
"grad_norm": 1.78125,
"learning_rate": 0.0004827031725505917,
"loss": 5.8543,
"mean_token_accuracy": 0.16648634225130082,
"num_tokens": 28132990.0,
"step": 15100
},
{
"entropy": 6.14323353767395,
"epoch": 1.3338926174496644,
"grad_norm": 2.140625,
"learning_rate": 0.0004826910620487411,
"loss": 5.8347,
"mean_token_accuracy": 0.16554337441921235,
"num_tokens": 28142504.0,
"step": 15105
},
{
"entropy": 6.171361589431763,
"epoch": 1.3343341575415049,
"grad_norm": 7.46875,
"learning_rate": 0.0004826789474783405,
"loss": 5.9211,
"mean_token_accuracy": 0.15933604836463927,
"num_tokens": 28151227.0,
"step": 15110
},
{
"entropy": 6.140801572799683,
"epoch": 1.3347756976333451,
"grad_norm": 3.59375,
"learning_rate": 0.0004826668288396276,
"loss": 5.8507,
"mean_token_accuracy": 0.16569503992795945,
"num_tokens": 28160244.0,
"step": 15115
},
{
"entropy": 6.038093233108521,
"epoch": 1.3352172377251854,
"grad_norm": 2.03125,
"learning_rate": 0.00048265470613283954,
"loss": 5.8445,
"mean_token_accuracy": 0.16578713655471802,
"num_tokens": 28169295.0,
"step": 15120
},
{
"entropy": 6.211527013778687,
"epoch": 1.335658777817026,
"grad_norm": 2.015625,
"learning_rate": 0.00048264257935821394,
"loss": 5.8878,
"mean_token_accuracy": 0.1629909172654152,
"num_tokens": 28179199.0,
"step": 15125
},
{
"entropy": 6.19280252456665,
"epoch": 1.3361003179088662,
"grad_norm": 2.3125,
"learning_rate": 0.0004826304485159882,
"loss": 5.9024,
"mean_token_accuracy": 0.1737440198659897,
"num_tokens": 28188315.0,
"step": 15130
},
{
"entropy": 6.1533058166503904,
"epoch": 1.3365418580007065,
"grad_norm": 3.9375,
"learning_rate": 0.00048261831360640016,
"loss": 5.8986,
"mean_token_accuracy": 0.16364324539899827,
"num_tokens": 28197776.0,
"step": 15135
},
{
"entropy": 6.095629787445068,
"epoch": 1.3369833980925467,
"grad_norm": 9.6875,
"learning_rate": 0.00048260617462968735,
"loss": 5.9047,
"mean_token_accuracy": 0.16950749307870866,
"num_tokens": 28207985.0,
"step": 15140
},
{
"entropy": 6.086922454833984,
"epoch": 1.337424938184387,
"grad_norm": 1.8046875,
"learning_rate": 0.00048259403158608773,
"loss": 5.7155,
"mean_token_accuracy": 0.17465082556009293,
"num_tokens": 28216321.0,
"step": 15145
},
{
"entropy": 6.120392799377441,
"epoch": 1.3378664782762275,
"grad_norm": 3.234375,
"learning_rate": 0.0004825818844758391,
"loss": 5.9269,
"mean_token_accuracy": 0.16015772223472596,
"num_tokens": 28226763.0,
"step": 15150
},
{
"entropy": 6.114413690567017,
"epoch": 1.3383080183680678,
"grad_norm": 2.109375,
"learning_rate": 0.00048256973329917943,
"loss": 5.8276,
"mean_token_accuracy": 0.16858740746974946,
"num_tokens": 28236123.0,
"step": 15155
},
{
"entropy": 6.227534437179566,
"epoch": 1.338749558459908,
"grad_norm": 2.359375,
"learning_rate": 0.00048255757805634665,
"loss": 5.9247,
"mean_token_accuracy": 0.16377091109752656,
"num_tokens": 28245848.0,
"step": 15160
},
{
"entropy": 6.084731483459473,
"epoch": 1.3391910985517486,
"grad_norm": 3.640625,
"learning_rate": 0.00048254541874757895,
"loss": 5.9233,
"mean_token_accuracy": 0.16596238762140275,
"num_tokens": 28255414.0,
"step": 15165
},
{
"entropy": 6.059762096405029,
"epoch": 1.3396326386435888,
"grad_norm": 1.8828125,
"learning_rate": 0.00048253325537311463,
"loss": 5.7596,
"mean_token_accuracy": 0.16878272593021393,
"num_tokens": 28264162.0,
"step": 15170
},
{
"entropy": 6.103969478607178,
"epoch": 1.3400741787354291,
"grad_norm": 2.921875,
"learning_rate": 0.00048252108793319184,
"loss": 5.8193,
"mean_token_accuracy": 0.1696118786931038,
"num_tokens": 28273146.0,
"step": 15175
},
{
"entropy": 6.096473836898804,
"epoch": 1.3405157188272696,
"grad_norm": 2.5625,
"learning_rate": 0.0004825089164280489,
"loss": 5.787,
"mean_token_accuracy": 0.1677632138133049,
"num_tokens": 28281865.0,
"step": 15180
},
{
"entropy": 6.082158088684082,
"epoch": 1.3409572589191099,
"grad_norm": 3.453125,
"learning_rate": 0.00048249674085792433,
"loss": 5.7384,
"mean_token_accuracy": 0.17069039940834047,
"num_tokens": 28291197.0,
"step": 15185
},
{
"entropy": 6.116611289978027,
"epoch": 1.3413987990109502,
"grad_norm": 2.515625,
"learning_rate": 0.00048248456122305667,
"loss": 5.9077,
"mean_token_accuracy": 0.15975599288940429,
"num_tokens": 28300283.0,
"step": 15190
},
{
"entropy": 6.1185619831085205,
"epoch": 1.3418403391027907,
"grad_norm": 1.75,
"learning_rate": 0.0004824723775236844,
"loss": 5.9736,
"mean_token_accuracy": 0.15634205490350722,
"num_tokens": 28309121.0,
"step": 15195
},
{
"entropy": 6.144614267349243,
"epoch": 1.342281879194631,
"grad_norm": 2.234375,
"learning_rate": 0.0004824601897600463,
"loss": 5.7878,
"mean_token_accuracy": 0.1706045910716057,
"num_tokens": 28318377.0,
"step": 15200
},
{
"entropy": 6.218353366851806,
"epoch": 1.3427234192864712,
"grad_norm": 2.296875,
"learning_rate": 0.00048244799793238104,
"loss": 5.7855,
"mean_token_accuracy": 0.1667351618409157,
"num_tokens": 28328341.0,
"step": 15205
},
{
"entropy": 6.137506675720215,
"epoch": 1.3431649593783115,
"grad_norm": 2.171875,
"learning_rate": 0.0004824358020409275,
"loss": 5.9559,
"mean_token_accuracy": 0.16414501070976256,
"num_tokens": 28337340.0,
"step": 15210
},
{
"entropy": 6.0143177032470705,
"epoch": 1.3436064994701518,
"grad_norm": 3.515625,
"learning_rate": 0.0004824236020859246,
"loss": 5.911,
"mean_token_accuracy": 0.1641640543937683,
"num_tokens": 28347653.0,
"step": 15215
},
{
"entropy": 6.208291006088257,
"epoch": 1.3440480395619923,
"grad_norm": 2.328125,
"learning_rate": 0.00048241139806761124,
"loss": 5.9211,
"mean_token_accuracy": 0.1615144908428192,
"num_tokens": 28356596.0,
"step": 15220
},
{
"entropy": 6.202220630645752,
"epoch": 1.3444895796538325,
"grad_norm": 2.546875,
"learning_rate": 0.00048239918998622657,
"loss": 5.9281,
"mean_token_accuracy": 0.16542965471744536,
"num_tokens": 28366253.0,
"step": 15225
},
{
"entropy": 6.058956289291382,
"epoch": 1.3449311197456728,
"grad_norm": 9.375,
"learning_rate": 0.0004823869778420097,
"loss": 5.7561,
"mean_token_accuracy": 0.16959169059991835,
"num_tokens": 28374815.0,
"step": 15230
},
{
"entropy": 6.100413417816162,
"epoch": 1.3453726598375133,
"grad_norm": 2.0625,
"learning_rate": 0.00048237476163519994,
"loss": 5.8619,
"mean_token_accuracy": 0.16081514060497284,
"num_tokens": 28384221.0,
"step": 15235
},
{
"entropy": 6.083461570739746,
"epoch": 1.3458141999293536,
"grad_norm": 3.859375,
"learning_rate": 0.0004823625413660365,
"loss": 5.8237,
"mean_token_accuracy": 0.1734177753329277,
"num_tokens": 28393453.0,
"step": 15240
},
{
"entropy": 6.082643032073975,
"epoch": 1.3462557400211939,
"grad_norm": 2.515625,
"learning_rate": 0.00048235031703475884,
"loss": 5.7628,
"mean_token_accuracy": 0.17514342516660691,
"num_tokens": 28402343.0,
"step": 15245
},
{
"entropy": 6.122287702560425,
"epoch": 1.3466972801130344,
"grad_norm": 2.609375,
"learning_rate": 0.0004823380886416064,
"loss": 5.7998,
"mean_token_accuracy": 0.1718698725104332,
"num_tokens": 28411527.0,
"step": 15250
},
{
"entropy": 6.135328960418701,
"epoch": 1.3471388202048746,
"grad_norm": 4.125,
"learning_rate": 0.0004823258561868187,
"loss": 5.9274,
"mean_token_accuracy": 0.15870449990034102,
"num_tokens": 28422518.0,
"step": 15255
},
{
"entropy": 6.126188945770264,
"epoch": 1.347580360296715,
"grad_norm": 2.171875,
"learning_rate": 0.00048231361967063534,
"loss": 5.8601,
"mean_token_accuracy": 0.1606899693608284,
"num_tokens": 28431692.0,
"step": 15260
},
{
"entropy": 6.1118114471435545,
"epoch": 1.3480219003885554,
"grad_norm": 2.734375,
"learning_rate": 0.0004823013790932961,
"loss": 5.8683,
"mean_token_accuracy": 0.16591231375932694,
"num_tokens": 28440304.0,
"step": 15265
},
{
"entropy": 6.207034587860107,
"epoch": 1.3484634404803957,
"grad_norm": 1.671875,
"learning_rate": 0.0004822891344550408,
"loss": 5.946,
"mean_token_accuracy": 0.1573217108845711,
"num_tokens": 28450265.0,
"step": 15270
},
{
"entropy": 6.122064161300659,
"epoch": 1.348904980572236,
"grad_norm": 2.453125,
"learning_rate": 0.00048227688575610915,
"loss": 5.8362,
"mean_token_accuracy": 0.17042937278747558,
"num_tokens": 28459699.0,
"step": 15275
},
{
"entropy": 6.096212244033813,
"epoch": 1.3493465206640762,
"grad_norm": 2.859375,
"learning_rate": 0.0004822646329967413,
"loss": 5.8598,
"mean_token_accuracy": 0.1595703825354576,
"num_tokens": 28468523.0,
"step": 15280
},
{
"entropy": 6.199342536926269,
"epoch": 1.3497880607559165,
"grad_norm": 2.203125,
"learning_rate": 0.0004822523761771771,
"loss": 5.9234,
"mean_token_accuracy": 0.1539541393518448,
"num_tokens": 28477629.0,
"step": 15285
},
{
"entropy": 6.0960530757904055,
"epoch": 1.350229600847757,
"grad_norm": 2.015625,
"learning_rate": 0.0004822401152976568,
"loss": 5.7884,
"mean_token_accuracy": 0.17311737835407257,
"num_tokens": 28486517.0,
"step": 15290
},
{
"entropy": 6.118200826644897,
"epoch": 1.3506711409395973,
"grad_norm": 3.640625,
"learning_rate": 0.00048222785035842045,
"loss": 5.9121,
"mean_token_accuracy": 0.1592455178499222,
"num_tokens": 28496103.0,
"step": 15295
},
{
"entropy": 6.0733174800872805,
"epoch": 1.3511126810314376,
"grad_norm": 2.28125,
"learning_rate": 0.00048221558135970834,
"loss": 5.8873,
"mean_token_accuracy": 0.16803468614816666,
"num_tokens": 28505538.0,
"step": 15300
},
{
"entropy": 6.043371534347534,
"epoch": 1.351554221123278,
"grad_norm": 2.421875,
"learning_rate": 0.00048220330830176086,
"loss": 5.7628,
"mean_token_accuracy": 0.1674954429268837,
"num_tokens": 28514322.0,
"step": 15305
},
{
"entropy": 6.255993318557739,
"epoch": 1.3519957612151183,
"grad_norm": 3.171875,
"learning_rate": 0.0004821910311848184,
"loss": 5.8577,
"mean_token_accuracy": 0.169841530919075,
"num_tokens": 28524298.0,
"step": 15310
},
{
"entropy": 6.180155038833618,
"epoch": 1.3524373013069586,
"grad_norm": 2.703125,
"learning_rate": 0.0004821787500091215,
"loss": 5.8813,
"mean_token_accuracy": 0.170614992082119,
"num_tokens": 28533567.0,
"step": 15315
},
{
"entropy": 6.02460560798645,
"epoch": 1.352878841398799,
"grad_norm": 2.0,
"learning_rate": 0.00048216646477491074,
"loss": 5.833,
"mean_token_accuracy": 0.16407113820314406,
"num_tokens": 28541746.0,
"step": 15320
},
{
"entropy": 6.083366441726684,
"epoch": 1.3533203814906394,
"grad_norm": 3.40625,
"learning_rate": 0.0004821541754824267,
"loss": 5.8977,
"mean_token_accuracy": 0.1569092705845833,
"num_tokens": 28551685.0,
"step": 15325
},
{
"entropy": 6.261707401275634,
"epoch": 1.3537619215824797,
"grad_norm": 2.609375,
"learning_rate": 0.0004821418821319102,
"loss": 5.9189,
"mean_token_accuracy": 0.1623137429356575,
"num_tokens": 28560935.0,
"step": 15330
},
{
"entropy": 6.160393714904785,
"epoch": 1.3542034616743202,
"grad_norm": 2.59375,
"learning_rate": 0.0004821295847236021,
"loss": 5.7721,
"mean_token_accuracy": 0.16808325350284575,
"num_tokens": 28569506.0,
"step": 15335
},
{
"entropy": 6.088107585906982,
"epoch": 1.3546450017661604,
"grad_norm": 2.46875,
"learning_rate": 0.0004821172832577431,
"loss": 5.85,
"mean_token_accuracy": 0.1630231559276581,
"num_tokens": 28579792.0,
"step": 15340
},
{
"entropy": 6.1480834007263185,
"epoch": 1.3550865418580007,
"grad_norm": 3.328125,
"learning_rate": 0.0004821049777345744,
"loss": 5.9266,
"mean_token_accuracy": 0.1649118483066559,
"num_tokens": 28589756.0,
"step": 15345
},
{
"entropy": 6.115909481048584,
"epoch": 1.355528081949841,
"grad_norm": 3.265625,
"learning_rate": 0.000482092668154337,
"loss": 5.8547,
"mean_token_accuracy": 0.1615961492061615,
"num_tokens": 28599853.0,
"step": 15350
},
{
"entropy": 6.092107582092285,
"epoch": 1.3559696220416813,
"grad_norm": 2.171875,
"learning_rate": 0.00048208035451727195,
"loss": 5.8753,
"mean_token_accuracy": 0.16523286700248718,
"num_tokens": 28608576.0,
"step": 15355
},
{
"entropy": 6.151393127441406,
"epoch": 1.3564111621335218,
"grad_norm": 2.28125,
"learning_rate": 0.0004820680368236206,
"loss": 5.911,
"mean_token_accuracy": 0.16158796101808548,
"num_tokens": 28618820.0,
"step": 15360
},
{
"entropy": 6.171906328201294,
"epoch": 1.356852702225362,
"grad_norm": 4.15625,
"learning_rate": 0.0004820557150736241,
"loss": 5.823,
"mean_token_accuracy": 0.1668887034058571,
"num_tokens": 28628092.0,
"step": 15365
},
{
"entropy": 6.162308692932129,
"epoch": 1.3572942423172023,
"grad_norm": 2.765625,
"learning_rate": 0.00048204338926752396,
"loss": 5.9169,
"mean_token_accuracy": 0.1606031060218811,
"num_tokens": 28637849.0,
"step": 15370
},
{
"entropy": 6.020817661285401,
"epoch": 1.3577357824090428,
"grad_norm": 2.140625,
"learning_rate": 0.0004820310594055616,
"loss": 5.8109,
"mean_token_accuracy": 0.17181960493326187,
"num_tokens": 28646957.0,
"step": 15375
},
{
"entropy": 6.173370599746704,
"epoch": 1.358177322500883,
"grad_norm": 2.515625,
"learning_rate": 0.0004820187254879784,
"loss": 5.8983,
"mean_token_accuracy": 0.1640555739402771,
"num_tokens": 28655768.0,
"step": 15380
},
{
"entropy": 6.174534940719605,
"epoch": 1.3586188625927234,
"grad_norm": 2.109375,
"learning_rate": 0.00048200638751501616,
"loss": 5.8821,
"mean_token_accuracy": 0.16627393662929535,
"num_tokens": 28664719.0,
"step": 15385
},
{
"entropy": 6.120928812026977,
"epoch": 1.3590604026845639,
"grad_norm": 2.1875,
"learning_rate": 0.0004819940454869166,
"loss": 5.8436,
"mean_token_accuracy": 0.1664762780070305,
"num_tokens": 28673568.0,
"step": 15390
},
{
"entropy": 6.097023391723633,
"epoch": 1.3595019427764041,
"grad_norm": 2.078125,
"learning_rate": 0.0004819816994039213,
"loss": 5.826,
"mean_token_accuracy": 0.1686085805296898,
"num_tokens": 28682558.0,
"step": 15395
},
{
"entropy": 6.150874328613281,
"epoch": 1.3599434828682444,
"grad_norm": 4.375,
"learning_rate": 0.00048196934926627227,
"loss": 5.8858,
"mean_token_accuracy": 0.16280508488416673,
"num_tokens": 28691965.0,
"step": 15400
},
{
"entropy": 6.063521385192871,
"epoch": 1.360385022960085,
"grad_norm": 3.015625,
"learning_rate": 0.0004819569950742114,
"loss": 5.8076,
"mean_token_accuracy": 0.16935428977012634,
"num_tokens": 28700805.0,
"step": 15405
},
{
"entropy": 6.077215242385864,
"epoch": 1.3608265630519252,
"grad_norm": 2.890625,
"learning_rate": 0.0004819446368279808,
"loss": 5.8103,
"mean_token_accuracy": 0.1743042752146721,
"num_tokens": 28710169.0,
"step": 15410
},
{
"entropy": 6.255135869979858,
"epoch": 1.3612681031437655,
"grad_norm": 2.046875,
"learning_rate": 0.00048193227452782237,
"loss": 5.9618,
"mean_token_accuracy": 0.15666793137788773,
"num_tokens": 28718656.0,
"step": 15415
},
{
"entropy": 6.180183458328247,
"epoch": 1.3617096432356057,
"grad_norm": 3.140625,
"learning_rate": 0.0004819199081739783,
"loss": 5.9084,
"mean_token_accuracy": 0.1626324325799942,
"num_tokens": 28728546.0,
"step": 15420
},
{
"entropy": 6.135239219665527,
"epoch": 1.362151183327446,
"grad_norm": 2.234375,
"learning_rate": 0.000481907537766691,
"loss": 5.8096,
"mean_token_accuracy": 0.1680270180106163,
"num_tokens": 28737267.0,
"step": 15425
},
{
"entropy": 6.096661138534546,
"epoch": 1.3625927234192865,
"grad_norm": 2.25,
"learning_rate": 0.0004818951633062027,
"loss": 5.8859,
"mean_token_accuracy": 0.16328068673610688,
"num_tokens": 28746721.0,
"step": 15430
},
{
"entropy": 6.161539602279663,
"epoch": 1.3630342635111268,
"grad_norm": 2.65625,
"learning_rate": 0.00048188278479275584,
"loss": 5.9301,
"mean_token_accuracy": 0.16388455778360367,
"num_tokens": 28756099.0,
"step": 15435
},
{
"entropy": 6.1142974376678465,
"epoch": 1.363475803602967,
"grad_norm": 3.09375,
"learning_rate": 0.0004818704022265928,
"loss": 5.86,
"mean_token_accuracy": 0.16340645849704744,
"num_tokens": 28765463.0,
"step": 15440
},
{
"entropy": 6.0938183784484865,
"epoch": 1.3639173436948075,
"grad_norm": 2.921875,
"learning_rate": 0.00048185801560795627,
"loss": 5.8269,
"mean_token_accuracy": 0.16870324164628983,
"num_tokens": 28775284.0,
"step": 15445
},
{
"entropy": 6.198780155181884,
"epoch": 1.3643588837866478,
"grad_norm": 2.953125,
"learning_rate": 0.00048184562493708895,
"loss": 5.8884,
"mean_token_accuracy": 0.16734731644392015,
"num_tokens": 28784524.0,
"step": 15450
},
{
"entropy": 6.177229928970337,
"epoch": 1.364800423878488,
"grad_norm": 1.984375,
"learning_rate": 0.00048183323021423334,
"loss": 5.8325,
"mean_token_accuracy": 0.16062391251325608,
"num_tokens": 28792942.0,
"step": 15455
},
{
"entropy": 6.096157360076904,
"epoch": 1.3652419639703286,
"grad_norm": 2.625,
"learning_rate": 0.00048182083143963247,
"loss": 5.8222,
"mean_token_accuracy": 0.171273173391819,
"num_tokens": 28801746.0,
"step": 15460
},
{
"entropy": 6.118318176269531,
"epoch": 1.3656835040621689,
"grad_norm": 2.140625,
"learning_rate": 0.0004818084286135291,
"loss": 5.8886,
"mean_token_accuracy": 0.16187200099229812,
"num_tokens": 28810276.0,
"step": 15465
},
{
"entropy": 6.151875114440918,
"epoch": 1.3661250441540091,
"grad_norm": 2.671875,
"learning_rate": 0.0004817960217361663,
"loss": 5.8907,
"mean_token_accuracy": 0.15933738946914672,
"num_tokens": 28819545.0,
"step": 15470
},
{
"entropy": 6.126094150543213,
"epoch": 1.3665665842458496,
"grad_norm": 2.140625,
"learning_rate": 0.000481783610807787,
"loss": 5.7756,
"mean_token_accuracy": 0.17122658640146254,
"num_tokens": 28828163.0,
"step": 15475
},
{
"entropy": 6.127861356735229,
"epoch": 1.36700812433769,
"grad_norm": 2.15625,
"learning_rate": 0.0004817711958286343,
"loss": 5.8788,
"mean_token_accuracy": 0.16285136789083482,
"num_tokens": 28837952.0,
"step": 15480
},
{
"entropy": 6.1801551342010494,
"epoch": 1.3674496644295302,
"grad_norm": 4.4375,
"learning_rate": 0.0004817587767989516,
"loss": 5.9423,
"mean_token_accuracy": 0.15398232340812684,
"num_tokens": 28847702.0,
"step": 15485
},
{
"entropy": 6.177108097076416,
"epoch": 1.3678912045213705,
"grad_norm": 2.96875,
"learning_rate": 0.00048174635371898197,
"loss": 5.8783,
"mean_token_accuracy": 0.16039789021015166,
"num_tokens": 28856936.0,
"step": 15490
},
{
"entropy": 6.106835079193115,
"epoch": 1.3683327446132107,
"grad_norm": 1.8125,
"learning_rate": 0.0004817339265889689,
"loss": 5.8213,
"mean_token_accuracy": 0.1717734456062317,
"num_tokens": 28867072.0,
"step": 15495
},
{
"entropy": 6.025548601150513,
"epoch": 1.3687742847050512,
"grad_norm": 2.421875,
"learning_rate": 0.0004817214954091557,
"loss": 5.7721,
"mean_token_accuracy": 0.16893286406993865,
"num_tokens": 28877546.0,
"step": 15500
},
{
"entropy": 6.161783170700073,
"epoch": 1.3692158247968915,
"grad_norm": 2.578125,
"learning_rate": 0.00048170906017978605,
"loss": 5.8487,
"mean_token_accuracy": 0.16890615373849868,
"num_tokens": 28886804.0,
"step": 15505
},
{
"entropy": 6.192712926864624,
"epoch": 1.3696573648887318,
"grad_norm": 3.8125,
"learning_rate": 0.0004816966209011034,
"loss": 5.9237,
"mean_token_accuracy": 0.1583094120025635,
"num_tokens": 28896476.0,
"step": 15510
},
{
"entropy": 6.178607416152954,
"epoch": 1.3700989049805723,
"grad_norm": 1.9296875,
"learning_rate": 0.00048168417757335155,
"loss": 5.911,
"mean_token_accuracy": 0.16368778496980668,
"num_tokens": 28906269.0,
"step": 15515
},
{
"entropy": 6.0654082775115965,
"epoch": 1.3705404450724126,
"grad_norm": 4.3125,
"learning_rate": 0.0004816717301967743,
"loss": 5.8259,
"mean_token_accuracy": 0.1651047423481941,
"num_tokens": 28915792.0,
"step": 15520
},
{
"entropy": 6.036007690429687,
"epoch": 1.3709819851642528,
"grad_norm": 2.5,
"learning_rate": 0.0004816592787716152,
"loss": 5.883,
"mean_token_accuracy": 0.16221778243780136,
"num_tokens": 28925065.0,
"step": 15525
},
{
"entropy": 6.120332193374634,
"epoch": 1.3714235252560933,
"grad_norm": 1.9765625,
"learning_rate": 0.00048164682329811855,
"loss": 5.8689,
"mean_token_accuracy": 0.15587522834539413,
"num_tokens": 28933879.0,
"step": 15530
},
{
"entropy": 6.088461971282959,
"epoch": 1.3718650653479336,
"grad_norm": 2.546875,
"learning_rate": 0.00048163436377652804,
"loss": 5.733,
"mean_token_accuracy": 0.1755826562643051,
"num_tokens": 28943176.0,
"step": 15535
},
{
"entropy": 6.171585607528686,
"epoch": 1.372306605439774,
"grad_norm": 3.90625,
"learning_rate": 0.0004816219002070879,
"loss": 5.9225,
"mean_token_accuracy": 0.15919211655855178,
"num_tokens": 28952770.0,
"step": 15540
},
{
"entropy": 6.022904253005981,
"epoch": 1.3727481455316144,
"grad_norm": 2.3125,
"learning_rate": 0.0004816094325900422,
"loss": 5.7269,
"mean_token_accuracy": 0.17486691921949388,
"num_tokens": 28961186.0,
"step": 15545
},
{
"entropy": 6.129666185379028,
"epoch": 1.3731896856234547,
"grad_norm": 2.296875,
"learning_rate": 0.00048159696092563533,
"loss": 5.8806,
"mean_token_accuracy": 0.16283677369356156,
"num_tokens": 28971787.0,
"step": 15550
},
{
"entropy": 6.167032241821289,
"epoch": 1.373631225715295,
"grad_norm": 4.53125,
"learning_rate": 0.0004815844852141114,
"loss": 5.9748,
"mean_token_accuracy": 0.15837966352701188,
"num_tokens": 28982095.0,
"step": 15555
},
{
"entropy": 6.13344087600708,
"epoch": 1.3740727658071352,
"grad_norm": 1.953125,
"learning_rate": 0.00048157200545571497,
"loss": 5.8691,
"mean_token_accuracy": 0.1678134471178055,
"num_tokens": 28991084.0,
"step": 15560
},
{
"entropy": 6.104653453826904,
"epoch": 1.3745143058989755,
"grad_norm": 2.53125,
"learning_rate": 0.0004815595216506903,
"loss": 5.8788,
"mean_token_accuracy": 0.1637309283018112,
"num_tokens": 29000544.0,
"step": 15565
},
{
"entropy": 6.119239568710327,
"epoch": 1.374955845990816,
"grad_norm": 2.171875,
"learning_rate": 0.0004815470337992822,
"loss": 5.7779,
"mean_token_accuracy": 0.16903695166110994,
"num_tokens": 29009366.0,
"step": 15570
},
{
"entropy": 6.1650902271270756,
"epoch": 1.3753973860826563,
"grad_norm": 2.390625,
"learning_rate": 0.00048153454190173517,
"loss": 5.933,
"mean_token_accuracy": 0.16395988464355468,
"num_tokens": 29018730.0,
"step": 15575
},
{
"entropy": 6.230202054977417,
"epoch": 1.3758389261744965,
"grad_norm": 3.5625,
"learning_rate": 0.00048152204595829394,
"loss": 5.9637,
"mean_token_accuracy": 0.15941810607910156,
"num_tokens": 29030255.0,
"step": 15580
},
{
"entropy": 6.153112125396729,
"epoch": 1.376280466266337,
"grad_norm": 2.1875,
"learning_rate": 0.0004815095459692032,
"loss": 5.8305,
"mean_token_accuracy": 0.1627992257475853,
"num_tokens": 29039030.0,
"step": 15585
},
{
"entropy": 6.104238033294678,
"epoch": 1.3767220063581773,
"grad_norm": 1.9453125,
"learning_rate": 0.000481497041934708,
"loss": 5.8582,
"mean_token_accuracy": 0.16831467896699906,
"num_tokens": 29047504.0,
"step": 15590
},
{
"entropy": 6.17299633026123,
"epoch": 1.3771635464500176,
"grad_norm": 2.171875,
"learning_rate": 0.00048148453385505317,
"loss": 5.9349,
"mean_token_accuracy": 0.1592304840683937,
"num_tokens": 29056488.0,
"step": 15595
},
{
"entropy": 6.157251262664795,
"epoch": 1.377605086541858,
"grad_norm": 2.703125,
"learning_rate": 0.00048147202173048366,
"loss": 5.8691,
"mean_token_accuracy": 0.17055196017026902,
"num_tokens": 29066067.0,
"step": 15600
},
{
"entropy": 6.132337951660157,
"epoch": 1.3780466266336984,
"grad_norm": 2.640625,
"learning_rate": 0.0004814595055612447,
"loss": 5.8671,
"mean_token_accuracy": 0.16986480504274368,
"num_tokens": 29075136.0,
"step": 15605
},
{
"entropy": 6.052063989639282,
"epoch": 1.3784881667255386,
"grad_norm": 2.140625,
"learning_rate": 0.00048144698534758153,
"loss": 5.839,
"mean_token_accuracy": 0.1750061795115471,
"num_tokens": 29084970.0,
"step": 15610
},
{
"entropy": 6.037084150314331,
"epoch": 1.3789297068173791,
"grad_norm": 2.828125,
"learning_rate": 0.00048143446108973924,
"loss": 5.7725,
"mean_token_accuracy": 0.16769738495349884,
"num_tokens": 29093234.0,
"step": 15615
},
{
"entropy": 6.106938600540161,
"epoch": 1.3793712469092194,
"grad_norm": 2.09375,
"learning_rate": 0.00048142193278796335,
"loss": 5.8371,
"mean_token_accuracy": 0.1632764995098114,
"num_tokens": 29102115.0,
"step": 15620
},
{
"entropy": 6.1543238162994385,
"epoch": 1.3798127870010597,
"grad_norm": 1.734375,
"learning_rate": 0.0004814094004424992,
"loss": 5.8518,
"mean_token_accuracy": 0.16515360176563262,
"num_tokens": 29111065.0,
"step": 15625
},
{
"entropy": 6.095177888870239,
"epoch": 1.3802543270929,
"grad_norm": 1.671875,
"learning_rate": 0.0004813968640535922,
"loss": 5.862,
"mean_token_accuracy": 0.16620463877916336,
"num_tokens": 29120238.0,
"step": 15630
},
{
"entropy": 6.101685523986816,
"epoch": 1.3806958671847402,
"grad_norm": 2.0,
"learning_rate": 0.000481384323621488,
"loss": 5.7986,
"mean_token_accuracy": 0.1665428727865219,
"num_tokens": 29129062.0,
"step": 15635
},
{
"entropy": 6.124349212646484,
"epoch": 1.3811374072765807,
"grad_norm": 1.96875,
"learning_rate": 0.0004813717791464324,
"loss": 5.9068,
"mean_token_accuracy": 0.1596272423863411,
"num_tokens": 29138990.0,
"step": 15640
},
{
"entropy": 6.07887897491455,
"epoch": 1.381578947368421,
"grad_norm": 7.875,
"learning_rate": 0.00048135923062867094,
"loss": 5.7822,
"mean_token_accuracy": 0.17262306958436965,
"num_tokens": 29147507.0,
"step": 15645
},
{
"entropy": 6.110772705078125,
"epoch": 1.3820204874602613,
"grad_norm": 2.390625,
"learning_rate": 0.0004813466780684495,
"loss": 5.9298,
"mean_token_accuracy": 0.1622328132390976,
"num_tokens": 29156277.0,
"step": 15650
},
{
"entropy": 6.1603271484375,
"epoch": 1.3824620275521018,
"grad_norm": 2.125,
"learning_rate": 0.0004813341214660141,
"loss": 6.018,
"mean_token_accuracy": 0.1587056927382946,
"num_tokens": 29165925.0,
"step": 15655
},
{
"entropy": 6.24934573173523,
"epoch": 1.382903567643942,
"grad_norm": 1.5390625,
"learning_rate": 0.0004813215608216105,
"loss": 5.9344,
"mean_token_accuracy": 0.15542737692594527,
"num_tokens": 29175811.0,
"step": 15660
},
{
"entropy": 6.187061309814453,
"epoch": 1.3833451077357823,
"grad_norm": 5.3125,
"learning_rate": 0.00048130899613548487,
"loss": 5.9134,
"mean_token_accuracy": 0.16901251673698425,
"num_tokens": 29185100.0,
"step": 15665
},
{
"entropy": 6.1655491352081295,
"epoch": 1.3837866478276228,
"grad_norm": 1.625,
"learning_rate": 0.00048129642740788337,
"loss": 5.8978,
"mean_token_accuracy": 0.15740839540958404,
"num_tokens": 29194430.0,
"step": 15670
},
{
"entropy": 6.068109130859375,
"epoch": 1.3842281879194631,
"grad_norm": 1.703125,
"learning_rate": 0.0004812838546390521,
"loss": 5.8401,
"mean_token_accuracy": 0.16758811175823213,
"num_tokens": 29203897.0,
"step": 15675
},
{
"entropy": 6.146728134155273,
"epoch": 1.3846697280113034,
"grad_norm": 2.0625,
"learning_rate": 0.0004812712778292375,
"loss": 5.9782,
"mean_token_accuracy": 0.16130871176719666,
"num_tokens": 29213474.0,
"step": 15680
},
{
"entropy": 6.23171968460083,
"epoch": 1.3851112681031439,
"grad_norm": 1.8046875,
"learning_rate": 0.000481258696978686,
"loss": 5.9141,
"mean_token_accuracy": 0.1602266922593117,
"num_tokens": 29222176.0,
"step": 15685
},
{
"entropy": 6.083932733535766,
"epoch": 1.3855528081949842,
"grad_norm": 2.359375,
"learning_rate": 0.00048124611208764375,
"loss": 5.8324,
"mean_token_accuracy": 0.16002349853515624,
"num_tokens": 29231885.0,
"step": 15690
},
{
"entropy": 6.102015495300293,
"epoch": 1.3859943482868244,
"grad_norm": 2.421875,
"learning_rate": 0.0004812335231563576,
"loss": 5.8557,
"mean_token_accuracy": 0.16753800511360167,
"num_tokens": 29241921.0,
"step": 15695
},
{
"entropy": 6.146859121322632,
"epoch": 1.3864358883786647,
"grad_norm": 3.65625,
"learning_rate": 0.00048122093018507396,
"loss": 5.9133,
"mean_token_accuracy": 0.16420000940561294,
"num_tokens": 29251308.0,
"step": 15700
},
{
"entropy": 6.145302867889404,
"epoch": 1.386877428470505,
"grad_norm": 2.71875,
"learning_rate": 0.0004812083331740396,
"loss": 5.8539,
"mean_token_accuracy": 0.17006118595600128,
"num_tokens": 29260628.0,
"step": 15705
},
{
"entropy": 6.181409215927124,
"epoch": 1.3873189685623455,
"grad_norm": 2.109375,
"learning_rate": 0.00048119573212350127,
"loss": 5.8679,
"mean_token_accuracy": 0.1638660952448845,
"num_tokens": 29269530.0,
"step": 15710
},
{
"entropy": 6.138296794891358,
"epoch": 1.3877605086541858,
"grad_norm": 2.171875,
"learning_rate": 0.00048118312703370576,
"loss": 5.8942,
"mean_token_accuracy": 0.16140485405921937,
"num_tokens": 29279846.0,
"step": 15715
},
{
"entropy": 6.175239229202271,
"epoch": 1.388202048746026,
"grad_norm": 1.9375,
"learning_rate": 0.00048117051790490007,
"loss": 5.8819,
"mean_token_accuracy": 0.16357457786798477,
"num_tokens": 29289822.0,
"step": 15720
},
{
"entropy": 6.110777378082275,
"epoch": 1.3886435888378665,
"grad_norm": 1.9609375,
"learning_rate": 0.00048115790473733124,
"loss": 5.8544,
"mean_token_accuracy": 0.17178755551576613,
"num_tokens": 29299454.0,
"step": 15725
},
{
"entropy": 6.170903491973877,
"epoch": 1.3890851289297068,
"grad_norm": 1.890625,
"learning_rate": 0.00048114528753124625,
"loss": 5.9095,
"mean_token_accuracy": 0.15858248472213746,
"num_tokens": 29308398.0,
"step": 15730
},
{
"entropy": 6.090342903137207,
"epoch": 1.389526669021547,
"grad_norm": 1.703125,
"learning_rate": 0.00048113266628689236,
"loss": 5.8656,
"mean_token_accuracy": 0.16787253320217133,
"num_tokens": 29318968.0,
"step": 15735
},
{
"entropy": 6.189314460754394,
"epoch": 1.3899682091133876,
"grad_norm": 1.875,
"learning_rate": 0.0004811200410045167,
"loss": 5.9406,
"mean_token_accuracy": 0.14789480119943618,
"num_tokens": 29329745.0,
"step": 15740
},
{
"entropy": 6.158523416519165,
"epoch": 1.3904097492052279,
"grad_norm": 2.078125,
"learning_rate": 0.0004811074116843667,
"loss": 5.754,
"mean_token_accuracy": 0.17276075929403306,
"num_tokens": 29338438.0,
"step": 15745
},
{
"entropy": 6.105166864395142,
"epoch": 1.3908512892970681,
"grad_norm": 2.53125,
"learning_rate": 0.00048109477832668977,
"loss": 5.8126,
"mean_token_accuracy": 0.168039970099926,
"num_tokens": 29347783.0,
"step": 15750
},
{
"entropy": 6.0703239917755125,
"epoch": 1.3912928293889086,
"grad_norm": 2.921875,
"learning_rate": 0.0004810821409317334,
"loss": 5.8759,
"mean_token_accuracy": 0.16287246942520142,
"num_tokens": 29357062.0,
"step": 15755
},
{
"entropy": 6.075339984893799,
"epoch": 1.391734369480749,
"grad_norm": 2.140625,
"learning_rate": 0.00048106949949974494,
"loss": 5.8633,
"mean_token_accuracy": 0.17048493027687073,
"num_tokens": 29366361.0,
"step": 15760
},
{
"entropy": 6.064424133300781,
"epoch": 1.3921759095725892,
"grad_norm": 3.921875,
"learning_rate": 0.0004810568540309723,
"loss": 5.8906,
"mean_token_accuracy": 0.15939663201570511,
"num_tokens": 29375992.0,
"step": 15765
},
{
"entropy": 6.1372678756713865,
"epoch": 1.3926174496644295,
"grad_norm": 1.9765625,
"learning_rate": 0.00048104420452566303,
"loss": 5.9456,
"mean_token_accuracy": 0.16422327011823654,
"num_tokens": 29386408.0,
"step": 15770
},
{
"entropy": 6.211482095718384,
"epoch": 1.3930589897562697,
"grad_norm": 2.203125,
"learning_rate": 0.00048103155098406505,
"loss": 5.9428,
"mean_token_accuracy": 0.15928721129894258,
"num_tokens": 29395881.0,
"step": 15775
},
{
"entropy": 6.1311243057250975,
"epoch": 1.3935005298481102,
"grad_norm": 1.703125,
"learning_rate": 0.00048101889340642604,
"loss": 5.7576,
"mean_token_accuracy": 0.1754090294241905,
"num_tokens": 29404397.0,
"step": 15780
},
{
"entropy": 6.021409940719605,
"epoch": 1.3939420699399505,
"grad_norm": 1.65625,
"learning_rate": 0.0004810062317929941,
"loss": 5.8241,
"mean_token_accuracy": 0.16846525818109512,
"num_tokens": 29413219.0,
"step": 15785
},
{
"entropy": 6.162354135513306,
"epoch": 1.3943836100317908,
"grad_norm": 2.375,
"learning_rate": 0.0004809935661440172,
"loss": 5.9212,
"mean_token_accuracy": 0.16283606588840485,
"num_tokens": 29422727.0,
"step": 15790
},
{
"entropy": 6.230003690719604,
"epoch": 1.3948251501236313,
"grad_norm": 1.9921875,
"learning_rate": 0.0004809808964597436,
"loss": 5.9228,
"mean_token_accuracy": 0.16476071923971175,
"num_tokens": 29432183.0,
"step": 15795
},
{
"entropy": 6.0916718482971195,
"epoch": 1.3952666902154716,
"grad_norm": 1.875,
"learning_rate": 0.00048096822274042145,
"loss": 5.8081,
"mean_token_accuracy": 0.16767892986536026,
"num_tokens": 29440821.0,
"step": 15800
},
{
"entropy": 6.192032146453857,
"epoch": 1.3957082303073118,
"grad_norm": 2.984375,
"learning_rate": 0.00048095554498629885,
"loss": 5.9415,
"mean_token_accuracy": 0.1615781679749489,
"num_tokens": 29450128.0,
"step": 15805
},
{
"entropy": 6.14204044342041,
"epoch": 1.3961497703991523,
"grad_norm": 1.796875,
"learning_rate": 0.00048094286319762426,
"loss": 5.8239,
"mean_token_accuracy": 0.16661964654922484,
"num_tokens": 29459271.0,
"step": 15810
},
{
"entropy": 6.098164796829224,
"epoch": 1.3965913104909926,
"grad_norm": 2.09375,
"learning_rate": 0.00048093017737464613,
"loss": 5.771,
"mean_token_accuracy": 0.17307702898979188,
"num_tokens": 29468517.0,
"step": 15815
},
{
"entropy": 6.1071840763092045,
"epoch": 1.3970328505828329,
"grad_norm": 1.7265625,
"learning_rate": 0.00048091748751761295,
"loss": 5.9448,
"mean_token_accuracy": 0.15817007571458816,
"num_tokens": 29478330.0,
"step": 15820
},
{
"entropy": 6.172364711761475,
"epoch": 1.3974743906746734,
"grad_norm": 2.015625,
"learning_rate": 0.0004809047936267732,
"loss": 5.8817,
"mean_token_accuracy": 0.15925693213939668,
"num_tokens": 29487190.0,
"step": 15825
},
{
"entropy": 6.129334783554077,
"epoch": 1.3979159307665137,
"grad_norm": 2.0,
"learning_rate": 0.00048089209570237573,
"loss": 5.9862,
"mean_token_accuracy": 0.15735596418380737,
"num_tokens": 29495885.0,
"step": 15830
},
{
"entropy": 6.141580295562744,
"epoch": 1.398357470858354,
"grad_norm": 2.296875,
"learning_rate": 0.0004808793937446692,
"loss": 5.8491,
"mean_token_accuracy": 0.15953641384840012,
"num_tokens": 29505524.0,
"step": 15835
},
{
"entropy": 6.119931364059449,
"epoch": 1.3987990109501942,
"grad_norm": 1.6640625,
"learning_rate": 0.0004808666877539025,
"loss": 5.8121,
"mean_token_accuracy": 0.17205947041511535,
"num_tokens": 29514003.0,
"step": 15840
},
{
"entropy": 6.096987915039063,
"epoch": 1.3992405510420345,
"grad_norm": 3.1875,
"learning_rate": 0.00048085397773032433,
"loss": 5.8622,
"mean_token_accuracy": 0.1640855684876442,
"num_tokens": 29523236.0,
"step": 15845
},
{
"entropy": 6.1621842861175535,
"epoch": 1.399682091133875,
"grad_norm": 1.5546875,
"learning_rate": 0.0004808412636741839,
"loss": 5.8984,
"mean_token_accuracy": 0.16695474982261657,
"num_tokens": 29532852.0,
"step": 15850
},
{
"entropy": 6.099269104003906,
"epoch": 1.4001236312257153,
"grad_norm": 2.109375,
"learning_rate": 0.00048082854558573017,
"loss": 5.853,
"mean_token_accuracy": 0.16693296581506728,
"num_tokens": 29542035.0,
"step": 15855
},
{
"entropy": 6.074254417419434,
"epoch": 1.4005651713175555,
"grad_norm": 1.9921875,
"learning_rate": 0.00048081582346521236,
"loss": 5.8441,
"mean_token_accuracy": 0.17053198516368867,
"num_tokens": 29551978.0,
"step": 15860
},
{
"entropy": 6.239467144012451,
"epoch": 1.401006711409396,
"grad_norm": 2.390625,
"learning_rate": 0.0004808030973128795,
"loss": 5.9884,
"mean_token_accuracy": 0.15497593134641646,
"num_tokens": 29562011.0,
"step": 15865
},
{
"entropy": 6.169714689254761,
"epoch": 1.4014482515012363,
"grad_norm": 2.703125,
"learning_rate": 0.00048079036712898106,
"loss": 5.8308,
"mean_token_accuracy": 0.16922168880701066,
"num_tokens": 29571498.0,
"step": 15870
},
{
"entropy": 6.118958139419556,
"epoch": 1.4018897915930766,
"grad_norm": 1.8984375,
"learning_rate": 0.00048077763291376637,
"loss": 5.7725,
"mean_token_accuracy": 0.17425878047943116,
"num_tokens": 29580704.0,
"step": 15875
},
{
"entropy": 6.093337297439575,
"epoch": 1.402331331684917,
"grad_norm": 1.8359375,
"learning_rate": 0.0004807648946674849,
"loss": 5.7747,
"mean_token_accuracy": 0.17092142552137374,
"num_tokens": 29590066.0,
"step": 15880
},
{
"entropy": 6.066196250915527,
"epoch": 1.4027728717767574,
"grad_norm": 1.7421875,
"learning_rate": 0.0004807521523903862,
"loss": 5.8762,
"mean_token_accuracy": 0.16555921882390975,
"num_tokens": 29599473.0,
"step": 15885
},
{
"entropy": 6.0984701156616214,
"epoch": 1.4032144118685976,
"grad_norm": 2.53125,
"learning_rate": 0.00048073940608271974,
"loss": 5.8925,
"mean_token_accuracy": 0.1614256277680397,
"num_tokens": 29609371.0,
"step": 15890
},
{
"entropy": 6.165452718734741,
"epoch": 1.4036559519604381,
"grad_norm": 2.234375,
"learning_rate": 0.0004807266557447354,
"loss": 5.7587,
"mean_token_accuracy": 0.17099967300891877,
"num_tokens": 29618821.0,
"step": 15895
},
{
"entropy": 6.0508099555969235,
"epoch": 1.4040974920522784,
"grad_norm": 2.28125,
"learning_rate": 0.0004807139013766829,
"loss": 5.7794,
"mean_token_accuracy": 0.17361864894628526,
"num_tokens": 29627491.0,
"step": 15900
},
{
"entropy": 6.015017032623291,
"epoch": 1.4045390321441187,
"grad_norm": 2.171875,
"learning_rate": 0.00048070114297881205,
"loss": 5.8798,
"mean_token_accuracy": 0.16711322218179703,
"num_tokens": 29637699.0,
"step": 15905
},
{
"entropy": 6.139966249465942,
"epoch": 1.404980572235959,
"grad_norm": 3.046875,
"learning_rate": 0.0004806883805513728,
"loss": 5.833,
"mean_token_accuracy": 0.1668118119239807,
"num_tokens": 29646439.0,
"step": 15910
},
{
"entropy": 6.177930641174316,
"epoch": 1.4054221123277992,
"grad_norm": 2.171875,
"learning_rate": 0.0004806756140946151,
"loss": 5.9069,
"mean_token_accuracy": 0.15072600841522216,
"num_tokens": 29655704.0,
"step": 15915
},
{
"entropy": 6.2274681568145756,
"epoch": 1.4058636524196397,
"grad_norm": 2.34375,
"learning_rate": 0.00048066284360878913,
"loss": 5.96,
"mean_token_accuracy": 0.15939329862594603,
"num_tokens": 29665163.0,
"step": 15920
},
{
"entropy": 6.161479806900024,
"epoch": 1.40630519251148,
"grad_norm": 3.015625,
"learning_rate": 0.00048065006909414507,
"loss": 5.8644,
"mean_token_accuracy": 0.16196232363581659,
"num_tokens": 29674803.0,
"step": 15925
},
{
"entropy": 6.176736640930176,
"epoch": 1.4067467326033203,
"grad_norm": 2.703125,
"learning_rate": 0.0004806372905509331,
"loss": 5.8717,
"mean_token_accuracy": 0.161611158400774,
"num_tokens": 29685149.0,
"step": 15930
},
{
"entropy": 6.093558406829834,
"epoch": 1.4071882726951608,
"grad_norm": 1.75,
"learning_rate": 0.00048062450797940347,
"loss": 5.7594,
"mean_token_accuracy": 0.17332044392824172,
"num_tokens": 29694224.0,
"step": 15935
},
{
"entropy": 6.144221019744873,
"epoch": 1.407629812787001,
"grad_norm": 3.859375,
"learning_rate": 0.0004806117213798068,
"loss": 5.8514,
"mean_token_accuracy": 0.16724241375923157,
"num_tokens": 29704512.0,
"step": 15940
},
{
"entropy": 6.108570194244384,
"epoch": 1.4080713528788413,
"grad_norm": 2.59375,
"learning_rate": 0.00048059893075239334,
"loss": 5.7696,
"mean_token_accuracy": 0.16789837479591369,
"num_tokens": 29712990.0,
"step": 15945
},
{
"entropy": 6.139979839324951,
"epoch": 1.4085128929706818,
"grad_norm": 2.109375,
"learning_rate": 0.00048058613609741374,
"loss": 5.9154,
"mean_token_accuracy": 0.1590418964624405,
"num_tokens": 29722844.0,
"step": 15950
},
{
"entropy": 6.137627363204956,
"epoch": 1.408954433062522,
"grad_norm": 4.125,
"learning_rate": 0.0004805733374151188,
"loss": 5.7929,
"mean_token_accuracy": 0.164412160217762,
"num_tokens": 29731593.0,
"step": 15955
},
{
"entropy": 6.1178075790405275,
"epoch": 1.4093959731543624,
"grad_norm": 1.8671875,
"learning_rate": 0.00048056053470575894,
"loss": 5.8931,
"mean_token_accuracy": 0.15994573384523392,
"num_tokens": 29741052.0,
"step": 15960
},
{
"entropy": 6.153901720046997,
"epoch": 1.4098375132462029,
"grad_norm": 2.59375,
"learning_rate": 0.00048054772796958517,
"loss": 5.8718,
"mean_token_accuracy": 0.16349824666976928,
"num_tokens": 29750187.0,
"step": 15965
},
{
"entropy": 6.108904075622559,
"epoch": 1.4102790533380432,
"grad_norm": 3.0,
"learning_rate": 0.00048053491720684836,
"loss": 5.8094,
"mean_token_accuracy": 0.16586447805166243,
"num_tokens": 29759574.0,
"step": 15970
},
{
"entropy": 6.115763378143311,
"epoch": 1.4107205934298834,
"grad_norm": 2.390625,
"learning_rate": 0.0004805221024177994,
"loss": 5.8595,
"mean_token_accuracy": 0.16241247504949569,
"num_tokens": 29769549.0,
"step": 15975
},
{
"entropy": 6.208867883682251,
"epoch": 1.4111621335217237,
"grad_norm": 1.96875,
"learning_rate": 0.0004805092836026893,
"loss": 5.8761,
"mean_token_accuracy": 0.1660727381706238,
"num_tokens": 29778643.0,
"step": 15980
},
{
"entropy": 6.081111860275269,
"epoch": 1.411603673613564,
"grad_norm": 2.171875,
"learning_rate": 0.0004804964607617693,
"loss": 5.8274,
"mean_token_accuracy": 0.16530224680900574,
"num_tokens": 29788685.0,
"step": 15985
},
{
"entropy": 6.071863842010498,
"epoch": 1.4120452137054045,
"grad_norm": 2.171875,
"learning_rate": 0.00048048363389529045,
"loss": 5.7998,
"mean_token_accuracy": 0.16909501552581788,
"num_tokens": 29798648.0,
"step": 15990
},
{
"entropy": 6.111819648742676,
"epoch": 1.4124867537972448,
"grad_norm": 1.9296875,
"learning_rate": 0.000480470803003504,
"loss": 5.8572,
"mean_token_accuracy": 0.16122416853904725,
"num_tokens": 29807582.0,
"step": 15995
},
{
"entropy": 6.114468288421631,
"epoch": 1.412928293889085,
"grad_norm": 2.046875,
"learning_rate": 0.0004804579680866614,
"loss": 5.8747,
"mean_token_accuracy": 0.1663564845919609,
"num_tokens": 29817443.0,
"step": 16000
},
{
"entropy": 6.136613512039185,
"epoch": 1.4133698339809255,
"grad_norm": 1.9296875,
"learning_rate": 0.0004804451291450142,
"loss": 5.848,
"mean_token_accuracy": 0.16939873546361922,
"num_tokens": 29825796.0,
"step": 16005
},
{
"entropy": 6.077986145019532,
"epoch": 1.4138113740727658,
"grad_norm": 1.9296875,
"learning_rate": 0.00048043228617881365,
"loss": 5.8289,
"mean_token_accuracy": 0.1664276123046875,
"num_tokens": 29834874.0,
"step": 16010
},
{
"entropy": 6.099431705474854,
"epoch": 1.414252914164606,
"grad_norm": 2.171875,
"learning_rate": 0.0004804194391883114,
"loss": 5.8443,
"mean_token_accuracy": 0.15956082791090012,
"num_tokens": 29843884.0,
"step": 16015
},
{
"entropy": 6.197801971435547,
"epoch": 1.4146944542564466,
"grad_norm": 1.953125,
"learning_rate": 0.00048040658817375927,
"loss": 5.968,
"mean_token_accuracy": 0.15660221725702286,
"num_tokens": 29853180.0,
"step": 16020
},
{
"entropy": 6.062063932418823,
"epoch": 1.4151359943482869,
"grad_norm": 1.796875,
"learning_rate": 0.00048039373313540885,
"loss": 5.8039,
"mean_token_accuracy": 0.17061771899461747,
"num_tokens": 29862926.0,
"step": 16025
},
{
"entropy": 6.028831481933594,
"epoch": 1.4155775344401271,
"grad_norm": 1.9140625,
"learning_rate": 0.000480380874073512,
"loss": 5.8114,
"mean_token_accuracy": 0.1680995300412178,
"num_tokens": 29871450.0,
"step": 16030
},
{
"entropy": 6.105000400543213,
"epoch": 1.4160190745319676,
"grad_norm": 2.46875,
"learning_rate": 0.00048036801098832067,
"loss": 5.7943,
"mean_token_accuracy": 0.16812623292207718,
"num_tokens": 29880142.0,
"step": 16035
},
{
"entropy": 6.0839448928833,
"epoch": 1.416460614623808,
"grad_norm": 1.9609375,
"learning_rate": 0.0004803551438800868,
"loss": 5.8257,
"mean_token_accuracy": 0.17074698209762573,
"num_tokens": 29888668.0,
"step": 16040
},
{
"entropy": 6.1324975967407225,
"epoch": 1.4169021547156482,
"grad_norm": 5.21875,
"learning_rate": 0.00048034227274906235,
"loss": 5.9632,
"mean_token_accuracy": 0.16008452624082564,
"num_tokens": 29898727.0,
"step": 16045
},
{
"entropy": 6.142888498306275,
"epoch": 1.4173436948074885,
"grad_norm": 1.6796875,
"learning_rate": 0.00048032939759549964,
"loss": 5.8697,
"mean_token_accuracy": 0.15153772234916688,
"num_tokens": 29909089.0,
"step": 16050
},
{
"entropy": 6.174179363250732,
"epoch": 1.4177852348993287,
"grad_norm": 1.9609375,
"learning_rate": 0.00048031651841965085,
"loss": 5.8374,
"mean_token_accuracy": 0.16748185753822326,
"num_tokens": 29918169.0,
"step": 16055
},
{
"entropy": 6.069959211349487,
"epoch": 1.4182267749911692,
"grad_norm": 1.8515625,
"learning_rate": 0.0004803036352217682,
"loss": 5.8705,
"mean_token_accuracy": 0.1657819464802742,
"num_tokens": 29928160.0,
"step": 16060
},
{
"entropy": 6.033580112457275,
"epoch": 1.4186683150830095,
"grad_norm": 1.9140625,
"learning_rate": 0.00048029074800210413,
"loss": 5.8934,
"mean_token_accuracy": 0.15751785188913345,
"num_tokens": 29937695.0,
"step": 16065
},
{
"entropy": 6.202345180511474,
"epoch": 1.4191098551748498,
"grad_norm": 2.15625,
"learning_rate": 0.000480277856760911,
"loss": 5.8829,
"mean_token_accuracy": 0.1610317587852478,
"num_tokens": 29947380.0,
"step": 16070
},
{
"entropy": 6.2125732421875,
"epoch": 1.4195513952666903,
"grad_norm": 3.421875,
"learning_rate": 0.00048026496149844146,
"loss": 5.9441,
"mean_token_accuracy": 0.15691696852445602,
"num_tokens": 29956313.0,
"step": 16075
},
{
"entropy": 6.108792781829834,
"epoch": 1.4199929353585306,
"grad_norm": 2.234375,
"learning_rate": 0.00048025206221494806,
"loss": 5.7865,
"mean_token_accuracy": 0.17209419906139373,
"num_tokens": 29965502.0,
"step": 16080
},
{
"entropy": 6.131576728820801,
"epoch": 1.4204344754503708,
"grad_norm": 1.5234375,
"learning_rate": 0.0004802391589106835,
"loss": 5.7908,
"mean_token_accuracy": 0.16665838062763214,
"num_tokens": 29974243.0,
"step": 16085
},
{
"entropy": 6.040534257888794,
"epoch": 1.4208760155422113,
"grad_norm": 2.015625,
"learning_rate": 0.0004802262515859005,
"loss": 5.7516,
"mean_token_accuracy": 0.17982443273067475,
"num_tokens": 29983966.0,
"step": 16090
},
{
"entropy": 6.046605777740479,
"epoch": 1.4213175556340516,
"grad_norm": 1.828125,
"learning_rate": 0.0004802133402408519,
"loss": 5.8651,
"mean_token_accuracy": 0.16078413277864456,
"num_tokens": 29993365.0,
"step": 16095
},
{
"entropy": 6.2006267547607425,
"epoch": 1.4217590957258919,
"grad_norm": 2.375,
"learning_rate": 0.00048020042487579076,
"loss": 5.8691,
"mean_token_accuracy": 0.1559872843325138,
"num_tokens": 30001919.0,
"step": 16100
},
{
"entropy": 6.076269054412842,
"epoch": 1.4222006358177324,
"grad_norm": 1.7734375,
"learning_rate": 0.00048018750549097,
"loss": 5.8385,
"mean_token_accuracy": 0.16609150916337967,
"num_tokens": 30011353.0,
"step": 16105
},
{
"entropy": 6.1821221828460695,
"epoch": 1.4226421759095726,
"grad_norm": 2.15625,
"learning_rate": 0.00048017458208664265,
"loss": 5.9082,
"mean_token_accuracy": 0.16320280879735946,
"num_tokens": 30019994.0,
"step": 16110
},
{
"entropy": 6.06850905418396,
"epoch": 1.423083716001413,
"grad_norm": 2.203125,
"learning_rate": 0.000480161654663062,
"loss": 5.7393,
"mean_token_accuracy": 0.16712867766618728,
"num_tokens": 30028934.0,
"step": 16115
},
{
"entropy": 6.159872341156006,
"epoch": 1.4235252560932532,
"grad_norm": 2.25,
"learning_rate": 0.0004801487232204811,
"loss": 5.7988,
"mean_token_accuracy": 0.16886568814516068,
"num_tokens": 30038069.0,
"step": 16120
},
{
"entropy": 6.14861421585083,
"epoch": 1.4239667961850935,
"grad_norm": 2.046875,
"learning_rate": 0.0004801357877591535,
"loss": 5.9013,
"mean_token_accuracy": 0.1581908255815506,
"num_tokens": 30047307.0,
"step": 16125
},
{
"entropy": 6.125604820251465,
"epoch": 1.424408336276934,
"grad_norm": 2.21875,
"learning_rate": 0.00048012284827933245,
"loss": 5.8685,
"mean_token_accuracy": 0.16420305222272874,
"num_tokens": 30057429.0,
"step": 16130
},
{
"entropy": 6.049166679382324,
"epoch": 1.4248498763687742,
"grad_norm": 3.515625,
"learning_rate": 0.0004801099047812715,
"loss": 5.8033,
"mean_token_accuracy": 0.16826165169477464,
"num_tokens": 30067327.0,
"step": 16135
},
{
"entropy": 6.155235052108765,
"epoch": 1.4252914164606145,
"grad_norm": 1.84375,
"learning_rate": 0.0004800969572652241,
"loss": 5.9153,
"mean_token_accuracy": 0.156301049888134,
"num_tokens": 30077103.0,
"step": 16140
},
{
"entropy": 6.188400983810425,
"epoch": 1.425732956552455,
"grad_norm": 1.953125,
"learning_rate": 0.00048008400573144394,
"loss": 5.9653,
"mean_token_accuracy": 0.15982804000377654,
"num_tokens": 30087539.0,
"step": 16145
},
{
"entropy": 6.179772472381591,
"epoch": 1.4261744966442953,
"grad_norm": 2.0625,
"learning_rate": 0.00048007105018018487,
"loss": 5.8412,
"mean_token_accuracy": 0.16355594843626023,
"num_tokens": 30097153.0,
"step": 16150
},
{
"entropy": 6.117720985412598,
"epoch": 1.4266160367361356,
"grad_norm": 2.875,
"learning_rate": 0.00048005809061170044,
"loss": 5.9216,
"mean_token_accuracy": 0.161703197658062,
"num_tokens": 30106291.0,
"step": 16155
},
{
"entropy": 6.1043986797332765,
"epoch": 1.427057576827976,
"grad_norm": 6.0,
"learning_rate": 0.0004800451270262447,
"loss": 5.9325,
"mean_token_accuracy": 0.16209484040737152,
"num_tokens": 30116441.0,
"step": 16160
},
{
"entropy": 6.078762102127075,
"epoch": 1.4274991169198163,
"grad_norm": 2.296875,
"learning_rate": 0.0004800321594240714,
"loss": 5.8029,
"mean_token_accuracy": 0.177707726508379,
"num_tokens": 30125040.0,
"step": 16165
},
{
"entropy": 6.1602904319763185,
"epoch": 1.4279406570116566,
"grad_norm": 3.359375,
"learning_rate": 0.0004800191878054349,
"loss": 5.7809,
"mean_token_accuracy": 0.17009861171245574,
"num_tokens": 30134284.0,
"step": 16170
},
{
"entropy": 6.213152122497559,
"epoch": 1.4283821971034971,
"grad_norm": 2.984375,
"learning_rate": 0.00048000621217058904,
"loss": 5.7706,
"mean_token_accuracy": 0.1768509104847908,
"num_tokens": 30143679.0,
"step": 16175
},
{
"entropy": 6.038517093658447,
"epoch": 1.4288237371953374,
"grad_norm": 1.9765625,
"learning_rate": 0.00047999323251978805,
"loss": 5.7155,
"mean_token_accuracy": 0.1786133661866188,
"num_tokens": 30152011.0,
"step": 16180
},
{
"entropy": 6.022201681137085,
"epoch": 1.4292652772871777,
"grad_norm": 1.9296875,
"learning_rate": 0.00047998024885328625,
"loss": 5.8337,
"mean_token_accuracy": 0.16451212465763093,
"num_tokens": 30161949.0,
"step": 16185
},
{
"entropy": 6.152598524093628,
"epoch": 1.429706817379018,
"grad_norm": 1.828125,
"learning_rate": 0.00047996726117133795,
"loss": 5.8493,
"mean_token_accuracy": 0.169940747320652,
"num_tokens": 30172003.0,
"step": 16190
},
{
"entropy": 6.025085496902466,
"epoch": 1.4301483574708582,
"grad_norm": 5.3125,
"learning_rate": 0.0004799542694741975,
"loss": 5.8157,
"mean_token_accuracy": 0.17683141231536864,
"num_tokens": 30181918.0,
"step": 16195
},
{
"entropy": 6.065569829940796,
"epoch": 1.4305898975626987,
"grad_norm": 2.234375,
"learning_rate": 0.00047994127376211953,
"loss": 5.7971,
"mean_token_accuracy": 0.16969448775053025,
"num_tokens": 30191032.0,
"step": 16200
},
{
"entropy": 6.107191133499145,
"epoch": 1.431031437654539,
"grad_norm": 1.9453125,
"learning_rate": 0.0004799282740353586,
"loss": 5.7996,
"mean_token_accuracy": 0.16826905757188798,
"num_tokens": 30200276.0,
"step": 16205
},
{
"entropy": 6.2089580535888675,
"epoch": 1.4314729777463793,
"grad_norm": 4.03125,
"learning_rate": 0.00047991527029416924,
"loss": 5.8597,
"mean_token_accuracy": 0.1699478179216385,
"num_tokens": 30208574.0,
"step": 16210
},
{
"entropy": 6.126046848297119,
"epoch": 1.4319145178382198,
"grad_norm": 2.125,
"learning_rate": 0.0004799022625388064,
"loss": 5.8823,
"mean_token_accuracy": 0.16609019935131072,
"num_tokens": 30218912.0,
"step": 16215
},
{
"entropy": 6.163868713378906,
"epoch": 1.43235605793006,
"grad_norm": 2.046875,
"learning_rate": 0.0004798892507695247,
"loss": 5.9434,
"mean_token_accuracy": 0.16359032988548278,
"num_tokens": 30228325.0,
"step": 16220
},
{
"entropy": 6.140902757644653,
"epoch": 1.4327975980219003,
"grad_norm": 1.8359375,
"learning_rate": 0.0004798762349865791,
"loss": 5.8211,
"mean_token_accuracy": 0.16669892370700837,
"num_tokens": 30237169.0,
"step": 16225
},
{
"entropy": 6.106867122650146,
"epoch": 1.4332391381137408,
"grad_norm": 2.265625,
"learning_rate": 0.0004798632151902246,
"loss": 5.7934,
"mean_token_accuracy": 0.1706940770149231,
"num_tokens": 30246452.0,
"step": 16230
},
{
"entropy": 6.129545259475708,
"epoch": 1.433680678205581,
"grad_norm": 2.40625,
"learning_rate": 0.00047985019138071616,
"loss": 5.8469,
"mean_token_accuracy": 0.16856598854064941,
"num_tokens": 30256055.0,
"step": 16235
},
{
"entropy": 6.031220626831055,
"epoch": 1.4341222182974214,
"grad_norm": 2.484375,
"learning_rate": 0.00047983716355830903,
"loss": 5.7415,
"mean_token_accuracy": 0.1685488760471344,
"num_tokens": 30265764.0,
"step": 16240
},
{
"entropy": 6.1366911888122555,
"epoch": 1.4345637583892619,
"grad_norm": 1.6640625,
"learning_rate": 0.00047982413172325845,
"loss": 5.8772,
"mean_token_accuracy": 0.16872833296656609,
"num_tokens": 30274490.0,
"step": 16245
},
{
"entropy": 6.166954374313354,
"epoch": 1.4350052984811021,
"grad_norm": 2.53125,
"learning_rate": 0.00047981109587581945,
"loss": 5.8175,
"mean_token_accuracy": 0.16878375113010408,
"num_tokens": 30283330.0,
"step": 16250
},
{
"entropy": 6.131444883346558,
"epoch": 1.4354468385729424,
"grad_norm": 1.7890625,
"learning_rate": 0.0004797980560162477,
"loss": 5.981,
"mean_token_accuracy": 0.15589560344815254,
"num_tokens": 30293542.0,
"step": 16255
},
{
"entropy": 6.11992073059082,
"epoch": 1.4358883786647827,
"grad_norm": 1.9609375,
"learning_rate": 0.0004797850121447984,
"loss": 5.8834,
"mean_token_accuracy": 0.1700153484940529,
"num_tokens": 30302122.0,
"step": 16260
},
{
"entropy": 6.165520048141479,
"epoch": 1.436329918756623,
"grad_norm": 2.3125,
"learning_rate": 0.00047977196426172725,
"loss": 5.9119,
"mean_token_accuracy": 0.1682533234357834,
"num_tokens": 30311490.0,
"step": 16265
},
{
"entropy": 6.1143577098846436,
"epoch": 1.4367714588484635,
"grad_norm": 2.375,
"learning_rate": 0.00047975891236728973,
"loss": 5.7981,
"mean_token_accuracy": 0.17362534999847412,
"num_tokens": 30321199.0,
"step": 16270
},
{
"entropy": 6.179951333999634,
"epoch": 1.4372129989403037,
"grad_norm": 2.234375,
"learning_rate": 0.00047974585646174165,
"loss": 5.8382,
"mean_token_accuracy": 0.166537107527256,
"num_tokens": 30330114.0,
"step": 16275
},
{
"entropy": 6.131779956817627,
"epoch": 1.437654539032144,
"grad_norm": 3.046875,
"learning_rate": 0.00047973279654533866,
"loss": 5.8522,
"mean_token_accuracy": 0.17097405791282655,
"num_tokens": 30339290.0,
"step": 16280
},
{
"entropy": 6.037762880325317,
"epoch": 1.4380960791239845,
"grad_norm": 2.890625,
"learning_rate": 0.0004797197326183365,
"loss": 5.813,
"mean_token_accuracy": 0.16953154504299164,
"num_tokens": 30349595.0,
"step": 16285
},
{
"entropy": 6.109376335144043,
"epoch": 1.4385376192158248,
"grad_norm": 1.984375,
"learning_rate": 0.0004797066646809914,
"loss": 5.8559,
"mean_token_accuracy": 0.16690303534269332,
"num_tokens": 30358010.0,
"step": 16290
},
{
"entropy": 6.170920038223267,
"epoch": 1.438979159307665,
"grad_norm": 1.875,
"learning_rate": 0.00047969359273355907,
"loss": 5.9324,
"mean_token_accuracy": 0.16610104888677596,
"num_tokens": 30367408.0,
"step": 16295
},
{
"entropy": 6.173849248886109,
"epoch": 1.4394206993995056,
"grad_norm": 5.375,
"learning_rate": 0.00047968051677629565,
"loss": 5.9111,
"mean_token_accuracy": 0.16326019465923308,
"num_tokens": 30376475.0,
"step": 16300
},
{
"entropy": 6.13179726600647,
"epoch": 1.4398622394913458,
"grad_norm": 1.734375,
"learning_rate": 0.00047966743680945734,
"loss": 5.834,
"mean_token_accuracy": 0.16082065999507905,
"num_tokens": 30385361.0,
"step": 16305
},
{
"entropy": 6.147293043136597,
"epoch": 1.4403037795831861,
"grad_norm": 1.921875,
"learning_rate": 0.0004796543528333004,
"loss": 5.863,
"mean_token_accuracy": 0.16977233439683914,
"num_tokens": 30393594.0,
"step": 16310
},
{
"entropy": 6.1191668033599855,
"epoch": 1.4407453196750266,
"grad_norm": 2.125,
"learning_rate": 0.000479641264848081,
"loss": 5.8663,
"mean_token_accuracy": 0.16828539967536926,
"num_tokens": 30403444.0,
"step": 16315
},
{
"entropy": 6.0643229484558105,
"epoch": 1.441186859766867,
"grad_norm": 1.9375,
"learning_rate": 0.0004796281728540556,
"loss": 5.7367,
"mean_token_accuracy": 0.16803878992795945,
"num_tokens": 30412485.0,
"step": 16320
},
{
"entropy": 6.103892517089844,
"epoch": 1.4416283998587072,
"grad_norm": 2.390625,
"learning_rate": 0.00047961507685148077,
"loss": 5.7918,
"mean_token_accuracy": 0.16968378126621247,
"num_tokens": 30421104.0,
"step": 16325
},
{
"entropy": 6.069272899627686,
"epoch": 1.4420699399505474,
"grad_norm": 2.25,
"learning_rate": 0.00047960197684061287,
"loss": 5.8136,
"mean_token_accuracy": 0.16991628259420394,
"num_tokens": 30430061.0,
"step": 16330
},
{
"entropy": 6.075813627243042,
"epoch": 1.4425114800423877,
"grad_norm": 1.7734375,
"learning_rate": 0.0004795888728217086,
"loss": 5.7243,
"mean_token_accuracy": 0.16823228746652602,
"num_tokens": 30437645.0,
"step": 16335
},
{
"entropy": 6.012386226654053,
"epoch": 1.4429530201342282,
"grad_norm": 2.046875,
"learning_rate": 0.00047957576479502466,
"loss": 5.7305,
"mean_token_accuracy": 0.1814337909221649,
"num_tokens": 30447805.0,
"step": 16340
},
{
"entropy": 6.124349355697632,
"epoch": 1.4433945602260685,
"grad_norm": 2.78125,
"learning_rate": 0.0004795626527608179,
"loss": 5.8669,
"mean_token_accuracy": 0.17114001810550689,
"num_tokens": 30457524.0,
"step": 16345
},
{
"entropy": 6.193208026885986,
"epoch": 1.4438361003179088,
"grad_norm": 2.265625,
"learning_rate": 0.0004795495367193451,
"loss": 5.8466,
"mean_token_accuracy": 0.1703917235136032,
"num_tokens": 30467082.0,
"step": 16350
},
{
"entropy": 6.106189918518067,
"epoch": 1.4442776404097493,
"grad_norm": 2.0625,
"learning_rate": 0.00047953641667086315,
"loss": 5.8983,
"mean_token_accuracy": 0.1658327430486679,
"num_tokens": 30476251.0,
"step": 16355
},
{
"entropy": 6.008179807662964,
"epoch": 1.4447191805015895,
"grad_norm": 2.75,
"learning_rate": 0.00047952329261562914,
"loss": 5.7928,
"mean_token_accuracy": 0.1643812656402588,
"num_tokens": 30485997.0,
"step": 16360
},
{
"entropy": 6.174843168258667,
"epoch": 1.4451607205934298,
"grad_norm": 2.140625,
"learning_rate": 0.00047951016455390023,
"loss": 5.8874,
"mean_token_accuracy": 0.17285365164279937,
"num_tokens": 30494886.0,
"step": 16365
},
{
"entropy": 6.147322320938111,
"epoch": 1.4456022606852703,
"grad_norm": 2.96875,
"learning_rate": 0.0004794970324859334,
"loss": 5.9045,
"mean_token_accuracy": 0.15845912247896193,
"num_tokens": 30504194.0,
"step": 16370
},
{
"entropy": 6.09095025062561,
"epoch": 1.4460438007771106,
"grad_norm": 2.5,
"learning_rate": 0.00047948389641198615,
"loss": 5.7873,
"mean_token_accuracy": 0.17071284502744674,
"num_tokens": 30513077.0,
"step": 16375
},
{
"entropy": 6.074637842178345,
"epoch": 1.4464853408689509,
"grad_norm": 2.296875,
"learning_rate": 0.00047947075633231553,
"loss": 5.851,
"mean_token_accuracy": 0.1656514510512352,
"num_tokens": 30521999.0,
"step": 16380
},
{
"entropy": 6.172419834136963,
"epoch": 1.4469268809607914,
"grad_norm": 2.234375,
"learning_rate": 0.0004794576122471791,
"loss": 5.9174,
"mean_token_accuracy": 0.15797322988510132,
"num_tokens": 30530138.0,
"step": 16385
},
{
"entropy": 6.120775318145752,
"epoch": 1.4473684210526316,
"grad_norm": 1.6796875,
"learning_rate": 0.0004794444641568344,
"loss": 5.7521,
"mean_token_accuracy": 0.17451072335243226,
"num_tokens": 30538850.0,
"step": 16390
},
{
"entropy": 6.080307912826538,
"epoch": 1.447809961144472,
"grad_norm": 2.78125,
"learning_rate": 0.0004794313120615388,
"loss": 5.8393,
"mean_token_accuracy": 0.16686188131570817,
"num_tokens": 30547593.0,
"step": 16395
},
{
"entropy": 6.0848063945770265,
"epoch": 1.4482515012363122,
"grad_norm": 2.125,
"learning_rate": 0.0004794181559615502,
"loss": 5.8213,
"mean_token_accuracy": 0.1658677041530609,
"num_tokens": 30557154.0,
"step": 16400
},
{
"entropy": 6.124777793884277,
"epoch": 1.4486930413281525,
"grad_norm": 3.1875,
"learning_rate": 0.00047940499585712615,
"loss": 5.8278,
"mean_token_accuracy": 0.16719926297664642,
"num_tokens": 30566379.0,
"step": 16405
},
{
"entropy": 6.019178628921509,
"epoch": 1.449134581419993,
"grad_norm": 1.7734375,
"learning_rate": 0.00047939183174852446,
"loss": 5.7598,
"mean_token_accuracy": 0.1755167856812477,
"num_tokens": 30575146.0,
"step": 16410
},
{
"entropy": 6.054279375076294,
"epoch": 1.4495761215118332,
"grad_norm": 2.15625,
"learning_rate": 0.00047937866363600295,
"loss": 5.8285,
"mean_token_accuracy": 0.16880883574485778,
"num_tokens": 30584444.0,
"step": 16415
},
{
"entropy": 6.113443613052368,
"epoch": 1.4500176616036735,
"grad_norm": 2.03125,
"learning_rate": 0.0004793654915198198,
"loss": 5.8294,
"mean_token_accuracy": 0.17074440270662308,
"num_tokens": 30593779.0,
"step": 16420
},
{
"entropy": 6.119849014282226,
"epoch": 1.450459201695514,
"grad_norm": 2.203125,
"learning_rate": 0.0004793523154002328,
"loss": 5.8475,
"mean_token_accuracy": 0.17157271653413772,
"num_tokens": 30603762.0,
"step": 16425
},
{
"entropy": 6.130419301986694,
"epoch": 1.4509007417873543,
"grad_norm": 2.234375,
"learning_rate": 0.00047933913527750015,
"loss": 5.8174,
"mean_token_accuracy": 0.17152507305145265,
"num_tokens": 30612907.0,
"step": 16430
},
{
"entropy": 6.064060258865356,
"epoch": 1.4513422818791946,
"grad_norm": 1.6953125,
"learning_rate": 0.0004793259511518801,
"loss": 5.7882,
"mean_token_accuracy": 0.17622989565134048,
"num_tokens": 30621537.0,
"step": 16435
},
{
"entropy": 6.089838600158691,
"epoch": 1.451783821971035,
"grad_norm": 2.421875,
"learning_rate": 0.0004793127630236309,
"loss": 5.8992,
"mean_token_accuracy": 0.15773479789495468,
"num_tokens": 30632143.0,
"step": 16440
},
{
"entropy": 6.178872776031494,
"epoch": 1.4522253620628753,
"grad_norm": 1.6953125,
"learning_rate": 0.00047929957089301085,
"loss": 5.88,
"mean_token_accuracy": 0.15832947343587875,
"num_tokens": 30641145.0,
"step": 16445
},
{
"entropy": 6.1209289073944095,
"epoch": 1.4526669021547156,
"grad_norm": 2.484375,
"learning_rate": 0.00047928637476027836,
"loss": 5.8591,
"mean_token_accuracy": 0.16620898842811585,
"num_tokens": 30650036.0,
"step": 16450
},
{
"entropy": 6.111941719055176,
"epoch": 1.453108442246556,
"grad_norm": 2.171875,
"learning_rate": 0.00047927317462569206,
"loss": 5.8506,
"mean_token_accuracy": 0.17314930856227875,
"num_tokens": 30659552.0,
"step": 16455
},
{
"entropy": 6.1574187755584715,
"epoch": 1.4535499823383964,
"grad_norm": 2.296875,
"learning_rate": 0.0004792599704895103,
"loss": 5.7922,
"mean_token_accuracy": 0.16787885874509811,
"num_tokens": 30668652.0,
"step": 16460
},
{
"entropy": 6.079209852218628,
"epoch": 1.4539915224302367,
"grad_norm": 2.125,
"learning_rate": 0.000479246762351992,
"loss": 5.8719,
"mean_token_accuracy": 0.16491849422454835,
"num_tokens": 30678613.0,
"step": 16465
},
{
"entropy": 6.112020254135132,
"epoch": 1.454433062522077,
"grad_norm": 2.21875,
"learning_rate": 0.00047923355021339576,
"loss": 5.8257,
"mean_token_accuracy": 0.1633804351091385,
"num_tokens": 30688259.0,
"step": 16470
},
{
"entropy": 6.104108190536499,
"epoch": 1.4548746026139172,
"grad_norm": 1.8515625,
"learning_rate": 0.0004792203340739805,
"loss": 5.8537,
"mean_token_accuracy": 0.16013700440526007,
"num_tokens": 30697309.0,
"step": 16475
},
{
"entropy": 6.16565351486206,
"epoch": 1.4553161427057577,
"grad_norm": 2.25,
"learning_rate": 0.0004792071139340049,
"loss": 5.915,
"mean_token_accuracy": 0.16603440493345262,
"num_tokens": 30707278.0,
"step": 16480
},
{
"entropy": 6.072613191604614,
"epoch": 1.455757682797598,
"grad_norm": 1.921875,
"learning_rate": 0.0004791938897937281,
"loss": 5.8125,
"mean_token_accuracy": 0.1661628320813179,
"num_tokens": 30716840.0,
"step": 16485
},
{
"entropy": 6.0903698921203615,
"epoch": 1.4561992228894383,
"grad_norm": 2.28125,
"learning_rate": 0.00047918066165340926,
"loss": 5.8979,
"mean_token_accuracy": 0.1632187023758888,
"num_tokens": 30727120.0,
"step": 16490
},
{
"entropy": 6.039119005203247,
"epoch": 1.4566407629812788,
"grad_norm": 2.84375,
"learning_rate": 0.0004791674295133072,
"loss": 5.789,
"mean_token_accuracy": 0.16892056316137313,
"num_tokens": 30735543.0,
"step": 16495
},
{
"entropy": 6.095232820510864,
"epoch": 1.457082303073119,
"grad_norm": 2.125,
"learning_rate": 0.00047915419337368146,
"loss": 5.8451,
"mean_token_accuracy": 0.15925087332725524,
"num_tokens": 30744971.0,
"step": 16500
},
{
"entropy": 6.1277471542358395,
"epoch": 1.4575238431649593,
"grad_norm": 2.25,
"learning_rate": 0.00047914095323479115,
"loss": 5.7524,
"mean_token_accuracy": 0.17544924467802048,
"num_tokens": 30753444.0,
"step": 16505
},
{
"entropy": 6.079892683029175,
"epoch": 1.4579653832567998,
"grad_norm": 2.078125,
"learning_rate": 0.0004791277090968956,
"loss": 5.8422,
"mean_token_accuracy": 0.1670495465397835,
"num_tokens": 30761469.0,
"step": 16510
},
{
"entropy": 6.017132520675659,
"epoch": 1.45840692334864,
"grad_norm": 2.28125,
"learning_rate": 0.0004791144609602544,
"loss": 5.7685,
"mean_token_accuracy": 0.1748020276427269,
"num_tokens": 30770773.0,
"step": 16515
},
{
"entropy": 6.063197040557862,
"epoch": 1.4588484634404804,
"grad_norm": 2.171875,
"learning_rate": 0.00047910120882512696,
"loss": 5.8882,
"mean_token_accuracy": 0.16339890658855438,
"num_tokens": 30779624.0,
"step": 16520
},
{
"entropy": 6.0843834400177,
"epoch": 1.4592900035323209,
"grad_norm": 5.625,
"learning_rate": 0.0004790879526917729,
"loss": 5.7872,
"mean_token_accuracy": 0.16625306159257888,
"num_tokens": 30788671.0,
"step": 16525
},
{
"entropy": 6.196316576004028,
"epoch": 1.4597315436241611,
"grad_norm": 4.5,
"learning_rate": 0.0004790746925604519,
"loss": 5.8614,
"mean_token_accuracy": 0.16804990023374558,
"num_tokens": 30797470.0,
"step": 16530
},
{
"entropy": 6.134182500839233,
"epoch": 1.4601730837160014,
"grad_norm": 2.8125,
"learning_rate": 0.00047906142843142383,
"loss": 5.865,
"mean_token_accuracy": 0.16754464954137802,
"num_tokens": 30807209.0,
"step": 16535
},
{
"entropy": 6.1485998153686525,
"epoch": 1.4606146238078417,
"grad_norm": 1.75,
"learning_rate": 0.00047904816030494834,
"loss": 5.874,
"mean_token_accuracy": 0.1599757120013237,
"num_tokens": 30816156.0,
"step": 16540
},
{
"entropy": 6.063813018798828,
"epoch": 1.461056163899682,
"grad_norm": 2.921875,
"learning_rate": 0.0004790348881812855,
"loss": 5.7592,
"mean_token_accuracy": 0.16762945353984832,
"num_tokens": 30825439.0,
"step": 16545
},
{
"entropy": 6.071900510787964,
"epoch": 1.4614977039915225,
"grad_norm": 2.1875,
"learning_rate": 0.00047902161206069514,
"loss": 5.7932,
"mean_token_accuracy": 0.17199310213327407,
"num_tokens": 30834953.0,
"step": 16550
},
{
"entropy": 6.080768203735351,
"epoch": 1.4619392440833627,
"grad_norm": 2.234375,
"learning_rate": 0.00047900833194343764,
"loss": 5.8353,
"mean_token_accuracy": 0.16948921382427215,
"num_tokens": 30843534.0,
"step": 16555
},
{
"entropy": 6.02741174697876,
"epoch": 1.462380784175203,
"grad_norm": 1.9375,
"learning_rate": 0.0004789950478297727,
"loss": 5.7567,
"mean_token_accuracy": 0.17465606182813645,
"num_tokens": 30851869.0,
"step": 16560
},
{
"entropy": 6.128734445571899,
"epoch": 1.4628223242670435,
"grad_norm": 5.25,
"learning_rate": 0.00047898175971996095,
"loss": 5.8888,
"mean_token_accuracy": 0.16105300188064575,
"num_tokens": 30862262.0,
"step": 16565
},
{
"entropy": 6.150708723068237,
"epoch": 1.4632638643588838,
"grad_norm": 2.03125,
"learning_rate": 0.00047896846761426255,
"loss": 5.8951,
"mean_token_accuracy": 0.16105843037366868,
"num_tokens": 30872223.0,
"step": 16570
},
{
"entropy": 6.116905927658081,
"epoch": 1.463705404450724,
"grad_norm": 2.0625,
"learning_rate": 0.0004789551715129378,
"loss": 5.827,
"mean_token_accuracy": 0.16639721691608428,
"num_tokens": 30881834.0,
"step": 16575
},
{
"entropy": 6.133434581756592,
"epoch": 1.4641469445425646,
"grad_norm": 1.9296875,
"learning_rate": 0.0004789418714162472,
"loss": 5.9008,
"mean_token_accuracy": 0.16520113348960877,
"num_tokens": 30893414.0,
"step": 16580
},
{
"entropy": 6.140759468078613,
"epoch": 1.4645884846344048,
"grad_norm": 2.125,
"learning_rate": 0.0004789285673244514,
"loss": 5.9279,
"mean_token_accuracy": 0.15582184493541718,
"num_tokens": 30902345.0,
"step": 16585
},
{
"entropy": 5.9847412109375,
"epoch": 1.465030024726245,
"grad_norm": 2.015625,
"learning_rate": 0.0004789152592378109,
"loss": 5.6549,
"mean_token_accuracy": 0.19056033790111543,
"num_tokens": 30911619.0,
"step": 16590
},
{
"entropy": 6.082251071929932,
"epoch": 1.4654715648180856,
"grad_norm": 1.828125,
"learning_rate": 0.00047890194715658645,
"loss": 5.8595,
"mean_token_accuracy": 0.1596570447087288,
"num_tokens": 30921515.0,
"step": 16595
},
{
"entropy": 6.106188201904297,
"epoch": 1.4659131049099259,
"grad_norm": 2.0625,
"learning_rate": 0.0004788886310810389,
"loss": 5.8131,
"mean_token_accuracy": 0.1753860369324684,
"num_tokens": 30930807.0,
"step": 16600
},
{
"entropy": 6.1389954566955565,
"epoch": 1.4663546450017662,
"grad_norm": 2.1875,
"learning_rate": 0.00047887531101142893,
"loss": 5.8883,
"mean_token_accuracy": 0.1566852182149887,
"num_tokens": 30939266.0,
"step": 16605
},
{
"entropy": 6.122376251220703,
"epoch": 1.4667961850936064,
"grad_norm": 2.125,
"learning_rate": 0.00047886198694801764,
"loss": 5.7868,
"mean_token_accuracy": 0.1666539877653122,
"num_tokens": 30948119.0,
"step": 16610
},
{
"entropy": 6.065003252029419,
"epoch": 1.4672377251854467,
"grad_norm": 2.140625,
"learning_rate": 0.00047884865889106593,
"loss": 5.7358,
"mean_token_accuracy": 0.1739128425717354,
"num_tokens": 30957005.0,
"step": 16615
},
{
"entropy": 5.994833755493164,
"epoch": 1.4676792652772872,
"grad_norm": 1.921875,
"learning_rate": 0.00047883532684083493,
"loss": 5.7654,
"mean_token_accuracy": 0.17672501802444457,
"num_tokens": 30967144.0,
"step": 16620
},
{
"entropy": 6.038400936126709,
"epoch": 1.4681208053691275,
"grad_norm": 3.53125,
"learning_rate": 0.0004788219907975858,
"loss": 5.7557,
"mean_token_accuracy": 0.16726327538490296,
"num_tokens": 30975315.0,
"step": 16625
},
{
"entropy": 6.1180504322052,
"epoch": 1.4685623454609678,
"grad_norm": 1.953125,
"learning_rate": 0.0004788086507615798,
"loss": 5.908,
"mean_token_accuracy": 0.1584606096148491,
"num_tokens": 30984705.0,
"step": 16630
},
{
"entropy": 6.130750894546509,
"epoch": 1.4690038855528083,
"grad_norm": 1.640625,
"learning_rate": 0.0004787953067330782,
"loss": 5.9061,
"mean_token_accuracy": 0.15690550655126573,
"num_tokens": 30994936.0,
"step": 16635
},
{
"entropy": 6.112804985046386,
"epoch": 1.4694454256446485,
"grad_norm": 1.9296875,
"learning_rate": 0.0004787819587123425,
"loss": 5.8272,
"mean_token_accuracy": 0.16139725893735885,
"num_tokens": 31004011.0,
"step": 16640
},
{
"entropy": 6.174977016448975,
"epoch": 1.4698869657364888,
"grad_norm": 1.796875,
"learning_rate": 0.0004787686066996341,
"loss": 5.8775,
"mean_token_accuracy": 0.16112721115350723,
"num_tokens": 31013852.0,
"step": 16645
},
{
"entropy": 6.100440883636475,
"epoch": 1.4703285058283293,
"grad_norm": 2.3125,
"learning_rate": 0.00047875525069521457,
"loss": 5.8143,
"mean_token_accuracy": 0.17048617005348204,
"num_tokens": 31023456.0,
"step": 16650
},
{
"entropy": 6.1090735912323,
"epoch": 1.4707700459201696,
"grad_norm": 1.9140625,
"learning_rate": 0.0004787418906993456,
"loss": 5.8948,
"mean_token_accuracy": 0.1596399337053299,
"num_tokens": 31032828.0,
"step": 16655
},
{
"entropy": 6.096241426467896,
"epoch": 1.4712115860120099,
"grad_norm": 2.375,
"learning_rate": 0.00047872852671228884,
"loss": 5.8205,
"mean_token_accuracy": 0.17458379417657852,
"num_tokens": 31043017.0,
"step": 16660
},
{
"entropy": 6.027974557876587,
"epoch": 1.4716531261038504,
"grad_norm": 2.484375,
"learning_rate": 0.00047871515873430614,
"loss": 5.6915,
"mean_token_accuracy": 0.18176603317260742,
"num_tokens": 31051491.0,
"step": 16665
},
{
"entropy": 6.066203260421753,
"epoch": 1.4720946661956906,
"grad_norm": 2.640625,
"learning_rate": 0.0004787017867656593,
"loss": 5.7409,
"mean_token_accuracy": 0.17820852547883986,
"num_tokens": 31060375.0,
"step": 16670
},
{
"entropy": 6.163179540634156,
"epoch": 1.472536206287531,
"grad_norm": 2.109375,
"learning_rate": 0.0004786884108066103,
"loss": 5.9497,
"mean_token_accuracy": 0.15578442960977554,
"num_tokens": 31071410.0,
"step": 16675
},
{
"entropy": 6.098751449584961,
"epoch": 1.4729777463793712,
"grad_norm": 2.265625,
"learning_rate": 0.0004786750308574212,
"loss": 5.6808,
"mean_token_accuracy": 0.18562431633472443,
"num_tokens": 31080123.0,
"step": 16680
},
{
"entropy": 6.061852025985718,
"epoch": 1.4734192864712115,
"grad_norm": 2.625,
"learning_rate": 0.0004786616469183541,
"loss": 5.8686,
"mean_token_accuracy": 0.16443560421466827,
"num_tokens": 31089870.0,
"step": 16685
},
{
"entropy": 6.1182152271270756,
"epoch": 1.473860826563052,
"grad_norm": 2.421875,
"learning_rate": 0.0004786482589896711,
"loss": 5.8628,
"mean_token_accuracy": 0.1665485367178917,
"num_tokens": 31098682.0,
"step": 16690
},
{
"entropy": 6.126465129852295,
"epoch": 1.4743023666548922,
"grad_norm": 2.5625,
"learning_rate": 0.0004786348670716346,
"loss": 5.8943,
"mean_token_accuracy": 0.16208623796701432,
"num_tokens": 31107785.0,
"step": 16695
},
{
"entropy": 6.027189540863037,
"epoch": 1.4747439067467325,
"grad_norm": 2.078125,
"learning_rate": 0.0004786214711645068,
"loss": 5.7097,
"mean_token_accuracy": 0.17467601895332335,
"num_tokens": 31116853.0,
"step": 16700
},
{
"entropy": 6.124193716049194,
"epoch": 1.475185446838573,
"grad_norm": 3.75,
"learning_rate": 0.0004786080712685503,
"loss": 5.8358,
"mean_token_accuracy": 0.16443626582622528,
"num_tokens": 31126260.0,
"step": 16705
},
{
"entropy": 6.118528270721436,
"epoch": 1.4756269869304133,
"grad_norm": 1.6015625,
"learning_rate": 0.00047859466738402743,
"loss": 5.8881,
"mean_token_accuracy": 0.16785090416669846,
"num_tokens": 31135047.0,
"step": 16710
},
{
"entropy": 6.0996684551239015,
"epoch": 1.4760685270222536,
"grad_norm": 2.71875,
"learning_rate": 0.00047858125951120073,
"loss": 5.818,
"mean_token_accuracy": 0.16569814532995225,
"num_tokens": 31144177.0,
"step": 16715
},
{
"entropy": 6.139336347579956,
"epoch": 1.476510067114094,
"grad_norm": 1.875,
"learning_rate": 0.000478567847650333,
"loss": 5.8928,
"mean_token_accuracy": 0.15954648405313493,
"num_tokens": 31153586.0,
"step": 16720
},
{
"entropy": 6.138139438629151,
"epoch": 1.4769516072059343,
"grad_norm": 2.3125,
"learning_rate": 0.000478554431801687,
"loss": 6.0067,
"mean_token_accuracy": 0.16604733169078828,
"num_tokens": 31163252.0,
"step": 16725
},
{
"entropy": 6.004011774063111,
"epoch": 1.4773931472977746,
"grad_norm": 3.0625,
"learning_rate": 0.0004785410119655253,
"loss": 5.7832,
"mean_token_accuracy": 0.16702827662229539,
"num_tokens": 31171947.0,
"step": 16730
},
{
"entropy": 6.058542728424072,
"epoch": 1.477834687389615,
"grad_norm": 2.65625,
"learning_rate": 0.00047852758814211104,
"loss": 5.8116,
"mean_token_accuracy": 0.1707317814230919,
"num_tokens": 31180502.0,
"step": 16735
},
{
"entropy": 6.1262054443359375,
"epoch": 1.4782762274814554,
"grad_norm": 2.734375,
"learning_rate": 0.00047851416033170704,
"loss": 5.9188,
"mean_token_accuracy": 0.15654567629098892,
"num_tokens": 31190744.0,
"step": 16740
},
{
"entropy": 6.164302778244019,
"epoch": 1.4787177675732956,
"grad_norm": 3.234375,
"learning_rate": 0.0004785007285345764,
"loss": 5.9494,
"mean_token_accuracy": 0.1597891092300415,
"num_tokens": 31200869.0,
"step": 16745
},
{
"entropy": 6.115197849273682,
"epoch": 1.479159307665136,
"grad_norm": 4.6875,
"learning_rate": 0.0004784872927509822,
"loss": 5.843,
"mean_token_accuracy": 0.17337475717067719,
"num_tokens": 31210046.0,
"step": 16750
},
{
"entropy": 6.069035768508911,
"epoch": 1.4796008477569762,
"grad_norm": 4.4375,
"learning_rate": 0.0004784738529811877,
"loss": 5.7668,
"mean_token_accuracy": 0.1737978830933571,
"num_tokens": 31219140.0,
"step": 16755
},
{
"entropy": 6.017835664749145,
"epoch": 1.4800423878488167,
"grad_norm": 5.4375,
"learning_rate": 0.00047846040922545604,
"loss": 5.7829,
"mean_token_accuracy": 0.1720931813120842,
"num_tokens": 31227993.0,
"step": 16760
},
{
"entropy": 6.068987846374512,
"epoch": 1.480483927940657,
"grad_norm": 4.0625,
"learning_rate": 0.00047844696148405074,
"loss": 5.8261,
"mean_token_accuracy": 0.16665592938661575,
"num_tokens": 31236959.0,
"step": 16765
},
{
"entropy": 6.146762084960938,
"epoch": 1.4809254680324972,
"grad_norm": 2.515625,
"learning_rate": 0.00047843350975723523,
"loss": 5.7366,
"mean_token_accuracy": 0.1773433580994606,
"num_tokens": 31246373.0,
"step": 16770
},
{
"entropy": 6.022189664840698,
"epoch": 1.4813670081243377,
"grad_norm": 2.265625,
"learning_rate": 0.0004784200540452729,
"loss": 5.8793,
"mean_token_accuracy": 0.16865076273679733,
"num_tokens": 31255556.0,
"step": 16775
},
{
"entropy": 6.040458154678345,
"epoch": 1.481808548216178,
"grad_norm": 2.640625,
"learning_rate": 0.0004784065943484274,
"loss": 5.7842,
"mean_token_accuracy": 0.17250773459672927,
"num_tokens": 31264824.0,
"step": 16780
},
{
"entropy": 6.053230667114258,
"epoch": 1.4822500883080183,
"grad_norm": 1.953125,
"learning_rate": 0.00047839313066696246,
"loss": 5.7548,
"mean_token_accuracy": 0.17860708087682725,
"num_tokens": 31273946.0,
"step": 16785
},
{
"entropy": 6.080665349960327,
"epoch": 1.4826916283998588,
"grad_norm": 2.625,
"learning_rate": 0.00047837966300114164,
"loss": 5.8038,
"mean_token_accuracy": 0.16341080963611604,
"num_tokens": 31283492.0,
"step": 16790
},
{
"entropy": 6.1266649723052975,
"epoch": 1.483133168491699,
"grad_norm": 2.015625,
"learning_rate": 0.00047836619135122906,
"loss": 5.8414,
"mean_token_accuracy": 0.16796915233135223,
"num_tokens": 31292250.0,
"step": 16795
},
{
"entropy": 6.100845241546631,
"epoch": 1.4835747085835393,
"grad_norm": 2.65625,
"learning_rate": 0.00047835271571748834,
"loss": 5.9931,
"mean_token_accuracy": 0.15550145506858826,
"num_tokens": 31302868.0,
"step": 16800
},
{
"entropy": 6.115131473541259,
"epoch": 1.4840162486753798,
"grad_norm": 2.515625,
"learning_rate": 0.0004783392361001836,
"loss": 5.7603,
"mean_token_accuracy": 0.1753035828471184,
"num_tokens": 31311918.0,
"step": 16805
},
{
"entropy": 6.0473888397216795,
"epoch": 1.4844577887672201,
"grad_norm": 2.046875,
"learning_rate": 0.0004783257524995788,
"loss": 5.7602,
"mean_token_accuracy": 0.1734097644686699,
"num_tokens": 31321339.0,
"step": 16810
},
{
"entropy": 6.108545923233033,
"epoch": 1.4848993288590604,
"grad_norm": 2.46875,
"learning_rate": 0.0004783122649159383,
"loss": 5.7634,
"mean_token_accuracy": 0.1661878377199173,
"num_tokens": 31330498.0,
"step": 16815
},
{
"entropy": 6.016039609909058,
"epoch": 1.4853408689509007,
"grad_norm": 2.5625,
"learning_rate": 0.000478298773349526,
"loss": 5.776,
"mean_token_accuracy": 0.17348876893520354,
"num_tokens": 31339676.0,
"step": 16820
},
{
"entropy": 6.164424705505371,
"epoch": 1.485782409042741,
"grad_norm": 2.046875,
"learning_rate": 0.0004782852778006064,
"loss": 5.9518,
"mean_token_accuracy": 0.1604897655546665,
"num_tokens": 31350072.0,
"step": 16825
},
{
"entropy": 6.214613962173462,
"epoch": 1.4862239491345814,
"grad_norm": 1.9765625,
"learning_rate": 0.00047827177826944396,
"loss": 5.8165,
"mean_token_accuracy": 0.17251616716384888,
"num_tokens": 31359992.0,
"step": 16830
},
{
"entropy": 6.053749990463257,
"epoch": 1.4866654892264217,
"grad_norm": 2.515625,
"learning_rate": 0.00047825827475630285,
"loss": 5.8144,
"mean_token_accuracy": 0.17339295148849487,
"num_tokens": 31369434.0,
"step": 16835
},
{
"entropy": 6.007764911651611,
"epoch": 1.487107029318262,
"grad_norm": 2.6875,
"learning_rate": 0.00047824476726144775,
"loss": 5.8303,
"mean_token_accuracy": 0.1652998298406601,
"num_tokens": 31378773.0,
"step": 16840
},
{
"entropy": 6.1889341354370115,
"epoch": 1.4875485694101025,
"grad_norm": 2.203125,
"learning_rate": 0.00047823125578514325,
"loss": 5.8527,
"mean_token_accuracy": 0.16319994181394576,
"num_tokens": 31388219.0,
"step": 16845
},
{
"entropy": 6.0548206806182865,
"epoch": 1.4879901095019428,
"grad_norm": 2.28125,
"learning_rate": 0.00047821774032765407,
"loss": 5.7736,
"mean_token_accuracy": 0.17643750756978988,
"num_tokens": 31397216.0,
"step": 16850
},
{
"entropy": 5.994337368011474,
"epoch": 1.488431649593783,
"grad_norm": 2.671875,
"learning_rate": 0.0004782042208892449,
"loss": 5.7492,
"mean_token_accuracy": 0.17886727452278137,
"num_tokens": 31406861.0,
"step": 16855
},
{
"entropy": 6.049257278442383,
"epoch": 1.4888731896856235,
"grad_norm": 2.921875,
"learning_rate": 0.00047819069747018065,
"loss": 5.8492,
"mean_token_accuracy": 0.17013893872499466,
"num_tokens": 31416387.0,
"step": 16860
},
{
"entropy": 6.124043321609497,
"epoch": 1.4893147297774638,
"grad_norm": 1.8046875,
"learning_rate": 0.0004781771700707262,
"loss": 5.7535,
"mean_token_accuracy": 0.17073024362325667,
"num_tokens": 31425056.0,
"step": 16865
},
{
"entropy": 6.1238147735595705,
"epoch": 1.489756269869304,
"grad_norm": 2.671875,
"learning_rate": 0.0004781636386911465,
"loss": 5.9546,
"mean_token_accuracy": 0.16077700704336167,
"num_tokens": 31435746.0,
"step": 16870
},
{
"entropy": 6.132592058181762,
"epoch": 1.4901978099611446,
"grad_norm": 2.046875,
"learning_rate": 0.0004781501033317067,
"loss": 5.9452,
"mean_token_accuracy": 0.15961093008518218,
"num_tokens": 31444808.0,
"step": 16875
},
{
"entropy": 6.137254428863526,
"epoch": 1.4906393500529849,
"grad_norm": 2.5,
"learning_rate": 0.0004781365639926718,
"loss": 5.8585,
"mean_token_accuracy": 0.1676896795630455,
"num_tokens": 31454205.0,
"step": 16880
},
{
"entropy": 6.134459972381592,
"epoch": 1.4910808901448251,
"grad_norm": 1.6328125,
"learning_rate": 0.0004781230206743073,
"loss": 5.8703,
"mean_token_accuracy": 0.16152407675981523,
"num_tokens": 31463446.0,
"step": 16885
},
{
"entropy": 6.1323872089385985,
"epoch": 1.4915224302366654,
"grad_norm": 1.8203125,
"learning_rate": 0.0004781094733768783,
"loss": 5.8423,
"mean_token_accuracy": 0.1696338102221489,
"num_tokens": 31473168.0,
"step": 16890
},
{
"entropy": 6.067504787445069,
"epoch": 1.4919639703285057,
"grad_norm": 2.078125,
"learning_rate": 0.00047809592210065017,
"loss": 5.7436,
"mean_token_accuracy": 0.17318003624677658,
"num_tokens": 31482899.0,
"step": 16895
},
{
"entropy": 6.059530353546142,
"epoch": 1.4924055104203462,
"grad_norm": 2.359375,
"learning_rate": 0.00047808236684588847,
"loss": 5.7348,
"mean_token_accuracy": 0.16994209140539168,
"num_tokens": 31492503.0,
"step": 16900
},
{
"entropy": 5.979795789718628,
"epoch": 1.4928470505121865,
"grad_norm": 3.046875,
"learning_rate": 0.0004780688076128587,
"loss": 5.6982,
"mean_token_accuracy": 0.18332343101501464,
"num_tokens": 31501520.0,
"step": 16905
},
{
"entropy": 6.0934898853302,
"epoch": 1.4932885906040267,
"grad_norm": 3.078125,
"learning_rate": 0.00047805524440182654,
"loss": 5.8663,
"mean_token_accuracy": 0.17112187892198563,
"num_tokens": 31510821.0,
"step": 16910
},
{
"entropy": 6.140140962600708,
"epoch": 1.4937301306958672,
"grad_norm": 2.765625,
"learning_rate": 0.00047804167721305756,
"loss": 5.8198,
"mean_token_accuracy": 0.17091161161661148,
"num_tokens": 31520472.0,
"step": 16915
},
{
"entropy": 6.045886516571045,
"epoch": 1.4941716707877075,
"grad_norm": 1.7109375,
"learning_rate": 0.00047802810604681757,
"loss": 5.849,
"mean_token_accuracy": 0.1713043913245201,
"num_tokens": 31529129.0,
"step": 16920
},
{
"entropy": 6.009889459609985,
"epoch": 1.4946132108795478,
"grad_norm": 1.875,
"learning_rate": 0.00047801453090337256,
"loss": 5.7925,
"mean_token_accuracy": 0.1735928624868393,
"num_tokens": 31537897.0,
"step": 16925
},
{
"entropy": 6.138300371170044,
"epoch": 1.4950547509713883,
"grad_norm": 2.34375,
"learning_rate": 0.0004780009517829882,
"loss": 5.8278,
"mean_token_accuracy": 0.16679175347089767,
"num_tokens": 31547656.0,
"step": 16930
},
{
"entropy": 6.099179601669311,
"epoch": 1.4954962910632286,
"grad_norm": 1.7890625,
"learning_rate": 0.0004779873686859308,
"loss": 5.8086,
"mean_token_accuracy": 0.1711348757147789,
"num_tokens": 31557303.0,
"step": 16935
},
{
"entropy": 6.137022924423218,
"epoch": 1.4959378311550688,
"grad_norm": 2.84375,
"learning_rate": 0.00047797378161246613,
"loss": 5.8251,
"mean_token_accuracy": 0.16063254028558732,
"num_tokens": 31565749.0,
"step": 16940
},
{
"entropy": 6.084331035614014,
"epoch": 1.4963793712469093,
"grad_norm": 1.7578125,
"learning_rate": 0.00047796019056286067,
"loss": 5.8614,
"mean_token_accuracy": 0.17144813239574433,
"num_tokens": 31575286.0,
"step": 16945
},
{
"entropy": 6.144155406951905,
"epoch": 1.4968209113387496,
"grad_norm": 4.21875,
"learning_rate": 0.0004779465955373804,
"loss": 5.8112,
"mean_token_accuracy": 0.17744483053684235,
"num_tokens": 31583723.0,
"step": 16950
},
{
"entropy": 5.9734655857086185,
"epoch": 1.49726245143059,
"grad_norm": 2.09375,
"learning_rate": 0.0004779329965362918,
"loss": 5.671,
"mean_token_accuracy": 0.18475079536437988,
"num_tokens": 31593171.0,
"step": 16955
},
{
"entropy": 6.020520210266113,
"epoch": 1.4977039915224302,
"grad_norm": 3.734375,
"learning_rate": 0.00047791939355986123,
"loss": 5.8611,
"mean_token_accuracy": 0.16288325786590577,
"num_tokens": 31603958.0,
"step": 16960
},
{
"entropy": 6.01478533744812,
"epoch": 1.4981455316142704,
"grad_norm": 2.140625,
"learning_rate": 0.0004779057866083551,
"loss": 5.8112,
"mean_token_accuracy": 0.16690921038389206,
"num_tokens": 31612460.0,
"step": 16965
},
{
"entropy": 6.133856916427613,
"epoch": 1.498587071706111,
"grad_norm": 3.0,
"learning_rate": 0.00047789217568204004,
"loss": 5.9077,
"mean_token_accuracy": 0.1652039647102356,
"num_tokens": 31622114.0,
"step": 16970
},
{
"entropy": 6.185836887359619,
"epoch": 1.4990286117979512,
"grad_norm": 2.5625,
"learning_rate": 0.00047787856078118266,
"loss": 5.8234,
"mean_token_accuracy": 0.17023879438638687,
"num_tokens": 31632272.0,
"step": 16975
},
{
"entropy": 6.143848514556884,
"epoch": 1.4994701518897915,
"grad_norm": 2.328125,
"learning_rate": 0.0004778649419060496,
"loss": 5.8134,
"mean_token_accuracy": 0.1684472978115082,
"num_tokens": 31642235.0,
"step": 16980
},
{
"entropy": 6.074910497665405,
"epoch": 1.499911691981632,
"grad_norm": 3.796875,
"learning_rate": 0.0004778513190569077,
"loss": 5.8894,
"mean_token_accuracy": 0.16002195626497268,
"num_tokens": 31652773.0,
"step": 16985
},
{
"entropy": 6.128612279891968,
"epoch": 1.5003532320734723,
"grad_norm": 2.1875,
"learning_rate": 0.0004778376922340239,
"loss": 5.8711,
"mean_token_accuracy": 0.16508624702692032,
"num_tokens": 31662681.0,
"step": 16990
},
{
"entropy": 6.058875608444214,
"epoch": 1.5007947721653125,
"grad_norm": 1.84375,
"learning_rate": 0.000477824061437665,
"loss": 5.7685,
"mean_token_accuracy": 0.1714063122868538,
"num_tokens": 31671576.0,
"step": 16995
},
{
"entropy": 6.132833766937256,
"epoch": 1.501236312257153,
"grad_norm": 3.015625,
"learning_rate": 0.00047781042666809816,
"loss": 5.9858,
"mean_token_accuracy": 0.1538826048374176,
"num_tokens": 31681149.0,
"step": 17000
},
{
"entropy": 6.089202880859375,
"epoch": 1.5016778523489933,
"grad_norm": 2.0,
"learning_rate": 0.0004777967879255904,
"loss": 5.7803,
"mean_token_accuracy": 0.16648064851760863,
"num_tokens": 31690007.0,
"step": 17005
},
{
"entropy": 6.192841577529907,
"epoch": 1.5021193924408336,
"grad_norm": 2.296875,
"learning_rate": 0.0004777831452104088,
"loss": 5.9304,
"mean_token_accuracy": 0.15836721807718276,
"num_tokens": 31700055.0,
"step": 17010
},
{
"entropy": 6.13472809791565,
"epoch": 1.502560932532674,
"grad_norm": 2.421875,
"learning_rate": 0.0004777694985228208,
"loss": 5.8169,
"mean_token_accuracy": 0.16753202378749849,
"num_tokens": 31708255.0,
"step": 17015
},
{
"entropy": 6.061981630325318,
"epoch": 1.5030024726245141,
"grad_norm": 2.875,
"learning_rate": 0.00047775584786309365,
"loss": 5.8383,
"mean_token_accuracy": 0.16871743351221086,
"num_tokens": 31716855.0,
"step": 17020
},
{
"entropy": 6.031319284439087,
"epoch": 1.5034440127163546,
"grad_norm": 1.6875,
"learning_rate": 0.00047774219323149474,
"loss": 5.7996,
"mean_token_accuracy": 0.17565614283084868,
"num_tokens": 31726153.0,
"step": 17025
},
{
"entropy": 6.089668321609497,
"epoch": 1.5038855528081951,
"grad_norm": 2.1875,
"learning_rate": 0.0004777285346282916,
"loss": 5.821,
"mean_token_accuracy": 0.1709704577922821,
"num_tokens": 31736935.0,
"step": 17030
},
{
"entropy": 6.134145927429199,
"epoch": 1.5043270929000352,
"grad_norm": 2.109375,
"learning_rate": 0.0004777148720537517,
"loss": 5.8821,
"mean_token_accuracy": 0.1667067140340805,
"num_tokens": 31746402.0,
"step": 17035
},
{
"entropy": 6.050812196731568,
"epoch": 1.5047686329918757,
"grad_norm": 3.421875,
"learning_rate": 0.00047770120550814276,
"loss": 5.7226,
"mean_token_accuracy": 0.17188408672809602,
"num_tokens": 31755615.0,
"step": 17040
},
{
"entropy": 6.0506431579589846,
"epoch": 1.505210173083716,
"grad_norm": 2.109375,
"learning_rate": 0.0004776875349917325,
"loss": 5.8734,
"mean_token_accuracy": 0.1710309848189354,
"num_tokens": 31765701.0,
"step": 17045
},
{
"entropy": 6.098856830596924,
"epoch": 1.5056517131755562,
"grad_norm": 3.625,
"learning_rate": 0.0004776738605047887,
"loss": 5.8353,
"mean_token_accuracy": 0.1662130355834961,
"num_tokens": 31774674.0,
"step": 17050
},
{
"entropy": 6.131393623352051,
"epoch": 1.5060932532673967,
"grad_norm": 2.984375,
"learning_rate": 0.0004776601820475793,
"loss": 5.7963,
"mean_token_accuracy": 0.16560952961444855,
"num_tokens": 31784871.0,
"step": 17055
},
{
"entropy": 6.1105176448822025,
"epoch": 1.506534793359237,
"grad_norm": 1.9453125,
"learning_rate": 0.0004776464996203721,
"loss": 5.7534,
"mean_token_accuracy": 0.17687686383724213,
"num_tokens": 31793274.0,
"step": 17060
},
{
"entropy": 6.1133420944213865,
"epoch": 1.5069763334510773,
"grad_norm": 2.390625,
"learning_rate": 0.0004776328132234353,
"loss": 5.9287,
"mean_token_accuracy": 0.158304063975811,
"num_tokens": 31803543.0,
"step": 17065
},
{
"entropy": 6.185716438293457,
"epoch": 1.5074178735429178,
"grad_norm": 2.3125,
"learning_rate": 0.0004776191228570368,
"loss": 5.9166,
"mean_token_accuracy": 0.1585632249712944,
"num_tokens": 31814529.0,
"step": 17070
},
{
"entropy": 6.171987056732178,
"epoch": 1.507859413634758,
"grad_norm": 2.578125,
"learning_rate": 0.0004776054285214451,
"loss": 5.8727,
"mean_token_accuracy": 0.16515349894762038,
"num_tokens": 31824064.0,
"step": 17075
},
{
"entropy": 6.109159517288208,
"epoch": 1.5083009537265983,
"grad_norm": 1.9453125,
"learning_rate": 0.00047759173021692813,
"loss": 5.86,
"mean_token_accuracy": 0.1602833241224289,
"num_tokens": 31833881.0,
"step": 17080
},
{
"entropy": 6.028692960739136,
"epoch": 1.5087424938184388,
"grad_norm": 2.09375,
"learning_rate": 0.0004775780279437545,
"loss": 5.8016,
"mean_token_accuracy": 0.1714847832918167,
"num_tokens": 31842987.0,
"step": 17085
},
{
"entropy": 6.094038009643555,
"epoch": 1.5091840339102789,
"grad_norm": 2.9375,
"learning_rate": 0.00047756432170219243,
"loss": 5.7545,
"mean_token_accuracy": 0.1671556919813156,
"num_tokens": 31851806.0,
"step": 17090
},
{
"entropy": 6.213186883926392,
"epoch": 1.5096255740021194,
"grad_norm": 1.71875,
"learning_rate": 0.0004775506114925106,
"loss": 5.9197,
"mean_token_accuracy": 0.1592623010277748,
"num_tokens": 31861857.0,
"step": 17095
},
{
"entropy": 6.139192914962768,
"epoch": 1.5100671140939599,
"grad_norm": 1.8984375,
"learning_rate": 0.00047753689731497734,
"loss": 5.8139,
"mean_token_accuracy": 0.1669353723526001,
"num_tokens": 31871252.0,
"step": 17100
},
{
"entropy": 6.112818765640259,
"epoch": 1.5105086541858,
"grad_norm": 1.84375,
"learning_rate": 0.0004775231791698616,
"loss": 5.8841,
"mean_token_accuracy": 0.15806825160980226,
"num_tokens": 31880734.0,
"step": 17105
},
{
"entropy": 6.128307294845581,
"epoch": 1.5109501942776404,
"grad_norm": 1.8984375,
"learning_rate": 0.00047750945705743187,
"loss": 5.7887,
"mean_token_accuracy": 0.16512935757637023,
"num_tokens": 31889304.0,
"step": 17110
},
{
"entropy": 6.083055734634399,
"epoch": 1.5113917343694807,
"grad_norm": 3.578125,
"learning_rate": 0.0004774957309779571,
"loss": 5.8387,
"mean_token_accuracy": 0.16495664268732071,
"num_tokens": 31898586.0,
"step": 17115
},
{
"entropy": 6.116261720657349,
"epoch": 1.511833274461321,
"grad_norm": 2.578125,
"learning_rate": 0.0004774820009317061,
"loss": 5.885,
"mean_token_accuracy": 0.15873634070158005,
"num_tokens": 31908153.0,
"step": 17120
},
{
"entropy": 6.026772403717041,
"epoch": 1.5122748145531615,
"grad_norm": 1.7578125,
"learning_rate": 0.00047746826691894787,
"loss": 5.6704,
"mean_token_accuracy": 0.1858276069164276,
"num_tokens": 31916467.0,
"step": 17125
},
{
"entropy": 5.9756371021270756,
"epoch": 1.5127163546450018,
"grad_norm": 2.234375,
"learning_rate": 0.00047745452893995145,
"loss": 5.7991,
"mean_token_accuracy": 0.16240359395742415,
"num_tokens": 31925469.0,
"step": 17130
},
{
"entropy": 6.070770788192749,
"epoch": 1.513157894736842,
"grad_norm": 1.734375,
"learning_rate": 0.00047744078699498587,
"loss": 5.8798,
"mean_token_accuracy": 0.1579558938741684,
"num_tokens": 31934747.0,
"step": 17135
},
{
"entropy": 6.13003191947937,
"epoch": 1.5135994348286825,
"grad_norm": 1.765625,
"learning_rate": 0.00047742704108432046,
"loss": 5.7934,
"mean_token_accuracy": 0.16213531345129012,
"num_tokens": 31943773.0,
"step": 17140
},
{
"entropy": 6.051134300231934,
"epoch": 1.5140409749205228,
"grad_norm": 2.09375,
"learning_rate": 0.00047741329120822446,
"loss": 5.8611,
"mean_token_accuracy": 0.16859391927719117,
"num_tokens": 31952699.0,
"step": 17145
},
{
"entropy": 6.062549352645874,
"epoch": 1.514482515012363,
"grad_norm": 1.890625,
"learning_rate": 0.0004773995373669672,
"loss": 5.8298,
"mean_token_accuracy": 0.1602741986513138,
"num_tokens": 31962845.0,
"step": 17150
},
{
"entropy": 6.121352577209473,
"epoch": 1.5149240551042036,
"grad_norm": 2.046875,
"learning_rate": 0.0004773857795608181,
"loss": 5.7203,
"mean_token_accuracy": 0.18019993603229523,
"num_tokens": 31972437.0,
"step": 17155
},
{
"entropy": 6.1184907913208,
"epoch": 1.5153655951960436,
"grad_norm": 2.734375,
"learning_rate": 0.00047737201779004667,
"loss": 5.8979,
"mean_token_accuracy": 0.1684282287955284,
"num_tokens": 31981652.0,
"step": 17160
},
{
"entropy": 6.1103071689605715,
"epoch": 1.5158071352878841,
"grad_norm": 2.4375,
"learning_rate": 0.0004773582520549226,
"loss": 5.8271,
"mean_token_accuracy": 0.1674877166748047,
"num_tokens": 31990088.0,
"step": 17165
},
{
"entropy": 6.110657405853272,
"epoch": 1.5162486753797246,
"grad_norm": 2.421875,
"learning_rate": 0.0004773444823557153,
"loss": 5.8569,
"mean_token_accuracy": 0.17246335595846177,
"num_tokens": 31999386.0,
"step": 17170
},
{
"entropy": 6.104423666000367,
"epoch": 1.5166902154715647,
"grad_norm": 2.296875,
"learning_rate": 0.0004773307086926948,
"loss": 5.7669,
"mean_token_accuracy": 0.1683843344449997,
"num_tokens": 32007695.0,
"step": 17175
},
{
"entropy": 6.07840633392334,
"epoch": 1.5171317555634052,
"grad_norm": 2.0,
"learning_rate": 0.00047731693106613075,
"loss": 5.9244,
"mean_token_accuracy": 0.16578991562128068,
"num_tokens": 32018300.0,
"step": 17180
},
{
"entropy": 6.0873167514801025,
"epoch": 1.5175732956552455,
"grad_norm": 1.796875,
"learning_rate": 0.0004773031494762931,
"loss": 5.883,
"mean_token_accuracy": 0.16245420426130294,
"num_tokens": 32028386.0,
"step": 17185
},
{
"entropy": 6.149094104766846,
"epoch": 1.5180148357470857,
"grad_norm": 2.421875,
"learning_rate": 0.0004772893639234518,
"loss": 5.8933,
"mean_token_accuracy": 0.16669531166553497,
"num_tokens": 32037260.0,
"step": 17190
},
{
"entropy": 6.125725126266479,
"epoch": 1.5184563758389262,
"grad_norm": 2.015625,
"learning_rate": 0.0004772755744078769,
"loss": 5.9071,
"mean_token_accuracy": 0.16324087083339692,
"num_tokens": 32047654.0,
"step": 17195
},
{
"entropy": 6.06972074508667,
"epoch": 1.5188979159307665,
"grad_norm": 4.40625,
"learning_rate": 0.0004772617809298385,
"loss": 5.8313,
"mean_token_accuracy": 0.1651151493191719,
"num_tokens": 32056791.0,
"step": 17200
},
{
"entropy": 6.176487827301026,
"epoch": 1.5193394560226068,
"grad_norm": 1.734375,
"learning_rate": 0.0004772479834896069,
"loss": 5.8371,
"mean_token_accuracy": 0.16250982284545898,
"num_tokens": 32066561.0,
"step": 17205
},
{
"entropy": 6.204676008224487,
"epoch": 1.5197809961144473,
"grad_norm": 2.859375,
"learning_rate": 0.00047723418208745226,
"loss": 5.8605,
"mean_token_accuracy": 0.1643473133444786,
"num_tokens": 32075801.0,
"step": 17210
},
{
"entropy": 6.028150939941407,
"epoch": 1.5202225362062876,
"grad_norm": 2.421875,
"learning_rate": 0.0004772203767236451,
"loss": 5.796,
"mean_token_accuracy": 0.16983660012483598,
"num_tokens": 32085274.0,
"step": 17215
},
{
"entropy": 6.056877565383911,
"epoch": 1.5206640762981278,
"grad_norm": 1.65625,
"learning_rate": 0.00047720656739845573,
"loss": 5.8301,
"mean_token_accuracy": 0.16838492155075074,
"num_tokens": 32094481.0,
"step": 17220
},
{
"entropy": 6.006037759780884,
"epoch": 1.5211056163899683,
"grad_norm": 1.65625,
"learning_rate": 0.0004771927541121547,
"loss": 5.7863,
"mean_token_accuracy": 0.17237377762794495,
"num_tokens": 32103094.0,
"step": 17225
},
{
"entropy": 6.0993787288665775,
"epoch": 1.5215471564818084,
"grad_norm": 1.6484375,
"learning_rate": 0.0004771789368650126,
"loss": 5.8049,
"mean_token_accuracy": 0.1687069818377495,
"num_tokens": 32112230.0,
"step": 17230
},
{
"entropy": 6.07606348991394,
"epoch": 1.5219886965736489,
"grad_norm": 1.9765625,
"learning_rate": 0.00047716511565730013,
"loss": 5.8203,
"mean_token_accuracy": 0.16994065344333648,
"num_tokens": 32121472.0,
"step": 17235
},
{
"entropy": 6.145331907272339,
"epoch": 1.5224302366654894,
"grad_norm": 4.375,
"learning_rate": 0.000477151290489288,
"loss": 5.8326,
"mean_token_accuracy": 0.17241119146347045,
"num_tokens": 32130849.0,
"step": 17240
},
{
"entropy": 6.118664264678955,
"epoch": 1.5228717767573294,
"grad_norm": 1.9765625,
"learning_rate": 0.0004771374613612471,
"loss": 5.7874,
"mean_token_accuracy": 0.17001993209123611,
"num_tokens": 32140874.0,
"step": 17245
},
{
"entropy": 6.119968032836914,
"epoch": 1.52331331684917,
"grad_norm": 1.7265625,
"learning_rate": 0.0004771236282734482,
"loss": 5.7591,
"mean_token_accuracy": 0.16728101521730424,
"num_tokens": 32150774.0,
"step": 17250
},
{
"entropy": 6.036998987197876,
"epoch": 1.5237548569410102,
"grad_norm": 1.828125,
"learning_rate": 0.00047710979122616247,
"loss": 5.7769,
"mean_token_accuracy": 0.16949184089899064,
"num_tokens": 32159825.0,
"step": 17255
},
{
"entropy": 6.045369100570679,
"epoch": 1.5241963970328505,
"grad_norm": 2.171875,
"learning_rate": 0.0004770959502196609,
"loss": 5.8151,
"mean_token_accuracy": 0.16876500099897385,
"num_tokens": 32168443.0,
"step": 17260
},
{
"entropy": 6.13749589920044,
"epoch": 1.524637937124691,
"grad_norm": 1.7265625,
"learning_rate": 0.00047708210525421445,
"loss": 5.7941,
"mean_token_accuracy": 0.16763613373041153,
"num_tokens": 32178065.0,
"step": 17265
},
{
"entropy": 6.108592557907104,
"epoch": 1.5250794772165313,
"grad_norm": 2.71875,
"learning_rate": 0.00047706825633009466,
"loss": 5.6814,
"mean_token_accuracy": 0.1767183944582939,
"num_tokens": 32187274.0,
"step": 17270
},
{
"entropy": 6.032173919677734,
"epoch": 1.5255210173083715,
"grad_norm": 3.390625,
"learning_rate": 0.00047705440344757264,
"loss": 5.6744,
"mean_token_accuracy": 0.17957901805639268,
"num_tokens": 32195811.0,
"step": 17275
},
{
"entropy": 5.916690444946289,
"epoch": 1.525962557400212,
"grad_norm": 1.953125,
"learning_rate": 0.00047704054660691964,
"loss": 5.7601,
"mean_token_accuracy": 0.17283954620361328,
"num_tokens": 32204958.0,
"step": 17280
},
{
"entropy": 6.056380891799927,
"epoch": 1.5264040974920523,
"grad_norm": 2.40625,
"learning_rate": 0.0004770266858084074,
"loss": 5.78,
"mean_token_accuracy": 0.1731582462787628,
"num_tokens": 32214299.0,
"step": 17285
},
{
"entropy": 6.132654190063477,
"epoch": 1.5268456375838926,
"grad_norm": 1.7578125,
"learning_rate": 0.00047701282105230716,
"loss": 5.8564,
"mean_token_accuracy": 0.16794989109039307,
"num_tokens": 32223353.0,
"step": 17290
},
{
"entropy": 6.129411602020264,
"epoch": 1.527287177675733,
"grad_norm": 3.1875,
"learning_rate": 0.0004769989523388906,
"loss": 5.8342,
"mean_token_accuracy": 0.15765578150749207,
"num_tokens": 32232641.0,
"step": 17295
},
{
"entropy": 6.188453245162964,
"epoch": 1.5277287177675731,
"grad_norm": 1.8203125,
"learning_rate": 0.0004769850796684296,
"loss": 5.9073,
"mean_token_accuracy": 0.15796520486474036,
"num_tokens": 32243028.0,
"step": 17300
},
{
"entropy": 6.129120397567749,
"epoch": 1.5281702578594136,
"grad_norm": 1.8046875,
"learning_rate": 0.0004769712030411957,
"loss": 5.8334,
"mean_token_accuracy": 0.1693001300096512,
"num_tokens": 32253660.0,
"step": 17305
},
{
"entropy": 6.097779655456543,
"epoch": 1.5286117979512541,
"grad_norm": 2.546875,
"learning_rate": 0.00047695732245746076,
"loss": 5.8301,
"mean_token_accuracy": 0.16979219764471054,
"num_tokens": 32263267.0,
"step": 17310
},
{
"entropy": 6.079668140411377,
"epoch": 1.5290533380430942,
"grad_norm": 2.765625,
"learning_rate": 0.0004769434379174967,
"loss": 5.7823,
"mean_token_accuracy": 0.17535442411899566,
"num_tokens": 32273929.0,
"step": 17315
},
{
"entropy": 6.034246253967285,
"epoch": 1.5294948781349347,
"grad_norm": 1.6796875,
"learning_rate": 0.0004769295494215757,
"loss": 5.7949,
"mean_token_accuracy": 0.17181513756513594,
"num_tokens": 32282717.0,
"step": 17320
},
{
"entropy": 6.103975009918213,
"epoch": 1.529936418226775,
"grad_norm": 2.015625,
"learning_rate": 0.00047691565696996954,
"loss": 5.8606,
"mean_token_accuracy": 0.1718050330877304,
"num_tokens": 32293225.0,
"step": 17325
},
{
"entropy": 6.140183830261231,
"epoch": 1.5303779583186152,
"grad_norm": 2.171875,
"learning_rate": 0.0004769017605629505,
"loss": 5.7629,
"mean_token_accuracy": 0.17733007818460464,
"num_tokens": 32301582.0,
"step": 17330
},
{
"entropy": 5.99885835647583,
"epoch": 1.5308194984104557,
"grad_norm": 2.59375,
"learning_rate": 0.0004768878602007909,
"loss": 5.7527,
"mean_token_accuracy": 0.16710060834884644,
"num_tokens": 32310131.0,
"step": 17335
},
{
"entropy": 6.041949653625489,
"epoch": 1.531261038502296,
"grad_norm": 1.4921875,
"learning_rate": 0.0004768739558837628,
"loss": 5.8404,
"mean_token_accuracy": 0.16583852767944335,
"num_tokens": 32320038.0,
"step": 17340
},
{
"entropy": 6.114171504974365,
"epoch": 1.5317025785941363,
"grad_norm": 2.125,
"learning_rate": 0.0004768600476121388,
"loss": 5.8716,
"mean_token_accuracy": 0.16631779372692107,
"num_tokens": 32329568.0,
"step": 17345
},
{
"entropy": 6.215513420104981,
"epoch": 1.5321441186859768,
"grad_norm": 1.625,
"learning_rate": 0.00047684613538619125,
"loss": 5.8332,
"mean_token_accuracy": 0.1676095798611641,
"num_tokens": 32338940.0,
"step": 17350
},
{
"entropy": 6.049060821533203,
"epoch": 1.532585658777817,
"grad_norm": 1.90625,
"learning_rate": 0.0004768322192061927,
"loss": 5.7688,
"mean_token_accuracy": 0.17266601473093032,
"num_tokens": 32347757.0,
"step": 17355
},
{
"entropy": 5.927619457244873,
"epoch": 1.5330271988696573,
"grad_norm": 1.609375,
"learning_rate": 0.0004768182990724158,
"loss": 5.735,
"mean_token_accuracy": 0.1741407558321953,
"num_tokens": 32357099.0,
"step": 17360
},
{
"entropy": 6.074064922332764,
"epoch": 1.5334687389614978,
"grad_norm": 2.28125,
"learning_rate": 0.00047680437498513317,
"loss": 5.8421,
"mean_token_accuracy": 0.16783702671527861,
"num_tokens": 32366548.0,
"step": 17365
},
{
"entropy": 6.155899477005005,
"epoch": 1.5339102790533379,
"grad_norm": 1.84375,
"learning_rate": 0.00047679044694461765,
"loss": 5.9789,
"mean_token_accuracy": 0.15655744969844818,
"num_tokens": 32377435.0,
"step": 17370
},
{
"entropy": 6.118641519546509,
"epoch": 1.5343518191451784,
"grad_norm": 1.96875,
"learning_rate": 0.000476776514951142,
"loss": 5.8474,
"mean_token_accuracy": 0.1569461852312088,
"num_tokens": 32386922.0,
"step": 17375
},
{
"entropy": 6.048507833480835,
"epoch": 1.5347933592370189,
"grad_norm": 4.9375,
"learning_rate": 0.00047676257900497915,
"loss": 5.8819,
"mean_token_accuracy": 0.16623508036136628,
"num_tokens": 32396350.0,
"step": 17380
},
{
"entropy": 5.978889417648316,
"epoch": 1.535234899328859,
"grad_norm": 1.6875,
"learning_rate": 0.00047674863910640217,
"loss": 5.6654,
"mean_token_accuracy": 0.17931348979473113,
"num_tokens": 32405678.0,
"step": 17385
},
{
"entropy": 6.110194253921509,
"epoch": 1.5356764394206994,
"grad_norm": 1.7578125,
"learning_rate": 0.00047673469525568406,
"loss": 5.802,
"mean_token_accuracy": 0.1704329416155815,
"num_tokens": 32415793.0,
"step": 17390
},
{
"entropy": 6.029006433486939,
"epoch": 1.5361179795125397,
"grad_norm": 1.78125,
"learning_rate": 0.00047672074745309804,
"loss": 5.7041,
"mean_token_accuracy": 0.17848612517118453,
"num_tokens": 32424735.0,
"step": 17395
},
{
"entropy": 5.976036787033081,
"epoch": 1.53655951960438,
"grad_norm": 2.25,
"learning_rate": 0.0004767067956989172,
"loss": 5.8436,
"mean_token_accuracy": 0.1752062514424324,
"num_tokens": 32435213.0,
"step": 17400
},
{
"entropy": 6.056599426269531,
"epoch": 1.5370010596962205,
"grad_norm": 2.0,
"learning_rate": 0.0004766928399934151,
"loss": 5.7113,
"mean_token_accuracy": 0.17057815939188004,
"num_tokens": 32443932.0,
"step": 17405
},
{
"entropy": 6.097528266906738,
"epoch": 1.5374425997880607,
"grad_norm": 2.265625,
"learning_rate": 0.0004766788803368649,
"loss": 5.718,
"mean_token_accuracy": 0.17339348345994948,
"num_tokens": 32453851.0,
"step": 17410
},
{
"entropy": 6.007525539398193,
"epoch": 1.537884139879901,
"grad_norm": 1.9921875,
"learning_rate": 0.0004766649167295401,
"loss": 5.7866,
"mean_token_accuracy": 0.17649368047714234,
"num_tokens": 32462906.0,
"step": 17415
},
{
"entropy": 6.032230949401855,
"epoch": 1.5383256799717415,
"grad_norm": 2.25,
"learning_rate": 0.0004766509491717144,
"loss": 5.7609,
"mean_token_accuracy": 0.1712416425347328,
"num_tokens": 32471840.0,
"step": 17420
},
{
"entropy": 6.050744342803955,
"epoch": 1.5387672200635818,
"grad_norm": 1.96875,
"learning_rate": 0.00047663697766366114,
"loss": 5.7342,
"mean_token_accuracy": 0.17555103749036788,
"num_tokens": 32481111.0,
"step": 17425
},
{
"entropy": 6.093402481079101,
"epoch": 1.539208760155422,
"grad_norm": 1.90625,
"learning_rate": 0.0004766230022056542,
"loss": 5.826,
"mean_token_accuracy": 0.16785212010145187,
"num_tokens": 32489827.0,
"step": 17430
},
{
"entropy": 6.106240606307983,
"epoch": 1.5396503002472626,
"grad_norm": 2.265625,
"learning_rate": 0.00047660902279796736,
"loss": 5.7442,
"mean_token_accuracy": 0.1741485118865967,
"num_tokens": 32499106.0,
"step": 17435
},
{
"entropy": 6.215137195587158,
"epoch": 1.5400918403391026,
"grad_norm": 2.46875,
"learning_rate": 0.0004765950394408744,
"loss": 6.0034,
"mean_token_accuracy": 0.14519519209861756,
"num_tokens": 32507858.0,
"step": 17440
},
{
"entropy": 6.079089403152466,
"epoch": 1.5405333804309431,
"grad_norm": 1.6953125,
"learning_rate": 0.0004765810521346493,
"loss": 5.7848,
"mean_token_accuracy": 0.16889618933200837,
"num_tokens": 32516761.0,
"step": 17445
},
{
"entropy": 6.040271854400634,
"epoch": 1.5409749205227836,
"grad_norm": 2.390625,
"learning_rate": 0.00047656706087956604,
"loss": 5.8035,
"mean_token_accuracy": 0.17361948490142823,
"num_tokens": 32526585.0,
"step": 17450
},
{
"entropy": 6.053572940826416,
"epoch": 1.5414164606146237,
"grad_norm": 2.328125,
"learning_rate": 0.00047655306567589864,
"loss": 5.8169,
"mean_token_accuracy": 0.16717963963747023,
"num_tokens": 32535607.0,
"step": 17455
},
{
"entropy": 6.0373656272888185,
"epoch": 1.5418580007064642,
"grad_norm": 2.953125,
"learning_rate": 0.00047653906652392135,
"loss": 5.7318,
"mean_token_accuracy": 0.17263903170824052,
"num_tokens": 32545401.0,
"step": 17460
},
{
"entropy": 6.111098670959473,
"epoch": 1.5422995407983044,
"grad_norm": 7.5,
"learning_rate": 0.0004765250634239083,
"loss": 5.8113,
"mean_token_accuracy": 0.16850534677505494,
"num_tokens": 32554421.0,
"step": 17465
},
{
"entropy": 6.069695472717285,
"epoch": 1.5427410808901447,
"grad_norm": 4.125,
"learning_rate": 0.00047651105637613395,
"loss": 5.8762,
"mean_token_accuracy": 0.16136234104633332,
"num_tokens": 32563652.0,
"step": 17470
},
{
"entropy": 6.068554306030274,
"epoch": 1.5431826209819852,
"grad_norm": 3.28125,
"learning_rate": 0.0004764970453808726,
"loss": 5.8758,
"mean_token_accuracy": 0.16802710592746734,
"num_tokens": 32572812.0,
"step": 17475
},
{
"entropy": 6.0348913192749025,
"epoch": 1.5436241610738255,
"grad_norm": 2.078125,
"learning_rate": 0.00047648303043839875,
"loss": 5.7877,
"mean_token_accuracy": 0.17527088820934295,
"num_tokens": 32581746.0,
"step": 17480
},
{
"entropy": 6.10411581993103,
"epoch": 1.5440657011656658,
"grad_norm": 2.1875,
"learning_rate": 0.0004764690115489869,
"loss": 5.817,
"mean_token_accuracy": 0.16557990312576293,
"num_tokens": 32591596.0,
"step": 17485
},
{
"entropy": 6.0134772777557375,
"epoch": 1.5445072412575063,
"grad_norm": 2.515625,
"learning_rate": 0.00047645498871291163,
"loss": 5.8272,
"mean_token_accuracy": 0.16358228474855424,
"num_tokens": 32600610.0,
"step": 17490
},
{
"entropy": 6.134658288955689,
"epoch": 1.5449487813493465,
"grad_norm": 2.078125,
"learning_rate": 0.0004764409619304478,
"loss": 5.8362,
"mean_token_accuracy": 0.16377431899309158,
"num_tokens": 32609827.0,
"step": 17495
},
{
"entropy": 6.110668325424195,
"epoch": 1.5453903214411868,
"grad_norm": 2.15625,
"learning_rate": 0.00047642693120187007,
"loss": 5.8378,
"mean_token_accuracy": 0.16570709347724916,
"num_tokens": 32618258.0,
"step": 17500
},
{
"entropy": 6.092135095596314,
"epoch": 1.5458318615330273,
"grad_norm": 1.9296875,
"learning_rate": 0.0004764128965274533,
"loss": 5.8374,
"mean_token_accuracy": 0.16591762900352477,
"num_tokens": 32628155.0,
"step": 17505
},
{
"entropy": 6.120477199554443,
"epoch": 1.5462734016248674,
"grad_norm": 1.7265625,
"learning_rate": 0.00047639885790747244,
"loss": 5.9115,
"mean_token_accuracy": 0.16354913115501404,
"num_tokens": 32638347.0,
"step": 17510
},
{
"entropy": 6.102036619186402,
"epoch": 1.5467149417167079,
"grad_norm": 1.9140625,
"learning_rate": 0.00047638481534220244,
"loss": 5.7771,
"mean_token_accuracy": 0.17105151265859603,
"num_tokens": 32648636.0,
"step": 17515
},
{
"entropy": 6.074493503570556,
"epoch": 1.5471564818085484,
"grad_norm": 1.9375,
"learning_rate": 0.0004763707688319185,
"loss": 5.8232,
"mean_token_accuracy": 0.16841974556446077,
"num_tokens": 32657762.0,
"step": 17520
},
{
"entropy": 6.070097494125366,
"epoch": 1.5475980219003884,
"grad_norm": 2.140625,
"learning_rate": 0.0004763567183768958,
"loss": 5.8371,
"mean_token_accuracy": 0.15725252404808998,
"num_tokens": 32668265.0,
"step": 17525
},
{
"entropy": 6.052039098739624,
"epoch": 1.548039561992229,
"grad_norm": 1.6953125,
"learning_rate": 0.00047634266397740934,
"loss": 5.7316,
"mean_token_accuracy": 0.17251663208007811,
"num_tokens": 32678051.0,
"step": 17530
},
{
"entropy": 6.166566658020019,
"epoch": 1.5484811020840692,
"grad_norm": 1.75,
"learning_rate": 0.00047632860563373466,
"loss": 5.9094,
"mean_token_accuracy": 0.17004334181547165,
"num_tokens": 32687186.0,
"step": 17535
},
{
"entropy": 6.113852882385254,
"epoch": 1.5489226421759095,
"grad_norm": 2.046875,
"learning_rate": 0.0004763145433461472,
"loss": 5.8157,
"mean_token_accuracy": 0.17104592621326448,
"num_tokens": 32697082.0,
"step": 17540
},
{
"entropy": 6.099697399139404,
"epoch": 1.54936418226775,
"grad_norm": 2.46875,
"learning_rate": 0.0004763004771149222,
"loss": 5.8157,
"mean_token_accuracy": 0.16378079652786254,
"num_tokens": 32706502.0,
"step": 17545
},
{
"entropy": 6.084665536880493,
"epoch": 1.5498057223595902,
"grad_norm": 1.7734375,
"learning_rate": 0.0004762864069403354,
"loss": 5.7858,
"mean_token_accuracy": 0.1692308306694031,
"num_tokens": 32715035.0,
"step": 17550
},
{
"entropy": 6.077127981185913,
"epoch": 1.5502472624514305,
"grad_norm": 2.25,
"learning_rate": 0.00047627233282266236,
"loss": 5.8064,
"mean_token_accuracy": 0.16486789882183076,
"num_tokens": 32724713.0,
"step": 17555
},
{
"entropy": 6.052487897872925,
"epoch": 1.550688802543271,
"grad_norm": 4.03125,
"learning_rate": 0.0004762582547621788,
"loss": 5.8213,
"mean_token_accuracy": 0.1708298683166504,
"num_tokens": 32734584.0,
"step": 17560
},
{
"entropy": 6.124513483047485,
"epoch": 1.5511303426351113,
"grad_norm": 2.046875,
"learning_rate": 0.00047624417275916045,
"loss": 5.7893,
"mean_token_accuracy": 0.17366618663072586,
"num_tokens": 32742744.0,
"step": 17565
},
{
"entropy": 6.0399768352508545,
"epoch": 1.5515718827269516,
"grad_norm": 1.828125,
"learning_rate": 0.00047623008681388324,
"loss": 5.7326,
"mean_token_accuracy": 0.18410656303167344,
"num_tokens": 32752051.0,
"step": 17570
},
{
"entropy": 6.1493871212005615,
"epoch": 1.552013422818792,
"grad_norm": 2.421875,
"learning_rate": 0.00047621599692662306,
"loss": 5.8071,
"mean_token_accuracy": 0.16908432990312577,
"num_tokens": 32761740.0,
"step": 17575
},
{
"entropy": 6.081074810028076,
"epoch": 1.5524549629106321,
"grad_norm": 1.7109375,
"learning_rate": 0.00047620190309765595,
"loss": 5.7416,
"mean_token_accuracy": 0.17670951187610626,
"num_tokens": 32770809.0,
"step": 17580
},
{
"entropy": 6.078304624557495,
"epoch": 1.5528965030024726,
"grad_norm": 1.75,
"learning_rate": 0.00047618780532725805,
"loss": 5.8457,
"mean_token_accuracy": 0.16505754888057708,
"num_tokens": 32780614.0,
"step": 17585
},
{
"entropy": 6.1434167385101315,
"epoch": 1.5533380430943131,
"grad_norm": 3.125,
"learning_rate": 0.00047617370361570534,
"loss": 5.8208,
"mean_token_accuracy": 0.1668805107474327,
"num_tokens": 32790336.0,
"step": 17590
},
{
"entropy": 6.0696087837219235,
"epoch": 1.5537795831861532,
"grad_norm": 2.3125,
"learning_rate": 0.0004761595979632743,
"loss": 5.7843,
"mean_token_accuracy": 0.17471766322851182,
"num_tokens": 32798991.0,
"step": 17595
},
{
"entropy": 6.108233022689819,
"epoch": 1.5542211232779937,
"grad_norm": 2.1875,
"learning_rate": 0.0004761454883702411,
"loss": 5.8316,
"mean_token_accuracy": 0.16921150237321853,
"num_tokens": 32807616.0,
"step": 17600
},
{
"entropy": 6.108051013946533,
"epoch": 1.554662663369834,
"grad_norm": 1.7578125,
"learning_rate": 0.0004761313748368821,
"loss": 5.8741,
"mean_token_accuracy": 0.16353895217180253,
"num_tokens": 32817107.0,
"step": 17605
},
{
"entropy": 6.077909374237061,
"epoch": 1.5551042034616742,
"grad_norm": 2.046875,
"learning_rate": 0.0004761172573634739,
"loss": 5.8247,
"mean_token_accuracy": 0.17275598496198655,
"num_tokens": 32827205.0,
"step": 17610
},
{
"entropy": 6.0821943283081055,
"epoch": 1.5555457435535147,
"grad_norm": 3.40625,
"learning_rate": 0.0004761031359502931,
"loss": 5.7255,
"mean_token_accuracy": 0.17424242943525314,
"num_tokens": 32836102.0,
"step": 17615
},
{
"entropy": 6.104980945587158,
"epoch": 1.555987283645355,
"grad_norm": 2.5625,
"learning_rate": 0.00047608901059761617,
"loss": 5.8748,
"mean_token_accuracy": 0.1621811181306839,
"num_tokens": 32845389.0,
"step": 17620
},
{
"entropy": 6.091833925247192,
"epoch": 1.5564288237371953,
"grad_norm": 2.421875,
"learning_rate": 0.00047607488130571997,
"loss": 5.7277,
"mean_token_accuracy": 0.17598800212144852,
"num_tokens": 32854186.0,
"step": 17625
},
{
"entropy": 6.038175058364868,
"epoch": 1.5568703638290358,
"grad_norm": 1.9609375,
"learning_rate": 0.0004760607480748811,
"loss": 5.7565,
"mean_token_accuracy": 0.16789646595716476,
"num_tokens": 32863498.0,
"step": 17630
},
{
"entropy": 6.07609543800354,
"epoch": 1.557311903920876,
"grad_norm": 1.921875,
"learning_rate": 0.00047604661090537657,
"loss": 5.8553,
"mean_token_accuracy": 0.15840479731559753,
"num_tokens": 32872483.0,
"step": 17635
},
{
"entropy": 6.190669298171997,
"epoch": 1.5577534440127163,
"grad_norm": 2.90625,
"learning_rate": 0.0004760324697974832,
"loss": 5.864,
"mean_token_accuracy": 0.16894371807575226,
"num_tokens": 32882739.0,
"step": 17640
},
{
"entropy": 6.182284879684448,
"epoch": 1.5581949841045568,
"grad_norm": 1.9375,
"learning_rate": 0.0004760183247514782,
"loss": 5.9401,
"mean_token_accuracy": 0.1611575484275818,
"num_tokens": 32892707.0,
"step": 17645
},
{
"entropy": 6.0706078052520756,
"epoch": 1.5586365241963969,
"grad_norm": 2.71875,
"learning_rate": 0.00047600417576763843,
"loss": 5.8507,
"mean_token_accuracy": 0.16488543301820754,
"num_tokens": 32901916.0,
"step": 17650
},
{
"entropy": 6.070568513870239,
"epoch": 1.5590780642882374,
"grad_norm": 1.8984375,
"learning_rate": 0.0004759900228462412,
"loss": 5.7927,
"mean_token_accuracy": 0.1653462290763855,
"num_tokens": 32910656.0,
"step": 17655
},
{
"entropy": 6.210458612442016,
"epoch": 1.5595196043800779,
"grad_norm": 16.75,
"learning_rate": 0.0004759758659875638,
"loss": 5.8952,
"mean_token_accuracy": 0.1709023892879486,
"num_tokens": 32919579.0,
"step": 17660
},
{
"entropy": 6.143015813827515,
"epoch": 1.559961144471918,
"grad_norm": 3.21875,
"learning_rate": 0.00047596170519188335,
"loss": 5.8515,
"mean_token_accuracy": 0.16467346698045732,
"num_tokens": 32928271.0,
"step": 17665
},
{
"entropy": 6.10622239112854,
"epoch": 1.5604026845637584,
"grad_norm": 2.40625,
"learning_rate": 0.0004759475404594776,
"loss": 5.7526,
"mean_token_accuracy": 0.17629916816949845,
"num_tokens": 32937671.0,
"step": 17670
},
{
"entropy": 6.0995903491973875,
"epoch": 1.5608442246555987,
"grad_norm": 3.640625,
"learning_rate": 0.0004759333717906236,
"loss": 5.9125,
"mean_token_accuracy": 0.1637970134615898,
"num_tokens": 32946896.0,
"step": 17675
},
{
"entropy": 6.107227420806884,
"epoch": 1.561285764747439,
"grad_norm": 1.8984375,
"learning_rate": 0.00047591919918559927,
"loss": 5.8871,
"mean_token_accuracy": 0.16126256585121154,
"num_tokens": 32956706.0,
"step": 17680
},
{
"entropy": 6.095067501068115,
"epoch": 1.5617273048392795,
"grad_norm": 2.40625,
"learning_rate": 0.0004759050226446821,
"loss": 5.7252,
"mean_token_accuracy": 0.17808463126420976,
"num_tokens": 32965990.0,
"step": 17685
},
{
"entropy": 6.070595836639404,
"epoch": 1.5621688449311197,
"grad_norm": 2.234375,
"learning_rate": 0.0004758908421681497,
"loss": 5.7293,
"mean_token_accuracy": 0.170539753139019,
"num_tokens": 32975311.0,
"step": 17690
},
{
"entropy": 6.095292282104492,
"epoch": 1.56261038502296,
"grad_norm": 2.203125,
"learning_rate": 0.00047587665775627997,
"loss": 5.8374,
"mean_token_accuracy": 0.16871586441993713,
"num_tokens": 32984641.0,
"step": 17695
},
{
"entropy": 6.110837984085083,
"epoch": 1.5630519251148005,
"grad_norm": 2.34375,
"learning_rate": 0.00047586246940935087,
"loss": 5.8629,
"mean_token_accuracy": 0.16627537310123444,
"num_tokens": 32994696.0,
"step": 17700
},
{
"entropy": 6.108120727539062,
"epoch": 1.5634934652066408,
"grad_norm": 2.125,
"learning_rate": 0.00047584827712764013,
"loss": 5.764,
"mean_token_accuracy": 0.17313507944345474,
"num_tokens": 33003392.0,
"step": 17705
},
{
"entropy": 6.0257526397705075,
"epoch": 1.563935005298481,
"grad_norm": 1.8671875,
"learning_rate": 0.0004758340809114259,
"loss": 5.8148,
"mean_token_accuracy": 0.16595792919397354,
"num_tokens": 33012896.0,
"step": 17710
},
{
"entropy": 6.110731410980224,
"epoch": 1.5643765453903216,
"grad_norm": 3.5,
"learning_rate": 0.0004758198807609862,
"loss": 5.86,
"mean_token_accuracy": 0.1676177427172661,
"num_tokens": 33022710.0,
"step": 17715
},
{
"entropy": 6.23256402015686,
"epoch": 1.5648180854821618,
"grad_norm": 2.390625,
"learning_rate": 0.0004758056766765993,
"loss": 5.8223,
"mean_token_accuracy": 0.16760372519493102,
"num_tokens": 33031982.0,
"step": 17720
},
{
"entropy": 6.136034107208252,
"epoch": 1.5652596255740021,
"grad_norm": 2.0,
"learning_rate": 0.00047579146865854333,
"loss": 5.8971,
"mean_token_accuracy": 0.16731034070253373,
"num_tokens": 33041496.0,
"step": 17725
},
{
"entropy": 6.06429967880249,
"epoch": 1.5657011656658426,
"grad_norm": 1.9765625,
"learning_rate": 0.00047577725670709675,
"loss": 5.7959,
"mean_token_accuracy": 0.16964198648929596,
"num_tokens": 33050764.0,
"step": 17730
},
{
"entropy": 6.109513902664185,
"epoch": 1.5661427057576827,
"grad_norm": 2.8125,
"learning_rate": 0.000475763040822538,
"loss": 5.8631,
"mean_token_accuracy": 0.16728705614805223,
"num_tokens": 33060809.0,
"step": 17735
},
{
"entropy": 6.066821813583374,
"epoch": 1.5665842458495232,
"grad_norm": 2.875,
"learning_rate": 0.0004757488210051453,
"loss": 5.7179,
"mean_token_accuracy": 0.17510061860084533,
"num_tokens": 33070155.0,
"step": 17740
},
{
"entropy": 6.094822263717651,
"epoch": 1.5670257859413634,
"grad_norm": 2.578125,
"learning_rate": 0.0004757345972551974,
"loss": 5.8158,
"mean_token_accuracy": 0.17473983019590378,
"num_tokens": 33079354.0,
"step": 17745
},
{
"entropy": 6.108089590072632,
"epoch": 1.5674673260332037,
"grad_norm": 2.234375,
"learning_rate": 0.0004757203695729729,
"loss": 5.7773,
"mean_token_accuracy": 0.17052431553602218,
"num_tokens": 33087877.0,
"step": 17750
},
{
"entropy": 6.127751207351684,
"epoch": 1.5679088661250442,
"grad_norm": 2.609375,
"learning_rate": 0.00047570613795875055,
"loss": 5.8717,
"mean_token_accuracy": 0.16291871219873427,
"num_tokens": 33097375.0,
"step": 17755
},
{
"entropy": 6.112053680419922,
"epoch": 1.5683504062168845,
"grad_norm": 1.953125,
"learning_rate": 0.0004756919024128091,
"loss": 5.8232,
"mean_token_accuracy": 0.16242819428443908,
"num_tokens": 33106336.0,
"step": 17760
},
{
"entropy": 5.991883182525635,
"epoch": 1.5687919463087248,
"grad_norm": 1.90625,
"learning_rate": 0.0004756776629354274,
"loss": 5.668,
"mean_token_accuracy": 0.17858933955430983,
"num_tokens": 33115753.0,
"step": 17765
},
{
"entropy": 6.102563428878784,
"epoch": 1.5692334864005653,
"grad_norm": 2.0625,
"learning_rate": 0.0004756634195268844,
"loss": 5.8417,
"mean_token_accuracy": 0.16595702171325682,
"num_tokens": 33125205.0,
"step": 17770
},
{
"entropy": 6.072338056564331,
"epoch": 1.5696750264924055,
"grad_norm": 1.828125,
"learning_rate": 0.0004756491721874592,
"loss": 5.7767,
"mean_token_accuracy": 0.17264486402273177,
"num_tokens": 33134470.0,
"step": 17775
},
{
"entropy": 6.037093687057495,
"epoch": 1.5701165665842458,
"grad_norm": 2.15625,
"learning_rate": 0.00047563492091743075,
"loss": 5.7258,
"mean_token_accuracy": 0.17865387350320816,
"num_tokens": 33143346.0,
"step": 17780
},
{
"entropy": 6.013606214523316,
"epoch": 1.5705581066760863,
"grad_norm": 1.6796875,
"learning_rate": 0.00047562066571707836,
"loss": 5.7499,
"mean_token_accuracy": 0.171930493414402,
"num_tokens": 33153291.0,
"step": 17785
},
{
"entropy": 6.186882448196411,
"epoch": 1.5709996467679266,
"grad_norm": 1.5078125,
"learning_rate": 0.00047560640658668126,
"loss": 5.9423,
"mean_token_accuracy": 0.16253482848405837,
"num_tokens": 33163642.0,
"step": 17790
},
{
"entropy": 6.201173782348633,
"epoch": 1.5714411868597669,
"grad_norm": 2.296875,
"learning_rate": 0.00047559214352651863,
"loss": 5.7733,
"mean_token_accuracy": 0.16982896029949188,
"num_tokens": 33173529.0,
"step": 17795
},
{
"entropy": 6.107950639724732,
"epoch": 1.5718827269516074,
"grad_norm": 2.3125,
"learning_rate": 0.00047557787653687014,
"loss": 5.7531,
"mean_token_accuracy": 0.17106093764305114,
"num_tokens": 33180877.0,
"step": 17800
},
{
"entropy": 6.043713569641113,
"epoch": 1.5723242670434474,
"grad_norm": 2.15625,
"learning_rate": 0.000475563605618015,
"loss": 5.8387,
"mean_token_accuracy": 0.1661772534251213,
"num_tokens": 33190831.0,
"step": 17805
},
{
"entropy": 6.145603132247925,
"epoch": 1.572765807135288,
"grad_norm": 2.0625,
"learning_rate": 0.000475549330770233,
"loss": 5.8659,
"mean_token_accuracy": 0.16210852563381195,
"num_tokens": 33200313.0,
"step": 17810
},
{
"entropy": 6.090163660049439,
"epoch": 1.5732073472271282,
"grad_norm": 2.453125,
"learning_rate": 0.0004755350519938036,
"loss": 5.8041,
"mean_token_accuracy": 0.16931876242160798,
"num_tokens": 33209272.0,
"step": 17815
},
{
"entropy": 6.074001932144165,
"epoch": 1.5736488873189685,
"grad_norm": 2.109375,
"learning_rate": 0.00047552076928900663,
"loss": 5.7943,
"mean_token_accuracy": 0.17832704484462739,
"num_tokens": 33218712.0,
"step": 17820
},
{
"entropy": 6.12870979309082,
"epoch": 1.574090427410809,
"grad_norm": 2.4375,
"learning_rate": 0.0004755064826561217,
"loss": 5.8784,
"mean_token_accuracy": 0.16562885344028472,
"num_tokens": 33227480.0,
"step": 17825
},
{
"entropy": 6.123364114761353,
"epoch": 1.5745319675026492,
"grad_norm": 2.5,
"learning_rate": 0.0004754921920954289,
"loss": 5.7801,
"mean_token_accuracy": 0.16678877174854279,
"num_tokens": 33236044.0,
"step": 17830
},
{
"entropy": 6.052751970291138,
"epoch": 1.5749735075944895,
"grad_norm": 2.15625,
"learning_rate": 0.0004754778976072081,
"loss": 5.828,
"mean_token_accuracy": 0.170947889983654,
"num_tokens": 33244770.0,
"step": 17835
},
{
"entropy": 6.014677572250366,
"epoch": 1.57541504768633,
"grad_norm": 2.0,
"learning_rate": 0.00047546359919173933,
"loss": 5.7584,
"mean_token_accuracy": 0.16743222028017044,
"num_tokens": 33254178.0,
"step": 17840
},
{
"entropy": 6.0351954936981205,
"epoch": 1.5758565877781703,
"grad_norm": 2.28125,
"learning_rate": 0.0004754492968493026,
"loss": 5.8188,
"mean_token_accuracy": 0.17239767462015151,
"num_tokens": 33264210.0,
"step": 17845
},
{
"entropy": 6.052313899993896,
"epoch": 1.5762981278700106,
"grad_norm": 2.09375,
"learning_rate": 0.0004754349905801782,
"loss": 5.7231,
"mean_token_accuracy": 0.1762167975306511,
"num_tokens": 33273348.0,
"step": 17850
},
{
"entropy": 6.06155309677124,
"epoch": 1.576739667961851,
"grad_norm": 2.28125,
"learning_rate": 0.00047542068038464625,
"loss": 5.7624,
"mean_token_accuracy": 0.1765015944838524,
"num_tokens": 33281906.0,
"step": 17855
},
{
"entropy": 6.074195146560669,
"epoch": 1.5771812080536913,
"grad_norm": 4.09375,
"learning_rate": 0.0004754063662629872,
"loss": 5.8985,
"mean_token_accuracy": 0.16188195794820787,
"num_tokens": 33291363.0,
"step": 17860
},
{
"entropy": 6.069593286514282,
"epoch": 1.5776227481455316,
"grad_norm": 1.7890625,
"learning_rate": 0.00047539204821548146,
"loss": 5.7927,
"mean_token_accuracy": 0.17723534554243087,
"num_tokens": 33299785.0,
"step": 17865
},
{
"entropy": 6.258641147613526,
"epoch": 1.578064288237372,
"grad_norm": 2.390625,
"learning_rate": 0.0004753777262424094,
"loss": 5.9133,
"mean_token_accuracy": 0.1651631623506546,
"num_tokens": 33309655.0,
"step": 17870
},
{
"entropy": 6.1760478019714355,
"epoch": 1.5785058283292122,
"grad_norm": 1.9296875,
"learning_rate": 0.00047536340034405166,
"loss": 5.8582,
"mean_token_accuracy": 0.1677873358130455,
"num_tokens": 33320158.0,
"step": 17875
},
{
"entropy": 6.039480781555175,
"epoch": 1.5789473684210527,
"grad_norm": 2.140625,
"learning_rate": 0.00047534907052068886,
"loss": 5.7627,
"mean_token_accuracy": 0.17785986363887787,
"num_tokens": 33328959.0,
"step": 17880
},
{
"entropy": 6.141569375991821,
"epoch": 1.579388908512893,
"grad_norm": 2.125,
"learning_rate": 0.0004753347367726017,
"loss": 5.8765,
"mean_token_accuracy": 0.16622551381587983,
"num_tokens": 33338624.0,
"step": 17885
},
{
"entropy": 6.198767614364624,
"epoch": 1.5798304486047332,
"grad_norm": 2.015625,
"learning_rate": 0.00047532039910007097,
"loss": 5.8317,
"mean_token_accuracy": 0.17077762484550477,
"num_tokens": 33348083.0,
"step": 17890
},
{
"entropy": 6.151215267181397,
"epoch": 1.5802719886965737,
"grad_norm": 2.34375,
"learning_rate": 0.00047530605750337765,
"loss": 5.7446,
"mean_token_accuracy": 0.1669705480337143,
"num_tokens": 33358226.0,
"step": 17895
},
{
"entropy": 6.117163228988647,
"epoch": 1.580713528788414,
"grad_norm": 2.15625,
"learning_rate": 0.00047529171198280244,
"loss": 5.9115,
"mean_token_accuracy": 0.16424695104360582,
"num_tokens": 33367997.0,
"step": 17900
},
{
"entropy": 6.117901277542114,
"epoch": 1.5811550688802543,
"grad_norm": 1.6484375,
"learning_rate": 0.00047527736253862664,
"loss": 5.8415,
"mean_token_accuracy": 0.16211212128400804,
"num_tokens": 33377574.0,
"step": 17905
},
{
"entropy": 6.111302614212036,
"epoch": 1.5815966089720948,
"grad_norm": 2.34375,
"learning_rate": 0.00047526300917113116,
"loss": 5.8768,
"mean_token_accuracy": 0.16849373579025267,
"num_tokens": 33387016.0,
"step": 17910
},
{
"entropy": 6.1492345333099365,
"epoch": 1.582038149063935,
"grad_norm": 3.59375,
"learning_rate": 0.0004752486518805972,
"loss": 5.8308,
"mean_token_accuracy": 0.16317096650600432,
"num_tokens": 33396239.0,
"step": 17915
},
{
"entropy": 6.08332462310791,
"epoch": 1.5824796891557753,
"grad_norm": 1.9921875,
"learning_rate": 0.00047523429066730603,
"loss": 5.7065,
"mean_token_accuracy": 0.1758200615644455,
"num_tokens": 33404738.0,
"step": 17920
},
{
"entropy": 6.02731409072876,
"epoch": 1.5829212292476158,
"grad_norm": 3.640625,
"learning_rate": 0.00047521992553153903,
"loss": 5.7115,
"mean_token_accuracy": 0.17591886818408967,
"num_tokens": 33413670.0,
"step": 17925
},
{
"entropy": 6.060974550247193,
"epoch": 1.583362769339456,
"grad_norm": 2.234375,
"learning_rate": 0.0004752055564735775,
"loss": 5.8138,
"mean_token_accuracy": 0.1606651946902275,
"num_tokens": 33422841.0,
"step": 17930
},
{
"entropy": 6.204880619049073,
"epoch": 1.5838043094312964,
"grad_norm": 2.140625,
"learning_rate": 0.00047519118349370306,
"loss": 5.8719,
"mean_token_accuracy": 0.16578718274831772,
"num_tokens": 33432023.0,
"step": 17935
},
{
"entropy": 6.1531147956848145,
"epoch": 1.5842458495231369,
"grad_norm": 2.671875,
"learning_rate": 0.0004751768065921971,
"loss": 5.8567,
"mean_token_accuracy": 0.15968200862407683,
"num_tokens": 33442181.0,
"step": 17940
},
{
"entropy": 6.133826065063476,
"epoch": 1.584687389614977,
"grad_norm": 3.4375,
"learning_rate": 0.00047516242576934144,
"loss": 5.8911,
"mean_token_accuracy": 0.15913937985897064,
"num_tokens": 33451847.0,
"step": 17945
},
{
"entropy": 6.206598949432373,
"epoch": 1.5851289297068174,
"grad_norm": 1.984375,
"learning_rate": 0.00047514804102541765,
"loss": 5.8648,
"mean_token_accuracy": 0.17383442670106888,
"num_tokens": 33461587.0,
"step": 17950
},
{
"entropy": 6.191175651550293,
"epoch": 1.5855704697986577,
"grad_norm": 2.03125,
"learning_rate": 0.00047513365236070753,
"loss": 5.8857,
"mean_token_accuracy": 0.1637287750840187,
"num_tokens": 33471553.0,
"step": 17955
},
{
"entropy": 6.005967044830323,
"epoch": 1.586012009890498,
"grad_norm": 4.40625,
"learning_rate": 0.00047511925977549303,
"loss": 5.7235,
"mean_token_accuracy": 0.1781052902340889,
"num_tokens": 33480984.0,
"step": 17960
},
{
"entropy": 6.066962718963623,
"epoch": 1.5864535499823385,
"grad_norm": 3.65625,
"learning_rate": 0.00047510486327005604,
"loss": 5.8588,
"mean_token_accuracy": 0.16800884306430816,
"num_tokens": 33491196.0,
"step": 17965
},
{
"entropy": 6.014367723464966,
"epoch": 1.5868950900741787,
"grad_norm": 1.796875,
"learning_rate": 0.00047509046284467855,
"loss": 5.7282,
"mean_token_accuracy": 0.17316108644008638,
"num_tokens": 33500404.0,
"step": 17970
},
{
"entropy": 6.210793447494507,
"epoch": 1.587336630166019,
"grad_norm": 2.3125,
"learning_rate": 0.00047507605849964274,
"loss": 5.9022,
"mean_token_accuracy": 0.1638495981693268,
"num_tokens": 33509281.0,
"step": 17975
},
{
"entropy": 6.207684707641602,
"epoch": 1.5877781702578595,
"grad_norm": 2.265625,
"learning_rate": 0.0004750616502352307,
"loss": 5.7917,
"mean_token_accuracy": 0.16069933921098709,
"num_tokens": 33518556.0,
"step": 17980
},
{
"entropy": 6.107335090637207,
"epoch": 1.5882197103496998,
"grad_norm": 2.9375,
"learning_rate": 0.00047504723805172474,
"loss": 5.9655,
"mean_token_accuracy": 0.15752041041851045,
"num_tokens": 33529266.0,
"step": 17985
},
{
"entropy": 6.020033502578736,
"epoch": 1.58866125044154,
"grad_norm": 2.1875,
"learning_rate": 0.00047503282194940715,
"loss": 5.8563,
"mean_token_accuracy": 0.1705830827355385,
"num_tokens": 33538972.0,
"step": 17990
},
{
"entropy": 6.1327825546264645,
"epoch": 1.5891027905333805,
"grad_norm": 2.53125,
"learning_rate": 0.0004750184019285603,
"loss": 5.7739,
"mean_token_accuracy": 0.16534010469913482,
"num_tokens": 33549528.0,
"step": 17995
},
{
"entropy": 6.150406980514527,
"epoch": 1.5895443306252208,
"grad_norm": 2.109375,
"learning_rate": 0.0004750039779894668,
"loss": 5.7144,
"mean_token_accuracy": 0.1730978459119797,
"num_tokens": 33557828.0,
"step": 18000
},
{
"epoch": 1.5895443306252208,
"eval_entropy": 5.86172532970476,
"eval_loss": 5.866982936859131,
"eval_mean_token_accuracy": 0.17479445476249486,
"eval_num_tokens": 33557828.0,
"eval_runtime": 26.2628,
"eval_samples_per_second": 1344.68,
"eval_steps_per_second": 168.109,
"step": 18000
},
{
"entropy": 6.0690460205078125,
"epoch": 1.589985870717061,
"grad_norm": 1.7890625,
"learning_rate": 0.00047498955013240907,
"loss": 5.8533,
"mean_token_accuracy": 0.16313113421201705,
"num_tokens": 33567087.0,
"step": 18005
},
{
"entropy": 6.08881402015686,
"epoch": 1.5904274108089016,
"grad_norm": 2.25,
"learning_rate": 0.00047497511835766984,
"loss": 5.8431,
"mean_token_accuracy": 0.1643111765384674,
"num_tokens": 33577442.0,
"step": 18010
},
{
"entropy": 6.167431354522705,
"epoch": 1.5908689509007417,
"grad_norm": 2.03125,
"learning_rate": 0.00047496068266553165,
"loss": 5.8395,
"mean_token_accuracy": 0.1643859401345253,
"num_tokens": 33585655.0,
"step": 18015
},
{
"entropy": 6.1432318687438965,
"epoch": 1.5913104909925821,
"grad_norm": 1.9296875,
"learning_rate": 0.00047494624305627754,
"loss": 5.8456,
"mean_token_accuracy": 0.16957613527774812,
"num_tokens": 33594808.0,
"step": 18020
},
{
"entropy": 6.1572418212890625,
"epoch": 1.5917520310844224,
"grad_norm": 2.03125,
"learning_rate": 0.0004749317995301902,
"loss": 5.8729,
"mean_token_accuracy": 0.16997406929731368,
"num_tokens": 33603924.0,
"step": 18025
},
{
"entropy": 6.055553770065307,
"epoch": 1.5921935711762627,
"grad_norm": 2.546875,
"learning_rate": 0.0004749173520875525,
"loss": 5.7628,
"mean_token_accuracy": 0.17220810651779175,
"num_tokens": 33613870.0,
"step": 18030
},
{
"entropy": 6.064531660079956,
"epoch": 1.5926351112681032,
"grad_norm": 2.375,
"learning_rate": 0.00047490290072864773,
"loss": 5.8153,
"mean_token_accuracy": 0.17207167744636537,
"num_tokens": 33622938.0,
"step": 18035
},
{
"entropy": 6.083874702453613,
"epoch": 1.5930766513599435,
"grad_norm": 2.40625,
"learning_rate": 0.00047488844545375886,
"loss": 5.8726,
"mean_token_accuracy": 0.16887077689170837,
"num_tokens": 33631520.0,
"step": 18040
},
{
"entropy": 6.192483568191529,
"epoch": 1.5935181914517837,
"grad_norm": 2.78125,
"learning_rate": 0.0004748739862631689,
"loss": 5.8737,
"mean_token_accuracy": 0.16298535764217376,
"num_tokens": 33641365.0,
"step": 18045
},
{
"entropy": 6.11848087310791,
"epoch": 1.5939597315436242,
"grad_norm": 2.734375,
"learning_rate": 0.00047485952315716126,
"loss": 5.6665,
"mean_token_accuracy": 0.18416400998830795,
"num_tokens": 33650425.0,
"step": 18050
},
{
"entropy": 6.1609132289886475,
"epoch": 1.5944012716354645,
"grad_norm": 2.546875,
"learning_rate": 0.00047484505613601917,
"loss": 5.8674,
"mean_token_accuracy": 0.16376861780881882,
"num_tokens": 33659928.0,
"step": 18055
},
{
"entropy": 6.080754280090332,
"epoch": 1.5948428117273048,
"grad_norm": 2.03125,
"learning_rate": 0.0004748305852000262,
"loss": 5.8406,
"mean_token_accuracy": 0.1745786890387535,
"num_tokens": 33668860.0,
"step": 18060
},
{
"entropy": 6.171019649505615,
"epoch": 1.5952843518191453,
"grad_norm": 1.8515625,
"learning_rate": 0.00047481611034946565,
"loss": 5.8347,
"mean_token_accuracy": 0.1645433321595192,
"num_tokens": 33679343.0,
"step": 18065
},
{
"entropy": 6.07139630317688,
"epoch": 1.5957258919109856,
"grad_norm": 1.8828125,
"learning_rate": 0.0004748016315846212,
"loss": 5.7616,
"mean_token_accuracy": 0.17583847939968109,
"num_tokens": 33688749.0,
"step": 18070
},
{
"entropy": 6.104921674728393,
"epoch": 1.5961674320028258,
"grad_norm": 1.796875,
"learning_rate": 0.00047478714890577633,
"loss": 5.8537,
"mean_token_accuracy": 0.16419648379087448,
"num_tokens": 33698359.0,
"step": 18075
},
{
"entropy": 6.133081293106079,
"epoch": 1.5966089720946663,
"grad_norm": 1.890625,
"learning_rate": 0.00047477266231321484,
"loss": 5.8306,
"mean_token_accuracy": 0.15890851318836213,
"num_tokens": 33707402.0,
"step": 18080
},
{
"entropy": 6.102872514724732,
"epoch": 1.5970505121865064,
"grad_norm": 1.609375,
"learning_rate": 0.00047475817180722056,
"loss": 5.773,
"mean_token_accuracy": 0.17151592224836348,
"num_tokens": 33717043.0,
"step": 18085
},
{
"entropy": 6.069227266311645,
"epoch": 1.597492052278347,
"grad_norm": 2.359375,
"learning_rate": 0.00047474367738807734,
"loss": 5.7552,
"mean_token_accuracy": 0.17951278239488602,
"num_tokens": 33726527.0,
"step": 18090
},
{
"entropy": 6.037159442901611,
"epoch": 1.5979335923701872,
"grad_norm": 1.96875,
"learning_rate": 0.00047472917905606903,
"loss": 5.7557,
"mean_token_accuracy": 0.17225386649370195,
"num_tokens": 33735357.0,
"step": 18095
},
{
"entropy": 5.979220628738403,
"epoch": 1.5983751324620274,
"grad_norm": 3.078125,
"learning_rate": 0.00047471467681147974,
"loss": 5.651,
"mean_token_accuracy": 0.18684182465076446,
"num_tokens": 33743660.0,
"step": 18100
},
{
"entropy": 6.113025379180908,
"epoch": 1.598816672553868,
"grad_norm": 1.6171875,
"learning_rate": 0.0004747001706545935,
"loss": 5.837,
"mean_token_accuracy": 0.16643664240837097,
"num_tokens": 33752899.0,
"step": 18105
},
{
"entropy": 6.111601829528809,
"epoch": 1.5992582126457082,
"grad_norm": 2.796875,
"learning_rate": 0.0004746856605856944,
"loss": 5.8086,
"mean_token_accuracy": 0.16916913092136382,
"num_tokens": 33761333.0,
"step": 18110
},
{
"entropy": 6.0450852394104,
"epoch": 1.5996997527375485,
"grad_norm": 1.859375,
"learning_rate": 0.00047467114660506687,
"loss": 5.8753,
"mean_token_accuracy": 0.1640693098306656,
"num_tokens": 33770507.0,
"step": 18115
},
{
"entropy": 6.035428237915039,
"epoch": 1.600141292829389,
"grad_norm": 2.265625,
"learning_rate": 0.0004746566287129951,
"loss": 5.7797,
"mean_token_accuracy": 0.17005180269479753,
"num_tokens": 33781658.0,
"step": 18120
},
{
"entropy": 6.127055311203003,
"epoch": 1.6005828329212293,
"grad_norm": 2.03125,
"learning_rate": 0.0004746421069097636,
"loss": 5.8657,
"mean_token_accuracy": 0.16283408999443055,
"num_tokens": 33792229.0,
"step": 18125
},
{
"entropy": 6.1899275302886965,
"epoch": 1.6010243730130695,
"grad_norm": 2.640625,
"learning_rate": 0.00047462758119565663,
"loss": 5.8551,
"mean_token_accuracy": 0.16682452261447905,
"num_tokens": 33801674.0,
"step": 18130
},
{
"entropy": 6.07554349899292,
"epoch": 1.60146591310491,
"grad_norm": 2.4375,
"learning_rate": 0.000474613051570959,
"loss": 5.7603,
"mean_token_accuracy": 0.18031615912914276,
"num_tokens": 33812066.0,
"step": 18135
},
{
"entropy": 6.131469011306763,
"epoch": 1.6019074531967503,
"grad_norm": 2.3125,
"learning_rate": 0.00047459851803595524,
"loss": 5.9019,
"mean_token_accuracy": 0.16240259855985642,
"num_tokens": 33822206.0,
"step": 18140
},
{
"entropy": 6.163219213485718,
"epoch": 1.6023489932885906,
"grad_norm": 2.765625,
"learning_rate": 0.00047458398059092995,
"loss": 5.904,
"mean_token_accuracy": 0.15977829396724702,
"num_tokens": 33832075.0,
"step": 18145
},
{
"entropy": 6.110730838775635,
"epoch": 1.602790533380431,
"grad_norm": 2.078125,
"learning_rate": 0.00047456943923616793,
"loss": 5.7257,
"mean_token_accuracy": 0.17277941554784776,
"num_tokens": 33841523.0,
"step": 18150
},
{
"entropy": 6.084936666488647,
"epoch": 1.6032320734722711,
"grad_norm": 1.9921875,
"learning_rate": 0.00047455489397195416,
"loss": 5.7751,
"mean_token_accuracy": 0.17209230363368988,
"num_tokens": 33850756.0,
"step": 18155
},
{
"entropy": 6.117101669311523,
"epoch": 1.6036736135641116,
"grad_norm": 2.65625,
"learning_rate": 0.00047454034479857356,
"loss": 5.8329,
"mean_token_accuracy": 0.16671661138534546,
"num_tokens": 33859611.0,
"step": 18160
},
{
"entropy": 6.076199626922607,
"epoch": 1.604115153655952,
"grad_norm": 2.125,
"learning_rate": 0.000474525791716311,
"loss": 5.8299,
"mean_token_accuracy": 0.16454399526119232,
"num_tokens": 33867993.0,
"step": 18165
},
{
"entropy": 6.15936975479126,
"epoch": 1.6045566937477922,
"grad_norm": 1.7734375,
"learning_rate": 0.00047451123472545175,
"loss": 5.8875,
"mean_token_accuracy": 0.16923944354057313,
"num_tokens": 33876785.0,
"step": 18170
},
{
"entropy": 6.184176254272461,
"epoch": 1.6049982338396327,
"grad_norm": 2.578125,
"learning_rate": 0.00047449667382628083,
"loss": 5.7462,
"mean_token_accuracy": 0.17404940277338027,
"num_tokens": 33885729.0,
"step": 18175
},
{
"entropy": 6.105750513076782,
"epoch": 1.605439773931473,
"grad_norm": 2.28125,
"learning_rate": 0.0004744821090190835,
"loss": 5.7903,
"mean_token_accuracy": 0.1733493149280548,
"num_tokens": 33894622.0,
"step": 18180
},
{
"entropy": 6.025648021697998,
"epoch": 1.6058813140233132,
"grad_norm": 2.953125,
"learning_rate": 0.00047446754030414513,
"loss": 5.8909,
"mean_token_accuracy": 0.1676089197397232,
"num_tokens": 33904187.0,
"step": 18185
},
{
"entropy": 6.16103048324585,
"epoch": 1.6063228541151537,
"grad_norm": 3.75,
"learning_rate": 0.0004744529676817511,
"loss": 5.86,
"mean_token_accuracy": 0.17588014006614686,
"num_tokens": 33914327.0,
"step": 18190
},
{
"entropy": 6.224307107925415,
"epoch": 1.606764394206994,
"grad_norm": 2.578125,
"learning_rate": 0.00047443839115218685,
"loss": 5.7208,
"mean_token_accuracy": 0.17221055477857589,
"num_tokens": 33923424.0,
"step": 18195
},
{
"entropy": 6.10960202217102,
"epoch": 1.6072059342988343,
"grad_norm": 2.0625,
"learning_rate": 0.000474423810715738,
"loss": 5.7875,
"mean_token_accuracy": 0.17125557363033295,
"num_tokens": 33932145.0,
"step": 18200
},
{
"entropy": 5.957092761993408,
"epoch": 1.6076474743906748,
"grad_norm": 4.90625,
"learning_rate": 0.0004744092263726901,
"loss": 5.8001,
"mean_token_accuracy": 0.16714505702257157,
"num_tokens": 33942505.0,
"step": 18205
},
{
"entropy": 6.01400055885315,
"epoch": 1.608089014482515,
"grad_norm": 2.796875,
"learning_rate": 0.0004743946381233288,
"loss": 5.8536,
"mean_token_accuracy": 0.16740232855081558,
"num_tokens": 33952156.0,
"step": 18210
},
{
"entropy": 6.155855512619018,
"epoch": 1.6085305545743553,
"grad_norm": 3.015625,
"learning_rate": 0.00047438004596794,
"loss": 5.8542,
"mean_token_accuracy": 0.16960717141628265,
"num_tokens": 33962478.0,
"step": 18215
},
{
"entropy": 6.168044805526733,
"epoch": 1.6089720946661958,
"grad_norm": 2.421875,
"learning_rate": 0.0004743654499068095,
"loss": 5.7934,
"mean_token_accuracy": 0.16890671998262405,
"num_tokens": 33971581.0,
"step": 18220
},
{
"entropy": 6.089832592010498,
"epoch": 1.609413634758036,
"grad_norm": 1.8984375,
"learning_rate": 0.0004743508499402232,
"loss": 5.7793,
"mean_token_accuracy": 0.17358706444501876,
"num_tokens": 33981262.0,
"step": 18225
},
{
"entropy": 6.094609880447388,
"epoch": 1.6098551748498764,
"grad_norm": 2.3125,
"learning_rate": 0.0004743362460684671,
"loss": 5.8369,
"mean_token_accuracy": 0.16898785680532455,
"num_tokens": 33989865.0,
"step": 18230
},
{
"entropy": 6.146298551559449,
"epoch": 1.6102967149417167,
"grad_norm": 1.9140625,
"learning_rate": 0.00047432163829182737,
"loss": 5.8214,
"mean_token_accuracy": 0.15995376706123351,
"num_tokens": 33999261.0,
"step": 18235
},
{
"entropy": 6.141281604766846,
"epoch": 1.610738255033557,
"grad_norm": 2.203125,
"learning_rate": 0.00047430702661059007,
"loss": 5.8214,
"mean_token_accuracy": 0.16632422655820847,
"num_tokens": 34008471.0,
"step": 18240
},
{
"entropy": 5.961677980422974,
"epoch": 1.6111797951253974,
"grad_norm": 4.5,
"learning_rate": 0.00047429241102504144,
"loss": 5.7171,
"mean_token_accuracy": 0.1782246246933937,
"num_tokens": 34018305.0,
"step": 18245
},
{
"entropy": 6.119319105148316,
"epoch": 1.6116213352172377,
"grad_norm": 3.03125,
"learning_rate": 0.00047427779153546787,
"loss": 5.8541,
"mean_token_accuracy": 0.16124129444360732,
"num_tokens": 34027393.0,
"step": 18250
},
{
"entropy": 6.144275522232055,
"epoch": 1.612062875309078,
"grad_norm": 2.71875,
"learning_rate": 0.00047426316814215563,
"loss": 5.7808,
"mean_token_accuracy": 0.17526775151491164,
"num_tokens": 34035835.0,
"step": 18255
},
{
"entropy": 6.065506553649902,
"epoch": 1.6125044154009185,
"grad_norm": 1.9765625,
"learning_rate": 0.00047424854084539134,
"loss": 5.8514,
"mean_token_accuracy": 0.16380847990512848,
"num_tokens": 34045946.0,
"step": 18260
},
{
"entropy": 6.1323570728302,
"epoch": 1.6129459554927588,
"grad_norm": 2.296875,
"learning_rate": 0.00047423390964546145,
"loss": 5.9077,
"mean_token_accuracy": 0.16687799543142318,
"num_tokens": 34055356.0,
"step": 18265
},
{
"entropy": 6.2116845607757565,
"epoch": 1.613387495584599,
"grad_norm": 1.984375,
"learning_rate": 0.0004742192745426525,
"loss": 5.9504,
"mean_token_accuracy": 0.15842400938272477,
"num_tokens": 34065862.0,
"step": 18270
},
{
"entropy": 6.1807760238647464,
"epoch": 1.6138290356764395,
"grad_norm": 1.9921875,
"learning_rate": 0.0004742046355372513,
"loss": 5.8436,
"mean_token_accuracy": 0.17109602987766265,
"num_tokens": 34074980.0,
"step": 18275
},
{
"entropy": 6.063287782669067,
"epoch": 1.6142705757682798,
"grad_norm": 1.8203125,
"learning_rate": 0.00047418999262954466,
"loss": 5.8303,
"mean_token_accuracy": 0.1621298760175705,
"num_tokens": 34085501.0,
"step": 18280
},
{
"entropy": 6.100457429885864,
"epoch": 1.61471211586012,
"grad_norm": 1.859375,
"learning_rate": 0.0004741753458198192,
"loss": 5.7896,
"mean_token_accuracy": 0.16870099902153016,
"num_tokens": 34095564.0,
"step": 18285
},
{
"entropy": 6.079445934295654,
"epoch": 1.6151536559519606,
"grad_norm": 2.109375,
"learning_rate": 0.00047416069510836215,
"loss": 5.8475,
"mean_token_accuracy": 0.1603478252887726,
"num_tokens": 34104571.0,
"step": 18290
},
{
"entropy": 6.108513355255127,
"epoch": 1.6155951960438006,
"grad_norm": 1.9140625,
"learning_rate": 0.0004741460404954602,
"loss": 5.866,
"mean_token_accuracy": 0.15915729403495787,
"num_tokens": 34114272.0,
"step": 18295
},
{
"entropy": 6.023153305053711,
"epoch": 1.6160367361356411,
"grad_norm": 2.171875,
"learning_rate": 0.0004741313819814007,
"loss": 5.8068,
"mean_token_accuracy": 0.1675526648759842,
"num_tokens": 34125521.0,
"step": 18300
},
{
"entropy": 6.07880597114563,
"epoch": 1.6164782762274814,
"grad_norm": 1.984375,
"learning_rate": 0.0004741167195664706,
"loss": 5.8432,
"mean_token_accuracy": 0.16506962180137635,
"num_tokens": 34134447.0,
"step": 18305
},
{
"entropy": 6.046179723739624,
"epoch": 1.6169198163193217,
"grad_norm": 1.8125,
"learning_rate": 0.00047410205325095725,
"loss": 5.7651,
"mean_token_accuracy": 0.17462612688541412,
"num_tokens": 34143207.0,
"step": 18310
},
{
"entropy": 6.097505807876587,
"epoch": 1.6173613564111622,
"grad_norm": 2.0625,
"learning_rate": 0.0004740873830351479,
"loss": 5.7708,
"mean_token_accuracy": 0.1728495642542839,
"num_tokens": 34153025.0,
"step": 18315
},
{
"entropy": 6.163943672180176,
"epoch": 1.6178028965030025,
"grad_norm": 1.7890625,
"learning_rate": 0.00047407270891932995,
"loss": 5.8096,
"mean_token_accuracy": 0.1661963000893593,
"num_tokens": 34162793.0,
"step": 18320
},
{
"entropy": 6.067262887954712,
"epoch": 1.6182444365948427,
"grad_norm": 1.515625,
"learning_rate": 0.00047405803090379083,
"loss": 5.8345,
"mean_token_accuracy": 0.16337695717811584,
"num_tokens": 34171941.0,
"step": 18325
},
{
"entropy": 6.119243717193603,
"epoch": 1.6186859766866832,
"grad_norm": 1.984375,
"learning_rate": 0.0004740433489888182,
"loss": 5.7897,
"mean_token_accuracy": 0.17165394574403764,
"num_tokens": 34180993.0,
"step": 18330
},
{
"entropy": 6.119691801071167,
"epoch": 1.6191275167785235,
"grad_norm": 1.8828125,
"learning_rate": 0.00047402866317469944,
"loss": 5.7377,
"mean_token_accuracy": 0.17339210212230682,
"num_tokens": 34190078.0,
"step": 18335
},
{
"entropy": 5.977187442779541,
"epoch": 1.6195690568703638,
"grad_norm": 3.625,
"learning_rate": 0.0004740139734617224,
"loss": 5.7291,
"mean_token_accuracy": 0.1762983188033104,
"num_tokens": 34199091.0,
"step": 18340
},
{
"entropy": 6.088537788391113,
"epoch": 1.6200105969622043,
"grad_norm": 4.625,
"learning_rate": 0.0004739992798501748,
"loss": 5.8539,
"mean_token_accuracy": 0.16969733834266662,
"num_tokens": 34209042.0,
"step": 18345
},
{
"entropy": 6.156441926956177,
"epoch": 1.6204521370540446,
"grad_norm": 1.859375,
"learning_rate": 0.00047398458234034445,
"loss": 5.8185,
"mean_token_accuracy": 0.16971989572048188,
"num_tokens": 34217311.0,
"step": 18350
},
{
"entropy": 6.025486946105957,
"epoch": 1.6208936771458848,
"grad_norm": 1.78125,
"learning_rate": 0.00047396988093251934,
"loss": 5.7715,
"mean_token_accuracy": 0.1747056782245636,
"num_tokens": 34227001.0,
"step": 18355
},
{
"entropy": 6.147510719299317,
"epoch": 1.6213352172377253,
"grad_norm": 1.9296875,
"learning_rate": 0.0004739551756269875,
"loss": 5.8131,
"mean_token_accuracy": 0.16625873893499374,
"num_tokens": 34236214.0,
"step": 18360
},
{
"entropy": 6.143719244003296,
"epoch": 1.6217767573295654,
"grad_norm": 1.640625,
"learning_rate": 0.0004739404664240368,
"loss": 5.773,
"mean_token_accuracy": 0.16954519152641295,
"num_tokens": 34244808.0,
"step": 18365
},
{
"entropy": 6.03213152885437,
"epoch": 1.6222182974214059,
"grad_norm": 1.796875,
"learning_rate": 0.00047392575332395556,
"loss": 5.7745,
"mean_token_accuracy": 0.1822574958205223,
"num_tokens": 34253355.0,
"step": 18370
},
{
"entropy": 6.141188859939575,
"epoch": 1.6226598375132462,
"grad_norm": 1.5546875,
"learning_rate": 0.0004739110363270319,
"loss": 5.8841,
"mean_token_accuracy": 0.1606649175286293,
"num_tokens": 34262235.0,
"step": 18375
},
{
"entropy": 6.134693670272827,
"epoch": 1.6231013776050864,
"grad_norm": 2.890625,
"learning_rate": 0.00047389631543355424,
"loss": 5.764,
"mean_token_accuracy": 0.17225708812475204,
"num_tokens": 34272174.0,
"step": 18380
},
{
"entropy": 6.093717432022094,
"epoch": 1.623542917696927,
"grad_norm": 3.65625,
"learning_rate": 0.0004738815906438108,
"loss": 5.7743,
"mean_token_accuracy": 0.17375739961862563,
"num_tokens": 34281153.0,
"step": 18385
},
{
"entropy": 6.052750444412231,
"epoch": 1.6239844577887672,
"grad_norm": 1.9296875,
"learning_rate": 0.00047386686195809017,
"loss": 5.8099,
"mean_token_accuracy": 0.17005577683448792,
"num_tokens": 34291045.0,
"step": 18390
},
{
"entropy": 6.064227724075318,
"epoch": 1.6244259978806075,
"grad_norm": 2.140625,
"learning_rate": 0.00047385212937668084,
"loss": 5.7556,
"mean_token_accuracy": 0.16989160180091858,
"num_tokens": 34299234.0,
"step": 18395
},
{
"entropy": 6.084740209579468,
"epoch": 1.624867537972448,
"grad_norm": 1.5703125,
"learning_rate": 0.00047383739289987134,
"loss": 5.8332,
"mean_token_accuracy": 0.1680184319615364,
"num_tokens": 34309084.0,
"step": 18400
},
{
"entropy": 6.174731302261352,
"epoch": 1.6253090780642883,
"grad_norm": 1.890625,
"learning_rate": 0.0004738226525279504,
"loss": 5.9098,
"mean_token_accuracy": 0.15738383084535598,
"num_tokens": 34320039.0,
"step": 18405
},
{
"entropy": 6.074712657928467,
"epoch": 1.6257506181561285,
"grad_norm": 2.125,
"learning_rate": 0.0004738079082612068,
"loss": 5.7267,
"mean_token_accuracy": 0.16968970596790314,
"num_tokens": 34329020.0,
"step": 18410
},
{
"entropy": 6.086336469650268,
"epoch": 1.626192158247969,
"grad_norm": 1.75,
"learning_rate": 0.00047379316009992927,
"loss": 5.8312,
"mean_token_accuracy": 0.16339126527309417,
"num_tokens": 34337953.0,
"step": 18415
},
{
"entropy": 6.013571834564209,
"epoch": 1.6266336983398093,
"grad_norm": 1.59375,
"learning_rate": 0.00047377840804440686,
"loss": 5.6972,
"mean_token_accuracy": 0.17497345209121704,
"num_tokens": 34346564.0,
"step": 18420
},
{
"entropy": 6.13233380317688,
"epoch": 1.6270752384316496,
"grad_norm": 2.1875,
"learning_rate": 0.0004737636520949285,
"loss": 5.942,
"mean_token_accuracy": 0.16039129644632338,
"num_tokens": 34357163.0,
"step": 18425
},
{
"entropy": 6.14234561920166,
"epoch": 1.62751677852349,
"grad_norm": 2.890625,
"learning_rate": 0.0004737488922517832,
"loss": 5.9324,
"mean_token_accuracy": 0.16269785016775132,
"num_tokens": 34366731.0,
"step": 18430
},
{
"entropy": 6.035276794433594,
"epoch": 1.6279583186153301,
"grad_norm": 2.140625,
"learning_rate": 0.00047373412851526013,
"loss": 5.7919,
"mean_token_accuracy": 0.17525396794080733,
"num_tokens": 34375845.0,
"step": 18435
},
{
"entropy": 6.095372867584229,
"epoch": 1.6283998587071706,
"grad_norm": 2.09375,
"learning_rate": 0.00047371936088564856,
"loss": 5.7739,
"mean_token_accuracy": 0.17423959225416183,
"num_tokens": 34385335.0,
"step": 18440
},
{
"entropy": 6.139209413528443,
"epoch": 1.628841398799011,
"grad_norm": 4.1875,
"learning_rate": 0.0004737045893632377,
"loss": 5.8452,
"mean_token_accuracy": 0.17196706980466842,
"num_tokens": 34394356.0,
"step": 18445
},
{
"entropy": 6.0750284671783445,
"epoch": 1.6292829388908512,
"grad_norm": 1.890625,
"learning_rate": 0.00047368981394831696,
"loss": 5.808,
"mean_token_accuracy": 0.17127752900123597,
"num_tokens": 34403727.0,
"step": 18450
},
{
"entropy": 6.173783779144287,
"epoch": 1.6297244789826917,
"grad_norm": 1.953125,
"learning_rate": 0.00047367503464117573,
"loss": 5.8546,
"mean_token_accuracy": 0.16936516463756562,
"num_tokens": 34413253.0,
"step": 18455
},
{
"entropy": 6.0577881813049315,
"epoch": 1.630166019074532,
"grad_norm": 1.78125,
"learning_rate": 0.00047366025144210356,
"loss": 5.7768,
"mean_token_accuracy": 0.17534940093755721,
"num_tokens": 34422430.0,
"step": 18460
},
{
"entropy": 6.0799017429351805,
"epoch": 1.6306075591663722,
"grad_norm": 1.609375,
"learning_rate": 0.00047364546435139004,
"loss": 5.8159,
"mean_token_accuracy": 0.16486478298902513,
"num_tokens": 34431111.0,
"step": 18465
},
{
"entropy": 6.112651586532593,
"epoch": 1.6310490992582127,
"grad_norm": 2.109375,
"learning_rate": 0.00047363067336932493,
"loss": 5.7778,
"mean_token_accuracy": 0.17224719524383544,
"num_tokens": 34440044.0,
"step": 18470
},
{
"entropy": 6.1080245018005375,
"epoch": 1.631490639350053,
"grad_norm": 1.7265625,
"learning_rate": 0.0004736158784961978,
"loss": 5.8201,
"mean_token_accuracy": 0.17181870490312576,
"num_tokens": 34450315.0,
"step": 18475
},
{
"entropy": 5.991387271881104,
"epoch": 1.6319321794418933,
"grad_norm": 2.296875,
"learning_rate": 0.00047360107973229865,
"loss": 5.7269,
"mean_token_accuracy": 0.1817321702837944,
"num_tokens": 34459380.0,
"step": 18480
},
{
"entropy": 6.100083637237549,
"epoch": 1.6323737195337338,
"grad_norm": 2.515625,
"learning_rate": 0.0004735862770779172,
"loss": 5.8495,
"mean_token_accuracy": 0.16936219483613968,
"num_tokens": 34468224.0,
"step": 18485
},
{
"entropy": 6.041209411621094,
"epoch": 1.632815259625574,
"grad_norm": 1.9765625,
"learning_rate": 0.0004735714705333436,
"loss": 5.7137,
"mean_token_accuracy": 0.16773688048124313,
"num_tokens": 34476917.0,
"step": 18490
},
{
"entropy": 6.0107067108154295,
"epoch": 1.6332567997174143,
"grad_norm": 2.046875,
"learning_rate": 0.00047355666009886785,
"loss": 5.834,
"mean_token_accuracy": 0.1678368180990219,
"num_tokens": 34487192.0,
"step": 18495
},
{
"entropy": 6.090392446517944,
"epoch": 1.6336983398092548,
"grad_norm": 1.515625,
"learning_rate": 0.00047354184577478,
"loss": 5.7798,
"mean_token_accuracy": 0.17256635427474976,
"num_tokens": 34496658.0,
"step": 18500
},
{
"entropy": 6.104557657241822,
"epoch": 1.6341398799010949,
"grad_norm": 1.6796875,
"learning_rate": 0.00047352702756137035,
"loss": 5.6979,
"mean_token_accuracy": 0.18012721389532088,
"num_tokens": 34505126.0,
"step": 18505
},
{
"entropy": 6.035897159576416,
"epoch": 1.6345814199929354,
"grad_norm": 2.03125,
"learning_rate": 0.0004735122054589291,
"loss": 5.7611,
"mean_token_accuracy": 0.1696541726589203,
"num_tokens": 34514236.0,
"step": 18510
},
{
"entropy": 5.951328468322754,
"epoch": 1.6350229600847757,
"grad_norm": 2.59375,
"learning_rate": 0.0004734973794677467,
"loss": 5.6902,
"mean_token_accuracy": 0.17745814323425294,
"num_tokens": 34522609.0,
"step": 18515
},
{
"entropy": 6.042683076858521,
"epoch": 1.635464500176616,
"grad_norm": 3.21875,
"learning_rate": 0.00047348254958811347,
"loss": 5.8273,
"mean_token_accuracy": 0.17215800583362578,
"num_tokens": 34531742.0,
"step": 18520
},
{
"entropy": 6.075387668609619,
"epoch": 1.6359060402684564,
"grad_norm": 1.40625,
"learning_rate": 0.00047346771582031994,
"loss": 5.7528,
"mean_token_accuracy": 0.16850955039262772,
"num_tokens": 34540821.0,
"step": 18525
},
{
"entropy": 6.129460191726684,
"epoch": 1.6363475803602967,
"grad_norm": 2.453125,
"learning_rate": 0.0004734528781646568,
"loss": 5.8407,
"mean_token_accuracy": 0.16756102740764617,
"num_tokens": 34549795.0,
"step": 18530
},
{
"entropy": 6.1593324661254885,
"epoch": 1.636789120452137,
"grad_norm": 1.84375,
"learning_rate": 0.0004734380366214146,
"loss": 5.8516,
"mean_token_accuracy": 0.16406078040599822,
"num_tokens": 34559455.0,
"step": 18535
},
{
"entropy": 6.158723783493042,
"epoch": 1.6372306605439775,
"grad_norm": 2.109375,
"learning_rate": 0.0004734231911908842,
"loss": 5.8194,
"mean_token_accuracy": 0.16565390974283217,
"num_tokens": 34568832.0,
"step": 18540
},
{
"entropy": 6.080087566375733,
"epoch": 1.6376722006358178,
"grad_norm": 1.8671875,
"learning_rate": 0.00047340834187335626,
"loss": 5.8108,
"mean_token_accuracy": 0.17242854088544846,
"num_tokens": 34578630.0,
"step": 18545
},
{
"entropy": 6.136902618408203,
"epoch": 1.638113740727658,
"grad_norm": 3.03125,
"learning_rate": 0.00047339348866912173,
"loss": 5.8364,
"mean_token_accuracy": 0.16759345978498458,
"num_tokens": 34587782.0,
"step": 18550
},
{
"entropy": 6.06225905418396,
"epoch": 1.6385552808194985,
"grad_norm": 1.7890625,
"learning_rate": 0.0004733786315784716,
"loss": 5.7639,
"mean_token_accuracy": 0.1724938854575157,
"num_tokens": 34597133.0,
"step": 18555
},
{
"entropy": 6.028275346755981,
"epoch": 1.6389968209113388,
"grad_norm": 3.25,
"learning_rate": 0.00047336377060169696,
"loss": 5.8522,
"mean_token_accuracy": 0.161611145734787,
"num_tokens": 34606697.0,
"step": 18560
},
{
"entropy": 6.111205768585205,
"epoch": 1.639438361003179,
"grad_norm": 1.8671875,
"learning_rate": 0.0004733489057390888,
"loss": 5.7928,
"mean_token_accuracy": 0.1731525629758835,
"num_tokens": 34615806.0,
"step": 18565
},
{
"entropy": 6.14549150466919,
"epoch": 1.6398799010950196,
"grad_norm": 1.71875,
"learning_rate": 0.0004733340369909384,
"loss": 5.9668,
"mean_token_accuracy": 0.1565863460302353,
"num_tokens": 34626563.0,
"step": 18570
},
{
"entropy": 6.110190153121948,
"epoch": 1.6403214411868596,
"grad_norm": 1.96875,
"learning_rate": 0.00047331916435753706,
"loss": 5.8294,
"mean_token_accuracy": 0.17008843421936035,
"num_tokens": 34636077.0,
"step": 18575
},
{
"entropy": 6.115274810791016,
"epoch": 1.6407629812787001,
"grad_norm": 2.046875,
"learning_rate": 0.00047330428783917607,
"loss": 5.8812,
"mean_token_accuracy": 0.16653720885515214,
"num_tokens": 34646164.0,
"step": 18580
},
{
"entropy": 6.09968581199646,
"epoch": 1.6412045213705404,
"grad_norm": 2.25,
"learning_rate": 0.00047328940743614683,
"loss": 5.7992,
"mean_token_accuracy": 0.16473203897476196,
"num_tokens": 34655577.0,
"step": 18585
},
{
"entropy": 6.141823101043701,
"epoch": 1.6416460614623807,
"grad_norm": 3.078125,
"learning_rate": 0.00047327452314874094,
"loss": 5.8388,
"mean_token_accuracy": 0.16695224195718766,
"num_tokens": 34664520.0,
"step": 18590
},
{
"entropy": 6.061571073532105,
"epoch": 1.6420876015542212,
"grad_norm": 2.125,
"learning_rate": 0.00047325963497724983,
"loss": 5.7372,
"mean_token_accuracy": 0.1752131313085556,
"num_tokens": 34673528.0,
"step": 18595
},
{
"entropy": 6.101268196105957,
"epoch": 1.6425291416460615,
"grad_norm": 2.265625,
"learning_rate": 0.0004732447429219652,
"loss": 5.8441,
"mean_token_accuracy": 0.1719423159956932,
"num_tokens": 34682563.0,
"step": 18600
},
{
"entropy": 6.117995071411133,
"epoch": 1.6429706817379017,
"grad_norm": 1.8984375,
"learning_rate": 0.0004732298469831789,
"loss": 5.7471,
"mean_token_accuracy": 0.17563538402318954,
"num_tokens": 34691932.0,
"step": 18605
},
{
"entropy": 6.092788982391357,
"epoch": 1.6434122218297422,
"grad_norm": 1.671875,
"learning_rate": 0.00047321494716118256,
"loss": 5.7411,
"mean_token_accuracy": 0.17382658272981644,
"num_tokens": 34701376.0,
"step": 18610
},
{
"entropy": 6.041273880004883,
"epoch": 1.6438537619215825,
"grad_norm": 2.234375,
"learning_rate": 0.00047320004345626816,
"loss": 5.7576,
"mean_token_accuracy": 0.1660645842552185,
"num_tokens": 34711112.0,
"step": 18615
},
{
"entropy": 6.077160739898682,
"epoch": 1.6442953020134228,
"grad_norm": 2.1875,
"learning_rate": 0.00047318513586872766,
"loss": 5.7784,
"mean_token_accuracy": 0.17643167823553085,
"num_tokens": 34720429.0,
"step": 18620
},
{
"entropy": 6.084652042388916,
"epoch": 1.6447368421052633,
"grad_norm": 1.765625,
"learning_rate": 0.000473170224398853,
"loss": 5.7952,
"mean_token_accuracy": 0.16976328790187836,
"num_tokens": 34729422.0,
"step": 18625
},
{
"entropy": 6.102636909484863,
"epoch": 1.6451783821971036,
"grad_norm": 2.15625,
"learning_rate": 0.00047315530904693643,
"loss": 5.8048,
"mean_token_accuracy": 0.16605391204357148,
"num_tokens": 34738231.0,
"step": 18630
},
{
"entropy": 6.108850955963135,
"epoch": 1.6456199222889438,
"grad_norm": 2.8125,
"learning_rate": 0.00047314038981327,
"loss": 5.848,
"mean_token_accuracy": 0.16697754710912704,
"num_tokens": 34747002.0,
"step": 18635
},
{
"entropy": 5.995891094207764,
"epoch": 1.6460614623807843,
"grad_norm": 2.65625,
"learning_rate": 0.000473125466698146,
"loss": 5.7127,
"mean_token_accuracy": 0.1802699536085129,
"num_tokens": 34756093.0,
"step": 18640
},
{
"entropy": 6.087904930114746,
"epoch": 1.6465030024726244,
"grad_norm": 2.234375,
"learning_rate": 0.0004731105397018569,
"loss": 5.8168,
"mean_token_accuracy": 0.1721769616007805,
"num_tokens": 34766031.0,
"step": 18645
},
{
"entropy": 6.157454633712769,
"epoch": 1.6469445425644649,
"grad_norm": 2.0625,
"learning_rate": 0.0004730956088246949,
"loss": 5.8891,
"mean_token_accuracy": 0.16713477969169616,
"num_tokens": 34776487.0,
"step": 18650
},
{
"entropy": 6.136001062393189,
"epoch": 1.6473860826563052,
"grad_norm": 2.046875,
"learning_rate": 0.00047308067406695255,
"loss": 5.7276,
"mean_token_accuracy": 0.1795403927564621,
"num_tokens": 34785372.0,
"step": 18655
},
{
"entropy": 6.000024080276489,
"epoch": 1.6478276227481454,
"grad_norm": 2.34375,
"learning_rate": 0.00047306573542892257,
"loss": 5.7363,
"mean_token_accuracy": 0.176891328394413,
"num_tokens": 34795453.0,
"step": 18660
},
{
"entropy": 6.087579917907715,
"epoch": 1.648269162839986,
"grad_norm": 1.90625,
"learning_rate": 0.00047305079291089735,
"loss": 5.8428,
"mean_token_accuracy": 0.16449207663536072,
"num_tokens": 34804818.0,
"step": 18665
},
{
"entropy": 6.132311725616455,
"epoch": 1.6487107029318262,
"grad_norm": 1.9609375,
"learning_rate": 0.00047303584651316985,
"loss": 5.8754,
"mean_token_accuracy": 0.16421028971672058,
"num_tokens": 34814031.0,
"step": 18670
},
{
"entropy": 6.090078687667846,
"epoch": 1.6491522430236665,
"grad_norm": 1.71875,
"learning_rate": 0.0004730208962360327,
"loss": 5.7498,
"mean_token_accuracy": 0.17047815322875975,
"num_tokens": 34823560.0,
"step": 18675
},
{
"entropy": 6.123842191696167,
"epoch": 1.649593783115507,
"grad_norm": 1.90625,
"learning_rate": 0.0004730059420797788,
"loss": 5.7697,
"mean_token_accuracy": 0.16962168216705323,
"num_tokens": 34833662.0,
"step": 18680
},
{
"entropy": 6.166540479660034,
"epoch": 1.6500353232073472,
"grad_norm": 1.5859375,
"learning_rate": 0.0004729909840447011,
"loss": 5.9064,
"mean_token_accuracy": 0.1596740610897541,
"num_tokens": 34844264.0,
"step": 18685
},
{
"entropy": 6.1350466251373295,
"epoch": 1.6504768632991875,
"grad_norm": 1.609375,
"learning_rate": 0.00047297602213109265,
"loss": 5.7717,
"mean_token_accuracy": 0.1766924351453781,
"num_tokens": 34853708.0,
"step": 18690
},
{
"entropy": 6.143089342117309,
"epoch": 1.650918403391028,
"grad_norm": 1.7734375,
"learning_rate": 0.0004729610563392465,
"loss": 5.8503,
"mean_token_accuracy": 0.1681128054857254,
"num_tokens": 34861926.0,
"step": 18695
},
{
"entropy": 6.040766763687134,
"epoch": 1.6513599434828683,
"grad_norm": 1.46875,
"learning_rate": 0.0004729460866694558,
"loss": 5.7809,
"mean_token_accuracy": 0.1715337887406349,
"num_tokens": 34870919.0,
"step": 18700
},
{
"entropy": 6.085544872283935,
"epoch": 1.6518014835747086,
"grad_norm": 2.390625,
"learning_rate": 0.000472931113122014,
"loss": 5.8037,
"mean_token_accuracy": 0.16903091967105865,
"num_tokens": 34879801.0,
"step": 18705
},
{
"entropy": 6.064466762542724,
"epoch": 1.652243023666549,
"grad_norm": 2.25,
"learning_rate": 0.0004729161356972141,
"loss": 5.8192,
"mean_token_accuracy": 0.16092301905155182,
"num_tokens": 34888605.0,
"step": 18710
},
{
"entropy": 6.100585079193115,
"epoch": 1.6526845637583891,
"grad_norm": 2.328125,
"learning_rate": 0.00047290115439534977,
"loss": 5.8709,
"mean_token_accuracy": 0.15966134667396545,
"num_tokens": 34899294.0,
"step": 18715
},
{
"entropy": 6.158120775222779,
"epoch": 1.6531261038502296,
"grad_norm": 2.40625,
"learning_rate": 0.0004728861692167143,
"loss": 5.8604,
"mean_token_accuracy": 0.16855270117521287,
"num_tokens": 34908624.0,
"step": 18720
},
{
"entropy": 6.146796464920044,
"epoch": 1.65356764394207,
"grad_norm": 1.9453125,
"learning_rate": 0.0004728711801616013,
"loss": 5.7325,
"mean_token_accuracy": 0.17281667292118072,
"num_tokens": 34917390.0,
"step": 18725
},
{
"entropy": 6.077745056152343,
"epoch": 1.6540091840339102,
"grad_norm": 1.8046875,
"learning_rate": 0.0004728561872303045,
"loss": 5.8372,
"mean_token_accuracy": 0.16003347039222718,
"num_tokens": 34926652.0,
"step": 18730
},
{
"entropy": 6.078874158859253,
"epoch": 1.6544507241257507,
"grad_norm": 2.234375,
"learning_rate": 0.0004728411904231175,
"loss": 5.8763,
"mean_token_accuracy": 0.16304221600294114,
"num_tokens": 34936900.0,
"step": 18735
},
{
"entropy": 6.1331048011779785,
"epoch": 1.654892264217591,
"grad_norm": 3.46875,
"learning_rate": 0.0004728261897403341,
"loss": 5.8442,
"mean_token_accuracy": 0.16958070993423463,
"num_tokens": 34946827.0,
"step": 18740
},
{
"entropy": 6.15837140083313,
"epoch": 1.6553338043094312,
"grad_norm": 2.59375,
"learning_rate": 0.00047281118518224807,
"loss": 5.8705,
"mean_token_accuracy": 0.16778819561004638,
"num_tokens": 34955987.0,
"step": 18745
},
{
"entropy": 6.077195310592652,
"epoch": 1.6557753444012717,
"grad_norm": 2.0,
"learning_rate": 0.0004727961767491535,
"loss": 5.7764,
"mean_token_accuracy": 0.17284119129180908,
"num_tokens": 34965001.0,
"step": 18750
},
{
"entropy": 6.1356773853302,
"epoch": 1.656216884493112,
"grad_norm": 1.7421875,
"learning_rate": 0.0004727811644413443,
"loss": 5.8547,
"mean_token_accuracy": 0.16264436393976212,
"num_tokens": 34974113.0,
"step": 18755
},
{
"entropy": 6.049778318405151,
"epoch": 1.6566584245849523,
"grad_norm": 1.7109375,
"learning_rate": 0.0004727661482591146,
"loss": 5.7081,
"mean_token_accuracy": 0.1753073588013649,
"num_tokens": 34982535.0,
"step": 18760
},
{
"entropy": 6.082410860061645,
"epoch": 1.6570999646767928,
"grad_norm": 1.921875,
"learning_rate": 0.0004727511282027585,
"loss": 5.822,
"mean_token_accuracy": 0.16553823202848433,
"num_tokens": 34991828.0,
"step": 18765
},
{
"entropy": 6.089109563827515,
"epoch": 1.657541504768633,
"grad_norm": 2.40625,
"learning_rate": 0.0004727361042725703,
"loss": 5.7712,
"mean_token_accuracy": 0.1727207064628601,
"num_tokens": 35001670.0,
"step": 18770
},
{
"entropy": 6.035490226745606,
"epoch": 1.6579830448604733,
"grad_norm": 2.234375,
"learning_rate": 0.0004727210764688442,
"loss": 5.7392,
"mean_token_accuracy": 0.1756819263100624,
"num_tokens": 35011407.0,
"step": 18775
},
{
"entropy": 6.014676141738891,
"epoch": 1.6584245849523138,
"grad_norm": 1.9296875,
"learning_rate": 0.0004727060447918748,
"loss": 5.6979,
"mean_token_accuracy": 0.18242545425891876,
"num_tokens": 35020753.0,
"step": 18780
},
{
"entropy": 6.065234756469726,
"epoch": 1.6588661250441539,
"grad_norm": 2.671875,
"learning_rate": 0.00047269100924195623,
"loss": 5.8312,
"mean_token_accuracy": 0.16399710476398469,
"num_tokens": 35030599.0,
"step": 18785
},
{
"entropy": 6.047504663467407,
"epoch": 1.6593076651359944,
"grad_norm": 1.765625,
"learning_rate": 0.00047267596981938337,
"loss": 5.8444,
"mean_token_accuracy": 0.16802098155021666,
"num_tokens": 35039098.0,
"step": 18790
},
{
"entropy": 6.172687244415283,
"epoch": 1.6597492052278346,
"grad_norm": 1.8515625,
"learning_rate": 0.00047266092652445066,
"loss": 5.8069,
"mean_token_accuracy": 0.16881141662597657,
"num_tokens": 35048286.0,
"step": 18795
},
{
"entropy": 6.182630586624145,
"epoch": 1.660190745319675,
"grad_norm": 1.65625,
"learning_rate": 0.0004726458793574528,
"loss": 5.8713,
"mean_token_accuracy": 0.16407173871994019,
"num_tokens": 35057331.0,
"step": 18800
},
{
"entropy": 6.097613048553467,
"epoch": 1.6606322854115154,
"grad_norm": 1.8671875,
"learning_rate": 0.0004726308283186846,
"loss": 5.8362,
"mean_token_accuracy": 0.1623414486646652,
"num_tokens": 35066321.0,
"step": 18805
},
{
"entropy": 6.043586111068725,
"epoch": 1.6610738255033557,
"grad_norm": 1.8828125,
"learning_rate": 0.0004726157734084409,
"loss": 5.7719,
"mean_token_accuracy": 0.1717945158481598,
"num_tokens": 35075218.0,
"step": 18810
},
{
"entropy": 6.078442096710205,
"epoch": 1.661515365595196,
"grad_norm": 2.203125,
"learning_rate": 0.0004726007146270164,
"loss": 5.8179,
"mean_token_accuracy": 0.168281389772892,
"num_tokens": 35084563.0,
"step": 18815
},
{
"entropy": 5.989255475997925,
"epoch": 1.6619569056870365,
"grad_norm": 1.9296875,
"learning_rate": 0.0004725856519747065,
"loss": 5.7148,
"mean_token_accuracy": 0.17327984273433686,
"num_tokens": 35093346.0,
"step": 18820
},
{
"entropy": 6.067823171615601,
"epoch": 1.6623984457788767,
"grad_norm": 2.296875,
"learning_rate": 0.0004725705854518059,
"loss": 5.7959,
"mean_token_accuracy": 0.16684834510087967,
"num_tokens": 35102501.0,
"step": 18825
},
{
"entropy": 6.112654733657837,
"epoch": 1.662839985870717,
"grad_norm": 4.8125,
"learning_rate": 0.00047255551505861007,
"loss": 5.8157,
"mean_token_accuracy": 0.16709154099225998,
"num_tokens": 35112083.0,
"step": 18830
},
{
"entropy": 6.02054238319397,
"epoch": 1.6632815259625575,
"grad_norm": 2.171875,
"learning_rate": 0.00047254044079541387,
"loss": 5.74,
"mean_token_accuracy": 0.17646532207727433,
"num_tokens": 35121380.0,
"step": 18835
},
{
"entropy": 6.074959802627563,
"epoch": 1.6637230660543978,
"grad_norm": 2.578125,
"learning_rate": 0.0004725253626625129,
"loss": 5.8567,
"mean_token_accuracy": 0.1649652138352394,
"num_tokens": 35130083.0,
"step": 18840
},
{
"entropy": 6.129145193099975,
"epoch": 1.664164606146238,
"grad_norm": 2.078125,
"learning_rate": 0.00047251028066020237,
"loss": 5.7336,
"mean_token_accuracy": 0.17628480345010758,
"num_tokens": 35139001.0,
"step": 18845
},
{
"entropy": 6.013051557540893,
"epoch": 1.6646061462380786,
"grad_norm": 1.953125,
"learning_rate": 0.00047249519478877774,
"loss": 5.6934,
"mean_token_accuracy": 0.17590784579515456,
"num_tokens": 35147701.0,
"step": 18850
},
{
"entropy": 6.01189923286438,
"epoch": 1.6650476863299186,
"grad_norm": 2.359375,
"learning_rate": 0.0004724801050485346,
"loss": 5.7494,
"mean_token_accuracy": 0.17600121051073075,
"num_tokens": 35157334.0,
"step": 18855
},
{
"entropy": 6.099175262451172,
"epoch": 1.6654892264217591,
"grad_norm": 1.640625,
"learning_rate": 0.0004724650114397685,
"loss": 5.7611,
"mean_token_accuracy": 0.17559392899274825,
"num_tokens": 35166647.0,
"step": 18860
},
{
"entropy": 6.127893257141113,
"epoch": 1.6659307665135994,
"grad_norm": 1.6953125,
"learning_rate": 0.00047244991396277515,
"loss": 5.7816,
"mean_token_accuracy": 0.1658578909933567,
"num_tokens": 35176345.0,
"step": 18865
},
{
"entropy": 6.104693651199341,
"epoch": 1.6663723066054397,
"grad_norm": 2.484375,
"learning_rate": 0.00047243481261785027,
"loss": 5.7631,
"mean_token_accuracy": 0.17336946576833726,
"num_tokens": 35185793.0,
"step": 18870
},
{
"entropy": 6.0252221584320065,
"epoch": 1.6668138466972802,
"grad_norm": 1.6796875,
"learning_rate": 0.00047241970740528975,
"loss": 5.8587,
"mean_token_accuracy": 0.1688209980726242,
"num_tokens": 35195905.0,
"step": 18875
},
{
"entropy": 6.056792068481445,
"epoch": 1.6672553867891204,
"grad_norm": 2.4375,
"learning_rate": 0.00047240459832538934,
"loss": 5.6981,
"mean_token_accuracy": 0.1722603917121887,
"num_tokens": 35204340.0,
"step": 18880
},
{
"entropy": 6.105068588256836,
"epoch": 1.6676969268809607,
"grad_norm": 3.4375,
"learning_rate": 0.0004723894853784452,
"loss": 5.8042,
"mean_token_accuracy": 0.1626199185848236,
"num_tokens": 35213270.0,
"step": 18885
},
{
"entropy": 6.035109233856201,
"epoch": 1.6681384669728012,
"grad_norm": 2.015625,
"learning_rate": 0.0004723743685647533,
"loss": 5.7883,
"mean_token_accuracy": 0.17037159353494644,
"num_tokens": 35222652.0,
"step": 18890
},
{
"entropy": 6.0708088874816895,
"epoch": 1.6685800070646415,
"grad_norm": 1.46875,
"learning_rate": 0.0004723592478846097,
"loss": 5.808,
"mean_token_accuracy": 0.16461750119924545,
"num_tokens": 35231684.0,
"step": 18895
},
{
"entropy": 6.095040893554687,
"epoch": 1.6690215471564818,
"grad_norm": 1.8671875,
"learning_rate": 0.00047234412333831073,
"loss": 5.8596,
"mean_token_accuracy": 0.1649626150727272,
"num_tokens": 35241589.0,
"step": 18900
},
{
"entropy": 6.2029680728912355,
"epoch": 1.6694630872483223,
"grad_norm": 2.203125,
"learning_rate": 0.0004723289949261527,
"loss": 5.9413,
"mean_token_accuracy": 0.15857751220464705,
"num_tokens": 35250903.0,
"step": 18905
},
{
"entropy": 6.13906831741333,
"epoch": 1.6699046273401625,
"grad_norm": 2.078125,
"learning_rate": 0.0004723138626484318,
"loss": 5.8021,
"mean_token_accuracy": 0.1677526354789734,
"num_tokens": 35260556.0,
"step": 18910
},
{
"entropy": 6.039302349090576,
"epoch": 1.6703461674320028,
"grad_norm": 2.09375,
"learning_rate": 0.00047229872650544446,
"loss": 5.6989,
"mean_token_accuracy": 0.17929557263851165,
"num_tokens": 35270237.0,
"step": 18915
},
{
"entropy": 6.036213350296021,
"epoch": 1.6707877075238433,
"grad_norm": 1.8515625,
"learning_rate": 0.00047228358649748745,
"loss": 5.7264,
"mean_token_accuracy": 0.17735819667577743,
"num_tokens": 35279017.0,
"step": 18920
},
{
"entropy": 6.056829500198364,
"epoch": 1.6712292476156834,
"grad_norm": 2.046875,
"learning_rate": 0.0004722684426248571,
"loss": 5.7659,
"mean_token_accuracy": 0.17563769817352295,
"num_tokens": 35288150.0,
"step": 18925
},
{
"entropy": 6.100571870803833,
"epoch": 1.6716707877075239,
"grad_norm": 1.9296875,
"learning_rate": 0.00047225329488785015,
"loss": 5.818,
"mean_token_accuracy": 0.1749769389629364,
"num_tokens": 35297463.0,
"step": 18930
},
{
"entropy": 6.118208980560302,
"epoch": 1.6721123277993641,
"grad_norm": 2.21875,
"learning_rate": 0.00047223814328676336,
"loss": 5.7959,
"mean_token_accuracy": 0.1695561572909355,
"num_tokens": 35307409.0,
"step": 18935
},
{
"entropy": 5.996574926376343,
"epoch": 1.6725538678912044,
"grad_norm": 2.40625,
"learning_rate": 0.0004722229878218935,
"loss": 5.7529,
"mean_token_accuracy": 0.16902965009212495,
"num_tokens": 35315613.0,
"step": 18940
},
{
"entropy": 6.053987073898315,
"epoch": 1.672995407983045,
"grad_norm": 1.8203125,
"learning_rate": 0.00047220782849353743,
"loss": 5.8193,
"mean_token_accuracy": 0.1724892169237137,
"num_tokens": 35325297.0,
"step": 18945
},
{
"entropy": 6.093305969238282,
"epoch": 1.6734369480748852,
"grad_norm": 1.90625,
"learning_rate": 0.0004721926653019922,
"loss": 5.7937,
"mean_token_accuracy": 0.16406864374876023,
"num_tokens": 35334014.0,
"step": 18950
},
{
"entropy": 6.039219903945923,
"epoch": 1.6738784881667255,
"grad_norm": 1.5859375,
"learning_rate": 0.0004721774982475548,
"loss": 5.7843,
"mean_token_accuracy": 0.17799000889062883,
"num_tokens": 35342784.0,
"step": 18955
},
{
"entropy": 6.140380907058716,
"epoch": 1.674320028258566,
"grad_norm": 1.8046875,
"learning_rate": 0.00047216232733052237,
"loss": 5.9127,
"mean_token_accuracy": 0.16654075682163239,
"num_tokens": 35351985.0,
"step": 18960
},
{
"entropy": 6.155159997940063,
"epoch": 1.6747615683504062,
"grad_norm": 2.25,
"learning_rate": 0.0004721471525511921,
"loss": 5.7652,
"mean_token_accuracy": 0.1691478207707405,
"num_tokens": 35360857.0,
"step": 18965
},
{
"entropy": 6.094503355026245,
"epoch": 1.6752031084422465,
"grad_norm": 2.953125,
"learning_rate": 0.0004721319739098611,
"loss": 5.7362,
"mean_token_accuracy": 0.1772860050201416,
"num_tokens": 35370200.0,
"step": 18970
},
{
"entropy": 6.060985374450683,
"epoch": 1.675644648534087,
"grad_norm": 2.15625,
"learning_rate": 0.000472116791406827,
"loss": 5.8177,
"mean_token_accuracy": 0.17464016526937484,
"num_tokens": 35379481.0,
"step": 18975
},
{
"entropy": 5.957863807678223,
"epoch": 1.6760861886259273,
"grad_norm": 2.296875,
"learning_rate": 0.000472101605042387,
"loss": 5.7627,
"mean_token_accuracy": 0.18130379170179367,
"num_tokens": 35387951.0,
"step": 18980
},
{
"entropy": 6.187017297744751,
"epoch": 1.6765277287177676,
"grad_norm": 1.7890625,
"learning_rate": 0.0004720864148168387,
"loss": 5.7948,
"mean_token_accuracy": 0.16849473416805266,
"num_tokens": 35396200.0,
"step": 18985
},
{
"entropy": 6.180339574813843,
"epoch": 1.676969268809608,
"grad_norm": 1.875,
"learning_rate": 0.0004720712207304796,
"loss": 5.7761,
"mean_token_accuracy": 0.16707134544849395,
"num_tokens": 35404474.0,
"step": 18990
},
{
"entropy": 6.10145263671875,
"epoch": 1.6774108089014481,
"grad_norm": 2.109375,
"learning_rate": 0.0004720560227836073,
"loss": 5.9293,
"mean_token_accuracy": 0.16707594245672225,
"num_tokens": 35414419.0,
"step": 18995
},
{
"entropy": 5.98349084854126,
"epoch": 1.6778523489932886,
"grad_norm": 1.828125,
"learning_rate": 0.0004720408209765197,
"loss": 5.7307,
"mean_token_accuracy": 0.17273528575897218,
"num_tokens": 35423727.0,
"step": 19000
},
{
"entropy": 5.974971008300781,
"epoch": 1.6782938890851289,
"grad_norm": 3.453125,
"learning_rate": 0.00047202561530951443,
"loss": 5.6885,
"mean_token_accuracy": 0.18723513931035995,
"num_tokens": 35433364.0,
"step": 19005
},
{
"entropy": 6.232299184799194,
"epoch": 1.6787354291769692,
"grad_norm": 3.34375,
"learning_rate": 0.0004720104057828894,
"loss": 5.8518,
"mean_token_accuracy": 0.16879160106182098,
"num_tokens": 35442665.0,
"step": 19010
},
{
"entropy": 6.1709808826446535,
"epoch": 1.6791769692688097,
"grad_norm": 1.828125,
"learning_rate": 0.00047199519239694257,
"loss": 5.7224,
"mean_token_accuracy": 0.1755139485001564,
"num_tokens": 35451443.0,
"step": 19015
},
{
"entropy": 5.980337810516358,
"epoch": 1.67961850936065,
"grad_norm": 1.8046875,
"learning_rate": 0.00047197997515197195,
"loss": 5.6796,
"mean_token_accuracy": 0.1845855727791786,
"num_tokens": 35460622.0,
"step": 19020
},
{
"entropy": 5.934973096847534,
"epoch": 1.6800600494524902,
"grad_norm": 4.375,
"learning_rate": 0.00047196475404827565,
"loss": 5.8383,
"mean_token_accuracy": 0.170000821352005,
"num_tokens": 35470345.0,
"step": 19025
},
{
"entropy": 6.115957593917846,
"epoch": 1.6805015895443307,
"grad_norm": 2.15625,
"learning_rate": 0.00047194952908615183,
"loss": 5.9189,
"mean_token_accuracy": 0.15950674712657928,
"num_tokens": 35480460.0,
"step": 19030
},
{
"entropy": 6.150973987579346,
"epoch": 1.680943129636171,
"grad_norm": 2.015625,
"learning_rate": 0.0004719343002658987,
"loss": 5.8435,
"mean_token_accuracy": 0.1620912194252014,
"num_tokens": 35489983.0,
"step": 19035
},
{
"entropy": 6.14506983757019,
"epoch": 1.6813846697280113,
"grad_norm": 1.9609375,
"learning_rate": 0.00047191906758781475,
"loss": 5.7607,
"mean_token_accuracy": 0.1770927295088768,
"num_tokens": 35498963.0,
"step": 19040
},
{
"entropy": 6.067849588394165,
"epoch": 1.6818262098198518,
"grad_norm": 1.921875,
"learning_rate": 0.0004719038310521982,
"loss": 5.8017,
"mean_token_accuracy": 0.17701827734708786,
"num_tokens": 35509054.0,
"step": 19045
},
{
"entropy": 6.101009559631348,
"epoch": 1.682267749911692,
"grad_norm": 1.8671875,
"learning_rate": 0.0004718885906593476,
"loss": 5.945,
"mean_token_accuracy": 0.15536979585886002,
"num_tokens": 35518093.0,
"step": 19050
},
{
"entropy": 6.136398029327393,
"epoch": 1.6827092900035323,
"grad_norm": 1.5,
"learning_rate": 0.0004718733464095614,
"loss": 5.8044,
"mean_token_accuracy": 0.17225586026906967,
"num_tokens": 35527330.0,
"step": 19055
},
{
"entropy": 6.1295613765716555,
"epoch": 1.6831508300953728,
"grad_norm": 1.640625,
"learning_rate": 0.00047185809830313844,
"loss": 5.8243,
"mean_token_accuracy": 0.16428747028112411,
"num_tokens": 35538147.0,
"step": 19060
},
{
"entropy": 6.176136827468872,
"epoch": 1.6835923701872129,
"grad_norm": 1.734375,
"learning_rate": 0.00047184284634037727,
"loss": 5.8839,
"mean_token_accuracy": 0.16094979643821716,
"num_tokens": 35547930.0,
"step": 19065
},
{
"entropy": 6.104318761825562,
"epoch": 1.6840339102790534,
"grad_norm": 7.3125,
"learning_rate": 0.00047182759052157665,
"loss": 5.7322,
"mean_token_accuracy": 0.17077509313821793,
"num_tokens": 35557111.0,
"step": 19070
},
{
"entropy": 6.069367218017578,
"epoch": 1.6844754503708936,
"grad_norm": 1.515625,
"learning_rate": 0.0004718123308470355,
"loss": 5.8699,
"mean_token_accuracy": 0.1645289897918701,
"num_tokens": 35565739.0,
"step": 19075
},
{
"entropy": 6.0656946182250975,
"epoch": 1.684916990462734,
"grad_norm": 1.75,
"learning_rate": 0.00047179706731705263,
"loss": 5.7322,
"mean_token_accuracy": 0.17014391720294952,
"num_tokens": 35574164.0,
"step": 19080
},
{
"entropy": 6.040375518798828,
"epoch": 1.6853585305545744,
"grad_norm": 3.0625,
"learning_rate": 0.00047178179993192723,
"loss": 5.7853,
"mean_token_accuracy": 0.16521000862121582,
"num_tokens": 35582813.0,
"step": 19085
},
{
"entropy": 6.119476461410523,
"epoch": 1.6858000706464147,
"grad_norm": 2.125,
"learning_rate": 0.00047176652869195825,
"loss": 5.7663,
"mean_token_accuracy": 0.17014666199684142,
"num_tokens": 35591884.0,
"step": 19090
},
{
"entropy": 6.124793910980225,
"epoch": 1.686241610738255,
"grad_norm": 4.5,
"learning_rate": 0.00047175125359744487,
"loss": 5.7931,
"mean_token_accuracy": 0.17020564824342727,
"num_tokens": 35601824.0,
"step": 19095
},
{
"entropy": 6.031408071517944,
"epoch": 1.6866831508300955,
"grad_norm": 2.25,
"learning_rate": 0.00047173597464868634,
"loss": 5.7397,
"mean_token_accuracy": 0.17949817925691605,
"num_tokens": 35610756.0,
"step": 19100
},
{
"entropy": 5.982952117919922,
"epoch": 1.6871246909219357,
"grad_norm": 2.375,
"learning_rate": 0.000471720691845982,
"loss": 5.7506,
"mean_token_accuracy": 0.17130498737096786,
"num_tokens": 35620160.0,
"step": 19105
},
{
"entropy": 6.050418376922607,
"epoch": 1.687566231013776,
"grad_norm": 2.609375,
"learning_rate": 0.00047170540518963114,
"loss": 5.8937,
"mean_token_accuracy": 0.15884621143341066,
"num_tokens": 35630487.0,
"step": 19110
},
{
"entropy": 6.175651502609253,
"epoch": 1.6880077711056165,
"grad_norm": 2.1875,
"learning_rate": 0.0004716901146799333,
"loss": 5.9541,
"mean_token_accuracy": 0.1588866353034973,
"num_tokens": 35641924.0,
"step": 19115
},
{
"entropy": 6.107827281951904,
"epoch": 1.6884493111974568,
"grad_norm": 2.0,
"learning_rate": 0.0004716748203171879,
"loss": 5.749,
"mean_token_accuracy": 0.16873503476381302,
"num_tokens": 35651575.0,
"step": 19120
},
{
"entropy": 6.048054265975952,
"epoch": 1.688890851289297,
"grad_norm": 1.8203125,
"learning_rate": 0.00047165952210169475,
"loss": 5.7268,
"mean_token_accuracy": 0.1725316107273102,
"num_tokens": 35661481.0,
"step": 19125
},
{
"entropy": 5.997692728042603,
"epoch": 1.6893323913811376,
"grad_norm": 1.890625,
"learning_rate": 0.0004716442200337533,
"loss": 5.7503,
"mean_token_accuracy": 0.1712045282125473,
"num_tokens": 35672049.0,
"step": 19130
},
{
"entropy": 6.1034369468688965,
"epoch": 1.6897739314729776,
"grad_norm": 1.515625,
"learning_rate": 0.00047162891411366343,
"loss": 5.7759,
"mean_token_accuracy": 0.1735806480050087,
"num_tokens": 35681653.0,
"step": 19135
},
{
"entropy": 6.098843574523926,
"epoch": 1.690215471564818,
"grad_norm": 2.21875,
"learning_rate": 0.00047161360434172506,
"loss": 5.8364,
"mean_token_accuracy": 0.17449243366718292,
"num_tokens": 35690868.0,
"step": 19140
},
{
"entropy": 6.028947734832764,
"epoch": 1.6906570116566584,
"grad_norm": 1.6953125,
"learning_rate": 0.0004715982907182379,
"loss": 5.7484,
"mean_token_accuracy": 0.17180782556533813,
"num_tokens": 35699062.0,
"step": 19145
},
{
"entropy": 6.054564189910889,
"epoch": 1.6910985517484987,
"grad_norm": 1.859375,
"learning_rate": 0.0004715829732435021,
"loss": 5.8135,
"mean_token_accuracy": 0.16396896690130233,
"num_tokens": 35708411.0,
"step": 19150
},
{
"entropy": 5.999300003051758,
"epoch": 1.6915400918403392,
"grad_norm": 2.203125,
"learning_rate": 0.00047156765191781763,
"loss": 5.7328,
"mean_token_accuracy": 0.17444276809692383,
"num_tokens": 35717937.0,
"step": 19155
},
{
"entropy": 6.050835180282593,
"epoch": 1.6919816319321794,
"grad_norm": 1.7734375,
"learning_rate": 0.00047155232674148465,
"loss": 5.7356,
"mean_token_accuracy": 0.1698319524526596,
"num_tokens": 35727712.0,
"step": 19160
},
{
"entropy": 6.1317931652069095,
"epoch": 1.6924231720240197,
"grad_norm": 1.546875,
"learning_rate": 0.00047153699771480335,
"loss": 5.8387,
"mean_token_accuracy": 0.1679384097456932,
"num_tokens": 35737076.0,
"step": 19165
},
{
"entropy": 6.074211263656617,
"epoch": 1.6928647121158602,
"grad_norm": 1.4375,
"learning_rate": 0.000471521664838074,
"loss": 5.6599,
"mean_token_accuracy": 0.17551683485507966,
"num_tokens": 35746436.0,
"step": 19170
},
{
"entropy": 5.999304676055909,
"epoch": 1.6933062522077005,
"grad_norm": 3.8125,
"learning_rate": 0.0004715063281115971,
"loss": 5.841,
"mean_token_accuracy": 0.17497310638427735,
"num_tokens": 35755786.0,
"step": 19175
},
{
"entropy": 6.057350540161133,
"epoch": 1.6937477922995408,
"grad_norm": 1.671875,
"learning_rate": 0.000471490987535673,
"loss": 5.8188,
"mean_token_accuracy": 0.17085411548614501,
"num_tokens": 35764424.0,
"step": 19180
},
{
"entropy": 6.126542282104492,
"epoch": 1.6941893323913813,
"grad_norm": 1.8515625,
"learning_rate": 0.00047147564311060216,
"loss": 5.7739,
"mean_token_accuracy": 0.17048425525426864,
"num_tokens": 35773792.0,
"step": 19185
},
{
"entropy": 6.025493431091308,
"epoch": 1.6946308724832215,
"grad_norm": 2.3125,
"learning_rate": 0.00047146029483668517,
"loss": 5.7283,
"mean_token_accuracy": 0.1748797357082367,
"num_tokens": 35783285.0,
"step": 19190
},
{
"entropy": 6.048759078979492,
"epoch": 1.6950724125750618,
"grad_norm": 3.25,
"learning_rate": 0.0004714449427142228,
"loss": 5.8636,
"mean_token_accuracy": 0.16319023370742797,
"num_tokens": 35792476.0,
"step": 19195
},
{
"entropy": 6.099813508987427,
"epoch": 1.6955139526669023,
"grad_norm": 2.671875,
"learning_rate": 0.00047142958674351563,
"loss": 5.7707,
"mean_token_accuracy": 0.17993659079074859,
"num_tokens": 35801640.0,
"step": 19200
},
{
"entropy": 6.080488872528076,
"epoch": 1.6959554927587424,
"grad_norm": 1.921875,
"learning_rate": 0.00047141422692486466,
"loss": 5.8094,
"mean_token_accuracy": 0.16995498538017273,
"num_tokens": 35811073.0,
"step": 19205
},
{
"entropy": 6.072859621047973,
"epoch": 1.6963970328505829,
"grad_norm": 1.96875,
"learning_rate": 0.00047139886325857074,
"loss": 5.7618,
"mean_token_accuracy": 0.17807624787092208,
"num_tokens": 35819814.0,
"step": 19210
},
{
"entropy": 6.038554096221924,
"epoch": 1.6968385729424231,
"grad_norm": 2.53125,
"learning_rate": 0.0004713834957449347,
"loss": 5.7259,
"mean_token_accuracy": 0.17250269055366516,
"num_tokens": 35828363.0,
"step": 19215
},
{
"entropy": 6.089145755767822,
"epoch": 1.6972801130342634,
"grad_norm": 2.34375,
"learning_rate": 0.0004713681243842577,
"loss": 5.7061,
"mean_token_accuracy": 0.17492627948522568,
"num_tokens": 35836868.0,
"step": 19220
},
{
"entropy": 6.1022419929504395,
"epoch": 1.697721653126104,
"grad_norm": 2.0625,
"learning_rate": 0.00047135274917684087,
"loss": 5.7947,
"mean_token_accuracy": 0.16571241319179536,
"num_tokens": 35846030.0,
"step": 19225
},
{
"entropy": 6.000464344024659,
"epoch": 1.6981631932179442,
"grad_norm": 2.515625,
"learning_rate": 0.0004713373701229852,
"loss": 5.6658,
"mean_token_accuracy": 0.17886538356542586,
"num_tokens": 35854862.0,
"step": 19230
},
{
"entropy": 6.029366588592529,
"epoch": 1.6986047333097845,
"grad_norm": 2.5,
"learning_rate": 0.0004713219872229923,
"loss": 5.7198,
"mean_token_accuracy": 0.17762991189956664,
"num_tokens": 35864238.0,
"step": 19235
},
{
"entropy": 6.064323663711548,
"epoch": 1.699046273401625,
"grad_norm": 3.0625,
"learning_rate": 0.0004713066004771633,
"loss": 5.7455,
"mean_token_accuracy": 0.17004108279943467,
"num_tokens": 35872542.0,
"step": 19240
},
{
"entropy": 6.088435268402099,
"epoch": 1.6994878134934652,
"grad_norm": 1.7421875,
"learning_rate": 0.00047129120988579953,
"loss": 5.8234,
"mean_token_accuracy": 0.1699926510453224,
"num_tokens": 35881899.0,
"step": 19245
},
{
"entropy": 6.067603302001953,
"epoch": 1.6999293535853055,
"grad_norm": 2.09375,
"learning_rate": 0.00047127581544920263,
"loss": 5.787,
"mean_token_accuracy": 0.1701134294271469,
"num_tokens": 35891970.0,
"step": 19250
},
{
"entropy": 6.026161956787109,
"epoch": 1.700370893677146,
"grad_norm": 1.8515625,
"learning_rate": 0.0004712604171676742,
"loss": 5.7143,
"mean_token_accuracy": 0.16807603985071182,
"num_tokens": 35901286.0,
"step": 19255
},
{
"entropy": 6.048978614807129,
"epoch": 1.7008124337689863,
"grad_norm": 1.8359375,
"learning_rate": 0.00047124501504151574,
"loss": 5.9143,
"mean_token_accuracy": 0.16434314250946044,
"num_tokens": 35912301.0,
"step": 19260
},
{
"entropy": 6.119181728363037,
"epoch": 1.7012539738608266,
"grad_norm": 2.5625,
"learning_rate": 0.00047122960907102906,
"loss": 5.7931,
"mean_token_accuracy": 0.1685246169567108,
"num_tokens": 35920767.0,
"step": 19265
},
{
"entropy": 6.120065498352051,
"epoch": 1.701695513952667,
"grad_norm": 1.96875,
"learning_rate": 0.000471214199256516,
"loss": 5.8538,
"mean_token_accuracy": 0.16903550326824188,
"num_tokens": 35930235.0,
"step": 19270
},
{
"entropy": 6.139681768417359,
"epoch": 1.702137054044507,
"grad_norm": 1.8828125,
"learning_rate": 0.00047119878559827825,
"loss": 5.8083,
"mean_token_accuracy": 0.16708132475614548,
"num_tokens": 35939213.0,
"step": 19275
},
{
"entropy": 6.134250593185425,
"epoch": 1.7025785941363476,
"grad_norm": 1.6328125,
"learning_rate": 0.00047118336809661793,
"loss": 5.871,
"mean_token_accuracy": 0.15915655791759492,
"num_tokens": 35948221.0,
"step": 19280
},
{
"entropy": 6.075332498550415,
"epoch": 1.7030201342281879,
"grad_norm": 2.03125,
"learning_rate": 0.0004711679467518371,
"loss": 5.7825,
"mean_token_accuracy": 0.16543844044208528,
"num_tokens": 35957961.0,
"step": 19285
},
{
"entropy": 6.129464483261108,
"epoch": 1.7034616743200282,
"grad_norm": 1.9921875,
"learning_rate": 0.00047115252156423767,
"loss": 5.8351,
"mean_token_accuracy": 0.16800863891839982,
"num_tokens": 35966742.0,
"step": 19290
},
{
"entropy": 6.148020219802857,
"epoch": 1.7039032144118686,
"grad_norm": 1.9375,
"learning_rate": 0.0004711370925341219,
"loss": 5.7794,
"mean_token_accuracy": 0.1719754159450531,
"num_tokens": 35976312.0,
"step": 19295
},
{
"entropy": 6.0410683155059814,
"epoch": 1.704344754503709,
"grad_norm": 1.875,
"learning_rate": 0.00047112165966179206,
"loss": 5.871,
"mean_token_accuracy": 0.17124896347522736,
"num_tokens": 35985537.0,
"step": 19300
},
{
"entropy": 6.099805212020874,
"epoch": 1.7047862945955492,
"grad_norm": 1.8359375,
"learning_rate": 0.00047110622294755045,
"loss": 5.7838,
"mean_token_accuracy": 0.16365809440612794,
"num_tokens": 35995004.0,
"step": 19305
},
{
"entropy": 6.106558227539063,
"epoch": 1.7052278346873897,
"grad_norm": 1.71875,
"learning_rate": 0.00047109078239169946,
"loss": 5.8021,
"mean_token_accuracy": 0.16805391162633895,
"num_tokens": 36004786.0,
"step": 19310
},
{
"entropy": 5.982954788208008,
"epoch": 1.70566937477923,
"grad_norm": 1.703125,
"learning_rate": 0.0004710753379945415,
"loss": 5.7542,
"mean_token_accuracy": 0.17895455062389373,
"num_tokens": 36014047.0,
"step": 19315
},
{
"entropy": 6.112330913543701,
"epoch": 1.7061109148710702,
"grad_norm": 1.59375,
"learning_rate": 0.00047105988975637927,
"loss": 5.7751,
"mean_token_accuracy": 0.17435785979032517,
"num_tokens": 36022921.0,
"step": 19320
},
{
"entropy": 6.071089553833008,
"epoch": 1.7065524549629107,
"grad_norm": 1.90625,
"learning_rate": 0.0004710444376775153,
"loss": 5.7518,
"mean_token_accuracy": 0.16997675895690917,
"num_tokens": 36032713.0,
"step": 19325
},
{
"entropy": 6.041446924209595,
"epoch": 1.706993995054751,
"grad_norm": 1.7265625,
"learning_rate": 0.00047102898175825224,
"loss": 5.7625,
"mean_token_accuracy": 0.1675780236721039,
"num_tokens": 36041595.0,
"step": 19330
},
{
"entropy": 6.043124628067017,
"epoch": 1.7074355351465913,
"grad_norm": 2.09375,
"learning_rate": 0.00047101352199889295,
"loss": 5.7712,
"mean_token_accuracy": 0.1682361841201782,
"num_tokens": 36051993.0,
"step": 19335
},
{
"entropy": 6.0096855640411375,
"epoch": 1.7078770752384318,
"grad_norm": 2.09375,
"learning_rate": 0.0004709980583997402,
"loss": 5.7794,
"mean_token_accuracy": 0.17545377612113952,
"num_tokens": 36061806.0,
"step": 19340
},
{
"entropy": 6.095308589935303,
"epoch": 1.7083186153302719,
"grad_norm": 2.375,
"learning_rate": 0.000470982590961097,
"loss": 5.8124,
"mean_token_accuracy": 0.17025091499090195,
"num_tokens": 36071390.0,
"step": 19345
},
{
"entropy": 6.079194688796997,
"epoch": 1.7087601554221123,
"grad_norm": 1.4453125,
"learning_rate": 0.00047096711968326626,
"loss": 5.7942,
"mean_token_accuracy": 0.1691606655716896,
"num_tokens": 36080561.0,
"step": 19350
},
{
"entropy": 6.0477183818817135,
"epoch": 1.7092016955139526,
"grad_norm": 1.5,
"learning_rate": 0.0004709516445665512,
"loss": 5.7227,
"mean_token_accuracy": 0.17021686285734178,
"num_tokens": 36089568.0,
"step": 19355
},
{
"entropy": 6.061768245697022,
"epoch": 1.709643235605793,
"grad_norm": 1.3984375,
"learning_rate": 0.0004709361656112547,
"loss": 5.7348,
"mean_token_accuracy": 0.17471609264612198,
"num_tokens": 36098881.0,
"step": 19360
},
{
"entropy": 6.068455505371094,
"epoch": 1.7100847756976334,
"grad_norm": 1.6328125,
"learning_rate": 0.0004709206828176804,
"loss": 5.7591,
"mean_token_accuracy": 0.17398913502693175,
"num_tokens": 36108209.0,
"step": 19365
},
{
"entropy": 5.955290842056274,
"epoch": 1.7105263157894737,
"grad_norm": 2.015625,
"learning_rate": 0.0004709051961861311,
"loss": 5.8007,
"mean_token_accuracy": 0.1713666468858719,
"num_tokens": 36117573.0,
"step": 19370
},
{
"entropy": 6.1124622344970705,
"epoch": 1.710967855881314,
"grad_norm": 1.609375,
"learning_rate": 0.0004708897057169105,
"loss": 5.824,
"mean_token_accuracy": 0.16743251383304597,
"num_tokens": 36127405.0,
"step": 19375
},
{
"entropy": 6.2021260261535645,
"epoch": 1.7114093959731544,
"grad_norm": 1.4140625,
"learning_rate": 0.0004708742114103221,
"loss": 5.8128,
"mean_token_accuracy": 0.16783492714166642,
"num_tokens": 36136148.0,
"step": 19380
},
{
"entropy": 5.997005462646484,
"epoch": 1.7118509360649947,
"grad_norm": 2.453125,
"learning_rate": 0.0004708587132666692,
"loss": 5.7965,
"mean_token_accuracy": 0.1714365914463997,
"num_tokens": 36146164.0,
"step": 19385
},
{
"entropy": 6.086441564559936,
"epoch": 1.712292476156835,
"grad_norm": 3.375,
"learning_rate": 0.00047084321128625545,
"loss": 5.7851,
"mean_token_accuracy": 0.16187313050031663,
"num_tokens": 36155313.0,
"step": 19390
},
{
"entropy": 6.157596588134766,
"epoch": 1.7127340162486755,
"grad_norm": 1.828125,
"learning_rate": 0.00047082770546938457,
"loss": 5.7993,
"mean_token_accuracy": 0.169806170463562,
"num_tokens": 36164902.0,
"step": 19395
},
{
"entropy": 6.10508017539978,
"epoch": 1.7131755563405158,
"grad_norm": 5.4375,
"learning_rate": 0.0004708121958163604,
"loss": 5.8212,
"mean_token_accuracy": 0.17636185884475708,
"num_tokens": 36174128.0,
"step": 19400
},
{
"entropy": 6.094959306716919,
"epoch": 1.713617096432356,
"grad_norm": 1.4375,
"learning_rate": 0.0004707966823274866,
"loss": 5.8613,
"mean_token_accuracy": 0.16184058636426926,
"num_tokens": 36183084.0,
"step": 19405
},
{
"entropy": 6.080106639862061,
"epoch": 1.7140586365241965,
"grad_norm": 2.078125,
"learning_rate": 0.00047078116500306723,
"loss": 5.7984,
"mean_token_accuracy": 0.17234787493944168,
"num_tokens": 36191650.0,
"step": 19410
},
{
"entropy": 6.141648435592652,
"epoch": 1.7145001766160366,
"grad_norm": 1.640625,
"learning_rate": 0.00047076564384340616,
"loss": 5.7957,
"mean_token_accuracy": 0.164674574136734,
"num_tokens": 36200712.0,
"step": 19415
},
{
"entropy": 6.063075876235962,
"epoch": 1.714941716707877,
"grad_norm": 1.6484375,
"learning_rate": 0.0004707501188488074,
"loss": 5.7697,
"mean_token_accuracy": 0.17197774350643158,
"num_tokens": 36209347.0,
"step": 19420
},
{
"entropy": 6.057208681106568,
"epoch": 1.7153832567997174,
"grad_norm": 2.4375,
"learning_rate": 0.00047073459001957524,
"loss": 5.7955,
"mean_token_accuracy": 0.16471873819828034,
"num_tokens": 36218233.0,
"step": 19425
},
{
"entropy": 6.123676013946533,
"epoch": 1.7158247968915576,
"grad_norm": 2.015625,
"learning_rate": 0.0004707190573560137,
"loss": 5.8046,
"mean_token_accuracy": 0.17091604322195053,
"num_tokens": 36227627.0,
"step": 19430
},
{
"entropy": 6.03953914642334,
"epoch": 1.7162663369833981,
"grad_norm": 2.0,
"learning_rate": 0.0004707035208584272,
"loss": 5.7752,
"mean_token_accuracy": 0.1732946053147316,
"num_tokens": 36236298.0,
"step": 19435
},
{
"entropy": 6.04589147567749,
"epoch": 1.7167078770752384,
"grad_norm": 1.9765625,
"learning_rate": 0.00047068798052711996,
"loss": 5.837,
"mean_token_accuracy": 0.17089489847421646,
"num_tokens": 36245623.0,
"step": 19440
},
{
"entropy": 6.053891706466675,
"epoch": 1.7171494171670787,
"grad_norm": 1.859375,
"learning_rate": 0.0004706724363623965,
"loss": 5.7247,
"mean_token_accuracy": 0.1815813347697258,
"num_tokens": 36255117.0,
"step": 19445
},
{
"entropy": 6.067101049423218,
"epoch": 1.7175909572589192,
"grad_norm": 2.09375,
"learning_rate": 0.00047065688836456134,
"loss": 5.7628,
"mean_token_accuracy": 0.17552953511476516,
"num_tokens": 36264535.0,
"step": 19450
},
{
"entropy": 6.0742494583129885,
"epoch": 1.7180324973507595,
"grad_norm": 2.125,
"learning_rate": 0.00047064133653391895,
"loss": 5.81,
"mean_token_accuracy": 0.16701480150222778,
"num_tokens": 36274432.0,
"step": 19455
},
{
"entropy": 6.014123821258545,
"epoch": 1.7184740374425997,
"grad_norm": 2.140625,
"learning_rate": 0.0004706257808707741,
"loss": 5.6867,
"mean_token_accuracy": 0.18044215589761733,
"num_tokens": 36282644.0,
"step": 19460
},
{
"entropy": 5.968777656555176,
"epoch": 1.7189155775344402,
"grad_norm": 2.1875,
"learning_rate": 0.00047061022137543144,
"loss": 5.758,
"mean_token_accuracy": 0.17538274228572845,
"num_tokens": 36290885.0,
"step": 19465
},
{
"entropy": 6.075881433486939,
"epoch": 1.7193571176262805,
"grad_norm": 1.40625,
"learning_rate": 0.00047059465804819576,
"loss": 5.8664,
"mean_token_accuracy": 0.1692483440041542,
"num_tokens": 36299477.0,
"step": 19470
},
{
"entropy": 6.074257040023804,
"epoch": 1.7197986577181208,
"grad_norm": 2.296875,
"learning_rate": 0.0004705790908893721,
"loss": 5.8522,
"mean_token_accuracy": 0.16889972984790802,
"num_tokens": 36309638.0,
"step": 19475
},
{
"entropy": 6.1508152961730955,
"epoch": 1.7202401978099613,
"grad_norm": 1.6875,
"learning_rate": 0.0004705635198992651,
"loss": 5.8861,
"mean_token_accuracy": 0.1685089275240898,
"num_tokens": 36319027.0,
"step": 19480
},
{
"entropy": 6.07422776222229,
"epoch": 1.7206817379018013,
"grad_norm": 1.8515625,
"learning_rate": 0.00047054794507818,
"loss": 5.7354,
"mean_token_accuracy": 0.1672875016927719,
"num_tokens": 36327936.0,
"step": 19485
},
{
"entropy": 6.107432842254639,
"epoch": 1.7211232779936418,
"grad_norm": 2.03125,
"learning_rate": 0.00047053236642642193,
"loss": 5.9253,
"mean_token_accuracy": 0.167560213804245,
"num_tokens": 36337162.0,
"step": 19490
},
{
"entropy": 6.1030020236969,
"epoch": 1.7215648180854821,
"grad_norm": 3.484375,
"learning_rate": 0.000470516783944296,
"loss": 5.7608,
"mean_token_accuracy": 0.17628691643476485,
"num_tokens": 36345587.0,
"step": 19495
},
{
"entropy": 6.108232545852661,
"epoch": 1.7220063581773224,
"grad_norm": 2.578125,
"learning_rate": 0.00047050119763210747,
"loss": 5.8411,
"mean_token_accuracy": 0.1675175666809082,
"num_tokens": 36354536.0,
"step": 19500
},
{
"entropy": 6.074399185180664,
"epoch": 1.722447898269163,
"grad_norm": 1.484375,
"learning_rate": 0.00047048560749016167,
"loss": 5.8601,
"mean_token_accuracy": 0.16411691755056382,
"num_tokens": 36363691.0,
"step": 19505
},
{
"entropy": 6.180702114105225,
"epoch": 1.7228894383610032,
"grad_norm": 2.671875,
"learning_rate": 0.00047047001351876403,
"loss": 5.9163,
"mean_token_accuracy": 0.1608528807759285,
"num_tokens": 36373898.0,
"step": 19510
},
{
"entropy": 6.1392998695373535,
"epoch": 1.7233309784528434,
"grad_norm": 1.9609375,
"learning_rate": 0.0004704544157182199,
"loss": 5.9162,
"mean_token_accuracy": 0.1611167460680008,
"num_tokens": 36384345.0,
"step": 19515
},
{
"entropy": 6.096267461776733,
"epoch": 1.723772518544684,
"grad_norm": 2.296875,
"learning_rate": 0.00047043881408883497,
"loss": 5.7797,
"mean_token_accuracy": 0.17723738849163057,
"num_tokens": 36393021.0,
"step": 19520
},
{
"entropy": 6.095131683349609,
"epoch": 1.7242140586365242,
"grad_norm": 1.7265625,
"learning_rate": 0.0004704232086309148,
"loss": 5.7854,
"mean_token_accuracy": 0.1657282754778862,
"num_tokens": 36402729.0,
"step": 19525
},
{
"entropy": 6.008803224563598,
"epoch": 1.7246555987283645,
"grad_norm": 2.875,
"learning_rate": 0.00047040759934476517,
"loss": 5.7212,
"mean_token_accuracy": 0.17646822482347488,
"num_tokens": 36412360.0,
"step": 19530
},
{
"entropy": 6.058895206451416,
"epoch": 1.725097138820205,
"grad_norm": 1.484375,
"learning_rate": 0.0004703919862306918,
"loss": 5.7247,
"mean_token_accuracy": 0.17433257699012755,
"num_tokens": 36420245.0,
"step": 19535
},
{
"entropy": 6.021845960617066,
"epoch": 1.7255386789120453,
"grad_norm": 2.0625,
"learning_rate": 0.0004703763692890006,
"loss": 5.6949,
"mean_token_accuracy": 0.1787973240017891,
"num_tokens": 36428758.0,
"step": 19540
},
{
"entropy": 6.028947448730468,
"epoch": 1.7259802190038855,
"grad_norm": 2.359375,
"learning_rate": 0.0004703607485199973,
"loss": 5.7689,
"mean_token_accuracy": 0.1744147077202797,
"num_tokens": 36437883.0,
"step": 19545
},
{
"entropy": 6.065730857849121,
"epoch": 1.726421759095726,
"grad_norm": 1.9765625,
"learning_rate": 0.00047034512392398815,
"loss": 5.796,
"mean_token_accuracy": 0.16888695657253266,
"num_tokens": 36447950.0,
"step": 19550
},
{
"entropy": 6.1385571479797365,
"epoch": 1.726863299187566,
"grad_norm": 1.4453125,
"learning_rate": 0.0004703294955012791,
"loss": 5.8303,
"mean_token_accuracy": 0.1661466121673584,
"num_tokens": 36456993.0,
"step": 19555
},
{
"entropy": 6.130035877227783,
"epoch": 1.7273048392794066,
"grad_norm": 2.109375,
"learning_rate": 0.0004703138632521762,
"loss": 5.8896,
"mean_token_accuracy": 0.16248778402805328,
"num_tokens": 36465942.0,
"step": 19560
},
{
"entropy": 6.056070280075073,
"epoch": 1.7277463793712469,
"grad_norm": 1.8359375,
"learning_rate": 0.000470298227176986,
"loss": 5.8485,
"mean_token_accuracy": 0.1744128242135048,
"num_tokens": 36474906.0,
"step": 19565
},
{
"entropy": 6.142373085021973,
"epoch": 1.7281879194630871,
"grad_norm": 1.7890625,
"learning_rate": 0.0004702825872760145,
"loss": 5.7686,
"mean_token_accuracy": 0.17025264203548432,
"num_tokens": 36483579.0,
"step": 19570
},
{
"entropy": 6.0351659774780275,
"epoch": 1.7286294595549276,
"grad_norm": 1.8359375,
"learning_rate": 0.0004702669435495681,
"loss": 5.7888,
"mean_token_accuracy": 0.17417503744363785,
"num_tokens": 36492541.0,
"step": 19575
},
{
"entropy": 6.152001571655274,
"epoch": 1.729070999646768,
"grad_norm": 1.8671875,
"learning_rate": 0.0004702512959979535,
"loss": 5.9277,
"mean_token_accuracy": 0.16263921558856964,
"num_tokens": 36502833.0,
"step": 19580
},
{
"entropy": 6.086148881912232,
"epoch": 1.7295125397386082,
"grad_norm": 3.28125,
"learning_rate": 0.00047023564462147697,
"loss": 5.8016,
"mean_token_accuracy": 0.17142287641763687,
"num_tokens": 36513091.0,
"step": 19585
},
{
"entropy": 6.060443878173828,
"epoch": 1.7299540798304487,
"grad_norm": 1.9140625,
"learning_rate": 0.00047021998942044517,
"loss": 5.8015,
"mean_token_accuracy": 0.17301201522350312,
"num_tokens": 36522911.0,
"step": 19590
},
{
"entropy": 6.1979358196258545,
"epoch": 1.730395619922289,
"grad_norm": 1.9609375,
"learning_rate": 0.00047020433039516484,
"loss": 5.866,
"mean_token_accuracy": 0.1664494290947914,
"num_tokens": 36531934.0,
"step": 19595
},
{
"entropy": 6.098582363128662,
"epoch": 1.7308371600141292,
"grad_norm": 3.40625,
"learning_rate": 0.0004701886675459427,
"loss": 5.7962,
"mean_token_accuracy": 0.17130719274282455,
"num_tokens": 36541823.0,
"step": 19600
},
{
"entropy": 6.091652822494507,
"epoch": 1.7312787001059697,
"grad_norm": 3.890625,
"learning_rate": 0.00047017300087308557,
"loss": 5.8797,
"mean_token_accuracy": 0.164170478284359,
"num_tokens": 36550954.0,
"step": 19605
},
{
"entropy": 6.035649061203003,
"epoch": 1.73172024019781,
"grad_norm": 1.9296875,
"learning_rate": 0.0004701573303769004,
"loss": 5.7628,
"mean_token_accuracy": 0.17078467607498168,
"num_tokens": 36560689.0,
"step": 19610
},
{
"entropy": 6.0269369125366214,
"epoch": 1.7321617802896503,
"grad_norm": 2.09375,
"learning_rate": 0.000470141656057694,
"loss": 5.7471,
"mean_token_accuracy": 0.17326179146766663,
"num_tokens": 36569587.0,
"step": 19615
},
{
"entropy": 6.079845571517945,
"epoch": 1.7326033203814908,
"grad_norm": 1.7109375,
"learning_rate": 0.00047012597791577364,
"loss": 5.796,
"mean_token_accuracy": 0.17424626499414445,
"num_tokens": 36579609.0,
"step": 19620
},
{
"entropy": 6.058219575881958,
"epoch": 1.7330448604733308,
"grad_norm": 3.34375,
"learning_rate": 0.0004701102959514463,
"loss": 5.7996,
"mean_token_accuracy": 0.1681429475545883,
"num_tokens": 36589685.0,
"step": 19625
},
{
"entropy": 6.058171081542969,
"epoch": 1.7334864005651713,
"grad_norm": 1.734375,
"learning_rate": 0.00047009461016501926,
"loss": 5.7604,
"mean_token_accuracy": 0.17124909460544585,
"num_tokens": 36598225.0,
"step": 19630
},
{
"entropy": 5.944314098358154,
"epoch": 1.7339279406570116,
"grad_norm": 1.4296875,
"learning_rate": 0.00047007892055679976,
"loss": 5.7015,
"mean_token_accuracy": 0.17935410290956497,
"num_tokens": 36607481.0,
"step": 19635
},
{
"entropy": 6.078158569335938,
"epoch": 1.7343694807488519,
"grad_norm": 1.6796875,
"learning_rate": 0.00047006322712709513,
"loss": 5.7884,
"mean_token_accuracy": 0.1710321992635727,
"num_tokens": 36616707.0,
"step": 19640
},
{
"entropy": 6.153675365447998,
"epoch": 1.7348110208406924,
"grad_norm": 1.625,
"learning_rate": 0.00047004752987621286,
"loss": 5.9198,
"mean_token_accuracy": 0.16569444835186004,
"num_tokens": 36626290.0,
"step": 19645
},
{
"entropy": 6.041921186447143,
"epoch": 1.7352525609325327,
"grad_norm": 2.390625,
"learning_rate": 0.0004700318288044603,
"loss": 5.8092,
"mean_token_accuracy": 0.17458787560462952,
"num_tokens": 36635155.0,
"step": 19650
},
{
"entropy": 6.025612497329712,
"epoch": 1.735694101024373,
"grad_norm": 1.84375,
"learning_rate": 0.00047001612391214527,
"loss": 5.7839,
"mean_token_accuracy": 0.17991275787353517,
"num_tokens": 36644632.0,
"step": 19655
},
{
"entropy": 6.089979743957519,
"epoch": 1.7361356411162134,
"grad_norm": 2.421875,
"learning_rate": 0.0004700004151995753,
"loss": 5.8276,
"mean_token_accuracy": 0.16504472643136978,
"num_tokens": 36654818.0,
"step": 19660
},
{
"entropy": 6.02713098526001,
"epoch": 1.7365771812080537,
"grad_norm": 1.75,
"learning_rate": 0.00046998470266705795,
"loss": 5.6847,
"mean_token_accuracy": 0.18014358282089232,
"num_tokens": 36664149.0,
"step": 19665
},
{
"entropy": 6.06798996925354,
"epoch": 1.737018721299894,
"grad_norm": 2.046875,
"learning_rate": 0.00046996898631490125,
"loss": 5.7338,
"mean_token_accuracy": 0.17727601677179336,
"num_tokens": 36673447.0,
"step": 19670
},
{
"entropy": 6.1750916004180905,
"epoch": 1.7374602613917345,
"grad_norm": 2.203125,
"learning_rate": 0.000469953266143413,
"loss": 5.9271,
"mean_token_accuracy": 0.15886940956115722,
"num_tokens": 36683426.0,
"step": 19675
},
{
"entropy": 6.165144348144532,
"epoch": 1.7379018014835748,
"grad_norm": 1.671875,
"learning_rate": 0.00046993754215290116,
"loss": 5.8127,
"mean_token_accuracy": 0.1706448331475258,
"num_tokens": 36692708.0,
"step": 19680
},
{
"entropy": 5.978824615478516,
"epoch": 1.738343341575415,
"grad_norm": 1.46875,
"learning_rate": 0.0004699218143436737,
"loss": 5.714,
"mean_token_accuracy": 0.1758846864104271,
"num_tokens": 36701527.0,
"step": 19685
},
{
"entropy": 6.075031566619873,
"epoch": 1.7387848816672555,
"grad_norm": 1.8125,
"learning_rate": 0.00046990608271603874,
"loss": 5.8764,
"mean_token_accuracy": 0.1686911776661873,
"num_tokens": 36711458.0,
"step": 19690
},
{
"entropy": 6.071360874176025,
"epoch": 1.7392264217590956,
"grad_norm": 2.984375,
"learning_rate": 0.0004698903472703045,
"loss": 5.773,
"mean_token_accuracy": 0.17156640738248824,
"num_tokens": 36721260.0,
"step": 19695
},
{
"entropy": 6.102495241165161,
"epoch": 1.739667961850936,
"grad_norm": 1.78125,
"learning_rate": 0.00046987460800677915,
"loss": 5.7731,
"mean_token_accuracy": 0.17895008772611617,
"num_tokens": 36730496.0,
"step": 19700
},
{
"entropy": 6.102282762527466,
"epoch": 1.7401095019427764,
"grad_norm": 1.921875,
"learning_rate": 0.00046985886492577106,
"loss": 5.7752,
"mean_token_accuracy": 0.16985697746276857,
"num_tokens": 36739016.0,
"step": 19705
},
{
"entropy": 6.133660411834716,
"epoch": 1.7405510420346166,
"grad_norm": 1.8203125,
"learning_rate": 0.0004698431180275887,
"loss": 5.8621,
"mean_token_accuracy": 0.1617666557431221,
"num_tokens": 36748259.0,
"step": 19710
},
{
"entropy": 6.204999303817749,
"epoch": 1.7409925821264571,
"grad_norm": 2.0625,
"learning_rate": 0.00046982736731254044,
"loss": 5.9118,
"mean_token_accuracy": 0.16715384721755983,
"num_tokens": 36758174.0,
"step": 19715
},
{
"entropy": 6.077083683013916,
"epoch": 1.7414341222182974,
"grad_norm": 1.6953125,
"learning_rate": 0.00046981161278093487,
"loss": 5.8574,
"mean_token_accuracy": 0.1721796825528145,
"num_tokens": 36767286.0,
"step": 19720
},
{
"entropy": 6.071274185180664,
"epoch": 1.7418756623101377,
"grad_norm": 1.8984375,
"learning_rate": 0.00046979585443308056,
"loss": 5.6917,
"mean_token_accuracy": 0.17723647356033326,
"num_tokens": 36775818.0,
"step": 19725
},
{
"entropy": 6.10238242149353,
"epoch": 1.7423172024019782,
"grad_norm": 1.8671875,
"learning_rate": 0.00046978009226928633,
"loss": 5.8033,
"mean_token_accuracy": 0.17100051045417786,
"num_tokens": 36785489.0,
"step": 19730
},
{
"entropy": 6.056038665771484,
"epoch": 1.7427587424938185,
"grad_norm": 3.390625,
"learning_rate": 0.0004697643262898608,
"loss": 5.7706,
"mean_token_accuracy": 0.17351435571908952,
"num_tokens": 36794241.0,
"step": 19735
},
{
"entropy": 6.0363646984100345,
"epoch": 1.7432002825856587,
"grad_norm": 1.9921875,
"learning_rate": 0.0004697485564951128,
"loss": 5.7985,
"mean_token_accuracy": 0.16549391001462938,
"num_tokens": 36803477.0,
"step": 19740
},
{
"entropy": 6.062912130355835,
"epoch": 1.7436418226774992,
"grad_norm": 2.15625,
"learning_rate": 0.0004697327828853515,
"loss": 5.7806,
"mean_token_accuracy": 0.16378590315580369,
"num_tokens": 36811974.0,
"step": 19745
},
{
"entropy": 6.156734895706177,
"epoch": 1.7440833627693395,
"grad_norm": 3.109375,
"learning_rate": 0.0004697170054608857,
"loss": 5.8922,
"mean_token_accuracy": 0.1605678379535675,
"num_tokens": 36822049.0,
"step": 19750
},
{
"entropy": 6.091805696487427,
"epoch": 1.7445249028611798,
"grad_norm": 2.71875,
"learning_rate": 0.0004697012242220245,
"loss": 5.8012,
"mean_token_accuracy": 0.17168796062469482,
"num_tokens": 36831989.0,
"step": 19755
},
{
"entropy": 6.091763973236084,
"epoch": 1.7449664429530203,
"grad_norm": 2.71875,
"learning_rate": 0.00046968543916907704,
"loss": 5.8333,
"mean_token_accuracy": 0.15905457735061646,
"num_tokens": 36841141.0,
"step": 19760
},
{
"entropy": 6.058210754394532,
"epoch": 1.7454079830448603,
"grad_norm": 2.03125,
"learning_rate": 0.00046966965030235253,
"loss": 5.6936,
"mean_token_accuracy": 0.17946523129940034,
"num_tokens": 36850101.0,
"step": 19765
},
{
"entropy": 6.1046586513519285,
"epoch": 1.7458495231367008,
"grad_norm": 2.265625,
"learning_rate": 0.00046965385762216024,
"loss": 5.8154,
"mean_token_accuracy": 0.17623028308153152,
"num_tokens": 36859234.0,
"step": 19770
},
{
"entropy": 6.143148136138916,
"epoch": 1.746291063228541,
"grad_norm": 2.109375,
"learning_rate": 0.0004696380611288096,
"loss": 5.8771,
"mean_token_accuracy": 0.16906866431236267,
"num_tokens": 36868937.0,
"step": 19775
},
{
"entropy": 6.035987091064453,
"epoch": 1.7467326033203814,
"grad_norm": 1.671875,
"learning_rate": 0.00046962226082261014,
"loss": 5.7203,
"mean_token_accuracy": 0.17461095601320267,
"num_tokens": 36878380.0,
"step": 19780
},
{
"entropy": 6.031628799438477,
"epoch": 1.7471741434122219,
"grad_norm": 1.6640625,
"learning_rate": 0.0004696064567038712,
"loss": 5.8276,
"mean_token_accuracy": 0.17206415683031082,
"num_tokens": 36887702.0,
"step": 19785
},
{
"entropy": 6.080829858779907,
"epoch": 1.7476156835040622,
"grad_norm": 2.125,
"learning_rate": 0.00046959064877290246,
"loss": 5.7108,
"mean_token_accuracy": 0.1814768433570862,
"num_tokens": 36896777.0,
"step": 19790
},
{
"entropy": 6.146916770935059,
"epoch": 1.7480572235959024,
"grad_norm": 2.28125,
"learning_rate": 0.00046957483703001366,
"loss": 5.7384,
"mean_token_accuracy": 0.1765810415148735,
"num_tokens": 36905256.0,
"step": 19795
},
{
"entropy": 6.004207468032837,
"epoch": 1.748498763687743,
"grad_norm": 1.9609375,
"learning_rate": 0.0004695590214755143,
"loss": 5.7428,
"mean_token_accuracy": 0.17250597327947617,
"num_tokens": 36913767.0,
"step": 19800
},
{
"entropy": 5.958636379241943,
"epoch": 1.7489403037795832,
"grad_norm": 2.625,
"learning_rate": 0.00046954320210971444,
"loss": 5.7523,
"mean_token_accuracy": 0.17745240777730942,
"num_tokens": 36922838.0,
"step": 19805
},
{
"entropy": 5.975859880447388,
"epoch": 1.7493818438714235,
"grad_norm": 2.203125,
"learning_rate": 0.00046952737893292396,
"loss": 5.6722,
"mean_token_accuracy": 0.1765366017818451,
"num_tokens": 36931955.0,
"step": 19810
},
{
"entropy": 6.037152242660523,
"epoch": 1.749823383963264,
"grad_norm": 1.8671875,
"learning_rate": 0.00046951155194545265,
"loss": 5.7299,
"mean_token_accuracy": 0.17689269334077834,
"num_tokens": 36941505.0,
"step": 19815
},
{
"entropy": 6.066903495788575,
"epoch": 1.7502649240551043,
"grad_norm": 1.5234375,
"learning_rate": 0.00046949572114761076,
"loss": 5.8257,
"mean_token_accuracy": 0.16107863783836365,
"num_tokens": 36951007.0,
"step": 19820
},
{
"entropy": 6.1251458644866945,
"epoch": 1.7507064641469445,
"grad_norm": 2.953125,
"learning_rate": 0.00046947988653970826,
"loss": 5.8007,
"mean_token_accuracy": 0.17618153989315033,
"num_tokens": 36961111.0,
"step": 19825
},
{
"entropy": 6.077570295333862,
"epoch": 1.751148004238785,
"grad_norm": 3.25,
"learning_rate": 0.0004694640481220554,
"loss": 5.8144,
"mean_token_accuracy": 0.1726420998573303,
"num_tokens": 36969605.0,
"step": 19830
},
{
"entropy": 6.11095290184021,
"epoch": 1.751589544330625,
"grad_norm": 2.046875,
"learning_rate": 0.0004694482058949624,
"loss": 5.7985,
"mean_token_accuracy": 0.16656336486339568,
"num_tokens": 36979051.0,
"step": 19835
},
{
"entropy": 6.027563953399659,
"epoch": 1.7520310844224656,
"grad_norm": 2.25,
"learning_rate": 0.00046943235985873975,
"loss": 5.7555,
"mean_token_accuracy": 0.17334649115800857,
"num_tokens": 36988807.0,
"step": 19840
},
{
"entropy": 6.023442888259888,
"epoch": 1.7524726245143059,
"grad_norm": 1.71875,
"learning_rate": 0.0004694165100136976,
"loss": 5.6709,
"mean_token_accuracy": 0.1824701562523842,
"num_tokens": 36997813.0,
"step": 19845
},
{
"entropy": 6.078595113754273,
"epoch": 1.7529141646061461,
"grad_norm": 3.90625,
"learning_rate": 0.00046940065636014665,
"loss": 5.7665,
"mean_token_accuracy": 0.17132644057273866,
"num_tokens": 37007849.0,
"step": 19850
},
{
"entropy": 6.026017665863037,
"epoch": 1.7533557046979866,
"grad_norm": 2.1875,
"learning_rate": 0.0004693847988983974,
"loss": 5.6672,
"mean_token_accuracy": 0.1880197659134865,
"num_tokens": 37016109.0,
"step": 19855
},
{
"entropy": 6.0669224739074705,
"epoch": 1.753797244789827,
"grad_norm": 2.46875,
"learning_rate": 0.0004693689376287605,
"loss": 5.7724,
"mean_token_accuracy": 0.16940202862024306,
"num_tokens": 37025156.0,
"step": 19860
},
{
"entropy": 6.1347400665283205,
"epoch": 1.7542387848816672,
"grad_norm": 1.5703125,
"learning_rate": 0.00046935307255154663,
"loss": 5.9047,
"mean_token_accuracy": 0.16363099366426467,
"num_tokens": 37035361.0,
"step": 19865
},
{
"entropy": 6.127477073669434,
"epoch": 1.7546803249735077,
"grad_norm": 2.296875,
"learning_rate": 0.0004693372036670667,
"loss": 5.8226,
"mean_token_accuracy": 0.16489195972681045,
"num_tokens": 37045249.0,
"step": 19870
},
{
"entropy": 6.143105363845825,
"epoch": 1.755121865065348,
"grad_norm": 1.84375,
"learning_rate": 0.00046932133097563137,
"loss": 5.8079,
"mean_token_accuracy": 0.17681962251663208,
"num_tokens": 37054637.0,
"step": 19875
},
{
"entropy": 6.068358898162842,
"epoch": 1.7555634051571882,
"grad_norm": 2.203125,
"learning_rate": 0.00046930545447755167,
"loss": 5.8172,
"mean_token_accuracy": 0.17301732003688813,
"num_tokens": 37064557.0,
"step": 19880
},
{
"entropy": 6.052277088165283,
"epoch": 1.7560049452490287,
"grad_norm": 2.125,
"learning_rate": 0.0004692895741731387,
"loss": 5.8376,
"mean_token_accuracy": 0.16504202485084535,
"num_tokens": 37073915.0,
"step": 19885
},
{
"entropy": 6.161046934127808,
"epoch": 1.756446485340869,
"grad_norm": 8.625,
"learning_rate": 0.0004692736900627034,
"loss": 5.8043,
"mean_token_accuracy": 0.17168434709310532,
"num_tokens": 37083008.0,
"step": 19890
},
{
"entropy": 6.145743274688721,
"epoch": 1.7568880254327093,
"grad_norm": 2.125,
"learning_rate": 0.00046925780214655713,
"loss": 5.8366,
"mean_token_accuracy": 0.16594296395778657,
"num_tokens": 37092742.0,
"step": 19895
},
{
"entropy": 6.108018493652343,
"epoch": 1.7573295655245498,
"grad_norm": 1.671875,
"learning_rate": 0.0004692419104250108,
"loss": 5.844,
"mean_token_accuracy": 0.16371577382087707,
"num_tokens": 37102242.0,
"step": 19900
},
{
"entropy": 6.100498390197754,
"epoch": 1.7577711056163898,
"grad_norm": 2.0625,
"learning_rate": 0.0004692260148983761,
"loss": 5.7687,
"mean_token_accuracy": 0.1802005499601364,
"num_tokens": 37111304.0,
"step": 19905
},
{
"entropy": 6.085822248458863,
"epoch": 1.7582126457082303,
"grad_norm": 1.84375,
"learning_rate": 0.0004692101155669641,
"loss": 5.7984,
"mean_token_accuracy": 0.17450565099716187,
"num_tokens": 37121420.0,
"step": 19910
},
{
"entropy": 6.101216602325439,
"epoch": 1.7586541858000706,
"grad_norm": 2.4375,
"learning_rate": 0.0004691942124310865,
"loss": 5.8213,
"mean_token_accuracy": 0.17218375205993652,
"num_tokens": 37131265.0,
"step": 19915
},
{
"entropy": 6.034389781951904,
"epoch": 1.7590957258919109,
"grad_norm": 1.7578125,
"learning_rate": 0.00046917830549105465,
"loss": 5.7282,
"mean_token_accuracy": 0.17250965386629105,
"num_tokens": 37141097.0,
"step": 19920
},
{
"entropy": 5.9802587032318115,
"epoch": 1.7595372659837514,
"grad_norm": 1.7265625,
"learning_rate": 0.0004691623947471803,
"loss": 5.6388,
"mean_token_accuracy": 0.18620399832725526,
"num_tokens": 37149687.0,
"step": 19925
},
{
"entropy": 6.09821572303772,
"epoch": 1.7599788060755917,
"grad_norm": 3.109375,
"learning_rate": 0.00046914648019977495,
"loss": 5.7597,
"mean_token_accuracy": 0.17996918857097627,
"num_tokens": 37159219.0,
"step": 19930
},
{
"entropy": 6.046886825561524,
"epoch": 1.760420346167432,
"grad_norm": 3.375,
"learning_rate": 0.00046913056184915054,
"loss": 5.7846,
"mean_token_accuracy": 0.17437225133180617,
"num_tokens": 37168681.0,
"step": 19935
},
{
"entropy": 5.939222574234009,
"epoch": 1.7608618862592724,
"grad_norm": 1.75,
"learning_rate": 0.0004691146396956188,
"loss": 5.6784,
"mean_token_accuracy": 0.17999475747346877,
"num_tokens": 37177932.0,
"step": 19940
},
{
"entropy": 6.010435247421265,
"epoch": 1.7613034263511127,
"grad_norm": 1.6328125,
"learning_rate": 0.0004690987137394917,
"loss": 5.6993,
"mean_token_accuracy": 0.17055750787258148,
"num_tokens": 37186783.0,
"step": 19945
},
{
"entropy": 6.079902696609497,
"epoch": 1.761744966442953,
"grad_norm": 2.546875,
"learning_rate": 0.0004690827839810812,
"loss": 5.8733,
"mean_token_accuracy": 0.16319728642702103,
"num_tokens": 37196290.0,
"step": 19950
},
{
"entropy": 6.119852304458618,
"epoch": 1.7621865065347935,
"grad_norm": 1.7890625,
"learning_rate": 0.00046906685042069927,
"loss": 5.731,
"mean_token_accuracy": 0.17258627116680145,
"num_tokens": 37205057.0,
"step": 19955
},
{
"entropy": 6.156963300704956,
"epoch": 1.7626280466266337,
"grad_norm": 2.296875,
"learning_rate": 0.0004690509130586582,
"loss": 5.8051,
"mean_token_accuracy": 0.1679999753832817,
"num_tokens": 37214078.0,
"step": 19960
},
{
"entropy": 6.030363368988037,
"epoch": 1.763069586718474,
"grad_norm": 3.9375,
"learning_rate": 0.00046903497189527006,
"loss": 5.7512,
"mean_token_accuracy": 0.1741851344704628,
"num_tokens": 37223232.0,
"step": 19965
},
{
"entropy": 6.014946508407593,
"epoch": 1.7635111268103145,
"grad_norm": 2.03125,
"learning_rate": 0.0004690190269308472,
"loss": 5.7578,
"mean_token_accuracy": 0.1778167098760605,
"num_tokens": 37232054.0,
"step": 19970
},
{
"entropy": 6.036854839324951,
"epoch": 1.7639526669021546,
"grad_norm": 1.96875,
"learning_rate": 0.0004690030781657019,
"loss": 5.716,
"mean_token_accuracy": 0.17673872262239457,
"num_tokens": 37241451.0,
"step": 19975
},
{
"entropy": 6.084426546096802,
"epoch": 1.764394206993995,
"grad_norm": 1.734375,
"learning_rate": 0.0004689871256001467,
"loss": 5.759,
"mean_token_accuracy": 0.1728297919034958,
"num_tokens": 37251029.0,
"step": 19980
},
{
"entropy": 6.013486671447754,
"epoch": 1.7648357470858353,
"grad_norm": 2.0625,
"learning_rate": 0.00046897116923449403,
"loss": 5.7792,
"mean_token_accuracy": 0.16986684501171112,
"num_tokens": 37259594.0,
"step": 19985
},
{
"entropy": 6.042197275161743,
"epoch": 1.7652772871776756,
"grad_norm": 6.40625,
"learning_rate": 0.00046895520906905635,
"loss": 5.711,
"mean_token_accuracy": 0.17325318306684495,
"num_tokens": 37268824.0,
"step": 19990
},
{
"entropy": 6.0927040576934814,
"epoch": 1.7657188272695161,
"grad_norm": 1.71875,
"learning_rate": 0.00046893924510414654,
"loss": 5.7338,
"mean_token_accuracy": 0.17374078333377838,
"num_tokens": 37278494.0,
"step": 19995
},
{
"entropy": 5.905918979644776,
"epoch": 1.7661603673613564,
"grad_norm": 2.78125,
"learning_rate": 0.0004689232773400772,
"loss": 5.582,
"mean_token_accuracy": 0.19275630563497542,
"num_tokens": 37287648.0,
"step": 20000
},
{
"entropy": 6.061917686462403,
"epoch": 1.7666019074531967,
"grad_norm": 1.890625,
"learning_rate": 0.0004689073057771611,
"loss": 5.7357,
"mean_token_accuracy": 0.17465366721153258,
"num_tokens": 37295938.0,
"step": 20005
},
{
"entropy": 6.0040833950042725,
"epoch": 1.7670434475450372,
"grad_norm": 3.734375,
"learning_rate": 0.00046889133041571126,
"loss": 5.7327,
"mean_token_accuracy": 0.17675487995147704,
"num_tokens": 37305097.0,
"step": 20010
},
{
"entropy": 6.0217187881469725,
"epoch": 1.7674849876368774,
"grad_norm": 1.7265625,
"learning_rate": 0.0004688753512560405,
"loss": 5.7787,
"mean_token_accuracy": 0.17717198729515077,
"num_tokens": 37313672.0,
"step": 20015
},
{
"entropy": 6.102943086624146,
"epoch": 1.7679265277287177,
"grad_norm": 2.46875,
"learning_rate": 0.0004688593682984619,
"loss": 5.8472,
"mean_token_accuracy": 0.1683364138007164,
"num_tokens": 37323342.0,
"step": 20020
},
{
"entropy": 6.132528400421142,
"epoch": 1.7683680678205582,
"grad_norm": 3.828125,
"learning_rate": 0.0004688433815432884,
"loss": 5.8115,
"mean_token_accuracy": 0.1688116416335106,
"num_tokens": 37332578.0,
"step": 20025
},
{
"entropy": 6.1219480514526365,
"epoch": 1.7688096079123985,
"grad_norm": 2.234375,
"learning_rate": 0.00046882739099083335,
"loss": 5.8032,
"mean_token_accuracy": 0.16592158377170563,
"num_tokens": 37341769.0,
"step": 20030
},
{
"entropy": 6.111376523971558,
"epoch": 1.7692511480042388,
"grad_norm": 1.6015625,
"learning_rate": 0.00046881139664141006,
"loss": 5.8141,
"mean_token_accuracy": 0.16533998548984527,
"num_tokens": 37351158.0,
"step": 20035
},
{
"entropy": 6.136845970153809,
"epoch": 1.7696926880960793,
"grad_norm": 2.15625,
"learning_rate": 0.0004687953984953316,
"loss": 5.7958,
"mean_token_accuracy": 0.17260803282260895,
"num_tokens": 37360924.0,
"step": 20040
},
{
"entropy": 6.003958225250244,
"epoch": 1.7701342281879193,
"grad_norm": 1.8984375,
"learning_rate": 0.0004687793965529115,
"loss": 5.7291,
"mean_token_accuracy": 0.1792281910777092,
"num_tokens": 37369295.0,
"step": 20045
},
{
"entropy": 6.033232736587524,
"epoch": 1.7705757682797598,
"grad_norm": 3.21875,
"learning_rate": 0.0004687633908144633,
"loss": 5.7713,
"mean_token_accuracy": 0.17159780263900756,
"num_tokens": 37379135.0,
"step": 20050
},
{
"entropy": 6.091190958023072,
"epoch": 1.7710173083716,
"grad_norm": 2.84375,
"learning_rate": 0.00046874738128030045,
"loss": 5.6564,
"mean_token_accuracy": 0.17839887142181396,
"num_tokens": 37387927.0,
"step": 20055
},
{
"entropy": 5.970152950286865,
"epoch": 1.7714588484634404,
"grad_norm": 1.8046875,
"learning_rate": 0.0004687313679507366,
"loss": 5.7076,
"mean_token_accuracy": 0.1807463675737381,
"num_tokens": 37397629.0,
"step": 20060
},
{
"entropy": 5.997935009002686,
"epoch": 1.7719003885552809,
"grad_norm": 1.7890625,
"learning_rate": 0.00046871535082608544,
"loss": 5.7176,
"mean_token_accuracy": 0.17698423564434052,
"num_tokens": 37407688.0,
"step": 20065
},
{
"entropy": 6.078509664535522,
"epoch": 1.7723419286471211,
"grad_norm": 2.0625,
"learning_rate": 0.0004686993299066607,
"loss": 5.7226,
"mean_token_accuracy": 0.17737672924995423,
"num_tokens": 37417019.0,
"step": 20070
},
{
"entropy": 6.0891430377960205,
"epoch": 1.7727834687389614,
"grad_norm": 1.8671875,
"learning_rate": 0.0004686833051927763,
"loss": 5.7944,
"mean_token_accuracy": 0.16832052171230316,
"num_tokens": 37427685.0,
"step": 20075
},
{
"entropy": 6.004330825805664,
"epoch": 1.773225008830802,
"grad_norm": 1.9609375,
"learning_rate": 0.00046866727668474605,
"loss": 5.6992,
"mean_token_accuracy": 0.1810306116938591,
"num_tokens": 37436844.0,
"step": 20080
},
{
"entropy": 6.019532251358032,
"epoch": 1.7736665489226422,
"grad_norm": 3.703125,
"learning_rate": 0.000468651244382884,
"loss": 5.6733,
"mean_token_accuracy": 0.17874204367399216,
"num_tokens": 37445755.0,
"step": 20085
},
{
"entropy": 6.063958406448364,
"epoch": 1.7741080890144825,
"grad_norm": 1.9609375,
"learning_rate": 0.0004686352082875043,
"loss": 5.8392,
"mean_token_accuracy": 0.1690211847424507,
"num_tokens": 37454176.0,
"step": 20090
},
{
"entropy": 6.063054704666138,
"epoch": 1.774549629106323,
"grad_norm": 3.03125,
"learning_rate": 0.0004686191683989209,
"loss": 5.7339,
"mean_token_accuracy": 0.1819625198841095,
"num_tokens": 37463696.0,
"step": 20095
},
{
"entropy": 6.099913835525513,
"epoch": 1.7749911691981632,
"grad_norm": 1.7734375,
"learning_rate": 0.0004686031247174482,
"loss": 5.7695,
"mean_token_accuracy": 0.16679587662220002,
"num_tokens": 37473651.0,
"step": 20100
},
{
"entropy": 6.1041148662567135,
"epoch": 1.7754327092900035,
"grad_norm": 2.984375,
"learning_rate": 0.0004685870772434002,
"loss": 5.8302,
"mean_token_accuracy": 0.16603632271289825,
"num_tokens": 37483137.0,
"step": 20105
},
{
"entropy": 6.109648990631103,
"epoch": 1.775874249381844,
"grad_norm": 2.390625,
"learning_rate": 0.0004685710259770916,
"loss": 5.8398,
"mean_token_accuracy": 0.16072432100772857,
"num_tokens": 37492029.0,
"step": 20110
},
{
"entropy": 6.140447902679443,
"epoch": 1.776315789473684,
"grad_norm": 1.8984375,
"learning_rate": 0.00046855497091883664,
"loss": 5.7579,
"mean_token_accuracy": 0.17525855749845504,
"num_tokens": 37500421.0,
"step": 20115
},
{
"entropy": 6.015039348602295,
"epoch": 1.7767573295655246,
"grad_norm": 3.828125,
"learning_rate": 0.0004685389120689499,
"loss": 5.7254,
"mean_token_accuracy": 0.17579565495252608,
"num_tokens": 37510332.0,
"step": 20120
},
{
"entropy": 5.9834237575531,
"epoch": 1.7771988696573648,
"grad_norm": 2.21875,
"learning_rate": 0.000468522849427746,
"loss": 5.7567,
"mean_token_accuracy": 0.18117524981498717,
"num_tokens": 37519802.0,
"step": 20125
},
{
"entropy": 6.180115222930908,
"epoch": 1.7776404097492051,
"grad_norm": 2.109375,
"learning_rate": 0.00046850678299553943,
"loss": 5.8901,
"mean_token_accuracy": 0.16586011201143264,
"num_tokens": 37529622.0,
"step": 20130
},
{
"entropy": 6.0050066947937015,
"epoch": 1.7780819498410456,
"grad_norm": 2.03125,
"learning_rate": 0.0004684907127726451,
"loss": 5.717,
"mean_token_accuracy": 0.1827375277876854,
"num_tokens": 37539446.0,
"step": 20135
},
{
"entropy": 5.989188194274902,
"epoch": 1.778523489932886,
"grad_norm": 1.96875,
"learning_rate": 0.0004684746387593778,
"loss": 5.6836,
"mean_token_accuracy": 0.17663790732622148,
"num_tokens": 37547877.0,
"step": 20140
},
{
"entropy": 6.119590616226196,
"epoch": 1.7789650300247262,
"grad_norm": 2.046875,
"learning_rate": 0.0004684585609560523,
"loss": 5.9105,
"mean_token_accuracy": 0.1657624512910843,
"num_tokens": 37557841.0,
"step": 20145
},
{
"entropy": 6.128692722320556,
"epoch": 1.7794065701165667,
"grad_norm": 2.296875,
"learning_rate": 0.0004684424793629836,
"loss": 5.8384,
"mean_token_accuracy": 0.16316440105438232,
"num_tokens": 37566876.0,
"step": 20150
},
{
"entropy": 6.12056303024292,
"epoch": 1.779848110208407,
"grad_norm": 2.578125,
"learning_rate": 0.00046842639398048683,
"loss": 5.807,
"mean_token_accuracy": 0.17246670126914979,
"num_tokens": 37575571.0,
"step": 20155
},
{
"entropy": 6.122084474563598,
"epoch": 1.7802896503002472,
"grad_norm": 2.078125,
"learning_rate": 0.0004684103048088769,
"loss": 5.8973,
"mean_token_accuracy": 0.1693157434463501,
"num_tokens": 37585972.0,
"step": 20160
},
{
"entropy": 6.084913015365601,
"epoch": 1.7807311903920877,
"grad_norm": 3.125,
"learning_rate": 0.0004683942118484692,
"loss": 5.8219,
"mean_token_accuracy": 0.16944292485713958,
"num_tokens": 37594849.0,
"step": 20165
},
{
"entropy": 6.111827039718628,
"epoch": 1.781172730483928,
"grad_norm": 3.25,
"learning_rate": 0.00046837811509957883,
"loss": 5.7493,
"mean_token_accuracy": 0.17413654327392578,
"num_tokens": 37603634.0,
"step": 20170
},
{
"entropy": 6.094721841812134,
"epoch": 1.7816142705757683,
"grad_norm": 2.5,
"learning_rate": 0.00046836201456252116,
"loss": 5.7157,
"mean_token_accuracy": 0.17325704097747802,
"num_tokens": 37612518.0,
"step": 20175
},
{
"entropy": 6.003599071502686,
"epoch": 1.7820558106676088,
"grad_norm": 5.65625,
"learning_rate": 0.0004683459102376116,
"loss": 5.7431,
"mean_token_accuracy": 0.1785813108086586,
"num_tokens": 37621553.0,
"step": 20180
},
{
"entropy": 6.007620000839234,
"epoch": 1.7824973507594488,
"grad_norm": 2.453125,
"learning_rate": 0.00046832980212516557,
"loss": 5.7987,
"mean_token_accuracy": 0.17401084005832673,
"num_tokens": 37631263.0,
"step": 20185
},
{
"entropy": 6.093570947647095,
"epoch": 1.7829388908512893,
"grad_norm": 4.53125,
"learning_rate": 0.00046831369022549876,
"loss": 5.7251,
"mean_token_accuracy": 0.1760151207447052,
"num_tokens": 37640810.0,
"step": 20190
},
{
"entropy": 6.1236968517303465,
"epoch": 1.7833804309431296,
"grad_norm": 2.875,
"learning_rate": 0.0004682975745389267,
"loss": 5.7896,
"mean_token_accuracy": 0.17517333328723908,
"num_tokens": 37650848.0,
"step": 20195
},
{
"entropy": 6.104809808731079,
"epoch": 1.7838219710349699,
"grad_norm": 2.640625,
"learning_rate": 0.00046828145506576504,
"loss": 5.7978,
"mean_token_accuracy": 0.16556617468595505,
"num_tokens": 37660370.0,
"step": 20200
},
{
"entropy": 6.054914093017578,
"epoch": 1.7842635111268104,
"grad_norm": 2.53125,
"learning_rate": 0.0004682653318063296,
"loss": 5.7292,
"mean_token_accuracy": 0.17247836738824845,
"num_tokens": 37669570.0,
"step": 20205
},
{
"entropy": 6.097461557388305,
"epoch": 1.7847050512186506,
"grad_norm": 2.140625,
"learning_rate": 0.00046824920476093624,
"loss": 5.8008,
"mean_token_accuracy": 0.1662905514240265,
"num_tokens": 37679585.0,
"step": 20210
},
{
"entropy": 6.127541351318359,
"epoch": 1.785146591310491,
"grad_norm": 1.71875,
"learning_rate": 0.00046823307392990086,
"loss": 5.8358,
"mean_token_accuracy": 0.17203833609819413,
"num_tokens": 37688736.0,
"step": 20215
},
{
"entropy": 6.110472822189331,
"epoch": 1.7855881314023314,
"grad_norm": 3.484375,
"learning_rate": 0.00046821693931353947,
"loss": 5.8454,
"mean_token_accuracy": 0.16285522282123566,
"num_tokens": 37699104.0,
"step": 20220
},
{
"entropy": 6.138068914413452,
"epoch": 1.7860296714941717,
"grad_norm": 4.84375,
"learning_rate": 0.0004682008009121681,
"loss": 5.8659,
"mean_token_accuracy": 0.1693836748600006,
"num_tokens": 37708260.0,
"step": 20225
},
{
"entropy": 6.081281137466431,
"epoch": 1.786471211586012,
"grad_norm": 1.7109375,
"learning_rate": 0.000468184658726103,
"loss": 5.7875,
"mean_token_accuracy": 0.17419836670160294,
"num_tokens": 37717442.0,
"step": 20230
},
{
"entropy": 6.066426706314087,
"epoch": 1.7869127516778525,
"grad_norm": 1.9609375,
"learning_rate": 0.0004681685127556602,
"loss": 5.8372,
"mean_token_accuracy": 0.1640912711620331,
"num_tokens": 37727063.0,
"step": 20235
},
{
"entropy": 6.104929780960083,
"epoch": 1.7873542917696927,
"grad_norm": 1.7578125,
"learning_rate": 0.00046815236300115615,
"loss": 5.7364,
"mean_token_accuracy": 0.1749081015586853,
"num_tokens": 37736441.0,
"step": 20240
},
{
"entropy": 6.034334373474121,
"epoch": 1.787795831861533,
"grad_norm": 2.4375,
"learning_rate": 0.00046813620946290716,
"loss": 5.6939,
"mean_token_accuracy": 0.17779458314180374,
"num_tokens": 37745290.0,
"step": 20245
},
{
"entropy": 6.097446632385254,
"epoch": 1.7882373719533735,
"grad_norm": 2.953125,
"learning_rate": 0.0004681200521412296,
"loss": 5.7988,
"mean_token_accuracy": 0.17294927984476088,
"num_tokens": 37754786.0,
"step": 20250
},
{
"entropy": 6.07311429977417,
"epoch": 1.7886789120452136,
"grad_norm": 2.9375,
"learning_rate": 0.00046810389103644015,
"loss": 5.7866,
"mean_token_accuracy": 0.16909732520580292,
"num_tokens": 37763513.0,
"step": 20255
},
{
"entropy": 6.062894487380982,
"epoch": 1.789120452137054,
"grad_norm": 1.9765625,
"learning_rate": 0.0004680877261488552,
"loss": 5.782,
"mean_token_accuracy": 0.16257330030202866,
"num_tokens": 37771752.0,
"step": 20260
},
{
"entropy": 6.05379638671875,
"epoch": 1.7895619922288943,
"grad_norm": 1.9921875,
"learning_rate": 0.0004680715574787916,
"loss": 5.797,
"mean_token_accuracy": 0.16199451982975005,
"num_tokens": 37781531.0,
"step": 20265
},
{
"entropy": 6.059544467926026,
"epoch": 1.7900035323207346,
"grad_norm": 1.6875,
"learning_rate": 0.00046805538502656596,
"loss": 5.728,
"mean_token_accuracy": 0.17324828505516052,
"num_tokens": 37791469.0,
"step": 20270
},
{
"entropy": 6.095893907546997,
"epoch": 1.7904450724125751,
"grad_norm": 1.84375,
"learning_rate": 0.0004680392087924952,
"loss": 5.8085,
"mean_token_accuracy": 0.169072225689888,
"num_tokens": 37800301.0,
"step": 20275
},
{
"entropy": 6.0223784923553465,
"epoch": 1.7908866125044154,
"grad_norm": 3.09375,
"learning_rate": 0.000468023028776896,
"loss": 5.6212,
"mean_token_accuracy": 0.18689271211624145,
"num_tokens": 37808849.0,
"step": 20280
},
{
"entropy": 6.082601118087768,
"epoch": 1.7913281525962557,
"grad_norm": 2.328125,
"learning_rate": 0.0004680068449800855,
"loss": 5.8193,
"mean_token_accuracy": 0.16789286583662033,
"num_tokens": 37818632.0,
"step": 20285
},
{
"entropy": 6.097744178771973,
"epoch": 1.7917696926880962,
"grad_norm": 1.796875,
"learning_rate": 0.0004679906574023807,
"loss": 5.7978,
"mean_token_accuracy": 0.1697489857673645,
"num_tokens": 37828158.0,
"step": 20290
},
{
"entropy": 6.06685848236084,
"epoch": 1.7922112327799364,
"grad_norm": 1.9921875,
"learning_rate": 0.0004679744660440987,
"loss": 5.7279,
"mean_token_accuracy": 0.16926877051591874,
"num_tokens": 37836242.0,
"step": 20295
},
{
"entropy": 6.057650423049926,
"epoch": 1.7926527728717767,
"grad_norm": 2.140625,
"learning_rate": 0.00046795827090555654,
"loss": 5.778,
"mean_token_accuracy": 0.17353682219982147,
"num_tokens": 37844286.0,
"step": 20300
},
{
"entropy": 6.03119535446167,
"epoch": 1.7930943129636172,
"grad_norm": 2.625,
"learning_rate": 0.0004679420719870717,
"loss": 5.7133,
"mean_token_accuracy": 0.1755613014101982,
"num_tokens": 37853440.0,
"step": 20305
},
{
"entropy": 6.067833375930786,
"epoch": 1.7935358530554575,
"grad_norm": 1.8828125,
"learning_rate": 0.0004679258692889613,
"loss": 5.6569,
"mean_token_accuracy": 0.17604544758796692,
"num_tokens": 37862511.0,
"step": 20310
},
{
"entropy": 6.118418788909912,
"epoch": 1.7939773931472978,
"grad_norm": 2.015625,
"learning_rate": 0.000467909662811543,
"loss": 5.8585,
"mean_token_accuracy": 0.1613827243447304,
"num_tokens": 37872797.0,
"step": 20315
},
{
"entropy": 6.070163059234619,
"epoch": 1.7944189332391383,
"grad_norm": 2.296875,
"learning_rate": 0.000467893452555134,
"loss": 5.7202,
"mean_token_accuracy": 0.1809371143579483,
"num_tokens": 37881859.0,
"step": 20320
},
{
"entropy": 6.016335201263428,
"epoch": 1.7948604733309783,
"grad_norm": 1.9921875,
"learning_rate": 0.00046787723852005197,
"loss": 5.7537,
"mean_token_accuracy": 0.18073657900094986,
"num_tokens": 37891381.0,
"step": 20325
},
{
"entropy": 5.941231393814087,
"epoch": 1.7953020134228188,
"grad_norm": 2.40625,
"learning_rate": 0.0004678610207066146,
"loss": 5.6602,
"mean_token_accuracy": 0.18109470307826997,
"num_tokens": 37900554.0,
"step": 20330
},
{
"entropy": 6.069563007354736,
"epoch": 1.795743553514659,
"grad_norm": 2.375,
"learning_rate": 0.0004678447991151395,
"loss": 5.7192,
"mean_token_accuracy": 0.17649997770786285,
"num_tokens": 37908965.0,
"step": 20335
},
{
"entropy": 6.039030838012695,
"epoch": 1.7961850936064994,
"grad_norm": 2.140625,
"learning_rate": 0.00046782857374594447,
"loss": 5.6977,
"mean_token_accuracy": 0.1767815500497818,
"num_tokens": 37917555.0,
"step": 20340
},
{
"entropy": 6.049967956542969,
"epoch": 1.7966266336983399,
"grad_norm": 1.59375,
"learning_rate": 0.0004678123445993473,
"loss": 5.7687,
"mean_token_accuracy": 0.1719534456729889,
"num_tokens": 37926334.0,
"step": 20345
},
{
"entropy": 5.994968557357788,
"epoch": 1.7970681737901801,
"grad_norm": 2.484375,
"learning_rate": 0.000467796111675666,
"loss": 5.7123,
"mean_token_accuracy": 0.17246616184711455,
"num_tokens": 37935912.0,
"step": 20350
},
{
"entropy": 5.982786798477173,
"epoch": 1.7975097138820204,
"grad_norm": 2.296875,
"learning_rate": 0.00046777987497521845,
"loss": 5.7571,
"mean_token_accuracy": 0.17566021233797074,
"num_tokens": 37945238.0,
"step": 20355
},
{
"entropy": 6.059523582458496,
"epoch": 1.797951253973861,
"grad_norm": 2.1875,
"learning_rate": 0.00046776363449832286,
"loss": 5.7393,
"mean_token_accuracy": 0.1827096775174141,
"num_tokens": 37954945.0,
"step": 20360
},
{
"entropy": 6.064646768569946,
"epoch": 1.7983927940657012,
"grad_norm": 2.234375,
"learning_rate": 0.00046774739024529736,
"loss": 5.6628,
"mean_token_accuracy": 0.1828878864645958,
"num_tokens": 37964114.0,
"step": 20365
},
{
"entropy": 6.081359243392944,
"epoch": 1.7988343341575415,
"grad_norm": 2.453125,
"learning_rate": 0.00046773114221645995,
"loss": 5.8302,
"mean_token_accuracy": 0.16006694436073304,
"num_tokens": 37973774.0,
"step": 20370
},
{
"entropy": 6.096774530410767,
"epoch": 1.799275874249382,
"grad_norm": 3.390625,
"learning_rate": 0.00046771489041212916,
"loss": 5.7861,
"mean_token_accuracy": 0.16919369250535965,
"num_tokens": 37982763.0,
"step": 20375
},
{
"entropy": 6.178370952606201,
"epoch": 1.7997174143412222,
"grad_norm": 1.4296875,
"learning_rate": 0.0004676986348326233,
"loss": 5.8614,
"mean_token_accuracy": 0.16514064222574235,
"num_tokens": 37992302.0,
"step": 20380
},
{
"entropy": 6.245607614517212,
"epoch": 1.8001589544330625,
"grad_norm": 2.984375,
"learning_rate": 0.0004676823754782607,
"loss": 5.9141,
"mean_token_accuracy": 0.16496999561786652,
"num_tokens": 38001785.0,
"step": 20385
},
{
"entropy": 5.990910530090332,
"epoch": 1.800600494524903,
"grad_norm": 1.734375,
"learning_rate": 0.00046766611234936,
"loss": 5.6984,
"mean_token_accuracy": 0.17228350192308425,
"num_tokens": 38010823.0,
"step": 20390
},
{
"entropy": 5.957917785644531,
"epoch": 1.801042034616743,
"grad_norm": 1.8046875,
"learning_rate": 0.0004676498454462398,
"loss": 5.7149,
"mean_token_accuracy": 0.17993209660053253,
"num_tokens": 38019718.0,
"step": 20395
},
{
"entropy": 6.129083871841431,
"epoch": 1.8014835747085836,
"grad_norm": 2.28125,
"learning_rate": 0.00046763357476921856,
"loss": 5.7479,
"mean_token_accuracy": 0.17176632583141327,
"num_tokens": 38028962.0,
"step": 20400
},
{
"entropy": 6.110822153091431,
"epoch": 1.8019251148004238,
"grad_norm": 2.1875,
"learning_rate": 0.0004676173003186152,
"loss": 5.7106,
"mean_token_accuracy": 0.18440910428762436,
"num_tokens": 38037824.0,
"step": 20405
},
{
"entropy": 6.058085250854492,
"epoch": 1.802366654892264,
"grad_norm": 1.84375,
"learning_rate": 0.00046760102209474855,
"loss": 5.8598,
"mean_token_accuracy": 0.1667885571718216,
"num_tokens": 38046764.0,
"step": 20410
},
{
"entropy": 6.080652379989624,
"epoch": 1.8028081949841046,
"grad_norm": 1.796875,
"learning_rate": 0.0004675847400979373,
"loss": 5.7395,
"mean_token_accuracy": 0.17901293337345123,
"num_tokens": 38055363.0,
"step": 20415
},
{
"entropy": 6.088107299804688,
"epoch": 1.8032497350759449,
"grad_norm": 2.25,
"learning_rate": 0.00046756845432850057,
"loss": 5.8115,
"mean_token_accuracy": 0.17384214252233504,
"num_tokens": 38065471.0,
"step": 20420
},
{
"entropy": 6.139524841308594,
"epoch": 1.8036912751677852,
"grad_norm": 2.140625,
"learning_rate": 0.0004675521647867573,
"loss": 5.8683,
"mean_token_accuracy": 0.1668051227927208,
"num_tokens": 38075448.0,
"step": 20425
},
{
"entropy": 6.0415548324584964,
"epoch": 1.8041328152596257,
"grad_norm": 1.796875,
"learning_rate": 0.00046753587147302665,
"loss": 5.8233,
"mean_token_accuracy": 0.17092170268297197,
"num_tokens": 38085657.0,
"step": 20430
},
{
"entropy": 6.074027252197266,
"epoch": 1.804574355351466,
"grad_norm": 2.375,
"learning_rate": 0.0004675195743876278,
"loss": 5.7664,
"mean_token_accuracy": 0.17080171406269073,
"num_tokens": 38095580.0,
"step": 20435
},
{
"entropy": 6.223772764205933,
"epoch": 1.8050158954433062,
"grad_norm": 3.796875,
"learning_rate": 0.00046750327353088,
"loss": 5.8643,
"mean_token_accuracy": 0.16754565984010697,
"num_tokens": 38104969.0,
"step": 20440
},
{
"entropy": 6.184945297241211,
"epoch": 1.8054574355351467,
"grad_norm": 4.0,
"learning_rate": 0.0004674869689031026,
"loss": 5.8236,
"mean_token_accuracy": 0.16764135509729386,
"num_tokens": 38114536.0,
"step": 20445
},
{
"entropy": 6.036003541946411,
"epoch": 1.805898975626987,
"grad_norm": 1.8046875,
"learning_rate": 0.00046747066050461486,
"loss": 5.7316,
"mean_token_accuracy": 0.17753866612911223,
"num_tokens": 38122969.0,
"step": 20450
},
{
"entropy": 6.075832462310791,
"epoch": 1.8063405157188273,
"grad_norm": 2.53125,
"learning_rate": 0.00046745434833573635,
"loss": 5.7876,
"mean_token_accuracy": 0.16976040750741958,
"num_tokens": 38132892.0,
"step": 20455
},
{
"entropy": 5.992115068435669,
"epoch": 1.8067820558106678,
"grad_norm": 1.96875,
"learning_rate": 0.0004674380323967867,
"loss": 5.7609,
"mean_token_accuracy": 0.17452638000249862,
"num_tokens": 38141950.0,
"step": 20460
},
{
"entropy": 6.13738055229187,
"epoch": 1.8072235959025078,
"grad_norm": 2.234375,
"learning_rate": 0.0004674217126880853,
"loss": 5.8536,
"mean_token_accuracy": 0.1666143387556076,
"num_tokens": 38151314.0,
"step": 20465
},
{
"entropy": 6.202310276031494,
"epoch": 1.8076651359943483,
"grad_norm": 1.7890625,
"learning_rate": 0.0004674053892099521,
"loss": 5.8427,
"mean_token_accuracy": 0.16920543760061263,
"num_tokens": 38159992.0,
"step": 20470
},
{
"entropy": 6.130959129333496,
"epoch": 1.8081066760861886,
"grad_norm": 1.96875,
"learning_rate": 0.00046738906196270663,
"loss": 5.7365,
"mean_token_accuracy": 0.16845079958438874,
"num_tokens": 38168436.0,
"step": 20475
},
{
"entropy": 6.002644681930542,
"epoch": 1.8085482161780289,
"grad_norm": 1.546875,
"learning_rate": 0.000467372730946669,
"loss": 5.7499,
"mean_token_accuracy": 0.17298794239759446,
"num_tokens": 38177932.0,
"step": 20480
},
{
"entropy": 6.054760217666626,
"epoch": 1.8089897562698694,
"grad_norm": 1.6171875,
"learning_rate": 0.00046735639616215884,
"loss": 5.7557,
"mean_token_accuracy": 0.17885021716356278,
"num_tokens": 38187727.0,
"step": 20485
},
{
"entropy": 6.042445421218872,
"epoch": 1.8094312963617096,
"grad_norm": 1.875,
"learning_rate": 0.00046734005760949634,
"loss": 5.8264,
"mean_token_accuracy": 0.16477064043283463,
"num_tokens": 38198768.0,
"step": 20490
},
{
"entropy": 6.099857378005981,
"epoch": 1.80987283645355,
"grad_norm": 1.6640625,
"learning_rate": 0.00046732371528900154,
"loss": 5.799,
"mean_token_accuracy": 0.1726243555545807,
"num_tokens": 38207538.0,
"step": 20495
},
{
"entropy": 6.122581243515015,
"epoch": 1.8103143765453904,
"grad_norm": 2.625,
"learning_rate": 0.0004673073692009945,
"loss": 5.8444,
"mean_token_accuracy": 0.16764572113752366,
"num_tokens": 38216254.0,
"step": 20500
},
{
"entropy": 6.1341455459594725,
"epoch": 1.8107559166372307,
"grad_norm": 1.7421875,
"learning_rate": 0.0004672910193457955,
"loss": 5.8154,
"mean_token_accuracy": 0.16556355208158494,
"num_tokens": 38225356.0,
"step": 20505
},
{
"entropy": 6.076239013671875,
"epoch": 1.811197456729071,
"grad_norm": 2.21875,
"learning_rate": 0.0004672746657237248,
"loss": 5.7038,
"mean_token_accuracy": 0.18037997484207152,
"num_tokens": 38234561.0,
"step": 20510
},
{
"entropy": 6.045130586624145,
"epoch": 1.8116389968209115,
"grad_norm": 1.90625,
"learning_rate": 0.0004672583083351027,
"loss": 5.7823,
"mean_token_accuracy": 0.17245611995458604,
"num_tokens": 38244418.0,
"step": 20515
},
{
"entropy": 6.104539251327514,
"epoch": 1.8120805369127517,
"grad_norm": 3.453125,
"learning_rate": 0.0004672419471802497,
"loss": 5.7709,
"mean_token_accuracy": 0.17494523674249648,
"num_tokens": 38253639.0,
"step": 20520
},
{
"entropy": 6.0988422393798825,
"epoch": 1.812522077004592,
"grad_norm": 1.8984375,
"learning_rate": 0.00046722558225948627,
"loss": 5.6581,
"mean_token_accuracy": 0.18882863223552704,
"num_tokens": 38262401.0,
"step": 20525
},
{
"entropy": 6.027865982055664,
"epoch": 1.8129636170964325,
"grad_norm": 2.5625,
"learning_rate": 0.00046720921357313303,
"loss": 5.7454,
"mean_token_accuracy": 0.17788840979337692,
"num_tokens": 38271070.0,
"step": 20530
},
{
"entropy": 6.060563850402832,
"epoch": 1.8134051571882726,
"grad_norm": 1.953125,
"learning_rate": 0.0004671928411215106,
"loss": 5.757,
"mean_token_accuracy": 0.1772928476333618,
"num_tokens": 38280675.0,
"step": 20535
},
{
"entropy": 6.056086826324463,
"epoch": 1.813846697280113,
"grad_norm": 2.09375,
"learning_rate": 0.00046717646490493977,
"loss": 5.811,
"mean_token_accuracy": 0.17047890275716782,
"num_tokens": 38290116.0,
"step": 20540
},
{
"entropy": 6.112353038787842,
"epoch": 1.8142882373719533,
"grad_norm": 2.109375,
"learning_rate": 0.0004671600849237412,
"loss": 5.782,
"mean_token_accuracy": 0.17602564692497252,
"num_tokens": 38299415.0,
"step": 20545
},
{
"entropy": 5.9768115997314455,
"epoch": 1.8147297774637936,
"grad_norm": 2.515625,
"learning_rate": 0.0004671437011782359,
"loss": 5.6771,
"mean_token_accuracy": 0.18386662751436234,
"num_tokens": 38308761.0,
"step": 20550
},
{
"entropy": 6.108418560028076,
"epoch": 1.815171317555634,
"grad_norm": 2.578125,
"learning_rate": 0.0004671273136687448,
"loss": 5.8302,
"mean_token_accuracy": 0.1718638136982918,
"num_tokens": 38318212.0,
"step": 20555
},
{
"entropy": 6.0954076766967775,
"epoch": 1.8156128576474744,
"grad_norm": 2.421875,
"learning_rate": 0.0004671109223955889,
"loss": 5.7918,
"mean_token_accuracy": 0.1700090989470482,
"num_tokens": 38327233.0,
"step": 20560
},
{
"entropy": 6.079988861083985,
"epoch": 1.8160543977393147,
"grad_norm": 2.734375,
"learning_rate": 0.0004670945273590892,
"loss": 5.6593,
"mean_token_accuracy": 0.17971165776252745,
"num_tokens": 38336473.0,
"step": 20565
},
{
"entropy": 6.071135950088501,
"epoch": 1.8164959378311551,
"grad_norm": 5.78125,
"learning_rate": 0.0004670781285595671,
"loss": 5.8058,
"mean_token_accuracy": 0.17199380248785018,
"num_tokens": 38345286.0,
"step": 20570
},
{
"entropy": 6.129253339767456,
"epoch": 1.8169374779229954,
"grad_norm": 2.59375,
"learning_rate": 0.0004670617259973435,
"loss": 5.7419,
"mean_token_accuracy": 0.16837744563817977,
"num_tokens": 38355191.0,
"step": 20575
},
{
"entropy": 6.052639532089233,
"epoch": 1.8173790180148357,
"grad_norm": 1.8203125,
"learning_rate": 0.00046704531967274007,
"loss": 5.7108,
"mean_token_accuracy": 0.17526288479566574,
"num_tokens": 38363902.0,
"step": 20580
},
{
"entropy": 6.000418043136596,
"epoch": 1.8178205581066762,
"grad_norm": 3.25,
"learning_rate": 0.00046702890958607804,
"loss": 5.8775,
"mean_token_accuracy": 0.1688127413392067,
"num_tokens": 38374828.0,
"step": 20585
},
{
"entropy": 6.042738819122315,
"epoch": 1.8182620981985165,
"grad_norm": 1.9765625,
"learning_rate": 0.0004670124957376788,
"loss": 5.7806,
"mean_token_accuracy": 0.1722944736480713,
"num_tokens": 38384918.0,
"step": 20590
},
{
"entropy": 6.166797113418579,
"epoch": 1.8187036382903567,
"grad_norm": 1.9453125,
"learning_rate": 0.0004669960781278641,
"loss": 5.8029,
"mean_token_accuracy": 0.1633400395512581,
"num_tokens": 38394005.0,
"step": 20595
},
{
"entropy": 6.128900098800659,
"epoch": 1.8191451783821972,
"grad_norm": 2.6875,
"learning_rate": 0.0004669796567569553,
"loss": 5.8395,
"mean_token_accuracy": 0.17295801490545273,
"num_tokens": 38402722.0,
"step": 20600
},
{
"entropy": 6.013058614730835,
"epoch": 1.8195867184740373,
"grad_norm": 1.96875,
"learning_rate": 0.0004669632316252743,
"loss": 5.7337,
"mean_token_accuracy": 0.17899467349052428,
"num_tokens": 38411726.0,
"step": 20605
},
{
"entropy": 6.132035207748413,
"epoch": 1.8200282585658778,
"grad_norm": 2.90625,
"learning_rate": 0.00046694680273314275,
"loss": 5.8048,
"mean_token_accuracy": 0.1665605276823044,
"num_tokens": 38421187.0,
"step": 20610
},
{
"entropy": 6.125906085968017,
"epoch": 1.820469798657718,
"grad_norm": 2.375,
"learning_rate": 0.0004669303700808824,
"loss": 5.8288,
"mean_token_accuracy": 0.1694124385714531,
"num_tokens": 38430722.0,
"step": 20615
},
{
"entropy": 6.0616772174835205,
"epoch": 1.8209113387495584,
"grad_norm": 2.125,
"learning_rate": 0.0004669139336688154,
"loss": 5.77,
"mean_token_accuracy": 0.17299177050590514,
"num_tokens": 38440763.0,
"step": 20620
},
{
"entropy": 6.068793630599975,
"epoch": 1.8213528788413988,
"grad_norm": 2.453125,
"learning_rate": 0.00046689749349726353,
"loss": 5.7749,
"mean_token_accuracy": 0.17288310825824738,
"num_tokens": 38449298.0,
"step": 20625
},
{
"entropy": 6.094410514831543,
"epoch": 1.8217944189332391,
"grad_norm": 1.53125,
"learning_rate": 0.0004668810495665489,
"loss": 5.7473,
"mean_token_accuracy": 0.17017145305871964,
"num_tokens": 38458941.0,
"step": 20630
},
{
"entropy": 6.036589288711548,
"epoch": 1.8222359590250794,
"grad_norm": 2.203125,
"learning_rate": 0.0004668646018769936,
"loss": 5.7349,
"mean_token_accuracy": 0.1760949894785881,
"num_tokens": 38468381.0,
"step": 20635
},
{
"entropy": 6.170140027999878,
"epoch": 1.82267749911692,
"grad_norm": 1.8125,
"learning_rate": 0.00046684815042891993,
"loss": 5.8072,
"mean_token_accuracy": 0.16837052553892135,
"num_tokens": 38477767.0,
"step": 20640
},
{
"entropy": 6.0492359638214115,
"epoch": 1.8231190392087602,
"grad_norm": 3.375,
"learning_rate": 0.0004668316952226501,
"loss": 5.6934,
"mean_token_accuracy": 0.17132195681333542,
"num_tokens": 38486884.0,
"step": 20645
},
{
"entropy": 6.040287494659424,
"epoch": 1.8235605793006004,
"grad_norm": 4.375,
"learning_rate": 0.0004668152362585064,
"loss": 5.7977,
"mean_token_accuracy": 0.17023590207099915,
"num_tokens": 38496243.0,
"step": 20650
},
{
"entropy": 5.986605453491211,
"epoch": 1.824002119392441,
"grad_norm": 2.015625,
"learning_rate": 0.0004667987735368113,
"loss": 5.6789,
"mean_token_accuracy": 0.17871363013982772,
"num_tokens": 38504447.0,
"step": 20655
},
{
"entropy": 6.059323978424072,
"epoch": 1.8244436594842812,
"grad_norm": 2.515625,
"learning_rate": 0.0004667823070578874,
"loss": 5.8045,
"mean_token_accuracy": 0.17368657141923904,
"num_tokens": 38514423.0,
"step": 20660
},
{
"entropy": 6.0814603805542,
"epoch": 1.8248851995761215,
"grad_norm": 1.796875,
"learning_rate": 0.00046676583682205713,
"loss": 5.7487,
"mean_token_accuracy": 0.1757699579000473,
"num_tokens": 38522765.0,
"step": 20665
},
{
"entropy": 6.1411419868469235,
"epoch": 1.825326739667962,
"grad_norm": 1.65625,
"learning_rate": 0.00046674936282964326,
"loss": 5.8586,
"mean_token_accuracy": 0.16721632778644563,
"num_tokens": 38532074.0,
"step": 20670
},
{
"entropy": 6.051646184921265,
"epoch": 1.825768279759802,
"grad_norm": 1.859375,
"learning_rate": 0.0004667328850809683,
"loss": 5.7246,
"mean_token_accuracy": 0.17359185367822647,
"num_tokens": 38541423.0,
"step": 20675
},
{
"entropy": 6.061280202865601,
"epoch": 1.8262098198516425,
"grad_norm": 2.15625,
"learning_rate": 0.0004667164035763552,
"loss": 5.8207,
"mean_token_accuracy": 0.16916983872652053,
"num_tokens": 38552369.0,
"step": 20680
},
{
"entropy": 6.129253721237182,
"epoch": 1.8266513599434828,
"grad_norm": 2.203125,
"learning_rate": 0.0004666999183161268,
"loss": 5.7859,
"mean_token_accuracy": 0.1745992660522461,
"num_tokens": 38561310.0,
"step": 20685
},
{
"entropy": 6.130341291427612,
"epoch": 1.827092900035323,
"grad_norm": 1.90625,
"learning_rate": 0.00046668342930060604,
"loss": 5.8356,
"mean_token_accuracy": 0.17163534760475158,
"num_tokens": 38571157.0,
"step": 20690
},
{
"entropy": 6.102051258087158,
"epoch": 1.8275344401271636,
"grad_norm": 1.8515625,
"learning_rate": 0.00046666693653011596,
"loss": 5.744,
"mean_token_accuracy": 0.17304611653089524,
"num_tokens": 38579862.0,
"step": 20695
},
{
"entropy": 6.11146879196167,
"epoch": 1.8279759802190039,
"grad_norm": 2.5,
"learning_rate": 0.00046665044000497954,
"loss": 5.8309,
"mean_token_accuracy": 0.17083992660045624,
"num_tokens": 38589784.0,
"step": 20700
},
{
"entropy": 6.086359691619873,
"epoch": 1.8284175203108441,
"grad_norm": 2.421875,
"learning_rate": 0.00046663393972551994,
"loss": 5.7328,
"mean_token_accuracy": 0.1749296635389328,
"num_tokens": 38598925.0,
"step": 20705
},
{
"entropy": 6.087245178222656,
"epoch": 1.8288590604026846,
"grad_norm": 2.078125,
"learning_rate": 0.00046661743569206056,
"loss": 5.8197,
"mean_token_accuracy": 0.16935811340808868,
"num_tokens": 38608245.0,
"step": 20710
},
{
"entropy": 6.10954008102417,
"epoch": 1.829300600494525,
"grad_norm": 1.6875,
"learning_rate": 0.0004666009279049245,
"loss": 5.8659,
"mean_token_accuracy": 0.1686677187681198,
"num_tokens": 38617586.0,
"step": 20715
},
{
"entropy": 6.107835149765014,
"epoch": 1.8297421405863652,
"grad_norm": 2.0,
"learning_rate": 0.00046658441636443526,
"loss": 5.8071,
"mean_token_accuracy": 0.1774121955037117,
"num_tokens": 38626420.0,
"step": 20720
},
{
"entropy": 6.099792242050171,
"epoch": 1.8301836806782057,
"grad_norm": 2.171875,
"learning_rate": 0.00046656790107091627,
"loss": 5.7518,
"mean_token_accuracy": 0.17423822730779648,
"num_tokens": 38635585.0,
"step": 20725
},
{
"entropy": 6.078214263916015,
"epoch": 1.830625220770046,
"grad_norm": 2.21875,
"learning_rate": 0.0004665513820246911,
"loss": 5.7674,
"mean_token_accuracy": 0.17218186855316162,
"num_tokens": 38643998.0,
"step": 20730
},
{
"entropy": 6.119875049591064,
"epoch": 1.8310667608618862,
"grad_norm": 2.203125,
"learning_rate": 0.0004665348592260833,
"loss": 5.7959,
"mean_token_accuracy": 0.1766229137778282,
"num_tokens": 38653018.0,
"step": 20735
},
{
"entropy": 5.994671249389649,
"epoch": 1.8315083009537267,
"grad_norm": 1.6015625,
"learning_rate": 0.0004665183326754165,
"loss": 5.7358,
"mean_token_accuracy": 0.17579521238803864,
"num_tokens": 38662079.0,
"step": 20740
},
{
"entropy": 6.046547937393188,
"epoch": 1.8319498410455668,
"grad_norm": 1.71875,
"learning_rate": 0.0004665018023730144,
"loss": 5.7608,
"mean_token_accuracy": 0.17906198352575303,
"num_tokens": 38669928.0,
"step": 20745
},
{
"entropy": 6.092733860015869,
"epoch": 1.8323913811374073,
"grad_norm": 1.4921875,
"learning_rate": 0.000466485268319201,
"loss": 5.745,
"mean_token_accuracy": 0.16897944808006288,
"num_tokens": 38679475.0,
"step": 20750
},
{
"entropy": 6.157550525665283,
"epoch": 1.8328329212292476,
"grad_norm": 1.484375,
"learning_rate": 0.0004664687305143001,
"loss": 5.8252,
"mean_token_accuracy": 0.17259877175092697,
"num_tokens": 38689057.0,
"step": 20755
},
{
"entropy": 6.034098148345947,
"epoch": 1.8332744613210878,
"grad_norm": 1.7421875,
"learning_rate": 0.00046645218895863564,
"loss": 5.6613,
"mean_token_accuracy": 0.18579232096672058,
"num_tokens": 38698362.0,
"step": 20760
},
{
"entropy": 5.902853155136109,
"epoch": 1.8337160014129283,
"grad_norm": 1.7421875,
"learning_rate": 0.00046643564365253173,
"loss": 5.7127,
"mean_token_accuracy": 0.17678497731685638,
"num_tokens": 38708319.0,
"step": 20765
},
{
"entropy": 6.122641944885254,
"epoch": 1.8341575415047686,
"grad_norm": 1.9140625,
"learning_rate": 0.0004664190945963124,
"loss": 5.813,
"mean_token_accuracy": 0.17094256430864335,
"num_tokens": 38717441.0,
"step": 20770
},
{
"entropy": 6.1737143993377686,
"epoch": 1.834599081596609,
"grad_norm": 2.0625,
"learning_rate": 0.00046640254179030184,
"loss": 5.791,
"mean_token_accuracy": 0.1698412150144577,
"num_tokens": 38726903.0,
"step": 20775
},
{
"entropy": 6.032573413848877,
"epoch": 1.8350406216884494,
"grad_norm": 2.78125,
"learning_rate": 0.0004663859852348244,
"loss": 5.7667,
"mean_token_accuracy": 0.17237791419029236,
"num_tokens": 38735983.0,
"step": 20780
},
{
"entropy": 6.048288345336914,
"epoch": 1.8354821617802897,
"grad_norm": 1.9765625,
"learning_rate": 0.00046636942493020437,
"loss": 5.8202,
"mean_token_accuracy": 0.1773562476038933,
"num_tokens": 38745017.0,
"step": 20785
},
{
"entropy": 6.0504919528961185,
"epoch": 1.83592370187213,
"grad_norm": 2.0625,
"learning_rate": 0.0004663528608767661,
"loss": 5.703,
"mean_token_accuracy": 0.1750240683555603,
"num_tokens": 38754756.0,
"step": 20790
},
{
"entropy": 6.078790903091431,
"epoch": 1.8363652419639704,
"grad_norm": 1.75,
"learning_rate": 0.0004663362930748341,
"loss": 5.7925,
"mean_token_accuracy": 0.17194769233465196,
"num_tokens": 38763695.0,
"step": 20795
},
{
"entropy": 6.127443599700928,
"epoch": 1.8368067820558107,
"grad_norm": 1.6171875,
"learning_rate": 0.00046631972152473295,
"loss": 5.8516,
"mean_token_accuracy": 0.16856312453746797,
"num_tokens": 38773637.0,
"step": 20800
},
{
"entropy": 6.015746688842773,
"epoch": 1.837248322147651,
"grad_norm": 1.46875,
"learning_rate": 0.00046630314622678724,
"loss": 5.6808,
"mean_token_accuracy": 0.18631396740674971,
"num_tokens": 38783004.0,
"step": 20805
},
{
"entropy": 6.0235342502594,
"epoch": 1.8376898622394915,
"grad_norm": 1.71875,
"learning_rate": 0.0004662865671813217,
"loss": 5.7679,
"mean_token_accuracy": 0.17734896689653395,
"num_tokens": 38791342.0,
"step": 20810
},
{
"entropy": 6.070442247390747,
"epoch": 1.8381314023313315,
"grad_norm": 1.984375,
"learning_rate": 0.00046626998438866114,
"loss": 5.7223,
"mean_token_accuracy": 0.17447034418582916,
"num_tokens": 38801046.0,
"step": 20815
},
{
"entropy": 6.088837814331055,
"epoch": 1.838572942423172,
"grad_norm": 2.015625,
"learning_rate": 0.00046625339784913035,
"loss": 5.7543,
"mean_token_accuracy": 0.17690883725881576,
"num_tokens": 38810806.0,
"step": 20820
},
{
"entropy": 6.07822003364563,
"epoch": 1.8390144825150123,
"grad_norm": 1.8359375,
"learning_rate": 0.00046623680756305427,
"loss": 5.8131,
"mean_token_accuracy": 0.16972272843122482,
"num_tokens": 38819362.0,
"step": 20825
},
{
"entropy": 6.1163797855377195,
"epoch": 1.8394560226068526,
"grad_norm": 2.40625,
"learning_rate": 0.0004662202135307579,
"loss": 5.8173,
"mean_token_accuracy": 0.169817978143692,
"num_tokens": 38829337.0,
"step": 20830
},
{
"entropy": 6.103693962097168,
"epoch": 1.839897562698693,
"grad_norm": 2.09375,
"learning_rate": 0.0004662036157525663,
"loss": 5.7837,
"mean_token_accuracy": 0.1700507238507271,
"num_tokens": 38838351.0,
"step": 20835
},
{
"entropy": 6.158497476577759,
"epoch": 1.8403391027905334,
"grad_norm": 1.7421875,
"learning_rate": 0.00046618701422880456,
"loss": 5.8239,
"mean_token_accuracy": 0.17275070548057556,
"num_tokens": 38847830.0,
"step": 20840
},
{
"entropy": 6.103699207305908,
"epoch": 1.8407806428823736,
"grad_norm": 1.9921875,
"learning_rate": 0.000466170408959798,
"loss": 5.8274,
"mean_token_accuracy": 0.1628857135772705,
"num_tokens": 38856945.0,
"step": 20845
},
{
"entropy": 6.0231360912323,
"epoch": 1.8412221829742141,
"grad_norm": 1.7734375,
"learning_rate": 0.0004661537999458718,
"loss": 5.7633,
"mean_token_accuracy": 0.17093238681554795,
"num_tokens": 38866493.0,
"step": 20850
},
{
"entropy": 5.9876988410949705,
"epoch": 1.8416637230660544,
"grad_norm": 2.421875,
"learning_rate": 0.00046613718718735143,
"loss": 5.7133,
"mean_token_accuracy": 0.17445554584264755,
"num_tokens": 38875653.0,
"step": 20855
},
{
"entropy": 5.982085275650024,
"epoch": 1.8421052631578947,
"grad_norm": 1.640625,
"learning_rate": 0.00046612057068456226,
"loss": 5.6389,
"mean_token_accuracy": 0.18361886590719223,
"num_tokens": 38884740.0,
"step": 20860
},
{
"entropy": 6.022364807128906,
"epoch": 1.8425468032497352,
"grad_norm": 2.203125,
"learning_rate": 0.00046610395043782983,
"loss": 5.7619,
"mean_token_accuracy": 0.18028481304645538,
"num_tokens": 38893801.0,
"step": 20865
},
{
"entropy": 6.083030128479004,
"epoch": 1.8429883433415755,
"grad_norm": 1.7421875,
"learning_rate": 0.00046608732644747963,
"loss": 5.7638,
"mean_token_accuracy": 0.17908594608306885,
"num_tokens": 38902298.0,
"step": 20870
},
{
"entropy": 6.043539381027221,
"epoch": 1.8434298834334157,
"grad_norm": 1.75,
"learning_rate": 0.00046607069871383745,
"loss": 5.6879,
"mean_token_accuracy": 0.1786566972732544,
"num_tokens": 38910904.0,
"step": 20875
},
{
"entropy": 5.9824505805969235,
"epoch": 1.8438714235252562,
"grad_norm": 1.6171875,
"learning_rate": 0.0004660540672372289,
"loss": 5.6761,
"mean_token_accuracy": 0.1788882464170456,
"num_tokens": 38920405.0,
"step": 20880
},
{
"entropy": 6.032701063156128,
"epoch": 1.8443129636170963,
"grad_norm": 3.75,
"learning_rate": 0.0004660374320179798,
"loss": 5.6598,
"mean_token_accuracy": 0.17582519352436066,
"num_tokens": 38930118.0,
"step": 20885
},
{
"entropy": 6.02574725151062,
"epoch": 1.8447545037089368,
"grad_norm": 1.71875,
"learning_rate": 0.00046602079305641615,
"loss": 5.7794,
"mean_token_accuracy": 0.17548258006572723,
"num_tokens": 38939388.0,
"step": 20890
},
{
"entropy": 6.0585602760314945,
"epoch": 1.845196043800777,
"grad_norm": 1.7734375,
"learning_rate": 0.00046600415035286374,
"loss": 5.7823,
"mean_token_accuracy": 0.17411801367998123,
"num_tokens": 38948632.0,
"step": 20895
},
{
"entropy": 6.127586078643799,
"epoch": 1.8456375838926173,
"grad_norm": 2.15625,
"learning_rate": 0.0004659875039076487,
"loss": 5.7894,
"mean_token_accuracy": 0.1709895461797714,
"num_tokens": 38957504.0,
"step": 20900
},
{
"entropy": 6.029495143890381,
"epoch": 1.8460791239844578,
"grad_norm": 2.03125,
"learning_rate": 0.000465970853721097,
"loss": 5.7619,
"mean_token_accuracy": 0.16607996225357055,
"num_tokens": 38967713.0,
"step": 20905
},
{
"entropy": 6.078852367401123,
"epoch": 1.8465206640762981,
"grad_norm": 2.421875,
"learning_rate": 0.00046595419979353494,
"loss": 5.7947,
"mean_token_accuracy": 0.17218336313962937,
"num_tokens": 38976982.0,
"step": 20910
},
{
"entropy": 6.05725793838501,
"epoch": 1.8469622041681384,
"grad_norm": 2.671875,
"learning_rate": 0.0004659375421252887,
"loss": 5.7506,
"mean_token_accuracy": 0.17323947250843047,
"num_tokens": 38985479.0,
"step": 20915
},
{
"entropy": 6.122451829910278,
"epoch": 1.8474037442599789,
"grad_norm": 1.640625,
"learning_rate": 0.0004659208807166846,
"loss": 5.829,
"mean_token_accuracy": 0.15962985754013062,
"num_tokens": 38995418.0,
"step": 20920
},
{
"entropy": 6.094206285476685,
"epoch": 1.8478452843518192,
"grad_norm": 2.203125,
"learning_rate": 0.0004659042155680491,
"loss": 5.7366,
"mean_token_accuracy": 0.1779482752084732,
"num_tokens": 39004961.0,
"step": 20925
},
{
"entropy": 6.0354289531707765,
"epoch": 1.8482868244436594,
"grad_norm": 1.6015625,
"learning_rate": 0.0004658875466797085,
"loss": 5.7343,
"mean_token_accuracy": 0.18209915310144426,
"num_tokens": 39014282.0,
"step": 20930
},
{
"entropy": 5.99270453453064,
"epoch": 1.8487283645355,
"grad_norm": 1.375,
"learning_rate": 0.00046587087405198943,
"loss": 5.7809,
"mean_token_accuracy": 0.1708643540740013,
"num_tokens": 39024480.0,
"step": 20935
},
{
"entropy": 6.072955656051636,
"epoch": 1.8491699046273402,
"grad_norm": 1.765625,
"learning_rate": 0.00046585419768521854,
"loss": 5.7839,
"mean_token_accuracy": 0.17345691472291946,
"num_tokens": 39034363.0,
"step": 20940
},
{
"entropy": 6.0674830913543705,
"epoch": 1.8496114447191805,
"grad_norm": 2.390625,
"learning_rate": 0.00046583751757972244,
"loss": 5.7116,
"mean_token_accuracy": 0.17812148332595826,
"num_tokens": 39043823.0,
"step": 20945
},
{
"entropy": 5.995621061325073,
"epoch": 1.850052984811021,
"grad_norm": 1.7109375,
"learning_rate": 0.0004658208337358279,
"loss": 5.7199,
"mean_token_accuracy": 0.1744454622268677,
"num_tokens": 39052219.0,
"step": 20950
},
{
"entropy": 5.993925142288208,
"epoch": 1.850494524902861,
"grad_norm": 1.546875,
"learning_rate": 0.00046580414615386175,
"loss": 5.8289,
"mean_token_accuracy": 0.17267364710569383,
"num_tokens": 39062974.0,
"step": 20955
},
{
"entropy": 5.895364475250244,
"epoch": 1.8509360649947015,
"grad_norm": 1.546875,
"learning_rate": 0.00046578745483415087,
"loss": 5.5846,
"mean_token_accuracy": 0.1910429134964943,
"num_tokens": 39072178.0,
"step": 20960
},
{
"entropy": 6.065663194656372,
"epoch": 1.8513776050865418,
"grad_norm": 1.5859375,
"learning_rate": 0.0004657707597770223,
"loss": 5.7673,
"mean_token_accuracy": 0.1702365279197693,
"num_tokens": 39081494.0,
"step": 20965
},
{
"entropy": 6.083360624313355,
"epoch": 1.851819145178382,
"grad_norm": 1.671875,
"learning_rate": 0.000465754060982803,
"loss": 5.7629,
"mean_token_accuracy": 0.1682858645915985,
"num_tokens": 39090783.0,
"step": 20970
},
{
"entropy": 6.041504192352295,
"epoch": 1.8522606852702226,
"grad_norm": 1.671875,
"learning_rate": 0.0004657373584518201,
"loss": 5.7796,
"mean_token_accuracy": 0.1750841662287712,
"num_tokens": 39100150.0,
"step": 20975
},
{
"entropy": 6.1106908321380615,
"epoch": 1.8527022253620629,
"grad_norm": 1.6796875,
"learning_rate": 0.000465720652184401,
"loss": 5.8314,
"mean_token_accuracy": 0.1686162233352661,
"num_tokens": 39109419.0,
"step": 20980
},
{
"entropy": 6.048003053665161,
"epoch": 1.8531437654539031,
"grad_norm": 2.09375,
"learning_rate": 0.0004657039421808726,
"loss": 5.6949,
"mean_token_accuracy": 0.177156201004982,
"num_tokens": 39118312.0,
"step": 20985
},
{
"entropy": 6.063169145584107,
"epoch": 1.8535853055457436,
"grad_norm": 2.65625,
"learning_rate": 0.00046568722844156254,
"loss": 5.8434,
"mean_token_accuracy": 0.16382675915956496,
"num_tokens": 39128169.0,
"step": 20990
},
{
"entropy": 6.022679281234741,
"epoch": 1.854026845637584,
"grad_norm": 2.1875,
"learning_rate": 0.00046567051096679807,
"loss": 5.7744,
"mean_token_accuracy": 0.1781610891222954,
"num_tokens": 39136790.0,
"step": 20995
},
{
"entropy": 6.035211133956909,
"epoch": 1.8544683857294242,
"grad_norm": 1.7109375,
"learning_rate": 0.0004656537897569068,
"loss": 5.7162,
"mean_token_accuracy": 0.18019587695598602,
"num_tokens": 39146974.0,
"step": 21000
},
{
"epoch": 1.8544683857294242,
"eval_entropy": 5.866296739081429,
"eval_loss": 5.825098991394043,
"eval_mean_token_accuracy": 0.17803571373920377,
"eval_num_tokens": 39146974.0,
"eval_runtime": 26.2669,
"eval_samples_per_second": 1344.467,
"eval_steps_per_second": 168.082,
"step": 21000
},
{
"entropy": 6.135365533828735,
"epoch": 1.8549099258212647,
"grad_norm": 2.90625,
"learning_rate": 0.0004656370648122161,
"loss": 5.9376,
"mean_token_accuracy": 0.1649667128920555,
"num_tokens": 39156910.0,
"step": 21005
},
{
"entropy": 6.097858619689942,
"epoch": 1.855351465913105,
"grad_norm": 2.140625,
"learning_rate": 0.00046562033613305377,
"loss": 5.8467,
"mean_token_accuracy": 0.16888533681631088,
"num_tokens": 39165790.0,
"step": 21010
},
{
"entropy": 6.024295949935913,
"epoch": 1.8557930060049452,
"grad_norm": 2.625,
"learning_rate": 0.0004656036037197475,
"loss": 5.6572,
"mean_token_accuracy": 0.18500449359416962,
"num_tokens": 39174811.0,
"step": 21015
},
{
"entropy": 6.015120553970337,
"epoch": 1.8562345460967857,
"grad_norm": 1.953125,
"learning_rate": 0.0004655868675726251,
"loss": 5.7801,
"mean_token_accuracy": 0.1673294946551323,
"num_tokens": 39184325.0,
"step": 21020
},
{
"entropy": 6.075020503997803,
"epoch": 1.8566760861886258,
"grad_norm": 1.9140625,
"learning_rate": 0.00046557012769201425,
"loss": 5.7258,
"mean_token_accuracy": 0.17503855526447296,
"num_tokens": 39194879.0,
"step": 21025
},
{
"entropy": 6.008840465545655,
"epoch": 1.8571176262804663,
"grad_norm": 1.84375,
"learning_rate": 0.000465553384078243,
"loss": 5.7628,
"mean_token_accuracy": 0.17720091193914414,
"num_tokens": 39204702.0,
"step": 21030
},
{
"entropy": 6.022570991516114,
"epoch": 1.8575591663723066,
"grad_norm": 1.8046875,
"learning_rate": 0.0004655366367316394,
"loss": 5.7927,
"mean_token_accuracy": 0.17439647763967514,
"num_tokens": 39214561.0,
"step": 21035
},
{
"entropy": 6.132090950012207,
"epoch": 1.8580007064641468,
"grad_norm": 1.8359375,
"learning_rate": 0.00046551988565253136,
"loss": 5.8719,
"mean_token_accuracy": 0.16283614486455916,
"num_tokens": 39224411.0,
"step": 21040
},
{
"entropy": 6.075593757629394,
"epoch": 1.8584422465559873,
"grad_norm": 1.6015625,
"learning_rate": 0.0004655031308412471,
"loss": 5.791,
"mean_token_accuracy": 0.1737430453300476,
"num_tokens": 39233422.0,
"step": 21045
},
{
"entropy": 6.099519920349121,
"epoch": 1.8588837866478276,
"grad_norm": 2.09375,
"learning_rate": 0.00046548637229811495,
"loss": 5.8132,
"mean_token_accuracy": 0.16328554302453996,
"num_tokens": 39243919.0,
"step": 21050
},
{
"entropy": 6.1206865310668945,
"epoch": 1.8593253267396679,
"grad_norm": 2.140625,
"learning_rate": 0.00046546961002346304,
"loss": 5.874,
"mean_token_accuracy": 0.16521138995885848,
"num_tokens": 39253682.0,
"step": 21055
},
{
"entropy": 6.071358633041382,
"epoch": 1.8597668668315084,
"grad_norm": 3.03125,
"learning_rate": 0.0004654528440176198,
"loss": 5.8386,
"mean_token_accuracy": 0.17449558824300765,
"num_tokens": 39263855.0,
"step": 21060
},
{
"entropy": 6.129558515548706,
"epoch": 1.8602084069233487,
"grad_norm": 1.9296875,
"learning_rate": 0.0004654360742809137,
"loss": 5.7443,
"mean_token_accuracy": 0.17492902874946595,
"num_tokens": 39272292.0,
"step": 21065
},
{
"entropy": 6.093110179901123,
"epoch": 1.860649947015189,
"grad_norm": 3.03125,
"learning_rate": 0.0004654193008136732,
"loss": 5.7356,
"mean_token_accuracy": 0.17502622455358505,
"num_tokens": 39281321.0,
"step": 21070
},
{
"entropy": 6.073567056655884,
"epoch": 1.8610914871070294,
"grad_norm": 1.7890625,
"learning_rate": 0.00046540252361622683,
"loss": 5.8748,
"mean_token_accuracy": 0.1652236357331276,
"num_tokens": 39292255.0,
"step": 21075
},
{
"entropy": 6.111558341979981,
"epoch": 1.8615330271988697,
"grad_norm": 2.28125,
"learning_rate": 0.00046538574268890334,
"loss": 5.7982,
"mean_token_accuracy": 0.1680863156914711,
"num_tokens": 39301841.0,
"step": 21080
},
{
"entropy": 6.094404840469361,
"epoch": 1.86197456729071,
"grad_norm": 2.390625,
"learning_rate": 0.00046536895803203144,
"loss": 5.7818,
"mean_token_accuracy": 0.16770751625299454,
"num_tokens": 39311238.0,
"step": 21085
},
{
"entropy": 6.105681228637695,
"epoch": 1.8624161073825505,
"grad_norm": 2.234375,
"learning_rate": 0.00046535216964593997,
"loss": 5.7863,
"mean_token_accuracy": 0.17535891830921174,
"num_tokens": 39319945.0,
"step": 21090
},
{
"entropy": 6.07252197265625,
"epoch": 1.8628576474743905,
"grad_norm": 3.421875,
"learning_rate": 0.0004653353775309576,
"loss": 5.7714,
"mean_token_accuracy": 0.17367388159036637,
"num_tokens": 39329436.0,
"step": 21095
},
{
"entropy": 6.078891944885254,
"epoch": 1.863299187566231,
"grad_norm": 1.6875,
"learning_rate": 0.0004653185816874136,
"loss": 5.7762,
"mean_token_accuracy": 0.178289033472538,
"num_tokens": 39338447.0,
"step": 21100
},
{
"entropy": 5.988069868087768,
"epoch": 1.8637407276580713,
"grad_norm": 2.359375,
"learning_rate": 0.0004653017821156368,
"loss": 5.702,
"mean_token_accuracy": 0.18608988970518112,
"num_tokens": 39346744.0,
"step": 21105
},
{
"entropy": 6.0559916496276855,
"epoch": 1.8641822677499116,
"grad_norm": 1.6328125,
"learning_rate": 0.0004652849788159563,
"loss": 5.8226,
"mean_token_accuracy": 0.16391983032226562,
"num_tokens": 39357402.0,
"step": 21110
},
{
"entropy": 6.141926574707031,
"epoch": 1.864623807841752,
"grad_norm": 1.6328125,
"learning_rate": 0.00046526817178870123,
"loss": 5.8003,
"mean_token_accuracy": 0.16666509360074996,
"num_tokens": 39366902.0,
"step": 21115
},
{
"entropy": 6.09144549369812,
"epoch": 1.8650653479335924,
"grad_norm": 1.9453125,
"learning_rate": 0.00046525136103420093,
"loss": 5.7816,
"mean_token_accuracy": 0.17256689220666885,
"num_tokens": 39376330.0,
"step": 21120
},
{
"entropy": 6.01424651145935,
"epoch": 1.8655068880254326,
"grad_norm": 2.046875,
"learning_rate": 0.00046523454655278466,
"loss": 5.7445,
"mean_token_accuracy": 0.17942257970571518,
"num_tokens": 39385926.0,
"step": 21125
},
{
"entropy": 6.084167432785034,
"epoch": 1.8659484281172731,
"grad_norm": 1.8359375,
"learning_rate": 0.0004652177283447818,
"loss": 5.7046,
"mean_token_accuracy": 0.17203551530838013,
"num_tokens": 39395558.0,
"step": 21130
},
{
"entropy": 6.086705875396729,
"epoch": 1.8663899682091134,
"grad_norm": 2.609375,
"learning_rate": 0.00046520090641052187,
"loss": 5.7853,
"mean_token_accuracy": 0.17685307562351227,
"num_tokens": 39405072.0,
"step": 21135
},
{
"entropy": 6.080677556991577,
"epoch": 1.8668315083009537,
"grad_norm": 1.6953125,
"learning_rate": 0.00046518408075033437,
"loss": 5.9015,
"mean_token_accuracy": 0.16817446202039718,
"num_tokens": 39414714.0,
"step": 21140
},
{
"entropy": 6.084312963485718,
"epoch": 1.8672730483927942,
"grad_norm": 2.921875,
"learning_rate": 0.0004651672513645488,
"loss": 5.6759,
"mean_token_accuracy": 0.17535320967435836,
"num_tokens": 39423189.0,
"step": 21145
},
{
"entropy": 6.040449380874634,
"epoch": 1.8677145884846345,
"grad_norm": 1.6328125,
"learning_rate": 0.00046515041825349505,
"loss": 5.8324,
"mean_token_accuracy": 0.1672353610396385,
"num_tokens": 39432791.0,
"step": 21150
},
{
"entropy": 6.094502973556518,
"epoch": 1.8681561285764747,
"grad_norm": 2.046875,
"learning_rate": 0.0004651335814175027,
"loss": 5.7778,
"mean_token_accuracy": 0.17120711058378218,
"num_tokens": 39442849.0,
"step": 21155
},
{
"entropy": 6.107310438156128,
"epoch": 1.8685976686683152,
"grad_norm": 2.34375,
"learning_rate": 0.00046511674085690155,
"loss": 5.7792,
"mean_token_accuracy": 0.16991094797849654,
"num_tokens": 39452171.0,
"step": 21160
},
{
"entropy": 6.060907888412475,
"epoch": 1.8690392087601553,
"grad_norm": 2.046875,
"learning_rate": 0.0004650998965720216,
"loss": 5.7817,
"mean_token_accuracy": 0.1692024677991867,
"num_tokens": 39460351.0,
"step": 21165
},
{
"entropy": 6.12179160118103,
"epoch": 1.8694807488519958,
"grad_norm": 1.515625,
"learning_rate": 0.00046508304856319283,
"loss": 5.845,
"mean_token_accuracy": 0.1692444384098053,
"num_tokens": 39470050.0,
"step": 21170
},
{
"entropy": 6.086332178115844,
"epoch": 1.869922288943836,
"grad_norm": 1.5234375,
"learning_rate": 0.00046506619683074526,
"loss": 5.7708,
"mean_token_accuracy": 0.17468780279159546,
"num_tokens": 39480192.0,
"step": 21175
},
{
"entropy": 6.081403350830078,
"epoch": 1.8703638290356763,
"grad_norm": 2.125,
"learning_rate": 0.00046504934137500903,
"loss": 5.8144,
"mean_token_accuracy": 0.17325816303491592,
"num_tokens": 39490118.0,
"step": 21180
},
{
"entropy": 6.10047869682312,
"epoch": 1.8708053691275168,
"grad_norm": 1.8515625,
"learning_rate": 0.00046503248219631417,
"loss": 5.8144,
"mean_token_accuracy": 0.1648593559861183,
"num_tokens": 39499173.0,
"step": 21185
},
{
"entropy": 6.01738748550415,
"epoch": 1.871246909219357,
"grad_norm": 1.8359375,
"learning_rate": 0.00046501561929499115,
"loss": 5.6884,
"mean_token_accuracy": 0.18093940168619155,
"num_tokens": 39508595.0,
"step": 21190
},
{
"entropy": 6.009029150009155,
"epoch": 1.8716884493111974,
"grad_norm": 2.171875,
"learning_rate": 0.00046499875267137016,
"loss": 5.7526,
"mean_token_accuracy": 0.18215204179286956,
"num_tokens": 39519300.0,
"step": 21195
},
{
"entropy": 6.099103403091431,
"epoch": 1.8721299894030379,
"grad_norm": 1.828125,
"learning_rate": 0.0004649818823257817,
"loss": 5.7796,
"mean_token_accuracy": 0.1701199606060982,
"num_tokens": 39527722.0,
"step": 21200
},
{
"entropy": 6.105059957504272,
"epoch": 1.8725715294948782,
"grad_norm": 1.6484375,
"learning_rate": 0.0004649650082585562,
"loss": 5.783,
"mean_token_accuracy": 0.1733989506959915,
"num_tokens": 39537063.0,
"step": 21205
},
{
"entropy": 6.077472305297851,
"epoch": 1.8730130695867184,
"grad_norm": 2.5625,
"learning_rate": 0.00046494813047002424,
"loss": 5.8031,
"mean_token_accuracy": 0.17570793777704238,
"num_tokens": 39546402.0,
"step": 21210
},
{
"entropy": 6.09699068069458,
"epoch": 1.873454609678559,
"grad_norm": 1.5,
"learning_rate": 0.00046493124896051634,
"loss": 5.7941,
"mean_token_accuracy": 0.17295222580432892,
"num_tokens": 39555877.0,
"step": 21215
},
{
"entropy": 6.06440281867981,
"epoch": 1.8738961497703992,
"grad_norm": 1.6796875,
"learning_rate": 0.00046491436373036346,
"loss": 5.7546,
"mean_token_accuracy": 0.17007897347211837,
"num_tokens": 39565153.0,
"step": 21220
},
{
"entropy": 6.101103162765503,
"epoch": 1.8743376898622395,
"grad_norm": 1.4765625,
"learning_rate": 0.0004648974747798961,
"loss": 5.7429,
"mean_token_accuracy": 0.17418258339166642,
"num_tokens": 39573775.0,
"step": 21225
},
{
"entropy": 6.108435535430909,
"epoch": 1.87477922995408,
"grad_norm": 1.5234375,
"learning_rate": 0.0004648805821094452,
"loss": 5.8542,
"mean_token_accuracy": 0.16847668439149857,
"num_tokens": 39583159.0,
"step": 21230
},
{
"entropy": 6.149360513687133,
"epoch": 1.87522077004592,
"grad_norm": 1.828125,
"learning_rate": 0.00046486368571934175,
"loss": 5.8518,
"mean_token_accuracy": 0.16708606481552124,
"num_tokens": 39592545.0,
"step": 21235
},
{
"entropy": 5.921206998825073,
"epoch": 1.8756623101377605,
"grad_norm": 2.140625,
"learning_rate": 0.0004648467856099167,
"loss": 5.6142,
"mean_token_accuracy": 0.18514120429754258,
"num_tokens": 39602059.0,
"step": 21240
},
{
"entropy": 6.039619064331054,
"epoch": 1.8761038502296008,
"grad_norm": 2.03125,
"learning_rate": 0.000464829881781501,
"loss": 5.7581,
"mean_token_accuracy": 0.17429224848747255,
"num_tokens": 39610777.0,
"step": 21245
},
{
"entropy": 6.100198459625244,
"epoch": 1.876545390321441,
"grad_norm": 2.171875,
"learning_rate": 0.00046481297423442593,
"loss": 5.8124,
"mean_token_accuracy": 0.17705283164978028,
"num_tokens": 39620782.0,
"step": 21250
},
{
"entropy": 6.184730052947998,
"epoch": 1.8769869304132816,
"grad_norm": 2.328125,
"learning_rate": 0.0004647960629690226,
"loss": 5.88,
"mean_token_accuracy": 0.16587981283664704,
"num_tokens": 39631340.0,
"step": 21255
},
{
"entropy": 5.984795045852661,
"epoch": 1.8774284705051218,
"grad_norm": 1.9296875,
"learning_rate": 0.0004647791479856223,
"loss": 5.6945,
"mean_token_accuracy": 0.17885422557592393,
"num_tokens": 39640361.0,
"step": 21260
},
{
"entropy": 6.075037336349487,
"epoch": 1.8778700105969621,
"grad_norm": 2.8125,
"learning_rate": 0.0004647622292845566,
"loss": 5.769,
"mean_token_accuracy": 0.17034107595682144,
"num_tokens": 39649726.0,
"step": 21265
},
{
"entropy": 6.0884318351745605,
"epoch": 1.8783115506888026,
"grad_norm": 1.671875,
"learning_rate": 0.0004647453068661566,
"loss": 5.8238,
"mean_token_accuracy": 0.16935776472091674,
"num_tokens": 39660226.0,
"step": 21270
},
{
"entropy": 5.9866156578063965,
"epoch": 1.878753090780643,
"grad_norm": 1.515625,
"learning_rate": 0.00046472838073075397,
"loss": 5.6078,
"mean_token_accuracy": 0.1799155965447426,
"num_tokens": 39668731.0,
"step": 21275
},
{
"entropy": 5.983852481842041,
"epoch": 1.8791946308724832,
"grad_norm": 1.59375,
"learning_rate": 0.00046471145087868034,
"loss": 5.7755,
"mean_token_accuracy": 0.1791406601667404,
"num_tokens": 39678465.0,
"step": 21280
},
{
"entropy": 6.017435693740845,
"epoch": 1.8796361709643237,
"grad_norm": 2.125,
"learning_rate": 0.00046469451731026725,
"loss": 5.6255,
"mean_token_accuracy": 0.18734701424837114,
"num_tokens": 39687057.0,
"step": 21285
},
{
"entropy": 6.023979806900025,
"epoch": 1.880077711056164,
"grad_norm": 2.796875,
"learning_rate": 0.0004646775800258464,
"loss": 5.7701,
"mean_token_accuracy": 0.177572663128376,
"num_tokens": 39696387.0,
"step": 21290
},
{
"entropy": 6.067063474655152,
"epoch": 1.8805192511480042,
"grad_norm": 1.828125,
"learning_rate": 0.00046466063902574973,
"loss": 5.7271,
"mean_token_accuracy": 0.1749122679233551,
"num_tokens": 39705756.0,
"step": 21295
},
{
"entropy": 6.072690725326538,
"epoch": 1.8809607912398447,
"grad_norm": 1.6484375,
"learning_rate": 0.00046464369431030894,
"loss": 5.717,
"mean_token_accuracy": 0.18112643510103227,
"num_tokens": 39713916.0,
"step": 21300
},
{
"entropy": 6.050394487380982,
"epoch": 1.8814023313316848,
"grad_norm": 1.5078125,
"learning_rate": 0.000464626745879856,
"loss": 5.8434,
"mean_token_accuracy": 0.17030081301927566,
"num_tokens": 39722920.0,
"step": 21305
},
{
"entropy": 6.160668277740479,
"epoch": 1.8818438714235253,
"grad_norm": 1.8671875,
"learning_rate": 0.000464609793734723,
"loss": 5.8355,
"mean_token_accuracy": 0.16978947967290878,
"num_tokens": 39732217.0,
"step": 21310
},
{
"entropy": 6.036292648315429,
"epoch": 1.8822854115153655,
"grad_norm": 2.109375,
"learning_rate": 0.000464592837875242,
"loss": 5.6733,
"mean_token_accuracy": 0.17855063825845718,
"num_tokens": 39741636.0,
"step": 21315
},
{
"entropy": 6.044407558441162,
"epoch": 1.8827269516072058,
"grad_norm": 2.25,
"learning_rate": 0.0004645758783017451,
"loss": 5.7952,
"mean_token_accuracy": 0.17352866530418395,
"num_tokens": 39751457.0,
"step": 21320
},
{
"entropy": 6.147983884811401,
"epoch": 1.8831684916990463,
"grad_norm": 2.0625,
"learning_rate": 0.00046455891501456456,
"loss": 5.7457,
"mean_token_accuracy": 0.17621436417102815,
"num_tokens": 39760308.0,
"step": 21325
},
{
"entropy": 6.018049001693726,
"epoch": 1.8836100317908866,
"grad_norm": 2.046875,
"learning_rate": 0.00046454194801403274,
"loss": 5.718,
"mean_token_accuracy": 0.18105508685111998,
"num_tokens": 39770002.0,
"step": 21330
},
{
"entropy": 5.941642427444458,
"epoch": 1.8840515718827269,
"grad_norm": 1.6015625,
"learning_rate": 0.0004645249773004819,
"loss": 5.7319,
"mean_token_accuracy": 0.17071604132652282,
"num_tokens": 39779043.0,
"step": 21335
},
{
"entropy": 6.134444856643677,
"epoch": 1.8844931119745674,
"grad_norm": 1.796875,
"learning_rate": 0.00046450800287424455,
"loss": 5.7786,
"mean_token_accuracy": 0.16829513013362885,
"num_tokens": 39788545.0,
"step": 21340
},
{
"entropy": 6.06839804649353,
"epoch": 1.8849346520664076,
"grad_norm": 2.140625,
"learning_rate": 0.0004644910247356532,
"loss": 5.679,
"mean_token_accuracy": 0.1835016429424286,
"num_tokens": 39798063.0,
"step": 21345
},
{
"entropy": 6.07654447555542,
"epoch": 1.885376192158248,
"grad_norm": 1.6640625,
"learning_rate": 0.0004644740428850404,
"loss": 5.7229,
"mean_token_accuracy": 0.17949128597974778,
"num_tokens": 39808622.0,
"step": 21350
},
{
"entropy": 6.07477560043335,
"epoch": 1.8858177322500884,
"grad_norm": 2.125,
"learning_rate": 0.0004644570573227389,
"loss": 5.8295,
"mean_token_accuracy": 0.1689848706126213,
"num_tokens": 39817608.0,
"step": 21355
},
{
"entropy": 6.01876745223999,
"epoch": 1.8862592723419287,
"grad_norm": 1.4375,
"learning_rate": 0.00046444006804908144,
"loss": 5.644,
"mean_token_accuracy": 0.18817944526672364,
"num_tokens": 39826055.0,
"step": 21360
},
{
"entropy": 5.917807292938233,
"epoch": 1.886700812433769,
"grad_norm": 1.765625,
"learning_rate": 0.0004644230750644007,
"loss": 5.6717,
"mean_token_accuracy": 0.18198802024126054,
"num_tokens": 39835490.0,
"step": 21365
},
{
"entropy": 6.037832450866699,
"epoch": 1.8871423525256095,
"grad_norm": 2.25,
"learning_rate": 0.00046440607836902974,
"loss": 5.7751,
"mean_token_accuracy": 0.18150360733270646,
"num_tokens": 39845613.0,
"step": 21370
},
{
"entropy": 6.088324546813965,
"epoch": 1.8875838926174495,
"grad_norm": 3.015625,
"learning_rate": 0.00046438907796330145,
"loss": 5.7455,
"mean_token_accuracy": 0.1753924757242203,
"num_tokens": 39854495.0,
"step": 21375
},
{
"entropy": 6.057007789611816,
"epoch": 1.88802543270929,
"grad_norm": 2.5,
"learning_rate": 0.00046437207384754874,
"loss": 5.7922,
"mean_token_accuracy": 0.17157539427280427,
"num_tokens": 39864528.0,
"step": 21380
},
{
"entropy": 6.088843727111817,
"epoch": 1.8884669728011303,
"grad_norm": 1.984375,
"learning_rate": 0.0004643550660221048,
"loss": 5.8425,
"mean_token_accuracy": 0.17227490097284318,
"num_tokens": 39873780.0,
"step": 21385
},
{
"entropy": 5.991315031051636,
"epoch": 1.8889085128929706,
"grad_norm": 1.8203125,
"learning_rate": 0.00046433805448730287,
"loss": 5.6434,
"mean_token_accuracy": 0.18277385979890823,
"num_tokens": 39882529.0,
"step": 21390
},
{
"entropy": 6.129056549072265,
"epoch": 1.889350052984811,
"grad_norm": 3.046875,
"learning_rate": 0.0004643210392434761,
"loss": 5.7503,
"mean_token_accuracy": 0.17712734043598174,
"num_tokens": 39890688.0,
"step": 21395
},
{
"entropy": 6.076018905639648,
"epoch": 1.8897915930766513,
"grad_norm": 2.1875,
"learning_rate": 0.00046430402029095784,
"loss": 5.8076,
"mean_token_accuracy": 0.16346725523471833,
"num_tokens": 39900849.0,
"step": 21400
},
{
"entropy": 5.984839725494385,
"epoch": 1.8902331331684916,
"grad_norm": 1.7421875,
"learning_rate": 0.0004642869976300815,
"loss": 5.7884,
"mean_token_accuracy": 0.17170612514019012,
"num_tokens": 39911297.0,
"step": 21405
},
{
"entropy": 6.033878421783447,
"epoch": 1.8906746732603321,
"grad_norm": 2.375,
"learning_rate": 0.0004642699712611806,
"loss": 5.7339,
"mean_token_accuracy": 0.17857350409030914,
"num_tokens": 39920312.0,
"step": 21410
},
{
"entropy": 6.052636432647705,
"epoch": 1.8911162133521724,
"grad_norm": 1.6796875,
"learning_rate": 0.0004642529411845885,
"loss": 5.7935,
"mean_token_accuracy": 0.17192422598600388,
"num_tokens": 39930128.0,
"step": 21415
},
{
"entropy": 6.079101848602295,
"epoch": 1.8915577534440127,
"grad_norm": 1.7890625,
"learning_rate": 0.0004642359074006389,
"loss": 5.742,
"mean_token_accuracy": 0.17703825533390044,
"num_tokens": 39939177.0,
"step": 21420
},
{
"entropy": 6.140759372711182,
"epoch": 1.8919992935358532,
"grad_norm": 1.9140625,
"learning_rate": 0.0004642188699096656,
"loss": 5.8495,
"mean_token_accuracy": 0.16658061146736144,
"num_tokens": 39948537.0,
"step": 21425
},
{
"entropy": 6.0546338081359865,
"epoch": 1.8924408336276934,
"grad_norm": 1.8046875,
"learning_rate": 0.0004642018287120022,
"loss": 5.7563,
"mean_token_accuracy": 0.17082998007535935,
"num_tokens": 39958623.0,
"step": 21430
},
{
"entropy": 6.084066486358642,
"epoch": 1.8928823737195337,
"grad_norm": 2.4375,
"learning_rate": 0.00046418478380798263,
"loss": 5.8497,
"mean_token_accuracy": 0.17032973617315292,
"num_tokens": 39968736.0,
"step": 21435
},
{
"entropy": 5.95973949432373,
"epoch": 1.8933239138113742,
"grad_norm": 1.5390625,
"learning_rate": 0.0004641677351979407,
"loss": 5.6754,
"mean_token_accuracy": 0.17411395013332367,
"num_tokens": 39977600.0,
"step": 21440
},
{
"entropy": 6.06945948600769,
"epoch": 1.8937654539032143,
"grad_norm": 1.8984375,
"learning_rate": 0.0004641506828822104,
"loss": 5.7929,
"mean_token_accuracy": 0.16968916952610016,
"num_tokens": 39987808.0,
"step": 21445
},
{
"entropy": 6.1501692771911625,
"epoch": 1.8942069939950548,
"grad_norm": 2.71875,
"learning_rate": 0.0004641336268611258,
"loss": 5.9235,
"mean_token_accuracy": 0.17036756575107576,
"num_tokens": 39998553.0,
"step": 21450
},
{
"entropy": 6.149128675460815,
"epoch": 1.894648534086895,
"grad_norm": 1.5703125,
"learning_rate": 0.00046411656713502106,
"loss": 5.8233,
"mean_token_accuracy": 0.16666509658098222,
"num_tokens": 40007529.0,
"step": 21455
},
{
"entropy": 6.117443180084228,
"epoch": 1.8950900741787353,
"grad_norm": 2.03125,
"learning_rate": 0.0004640995037042303,
"loss": 5.8246,
"mean_token_accuracy": 0.16539626717567443,
"num_tokens": 40017116.0,
"step": 21460
},
{
"entropy": 6.140552806854248,
"epoch": 1.8955316142705758,
"grad_norm": 1.59375,
"learning_rate": 0.0004640824365690878,
"loss": 5.8436,
"mean_token_accuracy": 0.17578538209199907,
"num_tokens": 40026601.0,
"step": 21465
},
{
"entropy": 6.057326221466065,
"epoch": 1.895973154362416,
"grad_norm": 1.5,
"learning_rate": 0.00046406536572992795,
"loss": 5.7432,
"mean_token_accuracy": 0.17890304327011108,
"num_tokens": 40036029.0,
"step": 21470
},
{
"entropy": 6.1155970096588135,
"epoch": 1.8964146944542564,
"grad_norm": 5.9375,
"learning_rate": 0.000464048291187085,
"loss": 5.7796,
"mean_token_accuracy": 0.16792111545801164,
"num_tokens": 40045892.0,
"step": 21475
},
{
"entropy": 6.098463773727417,
"epoch": 1.8968562345460969,
"grad_norm": 1.7109375,
"learning_rate": 0.0004640312129408936,
"loss": 5.7516,
"mean_token_accuracy": 0.17549518942832948,
"num_tokens": 40055411.0,
"step": 21480
},
{
"entropy": 6.060862970352173,
"epoch": 1.8972977746379371,
"grad_norm": 2.234375,
"learning_rate": 0.0004640141309916883,
"loss": 5.8013,
"mean_token_accuracy": 0.1727372333407402,
"num_tokens": 40063988.0,
"step": 21485
},
{
"entropy": 6.022618675231934,
"epoch": 1.8977393147297774,
"grad_norm": 1.6796875,
"learning_rate": 0.0004639970453398037,
"loss": 5.7537,
"mean_token_accuracy": 0.17715173810720444,
"num_tokens": 40072671.0,
"step": 21490
},
{
"entropy": 6.104068803787231,
"epoch": 1.898180854821618,
"grad_norm": 3.203125,
"learning_rate": 0.00046397995598557434,
"loss": 5.8554,
"mean_token_accuracy": 0.17143211960792543,
"num_tokens": 40082191.0,
"step": 21495
},
{
"entropy": 6.055403184890747,
"epoch": 1.8986223949134582,
"grad_norm": 1.75,
"learning_rate": 0.0004639628629293352,
"loss": 5.7933,
"mean_token_accuracy": 0.17402841448783873,
"num_tokens": 40090823.0,
"step": 21500
},
{
"entropy": 6.112652444839478,
"epoch": 1.8990639350052985,
"grad_norm": 1.4453125,
"learning_rate": 0.000463945766171421,
"loss": 5.7793,
"mean_token_accuracy": 0.1678495079278946,
"num_tokens": 40099825.0,
"step": 21505
},
{
"entropy": 6.146155118942261,
"epoch": 1.899505475097139,
"grad_norm": 1.71875,
"learning_rate": 0.0004639286657121668,
"loss": 5.7853,
"mean_token_accuracy": 0.17231134921312333,
"num_tokens": 40109589.0,
"step": 21510
},
{
"entropy": 6.041150856018066,
"epoch": 1.899947015188979,
"grad_norm": 2.484375,
"learning_rate": 0.0004639115615519074,
"loss": 5.7291,
"mean_token_accuracy": 0.17268815636634827,
"num_tokens": 40119194.0,
"step": 21515
},
{
"entropy": 6.062903594970703,
"epoch": 1.9003885552808195,
"grad_norm": 1.7734375,
"learning_rate": 0.000463894453690978,
"loss": 5.7934,
"mean_token_accuracy": 0.17083767503499986,
"num_tokens": 40128184.0,
"step": 21520
},
{
"entropy": 6.035384654998779,
"epoch": 1.9008300953726598,
"grad_norm": 1.7890625,
"learning_rate": 0.00046387734212971363,
"loss": 5.8315,
"mean_token_accuracy": 0.1676638215780258,
"num_tokens": 40137842.0,
"step": 21525
},
{
"entropy": 6.090236568450928,
"epoch": 1.9012716354645,
"grad_norm": 1.640625,
"learning_rate": 0.0004638602268684496,
"loss": 5.7776,
"mean_token_accuracy": 0.16683500111103058,
"num_tokens": 40147151.0,
"step": 21530
},
{
"entropy": 6.068207168579102,
"epoch": 1.9017131755563406,
"grad_norm": 1.9921875,
"learning_rate": 0.00046384310790752105,
"loss": 5.7367,
"mean_token_accuracy": 0.17374347895383835,
"num_tokens": 40157170.0,
"step": 21535
},
{
"entropy": 6.029587364196777,
"epoch": 1.9021547156481808,
"grad_norm": 1.65625,
"learning_rate": 0.0004638259852472635,
"loss": 5.7499,
"mean_token_accuracy": 0.17234230488538743,
"num_tokens": 40166787.0,
"step": 21540
},
{
"entropy": 6.095239543914795,
"epoch": 1.9025962557400211,
"grad_norm": 3.09375,
"learning_rate": 0.0004638088588880122,
"loss": 5.7096,
"mean_token_accuracy": 0.18185692727565766,
"num_tokens": 40176640.0,
"step": 21545
},
{
"entropy": 6.050916719436645,
"epoch": 1.9030377958318616,
"grad_norm": 1.6875,
"learning_rate": 0.0004637917288301029,
"loss": 5.7699,
"mean_token_accuracy": 0.1757751688361168,
"num_tokens": 40185732.0,
"step": 21550
},
{
"entropy": 6.083056449890137,
"epoch": 1.9034793359237019,
"grad_norm": 1.765625,
"learning_rate": 0.0004637745950738709,
"loss": 5.694,
"mean_token_accuracy": 0.17635063380002974,
"num_tokens": 40194798.0,
"step": 21555
},
{
"entropy": 6.073479747772216,
"epoch": 1.9039208760155422,
"grad_norm": 1.421875,
"learning_rate": 0.0004637574576196519,
"loss": 5.8824,
"mean_token_accuracy": 0.16456176340579987,
"num_tokens": 40204507.0,
"step": 21560
},
{
"entropy": 6.152085828781128,
"epoch": 1.9043624161073827,
"grad_norm": 1.6796875,
"learning_rate": 0.0004637403164677817,
"loss": 5.7885,
"mean_token_accuracy": 0.1636299803853035,
"num_tokens": 40213546.0,
"step": 21565
},
{
"entropy": 6.091641998291015,
"epoch": 1.904803956199223,
"grad_norm": 1.75,
"learning_rate": 0.00046372317161859605,
"loss": 5.7327,
"mean_token_accuracy": 0.17367458045482637,
"num_tokens": 40222571.0,
"step": 21570
},
{
"entropy": 6.077237701416015,
"epoch": 1.9052454962910632,
"grad_norm": 1.4609375,
"learning_rate": 0.00046370602307243083,
"loss": 5.8123,
"mean_token_accuracy": 0.1672673001885414,
"num_tokens": 40231803.0,
"step": 21575
},
{
"entropy": 6.060307025909424,
"epoch": 1.9056870363829037,
"grad_norm": 1.6796875,
"learning_rate": 0.00046368887082962187,
"loss": 5.8597,
"mean_token_accuracy": 0.16779260486364364,
"num_tokens": 40241755.0,
"step": 21580
},
{
"entropy": 6.05626916885376,
"epoch": 1.9061285764747438,
"grad_norm": 1.5,
"learning_rate": 0.0004636717148905053,
"loss": 5.7286,
"mean_token_accuracy": 0.17615480422973634,
"num_tokens": 40250963.0,
"step": 21585
},
{
"entropy": 6.126344108581543,
"epoch": 1.9065701165665843,
"grad_norm": 2.0,
"learning_rate": 0.0004636545552554171,
"loss": 5.7604,
"mean_token_accuracy": 0.17354899942874907,
"num_tokens": 40260626.0,
"step": 21590
},
{
"entropy": 6.020497894287109,
"epoch": 1.9070116566584245,
"grad_norm": 1.65625,
"learning_rate": 0.0004636373919246935,
"loss": 5.7355,
"mean_token_accuracy": 0.17540322691202165,
"num_tokens": 40269852.0,
"step": 21595
},
{
"entropy": 5.995649003982544,
"epoch": 1.9074531967502648,
"grad_norm": 1.5,
"learning_rate": 0.0004636202248986707,
"loss": 5.7468,
"mean_token_accuracy": 0.1775655597448349,
"num_tokens": 40279499.0,
"step": 21600
},
{
"entropy": 6.144084215164185,
"epoch": 1.9078947368421053,
"grad_norm": 1.3359375,
"learning_rate": 0.00046360305417768484,
"loss": 5.842,
"mean_token_accuracy": 0.1675044909119606,
"num_tokens": 40288131.0,
"step": 21605
},
{
"entropy": 6.086666679382324,
"epoch": 1.9083362769339456,
"grad_norm": 1.6328125,
"learning_rate": 0.0004635858797620725,
"loss": 5.7848,
"mean_token_accuracy": 0.16797549724578859,
"num_tokens": 40296951.0,
"step": 21610
},
{
"entropy": 6.02653751373291,
"epoch": 1.9087778170257859,
"grad_norm": 1.6640625,
"learning_rate": 0.00046356870165217004,
"loss": 5.7228,
"mean_token_accuracy": 0.17867209762334824,
"num_tokens": 40306250.0,
"step": 21615
},
{
"entropy": 5.973859596252441,
"epoch": 1.9092193571176264,
"grad_norm": 1.9453125,
"learning_rate": 0.00046355151984831395,
"loss": 5.6628,
"mean_token_accuracy": 0.18175569772720337,
"num_tokens": 40314561.0,
"step": 21620
},
{
"entropy": 5.983509254455567,
"epoch": 1.9096608972094666,
"grad_norm": 1.8828125,
"learning_rate": 0.00046353433435084083,
"loss": 5.6687,
"mean_token_accuracy": 0.17508445382118226,
"num_tokens": 40323580.0,
"step": 21625
},
{
"entropy": 6.046861267089843,
"epoch": 1.910102437301307,
"grad_norm": 1.5703125,
"learning_rate": 0.0004635171451600872,
"loss": 5.7508,
"mean_token_accuracy": 0.17389056086540222,
"num_tokens": 40333747.0,
"step": 21630
},
{
"entropy": 6.1338011741638185,
"epoch": 1.9105439773931474,
"grad_norm": 1.890625,
"learning_rate": 0.00046349995227639015,
"loss": 5.8387,
"mean_token_accuracy": 0.1749846324324608,
"num_tokens": 40343435.0,
"step": 21635
},
{
"entropy": 6.089724588394165,
"epoch": 1.9109855174849877,
"grad_norm": 1.8046875,
"learning_rate": 0.0004634827557000861,
"loss": 5.838,
"mean_token_accuracy": 0.16959740370512008,
"num_tokens": 40353282.0,
"step": 21640
},
{
"entropy": 6.111279678344727,
"epoch": 1.911427057576828,
"grad_norm": 1.90625,
"learning_rate": 0.000463465555431512,
"loss": 5.8444,
"mean_token_accuracy": 0.16848036348819734,
"num_tokens": 40363781.0,
"step": 21645
},
{
"entropy": 6.10241003036499,
"epoch": 1.9118685976686685,
"grad_norm": 1.9375,
"learning_rate": 0.00046344835147100495,
"loss": 5.7694,
"mean_token_accuracy": 0.16970350593328476,
"num_tokens": 40373240.0,
"step": 21650
},
{
"entropy": 6.080345821380615,
"epoch": 1.9123101377605085,
"grad_norm": 1.359375,
"learning_rate": 0.00046343114381890187,
"loss": 5.8498,
"mean_token_accuracy": 0.1726846769452095,
"num_tokens": 40383088.0,
"step": 21655
},
{
"entropy": 6.126946592330933,
"epoch": 1.912751677852349,
"grad_norm": 1.8828125,
"learning_rate": 0.0004634139324755398,
"loss": 5.7771,
"mean_token_accuracy": 0.17600300461053847,
"num_tokens": 40391654.0,
"step": 21660
},
{
"entropy": 6.006144571304321,
"epoch": 1.9131932179441893,
"grad_norm": 1.421875,
"learning_rate": 0.000463396717441256,
"loss": 5.669,
"mean_token_accuracy": 0.18655876070261002,
"num_tokens": 40400616.0,
"step": 21665
},
{
"entropy": 5.983450841903687,
"epoch": 1.9136347580360296,
"grad_norm": 1.8671875,
"learning_rate": 0.0004633794987163876,
"loss": 5.7724,
"mean_token_accuracy": 0.16597645729780197,
"num_tokens": 40411271.0,
"step": 21670
},
{
"entropy": 6.093260717391968,
"epoch": 1.91407629812787,
"grad_norm": 1.6015625,
"learning_rate": 0.00046336227630127205,
"loss": 5.6666,
"mean_token_accuracy": 0.17415802478790282,
"num_tokens": 40420019.0,
"step": 21675
},
{
"entropy": 6.032818412780761,
"epoch": 1.9145178382197103,
"grad_norm": 1.8046875,
"learning_rate": 0.00046334505019624656,
"loss": 5.7701,
"mean_token_accuracy": 0.17822012901306153,
"num_tokens": 40429858.0,
"step": 21680
},
{
"entropy": 5.983961677551269,
"epoch": 1.9149593783115506,
"grad_norm": 1.2734375,
"learning_rate": 0.00046332782040164867,
"loss": 5.7395,
"mean_token_accuracy": 0.17695232331752778,
"num_tokens": 40439566.0,
"step": 21685
},
{
"entropy": 6.073855972290039,
"epoch": 1.915400918403391,
"grad_norm": 1.4375,
"learning_rate": 0.0004633105869178159,
"loss": 5.6965,
"mean_token_accuracy": 0.178903292119503,
"num_tokens": 40448527.0,
"step": 21690
},
{
"entropy": 6.043253803253174,
"epoch": 1.9158424584952314,
"grad_norm": 3.0625,
"learning_rate": 0.0004632933497450858,
"loss": 5.713,
"mean_token_accuracy": 0.1795162469148636,
"num_tokens": 40458076.0,
"step": 21695
},
{
"entropy": 5.974893999099732,
"epoch": 1.9162839985870717,
"grad_norm": 1.6875,
"learning_rate": 0.0004632761088837961,
"loss": 5.65,
"mean_token_accuracy": 0.18878050595521928,
"num_tokens": 40467639.0,
"step": 21700
},
{
"entropy": 6.1015462398529055,
"epoch": 1.9167255386789122,
"grad_norm": 1.734375,
"learning_rate": 0.00046325886433428446,
"loss": 5.7347,
"mean_token_accuracy": 0.178841033577919,
"num_tokens": 40476243.0,
"step": 21705
},
{
"entropy": 6.0703754901885985,
"epoch": 1.9171670787707524,
"grad_norm": 1.5078125,
"learning_rate": 0.00046324161609688876,
"loss": 5.8037,
"mean_token_accuracy": 0.17824887931346894,
"num_tokens": 40485789.0,
"step": 21710
},
{
"entropy": 5.996189832687378,
"epoch": 1.9176086188625927,
"grad_norm": 1.4296875,
"learning_rate": 0.0004632243641719469,
"loss": 5.694,
"mean_token_accuracy": 0.1799496278166771,
"num_tokens": 40494139.0,
"step": 21715
},
{
"entropy": 6.055416917800903,
"epoch": 1.9180501589544332,
"grad_norm": 1.8046875,
"learning_rate": 0.00046320710855979677,
"loss": 5.7247,
"mean_token_accuracy": 0.17279697507619857,
"num_tokens": 40503965.0,
"step": 21720
},
{
"entropy": 6.1253358840942385,
"epoch": 1.9184916990462733,
"grad_norm": 2.109375,
"learning_rate": 0.00046318984926077637,
"loss": 5.7299,
"mean_token_accuracy": 0.1804726928472519,
"num_tokens": 40513140.0,
"step": 21725
},
{
"entropy": 5.960893869400024,
"epoch": 1.9189332391381138,
"grad_norm": 1.5390625,
"learning_rate": 0.00046317258627522393,
"loss": 5.7226,
"mean_token_accuracy": 0.1799830436706543,
"num_tokens": 40522858.0,
"step": 21730
},
{
"entropy": 5.985560750961303,
"epoch": 1.919374779229954,
"grad_norm": 1.359375,
"learning_rate": 0.0004631553196034774,
"loss": 5.7297,
"mean_token_accuracy": 0.17800479531288146,
"num_tokens": 40532050.0,
"step": 21735
},
{
"entropy": 6.056699609756469,
"epoch": 1.9198163193217943,
"grad_norm": 1.6171875,
"learning_rate": 0.0004631380492458753,
"loss": 5.72,
"mean_token_accuracy": 0.17297832071781158,
"num_tokens": 40540942.0,
"step": 21740
},
{
"entropy": 6.04608907699585,
"epoch": 1.9202578594136348,
"grad_norm": 2.03125,
"learning_rate": 0.0004631207752027558,
"loss": 5.756,
"mean_token_accuracy": 0.17675181329250336,
"num_tokens": 40550158.0,
"step": 21745
},
{
"entropy": 6.089682483673096,
"epoch": 1.920699399505475,
"grad_norm": 1.5546875,
"learning_rate": 0.0004631034974744573,
"loss": 5.869,
"mean_token_accuracy": 0.16383618116378784,
"num_tokens": 40559267.0,
"step": 21750
},
{
"entropy": 6.0691934585571286,
"epoch": 1.9211409395973154,
"grad_norm": 1.7109375,
"learning_rate": 0.0004630862160613183,
"loss": 5.7564,
"mean_token_accuracy": 0.1689904287457466,
"num_tokens": 40568503.0,
"step": 21755
},
{
"entropy": 6.059663534164429,
"epoch": 1.9215824796891559,
"grad_norm": 1.328125,
"learning_rate": 0.0004630689309636772,
"loss": 5.7087,
"mean_token_accuracy": 0.17780935615301133,
"num_tokens": 40578464.0,
"step": 21760
},
{
"entropy": 6.133597755432129,
"epoch": 1.9220240197809961,
"grad_norm": 1.4453125,
"learning_rate": 0.0004630516421818728,
"loss": 5.8724,
"mean_token_accuracy": 0.16706262081861495,
"num_tokens": 40588338.0,
"step": 21765
},
{
"entropy": 6.033979225158691,
"epoch": 1.9224655598728364,
"grad_norm": 1.625,
"learning_rate": 0.00046303434971624357,
"loss": 5.7391,
"mean_token_accuracy": 0.17355332374572754,
"num_tokens": 40598912.0,
"step": 21770
},
{
"entropy": 5.944955110549927,
"epoch": 1.922907099964677,
"grad_norm": 1.5234375,
"learning_rate": 0.00046301705356712846,
"loss": 5.6262,
"mean_token_accuracy": 0.17940857857465745,
"num_tokens": 40607084.0,
"step": 21775
},
{
"entropy": 6.073167228698731,
"epoch": 1.9233486400565172,
"grad_norm": 1.765625,
"learning_rate": 0.00046299975373486626,
"loss": 5.7442,
"mean_token_accuracy": 0.17020898759365083,
"num_tokens": 40616422.0,
"step": 21780
},
{
"entropy": 5.979709911346435,
"epoch": 1.9237901801483575,
"grad_norm": 2.0625,
"learning_rate": 0.0004629824502197956,
"loss": 5.702,
"mean_token_accuracy": 0.17826833724975585,
"num_tokens": 40626189.0,
"step": 21785
},
{
"entropy": 5.949887752532959,
"epoch": 1.924231720240198,
"grad_norm": 2.4375,
"learning_rate": 0.00046296514302225585,
"loss": 5.6749,
"mean_token_accuracy": 0.17708094269037247,
"num_tokens": 40636053.0,
"step": 21790
},
{
"entropy": 6.107101058959961,
"epoch": 1.924673260332038,
"grad_norm": 2.0625,
"learning_rate": 0.0004629478321425858,
"loss": 5.7861,
"mean_token_accuracy": 0.16697369813919066,
"num_tokens": 40645159.0,
"step": 21795
},
{
"entropy": 6.032732057571411,
"epoch": 1.9251148004238785,
"grad_norm": 1.7578125,
"learning_rate": 0.00046293051758112457,
"loss": 5.6586,
"mean_token_accuracy": 0.18280881345272065,
"num_tokens": 40653890.0,
"step": 21800
},
{
"entropy": 6.058666467666626,
"epoch": 1.9255563405157188,
"grad_norm": 1.8515625,
"learning_rate": 0.00046291319933821143,
"loss": 5.8146,
"mean_token_accuracy": 0.16956128776073456,
"num_tokens": 40663041.0,
"step": 21805
},
{
"entropy": 6.004148149490357,
"epoch": 1.925997880607559,
"grad_norm": 1.9296875,
"learning_rate": 0.00046289587741418553,
"loss": 5.6788,
"mean_token_accuracy": 0.17580487877130507,
"num_tokens": 40670972.0,
"step": 21810
},
{
"entropy": 6.059286069869995,
"epoch": 1.9264394206993996,
"grad_norm": 1.5390625,
"learning_rate": 0.00046287855180938633,
"loss": 5.797,
"mean_token_accuracy": 0.18182128816843032,
"num_tokens": 40680503.0,
"step": 21815
},
{
"entropy": 6.124375200271606,
"epoch": 1.9268809607912398,
"grad_norm": 4.125,
"learning_rate": 0.00046286122252415303,
"loss": 5.8108,
"mean_token_accuracy": 0.1730355516076088,
"num_tokens": 40691339.0,
"step": 21820
},
{
"entropy": 6.136557292938233,
"epoch": 1.92732250088308,
"grad_norm": 1.2578125,
"learning_rate": 0.00046284388955882526,
"loss": 5.7663,
"mean_token_accuracy": 0.17071108371019364,
"num_tokens": 40699744.0,
"step": 21825
},
{
"entropy": 6.0857892513275145,
"epoch": 1.9277640409749206,
"grad_norm": 1.6328125,
"learning_rate": 0.00046282655291374257,
"loss": 5.7672,
"mean_token_accuracy": 0.17367175668478013,
"num_tokens": 40709144.0,
"step": 21830
},
{
"entropy": 6.017265462875367,
"epoch": 1.9282055810667609,
"grad_norm": 1.6875,
"learning_rate": 0.00046280921258924455,
"loss": 5.8241,
"mean_token_accuracy": 0.16931818127632142,
"num_tokens": 40719513.0,
"step": 21835
},
{
"entropy": 6.071667098999024,
"epoch": 1.9286471211586012,
"grad_norm": 1.453125,
"learning_rate": 0.00046279186858567083,
"loss": 5.7687,
"mean_token_accuracy": 0.16924327313899995,
"num_tokens": 40728846.0,
"step": 21840
},
{
"entropy": 6.034422206878662,
"epoch": 1.9290886612504416,
"grad_norm": 1.5859375,
"learning_rate": 0.0004627745209033613,
"loss": 5.6882,
"mean_token_accuracy": 0.18305966407060623,
"num_tokens": 40737904.0,
"step": 21845
},
{
"entropy": 6.0015740394592285,
"epoch": 1.929530201342282,
"grad_norm": 1.6171875,
"learning_rate": 0.0004627571695426556,
"loss": 5.6944,
"mean_token_accuracy": 0.18785876482725145,
"num_tokens": 40747328.0,
"step": 21850
},
{
"entropy": 6.060842037200928,
"epoch": 1.9299717414341222,
"grad_norm": 1.4921875,
"learning_rate": 0.00046273981450389374,
"loss": 5.7268,
"mean_token_accuracy": 0.1740120157599449,
"num_tokens": 40755567.0,
"step": 21855
},
{
"entropy": 5.997227334976197,
"epoch": 1.9304132815259627,
"grad_norm": 1.328125,
"learning_rate": 0.00046272245578741567,
"loss": 5.7347,
"mean_token_accuracy": 0.17737153619527818,
"num_tokens": 40764684.0,
"step": 21860
},
{
"entropy": 6.006214284896851,
"epoch": 1.9308548216178028,
"grad_norm": 2.03125,
"learning_rate": 0.0004627050933935615,
"loss": 5.7572,
"mean_token_accuracy": 0.18066497445106505,
"num_tokens": 40774050.0,
"step": 21865
},
{
"entropy": 5.996052837371826,
"epoch": 1.9312963617096433,
"grad_norm": 1.6171875,
"learning_rate": 0.00046268772732267126,
"loss": 5.7197,
"mean_token_accuracy": 0.17863317281007768,
"num_tokens": 40782722.0,
"step": 21870
},
{
"entropy": 6.055865335464477,
"epoch": 1.9317379018014835,
"grad_norm": 2.203125,
"learning_rate": 0.0004626703575750852,
"loss": 5.7892,
"mean_token_accuracy": 0.17124466001987457,
"num_tokens": 40791978.0,
"step": 21875
},
{
"entropy": 6.048078870773315,
"epoch": 1.9321794418933238,
"grad_norm": 5.09375,
"learning_rate": 0.0004626529841511436,
"loss": 5.8015,
"mean_token_accuracy": 0.17386343330144882,
"num_tokens": 40801855.0,
"step": 21880
},
{
"entropy": 6.114425373077393,
"epoch": 1.9326209819851643,
"grad_norm": 1.6640625,
"learning_rate": 0.00046263560705118675,
"loss": 5.8621,
"mean_token_accuracy": 0.1673159822821617,
"num_tokens": 40812025.0,
"step": 21885
},
{
"entropy": 6.063846826553345,
"epoch": 1.9330625220770046,
"grad_norm": 1.6640625,
"learning_rate": 0.0004626182262755551,
"loss": 5.6931,
"mean_token_accuracy": 0.16984845250844954,
"num_tokens": 40820758.0,
"step": 21890
},
{
"entropy": 6.049705934524536,
"epoch": 1.9335040621688449,
"grad_norm": 1.828125,
"learning_rate": 0.00046260084182458906,
"loss": 5.7925,
"mean_token_accuracy": 0.1723492994904518,
"num_tokens": 40830653.0,
"step": 21895
},
{
"entropy": 6.090110492706299,
"epoch": 1.9339456022606853,
"grad_norm": 1.8046875,
"learning_rate": 0.00046258345369862915,
"loss": 5.85,
"mean_token_accuracy": 0.16197656393051146,
"num_tokens": 40840370.0,
"step": 21900
},
{
"entropy": 6.067175388336182,
"epoch": 1.9343871423525256,
"grad_norm": 1.453125,
"learning_rate": 0.0004625660618980162,
"loss": 5.764,
"mean_token_accuracy": 0.1697617143392563,
"num_tokens": 40849590.0,
"step": 21905
},
{
"entropy": 6.039927053451538,
"epoch": 1.934828682444366,
"grad_norm": 1.5234375,
"learning_rate": 0.00046254866642309067,
"loss": 5.7328,
"mean_token_accuracy": 0.17753973007202148,
"num_tokens": 40859271.0,
"step": 21910
},
{
"entropy": 6.018358325958252,
"epoch": 1.9352702225362064,
"grad_norm": 1.8359375,
"learning_rate": 0.0004625312672741935,
"loss": 5.7581,
"mean_token_accuracy": 0.1713439166545868,
"num_tokens": 40869272.0,
"step": 21915
},
{
"entropy": 6.166571474075317,
"epoch": 1.9357117626280467,
"grad_norm": 1.53125,
"learning_rate": 0.0004625138644516655,
"loss": 5.8543,
"mean_token_accuracy": 0.1681418389081955,
"num_tokens": 40880327.0,
"step": 21920
},
{
"entropy": 6.041709756851196,
"epoch": 1.936153302719887,
"grad_norm": 2.015625,
"learning_rate": 0.0004624964579558474,
"loss": 5.7648,
"mean_token_accuracy": 0.1731289431452751,
"num_tokens": 40890407.0,
"step": 21925
},
{
"entropy": 6.087824010848999,
"epoch": 1.9365948428117274,
"grad_norm": 1.7109375,
"learning_rate": 0.0004624790477870804,
"loss": 5.737,
"mean_token_accuracy": 0.16997726410627365,
"num_tokens": 40899306.0,
"step": 21930
},
{
"entropy": 6.099414682388305,
"epoch": 1.9370363829035675,
"grad_norm": 1.3046875,
"learning_rate": 0.0004624616339457055,
"loss": 5.8207,
"mean_token_accuracy": 0.17409995049238206,
"num_tokens": 40908908.0,
"step": 21935
},
{
"entropy": 6.0638316631317135,
"epoch": 1.937477922995408,
"grad_norm": 1.6875,
"learning_rate": 0.0004624442164320638,
"loss": 5.7618,
"mean_token_accuracy": 0.1764813706278801,
"num_tokens": 40917960.0,
"step": 21940
},
{
"entropy": 5.970258331298828,
"epoch": 1.9379194630872483,
"grad_norm": 2.0,
"learning_rate": 0.0004624267952464965,
"loss": 5.5651,
"mean_token_accuracy": 0.18299384713172911,
"num_tokens": 40926364.0,
"step": 21945
},
{
"entropy": 6.004292631149292,
"epoch": 1.9383610031790885,
"grad_norm": 2.390625,
"learning_rate": 0.00046240937038934484,
"loss": 5.7683,
"mean_token_accuracy": 0.16589892357587815,
"num_tokens": 40936558.0,
"step": 21950
},
{
"entropy": 6.03344407081604,
"epoch": 1.938802543270929,
"grad_norm": 1.625,
"learning_rate": 0.0004623919418609502,
"loss": 5.7434,
"mean_token_accuracy": 0.17723874151706695,
"num_tokens": 40945501.0,
"step": 21955
},
{
"entropy": 6.030202198028564,
"epoch": 1.9392440833627693,
"grad_norm": 1.9921875,
"learning_rate": 0.00046237450966165407,
"loss": 5.7304,
"mean_token_accuracy": 0.17495592385530473,
"num_tokens": 40954740.0,
"step": 21960
},
{
"entropy": 6.100745630264282,
"epoch": 1.9396856234546096,
"grad_norm": 1.734375,
"learning_rate": 0.00046235707379179775,
"loss": 5.8086,
"mean_token_accuracy": 0.17242567241191864,
"num_tokens": 40963748.0,
"step": 21965
},
{
"entropy": 6.07326831817627,
"epoch": 1.94012716354645,
"grad_norm": 2.484375,
"learning_rate": 0.00046233963425172306,
"loss": 5.7841,
"mean_token_accuracy": 0.17086239010095597,
"num_tokens": 40973907.0,
"step": 21970
},
{
"entropy": 6.038969898223877,
"epoch": 1.9405687036382904,
"grad_norm": 1.46875,
"learning_rate": 0.00046232219104177136,
"loss": 5.7745,
"mean_token_accuracy": 0.16827674359083175,
"num_tokens": 40983374.0,
"step": 21975
},
{
"entropy": 6.150747966766358,
"epoch": 1.9410102437301306,
"grad_norm": 2.703125,
"learning_rate": 0.0004623047441622845,
"loss": 5.8097,
"mean_token_accuracy": 0.16115092784166335,
"num_tokens": 40993305.0,
"step": 21980
},
{
"entropy": 6.105601024627686,
"epoch": 1.9414517838219711,
"grad_norm": 1.5546875,
"learning_rate": 0.00046228729361360427,
"loss": 5.7277,
"mean_token_accuracy": 0.16489584892988204,
"num_tokens": 41002438.0,
"step": 21985
},
{
"entropy": 5.951572418212891,
"epoch": 1.9418933239138114,
"grad_norm": 3.03125,
"learning_rate": 0.00046226983939607236,
"loss": 5.6768,
"mean_token_accuracy": 0.17866460978984833,
"num_tokens": 41011491.0,
"step": 21990
},
{
"entropy": 6.053163242340088,
"epoch": 1.9423348640056517,
"grad_norm": 1.5625,
"learning_rate": 0.0004622523815100309,
"loss": 5.7865,
"mean_token_accuracy": 0.16570097357034683,
"num_tokens": 41021091.0,
"step": 21995
},
{
"entropy": 6.041624450683594,
"epoch": 1.9427764040974922,
"grad_norm": 1.5703125,
"learning_rate": 0.00046223491995582187,
"loss": 5.745,
"mean_token_accuracy": 0.17275805920362472,
"num_tokens": 41030719.0,
"step": 22000
},
{
"entropy": 6.054871892929077,
"epoch": 1.9432179441893322,
"grad_norm": 1.7890625,
"learning_rate": 0.0004622174547337871,
"loss": 5.7793,
"mean_token_accuracy": 0.17273407727479934,
"num_tokens": 41039651.0,
"step": 22005
},
{
"entropy": 6.085270500183105,
"epoch": 1.9436594842811727,
"grad_norm": 1.671875,
"learning_rate": 0.00046219998584426885,
"loss": 5.6828,
"mean_token_accuracy": 0.17674959748983382,
"num_tokens": 41047914.0,
"step": 22010
},
{
"entropy": 6.023111629486084,
"epoch": 1.944101024373013,
"grad_norm": 1.703125,
"learning_rate": 0.0004621825132876094,
"loss": 5.8069,
"mean_token_accuracy": 0.17121815234422683,
"num_tokens": 41056779.0,
"step": 22015
},
{
"entropy": 6.045871162414551,
"epoch": 1.9445425644648533,
"grad_norm": 1.8828125,
"learning_rate": 0.00046216503706415096,
"loss": 5.7517,
"mean_token_accuracy": 0.1752164974808693,
"num_tokens": 41066356.0,
"step": 22020
},
{
"entropy": 6.135921382904053,
"epoch": 1.9449841045566938,
"grad_norm": 2.296875,
"learning_rate": 0.0004621475571742359,
"loss": 5.7776,
"mean_token_accuracy": 0.17822057977318764,
"num_tokens": 41075766.0,
"step": 22025
},
{
"entropy": 6.094571781158447,
"epoch": 1.945425644648534,
"grad_norm": 1.6953125,
"learning_rate": 0.00046213007361820663,
"loss": 5.7526,
"mean_token_accuracy": 0.1722821593284607,
"num_tokens": 41085503.0,
"step": 22030
},
{
"entropy": 6.124881792068481,
"epoch": 1.9458671847403743,
"grad_norm": 2.65625,
"learning_rate": 0.0004621125863964057,
"loss": 5.9179,
"mean_token_accuracy": 0.15890415608882905,
"num_tokens": 41096581.0,
"step": 22035
},
{
"entropy": 6.081394052505493,
"epoch": 1.9463087248322148,
"grad_norm": 2.1875,
"learning_rate": 0.00046209509550917553,
"loss": 5.7233,
"mean_token_accuracy": 0.17929622381925583,
"num_tokens": 41105226.0,
"step": 22040
},
{
"entropy": 6.1206906795501705,
"epoch": 1.9467502649240551,
"grad_norm": 1.78125,
"learning_rate": 0.0004620776009568589,
"loss": 5.7257,
"mean_token_accuracy": 0.17917758822441102,
"num_tokens": 41113998.0,
"step": 22045
},
{
"entropy": 5.948379898071289,
"epoch": 1.9471918050158954,
"grad_norm": 2.21875,
"learning_rate": 0.0004620601027397984,
"loss": 5.7616,
"mean_token_accuracy": 0.16611459851264954,
"num_tokens": 41123147.0,
"step": 22050
},
{
"entropy": 6.039873695373535,
"epoch": 1.947633345107736,
"grad_norm": 1.5546875,
"learning_rate": 0.00046204260085833695,
"loss": 5.732,
"mean_token_accuracy": 0.17895739674568176,
"num_tokens": 41132317.0,
"step": 22055
},
{
"entropy": 6.085047721862793,
"epoch": 1.9480748851995762,
"grad_norm": 1.6171875,
"learning_rate": 0.0004620250953128173,
"loss": 5.7893,
"mean_token_accuracy": 0.1752127602696419,
"num_tokens": 41140795.0,
"step": 22060
},
{
"entropy": 6.063392877578735,
"epoch": 1.9485164252914164,
"grad_norm": 1.3515625,
"learning_rate": 0.0004620075861035824,
"loss": 5.7522,
"mean_token_accuracy": 0.17315972000360488,
"num_tokens": 41149959.0,
"step": 22065
},
{
"entropy": 6.068568229675293,
"epoch": 1.948957965383257,
"grad_norm": 2.3125,
"learning_rate": 0.0004619900732309753,
"loss": 5.8303,
"mean_token_accuracy": 0.1649854764342308,
"num_tokens": 41159388.0,
"step": 22070
},
{
"entropy": 6.1809858798980715,
"epoch": 1.949399505475097,
"grad_norm": 1.765625,
"learning_rate": 0.00046197255669533886,
"loss": 5.9916,
"mean_token_accuracy": 0.16120552718639375,
"num_tokens": 41168875.0,
"step": 22075
},
{
"entropy": 6.1376749038696286,
"epoch": 1.9498410455669375,
"grad_norm": 2.015625,
"learning_rate": 0.00046195503649701646,
"loss": 5.8083,
"mean_token_accuracy": 0.16923728585243225,
"num_tokens": 41177621.0,
"step": 22080
},
{
"entropy": 6.11600546836853,
"epoch": 1.9502825856587778,
"grad_norm": 1.3515625,
"learning_rate": 0.0004619375126363513,
"loss": 5.8118,
"mean_token_accuracy": 0.17457843720912933,
"num_tokens": 41185911.0,
"step": 22085
},
{
"entropy": 6.071341848373413,
"epoch": 1.950724125750618,
"grad_norm": 1.390625,
"learning_rate": 0.00046191998511368646,
"loss": 5.7325,
"mean_token_accuracy": 0.1761992245912552,
"num_tokens": 41194811.0,
"step": 22090
},
{
"entropy": 5.919883298873901,
"epoch": 1.9511656658424585,
"grad_norm": 1.3359375,
"learning_rate": 0.00046190245392936554,
"loss": 5.6559,
"mean_token_accuracy": 0.18473272472620011,
"num_tokens": 41203955.0,
"step": 22095
},
{
"entropy": 6.035905218124389,
"epoch": 1.9516072059342988,
"grad_norm": 1.328125,
"learning_rate": 0.0004618849190837317,
"loss": 5.6914,
"mean_token_accuracy": 0.17730630189180374,
"num_tokens": 41212635.0,
"step": 22100
},
{
"entropy": 6.077783298492432,
"epoch": 1.952048746026139,
"grad_norm": 1.3515625,
"learning_rate": 0.0004618673805771287,
"loss": 5.7422,
"mean_token_accuracy": 0.17258945256471633,
"num_tokens": 41221443.0,
"step": 22105
},
{
"entropy": 6.051871871948242,
"epoch": 1.9524902861179796,
"grad_norm": 2.3125,
"learning_rate": 0.0004618498384098999,
"loss": 5.7387,
"mean_token_accuracy": 0.17233629375696183,
"num_tokens": 41230089.0,
"step": 22110
},
{
"entropy": 6.065559148788452,
"epoch": 1.9529318262098199,
"grad_norm": 1.4921875,
"learning_rate": 0.00046183229258238905,
"loss": 5.8402,
"mean_token_accuracy": 0.16514919549226761,
"num_tokens": 41239569.0,
"step": 22115
},
{
"entropy": 6.14043231010437,
"epoch": 1.9533733663016601,
"grad_norm": 1.40625,
"learning_rate": 0.0004618147430949399,
"loss": 5.7481,
"mean_token_accuracy": 0.17588029503822328,
"num_tokens": 41248394.0,
"step": 22120
},
{
"entropy": 6.034920120239258,
"epoch": 1.9538149063935006,
"grad_norm": 1.6171875,
"learning_rate": 0.00046179718994789624,
"loss": 5.7671,
"mean_token_accuracy": 0.1764278829097748,
"num_tokens": 41258148.0,
"step": 22125
},
{
"entropy": 6.024720525741577,
"epoch": 1.954256446485341,
"grad_norm": 1.6484375,
"learning_rate": 0.00046177963314160175,
"loss": 5.6805,
"mean_token_accuracy": 0.18116089105606079,
"num_tokens": 41266984.0,
"step": 22130
},
{
"entropy": 6.071393203735352,
"epoch": 1.9546979865771812,
"grad_norm": 1.453125,
"learning_rate": 0.00046176207267640054,
"loss": 5.8152,
"mean_token_accuracy": 0.172828708589077,
"num_tokens": 41276119.0,
"step": 22135
},
{
"entropy": 5.968490409851074,
"epoch": 1.9551395266690217,
"grad_norm": 1.875,
"learning_rate": 0.0004617445085526365,
"loss": 5.6688,
"mean_token_accuracy": 0.18223851025104523,
"num_tokens": 41284945.0,
"step": 22140
},
{
"entropy": 6.023298835754394,
"epoch": 1.9555810667608617,
"grad_norm": 1.765625,
"learning_rate": 0.0004617269407706537,
"loss": 5.6672,
"mean_token_accuracy": 0.1869859516620636,
"num_tokens": 41294255.0,
"step": 22145
},
{
"entropy": 6.0218834400177,
"epoch": 1.9560226068527022,
"grad_norm": 1.4453125,
"learning_rate": 0.0004617093693307964,
"loss": 5.7949,
"mean_token_accuracy": 0.1714227631688118,
"num_tokens": 41303056.0,
"step": 22150
},
{
"entropy": 6.057028436660767,
"epoch": 1.9564641469445425,
"grad_norm": 1.734375,
"learning_rate": 0.00046169179423340866,
"loss": 5.8112,
"mean_token_accuracy": 0.17268431484699248,
"num_tokens": 41312444.0,
"step": 22155
},
{
"entropy": 6.198144245147705,
"epoch": 1.9569056870363828,
"grad_norm": 1.6171875,
"learning_rate": 0.000461674215478835,
"loss": 5.9178,
"mean_token_accuracy": 0.16734032779932023,
"num_tokens": 41322507.0,
"step": 22160
},
{
"entropy": 6.127847957611084,
"epoch": 1.9573472271282233,
"grad_norm": 1.875,
"learning_rate": 0.0004616566330674195,
"loss": 5.7684,
"mean_token_accuracy": 0.17577459812164306,
"num_tokens": 41332507.0,
"step": 22165
},
{
"entropy": 6.0400683879852295,
"epoch": 1.9577887672200636,
"grad_norm": 1.4609375,
"learning_rate": 0.0004616390469995068,
"loss": 5.759,
"mean_token_accuracy": 0.1703336074948311,
"num_tokens": 41342085.0,
"step": 22170
},
{
"entropy": 6.007832813262939,
"epoch": 1.9582303073119038,
"grad_norm": 2.21875,
"learning_rate": 0.00046162145727544126,
"loss": 5.7094,
"mean_token_accuracy": 0.18436151295900344,
"num_tokens": 41351422.0,
"step": 22175
},
{
"entropy": 6.048597621917724,
"epoch": 1.9586718474037443,
"grad_norm": 1.5390625,
"learning_rate": 0.0004616038638955675,
"loss": 5.7235,
"mean_token_accuracy": 0.17865052521228791,
"num_tokens": 41361337.0,
"step": 22180
},
{
"entropy": 5.997058534622193,
"epoch": 1.9591133874955846,
"grad_norm": 1.5390625,
"learning_rate": 0.00046158626686023014,
"loss": 5.6814,
"mean_token_accuracy": 0.17977140694856644,
"num_tokens": 41370734.0,
"step": 22185
},
{
"entropy": 5.961888074874878,
"epoch": 1.9595549275874249,
"grad_norm": 1.8359375,
"learning_rate": 0.00046156866616977406,
"loss": 5.7167,
"mean_token_accuracy": 0.17512229532003404,
"num_tokens": 41380090.0,
"step": 22190
},
{
"entropy": 6.070858907699585,
"epoch": 1.9599964676792654,
"grad_norm": 1.65625,
"learning_rate": 0.00046155106182454384,
"loss": 5.7681,
"mean_token_accuracy": 0.17731525748968124,
"num_tokens": 41388967.0,
"step": 22195
},
{
"entropy": 6.046339321136474,
"epoch": 1.9604380077711057,
"grad_norm": 2.09375,
"learning_rate": 0.0004615334538248844,
"loss": 5.7238,
"mean_token_accuracy": 0.1710942193865776,
"num_tokens": 41397429.0,
"step": 22200
},
{
"entropy": 6.005281257629394,
"epoch": 1.960879547862946,
"grad_norm": 1.515625,
"learning_rate": 0.00046151584217114073,
"loss": 5.6997,
"mean_token_accuracy": 0.1713586539030075,
"num_tokens": 41406420.0,
"step": 22205
},
{
"entropy": 5.937029600143433,
"epoch": 1.9613210879547864,
"grad_norm": 1.40625,
"learning_rate": 0.0004614982268636577,
"loss": 5.6431,
"mean_token_accuracy": 0.18556031435728074,
"num_tokens": 41415994.0,
"step": 22210
},
{
"entropy": 6.010221767425537,
"epoch": 1.9617626280466265,
"grad_norm": 1.3515625,
"learning_rate": 0.0004614806079027806,
"loss": 5.6589,
"mean_token_accuracy": 0.1837079867720604,
"num_tokens": 41425744.0,
"step": 22215
},
{
"entropy": 6.0305029392242435,
"epoch": 1.962204168138467,
"grad_norm": 1.6796875,
"learning_rate": 0.00046146298528885435,
"loss": 5.8244,
"mean_token_accuracy": 0.1698705479502678,
"num_tokens": 41435452.0,
"step": 22220
},
{
"entropy": 6.09062008857727,
"epoch": 1.9626457082303073,
"grad_norm": 1.7578125,
"learning_rate": 0.0004614453590222243,
"loss": 5.763,
"mean_token_accuracy": 0.1759571686387062,
"num_tokens": 41444853.0,
"step": 22225
},
{
"entropy": 5.972477865219116,
"epoch": 1.9630872483221475,
"grad_norm": 1.3984375,
"learning_rate": 0.0004614277291032357,
"loss": 5.6361,
"mean_token_accuracy": 0.19820074439048768,
"num_tokens": 41454569.0,
"step": 22230
},
{
"entropy": 6.075066947937012,
"epoch": 1.963528788413988,
"grad_norm": 1.5859375,
"learning_rate": 0.0004614100955322339,
"loss": 5.8225,
"mean_token_accuracy": 0.17227286100387573,
"num_tokens": 41464159.0,
"step": 22235
},
{
"entropy": 6.108021640777588,
"epoch": 1.9639703285058283,
"grad_norm": 1.34375,
"learning_rate": 0.0004613924583095644,
"loss": 5.838,
"mean_token_accuracy": 0.1653406336903572,
"num_tokens": 41474354.0,
"step": 22240
},
{
"entropy": 6.05299072265625,
"epoch": 1.9644118685976686,
"grad_norm": 1.4609375,
"learning_rate": 0.0004613748174355726,
"loss": 5.7019,
"mean_token_accuracy": 0.1779753252863884,
"num_tokens": 41484053.0,
"step": 22245
},
{
"entropy": 6.0584189891815186,
"epoch": 1.964853408689509,
"grad_norm": 1.5859375,
"learning_rate": 0.00046135717291060415,
"loss": 5.7586,
"mean_token_accuracy": 0.1716051608324051,
"num_tokens": 41493377.0,
"step": 22250
},
{
"entropy": 6.011655330657959,
"epoch": 1.9652949487813494,
"grad_norm": 1.234375,
"learning_rate": 0.00046133952473500464,
"loss": 5.7134,
"mean_token_accuracy": 0.17693392783403397,
"num_tokens": 41502361.0,
"step": 22255
},
{
"entropy": 6.049775409698486,
"epoch": 1.9657364888731896,
"grad_norm": 1.8203125,
"learning_rate": 0.0004613218729091198,
"loss": 5.7454,
"mean_token_accuracy": 0.17243424504995347,
"num_tokens": 41511083.0,
"step": 22260
},
{
"entropy": 6.09012656211853,
"epoch": 1.9661780289650301,
"grad_norm": 2.15625,
"learning_rate": 0.0004613042174332955,
"loss": 5.8385,
"mean_token_accuracy": 0.16584311723709105,
"num_tokens": 41520264.0,
"step": 22265
},
{
"entropy": 6.055804061889648,
"epoch": 1.9666195690568704,
"grad_norm": 1.640625,
"learning_rate": 0.0004612865583078775,
"loss": 5.7035,
"mean_token_accuracy": 0.1749335080385208,
"num_tokens": 41529805.0,
"step": 22270
},
{
"entropy": 5.98424596786499,
"epoch": 1.9670611091487107,
"grad_norm": 1.921875,
"learning_rate": 0.0004612688955332118,
"loss": 5.6162,
"mean_token_accuracy": 0.1786441758275032,
"num_tokens": 41538348.0,
"step": 22275
},
{
"entropy": 6.0336202621459964,
"epoch": 1.9675026492405512,
"grad_norm": 1.8671875,
"learning_rate": 0.00046125122910964427,
"loss": 5.758,
"mean_token_accuracy": 0.1762828215956688,
"num_tokens": 41547433.0,
"step": 22280
},
{
"entropy": 6.022718667984009,
"epoch": 1.9679441893323912,
"grad_norm": 1.2890625,
"learning_rate": 0.0004612335590375212,
"loss": 5.7523,
"mean_token_accuracy": 0.17444323897361755,
"num_tokens": 41556162.0,
"step": 22285
},
{
"entropy": 6.084063291549683,
"epoch": 1.9683857294242317,
"grad_norm": 3.25,
"learning_rate": 0.0004612158853171886,
"loss": 5.7443,
"mean_token_accuracy": 0.17313191741704942,
"num_tokens": 41565415.0,
"step": 22290
},
{
"entropy": 6.030745506286621,
"epoch": 1.968827269516072,
"grad_norm": 1.5859375,
"learning_rate": 0.0004611982079489928,
"loss": 5.6588,
"mean_token_accuracy": 0.1815870463848114,
"num_tokens": 41574728.0,
"step": 22295
},
{
"entropy": 5.93251781463623,
"epoch": 1.9692688096079123,
"grad_norm": 1.90625,
"learning_rate": 0.0004611805269332798,
"loss": 5.8029,
"mean_token_accuracy": 0.16511484533548354,
"num_tokens": 41584749.0,
"step": 22300
},
{
"entropy": 6.008321523666382,
"epoch": 1.9697103496997528,
"grad_norm": 1.4609375,
"learning_rate": 0.00046116284227039626,
"loss": 5.6973,
"mean_token_accuracy": 0.1833537057042122,
"num_tokens": 41594658.0,
"step": 22305
},
{
"entropy": 6.108428478240967,
"epoch": 1.970151889791593,
"grad_norm": 1.921875,
"learning_rate": 0.0004611451539606886,
"loss": 5.8065,
"mean_token_accuracy": 0.16954938173294068,
"num_tokens": 41604548.0,
"step": 22310
},
{
"entropy": 6.044419622421264,
"epoch": 1.9705934298834333,
"grad_norm": 1.8671875,
"learning_rate": 0.0004611274620045031,
"loss": 5.7554,
"mean_token_accuracy": 0.1707133263349533,
"num_tokens": 41614002.0,
"step": 22315
},
{
"entropy": 6.011157989501953,
"epoch": 1.9710349699752738,
"grad_norm": 1.71875,
"learning_rate": 0.0004611097664021866,
"loss": 5.778,
"mean_token_accuracy": 0.16770342588424683,
"num_tokens": 41623793.0,
"step": 22320
},
{
"entropy": 6.064720821380615,
"epoch": 1.971476510067114,
"grad_norm": 1.5390625,
"learning_rate": 0.00046109206715408554,
"loss": 5.7022,
"mean_token_accuracy": 0.16932165026664733,
"num_tokens": 41632608.0,
"step": 22325
},
{
"entropy": 6.120521497726441,
"epoch": 1.9719180501589544,
"grad_norm": 1.8828125,
"learning_rate": 0.00046107436426054676,
"loss": 5.7962,
"mean_token_accuracy": 0.17158026695251466,
"num_tokens": 41641814.0,
"step": 22330
},
{
"entropy": 6.090767478942871,
"epoch": 1.9723595902507949,
"grad_norm": 1.9609375,
"learning_rate": 0.000461056657721917,
"loss": 5.7773,
"mean_token_accuracy": 0.16947346031665803,
"num_tokens": 41650643.0,
"step": 22335
},
{
"entropy": 6.047063827514648,
"epoch": 1.9728011303426352,
"grad_norm": 1.296875,
"learning_rate": 0.00046103894753854317,
"loss": 5.7847,
"mean_token_accuracy": 0.167997744679451,
"num_tokens": 41661308.0,
"step": 22340
},
{
"entropy": 6.157812070846558,
"epoch": 1.9732426704344754,
"grad_norm": 1.5703125,
"learning_rate": 0.0004610212337107721,
"loss": 5.8038,
"mean_token_accuracy": 0.1658959373831749,
"num_tokens": 41671090.0,
"step": 22345
},
{
"entropy": 6.070932865142822,
"epoch": 1.973684210526316,
"grad_norm": 1.6953125,
"learning_rate": 0.00046100351623895087,
"loss": 5.7621,
"mean_token_accuracy": 0.16651545315980912,
"num_tokens": 41679584.0,
"step": 22350
},
{
"entropy": 6.0098731994628904,
"epoch": 1.974125750618156,
"grad_norm": 1.390625,
"learning_rate": 0.00046098579512342654,
"loss": 5.7564,
"mean_token_accuracy": 0.1639693036675453,
"num_tokens": 41689772.0,
"step": 22355
},
{
"entropy": 6.041907119750976,
"epoch": 1.9745672907099965,
"grad_norm": 1.8046875,
"learning_rate": 0.0004609680703645463,
"loss": 5.7494,
"mean_token_accuracy": 0.17011204212903977,
"num_tokens": 41699196.0,
"step": 22360
},
{
"entropy": 6.033811426162719,
"epoch": 1.9750088308018368,
"grad_norm": 1.4453125,
"learning_rate": 0.00046095034196265726,
"loss": 5.7251,
"mean_token_accuracy": 0.17784952670335769,
"num_tokens": 41707899.0,
"step": 22365
},
{
"entropy": 5.988531494140625,
"epoch": 1.975450370893677,
"grad_norm": 1.828125,
"learning_rate": 0.00046093260991810685,
"loss": 5.7496,
"mean_token_accuracy": 0.1828193798661232,
"num_tokens": 41716903.0,
"step": 22370
},
{
"entropy": 6.0863118171691895,
"epoch": 1.9758919109855175,
"grad_norm": 1.6796875,
"learning_rate": 0.00046091487423124234,
"loss": 5.6799,
"mean_token_accuracy": 0.17742927223443986,
"num_tokens": 41725676.0,
"step": 22375
},
{
"entropy": 6.069465065002442,
"epoch": 1.9763334510773578,
"grad_norm": 1.75,
"learning_rate": 0.00046089713490241117,
"loss": 5.6624,
"mean_token_accuracy": 0.1772787645459175,
"num_tokens": 41734720.0,
"step": 22380
},
{
"entropy": 5.9439451694488525,
"epoch": 1.976774991169198,
"grad_norm": 1.6328125,
"learning_rate": 0.0004608793919319608,
"loss": 5.7438,
"mean_token_accuracy": 0.17879440188407897,
"num_tokens": 41743866.0,
"step": 22385
},
{
"entropy": 6.039175367355346,
"epoch": 1.9772165312610386,
"grad_norm": 2.140625,
"learning_rate": 0.00046086164532023894,
"loss": 5.7474,
"mean_token_accuracy": 0.17954644858837127,
"num_tokens": 41754157.0,
"step": 22390
},
{
"entropy": 6.109652519226074,
"epoch": 1.9776580713528789,
"grad_norm": 2.359375,
"learning_rate": 0.00046084389506759313,
"loss": 5.7366,
"mean_token_accuracy": 0.17678441852331161,
"num_tokens": 41763105.0,
"step": 22395
},
{
"entropy": 6.012633800506592,
"epoch": 1.9780996114447191,
"grad_norm": 1.984375,
"learning_rate": 0.00046082614117437103,
"loss": 5.6627,
"mean_token_accuracy": 0.17851006537675856,
"num_tokens": 41772623.0,
"step": 22400
},
{
"entropy": 5.941089248657226,
"epoch": 1.9785411515365596,
"grad_norm": 1.7890625,
"learning_rate": 0.00046080838364092057,
"loss": 5.7744,
"mean_token_accuracy": 0.1697394460439682,
"num_tokens": 41781331.0,
"step": 22405
},
{
"entropy": 6.071671628952027,
"epoch": 1.9789826916284,
"grad_norm": 1.6953125,
"learning_rate": 0.0004607906224675896,
"loss": 5.8783,
"mean_token_accuracy": 0.16538015902042388,
"num_tokens": 41789727.0,
"step": 22410
},
{
"entropy": 6.136638355255127,
"epoch": 1.9794242317202402,
"grad_norm": 1.375,
"learning_rate": 0.0004607728576547259,
"loss": 5.773,
"mean_token_accuracy": 0.17556797415018083,
"num_tokens": 41798531.0,
"step": 22415
},
{
"entropy": 6.080850982666016,
"epoch": 1.9798657718120807,
"grad_norm": 1.703125,
"learning_rate": 0.00046075508920267766,
"loss": 5.7673,
"mean_token_accuracy": 0.17196437418460847,
"num_tokens": 41808304.0,
"step": 22420
},
{
"entropy": 5.9950779438018795,
"epoch": 1.9803073119039207,
"grad_norm": 1.6171875,
"learning_rate": 0.0004607373171117929,
"loss": 5.651,
"mean_token_accuracy": 0.1798841252923012,
"num_tokens": 41817427.0,
"step": 22425
},
{
"entropy": 6.042256450653076,
"epoch": 1.9807488519957612,
"grad_norm": 1.59375,
"learning_rate": 0.0004607195413824197,
"loss": 5.7348,
"mean_token_accuracy": 0.17997312694787979,
"num_tokens": 41827202.0,
"step": 22430
},
{
"entropy": 6.054673957824707,
"epoch": 1.9811903920876015,
"grad_norm": 1.78125,
"learning_rate": 0.0004607017620149062,
"loss": 5.6654,
"mean_token_accuracy": 0.17754244655370713,
"num_tokens": 41836213.0,
"step": 22435
},
{
"entropy": 5.994782733917236,
"epoch": 1.9816319321794418,
"grad_norm": 1.703125,
"learning_rate": 0.0004606839790096009,
"loss": 5.7731,
"mean_token_accuracy": 0.17013630419969558,
"num_tokens": 41845358.0,
"step": 22440
},
{
"entropy": 6.034302997589111,
"epoch": 1.9820734722712823,
"grad_norm": 2.0625,
"learning_rate": 0.0004606661923668521,
"loss": 5.7625,
"mean_token_accuracy": 0.17544692605733872,
"num_tokens": 41854572.0,
"step": 22445
},
{
"entropy": 6.073245334625244,
"epoch": 1.9825150123631226,
"grad_norm": 1.5703125,
"learning_rate": 0.0004606484020870081,
"loss": 5.7213,
"mean_token_accuracy": 0.18345639407634734,
"num_tokens": 41863643.0,
"step": 22450
},
{
"entropy": 5.986920690536499,
"epoch": 1.9829565524549628,
"grad_norm": 1.640625,
"learning_rate": 0.00046063060817041747,
"loss": 5.6398,
"mean_token_accuracy": 0.18087583780288696,
"num_tokens": 41873004.0,
"step": 22455
},
{
"entropy": 6.037672138214111,
"epoch": 1.9833980925468033,
"grad_norm": 2.671875,
"learning_rate": 0.0004606128106174288,
"loss": 5.7139,
"mean_token_accuracy": 0.17878344655036926,
"num_tokens": 41881530.0,
"step": 22460
},
{
"entropy": 5.985376071929932,
"epoch": 1.9838396326386436,
"grad_norm": 2.53125,
"learning_rate": 0.0004605950094283908,
"loss": 5.7746,
"mean_token_accuracy": 0.16852685511112214,
"num_tokens": 41890342.0,
"step": 22465
},
{
"entropy": 6.0489363193511965,
"epoch": 1.9842811727304839,
"grad_norm": 1.5546875,
"learning_rate": 0.00046057720460365205,
"loss": 5.6979,
"mean_token_accuracy": 0.1770861566066742,
"num_tokens": 41899274.0,
"step": 22470
},
{
"entropy": 6.053419685363769,
"epoch": 1.9847227128223244,
"grad_norm": 1.3125,
"learning_rate": 0.00046055939614356146,
"loss": 5.7464,
"mean_token_accuracy": 0.17357972711324693,
"num_tokens": 41908835.0,
"step": 22475
},
{
"entropy": 5.981625032424927,
"epoch": 1.9851642529141647,
"grad_norm": 1.78125,
"learning_rate": 0.0004605415840484678,
"loss": 5.6493,
"mean_token_accuracy": 0.18739964067935944,
"num_tokens": 41917900.0,
"step": 22480
},
{
"entropy": 6.092053651809692,
"epoch": 1.985605793006005,
"grad_norm": 1.4453125,
"learning_rate": 0.00046052376831872007,
"loss": 5.7649,
"mean_token_accuracy": 0.17660360038280487,
"num_tokens": 41926964.0,
"step": 22485
},
{
"entropy": 6.090537452697754,
"epoch": 1.9860473330978454,
"grad_norm": 1.640625,
"learning_rate": 0.0004605059489546672,
"loss": 5.8049,
"mean_token_accuracy": 0.17375464886426925,
"num_tokens": 41936401.0,
"step": 22490
},
{
"entropy": 5.977529239654541,
"epoch": 1.9864888731896855,
"grad_norm": 1.5390625,
"learning_rate": 0.00046048812595665824,
"loss": 5.6608,
"mean_token_accuracy": 0.1805543377995491,
"num_tokens": 41944665.0,
"step": 22495
},
{
"entropy": 6.036603021621704,
"epoch": 1.986930413281526,
"grad_norm": 1.6015625,
"learning_rate": 0.0004604702993250425,
"loss": 5.7418,
"mean_token_accuracy": 0.1692625105381012,
"num_tokens": 41953868.0,
"step": 22500
},
{
"entropy": 6.017401552200317,
"epoch": 1.9873719533733663,
"grad_norm": 2.796875,
"learning_rate": 0.00046045246906016904,
"loss": 5.7632,
"mean_token_accuracy": 0.18105934411287308,
"num_tokens": 41963013.0,
"step": 22505
},
{
"entropy": 6.047124910354614,
"epoch": 1.9878134934652065,
"grad_norm": 1.8828125,
"learning_rate": 0.0004604346351623872,
"loss": 5.7746,
"mean_token_accuracy": 0.16565561518073083,
"num_tokens": 41972926.0,
"step": 22510
},
{
"entropy": 6.094768476486206,
"epoch": 1.988255033557047,
"grad_norm": 1.6640625,
"learning_rate": 0.00046041679763204625,
"loss": 5.7607,
"mean_token_accuracy": 0.17846638560295106,
"num_tokens": 41981773.0,
"step": 22515
},
{
"entropy": 6.068697929382324,
"epoch": 1.9886965736488873,
"grad_norm": 1.7734375,
"learning_rate": 0.0004603989564694957,
"loss": 5.7325,
"mean_token_accuracy": 0.17639482170343398,
"num_tokens": 41990893.0,
"step": 22520
},
{
"entropy": 5.98835768699646,
"epoch": 1.9891381137407276,
"grad_norm": 1.5546875,
"learning_rate": 0.0004603811116750851,
"loss": 5.7389,
"mean_token_accuracy": 0.1743205562233925,
"num_tokens": 42000842.0,
"step": 22525
},
{
"entropy": 6.190033674240112,
"epoch": 1.989579653832568,
"grad_norm": 1.7578125,
"learning_rate": 0.0004603632632491639,
"loss": 5.7458,
"mean_token_accuracy": 0.17619042098522186,
"num_tokens": 42009430.0,
"step": 22530
},
{
"entropy": 6.1075475215911865,
"epoch": 1.9900211939244083,
"grad_norm": 2.3125,
"learning_rate": 0.00046034541119208177,
"loss": 5.8567,
"mean_token_accuracy": 0.1731588289141655,
"num_tokens": 42018985.0,
"step": 22535
},
{
"entropy": 6.0206907272338865,
"epoch": 1.9904627340162486,
"grad_norm": 2.09375,
"learning_rate": 0.00046032755550418845,
"loss": 5.7248,
"mean_token_accuracy": 0.17373713254928588,
"num_tokens": 42028885.0,
"step": 22540
},
{
"entropy": 6.116259050369263,
"epoch": 1.9909042741080891,
"grad_norm": 1.5078125,
"learning_rate": 0.0004603096961858338,
"loss": 5.8207,
"mean_token_accuracy": 0.16879483163356782,
"num_tokens": 42037838.0,
"step": 22545
},
{
"entropy": 5.995342063903808,
"epoch": 1.9913458141999294,
"grad_norm": 1.328125,
"learning_rate": 0.00046029183323736755,
"loss": 5.7179,
"mean_token_accuracy": 0.1756678879261017,
"num_tokens": 42047212.0,
"step": 22550
},
{
"entropy": 6.090860509872437,
"epoch": 1.9917873542917697,
"grad_norm": 1.515625,
"learning_rate": 0.0004602739666591397,
"loss": 5.7809,
"mean_token_accuracy": 0.17322022765874862,
"num_tokens": 42056680.0,
"step": 22555
},
{
"entropy": 6.081259632110596,
"epoch": 1.9922288943836102,
"grad_norm": 1.6484375,
"learning_rate": 0.00046025609645150014,
"loss": 5.792,
"mean_token_accuracy": 0.1709069237112999,
"num_tokens": 42065604.0,
"step": 22560
},
{
"entropy": 6.1278478622436525,
"epoch": 1.9926704344754502,
"grad_norm": 1.5703125,
"learning_rate": 0.000460238222614799,
"loss": 5.7389,
"mean_token_accuracy": 0.1786057785153389,
"num_tokens": 42074672.0,
"step": 22565
},
{
"entropy": 6.00501070022583,
"epoch": 1.9931119745672907,
"grad_norm": 1.3125,
"learning_rate": 0.0004602203451493865,
"loss": 5.6939,
"mean_token_accuracy": 0.1736400157213211,
"num_tokens": 42083586.0,
"step": 22570
},
{
"entropy": 5.989296913146973,
"epoch": 1.993553514659131,
"grad_norm": 1.3046875,
"learning_rate": 0.00046020246405561283,
"loss": 5.6946,
"mean_token_accuracy": 0.1758251041173935,
"num_tokens": 42092328.0,
"step": 22575
},
{
"entropy": 5.995558357238769,
"epoch": 1.9939950547509713,
"grad_norm": 1.5,
"learning_rate": 0.00046018457933382807,
"loss": 5.7178,
"mean_token_accuracy": 0.18192638009786605,
"num_tokens": 42102154.0,
"step": 22580
},
{
"entropy": 6.088233566284179,
"epoch": 1.9944365948428118,
"grad_norm": 3.5,
"learning_rate": 0.00046016669098438286,
"loss": 5.7824,
"mean_token_accuracy": 0.17249981164932252,
"num_tokens": 42111762.0,
"step": 22585
},
{
"entropy": 6.076658868789673,
"epoch": 1.994878134934652,
"grad_norm": 1.734375,
"learning_rate": 0.0004601487990076274,
"loss": 5.7572,
"mean_token_accuracy": 0.1749763771891594,
"num_tokens": 42120631.0,
"step": 22590
},
{
"entropy": 5.951053142547607,
"epoch": 1.9953196750264923,
"grad_norm": 2.03125,
"learning_rate": 0.0004601309034039123,
"loss": 5.628,
"mean_token_accuracy": 0.1962128311395645,
"num_tokens": 42129311.0,
"step": 22595
},
{
"entropy": 6.04332480430603,
"epoch": 1.9957612151183328,
"grad_norm": 1.59375,
"learning_rate": 0.0004601130041735881,
"loss": 5.8732,
"mean_token_accuracy": 0.16825787723064423,
"num_tokens": 42138735.0,
"step": 22600
},
{
"entropy": 6.171170330047607,
"epoch": 1.996202755210173,
"grad_norm": 1.6796875,
"learning_rate": 0.0004600951013170054,
"loss": 5.8084,
"mean_token_accuracy": 0.17513348013162613,
"num_tokens": 42148416.0,
"step": 22605
},
{
"entropy": 6.090385389328003,
"epoch": 1.9966442953020134,
"grad_norm": 1.5859375,
"learning_rate": 0.00046007719483451493,
"loss": 5.7216,
"mean_token_accuracy": 0.17728171348571778,
"num_tokens": 42157191.0,
"step": 22610
},
{
"entropy": 5.925617647171021,
"epoch": 1.9970858353938539,
"grad_norm": 1.5390625,
"learning_rate": 0.00046005928472646747,
"loss": 5.6832,
"mean_token_accuracy": 0.1885446846485138,
"num_tokens": 42165798.0,
"step": 22615
},
{
"entropy": 6.010206842422486,
"epoch": 1.9975273754856941,
"grad_norm": 2.15625,
"learning_rate": 0.00046004137099321386,
"loss": 5.7791,
"mean_token_accuracy": 0.16778813749551774,
"num_tokens": 42175318.0,
"step": 22620
},
{
"entropy": 6.096094846725464,
"epoch": 1.9979689155775344,
"grad_norm": 1.3359375,
"learning_rate": 0.00046002345363510506,
"loss": 5.7976,
"mean_token_accuracy": 0.17106928825378417,
"num_tokens": 42184800.0,
"step": 22625
},
{
"entropy": 6.036216878890992,
"epoch": 1.998410455669375,
"grad_norm": 1.65625,
"learning_rate": 0.0004600055326524921,
"loss": 5.6225,
"mean_token_accuracy": 0.18114373087882996,
"num_tokens": 42194172.0,
"step": 22630
},
{
"entropy": 5.936356735229492,
"epoch": 1.998851995761215,
"grad_norm": 1.703125,
"learning_rate": 0.00045998760804572583,
"loss": 5.6815,
"mean_token_accuracy": 0.1827523425221443,
"num_tokens": 42203102.0,
"step": 22635
},
{
"entropy": 5.99210114479065,
"epoch": 1.9992935358530555,
"grad_norm": 1.546875,
"learning_rate": 0.00045996967981515763,
"loss": 5.6515,
"mean_token_accuracy": 0.18347228467464446,
"num_tokens": 42212421.0,
"step": 22640
},
{
"entropy": 6.084212112426758,
"epoch": 1.9997350759448957,
"grad_norm": 1.5546875,
"learning_rate": 0.00045995174796113856,
"loss": 5.7509,
"mean_token_accuracy": 0.1772667407989502,
"num_tokens": 42221528.0,
"step": 22645
},
{
"entropy": 6.055908918380737,
"epoch": 2.000176616036736,
"grad_norm": 1.359375,
"learning_rate": 0.00045993381248402,
"loss": 5.7111,
"mean_token_accuracy": 0.17184268683195114,
"num_tokens": 42230628.0,
"step": 22650
},
{
"entropy": 6.008942556381226,
"epoch": 2.0006181561285765,
"grad_norm": 1.640625,
"learning_rate": 0.00045991587338415306,
"loss": 5.6756,
"mean_token_accuracy": 0.17978897839784622,
"num_tokens": 42239571.0,
"step": 22655
},
{
"entropy": 5.9872870445251465,
"epoch": 2.001059696220417,
"grad_norm": 1.390625,
"learning_rate": 0.00045989793066188953,
"loss": 5.6693,
"mean_token_accuracy": 0.17754753082990646,
"num_tokens": 42248010.0,
"step": 22660
},
{
"entropy": 5.943401575088501,
"epoch": 2.001501236312257,
"grad_norm": 1.5625,
"learning_rate": 0.00045987998431758063,
"loss": 5.6377,
"mean_token_accuracy": 0.18002738803625107,
"num_tokens": 42257251.0,
"step": 22665
},
{
"entropy": 6.016818714141846,
"epoch": 2.0019427764040976,
"grad_norm": 3.21875,
"learning_rate": 0.0004598620343515779,
"loss": 5.7508,
"mean_token_accuracy": 0.17593501508235931,
"num_tokens": 42266441.0,
"step": 22670
},
{
"entropy": 6.068567848205566,
"epoch": 2.0023843164959376,
"grad_norm": 2.0,
"learning_rate": 0.00045984408076423313,
"loss": 5.7022,
"mean_token_accuracy": 0.17428232580423356,
"num_tokens": 42275995.0,
"step": 22675
},
{
"entropy": 6.116209840774536,
"epoch": 2.002825856587778,
"grad_norm": 1.546875,
"learning_rate": 0.0004598261235558979,
"loss": 5.6987,
"mean_token_accuracy": 0.1781181961297989,
"num_tokens": 42284065.0,
"step": 22680
},
{
"entropy": 6.018552350997925,
"epoch": 2.0032673966796186,
"grad_norm": 1.53125,
"learning_rate": 0.00045980816272692403,
"loss": 5.7864,
"mean_token_accuracy": 0.1777577057480812,
"num_tokens": 42295309.0,
"step": 22685
},
{
"entropy": 6.116229772567749,
"epoch": 2.0037089367714587,
"grad_norm": 1.40625,
"learning_rate": 0.00045979019827766345,
"loss": 5.7038,
"mean_token_accuracy": 0.170977184176445,
"num_tokens": 42304390.0,
"step": 22690
},
{
"entropy": 6.011090898513794,
"epoch": 2.004150476863299,
"grad_norm": 1.9296875,
"learning_rate": 0.00045977223020846785,
"loss": 5.7301,
"mean_token_accuracy": 0.17737231999635697,
"num_tokens": 42313830.0,
"step": 22695
},
{
"entropy": 6.086795425415039,
"epoch": 2.0045920169551397,
"grad_norm": 1.84375,
"learning_rate": 0.0004597542585196895,
"loss": 5.705,
"mean_token_accuracy": 0.16985444128513336,
"num_tokens": 42323827.0,
"step": 22700
},
{
"entropy": 6.149669933319092,
"epoch": 2.0050335570469797,
"grad_norm": 3.0625,
"learning_rate": 0.00045973628321168016,
"loss": 5.8095,
"mean_token_accuracy": 0.17025880813598632,
"num_tokens": 42333221.0,
"step": 22705
},
{
"entropy": 5.962525701522827,
"epoch": 2.00547509713882,
"grad_norm": 2.0625,
"learning_rate": 0.00045971830428479215,
"loss": 5.6845,
"mean_token_accuracy": 0.18078639656305312,
"num_tokens": 42343036.0,
"step": 22710
},
{
"entropy": 6.0080078125,
"epoch": 2.0059166372306607,
"grad_norm": 1.578125,
"learning_rate": 0.00045970032173937766,
"loss": 5.6635,
"mean_token_accuracy": 0.1835568830370903,
"num_tokens": 42351916.0,
"step": 22715
},
{
"entropy": 6.074195432662964,
"epoch": 2.0063581773225008,
"grad_norm": 2.1875,
"learning_rate": 0.00045968233557578883,
"loss": 5.7787,
"mean_token_accuracy": 0.1713354006409645,
"num_tokens": 42362412.0,
"step": 22720
},
{
"entropy": 6.045947599411011,
"epoch": 2.0067997174143413,
"grad_norm": 1.625,
"learning_rate": 0.0004596643457943781,
"loss": 5.6793,
"mean_token_accuracy": 0.18098925203084945,
"num_tokens": 42372773.0,
"step": 22725
},
{
"entropy": 6.051468420028686,
"epoch": 2.0072412575061818,
"grad_norm": 1.8203125,
"learning_rate": 0.0004596463523954979,
"loss": 5.6692,
"mean_token_accuracy": 0.1766323447227478,
"num_tokens": 42382009.0,
"step": 22730
},
{
"entropy": 5.978017330169678,
"epoch": 2.007682797598022,
"grad_norm": 1.5703125,
"learning_rate": 0.00045962835537950063,
"loss": 5.6784,
"mean_token_accuracy": 0.17747483700513839,
"num_tokens": 42390961.0,
"step": 22735
},
{
"entropy": 5.94108567237854,
"epoch": 2.0081243376898623,
"grad_norm": 1.3828125,
"learning_rate": 0.00045961035474673893,
"loss": 5.6634,
"mean_token_accuracy": 0.18035317659378053,
"num_tokens": 42400483.0,
"step": 22740
},
{
"entropy": 5.893748188018799,
"epoch": 2.0085658777817024,
"grad_norm": 1.59375,
"learning_rate": 0.00045959235049756537,
"loss": 5.5353,
"mean_token_accuracy": 0.18926527798175813,
"num_tokens": 42409285.0,
"step": 22745
},
{
"entropy": 6.04561710357666,
"epoch": 2.009007417873543,
"grad_norm": 1.453125,
"learning_rate": 0.00045957434263233253,
"loss": 5.7443,
"mean_token_accuracy": 0.16961453706026078,
"num_tokens": 42418950.0,
"step": 22750
},
{
"entropy": 6.035918807983398,
"epoch": 2.0094489579653834,
"grad_norm": 2.5,
"learning_rate": 0.00045955633115139343,
"loss": 5.7842,
"mean_token_accuracy": 0.16745383888483048,
"num_tokens": 42428285.0,
"step": 22755
},
{
"entropy": 6.064964628219604,
"epoch": 2.0098904980572234,
"grad_norm": 2.125,
"learning_rate": 0.0004595383160551007,
"loss": 5.6608,
"mean_token_accuracy": 0.17434049993753434,
"num_tokens": 42437832.0,
"step": 22760
},
{
"entropy": 5.989253759384155,
"epoch": 2.010332038149064,
"grad_norm": 1.8984375,
"learning_rate": 0.0004595202973438074,
"loss": 5.6666,
"mean_token_accuracy": 0.17717756181955338,
"num_tokens": 42447704.0,
"step": 22765
},
{
"entropy": 6.054805850982666,
"epoch": 2.0107735782409044,
"grad_norm": 1.390625,
"learning_rate": 0.0004595022750178663,
"loss": 5.7621,
"mean_token_accuracy": 0.1747470736503601,
"num_tokens": 42456571.0,
"step": 22770
},
{
"entropy": 6.092636775970459,
"epoch": 2.0112151183327445,
"grad_norm": 1.515625,
"learning_rate": 0.0004594842490776306,
"loss": 5.6707,
"mean_token_accuracy": 0.17643265873193742,
"num_tokens": 42466522.0,
"step": 22775
},
{
"entropy": 6.015467500686645,
"epoch": 2.011656658424585,
"grad_norm": 1.3828125,
"learning_rate": 0.00045946621952345335,
"loss": 5.6706,
"mean_token_accuracy": 0.17521903812885284,
"num_tokens": 42475940.0,
"step": 22780
},
{
"entropy": 6.051820087432861,
"epoch": 2.0120981985164255,
"grad_norm": 1.453125,
"learning_rate": 0.0004594481863556879,
"loss": 5.7789,
"mean_token_accuracy": 0.1693555787205696,
"num_tokens": 42486456.0,
"step": 22785
},
{
"entropy": 6.015244197845459,
"epoch": 2.0125397386082655,
"grad_norm": 2.046875,
"learning_rate": 0.00045943014957468726,
"loss": 5.7371,
"mean_token_accuracy": 0.1783664718270302,
"num_tokens": 42495578.0,
"step": 22790
},
{
"entropy": 6.047379970550537,
"epoch": 2.012981278700106,
"grad_norm": 1.4765625,
"learning_rate": 0.0004594121091808049,
"loss": 5.5935,
"mean_token_accuracy": 0.18576549142599105,
"num_tokens": 42504532.0,
"step": 22795
},
{
"entropy": 6.059862327575684,
"epoch": 2.0134228187919465,
"grad_norm": 1.578125,
"learning_rate": 0.00045939406517439427,
"loss": 5.6657,
"mean_token_accuracy": 0.17381043285131453,
"num_tokens": 42513683.0,
"step": 22800
},
{
"entropy": 5.996421051025391,
"epoch": 2.0138643588837866,
"grad_norm": 1.5546875,
"learning_rate": 0.00045937601755580864,
"loss": 5.7448,
"mean_token_accuracy": 0.17123643755912782,
"num_tokens": 42522717.0,
"step": 22805
},
{
"entropy": 6.051730012893676,
"epoch": 2.014305898975627,
"grad_norm": 1.7109375,
"learning_rate": 0.0004593579663254018,
"loss": 5.7603,
"mean_token_accuracy": 0.1746223509311676,
"num_tokens": 42531847.0,
"step": 22810
},
{
"entropy": 6.031564521789551,
"epoch": 2.014747439067467,
"grad_norm": 1.578125,
"learning_rate": 0.0004593399114835272,
"loss": 5.6828,
"mean_token_accuracy": 0.17750138491392137,
"num_tokens": 42540869.0,
"step": 22815
},
{
"entropy": 5.962666416168213,
"epoch": 2.0151889791593076,
"grad_norm": 1.609375,
"learning_rate": 0.00045932185303053857,
"loss": 5.6505,
"mean_token_accuracy": 0.1821257531642914,
"num_tokens": 42550875.0,
"step": 22820
},
{
"entropy": 5.969535636901855,
"epoch": 2.015630519251148,
"grad_norm": 1.3359375,
"learning_rate": 0.0004593037909667898,
"loss": 5.6536,
"mean_token_accuracy": 0.1784612074494362,
"num_tokens": 42560066.0,
"step": 22825
},
{
"entropy": 5.973468685150147,
"epoch": 2.016072059342988,
"grad_norm": 1.296875,
"learning_rate": 0.0004592857252926344,
"loss": 5.6298,
"mean_token_accuracy": 0.1841694414615631,
"num_tokens": 42568733.0,
"step": 22830
},
{
"entropy": 6.048460578918457,
"epoch": 2.0165135994348287,
"grad_norm": 1.9609375,
"learning_rate": 0.00045926765600842653,
"loss": 5.6731,
"mean_token_accuracy": 0.17765283584594727,
"num_tokens": 42577565.0,
"step": 22835
},
{
"entropy": 6.024071168899536,
"epoch": 2.016955139526669,
"grad_norm": 1.671875,
"learning_rate": 0.00045924958311452006,
"loss": 5.7247,
"mean_token_accuracy": 0.17611250877380372,
"num_tokens": 42586489.0,
"step": 22840
},
{
"entropy": 6.006563758850097,
"epoch": 2.017396679618509,
"grad_norm": 1.3359375,
"learning_rate": 0.00045923150661126904,
"loss": 5.7509,
"mean_token_accuracy": 0.17462799847126007,
"num_tokens": 42596263.0,
"step": 22845
},
{
"entropy": 6.059326696395874,
"epoch": 2.0178382197103497,
"grad_norm": 2.03125,
"learning_rate": 0.0004592134264990276,
"loss": 5.6802,
"mean_token_accuracy": 0.17673261612653732,
"num_tokens": 42605787.0,
"step": 22850
},
{
"entropy": 6.151911497116089,
"epoch": 2.01827975980219,
"grad_norm": 1.703125,
"learning_rate": 0.00045919534277814996,
"loss": 5.849,
"mean_token_accuracy": 0.17189008593559266,
"num_tokens": 42616014.0,
"step": 22855
},
{
"entropy": 6.042339181900024,
"epoch": 2.0187212998940303,
"grad_norm": 1.484375,
"learning_rate": 0.0004591772554489902,
"loss": 5.7195,
"mean_token_accuracy": 0.18031348437070846,
"num_tokens": 42624839.0,
"step": 22860
},
{
"entropy": 6.063779973983765,
"epoch": 2.0191628399858708,
"grad_norm": 1.671875,
"learning_rate": 0.0004591591645119028,
"loss": 5.7174,
"mean_token_accuracy": 0.17697373330593108,
"num_tokens": 42633811.0,
"step": 22865
},
{
"entropy": 5.893327474594116,
"epoch": 2.0196043800777113,
"grad_norm": 1.609375,
"learning_rate": 0.00045914106996724217,
"loss": 5.6117,
"mean_token_accuracy": 0.1896447569131851,
"num_tokens": 42643140.0,
"step": 22870
},
{
"entropy": 5.935611248016357,
"epoch": 2.0200459201695513,
"grad_norm": 1.34375,
"learning_rate": 0.00045912297181536257,
"loss": 5.6038,
"mean_token_accuracy": 0.18800802379846573,
"num_tokens": 42651123.0,
"step": 22875
},
{
"entropy": 6.039697980880737,
"epoch": 2.020487460261392,
"grad_norm": 1.578125,
"learning_rate": 0.00045910487005661877,
"loss": 5.6583,
"mean_token_accuracy": 0.18974012583494188,
"num_tokens": 42659880.0,
"step": 22880
},
{
"entropy": 6.027958822250366,
"epoch": 2.020929000353232,
"grad_norm": 1.515625,
"learning_rate": 0.0004590867646913653,
"loss": 5.6306,
"mean_token_accuracy": 0.18385301828384398,
"num_tokens": 42668689.0,
"step": 22885
},
{
"entropy": 5.998252010345459,
"epoch": 2.0213705404450724,
"grad_norm": 2.203125,
"learning_rate": 0.00045906865571995666,
"loss": 5.7,
"mean_token_accuracy": 0.18148774951696395,
"num_tokens": 42678403.0,
"step": 22890
},
{
"entropy": 5.939903926849365,
"epoch": 2.021812080536913,
"grad_norm": 2.421875,
"learning_rate": 0.0004590505431427479,
"loss": 5.6802,
"mean_token_accuracy": 0.18103769570589065,
"num_tokens": 42688203.0,
"step": 22895
},
{
"entropy": 6.019772720336914,
"epoch": 2.022253620628753,
"grad_norm": 1.5,
"learning_rate": 0.0004590324269600936,
"loss": 5.7578,
"mean_token_accuracy": 0.1658920615911484,
"num_tokens": 42698343.0,
"step": 22900
},
{
"entropy": 6.042679500579834,
"epoch": 2.0226951607205934,
"grad_norm": 1.2421875,
"learning_rate": 0.00045901430717234875,
"loss": 5.5965,
"mean_token_accuracy": 0.18744057714939116,
"num_tokens": 42707483.0,
"step": 22905
},
{
"entropy": 6.085736227035523,
"epoch": 2.023136700812434,
"grad_norm": 1.546875,
"learning_rate": 0.0004589961837798682,
"loss": 5.7554,
"mean_token_accuracy": 0.17636916786432266,
"num_tokens": 42717820.0,
"step": 22910
},
{
"entropy": 6.058533716201782,
"epoch": 2.023578240904274,
"grad_norm": 1.3203125,
"learning_rate": 0.00045897805678300714,
"loss": 5.7062,
"mean_token_accuracy": 0.18063692152500152,
"num_tokens": 42726996.0,
"step": 22915
},
{
"entropy": 6.031053924560547,
"epoch": 2.0240197809961145,
"grad_norm": 1.28125,
"learning_rate": 0.0004589599261821205,
"loss": 5.697,
"mean_token_accuracy": 0.18230030983686446,
"num_tokens": 42735779.0,
"step": 22920
},
{
"entropy": 6.03090763092041,
"epoch": 2.024461321087955,
"grad_norm": 1.4609375,
"learning_rate": 0.00045894179197756364,
"loss": 5.7866,
"mean_token_accuracy": 0.1747223660349846,
"num_tokens": 42745089.0,
"step": 22925
},
{
"entropy": 6.065462350845337,
"epoch": 2.024902861179795,
"grad_norm": 2.15625,
"learning_rate": 0.00045892365416969164,
"loss": 5.749,
"mean_token_accuracy": 0.16521667540073395,
"num_tokens": 42754963.0,
"step": 22930
},
{
"entropy": 6.174970865249634,
"epoch": 2.0253444012716355,
"grad_norm": 2.234375,
"learning_rate": 0.00045890551275885985,
"loss": 5.7693,
"mean_token_accuracy": 0.1717963546514511,
"num_tokens": 42764856.0,
"step": 22935
},
{
"entropy": 6.068346834182739,
"epoch": 2.025785941363476,
"grad_norm": 2.09375,
"learning_rate": 0.00045888736774542363,
"loss": 5.7823,
"mean_token_accuracy": 0.1737419918179512,
"num_tokens": 42775028.0,
"step": 22940
},
{
"entropy": 5.981128454208374,
"epoch": 2.026227481455316,
"grad_norm": 1.5546875,
"learning_rate": 0.0004588692191297385,
"loss": 5.7096,
"mean_token_accuracy": 0.1791267588734627,
"num_tokens": 42784288.0,
"step": 22945
},
{
"entropy": 6.070105266571045,
"epoch": 2.0266690215471566,
"grad_norm": 1.609375,
"learning_rate": 0.0004588510669121599,
"loss": 5.7818,
"mean_token_accuracy": 0.17165508419275283,
"num_tokens": 42793356.0,
"step": 22950
},
{
"entropy": 6.05946798324585,
"epoch": 2.0271105616389966,
"grad_norm": 2.046875,
"learning_rate": 0.00045883291109304346,
"loss": 5.6227,
"mean_token_accuracy": 0.18340609222650528,
"num_tokens": 42802287.0,
"step": 22955
},
{
"entropy": 6.032494020462036,
"epoch": 2.027552101730837,
"grad_norm": 1.9453125,
"learning_rate": 0.0004588147516727449,
"loss": 5.7602,
"mean_token_accuracy": 0.17274622470140458,
"num_tokens": 42812206.0,
"step": 22960
},
{
"entropy": 6.102327537536621,
"epoch": 2.0279936418226776,
"grad_norm": 1.7890625,
"learning_rate": 0.0004587965886516199,
"loss": 5.7417,
"mean_token_accuracy": 0.17018677592277526,
"num_tokens": 42822046.0,
"step": 22965
},
{
"entropy": 6.057186651229858,
"epoch": 2.0284351819145177,
"grad_norm": 1.78125,
"learning_rate": 0.00045877842203002417,
"loss": 5.6637,
"mean_token_accuracy": 0.1855585902929306,
"num_tokens": 42831228.0,
"step": 22970
},
{
"entropy": 6.048680400848388,
"epoch": 2.028876722006358,
"grad_norm": 1.609375,
"learning_rate": 0.00045876025180831373,
"loss": 5.7612,
"mean_token_accuracy": 0.17626469433307648,
"num_tokens": 42840683.0,
"step": 22975
},
{
"entropy": 6.062376976013184,
"epoch": 2.0293182620981987,
"grad_norm": 1.6796875,
"learning_rate": 0.00045874207798684446,
"loss": 5.6766,
"mean_token_accuracy": 0.17841056883335113,
"num_tokens": 42849731.0,
"step": 22980
},
{
"entropy": 6.06018648147583,
"epoch": 2.0297598021900387,
"grad_norm": 1.484375,
"learning_rate": 0.00045872390056597235,
"loss": 5.7281,
"mean_token_accuracy": 0.17724827378988267,
"num_tokens": 42858028.0,
"step": 22985
},
{
"entropy": 6.025942611694336,
"epoch": 2.030201342281879,
"grad_norm": 1.4609375,
"learning_rate": 0.0004587057195460536,
"loss": 5.7383,
"mean_token_accuracy": 0.1715095490217209,
"num_tokens": 42867340.0,
"step": 22990
},
{
"entropy": 6.136754179000855,
"epoch": 2.0306428823737197,
"grad_norm": 1.5625,
"learning_rate": 0.00045868753492744424,
"loss": 5.7314,
"mean_token_accuracy": 0.17500062733888627,
"num_tokens": 42877006.0,
"step": 22995
},
{
"entropy": 6.021406841278076,
"epoch": 2.0310844224655598,
"grad_norm": 1.4375,
"learning_rate": 0.0004586693467105005,
"loss": 5.6245,
"mean_token_accuracy": 0.17892100065946578,
"num_tokens": 42886324.0,
"step": 23000
},
{
"entropy": 6.016494989395142,
"epoch": 2.0315259625574003,
"grad_norm": 2.453125,
"learning_rate": 0.0004586511548955788,
"loss": 5.7223,
"mean_token_accuracy": 0.18065536320209502,
"num_tokens": 42896411.0,
"step": 23005
},
{
"entropy": 5.941242027282715,
"epoch": 2.0319675026492408,
"grad_norm": 1.3828125,
"learning_rate": 0.0004586329594830353,
"loss": 5.5934,
"mean_token_accuracy": 0.18335920572280884,
"num_tokens": 42905606.0,
"step": 23010
},
{
"entropy": 5.968629455566406,
"epoch": 2.032409042741081,
"grad_norm": 1.2421875,
"learning_rate": 0.00045861476047322664,
"loss": 5.5735,
"mean_token_accuracy": 0.18334662914276123,
"num_tokens": 42914226.0,
"step": 23015
},
{
"entropy": 6.02502965927124,
"epoch": 2.0328505828329213,
"grad_norm": 1.5234375,
"learning_rate": 0.00045859655786650925,
"loss": 5.7833,
"mean_token_accuracy": 0.16697933077812194,
"num_tokens": 42923910.0,
"step": 23020
},
{
"entropy": 5.971998929977417,
"epoch": 2.0332921229247614,
"grad_norm": 1.84375,
"learning_rate": 0.0004585783516632397,
"loss": 5.6235,
"mean_token_accuracy": 0.19275569915771484,
"num_tokens": 42933203.0,
"step": 23025
},
{
"entropy": 6.089569711685181,
"epoch": 2.033733663016602,
"grad_norm": 2.828125,
"learning_rate": 0.0004585601418637747,
"loss": 5.7004,
"mean_token_accuracy": 0.17364487051963806,
"num_tokens": 42942143.0,
"step": 23030
},
{
"entropy": 5.980508422851562,
"epoch": 2.0341752031084424,
"grad_norm": 1.5,
"learning_rate": 0.0004585419284684708,
"loss": 5.7074,
"mean_token_accuracy": 0.17887700498104095,
"num_tokens": 42951432.0,
"step": 23035
},
{
"entropy": 5.995807886123657,
"epoch": 2.0346167432002824,
"grad_norm": 2.734375,
"learning_rate": 0.000458523711477685,
"loss": 5.637,
"mean_token_accuracy": 0.17593905329704285,
"num_tokens": 42961033.0,
"step": 23040
},
{
"entropy": 6.029995632171631,
"epoch": 2.035058283292123,
"grad_norm": 1.6015625,
"learning_rate": 0.00045850549089177406,
"loss": 5.6257,
"mean_token_accuracy": 0.18923543244600297,
"num_tokens": 42971371.0,
"step": 23045
},
{
"entropy": 6.04789628982544,
"epoch": 2.0354998233839634,
"grad_norm": 2.0625,
"learning_rate": 0.00045848726671109493,
"loss": 5.7007,
"mean_token_accuracy": 0.16389745771884917,
"num_tokens": 42980445.0,
"step": 23050
},
{
"entropy": 6.036453676223755,
"epoch": 2.0359413634758035,
"grad_norm": 1.4453125,
"learning_rate": 0.00045846903893600457,
"loss": 5.6984,
"mean_token_accuracy": 0.1728944182395935,
"num_tokens": 42989923.0,
"step": 23055
},
{
"entropy": 6.000191926956177,
"epoch": 2.036382903567644,
"grad_norm": 1.546875,
"learning_rate": 0.00045845080756686007,
"loss": 5.5666,
"mean_token_accuracy": 0.1856266513466835,
"num_tokens": 42998370.0,
"step": 23060
},
{
"entropy": 6.028709125518799,
"epoch": 2.0368244436594845,
"grad_norm": 1.6875,
"learning_rate": 0.00045843257260401855,
"loss": 5.6803,
"mean_token_accuracy": 0.18184732496738434,
"num_tokens": 43007641.0,
"step": 23065
},
{
"entropy": 5.980359792709351,
"epoch": 2.0372659837513245,
"grad_norm": 1.703125,
"learning_rate": 0.00045841433404783733,
"loss": 5.6244,
"mean_token_accuracy": 0.18429340422153473,
"num_tokens": 43016271.0,
"step": 23070
},
{
"entropy": 5.978630828857422,
"epoch": 2.037707523843165,
"grad_norm": 1.96875,
"learning_rate": 0.0004583960918986736,
"loss": 5.5795,
"mean_token_accuracy": 0.18693849295377732,
"num_tokens": 43024525.0,
"step": 23075
},
{
"entropy": 5.980117559432983,
"epoch": 2.0381490639350055,
"grad_norm": 1.59375,
"learning_rate": 0.00045837784615688473,
"loss": 5.7018,
"mean_token_accuracy": 0.1777350515127182,
"num_tokens": 43033248.0,
"step": 23080
},
{
"entropy": 6.142973184585571,
"epoch": 2.0385906040268456,
"grad_norm": 1.6171875,
"learning_rate": 0.0004583595968228281,
"loss": 5.8723,
"mean_token_accuracy": 0.17307489663362502,
"num_tokens": 43042171.0,
"step": 23085
},
{
"entropy": 6.079459762573242,
"epoch": 2.039032144118686,
"grad_norm": 2.25,
"learning_rate": 0.00045834134389686137,
"loss": 5.6444,
"mean_token_accuracy": 0.18346306383609773,
"num_tokens": 43051447.0,
"step": 23090
},
{
"entropy": 6.030884790420532,
"epoch": 2.039473684210526,
"grad_norm": 2.234375,
"learning_rate": 0.0004583230873793419,
"loss": 5.611,
"mean_token_accuracy": 0.17918909937143326,
"num_tokens": 43059869.0,
"step": 23095
},
{
"entropy": 5.893182420730591,
"epoch": 2.0399152243023666,
"grad_norm": 1.8984375,
"learning_rate": 0.00045830482727062736,
"loss": 5.5674,
"mean_token_accuracy": 0.18762832432985305,
"num_tokens": 43068412.0,
"step": 23100
},
{
"entropy": 5.983854627609253,
"epoch": 2.040356764394207,
"grad_norm": 1.5625,
"learning_rate": 0.00045828656357107557,
"loss": 5.7039,
"mean_token_accuracy": 0.17574212849140167,
"num_tokens": 43077130.0,
"step": 23105
},
{
"entropy": 6.106360578536988,
"epoch": 2.040798304486047,
"grad_norm": 2.25,
"learning_rate": 0.0004582682962810442,
"loss": 5.7487,
"mean_token_accuracy": 0.17404151260852813,
"num_tokens": 43086304.0,
"step": 23110
},
{
"entropy": 6.07961139678955,
"epoch": 2.0412398445778877,
"grad_norm": 4.25,
"learning_rate": 0.0004582500254008912,
"loss": 5.6723,
"mean_token_accuracy": 0.18423030227422715,
"num_tokens": 43095734.0,
"step": 23115
},
{
"entropy": 6.025531244277954,
"epoch": 2.041681384669728,
"grad_norm": 3.4375,
"learning_rate": 0.00045823175093097444,
"loss": 5.6679,
"mean_token_accuracy": 0.18191159665584564,
"num_tokens": 43104761.0,
"step": 23120
},
{
"entropy": 6.02693543434143,
"epoch": 2.042122924761568,
"grad_norm": 2.40625,
"learning_rate": 0.0004582134728716518,
"loss": 5.708,
"mean_token_accuracy": 0.18012767136096955,
"num_tokens": 43114182.0,
"step": 23125
},
{
"entropy": 5.990087175369263,
"epoch": 2.0425644648534087,
"grad_norm": 2.03125,
"learning_rate": 0.0004581951912232814,
"loss": 5.6683,
"mean_token_accuracy": 0.18473038226366043,
"num_tokens": 43124893.0,
"step": 23130
},
{
"entropy": 6.017590618133545,
"epoch": 2.043006004945249,
"grad_norm": 1.46875,
"learning_rate": 0.0004581769059862215,
"loss": 5.6913,
"mean_token_accuracy": 0.17839339822530748,
"num_tokens": 43133514.0,
"step": 23135
},
{
"entropy": 6.086554098129272,
"epoch": 2.0434475450370893,
"grad_norm": 1.4609375,
"learning_rate": 0.0004581586171608301,
"loss": 5.7619,
"mean_token_accuracy": 0.17515552043914795,
"num_tokens": 43142082.0,
"step": 23140
},
{
"entropy": 6.09083251953125,
"epoch": 2.0438890851289298,
"grad_norm": 1.59375,
"learning_rate": 0.0004581403247474657,
"loss": 5.7248,
"mean_token_accuracy": 0.16987676173448563,
"num_tokens": 43151466.0,
"step": 23145
},
{
"entropy": 6.09461088180542,
"epoch": 2.0443306252207702,
"grad_norm": 1.375,
"learning_rate": 0.0004581220287464864,
"loss": 5.7797,
"mean_token_accuracy": 0.1676504507660866,
"num_tokens": 43160631.0,
"step": 23150
},
{
"entropy": 6.0175042152404785,
"epoch": 2.0447721653126103,
"grad_norm": 1.296875,
"learning_rate": 0.0004581037291582507,
"loss": 5.78,
"mean_token_accuracy": 0.1764102414250374,
"num_tokens": 43170968.0,
"step": 23155
},
{
"entropy": 6.076086568832397,
"epoch": 2.045213705404451,
"grad_norm": 1.859375,
"learning_rate": 0.0004580854259831171,
"loss": 5.6713,
"mean_token_accuracy": 0.17774345874786376,
"num_tokens": 43179661.0,
"step": 23160
},
{
"entropy": 6.043463039398193,
"epoch": 2.045655245496291,
"grad_norm": 1.6640625,
"learning_rate": 0.0004580671192214441,
"loss": 5.5352,
"mean_token_accuracy": 0.19697397351264953,
"num_tokens": 43188994.0,
"step": 23165
},
{
"entropy": 6.0617859840393065,
"epoch": 2.0460967855881314,
"grad_norm": 1.90625,
"learning_rate": 0.00045804880887359036,
"loss": 5.8031,
"mean_token_accuracy": 0.1698348954319954,
"num_tokens": 43199001.0,
"step": 23170
},
{
"entropy": 6.010433101654053,
"epoch": 2.046538325679972,
"grad_norm": 1.6484375,
"learning_rate": 0.0004580304949399146,
"loss": 5.6558,
"mean_token_accuracy": 0.18109705150127411,
"num_tokens": 43208113.0,
"step": 23175
},
{
"entropy": 5.983536624908448,
"epoch": 2.046979865771812,
"grad_norm": 1.4375,
"learning_rate": 0.00045801217742077544,
"loss": 5.6818,
"mean_token_accuracy": 0.18322782963514328,
"num_tokens": 43216983.0,
"step": 23180
},
{
"entropy": 6.005053758621216,
"epoch": 2.0474214058636524,
"grad_norm": 1.296875,
"learning_rate": 0.0004579938563165319,
"loss": 5.6327,
"mean_token_accuracy": 0.1829664632678032,
"num_tokens": 43225965.0,
"step": 23185
},
{
"entropy": 6.04766263961792,
"epoch": 2.047862945955493,
"grad_norm": 1.84375,
"learning_rate": 0.0004579755316275427,
"loss": 5.6021,
"mean_token_accuracy": 0.18402197510004042,
"num_tokens": 43235078.0,
"step": 23190
},
{
"entropy": 5.977911424636841,
"epoch": 2.048304486047333,
"grad_norm": 2.359375,
"learning_rate": 0.000457957203354167,
"loss": 5.7192,
"mean_token_accuracy": 0.17831050157546996,
"num_tokens": 43244398.0,
"step": 23195
},
{
"entropy": 6.061401796340943,
"epoch": 2.0487460261391734,
"grad_norm": 1.9140625,
"learning_rate": 0.00045793887149676366,
"loss": 5.7595,
"mean_token_accuracy": 0.17781311124563218,
"num_tokens": 43254638.0,
"step": 23200
},
{
"entropy": 5.977393436431885,
"epoch": 2.049187566231014,
"grad_norm": 1.4296875,
"learning_rate": 0.000457920536055692,
"loss": 5.6473,
"mean_token_accuracy": 0.17690491676330566,
"num_tokens": 43263287.0,
"step": 23205
},
{
"entropy": 5.985055255889892,
"epoch": 2.049629106322854,
"grad_norm": 2.640625,
"learning_rate": 0.00045790219703131097,
"loss": 5.607,
"mean_token_accuracy": 0.18264148086309434,
"num_tokens": 43272921.0,
"step": 23210
},
{
"entropy": 6.0334679126739506,
"epoch": 2.0500706464146945,
"grad_norm": 1.40625,
"learning_rate": 0.00045788385442397994,
"loss": 5.6902,
"mean_token_accuracy": 0.18028185218572618,
"num_tokens": 43283423.0,
"step": 23215
},
{
"entropy": 6.125678586959839,
"epoch": 2.050512186506535,
"grad_norm": 1.53125,
"learning_rate": 0.0004578655082340582,
"loss": 5.7482,
"mean_token_accuracy": 0.1774241015315056,
"num_tokens": 43293031.0,
"step": 23220
},
{
"entropy": 6.020258140563965,
"epoch": 2.050953726598375,
"grad_norm": 1.6484375,
"learning_rate": 0.0004578471584619051,
"loss": 5.7235,
"mean_token_accuracy": 0.18185753226280213,
"num_tokens": 43302775.0,
"step": 23225
},
{
"entropy": 5.9089329719543455,
"epoch": 2.0513952666902155,
"grad_norm": 1.7578125,
"learning_rate": 0.0004578288051078803,
"loss": 5.6498,
"mean_token_accuracy": 0.18566802740097046,
"num_tokens": 43312341.0,
"step": 23230
},
{
"entropy": 6.037532901763916,
"epoch": 2.0518368067820556,
"grad_norm": 1.8671875,
"learning_rate": 0.00045781044817234305,
"loss": 5.6804,
"mean_token_accuracy": 0.17813828587532043,
"num_tokens": 43321358.0,
"step": 23235
},
{
"entropy": 5.985131883621216,
"epoch": 2.052278346873896,
"grad_norm": 1.9921875,
"learning_rate": 0.00045779208765565324,
"loss": 5.6713,
"mean_token_accuracy": 0.1774029865860939,
"num_tokens": 43331839.0,
"step": 23240
},
{
"entropy": 6.021951389312744,
"epoch": 2.0527198869657366,
"grad_norm": 1.671875,
"learning_rate": 0.0004577737235581702,
"loss": 5.7584,
"mean_token_accuracy": 0.17365403473377228,
"num_tokens": 43340384.0,
"step": 23245
},
{
"entropy": 6.179580402374268,
"epoch": 2.0531614270575766,
"grad_norm": 1.625,
"learning_rate": 0.00045775535588025404,
"loss": 5.728,
"mean_token_accuracy": 0.17615599036216736,
"num_tokens": 43349264.0,
"step": 23250
},
{
"entropy": 6.054706811904907,
"epoch": 2.053602967149417,
"grad_norm": 1.7578125,
"learning_rate": 0.0004577369846222643,
"loss": 5.7259,
"mean_token_accuracy": 0.1776216521859169,
"num_tokens": 43358598.0,
"step": 23255
},
{
"entropy": 6.024570941925049,
"epoch": 2.0540445072412576,
"grad_norm": 2.171875,
"learning_rate": 0.0004577186097845609,
"loss": 5.6692,
"mean_token_accuracy": 0.1762707144021988,
"num_tokens": 43368357.0,
"step": 23260
},
{
"entropy": 6.1250073432922365,
"epoch": 2.0544860473330977,
"grad_norm": 1.6484375,
"learning_rate": 0.00045770023136750405,
"loss": 5.753,
"mean_token_accuracy": 0.1752946600317955,
"num_tokens": 43378143.0,
"step": 23265
},
{
"entropy": 5.979833173751831,
"epoch": 2.054927587424938,
"grad_norm": 2.671875,
"learning_rate": 0.0004576818493714534,
"loss": 5.6447,
"mean_token_accuracy": 0.18728580921888352,
"num_tokens": 43387010.0,
"step": 23270
},
{
"entropy": 5.901286506652832,
"epoch": 2.0553691275167787,
"grad_norm": 1.984375,
"learning_rate": 0.0004576634637967693,
"loss": 5.5473,
"mean_token_accuracy": 0.18618601262569429,
"num_tokens": 43395864.0,
"step": 23275
},
{
"entropy": 6.037658405303955,
"epoch": 2.0558106676086187,
"grad_norm": 1.359375,
"learning_rate": 0.0004576450746438118,
"loss": 5.637,
"mean_token_accuracy": 0.1835816740989685,
"num_tokens": 43404662.0,
"step": 23280
},
{
"entropy": 6.094954872131348,
"epoch": 2.0562522077004592,
"grad_norm": 1.7265625,
"learning_rate": 0.0004576266819129412,
"loss": 5.689,
"mean_token_accuracy": 0.17649575620889663,
"num_tokens": 43413927.0,
"step": 23285
},
{
"entropy": 6.039575386047363,
"epoch": 2.0566937477922997,
"grad_norm": 2.078125,
"learning_rate": 0.0004576082856045177,
"loss": 5.8255,
"mean_token_accuracy": 0.16206884980201722,
"num_tokens": 43424197.0,
"step": 23290
},
{
"entropy": 6.108440637588501,
"epoch": 2.05713528788414,
"grad_norm": 1.5234375,
"learning_rate": 0.00045758988571890176,
"loss": 5.7053,
"mean_token_accuracy": 0.17422624230384826,
"num_tokens": 43432630.0,
"step": 23295
},
{
"entropy": 5.999114084243774,
"epoch": 2.0575768279759803,
"grad_norm": 1.7109375,
"learning_rate": 0.00045757148225645383,
"loss": 5.7011,
"mean_token_accuracy": 0.17549870312213897,
"num_tokens": 43442186.0,
"step": 23300
},
{
"entropy": 5.966820192337036,
"epoch": 2.0580183680678203,
"grad_norm": 1.4296875,
"learning_rate": 0.00045755307521753443,
"loss": 5.6455,
"mean_token_accuracy": 0.1872586652636528,
"num_tokens": 43451927.0,
"step": 23305
},
{
"entropy": 6.075530958175659,
"epoch": 2.058459908159661,
"grad_norm": 1.5,
"learning_rate": 0.00045753466460250405,
"loss": 5.6676,
"mean_token_accuracy": 0.17543017119169235,
"num_tokens": 43460879.0,
"step": 23310
},
{
"entropy": 6.02326340675354,
"epoch": 2.0589014482515013,
"grad_norm": 1.5078125,
"learning_rate": 0.0004575162504117234,
"loss": 5.7828,
"mean_token_accuracy": 0.16743825376033783,
"num_tokens": 43469918.0,
"step": 23315
},
{
"entropy": 6.034957313537598,
"epoch": 2.0593429883433414,
"grad_norm": 1.4921875,
"learning_rate": 0.0004574978326455532,
"loss": 5.681,
"mean_token_accuracy": 0.17846959382295607,
"num_tokens": 43478779.0,
"step": 23320
},
{
"entropy": 6.073911046981811,
"epoch": 2.059784528435182,
"grad_norm": 5.84375,
"learning_rate": 0.0004574794113043543,
"loss": 5.7694,
"mean_token_accuracy": 0.1749046891927719,
"num_tokens": 43488128.0,
"step": 23325
},
{
"entropy": 5.9904985427856445,
"epoch": 2.0602260685270224,
"grad_norm": 1.3203125,
"learning_rate": 0.0004574609863884875,
"loss": 5.6898,
"mean_token_accuracy": 0.17811229228973388,
"num_tokens": 43497567.0,
"step": 23330
},
{
"entropy": 6.09191403388977,
"epoch": 2.0606676086188624,
"grad_norm": 1.703125,
"learning_rate": 0.00045744255789831377,
"loss": 5.7342,
"mean_token_accuracy": 0.17082674503326417,
"num_tokens": 43507360.0,
"step": 23335
},
{
"entropy": 6.060030794143676,
"epoch": 2.061109148710703,
"grad_norm": 1.6171875,
"learning_rate": 0.00045742412583419403,
"loss": 5.6976,
"mean_token_accuracy": 0.18158670514822006,
"num_tokens": 43517601.0,
"step": 23340
},
{
"entropy": 5.9667980670928955,
"epoch": 2.0615506888025434,
"grad_norm": 2.0625,
"learning_rate": 0.00045740569019648945,
"loss": 5.6396,
"mean_token_accuracy": 0.183489628136158,
"num_tokens": 43526348.0,
"step": 23345
},
{
"entropy": 6.024716901779175,
"epoch": 2.0619922288943835,
"grad_norm": 1.375,
"learning_rate": 0.0004573872509855612,
"loss": 5.6424,
"mean_token_accuracy": 0.18066062927246093,
"num_tokens": 43536106.0,
"step": 23350
},
{
"entropy": 6.100736665725708,
"epoch": 2.062433768986224,
"grad_norm": 1.8828125,
"learning_rate": 0.0004573688082017703,
"loss": 5.7613,
"mean_token_accuracy": 0.17104960680007936,
"num_tokens": 43545110.0,
"step": 23355
},
{
"entropy": 6.023363208770752,
"epoch": 2.0628753090780645,
"grad_norm": 1.6640625,
"learning_rate": 0.00045735036184547825,
"loss": 5.6657,
"mean_token_accuracy": 0.17442519664764405,
"num_tokens": 43554226.0,
"step": 23360
},
{
"entropy": 6.017705345153809,
"epoch": 2.0633168491699045,
"grad_norm": 3.21875,
"learning_rate": 0.00045733191191704633,
"loss": 5.699,
"mean_token_accuracy": 0.18403338342905046,
"num_tokens": 43563184.0,
"step": 23365
},
{
"entropy": 6.029230690002441,
"epoch": 2.063758389261745,
"grad_norm": 1.296875,
"learning_rate": 0.0004573134584168359,
"loss": 5.6687,
"mean_token_accuracy": 0.18793341219425203,
"num_tokens": 43572595.0,
"step": 23370
},
{
"entropy": 6.0479542255401615,
"epoch": 2.064199929353585,
"grad_norm": 1.484375,
"learning_rate": 0.0004572950013452086,
"loss": 5.76,
"mean_token_accuracy": 0.16995365619659425,
"num_tokens": 43582211.0,
"step": 23375
},
{
"entropy": 5.999669170379638,
"epoch": 2.0646414694454256,
"grad_norm": 1.8046875,
"learning_rate": 0.0004572765407025257,
"loss": 5.6068,
"mean_token_accuracy": 0.18323877602815627,
"num_tokens": 43591060.0,
"step": 23380
},
{
"entropy": 6.082147932052612,
"epoch": 2.065083009537266,
"grad_norm": 2.109375,
"learning_rate": 0.0004572580764891493,
"loss": 5.8091,
"mean_token_accuracy": 0.17198803275823593,
"num_tokens": 43600057.0,
"step": 23385
},
{
"entropy": 6.09594612121582,
"epoch": 2.065524549629106,
"grad_norm": 2.1875,
"learning_rate": 0.0004572396087054406,
"loss": 5.6083,
"mean_token_accuracy": 0.18684443533420564,
"num_tokens": 43608609.0,
"step": 23390
},
{
"entropy": 5.976738595962525,
"epoch": 2.0659660897209466,
"grad_norm": 1.4765625,
"learning_rate": 0.0004572211373517618,
"loss": 5.7449,
"mean_token_accuracy": 0.1754678502678871,
"num_tokens": 43618751.0,
"step": 23395
},
{
"entropy": 6.095247507095337,
"epoch": 2.066407629812787,
"grad_norm": 1.78125,
"learning_rate": 0.00045720266242847446,
"loss": 5.8271,
"mean_token_accuracy": 0.17263033986091614,
"num_tokens": 43628934.0,
"step": 23400
},
{
"entropy": 6.115425968170166,
"epoch": 2.066849169904627,
"grad_norm": 1.5390625,
"learning_rate": 0.00045718418393594055,
"loss": 5.7321,
"mean_token_accuracy": 0.17766957879066467,
"num_tokens": 43638512.0,
"step": 23405
},
{
"entropy": 5.995413827896118,
"epoch": 2.0672907099964677,
"grad_norm": 1.4765625,
"learning_rate": 0.00045716570187452214,
"loss": 5.6604,
"mean_token_accuracy": 0.17129747569561005,
"num_tokens": 43647708.0,
"step": 23410
},
{
"entropy": 6.026467370986938,
"epoch": 2.067732250088308,
"grad_norm": 2.203125,
"learning_rate": 0.0004571472162445813,
"loss": 5.7216,
"mean_token_accuracy": 0.178570519387722,
"num_tokens": 43657096.0,
"step": 23415
},
{
"entropy": 6.020626449584961,
"epoch": 2.0681737901801482,
"grad_norm": 1.5390625,
"learning_rate": 0.00045712872704647994,
"loss": 5.7286,
"mean_token_accuracy": 0.175422565639019,
"num_tokens": 43667410.0,
"step": 23420
},
{
"entropy": 5.998456382751465,
"epoch": 2.0686153302719887,
"grad_norm": 1.484375,
"learning_rate": 0.0004571102342805805,
"loss": 5.672,
"mean_token_accuracy": 0.18343950510025026,
"num_tokens": 43675800.0,
"step": 23425
},
{
"entropy": 6.014572095870972,
"epoch": 2.0690568703638292,
"grad_norm": 1.7890625,
"learning_rate": 0.0004570917379472451,
"loss": 5.6856,
"mean_token_accuracy": 0.18210575580596924,
"num_tokens": 43684802.0,
"step": 23430
},
{
"entropy": 5.98885407447815,
"epoch": 2.0694984104556693,
"grad_norm": 1.8125,
"learning_rate": 0.00045707323804683616,
"loss": 5.6858,
"mean_token_accuracy": 0.1790901243686676,
"num_tokens": 43693968.0,
"step": 23435
},
{
"entropy": 6.135851001739502,
"epoch": 2.06993995054751,
"grad_norm": 1.4921875,
"learning_rate": 0.000457054734579716,
"loss": 5.7046,
"mean_token_accuracy": 0.17207382321357728,
"num_tokens": 43703177.0,
"step": 23440
},
{
"entropy": 6.0369250774383545,
"epoch": 2.07038149063935,
"grad_norm": 1.65625,
"learning_rate": 0.00045703622754624716,
"loss": 5.7251,
"mean_token_accuracy": 0.17763496786355973,
"num_tokens": 43712894.0,
"step": 23445
},
{
"entropy": 6.0547600269317625,
"epoch": 2.0708230307311903,
"grad_norm": 1.53125,
"learning_rate": 0.00045701771694679213,
"loss": 5.6243,
"mean_token_accuracy": 0.18379054963588715,
"num_tokens": 43722591.0,
"step": 23450
},
{
"entropy": 5.957055997848511,
"epoch": 2.071264570823031,
"grad_norm": 1.6328125,
"learning_rate": 0.00045699920278171355,
"loss": 5.6185,
"mean_token_accuracy": 0.1862846463918686,
"num_tokens": 43732251.0,
"step": 23455
},
{
"entropy": 6.10202317237854,
"epoch": 2.071706110914871,
"grad_norm": 1.4140625,
"learning_rate": 0.0004569806850513741,
"loss": 5.7794,
"mean_token_accuracy": 0.1783634677529335,
"num_tokens": 43741061.0,
"step": 23460
},
{
"entropy": 6.047199630737305,
"epoch": 2.0721476510067114,
"grad_norm": 1.7421875,
"learning_rate": 0.00045696216375613647,
"loss": 5.7465,
"mean_token_accuracy": 0.16836286187171937,
"num_tokens": 43750147.0,
"step": 23465
},
{
"entropy": 6.05180139541626,
"epoch": 2.072589191098552,
"grad_norm": 1.6953125,
"learning_rate": 0.0004569436388963636,
"loss": 5.8069,
"mean_token_accuracy": 0.16635085344314576,
"num_tokens": 43760960.0,
"step": 23470
},
{
"entropy": 6.078740882873535,
"epoch": 2.073030731190392,
"grad_norm": 1.453125,
"learning_rate": 0.0004569251104724184,
"loss": 5.7261,
"mean_token_accuracy": 0.17826577574014663,
"num_tokens": 43771306.0,
"step": 23475
},
{
"entropy": 5.973532104492188,
"epoch": 2.0734722712822324,
"grad_norm": 1.609375,
"learning_rate": 0.0004569065784846636,
"loss": 5.6046,
"mean_token_accuracy": 0.17831213772296906,
"num_tokens": 43780520.0,
"step": 23480
},
{
"entropy": 6.048991680145264,
"epoch": 2.073913811374073,
"grad_norm": 1.5078125,
"learning_rate": 0.0004568880429334624,
"loss": 5.7303,
"mean_token_accuracy": 0.1773224353790283,
"num_tokens": 43789472.0,
"step": 23485
},
{
"entropy": 6.031053066253662,
"epoch": 2.074355351465913,
"grad_norm": 1.796875,
"learning_rate": 0.00045686950381917805,
"loss": 5.7425,
"mean_token_accuracy": 0.16964144706726075,
"num_tokens": 43798728.0,
"step": 23490
},
{
"entropy": 6.002817392349243,
"epoch": 2.0747968915577535,
"grad_norm": 1.578125,
"learning_rate": 0.00045685096114217336,
"loss": 5.6763,
"mean_token_accuracy": 0.1803995341062546,
"num_tokens": 43807959.0,
"step": 23495
},
{
"entropy": 6.057297563552856,
"epoch": 2.075238431649594,
"grad_norm": 2.265625,
"learning_rate": 0.0004568324149028119,
"loss": 5.6768,
"mean_token_accuracy": 0.1808547183871269,
"num_tokens": 43816922.0,
"step": 23500
},
{
"entropy": 5.949941730499267,
"epoch": 2.075679971741434,
"grad_norm": 1.9609375,
"learning_rate": 0.0004568138651014567,
"loss": 5.6718,
"mean_token_accuracy": 0.18064206689596177,
"num_tokens": 43827195.0,
"step": 23505
},
{
"entropy": 5.96398811340332,
"epoch": 2.0761215118332745,
"grad_norm": 1.265625,
"learning_rate": 0.0004567953117384714,
"loss": 5.6451,
"mean_token_accuracy": 0.17927154898643494,
"num_tokens": 43836289.0,
"step": 23510
},
{
"entropy": 6.0673116683959964,
"epoch": 2.0765630519251146,
"grad_norm": 1.6796875,
"learning_rate": 0.0004567767548142193,
"loss": 5.7236,
"mean_token_accuracy": 0.179074065387249,
"num_tokens": 43845918.0,
"step": 23515
},
{
"entropy": 6.0493710994720455,
"epoch": 2.077004592016955,
"grad_norm": 1.328125,
"learning_rate": 0.00045675819432906394,
"loss": 5.7566,
"mean_token_accuracy": 0.17527430206537248,
"num_tokens": 43853907.0,
"step": 23520
},
{
"entropy": 6.051184892654419,
"epoch": 2.0774461321087956,
"grad_norm": 2.015625,
"learning_rate": 0.00045673963028336896,
"loss": 5.6927,
"mean_token_accuracy": 0.18060398399829863,
"num_tokens": 43862992.0,
"step": 23525
},
{
"entropy": 6.080468940734863,
"epoch": 2.0778876722006356,
"grad_norm": 1.4453125,
"learning_rate": 0.00045672106267749795,
"loss": 5.709,
"mean_token_accuracy": 0.17169798612594606,
"num_tokens": 43871686.0,
"step": 23530
},
{
"entropy": 5.938653802871704,
"epoch": 2.078329212292476,
"grad_norm": 1.9296875,
"learning_rate": 0.0004567024915118148,
"loss": 5.7012,
"mean_token_accuracy": 0.1791726365685463,
"num_tokens": 43881302.0,
"step": 23535
},
{
"entropy": 6.0679505348205565,
"epoch": 2.0787707523843166,
"grad_norm": 1.3828125,
"learning_rate": 0.00045668391678668296,
"loss": 5.7629,
"mean_token_accuracy": 0.16436839550733567,
"num_tokens": 43889982.0,
"step": 23540
},
{
"entropy": 6.085354137420654,
"epoch": 2.0792122924761567,
"grad_norm": 1.5546875,
"learning_rate": 0.00045666533850246665,
"loss": 5.7442,
"mean_token_accuracy": 0.1773707628250122,
"num_tokens": 43898385.0,
"step": 23545
},
{
"entropy": 6.046249485015869,
"epoch": 2.079653832567997,
"grad_norm": 1.6640625,
"learning_rate": 0.0004566467566595297,
"loss": 5.6884,
"mean_token_accuracy": 0.16900994777679443,
"num_tokens": 43907882.0,
"step": 23550
},
{
"entropy": 6.091019344329834,
"epoch": 2.0800953726598377,
"grad_norm": 1.5390625,
"learning_rate": 0.00045662817125823605,
"loss": 5.7053,
"mean_token_accuracy": 0.18286565095186233,
"num_tokens": 43916222.0,
"step": 23555
},
{
"entropy": 5.975785207748413,
"epoch": 2.0805369127516777,
"grad_norm": 1.5859375,
"learning_rate": 0.00045660958229894985,
"loss": 5.622,
"mean_token_accuracy": 0.18040552139282226,
"num_tokens": 43925181.0,
"step": 23560
},
{
"entropy": 5.9371411323547365,
"epoch": 2.0809784528435182,
"grad_norm": 1.4609375,
"learning_rate": 0.00045659098978203524,
"loss": 5.6912,
"mean_token_accuracy": 0.1762475237250328,
"num_tokens": 43933973.0,
"step": 23565
},
{
"entropy": 5.941781044006348,
"epoch": 2.0814199929353587,
"grad_norm": 1.4296875,
"learning_rate": 0.0004565723937078563,
"loss": 5.6435,
"mean_token_accuracy": 0.18247038424015044,
"num_tokens": 43943297.0,
"step": 23570
},
{
"entropy": 6.030137205123902,
"epoch": 2.081861533027199,
"grad_norm": 1.5703125,
"learning_rate": 0.00045655379407677754,
"loss": 5.7337,
"mean_token_accuracy": 0.18085955530405046,
"num_tokens": 43952679.0,
"step": 23575
},
{
"entropy": 6.06365647315979,
"epoch": 2.0823030731190393,
"grad_norm": 1.578125,
"learning_rate": 0.0004565351908891632,
"loss": 5.6878,
"mean_token_accuracy": 0.17352163940668106,
"num_tokens": 43961629.0,
"step": 23580
},
{
"entropy": 6.014564657211304,
"epoch": 2.0827446132108793,
"grad_norm": 1.4140625,
"learning_rate": 0.00045651658414537765,
"loss": 5.7086,
"mean_token_accuracy": 0.17615048885345458,
"num_tokens": 43970880.0,
"step": 23585
},
{
"entropy": 6.037336444854736,
"epoch": 2.08318615330272,
"grad_norm": 1.5625,
"learning_rate": 0.0004564979738457855,
"loss": 5.6513,
"mean_token_accuracy": 0.18437934070825576,
"num_tokens": 43980449.0,
"step": 23590
},
{
"entropy": 6.055342674255371,
"epoch": 2.0836276933945603,
"grad_norm": 1.4140625,
"learning_rate": 0.00045647935999075127,
"loss": 5.6512,
"mean_token_accuracy": 0.1780635192990303,
"num_tokens": 43988716.0,
"step": 23595
},
{
"entropy": 6.037462425231934,
"epoch": 2.0840692334864004,
"grad_norm": 1.53125,
"learning_rate": 0.00045646074258063956,
"loss": 5.7388,
"mean_token_accuracy": 0.17799227088689804,
"num_tokens": 43998464.0,
"step": 23600
},
{
"entropy": 6.008177089691162,
"epoch": 2.084510773578241,
"grad_norm": 1.2421875,
"learning_rate": 0.0004564421216158152,
"loss": 5.6769,
"mean_token_accuracy": 0.17874691933393477,
"num_tokens": 44006993.0,
"step": 23605
},
{
"entropy": 6.048329305648804,
"epoch": 2.0849523136700814,
"grad_norm": 1.40625,
"learning_rate": 0.0004564234970966428,
"loss": 5.7472,
"mean_token_accuracy": 0.1738602414727211,
"num_tokens": 44015801.0,
"step": 23610
},
{
"entropy": 5.951680517196655,
"epoch": 2.0853938537619214,
"grad_norm": 1.3359375,
"learning_rate": 0.0004564048690234872,
"loss": 5.6705,
"mean_token_accuracy": 0.17798977643251418,
"num_tokens": 44025069.0,
"step": 23615
},
{
"entropy": 6.0874518871307375,
"epoch": 2.085835393853762,
"grad_norm": 1.859375,
"learning_rate": 0.00045638623739671343,
"loss": 5.8211,
"mean_token_accuracy": 0.1651106908917427,
"num_tokens": 44034700.0,
"step": 23620
},
{
"entropy": 6.045822191238403,
"epoch": 2.0862769339456024,
"grad_norm": 1.4140625,
"learning_rate": 0.00045636760221668646,
"loss": 5.6432,
"mean_token_accuracy": 0.17648534923791886,
"num_tokens": 44044417.0,
"step": 23625
},
{
"entropy": 6.050829172134399,
"epoch": 2.0867184740374425,
"grad_norm": 1.8046875,
"learning_rate": 0.0004563489634837713,
"loss": 5.6928,
"mean_token_accuracy": 0.18225812166929245,
"num_tokens": 44053617.0,
"step": 23630
},
{
"entropy": 6.046759986877442,
"epoch": 2.087160014129283,
"grad_norm": 2.078125,
"learning_rate": 0.00045633032119833314,
"loss": 5.6649,
"mean_token_accuracy": 0.17431908398866652,
"num_tokens": 44062738.0,
"step": 23635
},
{
"entropy": 6.040811920166016,
"epoch": 2.0876015542211235,
"grad_norm": 1.75,
"learning_rate": 0.000456311675360737,
"loss": 5.7394,
"mean_token_accuracy": 0.16950994729995728,
"num_tokens": 44072154.0,
"step": 23640
},
{
"entropy": 6.127094411849976,
"epoch": 2.0880430943129635,
"grad_norm": 1.3671875,
"learning_rate": 0.0004562930259713483,
"loss": 5.7808,
"mean_token_accuracy": 0.17507170885801315,
"num_tokens": 44081239.0,
"step": 23645
},
{
"entropy": 6.01930685043335,
"epoch": 2.088484634404804,
"grad_norm": 1.59375,
"learning_rate": 0.00045627437303053236,
"loss": 5.6713,
"mean_token_accuracy": 0.17575238794088363,
"num_tokens": 44090866.0,
"step": 23650
},
{
"entropy": 5.992135667800904,
"epoch": 2.088926174496644,
"grad_norm": 1.7734375,
"learning_rate": 0.0004562557165386546,
"loss": 5.7798,
"mean_token_accuracy": 0.17066235095262527,
"num_tokens": 44100225.0,
"step": 23655
},
{
"entropy": 6.083344602584839,
"epoch": 2.0893677145884846,
"grad_norm": 1.3984375,
"learning_rate": 0.0004562370564960804,
"loss": 5.6927,
"mean_token_accuracy": 0.17830038964748382,
"num_tokens": 44110139.0,
"step": 23660
},
{
"entropy": 6.0525195598602295,
"epoch": 2.089809254680325,
"grad_norm": 1.59375,
"learning_rate": 0.00045621839290317526,
"loss": 5.695,
"mean_token_accuracy": 0.17873380780220033,
"num_tokens": 44118687.0,
"step": 23665
},
{
"entropy": 6.012042903900147,
"epoch": 2.090250794772165,
"grad_norm": 1.421875,
"learning_rate": 0.00045619972576030495,
"loss": 5.7011,
"mean_token_accuracy": 0.1755807638168335,
"num_tokens": 44127377.0,
"step": 23670
},
{
"entropy": 5.998276805877685,
"epoch": 2.0906923348640056,
"grad_norm": 1.6328125,
"learning_rate": 0.000456181055067835,
"loss": 5.7252,
"mean_token_accuracy": 0.17986046075820922,
"num_tokens": 44136583.0,
"step": 23675
},
{
"entropy": 6.031317138671875,
"epoch": 2.091133874955846,
"grad_norm": 1.4453125,
"learning_rate": 0.0004561623808261313,
"loss": 5.7046,
"mean_token_accuracy": 0.174816857278347,
"num_tokens": 44145467.0,
"step": 23680
},
{
"entropy": 6.011755275726318,
"epoch": 2.091575415047686,
"grad_norm": 1.6796875,
"learning_rate": 0.0004561437030355595,
"loss": 5.6696,
"mean_token_accuracy": 0.18237929046154022,
"num_tokens": 44154932.0,
"step": 23685
},
{
"entropy": 5.948326349258423,
"epoch": 2.0920169551395267,
"grad_norm": 1.9296875,
"learning_rate": 0.0004561250216964857,
"loss": 5.6108,
"mean_token_accuracy": 0.18178659677505493,
"num_tokens": 44162791.0,
"step": 23690
},
{
"entropy": 6.0357414245605465,
"epoch": 2.092458495231367,
"grad_norm": 2.0,
"learning_rate": 0.0004561063368092757,
"loss": 5.7463,
"mean_token_accuracy": 0.17517218440771104,
"num_tokens": 44171993.0,
"step": 23695
},
{
"entropy": 6.073192977905274,
"epoch": 2.0929000353232072,
"grad_norm": 1.375,
"learning_rate": 0.00045608764837429543,
"loss": 5.7323,
"mean_token_accuracy": 0.17741714417934418,
"num_tokens": 44180807.0,
"step": 23700
},
{
"entropy": 6.111350965499878,
"epoch": 2.0933415754150477,
"grad_norm": 1.3984375,
"learning_rate": 0.00045606895639191126,
"loss": 5.7801,
"mean_token_accuracy": 0.1771610125899315,
"num_tokens": 44191764.0,
"step": 23705
},
{
"entropy": 6.031987857818604,
"epoch": 2.0937831155068882,
"grad_norm": 1.4765625,
"learning_rate": 0.00045605026086248916,
"loss": 5.7473,
"mean_token_accuracy": 0.17310077250003814,
"num_tokens": 44201165.0,
"step": 23710
},
{
"entropy": 6.079522895812988,
"epoch": 2.0942246555987283,
"grad_norm": 2.03125,
"learning_rate": 0.0004560315617863954,
"loss": 5.7688,
"mean_token_accuracy": 0.17144815772771835,
"num_tokens": 44210709.0,
"step": 23715
},
{
"entropy": 6.047672986984253,
"epoch": 2.0946661956905688,
"grad_norm": 1.578125,
"learning_rate": 0.0004560128591639964,
"loss": 5.7274,
"mean_token_accuracy": 0.17579573392868042,
"num_tokens": 44219827.0,
"step": 23720
},
{
"entropy": 6.083053541183472,
"epoch": 2.095107735782409,
"grad_norm": 2.109375,
"learning_rate": 0.0004559941529956584,
"loss": 5.7522,
"mean_token_accuracy": 0.1724516212940216,
"num_tokens": 44229498.0,
"step": 23725
},
{
"entropy": 6.017746162414551,
"epoch": 2.0955492758742493,
"grad_norm": 1.8828125,
"learning_rate": 0.0004559754432817479,
"loss": 5.6818,
"mean_token_accuracy": 0.18064150512218474,
"num_tokens": 44238844.0,
"step": 23730
},
{
"entropy": 6.0288722038269045,
"epoch": 2.09599081596609,
"grad_norm": 1.7421875,
"learning_rate": 0.00045595673002263125,
"loss": 5.679,
"mean_token_accuracy": 0.1822420820593834,
"num_tokens": 44247512.0,
"step": 23735
},
{
"entropy": 5.995956087112427,
"epoch": 2.09643235605793,
"grad_norm": 2.109375,
"learning_rate": 0.0004559380132186753,
"loss": 5.6332,
"mean_token_accuracy": 0.18707655221223832,
"num_tokens": 44256485.0,
"step": 23740
},
{
"entropy": 5.860043573379516,
"epoch": 2.0968738961497704,
"grad_norm": 1.5078125,
"learning_rate": 0.00045591929287024655,
"loss": 5.553,
"mean_token_accuracy": 0.1857229769229889,
"num_tokens": 44265095.0,
"step": 23745
},
{
"entropy": 6.024283218383789,
"epoch": 2.097315436241611,
"grad_norm": 1.75,
"learning_rate": 0.0004559005689777117,
"loss": 5.7271,
"mean_token_accuracy": 0.1751623973250389,
"num_tokens": 44274582.0,
"step": 23750
},
{
"entropy": 6.101634931564331,
"epoch": 2.097756976333451,
"grad_norm": 2.3125,
"learning_rate": 0.0004558818415414377,
"loss": 5.7687,
"mean_token_accuracy": 0.17644791156053544,
"num_tokens": 44285752.0,
"step": 23755
},
{
"entropy": 6.093977403640747,
"epoch": 2.0981985164252914,
"grad_norm": 1.8984375,
"learning_rate": 0.0004558631105617912,
"loss": 5.724,
"mean_token_accuracy": 0.17764008045196533,
"num_tokens": 44295315.0,
"step": 23760
},
{
"entropy": 6.019018316268921,
"epoch": 2.098640056517132,
"grad_norm": 1.640625,
"learning_rate": 0.00045584437603913923,
"loss": 5.7918,
"mean_token_accuracy": 0.16906996667385102,
"num_tokens": 44305151.0,
"step": 23765
},
{
"entropy": 6.013357019424438,
"epoch": 2.099081596608972,
"grad_norm": 1.4140625,
"learning_rate": 0.00045582563797384886,
"loss": 5.7511,
"mean_token_accuracy": 0.17240605801343917,
"num_tokens": 44314462.0,
"step": 23770
},
{
"entropy": 5.988945007324219,
"epoch": 2.0995231367008125,
"grad_norm": 1.71875,
"learning_rate": 0.000455806896366287,
"loss": 5.5672,
"mean_token_accuracy": 0.19624441713094712,
"num_tokens": 44322782.0,
"step": 23775
},
{
"entropy": 6.019668054580689,
"epoch": 2.099964676792653,
"grad_norm": 1.7421875,
"learning_rate": 0.0004557881512168209,
"loss": 5.6315,
"mean_token_accuracy": 0.18581141233444215,
"num_tokens": 44331588.0,
"step": 23780
},
{
"entropy": 6.008620643615723,
"epoch": 2.100406216884493,
"grad_norm": 1.4375,
"learning_rate": 0.0004557694025258177,
"loss": 5.6858,
"mean_token_accuracy": 0.1856122449040413,
"num_tokens": 44340997.0,
"step": 23785
},
{
"entropy": 5.994123315811157,
"epoch": 2.1008477569763335,
"grad_norm": 2.09375,
"learning_rate": 0.0004557506502936448,
"loss": 5.7189,
"mean_token_accuracy": 0.17358236461877824,
"num_tokens": 44350679.0,
"step": 23790
},
{
"entropy": 6.00539722442627,
"epoch": 2.1012892970681736,
"grad_norm": 1.3359375,
"learning_rate": 0.00045573189452066936,
"loss": 5.6304,
"mean_token_accuracy": 0.18289833068847655,
"num_tokens": 44359934.0,
"step": 23795
},
{
"entropy": 6.015073537826538,
"epoch": 2.101730837160014,
"grad_norm": 1.7578125,
"learning_rate": 0.00045571313520725897,
"loss": 5.6976,
"mean_token_accuracy": 0.17303459644317626,
"num_tokens": 44369104.0,
"step": 23800
},
{
"entropy": 5.967196798324585,
"epoch": 2.1021723772518546,
"grad_norm": 1.5703125,
"learning_rate": 0.00045569437235378103,
"loss": 5.669,
"mean_token_accuracy": 0.1788162961602211,
"num_tokens": 44379645.0,
"step": 23805
},
{
"entropy": 6.048094844818115,
"epoch": 2.1026139173436946,
"grad_norm": 1.4453125,
"learning_rate": 0.0004556756059606031,
"loss": 5.7118,
"mean_token_accuracy": 0.17971841394901275,
"num_tokens": 44389276.0,
"step": 23810
},
{
"entropy": 6.025794792175293,
"epoch": 2.103055457435535,
"grad_norm": 1.8203125,
"learning_rate": 0.0004556568360280928,
"loss": 5.6756,
"mean_token_accuracy": 0.17618853449821473,
"num_tokens": 44399114.0,
"step": 23815
},
{
"entropy": 5.854189252853393,
"epoch": 2.1034969975273756,
"grad_norm": 1.4296875,
"learning_rate": 0.00045563806255661784,
"loss": 5.4321,
"mean_token_accuracy": 0.2067415326833725,
"num_tokens": 44406917.0,
"step": 23820
},
{
"entropy": 6.020160484313965,
"epoch": 2.1039385376192157,
"grad_norm": 2.96875,
"learning_rate": 0.0004556192855465459,
"loss": 5.7135,
"mean_token_accuracy": 0.16529231816530227,
"num_tokens": 44416678.0,
"step": 23825
},
{
"entropy": 5.899413013458252,
"epoch": 2.104380077711056,
"grad_norm": 1.3828125,
"learning_rate": 0.0004556005049982449,
"loss": 5.5996,
"mean_token_accuracy": 0.1825975865125656,
"num_tokens": 44425427.0,
"step": 23830
},
{
"entropy": 6.087543773651123,
"epoch": 2.1048216178028967,
"grad_norm": 1.6171875,
"learning_rate": 0.00045558172091208284,
"loss": 5.6825,
"mean_token_accuracy": 0.17484444975852967,
"num_tokens": 44434267.0,
"step": 23835
},
{
"entropy": 6.050543737411499,
"epoch": 2.1052631578947367,
"grad_norm": 1.6171875,
"learning_rate": 0.00045556293328842746,
"loss": 5.6955,
"mean_token_accuracy": 0.18118411302566528,
"num_tokens": 44444037.0,
"step": 23840
},
{
"entropy": 5.9810834407806395,
"epoch": 2.1057046979865772,
"grad_norm": 1.9453125,
"learning_rate": 0.0004555441421276469,
"loss": 5.6336,
"mean_token_accuracy": 0.18358309864997863,
"num_tokens": 44453707.0,
"step": 23845
},
{
"entropy": 6.011198854446411,
"epoch": 2.1061462380784177,
"grad_norm": 2.078125,
"learning_rate": 0.00045552534743010934,
"loss": 5.6766,
"mean_token_accuracy": 0.17517673820257187,
"num_tokens": 44464357.0,
"step": 23850
},
{
"entropy": 6.067037200927734,
"epoch": 2.1065877781702578,
"grad_norm": 1.6640625,
"learning_rate": 0.00045550654919618283,
"loss": 5.777,
"mean_token_accuracy": 0.1716026246547699,
"num_tokens": 44473803.0,
"step": 23855
},
{
"entropy": 6.059677314758301,
"epoch": 2.1070293182620983,
"grad_norm": 1.4765625,
"learning_rate": 0.0004554877474262357,
"loss": 5.7132,
"mean_token_accuracy": 0.17787941545248032,
"num_tokens": 44482830.0,
"step": 23860
},
{
"entropy": 6.013998746871948,
"epoch": 2.1074708583539383,
"grad_norm": 1.7109375,
"learning_rate": 0.0004554689421206362,
"loss": 5.6865,
"mean_token_accuracy": 0.1807044893503189,
"num_tokens": 44493045.0,
"step": 23865
},
{
"entropy": 5.990636777877808,
"epoch": 2.107912398445779,
"grad_norm": 1.4609375,
"learning_rate": 0.0004554501332797529,
"loss": 5.6494,
"mean_token_accuracy": 0.18181126713752746,
"num_tokens": 44503304.0,
"step": 23870
},
{
"entropy": 6.044222974777222,
"epoch": 2.1083539385376193,
"grad_norm": 1.765625,
"learning_rate": 0.00045543132090395403,
"loss": 5.7477,
"mean_token_accuracy": 0.17363889664411544,
"num_tokens": 44512337.0,
"step": 23875
},
{
"entropy": 6.059621095657349,
"epoch": 2.1087954786294594,
"grad_norm": 1.5859375,
"learning_rate": 0.0004554125049936082,
"loss": 5.6862,
"mean_token_accuracy": 0.1846675917506218,
"num_tokens": 44521881.0,
"step": 23880
},
{
"entropy": 5.99329891204834,
"epoch": 2.1092370187213,
"grad_norm": 1.6484375,
"learning_rate": 0.000455393685549084,
"loss": 5.7076,
"mean_token_accuracy": 0.17575476318597794,
"num_tokens": 44531351.0,
"step": 23885
},
{
"entropy": 6.040595865249633,
"epoch": 2.1096785588131404,
"grad_norm": 2.09375,
"learning_rate": 0.0004553748625707501,
"loss": 5.7322,
"mean_token_accuracy": 0.17676051706075668,
"num_tokens": 44540592.0,
"step": 23890
},
{
"entropy": 5.9912474155426025,
"epoch": 2.1101200989049804,
"grad_norm": 2.375,
"learning_rate": 0.00045535603605897516,
"loss": 5.6599,
"mean_token_accuracy": 0.1868787795305252,
"num_tokens": 44550019.0,
"step": 23895
},
{
"entropy": 6.019462919235229,
"epoch": 2.110561638996821,
"grad_norm": 1.453125,
"learning_rate": 0.0004553372060141282,
"loss": 5.6767,
"mean_token_accuracy": 0.1779879778623581,
"num_tokens": 44559423.0,
"step": 23900
},
{
"entropy": 5.929722547531128,
"epoch": 2.1110031790886614,
"grad_norm": 1.625,
"learning_rate": 0.0004553183724365778,
"loss": 5.6543,
"mean_token_accuracy": 0.18400646597146988,
"num_tokens": 44568792.0,
"step": 23905
},
{
"entropy": 6.02311520576477,
"epoch": 2.1114447191805015,
"grad_norm": 2.140625,
"learning_rate": 0.0004552995353266931,
"loss": 5.6906,
"mean_token_accuracy": 0.1787199631333351,
"num_tokens": 44578191.0,
"step": 23910
},
{
"entropy": 6.029206037521362,
"epoch": 2.111886259272342,
"grad_norm": 2.078125,
"learning_rate": 0.0004552806946848431,
"loss": 5.6442,
"mean_token_accuracy": 0.1871098205447197,
"num_tokens": 44587402.0,
"step": 23915
},
{
"entropy": 6.077826929092407,
"epoch": 2.1123277993641825,
"grad_norm": 1.8515625,
"learning_rate": 0.00045526185051139676,
"loss": 5.7929,
"mean_token_accuracy": 0.16477192789316178,
"num_tokens": 44596241.0,
"step": 23920
},
{
"entropy": 5.984961080551147,
"epoch": 2.1127693394560225,
"grad_norm": 1.4375,
"learning_rate": 0.00045524300280672326,
"loss": 5.5936,
"mean_token_accuracy": 0.18328686356544494,
"num_tokens": 44604796.0,
"step": 23925
},
{
"entropy": 6.032520294189453,
"epoch": 2.113210879547863,
"grad_norm": 1.546875,
"learning_rate": 0.00045522415157119185,
"loss": 5.7599,
"mean_token_accuracy": 0.17023398280143737,
"num_tokens": 44615208.0,
"step": 23930
},
{
"entropy": 5.980794382095337,
"epoch": 2.113652419639703,
"grad_norm": 1.484375,
"learning_rate": 0.0004552052968051719,
"loss": 5.6888,
"mean_token_accuracy": 0.18169422596693038,
"num_tokens": 44623937.0,
"step": 23935
},
{
"entropy": 5.975437116622925,
"epoch": 2.1140939597315436,
"grad_norm": 1.609375,
"learning_rate": 0.0004551864385090326,
"loss": 5.6649,
"mean_token_accuracy": 0.1784968838095665,
"num_tokens": 44634116.0,
"step": 23940
},
{
"entropy": 6.105168724060059,
"epoch": 2.114535499823384,
"grad_norm": 1.734375,
"learning_rate": 0.0004551675766831434,
"loss": 5.7325,
"mean_token_accuracy": 0.1782498151063919,
"num_tokens": 44643436.0,
"step": 23945
},
{
"entropy": 6.089408683776855,
"epoch": 2.114977039915224,
"grad_norm": 2.515625,
"learning_rate": 0.00045514871132787394,
"loss": 5.7299,
"mean_token_accuracy": 0.17982221841812135,
"num_tokens": 44654077.0,
"step": 23950
},
{
"entropy": 6.0428567886352536,
"epoch": 2.1154185800070646,
"grad_norm": 1.625,
"learning_rate": 0.00045512984244359364,
"loss": 5.7048,
"mean_token_accuracy": 0.1778571844100952,
"num_tokens": 44663785.0,
"step": 23955
},
{
"entropy": 5.9350914478302,
"epoch": 2.115860120098905,
"grad_norm": 1.7890625,
"learning_rate": 0.00045511097003067216,
"loss": 5.5524,
"mean_token_accuracy": 0.19198434948921203,
"num_tokens": 44672750.0,
"step": 23960
},
{
"entropy": 5.981409788131714,
"epoch": 2.116301660190745,
"grad_norm": 1.890625,
"learning_rate": 0.00045509209408947914,
"loss": 5.644,
"mean_token_accuracy": 0.18511082082986832,
"num_tokens": 44681814.0,
"step": 23965
},
{
"entropy": 5.933332300186157,
"epoch": 2.1167432002825857,
"grad_norm": 1.75,
"learning_rate": 0.0004550732146203845,
"loss": 5.6744,
"mean_token_accuracy": 0.17912719696760177,
"num_tokens": 44690926.0,
"step": 23970
},
{
"entropy": 6.083492040634155,
"epoch": 2.117184740374426,
"grad_norm": 2.109375,
"learning_rate": 0.00045505433162375806,
"loss": 5.8039,
"mean_token_accuracy": 0.17236239463090897,
"num_tokens": 44700625.0,
"step": 23975
},
{
"entropy": 6.071900701522827,
"epoch": 2.117626280466266,
"grad_norm": 1.640625,
"learning_rate": 0.0004550354450999696,
"loss": 5.7204,
"mean_token_accuracy": 0.17936803102493287,
"num_tokens": 44710703.0,
"step": 23980
},
{
"entropy": 5.99297947883606,
"epoch": 2.1180678205581067,
"grad_norm": 1.5390625,
"learning_rate": 0.0004550165550493891,
"loss": 5.6499,
"mean_token_accuracy": 0.1825675591826439,
"num_tokens": 44719412.0,
"step": 23985
},
{
"entropy": 6.075795078277588,
"epoch": 2.118509360649947,
"grad_norm": 1.6484375,
"learning_rate": 0.00045499766147238675,
"loss": 5.7629,
"mean_token_accuracy": 0.1807320535182953,
"num_tokens": 44729161.0,
"step": 23990
},
{
"entropy": 6.1229630470275875,
"epoch": 2.1189509007417873,
"grad_norm": 1.3671875,
"learning_rate": 0.00045497876436933257,
"loss": 5.7725,
"mean_token_accuracy": 0.16962055414915084,
"num_tokens": 44738985.0,
"step": 23995
},
{
"entropy": 6.0038371086120605,
"epoch": 2.1193924408336278,
"grad_norm": 1.421875,
"learning_rate": 0.00045495986374059674,
"loss": 5.6611,
"mean_token_accuracy": 0.18424743711948394,
"num_tokens": 44748070.0,
"step": 24000
},
{
"epoch": 2.1193924408336278,
"eval_entropy": 5.740399907048399,
"eval_loss": 5.765365123748779,
"eval_mean_token_accuracy": 0.18401373771450663,
"eval_num_tokens": 44748070.0,
"eval_runtime": 26.2369,
"eval_samples_per_second": 1346.006,
"eval_steps_per_second": 168.275,
"step": 24000
}
],
"logging_steps": 5,
"max_steps": 113230,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6.6257580192768e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}